AITodaySeu digest de notícias de IA

Audio & Speech

Jul 24, 2026

Audio & Speech

Resumo do dia

A OpenAI expandiu o controle por voz no ChatGPT para o aplicativo desktop, incluindo uma nova função GPT-Live que permite aos engenheiros depurar código com as mãos livres. Simultaneamente, a Anthropic estendeu o modo de voz do Claude aos modelos Opus e Sonnet em todas as plataformas. Além disso, surgiu o Skipper, um assistente de IA offline projetado para ambientes sem conectividade, como barcos e casas remotas.

Principais notícias

  1. 1

    OpenAI adiciona controle por voz ao aplicativo desktop do ChatGPT

    O que aconteceu: A OpenAI atualizou seu aplicativo ChatGPT para desktop na quinta-feira para suportar ChatGPT Voice, permitindo que usuários falem comandos e controlem agentes de IA para executar tarefas no computador. O recurso usa modelos de voz ChatGPT-Live e funciona tanto com ChatGPT Work quanto com Codex, incluindo a capacidade de acessar sites, aplicativos e, no macOS, conteúdos da tela via Appshots. Por que é importante: A versão desktop é mais potente que a versão para smartphone lançada no início deste mês — ela permite que usuários ditem comandos complexos em várias etapas e interajam com o ChatGPT para obter esclarecimentos. Em uma demonstração, a OpenAI mostrou um desenvolvedor pedindo ao ChatGPT para criar uma thread, fazer um pull request e corrigir um erro em um único comando de voz, sugerindo que o controle por voz poderia transformar a forma como desenvolvedores e trabalhadores de escritório interagem com suas máquinas.

    O que acompanhar: O lançamento é global desde quinta-feira. Os usuários também podem acessar ChatGPT Voice no Codex do iOS através de acesso remoto. A Anthropic atualizou de forma semelhante o modo de voz do Claude para funcionar com seus modelos Opus, Sonnet e Haiku em tarefas no Gmail, Calendar, Slack, Notion e Canva.

  2. 2

    Modo de voz do Claude se expande para Opus e Sonnet em todas as plataformas

    O que aconteceu: A Anthropic expandiu o modo de voz do Claude para seus modelos Opus e Sonnet (antes limitado ao Haiku), com a capacidade de alternar entre modelos durante a conversa em celular, desktop e web. O modo suporta onze idiomas e pode se integrar com ferramentas como Gmail, Google Calendar e Slack para compor e enviar emails por voz. Por que é importante: O modo de voz do Claude agora compete mais diretamente com GPT-Live da OpenAI e Gemini Live do Google. Enquanto esses concorrentes usam áudio full-duplex (falar e ouvir simultaneamente) para uma sensação mais natural, o Claude usa um sistema baseado em turnos e se diferencia pela integração com ferramentas — é atualmente o único provedor que permite aos usuários compor e salvar emails diretamente do modo de áudio.

    O que observar: Os usuários agora podem escolher qual modelo do Claude usar durante conversas por voz e alternar idiomas com flexibilidade, dando-lhes controle sobre as compensações entre velocidade e capacidade dependendo de sua tarefa.

  3. 3

    OpenAI traz voz GPT-Live para codificação no desktop—engenheiros podem agora depurar com as mãos livres

    O que aconteceu: A OpenAI anunciou que a GPT-Live, seu modelo de voz full-duplex (que ouve e fala simultaneamente), agora alimenta a aplicação ChatGPT para desktop em macOS e Windows, integrada diretamente com sistemas de codificação agêntica como Codex e ChatGPT Work. Por que é importante: Engenheiros de software podem agora orquestrar tarefas de codificação multi-thread, revisar pull requests e depurar aplicações usando comandos de voz natural em vez de digitação—potencialmente permitindo fluxos de trabalho de desenvolvimento de software com as mãos livres.

    O que acompanhar: A GPT-Live foi lançada inicialmente em 8 de julho de 2026; a integração no desktop chega duas semanas após esse lançamento e representa a primeira integração de voz full-duplex em ferramentas voltadas para desenvolvedores.

  4. 4

    OpenAI lança ChatGPT Voice para computadores e automatização de tarefas sem uso das mãos

    O que aconteceu: A OpenAI lançou o ChatGPT Voice em computadores e laptops, estendendo a tecnologia GPT Live de voz que havia lançado em dispositivos móveis no início deste mês. O recurso permite que usuários falem com o ChatGPT de forma livre para completar múltiplas tarefas em segundo plano enquanto trabalham em outras coisas — como verificar um calendário, revisar e-mails ou redigir documentos — sem usar as mãos. Por que é importante: O lançamento na versão desktop visa programadores de software e usuários de alto volume de tokens de IA, um segmento lucrativo do mercado de IA. O recurso se integra diretamente com o Codex, produto de programação da OpenAI (que se fundiu no ChatGPT Work em 9 de julho), e usuários podem configurar uma tecla de atalho para ativar comandos de voz enquanto codificam em outras aplicações, eliminando atritos na forma como desenvolvedores interagem com IA.

    Pontos de atenção: A OpenAI está posicionando a voz como uma vantagem competitiva no mercado de IA saturado. A empresa também sinalizou que o GPT Live pode alimentar seu dispositivo de hardware em breve — um alto-falante para casa e parceiro de conversa, de acordo com a Bloomberg. O Codex atingiu dez milhões de usuários após o lançamento do ChatGPT Work em 9 de julho, sugerindo momentum significativo entre desenvolvedores.

  5. 5

    Skipper: assistente de IA offline para barcos, casas remotas e veículos

    O que aconteceu: Skipper é um assistente de IA projetado para funcionar sem internet, oferecendo interação por voz, memória personalizada, visão em alta definição e armazenamento de conhecimento local para uso em ambientes desconectados como barcos, casas remotas, veículos, oficinas, expedições e instalações privadas. Por que importa: Usuários em ambientes com acesso à internet precário ou inexistente agora podem acessar assistência de IA — lembretes por voz, manuais, procedimentos de segurança, informações de equipamentos — sem depender de serviços em nuvem, mantendo toda a inteligência central e informações armazenadas localmente no sistema Skipper em vez de servidores externos.

    O que observar: A capacidade do Skipper de se integrar com sistemas embarcados, residenciais ou móveis e reter contexto e personalidade específicos do usuário; o produto é personalizável para ambientes especializados e retém todos os dados localmente, atraindo usuários de navegação marítima, ambientes remotos e trabalho de campo que não podem contar com conectividade.

  6. 6

    O modo de voz do Claude se expande para os modelos Opus e Sonnet

    O que aconteceu: A Anthropic disponibilizou seus modelos Opus e Sonnet no modo de voz—até agora limitado ao modelo mais leve Haiku. A empresa também está trazendo o modo de voz para aplicativos como Gmail, Slack e Canva, e expandindo o suporte de idiomas para francês, alemão, espanhol, hindi, indonésio, italiano, japonês, coreano e português. Por que é importante: Haiku foi projetado para respostas rápidas e mantinha conversas breves, mas os usuários começaram a aplicar o modo de voz a trabalhos mais profundos—analisando problemas comerciais e gerando respostas complexas. Opus e Sonnet conseguem lidar com essa carga: podem entregar análises detalhadas, transformar conversas em propostas de uma página, ou ajustar seu calendário se seu trem estiver atrasado. Para empresas e desenvolvedores no Japão e em outros mercados, isso abre a interação por voz para tarefas que exigem raciocínio real, não apenas respostas rápidas.

    Fique atento: Os usuários agora podem alternar entre texto e voz no meio da conversa e mudar entre modelos rapidamente—então um bate-papo rápido com Haiku pode escalar perfeitamente para Opus se o problema ficar mais complexo. O suporte de idiomas agora inclui japonês, removendo uma barreira para falantes nativos.

Em breve

Fique atento ao lançamento global de funcionalidades de voz na OpenAI e Anthropic, que transformam ChatGPT e Claude em assistentes conversacionais mais naturais e acessíveis, com a OpenAI sinalizando que pode integrar voz em dispositivos de hardware em breve. Acompanhe também como startups como Skipper e soluções como GPT Live trazem capacidades de voz full-duplex para contextos especializados—desde navegação marítima até ambientes remotos—enquanto usuários ganham controle para alternar entre modelos, idiomas e formatos de comunicação conforme suas necessidades mudem.

Fontes

Share this with a friend

Send today's roundup to anyone who wants to keep up.

Get daily AI news free with AIToday

200+ AI sources, summarized in 1 minute. Email / LINE / Slack.

Sign up free