Audio & Speech
Jul 25, 2026

Resumo do dia
A OpenAI expandiu as capacidades de voz do ChatGPT para seu aplicativo desktop, incluindo um novo GPT-Live para codificação que permite aos engenheiros depurar sem usar as mãos, além de automação de tarefas por voz. O Claude também ampliou seu modo de voz para os modelos Opus e Sonnet em todas as plataformas, oferecendo mais opções de interação por áudio. Essas atualizações refletem a crescente integração de controle por voz nos assistentes de IA, melhorando a acessibilidade e a produtividade dos usuários.
Principais notícias
- 1
OpenAI adiciona controle de voz ao aplicativo desktop do ChatGPT
O que aconteceu: A OpenAI atualizou seu aplicativo desktop ChatGPT na quinta-feira para suportar ChatGPT Voice, permitindo que usuários deem comandos de voz e controlem agentes de IA para executar tarefas em seus computadores. O recurso utiliza modelos de voz ChatGPT-Live e funciona tanto com ChatGPT Work quanto com Codex, incluindo a capacidade de acessar sites, aplicativos e, no macOS, conteúdos da tela por meio do Appshots. Por que importa: A versão desktop é mais capaz que a versão para smartphone lançada no início deste mês — permite que usuários ditem comandos complexos de múltiplas etapas e interajam continuamente com o ChatGPT para esclarecimentos. Em uma demonstração, a OpenAI mostrou um desenvolvedor pedindo ao ChatGPT para criar uma thread, fazer um pull request e depurar um problema em um único comando de voz, sugerindo que o controle de voz poderia reformular a forma como desenvolvedores e profissionais de escritório interagem com suas máquinas.
Pontos de atenção: O lançamento é global a partir de quinta-feira. Os usuários também podem acessar ChatGPT Voice no Codex do iOS através de acesso remoto. A Anthropic atualizou de forma semelhante o modo de voz do Claude para funcionar com seus modelos Opus, Sonnet e Haiku para tarefas no Gmail, Calendar, Slack, Notion e Canva.
- 2
Claude expande modo de voz para Opus e Sonnet em todas as plataformas
O que aconteceu: A Anthropic expandiu o modo de voz do Claude para seus modelos Opus e Sonnet (anteriormente limitado ao Haiku), com a capacidade de alternar entre modelos durante a conversa em dispositivos móveis, desktop e web. O modo suporta onze idiomas e pode se integrar com ferramentas como Gmail, Google Calendar e Slack para compor e enviar e-mails por voz. Por que importa: O modo de voz do Claude agora compete mais diretamente com o GPT-Live da OpenAI e o Gemini Live do Google. Enquanto esses concorrentes usam áudio full-duplex (fala e escuta simultâneas) para uma experiência mais natural, Claude utiliza um sistema baseado em turnos e se diferencia através da integração com ferramentas—é atualmente o único provedor que permite aos usuários compor e salvar e-mails diretamente no modo de áudio.
O que acompanhar: Os usuários agora podem escolher qual modelo do Claude usar durante conversas por voz e alternar idiomas com flexibilidade, oferecendo controle sobre compensações entre velocidade e capacidade dependendo de sua tarefa.
- 3
OpenAI traz voz GPT-Live para codificação no desktop—engenheiros agora podem depurar sem usar as mãos
O que aconteceu: A OpenAI anunciou que o GPT-Live, seu modelo de voz full-duplex (que escuta e fala simultaneamente), agora potencializa a aplicação ChatGPT para desktop em macOS e Windows, integrado diretamente em sistemas de codificação agentivos como Codex e ChatGPT Work. Por que é importante: Engenheiros de software agora podem orquestrar tarefas de codificação multithreaded, revisar pull requests e depurar aplicações usando comandos de voz naturais em vez de digitar—potencialmente viabilizando fluxos de trabalho de desenvolvimento de software sem usar as mãos.
O que acompanhar: O GPT-Live foi lançado inicialmente em 8 de julho de 2026; a integração no desktop chega duas semanas após esse lançamento e representa a primeira integração de voz full-duplex em ferramentas voltadas para desenvolvedores.
- 4
OpenAI lança ChatGPT Voice para desktop com automação de tarefas sem uso de mãos
O que aconteceu: A OpenAI disponibilizou o ChatGPT Voice em computadores de mesa e laptops, ampliando a tecnologia GPT Live que havia lançado em dispositivos móveis no início deste mês. O recurso permite que os usuários falem com o ChatGPT de forma contínua para completar múltiplas tarefas em segundo plano enquanto trabalham em outras atividades—como verificar calendários, revisar emails ou redigir documentos—sem necessidade de usar as mãos. Por que é importante: O lançamento na versão desktop visa programadores de software e usuários de alto volume de tokens de IA, um segmento lucrativo do mercado de IA. O recurso se integra diretamente ao Codex, produto de programação da OpenAI (que foi incorporado ao ChatGPT Work em 9 de julho), e os usuários podem configurar uma tecla de atalho para disparar comandos de voz enquanto programam em outras aplicações, reduzindo o atrito na forma como desenvolvedores interagem com IA.
Pontos a acompanhar: A OpenAI está posicionando a voz como uma vantagem competitiva no mercado de IA saturado. A empresa também sinalizou que o GPT Live pode alimentar seu próximo dispositivo de hardware—um alto-falante de uso doméstico e parceiro de conversação, segundo a Bloomberg. O Codex atingiu dez milhões de usuários após o lançamento do ChatGPT Work em 9 de julho, sugerindo dinâmica significativa entre desenvolvedores.
- 5
Skipper: assistente de IA offline para barcos, casas remotas e veículos
O que aconteceu: Skipper é um assistente de IA projetado para funcionar sem internet, oferecendo interação por voz, memória personalizável, visão em alta definição e armazenamento local de conhecimento para uso em ambientes isolados como barcos, casas remotas, veículos, oficinas, expedições e instalações privadas. Por que importa: Usuários em ambientes com conectividade instável ou nenhuma conexão à internet agora podem acessar assistência de IA — lembretes por voz, manuais, procedimentos de segurança, informações de equipamento — sem depender de serviços em nuvem, mantendo toda a inteligência principal e informações armazenadas localmente no sistema Skipper em vez de servidores externos.
O que observar: A capacidade do Skipper de se integrar com sistemas embarcados, domésticos ou móveis e reter contexto e personalidade específicos do usuário; o produto é personalizável para ambientes especializados e retém todos os dados localmente, atraindo usuários marítimos, remotos e de trabalho em campo que não podem contar com conectividade.
- 6
O modo de voz do Claude se expande para os modelos Opus e Sonnet
O que aconteceu: A Anthropic disponibilizou seus modelos Opus e Sonnet no modo de voz — até agora limitado ao modelo mais leve Haiku. A empresa também está levando o modo de voz para aplicativos como Gmail, Slack e Canva, além de expandir o suporte de idiomas para francês, alemão, espanhol, hindi, indonésio, italiano, japonês, coreano e português. Por que é importante: O Haiku foi projetado para respostas rápidas e mantinha conversas breves, mas os usuários começaram a aplicar o modo de voz a trabalhos mais profundos — analisando problemas comerciais e gerando respostas complexas. Opus e Sonnet conseguem suportar essa carga: podem fornecer análises detalhadas, transformar conversas em apresentações de uma página ou ajustar seu calendário se seu trem estiver atrasado. Para empresas e desenvolvedores no Japão e em outros mercados, isso abre a interação por voz para tarefas que exigem raciocínio real, não apenas respostas rápidas.
O que acompanhar: Os usuários agora podem alternar entre texto e voz no meio de uma conversa e trocar de modelos rapidamente — assim uma conversa rápida com Haiku pode escalar perfeitamente para Opus se o problema ficar mais complexo. O suporte a idiomas agora inclui japonês, removendo uma barreira para falantes nativos.
Em breve
À medida que OpenAI e Anthropic ampliam suas capacidades de voz com lançamentos globais e integrações em ferramentas populares, observe como a competição por voz como diferencial competitivo molda o próximo ciclo de inovação em IA—especialmente com a possibilidade de dispositivos de hardware dedicados e a crescente demanda por interações flexíveis entre texto, voz e múltiplos modelos em tempo real. Acompanhe também como soluções especializadas como o Skipper estabelecem novos padrões para conectividade offline e retenção de dados locais, abrindo oportunidades em mercados até agora inacessíveis à IA conversacional.
Fontes
- OpenAI’s new voice mode makes it to the ChatGPT desktop app
- Claude's voice mode now runs on Anthropic's most capable models across all platforms
- Agentic coding goes hands-free as OpenAI brings GPT-Live's full duplex voice control to Codex and ChatGPT on the desktop
- OpenAI debuts ChatGPT Voice so you can have ongoing conversations, ask the AI to complete tasks while hands-free
- Skipper – An offline, voice-enabled AI companion for off-grid environments
- Claude’s voice mode is now available for Opus and Sonnet
- Anthropic updates Claude voice mode with more capable models
- Flux 3 generates videos with native audio up to 20 seconds long, a first for Black Forest Labs
- Black Forest Labs launches FLUX 3 capable of generating images and 20-second video with audio — but in limited release to start
- AI Voice Phishing Performs on Par With Human Scammers at a Fraction of the Cost
Share this with a friend
Send today's roundup to anyone who wants to keep up.
Get daily AI news free with AIToday
200+ AI sources, summarized in 1 minute. Email / LINE / Slack.
Sign up free