AITodaySeu digest de notícias de IA

Audio & Speech

Jul 25, 2026

Audio & Speech

Resumo do dia

A OpenAI expandiu as capacidades de voz do ChatGPT para seu aplicativo desktop, incluindo um novo GPT-Live para codificação que permite aos engenheiros depurar sem usar as mãos, além de automação de tarefas por voz. O Claude também ampliou seu modo de voz para os modelos Opus e Sonnet em todas as plataformas, oferecendo mais opções de interação por áudio. Essas atualizações refletem a crescente integração de controle por voz nos assistentes de IA, melhorando a acessibilidade e a produtividade dos usuários.

Principais notícias

  1. 1

    OpenAI adiciona controle de voz ao aplicativo desktop do ChatGPT

    O que aconteceu: A OpenAI atualizou seu aplicativo desktop ChatGPT na quinta-feira para suportar ChatGPT Voice, permitindo que usuários deem comandos de voz e controlem agentes de IA para executar tarefas em seus computadores. O recurso utiliza modelos de voz ChatGPT-Live e funciona tanto com ChatGPT Work quanto com Codex, incluindo a capacidade de acessar sites, aplicativos e, no macOS, conteúdos da tela por meio do Appshots. Por que importa: A versão desktop é mais capaz que a versão para smartphone lançada no início deste mês — permite que usuários ditem comandos complexos de múltiplas etapas e interajam continuamente com o ChatGPT para esclarecimentos. Em uma demonstração, a OpenAI mostrou um desenvolvedor pedindo ao ChatGPT para criar uma thread, fazer um pull request e depurar um problema em um único comando de voz, sugerindo que o controle de voz poderia reformular a forma como desenvolvedores e profissionais de escritório interagem com suas máquinas.

    Pontos de atenção: O lançamento é global a partir de quinta-feira. Os usuários também podem acessar ChatGPT Voice no Codex do iOS através de acesso remoto. A Anthropic atualizou de forma semelhante o modo de voz do Claude para funcionar com seus modelos Opus, Sonnet e Haiku para tarefas no Gmail, Calendar, Slack, Notion e Canva.

  2. 2

    Claude expande modo de voz para Opus e Sonnet em todas as plataformas

    O que aconteceu: A Anthropic expandiu o modo de voz do Claude para seus modelos Opus e Sonnet (anteriormente limitado ao Haiku), com a capacidade de alternar entre modelos durante a conversa em dispositivos móveis, desktop e web. O modo suporta onze idiomas e pode se integrar com ferramentas como Gmail, Google Calendar e Slack para compor e enviar e-mails por voz. Por que importa: O modo de voz do Claude agora compete mais diretamente com o GPT-Live da OpenAI e o Gemini Live do Google. Enquanto esses concorrentes usam áudio full-duplex (fala e escuta simultâneas) para uma experiência mais natural, Claude utiliza um sistema baseado em turnos e se diferencia através da integração com ferramentas—é atualmente o único provedor que permite aos usuários compor e salvar e-mails diretamente no modo de áudio.

    O que acompanhar: Os usuários agora podem escolher qual modelo do Claude usar durante conversas por voz e alternar idiomas com flexibilidade, oferecendo controle sobre compensações entre velocidade e capacidade dependendo de sua tarefa.

  3. 3

    OpenAI traz voz GPT-Live para codificação no desktop—engenheiros agora podem depurar sem usar as mãos

    O que aconteceu: A OpenAI anunciou que o GPT-Live, seu modelo de voz full-duplex (que escuta e fala simultaneamente), agora potencializa a aplicação ChatGPT para desktop em macOS e Windows, integrado diretamente em sistemas de codificação agentivos como Codex e ChatGPT Work. Por que é importante: Engenheiros de software agora podem orquestrar tarefas de codificação multithreaded, revisar pull requests e depurar aplicações usando comandos de voz naturais em vez de digitar—potencialmente viabilizando fluxos de trabalho de desenvolvimento de software sem usar as mãos.

    O que acompanhar: O GPT-Live foi lançado inicialmente em 8 de julho de 2026; a integração no desktop chega duas semanas após esse lançamento e representa a primeira integração de voz full-duplex em ferramentas voltadas para desenvolvedores.

  4. 4

    OpenAI lança ChatGPT Voice para desktop com automação de tarefas sem uso de mãos

    O que aconteceu: A OpenAI disponibilizou o ChatGPT Voice em computadores de mesa e laptops, ampliando a tecnologia GPT Live que havia lançado em dispositivos móveis no início deste mês. O recurso permite que os usuários falem com o ChatGPT de forma contínua para completar múltiplas tarefas em segundo plano enquanto trabalham em outras atividades—como verificar calendários, revisar emails ou redigir documentos—sem necessidade de usar as mãos. Por que é importante: O lançamento na versão desktop visa programadores de software e usuários de alto volume de tokens de IA, um segmento lucrativo do mercado de IA. O recurso se integra diretamente ao Codex, produto de programação da OpenAI (que foi incorporado ao ChatGPT Work em 9 de julho), e os usuários podem configurar uma tecla de atalho para disparar comandos de voz enquanto programam em outras aplicações, reduzindo o atrito na forma como desenvolvedores interagem com IA.

    Pontos a acompanhar: A OpenAI está posicionando a voz como uma vantagem competitiva no mercado de IA saturado. A empresa também sinalizou que o GPT Live pode alimentar seu próximo dispositivo de hardware—um alto-falante de uso doméstico e parceiro de conversação, segundo a Bloomberg. O Codex atingiu dez milhões de usuários após o lançamento do ChatGPT Work em 9 de julho, sugerindo dinâmica significativa entre desenvolvedores.

  5. 5

    Skipper: assistente de IA offline para barcos, casas remotas e veículos

    O que aconteceu: Skipper é um assistente de IA projetado para funcionar sem internet, oferecendo interação por voz, memória personalizável, visão em alta definição e armazenamento local de conhecimento para uso em ambientes isolados como barcos, casas remotas, veículos, oficinas, expedições e instalações privadas. Por que importa: Usuários em ambientes com conectividade instável ou nenhuma conexão à internet agora podem acessar assistência de IA — lembretes por voz, manuais, procedimentos de segurança, informações de equipamento — sem depender de serviços em nuvem, mantendo toda a inteligência principal e informações armazenadas localmente no sistema Skipper em vez de servidores externos.

    O que observar: A capacidade do Skipper de se integrar com sistemas embarcados, domésticos ou móveis e reter contexto e personalidade específicos do usuário; o produto é personalizável para ambientes especializados e retém todos os dados localmente, atraindo usuários marítimos, remotos e de trabalho em campo que não podem contar com conectividade.

  6. 6

    O modo de voz do Claude se expande para os modelos Opus e Sonnet

    O que aconteceu: A Anthropic disponibilizou seus modelos Opus e Sonnet no modo de voz — até agora limitado ao modelo mais leve Haiku. A empresa também está levando o modo de voz para aplicativos como Gmail, Slack e Canva, além de expandir o suporte de idiomas para francês, alemão, espanhol, hindi, indonésio, italiano, japonês, coreano e português. Por que é importante: O Haiku foi projetado para respostas rápidas e mantinha conversas breves, mas os usuários começaram a aplicar o modo de voz a trabalhos mais profundos — analisando problemas comerciais e gerando respostas complexas. Opus e Sonnet conseguem suportar essa carga: podem fornecer análises detalhadas, transformar conversas em apresentações de uma página ou ajustar seu calendário se seu trem estiver atrasado. Para empresas e desenvolvedores no Japão e em outros mercados, isso abre a interação por voz para tarefas que exigem raciocínio real, não apenas respostas rápidas.

    O que acompanhar: Os usuários agora podem alternar entre texto e voz no meio de uma conversa e trocar de modelos rapidamente — assim uma conversa rápida com Haiku pode escalar perfeitamente para Opus se o problema ficar mais complexo. O suporte a idiomas agora inclui japonês, removendo uma barreira para falantes nativos.

Em breve

À medida que OpenAI e Anthropic ampliam suas capacidades de voz com lançamentos globais e integrações em ferramentas populares, observe como a competição por voz como diferencial competitivo molda o próximo ciclo de inovação em IA—especialmente com a possibilidade de dispositivos de hardware dedicados e a crescente demanda por interações flexíveis entre texto, voz e múltiplos modelos em tempo real. Acompanhe também como soluções especializadas como o Skipper estabelecem novos padrões para conectividade offline e retenção de dados locais, abrindo oportunidades em mercados até agora inacessíveis à IA conversacional.

Fontes

Share this with a friend

Send today's roundup to anyone who wants to keep up.

Get daily AI news free with AIToday

200+ AI sources, summarized in 1 minute. Email / LINE / Slack.

Sign up free