AITodaySeu digest de notícias de IA

Audio & Speech

Jul 23, 2026

Audio & Speech

Resumo do dia

OpenAI, Anthropic e Black Forest Labs lançam novos recursos de áudio e voz para seus assistentes de IA, expandindo as capacidades do ChatGPT Voice para desktop com automação de tarefas, do Claude com integração a ferramentas populares como Gmail e Slack, e do FLUX 3 com geração nativa de áudio e vídeo. Além disso, surgem soluções especializadas como o Skipper, um assistente de IA offline projetado para cenários sem conectividade, como barcos e casas remotas. O foco geral é tornar os assistentes de IA mais acessíveis e úteis no dia a dia, com suporte a interação por voz e integração com plataformas que as pessoas já usam.

Principais notícias

  1. 1

    OpenAI lança ChatGPT Voice para desktop com automação de tarefas sem usar as mãos

    O que aconteceu: A OpenAI lançou o ChatGPT Voice em computadores de mesa e laptops, expandindo a tecnologia de voz GPT Live que havia sido lançada em dispositivos móveis no início deste mês. O recurso permite que os usuários falem com o ChatGPT de forma livre e contínua para completar múltiplas tarefas em segundo plano enquanto trabalham em outras coisas—como verificar um calendário, revisar e-mails ou redigir documentos—sem usar as mãos. Por que é importante: O lançamento para desktop tem como alvo programadores de software e usuários com alto volume de tokens de IA, um segmento lucrativo do mercado de IA. O recurso se integra diretamente ao Codex, o produto de programação da OpenAI (que se uniu ao ChatGPT Work em 9 de julho), e os usuários podem configurar uma tecla de atalho para disparar comandos de voz enquanto codificam em outras aplicações, eliminando fricção na forma como desenvolvedores interagem com IA.

    O que observar: A OpenAI está posicionando a voz como uma vantagem competitiva no mercado de IA saturado. A empresa também sinalizou que GPT Live pode alimentar seu próximo dispositivo de hardware—um alto-falante para casa e companheiro de conversa, segundo a Bloomberg. O Codex alcançou dez milhões de usuários após o lançamento do ChatGPT Work em 9 de julho, sugerindo um momentum significativo entre desenvolvedores.

  2. 2

    Skipper: assistente de IA offline para barcos, casas remotas e veículos

    O que aconteceu: Skipper é um assistente de IA projetado para funcionar sem internet, oferecendo interação por voz, memória customizável, visão em alta definição e armazenamento de conhecimento local para uso em ambientes isolados como barcos, casas remotas, veículos, oficinas, expedições e instalações privadas. Por que importa: Usuários em ambientes com acesso à internet precário ou inexistente agora podem contar com assistência de IA — lembretes por voz, manuais, procedimentos de segurança, informações de equipamentos — sem depender de serviços em nuvem, mantendo toda a inteligência central e informações armazenadas localmente no sistema Skipper em vez de servidores externos.

    O que acompanhar: A capacidade do Skipper de se integrar com sistemas embarcados, domésticos ou móveis e reter contexto e personalidade específicos do usuário; o produto é personalizável para ambientes especializados e retém todos os dados localmente, atraindo usuários marítimos, remotos e de trabalho em campo que não podem depender de conectividade.

  3. 3

    O modo de voz do Claude se expande para os modelos Opus e Sonnet

    O que aconteceu: A Anthropic disponibilizou seus modelos Opus e Sonnet em modo de voz—até agora limitado ao modelo mais leve Haiku. A empresa também está trazendo o modo de voz para aplicativos como Gmail, Slack e Canva, e expandindo o suporte de idiomas para francês, alemão, espanhol, hindi, indonésio, italiano, japonês, coreano e português. Por que é importante: O Haiku foi projetado para respostas rápidas e mantinha as conversas breves, mas os usuários começaram a aplicar o modo de voz a trabalhos mais profundos—analisando problemas comerciais e gerando respostas complexas. Opus e Sonnet conseguem suportar essa carga: podem entregar análises detalhadas, transformar conversas em apresentações de uma página ou ajustar seu calendário se seu trem se atrasar. Para empresas e desenvolvedores no Japão e em outros mercados, isso abre a interação por voz para tarefas que exigem raciocínio real, não apenas respostas rápidas.

    Pontos a acompanhar: Os usuários agora podem alternar entre texto e voz no meio da conversa e mudar entre modelos rapidamente—então um bate-papo rápido com Haiku pode escalar perfeitamente para Opus se o problema ficar mais difícil. O suporte de idiomas agora inclui japonês, removendo uma barreira para falantes nativos.

  4. 4

    Claude com modo de voz agora suporta três modelos e se integra com Gmail, Slack e Notion

    O que aconteceu: A Anthropic atualizou o modo de voz do Claude para permitir que usuários escolham entre os modelos Opus, Sonnet e Haiku, com o modo definindo como padrão a versão mais rápida do último modelo que utilizaram em chat de texto. O modo de voz agora pode se conectar ao Gmail, Google Calendar, Slack, Canva e Notion, possibilitando tarefas como atualizar horários de reuniões, redigir e-mails e criar documentos. Por que importa: O modo de voz do Claude estava anteriormente limitado ao modelo Haiku e respostas rápidas, tornando-o inadequado para trabalhos complexos. A expansão para modelos mais poderosos (Opus e Sonnet) e a integração com aplicativos externos permite que usuários lidem com conversas mais longas e substanciais e concluam trabalho real diretamente pela voz — uma capacidade que o modo de voz do OpenAI ainda não oferece.

    Pontos de atenção: A atualização está disponível em beta para todos os usuários em todas as plataformas, mas usuários gratuitos ficam restritos ao modelo Haiku com apenas um aplicativo conectado. A Anthropic não alterou o modelo de voz subjacente nem detalhou sua arquitetura de voz, portanto usuários podem não experimentar melhorias conversacionais como melhor tratamento de interrupções que a atualização recente de voz do OpenAI ofereceu.

  5. 5

    Black Forest Labs lança Flux 3 com geração nativa de áudio e vídeo

    O que aconteceu: A empresa alemã de IA Black Forest Labs lançou o Flux 3, um modelo de fundação multimodal que aprende a partir de imagens, vídeos e áudio em conjunto. O modelo consegue gerar vídeos com áudio nativo de até vinte segundos pela primeira vez, suportando conversão de texto para vídeo, imagem para vídeo, vídeo para vídeo, transições baseadas em keyframes, diálogo multilíngue e conexões entre clipes orientadas por agentes. Por que importa: Em avaliações iniciais utilizando clipes de dez segundos em 720p, o Flux 3 foi preferido em relação a múltiplos concorrentes: noventa e três por cento sobre Luma Ray 3.2, setenta e sete por cento sobre Runway Gen-4.5, e sessenta e nove por cento sobre Grok Imagine Video. Quando comparado a concorrentes mais fortes, igualou ou se aproximou de Seedance 2.0 e Gemini Omni Flash (ambos com cinquenta e dois por cento de preferência), que já atendem grandes fluxos de produção. A BFL também desenvolveu Flux-mimic, um modelo de ação em vídeo sendo testado em tarefas de produção na Audi, sugerindo que a arquitetura se estende para aplicações em robótica.

    O que observar: Flux 3 Image está previsto para lançamento em acesso antecipado nas próximas semanas, com melhorias para prompts complexos e renderização de texto multilíngue. A predição de ações será inicialmente oferecida através de parceiros selecionados. A BFL planeja acesso com pesos abertos ao backbone multimodal sob o nome 'Flux 3 Dev', com trabalho a longo prazo em um modelo único que combine predição de percepção, ação e linguagem.

  6. 6

    Black Forest Labs lança FLUX 3 para geração de imagens, vídeos e áudio

    O que aconteceu: A Black Forest Labs lançou o FLUX 3, um modelo de IA multimodal que gera imagens e clipes combinados de áudio/vídeo de até vinte segundos a partir de um único prompt. O modelo é treinado conjuntamente em imagem, vídeo e áudio, em vez de combinar modelos separados. Ele também se estende a visão e ações robóticas. Por que é importante: O FLUX 3 representa o primeiro modelo público de geração de vídeo da empresa e enquadra a geração criativa, simulação, uso de computador e robótica como aplicações conectadas de uma única capacidade. A Black Forest Labs posiciona isso como "inteligência visual"—modelos que podem perceber, prever e agir em ambientes físicos e digitais—em vez de tratar cada modalidade como uma ferramenta separada.

    Pontos de atenção: O FLUX 3 será oferecido através de quatro linhas de produtos: FLUX 3 Video, FLUX 3 Image e FLUX 3 Act. O lançamento é limitado inicialmente, o que significa que detalhes de disponibilidade mais ampla ou preços podem ser anunciados posteriormente.

Em breve

Acompanhe a corrida pela integração de voz nos assistentes de IA: a OpenAI está sinalizando um dispositivo de hardware alimentado por GPT Live, enquanto a Anthropic expande o suporte multilíngue e a capacidade de alternar entre texto e voz em tempo real. Simultaneamente, observe o lançamento do Flux 3 da Black Forest Labs, que promete melhorias significativas em geração de imagens complexas e um novo modelo de predição de ações, com acesso aberto aos pesos do backbone multimodal planejado para breve.

Fontes

Share this with a friend

Send today's roundup to anyone who wants to keep up.

Get daily AI news free with AIToday

200+ AI sources, summarized in 1 minute. Email / LINE / Slack.

Sign up free