AITodaySeu digest de notícias de IA

Audio & Speech

Jul 29, 2026

Audio & Speech

Resumo do dia

O Google lançou Lyria 3.5, permitindo edição de seções específicas em músicas geradas por IA, enquanto a OpenAI apresentou GPT-Transcribe para transcrição de áudio em tempo real, embora ainda fique atrás de concorrentes como ElevenLabs e Google em precisão. A Fish Audio arrecadou US$ 52 milhões para desenvolver modelos de voz com IA, enquanto o Japão estabelece responsabilidade civil pelo uso não autorizado de vozes em sistemas de inteligência artificial.

Principais notícias

  1. 1

    Lyria 3.5 do Google permite que usuários editem seções de músicas sem recomeçar

    O que aconteceu: O Google lançou a Lyria 3.5, um modelo de geração de música que produz melodias com som mais natural, letras melhores e vocais mais realistas. O modelo está disponível por meio do Google Flow Music e inclui um novo recurso chamado 'Selective Section Painting' que permite aos usuários editar partes específicas de uma faixa ou transformar melodias curtas em músicas completas sem começar do zero. Por que é importante: A capacidade de editar seções individuais sem reiniciar o processo de geração torna a criação musical mais rápida e flexível para os usuários. Eles também podem ajustar o tempo e a duração de elementos específicos, como vocais, bateria e baixo, dando mais controle criativo sobre o resultado final.

    Pontos de atenção: As faixas podem ter de trinta segundos a três minutos de duração. O Google não forneceu detalhes sobre os dados de treinamento da Lyria 3.5, apesar de ter divulgado que a Lyria 3 foi treinada com materiais que o YouTube e o Google tinham direito de usar sob seus termos de serviço, acordos com parceiros e legislação aplicável.

  2. 2

    GPT Transcribe da OpenAI melhora 0,7 pontos percentuais, mas fica atrás de ElevenLabs, Google e Mistral

    O que aconteceu: A OpenAI lançou GPT Transcribe e GPT Live Transcribe, dois modelos de reconhecimento de fala via sua API. GPT Transcribe processa áudio pré-gravado cerca de 34 vezes mais rápido do que em tempo real, enquanto GPT Live Transcribe lida com transmissão em tempo real com baixa latência. O novo GPT Transcribe alcança uma taxa de erro de palavra de 3,31 por cento—uma melhoria de 0,7 ponto percentual em relação a GPT-4o Transcribe—com redução de preço de 25 por cento para US$ 0,0045 por minuto de áudio. Por que importa: Os modelos de transcrição da OpenAI agora ocupam a quarta posição no benchmark AA-WER, atrás de ElevenLabs Scribe v2 (2,3%), Gemini 3 Pro do Google (2,9%) e Voxtral Small do Mistral (3%). A redução de preço posiciona a OpenAI competitivamente contra Voxtral Transcribe V2 do Mistral, que começa em US$ 0,003 por minuto—sugerindo que a OpenAI está respondendo à pressão de margens em um mercado de reconhecimento de fala saturado.

    O que acompanhar: Os modelos aceitam texto como contexto de transcrição, palavras-chave e múltiplos idiomas de entrada, complementando o modelo de geração em tempo real anunciado recentemente pela OpenAI, que inclui GPT-Realtime-Whisper. Os detalhes técnicos completos estão disponíveis no Guia de Transcrição da OpenAI.

  3. 3

    Echologue: AI voice journal com privacidade local

    Um desenvolvedor criou Echologue, um app de diário de voz com IA integrada, projetado para uso pessoal com armazenamento totalmente local no dispositivo. O app permite consultas semânticas sobre entradas de voz passadas (por exemplo, "destaque-me as noites loucas nos últimos 3 meses") usando embeddings locais e inferência de IA; toda a inferência ocorre em Zero Data Retention Endpoints, garantindo anonimato total e nenhum registro de dados do usuário.

    O design "fire and forget" — falar por cerca de um minuto diariamente — é pensado para remover as barreiras que impedem a adesão ao journaling tradicional.

  4. 4

    OpenAI lança GPT-Transcribe, modelo de fala para texto para arquivos de áudio e sessões ao vivo

    O que aconteceu: A OpenAI anunciou GPT Transcribe, um modelo de fala para texto que processa arquivos de áudio concluídos, transcrições de arquivos transmitidos e turnos confirmados em sessões Realtime via WebSocket. O modelo suporta contexto não estruturado, dicas de palavras-chave e dicas de múltiplos idiomas para melhorar a transcrição de termos de domínio, áudio multilíngue e alternância de código. Por que importa: A capacidade do modelo de lidar com dicas de palavras-chave e dicas de idioma significa que ele pode ser ajustado para vocabulários especializados e contextos multilíngues — uma funcionalidade que poderia reduzir erros de transcrição em áreas como medicina, direito e desenvolvimento de software, onde a terminologia precisa é essencial. O suporte para sessões Realtime via WebSocket sugere casos de uso de transcrição em tempo real ao lado do processamento em lote.

    O que observar: O anúncio não inclui informações sobre preços, data de disponibilidade, detalhes de acesso à API ou restrições regionais. Nenhuma informação é fornecida sobre como GPT Transcribe se compara aos serviços de transcrição existentes ou se um segundo modelo (GPT-live-transcribe) mencionado no título será detalhado separadamente.

  5. 5

    Fish Audio levanta US$ 52 milhões em rodada seed para construir modelos de voz com IA

    O que aconteceu: A Fish Audio, sediada em Palo Alto, que possui mais de 8 milhões de usuários e gera US$ 21 milhões em receita recorrente anual, levantou US$ 52 milhões em uma rodada seed liderada pela Coreline Ventures e Capital Today na terça-feira. A startup lançou cinco modelos no ano passado—quatro modelos de geração de fala e um modelo de fala para texto—e opera uma biblioteca com mais de 15 mil controles de linguagem natural. Por que importa: A geração de voz com IA é cada vez mais valiosa para criadores que precisam de vozes sintéticas expressivas e empresas que automatizam atendimento ao cliente e vendas. A abordagem de código aberto da Fish Audio (três de seus modelos são de código aberto, com o mais recente S2.1 Pro disponível apenas via API paga) atraiu desenvolvedores independentes e designers de videogames, enquanto organizações como HeyGen e Sanas utilizam suas APIs empresariais. A empresa enfrenta um mercado competitivo com concorrentes como ElevenLabs, WellSaid e Cartesia.

    O que observar: A Fish Audio planeja lançar um modelo de compreensão de áudio este ano e está construindo um modelo de fala para fala. A startup também automatizou seu processo de remoção de vozes—criadores agora podem remover uploads de voz não autorizada em menos de três minutos enviando uma amostra de voz ou contrato—abordando preocupações anteriores sobre consentimento.

  6. 6

    Ministério da Justiça do Japão respalda responsabilidade civil pelo uso não autorizado de voz em IA

    O que aconteceu: Uma comissão de especialistas do Ministério da Justiça do Japão aprovou na segunda-feira um relatório preliminar estabelecendo que o uso não autorizado de vozes de figuras públicas através de IA generativa pode estar sujeito a responsabilidade civil sob o direito de personalidade — uma proteção legal que permite a celebridades controlar o valor comercial de suas identidades. Indivíduos podem exigir indenização ou remoção de postagens infratoras na internet. Por que importa: Atores de voz e outros há muito tempo solicitavam esclarecimentos sobre o que constitui uso ilegal de voz, já que nenhuma decisão judicial japonesa havia abordado anteriormente esses direitos. O relatório especifica que até vozes geradas por IA que não são idênticas aos originais, mas compartilham qualidade de voz e estilo similares, podem constituir infração — um padrão significativo para vítimas de imitação de voz com IA não autorizada usada com fins lucrativos.

    Pontos de atenção: O Ministério da Justiça divulgará um relatório final já em agosto com base na contribuição dos especialistas. O relatório preliminar também esclarece que gerar imagens sexuais a partir do retrato de um ator usando IA pode infringir tanto o direito de personalidade quanto direitos de imagem, abordando uma classe mais ampla de danos causados por IA generativa.

Em breve

Fique atento aos próximos passos do Google com a Lyria 3.5, especialmente quanto aos detalhes de treinamento e disponibilidade, enquanto acompanha como a OpenAI e a Fish Audio expandem suas capacidades de transcrição e compreensão de áudio. Também observe as diretrizes regulatórias que o Ministério da Justiça deve divulgar em agosto, que podem definir novos padrões legais para o uso de IA generativa em conteúdo envolvendo personalidades públicas.

Fontes

Share this with a friend

Send today's roundup to anyone who wants to keep up.

Get daily AI news free with AIToday

200+ AI sources, summarized in 1 minute. Email / LINE / Slack.

Sign up free