AIToday您的AI新闻摘要

Audio & Speech

Jul 29, 2026

Audio & Speech

今日要点

Google推出Lyria 3.5增强了音乐编辑功能,而OpenAI的GPT Transcribe语音转文字模型虽然性能提升但仍落后于ElevenLabs、Google和Mistral等竞争对手。与此同时,Fish Audio获得5200万美元种子融资用于AI语音模型开发,个人开发者也推出了私人AI语音日记应用,日本法务省则开始支持对未经授权使用AI语音追究民事责任。

主要新闻

  1. 1

    Google Lyria 3.5 支持编辑音乐片段

    Google发布了音乐生成模型Lyria 3.5,并集成到Google Flow Music中。新增「Selective Section Painting」功能让用户可以编辑音乐片段中的特定部分,而无需从头开始生成。该模型生成的音乐长度为30秒至3分钟。 这项功能提高了音乐生成的灵活性。用户此前如果对生成音乐的某一部分不满意,需要重新生成整首曲目;现在可以精细调整特定片段,大幅降低了编辑成本和时间消耗。

    Google尚未披露Lyria 3.5的训练数据细节。用户可通过Google Flow Music体验这一新功能。

  2. 2

    OpenAI的GPT Transcribe性能提升0.7个百分点,但仍落后于ElevenLabs、Google和Mistral

    发生了什么:OpenAI通过其API发布了GPT Transcribe和GPT Live Transcribe两款语音识别模型。GPT Transcribe处理预录音频的速度比实时快34倍,而GPT Live Transcribe则处理实时流媒体并具有低延迟。新的GPT Transcribe实现了3.31%的字错率——相比GPT-4o Transcribe提高了0.7个百分点——价格下降25%,现为每分钟音频0.0045美元。 为什么重要:OpenAI的转录模型在AA-WER基准测试中排名第四,落后于ElevenLabs Scribe v2(2.3%)、Google的Gemini 3 Pro(2.9%)和Mistral的Voxtral Small(3%)。价格下降使OpenAI在与Mistral的Voxtral Transcribe V2(起价每分钟0.003美元)的竞争中更具竞争力,这表明OpenAI正在应对竞争激烈的语音识别市场中的利润压力。

    值得关注:这些模型接受文本作为转录上下文、关键词和多种输入语言,并补充了OpenAI最近宣布的实时模型生成功能,其中包括GPT-Realtime-Whisper。完整的技术细节可在OpenAI的转录指南中找到。

  3. 3

    個人開発者がプライベートAI音声日記アプリ公開

    開発者が自分用に作った音声日記アプリ「Echologue」を公開しました。音声入力を中心に、プライベート性を重視し、AI機能で過去の日記から質問に答えてもらったり、タグ付けや意味抽出ができます。 従来の日記アプリは継続しにくいという課題に対し、話すだけで記録でき、AIが「過去3ヶ月の思い出や特別な夜は」「スペイン旅行中の気分と別れの影響」といった質問に答える仕組みで、ユーザーが本当の気持ちを記録しやすくしています。

    すべてのデータをデバイス内に保存し、AI処理はZero Data Retention Endpointsで行われるため、メールアドレスなど個人情報は一切保持されず、完全に匿名です。

  4. 4

    OpenAI推出GPT-Transcribe语音转文字模型,支持音频文件和实时会话

    发生了什么:OpenAI宣布推出GPT Transcribe语音转文字模型,可处理已完成的音频文件、流式文件转录和WebSocket上的Realtime会话中的确认轮次。该模型支持非结构化上下文、关键词提示和多种语言提示,以改进专业术语、多语言音频和代码转换的转录效果。 为什么重要:该模型能够处理关键词提示和语言提示,这意味着它可以针对专业词汇和多语言环境进行调优——这一能力可以减少医学、法律和软件开发等对精确术语要求高的领域的转录错误。对WebSocket上Realtime会话的支持表明除批量处理外,还有实时转录的应用场景。

    值得关注:该公告未包含定价、可用日期、API访问细节或地域限制信息。也没有提供GPT Transcribe与现有转录服务的对比信息,也不清楚标题中提到的第二个模型GPT-live-transcribe是否会单独详细介绍。

  5. 5

    Fish Audio融资5200万美元种子轮,构建AI语音模型

    发生了什么:总部位于帕洛阿尔托的Fish Audio拥有超过800万用户,年经常性收入达2100万美元,于周二完成由Coreline Ventures和Capital Today领投的5200万美元种子轮融资。该公司在过去一年发布了五个模型——四个语音生成模型和一个语音转文本模型——并运营着拥有超过15000个自然语言控制的模型库。 为何重要:AI语音生成对需要富有表现力的合成语音的创作者,以及自动化客户支持和销售的企业越来越有价值。Fish Audio采取开源策略(其三个模型已开源,最新的S2.1 Pro仅通过付费API提供),吸引了独立开发者和电子游戏设计师,而HeyGen和Sanas等机构正在使用其企业API。该公司面临市场竞争激烈,竞争对手包括ElevenLabs、WellSaid和Cartesia。

    值得关注的是:Fish Audio计划今年发布音频理解模型,并正在构建语音转语音模型。该公司还自动化了其语音删除流程——创作者现在可以通过提交语音样本或合同在不到三分钟内删除未授权的语音上传——这解决了早期关于同意的担忧。

  6. 6

    日本法务省支持对未经授权使用AI语音追究民事责任

    发生了什么:日本法务省专家委员会周一批准了一份草案报告,确立未经授权通过生成式AI使用公众人物语音可以根据肖像权法(允许名人控制其身份商业价值的法律保护)追究民事责任。个人可以要求赔偿或删除侵权网络内容。 为什么重要:配音演员和其他人士长期以来一直呼吁澄清什么构成非法使用语音,因为日本法院之前未曾对这些权利作出裁决。该报告规定,即使AI生成的语音与原声不完全相同,但具有相似的声音品质和风格也可能构成侵权——这为遭受未经授权的盈利性AI语音模仿的受害者树立了有意义的标准。

    值得关注的是:法务省将根据专家意见最早在8月份发布最终报告。该草案还明确指出,利用AI从演员肖像生成色情图像可能侵犯肖像权和人格权,涉及更广泛的生成式AI危害类别。

接下来关注

随着Google Lyria 3.5、OpenAI GPT-Realtime-Whisper等新一代语音AI模型的陆续推出,用户需要关注这些服务的具体定价、可用日期和地域限制等后续信息披露。同时,Fish Audio的音频理解模型和法务省关于AI生成内容的监管报告也值得密切关注,这些将直接影响语音AI技术的应用前景和合规框架。

来源

Share this with a friend

Send today's roundup to anyone who wants to keep up.

Get daily AI news free with AIToday

200+ AI sources, summarized in 1 minute. Email / LINE / Slack.

Sign up free