AIToday您的AI新闻摘要

Audio & Speech

Jul 28, 2026

Audio & Speech

今日要点

Fish Audio完成5200万美元种子轮融资,致力于开发AI语音模型技术。日本法务省表示支持对未经授权使用AI语音追究民事责任,同时超三成新播客已由AI生成。此外,前AWS科学家创立的Boson AI推出廉价语音模型与OpenAI和Meta竞争,Deepgram也在优化AWS集成功能以提升用户体验。

主要新闻

  1. 1

    Fish Audio融资5200万美元种子轮打造AI语音模型

    发生了什么:总部位于帕洛阿尔托的Fish Audio拥有超过800万用户,年经常性收入2100万美元,于周二完成由Coreline Ventures和Capital Today领投的5200万美元种子轮融资。该初创公司在过去一年发布了五个模型——四个语音生成模型和一个语音转文字模型——并运营包含超过15000个自然语言控制的库。 为什么重要:AI语音生成对需要富有表现力合成语音的创作者以及自动化客户支持和销售的企业来说价值越来越大。Fish Audio的开源方式(其五个模型中三个为开源,最新的S2.1 Pro仅通过付费API提供)吸引了独立开发者和视频游戏设计师,而HeyGen和Sanas等机构都在使用其企业API。该公司面临包括ElevenLabs、WellSaid和Cartesia在内竞争对手的激烈市场竞争。

    值得关注:Fish Audio计划在今年发布音频理解模型,并正在开发语音转语音模型。该初创公司还自动化了语音删除流程——创作者现在可以通过提交语音样本或合同在三分钟内移除未授权的语音上传——这解决了之前关于同意的担忧。

  2. 2

    日本法务省支持对未经授权的AI语音使用追究民事责任

    发生了什么:日本法务省专家委员会周一批准了一份草案报告,确立未经授权通过生成式AI使用公众人物的声音可根据肖像权法承担民事责任——这是一项允许名人控制其身份商业价值的法律保护。个人可以要求赔偿或删除侵权网络内容。 为什么重要:配音演员和其他人士长期以来一直呼吁澄清什么构成非法语音使用,因为日本法院此前从未对这些权利进行过裁决。该报告明确指出,即使是与原声不完全相同但具有相似声音质量和风格的AI生成语音也可能构成侵权——这对未经授权的AI语音模仿被用于牟利的受害者来说是一个有意义的标准。

    值得关注的是:法务省将根据专家意见最早在8月发布最终报告。草案还澄清了使用AI从演员肖像生成色情图像可能会侵犯肖像权和肖像权法两者,涉及更广泛的生成式AI伤害问题。

  3. 3

    超三成新播客由AI生成,Listen Notes数据显示

    发生了什么:播客搜索数据库Listen Notes报告称,超过30%的新创播客由AI生成音频组成,而非人类创作的内容。该平台拥有379万3012个播客的数据库,通过过滤AI垃圾内容、已删除播客和其他服务计数中包含的非音频内容来区分自身数据库。 为什么重要:AI生成播客的激增削弱了真实人类创作音频内容的质量和可发现性。对听众和创作者而言,这意味着真正的播客数量远低于标题数字所暗示的水平,这种差异影响行业如何衡量增长和成功。

    值得关注:Listen Notes使用24小时自动化脚本和人工审核员来维护其真实播客数据库,为该行业设立质量管理标准,而在该行业中播客数量虚高现已成为常见做法。

  4. 4

    Deepgram整合AWS IAM临时委派功能以支持SageMaker访问

    事件:Deepgram已将IAM临时委派(一项新的AWS IAM功能)整合到其支持工作流中,用于在Amazon SageMaker AI上运行Deepgram语音AI模型的客户。该整合允许Deepgram工程师直接从支持工单系统请求对客户端点和日志的时间限制、范围受限的访问权限,客户可在其自己的IAM控制台中批准请求。 重要性:这替代了之前的长期跨账户IAM角色模式,该模式需要反复进行预配和审计对话。Deepgram已将SageMaker AI支持工单的初始调查时间从数天缩短至数分钟,因为客户现在可以在其IAM控制台中批准访问,而无需安排屏幕共享。每个委派的API调用都在AWS CloudTrail中标记有Deepgram的合作伙伴账户ID,以实现完整的可审计性。

    关注点:通过该整合颁发的凭证在十二小时后自动过期,客户可在过期前的任何时候撤销访问权限。该整合需要有效的Deepgram支持合同、在SageMaker AI端点运行的区域中启用的AWS CloudTrail追踪,以及用于SageMaker AI端点托管、Amazon CloudWatch日志、AWS CloudTrail和网络的AWS基础设施费用(Deepgram为其模型提供14天免费试用,但从部署开始之日起需支付AWS基础设施成本)。

  5. 5

    前AWS科学家创立Boson AI,推出廉价语音模型对标OpenAI和Meta

    发生了什么:亚马逊前首席科学家Alex Smola创立了Boson AI公司,推出了语音转换语音模型Higgs RealTime,相比竞争对手的语音系统成本要便宜得多。这家圣克拉拉初创企业已融资7000万美元,投资方包括中国创业者Su Hua和新加坡淡马锡旗下的风险投资部门。 为什么重要:语音AI已经成为OpenAI、Meta等领导者争夺的主要阵地,他们都在开发全双工系统,这种技术能够实现自然的双向对话,用户可以在对方说话中途打断。Boson声称其模型成本仅为竞争对手的十分之一,这可能会重塑语音客服、销售等企业应用部署的经济效益。Smola的目标客户包括金融、电信、医疗和保险行业。

    需要关注:Boson面临资金充足的竞争对手——微软最近推出了新版本的语音模型,OpenAI发布了全双工音频模型系列GPT-Live,Meta则推出了针对可穿戴设备语音优化的Muse Spark。关键的技术难点仍然是延迟问题;虽然文本聊天中一秒延迟可以接受,但在语音对话中就会显得很突兀。

  6. 6

    オープンソース音声エージェント分析ツール VoiceGateway公開

    音声エージェント向けのオープンソース分析ツール VoiceGateway が公開されました。LiveKit や Pipecat などの音声エージェントを自分で運用している場合、モデル層での動作を可視化できなかったという問題に対応するもので、STT(音声認識)、LLM(大規模言語モデル)、TTS(音声合成)の各呼び出しについて遅延の内訳、モデル ID、コストをプロファイリングします。 自社運用する音声エージェントの内部動作が見えないという課題を解決する道具が出現したことで、音声 AI システムの運用・最適化がしやすくなるとみられます。特にコスト追跡機能(voicegw reconcile でプロバイダーの請求書との照合が可能)は、利用費の透明性を求める企業にとって有用です。

    MIT ライセンスのオープンソースで、Docker で動作し、ローカルの SQLite にデータを保存、DuckDB で分析します。セッションに一度 attach() を呼び出すだけで利用でき、音声経路の外側で動作するため既存の音声エージェント構成への組み込みが容易です。

接下来关注

随着Fish Audio推进音频理解和语音转语音模型的开发,以及在语音删除自动化方面取得进展,音频创作者的权益保护机制正在不断完善;同时,随着微软、OpenAI和Meta等科技巨头纷纷推出各自的先进语音模型,语音AI领域的竞争日益激烈,延迟优化将成为决定用户体验的关键因素。

来源

Share this with a friend

Send today's roundup to anyone who wants to keep up.

Get daily AI news free with AIToday

200+ AI sources, summarized in 1 minute. Email / LINE / Slack.

Sign up free