AIToday
音声・スピーチAIビジネス・産業SiliconANGLE AI掲載日時: 2026年7月30日 19:018分で読める

Fish Audio、AI音声開発で5200万ドル調達

LINEで送る
Fish Audio、AI音声開発で5200万ドル調達

要点

  • 元Nvidia研究員が創業したAI音声スタートアップFish Audioが、人間らしい合成音声生成プラットフォームの拡大に向けてシードラウンドで5200万ドルを調達した。

  • 既に800万ユーザーを超えており、年間経常収益は2100万ドルを上回っている。

  • 盲検リスニングテストでリスナーの67%がFish Audioの音声を競合他社より選好しており、ElevenLabsなど知名度の高い音声AIスタートアップへの強力な対抗馬として位置付けられている。

3つのポイント

  1. 何が起きたか

    元Nvidia研究員の廖世嘉が創業したAIスタートアップFish Audioが、Coreline VenturesとCapital Todayが主導するシードラウンドで5200万ドルを調達した。同社のフラグシップモデルS2.1 Proは8月末からAPI経由で全開発者に無料公開される。

  2. なぜ重要か

    Fish Audioプラットフォームは既に800万ユーザーを超える利用者を獲得し、年間経常収益が2100万ドルを上回っている。盲検リスニングテストでは、リスナーの67%がFish Audioの音声出力を競合他社より選好した。ElevenLabsが最近5億ドルを110億ドルの評価額で調達した市場において、この結果は大きな競争優位性を示す。本資金調達により、Fish Audioは医療・金融サービス分野の企業向け市場への拡大が可能になり、セキュアでコンプライアンス対応の音声AIの需要が高まる市場での地位を強化できる。

  3. 注目点

    Fish Audioは音声合成から音声ネイティブ大規模言語モデル、リアルタイム音声間翻訳へと事業を拡大する計画である。企業営業チームの拡大とRetell AIやLiveKitなどのパートナーとのAPI統合も予定している。8月末からの全開発者向けS2.1 Pro無料アクセスは、採用を大幅に加速させる可能性がある。

詳細

全文を読む

花火AI社として正式登録されているFish Audioは本日、すべてのAIモデルのデフォルトインターフェースとして音声を確立するため、シードラウンドで5200万ドルの資金調達を完了したと発表した。ラウンドはCoreline VenturesとCapital Todayが主導し、359 Capital、Play Time、HF0、645 Ventures、Parable、Carya Venture Partners、Alphalist Partners、および複数の匿名エンジェル投資家が参加した。

同社の創業ストーリーは初期段階のAI音声品質への不満に根ざしている。共同創業者で最高科学責任者の廖世嘉は、Nvidiaのビデオ研究者として働いていた経歴を持ち、日本アニメの生涯ファンである。彼は初期のAIモデルが生み出した単調でロボット的な合成音声に疲れ果て、自分自身で音声AIモデルを訓練することを決意した。寝室のノートパソコンに搭載された1枚のGPUのみを使用という過酷なハードウェア制限の中で、廖は当初のテキスト音声変換と音声クローン化モデルを開発し、それはやがてFish Speechへと進化した。このオープンソースプロジェクトはGitHub上で急速に注目を集め、3万1000ユーザー超のスターを累積し、より表現豊かな音声生成機能を求めるインディー開発者、コンテンツクリエイター、ビデオゲームデザイナーの目を引いた。

2023年の公式立ち上げ以来、Fish Audioは利用可能な最も包括的な音声AIプラットフォームの一つへと進化した。プラットフォームは、初期モデルが生み出した生気のない合成音声を排除することを中心に構築されており、1万5000を超える自然言語プロンプトで駆動する単語レベルの感情コントロール機能を提供する。これにより開発者はAI生成音声の正確なトーン、イントネーション、ペーシングを細かく調整できる。プラットフォームはわずか5秒のオーディオクリップから15秒以内に音声をクローン化でき、ネイティブで83言語をサポートし、同社のフラグシップS2.1 Proモデルは盲検リスニングテストで競合他社を上回り、リスナーの67%がFish Audioの音声出力を選好している。これらの機能により同社は800万ユーザーを超える利用者を獲得し、年間経常収益は2100万ドルを上回るようになった。

当初はビデオゲーム開発者とコンテンツクリエイターを対象としていたFish Audioは、医療や金融サービスといった規制対象業種に事業を拡大した。同社は現在、顧客プライバシー保護のため、ゼロデータリテンション対応でHIPAAコンプライアンス対応のセキュアなオンプレミス展開を提供している。この企業向け拡大により、Fish AudioはElevenLabsなど知名度のあるライバル企業への強力な対抗馬として位置付けられている。ElevenLabsは最近5億ドルを調達し、企業評価が110億ドルに達している。

共同創業者のリサ・カオ最高経営責任者は、人間らしいAI音声を誰もが利用できるようにするという使命を述べた。「我々は初心者クリエイターから100万ドル規模の企業まで、あらゆるユーザーが利用可能な高品質で人間らしい音声を提供し、コミュニケーションがより効率的で信頼できるものになるようにしている。モデルを改善し続ければ人々は気づくだろうと、我々は常に信じてきた。800万の人々がそうしてくれた」と述べた。

新たな資金により、Fish Audioはモデルラインアップの大幅な拡大を計画している。現在のテキスト音声変換機能を超えて、同社は音声ネイティブ大規模言語モデルとリアルタイム音声間翻訳ツールで構成される完全なオーディオネイティブスタックの構築を意図している。企業営業チームへの投資拡大、Retell AIやLiveKitなどのパートナーを通じた追加的なAPI統合によるデベロッパーツーリングの拡張も行う。プラットフォーム採用を加速するため、Fish Audioは8月末から公式API経由でフラグシップモデルS2.1 Proを全開発者に無料で利用可能にする。

Coreline Venturesのマネージングパートナーである本田大輔は投資決定の理由を説明した。「Fish Audioは短い歴史の中で、パフォーマンス、多言語サポート、感情表現、コストの面で限界を押し広げるという比類なき実績を構築してきた。これらすべての要因が、Fish Audioをクリエイター、開発者、そして現在は世界中の企業にとってデフォルトの選択肢として迅速に位置付け、彼らが今後も先導し続けることを期待している」と述べた。

背景と解説

Fish Audioは典型的なスタートアップの起業ストーリーから生まれた。劣悪なテクノロジーに不満を持つ一人のエンジニアがより優れたソリューション構築を決意したのだ。共同創業者の廖世嘉はNvidiaのビデオ研究者であり、生涯のアニメファンでもある。彼は寝室のノートパソコンに搭載された1枚のGPUで音声AIモデルの訓練を開始した。彼のオープンソースプロジェクトFish SpeechはGitHub上で急速に注目を集め、3万1000ユーザー超のスターを獲得し、インディー開発者、コンテンツクリエイター、ゲームデザイナーがより表現豊かな音声生成ツールを求めた。2023年の立ち上げ以来、同社は800万ユーザーを超えるまでに成長し、年間経常収益は2100万ドルを上回っている。これはウィークエンドプロジェクトから始まった企業とは思えない成長である。

5200万ドルのシードラウンドは、音声AIがAIシステムの基本的なインターフェースとして機能することに対する強い投資家信頼を反映している。Coreline Venturesのマネージングパートナーである本田大輔は、音声が「AIシステムのデフォルトインターフェース」になることを中心にこの投資を位置付けており、投資家が音声をますます重要な競争要因として認識していることを示唆している。Fish Audioのパフォーマンス指標がこの見方を支持している。同社のS2.1 Proモデルは盲検リスニングテストで競合他社を上回り、リスナーの67%がその出力を選好した。これはトーンと自然さがユーザー体験と採用を直接左右する市場における意味のある差別化要因である。

Fish AudioはElevenLabsなど知名度のあるスタートアップと直接競争している。ElevenLabsは最近5億ドルを調達し、110億ドルの評価額に達している。同社の企業向け市場へのピボット(医療向けにはHIPAAコンプライアンス対応のセキュアなオンプレミス展開を提供)は、データプライバシーが絶対要件である規制対象顧客から高マージン顧客を獲得する戦略を示唆している。8月末からのS2.1 Pro無料API開放は、営業チームの拡大と音声ネイティブ大規模言語モデルや音声間翻訳などの隣接製品への拡大の前に、開発者採用を加速させてユーザーをロックインする戦術かもしれない。

よくある質問

Fish Audioの音声は競合他社と何が異なるのか?
Fish Audioプラットフォームは1万5000を超える自然言語プロンプトによる単語レベルの感情コントロール機能を提供し、開発者がトーン、イントネーション、ペーシングを細かく調整できる。盲検リスニングテストでは、リスナーの67%がFish Audioの音声出力を他のモデルより選好した。プラットフォームは83言語に対応し、5秒のオーディオクリップから15秒以内に音声をクローン化できる。
Fish Audioのフラグシップモデルはいつ無料公開されるのか?
Fish Audioは8月末から、公式API経由でS2.1 Proモデルを全開発者に無料で利用可能にする予定である。
Fish Audioの資金調達ラウンドを主導したのは誰か?
Coreline VenturesとCapital Todayが5200万ドルのシードラウンドを主導し、359 Capital、Play Time、HF0、645 Ventures、Parable、Carya Venture Partners、Alphalist Partners、および複数の匿名エンジェル投資家が参加した。
SiliconANGLE AI元記事を読む

「音声・スピーチ」の最新ニュースを、毎朝7時にお届けします

AIが要約して、あなたの選んだトピックだけを1日1通。LINE・Email・Slackで届きます。

登録無料・30秒で完了・いつでも解除できます

関連記事

次の記事へMicrosoft、88カ所のデータセンター新設

AIニュースの要点を毎朝1分で。

無料で登録