
元Amazon Distinguished Scientistのアレックス・スモーラ氏がBoson AIを立ち上げ、音声AIモデルでOpenAIとMetaと直接競争している。スタートアップは全スタックアプローチを採用することで、エンタープライズクライアントが自社のデータセンター内でシステムを実行でき、競合他社の10分の1のコストで音声間翻訳機能を提供できると主張している。Bosonは7000万ドル(約110億円)の資金調達を実施しており、金融、通信、医療、保険セクターをターゲットにしている。音声AIが次世代会話型AIの構築競争における主要なフロンティアとして浮上する中、このスタートアップは大きな注目を集めている。
こういう要約が、毎朝あなたのメールに届きます。
無料で登録 →何が起きたか
Amazonの元Distinguished Scientistアレックス・スモーラ氏がBoson AIを設立し、競合他社の音声システムよりも大幅に低価格な音声間翻訳モデル「Higgs RealTime」をリリースする。サンタクララに拠点を置くこのスタートアップは7000万ドル(約110億円)の資金調達を実施し、中国の起業家スー・フア氏およびシンガポール拠点のTemasekのベンチャー部門が支援者に名を連ねている。
なぜ重要か
音声AIはOpenAIやMetaなど主要企業が注力する全二重通信システム(ユーザーが途中で割り込める自然な双方向会話を実現する技術)の重要な競争領域となっている。Bosonは自社モデルが競合他社の10分の1の費用で利用できると主張しており、カスタマーサポート、営業、その他のエンタープライズアプリケーションにおける音声エージェントの導入経済学を大きく変える可能性がある。スモーラ氏は金融、通信、医療、保険業界の顧客をターゲットにしている。
注目点
Bosonは多くの資金を持つ競合に直面している。Microsoftは最近新しい音声モデルの反復版を発表し、OpenAIはGPT-Live(全二重オーディオモデルのファミリー)をローンチし、Metaはウェアラブル向けに最適化したMuse Sparkをリリースしている。主要な技術的課題はレイテンシーのままである。テキストチャットでは1秒の遅延は許容されるが、音声会話ではそれが不快に感じられる。
アマゾンの元Distinguished Scientistで著名な機械学習研究者のアレックス・スモーラ氏は、OpenAI、Meta、Microsoftと直接競争する音声AIモデルを構築するためにカリフォルニア州サンタクララにBoson AIを設立した。スタートアップは音声間翻訳モデル「Higgs RealTime」のリリースを準備しており、中国の起業家スー・フア氏およびシンガポールのベンチャー投資企業Temasekを含む支援者から7000万ドル(約110億円)の資金を調達している。
スモーラ氏の中核的な洞察は、業界がテキストオンリーのインターフェースからマルチモーダルAI(オーディオとビジョンを統合してより豊かなユーザー体験を提供するシステム)への移行を進めているというものである。しかし、彼は市場ギャップを特定した。OpenAI、Meta、その他の企業からの既存の音声モデルは構築と導入に高額な費用がかかるということである。Bosonは自社モデルが競合他社のシステムの10分の1のコストであると主張している。「我々が提供しているのは競合他社と比べて桁違いに手頃な価格設定であり、それでいて非常に使用に適した性能を備えている」とスモーラ氏はFortuneに語った。同社の全スタックアプローチがこのコスト優位性の鍵である。エンタープライズカスタマーが自社データセンター内でシステムを実行し、ゼロからカスタム音声およびビデオモデルを訓練し、データ所在地とモデル実行に対する直接的な制御を維持できる。これは金融、通信、医療、保険の機密性の高いビジネス環境にとって重大な要件である。
音声AI分野は主要な競争領域となっている。OpenAI最高経営責任者のサム・アルトマン氏は最近、自分がChatGPTと会話する方がテキストでやり取りするより多いと投稿し、同社の「新しい音声モデルは本当に転換点を越えた」と指摘した。OpenAIはGPT-Live(全二重オーディオモデルのファミリー)をローンチし、ユーザーが割り込んだり、トピックを切り替えたりできる自然で流暢な双方向会話を実現している。Metaは同様に音声に最適化されたMuse Sparkをリリースし、「アシスタントと自然に会話する、割り込む、トピックを切り替える、言語を切り替えるのが可能」である。Microsoftは新しい音声モデルの反復版を発表した。各競合は異なるポジショニングを採用している。Microsoftは職場生産性、OpenAIはアプリ開発者向けのデフォルト、Metaはウェアラブル全体のハードウェア統合に軸足を置いている。
Bosonは実際の技術的課題に直面している。テキストチャットでは1秒の応答遅延は許容できるが、音声会話では同じ間隔は不自然に感じられる。スモーラ氏は、Bosonが感情的なトーンと高速音声パターンを含む「人間の状態」の微妙な点を解析することでレイテンシー課題に対処するようAIを訓練していると述べている。全二重オーディオはグラフィックス処理装置の使用を増加させるため高額な費用を招く。これらの障害物があるにもかかわらず、スモーラ氏はエンタープライズ価値を直ちに見出している。音声モデルはカスタマーサポートと営業インタラクションを自動化でき、コール中の完全な文脈を維持して人間のチームより迅速にリアルタイムログとパーソナライズされたレコードを生成でき、最終的に多くの役割で「厳密に人間より優れている」ものになるという。さらに先を見れば、スモーラ氏はアニメーション顔と高度な音声モデルを備えた具現化ロボットが一般家庭の備品となること、そしてロボットが推論、ビジョン、音声を組み合わせて「究極の技術フロンティア」となることを想定している。
音声AIはテキストオンリーのインターフェースから、オーディオ、ビジョン、推論を組み合わせたマルチモーダルシステムへと進化し、会話型AIにおける次の主要なフロンティアとなっている。OpenAI最高経営責任者のサム・アルトマン氏は最近、同社の新しい音声モデルが「本当に転換点を越えた」と指摘し、この技術が人間と機械の相互作用に意味のあるシフトをもたらすほど成熟したことを示唆している。これが激しい競争を促している。OpenAIがGPT-Liveをリリースし、MetaがMuse Sparkをローンチし、Microsoftが新しい音声反復版を発表しており、各社は異なるポジショニングを採用している。Microsoftは職場生産性、OpenAIはアプリ開発者向けのデフォルト、Metaはウェアラブル全体のハードウェア統合に軸足を置いている。
スモーラ氏の差別化要因はコストと制御である。エンタープライズカスタマーが自社データセンター内でシステムを実行し、ゼロからカスタムモデルを訓練できる全スタックアーキテクチャを提供することで、Bosonはクライアントにデータ所在地とモデル実行に対する直接的な制御を与える。これは金融や医療などの規制産業にとって大きな利点である。競合他社の10分の1のコストで、このスタートアップは音声導入の経済学を大きく変える可能性があるが、低レイテンシーで感情認識に対応した会話として自然に感じるシステムの構築は依然として技術的に難しい課題である。スモーラ氏が示唆する広い意味でのビジョン(推論、ビジョン、音声を組み合わせた具現化AI)は、音声モデルがスタンドアロン製品ではなく、マルチモーダルで文脈認識型エージェントへのより大きなシフトの一部であることを示唆している。
AIが要約して、あなたの選んだトピックだけを1日1通。LINE・Email・Slackで届きます。
登録無料・30秒で完了・いつでも解除できます
まだコメントがありません。最初のコメントを投稿しましょう!
ログインして議論に参加200以上のソースから厳選したAIニュースを毎日無料でお届けします。
無料で始める登録無料・30秒で完了・いつでも解除できます