
2024年後半に設立されたSmallest.aiは、リアルタイムで音声を処理することで、人間と区別がつかない音声AIエージェントを開発するため、シリーズAで1300万ドルを調達した。ほとんどのAIエージェントは応答を生成する際に顕著に一時停止するのに対し、Smallest.aiの小規模で特化されたモデルは、よく知られた顧客サポートトピックに対して即座に対応し、複雑な質問は必要な場合のみより大きなモデルに引き継ぐ。
人間のエージェントと同じ方式だ。
同社はRingCentralおよびTruecallerと既に協業しており、ElevenLabsなどの確立されたプレイヤーと競合している。
何が起きたか
2024年後半に設立されたSmallest.aiが、Seligman Venturesが主導するシリーズAで1300万ドルを調達した。Sierra VenturesおよびOneone4 Capitalも参加し、総資金調達額は2100万ドルを超えた。同社は人間のように同時に聴き、考え、話すことで、AIエージェントの不自然な遅延を排除する小規模な特化型音声モデルを開発している。
なぜ重要か
ほとんどのAI顧客サポートエージェントはまだ機械的に聞こえ、会話における不自然な一時停止がある。Smallest.aiのアプローチは、よく知られたトピックに対して即座に対応する小規模なリアルタイム音声モデルを使用し、複雑な質問が必要な場合のみより大きなモデルに引き継ぐ方式で、人間のサポートエージェントが不慣れな問題を簡単に調査するやり方を模倣している。既存の顧客にはRingCentralとTruecallerが含まれており、このモデルは社内音声AI専門知識を持たない顧客サポート企業に訴求する可能性がある。
注目点
Smallest.aiはElevenLabs、Cartesia、Sarvamなどの地域プレイヤーと競合している。同社はリアルタイム会話型音声エージェントの企業向けに絞って注力し、多様なアクセント、数十言語、騒音環境に対応している。音声ダビングやポッドキャスティングなどのより広い音声ユースケースは対象ではない。
2024年後半に設立されたSmallest.aiは、Seligman Venturesが主導する1300万ドルのシリーズAを発表した。Sierra VenturesおよびOneone4 Capitalも参加している。資金調達により、同社の総資本調達額は2100万ドルを超えた。同社は、ほとんどの現在の音声AI システムに悩まされている不自然な一時停止を排除することで、AIエージェントとの会話を人間のように感じさせる、小規模で特化した音声モデルを構築している。
コア・イノベーションは、人間が音声を処理する方法と同じように機能する音声モデルである。すなわち、同時に聴き、考え、話す。創業者兼CEOのSudarshan Kamathが TechCrunchに説明したように、「私があなたに話している間、あなたはすでに考えており、もし私が長く話し続けたら、あなたは私を遮るかもしれない。これは正確にスタートアップのモデルが動作するように設計された方法である」。標準的な大規模言語モデルは異なった方法で動作する。プロンプト全体を受け取り、その後に処理を開始する。これにより注目すべきレイテンシーが導入される。テキスト チャットでは、そのような遅延は許容可能である。音声会話では、不自然で不安定に感じられる。Smallest.aiのモデルは、リアルタイムのインテリジェンス層として機能し、特定のトピックに関する自然な顧客会話をほぼゼロの応答遅延で可能にする。モデルが限定されたナレッジベースの外にあるサブジェクトに遭遇した場合、クエリを大規模な基盤モデルに引き継ぎ、顧客を短時間保留にして問題を「研究」する。人間のサポートエージェントが不慣れな問題に対処する方法を模倣している。
Kamathは、AIエージェントの未来はリアルタイム相互作用のための小規模音声モデルと、必要に応じて複雑な問題解決のために呼び出される「オフライン」大規模言語モデルという2つのモデルに依存していると考えている。大規模な基盤モデルとは異なり、Smallest.aiは音声固有のニュアンスに厳密に焦点を当てている。多様なアクセント、数十言語のサポート、騒音環境での信頼性の高い動作である。同社の既存顧客にはRingCentralおよびTruecallerが含まれる。Kamathは、SierraおよびDecagonなどの新興企業を含むあらゆるカスタマーサポート企業が、Smallest.aiのテクノロジーから恩恵を受ける可能性があることを指摘した。資金豊富なAIカスタマーサポート企業が独自の音声モデルを構築しないのはなぜかと聞かれたとき、Kamathは、音声で「非常に優れた」になることは彼らのコアビジネスからの「気を散らすこと」だと答えた。
Smallest.aiはElevenLabs(主要な音声AI企業)およびCartesia、ならびにローカル言語に焦点を当てるSarvamなどの地域プレイヤーと競合している。しかし、Smallest.aiのポジショニングは異なっている。一部の競合他社は音声AIをダビングおよびポッドキャスティングに適用している一方、Smallest.aiは企業顧客向けの リアルタイム会話型音声エージェントに専念している。Kamathは同社の中心的な野心を述べた。「私たちは、私たちのモデルがチューリング・テストを破ってほしいと考えている。あなたは私たちのモデルに話しかけるべきであり、それがAIか人間かを知らないべきである。これが同社の唯一の焦点である。」
同社は、AIカスタマーサポートにおける根強い問題点に対処している。大規模言語モデルが入力を処理して出力を生成するときに発生する、不気味でロボット的な一時停止である。標準的なLLMベースのエージェントは順序立てて動作する。入力を受け取り、その後に思考し、その後に話す。これにより測定可能なレイテンシーが導入され、自然な会話の流れが中断される。Smallest.aiの創業者らは、次のフロンティアはより大きなモデルでの高速推論ではなく、人間の音声と会話のメカニクスについて特別に訓練された目的別設計の小規模モデルであると主張している。
同社の2段階アーキテクチャ。リアルタイム交換のための小規模音声モデル、複雑なクエリのための大規模基盤モデル。は、万能の基盤モデルが特殊なタスクに対して非効率である可能性があるという業界の新たな信念を反映している。音声固有の課題(多様なアクセント、多言語対応、ノイズロバストネス)およびリアルタイムカスタマーサポートに焦点を絞ることで、Smallest.aiはダビングからポッドキャスティングまで、より広い音声AI使用ケースに対応するElevenLabsなどの競合他社よりも、狭いがより競争が少ないニッチに自らを位置付けている。1300万ドルのシリーズA、顧客トラクション(RingCentral、Truecaller)、および2024年後半の設立日は、汎用モデルがより強力になるにつれても、特化された会話型音声AIが企業価値をキャプチャできるというテーゼに対するベンチャーキャピタルの信頼を示唆している。
AIが要約して、あなたの選んだトピックだけを1日1通。LINE・Email・Slackで届きます。
登録無料・30秒で完了・いつでも解除できます
AI音声ペンダントのスタートアップ Friend が、ユーザーと会話できるスピーカーを内蔵した製品を再発売し、価格を129ドルから249ドルに引き上げた

元Nvidia研究員の廖世嘉が創業したAIスタートアップFish Audioが、Coreline VenturesとCapital Todayが主導するシードラウンドで5200万ドルを調達した
Googleが音楽生成モデル「Lyria 3.5」をリリースした

OpenAIがAPI経由で音声認識モデルGPT TranscribeとGPT Live Transcribeを公開した

OpenAIが音声文字変換モデル「GPT Transcribe」を発表した

パロアルト拠点のFish Audioは、ユーザー数800万人超、年間経常収益2100万ドルを生み出している企業で、火曜日にCoreline VenturesとCapital Todayが主導するシードラウンドで5200万…

AIニュースの要点を毎朝1分で。
無料で登録