
上海を拠点とするロボット企業AGIBOTが、マルチモーダルAIファウンデーションモデル「WITA-Omni Preview」をリリースした。このモデルはDaily-Omniベンチマークで85.21%の精度を達成し、Google、Alibaba、ByteDanceの競合製品を上回っている。
オーディオとビジュアル情報を同時に理解する能力に優れており、AGIBOTはこのスキルが音を解釈し、イベントシーケンスを追跡し、実環境での応答方法を判断する必要があるロボットにとって重要だと主張している。
AGIBOTはこの技術をロボットシステムに組み込み、人間とロボットの相互作用を改善する計画だ。
何が起きたか
AGIBOTのWITA-Omni Previewファウンデーションモデルが、Daily-Omniオーディオビジュアル推論ベンチマークで平均精度85.21%を達成し、Alibabaの Qwen3.5-Omni-Plus、GoogleのGemini 3.1 Pro Preview、ByteDanceのDoubao Seed 2.0 Liteなど競合他社を上回った。報告された8つの評価指標のうち6つで第1位または同率第1位にランクインした。
なぜ重要か
Daily-Omniベンチマークは、AIモデルが実環境でオーディオとビジュアル情報を同時に理解できるかどうかをテストするもの。AGIBOTは、ロボットが動的環境で動作する際に音と動作を関連付け、イベントのシーケンスを追跡し、いつ応答すべきかを判断する上で、この能力が不可欠だと述べている。画像テキストベンチマークとは異なり、Daily-Omniはオーディオ、ビデオ、およびそれらの組み合わせ全体でのクロスモーダル推論を評価する。
注目点
AGIBOTのWITA-Omni Previewは、リアルタイムで音声と協調した物理的動きおよび顔表情を生成する「Thinker-Talker-Actor」アーキテクチャを統合している。同社はこの技術をヒューマノイドロボット、四脚ロボットを含む自社のロボットプラットフォームに統合し、より自然な人間とロボットの相互作用を実現する計画を立てている。
AGIBOTは、そのWITA-Omni PreviewマルチモーダルファウンデーションモデルがDaily-Omniオーディオビジュアル推論ベンチマークで最高スコアを達成し、平均精度85.21%を記録したと発表した。このモデルはAlibabaのQwen3.5-Omni-Plus、GoogleのGemini 3.1 Pro Preview、ByteDanceのDoubao Seed 2.0 Liteを上回った。オーディオビジュアル対応、比較、イベントシーケンス、およびベンチマークの30秒および60秒ビデオサブセットで最高スコアを達成し、報告された8つの評価指標のうち6つで第1位または同率第1位にランクインした。推論では第1位で並んだ。
Daily-Omniは、684の実世界ビデオと1,197の多肢選択問題を含む第三者ベンチマークであり、6つのタスク カテゴリーを対象としている:オーディオビジュアル対応、イベントシーケンス、推論、推理。主に画像テキスト理解に焦点を当てたベンチマークとは異なり、Daily-Omniは、AIモデルが音を可視イベントと関連付け、状況がどのように時間とともに発展するかを理解し、複数のデータタイプ全体で推論を実行できるかどうかを評価する。AGIBOTは、動的環境で動作するロボットなどの具現化されたAIシステムにとって、誰が話しているかを判断し、音を動作と関連付け、イベントのシーケンスを追跡し、応答するかどうか、いつ、誰に応答すべきかを決定する必要があるため、これらの能力は特に重要だと述べている。
WITA-Omniは統合「Thinker-Talker-Actor」アーキテクチャを通じて差別化されている。Thinkerは多モーダル推論エンジンとして機能し、共有表現空間内でテキスト、画像、オーディオ、および結合されたオーディオビジュアル入力を処理する。Talkerはノーカーの内部状態に基づいてリアルタイムで音声を生成し、Actorは協調した物理的動きと顔表情を生成する。この統合設計により、知覚、推論、音声、動き、顔表情生成が共有モデル状態とタイムラインで動作し、ロボットが応答を準備して配信しながら周囲を継続的に観察することを可能にする。
このモデルは継続的訓練中に数千万時間のマルチモーダルデータで訓練され、テキストと画像を超えてオーディオ知覚とクロスモーダル推論を含む能力を拡張している。AGIBOTはまた、オーディオ、ビデオ、言語、身体の動き、および顔表情間の時間的関係を保持する、数千時間にわたる人間中心のマルチモーダル相互作用データセットを開発した。訓練は3段階のプロセスを使用した:教師あり微調整(マルチモーダル理解と協調出力の確立)、オンポリシー蒸留(追加のコンテキスト情報を持つ教師モデルからそれなしの学生モデルに知識を転送)、および応答精度、タイミング、対象人物選択の改善、および応答を与えるべきかどうかを判断することを含む相互作用決定の改善に焦点を当てた強化学習。同社はモデルのポリシーを最適化するためにGroup Relative Policy Optimization(GRPO)を使用した。
AGIBOTはWITA-Omni Previewがその相互作用インテリジェンスプラットフォームの基盤を形成し、操作インテリジェンスと移動インテリジェンス技術とともに開発されており、「3つのインテリジェンスが1つ」アーキテクチャの一部であると述べた。上海を拠点とする同社は、WITAファミリーのマルチモーダルモデルの開発を継続し、ヒューマノイドロボット、四脚ロボット、器用な操作システム、商用清掃ロボットを含む自社のロボットプラットフォームにこの技術を統合する計画を立てており、人間と具現化されたAI間のより自然で文脈認識された相互作用を可能にする。2026年6月、AGIBOTは15,000番目のロボットが生産ラインから完成したと発表した。
Daily-Omniに関するAGIBOTの成果は、ロボットのためのファウンデーションモデルがどのように評価されているかの転換を反映している。従来のAIベンチマークは画像テキスト理解に重点を置いているが、Daily-Omniはクロスモーダル推論、つまり音を可視イベントにリンクし、状況がどのように時間とともに発展するかを理解する能力をテストする。物理環境で動作するロボットなどの具現化されたAIシステムは複数のデータストリームを同時に解釈する必要があるため、この区別は重要である。声は聞こえるが話者と結びつけられない、あるいは周囲で展開しているイベントのシーケンスを見逃すロボットは、自然に相互作用したり安全な決定を下したりするのに苦労するだろう。
数千万時間のマルチモーダルデータで訓練し、その後数千時間の人間中心の相互作用記録で、モデルを洗練させるというAGIBOTのアプローチはこのギャップに対処している。オーディオ、ビデオ、動き、顔表情の時間的関係(タイミングと順序)に対する同社の強調は、いつどのように応答するかを学ぶことが、応答するかどうかを学ぶのと同じくらい重要であることを示唆している。これはAGIBOTの明記された設計目標と一致している:正確な応答を生成するだけでなく、適切性、タイミング、および意図した受信者を決定することである。
AIが要約して、あなたの選んだトピックだけを1日1通。LINE・Email・Slackで届きます。
登録無料・30秒で完了・いつでも解除できます
この記事についてわからないことをAIに質問できます。Q&Aはこのページに公開され、他の読者も読めます。
AIニュースの要点を毎朝1分で。
無料で登録