AIToday
大規模言語モデルロボティクスTHE DECODER掲載日時: 2026年10月6日 4:00

Reka AI、単一モデルRho-1公開

LINEで送る
Reka AI、単一モデルRho-1公開

3つのポイント

  1. 何が起きたか

    Reka AIが19-billion-parameterのomni-model「Rho-1」の研究プレビューを公開した。

  2. なぜ重要か

    多くのAIシステムは専門モデルにタスクを振り分けるが、Rho-1は全モダリティを共有コンテキストウィンドウ内のトークンとして扱い、ツール呼び出しや外部モデルを必要としない点が特徴とみられる。

  3. 注目点

    ロボット訓練データの不足を、通常のインターネット動画から制御信号を抽出するinverse dynamics modelで補った。同じ重みがカメラ画像の予測とロボットの動きの両方を担う。

誰に効くかマルチモーダルAIの導入を検討する企業の技術選定担当や、ロボット制御と生成AIを組み合わせたい製造・物流の研究開発部門に影響しうる。単一モデルで複数モダリティを扱えれば、システム構成や運用コストの見直しにつながる可能性がある。

わからないところ、AIに聞けます

質問と回答はこのページに公開されます。

こういう要約が、毎朝あなたのメールに届きます。

背景と解説

Reka AIはマルチモーダルAIの分野で以前から取り組んできた。2024年4月には、ベンチマークでGPT-4、Claude 3、Gemini Ultraと競合するマルチモーダル言語モデル「Reka Core」を投入している。今回のRho-1の公開は、AI研究におけるいわゆるworld modelsへの広い流れに沿うものだ。

Rho-1は19-billion-parameterのomni-modelで、テキスト、画像、動画、ロボット制御アクションを単一のニューラルネットワークで処理・生成する。多くのAIシステムが専門モデルにタスクを振り分けるのに対し、Rho-1は全モダリティを共有コンテキストウィンドウ内のトークンとして扱い、ツール呼び出しや外部モデルを必要としない。動画をリアルタイムで生成し、再起動なしに新しい指示へその場で応答する点も特徴だ。

ロボット制御への応用では、同じ重みがカメラ画像の予測とロボットの動きの両方を担う。ロボット訓練データの不足を補うため、通常のインターネット動画から制御信号を抽出するinverse dynamics modelを構築した。訓練には320 H100 GPUsを約3ヶ月使用している。

この研究プレビューが実運用にどこまで耐えるかは、リアルタイム生成の品質やロボット制御の精度次第とみられる。単一モデルで複数モダリティを扱う設計は、システム構成の簡素化を狙う企業にとって関心の的になりそうだ。

よくある質問
Rho-1は何ができますか?
テキスト、画像、動画、ロボット制御アクションを単一のニューラルネットワークで処理・生成する。動画をリアルタイム生成し、再起動なしに新しい指示へその場で応答する。
他のAIシステムと何が違いますか?
多くのAIシステムは専門モデルにタスクを振り分けるが、Rho-1は全モダリティを共有コンテキストウィンドウ内のトークンとして扱い、ツール呼び出しや外部モデルを使わない。
ロボット訓練データはどう集めましたか?
ロボット訓練データの不足に対応するため、通常のインターネット動画から制御信号を抽出するinverse dynamics modelを構築した。同じ重みがカメラ画像の予測とロボットの動きを担う。
LINEで送る

あなたの仕事に関係するAIニュースを、毎朝お届けします。

業界と使っているAIツールを選ぶと、仕事に関係するニュースが毎朝届きます。

登録無料・Googleアカウントなら30秒・いつでも解除できますAITodayについて →

AIに質問

この記事についてわからないことをAIに質問できます。AIはこの記事・AIToday の過去記事・Wikipedia を読み、出典を付けて答えます。Q&Aはこのページに公開され、他の読者も読めます。

質問と回答はこのページに公開されます。

関連記事

次の記事へFCCのロボット規制、AIを機械側へ