AIToday
大規模言語モデルロボティクスTHE DECODER掲載日時: 2026年9月13日 1:003分で読める

GPT-6がMolmoAct2に7対0

LINEで送る
GPT-6がMolmoAct2に7対0

3つのポイント

  1. 何が起きたか

    StationeryBenchでOpenAIのGPT-6 Astraは100件中7件の双腕ロボットタスクを完全に完了したが、Ai2のMolmoAct2は0件で、200回の試行における進捗スコアの中央値は100点中46点と12点だった。

  2. なぜ重要か

    研究者Yoav Artzi氏はAstraを「空間推論における段階的な変化」と呼び、未公開のREMAPベンチマークでは人間レベルに近い精度に達するが、Artzi氏はAstraが他の場面では依然として人間に及ばないと指摘する。

  3. 注目点

    Artzi氏はOpenAIがBlenderシーンなど大量の3DデータでAstraを学習させたと推測しており、それが3Dタスクでの向上を説明するだろう。結果、動画、コードはGitHubで公開されている。

誰に効くか双腕マニピュレーションを評価するロボティクスおよび身体性AIのチームは、StationeryBenchを空間推論の新たな基準点として扱う可能性が高いが、このベンチマークは5つの机上文具タスクしか対象としていない。

この記事についてAIに質問する →

こういう要約が、毎朝あなたのメールに届きます。

背景と解説

StationeryBenchは初期の小規模なテストだが、そこで示された差は歴然としている。同じ双腕YAMロボットによる200回の試行で、OpenAIのGPT-6 Astraは100件中7件のタスクを完了し、Ai2のMolmoAct2は1件も完了しなかった。Astraの進捗スコアの中央値は100点中46点で、MolmoAct2の12点と比べると、違いはタスクを完了するかどうかだけでなく、各モデルがどこまでタスクに近づくかにもあることがうかがえる。

ベンチマーク自体は、マーカーのキャップを外す、クリップを注ぎ出す、2本のロボットアーム間で定規を渡すという5つの机上文具タスクしか対象としておらず、操作のごく一部に過ぎない。それでも、結果はGitHubで公開された動画とコードを伴い、独自の消費者向けロボットを構築するというOpenAIの公表済みの長期計画に続くものであり、同社のモデルがテキストや画像の外でどう機能するかを示す初期の兆候となる。

外部の研究者Yoav Artzi氏の「空間推論における段階的な変化」という表現は、まだ未公開のREMAPベンチマークに一部基づいており、そこではAstraが人間レベルに近い精度に達する。Artzi氏自身の「ASTRAでさえ、他のシナリオで人間がすることには及ばない」という留保と、OpenAIがBlenderシーンなど大量の3Dデータで学習したという同氏の推測は、この成果がどれだけ汎用的か、3D中心の学習にどれだけ結び付いているかにかかっていることを示唆している。

よくある質問
StationeryBenchとは何か?
マーカーのキャップを外す、2本のロボットアーム間で定規を渡すなど、5つの机上文具タスクでモデルを試す新しいロボティクスベンチマークで、双腕YAMロボットを使い200回の試行を行う。
GPT-6 AstraとMolmoAct2の比較は?
Astraは100件中7件のタスクを完全に完了し、MolmoAct2は0件だった。進捗スコアの中央値では、Astraが100点中46点に達したのに対し、MolmoAct2は12点だった。
なぜAstraは3Dタスクが得意に見えるのか?
研究者Yoav Artzi氏は、OpenAIがBlenderシーンなど大量の3Dデータでモデルを学習させたと推測している。
LINEで送る

「大規模言語モデル」の最新ニュースを、毎朝7時にお届けします

たとえば、いま届くならこの3本です

  • Nvidia、次は従業員4万人にエージェント400万体Yahoo Finance AI · 1時間前
  • Nvidia、Anthropicに1000億ドル投資協議Yahoo Finance AI · 1時間前
  • KAIST、AI推論段階の分離可能と判明THE DECODER · 1時間前

AIが要約して、あなたの選んだトピックだけを1日1通。LINE・Email・Slackで届きます。

登録無料・Googleアカウントなら30秒・いつでも解除できますAITodayについて →

AIに質問

この記事についてわからないことをAIに質問できます。Q&Aはこのページに公開され、他の読者も読めます。

関連記事

Nvidia、次は従業員4万人にエージェント400万体

Nvidiaの最新決算説明会でCEOのJensen Huang氏は、先月AIが変曲点を迎え、現在のAIの大半はエージェント型になったと述べた

NEWYahoo Finance AI1時間前

Nvidia、Anthropicに1000億ドル投資協議

NvidiaがAnthropicの1000億ドルのIPOを、評価額約2兆ドルで中核投資すべく協議中と報じられた

NEWYahoo Finance AI1時間前

KAIST、AI推論段階の分離可能と判明

KAISTとNaver AI Labの研究で、抽出・分解・公式想起・演繹・計算といった推論操作が、Qwen2.5-7B、Qwen3-8B、Gemma4-31Bの内部表現で識別でき、中間層でピークに達する

NEWTHE DECODER1時間前

Nvidia、Anthropicの過去最大2兆ドルIPOで基幹投資家交渉

Reutersによると、NvidiaはAnthropicが計画するIPOで最大100億ドルを基幹投資家として出資する交渉中で、公開前に株式を確保する

NEWTHE DECODER1時間前

OpenAI、GPT-6でガードレール削減推奨

OpenAIのEric Provencher氏はGPT-6 Astraへの切り替え時にスキル、AGENTS.md、タスクプロンプトを見直すよう推奨した

NEWTHE DECODER1時間前

アモデイ氏、AI減速を訴え 評価者に常時アクセス

Anthropic CEOのダリオ・アモデイ氏がフロンティアAIの進歩を遅らせる3段階計画を提唱する論文を公開し、独立評価者に従業員並みの恒久的アクセスを一方的に付与すると表明した

NEWFortune AI1時間前
次の記事へアモデイ氏、AI減速を訴え 評価者に常時アクセス