
何が起きたか
StationeryBenchでOpenAIのGPT-6 Astraは100件中7件の双腕ロボットタスクを完全に完了したが、Ai2のMolmoAct2は0件で、200回の試行における進捗スコアの中央値は100点中46点と12点だった。
なぜ重要か
研究者Yoav Artzi氏はAstraを「空間推論における段階的な変化」と呼び、未公開のREMAPベンチマークでは人間レベルに近い精度に達するが、Artzi氏はAstraが他の場面では依然として人間に及ばないと指摘する。
注目点
Artzi氏はOpenAIがBlenderシーンなど大量の3DデータでAstraを学習させたと推測しており、それが3Dタスクでの向上を説明するだろう。結果、動画、コードはGitHubで公開されている。
誰に効くか双腕マニピュレーションを評価するロボティクスおよび身体性AIのチームは、StationeryBenchを空間推論の新たな基準点として扱う可能性が高いが、このベンチマークは5つの机上文具タスクしか対象としていない。
こういう要約が、毎朝あなたのメールに届きます。
StationeryBenchは初期の小規模なテストだが、そこで示された差は歴然としている。同じ双腕YAMロボットによる200回の試行で、OpenAIのGPT-6 Astraは100件中7件のタスクを完了し、Ai2のMolmoAct2は1件も完了しなかった。Astraの進捗スコアの中央値は100点中46点で、MolmoAct2の12点と比べると、違いはタスクを完了するかどうかだけでなく、各モデルがどこまでタスクに近づくかにもあることがうかがえる。
ベンチマーク自体は、マーカーのキャップを外す、クリップを注ぎ出す、2本のロボットアーム間で定規を渡すという5つの机上文具タスクしか対象としておらず、操作のごく一部に過ぎない。それでも、結果はGitHubで公開された動画とコードを伴い、独自の消費者向けロボットを構築するというOpenAIの公表済みの長期計画に続くものであり、同社のモデルがテキストや画像の外でどう機能するかを示す初期の兆候となる。
外部の研究者Yoav Artzi氏の「空間推論における段階的な変化」という表現は、まだ未公開のREMAPベンチマークに一部基づいており、そこではAstraが人間レベルに近い精度に達する。Artzi氏自身の「ASTRAでさえ、他のシナリオで人間がすることには及ばない」という留保と、OpenAIがBlenderシーンなど大量の3Dデータで学習したという同氏の推測は、この成果がどれだけ汎用的か、3D中心の学習にどれだけ結び付いているかにかかっていることを示唆している。
たとえば、いま届くならこの3本です
AIが要約して、あなたの選んだトピックだけを1日1通。LINE・Email・Slackで届きます。
登録無料・Googleアカウントなら30秒・いつでも解除できますAITodayについて →
この記事についてわからないことをAIに質問できます。Q&Aはこのページに公開され、他の読者も読めます。
Nvidiaの最新決算説明会でCEOのJensen Huang氏は、先月AIが変曲点を迎え、現在のAIの大半はエージェント型になったと述べた

NvidiaがAnthropicの1000億ドルのIPOを、評価額約2兆ドルで中核投資すべく協議中と報じられた

KAISTとNaver AI Labの研究で、抽出・分解・公式想起・演繹・計算といった推論操作が、Qwen2.5-7B、Qwen3-8B、Gemma4-31Bの内部表現で識別でき、中間層でピークに達する

Reutersによると、NvidiaはAnthropicが計画するIPOで最大100億ドルを基幹投資家として出資する交渉中で、公開前に株式を確保する

OpenAIのEric Provencher氏はGPT-6 Astraへの切り替え時にスキル、AGENTS.md、タスクプロンプトを見直すよう推奨した

Anthropic CEOのダリオ・アモデイ氏がフロンティアAIの進歩を遅らせる3段階計画を提唱する論文を公開し、独立評価者に従業員並みの恒久的アクセスを一方的に付与すると表明した
