
何が起きたか
Axiom Mathの3人が2022年式トヨタ・カローラとcomma four、openpilotを使うDrivingBenchで4モデルを走らせ、約135mのコースを完走したのはGPT-6 Astraだけで、5分22秒だった。
なぜ重要か
汎用AIが自動運転向けの訓練なしに実車を操作できる範囲と限界が、実走行で初めて具体的な数字として示されたとみられる。
注目点
カーブでの失敗はコーンの配置から正しい走行位置を読み取る「認識」が課題で、判断速度も評価対象になる。チームは試行回数を増やすDrivingBench v2を検討している。
誰に効くか自動運転やロボティクスを手がける開発・実証担当者は、汎用AIをそのまま物理機器に載せると認識と応答速度が律速になると読む必要がある。AI安全・ガバナンスの担当者には、モデルが実車と気付いて操作を拒否する挙動が運用上の新たな制約になる可能性がある。
こういう要約が、毎朝あなたのメールに届きます。
DrivingBenchは、文章生成や画像認識、プログラミングなど幅広い用途を想定した汎用AIが、現実世界の物理的な作業をどこまでこなせるかを調べるために作られた。ロボットに絵を描かせたり物体を移動させたりする近年のAIデモを見たことがきっかけで、自動運転システムの開発そのものを目的としたものではない点が特徴だ。
実験では車載デバイス「comma four」とオープンソースの運転支援ソフトウェア「openpilot」を使い、AIが「周囲を確認する」「車を動かす」「停止する」の3種類の操作を呼び出して実車に伝える構成をとった。与えられた指示は600語未満で、逆U字型の駐車場コースを進み、青色の小さなコーンで示された駐車スペースへ入るという内容だった。
完走できたモデルが限られたことに加え、実車を動かすことで一般的なベンチマークでは目立ちにくい応答速度の問題が浮かび上がった。AIが次の操作を考えている間も直前の命令で車が動き続けるため、応答が遅れるほどコースを外れる危険が高まる。マーンス氏は、ChatGPTのようなAIが今後ロボットなどを通じて物理世界へ影響を及ぼす機会が増えるとみられるため、現実世界での失敗の仕方を調べる実験にも意味があると述べている。
業界と使っているAIツールを選ぶと、毎朝7時に仕事に関係するニュースが届きます。
登録無料・Googleアカウントなら30秒・いつでも解除できますAITodayについて →
この記事についてわからないことをAIに質問できます。AIはこの記事・AIToday の過去記事・Wikipedia を読み、出典を付けて答えます。Q&Aはこのページに公開され、他の読者も読めます。
トランプ大統領とElon Musk、Mark Zuckerberg、Dario Amodei、Jensen Huang、Greg Brockman、Sundar PichaiらCEOがWhite House昼食会で自主的…

トランプ大統領とMark Zuckerberg氏、Greg Brockman氏、Jensen Huang氏、Elon Musk氏ら経営陣がホワイトハウスでAI行動規範に署名

KnowledgeSenseは9月30日、国産AIエージェントCodeSenseを数週間以内にリリースすると発表し、現在β版ユーザーを募集している

SAILはVLMで軌道を生成し、シミュレータで実行、映像から進捗を採点し、修正した軌道をアームに送る

Anthropicは2026年9月29日公表のレビューで、Z.aiのGLM-5.3がExploitBenchの410回中50回でエクスプロイトを構築したと報告

Googleは「Google for Startups AI Agents Challenge」の上位応募作から4つの設計パターンを公開
