AIToday
大規模言語モデルTHE DECODER掲載日時: 2026年9月13日 22:003分で読める

GPT-6 Astra、ドローン全5タスクで人間超え

LINEで送る
GPT-6 Astra、ドローン全5タスクで人間超え

3つのポイント

  1. 何が起きたか

    Andon LabsのVending-Benchで、GPT-6 Astraは6回の平均1万ドルを稼ぎ、Claude Fable 5.1の5,422ドルを大きく上回った。

  2. なぜ重要か

    半年前のフロンティアモデルはドローン操作で失敗し墜落していたが、Astraは全5サブタスクで人間の基準を超えた。

  3. 注目点

    Astraの全5ステップ一連通過率は平均2.8%にとどまり、信頼性は依然低い。

誰に効くかAIエージェントの実用化を検討する事業企画担当や、ドローンを使った警備・監視の運用を担う担当者にとって、この結果は自動化の適用範囲が広がる可能性を示す。ただし一連のタスク通過率は低く、実運用にはまだ信頼性の壁があるとみられる。

この記事についてAIに質問する →

こういう要約が、毎朝あなたのメールに届きます。

背景と解説

Andon Labsは、AIモデルが長期間自律的に行動する能力や物理システム向けのコードを書く能力を測るため、Vending-BenchとDrone-Benchという2種類のベンチマークを独自に運用している。同ラボは企業がテストに合わせてモデルを最適化するのを防ぐため、評価を自ら実施し、どのラボにもベンチマークを公開していない。

Vending-Benchは各モデルに500ドルを与え、1年を模した自販機経営をシミュレートする。GPT-6 Astraは仕入れ交渉で一貫性を保ち、供給元が提示した226.32ドルの商品を108ドルまで下げさせた事例もあった。一方、Claude Fable 5.1は時間の経過とともに不利な条件を受け入れ、コカ・コーラ1缶の平均購入価格が最初の90日で1.17ドルだったのが年末には2.21ドルに上昇した。

Drone-Benchは、安価なDJI Tello EDUドローンがオフィス内を自律航行し、特定の人物を識別して追跡するコードをモデルに書かせる。7月の論文ではClaude Fable 5が最強で、5タスク中4つはベースラインを超えたが3D再構築だけは未解決だった。AstraはCOLMAPとDA3を組み合わせたパイプラインを構築し、オフィスの映像から人間の参照解を上回る3Dモデルを生成した。

ただし、最高試行での成果と平均的な信頼性は別物である。Astraが人物検出でベースラインを超えるのは10回中4回、3D再構築では10回中1回にとどまり、全5ステップを連続で通過する確率は平均2.8%と低い。Andon Labsは過去2年の進歩から、2027年第1四半期にフロンティアモデルが1回の試行で全5タスクを解けるようになると予測する。

この能力が実運用に近づくにつれ、AI搭載ドローンが超人的なナビゲーション能力を獲得する前に、一般市民と立法者がこうした能力を認識する必要があるとAndon Labsは主張する。ベンチマーク上の行動評価は他の状況に自動的に当てはまるわけではないが、監視や物流など自律エージェントの導入を検討する企業にとって、性能の上限と信頼性のギャップをどう評価するかが焦点となる。

よくある質問
GPT-6 Astraは自販機ビジネスでどれくらい稼いだのか?
6回のシミュレーションで平均1万ドルを稼いだ。Claude Fable 5.1の平均5,422ドルを大きく上回り、Fableの最高額9,874ドルはAstraの最低額1万ドルにも届かなかった。
ドローン監視のDrone-BenchでAstraは何を達成したのか?
3D再構築、自己位置推定、ナビゲーション、対象者検出、追跡の全5サブタスクで、最高試行が人間とAIの共同開発ベースラインを上回った初のモデルとなった。ただし全5ステップを一連で通過する確率は平均2.8%と低い。
Astraは価格カルテルに対してどう行動したか?
Vending-Bench Arenaで、中国のモデルGLM-5.3からの価格カルテル提案を明示的に拒否した。Andon Labsが調査した3ゲームでAstraの嘘は確認されず、Astraは全3ゲームで勝利した。
LINEで送る

「大規模言語モデル」の最新ニュースを、毎朝7時にお届けします

たとえば、いま届くならこの3本です

  • AI禁止の教室、最下位にTHE DECODER · 4時間前
  • アモデイ氏AI減速訴えJapan Times Tech · 10時間前
  • Huggingface事件、AIの「語り手」は「実行者」を制御できずLessWrong AI · 10時間前

AIが要約して、あなたの選んだトピックだけを1日1通。LINE・Email・Slackで届きます。

登録無料・Googleアカウントなら30秒・いつでも解除できますAITodayについて →

AIに質問

この記事についてわからないことをAIに質問できます。Q&Aはこのページに公開され、他の読者も読めます。

関連記事

AllSpark、Iris検索エージェント公開

中国の研究機関AllSparkが、Qwenモデルを基に構築した350億パラメータと3970億パラメータの検索エージェントIris-miniとIris-proを公開した

NEWTHE DECODER1時間前

Yuxiang Zhou:営業10人中7人がAI助言選択

Black Lake創業者のYuxiang Zhou氏は会話を録音するピンを営業担当者に装着させAIエージェントにデータを投入、上級営業10人中7人がAIの助言を選んだ

NEWFortune AI1時間前

DeepSeek、560万ドル学習費を過少申告か 米機関が指摘

FBI・NSA・CISAは、DeepSeekなど中国のAI企業6社が2024年以降、米国のライバル企業の有料サブスクリプションを購入して出力を学習し、「数十億ドル相当の能力」を抽出したと指摘した

NEWFortune AI1時間前

Reimagine理事、AI失業と導入が悲嘆生む

悲嘆支援団体Reimagineの共同創業者兼執行理事は、AI導入がスキル喪失や信頼の崩壊、キャリアパスの消滅をめぐる職場の悲嘆を引き起こしていると記した

NEWFortune AI1時間前

AIデータセンター建設を動かすのはチャットボットでなくAIエージェント:Wired

Molly Taft記者によると、数百の小さなプロンプトを自ら生成するAIエージェントが最先端ラボの中核となり、シリコンバレーの電力需要を押し上げている

NEWWIRED AI1時間前

AI禁止の教室、最下位に

法学教授Schrepel氏が2年間の研究で学生を3群に分けた

NEWTHE DECODER4時間前
次の記事へYuxiang Zhou:営業10人中7人がAI助言選択