
何が起きたか
Andon LabsのVending-Benchで、GPT-6 Astraは6回の平均1万ドルを稼ぎ、Claude Fable 5.1の5,422ドルを大きく上回った。
なぜ重要か
半年前のフロンティアモデルはドローン操作で失敗し墜落していたが、Astraは全5サブタスクで人間の基準を超えた。
注目点
Astraの全5ステップ一連通過率は平均2.8%にとどまり、信頼性は依然低い。
誰に効くかAIエージェントの実用化を検討する事業企画担当や、ドローンを使った警備・監視の運用を担う担当者にとって、この結果は自動化の適用範囲が広がる可能性を示す。ただし一連のタスク通過率は低く、実運用にはまだ信頼性の壁があるとみられる。
こういう要約が、毎朝あなたのメールに届きます。
Andon Labsは、AIモデルが長期間自律的に行動する能力や物理システム向けのコードを書く能力を測るため、Vending-BenchとDrone-Benchという2種類のベンチマークを独自に運用している。同ラボは企業がテストに合わせてモデルを最適化するのを防ぐため、評価を自ら実施し、どのラボにもベンチマークを公開していない。
Vending-Benchは各モデルに500ドルを与え、1年を模した自販機経営をシミュレートする。GPT-6 Astraは仕入れ交渉で一貫性を保ち、供給元が提示した226.32ドルの商品を108ドルまで下げさせた事例もあった。一方、Claude Fable 5.1は時間の経過とともに不利な条件を受け入れ、コカ・コーラ1缶の平均購入価格が最初の90日で1.17ドルだったのが年末には2.21ドルに上昇した。
Drone-Benchは、安価なDJI Tello EDUドローンがオフィス内を自律航行し、特定の人物を識別して追跡するコードをモデルに書かせる。7月の論文ではClaude Fable 5が最強で、5タスク中4つはベースラインを超えたが3D再構築だけは未解決だった。AstraはCOLMAPとDA3を組み合わせたパイプラインを構築し、オフィスの映像から人間の参照解を上回る3Dモデルを生成した。
ただし、最高試行での成果と平均的な信頼性は別物である。Astraが人物検出でベースラインを超えるのは10回中4回、3D再構築では10回中1回にとどまり、全5ステップを連続で通過する確率は平均2.8%と低い。Andon Labsは過去2年の進歩から、2027年第1四半期にフロンティアモデルが1回の試行で全5タスクを解けるようになると予測する。
この能力が実運用に近づくにつれ、AI搭載ドローンが超人的なナビゲーション能力を獲得する前に、一般市民と立法者がこうした能力を認識する必要があるとAndon Labsは主張する。ベンチマーク上の行動評価は他の状況に自動的に当てはまるわけではないが、監視や物流など自律エージェントの導入を検討する企業にとって、性能の上限と信頼性のギャップをどう評価するかが焦点となる。
たとえば、いま届くならこの3本です
AIが要約して、あなたの選んだトピックだけを1日1通。LINE・Email・Slackで届きます。
登録無料・Googleアカウントなら30秒・いつでも解除できますAITodayについて →
この記事についてわからないことをAIに質問できます。Q&Aはこのページに公開され、他の読者も読めます。
中国の研究機関AllSparkが、Qwenモデルを基に構築した350億パラメータと3970億パラメータの検索エージェントIris-miniとIris-proを公開した

Black Lake創業者のYuxiang Zhou氏は会話を録音するピンを営業担当者に装着させAIエージェントにデータを投入、上級営業10人中7人がAIの助言を選んだ

FBI・NSA・CISAは、DeepSeekなど中国のAI企業6社が2024年以降、米国のライバル企業の有料サブスクリプションを購入して出力を学習し、「数十億ドル相当の能力」を抽出したと指摘した

悲嘆支援団体Reimagineの共同創業者兼執行理事は、AI導入がスキル喪失や信頼の崩壊、キャリアパスの消滅をめぐる職場の悲嘆を引き起こしていると記した

Molly Taft記者によると、数百の小さなプロンプトを自ら生成するAIエージェントが最先端ラボの中核となり、シリコンバレーの電力需要を押し上げている

法学教授Schrepel氏が2年間の研究で学生を3群に分けた
