AIToday
大規模言語モデルAIコーディングITmedia AI+掲載日時: 2026年9月26日 16:00

Android Bench 2.0公開、長距離タスク通過率91%→28%に急落

LINEで送る
Android Bench 2.0公開、長距離タスク通過率91%→28%に急落

3つのポイント

  1. 何が起きたか

    Googleが2026年9月17日にAndroid Bench 2.0を公開しLong-Horizon Tasksを追加した。

  2. なぜ重要か

    AIエージェントが実務的な長期開発タスクを完遂する能力は依然として限定的であることを示す。モデル提供者は自社モデルの限界を正確に把握でき、開発チームは自社ワークフローに適合するモデルを選びやすくなる。

  3. 注目点

    Googleは今後、長距離タスク、マルチモーダル評価、エージェント環境、アースコアリングを組み合わせ、開発者が最適なAIツールを選べる環境を整える方針だ。追加モデルの評価結果が焦点となる。

誰に効くかAndroidアプリ開発チームのリードやAIエージェントを導入する情報システム部門は、長距離タスクでの通過率が低いことを踏まえ、AI導入時の期待値を調整する必要があるとみられる。

わからないところ、AIに聞けます

質問と回答はこのページに公開されます。

こういう要約が、毎朝あなたのメールに届きます。

背景と解説

GoogleはこれまでAndroid Benchや初級AIコーディングベンチマークで、小規模変更やバグ修正、機能追加といった短時間の作業を評価してきた。しかし、これでは実際のAI支援機能の性能を反映しきれないとして、Android Bench 2.0では開発者がAIに委託する時間に合わせて難易度を引き上げた。新たに追加されたLong-Horizon Tasksには、ライブラリ依存関係のアップグレード、新機能の追加、スクラッチからのアプリケーション構築、クロスプラットフォームアプリケーションのAndroid移植などが含まれ、エージェントが1週間程度を要する作業を想定している。

この変更により、従来のタスクでは最高通過率が約91%に達していたが、長距離タスクでは約28%に急落した。Googleはこの結果を受け、有意義な評価指標を提供するため「完成率(Completion Rate)」を計算するアースコアリングを採用し、機能性、UIの正確度、リグレッションの防止などを組み合わせて評価する。また、旧手順との一貫性や代表者の整合に反する場合は客観的な結論ペナルティーを適用する。これにより、モデル開発者は競合を正確に比較でき、開発チームは自社のワークフローに適合するモデルやコーディングエージェントを選びやすくなる。

Android Bench 2.0では、モデル提供者が用意するエージェントツールと組み合わせた検証も開始されている。OpenAIの「GPT 5.6 Sol」を「Codex」で実行し、Googleの「Gemini 3.8 Flash」をエージェント環境「Google Antigravity」で稼働させて検証した。実行環境の設計が開発者に与える影響は大きく、プロンプトキャッシングやツールのコンテキスト長の最適化により、トークン消費を大幅に削減できることも確認されている。リーダーボードには最新モデル群が追加され、Googleの「Gemini 3.8 Flash」「Gemini 3.7 Flash」、OpenAIの「GPT-6」、Anthropicの「Fable 5.1」、Moonshot AIの「Kimi K3」、Alibaba Cloudの「Qwen 3.8 Max」などが参加している。

Googleは今後、さまざまなモデルとエージェントツールの組み合わせによる評価結果の拡充を予定している。長距離タスク、マルチモーダル評価、エージェント環境、アースコアリングを組み合わせることで、開発者が最適なAIツールを選択できる統合的な環境を整える方針だ。このベンチマークの結果が、Android開発におけるAIエージェント導入の判断材料としてどの程度影響力を持つかが焦点となる。

よくある質問
Android Bench 2.0は何を評価しますか?
Android開発におけるAIエージェントの能力を評価する。1週間程度を要するLong-Horizon Tasksを含み、ライブラリのアップグレードや新機能追加など複雑な作業を対象とする。
最高スコアを記録したモデルは?
OpenAIの「GPT-6 Astra」が長距離タスクで最高通過率28%を記録した。
従来のベンチマークとどう違いますか?
従来は小規模変更やバグ修正、機能追加など短時間の作業を評価していたが、2.0では長距離タスクを追加し難易度を大幅に引き上げた。
ITmedia AI+元記事を読む
LINEで送る

「大規模言語モデル」の最新ニュースを、毎朝7時にお届けします

たとえば、いま届くならこの3本です

  • MetaのMuse、株価急伸Yahoo Finance AI · 1時間前
  • Microsoft、Copilotを刷新 ナデラCEO「仕事のための新しいOS」ITmedia AI+ · 7時間前
  • Salesforceが医療AI披露Top Companies AI · 11時間前

AIが要約して、あなたの選んだトピックだけを1日1通。LINE・Email・Slackで届きます。

登録無料・Googleアカウントなら30秒・いつでも解除できますAITodayについて →

AIに質問

この記事についてわからないことをAIに質問できます。AIはこの記事・AIToday の過去記事・Wikipedia を読み、出典を付けて答えます。Q&Aはこのページに公開され、他の読者も読めます。

質問と回答はこのページに公開されます。

関連記事

次の記事へNVIDIA24.9倍、Broadcom19.4倍