
何が起きたか
Googleが2026年9月17日にAndroid Bench 2.0を公開しLong-Horizon Tasksを追加した。
なぜ重要か
AIエージェントが実務的な長期開発タスクを完遂する能力は依然として限定的であることを示す。モデル提供者は自社モデルの限界を正確に把握でき、開発チームは自社ワークフローに適合するモデルを選びやすくなる。
注目点
Googleは今後、長距離タスク、マルチモーダル評価、エージェント環境、アースコアリングを組み合わせ、開発者が最適なAIツールを選べる環境を整える方針だ。追加モデルの評価結果が焦点となる。
誰に効くかAndroidアプリ開発チームのリードやAIエージェントを導入する情報システム部門は、長距離タスクでの通過率が低いことを踏まえ、AI導入時の期待値を調整する必要があるとみられる。
こういう要約が、毎朝あなたのメールに届きます。
GoogleはこれまでAndroid Benchや初級AIコーディングベンチマークで、小規模変更やバグ修正、機能追加といった短時間の作業を評価してきた。しかし、これでは実際のAI支援機能の性能を反映しきれないとして、Android Bench 2.0では開発者がAIに委託する時間に合わせて難易度を引き上げた。新たに追加されたLong-Horizon Tasksには、ライブラリ依存関係のアップグレード、新機能の追加、スクラッチからのアプリケーション構築、クロスプラットフォームアプリケーションのAndroid移植などが含まれ、エージェントが1週間程度を要する作業を想定している。
この変更により、従来のタスクでは最高通過率が約91%に達していたが、長距離タスクでは約28%に急落した。Googleはこの結果を受け、有意義な評価指標を提供するため「完成率(Completion Rate)」を計算するアースコアリングを採用し、機能性、UIの正確度、リグレッションの防止などを組み合わせて評価する。また、旧手順との一貫性や代表者の整合に反する場合は客観的な結論ペナルティーを適用する。これにより、モデル開発者は競合を正確に比較でき、開発チームは自社のワークフローに適合するモデルやコーディングエージェントを選びやすくなる。
Android Bench 2.0では、モデル提供者が用意するエージェントツールと組み合わせた検証も開始されている。OpenAIの「GPT 5.6 Sol」を「Codex」で実行し、Googleの「Gemini 3.8 Flash」をエージェント環境「Google Antigravity」で稼働させて検証した。実行環境の設計が開発者に与える影響は大きく、プロンプトキャッシングやツールのコンテキスト長の最適化により、トークン消費を大幅に削減できることも確認されている。リーダーボードには最新モデル群が追加され、Googleの「Gemini 3.8 Flash」「Gemini 3.7 Flash」、OpenAIの「GPT-6」、Anthropicの「Fable 5.1」、Moonshot AIの「Kimi K3」、Alibaba Cloudの「Qwen 3.8 Max」などが参加している。
Googleは今後、さまざまなモデルとエージェントツールの組み合わせによる評価結果の拡充を予定している。長距離タスク、マルチモーダル評価、エージェント環境、アースコアリングを組み合わせることで、開発者が最適なAIツールを選択できる統合的な環境を整える方針だ。このベンチマークの結果が、Android開発におけるAIエージェント導入の判断材料としてどの程度影響力を持つかが焦点となる。
たとえば、いま届くならこの3本です
AIが要約して、あなたの選んだトピックだけを1日1通。LINE・Email・Slackで届きます。
登録無料・Googleアカウントなら30秒・いつでも解除できますAITodayについて →
この記事についてわからないことをAIに質問できます。AIはこの記事・AIToday の過去記事・Wikipedia を読み、出典を付けて答えます。Q&Aはこのページに公開され、他の読者も読めます。
MetaのMuseエージェント展開が、エージェント型AIの計算需要増加を背景にした数日間の株価上昇をさらに延長した

Microsoftは9月25日にCopilotを刷新し、Home・Code・Autopilotの3タブとWord・Excel・PowerPointを組むOffice in Copilotを提供する

OpenAIのコーディングツール「Codex」が、9月26日午前8時前からウェブ、API、CLI、VS Code拡張機能の全機能で障害

Dreamforce 2026でSalesforceは医療向けエージェント企業を提示し、UCLA Healthの6カ月で75,000件超の患者対応と4.6/5評価、Select Healthの資格認定を最短6カ月から6日…

GitHubは/create-canvasスキルで作る「キャンバス」の詳細を公開

Carter Leffen氏がOpenAIのAstraに未解読のエニグマ暗号文の探索と解読を依頼し、2005年以来研究者を悩ませてきた平文を復元
