AIToday
大規模言語モデルAIコーディングGitHub Copilot Blog掲載日時: 2026年6月26日 10:002分で読める

GitHub Copilot のエージェント実行基盤が複数のAIモデルに対応しながら、同等のタスク完了率を維持して少ないトークン消費を実現。

LINEで送る
GitHub Copilot のエージェント実行基盤が複数のAIモデルに対応しながら、同等のタスク完了率を維持して少ないトークン消費を実現。

要点

  • GitHub Copilot の実行基盤は、20以上のフロンティアモデル(GPT、Claude、Gemini、MAI ファミリー、オープンソースモデル対応)をサポートしながら、複数の標準ベンチマーク(SWE-bench Verified、SWE-bench Pro、SkillsBench など)で同等のタスク完了率を保ちながらトークン消費を減らしていることが明らかになりました。

  • 開発者はモデルベンダーの公式ハーネスに比べて、同じ結果をより少ないトークンで達成でき、タスク特性に応じて効率か品質かを選択できるようになります。

3つのポイント

  1. 何が起きたか

    GitHub は、GitHub Copilot SDK の中核となるエージェント実行基盤(ハーネス)が、Claude Sonnet 4.6、Claude Opus 4.7、GPT-5.4、GPT-5.5 といった複数の最先端モデルに対応し、ベンチマークテストで同等のタスク完了率を実現しながらトークン消費が少ないことを実証しました。

  2. なぜ重要か

    開発者にとって、同じ処理を同等の精度で実現しながらコストを抑える選択肢が生まれます。また、複数モデルに対応する設計により、タスクごとに効率性と品質のトレードオフを自分で選べるようになるため、開発効率とコスト管理の両立が可能になる可能性があります。

  3. 注目点

    GitHub Copilot は GPT モデルで最高の費用対効果を、Claude Opus で最高の完了率を実現するなど、モデルごとに異なる特性があることが判明。TerminalBench 2.0 での分析では、GitHub Copilot の紫色のマーカーが競合ハーネスと同等または上回るポジションに位置し、実行から実行への分散は各設定の標準偏差で示されています。

この記事についてAIに質問する →

よくある質問

GitHub Copilot のエージェント実行基盤はどのモデルに対応していますか?
20以上のフロンティアモデルに対応しており、GPT、Claude、Gemini、MAI ファミリーのほか、オープンソースやローカルモデルもサポートしています。
従来のモデルベンダーのハーネスと比べて何が違いますか?
GitHub Copilot の実行基盤は、同じモデルとタスクで複数のベンチマークにおいてトークン消費が少ないうえ、複数モデルを柔軟に選択できるマルチモデル設計により、モデルベンダーの単一ハーネスでは提供できないハーネスレベルの機能(例えば Rubber Duck という複数モデル間による相互レビュー機能)が利用できます。
ベンチマークではどのような項目を評価していますか?
SWE-bench Verified(オープンソース Python リポジトリの 500 件のバグ修正タスク)、SWE-bench Pro(複雑な多段階タスク)、SkillsBench(スキル活用能力)、TerminalBench(ターミナルベース作業のパフォーマンス)、Win-Hill(Windows コンテナ内のタスク)など複数の標準およびカスタムベンチマークで評価しています。
GitHub Copilot Blog元記事を読む

「大規模言語モデル」の最新ニュースを、毎朝7時にお届けします

AIが要約して、あなたの選んだトピックだけを1日1通。LINE・Email・Slackで届きます。

登録無料・30秒で完了・いつでも解除できます

AIに質問

この記事についてわからないことをAIに質問できます。Q&Aはこのページに公開され、他の読者も読めます。

関連記事

次の記事へAnthropic、約160兆円評価で軍事利用も