AIToday
AIコーディングオープンソースAIGitHub Blog (AI)掲載日時: 2026年10月6日 1:00

GitHub、AIコードレビューBench公開

LINEで送る
GitHub、AIコードレビューBench公開

3つのポイント

  1. 何が起きたか

    GitHubは103.9 million件のGitHubプルリクエストと19言語・187リポジトリの219件をもとに構築したReviewBenchを公開した。

  2. なぜ重要か

    後に行う本番実験と同じ方向を示すオフラインのシグナルが得られるため、測定された改善がユーザーにとって意味のある向上を反映している可能性が高まる。ただし方向性を示す指標であり、保証ではないとしている。

  3. 注目点

    エージェントの能力が高まるにつれ、ベンチマークの予測精度が保たれるかどうか。

誰に効くかこれはAIコードレビューエージェントを構築または購入するエンジニアリングチームに影響する。本番導入を決める前にシステムを比較できる公開の尺度を与えるからだ。また、今後自分のエージェントをリーダーボードに提出することになるシニアエンジニアやメンテナーにも関わる。

わからないところ、AIに聞けます

質問と回答はこのページに公開されます。

こういう要約が、毎朝あなたのメールに届きます。

背景と解説

エージェント型コードレビューは、コードが出荷される前にプルリクエストを検査して問題を捉える用途でますます使われているが、チームにとって、こうしたAIレビュアーが実際にどれだけ機能するかを測るのは難しかった。既存のベンチマークはラベルの品質、網羅性、実世界での代表性の間でトレードオフになりがちだったため、GitHubは三つを兼ね備えるべくReviewBenchを構築した。このベンチマークは103.9 million件のGitHubプルリクエストを分析し、言語、リポジトリの規模、さらにはプルリクエストの規模までモデル化し、小さな単一ファイルの変更が支配的にならないよう、レビュー対象となる中間層と裾を意図的に重み付けしている。正解データは、人間のレビュアー、後続コミット、静的解析ツール、最先端LLMという複数来源のゴールデンセットから得ており、重複する指摘は統合し、すべての指摘を公開されたルーブリックに基づきLLMジャッジが検証している。データセット構築に関わっていないシニアエンジニアがすべての正解指摘を再ラベル付けし、ReviewBenchと96.6%の割合で一致した。

ベンチマークは2系統・6指標を報告する。固定のゴールデンセットに対するgrounded precision、recall、F1と、以前は知られていなかった有効な問題を挙げたエージェントを評価するaugmented precision、recall、F1である。これは重要だ。固定のゴールデンセットは、システムの能力が高まるにつれて必然的に不完全になるため、augmented指標は予期しない問題を見つけたエージェントにペナルティを与えるのを避けられる。ユーザーは結果を深刻度とカテゴリで切り分け、βパラメータを調整して網羅性を広げるかノイズを下げるかを選べ、リーダーボードもそれに応じて再ランキングされる。

GitHubはReviewBenchを使い、Copilotコードレビューを複数回のイテレーションで評価した。最近のある実験——複数の独立したモデル実行を単一のレビューに統合するマルチモデルアンサンブル——は、このベンチマークの価値を示した。ReviewBenchは適合率、再現率、コメント量の向上とレビューあたりコストの低下を予測し、その後のオンラインA/Bテストでは対応率が8.0%上昇、再現率が13.6%上昇、コメント量が61%増加、レビューあたりコストが8.0%低下した。深刻度レベルの評価も一致し、重大コメントが227%増加すると予測したのに対し、オンラインでは262%増加した。未解決の問いは、レビューエージェントが進化し固定のゴールデンセットが古くなるにつれ、この予測精度が保たれるかどうかである。今後の提出でもオフラインのシグナルが本番を追随するかが試金石となる。

よくある質問
チームはReviewBenchの結果をコードレビューツールの選定にどう活用できるか?
ReviewBenchでは結果を深刻度とカテゴリで切り分けられ、ユーザーはFβスコアのβを調整して再現率と適合率のどちらを重視するかを変えられる。リーダーボードもそれに応じて再ランキングされ、レビューの優先度に最も合うシステムの特定に役立つ。
マルチモデルアンサンブルレビューの実際の本番影響について、GitHubのA/Bテストは何を示したか?
本番の対照群と比べて、対応率は8.0%上昇、再現率は13.6%上昇、コメント量は61%増加し、レビューあたりのコストは8.0%低下した。ReviewBenchはこれらの変化の方向を予測していた。
自分のコードレビューエージェントをReviewBenchに提出するにはどうすればよいか?
ReviewBenchのウェブサイトでGitHubにサインインし、コンテナイメージと設定でエージェントを登録し、25件のプルリクエストのテストセットで実行した後、219件のプルリクエストのフル実行を行う。スコアが公開されるのは、エージェントの現在のリーダーボードスコアを上回った場合か、初めての提出の場合のみ。
GitHub Blog (AI)元記事を読む
LINEで送る

GitHub Copilot Blogも報道

あなたの仕事に関係するAIニュースを、毎朝お届けします。

業界と使っているAIツールを選ぶと、仕事に関係するニュースが毎朝届きます。

登録無料・Googleアカウントなら30秒・いつでも解除できますAITodayについて →

AIに質問

この記事についてわからないことをAIに質問できます。AIはこの記事・AIToday の過去記事・Wikipedia を読み、出典を付けて答えます。Q&Aはこのページに公開され、他の読者も読めます。

質問と回答はこのページに公開されます。

関連記事

次の記事へノルウェー、スマートグラス撮影制限へ