
何が起きたか
差分85件に対し99回のレビューを行い、確定した重大な指摘138件のうち72件は1本のレーンだけが指摘した。code-reviewが同時に検出した重大な指摘は100件中7件だった。
なぜ重要か
1本のレーンしか見つけられない重大な指摘が半数以上を占め、観点を分けて実行すること自体に意味があるとみられる。
注目点
1回あたりの消費tokenは約140〜150万でcode-reviewの約9倍。行数だけでは切り分けできず、何に触るかで判断すべきと筆者は指摘する。
誰に効くかコードレビューを運用する開発チームのリードやエンジニアリングマネージャーは、敵対的レビューの導入判断と、どのPRに適用するかの基準づくりを迫られる。
こういう要約が、毎朝あなたのメールに届きます。
敵対的レビューは、AIエージェントにコードレビューをさせる手法のひとつとして広まっている。差分を通常どおりレビューするだけでなく、「この変更で誤った結果やエラーを起こす入力や状況は何か」を探す役割のエージェントを別に立て、両者の指摘を実コードで確かめてから確定させる方式である。筆者のチームでも導入しているが、時間とtokenのコストが高く、細かい指摘を捌く運用の負担も大きいことから、実務でどの程度役立つかを自分の手元のデータで確かめることにした。
検証ではClaude Codeのskillとして敵対的レビューを自前で用意し、正統・敵対・役割の3系統8本のレーンを並列に実行した。指摘は本体のエージェントが実コードで確かめ、判定が割れた論点は別のClaudeのモデル(Claude Fable 5)にまとめて送って判定させた。交差検証を通った指摘は確定の前にYAGNIレーンで再チェックし、実害を示せないものを棄却または降格した。
9回のレビューのうち、Fableに判定を依頼したのは31回で計64件。内訳は問題あり26件、問題なし27件、降格7件、その他4件だった。確定した357件のうちSuggestionとNitが207件を占める一方、各レーンが指摘した段階では1,413件あり、確定しなかった1,056件の棄却にも交差検証の時間とtokenがかかる。敵対的レビューを入れるとレビューと自動修正のループで指摘が収束しにくくなる傾向も強まるため、YAGNIレーンや指摘の帰属の分離、周回の打ち切り条件の固定といった工夫が必要になる。
筆者は、行数だけで適用範囲を切り分けることはできないとし、データの更新、計算ロジック、認可まわりなど何に触るかを基準にすべきだと結論づけている。導入を検討するチームにとっては、検出力とコストのどちらをどこで優先するかの線引きが焦点になるとみられる。
業界と使っているAIツールを選ぶと、仕事に関係するニュースが毎朝届きます。
登録無料・Googleアカウントなら30秒・いつでも解除できますAITodayについて →
この記事についてわからないことをAIに質問できます。AIはこの記事・AIToday の過去記事・Wikipedia を読み、出典を付けて答えます。Q&Aはこのページに公開され、他の読者も読めます。
AIのAtaraxosが、Strategoで最も実績のあるNiemeijerを3週間で実効勝率85%で破った

山田喜三郎氏が論理IDE「LogicStudio」、そのチェッカー「LLint」、.worldモデル形式「.wm」を構想

Cocos2d-x 3.17.2のC++とLuaを無改変で動かし、Cocos2d-x API互換ランタイムをUnreal Engine 5.8上に構築

開発者がJevをCloudflare Workers AIで実行し、架空求人30件で法定労働条件14項目を判定

Zennの記事が、話した内容から要件定義書(SPEC.md)と実装計画(PLAN.md)を仕上げるClaude専用のAIスキル「requirements-interview」を解説した

著者がClaude Code 2.1.170と2.1.278で6条件ずつ計12試行を実施し、@AGENTS.md取り込みは両版でA・Cを返したが、AGENTS.md単独配置は両版ともNONEだった
