AIToday
AIコーディングAI安全性・アラインメントHacker News掲載日時: 2026年7月26日 13:01

AIコーディングエージェントの暴走を防ぐルール集

LINEで送る
AIコーディングエージェントの暴走を防ぐルール集

3つのポイント

  1. 何が起きたか

    開発者がAIコーディング支援ツール(Claude Code、Cursor、Codex)にバグや意図しない変更を導入させないよう設計されたルールセットとプロンプトを公開した。核となる推奨事項は、プロジェクトルートにCLAUDE.mdファイルを作成し、「指定していないファイルを修正するな」「依頼されないままリファクタリングするな」といった明示的な禁止事項を記載することで、これらのツールが各セッション開始時に自動的に読み込む。

  2. なぜ重要か

    コードベースが成長するにつれ、AIアシスタントは一つの問題を修正しながら別の問題を破壊し始める。この構造的問題はプロンプト改善だけでは解決できない。このルール群は曖昧な指示(「きれいなコードを書け」)を、明確で即座に境界が引ける禁止事項で置き換えることで対処する。また、編集前にプランを示すよう要求する、作業が機能しているという主張ではなくテスト証拠を求める、プロジェクト状態を保存して変更をロールバック可能にするなどの仕組みも含まれる。

  3. 注目点

    著者は、事前に想像されたルールより実際の破壊から学んだルールの方が効果的であることを強調している。モデルが失敗するたびに、その特定の失敗をルールファイルに追加すべきだ。3~5タスクごとに新規セッションを開始し(実施内容、次のステップ、試行して放棄した事項を要約する)、コンテキストの腐食を防ぐ。STOP.txtファイルなどのキルスイッチにより、開発者は自律的に動作するエージェントを安心して放置できる。

わからないところ、AIに聞けます

こういう要約が、毎朝あなたのメールに届きます。

背景と解説

この記事は実在する問題を扱っている。AIコーディングアシスタントが1回の会話内でより有能になるにつれ、スケールでより危険になるという問題だ。著者の観察―最初の2週間の見かけ上の魔法の後、モデルが問題Aを修正しながら問題Bを破壊し始めるという観察―は、単一タスク性能と複数ファイルの一貫性の隔たりを反映している。提案されたソリューションはモデルをより良く訓練したり、より強くプロンプトしたりしようとしない代わりに、これを制約を必要とする構造的問題として扱う。

ルールフレームワークは特定の洞察に基づいている。曖昧な指示は実行境界がないから失敗するということだ。「注意して」や「きれいなコードを書け」は願いだが行動的に空である。「指定していないファイルを修正するな」という禁止事項は明確な境界があるため実行可能だ。同じ論理は5つのプロンプトにも拡張される。各プロンプトは検証の負担をモデルの自己レビュー(その想定を継承する)から外的証拠へシフトさせる。テストが合格すること、または実行前にプランが述べられることを要求することで、モデルがバグを作った同じ欠陥のある論理を用いて合理化できないチェックポイントを作成する。

著者はコンテキスト腐食も実践的な失敗モードとして識別する。長いセッションは放棄された方向と修正された間違いを蓄積し、それらはコンテキストウィンドウに留まってシグナルを腐す。解決策―3~5タスクごとに新規セッションを開始し、試行されて放棄された事項の要約をする―は、モデルが失敗したアプローチを再度提案するのを防ぐ状態リセットの形式だ。最後に、可逆性原則(エージェント実行前に状態を保存し、取り消し不可能なアクションのみをゲートする)はリスク管理の洞察である。低リスク領域ではモデルが反復するのを自由にしながら、デプロイなどの高リスク決定に対する人間のコントロールを維持する。

よくある質問
どのファイルを作成し、どこに置くか?
プロジェクトルートにCLAUDE.mdを作成する。Claude Codeはすべての会話の開始時に自動的にこれを読み込む。Cursorの場合は.cursorrules、Codex/Copilotの場合はAGENTS.mdを使用する。内容は同じだ。
ルールファイルには何を含めるべきか?
プロジェクトの1行説明、現在の状態(何が機能して何が機能していないか)、修正してはいけないファイルやフォルダとその理由を記載した「Do not touch」セクション、および「指定していないファイルを修正するな」「依頼されないままリファクタリングするな」「確信がなければ『わかりません』と言え。推測を事実として提示するな」などの明示的なルールを含める。
禁止事項が肯定的な指示より効果的な理由は?
禁止事項は明確な境界を持ち、即座に適用される。議論の余地がない。「きれいなコードを書け」といった指示には行動的な境界がないため、モデルは確実に行動を変えられない。一方「指定していないファイルについて修正するな」という禁止事項は曖昧でない。
LINEで送る

「AIコーディング」の最新ニュースを、毎朝7時にお届けします

たとえば、いま届くならこの3本です

  • llm-keys-ui 0.1、APIキー分離Simon Willison's Weblog · 13時間前
  • 高校生がC++の自動微分プロジェクトに意見募集r/MachineLearning · 22時間前
  • フィンテック、AIをCoder領域と脆弱性修正へr/MachineLearning · 1日前

AIが要約して、あなたの選んだトピックだけを1日1通。LINE・Email・Slackで届きます。

登録無料・Googleアカウントなら30秒・いつでも解除できますAITodayについて →

AIに質問

この記事についてわからないことをAIに質問できます。Q&Aはこのページに公開され、他の読者も読めます。

関連記事

次の記事へAlphabet、AI基盤構想で購買契約8110億ドル超に