AIToday
大規模言語モデルAIコーディングDaily Dose of Data Science掲載日時: 2026年7月20日 4:004分で読める

Claude Codeの真の強みはハーネス

LINEで送る
Claude Codeの真の強みはハーネス

3つのポイント

  1. 何が起きたか

    開発者がClaude CodeのエージェントアーキテクチャをオープンソースフレームワークCrewAIで再構築し、基本的なエージェントループとClaude Codeの能力の差は、根底にある言語モデルではなく、計画、メモリ、サンドボックス、サブエージェント委譲、承認システムといった周辺機構から生まれていることを発見した。

  2. なぜ重要か

    ほとんどのチームがモデル外部にある工学的な仕事の量を過小評価している。素のエージェントループは実際のコードベースで失敗し(間違ったファイルを読む、コンテキストを失う、メモリを古い出力で満たす)、Claude Codeは軌道を保つ。モデルを「脳」(行動を決定)、ハーネスを「手」(それを実行)と分けて理解することで、本番環境で信頼性の高いコーディングエージェントを構築するために本当に必要なものが見える。

  3. 注目点

    この再構築は、2つの実際のバグと5つのテストを持つ小さなBankAccountクラスに対してテストされた。ハーネスにより、プロジェクトは3つの失敗と2つの成功から5つすべて成功へ進み、計画、サブエージェント、サンドボックスの組み合わせが、テストを編集するといった近道を使わずにエージェントがコードを正しく修正できることを示した。

この記事についてAIに質問する →

こういう要約が、毎朝あなたのメールに届きます。

背景と解説

この記事は一般的な誤解を追跡する。Claude Codeの力はAnthropicの言語モデルにあると思い込まれているが、実際の洞察はアーキテクチャにある。基本的なエージェントループ(タスク送信、ツール実行、繰り返し)は30行で書けるが、周辺機構を欠いているため実際のコードベースではつぶれる。コンテキストロットは、元の目標が中間結果に押し出される緩やかな劣化であり、モデル能力だけでは解けない構造的な問題である。ここがハーネスが層を重ねる場所だ。計画は高レベルのロードマップを構築し、サブエージェントは専門コンテキストに仕事を委譲してメインエージェントがギガバイトのファイル読み込みをメモリに保たないようにし、メモリはセッションをまたいで事実を保持してエージェントがゼロから始まらないようにし、サンドボックス化と承認ループはプロンプトに頼らずにセキュリティを提供する。この記事はClaude CodeのアーキテクチャをCrewAIで再構築することでこれを実証する。ほとんどのレイヤーは組み込み機能にマップできるが(ループ、ツール、計画、委譲、メモリはフレームワークの責任)、3つの重要な部分は設計者の仕事のままだ。プロンプト設計(各エージェントのロール、目標、バックストーリー)、サンドボックス設定、ツール割り当てである。テストケース(2つの実バグを持つBankAccountクラスの修正)は仮説を確認する。完全なハーネスは、モデルがより賢いからではなく、ハーネスがそれを焦点を当てたままにし、メモリを管理し、仕事を分散させ、セキュリティを強制するから、素のループより優れている。コストはトレードオフである。計画、サブエージェント、ループはAPI呼び出しを追加するので、複雑なエージェント設定は高額になりうる。

よくある質問
素のエージェントループが失敗するときに、Claude Codeはどうして軌道を保つのか?
素のループは十分なツール呼び出しとファイル読み込みがコンテキストウィンドウを満たすと、元の目標を失う。これはコンテキストロットと呼ばれる問題である。Claude Codeは計画(コンテキストに保持されるステップバイステップのロードマップ)、サブエージェント(独立したコンテキストで特定のタスクを専門エージェントに委譲)、メモリ(セッションをまたいで運ばれる事実)を追加することで、エージェントを長期実行タスクに固定したままにする。
Claude Codeはシェルアクセスでセキュリティをどう扱うのか?
2つのレイヤーがある。機密性の高いアクションに承認を要求する権限システムと、承認されたコマンドでさえホストマシンに触れられないように実行を隔離するサンドボックスである。Anthropicは同じアプローチを取り、破壊的なコマンドを防ぐためにプロンプトに依存するのではなく、コード実行をサンドボックス(セッションごとに新しいVMをスピンアップするE2Bなど)に移す。
テスト再構築は何を証明したのか?
ハーネスはBankAccountクラスプロジェクトを3つの失敗と2つの成功テストから5つすべて成功に進めた。実装のみを修正し、失敗したテストを編集または削除せず、Anthropicが社内でコーディングエージェントを評価する方法を反映している。
Daily Dose of Data Science元記事を読む
LINEで送る

「大規模言語モデル」の最新ニュースを、毎朝7時にお届けします

たとえば、いま届くならこの3本です

  • OpenAI、GPT-6 Astra低設定がGPT-5.6 Sol高設定に勝ると主張ITmedia AI+ · 6時間前
  • OpenAI、エージェントで研究3.1倍速ITmedia AI+ · 9時間前
  • OpenAIエージェントが独サイトへ攻撃、非公表Semafor Tech · 9時間前

AIが要約して、あなたの選んだトピックだけを1日1通。LINE・Email・Slackで届きます。

登録無料・Googleアカウントなら30秒・いつでも解除できますAITodayについて →

AIに質問

この記事についてわからないことをAIに質問できます。Q&Aはこのページに公開され、他の読者も読めます。

関連記事

次の記事へAI導入失敗の原因はデータ品質、モデルではない