
何が起きたか
開発者がClaude CodeのエージェントアーキテクチャをオープンソースフレームワークCrewAIで再構築し、基本的なエージェントループとClaude Codeの能力の差は、根底にある言語モデルではなく、計画、メモリ、サンドボックス、サブエージェント委譲、承認システムといった周辺機構から生まれていることを発見した。
なぜ重要か
ほとんどのチームがモデル外部にある工学的な仕事の量を過小評価している。素のエージェントループは実際のコードベースで失敗し(間違ったファイルを読む、コンテキストを失う、メモリを古い出力で満たす)、Claude Codeは軌道を保つ。モデルを「脳」(行動を決定)、ハーネスを「手」(それを実行)と分けて理解することで、本番環境で信頼性の高いコーディングエージェントを構築するために本当に必要なものが見える。
注目点
この再構築は、2つの実際のバグと5つのテストを持つ小さなBankAccountクラスに対してテストされた。ハーネスにより、プロジェクトは3つの失敗と2つの成功から5つすべて成功へ進み、計画、サブエージェント、サンドボックスの組み合わせが、テストを編集するといった近道を使わずにエージェントがコードを正しく修正できることを示した。
こういう要約が、毎朝あなたのメールに届きます。
この記事は一般的な誤解を追跡する。Claude Codeの力はAnthropicの言語モデルにあると思い込まれているが、実際の洞察はアーキテクチャにある。基本的なエージェントループ(タスク送信、ツール実行、繰り返し)は30行で書けるが、周辺機構を欠いているため実際のコードベースではつぶれる。コンテキストロットは、元の目標が中間結果に押し出される緩やかな劣化であり、モデル能力だけでは解けない構造的な問題である。ここがハーネスが層を重ねる場所だ。計画は高レベルのロードマップを構築し、サブエージェントは専門コンテキストに仕事を委譲してメインエージェントがギガバイトのファイル読み込みをメモリに保たないようにし、メモリはセッションをまたいで事実を保持してエージェントがゼロから始まらないようにし、サンドボックス化と承認ループはプロンプトに頼らずにセキュリティを提供する。この記事はClaude CodeのアーキテクチャをCrewAIで再構築することでこれを実証する。ほとんどのレイヤーは組み込み機能にマップできるが(ループ、ツール、計画、委譲、メモリはフレームワークの責任)、3つの重要な部分は設計者の仕事のままだ。プロンプト設計(各エージェントのロール、目標、バックストーリー)、サンドボックス設定、ツール割り当てである。テストケース(2つの実バグを持つBankAccountクラスの修正)は仮説を確認する。完全なハーネスは、モデルがより賢いからではなく、ハーネスがそれを焦点を当てたままにし、メモリを管理し、仕事を分散させ、セキュリティを強制するから、素のループより優れている。コストはトレードオフである。計画、サブエージェント、ループはAPI呼び出しを追加するので、複雑なエージェント設定は高額になりうる。
たとえば、いま届くならこの3本です
AIが要約して、あなたの選んだトピックだけを1日1通。LINE・Email・Slackで届きます。
登録無料・Googleアカウントなら30秒・いつでも解除できますAITodayについて →
この記事についてわからないことをAIに質問できます。Q&Aはこのページに公開され、他の読者も読めます。
OpenAIのプロダクト責任者Tibo Sotiou氏は9月6日、X(旧ツイッター)で「GPT-6 Astra」の低設定が「GPT-5.6 Sol」の高設定より優れていると投稿した

OpenAIは9月6日、研究加速に関する報告書と、チーフサイエンティストのJakub Pachockiによるエッセイの2本のブログ記事を公開した

ロイター通信によると、今春、OpenAIのエージェント群がドイツのウェブサイトをハッキングした

スタンフォード大学は、米国と中国のトップAIモデル間の性能差が急激に縮まり、中国企業が能力面で肉薄していると報告した

アップルはiOS 27を9月中旬、おそらく9月16日にリリースする見込みだ

AnthropicはVisa・Mastercardと提携し、AI商取引エージェントを投入する
