
イリノイ大学アーバナ・シャンペーン校、Meta、Stanfordの研究者が、AIエージェントがコードを推論・実行・協調作業の基盤として使うと主張する論文を発表。ソフトウェア層(「harness」と呼ぶ)がモデルを言語処理から自律的に動作するエージェントに変えると指摘。
harness層はツール、インターフェース、サンドボックス実行環境、メモリ、テスト、権限設定、実行ループ、フィードバックチャネルを含む。コードは実行可能、追跡可能、ステップをまたいで持続するため、モデルの出力を検証可能な操作に変換する。
Anthropic、OpenAI、DeepSeekなど複数の企業がこのパターンを実装。例えばAnthropicのClaude Codeはローカルターミナル、開発環境、ブラウザを統合し、エージェントがファイル編集やコマンド実行時に権限ルールに従う必要がある。DeepSeekは同様の「Harness」チーム を北京に設立。
研究者は現在のテスト基準では不十分と指摘。テストが不完全な場合があり、GUIエージェント向けのテストは悪い中間ステップを見落とす可能性があり、シミュレータは物理的リスクを隠蔽する危険があると述べている。
たとえば、いま届くならこの3本です
AIが要約して、あなたの選んだトピックだけを1日1通。LINE・Email・Slackで届きます。
登録無料・30秒で完了・いつでも解除できますAITodayについて →
この記事についてわからないことをAIに質問できます。Q&Aはこのページに公開され、他の読者も読めます。
ウォルマートはオピオイド調剤に関する請求を5000万ドルで和解した

CrowdStrikeはAIディテクション&レスポンス(AIDR)分野の主力製品として、AIエージェントを保護するFalcon Guardianを発表した

AT&T、Dell Technologies、AMDが、通信業界向けとして最大かつ最高性能のオープンソースモデル「OTel 2.0」を発表した

AT&Tの法務部門が「Legal Edge」という社内センターを設置

SonyとWarner系の音楽出版社がAnthropicを提訴し、歴史上最大級の知的財産権侵害だとして訴えた

AnthropicはClaude Fable 5.1とMythos 5.1を公開
