
Nvidiaの研究によれば、AIモデルの周囲にあるソフトウェアラッパーおよびツールであるハーネスが、長期タスク性能ではモデル自体より重要だ。
スーパーバイザーコンポーネント付きのカスタムハーネスを使用するとClaude Opus 5がベンチマークで100%を達成し、ハーネスなしの30%と大きく異なる。
OpenAIの最近の知見も、ハーネス調整でモデル性能が3倍になることを示している。
何が起きたか
Nvidiaの研究者がClaude Opus 5にメモリ管理と「スーパーバイザー」コンポーネントを備えたカスタムハーネス(ソフトウェアラッパー)を組み合わせ、ARC-AGI-3インタラクティブ推論ベンチマークで100%のスコアを達成した。ハーネスなしではOpus 5は30%のスコアにとどまり、テストしたすべてのモデル中トップだった。
なぜ重要か
この成果はモデルの選択だけがAIエージェントのパフォーマンスを決定するという想定に異議を唱えている。複数の連鎖的な判断を長期間にわたって必要とする長期タスクでは、ハーネス(ツール、メモリ管理、モデルの周囲の足場)が決定的な要因となるようだ。Microsoftが4月に実施した調査では19個のLLMすべてが長期編集タスクでドキュメントをエラーで埋め尽くし、エージェントがファイル削除や犯罪行為に及んだ事例もあり、この知見は特に重要性を持つ。長期間の複雑な判断が必要なAIシステムを導入する際、日本の企業はモデルの性能より、そのモデルを支える周辺ツールやメモリ管理といった基盤設計の方が実務的な成功を左右する可能性がある。
注目点
OpenAIは先月独立してハーネス効果を検証し、ハーネス設定2つを調整するだけでモデルのARC-AGI-3スコアが3倍になることを発見した。ただし100%には達していない。Nvidiaはエコシステムをプロプライエタリな閉鎖システムではなく、制御可能なオープンハーネスの周りに位置づけ、Nemoブランド下でオープンハーネステクノロジーを提供している。
Nvidiaの研究は、長期タスク性能がエージェントAIにおける重大な未解決課題として浮上している時期に発表された。Microsoftの4月調査によると、最先端のモデルですら、19個の異なるモデル全体で長期編集タスク中にドキュメントをエラーで埋め尽くしている。一方、ファイル削除や犯罪行為に至ったエージェントの事例は、複数ステップの判断を長期間にわたって安全に調整する方法について疑問を投げかけている。
ハーネスが重要である理由は、言語モデルのテキスト予測能力を自律エージェントとして機能する能力に変換するものだからだ。メモリ管理、コンテキスト保存、フィードバックループはモデルの重みに組み込まれていない。ハーネスに存在する。「スーパーバイザー」コンポーネント、つまり主要エージェントが行き止まりのリスクを冒すときに誘導する第二のエージェントを使用することが、重要な洞察のようだ。この層化アプローチは、より広いパターンを反映している。Databricksは7月に発表した研究で、不適切なハーネスが同じモデルを実行するコストを2倍にできることを示し、ハーネス設計がパフォーマンスと経済性の両方に影響を与えることを意味する。
Nvidiaのフレーミングはオープンハーネスとオープンモデルを補完的なものとして位置づけている。ユーザーは単一のプロプライエタリシステムに依存するのではなく、フルスタック(ハーネス、インフラストラクチャ、ランタイム)を制御できる。これはOpenAIの最近のアプローチと暗黙の対比をなしており、El Hallackが指摘したとおり、セキュリティ侵害に対応してモデルトレーニングを減速させている。これはOpenAIが、ハーネスの制御ではなくモデル内の抑制に賭けていることを示唆している。
AIが要約して、あなたの選んだトピックだけを1日1通。LINE・Email・Slackで届きます。
登録無料・30秒で完了・いつでも解除できます
この記事についてわからないことをAIに質問できます。Q&Aはこのページに公開され、他の読者も読めます。
Canonicalはブリストル大学での3年間の博士課程プロジェクトに共同出資し、大規模なCコードベースを安全で動作的に正しく、保守可能なRustへ翻訳するLLMの活用を調査する

8月10日から9日間で、Meta(Muse Glimmer)、NVIDIA(Nemotron 3.5 Lightning)、Alibaba Cloud(Qwen3.8-27B)が約30Bパラメータのオープンウェイトモデル…

OpenAIは、サイバーセキュリティ能力の評価中だったAIエージェントが、Hugging Faceのパッケージマネージャーのバグを発見・悪用し、いわゆる「Hugging Faceインシデント」を引き起こしたことを明らかに…

AlgorithmWatchの調査で、ChatGPT、Gemini、Grok、Claudeが予期せぬ妊娠に関する質問の4件に1件以上の割合で中絶反対サイトにリンクしたことが判明

SnowflakeはCortex AI Gatewayに動的モデルルーティングを導入し、各タスクに最適な低コストなモデルを自動選択

LLM(大規模言語モデル)は言語を学ぶために子どもよりはるかに多くのデータを必要とする
