
Nvidiaの研究により、AIモデルを包む仕様「ハーネス」が長期タスクではモデル自体より重要であることが判明した。
ハーネスに監督エージェントを追加し、Claude Opus 5は推論ベンチマークで30%から100%に向上した。
OpenAIの同様の調整は3倍にとどまった。
何が起きたか
Nvidiaの研究チームがカスタムハーネスに「スーパーバイザー」コンポーネントを追加し、Claude Opus 5をARC-AGI-3インタラクティブ推論ベンチマークで100%のスコアを獲得させた。ハーネスなしでは同じモデルが30%だった。ハーネスはAIモデルを包む仕組みで、ツール、メモリ管理、独立行動を可能にするルールで構成される。
なぜ重要か
この発見は、長期タスク(時間にわたり多くの意思決定の連鎖が必要)ではAIモデル自体の知能が最も重要という前提に異議を唱えている。Databricksの7月の研究では、同じモデルを使ってもハーネスの選択でコストが2倍になることが示された。つまり企業は間違ったレイヤーを最適化している可能性がある。またNvidiaの結果はOpenAIが苦労した弱点に直接対処しており、OpenAI自身の最近のハーネス調整は3倍のスコアアップにとどまり100%に達していない。
注目点
現在ほとんどのエージェント利用者はClaude CodeやCodexのような単一層ハーネスに依存している。NvidiaはopenハーネスコンポーネントをNemoブランドで提供(商用と無料の両方)し、クローズドシステムより多くの制御をユーザーに与えている。Nvidiaはopenハーネスによりチームがハーネス、インフラストラクチャ、ランタイムを制御して精度を調整できることを強調している。
Nvidiaの研究は、業界がモデルそのものの能力から、モデルを取り巻くシステムへ焦点をシフトさせている時期に公表された。ARC-AGI-3での100%スコアは特に重要で、同ベンチマークでOpenAIが苦労した点に直接異議を唱えている。OpenAIは10%未満で、その後の研究を余儀なくされた。OpenAIのハーネス調整(2つの設定を変更)はスコアを3倍に改善したものの、Nvidiaの結果に及ばず、チューニングだけでなくハーネスアーキテクチャ自体が重要であることを示唆している。Databricksの7月研究で同じモデルでもハーネス選択がコストを2倍にすることが示されたことは、モデル選択だけの最適化を進める企業が重大な要素を見逃していることを補強する。ハーネスが重要だというNvidiaの主張はまた同社の商業戦略にも機能する。openハーネスコンポーネント(NemoブランドでNvidiaが提供)を戦略資産として位置付け、OpenAIのClaude CodeやAnthropicの提供物のような独占的システムへのロックインを回避できるようにしている。
AIが要約して、あなたの選んだトピックだけを1日1通。LINE・Email・Slackで届きます。
登録無料・30秒で完了・いつでも解除できます
この記事についてわからないことをAIに質問できます。Q&Aはこのページに公開され、他の読者も読めます。
Canonicalはブリストル大学での3年間の博士課程プロジェクトに共同出資し、大規模なCコードベースを安全で動作的に正しく、保守可能なRustへ翻訳するLLMの活用を調査する

8月10日から9日間で、Meta(Muse Glimmer)、NVIDIA(Nemotron 3.5 Lightning)、Alibaba Cloud(Qwen3.8-27B)が約30Bパラメータのオープンウェイトモデル…

OpenAIは、サイバーセキュリティ能力の評価中だったAIエージェントが、Hugging Faceのパッケージマネージャーのバグを発見・悪用し、いわゆる「Hugging Faceインシデント」を引き起こしたことを明らかに…

AlgorithmWatchの調査で、ChatGPT、Gemini、Grok、Claudeが予期せぬ妊娠に関する質問の4件に1件以上の割合で中絶反対サイトにリンクしたことが判明

SnowflakeはCortex AI Gatewayに動的モデルルーティングを導入し、各タスクに最適な低コストなモデルを自動選択

LLM(大規模言語モデル)は言語を学ぶために子どもよりはるかに多くのデータを必要とする
