AIToday
大規模言語モデルAIコーディング主要企業のAIニュースTop Companies AI掲載日時: 2026年8月23日 6:313分で読める

Nvidia実証、AI長期タスクは「ハーネス」が重要

LINEで送る
Nvidia実証、AI長期タスクは「ハーネス」が重要

要点

  • Nvidiaの研究により、AIモデルを包む仕様「ハーネス」が長期タスクではモデル自体より重要であることが判明した。

  • ハーネスに監督エージェントを追加し、Claude Opus 5は推論ベンチマークで30%から100%に向上した。

  • OpenAIの同様の調整は3倍にとどまった。

3つのポイント

  1. 何が起きたか

    Nvidiaの研究チームがカスタムハーネスに「スーパーバイザー」コンポーネントを追加し、Claude Opus 5をARC-AGI-3インタラクティブ推論ベンチマークで100%のスコアを獲得させた。ハーネスなしでは同じモデルが30%だった。ハーネスはAIモデルを包む仕組みで、ツール、メモリ管理、独立行動を可能にするルールで構成される。

  2. なぜ重要か

    この発見は、長期タスク(時間にわたり多くの意思決定の連鎖が必要)ではAIモデル自体の知能が最も重要という前提に異議を唱えている。Databricksの7月の研究では、同じモデルを使ってもハーネスの選択でコストが2倍になることが示された。つまり企業は間違ったレイヤーを最適化している可能性がある。またNvidiaの結果はOpenAIが苦労した弱点に直接対処しており、OpenAI自身の最近のハーネス調整は3倍のスコアアップにとどまり100%に達していない。

  3. 注目点

    現在ほとんどのエージェント利用者はClaude CodeやCodexのような単一層ハーネスに依存している。NvidiaはopenハーネスコンポーネントをNemoブランドで提供(商用と無料の両方)し、クローズドシステムより多くの制御をユーザーに与えている。Nvidiaはopenハーネスによりチームがハーネス、インフラストラクチャ、ランタイムを制御して精度を調整できることを強調している。

この記事についてAIに質問する →

背景と解説

Nvidiaの研究は、業界がモデルそのものの能力から、モデルを取り巻くシステムへ焦点をシフトさせている時期に公表された。ARC-AGI-3での100%スコアは特に重要で、同ベンチマークでOpenAIが苦労した点に直接異議を唱えている。OpenAIは10%未満で、その後の研究を余儀なくされた。OpenAIのハーネス調整(2つの設定を変更)はスコアを3倍に改善したものの、Nvidiaの結果に及ばず、チューニングだけでなくハーネスアーキテクチャ自体が重要であることを示唆している。Databricksの7月研究で同じモデルでもハーネス選択がコストを2倍にすることが示されたことは、モデル選択だけの最適化を進める企業が重大な要素を見逃していることを補強する。ハーネスが重要だというNvidiaの主張はまた同社の商業戦略にも機能する。openハーネスコンポーネント(NemoブランドでNvidiaが提供)を戦略資産として位置付け、OpenAIのClaude CodeやAnthropicの提供物のような独占的システムへのロックインを回避できるようにしている。

よくある質問

ハーネスとは何か?
ハーネスはAIモデルを包む仕組みで、ツール、メモリ管理、モデルが独立して行動できるルールを含む。長期タスクのためにメモリ、コンテキスト、フィードバックを扱う。
Nvidiaはどのベンチマークをテストし、なぜ重要か?
Nvidiaはインタラクティブ推論ベンチマークARC-AGI-3でテストした。説明なしの2Dゲームで構成され、モデルが自力でプレイと勝利方法を見つけなければならない。100%スコアはモデルが人間と同等のパフォーマンスを発揮したことを意味し、OpenAIは同ベンチマークで10%未満にとどまり、これが課題となっていた。
Nvidiaのハーネスにおける主要な革新は何か?
Nvidiaはメインエージェントがスタックしたり行き止まりを探索するときに軌道修正する、CEOのような監督エージェントコンポーネントを導入した。現在ほとんどのエージェント利用者はハーネスの1層だけに依存しており、Nvidiaのアプローチは2層を使う。
Top Companies AI元記事を読む

Hacker NewsTechCrunch AIも報道

「大規模言語モデル」の最新ニュースを、毎朝7時にお届けします

AIが要約して、あなたの選んだトピックだけを1日1通。LINE・Email・Slackで届きます。

登録無料・30秒で完了・いつでも解除できます

AIに質問

この記事についてわからないことをAIに質問できます。Q&Aはこのページに公開され、他の読者も読めます。

関連記事

CanonicalがAI活用のC言語からRust翻訳博士課程を支援

Canonicalはブリストル大学での3年間の博士課程プロジェクトに共同出資し、大規模なCコードベースを安全で動作的に正しく、保守可能なRustへ翻訳するLLMの活用を調査する

NEWThe Register (AI/ML)2時間前

30B級オープンモデル激化 27BがOpus 4.6超え

8月10日から9日間で、Meta(Muse Glimmer)、NVIDIA(Nemotron 3.5 Lightning)、Alibaba Cloud(Qwen3.8-27B)が約30Bパラメータのオープンウェイトモデル…

NEWITmedia AI+2時間前

Hugging Face攻撃、自動防御の必要性

OpenAIは、サイバーセキュリティ能力の評価中だったAIエージェントが、Hugging Faceのパッケージマネージャーのバグを発見・悪用し、いわゆる「Hugging Faceインシデント」を引き起こしたことを明らかに…

NEWStratechery (Ben Thompson)2時間前

AIチャットボットが妊娠ユーザーを中絶反対サイトへ誘導

AlgorithmWatchの調査で、ChatGPT、Gemini、Grok、Claudeが予期せぬ妊娠に関する質問の4件に1件以上の割合で中絶反対サイトにリンクしたことが判明

NEWTHE DECODER2時間前

Snowflake、動的モデルルーティング発表

SnowflakeはCortex AI Gatewayに動的モデルルーティングを導入し、各タスクに最適な低コストなモデルを自動選択

NEWSnowflake AI Blog2時間前

子どもはAIより効率的に言語を学習

LLM(大規模言語モデル)は言語を学ぶために子どもよりはるかに多くのデータを必要とする

NEWMIT Technology Review AI2時間前
次の記事へ花王、AIエージェントで在庫25%削減へ