AIToday
大規模言語モデルAIコーディングAIビジネス・産業Tomasz Tunguz (Theory Ventures)掲載日時: 2026年9月18日 4:00

UCバークレー:ハーネスでAI回答コスト71%削減

LINEで送る
UCバークレー:ハーネスでAI回答コスト71%削減

3つのポイント

  1. 何が起きたか

    UCバークレーの研究で、GPT-5.6 SolはPi上ではClaude Code上よりコストが71%低く、同じ結果が得られた。42件のハーネス比較はいずれも品質に統計的有意差を示さなかった。

  2. なぜ重要か

    同じモデルが同じ結果をはるかに低いコストで返すなら、コスト優位の源泉はモデル自体ではなく、モデルを囲むシステムになるというのがこの研究の指摘だ。

  3. 注目点

    この発見は42件のハーネス比較と1つのモデルを対象としたものだ。他のモデルやタスクでも同じ傾向が成り立つかが試される。

誰に効くかこれはソフトウェアスタートアップのAIプロダクト・エンジニアリングチームに最も重くのしかかる。モデルを囲む層こそが、モデルの選択ではなく粗利益率を左右するという証拠を突きつけられたからだ。こうしたスタートアップをコスト構造で評価する投資家にとっても重要だ。

わからないところ、AIに聞けます

こういう要約が、毎朝あなたのメールに届きます。

背景と解説

この研究結果は、あらゆるタスクに最先端モデルを使わせるためにいくら費やすかを企業が天秤にかける中で出てきた。記事が挙げる、同じ$250kの契約に2社のスタートアップが入札する例——一方は各ステップで最先端モデルを呼び出し、もう一方はそれを必要とする少数のステップに取っておく——は、その選択がそのまま粗利益率に直結することを示す。38%対75%だ。安い方のスタートアップは営業コストの回収も半分の期間で済み、記事はこれを「採用を2倍の速さで進められるか、そうでないか」の違いだと位置づける。

記事は、このコスト優位は模倣しにくいと論じる。安いモデルへのルーティングは、どのタスクをこなせるかを把握していて初めて安全になり、その知識は同じ仕事の何千ものバージョンを見ることで得られる。コスト優位と堀は同じ資産だということだ。高コストな構成は、8,600を超える評価ごとに損失を出し、顧客が最も価値を感じるまさにその時に利用を制限せざるを得なくなる。

記事は100%の利益率を約束することを慎重に避けている。推論が安くなるにつれ、買い手はエージェントにもっと多くのことを求めるようになり、均衡点は移る。それでも残るのは2社の間の差だと記事は言う。その差が42件の比較を超えて他のモデルやタスクでも保たれるかが未解決の問いだ。

よくある質問
ここでいうハーネスとは何か?
記事ではハーネスを、AIエージェントを制御するシステムと定義している。一般的なワークフローを、決定論的なコードやスキルという再現可能なパターンにまとめ上げるものだ。
安いハーネスは回答の質を落としたのか?
いいえ。42件のハーネス比較はいずれも品質に統計的な有意差を示さず、同じモデルが同じ結果を返した。
有効なハーネスを成り立たせるものは何か?
記事は、顧客への深い理解、関連する評価の集合、山登りを自動化する工場を挙げている。
Tomasz Tunguz (Theory Ventures)元記事を読む
LINEで送る

「大規模言語モデル」の最新ニュースを、毎朝7時にお届けします

たとえば、いま届くならこの3本です

  • Workiva、金融向けAIエージェントSiliconANGLE AI · 1時間前
  • Anthropic、Claude Codeを並列刷新THE DECODER · 1時間前
  • Claude Code、複数エージェント対応開放The Verge AI · 1時間前

AIが要約して、あなたの選んだトピックだけを1日1通。LINE・Email・Slackで届きます。

登録無料・Googleアカウントなら30秒・いつでも解除できますAITodayについて →

AIに質問

この記事についてわからないことをAIに質問できます。Q&Aはこのページに公開され、他の読者も読めます。

関連記事

次の記事へPika、高速AI動画ツール公開