AIToday
Hugging Face Blog掲載日時: 2026年4月30日 4:001分で読める

AIモデルの評価コストが急増し、誰が評価を実施できるかを左右する段階に達した

LINEで送る
AIモデルの評価コストが急増し、誰が評価を実施できるかを左右する段階に達した

3つのポイント

  1. Holistic Agent Leaderboard(HAL)は9つのモデルと9つのベンチマーク対して21,730のエージェント実行に約$40,000を費やした。単一のGAIA実行はフロンティアモデル上で$2,829のコストがかかる。

  2. 静的なベンチマーク(モデルが予測を行うのみで学習しないテスト)では、100×から200×の計算削減で順位付けがほぼ保持されるが、エージェント評価(AIが自分で判断して作業する評価)では同じ技法の効果は限定的である。エージェントタスクは多段階で分散が高く、短縮が難しい。

  3. Scientific ML領域では、The Wellが1つの新しいアーキテクチャの評価に960 H100時間を要し、4つのベースライン比較の完全スウィープに3,840 H100時間を要する。この領域では評価計算が学習計算を約2桁上回る。

この記事についてAIに質問する →

Hugging Face Blog元記事を読む
LINEで送る

こうしたAIニュースを、毎朝7時にお届けします

たとえば、いま届くならこの3本です

  • Aranyaが1100万ドル調達、ベアメタルを48時間でAIクラスター化SiliconANGLE AI · 2時間前
  • CBTSがForge Agents発表、AIエージェントを数日で構築SiliconANGLE AI · 2時間前
  • アルファベットAI概要、月間25億人が利用Yahoo Finance AI · 2時間前

AIが要約して、あなたの選んだトピックだけを1日1通。LINE・Email・Slackで届きます。

登録無料・30秒で完了・いつでも解除できますAITodayについて →

AIに質問

この記事についてわからないことをAIに質問できます。Q&Aはこのページに公開され、他の読者も読めます。

次の記事へAppleの研究チームが、LLMが問題の複雑さに応じて推論時間を自動調整する手法を発表