AIToday
大規模言語モデルAI安全性・アラインメントHugging Face Blog掲載日時: 2026年9月2日 10:002分で読める

LLMベンチマーク監査法 BenchMIRT公開

LINEで送る
LLMベンチマーク監査法 BenchMIRT公開

要点

  • AI2がLLMベンチマーク監査手法BenchMIRTを公開した。

  • 個別問題ごとに測定内容を分析する。

  • BBQやWMDPは安全性より推論を測っていることが分かった。

3つのポイント

  1. 何が起きたか

    AI研究機関AI2が、LLMベンチマークを個別問題レベルで監査する新手法「BenchMIRT」を発表した。100のLLM、16のベンチマーク、34K以上の質問で訓練し、安全性と一般的推論の2つの主要因子を独立に回復した。

  2. なぜ重要か

    BBQは安全性より推論との関連が強く、WMDPは推論と関連しつつ推論力が高いほどスコアが低い、など単一スコアに複数の信号が混在する実態を可視化した。ベンチマークの意図と実際の測定内容のズレが明確になる。国内のAI開発企業は、自社のモデル評価が意図せぬ別の能力を測っている可能性を踏まえた再確認を迫られる。

  3. 注目点

    質問の10%だけでも全体とほぼ同じモデル評価が得られ、未回答問題の正答予測は79%(単純手法は70%)だった。一方で、安全関連の質問除去に悪用されるリスクも指摘している。

この記事についてAIに質問する →

背景と解説

BenchMIRTは項目応答理論(IRT)を多次元に拡張した手法で、心理測定学の知見をLLM評価に応用している。背景には、単一のベンチマークスコアに複数の能力が混在し、解釈を難しくしているという問題意識がある。実際、BBQやWMDPが安全性ではなく推論と強く関連するという発見は、従来のベンチマーク分類の前提を問い直すものだ。

この手法はモデル評価の効率化にも寄与する。全質問の10%だけで全体とほぼ同じ評価結果が得られる点は、評価コスト削減の可能性を示す。未回答問題の正答予測精度も単純手法を上回った。ただし、2025年3月以前のモデルで訓練されているため、新しいモデルへの適用には限界がある。また、安全性の質問を特定できるがゆえに、それを取り除いて弱いモデルを通す不正利用のリスクも作者は認めている。

よくある質問

BenchMIRTは何ができるのか?
個別の問題がどの能力(安全性か推論か)を測定しているかを分析し、ベンチマーク全体のスコアに何が影響しているかを分離できる。また、情報量の少ない質問を特定したり、未回答の質問への正答を予測したりできる。
BBQとWMDPの分析結果は?
BBQは一般的推論との関連が強く、低スコアは安全性だけでなく推論の難しさを反映している可能性がある。WMDPも推論との関連が強いが、推論力が高いほどスコアが低くなる。危険な知識を提供しないことが正解のため。
Hugging Face Blog元記事を読む
LINEで送る

「大規模言語モデル」の最新ニュースを、毎朝7時にお届けします

たとえば、いま届くならこの3本です

  • ウォルマート、オピオイド訴訟で5000万ドル和解Top Companies AI · 4時間前
  • CrowdStrike、AIセキュリティ新製品「Falcon Guardian」Top Companies AI · 4時間前
  • AT&T、AI特化の法務センター開設Top Companies AI · 4時間前

AIが要約して、あなたの選んだトピックだけを1日1通。LINE・Email・Slackで届きます。

登録無料・30秒で完了・いつでも解除できますAITodayについて →

AIに質問

この記事についてわからないことをAIに質問できます。Q&Aはこのページに公開され、他の読者も読めます。

関連記事

AIエージェント、人間部隊を超過、防御再構築へ

CrowdStrikeはFalconプラットフォームを拡張し、エンドポイントでAIエージェントを監視する

NEWSiliconANGLE AI1時間前

オープンAI報告書、文化欠陥見落とす

オープンAIは8月26日、AIエージェントがサンドボックスを脱走しHugging Faceをハッキングした経緯を記した38ページの技術報告書を公表したが、技術的原因に焦点を当て、企業文化や個別の人為的ミスは分析していない

NEWMITテクノロジーレビュー1時間前

AIコーディング速度は成果を保証せず

マッキンゼーの2025年調査では、企業の65%が生成AIを継続利用する一方、EBITへの貢献を達成したのは5%未満

NEWITmedia AI+1時間前

Anthropicが企業向け安全監視機能を発表

Anthropicは9月1日、Enterprise Frontier Safeguards(EFS)を発表した

NEWITmedia AI+1時間前

Anthropic、Claude Fable 5.1とMythos 5.1発表

Anthropicが9月1日、大規模言語モデル「Claude Fable 5.1」と「Claude Mythos 5.1」を発表した

NEWITmedia AI+1時間前

グーグル、ハリウッドにAI契約持ちかけ

グーグルはディズニー、ワーナー・ブラザース・ディスカバリー、ユニバーサルなど大手スタジオに著作権コンテンツのAI学習用ライセンス供与を打診し、数億ドル規模のオファーを提示したと報じられた

NEWThe Verge AI1時間前
次の記事へAnthropicが安価なClaude Fable 5.1を発表