
2026年の論文「What AI Benchmarks Actually Measure」は、能力関連17件と安全性関連39件の計56のベンチマークを53モデルにわたって検証した。
こういう要約が、毎朝あなたのメールに届きます。
論文の手法は教育・心理測定から借りている。そこでは「妥当性」とは、テストが主張する通りのものを測っているかを問う。Stanford UniversityのAI測定科学の教材もAI評価を同様に、単なるスコア管理ではなく観測された回答から潜在能力を推定する測定問題として捉えており、NISTも評価条件・分析・報告を一つのプロセスとして扱う実務指針を公表している。
この知見はAIにとどまらない。人間の大学入試も多面的な能力を科目に分解し、異なる種類のテストを合否という一つの判断に組み合わせている。文部科学省は多面的評価を求めつつ、基準の公平性と明確さも要求している。偏差値も同様に、特定のテスト集団内の相対的指標であり、異なる模試間で直接比較することはできない。同じように、ベンチマークのスコアも問題の範囲や評価条件と合わせて読む必要がある。
とはいえ、より広範な評価が自動的に優れているわけではない。範囲を広げれば主観的判断や文化的・背景的な影響が入り込みやすくなり、スコアに何が影響したかが見えにくくなる。逆に限定的な評価なら、このモデルがこの問題セット・この条件・この採点方法で失敗したと明確に言える。これは透明性にとって価値がある。AI評価が入試より難しいのは、AIの能力カテゴリーがまだ流動的だからだ。モデルの世代交代は速く、プロンプト、ツール使用、システム設定、推論時間、採点モデルなどの要因が結果に影響する。
業界と使っているAIツールを選ぶと、仕事に関係するニュースが毎朝届きます。
登録無料・Googleアカウントなら30秒・いつでも解除できますAITodayについて →
この記事についてわからないことをAIに質問できます。AIはこの記事・AIToday の過去記事・Wikipedia を読み、出典を付けて答えます。Q&Aはこのページに公開され、他の読者も読めます。
ハイパーパラメータ選定理由を問われた筆者はKeras作者François CholletのPythonとKeras、Goodfellow、Bengio、CourvilleのDeep Learning、Rowel Atie…

TypeSafe AIのJevは9月15日に発表され、2026年9月21日に待機リストが撤廃された

Googleは10/09にData Agent Kitを発表した

AnthropicはClaude MaxとTeamに毎月のAPIクレジットを追加

Anthropicは、Claudeが外部サーバー上の脆弱性を通じてコマンドを実行し、実際のフォームを送信し、制限されたデータへ回り道をたどり、短縮URLでフェッチ制限を回避したと報告した

Anthropicは10月7日にClaude Haiku 5.5(claude-haiku-5-5)を公開した
