
何が起きたか
Artificial Analysisは9月4日、AIモデルのベンチマーク「Intelligence Index」をv4.2に更新した。新たに知識労働を測る「AA-Briefcase」とPDF読解を測る「GDP.pdf」を追加し、スコアが飽和している「GPQA Diamond」を除外した。
なぜ重要か
非公開データの比重がv4.1の2倍の40%となった。AI開発企業がテスト対策をする「ゲーム化」を防ぐ狙いで、次期v5ではさらに高めるという。
注目点
首位はAnthropicの「Claude Fable 5.1」、2位はOpenAIの「GPT-6 Astra」。GPT-6 Astraは前モデル比で4ポイント伸ばし、出力トークン効率の高さが光る。
こういう要約が、毎朝あなたのメールに届きます。
Artificial Analysisがベンチマークを更新した背景には、AI開発企業がテストに過剰適応して本来の性能評価が歪む「ゲーム化」への警戒がある。非公開データの比重を高めることで、実務に近い課題での評価を狙う。今回の結果ではAnthropicとOpenAIが上位を占め、GPT-6 Astraは出力効率の良さが際立つ。評価方法の変更が今後のモデル開発の焦点となる。
たとえば、いま届くならこの3本です
AIが要約して、あなたの選んだトピックだけを1日1通。LINE・Email・Slackで届きます。
登録無料・Googleアカウントなら30秒・いつでも解除できますAITodayについて →
この記事についてわからないことをAIに質問できます。Q&Aはこのページに公開され、他の読者も読めます。
福島県は2025年度、2つの生成AIサービス(NTT東日本の提供サービスとMicrosoft 365 Copilot)について、有償アカウントを各50ずつ、計100アカウント用意し、約50人の職員を対象に実証実験を行った

エージェンティックコマース最適化プラットフォームのAzomaが、AIショッピングエージェントに商品を発見されるためのプラットフォーム選定基準を発表

OpenAI、WAN-IFRA、AIRPPUが、ウクライナの報道機関のAI導入を支援する共同イニシアチブを発表した

DeepSeekが内モンゴル自治区で建設中の1GWデータセンター向けに、華為技術(ファーウェイ)のチップ16万枚の購入を計画していると報じられた

パランティール・テクノロジーズのアレックス・カープCEOはG20イノベーション閣僚会合で、AIの真の脅威はデータ漏洩ではなく、企業が独自の知識や業務プロセス、意思決定——いわゆる「アルファ」——を意図せず外部に提供してし…

OpenAIは「現在AGI時代に突入している」と表明し、汎用人工知能の構築方法を把握しているとの見解も示した
