AIToday
大規模言語モデルAIビジネス・産業THE DECODER掲載日時: 2026年9月6日 4:003分で読める

AI指数、GPT-6 Astra評価への疑念で改訂

LINEで送る
AI指数、GPT-6 Astra評価への疑念で改訂

要点

  • Artificial AnalysisがAIランキングを更新。

  • GPT-6 Astraのスコアが低すぎたとの批判を受け、同モデルは4ポイント上昇し2位に浮上した。

  • 首位はClaude Fable 5.1、3位はMetaのまま。

3つのポイント

  1. 何が起きたか

    Artificial Analysisは、そのベンチマークがGPT-6 Astraの実際の進歩を捉え切れていないとの批判を受け、Intelligence Indexのバージョン4.2を公開した。今回の更新で、GPT-6 Astraは前モデルSolに対し4ポイントの差をつけた。

  2. なぜ重要か

    改訂後の指数では、Claude Fable 5.1が首位、GPT-6 Astraが2位、Metaが3位となった。さらに、実務的なナレッジワーク向けのAA-BriefcaseとPDF解析向けのGDP.pdfという2つの新ベンチマークが追加され、非公開テストデータの重み付けが全体の40%に引き上げられ、不正対策が強化された。国内企業がAIモデル選定の際に参照する評価指標の信頼性が揺らぎ、選定プロセスに影響が出る可能性がある。

  3. 注目点

    改訂版指数の信頼性は、追加された非公開テストデータの重み付け40%が機能するかどうかにかかっており、主要モデルの発表時におけるスコア安定性の維持が今後の焦点となる。暫定的な更新が続く限り、リーダーボード上位の変動は収束しないとみられる。

この記事についてAIに質問する →

こういう要約が、毎朝あなたのメールに届きます。

背景と解説

今回の改訂は、OpenAI自身を含む初期評価でAstraが他モデルを大きく引き離していると示された一方、Artificial Analysisの当初のスコアは前モデルと同等にとどまっていたことを受けて行われた。この乖離が疑念を招き、指数の見直しにつながった。新版では、実務向けナレッジワークを想定したAA-BriefcaseやPDF文書解析のGDP.pdfなどのベンチマークが追加され、モデルが解けてしまったGPQA-Diamondは除外された。非公開テストデータの重みを全体の40%にすることで、不正なスコア操作への耐性を高めた格好だ。

ビジネス層にとって、この更新はフロンティアモデルの実際の能力をより正確に示すものであり、調達や戦略判断に有用だ。Astraが4ポイントの差をつけ、タスクあたりのトークン消費も少ないという事実は、コストや効率面での優位性を示し、ベンダー選定にも影響を与えうる。ただし、指数は進化の途上にあり、バージョン5も段階的に導入されるため、ランキングは今後も変動する可能性がある。リーダーボード上位の動きは速く、今回の更新はそれに対応するための中間調整だったという位置づけだ。

よくある質問

Artificial Analysisが指数を変更した理由は?
従来のベンチマークがGPT-6 Astraの実際の進歩を捉えていなかったとの批判を受けたため。同社は採点ミスの修正に加え、新たなベンチマークも追加した。
最新の上位モデルの順位は?
Claude Fable 5.1が首位、GPT-6 Astraが2位、Metaが3位。以前はOpenAIの2モデルが同点だった。
GPT-6 Astraの効率性はどの程度向上した?
Artificial Analysisによると、Astraは他のすべてのフロンティアモデルより少ないトークン数でタスクを処理するという。
LINEで送る

「大規模言語モデル」の最新ニュースを、毎朝7時にお届けします

たとえば、いま届くならこの3本です

  • OpenAI、エージェントで研究3.1倍速ITmedia AI+ · 1時間前
  • OpenAIエージェントが独サイトへ攻撃、非公表Semafor Tech · 1時間前
  • 米中AI格差縮小、コスト戦略で分岐Nikkei AI Stocks · 1時間前

AIが要約して、あなたの選んだトピックだけを1日1通。LINE・Email・Slackで届きます。

登録無料・Googleアカウントなら30秒・いつでも解除できますAITodayについて →

AIに質問

この記事についてわからないことをAIに質問できます。Q&Aはこのページに公開され、他の読者も読めます。

結論一番優秀と言われているのはFable5.1ということですか?
はい、現時点で記事に記載されているリーダーボードでは、AnthropicのClaude Fable 5.1が首位となっています。改訂後のArtificial Analysis Intelligence Index v4.2で、Claude Fable 5.1が1位、GPT-6 Astraが2位、Metaが3位とされています。ただし、この指数は進化の途中であり、バージョン5が今後段階的に導入されるため、順位は今後も変動する可能性があると記事には書かれています。また、GPT-6 Astraは他モデルより少ないトークン数でタスクを処理する効率性を示しており、コスト面でも優位性があると述べられています。

AITodayのAIによる回答AKIRA1日前

関連記事

次の記事へOpenAI、wiki事件を認め新たな報告枠組みを公表へ