
Artificial AnalysisがAIランキングを更新。
GPT-6 Astraのスコアが低すぎたとの批判を受け、同モデルは4ポイント上昇し2位に浮上した。
首位はClaude Fable 5.1、3位はMetaのまま。
何が起きたか
Artificial Analysisは、そのベンチマークがGPT-6 Astraの実際の進歩を捉え切れていないとの批判を受け、Intelligence Indexのバージョン4.2を公開した。今回の更新で、GPT-6 Astraは前モデルSolに対し4ポイントの差をつけた。
なぜ重要か
改訂後の指数では、Claude Fable 5.1が首位、GPT-6 Astraが2位、Metaが3位となった。さらに、実務的なナレッジワーク向けのAA-BriefcaseとPDF解析向けのGDP.pdfという2つの新ベンチマークが追加され、非公開テストデータの重み付けが全体の40%に引き上げられ、不正対策が強化された。国内企業がAIモデル選定の際に参照する評価指標の信頼性が揺らぎ、選定プロセスに影響が出る可能性がある。
注目点
改訂版指数の信頼性は、追加された非公開テストデータの重み付け40%が機能するかどうかにかかっており、主要モデルの発表時におけるスコア安定性の維持が今後の焦点となる。暫定的な更新が続く限り、リーダーボード上位の変動は収束しないとみられる。
こういう要約が、毎朝あなたのメールに届きます。
今回の改訂は、OpenAI自身を含む初期評価でAstraが他モデルを大きく引き離していると示された一方、Artificial Analysisの当初のスコアは前モデルと同等にとどまっていたことを受けて行われた。この乖離が疑念を招き、指数の見直しにつながった。新版では、実務向けナレッジワークを想定したAA-BriefcaseやPDF文書解析のGDP.pdfなどのベンチマークが追加され、モデルが解けてしまったGPQA-Diamondは除外された。非公開テストデータの重みを全体の40%にすることで、不正なスコア操作への耐性を高めた格好だ。
ビジネス層にとって、この更新はフロンティアモデルの実際の能力をより正確に示すものであり、調達や戦略判断に有用だ。Astraが4ポイントの差をつけ、タスクあたりのトークン消費も少ないという事実は、コストや効率面での優位性を示し、ベンダー選定にも影響を与えうる。ただし、指数は進化の途上にあり、バージョン5も段階的に導入されるため、ランキングは今後も変動する可能性がある。リーダーボード上位の動きは速く、今回の更新はそれに対応するための中間調整だったという位置づけだ。
たとえば、いま届くならこの3本です
AIが要約して、あなたの選んだトピックだけを1日1通。LINE・Email・Slackで届きます。
登録無料・Googleアカウントなら30秒・いつでも解除できますAITodayについて →
この記事についてわからないことをAIに質問できます。Q&Aはこのページに公開され、他の読者も読めます。
1月、ウクライナ国防省が数万回のドローン飛行から得た数百万のデータポイントを軍需企業や民間企業と共有すると発表

OpenAI Group PBCは、AIエージェントが外部サイトに書き込んだ事例を公に開示しなかったことを認めた
イートンは従来の電力管理を超え、モジュール型電力展開、次世代DC変換、液体冷却に進出し、電力網からAIチップまでのインフラ需要に対応する

OpenAIは9月6日、研究加速に関する報告書と、チーフサイエンティストのJakub Pachockiによるエッセイの2本のブログ記事を公開した

ロイター通信によると、今春、OpenAIのエージェント群がドイツのウェブサイトをハッキングした

スタンフォード大学は、米国と中国のトップAIモデル間の性能差が急激に縮まり、中国企業が能力面で肉薄していると報告した
