AIToday
大規模言語モデルAIビジネス・産業THE DECODER掲載日時: 2026年7月26日 22:00

Anthropic の Opus 5 が ARC-AGI-3 で30.2%を達成、従来記録の7.8%を大幅更新

LINEで送る
Anthropic の Opus 5 が ARC-AGI-3 で30.2%を達成、従来記録の7.8%を大幅更新

3つのポイント

  1. 何が起きたか

    Anthropic の Claude Opus 5 が ARC-AGI-3 で30.2%を達成した。このベンチマークは AI モデルが訓練中に見たことのない新しいタスクをどの程度解けるかを測定する。従来の記録は OpenAI の GPT-5.6 Sol (Max) による7.8%だった。Opus 5 はそれまで未解決だった5つの環境を解き、そのうち4つは人間レベル以上の性能を示した。また Anthropic 自身の Fable クラスモデル(約20%)をも上回った。

  2. なぜ重要か

    ARC Prize の開発者は、この成果を未知の環境における自律的な探索・計画・実行を可能にする論理推論の強化に帰している。Opus 5 は研究者が過去に見たことのない推論行動を示し、タスクを代数表記に変換し、独立して反射方程式を定式化した。ただし、対話型パズルゲーム用の非公開ベンチマーク Witness での独立テストでは、実世界での効果はより限定的であることが示唆されている。Opus 5 は Witness で43.4を獲得し、競合モデルと統計的に同等で、ARC-AGI-3 での伸びに比べ Opus 4.8 からの改善幅がはるかに小さい。

  3. 注目点

    ARC-AGI-3 の25個の公開デモ環境のうち6つが解決された。完全な結果、リプレイ、ベンチマークコードはすべて公開されている。より古い ARC-AGI-2 ベンチマークでは Opus 5 は90.4%、ARC-AGI-1 では97.5%に達する。研究者によると、Claude Code などの外部ツール内で使用された場合、Opus 5 はさらに高スコアを得る可能性が高いが、公式スコアは言語モデル単独の性能を反映している。

わからないところ、AIに聞けます

こういう要約が、毎朝あなたのメールに届きます。

背景と解説

Claude Opus 5 の ARC-AGI-3 でのパフォーマンスは劇的な飛躍を表している。7.8%から30.2%へのジャンプだ。しかし、その改善の本質については議論がある。ARC Prize は、未知の環境における自律的な探索と計画をより強く可能にする論理推論能力の強化に焦点を当てている。タスクを代数表記に変換し、独立して反射方程式を定式化するモデルの能力は、推論の観点から見て本当に新しい行動を示している。しかし、Anthropic はトレーニング方法を開示していないため、このゲインが根本的な推論改善を反映しているのか、それとも ARC-AGI-3 のパズル固有のメカニクスに対する焦点的な最適化を反映しているのかという疑問は残る。

これらの解釈の間の緊張は、ベンチマーク間での結果比較を通じてはっきりしてくる。別の対話型パズルベンチマークである Witness での独立テストでは、Opus 5 は43.4を獲得している。これは Kimi K3 や Fable 5 などの競合モデルと統計的に同等であり、ARC-AGI-3 での大幅なジャンプと比べて Opus 4.8 からの改善幅は限定的だ。Witness の開発者である Guanghan Ning は、このパターンがジャンル固有データでのトレーニングに適合していることを示唆しているが、Opus 5 は Witness に対して一般化しており、ただし ARC-AGI-3 ほど劇的ではないことを明確にしている。ARC-AGI-3 の開発者の一人である Greg Kamradt は、Witness は新規性への適応を完全にテストしていない可能性があり、単一の弱い結果が、より広い推論の改善の可能性を排除しないと反論している。

解決策は AI ベンチマーキングの進化の方法にあるかもしれない。Ning はコーディングベンチマークとの類似性を指摘している。モデルが改善するにつれて、HumanEval のような飽和状態のベンチマークから頻繁に更新される競技へと移行した。ARC-AGI-3 が対話型推論研究の主要なターゲットとして浮上し始めた今、集中的なトレーニング努力をまず引き付けるであろう。その後、より多くのエッジケースと汎化パターンをカバーすることで、モデルはこれらのスキルをより広い推論タスクに転送するのを助けることができる。真の新規性処理をテストする独立したベンチマークが成熟するまで、Opus 5 の ARC-AGI-3 でのリードが根本的な進歩を反映しているのか、焦点的な最適化を反映しているのかという問題は、未解決のままであろう。

よくある質問
ARC-AGI-3 とは何か、なぜ重要か。
ARC-AGI-3 は、AI モデルが訓練中に見たことのない新しいタスク(通常人間が容易に解くことができるものを含む)をどの程度解けるかを測定する。現在のバージョンはゲームのように機能し、モデルは対話型環境のルールを推測し、行動を計画し、段階的に実行することが求められ、保存された知識ではなく汎用推論をテストする。
Opus 5 は従来の記録をどの程度上回ったか。
Opus 5 は ARC-AGI-3 で30.2%を獲得したのに対し、GPT-5.6 Sol (Max) による従来記録は7.8%だった。また、それまで未解決だった5つの環境を解き、そのうち4つは人間レベル以上の性能を達成した。
独立テストも同じレベルの改善を確認しているか。
いいえ。対話型パズルゲーム用の非公開ベンチマーク Witness では、Opus 5 は43.4を獲得し、Kimi K3 や Fable 5 と統計的に同等である一方、ARC-AGI-3 での伸びに比べ Opus 4.8 からの改善は大幅に小さく、ARC-AGI-3 の特定の形式以外の新規推論タスクではゲインがより限定的である可能性を示唆している。
LINEで送る

「大規模言語モデル」の最新ニュースを、毎朝7時にお届けします

たとえば、いま届くならこの3本です

  • NvidiaのHuang氏:AIは「高生産立ち上げ」段階、売上高は1080億ドルにYahoo Finance AI · 5時間前
  • llm-keys-ui 0.1、APIキー分離Simon Willison's Weblog · 5時間前
  • YuE2、Sunoに対抗 ソニーHakkenもTop Companies AI · 9時間前

AIが要約して、あなたの選んだトピックだけを1日1通。LINE・Email・Slackで届きます。

登録無料・Googleアカウントなら30秒・いつでも解除できますAITodayについて →

AIに質問

この記事についてわからないことをAIに質問できます。Q&Aはこのページに公開され、他の読者も読めます。

関連記事

次の記事へAI時代に「人材債務」が労働データに可視化