
Anthropic の Claude Opus 5 は、新規タスクに対する汎用推論をテストするために設計されたベンチマーク ARC-AGI-3 で大きな飛躍を達成し、30.2%を獲得した。これは OpenAI の GPT-5.6 Sol (Max) による従来記録の7.8%を大幅に上回っている。ARC Prize はこの成果を、未知の環境での探索と計画を可能にする論理推論の強化に帰している。モデルはタスクを代数表記に変換するなど、かつてないような行動を示した。しかし、Witness などの独立したベンチマークでのパフォーマンスは、実世界シナリオではゲインがより限定的であることを示唆しており、改善は ARC-AGI-3 の特定のパズル形式に適応したトレーニングを反映している可能性がある。
こういう要約が、毎朝あなたのメールに届きます。
無料で登録 →何が起きたか
Anthropic の Claude Opus 5 が ARC-AGI-3 で30.2%を達成した。このベンチマークは AI モデルが訓練中に見たことのない新しいタスクをどの程度解けるかを測定する。従来の記録は OpenAI の GPT-5.6 Sol (Max) による7.8%だった。Opus 5 はそれまで未解決だった5つの環境を解き、そのうち4つは人間レベル以上の性能を示した。また Anthropic 自身の Fable クラスモデル(約20%)をも上回った。
なぜ重要か
ARC Prize の開発者は、この成果を未知の環境における自律的な探索・計画・実行を可能にする論理推論の強化に帰している。Opus 5 は研究者が過去に見たことのない推論行動を示し、タスクを代数表記に変換し、独立して反射方程式を定式化した。ただし、対話型パズルゲーム用の非公開ベンチマーク Witness での独立テストでは、実世界での効果はより限定的であることが示唆されている。Opus 5 は Witness で43.4を獲得し、競合モデルと統計的に同等で、ARC-AGI-3 での伸びに比べ Opus 4.8 からの改善幅がはるかに小さい。
注目点
ARC-AGI-3 の25個の公開デモ環境のうち6つが解決された。完全な結果、リプレイ、ベンチマークコードはすべて公開されている。より古い ARC-AGI-2 ベンチマークでは Opus 5 は90.4%、ARC-AGI-1 では97.5%に達する。研究者によると、Claude Code などの外部ツール内で使用された場合、Opus 5 はさらに高スコアを得る可能性が高いが、公式スコアは言語モデル単独の性能を反映している。
Anthropic の Claude Opus 5 は ARC-AGI-3 で新高スコアの30.2%を達成した。これは OpenAI の GPT-5.6 Sol (Max) による従来記録の7.8%からの大幅な飛躍である。この過程で Opus 5 は従来解決されていなかった5つの環境を解き、そのうち4つは人間レベル以上のパフォーマンスに達した。また、Anthropic 自身の Fable クラスモデル(同じベンチマークで約20%)をも上回った。ベンチマーク背後の組織である ARC Prize は、完全な結果、リプレイ、ベンチマークコードを公開し、25個の公開デモ環境のうち6つが解決されたことを報告した。
ARC-AGI-3 は、AI モデルが訓練中に見たことのない新規タスク(人間が一般に容易に解くタスクを含む)にどの程度対応できるかを測定するために設計されている。保存された知識に報酬を与えるベンチマークとは異なり、ARC-AGI-3 は対話型ゲームのように機能する。モデルは環境のルールを推測し、行動の順序を計画し、それを段階的に実行しなければならない。この形式は汎用推論能力と、見慣れないパターンへの適応能力をテストする。ARC Prize の分析によれば、Opus 5 の圧倒的なリードは「未知の環境における自律的な探索、計画、実行をより可能にする」強力な論理推論に由来している。モデルはテスト中に前例のない行動を示した。タスクを代数表記に変換し、独立して反射方程式を定式化したのだ。これは研究者が過去のモデルで観察したことのない能力である。
ただし、Opus 5 の改善の出所は不明であり、独立した研究者によって異議を唱えられている。Anthropic はモデルがどのようにトレーニングされたか、最適化されたかを開示していない。標的を絞ったデータラベリングと強化学習は、妥当なメカニズムである。アノテータは推論トレース、有用なアクション、失敗した試み、類似のパズルからの回復ステップにラベルを付けることができ、その後強化学習が探索、計画、ルール発見、自己修正に報酬を与えることができる。注目すべきことに、Opus 5 は ARC-AGI-3 とそのフォーマットが公開された後に開発された。これにより Anthropic はベンチマークの特定のスキルとパズルタイプに合わせてトレーニングを調整できた可能性がある。ただし、同社が正確なタスク自体でトレーニングしたことは示されていない。
独立テストはより慎重な見方を示唆している。対話型パズルゲーム用の非公開ベンチマーク Witness を設計した Guanghan Ning は、Opus 5 が43.4を獲得したと判断した。これは Kimi K3 や Fable 5 などの競合モデルと統計的に同等であり、ARC-AGI-3 での改善に比べて Opus 4.8 からの改善ははるかに少ない。あるテストでは、Opus 5 は任意のアクションを取る前に従来のパズルの隠されたルールを識別したが、より不慣れなメカニクスを持つゲームでは Opus 4.8 に遅れをとった。Ning は、このパターンがジャンル固有データでのトレーニングに適合していることを示唆しており、Witness は Anthropic がどのデータを使用したかを特定することができない。ARC-AGI-3 の研究者の一人である Greg Kamradt は、単一の弱い結果がモデルの全体的な改善を上回るものではなく、ARC-AGI-3 スタイルのパズルを中心に設計された Witness は、ARC-AGI-3 が測定するその種の新規性適応を完全にテストしない可能性があると反論した。Ning は後に、Opus 5 は Witness に対して一般化したが、ARC-AGI-3 ほど大幅ではなかったことを明確にし、コーディングベンチマークがどのように進化したかに平行線を引いた。対話型推論の主要なターゲットとして、ARC-AGI-3 はおそらく最初に最も多くのトレーニング努力を引き付けるであろう。より多くのエッジケースをカバーすることで、モデルはこれらのスキルをより広い範囲の抽象推論タスクに一般化するのを助けることができる。
ベンチマークの古いバージョンでは、Opus 5 のパフォーマンスは安定していた。ARC-AGI-2 では90.4%、ARC-AGI-1 では97.5%のスコアで、従来の最高スコアに匹敵しているものの、わずかに高いコストである。ARC Prize はまた、いくつかの AI システムがハーネスと呼ばれる外部ソフトウェアツールで使用された場合、すでにベンチマークを通過している可能性があることに留意しているが、公式スコアは言語モデル単独のパフォーマンスをカウントする。Opus 5 は Claude Code などのハーネス内で使用された場合、さらに高いスコアを得る可能性があるが、公式リーダーボードはモデルが独立して動作することを反映している。
Claude Opus 5 の ARC-AGI-3 でのパフォーマンスは劇的な飛躍を表している。7.8%から30.2%へのジャンプだ。しかし、その改善の本質については議論がある。ARC Prize は、未知の環境における自律的な探索と計画をより強く可能にする論理推論能力の強化に焦点を当てている。タスクを代数表記に変換し、独立して反射方程式を定式化するモデルの能力は、推論の観点から見て本当に新しい行動を示している。しかし、Anthropic はトレーニング方法を開示していないため、このゲインが根本的な推論改善を反映しているのか、それとも ARC-AGI-3 のパズル固有のメカニクスに対する焦点的な最適化を反映しているのかという疑問は残る。
これらの解釈の間の緊張は、ベンチマーク間での結果比較を通じてはっきりしてくる。別の対話型パズルベンチマークである Witness での独立テストでは、Opus 5 は43.4を獲得している。これは Kimi K3 や Fable 5 などの競合モデルと統計的に同等であり、ARC-AGI-3 での大幅なジャンプと比べて Opus 4.8 からの改善幅は限定的だ。Witness の開発者である Guanghan Ning は、このパターンがジャンル固有データでのトレーニングに適合していることを示唆しているが、Opus 5 は Witness に対して一般化しており、ただし ARC-AGI-3 ほど劇的ではないことを明確にしている。ARC-AGI-3 の開発者の一人である Greg Kamradt は、Witness は新規性への適応を完全にテストしていない可能性があり、単一の弱い結果が、より広い推論の改善の可能性を排除しないと反論している。
解決策は AI ベンチマーキングの進化の方法にあるかもしれない。Ning はコーディングベンチマークとの類似性を指摘している。モデルが改善するにつれて、HumanEval のような飽和状態のベンチマークから頻繁に更新される競技へと移行した。ARC-AGI-3 が対話型推論研究の主要なターゲットとして浮上し始めた今、集中的なトレーニング努力をまず引き付けるであろう。その後、より多くのエッジケースと汎化パターンをカバーすることで、モデルはこれらのスキルをより広い推論タスクに転送するのを助けることができる。真の新規性処理をテストする独立したベンチマークが成熟するまで、Opus 5 の ARC-AGI-3 でのリードが根本的な進歩を反映しているのか、焦点的な最適化を反映しているのかという問題は、未解決のままであろう。
AIが要約して、あなたの選んだトピックだけを1日1通。LINE・Email・Slackで届きます。
登録無料・30秒で完了・いつでも解除できます
まだコメントがありません。最初のコメントを投稿しましょう!
ログインして議論に参加200以上のソースから厳選したAIニュースを毎日無料でお届けします。
無料で始める登録無料・30秒で完了・いつでも解除できます