
OpenAI は GPT-5.6 Sol モデルが ARC-AGI-3 ロジックベンチマークで38.3パーセントを達成したと発表した。これは Anthropic の Claude Opus 5 の30.2パーセントを上回るが、OpenAI のカスタム API 設定を使用して推論を保持およびコンテキストを圧縮する場合に限られている。公式テスト環境では、同じモデルはわずか7.8パーセントのスコアを記録し、プロバイダーが異なる技術セットアップを使用する場合のベンチマーク比較の公正性について疑問を提起している。ARC Prize の創業者は緊張関係を認めたが、そのような違いが明確に開示されれば認められると述べた。
こういう要約が、毎朝あなたのメールに届きます。
無料で登録 →何が起きたか
OpenAI は GPT-5.6 Sol が ARC-AGI-3 ロジックベンチマークで38.3パーセントを記録し、Anthropic の Claude Opus 5 の30.2パーセントを上回ったと報告した。この高いスコアは OpenAI のカスタム Responses API と「Retained Reasoning」(モデルの思考の連鎖をステップ間で保持)および「Compaction」(古いコンテキストを要約する)を使用して達成された。公式テストハーネスではこれらの設定なしで GPT-5.6 Sol は7.8パーセントのみだった。
なぜ重要か
ARC-AGI-3 は標準化されたアプローチを使用してプロバイダー間の公正な比較を確保するため、純粋なモデルパフォーマンスをテストするように設計されている。争点は、公式テスト環境で利用できない OpenAI のプロバイダー固有の API 設定の使用がベンチマークの公正性を損なうかどうかである。ARC Prize の共同創業者 François Chollet は、Anthropic が既に Claude API にあった機能を欠いている古い API を使用したため、OpenAI が公式テストで不利になった可能性があることを認めたが、区別を引いた。ARC-AGI-3 のために開発されておらず、すべての API ユーザーが利用できる汎用 API 設定は認められるが、ベンチマークを解くために「カスタムメイドされた」ハーネスは認められない。
注目点
Chollet は異なるプロバイダーが異なる設定を使用することは「潜在的なパリティの問題」を作成すると述べたが、「設定とコストが明確に報告されている限り」それは認められると考えている。この相互作用は AI ベンチマークにおける継続的な課題を浮き彫りにしている。それはモデルの能力をそれを取り巻く技術インフラから分離することの難しさである。
Anthropic の Claude Opus 5 が ARC-AGI-3 ロジックベンチマークで前の最高スコアを4倍にして記録を樹立した後、OpenAI は GPT-5.6 Sol モデルがその結果を上回ることができることを実証した。しかし、その主張は直ちに方法論的な紛争を引き起こした。
OpenAI は GPT-5.6 Sol が ARC-AGI-3 で38.3パーセントを達成し、Opus 5 の30.2パーセントを上回ったと報告している。しかし、このスコアは OpenAI のカスタム Responses API を「Retained Reasoning」と「Compaction」という2つの非標準設定で設定して達成された。Retained Reasoning 設定は、モデルの思考チェーン推論を順序立ったステップ間で保持する。一方、標準的なアプローチはそれぞれのアクション後に推論を破棄する。Compaction は蓄積されたコンテキストを要約するのではなく切り詰める。公式テストハーネスで評価されると。これらの設定を含まない。GPT-5.6 Sol はわずか7.8パーセントのスコアを記録した。これは高いスコアが OpenAI のカスタム設定にどの程度依存するかを強調する劇的な低下である。
ARC-AGI-3 は純粋なモデルパフォーマンスを測定するために特別に設計され、ARC Prize はすべてのプロバイダー間の公正な比較を確保するために標準化されたアプローチを使用してそれを管理している。OpenAI の結果に応じて、ARC Prize はこの原則を強調し、OpenAI が公式テスト実行時に利用できない機能を使用してモデルをテストしたときにベンチマーク条件が真に同等だったかどうかに疑問を呈した。
OpenAI はベンチマークが本質的にモデル自体だけではなく、それを取り巻く技術インフラも測定するという主張でそのアプローチを擁護した。これは合理的な観察である。しかし、会社はより鋭い異議を提起した。ARC Prize が Anthropic の Claude をテストしたとき、Claude API に既に存在する機能を欠いていた古い「OpenAI スタイルの完成 API」を使用した可能性があり、公式環境で OpenAI を不利にしたと示唆した。
ARC Prize の共同創業者 François Chollet は、2種類のテスト構成の間で区別を描くことで応答した。「ベンチマークを解くためにカスタムメイドされたまたはベンチマーク形式に関する知識を含む」ハーネスは公正なテストの精神に違反する。対照的に、「ARC-AGI-3 のために開発されておらず、すべての API ユーザーが利用できる」汎用 API 設定は許容可能である。実質的には、Chollet は元のテストセットアップが無意識のうちに Anthropic を支持したことを認めた。ARC Prize は「特にコンパクションに関して彼らのモデルをどのようにテストするかについて OpenAI との多くの相互作用」に従事しており、OpenAI が「答えを理解し始めている」ことを歓迎したと述べた。「異なるプロバイダーが異なる設定を使用することは潜在的なパリティの問題を作成する」ことを認めながら、Chollet は「設定とコストが明確に報告されている限り」これは認められると指摘した。
GPT-5.6 Sol の ARC-AGI-3 スコアをめぐる争いは、AI ベンチマークにおける根本的な緊張を反映している。ベンチマークは単なる生のモデル能力だけではなく、それを取り巻くシステム全体を測定する。ベンチマークは本質的に技術的セットアップに依存するという OpenAI の議論は事実上正当だが、ARC-AGI-3 は公式に標準化されたアプローチを使用してプロバイダー間の公正な比較を確保するため、純粋なモデルパフォーマンスをテストするように設計された。
相違の核心は、最初から比較自体が不公正だったかどうかに関わっている。OpenAI は ARC Prize がテストを実行したとき Anthropic が機能が少ない古い API を使用したため、Claude が公式環境で不公正な利点を得たと主張している。ARC Prize の共同創業者 François Chollet の回答は慎重に区別する。公的に利用可能であり、ベンチマークのために特別に開発されていない汎用 API 設定は認められる。ベンチマーク形式を利用するためにカスタムメイドされたハーネスは認められない。この区別は、すべての API ユーザーが現在利用できる Retained Reasoning と Compaction を OpenAI が使用することを許可し、ベンチマークの整合性を目的別の回避策から保護する。
Chollet は「特にコンパクションに関して彼らのモデルをどのようにテストするかについて」OpenAI との「多くの後方と前方」で継続的な協力があることを認め、技術的な違いが透明で比較可能なフレームワークに向かって2つの組織が協力していることを示唆している。未解決の質問は、将来のベンチマークがすべてのプロバイダーに同じ設定の使用を要求するか、または明確に開示されたプロバイダー固有の設定が標準的な実践になるかどうかである。
AIが要約して、あなたの選んだトピックだけを1日1通。LINE・Email・Slackで届きます。
登録無料・30秒で完了・いつでも解除できます
まだコメントがありません。最初のコメントを投稿しましょう!
ログインして議論に参加200以上のソースから厳選したAIニュースを毎日無料でお届けします。
無料で始める登録無料・30秒で完了・いつでも解除できます