AIToday

Claude Opus 5がFable 5を上回る

THE DECODER2時間前
Claude Opus 5がFable 5を上回る

要点

Anthropicの Claude Opus 5は複数のベンチマークによると現在利用可能な最も高性能なAIモデルとなった。人工知能指数で61点を獲得し、Fable 5を上回りながらより低コストである。知識業務タスクでは、デフォルトの「高」推論層でOpcus 5は1タスク当たり10.41ドル、Fable 5は22.30ドルとなり、優れた分析品質を達成している。この結果は、最先端AIモデルの能力が収束していることを強調している。単一のモデルが明確な優位性を主張することはできず、AIモデルが最終的にはコモディティ化するという議論に重みを与えている。

こういう要約が、毎朝あなたのメールに届きます。

無料で登録 →

3つのポイント

  • 何が起きたか

    Anthropicが Claude Opus 5をリリースした。人工知能指数(Artificial Analysis Intelligence Index)で61点を獲得し、Fable 5(60点)を上回った。また、コーディング、科学的推論、知識業務タスクを含むほぼすべてのベンチマークでFable 5と同等かそれ以上の成績を収めた。トークン価格は入力トークン100万個当たり5ドル、出力トークン100万個当たり25ドルのまま据え置かれている。

  • なぜ重要か

    Opus 5は平均的な人工知能指数タスクではFable 5より低コスト(2.03ドル対2.75ドル)であり、知識業務ではかなり安い(「高」推論層で10.41ドル対Fable 5の22.30ドル)。同時に分析品質も優れている(分析品質Eloが2016対Fable 5の約1700)。このことは、最先端モデルがより費用対効果の高い競争になっており、互いに離れていくのではないことを示唆している。

  • 注目点

    「高」推論層はOpcus 5のコーディングタスクで最良の価値を提供する。時間制約がため試行回数を制限するため、より高コストの「最大」層を上回っている。「最大」では、Opus 5は知識業務で1タスク当たり36分以上かかり、Opus 4.8より約50パーセント長い。

詳細

Anthropicの Claude Opus 5は現在利用可能な最も高性能なAIモデルとしてローンチした。ただし、Fable 5などのライバルとの差は、実質的な差ではなく数ポイント程度に縮小している。知識業務、コーディング、科学的推論、事実の正確性をカバーする9つのテストを組み合わせた人工知能指数では、Opus 5は61ポイント、Fable 5(60)、GPT-5.6 Sol(59)、Kimi K3(57)、Claude Opus 4.8(56)を獲得した。人工知能分析はAnthropicと協力してパブリックリリース前にモデルをテストした。

特化したドメインでは、Opus 5は強みと弱みを示している。AIモデルがプログラミングタスクを独立して処理する方法を測定する人工知能コーディング指数では、「超高」のOpcus 5とClaude Codeを組み合わせるとリーダーボードで1位を共有している。実端末環境での自律エージェントをテストするTerminal-Bench v2.1では、Opus 5は「最大」で89パーセントを獲得し、前のリーダーであるGPT-5.6 Solと同じである。科学的推論については、Opus 5はHumanity's Last Examで53パーセント、アルゴンヌ国立研究所とUIUC研究者によるCritPt物理ベンチマークではFable 5と同点である。しかし、事実の正確性は依然として弱点である。モデルの知識主張の正確性をテストするAA-Omniscienceでは、Opus 5はOpus 4.8より7ポイント改善したが、それでもFable 5に遅れをとっている。その幻覚率は50パーセントで、Opus 4.8より14ポイント高い。別個の研究機関であるEpoch AIがOpcus 5を独立してテストし、全体的なEpoch能力指数で159を割り当てた。Fable 5は161で、ただしソフトウェアエンジニアリングベンチマークに限定するとOpcus 5はFable 5と同点の161である。

価格設定と推論層がOpus 5の主要な差別化要因として浮上する。トークン価格は入力トークン100万個当たり5ドル、出力トークン100万個当たり25ドルで据え置かれている。平均的な人工知能指数タスクでは、Opus 5は2.03ドル対Fable 5の2.75ドル。より重要なのは、レポート作成、プレゼンテーション作成、何千ものファイルからのスプレッドシート分析などの典型的なオフィスタスクをテストするAA-Briefcaseベンチマークで測定される知識業務では、「高」推論層のOpcus 5は1タスク当たり10.41ドル対Fable 5の22.30ドル、53パーセント下落である。「最大」推論では、Opus 5は17.79ドルで、それでもFable 5より約20パーセント低い。AA-Briefcaseでのopus 5のEloレーティングは「最大」推論で1720に達し、Fable 5(1574)より146ポイント上である。その3つの最高推論層(最大、超高、高)が上位3位を占め、Fable 5、Sonnet 5、Opus 4.8と組み合わせると、Anthropicモデルがトップ10位置を支配する。別の知識業務テストであるGDPval-AA v2では、「最大」のOpcus 5は1861のEloに達し、人間の基準1000をはるかに超えている。

しかし、より高い推論層が必ずしも比例した価値を提供するわけではない。Vals.aiがVibeコードベンチというプログラミングベンチマークを使用してOpus 5をすべての5つの推論層でテストした。スコアは「低」で76.7パーセント、「中」で82パーセント、「高」で89.8パーセントに上昇したが、その後「超高」で88.3パーセント、「最大」で88.4パーセントに低下し、コストは大幅に高い。Vals.aiは最高層がより複雑なソリューションを生成する傾向があり、より頻繁にエラーを含むことを発見した。一方、「高」層はより単純なソリューションを生成し、要件をより確実に満たしている。このパターンはTerminal-Bench 2.1でも成立する。「高」層が「最大」を上回るのは、モデルが最高層での各試行により多くの時間を費やすため、時間制限内での総試行数が減るためである。AnthropicはそれぞれのAPIおよびClaude Codeで「高」をデフォルト層として設定しており、この実践的な洞察を反映している。知識業務では、Opus 5の最大の改善は分析品質に現れる。「最大」では、分析品質Eloが2016に達し、Fable 5より約300ポイント上である。ルーブリック合格率(定義済み品質基準を満たす頻度)は「最大」で58パーセント、「超高」で57.2パーセント、「高」で56パーセント。プレゼンテーション品質はより弱く、Opus 5のプレゼンテーションEloは1628で、「最大」でのGPT-5.6 Sol(1666)より約40ポイント低い。知識業務の実行時間は相当である。「最大」では、Opus 5は1タスク当たり36分以上必要で、平均103パスであり、24分と55パスのOpus 4.8より約50パーセント長い。

背景と解説

Claude Opus 5は最先端AIモデル間の収束地点に到達した。人工知能分析およびEpoch AIの両社は、主要なモデル間のパフォーマンス格差が著しく縮小したことを確認している。人工知能分析はOpcus 5を人工知能指数で61点でテストし、Fable 5より1ポイント、GPT-5.6 Solより2ポイント高いに過ぎない。Epoch AIの独立した評価もこの状況を強調している。Opus 5は全体的なEpoch能力指数で159点を獲得し、Fable 5は161点であり、優位性を主張するには小さすぎる差である。記事は明示的に「単一のモデルが離れるか明確な優位性を主張することはできない」と述べており、各モデルのリリースが決定的な改善をもたらす時代が終わろうとしていることを示唆している。

Opcus 5を区別するのは、革新的な能力ではなく、費用対効果と特化である。レポート作成、プレゼンテーション作成、データ分析などのタスクである知識業務では、Opus 5は劇的なコスト優位性を達成している。「高」推論層で1タスク当たり10.41ドル対Fable 5の22.30ドルであり、Eloランキングでもオプス5がFable 5を上回っている。その分析品質は特に強く、「最大」で分析品質Eloが2016に達し、Fable 5より約300ポイント上である。このパターンは、汎用的な優位性ではなく、Opus 5が特定のドメインと価格設定で優れていることを示唆している。推論層に関するデータは興味深い緊張を明らかにする。より高い推論層はより複雑で(エラーが多い)ソリューションを生成し、デフォルトの「高」層は信頼性とコストのバランスを取る。この洞察はAnthropicの独自のAPI設計と一致し、「高」をデフォルトとして設定している。これはより多くの計算がより良い結果をもたらすとは限らないという実践的な認識である。

よくある質問

Claude Opus 5の費用は他のモデルと比べてどのくらいか。
トークン価格は入力トークン100万個当たり5ドル、出力トークン100万個当たり25ドルである。知識業務タスクの「高」推論層では、1タスク当たり10.41ドル対Fable 5の22.30ドル。平均的な人工知能指数タスクでは、1タスク当たり2.03ドル対Fable 5の2.75ドル。
コーディングタスクで最良の価値を得るには、どの推論層を使うべきか。
「高」推論層がコーディングタスクで最良の結果を提供する。Vals.aiは、最高層(「超高」と「最大」)がより複雑なソリューションを生成し、より頻繁にエラーを含むことを発見した。一方、「高」層はより単純なソリューションを生成し、要件をより確実に満たしている。
Opus 5がライバルに比べて劣る点は。
事実の正確性が弱点のままである。AA-Omniscienceではオプス5がFable 5に遅れをとっており、幻覚率は50パーセント。知識業務のプレゼンテーション品質では、プレゼンテーションEloが1628で、「最大」時のGPT-5.6 Solの1666より約40ポイント低い。

「大規模言語モデル」の最新ニュースを、毎朝7時にお届けします

AIが要約して、あなたの選んだトピックだけを1日1通。LINE・Email・Slackで届きます。

登録無料・30秒で完了・いつでも解除できます

ディスカッション

まだコメントがありません。最初のコメントを投稿しましょう!

ログインして議論に参加

関連記事

AIニュースを毎日お届け

200以上のソースから厳選したAIニュースを毎日無料でお届けします。

無料で始める

登録無料・30秒で完了・いつでも解除できます