AIToday
大規模言語モデルAIビジネス・産業Latent Space掲載日時: 2026年7月25日 19:014分で読める

Claude Opus 5がFableと同等の性能を半額で実現

LINEで送る
Claude Opus 5がFableと同等の性能を半額で実現

3つのポイント

  1. 何が起きたか

    Anthropicは金曜日にClaude Opus 5をリリースした。Artificial Analysisのエージェント知識作業ベンチマーク(AA-Briefcase)ではOpus 5がClaude Fable 5を約150Elo上回りながら、タスクあたりのコストを20%削減した。Epochの報告によると、Opus 5は総合的には159のECI(Epoch Capabilities Index)を達成し、Fable 5の161をやや下回るものの、ソフトウェアエンジニアリングベンチマーク(SWE-ECI)ではFable 5と同じ161に並んだ。

  2. なぜ重要か

    独立系ベンチマークは、Opus 5が低価格でフロンティアレベルの能力を提供し、性能と価格の従来のトレードオフに異議を唱えていることを示している。ユーザーはコーディングとブラウザ自動化タスクで強い実用的改善を報告しており、総合ベンチマークスコアではわずかな改善にとどまる場合でもそうである。このローンチは、従来のメトリクスが過小評価する可能性があるエージェント評価(ツール使用、ブラウザ制御、ソフトウェアエンジニアリングループ)への市場シフトを強調している。

  3. 注目点

    Arenaによると、実際の使用に基づいたリアルワールドリーダーボードスコアは近日中に公開される予定である。リリース時点では、コミュニティ評価はまだ追いついていない状況である。Nous Researchはポータル経由でOpus 5へのアクセスを追加し、Opus 5を含むすべてのモデルに20%の割引を適用している。

この記事についてAIに質問する →

こういう要約が、毎朝あなたのメールに届きます。

背景と解説

Claude Opus 5のローンチは、フロンティアAIモデルがどのように評価・展開されるかについての根本的なシフトを反映している。Epochのベンチマークスコアは総合レベルでFable 5に対する控えめなゲインのみを示唆しているが(159 ECI対161)、独立評価とユーザーフィードバックは意味のある実用的改善を示唆している。特にコーディング、ソフトウェアエンジニアリングタスク、およびエージェントワークフローにおいてそうである。ベンチマークスコアと質的ユーザーレポート間の緊張は、より広いエコシステム問題を指しており、従来の能力指標は多様な行動を単一の数値に圧縮し、ユーザーが最も関心を持つソフトウェアエンジニアリングやツール使用などの領域における専門的強みを曖昧にしている。

市場環境はこのローンチの受け取り方を説明している。Anthropicは、コスト効率が生の能力と同じくらい重要な分野に参入しており、エージェント能力(ブラウザ制御、タスク自動化、多段階推論)が重要な競争上の楔となった。ユーザーはもはやモデルが静的チャットベンチマークで前のフロンティアリーダーに匹敵するかを尋ねるのではなく、ブラウザ自動化、コード生成ループ、ツール呼び出しなどの実世界ワークフローを許容可能なコストで確実に実行できるかを尋ねている。Opus 5がFable並みの性能を大幅に低いコストで提供できることは、このシフトの両方の側面に対応している。

コミュニティの反応は、公開されたベンチマークが展開された能力のペースに追いついているかどうかについての懐疑論の高まりも反映している。あるユーザーはECI結果を「信じられないほど過小評価されている」と呼び、Opus 5は実際に「すべてについてはるかに良い」と感じられるにもかかわらず、前のOpus 4.8モデルより1ポイントしか高くないスコアだと主張した。この摩擦はOpus 5に限ったことではなく、テスト時間計算と探索戦略が静的評価と実世界性能の関係を複雑にするため、フロンティアラボが直面するより広い課題を示唆している。実際の使用に基づいたリアルワールドリーダーボードは近日中に公開される予定だが、それまでの間、実務家の判断と逸話が総合ベンチマークに代わって知覚を形作る可能性が高い。

よくある質問
Opus 5のベンチマーク性能はFable 5と比べてどうか?
Epochの報告によると、Opus 5は総合的に159のECIを達成し、Fable 5の161をやや下回るものの、ソフトウェアエンジニアリングベンチマーク(SWE-ECI)ではFable 5と同じ161に並んだ。Artificial Analysisのエージェント知識作業ベンチマーク(AA-Briefcase)では、Opus 5はFable 5を約150Elo上回った。
Opus 5はFableより大幅に安いのか?
AA-Briefcaseベンチマークでは、Opus 5はFable 5と比べてタスクあたりのコストを20%削減した。Nous Portalはまた、Opus 5を含むすべてのモデルに20%の割引を適用している。
ユーザーが報告している実用的な強みは何か?
ユーザーはコーディング性能とエージェントツールの使用、特にブラウザの自動化と制御で強い性能を強調した。あるユーザーはOpus 5がブラウザを開いてChatGPT Pro購読をキャンセルしたことを報告し、「このモデルは本当にブラウザを操れるんだ、すごい」とコメントした。
Latent Space元記事を読む
LINEで送る

「大規模言語モデル」の最新ニュースを、毎朝7時にお届けします

たとえば、いま届くならこの3本です

  • Tesla、AI支出上限でGrok 4.5へ誘導かTop Companies AI · 4時間前
  • Nvidia、次は従業員4万人にエージェント400万体Yahoo Finance AI · 9時間前
  • Nvidia、Anthropicに1000億ドル投資協議Yahoo Finance AI · 9時間前

AIが要約して、あなたの選んだトピックだけを1日1通。LINE・Email・Slackで届きます。

登録無料・Googleアカウントなら30秒・いつでも解除できますAITodayについて →

AIに質問

この記事についてわからないことをAIに質問できます。Q&Aはこのページに公開され、他の読者も読めます。

関連記事

次の記事へClaude Opus 5がFable 5を上回る