AIToday

Claude Opus 5、Fable 5と同等の性能をトークン価格半額で実現

THE DECODER2時間前
Claude Opus 5、Fable 5と同等の性能をトークン価格半額で実現

要点

Anthropicが新型フラッグシップモデル「Claude Opus 5」をリリースした。価格はより高額なFable 5の半分に設定されながら、主要ベンチマークで同等またはそれ以上の性能を提供する。エージェント型ターミナルコーディングで43.3%を獲得(Fable 5は33.7%を上回る)し、知識作業ではEloスコア1,861に到達、ARC-AGI-3問題解決で30.2%を達成している。これは競合他社の約4倍である。Opus 5はClaude MaxおよびClaude Proのデフォルトモデルとなり、ユーザーは5つの努力度設定を通じて性能とコストをコントロールできる。

こういう要約が、毎朝あなたのメールに届きます。

無料で登録 →

3つのポイント

  • 何が起きたか

    Anthropicが新しいフラッグシップモデル「Claude Opus 5」をリリースした。入力トークン100万あたり5ドル、出力トークン100万あたり25ドルという価格設定で、Fable 5(それぞれ10ドルと50ドル)の半額となる。Opus 5はClaude Maxのデフォルトモデルとなり、Claude Proの最高性能モデルとして機能する。100万トークンのコンテキストウィンドウを備え、新たに追加された高速モードは処理速度を2.5倍に高める一方で、価格は2倍になる。

  • なぜ重要か

    Opus 5は複数の主要ベンチマークでFable 5とGPT-5.6 Solを上回る性能を発揮している。エージェント型ターミナルコーディングで43.3%を獲得(Fable 5は33.7%)し、知識作業ではEloスコア1,861に達する(Fable 5は1,747)、ARC-AGI-3問題解決で30.2%を達成している。これはGPT-5.6 Solの7.8%の約4倍である。この動きは競合他社からの価格圧力に直接対抗しながら、同等以上の性能をより低い費用で提供する戦略である。

  • 注目点

    トークン単価だけでは全体的なコストの実態は明らかにならない。トークン効率は努力度レベルによって異なり、ユーザーは5つの努力度設定(低、中、高、極高、最大)を通じて性能とトークン使用量をトレードオフできる。Anthropicは、Opus 5がすべての努力度レベルで前世代モデルより優れた価値を提供すると述べており、一般的なタスクには低および中レベルの使用を推奨する一方、コーディングとエージェント型作業には極高レベルを推奨している。

詳細

Anthropicは新型フラッグシップモデル「Claude Opus 5」を発表した。このモデルはFable 5に近い性能を大幅に低いコストで提供するよう設計されている。入力トークン100万あたり5ドル、出力トークン100万あたり25ドルで価格設定され、Fable 5(それぞれ10ドルと50ドル)の正確に半額である。前世代モデルOpus 4.8と同じ100万トークンのコンテキストウィンドウを備えながら、Claude Maxではデフォルトモデルとなり、Claude Proでは最高性能のオプションとなる。処理速度を2.5倍に高める新しい高速モード機能が追加されたが、価格は入力トークン100万あたり10ドル、出力トークン100万あたり50ドルに倍増する。

このリリースはGPT-5.6 Solおよび中国の競合他社からの競争圧力の中で実施される。本記事は、トークン単価だけでは不完全な情報であることを指摘している。トークン効率——タスク完了に実際に消費されるトークン数——はモデル間および努力度レベル間で大きく異なる。ユーザーは5つの努力度設定:低、中、高、極高、最大を通じて性能とトークン消費をトレードオフできる。Anthropicは、低および中レベルの広範な使用を一般的なタスクに推奨し、以前のOpusモデルと比べてトークン使用量と遅延の一部で良好な結果が得られると述べており、コーディングおよびエージェント型作業には極高レベルを推奨している。Anthropicは、Opus 5がすべての努力度レベルで前世代モデルより優れた価値を提供していると報告しているが、本記事は異常を指摘している。2つのベンチマーク(Frontier-Bench v0.1およびArtificial Analysis Coding Agent Index)では、Opus 5は最大努力レベルで第2に高いレベルよりわずかに悪いスコアを獲得しており、より高いコストにもかかわらずそうなっている。

Opus 5のベンチマーク性能はコーディングおよび知識作業における強い位置を示している。Frontier-Bench v0.1では、Opus 5はエージェント型ターミナルコーディングで43.3%に到達し、Fable 5(33.7%)、GPT-5.6 Sol(34.4%)、前世代のOpus 4.8(21.1%)を大幅に上回っている。知識作業ベンチマークGDPval-AA v2では、Opus 5はEloスコア1,861を達成し、Fable 5(1,747)およびGPT-5.6 Sol(1,736)を上回っている。最も印象的な結果はARC-AGI-3にもたらされる。これは記憶されたパターンなしで新規問題解決を測定するもので、Opus 5は30.2%を獲得し、GPT-5.6 Sol(7.8%)の約4倍高く、Opus 4.8(1.5%)をはるかに上回っている。本記事はこれを最大のサプライズとしてフラグを付け、そのような大きなリードが実際の使用で実現するかどうかについて不確実性を指摘している。しかし、Opus 5はすべてで優位ではない。DeepSWE v1.1を介したエージェント型コーディングでは、GPT-5.6 Solが72.7%でリードし、Fable 5(69.7%)、Opus 5(68.8%)が続く。ヘルスケアおよび法務タスクではそれぞれFable 5およびMythos 5がOpus 5を上回る。Anthropicは意図的にOpus 5をサイバーセキュリティタスクで訓練しておらず、エクスプロイト開発ではMythos 5に遅れをとっており、脆弱性発見では同等の性能を示している。Anthropicはまた、ビジュアル出力生成およびビジュアルコンテンツ分析の改善も報告している。

AnthropicはOpus 5が独自ツールを構築し、反復を通じて独自の作業をチェックする能力を強調している。あるFrontier-Benchタスクでは、Opus 5は機械部品の図面を受け取り、FreeCADで3Dモデルを作成するよう指示されたが、インターフェースは意図的に図面の直接閲覧をブロックしていた。Opus 5は独自のコンピュータビジョンパイプラインを記述してraw pixelから幾何学を抽出し、完全な機械部品を再構築することで対応し、他のモデルは5回の試行後にも解くことができなかったタスクを完成させた。別の例では、Opus 5は人気のあるオープンソースパッケージマネージャーのバグの根本原因を特定し、コミュニティパッチが見落とした edge case を修正した。あるトレーディング企業のエンジニアは、Opus 5を使用して新しい取引所のマーケットデータフィードを単一のセッションで構築したと報告しており、これは以前のモデルが完了できないタスクであった。

セーフティに関して、Opus 5のサイバーフィルターはソースコード脆弱性研究を許可するがバイナリベースの脆弱性スキャン、侵入テスト、エクスプロイト生成をブロックしている。Anthropicは、そのサイバー分類器がFable 5上より約85パーセント少ない頻度でトリガーされると報告し、Fable 5の頻繁な介入についての批判に対応している。Claude.ai、Claude Code、Claude Coworkでのブロック要求は、Opus 4.8にフォールバックする。Anthropicは、Opus 5を科学研究のための最も有能な一般公開モデルとして説明し、すべての生命科学評価において利得を示しており、特に有機化学(分光法データから分子構造を導出することで10.2ポイント加点)およびタンパク質関連タスク(7.7ポイント加点)で改善されている。このリリースには2つのベータ機能が含まれている。Mid-Conversation Tool Changesにより、開発者はプロンプトキャッシュを無効にすることなく会話中に利用可能なツールを交換でき、API上のAutomatic Fallbacksはブロック要求を別のモデルに自動的にルーティングする。

背景と解説

Claude Opus 5のリリースは、大規模言語モデル市場における競争および価格圧力への直接的な対応を表している。本記事では、Anthropicが具体的にGPT-5.6 Solおよび中国の競合他社からの価格圧力に対応していることが指摘されており、Opus 5はFable 5との価格性能ギャップを埋めるために設計されている。Fable 5はトークンあたりの費用が著しく高いが、Opus 5は入力および出力トークン単価をFable 5の正確に半額に設定しながら、複数のベンチマークで同等またはそれ以上の性能を提供することで、能力を犠牲にすることなく製品ラインアップの再編成を行っている。

しかし、本記事は生のトークン単価がより複雑なコストの実態を隠蔽していることを強調している。トークン効率——タスクを完了するために実際に消費されるトークン数——はモデル間および努力度レベル間で大きく異なる。本記事は、Opus 4.7は基本料金が同一であるにもかかわらず、Opus 4.6と比べてタスクあたり30~40パーセント多く費用がかかったこと、同様のパターンがClaude Sonnet 5でも見られたことを指摘している。これはOpus 5の単価引き下げが自動的にタスクあたりコストの低減につながることを意味しない。5つの努力度レベル(低、中、高、極高、最大)により、ユーザーは性能と効率のトレードオフを明示的に行える。Anthropicは、Opus 5が前世代モデルと比べてすべての努力度レベルでより優れた価値を達成し、一般的な作業では低および中レベルから始め、特化したコーディングタスクには極高レベルをユーザーに推奨していると報告している。

Opus 5のベンチマーク性能は微妙な story を語っている。コーディングと新規問題解決(ARC-AGI-3の30.2%という結果はGPT-5.6 Solの7.8%の4倍近く、本記事で注目すべき異常値としてフラグが付けられ、実世界への影響が不明確であることが指摘されている)では決定的なリードを保ち、知識作業ではFable 5を上回る。しかし、本記事は明らかにOpus 5が全ての領域で優位ではないことを述べている。ヘルスケアおよび法務分野ではそれぞれFable 5およびMythos 5が優位を保ち、DeepSWE v1.1コーディングベンチマークではGPT-5.6 Solがリードしている。また、このリリースには技術的な改善も含まれている。Opus 5は問題を解決するための独自ツールを構築でき(本記事は直接画像閲覧がブロックされた際にコンピュータビジョンパイプラインを作成したことを説明)、そのセーフティ分類器はFable 5よりおよそ85パーセント少ない頻度でトリガーされる。これはFable 5が過度な介入で強く批判されたことへの対応である。

よくある質問

Claude Opus 5はFable 5と比べてどのくらい費用がかかるか?
Opus 5は入力トークン100万あたり5ドル、出力トークン100万あたり25ドルであり、Fable 5は入力トークン100万あたり10ドル、出力トークン100万あたり50ドルである。Opus 5の高速モードは価格を2倍にするが、処理速度は2.5倍に高まる。
Opus 5はどのベンチマークでFable 5を上回るか?
Opus 5はエージェント型ターミナルコーディングで43.3%を獲得(Fable 5は33.7%)し、知識作業ではEloスコア1,861に達する(Fable 5は1,747)、ARC-AGI-3問題解決で30.2%を獲得している。これは次点のモデルの約4倍である。ただし、ヘルスケアタスクではFable 5が、法務ベンチマークではMythos 5がOpus 5を上回る。
努力度レベルの設定は何であり、Anthropicはどれを推奨するか?
Opus 5は5つの努力度レベルを提供する:低、中、高、極高、最大。Anthropicは、良好な結果をトークン使用量と遅延の削減で得られるため、低および中レベルの広範な使用を推奨し、コーディングおよびエージェント型タスクには極高レベルを推奨している。

「大規模言語モデル」の最新ニュースを、毎朝7時にお届けします

AIが要約して、あなたの選んだトピックだけを1日1通。LINE・Email・Slackで届きます。

登録無料・30秒で完了・いつでも解除できます

ディスカッション

まだコメントがありません。最初のコメントを投稿しましょう!

ログインして議論に参加

関連記事

AIニュースを毎日お届け

200以上のソースから厳選したAIニュースを毎日無料でお届けします。

無料で始める

登録無料・30秒で完了・いつでも解除できます