
Anthropicは7月24日にClaude Opus 5をリリース。推論モデルとしてFable 5に近い性能を発揮しながら、API コストは半分:入出力で1M トークンあたり3ドル/15ドル対Fable 5の10ドル/50ドル。Opus 4.8より前のモデルから安全保障ルールを緩和する一方、不安全なリクエストをより安全なモデルにルーティングする自動フォールバックを追加。高度なAIの利用を広げる一方で、サイバーセキュリティなど機密分野での安全保障は改良されている。
こういう要約が、毎朝あなたのメールに届きます。
無料で登録 →何が起きたか
Anthropicは7月24日にClaude Opus 5をリリースした。推論タスクではClaude Fable 5と同等の性能を発揮しながら、価格は半分。入力価格は1M トークンあたり3ドル(Fable 5は10ドル)、出力は1M トークンあたり15ドル(Fable 5は50ドル)。
なぜ重要か
Opus 5はOpus 4.8に比べてAnthropicの安全保障体制を大幅に緩和し、同時にフラグが立てられたリクエストをより安全なモデルにルーティングする自動フォールバック機能を導入した。セキュリティに関わる領域での強力な推論機能の広範な実展開が可能になるかもしれない。
注目点
このモデルはすべてのプラットフォーム(Claude.ai、Claude API、Claude Code)で利用可能。API価格引き下げは2026年5月まで。自動フォールバックは現在APIでベータ版。その他のプラットフォームではマニュアルフォールバックが利用可能。
7月24日、Anthropicは新たなLLMであるClaude Opus 5を発表した。これはClaude Fable 5のコスト低減版として位置づけられている。このモデルはすべてのプラットフォーム—Claude.ai、Claude API(モデルID:claude-opus-5)、Claude Code、Claude Cowork—で利用可能。API価格は1M トークンあたり入力3ドル、出力15ドルで、Fable 5の10ドルと50ドルに比べて大幅に低い。価格引き下げは2026年5月を通じてスケジュール予定。
標準的なベンチマークでOpus 5は競争力のある性能を示す。Frontier-Bench v0.1ではOpus 5はOpus 4.8の2倍のスコアを達成。CursorBench 3.2では最大努力レベルでFable 5のピークスコアから0.5ポイント以内の距離。ARC-AGI 3では、一般的な問題解決能力をテストし、Opus 5はOpus 4.8の3倍のスコア。OSWorld 2.0では、コンピュータとの現実的な相互作用を測定し、Fable 5の最高スコアの約3分の1を達成。Opus 5はまた生命科学ベンチマーク全体でOpus 4.8を上回る。
Fable 5との主要な建築上の違いは、生の能力ではなく、最適化のトレードオフをどのようにバランスするかにある。Fable 5はAnthropicの内部Mythosモデルで訓練されており、強力なサイバーセキュリティと安全制約を埋め込んでいる。Fable 5の入力価格は1M トークンあたり10ドルから始まり、出力は50ドル。Opus 5はサイバーセキュリティタスクに異なるスタンスで対応する:安全を明示的に学ぶのではなく、Fable 5のMythosベースラインに匹敵する性能を能力の実践的表現を通じて達成し、安全感応的なクエリに対して明確な拒否を回避する。Anthropicはブロッキングが発生する場所で、Opus 5が自動フォールバックを使用してそのようなリクエストをルーティングすると述べている。
AnthropicはOpus 4.8、Sonnet 5、Fable 5全体で憲法を改訂し(Claudeの基礎となる倫理ガイドライン)、行動脆性を減らした。新しいバージョンはより細かい反応を許す一方、安全を維持。全体的な拒否スコアは2.3に低下し、モデルはより完全な拒否の傾向が少なくなった。安全保障では、Opus 5の設計はOpus 4.8に基本的に似ているが、Anthropicはサイバーセキュリティガードレールを緩和し、プロンプト インジェクション、ペネトレーションテスト、エクスプロイト作成、および他のアタックベクトルに対する保護を追加した。Fable 5のレベルの約85ポイントでフラグが立つ安全保障では、Opus 5は現在、ブロックアウトするのではなくこれらのリクエストをルーティングする。Claude.ai、Claude Code、Claude Coworkではフラグが立つリクエストはOpus 4.8に自動的にフォールバック。APIではOpus 5とFable 5は現在ベータ版の機能である最適な利用可能モデルにフラグが立つリクエストを自動的にリダイレクト。フォールバック機構は正当なユースケースを提供する機能を犠牲にすることなく安全性ネットを提供することを意図している。許可された使用については、Anthropicは正当なサイバーセキュリティ研究とレッドチーミングをサポートするための「Cyber Verification Program」をロールアウト。
Anthropicはまた標準価格で2.5倍高速な推論を提供する「Fast mode」を導入した。検索プレビューとベンチマークのため。Claude Platformでは、標準速度は2倍のコストがかかる。Claude Codeは使用クレジットをツールの消費に基づいて課金。Claude.ai、Claude Code、Claude Coworkでリクエストがフラグされると、自動的にOpus 4.8にフォールバック。APIではいくつかのフラグが立つリクエストはフォールバックモデルにルーティング可能。Opus 5とFable 5の両方は自動的にフラグが立つリクエストをより安全なモデルにリダイレクト—APIではベータ版の機能。一部のプロンプトでは、ユーザーはキャッシング を無効化して互換バージョン間のツール切り替えにおけるフォールバックを有効化できる。Anthropicはまた責任と安全スケーリングポリシー(RSP)を文書化したSystem Card(PDF)を公開した。Opus 5は既知知識で「CB-1」能力を示すと報告—セキュリティエクスプロイトを独立して開発または使用しないことを意味—新たなエクスプロイト(「CB-2」)は慎重に評価される。SL-3への整合はOpus 4.8に一致する。モデルが安全な展開を確認できないエッジケースでは、Anthropicはリクエストを安全なフォールバックにルーティングするか、不確実性をユーザーに明確にする。そのような事例では有害な出力は自動的に適用されたブロッキングをもたらさないが、Anthropicはclaude.aiのシステムプロンプトを更新してリスクを管理できる。このモデルは安全懸念をフラグするようユーザーに促し、Opus 5が頼りにならないところでは明確なテストやその他の検証メソッドへのエスカレーションを推奨するガイドラインを含む。
AnthropicによるClaude Opus 5のリリースは、推論モデル市場での戦略的な再構築を示している。このモデルはCursorBench 3.2などのベンチマークでFable 5に近い性能を達成し、最大努力スコアではFable 5のピークから0.5ポイント以内に収まる一方、API コストを半分に削減している。この価格設定の動きは、OpenAIのGPT-5.6 Solに直接対抗する(1M トークンあたり入力5ドル、出力30ドル)。
安全保障姿勢の転換はAnthropicの設計哲学における注目すべき変化を示唆している。Opus 4.8は厳格なガードレール を維持していたが、Opus 5はその前身からの制約を緩和する一方で、Anthropicはリスク軽減のための自動フォールバック機構を導入した。フォールバックはフラグが立てられたリクエスト(サイバーセキュリティタスク関連を含む)をより安全なモデルにルーティングし、より能力の高いモデルを機密環境で展開しながら安全性ネットを保持することができる。サイバーセキュリティチームとエンタープライズにとって、これまでより厳格な安全ルールでブロックされていたユースケースが解放される可能性がある。ただしトレードオフとして一部のリクエストは回答されずに自動的に迂回される。
Anthropicは、安全保障ガードレールが最大性能の障害となるCursorBenchベンチマークにおいて、Fable 5がおよそ85ポイントをスコアするのに対し、Opus 5は新しい安全保障機構にもかかわらずOpus 4.8のブロッキング挙動を回避し、基礎となるタスクの同等の能力に到達すると述べている。アナウンスメントで言及されたCyber Verification Programは、Anthropicが高いステークを持つ分野での構造化検証に投資していることを示唆している。
AIが要約して、あなたの選んだトピックだけを1日1通。LINE・Email・Slackで届きます。
登録無料・30秒で完了・いつでも解除できます
まだコメントがありません。最初のコメントを投稿しましょう!
ログインして議論に参加200以上のソースから厳選したAIニュースを毎日無料でお届けします。
無料で始める登録無料・30秒で完了・いつでも解除できます