
AnthropicがClaude Fable 5.1を公開。新科学ベンチマークで高得点を獲得。
クリエイティブテストでは最高額の推論モードが過去最高のペリカン画像を出力。
このモードは3.30ドル、約14分を要した。
何が起きたか
Anthropicは2026年9月1日にClaude Fable(およびMythos)5.1をリリースした。テストでは、モデルの「max」推論設定が、これまでAnthropicが生成した中で最も優れたAI生成ペリカン画像を生み出し、そのコストは3.30ドル、処理時間は13分54秒だった。
なぜ重要か
新ベンチマークTerminal-Bench-Science 0.1で、同モデルは52.6%を記録。Fable 5の24.7%、Opus 5の29.0%、GPT-5.6 Solの22.4%を上回った。ただし著者によると、低い推論設定(「low」と「medium」)ではペリカンのプロンプトに対して推論が完全にスキップされたようで、コストは約10セントだった。国内のAI開発企業は、高性能な出力と引き換えに推論コストが増大する事例を参考に、自社のモデル設計を見直す可能性がある。
注目点
「max」推論レベルでは65,927個の出力トークンと詳細な推論トレースが生成され、青い帽子と魚の入ったバスケットを持つペリカンが完成した。この出力を別のプロンプトでアニメーション化した際は、コストは1.37ドルで、元のSVGで車輪が正しく回転する動画が生成された。
Claude Fable 5.1のリリースで注目されるのは、新設の科学ベンチマークTerminal-Bench-Science 0.1での飛躍的なスコア向上だ。前モデルの24.7%に対し52.6%を記録し、科学研究タスクの処理能力が大幅に改善したことを示している。これはAnthropicのマーケティングにおいて重要な領域だ。
一方、著者の実機テストでは、モデルの推論能力に関するより複雑な実態が浮き彫りになった。単純なSVG生成にかかるコストと時間は、推論努力設定によって劇的に変動し、「low」では約10セント・24秒だったのに対し、「max」では3.30ドル・約14分に達した。興味深いことに、低い設定ではこのタスクに対して推論が完全に省略されたようだ。
「max」設定の長時間に及ぶ推論トレースを見ると、モデルは視覚的な衝突チェックから自転車フォークの曲線修正まで、詳細で意図的な計画を実行している。複雑で反復的なタスクにおいては、高コストのティアが真に異なる、より高度な動作モードを提供することが示唆される。ただし著者は、競合モデルであるGemini 3.7 Flashのような創造性は依然として欠けていると指摘している。
たとえば、いま届くならこの3本です
AIが要約して、あなたの選んだトピックだけを1日1通。LINE・Email・Slackで届きます。
登録無料・30秒で完了・いつでも解除できますAITodayについて →
この記事についてわからないことをAIに質問できます。Q&Aはこのページに公開され、他の読者も読めます。
ラムリサーチの幹部が今週、業界関係者に対し、半導体製造の次の大きな飛躍は、人間を完全に排除するのではなく、協働ロボットとAIによる予測保守を組み合わせることで実現すると語った

デルは2027年度通期の売上高見通しをアナリスト予想より約250億ドル上方修正した

SemaforとRiddance AIは、実在の俳優とAI生成スクリプトを使い、民主党政治家に関する誇張や虚偽の主張を広める約12のYouTubeチャンネルを発見

最近のICRAパネルで、ロボット工学の研究者らが論文数の急増への対応を議論した

Anthropicは新たな旗艦モデルとしてClaude Fable 5.1とClaude Mythos 5.1を公開した

GoogleはGemini 3.7 Flash、3.6 Flash、3.5 Flash-Liteにエージェント型動画分析を追加した
