
OpenAIが新型AI「GPT-5.6」を3つのサイズ(Luna、Terra、Sol)で一般公開しました。
長時間の複合業務を評価するベンチマークで、最大モデルのSolは競合のClaude Fable 5を大幅に上回り、小型のTerraやLunaでもFable 5の約6分の1のコストで同等以上の性能を発揮しています。
何が起きたか
OpenAIが新型モデルGPT-5.6をLuna、Terra、Solの3サイズで一般向けに提供開始しました。Luna $1/$6、Terra $2.50/$15、Sol $5/$30と、サイズごとに100万トークンあたりの価格を設定しています。
なぜ重要か
長時間の職務処理を評価する「Agents' Last Exam」というベンチマークで、GPT-5.6 Solは53.6点を記録し、Claude Fable 5(適応推論)を13.1ポイント上回りました。Terraとも、Fable 5の約6分の1の推定コストで同等の性能を達成しており、より小型・低コストなモデルでも高い能力が得られることを示しています。
注目点
新APIには「Programmatic Tool Calling」(JavaScriptでツール呼び出しを組み合わせる機能)、「Multi-agent」(サブエージェントで並列処理)、「Prompt cache breakpoints」(キャッシュポイントの明示的設定)が追加されました。
OpenAIは今月9日、GPT-5.6ファミリーの正式提供を開始し、特に職務処理の効率性を強調しています。同社が公表したAgents' Last Examベンチマークでは、新モデルが競合のClaude Fable 5に対し顕著な優位性を示しており、特に小型モデルでコスト効率を実現している点が特徴です。
ただし、OpenAI自身も課題を認めています。ソフトウェアエンジニアリングタスク評価のSWE-Bench Proではむしろ劣る結果となり、同社はこのベンチマークの約30%のタスクが不具合を抱えていると指摘しています。また、著者の実体験では、複雑なコーディングタスクではFable 5と比べて明確な優位性がまだ見当たらないと述べられており、実世界でのパフォーマンスには更なる検証が必要な状態です。新APIの機能(Tool Calling、Multi-agent、Prompt cache breakpoints)は既存のアプローチ(Anthropicの動的フィルタリングなど)と競合しており、業界全体での実装パターンの収斂に向かう段階にあるとみられます。
たとえば、いま届くならこの3本です
AIが要約して、あなたの選んだトピックだけを1日1通。LINE・Email・Slackで届きます。
登録無料・30秒で完了・いつでも解除できますAITodayについて →
この記事についてわからないことをAIに質問できます。Q&Aはこのページに公開され、他の読者も読めます。
ViskoはLlama Venturesからプレシードで1000万ドルを調達し、長編動画を生成するライブモデル「Orbis」を一般公開した
AI企業のRunwayが、新カテゴリー「インターフェース・ワールドモデル」の第一弾となるSolarisを発表した

GoogleのAI検索が、アフリカ系、インド系、パキスタン系の人と二人きりのユーザーに緊急通報を勧め、イギリス人には紅茶を提案した

ジョンディアは、農家が過去の農場データについて自由な質問ができる対話型AIツール「JD」を発表した

エヌビディアCEOのジェンスン・フアン氏がFox Businessで、AIはチップ工場やパッケージング、コンピューター工場、AIファクトリーなどで「数十万人規模」の雇用を生み出すと発言

イスラエルの新興企業DataAgent Ltd.は、顧客のKubernetesクラスター内の本番障害を修復するプラットフォームを発表し、1000万ドルのプレシード資金を調達した