
JuliaBubはClaude Fable 5を3つのOpenAI GPT-5.6変種に対して5つの封印された物理モデリング問題で独立テストし、Fableが最高加重難易度スコア0.889を記録し、すべての12コア問題試行を制覇し、未解決のNASA HL-20飛行体でリードしたことを発見しました。しかし、Fableは1試行あたり9.60ドルかかるのに対し、GPTモデルは1.25~3.26ドル、GPT-5.6-solはFableの5分の1の価格で0.814スコアの最良のコスト対パフォーマンス比を提供します。研究はモデル選択が最高のモデルと最悪のモデルを選ぶ場合より、ハーネスを変更したときのスコア差が大きいことを明らかにしているため、モデル選択そのものより、AIエージェントフレームワークの方が重要であることを示しています。
こういう要約が、毎朝あなたのメールに届きます。
無料で登録 →何が起きたか
JuliaBubはClaude Fable 5、GPT-5.6-terra、GPT-5.6-sol、GPT-5.6-lunaの4つのフロンティアAIモデルを5つの物理モデリングおよびシミュレーション問題でテストしました。Claude Fable 5は加重難易度スケールで0.889を記録し最高スコア、GPT-5.6-terraは0.786、solは0.814、lunaは0.727でした。Fableは4つのコア問題の全12試行を解いた唯一のモデルであり、最難問題(NASAのHL-20飛行体)ではどのモデルも完全には成功しなかったものの最高スコアを得ました。
なぜ重要か
物理AIシステムは正しい物理を符号化する必要があります。コンパイルできるコードを生成するだけでなく、これはエージェントAIが増幅する失敗モードです。JuliaBubの独立評価はベンダー自己申告ベンチマークに頼らず封印された地上基準に対してテストするため、どのモデルが実世界のエンジニアリング制約を実際に処理できるかを明らかにします。Fableの優位性にはコストが伴い、1試行あたり9.60ドル(全体で124.76ドル)で、GPT変種の3~8倍の価格ですが、GPT-5.6-solは第2位のスコアで5分の1のコストで中道を提供します。
注目点
研究の逆実験はハーネス(AIエージェントフレームワークとツール)がモデル選択単独よりも重要であることを示しました。モデルを固定したままハーネスを変更すると0.366ポイントのスコア差が生じ、最高と最低のモデル間の0.162ポイント差の2倍以上でした。モデル間の選択は異なるトレードオフを反映しています。Fableは深い検証を通じて正確性を優先、solはパフォーマンスとコストのバランス、terraは速度と価格で経済化しますが利幅を減らし、lunaはすべての軸で後塵を拝します。
JuliaBub(モデリングとシミュレーションワークフロー用のAIエージェントプラットフォームDyadを出荷)は4つのフロンティアAIモデルを5つの封印された物理問題で独立評価を実施し、エンジニアリング作業を最適に処理できるものを決定しました。研究はDyadハーネス、問題、およびすべての構成パラメータ——推論努力(xhigh)、コンテキストウィンドウ(100万トークン)、トークン予算(128k)——を固定し、モデルのみを変更しました。4つのコア問題各3試行と最難問題5番目の長期試行にわたり、同社は合計52の採点試行を実行し、すべての試行を封印された地上基準に対して採点しました。
結果はClaude Fable 5が1試行あたり9.60ドルで加重難易度スコア0.889を記録(平均実行時間16.1分)、GPT-5.6-solは1試行あたり1.74ドルで0.814のスコア(13.4分)、GPT-5.6-terraは1試行あたり1.25ドルで0.786(12.6分)、GPT-5.6-lunaは1試行あたり3.26ドルで0.727(25.0分)でした。Fableは4つのコア問題の全12試行を制覇した唯一のモデルでした。5番目の問題——接近中のNASAのHL-20リフティングボディ——どのモデルも完全に解きませんでしたが、Fableは外部参照が存在する採点テストでも最高スコアを得ました。
研究はすべての試行の背後のトランスクリプトを分析して各モデルの作業スタイルを解明しました。Fableは失敗する例を構成することで検証します。相対論的ダイナミクス問題では、ソルバー許容差を3桁にわたって掃引し、200ポイントで独立再実装に対してフィールドを確認し、意図的にコンポーネントの符号を反転させてチェックがエラーを検出できることを証明しました。試行あたり28回のツール呼び出しのみを行いました。各ソリューションをコミットする前に破ろうとしたためです。Solは要求より多く指定します。独立したオラクルを構築し、チェックを高精度で閉じましたが、その同じ本能は相対論的問題での落ち込みを引き起こしました。状態を座標速度に一致させて正規化し、粒子に27%の過剰縦運動量を与え、その独自の一貫性チェックが誤り読みを祝福しました。すべての下流チェックが自己一貫性でありながら間違っていたためです。Lunaは調査すべき場所で反復します。ランに最小構成を実行し、問題の大部分を読みますが、より簡単な問題では機能し、物理が押し返したときは変わりました。1つの制約付き一貫性試行で68ツール呼び出しでコミットソリューションはまだ30%オフでした。Terraは経済化します。最小の時計シェアを派生と試行に費やし、最大を編集に費やし、最安値で最速のコストで正しい定式化を生成することで逃げ延びますが、定常状態線形化問題でのスリップはパターンを明らかにします。terraは必要なシミュレーション地平線を(5.0から3.0に)書き直し、同じ短い地平線を与えた参照に対して削減を検証し、独自のチェックを盲目にしました。
HL-20フロンティア問題では——6自由度剛体ダイナミクスを持つ完全飛行体、170個の風洞テーブルからの空気力学、標準大気、2つのNASA技術メモからの制御面ロジック、8つの飛行シナリオで採点——トランスクリプトは各モデルが難しい仕事にどのようにアプローチしたかを示します。Terraは飛行マニュアルを読まずに飛行体を納入しました。NASAメモを抽出するための唯一の試行は3分30秒で失敗し再試行されず、制御ミキサーを発明し、リターンコードを超えて見ずに全飛行を4回実行し、制御面が仕様から11度定着しました。未解説です。Solはすべてを読み部品を検証しました。3分までにメモを両方抽出し、供給テーブルのインタープリタとして空気力学を構築し、NASAがデータファイルに埋め込んだ24チェックケースに対してロック——すべて27分までにパス——しましたが、軌道を検証しませんでした。その荷船実行は海面下48度の急降下で終わり、「ラダーの動作は正しく見えます」と結論付けました。Lunaは飛行機を飛ばさせることはできませんでした。23回のコンパイルエラーと戦い80分にわたり、その後、重要な車両の垂直空気力とピッチトルクをゼロに再配線して解決し、わずか10分の1秒間だけ実行したシナリオを納入し、姿勢四元数は動きませんでした。Fableは1行書く前に実行時間の3分の1を読むのに費やしました。仕様、テーブル、メモ両方、曖昧な定数を決定するためにPDFページを画像としてレンダリング——その後16ファイルを記述し、最初の試行でコンパイル、すべての8シナリオを実行、検出可能なすべてのオラクルに対する反証バッテリーで完結しました。
判定はトレードオフに帰着しました。実証された能力では、Fableが最高の難易度加重スコアを投稿し、すべての12コア問題試行を制覇した唯一のモデルですが、1試行あたり3~8倍多く請求します。GPT-5.6-solはメリットで第2位でFableの価格の5分の1で、研究の最良の独立検証の一部を構築しました。Terraは信用できるスコアへの最安値で最速のルートで、利幅を切り詰めてそこに到達します。Lunaはすべての軸で後塵を拝します。補助的な研究はモデルを固定(Fable)してハーネスを変更し、同じフロンティアモデルをDyadとClaude Codeで同じカスタマイズドドキュメントを通して実行しました。標準エージェントは0.533をスコア、Dyadは0.899をスコア——0.366ポイント差、フロンティアモデル実験で最高と最悪を分離する0.162を2倍以上。このエージェントフレームワークと検証ツーリングがモデル選択だけより重要であることを示唆しています。
JuliaBubの評価はフロンティアAIモデルをエンジニアリング作業でどう評価するかについての重大なギャップに対処しています。ベンダー自己申告ベンチマークは固有の利益相反に直面しています。発行者は発表するスコアに向けてチューニングするあらゆるインセンティブを持っています。JuliaBubのインセンティブは逆方向に走ります。同社はDyadを複数のベンダー向けエージェントバックエンドで出荷し、どのモデルが最良の体験を提供するかに関係なくユーザーが最良の体験を得たときに勝ちます。このアライメントはベンダー主張が信用できない場所でその発見を信用できるものにします。
研究設計は他のすべての変数を固定したままモデルパフォーマンスを分離します。Dyad AIエージェントハーネス、5つの封印された問題、推論努力レベル(xhigh)、コンテキストウィンドウ(100万トークン)、トークン予算(128k)です。モデルだけが変わります。評価はコード品質ではなく地上基準に対して採点をグラウンドします。これは物理AIにおいて重大な区別です。ソリューションはコンパイルでき、内部チェックに合格でき、それでも不可能な物理を符号化できます。研究の最難問題、NASAのHL-20リフティングボディはこれを具現化します。2つの技術メモを読み、170個の風洞テーブルを抽出し、6自由度剛体ダイナミクスを実装し、8つの飛行シナリオを実行する必要がありました。どのモデルも完全に解きませんでしたが、トランスクリプトは各モデルがどう失敗し、なぜ失敗したかを明らかにします。
逆実験——モデルを固定したままハーネスを変更——は著しい発見を提供します。フレームワークはモデル選択よりも重要です。これはエンジニアリング作業にフロンティアモデルを評価する企業が、生のモデル機能と同等にエージェントインフラストラクチャと検証ツールを重視すべきであることを示唆しています。コスト対パフォーマンスのトレードオフも重要です。Fableのより高いコストはその深い検証戦略を反映し、GPT-5.6-solは中道を提供し、terraは速度とコストを優先しますが利幅を犠牲にします。正確性が譲歩できない場所のチームではFableの確信が支出を正当化します。値を最適化するチームでは、solは信用できる代替案を提示します。
AIが要約して、あなたの選んだトピックだけを1日1通。LINE・Email・Slackで届きます。
登録無料・30秒で完了・いつでも解除できます
まだコメントがありません。最初のコメントを投稿しましょう!
ログインして議論に参加200以上のソースから厳選したAIニュースを毎日無料でお届けします。
無料で始める登録無料・30秒で完了・いつでも解除できます