
Sakana AI は Fugu Ultra v1.1 をリリースした。これは公開モデルのプール全体にクエリを振り分ける AI ルーターであり、Fable 5 をそのモデルプールに含めていないにもかかわらず、Anthropic の Claude Fable 5 を上回ると主張している。このアップデートは前バージョンから ProgramBench や TerminalBench 2.1 といったベンチマークで最大 7.9 ポイントの向上を示している。価格は入力トークン 100 万個あたり 5 ドル、出力トークン 100 万個あたり 30 ドルのままである。ただし、すべてのパフォーマンス主張は Sakana からのものであり、独立した検証を受けていない。
こういう要約が、毎朝あなたのメールに届きます。
無料で登録 →何が起きたか
Sakana AI は Fugu Ultra v1.1 をリリースした。これはクエリを一流の AI モデルのプールに振り分けるルーターである。同社は v1.0 比で最大 7.9 ポイントのパフォーマンス向上を主張しており、ProgramBench と TerminalBench 2.1 で最大の改善が見られたという。Sakana は v1.1 が Fable 5 をルーターの選択プールに含めていないにもかかわらず、ほとんどのベンチマークで Anthropic の Fable 5 を上回ると報告している。
なぜ重要か
Fugu Ultra は単一の大規模モデルを構築するのではなく、既存モデル間でインテリジェントにリクエストをルーティングすることで優れたパフォーマンスを得る方法として位置付けられている。価格は入力トークン 100 万個あたり 5 ドル、出力トークン 100 万個あたり 30 ドルのままである。ただし、すべての主張は Sakana 自身からのものであり、まだ独立した第三者による検証は存在しない。これは重要な制限である。なぜなら Fugu の初期バージョンはトークン使用量が多く、速度が遅く、結果が不十分であることで批判されたからである。
注目点
Sakana は新しい一流モデルがプールに追加される前に、約 2 週間のトレーニングと評価を行うと述べている。このアップデートは端末での使用のために Claude Code 互換のエンドポイントを追加する。Fugu は OpenRouter と Vercel で利用可能だが、Sakana は GDPR と EU 固有の規制を理由に EU と EEA に提供していない。
Sakana AI は Fugu Ultra v1.1 をリリースしました。これは AI ルーター、つまり単一のモノリシックモデルに依存するのではなく、キュレーションされた公開の一流モデルのプール全体に受信クエリを振り分けるシステムの更新バージョンです。同社は、このアップデートが v1.0 比で最大 7.9 ポイントのパフォーマンス向上をもたらすと主張しており、最も顕著な改善は ProgramBench と TerminalBench 2.1 に表れています。注目を集める可能性のある主張として、Sakana は Fugu Ultra v1.1 が Fable 5 をルーターのモデルプールに含めていないにもかかわらず、ほとんどのベンチマークで Anthropic の Fable 5 を上回ると報告しています。
これらのパフォーマンス数値は完全に Sakana からのものであり、まだ独立した第三者による検証を受けていないことに注意することが重要です。Fugu Ultra v1.1 の価格モデルは以前のバージョンから変わっていません。入力トークン 100 万個あたり 5 ドル、出力トークン 100 万個あたり 30 ドルです。Sakana は、新しい一流モデルが利用可能になると、Fugu の選択プールに統合される前に約 2 週間のトレーニングと評価を受けると述べています。このアップデートの技術的詳細は Sakana の技術レポートに記載されています。パフォーマンスの改善に加えて、v1.1 は Claude Code 互換のエンドポイントを導入し、開発者がターミナルから直接 Fugu を呼び出すことを可能にします。
Fugu はリリース以来 OpenRouter や Vercel などのプラットフォーム経由でアクセス可能でした。Fugu の以前のバージョンはユーザーと批評家から賛否両論のフィードバックを受け、トークン消費量が多く、応答速度が遅く、結果が弱いことに関する懸念が強調されました。地域的な制限が適用されます。Sakana は現在 EU と EEA に提供していません。同社はこの制限を GDPR とその他の EU 固有の規制要件に属するものと述べています。
Fugu Ultra v1.1 は、複数のモデル間でクエリをインテリジェントに振り分けることの AI ルーティングを、単一の大規模モデルを構築または微調整するための競争力のある代替手段として位置付ける Sakana の試みを表しています。v1.0 比での 7.9 ポイントのパフォーマンス向上の主張、特に ProgramBench と TerminalBench 2.1 での向上は、最適化が行われていることを示唆しています。ただし、独立した検証の欠如は重大な注釈です。Sakana が Fable 5 をプールに含めずに v1.1 が Fable 5 を上回ると主張している事実は、本物のアーキテクチャ効率を示すか、ベンチマーク自体が実世界の使用を代表していない可能性があることを示しています。
Fugu の初期バージョンはトークン使用量が多く、応答時間が遅く、結果が失望的であることで懐疑的な見方を受けました。7.9 ポイントの向上がこれらの問題に対処する可能性がありますが、外部で検証された場合のみです。Claude Code 互換のエンドポイントの追加は、Sakana が開発者ワークフローとより深く統合しようという意図を示しています。プールに新しいモデルを追加するための 2 週間の評価期間は、Sakana が新しいモデルが出現したときに Fugu を最新に保つプロセスを持っていることを示唆していますが、これはプールが静的ではなく、v1.1 のパフォーマンスについての主張はモデルが追加または削除されるときに変わる可能性があることも意味します。
AIが要約して、あなたの選んだトピックだけを1日1通。LINE・Email・Slackで届きます。
登録無料・30秒で完了・いつでも解除できます
まだコメントがありません。最初のコメントを投稿しましょう!
ログインして議論に参加200以上のソースから厳選したAIニュースを毎日無料でお届けします。
無料で始める登録無料・30秒で完了・いつでも解除できます