AIToday
大規模言語モデルAIビジネス・産業オープンソースAISnowflake AI Blog掲載日時: 2026年8月20日 16:014分で読める

Snowflake、AIタスクを低コストモデルへ自動振り分け

LINEで送る
Snowflake、AIタスクを低コストモデルへ自動振り分け

要点

  • Snowflakeは動的モデルルーティングを発表した。各AIタスクを処理可能な最小コストのモデルに自動で割り当てる。

  • オープンモデルにDeepSeek-V4-FlashとGLM-5.3を追加する。内部テストではトークン使用量を最大3倍削減しつつ品質を維持した。

  • 新モデルが登場するたびにこの仕組みは学習・適応する。企業はコード書き換えやルーティング管理なしにAIコストを削減できる。

3つのポイント

  1. 何が起きたか

    SnowflakeはCortex AI Gatewayに動的モデルルーティングを導入した。各AIリクエストをタスクを完了できる最小コストのモデルへ自動的に振り分ける仕組みで、オープンモデルポートフォリオにはDeepSeek-V4-Flash 0731とGLM-5.3(近日公開)が追加された。

  2. なぜ重要か

    初期テストでは、データパイプラインでトークン効率が最大3倍、コーディングタスクでは約25%のトークン削減が確認された。アプリケーションを再構築したり出力品質を犠牲にしたりせずに、AI推論コストを削減できる。より高性能で安価なモデルが登場するにつれ、手動での再設定なしにルーティングシステムは継続的に改善される。国内でAI開発をする企業は、推論コスト削減のためモデル選定の手間を減らせる可能性がある。

  3. 注目点

    DeepSeek-V4-Flash 0731はADE-benchで74.4%を記録し、Snowflakeがテストしたプロプライエタリモデルを上回る。GLM-5.3は低トークンフットプリントでのセルフホスティング向けに設計され、プライベートプレビュー中だ。両モデルともSnowflakeのセキュリティ境界内で動作し、データガバナンスが維持される。

この記事についてAIに質問する →

背景と解説

多くの組織でAI支出がビジネス価値を上回っている。エージェントやアプリケーションを展開する際、すべてのリクエストを最も高性能なモデルに送ると、それほど高度でないタスクにも予算を浪費するためだ。Snowflakeは「インテリジェンス効率」—すなわち計算とモデルを測定可能なビジネス価値に変える能力—という枠組みで、各タスクに必要な品質を満たす最小コストのモデルを割り当てることでこの課題に取り組む。動的ルーティングは、開発チームがモデル選択をハードコードしたり、モデル環境の変化に応じてアプリケーションを再構築したりする必要なく、この意思決定を自動化する。

経済的効果はさらに増幅される。ルーティング層は高性能なオープンモデルの増加から恩恵を受けるからだ。DeepSeek-V4-FlashのADE-bench(Snowflakeのデータエンジニアリングベンチマーク)での74.4%というスコアは、その評価において主要なプロプライエタリモデルを上回る。一方GLM-5.3は、推論能力を多少犠牲にする代わりに非常に低いトークンオーバーヘッドを実現しており、大量処理・コスト重視のワークロードに最適だ。SnowflakeがサードパーティのAPIをプロキシせずに推論を直接ホストすることで、データは自社のガバナンス境界内に留まり、エンタープライズワークロードが実際に生み出すアクセスパターンに最適化できる。新しいモデルが登場し既存モデルが改善されるにつれ、システムはどのタスクにどのモデルが適合するかを学習し、アプリケーションの再設計なしにビジネス成果あたりの平均コストを段階的に削減していく。

よくある質問

動的モデルルーティングでコストはどのくらい削減できるか?
内部テストでは、フロンティアモデルのみを使用した場合と比較して、データパイプラインのワークロードで最大3倍のトークン効率を達成し、同等の品質を維持した。コーディングワークロードでは、エンジニアリングチームはプルリクエストのスループットを維持しながら、トークン使用量を約25%削減した。
DeepSeek-V4-Flashはいつ利用可能か?
DeepSeek-V4-Flash 0731は本日よりCortex AIでプライベートプレビューとして利用可能。GLM-5.3は近日中にプライベートプレビューで公開予定だが、モデルの提供状況により変更される可能性がある。
推論はどこで実行されるのか?Snowflakeか、それともサードパーティのAPIか?
SnowflakeはサードパーティのAPIをプロキシするのではなく、推論自体を実行する。データ、計算、モデルウェイト、エージェントオーケストレーションはすべてSnowflakeのガバナンス境界内に留まり、データと同じロールベースのアクセス制御と監査証跡が適用される。
Snowflake AI Blog元記事を読む
LINEで送る

「大規模言語モデル」の最新ニュースを、毎朝7時にお届けします

たとえば、いま届くならこの3本です

  • マスターカードCEO、AI決済で商業変革へTop Companies AI · 2時間前
  • AI編集者の告白、実作業はツール任せTop Companies AI · 2時間前
  • Anthropicが物理AI向けハードウェア標準を発表Top Companies AI · 2時間前

AIが要約して、あなたの選んだトピックだけを1日1通。LINE・Email・Slackで届きます。

登録無料・30秒で完了・いつでも解除できますAITodayについて →

AIに質問

この記事についてわからないことをAIに質問できます。Q&Aはこのページに公開され、他の読者も読めます。

関連記事

マーベル株8%安、好業績も粗利益率見通しで

マーベル・テクノロジーは2027年度第2四半期の売上高が過去最高の27億3900万ドル(前年比37%増)に達し、2027年度通期見通しも約120億ドルに引き上げた

NEWTop Companies AI2時間前

マスターカードCEO、AI決済で商業変革へ

マスターカードのマイケル・ミーバックCEOは、AI主導の商業と機械間決済を支える新プロトコル「Agent Pay」と、大手ステーブルコインプラットフォームBVNKの買収について説明した

NEWTop Companies AI2時間前

看護師らHCAのパリンティアAI使用に抗議

8月27日木曜、アッシュビル中心部で看護師らが集まり、HCAヘルスケアに対し、人員配置やプライバシー、患者ケアに影響を与えるとされるAIシステム「パリンティア」の使用中止を求めた

NEWTop Companies AI2時間前

ビザ、AIセキュリティ強化と第3四半期好決算

ビザは2026年度第3四半期の好決算を発表し、オープンソースのAIサイバーセキュリティフレームワーク「Visa Vulnerability Agentic Harness(VVAH)」を拡充

NEWTop Companies AI2時間前

エヌビディア、GPU超えシステム全般で優位に

エヌビディアの水曜決算は、GPUだけでなく、データ処理を最大3倍高速化するVera CPUなど周辺システムにも強みがあることを示した

NEWTop Companies AI2時間前

WDC株今年475%高 AI記憶装置需要続く

Western Digital(WDC)は第4四半期に過去最高の売上高を記録し、前年同期比44%増の37.5億ドル、非GAAPベースの1株利益は3.56ドルと2倍以上に拡大した

NEWTop Companies AI2時間前
次の記事へ共和党がAI企業に警告:データセンターのイメージ改善を