
何が起きたか
SnowflakeはCortex AI Gatewayに動的モデルルーティングを導入し、各タスクに最適な低コストモデルを自動選択。オープンモデル群には、DeepSeek-V4-Flash 0731(プライベートプレビュー中)とGLM-5.3(近日プライベートプレビュー予定)を追加した。従来からAnthropic、Google、OpenAI、SpaceXAI、Mistral AI、Metaのモデルを提供している。
なぜ重要か
AIエージェントを導入する組織は、単純なタスクでも最上位モデルを使いがちで、コストが膨らむ。社内テストでは、動的ルーティングによりデータパイプライン処理でトークン使用量を最大3倍効率化し、品質は同等を維持。コーディングタスクでは約25%削減しつつ、プルリクエストの処理量は安定していた。推論はSnowflakeのガバナンス境界内で実行されるため、企業データが社外に出ることはない。国内でAIエージェントを導入する企業は、モデル選定の手間を減らしつつコスト効率が向上する可能性がある。
注目点
DeepSeek-V4-Flash 0731はSnowflakeのデータエンジニアリングベンチマーク(ADE-bench)で74.4%を記録し、テストした主要プロプライエタリモデルを上回った。GLM-5.3は高負荷・低コスト向けに設計され、同じベンチマークで66%を記録し、テスト対象中最もトークン消費が少なかった。
こういう要約が、毎朝あなたのメールに届きます。
AIコストは、複数のエージェントやアプリケーションを導入する組織にとって、事業価値の向上を上回るペースで膨張している。問題は単純だ。多くの企業が、ステータス要約のような単純なタスクでも最上位かつ最高額のモデルに全リクエストを送っている。Snowflakeの答えは二段構え。各リクエストを最小で十分な能力のモデルに振り分け、さらにその選択肢となるモデル群を拡充して、よりコスト効率の高い選択肢を増やすことだ。
ルーティング層はSnowflakeの既存の企業向けガバナンス管理内にあり、管理者が利用可能なモデルを承認し、データ所在地ルールを適用し、すべてのルーティング判断を監査できる。ルーティングロジックを一元管理するため、顧客はアプリケーションを再構築したり、モデルをハードコードしたりする必要がない。新モデルの登場や価格変更に応じてルーティング層が適応する。社内ベンチマークでは、dbtパイプラインで最上位モデルのみを使う場合と比べ、動的ルーティングで最大3倍のトークン効率を達成。エンジニアリングのプルリクエストでは、処理量を維持しながらトークン使用量を約25%削減した。
Snowflakeが追加するオープンモデル、特にデータエンジニアリングベンチマークで74.4%を記録し主要プロプライエタリモデルを上回ったDeepSeek-V4-Flashは、オープンソースがデータチームにとって重要な領域で追いついたことを示している。高品質で効率的なモデルの選択肢が増えれば、ルーティング層がタスクあたりの平均コストを下げやすくなる。実際の利用でルーティング精度が向上し、新モデルが登場するにつれ、効率的なモデルが処理するワークロードの割合は増え、企業のガバナンスは維持され続ける。
業界と使っているAIツールを選ぶと、仕事に関係するニュースが毎朝届きます。
登録無料・Googleアカウントなら30秒・いつでも解除できますAITodayについて →
この記事についてわからないことをAIに質問できます。AIはこの記事・AIToday の過去記事・Wikipedia を読み、出典を付けて答えます。Q&Aはこのページに公開され、他の読者も読めます。
Arm対Marvell Technologyの比較で、アナリストはMarvellを選択

ハイパーパラメータ選定理由を問われた筆者はKeras作者François CholletのPythonとKeras、Goodfellow、Bengio、CourvilleのDeep Learning、Rowel Atie…

TypeSafe AIのJevは9月15日に発表され、2026年9月21日に待機リストが撤廃された

Googleは10/09にData Agent Kitを発表した

2026年9月25日、cost-tracker.jsonで記録は固定値"0.02"ドルの朝のダイジェスト1件のみで、160ドル警告・200ドル停止のガードは実際の支出を使っていない

Gemini at Work 2026で、Google/Alphabet CEOのSundar Pichai氏が「Gemini 4 Argon」を発表
