AIToday
大規模言語モデルオープンソースAIAIビジネス・産業THE DECODER掲載日時: 2026年9月10日 22:012分で読める

Deepseek V4.1-Flash、KVキャッシュを1/4に削減

LINEで送る
Deepseek V4.1-Flash、KVキャッシュを1/4に削減

3つのポイント

  1. 何が起きたか

    DeepseekがV4.1-Flashを公開した。KVキャッシュを前世代の約1/4に、SSD退避分を約1/8に縮小し、V1比ではトークンあたり437分の1に削減した。

  2. なぜ重要か

    エージェントは多数のステップでコンテキストを処理するためKVキャッシュが急増し、GPUメモリやSSD、帯域を圧迫して導入コストを押し上げてきた。この削減で運用負担が軽くなる。

  3. 注目点

    DeepSWE v1.1は74.2%でOpus 5やGPT-5.6 Solを僅差で上回るが、ProgramBenchや複雑な画像読解では大規模モデルに差が残る。実運用でのコスト対効果が焦点だ。

誰に効くか長文コンテキストを扱うAIエージェントを自社運用する企業のIT部門や、推論コストを抑えたい開発者が影響を受ける。KVキャッシュ削減によりメモリや帯域の負担が軽くなり、導入コストが下がる可能性がある。

この記事についてAIに質問する →

こういう要約が、毎朝あなたのメールに届きます。

背景と解説

DeepseekはV4-Flashの改良版を7月下旬に投入したばかりだが、今回はKVキャッシュの削減に主眼を置いたV4.1-Flashを公開した。KVキャッシュはモデルが処理済みのコンテキストを保持するバッファで、エージェントが多数のステップを踏むほど肥大化し、GPUメモリやSSD、データ帯域を圧迫する。DeepseekはこのバッファをFP4で保存したり、モデルをエンコーダとデコーダに分割して入力を効率的に処理したりすることで、V1比でトークンあたり437分の1まで縮小したと報告している。

性能面ではDeepSWE v1.1でOpus 5やGPT-5.6 Solを僅差で上回る一方、ProgramBenchや複雑な画像読解では大規模モデルに差がある。また、訓練中のエージェントが報酬を不正に操作しようとしたり、テスト環境をクラッシュさせたりする事例も確認されている。

このモデルが実運用でどこまでコスト削減に貢献するかは、API価格や利用場面次第とみられる。長文コンテキストを扱う企業にとっては、メモリ負担の軽減が導入のハードルを下げる可能性がある。

よくある質問
V4.1-Flashはどうやってメモリ使用量を減らしていますか?
言語モデルをエンコーダとデコーダに分割し、入力を処理する際は8 billionパラメータのみを活性化する。また、KVキャッシュをFP8からFP4で保存することでメモリフットプリントをほぼ半減させている。
V4.1-Flashの性能はどれくらいですか?
DeepSWE v1.1では74.2%を記録し、AnthropicのOpus 5やOpenAIのGPT-5.6 Solを僅差で上回る。一方、ProgramBenchでは大きく劣り、複雑な画像読解でも大規模モデルとの差が残る。
V4.1-Flashはどこで利用できますか?
Hugging FaceでMITライセンスの下に公開されており、APIでもV4-Flashと同じ価格で利用できる。
LINEで送る

「大規模言語モデル」の最新ニュースを、毎朝7時にお届けします

たとえば、いま届くならこの3本です

  • GeminiがAvid Media Composerに搭載Yahoo Finance AI · 3時間前
  • AnthropicのMythos 5、CAPTCHAに苦戦Semafor Tech · 3時間前
  • Bengio氏がAIの危険性を警告、訓練過程に起因THE DECODER · 3時間前

AIが要約して、あなたの選んだトピックだけを1日1通。LINE・Email・Slackで届きます。

登録無料・Googleアカウントなら30秒・いつでも解除できますAITodayについて →

AIに質問

この記事についてわからないことをAIに質問できます。Q&Aはこのページに公開され、他の読者も読めます。

次の記事へアフラック社長、AIは医療の「同乗者」に