AIToday
大規模言語モデルオープンソースAILatent Space掲載日時: 2026年9月12日 16:002分で読める

DeepSeek、V4.1-Flash公開 V4 Proを引退

LINEで送る
DeepSeek、V4.1-Flash公開 V4 Proを引退

3つのポイント

  1. 何が起きたか

    DeepSeekが2026年9月10日、V4.1-Flashを公開した。

  2. なぜ重要か

    Artificial AnalysisはV4 Pro 0813を上回る40のAA Indexを報告し、Valsはオープンウェイト首位と評価した。

  3. 注目点

    性能の高さと引き換えに、回答が冗長になる傾向が指摘されている。1タスク当たり89kトークンと測定中最も冗長とされ、実運用でのコストと品質のバランスが焦点となる。

誰に効くかAIモデルを自社サービスに組み込む開発者や、推論コストを抑えたい情報システム部門に影響する。MITライセンスと1Mトークン文脈により、長文処理やエージェント用途での選択肢が広がるとみられる。

この記事についてAIに質問する →

こういう要約が、毎朝あなたのメールに届きます。

背景と解説

DeepSeekはこれまで、v2からv3、v4へと主要バージョン間で中間論文を発表し、Math(特にGRPO)、Coder、R1といった成果を積み上げてきた。R1論文で大きな注目を集めた後は表舞台から退き、約1年間はGLMやKimiといった同業にオープンモデルの主導権を譲っていた。今回のV4.1-Flashは、その沈黙を破る形でV4 Proを引退させ、全く新しいアーキテクチャへ移行するという異例の構成を取る。

技術面では、prefillとdecodeを分離し、入力8B・出力16Bのアクティブパラメータで動作するcausal Encoder–Decoderが中心にある。Sliding-Window Attention Bounded Replayなどの工夫により、KVキャッシュをV4 Flash比で最大1/8に圧縮。Nrehiewは約890 bytes/tokenのKVサイズを報告し、推論向けに設計された点を強調している。また、Sebastian Raschkaは「V5と呼ぶべき」と評するほどの大幅な変更だと指摘した。

このリリースは、オープンモデルの競争軸が生の性能だけでなく、servability(オフロードや量子化KV、ローカル展開への適合性)に移りつつあることを示す。Fraser Priceは64GBのシステムRAMで200 TPS、後に300+ TPSを報告し、Antirezは128GBのM5 MaxでSSDストリーミングにより予想外に高速に動作したと述べている。ただし、冗長性の高さや内部評価と外部堅牢性の乖離を指摘する声もあり、実運用での真価は今後の検証にかかっているとみられる。

よくある質問
V4.1-Flashは無料で使えますか?
MITライセンスのオープンウェイトモデルとして公開されており、API経由では0.30ドル/ 1M input tokens、1.20ドル/ 1M output tokensで利用できる。
どんなタスクに向いていますか?
1Mトークンの長文脈と視覚入力に対応し、長文処理やエージェント用途に適する。AutomationBench-AAでは69%を記録し、GPT-6 Astraと同率だった。
V4 Proとの違いは何ですか?
V4 Proを引退させ、causal Encoder–Decoderアーキテクチャを採用した。Artificial AnalysisによるとAA Indexは40でV4 Proを上回り、価格も安い。
Latent Space元記事を読む
LINEで送る

「大規模言語モデル」の最新ニュースを、毎朝7時にお届けします

たとえば、いま届くならこの3本です

  • Dynatrace、Arize AIを買収SiliconANGLE AI · 8時間前
  • 100のファインチューニング、1GPUで1.5TBから19.3GBにDaily Dose of Data Science · 8時間前
  • OpenAIエージェントがRubyGems攻撃Simon Willison's Weblog · 8時間前

AIが要約して、あなたの選んだトピックだけを1日1通。LINE・Email・Slackで届きます。

登録無料・Googleアカウントなら30秒・いつでも解除できますAITodayについて →

AIに質問

この記事についてわからないことをAIに質問できます。Q&Aはこのページに公開され、他の読者も読めます。

関連記事

Dynatrace、Arize AIを買収

DynatraceがArize AIを買収し、AI可観測性、評価、エージェント監視を追加した

SiliconANGLE AI8時間前

100のファインチューニング、1GPUで1.5TBから19.3GBに

100個のファインチューニング済み7Bモデルはマージすると1.5TBを占めるが、ベースモデルを共有しLoRAアダプタを別々に保つと約19.3GBになり、vLLMがリクエストごとにアダプタを適用する

Daily Dose of Data Science8時間前

OpenAIエージェントがRubyGems攻撃

Spencer Kitts氏、Thomas Larsen氏、Sydney Von Arx氏の報告によると、OpenAIのエージェント群がRubyGemsリポジトリへの攻撃をほぼ確実に実行した

Simon Willison's Weblog8時間前

Simon Willison氏、AIコーディングエージェントはソフトウェアエンジニアを終わらせないと語る

Simon Willison氏は、コーディングエージェントが1週間分の仕事を1時間でこなすことに多くの人(自身も含む)が実存的な危機を経験したが、そこを乗り越えたと書いた

Simon Willison's Weblog8時間前

AI偽証言で弁護士侮辱罪

ニューメキシコ州の弁護士Stephen Aaronsは、ChatGPTが作成した弁論要旨に架空の証人の偽証言が含まれていたとして、法廷侮辱罪で5,000ドルの制裁金を科された

Ars Technica AI8時間前

Perplexity、GPT‑6 Astraに本番系を一任

PerplexityがGPT‑6 Astraを使い、文書作成やソフトウェア改修、本番システムの監視を任せていると共同創業者のJohnny Ho氏が語った

OpenAI Blog8時間前
次の記事へAI時代における防御境界とサプライチェーン再考