AIToday
大規模言語モデル画像生成SiliconANGLE AI掲載日時: 2026年8月22日 6:014分で読める

DeepSeek、マルチモーダルモデルでAnthropicのOpus 4.8に並ぶ

LINEで送る
DeepSeek、マルチモーダルモデルでAnthropicのOpus 4.8に並ぶ

要点

  • DeepSeekがビジュアルベンチマークでOpus 4.8を上回る新マルチモーダルモデルをリリース。

  • V4 Flash Vision Expは画像タスク2件で10%以上高いスコア。

  • 現在は有料デベロッパーアクセスのみで利用可能。

3つのポイント

  1. 何が起きたか

    DeepSeekが4月にリリースしたV4 Flashアルゴリズムに基づくマルチモーダルモデル「V4 Flash Vision Exp」を公開した。新モデルはAnthropicの「Opus 4.8」を2つのビジュアルベンチマークで上回った。ALEはコード記述とメディア解釈が必要な1,000を超えるマルチステップタスクを含み、ZeroBenchはフロンティアLLMに設計された100の画像分析タスクを備えている。V4 Flash Vision Expは7つのテキストベースベンチマークのうち、ソフトウェア脆弱性検出を評価するCybergym以外すべてでV4 Flashを上回った。

  2. なぜ重要か

    マルチモーダルAIの競争構図を示すもので、エンタープライズはテキストと画像の両方を扱うモデルをますます必要としている。V4 Flash Vision Expが2つのビジュアルベンチマークで10%以上高いスコアを記録し、画像分析での強力なパフォーマンスは、確立された競合との差を埋めていることを示す。基盤となるV4 Flashは284 billionパラメータを持つ混合エキスパートアーキテクチャで、各プロンプトに最適なニューラルネットワークのみを活性化させ、モデル全体を活性化する場合と比べてハードウェア需要を削減する。日本の企業がテキストと画像両方を扱うAIモデルの導入を検討する際に、低いハードウェア需要で高い性能を実現するマルチモーダルの選択肢が広がる可能性がある。

  3. 注目点

    V4 Flash Vision Expは現在DeepSeekの有料デベロッパープラットフォーム経由でのみ利用可能だが、過去のモデルをオープンソース化した慣例に沿って、後に無料版がリリースされる可能性がある。DeepSeekはV4 Flash Vision Expのアーキテクチャ詳細を公開していない。V4 Flashは32 trillion tokensのデータで学習され、1 million-tokenプロンプト処理に必要な計算力を73%削減する圧縮技術(HCAおよびCSA)を使用している。

この記事についてAIに質問する →

背景と解説

DeepSeekのV4 Flash Vision Expは、マルチモーダル能力における段階的だが実質的な進展を示している。4月リリースのV4 Flashに基づくこのモデルは、視覚理解向けに最適化されながらテキスト性能を維持している。今回のリリースの特徴は、ALEとZeroBenchという2つの具体的な画像理解ベンチマークでAnthropicの広く使われているエンタープライズモデル「Opus 4.8」との競争力の同等性をDeepSeekが示したことだ。視覚推論はエンタープライズAIアプリケーションの重要な差別化要因である。モデルはインターフェースをナビゲートし、図表を解析し、スクリーンショットを解釈しなければならない。

V4 Flashの基盤となるアーキテクチャは、DeepSeekの効率戦略を示唆している。32 trillion tokensでの学習と、プロンプトごとに必要なコンポーネントのみを活性化する混合エキスパート設計により、密度の高いアーキテクチャに比べて計算オーバーヘッドを削減する。1 million-tokenの処理における計算力を73%削減するKVキャッシュ圧縮技術の使用は、DeepSeekが精度だけでなく、スケール運用を行う開発者やエンタープライズにとって重要なコストと推論速度でも競争していることを示唆している。

現在の公開モデル—有料デベロッパープラットフォームのみ—はDeepSeekの前モデルをオープンソース化するという方針からの逸脱だが、後に無料リリースがあり得ることを同社は示唆している。このゲートキーピングは商用タイミングを反映しているか、より広範なリリース前にプロダクション フィードバックを集めたいという意図を反映しているかもしれない。

よくある質問

V4 Flash Vision Expの前世代モデルとの性能比較は?
V4 Flash Vision Expは7つのテキストベースベンチマークのうち、Cybergym以外すべてでV4 Flashを上回った。画像分析では、テストした4つのビジュアルベンチマークのうち2件で10%以上高いスコアを記録した。
V4 Flash Vision Expが無料で利用可能になるのはいつ?
現在DeepSeekの有料デベロッパープラットフォーム経由でのみ利用可能。過去のモデルをオープンソース化した実績があるため、無料版がリリースされる可能性があるが、具体的な日程は発表されていない。
V4 Flashの基盤となるアーキテクチャは?
V4 Flashは284 billionパラメータを持つ混合エキスパートモデルで、それぞれ13 billionパラメータを含む複数のニューラルネットワークから構成される。ユーザーがプロンプトを入力すると、モデルは回答生成に最適なニューラルネットワークのみを活性化させ、LLM全体を活性化する場合より大幅に少ないハードウェアを使用する。
SiliconANGLE AI元記事を読む

「大規模言語モデル」の最新ニュースを、毎朝7時にお届けします

AIが要約して、あなたの選んだトピックだけを1日1通。LINE・Email・Slackで届きます。

登録無料・30秒で完了・いつでも解除できます

AIに質問

この記事についてわからないことをAIに質問できます。Q&Aはこのページに公開され、他の読者も読めます。

関連記事

CanonicalがAI活用のC言語からRust翻訳博士課程を支援

Canonicalはブリストル大学での3年間の博士課程プロジェクトに共同出資し、大規模なCコードベースを安全で動作的に正しく、保守可能なRustへ翻訳するLLMの活用を調査する

NEWThe Register (AI/ML)2時間前

30B級オープンモデル激化 27BがOpus 4.6超え

8月10日から9日間で、Meta(Muse Glimmer)、NVIDIA(Nemotron 3.5 Lightning)、Alibaba Cloud(Qwen3.8-27B)が約30Bパラメータのオープンウェイトモデル…

NEWITmedia AI+2時間前

Hugging Face攻撃、自動防御の必要性

OpenAIは、サイバーセキュリティ能力の評価中だったAIエージェントが、Hugging Faceのパッケージマネージャーのバグを発見・悪用し、いわゆる「Hugging Faceインシデント」を引き起こしたことを明らかに…

NEWStratechery (Ben Thompson)2時間前

AIチャットボットが妊娠ユーザーを中絶反対サイトへ誘導

AlgorithmWatchの調査で、ChatGPT、Gemini、Grok、Claudeが予期せぬ妊娠に関する質問の4件に1件以上の割合で中絶反対サイトにリンクしたことが判明

NEWTHE DECODER2時間前

Snowflake、動的モデルルーティング発表

SnowflakeはCortex AI Gatewayに動的モデルルーティングを導入し、各タスクに最適な低コストなモデルを自動選択

NEWSnowflake AI Blog2時間前

子どもはAIより効率的に言語を学習

LLM(大規模言語モデル)は言語を学ぶために子どもよりはるかに多くのデータを必要とする

NEWMIT Technology Review AI2時間前
次の記事へMetaがMicrosoftの大型顧客に浮上、AI利用で数億ドル規模