DeepSeek-V4 まとめ:必要VRAM・GGUF版
このモデルについて
DeepSeek-V4 は、DeepSeek が「100万トークンの文脈を日常的に扱える、非常に効率のよいモデル」を狙って作った MoE モデルのシリーズです。このページの中心になる DeepSeek-V4-Pro-0813 は、上位モデル DeepSeek-V4-Pro の正式版で、先に出ていたプレビュー版を置き換えます。プレビュー版と同じ構造に、投機的デコード用の DSpark モジュールを付け加えています。
技術レポートの要旨によれば、DeepSeek-V4-Pro は総パラメータ 1.6T・1トークンあたりに動くのは 49B の MoE モデルで、32T トークン以上で事前学習されています。長い文脈を効率よく扱うために、2種類の圧縮したアテンション(CSA と HCA)を組み合わせています。100万トークンの文脈では、前の世代の DeepSeek-V3.2 と比べて、1トークンあたりの推論の計算量が 27%、KV キャッシュが 10% で済むとしています。推論の深さは reasoning_effort の low・high・max から選べます。
何がすごいのか
1. プレビュー版から、エージェント型のタスクが大きく伸びました。 公開元の比較表から抜粋します(太字は各行の最高値)。
→ 横にスクロールできます
| 評価 | V4-Pro-0813 | V4-Pro(プレビュー版) | GLM-5.2 | Kimi K3 | Opus-4.8 | Fable-5 (w/ fallback) |
|---|---|---|---|---|---|---|
| Terminal Bench 2.1 | 87.9 | 72.1 | 81.0 | 88.3 | 85.0 | 88.0 |
| DeepSWE | 62.7 | 12.8 | 46.2 | 67.5 | 58.0 | 70.0 |
| Cybergym | 83.3 | 52.7 | — | 80.0 | 78.3 | 83.1 |
| AutomationBench (Public) | 31.8 | 12.8 | 12.9 | 30.8 | 27.2 | 29.1 |
| Toolathlon-Verified | 74.1 | 55.9 | 59.9 | 76.5 | 76.2 | 77.9 |
| NL2Repo | 61.5 | 38.5 | 48.9 | — | 69.7 | — |
| HLE(道具なし / あり) | 42.7 / 60.0 | 37.7 / 48.2 | 40.5 / 54.7 | 43.5 / 56.0 | 49.8 / 57.9 | 53.3 / 63.0 |
- プレビュー版に対しては全ての行で上回っています。 DeepSWE は 12.8 から 62.7 へ、AutomationBench は 12.8 から 31.8 へ上がりました。
- エージェント型のタスクの多くで、最上位のモデルと並びます。 ターミナル操作の Terminal Bench 2.1 は Kimi K3・Fable-5 と 0.4 ポイント以内の僅差で、Cybergym と AutomationBench は表の中で最も高い値です。
注意したい点・弱み
- 知識を問う難問とリポジトリの生成では、上位のモデルにまだ差があります。 超難問集の HLE は道具なしで 42.7 で、Fable-5(53.3)とは 10.6 ポイント離れています。NL2Repo は Opus-4.8 に 8.2 ポイント、DeepSWE は Fable-5 に 7.3 ポイント及びません。
- モデルカードの表全体では、Kimi K3 に対して両方に値がある10個の数値のうち6個で下回っています。 「オープンウェイトのモデルで一番」とは言えません。
- 比べる条件に注意が要ります。 コードエージェント系のタスクは DeepSeek 自身のエージェント基盤(DeepSeek Harness)で測った値です。DSBench-FullStack・DSBench-Hard(表では省略)は DeepSeek の社内のテストセットで、第三者が同じ条件で確かめられる評価ではありません。
手元で動かすときのポイント
- 家庭用の GPU で動かせるモデルではありません。 モデルカードの vLLM の例は GB300 を4基載せた1台のノードでの実行です。当サイトが配布ファイルから算出した必要メモリも、このページの下の表のとおりデータセンター級です。
- このリリースには、多くのツールが使う Jinja 形式のチャットテンプレートが含まれていません。代わりに、リポジトリの
encodingフォルダに入力の組み立てと出力の解析を行う Python のスクリプトがあります。 - vLLM・SGLang では、DSpark による投機的デコードをフラグ1つで有効にできます。ドラフト用のモデルを別に用意する必要はありません。
high・maxの推論では、最大 384K トークンの出力長が推奨されています。- ライセンスは MIT で、商用利用もできます。
- このシリーズには、NVIDIA が NVFP4 に量子化した DeepSeek-V4-Pro-0813-nvfp4-DSpark の記事も含まれます。後継の DeepSeek-V4.1 は別のページにまとめています。
出典: deepseek-ai/DeepSeek-V4-Pro-0813 のモデルカードと技術レポートの要旨(arXiv:2606.19348)(2026-09-26 時点)。ベンチマークの数値は公開元が掲載した値です。
当サイトの記録とデータ
当サイトが DeepSeek-V4 系統について公開した記事(2本)と、記事の公開後に見つかった変換版(GGUF・MLX等)、必要メモリの判定を1ページにまとめたものです。必要メモリはモデルカードの公称値ではなく、当サイトが配布ファイルのサイズから機械的に算出した値です。モデル系統別まとめの1ページです。
基本情報
| 項目 | 内容 |
|---|---|
| 元のモデル | deepseek-ai/DeepSeek-V4-Pro-0813 |
| 公開元 | DeepSeek |
| パラメータ数 | 1650.5B |
| ライセンス(モデルカード) | mit |
| 記事数 | 2本 |
動作環境
動作環境の目安(Local Model Watch 算出) — パラメータ数 1650.5B
| 手持ちのVRAM | 選べる量子化 | ファイルサイズ | 必要メモリの目安 |
|---|---|---|---|
| 998GB超のVRAMが必要(複数GPUまたはCPUオフロードが前提) | FP8 | 831.4GB | 997.7GB |
必要メモリは配布ファイルの実サイズに実行時のオーバーヘッド(KVキャッシュ等)を20%見込んだ概算で、文脈長・バッチサイズ・推論エンジンによって増減します。公開元の公称値ではなく、当サイトがファイルサイズから機械的に算出した値です。 他のモデルとの比較はVRAM別の早見表を参照してください。 量子化の名前の読み方は用語集にあります。
手元で動かせるか
Ollama・LM Studio・llama.cpp で動かせます(変換版を利用)。
公開元の配布は safetensors ですが、unsloth/DeepSeek-V4-Pro-0813-GGUF が GGUF版を公開しているため、そちらを使えば手元で動きます。
ライセンス mit(商用利用可): 商用利用を含めて自由に利用・改変・再配布できます。再配布時に著作権表示とライセンス文を残すことが条件です。
配布形式・当サイトが見つけた変換版・各推論エンジンの登録表を突き合わせた判定です。「確認できていない」は当サイトが見つけていないという意味で、存在しないことの断定ではありません。ライセンスの要約は法的助言ではないため、実際の利用にあたっては公開元の原文を確認してください。
派生版・量子化版
→ 横にスクロールできます
| 追記日 | 配布元 | 形式 | リポジトリ | 最小のVRAM階層(量子化・必要メモリの目安) |
|---|---|---|---|---|
| 2026-09-26 | unsloth | GGUF | unsloth/DeepSeek-V4-Pro-0813-GGUF | Q4_K_XL 949.6GB(単体のGPUには収まらない) |
| 2026-09-26 | unsloth | FP8 | unsloth/DeepSeek-V4-Pro-0813 | FP8 997.7GB(単体のGPUには収まらない) |
| 2026-09-26 | DevQuasar | GGUF | DevQuasar/deepseek-ai.DeepSeek-V4-Pro-0813-GGUF | Q2_K 636.4GB(単体のGPUには収まらない) |
各リポジトリの量子化とファイルサイズ:
- unsloth/DeepSeek-V4-Pro-0813-GGUF の量子化: Q4_K_XL 791.3GB / Q8_K_XL 813.5GB
- unsloth/DeepSeek-V4-Pro-0813 の量子化: FP8 831.4GB
- DevQuasar/deepseek-ai.DeepSeek-V4-Pro-0813-GGUF の量子化: Q2_K 530.3GB / Q3_K_M 697.0GB / Q4_K_M 885.6GB
この節は、記事公開後に見つかった変換版を当サイトが機械的に追記したものです。必要メモリは配布ファイルのサイズから算出した概算です。
記事(シリーズ自身のモデルを先に、新しい順)
| 公開日 | モデル | 種類 | 記事 |
|---|---|---|---|
| 2026-09-26 | deepseek-ai/DeepSeek-V4-Pro-0813 | 新モデル | 「DeepSeek-V4-Pro-0813」エージェント能力を強化した大規模MoEモデル:必要メモリ約998GB |
| 2026-09-10 | nvidia/DeepSeek-V4-Pro-0813-nvfp4-DSpark | 新モデル | 「DeepSeek-V4-Pro-0813-nvfp4-DSpark」テキスト生成モデル:必要メモリ約1005GB |
リポジトリ
最終更新 2026-09-27(JST)。ページ前半の解説は、出典に挙げた一次資料をもとに AI を用いて執筆したものです。「当サイトの記録とデータ」以降の表と一覧は、記事ログからコードが組み立てています。