「DeepSeek-V4-Pro-0813」エージェント能力を強化した大規模MoEモデル:必要メモリ約998GB

基本情報
| 項目 | 内容 |
|---|---|
| リポジトリ | deepseek-ai/DeepSeek-V4-Pro-0813 |
| まとめページ | DeepSeek-V4 のまとめ(記事2本) |
| 公開元のまとめ | DeepSeek のモデルとライセンスのまとめ |
| 公開日 | 2026-08-13 |
| ライセンス | mit |
| 配布形式 | safetensors |
| 論文 | arXiv:2606.19348 |
| 出典の種類 | 公開元の一次情報(公式HFアカウントの一次情報) |
収集・肉付けの時点で当サイトのコードが確定させた値です。日付はJST。
概要
DeepSeek が、大規模な MoE モデル DeepSeek-V4-Pro の正式版 DeepSeek-V4-Pro-0813 を Hugging Face で公開している。モデルカードによれば、これまでのプレビュー版(DeepSeek-V4-Pro (Preview))を置き換えるもので、エージェントとしての能力が大きく強化され、特に実運用の環境で性能の向上がはっきり出るとしている。構造はプレビュー版と同じで、そこに投機的デコード用の DSpark モジュールを付け加えている。
DeepSeek-V4 シリーズの技術レポートの要旨によれば、このシリーズは「100万トークンの文脈を日常的に扱える、非常に効率のよいモデル」を狙って作られている。100万トークンの文脈では、DeepSeek-V3.2 と比べて1トークンあたりの推論の計算量(FLOPs)が 27%、KV キャッシュが 10% で済むという。
スペック
- パラメータ数: 技術レポートの要旨では、DeepSeek-V4-Pro(プレビュー版)は総パラメータ 1.6T・活性パラメータ 49B の MoE モデル。正式版の 0813 はこの構造をそのまま使っている
- アーキテクチャ: MoE。長い文脈を効率よく扱うために、Compressed Sparse Attention(CSA)と Heavily Compressed Attention(HCA)を組み合わせたハイブリッドのアテンションを使う。残差接続は Manifold-Constrained Hyper-Connections(mHC)で強化し、学習には Muon オプティマイザを使っている
- 学習データ: 32T トークン以上で事前学習し、その後に大がかりな事後学習を行った(プレビュー版の技術レポートの要旨より)
- コンテキスト長: 100万トークン
- 投機的デコード: DSpark モジュールを同じチェックポイントに同梱。ドラフト用のモデルを別に用意する必要がない
- 推論の深さ:
reasoning_effortでlow・high・maxの3段階を選べる - 重みの精度: FP8(Hugging Face のタグより)
性能
モデルカードは、正式版・同時期の DeepSeek-V4-Flash-0731・両方のプレビュー版と、他社の4モデルを並べた比較表を載せている。数値は公開元の測定で、第三者による検証ではない。
→ 横にスクロールできます
| Benchmark | DeepSeek-V4-Pro-0813 | DeepSeek-V4-Flash-0731 | DeepSeek-V4-Pro (Preview) | DeepSeek-V4-Flash (Preview) | GLM-5.2 | Kimi K3 | Opus-4.8 | Fable-5 (w/ fallback) |
|---|---|---|---|---|---|---|---|---|
| HLE (wo / w tools) | 42.7 / 60.0 | 37.8 / 51.5 | 37.7 / 48.2 | 34.8 / 45.1 | 40.5 / 54.7 | 43.5 / 56.0 | 49.8 / 57.9 | 53.3 / 63.0 |
| Terminal Bench 2.1 | 87.9 | 82.7 | 72.1 | 61.8 | 81.0 | 88.3 | 85.0 | 88.0 |
| NL2Repo | 61.5 | 54.2 | 38.5 | 39.4 | 48.9 | – | 69.7 | – |
| Cybergym | 83.3 | 76.7 | 52.7 | 38.7 | – | 80.0 | 78.3 | 83.1 |
| DeepSWE | 62.7 | 54.4 | 12.8 | 7.3 | 46.2 | 67.5 | 58.0 | 70.0 |
| Toolathlon-Verified | 74.1 | 70.3 | 55.9 | 49.7 | 59.9 | 76.5 | 76.2 | 77.9 |
| Agents’ Last Exam | 25.7 | 25.2 | 16.5 | 15.8 | 23.8 | 27.6 | 25.7 | – |
| AutomationBench (Public) | 31.8 | 25.1 | 12.8 | 10.8 | 12.9 | 30.8 | 27.2 | 29.1 |
| DSBench-FullStack † | 71.1 | 68.7 | 41.8 | 37.0 | 61.8 | 73.7 | 71.6 | 77.2 |
| DSBench-Hard † | 67.2 | 59.6 | 31.1 | 25.8 | 54.5 | 63.0 | 71.7 | 68.3 |
プレビュー版からの伸びは、どの行でも大きい。 特にエージェント型のタスクで差が開き、DeepSWE は 12.8 から 62.7 へ、AutomationBench (Public) は 12.8 から 31.8 へ、社内の DSBench-Hard は 31.1 から 67.2 へ上がった。「エージェントとしての能力を大きく強化した」というモデルカードの説明は、この表のとおりである。
他社の最上位モデルとは、項目によって勝ち負けが分かれる。 ターミナル上で作業を最後までやり切れるかを見る Terminal Bench 2.1 は 87.9 で、Kimi K3(88.3)・Fable-5(88.0)と 0.4 ポイント以内の僅差、Opus-4.8(85.0)を上回る。Cybergym(83.3)と AutomationBench (Public)(31.8)は表の中で最も高い。一方、各分野の専門家が作った超難問集 HLE は、道具なしで 42.7 にとどまり、Fable-5(53.3)・Opus-4.8(49.8)とは 7.1〜10.6 ポイントの差がある(道具ありでは 60.0 で、Fable-5 の 63.0 に次ぐ2位)。NL2Repo は Opus-4.8 に 8.2 ポイント、DeepSWE は Fable-5 に 7.3 ポイント、Kimi K3 に 4.8 ポイント及ばない。Kimi K3 とは、両方に値がある10個の数値のうち6個で下回っている。「エージェント型のタスクの多くで最上位に並ぶが、知識を問う難問と一部のコーディングではまだ差がある」と読むのが妥当である。
比較の条件にも注意が要る。モデルカードの注記によれば、表のコードエージェント系のタスクは、DeepSeek 自身のエージェント基盤(DeepSeek Harness の minimal モード)で、推論の深さを max、temperature = 1.0・top_p = 0.95 にして測っている。DSBench-FullStack と DSBench-Hard(†印)は DeepSeek の社内のテストセットで、第三者が同じ条件で確かめられる評価ではない。Fable-5 の列には「w/ fallback」の条件が付いている。
得意なこと・想定用途
モデルカードが強調しているのはエージェントとしての能力で、表で伸びが大きいのも、ターミナル操作・リポジトリの生成・ソフトウェアの修正・業務の自動化・ツール利用といった「自分で手を動かして最後までやり切る」種類のタスクである。技術レポートの要旨が掲げる「100万トークンの文脈を日常的に扱える」効率のよさも、長い手順の作業や、推論にたくさんのトークンを使う使い方(テスト時スケーリング)を現実的にするためのものだとしている。
推論の深さは reasoning_effort の3段階で選べる。モデルカードは high と max について最大 384K トークンの出力長を勧めており、深い推論ではそれだけ長い出力を前提にしている。
一方で、読者の手元の機材で動かす用途には向かない。モデルカードの vLLM の例は GB300 を4基載せた1台のノードでの実行で、SGLang の例もテンソル並列4を前提にしている。家庭用の GPU で試すモデルではなく、データセンター級の環境や、事業者が提供する API で使う規模のモデルである。
類似モデルとの違い
当サイトでは以前、このモデルを NVIDIA が量子化した 「DeepSeek-V4-Pro-0813-nvfp4-DSpark」テキスト生成モデル:必要メモリ約1005GB を取り上げた。あちらは DSpark のドラフト用の部分まで含めて NVFP4 に量子化し、1つのチェックポイントで動くようにしたもので、NVIDIA の環境で動かすことを狙っている。今回の 0813 は、その元になった DeepSeek 自身の重みである。
動作環境
動作環境の目安(Local Model Watch 算出) — パラメータ数 1650.5B
| 手持ちのVRAM | 選べる量子化 | ファイルサイズ | 必要メモリの目安 |
|---|---|---|---|
| 998GB超のVRAMが必要(複数GPUまたはCPUオフロードが前提) | FP8 | 831.4GB | 997.7GB |
推論エンジンの対応状況(各プロジェクトのソースにあるモデル登録表とアーキテクチャ名を当サイトが機械的に照合。2026-09-27 時点): llama.cpp: 登録あり、vLLM: 登録あり、MLX (mlx-lm): 未登録。「未登録」はその時点の登録表に名前が無いという意味で、動かないことの断定ではありません。
必要メモリは配布ファイルの実サイズに実行時のオーバーヘッド(KVキャッシュ等)を20%見込んだ概算で、文脈長・バッチサイズ・推論エンジンによって増減します。公開元の公称値ではなく、当サイトがファイルサイズから機械的に算出した値です。 他のモデルとの比較はVRAM別の早見表を参照してください。 量子化の名前の読み方は用語集にあります。
手元で動かせるか
Ollama・LM Studio・llama.cpp で動かせます(変換版を利用)。
公開元の配布は safetensors ですが、unsloth/DeepSeek-V4-Pro-0813-GGUF が GGUF版を公開しているため、そちらを使えば手元で動きます。
ライセンス mit(商用利用可): 商用利用を含めて自由に利用・改変・再配布できます。再配布時に著作権表示とライセンス文を残すことが条件です。
配布形式・当サイトが見つけた変換版・各推論エンジンの登録表を突き合わせた判定です。「確認できていない」は当サイトが見つけていないという意味で、存在しないことの断定ではありません。ライセンスの要約は法的助言ではないため、実際の利用にあたっては公開元の原文を確認してください。
入手方法
- 配布形式: Hugging Face の
deepseek-ai/DeepSeek-V4-Pro-0813に、safetensors 形式の重み(FP8)が置かれている。ダウンロードに利用規約への同意は要らない - 入手コマンドの例:
huggingface-cli download deepseek-ai/DeepSeek-V4-Pro-0813 - 対応エンジン: モデルカードが案内しているのは vLLM と SGLang。どちらも DSpark による投機的デコードを有効にできる。vLLM では起動コマンドに
--speculative-config '{"method":"dspark","num_speculative_tokens":7,"draft_sample_method":"greedy"}'を足し、SGLang では--speculative-algorithm DSPARKを指定する。SGLang ではドラフトの重みも同じチェックポイントから読むので、--speculative-draft-model-pathは指定しない - チャットテンプレート: このリリースには、多くのツールが使う Jinja 形式のチャットテンプレートが含まれていない。代わりにリポジトリの
encodingフォルダに、OpenAI 互換のメッセージをモデルへの入力文字列に変換し、出力を解析する Python のスクリプトとテストケースが入っている。各エンジンの対応状況を確かめてから使う必要がある - 自前で動かす場合: リポジトリの
inferenceフォルダに、重みの変換と対話デモの手順がある。モデルカードの推奨はtemperature = 1.0で、top_pはエージェント用途で 0.95、それ以外で 1.0 - 家庭用の環境で動かすための GGUF 版などは、モデルカードでは案内されていない
派生版・量子化版
→ 横にスクロールできます
| 追記日 | 配布元 | 形式 | リポジトリ | 最小のVRAM階層(量子化・必要メモリの目安) |
|---|---|---|---|---|
| 2026-09-26 | unsloth | GGUF | unsloth/DeepSeek-V4-Pro-0813-GGUF | Q4_K_XL 949.6GB(単体のGPUには収まらない) |
| 2026-09-26 | unsloth | FP8 | unsloth/DeepSeek-V4-Pro-0813 | FP8 997.7GB(単体のGPUには収まらない) |
| 2026-09-26 | DevQuasar | GGUF | DevQuasar/deepseek-ai.DeepSeek-V4-Pro-0813-GGUF | Q2_K 636.4GB(単体のGPUには収まらない) |
各リポジトリの量子化とファイルサイズ:
- unsloth/DeepSeek-V4-Pro-0813-GGUF の量子化: Q4_K_XL 791.3GB / Q8_K_XL 813.5GB
- unsloth/DeepSeek-V4-Pro-0813 の量子化: FP8 831.4GB
- DevQuasar/deepseek-ai.DeepSeek-V4-Pro-0813-GGUF の量子化: Q2_K 530.3GB / Q3_K_M 697.0GB / Q4_K_M 885.6GB
このほか、上記以外の投稿者による変換版が 8 件あります(当サイトは公開元自身と、実績のある量子化担当の配布だけを表に載せています)。
この節は、記事公開後に見つかった変換版を当サイトが機械的に追記したものです。必要メモリは配布ファイルのサイズから算出した概算です。 量子化の名前の読み方は用語集にあります。
関連記事
- 「DeepSeek-V4-Pro-0813-nvfp4-DSpark」テキスト生成モデル:必要メモリ約1005GB
- 「DeepSeek-V4.1-Flash」552BのマルチモーダルMoEモデル:必要メモリ約570GB
- 「K2-Horizon-32B-NVFP4」長文・推論対応モデル:必要VRAM 32GB〜
- 「K2-Horizon-375B-A23B-NVFP4」NVFP4量子化の巨大MoEモデル:必要メモリ約257GB
次に読むなら
- GPUのVRAMから探す(このモデルは80GBの階層にも収まりません。最小構成でも約998GB) → 80GB超のモデルも並べたVRAM別の早見表
- 同じモデル系統を調べる → DeepSeek-V4 系統のまとめ(記事2本・変換版3件)
- このモデルを動かすエンジンを調べる → llama.cpp / Ollama / vLLM
- 入手できる形式と、表に出てくる FP8 の意味を知る → GGUF形式の解説と対応モデル / FP8形式の解説と対応モデル / 量子化・モデル形式の用語集
- 公開元について調べる → DeepSeek のモデル・ライセンス・記事のまとめ
出典
更新履歴
- 2026-09-26: 変換版を「派生版・量子化版」に追記しました: unsloth/DeepSeek-V4-Pro-0813-GGUF, unsloth/DeepSeek-V4-Pro-0813, DevQuasar/deepseek-ai.DeepSeek-V4-Pro-0813-GGUF
- 2026-09-26: タイトルを、記事で分かる内容(必要VRAM・配布ファイル等)を示す形に変更しました。

