DeepSeek-V4.1 まとめ:必要VRAM
このモデルについて
DeepSeek-V4.1-Flash は、DeepSeek が公開した大規模な MoE モデルです。本体(バックボーン)のパラメータは 552B で、1トークンあたりに動くのは 8B〜16B です。モデルカードは追加の構成要素として、トークンに応じて必要な部分だけを引く記憶用の「Engram」(196B)などを挙げており、Hugging Face 上の総パラメータ数は 763.2B です。最大 100万トークンの文脈に対応し、画像とテキストを最初から一緒に学習したマルチモーダルモデルでもあります。45T トークンのデータで一から学習されています。
「推論にどれだけ手間をかけるか」を 1〜100 の整数で細かく調整できるのも特徴で、速さ・コストと正確さのバランスを用途ごとに選べます。
何がすごいのか
1. 長い文脈を扱うときのメモリが大幅に減りました。 文脈を覚えておくためのメモリ(KV キャッシュ)は、1トークンあたり 890 バイトです。前世代の DeepSeek-V4-Flash の約 1/4、初代 DeepSeek の約 1/437 にあたります。層ごとに KV を共有・再利用する新しいアテンション(CSA2)と、KV キャッシュ自体の 4bit 化の組み合わせによるものです。100万トークン級の文脈を実用的なメモリ量で扱うための工夫で、モデル名の副題も「KV キャッシュ圧縮の限界に挑む」です。
2. エージェント系の課題では最前線のクローズドモデルと並びます。 公開元の比較表(推論の手間を最大にした設定)から抜粋します。
→ 横にスクロールできます
| 評価(何を測るか) | V4.1-Flash | V4-Flash(前世代) | V4-Pro(前世代の上位) | Claude Opus 5.0 | GPT-5.6 Sol |
|---|---|---|---|---|---|
| Terminal-Bench 2.1(ターミナル操作) | 90.6 | 82.7 | 87.9 | 89.1 | 88.8 |
| DeepSWE v1.1(ソフトウェア修正) | 74.2 | 54.4 | 62.7 | 74.0 | 73.0 |
| AutomationBench(業務の自動化) | 54.8 | 37.7 | 43.2 | 50.3 | 45.8 |
| HLE w/ tools(道具ありの難問) | 63.9 | 51.5 | 60.0 | 63.6 | — |
| Terminal-Bench 3.0(より難しいターミナル操作) | 30.0 | 7.6 | 11.8 | 43.3 | 34.4 |
| Terminal-Bench 4.0(さらに難しいターミナル操作) | 31.2 | 7.0 | 12.4 | 51.8 | 39.9 |
| ProgramBench(プログラムを一から作る) | 20.3 | — | 15.5 | 37.0 | 23.0 |
| GPQA Diamond(大学院レベルの科学) | 90.9 | 89.9 | 92.4 | 93.4 | 94.1 |
- 前世代の上位モデル V4-Pro(本体 1.6T)を、3分の1ほどの大きさで多くの項目で上回っています。
- Terminal-Bench 2.1・DeepSWE・AutomationBench などでは Claude Opus 5.0・GPT-5.6 Sol と同等か上回ります。
- ただし、より難しい課題では Opus 5.0 との差がはっきりしています。 Terminal-Bench 3.0 で 13ポイント、4.0 で 20ポイント、ProgramBench で 17ポイント、リポジトリを一から作る NL2Repo-Bench で 11ポイント(64.0 対 75.3)、道具を使わない HLE では 20ポイント近く(36.8 対 56.3)離されています。知識を問う GPQA でも最上位ではありません。「よく知られた課題では最前線に並ぶが、最も難しい課題ではまだ差がある」と読むのが妥当です。
手元で動かすときのポイント
- 家庭用の GPU で動かせるモデルではありません。 総パラメータ 763.2B は、量子化しても数百 GB のメモリが必要になる規模です。KV キャッシュの削減は、主に大規模なサーバーで長い文脈を扱うときに効く改良です。
- このリリースには、多くのツールが使う Jinja 形式のチャットテンプレートが含まれていません。代わりに Python の参照実装(
encoding)と Rust 製のライブラリ(deepseek-recipe)が公開されているので、各推論エンジンの対応を待つか、それらを使う必要があります。 - ライセンスは MIT で、商用利用もできます。
- このシリーズの記事には、第三者(dealignai)が安全対策を外した FP8 版も含まれます。公式のモデルとは重みが異なる別物です。
出典: deepseek-ai/DeepSeek-V4.1-Flash のモデルカード(2026-09-25 時点)。ベンチマークの数値は公開元が掲載した値です。
当サイトの記録とデータ
当サイトが DeepSeek-V4.1 系統について公開した記事(2本)と、記事の公開後に見つかった変換版(GGUF・MLX等)、必要メモリの判定を1ページにまとめたものです。必要メモリはモデルカードの公称値ではなく、当サイトが配布ファイルのサイズから機械的に算出した値です。モデル系統別まとめの1ページです。
基本情報
| 項目 | 内容 |
|---|---|
| 元のモデル | deepseek-ai/DeepSeek-V4.1-Flash |
| 公開元 | DeepSeek |
| パラメータ数 | 763.2B |
| ライセンス(モデルカード) | mit |
| 記事数 | 2本 |
動作環境
動作環境の目安(Local Model Watch 算出) — パラメータ数 763.2B
| 手持ちのVRAM | 選べる量子化 | ファイルサイズ | 必要メモリの目安 |
|---|---|---|---|
| 570GB超のVRAMが必要(複数GPUまたはCPUオフロードが前提) | FP8 | 475.3GB | 570.3GB |
必要メモリは配布ファイルの実サイズに実行時のオーバーヘッド(KVキャッシュ等)を20%見込んだ概算で、文脈長・バッチサイズ・推論エンジンによって増減します。公開元の公称値ではなく、当サイトがファイルサイズから機械的に算出した値です。 他のモデルとの比較はVRAM別の早見表を参照してください。 量子化の名前の読み方は用語集にあります。
手元で動かせるか
現時点では Ollama・LM Studio・llama.cpp で動かせません。
公開元の配布は safetensors のみで、llama.cpp の登録表にもこのモデルのアーキテクチャ名がありません。これらのツールで動かせるようになるには、まず llama.cpp 側が対応する必要があります。公開元と実績のある量子化担当以外による変換版は 46 件あります。現時点で動かすなら transformers(PyTorch)・vLLM で読み込む形になり、必要メモリは上の表のとおりです。
ライセンス mit(商用利用可): 商用利用を含めて自由に利用・改変・再配布できます。再配布時に著作権表示とライセンス文を残すことが条件です。
配布形式・当サイトが見つけた変換版・各推論エンジンの登録表を突き合わせた判定です。「確認できていない」は当サイトが見つけていないという意味で、存在しないことの断定ではありません。ライセンスの要約は法的助言ではないため、実際の利用にあたっては公開元の原文を確認してください。
派生版・量子化版
→ 横にスクロールできます
| 追記日 | 配布元 | 形式 | リポジトリ | 最小のVRAM階層(量子化・必要メモリの目安) |
|---|---|---|---|---|
| 2026-09-17 | nvidia | NVFP4 | nvidia/DeepSeek-V4.1-Flash-NVFP4 | BF16 1690.8GB(単体のGPUには収まらない) |
この節は、記事公開後に見つかった変換版を当サイトが機械的に追記したものです。必要メモリは配布ファイルのサイズから算出した概算です。
記事(シリーズ自身のモデルを先に、新しい順)
| 公開日 | モデル | 種類 | 記事 |
|---|---|---|---|
| 2026-09-10 | deepseek-ai/DeepSeek-V4.1-Flash | 新モデル | 「DeepSeek-V4.1-Flash」552BのマルチモーダルMoEモデル:必要メモリ約570GB |
| 2026-09-13 | dealignai/DeepSeek-V4.1-Flash-UNCENSORED-FP8 | 新モデル | 「DeepSeek-V4.1-Flash-UNCENSORED-FP8」VLMモデル:必要メモリ約570GB |
リポジトリ
最終更新 2026-09-27(JST)。ページ前半の解説は、出典に挙げた一次資料をもとに AI を用いて執筆したものです。「当サイトの記録とデータ」以降の表と一覧は、記事ログからコードが組み立てています。