NVFP4・MXFP4形式とは:対応エンジンと入手できるモデルまとめ
NVFP4・MXFP4 とは
NVFP4 と MXFP4 は、重みを 4bit の浮動小数点数で持つ形式です。4bit では表せる値がごく少ないので、どちらも重みを小さなブロックに分け、ブロックごとに「倍率(スケール)」を持たせて精度を補います。
- MXFP4 は、業界団体 OCP(Open Compute Project)の「Microscaling(MX)」という規格の一つで、32個の値ごとに倍率を持ちます。OpenAI の gpt-oss が MoE の重みをこの形式で公開したことで広く知られました。
- NVFP4 は NVIDIA の形式で、16個の値ごとに FP8 の倍率を持つなど、MXFP4 より細かく倍率を持たせて精度を上げています。NVIDIA などが、大きなモデルの NVFP4 版を公開しています。
Hugging Face では、名前に NVFP4
MXFP4 の付いたリポジトリ(中身は .safetensors)として配られることが多い形式です。
何がうれしいのか
- 元の BF16 のおよそ4分の1の大きさになります。 巨大なモデルを、より少ない GPU に載せられます。
- 最新の GPU では計算そのものを 4bit で行えます。 NVIDIA の Blackwell 世代(B200・RTX 50 系など)は 4bit の浮動小数点の計算をハードウェアで持っており、速度の面でも有利です。
- それより前の GPU でも読み込める場合があります。 vLLM は、重みだけを 4bit にして計算は 16bit で行う方式(Marlin)で、Ampere などの世代にも対応しています(対応表の注記では、Turing は Marlin の MXFP4 に非対応)。
手元で動かすときのポイント
- 主に vLLM・SGLang・TensorRT-LLM で動かす形式です。 Ollama・LM Studio はこの
.safetensorsを読み込めません。ただし llama.cpp は gpt-oss 用に MXFP4 の GGUF を扱えるので、gpt-oss なら GGUF 版を選べます。 - 量子化の方式が同じ名前でも、どこまで 4bit にしたかは配布ごとに違います。 MoE のエキスパートだけを 4bit にして残りを FP8 や BF16 に残す、といった混合も普通です。必要メモリは記事の動作環境の表(実ファイルのサイズ)で確かめてください。
出典: vLLM の量子化のドキュメント(ハードウェアの対応表)、NVIDIA の技術ブログ「Introducing NVFP4」、OCP Microscaling Formats(MX)v1.0 の仕様、openai/gpt-oss-20b のモデルカード(いずれも 2026-09-27 時点)。
当サイトの記録とデータ
当サイトは、NVFP4・MXFP4形式で入手できるモデルの記事を6本公開しています(記事のリポジトリ自体がNVFP4・MXFP4形式のもの3本、そのモデルのNVFP4・MXFP4版を確認したもの3本)。下の一覧は当サイトが確認した範囲(公開元の組織と、実績のある量子化の配布者)に限られます。一覧に無いモデルにもNVFP4・MXFP4版が存在することがあります。モデル形式別まとめの1ページです。
対応する主なエンジン
| エンジン | 概要 |
|---|---|
| vLLM | PagedAttention による高スループットのLLM推論サーバー。複数リクエストの同時処理と量子化(AWQ / GPTQ / FP8)に対応し、サーバー用途のGPUで広く使われる。 |
| SGLang | RadixAttention によるプレフィックスキャッシュと構造化出力を特徴とするLLM推論サーバー。vLLMと並ぶサーバー用途の選択肢。 |
NVFP4・MXFP4形式で入手できるモデル
→ 横にスクロールできます
| 公開日 | モデル | 入手先 | 量子化 | 最小のVRAM階層 | 記事 |
|---|---|---|---|---|---|
| 2026-09-27 | XiaomiMiMo/MiMo-V2.6-Pro-RL | mlx-community/MiMo-V2.6-Pro-RL-mxfp4-q8 | MLX 4bit | — | XiaomiMiMo-V2.6-Pro-RL公開:1.02TのMoEマルチモーダルモデル |
| 2026-09-26 | Qwen/Qwen3.8-27B | unsloth/Qwen3.8-27B-NVFP4 | NVFP4 | 32GB | 「Qwen3.8-27B」マルチモーダル視覚言語モデル:必要VRAM 8GB〜・GGUF版あり |
| 2026-09-23 | IFM/K2-Horizon-32B-NVFP4 | このリポジトリ | — | 32GB | 「K2-Horizon-32B-NVFP4」長文・推論対応モデル:必要VRAM 32GB〜 |
| 2026-09-23 | IFM/K2-Horizon-375B-A23B-NVFP4 | このリポジトリ | — | — | 「K2-Horizon-375B-A23B-NVFP4」NVFP4量子化の巨大MoEモデル:必要メモリ約257GB |
| 2026-09-10 | nvidia/DeepSeek-V4-Pro-0813-nvfp4-DSpark | このリポジトリ | — | — | 「DeepSeek-V4-Pro-0813-nvfp4-DSpark」テキスト生成モデル:必要メモリ約1005GB |
| 2026-09-10 | deepseek-ai/DeepSeek-V4.1-Flash | nvidia/DeepSeek-V4.1-Flash-NVFP4 | — | — | 「DeepSeek-V4.1-Flash」552BのマルチモーダルMoEモデル:必要メモリ約570GB |
「最小のVRAM階層」は各記事の動作環境の表(変換版は、その変換版のファイル。画像・動画・音声のモデルは部品まで数えた記事の表)で最も小さい構成が収まる階層です。コンテキスト長に応じた余裕を見込んでください。
最終更新 2026-09-27(JST)。ページ前半の解説は、出典に挙げた一次資料をもとに AI を用いて執筆したものです。「当サイトの記録とデータ」以降の表は、記事ログからコードが組み立てています。