NVFP4・MXFP4形式とは:対応エンジンと入手できるモデルまとめ

NVFP4・MXFP4 とは

NVFP4 と MXFP4 は、重みを 4bit の浮動小数点数で持つ形式です。4bit では表せる値がごく少ないので、どちらも重みを小さなブロックに分け、ブロックごとに「倍率(スケール)」を持たせて精度を補います。

  • MXFP4 は、業界団体 OCP(Open Compute Project)の「Microscaling(MX)」という規格の一つで、32個の値ごとに倍率を持ちます。OpenAI の gpt-oss が MoE の重みをこの形式で公開したことで広く知られました。
  • NVFP4 は NVIDIA の形式で、16個の値ごとに FP8 の倍率を持つなど、MXFP4 より細かく倍率を持たせて精度を上げています。NVIDIA などが、大きなモデルの NVFP4 版を公開しています。

Hugging Face では、名前に NVFP4 MXFP4 の付いたリポジトリ(中身は .safetensors)として配られることが多い形式です。

何がうれしいのか

  • 元の BF16 のおよそ4分の1の大きさになります。 巨大なモデルを、より少ない GPU に載せられます。
  • 最新の GPU では計算そのものを 4bit で行えます。 NVIDIA の Blackwell 世代(B200・RTX 50 系など)は 4bit の浮動小数点の計算をハードウェアで持っており、速度の面でも有利です。
  • それより前の GPU でも読み込める場合があります。 vLLM は、重みだけを 4bit にして計算は 16bit で行う方式(Marlin)で、Ampere などの世代にも対応しています(対応表の注記では、Turing は Marlin の MXFP4 に非対応)。

手元で動かすときのポイント

  • 主に vLLM・SGLang・TensorRT-LLM で動かす形式です。 Ollama・LM Studio はこの .safetensors を読み込めません。ただし llama.cpp は gpt-oss 用に MXFP4 の GGUF を扱えるので、gpt-oss なら GGUF 版を選べます。
  • 量子化の方式が同じ名前でも、どこまで 4bit にしたかは配布ごとに違います。 MoE のエキスパートだけを 4bit にして残りを FP8 や BF16 に残す、といった混合も普通です。必要メモリは記事の動作環境の表(実ファイルのサイズ)で確かめてください。

出典: vLLM の量子化のドキュメント(ハードウェアの対応表)、NVIDIA の技術ブログ「Introducing NVFP4」、OCP Microscaling Formats(MX)v1.0 の仕様、openai/gpt-oss-20b のモデルカード(いずれも 2026-09-27 時点)。

当サイトの記録とデータ

当サイトは、NVFP4・MXFP4形式で入手できるモデルの記事を6本公開しています(記事のリポジトリ自体がNVFP4・MXFP4形式のもの3本、そのモデルのNVFP4・MXFP4版を確認したもの3本)。下の一覧は当サイトが確認した範囲(公開元の組織と、実績のある量子化の配布者)に限られます。一覧に無いモデルにもNVFP4・MXFP4版が存在することがあります。モデル形式別まとめの1ページです。

対応する主なエンジン

エンジン 概要
vLLM PagedAttention による高スループットのLLM推論サーバー。複数リクエストの同時処理と量子化(AWQ / GPTQ / FP8)に対応し、サーバー用途のGPUで広く使われる。
SGLang RadixAttention によるプレフィックスキャッシュと構造化出力を特徴とするLLM推論サーバー。vLLMと並ぶサーバー用途の選択肢。

NVFP4・MXFP4形式で入手できるモデル

→ 横にスクロールできます

公開日 モデル 入手先 量子化 最小のVRAM階層 記事
2026-09-27 XiaomiMiMo/MiMo-V2.6-Pro-RL mlx-community/MiMo-V2.6-Pro-RL-mxfp4-q8 MLX 4bit — XiaomiMiMo-V2.6-Pro-RL公開:1.02TのMoEマルチモーダルモデル
2026-09-26 Qwen/Qwen3.8-27B unsloth/Qwen3.8-27B-NVFP4 NVFP4 32GB 「Qwen3.8-27B」マルチモーダル視覚言語モデル:必要VRAM 8GB〜・GGUF版あり
2026-09-23 IFM/K2-Horizon-32B-NVFP4 このリポジトリ — 32GB 「K2-Horizon-32B-NVFP4」長文・推論対応モデル:必要VRAM 32GB〜
2026-09-23 IFM/K2-Horizon-375B-A23B-NVFP4 このリポジトリ — — 「K2-Horizon-375B-A23B-NVFP4」NVFP4量子化の巨大MoEモデル:必要メモリ約257GB
2026-09-10 nvidia/DeepSeek-V4-Pro-0813-nvfp4-DSpark このリポジトリ — — 「DeepSeek-V4-Pro-0813-nvfp4-DSpark」テキスト生成モデル:必要メモリ約1005GB
2026-09-10 deepseek-ai/DeepSeek-V4.1-Flash nvidia/DeepSeek-V4.1-Flash-NVFP4 — — 「DeepSeek-V4.1-Flash」552BのマルチモーダルMoEモデル:必要メモリ約570GB

「最小のVRAM階層」は各記事の動作環境の表(変換版は、その変換版のファイル。画像・動画・音声のモデルは部品まで数えた記事の表)で最も小さい構成が収まる階層です。コンテキスト長に応じた余裕を見込んでください。

最終更新 2026-09-27(JST)。ページ前半の解説は、出典に挙げた一次資料をもとに AI を用いて執筆したものです。「当サイトの記録とデータ」以降の表は、記事ログからコードが組み立てています。