FP8形式とは:対応エンジンと入手できるモデルまとめ

FP8 とは

FP8 は、重みを 8bit の浮動小数点数で持つ形式です。元の BF16 / FP16(16bit)と比べてファイルと必要メモリがおよそ半分になります。整数に丸める 8bit(INT8)と違い、小さな値から大きな値まで幅広く表せるので、精度を落としにくいのが特徴です。Hugging Face では、名前に FP8 の付いたリポジトリ(中身は .safetensors)として配られ、公開元自身が FP8 版を公式に出すことも増えています。

何がうれしいのか

  • ほぼ元の精度のまま、半分の大きさになります。 4bit の量子化より精度の低下が小さく、大きなモデルをサーバーで動かす際の定番になっています。
  • 新しい GPU では計算も速くなります。 vLLM の対応表では、重みと計算の両方を FP8 にする方式(W8A8)は Ada(RTX 40 系)と Hopper(H100 など)の世代が対象です。それより前の Ampere(RTX 30 系)でも、重みだけを FP8 にして計算は 16bit で行う方式(Marlin)で読み込めます。
  • vLLM・SGLang で、元のモデルとほぼ同じ手順で動かせます。

手元で動かすときのポイント

  • 家庭用の GPU では、まだ大きい形式です。 パラメータ数とほぼ同じバイト数が要ります(例えば 32B のモデルで約32GB)。1枚の GPU で動かすなら、GGUF の 4bit などの方が現実的です。
  • Ollama・LM Studio(llama.cpp 系)では読み込めません。
  • 公開元の FP8 版は、元のモデルと同じリポジトリの組織から出ていることが多いです。 第三者の変換版より、公開元が評価を示している公式版を優先するのが安全です。

出典: vLLM の量子化のドキュメント(ハードウェアの対応表)(2026-09-27 時点)。

当サイトの記録とデータ

当サイトは、FP8形式で入手できるモデルの記事を4本公開しています(記事のリポジトリ自体がFP8形式のもの1本、そのモデルのFP8版を確認したもの3本)。下の一覧は当サイトが確認した範囲(公開元の組織と、実績のある量子化の配布者)に限られます。一覧に無いモデルにもFP8版が存在することがあります。モデル形式別まとめの1ページです。

対応する主なエンジン

エンジン 概要
vLLM PagedAttention による高スループットのLLM推論サーバー。複数リクエストの同時処理と量子化(AWQ / GPTQ / FP8)に対応し、サーバー用途のGPUで広く使われる。
SGLang RadixAttention によるプレフィックスキャッシュと構造化出力を特徴とするLLM推論サーバー。vLLMと並ぶサーバー用途の選択肢。

FP8形式で入手できるモデル

→ 横にスクロールできます

公開日 モデル 入手先 量子化 最小のVRAM階層 記事
2026-09-26 deepseek-ai/DeepSeek-V4-Pro-0813 unsloth/DeepSeek-V4-Pro-0813 FP8 — 「DeepSeek-V4-Pro-0813」エージェント能力を強化した大規模MoEモデル:必要メモリ約998GB
2026-09-26 Qwen/Qwen3.8-27B Qwen/Qwen3.8-27B-FP8 — — 「Qwen3.8-27B」マルチモーダル視覚言語モデル:必要VRAM 8GB〜・GGUF版あり
2026-09-21 abenzerps/Qwen-Image-2.1-Uncensored-GGUF unsloth/Qwen-Image-2.1-FP8 FP8, INT8, FP8(Qwen-Image-2.1-text_encoder-FP8) 16GB 「Qwen-Image-2.1-Uncensored-GGUF」画像生成モデル:必要VRAM 16GB〜
2026-09-13 dealignai/DeepSeek-V4.1-Flash-UNCENSORED-FP8 このリポジトリ — — 「DeepSeek-V4.1-Flash-UNCENSORED-FP8」VLMモデル:必要メモリ約570GB

「最小のVRAM階層」は各記事の動作環境の表(変換版は、その変換版のファイル。画像・動画・音声のモデルは部品まで数えた記事の表)で最も小さい構成が収まる階層です。コンテキスト長に応じた余裕を見込んでください。

最終更新 2026-09-26(JST)。ページ前半の解説は、出典に挙げた一次資料をもとに AI を用いて執筆したものです。「当サイトの記録とデータ」以降の表は、記事ログからコードが組み立てています。