FP8形式とは:対応エンジンと入手できるモデルまとめ
FP8 とは
FP8 は、重みを 8bit の浮動小数点数で持つ形式です。元の BF16 / FP16(16bit)と比べてファイルと必要メモリがおよそ半分になります。整数に丸める 8bit(INT8)と違い、小さな値から大きな値まで幅広く表せるので、精度を落としにくいのが特徴です。Hugging Face では、名前に FP8 の付いたリポジトリ(中身は .safetensors)として配られ、公開元自身が FP8 版を公式に出すことも増えています。
何がうれしいのか
- ほぼ元の精度のまま、半分の大きさになります。 4bit の量子化より精度の低下が小さく、大きなモデルをサーバーで動かす際の定番になっています。
- 新しい GPU では計算も速くなります。 vLLM の対応表では、重みと計算の両方を FP8 にする方式(W8A8)は Ada(RTX 40 系)と Hopper(H100 など)の世代が対象です。それより前の Ampere(RTX 30 系)でも、重みだけを FP8 にして計算は 16bit で行う方式(Marlin)で読み込めます。
- vLLM・SGLang で、元のモデルとほぼ同じ手順で動かせます。
手元で動かすときのポイント
- 家庭用の GPU では、まだ大きい形式です。 パラメータ数とほぼ同じバイト数が要ります(例えば 32B のモデルで約32GB)。1枚の GPU で動かすなら、GGUF の 4bit などの方が現実的です。
- Ollama・LM Studio(llama.cpp 系)では読み込めません。
- 公開元の FP8 版は、元のモデルと同じリポジトリの組織から出ていることが多いです。 第三者の変換版より、公開元が評価を示している公式版を優先するのが安全です。
出典: vLLM の量子化のドキュメント(ハードウェアの対応表)(2026-09-27 時点)。
当サイトの記録とデータ
当サイトは、FP8形式で入手できるモデルの記事を4本公開しています(記事のリポジトリ自体がFP8形式のもの1本、そのモデルのFP8版を確認したもの3本)。下の一覧は当サイトが確認した範囲(公開元の組織と、実績のある量子化の配布者)に限られます。一覧に無いモデルにもFP8版が存在することがあります。モデル形式別まとめの1ページです。
対応する主なエンジン
| エンジン | 概要 |
|---|---|
| vLLM | PagedAttention による高スループットのLLM推論サーバー。複数リクエストの同時処理と量子化(AWQ / GPTQ / FP8)に対応し、サーバー用途のGPUで広く使われる。 |
| SGLang | RadixAttention によるプレフィックスキャッシュと構造化出力を特徴とするLLM推論サーバー。vLLMと並ぶサーバー用途の選択肢。 |
FP8形式で入手できるモデル
→ 横にスクロールできます
| 公開日 | モデル | 入手先 | 量子化 | 最小のVRAM階層 | 記事 |
|---|---|---|---|---|---|
| 2026-09-26 | deepseek-ai/DeepSeek-V4-Pro-0813 | unsloth/DeepSeek-V4-Pro-0813 | FP8 | — | 「DeepSeek-V4-Pro-0813」エージェント能力を強化した大規模MoEモデル:必要メモリ約998GB |
| 2026-09-26 | Qwen/Qwen3.8-27B | Qwen/Qwen3.8-27B-FP8 | — | — | 「Qwen3.8-27B」マルチモーダル視覚言語モデル:必要VRAM 8GB〜・GGUF版あり |
| 2026-09-21 | abenzerps/Qwen-Image-2.1-Uncensored-GGUF | unsloth/Qwen-Image-2.1-FP8 | FP8, INT8, FP8(Qwen-Image-2.1-text_encoder-FP8) | 16GB | 「Qwen-Image-2.1-Uncensored-GGUF」画像生成モデル:必要VRAM 16GB〜 |
| 2026-09-13 | dealignai/DeepSeek-V4.1-Flash-UNCENSORED-FP8 | このリポジトリ | — | — | 「DeepSeek-V4.1-Flash-UNCENSORED-FP8」VLMモデル:必要メモリ約570GB |
「最小のVRAM階層」は各記事の動作環境の表(変換版は、その変換版のファイル。画像・動画・音声のモデルは部品まで数えた記事の表)で最も小さい構成が収まる階層です。コンテキスト長に応じた余裕を見込んでください。
最終更新 2026-09-26(JST)。ページ前半の解説は、出典に挙げた一次資料をもとに AI を用いて執筆したものです。「当サイトの記録とデータ」以降の表は、記事ログからコードが組み立てています。