GPTQ形式とは:対応エンジンと入手できるモデルまとめ
GPTQ とは
GPTQ は、2022年に発表された、学習済みの LLM を後から 3〜4bit 程度に量子化する手法です。少量のデータ(キャリブレーション用のテキスト)を流しながら、1層ずつ「量子化で生じた誤差を、まだ量子化していない重みで打ち消す」ように丸めていくのが特徴です。Hugging Face では、名前に GPTQ の付いたリポジトリ(中身は .safetensors)として配られています。
何がうれしいのか
- GPU 向けの 4bit 量子化として早くから広まりました。 大きなモデルを1枚の GPU に収める手段として定着し、古いモデルも含めて量子化版が多く残っています。
- 対応するエンジンが多いです。 vLLM・SGLang・Transformers が読み込めます。vLLM の対応表では、GPTQ は NVIDIA の幅広い世代の GPU が対象です。
- ビット数やグループの大きさを選べます。 4bit・3bit、グループの大きさ(
128gなど)の違う版が並ぶことがあり、小さいほどファイルは小さく、精度は落ちやすくなります。
手元で動かすときのポイント
- NVIDIA の GPU が前提です。 CPU や Mac で動かすなら GGUF・MLX を選びます。Ollama・LM Studio(llama.cpp 系)では読み込めません。
- AWQ とは用途が重なります。 どちらも GPU で重みだけを 4bit にする形式です。同じモデルに両方あれば、使うエンジンの対応と、配布者が示す評価の結果で選びます。
- 量子化のツールは GPTQModel に引き継がれています。 以前の AutoGPTQ は開発が止まっており、vLLM のドキュメントも GPTQModel を案内しています。
出典: GPTQ の論文(arXiv:2210.17323)、vLLM の量子化のドキュメント、ModelCloud/GPTQModel の README(いずれも 2026-09-27 時点)。
当サイトの記録とデータ
当サイトは、GPTQ形式で入手できるモデルの記事を1本公開しています(記事のリポジトリ自体がGPTQ形式のもの0本、そのモデルのGPTQ版を確認したもの1本)。下の一覧は当サイトが確認した範囲(公開元の組織と、実績のある量子化の配布者)に限られます。一覧に無いモデルにもGPTQ版が存在することがあります。モデル形式別まとめの1ページです。
対応する主なエンジン
| エンジン | 概要 |
|---|---|
| vLLM | PagedAttention による高スループットのLLM推論サーバー。複数リクエストの同時処理と量子化(AWQ / GPTQ / FP8)に対応し、サーバー用途のGPUで広く使われる。 |
| SGLang | RadixAttention によるプレフィックスキャッシュと構造化出力を特徴とするLLM推論サーバー。vLLMと並ぶサーバー用途の選択肢。 |
GPTQ形式で入手できるモデル
→ 横にスクロールできます
| 公開日 | モデル | 入手先 | 量子化 | 最小のVRAM階層 | 記事 |
|---|---|---|---|---|---|
| 2026-09-08 | openbmb/MiniCPM5-2B | openbmb/MiniCPM5-2B-GPTQ | GPTQ | 4GB | 「MiniCPM5-2B」コードや数学に強いオンデバイスモデル:必要VRAM 4GB〜・GGUF版あり |
「最小のVRAM階層」は各記事の動作環境の表(変換版は、その変換版のファイル。画像・動画・音声のモデルは部品まで数えた記事の表)で最も小さい構成が収まる階層です。コンテキスト長に応じた余裕を見込んでください。
最終更新 2026-09-08(JST)。ページ前半の解説は、出典に挙げた一次資料をもとに AI を用いて執筆したものです。「当サイトの記録とデータ」以降の表は、記事ログからコードが組み立てています。