GPTQ形式とは:対応エンジンと入手できるモデルまとめ

GPTQ とは

GPTQ は、2022年に発表された、学習済みの LLM を後から 3〜4bit 程度に量子化する手法です。少量のデータ(キャリブレーション用のテキスト)を流しながら、1層ずつ「量子化で生じた誤差を、まだ量子化していない重みで打ち消す」ように丸めていくのが特徴です。Hugging Face では、名前に GPTQ の付いたリポジトリ(中身は .safetensors)として配られています。

何がうれしいのか

  • GPU 向けの 4bit 量子化として早くから広まりました。 大きなモデルを1枚の GPU に収める手段として定着し、古いモデルも含めて量子化版が多く残っています。
  • 対応するエンジンが多いです。 vLLM・SGLang・Transformers が読み込めます。vLLM の対応表では、GPTQ は NVIDIA の幅広い世代の GPU が対象です。
  • ビット数やグループの大きさを選べます。 4bit・3bit、グループの大きさ(128g など)の違う版が並ぶことがあり、小さいほどファイルは小さく、精度は落ちやすくなります。

手元で動かすときのポイント

  • NVIDIA の GPU が前提です。 CPU や Mac で動かすなら GGUF・MLX を選びます。Ollama・LM Studio(llama.cpp 系)では読み込めません。
  • AWQ とは用途が重なります。 どちらも GPU で重みだけを 4bit にする形式です。同じモデルに両方あれば、使うエンジンの対応と、配布者が示す評価の結果で選びます。
  • 量子化のツールは GPTQModel に引き継がれています。 以前の AutoGPTQ は開発が止まっており、vLLM のドキュメントも GPTQModel を案内しています。

出典: GPTQ の論文(arXiv:2210.17323)、vLLM の量子化のドキュメント、ModelCloud/GPTQModel の README(いずれも 2026-09-27 時点)。

当サイトの記録とデータ

当サイトは、GPTQ形式で入手できるモデルの記事を1本公開しています(記事のリポジトリ自体がGPTQ形式のもの0本、そのモデルのGPTQ版を確認したもの1本)。下の一覧は当サイトが確認した範囲(公開元の組織と、実績のある量子化の配布者)に限られます。一覧に無いモデルにもGPTQ版が存在することがあります。モデル形式別まとめの1ページです。

対応する主なエンジン

エンジン 概要
vLLM PagedAttention による高スループットのLLM推論サーバー。複数リクエストの同時処理と量子化(AWQ / GPTQ / FP8)に対応し、サーバー用途のGPUで広く使われる。
SGLang RadixAttention によるプレフィックスキャッシュと構造化出力を特徴とするLLM推論サーバー。vLLMと並ぶサーバー用途の選択肢。

GPTQ形式で入手できるモデル

→ 横にスクロールできます

公開日 モデル 入手先 量子化 最小のVRAM階層 記事
2026-09-08 openbmb/MiniCPM5-2B openbmb/MiniCPM5-2B-GPTQ GPTQ 4GB 「MiniCPM5-2B」コードや数学に強いオンデバイスモデル:必要VRAM 4GB〜・GGUF版あり

「最小のVRAM階層」は各記事の動作環境の表(変換版は、その変換版のファイル。画像・動画・音声のモデルは部品まで数えた記事の表)で最も小さい構成が収まる階層です。コンテキスト長に応じた余裕を見込んでください。

最終更新 2026-09-08(JST)。ページ前半の解説は、出典に挙げた一次資料をもとに AI を用いて執筆したものです。「当サイトの記録とデータ」以降の表は、記事ログからコードが組み立てています。