GGUF形式とは:対応エンジンと入手できるモデルまとめ

GGUF とは

GGUF は、C/C++ の推論エンジン llama.cpp とその土台のライブラリ ggml のために作られた、モデルの配布形式です。重み(テンソル)と、モデルの構造・トークナイザー・チャットの書式などの情報(メタデータ)を1つのファイルにまとめて持ちます。ファイルを1つ落とせばそのまま動かせるので、ローカルLLMでは最もよく使われる形式になっています。

何がうれしいのか

  • 量子化の選択肢が細かくそろっています。 同じモデルに Q8_0・Q6_K・Q5_K_M・Q4_K_M・Q3_K_M・IQ2_XXS のような精度違いのファイルが並び、手元の GPU のメモリに合わせて選べます。名前の読み方は量子化・モデル形式の用語集にまとめています。
  • GPU が無くても動きます。 CPU だけでも、NVIDIA(CUDA)・AMD(ROCm / Vulkan)・Apple Silicon(Metal)の GPU でも動き、GPU に載りきらない層を CPU に回す(部分オフロード)こともできます。
  • 対応するアプリが多いです。 Ollama・LM Studio・KoboldCpp・Jan などの多くは内部で llama.cpp を使っており、GGUF をそのまま読み込めます。

手元で動かすときのポイント

  • 迷ったら Q4_K_M から試すのが定番です。 精度の落ち方とファイルの小ささの釣り合いがよく、多くの量子化の配布者が推奨の目安に挙げています。メモリに余裕があれば Q5_K_M・Q6_K へ上げます。
  • ファイルの大きさ+コンテキストの分がメモリに要ります。 会話が長くなるほど KV キャッシュが増えるので、ファイルサイズぎりぎりの GPU では足りません。当サイトの記事の「動作環境」の表は、配布ファイルの実サイズから必要メモリを算出しています。
  • 画像を扱うモデルは mmproj ファイルが別に要ります。 視覚エンコーダの部分は本体とは別の GGUF で配られることが多いので、一緒に落とします。
  • 公式の GGUF が無いモデルも多いです。 その場合は bartowski・unsloth など量子化の配布者が作った版を使います。下の一覧では、記事のリポジトリ自体が GGUF のものと、変換版を確認したものを分けて載せています。

出典: GGUF の仕様(ggml-org/ggml の docs/gguf.md)、Hugging Face Hub の GGUF の説明、llama.cpp の README(いずれも 2026-09-27 時点)。

当サイトの記録とデータ

当サイトは、GGUF形式で入手できるモデルの記事を22本公開しています(記事のリポジトリ自体がGGUF形式のもの12本、そのモデルのGGUF版を確認したもの10本)。下の一覧は当サイトが確認した範囲(公開元の組織と、実績のある量子化の配布者)に限られます。一覧に無いモデルにもGGUF版が存在することがあります。モデル形式別まとめの1ページです。

対応する主なエンジン

エンジン 概要
llama.cpp C/C++で書かれたLLM推論エンジン。GGUF形式のモデルをCPU・GPU(CUDA / Metal / Vulkan / ROCm)で動かす。ローカルLLMのエコシステムの土台で、Ollama・LM Studio・KoboldCppなどが内部で使っている。
Ollama コマンド1つでモデルの取得と実行ができるローカルLLMランタイム。OpenAI互換のAPIサーバーを内蔵し、macOS / Linux / Windows に対応する。
KoboldCpp llama.cpp を単一実行ファイルにまとめ、Web UI と API を同梱したランタイム。GGUFモデルをダウンロードして起動するだけで使える。
llamafile モデルの重みと llama.cpp を1つの実行ファイルにまとめ、OSを問わずそのまま実行できるようにする配布形式。
LocalAI OpenAI API 互換のセルフホスト推論サーバー。テキスト・画像・音声など複数のバックエンドを1つのAPIで扱う。
Jan オフラインで動くデスクトップのチャットアプリ。llama.cpp を内蔵し、ローカルAPIサーバーとしても使える。

GGUF形式で入手できるモデル

→ 横にスクロールできます

公開日 モデル 入手先 量子化 最小のVRAM階層 記事
2026-09-26 MiniMaxAI/MiniMax-H3 unsloth/MiniMax-H3-GGUF Q2_K, Q2_K_XL, Q3_K, Q3_K_XL, Q4_K, Q2_K_M … 32GB 「MiniMax-H3」音声付き動画生成モデル:必要VRAM 32GB〜・配布ファイル一覧
2026-09-26 deepseek-ai/DeepSeek-V4-Pro-0813 unsloth/DeepSeek-V4-Pro-0813-GGUF, DevQuasar/deepseek-ai.DeepSeek-V4-Pro-0813-GGUF Q4_K_XL, Q8_K_XL, Q2_K, Q3_K_M, Q4_K_M — 「DeepSeek-V4-Pro-0813」エージェント能力を強化した大規模MoEモデル:必要メモリ約998GB
2026-09-26 Qwen/Qwen3.8-27B unsloth/Qwen3.8-27B-GGUF, lmstudio-community/Qwen3.8-27B-GGUF IQ1_S, IQ1_M, IQ2_XXS, IQ2_S, Q2_K_XL, IQ3_XXS … 8GB 「Qwen3.8-27B」マルチモーダル視覚言語モデル:必要VRAM 8GB〜・GGUF版あり
2026-09-25 LiquidAI/LFM2.5-VL-3B-DSpark LiquidAI/LFM2.5-VL-3B-DSpark-GGUF F16 4GB 「LFM2.5-VL-3B-DSpark」ビジョン言語モデル向けドラフトモデル:必要VRAM 4GB〜・GGUF版あり
2026-09-24 pfnet/plamo-3-610m-fin-instruct mradermacher/plamo-3-610m-fin-instruct-GGUF Q2_K, Q3_K_S, Q3_K_M, Q3_K_L, IQ4_XS, Q4_K_S … 4GB 「plamo-3-610m-fin-instruct」金融特化型の軽量日本語言語モデル:必要VRAM 4GB〜
2026-09-24 togethercomputer/Tev1-4B-experimental bartowski/togethercomputer_Tev1-4B-experimental-GGUF IQ2_M, Q2_K, IQ3_XXS, Q3_K_S, IQ3_XS, Q3_K_M … 4GB 「Tev1-4B-experimental」構造化データの意思決定に特化した4Bモデル:必要VRAM 4GB〜
2026-09-22 ggml-org/MiMo-V2.6-Flash-RL-GGUF このリポジトリ — — 「MiMo-V2.6-Flash-RL-GGUF」マルチモーダル対応のMoEモデル:必要メモリ約141GB
2026-09-22 ggml-org/MiMo-V2.6-Distill-Qwen-9B-GGUF このリポジトリ — 12GB 「MiMo-V2.6-Distill-Qwen-9B-GGUF」VLMモデル:必要VRAM 12GB〜
2026-09-21 abenzerps/Qwen-Image-2.1-Uncensored-GGUF このリポジトリ — 16GB 「Qwen-Image-2.1-Uncensored-GGUF」画像生成モデル:必要VRAM 16GB〜
2026-09-18 prism-ml/Ternary-Bonsai-2-27B-gguf このリポジトリ — 8GB 「Ternary-Bonsai-2-27B-gguf」テキスト生成モデル:必要VRAM 8GB〜
2026-09-18 tencent/WeVisDoc-4B mradermacher/WeVisDoc-4B-GGUF, mradermacher/WeVisDoc-4B-i1-GGUF Q2_K, Q3_K_S, Q3_K_M, Q3_K_L, IQ4_XS, Q4_K_S … 4GB Tencent、ドキュメント解析モデル「WeVisDoc-2B/4B」公開
2026-09-15 bartowski/vectionlabs_Salience-27B-R6-GGUF このリポジトリ — 12GB 「vectionlabs_Salience-27B-R6-GGUF」VLMモデル:必要VRAM 12GB〜
2026-09-15 bartowski/Intern-S2-397B-GGUF このリポジトリ — — 「Intern-S2-397B-GGUF」科学分野向けマルチモーダル基盤モデル:必要メモリ約102GB
2026-09-14 bartowski/TheDrummer_Orion-26B-A4B-v1.1-GGUF このリポジトリ — 12GB 「TheDrummer_Orion-26B-A4B-v1.1-GGUF」マルチモーダルモデル:必要VRAM 12GB〜
2026-09-13 DavidAU/Qwen3.8-27B-TWIN-TURBO-Fable-Cold-Fusion-709-L-Uncensored-NM-DAU-NEO-MTP-GGUF このリポジトリ — 12GB Qwen3.8-27BカスタムGGUFモデル「TWIN-TURBO」公開、思考トークンを削減
2026-09-12 agentionai/Signal-3.8-27B-GGUF このリポジトリ — 16GB 「Signal-3.8-27B-GGUF」トークン効率を最適化したGGUFモデル:必要VRAM 16GB〜
2026-09-11 bartowski/Gryphe_Pantheon-Reasoning-26B-A4B-1.1-V2-GGUF このリポジトリ — 12GB 「Gryphe_Pantheon-Reasoning-26B-A4B-1.1-V2-GGUF」:必要VRAM 12GB〜
2026-09-09 nex-agi/Nex-N2.5-Pro bartowski/Nex-N2.5-Pro-GGUF, DevQuasar/nex-agi.Nex-N2.5-Pro-GGUF IQ1_S, IQ1_M, IQ2_XXS, IQ2_XS, IQ2_S, IQ2_M … — 「Nex-N2.5-Pro」長期タスク向けエージェントモデル:必要メモリ約98GB・GGUF版あり
2026-09-09 nex-agi/Nex-N2.5-mini bartowski/nex-agi_Nex-N2.5-mini-GGUF, mradermacher/Nex-N2.5-mini-GGUF IQ2_XXS, IQ2_XS, IQ2_S, IQ2_M, Q2_K, IQ3_XXS … 16GB 「Nex-N2.5-mini」長期タスク向けのエージェントモデル:必要VRAM 16GB〜・GGUF版あり
2026-09-08 openbmb/MiniCPM5-2B openbmb/MiniCPM5-2B-GGUF, bartowski/MiniCPM5-2B-GGUF Q4_K_M, Q8_0, F16, IQ2_M, Q2_K, IQ3_XXS … 4GB 「MiniCPM5-2B」コードや数学に強いオンデバイスモデル:必要VRAM 4GB〜・GGUF版あり
2026-09-06 IFM/K2-Horizon-MoVA-36B-A4B-GGUF このリポジトリ — 32GB 「K2-Horizon-MoVA-36B-A4B-GGUF」テキスト生成モデル:必要VRAM 32GB〜
2026-09-06 Jackrong/Qwopus3.8-27B-Flash-GGUF このリポジトリ — 16GB 「Qwopus3.8-27B-Flash-GGUF」エージェント向け軽量化モデル:必要VRAM 16GB〜

「最小のVRAM階層」は各記事の動作環境の表(変換版は、その変換版のファイル。画像・動画・音声のモデルは部品まで数えた記事の表)で最も小さい構成が収まる階層です。コンテキスト長に応じた余裕を見込んでください。

最終更新 2026-09-26(JST)。ページ前半の解説は、出典に挙げた一次資料をもとに AI を用いて執筆したものです。「当サイトの記録とデータ」以降の表は、記事ログからコードが組み立てています。