GGUF形式とは:対応エンジンと入手できるモデルまとめ
GGUF とは
GGUF は、C/C++ の推論エンジン llama.cpp とその土台のライブラリ ggml のために作られた、モデルの配布形式です。重み(テンソル)と、モデルの構造・トークナイザー・チャットの書式などの情報(メタデータ)を1つのファイルにまとめて持ちます。ファイルを1つ落とせばそのまま動かせるので、ローカルLLMでは最もよく使われる形式になっています。
何がうれしいのか
- 量子化の選択肢が細かくそろっています。 同じモデルに Q8_0・Q6_K・Q5_K_M・Q4_K_M・Q3_K_M・IQ2_XXS のような精度違いのファイルが並び、手元の GPU のメモリに合わせて選べます。名前の読み方は量子化・モデル形式の用語集にまとめています。
- GPU が無くても動きます。 CPU だけでも、NVIDIA(CUDA)・AMD(ROCm / Vulkan)・Apple Silicon(Metal)の GPU でも動き、GPU に載りきらない層を CPU に回す(部分オフロード)こともできます。
- 対応するアプリが多いです。 Ollama・LM Studio・KoboldCpp・Jan などの多くは内部で llama.cpp を使っており、GGUF をそのまま読み込めます。
手元で動かすときのポイント
- 迷ったら Q4_K_M から試すのが定番です。 精度の落ち方とファイルの小ささの釣り合いがよく、多くの量子化の配布者が推奨の目安に挙げています。メモリに余裕があれば Q5_K_M・Q6_K へ上げます。
- ファイルの大きさ+コンテキストの分がメモリに要ります。 会話が長くなるほど KV キャッシュが増えるので、ファイルサイズぎりぎりの GPU では足りません。当サイトの記事の「動作環境」の表は、配布ファイルの実サイズから必要メモリを算出しています。
- 画像を扱うモデルは
mmprojファイルが別に要ります。 視覚エンコーダの部分は本体とは別の GGUF で配られることが多いので、一緒に落とします。 - 公式の GGUF が無いモデルも多いです。 その場合は bartowski・unsloth など量子化の配布者が作った版を使います。下の一覧では、記事のリポジトリ自体が GGUF のものと、変換版を確認したものを分けて載せています。
出典: GGUF の仕様(ggml-org/ggml の docs/gguf.md)、Hugging Face Hub の GGUF の説明、llama.cpp の README(いずれも 2026-09-27 時点)。
当サイトの記録とデータ
当サイトは、GGUF形式で入手できるモデルの記事を22本公開しています(記事のリポジトリ自体がGGUF形式のもの12本、そのモデルのGGUF版を確認したもの10本)。下の一覧は当サイトが確認した範囲(公開元の組織と、実績のある量子化の配布者)に限られます。一覧に無いモデルにもGGUF版が存在することがあります。モデル形式別まとめの1ページです。
対応する主なエンジン
| エンジン | 概要 |
|---|---|
| llama.cpp | C/C++で書かれたLLM推論エンジン。GGUF形式のモデルをCPU・GPU(CUDA / Metal / Vulkan / ROCm)で動かす。ローカルLLMのエコシステムの土台で、Ollama・LM Studio・KoboldCppなどが内部で使っている。 |
| Ollama | コマンド1つでモデルの取得と実行ができるローカルLLMランタイム。OpenAI互換のAPIサーバーを内蔵し、macOS / Linux / Windows に対応する。 |
| KoboldCpp | llama.cpp を単一実行ファイルにまとめ、Web UI と API を同梱したランタイム。GGUFモデルをダウンロードして起動するだけで使える。 |
| llamafile | モデルの重みと llama.cpp を1つの実行ファイルにまとめ、OSを問わずそのまま実行できるようにする配布形式。 |
| LocalAI | OpenAI API 互換のセルフホスト推論サーバー。テキスト・画像・音声など複数のバックエンドを1つのAPIで扱う。 |
| Jan | オフラインで動くデスクトップのチャットアプリ。llama.cpp を内蔵し、ローカルAPIサーバーとしても使える。 |
GGUF形式で入手できるモデル
→ 横にスクロールできます
| 公開日 | モデル | 入手先 | 量子化 | 最小のVRAM階層 | 記事 |
|---|---|---|---|---|---|
| 2026-09-26 | MiniMaxAI/MiniMax-H3 | unsloth/MiniMax-H3-GGUF | Q2_K, Q2_K_XL, Q3_K, Q3_K_XL, Q4_K, Q2_K_M … | 32GB | 「MiniMax-H3」音声付き動画生成モデル:必要VRAM 32GB〜・配布ファイル一覧 |
| 2026-09-26 | deepseek-ai/DeepSeek-V4-Pro-0813 | unsloth/DeepSeek-V4-Pro-0813-GGUF, DevQuasar/deepseek-ai.DeepSeek-V4-Pro-0813-GGUF | Q4_K_XL, Q8_K_XL, Q2_K, Q3_K_M, Q4_K_M | — | 「DeepSeek-V4-Pro-0813」エージェント能力を強化した大規模MoEモデル:必要メモリ約998GB |
| 2026-09-26 | Qwen/Qwen3.8-27B | unsloth/Qwen3.8-27B-GGUF, lmstudio-community/Qwen3.8-27B-GGUF | IQ1_S, IQ1_M, IQ2_XXS, IQ2_S, Q2_K_XL, IQ3_XXS … | 8GB | 「Qwen3.8-27B」マルチモーダル視覚言語モデル:必要VRAM 8GB〜・GGUF版あり |
| 2026-09-25 | LiquidAI/LFM2.5-VL-3B-DSpark | LiquidAI/LFM2.5-VL-3B-DSpark-GGUF | F16 | 4GB | 「LFM2.5-VL-3B-DSpark」ビジョン言語モデル向けドラフトモデル:必要VRAM 4GB〜・GGUF版あり |
| 2026-09-24 | pfnet/plamo-3-610m-fin-instruct | mradermacher/plamo-3-610m-fin-instruct-GGUF | Q2_K, Q3_K_S, Q3_K_M, Q3_K_L, IQ4_XS, Q4_K_S … | 4GB | 「plamo-3-610m-fin-instruct」金融特化型の軽量日本語言語モデル:必要VRAM 4GB〜 |
| 2026-09-24 | togethercomputer/Tev1-4B-experimental | bartowski/togethercomputer_Tev1-4B-experimental-GGUF | IQ2_M, Q2_K, IQ3_XXS, Q3_K_S, IQ3_XS, Q3_K_M … | 4GB | 「Tev1-4B-experimental」構造化データの意思決定に特化した4Bモデル:必要VRAM 4GB〜 |
| 2026-09-22 | ggml-org/MiMo-V2.6-Flash-RL-GGUF | このリポジトリ | — | — | 「MiMo-V2.6-Flash-RL-GGUF」マルチモーダル対応のMoEモデル:必要メモリ約141GB |
| 2026-09-22 | ggml-org/MiMo-V2.6-Distill-Qwen-9B-GGUF | このリポジトリ | — | 12GB | 「MiMo-V2.6-Distill-Qwen-9B-GGUF」VLMモデル:必要VRAM 12GB〜 |
| 2026-09-21 | abenzerps/Qwen-Image-2.1-Uncensored-GGUF | このリポジトリ | — | 16GB | 「Qwen-Image-2.1-Uncensored-GGUF」画像生成モデル:必要VRAM 16GB〜 |
| 2026-09-18 | prism-ml/Ternary-Bonsai-2-27B-gguf | このリポジトリ | — | 8GB | 「Ternary-Bonsai-2-27B-gguf」テキスト生成モデル:必要VRAM 8GB〜 |
| 2026-09-18 | tencent/WeVisDoc-4B | mradermacher/WeVisDoc-4B-GGUF, mradermacher/WeVisDoc-4B-i1-GGUF | Q2_K, Q3_K_S, Q3_K_M, Q3_K_L, IQ4_XS, Q4_K_S … | 4GB | Tencent、ドキュメント解析モデル「WeVisDoc-2B/4B」公開 |
| 2026-09-15 | bartowski/vectionlabs_Salience-27B-R6-GGUF | このリポジトリ | — | 12GB | 「vectionlabs_Salience-27B-R6-GGUF」VLMモデル:必要VRAM 12GB〜 |
| 2026-09-15 | bartowski/Intern-S2-397B-GGUF | このリポジトリ | — | — | 「Intern-S2-397B-GGUF」科学分野向けマルチモーダル基盤モデル:必要メモリ約102GB |
| 2026-09-14 | bartowski/TheDrummer_Orion-26B-A4B-v1.1-GGUF | このリポジトリ | — | 12GB | 「TheDrummer_Orion-26B-A4B-v1.1-GGUF」マルチモーダルモデル:必要VRAM 12GB〜 |
| 2026-09-13 | DavidAU/Qwen3.8-27B-TWIN-TURBO-Fable-Cold-Fusion-709-L-Uncensored-NM-DAU-NEO-MTP-GGUF | このリポジトリ | — | 12GB | Qwen3.8-27BカスタムGGUFモデル「TWIN-TURBO」公開、思考トークンを削減 |
| 2026-09-12 | agentionai/Signal-3.8-27B-GGUF | このリポジトリ | — | 16GB | 「Signal-3.8-27B-GGUF」トークン効率を最適化したGGUFモデル:必要VRAM 16GB〜 |
| 2026-09-11 | bartowski/Gryphe_Pantheon-Reasoning-26B-A4B-1.1-V2-GGUF | このリポジトリ | — | 12GB | 「Gryphe_Pantheon-Reasoning-26B-A4B-1.1-V2-GGUF」:必要VRAM 12GB〜 |
| 2026-09-09 | nex-agi/Nex-N2.5-Pro | bartowski/Nex-N2.5-Pro-GGUF, DevQuasar/nex-agi.Nex-N2.5-Pro-GGUF | IQ1_S, IQ1_M, IQ2_XXS, IQ2_XS, IQ2_S, IQ2_M … | — | 「Nex-N2.5-Pro」長期タスク向けエージェントモデル:必要メモリ約98GB・GGUF版あり |
| 2026-09-09 | nex-agi/Nex-N2.5-mini | bartowski/nex-agi_Nex-N2.5-mini-GGUF, mradermacher/Nex-N2.5-mini-GGUF | IQ2_XXS, IQ2_XS, IQ2_S, IQ2_M, Q2_K, IQ3_XXS … | 16GB | 「Nex-N2.5-mini」長期タスク向けのエージェントモデル:必要VRAM 16GB〜・GGUF版あり |
| 2026-09-08 | openbmb/MiniCPM5-2B | openbmb/MiniCPM5-2B-GGUF, bartowski/MiniCPM5-2B-GGUF | Q4_K_M, Q8_0, F16, IQ2_M, Q2_K, IQ3_XXS … | 4GB | 「MiniCPM5-2B」コードや数学に強いオンデバイスモデル:必要VRAM 4GB〜・GGUF版あり |
| 2026-09-06 | IFM/K2-Horizon-MoVA-36B-A4B-GGUF | このリポジトリ | — | 32GB | 「K2-Horizon-MoVA-36B-A4B-GGUF」テキスト生成モデル:必要VRAM 32GB〜 |
| 2026-09-06 | Jackrong/Qwopus3.8-27B-Flash-GGUF | このリポジトリ | — | 16GB | 「Qwopus3.8-27B-Flash-GGUF」エージェント向け軽量化モデル:必要VRAM 16GB〜 |
「最小のVRAM階層」は各記事の動作環境の表(変換版は、その変換版のファイル。画像・動画・音声のモデルは部品まで数えた記事の表)で最も小さい構成が収まる階層です。コンテキスト長に応じた余裕を見込んでください。
最終更新 2026-09-26(JST)。ページ前半の解説は、出典に挙げた一次資料をもとに AI を用いて執筆したものです。「当サイトの記録とデータ」以降の表は、記事ログからコードが組み立てています。