観測データ: 日本語のトークン効率・CPUでの実測・GGUFの中身・エンジンの対応の早さ
このページは、モデルカードの記載ではなく、当サイトが自分で測り、記録した値をまとめたものです。記事にしたモデルのトークナイザと GGUF ファイルの先頭を読み、小さなモデルは GPU の無い当サイトのサーバーで実際に動かし、Hugging Face と各推論エンジンの登録表を毎日記録しています。以下の数値はすべてその記録からコードが集計したもので、言語モデルに書かせたり採点させたりはしていません。各モデルの記事の「当サイトでの実測」の節にも同じ値と、5問の日本語の質問への回答(温度0・最大1024トークン)を原文のまま載せています。
日本語のトークン効率
各モデルのトークナイザが、当サイトが書き下ろした固定の文章(876字・6種の文体)と、同じ内容の英文を何トークンに分けるかを数えました。少ないほど、同じ文脈長に長い日本語が入り、生成も1字あたりで速くなります。同じトークナイザを使うモデルは1行にまとめています。「参考」は比較のために測った有名なモデルのトークナイザです。
→ 横にスクロールできます
CPUだけで動かした速度
当サイトのサーバー(Neoverse-N1 の3スレッド・GPUなし)で、llama.cpp の公式配布(b11223)を使って測りました。速度は llama-bench(プロンプト512トークン・生成128トークン)、ピーク時のメモリは文脈4,096トークンで日本語の質問に答えさせている間の値で、ファイルをメモリに割り当てた分を含みます。各モデルの回答は記事に原文のまま載せています。
→ 横にスクロールできます
| モデル | 量子化 | ファイル | プロンプト | 生成 | 日本語換算 | ピーク時のメモリ | 測定日 |
|---|---|---|---|---|---|---|---|
| MiniCPM5-2B | Q4_K_M |
1.45GB | 34.4 トークン/秒 | 13.9 トークン/秒 | 20.9字/秒 | 2.9GB | 2026-09-28 |
| Qwen3-4B(参考) | Q4_K_M |
2.33GB | 18.9 トークン/秒 | 6.8 トークン/秒 | — | 5.7GB | 2026-09-28 |
| olmo3-7b-sdf-sft-clean150 | Q4_K_M |
4.16GB | 11.3 トークン/秒 | 4.9 トークン/秒 | 4.4字/秒 | 12.4GB | 2026-09-28 |
| Qwen3-8B(参考) | Q4_K_M |
4.68GB | 10.4 トークン/秒 | 4.6 トークン/秒 | — | 9.5GB | 2026-09-28 |
量子化ごとの劣化
モデルごとに量子化を1つずつダウンロードし、F16(無ければ Q8_0)を基準に、固定の日本語の文章(夏目漱石「坊っちゃん」の冒頭。青空文庫のパブリックドメインのテキスト)で llama.cpp のKL ダイバージェンスの計測を行いました(文脈512トークン)。各欄は、次のトークンの第1候補が基準と一致した割合です。「坊っちゃん」は有名な作品で学習データに含まれている可能性があるため、モデルどうしではなく、同じモデルの量子化どうしで比べてください。
→ 横にスクロールできます
| モデル | 基準 | Q2_K | Q3_K_M | IQ4_XS | Q4_K_M | Q5_K_M | Q6_K |
|---|---|---|---|---|---|---|---|
| Qwen3-4B(参考) | Q8_0 |
54.1% | 72.7% | 83.0% | 83.9% | 90.3% | 91.7% |
| MiniCPM5-2B | Q8_0 |
37.4% | 63.6% | 76.9% | 81.5% | 89.1% | 90.8% |
GGUFファイルの中身
各 GGUF ファイルの先頭(メタデータ)だけを HTTP の範囲指定で読みました(重みはダウンロードしていません)。18ファイルのうち、imatrix を使って量子化したと記録しているのは12ファイル、チャットテンプレートにツール呼び出しの記述があるのは18ファイルです。平均のビット数は、ファイルのデータの大きさを重みの数で割った実測値です。
→ 横にスクロールできます
| モデル | ファイル | 平均ビット数 | 主な型 | imatrix | 最大文脈長 | テンプレートのツール記述 |
|---|---|---|---|---|---|---|
| Hemmingway-1 | Q4_K_M (bartowski) |
5.10 | Q4_K 75% / Q6_K 18% | あり | 262,144 | あり |
| LensVLM-9B | Q4_K_M (bartowski) |
5.21 | Q4_K 72% / Q6_K 21% | あり | 262,144 | あり |
| Xing4.0-29B-A4B | IQ4_NL (XingChen-AGI) |
5.15 | IQ4_NL 93% / BF16 5% | あり | 262,144 | あり |
| DeepSeek-V4-Pro-0813 | Q4_K_M (DevQuasar) |
4.84 | Q4_K 84% / Q6_K 16% | なし | 1,048,576 | あり |
| Qwen3.8-27B | Q4_K_M (unsloth) |
4.82 | IQ4_XS 33% / Q4_K 27% | あり | 262,144 | あり |
| plamo-3-610m-fin-instruct | Q4_K_M (mradermacher) |
5.13 | Q4_K 70% / Q6_K 30% | なし | 262,144 | あり |
| Tev1-4B-experimental | Q4_K_M (bartowski) |
5.15 | Q4_K 65% / Q5_K 15% | あり | 262,144 | あり |
| olmo3-7b-sdf-sft-clean150 | Q4_K_M (EleutherAI) |
4.90 | Q4_K 81% / Q6_K 19% | なし | 65,536 | あり |
| vectionlabs_Salience-27B-R6-GGUF | Q4_K_M (bartowski) |
5.10 | Q4_K 75% / Q6_K 18% | あり | 1,048,576 | あり |
| Intern-S2-397B-GGUF | Q4_K_M (bartowski) |
5.05 | Q4_K 77% / Q6_K 17% | あり | 262,144 | あり |
| TheDrummer_Orion-26B-A4B-v1.1-GGUF | Q4_K_M (bartowski) |
5.69 | Q4_K 52% / Q8_0 20% | あり | 262,144 | あり |
| Signal-3.8-27B-GGUF | Q4_K_M (agentionai) |
4.97 | Q4_K 79% / Q6_K 20% | あり | 262,144 | あり |
| Gryphe_Pantheon-Reasoning-26B-A4B-1.1-V2-GGUF | Q4_K_M (bartowski) |
5.77 | Q4_K 51% / Q8_0 22% | あり | 262,144 | あり |
| Nex-N2.5-Pro | Q4_K_M (bartowski) |
5.06 | Q4_K 78% / Q6_K 17% | あり | 262,144 | あり |
| Nex-N2.5-mini | Q4_K_M (bartowski) |
5.15 | Q4_K 76% / Q6_K 12% | あり | 262,144 | あり |
| MiniCPM5-2B | Q4_K_M (openbmb) |
4.95 | Q4_K 78% / Q6_K 22% | なし | 131,072 | あり |
| K2-Horizon-MoVA-36B-A4B-GGUF | Q4_K_M (IFM) |
4.78 | Q4_K 87% / Q6_K 13% | なし | 524,288 | あり |
| Qwopus3.8-27B-Flash-GGUF | Q4_K_M (Jackrong) |
4.92 | Q4_K 80% / Q6_K 20% | なし | 262,144 | あり |
GGUF版が出るまでの時間
当サイトが記事にしたモデルについて、元モデルの Hugging Face のリポジトリが作られてから、最初の GGUF 版のリポジトリが作られるまでの時間です(公開日時ではなく作成日時の差です。リポジトリは公開前に非公開で作られることが多く、マイナスは GGUF 版の方が先に作られていた= 事前に提供を受けていたと見られるものです)。11モデルの中央値は15.2時間でした。
| 最初の GGUF 版を出したのは | モデル数 | 中央値(時間) |
|---|---|---|
| bartowski | 4 | 32.0 |
| mradermacher | 2 | 23.5 |
| 公開元自身 | 2 | -13.4 |
| unsloth | 2 | 101.3 |
| LiquidAI | 1 | 0.0 |
新しいアーキテクチャが推論エンジンに登録されるまで
各エンジンのソースにあるモデルの登録表を毎日取得し、アーキテクチャ名を初めて見た日を記録しています(2026-09-18から)。記事にしたモデルについて、その日とモデルのリポジトリが作られた日を比べました。「未登録」は今日の登録表に名前が無いという意味で、動かないことの断定ではありません。
→ 横にスクロールできます
| エンジン | モデルの登場時点で登録済み | 後から登録 | 未登録 | 観測開始前から登録済み |
|---|---|---|---|---|
| llama.cpp | 9 | 0 | 4 | 8 |
| vLLM | 10 | 0 | 2 | 9 |
| MLX (mlx-lm) | 6 | 0 | 9 | 6 |
推論エンジンのリリースの頻度
各プロジェクトの GitHub のリリースを記録したもののうち、2026-09-28までの30日間の数です。
| プロジェクト | リリース数 | 間隔の中央値(日) | 最新 |
|---|---|---|---|
| Unsloth | 13 | 1.1 | 2026-09-28 |
| ExLlamaV3 | 9 | 3.3 | 2026-09-28 |
| ggml | 6 | 0.8 | 2026-09-25 |
| Ollama | 6 | 4.0 | 2026-09-23 |
| ComfyUI | 3 | 5.7 | 2026-09-21 |
| KoboldCpp | 3 | 5.4 | 2026-09-26 |
| llama.cpp | 3 | 9.5 | 2026-09-24 |
| Open WebUI | 3 | 10.8 | 2026-09-22 |
| InvokeAI | 2 | 21.1 | 2026-09-28 |
| SGLang | 2 | 13.8 | 2026-09-19 |
| vLLM | 2 | 12.9 | 2026-09-22 |
| RamaLama | 1 | — | 2026-09-25 |
| whisper.cpp | 1 | — | 2026-09-11 |
| llamafile | 1 | — | 2026-09-16 |
| LocalAI | 1 | — | 2026-09-18 |
| TTS WebUI | 1 | — | 2026-09-01 |