観測データ: 日本語のトークン効率・CPUでの実測・GGUFの中身・エンジンの対応の早さ

2026年9月29日

このページは、モデルカードの記載ではなく、当サイトが自分で測り、記録した値をまとめたものです。記事にしたモデルのトークナイザと GGUF ファイルの先頭を読み、小さなモデルは GPU の無い当サイトのサーバーで実際に動かし、Hugging Face と各推論エンジンの登録表を毎日記録しています。以下の数値はすべてその記録からコードが集計したもので、言語モデルに書かせたり採点させたりはしていません。各モデルの記事の「当サイトでの実測」の節にも同じ値と、5問の日本語の質問への回答(温度0・最大1024トークン)を原文のまま載せています。

日本語のトークン効率

各モデルのトークナイザが、当サイトが書き下ろした固定の文章(876字・6種の文体)と、同じ内容の英文を何トークンに分けるかを数えました。少ないほど、同じ文脈長に長い日本語が入り、生成も1字あたりで速くなります。同じトークナイザを使うモデルは1行にまとめています。「参考」は比較のために測った有名なモデルのトークナイザです。

→ 横にスクロールできます

順位 日本語1,000字あたり 英文との比 語彙数 このトークナイザを使うモデル
1 497 0.85倍 99,574 LLM-jp-3(参考)
2 546 0.99倍 248,070〜248,077 Qwopus3.8-27B-Flash-GGUF、Nex-N2.5-mini、Nex-N2.5-Pro、Edge0-35B-A3B-preview、Signal-3.8-27B-GGUF、Intern-S2-397B-GGUF、vectionlabs_Salience-27B-R6-GGUF、Ternary-Bonsai-2-27B-gguf、MiMo-V2.6-Distill-Qwen-9B-GGUF、Tev1-4B-experimental、Tev1-0.8B-experimental、Qwen3.8-27B、LensVLM-9B、Hemmingway-1、OrcaSAQ-2-27B
3 564 1.03倍 262,144〜262,145 Gemma 3(参考)、Gryphe_Pantheon-Reasoning-26B-A4B-1.1-V2-GGUF、TheDrummer_Orion-26B-A4B-v1.1-GGUF
4 565 1.04倍 250,624 K2-Horizon-MoVA-36B-A4B-GGUF、K2-Horizon-375B-A23B-NVFP4、K2-Horizon-32B-NVFP4
5 642 1.15倍 125,017 LFM2.5-VL-3B-DSpark
6 666 1.21倍 130,560 MiniCPM5-2B
7 688 1.26倍 151,665〜151,675 Qwen3(参考)、Simple-Attention-Sparsification、Qwen-2.5-1B-RLCD、MiMo-V2.6-Flash-RL-GGUF、MiMo-V2.6-Pro-RL、MiMo-V2.6-Flash-MOPD
8 705 1.29倍 129,280 DeepSeek-V4.1-Flash、DeepSeek-V4-Pro-0813-nvfp4-DSpark、DeepSeek-V4-Pro-0813
9 744 1.36倍 128,256 Llama 3.2(参考)
10 795 1.45倍 200,019 gpt-oss(参考)
11 1,119 2.05倍 100,278 olmo3-7b-sdf-sft-clean150

CPUだけで動かした速度

当サイトのサーバー(Neoverse-N1 の3スレッド・GPUなし)で、llama.cpp の公式配布(b11223)を使って測りました。速度は llama-bench(プロンプト512トークン・生成128トークン)、ピーク時のメモリは文脈4,096トークンで日本語の質問に答えさせている間の値で、ファイルをメモリに割り当てた分を含みます。各モデルの回答は記事に原文のまま載せています。

→ 横にスクロールできます

モデル 量子化 ファイル プロンプト 生成 日本語換算 ピーク時のメモリ 測定日
MiniCPM5-2B Q4_K_M 1.45GB 34.4 トークン/秒 13.9 トークン/秒 20.9字/秒 2.9GB 2026-09-28
Qwen3-4B(参考) Q4_K_M 2.33GB 18.9 トークン/秒 6.8 トークン/秒 — 5.7GB 2026-09-28
olmo3-7b-sdf-sft-clean150 Q4_K_M 4.16GB 11.3 トークン/秒 4.9 トークン/秒 4.4字/秒 12.4GB 2026-09-28
Qwen3-8B(参考) Q4_K_M 4.68GB 10.4 トークン/秒 4.6 トークン/秒 — 9.5GB 2026-09-28

量子化ごとの劣化

モデルごとに量子化を1つずつダウンロードし、F16(無ければ Q8_0)を基準に、固定の日本語の文章(夏目漱石「坊っちゃん」の冒頭。青空文庫のパブリックドメインのテキスト)で llama.cpp のKL ダイバージェンスの計測を行いました(文脈512トークン)。各欄は、次のトークンの第1候補が基準と一致した割合です。「坊っちゃん」は有名な作品で学習データに含まれている可能性があるため、モデルどうしではなく、同じモデルの量子化どうしで比べてください。

→ 横にスクロールできます

モデル 基準 Q2_K Q3_K_M IQ4_XS Q4_K_M Q5_K_M Q6_K
Qwen3-4B(参考) Q8_0 54.1% 72.7% 83.0% 83.9% 90.3% 91.7%
MiniCPM5-2B Q8_0 37.4% 63.6% 76.9% 81.5% 89.1% 90.8%

GGUFファイルの中身

各 GGUF ファイルの先頭(メタデータ)だけを HTTP の範囲指定で読みました(重みはダウンロードしていません)。18ファイルのうち、imatrix を使って量子化したと記録しているのは12ファイル、チャットテンプレートにツール呼び出しの記述があるのは18ファイルです。平均のビット数は、ファイルのデータの大きさを重みの数で割った実測値です。

→ 横にスクロールできます

モデル ファイル 平均ビット数 主な型 imatrix 最大文脈長 テンプレートのツール記述
Hemmingway-1 Q4_K_M (bartowski) 5.10 Q4_K 75% / Q6_K 18% あり 262,144 あり
LensVLM-9B Q4_K_M (bartowski) 5.21 Q4_K 72% / Q6_K 21% あり 262,144 あり
Xing4.0-29B-A4B IQ4_NL (XingChen-AGI) 5.15 IQ4_NL 93% / BF16 5% あり 262,144 あり
DeepSeek-V4-Pro-0813 Q4_K_M (DevQuasar) 4.84 Q4_K 84% / Q6_K 16% なし 1,048,576 あり
Qwen3.8-27B Q4_K_M (unsloth) 4.82 IQ4_XS 33% / Q4_K 27% あり 262,144 あり
plamo-3-610m-fin-instruct Q4_K_M (mradermacher) 5.13 Q4_K 70% / Q6_K 30% なし 262,144 あり
Tev1-4B-experimental Q4_K_M (bartowski) 5.15 Q4_K 65% / Q5_K 15% あり 262,144 あり
olmo3-7b-sdf-sft-clean150 Q4_K_M (EleutherAI) 4.90 Q4_K 81% / Q6_K 19% なし 65,536 あり
vectionlabs_Salience-27B-R6-GGUF Q4_K_M (bartowski) 5.10 Q4_K 75% / Q6_K 18% あり 1,048,576 あり
Intern-S2-397B-GGUF Q4_K_M (bartowski) 5.05 Q4_K 77% / Q6_K 17% あり 262,144 あり
TheDrummer_Orion-26B-A4B-v1.1-GGUF Q4_K_M (bartowski) 5.69 Q4_K 52% / Q8_0 20% あり 262,144 あり
Signal-3.8-27B-GGUF Q4_K_M (agentionai) 4.97 Q4_K 79% / Q6_K 20% あり 262,144 あり
Gryphe_Pantheon-Reasoning-26B-A4B-1.1-V2-GGUF Q4_K_M (bartowski) 5.77 Q4_K 51% / Q8_0 22% あり 262,144 あり
Nex-N2.5-Pro Q4_K_M (bartowski) 5.06 Q4_K 78% / Q6_K 17% あり 262,144 あり
Nex-N2.5-mini Q4_K_M (bartowski) 5.15 Q4_K 76% / Q6_K 12% あり 262,144 あり
MiniCPM5-2B Q4_K_M (openbmb) 4.95 Q4_K 78% / Q6_K 22% なし 131,072 あり
K2-Horizon-MoVA-36B-A4B-GGUF Q4_K_M (IFM) 4.78 Q4_K 87% / Q6_K 13% なし 524,288 あり
Qwopus3.8-27B-Flash-GGUF Q4_K_M (Jackrong) 4.92 Q4_K 80% / Q6_K 20% なし 262,144 あり

GGUF版が出るまでの時間

当サイトが記事にしたモデルについて、元モデルの Hugging Face のリポジトリが作られてから、最初の GGUF 版のリポジトリが作られるまでの時間です(公開日時ではなく作成日時の差です。リポジトリは公開前に非公開で作られることが多く、マイナスは GGUF 版の方が先に作られていた= 事前に提供を受けていたと見られるものです)。11モデルの中央値は15.2時間でした。

最初の GGUF 版を出したのは モデル数 中央値(時間)
bartowski 4 32.0
mradermacher 2 23.5
公開元自身 2 -13.4
unsloth 2 101.3
LiquidAI 1 0.0

新しいアーキテクチャが推論エンジンに登録されるまで

各エンジンのソースにあるモデルの登録表を毎日取得し、アーキテクチャ名を初めて見た日を記録しています(2026-09-18から)。記事にしたモデルについて、その日とモデルのリポジトリが作られた日を比べました。「未登録」は今日の登録表に名前が無いという意味で、動かないことの断定ではありません。

→ 横にスクロールできます

エンジン モデルの登場時点で登録済み 後から登録 未登録 観測開始前から登録済み
llama.cpp 9 0 4 8
vLLM 10 0 2 9
MLX (mlx-lm) 6 0 9 6

推論エンジンのリリースの頻度

各プロジェクトの GitHub のリリースを記録したもののうち、2026-09-28までの30日間の数です。

プロジェクト リリース数 間隔の中央値(日) 最新
Unsloth 13 1.1 2026-09-28
ExLlamaV3 9 3.3 2026-09-28
ggml 6 0.8 2026-09-25
Ollama 6 4.0 2026-09-23
ComfyUI 3 5.7 2026-09-21
KoboldCpp 3 5.4 2026-09-26
llama.cpp 3 9.5 2026-09-24
Open WebUI 3 10.8 2026-09-22
InvokeAI 2 21.1 2026-09-28
SGLang 2 13.8 2026-09-19
vLLM 2 12.9 2026-09-22
RamaLama 1 — 2026-09-25
whisper.cpp 1 — 2026-09-11
llamafile 1 — 2026-09-16
LocalAI 1 — 2026-09-18
TTS WebUI 1 — 2026-09-01