llama.cpp v0.4.1公開:ロード方式の変更と新モデルサポート

基本情報
| 項目 | 内容 |
|---|---|
| リポジトリ | ggml-org/llama.cpp |
| 版 | v0.4.1 |
| 公開日 | 2026-09-15 |
| ライセンス | MIT |
| 出典の種類 | 公開元の一次情報(公式GitHubリリースノートが一次情報) |
収集・肉付けの時点で当サイトのコードが確定させた値です。日付はJST。
概要
llama.cpp v0.4.1がリリースされました。llama.cppは、C/C++で実装された、ローカル環境でのLLM(大規模言語モデル)推論を可能にするオープンウェイトモデル向けの推論エンジンです。
今回のアップデートにおける最も重要な変更は、モデルのロード方式に関する引数の整理です。これまで利用可能だった特定のロードオプションが完全に削除され、--load-modeによる管理へと統合されました。既存の起動スクリプトや設定ファイルでこれらのオプションを直接指定しているユーザーは、更新後にモデルが起動できなくなるため、必ず引数の書き換えを行う必要があります。
破壊的変更・非推奨
長らく非推奨とされていたモデルロード関連の引数が、今回のリリースで完全に削除されました。
| 旧オプション | 新オプション |
|---|---|
--mmap / --mlock / --direct-io |
--load-mode の値 |
これらのオプションを直接指定してモデルを起動していたユーザーは、新しい形式への移行が必要です。
また、API利用者向けに以下の変更があります。
| 関数名 | 変更内容 |
|---|---|
llama_sampler_chain_n() |
戻り値の型が int から int32_t に変更 |
これはAPIの一貫性を目的とした変更であり、現在サポートされているすべてのプラットフォームにおいて、ABIや動作への影響はありません。
主な変更点
新しいモデルアーキテクチャのサポート
複数の新しいモデルアーキテクチャへの対応が追加されました。
- Maple 20B-A1B: DeepGroveによるternary MoEアーキテクチャのサポートが追加されました。TQ1_0/TQ2_0によるternary weightsを使用しており、現在はCPUのみの対応となっています。
- Tencent Hy 4 (
hy_v4): TencentのHy 4 プレビューモデルのアーキテクチャサポートが追加されました。これはDeepSeek-V3スタイルのMLA + MoEモデルです。 - Spark2.5: Spark2.5モデルのGGUF変換、アーキテクチャ登録、トークナイザー、および推論グラフのサポートが追加されました。このモデルはfused QKV projectionやhead-wise sigmoid attention output gateを使用しています。
モデル変換とログ出力の機能追加
- QKVテンソルの結合: Hugging FaceからGGUFへ変換する際、Q/K/Vテンソルを結合するための
--fuse-qkvフラグが追加されました。これにより、変換プロセスにおける効率化が図れます。 - 構造化ログの導入:
--log-jsonlフラグにより、構造化されたJSONL形式でのログ出力が可能になりました。システムのモニタリングや解析が容易になります。
処理の改善とバグ修正
- JSON処理の刷新: 内部的なJSONスキーマの表現方法がリファクタリングされました。これにより、モデルの構造化された出力(Structured Output)のハンドリングが改善されています。
- サーバーの安定性向上:
llama-serverにおいて、同一モデルに対する複数のリクエストが発生した際に、LRU(Least Recently Used)がハングする問題が修正されました。マルチリクエスト環境での信頼性が向上します。 - マルチモーダル機能の修正: 画像入力後の投機的デコーディング(speculative decoding)に関する不具合が修正されました。
対応モデル・ハードウェア
今回のリリースでは、以下の新しいモデルアーキテクチャおよび量子化形式への対応が追加されました。
- Maple 20B-A1B: DeepGroveのternary MoEアーキテクチャへの対応。TQ1_0/TQ2_0を用いたternary weightsを使用しており、現在はCPUでの推論が可能です。
- Tencent Hy 4 (
hy_v4): TencentのHy 4 プレビューモデルのアーキテクチャサポート。DeepSeek-V3スタイルのMLA + MoEモデルに対応しています。 - Spark2.5: Spark2.5モデルのGGUF変換、アーキテクチャ、およびトークナイザーのサポート。
- Qwen3-Next / Qwen3.5: 変換時に
recurrent_layersメタデータを明示的に書き込むようになり、変換の精度が向上しています。
また、ハードウェア面では、iGPUにおいてデフォルトでlazy tensor loadingが無効化されるなどの変更が行われています。
アップデート方法
llama.cpp をアップデートするには、以下の手順に従ってください。
ソースからビルドする場合は、リポジトリをクローンしてビルドしてください。
git pull
make
また、ビルド時間の短縮のために PCH (Precompiled Headers) および unity build のサポートが追加されています。
前回の記事からの更新履歴
当サイトがGitHubのリリース一覧から機械的にまとめた、この版と前回取り上げた版の間に出た版です(単独記事にはしていません)。 全ての版はエンジン別ページにあります。
出典
- ggml-org/llama.cpp v0.4.1
- PR #28334: args: remove mmap/mlock/dio flags from arg parser
- PR #27000: llama: add Maple 20B-A1B ternary MoE architecture (CPU)
- PR #28127: Model: add Tencent Hy 4 (hy_v4) preview architecture support
- PR #27868: [Model] Support for Spark2_5ForCausalLM implementation
更新履歴
- 2026-09-20: 下書きに戻していた記事を、材料を集め直して書き直し、公開に戻しました。

