C/C++ LLM推論ライブラリ「llama.cpp v0.5.0」リリース

基本情報
| 項目 | 内容 |
|---|---|
| リポジトリ | ggml-org/llama.cpp |
| 版 | v0.5.0 |
| 公開日 | 2026-09-24 |
| ライセンス | MIT |
| 出典の種類 | 公開元の一次情報(公式リポジトリのリリースページが一次情報) |
収集・肉付けの時点で当サイトのコードが確定させた値です。日付はJST。
概要
C/C++によるLLM推論ライブラリであるllama.cppの最新バージョン、v0.5.0がリリースされました。今回のアップデートは、バックエンドのパフォーマンス向上、モデル対応の拡大、およびサーバー/ルーター動作の堅牢化に重点が置かれています。
利用者にとって最も影響が大きい変更は、バックエンド(ggml)のアップデートに伴う、CUDAにおけるconv2dのimplicit GEMMによる加速や、MetalにおけるMoEおよびSSM_CONVの融合最適化といった、ハードウェアアクセラレーションの強化です。これにより、特定の環境下での推論パフォーマンス向上が期待できます。
主な変更点
バックエンドとハードウェアアクセラレーションの最適化
CUDA環境において、implicit GEMMを用いることでconv2d演算が加速されました。また、Metal環境ではMoE(Mixture of Experts)およびSSM_CONVの融合(fusion)最適化が追加されています。これらは、NVIDIA GPUやApple Siliconを使用しているユーザーの推論速度に直接影響を与える変更です。
サーバー機能の拡張とマルチアドレス対応
llama-serverにおいて、--hostオプションがカンマ区切りのTCPアドレスおよびUNIXソケットを受け入れられるようになりました。これにより、例えばVPN経由の接続とlocalhost経由の接続を同時に待ち受けるといった、複数のネットワークインターフェースへのバインドが可能になります。サーバーを複数のネットワーク環境で運用している技術者にとって非常に有用な機能です。
新しいモデルアーキテクチャへの対応
多くの新しいモデルやアーキテクチャへの対応が進められました。具体的には、HRM-Text (DFM Mimir 1B) のサポート、MiMo-V2.6の変換サポート、HunyuanOCRに対するDFlash(投機的デコード)のサポートなどが含まれます。また、Nemotron MTPのサポート拡張や、Qwen4Expのハイパーコネクション演算およびsparse flash attentionへの対応も行われています。新しいモデルをローカル環境で試したいユーザーは、これらの対応によりGGUF形式での利用が可能になります。
サーバーの出力におけるマルチモーダル対応
サーバーのfunction-call(関数呼び出し)の出力において、input_imageのサポートが追加されました。これにより、ツール実行の結果として画像データを扱うといった、より高度なマルチモーダルなエージェント機能の構築が可能になります。Gemma 4などのマルチモーダルモデルを利用して、画像を含む複雑なタスクを処理する開発者に影響があります。
環境変数によるサンプリング制御
temperature、top-p、min-p、および各種ペナルティの設定を、環境変数経由で行えるようになりました。これにより、コードを書き換えることなく、実行環境の設定だけでサンプリングパラメータを制御できるようになります。推論の挙動を動的に調整したいユーザーにとって利便性が向上します。
対応モデル・ハードウェア
今回のリリースでは、以下のモデルアーキテクチャおよび形式への対応が強化されています。
- HRM-Text (DFM Mimir 1B): 新たにサポートされました。このモデルは2つのトランスフォーマー・スタックを交互に実行する構造を持っており、GGUF形式での利用が可能です。
- MiMo-V2.6 (Pro/Flash): 変換サポートが追加されました。これらのモデルはmxfp4エキスパートを使用しており、vision機能を持った状態で
llama.cppにロードできます。 - HunyuanOCR: DFlashを用いた投機的デコード(speculative decoding)がサポートされました。これにより、ドキュメント画像のOCR処理において、デコード速度が約2倍に向上することが報告されています。
- Nemotronシリーズ: Nemotron Super 3におけるMTP(Multi-Token Prediction)サポートが拡張されました。
- Qwen4Exp: ハイパーコネクション演算およびsparse flash attentionへの対応が行われました。
- Muse Glimmer:
--fuse-qkvオプションによるサポートが追加されました。 - Gemma 4: パースの修正が行われ、Gemma 4 DSpark draft backboneのサポートも含まれています。
アップデート方法
llama.cppをアップデートするには、以下のいずれかの方法を行ってください。
ソースからビルドする場合 リポジトリをクローンし、ビルド手順に従って再ビルドしてください。
git pull && make
Dockerを使用する場合 Dockerイメージを使用している場合は、最新のイメージを取得してください。
バイナリを使用する場合 リリースページから、最新のプリビルド済みバイナリをダウンロードしてください。
関連記事
- llama.cpp v0.4.1公開:ロード方式の変更と新モデルサポート
- ggml v0.24.0リリース:精度制御APIの追加とバックエンド強化
- テンソルライブラリ「ggml v0.23.0」公開:スパースアテンションと非同期RPCに対応
- llamafile 0.10.6公開、llama.cpp更新とCUDA/HIPのグラフ機能強化

