C/C++ LLM推論ライブラリ「llama.cpp v0.5.0」リリース

C/C++ LLM推論ライブラリ「llama.cpp v0.5.0」リリース

基本情報

項目 内容
リポジトリ ggml-org/llama.cpp
v0.5.0
公開日 2026-09-24
ライセンス MIT
出典の種類 公開元の一次情報(公式リポジトリのリリースページが一次情報)

収集・肉付けの時点で当サイトのコードが確定させた値です。日付はJST。

概要

C/C++によるLLM推論ライブラリであるllama.cppの最新バージョン、v0.5.0がリリースされました。今回のアップデートは、バックエンドのパフォーマンス向上、モデル対応の拡大、およびサーバー/ルーター動作の堅牢化に重点が置かれています。

利用者にとって最も影響が大きい変更は、バックエンド(ggml)のアップデートに伴う、CUDAにおけるconv2dのimplicit GEMMによる加速や、MetalにおけるMoEおよびSSM_CONVの融合最適化といった、ハードウェアアクセラレーションの強化です。これにより、特定の環境下での推論パフォーマンス向上が期待できます。

主な変更点

バックエンドとハードウェアアクセラレーションの最適化

CUDA環境において、implicit GEMMを用いることでconv2d演算が加速されました。また、Metal環境ではMoE(Mixture of Experts)およびSSM_CONVの融合(fusion)最適化が追加されています。これらは、NVIDIA GPUやApple Siliconを使用しているユーザーの推論速度に直接影響を与える変更です。

サーバー機能の拡張とマルチアドレス対応

llama-serverにおいて、--hostオプションがカンマ区切りのTCPアドレスおよびUNIXソケットを受け入れられるようになりました。これにより、例えばVPN経由の接続とlocalhost経由の接続を同時に待ち受けるといった、複数のネットワークインターフェースへのバインドが可能になります。サーバーを複数のネットワーク環境で運用している技術者にとって非常に有用な機能です。

新しいモデルアーキテクチャへの対応

多くの新しいモデルやアーキテクチャへの対応が進められました。具体的には、HRM-Text (DFM Mimir 1B) のサポート、MiMo-V2.6の変換サポート、HunyuanOCRに対するDFlash(投機的デコード)のサポートなどが含まれます。また、Nemotron MTPのサポート拡張や、Qwen4Expのハイパーコネクション演算およびsparse flash attentionへの対応も行われています。新しいモデルをローカル環境で試したいユーザーは、これらの対応によりGGUF形式での利用が可能になります。

サーバーの出力におけるマルチモーダル対応

サーバーのfunction-call(関数呼び出し)の出力において、input_imageのサポートが追加されました。これにより、ツール実行の結果として画像データを扱うといった、より高度なマルチモーダルなエージェント機能の構築が可能になります。Gemma 4などのマルチモーダルモデルを利用して、画像を含む複雑なタスクを処理する開発者に影響があります。

環境変数によるサンプリング制御

temperaturetop-pmin-p、および各種ペナルティの設定を、環境変数経由で行えるようになりました。これにより、コードを書き換えることなく、実行環境の設定だけでサンプリングパラメータを制御できるようになります。推論の挙動を動的に調整したいユーザーにとって利便性が向上します。

対応モデル・ハードウェア

今回のリリースでは、以下のモデルアーキテクチャおよび形式への対応が強化されています。

  • HRM-Text (DFM Mimir 1B): 新たにサポートされました。このモデルは2つのトランスフォーマー・スタックを交互に実行する構造を持っており、GGUF形式での利用が可能です。
  • MiMo-V2.6 (Pro/Flash): 変換サポートが追加されました。これらのモデルはmxfp4エキスパートを使用しており、vision機能を持った状態でllama.cppにロードできます。
  • HunyuanOCR: DFlashを用いた投機的デコード(speculative decoding)がサポートされました。これにより、ドキュメント画像のOCR処理において、デコード速度が約2倍に向上することが報告されています。
  • Nemotronシリーズ: Nemotron Super 3におけるMTP(Multi-Token Prediction)サポートが拡張されました。
  • Qwen4Exp: ハイパーコネクション演算およびsparse flash attentionへの対応が行われました。
  • Muse Glimmer: --fuse-qkvオプションによるサポートが追加されました。
  • Gemma 4: パースの修正が行われ、Gemma 4 DSpark draft backboneのサポートも含まれています。

アップデート方法

llama.cppをアップデートするには、以下のいずれかの方法を行ってください。

ソースからビルドする場合 リポジトリをクローンし、ビルド手順に従って再ビルドしてください。

git pull && make

Dockerを使用する場合 Dockerイメージを使用している場合は、最新のイメージを取得してください。

バイナリを使用する場合 リリースページから、最新のプリビルド済みバイナリをダウンロードしてください。

関連記事

出典