推論エンジン「KoboldCpp v1.122」公開:エージェント機能追加

基本情報
| 項目 | 内容 |
|---|---|
| リポジトリ | LostRuins/koboldcpp |
| 版 | v1.122 |
| 公開日 | 2026-09-26 |
| ライセンス | AGPL-3.0 |
| 出典の種類 | 公開元の一次情報(GitHub公式リリースノートが一次情報) |
収集・肉付けの時点で当サイトのコードが確定させた値です。日付はJST。
概要
GGUFモデルを手軽に実行できるAGPL-3.0ライセンスの推論エンジン「KoboldCpp」の最新版となるv1.122が公開されました。KoboldCppは単一バイナリ形式で動作し、ブラウザから扱える「KoboldAI UI」を内包したC++ベースの推論環境です。
本バージョンにおける最も大きな変更点は、軽量なエージェント基盤「KoboldCpp Agent」の統合です。9種類の組み込みツールを備え、システムプロンプトの消費を約2kトークンに抑えた設計となっており、ローカルLLMを用いた自律的なコーディングやタスク実行環境を最小限のオーバーヘッドで構築できるようになりました。
破壊的変更・非推奨
今回のリリースでは、ビルドスクリプトの動作仕様変更および一部の起動フラグの整理が行われています。
| 項目 | 旧仕様 | 新仕様(v1.122以降) |
|---|---|---|
ビルドスクリプト koboldcpp.sh によるポータブルビルド |
デフォルトでポータブル向けビルドを生成 | 実行環境向けに自動最適化。他環境向けバイナリを作成する場合は環境変数 KCPP_PORTABLE=1 の付与が必須 |
| パイプライン並列フラグ | 専用フラグで手動指定 | フラグ削除(ubatch が batchsize より小さい場合に自動で有効化) |
koboldcpp.sh を利用してパッケージを配布しているメンテナーやビルドパイプラインを組んでいる利用者は、生成バイナリが実行マシン固有の最適化に固定されないよう、環境変数 KCPP_PORTABLE=1 を明示的に設定する対応が必要です。
主な変更点
組み込みエージェント機能「KoboldCpp Agent」の追加
Opencode、Codex、Claude Codeなどの代替として機能する軽量なエージェントフレームワークがKoboldCpp本体にバンドルされました。9種類の内蔵ツールを搭載しながら、全ツール定義を含めたシステムプロンプトの消費量を約2kトークンに抑えています。
GUIランチャーの「Admin」タブから有効化するか、起動時オプションに --agent を指定することで利用できます。外部のOpenAI Chat Completions互換エンドポイントへの接続にも対応するほか、mcp.json ファイルを読み込むことでModel Context Protocol(MCP)経由のツール拡張も可能です(MCPツールはKoboldCppサーバー側、Agentツールはエージェントクライアント側で実行されます)。ツール呼び出しの確認には on、auto、off の3種類の承認モードが用意されています。エージェントを実用的に動かす環境として、少なくとも28k以上のコンテキスト長、8k以上の生成トークン数、および12GB以上のVRAM搭載環境が推奨されています。
ubatchsizeの独立設定対応とパイプライン並列の自動化
llama.cppと同様に、batchsize とは独立して ubatchsize(マイクロバッチサイズ)を指定できるようになりました。これに伴いGUIに ubatch スライダーが追加され、各種スライダーUIもコンパクトに再配置されています。あわせて従来のパイプライン並列用フラグは整理され、ubatch の値が batchsize 未満に設定された際に自動で有効化される挙動に変更されました。
モデルスワップ制御フラグ --autoswapthreshold の導入
モデルの自動スワップがトリガーされるサイズ制限を指定する --autoswapthreshold オプションが追加されました。小さなモデルを補助的に読み込んで使用する際に、不要なメモリスワップが発生するのを防ぐことができます。
デフォルトコンテキストサイズの拡張とコンテキスト管理の改善
起動時のデフォルトコンテキストサイズが引き上げられたほか、最大コンテキスト長に近づいた際の最大出力トークン数の扱いがよりスマートに制御されるようになりました。また、ストリーミング生成中にエラーが発生した際にエラーオブジェクトを返す仕様への変更や、ツールのストリーミングおよびテキスト同期リクエストに対するキープアライブ用の空白パディング追加が行われています。
画像・音楽生成およびStable Diffusion連携の修正
アップストリームの sd.cpp の同期が取り込まれ、SD VAEのタイリング閾値が512へ引き下げられました。さらにピクセル空間拡散モデルを適切に処理するため画像プレビューの最大サイズ制限が導入されたほか、LLMを歌詞生成に用いた際のオーディオコード生成(2ステップ処理)への対応と音楽関連UIの改善が施されています。
ハードウェア固有の不具合修正と最適化
P40環境で発生していたVRAM使用量増加の問題がリバートされたほか、quietモード動作時におけるsmartcacheログの抑制や、ツール呼び出しパーサーの修正、Kobold Liteの更新が実施されています。
対応モデル・ハードウェア
KoboldCpp v1.122は、多種多様なハードウェア環境と最新のモデルアーキテクチャをサポートしています。アップストリームである llama.cpp および sd.cpp からの最新の改善がマージされたことで、推論の安定性と対応範囲がさらに向上しました。
サポートされるモデルと量子化形式
本バージョンでは、GGUF形式で提供される広範なLLM(大規模言語モデル)の推論が可能です。アップストリームからのマージにより、最新のモデルアーキテクチャへの対応が継続されています。
- 最新モデルのサポート: 新機能であるエージェント機能を最大限に活用するため、Qwen 3.6 35BA3B などのモデルに対応した
.kcpptテンプレートが公開されています。これにより、最新の高性能モデルをエージェントとして即座に利用可能です。 - 画像生成モデル:
sd.cppの同期により、Stable Diffusion を用いた画像生成機能が強化されました。VAEタイリング閾値が512へ引き下げられたほか、ピクセル空間拡散モデルを適切に処理するための画像プレビューサイズ制限が導入されています。 - 量子化ツール: GGUF形式への変換および量子化を行うためのツール群も、プロジェクトに関連して提供されています。
サポートされるハードウェア環境
利用者の環境に合わせて、最適化された複数のバイナリが提供されています。
- NVIDIA GPU: CUDA 12を利用する標準的な
koboldcpp.exe(Windows) およびkoboldcpp-linux-x64(Linux) が推奨されます。また、Tesla P40などの特定のハードウェアで発生していたVRAM使用量の問題が修正されており、該当するGPUユーザーの利便性が向上しています。 - 旧型PC・レガシーGPU: 最新のCUDAが動作しない古いNVIDIA GPUや、AVX1命令セットのみをサポートする古いCPU向けに
oldpcバージョン(CUDA 11 + AVX1)が用意されています。 - AMD GPU: NVIDIA GPUを搭載していない環境では、
nocudaバージョンでの Vulkan オプションの利用が推奨されています。Linux環境向けには、ROCm対応のバイナリも別途提供されています。 - Apple Silicon: M1/M2/M3などのチップを搭載した現代的なMacOS向けに、
koboldcpp-mac-arm64バイナリが提供されており、Metalアクセラレーションを活用した高速な推論が可能です。 - Android: Termux環境を通じた実行を公式にサポートしており、モバイルデバイス上での推論も可能です。
なお、ビルド済みのバイナリを自作・配布するパッケージメンテナー向けには、実行環境に依存しないバイナリを作成するための環境変数 KCPP_PORTABLE=1 が導入されています。
アップデート方法
KoboldCppは「Zero Install(インストール不要)」を設計思想としており、基本的には新しいバイナリをダウンロードして既存のものと置き換えるだけでアップデートが完了します。
Windowsでの利用
- リリースページから最新の
koboldcpp.exeをダウンロードします。 - ダウンロードしたファイルを実行します。GUIランチャーが起動するため、モデルの選択や設定(GPUレイヤー数など)を行い、「Launch」をクリックしてください。
- コマンドラインから詳細な設定を行いたい場合は、
koboldcpp.exe --helpで利用可能なオプションを確認できます。
Linuxでの利用
推奨される方法は、リリースページから koboldcpp-linux-x64 プリビルドバイナリをダウンロードすることです。ダウンロード後、実行権限を付与(chmod +x)して実行してください。
ターミナルから直接最新版を取得してインストールする場合は、以下のコマンドが利用可能です:
curl -fLo koboldcpp https://github.com/LostRuins/koboldcpp/releases/latest/download/koboldcpp-linux-x64-oldpc && chmod +x koboldcpp
インストール後は ./koboldcpp で起動できます。
Android (Termux) での利用
AndroidデバイスでTermuxを利用している場合は、以下のクイックセットアップスクリプトを実行することで、必要な依存関係のインストールからビルドまでを自動で行うことができます:
curl -sSL https://raw.githubusercontent.com/LostRuins/koboldcpp/concedo/android_install.sh | sh
手動でビルドを行いたい場合は、リポジトリをクローンした後に make コマンドを実行してください。他のデバイスと共有可能なポータブルビルドを作成する場合は、LLAMA_PORTABLE=1 フラグを付けてビルドする必要があります。
前回の記事からの更新履歴
当サイトがGitHubのリリース一覧から機械的にまとめた、この版と前回取り上げた版の間に出た版です(単独記事にはしていません)。 全ての版はエンジン別ページにあります。
| 版 | 公開日 | リリースノート |
|---|---|---|
| v1.122.1 | 2026-09-26 | GitHub |
次に読むなら
- このツールの更新を追う → KoboldCpp の概要とリリース履歴(記録済み132版)
- 同じ分類(推論エンジン・ランタイム)の他のツール → llama.cpp / Ollama / vLLM

