AIモデル実行ツール「ramalama v0.25.0」公開、セキュリティ強化とllama.cpp更新

基本情報
| 項目 | 内容 |
|---|---|
| リポジトリ | containers/ramalama |
| 版 | v0.25.0 |
| 公開日 | 2026-09-25 |
| ライセンス | MIT |
| 出典の種類 | 公開元の一次情報(公式GitHubリポジトリのリリースノート) |
収集・肉付けの時点で当サイトのコードが確定させた値です。日付はJST。
概要
RamaLamaは、あらゆるソースからのAIモデルのローカルサービングを簡素化し、コンテナの仕組みを通じて本番環境での推論利用を容易にする、Python製のオープンソース開発者ツールです。今回のアップデートであるv0.25.0では、ネットワークセキュリティの強化、推論エンジンの更新、および環境互換性の向上が図られています。
特に、serveコマンドのデフォルトのバインド設定が変更されたことは、ネットワーク経由でモデルを公開しているユーザーにとって重要な変更です。また、特定のAPIトランスポートが非推奨となったため、既存のワークフローを利用している場合は注意が必要です。
破壊的変更・非推奨
今回のリリースでは、既定値の変更および機能の非推奨化が含まれています。
| 項目 | 旧設定・動作 | 新設定・動作 |
|---|---|---|
serve コマンドのバインド |
(未指定/広範なバインド) | デフォルトで loopback にバインド |
| hosted API transport | 利用可能 | 非推奨 (Deprecated) |
serve コマンドの変更は、ネットワーク上の他のマシンからRamaLamaのサーバーにアクセスしようとしているユーザーに影響します。デフォルトで loopback(127.0.0.1)にバインドされるため、明示的に設定を変更しない限り、外部からの接続は受け付けられなくなります。
また、hosted API transport が非推奨となりました。この機能に依存しているシステムやスクリプトを使用している場合は、将来的な削除に備えて、他のトランスポート方式への移行を検討する必要があります。
主な変更点
NVIDIA環境でのVulkanサポート
NVIDIA GPUを利用しているユーザー向けに、Vulkanを有効化する変更が加えられました。これにより、NVIDIA環境における推論の実行において、Vulkanを利用した新しいオプションが提供されます。
llama.cpp のバージョンアップ
推論エンジンの中核を担う llama.cpp が v0.4.1 にアップデートされました。これにより、最新のモデルへの対応や、推論処理の安定性が向上している可能性があります。
WSL2およびGPUパススルーの修正
WSL2環境での検出、イメージの選択、およびGPUデバイスのパススルーに関する複数の修正が行われました。Windows上でDocker DesktopやPodman Desktopを使用し、WSL2バックエンド経由でGPUアクセラレーションを利用しているユーザーにとって、動作の安定性が向上します。
スナップショットにおけるファイル混在の防止
スナップショット作成時に、GGUF形式とsafetensors形式のファイルが混在してしまう問題が修正されました。これにより、モデルの保存やロード時に発生する可能性のある不整合を防ぐことができます。
Toolbox環境でのフルサポート
コンテナを使用したtoolbox内での実行がフルサポートされました。より隔離された環境や、特定の開発コンテナ環境内でRamaLamaを動作させたいユーザーに適しています。
macOSにおけるPodman 6への対応
macOS上でPodman 6を使用している場合、podman-machine-list の呼び出しが正しく動作するように修正されました。macOS環境でPodmanを利用しているユーザーに影響があります。
huggingface-hub 依存関係の更新
huggingface-hub への依存関係が更新され、最新のバージョン(~=1.32.0)に対応しています。これにより、Hugging Faceからのモデル取得に関する安定性が向上します。
対応モデル・ハードウェア
今回のアップデートでは、推論エンジンである llama.cpp が v0.4.1 に更新されたことにより、対応するモデルアーキテクチャや量子化形式の範囲が広がっている可能性があります。また、NVIDIA GPU環境におけるVulkanの有効化や、WSL2におけるGPUデバイスパススルーの修正が行われたことで、Windows上のコンテナ環境からNVIDIA GPUを活用した推論がより安定して行えるようになっています。
アップデート方法
環境に応じた以下のコマンドでアップデートが可能です。
PyPIを利用している場合
pip install --upgrade ramalama
Fedoraを利用している場合
sudo dnf upgrade ramalama
インストールスクリプトを利用している場合
curl -fsSL https://ramalama.ai/install.sh | bash
macOSで.pkgインストーラーを使用している場合は、Releasesから最新のインストーラーをダウンロードして再インストールしてください。
前回の記事からの更新履歴
当サイトがGitHubのリリース一覧から機械的にまとめた、この版と前回取り上げた版の間に出た版です(単独記事にはしていません)。 全ての版はエンジン別ページにあります。
| 版 | 公開日 | リリースノート |
|---|---|---|
| v0.24.0 | 2026-08-22 | GitHub |
| v0.23.0 | 2026-06-25 | GitHub |
| v0.22.0 | 2026-06-06 | GitHub |
| v0.21.0 | 2026-05-14 | GitHub |
| v0.20.0 | 2026-04-28 | GitHub |
次に読むなら
- このツールの更新を追う → RamaLama の概要とリリース履歴(記録済み67版)
- 同じ分類(推論エンジン・ランタイム)の他のツール → llama.cpp / Ollama / vLLM

