LLM推論エンジン「vllm-project/vllm v0.30.0」公開 – Fast Start機能や新モデル対応

LLM推論エンジン「vllm-project/vllm v0.30.0」公開 - Fast Start機能や新モデル対応

基本情報

項目 内容
リポジトリ vllm-project/vllm
v0.30.0
公開日 2026-09-22
ライセンス Apache-2.0
出典の種類 公開元の一次情報(公式GitHubリポジトリのリリースページが一次情報)

収集・肉付けの時点で当サイトのコードが確定させた値です。日付はJST。

概要

vLLMの最新バージョン v0.30.0 がリリースされました。vLLMは、LLM(大規模言語モデル)の推論とサービングを高速かつメモリ効率よく行うためのオープンソースエンジンで、Apache-2.0ライセンスの下で開発されています。GitHubでは9万以上のスターを獲得しており、ローカル環境やクラウドサーバーでのLLM運用において標準的な選択肢の一つとなっています。

本バージョンにおける利用者への最も大きな影響は、エンジンの再起動時間を劇的に短縮する「Fast Start(重みキャッシュ機能)」の導入です。これにより、モデルの重みをGPUメモリ上に保持し続けることが可能になり、開発や運用におけるトライアンドエラーの効率が大幅に向上します。

破壊的変更・非推奨

本バージョンでは、コマンドライン引数への移行や古い環境変数の削除が行われています。特にスケールアウト機能やgRPCサーバーを利用している場合は、起動コマンドの変更が必要です。

旧設定・方法 新設定・方法
VLLM_ENABLE_SCALE_OUT_ENDPOINTS (環境変数) --enable-scale-out (引数)
python -m vllm.entrypoints.grpc_server vllm serve --grpc
VLLM_PREFIX_CACHE_RETENTION_INTERVAL (環境変数) (削除)
VLLM_MM_HASHER_ALGORITHM (環境変数) (削除)
GPTQの g_idx (activation ordering) (削除)
Mambaの all キャッシュモード (非推奨)

これらの変更は、vllm serve を使用してAPIサーバーを立ち上げているユーザーや、特定の量子化モデル、Mambaアーキテクチャを利用しているユーザーに影響します。また、YaRN(Yet another RoPE extensioN)の挙動がTransformersと統合されたため、ベンダー固有のエイリアスを使用しても max_model_len が自動的に再スケールされなくなっています。

主な変更点

Fast Start:GPUメモリによる重みキャッシュ

新しい「Fast Start」機能により、エンジンの再起動が高速化されます。これは、永続的なGPUごとの重みキャッシュデーモンが、量子化・テンソル並列(TP)分割済みの重みをGPUメモリ上に保持する仕組みです。エンジンの再起動時にディスクから読み直すのではなく、--load-format ipc_cache を指定することで、CUDA IPCを介してメモリ上の重みを直接マップできます。この機能はFP4チェックポイントやマルチノードTPにも対応しており、開発時などの頻繁な再起動が必要な場面で威力を発揮します。

エンジン初期化とグラフキャプチャの高速化

Model Runner V2の改良により、エンジンの初期化時間が大幅に短縮されました。特に、CUDAグラフのキャプチャ中にガベージコレクション(GC)を凍結する最適化が行われ、H200環境ではキャプチャ時間が12秒から2秒へ、エンジン初期化全体では28.9秒から8.2秒へと高速化されています。また、eagerモードでのデュアルバッチ・オーバーラップや、マイクロバッチ・ステップにおけるフルCUDAグラフのサポートなど、推論効率を高める変更が多数含まれています。

Qwen3.8-Flash-Next の最適化とメモリ節約

Qwen3.8-Flash-Next(Qwen4Exp)向けに、専用のTritonカーネルが導入されました。Prefill(入力処理)とDecode(生成)のパスを分離したQSAインデクサー、融合されたPLEカーネル、FP8インデクサーキャッシュなどにより、パフォーマンスが向上しています。また、NVIDIA実装において torch.compile を削除したことで、FP8チェックポイントを単一のGB300上でロードできるようになりました。以前は torch.compile の自動チューニングにより約50GBの余分なメモリを消費してOOM(メモリ不足)が発生していましたが、これが解消されています。さらに、--engram-config を通じてPLE重みをCPUにオフロードし、CUDA UVA(Unified Virtual Addressing)で読み出す設定も可能になりました。

DeepSeek-V4.1-Flash と MLA の強化

最新の DeepSeek-V4.1-Flash に対応しました。SM100環境では FlashMLA V4.1 を利用し、KVキャッシュ全体を MXFP8 形式で保持することが可能です。また、GPUメモリ圧迫時にKVページをホストメモリ(RAM)へ退避させる「HiSparse」機能も導入されました。これは HiSparseConnector を通じて有効化でき、GPU上のホットバッファとホストキャッシュを組み合わせることで、巨大なコンテキストを扱う際の柔軟性が向上しています。

量子化とウォーターマーキング機能

量子化設定 quantization_config.targets を通じて、特定の層を狙ったオンライン量子化が可能になりました。また、AutoRoundによる2/3/5/6/7ビット量子化のCUDAサポートや、NVFP4形式の改善も行われています。生成面では、Gumbel-maxを利用したウォーターマーキング(電子透かし)の生成と検出に対応しました。これは推論リクエストごとにオプトアウトが可能で、投機的デコーディングとも互換性があります。

対応モデル・ハードウェア

新バージョン v0.30.0 では、多くの最新モデルアーキテクチャやハードウェア向け機能が追加されています。新しく追加されたモデルとして、DeepSeek-V4.1-Flash(FlashMLA V4.1によるMXFP8 KVキャッシュ保存やDeepGEMM Mega-mHCなどに対応)、DeepSeek-V4-Flash-Vision-Exp(ROCm対応やLoRAを含む)、GLM-5.3-Flash(EPLB対応)、推論・ツールパーサを備えたK2-Horizon、Cohere Compass、MTP対応のBailing V3 VL、Transformersバックエンド経由のNanbeige4.2、およびAVX512/AMX対応のDeepSeek-V4 CPUバックエンドがサポートされました。

ハードウェア最適化の面では、NVIDIA環境においてパブリックなCUDA 13.4 Rubinビルドパスが用意され、SM12x向けブロック単位FP8 CTAラスタースウィズル(GB10/DGX Spark向け)や、SM120/121でのW4A4 NVFP4の優先、H200におけるグラフキャプチャの高速化などが導入されています。AMD ROCm環境では、TheRockのベースがROCm 10.0にアップデートされ、AITER 0.1.21.post2の採用や、DeepSeek V4のShared Expert融合、MXFP8のデカント最適化など、複数のパフォーマンス改善が含まれています。

アップデート方法

vLLMのインストールおよびアップデートには、uv(推奨)または pip を使用します。GPU環境や目的に応じて、以下のコマンドを実行してください。

uv pip install vllm

開発向けにソースコードからビルドする場合は公式ドキュメントを参照してください。また、CUDA 13.0以外の環境やROCm、XPUを利用する場合は、プラットフォームに応じた追加のインデックスURLやDockerイメージ(vllm/vllm-openai:v0.30.0 など)を利用してください。

関連記事

出典