推論エンジン vllm v0.31.0公開、高速再起動やDeepSeek最適化

推論エンジン vllm v0.31.0公開、高速再起動やDeepSeek最適化

基本情報

項目 内容
リポジトリ vllm-project/vllm
版 v0.31.0
公開日 2026-10-05
ライセンス Apache-2.0
出典の種類 公開元の一次情報(公式GitHubリポジトリのリリースノートが一次情報)

情報を集めた時点で、当サイトのコードが確定させた値です。日付はJSTで表示しています。

概要

LLM(大規模言語モデル)の高速な推論とサービングを実現する推論エンジンである vLLM の最新バージョン v0.31.0 がリリースされました。vLLM は Python で記述された Apache-2.0 ライセンスのオープンソースプロジェクトで、高いスループットとメモリ効率を特徴としています。

本バージョンにおける利用者への最大の影響は、新機能「Fast restart」の導入です。vllm preload コマンドによって量子化済みの重みを GPU メモリ上に保持するデーモンを起動できるようになり、エンジンの再起動時におけるモデルのロード時間を大幅に短縮できます。

破壊的変更・非推奨

本バージョンでは、セキュリティ強化や内部構造の整理に伴い、いくつかの設定オプションや機能が変更・削除されています。特にマルチモーダルモデルを利用している場合、リクエストごとの引数指定がデフォルトで拒否されるようになるため注意が必要です。

項目 旧設定・機能 新設定・移行先
マルチモーダル引数 リクエストごとの mm_processor_kwargs 等を許可 デフォルトで拒否(--trust-request-mm-kwargs で許可)
トカナイザーモード tokenizer_mode="slow" 削除(デフォルトの “hf" を使用)
Mamba キャッシュ設定 --enable-mamba-fine-grained-prefix-cache --enable-mamba-shared-prefix-checkpoint
FP8 量子化指定 quantization="fp8" fp8_per_tensor (ショートハンド)
Quark 量子化 暗黙的なオンライン量子化 削除(vLLM 標準のオンライン量子化 API を使用)
推論バックエンド AllSpark INT8 W8A16 削除
Eager モード --enforce-eager JIT カーネルのウォームアップも無効化
XPU 設定 VLLM_XPU_ENABLE_XPU_GRAPH 削除(デフォルトで有効化)

マルチモーダルモデルの利用者には、セキュリティ上の理由からリクエストごとの引数指定に制限がかかります。信頼できる環境で従来通りの動作が必要な場合は、サーバー起動時に --trust-request-mm-kwargs オプションを付与してください。

主な変更点

高速再起動機能(Fast restart)の導入

新しく導入された vllm preload CLI により、量子化済みの重みを GPU メモリ内に常駐させる「weight-cache デーモン」が利用可能になりました。これにより、エンジンの再起動を繰り返す開発環境や、頻繁にモデルを切り替える運用環境において、重みの再ロード待ち時間を劇的に削減できます。この機能はデータ並列(DP)や MTP ドラフトモデルにも対応しており、/health エンドポイントによる状態監視も可能です。

DeepSeek-V4.1-Flash への最適化

最新の DeepSeek-V4.1-Flash モデルに対して、ハードウェアの性能を最大限に引き出すための最適化が多数導入されました。NVIDIA Blackwell (SM100) において FlashMLA mega attention と NVFP4 圧縮 KV キャッシュがデフォルトで有効になるほか、DeepGEMM を用いた疎な MQA ロジット計算や、ゲート GEMM とエキスパート選択を融合させた「Mega-Gate」などの高度なカーネル融合が実装されています。これにより、最新世代の GPU における推論速度が向上します。

プレフィックスキャッシュのセキュリティと正確性の向上

プレフィックスキャッシュ(Prefix caching)のハッシュ計算ロジックが改善されました。従来は LoRA 名や cache_salt がタグ付けされずに混合されていたため、異なる LoRA アダプターやソルト指定の間でキャッシュが衝突する可能性がありました。本バージョンからは各要素がソースごとにタグ付けされ、さらに LoRA の場合はアダプターのパスもハッシュに含まれるようになります。これにより、同じ名前で異なるアダプターをロードし直した場合でも、古いキャッシュを誤って再利用する問題が解消されます。

スケジューリング制御の柔軟化

新しいオプション --max-num-active-seqs が追加され、実行中のシーケンス数を max_num_seqs とは独立して制限できるようになりました。また、待機キューのロジックが刷新され、既に KV ブロックを保持しているリクエストが優先的にスケジュールされるようになっています。これにより、リソースに負荷がかかっている状況でのスループット低下やデッドロックが抑制されます。

Model Runner V2 と投機的デコードの強化

内部アーキテクチャである Model Runner V2 において、ドラフトモデルを用いた投機的デコード(Speculative decoding)やカスタムロジッツプロセッサがサポートされました。また、新しいドラフト手法である LiLiCorr の追加や、DFlash における非同期スケジューリングのサポートなど、推論の遅延を短縮するための機能が拡充されています。

対応モデル・ハードウェア

本バージョンでは、数多くの新しいモデルアーキテクチャや量子化形式への対応が行われ、ハードウェア向けの最適化も大幅に進んでいます。

新規対応モデルと機能拡張

多様な最新モデルに対する推論サポートと機能拡張が追加されています。

  • MiMo V2 / Cohere2MoE: MiMo V2 において MXFP4 MoE、BF16 MoE ルーター、および DFlash ドラフトモデルがサポートされました。Cohere2MoE では EAGLE3 や DFlash ドラフター向けの補助隠れ状態に対応しています。
  • GLM-5.3-Flash / GLM-5.2: GLM-5.3-Flash では、SM90 向けの FlashAttention および FlashMLA 疎バックエンド(オプトイン)や、SM120 向けの NoPE 疎 MLA バックエンドが導入されました。インデクサデコードワークスペースの最適化によりメモリ消費を 3 GiB 削減したほか、メタデータ操作が 1.6 倍から 4.8 倍高速化しています。また、GLM-5.2-MXFP4 が ROCm 環境の DeepSeek-V3.2 実行パスで利用可能です。
  • DeepSeek シリーズ: DeepSeek V4 において、FlashInfer 疎 MLA による融合逆 RoPE と FP8 量子化、suffix 引数を用いた FIM(Fill-in-the-Middle)補完、既存システムメッセージへのツール定義付与に対応しました。AMD-Quark 混合精度チェックポイントとして、DeepSeek-V4.1-Flash-MXFP4 や GLM-5.3-Flash Quark MXFP4 もサポートされています。
  • Qwen3.8-Flash-Next (Qwen4Exp): QSA パスでの FP8 メイン KV キャッシュや、FlashInfer TRTLLM MoE による FP8 テンソル並列に対応しました。DGX Spark 上での重みロード処理を約 25 秒短縮する最適化も含まれます。
  • Kimi K3 / MiniMax-M3: Kimi-K3 ではビジョンパッチエンベッダーの GEMM 化や KimiViT QK RoPE の融合カーネル(最大 29 倍高速化)が追加されました。MiniMax-M3 でも Conv3dLayer パッチエンベッディングの最適化(約 62 倍高速化)やエンコーダ CUDA グラフのサポートが行われています。
  • DiffusionGemma / Granite 4.2: DiffusionGemma において有界シングルチョイストークンによる構造化生成モードが実装され、制約付き読み込みが約 25% 高速化しました。Granite 4.2 向けには granite_thinking_parser が組み込みで提供されます。

マルチモーダルモデルおよび LoRA の拡充

マルチモーダルモデルでは、音声モデルの Whisper や Qwen2-Audio において 30 秒を超える音声クリップの処理が可能になりました。Qwen2.5-VL では時間軸 M-RoPE 向けに動画の fps 設定が尊重されるよう改善されたほか、Gemma4 におけるヘッド次元 512 の FP8 KV キャッシュ対応などが導入されています。

LoRA アダプターのサポート対象も拡大しており、Nemotron VL 言語モデル、ModernBert、VoyageQwen3 埋め込みモデル、RoBERTa 配列分類モデルに対して LoRA を適用できるようになりました。

ハードウェアサポートの進展

NVIDIA の最新世代アーキテクチャである SM100 および SM103(Blackwell)向けの最適化が集中的に行われており、NVFP4 圧縮 KV キャッシュや MXFP8 関連の融合カーネル、マルチメモリを活用した低レイテンシな reduce-scatter 処理が実装されています。SM120 向けの行列積カーネル設定も追加されました。

また、Intel XPU 環境では XPU グラフがデフォルトで有効化され、環境変数による明示的な指定が不要になりました。AMD ROCm 環境に対しても、ROCm 7.2.3 向けのコンパイル済みパッケージが提供されています。

アップデート方法

既存の環境を v0.31.0 に更新するには、推奨パッケージマネージャーの uv または pip を使用してアップグレードを行います。

一般的な CUDA 13.0 環境では、以下のコマンドを実行します。

uv pip install vllm --torch-backend=auto

通常の pip を利用する場合は、以下のコマンドを実行してください。

pip install --upgrade vllm

ROCm 環境向けのビルドを導入する場合は、専用の wheel インデックスを指定してインストールします。

pip install vllm --extra-index-url https://wheels.vllm.ai/rocm/0.31.0/rocm723

コンテナ環境を利用する場合は、公式 Docker イメージを取得して更新できます。

docker pull vllm/vllm-openai:v0.31.0

関連記事

次に読むなら

出典