高速推論エンジン「SGLang v0.5.21」公開、PDインスタンスの動的切り替えに対応

高速推論エンジン「SGLang v0.5.21」公開、PDインスタンスの動的切り替えに対応

基本情報

項目 内容
リポジトリ sgl-project/sglang
版 v0.5.21
公開日 2026-10-02
ライセンス Apache-2.0
出典の種類 公開元の一次情報(公式GitHubリポジトリのリリースページが出典)

情報を集めた時点で、当サイトのコードが確定させた値です。日付はJSTで表示しています。

概要

SGLangは、大規模言語モデル(LLM)およびマルチモーダルモデルのための高性能なサービングフレームワークです。今回のアップデートでは、バージョン0.5.21がリリースされました。

このリリースの最も大きな変更点は、PD(Prefill/Decode)インスタンスが、再起動することなく実行中にPrefillとDecodeの状態を動的に切り替えられるようになったことです。これにより、推論リソースの利用効率が大幅に向上することが期待されます。

破壊的変更・非推奨

今回のアップデートでは、過去のリリースで非推奨とされていた機能や、実験的な機能の削除が行われています。これらを使用している環境では注意が必要です。

変更内容 旧状態・設定 新状態
実験的なC++ radix treeの削除 SGLANG_EXPERIMENTAL_CPP_RADIX_TREE 環境変数 利用不可
特定のRadix Cacheの実装削除 SWARadixCache / MambaRadixCache UnifiedRadixCache へ統合
未使用のHiRadixCacheの削除 HiRadixCache 利用不可
過去の非推奨エンドポイントの削除 2リリース以上前から非推奨だったAPI/環境変数/エイリアス 利用不可

これらは、主に開発者や、特定の実験的なキャッシュ設定を明示的に指定して運用しているユーザーに影響します。

主な変更点

PDインスタンスの動的なロール切り替え

PD(Prefill/Decode)インスタンスにおいて、PrefillとDecodeの役割を、インスタンスを再起動することなくオンザフライで切り替えられるようになりました。これにより、推論ワークロードの変化に柔軟に対応できるようになります。

Prefix CacheのRustコア化

Prefix Cacheが、デフォルトでRustベースのコアで動作するようになりました。これにより、キャッシュ管理の効率化とパフォーマンスの向上が図られています。

新しいAPIの導入(Decisions API / Score API)

LLMやVLMを低遅延の分類器やスコアラーとして利用するための新しいAPIが追加されました。
– /v1/decisions (Decisions API): モデルを低遅延な分類器やスコアラーとして機能させます。
– /v1/score (Score API): 1回のリクエストで全ての候補のスコアを算出できます。

特定モデルのパフォーマンス改善

特定のモデルにおいて、推論速度の向上が報告されています。
– DeepSeek-V4.1: 長いプロンプトにおける最初のトークン生成(First Token)が22%高速化されました。
– Kimi K3: PDサービングにおけるPrefillスループットが20.6%向上しました。
– LFM2-VL: DSpark speculative decodingの導入により、バッチサイズ1において1.66xから2.56xの高速化を実現しました。

並列処理と通信の最適化

PP(Pipeline Parallelism)、DP(Data Parallelism)、CP(Context Parallelism)環境下での精度向上と最適化が行われました。具体的には、レイヤー間の通信がSGLangによって直接制御されるようになり、より正確な結果が得られるようになっています。また、MoE(Mixture-of-Experts)モデルにおける、DeepEP v2のサポートや、H200におけるw4a8 MoEの最適化なども含まれています。

対応モデル・ハードウェア

今回のアップデートでは、最新のLLM(大規模言語モデル)やVLM(マルチモーダルモデル)、さらにはDiffusion(拡散モデル)といった、多岐にわたるモデルアーキテクチャへの対応が大幅に拡充されました。これにより、テキスト生成や画像理解、さらには画像生成といった、生成AIにおける主要なタスクをSGLangの高性能な推論エンジン上で一貫して実行できるようになります。

新たに対応したモデル

以下のモデルが新たに追加され、推論が可能になりました。各モデルの具体的な利用方法については、公式のCookbookを参照してください。

LLM / VLM (大規模言語モデルおよびマルチモーダルモデル)

テキスト生成や、画像とテキストを組み合わせた理解を行うためのモデルです。
– DeepSeek-V4.1 Flash
– GigaChat 3.5
– IQuest-Q1
– MiMo-V2.6 / MiMo-V2.6-Pro
– Ling-3.0-flash-VL

Diffusion (拡散モデル)

画像生成タスクなどに使用される拡散モデルです。
– DiffusionGemma
– Qwen-Image 2.1
– Anima Base v1.0
– Ming-Image 0.1 Design / Design-Layer
– FLUX 3 Action

対応ハードウェア・プラットフォーム

SGLangは、多様な計算リソースで動作するように設計されています。今回のリリースでは、以下のプラットフォーム向けに最適化されたDockerイメージが提供されています。各イメージを使用することで、ハードウェアの性能を最大限に引き出すことが可能です。

  • NVIDIA GPU: CUDA 13環境での動作に対応しています。
  • AMD GPU: ROCm 10環境において、AMDの最新アーキテクチャであるMI35xおよびMI30xの両方に対応しています。
  • Intel GPU: Intel XPUプラットフォームに対応しています。
  • Intel CPU: Intel XeonプロセッサなどのCPU環境に対応しています。

アップデート方法

ご利用の環境に合わせて、以下のいずれかの方法でアップデートを行ってください。

pipを使用したアップデート

uv を利用してパッケージ管理を行っている場合は、以下のコマンドを実行することで、プリリリース版を許可した状態でバージョン 0.5.21 を直接指定してインストールできます。

uv pip install --prerelease=allow sglang==0.5.21

Dockerイメージによる利用

コンテナベースの環境を利用している場合は、プラットフォームごとに最適化された以下のDockerイメージを取得して利用することが推奨されます。

  • NVIDIA (CUDA 13): lmsysorg/sglang:v0.5.21
  • AMD MI35x: lmsysorg/sglang:v0.5.21-rocm10-mi35x
  • AMD MI30x: lmsysorg/sglang:v0.5.21-rocm10-mi30x
  • Intel GPU: lmsysorg/sglang:v0.5.21-xpu
  • Intel CPU: lmsysorg/sglang:v0.5.21-xeon

関連記事

次に読むなら

出典