NVIDIA Dynamo-Triton 26.07公開、TensorRTのマルチGPU統合機能に対応

基本情報
| 項目 | 内容 |
|---|---|
| 公開元 | NVIDIA Developer |
| 公開日 | 2026-09-22 |
| 出典の種類 | 公開元の一次情報(NVIDIA公式開発者ブログによる一次情報) |
収集・肉付けの時点で当サイトのコードが確定させた値です。日付はJST。
概要
NVIDIAは2026年9月21日、推論サーバー「NVIDIA Dynamo-Triton」(旧称 NVIDIA Triton Inference Server)のバージョン26.07を公開し、NVIDIA TensorRTのマルチデバイス統合機能を導入したことを発表しました。このアップデートにより、単一のモデルインスタンスが複数のGPUを直接管理し、NCCL(NVIDIA Collective Communications Library)を利用した分散推論を効率的に実行できるようになります。
発表の内容
今回の発表の核となるのは、TensorRT 11.0からフルサポートされた「マルチデバイス推論」機能のDynamo-Tritonへの統合です。これにより、これまで開発者が個別に制御する必要があった複数GPUにまたがる推論プロセスが、推論サーバー側で抽象化されました。
システム構成の簡素化
Dynamo-Triton 26.07では、KIND_MODELとして定義された1つのインスタンスが複数のGPUを占有できるようになりました。サーバー内部で各ランク(GPU)ごとの実行コンテキスト、CUDAストリーム、およびNCCL通信プロトコルが自動的に生成・管理されます。クライアント側からは、単一のgRPCエンドポイントを呼び出すだけで分散推論を利用でき、GPU間のランク調整や通信のライフサイクル管理をユーザーが実装する必要がありません。
Cosmos 3 Nanoによる実証
NVIDIAは、動画生成モデル「NVIDIA Cosmos 3 Nano」を用いたベンチマーク結果を公開しました。このモデルは36層のデノイジング・トランスフォーマーを備え、1回の生成で44,160個のビデオトークンを処理する負荷の高いワークロードです。ベンチマークは、1280×720の解像度、24 FPSで189フレームの動画を、35のデノイジング・ステップで生成する条件で実施されました。
今回の統合では「Ulyssesコンテキスト並列(Ulysses context parallelism)」が採用されており、ビデオトークンを最大8基のGPUに分散して処理します。具体的なパフォーマンスの変化は以下の通りです。
- 1基のGPU(シングルデバイス):エンドポイント間の平均生成レイテンシは156.595秒。
- 8基のGPU(CP8構成):エンドポイント間の平均生成レイテンシは34.183秒まで短縮。
- トランスフォーマーのRPC(遠隔手続き呼出し)単体では、1基のGPUで146.192秒だった処理が、8基では23.993秒となり、約6.09倍の高速化を達成しています。
構成方法と実装の詳細
マルチデバイス機能を有効にするには、モデルの構成ファイル(config.pbtxt)で enable_multi_device を true に設定し、使用するGPUのIDを指定します。資料で示された8基構成の例では、multi_device_gpus に 0,1,2,3,4,5,6,7 が指定されています。
実装面では、PyTorchからエクスポートされたエンジンがTorch-TensorRTでコンパイルされ、TensorRTの公開分散コレクティブレイヤー(reduce-scatter、all-to-all、all-gather)に変換されます。Ulyssesの仕組みにより、アテンション処理の前後で分割軸を変更することで、各ランクが全ビデオシーケンスの非重複サブセットを処理する構造となっています。
出力品質の検証
複数GPUへの分散処理による品質への影響についても検証が行われました。同一のシード値を用いたテストにおいて、シングルデバイスの結果とマルチデバイス(2基、4基、8基)の結果を比較したところ、設定された品質閾値(MAE ≤ 25、PSNR ≥ 18 dB)をすべてクリアしたと報告されています。8基構成(CP8)では、MAE 16.316、PSNR 19.400 dBを記録し、視覚的にも一貫性のある動作が確認されました。
背景
生成AIの計算量とメモリ需要は、単一のGPUが提供できる能力をますます超えるようになっています。これに対応するため、NVIDIAはTensorRT 11.0から「NVIDIA TensorRT マルチデバイス推論」を導入しました。これは、TensorRTの推論最適化を維持したまま、NCCL(NVIDIA Collective Communications Library)を利用した分散コレクティブ通信を通じて、単一のTensorRTネットワークを複数のGPUで実行できるようにする機能です。
今回のDynamo-Triton 26.07における統合は、このマルチGPUアクセラレーションと、実際に利用可能な推論サービスとの間のギャップを埋めることを目的としています。特に、動画生成のような長いシーケンスを扱うワークロードでは、単一GPUでの処理時間がユーザーの待機時間に直結するため、効率的な分散手法が求められていました。NVIDIAは、複雑な分散処理のライフサイクル管理を推論サーバー側に持たせることで、開発者がより容易に高性能な推論環境を構築できる環境を整えた形です。
ローカルLLMの利用者への影響
ローカル環境や自社サーバーでオープンウェイトのモデルを運用する技術者にとって、今回のアップデートはマルチGPU環境の構築と運用の難易度を大幅に下げるものです。具体的には、以下の3つの点で大きな変化が期待されます。
分散推論の実装コストの削減
従来、複数のGPUにまたがる推論を行うには、開発者が各GPU(ランク)間の通信や同期、ライフサイクル管理をコードレベルで記述する必要がありました。Dynamo-Triton 26.07では、これらがサーバー側で抽象化されており、ユーザーは設定ファイル(config.pbtxt)を記述するだけでマルチGPU推論を有効にできます。これにより、クライアント側のアプリケーションは単一のgRPCエンドポイントを呼び出すだけで済み、複雑なランク調整コードを自前で実装・維持する必要がなくなります。
推論レイテンシの劇的な改善
資料で示されたCosmos 3 Nanoの例では、トランスフォーマー部分の処理速度が約6倍に向上し、エンドツーエンドの生成時間も156秒から34秒へと大幅に短縮されています。これは、生成AIを用いた対話型アプリケーションや、試行錯誤のサイクルが重要となるメディア生成ワークロードにおいて、ユーザー体験を直接的に向上させる要素です。特に、Ulyssesコンテキスト並列の採用により、アテンション処理の軸を動的に変更することで、各GPUが全シーケンスの一部を分担して処理する高度な分散手法が利用可能になります。これは、モデルの構造を大きく変えることなく、コンパイル時の設定で実現できるため、新しいオープンウェイトモデルへの適用も比較的スムーズに行える可能性があります。
リソース活用の柔軟性
リソースとレイテンシのトレードオフを柔軟に選択できるようになります。同じモデルを、1基のGPUで時間をかけて動かすか、あるいは追加のGPUリソースを投入して応答時間を短縮するかを、インフラの状況やサービスレベル目標(SLO)に合わせて容易に切り替えられます。提供形態については、資料ではNGCからダウンロード可能なDynamo-Triton 26.07を通じたローカル実行や自己ホスト型のサービングが中心となっており、APIサービスへの移行を強制するような言及はありません。既存のワークフローを維持したまま、バックエンドでマルチGPUの恩恵を受けられる点が強調されています。
なお、今回の発表はTensorRTバックエンドでのマルチデバイス対応に焦点を当てたものであり、他のバックエンドでの同様の統合については資料に記載されていません。また、同時リクエストのスループットや、生成ビデオあたりのコスト、総所有コスト(TCO)といった指標については、今回のベンチマークの範囲外であると明記されており、利用者は自身の環境でこれらの指標を評価する必要があります。
関連記事
- NVIDIA AIPerf公開:大規模LLM推論ベンチマークツール
- JAXとNVIDIA Transformer EngineによるDropless MoE学習の高速化
- NVIDIA PAIR仮想推論ルーター公開、ローカル計算資源を拡張

