NVIDIA Blackwell GPUの機密コンピューティングで安全なAI推論

基本情報
| 項目 | 内容 |
|---|---|
| 公開元 | NVIDIA Developer |
| 公開日 | 2026-09-23 |
| 出典の種類 | 公開元の一次情報(NVIDIA公式開発者ブログが一次情報) |
収集・肉付けの時点で当サイトのコードが確定させた値です。日付はJST。
概要
NVIDIAは、NVIDIA Blackwell GPUを用いた機密コンピューティング(Confidential Computing, CC)環境下でのAI推論パフォーマンスに関する検証結果を発表しました。メモリ暗号化された機密仮想マシン(CVM)、機密GPU、および暗号化されたNVIDIA NVLinkを使用することで、機密性の高いデータやモデルコンテキストを保護しながら、高パフォーマンスなAI推論を実行できることを示しています。
主張と根拠
NVIDIAの発表によれば、TensorRT LLMなどの推論フレームワークが機密コンピューティング環境に最適化されている場合、セキュリティ機能を有効にしても推論パフォーマンスへの影響を最小限に抑えられるとしています。NVIDIAのエンジニアリングチームによる測定では、NVIDIA Blackwell GPUを用いたDeepSeek-R1モデルの推論において、機密コンピューティングを有効(CC on)にしても、無効(CC off)の場合と比較して、出力トークンのスループットの96.1%から98.2%を維持し、トークンあたりの平均レイテンシ(TPOT)のオーバーヘッドを1.2%から4.3%の範囲内に留めることができました。
この結果は、以下のワークロード構成を用いた比較実験に基づいています。
ワークロード構成
| 項目 | 設定内容 |
|---|---|
| モデル | nvidia/DeepSeek-R1-0528-NVFP4 |
| 推論フレームワーク | TensorRT LLM (PyTorch backend) |
| I/Oシーケンス長 | 入力 32K / 出力 1K |
| 並列リクエスト数 | 1, 2, 4, 8, 16 |
| 並列化設定 | TP=8, EP=1, PP=1 |
| KVキャッシュ | FP8 |
測定指標
発表者は、CCによるオーバーヘッドを定量化するために、以下の指標を用いています。
– Output throughput retained: $100 \times \text{(CC on の出力トークン/s} \div \text{CC off の出力トークン/s)}$
– Latency overhead Time Per Output Token (TPOT): $100 \times (\text{CC on の TPOT} \div \text{CC off の TPOT} – 1)$
前提条件
検証に使用されたハードウェアおよびソフトウェアの構成は以下の通りです。
- ハードウェア: 1 NVIDIA DGX B200 system (8 NVIDIA B200 GPUs)
- プラットフォーム: Intel TDX
- ホストOS: Ubuntu 25.10 (Host kernel 6.17.0-20-generic)
- ゲストOS: Ubuntu 24.04.4 LTS (Guest kernel 6.8.0-124-generic)
- ゲストvCPUs: 256
- ゲストNUMA: 2 nodes
- NVIDIA driver: 595.71.05
- VBIOS FW: 1.4.x [97.10.64.00.0C]
- GPU power limit: 1,000 W
- CUDA: 13.2
- TensorRT LLM:
nvcr.io/nvidia/tensorrt-llm/release:1.3.0rc22 - NCCL: v2.30
- OpenSSL: 3.6.0
- オーケストレーション: Docker Container + NVIDIA Container Toolkit
手元で再現できる範囲
本資料では、TensorRT LLMが機密コンピューティング(CC)環境下でのパフォーマンス低下を抑制するために導入した、具体的な最適化手法が示されています。これらの実装は、以下のGitHub上のプルリクエスト(PR)を通じて確認できる可能性があります。
-
TensorRT LLM PR #11573: B200のCC構成では、GPUが保護されたCVMメモリに直接アクセスできないため、ホストからデバイスへの転送がソフトウェア暗号化されたバウンスバッファを経由します。これにより、一部のコピーが呼び出しスレッドをブロックする可能性があります。この問題に対し、TensorRT LLMは、デコード中に保護されたコピーがメインスケジューラをブロックするのを防ぐため、繰り返されるトークンおよびサンプリングデータの読み戻しを非同期ワーカーに移動する最適化を行っています。また、ホストからデバイスへの転送において、無条件にピン留めメモリ(pinned memory)を使用するのではなく、CCを考慮したメモリ選択を行い、影響を受けるパスに対してページング可能なメモリ(pageable memory)を選択することで対応しています。 -
TensorRT LLM PR #11657: カーネルautotunerは通常、CUDAイベントを使用して候補となるタクティクスを比較しますが、テストされたCC構成ではCUDAイベントのタイムスタンプが不安定な信号を生成し、autotunerがより低速なタクティクスを選択してしまう可能性がありました。この対策として、TensorRT LLMはCC環境下でのタクティクス測定にGPUの%globaltimerを使用するようにしています(CC環境外では引き続きCUDAイベントを使用)。
また、機密コンピューティングの導入計画については、NVIDIA Trusted Computing documentation を参照することが案内されています。ただし、検証に使用された環境は NVIDIA DGX B200 システムという特定のデータセンター向けハードウェアに基づいている点に注意が必要です。
資料が触れていないこと
本資料では、以下の点については言及されていません。
- Blackwell世代以外のGPUアーキテクチャにおける機密コンピューティングのパフォーマンスや挙動。
- 機密コンピューティング環境を構築・運用する際にかかる具体的なコスト。
- 異なるOS、カーネル、または異なるNUMA構成など、他のソフトウェア・ハードウェア環境における詳細なベンチマーク結果。
- NVLS (NVLink SHARP) multicast が利用できない状況において、メッセージサイズ、トポロジー、ワークロード特性に応じた最適な通信アルゴリズムを具体的にどのように選定すべきかという詳細な基準。
関連記事
- NVIDIA AIPerf公開:大規模LLM推論ベンチマークツール
- NVIDIA Topograph公開、クラスターのネットワークトポロジーを自動発見し最適配置
- NVIDIA Dynamo-Triton 26.07公開、TensorRTのマルチGPU統合機能に対応
- JAXとNVIDIA Transformer EngineによるDropless MoE学習の高速化
出典
更新履歴
- 2026-09-23: 記事の組み立てを更新しました: GGUF量子化版のビルド重複合算バグを修正(必要メモリ・VRAM早見表)
- 2026-09-23: 記事の組み立てを更新しました: 投機的デコード用draft head(mtp-)ファイルを本体と誤認していたバグを修正(必要メモリ・VRAM早見表)

