NVIDIA AIPerf公開:大規模LLM推論ベンチマークツール
NVIDIAが大規模LLM推論の性能測定ツール「NVIDIA AIPerf」を発表。マルチプロセス構成による高並行環境の正確なベンチマーク測定手順を解説します。
TensorRT Edge-LLMとQwen3.6-27BでMLPerf Edge Agenticベンチマークを高速化
NVIDIA Jetson AGX Thor上でTensorRT Edge-LLMとQwen3.6-27Bを用いてMLPerf Edge Agenticベンチマークを実行し、従来のリファレンス比6.4倍の高速化を達成した詳細と再現手順 ...
NVIDIA Groq 3 LPXの決定的実行とVera Rubinでの高効率推論
NVIDIA Vera Rubinプラットフォーム向け「NVIDIA Groq 3 LPX」の決定的実行モデルと電力効率化技術の詳細を解説。サイクル単位のスケジューリングにより高対話型推論を最適化する仕組みを紹介します。
NVIDIA BioNeMo Inference Runtime発表、Boltz-2の推論を高速化
NVIDIAがオープンウェイトの生体分子構造予測モデルBoltz-2などの推論を高速化する「NVIDIA BioNeMo Inference Runtime(BioIR)」を発表。H100 GPUを用いたスループット向上や電力削減の仕 ...
NVIDIA Dynamo、マルチモーダルモデル向けEPD分散サービングの活用法を公開
NVIDIA Developerが公開したマルチモーダルモデルのサービングを加速する「Encode-Prefill-Decode (EPD) disaggregation」の活用法について解説します。NVIDIA DynamoによるT ...