NVIDIA AIPerf公開:大規模LLM推論ベンチマークツール
NVIDIAが大規模LLM推論の性能測定ツール「NVIDIA AIPerf」を発表。マルチプロセス構成による高並行環境の正確なベンチマーク測定手順を解説します。
LM Studio、会話履歴を自己検索する「Introspection」とセッション参照機能を発表
LM Studioは、Bionicにおける過去の会話セッションの検索・参照機能「Introspection」および「@」メンション機能を発表しました。コンパクションによる情報の損失を防ぐエージェントの自己省察の仕組みを解説します。
GLMが独自推論インフラ構築を発表、中国製アクセラレータ活用と大規模MoEのローカル実行手法
GLMが10万台超の中国製AIアクセラレータを用いた独自推論インフラと「GLM-5.3-Flash」の稼働を発表。さらに744B MoEモデルをMacBookで動かすNVMeストリーミング手法も解説します。
TensorRT Edge-LLMとQwen3.6-27BでMLPerf Edge Agenticベンチマークを高速化
NVIDIA Jetson AGX Thor上でTensorRT Edge-LLMとQwen3.6-27Bを用いてMLPerf Edge Agenticベンチマークを実行し、従来のリファレンス比6.4倍の高速化を達成した詳細と再現手順 ...
NVIDIA Groq 3 LPXの決定的実行とVera Rubinでの高効率推論
NVIDIA Vera Rubinプラットフォーム向け「NVIDIA Groq 3 LPX」の決定的実行モデルと電力効率化技術の詳細を解説。サイクル単位のスケジューリングにより高対話型推論を最適化する仕組みを紹介します。
Together AI、オープンウェイトモデルのファインチューニング機能を拡充し値下げも実施
Together AIがオープンウェイトモデル向けファインチューニングサービスをアップデート。新モデルの追加、ライブメトリクス追跡、Expert LoRAの導入、早期停止機能や最大70%の値下げを発表しました。
NVIDIA BioNeMo Inference Runtime発表、Boltz-2の推論を高速化
NVIDIAがオープンウェイトの生体分子構造予測モデルBoltz-2などの推論を高速化する「NVIDIA BioNeMo Inference Runtime(BioIR)」を発表。H100 GPUを用いたスループット向上や電力削減の仕 ...
NVIDIA NIM最適化でNemotron 3 Ultraのスループットが2.5倍に向上
NVIDIA Nemotron 3 Ultra向けNIM 2.0.12の最適化により、B200システム上でのスループットが2.5倍に向上した技術詳細とローカル環境での活用法を解説します。
NVIDIA Dynamo、マルチモーダルモデル向けEPD分散サービングの活用法を公開
NVIDIA Developerが公開したマルチモーダルモデルのサービングを加速する「Encode-Prefill-Decode (EPD) disaggregation」の活用法について解説します。NVIDIA DynamoによるT ...
Goodfire、Ai2のオープン後学習スタックでOlmoモデルの挙動を追跡
GoodfireがAllen Institute for AI (Ai2)のオープンなポストトレーニングスタックを利用し、Olmoモデルの望ましくない挙動の追跡や予測を行った事例を解説します。