「PixelUMM」マルチモーダルモデル:必要VRAM 24GB〜
NVIDIAが公開した「PixelUMM」は、テキスト・画像・動画の理解と生成を単一モデルで行うマルチモーダルモデルです。外部の視覚エンコーダを使わないエンコーダフリー構造の特徴や仕様、入手方法を解説します。
手元で動くオープンウェイトモデルの新着・早見表・実測データ
NVIDIAが公開した「PixelUMM」は、テキスト・画像・動画の理解と生成を単一モデルで行うマルチモーダルモデルです。外部の視覚エンコーダを使わないエンコーダフリー構造の特徴や仕様、入手方法を解説します。