「PixelUMM」マルチモーダルモデル:必要VRAM 24GB〜

「PixelUMM」マルチモーダルモデル:必要VRAM 24GB〜

作例は配布元のモデルカードで公開されています。

基本情報

項目 内容
リポジトリ nvidia/PixelUMM
公開元のまとめ NVIDIA のモデルとライセンスのまとめ
公開日 2026-10-02
ライセンス nvidia-one-way-noncommercial-license
出典の種類 公開元の一次情報(NVIDIA公式HFリポジトリの一次情報)

情報を集めた時点で、当サイトのコードが確定させた値です。日付はJSTで表示しています。

概要

NVIDIAは、テキスト、画像、動画の相互理解および生成を単一のモデルで統合して行うマルチモーダルモデル「PixelUMM」を公開しました。本モデルは、テキストからの画像生成(text-to-image)、画像条件付きのテキスト生成(image-to-text)、動画条件付きの理解(video-text-to-text)、そして動画生成(video generation)という多岐にわたるタスクに対応しています。

最大の特徴は、従来のモデルのように別個の事前学習済みビジョンエンコーダから埋め込み表現を得るのではなく、RGB画像を直接ピクセルパッチとして扱う「エンコーダフリー(encoder-free)」な構造を採用している点です。これにより、画像や動画の理解タスクと生成タスクが、共通のTransformerベース表現を共有しながら直接ピクセル空間で処理される仕組みを実現しています。

スペック

モデルカードおよび公開資料に記載されているPixelUMMのスペックと仕様は以下の通りです。

  • パラメータ数: 15,199,672,064
  • アーキテクチャ: 生ピクセル(raw-pixel)パッチ埋め込みと反復的ピクセル生成ヘッドを備えたデコーダー専用(Decoder-only)Transformer
  • 言語バックボーン: Qwen/Qwen3-8B(リビジョン b968826d9c46dd6066d109eabc6255188de91218)
  • 画像表現形式: RGB画像を16×16ピクセルのパッチに分割
  • 生成方式: 画像および動画生成における反復的デノイジング(Iterative denoising)
  • 入力形式: テキスト、RGB画像、動画フレーム
  • 出力形式: テキスト、RGB画像、動画フレーム
  • 利用条件: 非商業目的の研究または評価目的(non-commercial research or evaluation purposes)のみに限定

性能・品質

公開されたモデルカードには、具体的な数値によるベンチマーク結果や他モデルとの定量的な比較表は掲載されていません。ただし、公開元であるNVIDIAはモデルカード内で、PixelUMMの品質や生成時の特性、制限事項について以下の通り言及しています。

NVIDIAの報告によると、本モデルは入力されたプロンプトに常に信頼性高く従うとは限らず、生成される画像や動画において意味的または時間的な不整合が生じる場合があるとされています。また、対応する言語や視覚的ドメインの違い、動画の長さ、解像度、アスペクト比、さらには実行するハードウェア構成の違いによっても、パフォーマンスや出力結果の品質が変化する可能性があると説明されています。

あわせて、不正確な情報や不適切なコンテンツを出力するリスクが存在するため、利用にあたってはコンテンツフィルタリングや利用監視、アクセス制限などの安全対策を実施することが求められています。なお、本モデルは商用プロダクション環境や厳格な精度が求められる運用環境での検証は行われていないとされています。

得意なこと・想定用途

PixelUMMは、統合的なマルチモーダルモデリングやピクセル空間での表現学習、マルチモーダル理解、そして画像・動画生成に関する技術検証や研究開発を主な想定用途としています。公開元のNVIDIAによるモデルカードでは、具体的に以下のようなユースケースが挙げられています。

  • テキスト、画像、動画にわたる共通の共有表現に関する研究
  • 外部の視覚エンコーダを使用しない「エンコーダフリー」マルチモーダルアーキテクチャの性能評価
  • テキストプロンプトを入力とした画像および動画の生成
  • 入力された画像や動画フレームを条件(コンディショニング)としたテキストの生成

本モデルは、入力側・出力側の双方でテキスト、画像パッチ、動画フレームを同一の枠組みで扱えるため、従来のタスク別モデルのように個別のビジョンエンコーダを用意することなく、同一のネットワーク上で生成と理解を直接処理できる点が強みです。

なお、PixelUMMのベースとなっている言語モデル「Qwen/Qwen3-8B」自体の性能・特徴として、論理推論や数学・コード生成を強化する「思考モード(thinking mode)」と一般的な対話向けの「非思考モード(non-thinking mode)」の切り替え機能や、ツール呼び出しを行うAgent能力、100以上の言語に対応する多言語理解・翻訳能力などが挙げられます。PixelUMMでは、このQwen3-8Bの言語バックボーンを基礎としながら、生ピクセル(raw-pixel)パッチの埋め込みと反復デノイジングによるピクセル生成ヘッドを統合することで、テキストとビジュアル表現を一体的に処理する環境を提供しています。

動作環境

動作環境の目安(Local Model Watch 算出) — パラメータ数 8.2B(元モデル Qwen/Qwen3-8B の値)

手持ちのVRAM 選べる量子化 ファイルサイズ 必要メモリの目安
RTX 4090 / 3090 など 24GB BF16 15.3GB 18.3GB

必要メモリは配布ファイルの実サイズに実行時のオーバーヘッド(KVキャッシュ等)を20%見込んだ概算で、文脈長・バッチサイズ・推論エンジンによって増減します。公開元の公称値ではなく、当サイトがファイルサイズから機械的に算出した値です。 他のモデルとの比較はVRAM別の早見表を参照してください。 量子化の名前の読み方は用語集にあります。

手元で動かせるか

ライセンス nvidia-one-way-noncommercial-license: 公開元の独自ライセンスです。商用利用の可否を含め、条件は公開元の原文を直接確認してください。

配布形式とライセンス表記から当サイトのコードが組み立てた判定です。ライセンスの要約は法的助言ではないため、実際の利用にあたっては公開元の原文を確認してください。

当サイトでの実測

ライセンスの都合で行っていない実測

このモデルのライセンス(nvidia-one-way-noncommercial-license)の商用利用の条件を、当サイトが満たしていることを確認できていません。広告を掲載している当サイトでは、ライセンスの都合上、モデルを動かす実測(CPU での実行・回答・量子化の比較・変換・生成)は行っていません。

入手方法

PixelUMMのモデルリポジトリは、Hugging Face上の nvidia/PixelUMM で公開されています。

本モデルを実行・検証するためには、Linux環境、NVIDIA製GPU、CUDAに対応したPyTorch、およびFlashAttentionが必須要件として定められています。実際の導入手順としては、使用するCUDA環境に応じたPyTorchとFlashAttentionをセットアップした上で、残りの依存ライブラリをインストールする手順となります。

利用にあたってHugging Face上でのライセンス同意申請(gated)は設定されておらず、リポジトリから直接入手が可能です。ただし、適用されるライセンスは「NVIDIA One-Way Non-Commercial License(nvidia-one-way-noncommercial-license)」となっており、非商業目的の研究または評価目的に限定して配布されている点にご注意ください。

関連記事

次に読むなら

出典