100Mパラメータの軽量画像生成モデル「SupraLabs/Supra2-IMG」公開

2026年9月24日

100Mパラメータの軽量画像生成モデル「SupraLabs/Supra2-IMG」公開

作例は配布元のモデルカードで公開されています。

基本情報

項目 内容
リポジトリ SupraLabs/Supra2-IMG
公開日 2026-09-21
ライセンス apache-2.0
出典の種類 公開元の一次情報(HuggingFace公式リポジトリが一次情報)

収集・肉付けの時点で当サイトのコードが確定させた値です。日付はJST。

作例は配布元のモデルカードで公開されています。

作例は配布元のモデルカードで公開されています。

作例は配布元のモデルカードで公開されています。

概要

SupraLabsは、高品質な合成データセットを用いてスクラッチから学習された、極めて軽量なテキストから画像への生成モデル(Text-to-Image)である「Supra2-IMG」を公開しました。このモデルは、パラメータ数が約100M(1億)という非常に小さなサイズでありながら、その規模においてState-of-the-art(SOTA)の画像品質を提供することを目的として設計されています。

スペック

モデルの主要な仕様および構成は以下の通りです。

  • アーキテクチャ: Diffusion Transformer (DiT) / SupraDiT
  • パラメータ数: 104.1M
  • 入力: テキスト
  • 出力解像度: 256²
  • 潜在変数サイズ (Latent size): 32²
  • パッチサイズ: 2
  • テキストエンコーダー: Flan-T5-Base (frozen)
  • VAE: SD-VAE-FT-MSE
  • 推奨サンプリング設定:
    • CFGスケール: 3.0 – ステップ数: 50 – シード値: 0
  • モデル構成の詳細:
    • D_MODEL: 576 – DEPTH: 14 – N_HEADS: 9 – HEAD_DIM: 64 – MLP_RATIO: 4.0 – D_CTX: 768 – VAE_SCALE: 0.18215
  • ライセンス: apache-2.0

性能・品質

Supra2-IMGは、5.6M(560万)枚の画像を含む「LucasFang/FLUX-Reason-6M」データセットを用いて、10エポックの学習が行われました。データ準備のプロセスにおいては、学習に用いるデータの品質を最大限に高めるため、プロンプトの選択において特定の優先順位が設けられています。具体的には、caption_compositioncaption_entitycaption_textcaption_stylecaption_imaginativeという順序でプロンプトが選択され、前のプロンプトが利用できない場合のフォールバックとして機能することで、最も高品質なデータのみがプリトレーニングに使用されるよう厳格に管理されています。

学習環境については、単一のNvidia H100 SXM 80GB(Runpod Pod)を使用し、データ準備の時間を含めて合計9時間で完了したと報告されています。また、学習には2.5TBのディスクが使用されました。

モデルカードによれば、この104.1Mという極めて小さなパラメータ数において、SOTA(State-of-the-art)の品質を実現しているとされています。具体的な数値によるベンチマーク比較は示されていませんが、高品質な合成データと効率的なDiTアーキテクチャの組み合わせにより、モデルサイズに対する高い生成能力を持っていることが強調されています。

得意なこと・想定用途

Supra2-IMGは、テキストから画像を生成するText-to-Image(T2I)モデルであり、その最大の特徴は、わずか104.1Mという極めて小さなパラメータ数で、モデルサイズに対してSOTA(State-of-the-art)級の品質を実現している点にあります。これは、学習プロセスにおいて「LucasFang/FLUX-Reason-6M」という5.6M枚の画像を含む高品質な合成データセットを、非常に厳格な基準で準備したことが大きく寄与しています。

具体的には、データの準備段階において、caption_compositioncaption_entitycaption_textcaption_stylecaption_imaginative という順序でプロンプトの質を評価し、前の段階の品質が満たされない場合にのみ次のプロンプトを使用するというフォールバック方式が採用されています。このプロセスにより、モデルは最も高品質なデータのみを学習対象としており、結果として、限られた計算リソースやメモリ容量でも、精度の高い画像生成を行うことが期待されます。

現在は、英語(en)を対象とした生成を想定しており、将来的に「Supra2.5-IMG」のような次世代モデルへと進化させる計画も示されています。軽量ながらも高品質な生成を求める、ローカル環境での動作を重視する技術者にとって、非常に有力な選択肢となるでしょう。

入手方法

モデルの利用は、Hugging Faceのリポジトリから提供される推論用スクリプトを用いて行います。配布形式は、スクリプトとモデルの重みファイル(model_final_ema.pt)を組み合わせて使用する形となります。

まず、以下のコマンドを実行して作業用のディレクトリを作成し、推論スクリプト inference.py を取得してください。

# プロジェクトディレクトリの作成
mkdir Supra2-IMG
cd Supra2-IMG

# 推論スクリプトのダウンロード
wget https://huggingface.co/SupraLabs/Supra2-IMG/resolve/main/inference.py

次に、python inference.py コマンドを使用して画像生成を開始できます。実行時には、生成したい内容を記述する --prompt 引数に加え、再現性を確保するための --seed、生成の品質を制御する --cfg(推奨値は3.0)、およびサンプリングの精度を決定する --steps(推奨値は50)などのオプションを指定します。また、生成する枚数を示す --n や、出力ファイル名を指定する --out も利用可能です。

python inference.py --prompt "a sea jellyfish floating in the pitch-black ocean depths"  --seed 0  --cfg 3.0  --steps 50  --n 1  --out jellyfish.png

実行時のログには、使用されるデバイス、ロードされたチェックポイント、モデルのパラメータ数、テキストエンコーダー(Flan-T5-Base)のロード状況、およびサンプリング工程(Euler flow)の詳細が表示されます。

なお、本モデルのダウンロードにあたって、Hugging Face上でのライセンス同意(Gated access)は必要ありません。

出典

更新履歴

  • 2026-09-23: 記事の組み立てを更新しました: GGUF量子化版のビルド重複合算バグを修正(必要メモリ・VRAM早見表)
  • 2026-09-23: 記事の組み立てを更新しました: 投機的デコード用draft head(mtp-)ファイルを本体と誤認していたバグを修正(必要メモリ・VRAM早見表)