ComfyUI向け画像生成モデル「Comfy-Org/Ming-Image」公開

基本情報
| 項目 | 内容 |
|---|---|
| リポジトリ | Comfy-Org/Ming-Image |
| 公開日 | 2026-09-24 |
| ライセンス | mit |
| 配布形式 | safetensors |
| 出典の種類 | 未確認(一次情報で裏付けできていない)(Comfy-Orgは公式だが、Ming-ImageはinclusionAI製で一次情報ではない) |
収集・肉付けの時点で当サイトのコードが確定させた値です。日付はJST。
概要
Comfy-Orgより、inclusionAIが開発したinclusionAI/Ming-Image-0.1-DesignをComfyUIで利用できるように再パッケージしたComfy-Org/Ming-Imageが公開されたと報告されています。本リポジトリは、テキスト入力から画像を出力するtext-to-imageモデルのファイルを、ComfyUIのディレクトリ構造に合わせて整理したものです。なお、この情報は現時点で公式に確認されたものではありません。
スペック
ベースモデルであるinclusionAI/Ming-Image-0.1-Designの仕様および、提供されているファイル構成は以下の通りです。
基本仕様
- パラメータ数: 6B
- 出力の仕様:
- 推奨解像度: 2048 x 2048 – 高速生成用解像度: 1024 x 1024 – 背景: RGBA(透過背景)出力に対応
- 推奨設定:
- サンプリングステップ数: 12 – CFGスケール: 1.0 – 精度: BF16
- プロンプト拡張(PE):
Ling-3.0-flash-VLまたはqwen3.8-27Bの使用が言及されています - ライセンス: MIT
ComfyUIでのファイル配置
再パッケージされたファイルは、ComfyUIの以下のディレクトリに配置することが想定されています。
models/diffusion_models/:ming_image_0.1_design_bf16.safetensors等models/text_encoders/:ming_image_0.1_ling_mini_2.0_bf16.safetensors等models/vae/:ming_image_vae_bf16.safetensors
性能・品質
モデルカードの記述によると、本モデルはUI、インフォグラフィックス、ポスター、およびテキストを多く含むその他のビジュアルデザインの生成に特化しているとされています。単なる要素の生成に留まらず、完全なビジュアル構成(complete visual compositions)を生成する能力を持つと報告されています。また、RGBA形式による透過背景の生成もサポートしており、特定の推奨されるRGBAフレーズをプロンプトの先頭に付与することで、透明な背景を持つ画像の生成が可能になるとされています。
なお、具体的なベンチマークスコアや他モデルとの数値比較については、提供された資料内には記載されていません。
得意なこと・想定用途
元モデルであるinclusionAI/Ming-Image-0.1-Designの資料に基づくと、本モデルは一般的な写真やイラストの生成にとどまらず、テキスト要素を含むグラフィックデザインやUI/UXデザインの制作に特化しているとされています。
具体的には、以下のような用途や機能が想定されています。
- テキストを多く含むビジュアルデザインの生成:
ポスターやインフォグラフィックス、各種UI画面など、文字やレイアウトが重要な意味を持つ画像の生成に適しているとされています。タグ情報にもgraphic-designやtext-renderingが含まれており、視覚的な要素とテキスト要素をバランスよく配置した完全なビジュアル構成の出力が想定されています。 - 透過背景(RGBA)画像の出力:
通常のRGB画像だけでなく、アルファチャンネルを含むRGBA形式での出力に対応しているとされています。特定の推奨フレーズをプロンプトの先頭に指定することで、背景が透明なパーツやグラフィック素材を直接生成できると報告されています。これにより、後処理での背景切り抜き作業を省略し、Webデザインやスライド資料(プレゼンテーション資料)などの素材作成に直接活用できるとされています。 - デザイン補助・スライド作成スキルとの連携:
元モデルのリポジトリでは、UIデザインスキル(ling-ui-design)や画像を編集可能なスライドに変換するスキル(image-to-editable-ppt)といった推奨ツールの存在が示されており、プレゼンテーション資料や画面設計のプロトタイピングにおける実用的なワークフローが想定されていると報告されています。
なお、本パッケージであるComfy-Org/Ming-Imageは、これらの機能をノードベースのGUI環境であるComfyUI上で手軽に扱えるように再パッケージしたものであるとされています。
入手方法
Comfy-Org/Ming-Imageのモデルファイルは、Hugging Faceの該当リポジトリから入手可能とされています。Gatedモデルではないため、事前の利用規約への同意申請などは不要で直接ダウンロードできる状態となっています。
提供されている重みファイルはsafetensors形式で配布されており、モデルの種類や精度ごとに細分化されています。ComfyUIのインストールディレクトリ内にある各フォルダへ、用途に応じたファイルを配置して使用する構成とされています。
モデルカードで指定されている配置先とファイルの一覧は以下の通りです。
ディフュージョンモデル本体の配置先
ComfyUI/models/diffusion_models/
– ming_image_0.1_design_bf16.safetensors
– ming_image_0.1_design_int8_convrot.safetensors
– ming_image_0.1_design_layer_bf16.safetensors
– ming_image_0.1_design_layer_int8_convrot.safetensors
標準のBF16精度のモデルに加え、量子化が施されたint8_convrot版や、レイヤー分離に対応したとされるlayer版のファイルが用意されています。
テキストエンコーダーの配置先
ComfyUI/models/text_encoders/
– ming_image_0.1_ling_mini_2.0_bf16.safetensors
– ming_image_0.1_ling_mini_2.0_int8_convrot.safetensors
– ming_image_0.1_ling_mini_2.0_w4a8.safetensors
– ming_image_0.1_ling_mini_2.0_layer_bf16.safetensors
– ming_image_0.1_ling_mini_2.0_layer_int8_convrot.safetensors
テキストエンコーダー側にも、BF16精度のほか、int8_convrot版やw4a8版など複数の軽量化・量子化バリアントが用意されていると報告されています。
VAEの配置先
ComfyUI/models/vae/
– ming_image_vae_bf16.safetensors
利用者は自身の環境やワークフローに合わせて必要な精度の組み合わせを選択し、上記フォルダに配置してComfyUI上でロードすることになります。
関連記事
出典
- Comfy-Org/Ming-Image (Hugging Face)
- inclusionAI/Ming-Image-0.1-Design (Hugging Face)
- inclusionAI/Ming-Image-0.1-Design-Layer (Hugging Face)
この記事は未確認情報を含みます。 公式の一次情報で裏が取れ次第、更新履歴を追記して反映します。
