画像生成・編集モデル「Qwen-Image-2.1」公開、透過処理や高度なマルチ画像編集に対応

作例は配布元のモデルカードで公開されています。
基本情報
| 項目 | 内容 |
|---|---|
| リポジトリ | Qwen/Qwen-Image-2.1-PE-I2I |
| 公開日 | 2026-09-20 |
| ライセンス | other |
| 配布形式 | safetensors |
| 出典の種類 | 公開元の一次情報(Qwen公式HFリポジトリが一次情報) |
収集・肉付けの時点で当サイトのコードが確定させた値です。日付はJST。
作例は配布元のモデルカードで公開されています。
概要
Qwenチームより、テキストからの画像生成および画像編集を統合した新しいオープンウェイトモデル「Qwen-Image-2.1」が公開されました。本モデルは、テキストから高品質な画像を生成する「Text-to-Image」機能と、既存の画像を指示に従って編集する「Image-Editing」機能を1つに統合したモデルです。
これに伴い、ユーザーからの短い指示や曖昧なリクエストを、画像生成・編集モデルが理解しやすい詳細なプロンプトへと書き換えるための専用プロンプト書き換えモデル「Qwen-Image-2.1-PE-T2I」および「Qwen-Image-2.1-PE-I2I」も同時にオープンソースとして公開されました。これらはQwen3.5-VL 9Bをファインチューニングしたモデルであり、任意の言語で入力された短いリクエストを詳細な英語プロンプトに拡張し、最適なアスペクト比などの推薦情報とともにJSON形式で出力する役割を担います。
スペック
公開されたモデル群およびベースとなる「Qwen-Image-2.1」の主なスペックは以下の通りです。
Qwen-Image-2.1(画像生成・編集モデル)
- パラメータ数: 視覚生成コンポーネントにおいて7Bパラメータ
- アーキテクチャ: 32層のシングルストリームDiT(Diffusion Transformer)
- 特徴的な機能:
- ネイティブ透過性(RGBAサポート): テキストからの通常画像生成に加え、背景が透過したRGBA画像の生成、透過レイヤーの編集、写真からの被写体抽出(背景透過切り抜き)を単一モデルで処理可能。 – 高度な画像編集: 最大10枚の参照画像をサポート。円、ペイントされたアノテーション、または個別のマスクによるローカル編集(部分編集)の指定に対応し、人物や製品のアイデンティティ(特徴)を保持した編集が可能。 – 効率化技術: 混合粒度アテンション(mixed-granularity attention)とプレフィックスKVキャッシュ再利用(prefix KV cache reuse)を採用した軽量アーキテクチャにより、低い計算コストで高い画像品質を実現。
Qwen-Image-2.1-PE-T2I(テキスト生成用プロンプト書き換えモデル)
- ベースアーキテクチャ: Qwen3.5-VL 9B(ファインチューニング版)
- インプット: 任意の言語による短い画像生成リクエスト
- アウトプット:
<think>による推論プロセスの後に、以下のJSONフォーマットを出力 rewritten_prompt: 画像生成モデルに渡すための、詳細に拡張された英語プロンプト –wh_ratio: 推奨されるアスペクト比(例:"16:9"、"1:1"、"4:3"など)- 対応アスペクト比と解像度の例:
1:1(2048 x 2048) –4:3(2400 x 1792) –3:4(1792 x 2400) –3:2(2528 x 1696) –2:3(1696 x 2528) –16:9(2752 x 1536) –9:16(1536 x 2752)
Qwen-Image-2.1-PE-I2I(画像編集用プロンプト書き換えモデル)
- ベースアーキテクチャ: Qwen3.5-VL 9B(ファインチューニング版)
- インプット: 曖昧な編集指示、および1枚以上の入力画像(最大10枚の参照画像をサポート)
- アウトプット:
<think>による推論プロセスの後に、以下のJSONフォーマットを出力 rewritten_prompt: 画像編集モデルに適した、正確で実行可能な詳細プロンプト –wh_ratio: 新規に構図を作成する場合にモデルが選択したアスペクト比 –ratio_follow: 入力画像の比率をそのまま引き継いでインプレース編集を行う場合、対象となる画像(例:"<image1>")を指定(wh_ratioとratio_followは排他的)
ライセンス
- ライセンス: other(利用にあたっては各リポジトリに設定された独自のライセンス条件が適用されます)
性能・品質
公開元であるQwenチームのモデルカードによると、Qwen-Image-2.1は前世代からいくつかの重要な品質向上が図られていると報告されています。
具体的には、タイポグラフィ(画像内テキストの描画能力)、ポートレートにおけるライティング(照明効果)、および細部のディテール表現が大幅に改善されました。これにより、よりリアルな質感と洗練された美学(Aesthetics)を備えた、視覚的に説得力のある画像を生成できるとされています。
また、プロンプト書き換えモデル(PEモデル)を前段に組み合わせることで、ユーザーが入力した「雨の中でギターを弾くコーギー」といった極めて短い指示であっても、推論(Reasoning)プロセスを経て、シーンの背景、光の当たり方、質感などを補完した詳細な英語プロンプトを自動生成します。これにより、下流の生成モデルのポテンシャルを最大限に引き出し、意図に沿った高品質な画像生成や複雑なマルチ画像編集(例: 「画像1の被写体を画像2の背景に配置する」など)を安定して実行できる仕組みが整えられています。
得意なこと・想定用途
Qwen-Image-2.1および同時に公開されたプロンプト書き換えモデル(PEモデル)は、以下のような高度な画像生成・編集タスクにおいてその真価を発揮します。
透過画像(RGBA)のネイティブ生成と被写体抽出
従来の画像生成モデルでは困難であった、背景が透過したRGBA画像の生成をネイティブにサポートしています。これにより、テキスト指示から直接、背景のないキャラクターやオブジェクトの画像を生成できます。また、既存の写真から特定の被写体だけを検出し、背景を透過させて切り抜く「被写体抽出」タスクにも対応しており、グラフィックデザインやアセット制作の現場で即戦力として活用できます。
複数画像を用いた高度なインプレース編集
最大10枚までの参照画像を入力として受け取ることができ、特定の人物や製品のアイデンティティ(特徴や外観)を維持したまま、新しいシーンへ合成する編集が得意です。また、画像内の特定の場所を円で囲んだり、ペイントによるアノテーションを施したり、個別のマスク画像を指定したりすることで、ピンポイントなローカル編集(部分修正)を正確に行うことができます。
多言語リクエストからの詳細な指示書の自動作成
ユーザーが日本語などの任意の言語で入力した「雨の中でギターを弾くコーギー」といった短く曖昧な指示を、PEモデルが思考プロセス(`") result = json.loads(answer.strip()) print(result)
出力例: {“rewritten_prompt": “<詳細な英語プロンプト>", “wh_ratio": “16:9"}
上記で得られた `rewritten_prompt` と `wh_ratio`(アスペクト比)を、Diffusersの `QwenImage21Pipeline` に渡して画像生成を実行します。アスペクト比に応じた解像度のマッピング(例: `16:9` の場合は 2752 x 1536)を行い、パイプラインに入力します。
```python
from diffusers import QwenImage21Pipeline
WH_RATIO_TO_SIZE = { "1:1": (2048, 2048), "4:3": (2400, 1792), "3:4": (1792, 2400), "3:2": (2528, 1696), "2:3": (1696, 2528), "16:9": (2752, 1536), "9:16": (1536, 2752), }
prompt = result["rewritten_prompt"] width, height = WH_RATIO_TO_SIZE.get(result["wh_ratio"], (2048, 2048))
pipe = QwenImage21Pipeline.from_pretrained( "Qwen/Qwen-Image-2.1", torch_dtype=torch.bfloat16 ).to("cuda")
image = pipe( prompt=prompt, width=width, height=height, num_inference_steps=40, generator=torch.Generator("cuda").manual_seed(42), ).images[0]
image.save("rewritten_t2i.png")
画像編集(I2I)手順
既存の画像を編集する場合は、画像編集用プロンプト書き換えモデル Qwen/Qwen-Image-2.1-PE-I2I を使用します。このモデルは、入力画像(複数指定可能)と大まかな編集指示を受け取り、正確な編集用プロンプトを生成します。
from PIL import Image from transformers import AutoModelForImageTextToText, AutoProcessor
model_id = "Qwen/Qwen-Image-2.1-PE-I2I" processor = AutoProcessor.from_pretrained(model_id) model = AutoModelForImageTextToText.from_pretrained( model_id, dtype=torch.bfloat16, device_map="auto" ).eval()
sys_prompt_path = huggingface_hub.hf_hub_download(model_id, "system_prompt.txt") system_prompt = open(sys_prompt_path).read().strip()
input_image = Image.open("input.png").convert("RGB") user_prompt = "make the sky sunset"
messages = [ {"role": "system", "content": [{"type": "text", "text": system_prompt}]}, {"role": "user", "content": [ {"type": "image", "image": input_image}, {"type": "text", "text": user_prompt}, ]}, ]
inputs = processor.apply_chat_template( messages, add_generation_prompt=True, tokenize=True, return_dict=True, return_tensors="pt", enable_thinking=True, ).to(model.device)
with torch.no_grad(): out = model.generate( **inputs, max_new_tokens=24000, do_sample=True, temperature=1.0, top_p=0.95, top_k=20, ) gen = processor.tokenizer.decode( out[0, inputs["input_ids"].shape[1]:], skip_special_tokens=True )
thinking, _, answer = gen.partition("</think>") result = json.loads(answer.strip())
# 出力例: {"rewritten_prompt": "...", "wh_ratio": "", "ratio_follow": "<image1>"}
この出力に含まれる ratio_follow は、編集元の画像の縦横比をそのまま引き継ぐ(インプレース編集を行う)ことを示しています。得られた rewritten_prompt を元画像 input_image とともに QwenImage21Pipeline に渡すことで、指定した編集が適用された画像が出力されます。
また、複数の画像を入力する場合は、メッセージのリスト内に複数の画像オブジェクトを配置し、テキスト指示の中で <image1> や <image2> と指定することで、特定の画像を対象にした複雑な指示(例: 「<image1> の被写体を <image2> の背景に配置する」など)をPEモデルに解釈させることが可能です。

