「QI_2.1_AnyAngle」カメラアングル操作LoRA:必要VRAM 48GB〜・配布ファイル一覧

「QI_2.1_AnyAngle」カメラアングル操作LoRA:必要VRAM 48GB〜・配布ファイル一覧

作例は配布元のモデルカードで公開されています。

基本情報

項目 内容
リポジトリ lilylilith/QI_2.1_AnyAngle
まとめページ Qwen-Image-2.1 のまとめ(記事3本)
公開元のまとめ Alibaba(Qwen) のモデルとライセンスのまとめ
公開日 2026-09-28
ライセンス apache-2.0
配布形式 safetensors
出典の種類 公開元の一次情報(Hugging Face公式モデルページ)

情報を集めた時点で、当サイトのコードが確定させた値です。日付はJSTで表示しています。

概要

AIによる画像生成において、プロンプトでカメラアングルを指定しても、意図した通りの構図が得られないことは、多くの技術者が直面する一般的な課題です。既存の画像編集モデル(Qwen Image EditやFLUX.2など)でも、既存の画像のカメラアングルを変更することは可能になりつつありますが、その多くは方位角や仰角の選択肢が限定されており、クリエイターが求めるような自由なコントロールを実現するには至っていません。また、劇的なアングル変更を試みると、画像のスタイルが元のものから大きく逸脱してしまうという問題も報告されています。

「QI_2.1_AnyAngle」は、これらの課題を克服するために設計されたLoRAです。このモデルは、元の画像と、3DモデルやGaussian Splatから生成した「粗い(coarse)」画像をリファレンスとしてQwen Image 2.1に入力することで、スタイルの一貫性を保ちながら、任意のカメラアングルへと画像を変換します。

具体的なワークフローは以下の通りです。まず、元の画像からTripo SplatやTrellis2、Pixal3Dなどのツールを用いてGaussian Splatまたは3Dモデルを生成します。次に、そのモデルをBlenderにインポートして任意のカメラアングルに調整し、画像をレンダリングします。最後に、このレンダリング画像と元の画像を、AnyAngle LoRAを適用したQwen Image 2.1に、指示プロンプト「Change the camera angle from to .」と共に提供することで、目的のアングルを実現します。

スペック

  • ベースモデル: Qwen/Qwen-Image-2.1 (ビジュアル生成コンポーネントに7Bのパラメータ)
  • アーキテクチャ: LoRA
  • ライセンス: apache-2.0
  • 推奨設定:
    • LoRA強度: 1 – CFGスケール: 3.0 – ステップ数: 20ステップ以上
  • 補足: ショットプランニングなどの用途で高速な推論が必要な場合は、品質がわずかに低下する代わりにレイテンシを抑えられるturbo loraの使用も可能です。

性能・品質

本モデルの学習手法については、スタイルの整合性を極限まで高めるための工夫がなされています。学習には、多様なスタイルを持つBlenderによる実写レンダリング画像と、デジタルイラスト用のSOTAビデオモデルであるMiniMax H3が用いられています。Blenderのレンダリングデータを使用するプロセスでは、元の画像(アンカー)と異なるカメラアングルからのフレーム(ターゲット)のペアを作成します。ターゲット画像からGaussian Splatや3Dモデルを生成し、それを「粗いレンダリング(coarse render)」として制御画像に用いることで、学習を繰り返しています。

さらに、イラストやスケッチといったスタイルにおいても、一貫性を維持したまま操作ができるように設計されています。これには、MiniMax H3のimage-to-videoを活用し、被写体が完全に静止した状態で周囲を回るような「オービット(軌道)」レンダリングを生成する手法が用いられています。これにより、アングルが変わってもスタイルが崩れにくい、高い整合性を実現しています。

ただし、生成の品質は入力となる3Dデータの精度に依存します。生成されたGaussian Splatや3Dモデルが空間を正確に認識できていない場合や、造形が粗すぎる場合には、アイテムの配置がずれたり、顔の造形が崩れたりする可能性があると報告されています。特に、解剖学的な構造が極端に崩れている場合や、低解像度の画像から生成された場合には、このような問題が発生しやすくなります。

得意なこと・想定用途

本モデルは、既存の画像のスタイル(画風)を維持したまま、カメラアングルのみを自由に変更することを得意としています。具体的には、以下のような用途が想定されています。

  • 写実的な画像から、Blenderのレンダリングデータを用いた高度なアングル操作
  • デジタルイラストやスケッチといった、MiniMax H3によるオービットレンダリングを活用したスタイルの一貫性を保つアングル変更
  • ショットプランニングなどの、迅速な構図確認を目的とした高速な推論(turbo loraの使用による)

タグとして image-to-image が付与されており、3DモデルやGaussian Splatを介した高度な画像編集ワークフローに組み込んで使用することが想定されています。

類似モデルとの違い

Qwen-Image-2.1をベースとした他のモデルとの違いについては、以下の通りです。

  • 「Qwen-Image-2.1-viggle-turbo」4ステップの高速画像生成・編集モデル:必要VRAM 48GB〜は、DMDを用いて4ステップでの高速生成を可能にした蒸留モデルですが、本モデルは3DモデルやGaussian Splatをリファレンスとして用いることで、より自由なカメラアングルの制御とスタイルの維持を狙っています。
  • 「Qwen-Image-2.1-Uncensored-GGUF」画像生成モデル:必要VRAM 16GB〜は、量子化による軽量化に焦点を当てたモデルですが、本モデルは特定の編集機能(カメラアングル操作)に特化したLoRAとして機能します。

動作環境

動作環境の目安(Local Model Watch 算出) — パラメータ数 7.1B(元モデル Qwen/Qwen-Image-2.1 の値)

手持ちのVRAM 選べる量子化 ファイルサイズ 必要メモリの目安
RTX 6000 Ada / A6000 など 48GB BF16 30.8GB 37.0GB

必要メモリは配布ファイルの実サイズに実行時のオーバーヘッド(KVキャッシュ等)を20%見込んだ概算で、文脈長・バッチサイズ・推論エンジンによって増減します。公開元の公称値ではなく、当サイトがファイルサイズから機械的に算出した値です。 この配布は LoRA 等のアダプタで、表は元モデル Qwen/Qwen-Image-2.1 を動かす要件です。 他のモデルとの比較はVRAM別の早見表を参照してください。 量子化の名前の読み方は用語集にあります。

手元で動かせるか

公開元の配布形式は safetensors です。

ライセンス apache-2.0(商用利用可): 商用利用を含めて自由に利用・改変・再配布できます。再配布時にライセンス文と変更点の告知が必要で、特許の許諾条項があります。

配布形式とライセンス表記から当サイトのコードが組み立てた判定です。ライセンスの要約は法的助言ではないため、実際の利用にあたっては公開元の原文を確認してください。

配布ファイル

lilylilith/QI_2.1_AnyAngle で配布されている重みファイルを、Hugging FaceのAPIから当サイトが並べたものです。サイズは実ファイルの値です。

ファイル サイズ
QI2.1_AnyAngle.safetensors 120MB

入手方法

関連記事

次に読むなら

出典