Qwen-Image-2.1-Turbo(クウェン・イメージ・ツー・ポイントワン・ターボ)は、AlibabaのQwenチームが公開した画像生成・編集モデルで、わずか8デノイジングステップで2K画像の生成と自然言語による画像編集ができます。
室谷代表取締役Qwenチームが「Qwen-Image-2.1-Turbo」を公開ウェイトとしてリリースしました。ベースは9月20日にオープンソース化されたQwen-Image-2.1で、その高速版チェックポイントという位置づけなんですよね。
あわせてProとTurboのホスト型APIも正式に提供開始になっています。
あわせてProとTurboのホスト型APIも正式に提供開始になっています。
テキトー教師DotAI 認定講師これは単に「速くなった版が出た」という話じゃないんですよ。同じ7Bの視覚生成アーキテクチャを使いながら、推論のステップ数をぐっと減らして実用速度に持ってきた、という設計の話なんです。
講座でも「拡散モデルはステップ数との戦い」とよく話すんですが、まさにその最前線です。
講座でも「拡散モデルはステップ数との戦い」とよく話すんですが、まさにその最前線です。
Qwen-Image-2.1-Turboとは?何が8ステップで変わるのか
まとめ
Qwen-Image-2.1-Turbo の要点
- ベースは Qwen-Image-2.1(7Bの視覚生成アーキテクチャ)
- 生成は8デノイジングステップに圧縮した加速チェックポイント
- ステップを減らしても品質は落ちないよう調整(Fewer steps does not mean lower quality)
- テキストから強い2K画像を生成できる
- デフォルト設定は CFG=1
- 高速化の仕組みはプレフィックスKVキャッシュでテキスト・参照画像のコンテキストを各ステップ間で再利用
- 推奨8ステップのスケジューラがチェックポイントに保存され自動適用
- num_inference_steps を設定しただけでは保存済みスケジュールを上書きしない
- sigmas 引数を呼び出し時に渡せば上書きできるが、それ以外のスケジュールはこのチェックポイントでは未評価
- まずはデフォルトのまま回すのが安全
室谷代表取締役まず前提として、拡散モデルはノイズから少しずつ画像を彫刻するように生成する方式で、この繰り返し回数がステップ数です。一般にステップが多いほど高品質だけど遅い。
Turboはそこを8ステップに圧縮した加速チェックポイントなんですよね。
Turboはそこを8ステップに圧縮した加速チェックポイントなんですよね。
テキトー教師DotAI 認定講師ここで大事なのは、ステップを減らしても品質が落ちないように調整されている点です。公式の説明でも「Fewer steps does not mean lower quality」、つまりステップが少ないからといって低品質ではない、と明言されています。
テキストから強い2K画像を生成できると。
テキストから強い2K画像を生成できると。
室谷代表取締役モデルカードによると、チェックポイントには推奨の8ステップのサンプリングスケジュールが保存されていて、手動でスケジューラを設定しなくてもそのまま使えるようになっています。生成はデフォルトでCFG=1、そしてプレフィックスKVキャッシュでテキストと参照画像のコンテキストをデノイジングの各ステップ間で再利用する、と。
テキトー教師DotAI 認定講師整理するとこうです。
- ベース: Qwen-Image-2.1(7Bの視覚生成アーキテクチャ)
- 生成ステップ: 8デノイジングステップ
- デフォルト設定: CFG=1
- 高速化の仕組み: プレフィックスKVキャッシュでテキスト・参照画像のコンテキストを再利用
- スケジューラ: 推奨8ステップのスケジュールがチェックポイントに保存され自動適用
室谷代表取締役ここ、運用でハマりやすいポイントがあって。モデルカードには「num_inference_stepsを設定しただけでは保存済みスケジュールを上書きしない」と書かれているんですよ。
実験で明示的にsigmas引数を呼び出し時に渡せば上書きできるけど、それ以外のスケジュールはこのチェックポイントでは評価されていない、と。
実験で明示的にsigmas引数を呼び出し時に渡せば上書きできるけど、それ以外のスケジュールはこのチェックポイントでは評価されていない、と。
テキトー教師DotAI 認定講師つまり「いつもの感覚でステップ数をいじる」と意図した挙動にならない可能性がある、ということですね。受講生さんもここで混乱しがちなので、まずはデフォルトのまま回すのが安全です。
Qwen-Image-2.1-Turboでできること — 2K画像生成と自然言語での画像編集
Qwen-Image-2.1-Turboでできること
テキストからの画像生成
プロンプトから画像を生成。公式スレッドでは継続的な編集にも対応
自然言語による画像編集
「アクセサリーを足す」「シーンを変える」などの編集指示に対応
生成と編集を1モデルに統合
ベースのQwen-Image-2.1がテキスト生成と画像編集を統合
ネイティブな透過画像(RGBA)生成・編集
プロンプトで通常画像か透過チャンネル付き画像かを決めて出力。透過レイヤー内のテキスト編集や被写体のRGBA抽出も可能
最大10枚の参照画像を使った編集
集合写真の合成、5入力のバーチャル試着、10枚の家具画像からの部屋レイアウト生成など
ローカル編集・忠実な保持
円やペイント注釈、別途マスクで編集範囲を指定。人物や商品を忠実に保持
タイポグラフィ・ポートレート品質
タイポグラフィやポートレートのライティング、細部の質感向上
室谷代表取締役できることの中心は2つで、テキストからの画像生成と、自然言語による画像編集です。公式スレッドでは「アクセサリーを足す」「シーンを変える」といった継続的な編集に対応すると説明されています。
テキトー教師DotAI 認定講師ベースのQwen-Image-2.1の特徴も押さえておきたいです。ブログによると、テキストからの画像生成と画像編集を1つのモデルに統合していて、ネイティブで透過画像(RGBA)の生成・編集ができる。
最大10枚の参照画像を使った編集、ローカル編集、人物や商品の忠実な保持、そしてタイポグラフィやポートレートのライティング、細部の質感向上が挙げられています。
最大10枚の参照画像を使った編集、ローカル編集、人物や商品の忠実な保持、そしてタイポグラフィやポートレートのライティング、細部の質感向上が挙げられています。
室谷代表取締役透過まわりは実務で効いてきますよね。プロンプトで通常画像か透過チャンネル付き画像かを決めて出力できる。
透過レイヤー内のテキスト編集、たとえば「BLOOM」を「Qwen-Image」に置き換える、なんて例もブログで示されています。実写写真から被写体をRGBAレイヤーとして抽出して、後続のデザインやコンポジションに再利用する、という使い方もできます。
透過レイヤー内のテキスト編集、たとえば「BLOOM」を「Qwen-Image」に置き換える、なんて例もブログで示されています。実写写真から被写体をRGBAレイヤーとして抽出して、後続のデザインやコンポジションに再利用する、という使い方もできます。
テキトー教師DotAI 認定講師編集のバリエーションも具体的です。円やペイント注釈、別途マスクで編集範囲を指定できる。
ブログの例だと、青い円の金属ウォッチを消して、赤い円の髪を黒に変えて、緑の円の領域をグレーの半袖リネンパジャマに置き換える、という3箇所同時の指示を1回で処理しています。
ブログの例だと、青い円の金属ウォッチを消して、赤い円の髪を黒に変えて、緑の円の領域をグレーの半袖リネンパジャマに置き換える、という3箇所同時の指示を1回で処理しています。
室谷代表取締役参照画像を最大10枚まで使えるのも大きい。集合写真の合成、モデル・服・靴・バッグ・帽子の5入力を組み合わせたバーチャル試着、10枚の家具画像から部屋のレイアウトを生成する、といった例がブログで紹介されています。
MYUUUでも商品画像まわりは毎回試行錯誤するので、この参照枚数の多さは素直にありがたいです。
MYUUUでも商品画像まわりは毎回試行錯誤するので、この参照枚数の多さは素直にありがたいです。
テキトー教師DotAI 認定講師公式のTurboショーケースでも、ポートレート写真、人物のポーズと動き、透過画像生成、タイポグラフィとポスターデザイン、UIと情報レイアウト、単一画像の変換、マルチ参照のコンポジション、4画像のインテリア合成、といったカテゴリの8ステップ出力例が並んでいます。
室谷代表取締役編集の例も出ていますね。スケッチからフォトリアルなモーターヨットを生成する例がモデルカードに載っていて、入力スケッチの構造を保ちながら、船体を黒、上部構造とマストを白、ファンネルを黄色に塗る、といった細かい指示を反映させています。
Qwen-Image-2.1-Turboの使い方・始め方 — Diffusersでの読み込みと推論設定
DiffusersでQwen-Image-2.1-Turboを動かす手順
- 01PyTorch(CUDA対応)をインストールCUDA対応のPyTorchを入れる
- 02Diffusersソースと依存関係をインストールpip install git+https://github.com/huggingface/diffusers.git / pip install "transformers>=5.17.0" accelerate pillow
- 03最新Diffusersを使うサンプリングsigmas対応が必要(PR #14950で追加)。古いDiffusersだと動かない可能性がある
- 04QwenImage21Pipelineで読み込むQwenImage21Pipeline.from_pretrainedで「Qwen/Qwen-Image-2.1-Turbo」を指定し、dtype=torch.bfloat16でcudaに載せる
- 05テキストto画像を実行width 1680・height 2512の縦長、use_kv_cache=True、generatorにシードを渡す
- 06画像編集を実行入力画像をRGBAで読み込み、width/heightを2048にして同じパイプラインにimageとして渡し、プロンプトで「入力スケッチの構造で」と指示
室谷代表取締役使い方はDiffusers経由が基本です。モデルカードのクイックスタートでは、CUDA対応のPyTorchを入れたうえで、最新のDiffusersソースと依存関係をインストールする手順が示されています。
テキトー教師DotAI 認定講師整理するとこうです。
code
pip install git+https://github.com/huggingface/diffusers.git
pip install "transformers>=5.17.0" accelerate pillow
室谷代表取締役注意点として、このチェックポイントはパイプライン設定のサンプリングsigmasに対応したDiffusersが必要で、それはPR #14950で追加されたものだと明記されています。古いDiffusersだと動かない可能性があるので、そこは素直に最新を入れるのが吉です。
テキトー教師DotAI 認定講師読み込みはQwenImage21Pipelineを使います。Hugging FaceのモデルカードではDiffusionPipelineを使った例も載っていますが、ModelScope側の例ではQwenImage21Pipeline.from_pretrainedで「Qwen/Qwen-Image-2.1-Turbo」を指定し、dtypeをtorch.bfloat16にしてcudaに載せる、という流れです。
室谷代表取締役テキストto画像の例では、width 1680、height 2512の縦長で生成していて、use_kv_cache=True、generatorにシードを渡す構成です。編集の例では入力画像をRGBAで読み込んで、width/heightを2048にして同じパイプラインにimageとして渡す。
プロンプトで「入力スケッチの構造で」と指示する形になっています。
プロンプトで「入力スケッチの構造で」と指示する形になっています。
テキトー教師DotAI 認定講師解像度プリセットもベースと同じものが使えます。1:1が2048×2048、4:3が2400×1792、3:4が1792×2400、3:2が2528×1696、2:3が1696×2528、16:9が2752×1536、9:16が1536×2752の7種類です。
室谷代表取締役ちなみにHugging Faceのモデルページには、Draw ThingsやDiffusionBeeといったローカルアプリの項目も並んでいます。ComfyUIについては、今回の公式スレッドとモデルカードの範囲では手順の記載を確認できていません。
現時点では明らかにされていない、という扱いが正確ですね。
現時点では明らかにされていない、という扱いが正確ですね。
テキトー教師DotAI 認定講師ローカルで動かすなら、まずはDiffusersの公式手順どおりに試すのが確実です。Hugging Face自体の仕組みや商用利用の考え方については、Hugging Faceとは?できること・料金・商用利用とNVIDIA買収の現在で解説しているので、あわせて確認しておくと安心です。
料金と提供範囲 — Pro/Turbo APIの価格と日本から使えるか
室谷代表取締役APIも見逃せません。Qwen-Image-2.1 ProとTurboのホスト型APIが正式に提供開始になりました。
価格はProが1画像0.04ドル、Turboが1画像0.016ドルです。Turboのほうが明確に安い。
価格はProが1画像0.04ドル、Turboが1画像0.016ドルです。Turboのほうが明確に安い。
テキトー教師DotAI 認定講師整理するとこうです。
- Qwen-Image-2.1 Pro API: 1画像あたり0.04ドル、RPM 20
- Qwen-Image-2.1 Turbo API: 1画像あたり0.016ドル、RPM 120
- 無料枠: いずれも「Not Supported」(提供なし)
- 入力モダリティ: テキスト・画像、出力: 画像
室谷代表取締役レート制限がProでRPM 20、TurboでRPM 120という差も実務では効いてきます。バッチ的に大量生成したい用途ならTurbo、品質重視で枚数を絞るならPro、という住み分けが見えますね。
テキトー教師DotAI 認定講師提供範囲について。APIのページはシンガポール(ap-southeast-1)のModel Studioの国際版として表示されていて、英語表記で案内されています。
日本からの利用可否そのものを明記した記述は、今回の公式ページ抜粋の範囲では確認できません。ここは「現時点では明らかにされていません」と正直に伝えるのが正確です。
日本からの利用可否そのものを明記した記述は、今回の公式ページ抜粋の範囲では確認できません。ここは「現時点では明らかにされていません」と正直に伝えるのが正確です。
室谷代表取締役一方で、オープンウェイトがModelScopeとHugging Faceの両方で公開されているので、自前環境で動かす道は確保されています。APIを使うか、Turboのウェイトを自分のワークフローに組み込むか、両方選べるのが今回のポイントなんですよね。
テキトー教師DotAI 認定講師モデルカードには、このモデルがどのInference Providerにもデプロイされていない、という表示もありました。APIはAlibaba CloudのModel Studio経由、という整理で理解しておくのがよさそうです。
ベースモデルQwen-Image-2.1との違いとTurbo化の狙い
室谷代表取締役ここが一番聞かれそうなところです。TurboはQwen-Image-2.1と同じ7Bの視覚生成アーキテクチャを使う、加速チェックポイントです。
ベースモデルは9月20日にオープンソース化されていて、テキストto画像と画像編集を1モデルに統合し、7Bの視覚生成コンポーネントを持ち、透過画像の生成・編集にネイティブ対応しています。
ベースモデルは9月20日にオープンソース化されていて、テキストto画像と画像編集を1モデルに統合し、7Bの視覚生成コンポーネントを持ち、透過画像の生成・編集にネイティブ対応しています。
テキトー教師DotAI 認定講師ベースモデルの技術的な特徴も押さえておきましょう。ブログによると、視覚生成コンポーネントは32のSingle-Stream DiTレイヤーと7Bパラメータで構成されています。
推論効率の最適化は混在粒度のアテンションアーキテクチャによるもので、テキスト(システムプレフィックスと編集指示を含む)はトークンレベルの因果マスク、画像生成はチャンクレベルのマスクを使う。KVキャッシュの再利用で、入力画像と編集指示を静的コンテキストとして最初のステップで計算・キャッシュし、推論効率を上げメモリ使用量を減らす、という設計です。
推論効率の最適化は混在粒度のアテンションアーキテクチャによるもので、テキスト(システムプレフィックスと編集指示を含む)はトークンレベルの因果マスク、画像生成はチャンクレベルのマスクを使う。KVキャッシュの再利用で、入力画像と編集指示を静的コンテキストとして最初のステップで計算・キャッシュし、推論効率を上げメモリ使用量を減らす、という設計です。
室谷代表取締役Turbo化の狙いはシンプルで、「品質を保ちつつ、いかに速く・安く回すか」という画像生成AIの永遠の課題への回答です。特に複数枚の参照画像を使う編集では推論コストが膨らみやすい。
そこにステップ削減の高速化と、API価格の低さが効いてくる。
そこにステップ削減の高速化と、API価格の低さが効いてくる。
テキトー教師DotAI 認定講師ただし注意点として、Turboがベースモデルからどれだけ品質が劣化するかを示す数値は、今回の公式ページ抜粋の範囲では確認できません。公式は「ステップが少ないからといって低品質ではない」と説明していますが、ベンチマークの比較数値は示されていない。
ここは憶測で語らないほうがいいですね。
ここは憶測で語らないほうがいいですね。
室谷代表取締役そうですね。「約5倍高速」といった数値も、今回のソースには出てきていません。
ソースに書かれているのは8ステップで生成・編集ができるという事実までです。そこを混ぜないのが誠実な報道だと思います。
ソースに書かれているのは8ステップで生成・編集ができるという事実までです。そこを混ぜないのが誠実な報道だと思います。
テキトー教師DotAI 認定講師ライセンスも重要です。このモデルはQwen Research License Agreementで提供されています。
商用利用の条件を確認したい場合は、ライセンス本文を必ず確認してください。
商用利用の条件を確認したい場合は、ライセンス本文を必ず確認してください。
よくある質問 — ステップ数・CFG・VRAM・ライセンスの疑問
室谷代表取締役では、よく聞かれる疑問を整理していきます。まずステップ数。
8ステップが推奨で、チェックポイントに保存されたスケジュールが自動適用されます。num_inference_stepsを設定しただけでは上書きされないので注意です。
8ステップが推奨で、チェックポイントに保存されたスケジュールが自動適用されます。num_inference_stepsを設定しただけでは上書きされないので注意です。
テキトー教師DotAI 認定講師CFGはどうか。公式にはデフォルトでCFG=1と説明されています。
つまりCFGを明示的にいじる前提ではなく、そのまま使う設計です。
つまりCFGを明示的にいじる前提ではなく、そのまま使う設計です。
室谷代表取締役VRAM要件については、今回の公式ページ抜粋に具体的な数値の記載はありません。ですので「現時点では明らかにされていません」が正確な答えです。
モデルサイズは7Bパラメータ、テンソルタイプはBF16と記載されています。
モデルサイズは7Bパラメータ、テンソルタイプはBF16と記載されています。
テキトー教師DotAI 認定講師ライセンスはQwen Research License Agreementです。研究用途の名称ですが、条件の詳細はライセンス本文の確認が必要です。
室谷代表取締役日本語のプロンプトが使えるか、といった点も、今回のソースでは明記されていません。ここも憶測は避けたいところですね。
テキトー教師DotAI 認定講師まとめると、Qwen-Image-2.1-Turboは「8ステップで2K生成と自然言語編集ができる、7Bのオープンウェイト加速チェックポイント」で、APIはProが1画像0.04ドル、Turboが0.016ドル。DiffusersのQwenImage21Pipelineで読み込める。
まずはここを押さえておけば、今日から試せます。
まずはここを押さえておけば、今日から試せます。
室谷代表取締役画像生成のコストと速度は、プロダクトに組み込むかどうかを左右する要素なので、Turboの登場は地味に大きいんですよね。MYUUUでも実際に触ってみて、また共有します。
