今回は画像生成AIに関する話題で
「Qwen-Image-2.1」の導入方法・使い方
を丁寧にわかりやすくご紹介するという内容になっております。
画像生成AI界隈ではここ数か月はあまり大きな動きはありませんでしたが、突如としてQwen-Imageの最新版モデルの公開が告知されて海外の掲示板「reddit」など各所で期待が高まっていました。そしてつい先日、その「Qwen-Image-2.1」がオープンウェイトとしてリリースされ大変話題になっています。
このモデルは単に高品質な画像を生成できるだけでなく同じモデルを使って画像編集を行えたり、透過画像を直接生成できたりと今まで以上に高性能な点がセールスポイントになっているようだったので私も早速試してみることにしました。
ここではこの「Qwen-Image-2.1」について、ローカル環境への導入方法や使い方を解説していきますね。
「Qwen-Image-2.1」について
公式リポジトリ
Qwen-Image-2.1とは?
Qwen-Image-2.1は、中国のアリババのAI開発チームが提供している画像生成&編集モデルです。1つのモデルで画像生成と画像編集の二役をこなせるのが大きな特徴となっています。主な特徴は次のとおり。
- 同一モデルで画像生成と画像編集を行える
- 高品質な画像を柔軟に生成可能
- 日本語のプロンプトも使用可能
- テキスト描画も得意(短ければ日本語テキストもOK)
- 透過画像を直接生成できる
- オープンウェイトなので誰でも無料でローカル環境で動かせる
一つのモデルで二役こなせてしまうという点も便利ですが、透過画像を直接生成できるという点が今までのローカル用モデルにはなかった強みなので個人的にいいなと思いました。
ライセンスについて
Qwen-Image-2.1のライセンスは独自の「Qwen RESEARCH LICENSE」です。モデル自体を商用利用する場合は別途ライセンス契約が必要とのことなので注意しましょう。
ライセンス本文を見てみると、パッと見では生成した画像も商用利用できないような文言になっていますが、問い合わせ(というよりは批判?)が多かったためか公式Xでは「出力はライセンス対象には含まれず、ユーザーはモデルを使用して生成した画像の権利を保持できる」という声明が出されています。
Qwen-Image-2.1で実際に生成したサンプル画像
さて概要をざっとご説明したところで
- 具体的にどういう画像を生成できるの?
- 画像編集もできるっていうけどどんなことができる?
といった点が皆さん気になるかと思います。そこで私が実際にQwen-Image-2.1で生成したサンプル画像をプロンプトつきで掲載しますのでぜひ参考になさってください。
※なお下記の例では英語プロンプトで生成を行いましたが、後で試したら日本語プロンプトでも指示通りの画像生成を行えました。「いちいち翻訳するのが面倒だな」という方は日本語で書くのもいいかもしれません。ただし精度的には英語プロンプトが一番だとは思います。
例1:写実的な画像(スーツを着た黒い熊)
まずはお手並み拝見、というところでいつも通り「スーツを着た黒い熊がオフィスで働いている様子」を映したリアルな画像を生成してみました。

プロンプト:
A highly realistic image of a black bear wearing a suit, working on a laptop in a clean office. The office is located in a high-rise building, with a view visible through a large window. The lighting is bright yet soft; the camera is focused on the bear, with the background slightly blurred. There is a drink and some documents on the bear's desk.
(参考)日本語訳:
スーツを着た黒い熊が、清潔なオフィスでノートPCを使って作業しているとても写実的な画像。オフィスは高層ビルの一室で大きな窓からは風景が見える。照明は明るいが柔らかい光で、カメラの焦点は熊にあり背景は少しぼかされている。熊の机には飲み物と書類がある。
リアルな画像に関しては実用的なレベルの高品質な画像が生成されました。もっとも、リアル系は他の画像生成AIも強いのでこれは「できて当たり前」なレベルです。
例2:森でラーメンを食べる女の子の美少女イラスト
お次は本命の美少女イラストです。最近の画像生成モデルはリアルな画像だけでなく美少女イラストもきちんと生成できることが多いのですが、Qwen-Image-2.1はどうなのかを試してみました。


プロンプト:
A high-quality illustration resembling an anime screenshot. An anime-style girl with black hair—wearing a black hoodie with bear ears and a black skirt—sits on a rock in a bright forest, happily eating ramen. She wears the hood up and looks thoroughly satisfied. Steam rises from the ramen, which is topped with an egg, roast pork, and nori seaweed. The background features a beautiful, anime-style forest, with the camera focused on the girl and the background softly blurred. The art style is anime-inspired, featuring flat coloring.
(参考)日本語訳:
まるでアニメのスクリーンショットのような高品質のイラスト。アニメ風の女の子が、明るい森の中で石の上に座っておいしそうにラーメンを食べている。女の子は熊の耳がついた黒いパーカーと黒いスカートを着ており、髪は黒く、フードを被っている。女の子はとても満足げな表情である。ラーメンからは湯気が立っており、ラーメンの具は卵とチャーシューと海苔。背景はアニメ風の美しい森で、カメラの焦点は女の子にあり背景はぼかされている。画風はアニメスタイルでフラットな塗りである。
美少女イラストに関しては「Anima」などには及ばないものの悪くないクオリティのイラストが生成されました。↑の例ではシチュエーションが特殊なためか指示に従わなかったり、ところどころ怪しい部分があったりしますがある程度の打率できちんと生成できるようです。
例3:キャラクターの立ち絵(透過画像生成)
Qwen-Image-2.1の目玉機能の一つである「透過画像生成」を試すために、キャラクターの立ち絵を生成しました(※画像クリックで本当に透過画像になっているかどうかを確認できます)。

プロンプト:
A full-body, anime-style portrait asset of a girl for a game. She has black hair and is wearing a black hoodie and a black uniform skirt. The hoodie features bear ears on the hood. The background is transparent.
(参考)日本語訳:
アニメ風の女の子のゲーム用の全身のポートレートアセット。女の子は黒いパーカーと黒い制服スカートを着ており、黒髪である。パーカーのフードには熊の耳がついている。背景は透過。
ちゃんと透過画像が生成されました!立ち絵としてのクオリティも高く、そのままゲーム等で使えそうですね。
例4:テキスト入りの画像
Qwen-Image-2.1はテキスト入りの画像も比較的得意だという話だったので、少し長めのテキストが入った画像の生成も試しました。

プロンプト:
A high-quality illustration resembling an anime screenshot. An anime-style girl with black hair and her hood up is smiling while holding a white board that reads, "KurokumaSoft is a technical blog about image generation AI." She is wearing a black hoodie with bear ears and a black skirt. The text "KurokumaSoft" appears in large characters on the board. The artwork features an anime style with flat coloring, set against a white background.
(参考)日本語訳:
まるでアニメのスクリーンショットのような高品質のイラスト。アニメ風の女の子が、「KurokumaSoftは画像生成AIの技術ブログです」と書かれた白い板を持って微笑んでいる。女の子は熊の耳がついた黒いパーカーと黒いスカートを着ており、髪は黒く、フードを被っている。板は「KurokumaSoft」の部分が大きく書かれている。画風はアニメスタイルでフラットな塗りである。背景は白。
テキストもきちんと綺麗に描かれていますね。従来の画像生成AIだと変な文字が生成されることも多かったのですが、Qwen-Image-2.1では英語であればかなり鮮明できれいなテキストが出るようです。
おまけ:
ついでに日本語テキストをちゃんと描画できるかも試しました。

プロンプト:
A high-quality illustration resembling an anime screenshot. An anime-style girl with black hair and her hood up is smiling while holding a white board that reads, "このイラストはくろくまが生成しました". She is wearing a black hoodie with bear ears and a black skirt. The text "くろくま" appears in large characters on the board. The artwork features an anime style with flat coloring, set against a white background.
ちょっと意地悪して「”くろくま”の部分だけ大きい文字で書いて」と指示したところ、打率は良くなかったのですが何度かガチャするとそれっぽい画像が生成されました。短いテキストならある程度は日本語を描画できるようですね。
例5:画像編集(背景変更)
あと、せっかくなので画像編集機能も試してみました。簡単な背景変更のサンプルです。
編集前の画像:

プロンプト:
Keep the character and pose from <image1> exactly as they are, but change the background to a cityscape featuring a blue sky and cute, figure-like skyscrapers.
(参考)日本語訳:
<image1>のキャラクターとポーズはそのままにして、背景をフィギュアのようなかわいい大都会の高層ビル群と青空の街並みに変更する。
編集後の画像:

例6:参照画像をイラスト化
当ブログのマスコットキャラクター「くろくまちゃん」の美少女フィギュア風画像をイラスト化してみました。
参照画像:

プロンプト:
Keep the character and pose from <image1> as they are, but change the art style to a high-quality anime-style illustration.
(参考)日本語訳:
<image1>のキャラクターとポーズはそのままにして、画風を高品質なアニメ風イラストにする。
生成した画像:

例7:キャラクターの三面図作成
先ほどの例で作成した「くろくまちゃん」のイラストを元に、キャラクターの設定画でよくある三面図を作ってみました。
参照画像:↑の例の生成画像
プロンプト:
Create a character design sheet showing the front, side, and back views of the character in <image1>.
(参考)日本語訳:
<image1>のキャラクターの正面・側面・背面を示したデザインシートを作成する。
生成した画像:

なんか下のほうに余計なイラストと謎のテキストが生成されましたが三面図自体はいい出来です。
Qwen-Image-2.1の導入方法(ComfyUI)
さて前置きが長くなってしまいましたが、ここからが本題でQwen-Image-2.1のローカル環境への導入方法を解説していきます。主な手順は次のとおり。
- ComfyUIをインストールする(※既に導入済みの方はアップデート)
- Qwen-Image-2.1用のComfyUIテンプレートを導入する
- 必要なモデルをダウンロードする
それぞれ詳しく見ていきましょう。
手順1:ComfyUIのインストール(※既に導入済みの方はアップデート)
まずQwen-Image-2.1を手っ取り早く導入するには「ComfyUI」というツールを使うのが一番なので、まだ導入していない方は先にインストールを済ませてください。少し古い記事ですがComfyUIの概要やインストール方法は下記で詳しく解説しています。
また、既に導入済みだよという方は忘れずにComfyUIをアップデートしておきましょう。
手順2:Qwen-Image-2.1用のComfyUIテンプレートを導入
次にComfyUIを開いてQwen-Image-2.1用のテンプレートを導入します。サイドバーの「テンプレート」を選択するとワークフローのテンプレート一覧が出るので、右上の検索欄で「qwen image 2.1」と検索すると出てくるテンプレートを選びましょう。

テンプレートは「テキストから画像へ」と「画像編集」の2種類があります。Qwen-Image-2.1を使うなら最終的には両方のテンプレートを使うことになると思いますが、とりあえずここでは「テキストから画像へ」のほうを選んでみましょう。
手順3:必要なモデルをダウンロードする
するとワークフローが開いて下記のような画面になります。しかしそのままだとエラーが出て生成できないと思います。

エラー内容を見てみると当然ながら「必要なモデルが足りないよ」という旨のメッセージが出ていますね。ご丁寧にダウンロードボタンが表示されていますので「すべてダウンロード」ボタンを押してモデルを一括ダウンロードしましょう。必要なモデルの合計サイズは約16GBもあるので、お使いの回線速度にもよりますがしばらく時間がかかります。気長に待ちましょう。
なお執筆時点のComfyUIではボタンを押しても何も反応がないように見えます。しかし実際にはダウンロードは始まっており、よく見るとタイトルバー右側の最小化ボタンの隣にダウンロードマークが出るはずです。そこを押すと現在のダウンロード状況などが表示されます。
あと、ダウンロードが完了してもエラーは自動的には消えません。ダウンロードが終わったら「不足しているモデル」というエラー表示の隣にある更新ボタンを押すことでエラー表示が消えるはずです。
Qwen-Image-2.1の使い方
導入が済んだところで、お次はQwen-Image-2.1の具体的な使い方をご紹介します。
テキストから画像生成(t2i)のやり方
まずテキストから画像生成(別名t2i、Text to Image)の場合は、先ほど導入していただいたワークフローを開いて
- アスペクト比
- メガピクセル
- プロンプト
の3つを指定して「実行する」ボタンを押すだけです。
アスペクト比とメガピクセル(=画像解像度)の指定
最初に「解像度セレクター」ノードにある「アスペクト比」と「メガピクセル」を指定します。

アスペクト比とは画像の縦横比のことで、例えば
- 1:1→正方形
- 4:3→正方形に近いがやや横長の画像
- 16:9→ワイドスクリーンに適した一般的な横長の画像
などとなっています。
ただしこれだけでは画像サイズまでは指定できません。そこでメガピクセルという単位を使って「何百万画素の解像度の画像なのか」を決めます。例えば「1メガピクセル=100万画素の解像度」です。この値を大きくすればより高解像度の画像を生成できて便利ですが、その分生成処理が遅くなる点には注意してください。
もし手っ取り早く高解像度の画像が欲しい場合は、ほどほどのサイズの画像を生成しておいて後でアップスケールを行うやり方があります。ComfyUIでのアップスケールのやり方は下記の記事で詳しく解説していますのでそちらも併せてご覧いただければと思います。
プロンプトの指定
次に「Text to Image」ノードにプロンプトを記入します。

プロンプトは画像生成AIに「こういう画像を生成しろ」と命令するための指示文のようなもので画像生成においてとても重要です。自分の思い通りの画像を生成するためにはこのプロンプトをなるべく具体的に記入するのが望ましいです。
プロンプトの例:
まるでアニメのスクリーンショットのような高品質のイラスト。アニメ風の女の子が、明るい森の中で石の上に座っておいしそうにラーメンを食べている。女の子は熊の耳がついた黒いパーカーと黒いスカートを着ており、髪は黒く、フードを被っている。女の子はとても満足げな表情である。ラーメンからは湯気が立っており、ラーメンの具は卵とチャーシューと海苔。背景はアニメ風の美しい森で、カメラの焦点は女の子にあり背景はぼかされている。画風はアニメスタイルでフラットな塗りである。
例えば↑の例のように
- どのような特徴のキャラクターが
- どのようなシチュエーション・場所で
- 何をしているか
- キャラクターのポーズや画像全体の構図・色調はどんな感じか
- イラストならどのような画風か
といったことをなるべく詳しく・具体的にプロンプトに盛り込むようにしましょう。
ただし「この部分は別にランダムでも構わないよ」というところがあればそこはザックリ書いておいても問題ありません。最近の画像生成AIは多少プロンプトが甘くてもいい感じの画像を出してくれます。t2iの場合は運任せでガチャを引くのもまた一興です。
なおノードを見るとプロンプト欄は2つあって上が「ポジティブプロンプト」欄(※一般的にはこちらがプロンプトと呼ばれる)、下が「ネガティブプロンプト」欄になっています。昔の画像生成AIはネガティブプロンプトを書かないとクオリティの低い画像を平気で生成してくるなんてことがありましたが、最近のAIはネガティブプロンプトを何も書かなくても高品質な画像を生成してくれることが多く、Qwen-Image-2.1でもネガティブプロンプトは空欄で構わないと思います。そっちよりも普通のプロンプトをしっかり具体的に書くようにしましょう。
おまけ:シードの生成方法を変更する方法
さておまけとして画像生成に使うシードの生成方法を変更する方法をご紹介しておきます。「Text to Image」ノードのところに「seed」という欄があると思うのですが、この欄の右側に何やらマークがあるのが分かると思います。ここをクリックすると画像生成時のシードの決め方を指定できます。

よく使うのが「値をランダム化」と「固定値」の2つです。
- 値をランダム化:
画像を生成するたびに前回とは違うシードを生成する - 固定値:
全く同じシードを使って画像を生成する
今回のワークフローはデフォルトで「固定値」になっているようですが、通常はここを「値をランダム化」にしておいてガチャを引くのが一般的です。
画像編集(Image Edit)のやり方
次に画像編集(Image Edit)の場合は、画像編集用のワークフローを導入して編集に使う画像を最大10枚まで登録し、画像サイズやプロンプトを記入して実行すればOKです。
参照画像の登録方法
画像編集では編集に使う「参照画像」が1枚以上必要です。参照画像の登録方法は「画像を読み込む」ノードに画像ファイルをドラッグ&ドロップするだけでOK。もしくはComfyUIの「input」フォルダに予め入れておいた画像を読み込むこともできます。
ちなみに高解像度の画像を参照画像にすると生成処理が遅くなるのでその点は注意してください。
参照画像の枚数を変更する方法
画像編集用のワークフローを開くと画像を2枚登録するようになっていますが、これは必要に応じて変更できます。

参照画像の枚数を増やしたい場合は「画像を読み込む」ノードを追加(何もないところでダブルクリック→画像を読み込むを選択)して、その画像出力を「Image Edit」ノードの画像入力部分(「image_○」と書かれたところ)の空いている部分に接続すればOKです。
逆に参照画像の枚数を減らしたい場合は、画像を読み込むノードを削除してもいいですがいちいち削除するのは面倒くさいと思うのでバイパスしましょう。ノードを右クリック→「バイパス」を選択するとそのノードが半透明の紫色になり、その部分は実行時にスキップされるようになります。
おわりに
以上、Qwen-Image-2.1の導入方法や使い方を解説しました。このモデルを使いこなせれば従来のモデル以上に様々な用途に使えてとても便利だと思うので、皆さんもぜひ試してみてください。
この記事が画像生成のお役に立てば幸いです。




