技術記事

Qwen-Image-Edit登場:画像とテキストを高精度に編集

Qwen-Image-Editによるセマンティック変換、精密な外観編集、中国語・英語のテキスト変更、反復的な画像調整を紹介します。

Qwen Image Team

予想読了時間
約 4 分
文字数
約 787 文字

うまくできている部分を作り直さずに画像を編集

クリエイティブ制作が最初の画像で終わることはほとんどありません。構図の他の部分を失わずに、オブジェクトの削除、文言の変更、新しいスタイルの探索、細部の修正を行う必要があります。Qwen-Image-Editは、20BのQwen-Imageモデルを基盤に、こうした改稿をプロンプトベースのワークフローで実現します。

さらに、入力画像をQwen2.5-VLに渡して視覚的な意味を理解し、VAE Encoderで外観を制御することで、二つの長所を統合しています。この仕組みにより、細かな調整から全面的な変換まで、新たな編集の可能性が広がります。

つまり、視覚的な意味理解を担うQwen2.5-VLと、外観制御を担うVAE Encoderを組み合わせ、幅広い創造的変換と局所的な変更の両方を支援します。

中核機能

Qwen-Image-Editは三つの実践的な編集ニーズに対応します。

  • セマンティック編集と外観編集: 周囲を保ちながら要素を追加・削除したり、スタイル変換、オブジェクトの回転、キャラクター開発などの広範な変更を行ったりできます。
  • 高精度なテキスト編集: 元のフォント、サイズ、スタイルを維持しながら、中国語と英語のテキストを追加、削除、変更できます。
  • 反復的な調整: 構図全体をやり直さず、対象領域を段階的に修正できます。

編集モードの実例

Qwen-Image-Editならではの機能を、いくつかの例で見ていきましょう。

広範な変換に対応するセマンティック編集

セマンティック編集は、元の意味とスタイルを保ちながら画像の内容を変更します。愛らしいマスコットのカピバラを例に、その可能性を見てみましょう。

カピバラ

編集後の画像が元画像と大きく異なっていても、カピバラのキャラクターは一貫しています。この強力なセマンティック編集により、多様で独自性のあるIPコンテンツを容易に制作できます。

カピバラを基にMBTIをテーマにした絵文字パックも作成し、表現の可能性の広さを示しました。

MBTIミームシリーズ

新しい視点を生むビュー合成

Qwen-Image-Editは、オブジェクトを別の角度から見た新しいビューも生成できます。90度、さらに180度回転させ、背面を表示することも可能です。

視点を90度変換

視点を180度変換

視覚探索のためのスタイル変換

ポートレートを、象徴的なスタジオジブリ風など多様な芸術スタイルへ簡単に変換できます。カスタムアバターの制作や、写真を使った気軽な創作に最適です。

スタイル変換

局所的な変更に対応する外観編集

外観編集は、他の部分を変えずに画像の特定箇所だけを正確に変更します。Qwen-Image-Editは要素の追加、削除、変更を細部まで実行できます。

たとえば場面に看板を追加すると、それに対応する反射まで生成します。

看板の追加

細い髪の毛を取り除いたり、一文字だけ色を変えたりすることもできます。

細い髪の毛を削除

テキスト色の変更

背景の変更から服装の差し替えまで、幅広く対応します。

背景の変更

服装の変更

2言語の制作物に対応するテキスト編集

高度なテキスト描画理解により、画像内の文字を容易に編集できます。英語と中国語の見出し、ポスター、細かな文字要素まで正確に変更できます。

英語テキストの編集1

英語テキストの編集2

中国語ポスターの編集

段階的に仕上げる連鎖編集

理想の結果には複数回の試行が必要なことがあります。編集を連鎖させ、誤りを徐々に直しながら目的の画像へ近づけられます。

Qwen-Imageで生成した書道作品を連鎖編集で修正した例です。

書道作品

枠を描いて具体的に指示し、最終版に至るまで文字を一つずつ修正しました。

文字の修正

文字の微調整

この段階的な方法なら、良好な部分を維持しながら個々の文字の誤りを修正できます。

最終版1

最初の編集を始める

明瞭な元画像を選び、主要な変更を一つ記述します。維持すべき部分を明示し、結果を確認して、残る細部には二つ目の焦点を絞ったプロンプトを使います。Qwen Image GeneratorでImage Editingを選択して始めてください。

関連記事