Qwen-Image-Edit オープンソース: デュアルチャネル制御アーキテクチャにより、「画像内の単語の変更」に再作業が不要になりました

Alibaba Tongyi Qianwen は、2025 年 8 月 19 日に Qwen-Image-Edit をリリースしました。これは 20B Qwen-Image に基づいて構築されています。 Qwen2.5-VL(ビジュアルセマンティックコントロール)+VAEエンコーダー(ビジュアルアピアランスコントロール)のデュアルチャネルアーキテクチャにより、「セマンティック編集+アピアランス編集」を両立し、画像内の正確なテキスト編集をサポートします。

デザイン ワークフローで最も面倒な作業は、多くの場合、「絵を描く」ことではなく、「タイプミスを修正する」ことです。AI が生成した宣伝用の絵に誤ったテキストが含まれている場合、通常は絵全体を描き直すことになります。 Alibaba Tongyi Qianwen が 8 月 19 日にリリースした Qwen-Image-Edit は、この手直しに終止符を打とうとしています。20B パラメータに基づく Qwen-Image ベースは、テキスト レンダリング機能を編集タスクに拡張し、正確なテキストの置換と修正をサポートします。

双方向制御: セマンティクスと外観はそれぞれ独自の役割を果たします

Qwen-Image-Edit のコア テクノロジーは、デュアル入力アーキテクチャ のセットです。同じ入力画像が 2 つのチャンネルに同時に供給されます。

  • Qwen2.5-VL: 視覚的なセマンティック制御を担当し、命令を理解し、セマンティックレベルの変更を行います。
  • VAE エンコーダー: 視覚的な外観制御を担当し、元の画像のスタイル、構成、その他の外観情報を保持します。

2つのチャンネルを並行して実行することで、「意味編集+見た目編集」を両立し、「ポスターの『秋』を『冬』に変える」といった指示も、画面全体のレイアウトスタイルを逸脱することなく理解できる。このアーキテクチャは、編集の品質と効率のバランスをとる鍵となります。

Qwen-Image でデュアル エンジンを形成する

Qwen-Image-Edit と Qwen-Image は合わせて、画像生成/編集の方向における Tongyi Qianwen のオープンソース デュアル エンジンを構成します。このモデルは GitHub、Hugging Face、ModelScope 上のオープンソースでもあり、Qwen Chat に接続されています。デザイン、電子商取引、広告などの業界では、中国のシナリオにおける「テキスト中心の画像編集」タスク、特にモデル層で直接解決できる単語の修正やコピーライティングなどの高頻度の操作のコストが大幅に削減されます。

業界の観点から見ると、Qwen この組み合わせのプレイ スタイルは、中国のシーン優先戦略を継続しています。海外の編集モデルは当然のことながら、中国語の指示の理解と中国語のグリフの保持に問題を抱えていますが、Qwen シリーズ (2.5-VL の視覚的意味の理解を含む) はこのトラックでホーム フィールドのアドバンテージを持っています。国内の画像ツールや電子商取引プラットフォームにとって、「中国語の画像変更命令を理解できる」オープンソース モデルは、AI 編集機能をビジネス プロセスに組み込むための既成の基盤となります。

将来的に追跡する価値のあるいくつかの方向性:

  1. 複雑なレイアウトでの安定性: マルチテキストおよびマルチレイヤーのポスターの編集成功率は、制作レベルのアプリケーションの鍵となります。
  2. 編集の粒度: 「1 つの単語を変更するが、他の単語は変更しない」ことは可能ですか、それともその一部を再描画することは可能ですか?
  3. デザイン ツール (Photoshop/インスタント デザイン) との統合: オープンソース モデル + プラグイン形式での実装速度。
  4. Qwen2.5-VL のアップグレードにより編集機能が向上: 視覚的な意味の理解が深まるほど、次の編集手順がより正確になります。
著作権:コンテンツソース クウェン公式ブログ 。このプラットフォームは、情報提供と学習交流の目的でコンテンツを編集・整理しています。著作権に関する問題がございましたら、お問い合わせください。

レビュー

  • レビューを読み込み中...