Qwen-Image-Edit 오픈 소스: 이중 채널 제어 아키텍처를 통해 "그림의 단어 변경"에 더 이상 재작업이 필요하지 않습니다.
Alibaba Tongyi Qianwen은 2025년 8월 19일에 Qwen-Image-Edit을 출시했습니다. 이는 20B Qwen-Image를 기반으로 구축되었습니다. Qwen2.5-VL(시각적 의미 제어) + VAE 인코더(시각적 모양 제어)의 듀얼 채널 아키텍처를 통해 "의미적 편집 + 모양 편집"을 모두 달성하고 그림에서 정확한 텍스트 편집을 지원합니다.
디자인 작업 흐름에서 가장 지루한 링크는 종종 "그림 그리기"가 아니라 "오타 수정"입니다. AI가 생성한 홍보 그림의 잘못된 텍스트는 일반적으로 전체 그림을 다시 그리는 것을 의미합니다. 8월 19일 Alibaba Tongyi Qianwen이 출시한 Qwen-Image-Edit은 이러한 재작업을 끝내려고 합니다. 20B 매개변수를 기반으로 하는 Qwen-Image 기반은 텍스트 렌더링 기능을 편집 작업으로 확장하고 정확한 텍스트 교체 및 수정을 지원합니다.
양방향 제어: 의미와 모양이 각각 고유한 임무를 수행합니다.
Qwen-Image-Edit의 핵심 기술은 이중 입력 아키텍처 세트입니다. 동일한 입력 이미지가 동시에 두 채널에 공급됩니다.
- Qwen2.5-VL: 시각적 의미 제어, 지침 이해 및 의미 수준 수정을 담당합니다.
- VAE 인코더: 시각적 모양 제어를 담당하여 원본 이미지의 스타일, 구성 및 기타 모양 정보를 유지합니다.
두 채널을 병렬로 운영해 '의미적 편집+외모 편집'을 모두 구현해 전체 그림의 레이아웃 스타일에서 벗어나지 않으면서 '포스터의 '가을'을 '겨울'로 변경' 등의 지시를 이해할 수 있다. 이 아키텍처는 편집 품질과 효율성 사이의 균형을 맞추는 열쇠입니다.
Qwen-Image로 듀얼 엔진 구성
Qwen-Image-Edit과 Qwen-Image는 함께 이미지 생성/편집 방향에 대한 Tongyi Qianwen의 오픈 소스 듀얼 엔진을 구성합니다. 이 모델은 GitHub, Hugging Face 및 ModelScope의 오픈 소스이기도 하며 Qwen Chat에 연결됩니다. 디자인, 전자상거래 및 광고와 같은 산업의 경우 중국어 시나리오에서 "텍스트 집약적인 이미지 편집" 작업의 비용을 크게 줄입니다. 특히 모델 계층에서 직접 해결할 수 있는 단어 수정 및 카피라이팅과 같은 빈도가 높은 작업입니다.
업계 관점에서 볼 때 Qwen 이 조합의 플레이 스타일은 중국 장면 우선 전략을 이어갑니다. 해외 편집 모델은 자연스럽게 중국어 지침을 이해하고 중국어 글리프를 유지하는 데 어려움을 겪는 반면 Qwen 시리즈(2.5-VL 시각적 의미 이해 포함)는 이 트랙에서 홈 필드 이점을 갖습니다. 국내 이미지 도구 및 전자상거래 플랫폼의 경우 "중국 이미지 수정 지침을 이해할 수 있는" 오픈 소스 모델은 AI 편집 기능을 비즈니스 프로세스에 내장하기 위한 기성 기반입니다.
앞으로 추적할 가치가 있는 몇 가지 방향은 다음과 같습니다.
- 복잡한 레이아웃의 안정성: 다중 텍스트 및 다중 레이어 포스터의 편집 성공률은 제작 수준 애플리케이션의 핵심입니다.
- 세분성 편집: "한 단어는 변경하고 다른 단어는 변경하지 않음"이 가능합니까, 아니면 일부를 다시 그리는 것이 가능합니까?
- 디자인 도구와의 통합(Photoshop/인스턴트 디자인): 오픈 소스 모델 + 플러그인 형태의 구현 속도.
- Qwen2.5-VL 업그레이드로 편집 기능이 향상됩니다: 시각적 의미에 대한 이해가 강할수록 다음 편집 지침이 더 정확해집니다.
후기