Alibaba 오픈 소스 Qwen-Image: 20B 매개변수, "텍스트 렌더링"을 이미지 모델의 본거지로 만들기
Alibaba Tongyi Qianwen은 2025년 8월 4일에 Qwen-Image를 출시했습니다. 이 모델은 복잡한 텍스트 렌더링(다중 줄 조판, 단락 의미 체계, 세밀한 세부 정보)에서 획기적인 발전을 이루었고 중국어 및 영어와 같은 여러 언어를 지원하며 GitHub, Hugging Face 및 ModelScope의 오픈 소스입니다.
대부분의 이미지 생성 모델은 "잘 그리기"에 열심히 노력하지만 "좋은 문자 쓰기"에 실패하는 경우가 많습니다. 포스터의 한자는 항상 획이 부족하고 획이 적습니다. 2025년 8월 4일 Alibaba Tongyi Qianwen이 출시한 Qwen-Image는 이 중국 장면의 가장 고통스러운 점을 정면으로 해결하기로 결정했습니다. 즉, 20B 매개변수를 사용하는 MMDiT(Multi-modal Diffusion Transformer) 이미지 기본 모델을 선택하여 복잡한 텍스트 렌더링을 홈 기능으로 만들었습니다.
"텍스트 중심" 이미지에 집중
Qwen-Image의 주요 기능은 여러 줄 조판, 단락 수준 의미 체계, 세밀한 세부 정보 및 기타 복잡한 텍스트 렌더링 기능에 중점을 두는 동시에 중국어 및 영어와 같은 여러 알파벳/표의 문자 언어를 지원합니다. 이는 포스터, 로고, 광고 등 "텍스트가 주제"인 강력한 텍스트 장면이 마침내 오픈 소스, 중국어 친화적인 기본 모델을 갖게 되었음을 의미합니다. 텍스트 렌더링 외에도 이미지 베이스 모델로 정밀한 편집도 지원합니다.
사용자는 Qwen Chat에서 "이미지 생성"을 선택하여 직접 경험할 수 있으며, 모델은 GitHub, Hugging Face, ModelScope 및 기타 플랫폼에도 오픈 소스로 출시됩니다. 국내 개발자는 방화벽을 우회할 필요 없이 다운로드하여 사용할 수 있어 중국 커뮤니티에서 프로젝트를 구현하는 데 있어 매우 편리합니다.
지속 가능한 오픈소스 전쟁
Qwen-Image는 고립된 동작이 아닙니다. 15일 후(8월 19일) 팀은 텍스트 렌더링 기능을 편집 작업으로 확장하기 위해 동일한 20B 기반을 기반으로 하는 Qwen-Image-Edit을 출시했습니다. 이 "생성 + 편집" 듀얼 엔진은 DALL·E, Stable Diffusion, Flux 등 국제 모델과 직접 경쟁하며 Qwen 멀티모달 세대 방향에서 Alibaba의 가장 대표적인 오픈 소스 성과를 만들어냅니다.
업계 관점에서 볼 때, Qwen-Image의 차별화된 전략은 매우 영리합니다. 해외 모델과 함께 '사진/예술적 스타일'의 긍정적인 소비를 지양하고, 대신 해외 모델이 일반적으로 취약하지만 국내 디자인, 전자상거래, 광고 업계에서 자주 필요한 분야인 '중국어 텍스트 렌더링'에 중점을 두는 것입니다. 국내 이미지 도구 개발자에게 상용화되고 미세 조정된 중국 기반을 제공합니다. 이러한 "오픈 소스 + 중국 장면 적응"의 조합은 바로 중국 오픈 소스 생태계에 가장 필요한 것입니다.
앞으로 추적할 가치가 있는 몇 가지 방향은 다음과 같습니다.
- Qwen-Image의 커뮤니티 생태: 이를 기반으로 미세 조정된 수직 모델(전자상거래, 광고, UI)의 수입니다.
- 중국어 긴 텍스트 렌더링의 한계: 매우 긴 문단과 조밀한 작은 문자의 안정성이 제작 테스트를 견딜 수 있는지 여부.
- Flux/SD3.5와의 오픈 소스 비교: 동일한 매개변수 척도에서 텍스트 렌더링과 이미지 품질 사이의 딜레마를 평가하는 방법.
- Alibaba의 다중 모드 후속 조치: Qwen-Image가 비디오 생성 기반의 일부로 진화할지 여부.
후기