유량
FLUX는 Stable Diffusion의 원년 핵심팀이 설립한 Black Forest Labs에서 출시한 차세대
FLUX — Black Forest Labs의 차세대 고품질 AI 이미지 생성 모델
핵심 매개변수 및 통계
| 매개변수 | 세부정보 |
|---|---|
| 개발자 | Black Forest Labs GmbH (독일 프라이부르크) |
| 창립자 | Robin Rombach, Andreas Blattmann(이전 안정성 AI / 안정 확산) |
| 첫 출시일 | 2024년 8월 1일 |
| 모델 시리즈 | FLUX.1 [프로], [개발자], [슈넬]; FLUX1.1 [프로], [프로] 울트라 |
| [슈넬] 라이센스 | Apache 2.0(상용 가능, 완전 개방형) |
| [개발자] 라이센스 | 공개 권리, 비상업적 사용 |
| [프로] 라이센스 | API를 통해서만 액세스, 상용 라이센스 |
| 최대 출력 해상도 | 4MP(FLUX1.1 [프로] 울트라) |
| API 액세스 채널 | Replicate, fal.ai, Together AI, 공식 API |
| 경쟁제품 비교평가 | 많은 평가에서 이미지 품질이 Midjourney v6 및 DALL-E 3을 능가함 |
FLUX의 핵심 장점은 "최고의 이미지 품질 + 개방형 전략"의 조합에 있습니다. [pro] 시리즈는 품질 측면에서 Midjourney와 같은 최고의 상용 도구와 경쟁하는 반면, [schnell] 버전은 Apache 2.0을 사용하여 커뮤니티 및 상용 프로젝트에 완전히 개방되어 "오픈 소스 커뮤니티 사용 → 상용 배포"의 완전한 생태 체인을 엽니다.
사용자 및 시장 인지도
2024년 8월 FLUX.1 시리즈가 출시된 후 AI 이미지 생성 커뮤니티에서 보기 드문 센세이션을 일으켰습니다. Hugging Face의 FLUX.1 [dev] 모델은 출시 첫 주에 가장 많이 다운로드된 이미지 생성 모델이 되었습니다. Reddit과 Twitter에는 많은 리뷰 게시물이 있었고 사용자들은 일반적으로 이미지 품질이 Midjourney v6 수준에 도달했거나 그 이상이라는 것을 인식했습니다.
FLUX는 역사적으로 AI 이미지 생성이 어려웠던 인체 해부학의 정확성, 복잡한 장면에서 여러 객체의 관계 처리, 텍스트 렌더링 정확성, 전체적인 시각적 아름다움 등의 측면에서 높은 점수를 받았습니다. 여러 AI 커뮤니티 독립 리뷰에서는 FLUX.1 [pro] 및 FLUX1.1 [pro]를 전반적으로 가장 높은 품질의 AI 이미지 생성 모델 중 하나로 평가했습니다. Black Forest Labs 팀의 Stable Diffusion 창의적 배경은 제품에 높은 수준의 기술적 신뢰성을 제공합니다.
비용 이점
| 버전 | 액세스 | 가격 | 라이센스 | 대상자 |
|---|---|---|---|---|
| FLUX.1 [슈넬] | 오픈 웨이트 다운로드 | 무료 | 아파치 2.0 | 개발자, 연구원, 상용 배포 |
| FLUX.1 [개발자] | 오픈 웨이트 다운로드 | 무료 | 비상업적 | 연구, 학습, 개인 실험 |
| FLUX.1 [프로] | 복제/fal.ai API | 카드당 약 $0.05 | 상업용 라이센스 | 애플리케이션 개발자, 전문 사용자 |
| FLUX1.1 [프로] | API | 약 $0.04/개 | 상업용 라이센스 | 고품질 상용 응용 프로그램 |
| FLUX1.1 [프로] 울트라 | API | 사진당 약 $0.06 | 상업용 라이센스 | 고해상도 전문 장면 |
강력한 자체 호스팅 기능을 갖춘 개발자의 경우 [schnell]의 Apache 2.0 라이센스는 고품질 상업용 이미지 생성을 위한 가장 저렴한 옵션 중 하나입니다. 인프라 유지를 원하지 않는 사용자의 경우 API 액세스에 대한 종량제 모델이 낮거나 중간 빈도의 사용으로 비용 효율적입니다.
주요 기능
- 고품질 텍스트-이미지 생성: FLUX 모델 시리즈는 특히 문자 및 복잡한 장면의 생성 품질에서 신속한 단어 추적 정확도, 이미지 사실성, 인체 해부학 정확도 및 예술적 스타일 다양성 측면에서 업계 최고 수준에 도달했습니다.
- 3단계 모델의 유연한 선택: [schnell](Apache 2.0에서 가장 빠르며 상업적으로 사용 가능)은 속도 우선 순위 요구 사항을 충족합니다. [dev] (공개 중량, 비상업적)는 연구 및 미세 조정에 적합합니다. [pro](최고 품질, API 액세스)는 최고 품질 요구 사항을 충족하며 사용자는 실제 시나리오에 따라 유연하게 선택할 수 있습니다.
- 텍스트 렌더링 기능: FLUX의 이미지 내 텍스트(포스터 슬로건, 간판 텍스트 등) 렌더링 정확도는 동기간 경쟁 제품보다 높습니다. 이 기능은 그래픽과 텍스트의 조합이 필요한 디자인 시나리오에서 실질적인 이점을 제공합니다.
- 초고해상도 출력(Ultra): FLUX1.1 [pro] Ultra는 최대 4MP의 이미지 출력을 지원하여 인쇄, 대형 디스플레이, 전문 사진 대체 등 초고해상도 요구 사항을 충족하는 장면을 지원합니다.
- 개방형 가중치 생태계([dev]/[schnell]): 개방형 가중치를 통해 커뮤니티 개발자는 로컬로 배포하고 LoRA를 미세 조정하고 스타일을 사용자 지정할 수 있습니다. Civitai와 같은 커뮤니티에서는 FLUX를 기반으로 한 수많은 맞춤형 모델과 LoRA가 축적되어 생성된 스타일의 다양성이 풍부해졌습니다.
- 빠른 생성([schnell]): FLUX.1 [schnell]은 고품질을 유지하면서 추론 속도를 최적화하고 생성 시간을 단축합니다. 실시간 또는 거의 실시간에 가까운 이미지 생성이 필요한 애플리케이션 시나리오에 적합합니다.
- 멀티 플랫폼 API 액세스: Replicate, fal.ai, Together AI, Black Forest Labs 공식 API 등 여러 채널을 통해 액세스가 제공되므로 개발자는 인프라 및 비용 구조에 가장 적합한 액세스 방법을 선택할 수 있습니다.
모델 및 버전의 진화
| 버전 | 시간 | 설명 |
|---|---|---|
| 블랙 포레스트 연구소 설립 | 2024-06 | Robin Rombach와 Andreas Blattmann이 설립 |
| FLUX.1 [pro/dev/schnell] | 2024-08-01 | 3단 모델 동시 출시, 커뮤니티에 돌풍 |
| FLUX1.1 [프로] | ~2024-10 | 품질과 속도가 두 배로 향상되고, 3배 더 빨라집니다 |
| FLUX1.1 [프로] 울트라 | ~2024-11 | 4MP 초고해상도 버전 출시 |
| 커뮤니티 LoRA 생태번영 | ~2024-Q4 | Civitai와 HuggingFace 커뮤니티는 수많은 FLUX LoRA |
기술적인 장점
Rectified Flow Transformer Architecture: FLUX는 Stable Diffusion 시리즈(U-Net 기반)와는 다른 Transformer 아키텍처(DiT - Diffusion Transformer와 유사)를 채택합니다. Rectified Flow 훈련 방법과 결합된 이 모델은 이미지 세부 정보 유지, 의미론적 이해 및 생성 일관성 측면에서 아키텍처 수준의 상당한 이점을 달성하여 후속 품질 개선을 위한 보다 견고한 기반을 마련합니다.
가이던스 증류 기술([schnell]): FLUX.1 [schnell]은 증류 기술을 사용하여 다단계 샘플링이 필요한 생성 프로세스를 몇 단계(1~4단계)의 고품질 생성으로 압축합니다. 이를 통해 추론 계산량을 크게 줄이면서 이미지 품질을 높은 단계 샘플링에 가깝게 유지하여 속도와 품질 간의 효율적인 균형을 달성합니다.
인체 해부학 최적화 교육: FLUX 시리즈는 인체 해부학 정확도(손, 얼굴 비율, 사지 관절) 측면에서 초기 확산 모델보다 훨씬 뛰어납니다. 이는 훈련 데이터 품질 및 감독 신호에 대한 팀의 특별한 최적화에서 비롯되며 평가에서 사용자가 가장 칭찬하는 차원 중 하나입니다.
사용방법
| 입구 | 설명 |
|---|---|
| 복제 | API 호출 또는 웹 인터페이스 평가판을 보려면 https://replicate.com/black-forest-labs를 방문하세요 |
| fal.ai | 다양한 FLUX 모델 API를 제공하는 https://fal.ai를 방문하세요 |
| 포옹얼굴 | [dev]/[schnell] 공개 가중치 모델 다운로드, 로컬 또는 클라우드에서 실행 |
| ComfyUI/Automatic1111 | 로컬 배포, 커뮤니티 플러그인을 통한 FLUX 모델 로딩 |
| 공식 API | https://api.bfl.ml을 방문하여 Black Forest Labs 공식 API를 직접 호출하세요 |
일반적인 사용 단계(Replicate API를 통해 FLUX1.1 [pro] 호출):
- https://replicate.com을 방문하여 계정을 등록하고 결제 수단을 연결하세요.
- Replicate에서 "black-forest-labs/flux-1.1-pro"를 검색하여 모델 페이지를 봅니다.
- 웹 인터페이스에 직접 프롬프트 단어 경험을 입력하거나 API 통합을 위한 Python 샘플 코드를 복사합니다.
- API 호출:
replicatePython 패키지를 설치하고, API 토큰을 설정하고,replicate.run("black-forest-labs/flux-1.1-pro", input={"prompt": "..."})를 호출하여 이미지를 생성합니다. - 로컬 배포([schnell]): HuggingFace에서
black-forest-labs/FLUX.1-schnell모델 가중치를 다운로드하고 ComfyUI를 통해 로드하고 실행합니다(24GB+ GPU 메모리 필요).
제품 가격
- FLUX.1 [schnell]: 완전 무료, Apache 2.0 오픈 소스 라이센스, 상업용으로 사용 가능, 로컬 배포, 사용 제한 없음(하드웨어 비용은 본인 부담). API 플랫폼을 통한 통화 비용은 티켓당 약 $0.003입니다.
- FLUX.1 [dev]: API 플랫폼 호출을 통해 사진당 약 $0.025의 연구 및 개인 학습에 적합한 개방형 비상업적 라이센스로 무료 다운로드할 수 있습니다.
- FLUX.1 [pro]: API 액세스 전용, Replicate에서 약 $0.055/개, fal.ai에서 약 $0.05/개, 상업용 애플리케이션 개발에 적합합니다.
- FLUX1.1 [프로]: 복제 비용은 약 $0.04/개이며, 더 빠르고 품질도 높습니다. [프로]의 업그레이드 버전을 추천드립니다.
- FLUX1.1 [pro] Ultra: 장당 약 $0.06, 4MP 고해상도를 지원하며 전문적인 상업 인쇄 및 디자인 요구에 적합합니다.
애플리케이션 시나리오
1. 고품질 상업용 영상 콘텐츠 생성 브랜드 디자인 팀과 광고 회사는 FLUX1.1 [pro] API를 사용하여 고품질 제품 디스플레이 이미지, 마케팅 비주얼 및 광고 크리에이티브를 생성합니다. 캐릭터, 제품 및 장면 생성 품질에 대한 FLUX의 장점은 출력 콘텐츠의 상업적 가용성을 직접적으로 향상시키고 사후 리터칭 비용을 절감합니다.
2. 개발자는 고품질 이미지 생성을 통합 애플리케이션 개발자는 FLUX API를 통해 AI 이미지 생성 기능을 제품에 통합할 수 있습니다. [schnell]의 Apache 2.0 라이센스는 상업적 통합을 허용하며, [pro]의 높은 품질은 고품질 출력이 필요한 상용 애플리케이션 시나리오를 충족하고, 다양한 비용 및 품질 요구 사항을 충족하는 유연한 API 선택을 제공합니다.
3. 연구 및 오픈 소스 커뮤니티 모델 미세 조정 AI 연구원과 커뮤니티 개발자는 FLUX.1 [dev]의 개방형 가중치를 사용하여 LoRA를 미세 조정하고 특정 스타일(예: 애니메이션, 사실적인 사진, 예술적 스타일)에 대한 맞춤형 모델을 교육합니다. Civitai 커뮤니티는 사용자가 다운로드하여 사용할 수 있는 고품질 FLUX LoRA를 대량으로 축적했습니다.
4. 고해상도 전문 이미지 생성(Ultra) 인쇄, 대형 디스플레이 또는 전문 사진 대체 장면에 사용해야 하는 FLUX1.1 [pro] Ultra의 4MP 출력은 최고 수준의 이미지 품질과 결합되어 "AI 생성 + 고해상도"가 필요한 전문 시각적 장면에 적합한 상업용 인쇄의 해상도 요구 사항을 충족합니다.
해당자
- AI 개발자 및 독립 개발자: 애플리케이션 통합을 위해 고품질 이미지 생성 API가 필요하며 [schnell]의 Apache 2.0 라이선스는 상업적 사용에 대한 법적 장벽을 허용하지 않습니다.
- AI 아티스트 및 디지털 콘텐츠 제작자: FLUX는 최고의 이미지 품질을 추구하여 사실적인 스타일과 예술적인 스타일로 종합적인 성능을 선도하며, 오픈 웨이트 버전은 로컬 유연한 제어를 지원합니다.
- 브랜드 디자인 및 마케팅 비주얼팀: 비즈니스 요구 사항을 충족하기 위해 안정적인 고품질 상업용 이미지 생성 API, 상업용 인증 [pro] 시리즈 및 안정적인 API 서비스가 필요합니다.
- AI 연구원 및 학계: [dev]의 개방형 가중치는 이미지 생성 모델 연구, 미세 조정 기술 실험 및 절제 연구에 적합한 완전한 연구 재현성을 지원합니다.
- 시나리오에는 적합하지 않음: 기술적 지식이 전혀 없고 간단한 드래그 앤 드롭 인터페이스만 필요한 일반 사용자(Midjourney 또는 Adobe Firefly가 보다 친숙한 제품 경험을 제공) 비디오 생성이 필요합니다(FLUX는 정적 이미지에 중점을 둡니다). 높은 GPU 컴퓨팅 성능이 필요한 로컬 배포는 일반 소비자 하드웨어에서는 불가능합니다.
요약 및 전망
FLUX의 출현은 Stable Diffusion의 원래 팀이 시작한 오픈 소스 이미지 생성 분야의 또 다른 기술적 도약을 의미합니다. U-Net을 Transformer 아키텍처로 대체하고 Midjourney에 최고의 상용 품질을 부여하는 동시에 [schnell] 버전의 Apache 2.0으로 오픈 소스 생태계의 활력을 유지합니다. "품질을 손상시키지 않는 상용 버전 + 개방성을 손상시키지 않는 오픈 소스 버전"이라는 이중 트랙 전략은 비즈니스 지속 가능성을 보장할 뿐만 아니라 커뮤니티 생태계의 번영도 유지합니다.
현재 제한 사항은 다음과 같습니다. [pro] 시리즈는 API 액세스에 의존하며 비용은 자체 호스팅 오픈 소스 솔루션보다 높습니다. [dev]/[schnell]을 로컬로 실행하려면 24GB 이상의 비디오 메모리가 필요하며 소비자급 하드웨어 임계값은 높습니다. 공식적인 대화형 이미지 편집 인터페이스가 없으며 타사 플랫폼의 UI 레이어에 의존해야 합니다. 중국어 프롬프트 단어의 품질은 여전히 영어 프롬프트 단어에 비해 뒤떨어집니다.
앞으로 Black Forest Labs는 FLUX(안정적인 비디오 확산의 기술 경로 지속)를 기반으로 하는 비디오 생성 모델과 더 가벼운 버전(비디오 메모리의 로컬 배포에 대한 임계값을 낮추는 것)을 출시할 것으로 예상됩니다. FLUX에서 LoRA 및 ControlNet 생태계가 더욱 성숙해짐에 따라 FLUX는 창의적인 제어 유연성 측면에서 Stable Diffusion 생태계와의 격차를 더욱 좁힐 것으로 예상됩니다.
관련 도구: midjourney, stable-diffusion
버전 정보
- FLUX1.1 [프로] 울트라 :FLUX1.1 [pro] Ultra 버전 출시, FLUX1.1 [pro]의 최고 이미지 품질을 유지하면서 최대 4MP(약 400만 픽셀)의 초고해상도 이미지 생성을 지원하며, 출력 해상도에 대한 전문가 수준 요구 사항이 있는 상업용 디자인 및 인쇄 목적에 적합하며 API를 통한 액세스를 제공합니다.
- FLUX1.1 [프로] :FLUX.1 [pro]를 기반으로 이미지 품질, 생성 속도(1세대보다 3배 빠름) 및 프롬프트 단어 추적 정확도를 더욱 향상시킨 FLUX1.1 [pro]를 출시하여 여러 독립적인 평가에서 최고의 상용 이미지 생성 도구와 경쟁하며 선두 점수를 획득했습니다.
- FLUX.1 시리즈 첫 번째 릴리스([pro]/[dev]/[schnell]) :Black Forest Labs는 [pro](최고 품질, API 전용), [dev](개방형, 비상업적 라이센스), [schnell](가장 빠른, 개방형, Apache 2.0 상업용 라이센스)의 세 가지 FLUX.1 모델 세트를 공식 출시합니다. 출시 후 빠르게 AI 커뮤니티에서 폭넓은 관심을 끌었고, Hugging Face, Replicate, fal.ai 등의 플랫폼이 동시에 출시되어 배포되었습니다.
사용자 후기