베이글 무료

-

BAGEL은 ByteDance Seed 팀이 제공하는 오픈 소스 다중 모드 통합 기본 모델(7B 활성 매개변수/14B 총 매개변수)입니다. 이는 MoT(Mixture-of-Transformer-Experts) 아키텍처를 기반으로 하며 시각적 이해, 텍스트-이미지 생성, 이미지 편집, 스타일 전송, 세계 탐색 및 다중 라운드 결합 대화 기능을 동일한 모델에 통합합니다. 시각적 이해 벤치마크에서 Qwen2.5-VL-7B를 능가하고 FLUX.1-dev에 대한 Vincent 이미지 품질을 벤치마킹했으며 이미지 편집 기능은 Gemini 2.0과 비슷합니다. Apache 2.0 라이센스는 Gradio WebUI 및 HuggingFace 모델 가중치를 제공합니다.

베이글 제품 인터페이스

베이글

BAGEL의 핵심 매개변수 및 통계

BAGEL(Bagel AI)은 ByteDance Seed 팀의 오픈 소스 다중 모드 통합 기본 모델입니다. 이는 공식적으로 "다중 모드 이해 및 생성을 위한 통합 모델"로 지정됩니다. 시각적 이해, 텍스트-이미지 생성, 이미지 편집, 스타일 전송, 세계 탐색 및 모델 가중치 세트 내의 다중 라운드 결합 대화를 다룹니다. 독립적인 챗봇도 아니고, 단순한 이미지 생성기도 아닌, 동일한 아키텍처 하에서 이해와 생성을 통합하는 기본 모델입니다.

프로젝트 공공정보
공식 포지셔닝 다중 모드 이해 및 생성을 위한 통합 모델
개발팀 Bytedance Seed 팀 (Chaorui Deng, Deyao Zhu, Kunchang Li 등)
건축 MoT(변압기 전문가 혼합)
모델 사이즈 7B 활성 매개변수 / 14B 총 매개변수(총 가중치 15B)
기본 모델 Qwen2.5-7B-Instruct를 기반으로 미세 조정됨
비주얼 인코더 VAE(픽셀 레벨) + ViT(의미 레벨) 듀얼 인코더
생성 패러다임 다음 토큰 예측 그룹
오픈 소스 라이센스 아파치 2.0
GitHub 스타 6,100+
GitHub 포크 542
포옹얼굴이 좋아요 1,210+
최신 버전 BAGEL-7B-MoT (2025-05-20)
지원되는 언어 영어(메인), 커뮤니티 기여 중국어 인터페이스
컨텍스트에 따라 실행 12GB+ VRAM(NF4 양자화), 32GB+ 권장

듀얼 인코더 설계의 실제 의미: VAE 인코더는 픽셀 수준의 세부 정보(질감, 가장자리, 색상 그라데이션)를 캡처하는 역할을 담당하고 ViT 인코더는 의미 수준의 특징(객체 범주, 장면 관계, 감정적 분위기)을 추출하는 역할을 합니다. 두 사람의 협력을 통해 BAGEL은 원본 이미지의 미세한 구조를 유지하고 이미지 편집 작업에서 사용자 의도의 의미 수정 대상을 이해할 수 있게 되었습니다. 이는 편집 벤치마크에서 대부분의 경쟁 제품을 능가할 수 있는 기술적 기반입니다.

BAGEL의 사용자 및 시장 인지도

BAGEL은 ByteDance Seed 팀이 다중 모드 필드를 통합하려는 오픈 소스 시도입니다. 단기간(2025년 5월) 출시되었음에도 불구하고 기술 커뮤니티에서 큰 주목을 받으며 GitHub, HuggingFace, Discord로 구성된 초기 생태계를 형성했습니다.

GitHub 및 HuggingFace 커뮤니티 피드백: 출시 후 2개월 이내에 GitHub는 6,100개 이상의 별과 542개의 포크를 받았으며 HuggingFace 모델 페이지는 1,210개 이상의 좋아요를 받았습니다. 모델 다운로드는 월 평균 약 759회입니다. 웨어하우스는 142개의 이슈와 9개의 풀 요청을 생성했으며 커뮤니티 활동은 ByteDance 오픈 소스 프로젝트 중에서 높은 수준입니다.

커뮤니티 파생 생태계: 출시 후 커뮤니티는 ComfyUI 노드 통합(@neverbiasu), DF11 압축 버전(@LeanModels), INT8 양자화 버전(@Gapeleon), Windows 설치 가이드(@prartio), Docker 이미지(@davideuler, @jnc-nj) 및 여러 타사 HuggingFace Space 데모 인스턴스 등 여러 파생 프로젝트와 도구를 빠르게 기여했습니다. 이 "공식 릴리스 모델 + 커뮤니티 완성 도구 체인" 모델은 BAGEL의 기본 기능이 엔지니어링 커뮤니티에서 인정받았음을 보여줍니다.

산업 벤치마크 성능: 시각적 이해 측면에서 BAGEL은 MMBench(85.0), MMStar(67.2) 및 MathVista(73.1)와 같은 벤치마크에서 Qwen2.5-VL-7B(83.5/67.1/68.2) 및 Janus-Pro-7B(79.2/41.0/50.0)를 능가합니다. Vincent 그래프 차원에서 GenEval의 종합 점수는 0.88(Rewriter/CoT 포함)로 FLUX.1-dev(0.82), SD3-Medium(0.74) 및 Janus-Pro-7B(0.80)를 초과합니다. 이미지 편집 차원에서 ImgEdit-Bench(7.36/6.83/6.52)에서의 BAGEL 성능은 Gemini 2.0(6.73/6.61/6.32)과 GPT-4o(7.85/7.62/7.53) 사이입니다. 오픈소스 모델 중 가장 강력한 편집 기능을 갖춘 솔루션 중 하나입니다.

BAGEL의 비용 우위

BAGEL의 비용 구조는 모델 획득 비용, 추론 실행 비용, 미세 조정/사용자 지정 비용의 세 가지 수준으로 나뉩니다. 각 수준의 비용 특성은 크게 다릅니다.

C 측/개인 사용자: 무료 모델, 나만의 컴퓨팅 성능 제공: BAGEL의 모델 가중치는 Apache 2.0 라이선스에 따라 HuggingFace에서 라이선스 비용 없이 무료로 다운로드할 수 있습니다. 그러나 개별 사용자는 추론을 실행하기 위해 자신의 GPU 하드웨어를 가져와야 합니다. 최소 구성에는 12GB VRAM(NF4 4비트 양자화 사용)이 필요하며 32GB+ VRAM이 권장됩니다. 클라우드 GPU 임대를 예로 들면, 7B 모델의 추론을 실행하려면 약 1×A100-80G 또는 1×RTX 4090이 필요하며 주문형 임대 비용은 시간당 약 5~15위안입니다. 가끔 사용하는 개인 사용자의 경우 이는 각 실험 비용이 몇 위안에서 수십 위안에 이른다는 것을 의미합니다.

개발자/API 통합: 공식 API가 없으므로 자체 추론 서비스를 구축해야 합니다: BAGEL은 현재 호스팅된 상용 API 서비스를 제공하지 않으며 개발자는 자체 추론 엔드포인트를 배포해야 합니다. 배포 옵션에는 HuggingFace Inference Endpoints를 통해 호스팅되거나 자체 애플리케이션 백엔드에 통합된 기본 Gradio WebUI가 포함됩니다. 배포 비용은 주로 추론 하드웨어에 따라 결정됩니다. 단일 카드 A100-80G는 7B 모델의 실시간 추론을 지원할 수 있으며 클라우드 서비스의 월 임대 비용은 5,000~8,000위안입니다. 커뮤니티에서 기여한 양자화 버전(DF11, INT8)은 보다 경제적인 하드웨어에서 실행될 수 있지만 출력 품질은 저하됩니다.

기업/개인 배포: 오픈 소스에 대한 라이선스 비용은 없지만 수동 운영 및 유지 관리가 필요함: 기업은 라이선스 비용을 지불하지 않고도 Apache 2.0 라이선스에 따라 BAGEL을 자유롭게 다운로드, 수정 및 배포할 수 있습니다. 그러나 민영화된 배포의 실제 비용은 다음 세 가지 측면에 반영됩니다. GPU 컴퓨팅 클러스터의 구입 또는 임대 비용(4×A100-80G로 시작하는 것이 좋으며 월 요금은 약 20,000~30,000위안). 모델 미세 조정 및 사용자 정의에 드는 인건비(다중 모드 모델 교육 경험이 있는 엔지니어 필요) 지속적인 버전 업데이트 및 커뮤니티 추적 비용. 상용 폐쇄 소스 솔루션(예: 토큰 입력당 미화 30달러, 토큰 출력당 미화 180달러의 비용이 드는 GPT-4o API)과 비교할 때 BAGEL의 오픈 소스 모델은 고주파 통화 시나리오에서 상당한 비용 이점을 제공하지만 기업에는 이에 상응하는 기술 운영 및 유지 관리 기능이 필요합니다.

비용 차원 BAGEL(오픈 소스 모델) 상용 폐쇄 소스 솔루션(예: GPT-4o API)
모델 라이센스 비용 비용 없음(Apache 2.0) 토큰으로 청구
추론 하드웨어 자신만의 GPU를 가져오세요(월 임대료 5,000~8,000위안부터 시작) 하드웨어 비용 제로
단위 추론 비용 하드웨어 상환액에 따라 다르며 빈도가 높은 시나리오에서는 매우 낮습니다 입력 ~30 USD/백만 토큰, 출력 ~180 USD/백만 토큰
미세 조정/사용자 정의 스스로 미세 조정할 수 있으며 비용은 컴퓨팅 성능 + 인력 미세 조정되지 않음
운영 및 유지관리 인력 요구 사항(모델 배포, 모니터링, 업데이트) 제로 운영 및 유지 관리
데이터 개인정보 보호 완전한 자제력 클라우드 서비스 제공업체 데이터 정책에 대한 의존도

BAGEL의 주요 기능

BAGEL의 역량 라인은 이해에서 생성까지 완전한 시각적 언어 범위를 포괄합니다. 다음 6가지 핵심 기능은 순수 텍스트 모델 또는 순수 생성 모델 간의 주요 차이점입니다.

  • 시각적 이해: 이미지 및 텍스트 입력을 받고 다중 모드 대화를 수행합니다. BAGEL은 이미지 속의 사물과 장면을 인식할 뿐만 아니라 이미지 내의 텍스트, 그래픽, 예술적 스타일 및 문화적 맥락도 이해합니다. MMBench(85.0), MMMU(55.3) 등 종합 이해 벤치마크에서 동일한 매개변수 크기의 Qwen2.5-VL-7B를 능가합니다. 사용 가치: 이미지 콘텐츠 검토, 시각적 질문 및 답변, 교육 자료 해석 및 이미지 의미에 대한 심층적인 이해가 필요한 기타 시나리오에 적합합니다.

  • 텍스트-이미지 생성: 텍스트 설명에서 충실도가 높고 사실적인 이미지를 생성합니다. BAGEL은 자동 회귀 생성을 위한 개별 토큰 시퀀스로 이미지를 표현하기 위해 Next Group of Token Prediction 패러다임을 채택합니다. 전체 GenEval 점수는 0.88(Rewritter/CoT 포함)로 색상, 공간 관계, 개체 수 등 세부적인 차원에서 FLUX.1-dev 및 SD3-Medium보다 우수합니다. 사용 가치: 창의적인 디자인의 초기 단계에서 컨셉 도면을 생성하고, 광고 자료를 빠르게 반복하고, 제품 프로토타입을 시각화하는 데 적합합니다.

  • 지능형 이미지 편집: BAGEL의 가장 눈에 띄는 차별화 기능입니다. BAGEL은 비디오 캐스케이드 데이터에 대한 사전 학습을 통해 얻은 시각적 아이덴티티 보존 능력을 기반으로 자연어 지시를 통해 이미지의 로컬 수정, 객체 교체, 배경 변환 등의 작업을 수행할 수 있으며, 편집된 이미지는 조명, 질감, 원근감 측면에서 원본 이미지와 높은 일관성을 유지합니다. CLIP 점수가 7.36/6.83/6.52인 ImgEdit-Bench의 선도적인 오픈 소스 모델입니다. 사용 가치: 전자상거래 제품 이미지 배경 교체, 인물 사진 수정, 창의적인 광고 사후 조정, 포토샵 등 전문 도구를 배울 필요가 없습니다.

  • 스타일 전송: 입력 이미지를 하나의 시각적 스타일에서 다른 시각적 스타일로 변환하거나(예: 실제 사진에서 3D 애니메이션으로, 유화에서 수채화로) "세계" 전반에 걸쳐 스타일을 변환합니다(예: 실제 장면에서 공상 과학 세계로). 사용 가치: 콘텐츠 제작자, 영화 제작 전 및 TV 컨셉 디자인, 소셜 미디어 특수 효과를 위한 양식화된 일괄 처리.

  • 세계 탐색: BAGEL은 비디오 데이터에서 공간 탐색 기능을 추출하고 현재 원근 이미지를 바탕으로 전달 및 회전과 같은 작업을 수행한 후 다음 프레임을 예측할 수 있습니다. 공상 과학 장면, 예술적인 그림, 다양한 회전 각도에서의 자유로운 탐색에 적합합니다. 사용 가치: 게임 장면 자동 생성, 로봇 시각적 내비게이션 시뮬레이션 VR/AR 콘텐츠 조기 미리보기.

  • 구성 및 사고: 여러 차례의 대화에서 이미지의 지속적인 생성 및 수정을 지원합니다("엘프 소녀 생성 → 젤리캣 인형으로 변환 → 이 인형에 대한 마케팅 슬로건 작성"). 사고 모드를 켠 후 BAGEL은 먼저 자세한 추론 프로세스(<think> 태그 내)를 생성한 다음 추론 결과를 기반으로 보다 정확한 시각적 출력을 생성합니다. 가치 사용: 여러 번의 반복이 필요한 창의적인 작업 흐름, 추론과 계획이 필요한 고정밀 생성 작업입니다.

BAGEL의 모델 및 버전 진화

BAGEL은 내부 연구 프로젝트부터 오픈소스까지 약 2~3개월의 개발 및 검증 주기만 거쳤습니다. 그러나 커뮤니티 생태계의 급속한 성장으로 인해 단기간 내에 풍부한 파생 버전 시스템을 형성할 수 있게 되었습니다.

메인라인 출시

  • BAGEL 베타(~2025-03): ByteDance Seed 팀 내부 연구 단계의 프로토타입 버전으로 확산 모델을 통합하는 탐색 단계에 있습니다. 아직 출판되지 않았으며 공식적인 정확한 날짜는 없습니다.
  • BAGEL-7B-MoT v1.0(2025-05-20): 최초 공개 버전이자 오픈 소스 모델 가중치(HuggingFace), 교육 코드(GitHub), 기술 보고서(arXiv:2505.14683) 및 온라인 데모. Qwen2.5-7B-Instruct 미세 조정을 기반으로 MoT 아키텍처 및 듀얼 인코더 설계를 사용하여 텍스트-이미지 통합 이해 및 생성을 수행합니다.
  • BAGEL-7B-MoT 지속적인 업데이트(2025-05~현재): 관계자는 평가 코드 업데이트(KRIS-Bench, RISEBench, ImgEdit-Bench 평가 스크립트), 교육 가이드(TRAIN.md) 개선, 추론 최적화(MFU 추적 지원, 하드웨어 피크 FLOPS 감지) 등을 포함하여 릴리스 후 활성 코드 유지 관리를 유지합니다. 최신 커밋(a2fa77d)은 2025년 5월입니다.

커뮤니티 파생 버전

BAGEL의 Apache 2.0 라이선스를 사용하면 커뮤니티에서 모델을 자유롭게 배포하고 수정할 수 있으며 짧은 출시 시간 내에 여러 파생 버전이 나타납니다.

버전 유형 기여자 설명
DF11 압축 버전 @LeanModels DF11 형식 압축을 사용하여 저장 및 로드 오버헤드 줄이기
INT8 양자화 버전 @가펠레온 8비트 양자화 버전, 더 낮은 메모리 하드웨어에서 실행 가능
ComfyUI 노드 @neverbiasu ComfyUI 워크플로에서 BAGEL이라고 할 수 있는 ComfyUI-BAGEL 노드
Windows 설치 가이드 @프라티오 Windows 11에서 BAGEL의 전체 설치 및 운영 계획
도커 이미지 @jnc-nj, @davideuler 컨텍스트 구성의 어려움을 줄이기 위해 미리 컴파일된 flash_attn이 포함된 Docker 이미지

이러한 파생 버전은 ByteDance Seed 팀에서 공식적으로 보증하지 않으며 품질과 호환성은 사용자가 직접 평가해야 합니다.

주요 모델 아키텍처 세부정보

BAGEL-7B-MoT의 전체 프레임워크에는 언어 백본(Qwen2.5-7B-Instruct의 Transformer 계층이 MoT로 변환됨), 이중 시각적 인코더(VAE는 픽셀 수준 기능을 제공하고 ViT는 의미 수준 기능을 제공함), 시각적 기능과 언어 기능을 연결하는 프로젝션 계층의 세 가지 주요 구성 요소가 포함되어 있습니다. 훈련은 사전 훈련(대규모 인터리브 다중 모드 데이터), 지속적인 훈련(고품질 정렬 데이터), 감독된 미세 조정(명령 데이터)의 세 단계로 나뉩니다. ImageNet과 같은 표준 벤치마크에서 BAGEL은 훈련 토큰의 양이 증가함에 따라 지속적으로 개선되는 일관된 성능을 보여줍니다.

BAGEL의 기술적 장점

BAGEL의 기술 경로 선택은 두 개의 독립적인 모듈을 "연결"하는 것이 아니라 아키텍처 설계 및 교육 전략의 통합을 통해 단일 모델 내에서 이해와 생성을 모두 수행할 수 있는 이유를 설명합니다.

MoT(Transformer-Experts) 아키텍처: MoT는 BAGEL의 핵심 설계 결정입니다. 전통적인 MoE(Mixture-of-Experts)는 FFN 계층에서 여러 전문가 네트워크를 사용하는 반면, MoT는 Transformer의 전체 계층(주의 및 피드포워드 네트워크 포함)을 전문가 단위로 사용합니다. 이를 통해 다양한 전문가가 차별화된 정보 처리 모드를 학습할 수 있습니다. 일부 전문가는 시각적 토큰 간의 공간적 관계를 처리하는 데 능숙하고 일부 전문가는 언어 토큰의 의미 추론에 능숙합니다. 추론 중에 각 토큰은 상위 2명의 전문가에게만 라우팅되며 활성화 매개변수는 약 7B(총 매개변수 14B)로 추론 효율성을 유지하면서 높은 용량을 유지합니다.

이중 인코더 융합 전략: BAGEL은 VAE(Variational Autoencoder)와 ViT(Visual Transformer)라는 두 가지 시각적 인코더를 사용하여 각각 픽셀 수준 및 의미 수준 특징을 추출합니다. VAE 인코더는 이미지 편집 작업에서 이미지의 구조적 세부 사항을 잘 보존합니다. 이는 수정된 영역의 가장자리, 텍스처 및 조명이 원본 이미지와 원활하게 혼합된다는 것을 의미합니다. ViT 인코더는 이미지의 전반적인 의미를 이해하는 데 능숙합니다. 이를 통해 편집 개체가 "무엇"인지, "어떤 속성을 가져야 하는지"를 모델에 알릴 수 있습니다. 두 가지 특징은 투영 레이어에서 융합된 후 MoT 백본에 입력되어 "픽셀 정확도 + 의미 이해"라는 이중 시각적 신호를 형성합니다. 공식 절제 실험에 따르면 두 인코더 중 하나를 제거하면 편집 품질이 크게 저하되는 것으로 나타났습니다.

토큰 예측 생성 패러다임의 다음 그룹: 토큰별로 토큰을 예측하는 대부분의 자동 회귀 모델과 달리 BAGEL은 그룹 예측(그룹 예측)을 사용하여 매번 여러 연속 토큰(그룹)을 예측합니다. 이는 추론 단계 수를 늘리지 않고도 생성 처리량을 향상시키는 동시에 각 토큰 그룹의 내부 상관 관계를 통해 생성된 이미지에 더 나은 로컬 일관성을 제공합니다. Flow Matching 훈련 목표의 확산 손실과 결합하여 BAGEL은 텍스트-이미지 생성 품질에서 전용 확산 모델과 경쟁할 수 있는 수준에 도달합니다.

비디오 캐스케이드 데이터가 제공하는 새로운 기능: BAGEL은 대규모 인터리브 비디오 데이터에 대해 사전 학습되었습니다. 비디오 프레임 간의 시간적 일관성으로 인해 모델은 "시각적 정체성 보존", 즉 동일한 객체가 다양한 시야각, 조명 및 자세에서 동일한 외관을 유지하는 능력을 학습하게 됩니다. 이 기능은 이미지 편집 시나리오로 직접 전송되므로 BAGEL은 일관된 ID를 유지하면서 이미지 콘텐츠(예: 개체 교체, 작업 변경)를 크게 수정할 수 있습니다. 공식 실험에 따르면 훈련 토큰의 양이 늘어날수록 이해, 생성, 기본 편집, 지능형 편집 기능이 순서대로 등장하는 것으로 나타났습니다. 그 중 '지능형 편집'(사용자의 의도를 이해한 후 창의적인 수정이 필요한)이 최근 등장하는 능력이자 BAGEL과 순수 생성 모델의 핵심 차이점이기도 하다.

성능 및 처리량 참조: BAGEL은 공식적으로 정확한 추론 지연 시간 데이터(TTFT/TPM)를 공개하지 않습니다. 실제 성능은 하드웨어 구성 및 양자화 방식에 따라 달라집니다. BAGEL-7B-MoT(BF16)를 참조로 실행하는 단일 카드 A100-80G를 사용하면 텍스트-이미지 생성의 단일 추론 시간은 대략 5~15초 범위입니다(이미지 해상도 및 노이즈 제거 단계에 따라 다름). NF4 양자화 기능을 갖춘 RTX 4090(24GB VRAM)에서 실행하면 추론 지연 시간이 30~50% 늘어납니다. 일괄 처리 시나리오에서는 일괄 처리 크기를 늘려 처리량을 선형적으로 향상시킬 수 있지만 비디오 메모리의 상한에 주의해야 합니다.

경계에는 적합하지 않음: BAGEL은 매우 긴 텍스트 이해가 필요한 시나리오(예: 백만 토큰 문서 분석)에는 적합하지 않습니다. 비디오 생성을 지원하지 않습니다(단일 프레임 예측만 지원). 중국의 이해 능력은 특별히 최적화되지 않았으며 주로 기본 모델 Qwen2.5-7B의 중국 능력에서 계승되었습니다. 상용 API 또는 SLA 보증을 제공하지 않습니다. 고해상도 이미지 생성(>1024×1024)에 대한 지원이 제한되어 있습니다.

베이글 사용 방법

BAGEL의 사용 경로는 로컬 배포와 온라인 경험으로 구분됩니다. 현재 호스팅된 상용 API 서비스를 제공하지 않습니다.

사용 방법 사람들에게 적합 특징 비용
공식 온라인 데모 빠른 사용자 경험 deco.bagel-ai.org를 방문하세요. 로컬 GPU가 필요하지 않습니다 무료
허깅페이스 스페이스 빠른 평가판 사용자 hf.co/spaces/ByteDance-Seed/BAGEL 방문 무료(HF 할당량 제한 적용)
로컬 Gradio WebUI 개발자/심층 사용자 로컬 GPU 실행, 전체 기능 액세스 자신만의 GPU 하드웨어를 가져오세요
로컬 명령줄 추론 개발자/연구원 inference.ipynb 또는 inferencer.py를 통해 호출됨 자신만의 GPU 하드웨어를 가져오세요
자체 구축 추론 서비스 엔터프라이즈/통합 요구 사항 API 엔드포인트로 캡슐화되어 자체 시스템에 통합됨 자체 GPU 하드웨어 준비 + 운영 및 유지 관리

로컬 빠른 배포(Gradio WebUI):

``배쉬

1. 저장소를 복제하고 종속성을 설치합니다.

자식 클론 https://github.com/bytedance-seed/BAGEL.git CD 베이글 conda create -n 베이글 python=3.10 -y 콘다 활성화 베이글 pip 설치 -r 요구사항.txt pip install flash_attn==2.5.8 --no-build-isolation

2. 모델 가중치 다운로드(Python 스크립트)

파이썬 -c " Huggingface_hub에서 snapshot_download 가져오기 save_dir = '모델/BAGEL-7B-MoT' snapshot_download( local_dir=save_dir, repo_id='ByteDance-Seed/BAGEL-7B-MoT', local_dir_use_symlinks=거짓, 이력서_다운로드=사실, allow_patterns=['.json', '.safetensors', '.bin', '.py', '.md', '.txt'] ) "

3. Gradio WebUI 시작

python app.py # 32GB+ VRAM 또는 다중 GPU python app.py --mode 2 --zh # 22~32GB VRAM, INT8 양자화 권장, 중국어 인터페이스 python app.py --mode 3 # 12~22GB VRAM, NF4 양자화 권장


**추론 매개변수 설명**: BAGEL은 생성 동작을 제어하기 위해 조정 가능한 여러 추론 하이퍼 매개변수를 제공합니다. `cfg_text_scale`(4.0~8.0 권장)은 모델이 텍스트 단서를 얼마나 강력하게 따르는지 제어합니다. `cfg_image_scale`(권장 1.0-2.0)은 입력 이미지의 세부 정보가 얼마나 보존되는지 제어합니다. `cfg_interval`(`[0.4, 1.0]` 권장)은 CFG가 적용하는 노이즈 제거 단계의 비율을 제어합니다. 'timestep_shift'는 노이즈 제거 단계 수의 분포 이동을 제어합니다(값이 높을수록 이전 단계 수가 많아져 레이아웃에 영향을 미치고, 값이 낮을수록 후속 단계 수가 많아져 세부 정보가 향상됩니다). 'num_timesteps'(권장 50)는 총 노이즈 제거 단계 수를 제어합니다.

**API 빠른 참조**: BAGEL은 표준 REST API를 제공하지 않지만 inferencer.py를 기반으로 사용자 정의 추론 서비스를 캡슐화할 수 있습니다. 다음은 기본 Python 호출 패턴입니다.

``파이썬
추론기 가져오기 BagelInferencer에서

모델 = 베이글인퍼런스(
    model_path="모델/BAGEL-7B-MoT",
    dtype="bf16",
    tantize=None # "nf4" 또는 "int8"로 설정할 수 있습니다.
)

# 시각적 이해
응답 = model.chat(
    이미지="경로/to/image.jpg",
    text="이 이미지를 자세히 설명하세요."
)

# 텍스트를 이미지로 생성
이미지 = model.generate(
    프롬프트="우주복을 입고 화성에 서 있는 고양이의 사실적인 사진",
    cfg_text_scale=6.0,
    num_timesteps=50
)

ComfyUI 통합: 커뮤니티 기부 ComfyUI 노드(ComfyUI-BAGEL)를 사용하면 ComfyUI 워크플로 내에서 BAGEL의 생성 및 편집 기능을 호출할 수 있습니다. 설치 방법은 github.com/neverbiasu/ComfyUI-BAGEL의 지침을 참조하세요.

베이글 제품 가격

BAGEL에는 현재 상용 가격 시스템이 없으며, 사용 비용은 전적으로 사용자의 하드웨어 선택 및 배포 방법에 따라 결정됩니다.

모델 획득 비용: 비용이 0입니다. BAGEL 모델 가중치는 Apache 2.0 라이선스에 따라 HuggingFace에 공개적으로 공개되며, 기업, 개인, 개발자는 라이선스 비용을 지불하지 않고 자유롭게 다운로드하여 사용할 수 있습니다. 훈련 코드와 평가 스크립트도 Apache 2.0 라이선스에 따라 GitHub의 오픈 소스입니다.

추론 실행 비용: 하드웨어 구성에 따라 다릅니다. 최저 구성(NF4 양자화, 12GB VRAM)은 소비자급 GPU(예: RTX 3090/4090)로 실행할 수 있으며 단일 카드의 월 임대 비용은 약 2,000~4,000위안입니다. 권장 구성(BF16, 32GB+ VRAM)에는 A100-80G 또는 이에 준하는 컴퓨팅 성능이 필요하며, 클라우드 GPU 월 임대 비용은 5,000~8,000위안입니다. 다중 인스턴스 배포 또는 높은 동시성 시나리오에는 실제 로드를 기반으로 하드웨어의 선형 확장이 필요합니다.

미세 조정 및 맞춤화 비용: BAGEL은 LoRA 기반 또는 전체 매개변수 미세 조정을 지원하지만, 미세 조정을 위해서는 더 높은 하드웨어 구성(4×A100-80G로 시작하는 것이 권장됨)과 전문적인 모델 교육 경험이 필요합니다. 단일 미세 조정 실험의 운영 비용은 수백 위안에서 수천 위안에 이릅니다(데이터 크기 및 훈련 단계 수에 따라 다름). 커뮤니티가 기여한 양자화 버전(DF11, INT8)은 미세 조정을 위한 하드웨어 임계값을 낮출 수 있지만 현재 표준화된 미세 조정 도구 체인은 없습니다.

상용 API와의 비용 비교: 일일 평균 호출량이 100,000회를 초과하는 시나리오의 경우 자체 구축된 BAGEL 추론 서비스의 한계 비용은 상용 API(예: GPT-4o)보다 낮지만 인프라와 운영 및 유지 관리 기능에 대한 일회성 투자가 필요합니다. 평균 일일 호출량이 10,000회 미만인 시나리오의 경우 상용 API의 "종량제" 모델이 전반적인 비용 이점을 더 가질 수 있습니다.

BAGEL의 적용 시나리오

BAGEL의 다중 모드 통합 기능을 통해 콘텐츠 제작, 전자상거래 마케팅, 게임 개발 및 학술 연구의 네 가지 분야에서 직접적인 구현 가치를 입증할 수 있습니다.

  • 컨텐츠 제작 및 디자인 지원: BAGEL의 "이해→생성→편집→이해" 기능은 특히 창의적인 워크플로의 다단계 반복 시나리오에 적합합니다. 예를 들어, 디자이너는 먼저 텍스트를 사용하여 제품 컨셉 맵을 생성한 다음 자연어 편집을 통해 로컬 세부 사항을 수정하고 마지막으로 모델이 생성된 이미지의 품질을 분석하고 개선을 위한 제안을 제시하도록 합니다. 이 프로세스는 여러 도구를 전환하지 않고도 단일 대화로 완료할 수 있습니다. 구현 팁: BAGEL의 출력 해상도는 기본 모델 용량(약 1024×1024)에 의해 제한되며, 이는 초고화질 출력(예: 인쇄급 포스터)이 필요한 최종 제작에는 적합하지 않습니다. 중기 개념 증명 및 영감 탐색에 더 적합합니다.

  • 전자상거래 및 광고물 제작: 전자상거래 현장의 핵심 문제점은 "다중 SKU × 다중 장면 × 다중 스타일"의 재료 조합이 폭발적으로 증가한다는 것입니다. BAGEL의 스타일 마이그레이션 및 이미지 편집 기능은 "하나의 제품 이미지 → N 배경 스타일"의 일괄 확장을 실현하여 단일 SKU의 자재 생산 주기를 며칠에서 몇 시간으로 단축할 수 있습니다. 마케팅 비주얼의 빈번한 변경이 필요한 소셜 미디어 운영 및 대규모 프로모션 페이지 디자인의 경우 BAGEL의 Thinking 모드는 생성된 이미지에 대한 마케팅 카피를 자동으로 작성하여 그래픽과 텍스트의 통합 출력을 달성할 수도 있습니다. 구현 팁: BAGEL에서 생성된 이미지는 브랜드 요소(로고, 표준 색상)를 복원하는 전문 브랜드 디자인 도구만큼 정확하지 않을 수 있습니다. BAGEL 출력을 기본 소재로 사용하고, 이후 단계에서 브랜드 사양을 추가하는 것이 좋습니다.

  • 게임 및 가상 세계 개발: BAGEL의 세계 탐색 및 스타일 전송 기능은 게임 개발자에게 신속한 프로토타입 검증 수단을 제공합니다. 디자이너는 개념적 장면 그래프를 입력하고 모델이 다양한 관점에서 이미지를 예측하도록 하거나("시각적 3D 미리보기"와 동일) 다양한 아트 스타일 간에 빠르게 전환하여 효과를 비교할 수 있습니다. 독립 게임 팀과 프로토타이핑 단계의 경우 컨셉 아트 아웃소싱 비용을 크게 줄일 수 있습니다. 착륙 팁: BAGEL의 월드 내비게이션은 현재 제한된 관점 변경(전진 및 후진 이동, 회전)만 지원하며 완전한 3D 장면의 자유로운 로밍은 지원하지 않습니다. 2D 수평 버전이나 고정 관점 게임 유형에 더 적합합니다.

  • 학술 연구 및 교육: Apache 2.0 라이선스에 따라 라이선스가 부여된 오픈 소스 모델인 BAGEL은 다중 모드 AI 연구를 위한 재현 가능하고 수정 가능한 기준선을 제공합니다. 연구자들은 BAGEL을 기반으로 통합 다중 모드 아키텍처의 확장 법칙, 시각적 의미 융합 전략 및 창발 기능의 트리거 조건을 탐색할 수 있습니다. 교육 분야에서는 BAGEL의 시각적 이해 및 대화 기능을 사용하여 대화형 학습 보조 장치를 구축할 수 있습니다. 예를 들어 학생들은 회로도를 업로드하고 모델을 분석하여 설명 텍스트를 생성하고 주요 구성 요소를 표시합니다. 구현 팁: BAGEL의 중국어 기능은 특별히 최적화되지 않았습니다. 중국어가 주요 언어인 교육 시나리오에서는 영어 입력을 사용하거나 중국어-영어 이중 언어 버전을 직접 미세 조정하는 것이 좋습니다.

BAGEL은 사람들에게 적합합니다

BAGEL의 비상업적 포지셔닝 및 오픈 소스 기술 스택은 즉시 사용 가능한 제품을 찾는 최종 사용자보다는 자체 배포 기능을 갖춘 팀과 연구원에게 더 적합하다고 판단합니다.

  • AI 연구원 및 다중 모드 박사 과정 학생: BAGEL은 현재 오픈 소스 커뮤니티에서 몇 안 되는 통합 다중 모드 모델 중 하나이며, "이해와 생성의 통일", "시각적-의미적 관절 표현" 및 "창발 능력"을 연구하기 위한 이상적인 실험 플랫폼을 제공합니다. Apache 2.0 라이선스는 무료 수정 및 재배포를 허용하며 인용 기준선은 그대로 유지됩니다. 전제 조건: 대규모 모델 훈련 및 추론에 대한 엔지니어링 경험이 필요합니다. 하드웨어 4×A100-80G 이상을 권장합니다.

  • AI 애플리케이션 개발자 및 기업가 팀: 개발자는 BAGEL(예: 스마트 사진 앨범 편집 도구, 전자상거래 디자인 도우미, 교육 콘텐츠 생성기)을 기반으로 수직 시나리오를 위한 다중 모드 애플리케이션을 구축하고 동일한 추론 파이프라인에서 시각적 이해 및 생성 기능을 동시에 확보하여 여러 독립 모델 통합으로 인해 발생하는 엔지니어링 복잡성 및 지연 중첩을 방지할 수 있습니다. 전제 조건: 모델 배포 및 API 캡슐화 기능이 필요합니다. 비즈니스 모델에서 GPU 비용의 지속 가능성을 평가하는 것이 좋습니다.

  • 콘텐츠 제작자 및 디자이너(기술): 명령줄과 Python에 익숙한 제작자는 BAGEL의 Gradio WebUI를 직접 사용하여 로컬 제작을 수행할 수 있으며 무제한 무료 생성 시간과 완전한 데이터 개인정보 보호(로컬 실행)를 누릴 수 있습니다. 클라우드 서비스에 비해 로컬 배포에는 일회성 하드웨어 투자가 필요하지만 장기 사용 비용이 저렴하고 서비스 제공업체의 콘텐츠 검토 정책이 적용되지 않습니다. 전제 조건: 자체 GPU 하드웨어를 가져와야 합니다(RTX 4090 이상 권장). 기본적인 명령줄 작업 기능이 필요합니다.

  • 부적합한 사용자: BAGEL은 다음 네 가지 유형의 사용자에게 적합하지 않습니다. - ① 즉시 사용을 추구하는 비기술적 사용자(BAGEL에는 모바일 앱도 없고 관리되는 API도 없으며 직접 배포해야 함) ② 상용급 SLA 및 고객 지원이 필요한 기업(BAGEL은 공식적인 기술 지원이 없는 커뮤니티 기반 오픈 소스 프로젝트입니다.) ③ 비디오 생성 또는 긴 비디오 이해 기능이 필요한 사용자(BAGEL 타이밍 기능은 단일 프레임 예측 및 단거리 탐색으로 제한됩니다) ④ 초고품질의 중국어 출력이 필요한 사용자(BAGEL의 중국어 기능은 기본 모델인 Qwen2.5에서 나온 것으로 중국어 장면에 맞게 특별히 미세 조정되지 않았습니다.)

요약 및 전망

통합 다중 모드 모델 분야에서 BAGEL의 핵심 역량과 현재의 한계는 매우 분명합니다. 가치 제안과 위험 특성은 다음과 같습니다.

핵심 역량: BAGEL은 동일한 아키텍처에서 "이해 + 생성 + 편집"의 세 가지 주요 기능을 실현하는 현재 오픈 소스 커뮤니티에서 매우 소수의 다중 모드 모델 중 하나입니다. MoT 아키텍처와 듀얼 인코더 전략은 기술 측면에서 미래 지향적입니다. 여러 전용 모델을 "접합"하는 데 의존하지 않고 교육 전략을 사용하여 단일 모델이 다차원 기능을 발휘할 수 있도록 합니다. 이미지 편집의 핵심 부문에서 BAGEL의 오픈 소스 성능은 상용 API를 사용할 수 없는 데이터에 민감한 시나리오(의료 영상, 규정 준수 검토, 내부 디자인 시스템)에 상당한 가치가 있는 폐쇄 소스 비즈니스 모델(GPT-4o, Gemini 2.0) 수준에 가깝거나 도달합니다.

현재 제한 사항: BAGEL은 아직 오픈 소스 프로젝트의 초기 단계에 있으며 엔지니어링 성숙도, 문서 완성도 및 생태학적 도구 체인 측면에서 성숙한 프로젝트와 격차가 있습니다. GitHub 리포지토리에는 공식적인 릴리스 릴리스 프로세스가 없으며 버전 관리가 불투명합니다. 공무원은 상용 API 및 지원 서비스를 제공하지 않으며 기업은 전적으로 자체 기술 역량에 의존합니다. 모델의 중국어 기능, 고해상도 출력 및 비디오 생성 기능에는 모두 단점이 있습니다. 커뮤니티가 제공하는 파생 버전의 품질은 고르지 않으며 공식적인 검증 메커니즘이 부족합니다.

기술 진화 방향: Seed 팀이 arXiv 논문에서 공개한 확장 법칙 분석에 따르면 BAGEL은 더 많은 훈련 토큰을 통해 지속적으로 성능 개선 추세를 보여줍니다. 주목할만한 후속 진화 방향에는 고해상도 생성 기능 확장, 비디오 생성 기능 도입(비디오 캐스케이드 데이터가 이 방향의 기반을 마련함), 중국어 및 다국어 기능의 특수 최적화, 보다 효율적인 추론 가속 솔루션(예: 추측 디코딩, 병렬 생성)이 포함됩니다.

조달 및 채택 위험 평가: 자체 배포 능력과 기술팀을 갖춘 기관의 경우 BAGEL의 저위험 채택 경로는 다음과 같습니다. - ① 단일 카드 A100-80G 또는 RTX 4090에서 PoC 검증 핵심 시나리오를 구축합니다(이미지 편집 및 Wensheng 다이어그램으로 시작하는 것이 좋습니다). ② Tencent Hunyuan, Zhipu GLM-4V 등 국내 오픈소스 멀티모달 모델과 수평적 비교를 통해 비즈니스 시나리오에서의 실제 효과를 평가합니다. ③ 검증을 통과하면 멀티 인스턴스 배포 및 미세 조정 커스터마이징으로 확장 가능합니다. 주의해야 할 세 가지 규정 준수 검사가 있습니다. Apache 2.0 라이센스에 따라 파생 모델을 교육할 때 원본 저작권 설명을 유지해야 합니다. 귀하는 BAGEL에서 생성된 상업용 콘텐츠를 사용할 때 콘텐츠 규정 준수에 대한 책임을 져야 합니다. 모델은 Qwen2.5를 기반으로 미세 조정되었으며 Tongyi Qianwen의 추가 사용 약관을 준수해야 합니다. GPU 인프라가 없거나 대규모 모델을 운영 및 유지 관리할 능력이 부족한 팀의 경우 관리형 API를 갖춘 상용 다중 모드 솔루션에 우선순위를 두는 것이 좋습니다.

관련 도구: midjourney, stable-diffusion

버전 정보

  • 베이글-7B-MoT :첫 번째 공개 버전, 통합 다중 모드 이해 및 생성 모델, 7B 활성 매개변수/14B 총 매개변수, MoT 아키텍처.
  • 베이글 베타 :내부 테스트 버전이며 아직 공식적인 정확한 날짜는 없습니다.

사용자 후기

  • 후기를 불러오는 중...