BAGEL Gratuit

-

BAGEL est un modèle de base unifié multimodal open source (7B paramètres actifs/14B paramètres totaux) par l'équipe ByteDance Seed. Il est basé sur l'architecture Mixture-of-Transformer-Experts (MoT) et intègre la compréhension visuelle, la génération de texte en image, l'édition d'images, le transfert de style, la navigation mondiale et les capacités de dialogue combiné à plusieurs tours dans le même modèle. Il surpasse Qwen2.5-VL-7B dans le benchmark de compréhension visuelle, compare la qualité des images Vincent à FLUX.1-dev et ses capacités d'édition d'images sont comparables à celles de Gemini 2.0. Licence Apache 2.0, fournit les pondérations des modèles Gradio WebUI et HuggingFace.

BAGEL Interface du produit

BAGEL

Paramètres de base et statistiques de BAGEL

BAGEL (Bagel AI) est un modèle de base unifié multimodal open source de l'équipe ByteDance Seed. Il se positionne officiellement comme « Modèle unifié pour la compréhension et la génération multimodales ». Il couvre la compréhension visuelle, la génération de texte en image, l'édition d'images, le transfert de style, la navigation dans le monde et le dialogue combiné à plusieurs tours au sein d'un ensemble de poids de modèle. Il ne s’agit pas d’un chatbot indépendant, ni d’un simple générateur d’images, mais d’un modèle de base qui unifie compréhension et génération sous une même architecture.

Projets Informations publiques
Positionnement officiel Modèle unifié pour la compréhension et la génération multimodales
Équipe de développement Équipe Bytedance Seed (Chaorui Deng, Deyao Zhu, Kunchang Li, etc.)
Architecture Mélange d'experts en transformateurs (MoT)
Taille du modèle 7B paramètres actifs / 14B paramètres totaux (15B poids totaux)
Modèle de base Affiné basé sur Qwen2.5-7B-Instruct
Encodeur visuel Double encodeur VAE (niveau de pixel) + ViT (niveau sémantique)
Paradigme Génératif Groupe suivant de prédiction de jetons
Licence Open Source Apache2.0
Étoiles GitHub 6 100+
Fourches GitHub 542
HuggingFace aime 1 210+
Dernière version BAGEL-7B-MoT (2025-05-20)
Langues prises en charge Anglais (principal), la communauté a contribué à l'interface chinoise
Exécuter avec le contexte 12 Go+ de VRAM (quantification NF4), 32 Go+ recommandés

Signification réelle de la conception à double encodeur : L'encodeur VAE est responsable de la capture des détails au niveau des pixels (texture, bords, dégradés de couleurs) et l'encodeur ViT est responsable de l'extraction des caractéristiques au niveau sémantique (catégories d'objets, relations de scène, atmosphère émotionnelle). La collaboration entre les deux permet à BAGEL de conserver la structure fine de l'image originale et de comprendre l'objectif de modification sémantique dans l'intention de l'utilisateur dans les tâches d'édition d'images - c'est la base technique qui lui permet de surpasser la plupart des produits concurrents dans les tests d'édition.

Utilisateurs et reconnaissance du marché de BAGEL

BAGEL est une tentative open source de l'équipe ByteDance Seed pour unifier les domaines multimodaux. Bien qu'il ait été publié pendant une courte période (mai 2025), il a suscité une attention considérable dans la communauté technologique et a formé un premier écosystème composé de GitHub, HuggingFace et Discord.

Commentaires de la communauté GitHub et HuggingFace : dans les deux mois suivant sa sortie, GitHub a reçu plus de 6 100 étoiles et 542 forks, et la page de modèle HuggingFace a reçu plus de 1 210 likes. Les téléchargements de modèles sont en moyenne environ 759 fois par mois. L'entrepôt a généré 142 problèmes et 9 pull request, et l'activité de la communauté est à un niveau élevé parmi les projets open source ByteDance.

Écosystème dérivé de la communauté : après la sortie, la communauté a rapidement contribué à plusieurs projets et outils dérivés : intégration de nœuds ComfyUI (@jamarbiasu), version compressée DF11 (@LeanModels), version quantifiée INT8 (@Gapeleon), guide d'installation Windows (@prartio), image Docker (@davideuler, @jnc-nj) et plusieurs instances de démonstration tierces de HuggingFace Space. Ce modèle de « modèle de version officielle + chaîne d'outils de complétion communautaire » montre que les capacités de base de BAGEL ont été reconnues par la communauté des ingénieurs.

Performance de référence de l'industrie : dans la dimension de compréhension visuelle, BAGEL surpasse Qwen2.5-VL-7B (83,5/67,1/68,2) et Janus-Pro-7B (79,2/41,0/50,0) sur des références telles que MMBench (85,0), MMStar (67,2) et MathVista (73,1). Dans la dimension du graphique Vincent, le score global de GenEval est de 0,88 (y compris Rewriter/CoT), dépassant FLUX.1-dev (0,82), SD3-Medium (0,74) et Janus-Pro-7B (0,80). Dans la dimension d'édition d'images, les performances de BAGEL sur ImgEdit-Bench (7,36/6,83/6,52) se situent entre Gemini 2.0 (6,73/6,61/6,32) et GPT-4o (7,85/7,62/7,53). C'est l'une des solutions dotées des capacités d'édition les plus puissantes parmi les modèles open source.

L'avantage de coût de BAGEL

La structure des coûts de BAGEL est divisée en trois niveaux : coût d'acquisition du modèle, coût de fonctionnement de l'inférence et coût de réglage/personnalisation. Les caractéristiques de coût de chaque niveau sont très différentes.

Côté C/Utilisateurs individuels : modèles gratuits, apportez votre propre puissance de calcul : les poids des modèles BAGEL sont disponibles en téléchargement gratuit sur HuggingFace sous la licence Apache 2.0, sans aucun frais de licence. Cependant, les utilisateurs individuels doivent apporter leur propre matériel GPU pour exécuter l'inférence. La configuration minimale nécessite 12 Go de VRAM (en utilisant la quantification NF4 4 bits), 32 Go+ de VRAM recommandés. En prenant la location de GPU cloud comme exemple, l'exécution de l'inférence du modèle 7B nécessite environ 1 × A100-80G ou 1 × RTX 4090, et le coût de location à la demande est d'environ 5 à 15 yuans/heure. Pour les utilisateurs individuels qui l'utilisent occasionnellement, cela signifie que le coût de chaque expérience varie de quelques yuans à des dizaines de yuans.

Intégration développeur/API : pas d'API officielle, vous devez créer votre propre service d'inférence : BAGEL ne fournit actuellement pas de services d'API commerciaux hébergés et les développeurs doivent déployer leurs propres points de terminaison d'inférence. Les options de déploiement incluent l'interface Web Gradio native, hébergée via HuggingFace Inference Endpoints ou intégrée dans votre propre backend d'application. Le coût de déploiement est principalement déterminé par le matériel d'inférence : une seule carte A100-80G peut prendre en charge l'inférence en temps réel des modèles 7B, et la location mensuelle des services cloud est de 5 000 à 8 000 yuans. Les versions quantifiées (DF11, INT8) fournies par la communauté peuvent fonctionner sur du matériel plus économique, mais la qualité de sortie sera compromise.

Déploiement en entreprise/privé : aucun frais de licence pour l'open source, mais opération et maintenance manuelles requises : les entreprises peuvent librement télécharger, modifier et déployer BAGEL sous la licence Apache 2.0 sans payer de frais de licence. Cependant, le coût réel d'un déploiement privatisé se reflète dans trois aspects : le coût d'achat ou de location d'un cluster de calcul GPU (il est recommandé de commencer avec 4×A100-80G, avec un tarif mensuel d'environ 20 000 à 30 000 yuans) ; le coût de la main-d'œuvre pour le réglage fin et la personnalisation du modèle (des ingénieurs ayant une expérience en formation sur les modèles multimodaux sont requis) ; et le coût des mises à jour continues des versions et du suivi de la communauté. Comparé aux solutions commerciales à source fermée (telles que l'API GPT-4o, qui coûte environ 30 $ US/million de jetons en entrée et 180 $ US/million de jetons en sortie), le modèle open source de BAGEL présente des avantages de coût significatifs dans les scénarios d'appels à haute fréquence, mais il nécessite que les entreprises disposent des capacités techniques d'exploitation et de maintenance correspondantes.

Dimension du coût BAGEL (modèle open source) Solutions commerciales fermées (telles que l'API GPT-4o)
Modèle de redevance de licence Zéro coût (Apache 2.0) Facturé par jeton
Matériel d'inférence Apportez votre propre GPU (loyer mensuel à partir de 5 000 à 8 000 yuans) Coût matériel nul
Coût d'inférence unitaire Dépend de l'amortissement du matériel, extrêmement faible dans les scénarios à haute fréquence Entrée ~ 30 USD/million de jetons, sortie ~ 180 USD/million de jetons
Mise au point/personnalisation Peut être affiné par vous-même, le coût est la puissance de calcul + la main-d'œuvre Pas affiné
Main d'œuvre d'exploitation et de maintenance Exigences (déploiement du modèle, surveillance, mise à jour) Zéro opération et maintenance
Confidentialité des données Maîtrise de soi complète Dépendance à la politique de données du fournisseur de services cloud

Principales fonctions de BAGEL

La gamme de capacités de BAGEL couvre toute la gamme visuo-linguistique, de la compréhension à la génération. Les six fonctionnalités principales suivantes constituent les principales différences entre celui-ci et les modèles de texte pur ou les modèles génératifs purs.

  • Compréhension visuelle : recevez des entrées d'images et de texte et menez des conversations multimodales. BAGEL reconnaît non seulement les objets et les scènes dans les images, mais comprend également le texte, les graphiques, le style artistique et le contexte culturel de l'image. Il surpasse Qwen2.5-VL-7B de la même ampleur de paramètre sur des tests de compréhension complets tels que MMBench (85,0) et MMMU (55,3). Valeur d'usage : convient à l'examen du contenu des images, aux questions et réponses visuelles, à l'interprétation du matériel pédagogique et à d'autres scénarios nécessitant une compréhension approfondie de la sémantique des images.

  • Génération de texte en image : générez des images photoréalistes haute fidélité à partir de descriptions de texte. BAGEL adopte le paradigme Next Group of Token Prediction pour représenter les images sous forme de séquences de jetons discrètes pour la génération autorégressive. Le score global de GenEval est de 0,88 (avec Rewriter/CoT), ce qui est meilleur que FLUX.1-dev et SD3-Medium dans des dimensions fines telles que la couleur, la relation spatiale et le nombre d'objets. Valeur d'usage : convient à la génération de dessins conceptuels dès les premières étapes de la conception créative, à l'itération rapide de supports publicitaires et à la visualisation de prototypes de produits.

  • Édition d'images intelligente : la capacité différenciée la plus importante de BAGEL. Basé sur la capacité de préservation de l'identité visuelle obtenue par pré-entraînement sur les données de cascade vidéo, BAGEL peut effectuer des opérations telles que la modification locale, le remplacement d'objets et la transformation d'arrière-plan des images via des instructions en langage naturel, et l'image éditée reste hautement cohérente avec l'image originale en termes d'éclairage, de texture et de perspective. Principaux modèles open source sur ImgEdit-Bench avec des scores CLIP de 7,36/6,83/6,52. Valeur d'usage : remplacement de l'arrière-plan de l'image du produit de commerce électronique, modification du portrait, post-ajustement de la publicité créative, pas besoin d'apprendre des outils professionnels tels que Photoshop.

  • Transfert de style : convertissez l'image d'entrée d'un style visuel à un autre (comme de vraies photos en animation 3D, de la peinture à l'huile en aquarelle) ou transfert de style à travers des "mondes" (comme des scènes réelles vers le monde de la science-fiction). Valeur d'usage : traitement par lots stylisé pour les créateurs de contenu, conception de concepts pré-cinématographiques et télévisuels et effets spéciaux pour les réseaux sociaux.

  • World Navigation : BAGEL distille les capacités de navigation spatiale à partir de données vidéo et peut prédire l'image suivante après avoir effectué des opérations telles que l'avancement et la rotation, compte tenu de l'image en perspective actuelle. Convient aux scènes de science-fiction, aux peintures artistiques et à la navigation libre sous différents angles de rotation. Valeur d'usage : génération automatique de scènes de jeu, aperçu anticipé du contenu VR/AR de simulation de navigation visuelle de robot.

  • Composition et réflexion : prend en charge la génération et la modification continues d'images lors de plusieurs cycles de dialogue ("Générer une fille elfe → transformer-la en poupée Jellycat → écrire un slogan marketing pour cette poupée"). Après avoir activé le mode Réflexion, BAGEL générera d'abord un processus de raisonnement détaillé (dans la balise « »), puis générera une sortie visuelle plus précise basée sur les résultats du raisonnement. Valeur d'usage : flux de travail créatifs qui nécessitent plusieurs itérations, tâches de génération de haute précision qui nécessitent un raisonnement et une planification.

Evolution du modèle et de la version de BAGEL

BAGEL n'a suivi qu'un cycle de développement et de vérification d'environ 2 à 3 mois, depuis un projet de recherche interne vers l'open source. Cependant, la croissance rapide de l'écosystème communautaire lui a permis de former un riche système de versions dérivées en peu de temps.

Version principale

  • BAGEL beta (~2025-03) : Une version prototype de la phase de recherche interne de l'équipe ByteDance Seed, qui est en phase d'exploration pour unifier le modèle de diffusion. Inédit, pas encore de date officielle précise.
  • BAGEL-7B-MoT v1.0 (20/05/2025) : La première version rendue publique, avec les poids du modèle open source (HuggingFace), le code de formation (GitHub), le rapport technique (arXiv :2505.14683) et la démo en ligne. Basé sur le réglage fin de Qwen2.5-7B-Instruct, utilisant l'architecture MoT et la conception à double encodeur, la compréhension et la génération unifiées texte-image.
  • Mises à jour continues de BAGEL-7B-MoT (2025-05 à aujourd'hui) : les responsables maintiennent une maintenance active du code après la publication, y compris les mises à jour du code d'évaluation (KRIS-Bench, RISEBench, scripts d'évaluation ImgEdit-Bench), les améliorations du guide de formation (TRAIN.md), l'optimisation des inférences (prise en charge du suivi MFU, détection des FLOPS de pointe matérielle), etc. Le dernier commit (a2fa77d) date de mai 2025.

Version dérivée de la communauté

La licence Apache 2.0 de BAGEL permet à la communauté de distribuer et de modifier librement le modèle, avec plusieurs versions dérivées apparaissant peu de temps après la sortie :

Type de version Contributeurs Descriptif
Version compressée DF11 @LeanModels Utiliser la compression au format DF11 pour réduire les frais de stockage et de chargement
Version quantifiée INT8 @Gapéléon Version quantifiée 8 bits, peut fonctionner sur du matériel à mémoire inférieure
Nœud ComfyUI @jamaisbiasu Nœud ComfyUI-BAGEL, qui peut être appelé BAGEL dans le flux de travail ComfyUI
Guide d'installation de Windows @prartio Plan complet d'installation et d'exploitation de BAGEL sous Windows 11
Image Docker @jnc-nj, @davideuler Image Docker avec flash_attn précompilé pour réduire la difficulté de configuration du contexte

Ces versions dérivées ne sont pas officiellement approuvées par l'équipe ByteDance Seed, et la qualité et la compatibilité doivent être évaluées par les utilisateurs eux-mêmes.

Détails clés de l'architecture du modèle

Le cadre global de BAGEL-7B-MoT contient trois composants principaux : l'épine dorsale du langage (la couche Transformer de Qwen2.5-7B-Instruct est transformée en MoT), le double encodeur visuel (VAE fournit des fonctionnalités au niveau des pixels et ViT fournit des fonctionnalités au niveau sémantique) et la couche de projection qui relie les fonctionnalités visuelles et linguistiques. La formation est divisée en trois étapes : la pré-formation (données multimodales entrelacées à grande échelle), la formation continue (données alignées de haute qualité) et la mise au point supervisée (données d'instruction). Sur des benchmarks standards tels qu'ImageNet, BAGEL affiche des performances constantes qui continuent de s'améliorer à mesure que la quantité de jetons de formation augmente.

Les avantages techniques de BAGEL

Le choix de l'itinéraire technique de BAGEL explique pourquoi il peut réaliser à la fois la compréhension et la génération au sein d'un seul modèle - non pas en « fusionnant » deux modules indépendants, mais grâce à l'unification de la conception architecturale et des stratégies de formation.

Architecture mélange de transformateurs-experts (MoT) : MoT est la décision de conception principale de BAGEL. Le MoE traditionnel (mélange d'experts) utilise plusieurs réseaux experts dans la couche FFN, tandis que le MoT utilise toute la couche de Transformer (y compris les réseaux d'attention et de rétroaction) comme unité experte. Cela permet à différents experts d'apprendre des modes de traitement de l'information différenciés : certains experts sont bons dans le traitement de la relation spatiale entre les jetons visuels, et certains experts sont bons dans le raisonnement sémantique des jetons de langage. Lors de l'inférence, chaque jeton est acheminé uniquement vers les 2 meilleurs experts, et les paramètres d'activation sont d'environ 7B (paramètres totaux 14B), maintenant une capacité élevée tout en maintenant l'efficacité du raisonnement.

Stratégie de fusion à double encodeur : BAGEL utilise deux encodeurs visuels, VAE (autoencodeur variationnel) et ViT (transformateur visuel), pour extraire respectivement les caractéristiques au niveau des pixels et au niveau sémantique. Les encodeurs VAE sont efficaces pour préserver les détails structurels d'une image : dans les tâches d'édition d'image, cela signifie que les bords, les textures et l'éclairage des zones modifiées se fondent parfaitement avec l'image d'origine. L'encodeur ViT est efficace pour comprendre la sémantique globale de l'image - il permet au modèle de savoir "ce qu'est" l'objet d'édition "et "quelles propriétés il devrait avoir". Les caractéristiques des deux sont entrées dans le squelette du MoT après fusion au niveau de la couche de projection, formant un double signal visuel de « précision des pixels + compréhension sémantique ». Les expériences d'ablation officielles montrent que la suppression de l'un ou l'autre encodeur entraîne une baisse significative de la qualité d'édition.

Paradigme de génération du prochain groupe de prédiction de jetons : contrairement à la plupart des modèles autorégressifs qui prédisent jeton par jeton, BAGEL utilise la prédiction de groupe (Group Prediction) - prédisant plusieurs jetons consécutifs (un groupe) à chaque fois. Cela améliore le débit de génération sans augmenter le nombre d'étapes d'inférence, tandis que la corrélation interne de chaque groupe de jetons confère aux images générées une meilleure cohérence locale. Couplé à la perte de diffusion de la cible d'entraînement Flow Matching, BAGEL atteint un niveau compétitif avec les modèles de diffusion dédiés dans la qualité de génération texte-image.

Capacités émergentes apportées par les données en cascade vidéo : BAGEL est pré-entraîné sur les données vidéo entrelacées à grande échelle. La cohérence temporelle entre les images vidéo oblige le modèle à apprendre la « préservation de l'identité visuelle », c'est-à-dire la capacité du même objet à conserver la même apparence sous différents angles de vision, éclairage et postures. Cette capacité est transférée directement aux scénarios d'édition d'images, permettant à BAGEL de modifier considérablement le contenu de l'image (par exemple, remplacer des objets, modifier des actions) tout en conservant une identité cohérente. Les expériences officielles montrent qu'à mesure que le nombre de jetons de formation augmente, les capacités de compréhension, de génération, d'édition de base et d'édition intelligente émergent dans l'ordre. Parmi eux, « l'édition intelligente » (qui nécessite une modification créative après avoir compris l'intention de l'utilisateur) est la dernière capacité à apparaître, et constitue également la différence fondamentale entre BAGEL et les modèles génératifs purs.

Référence de performances et de débit : BAGEL ne divulgue officiellement pas de données précises sur la latence d'inférence (TTFT/TPM). Les performances réelles dépendent de la configuration matérielle et du schéma de quantification. En prenant comme référence une seule carte A100-80G exécutant BAGEL-7B-MoT (BF16), le temps d'inférence unique de génération texte-image est d'environ 5 à 15 secondes (en fonction de la résolution de l'image et des étapes de débruitage). Fonctionner sur RTX 4090 (24 Go de VRAM) avec quantification NF4 augmente la latence d'inférence de 30 à 50 %. Dans les scénarios de traitement par lots, le débit peut être amélioré de manière linéaire en augmentant la taille du lot, mais il convient de prêter attention à la limite supérieure de la mémoire vidéo.

Ne convient pas aux limites : BAGEL ne convient pas aux scénarios qui nécessitent une compréhension de texte ultra longue (comme l'analyse d'un million de jetons) ; ne prend pas en charge la génération vidéo (prend uniquement en charge la prédiction d'une seule image) ; la capacité de compréhension chinoise n'a pas été spécialement optimisée et est principalement héritée de la capacité chinoise du modèle de base Qwen2.5-7B ; ne fournit pas de garantie commerciale API ou SLA ; a une prise en charge limitée pour la génération d'images haute résolution (> 1024 × 1024).

COMMENT UTILISER LE BAGEL

Les chemins d'utilisation de BAGEL sont divisés en déploiement local et expérience en ligne. Actuellement, il ne fournit pas de services API commerciaux hébergés.

Comment utiliser Convient aux personnes Caractéristiques Coût
Démo officielle en ligne Expérience utilisateur rapide Visitez demo.bagel-ai.org, aucun GPU local requis Gratuit
Espace câlin visage Utilisateurs d'essai rapide Visitez hf.co/spaces/ByteDance-Seed/BAGEL Gratuit (sous réserve de la limite du quota HF)
Interface utilisateur Web Gradio locale Développeur/Utilisateur approfondi GPU local en cours d'exécution, accès complet aux fonctionnalités Apportez votre propre matériel GPU
Inférence de ligne de commande locale Développeurs/chercheurs Appelé via inference.ipynb ou inferencer.py Apportez votre propre matériel GPU
Service d'inférence auto-construit Exigences d'entreprise/intégration Encapsulé en tant que point de terminaison API, intégré dans votre propre système Préparez votre propre matériel GPU + exploitation et maintenance

Déploiement rapide local (Gradio WebUI) :

# 1. Clonez le référentiel et installez les dépendances
clone git https://github.com/bytedance-seed/BAGEL.git
CD BAGEL
conda create -n bagel python=3.10 -y
conda active le bagel
pip install -r exigences.txt
pip install flash_attn==2.5.8 --no-build-isolation

# 2. Télécharger les poids du modèle (script Python)
python -c "
depuis huggingface_hub importer snapshot_download
save_dir = 'modèles/BAGEL-7B-MoT'
téléchargement_instantané(
    local_dir=save_dir,
    repo_id='ByteDance-Seed/BAGEL-7B-MoT',
    local_dir_use_symlinks=False,
    curriculum vitae_download=Vrai,
    allow_patterns=['*.json', '*.safetensors', '*.bin', '*.py', '*.md', '*.txt']
)
"

# 3. Démarrez Gradio WebUI
python app.py # 32 Go+ de VRAM ou plusieurs GPU
python app.py --mode 2 --zh # 22~32 Go de VRAM, quantification INT8 recommandée, interface chinoise
python app.py --mode 3 # 12 ~ 22 Go de VRAM, la quantification NF4 est recommandée

Description des paramètres d'inférence : BAGEL fournit plusieurs hyperparamètres d'inférence réglables pour contrôler le comportement de génération. cfg_text_scale (recommandé 4.0-8.0) contrôle la mesure dans laquelle le modèle suit les indices textuels ; cfg_image_scale (recommandé 1.0-2.0) contrôle la quantité de détails de l'image d'entrée qui sont préservés ; cfg_interval (recommandé [0.4, 1.0]) contrôle la proportion d'étapes de débruitage appliquées par CFG ; timestep_shift contrôle le débruitage Le décalage de distribution du nombre d'étapes (plus la valeur est élevée, plus le nombre d'étapes précédentes, affectant la disposition ; plus la valeur est faible, plus le nombre d'étapes suivantes est élevé, ce qui améliore les détails) ; num_timesteps (recommandé 50) contrôle le nombre total d'étapes de débruitage.

Référence rapide de l'API : BAGEL ne fournit pas d'API REST standard, mais peut encapsuler des services d'inférence personnalisés basés sur inferencer.py. Voici un modèle d'appel Python de base :

à partir de l'importation de l'inférence BagelInferencer

modèle = BagelInferencer (
    model_path="modèles/BAGEL-7B-MoT",
    dtype="bf16",
    quantize=Aucun # Peut être réglé sur "nf4" ou "int8"
)

# compréhension visuelle
réponse = modèle.chat(
    image="chemin/vers/image.jpg",
    text="Décrivez cette image en détail."
)

# Génération de texte en image
image = modèle.generate(
    prompt="Une photo photoréaliste d'un chat portant une combinaison spatiale, debout sur Mars",
    cfg_text_scale=6.0,
    num_timesteps=50
)

Intégration ComfyUI : un nœud ComfyUI fourni par la communauté (ComfyUI-BAGEL) permet d'appeler les capacités de génération et d'édition de BAGEL dans les flux de travail ComfyUI. Veuillez vous référer aux instructions sur github.com/jamais/ComfyUI-BAGEL pour la méthode d'installation.

PRIX DES PRODUITS BAGEL

BAGEL ne dispose actuellement pas d'un système de tarification commerciale et son coût d'utilisation est entièrement déterminé par la sélection du matériel et la méthode de déploiement de l'utilisateur.

Coût d'acquisition du modèle : coût nul. Les poids des modèles BAGEL sont rendus publics sur HuggingFace sous la licence Apache 2.0, et les entreprises, les particuliers et les développeurs peuvent les télécharger et les utiliser librement sans payer de frais de licence. Le code de formation et les scripts d'évaluation sont également open source sur GitHub sous la licence Apache 2.0.

Coût de fonctionnement de l'inférence : dépend de la configuration matérielle. La configuration la plus basse (quantification NF4, 12 Go de VRAM) peut être exécutée avec un GPU grand public (tel que RTX 3090/4090), et le coût de location mensuel d'une seule carte est d'environ 2 000 à 4 000 yuans. La configuration recommandée (BF16, 32 Go + VRAM) nécessite A100-80G ou une puissance de calcul équivalente, et la location mensuelle du GPU cloud coûte entre 5 000 et 8 000 yuans. Le déploiement multi-instance ou les scénarios de concurrence élevée nécessitent une expansion linéaire du matériel en fonction de la charge réelle.

Coûts de réglage fin et de personnalisation : BAGEL prend en charge le réglage fin basé sur LoRA ou tous les paramètres, mais le réglage fin nécessite une configuration matérielle plus élevée (recommandé pour commencer avec 4 × A100-80G) et une expérience de formation de modèle professionnelle. Le coût de fonctionnement d’une seule expérience de réglage fin varie de centaines à plusieurs milliers de yuans (en fonction de la taille des données et du nombre d’étapes de formation). Les versions quantifiées (DF11, INT8) fournies par la communauté peuvent abaisser le seuil matériel pour un réglage fin, mais il n'existe actuellement aucune chaîne d'outils de réglage fin standardisée.

Comparaison des coûts avec les API commerciales : pour les scénarios dans lesquels le volume d'appels quotidien moyen dépasse 100 000 fois, le coût marginal d'un service d'inférence BAGEL auto-construit est inférieur à celui des API commerciales (telles que GPT-4o), mais il nécessite un investissement ponctuel dans l'infrastructure et les capacités d'exploitation et de maintenance. Pour les scénarios dans lesquels le volume d'appels quotidien moyen est inférieur à 10 000 fois, le modèle « paiement à l'utilisation » des API commerciales peut présenter des avantages globaux en termes de coûts.

Scénarios d'application de BAGEL

Les capacités multimodales unifiées de BAGEL lui permettent de démontrer une valeur de mise en œuvre directe dans quatre domaines : la création de contenu, le marketing de commerce électronique, le développement de jeux et la recherche universitaire.

  • Création de contenu et aide à la conception : la fonction « comprendre → générer → modifier → comprendre » de BAGEL la rend particulièrement adaptée aux scénarios d'itérations à plusieurs tours dans les flux de travail créatifs. Par exemple : le concepteur utilise d'abord du texte pour générer une carte conceptuelle de produit, puis modifie les détails locaux via l'édition en langage naturel, et enfin laisse le modèle analyser la qualité de l'image générée et faire des suggestions d'amélioration. Ce processus peut être effectué en une seule conversation sans basculer entre plusieurs outils. Conseils de mise en œuvre : La résolution de sortie de BAGEL est limitée par la capacité du modèle de base (environ 1 024 × 1 024), qui ne convient pas à la production finale nécessitant une sortie ultra haute définition (telle que des affiches de qualité impression). Il est plus adapté à la preuve de concept à moyen terme et à l'exploration de l'inspiration.

  • Production de matériel de commerce électronique et publicitaire : Le principal problème de la scène du commerce électronique est l'explosion des combinaisons de matériaux de « plusieurs SKU × plusieurs scènes × plusieurs styles ». Les capacités de migration de style et d'édition d'images de BAGEL peuvent réaliser une expansion par lots de « une image de produit → N styles d'arrière-plan », raccourcissant le cycle de production de matériaux d'un seul SKU de quelques jours à quelques heures. Pour les opérations sur les réseaux sociaux et la conception de grandes pages de promotion qui nécessitent des changements fréquents dans les visuels marketing, le mode Réflexion de BAGEL peut également rédiger automatiquement une copie marketing pour les images générées, obtenant ainsi une sortie intégrée de graphiques et de texte. Conseils de mise en œuvre : Les images générées par BAGEL peuvent ne pas être aussi précises que les outils de conception de marque spécialisés dans la restauration des éléments de la marque (logos, couleurs standard). Il est recommandé d'utiliser la sortie BAGEL comme matériau de base, puis d'ajouter les spécifications de la marque à un stade ultérieur.

  • Développement de jeux et de mondes virtuels : les capacités de navigation mondiale et de transfert de style de BAGEL offrent aux développeurs de jeux un moyen de vérification rapide des prototypes. Les concepteurs peuvent saisir des graphiques de scène conceptuels et laisser le modèle prédire des images sous différentes perspectives (équivalent à un « aperçu visuel 3D »), ou basculer rapidement entre différents styles artistiques pour comparer les effets. Pour les équipes de jeu indépendantes et la phase de prototypage, cela peut réduire considérablement les dépenses liées à l’externalisation de l’art conceptuel. Conseils d'atterrissage : La navigation mondiale de BAGEL ne prend actuellement en charge que des changements de perspective limités (mouvements avant et arrière, rotation) et ne prend pas en charge l'itinérance libre de scènes 3D complètes. Il est plus adapté à la version horizontale 2D ou aux types de jeux à perspective fixe.

  • Recherche académique et éducation : en tant que modèle open source sous licence Apache 2.0, BAGEL fournit une base de référence reproductible et modifiable pour la recherche multimodale sur l'IA. Les chercheurs peuvent explorer la loi d’échelle de l’architecture multimodale unifiée, les stratégies de fusion sémantique visuelle et les conditions de déclenchement des capacités émergentes basées sur BAGEL. Dans le domaine de l'éducation, les capacités de compréhension visuelle et de dialogue de BAGEL peuvent être utilisées pour créer des assistants d'apprentissage interactifs : par exemple, les étudiants téléchargent un schéma de circuit et le modèle est analysé pour générer un texte d'explication et marquer les composants clés. Conseils de mise en œuvre : les capacités chinoises de BAGEL n'ont pas été spécialement optimisées. Dans les scénarios éducatifs où le chinois est la langue principale, il est recommandé d'utiliser la saisie en anglais ou d'affiner vous-même la version bilingue chinois-anglais.

BAGEL convient aux personnes

Le positionnement non commercial de BAGEL et sa pile technologique open source déterminent qu'il est plus adapté aux équipes et aux chercheurs disposant de capacités d'auto-déploiement, plutôt qu'aux utilisateurs finaux à la recherche de produits prêts à l'emploi.

  • Chercheur en IA et doctorant multimodal : BAGEL est l'un des rares modèles multimodaux unifiés dans la communauté open source actuelle, fournissant une plate-forme expérimentale idéale pour étudier "l'unification de la compréhension et de la génération", la "représentation conjointe visuo-sémantique" et la "capacité émergente". La licence Apache 2.0 permet une modification et une redistribution gratuites, et la base de référence des citations est intacte. Prérequis : Une expérience en ingénierie dans la formation et l'inférence de grands modèles est requise ; le matériel 4 × A100-80G ou supérieur est recommandé.

  • Développeurs d'applications d'IA et équipes entrepreneuriales : les développeurs peuvent créer des applications multimodales pour des scénarios verticaux basés sur BAGEL (tels que des outils d'édition d'albums photo intelligents, des assistants de conception de commerce électronique, des générateurs de contenu éducatif), et simultanément obtenir une compréhension visuelle et des capacités de génération dans le même pipeline de raisonnement, évitant ainsi la complexité d'ingénierie et la superposition de retards causées par l'intégration de plusieurs modèles indépendants. Prérequis : des capacités de déploiement de modèles et d'encapsulation d'API sont requises ; il est recommandé d’évaluer la pérennité des coûts GPU dans le modèle économique.

  • Créateurs et concepteurs de contenu (technique) : les créateurs familiarisés avec la ligne de commande et Python peuvent directement utiliser Gradio WebUI de BAGEL pour la création locale, bénéficiant de temps de génération gratuits illimités et d'une confidentialité totale des données (exécution locale). Par rapport aux services cloud, bien que le déploiement local nécessite un investissement matériel ponctuel, le coût d'utilisation à long terme est inférieur et n'est pas soumis à la politique de révision du contenu du fournisseur de services. Prérequis : Vous devez apporter votre propre matériel GPU (RTX 4090 ou supérieur recommandé) ; des capacités opérationnelles de base en ligne de commande sont requises.

  • Personnes inappropriées : BAGEL ne convient pas aux quatre types d'utilisateurs suivants - ① Utilisateurs non techniques qui recherchent une utilisation prête à l'emploi (BAGEL n'a pas d'application mobile, pas d'API gérée et doit être déployé par vous-même) ; ② Entreprises qui nécessitent un SLA et un support client de qualité commerciale (BAGEL est un projet open source piloté par la communauté sans support technique officiel) ; ③ Utilisateurs qui ont besoin de capacités de génération vidéo ou de compréhension de vidéos longues (BAGEL Les capacités de synchronisation sont limitées à la prédiction d'une seule image et à la navigation à courte portée) ; ④ Utilisateurs qui ont besoin d'une sortie chinoise de très haute qualité (les capacités chinoises de BAGEL proviennent du modèle de base Qwen2.5 et n'ont pas été spécialement optimisées pour les scènes chinoises).

Résumé et Outlook

Les compétences clés de BAGEL et les limites actuelles dans le domaine des modèles multimodaux unifiés sont très claires. Sa proposition de valeur et ses caractéristiques de risque sont les suivantes.

Compétences de base : BAGEL est l'un des très rares modèles multimodaux de la communauté open source actuelle à réaliser les trois capacités majeures : "compréhension + génération + édition" sous la même architecture. L'architecture MoT et la stratégie à double encodeur sont tournées vers l'avenir en termes de technologie : elles ne reposent pas sur « l'épissage » de plusieurs modèles dédiés, mais utilisent des stratégies de formation pour permettre à un modèle unique d'émerger avec des capacités multidimensionnelles. Dans le segment clé de l'édition d'images, les performances open source de BAGEL sont proches ou atteignent le niveau des modèles commerciaux à source fermée (GPT-4o, Gemini 2.0), ce qui est d'une valeur substantielle pour les scénarios sensibles aux données (imagerie médicale, examen de conformité, systèmes de conception internes) qui ne peuvent pas utiliser d'API commerciales.

Limites actuelles : BAGEL en est encore aux premiers stades d'un projet open source, et il existe un écart entre celui-ci et les projets matures en termes de maturité technique, d'exhaustivité de la documentation et de chaîne d'outils écologiques. Le référentiel GitHub n'a pas de processus de publication formel et la gestion des versions est opaque ; le fonctionnaire ne fournit pas d'API commerciales ni de services de support, et les entreprises s'appuient entièrement sur leurs propres capacités techniques ; les capacités de langue chinoise du modèle, la sortie haute résolution et les capacités de génération vidéo présentent toutes des lacunes ; la qualité des versions dérivées fournies par la communauté est inégale et manque de mécanisme de vérification officiel.

Direction de l'évolution technologique : selon l'analyse de la loi de mise à l'échelle divulguée par l'équipe Seed dans l'article arXiv, BAGEL continue de montrer une tendance à l'amélioration des performances avec davantage de jetons de formation. Les orientations d'évolution ultérieures dignes d'attention comprennent : l'expansion des capacités de génération de résolution plus élevée, l'introduction de capacités de génération vidéo (les données en cascade vidéo ont jeté les bases de cette direction), l'optimisation spéciale des capacités chinoises et multilingues et des solutions d'accélération d'inférence plus efficaces (telles que le décodage spéculatif, la génération parallèle).

Évaluation des risques d'approvisionnement et d'adoption : Pour les institutions disposant de capacités d'auto-déploiement et d'équipes techniques, la voie d'adoption à faible risque de BAGEL est la suivante : ① Créer un scénario principal de vérification PoC sur une seule carte A100-80G ou RTX 4090 (il est recommandé de commencer par l'édition d'images et le diagramme Wensheng) ; ② Effectuer une comparaison horizontale avec les modèles multimodaux open source nationaux tels que Tencent Hunyuan et Zhipu GLM-4V pour évaluer l'effet réel dans les scénarios commerciaux ; ③ Si la vérification est réussie, elle peut être étendue au déploiement multi-instance et à la personnalisation fine. Il y a trois contrôles de conformité à noter : lors de la formation de votre propre modèle dérivé sous la licence Apache 2.0, vous devez conserver la déclaration de droit d'auteur originale ; vous devez assumer la responsabilité de la conformité du contenu lorsque vous utilisez du contenu commercial généré par BAGEL ; le modèle est affiné sur la base de Qwen2.5 et doit être conforme aux conditions d'utilisation supplémentaires de Tongyi Qianwen. Pour les équipes sans infrastructure GPU ou n’ayant pas la capacité d’exploiter et de maintenir de grands modèles, il est recommandé de donner la priorité aux solutions multimodales commerciales avec des API managées.

Outils associés : midjourney, stable-diffusion

Informations de version

  • BAGEL-7B-MoT :La première version publique, un modèle de compréhension et de génération multimodal unifié, 7B de paramètres actifs/14B de paramètres totaux, architecture MoT.
  • BAGEL bêta :Version de test interne, pas encore de date officielle précise.

Avis des utilisateurs

  • Chargement des avis...