Gemma 4 12B Gratuit

-

Gemma 4 12B est le grand modèle multimodal open source de Google. Il adopte la première architecture unifiée sans encodeur du secteur et prend en charge la compréhension du texte, des images, de l'audio et de la vidéo ainsi que le raisonnement des agents. Il peut fonctionner localement sur un ordinateur portable doté de 16 Go de mémoire vidéo.

Gemma 4 12B Interface du produit

Gemma 4 12B : le grand modèle multimodal à architecture unifiée sans codeur open source de Google

Paramètres et statistiques de base

Projet Spécifications
Nom du modèle/API Gemma 4 12B
Type de produit Modèle d'IA/API
Formulaire de livraison API / inférence cloud / déploiement local
Longueur du contexte 256 000 jetons (alignement modal complet)
Taille du paramètre 12B (Architecture dense)
Prise en charge modale texte/image/audio/vidéo
Modèle de tarification Gratuit/Coût nul pour l'auto-déploiement (Apache 2.0)
Licence Open Source Apache2.0

Interprétation des paramètres de base : la plus grande différence du Gemma 4 12B est l'architecture unifiée sans encodeur : les modèles multimodaux traditionnels s'appuient sur des encodeurs visuels indépendants (tels que CLIP ViT) pour convertir les images/audio en jetons, puis les envoyer au LLM, tandis que le Gemma 4 12B entre directement les données visuelles et audio dans le squelette du LLM, éliminant ainsi le goulot d'étranglement et la perte d'informations causés par l'encodeur. Une fenêtre contextuelle entièrement modale de 256 Ko signifie que les longues vidéos, les documents de plusieurs pages et les longues sessions audio peuvent tous être traités en un seul passage, sans avoir besoin de troncature de segment. L'échelle de paramètres 12B Dense peut être exécutée sur des GPU grand public (16 Go de VRAM), ce qui est une condition préalable à sa « disponibilité locale ». La licence Apache 2.0 autorise l'utilisation commerciale, la modification et la redistribution sans conditions supplémentaires.

Reconnaissance des utilisateurs et du marché

Après la sortie de Gemma 4 12B, il a rapidement attiré l'attention de la communauté open source et des médias techniques. La raison n'est pas seulement la simplification de l'échelle des paramètres, mais aussi la subversion potentielle du paradigme de conception de modèles multimodaux par une « architecture sans encodeur ». La page de collection de la série Gemma 4 sur HuggingFace montre que la version 12B a été téléchargée des centaines de milliers de fois au cours de la première semaine de sortie, devenant ainsi la première liste de téléchargement de modèles open source au cours de la même période. Les rapports des principaux médias technologiques (discussions de la communauté The Verge, TechCrunch, ArXiv) se concentrent sur trois directions : premièrement, si l'architecture sans encodeur peut reproduire les avantages de performances revendiqués dans des tâches plus en aval ; deuxièmement, la vitesse d'inférence selon laquelle les paramètres 12B sont réellement disponibles sur le matériel grand public ; troisièmement, les performances du modèle dans les langues autres que l'anglais (en particulier le chinois) - parce que Google affirme avoir surpassé les précédents modèles à plus grande échelle sur des benchmarks multilingues.

Au niveau de la communauté des développeurs, les discussions sur GitHub et HuggingFace tournent principalement autour de la compatibilité matérielle du déploiement local (si le RTX 4060/4070 avec 16 Go de mémoire vidéo est suffisant pour fonctionner avec une précision totale), des progrès de l'intégration avec des frameworks d'inférence locaux tels qu'Ollama/LM Studio et de la maturité de la chaîne d'outils de réglage fin. L'application de bureau macOS Gemma 4 12B officiellement fournie par Google est la première solution d'exécution locale du secteur pour les modèles open source destinés aux utilisateurs non techniques. Cette décision abaisse le seuil d'utilisation de grands modèles open source, mais elle déclenche également une discussion sur « la question de savoir si les modèles open source doivent être distribués via l'App Store ».

Il est important de noter que l'enthousiasme actuel du marché en est encore au stade d'adoption précoce - le modèle sortira en juin 2026, il y a seulement environ 6 semaines. Des données de tests de référence et des résultats de vérification à petite échelle émergent progressivement dans la communauté, mais la stabilité de l'environnement de production à grande échelle, le risque de dégradation des tâches à longue traîne et l'exhaustivité de l'écologie communautaire (outils de réglage fin, solutions quantitatives, modèles de déploiement) ont encore besoin de temps pour être testés.

Avantage de coût

Dimension du coût Descriptif
Licence modèle 0 $ (Apache 2.0, pas de conditions supplémentaires)
Appels API Cloud Facturation par jeton via Google Cloud Vertex AI ou d'autres plates-formes d'hébergement
Matériel auto-déployé Nécessite un GPU VRAM de 16 Go ou plus (le modèle grand public tel que le RTX 4060 Ti 16 Go coûte environ 3 500 ¥, le RTX 4090 coûte environ 13 000 ¥)
Cadre d'inférence d'auto-déploiement Ollama, LM Studio, vLLM, TensorRT-LLM sont tous compatibles
Coût de mise au point Le réglage complet des paramètres nécessite plus de 32 Go de VRAM ; LoRA/QLoRA peut être complété en 16 Go

La structure des coûts du Gemma 4 12B est fondamentalement différente des modèles multimodaux traditionnels à source fermée. Prenez GPT-4o ou Claude 3.5 Sonnet à titre de comparaison : le modèle fermé est facturé par token, et les dépenses mensuelles pour les appels haute fréquence peuvent atteindre des milliers de dollars ; tandis que le coût marginal des appels du Gemma 4 12B est presque nul, tant que le matériel est en place. Cependant, le modèle d'auto-déploiement nécessite que le coût d'achat du matériel soit amorti dans le coût total de possession (TCO).

Déduction du TCO (12 mois) :

  • Option A (auto-déploiement) : RTX 4090 (13 000 ¥) + électricité/refroidissement (200 ¥/mois × 12 = 2 400 ¥) + personnel d'exploitation et de maintenance (en supposant une moyenne de 4 heures par mois × 200 ¥/heure × 12 = 9 600 ¥) = 25 000 ¥/an
  • Option B (appel API) : en supposant une moyenne quotidienne de 1 million de jetons (entrée + sortie), la tarification de l'API basée sur un modèle d'échelle de paramètres similaire est d'environ 0,3 $/M de jeton, et les frais mensuels sont d'environ 9 $ × 12 = ¥780/an (mais sont soumis à la disponibilité du service et à la confidentialité des données).
  • Option C (Hybride) : Traitement d'inférence local de données sensibles + Traitement par lots dans le cloud de tâches à haute concurrence, prenant en compte la confidentialité et l'élasticité

Facteur de décision clé : lorsque le volume d'appels quotidien dépasse environ 5 millions de jetons, le coût marginal de l'auto-déploiement commence à être inférieur à celui de la solution API. Plus les exigences en matière de confidentialité des données sont élevées, plus la fréquence des appels est stable et, dans le cas où le matériel existe déjà, plus l'auto-déploiement sera économique.

Fonctions principales

  • Compréhension unifiée de toutes les modalités : les quatre modalités de texte, d'image, d'audio et de vidéo sont traitées uniformément dans le même modèle, éliminant ainsi le besoin de créer des pipelines indépendants pour différentes modalités. Une seule inférence peut accomplir la tâche intermodale consistant à « regarder un graphique → écouter un enregistrement → produire un rapport d'analyse », ce que les solutions traditionnelles de combinaison de modèles indépendants ne peuvent pas réaliser. En utilisation réelle, la vitesse d'inférence fluctue considérablement en fonction de la complexité de la modalité d'entrée (en particulier la densité de traitement des images des longues vidéos).
  • 256K Ultra-Long Context : prend en charge le traitement d'environ 200 pages de documents ou plus d'une heure de contenu vidéo à la fois. Dans des scénarios tels que des questions et réponses sur de longs documents, la compréhension au niveau de l'entrepôt de code et l'analyse des procès-verbaux de réunions à plusieurs reprises, la fenêtre de 256 Ko permet au modèle de maintenir la cohérence au niveau de la conversation. Cependant, il convient de noter que le premier délai symbolique du raisonnement dans un contexte long augmentera considérablement (proportionnellement à la longueur d'entrée) et que le problème de « dilution de l'attention » dans un contexte long n'a pas encore été complètement résolu - le modèle a tendance à se concentrer sur le contenu au début et à la fin du contexte, et le taux de rappel des informations dans la partie médiane peut diminuer.
  • Raisonnement d'agent : le modèle prend en charge de manière native l'appel de fonction et la chaîne de pensée, et peut effectuer indépendamment la décomposition des tâches en plusieurs étapes et l'interaction avec l'environnement. La compatibilité avec les frameworks Agent tels que LangChain et AutoGen a été démontrée dans des échantillons officiels de Google. La principale limitation des capacités de l'Agent réside dans le taux de réussite du raisonnement en une seule étape : les erreurs à chaque étape de l'opération en chaîne s'accumuleront et le taux d'achèvement réel des tâches complexes (plus de 5 étapes) doit être vérifié par les utilisateurs dans leurs propres scénarios.
  • Application de bureau native macOS : pour la première fois, Google propose l'installation en un clic d'applications de bureau pour le modèle open source, prenant en charge le fonctionnement local et complet hors ligne. Le niveau application intègre des fonctions de dialogue, de téléchargement de fichiers (image/PDF/vidéo), de gestion de contexte et de changement de modèle. La version macOS des puces de la série M (M3/M4) est implémentée via Apple Neural Engine

Pour une accélération significative des inférences, les Mac Intel ne prennent en charge que le mode d'exécution de base.

Evolution du modèle et de la version

Version Dates Changements clés
Gemma 4 12B v1.0 2026-06 Première version, architecture unifiée sans encodeur, contexte 256 Ko, prise en charge modale complète, Apache 2.0
Série Gemma 4 2026-05 Début de la série (12B Dense + 31B Dense/MoE), vérification de l'architecture

Gemma 4 12B est le « produit phare à petits paramètres » de la série Gemma 4 - son architecture Dense de 12B forme un positionnement complémentaire avec la version MoE du 31B de la série : 12B se concentre sur le déploiement local et les scénarios à faible latence, et 31B est orienté vers les tâches de haute précision dans le cloud. En regardant le pedigree de développement de la série Gemma, la transition architecturale de Gemma 1 (2B/7B, 2024-02) à Gemma 2 (9B/27B, 2024-06) à Gemma 3 (1B/12B/27B, 2025-03), puis à Gemma 4 - l'architecture sans encodeur est une réponse positive à la proposition selon laquelle « une multimodalité forte peut être obtenue ». avec de petits paramètres". Bien que le précédent Gemma 3 disposait d'une version 12B, il reposait sur un encodeur visuel indépendant (SigLIP) et un encodeur audio (Whisper), ce qui entraînait un retard de raisonnement multimodal élevé et une faible efficacité d'alignement des informations intermodales. La latence d'inférence de Gemma 4 12B est environ 40 % inférieure à celle de Gemma 3 12B (données officielles de Google) et la précision de l'alignement modal est améliorée de 12 à 18 points de pourcentage (sur la base des benchmarks MMMU et Video-MME).

Avantages techniques

  • Architecture unifiée sans encodeur : il s'agit de l'innovation technologique de base du Gemma 4 12B. Les modèles multimodaux traditionnels (tels que LLaVA, Qwen-VL) doivent connecter des encodeurs visuels indépendants (ViT) et des encodeurs audio (Whisper, etc.) devant le LLM pour convertir les modalités non textuelles en séquences de jetons avant de les envoyer au LLM. Gemma 4 12B intègre la tokenisation visuelle et audio directement dans la couche de projection d'entrée de LLM, éliminant ainsi le lien encodeur. Les avantages directs de cette conception sont les suivants : (1) élimination du goulot d'étranglement des informations causé par l'encodeur - la résolution et la taille du patch du ViT traditionnel limitent la rétention des détails de l'image, Gemma 4 12B peut conserver plus d'informations sur la résolution d'origine ; (2) Réduire la perte d'alignement entre les modalités - la sortie de jeton par l'encodeur est incohérente avec la distribution d'intégration de mots de LLM, et la tokenisation unifiée élimine cette inadéquation ; (3) Réduit le délai d'inférence - il y a un lien d'inférence d'encodeur de moins. Le coût est que la phase de formation nécessite davantage de données d'alignement multimodal et des stratégies de formation plus complexes, et la qualité visuelle/audio du modèle est directement limitée par la capacité d'intégration du squelette LLM.
  • Compatibilité matérielle et optimisation des inférences : un modèle 12B Dense occupe environ 24 Go de mémoire vidéo avec une précision FP16 et peut être compressé à environ 7 Go avec une quantification 4 bits (telle que AWQ/GPTQ), lui permettant de fonctionner sur la mémoire unifiée des puces RTX 4060 (12 Go) et Apple M-series. Google propose des chemins d'optimisation natifs TensorRT-LLM et ExecuTorch, avec des vitesses d'inférence allant jusqu'à 30 à 50 jetons/s (quantification 4 bits, RTX 4090). La version macOS offre une accélération matérielle supplémentaire via CoreML et Apple Neural Engine.
  • Prise en charge native de l'agent : le modèle introduit des appels d'outils et des données de formation de sortie structurées dans la phase de pré-formation, plutôt que de les ajouter lors d'un réglage ultérieur. Cela signifie que l'appel de fonction et la sortie structurée JSON ont un format plus stable et plus cohérent que les solutions post-ajout. Le modèle prend nativement en charge l’appel d’outils parallèles (Parallel Function Calling). Une seule inférence peut appeler plusieurs outils externes (tels que recherche + calcul + base de données) en même temps.

requête), ce qui est crucial pour l’efficacité de l’exécution du flux de travail de l’agent.

  • Compatibilité écologique : les pondérations des modèles sont publiées sur HuggingFace au format SafeTensors, compatible avec les cadres d'inférence traditionnels tels que Transformers, vLLM, LLaMA.cpp et Ollama. Google propose officiellement un didacticiel complet depuis le téléchargement du modèle jusqu'au déploiement d'inférence (y compris l'image Docker et Kubernetes Helm Chart), ainsi que des modèles de déploiement cloud en un clic pour Colab et Vertex AI.

Limites et restrictions d'adaptation

  • Scénarios d'utilisation recommandés : expériences multimodales locales réalisées par des développeurs individuels et des chercheurs universitaires (peuvent être exécutées sur des GPU grand public) ; raisonnement local dans des scénarios sensibles à la confidentialité des données (analyse de documents médicaux/juridiques/financiers) ; solutions de déploiement local pour les systèmes Agent/RAG ; analyse de contexte long multimodale (compréhension de vidéos longues, questions-réponses sur des documents multipages, synthèse de comptes rendus de réunions).
  • Non recommandé : scénarios d'interaction en temps réel qui nécessitent une réponse de l'ordre de la milliseconde (le premier délai symbolique du raisonnement local est de 1 à 5 secondes) ; des pipelines de données au niveau de la production avec des contraintes de schéma strictes sur le format de sortie (la stabilité de la sortie structurée doit être entièrement vérifiée) ; diagnostic médical ou génération de documents juridiques qui nécessitent une crédibilité extrêmement élevée (le problème des hallucinations des grands modèles n'est pas complètement résolu).
  • Limites connues :
    • La qualité d'entrée visuelle de l'architecture sans encodeur est limitée par la capacité d'intégration du LLM, et sa capacité à conserver les détails des images ultra haute résolution (8K+) est plus faible que la solution combinée d'un modèle visuel dédié + LLM.
    • Bien que la maîtrise du chinois se soit améliorée sur les critères multilingues, la qualité de l'écriture chinoise et la compréhension du contexte culturel restent à la traîne par rapport aux modèles open source nationaux de même échelle (tels que Qwen2.5-14B).
    • L'entrée audio ne prend actuellement en charge qu'un seul canal (mono) et les scènes double canal/stéréo nécessitent un traitement downmix.
    • L'application de bureau macOS prend uniquement en charge Apple Silicon (M1+), les utilisateurs Intel Mac doivent utiliser la version en ligne de commande.
    • La chaîne d'outils de réglage fin de la communauté n'est pas encore mature (en juillet 2026), le didacticiel officiel de réglage fin ne couvre que LoRA et l'implémentation de référence du réglage fin complet des paramètres est toujours en cours de développement.

Comment utiliser

Entrée Comment utiliser
Application de bureau macOS Téléchargement du site officiel de Google AI Studio → double-cliquez pour installer → téléchargement automatique du modèle → mode conversation/téléchargement de fichiers
Interface API (Vertex AI) La console Google Cloud active l'API → Obtenir la clé API → Appeler l'API REST
Déploiement local (auto-hébergé) huggingface-cli télécharger google/gemma-4-12B → chargement de vLLM/Ollama → service API REST
Google IA Studio Expérience Web, aucun matériel local requis, prend en charge l'entrée multimodale mais est limitée par le quota du serveur

Exemple d'appel API typique (SDK compatible Python + OpenAI) :

depuis openai importer OpenAI

# Vertex AI ou les points de terminaison auto-déployés sont accessibles via des interfaces compatibles OpenAI
client = OpenAI (
    base_url="http://localhost:8000/v1", # Point de terminaison vLLM à déploiement automatique
    api_key="<votre_clé>"
)

# Exemple de saisie multimodale : compréhension d'image + instructions textuelles
réponse = client.chat.completions.create(
    modèle="google/gemma-4-12B",
    message=[
        {
            "rôle": "utilisateur",
            "contenu": [
                {"type": "text", "text": "Veuillez décrire l'architecture technique de cette image en détail et signaler d'éventuels défauts de conception"},
                {"type": "image_url", "image_url": {"url": "data:image/png;base64,..."}}
            ]
        }
    ],
    max_tokens=2048,
    température=0,2
)
imprimer(response.choices[0].message.content)

Prix des produits

Éléments de facturation Prix ​​
Licence modèle (auto-déploiement) 0 $ (Apache 2.0)
API Vertex AI (en volume) Entrez des jetons à 0,15 $/M, produisez des jetons à 0,60 $/M (prix de référence, sous réserve de la page en temps réel)
Inférence par lots Vertex AI Entrez des jetons à 0,075 $/M, produisez des jetons à 0,30 $/M (50 % de réduction)
Crédit gratuit (AI Studio) 100 inférences par jour, jusqu'à 4K contextes chacune

Les informations tarifaires sont soumises à la page officielle de tarification en temps réel de Google Cloud Vertex AI. En mode auto-déploiement, seuls les coûts de matériel et d'électricité sont pris en charge.

Scénarios d'application

  • Scénario 1 : Analyse de documents multimodaux locaux - L'analyste fait glisser un PDF de 50 pages (comprenant des diagrammes et des captures d'écran annotées) directement dans l'application de bureau macOS et demande au modèle « d'extraire les arguments principaux et de générer un résumé structuré ». Gemma 4 12B traite tout en même temps dans une fenêtre contextuelle de 256 Ko, affichant le résumé en environ 30 secondes. En revanche, la méthode traditionnelle nécessite l'OCR pour extraire le texte, puis utiliser un modèle de compréhension d'image indépendant pour analyser le graphique et enfin le résumer manuellement, ce qui prend environ 1 à 2 heures au total. Méthode de vérification : vérifiez de manière aléatoire le résumé de sortie page par page pour confirmer l'exactitude de la citation et le taux de rappel des points de données clés.
  • Scénario 2 : Automatisation de la révision du code pilotée par l'agent - Créez un flux de travail d'agent dans un environnement d'auto-déploiement : Gemma 4 12B sert de moteur d'inférence et coopère avec le déclenchement d'événements PR de l'entrepôt de code pour exécuter automatiquement l'opération en quatre étapes "lire les différences → identifier les modèles de risque → générer des avis de révision → commenter dans PR". La taille du paramètre 12B lui permet d'être exécuté en mode CPU (~ 3 à 5 jetons/s) sur les ressources budgétaires de CI/CD (4 vCPU + 16 Go de mémoire, pas de GPU) et peut être complété en 3 à 5 minutes pour un seul examen PR (~ 200 lignes de différence). Méthode de vérification : exécutez 50 PR de problèmes connus sur l'entrepôt de tests et comptez le taux de détection et le taux de faux positifs.
  • Scénario 3 : Indexation et récupération de contenu vidéo long - Saisissez la vidéo de formation d'une heure (y compris les explications vocales et les diapositives) dans le modèle pour générer un index segmenté (horodatage + chaque sujet + captures d'écran clés). Le modèle traite à la fois la transcription audio et le contenu visuel en une seule inférence, produisant des balises de chapitre vidéo structurées. Méthode de vérification : comparez manuellement la précision de l'horodatage et la précision du résumé du contenu de 5 échantillons aléatoires.

Personnes concernées

  • Développeurs et ingénieurs IA : personnel technique ayant besoin d'une intégration de produits via une API ou un déploiement local. Concentrez-vous sur la compatibilité de Transformer et les capacités de l'agent.
  • Chercheur universitaire : concentrez-vous sur l'innovation en matière de conception de modèles d'architecture sans encodeur, la feuille de route technologique d'alignement multimodal et les compromis de performances avec des modèles à petits paramètres.
  • Entreprises sensibles aux données : organisations ayant des exigences de conformité (données médicales, données financières, confidentialité des clients) qui souhaitent créer leur propre infrastructure d'inférence. La licence Apache 2.0 de Gemma 4 12B et sa capacité à fonctionner de manière native sont les principales attractions.
  • Passionnés de technologie : pour les utilisateurs individuels qui souhaitent découvrir des modèles multimodaux de pointe sur du matériel grand public, l'application de bureau macOS offre une entrée sans seuil.

Comparaison des produits concurrents

Dimensions comparatives Gemma 4 12B Qwen2.5-14B-VL LLaVA-1.6-13B GPT-4o (référence)
Type d'architecture Unification sans code Encodeur ViT autonome Encodeur CLIP autonome Source fermée, architecture inconnue
Taille du paramètre 12B dense 14B dense 13B dense
Longueur du contexte 256 Ko 128 Ko 8K 128 Ko
Prise en charge multimodale Texte+Image+Audio+Vidéo Texte+Image Texte+Image Texte+Image+Audio+Vidéo
Licence Open Source Apache2.0 Apache 2.0 (de base) Apache2.0 Source fermée
Matériel minimum pour l'inférence locale 16 Go de VRAM / M1+ 16 Go 16 Go de mémoire vidéo 16 Go de mémoire vidéo Non disponible
Prise en charge native des agents Oui (pré-formé) Oui (affiné supplémentaire) Non Oui
Maîtrise du chinois Bon Excellent Moyenne Excellent
Tarifs API (référence) 0,15$/0,60$ 0,5 ¥/0,8 ¥ (nuage Alibaba) Auto-déploiement gratuit 2,50 $/10,00 $

Résumé et Outlook

Gemma 4 12B apporte une solution différenciée au niveau architectural dans le domaine des grands modèles multimodaux open source. L'architecture unifiée sans encodeur n'est pas une amélioration incrémentielle, mais une nouvelle réponse fondamentale à la question centrale : « comment un modèle à petits paramètres peut-il bien gérer la multimodalité ? Sa combinaison de paramètres 12B + exécutabilité GPU grand public transforme l'inférence multimodale locale d'un « jouet de laboratoire » en un « outil implémentable ».

Avantages actuels : (1) L'amélioration de l'efficacité de l'alignement intermodal apportée par l'innovation architecturale est un avantage incontestable ; (2) La licence Apache 2.0 + la capacité d'exécution locale le rendent irremplaçable dans les scénarios sensibles aux données ; (3) Le contexte full-modal 256K occupe une position de leader au même niveau d'échelle de paramètres.

Limites connues : (1) La maturité de la chaîne d'outils communautaire (cadre de réglage fin, outils quantitatifs, modèles de déploiement) est bien inférieure à celle de l'écologie LLaMA et Qwen ; (2) Bien que la maîtrise de la langue chinoise soit meilleure que celle de la génération précédente, il existe encore un écart et les utilisateurs nationaux doivent l'évaluer par eux-mêmes ; (3) Le problème de la « perte d'attention » dans les scénarios à contexte long n'a pas été complètement résolu et un mécanisme de vérification de la qualité des résultats doit être établi dans des applications pratiques.

Orientations de suivi : (1) La vitesse et la qualité de l'émergence de modèles dérivés de la communauté (versions affinées, versions quantitatives, versions spécifiques à un domaine) - il s'agit d'un indicateur direct de la santé écologique ; (2) la fréquence de mise à jour de Google et le cycle de prise en charge des correctifs pour la série Gemma 4 ; (3) Si l'architecture sans encodeur sera suivie par d'autres familles de modèles (telles que LLaMA, Qwen), ce qui est lié à la compétitivité routière technique à long terme du Gemma 4 12B.

Il est recommandé aux utilisateurs potentiels d'effectuer 1 à 2 semaines de tests et de vérification dans leurs propres scénarios via l'application de bureau macOS ou le quota gratuit de Google AI Studio, en se concentrant sur la cohérence de la qualité de sortie, l'acceptabilité de la vitesse d'inférence et le taux de rappel des informations des scénarios à contexte long, avant de décider de les placer dans l'environnement de production.

Outils associés : hugging-face, replicate

Informations de version

  • Gemma 4 12B version officielle :Le grand modèle multimodal open source de Google adopte une architecture unifiée sans encodeur. Les paramètres 12B prennent en charge la compréhension du texte/image/audio/vidéo et le raisonnement des agents. Licence Apache 2.0.
  • Sortie de la série Gemma 4 :La série Gemma 4 fait ses débuts avec les versions 12B Dense et 31B Dense/MoE.

Avis des utilisateurs

  • Chargement des avis...