Gemme Gratuit

-

Gemma est une série légère et open source publiée par Google DeepMind sur la base des résultats de la recherche Gemini. Gemma 2 propose trois échelles de 2B/9B/27B, suit la licence Apache 2.0 et est gratuit pour une utilisation commerciale. Il est spécialement optimisé pour les scénarios finaux et avec des ressources limitées. Il offre des performances de pointe dans la même échelle de paramètres et prend en charge HuggingFace, Kaggle et Google Cloud. Accès multicanal.

Gemme Interface du produit

Gemma — La série de modèles de langage légers et open source de Google

Paramètres et statistiques de base

Paramètres Détails
Dernière version Gemma 2 (2B/9B/27B)
Date de sortie 2024-06-27
Licence Apache 2.0 (entièrement ouvert à un usage commercial, sans limite d'activité mensuelle)
Fenêtre contextuelle 8192 Jeton (Gemma 2)
Source technologique Basé sur les résultats de la recherche Gemini, utilisant la technologie de distillation des connaissances
Canaux de diffusion HuggingFace, Kaggle, Google Cloud Vertex AI
Modèle de variante CodeGemma (code), PaliGemma (langage visuel), RecurrentGemma
Prise en charge de la quantification GGUF, GPTQ, AWQ et autres formats de quantification courants
Cadre d'inférence HuggingFace Transformers, lama.cpp, Ollama, vLLM
Assistance Google Colab Notebook Colab gratuit, exécutez Gemma directement dans le navigateur

La principale différence entre Gemma et Llama réside dans la licence : Gemma utilise Apache 2.0 (aucune limite de taille d'utilisateur, véritablement entièrement open source), tandis que la licence Meta Llama de Llama 3 nécessite des licences spéciales après avoir dépassé 700 millions d'utilisateurs actifs mensuels. Pour les applications commerciales en pleine croissance, la licence Apache 2.0 de Gemma offre une protection juridique encore plus sans souci.

Reconnaissance des utilisateurs et du marché

Depuis sa sortie en février 2024, Gemma a continué de croître en termes de téléchargements sur HuggingFace, devenant ainsi la deuxième famille LLM open source la plus populaire après la série Llama. Le puissant écosystème de développeurs de Google (Kaggle, Colab, Google Cloud) offre à Gemma un canal de distribution unique. Un grand nombre de data scientists et de participants au concours Kaggle ont accès à Gemma via une plate-forme familière, formant ainsi une base d'utilisateurs en croissance rapide.

Gemma 2 27B a atteint un niveau proche de GPT-4 Turbo dans le classement des blind tests de LMSys Chatbot Arena. Ce résultat de référence a attiré une large attention dans la communauté open source et a prouvé que les petits modèles efficaces en termes de paramètres peuvent atteindre des niveaux de performances dépassant de loin le nombre attendu de paramètres grâce à la distillation des connaissances. Le lancement de variantes professionnelles telles que CodeGemma et PaliGemma élargit encore la couverture des scénarios d'application de l'écosystème Gemma.

Avantage de coût

Méthode Prix ​​ Principaux scénarios applicables Caractéristiques
Déploiement local Coût du matériel (unique) Applications de confidentialité, expériences de développement Apache 2.0, aucune restriction commerciale
Google Cloud Vertex AI Facturation par Token (système de tarification Gemini) Intégration d'API d'entreprise Intégration approfondie avec Google Cloud
Inférence CâlinsFace Forfait gratuit (limité) ou PRO Tests d'applications légers Le démarrage le plus rapide, aucun GPU local requis
Carnets Kaggle Gratuit (GPU inclus) Expériences de science des données Accès sans frais pour les utilisateurs de Kaggle

La version quantifiée du Gemma 2 2B peut à peine fonctionner sur le processeur et fonctionne sans problème sur un MacBook (puce M) ou RTX 3060. Il s'agit de l'une des options les plus puissantes parmi les « modèles d'IA pouvant être exécutés sur un ordinateur portable ». Les exigences matérielles du Gemma 2B/9B se traduisent par des coûts de développement nettement inférieurs à ceux des modèles à plus grande échelle nécessitant un A100.

Fonctions principales

  • Modèle de pré-formation multi-échelle Gemma 2 (Base) : fournit un modèle de pré-formation de base sans réglage fin des instructions, adapté aux chercheurs pour effectuer un réglage fin secondaire dans des tâches ou des domaines spécifiques. Les trois échelles 2B/9B/27B couvrent différents scénarios de puissance de calcul, du déploiement côté terminal aux serveurs hautes performances.
  • Gemma 2 Instruction version affinée (Instruct) : Une version conversationnelle formée avec le suivi des instructions et un alignement sûr. Il peut être utilisé directement dans les assistants de discussion et les applications de questions-réponses. Il peut obtenir des capacités d’interaction en langage naturel de haute qualité sans ajustement supplémentaire.
  • Efficacité ultra-élevée des paramètres d'optimisation de la distillation des connaissances : Gemma 2 obtient des résultats de tests de référence nettement supérieurs dans la même échelle de paramètres en obtenant l'efficacité des paramètres de modèles Gemini à plus grande échelle (27B distillé à partir de Gemini, 9B/2B distillé à partir de 27B). Cette stratégie de « chaîne de distillation » est l'innovation technologique centrale de la série Gemma.
  • CodeGemma (variante spécifique au code) : une variante Gemma spécifiquement optimisée pour la complétion de code, la génération de code et le raisonnement mathématique. Il fournit deux spécifications : 2B (remplissage du code) et 7B (version instruction). Les performances des tâches de code sont meilleures que le modèle général Gemma de même échelle.
  • PaliGemma (version multimodale du langage visuel) : une variante multimodale de Gemma qui prend en charge la compréhension des images. Il peut gérer une saisie mixte d'images et de texte, effectuer des descriptions d'images, des réponses visuelles aux questions et des tâches de compréhension de documents. Il s'agit d'un représentant du modèle open source multimodal léger de Google.
  • Licence commerciale sans restriction Apache 2.0 : Tous les modèles Gemma suivent la licence Apache 2.0 et peuvent être librement utilisés, modifiés et distribués dans des produits commerciaux de toute taille, sans aucune restriction sur le nombre d'utilisateurs ou les revenus. Il s’agit de l’une des licences commerciales open source LLM les plus libérales.
  • Expérience sans configuration de Google Colab : Google fournit un bloc-notes Colab officiel pour Gemma. Les utilisateurs peuvent exécuter Gemma directement dans le navigateur sans GPU local. Il s’agit du point d’entrée le plus bas permettant aux apprenants en IA et aux data scientists de découvrir Gemma.
  • Kaggle Ecological Deep Integration : Gemma est profondément intégrée à la plateforme Kaggle et prend en charge la participation aux compétitions Kaggle et

Les appels directs dans les blocs-notes et un canal de distribution unique pour la communauté de la science des données forment une niche unique qui différencie Gemma des autres LLM open source.

Evolution du modèle et de la version

Version Date de sortie Descriptif
Gemma 1.0 (2B/7B) 2024-02-21 Première version Gemma de Google, version de base + version commande, licence Apache 2.0
CodeGemma (2B/7B) 2024-04-09 Variantes spécifiques au code, remplissage du code et optimisation de la génération
Gemma 1.1 (version mise à jour 2B/7B) 2024-04-05 Les commandes suivent les améliorations de qualité, corrigent les problèmes de dialogue dans la version 1.0
Gemma récurrente (2B/9B) 2024-04 Variante d'inférence efficace basée sur une architecture récursive linéaire, adaptée aux appareils de pointe
PaliGemma (3B multimodal) 2024-05 Modèle de langage visuel pour prendre en charge les tâches de compréhension d'images
Gemma 2 (2B/9B/27B) 2024-06-27 Deuxième génération, optimisation de la distillation des connaissances, performances grandement améliorées, 27B est proche du GPT-4 Turbo
Gemma 2 JetBrains/Ollama 2024-08 Les IDE grand public et les outils d'inférence locaux prennent en charge Gemma 2, et l'écosystème continue de se développer

Avantages techniques

Efficacité des paramètres ultra-élevée apportée par la chaîne de distillation des connaissances : Le cœur technique de Gemma 2 est la distillation des connaissances à plusieurs niveaux - 27B est distillé à partir du plus grand Gemini, et 9B et 2B sont distillés à partir de 27B. Cette chaîne de distillation permet à chaque taille de modèle Gemma 2 d'atteindre un niveau de performance bien au-delà de sa taille paramètre. C'est la raison technique pour laquelle Gemma 2 9B a surpassé Llama 3 70B dans le classement HuggingFace Open LLM, et reflète les principaux résultats de recherche de Google DeepMind dans le domaine de la compression de modèles et du transfert de connaissances.

Licence commerciale la plus lâche d'Apache 2.0 : comparée à la licence Meta Llama de Llama (une autorisation spéciale est requise pour plus de 700 millions de MAU), la licence Apache 2.0 de Gemma n'a aucune restriction sur toute utilisation commerciale. Les développeurs et les entreprises peuvent intégrer Gemma dans des produits commerciaux de toute taille sans craindre de déclencher des restrictions de licence à mesure que leur activité se développe, réduisant ainsi les risques de conformité juridique des entreprises utilisant le LLM open source.

Intégration étroite avec l'infrastructure Google : Gemma est un modèle de support natif pour Google Cloud, Vertex AI, Colab et Kaggle, avec un accès et une prise en charge d'outils optimaux sur ces plates-formes. Pour les entreprises qui ont adopté Google Cloud pour leur infrastructure cloud, l'utilisation de Gemma offre l'intégration la plus approfondie avec l'écosystème Google, y compris le registre de modèles géré et optimisé de Vertex AI et les capacités de surveillance de la sécurité.

Valeur de déploiement final hautes performances à petite échelle : Gemma 2 2B est actuellement l'un des modèles open source à l'échelle des paramètres 2B les plus performants. Il peut s'exécuter localement sur un téléphone Android de configuration moyenne (avec le framework Google AI Edge) et fournit des fonctionnalités LLM locales pratiques pour les applications d'IA finales (assistant vocal hors ligne, traitement côté appareil de protection de la vie privée, etc.). C'est un avantage différenciant important du Gemma par rapport au Lama (minimum 8B).

Comment utiliser

Entrée Descriptif
CâlinsVisage Visitez https://huggingface.co/google/gemma-2-9b pour demander l'accès et télécharger le modèle
Kaggle Utilisez Gemma gratuitement dans les notebooks Kaggle, y compris l'accélération GPU
Google Colab Utilisez le notebook Colab officiel de Google pour fonctionner sans GPU local
Ollama (local) ollama run gemma2:9b Déploiement local en un clic
Sommet AI Accédez au service API Gemma via Google Cloud Vertex AI

Étapes d'utilisation typiques (HuggingFace connecté à Gemma 2) :

  1. Visitez https://huggingface.co/google/gemma-2-9b, connectez-vous à votre compte HuggingFace et acceptez l'accord d'utilisation (Apache 2.0, aucune restriction supplémentaire).
  2. Installez les dépendances : « les transformateurs d'installation pip accélèrent ».
  3. Utilisez HuggingFace Transformers pour charger le modèle : « à partir des transformateurs, importez AutoTokenizer, AutoModelForCausalLM ».
  4. Chargez le Tokenizer et le modèle (nécessite au moins 20 Go de mémoire vidéo pour exécuter le modèle 9B, 2B équivaut à environ 6 Go), ou utilisez la version quantifiée pour réduire les besoins en mémoire vidéo.
  5. Écrivez le code d'inférence et utilisez model.generate() pour générer du texte. La version de la commande Gemma suit le format de conversation <start_of_turn>user ... <end_of_turn>.
  6. Si un réglage fin est nécessaire, il est recommandé d'utiliser HuggingFace TRL + LoRA pour un réglage fin efficace des paramètres.

Prix des produits

Les poids des modèles Gemma sont entièrement gratuits et le coût d'utilisation de chaque plateforme est différent :

  • Téléchargement du poids du modèle : entièrement gratuit, licence Apache 2.0, aucune restriction commerciale, peut être téléchargé directement depuis HuggingFace ou Kaggle, aucune application spéciale n'est requise.
  • Déploiement local : uniquement le coût matériel, Gemma 2 2B fonctionne correctement sur RTX 3060 (12 Go), 9B nécessite RTX 3090 (24 Go) ou un déploiement multi-cartes.
  • Kaggle Notebooks : le compte gratuit Kaggle fournit un quota GPU limité (environ 30 heures/semaine de GPU T4), qui peut exécuter des expériences Gemma et démarrer sans frais.
  • Google Colab : la version gratuite permet une utilisation limitée du GPU, et Colab Pro (environ 10 $/mois) fournit plus de ressources GPU et convient aux expériences à moyenne échelle.
  • Google Cloud Vertex AI : les services d'API commerciaux sont facturés par Token. Pour connaître les prix spécifiques, veuillez vous référer à la page des prix officiels de Google Cloud. Il fournit des services d'inférence gérés pour les applications de niveau entreprise.

Scénarios d'application

  1. Fonctions IA des appareils mobiles et périphériques : la conception compacte du Gemma 2 2B est optimisée pour le déploiement final. Il peut s'exécuter localement sur des appareils Android de milieu à haut de gamme via le framework Google AI Edge. Il prend en charge les assistants intelligents hors ligne, le traitement de texte en temps réel et les fonctions NLP côté appareil protégeant la confidentialité. Il s'agit de la solution open source préférée pour les applications mobiles nécessitant des capacités d'IA hors ligne.

  2. Déploiement d'IA avec des ressources limitées : les applications d'IA dans les systèmes embarqués, les serveurs de périphérie et les instances cloud à faible calcul utilisent le modèle quantifié Gemma 2B/9B pour fournir des capacités pratiques de génération de texte et de réponse aux questions dans une mémoire GPU limitée (8 à 16 Go). C'est un choix idéal pour maximiser les capacités de l'IA lorsque les conditions matérielles sont limitées.

  3. Expérience d'apprentissage de l'IA pour les étudiants et les chercheurs : en accédant à Gemma via les blocs-notes Kaggle (GPU gratuit), les étudiants en science des données peuvent découvrir le processus complet de réglage fin, d'évaluation et de déploiement du LLM sans frais. La licence Apache 2.0 garantit que les résultats de la recherche universitaire peuvent être librement publiés et commercialisés, ce qui en fait l'un des LLM open source les plus accessibles pour l'enseignement de l'IA.

  4. Intégration de l'IA pour les entreprises Google Cloud : les entreprises qui ont adopté Google Cloud utilisent Gemma sur Vertex AI pour bénéficier de l'intégration la plus approfondie avec l'infrastructure Google, du service de réglage fin géré, de la gestion des versions de Model Registry et des capacités de conformité de sécurité de niveau entreprise, combinant les avantages en termes de coûts des modèles open source avec la fiabilité technique de Google Cloud.

  5. Développement d'outils assistés par code : utilisez CodeGemma 7B pour créer des outils privatisés de complétion et de révision de code, déployez-les localement ou sur l'intranet et évitez la transmission de code via des services cloud tels que GitHub Copilot. La licence Apache 2.0 garantit que les outils de code peuvent être commercialisés librement, ce qui convient aux éditeurs de logiciels ayant des besoins en matière de protection de la propriété intellectuelle.

Personnes concernées

  • Data Scientists et participants au concours Kaggle : L'intégration approfondie de la plateforme Kaggle et l'accès gratuit au GPU font de Gemma un choix naturel pour ce groupe, s'intégrant parfaitement aux flux de travail existants.
  • Développeurs d'IA mobiles et côté client : pour les développeurs Android qui doivent exécuter LLM sur l'appareil, la combinaison de Gemma 2B et de Google AI Edge est actuellement la solution de développement LLM côté client la plus mature.
  • Entreprises nécessitant une licence Apache 2.0 : Pour les entreprises qui ont des problèmes juridiques concernant la licence Meta Llama de Llama et qui ont besoin d'une licence open source plus souple, Gemma pour Apache 2.0 offre des garanties d'utilisation commerciale sans souci.
  • Utilisateurs de Google Cloud : les équipes qui ont déployé l'infrastructure Google Cloud peuvent utiliser Gemma sur Vertex AI pour bénéficier de la meilleure expérience d'intégration et d'une assistance de niveau entreprise.
  • Scénarios inappropriés : applications nécessitant un traitement de contexte ultra long (jeton> 8K) (la fenêtre contextuelle de Gemma 2 est relativement petite, les 128K de Llama 3.1 sont plus adaptés) ; les applications de niveau production qui nécessitent les performances les plus élevées (le Gemma 27B est plus puissant que les produits concurrents de même échelle, mais il existe toujours un écart par rapport au Llama 3.1 405B ou au GPT-4) ; des équipes qui disposent déjà d'une pile technologique Llama stable et qui n'ont aucune motivation pour migrer.

Résumé et Outlook

La série Gemma représente la configuration stratégique de Google dans le domaine de l'IA open source : en diffusant les meilleurs résultats de recherche de Gemini à la communauté des développeurs sous la forme d'une licence ouverte, elle favorise non seulement la popularité de l'IA, mais attire également un grand nombre de développeurs vers l'écosystème Google (Cloud, Colab, Kaggle). L'efficacité ultra-élevée des paramètres apportée par la chaîne de distillation des connaissances constitue le point de différenciation technique le plus important de Gemma, permettant aux modèles à petite échelle d'avoir des performances qui dépassent les performances attendues à l'échelle des paramètres.

Le choix de la licence Apache 2.0 reflète l'engagement sincère de Google envers la communauté open source. Elle est plus ouverte que la licence Llama de Meta, ce qui constitue un avantage unique sur le marché des entreprises sensible à la conformité légale.

Objectif de suivi : l'expansion de l'échelle des paramètres et l'amélioration des capacités multimodales (visuelles, audio) de la série Gemma 3, l'évolution fonctionnelle du modèle de langage visuel PaliGemma, la perfection de l'écosystème de déploiement côté appareil de Google AI Edge et son positionnement différencié avec Gemini Nano (Gemini côté appareil) détermineront la position à long terme de Gemma dans le paysage de la concurrence LLM open source.

Outils associés : hugging-face, replicate

Informations de version

  • Gemma 2 (2B/9B/27B) :Gemma 2 est officiellement lancé, avec trois tailles de paramètres 2B, 9B et 27B. Il utilise la technologie de distillation des connaissances pour compresser les capacités des grands modèles en petits modèles. Dans les tests de référence grand public tels que LMSys Chatbot Arena, le Gemma 2 27B est proche du niveau GPT-4 Turbo et la version 9B surpasse tous les modèles open source de la même échelle. Toutes les versions suivent la licence Apache 2.0 et sont gratuites pour un usage commercial ; en même temps, dans HuggingFace, Kaggle et Google Cloud, les trois principaux canaux sont diffusés simultanément, ce qui réduit considérablement le seuil d'accès.
  • Gemma 1.1 (version mise à jour 2B/7B) :La version mise à jour de Gemma 1.1 a été publiée. Des améliorations spéciales ont été apportées pour résoudre les instructions suite aux problèmes de qualité signalés par les utilisateurs dans Gemma 1.0, et les capacités de dialogue de la version d'instruction (Instruct) ont été grandement améliorées. Dans le même temps, CodeGemma (version spécifique au code 2B/7B) et RecurrentGemma (variante de raisonnement à haute efficacité) ont été officiellement lancés, étendant la famille de modèles Gemma à des scénarios professionnels tels que la génération de code.
  • :Google a publié pour la première fois la série de modèles open source Gemma, en lançant une version de pré-formation (Base) et une version de réglage fin des instructions (Instruct) en deux tailles : 2B et 7B. Basé sur la distillation des résultats de recherche sur le modèle Gemini, il a obtenu des résultats de premier plan dans les tests de référence sur des modèles open source de la même échelle de paramètres. Il propose trois canaux d'accès : HuggingFace, Kaggle et Google Colab, et publie une boîte à outils pour une utilisation responsable de l'IA.

Avis des utilisateurs

  • Chargement des avis...