Gretel
Gratuit
Gretel est une plate-forme de génération de données synthétiques destinée aux entreprises et aux développeurs, offrant des capacités de synthèse différentielle de confidentialité pour les données tabulaires structurées, les données de séries chronologiques et les données textuelles. Sa bibliothèque open source gretel-synthetics (PyPI 0.22.20) prend en charge ACTGAN, Timeseries DGAN et d'autres modèles. Il a été acquis par NVIDIA et intégré à l'écosystème Nemotron/NeMo. La plateforme SaaS d'origine a cessé de fonctionner de manière indépendante.
Revue approfondie de Gretel : le panorama et la fin de partie de la plateforme de génération de données synthétiques
Paramètres et statistiques de base
| Dimensions | Spécifications |
|---|---|
| Positionnement du produit | Plateforme de génération de données synthétiques de confidentialité différentielle (structurées/séquentielles/textes) |
| Statut actuel | Acquis et intégré par NVIDIA, le SaaS indépendant a cessé ses activités |
| Licence open source | Licence Gretel Source disponible (bibliothèque principale) / Apache-2.0 (client, etc.) |
| Plateformes prises en charge | Web (service interrompu), API (service interrompu), SDK Python (open source disponible) |
| Langage de programmation | Python (99,7%), complété par Shell, Jupyter Notebook |
| Étoiles GitHub | 685 (dépôt principal Gretel-Synthetics) |
| Fourches GitHub | 101 |
| Nombre d'entrepôts de l'organisation | 30 (tous archivés) |
| Dernière version | v0.22.20 (2025-06-25) |
| Date de dépôt | 2026-02-18 |
| Téléchargements PyPI | Disponible publiquement |
| Modèles de base | ACTGAN, Timeseries DGAN, LSTM (obsolète) |
Le cycle de vie d'exploitation indépendant de Gretel a duré environ 7 ans (2018-2025), culminant avec son acquisition par NVIDIA et son intégration dans l'écosystème Nemotron/NeMo. Ses actifs open source (en particulier la bibliothèque « gretel-synthetics ») sont toujours disponibles indépendamment, mais le plan de contrôle SaaS et l'API cloud ont été mis hors ligne avec l'acquisition. Pour les équipes techniques évaluant les outils de données synthétiques, la bibliothèque open source de Gretel reste une référence très précieuse pour la mise en œuvre de données synthétiques de confidentialité différentielle.
Reconnaissance des utilisateurs et du marché
GitHub Community Base : La bibliothèque principale gretel-synthetics a accumulé 685 étoiles et 101 forks avant l'archivage, et 29 contributeurs ont participé à la soumission du code, reflétant l'attention des développeurs dans le domaine des données synthétiques au projet. Il existe également des entrepôts auxiliaires tels que « gretel-blueprints » (85 étoiles) et « gretel-python-client » (64 étoiles) sous l'organisation.
Signal de consolidation de l'industrie : début 2026, Gretel a été acquis par NVIDIA et le nom de domaine « gretel.ai » redirige désormais vers la page de la solution de données synthétiques NVIDIA. Cela signifie que NVIDIA considère les capacités de données synthétiques de Gretel comme une pièce clé du puzzle de son infrastructure de données AI Agent, formant une liaison de données complète avec la plate-forme de réglage fin du modèle Nemo NeMo. L’acquisition elle-même constitue la plus haute reconnaissance de la valeur de la technologie de Gretel.
Clients d'entreprise et financement : Gretel a répondu aux besoins en données synthétiques de nombreuses sociétés financières, médicales et technologiques au cours de son activité indépendante, mais la liste spécifique des clients et le montant du tour de financement n'ont pas été entièrement divulgués. Après l'acquisition, ses entreprises clientes ont migré vers l'écosystème NVIDIA.
Avantage de coût
Côté C/utilisateurs individuels : la bibliothèque Python open source de Gretel gretel-synthetics reste publiquement disponible sur PyPI, et les développeurs individuels peuvent l'installer et l'utiliser sans frais. Le quota gratuit de la plateforme SaaS d'origine (comme le nombre d'enregistrements gratuits générés chaque mois) a pris fin lorsque la plateforme a été mise hors ligne.
Développeurs/Utilisateurs d'API : L'API Gretel REST d'origine (appelée via gretel-python-client) n'est plus disponible de manière autonome. Pour les développeurs qui souhaitent consommer des fonctionnalités de données synthétiques via des API, ils doivent se tourner vers le service de données synthétiques (NeMo Data Designer) de la plateforme NVIDIA Nemotron. Le modèle de tarification est basé sur la page de tarification officielle de NVIDIA.
Déploiement en entreprise/privé : la bibliothèque open source prend en charge le déploiement localisé pour exécuter la génération de données synthétiques sur votre propre infrastructure sans avoir besoin d'une connexion réseau. Les entreprises peuvent créer leurs propres pipelines basés sur des « gretel-synthétiques », et le coût est limité aux ressources matérielles (GPU recommandé) et à la main d'œuvre d'exploitation et de maintenance. Les solutions de données synthétiques de NVIDIA Enterprise nécessitent une licence via les canaux commerciaux NVIDIA.
Fonctions principales
-
Synthèse de données tabulaires structurées : basé sur le modèle ACTGAN (Anyway CTGAN), il peut apprendre la distribution et la corrélation des colonnes à partir de données tabulaires réelles et générer des ensembles de données synthétiques avec une fidélité statistique élevée. Prend en charge des fonctionnalités de niveau entreprise telles que la détection automatique du type de colonne, la gestion du proxy NaN optimisée en mémoire, et bien plus encore. Convient pour la désensibilisation des bases de données, la génération de données de test, l'amélioration des données et d'autres scénarios.
-
Synthèse de données de séries chronologiques : basé sur Timeseries DGAN (implémentation PyTorch de DoppelGANger), il est spécialement conçu pour les données dépendant du temps telles que les lectures de capteurs de maison intelligente et les journaux d'appareils IoT de séries chronologiques financières. Préservez l’autocorrélation et les dépendances croisées des données de séries chronologiques.
-
Protection différentielle de la vie privée : capacités de différenciation de base - peuvent non seulement « ressembler à des données réelles », mais également fournir des garanties quantifiables de protection de la vie privée grâce au mécanisme de confidentialité différentielle (confidentialité différentielle). Les utilisateurs peuvent contrôler le budget de confidentialité via des paramètres et faire un compromis entre l'utilité des données et l'intensité de la protection de la vie privée.
-
Rapport sur la qualité des données et la confidentialité : après avoir généré des données synthétiques, Gretel génère automatiquement des rapports sur la qualité des données (couvrant les comparaisons de distribution de colonnes, les matrices de corrélation, les taux de champs manquants, etc.) et des rapports d'évaluation de la confidentialité (scores de risque de confidentialité, évaluations des risques d'inférence des membres) pour aider les utilisateurs à vérifier si les données synthétiques atteignent l'efficacité attendue.
-
Code Synth (Code Data Synthesis) : direction expérimentale : expansion des données de formation pour les modèles de programmation d'IA grâce à la synthèse de code. Le référentiel
gretel-code-syntha exploré cette direction, mais seulement au stade du prototype.
Vue d'expert : La valeur fondamentale de Gretel ne réside pas dans la seule fonction de "génération de données", mais dans la combinaison de "protection de la vie privée + évaluation de l'utilité des données" - elle génère non seulement des données synthétiques, mais quantifie également la performance des données synthétiques en matière de risque de fuite de confidentialité. Ce mécanisme collaboratif « génération-évaluation » revêt une importance technique pratique dans des scénarios réglementaires stricts tels que la conformité financière et le partage de données médicales. Après avoir été intégrée par NVIDIA, cette fonctionnalité a été intégrée au module Safe Synthesizer de la plateforme Nemotron et collabore avec l'outil de conception visuelle de NeMo Data Designer pour abaisser le seuil d'utilisation des données synthétiques.
Evolution du modèle et de la version
Phase de développement de la bibliothèque open source (2019-2025)
La bibliothèque open source principale de Gretel, « gretel-synthetics », a traversé un cycle d'itération complet, évoluant du modèle LSTM initial basé sur TensorFlow à une bibliothèque complète prenant en charge des architectures de plusieurs générations.
Première version (v0.1 à v0.17) : principalement basée sur le modèle LSTM basé sur TensorFlow, prenant en charge la synthèse de texte structurée et jetant les bases de l'infrastructure.
Version intermédiaire (v0.18 – v0.21) : présentation d'ACTGAN (extension CTGAN basée sur SDV) pour prendre en charge les données tabulaires ; ajout de Timeseries DGAN (basé sur DoppelGANger) pour couvrir les scénarios de séries chronologiques. Cette phase a vu la transformation d'un LSTM unique vers une stratégie multimodèle.
Version ultérieure (v0.22.x, 2024-2025) : période de maintenance, axée sur les mises à jour de sécurité des dépendances (jinja2, axios, compatibilité TensorFlow), la mise à niveau de la version Python (vers 3.11.9) et la suppression du runtime LSTM obsolète. La v0.22.20 est la version finale.
Chronologie des versions
| Version | Dates | Changements critiques |
|---|---|---|
| v0.22.20 | 2025-06-25 | Python 3.11.9, supprime la dépendance TensorFlow, dépend de la mise à jour de sécurité |
| v0.22.19 | 2025-02-26 | Supprimez le runtime LSTM et abaissez le seuil d'assertion des tests de synchronisation |
| v0.22.17 | 2025-01-29 | Correction de la dépendance de construction de documents |
| v0.22.16 | 2024-12-11 | Maintenance des dépendances et de la compatibilité |
| v0.22.15 | 2024-12-05 | Correction de la dépendance TensorFlow/protobuf |
| v0.22.14 | 2024-10-30 | Supprimer l'intégration des notifications Slack |
| v0.22.13 | 2024-10-09 | Mise à jour TensorFlow 2.12.1 |
| v0.22.12 | 2024-09-11 | Correctifs généraux |
| v0.22.11 | 2024-06-27 | Correctifs généraux |
| v0.22.10 | 2024-05-15 | Proxy NaN pour les calculs de corrélation |
Phase post-acquisition (2026-présent)
Le 18 février 2026, l'organisation GitHub de Gretel a été marquée comme archivée par l'administrateur et tous les référentiels sont devenus en lecture seule. Le domaine « gretel.ai » a commencé à être redirigé vers NVIDIA. Les capacités techniques de Gretel, en particulier la génération de données synthétiques différentiellement privées, sont intégrées dans les composants NeMo Data Designer et Safe Synthesizer de la plate-forme NVIDIA Nemotron. Les utilisateurs SaaS d'origine ont été migrés vers l'écosystème NVIDIA.
Avantages techniques
Base théorique de la protection de la vie privée : la principale différence technique de Gretel réside dans l'intégration technique de la théorie de la confidentialité différentielle (Differential Privacy) dans le processus de génération de données synthétiques. En injectant du bruit contrôlé dans le processus de formation, la difficulté de déduire des enregistrements individuels originaux à partir de données synthétiques est théoriquement quantifiable. Cela signifie que les data scientists peuvent répondre avec précision : « Quelle est la probabilité que cet ensemble de données synthétiques divulgue des informations réelles sur un utilisateur ? »
Mécanique → Effets → Scénarios :
- Mécanisme : appliquez une perturbation différentielle de la confidentialité (via des algorithmes tels que DP-SGD) à la fonction de gradient ou de perte pendant la phase de formation du modèle au lieu d'une désensibilisation post-traitement après la génération.
- Effet : les données synthétiques conservent les caractéristiques de distribution des données d'origine (moyenne, variance, corrélation) au niveau statistique, mais offrent une garantie de protection de la vie privée au niveau des enregistrements individuels.
- Scénario : lorsque des instituts de recherche médicale partagent des données sur des patients, ils peuvent utiliser Gretel pour générer des ensembles de données protégés par la confidentialité et destinés à être utilisés par des partenaires externes ; les institutions financières peuvent utiliser des données synthétiques pour remplacer les enregistrements de transactions sensibles lors du développement de modèles.
Sagesse technique pour les stratégies multimodèles : Gretel ne s'appuie pas sur un algorithme à génération unique, mais propose trois modèles : ACTGAN (données tabulaires), Timeseries DGAN (données de séries chronologiques) et LSTM (texte, obsolète). Cette conception de « sélection de modèles par type de données » évite le compromis de performances provoqué par le « modèle universel ». En utilisation réelle, il est nécessaire de sélectionner un modèle approprié en fonction du formulaire de données.
Le coût de la confidentialité différentielle : L'ajout de la confidentialité différentielle réduira inévitablement la fidélité statistique des données synthétiques. Plus le budget de confidentialité $\epsilon$ est petit (plus la protection est forte), plus la perte d'utilité des données est importante. Gretel permet aux utilisateurs de choisir un point d'équilibre sur la courbe confidentialité-utilité, mais les équipes d'ingénierie doivent évaluer la tolérance de l'exactitude des données pour des scénarios commerciaux spécifiques.
Comment utiliser
Méthode 1 : Utiliser la bibliothèque Python open source (actuellement disponible)
#Installer Gretel-synthetics
pip installer gretel-synthétiques
# Remarque : les dépendances doivent être installées manuellement
pip install torch==2.0 # pour Timeseries DGAN ou ACTGAN (via SDV)
# ou
pip install sdv <0,18 # pour ACTGAN
Processus d'utilisation de base :
- Préparer les données d'entraînement (Pandas DataFrame)
- Configurez les paramètres de formation (sélectionnez le modèle, le budget de confidentialité, etc.)
- Entraînement du modèle synthétique
- Générer des enregistrements synthétiques
- Évaluer la qualité des données synthétiques
Des didacticiels détaillés peuvent être trouvés dans le répertoire examples/ du référentiel GitHub avec des exemples Jupyter Notebook, ou exécutés en ligne via Google Colab.
Méthode 2 : écosystème NVIDIA Nemotron (actuellement recommandé)
Les capacités de Gretel sont intégrées à NVIDIA NeMo Data Designer :
- Visitez « https://build.nvidia.com/nemo/data-designer »
- Configurer l'ensemble de données de départ et les colonnes synthétiques
- Sélectionnez le niveau de protection de la vie privée
- Aperçu et génération par lots
Cette méthode convient aux utilisateurs d'entreprise qui ont besoin d'un SLA au niveau de l'entreprise, d'une interface d'exploitation visuelle et d'une production à grande échelle.
Troisième méthode : NVIDIA Safe Synthesizer (scénario de conformité en matière de confidentialité)
Pour les scénarios de génération de données qui nécessitent la conformité HIPAA/GDPR, utilisez le composant Safe Synthesizer de la plate-forme NVIDIA Nemotron, qui hérite et étend les capacités de confidentialité différentielles de Gretel.
Prix des produits
| Niveaux | Modèle de tarification | Descriptif |
|---|---|---|
| Bibliothèque open source (auto-hébergée) | Gratuit | Package PyPI gretel-synthetics, entièrement gratuit, sans limite d'utilisation |
| Concepteur de données NVIDIA NeMo | Soumis aux tarifs officiels NVIDIA | Fournit un concepteur visuel, une génération à grande échelle et un support au niveau de l'entreprise |
| Licence Entreprise NVIDIA | Contacter NVIDIA Entreprise | Comprend SLA, certification de conformité et options de déploiement privé |
La tarification SaaS originale de Gretel (basée sur un nombre record d'abonnements) a été mise hors ligne avec la plateforme et n'est plus disponible. Les capacités actuelles de données synthétiques sont fournies via l'écosystème NVIDIA. Le prix spécifique est soumis aux informations en temps réel sur la page de tarification officielle de NVIDIA. Il est recommandé aux utilisateurs professionnels de confirmer les conditions commerciales auprès de l'équipe commerciale de NVIDIA.
Scénarios d'application
-
Désensibilisation des données et partage de conformité : les institutions financières doivent partager les données de transaction avec des développeurs externes de modèles de contrôle des risques, mais sont soumises à des réglementations en matière de confidentialité telles que le RGPD/CCPA. L'utilisation d'ACTGAN de Gretel pour générer des données de transaction synthétiques présentant des caractéristiques statistiques similaires, combinée à une protection différentielle de la confidentialité, peut non seulement répondre aux besoins de développement de modèles, mais également réussir les audits de conformité. Objectif de vérification : si le budget de confidentialité $\epsilon$ est défini pour répondre aux exigences légales et si les données synthétiques conservent les caractéristiques d'origine dans les indicateurs clés (tels que la répartition des taux de fraude).
-
Génération de données de formation des agents IA : lors de la création d'agents IA conversationnels, les données de conversation réelles sont souvent rares et sensibles. Les capacités de données synthétiques de Gretel (maintenant NVIDIA Nemotron) peuvent générer des ensembles de données de conversation diversifiés à grande échelle à partir d'un petit nombre de conversations de départ, couvrant des scénarios de pointe et des variations d'intention. Points clés de vérification : Si la diversité et le naturel du dialogue synthétique sont suffisants pour couvrir la distribution à longue traîne du dialogue réel.
-
Tests d'apprentissage automatique et CI/CD : le pipeline d'intégration continue nécessite une grande quantité de données de test pour vérifier l'exactitude de la logique de traitement des données. Gretel peut générer des ensembles de données synthétiques structurellement cohérents à partir du schéma de la base de données de production pour les tests unitaires et les tests d'intégration, empêchant ainsi la copie des données de production dans l'environnement de développement. Points clés de vérification : si les données synthétiques couvrent complètement les contraintes de données (clés uniques, clés étrangères, plages de valeurs d'énumération, etc.).
-
Recherche sur les données médicales : lorsque les hôpitaux collaborent avec des instituts de recherche, les données des patients sont strictement protégées par la HIPAA. Les données synthétiques différentiellement privées de Gretel peuvent générer des dossiers de patients synthétiques avec des caractéristiques statistiques cohérentes sans exposer les informations individuelles des patients, prenant en charge des scénarios tels que la recherche épidémiologique et l'analyse des effets des traitements. Objectif de la vérification : si l'ajout d'une confidentialité différentielle entraîne la perte des caractéristiques des maladies rares et affecte la validité des conclusions de la recherche.
Personnes concernées
-
Ingénieur en matière de confidentialité et de conformité des données : nécessité de fournir des ensembles de données « utilisables mais non traçables » à des tiers sans enfreindre les réglementations en matière de confidentialité. Le rapport différentiel de confidentialité et le score de confidentialité de Gretel fournissent des preuves vérifiables de conformité. Cependant, veuillez noter : la confidentialité différentielle ne peut pas éliminer complètement le risque de ré-identification, et l'équipe de conformité doit toujours travailler avec un conseiller juridique pour évaluer des scénarios spécifiques.
-
Data Scientists et ML Engineers : utilisez des données synthétiques pour améliorer les données lorsque les données de formation sont insuffisantes ou que la distribution des données est déséquilibrée. La stratégie multimodèle de Gretel permet aux data scientists de choisir l'algorithme de génération le plus approprié en fonction du type de données (tabulaire/série chronologique/texte). Scénarios inappropriés : dans les scénarios où l'authenticité des données synthétiques est extrêmement élevée (comme l'utilisation directe de données synthétiques pour entraîner un modèle de production), il est recommandé d'utiliser d'abord des expériences à petite échelle pour vérifier l'amélioration de l'effet de modèle des données synthétiques.
-
Ingénieur DevOps/QA : Une grande quantité de données de test est nécessaire pour vérifier l'exactitude et les conditions limites du pipeline de traitement des données. La bibliothèque open source de Gretel peut être intégrée aux pipelines CI/CD pour générer des données de test à la demande. Mais attention : les bibliothèques open source ne fournissent pas de garanties d'intégrité des contraintes de données (comme la cohérence des clés étrangères), et la synthèse de schémas complexes nécessite un travail d'ingénierie supplémentaire.
-
Décideurs de sélection de technologies d'entreprise : lors de l'évaluation des outils de données synthétiques, l'héritage open source de Gretel (« gretel-synthetics ») est l'implémentation de référence de choix pour la validation technique. Cependant, les solutions de données synthétiques à grande échelle orientées vers la production devraient évaluer directement toutes les capacités de la plateforme NVIDIA Nemotron. Ne convient pas à la limite : Si vous avez besoin d'un service SaaS purement géré qui ne repose pas sur l'écosystème NVIDIA, Gretel n'est plus adapté : le SaaS d'origine a été hors ligne et vous devez vous tourner vers d'autres fournisseurs de données synthétiques indépendants.
Résumé et Outlook
En tant que pionnier dans le domaine de la génération de données synthétiques, la principale contribution de Gretel réside dans la combinaison de la théorie différentielle de la confidentialité avec la pratique de l'ingénierie pour créer un flux de travail complet de synthèse de données de « génération-évaluation-conformité ». Sa bibliothèque open source « gretel-synthetics » fournit à l'industrie une implémentation de base vérifiable de données synthétiques préservant la confidentialité.
Acquis par NVIDIA et intégré à l'écosystème Nemotron/NeMo, il marque la tendance du secteur où les données synthétiques passent d'outils indépendants à une infrastructure de plateforme. L'ADN technique de Gretel fait désormais partie de la stratégie de données d'IA de NVIDIA, formant une synergie approfondie avec le framework LangChain Agent de la plate-forme de réglage fin du modèle Nemotron NeMo.
Limites et incertitudes actuelles :
- Le SaaS indépendant a été hors ligne et l'expérience utilisateur d'origine (interface utilisateur Web, gestion des clés API, collaboration en équipe) ne peut pas être reproduite.
- Bien que la bibliothèque open source soit disponible, l'état de maintenance à long terme est inconnu (l'entrepôt a été archivé et il n'y a aucun signe évident de prise de contrôle active du fork communautaire).
- Au sein de l'écosystème NVIDIA, il n'existe pas de feuille de route publique indiquant si les capacités de différenciation différentielle de Gretel sont entièrement intégrées aux gammes de produits originales de NVIDIA (telles que NeMo Safe Synthesizer) et si une marque indépendante restera.
Évaluation des risques d'approvisionnement/d'adoption :
- Vérification technique : la bibliothèque open source de "gretel-synthetics" convient à la preuve de concept technique de données synthétiques de confidentialité différentielle et peut être démarrée sans frais.
- Utilisation en production : il est recommandé d'évaluer directement le service de données synthétiques (NeMo Data Designer + Safe Synthesizer) de la plateforme NVIDIA Nemotron pour confirmer s'il répond aux exigences de conformité en matière de confidentialité et d'échelle de données SLA.
- Coûts de migration : Si vous disposez déjà d'actifs existants sur Gretel SaaS, vous devez contacter NVIDIA pour confirmer le plan de migration ; si vous démarrez un nouveau projet, il est recommandé d'utiliser l'écosystème NVIDIA comme point de départ de l'évaluation par défaut.
- Verrouillage du fournisseur : choisir l'écosystème NVIDIA signifie accepter sa dépendance à la plate-forme, et il est recommandé d'évaluer également les alternatives open source (telles que SDV, YData Synthetic) comme alternatives pendant la phase PoC.
Informations de version
- gretel-synthétiques v0.22.20 :Mise à jour des dépendances axios et jinja2, suppression des dépendances TensorFlow, mise à niveau de Python vers 3.11.9 et réduction du seuil d'assertion du test DGAN de synchronisation. Il s'agit de la dernière version publique de Gretel au cours de son fonctionnement indépendant, et a été archivée dans le référentiel GitHub le 18/02/2026.
- gretel-synthétiques v0.22.19 :Rétrogradez setuptools_scm, supprimez le runtime LSTM, corrigez le rapport MM. Il n’y a pas encore de date officielle précise.
- gretel-synthétiques v0.22.17 :Correction de la version de documentation, mise à jour de jinja2 vers 3.1.5. Il n’y a pas encore de date officielle précise.
- gretel-synthétiques v0.22.10 :Remplacement du proxy NaN pour les calculs de corrélation, mise à jour de la dépendance jinja2. Il n’y a pas encore de date officielle précise.
Avis des utilisateurs