Gretel 免费

-

Gretel 是一个面向企业和开发者的合成数据生成平台,提供结构化表格数据、时序数据和文本数据的差分隐私合成能力。其开源的 gretel-synthetics 库(PyPI 0.22.20)支持 ACTGAN、Timeseries DGAN 等模型,已被 NVIDIA 收购并整合至 Nemotron/NeMo 生态,原 SaaS 平台已停止独立运营。

Gretel 产品界面

Gretel 的深度评测:合成数据生成平台的全景与终局

核心参数与统计

维度 规格
产品定位 差分隐私合成数据生成平台(结构化/时序/文本)
当前状态 已被 NVIDIA 收购整合,独立 SaaS 已停止运营
开源许可 Gretel Source Available License(主库)/ Apache-2.0(客户端等)
支持平台 Web(已停服)、API(已停服)、Python SDK(开源可用)
编程语言 Python(99.7%),辅以 Shell、Jupyter Notebook
GitHub Stars 685(gretel-synthetics 主库)
GitHub Forks 101
组织仓库数 30(全部已归档)
最后版本 v0.22.20(2025-06-25)
归档日期 2026-02-18
PyPI 下载量 公开可用
核心模型 ACTGAN、Timeseries DGAN、LSTM(已弃用)

Gretel 的独立运营生命周期跨越约 7 年(2018–2025),最终以被 NVIDIA 收购并整合至 Nemotron/NeMo 生态为终点。其开源资产(尤其是 gretel-synthetics 库)仍可独立使用,但 SaaS 控制面与云端 API 已随收购下线。对于评估合成数据工具的技术团队来说,Gretel 的开源库仍是参考价值极高的差分隐私合成数据实现。

用户与市场认可

GitHub 社区基础gretel-synthetics 主库在归档前积累了 685 Stars 和 101 Forks,29 位贡献者参与了代码提交,体现出合成数据领域开发者对该项目的关注。组织下还有 gretel-blueprints(85 Stars)、gretel-python-client(64 Stars)等辅助仓库。

行业整合信号:2026 年初,Gretel 被 NVIDIA 收购,域名 gretel.ai 现已重定向至 NVIDIA 合成数据方案页。这标志着 NVIDIA 将 Gretel 的合成数据能力视为其 AI Agent 数据基础设施的关键拼图,与 Nemotron 模型NeMo 微调平台形成完整数据链路。收购本身即是对 Gretel 技术价值的最高背书。

企业客户与融资:Gretel 在独立运营期间服务于多家金融、医疗和科技企业的合成数据需求,但具体客户名单与融资轮次金额未完整公开。收购后其企业客户已迁移至 NVIDIA 生态。

成本优势

C 端/个人用户:Gretel 的开源 Python 库 gretel-synthetics 在 PyPI 上保持公开可用,个人开发者可以零成本安装使用。原 SaaS 平台的免费额度(如每月免费生成记录数)已随平台下线而终止。

开发者/API 用户:原 Gretel REST API(通过 gretel-python-client 调用)已无法独立使用。对于希望通过 API 消费合成数据能力的开发者,需转向 NVIDIA Nemotron 平台的合成数据服务(NeMo Data Designer),其定价模型以 NVIDIA 官方定价页为准。

企业/私有化部署:开源库支持本地化部署,无需网络连接即可在自有基础设施上运行合成数据生成。企业可以基于 gretel-synthetics 自行构建流水线,成本仅限于硬件资源(GPU 推荐)和运维人力。NVIDIA 企业的合成数据方案则需通过 NVIDIA 商务渠道获取许可。

主要功能

  • 结构化表格数据合成:基于 ACTGAN(Anyway CTGAN)模型,能从真实表格数据学习列分布与相关性,生成统计保真度高的合成数据集。支持自动检测列类型、内存优化NaN 代理处理等企业级特性。适合数据库脱敏、测试数据生成、数据增强等场景。

  • 时序数据合成:基于 Timeseries DGAN(DoppelGANger 的 PyTorch 实现),专门针对智能家居传感器读数、金融时间序列IoT 设备日志等带有时间依赖性的数据设计。保留时序数据的自相关性和跨特征依赖关系。

  • 差分隐私保护:核心差异化能力——不只能"看起来像真实数据",还能通过差分隐私(Differential Privacy)机制提供可量化的隐私保护保证。用户可以通过参数控制隐私预算,在数据效用与隐私保护强度之间做权衡。

  • 数据质量与隐私报告:生成合成数据后,Gretel 自动产出数据质量报告(涵盖列分布对比、相关性矩阵、字段缺失率等)和隐私评估报告(隐私风险评分、成员推断风险评估),帮助用户验证合成数据是否达到预期效用。

  • Code Synth(代码数据合成):实验性方向——通过代码合成扩充 AI 编程模型的训练数据。gretel-code-synth 仓库曾探索此方向,但仅处于原型阶段。

专家视点:Gretel 的核心价值不在于"生成数据"这一单一功能,而在于"隐私保护 + 数据效用评估"的闭有——它不仅生成合成数据,还能量化合成数据在隐私泄露风险上的表现。这种"生成-评估"协同机制在金融合规、医疗数据共享等强监管场景中具有实际工程意义。被 NVIDIA 整合后,这一能力已融入 Nemotron 平台的 Safe Synthesizer 模块,与 NeMo Data Designer 的可视化设计工具协同,降低了合成数据的使用门槛。

模型与版本演进

开源库开发阶段(2019–2025)

Gretel 的核心开源库 gretel-synthetics 经历了完整的迭代周期,从最初的 TensorFlow 为基础的 LSTM 模型,演进到支持多种生成架构的综合库。

早期版本(v0.1–v0.17):基于 TensorFlow 的 LSTM 模型为主,支持结构化文本合成,奠定基础架构。

中期版本(v0.18–v0.21):引入 ACTGAN(基于 SDV 的 CTGAN 扩展),支持表格数据;加入 Timeseries DGAN(基于 DoppelGANger),覆盖时序场景。这一阶段见证了从单一 LSTM 到多模型策略的转型。

后期版本(v0.22.x,2024–2025):维护期,聚焦依赖安全更新(jinja2、axios、TensorFlow 兼容性)、Python 版本升级(至 3.11.9)、移除已弃用的 LSTM 运行时。v0.22.20 为最终版本。

版本时间线

版本 日期 关键变更
v0.22.20 2025-06-25 Python 3.11.9,移除 TensorFlow 依赖,依赖安全更新
v0.22.19 2025-02-26 移除 LSTM 运行时、降低时序测试断言阈值
v0.22.17 2025-01-29 修复文档构建依赖
v0.22.16 2024-12-11 依赖与兼容性维护
v0.22.15 2024-12-05 修复 TensorFlow/protobuf 依赖
v0.22.14 2024-10-30 移除 Slack 通知集成
v0.22.13 2024-10-09 TensorFlow 2.12.1 更新
v0.22.12 2024-09-11 常规修复
v0.22.11 2024-06-27 常规修复
v0.22.10 2024-05-15 NaN 代理用于相关性计算

收购后阶段(2026–今)

2026 年 2 月 18 日,Gretel 的 GitHub 组织被管理员标记为归档状态,所有仓库转为只读。gretel.ai 域名开始重定向至 NVIDIA。Gretel 的技术能力(特别是差分隐私合成数据生成)已融入 NVIDIA Nemotron 平台的 NeMo Data Designer 和 Safe Synthesizer 组件。原 SaaS 用户已迁移至 NVIDIA 生态。

技术优势

隐私保护的理论基础:Gretel 的核心技术差异在于将差分隐私(Differential Privacy)理论工程化地融入合成数据生成流程。通过向训练过程注入受控噪声,使得从合成数据反推原始个体记录的难度在理论上可量化证明。这意味着数据科学家可以精确回答"这个合成数据集泄露某个用户真实信息的概率是多少"。

机制 → 效果 → 场景

  • 机制:在模型训练阶段,对梯度或损失函数施加差分隐私扰动(通过 DP-SGD 等算法),而非在生成后做后处理脱敏。
  • 效果:合成数据在统计层面上保留原始数据分布特征(均值、方差、相关性),但在个体记录层面上提供隐私保护保证。
  • 场景:医疗研究机构在共享患者数据时,可以使用 Gretel 生成隐私保护的数据集供外部合作方使用;金融机构在模型开发中可以用合成数据替代敏感交易记录。

多模型策略的工程智慧:Gretel 不依赖单一生成算法,而是提供 ACTGAN(表格数据)、Timeseries DGAN(时序数据)和 LSTM(文本,已弃用)三种模型。这种"按数据类型选模型"的设计避免了"万能模型"带来的效果折中。实际使用时需要根据数据形态选择合适的模型。

差分隐私的代价:差分隐私的加入会不可避免地降低合成数据的统计保真度。隐私预算 $\epsilon$ 越小(保护越强),数据效用损失越大。Gretel 允许用户在隐私-效用曲线上选择平衡点,但工程团队需要评估具体业务场景对数据精度的容忍度。

如何使用

方式一:使用开源 Python 库(当前可用)

# 安装 gretel-synthetics
pip install gretel-synthetics

# 注意:需手动安装依赖
pip install torch==2.0  # 用于 Timeseries DGAN 或 ACTGAN(通过 SDV)
# 或
pip install sdv<0.18    # 用于 ACTGAN

基本使用流程:

  1. 准备训练数据(Pandas DataFrame)
  2. 配置训练参数(选择模型、隐私预算等)
  3. 训练合成模型
  4. 生成合成记录
  5. 评估合成数据质量

详细教程可在 GitHub 仓库的 examples/ 目录下找到 Jupyter Notebook 示例,或通过 Google Colab 在线运行。

方式二:NVIDIA Nemotron 生态(当前推荐)

Gretel 的能力已整合至 NVIDIA NeMo Data Designer:

  1. 访问 https://build.nvidia.com/nemo/data-designer
  2. 配置种子数据集和合成列
  3. 选择隐私保护级别
  4. 预览并批量生成

此方式适用于需要企业级 SLA、可视化操作界面和大规模生成的企业用户。

方式三:NVIDIA Safe Synthesizer(隐私合规场景)

对于需要 HIPAA/GDPR 合规的数据生成场景,可使用 NVIDIA Nemotron 平台中的 Safe Synthesizer 组件,该组件继承并扩展了 Gretel 的差分隐私能力。

产品定价

层级 定价模式 说明
开源库(自托管) 免费 gretel-synthetics PyPI 包,完全免费使用,无使用次数限制
NVIDIA NeMo Data Designer 以 NVIDIA 官方定价为准 提供可视化设计器、大规模生成、企业级支持
NVIDIA 企业许可 需联系 NVIDIA 商务 含 SLA、合规认证、私有部署选项

Gretel 原 SaaS 定价(基于记录数订阅)已随平台下线而不可用。当前合成数据能力通过 NVIDIA 生态交付,具体价格以 NVIDIA 官方定价页实时信息为准,建议企业用户与 NVIDIA 销售团队确认商务条款。

应用场景

  • 数据脱敏与合规共享:金融机构需要将交易数据共享给外部风控模型开发商,但受限于 GDPR/CCPA 等隐私法规。使用 Gretel 的 ACTGAN 生成统计特征相似的合成交易数据,配合差分隐私保护,既能满足模型开发需求,又能通过合规审计。核验重点:隐私预算 $\epsilon$ 的设定是否满足法务要求,合成数据在关键指标(如欺诈率分布)上是否保留原始特征。

  • AI Agent 训练数据生成:构建对话式 AI Agent 时,真实对话数据往往稀少且敏感。Gretel(现 NVIDIA Nemotron)的合成数据能力可以从少量种子对话生成大规模多样化对话数据集,覆盖边缘场景和意图变体。核验重点:合成对话的多样性和自然度是否足以覆盖真实对话中的长尾分布。

  • 机器学习测试与 CI/CD:持续集成流水线需要大量测试数据验证数据处理逻辑的正确性。Gretel 可以从生产数据库的 schema 生成结构一致的合成数据集,用于单元测试和集成测试,避免生产数据被复制到开发有境。核验重点:合成数据是否完整覆盖了数据约束(唯一键、外键、枚举值范围等)。

  • 医疗数据研究:医院与研究机构合作时,患者数据受 HIPAA 严格保护。Gretel 的差分隐私合成数据可以在不暴露个体患者信息的前提下,生成统计特征一致的合成患者记录,支持流行病学研究、治疗效果分析等场景。核验重点:差分隐私的加入是否导致罕见病的特征丢失,影响研究结论的有效性。

适用人群

  • 数据隐私与合规工程师:需要在不违反隐私法规的前提下,向第三方提供"可用但不可追溯"的数据集。Gretel 的差分隐私报告和隐私评分提供了可审计的合规证据。但需注意:差分隐私并不能完全消除重识别风险,合规团队仍需结合法律顾问评估具体场景。

  • 数据科学家与 ML 工程师:在训练数据不足或数据分布不平衡时,使用合成数据做数据增强。Gretel 的多模型策略让数据科学家可以根据数据类型(表格/时序/文本)选择最适合的生成算法。不适配场景:对合成数据真实度要求极高(如直接用合成数据训练生产模型)的场景,建议先用小规模实验验证合成数据对模型效果的提升。

  • DevOps/QA 工程师:需要大量测试数据验证数据处理管线的正确性和边界条件。Gretel 的开源库可以嵌入 CI/CD 流水线,按需生成测试数据。但需注意:开源库不提供数据约束完整性保证(如外键一致性),复杂 schema 的合成需要额外工程工作。

  • 企业技术选型决策者:评估合成数据工具时,Gretel 的开源遗产(gretel-synthetics)是技术验证的首选参考实现。但面向生产的大规模合成数据方案,应直接评估 NVIDIA Nemotron 平台的完整能力。不适配边界:如果你需要的是纯托管 SaaS 服务且不依赖 NVIDIA 生态,Gretel 已不适合——原 SaaS 已下线,需转向其他独立合成数据厂商。

总结与展望

Gretel 作为合成数据生成领域的先行者,其核心贡献在于将差分隐私理论与工程化实践相结合,打造了"生成-评估-合规"的完整数据合成工作流。其开源库 gretel-synthetics 为行业提供了可验证的隐私保护合成数据基线实现。

被 NVIDIA 收购并整合至 Nemotron/NeMo 生态,标志着合成数据从独立工具走向平台基础设施的行业趋势。Gretel 的技术 DNA 现已成为 NVIDIA AI 数据战略的一部分,与 Nemotron 模型NeMo 微调平台LangChain Agent 框架形成纵深协同。

当前限制与不确定项

  • 独立 SaaS 已下线,原用户体验(Web UI、API Key 管理、团队协作)不可复现。
  • 开源库虽然可用,但长期维护状态不明(仓库已归档,无社区 fork 活跃接管的明显信号)。
  • 在 NVIDIA 生态内,Gretel 的差分化能力是否与 NVIDIA 原有产品线(如 NeMo Safe Synthesizer)完全融合、是否有独立品牌留存,尚无公开路线图。

采购/采用风险评估

  • 技术验证:gretel-synthetics 的开源库适合做差分隐私合成数据的技术概念验证,零成本启动。
  • 生产使用:建议直接评估 NVIDIA Nemotron 平台的合成数据服务(NeMo Data Designer + Safe Synthesizer),确认是否满足隐私合规、数据规模SLA 要求。
  • 迁移成本:如已在 Gretel SaaS 上有存量资产,需联系 NVIDIA 确认迁移方案;如新启动项目,建议默认以 NVIDIA 生态为评估起点。
  • 供应商锁定:选择 NVIDIA 生态意味着接受其平台依赖,建议在 PoC 阶段同时评估开源替代方案(如 SDV、YData Synthetic)作为备选。

限制与不适配场景

该工具在以下场景中存在使用限制:

场景适配边界 需要高度行业专业知识的任务、对输出格式有严格规范的场景、需要零错误的自动化流程可能效果不达预期。AI 输出应作为初稿或辅助参考,最终结果需人工核验。

技术限制 上下文长度有限、复杂推理准确性可能不足、免费版有使用额度。建议在正式采用前通过试用验证核心场景的可用性。

版本信息

  • gretel-synthetics v0.22.20 :更新 axios 和 jinja2 依赖,移除 TensorFlow 依赖,Python 升级至 3.11.9,降低时序 DGAN 测试断言阈值。此为 Gretel 独立运营期间最后一个公开版本,此后 GitHub 仓库于 2026-02-18 归档。
  • gretel-synthetics v0.22.19 :降级 setuptools_scm,移除 LSTM 运行时,修复 MM Report。暂无官方精确日期。
  • gretel-synthetics v0.22.17 :修复文档构建,更新 jinja2 至 3.1.5。暂无官方精确日期。
  • gretel-synthetics v0.22.10 :替换 NaN 代理用于相关性计算,更新 jinja2 依赖。暂无官方精确日期。

用户评价

  • 加载评价中...