Mostly AI
免费
Mostly AI 是源于奥地利的开源合成数据平台,提供 SDK 与数据智能平台两种交付形态。核心基于 TabularARGN 深度生成架构,支持表格与文本数据的训练、生成与质量校验。2026 年 6 月被 Syntho 收购,现以 "MOSTLY AI, powered by Syntho" 品牌运营。
Mostly AI 的合成数据平台
核心参数与统计
| 参数 | 值 |
|---|---|
| 产品定位 | 开源合成数据生成平台 |
| 交付形态 | Python SDK(开源)+ 数据智能平台(企业级) |
| 开源许可 | Apache 2.0(SDK) |
| 核心架构 | TabularARGN(深度生成模型) |
| 支持数据类型 | 表格(单表/多表/时序)、文本 |
| 支持平台 | Web(平台)、API、桌面端(SDK 本地运行) |
| GitHub Stars | ~784 |
| GitHub Forks | ~68 |
| 总发布数 | 116 个 Release |
| 最新版本 | 6.1.1(2026-05-08) |
| 归属地 | 奥地利(AT) |
| 当前运营方 | Syntho(荷兰,2026 年 6 月收购) |
Mostly AI 以「合成数据民主化」为核心理念,将数据生成能力从企业数据科学家扩展到普通开发者。开源 SDK 提供本地优先的 Python 工具链,企业平台则提供可视化的数据探索、协作与分享能力。两种形态覆盖从个人实验到企业级合规部署的全场景。
用户与市场认可
- 企业客户:公开案例包括 Swiss Post(将客户数据可用性从 11% 提升至 100%)、Erste Group(在 Databricks 有境中用合成数据加速模型开发)、AWS(用于客户云迁移中的数据解锁)、Databricks(用于 Clean Room 跨行业数据协作)。
- 金融与保险行业:JPMorgan 利用合成数据沙箱加速第三方 POC;Anthem 用合成数据检测欺诈并个性化服务;Telefónica 用合成客户数据进行分析。
- 开源社区:GitHub 784 Stars、68 Forks、116 个 Release、20 位贡献者,PyPI 下载量持续增长。项目在 Apache 2.0 许可下运营,接受社区贡献。
- 行业认可:被 Gartner 列为合成数据代表厂商。Gartner 预测「到 2030 年,用于 AI 和分析项目开发的大部分数据将是合成生成的」。
成本优势
C 端 / 个人开发者:开源 SDK 完全免费(Apache 2.0 许可),可通过 pip/uv 安装 mostlyai[local] 在本地 CPU/GPU 有境运行。个人学习、实验与原型开发无显性费用,仅需承担本地计算资源成本。
API / 开发者:SDK 支持 LOCAL 模式(本地训练推理)与 CLIENT 模式(连接远程 SDK 端点)。CLIENT 模式和平台 API 的具体计费方式未公开,需联系 Syntho 商务获取报价。PyPI 包本身免费,但使用远程端点涉及平台资源消耗。
企业 / 私有化:企业级 Data Intelligence Platform 支持 Kubernetes/OpenShift 私有化部署,费用取决于数据量、节点数、用户数与支持级别。官方无公开价格表,以商务合同为准。开源 SDK 也可在企业内网离线部署,但 Hugging Face 模型下载在离线有境中需手动传输文件。
隐性成本:训练大型语言模型需要 GPU 资源(官方推荐现代 GPU 用于 LLM 微调推理);表格数据训练在 CPU 上即可高效运行。企业部署需自行维护 Kubernetes 基础设施。
主要功能
-
AI 生成合成数据:基于 TabularARGN 深度生成模型,从真实样本数据中学习统计分布与关联结构,生成统计特征一致的合成数据。支持单表、多表关系、时序数据与文本数据。自动附带质量保证报告(Model Insight Report),校验保真度与隐私安全。
-
AI Assistant:自然语言驱动的数据分析助手,无需写代码即可对生产数据执行探索性分析、趋势监控与模式发现。底层自动生成并执行 Python 代码,适合业务分析师使用。
-
Mock Data 模拟数据:基于规则与随机性生成模拟数据,无需真实样本。适合开发有境Demo 演示、原型测试等场景。相比纯规则工具,Mock Data 能生成更真实的上下文数据。
-
Simulated Data 场景推演:基于真实或合成数据建模,推演边缘案例、未来场景与"what-if"条件。适合压力测试、策略验证与算法鲁棒性评估。
-
合成数据 SDK:Python 工具包,提供
mostly.train()、mostly.generate()、mostly.probe()、mostly.connect()四个核心 API。支持 GPU/CPU 训练、差分隐私、条件采样、公平性控制、温度调节等高级选项。生成器可导出并在平台中共享。
模型与版本演进
主线迭代
Mostly AI 的开源 SDK 自 2023 年首次发布以来,经历了从平台绑定到本地优先的架构演进。以下是主要版本里程碑:
-
2023 - v1.0(初始开源):基于 TabularARGN 架构的首个开源版本,支持单表/多表合成数据生成与质量报告。采用 Apache 2.0 许可。
-
2025 Q4 - v5.9.0:新增 OAuth2 集成支持,改进了与外部数据源的连接能力。
-
2026 Q1 - v5.10.0:引入业务规则约束系统(Inequality、FixedCombinations),使生成数据可遵守特定列间关系约束。升级引擎至 2.4,PyTorch 2.9.1。
-
2026 Q2 - v6.0.0:重大架构重构——SDK 彻底本地优先化,移除仅平台相关的接口与 Hive/Databricks/Redshift 连接器。CLIENT 模式作为独立轻量安装选项保留。
-
2026 Q2 - v6.1.0/6.1.1:引擎迭代至 2.6.1,QA 模块至 1.10.6,持续提升训练效率与生成质量。
技术白皮书
2025 年发布 arXiv 论文《Democratizing Tabular Data Access with an Open-Source Synthetic-Data SDK》(arXiv:2508.00718),系统阐述了 SDK 架构TabularARGN 模型设计与质量评估体系。
技术优势
TabularARGN 架构:Mostly AI 的核心技术优势在于 TabularARGN(arXiv:2501.12012)深度生成模型。该架构在保持最佳合成数据质量的同时,训练效率比同类模型高 1-2 个数量级。这使得在 CPU 有境下也能在数分钟内完成百万级记录的训练与生成——不是通过压缩模型规模,而是通过优化训练算法的计算效率实现。
灵活的多模型支持:表格数据采用 TabularARGN,图关系采用 DNN 匹配,文本数据可用基础 LSTM(LSTMFromScratch-3m)或微调 Hugging Face Hub 上任意 AutoModelForCausalLM 模型。这种分层策略确保不同类型的数据使用最适合的生成方法。
内置质量保证:每个生成的 Generator 自动附带 Model Insight Report,提供保真度与隐私指标的可视化报告。生成时就防止过拟合与泄露,而非事后检测。
高级采样能力:支持上采样到任意数据量、基于任意列的条件模拟(如"生成 1 万条 24 岁男性记录")、欠表征群体重平衡、上下文感知数据插补、统计公平性控制与温度调节规则约束。这些能力让合成数据不仅是"复制",而是有目标的数据增强。
差分隐私:训练时可启用差分隐私保护,为数据发布提供可量化的隐私预算保障。
如何使用
开源 SDK 快速上手
# 安装
# pip install -U 'mostlyai[local]'
from mostlyai.sdk import MostlyAI
# 初始化 SDK(LOCAL 模式)
mostly = MostlyAI()
# 1. 从文件导入预训练生成器
g = mostly.generators.import_from_file(
"https://github.com/mostly-ai/public-demo-data/raw/dev/census/census-generator.zip"
)
# 2. 探测生成 1000 条代表性样本
df = mostly.probe(g, size=1000)
# 3. 基于固定列值生成
df = mostly.probe(g, seed=[{"age": 24, "sex": "Male"}] * 10_000)
# 4. 训练自己的生成器
import pandas as pd
original_df = pd.read_csv(
"https://github.com/mostly-ai/public-demo-data/raw/dev/titanic/titanic.csv"
)
g = mostly.train(name="Titanic Demo", data=original_df)
# 5. 查看质量报告
g.reports(display=True)
# 6. 生成合成数据集
sd = mostly.generate(g)
df = sd.data()
企业平台
Data Intelligence Platform 通过浏览器访问,提供:
- 数据源连接:直连 Databricks、Snowflake、Postgres 等数据平台
- AI Assistant:自然语言查询与分析
- 项目协作:团队共享生成器、数据集与分析报告
- 安全部署:支持 Kubernetes/OpenShift 私有化部署
三种运行模式
| 模式 | 安装方式 | 适用场景 |
|---|---|---|
| LOCAL(默认) | mostlyai[local](含 PyTorch) |
本地开发、个人实验、离线有境 |
| CLIENT | mostlyai(轻量) |
连接远程 SDK 端点 |
| Docker | Dockerfile 构建 | 隔离有境CI/CD 集成 |
产品定价
Mostly AI 采用开源 + 企业平台的混合定价模式:
- 开源 SDK:完全免费,Apache 2.0 许可。可在本地无限使用,无功能限制。
- 企业数据智能平台:按私有化部署或 SaaS 订阅计费。具体价格未公开,需联系 Syntho 商务([email protected])获取报价。定价因素包括数据量、用户数、部署节点与支持级别。
- CLIENT 模式:连接远程端点时涉及平台资源消耗,计费方式未公开。
注:2026 年 6 月 Syntho 收购后,产品路线图与定价策略可能调整,以官方实时页面为准。
应用场景
-
AI/ML 开发训练:为机器学习模型生成保真度高的训练数据,解决真实数据稀缺、标签不均衡或隐私受限的问题。可上采样欠表征群体、校正数据偏差。落地提示:先用小样本做 Crawl/Walk/Run 渐进训练,验证生成质量后再扩展。
-
测试数据与 QA:为开发/测试/预发布有境生成拟真的结构化测试数据,消除生产数据敏感信息泄露风险。适合集成测试、压力测试、端到端验收。落地提示:Mock Data 适用于无严格统计要求的场景,合成数据适用于需要真实数据分布的场景。
-
数据共享与协作:生成隐私安全的合成数据集,跨团队、跨组织分享数据而不暴露 PII。支持 Clean Room 有境下的安全数据协作。落地提示:启用差分隐私功能可提供可量化的隐私保障,适用于合规审计场景。
-
Demo 与原型展示:为销售演示、产品原型、概念验证生成逼真但不含敏感信息的数据集,加速客户沟通与反馈周期。
-
数据增强与偏差校正:在原始数据基础上补充边缘案例或欠表征群体,提升模型的泛化能力与公平性。
适用人群
-
数据科学家与 ML 工程师:用 SDK 在 Python 工作流中直接生成高质量合成数据,无需离开 Notebook 有境。适合需要频繁迭代训练数据的团队。
-
数据工程师与 DevOps:用 Docker 或 CLI 模式将合成数据生成嵌入 CI/CD 流水线,为测试有境自动供应安全数据。不适合对数据生成延迟有极端要求的实时场景。
-
业务分析师与合规团队:用平台 AI Assistant 以自然语言探索数据,无需编写代码即可获取分析洞察。不适合需要深度定制生成模型的场景。
-
企业数据平台团队:需要跨团队共享数据但又受限于隐私合规的组织,可用 Mostly AI 创建合成数据沙箱。前置条件:需具备 Kubernetes 运维能力。
-
不适用人群:
- 需要图像、音频、视频等非结构化合成数据的场景(Mostly AI 专注表格与文本)
- 对生成数据有极端实时性要求(亚秒级)的场景
- 不需要统计真实性、仅需完全随机占位数据的场景(规则 Mock 工具更轻量)
总结与展望
Mostly AI 的核心竞争力在于 TabularARGN 架构的高效性与开源策略——它是少数提供 Apache 2.0 许可、且训练效率比竞品高 1-2 个数量级的合成数据平台。从 Swiss Post 到 JPMorgan 的企业案例验证了其在金融、电信、医疗等强监管行业的落地能力。
当前限制与不确定项:
- 2026 年 6 月被 Syntho 收购后,产品整合方向、品牌策略与定价模式可能发生变化,企业采购前需关注 Syntho 的后续产品公告。
- 企业平台定价未公开,需联系商务获取合同报价,难以直接做竞品成本对比。
- 文本数据生成依赖 Hugging Face 模型,在离线/气隙有境中部署需要额外的人工模型传输步骤。
- 图像/音频/视频等非结构化数据不在支持范围内。
采购/采用风险评估:企业采购 Mostly AI 平台前需重点核验:① Syntho 收购后对现有 SDK 开源策略(是否有闭源化风险);② 企业版的实际部署成本与最小资源要求;③ 对中文等多语种数据的生成质量;④ 私有化部署的合规认证(如 SOC2、GDPR 符合性)。建议先用开源 SDK 做 POC 验证生成质量,确认满足业务需求后再进行企业版商务谈判。
限制与不适配场景
该工具在以下场景中存在使用限制:
场景适配边界 需要高度行业专业知识的任务、对输出格式有严格规范的场景、需要零错误的自动化流程可能效果不达预期。AI 输出应作为初稿或辅助参考,最终结果需人工核验。
技术限制 上下文长度有限、复杂推理准确性可能不足、免费版有使用额度。建议在正式采用前通过试用验证核心场景的可用性。
版本信息
- SDK Release 6.1.1 :更新引擎 2.6.1 与 QA 1.10.6,升级 Dependabot 锁文件。
- SDK Release 6.1.0 :更新引擎 2.6.0 与 QA 1.10.5。
- SDK Release 6.0.0 :SDK 本地优先重构,移除仅平台相关的接口与 Hive/Databricks/Redshift 连接器。
- SDK Release 5.10.0 :引入业务规则约束(Inequality 与 FixedCombinations),升级引擎 2.4 与 PyTorch 2.9.1。
- SDK Release 5.9.0 :新增 OAuth2 集成支持。
- Initial Open Source Release :SDK 首个开源版本,基于 TabularARGN 架构,支持单表/多表合成数据生成。暂无官方精确日期。
用户评价