グレーテル
無料
Gretel は、企業および開発者向けの合成データ生成プラットフォームであり、構造化された表形式データ、時系列データ、テキスト データの差分プライバシー合成機能を提供します。オープン ソースの gretel 合成ライブラリ (PyPI 0.22.20) は、ACTGAN、Timeseries DGAN、およびその他のモデルをサポートしています。 NVIDIA によって買収され、Nemotron/NeMo エコシステムに統合されました。元の SaaS プラットフォームは単独での運用を停止しました。
グレーテルの詳細なレビュー: 合成データ生成プラットフォームのパノラマと最終段階
コアパラメータと統計
| 寸法 | 仕様 |
|---|---|
| 製品のポジショニング | 差分プライバシー合成データ生成プラットフォーム (構造化/シーケンシャル/テキスト) |
| 現在の状況 | NVIDIA によって買収および統合された独立系 SaaS が運営を停止 |
| オープンソースライセンス | Gretel ソース 利用可能なライセンス (メイン ライブラリ) / Apache-2.0 (クライアントなど) |
| サポートされているプラットフォーム | Web(サービス終了)、API(サービス終了)、Python SDK(オープンソースあり) |
| プログラミング言語 | Python (99.7%)、シェル、Jupyter Notebook で補足 |
| GitHub スター | 685 (gretel-synthetics メイン リポジトリ) |
| GitHub フォーク | 101 |
| 組織倉庫数 | 30 (すべてアーカイブ済み) |
| 最新バージョン | v0.22.20 (2025-06-25) |
| 出願日 | 2026-02-18 |
| PyPIのダウンロード | 一般公開 |
| コアモデル | ACTGAN、時系列 DGAN、LSTM (非推奨) |
Gretel の独立した運用ライフ サイクルは約 7 年 (2018 ~ 2025 年) に及び、NVIDIA による買収と Nemotron/NeMo エコシステムへの統合で最高潮に達しました。そのオープンソース資産 (特に「gretel-synthetics」ライブラリ) は引き続き単独で利用できますが、SaaS コントロール プレーンとクラウド API は買収に伴いオフラインになりました。合成データ ツールを評価する技術チームにとって、Gretel のオープン ソース ライブラリは、差分プライバシー合成データの実装に関して依然として非常に貴重なリファレンスです。
ユーザーと市場の認識
GitHub コミュニティ ベース: 「gretel-synthetics」メイン ライブラリは、アーカイブ前に 685 個のスターと 101 個のフォークを蓄積し、29 人の寄稿者がコードの提出に参加しました。これは、プロジェクトに対する合成データの分野の開発者の注目を反映しています。この組織の下には、「gretel-blueprints」 (スター 85 個) や「gretel-python-client」 (スター 64 個) などの補助ウェアハウスもあります。
業界統合のシグナル: 2026 年初頭に、Gretel は NVIDIA に買収され、ドメイン名「gretel.ai」は現在、NVIDIA 合成データ ソリューションのページにリダイレクトされます。これは、NVIDIA が Gretel の合成データ機能を AI エージェント データ インフラストラクチャの重要なパズルのピースとみなしていることを意味し、Nemotron モデル NeMo 微調整プラットフォームとの完全なデータ リンクを形成します。この買収自体が、Gretel のテクノロジーの価値を最大限に裏付けるものです。
企業顧客と融資: Gretel は独立運営中に多くの金融、医療、テクノロジー企業の合成データのニーズに応えてきましたが、具体的な顧客リストと融資ラウンドの金額は完全には開示されていません。買収後、同社の企業顧客は NVIDIA エコシステムに移行しました。
コストメリット
C 側/個人ユーザー: Gretel のオープンソース Python ライブラリ「gretel-synthetics」は、引き続き PyPI で公開されており、個人の開発者は無料でインストールして使用できます。元の SaaS プラットフォームの無料割り当て (毎月生成される無料レコードの数など) は、プラットフォームがオフラインになったときに終了しました。
開発者/API ユーザー: オリジナルの Gretel REST API (gretel-python-client 経由で呼び出される) はスタンドアロンでは利用できなくなりました。 API を通じて合成データ機能を利用したい開発者は、NVIDIA Nemotron プラットフォームの合成データ サービス (NeMo Data Designer) を利用する必要があります。価格モデルは、NVIDIA 公式価格ページに基づいています。
エンタープライズ/プライベート展開: オープンソース ライブラリは、ネットワーク接続を必要とせずに独自のインフラストラクチャで合成データ生成を実行するローカライズされた展開をサポートしています。企業は「gretel-synthetics」に基づいて独自のパイプラインを構築でき、コストはハードウェア リソース (GPU 推奨) と運用保守の人件費に限定されます。 NVIDIA Enterprise の合成データ ソリューションには、NVIDIA 商用チャネルを介したライセンスが必要です。
主な機能
-
構造化された表形式データ合成: ACTGAN (Anyway CTGAN) モデルに基づいて、実際の表形式データから列の分布と相関関係を学習し、統計的忠実度の高い合成データ セットを生成できます。列タイプの自動検出、メモリ最適化された NaN プロキシ処理などのエンタープライズ レベルの機能をサポートします。データベースの感度解除、テスト データの生成、データの強化、その他のシナリオに適しています。
-
時系列データ合成: Timeseries DGAN (DoppelGANger の PyTorch 実装) に基づいて、スマート ホーム センサーの読み取り値や金融時系列 IoT デバイス ログなどの時間依存データ用に特別に設計されています。時系列データの自己相関と特徴間の依存関係を保持します。
-
差分プライバシー保護: コア差別化機能 - 「実際のデータのように見える」だけでなく、差分プライバシー (差分プライバシー) メカニズムを通じて定量化可能なプライバシー保護保証を提供します。ユーザーはパラメータを通じてプライバシー予算を制御し、データの有用性とプライバシー保護の強度の間でトレードオフを行うことができます。
-
データ品質およびプライバシー レポート: 合成データの生成後、Gretel はデータ品質レポート (列分布の比較、相関行列、フィールド欠落率などをカバー) およびプライバシー評価レポート (プライバシー リスク スコア、メンバー推論リスク評価) を自動的に生成し、合成データが期待される有効性を達成しているかどうかをユーザーが検証できるようにします。
-
コード シンセ (コード データ合成): 実験の方向性 - コード合成を通じて AI プログラミング モデルのトレーニング データを拡張します。 「gretel-code-synth」リポジトリはこの方向性を検討していますが、まだプロトタイプの段階にすぎません。
専門家の見解: Gretel の核となる価値は、「データ生成」という単一の機能にあるのではなく、「プライバシー保護 + データ ユーティリティの評価」の組み合わせにあります。合成データを生成するだけでなく、プライバシー漏洩のリスクにおける合成データのパフォーマンスも定量化します。この「世代評価」協力メカニズムは、財務コンプライアンスや医療データ共有などの強力な規制シナリオにおいて実用的な工学的重要性を持ちます。 NVIDIA によって統合された後、この機能は Nemotron プラットフォームの Safe Synthesizer モジュールに統合され、NeMo Data Designer のビジュアル デザイン ツールと連携して、合成データの使用のしきい値を下げます。
モデルとバージョンの進化
オープンソース ライブラリの開発フェーズ (2019 ~ 2025 年)
Gretel のコア オープン ソース ライブラリ「gretel-synthetics」は完全な反復サイクルを経て、初期の TensorFlow ベースの LSTM モデルから複数世代のアーキテクチャをサポートする包括的なライブラリに進化しました。
初期バージョン (v0.1 ~ v0.17): 主に TensorFlow に基づく LSTM モデルに基づいており、構造化テキスト合成をサポートし、インフラストラクチャの基礎を築きます。
暫定バージョン (v0.18 ~ v0.21): 表形式データをサポートするための ACTGAN (SDV に基づく CTGAN 拡張機能) の導入。時系列シナリオをカバーするために Timeseries DGAN (DoppelGANger に基づく) を追加します。このフェーズでは、単一の LSTM 戦略からマルチモデル戦略への転換が見られました。
後のバージョン (v0.22.x、2024 ~ 2025): 依存関係のセキュリティ更新 (jinja2、axios、TensorFlow 互換性)、Python バージョンのアップグレード (3.11.9 へ)、および非推奨の LSTM ランタイムの削除に重点を置いたメンテナンス期間。 v0.22.20が最終バージョンです。
バージョンのタイムライン
| バージョン | 日付 | 重大な変更 |
|---|---|---|
| v0.22.20 | 2025-06-25 | Python 3.11.9、TensorFlow 依存関係を削除、セキュリティ更新に依存 |
| v0.22.19 | 2025-02-26 | LSTM ランタイムを削除し、タイミング テスト アサーションしきい値を下げる |
| v0.22.17 | 2025-01-29 | ドキュメントのビルド依存関係を修正 |
| v0.22.16 | 2024-12-11 | 依存関係と互換性のメンテナンス |
| v0.22.15 | 2024-12-05 | TensorFlow/protobuf 依存関係を修正 |
| v0.22.14 | 2024-10-30 | Slack 通知統合を削除する |
| v0.22.13 | 2024-10-09 | TensorFlow 2.12.1 アップデート |
| v0.22.12 | 2024-09-11 | 一般的な修正 |
| v0.22.11 | 2024-06-27 | 一般的な修正 |
| v0.22.10 | 2024-05-15 | 相関計算用の NaN プロキシ |
買収後の段階 (2026 ~現在)
2026 年 2 月 18 日、Gretel の GitHub 組織は管理者によってアーカイブ済みとしてマークされ、すべてのリポジトリが読み取り専用になりました。 「gretel.ai」ドメインが NVIDIA へのリダイレクトを開始しました。 Gretel の技術機能、特に差分プライベート合成データ生成は、NVIDIA Nemotron プラットフォームの NeMo Data Designer および Safe Synthesizer コンポーネントに統合されています。元の SaaS ユーザーは NVIDIA エコシステムに移行されました。
技術的な利点
プライバシー保護の理論的基礎: Gretel の主な技術的違いは、差分プライバシー (Differential Privacy) 理論を合成データ生成プロセスに工学的に統合していることにあります。制御されたノイズをトレーニング プロセスに注入することにより、合成データから元の個々の記録を推測することの難しさは理論的に定量化できます。これは、データ サイエンティストが「この合成データ セットがユーザーに関する実際の情報を漏洩する確率はどのくらいですか?」に正確に答えることができることを意味します。
メカニクス → エフェクト → シナリオ:
- メカニズム: 生成後の後処理による感度低下の代わりに、モデルのトレーニング段階で差分プライバシー摂動 (DP-SGD などのアルゴリズムを通じて) を勾配関数または損失関数に適用します。
- 効果: 合成データは、統計レベルでは元のデータの分布特性 (平均、分散、相関) を保持しますが、個々のレコード レベルではプライバシー保護が保証されます。
- シナリオ: 医療研究機関が患者データを共有する場合、Gretel を使用して、外部パートナーが使用するプライバシー保護されたデータ セットを生成できます。金融機関は、モデル開発において合成データを使用して機密取引記録を置き換えることができます。
マルチモデル戦略のためのエンジニアリングの知恵: Gretel は単一生成アルゴリズムに依存せず、ACTGAN (表形式データ)、Timeseries DGAN (時系列データ)、および LSTM (テキスト、非推奨) の 3 つのモデルを提供します。この「データ型によるモデルの選択」の設計により、「ユニバーサル モデル」によって引き起こされるパフォーマンスの低下が回避されます。実際に使用する場合はデータ形式に応じて適切な機種を選択する必要があります。
差分プライバシーのコスト: 差分プライバシーの追加により、合成データの統計的忠実度は必然的に低下します。プライバシー バジェット $\epsilon$ が小さいほど (保護が強力であるほど)、データ ユーティリティの損失は大きくなります。 Gretel を使用すると、ユーザーはプライバシーとユーティリティの曲線上のバランス ポイントを選択できますが、エンジニアリング チームは特定のビジネス シナリオに対するデータ精度の許容範囲を評価する必要があります。
使い方
方法 1: オープンソースの Python ライブラリを使用する (現在利用可能)
「」バッシュ
gretel-synthetics をインストールする
pip インストール gretel-synthetics
注: 依存関係は手動でインストールする必要があります
pip install torch==2.0 # Timeseries DGAN または ACTGAN の場合 (SDV 経由)
または
pip install sdv<0.18 # ACTGAN 用 「」
基本的な使用プロセス:
- 学習データ(Pandas DataFrame)を準備する
- トレーニングパラメータの設定 (モデルの選択、プライバシー予算など)
- 合成モデルのトレーニング
- 合成レコードの生成
- 合成データの品質を評価する
詳細なチュートリアルは、GitHub リポジトリの「examples/」ディレクトリに Jupyter Notebook のサンプルが含まれています。または、Google Colab 経由でオンラインで実行できます。
方法 2: NVIDIA Nemotron エコシステム (現在推奨)
Gretel の機能は NVIDIA NeMo Data Designer に統合されています。 1.「https://build.nvidia.com/nemo/data-designer」にアクセスします。
- シード データ セットと合成列を構成する
- プライバシー保護レベルを選択します
- プレビューとバッチ生成
この方法は、エンタープライズ レベルの SLA、視覚的な操作インターフェイス、および大規模な生産を必要とするエンタープライズ ユーザーに適しています。
方法 3: NVIDIA Safe Synthesizer (プライバシー コンプライアンス シナリオ)
HIPAA/GDPR への準拠が必要なデータ生成シナリオの場合は、Gretel の差分プライバシー機能を継承および拡張する、NVIDIA Nemotron プラットフォームの Safe Synthesizer コンポーネントを使用します。
製品の価格設定
| 階層 | 価格モデル | 説明 |
|---|---|---|
| オープンソース ライブラリ (自己ホスト型) | 無料 | gretel-synthetics PyPI パッケージ、完全に無料で使用可能、使用制限なし |
| NVIDIA NeMo データ デザイナー | NVIDIA の公式価格に従う | ビジュアルデザイナー、大規模生成、エンタープライズレベルのサポートを提供 |
| NVIDIA エンタープライズ ライセンス | NVIDIA ビジネスへのお問い合わせ | SLA、コンプライアンス認証、プライベート展開オプションが含まれています |
Gretel の元の SaaS 価格設定 (レコード数のサブスクリプションに基づく) は、プラットフォームではオフラインになり、利用できなくなりました。現在の合成データ機能は、NVIDIA エコシステムを通じて提供されます。 具体的な価格は、NVIDIA の公式価格ページにあるリアルタイム情報の影響を受けます。企業ユーザーは、NVIDIA セールス チームに取引条件を確認することをお勧めします。
アプリケーションのシナリオ
-
データの非感作化とコンプライアンスの共有: 金融機関は、取引データを外部のリスク管理モデル開発者と共有する必要がありますが、GDPR/CCPA などのプライバシー規制の対象となります。 Gretel の ACTGAN を使用して同様の統計的特性を持つ合成トランザクション データを生成し、差分プライバシー保護と組み合わせることで、モデル開発のニーズを満たすだけでなく、コンプライアンス監査に合格することもできます。検証の焦点: プライバシー予算 $\epsilon$ が法的要件を満たすように設定されているかどうか、および合成データが主要な指標 (不正行為率の分布など) で元の特性を保持しているかどうか。
-
AI エージェントのトレーニング データの生成: 会話型 AI エージェントを構築する場合、実際の会話データは不足しており、機密であることがよくあります。 Gretel (現在は NVIDIA Nemotron) の合成データ機能は、少数のシード会話から大規模で多様な会話データセットを生成し、エッジ シナリオと意図のバリエーションをカバーできます。検証のポイント:合成対話の多様性と自然性が、実際の対話におけるロングテール分布をカバーするのに十分であるかどうか。
-
機械学習テストと CI/CD: 継続的インテグレーション パイプラインでは、データ処理ロジックの正確性を検証するために大量のテスト データが必要です。 Gretel は、単体テストおよび統合テスト用に実稼働データベースのスキーマから構造的に一貫した合成データ セットを生成し、実稼働データが開発環境にコピーされるのを防ぎます。検証の重要なポイント: 合成データがデータ制約 (一意キー、外部キー、列挙値の範囲など) を完全にカバーしているかどうか。
-
医療データ研究: 病院が研究機関と協力する場合、患者データは HIPAA によって厳格に保護されます。グレーテルの差分プライベート合成データは、個々の患者情報を公開することなく、一貫した統計的特徴を持つ合成患者記録を生成でき、疫学調査や治療効果分析などのシナリオをサポートします。検証の焦点: 差分プライバシーの追加が希少疾患の特徴の喪失につながり、研究結論の妥当性に影響を与えるかどうか。
該当する人
-
データ プライバシーおよびコンプライアンス エンジニア: プライバシー規制に違反することなく、「使用可能だが追跡できない」データ セットを第三者に提供する必要があります。 Gretel の差分プライバシー レポートとプライバシー スコアは、コンプライアンスの監査可能な証拠を提供します。ただし、差分プライバシーでは再識別のリスクを完全に排除することはできず、コンプライアンス チームは引き続き弁護士と協力して特定のシナリオを評価する必要があることに注意してください。
-
データ サイエンティストと ML エンジニア: トレーニング データが不十分な場合、またはデータ分散がアンバランスな場合は、合成データを使用してデータを強化します。 Gretel のマルチモデル戦略により、データ サイエンティストはデータ タイプ (表形式/時系列/テキスト) に基づいて最適な生成アルゴリズムを選択できます。不適切なシナリオ: 合成データの信頼性が非常に高いシナリオ (本番モデルのトレーニングに合成データを直接使用するなど) では、最初に小規模な実験を使用して、合成データのモデル効果の改善を検証することをお勧めします。
-
DevOps/QA エンジニア: データ処理パイプラインの正確性と境界条件を検証するには、大量のテスト データが必要です。 Gretel のオープンソース ライブラリを CI/CD パイプラインに埋め込んで、オンデマンドでテスト データを生成できます。ただし、オープン ソース ライブラリではデータ制約の整合性保証 (外部キーの一貫性など) が提供されず、複雑なスキーマの合成には追加のエンジニアリング作業が必要になることに注意してください。
-
エンタープライズ テクノロジーの選択意思決定者: 合成データ ツールを評価する場合、Gretel のオープン ソースのレガシー (
gretel-synthetics) が技術検証用のリファレンス実装として選択されます。ただし、実稼働指向の大規模合成データ ソリューションでは、NVIDIA Nemotron プラットフォームの完全な機能を直接評価する必要があります。 境界には適していません: NVIDIA エコシステムに依存しない純粋にマネージド型の SaaS サービスが必要な場合、Gretel はもう適していません。元の SaaS はオフラインになっているため、他の独立した合成データ ベンダーに頼る必要があります。
概要と展望
合成データ生成分野のパイオニアとして、Gretel の主な貢献は、差分プライバシー理論とエンジニアリング実践を組み合わせて、「生成、評価、コンプライアンス」の完全なデータ合成ワークフローを作成することにあります。そのオープンソース ライブラリ「gretel-synthetics」は、プライバシーを保護する合成データの検証可能なベースライン実装を業界に提供します。
NVIDIA によって買収され、Nemotron/NeMo エコシステムに統合されたこの製品は、合成データが独立したツールからプラットフォーム インフラストラクチャに移行する業界のトレンドを示しています。 Gretel の技術 DNA は現在、NVIDIA の AI データ戦略の一部となり、Nemotron モデル NeMo 微調整プラットフォーム LangChain Agent フレームワークとの深い相乗効果を形成しています。
現在の制限と不確実性: ・独立系SaaSがオフラインになっており、本来のユーザーエクスペリエンス(Web UI、API Key管理、チームコラボレーション)が再現できません。
- オープンソース ライブラリは利用可能ですが、長期的なメンテナンスの状況は不明です (ウェアハウスはアーカイブされており、アクティブなコミュニティ フォークによる乗っ取りの明らかな兆候はありません)。
- NVIDIA エコシステム内では、Gretel の差分差別化機能が NVIDIA のオリジナル製品ライン (NeMo Safe Synthesizer など) と完全に統合されるかどうか、また独立したブランドが存続するかどうかについての公開ロードマップはありません。
調達/採用リスク評価:
- 技術検証:「gretel-synthetics」のオープンソースライブラリは、差分プライバシー合成データの技術概念証明に適しており、コストゼロで開始できます。
- 本番使用: NVIDIA Nemotron プラットフォームの合成データ サービス (NeMo Data Designer + Safe Synthesizer) を直接評価して、プライバシー コンプライアンスとデータ スケールの SLA 要件を満たしているかどうかを確認することをお勧めします。
- 移行コスト: Gretel SaaS に既存の資産がすでにある場合は、NVIDIA に連絡して移行計画を確認する必要があります。新しいプロジェクトを開始する場合は、デフォルトで NVIDIA エコシステムを評価の開始点として使用することをお勧めします。
- ベンダー ロックイン: NVIDIA エコシステムを選択するということは、そのプラットフォームの依存関係を受け入れることを意味し、PoC 段階で代替案としてオープン ソースの代替 (SDV、YData Synthetic など) も評価することをお勧めします。
バージョン情報
- グレーテル合成 v0.22.20 :axios と jinja2 の依存関係を更新し、TensorFlow の依存関係を削除し、Python を 3.11.9 にアップグレードし、タイミング DGAN テスト アサーションしきい値を下げました。これは、独立運用中の Gretel の最後の公開バージョンであり、2026 年 2 月 18 日に GitHub リポジトリにアーカイブされました。
- グレーテル合成 v0.22.19 :setuptools_scm をダウングレードし、LSTM ランタイムを削除し、MM レポートを修正します。公式の正確な日付はまだありません。
- グレーテル合成 v0.22.17 :ドキュメントのビルドを修正し、jinja2 を 3.1.5 に更新します。公式の正確な日付はまだありません。
- グレーテル合成 v0.22.10 :相関計算用の NaN プロキシを置き換え、jinja2 の依存関係を更新しました。公式の正確な日付はまだありません。
ユーザーレビュー