このプロジェクトについて
SDV(Synthetic Data Vault)は、表形式の合成データを作成するためのPythonライブラリです。さまざまな機械学習モデルを使用して実データからパターンを学習し、生成データに再現します。
READMEに記載されている主な機能:
- 古典的な統計手法(GaussianCopula)から深層学習(CTGAN)まで、複数のシンセサイザー。
- 単一テーブル、複数の関連テーブル、時系列テーブルに対応。
- メタデータ駆動のモデリング:列のデータ型、主キー、リレーションシップをメタデータで記述。
- 評価と可視化:品質レポートや列プロットで合成データと実データを比較。
- 前処理、匿名化オプション、ビジネスルールをエンコードする論理制約。
- デモデータセットとColabノートブックによるチュートリアル、ドキュメント、コミュニティフォーラム。
典型的なワークフロー:デモデータセットとメタデータをダウンロードし、GaussianCopulaSynthesizerなどのシンセサイザーをインスタンス化して実データに適合させ、合成行をサンプリングします。品質レポートでは、総合スコアに加えて、列の形状と列ペアの傾向の内訳が計算されます。
このプロジェクトはThe Synthetic Data Vault Projectの一部であり、2016年にMITのData to AI Labで最初に作成され、後にDataCeboによって開発されました。Business Source Licenseの下で配布され、pipまたはcondaでインストールできます。
Comments
0 people shared their preference · Deer Point appears after 10 participants
Sign in to join the discussion.