このプロジェクトについて

SDV(Synthetic Data Vault)は、表形式の合成データを作成するためのPythonライブラリです。さまざまな機械学習モデルを使用して実データからパターンを学習し、生成データに再現します。 READMEに記載されている主な機能: - 古典的な統計手法(GaussianCopula)から深層学習(CTGAN)まで、複数のシンセサイザー。 - 単一テーブル、複数の関連テーブル、時系列テーブルに対応。 - メタデータ駆動のモデリング:列のデータ型、主キー、リレーションシップをメタデータで記述。 - 評価と可視化:品質レポートや列プロットで合成データと実データを比較。 - 前処理、匿名化オプション、ビジネスルールをエンコードする論理制約。 - デモデータセットとColabノートブックによるチュートリアル、ドキュメント、コミュニティフォーラム。 典型的なワークフロー:デモデータセットとメタデータをダウンロードし、GaussianCopulaSynthesizerなどのシンセサイザーをインスタンス化して実データに適合させ、合成行をサンプリングします。品質レポートでは、総合スコアに加えて、列の形状と列ペアの傾向の内訳が計算されます。 このプロジェクトはThe Synthetic Data Vault Projectの一部であり、2016年にMITのData to AI Labで最初に作成され、後にDataCeboによって開発されました。Business Source Licenseの下で配布され、pipまたはcondaでインストールできます。