这个项目能做什么
SDV(Synthetic Data Vault)是一个用于创建表格合成数据的Python库。它使用一系列机器学习模型从真实数据中学习模式,并在生成的数据中重现这些模式。
README中描述的主要能力:
- 多种合成器,从经典统计方法(GaussianCopula)到深度学习(CTGAN)。
- 支持单表、多个相互关联的表以及序列表。
- 元数据驱动建模:列数据类型、主键和关系都在元数据中描述。
- 评估与可视化:通过质量报告和列图比较合成数据与真实数据。
- 预处理、匿名化选项,以及用于编码业务规则的逻辑约束。
- 通过Colab笔记本提供演示数据集和教程,另有文档和社区论坛。
典型工作流程:下载演示数据集和元数据,实例化诸如GaussianCopulaSynthesizer之类的合成器,在真实数据上拟合,然后采样合成行。质量报告会计算总体得分以及列形状和列对趋势的细分。
该项目是The Synthetic Data Vault Project的一部分,最初于2016年在MIT的Data to AI Lab创建,后来由DataCebo开发。它根据Business Source License分发,可通过pip或conda安装。
评论
0 人表达喜爱 · 满10人后显示 Deer Point
登录后参与讨论。