Sobre el proyecto

SDV (Synthetic Data Vault) es una biblioteca de Python para crear datos sintéticos tabulares. Aprende patrones de datos reales utilizando una variedad de modelos de aprendizaje automático y los reproduce en los datos generados. Capacidades clave descritas en el README: - Múltiples sintetizadores, desde métodos estadísticos clásicos (GaussianCopula) hasta aprendizaje profundo (CTGAN). - Compatibilidad con tablas únicas, múltiples tablas conectadas y tablas secuenciales. - Modelado basado en metadatos: los tipos de datos de las columnas, las claves primarias y las relaciones se describen en los metadatos. - Evaluación y visualización: comparar datos sintéticos con datos reales mediante informes de calidad y gráficos de columnas. - Preprocesamiento, opciones de anonimización y restricciones lógicas para codificar reglas de negocio. - Conjuntos de datos de demostración y tutoriales mediante cuadernos de Colab, además de documentación y un foro comunitario. Flujo de trabajo típico: descargar un conjunto de datos de demostración y sus metadatos, instanciar un sintetizador como GaussianCopulaSynthesizer, ajustarlo con datos reales y luego muestrear filas sintéticas. Un informe de calidad calcula una puntuación general, además de desgloses de la forma de las columnas y la tendencia de pares de columnas. El proyecto forma parte de The Synthetic Data Vault Project, creado originalmente en el Data to AI Lab del MIT en 2016 y desarrollado posteriormente por DataCebo. Se distribuye bajo la Business Source License y se puede instalar mediante pip o conda.