À propos du projet

SDV (Synthetic Data Vault) est une bibliothèque Python pour créer des données tabulaires synthétiques. Elle apprend des motifs à partir de données réelles en utilisant une gamme de modèles d'apprentissage automatique et les reproduit dans les données générées. Capacités clés décrites dans le README : - Plusieurs synthétiseurs, des méthodes statistiques classiques (GaussianCopula) à l'apprentissage profond (CTGAN). - Prise en charge des tables uniques, des tables multiples connectées et des tables séquentielles. - Modélisation pilotée par métadonnées : les types de colonnes, les clés primaires et les relations sont décrits dans les métadonnées. - Évaluation et visualisation : comparez les données synthétiques et réelles avec des rapports de qualité et des graphiques de colonnes. - Prétraitement, options d'anonymisation et contraintes logiques pour encoder les règles métier. - Jeux de données de démonstration et tutoriels via des notebooks Colab, ainsi qu'une documentation et un forum communautaire. Flux de travail typique : téléchargez un jeu de données de démonstration et ses métadonnées, instanciez un synthétiseur tel que GaussianCopulaSynthesizer, ajustez-le sur les données réelles, puis échantillonnez des lignes synthétiques. Un rapport de qualité calcule un score global ainsi que des ventilations de forme de colonne et de tendance de paires de colonnes. Le projet fait partie du Synthetic Data Vault Project, créé à l'origine au MIT Data to AI Lab en 2016 et développé ensuite par DataCebo. Il est distribué sous la licence Business Source et installable via pip ou conda.