Sobre o projeto

SDV (Synthetic Data Vault) é uma biblioteca Python para criar dados sintéticos tabulares. Ela aprende padrões de dados reais usando uma variedade de modelos de aprendizado de máquina e os reproduz nos dados gerados. Principais capacidades descritas no README: - Múltiplos sintetizadores, desde métodos estatísticos clássicos (GaussianCopula) até aprendizado profundo (CTGAN). - Suporte para tabelas únicas, múltiplas tabelas conectadas e tabelas sequenciais. - Modelagem orientada por metadados: tipos de dados de colunas, chaves primárias e relacionamentos são descritos nos metadados. - Avaliação e visualização: compare dados sintéticos com dados reais por meio de relatórios de qualidade e gráficos de colunas. - Pré-processamento, opções de anonimização e restrições lógicas para codificar regras de negócio. - Conjuntos de dados de demonstração e tutoriais via notebooks Colab, além de documentação e um fórum comunitário. Fluxo de trabalho típico: baixe um conjunto de dados de demonstração e metadados, instancie um sintetizador como o GaussianCopulaSynthesizer, ajuste-o aos dados reais e, em seguida, gere amostras de linhas sintéticas. Um relatório de qualidade calcula uma pontuação geral, além de detalhamentos de forma de coluna e tendência de pares de colunas. O projeto faz parte do The Synthetic Data Vault Project, criado originalmente no Data to AI Lab do MIT em 2016 e posteriormente desenvolvido pela DataCebo. É distribuído sob a Business Source License e pode ser instalado via pip ou conda.