Sobre o projeto
SDV (Synthetic Data Vault) é uma biblioteca Python para criar dados sintéticos tabulares. Ela aprende padrões de dados reais usando uma variedade de modelos de aprendizado de máquina e os reproduz nos dados gerados.
Principais capacidades descritas no README:
- Múltiplos sintetizadores, desde métodos estatísticos clássicos (GaussianCopula) até aprendizado profundo (CTGAN).
- Suporte para tabelas únicas, múltiplas tabelas conectadas e tabelas sequenciais.
- Modelagem orientada por metadados: tipos de dados de colunas, chaves primárias e relacionamentos são descritos nos metadados.
- Avaliação e visualização: compare dados sintéticos com dados reais por meio de relatórios de qualidade e gráficos de colunas.
- Pré-processamento, opções de anonimização e restrições lógicas para codificar regras de negócio.
- Conjuntos de dados de demonstração e tutoriais via notebooks Colab, além de documentação e um fórum comunitário.
Fluxo de trabalho típico: baixe um conjunto de dados de demonstração e metadados, instancie um sintetizador como o GaussianCopulaSynthesizer, ajuste-o aos dados reais e, em seguida, gere amostras de linhas sintéticas. Um relatório de qualidade calcula uma pontuação geral, além de detalhamentos de forma de coluna e tendência de pares de colunas.
O projeto faz parte do The Synthetic Data Vault Project, criado originalmente no Data to AI Lab do MIT em 2016 e posteriormente desenvolvido pela DataCebo. É distribuído sob a Business Source License e pode ser instalado via pip ou conda.
Comments
0 people shared their preference · Deer Point appears after 10 participants
Sign in to join the discussion.