Sobre o projeto

skrub é uma biblioteca Python projetada para simplificar os fluxos de trabalho de machine learning ao trabalhar com dados tabulares (dataframes). Ela fornece ferramentas e utilitários para pré-processar, transformar e integrar dados baseados em dataframes em pipelines do scikit-learn, facilitando o manuseio de conjuntos de dados do mundo real com tipos mistos, valores ausentes ou recursos categóricos. A biblioteca inclui codificadores especializados, transformadores e auxiliares para compatibilidade perfeita com dataframes do pandas e estimadores do scikit-learn. Suporta instalação via pip ou conda e oferece extensa documentação, exemplos e recursos da comunidade (por exemplo, Discord, GitHub Discussions).