À propos du projet

skrub est une bibliothèque Python conçue pour simplifier les workflows de machine learning lorsqu'on travaille avec des données tabulaires (dataframes). Elle fournit des outils et des utilitaires pour prétraiter, transformer et intégrer des données basées sur des dataframes dans des pipelines scikit-learn, facilitant ainsi la gestion de jeux de données réels avec des types mixtes, des valeurs manquantes ou des caractéristiques catégorielles. La bibliothèque inclut des encodeurs spécialisés, des transformateurs et des aides pour une compatibilité transparente avec les dataframes pandas et les estimateurs scikit-learn. Elle prend en charge l'installation via pip ou conda et offre une documentation complète, des exemples et des ressources communautaires (par exemple, Discord, GitHub Discussions).