À propos du projet

Splink est une bibliothèque Python pour le couplage probabiliste de données (résolution d'entités), permettant la déduplication et le rapprochement de jeux de données sans identifiants uniques. Elle implémente le modèle Fellegi-Sunter avec des personnalisations pour améliorer la précision. Les caractéristiques clés incluent une grande vitesse (couplage d'environ 1 million de dossiers sur un ordinateur portable en environ 1 minute), la prise en charge de la correspondance floue et des ajustements de fréquence des termes, l'évolutivité via DuckDB (Python) ou Spark/PostgreSQL (pour plus de 100 millions de dossiers), l'apprentissage non supervisé (aucune donnée d'entraînement requise) et des visualisations interactives pour le diagnostic du modèle. Elle fonctionne mieux avec des données d'entrée multi-colonnes et à faible corrélation (par exemple, nom, date de naissance, ville pour les personnes). Elle est utilisée dans le secteur gouvernemental, universitaire et privé. Elle propose des installations spécifiques au backend et une documentation complète avec des tutoriels et des exemples.