Sobre o projeto

Splink é uma biblioteca Python para ligação probabilística de registros (resolução de entidades), permitindo deduplicação e ligação de conjuntos de dados sem identificadores únicos. Ela implementa o modelo Fellegi-Sunter com personalizações para maior precisão. As principais características incluem alta velocidade (ligação de aproximadamente 1 milhão de registros em um laptop em cerca de 1 minuto), suporte para correspondência difusa e ajustes de frequência de termos, escalabilidade via DuckDB (Python) ou Spark/PostgreSQL (para mais de 100 milhões de registros), aprendizado não supervisionado (sem necessidade de dados de treinamento) e visualizações interativas para diagnóstico do modelo. Funciona melhor com dados de entrada de múltiplas colunas e baixa correlação (por exemplo, nome, data de nascimento, cidade para pessoas). Usado em governo, academia e setor privado. Oferece instalações específicas para cada backend e documentação extensa com tutoriais e exemplos.