Sobre el proyecto
Splink es una biblioteca de Python para la vinculación probabilística de registros (resolución de entidades), que permite la deduplicación y vinculación de conjuntos de datos sin identificadores únicos. Implementa el modelo Fellegi-Sunter con personalizaciones para mejorar la precisión. Las características clave incluyen alta velocidad (vinculación de ~1M de registros en una laptop en ~1 minuto), soporte para coincidencia difusa y ajustes de frecuencia de términos, escalabilidad mediante DuckDB (Python) o Spark/PostgreSQL (para más de 100M de registros), aprendizaje no supervisado (no se requieren datos de entrenamiento) y visualizaciones interactivas para el diagnóstico del modelo. Funciona mejor con datos de entrada de múltiples columnas y baja correlación (por ejemplo, nombre, fecha de nacimiento, ciudad para personas). Se utiliza en el gobierno, la academia y el sector privado. Ofrece instalaciones específicas para cada backend y documentación extensa con tutoriales y ejemplos.
Comments
0 people shared their preference · Deer Point appears after 10 participants
Sign in to join the discussion.