Об этом проекте

Splink — это библиотека Python для вероятностной записи связи (разрешения сущностей), позволяющая выполнять дедупликацию и связывание наборов данных без уникальных идентификаторов. Она реализует модель Фельджи-Сантера с настройками для повышения точности. Ключевые особенности включают высокую скорость (связывание ~1 млн записей на ноутбуке за ~1 минуту), поддержку нечеткого сопоставления и корректировок частоты терминов, масштабируемость через DuckDB (Python) или Spark/PostgreSQL (для 100 млн+ записей), обучение без учителя (не требует обучающих данных) и интерактивные визуализации для диагностики модели. Лучше всего работает с многоколоночными данными с низкой корреляцией (например, имя, дата рождения, город для людей). Используется в правительстве, академических кругах и частном секторе. Предлагает установки, специфичные для бэкенда, и обширную документацию с учебными пособиями и примерами.