このプロジェクトについて

Splinkは、確率的レコードリンケージ(エンティティ解決)のためのPythonライブラリであり、一意の識別子なしでデータセットの重複排除とリンクを可能にします。精度向上のためのカスタマイズを加えたFellegi-Sunterモデルを実装しています。主な特徴として、高速性(ラップトップで約100万件のレコードを約1分でリンク)、ファジーマッチングと用語頻度調整のサポート、DuckDB(Python)またはSpark/PostgreSQL(1億件以上のレコード向け)によるスケーラビリティ、教師なし学習(トレーニングデータ不要)、モデル診断のためのインタラクティブな可視化が挙げられます。複数列で相関の低い入力データ(例:人物の氏名、生年月日、都市)で最も効果を発揮します。政府、学界、民間部門で使用されています。バックエンド固有のインストール方法と、チュートリアルや例を含む充実したドキュメントを提供しています。