इस प्रोजेक्ट के बारे में

Splink एक Python लाइब्रेरी है जो रिकॉर्ड लिंकेज (एंटिटी रिज़ॉल्यूशन), डेटासेट्स के डुप्लीकेशन और बिना यूनिक आइडेंटिफायर के लिंकिंग के लिए है। यह Fellegi-Sunter मॉडल को लागू करता है और सटीकता के लिए इसमें कस्टमाइज़ेशन किए गए हैं। मुख्य विशेषताएँ: उच्च गति (लैपटॉप पर ~1M रिकॉर्ड को ~1 मिनट में लिंक करना), फ़ज़ी मैचिंग और टर्म फ़्रीक्वेंसी एडजस्टमेंट के लिए समर्थन, डुप्लीकेशन (Python) या Spark/PostgreSQL (100M+ रिकॉर्ड के लिए) के माध्यम से स्केलेबिलिटी, अनसुपरवाइज़्ड लर्निंग (ट्रेनिंग डेटा की आवश्यकता नहीं), और मॉडल डायग्नोस्टिक्स के लिए इंटरैक्टिव विज़ुअलाइज़ेशन। यह मल्टी-कॉलम, कम-कोरिलेशन वाले इनपुट डेटा (जैसे व्यक्तियों के लिए नाम, जन्म तिथि, शहर) के साथ सबसे अच्छा काम करता है। सरकार, अकादमिक जगत और निजी क्षेत्र में उपयोग किया जाता है। यह बैकएंड-विशिष्ट इंस्टॉलेशन और ट्यूटोरियल तथा उदाहरणों के साथ व्यापक दस्तावेज़ीकरण प्रदान करता है।