इस प्रोजेक्ट के बारे में
Splink एक Python लाइब्रेरी है जो रिकॉर्ड लिंकेज (एंटिटी रिज़ॉल्यूशन), डेटासेट्स के डुप्लीकेशन और बिना यूनिक आइडेंटिफायर के लिंकिंग के लिए है। यह Fellegi-Sunter मॉडल को लागू करता है और सटीकता के लिए इसमें कस्टमाइज़ेशन किए गए हैं। मुख्य विशेषताएँ: उच्च गति (लैपटॉप पर ~1M रिकॉर्ड को ~1 मिनट में लिंक करना), फ़ज़ी मैचिंग और टर्म फ़्रीक्वेंसी एडजस्टमेंट के लिए समर्थन, डुप्लीकेशन (Python) या Spark/PostgreSQL (100M+ रिकॉर्ड के लिए) के माध्यम से स्केलेबिलिटी, अनसुपरवाइज़्ड लर्निंग (ट्रेनिंग डेटा की आवश्यकता नहीं), और मॉडल डायग्नोस्टिक्स के लिए इंटरैक्टिव विज़ुअलाइज़ेशन। यह मल्टी-कॉलम, कम-कोरिलेशन वाले इनपुट डेटा (जैसे व्यक्तियों के लिए नाम, जन्म तिथि, शहर) के साथ सबसे अच्छा काम करता है। सरकार, अकादमिक जगत और निजी क्षेत्र में उपयोग किया जाता है। यह बैकएंड-विशिष्ट इंस्टॉलेशन और ट्यूटोरियल तथा उदाहरणों के साथ व्यापक दस्तावेज़ीकरण प्रदान करता है।
Comments
0 people shared their preference · Deer Point appears after 10 participants
Sign in to join the discussion.