इस प्रोजेक्ट के बारे में

skrub एक पायथन लाइब्रेरी है जिसे टेबुलर डेटा (डेटाफ्रेम) के साथ काम करते समय मशीन लर्निंग वर्कफ़्लो को सरल बनाने के लिए डिज़ाइन किया गया है। यह डेटाफ्रेम-आधारित डेटा को प्रीप्रोसेस, ट्रांसफ़ॉर्म और scikit-learn पाइपलाइन में एकीकृत करने के लिए टूल और यूटिलिटीज़ प्रदान करता है, जिससे मिश्रित प्रकार, अनुपलब्ध मान या श्रेणीबद्ध विशेषताओं वाले वास्तविक-विश्व डेटासेट को संभालना आसान हो जाता है। लाइब्रेरी में pandas डेटाफ्रेम और scikit-learn एस्टिमेटर के साथ सहज संगतता के लिए विशेष एनकोडर, ट्रांसफ़ॉर्मर और हेल्पर शामिल हैं। यह pip या conda के माध्यम से इंस्टॉलेशन का समर्थन करता है और व्यापक दस्तावेज़ीकरण, उदाहरण और सामुदायिक संसाधन (जैसे, Discord, GitHub Discussions) प्रदान करता है।