इस प्रोजेक्ट के बारे में
रिवर एक ओपन-सोर्स पायथन लाइब्रेरी है जो ऑनलाइन मशीन लर्निंग के लिए समर्पित है, यानी डेटा स्ट्रीम से एक बार में एक अवलोकन सीखना। इसे creme और scikit-multiflow परियोजनाओं के विलय के परिणाम के रूप में प्रस्तुत किया गया है, और इसका घोषित लक्ष्य स्ट्रीमिंग डेटा पर मशीन लर्निंग के लिए उपयोगकर्ता-मैत्रीपूर्ण लाइब्रेरी होना है।
मुख्य इंटरफ़ेस इंक्रीमेंटल है: मॉडल learn_one और predict_one प्रदान करते हैं, इसलिए प्रत्येक नमूने के आने पर भविष्यवाणियों और अपडेट को इंटरलीव किया जा सकता है, बिना पिछले डेटा को दोबारा देखे। एक क्विकस्टार्ट उदाहरण StandardScaler के बाद LogisticRegression की पाइपलाइन का उपयोग करके अंतर्निहित Phishing डेटासेट पर लॉजिस्टिक रिग्रेशन को प्रशिक्षित करता है, जबकि मॉडल के साथ-साथ एक Accuracy मेट्रिक भी अपडेट की जाती है।
इंस्टॉलेशन pip के माध्यम से होता है (pip install river), जिसमें Linux, macOS और Windows के लिए व्हील्स प्रकाशित हैं। परियोजना Python 3.11 और उससे ऊपर को लक्षित करती है। मुख्य ऑनलाइन इंटरफ़ेस में pandas की निर्भरता नहीं है; एक मिनी-बैच इंटरफ़ेस (learn_many, predict_many, predict_proba_many, transform_many) pandas पर बना है और river[pandas] एक्स्ट्रा के माध्यम से ऑप्ट-इन है। GitHub से एक डेवलपमेंट संस्करण इंस्टॉल किया जा सकता है, जिसके लिए Cython और Rust आवश्यक हैं।
कवर किए गए एल्गोरिदम परिवारों में विभिन्न ऑप्टिमाइज़र के साथ लीनियर मॉडल, डिसीज़न ट्री और रैंडम फ़ॉरेस्ट, अनुमानित निकटतम पड़ोसी, विसंगति पहचान, ड्रिफ्ट पहचान, रेकमेंडर सिस्टम, टाइम सीरीज़ फोरकास्टिंग, बैंडिट, फैक्टराइज़ेशन मशीन, असंतुलित लर्निंग, क्लस्टरिंग, बैगिंग/बूस्टिंग/स्टैकिंग और सक्रिय लर्निंग शामिल हैं। अतिरिक्त ऑनलाइन उपयोगिताओं में फ़ीचर एक्सट्रैक्शन और चयन, ऑनलाइन सांख्यिकी और मेट्रिक्स, प्रीप्रोसेसिंग, अंतर्निहित डेटासेट, प्रोग्रेसिव मॉडल वैलिडेशन और मॉडल पाइपलाइन शामिल हैं।
README स्पष्ट रूप से बताता है कि ऑनलाइन लर्निंग कब उपयुक्त है: जब किसी मॉडल को पिछले डेटा को दोबारा देखे बिना नए डेटा से सीखना चाहिए, जब कॉन्सेप्ट ड्रिफ्ट के प्रति मजबूती मायने रखती है, या जब विकास इवेंट-आधारित प्रोडक्शन सेटिंग्स जैसा होना चाहिए। यह यह भी नोट करता है कि रिवर प्रदर्शन की तुलना में स्पष्टता और उपयोगकर्ता अनुभव पर जोर देता है, एक बार में एक नमूना संसाधित करने में तेज़ है, और पायथन पारिस्थितिकी तंत्र के बाकी हिस्सों के साथ एकीकृत होता है।
दस्तावेज़ीकरण riverml.xyz पर होस्ट किया गया है, जिसमें पैकेज रिलीज़, एक awesome-online-machine-learning सूची, एक 2022 GAIA प्रस्तुति और ऑनलाइन क्लस्टरिंग पर एक KDD'22 पेपर के लिंक हैं। परियोजना BSD 3-clause लाइसेंस के अंतर्गत है, इसका एक सार्वजनिक रोडमैप है, और यह चर्चाओं, मुद्दों और योगदानों का स्वागत करती है। उद्धरण के लिए एक JMLR पेपर उपलब्ध है।
Comments
0 people shared their preference · Deer Point appears after 10 participants
Sign in to join the discussion.