इस प्रोजेक्ट के बारे में

EconML मशीन लर्निंग के माध्यम से अवलोकन संबंधी डेटा से विषम उपचार प्रभावों का अनुमान लगाने के लिए एक Python पैकेज है। इसे माइक्रोसॉफ्ट रिसर्च में ALICE परियोजना के हिस्से के रूप में डिज़ाइन और निर्मित किया गया था, जो जटिल कारणात्मक अनुमान समस्याओं में स्वचालन लाने के लिए अत्याधुनिक मशीन लर्निंग तकनीकों को इकोनोमेट्रिक्स के साथ जोड़ता है। मुख्य उद्देश्य: फीचर्स X और W को नियंत्रित करते हुए एक या अधिक उपचार चर T का परिणाम चर Y पर कारणात्मक प्रभाव मापना, और यह प्रभाव X के फलन के रूप में कैसे बदलता है। विधियाँ अवलोकन संबंधी (गैर-प्रायोगिक या ऐतिहासिक) डेटासेट के साथ काम करती हैं। कारणात्मक व्याख्या के लिए, कुछ विधियाँ कोई अप्राप्त कन्फाउंडर नहीं मानती हैं, जबकि अन्य एक इंस्ट्रुमेंट Z तक पहुँच मानती हैं जो उपचार T को प्रभावित करता है लेकिन परिणाम Y पर कोई सीधा प्रभाव नहीं डालता। अधिकांश विधियाँ विश्वास अंतराल और अनुमान परिणाम प्रदान करती हैं। घोषित डिज़ाइन लक्ष्यों में इकोनोमेट्रिक्स और मशीन लर्निंग के प्रतिच्छेदन पर हाल की तकनीकों को लागू करना, प्रभाव विषमता के मॉडलिंग में लचीलापन बनाए रखना (रैंडम फॉरेस्ट, बूस्टिंग, लासो, न्यूरल नेट) जबकि कारणात्मक व्याख्या को संरक्षित करना और अक्सर वैध विश्वास अंतराल प्रदान करना, एक एकीकृत API का उपयोग करना, और मशीन लर्निंग और डेटा विश्लेषण के लिए मानक Python पैकेजों पर निर्माण करना शामिल है। README में दिखाए गए कार्यान्वित अनुमान परिवारों में शामिल हैं: - डबल मशीन लर्निंग (LinearDML, SparseLinearDML, NonParamDML, CausalForestDML) OLS या बूटस्ट्रैप विश्वास अंतराल के साथ। - पैनल डेटा के लिए डायनामिक डबल मशीन लर्निंग (DynamicDML)। - ऑर्थोगोनल रैंडम फॉरेस्ट (DMLOrthoForest, DROrthoForest)। - मेटा-लर्नर: XLearner, SLearner, TLearner। - डबली रोबस्ट लर्नर: LinearDRLearner, SparseLinearDRLearner, ForestDRLearner। - इंस्ट्रुमेंटल वेरिएबल विधियाँ: OrthoIV, NonParamDMLIV, LinearDRIV, SparseLinearDRIV, ForestDRIV, LinearIntentToTreatDRIV। व्याख्या समर्थन में CATE मॉडल का ट्री इंटरप्रेटर (SingleTreeCateInterpreter), एक नीति इंटरप्रेटर (SingleTreePolicyInterpreter), और CATE मॉडल के लिए SHAP मान शामिल हैं। मॉडल चयन और सत्यापन: कारणात्मक मॉडल चयन, स्कोरिंग और भारित एन्सेम्बलिंग के लिए एक RScorer; अंतर्निहित प्रथम-चरण मॉडल चयन जो sklearn मॉडल चयन कक्षाओं जैसे LassoCV या GridSearchCV, या उम्मीदवार मॉडलों की सूची के साथ काम करता है। अनुमान: सक्षम होने पर, एक InferenceResults ऑब्जेक्ट p-मान, z-सांख्यिकी, मानक त्रुटियाँ और विश्वास अंतराल प्रदान करता है; रैखिक पैरामीट्रिक CATE मॉडलों के लिए एक summary() विधि उपलब्ध है, साथ ही नमूना और जनसंख्या स्तर पर effect_inference सारांश। नीति शिक्षण: ऑफ़लाइन नीति शिक्षण के लिए डबली रोबस्ट विधि का उपयोग करके अवलोकन संबंधी डेटा से प्रत्यक्ष नीति शिक्षण, एक अनुशंसित उपचार की भविष्यवाणी करना। स्थापना PyPI से pip install econml के माध्यम से की जाती है; स्रोत स्थापना डेवलपर्स के लिए प्रलेखित है। परियोजना pywhy.org/EconML पर एक सक्रिय रिलीज़ इतिहास और दस्तावेज़ीकरण बनाए रखती है, साथ ही योगदानकर्ताओं के लिए परीक्षण और दस्तावेज़ीकरण निर्माण निर्देश।