프로젝트 소개
EconML은 머신러닝을 통해 관측 데이터에서 이질적 처치 효과를 추정하기 위한 Python 패키지이다. Microsoft Research의 ALICE 프로젝트의 일환으로 설계 및 구축되었으며, 최신 머신러닝 기법과 계량경제학을 결합하여 복잡한 인과 추론 문제에 자동화를 도입한다.
핵심 목적: 하나 이상의 처치 변수 T가 결과 변수 Y에 미치는 인과 효과를 측정하고, 특징 X와 W를 통제하며, 그 효과가 X의 함수로서 어떻게 달라지는지 파악한다. 이 방법들은 관측(비실험 또는 과거) 데이터셋과 함께 작동한다. 인과적 해석을 위해 일부 방법은 관측되지 않은 교란 요인이 없다고 가정하며, 다른 방법은 처치 T에는 영향을 미치지만 결과 Y에는 직접적인 영향을 미치지 않는 도구 Z에 대한 접근을 가정한다. 대부분의 방법은 신뢰 구간과 추론 결과를 제공한다.
명시된 설계 목표에는 계량경제학과 머신러닝의 교차점에서 최신 기법을 구현하고, 효과 이질성 모델링(랜덤 포레스트, 부스팅, 라쏘, 신경망)의 유연성을 유지하면서 인과적 해석을 보존하고 종종 유효한 신뢰 구간을 제공하며, 통합 API를 사용하고, 머신러닝 및 데이터 분석을 위한 표준 Python 패키지를 기반으로 구축하는 것이 포함된다.
README에 표시된 구현된 추정 계열은 다음과 같다:
- 이중 머신러닝(LinearDML, SparseLinearDML, NonParamDML, CausalForestDML) - OLS 또는 부트스트랩 신뢰 구간 포함.
- 패널 데이터를 위한 동적 이중 머신러닝(DynamicDML).
- 직교 랜덤 포레스트(DMLOrthoForest, DROrthoForest).
- 메타러너: XLearner, SLearner, TLearner.
- 이중 강건 학습기: LinearDRLearner, SparseLinearDRLearner, ForestDRLearner.
- 도구 변수 방법: OrthoIV, NonParamDMLIV, LinearDRIV, SparseLinearDRIV, ForestDRIV, LinearIntentToTreatDRIV.
해석 가능성 지원에는 CATE 모델의 트리 해석기(SingleTreeCateInterpreter), 정책 해석기(SingleTreePolicyInterpreter), CATE 모델에 대한 SHAP 값이 포함된다.
모델 선택 및 검증: 인과 모델 선택, 점수 산정 및 가중 앙상블을 위한 RScorer; LassoCV 또는 GridSearchCV와 같은 sklearn 모델 선택 클래스 또는 후보 모델 목록과 함께 작동하는 내장 1단계 모델 선택.
추론: 활성화되면 InferenceResults 객체가 p-값, z-통계량, 표준 오차 및 신뢰 구간을 제공한다. 선형 모수 CATE 모델에는 summary() 메서드가 제공되며, 표본 및 모집단 수준에서 effect_inference 요약도 제공된다.
정책 학습: 오프라인 정책 학습을 위한 이중 강건 방법을 사용하여 관측 데이터에서 직접 정책을 학습하고 권장 처치를 예측한다.
설치는 PyPI에서 pip install econml을 통해 이루어지며, 소스 설치는 개발자를 위해 문서화되어 있다. 이 프로젝트는 활발한 릴리스 이력과 pywhy.org/EconML에서 문서를 유지 관리하며, 기여자를 위한 테스트 및 문서 생성 지침을 제공한다.
Comments
0 people shared their preference · Deer Point appears after 10 participants
Sign in to join the discussion.