Sobre el proyecto
EconML es un paquete de Python para estimar efectos de tratamiento heterogéneos a partir de datos observacionales mediante aprendizaje automático. Fue diseñado y construido como parte del proyecto ALICE en Microsoft Research, combinando técnicas de aprendizaje automático de vanguardia con econometría para aportar automatización a problemas complejos de inferencia causal.
Propósito principal: medir el efecto causal de una o más variables de tratamiento T sobre una variable de resultado Y, controlando por las características X y W, y cómo ese efecto varía en función de X. Los métodos funcionan con conjuntos de datos observacionales (no experimentales o históricos). Para la interpretación causal, algunos métodos asumen que no hay confusores no observados, mientras que otros asumen acceso a un instrumento Z que afecta al tratamiento T pero no tiene un efecto directo sobre el resultado Y. La mayoría de los métodos proporcionan intervalos de confianza y resultados de inferencia.
Los objetivos de diseño declarados incluyen implementar técnicas recientes en la intersección de la econometría y el aprendizaje automático, mantener flexibilidad en el modelado de la heterogeneidad de los efectos (bosques aleatorios, boosting, lasso, redes neuronales) preservando la interpretación causal y ofreciendo a menudo intervalos de confianza válidos, usar una API unificada y basarse en paquetes estándar de Python para aprendizaje automático y análisis de datos.
Las familias de estimación implementadas que se muestran en el README incluyen:
- Double Machine Learning (LinearDML, SparseLinearDML, NonParamDML, CausalForestDML) con intervalos de confianza OLS o bootstrap.
- Dynamic Double Machine Learning para datos de panel (DynamicDML).
- Orthogonal Random Forests (DMLOrthoForest, DROrthoForest).
- Meta-aprendices: XLearner, SLearner, TLearner.
- Aprendices doblemente robustos: LinearDRLearner, SparseLinearDRLearner, ForestDRLearner.
- Métodos de variables instrumentales: OrthoIV, NonParamDMLIV, LinearDRIV, SparseLinearDRIV, ForestDRIV, LinearIntentToTreatDRIV.
El soporte de interpretabilidad incluye un intérprete de árbol del modelo CATE (SingleTreeCateInterpreter), un intérprete de políticas (SingleTreePolicyInterpreter) y valores SHAP para el modelo CATE.
Selección y validación de modelos: un RScorer para la selección de modelos causales, puntuación y ensamblado ponderado; selección de modelos de primera etapa integrada que funciona con clases de selección de modelos de sklearn como LassoCV o GridSearchCV, o una lista de modelos candidatos.
Inferencia: cuando está habilitada, un objeto InferenceResults proporciona valores p, estadísticos z, errores estándar e intervalos de confianza; hay disponible un método summary() para modelos CATE paramétricos lineales, además de resúmenes de effect_inference a nivel de muestra y de población.
Aprendizaje de políticas: aprendizaje directo de políticas a partir de datos observacionales mediante un método doblemente robusto para el aprendizaje de políticas fuera de línea, prediciendo un tratamiento recomendado.
La instalación se realiza mediante pip install econml desde PyPI; la instalación desde el código fuente está documentada para desarrolladores. El proyecto mantiene un historial de versiones activo y documentación en pywhy.org/EconML, con instrucciones de pruebas y generación de documentación para colaboradores.
Comments
0 people shared their preference · Deer Point appears after 10 participants
Sign in to join the discussion.