このプロジェクトについて

EconMLは、観測データから機械学習を用いて不均一治療効果を推定するためのPythonパッケージです。これはマイクロソフトリサーチのALICEプロジェクトの一部として設計・構築され、最先端の機械学習技術と計量経済学を組み合わせ、複雑な因果推論問題に自動化をもたらします。 主な目的は、特徴量XとWを制御しながら、1つ以上の治療変数Tが結果変数Yに与える因果効果と、その効果がXの関数としてどう変化するかを測定することです。この手法は観測(非実験的または履歴)データセットで機能します。因果解釈のために、一部の手法は観測されない交絡因子がないことを仮定し、他の手法は治療Tに影響するが結果Yには直接影響しない操作変数Zへのアクセスを仮定します。ほとんどの手法は信頼区間と推論結果を提供します。 明示された設計目標には、計量経済学と機械学習の交差点にある最近の技術を実装し、効果不均一性のモデリング(ランダムフォレスト、ブースティング、ラッソ、ニューラルネット)で柔軟性を維持しつつ、因果解釈を保持し、多くの場合有効な信頼区間を提供し、統一APIを使用し、標準的なPython機械学習・データ分析パッケージに基づくことが含まれます。 READMEに示された実装済み推定ファミリーには以下が含まれます: - 二重機械学習(LinearDML、SparseLinearDML、NonParamDML、CausalForestDML)で、OLSまたはブートストラップ信頼区間を使用。 - パネルデータ用の動的二重機械学習(DynamicDML)。 - 直交ランダムフォレスト(DMLOrthoForest、DROrthoForest)。 - メタ学習器:XLearner、SLearner、TLearner。 - 二重ロバスト学習器:LinearDRLearner、SparseLinearDRLearner、ForestDRLearner。 - 操作変数法:OrthoIV、NonParamDMLIV、LinearDRIV、SparseLinearDRIV、ForestDRIV、LinearIntentToTreatDRIV。 解釈可能性サポートには、CATEモデルのツリー解釈器(SingleTreeCateInterpreter)、政策解釈器(SingleTreePolicyInterpreter)、およびCATEモデルのSHAP値が含まれます。 モデル選択と検証:因果モデル選択、スコアリング、重み付きアンサンブルのためのRScorer、LassoCVやGridSearchCVなどのsklearnモデル選択クラスまたは候補モデルのリストで機能する組み込みの第一段階モデル選択。 推論:有効な場合、InferenceResultsオブジェクトがp値、z統計量、標準誤差、信頼区間を提供します。線形パラメトリックCATEモデル用のsummary()メソッドに加え、サンプルおよび母集団レベルでのeffect_inference要約があります。 政策学習:オフライン政策学習のための二重ロバスト法を使用した観測データからの直接的な政策学習で、推奨治療を予測します。 インストールはPyPIからpip install econmlで行います。ソースからのインストールは開発者向けに文書化されています。プロジェクトは活発なリリース履歴とpywhy.org/EconMLでの文書を維持し、貢献者向けのテストと文書生成手順を含みます。