{ "benchmark": "Causal Forge", "replications": 100, "samples_per_replication": 3000, "cross_fitting_folds": 5, "structural_truth": "known heterogeneous individual treatment effects", "summary": { "both_correct": { "naive": { "mean_estimate": 3.1123144027184075, "bias": 1.110939263534936, "mean_absolute_error": 1.110939263534936, "rmse": 1.1132682867094192 }, "ipw": { "mean_estimate": 2.005159416540855, "bias": 0.0037842773573832744, "mean_absolute_error": 0.0643549025548575, "rmse": 0.07985124612336089 }, "outcome_regression": { "mean_estimate": 2.0031127881794304, "bias": 0.0017376489959579633, "mean_absolute_error": 0.038795035337436425, "rmse": 0.04801133697032812 }, "aipw": { "mean_estimate": 2.0017294974257873, "bias": 0.00035435824231527135, "mean_absolute_error": 0.04261334125461211, "rmse": 0.05444966094807796, "confidence_interval_coverage": 0.89 } }, "propensity_misspecified": { "naive": { "mean_estimate": 3.1123144027184075, "bias": 1.110939263534936, "mean_absolute_error": 1.110939263534936, "rmse": 1.1132682867094192 }, "ipw": { "mean_estimate": 2.1339948243616265, "bias": 0.13261968517815434, "mean_absolute_error": 0.1341636821632256, "rmse": 0.14885056735045618 }, "outcome_regression": { "mean_estimate": 2.0031127881794304, "bias": 0.0017376489959579633, "mean_absolute_error": 0.038795035337436425, "rmse": 0.04801133697032812 }, "aipw": { "mean_estimate": 2.002138366914246, "bias": 0.0007632277307738455, "mean_absolute_error": 0.04142272629021512, "rmse": 0.05271409176654249, "confidence_interval_coverage": 0.92 } }, "outcome_misspecified": { "naive": { "mean_estimate": 3.1123144027184075, "bias": 1.110939263534936, "mean_absolute_error": 1.110939263534936, "rmse": 1.1132682867094192 }, "ipw": { "mean_estimate": 2.005159416540855, "bias": 0.0037842773573832744, "mean_absolute_error": 0.0643549025548575, "rmse": 0.07985124612336089 }, "outcome_regression": { "mean_estimate": 2.2701977886081592, "bias": 0.26882264942468725, "mean_absolute_error": 0.26882264942468725, "rmse": 0.2753485792353652 }, "aipw": { "mean_estimate": 2.009154042503896, "bias": 0.007778903320424111, "mean_absolute_error": 0.048137374861682396, "rmse": 0.06166591119979539, "confidence_interval_coverage": 0.99 } }, "both_misspecified": { "naive": { "mean_estimate": 3.1123144027184075, "bias": 1.110939263534936, "mean_absolute_error": 1.110939263534936, "rmse": 1.1132682867094192 }, "ipw": { "mean_estimate": 2.1339948243616265, "bias": 0.13261968517815434, "mean_absolute_error": 0.1341636821632256, "rmse": 0.14885056735045618 }, "outcome_regression": { "mean_estimate": 2.2701977886081592, "bias": 0.26882264942468725, "mean_absolute_error": 0.26882264942468725, "rmse": 0.2753485792353652 }, "aipw": { "mean_estimate": 2.396631864687349, "bias": 0.395256725503877, "mean_absolute_error": 0.395256725503877, "rmse": 0.4048953844650616, "confidence_interval_coverage": 0.01 } } } }