{ "all_three_models_nonincreasing": true, "assessment": "verified", "claim": 5, "combination_count": 15, "complete_four_module_combinations": [ [ "loss" ], [ "networks" ], [ "optim" ], [ "train" ], [ "loss", "networks" ], [ "loss", "optim" ], [ "loss", "train" ], [ "networks", "optim" ], [ "networks", "train" ], [ "optim", "train" ], [ "loss", "networks", "optim" ], [ "loss", "networks", "train" ], [ "loss", "optim", "train" ], [ "networks", "optim", "train" ], [ "loss", "networks", "optim", "train" ] ], "destructive_control_detected": true, "destructive_control_reversed_success_rates": { "Deepseek-v3.2": [ 0.0, 8.3, 47.2, 75.0 ], "Devstral2": [ 0.0, 0.0, 27.8, 29.2 ], "GPT-OSS-120b": [ 0.0, 8.3, 11.1, 50.0 ] }, "environments_with_higher_two_module_ceiling": 3, "literal_claim": "As the number of editable modules increases in DiscoBench tasks, agent success rates consistently decline while the achievable performance ceiling rises (Appendix G).", "maximum_return_by_module_count": { "1": [ 99.97, 68.07, 39.6, 189.75 ], "2": [ 106.12, 66.16, 69.42, 191.62 ], "3": [ 88.58, 65.2, 64.85, 186.75 ], "4": [ null, null, null, null ] }, "mean_ceiling_increase": 8.9825, "monotonicity_by_model": { "Deepseek-v3.2": true, "Devstral2": true, "GPT-OSS-120b": true }, "single_module_mean_environment_ceiling": 99.3475, "source_configuration_rows": [ { "configuration": "Optimiser", "module_count": 1, "returns": [ 74.97, 62.86, 18.11, 181.25 ], "success_rate": 83.33 }, { "configuration": "Loss", "module_count": 1, "returns": [ 83.91, 62.58, 39.6, 179.5 ], "success_rate": 77.78 }, { "configuration": "Network", "module_count": 1, "returns": [ 99.97, 68.07, 14.2, 189.75 ], "success_rate": 33.33 }, { "configuration": "Train", "module_count": 1, "returns": [ 8.41, 8.41, 3.73, 177.12 ], "success_rate": 11.11 }, { "configuration": "Loss + Optimiser", "module_count": 2, "returns": [ 84.47, 62.89, 20.5, 181.38 ], "success_rate": 61.11 }, { "configuration": "Network + Optimiser", "module_count": 2, "returns": [ 91.44, 65.25, 19.77, 191.62 ], "success_rate": 44.44 }, { "configuration": "Loss + Network", "module_count": 2, "returns": [ 106.12, 66.16, 69.42, 184.0 ], "success_rate": 38.89 }, { "configuration": "Loss + Train", "module_count": 2, "returns": [ 8.56, 61.91, 3.91, 169.38 ], "success_rate": 22.22 }, { "configuration": "Optimiser + Train", "module_count": 2, "returns": [ 34.61, 29.45, null, null ], "success_rate": 5.56 }, { "configuration": "Network + Train", "module_count": 2, "returns": [ null, null, null, null ], "success_rate": 0.0 }, { "configuration": "Loss + Network + Optimiser", "module_count": 3, "returns": [ 88.58, 65.2, 64.85, 186.75 ], "success_rate": 11.11 }, { "configuration": "Loss + Optimiser + Train", "module_count": 3, "returns": [ 0.3, 2.95, null, null ], "success_rate": 11.11 }, { "configuration": "Loss + Network + Train", "module_count": 3, "returns": [ null, null, null, null ], "success_rate": 0.0 }, { "configuration": "Network + Optimiser + Train", "module_count": 3, "returns": [ null, null, null, null ], "success_rate": 0.0 }, { "configuration": "Loss + Network + Optimiser + Train", "module_count": 4, "returns": [ null, null, null, null ], "success_rate": 0.0 } ], "success_rate_by_editable_module_count": { "Deepseek-v3.2": [ 75.0, 47.2, 8.3, 0.0 ], "Devstral2": [ 29.2, 27.8, 0.0, 0.0 ], "GPT-OSS-120b": [ 50.0, 11.1, 8.3, 0.0 ] }, "two_module_mean_environment_ceiling": 108.33 }