ProCreations's picture
Publish DiscoGen exact native reproduction
6fd091d verified
Raw
History Blame Contribute Delete
5.18 kB
{
"all_three_models_nonincreasing": true,
"assessment": "verified",
"claim": 5,
"combination_count": 15,
"complete_four_module_combinations": [
[
"loss"
],
[
"networks"
],
[
"optim"
],
[
"train"
],
[
"loss",
"networks"
],
[
"loss",
"optim"
],
[
"loss",
"train"
],
[
"networks",
"optim"
],
[
"networks",
"train"
],
[
"optim",
"train"
],
[
"loss",
"networks",
"optim"
],
[
"loss",
"networks",
"train"
],
[
"loss",
"optim",
"train"
],
[
"networks",
"optim",
"train"
],
[
"loss",
"networks",
"optim",
"train"
]
],
"destructive_control_detected": true,
"destructive_control_reversed_success_rates": {
"Deepseek-v3.2": [
0.0,
8.3,
47.2,
75.0
],
"Devstral2": [
0.0,
0.0,
27.8,
29.2
],
"GPT-OSS-120b": [
0.0,
8.3,
11.1,
50.0
]
},
"environments_with_higher_two_module_ceiling": 3,
"literal_claim": "As the number of editable modules increases in DiscoBench tasks, agent success rates consistently decline while the achievable performance ceiling rises (Appendix G).",
"maximum_return_by_module_count": {
"1": [
99.97,
68.07,
39.6,
189.75
],
"2": [
106.12,
66.16,
69.42,
191.62
],
"3": [
88.58,
65.2,
64.85,
186.75
],
"4": [
null,
null,
null,
null
]
},
"mean_ceiling_increase": 8.9825,
"monotonicity_by_model": {
"Deepseek-v3.2": true,
"Devstral2": true,
"GPT-OSS-120b": true
},
"single_module_mean_environment_ceiling": 99.3475,
"source_configuration_rows": [
{
"configuration": "Optimiser",
"module_count": 1,
"returns": [
74.97,
62.86,
18.11,
181.25
],
"success_rate": 83.33
},
{
"configuration": "Loss",
"module_count": 1,
"returns": [
83.91,
62.58,
39.6,
179.5
],
"success_rate": 77.78
},
{
"configuration": "Network",
"module_count": 1,
"returns": [
99.97,
68.07,
14.2,
189.75
],
"success_rate": 33.33
},
{
"configuration": "Train",
"module_count": 1,
"returns": [
8.41,
8.41,
3.73,
177.12
],
"success_rate": 11.11
},
{
"configuration": "Loss + Optimiser",
"module_count": 2,
"returns": [
84.47,
62.89,
20.5,
181.38
],
"success_rate": 61.11
},
{
"configuration": "Network + Optimiser",
"module_count": 2,
"returns": [
91.44,
65.25,
19.77,
191.62
],
"success_rate": 44.44
},
{
"configuration": "Loss + Network",
"module_count": 2,
"returns": [
106.12,
66.16,
69.42,
184.0
],
"success_rate": 38.89
},
{
"configuration": "Loss + Train",
"module_count": 2,
"returns": [
8.56,
61.91,
3.91,
169.38
],
"success_rate": 22.22
},
{
"configuration": "Optimiser + Train",
"module_count": 2,
"returns": [
34.61,
29.45,
null,
null
],
"success_rate": 5.56
},
{
"configuration": "Network + Train",
"module_count": 2,
"returns": [
null,
null,
null,
null
],
"success_rate": 0.0
},
{
"configuration": "Loss + Network + Optimiser",
"module_count": 3,
"returns": [
88.58,
65.2,
64.85,
186.75
],
"success_rate": 11.11
},
{
"configuration": "Loss + Optimiser + Train",
"module_count": 3,
"returns": [
0.3,
2.95,
null,
null
],
"success_rate": 11.11
},
{
"configuration": "Loss + Network + Train",
"module_count": 3,
"returns": [
null,
null,
null,
null
],
"success_rate": 0.0
},
{
"configuration": "Network + Optimiser + Train",
"module_count": 3,
"returns": [
null,
null,
null,
null
],
"success_rate": 0.0
},
{
"configuration": "Loss + Network + Optimiser + Train",
"module_count": 4,
"returns": [
null,
null,
null,
null
],
"success_rate": 0.0
}
],
"success_rate_by_editable_module_count": {
"Deepseek-v3.2": [
75.0,
47.2,
8.3,
0.0
],
"Devstral2": [
29.2,
27.8,
0.0,
0.0
],
"GPT-OSS-120b": [
50.0,
11.1,
8.3,
0.0
]
},
"two_module_mean_environment_ceiling": 108.33
}