Spaces:
Running
Running
Publish codex SIMPLE seed-0 evaluation evidence
Browse files- catalog/task06/07-pick-and-place-and-hug-container/task.yaml +1 -0
- comparison.json +47 -47
- data.json +164 -105
- episodes.csv +1 -1
- episodes.json +82 -74
- manifest.json +8 -8
- protocol.json +5 -5
- publication-manifest.json +17 -17
- summary.json +14 -6
- task-index.json +52 -17
catalog/task06/07-pick-and-place-and-hug-container/task.yaml
CHANGED
|
@@ -11,3 +11,4 @@ backend_kwargs:
|
|
| 11 |
sim_mode: mujoco_isaac
|
| 12 |
dr_level: 0
|
| 13 |
arm_gravity_compensation: true
|
|
|
|
|
|
| 11 |
sim_mode: mujoco_isaac
|
| 12 |
dr_level: 0
|
| 13 |
arm_gravity_compensation: true
|
| 14 |
+
max_steps: 15000
|
comparison.json
CHANGED
|
@@ -3693,42 +3693,42 @@
|
|
| 3693 |
"same_instruction": true,
|
| 3694 |
"same_budget": true,
|
| 3695 |
"same_roboenv_source": true,
|
| 3696 |
-
"kinex_steps":
|
| 3697 |
-
"codex_steps":
|
| 3698 |
"kinex_usage": {
|
| 3699 |
-
"input_tokens":
|
| 3700 |
-
"output_tokens":
|
| 3701 |
-
"cached_input_tokens":
|
| 3702 |
"cache_write_input_tokens": 0,
|
| 3703 |
-
"reasoning_output_tokens":
|
| 3704 |
-
"cache_reported_input_tokens":
|
| 3705 |
-
"cache_write_reported_input_tokens":
|
| 3706 |
-
"reasoning_reported_output_tokens":
|
| 3707 |
"schema": "rlebench/token-usage/1",
|
| 3708 |
"source": "Provider terminal response usage",
|
| 3709 |
-
"response_count":
|
| 3710 |
"reported_responses": {
|
| 3711 |
-
"input_tokens":
|
| 3712 |
-
"output_tokens":
|
| 3713 |
-
"cached_input_tokens":
|
| 3714 |
-
"cache_write_input_tokens":
|
| 3715 |
-
"reasoning_output_tokens":
|
| 3716 |
-
"cache_reported_input_tokens":
|
| 3717 |
-
"cache_write_reported_input_tokens":
|
| 3718 |
-
"reasoning_reported_output_tokens":
|
| 3719 |
},
|
| 3720 |
-
"known_cached_input_tokens":
|
| 3721 |
-
"known_input_tokens":
|
| 3722 |
-
"known_output_tokens":
|
| 3723 |
"known_cache_write_input_tokens": 0,
|
| 3724 |
-
"known_reasoning_output_tokens":
|
| 3725 |
-
"cache_hit_rate": 0.
|
| 3726 |
-
"uncached_input_tokens":
|
| 3727 |
"cost_usd": null,
|
| 3728 |
"response_ids_complete": true,
|
| 3729 |
"accounting": "reported-responses",
|
| 3730 |
"usage_source": "provider-raw",
|
| 3731 |
-
"request_attempts":
|
| 3732 |
"rejected_attempts": 0,
|
| 3733 |
"unresolved_attempts": [],
|
| 3734 |
"audit_complete": true
|
|
@@ -3736,38 +3736,38 @@
|
|
| 3736 |
"codex_usage": {
|
| 3737 |
"accounting": "reported-responses",
|
| 3738 |
"audit_complete": true,
|
| 3739 |
-
"cache_hit_rate": 0.
|
| 3740 |
-
"cache_reported_input_tokens":
|
| 3741 |
"cache_write_input_tokens": 0,
|
| 3742 |
-
"cache_write_reported_input_tokens":
|
| 3743 |
-
"cached_input_tokens":
|
| 3744 |
"completed_turns": 1,
|
| 3745 |
"cost_usd": null,
|
| 3746 |
"failed_turns": 0,
|
| 3747 |
-
"input_tokens":
|
| 3748 |
"known_cache_write_input_tokens": 0,
|
| 3749 |
-
"known_cached_input_tokens":
|
| 3750 |
-
"known_input_tokens":
|
| 3751 |
-
"known_output_tokens":
|
| 3752 |
-
"known_reasoning_output_tokens":
|
| 3753 |
-
"output_tokens":
|
| 3754 |
-
"reasoning_output_tokens":
|
| 3755 |
-
"reasoning_reported_output_tokens":
|
| 3756 |
"reported_responses": {
|
| 3757 |
-
"cache_reported_input_tokens":
|
| 3758 |
-
"cache_write_input_tokens":
|
| 3759 |
-
"cache_write_reported_input_tokens":
|
| 3760 |
-
"cached_input_tokens":
|
| 3761 |
-
"input_tokens":
|
| 3762 |
-
"output_tokens":
|
| 3763 |
-
"reasoning_output_tokens":
|
| 3764 |
-
"reasoning_reported_output_tokens":
|
| 3765 |
},
|
| 3766 |
-
"response_count":
|
| 3767 |
"response_ids_complete": true,
|
| 3768 |
"schema": "rlebench/token-usage/1",
|
| 3769 |
"source": "Codex token_usage_record per response",
|
| 3770 |
-
"uncached_input_tokens":
|
| 3771 |
"unidentified_usage_records": 0
|
| 3772 |
}
|
| 3773 |
},
|
|
|
|
| 3693 |
"same_instruction": true,
|
| 3694 |
"same_budget": true,
|
| 3695 |
"same_roboenv_source": true,
|
| 3696 |
+
"kinex_steps": 12022,
|
| 3697 |
+
"codex_steps": 13688,
|
| 3698 |
"kinex_usage": {
|
| 3699 |
+
"input_tokens": 27597531,
|
| 3700 |
+
"output_tokens": 39270,
|
| 3701 |
+
"cached_input_tokens": 27060864,
|
| 3702 |
"cache_write_input_tokens": 0,
|
| 3703 |
+
"reasoning_output_tokens": 15762,
|
| 3704 |
+
"cache_reported_input_tokens": 27597531,
|
| 3705 |
+
"cache_write_reported_input_tokens": 27597531,
|
| 3706 |
+
"reasoning_reported_output_tokens": 39270,
|
| 3707 |
"schema": "rlebench/token-usage/1",
|
| 3708 |
"source": "Provider terminal response usage",
|
| 3709 |
+
"response_count": 315,
|
| 3710 |
"reported_responses": {
|
| 3711 |
+
"input_tokens": 315,
|
| 3712 |
+
"output_tokens": 315,
|
| 3713 |
+
"cached_input_tokens": 315,
|
| 3714 |
+
"cache_write_input_tokens": 315,
|
| 3715 |
+
"reasoning_output_tokens": 315,
|
| 3716 |
+
"cache_reported_input_tokens": 315,
|
| 3717 |
+
"cache_write_reported_input_tokens": 315,
|
| 3718 |
+
"reasoning_reported_output_tokens": 315
|
| 3719 |
},
|
| 3720 |
+
"known_cached_input_tokens": 27060864,
|
| 3721 |
+
"known_input_tokens": 27597531,
|
| 3722 |
+
"known_output_tokens": 39270,
|
| 3723 |
"known_cache_write_input_tokens": 0,
|
| 3724 |
+
"known_reasoning_output_tokens": 15762,
|
| 3725 |
+
"cache_hit_rate": 0.9805538038891958,
|
| 3726 |
+
"uncached_input_tokens": 536667,
|
| 3727 |
"cost_usd": null,
|
| 3728 |
"response_ids_complete": true,
|
| 3729 |
"accounting": "reported-responses",
|
| 3730 |
"usage_source": "provider-raw",
|
| 3731 |
+
"request_attempts": 318,
|
| 3732 |
"rejected_attempts": 0,
|
| 3733 |
"unresolved_attempts": [],
|
| 3734 |
"audit_complete": true
|
|
|
|
| 3736 |
"codex_usage": {
|
| 3737 |
"accounting": "reported-responses",
|
| 3738 |
"audit_complete": true,
|
| 3739 |
+
"cache_hit_rate": 0.9903104416710947,
|
| 3740 |
+
"cache_reported_input_tokens": 28195506,
|
| 3741 |
"cache_write_input_tokens": 0,
|
| 3742 |
+
"cache_write_reported_input_tokens": 28195506,
|
| 3743 |
+
"cached_input_tokens": 27922304,
|
| 3744 |
"completed_turns": 1,
|
| 3745 |
"cost_usd": null,
|
| 3746 |
"failed_turns": 0,
|
| 3747 |
+
"input_tokens": 28195506,
|
| 3748 |
"known_cache_write_input_tokens": 0,
|
| 3749 |
+
"known_cached_input_tokens": 27922304,
|
| 3750 |
+
"known_input_tokens": 28195506,
|
| 3751 |
+
"known_output_tokens": 45427,
|
| 3752 |
+
"known_reasoning_output_tokens": 17604,
|
| 3753 |
+
"output_tokens": 45427,
|
| 3754 |
+
"reasoning_output_tokens": 17604,
|
| 3755 |
+
"reasoning_reported_output_tokens": 45427,
|
| 3756 |
"reported_responses": {
|
| 3757 |
+
"cache_reported_input_tokens": 330,
|
| 3758 |
+
"cache_write_input_tokens": 330,
|
| 3759 |
+
"cache_write_reported_input_tokens": 330,
|
| 3760 |
+
"cached_input_tokens": 330,
|
| 3761 |
+
"input_tokens": 330,
|
| 3762 |
+
"output_tokens": 330,
|
| 3763 |
+
"reasoning_output_tokens": 330,
|
| 3764 |
+
"reasoning_reported_output_tokens": 330
|
| 3765 |
},
|
| 3766 |
+
"response_count": 330,
|
| 3767 |
"response_ids_complete": true,
|
| 3768 |
"schema": "rlebench/token-usage/1",
|
| 3769 |
"source": "Codex token_usage_record per response",
|
| 3770 |
+
"uncached_input_tokens": 273202,
|
| 3771 |
"unidentified_usage_records": 0
|
| 3772 |
}
|
| 3773 |
},
|
data.json
CHANGED
|
@@ -6,7 +6,7 @@
|
|
| 6 |
"benchmark_complete": true,
|
| 7 |
"edition": "codex-simple-astra-high-seed0",
|
| 8 |
"created_at": "2026-10-09T00:09:42.989838+00:00",
|
| 9 |
-
"updated_at": "2026-10-10T05:
|
| 10 |
"model": "gpt-6-astra",
|
| 11 |
"effort": "high",
|
| 12 |
"seed": 0,
|
|
@@ -120,7 +120,7 @@
|
|
| 120 |
"task06/04": 15000,
|
| 121 |
"task06/05": 15000,
|
| 122 |
"task06/06": 15000,
|
| 123 |
-
"task06/07":
|
| 124 |
"task06/08": 10000,
|
| 125 |
"task06/09": 15000,
|
| 126 |
"task06/10": 15000,
|
|
@@ -131,9 +131,9 @@
|
|
| 131 |
"formal_results": 12,
|
| 132 |
"modified_results": 0,
|
| 133 |
"original_results": 12,
|
| 134 |
-
"input_tokens":
|
| 135 |
-
"cached_input_tokens":
|
| 136 |
-
"output_tokens":
|
| 137 |
}
|
| 138 |
],
|
| 139 |
"interrupted_attempts": 4,
|
|
@@ -161,8 +161,8 @@
|
|
| 161 |
},
|
| 162 |
"simple_reruns": {
|
| 163 |
"authorized": 6,
|
| 164 |
-
"published":
|
| 165 |
-
"remaining":
|
| 166 |
"selection": "Latest validated completed result per task; earlier native failures remain in attempt history.",
|
| 167 |
"comparison_scope": "Only earlier failures were rerun at 15000 steps. Retained successes use 10000 steps. This selected-result view is not a uniform-budget agent comparison.",
|
| 168 |
"replacements": [
|
|
@@ -205,6 +205,14 @@
|
|
| 205 |
"current_max_steps": 15000,
|
| 206 |
"previous_max_steps": 10000,
|
| 207 |
"success": false
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 208 |
}
|
| 209 |
]
|
| 210 |
}
|
|
@@ -310,7 +318,7 @@
|
|
| 310 |
"task06/04": 15000,
|
| 311 |
"task06/05": 15000,
|
| 312 |
"task06/06": 15000,
|
| 313 |
-
"task06/07":
|
| 314 |
"task06/08": 10000,
|
| 315 |
"task06/09": 15000,
|
| 316 |
"task06/10": 15000,
|
|
@@ -321,9 +329,9 @@
|
|
| 321 |
"formal_results": 12,
|
| 322 |
"modified_results": 0,
|
| 323 |
"original_results": 12,
|
| 324 |
-
"input_tokens":
|
| 325 |
-
"cached_input_tokens":
|
| 326 |
-
"output_tokens":
|
| 327 |
}
|
| 328 |
],
|
| 329 |
"tasks": [
|
|
@@ -6396,7 +6404,7 @@
|
|
| 6396 |
"task06/04": 15000,
|
| 6397 |
"task06/05": 15000,
|
| 6398 |
"task06/06": 15000,
|
| 6399 |
-
"task06/07":
|
| 6400 |
"task06/08": 10000,
|
| 6401 |
"task06/09": 15000,
|
| 6402 |
"task06/10": 15000,
|
|
@@ -6440,7 +6448,7 @@
|
|
| 6440 |
"task06/04": 15000,
|
| 6441 |
"task06/05": 15000,
|
| 6442 |
"task06/06": 15000,
|
| 6443 |
-
"task06/07":
|
| 6444 |
"task06/08": 10000,
|
| 6445 |
"task06/09": 15000,
|
| 6446 |
"task06/10": 15000,
|
|
@@ -6526,7 +6534,7 @@
|
|
| 6526 |
"task06/04": 15000,
|
| 6527 |
"task06/05": 15000,
|
| 6528 |
"task06/06": 15000,
|
| 6529 |
-
"task06/07":
|
| 6530 |
"task06/08": 10000,
|
| 6531 |
"task06/09": 15000,
|
| 6532 |
"task06/10": 15000,
|
|
@@ -6612,7 +6620,7 @@
|
|
| 6612 |
"task06/04": 15000,
|
| 6613 |
"task06/05": 15000,
|
| 6614 |
"task06/06": 15000,
|
| 6615 |
-
"task06/07":
|
| 6616 |
"task06/08": 10000,
|
| 6617 |
"task06/09": 15000,
|
| 6618 |
"task06/10": 15000,
|
|
@@ -6698,7 +6706,7 @@
|
|
| 6698 |
"task06/04": 15000,
|
| 6699 |
"task06/05": 15000,
|
| 6700 |
"task06/06": 15000,
|
| 6701 |
-
"task06/07":
|
| 6702 |
"task06/08": 10000,
|
| 6703 |
"task06/09": 15000,
|
| 6704 |
"task06/10": 15000,
|
|
@@ -6784,7 +6792,7 @@
|
|
| 6784 |
"task06/04": 15000,
|
| 6785 |
"task06/05": 15000,
|
| 6786 |
"task06/06": 15000,
|
| 6787 |
-
"task06/07":
|
| 6788 |
"task06/08": 10000,
|
| 6789 |
"task06/09": 15000,
|
| 6790 |
"task06/10": 15000,
|
|
@@ -6855,14 +6863,14 @@
|
|
| 6855 |
"native_instruction": "pick up the apple from table1,hug the container,walk to table2,and place on table2.",
|
| 6856 |
"instruction_source": "Unchanged native SIMPLE instruction for the effective default task configuration.",
|
| 6857 |
"status": "completed",
|
| 6858 |
-
"episode_id": "task06-07-seed0-formal",
|
| 6859 |
"run_status": "finished",
|
| 6860 |
"status_note": "Native result, execution and usage complete.",
|
| 6861 |
"planned_protocol": {
|
| 6862 |
"episodes": 1,
|
| 6863 |
"seed": 0,
|
| 6864 |
"control_frequency_hz": 50,
|
| 6865 |
-
"max_control_steps":
|
| 6866 |
"max_control_steps_by_task": {
|
| 6867 |
"task06/01": 10000,
|
| 6868 |
"task06/02": 15000,
|
|
@@ -6870,7 +6878,7 @@
|
|
| 6870 |
"task06/04": 15000,
|
| 6871 |
"task06/05": 15000,
|
| 6872 |
"task06/06": 15000,
|
| 6873 |
-
"task06/07":
|
| 6874 |
"task06/08": 10000,
|
| 6875 |
"task06/09": 15000,
|
| 6876 |
"task06/10": 15000,
|
|
@@ -6889,11 +6897,46 @@
|
|
| 6889 |
},
|
| 6890 |
"simple_rerun": {
|
| 6891 |
"attempt": 2,
|
| 6892 |
-
"status": "
|
| 6893 |
"target_max_steps": 15000,
|
| 6894 |
"previous_max_steps": 10000,
|
| 6895 |
-
"note": "
|
| 6896 |
-
}
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 6897 |
},
|
| 6898 |
{
|
| 6899 |
"key": "task06/08",
|
|
@@ -6921,7 +6964,7 @@
|
|
| 6921 |
"task06/04": 15000,
|
| 6922 |
"task06/05": 15000,
|
| 6923 |
"task06/06": 15000,
|
| 6924 |
-
"task06/07":
|
| 6925 |
"task06/08": 10000,
|
| 6926 |
"task06/09": 15000,
|
| 6927 |
"task06/10": 15000,
|
|
@@ -6965,7 +7008,7 @@
|
|
| 6965 |
"task06/04": 15000,
|
| 6966 |
"task06/05": 15000,
|
| 6967 |
"task06/06": 15000,
|
| 6968 |
-
"task06/07":
|
| 6969 |
"task06/08": 10000,
|
| 6970 |
"task06/09": 15000,
|
| 6971 |
"task06/10": 15000,
|
|
@@ -7009,7 +7052,7 @@
|
|
| 7009 |
"task06/04": 15000,
|
| 7010 |
"task06/05": 15000,
|
| 7011 |
"task06/06": 15000,
|
| 7012 |
-
"task06/07":
|
| 7013 |
"task06/08": 10000,
|
| 7014 |
"task06/09": 15000,
|
| 7015 |
"task06/10": 15000,
|
|
@@ -7053,7 +7096,7 @@
|
|
| 7053 |
"task06/04": 15000,
|
| 7054 |
"task06/05": 15000,
|
| 7055 |
"task06/06": 15000,
|
| 7056 |
-
"task06/07":
|
| 7057 |
"task06/08": 10000,
|
| 7058 |
"task06/09": 15000,
|
| 7059 |
"task06/10": 15000,
|
|
@@ -7097,7 +7140,7 @@
|
|
| 7097 |
"task06/04": 15000,
|
| 7098 |
"task06/05": 15000,
|
| 7099 |
"task06/06": 15000,
|
| 7100 |
-
"task06/07":
|
| 7101 |
"task06/08": 10000,
|
| 7102 |
"task06/09": 15000,
|
| 7103 |
"task06/10": 15000,
|
|
@@ -27242,7 +27285,7 @@
|
|
| 27242 |
"asset_base": "https://huggingface.co/datasets/RLE-Bench/codex-benchmark/resolve/main/episodes/task06/06/seed-0-attempt02/"
|
| 27243 |
},
|
| 27244 |
{
|
| 27245 |
-
"id": "task06-07-seed0-formal",
|
| 27246 |
"task_key": "task06/07",
|
| 27247 |
"family": "task06",
|
| 27248 |
"slot": "07",
|
|
@@ -27259,13 +27302,13 @@
|
|
| 27259 |
},
|
| 27260 |
"verdict": {
|
| 27261 |
"evidence_valid": true,
|
| 27262 |
-
"steps":
|
| 27263 |
"success": false,
|
| 27264 |
"termination": "stopped"
|
| 27265 |
},
|
| 27266 |
-
"steps":
|
| 27267 |
"simulation_time_s": null,
|
| 27268 |
-
"wall_time_s":
|
| 27269 |
"model": "gpt-6-astra",
|
| 27270 |
"effort": "high",
|
| 27271 |
"harness": "codex",
|
|
@@ -27276,44 +27319,44 @@
|
|
| 27276 |
"usage": {
|
| 27277 |
"accounting": "reported-responses",
|
| 27278 |
"audit_complete": true,
|
| 27279 |
-
"cache_hit_rate": 0.
|
| 27280 |
-
"cache_reported_input_tokens":
|
| 27281 |
"cache_write_input_tokens": 0,
|
| 27282 |
-
"cache_write_reported_input_tokens":
|
| 27283 |
-
"cached_input_tokens":
|
| 27284 |
"completed_turns": 1,
|
| 27285 |
"cost_usd": null,
|
| 27286 |
"failed_turns": 0,
|
| 27287 |
-
"input_tokens":
|
| 27288 |
"known_cache_write_input_tokens": 0,
|
| 27289 |
-
"known_cached_input_tokens":
|
| 27290 |
-
"known_input_tokens":
|
| 27291 |
-
"known_output_tokens":
|
| 27292 |
-
"known_reasoning_output_tokens":
|
| 27293 |
-
"output_tokens":
|
| 27294 |
-
"reasoning_output_tokens":
|
| 27295 |
-
"reasoning_reported_output_tokens":
|
| 27296 |
"reported_responses": {
|
| 27297 |
-
"cache_reported_input_tokens":
|
| 27298 |
-
"cache_write_input_tokens":
|
| 27299 |
-
"cache_write_reported_input_tokens":
|
| 27300 |
-
"cached_input_tokens":
|
| 27301 |
-
"input_tokens":
|
| 27302 |
-
"output_tokens":
|
| 27303 |
-
"reasoning_output_tokens":
|
| 27304 |
-
"reasoning_reported_output_tokens":
|
| 27305 |
-
},
|
| 27306 |
-
"response_count":
|
| 27307 |
"response_ids_complete": true,
|
| 27308 |
"schema": "rlebench/token-usage/1",
|
| 27309 |
"source": "Codex token_usage_record per response",
|
| 27310 |
-
"uncached_input_tokens":
|
| 27311 |
"unidentified_usage_records": 0
|
| 27312 |
},
|
| 27313 |
"call_activity": {
|
| 27314 |
-
"model_tool_calls":
|
| 27315 |
"model_tool_calls_by_name": {
|
| 27316 |
-
"exec":
|
| 27317 |
},
|
| 27318 |
"nested_python_tool_invocations": null,
|
| 27319 |
"python_device_rpc_attempts": null,
|
|
@@ -27329,21 +27372,21 @@
|
|
| 27329 |
"passed": true,
|
| 27330 |
"width": 1280,
|
| 27331 |
"height": 360,
|
| 27332 |
-
"duration_s":
|
| 27333 |
"speed": 4,
|
| 27334 |
"source_fps": 10,
|
| 27335 |
"output_fps": 20,
|
| 27336 |
"recording": {
|
| 27337 |
-
"accepted_samples":
|
| 27338 |
-
"captured_samples":
|
| 27339 |
"clock": "simulation",
|
| 27340 |
"dropped_samples": 0,
|
| 27341 |
-
"encoded_frames":
|
| 27342 |
-
"end_time_s":
|
| 27343 |
"error": null,
|
| 27344 |
"experimental": true,
|
| 27345 |
"fps": 10,
|
| 27346 |
-
"received_samples":
|
| 27347 |
"schema": "roboenv/recording/1",
|
| 27348 |
"state": "closed",
|
| 27349 |
"status": "complete",
|
|
@@ -27370,12 +27413,12 @@
|
|
| 27370 |
"camera_head_left",
|
| 27371 |
"camera_head_right"
|
| 27372 |
],
|
| 27373 |
-
"sha256": "
|
| 27374 |
"scope": "Native spectator recording postprocessed at 4x; no replay or rerender"
|
| 27375 |
},
|
| 27376 |
"analysis": {
|
| 27377 |
"outcome": "\u539f\u751f\u5224\u5b9a\u672a\u6210\u529f\u3002",
|
| 27378 |
-
"duration": "\u4f7f\u7528
|
| 27379 |
"execution": "\u6267\u884c\u6b63\u5e38\u5b8c\u6210\uff0c\u7528\u91cf\u8bb0\u5f55\u5b8c\u6574\u3002",
|
| 27380 |
"cause": "\u539f\u751f\u5931\u8d25\u5df2\u7ecf\u786e\u8ba4\uff1b\u5177\u4f53\u5931\u8d25\u673a\u5236\u5c1a\u672a\u9010\u9879\u5b9a\u4f4d\uff0c\u8bf7\u7ed3\u5408\u7ec8\u6001\u8bc1\u636e\u548c\u5b8c\u6574 session \u67e5\u770b\u3002"
|
| 27381 |
},
|
|
@@ -27391,9 +27434,9 @@
|
|
| 27391 |
"tests",
|
| 27392 |
"docs"
|
| 27393 |
],
|
| 27394 |
-
"content_sha256": "
|
| 27395 |
"dirty": true,
|
| 27396 |
-
"revision": "
|
| 27397 |
"source": "/home/evaluator/PhyRSI/benchmark-v0.10.0/RLE-Bench-inhouse"
|
| 27398 |
},
|
| 27399 |
"RoboEnv": {
|
|
@@ -27411,7 +27454,7 @@
|
|
| 27411 |
"third_party/patches",
|
| 27412 |
"docs/validation"
|
| 27413 |
],
|
| 27414 |
-
"content_sha256": "
|
| 27415 |
"dirty": true,
|
| 27416 |
"revision": "b73356c09507eeffaf9ca9e90b668ef0b7f1fa92",
|
| 27417 |
"source": "/home/evaluator/PhyRSI/benchmark-v0.10.0/RoboEnv"
|
|
@@ -27436,15 +27479,15 @@
|
|
| 27436 |
"source": "/home/evaluator/PhyRSI/benchmark-v0.10.0/kinex"
|
| 27437 |
}
|
| 27438 |
},
|
| 27439 |
-
"job": "task06-07-pick-and-place-and-hug-container-codex-seed0-
|
| 27440 |
-
"attempt":
|
| 27441 |
"harness": "stock Codex CLI",
|
| 27442 |
"control_interface": "public RoboEnv SDK and CLI",
|
| 27443 |
"kinex_agent_runtime_used": false,
|
| 27444 |
-
"gpu_index":
|
| 27445 |
"gpu_model": "NVIDIA L40S",
|
| 27446 |
-
"campaign_dispatch_concurrency_limit":
|
| 27447 |
-
"concurrency_note": "One GPU per active SIMPLE episode;
|
| 27448 |
"codex_version": "0.160.0",
|
| 27449 |
"model": "gpt-6-astra",
|
| 27450 |
"effort": "high",
|
|
@@ -27461,51 +27504,59 @@
|
|
| 27461 |
},
|
| 27462 |
"classification": "formal",
|
| 27463 |
"measured_images": {
|
| 27464 |
-
"agent": "sha256:
|
| 27465 |
-
"task": "sha256:
|
| 27466 |
},
|
| 27467 |
-
"session_original_sha256": "
|
| 27468 |
-
"protocol_sha256": "
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 27469 |
},
|
| 27470 |
"links": {
|
| 27471 |
-
"native_session": "https://huggingface.co/datasets/RLE-Bench/codex-benchmark/resolve/main/episodes/task06/07/seed-0/native/agent/session.jsonl",
|
| 27472 |
-
"trace": "https://huggingface.co/datasets/RLE-Bench/codex-benchmark/resolve/main/episodes/task06/07/seed-0/native/agent/trajectory.json",
|
| 27473 |
-
"provider_usage": "https://huggingface.co/datasets/RLE-Bench/codex-benchmark/resolve/main/episodes/task06/07/seed-0/native/agent/provider-usage.jsonl",
|
| 27474 |
-
"transcript": "https://huggingface.co/datasets/RLE-Bench/codex-benchmark/resolve/main/episodes/task06/07/seed-0/transcript.json",
|
| 27475 |
-
"verdict": "https://huggingface.co/datasets/RLE-Bench/codex-benchmark/resolve/main/episodes/task06/07/seed-0/native/verifier/episode.json",
|
| 27476 |
-
"protocol": "https://huggingface.co/datasets/RLE-Bench/codex-benchmark/resolve/main/episodes/task06/07/seed-0/native/verifier/protocol.json",
|
| 27477 |
-
"native_goal": "https://huggingface.co/datasets/RLE-Bench/codex-benchmark/resolve/main/episodes/task06/07/seed-0/instructions.json",
|
| 27478 |
-
"workspace": "https://huggingface.co/datasets/RLE-Bench/codex-benchmark/resolve/main/episodes/task06/07/seed-0/native/verifier/workspace.tar.gz",
|
| 27479 |
-
"workspace_changes": "https://huggingface.co/datasets/RLE-Bench/codex-benchmark/resolve/main/episodes/task06/07/seed-0/native/verifier/workspace.json",
|
| 27480 |
-
"owner_journal": "https://huggingface.co/datasets/RLE-Bench/codex-benchmark/resolve/main/episodes/task06/07/seed-0/native/evidence/episode/evidence/journal/actions.jsonl",
|
| 27481 |
-
"recording_manifest": "https://huggingface.co/datasets/RLE-Bench/codex-benchmark/resolve/main/episodes/task06/07/seed-0/native/evidence/episode/evidence/recording/manifest.json",
|
| 27482 |
-
"usage": "https://huggingface.co/datasets/RLE-Bench/codex-benchmark/resolve/main/episodes/task06/07/seed-0/usage.json",
|
| 27483 |
-
"analysis": "https://huggingface.co/datasets/RLE-Bench/codex-benchmark/resolve/main/episodes/task06/07/seed-0/analysis.json",
|
| 27484 |
-
"provenance": "https://huggingface.co/datasets/RLE-Bench/codex-benchmark/resolve/main/episodes/task06/07/seed-0/provenance.json",
|
| 27485 |
-
"video": "https://huggingface.co/datasets/RLE-Bench/codex-benchmark/resolve/main/episodes/task06/07/seed-0/video.mp4",
|
| 27486 |
-
"poster": "https://huggingface.co/datasets/RLE-Bench/codex-benchmark/resolve/main/episodes/task06/07/seed-0/poster.jpg",
|
| 27487 |
-
"media_check": "https://huggingface.co/datasets/RLE-Bench/codex-benchmark/resolve/main/episodes/task06/07/seed-0/media-validation.json",
|
| 27488 |
-
"final_observation": "https://huggingface.co/datasets/RLE-Bench/codex-benchmark/resolve/main/episodes/task06/07/seed-0/native/evidence/episode/evidence/final-observation.json"
|
| 27489 |
},
|
| 27490 |
"resources": [
|
| 27491 |
{
|
| 27492 |
"name": "tools/robot.py",
|
| 27493 |
-
"file": "https://huggingface.co/datasets/RLE-Bench/codex-benchmark/resolve/main/episodes/task06/07/seed-0/resources/tools/robot.py",
|
| 27494 |
"kind": "Created during this episode; final workspace snapshot."
|
| 27495 |
},
|
| 27496 |
{
|
| 27497 |
-
"name": "memos/
|
| 27498 |
-
"file": "https://huggingface.co/datasets/RLE-Bench/codex-benchmark/resolve/main/episodes/task06/07/seed-0/resources/memos/
|
| 27499 |
"kind": "Created during this episode; final workspace snapshot."
|
| 27500 |
}
|
| 27501 |
],
|
| 27502 |
"session_counts": {
|
| 27503 |
-
"visible_events":
|
| 27504 |
-
"observed_images":
|
| 27505 |
-
"tool_errors":
|
| 27506 |
},
|
| 27507 |
"selected_for_formal_metrics": true,
|
| 27508 |
-
"asset_base": "https://huggingface.co/datasets/RLE-Bench/codex-benchmark/resolve/main/episodes/task06/07/seed-0/"
|
| 27509 |
},
|
| 27510 |
{
|
| 27511 |
"id": "task06-08-seed0-formal",
|
|
@@ -28873,8 +28924,8 @@
|
|
| 28873 |
"authorized_selection_complete": true,
|
| 28874 |
"simple_reruns": {
|
| 28875 |
"authorized": 6,
|
| 28876 |
-
"published":
|
| 28877 |
-
"remaining":
|
| 28878 |
"selection": "Latest validated completed result per task; earlier native failures remain in attempt history.",
|
| 28879 |
"comparison_scope": "Only earlier failures were rerun at 15000 steps. Retained successes use 10000 steps. This selected-result view is not a uniform-budget agent comparison.",
|
| 28880 |
"replacements": [
|
|
@@ -28917,8 +28968,16 @@
|
|
| 28917 |
"current_max_steps": 15000,
|
| 28918 |
"previous_max_steps": 10000,
|
| 28919 |
"success": false
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 28920 |
}
|
| 28921 |
]
|
| 28922 |
},
|
| 28923 |
-
"authorized_rerun_selection_complete":
|
| 28924 |
}
|
|
|
|
| 6 |
"benchmark_complete": true,
|
| 7 |
"edition": "codex-simple-astra-high-seed0",
|
| 8 |
"created_at": "2026-10-09T00:09:42.989838+00:00",
|
| 9 |
+
"updated_at": "2026-10-10T05:34:41.504169+00:00",
|
| 10 |
"model": "gpt-6-astra",
|
| 11 |
"effort": "high",
|
| 12 |
"seed": 0,
|
|
|
|
| 120 |
"task06/04": 15000,
|
| 121 |
"task06/05": 15000,
|
| 122 |
"task06/06": 15000,
|
| 123 |
+
"task06/07": 15000,
|
| 124 |
"task06/08": 10000,
|
| 125 |
"task06/09": 15000,
|
| 126 |
"task06/10": 15000,
|
|
|
|
| 131 |
"formal_results": 12,
|
| 132 |
"modified_results": 0,
|
| 133 |
"original_results": 12,
|
| 134 |
+
"input_tokens": 106763761,
|
| 135 |
+
"cached_input_tokens": 105331968,
|
| 136 |
+
"output_tokens": 303566
|
| 137 |
}
|
| 138 |
],
|
| 139 |
"interrupted_attempts": 4,
|
|
|
|
| 161 |
},
|
| 162 |
"simple_reruns": {
|
| 163 |
"authorized": 6,
|
| 164 |
+
"published": 6,
|
| 165 |
+
"remaining": 0,
|
| 166 |
"selection": "Latest validated completed result per task; earlier native failures remain in attempt history.",
|
| 167 |
"comparison_scope": "Only earlier failures were rerun at 15000 steps. Retained successes use 10000 steps. This selected-result view is not a uniform-budget agent comparison.",
|
| 168 |
"replacements": [
|
|
|
|
| 205 |
"current_max_steps": 15000,
|
| 206 |
"previous_max_steps": 10000,
|
| 207 |
"success": false
|
| 208 |
+
},
|
| 209 |
+
{
|
| 210 |
+
"task_key": "task06/07",
|
| 211 |
+
"current_job": "task06-07-pick-and-place-and-hug-container-codex-seed0-attempt02",
|
| 212 |
+
"previous_job": "task06-07-pick-and-place-and-hug-container-codex-seed0-attempt01",
|
| 213 |
+
"current_max_steps": 15000,
|
| 214 |
+
"previous_max_steps": 10000,
|
| 215 |
+
"success": false
|
| 216 |
}
|
| 217 |
]
|
| 218 |
}
|
|
|
|
| 318 |
"task06/04": 15000,
|
| 319 |
"task06/05": 15000,
|
| 320 |
"task06/06": 15000,
|
| 321 |
+
"task06/07": 15000,
|
| 322 |
"task06/08": 10000,
|
| 323 |
"task06/09": 15000,
|
| 324 |
"task06/10": 15000,
|
|
|
|
| 329 |
"formal_results": 12,
|
| 330 |
"modified_results": 0,
|
| 331 |
"original_results": 12,
|
| 332 |
+
"input_tokens": 106763761,
|
| 333 |
+
"cached_input_tokens": 105331968,
|
| 334 |
+
"output_tokens": 303566
|
| 335 |
}
|
| 336 |
],
|
| 337 |
"tasks": [
|
|
|
|
| 6404 |
"task06/04": 15000,
|
| 6405 |
"task06/05": 15000,
|
| 6406 |
"task06/06": 15000,
|
| 6407 |
+
"task06/07": 15000,
|
| 6408 |
"task06/08": 10000,
|
| 6409 |
"task06/09": 15000,
|
| 6410 |
"task06/10": 15000,
|
|
|
|
| 6448 |
"task06/04": 15000,
|
| 6449 |
"task06/05": 15000,
|
| 6450 |
"task06/06": 15000,
|
| 6451 |
+
"task06/07": 15000,
|
| 6452 |
"task06/08": 10000,
|
| 6453 |
"task06/09": 15000,
|
| 6454 |
"task06/10": 15000,
|
|
|
|
| 6534 |
"task06/04": 15000,
|
| 6535 |
"task06/05": 15000,
|
| 6536 |
"task06/06": 15000,
|
| 6537 |
+
"task06/07": 15000,
|
| 6538 |
"task06/08": 10000,
|
| 6539 |
"task06/09": 15000,
|
| 6540 |
"task06/10": 15000,
|
|
|
|
| 6620 |
"task06/04": 15000,
|
| 6621 |
"task06/05": 15000,
|
| 6622 |
"task06/06": 15000,
|
| 6623 |
+
"task06/07": 15000,
|
| 6624 |
"task06/08": 10000,
|
| 6625 |
"task06/09": 15000,
|
| 6626 |
"task06/10": 15000,
|
|
|
|
| 6706 |
"task06/04": 15000,
|
| 6707 |
"task06/05": 15000,
|
| 6708 |
"task06/06": 15000,
|
| 6709 |
+
"task06/07": 15000,
|
| 6710 |
"task06/08": 10000,
|
| 6711 |
"task06/09": 15000,
|
| 6712 |
"task06/10": 15000,
|
|
|
|
| 6792 |
"task06/04": 15000,
|
| 6793 |
"task06/05": 15000,
|
| 6794 |
"task06/06": 15000,
|
| 6795 |
+
"task06/07": 15000,
|
| 6796 |
"task06/08": 10000,
|
| 6797 |
"task06/09": 15000,
|
| 6798 |
"task06/10": 15000,
|
|
|
|
| 6863 |
"native_instruction": "pick up the apple from table1,hug the container,walk to table2,and place on table2.",
|
| 6864 |
"instruction_source": "Unchanged native SIMPLE instruction for the effective default task configuration.",
|
| 6865 |
"status": "completed",
|
| 6866 |
+
"episode_id": "task06-07-seed0-formal-attempt02",
|
| 6867 |
"run_status": "finished",
|
| 6868 |
"status_note": "Native result, execution and usage complete.",
|
| 6869 |
"planned_protocol": {
|
| 6870 |
"episodes": 1,
|
| 6871 |
"seed": 0,
|
| 6872 |
"control_frequency_hz": 50,
|
| 6873 |
+
"max_control_steps": 15000,
|
| 6874 |
"max_control_steps_by_task": {
|
| 6875 |
"task06/01": 10000,
|
| 6876 |
"task06/02": 15000,
|
|
|
|
| 6878 |
"task06/04": 15000,
|
| 6879 |
"task06/05": 15000,
|
| 6880 |
"task06/06": 15000,
|
| 6881 |
+
"task06/07": 15000,
|
| 6882 |
"task06/08": 10000,
|
| 6883 |
"task06/09": 15000,
|
| 6884 |
"task06/10": 15000,
|
|
|
|
| 6897 |
},
|
| 6898 |
"simple_rerun": {
|
| 6899 |
"attempt": 2,
|
| 6900 |
+
"status": "published",
|
| 6901 |
"target_max_steps": 15000,
|
| 6902 |
"previous_max_steps": 10000,
|
| 6903 |
+
"note": "Fresh 15000-step rerun selected; previous 10000-step native failure retained below."
|
| 6904 |
+
},
|
| 6905 |
+
"attempt_history": [
|
| 6906 |
+
{
|
| 6907 |
+
"id": "task06-07-pick-and-place-and-hug-container-codex-seed0-attempt01",
|
| 6908 |
+
"max_steps": 10000,
|
| 6909 |
+
"success": false,
|
| 6910 |
+
"steps": 8645,
|
| 6911 |
+
"execution": {
|
| 6912 |
+
"reason": null,
|
| 6913 |
+
"status": "finished"
|
| 6914 |
+
},
|
| 6915 |
+
"usage_complete": true,
|
| 6916 |
+
"links": {
|
| 6917 |
+
"native_session": "https://huggingface.co/datasets/RLE-Bench/codex-benchmark/resolve/main/episodes/task06/07/seed-0/native/agent/session.jsonl",
|
| 6918 |
+
"trace": "https://huggingface.co/datasets/RLE-Bench/codex-benchmark/resolve/main/episodes/task06/07/seed-0/native/agent/trajectory.json",
|
| 6919 |
+
"provider_usage": "https://huggingface.co/datasets/RLE-Bench/codex-benchmark/resolve/main/episodes/task06/07/seed-0/native/agent/provider-usage.jsonl",
|
| 6920 |
+
"transcript": "https://huggingface.co/datasets/RLE-Bench/codex-benchmark/resolve/main/episodes/task06/07/seed-0/transcript.json",
|
| 6921 |
+
"verdict": "https://huggingface.co/datasets/RLE-Bench/codex-benchmark/resolve/main/episodes/task06/07/seed-0/native/verifier/episode.json",
|
| 6922 |
+
"protocol": "https://huggingface.co/datasets/RLE-Bench/codex-benchmark/resolve/main/episodes/task06/07/seed-0/native/verifier/protocol.json",
|
| 6923 |
+
"native_goal": "https://huggingface.co/datasets/RLE-Bench/codex-benchmark/resolve/main/episodes/task06/07/seed-0/instructions.json",
|
| 6924 |
+
"workspace": "https://huggingface.co/datasets/RLE-Bench/codex-benchmark/resolve/main/episodes/task06/07/seed-0/native/verifier/workspace.tar.gz",
|
| 6925 |
+
"workspace_changes": "https://huggingface.co/datasets/RLE-Bench/codex-benchmark/resolve/main/episodes/task06/07/seed-0/native/verifier/workspace.json",
|
| 6926 |
+
"owner_journal": "https://huggingface.co/datasets/RLE-Bench/codex-benchmark/resolve/main/episodes/task06/07/seed-0/native/evidence/episode/evidence/journal/actions.jsonl",
|
| 6927 |
+
"recording_manifest": "https://huggingface.co/datasets/RLE-Bench/codex-benchmark/resolve/main/episodes/task06/07/seed-0/native/evidence/episode/evidence/recording/manifest.json",
|
| 6928 |
+
"usage": "https://huggingface.co/datasets/RLE-Bench/codex-benchmark/resolve/main/episodes/task06/07/seed-0/usage.json",
|
| 6929 |
+
"analysis": "https://huggingface.co/datasets/RLE-Bench/codex-benchmark/resolve/main/episodes/task06/07/seed-0/analysis.json",
|
| 6930 |
+
"provenance": "https://huggingface.co/datasets/RLE-Bench/codex-benchmark/resolve/main/episodes/task06/07/seed-0/provenance.json",
|
| 6931 |
+
"video": "https://huggingface.co/datasets/RLE-Bench/codex-benchmark/resolve/main/episodes/task06/07/seed-0/video.mp4",
|
| 6932 |
+
"poster": "https://huggingface.co/datasets/RLE-Bench/codex-benchmark/resolve/main/episodes/task06/07/seed-0/poster.jpg",
|
| 6933 |
+
"media_check": "https://huggingface.co/datasets/RLE-Bench/codex-benchmark/resolve/main/episodes/task06/07/seed-0/media-validation.json",
|
| 6934 |
+
"final_observation": "https://huggingface.co/datasets/RLE-Bench/codex-benchmark/resolve/main/episodes/task06/07/seed-0/native/evidence/episode/evidence/final-observation.json",
|
| 6935 |
+
"episode_record": "https://huggingface.co/datasets/RLE-Bench/codex-benchmark/resolve/main/history/simple-10000/07/episode.json"
|
| 6936 |
+
},
|
| 6937 |
+
"selected_for_formal_metrics": false
|
| 6938 |
+
}
|
| 6939 |
+
]
|
| 6940 |
},
|
| 6941 |
{
|
| 6942 |
"key": "task06/08",
|
|
|
|
| 6964 |
"task06/04": 15000,
|
| 6965 |
"task06/05": 15000,
|
| 6966 |
"task06/06": 15000,
|
| 6967 |
+
"task06/07": 15000,
|
| 6968 |
"task06/08": 10000,
|
| 6969 |
"task06/09": 15000,
|
| 6970 |
"task06/10": 15000,
|
|
|
|
| 7008 |
"task06/04": 15000,
|
| 7009 |
"task06/05": 15000,
|
| 7010 |
"task06/06": 15000,
|
| 7011 |
+
"task06/07": 15000,
|
| 7012 |
"task06/08": 10000,
|
| 7013 |
"task06/09": 15000,
|
| 7014 |
"task06/10": 15000,
|
|
|
|
| 7052 |
"task06/04": 15000,
|
| 7053 |
"task06/05": 15000,
|
| 7054 |
"task06/06": 15000,
|
| 7055 |
+
"task06/07": 15000,
|
| 7056 |
"task06/08": 10000,
|
| 7057 |
"task06/09": 15000,
|
| 7058 |
"task06/10": 15000,
|
|
|
|
| 7096 |
"task06/04": 15000,
|
| 7097 |
"task06/05": 15000,
|
| 7098 |
"task06/06": 15000,
|
| 7099 |
+
"task06/07": 15000,
|
| 7100 |
"task06/08": 10000,
|
| 7101 |
"task06/09": 15000,
|
| 7102 |
"task06/10": 15000,
|
|
|
|
| 7140 |
"task06/04": 15000,
|
| 7141 |
"task06/05": 15000,
|
| 7142 |
"task06/06": 15000,
|
| 7143 |
+
"task06/07": 15000,
|
| 7144 |
"task06/08": 10000,
|
| 7145 |
"task06/09": 15000,
|
| 7146 |
"task06/10": 15000,
|
|
|
|
| 27285 |
"asset_base": "https://huggingface.co/datasets/RLE-Bench/codex-benchmark/resolve/main/episodes/task06/06/seed-0-attempt02/"
|
| 27286 |
},
|
| 27287 |
{
|
| 27288 |
+
"id": "task06-07-seed0-formal-attempt02",
|
| 27289 |
"task_key": "task06/07",
|
| 27290 |
"family": "task06",
|
| 27291 |
"slot": "07",
|
|
|
|
| 27302 |
},
|
| 27303 |
"verdict": {
|
| 27304 |
"evidence_valid": true,
|
| 27305 |
+
"steps": 13688,
|
| 27306 |
"success": false,
|
| 27307 |
"termination": "stopped"
|
| 27308 |
},
|
| 27309 |
+
"steps": 13688,
|
| 27310 |
"simulation_time_s": null,
|
| 27311 |
+
"wall_time_s": 3043.529979,
|
| 27312 |
"model": "gpt-6-astra",
|
| 27313 |
"effort": "high",
|
| 27314 |
"harness": "codex",
|
|
|
|
| 27319 |
"usage": {
|
| 27320 |
"accounting": "reported-responses",
|
| 27321 |
"audit_complete": true,
|
| 27322 |
+
"cache_hit_rate": 0.9903104416710947,
|
| 27323 |
+
"cache_reported_input_tokens": 28195506,
|
| 27324 |
"cache_write_input_tokens": 0,
|
| 27325 |
+
"cache_write_reported_input_tokens": 28195506,
|
| 27326 |
+
"cached_input_tokens": 27922304,
|
| 27327 |
"completed_turns": 1,
|
| 27328 |
"cost_usd": null,
|
| 27329 |
"failed_turns": 0,
|
| 27330 |
+
"input_tokens": 28195506,
|
| 27331 |
"known_cache_write_input_tokens": 0,
|
| 27332 |
+
"known_cached_input_tokens": 27922304,
|
| 27333 |
+
"known_input_tokens": 28195506,
|
| 27334 |
+
"known_output_tokens": 45427,
|
| 27335 |
+
"known_reasoning_output_tokens": 17604,
|
| 27336 |
+
"output_tokens": 45427,
|
| 27337 |
+
"reasoning_output_tokens": 17604,
|
| 27338 |
+
"reasoning_reported_output_tokens": 45427,
|
| 27339 |
"reported_responses": {
|
| 27340 |
+
"cache_reported_input_tokens": 330,
|
| 27341 |
+
"cache_write_input_tokens": 330,
|
| 27342 |
+
"cache_write_reported_input_tokens": 330,
|
| 27343 |
+
"cached_input_tokens": 330,
|
| 27344 |
+
"input_tokens": 330,
|
| 27345 |
+
"output_tokens": 330,
|
| 27346 |
+
"reasoning_output_tokens": 330,
|
| 27347 |
+
"reasoning_reported_output_tokens": 330
|
| 27348 |
+
},
|
| 27349 |
+
"response_count": 330,
|
| 27350 |
"response_ids_complete": true,
|
| 27351 |
"schema": "rlebench/token-usage/1",
|
| 27352 |
"source": "Codex token_usage_record per response",
|
| 27353 |
+
"uncached_input_tokens": 273202,
|
| 27354 |
"unidentified_usage_records": 0
|
| 27355 |
},
|
| 27356 |
"call_activity": {
|
| 27357 |
+
"model_tool_calls": 330,
|
| 27358 |
"model_tool_calls_by_name": {
|
| 27359 |
+
"exec": 330
|
| 27360 |
},
|
| 27361 |
"nested_python_tool_invocations": null,
|
| 27362 |
"python_device_rpc_attempts": null,
|
|
|
|
| 27372 |
"passed": true,
|
| 27373 |
"width": 1280,
|
| 27374 |
"height": 360,
|
| 27375 |
+
"duration_s": 68.45,
|
| 27376 |
"speed": 4,
|
| 27377 |
"source_fps": 10,
|
| 27378 |
"output_fps": 20,
|
| 27379 |
"recording": {
|
| 27380 |
+
"accepted_samples": 2739,
|
| 27381 |
+
"captured_samples": 2739,
|
| 27382 |
"clock": "simulation",
|
| 27383 |
"dropped_samples": 0,
|
| 27384 |
+
"encoded_frames": 2738,
|
| 27385 |
+
"end_time_s": 273.760000000041,
|
| 27386 |
"error": null,
|
| 27387 |
"experimental": true,
|
| 27388 |
"fps": 10,
|
| 27389 |
+
"received_samples": 2739,
|
| 27390 |
"schema": "roboenv/recording/1",
|
| 27391 |
"state": "closed",
|
| 27392 |
"status": "complete",
|
|
|
|
| 27413 |
"camera_head_left",
|
| 27414 |
"camera_head_right"
|
| 27415 |
],
|
| 27416 |
+
"sha256": "2d99303a8803b78755f8a0844c59904c84a9edd43ac54a607a5f2c0e3e50f437",
|
| 27417 |
"scope": "Native spectator recording postprocessed at 4x; no replay or rerender"
|
| 27418 |
},
|
| 27419 |
"analysis": {
|
| 27420 |
"outcome": "\u539f\u751f\u5224\u5b9a\u672a\u6210\u529f\u3002",
|
| 27421 |
+
"duration": "\u4f7f\u7528 13,688 / 15,000 \u4e2a\u52a8\u4f5c\u5e27\uff1b\u7ed3\u675f\u539f\u56e0\uff1astopped\u3002",
|
| 27422 |
"execution": "\u6267\u884c\u6b63\u5e38\u5b8c\u6210\uff0c\u7528\u91cf\u8bb0\u5f55\u5b8c\u6574\u3002",
|
| 27423 |
"cause": "\u539f\u751f\u5931\u8d25\u5df2\u7ecf\u786e\u8ba4\uff1b\u5177\u4f53\u5931\u8d25\u673a\u5236\u5c1a\u672a\u9010\u9879\u5b9a\u4f4d\uff0c\u8bf7\u7ed3\u5408\u7ec8\u6001\u8bc1\u636e\u548c\u5b8c\u6574 session \u67e5\u770b\u3002"
|
| 27424 |
},
|
|
|
|
| 27434 |
"tests",
|
| 27435 |
"docs"
|
| 27436 |
],
|
| 27437 |
+
"content_sha256": "c9c6cd1b554380cfffee56b9a7bb47e102296d7bd38690f3ddcef2a4a5ca7bfc",
|
| 27438 |
"dirty": true,
|
| 27439 |
+
"revision": "2f315b78ab45a2978c2a69b7c33ec8fa4f78f618",
|
| 27440 |
"source": "/home/evaluator/PhyRSI/benchmark-v0.10.0/RLE-Bench-inhouse"
|
| 27441 |
},
|
| 27442 |
"RoboEnv": {
|
|
|
|
| 27454 |
"third_party/patches",
|
| 27455 |
"docs/validation"
|
| 27456 |
],
|
| 27457 |
+
"content_sha256": "0ea971928890164e2c1b0056a6cc3ebd0d1a306a63746193c33cf0b6e15a9aa2",
|
| 27458 |
"dirty": true,
|
| 27459 |
"revision": "b73356c09507eeffaf9ca9e90b668ef0b7f1fa92",
|
| 27460 |
"source": "/home/evaluator/PhyRSI/benchmark-v0.10.0/RoboEnv"
|
|
|
|
| 27479 |
"source": "/home/evaluator/PhyRSI/benchmark-v0.10.0/kinex"
|
| 27480 |
}
|
| 27481 |
},
|
| 27482 |
+
"job": "task06-07-pick-and-place-and-hug-container-codex-seed0-attempt02",
|
| 27483 |
+
"attempt": 2,
|
| 27484 |
"harness": "stock Codex CLI",
|
| 27485 |
"control_interface": "public RoboEnv SDK and CLI",
|
| 27486 |
"kinex_agent_runtime_used": false,
|
| 27487 |
+
"gpu_index": 4,
|
| 27488 |
"gpu_model": "NVIDIA L40S",
|
| 27489 |
+
"campaign_dispatch_concurrency_limit": 8,
|
| 27490 |
+
"concurrency_note": "One GPU per active SIMPLE episode; dispatch only on idle GPUs.",
|
| 27491 |
"codex_version": "0.160.0",
|
| 27492 |
"model": "gpt-6-astra",
|
| 27493 |
"effort": "high",
|
|
|
|
| 27504 |
},
|
| 27505 |
"classification": "formal",
|
| 27506 |
"measured_images": {
|
| 27507 |
+
"agent": "sha256:0093e794ce2fe8d5ab270fccfc8aef2ee8faf15d040d5a83f8c9416335b19217",
|
| 27508 |
+
"task": "sha256:66c86a017966a02653a3a2278a74002e1d16a717e6b21aa5e884cb94d54a8957"
|
| 27509 |
},
|
| 27510 |
+
"session_original_sha256": "1a98ccf2349496b219706c4996235516da26825a877a4816bfe2c78f484beeb7",
|
| 27511 |
+
"protocol_sha256": "48e670abdbf3fa6c277bcba1dd8310af3cb90f8d0166db40b5606c4e37ccfae0",
|
| 27512 |
+
"deployment": "failed10000-rerun15000-20261010T020844Z",
|
| 27513 |
+
"max_steps": 15000,
|
| 27514 |
+
"budget_revision": "failed10000-rerun15000-20261010T020844Z",
|
| 27515 |
+
"same_protocol_replacement": false,
|
| 27516 |
+
"replaces_user_interrupted_attempt": null,
|
| 27517 |
+
"replacement_reason": "Explicit user-authorized fresh rerun of a completed 10000-step native failure with 15000 steps.",
|
| 27518 |
+
"previous_native_failure": "task06-07-pick-and-place-and-hug-container-codex-seed0-attempt01",
|
| 27519 |
+
"previous_max_steps": 10000
|
| 27520 |
},
|
| 27521 |
"links": {
|
| 27522 |
+
"native_session": "https://huggingface.co/datasets/RLE-Bench/codex-benchmark/resolve/main/episodes/task06/07/seed-0-attempt02/native/agent/session.jsonl",
|
| 27523 |
+
"trace": "https://huggingface.co/datasets/RLE-Bench/codex-benchmark/resolve/main/episodes/task06/07/seed-0-attempt02/native/agent/trajectory.json",
|
| 27524 |
+
"provider_usage": "https://huggingface.co/datasets/RLE-Bench/codex-benchmark/resolve/main/episodes/task06/07/seed-0-attempt02/native/agent/provider-usage.jsonl",
|
| 27525 |
+
"transcript": "https://huggingface.co/datasets/RLE-Bench/codex-benchmark/resolve/main/episodes/task06/07/seed-0-attempt02/transcript.json",
|
| 27526 |
+
"verdict": "https://huggingface.co/datasets/RLE-Bench/codex-benchmark/resolve/main/episodes/task06/07/seed-0-attempt02/native/verifier/episode.json",
|
| 27527 |
+
"protocol": "https://huggingface.co/datasets/RLE-Bench/codex-benchmark/resolve/main/episodes/task06/07/seed-0-attempt02/native/verifier/protocol.json",
|
| 27528 |
+
"native_goal": "https://huggingface.co/datasets/RLE-Bench/codex-benchmark/resolve/main/episodes/task06/07/seed-0-attempt02/instructions.json",
|
| 27529 |
+
"workspace": "https://huggingface.co/datasets/RLE-Bench/codex-benchmark/resolve/main/episodes/task06/07/seed-0-attempt02/native/verifier/workspace.tar.gz",
|
| 27530 |
+
"workspace_changes": "https://huggingface.co/datasets/RLE-Bench/codex-benchmark/resolve/main/episodes/task06/07/seed-0-attempt02/native/verifier/workspace.json",
|
| 27531 |
+
"owner_journal": "https://huggingface.co/datasets/RLE-Bench/codex-benchmark/resolve/main/episodes/task06/07/seed-0-attempt02/native/evidence/episode/evidence/journal/actions.jsonl",
|
| 27532 |
+
"recording_manifest": "https://huggingface.co/datasets/RLE-Bench/codex-benchmark/resolve/main/episodes/task06/07/seed-0-attempt02/native/evidence/episode/evidence/recording/manifest.json",
|
| 27533 |
+
"usage": "https://huggingface.co/datasets/RLE-Bench/codex-benchmark/resolve/main/episodes/task06/07/seed-0-attempt02/usage.json",
|
| 27534 |
+
"analysis": "https://huggingface.co/datasets/RLE-Bench/codex-benchmark/resolve/main/episodes/task06/07/seed-0-attempt02/analysis.json",
|
| 27535 |
+
"provenance": "https://huggingface.co/datasets/RLE-Bench/codex-benchmark/resolve/main/episodes/task06/07/seed-0-attempt02/provenance.json",
|
| 27536 |
+
"video": "https://huggingface.co/datasets/RLE-Bench/codex-benchmark/resolve/main/episodes/task06/07/seed-0-attempt02/video.mp4",
|
| 27537 |
+
"poster": "https://huggingface.co/datasets/RLE-Bench/codex-benchmark/resolve/main/episodes/task06/07/seed-0-attempt02/poster.jpg",
|
| 27538 |
+
"media_check": "https://huggingface.co/datasets/RLE-Bench/codex-benchmark/resolve/main/episodes/task06/07/seed-0-attempt02/media-validation.json",
|
| 27539 |
+
"final_observation": "https://huggingface.co/datasets/RLE-Bench/codex-benchmark/resolve/main/episodes/task06/07/seed-0-attempt02/native/evidence/episode/evidence/final-observation.json"
|
| 27540 |
},
|
| 27541 |
"resources": [
|
| 27542 |
{
|
| 27543 |
"name": "tools/robot.py",
|
| 27544 |
+
"file": "https://huggingface.co/datasets/RLE-Bench/codex-benchmark/resolve/main/episodes/task06/07/seed-0-attempt02/resources/tools/robot.py",
|
| 27545 |
"kind": "Created during this episode; final workspace snapshot."
|
| 27546 |
},
|
| 27547 |
{
|
| 27548 |
+
"name": "memos/g1_simple.md",
|
| 27549 |
+
"file": "https://huggingface.co/datasets/RLE-Bench/codex-benchmark/resolve/main/episodes/task06/07/seed-0-attempt02/resources/memos/g1_simple.md",
|
| 27550 |
"kind": "Created during this episode; final workspace snapshot."
|
| 27551 |
}
|
| 27552 |
],
|
| 27553 |
"session_counts": {
|
| 27554 |
+
"visible_events": 689,
|
| 27555 |
+
"observed_images": 88,
|
| 27556 |
+
"tool_errors": 12
|
| 27557 |
},
|
| 27558 |
"selected_for_formal_metrics": true,
|
| 27559 |
+
"asset_base": "https://huggingface.co/datasets/RLE-Bench/codex-benchmark/resolve/main/episodes/task06/07/seed-0-attempt02/"
|
| 27560 |
},
|
| 27561 |
{
|
| 27562 |
"id": "task06-08-seed0-formal",
|
|
|
|
| 28924 |
"authorized_selection_complete": true,
|
| 28925 |
"simple_reruns": {
|
| 28926 |
"authorized": 6,
|
| 28927 |
+
"published": 6,
|
| 28928 |
+
"remaining": 0,
|
| 28929 |
"selection": "Latest validated completed result per task; earlier native failures remain in attempt history.",
|
| 28930 |
"comparison_scope": "Only earlier failures were rerun at 15000 steps. Retained successes use 10000 steps. This selected-result view is not a uniform-budget agent comparison.",
|
| 28931 |
"replacements": [
|
|
|
|
| 28968 |
"current_max_steps": 15000,
|
| 28969 |
"previous_max_steps": 10000,
|
| 28970 |
"success": false
|
| 28971 |
+
},
|
| 28972 |
+
{
|
| 28973 |
+
"task_key": "task06/07",
|
| 28974 |
+
"current_job": "task06-07-pick-and-place-and-hug-container-codex-seed0-attempt02",
|
| 28975 |
+
"previous_job": "task06-07-pick-and-place-and-hug-container-codex-seed0-attempt01",
|
| 28976 |
+
"current_max_steps": 15000,
|
| 28977 |
+
"previous_max_steps": 10000,
|
| 28978 |
+
"success": false
|
| 28979 |
}
|
| 28980 |
]
|
| 28981 |
},
|
| 28982 |
+
"authorized_rerun_selection_complete": true
|
| 28983 |
}
|
episodes.csv
CHANGED
|
@@ -77,7 +77,7 @@ task06/03,simple/bend-pick,completed,0,True,False,13225,3398.536602,19912568,197
|
|
| 77 |
task06/04,simple/bend-pick-and-place,completed,0,True,True,116,111.95334,329238,301696,2595
|
| 78 |
task06/05,simple/bend-handover,completed,0,True,True,12320,4359.883363,32371907,32134912,103454
|
| 79 |
task06/06,simple/handover,completed,0,True,False,8170,1791.504625,8606079,8362368,24634
|
| 80 |
-
task06/07,simple/pick-and-place-and-hug-container,completed,0,True,False,
|
| 81 |
task06/08,simple/close-door,completed,0,True,True,1277,369.21498,1340798,1294208,6729
|
| 82 |
task06/09,simple/open-oven,completed,0,True,False,3170,918.375583,4133002,3992704,16710
|
| 83 |
task06/10,simple/open-faucet,completed,0,True,True,1710,559.043041,2661777,2603904,11612
|
|
|
|
| 77 |
task06/04,simple/bend-pick-and-place,completed,0,True,True,116,111.95334,329238,301696,2595
|
| 78 |
task06/05,simple/bend-handover,completed,0,True,True,12320,4359.883363,32371907,32134912,103454
|
| 79 |
task06/06,simple/handover,completed,0,True,False,8170,1791.504625,8606079,8362368,24634
|
| 80 |
+
task06/07,simple/pick-and-place-and-hug-container,completed,0,True,False,13688,3043.529979,28195506,27922304,45427
|
| 81 |
task06/08,simple/close-door,completed,0,True,True,1277,369.21498,1340798,1294208,6729
|
| 82 |
task06/09,simple/open-oven,completed,0,True,False,3170,918.375583,4133002,3992704,16710
|
| 83 |
task06/10,simple/open-faucet,completed,0,True,True,1710,559.043041,2661777,2603904,11612
|
episodes.json
CHANGED
|
@@ -20124,7 +20124,7 @@
|
|
| 20124 |
"asset_base": "https://huggingface.co/datasets/RLE-Bench/codex-benchmark/resolve/main/episodes/task06/06/seed-0-attempt02/"
|
| 20125 |
},
|
| 20126 |
{
|
| 20127 |
-
"id": "task06-07-seed0-formal",
|
| 20128 |
"task_key": "task06/07",
|
| 20129 |
"family": "task06",
|
| 20130 |
"slot": "07",
|
|
@@ -20141,13 +20141,13 @@
|
|
| 20141 |
},
|
| 20142 |
"verdict": {
|
| 20143 |
"evidence_valid": true,
|
| 20144 |
-
"steps":
|
| 20145 |
"success": false,
|
| 20146 |
"termination": "stopped"
|
| 20147 |
},
|
| 20148 |
-
"steps":
|
| 20149 |
"simulation_time_s": null,
|
| 20150 |
-
"wall_time_s":
|
| 20151 |
"model": "gpt-6-astra",
|
| 20152 |
"effort": "high",
|
| 20153 |
"harness": "codex",
|
|
@@ -20158,44 +20158,44 @@
|
|
| 20158 |
"usage": {
|
| 20159 |
"accounting": "reported-responses",
|
| 20160 |
"audit_complete": true,
|
| 20161 |
-
"cache_hit_rate": 0.
|
| 20162 |
-
"cache_reported_input_tokens":
|
| 20163 |
"cache_write_input_tokens": 0,
|
| 20164 |
-
"cache_write_reported_input_tokens":
|
| 20165 |
-
"cached_input_tokens":
|
| 20166 |
"completed_turns": 1,
|
| 20167 |
"cost_usd": null,
|
| 20168 |
"failed_turns": 0,
|
| 20169 |
-
"input_tokens":
|
| 20170 |
"known_cache_write_input_tokens": 0,
|
| 20171 |
-
"known_cached_input_tokens":
|
| 20172 |
-
"known_input_tokens":
|
| 20173 |
-
"known_output_tokens":
|
| 20174 |
-
"known_reasoning_output_tokens":
|
| 20175 |
-
"output_tokens":
|
| 20176 |
-
"reasoning_output_tokens":
|
| 20177 |
-
"reasoning_reported_output_tokens":
|
| 20178 |
"reported_responses": {
|
| 20179 |
-
"cache_reported_input_tokens":
|
| 20180 |
-
"cache_write_input_tokens":
|
| 20181 |
-
"cache_write_reported_input_tokens":
|
| 20182 |
-
"cached_input_tokens":
|
| 20183 |
-
"input_tokens":
|
| 20184 |
-
"output_tokens":
|
| 20185 |
-
"reasoning_output_tokens":
|
| 20186 |
-
"reasoning_reported_output_tokens":
|
| 20187 |
-
},
|
| 20188 |
-
"response_count":
|
| 20189 |
"response_ids_complete": true,
|
| 20190 |
"schema": "rlebench/token-usage/1",
|
| 20191 |
"source": "Codex token_usage_record per response",
|
| 20192 |
-
"uncached_input_tokens":
|
| 20193 |
"unidentified_usage_records": 0
|
| 20194 |
},
|
| 20195 |
"call_activity": {
|
| 20196 |
-
"model_tool_calls":
|
| 20197 |
"model_tool_calls_by_name": {
|
| 20198 |
-
"exec":
|
| 20199 |
},
|
| 20200 |
"nested_python_tool_invocations": null,
|
| 20201 |
"python_device_rpc_attempts": null,
|
|
@@ -20211,21 +20211,21 @@
|
|
| 20211 |
"passed": true,
|
| 20212 |
"width": 1280,
|
| 20213 |
"height": 360,
|
| 20214 |
-
"duration_s":
|
| 20215 |
"speed": 4,
|
| 20216 |
"source_fps": 10,
|
| 20217 |
"output_fps": 20,
|
| 20218 |
"recording": {
|
| 20219 |
-
"accepted_samples":
|
| 20220 |
-
"captured_samples":
|
| 20221 |
"clock": "simulation",
|
| 20222 |
"dropped_samples": 0,
|
| 20223 |
-
"encoded_frames":
|
| 20224 |
-
"end_time_s":
|
| 20225 |
"error": null,
|
| 20226 |
"experimental": true,
|
| 20227 |
"fps": 10,
|
| 20228 |
-
"received_samples":
|
| 20229 |
"schema": "roboenv/recording/1",
|
| 20230 |
"state": "closed",
|
| 20231 |
"status": "complete",
|
|
@@ -20252,12 +20252,12 @@
|
|
| 20252 |
"camera_head_left",
|
| 20253 |
"camera_head_right"
|
| 20254 |
],
|
| 20255 |
-
"sha256": "
|
| 20256 |
"scope": "Native spectator recording postprocessed at 4x; no replay or rerender"
|
| 20257 |
},
|
| 20258 |
"analysis": {
|
| 20259 |
"outcome": "\u539f\u751f\u5224\u5b9a\u672a\u6210\u529f\u3002",
|
| 20260 |
-
"duration": "\u4f7f\u7528
|
| 20261 |
"execution": "\u6267\u884c\u6b63\u5e38\u5b8c\u6210\uff0c\u7528\u91cf\u8bb0\u5f55\u5b8c\u6574\u3002",
|
| 20262 |
"cause": "\u539f\u751f\u5931\u8d25\u5df2\u7ecf\u786e\u8ba4\uff1b\u5177\u4f53\u5931\u8d25\u673a\u5236\u5c1a\u672a\u9010\u9879\u5b9a\u4f4d\uff0c\u8bf7\u7ed3\u5408\u7ec8\u6001\u8bc1\u636e\u548c\u5b8c\u6574 session \u67e5\u770b\u3002"
|
| 20263 |
},
|
|
@@ -20273,9 +20273,9 @@
|
|
| 20273 |
"tests",
|
| 20274 |
"docs"
|
| 20275 |
],
|
| 20276 |
-
"content_sha256": "
|
| 20277 |
"dirty": true,
|
| 20278 |
-
"revision": "
|
| 20279 |
"source": "/home/evaluator/PhyRSI/benchmark-v0.10.0/RLE-Bench-inhouse"
|
| 20280 |
},
|
| 20281 |
"RoboEnv": {
|
|
@@ -20293,7 +20293,7 @@
|
|
| 20293 |
"third_party/patches",
|
| 20294 |
"docs/validation"
|
| 20295 |
],
|
| 20296 |
-
"content_sha256": "
|
| 20297 |
"dirty": true,
|
| 20298 |
"revision": "b73356c09507eeffaf9ca9e90b668ef0b7f1fa92",
|
| 20299 |
"source": "/home/evaluator/PhyRSI/benchmark-v0.10.0/RoboEnv"
|
|
@@ -20318,15 +20318,15 @@
|
|
| 20318 |
"source": "/home/evaluator/PhyRSI/benchmark-v0.10.0/kinex"
|
| 20319 |
}
|
| 20320 |
},
|
| 20321 |
-
"job": "task06-07-pick-and-place-and-hug-container-codex-seed0-
|
| 20322 |
-
"attempt":
|
| 20323 |
"harness": "stock Codex CLI",
|
| 20324 |
"control_interface": "public RoboEnv SDK and CLI",
|
| 20325 |
"kinex_agent_runtime_used": false,
|
| 20326 |
-
"gpu_index":
|
| 20327 |
"gpu_model": "NVIDIA L40S",
|
| 20328 |
-
"campaign_dispatch_concurrency_limit":
|
| 20329 |
-
"concurrency_note": "One GPU per active SIMPLE episode;
|
| 20330 |
"codex_version": "0.160.0",
|
| 20331 |
"model": "gpt-6-astra",
|
| 20332 |
"effort": "high",
|
|
@@ -20343,51 +20343,59 @@
|
|
| 20343 |
},
|
| 20344 |
"classification": "formal",
|
| 20345 |
"measured_images": {
|
| 20346 |
-
"agent": "sha256:
|
| 20347 |
-
"task": "sha256:
|
| 20348 |
},
|
| 20349 |
-
"session_original_sha256": "
|
| 20350 |
-
"protocol_sha256": "
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 20351 |
},
|
| 20352 |
"links": {
|
| 20353 |
-
"native_session": "https://huggingface.co/datasets/RLE-Bench/codex-benchmark/resolve/main/episodes/task06/07/seed-0/native/agent/session.jsonl",
|
| 20354 |
-
"trace": "https://huggingface.co/datasets/RLE-Bench/codex-benchmark/resolve/main/episodes/task06/07/seed-0/native/agent/trajectory.json",
|
| 20355 |
-
"provider_usage": "https://huggingface.co/datasets/RLE-Bench/codex-benchmark/resolve/main/episodes/task06/07/seed-0/native/agent/provider-usage.jsonl",
|
| 20356 |
-
"transcript": "https://huggingface.co/datasets/RLE-Bench/codex-benchmark/resolve/main/episodes/task06/07/seed-0/transcript.json",
|
| 20357 |
-
"verdict": "https://huggingface.co/datasets/RLE-Bench/codex-benchmark/resolve/main/episodes/task06/07/seed-0/native/verifier/episode.json",
|
| 20358 |
-
"protocol": "https://huggingface.co/datasets/RLE-Bench/codex-benchmark/resolve/main/episodes/task06/07/seed-0/native/verifier/protocol.json",
|
| 20359 |
-
"native_goal": "https://huggingface.co/datasets/RLE-Bench/codex-benchmark/resolve/main/episodes/task06/07/seed-0/instructions.json",
|
| 20360 |
-
"workspace": "https://huggingface.co/datasets/RLE-Bench/codex-benchmark/resolve/main/episodes/task06/07/seed-0/native/verifier/workspace.tar.gz",
|
| 20361 |
-
"workspace_changes": "https://huggingface.co/datasets/RLE-Bench/codex-benchmark/resolve/main/episodes/task06/07/seed-0/native/verifier/workspace.json",
|
| 20362 |
-
"owner_journal": "https://huggingface.co/datasets/RLE-Bench/codex-benchmark/resolve/main/episodes/task06/07/seed-0/native/evidence/episode/evidence/journal/actions.jsonl",
|
| 20363 |
-
"recording_manifest": "https://huggingface.co/datasets/RLE-Bench/codex-benchmark/resolve/main/episodes/task06/07/seed-0/native/evidence/episode/evidence/recording/manifest.json",
|
| 20364 |
-
"usage": "https://huggingface.co/datasets/RLE-Bench/codex-benchmark/resolve/main/episodes/task06/07/seed-0/usage.json",
|
| 20365 |
-
"analysis": "https://huggingface.co/datasets/RLE-Bench/codex-benchmark/resolve/main/episodes/task06/07/seed-0/analysis.json",
|
| 20366 |
-
"provenance": "https://huggingface.co/datasets/RLE-Bench/codex-benchmark/resolve/main/episodes/task06/07/seed-0/provenance.json",
|
| 20367 |
-
"video": "https://huggingface.co/datasets/RLE-Bench/codex-benchmark/resolve/main/episodes/task06/07/seed-0/video.mp4",
|
| 20368 |
-
"poster": "https://huggingface.co/datasets/RLE-Bench/codex-benchmark/resolve/main/episodes/task06/07/seed-0/poster.jpg",
|
| 20369 |
-
"media_check": "https://huggingface.co/datasets/RLE-Bench/codex-benchmark/resolve/main/episodes/task06/07/seed-0/media-validation.json",
|
| 20370 |
-
"final_observation": "https://huggingface.co/datasets/RLE-Bench/codex-benchmark/resolve/main/episodes/task06/07/seed-0/native/evidence/episode/evidence/final-observation.json"
|
| 20371 |
},
|
| 20372 |
"resources": [
|
| 20373 |
{
|
| 20374 |
"name": "tools/robot.py",
|
| 20375 |
-
"file": "https://huggingface.co/datasets/RLE-Bench/codex-benchmark/resolve/main/episodes/task06/07/seed-0/resources/tools/robot.py",
|
| 20376 |
"kind": "Created during this episode; final workspace snapshot."
|
| 20377 |
},
|
| 20378 |
{
|
| 20379 |
-
"name": "memos/
|
| 20380 |
-
"file": "https://huggingface.co/datasets/RLE-Bench/codex-benchmark/resolve/main/episodes/task06/07/seed-0/resources/memos/
|
| 20381 |
"kind": "Created during this episode; final workspace snapshot."
|
| 20382 |
}
|
| 20383 |
],
|
| 20384 |
"session_counts": {
|
| 20385 |
-
"visible_events":
|
| 20386 |
-
"observed_images":
|
| 20387 |
-
"tool_errors":
|
| 20388 |
},
|
| 20389 |
"selected_for_formal_metrics": true,
|
| 20390 |
-
"asset_base": "https://huggingface.co/datasets/RLE-Bench/codex-benchmark/resolve/main/episodes/task06/07/seed-0/"
|
| 20391 |
},
|
| 20392 |
{
|
| 20393 |
"id": "task06-08-seed0-formal",
|
|
|
|
| 20124 |
"asset_base": "https://huggingface.co/datasets/RLE-Bench/codex-benchmark/resolve/main/episodes/task06/06/seed-0-attempt02/"
|
| 20125 |
},
|
| 20126 |
{
|
| 20127 |
+
"id": "task06-07-seed0-formal-attempt02",
|
| 20128 |
"task_key": "task06/07",
|
| 20129 |
"family": "task06",
|
| 20130 |
"slot": "07",
|
|
|
|
| 20141 |
},
|
| 20142 |
"verdict": {
|
| 20143 |
"evidence_valid": true,
|
| 20144 |
+
"steps": 13688,
|
| 20145 |
"success": false,
|
| 20146 |
"termination": "stopped"
|
| 20147 |
},
|
| 20148 |
+
"steps": 13688,
|
| 20149 |
"simulation_time_s": null,
|
| 20150 |
+
"wall_time_s": 3043.529979,
|
| 20151 |
"model": "gpt-6-astra",
|
| 20152 |
"effort": "high",
|
| 20153 |
"harness": "codex",
|
|
|
|
| 20158 |
"usage": {
|
| 20159 |
"accounting": "reported-responses",
|
| 20160 |
"audit_complete": true,
|
| 20161 |
+
"cache_hit_rate": 0.9903104416710947,
|
| 20162 |
+
"cache_reported_input_tokens": 28195506,
|
| 20163 |
"cache_write_input_tokens": 0,
|
| 20164 |
+
"cache_write_reported_input_tokens": 28195506,
|
| 20165 |
+
"cached_input_tokens": 27922304,
|
| 20166 |
"completed_turns": 1,
|
| 20167 |
"cost_usd": null,
|
| 20168 |
"failed_turns": 0,
|
| 20169 |
+
"input_tokens": 28195506,
|
| 20170 |
"known_cache_write_input_tokens": 0,
|
| 20171 |
+
"known_cached_input_tokens": 27922304,
|
| 20172 |
+
"known_input_tokens": 28195506,
|
| 20173 |
+
"known_output_tokens": 45427,
|
| 20174 |
+
"known_reasoning_output_tokens": 17604,
|
| 20175 |
+
"output_tokens": 45427,
|
| 20176 |
+
"reasoning_output_tokens": 17604,
|
| 20177 |
+
"reasoning_reported_output_tokens": 45427,
|
| 20178 |
"reported_responses": {
|
| 20179 |
+
"cache_reported_input_tokens": 330,
|
| 20180 |
+
"cache_write_input_tokens": 330,
|
| 20181 |
+
"cache_write_reported_input_tokens": 330,
|
| 20182 |
+
"cached_input_tokens": 330,
|
| 20183 |
+
"input_tokens": 330,
|
| 20184 |
+
"output_tokens": 330,
|
| 20185 |
+
"reasoning_output_tokens": 330,
|
| 20186 |
+
"reasoning_reported_output_tokens": 330
|
| 20187 |
+
},
|
| 20188 |
+
"response_count": 330,
|
| 20189 |
"response_ids_complete": true,
|
| 20190 |
"schema": "rlebench/token-usage/1",
|
| 20191 |
"source": "Codex token_usage_record per response",
|
| 20192 |
+
"uncached_input_tokens": 273202,
|
| 20193 |
"unidentified_usage_records": 0
|
| 20194 |
},
|
| 20195 |
"call_activity": {
|
| 20196 |
+
"model_tool_calls": 330,
|
| 20197 |
"model_tool_calls_by_name": {
|
| 20198 |
+
"exec": 330
|
| 20199 |
},
|
| 20200 |
"nested_python_tool_invocations": null,
|
| 20201 |
"python_device_rpc_attempts": null,
|
|
|
|
| 20211 |
"passed": true,
|
| 20212 |
"width": 1280,
|
| 20213 |
"height": 360,
|
| 20214 |
+
"duration_s": 68.45,
|
| 20215 |
"speed": 4,
|
| 20216 |
"source_fps": 10,
|
| 20217 |
"output_fps": 20,
|
| 20218 |
"recording": {
|
| 20219 |
+
"accepted_samples": 2739,
|
| 20220 |
+
"captured_samples": 2739,
|
| 20221 |
"clock": "simulation",
|
| 20222 |
"dropped_samples": 0,
|
| 20223 |
+
"encoded_frames": 2738,
|
| 20224 |
+
"end_time_s": 273.760000000041,
|
| 20225 |
"error": null,
|
| 20226 |
"experimental": true,
|
| 20227 |
"fps": 10,
|
| 20228 |
+
"received_samples": 2739,
|
| 20229 |
"schema": "roboenv/recording/1",
|
| 20230 |
"state": "closed",
|
| 20231 |
"status": "complete",
|
|
|
|
| 20252 |
"camera_head_left",
|
| 20253 |
"camera_head_right"
|
| 20254 |
],
|
| 20255 |
+
"sha256": "2d99303a8803b78755f8a0844c59904c84a9edd43ac54a607a5f2c0e3e50f437",
|
| 20256 |
"scope": "Native spectator recording postprocessed at 4x; no replay or rerender"
|
| 20257 |
},
|
| 20258 |
"analysis": {
|
| 20259 |
"outcome": "\u539f\u751f\u5224\u5b9a\u672a\u6210\u529f\u3002",
|
| 20260 |
+
"duration": "\u4f7f\u7528 13,688 / 15,000 \u4e2a\u52a8\u4f5c\u5e27\uff1b\u7ed3\u675f\u539f\u56e0\uff1astopped\u3002",
|
| 20261 |
"execution": "\u6267\u884c\u6b63\u5e38\u5b8c\u6210\uff0c\u7528\u91cf\u8bb0\u5f55\u5b8c\u6574\u3002",
|
| 20262 |
"cause": "\u539f\u751f\u5931\u8d25\u5df2\u7ecf\u786e\u8ba4\uff1b\u5177\u4f53\u5931\u8d25\u673a\u5236\u5c1a\u672a\u9010\u9879\u5b9a\u4f4d\uff0c\u8bf7\u7ed3\u5408\u7ec8\u6001\u8bc1\u636e\u548c\u5b8c\u6574 session \u67e5\u770b\u3002"
|
| 20263 |
},
|
|
|
|
| 20273 |
"tests",
|
| 20274 |
"docs"
|
| 20275 |
],
|
| 20276 |
+
"content_sha256": "c9c6cd1b554380cfffee56b9a7bb47e102296d7bd38690f3ddcef2a4a5ca7bfc",
|
| 20277 |
"dirty": true,
|
| 20278 |
+
"revision": "2f315b78ab45a2978c2a69b7c33ec8fa4f78f618",
|
| 20279 |
"source": "/home/evaluator/PhyRSI/benchmark-v0.10.0/RLE-Bench-inhouse"
|
| 20280 |
},
|
| 20281 |
"RoboEnv": {
|
|
|
|
| 20293 |
"third_party/patches",
|
| 20294 |
"docs/validation"
|
| 20295 |
],
|
| 20296 |
+
"content_sha256": "0ea971928890164e2c1b0056a6cc3ebd0d1a306a63746193c33cf0b6e15a9aa2",
|
| 20297 |
"dirty": true,
|
| 20298 |
"revision": "b73356c09507eeffaf9ca9e90b668ef0b7f1fa92",
|
| 20299 |
"source": "/home/evaluator/PhyRSI/benchmark-v0.10.0/RoboEnv"
|
|
|
|
| 20318 |
"source": "/home/evaluator/PhyRSI/benchmark-v0.10.0/kinex"
|
| 20319 |
}
|
| 20320 |
},
|
| 20321 |
+
"job": "task06-07-pick-and-place-and-hug-container-codex-seed0-attempt02",
|
| 20322 |
+
"attempt": 2,
|
| 20323 |
"harness": "stock Codex CLI",
|
| 20324 |
"control_interface": "public RoboEnv SDK and CLI",
|
| 20325 |
"kinex_agent_runtime_used": false,
|
| 20326 |
+
"gpu_index": 4,
|
| 20327 |
"gpu_model": "NVIDIA L40S",
|
| 20328 |
+
"campaign_dispatch_concurrency_limit": 8,
|
| 20329 |
+
"concurrency_note": "One GPU per active SIMPLE episode; dispatch only on idle GPUs.",
|
| 20330 |
"codex_version": "0.160.0",
|
| 20331 |
"model": "gpt-6-astra",
|
| 20332 |
"effort": "high",
|
|
|
|
| 20343 |
},
|
| 20344 |
"classification": "formal",
|
| 20345 |
"measured_images": {
|
| 20346 |
+
"agent": "sha256:0093e794ce2fe8d5ab270fccfc8aef2ee8faf15d040d5a83f8c9416335b19217",
|
| 20347 |
+
"task": "sha256:66c86a017966a02653a3a2278a74002e1d16a717e6b21aa5e884cb94d54a8957"
|
| 20348 |
},
|
| 20349 |
+
"session_original_sha256": "1a98ccf2349496b219706c4996235516da26825a877a4816bfe2c78f484beeb7",
|
| 20350 |
+
"protocol_sha256": "48e670abdbf3fa6c277bcba1dd8310af3cb90f8d0166db40b5606c4e37ccfae0",
|
| 20351 |
+
"deployment": "failed10000-rerun15000-20261010T020844Z",
|
| 20352 |
+
"max_steps": 15000,
|
| 20353 |
+
"budget_revision": "failed10000-rerun15000-20261010T020844Z",
|
| 20354 |
+
"same_protocol_replacement": false,
|
| 20355 |
+
"replaces_user_interrupted_attempt": null,
|
| 20356 |
+
"replacement_reason": "Explicit user-authorized fresh rerun of a completed 10000-step native failure with 15000 steps.",
|
| 20357 |
+
"previous_native_failure": "task06-07-pick-and-place-and-hug-container-codex-seed0-attempt01",
|
| 20358 |
+
"previous_max_steps": 10000
|
| 20359 |
},
|
| 20360 |
"links": {
|
| 20361 |
+
"native_session": "https://huggingface.co/datasets/RLE-Bench/codex-benchmark/resolve/main/episodes/task06/07/seed-0-attempt02/native/agent/session.jsonl",
|
| 20362 |
+
"trace": "https://huggingface.co/datasets/RLE-Bench/codex-benchmark/resolve/main/episodes/task06/07/seed-0-attempt02/native/agent/trajectory.json",
|
| 20363 |
+
"provider_usage": "https://huggingface.co/datasets/RLE-Bench/codex-benchmark/resolve/main/episodes/task06/07/seed-0-attempt02/native/agent/provider-usage.jsonl",
|
| 20364 |
+
"transcript": "https://huggingface.co/datasets/RLE-Bench/codex-benchmark/resolve/main/episodes/task06/07/seed-0-attempt02/transcript.json",
|
| 20365 |
+
"verdict": "https://huggingface.co/datasets/RLE-Bench/codex-benchmark/resolve/main/episodes/task06/07/seed-0-attempt02/native/verifier/episode.json",
|
| 20366 |
+
"protocol": "https://huggingface.co/datasets/RLE-Bench/codex-benchmark/resolve/main/episodes/task06/07/seed-0-attempt02/native/verifier/protocol.json",
|
| 20367 |
+
"native_goal": "https://huggingface.co/datasets/RLE-Bench/codex-benchmark/resolve/main/episodes/task06/07/seed-0-attempt02/instructions.json",
|
| 20368 |
+
"workspace": "https://huggingface.co/datasets/RLE-Bench/codex-benchmark/resolve/main/episodes/task06/07/seed-0-attempt02/native/verifier/workspace.tar.gz",
|
| 20369 |
+
"workspace_changes": "https://huggingface.co/datasets/RLE-Bench/codex-benchmark/resolve/main/episodes/task06/07/seed-0-attempt02/native/verifier/workspace.json",
|
| 20370 |
+
"owner_journal": "https://huggingface.co/datasets/RLE-Bench/codex-benchmark/resolve/main/episodes/task06/07/seed-0-attempt02/native/evidence/episode/evidence/journal/actions.jsonl",
|
| 20371 |
+
"recording_manifest": "https://huggingface.co/datasets/RLE-Bench/codex-benchmark/resolve/main/episodes/task06/07/seed-0-attempt02/native/evidence/episode/evidence/recording/manifest.json",
|
| 20372 |
+
"usage": "https://huggingface.co/datasets/RLE-Bench/codex-benchmark/resolve/main/episodes/task06/07/seed-0-attempt02/usage.json",
|
| 20373 |
+
"analysis": "https://huggingface.co/datasets/RLE-Bench/codex-benchmark/resolve/main/episodes/task06/07/seed-0-attempt02/analysis.json",
|
| 20374 |
+
"provenance": "https://huggingface.co/datasets/RLE-Bench/codex-benchmark/resolve/main/episodes/task06/07/seed-0-attempt02/provenance.json",
|
| 20375 |
+
"video": "https://huggingface.co/datasets/RLE-Bench/codex-benchmark/resolve/main/episodes/task06/07/seed-0-attempt02/video.mp4",
|
| 20376 |
+
"poster": "https://huggingface.co/datasets/RLE-Bench/codex-benchmark/resolve/main/episodes/task06/07/seed-0-attempt02/poster.jpg",
|
| 20377 |
+
"media_check": "https://huggingface.co/datasets/RLE-Bench/codex-benchmark/resolve/main/episodes/task06/07/seed-0-attempt02/media-validation.json",
|
| 20378 |
+
"final_observation": "https://huggingface.co/datasets/RLE-Bench/codex-benchmark/resolve/main/episodes/task06/07/seed-0-attempt02/native/evidence/episode/evidence/final-observation.json"
|
| 20379 |
},
|
| 20380 |
"resources": [
|
| 20381 |
{
|
| 20382 |
"name": "tools/robot.py",
|
| 20383 |
+
"file": "https://huggingface.co/datasets/RLE-Bench/codex-benchmark/resolve/main/episodes/task06/07/seed-0-attempt02/resources/tools/robot.py",
|
| 20384 |
"kind": "Created during this episode; final workspace snapshot."
|
| 20385 |
},
|
| 20386 |
{
|
| 20387 |
+
"name": "memos/g1_simple.md",
|
| 20388 |
+
"file": "https://huggingface.co/datasets/RLE-Bench/codex-benchmark/resolve/main/episodes/task06/07/seed-0-attempt02/resources/memos/g1_simple.md",
|
| 20389 |
"kind": "Created during this episode; final workspace snapshot."
|
| 20390 |
}
|
| 20391 |
],
|
| 20392 |
"session_counts": {
|
| 20393 |
+
"visible_events": 689,
|
| 20394 |
+
"observed_images": 88,
|
| 20395 |
+
"tool_errors": 12
|
| 20396 |
},
|
| 20397 |
"selected_for_formal_metrics": true,
|
| 20398 |
+
"asset_base": "https://huggingface.co/datasets/RLE-Bench/codex-benchmark/resolve/main/episodes/task06/07/seed-0-attempt02/"
|
| 20399 |
},
|
| 20400 |
{
|
| 20401 |
"id": "task06-08-seed0-formal",
|
manifest.json
CHANGED
|
@@ -12,16 +12,16 @@
|
|
| 12 |
"catalog/task06/04-bend-pick-and-place/task.yaml": "9943d0d6f74996ead10611304620430c8f3fb3d1cfcd6e5da6a15eb4345f7ecb",
|
| 13 |
"catalog/task06/05-bend-handover/task.yaml": "ba55ca57801e786627a9b981db3ac4e007a0ddf64cbf3cccd0252ac9cba0b111",
|
| 14 |
"catalog/task06/06-handover/task.yaml": "2153c888b800f28c78afcfb05feccf37234ae88fae1bb305f45668ad9c0a2e00",
|
| 15 |
-
"catalog/task06/07-pick-and-place-and-hug-container/task.yaml": "
|
| 16 |
"catalog/task06/08-close-door/task.yaml": "a0256216150b375a5ba091179411e6a15ea3a455e50e793a5e479bb1355028b3",
|
| 17 |
"catalog/task06/09-open-oven/task.yaml": "f7126ed4aa03c922f3b7fbef567be75d9f5080b9219c673b941fa2d03cabb91e",
|
| 18 |
"catalog/task06/10-open-faucet/task.yaml": "dcdd2228bfd8de298da36798856f5ff59b523c7104118103530eb7a641b52197",
|
| 19 |
"catalog/task06/11-push-office-chair/task.yaml": "0e2de1c50619b0c58fd939f58362dfc0630f34d4e19587fe4927a2c4e5c1d785",
|
| 20 |
"catalog/task06/12-open-trash-can/task.yaml": "e02833927892caa9c40ed193348aab1858e6ae6208c4c04892dec8eae4ad45f0",
|
| 21 |
-
"comparison.json": "
|
| 22 |
-
"data.json": "
|
| 23 |
-
"episodes.csv": "
|
| 24 |
-
"episodes.json": "
|
| 25 |
"failure-reviews.json": "c66a997c9ecd6f7f43f130a8a33cd64c7a5b2049033e9ccde653ee30e4796f23",
|
| 26 |
"favicon.svg": "46063791218655f70c828ef71a1232a34fd38181da938338badec929ad226819",
|
| 27 |
"index.html": "d29e3b0133b9af6378b8b3ab7a6bc04f8f985eff46a409078c4f8e6a521edfc2",
|
|
@@ -30,8 +30,8 @@
|
|
| 30 |
"licenses/RoboTwin-LICENSE.txt": "c695d421718e54e6f3a60858f0c601125c3ecc60c199332c15947360561e2a9f",
|
| 31 |
"licenses/robocasa-LICENSE.txt": "5da18670b3f00c59847b1ded9c28dee59940d963b1e03b528b0108d9c5a09885",
|
| 32 |
"licenses/robosuite-LICENSE.txt": "177978cbece0a4c454c2aaec5b3f145b39270814874c43109da9e829c39d9cba",
|
| 33 |
-
"protocol.json": "
|
| 34 |
"style.css": "dd31b30951c220ebb82bc96224b5e640913945679e42b2e0a42e2c373a329e6c",
|
| 35 |
-
"summary.json": "
|
| 36 |
-
"task-index.json": "
|
| 37 |
}
|
|
|
|
| 12 |
"catalog/task06/04-bend-pick-and-place/task.yaml": "9943d0d6f74996ead10611304620430c8f3fb3d1cfcd6e5da6a15eb4345f7ecb",
|
| 13 |
"catalog/task06/05-bend-handover/task.yaml": "ba55ca57801e786627a9b981db3ac4e007a0ddf64cbf3cccd0252ac9cba0b111",
|
| 14 |
"catalog/task06/06-handover/task.yaml": "2153c888b800f28c78afcfb05feccf37234ae88fae1bb305f45668ad9c0a2e00",
|
| 15 |
+
"catalog/task06/07-pick-and-place-and-hug-container/task.yaml": "30c3e4d743fb523ac8fd5f278b41c73c85cd08469bee4e4f0d2cf8db2dd4a6b0",
|
| 16 |
"catalog/task06/08-close-door/task.yaml": "a0256216150b375a5ba091179411e6a15ea3a455e50e793a5e479bb1355028b3",
|
| 17 |
"catalog/task06/09-open-oven/task.yaml": "f7126ed4aa03c922f3b7fbef567be75d9f5080b9219c673b941fa2d03cabb91e",
|
| 18 |
"catalog/task06/10-open-faucet/task.yaml": "dcdd2228bfd8de298da36798856f5ff59b523c7104118103530eb7a641b52197",
|
| 19 |
"catalog/task06/11-push-office-chair/task.yaml": "0e2de1c50619b0c58fd939f58362dfc0630f34d4e19587fe4927a2c4e5c1d785",
|
| 20 |
"catalog/task06/12-open-trash-can/task.yaml": "e02833927892caa9c40ed193348aab1858e6ae6208c4c04892dec8eae4ad45f0",
|
| 21 |
+
"comparison.json": "41ac8e73537d3866ad37188ed82e53dae6c51bb1d87414ee6406ee7479b2d777",
|
| 22 |
+
"data.json": "97389e0e92435e8a3828a0bd1fb140a6ec84b6d5419ccac5b343a7c42ddcfa08",
|
| 23 |
+
"episodes.csv": "f8262dfb6fc34aa549282d2e4983ffd3c97e3002a9259bff3d562010a2137a5f",
|
| 24 |
+
"episodes.json": "cb86175ca74e96dc4de0b61e64458e63d8e22acb8a1e29ce88c6343d31731a5a",
|
| 25 |
"failure-reviews.json": "c66a997c9ecd6f7f43f130a8a33cd64c7a5b2049033e9ccde653ee30e4796f23",
|
| 26 |
"favicon.svg": "46063791218655f70c828ef71a1232a34fd38181da938338badec929ad226819",
|
| 27 |
"index.html": "d29e3b0133b9af6378b8b3ab7a6bc04f8f985eff46a409078c4f8e6a521edfc2",
|
|
|
|
| 30 |
"licenses/RoboTwin-LICENSE.txt": "c695d421718e54e6f3a60858f0c601125c3ecc60c199332c15947360561e2a9f",
|
| 31 |
"licenses/robocasa-LICENSE.txt": "5da18670b3f00c59847b1ded9c28dee59940d963b1e03b528b0108d9c5a09885",
|
| 32 |
"licenses/robosuite-LICENSE.txt": "177978cbece0a4c454c2aaec5b3f145b39270814874c43109da9e829c39d9cba",
|
| 33 |
+
"protocol.json": "8945b054460c822ed8e443487ec7f8d3ba65bf9c37242372f963d5f5865c6cea",
|
| 34 |
"style.css": "dd31b30951c220ebb82bc96224b5e640913945679e42b2e0a42e2c373a329e6c",
|
| 35 |
+
"summary.json": "0a5383bc176a323c184e4b739f689b7c959428405c504ab509e2b37bf5593dd9",
|
| 36 |
+
"task-index.json": "c3fe50ef22662dd477d91f8bafe0c3de3d94a0586d25671aa249cceb2eb40af1"
|
| 37 |
}
|
protocol.json
CHANGED
|
@@ -110,7 +110,7 @@
|
|
| 110 |
"task06/04": 15000,
|
| 111 |
"task06/05": 15000,
|
| 112 |
"task06/06": 15000,
|
| 113 |
-
"task06/07":
|
| 114 |
"task06/08": 10000,
|
| 115 |
"task06/09": 15000,
|
| 116 |
"task06/10": 15000,
|
|
@@ -121,9 +121,9 @@
|
|
| 121 |
"formal_results": 12,
|
| 122 |
"modified_results": 0,
|
| 123 |
"original_results": 12,
|
| 124 |
-
"input_tokens":
|
| 125 |
-
"cached_input_tokens":
|
| 126 |
-
"output_tokens":
|
| 127 |
}
|
| 128 |
],
|
| 129 |
"usage_accounting": "reported-responses",
|
|
@@ -174,7 +174,7 @@
|
|
| 174 |
"task06/04": 15000,
|
| 175 |
"task06/05": 15000,
|
| 176 |
"task06/06": 15000,
|
| 177 |
-
"task06/07":
|
| 178 |
"task06/08": 10000,
|
| 179 |
"task06/09": 15000,
|
| 180 |
"task06/10": 15000,
|
|
|
|
| 110 |
"task06/04": 15000,
|
| 111 |
"task06/05": 15000,
|
| 112 |
"task06/06": 15000,
|
| 113 |
+
"task06/07": 15000,
|
| 114 |
"task06/08": 10000,
|
| 115 |
"task06/09": 15000,
|
| 116 |
"task06/10": 15000,
|
|
|
|
| 121 |
"formal_results": 12,
|
| 122 |
"modified_results": 0,
|
| 123 |
"original_results": 12,
|
| 124 |
+
"input_tokens": 106763761,
|
| 125 |
+
"cached_input_tokens": 105331968,
|
| 126 |
+
"output_tokens": 303566
|
| 127 |
}
|
| 128 |
],
|
| 129 |
"usage_accounting": "reported-responses",
|
|
|
|
| 174 |
"task06/04": 15000,
|
| 175 |
"task06/05": 15000,
|
| 176 |
"task06/06": 15000,
|
| 177 |
+
"task06/07": 15000,
|
| 178 |
"task06/08": 10000,
|
| 179 |
"task06/09": 15000,
|
| 180 |
"task06/10": 15000,
|
publication-manifest.json
CHANGED
|
@@ -54,8 +54,8 @@
|
|
| 54 |
"bytes": 370
|
| 55 |
},
|
| 56 |
"catalog/task06/07-pick-and-place-and-hug-container/task.yaml": {
|
| 57 |
-
"sha256": "
|
| 58 |
-
"bytes":
|
| 59 |
},
|
| 60 |
"catalog/task06/08-close-door/task.yaml": {
|
| 61 |
"sha256": "a0256216150b375a5ba091179411e6a15ea3a455e50e793a5e479bb1355028b3",
|
|
@@ -78,20 +78,20 @@
|
|
| 78 |
"bytes": 338
|
| 79 |
},
|
| 80 |
"comparison.json": {
|
| 81 |
-
"sha256": "
|
| 82 |
-
"bytes":
|
| 83 |
},
|
| 84 |
"data.json": {
|
| 85 |
-
"sha256": "
|
| 86 |
-
"bytes":
|
| 87 |
},
|
| 88 |
"episodes.csv": {
|
| 89 |
-
"sha256": "
|
| 90 |
-
"bytes":
|
| 91 |
},
|
| 92 |
"episodes.json": {
|
| 93 |
-
"sha256": "
|
| 94 |
-
"bytes":
|
| 95 |
},
|
| 96 |
"failure-reviews.json": {
|
| 97 |
"sha256": "c66a997c9ecd6f7f43f130a8a33cd64c7a5b2049033e9ccde653ee30e4796f23",
|
|
@@ -126,23 +126,23 @@
|
|
| 126 |
"bytes": 1474
|
| 127 |
},
|
| 128 |
"protocol.json": {
|
| 129 |
-
"sha256": "
|
| 130 |
-
"bytes":
|
| 131 |
},
|
| 132 |
"style.css": {
|
| 133 |
"sha256": "dd31b30951c220ebb82bc96224b5e640913945679e42b2e0a42e2c373a329e6c",
|
| 134 |
"bytes": 16560
|
| 135 |
},
|
| 136 |
"summary.json": {
|
| 137 |
-
"sha256": "
|
| 138 |
-
"bytes":
|
| 139 |
},
|
| 140 |
"task-index.json": {
|
| 141 |
-
"sha256": "
|
| 142 |
-
"bytes":
|
| 143 |
},
|
| 144 |
"manifest.json": {
|
| 145 |
-
"sha256": "
|
| 146 |
"bytes": 3481
|
| 147 |
}
|
| 148 |
}
|
|
|
|
| 54 |
"bytes": 370
|
| 55 |
},
|
| 56 |
"catalog/task06/07-pick-and-place-and-hug-container/task.yaml": {
|
| 57 |
+
"sha256": "30c3e4d743fb523ac8fd5f278b41c73c85cd08469bee4e4f0d2cf8db2dd4a6b0",
|
| 58 |
+
"bytes": 416
|
| 59 |
},
|
| 60 |
"catalog/task06/08-close-door/task.yaml": {
|
| 61 |
"sha256": "a0256216150b375a5ba091179411e6a15ea3a455e50e793a5e479bb1355028b3",
|
|
|
|
| 78 |
"bytes": 338
|
| 79 |
},
|
| 80 |
"comparison.json": {
|
| 81 |
+
"sha256": "41ac8e73537d3866ad37188ed82e53dae6c51bb1d87414ee6406ee7479b2d777",
|
| 82 |
+
"bytes": 157967
|
| 83 |
},
|
| 84 |
"data.json": {
|
| 85 |
+
"sha256": "97389e0e92435e8a3828a0bd1fb140a6ec84b6d5419ccac5b343a7c42ddcfa08",
|
| 86 |
+
"bytes": 1249622
|
| 87 |
},
|
| 88 |
"episodes.csv": {
|
| 89 |
+
"sha256": "f8262dfb6fc34aa549282d2e4983ffd3c97e3002a9259bff3d562010a2137a5f",
|
| 90 |
+
"bytes": 8275
|
| 91 |
},
|
| 92 |
"episodes.json": {
|
| 93 |
+
"sha256": "cb86175ca74e96dc4de0b61e64458e63d8e22acb8a1e29ce88c6343d31731a5a",
|
| 94 |
+
"bytes": 924243
|
| 95 |
},
|
| 96 |
"failure-reviews.json": {
|
| 97 |
"sha256": "c66a997c9ecd6f7f43f130a8a33cd64c7a5b2049033e9ccde653ee30e4796f23",
|
|
|
|
| 126 |
"bytes": 1474
|
| 127 |
},
|
| 128 |
"protocol.json": {
|
| 129 |
+
"sha256": "8945b054460c822ed8e443487ec7f8d3ba65bf9c37242372f963d5f5865c6cea",
|
| 130 |
+
"bytes": 6472
|
| 131 |
},
|
| 132 |
"style.css": {
|
| 133 |
"sha256": "dd31b30951c220ebb82bc96224b5e640913945679e42b2e0a42e2c373a329e6c",
|
| 134 |
"bytes": 16560
|
| 135 |
},
|
| 136 |
"summary.json": {
|
| 137 |
+
"sha256": "0a5383bc176a323c184e4b739f689b7c959428405c504ab509e2b37bf5593dd9",
|
| 138 |
+
"bytes": 5827
|
| 139 |
},
|
| 140 |
"task-index.json": {
|
| 141 |
+
"sha256": "c3fe50ef22662dd477d91f8bafe0c3de3d94a0586d25671aa249cceb2eb40af1",
|
| 142 |
+
"bytes": 247399
|
| 143 |
},
|
| 144 |
"manifest.json": {
|
| 145 |
+
"sha256": "8adbe63328a37af296e5a2dbb0540dc05aef5cdf9077307c78008d16f2fe608e",
|
| 146 |
"bytes": 3481
|
| 147 |
}
|
| 148 |
}
|
summary.json
CHANGED
|
@@ -103,7 +103,7 @@
|
|
| 103 |
"task06/04": 15000,
|
| 104 |
"task06/05": 15000,
|
| 105 |
"task06/06": 15000,
|
| 106 |
-
"task06/07":
|
| 107 |
"task06/08": 10000,
|
| 108 |
"task06/09": 15000,
|
| 109 |
"task06/10": 15000,
|
|
@@ -114,9 +114,9 @@
|
|
| 114 |
"formal_results": 12,
|
| 115 |
"modified_results": 0,
|
| 116 |
"original_results": 12,
|
| 117 |
-
"input_tokens":
|
| 118 |
-
"cached_input_tokens":
|
| 119 |
-
"output_tokens":
|
| 120 |
}
|
| 121 |
],
|
| 122 |
"interrupted_attempts": 4,
|
|
@@ -144,8 +144,8 @@
|
|
| 144 |
},
|
| 145 |
"simple_reruns": {
|
| 146 |
"authorized": 6,
|
| 147 |
-
"published":
|
| 148 |
-
"remaining":
|
| 149 |
"selection": "Latest validated completed result per task; earlier native failures remain in attempt history.",
|
| 150 |
"comparison_scope": "Only earlier failures were rerun at 15000 steps. Retained successes use 10000 steps. This selected-result view is not a uniform-budget agent comparison.",
|
| 151 |
"replacements": [
|
|
@@ -188,6 +188,14 @@
|
|
| 188 |
"current_max_steps": 15000,
|
| 189 |
"previous_max_steps": 10000,
|
| 190 |
"success": false
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 191 |
}
|
| 192 |
]
|
| 193 |
}
|
|
|
|
| 103 |
"task06/04": 15000,
|
| 104 |
"task06/05": 15000,
|
| 105 |
"task06/06": 15000,
|
| 106 |
+
"task06/07": 15000,
|
| 107 |
"task06/08": 10000,
|
| 108 |
"task06/09": 15000,
|
| 109 |
"task06/10": 15000,
|
|
|
|
| 114 |
"formal_results": 12,
|
| 115 |
"modified_results": 0,
|
| 116 |
"original_results": 12,
|
| 117 |
+
"input_tokens": 106763761,
|
| 118 |
+
"cached_input_tokens": 105331968,
|
| 119 |
+
"output_tokens": 303566
|
| 120 |
}
|
| 121 |
],
|
| 122 |
"interrupted_attempts": 4,
|
|
|
|
| 144 |
},
|
| 145 |
"simple_reruns": {
|
| 146 |
"authorized": 6,
|
| 147 |
+
"published": 6,
|
| 148 |
+
"remaining": 0,
|
| 149 |
"selection": "Latest validated completed result per task; earlier native failures remain in attempt history.",
|
| 150 |
"comparison_scope": "Only earlier failures were rerun at 15000 steps. Retained successes use 10000 steps. This selected-result view is not a uniform-budget agent comparison.",
|
| 151 |
"replacements": [
|
|
|
|
| 188 |
"current_max_steps": 15000,
|
| 189 |
"previous_max_steps": 10000,
|
| 190 |
"success": false
|
| 191 |
+
},
|
| 192 |
+
{
|
| 193 |
+
"task_key": "task06/07",
|
| 194 |
+
"current_job": "task06-07-pick-and-place-and-hug-container-codex-seed0-attempt02",
|
| 195 |
+
"previous_job": "task06-07-pick-and-place-and-hug-container-codex-seed0-attempt01",
|
| 196 |
+
"current_max_steps": 15000,
|
| 197 |
+
"previous_max_steps": 10000,
|
| 198 |
+
"success": false
|
| 199 |
}
|
| 200 |
]
|
| 201 |
}
|
task-index.json
CHANGED
|
@@ -6068,7 +6068,7 @@
|
|
| 6068 |
"task06/04": 15000,
|
| 6069 |
"task06/05": 15000,
|
| 6070 |
"task06/06": 15000,
|
| 6071 |
-
"task06/07":
|
| 6072 |
"task06/08": 10000,
|
| 6073 |
"task06/09": 15000,
|
| 6074 |
"task06/10": 15000,
|
|
@@ -6112,7 +6112,7 @@
|
|
| 6112 |
"task06/04": 15000,
|
| 6113 |
"task06/05": 15000,
|
| 6114 |
"task06/06": 15000,
|
| 6115 |
-
"task06/07":
|
| 6116 |
"task06/08": 10000,
|
| 6117 |
"task06/09": 15000,
|
| 6118 |
"task06/10": 15000,
|
|
@@ -6198,7 +6198,7 @@
|
|
| 6198 |
"task06/04": 15000,
|
| 6199 |
"task06/05": 15000,
|
| 6200 |
"task06/06": 15000,
|
| 6201 |
-
"task06/07":
|
| 6202 |
"task06/08": 10000,
|
| 6203 |
"task06/09": 15000,
|
| 6204 |
"task06/10": 15000,
|
|
@@ -6284,7 +6284,7 @@
|
|
| 6284 |
"task06/04": 15000,
|
| 6285 |
"task06/05": 15000,
|
| 6286 |
"task06/06": 15000,
|
| 6287 |
-
"task06/07":
|
| 6288 |
"task06/08": 10000,
|
| 6289 |
"task06/09": 15000,
|
| 6290 |
"task06/10": 15000,
|
|
@@ -6370,7 +6370,7 @@
|
|
| 6370 |
"task06/04": 15000,
|
| 6371 |
"task06/05": 15000,
|
| 6372 |
"task06/06": 15000,
|
| 6373 |
-
"task06/07":
|
| 6374 |
"task06/08": 10000,
|
| 6375 |
"task06/09": 15000,
|
| 6376 |
"task06/10": 15000,
|
|
@@ -6456,7 +6456,7 @@
|
|
| 6456 |
"task06/04": 15000,
|
| 6457 |
"task06/05": 15000,
|
| 6458 |
"task06/06": 15000,
|
| 6459 |
-
"task06/07":
|
| 6460 |
"task06/08": 10000,
|
| 6461 |
"task06/09": 15000,
|
| 6462 |
"task06/10": 15000,
|
|
@@ -6527,14 +6527,14 @@
|
|
| 6527 |
"native_instruction": "pick up the apple from table1,hug the container,walk to table2,and place on table2.",
|
| 6528 |
"instruction_source": "Unchanged native SIMPLE instruction for the effective default task configuration.",
|
| 6529 |
"status": "completed",
|
| 6530 |
-
"episode_id": "task06-07-seed0-formal",
|
| 6531 |
"run_status": "finished",
|
| 6532 |
"status_note": "Native result, execution and usage complete.",
|
| 6533 |
"planned_protocol": {
|
| 6534 |
"episodes": 1,
|
| 6535 |
"seed": 0,
|
| 6536 |
"control_frequency_hz": 50,
|
| 6537 |
-
"max_control_steps":
|
| 6538 |
"max_control_steps_by_task": {
|
| 6539 |
"task06/01": 10000,
|
| 6540 |
"task06/02": 15000,
|
|
@@ -6542,7 +6542,7 @@
|
|
| 6542 |
"task06/04": 15000,
|
| 6543 |
"task06/05": 15000,
|
| 6544 |
"task06/06": 15000,
|
| 6545 |
-
"task06/07":
|
| 6546 |
"task06/08": 10000,
|
| 6547 |
"task06/09": 15000,
|
| 6548 |
"task06/10": 15000,
|
|
@@ -6561,11 +6561,46 @@
|
|
| 6561 |
},
|
| 6562 |
"simple_rerun": {
|
| 6563 |
"attempt": 2,
|
| 6564 |
-
"status": "
|
| 6565 |
"target_max_steps": 15000,
|
| 6566 |
"previous_max_steps": 10000,
|
| 6567 |
-
"note": "
|
| 6568 |
-
}
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 6569 |
},
|
| 6570 |
{
|
| 6571 |
"key": "task06/08",
|
|
@@ -6593,7 +6628,7 @@
|
|
| 6593 |
"task06/04": 15000,
|
| 6594 |
"task06/05": 15000,
|
| 6595 |
"task06/06": 15000,
|
| 6596 |
-
"task06/07":
|
| 6597 |
"task06/08": 10000,
|
| 6598 |
"task06/09": 15000,
|
| 6599 |
"task06/10": 15000,
|
|
@@ -6637,7 +6672,7 @@
|
|
| 6637 |
"task06/04": 15000,
|
| 6638 |
"task06/05": 15000,
|
| 6639 |
"task06/06": 15000,
|
| 6640 |
-
"task06/07":
|
| 6641 |
"task06/08": 10000,
|
| 6642 |
"task06/09": 15000,
|
| 6643 |
"task06/10": 15000,
|
|
@@ -6681,7 +6716,7 @@
|
|
| 6681 |
"task06/04": 15000,
|
| 6682 |
"task06/05": 15000,
|
| 6683 |
"task06/06": 15000,
|
| 6684 |
-
"task06/07":
|
| 6685 |
"task06/08": 10000,
|
| 6686 |
"task06/09": 15000,
|
| 6687 |
"task06/10": 15000,
|
|
@@ -6725,7 +6760,7 @@
|
|
| 6725 |
"task06/04": 15000,
|
| 6726 |
"task06/05": 15000,
|
| 6727 |
"task06/06": 15000,
|
| 6728 |
-
"task06/07":
|
| 6729 |
"task06/08": 10000,
|
| 6730 |
"task06/09": 15000,
|
| 6731 |
"task06/10": 15000,
|
|
@@ -6769,7 +6804,7 @@
|
|
| 6769 |
"task06/04": 15000,
|
| 6770 |
"task06/05": 15000,
|
| 6771 |
"task06/06": 15000,
|
| 6772 |
-
"task06/07":
|
| 6773 |
"task06/08": 10000,
|
| 6774 |
"task06/09": 15000,
|
| 6775 |
"task06/10": 15000,
|
|
|
|
| 6068 |
"task06/04": 15000,
|
| 6069 |
"task06/05": 15000,
|
| 6070 |
"task06/06": 15000,
|
| 6071 |
+
"task06/07": 15000,
|
| 6072 |
"task06/08": 10000,
|
| 6073 |
"task06/09": 15000,
|
| 6074 |
"task06/10": 15000,
|
|
|
|
| 6112 |
"task06/04": 15000,
|
| 6113 |
"task06/05": 15000,
|
| 6114 |
"task06/06": 15000,
|
| 6115 |
+
"task06/07": 15000,
|
| 6116 |
"task06/08": 10000,
|
| 6117 |
"task06/09": 15000,
|
| 6118 |
"task06/10": 15000,
|
|
|
|
| 6198 |
"task06/04": 15000,
|
| 6199 |
"task06/05": 15000,
|
| 6200 |
"task06/06": 15000,
|
| 6201 |
+
"task06/07": 15000,
|
| 6202 |
"task06/08": 10000,
|
| 6203 |
"task06/09": 15000,
|
| 6204 |
"task06/10": 15000,
|
|
|
|
| 6284 |
"task06/04": 15000,
|
| 6285 |
"task06/05": 15000,
|
| 6286 |
"task06/06": 15000,
|
| 6287 |
+
"task06/07": 15000,
|
| 6288 |
"task06/08": 10000,
|
| 6289 |
"task06/09": 15000,
|
| 6290 |
"task06/10": 15000,
|
|
|
|
| 6370 |
"task06/04": 15000,
|
| 6371 |
"task06/05": 15000,
|
| 6372 |
"task06/06": 15000,
|
| 6373 |
+
"task06/07": 15000,
|
| 6374 |
"task06/08": 10000,
|
| 6375 |
"task06/09": 15000,
|
| 6376 |
"task06/10": 15000,
|
|
|
|
| 6456 |
"task06/04": 15000,
|
| 6457 |
"task06/05": 15000,
|
| 6458 |
"task06/06": 15000,
|
| 6459 |
+
"task06/07": 15000,
|
| 6460 |
"task06/08": 10000,
|
| 6461 |
"task06/09": 15000,
|
| 6462 |
"task06/10": 15000,
|
|
|
|
| 6527 |
"native_instruction": "pick up the apple from table1,hug the container,walk to table2,and place on table2.",
|
| 6528 |
"instruction_source": "Unchanged native SIMPLE instruction for the effective default task configuration.",
|
| 6529 |
"status": "completed",
|
| 6530 |
+
"episode_id": "task06-07-seed0-formal-attempt02",
|
| 6531 |
"run_status": "finished",
|
| 6532 |
"status_note": "Native result, execution and usage complete.",
|
| 6533 |
"planned_protocol": {
|
| 6534 |
"episodes": 1,
|
| 6535 |
"seed": 0,
|
| 6536 |
"control_frequency_hz": 50,
|
| 6537 |
+
"max_control_steps": 15000,
|
| 6538 |
"max_control_steps_by_task": {
|
| 6539 |
"task06/01": 10000,
|
| 6540 |
"task06/02": 15000,
|
|
|
|
| 6542 |
"task06/04": 15000,
|
| 6543 |
"task06/05": 15000,
|
| 6544 |
"task06/06": 15000,
|
| 6545 |
+
"task06/07": 15000,
|
| 6546 |
"task06/08": 10000,
|
| 6547 |
"task06/09": 15000,
|
| 6548 |
"task06/10": 15000,
|
|
|
|
| 6561 |
},
|
| 6562 |
"simple_rerun": {
|
| 6563 |
"attempt": 2,
|
| 6564 |
+
"status": "published",
|
| 6565 |
"target_max_steps": 15000,
|
| 6566 |
"previous_max_steps": 10000,
|
| 6567 |
+
"note": "Fresh 15000-step rerun selected; previous 10000-step native failure retained below."
|
| 6568 |
+
},
|
| 6569 |
+
"attempt_history": [
|
| 6570 |
+
{
|
| 6571 |
+
"id": "task06-07-pick-and-place-and-hug-container-codex-seed0-attempt01",
|
| 6572 |
+
"max_steps": 10000,
|
| 6573 |
+
"success": false,
|
| 6574 |
+
"steps": 8645,
|
| 6575 |
+
"execution": {
|
| 6576 |
+
"reason": null,
|
| 6577 |
+
"status": "finished"
|
| 6578 |
+
},
|
| 6579 |
+
"usage_complete": true,
|
| 6580 |
+
"links": {
|
| 6581 |
+
"native_session": "episodes/task06/07/seed-0/native/agent/session.jsonl",
|
| 6582 |
+
"trace": "episodes/task06/07/seed-0/native/agent/trajectory.json",
|
| 6583 |
+
"provider_usage": "episodes/task06/07/seed-0/native/agent/provider-usage.jsonl",
|
| 6584 |
+
"transcript": "episodes/task06/07/seed-0/transcript.json",
|
| 6585 |
+
"verdict": "episodes/task06/07/seed-0/native/verifier/episode.json",
|
| 6586 |
+
"protocol": "episodes/task06/07/seed-0/native/verifier/protocol.json",
|
| 6587 |
+
"native_goal": "episodes/task06/07/seed-0/instructions.json",
|
| 6588 |
+
"workspace": "episodes/task06/07/seed-0/native/verifier/workspace.tar.gz",
|
| 6589 |
+
"workspace_changes": "episodes/task06/07/seed-0/native/verifier/workspace.json",
|
| 6590 |
+
"owner_journal": "episodes/task06/07/seed-0/native/evidence/episode/evidence/journal/actions.jsonl",
|
| 6591 |
+
"recording_manifest": "episodes/task06/07/seed-0/native/evidence/episode/evidence/recording/manifest.json",
|
| 6592 |
+
"usage": "episodes/task06/07/seed-0/usage.json",
|
| 6593 |
+
"analysis": "episodes/task06/07/seed-0/analysis.json",
|
| 6594 |
+
"provenance": "episodes/task06/07/seed-0/provenance.json",
|
| 6595 |
+
"video": "episodes/task06/07/seed-0/video.mp4",
|
| 6596 |
+
"poster": "episodes/task06/07/seed-0/poster.jpg",
|
| 6597 |
+
"media_check": "episodes/task06/07/seed-0/media-validation.json",
|
| 6598 |
+
"final_observation": "episodes/task06/07/seed-0/native/evidence/episode/evidence/final-observation.json",
|
| 6599 |
+
"episode_record": "history/simple-10000/07/episode.json"
|
| 6600 |
+
},
|
| 6601 |
+
"selected_for_formal_metrics": false
|
| 6602 |
+
}
|
| 6603 |
+
]
|
| 6604 |
},
|
| 6605 |
{
|
| 6606 |
"key": "task06/08",
|
|
|
|
| 6628 |
"task06/04": 15000,
|
| 6629 |
"task06/05": 15000,
|
| 6630 |
"task06/06": 15000,
|
| 6631 |
+
"task06/07": 15000,
|
| 6632 |
"task06/08": 10000,
|
| 6633 |
"task06/09": 15000,
|
| 6634 |
"task06/10": 15000,
|
|
|
|
| 6672 |
"task06/04": 15000,
|
| 6673 |
"task06/05": 15000,
|
| 6674 |
"task06/06": 15000,
|
| 6675 |
+
"task06/07": 15000,
|
| 6676 |
"task06/08": 10000,
|
| 6677 |
"task06/09": 15000,
|
| 6678 |
"task06/10": 15000,
|
|
|
|
| 6716 |
"task06/04": 15000,
|
| 6717 |
"task06/05": 15000,
|
| 6718 |
"task06/06": 15000,
|
| 6719 |
+
"task06/07": 15000,
|
| 6720 |
"task06/08": 10000,
|
| 6721 |
"task06/09": 15000,
|
| 6722 |
"task06/10": 15000,
|
|
|
|
| 6760 |
"task06/04": 15000,
|
| 6761 |
"task06/05": 15000,
|
| 6762 |
"task06/06": 15000,
|
| 6763 |
+
"task06/07": 15000,
|
| 6764 |
"task06/08": 10000,
|
| 6765 |
"task06/09": 15000,
|
| 6766 |
"task06/10": 15000,
|
|
|
|
| 6804 |
"task06/04": 15000,
|
| 6805 |
"task06/05": 15000,
|
| 6806 |
"task06/06": 15000,
|
| 6807 |
+
"task06/07": 15000,
|
| 6808 |
"task06/08": 10000,
|
| 6809 |
"task06/09": 15000,
|
| 6810 |
"task06/10": 15000,
|