refactor: update JSONL files for e1 launch readiness and h1 acquisition defense scenarios
Browse filesModified JSONL files for e1 launch readiness and h1 acquisition defense to ensure consistency and accuracy in task definitions and action trajectories. Updated agent reports and reasoning logs to reflect the latest evaluation metrics and decision-making processes. Enhanced the structure of the data to improve clarity and facilitate better integration into the verification framework.
- data/processed/e1_m1_clean.jsonl +0 -0
- data/processed/h1_seed_clean.jsonl +0 -0
- data/processed/verified/e1_m1_all_records.jsonl +0 -0
- data/processed/verified/e1_m1_clean.jsonl +0 -0
- data/processed/verified/h1_seed_all_records.jsonl +0 -0
- data/processed/verified/h1_seed_clean.jsonl +0 -0
- data/raw/e1_m1_examples.jsonl +0 -0
- data/raw/imported/e1_m1_examples.jsonl +0 -0
- data/sft/e1_m1_h1_examples.jsonl +0 -0
- data/sft/merged/e1_m1_h1_examples.jsonl +0 -0
- results/data_pipeline/e1_m1_summary.json +1 -1
- results/model_compare_qwen25_fresh_all3_ep5/comparison_summary.csv +10 -0
- results/model_compare_qwen25_fresh_all3_ep5/comparison_summary.md +15 -0
- results/model_compare_qwen25_fresh_all3_ep5/invalid_action_rate.png +3 -0
- results/model_compare_qwen25_fresh_all3_ep5/model_comparison.png +3 -0
- results/model_compare_qwen25_fresh_all3_ep5/reward_curve.png +3 -0
- results/model_compare_qwen25_fresh_all3_ep5/success_by_task.png +3 -0
- results/model_compare_qwen25_fresh_no_grpo_ep5rlvr/comparison_summary.csv +10 -0
- results/model_compare_qwen25_fresh_no_grpo_ep5rlvr/comparison_summary.md +15 -0
- results/model_compare_qwen25_fresh_no_grpo_ep5rlvr/invalid_action_rate.png +3 -0
- results/model_compare_qwen25_fresh_no_grpo_ep5rlvr/model_comparison.png +3 -0
- results/model_compare_qwen25_fresh_no_grpo_ep5rlvr/reward_curve.png +3 -0
- results/model_compare_qwen25_fresh_no_grpo_ep5rlvr/success_by_task.png +3 -0
- results/model_compare_qwen25_fresh_rlvr/comparison_summary.csv +13 -0
- results/model_compare_qwen25_fresh_rlvr/comparison_summary.md +18 -0
- results/model_compare_qwen25_fresh_rlvr/invalid_action_rate.png +3 -0
- results/model_compare_qwen25_fresh_rlvr/model_comparison.png +3 -0
- results/model_compare_qwen25_fresh_rlvr/reward_curve.png +3 -0
- results/model_compare_qwen25_fresh_rlvr/success_by_task.png +3 -0
- results/runs/qwen25_7b_fresh__base/base-qwen2.5-7b-fresh_eval.jsonl +9 -0
- results/runs/qwen25_7b_fresh__base/metadata.json +32 -0
- results/runs/qwen25_7b_fresh__base_ep5/base-qwen2.5-7b-fresh-ep5_eval.jsonl +15 -0
- results/runs/qwen25_7b_fresh__base_ep5/metadata.json +32 -0
- results/runs/qwen25_7b_fresh__rlvr/metadata.json +32 -0
- results/runs/qwen25_7b_fresh__rlvr/rlvr-qwen2.5-7b-fresh_eval.jsonl +9 -0
- results/runs/qwen25_7b_fresh__rlvr_ep5/metadata.json +32 -0
- results/runs/qwen25_7b_fresh__rlvr_ep5/rlvr-qwen2.5-7b-fresh-ep5_eval.jsonl +15 -0
- results/runs/qwen25_7b_fresh__sft/metadata.json +32 -0
- results/runs/qwen25_7b_fresh__sft/sft-qwen2.5-7b-fresh_eval.jsonl +9 -0
- results/runs/qwen25_7b_fresh__sft_ep5/metadata.json +32 -0
- results/runs/qwen25_7b_fresh__sft_ep5/sft-qwen2.5-7b-fresh-ep5_eval.jsonl +15 -0
- results/runs/qwen3_14b__base/base_qwen3_14b_eval.jsonl +9 -0
- results/runs/qwen3_14b__base/metadata.json +32 -0
- results/runs/rlvr_qwen2.5_7b_fresh_stats.jsonl +3 -0
data/processed/e1_m1_clean.jsonl
CHANGED
|
The diff for this file is too large to render.
See raw diff
|
|
|
data/processed/h1_seed_clean.jsonl
CHANGED
|
The diff for this file is too large to render.
See raw diff
|
|
|
data/processed/verified/e1_m1_all_records.jsonl
CHANGED
|
The diff for this file is too large to render.
See raw diff
|
|
|
data/processed/verified/e1_m1_clean.jsonl
CHANGED
|
The diff for this file is too large to render.
See raw diff
|
|
|
data/processed/verified/h1_seed_all_records.jsonl
CHANGED
|
The diff for this file is too large to render.
See raw diff
|
|
|
data/processed/verified/h1_seed_clean.jsonl
CHANGED
|
The diff for this file is too large to render.
See raw diff
|
|
|
data/raw/e1_m1_examples.jsonl
CHANGED
|
The diff for this file is too large to render.
See raw diff
|
|
|
data/raw/imported/e1_m1_examples.jsonl
CHANGED
|
The diff for this file is too large to render.
See raw diff
|
|
|
data/sft/e1_m1_h1_examples.jsonl
CHANGED
|
The diff for this file is too large to render.
See raw diff
|
|
|
data/sft/merged/e1_m1_h1_examples.jsonl
CHANGED
|
The diff for this file is too large to render.
See raw diff
|
|
|
results/data_pipeline/e1_m1_summary.json
CHANGED
|
@@ -14,7 +14,7 @@
|
|
| 14 |
"clean": 100
|
| 15 |
}
|
| 16 |
},
|
| 17 |
-
"clean_avg_terminal_reward": 0.
|
| 18 |
"clean_avg_verifier_pass_rate": 1.0,
|
| 19 |
"clean_avg_reasoning_steps": 1.0,
|
| 20 |
"clean_phase_progression_ok_rate": 0.0
|
|
|
|
| 14 |
"clean": 100
|
| 15 |
}
|
| 16 |
},
|
| 17 |
+
"clean_avg_terminal_reward": 0.926667,
|
| 18 |
"clean_avg_verifier_pass_rate": 1.0,
|
| 19 |
"clean_avg_reasoning_steps": 1.0,
|
| 20 |
"clean_phase_progression_ok_rate": 0.0
|
results/model_compare_qwen25_fresh_all3_ep5/comparison_summary.csv
ADDED
|
@@ -0,0 +1,10 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
model_stage,task_id,episodes,avg_terminal_reward,avg_total_reward,avg_verifier_pass_rate,success_rate,avg_invalid_action_rate,avg_steps
|
| 2 |
+
base-qwen2.5-7b-fresh-ep5,e1_launch_readiness,5,0.91,1.542,1.0,1.0,0.0,3.8
|
| 3 |
+
base-qwen2.5-7b-fresh-ep5,h1_acquisition_defence,5,0.761333,2.333333,0.666667,0.0,0.0,7.8
|
| 4 |
+
base-qwen2.5-7b-fresh-ep5,m1_budget_reallocation,5,0.706667,1.702667,0.533333,0.0,0.0,5.4
|
| 5 |
+
sft-qwen2.5-7b-fresh-ep5,e1_launch_readiness,5,0.91,1.58,1.0,1.0,0.0,4.0
|
| 6 |
+
sft-qwen2.5-7b-fresh-ep5,h1_acquisition_defence,5,0.8825,3.2345,0.75,0.0,0.0,11.8
|
| 7 |
+
sft-qwen2.5-7b-fresh-ep5,m1_budget_reallocation,5,0.943333,2.093333,1.0,1.0,0.0,6.0
|
| 8 |
+
rlvr-qwen2.5-7b-fresh-ep5,e1_launch_readiness,5,0.91,1.58,1.0,1.0,0.0,4.0
|
| 9 |
+
rlvr-qwen2.5-7b-fresh-ep5,h1_acquisition_defence,5,0.779167,3.455167,0.683333,0.0,0.013333,13.4
|
| 10 |
+
rlvr-qwen2.5-7b-fresh-ep5,m1_budget_reallocation,5,0.931666,2.079666,0.966667,0.8,0.028571,6.2
|
results/model_compare_qwen25_fresh_all3_ep5/comparison_summary.md
ADDED
|
@@ -0,0 +1,15 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
# CORP-ENV Result Comparison
|
| 2 |
+
|
| 3 |
+
| Model Stage | Task | Episodes | Terminal Reward | Verifier Pass | Success | Invalid Rate | Avg Steps |
|
| 4 |
+
| --- | --- | --- | --- | --- | --- | --- | --- |
|
| 5 |
+
| base-qwen2.5-7b-fresh-ep5 | E1 Launch | 5 | 0.910 | 1.000 | 1.000 | 0.000 | 3.8 |
|
| 6 |
+
| base-qwen2.5-7b-fresh-ep5 | H1 Acquisition | 5 | 0.761 | 0.667 | 0.000 | 0.000 | 7.8 |
|
| 7 |
+
| base-qwen2.5-7b-fresh-ep5 | M1 Budget | 5 | 0.707 | 0.533 | 0.000 | 0.000 | 5.4 |
|
| 8 |
+
| sft-qwen2.5-7b-fresh-ep5 | E1 Launch | 5 | 0.910 | 1.000 | 1.000 | 0.000 | 4.0 |
|
| 9 |
+
| sft-qwen2.5-7b-fresh-ep5 | H1 Acquisition | 5 | 0.882 | 0.750 | 0.000 | 0.000 | 11.8 |
|
| 10 |
+
| sft-qwen2.5-7b-fresh-ep5 | M1 Budget | 5 | 0.943 | 1.000 | 1.000 | 0.000 | 6.0 |
|
| 11 |
+
| rlvr-qwen2.5-7b-fresh-ep5 | E1 Launch | 5 | 0.910 | 1.000 | 1.000 | 0.000 | 4.0 |
|
| 12 |
+
| rlvr-qwen2.5-7b-fresh-ep5 | H1 Acquisition | 5 | 0.779 | 0.683 | 0.000 | 0.013 | 13.4 |
|
| 13 |
+
| rlvr-qwen2.5-7b-fresh-ep5 | M1 Budget | 5 | 0.932 | 0.967 | 0.800 | 0.029 | 6.2 |
|
| 14 |
+
|
| 15 |
+
Generated by `plot_results.py` from eval JSONL files.
|
results/model_compare_qwen25_fresh_all3_ep5/invalid_action_rate.png
ADDED
|
Git LFS Details
|
results/model_compare_qwen25_fresh_all3_ep5/model_comparison.png
ADDED
|
Git LFS Details
|
results/model_compare_qwen25_fresh_all3_ep5/reward_curve.png
ADDED
|
Git LFS Details
|
results/model_compare_qwen25_fresh_all3_ep5/success_by_task.png
ADDED
|
Git LFS Details
|
results/model_compare_qwen25_fresh_no_grpo_ep5rlvr/comparison_summary.csv
ADDED
|
@@ -0,0 +1,10 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
model_stage,task_id,episodes,avg_terminal_reward,avg_total_reward,avg_verifier_pass_rate,success_rate,avg_invalid_action_rate,avg_steps
|
| 2 |
+
base-qwen2.5-7b-fresh,e1_launch_readiness,3,0.91,1.58,1.0,1.0,0.0,4.0
|
| 3 |
+
base-qwen2.5-7b-fresh,h1_acquisition_defence,3,0.809722,2.823056,0.694444,0.0,0.0,9.667
|
| 4 |
+
base-qwen2.5-7b-fresh,m1_budget_reallocation,3,0.765,1.788334,0.611111,0.0,0.0,5.333
|
| 5 |
+
sft-qwen2.5-7b-fresh,e1_launch_readiness,3,0.91,1.58,1.0,1.0,0.0,4.0
|
| 6 |
+
sft-qwen2.5-7b-fresh,h1_acquisition_defence,3,0.889167,3.405833,0.75,0.0,0.0,12.667
|
| 7 |
+
sft-qwen2.5-7b-fresh,m1_budget_reallocation,3,0.943333,2.093333,1.0,1.0,0.0,6.0
|
| 8 |
+
rlvr-qwen2.5-7b-fresh-ep5,e1_launch_readiness,5,0.91,1.58,1.0,1.0,0.0,4.0
|
| 9 |
+
rlvr-qwen2.5-7b-fresh-ep5,h1_acquisition_defence,5,0.779167,3.455167,0.683333,0.0,0.013333,13.4
|
| 10 |
+
rlvr-qwen2.5-7b-fresh-ep5,m1_budget_reallocation,5,0.931666,2.079666,0.966667,0.8,0.028571,6.2
|
results/model_compare_qwen25_fresh_no_grpo_ep5rlvr/comparison_summary.md
ADDED
|
@@ -0,0 +1,15 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
# CORP-ENV Result Comparison
|
| 2 |
+
|
| 3 |
+
| Model Stage | Task | Episodes | Terminal Reward | Verifier Pass | Success | Invalid Rate | Avg Steps |
|
| 4 |
+
| --- | --- | --- | --- | --- | --- | --- | --- |
|
| 5 |
+
| base-qwen2.5-7b-fresh | E1 Launch | 3 | 0.910 | 1.000 | 1.000 | 0.000 | 4.0 |
|
| 6 |
+
| base-qwen2.5-7b-fresh | H1 Acquisition | 3 | 0.810 | 0.694 | 0.000 | 0.000 | 9.7 |
|
| 7 |
+
| base-qwen2.5-7b-fresh | M1 Budget | 3 | 0.765 | 0.611 | 0.000 | 0.000 | 5.3 |
|
| 8 |
+
| sft-qwen2.5-7b-fresh | E1 Launch | 3 | 0.910 | 1.000 | 1.000 | 0.000 | 4.0 |
|
| 9 |
+
| sft-qwen2.5-7b-fresh | H1 Acquisition | 3 | 0.889 | 0.750 | 0.000 | 0.000 | 12.7 |
|
| 10 |
+
| sft-qwen2.5-7b-fresh | M1 Budget | 3 | 0.943 | 1.000 | 1.000 | 0.000 | 6.0 |
|
| 11 |
+
| rlvr-qwen2.5-7b-fresh-ep5 | E1 Launch | 5 | 0.910 | 1.000 | 1.000 | 0.000 | 4.0 |
|
| 12 |
+
| rlvr-qwen2.5-7b-fresh-ep5 | H1 Acquisition | 5 | 0.779 | 0.683 | 0.000 | 0.013 | 13.4 |
|
| 13 |
+
| rlvr-qwen2.5-7b-fresh-ep5 | M1 Budget | 5 | 0.932 | 0.967 | 0.800 | 0.029 | 6.2 |
|
| 14 |
+
|
| 15 |
+
Generated by `plot_results.py` from eval JSONL files.
|
results/model_compare_qwen25_fresh_no_grpo_ep5rlvr/invalid_action_rate.png
ADDED
|
Git LFS Details
|
results/model_compare_qwen25_fresh_no_grpo_ep5rlvr/model_comparison.png
ADDED
|
Git LFS Details
|
results/model_compare_qwen25_fresh_no_grpo_ep5rlvr/reward_curve.png
ADDED
|
Git LFS Details
|
results/model_compare_qwen25_fresh_no_grpo_ep5rlvr/success_by_task.png
ADDED
|
Git LFS Details
|
results/model_compare_qwen25_fresh_rlvr/comparison_summary.csv
ADDED
|
@@ -0,0 +1,13 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
model_stage,task_id,episodes,avg_terminal_reward,avg_total_reward,avg_verifier_pass_rate,success_rate,avg_invalid_action_rate,avg_steps
|
| 2 |
+
base-qwen2.5-7b,e1_launch_readiness,1,0.91,1.39,1.0,1.0,0.0,3.0
|
| 3 |
+
base-qwen2.5-7b,h1_acquisition_defence,1,0.753333,2.283333,0.666667,0.0,0.0,8.0
|
| 4 |
+
base-qwen2.5-7b,m1_budget_reallocation,1,0.806667,2.056667,0.666667,0.0,0.0,6.0
|
| 5 |
+
sft-qwen2.5-7b,e1_launch_readiness,1,0.91,1.58,1.0,1.0,0.0,4.0
|
| 6 |
+
sft-qwen2.5-7b,h1_acquisition_defence,1,0.515,2.915,0.5,0.0,0.0,15.0
|
| 7 |
+
sft-qwen2.5-7b,m1_budget_reallocation,1,0.943333,2.093333,1.0,1.0,0.0,6.0
|
| 8 |
+
grpo-qwen2.5-7b,e1_launch_readiness,1,0.91,1.58,1.0,1.0,0.0,4.0
|
| 9 |
+
grpo-qwen2.5-7b,h1_acquisition_defence,1,-0.01,1.54,0.416667,0.0,0.783333,60.0
|
| 10 |
+
grpo-qwen2.5-7b,m1_budget_reallocation,1,0.548333,1.508333,0.5,0.0,0.0,5.0
|
| 11 |
+
rlvr-qwen2.5-7b-fresh,e1_launch_readiness,3,0.91,1.453333,1.0,1.0,0.0,3.333
|
| 12 |
+
rlvr-qwen2.5-7b-fresh,h1_acquisition_defence,3,0.786667,3.176667,0.666667,0.0,0.0,12.0
|
| 13 |
+
rlvr-qwen2.5-7b-fresh,m1_budget_reallocation,3,0.904444,2.054444,0.888889,0.333333,0.0,6.0
|
results/model_compare_qwen25_fresh_rlvr/comparison_summary.md
ADDED
|
@@ -0,0 +1,18 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
# CORP-ENV Result Comparison
|
| 2 |
+
|
| 3 |
+
| Model Stage | Task | Episodes | Terminal Reward | Verifier Pass | Success | Invalid Rate | Avg Steps |
|
| 4 |
+
| --- | --- | --- | --- | --- | --- | --- | --- |
|
| 5 |
+
| base-qwen2.5-7b | E1 Launch | 1 | 0.910 | 1.000 | 1.000 | 0.000 | 3.0 |
|
| 6 |
+
| base-qwen2.5-7b | H1 Acquisition | 1 | 0.753 | 0.667 | 0.000 | 0.000 | 8.0 |
|
| 7 |
+
| base-qwen2.5-7b | M1 Budget | 1 | 0.807 | 0.667 | 0.000 | 0.000 | 6.0 |
|
| 8 |
+
| sft-qwen2.5-7b | E1 Launch | 1 | 0.910 | 1.000 | 1.000 | 0.000 | 4.0 |
|
| 9 |
+
| sft-qwen2.5-7b | H1 Acquisition | 1 | 0.515 | 0.500 | 0.000 | 0.000 | 15.0 |
|
| 10 |
+
| sft-qwen2.5-7b | M1 Budget | 1 | 0.943 | 1.000 | 1.000 | 0.000 | 6.0 |
|
| 11 |
+
| grpo-qwen2.5-7b | E1 Launch | 1 | 0.910 | 1.000 | 1.000 | 0.000 | 4.0 |
|
| 12 |
+
| grpo-qwen2.5-7b | H1 Acquisition | 1 | -0.010 | 0.417 | 0.000 | 0.783 | 60.0 |
|
| 13 |
+
| grpo-qwen2.5-7b | M1 Budget | 1 | 0.548 | 0.500 | 0.000 | 0.000 | 5.0 |
|
| 14 |
+
| rlvr-qwen2.5-7b-fresh | E1 Launch | 3 | 0.910 | 1.000 | 1.000 | 0.000 | 3.3 |
|
| 15 |
+
| rlvr-qwen2.5-7b-fresh | H1 Acquisition | 3 | 0.787 | 0.667 | 0.000 | 0.000 | 12.0 |
|
| 16 |
+
| rlvr-qwen2.5-7b-fresh | M1 Budget | 3 | 0.904 | 0.889 | 0.333 | 0.000 | 6.0 |
|
| 17 |
+
|
| 18 |
+
Generated by `plot_results.py` from eval JSONL files.
|
results/model_compare_qwen25_fresh_rlvr/invalid_action_rate.png
ADDED
|
Git LFS Details
|
results/model_compare_qwen25_fresh_rlvr/model_comparison.png
ADDED
|
Git LFS Details
|
results/model_compare_qwen25_fresh_rlvr/reward_curve.png
ADDED
|
Git LFS Details
|
results/model_compare_qwen25_fresh_rlvr/success_by_task.png
ADDED
|
Git LFS Details
|
results/runs/qwen25_7b_fresh__base/base-qwen2.5-7b-fresh_eval.jsonl
ADDED
|
@@ -0,0 +1,9 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
{"task_id": "e1_launch_readiness", "policy_kind": "model", "steps": 4, "total_reward": 1.58, "terminal_reward": 0.91, "reward_trace": [0.29000000000000004, 0.19, 0.19, 0.9099999999999999], "verifier_pass_rate": 1.0, "passed_checks": ["qa_report_present", "final_rec_valid", "no_missed_milestones"], "failed_checks": [], "milestones_total": 2, "milestones_complete": 2, "milestones_missed": 0, "invalid_action_count": 0, "env_error_count": 0, "errors": [], "final_swd_version": 5, "success": true, "episode_index": 0, "model_stage": "base-qwen2.5-7b-fresh", "policy": "hf", "model": "Qwen/Qwen2.5-7B-Instruct", "adapter": ""}
|
| 2 |
+
{"task_id": "m1_budget_reallocation", "policy_kind": "model", "steps": 6, "total_reward": 2.056667, "terminal_reward": 0.806667, "reward_trace": [0.09000000000000001, 0.29000000000000004, 0.19, 0.39, 0.29000000000000004, 0.8066666666666666], "verifier_pass_rate": 0.666667, "passed_checks": ["required_agents_consulted", "conflict_logged", "conflict_resolved", "phased_plan"], "failed_checks": ["budget_constraint_acknowledged", "reasoning_documented"], "milestones_total": 3, "milestones_complete": 3, "milestones_missed": 0, "invalid_action_count": 0, "env_error_count": 0, "errors": [], "final_swd_version": 7, "success": false, "episode_index": 0, "model_stage": "base-qwen2.5-7b-fresh", "policy": "hf", "model": "Qwen/Qwen2.5-7B-Instruct", "adapter": ""}
|
| 3 |
+
{"task_id": "h1_acquisition_defence", "policy_kind": "model", "steps": 9, "total_reward": 2.7425, "terminal_reward": 0.8225, "reward_trace": [0.09000000000000001, 0.09000000000000001, 0.29000000000000004, 0.19, 0.39, 0.39, 0.19, 0.29000000000000004, 0.8225], "verifier_pass_rate": 0.75, "passed_checks": ["all_agents_consulted", "multi_conflict_logged", "conflict_explicitly_resolved", "resolution_has_type", "counter_offer_present", "deadline_present", "retention_addressed", "no_single_agent_copied", "swd_version_rich"], "failed_checks": ["rich_reasoning_log", "timeline_constraint_acknowledged", "all_phases_reached"], "milestones_total": 5, "milestones_complete": 4, "milestones_missed": 0, "invalid_action_count": 0, "env_error_count": 0, "errors": [], "final_swd_version": 10, "success": false, "episode_index": 0, "model_stage": "base-qwen2.5-7b-fresh", "policy": "hf", "model": "Qwen/Qwen2.5-7B-Instruct", "adapter": ""}
|
| 4 |
+
{"task_id": "e1_launch_readiness", "policy_kind": "model", "steps": 4, "total_reward": 1.58, "terminal_reward": 0.91, "reward_trace": [0.29000000000000004, 0.19, 0.19, 0.9099999999999999], "verifier_pass_rate": 1.0, "passed_checks": ["qa_report_present", "final_rec_valid", "no_missed_milestones"], "failed_checks": [], "milestones_total": 2, "milestones_complete": 2, "milestones_missed": 0, "invalid_action_count": 0, "env_error_count": 0, "errors": [], "final_swd_version": 5, "success": true, "episode_index": 1, "model_stage": "base-qwen2.5-7b-fresh", "policy": "hf", "model": "Qwen/Qwen2.5-7B-Instruct", "adapter": ""}
|
| 5 |
+
{"task_id": "m1_budget_reallocation", "policy_kind": "model", "steps": 5, "total_reward": 1.766667, "terminal_reward": 0.806667, "reward_trace": [0.09000000000000001, 0.29000000000000004, 0.19, 0.39, 0.8066666666666666], "verifier_pass_rate": 0.666667, "passed_checks": ["required_agents_consulted", "conflict_logged", "conflict_resolved", "phased_plan"], "failed_checks": ["budget_constraint_acknowledged", "reasoning_documented"], "milestones_total": 3, "milestones_complete": 3, "milestones_missed": 0, "invalid_action_count": 0, "env_error_count": 0, "errors": [], "final_swd_version": 6, "success": false, "episode_index": 1, "model_stage": "base-qwen2.5-7b-fresh", "policy": "hf", "model": "Qwen/Qwen2.5-7B-Instruct", "adapter": ""}
|
| 6 |
+
{"task_id": "h1_acquisition_defence", "policy_kind": "model", "steps": 11, "total_reward": 2.964167, "terminal_reward": 0.764167, "reward_trace": [0.09000000000000001, 0.09000000000000001, 0.29000000000000004, 0.19, 0.39, 0.29000000000000004, 0.19, 0.19, 0.19, 0.29000000000000004, 0.7641666666666667], "verifier_pass_rate": 0.583333, "passed_checks": ["all_agents_consulted", "multi_conflict_logged", "counter_offer_present", "deadline_present", "retention_addressed", "no_single_agent_copied", "swd_version_rich"], "failed_checks": ["conflict_explicitly_resolved", "resolution_has_type", "rich_reasoning_log", "timeline_constraint_acknowledged", "all_phases_reached"], "milestones_total": 5, "milestones_complete": 3, "milestones_missed": 0, "invalid_action_count": 0, "env_error_count": 0, "errors": [], "final_swd_version": 12, "success": false, "episode_index": 1, "model_stage": "base-qwen2.5-7b-fresh", "policy": "hf", "model": "Qwen/Qwen2.5-7B-Instruct", "adapter": ""}
|
| 7 |
+
{"task_id": "e1_launch_readiness", "policy_kind": "model", "steps": 4, "total_reward": 1.58, "terminal_reward": 0.91, "reward_trace": [0.29000000000000004, 0.19, 0.19, 0.9099999999999999], "verifier_pass_rate": 1.0, "passed_checks": ["qa_report_present", "final_rec_valid", "no_missed_milestones"], "failed_checks": [], "milestones_total": 2, "milestones_complete": 2, "milestones_missed": 0, "invalid_action_count": 0, "env_error_count": 0, "errors": [], "final_swd_version": 5, "success": true, "episode_index": 2, "model_stage": "base-qwen2.5-7b-fresh", "policy": "hf", "model": "Qwen/Qwen2.5-7B-Instruct", "adapter": ""}
|
| 8 |
+
{"task_id": "m1_budget_reallocation", "policy_kind": "model", "steps": 5, "total_reward": 1.541667, "terminal_reward": 0.681667, "reward_trace": [0.09000000000000001, 0.29000000000000004, 0.19, 0.29000000000000004, 0.6816666666666666], "verifier_pass_rate": 0.5, "passed_checks": ["required_agents_consulted", "conflict_logged", "phased_plan"], "failed_checks": ["conflict_resolved", "budget_constraint_acknowledged", "reasoning_documented"], "milestones_total": 3, "milestones_complete": 2, "milestones_missed": 0, "invalid_action_count": 0, "env_error_count": 0, "errors": [], "final_swd_version": 6, "success": false, "episode_index": 2, "model_stage": "base-qwen2.5-7b-fresh", "policy": "hf", "model": "Qwen/Qwen2.5-7B-Instruct", "adapter": ""}
|
| 9 |
+
{"task_id": "h1_acquisition_defence", "policy_kind": "model", "steps": 9, "total_reward": 2.7625, "terminal_reward": 0.8425, "reward_trace": [0.09000000000000001, 0.09000000000000001, 0.29000000000000004, 0.19, 0.39, 0.29000000000000004, 0.19, 0.39, 0.8425], "verifier_pass_rate": 0.75, "passed_checks": ["all_agents_consulted", "multi_conflict_logged", "conflict_explicitly_resolved", "resolution_has_type", "counter_offer_present", "deadline_present", "retention_addressed", "no_single_agent_copied", "swd_version_rich"], "failed_checks": ["rich_reasoning_log", "timeline_constraint_acknowledged", "all_phases_reached"], "milestones_total": 5, "milestones_complete": 4, "milestones_missed": 0, "invalid_action_count": 0, "env_error_count": 0, "errors": [], "final_swd_version": 10, "success": false, "episode_index": 2, "model_stage": "base-qwen2.5-7b-fresh", "policy": "hf", "model": "Qwen/Qwen2.5-7B-Instruct", "adapter": ""}
|
results/runs/qwen25_7b_fresh__base/metadata.json
ADDED
|
@@ -0,0 +1,32 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
{
|
| 2 |
+
"model_stage": "base-qwen2.5-7b-fresh",
|
| 3 |
+
"policy": "hf",
|
| 4 |
+
"model": "Qwen/Qwen2.5-7B-Instruct",
|
| 5 |
+
"adapter": "",
|
| 6 |
+
"tasks": [
|
| 7 |
+
"e1_launch_readiness",
|
| 8 |
+
"m1_budget_reallocation",
|
| 9 |
+
"h1_acquisition_defence"
|
| 10 |
+
],
|
| 11 |
+
"episodes": 3,
|
| 12 |
+
"max_steps": 30,
|
| 13 |
+
"max_new_tokens": 1536,
|
| 14 |
+
"eval_file": "results/runs/qwen25_7b_fresh__base/base-qwen2.5-7b-fresh_eval.jsonl",
|
| 15 |
+
"metrics_by_task": {
|
| 16 |
+
"e1_launch_readiness": {
|
| 17 |
+
"avg_terminal_reward": 0.91,
|
| 18 |
+
"avg_verifier_pass_rate": 1.0,
|
| 19 |
+
"success_rate": 1.0
|
| 20 |
+
},
|
| 21 |
+
"m1_budget_reallocation": {
|
| 22 |
+
"avg_terminal_reward": 0.765,
|
| 23 |
+
"avg_verifier_pass_rate": 0.611111,
|
| 24 |
+
"success_rate": 0.0
|
| 25 |
+
},
|
| 26 |
+
"h1_acquisition_defence": {
|
| 27 |
+
"avg_terminal_reward": 0.809722,
|
| 28 |
+
"avg_verifier_pass_rate": 0.694444,
|
| 29 |
+
"success_rate": 0.0
|
| 30 |
+
}
|
| 31 |
+
}
|
| 32 |
+
}
|
results/runs/qwen25_7b_fresh__base_ep5/base-qwen2.5-7b-fresh-ep5_eval.jsonl
ADDED
|
@@ -0,0 +1,15 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
{"task_id": "e1_launch_readiness", "policy_kind": "model", "steps": 4, "total_reward": 1.58, "terminal_reward": 0.91, "reward_trace": [0.29000000000000004, 0.19, 0.19, 0.9099999999999999], "verifier_pass_rate": 1.0, "passed_checks": ["qa_report_present", "final_rec_valid", "no_missed_milestones"], "failed_checks": [], "milestones_total": 2, "milestones_complete": 2, "milestones_missed": 0, "invalid_action_count": 0, "env_error_count": 0, "errors": [], "final_swd_version": 5, "success": true, "episode_index": 0, "model_stage": "base-qwen2.5-7b-fresh-ep5", "policy": "hf", "model": "Qwen/Qwen2.5-7B-Instruct", "adapter": ""}
|
| 2 |
+
{"task_id": "m1_budget_reallocation", "policy_kind": "model", "steps": 5, "total_reward": 1.541667, "terminal_reward": 0.681667, "reward_trace": [0.09000000000000001, 0.29000000000000004, 0.19, 0.29000000000000004, 0.6816666666666666], "verifier_pass_rate": 0.5, "passed_checks": ["required_agents_consulted", "conflict_logged", "phased_plan"], "failed_checks": ["conflict_resolved", "budget_constraint_acknowledged", "reasoning_documented"], "milestones_total": 3, "milestones_complete": 2, "milestones_missed": 0, "invalid_action_count": 0, "env_error_count": 0, "errors": [], "final_swd_version": 6, "success": false, "episode_index": 0, "model_stage": "base-qwen2.5-7b-fresh-ep5", "policy": "hf", "model": "Qwen/Qwen2.5-7B-Instruct", "adapter": ""}
|
| 3 |
+
{"task_id": "h1_acquisition_defence", "policy_kind": "model", "steps": 8, "total_reward": 2.214167, "terminal_reward": 0.684167, "reward_trace": [0.09000000000000001, 0.09000000000000001, 0.29000000000000004, 0.19, 0.29000000000000004, 0.29000000000000004, 0.29000000000000004, 0.6841666666666666], "verifier_pass_rate": 0.583333, "passed_checks": ["all_agents_consulted", "counter_offer_present", "deadline_present", "retention_addressed", "no_single_agent_copied", "all_phases_reached", "swd_version_rich"], "failed_checks": ["multi_conflict_logged", "conflict_explicitly_resolved", "resolution_has_type", "rich_reasoning_log", "timeline_constraint_acknowledged"], "milestones_total": 5, "milestones_complete": 2, "milestones_missed": 0, "invalid_action_count": 0, "env_error_count": 0, "errors": [], "final_swd_version": 9, "success": false, "episode_index": 0, "model_stage": "base-qwen2.5-7b-fresh-ep5", "policy": "hf", "model": "Qwen/Qwen2.5-7B-Instruct", "adapter": ""}
|
| 4 |
+
{"task_id": "e1_launch_readiness", "policy_kind": "model", "steps": 4, "total_reward": 1.58, "terminal_reward": 0.91, "reward_trace": [0.29000000000000004, 0.19, 0.19, 0.9099999999999999], "verifier_pass_rate": 1.0, "passed_checks": ["qa_report_present", "final_rec_valid", "no_missed_milestones"], "failed_checks": [], "milestones_total": 2, "milestones_complete": 2, "milestones_missed": 0, "invalid_action_count": 0, "env_error_count": 0, "errors": [], "final_swd_version": 5, "success": true, "episode_index": 1, "model_stage": "base-qwen2.5-7b-fresh-ep5", "policy": "hf", "model": "Qwen/Qwen2.5-7B-Instruct", "adapter": ""}
|
| 5 |
+
{"task_id": "m1_budget_reallocation", "policy_kind": "model", "steps": 6, "total_reward": 1.831667, "terminal_reward": 0.681667, "reward_trace": [0.09000000000000001, 0.29000000000000004, 0.19, 0.29000000000000004, 0.29000000000000004, 0.6816666666666666], "verifier_pass_rate": 0.5, "passed_checks": ["required_agents_consulted", "conflict_logged", "phased_plan"], "failed_checks": ["conflict_resolved", "budget_constraint_acknowledged", "reasoning_documented"], "milestones_total": 3, "milestones_complete": 2, "milestones_missed": 0, "invalid_action_count": 0, "env_error_count": 0, "errors": [], "final_swd_version": 7, "success": false, "episode_index": 1, "model_stage": "base-qwen2.5-7b-fresh-ep5", "policy": "hf", "model": "Qwen/Qwen2.5-7B-Instruct", "adapter": ""}
|
| 6 |
+
{"task_id": "h1_acquisition_defence", "policy_kind": "model", "steps": 7, "total_reward": 2.2625, "terminal_reward": 0.8225, "reward_trace": [0.09000000000000001, 0.09000000000000001, 0.29000000000000004, 0.19, 0.39, 0.39, 0.8225], "verifier_pass_rate": 0.75, "passed_checks": ["all_agents_consulted", "multi_conflict_logged", "conflict_explicitly_resolved", "resolution_has_type", "counter_offer_present", "deadline_present", "retention_addressed", "no_single_agent_copied", "swd_version_rich"], "failed_checks": ["rich_reasoning_log", "timeline_constraint_acknowledged", "all_phases_reached"], "milestones_total": 5, "milestones_complete": 4, "milestones_missed": 0, "invalid_action_count": 0, "env_error_count": 0, "errors": [], "final_swd_version": 8, "success": false, "episode_index": 1, "model_stage": "base-qwen2.5-7b-fresh-ep5", "policy": "hf", "model": "Qwen/Qwen2.5-7B-Instruct", "adapter": ""}
|
| 7 |
+
{"task_id": "e1_launch_readiness", "policy_kind": "model", "steps": 3, "total_reward": 1.39, "terminal_reward": 0.91, "reward_trace": [0.29000000000000004, 0.19, 0.9099999999999999], "verifier_pass_rate": 1.0, "passed_checks": ["qa_report_present", "final_rec_valid", "no_missed_milestones"], "failed_checks": [], "milestones_total": 2, "milestones_complete": 2, "milestones_missed": 0, "invalid_action_count": 0, "env_error_count": 0, "errors": [], "final_swd_version": 4, "success": true, "episode_index": 2, "model_stage": "base-qwen2.5-7b-fresh-ep5", "policy": "hf", "model": "Qwen/Qwen2.5-7B-Instruct", "adapter": ""}
|
| 8 |
+
{"task_id": "m1_budget_reallocation", "policy_kind": "model", "steps": 5, "total_reward": 1.541667, "terminal_reward": 0.681667, "reward_trace": [0.09000000000000001, 0.29000000000000004, 0.19, 0.29000000000000004, 0.6816666666666666], "verifier_pass_rate": 0.5, "passed_checks": ["required_agents_consulted", "conflict_logged", "phased_plan"], "failed_checks": ["conflict_resolved", "budget_constraint_acknowledged", "reasoning_documented"], "milestones_total": 3, "milestones_complete": 2, "milestones_missed": 0, "invalid_action_count": 0, "env_error_count": 0, "errors": [], "final_swd_version": 6, "success": false, "episode_index": 2, "model_stage": "base-qwen2.5-7b-fresh-ep5", "policy": "hf", "model": "Qwen/Qwen2.5-7B-Instruct", "adapter": ""}
|
| 9 |
+
{"task_id": "h1_acquisition_defence", "policy_kind": "model", "steps": 8, "total_reward": 2.5525, "terminal_reward": 0.8225, "reward_trace": [0.09000000000000001, 0.09000000000000001, 0.29000000000000004, 0.19, 0.39, 0.39, 0.29000000000000004, 0.8225], "verifier_pass_rate": 0.75, "passed_checks": ["all_agents_consulted", "multi_conflict_logged", "conflict_explicitly_resolved", "resolution_has_type", "counter_offer_present", "deadline_present", "retention_addressed", "no_single_agent_copied", "swd_version_rich"], "failed_checks": ["rich_reasoning_log", "timeline_constraint_acknowledged", "all_phases_reached"], "milestones_total": 5, "milestones_complete": 4, "milestones_missed": 0, "invalid_action_count": 0, "env_error_count": 0, "errors": [], "final_swd_version": 9, "success": false, "episode_index": 2, "model_stage": "base-qwen2.5-7b-fresh-ep5", "policy": "hf", "model": "Qwen/Qwen2.5-7B-Instruct", "adapter": ""}
|
| 10 |
+
{"task_id": "e1_launch_readiness", "policy_kind": "model", "steps": 4, "total_reward": 1.58, "terminal_reward": 0.91, "reward_trace": [0.29000000000000004, 0.19, 0.19, 0.9099999999999999], "verifier_pass_rate": 1.0, "passed_checks": ["qa_report_present", "final_rec_valid", "no_missed_milestones"], "failed_checks": [], "milestones_total": 2, "milestones_complete": 2, "milestones_missed": 0, "invalid_action_count": 0, "env_error_count": 0, "errors": [], "final_swd_version": 5, "success": true, "episode_index": 3, "model_stage": "base-qwen2.5-7b-fresh-ep5", "policy": "hf", "model": "Qwen/Qwen2.5-7B-Instruct", "adapter": ""}
|
| 11 |
+
{"task_id": "m1_budget_reallocation", "policy_kind": "model", "steps": 6, "total_reward": 2.056667, "terminal_reward": 0.806667, "reward_trace": [0.09000000000000001, 0.29000000000000004, 0.19, 0.39, 0.29000000000000004, 0.8066666666666666], "verifier_pass_rate": 0.666667, "passed_checks": ["required_agents_consulted", "conflict_logged", "conflict_resolved", "phased_plan"], "failed_checks": ["budget_constraint_acknowledged", "reasoning_documented"], "milestones_total": 3, "milestones_complete": 3, "milestones_missed": 0, "invalid_action_count": 0, "env_error_count": 0, "errors": [], "final_swd_version": 7, "success": false, "episode_index": 3, "model_stage": "base-qwen2.5-7b-fresh-ep5", "policy": "hf", "model": "Qwen/Qwen2.5-7B-Instruct", "adapter": ""}
|
| 12 |
+
{"task_id": "h1_acquisition_defence", "policy_kind": "model", "steps": 9, "total_reward": 2.7425, "terminal_reward": 0.8225, "reward_trace": [0.09000000000000001, 0.09000000000000001, 0.29000000000000004, 0.19, 0.39, 0.29000000000000004, 0.39, 0.19, 0.8225], "verifier_pass_rate": 0.75, "passed_checks": ["all_agents_consulted", "multi_conflict_logged", "conflict_explicitly_resolved", "resolution_has_type", "counter_offer_present", "deadline_present", "retention_addressed", "no_single_agent_copied", "swd_version_rich"], "failed_checks": ["rich_reasoning_log", "timeline_constraint_acknowledged", "all_phases_reached"], "milestones_total": 5, "milestones_complete": 4, "milestones_missed": 0, "invalid_action_count": 0, "env_error_count": 0, "errors": [], "final_swd_version": 10, "success": false, "episode_index": 3, "model_stage": "base-qwen2.5-7b-fresh-ep5", "policy": "hf", "model": "Qwen/Qwen2.5-7B-Instruct", "adapter": ""}
|
| 13 |
+
{"task_id": "e1_launch_readiness", "policy_kind": "model", "steps": 4, "total_reward": 1.58, "terminal_reward": 0.91, "reward_trace": [0.29000000000000004, 0.19, 0.19, 0.9099999999999999], "verifier_pass_rate": 1.0, "passed_checks": ["qa_report_present", "final_rec_valid", "no_missed_milestones"], "failed_checks": [], "milestones_total": 2, "milestones_complete": 2, "milestones_missed": 0, "invalid_action_count": 0, "env_error_count": 0, "errors": [], "final_swd_version": 5, "success": true, "episode_index": 4, "model_stage": "base-qwen2.5-7b-fresh-ep5", "policy": "hf", "model": "Qwen/Qwen2.5-7B-Instruct", "adapter": ""}
|
| 14 |
+
{"task_id": "m1_budget_reallocation", "policy_kind": "model", "steps": 5, "total_reward": 1.541667, "terminal_reward": 0.681667, "reward_trace": [0.09000000000000001, 0.29000000000000004, 0.19, 0.29000000000000004, 0.6816666666666666], "verifier_pass_rate": 0.5, "passed_checks": ["required_agents_consulted", "conflict_logged", "phased_plan"], "failed_checks": ["conflict_resolved", "budget_constraint_acknowledged", "reasoning_documented"], "milestones_total": 3, "milestones_complete": 2, "milestones_missed": 0, "invalid_action_count": 0, "env_error_count": 0, "errors": [], "final_swd_version": 6, "success": false, "episode_index": 4, "model_stage": "base-qwen2.5-7b-fresh-ep5", "policy": "hf", "model": "Qwen/Qwen2.5-7B-Instruct", "adapter": ""}
|
| 15 |
+
{"task_id": "h1_acquisition_defence", "policy_kind": "model", "steps": 7, "total_reward": 1.895, "terminal_reward": 0.655, "reward_trace": [0.09000000000000001, 0.09000000000000001, 0.29000000000000004, 0.19, 0.29000000000000004, 0.29000000000000004, 0.655], "verifier_pass_rate": 0.5, "passed_checks": ["all_agents_consulted", "counter_offer_present", "deadline_present", "retention_addressed", "no_single_agent_copied", "swd_version_rich"], "failed_checks": ["multi_conflict_logged", "conflict_explicitly_resolved", "resolution_has_type", "rich_reasoning_log", "timeline_constraint_acknowledged", "all_phases_reached"], "milestones_total": 5, "milestones_complete": 2, "milestones_missed": 0, "invalid_action_count": 0, "env_error_count": 0, "errors": [], "final_swd_version": 8, "success": false, "episode_index": 4, "model_stage": "base-qwen2.5-7b-fresh-ep5", "policy": "hf", "model": "Qwen/Qwen2.5-7B-Instruct", "adapter": ""}
|
results/runs/qwen25_7b_fresh__base_ep5/metadata.json
ADDED
|
@@ -0,0 +1,32 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
{
|
| 2 |
+
"model_stage": "base-qwen2.5-7b-fresh-ep5",
|
| 3 |
+
"policy": "hf",
|
| 4 |
+
"model": "Qwen/Qwen2.5-7B-Instruct",
|
| 5 |
+
"adapter": "",
|
| 6 |
+
"tasks": [
|
| 7 |
+
"e1_launch_readiness",
|
| 8 |
+
"m1_budget_reallocation",
|
| 9 |
+
"h1_acquisition_defence"
|
| 10 |
+
],
|
| 11 |
+
"episodes": 5,
|
| 12 |
+
"max_steps": 30,
|
| 13 |
+
"max_new_tokens": 1536,
|
| 14 |
+
"eval_file": "results/runs/qwen25_7b_fresh__base_ep5/base-qwen2.5-7b-fresh-ep5_eval.jsonl",
|
| 15 |
+
"metrics_by_task": {
|
| 16 |
+
"e1_launch_readiness": {
|
| 17 |
+
"avg_terminal_reward": 0.91,
|
| 18 |
+
"avg_verifier_pass_rate": 1.0,
|
| 19 |
+
"success_rate": 1.0
|
| 20 |
+
},
|
| 21 |
+
"m1_budget_reallocation": {
|
| 22 |
+
"avg_terminal_reward": 0.706667,
|
| 23 |
+
"avg_verifier_pass_rate": 0.533333,
|
| 24 |
+
"success_rate": 0.0
|
| 25 |
+
},
|
| 26 |
+
"h1_acquisition_defence": {
|
| 27 |
+
"avg_terminal_reward": 0.761333,
|
| 28 |
+
"avg_verifier_pass_rate": 0.666667,
|
| 29 |
+
"success_rate": 0.0
|
| 30 |
+
}
|
| 31 |
+
}
|
| 32 |
+
}
|
results/runs/qwen25_7b_fresh__rlvr/metadata.json
ADDED
|
@@ -0,0 +1,32 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
{
|
| 2 |
+
"model_stage": "rlvr-qwen2.5-7b-fresh",
|
| 3 |
+
"policy": "hf",
|
| 4 |
+
"model": "Qwen/Qwen2.5-7B-Instruct",
|
| 5 |
+
"adapter": "outputs/rlvr_Qwen2.5-7B-Instruct",
|
| 6 |
+
"tasks": [
|
| 7 |
+
"e1_launch_readiness",
|
| 8 |
+
"m1_budget_reallocation",
|
| 9 |
+
"h1_acquisition_defence"
|
| 10 |
+
],
|
| 11 |
+
"episodes": 3,
|
| 12 |
+
"max_steps": 30,
|
| 13 |
+
"max_new_tokens": 1536,
|
| 14 |
+
"eval_file": "results/runs/qwen25_7b_fresh__rlvr/rlvr-qwen2.5-7b-fresh_eval.jsonl",
|
| 15 |
+
"metrics_by_task": {
|
| 16 |
+
"e1_launch_readiness": {
|
| 17 |
+
"avg_terminal_reward": 0.91,
|
| 18 |
+
"avg_verifier_pass_rate": 1.0,
|
| 19 |
+
"success_rate": 1.0
|
| 20 |
+
},
|
| 21 |
+
"m1_budget_reallocation": {
|
| 22 |
+
"avg_terminal_reward": 0.904444,
|
| 23 |
+
"avg_verifier_pass_rate": 0.888889,
|
| 24 |
+
"success_rate": 0.333333
|
| 25 |
+
},
|
| 26 |
+
"h1_acquisition_defence": {
|
| 27 |
+
"avg_terminal_reward": 0.786667,
|
| 28 |
+
"avg_verifier_pass_rate": 0.666667,
|
| 29 |
+
"success_rate": 0.0
|
| 30 |
+
}
|
| 31 |
+
}
|
| 32 |
+
}
|
results/runs/qwen25_7b_fresh__rlvr/rlvr-qwen2.5-7b-fresh_eval.jsonl
ADDED
|
@@ -0,0 +1,9 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
{"task_id": "e1_launch_readiness", "policy_kind": "model", "steps": 3, "total_reward": 1.39, "terminal_reward": 0.91, "reward_trace": [0.29000000000000004, 0.19, 0.9099999999999999], "verifier_pass_rate": 1.0, "passed_checks": ["qa_report_present", "final_rec_valid", "no_missed_milestones"], "failed_checks": [], "milestones_total": 2, "milestones_complete": 2, "milestones_missed": 0, "invalid_action_count": 0, "env_error_count": 0, "errors": [], "final_swd_version": 4, "success": true, "episode_index": 0, "model_stage": "rlvr-qwen2.5-7b-fresh", "policy": "hf", "model": "Qwen/Qwen2.5-7B-Instruct", "adapter": "outputs/rlvr_Qwen2.5-7B-Instruct"}
|
| 2 |
+
{"task_id": "m1_budget_reallocation", "policy_kind": "model", "steps": 6, "total_reward": 2.093333, "terminal_reward": 0.943333, "reward_trace": [0.09000000000000001, 0.29000000000000004, 0.19, 0.19, 0.39, 0.9433333333333334], "verifier_pass_rate": 1.0, "passed_checks": ["required_agents_consulted", "conflict_logged", "conflict_resolved", "phased_plan", "budget_constraint_acknowledged", "reasoning_documented"], "failed_checks": [], "milestones_total": 3, "milestones_complete": 3, "milestones_missed": 0, "invalid_action_count": 0, "env_error_count": 0, "errors": [], "final_swd_version": 7, "success": true, "episode_index": 0, "model_stage": "rlvr-qwen2.5-7b-fresh", "policy": "hf", "model": "Qwen/Qwen2.5-7B-Instruct", "adapter": "outputs/rlvr_Qwen2.5-7B-Instruct"}
|
| 3 |
+
{"task_id": "h1_acquisition_defence", "policy_kind": "model", "steps": 13, "total_reward": 3.175, "terminal_reward": 0.595, "reward_trace": [0.09000000000000001, 0.09000000000000001, 0.29000000000000004, 0.19, 0.19, 0.19, 0.39, 0.19, 0.19, 0.39, 0.19, 0.19, 0.595], "verifier_pass_rate": 0.5, "passed_checks": ["all_agents_consulted", "multi_conflict_logged", "conflict_explicitly_resolved", "resolution_has_type", "no_single_agent_copied", "swd_version_rich"], "failed_checks": ["rich_reasoning_log", "counter_offer_present", "deadline_present", "retention_addressed", "timeline_constraint_acknowledged", "all_phases_reached"], "milestones_total": 5, "milestones_complete": 3, "milestones_missed": 0, "invalid_action_count": 0, "env_error_count": 0, "errors": [], "final_swd_version": 14, "success": false, "episode_index": 0, "model_stage": "rlvr-qwen2.5-7b-fresh", "policy": "hf", "model": "Qwen/Qwen2.5-7B-Instruct", "adapter": "outputs/rlvr_Qwen2.5-7B-Instruct"}
|
| 4 |
+
{"task_id": "e1_launch_readiness", "policy_kind": "model", "steps": 4, "total_reward": 1.58, "terminal_reward": 0.91, "reward_trace": [0.29000000000000004, 0.19, 0.19, 0.9099999999999999], "verifier_pass_rate": 1.0, "passed_checks": ["qa_report_present", "final_rec_valid", "no_missed_milestones"], "failed_checks": [], "milestones_total": 2, "milestones_complete": 2, "milestones_missed": 0, "invalid_action_count": 0, "env_error_count": 0, "errors": [], "final_swd_version": 5, "success": true, "episode_index": 1, "model_stage": "rlvr-qwen2.5-7b-fresh", "policy": "hf", "model": "Qwen/Qwen2.5-7B-Instruct", "adapter": "outputs/rlvr_Qwen2.5-7B-Instruct"}
|
| 5 |
+
{"task_id": "m1_budget_reallocation", "policy_kind": "model", "steps": 6, "total_reward": 2.035, "terminal_reward": 0.885, "reward_trace": [0.09000000000000001, 0.29000000000000004, 0.19, 0.19, 0.39, 0.885], "verifier_pass_rate": 0.833333, "passed_checks": ["required_agents_consulted", "conflict_logged", "conflict_resolved", "phased_plan", "reasoning_documented"], "failed_checks": ["budget_constraint_acknowledged"], "milestones_total": 3, "milestones_complete": 3, "milestones_missed": 0, "invalid_action_count": 0, "env_error_count": 0, "errors": [], "final_swd_version": 7, "success": false, "episode_index": 1, "model_stage": "rlvr-qwen2.5-7b-fresh", "policy": "hf", "model": "Qwen/Qwen2.5-7B-Instruct", "adapter": "outputs/rlvr_Qwen2.5-7B-Instruct"}
|
| 6 |
+
{"task_id": "h1_acquisition_defence", "policy_kind": "model", "steps": 11, "total_reward": 3.0825, "terminal_reward": 0.8825, "reward_trace": [0.09000000000000001, 0.09000000000000001, 0.29000000000000004, 0.19, 0.19, 0.19, 0.39, 0.19, 0.19, 0.39, 0.8824999999999998], "verifier_pass_rate": 0.75, "passed_checks": ["all_agents_consulted", "multi_conflict_logged", "conflict_explicitly_resolved", "resolution_has_type", "counter_offer_present", "deadline_present", "retention_addressed", "no_single_agent_copied", "swd_version_rich"], "failed_checks": ["rich_reasoning_log", "timeline_constraint_acknowledged", "all_phases_reached"], "milestones_total": 5, "milestones_complete": 4, "milestones_missed": 0, "invalid_action_count": 0, "env_error_count": 0, "errors": [], "final_swd_version": 12, "success": false, "episode_index": 1, "model_stage": "rlvr-qwen2.5-7b-fresh", "policy": "hf", "model": "Qwen/Qwen2.5-7B-Instruct", "adapter": "outputs/rlvr_Qwen2.5-7B-Instruct"}
|
| 7 |
+
{"task_id": "e1_launch_readiness", "policy_kind": "model", "steps": 3, "total_reward": 1.39, "terminal_reward": 0.91, "reward_trace": [0.29000000000000004, 0.19, 0.9099999999999999], "verifier_pass_rate": 1.0, "passed_checks": ["qa_report_present", "final_rec_valid", "no_missed_milestones"], "failed_checks": [], "milestones_total": 2, "milestones_complete": 2, "milestones_missed": 0, "invalid_action_count": 0, "env_error_count": 0, "errors": [], "final_swd_version": 4, "success": true, "episode_index": 2, "model_stage": "rlvr-qwen2.5-7b-fresh", "policy": "hf", "model": "Qwen/Qwen2.5-7B-Instruct", "adapter": "outputs/rlvr_Qwen2.5-7B-Instruct"}
|
| 8 |
+
{"task_id": "m1_budget_reallocation", "policy_kind": "model", "steps": 6, "total_reward": 2.035, "terminal_reward": 0.885, "reward_trace": [0.09000000000000001, 0.29000000000000004, 0.19, 0.19, 0.39, 0.885], "verifier_pass_rate": 0.833333, "passed_checks": ["required_agents_consulted", "conflict_logged", "conflict_resolved", "phased_plan", "reasoning_documented"], "failed_checks": ["budget_constraint_acknowledged"], "milestones_total": 3, "milestones_complete": 3, "milestones_missed": 0, "invalid_action_count": 0, "env_error_count": 0, "errors": [], "final_swd_version": 7, "success": false, "episode_index": 2, "model_stage": "rlvr-qwen2.5-7b-fresh", "policy": "hf", "model": "Qwen/Qwen2.5-7B-Instruct", "adapter": "outputs/rlvr_Qwen2.5-7B-Instruct"}
|
| 9 |
+
{"task_id": "h1_acquisition_defence", "policy_kind": "model", "steps": 12, "total_reward": 3.2725, "terminal_reward": 0.8825, "reward_trace": [0.09000000000000001, 0.09000000000000001, 0.29000000000000004, 0.19, 0.19, 0.19, 0.19, 0.39, 0.39, 0.19, 0.19, 0.8824999999999998], "verifier_pass_rate": 0.75, "passed_checks": ["all_agents_consulted", "multi_conflict_logged", "conflict_explicitly_resolved", "resolution_has_type", "counter_offer_present", "deadline_present", "retention_addressed", "no_single_agent_copied", "swd_version_rich"], "failed_checks": ["rich_reasoning_log", "timeline_constraint_acknowledged", "all_phases_reached"], "milestones_total": 5, "milestones_complete": 4, "milestones_missed": 0, "invalid_action_count": 0, "env_error_count": 0, "errors": [], "final_swd_version": 13, "success": false, "episode_index": 2, "model_stage": "rlvr-qwen2.5-7b-fresh", "policy": "hf", "model": "Qwen/Qwen2.5-7B-Instruct", "adapter": "outputs/rlvr_Qwen2.5-7B-Instruct"}
|
results/runs/qwen25_7b_fresh__rlvr_ep5/metadata.json
ADDED
|
@@ -0,0 +1,32 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
{
|
| 2 |
+
"model_stage": "rlvr-qwen2.5-7b-fresh-ep5",
|
| 3 |
+
"policy": "hf",
|
| 4 |
+
"model": "Qwen/Qwen2.5-7B-Instruct",
|
| 5 |
+
"adapter": "outputs/rlvr_Qwen2.5-7B-Instruct",
|
| 6 |
+
"tasks": [
|
| 7 |
+
"e1_launch_readiness",
|
| 8 |
+
"m1_budget_reallocation",
|
| 9 |
+
"h1_acquisition_defence"
|
| 10 |
+
],
|
| 11 |
+
"episodes": 5,
|
| 12 |
+
"max_steps": 30,
|
| 13 |
+
"max_new_tokens": 1536,
|
| 14 |
+
"eval_file": "results/runs/qwen25_7b_fresh__rlvr_ep5/rlvr-qwen2.5-7b-fresh-ep5_eval.jsonl",
|
| 15 |
+
"metrics_by_task": {
|
| 16 |
+
"e1_launch_readiness": {
|
| 17 |
+
"avg_terminal_reward": 0.91,
|
| 18 |
+
"avg_verifier_pass_rate": 1.0,
|
| 19 |
+
"success_rate": 1.0
|
| 20 |
+
},
|
| 21 |
+
"m1_budget_reallocation": {
|
| 22 |
+
"avg_terminal_reward": 0.931666,
|
| 23 |
+
"avg_verifier_pass_rate": 0.966667,
|
| 24 |
+
"success_rate": 0.8
|
| 25 |
+
},
|
| 26 |
+
"h1_acquisition_defence": {
|
| 27 |
+
"avg_terminal_reward": 0.779167,
|
| 28 |
+
"avg_verifier_pass_rate": 0.683333,
|
| 29 |
+
"success_rate": 0.0
|
| 30 |
+
}
|
| 31 |
+
}
|
| 32 |
+
}
|
results/runs/qwen25_7b_fresh__rlvr_ep5/rlvr-qwen2.5-7b-fresh-ep5_eval.jsonl
ADDED
|
@@ -0,0 +1,15 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
{"task_id": "e1_launch_readiness", "policy_kind": "model", "steps": 4, "total_reward": 1.58, "terminal_reward": 0.91, "reward_trace": [0.29000000000000004, 0.19, 0.19, 0.9099999999999999], "verifier_pass_rate": 1.0, "passed_checks": ["qa_report_present", "final_rec_valid", "no_missed_milestones"], "failed_checks": [], "milestones_total": 2, "milestones_complete": 2, "milestones_missed": 0, "invalid_action_count": 0, "env_error_count": 0, "errors": [], "final_swd_version": 5, "success": true, "episode_index": 0, "model_stage": "rlvr-qwen2.5-7b-fresh-ep5", "policy": "hf", "model": "Qwen/Qwen2.5-7B-Instruct", "adapter": "outputs/rlvr_Qwen2.5-7B-Instruct"}
|
| 2 |
+
{"task_id": "m1_budget_reallocation", "policy_kind": "model", "steps": 6, "total_reward": 2.093333, "terminal_reward": 0.943333, "reward_trace": [0.09000000000000001, 0.29000000000000004, 0.19, 0.19, 0.39, 0.9433333333333334], "verifier_pass_rate": 1.0, "passed_checks": ["required_agents_consulted", "conflict_logged", "conflict_resolved", "phased_plan", "budget_constraint_acknowledged", "reasoning_documented"], "failed_checks": [], "milestones_total": 3, "milestones_complete": 3, "milestones_missed": 0, "invalid_action_count": 0, "env_error_count": 0, "errors": [], "final_swd_version": 7, "success": true, "episode_index": 0, "model_stage": "rlvr-qwen2.5-7b-fresh-ep5", "policy": "hf", "model": "Qwen/Qwen2.5-7B-Instruct", "adapter": "outputs/rlvr_Qwen2.5-7B-Instruct"}
|
| 3 |
+
{"task_id": "h1_acquisition_defence", "policy_kind": "model", "steps": 15, "total_reward": 3.584167, "terminal_reward": 0.624167, "reward_trace": [0.09000000000000001, 0.09000000000000001, 0.29000000000000004, 0.19, 0.19, 0.19, 0.19, 0.39, 0.39, 0.19, -0.01, 0.29000000000000004, 0.19, 0.29000000000000004, 0.6241666666666668], "verifier_pass_rate": 0.583333, "passed_checks": ["all_agents_consulted", "multi_conflict_logged", "conflict_explicitly_resolved", "resolution_has_type", "no_single_agent_copied", "all_phases_reached", "swd_version_rich"], "failed_checks": ["rich_reasoning_log", "counter_offer_present", "deadline_present", "retention_addressed", "timeline_constraint_acknowledged"], "milestones_total": 5, "milestones_complete": 3, "milestones_missed": 0, "invalid_action_count": 1, "env_error_count": 1, "errors": ["invalid_action: Expecting property name enclosed in double quotes: line 1 column 110 (char 109)"], "final_swd_version": 15, "success": false, "episode_index": 0, "model_stage": "rlvr-qwen2.5-7b-fresh-ep5", "policy": "hf", "model": "Qwen/Qwen2.5-7B-Instruct", "adapter": "outputs/rlvr_Qwen2.5-7B-Instruct"}
|
| 4 |
+
{"task_id": "e1_launch_readiness", "policy_kind": "model", "steps": 4, "total_reward": 1.58, "terminal_reward": 0.91, "reward_trace": [0.29000000000000004, 0.19, 0.19, 0.9099999999999999], "verifier_pass_rate": 1.0, "passed_checks": ["qa_report_present", "final_rec_valid", "no_missed_milestones"], "failed_checks": [], "milestones_total": 2, "milestones_complete": 2, "milestones_missed": 0, "invalid_action_count": 0, "env_error_count": 0, "errors": [], "final_swd_version": 5, "success": true, "episode_index": 1, "model_stage": "rlvr-qwen2.5-7b-fresh-ep5", "policy": "hf", "model": "Qwen/Qwen2.5-7B-Instruct", "adapter": "outputs/rlvr_Qwen2.5-7B-Instruct"}
|
| 5 |
+
{"task_id": "m1_budget_reallocation", "policy_kind": "model", "steps": 6, "total_reward": 2.093333, "terminal_reward": 0.943333, "reward_trace": [0.09000000000000001, 0.29000000000000004, 0.19, 0.19, 0.39, 0.9433333333333334], "verifier_pass_rate": 1.0, "passed_checks": ["required_agents_consulted", "conflict_logged", "conflict_resolved", "phased_plan", "budget_constraint_acknowledged", "reasoning_documented"], "failed_checks": [], "milestones_total": 3, "milestones_complete": 3, "milestones_missed": 0, "invalid_action_count": 0, "env_error_count": 0, "errors": [], "final_swd_version": 7, "success": true, "episode_index": 1, "model_stage": "rlvr-qwen2.5-7b-fresh-ep5", "policy": "hf", "model": "Qwen/Qwen2.5-7B-Instruct", "adapter": "outputs/rlvr_Qwen2.5-7B-Instruct"}
|
| 6 |
+
{"task_id": "h1_acquisition_defence", "policy_kind": "model", "steps": 11, "total_reward": 3.0825, "terminal_reward": 0.8825, "reward_trace": [0.09000000000000001, 0.09000000000000001, 0.29000000000000004, 0.19, 0.19, 0.19, 0.19, 0.39, 0.39, 0.19, 0.8824999999999998], "verifier_pass_rate": 0.75, "passed_checks": ["all_agents_consulted", "multi_conflict_logged", "conflict_explicitly_resolved", "resolution_has_type", "counter_offer_present", "deadline_present", "retention_addressed", "no_single_agent_copied", "swd_version_rich"], "failed_checks": ["rich_reasoning_log", "timeline_constraint_acknowledged", "all_phases_reached"], "milestones_total": 5, "milestones_complete": 4, "milestones_missed": 0, "invalid_action_count": 0, "env_error_count": 0, "errors": [], "final_swd_version": 12, "success": false, "episode_index": 1, "model_stage": "rlvr-qwen2.5-7b-fresh-ep5", "policy": "hf", "model": "Qwen/Qwen2.5-7B-Instruct", "adapter": "outputs/rlvr_Qwen2.5-7B-Instruct"}
|
| 7 |
+
{"task_id": "e1_launch_readiness", "policy_kind": "model", "steps": 4, "total_reward": 1.58, "terminal_reward": 0.91, "reward_trace": [0.29000000000000004, 0.19, 0.19, 0.9099999999999999], "verifier_pass_rate": 1.0, "passed_checks": ["qa_report_present", "final_rec_valid", "no_missed_milestones"], "failed_checks": [], "milestones_total": 2, "milestones_complete": 2, "milestones_missed": 0, "invalid_action_count": 0, "env_error_count": 0, "errors": [], "final_swd_version": 5, "success": true, "episode_index": 2, "model_stage": "rlvr-qwen2.5-7b-fresh-ep5", "policy": "hf", "model": "Qwen/Qwen2.5-7B-Instruct", "adapter": "outputs/rlvr_Qwen2.5-7B-Instruct"}
|
| 8 |
+
{"task_id": "m1_budget_reallocation", "policy_kind": "model", "steps": 6, "total_reward": 2.035, "terminal_reward": 0.885, "reward_trace": [0.09000000000000001, 0.29000000000000004, 0.19, 0.19, 0.39, 0.885], "verifier_pass_rate": 0.833333, "passed_checks": ["required_agents_consulted", "conflict_logged", "conflict_resolved", "phased_plan", "reasoning_documented"], "failed_checks": ["budget_constraint_acknowledged"], "milestones_total": 3, "milestones_complete": 3, "milestones_missed": 0, "invalid_action_count": 0, "env_error_count": 0, "errors": [], "final_swd_version": 7, "success": false, "episode_index": 2, "model_stage": "rlvr-qwen2.5-7b-fresh-ep5", "policy": "hf", "model": "Qwen/Qwen2.5-7B-Instruct", "adapter": "outputs/rlvr_Qwen2.5-7B-Instruct"}
|
| 9 |
+
{"task_id": "h1_acquisition_defence", "policy_kind": "model", "steps": 13, "total_reward": 3.4625, "terminal_reward": 0.8825, "reward_trace": [0.09000000000000001, 0.09000000000000001, 0.29000000000000004, 0.19, 0.19, 0.19, 0.39, 0.19, 0.19, 0.39, 0.19, 0.19, 0.8824999999999998], "verifier_pass_rate": 0.75, "passed_checks": ["all_agents_consulted", "multi_conflict_logged", "conflict_explicitly_resolved", "resolution_has_type", "counter_offer_present", "deadline_present", "retention_addressed", "no_single_agent_copied", "swd_version_rich"], "failed_checks": ["rich_reasoning_log", "timeline_constraint_acknowledged", "all_phases_reached"], "milestones_total": 5, "milestones_complete": 4, "milestones_missed": 0, "invalid_action_count": 0, "env_error_count": 0, "errors": [], "final_swd_version": 14, "success": false, "episode_index": 2, "model_stage": "rlvr-qwen2.5-7b-fresh-ep5", "policy": "hf", "model": "Qwen/Qwen2.5-7B-Instruct", "adapter": "outputs/rlvr_Qwen2.5-7B-Instruct"}
|
| 10 |
+
{"task_id": "e1_launch_readiness", "policy_kind": "model", "steps": 4, "total_reward": 1.58, "terminal_reward": 0.91, "reward_trace": [0.29000000000000004, 0.19, 0.19, 0.9099999999999999], "verifier_pass_rate": 1.0, "passed_checks": ["qa_report_present", "final_rec_valid", "no_missed_milestones"], "failed_checks": [], "milestones_total": 2, "milestones_complete": 2, "milestones_missed": 0, "invalid_action_count": 0, "env_error_count": 0, "errors": [], "final_swd_version": 5, "success": true, "episode_index": 3, "model_stage": "rlvr-qwen2.5-7b-fresh-ep5", "policy": "hf", "model": "Qwen/Qwen2.5-7B-Instruct", "adapter": "outputs/rlvr_Qwen2.5-7B-Instruct"}
|
| 11 |
+
{"task_id": "m1_budget_reallocation", "policy_kind": "model", "steps": 7, "total_reward": 2.083333, "terminal_reward": 0.943333, "reward_trace": [0.09000000000000001, -0.01, 0.29000000000000004, 0.19, 0.19, 0.39, 0.9433333333333334], "verifier_pass_rate": 1.0, "passed_checks": ["required_agents_consulted", "conflict_logged", "conflict_resolved", "phased_plan", "budget_constraint_acknowledged", "reasoning_documented"], "failed_checks": [], "milestones_total": 3, "milestones_complete": 3, "milestones_missed": 0, "invalid_action_count": 1, "env_error_count": 1, "errors": ["invalid_action: unbalanced JSON object"], "final_swd_version": 7, "success": true, "episode_index": 3, "model_stage": "rlvr-qwen2.5-7b-fresh-ep5", "policy": "hf", "model": "Qwen/Qwen2.5-7B-Instruct", "adapter": "outputs/rlvr_Qwen2.5-7B-Instruct"}
|
| 12 |
+
{"task_id": "h1_acquisition_defence", "policy_kind": "model", "steps": 11, "total_reward": 3.0825, "terminal_reward": 0.8825, "reward_trace": [0.09000000000000001, 0.09000000000000001, 0.29000000000000004, 0.19, 0.19, 0.19, 0.19, 0.39, 0.39, 0.19, 0.8824999999999998], "verifier_pass_rate": 0.75, "passed_checks": ["all_agents_consulted", "multi_conflict_logged", "conflict_explicitly_resolved", "resolution_has_type", "counter_offer_present", "deadline_present", "retention_addressed", "no_single_agent_copied", "swd_version_rich"], "failed_checks": ["rich_reasoning_log", "timeline_constraint_acknowledged", "all_phases_reached"], "milestones_total": 5, "milestones_complete": 4, "milestones_missed": 0, "invalid_action_count": 0, "env_error_count": 0, "errors": [], "final_swd_version": 12, "success": false, "episode_index": 3, "model_stage": "rlvr-qwen2.5-7b-fresh-ep5", "policy": "hf", "model": "Qwen/Qwen2.5-7B-Instruct", "adapter": "outputs/rlvr_Qwen2.5-7B-Instruct"}
|
| 13 |
+
{"task_id": "e1_launch_readiness", "policy_kind": "model", "steps": 4, "total_reward": 1.58, "terminal_reward": 0.91, "reward_trace": [0.29000000000000004, 0.19, 0.19, 0.9099999999999999], "verifier_pass_rate": 1.0, "passed_checks": ["qa_report_present", "final_rec_valid", "no_missed_milestones"], "failed_checks": [], "milestones_total": 2, "milestones_complete": 2, "milestones_missed": 0, "invalid_action_count": 0, "env_error_count": 0, "errors": [], "final_swd_version": 5, "success": true, "episode_index": 4, "model_stage": "rlvr-qwen2.5-7b-fresh-ep5", "policy": "hf", "model": "Qwen/Qwen2.5-7B-Instruct", "adapter": "outputs/rlvr_Qwen2.5-7B-Instruct"}
|
| 14 |
+
{"task_id": "m1_budget_reallocation", "policy_kind": "model", "steps": 6, "total_reward": 2.093333, "terminal_reward": 0.943333, "reward_trace": [0.09000000000000001, 0.29000000000000004, 0.19, 0.19, 0.39, 0.9433333333333334], "verifier_pass_rate": 1.0, "passed_checks": ["required_agents_consulted", "conflict_logged", "conflict_resolved", "phased_plan", "budget_constraint_acknowledged", "reasoning_documented"], "failed_checks": [], "milestones_total": 3, "milestones_complete": 3, "milestones_missed": 0, "invalid_action_count": 0, "env_error_count": 0, "errors": [], "final_swd_version": 7, "success": true, "episode_index": 4, "model_stage": "rlvr-qwen2.5-7b-fresh-ep5", "policy": "hf", "model": "Qwen/Qwen2.5-7B-Instruct", "adapter": "outputs/rlvr_Qwen2.5-7B-Instruct"}
|
| 15 |
+
{"task_id": "h1_acquisition_defence", "policy_kind": "model", "steps": 17, "total_reward": 4.064167, "terminal_reward": 0.624167, "reward_trace": [0.09000000000000001, 0.09000000000000001, 0.29000000000000004, 0.19, 0.19, 0.19, 0.39, 0.19, 0.19, 0.39, 0.19, 0.19, 0.29000000000000004, 0.19, 0.19, 0.19, 0.6241666666666668], "verifier_pass_rate": 0.583333, "passed_checks": ["all_agents_consulted", "multi_conflict_logged", "conflict_explicitly_resolved", "resolution_has_type", "timeline_constraint_acknowledged", "no_single_agent_copied", "swd_version_rich"], "failed_checks": ["rich_reasoning_log", "counter_offer_present", "deadline_present", "retention_addressed", "all_phases_reached"], "milestones_total": 5, "milestones_complete": 3, "milestones_missed": 0, "invalid_action_count": 0, "env_error_count": 0, "errors": [], "final_swd_version": 18, "success": false, "episode_index": 4, "model_stage": "rlvr-qwen2.5-7b-fresh-ep5", "policy": "hf", "model": "Qwen/Qwen2.5-7B-Instruct", "adapter": "outputs/rlvr_Qwen2.5-7B-Instruct"}
|
results/runs/qwen25_7b_fresh__sft/metadata.json
ADDED
|
@@ -0,0 +1,32 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
{
|
| 2 |
+
"model_stage": "sft-qwen2.5-7b-fresh",
|
| 3 |
+
"policy": "hf",
|
| 4 |
+
"model": "Qwen/Qwen2.5-7B-Instruct",
|
| 5 |
+
"adapter": "outputs/sft_Qwen2.5-7B-Instruct",
|
| 6 |
+
"tasks": [
|
| 7 |
+
"e1_launch_readiness",
|
| 8 |
+
"m1_budget_reallocation",
|
| 9 |
+
"h1_acquisition_defence"
|
| 10 |
+
],
|
| 11 |
+
"episodes": 3,
|
| 12 |
+
"max_steps": 30,
|
| 13 |
+
"max_new_tokens": 1536,
|
| 14 |
+
"eval_file": "results/runs/qwen25_7b_fresh__sft/sft-qwen2.5-7b-fresh_eval.jsonl",
|
| 15 |
+
"metrics_by_task": {
|
| 16 |
+
"e1_launch_readiness": {
|
| 17 |
+
"avg_terminal_reward": 0.91,
|
| 18 |
+
"avg_verifier_pass_rate": 1.0,
|
| 19 |
+
"success_rate": 1.0
|
| 20 |
+
},
|
| 21 |
+
"m1_budget_reallocation": {
|
| 22 |
+
"avg_terminal_reward": 0.943333,
|
| 23 |
+
"avg_verifier_pass_rate": 1.0,
|
| 24 |
+
"success_rate": 1.0
|
| 25 |
+
},
|
| 26 |
+
"h1_acquisition_defence": {
|
| 27 |
+
"avg_terminal_reward": 0.889167,
|
| 28 |
+
"avg_verifier_pass_rate": 0.75,
|
| 29 |
+
"success_rate": 0.0
|
| 30 |
+
}
|
| 31 |
+
}
|
| 32 |
+
}
|
results/runs/qwen25_7b_fresh__sft/sft-qwen2.5-7b-fresh_eval.jsonl
ADDED
|
@@ -0,0 +1,9 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
{"task_id": "e1_launch_readiness", "policy_kind": "model", "steps": 4, "total_reward": 1.58, "terminal_reward": 0.91, "reward_trace": [0.29000000000000004, 0.19, 0.19, 0.9099999999999999], "verifier_pass_rate": 1.0, "passed_checks": ["qa_report_present", "final_rec_valid", "no_missed_milestones"], "failed_checks": [], "milestones_total": 2, "milestones_complete": 2, "milestones_missed": 0, "invalid_action_count": 0, "env_error_count": 0, "errors": [], "final_swd_version": 5, "success": true, "episode_index": 0, "model_stage": "sft-qwen2.5-7b-fresh", "policy": "hf", "model": "Qwen/Qwen2.5-7B-Instruct", "adapter": "outputs/sft_Qwen2.5-7B-Instruct"}
|
| 2 |
+
{"task_id": "m1_budget_reallocation", "policy_kind": "model", "steps": 6, "total_reward": 2.093333, "terminal_reward": 0.943333, "reward_trace": [0.09000000000000001, 0.29000000000000004, 0.19, 0.19, 0.39, 0.9433333333333334], "verifier_pass_rate": 1.0, "passed_checks": ["required_agents_consulted", "conflict_logged", "conflict_resolved", "phased_plan", "budget_constraint_acknowledged", "reasoning_documented"], "failed_checks": [], "milestones_total": 3, "milestones_complete": 3, "milestones_missed": 0, "invalid_action_count": 0, "env_error_count": 0, "errors": [], "final_swd_version": 7, "success": true, "episode_index": 0, "model_stage": "sft-qwen2.5-7b-fresh", "policy": "hf", "model": "Qwen/Qwen2.5-7B-Instruct", "adapter": "outputs/sft_Qwen2.5-7B-Instruct"}
|
| 3 |
+
{"task_id": "h1_acquisition_defence", "policy_kind": "model", "steps": 13, "total_reward": 3.4625, "terminal_reward": 0.8825, "reward_trace": [0.09000000000000001, 0.09000000000000001, 0.29000000000000004, 0.19, 0.19, 0.19, 0.39, 0.19, 0.19, 0.39, 0.19, 0.19, 0.8824999999999998], "verifier_pass_rate": 0.75, "passed_checks": ["all_agents_consulted", "multi_conflict_logged", "conflict_explicitly_resolved", "resolution_has_type", "counter_offer_present", "deadline_present", "retention_addressed", "no_single_agent_copied", "swd_version_rich"], "failed_checks": ["rich_reasoning_log", "timeline_constraint_acknowledged", "all_phases_reached"], "milestones_total": 5, "milestones_complete": 4, "milestones_missed": 0, "invalid_action_count": 0, "env_error_count": 0, "errors": [], "final_swd_version": 14, "success": false, "episode_index": 0, "model_stage": "sft-qwen2.5-7b-fresh", "policy": "hf", "model": "Qwen/Qwen2.5-7B-Instruct", "adapter": "outputs/sft_Qwen2.5-7B-Instruct"}
|
| 4 |
+
{"task_id": "e1_launch_readiness", "policy_kind": "model", "steps": 4, "total_reward": 1.58, "terminal_reward": 0.91, "reward_trace": [0.29000000000000004, 0.19, 0.19, 0.9099999999999999], "verifier_pass_rate": 1.0, "passed_checks": ["qa_report_present", "final_rec_valid", "no_missed_milestones"], "failed_checks": [], "milestones_total": 2, "milestones_complete": 2, "milestones_missed": 0, "invalid_action_count": 0, "env_error_count": 0, "errors": [], "final_swd_version": 5, "success": true, "episode_index": 1, "model_stage": "sft-qwen2.5-7b-fresh", "policy": "hf", "model": "Qwen/Qwen2.5-7B-Instruct", "adapter": "outputs/sft_Qwen2.5-7B-Instruct"}
|
| 5 |
+
{"task_id": "m1_budget_reallocation", "policy_kind": "model", "steps": 6, "total_reward": 2.093333, "terminal_reward": 0.943333, "reward_trace": [0.09000000000000001, 0.29000000000000004, 0.19, 0.19, 0.39, 0.9433333333333334], "verifier_pass_rate": 1.0, "passed_checks": ["required_agents_consulted", "conflict_logged", "conflict_resolved", "phased_plan", "budget_constraint_acknowledged", "reasoning_documented"], "failed_checks": [], "milestones_total": 3, "milestones_complete": 3, "milestones_missed": 0, "invalid_action_count": 0, "env_error_count": 0, "errors": [], "final_swd_version": 7, "success": true, "episode_index": 1, "model_stage": "sft-qwen2.5-7b-fresh", "policy": "hf", "model": "Qwen/Qwen2.5-7B-Instruct", "adapter": "outputs/sft_Qwen2.5-7B-Instruct"}
|
| 6 |
+
{"task_id": "h1_acquisition_defence", "policy_kind": "model", "steps": 12, "total_reward": 3.2925, "terminal_reward": 0.9025, "reward_trace": [0.09000000000000001, 0.09000000000000001, 0.29000000000000004, 0.19, 0.19, 0.19, 0.39, 0.19, 0.19, 0.19, 0.39, 0.9024999999999999], "verifier_pass_rate": 0.75, "passed_checks": ["all_agents_consulted", "multi_conflict_logged", "conflict_explicitly_resolved", "resolution_has_type", "counter_offer_present", "deadline_present", "retention_addressed", "no_single_agent_copied", "swd_version_rich"], "failed_checks": ["rich_reasoning_log", "timeline_constraint_acknowledged", "all_phases_reached"], "milestones_total": 5, "milestones_complete": 4, "milestones_missed": 0, "invalid_action_count": 0, "env_error_count": 0, "errors": [], "final_swd_version": 13, "success": false, "episode_index": 1, "model_stage": "sft-qwen2.5-7b-fresh", "policy": "hf", "model": "Qwen/Qwen2.5-7B-Instruct", "adapter": "outputs/sft_Qwen2.5-7B-Instruct"}
|
| 7 |
+
{"task_id": "e1_launch_readiness", "policy_kind": "model", "steps": 4, "total_reward": 1.58, "terminal_reward": 0.91, "reward_trace": [0.29000000000000004, 0.19, 0.19, 0.9099999999999999], "verifier_pass_rate": 1.0, "passed_checks": ["qa_report_present", "final_rec_valid", "no_missed_milestones"], "failed_checks": [], "milestones_total": 2, "milestones_complete": 2, "milestones_missed": 0, "invalid_action_count": 0, "env_error_count": 0, "errors": [], "final_swd_version": 5, "success": true, "episode_index": 2, "model_stage": "sft-qwen2.5-7b-fresh", "policy": "hf", "model": "Qwen/Qwen2.5-7B-Instruct", "adapter": "outputs/sft_Qwen2.5-7B-Instruct"}
|
| 8 |
+
{"task_id": "m1_budget_reallocation", "policy_kind": "model", "steps": 6, "total_reward": 2.093333, "terminal_reward": 0.943333, "reward_trace": [0.09000000000000001, 0.29000000000000004, 0.19, 0.19, 0.39, 0.9433333333333334], "verifier_pass_rate": 1.0, "passed_checks": ["required_agents_consulted", "conflict_logged", "conflict_resolved", "phased_plan", "budget_constraint_acknowledged", "reasoning_documented"], "failed_checks": [], "milestones_total": 3, "milestones_complete": 3, "milestones_missed": 0, "invalid_action_count": 0, "env_error_count": 0, "errors": [], "final_swd_version": 7, "success": true, "episode_index": 2, "model_stage": "sft-qwen2.5-7b-fresh", "policy": "hf", "model": "Qwen/Qwen2.5-7B-Instruct", "adapter": "outputs/sft_Qwen2.5-7B-Instruct"}
|
| 9 |
+
{"task_id": "h1_acquisition_defence", "policy_kind": "model", "steps": 13, "total_reward": 3.4625, "terminal_reward": 0.8825, "reward_trace": [0.09000000000000001, 0.09000000000000001, 0.29000000000000004, 0.19, 0.19, 0.19, 0.39, 0.19, 0.19, 0.39, 0.19, 0.19, 0.8824999999999998], "verifier_pass_rate": 0.75, "passed_checks": ["all_agents_consulted", "multi_conflict_logged", "conflict_explicitly_resolved", "resolution_has_type", "counter_offer_present", "deadline_present", "retention_addressed", "no_single_agent_copied", "swd_version_rich"], "failed_checks": ["rich_reasoning_log", "timeline_constraint_acknowledged", "all_phases_reached"], "milestones_total": 5, "milestones_complete": 4, "milestones_missed": 0, "invalid_action_count": 0, "env_error_count": 0, "errors": [], "final_swd_version": 14, "success": false, "episode_index": 2, "model_stage": "sft-qwen2.5-7b-fresh", "policy": "hf", "model": "Qwen/Qwen2.5-7B-Instruct", "adapter": "outputs/sft_Qwen2.5-7B-Instruct"}
|
results/runs/qwen25_7b_fresh__sft_ep5/metadata.json
ADDED
|
@@ -0,0 +1,32 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
{
|
| 2 |
+
"model_stage": "sft-qwen2.5-7b-fresh-ep5",
|
| 3 |
+
"policy": "hf",
|
| 4 |
+
"model": "Qwen/Qwen2.5-7B-Instruct",
|
| 5 |
+
"adapter": "outputs/sft_Qwen2.5-7B-Instruct",
|
| 6 |
+
"tasks": [
|
| 7 |
+
"e1_launch_readiness",
|
| 8 |
+
"m1_budget_reallocation",
|
| 9 |
+
"h1_acquisition_defence"
|
| 10 |
+
],
|
| 11 |
+
"episodes": 5,
|
| 12 |
+
"max_steps": 30,
|
| 13 |
+
"max_new_tokens": 1536,
|
| 14 |
+
"eval_file": "results/runs/qwen25_7b_fresh__sft_ep5/sft-qwen2.5-7b-fresh-ep5_eval.jsonl",
|
| 15 |
+
"metrics_by_task": {
|
| 16 |
+
"e1_launch_readiness": {
|
| 17 |
+
"avg_terminal_reward": 0.91,
|
| 18 |
+
"avg_verifier_pass_rate": 1.0,
|
| 19 |
+
"success_rate": 1.0
|
| 20 |
+
},
|
| 21 |
+
"m1_budget_reallocation": {
|
| 22 |
+
"avg_terminal_reward": 0.943333,
|
| 23 |
+
"avg_verifier_pass_rate": 1.0,
|
| 24 |
+
"success_rate": 1.0
|
| 25 |
+
},
|
| 26 |
+
"h1_acquisition_defence": {
|
| 27 |
+
"avg_terminal_reward": 0.8825,
|
| 28 |
+
"avg_verifier_pass_rate": 0.75,
|
| 29 |
+
"success_rate": 0.0
|
| 30 |
+
}
|
| 31 |
+
}
|
| 32 |
+
}
|
results/runs/qwen25_7b_fresh__sft_ep5/sft-qwen2.5-7b-fresh-ep5_eval.jsonl
ADDED
|
@@ -0,0 +1,15 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
{"task_id": "e1_launch_readiness", "policy_kind": "model", "steps": 4, "total_reward": 1.58, "terminal_reward": 0.91, "reward_trace": [0.29000000000000004, 0.19, 0.19, 0.9099999999999999], "verifier_pass_rate": 1.0, "passed_checks": ["qa_report_present", "final_rec_valid", "no_missed_milestones"], "failed_checks": [], "milestones_total": 2, "milestones_complete": 2, "milestones_missed": 0, "invalid_action_count": 0, "env_error_count": 0, "errors": [], "final_swd_version": 5, "success": true, "episode_index": 0, "model_stage": "sft-qwen2.5-7b-fresh-ep5", "policy": "hf", "model": "Qwen/Qwen2.5-7B-Instruct", "adapter": "outputs/sft_Qwen2.5-7B-Instruct"}
|
| 2 |
+
{"task_id": "m1_budget_reallocation", "policy_kind": "model", "steps": 6, "total_reward": 2.093333, "terminal_reward": 0.943333, "reward_trace": [0.09000000000000001, 0.29000000000000004, 0.19, 0.19, 0.39, 0.9433333333333334], "verifier_pass_rate": 1.0, "passed_checks": ["required_agents_consulted", "conflict_logged", "conflict_resolved", "phased_plan", "budget_constraint_acknowledged", "reasoning_documented"], "failed_checks": [], "milestones_total": 3, "milestones_complete": 3, "milestones_missed": 0, "invalid_action_count": 0, "env_error_count": 0, "errors": [], "final_swd_version": 7, "success": true, "episode_index": 0, "model_stage": "sft-qwen2.5-7b-fresh-ep5", "policy": "hf", "model": "Qwen/Qwen2.5-7B-Instruct", "adapter": "outputs/sft_Qwen2.5-7B-Instruct"}
|
| 3 |
+
{"task_id": "h1_acquisition_defence", "policy_kind": "model", "steps": 11, "total_reward": 3.0825, "terminal_reward": 0.8825, "reward_trace": [0.09000000000000001, 0.09000000000000001, 0.29000000000000004, 0.19, 0.19, 0.19, 0.39, 0.19, 0.19, 0.39, 0.8824999999999998], "verifier_pass_rate": 0.75, "passed_checks": ["all_agents_consulted", "multi_conflict_logged", "conflict_explicitly_resolved", "resolution_has_type", "counter_offer_present", "deadline_present", "retention_addressed", "no_single_agent_copied", "swd_version_rich"], "failed_checks": ["rich_reasoning_log", "timeline_constraint_acknowledged", "all_phases_reached"], "milestones_total": 5, "milestones_complete": 4, "milestones_missed": 0, "invalid_action_count": 0, "env_error_count": 0, "errors": [], "final_swd_version": 12, "success": false, "episode_index": 0, "model_stage": "sft-qwen2.5-7b-fresh-ep5", "policy": "hf", "model": "Qwen/Qwen2.5-7B-Instruct", "adapter": "outputs/sft_Qwen2.5-7B-Instruct"}
|
| 4 |
+
{"task_id": "e1_launch_readiness", "policy_kind": "model", "steps": 4, "total_reward": 1.58, "terminal_reward": 0.91, "reward_trace": [0.29000000000000004, 0.19, 0.19, 0.9099999999999999], "verifier_pass_rate": 1.0, "passed_checks": ["qa_report_present", "final_rec_valid", "no_missed_milestones"], "failed_checks": [], "milestones_total": 2, "milestones_complete": 2, "milestones_missed": 0, "invalid_action_count": 0, "env_error_count": 0, "errors": [], "final_swd_version": 5, "success": true, "episode_index": 1, "model_stage": "sft-qwen2.5-7b-fresh-ep5", "policy": "hf", "model": "Qwen/Qwen2.5-7B-Instruct", "adapter": "outputs/sft_Qwen2.5-7B-Instruct"}
|
| 5 |
+
{"task_id": "m1_budget_reallocation", "policy_kind": "model", "steps": 6, "total_reward": 2.093333, "terminal_reward": 0.943333, "reward_trace": [0.09000000000000001, 0.29000000000000004, 0.19, 0.19, 0.39, 0.9433333333333334], "verifier_pass_rate": 1.0, "passed_checks": ["required_agents_consulted", "conflict_logged", "conflict_resolved", "phased_plan", "budget_constraint_acknowledged", "reasoning_documented"], "failed_checks": [], "milestones_total": 3, "milestones_complete": 3, "milestones_missed": 0, "invalid_action_count": 0, "env_error_count": 0, "errors": [], "final_swd_version": 7, "success": true, "episode_index": 1, "model_stage": "sft-qwen2.5-7b-fresh-ep5", "policy": "hf", "model": "Qwen/Qwen2.5-7B-Instruct", "adapter": "outputs/sft_Qwen2.5-7B-Instruct"}
|
| 6 |
+
{"task_id": "h1_acquisition_defence", "policy_kind": "model", "steps": 11, "total_reward": 3.0825, "terminal_reward": 0.8825, "reward_trace": [0.09000000000000001, 0.09000000000000001, 0.29000000000000004, 0.19, 0.19, 0.19, 0.39, 0.19, 0.19, 0.39, 0.8824999999999998], "verifier_pass_rate": 0.75, "passed_checks": ["all_agents_consulted", "multi_conflict_logged", "conflict_explicitly_resolved", "resolution_has_type", "counter_offer_present", "deadline_present", "retention_addressed", "no_single_agent_copied", "swd_version_rich"], "failed_checks": ["rich_reasoning_log", "timeline_constraint_acknowledged", "all_phases_reached"], "milestones_total": 5, "milestones_complete": 4, "milestones_missed": 0, "invalid_action_count": 0, "env_error_count": 0, "errors": [], "final_swd_version": 12, "success": false, "episode_index": 1, "model_stage": "sft-qwen2.5-7b-fresh-ep5", "policy": "hf", "model": "Qwen/Qwen2.5-7B-Instruct", "adapter": "outputs/sft_Qwen2.5-7B-Instruct"}
|
| 7 |
+
{"task_id": "e1_launch_readiness", "policy_kind": "model", "steps": 4, "total_reward": 1.58, "terminal_reward": 0.91, "reward_trace": [0.29000000000000004, 0.19, 0.19, 0.9099999999999999], "verifier_pass_rate": 1.0, "passed_checks": ["qa_report_present", "final_rec_valid", "no_missed_milestones"], "failed_checks": [], "milestones_total": 2, "milestones_complete": 2, "milestones_missed": 0, "invalid_action_count": 0, "env_error_count": 0, "errors": [], "final_swd_version": 5, "success": true, "episode_index": 2, "model_stage": "sft-qwen2.5-7b-fresh-ep5", "policy": "hf", "model": "Qwen/Qwen2.5-7B-Instruct", "adapter": "outputs/sft_Qwen2.5-7B-Instruct"}
|
| 8 |
+
{"task_id": "m1_budget_reallocation", "policy_kind": "model", "steps": 6, "total_reward": 2.093333, "terminal_reward": 0.943333, "reward_trace": [0.09000000000000001, 0.29000000000000004, 0.19, 0.19, 0.39, 0.9433333333333334], "verifier_pass_rate": 1.0, "passed_checks": ["required_agents_consulted", "conflict_logged", "conflict_resolved", "phased_plan", "budget_constraint_acknowledged", "reasoning_documented"], "failed_checks": [], "milestones_total": 3, "milestones_complete": 3, "milestones_missed": 0, "invalid_action_count": 0, "env_error_count": 0, "errors": [], "final_swd_version": 7, "success": true, "episode_index": 2, "model_stage": "sft-qwen2.5-7b-fresh-ep5", "policy": "hf", "model": "Qwen/Qwen2.5-7B-Instruct", "adapter": "outputs/sft_Qwen2.5-7B-Instruct"}
|
| 9 |
+
{"task_id": "h1_acquisition_defence", "policy_kind": "model", "steps": 11, "total_reward": 3.0825, "terminal_reward": 0.8825, "reward_trace": [0.09000000000000001, 0.09000000000000001, 0.29000000000000004, 0.19, 0.19, 0.19, 0.39, 0.19, 0.19, 0.39, 0.8824999999999998], "verifier_pass_rate": 0.75, "passed_checks": ["all_agents_consulted", "multi_conflict_logged", "conflict_explicitly_resolved", "resolution_has_type", "counter_offer_present", "deadline_present", "retention_addressed", "no_single_agent_copied", "swd_version_rich"], "failed_checks": ["rich_reasoning_log", "timeline_constraint_acknowledged", "all_phases_reached"], "milestones_total": 5, "milestones_complete": 4, "milestones_missed": 0, "invalid_action_count": 0, "env_error_count": 0, "errors": [], "final_swd_version": 12, "success": false, "episode_index": 2, "model_stage": "sft-qwen2.5-7b-fresh-ep5", "policy": "hf", "model": "Qwen/Qwen2.5-7B-Instruct", "adapter": "outputs/sft_Qwen2.5-7B-Instruct"}
|
| 10 |
+
{"task_id": "e1_launch_readiness", "policy_kind": "model", "steps": 4, "total_reward": 1.58, "terminal_reward": 0.91, "reward_trace": [0.29000000000000004, 0.19, 0.19, 0.9099999999999999], "verifier_pass_rate": 1.0, "passed_checks": ["qa_report_present", "final_rec_valid", "no_missed_milestones"], "failed_checks": [], "milestones_total": 2, "milestones_complete": 2, "milestones_missed": 0, "invalid_action_count": 0, "env_error_count": 0, "errors": [], "final_swd_version": 5, "success": true, "episode_index": 3, "model_stage": "sft-qwen2.5-7b-fresh-ep5", "policy": "hf", "model": "Qwen/Qwen2.5-7B-Instruct", "adapter": "outputs/sft_Qwen2.5-7B-Instruct"}
|
| 11 |
+
{"task_id": "m1_budget_reallocation", "policy_kind": "model", "steps": 6, "total_reward": 2.093333, "terminal_reward": 0.943333, "reward_trace": [0.09000000000000001, 0.29000000000000004, 0.19, 0.19, 0.39, 0.9433333333333334], "verifier_pass_rate": 1.0, "passed_checks": ["required_agents_consulted", "conflict_logged", "conflict_resolved", "phased_plan", "budget_constraint_acknowledged", "reasoning_documented"], "failed_checks": [], "milestones_total": 3, "milestones_complete": 3, "milestones_missed": 0, "invalid_action_count": 0, "env_error_count": 0, "errors": [], "final_swd_version": 7, "success": true, "episode_index": 3, "model_stage": "sft-qwen2.5-7b-fresh-ep5", "policy": "hf", "model": "Qwen/Qwen2.5-7B-Instruct", "adapter": "outputs/sft_Qwen2.5-7B-Instruct"}
|
| 12 |
+
{"task_id": "h1_acquisition_defence", "policy_kind": "model", "steps": 13, "total_reward": 3.4625, "terminal_reward": 0.8825, "reward_trace": [0.09000000000000001, 0.09000000000000001, 0.29000000000000004, 0.19, 0.19, 0.19, 0.39, 0.19, 0.19, 0.39, 0.19, 0.19, 0.8824999999999998], "verifier_pass_rate": 0.75, "passed_checks": ["all_agents_consulted", "multi_conflict_logged", "conflict_explicitly_resolved", "resolution_has_type", "counter_offer_present", "deadline_present", "retention_addressed", "no_single_agent_copied", "swd_version_rich"], "failed_checks": ["rich_reasoning_log", "timeline_constraint_acknowledged", "all_phases_reached"], "milestones_total": 5, "milestones_complete": 4, "milestones_missed": 0, "invalid_action_count": 0, "env_error_count": 0, "errors": [], "final_swd_version": 14, "success": false, "episode_index": 3, "model_stage": "sft-qwen2.5-7b-fresh-ep5", "policy": "hf", "model": "Qwen/Qwen2.5-7B-Instruct", "adapter": "outputs/sft_Qwen2.5-7B-Instruct"}
|
| 13 |
+
{"task_id": "e1_launch_readiness", "policy_kind": "model", "steps": 4, "total_reward": 1.58, "terminal_reward": 0.91, "reward_trace": [0.29000000000000004, 0.19, 0.19, 0.9099999999999999], "verifier_pass_rate": 1.0, "passed_checks": ["qa_report_present", "final_rec_valid", "no_missed_milestones"], "failed_checks": [], "milestones_total": 2, "milestones_complete": 2, "milestones_missed": 0, "invalid_action_count": 0, "env_error_count": 0, "errors": [], "final_swd_version": 5, "success": true, "episode_index": 4, "model_stage": "sft-qwen2.5-7b-fresh-ep5", "policy": "hf", "model": "Qwen/Qwen2.5-7B-Instruct", "adapter": "outputs/sft_Qwen2.5-7B-Instruct"}
|
| 14 |
+
{"task_id": "m1_budget_reallocation", "policy_kind": "model", "steps": 6, "total_reward": 2.093333, "terminal_reward": 0.943333, "reward_trace": [0.09000000000000001, 0.29000000000000004, 0.19, 0.19, 0.39, 0.9433333333333334], "verifier_pass_rate": 1.0, "passed_checks": ["required_agents_consulted", "conflict_logged", "conflict_resolved", "phased_plan", "budget_constraint_acknowledged", "reasoning_documented"], "failed_checks": [], "milestones_total": 3, "milestones_complete": 3, "milestones_missed": 0, "invalid_action_count": 0, "env_error_count": 0, "errors": [], "final_swd_version": 7, "success": true, "episode_index": 4, "model_stage": "sft-qwen2.5-7b-fresh-ep5", "policy": "hf", "model": "Qwen/Qwen2.5-7B-Instruct", "adapter": "outputs/sft_Qwen2.5-7B-Instruct"}
|
| 15 |
+
{"task_id": "h1_acquisition_defence", "policy_kind": "model", "steps": 13, "total_reward": 3.4625, "terminal_reward": 0.8825, "reward_trace": [0.09000000000000001, 0.09000000000000001, 0.29000000000000004, 0.19, 0.19, 0.19, 0.39, 0.19, 0.19, 0.39, 0.19, 0.19, 0.8824999999999998], "verifier_pass_rate": 0.75, "passed_checks": ["all_agents_consulted", "multi_conflict_logged", "conflict_explicitly_resolved", "resolution_has_type", "counter_offer_present", "deadline_present", "retention_addressed", "no_single_agent_copied", "swd_version_rich"], "failed_checks": ["rich_reasoning_log", "timeline_constraint_acknowledged", "all_phases_reached"], "milestones_total": 5, "milestones_complete": 4, "milestones_missed": 0, "invalid_action_count": 0, "env_error_count": 0, "errors": [], "final_swd_version": 14, "success": false, "episode_index": 4, "model_stage": "sft-qwen2.5-7b-fresh-ep5", "policy": "hf", "model": "Qwen/Qwen2.5-7B-Instruct", "adapter": "outputs/sft_Qwen2.5-7B-Instruct"}
|
results/runs/qwen3_14b__base/base_qwen3_14b_eval.jsonl
ADDED
|
@@ -0,0 +1,9 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
{"task_id": "e1_launch_readiness", "policy_kind": "model", "steps": 3, "total_reward": 1.39, "terminal_reward": 0.91, "reward_trace": [0.29000000000000004, 0.19, 0.9099999999999999], "verifier_pass_rate": 1.0, "passed_checks": ["qa_report_present", "final_rec_valid", "no_missed_milestones"], "failed_checks": [], "milestones_total": 2, "milestones_complete": 2, "milestones_missed": 0, "invalid_action_count": 0, "env_error_count": 0, "errors": [], "final_swd_version": 4, "success": true, "episode_index": 0, "model_stage": "base_qwen3_14b", "policy": "hf", "model": "Qwen/Qwen3-14B", "adapter": ""}
|
| 2 |
+
{"task_id": "m1_budget_reallocation", "policy_kind": "model", "steps": 5, "total_reward": 1.766667, "terminal_reward": 0.806667, "reward_trace": [0.09000000000000001, 0.29000000000000004, 0.19, 0.39, 0.8066666666666666], "verifier_pass_rate": 0.666667, "passed_checks": ["required_agents_consulted", "conflict_logged", "conflict_resolved", "phased_plan"], "failed_checks": ["budget_constraint_acknowledged", "reasoning_documented"], "milestones_total": 3, "milestones_complete": 3, "milestones_missed": 0, "invalid_action_count": 0, "env_error_count": 0, "errors": [], "final_swd_version": 6, "success": false, "episode_index": 0, "model_stage": "base_qwen3_14b", "policy": "hf", "model": "Qwen/Qwen3-14B", "adapter": ""}
|
| 3 |
+
{"task_id": "h1_acquisition_defence", "policy_kind": "model", "steps": 10, "total_reward": 2.2825, "terminal_reward": 0.8225, "reward_trace": [0.09000000000000001, 0.09000000000000001, 0.29000000000000004, -0.16, -0.01, 0.19, 0.39, 0.39, 0.19, 0.8225], "verifier_pass_rate": 0.75, "passed_checks": ["all_agents_consulted", "multi_conflict_logged", "conflict_explicitly_resolved", "resolution_has_type", "counter_offer_present", "deadline_present", "retention_addressed", "no_single_agent_copied", "swd_version_rich"], "failed_checks": ["rich_reasoning_log", "timeline_constraint_acknowledged", "all_phases_reached"], "milestones_total": 5, "milestones_complete": 4, "milestones_missed": 0, "invalid_action_count": 1, "env_error_count": 2, "errors": ["log_conflict invalid JSON: Extra data: line 1 column 140 (char 139)", "invalid_action: unbalanced JSON object"], "final_swd_version": 9, "success": false, "episode_index": 0, "model_stage": "base_qwen3_14b", "policy": "hf", "model": "Qwen/Qwen3-14B", "adapter": ""}
|
| 4 |
+
{"task_id": "e1_launch_readiness", "policy_kind": "model", "steps": 3, "total_reward": 1.39, "terminal_reward": 0.91, "reward_trace": [0.29000000000000004, 0.19, 0.9099999999999999], "verifier_pass_rate": 1.0, "passed_checks": ["qa_report_present", "final_rec_valid", "no_missed_milestones"], "failed_checks": [], "milestones_total": 2, "milestones_complete": 2, "milestones_missed": 0, "invalid_action_count": 0, "env_error_count": 0, "errors": [], "final_swd_version": 4, "success": true, "episode_index": 1, "model_stage": "base_qwen3_14b", "policy": "hf", "model": "Qwen/Qwen3-14B", "adapter": ""}
|
| 5 |
+
{"task_id": "m1_budget_reallocation", "policy_kind": "model", "steps": 5, "total_reward": 1.766667, "terminal_reward": 0.806667, "reward_trace": [0.09000000000000001, 0.29000000000000004, 0.19, 0.39, 0.8066666666666666], "verifier_pass_rate": 0.666667, "passed_checks": ["required_agents_consulted", "conflict_logged", "conflict_resolved", "phased_plan"], "failed_checks": ["budget_constraint_acknowledged", "reasoning_documented"], "milestones_total": 3, "milestones_complete": 3, "milestones_missed": 0, "invalid_action_count": 0, "env_error_count": 0, "errors": [], "final_swd_version": 6, "success": false, "episode_index": 1, "model_stage": "base_qwen3_14b", "policy": "hf", "model": "Qwen/Qwen3-14B", "adapter": ""}
|
| 6 |
+
{"task_id": "h1_acquisition_defence", "policy_kind": "model", "steps": 8, "total_reward": 2.4525, "terminal_reward": 0.8225, "reward_trace": [0.09000000000000001, 0.09000000000000001, 0.29000000000000004, 0.19, 0.39, 0.39, 0.19, 0.8225], "verifier_pass_rate": 0.75, "passed_checks": ["all_agents_consulted", "multi_conflict_logged", "conflict_explicitly_resolved", "resolution_has_type", "counter_offer_present", "deadline_present", "retention_addressed", "no_single_agent_copied", "swd_version_rich"], "failed_checks": ["rich_reasoning_log", "timeline_constraint_acknowledged", "all_phases_reached"], "milestones_total": 5, "milestones_complete": 4, "milestones_missed": 0, "invalid_action_count": 0, "env_error_count": 0, "errors": [], "final_swd_version": 9, "success": false, "episode_index": 1, "model_stage": "base_qwen3_14b", "policy": "hf", "model": "Qwen/Qwen3-14B", "adapter": ""}
|
| 7 |
+
{"task_id": "e1_launch_readiness", "policy_kind": "model", "steps": 3, "total_reward": 1.39, "terminal_reward": 0.91, "reward_trace": [0.29000000000000004, 0.19, 0.9099999999999999], "verifier_pass_rate": 1.0, "passed_checks": ["qa_report_present", "final_rec_valid", "no_missed_milestones"], "failed_checks": [], "milestones_total": 2, "milestones_complete": 2, "milestones_missed": 0, "invalid_action_count": 0, "env_error_count": 0, "errors": [], "final_swd_version": 4, "success": true, "episode_index": 2, "model_stage": "base_qwen3_14b", "policy": "hf", "model": "Qwen/Qwen3-14B", "adapter": ""}
|
| 8 |
+
{"task_id": "m1_budget_reallocation", "policy_kind": "model", "steps": 5, "total_reward": 1.766667, "terminal_reward": 0.806667, "reward_trace": [0.09000000000000001, 0.29000000000000004, 0.19, 0.39, 0.8066666666666666], "verifier_pass_rate": 0.666667, "passed_checks": ["required_agents_consulted", "conflict_logged", "conflict_resolved", "phased_plan"], "failed_checks": ["budget_constraint_acknowledged", "reasoning_documented"], "milestones_total": 3, "milestones_complete": 3, "milestones_missed": 0, "invalid_action_count": 0, "env_error_count": 0, "errors": [], "final_swd_version": 6, "success": false, "episode_index": 2, "model_stage": "base_qwen3_14b", "policy": "hf", "model": "Qwen/Qwen3-14B", "adapter": ""}
|
| 9 |
+
{"task_id": "h1_acquisition_defence", "policy_kind": "model", "steps": 7, "total_reward": 2.2625, "terminal_reward": 0.8225, "reward_trace": [0.09000000000000001, 0.09000000000000001, 0.29000000000000004, 0.19, 0.39, 0.39, 0.8225], "verifier_pass_rate": 0.75, "passed_checks": ["all_agents_consulted", "multi_conflict_logged", "conflict_explicitly_resolved", "resolution_has_type", "counter_offer_present", "deadline_present", "retention_addressed", "no_single_agent_copied", "swd_version_rich"], "failed_checks": ["rich_reasoning_log", "timeline_constraint_acknowledged", "all_phases_reached"], "milestones_total": 5, "milestones_complete": 4, "milestones_missed": 0, "invalid_action_count": 0, "env_error_count": 0, "errors": [], "final_swd_version": 8, "success": false, "episode_index": 2, "model_stage": "base_qwen3_14b", "policy": "hf", "model": "Qwen/Qwen3-14B", "adapter": ""}
|
results/runs/qwen3_14b__base/metadata.json
ADDED
|
@@ -0,0 +1,32 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
{
|
| 2 |
+
"model_stage": "base_qwen3_14b",
|
| 3 |
+
"policy": "hf",
|
| 4 |
+
"model": "Qwen/Qwen3-14B",
|
| 5 |
+
"adapter": "",
|
| 6 |
+
"tasks": [
|
| 7 |
+
"e1_launch_readiness",
|
| 8 |
+
"m1_budget_reallocation",
|
| 9 |
+
"h1_acquisition_defence"
|
| 10 |
+
],
|
| 11 |
+
"episodes": 3,
|
| 12 |
+
"max_steps": 30,
|
| 13 |
+
"max_new_tokens": 1536,
|
| 14 |
+
"eval_file": "results/runs/qwen3_14b__base/base_qwen3_14b_eval.jsonl",
|
| 15 |
+
"metrics_by_task": {
|
| 16 |
+
"e1_launch_readiness": {
|
| 17 |
+
"avg_terminal_reward": 0.91,
|
| 18 |
+
"avg_verifier_pass_rate": 1.0,
|
| 19 |
+
"success_rate": 1.0
|
| 20 |
+
},
|
| 21 |
+
"m1_budget_reallocation": {
|
| 22 |
+
"avg_terminal_reward": 0.806667,
|
| 23 |
+
"avg_verifier_pass_rate": 0.666667,
|
| 24 |
+
"success_rate": 0.0
|
| 25 |
+
},
|
| 26 |
+
"h1_acquisition_defence": {
|
| 27 |
+
"avg_terminal_reward": 0.8225,
|
| 28 |
+
"avg_verifier_pass_rate": 0.75,
|
| 29 |
+
"success_rate": 0.0
|
| 30 |
+
}
|
| 31 |
+
}
|
| 32 |
+
}
|
results/runs/rlvr_qwen2.5_7b_fresh_stats.jsonl
ADDED
|
@@ -0,0 +1,3 @@
|
|
|
|
|
|
|
|
|
|
|
|
|
| 1 |
+
{"prompts_seen": 128.0, "prompts_kept": 128.0, "keep_rate": 1.0, "mean_best_reward": 0.6200325520833333, "mean_sample_reward": 0.6200325520833333, "total_rollouts": 1024.0, "seconds": 310.7949016094208, "keep_rate/h1_acquisition_defence": 1.0, "reward_status/ok": 1024.0, "round": 1}
|
| 2 |
+
{"prompts_seen": 128.0, "prompts_kept": 128.0, "keep_rate": 1.0, "mean_best_reward": 0.6201953125, "mean_sample_reward": 0.6201953125, "total_rollouts": 1024.0, "seconds": 311.80109000205994, "keep_rate/h1_acquisition_defence": 1.0, "reward_status/ok": 1024.0, "round": 2}
|
| 3 |
+
{"prompts_seen": 128.0, "prompts_kept": 128.0, "keep_rate": 1.0, "mean_best_reward": 0.6194791666666667, "mean_sample_reward": 0.6194791666666667, "total_rollouts": 1024.0, "seconds": 307.97119879722595, "keep_rate/h1_acquisition_defence": 1.0, "reward_status/ok": 1024.0, "round": 3}
|