Pranav2748 commited on
Commit
348f33d
·
verified ·
1 Parent(s): f6ff951

Add outputs/pairs_4b

Browse files
.gitattributes CHANGED
@@ -39,3 +39,4 @@ logs/figures/E0-baseline_diagnostics.png filter=lfs diff=lfs merge=lfs -text
39
  logs/figures/E0-baseline_trajectory.png filter=lfs diff=lfs merge=lfs -text
40
  logs/figures/E0_entropy_live.png filter=lfs diff=lfs merge=lfs -text
41
  logs/figures/E0_live_dashboard.png filter=lfs diff=lfs merge=lfs -text
 
 
39
  logs/figures/E0-baseline_trajectory.png filter=lfs diff=lfs merge=lfs -text
40
  logs/figures/E0_entropy_live.png filter=lfs diff=lfs merge=lfs -text
41
  logs/figures/E0_live_dashboard.png filter=lfs diff=lfs merge=lfs -text
42
+ outputs/pairs_4b/multipos_train.jsonl filter=lfs diff=lfs merge=lfs -text
outputs/pairs_4b/divpo_emb_train.jsonl ADDED
The diff for this file is too large to render. See raw diff
 
outputs/pairs_4b/divpo_prob_train.jsonl ADDED
The diff for this file is too large to render. See raw diff
 
outputs/pairs_4b/multipos_train.jsonl ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:4b22919c76fe36794155c8997040497c20a45783059d9dabc5080477172e733a
3
+ size 18112100
outputs/pairs_4b/pair_stats_train.json ADDED
@@ -0,0 +1,41 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "divpo-emb": {
3
+ "criterion": "divpo-emb",
4
+ "rho": 7.0,
5
+ "n_prompts": 1000,
6
+ "n_rows": 956,
7
+ "no_chosen": 12,
8
+ "no_rejected": 32,
9
+ "ok": 956,
10
+ "skip_rate": 0.04400000000000004,
11
+ "rho_adjusted_from": 6.0,
12
+ "reason": "skip_rate 0.314 > 0.3 (no_chosen=3, no_rejected=311); swept [3.0, 4.0, 5.0, 6.0, 7.0, 8.0, 9.0] -> rho=7.0"
13
+ },
14
+ "divpo-prob": {
15
+ "criterion": "divpo-prob",
16
+ "rho": 7.0,
17
+ "n_prompts": 1000,
18
+ "n_rows": 956,
19
+ "no_chosen": 12,
20
+ "no_rejected": 32,
21
+ "ok": 956,
22
+ "skip_rate": 0.04400000000000004,
23
+ "rho_adjusted_from": 6.0,
24
+ "reason": "skip_rate 0.314 > 0.3 (no_chosen=3, no_rejected=311); swept [3.0, 4.0, 5.0, 6.0, 7.0, 8.0, 9.0] -> rho=7.0"
25
+ },
26
+ "e3-multipos": {
27
+ "n_prompts": 1000,
28
+ "skipped_no_survivors": 3,
29
+ "skipped_no_negatives": 0,
30
+ "ok": 997,
31
+ "n_rows": 3593,
32
+ "mean_chosen_per_prompt": 3.9979939819458377,
33
+ "skip_rate": 0.0030000000000000027,
34
+ "weight_mean_after_norm": 1.0,
35
+ "weight_sd": 0.29810715542051675,
36
+ "neg_type_counts": {
37
+ "r_Q": 1991,
38
+ "r_D": 1602
39
+ }
40
+ }
41
+ }