File size: 3,946 Bytes
20a47b1
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
2
3
4
5
6
7
8
9
10
11
12
13
14
15
16
17
18
19
20
21
22
23
24
25
26
27
28
29
30
31
32
33
34
35
36
37
38
39
40
41
42
43
44
45
46
47
48
49
50
51
52
53
54
55
56
57
58
59
60
61
62
63
64
65
66
67
68
69
70
71
72
73
74
75
76
77
78
79
80
81
82
83
84
85
86
87
88
89
90
91
92
93
94
95
96
97
98
99
100
101
102
103
104
105
106
107
108
109
110
111
112
113
114
115
116
117
118
119
120
121
122
123
124
125
126
127
128
129
130
131
132
133
134
135
136
137
138
139
140
141
142
143
144
145
146
147
148
149
150
151
152
153
154
155
156
157
158
159
160
161
162
[
  {
    "step": 5,
    "training_loss": 0.036,
    "reward": 0.015,
    "reward_std": 0.176603,
    "mean_length": 74.5,
    "min_length": 70.0,
    "max_length": 87.8,
    "clipped_ratio": 0.05,
    "mean_terminated_length": 70.525,
    "min_terminated_length": 70.0,
    "max_terminated_length": 72.4,
    "kl": 0.719967,
    "rlvr_reward_mean": 0.015,
    "rlvr_reward_std": 0.290382
  },
  {
    "step": 10,
    "training_loss": 0.0377,
    "reward": 0.01,
    "reward_std": 0.17,
    "mean_length": 71.025,
    "min_length": 70.0,
    "max_length": 77.4,
    "clipped_ratio": 0.0,
    "mean_terminated_length": 71.025,
    "min_terminated_length": 70.0,
    "max_terminated_length": 77.4,
    "kl": 0.754907,
    "rlvr_reward_mean": 0.01,
    "rlvr_reward_std": 0.321286
  },
  {
    "step": 15,
    "training_loss": 0.0351,
    "reward": 0.11,
    "reward_std": 0.219114,
    "mean_length": 70.2,
    "min_length": 69.6,
    "max_length": 71.4,
    "clipped_ratio": 0.0,
    "mean_terminated_length": 70.2,
    "min_terminated_length": 69.6,
    "max_terminated_length": 71.4,
    "kl": 0.701821,
    "rlvr_reward_mean": 0.11,
    "rlvr_reward_std": 0.605215
  },
  {
    "step": 20,
    "training_loss": 0.0385,
    "reward": 0.0825,
    "reward_std": 0.172561,
    "mean_length": 70.8,
    "min_length": 70.0,
    "max_length": 73.4,
    "clipped_ratio": 0.0,
    "mean_terminated_length": 70.8,
    "min_terminated_length": 70.0,
    "max_terminated_length": 73.4,
    "kl": 0.769613,
    "rlvr_reward_mean": 0.0825,
    "rlvr_reward_std": 0.563774
  },
  {
    "step": 25,
    "training_loss": 0.0368,
    "reward": 0.06,
    "reward_std": 0.322703,
    "mean_length": 71.4,
    "min_length": 69.8,
    "max_length": 76.4,
    "clipped_ratio": 0.0,
    "mean_terminated_length": 71.4,
    "min_terminated_length": 69.8,
    "max_terminated_length": 76.4,
    "kl": 0.736659,
    "rlvr_reward_mean": 0.06,
    "rlvr_reward_std": 0.57968
  },
  {
    "step": 30,
    "training_loss": 0.0333,
    "reward": 0.1125,
    "reward_std": 0.152915,
    "mean_length": 72.625,
    "min_length": 70.0,
    "max_length": 80.8,
    "clipped_ratio": 0.0,
    "mean_terminated_length": 72.625,
    "min_terminated_length": 70.0,
    "max_terminated_length": 80.8,
    "kl": 0.666011,
    "rlvr_reward_mean": 0.1125,
    "rlvr_reward_std": 0.366824
  },
  {
    "step": 35,
    "training_loss": 0.0321,
    "reward": 0.02,
    "reward_std": 0.251373,
    "mean_length": 74.025,
    "min_length": 67.8,
    "max_length": 92.8,
    "clipped_ratio": 0.025,
    "mean_terminated_length": 72.103572,
    "min_terminated_length": 67.8,
    "max_terminated_length": 78.0,
    "kl": 0.642058,
    "rlvr_reward_mean": 0.02,
    "rlvr_reward_std": 0.589289
  },
  {
    "step": 40,
    "training_loss": 0.0289,
    "reward": 0.005,
    "reward_std": 0.176188,
    "mean_length": 73.275,
    "min_length": 67.6,
    "max_length": 90.6,
    "clipped_ratio": 0.025,
    "mean_terminated_length": 71.382144,
    "min_terminated_length": 67.6,
    "max_terminated_length": 76.4,
    "kl": 0.578678,
    "rlvr_reward_mean": 0.005,
    "rlvr_reward_std": 0.618447
  },
  {
    "step": 45,
    "training_loss": 0.0267,
    "reward": 0.0525,
    "reward_std": 0.190203,
    "mean_length": 71.775,
    "min_length": 69.8,
    "max_length": 74.4,
    "clipped_ratio": 0.0,
    "mean_terminated_length": 71.775,
    "min_terminated_length": 69.8,
    "max_terminated_length": 74.4,
    "kl": 0.533456,
    "rlvr_reward_mean": 0.0525,
    "rlvr_reward_std": 0.482638
  },
  {
    "step": 50,
    "training_loss": 0.0272,
    "reward": -0.0925,
    "reward_std": 0.37086,
    "mean_length": 76.95,
    "min_length": 68.2,
    "max_length": 107.6,
    "clipped_ratio": 0.05,
    "mean_terminated_length": 73.139287,
    "min_terminated_length": 68.2,
    "max_terminated_length": 82.8,
    "kl": 0.543908,
    "rlvr_reward_mean": -0.0925,
    "rlvr_reward_std": 0.45598
  }
]