PRATYUSH-BHARDWAJ commited on
Commit
3aa0fdd
·
verified ·
1 Parent(s): cf02942

SFT checkpoint step 58

Browse files
checkpoints/checkpoint-58/adapter_model.safetensors CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:ea6862c6cf353de778a159ea0f907cb011f50089bf659d42648539746d0937b9
3
  size 204500912
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:db17a50472276b863efebaae63dd5173d1d71e5afe697186713de94b3e671fd6
3
  size 204500912
checkpoints/checkpoint-58/optimizer.pt CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:df7502b47f9417a68d9d52633285620465862a5ef2bedc8286d9886dbf7e6990
3
  size 620569547
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:a947c02b62f310e91e205429a144af3de2f7ccf8b8f6ebe7175d109091126c1b
3
  size 620569547
checkpoints/checkpoint-58/scaler.pt CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:94daf24225993d49e3b9dae55d8f50c9ca8d34c6de2f05ec79c39db3cde15c72
3
  size 1383
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:72b216d080578100bd57ee7cdb48421e348ca42dd3c8025e9877a55f62e8737f
3
  size 1383
checkpoints/checkpoint-58/scheduler.pt CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:a5e9a21fee0ed695b918359d73521fd31afdc5745d9a5621dafc5600643d2c22
3
  size 1465
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:645097abd69992527144f761706f73c4c082ca049e8ce9eff30ed02004535f77
3
  size 1465
checkpoints/checkpoint-58/time_state.json CHANGED
@@ -1 +1 @@
1
- {"consumed_seconds": 514.7618689537048, "global_step": 58}
 
1
+ {"consumed_seconds": 535.0243752002716, "global_step": 58}
checkpoints/checkpoint-58/trainer_state.json CHANGED
@@ -17,15 +17,15 @@
17
  "num_input_tokens_seen": 1494,
18
  "num_tokens": 1494.0,
19
  "step": 1,
20
- "train_runtime": 44.9864,
21
- "train_tokens_per_second": 33.21
22
  },
23
  {
24
  "epoch": 0.06956521739130435,
25
  "eval_loss": 5.31978178024292,
26
  "eval_num_tokens": 4980.0,
27
- "eval_runtime": 28.6663,
28
- "eval_samples_per_second": 1.047,
29
  "eval_steps_per_second": 0.279,
30
  "num_input_tokens_seen": 4980,
31
  "step": 4
@@ -34,194 +34,194 @@
34
  "epoch": 0.1391304347826087,
35
  "eval_loss": 5.31978178024292,
36
  "eval_num_tokens": 9004.0,
37
- "eval_runtime": 3.5559,
38
- "eval_samples_per_second": 8.437,
39
- "eval_steps_per_second": 2.25,
40
  "num_input_tokens_seen": 9004,
41
  "step": 8
42
  },
43
  {
44
  "epoch": 0.17391304347826086,
45
- "grad_norm": 28.138591766357422,
46
  "learning_rate": 0.0,
47
  "loss": 2.5477417839898004,
48
  "num_input_tokens_seen": 11145,
49
  "num_tokens": 11145.0,
50
  "step": 10,
51
- "train_runtime": 145.0656,
52
- "train_tokens_per_second": 76.827
53
  },
54
  {
55
  "epoch": 0.20869565217391303,
56
- "eval_loss": 1.795594573020935,
57
  "eval_num_tokens": 13293.0,
58
- "eval_runtime": 3.5484,
59
- "eval_samples_per_second": 8.455,
60
- "eval_steps_per_second": 2.255,
61
  "num_input_tokens_seen": 13293,
62
  "step": 12
63
  },
64
  {
65
  "epoch": 0.2782608695652174,
66
- "eval_loss": 0.5860968232154846,
67
  "eval_num_tokens": 17742.0,
68
- "eval_runtime": 3.4658,
69
- "eval_samples_per_second": 8.656,
70
- "eval_steps_per_second": 2.308,
71
  "num_input_tokens_seen": 17742,
72
  "step": 16
73
  },
74
  {
75
  "epoch": 0.34782608695652173,
76
- "grad_norm": 7.353201389312744,
77
- "learning_rate": 0.0001442909649383465,
78
- "loss": 0.8008382797241211,
79
  "num_input_tokens_seen": 20264,
80
  "num_tokens": 20264.0,
81
  "step": 20,
82
- "train_runtime": 227.664,
83
- "train_tokens_per_second": 89.008
84
  },
85
  {
86
  "epoch": 0.34782608695652173,
87
- "eval_loss": 0.39688172936439514,
88
  "eval_num_tokens": 20264.0,
89
- "eval_runtime": 3.494,
90
- "eval_samples_per_second": 8.586,
91
- "eval_steps_per_second": 2.29,
92
  "num_input_tokens_seen": 20264,
93
  "step": 20
94
  },
95
  {
96
  "epoch": 0.41739130434782606,
97
- "eval_loss": 0.5452550053596497,
98
  "eval_num_tokens": 24990.0,
99
- "eval_runtime": 3.5856,
100
- "eval_samples_per_second": 8.367,
101
- "eval_steps_per_second": 2.231,
102
  "num_input_tokens_seen": 24990,
103
  "step": 24
104
  },
105
  {
106
  "epoch": 0.48695652173913045,
107
- "eval_loss": 0.31608301401138306,
108
  "eval_num_tokens": 28628.0,
109
- "eval_runtime": 3.5529,
110
- "eval_samples_per_second": 8.444,
111
- "eval_steps_per_second": 2.252,
112
  "num_input_tokens_seen": 28628,
113
  "step": 28
114
  },
115
  {
116
  "epoch": 0.5217391304347826,
117
- "grad_norm": 2.936347007751465,
118
- "learning_rate": 0.00011840034721348544,
119
- "loss": 0.20213119983673095,
120
  "num_input_tokens_seen": 30604,
121
  "num_tokens": 30604.0,
122
  "step": 30,
123
- "train_runtime": 314.4011,
124
- "train_tokens_per_second": 97.341
125
  },
126
  {
127
  "epoch": 0.5565217391304348,
128
- "eval_loss": 0.3312884569168091,
129
  "eval_num_tokens": 33017.0,
130
- "eval_runtime": 3.5533,
131
- "eval_samples_per_second": 8.443,
132
- "eval_steps_per_second": 2.251,
133
  "num_input_tokens_seen": 33017,
134
  "step": 32
135
  },
136
  {
137
  "epoch": 0.6260869565217392,
138
- "eval_loss": 0.23424790799617767,
139
  "eval_num_tokens": 37556.0,
140
- "eval_runtime": 3.4971,
141
- "eval_samples_per_second": 8.579,
142
- "eval_steps_per_second": 2.288,
143
  "num_input_tokens_seen": 37556,
144
  "step": 36
145
  },
146
  {
147
  "epoch": 0.6956521739130435,
148
- "grad_norm": 2.543781280517578,
149
- "learning_rate": 7.920528354278937e-05,
150
- "loss": 0.12761373519897462,
151
  "num_input_tokens_seen": 43339,
152
  "num_tokens": 43339.0,
153
  "step": 40,
154
- "train_runtime": 381.0466,
155
- "train_tokens_per_second": 113.737
156
  },
157
  {
158
  "epoch": 0.6956521739130435,
159
- "eval_loss": 0.20891477167606354,
160
  "eval_num_tokens": 43339.0,
161
- "eval_runtime": 3.4787,
162
- "eval_samples_per_second": 8.624,
163
- "eval_steps_per_second": 2.3,
164
  "num_input_tokens_seen": 43339,
165
  "step": 40
166
  },
167
  {
168
  "epoch": 0.7652173913043478,
169
- "eval_loss": 0.16005884110927582,
170
  "eval_num_tokens": 51343.0,
171
- "eval_runtime": 3.5211,
172
- "eval_samples_per_second": 8.52,
173
- "eval_steps_per_second": 2.272,
174
  "num_input_tokens_seen": 51343,
175
  "step": 44
176
  },
177
  {
178
  "epoch": 0.8347826086956521,
179
- "eval_loss": 0.1316540390253067,
180
  "eval_num_tokens": 55787.0,
181
- "eval_runtime": 3.5293,
182
- "eval_samples_per_second": 8.5,
183
- "eval_steps_per_second": 2.267,
184
  "num_input_tokens_seen": 55787,
185
  "step": 48
186
  },
187
  {
188
  "epoch": 0.8695652173913043,
189
- "grad_norm": 2.2746105194091797,
190
- "learning_rate": 3.872108346710701e-05,
191
- "loss": 0.103130304813385,
192
  "num_input_tokens_seen": 56637,
193
  "num_tokens": 56637.0,
194
  "step": 50,
195
- "train_runtime": 459.3749,
196
- "train_tokens_per_second": 123.291
197
  },
198
  {
199
  "epoch": 0.9043478260869565,
200
- "eval_loss": 0.10423395037651062,
201
  "eval_num_tokens": 60640.0,
202
- "eval_runtime": 3.4932,
203
- "eval_samples_per_second": 8.588,
204
- "eval_steps_per_second": 2.29,
205
  "num_input_tokens_seen": 60640,
206
  "step": 52
207
  },
208
  {
209
  "epoch": 0.9739130434782609,
210
- "eval_loss": 0.08810122311115265,
211
  "eval_num_tokens": 66252.0,
212
- "eval_runtime": 3.5537,
213
- "eval_samples_per_second": 8.442,
214
- "eval_steps_per_second": 2.251,
215
  "num_input_tokens_seen": 66252,
216
  "step": 56
217
  },
218
  {
219
  "epoch": 1.0,
220
- "eval_loss": 0.0836324393749237,
221
  "eval_num_tokens": 67398.0,
222
- "eval_runtime": 3.4688,
223
- "eval_samples_per_second": 8.649,
224
- "eval_steps_per_second": 2.306,
225
  "num_input_tokens_seen": 67398,
226
  "step": 58
227
  }
 
17
  "num_input_tokens_seen": 1494,
18
  "num_tokens": 1494.0,
19
  "step": 1,
20
+ "train_runtime": 42.4619,
21
+ "train_tokens_per_second": 35.185
22
  },
23
  {
24
  "epoch": 0.06956521739130435,
25
  "eval_loss": 5.31978178024292,
26
  "eval_num_tokens": 4980.0,
27
+ "eval_runtime": 28.7144,
28
+ "eval_samples_per_second": 1.045,
29
  "eval_steps_per_second": 0.279,
30
  "num_input_tokens_seen": 4980,
31
  "step": 4
 
34
  "epoch": 0.1391304347826087,
35
  "eval_loss": 5.31978178024292,
36
  "eval_num_tokens": 9004.0,
37
+ "eval_runtime": 3.4006,
38
+ "eval_samples_per_second": 8.822,
39
+ "eval_steps_per_second": 2.353,
40
  "num_input_tokens_seen": 9004,
41
  "step": 8
42
  },
43
  {
44
  "epoch": 0.17391304347826086,
45
+ "grad_norm": 28.1390438079834,
46
  "learning_rate": 0.0,
47
  "loss": 2.5477417839898004,
48
  "num_input_tokens_seen": 11145,
49
  "num_tokens": 11145.0,
50
  "step": 10,
51
+ "train_runtime": 146.4448,
52
+ "train_tokens_per_second": 76.104
53
  },
54
  {
55
  "epoch": 0.20869565217391303,
56
+ "eval_loss": 1.7850792407989502,
57
  "eval_num_tokens": 13293.0,
58
+ "eval_runtime": 3.4816,
59
+ "eval_samples_per_second": 8.617,
60
+ "eval_steps_per_second": 2.298,
61
  "num_input_tokens_seen": 13293,
62
  "step": 12
63
  },
64
  {
65
  "epoch": 0.2782608695652174,
66
+ "eval_loss": 0.5965744256973267,
67
  "eval_num_tokens": 17742.0,
68
+ "eval_runtime": 3.4391,
69
+ "eval_samples_per_second": 8.723,
70
+ "eval_steps_per_second": 2.326,
71
  "num_input_tokens_seen": 17742,
72
  "step": 16
73
  },
74
  {
75
  "epoch": 0.34782608695652173,
76
+ "grad_norm": 6.518080711364746,
77
+ "learning_rate": 0.0001425726650926814,
78
+ "loss": 0.7919160842895507,
79
  "num_input_tokens_seen": 20264,
80
  "num_tokens": 20264.0,
81
  "step": 20,
82
+ "train_runtime": 241.9804,
83
+ "train_tokens_per_second": 83.742
84
  },
85
  {
86
  "epoch": 0.34782608695652173,
87
+ "eval_loss": 0.6307523250579834,
88
  "eval_num_tokens": 20264.0,
89
+ "eval_runtime": 3.512,
90
+ "eval_samples_per_second": 8.542,
91
+ "eval_steps_per_second": 2.278,
92
  "num_input_tokens_seen": 20264,
93
  "step": 20
94
  },
95
  {
96
  "epoch": 0.41739130434782606,
97
+ "eval_loss": 0.3135659396648407,
98
  "eval_num_tokens": 24990.0,
99
+ "eval_runtime": 3.4341,
100
+ "eval_samples_per_second": 8.736,
101
+ "eval_steps_per_second": 2.33,
102
  "num_input_tokens_seen": 24990,
103
  "step": 24
104
  },
105
  {
106
  "epoch": 0.48695652173913045,
107
+ "eval_loss": 0.4761301875114441,
108
  "eval_num_tokens": 28628.0,
109
+ "eval_runtime": 3.4198,
110
+ "eval_samples_per_second": 8.772,
111
+ "eval_steps_per_second": 2.339,
112
  "num_input_tokens_seen": 28628,
113
  "step": 28
114
  },
115
  {
116
  "epoch": 0.5217391304347826,
117
+ "grad_norm": 3.650630235671997,
118
+ "learning_rate": 0.00011490240573865023,
119
+ "loss": 0.22239422798156738,
120
  "num_input_tokens_seen": 30604,
121
  "num_tokens": 30604.0,
122
  "step": 30,
123
+ "train_runtime": 326.8185,
124
+ "train_tokens_per_second": 93.642
125
  },
126
  {
127
  "epoch": 0.5565217391304348,
128
+ "eval_loss": 0.2599254846572876,
129
  "eval_num_tokens": 33017.0,
130
+ "eval_runtime": 3.409,
131
+ "eval_samples_per_second": 8.8,
132
+ "eval_steps_per_second": 2.347,
133
  "num_input_tokens_seen": 33017,
134
  "step": 32
135
  },
136
  {
137
  "epoch": 0.6260869565217392,
138
+ "eval_loss": 0.17896154522895813,
139
  "eval_num_tokens": 37556.0,
140
+ "eval_runtime": 3.3953,
141
+ "eval_samples_per_second": 8.836,
142
+ "eval_steps_per_second": 2.356,
143
  "num_input_tokens_seen": 37556,
144
  "step": 36
145
  },
146
  {
147
  "epoch": 0.6956521739130435,
148
+ "grad_norm": 3.054882049560547,
149
+ "learning_rate": 7.5e-05,
150
+ "loss": 0.1124645471572876,
151
  "num_input_tokens_seen": 43339,
152
  "num_tokens": 43339.0,
153
  "step": 40,
154
+ "train_runtime": 400.6098,
155
+ "train_tokens_per_second": 108.183
156
  },
157
  {
158
  "epoch": 0.6956521739130435,
159
+ "eval_loss": 0.19172506034374237,
160
  "eval_num_tokens": 43339.0,
161
+ "eval_runtime": 3.3581,
162
+ "eval_samples_per_second": 8.934,
163
+ "eval_steps_per_second": 2.382,
164
  "num_input_tokens_seen": 43339,
165
  "step": 40
166
  },
167
  {
168
  "epoch": 0.7652173913043478,
169
+ "eval_loss": 0.14692261815071106,
170
  "eval_num_tokens": 51343.0,
171
+ "eval_runtime": 3.409,
172
+ "eval_samples_per_second": 8.8,
173
+ "eval_steps_per_second": 2.347,
174
  "num_input_tokens_seen": 51343,
175
  "step": 44
176
  },
177
  {
178
  "epoch": 0.8347826086956521,
179
+ "eval_loss": 0.13185091316699982,
180
  "eval_num_tokens": 55787.0,
181
+ "eval_runtime": 3.4735,
182
+ "eval_samples_per_second": 8.637,
183
+ "eval_steps_per_second": 2.303,
184
  "num_input_tokens_seen": 55787,
185
  "step": 48
186
  },
187
  {
188
  "epoch": 0.8695652173913043,
189
+ "grad_norm": 2.5227229595184326,
190
+ "learning_rate": 3.5097594261349764e-05,
191
+ "loss": 0.08426350355148315,
192
  "num_input_tokens_seen": 56637,
193
  "num_tokens": 56637.0,
194
  "step": 50,
195
+ "train_runtime": 479.1478,
196
+ "train_tokens_per_second": 118.204
197
  },
198
  {
199
  "epoch": 0.9043478260869565,
200
+ "eval_loss": 0.09836789965629578,
201
  "eval_num_tokens": 60640.0,
202
+ "eval_runtime": 3.4114,
203
+ "eval_samples_per_second": 8.794,
204
+ "eval_steps_per_second": 2.345,
205
  "num_input_tokens_seen": 60640,
206
  "step": 52
207
  },
208
  {
209
  "epoch": 0.9739130434782609,
210
+ "eval_loss": 0.07989717274904251,
211
  "eval_num_tokens": 66252.0,
212
+ "eval_runtime": 3.4003,
213
+ "eval_samples_per_second": 8.823,
214
+ "eval_steps_per_second": 2.353,
215
  "num_input_tokens_seen": 66252,
216
  "step": 56
217
  },
218
  {
219
  "epoch": 1.0,
220
+ "eval_loss": 0.0754588395357132,
221
  "eval_num_tokens": 67398.0,
222
+ "eval_runtime": 3.3898,
223
+ "eval_samples_per_second": 8.85,
224
+ "eval_steps_per_second": 2.36,
225
  "num_input_tokens_seen": 67398,
226
  "step": 58
227
  }