ChiefTheLord commited on
Commit
3a41627
·
verified ·
1 Parent(s): a56dad2

Upload folder using huggingface_hub

Browse files
checkpoints-v1.0-discrete-semantc/checkpoint-20480/eval_state.json ADDED
The diff for this file is too large to render. See raw diff
 
checkpoints-v1.0-discrete-semantc/checkpoint-20480/model.safetensors ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:b767a63f41c3869eb7c2eef6745d19a9610b830f0f773532d674d05ebc4a0747
3
+ size 9318340
checkpoints-v1.0-discrete-semantc/checkpoint-20480/optimizer.pt ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:9847a8b1c64368508a4fc840883b4636601af3b5266ad17f564a9177e52c119b
3
+ size 1641995
checkpoints-v1.0-discrete-semantc/checkpoint-20480/rng_state.pth ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:66027b053d92554ecf06a4e17396590e01102bcf3b25d43bc5e6c98a2e5fd648
3
+ size 14645
checkpoints-v1.0-discrete-semantc/checkpoint-20480/scaler.pt ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:e1654750e91fad9c84d48b2b56e72818b509aa308aa50c4ccf5496b389664c5b
3
+ size 1383
checkpoints-v1.0-discrete-semantc/checkpoint-20480/scheduler.pt ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:ebd523f2f266d8d9e2fe88e1870b08c91dfa6ae1dc725a1649aff91c0b251fbb
3
+ size 1465
checkpoints-v1.0-discrete-semantc/checkpoint-20480/trainer_state.json ADDED
@@ -0,0 +1,824 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "best_global_step": null,
3
+ "best_metric": null,
4
+ "best_model_checkpoint": null,
5
+ "epoch": 0.2084382903582024,
6
+ "eval_steps": 2048,
7
+ "global_step": 20480,
8
+ "is_hyper_param_search": false,
9
+ "is_local_process_zero": true,
10
+ "is_world_process_zero": true,
11
+ "log_history": [
12
+ {
13
+ "epoch": 0.0026054786294775305,
14
+ "grad_norm": 0.25278976559638977,
15
+ "learning_rate": 0.000498046875,
16
+ "loss": 0.18901292979717255,
17
+ "step": 256
18
+ },
19
+ {
20
+ "epoch": 0.005210957258955061,
21
+ "grad_norm": 0.3028739094734192,
22
+ "learning_rate": 0.000998046875,
23
+ "loss": 0.13242575526237488,
24
+ "step": 512
25
+ },
26
+ {
27
+ "epoch": 0.007816435888432591,
28
+ "grad_norm": 0.23641528189182281,
29
+ "learning_rate": 0.0009999832063013975,
30
+ "loss": 0.1147228330373764,
31
+ "step": 768
32
+ },
33
+ {
34
+ "epoch": 0.010421914517910122,
35
+ "grad_norm": 0.1741982400417328,
36
+ "learning_rate": 0.0009999325626552273,
37
+ "loss": 0.10675819963216782,
38
+ "step": 1024
39
+ },
40
+ {
41
+ "epoch": 0.01302739314738765,
42
+ "grad_norm": 0.23829564452171326,
43
+ "learning_rate": 0.000999848072231934,
44
+ "loss": 0.10438411682844162,
45
+ "step": 1280
46
+ },
47
+ {
48
+ "epoch": 0.015632871776865183,
49
+ "grad_norm": 0.13794861733913422,
50
+ "learning_rate": 0.0009997297407517455,
51
+ "loss": 0.1017049103975296,
52
+ "step": 1536
53
+ },
54
+ {
55
+ "epoch": 0.018238350406342713,
56
+ "grad_norm": 0.17629992961883545,
57
+ "learning_rate": 0.0009995775762260215,
58
+ "loss": 0.0993618294596672,
59
+ "step": 1792
60
+ },
61
+ {
62
+ "epoch": 0.020843829035820244,
63
+ "grad_norm": 0.23240557312965393,
64
+ "learning_rate": 0.0009993915889567086,
65
+ "loss": 0.09926237165927887,
66
+ "step": 2048
67
+ },
68
+ {
69
+ "epoch": 0.020843829035820244,
70
+ "eval_bce_loss": 1.5750247291156223,
71
+ "eval_bleu": 0.0008629714973265223,
72
+ "eval_cos_loss": 0.23970603900296347,
73
+ "eval_loss": 0.10751142757279532,
74
+ "eval_mean_score": 0.6800641741071428,
75
+ "eval_mse_loss": 0.09176118011985507,
76
+ "step": 2048
77
+ },
78
+ {
79
+ "epoch": 0.020843829035820244,
80
+ "eval_bce_loss": 1.5750247291156223,
81
+ "eval_bleu": 0.0008629714973265223,
82
+ "eval_cos_loss": 0.23970603900296347,
83
+ "eval_loss": 0.10751142757279532,
84
+ "eval_mean_score": 0.6800641741071428,
85
+ "eval_mse_loss": 0.09176118011985507,
86
+ "eval_runtime": 18.5003,
87
+ "eval_samples_per_second": 118.917,
88
+ "eval_steps_per_second": 1.892,
89
+ "step": 2048
90
+ },
91
+ {
92
+ "epoch": 0.023449307665297774,
93
+ "grad_norm": 0.16738885641098022,
94
+ "learning_rate": 0.0009991717915356446,
95
+ "loss": 0.09865972399711609,
96
+ "step": 2304
97
+ },
98
+ {
99
+ "epoch": 0.0260547862947753,
100
+ "grad_norm": 0.16121487319469452,
101
+ "learning_rate": 0.0009989181988437053,
102
+ "loss": 0.09649977833032608,
103
+ "step": 2560
104
+ },
105
+ {
106
+ "epoch": 0.028660264924252832,
107
+ "grad_norm": 0.24666129052639008,
108
+ "learning_rate": 0.0009986308280497966,
109
+ "loss": 0.09620590507984161,
110
+ "step": 2816
111
+ },
112
+ {
113
+ "epoch": 0.031265743553730366,
114
+ "grad_norm": 0.1150430217385292,
115
+ "learning_rate": 0.0009983096986096933,
116
+ "loss": 0.0973711758852005,
117
+ "step": 3072
118
+ },
119
+ {
120
+ "epoch": 0.03387122218320789,
121
+ "grad_norm": 0.22624613344669342,
122
+ "learning_rate": 0.000997954832264721,
123
+ "loss": 0.09581801295280457,
124
+ "step": 3328
125
+ },
126
+ {
127
+ "epoch": 0.03647670081268543,
128
+ "grad_norm": 0.23274144530296326,
129
+ "learning_rate": 0.0009975662530402843,
130
+ "loss": 0.09428834170103073,
131
+ "step": 3584
132
+ },
133
+ {
134
+ "epoch": 0.039082179442162954,
135
+ "grad_norm": 0.2979954183101654,
136
+ "learning_rate": 0.0009971439872442397,
137
+ "loss": 0.0952843651175499,
138
+ "step": 3840
139
+ },
140
+ {
141
+ "epoch": 0.04168765807164049,
142
+ "grad_norm": 0.13622763752937317,
143
+ "learning_rate": 0.0009966880634651165,
144
+ "loss": 0.09436459839344025,
145
+ "step": 4096
146
+ },
147
+ {
148
+ "epoch": 0.04168765807164049,
149
+ "eval_bce_loss": 1.2727542996406556,
150
+ "eval_bleu": 0.0006777012438118088,
151
+ "eval_cos_loss": 0.2344500047819955,
152
+ "eval_loss": 0.10118420294352941,
153
+ "eval_mean_score": 0.71640625,
154
+ "eval_mse_loss": 0.0884566605091095,
155
+ "step": 4096
156
+ },
157
+ {
158
+ "epoch": 0.04168765807164049,
159
+ "eval_bce_loss": 1.2727542996406556,
160
+ "eval_bleu": 0.0006777012438118088,
161
+ "eval_cos_loss": 0.2344500047819955,
162
+ "eval_loss": 0.10118420294352941,
163
+ "eval_mean_score": 0.71640625,
164
+ "eval_mse_loss": 0.0884566605091095,
165
+ "eval_runtime": 19.465,
166
+ "eval_samples_per_second": 113.023,
167
+ "eval_steps_per_second": 1.798,
168
+ "step": 4096
169
+ },
170
+ {
171
+ "epoch": 0.044293136701118015,
172
+ "grad_norm": 0.14671610295772552,
173
+ "learning_rate": 0.0009961985125701786,
174
+ "loss": 0.09386898577213287,
175
+ "step": 4352
176
+ },
177
+ {
178
+ "epoch": 0.04689861533059555,
179
+ "grad_norm": 0.11165767163038254,
180
+ "learning_rate": 0.0009956753677033364,
181
+ "loss": 0.09496171772480011,
182
+ "step": 4608
183
+ },
184
+ {
185
+ "epoch": 0.049504093960073076,
186
+ "grad_norm": 0.19689643383026123,
187
+ "learning_rate": 0.000995118664282902,
188
+ "loss": 0.09313815832138062,
189
+ "step": 4864
190
+ },
191
+ {
192
+ "epoch": 0.0521095725895506,
193
+ "grad_norm": 0.12060590833425522,
194
+ "learning_rate": 0.0009945284399991924,
195
+ "loss": 0.09367529302835464,
196
+ "step": 5120
197
+ },
198
+ {
199
+ "epoch": 0.05471505121902814,
200
+ "grad_norm": 0.13436441123485565,
201
+ "learning_rate": 0.0009939047348119768,
202
+ "loss": 0.0925508588552475,
203
+ "step": 5376
204
+ },
205
+ {
206
+ "epoch": 0.057320529848505664,
207
+ "grad_norm": 0.1394355297088623,
208
+ "learning_rate": 0.0009932475909477712,
209
+ "loss": 0.092799112200737,
210
+ "step": 5632
211
+ },
212
+ {
213
+ "epoch": 0.0599260084779832,
214
+ "grad_norm": 0.16785988211631775,
215
+ "learning_rate": 0.0009925570528969802,
216
+ "loss": 0.09231170266866684,
217
+ "step": 5888
218
+ },
219
+ {
220
+ "epoch": 0.06253148710746073,
221
+ "grad_norm": 0.12323057651519775,
222
+ "learning_rate": 0.0009918331674108843,
223
+ "loss": 0.09121806174516678,
224
+ "step": 6144
225
+ },
226
+ {
227
+ "epoch": 0.06253148710746073,
228
+ "eval_bce_loss": 1.37689631155559,
229
+ "eval_bleu": 0.0007894363314727929,
230
+ "eval_cos_loss": 0.23060905975954873,
231
+ "eval_loss": 0.10043682392154421,
232
+ "eval_mean_score": 0.6661830357142857,
233
+ "eval_mse_loss": 0.0866678610444069,
234
+ "step": 6144
235
+ },
236
+ {
237
+ "epoch": 0.06253148710746073,
238
+ "eval_bce_loss": 1.37689631155559,
239
+ "eval_bleu": 0.0007894363314727929,
240
+ "eval_cos_loss": 0.23060905975954873,
241
+ "eval_loss": 0.10043682392154421,
242
+ "eval_mean_score": 0.6661830357142857,
243
+ "eval_mse_loss": 0.0866678610444069,
244
+ "eval_runtime": 18.447,
245
+ "eval_samples_per_second": 119.261,
246
+ "eval_steps_per_second": 1.897,
247
+ "step": 6144
248
+ },
249
+ {
250
+ "epoch": 0.06513696573693825,
251
+ "grad_norm": 0.11431664973497391,
252
+ "learning_rate": 0.000991075983498475,
253
+ "loss": 0.09111239016056061,
254
+ "step": 6400
255
+ },
256
+ {
257
+ "epoch": 0.06774244436641579,
258
+ "grad_norm": 0.15795110166072845,
259
+ "learning_rate": 0.0009902855524231366,
260
+ "loss": 0.09170184284448624,
261
+ "step": 6656
262
+ },
263
+ {
264
+ "epoch": 0.07034792299589332,
265
+ "grad_norm": 0.1189679428935051,
266
+ "learning_rate": 0.0009894619276991758,
267
+ "loss": 0.09055215865373611,
268
+ "step": 6912
269
+ },
270
+ {
271
+ "epoch": 0.07295340162537085,
272
+ "grad_norm": 0.12559665739536285,
273
+ "learning_rate": 0.0009886051650881986,
274
+ "loss": 0.09139999002218246,
275
+ "step": 7168
276
+ },
277
+ {
278
+ "epoch": 0.07555888025484837,
279
+ "grad_norm": 0.10260415077209473,
280
+ "learning_rate": 0.0009877153225953342,
281
+ "loss": 0.09160503000020981,
282
+ "step": 7424
283
+ },
284
+ {
285
+ "epoch": 0.07816435888432591,
286
+ "grad_norm": 0.14531247317790985,
287
+ "learning_rate": 0.0009867924604653093,
288
+ "loss": 0.08971104025840759,
289
+ "step": 7680
290
+ },
291
+ {
292
+ "epoch": 0.08076983751380344,
293
+ "grad_norm": 0.135915145277977,
294
+ "learning_rate": 0.0009858366411783688,
295
+ "loss": 0.09080137312412262,
296
+ "step": 7936
297
+ },
298
+ {
299
+ "epoch": 0.08337531614328098,
300
+ "grad_norm": 0.0951119214296341,
301
+ "learning_rate": 0.0009848479294460454,
302
+ "loss": 0.08976119756698608,
303
+ "step": 8192
304
+ },
305
+ {
306
+ "epoch": 0.08337531614328098,
307
+ "eval_bce_loss": 1.1331708482333591,
308
+ "eval_bleu": 0.0,
309
+ "eval_cos_loss": 0.22396006413868497,
310
+ "eval_loss": 0.09644954183271953,
311
+ "eval_mean_score": 0.7250139508928571,
312
+ "eval_mse_loss": 0.08511783331632614,
313
+ "step": 8192
314
+ },
315
+ {
316
+ "epoch": 0.08337531614328098,
317
+ "eval_bce_loss": 1.1331708482333591,
318
+ "eval_bleu": 0.0,
319
+ "eval_cos_loss": 0.22396006413868497,
320
+ "eval_loss": 0.09644954183271953,
321
+ "eval_mean_score": 0.7250139508928571,
322
+ "eval_mse_loss": 0.08511783331632614,
323
+ "eval_runtime": 18.5283,
324
+ "eval_samples_per_second": 118.738,
325
+ "eval_steps_per_second": 1.889,
326
+ "step": 8192
327
+ },
328
+ {
329
+ "epoch": 0.0859807947727585,
330
+ "grad_norm": 0.2771708369255066,
331
+ "learning_rate": 0.0009838263922067783,
332
+ "loss": 0.09032878279685974,
333
+ "step": 8448
334
+ },
335
+ {
336
+ "epoch": 0.08858627340223603,
337
+ "grad_norm": 0.1163194477558136,
338
+ "learning_rate": 0.0009827720986213824,
339
+ "loss": 0.09021615236997604,
340
+ "step": 8704
341
+ },
342
+ {
343
+ "epoch": 0.09119175203171356,
344
+ "grad_norm": 0.1319112330675125,
345
+ "learning_rate": 0.000981685120068365,
346
+ "loss": 0.08950018137693405,
347
+ "step": 8960
348
+ },
349
+ {
350
+ "epoch": 0.0937972306611911,
351
+ "grad_norm": 0.17556321620941162,
352
+ "learning_rate": 0.0009805655301390929,
353
+ "loss": 0.08931967616081238,
354
+ "step": 9216
355
+ },
356
+ {
357
+ "epoch": 0.09640270929066862,
358
+ "grad_norm": 0.10782352089881897,
359
+ "learning_rate": 0.0009794134046328114,
360
+ "loss": 0.08995676040649414,
361
+ "step": 9472
362
+ },
363
+ {
364
+ "epoch": 0.09900818792014615,
365
+ "grad_norm": 0.33878061175346375,
366
+ "learning_rate": 0.0009782288215515113,
367
+ "loss": 0.08961572498083115,
368
+ "step": 9728
369
+ },
370
+ {
371
+ "epoch": 0.10161366654962369,
372
+ "grad_norm": 0.18630877137184143,
373
+ "learning_rate": 0.0009770118610946488,
374
+ "loss": 0.09020468592643738,
375
+ "step": 9984
376
+ },
377
+ {
378
+ "epoch": 0.1042191451791012,
379
+ "grad_norm": 0.10592332482337952,
380
+ "learning_rate": 0.0009757626056537148,
381
+ "loss": 0.08932031691074371,
382
+ "step": 10240
383
+ },
384
+ {
385
+ "epoch": 0.1042191451791012,
386
+ "eval_bce_loss": 1.0940844322953904,
387
+ "eval_bleu": 0.0,
388
+ "eval_cos_loss": 0.22045842707157134,
389
+ "eval_loss": 0.0946416518517903,
390
+ "eval_mean_score": 0.761328125,
391
+ "eval_mse_loss": 0.08370080781834466,
392
+ "step": 10240
393
+ },
394
+ {
395
+ "epoch": 0.1042191451791012,
396
+ "eval_bce_loss": 1.0940844322953904,
397
+ "eval_bleu": 0.0,
398
+ "eval_cos_loss": 0.22045842707157134,
399
+ "eval_loss": 0.0946416518517903,
400
+ "eval_mean_score": 0.761328125,
401
+ "eval_mse_loss": 0.08370080781834466,
402
+ "eval_runtime": 18.6175,
403
+ "eval_samples_per_second": 118.168,
404
+ "eval_steps_per_second": 1.88,
405
+ "step": 10240
406
+ },
407
+ {
408
+ "epoch": 0.10682462380857874,
409
+ "grad_norm": 0.09680312126874924,
410
+ "learning_rate": 0.000974481139806658,
411
+ "loss": 0.08943861722946167,
412
+ "step": 10496
413
+ },
414
+ {
415
+ "epoch": 0.10943010243805627,
416
+ "grad_norm": 0.2351679801940918,
417
+ "learning_rate": 0.0009731675503121576,
418
+ "loss": 0.08960960805416107,
419
+ "step": 10752
420
+ },
421
+ {
422
+ "epoch": 0.11203558106753381,
423
+ "grad_norm": 0.12805607914924622,
424
+ "learning_rate": 0.0009718219261037504,
425
+ "loss": 0.08869561553001404,
426
+ "step": 11008
427
+ },
428
+ {
429
+ "epoch": 0.11464105969701133,
430
+ "grad_norm": 0.11389618366956711,
431
+ "learning_rate": 0.0009704443582838089,
432
+ "loss": 0.08700637519359589,
433
+ "step": 11264
434
+ },
435
+ {
436
+ "epoch": 0.11724653832648886,
437
+ "grad_norm": 0.11915703117847443,
438
+ "learning_rate": 0.0009690349401173742,
439
+ "loss": 0.08796984702348709,
440
+ "step": 11520
441
+ },
442
+ {
443
+ "epoch": 0.1198520169559664,
444
+ "grad_norm": 0.08544740080833435,
445
+ "learning_rate": 0.0009675937670258413,
446
+ "loss": 0.087662473320961,
447
+ "step": 11776
448
+ },
449
+ {
450
+ "epoch": 0.12245749558544393,
451
+ "grad_norm": 0.10790608078241348,
452
+ "learning_rate": 0.000966120936580499,
453
+ "loss": 0.08814739435911179,
454
+ "step": 12032
455
+ },
456
+ {
457
+ "epoch": 0.12506297421492146,
458
+ "grad_norm": 0.13961143791675568,
459
+ "learning_rate": 0.0009646165484959241,
460
+ "loss": 0.08711596578359604,
461
+ "step": 12288
462
+ },
463
+ {
464
+ "epoch": 0.12506297421492146,
465
+ "eval_bce_loss": 1.1939687473433358,
466
+ "eval_bleu": 0.0,
467
+ "eval_cos_loss": 0.21508082662309919,
468
+ "eval_loss": 0.0935181138770921,
469
+ "eval_mean_score": 0.73857421875,
470
+ "eval_mse_loss": 0.08157842648880823,
471
+ "step": 12288
472
+ },
473
+ {
474
+ "epoch": 0.12506297421492146,
475
+ "eval_bce_loss": 1.1939687473433358,
476
+ "eval_bleu": 0.0,
477
+ "eval_cos_loss": 0.21508082662309919,
478
+ "eval_loss": 0.0935181138770921,
479
+ "eval_mean_score": 0.73857421875,
480
+ "eval_mse_loss": 0.08157842648880823,
481
+ "eval_runtime": 18.583,
482
+ "eval_samples_per_second": 118.388,
483
+ "eval_steps_per_second": 1.883,
484
+ "step": 12288
485
+ },
486
+ {
487
+ "epoch": 0.12766845284439898,
488
+ "grad_norm": 0.09527724236249924,
489
+ "learning_rate": 0.0009630807046232299,
490
+ "loss": 0.08747082203626633,
491
+ "step": 12544
492
+ },
493
+ {
494
+ "epoch": 0.1302739314738765,
495
+ "grad_norm": 0.09321276098489761,
496
+ "learning_rate": 0.0009615135089431713,
497
+ "loss": 0.08775044977664948,
498
+ "step": 12800
499
+ },
500
+ {
501
+ "epoch": 0.13287941010335405,
502
+ "grad_norm": 0.08462223410606384,
503
+ "learning_rate": 0.0009599150675591049,
504
+ "loss": 0.08798608183860779,
505
+ "step": 13056
506
+ },
507
+ {
508
+ "epoch": 0.13548488873283157,
509
+ "grad_norm": 0.09068363904953003,
510
+ "learning_rate": 0.0009582854886898051,
511
+ "loss": 0.08702214062213898,
512
+ "step": 13312
513
+ },
514
+ {
515
+ "epoch": 0.13809036736230912,
516
+ "grad_norm": 0.13726262748241425,
517
+ "learning_rate": 0.0009566248826621377,
518
+ "loss": 0.08681564033031464,
519
+ "step": 13568
520
+ },
521
+ {
522
+ "epoch": 0.14069584599178664,
523
+ "grad_norm": 0.10372263193130493,
524
+ "learning_rate": 0.0009549333619035909,
525
+ "loss": 0.08741886168718338,
526
+ "step": 13824
527
+ },
528
+ {
529
+ "epoch": 0.14330132462126416,
530
+ "grad_norm": 0.21570627391338348,
531
+ "learning_rate": 0.0009532110409346625,
532
+ "loss": 0.08581440150737762,
533
+ "step": 14080
534
+ },
535
+ {
536
+ "epoch": 0.1459068032507417,
537
+ "grad_norm": 0.11762681603431702,
538
+ "learning_rate": 0.0009514580363611076,
539
+ "loss": 0.08681235462427139,
540
+ "step": 14336
541
+ },
542
+ {
543
+ "epoch": 0.1459068032507417,
544
+ "eval_bce_loss": 0.9678310785974775,
545
+ "eval_bleu": 0.0007685106705860851,
546
+ "eval_cos_loss": 0.22033600551741464,
547
+ "eval_loss": 0.092972403551851,
548
+ "eval_mean_score": 0.7832589285714285,
549
+ "eval_mse_loss": 0.083294092970235,
550
+ "step": 14336
551
+ },
552
+ {
553
+ "epoch": 0.1459068032507417,
554
+ "eval_bce_loss": 0.9678310785974775,
555
+ "eval_bleu": 0.0007685106705860851,
556
+ "eval_cos_loss": 0.22033600551741464,
557
+ "eval_loss": 0.092972403551851,
558
+ "eval_mean_score": 0.7832589285714285,
559
+ "eval_mse_loss": 0.083294092970235,
560
+ "eval_runtime": 18.8884,
561
+ "eval_samples_per_second": 116.474,
562
+ "eval_steps_per_second": 1.853,
563
+ "step": 14336
564
+ },
565
+ {
566
+ "epoch": 0.14851228188021923,
567
+ "grad_norm": 0.11540628969669342,
568
+ "learning_rate": 0.0009496744668660439,
569
+ "loss": 0.08700872212648392,
570
+ "step": 14592
571
+ },
572
+ {
573
+ "epoch": 0.15111776050969675,
574
+ "grad_norm": 0.22385740280151367,
575
+ "learning_rate": 0.0009478604532019162,
576
+ "loss": 0.08554290980100632,
577
+ "step": 14848
578
+ },
579
+ {
580
+ "epoch": 0.1537232391391743,
581
+ "grad_norm": 0.08197021484375,
582
+ "learning_rate": 0.0009460161181823213,
583
+ "loss": 0.08630763739347458,
584
+ "step": 15104
585
+ },
586
+ {
587
+ "epoch": 0.15632871776865181,
588
+ "grad_norm": 0.12326359003782272,
589
+ "learning_rate": 0.0009441415866736933,
590
+ "loss": 0.08561107516288757,
591
+ "step": 15360
592
+ },
593
+ {
594
+ "epoch": 0.15893419639812933,
595
+ "grad_norm": 0.10007017850875854,
596
+ "learning_rate": 0.0009422369855868494,
597
+ "loss": 0.08561205118894577,
598
+ "step": 15616
599
+ },
600
+ {
601
+ "epoch": 0.16153967502760688,
602
+ "grad_norm": 0.10633770376443863,
603
+ "learning_rate": 0.0009403024438683983,
604
+ "loss": 0.08642981946468353,
605
+ "step": 15872
606
+ },
607
+ {
608
+ "epoch": 0.1641451536570844,
609
+ "grad_norm": 0.07606809586286545,
610
+ "learning_rate": 0.0009383380924920099,
611
+ "loss": 0.08625014871358871,
612
+ "step": 16128
613
+ },
614
+ {
615
+ "epoch": 0.16675063228656195,
616
+ "grad_norm": 0.1325465440750122,
617
+ "learning_rate": 0.0009363440644495478,
618
+ "loss": 0.08541498333215714,
619
+ "step": 16384
620
+ },
621
+ {
622
+ "epoch": 0.16675063228656195,
623
+ "eval_bce_loss": 1.0740072871957507,
624
+ "eval_bleu": 0.0007592252289275898,
625
+ "eval_cos_loss": 0.22020856738090516,
626
+ "eval_loss": 0.0942037650517055,
627
+ "eval_mean_score": 0.7717494419642857,
628
+ "eval_mse_loss": 0.08346369223935264,
629
+ "step": 16384
630
+ },
631
+ {
632
+ "epoch": 0.16675063228656195,
633
+ "eval_bce_loss": 1.0740072871957507,
634
+ "eval_bleu": 0.0007592252289275898,
635
+ "eval_cos_loss": 0.22020856738090516,
636
+ "eval_loss": 0.0942037650517055,
637
+ "eval_mean_score": 0.7717494419642857,
638
+ "eval_mse_loss": 0.08346369223935264,
639
+ "eval_runtime": 18.6586,
640
+ "eval_samples_per_second": 117.908,
641
+ "eval_steps_per_second": 1.876,
642
+ "step": 16384
643
+ },
644
+ {
645
+ "epoch": 0.16935611091603947,
646
+ "grad_norm": 0.091303251683712,
647
+ "learning_rate": 0.0009343204947420658,
648
+ "loss": 0.08596814423799515,
649
+ "step": 16640
650
+ },
651
+ {
652
+ "epoch": 0.171961589545517,
653
+ "grad_norm": 0.12643784284591675,
654
+ "learning_rate": 0.0009322675203706674,
655
+ "loss": 0.08583420515060425,
656
+ "step": 16896
657
+ },
658
+ {
659
+ "epoch": 0.17456706817499454,
660
+ "grad_norm": 0.07990458607673645,
661
+ "learning_rate": 0.0009301852803272315,
662
+ "loss": 0.08544512093067169,
663
+ "step": 17152
664
+ },
665
+ {
666
+ "epoch": 0.17717254680447206,
667
+ "grad_norm": 0.08775606006383896,
668
+ "learning_rate": 0.0009280739155850008,
669
+ "loss": 0.08551637083292007,
670
+ "step": 17408
671
+ },
672
+ {
673
+ "epoch": 0.17977802543394958,
674
+ "grad_norm": 0.1105438694357872,
675
+ "learning_rate": 0.0009259335690890387,
676
+ "loss": 0.08535689860582352,
677
+ "step": 17664
678
+ },
679
+ {
680
+ "epoch": 0.18238350406342713,
681
+ "grad_norm": 0.20936648547649384,
682
+ "learning_rate": 0.0009237643857465513,
683
+ "loss": 0.08509912341833115,
684
+ "step": 17920
685
+ },
686
+ {
687
+ "epoch": 0.18498898269290465,
688
+ "grad_norm": 0.14499887824058533,
689
+ "learning_rate": 0.0009215665124170764,
690
+ "loss": 0.08604084700345993,
691
+ "step": 18176
692
+ },
693
+ {
694
+ "epoch": 0.1875944613223822,
695
+ "grad_norm": 0.12544849514961243,
696
+ "learning_rate": 0.0009193400979025412,
697
+ "loss": 0.08515645563602448,
698
+ "step": 18432
699
+ },
700
+ {
701
+ "epoch": 0.1875944613223822,
702
+ "eval_bce_loss": 1.1422579322542463,
703
+ "eval_bleu": 0.0,
704
+ "eval_cos_loss": 0.2127199751990182,
705
+ "eval_loss": 0.09097630232572555,
706
+ "eval_mean_score": 0.7556780133928571,
707
+ "eval_mse_loss": 0.0795537236545767,
708
+ "step": 18432
709
+ },
710
+ {
711
+ "epoch": 0.1875944613223822,
712
+ "eval_bce_loss": 1.1422579322542463,
713
+ "eval_bleu": 0.0,
714
+ "eval_cos_loss": 0.2127199751990182,
715
+ "eval_loss": 0.09097630232572555,
716
+ "eval_mean_score": 0.7556780133928571,
717
+ "eval_mse_loss": 0.0795537236545767,
718
+ "eval_runtime": 18.7909,
719
+ "eval_samples_per_second": 117.078,
720
+ "eval_steps_per_second": 1.863,
721
+ "step": 18432
722
+ },
723
+ {
724
+ "epoch": 0.19019993995185971,
725
+ "grad_norm": 0.08133585005998611,
726
+ "learning_rate": 0.0009170852929371873,
727
+ "loss": 0.08439277112483978,
728
+ "step": 18688
729
+ },
730
+ {
731
+ "epoch": 0.19280541858133723,
732
+ "grad_norm": 0.06131386756896973,
733
+ "learning_rate": 0.0009148022501773669,
734
+ "loss": 0.08581775426864624,
735
+ "step": 18944
736
+ },
737
+ {
738
+ "epoch": 0.19541089721081478,
739
+ "grad_norm": 0.07301361113786697,
740
+ "learning_rate": 0.0009124911241912059,
741
+ "loss": 0.08452904224395752,
742
+ "step": 19200
743
+ },
744
+ {
745
+ "epoch": 0.1980163758402923,
746
+ "grad_norm": 0.19900229573249817,
747
+ "learning_rate": 0.0009101520714481405,
748
+ "loss": 0.08590829372406006,
749
+ "step": 19456
750
+ },
751
+ {
752
+ "epoch": 0.20062185446976982,
753
+ "grad_norm": 0.09695785492658615,
754
+ "learning_rate": 0.0009077852503083233,
755
+ "loss": 0.08517937362194061,
756
+ "step": 19712
757
+ },
758
+ {
759
+ "epoch": 0.20322733309924737,
760
+ "grad_norm": 0.10248035192489624,
761
+ "learning_rate": 0.0009053908210119015,
762
+ "loss": 0.08495298027992249,
763
+ "step": 19968
764
+ },
765
+ {
766
+ "epoch": 0.2058328117287249,
767
+ "grad_norm": 0.07756716758012772,
768
+ "learning_rate": 0.0009029689456681695,
769
+ "loss": 0.08380474150180817,
770
+ "step": 20224
771
+ },
772
+ {
773
+ "epoch": 0.2084382903582024,
774
+ "grad_norm": 0.12057510763406754,
775
+ "learning_rate": 0.000900519788244592,
776
+ "loss": 0.08552172780036926,
777
+ "step": 20480
778
+ },
779
+ {
780
+ "epoch": 0.2084382903582024,
781
+ "eval_bce_loss": 1.0288238414696285,
782
+ "eval_bleu": 0.0007499294204948674,
783
+ "eval_cos_loss": 0.21279827271189009,
784
+ "eval_loss": 0.0905734583735466,
785
+ "eval_mean_score": 0.7749860491071429,
786
+ "eval_mse_loss": 0.08028522048677716,
787
+ "step": 20480
788
+ },
789
+ {
790
+ "epoch": 0.2084382903582024,
791
+ "eval_bce_loss": 1.0288238414696285,
792
+ "eval_bleu": 0.0007499294204948674,
793
+ "eval_cos_loss": 0.21279827271189009,
794
+ "eval_loss": 0.0905734583735466,
795
+ "eval_mean_score": 0.7749860491071429,
796
+ "eval_mse_loss": 0.08028522048677716,
797
+ "eval_runtime": 18.3827,
798
+ "eval_samples_per_second": 119.678,
799
+ "eval_steps_per_second": 1.904,
800
+ "step": 20480
801
+ }
802
+ ],
803
+ "logging_steps": 256,
804
+ "max_steps": 98255,
805
+ "num_input_tokens_seen": 0,
806
+ "num_train_epochs": 1,
807
+ "save_steps": 2048,
808
+ "stateful_callbacks": {
809
+ "TrainerControl": {
810
+ "args": {
811
+ "should_epoch_stop": false,
812
+ "should_evaluate": false,
813
+ "should_log": false,
814
+ "should_save": true,
815
+ "should_training_stop": false
816
+ },
817
+ "attributes": {}
818
+ }
819
+ },
820
+ "total_flos": 0.0,
821
+ "train_batch_size": 64,
822
+ "trial_name": null,
823
+ "trial_params": null
824
+ }
checkpoints-v1.0-discrete-semantc/checkpoint-20480/training_args.bin ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:7a20a7dfaef1ebb92c146eb8a8691f98d5b3e68f0184ad28ef70ddfe5a160a49
3
+ size 5137