CodeIsAbstract commited on
Commit
46dc3e1
·
verified ·
1 Parent(s): e463356

Training in progress, step 1800, checkpoint

Browse files
last-checkpoint/model.safetensors CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:bc8d4620e45e3023852d6db363117d2149bf91809954eab034e0f3df6b2e9a53
3
  size 847599616
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:e1fdfb8dfcb901505d88cb8a470e308efd9e0925381c391ffc384136b1ebd88d
3
  size 847599616
last-checkpoint/optimizer.pt CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:5bbab7f145dce1b83f41efbeae326f52ae177bc04e5b4bcb5acd73f2e563e608
3
  size 1386414411
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:fec21f808a923bf61ae943ab35e94b8cc5c8bae8a15db1f8728417fdb5514516
3
  size 1386414411
last-checkpoint/rng_state_0.pth CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:2b0d1a4257bdb1e850f5a1f4f1d426b1aff1480f1f1be49a43a9b59e27d1626c
3
  size 14917
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:29ddf99768976dfa1ee6d0925d35e9cc22f598f3ea5118aa848b2b6342be72c1
3
  size 14917
last-checkpoint/rng_state_1.pth CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:9156180c20e717a1c296208930ef03eb900f1c8749f9b5001b6e2a8c9e24d691
3
  size 14917
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:5fd13efabdb0e66816b180aa0d21e252da318cce2ddf5d9d38e39eb7b38ab940
3
  size 14917
last-checkpoint/scheduler.pt CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:1eb3b2f44ae75601267d4a6c3582add2f5156f5a074e6f3b9a7a8115e10aac03
3
  size 1465
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:423108cec97a3ca65f7a856a6a60f5138d6147e68a603ecfb19ab83adf2f9fe9
3
  size 1465
last-checkpoint/trainer_state.json CHANGED
@@ -2,9 +2,9 @@
2
  "best_global_step": null,
3
  "best_metric": null,
4
  "best_model_checkpoint": null,
5
- "epoch": 0.7142857142857143,
6
  "eval_steps": 150,
7
- "global_step": 1500,
8
  "is_hyper_param_search": false,
9
  "is_local_process_zero": true,
10
  "is_world_process_zero": true,
@@ -1148,6 +1148,234 @@
1148
  "eval_samples_per_second": 19.908,
1149
  "eval_steps_per_second": 2.508,
1150
  "step": 1500
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1151
  }
1152
  ],
1153
  "logging_steps": 10,
 
2
  "best_global_step": null,
3
  "best_metric": null,
4
  "best_model_checkpoint": null,
5
+ "epoch": 0.8571428571428571,
6
  "eval_steps": 150,
7
+ "global_step": 1800,
8
  "is_hyper_param_search": false,
9
  "is_local_process_zero": true,
10
  "is_world_process_zero": true,
 
1148
  "eval_samples_per_second": 19.908,
1149
  "eval_steps_per_second": 2.508,
1150
  "step": 1500
1151
+ },
1152
+ {
1153
+ "epoch": 0.719047619047619,
1154
+ "grad_norm": 25.103525161743164,
1155
+ "learning_rate": 8.054021393243589e-07,
1156
+ "loss": 16.271298217773438,
1157
+ "step": 1510
1158
+ },
1159
+ {
1160
+ "epoch": 0.7238095238095238,
1161
+ "grad_norm": 20.621360778808594,
1162
+ "learning_rate": 7.80291988787982e-07,
1163
+ "loss": 16.023663330078126,
1164
+ "step": 1520
1165
+ },
1166
+ {
1167
+ "epoch": 0.7285714285714285,
1168
+ "grad_norm": 14.038392066955566,
1169
+ "learning_rate": 7.554842933063619e-07,
1170
+ "loss": 16.03165283203125,
1171
+ "step": 1530
1172
+ },
1173
+ {
1174
+ "epoch": 0.7333333333333333,
1175
+ "grad_norm": 11.327874183654785,
1176
+ "learning_rate": 7.30985204526309e-07,
1177
+ "loss": 16.745071411132812,
1178
+ "step": 1540
1179
+ },
1180
+ {
1181
+ "epoch": 0.7380952380952381,
1182
+ "grad_norm": 12.739700317382812,
1183
+ "learning_rate": 7.068007975684009e-07,
1184
+ "loss": 16.04017791748047,
1185
+ "step": 1550
1186
+ },
1187
+ {
1188
+ "epoch": 0.7428571428571429,
1189
+ "grad_norm": 9.787664413452148,
1190
+ "learning_rate": 6.829370695205175e-07,
1191
+ "loss": 16.20958251953125,
1192
+ "step": 1560
1193
+ },
1194
+ {
1195
+ "epoch": 0.7476190476190476,
1196
+ "grad_norm": 12.524157524108887,
1197
+ "learning_rate": 6.593999379507207e-07,
1198
+ "loss": 16.128921508789062,
1199
+ "step": 1570
1200
+ },
1201
+ {
1202
+ "epoch": 0.7523809523809524,
1203
+ "grad_norm": 6.589555263519287,
1204
+ "learning_rate": 6.3619523943986e-07,
1205
+ "loss": 16.84815368652344,
1206
+ "step": 1580
1207
+ },
1208
+ {
1209
+ "epoch": 0.7571428571428571,
1210
+ "grad_norm": 9.732259750366211,
1211
+ "learning_rate": 6.133287281342496e-07,
1212
+ "loss": 16.412393188476564,
1213
+ "step": 1590
1214
+ },
1215
+ {
1216
+ "epoch": 0.7619047619047619,
1217
+ "grad_norm": 13.840083122253418,
1218
+ "learning_rate": 5.908060743187979e-07,
1219
+ "loss": 16.528514099121093,
1220
+ "step": 1600
1221
+ },
1222
+ {
1223
+ "epoch": 0.7666666666666667,
1224
+ "grad_norm": 12.243499755859375,
1225
+ "learning_rate": 5.686328630109287e-07,
1226
+ "loss": 16.269061279296874,
1227
+ "step": 1610
1228
+ },
1229
+ {
1230
+ "epoch": 0.7714285714285715,
1231
+ "grad_norm": 12.514222145080566,
1232
+ "learning_rate": 5.468145925756424e-07,
1233
+ "loss": 16.259161376953124,
1234
+ "step": 1620
1235
+ },
1236
+ {
1237
+ "epoch": 0.7761904761904762,
1238
+ "grad_norm": 9.389951705932617,
1239
+ "learning_rate": 5.253566733620706e-07,
1240
+ "loss": 16.349365234375,
1241
+ "step": 1630
1242
+ },
1243
+ {
1244
+ "epoch": 0.780952380952381,
1245
+ "grad_norm": 36.1035041809082,
1246
+ "learning_rate": 5.042644263618525e-07,
1247
+ "loss": 16.16446533203125,
1248
+ "step": 1640
1249
+ },
1250
+ {
1251
+ "epoch": 0.7857142857142857,
1252
+ "grad_norm": 9.599213600158691,
1253
+ "learning_rate": 4.835430818896733e-07,
1254
+ "loss": 16.311676025390625,
1255
+ "step": 1650
1256
+ },
1257
+ {
1258
+ "epoch": 0.7857142857142857,
1259
+ "eval_accuracy": 0.06944881889763779,
1260
+ "eval_loss": 16.275449752807617,
1261
+ "eval_runtime": 26.1826,
1262
+ "eval_samples_per_second": 19.097,
1263
+ "eval_steps_per_second": 2.406,
1264
+ "step": 1650
1265
+ },
1266
+ {
1267
+ "epoch": 0.7904761904761904,
1268
+ "grad_norm": 8.050191879272461,
1269
+ "learning_rate": 4.6319777828628237e-07,
1270
+ "loss": 16.19422607421875,
1271
+ "step": 1660
1272
+ },
1273
+ {
1274
+ "epoch": 0.7952380952380952,
1275
+ "grad_norm": 15.81093692779541,
1276
+ "learning_rate": 4.432335606443234e-07,
1277
+ "loss": 16.439752197265626,
1278
+ "step": 1670
1279
+ },
1280
+ {
1281
+ "epoch": 0.8,
1282
+ "grad_norm": 16.138633728027344,
1283
+ "learning_rate": 4.236553795572875e-07,
1284
+ "loss": 16.333755493164062,
1285
+ "step": 1680
1286
+ },
1287
+ {
1288
+ "epoch": 0.8047619047619048,
1289
+ "grad_norm": 16.733367919921875,
1290
+ "learning_rate": 4.0446808989189485e-07,
1291
+ "loss": 16.334153747558595,
1292
+ "step": 1690
1293
+ },
1294
+ {
1295
+ "epoch": 0.8095238095238095,
1296
+ "grad_norm": 8.272436141967773,
1297
+ "learning_rate": 3.856764495842197e-07,
1298
+ "loss": 16.340499877929688,
1299
+ "step": 1700
1300
+ },
1301
+ {
1302
+ "epoch": 0.8142857142857143,
1303
+ "grad_norm": 34.05455017089844,
1304
+ "learning_rate": 3.6728511845984776e-07,
1305
+ "loss": 16.4441162109375,
1306
+ "step": 1710
1307
+ },
1308
+ {
1309
+ "epoch": 0.819047619047619,
1310
+ "grad_norm": 16.842851638793945,
1311
+ "learning_rate": 3.4929865707836535e-07,
1312
+ "loss": 16.022296142578124,
1313
+ "step": 1720
1314
+ },
1315
+ {
1316
+ "epoch": 0.8238095238095238,
1317
+ "grad_norm": 10.098868370056152,
1318
+ "learning_rate": 3.317215256024606e-07,
1319
+ "loss": 16.09764404296875,
1320
+ "step": 1730
1321
+ },
1322
+ {
1323
+ "epoch": 0.8285714285714286,
1324
+ "grad_norm": 8.483038902282715,
1325
+ "learning_rate": 3.1455808269192164e-07,
1326
+ "loss": 16.11446533203125,
1327
+ "step": 1740
1328
+ },
1329
+ {
1330
+ "epoch": 0.8333333333333334,
1331
+ "grad_norm": 10.998558044433594,
1332
+ "learning_rate": 2.9781258442280877e-07,
1333
+ "loss": 16.22391357421875,
1334
+ "step": 1750
1335
+ },
1336
+ {
1337
+ "epoch": 0.8380952380952381,
1338
+ "grad_norm": 10.043136596679688,
1339
+ "learning_rate": 2.814891832320565e-07,
1340
+ "loss": 16.850048828125,
1341
+ "step": 1760
1342
+ },
1343
+ {
1344
+ "epoch": 0.8428571428571429,
1345
+ "grad_norm": 13.000489234924316,
1346
+ "learning_rate": 2.6559192688778263e-07,
1347
+ "loss": 16.31856689453125,
1348
+ "step": 1770
1349
+ },
1350
+ {
1351
+ "epoch": 0.8476190476190476,
1352
+ "grad_norm": 11.428621292114258,
1353
+ "learning_rate": 2.5012475748554916e-07,
1354
+ "loss": 16.24926300048828,
1355
+ "step": 1780
1356
+ },
1357
+ {
1358
+ "epoch": 0.8523809523809524,
1359
+ "grad_norm": 21.403606414794922,
1360
+ "learning_rate": 2.3509151047082866e-07,
1361
+ "loss": 16.078160095214844,
1362
+ "step": 1790
1363
+ },
1364
+ {
1365
+ "epoch": 0.8571428571428571,
1366
+ "grad_norm": 9.761038780212402,
1367
+ "learning_rate": 2.2049591368791386e-07,
1368
+ "loss": 15.990585327148438,
1369
+ "step": 1800
1370
+ },
1371
+ {
1372
+ "epoch": 0.8571428571428571,
1373
+ "eval_accuracy": 0.0696771653543307,
1374
+ "eval_loss": 16.194637298583984,
1375
+ "eval_runtime": 25.3768,
1376
+ "eval_samples_per_second": 19.703,
1377
+ "eval_steps_per_second": 2.483,
1378
+ "step": 1800
1379
  }
1380
  ],
1381
  "logging_steps": 10,