CodeIsAbstract commited on
Commit
38e4934
·
verified ·
1 Parent(s): 1f4babe

Training in progress, step 16000, checkpoint

Browse files
last-checkpoint/model.safetensors CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:f995787c415a06379c93fa16cdd3342ead1953e820a7c8548c0770b20408526d
3
  size 529337896
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:2bef8568f96238a5b06f1b8201e0457a70533d075df2bb2744dfc21292e3ccee
3
  size 529337896
last-checkpoint/optimizer.pt CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:cba6c3ab71a635e3a1f6cb9907f4f27120b466b178e1e92fa2c249da30f3f7e4
3
  size 871247243
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:ae466236a6b73341348524a8c14751f290085bd91d0879fd65d99038fe1a8df2
3
  size 871247243
last-checkpoint/rng_state.pth CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:84ec1f587c02234737f99fa1daded8a3c26ce4ce7280283e8fe016d82a0ee148
3
  size 14645
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:3094f03eb1b7ca78cd75cfac64b3e97454e2450697d516b4311c6fe7ecad5494
3
  size 14645
last-checkpoint/scheduler.pt CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:5dcd90d4261e8acb8aa69d2cdcf6bd4451975f95262601bbfdb94f38ebb145b3
3
  size 1465
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:262c03618811dd08c5542ed422cb02749751837f2f34131505a0ce5eebb179de
3
  size 1465
last-checkpoint/trainer_state.json CHANGED
@@ -2,9 +2,9 @@
2
  "best_global_step": null,
3
  "best_metric": null,
4
  "best_model_checkpoint": null,
5
- "epoch": 0.28,
6
  "eval_steps": 1000,
7
- "global_step": 14000,
8
  "is_hyper_param_search": false,
9
  "is_local_process_zero": true,
10
  "is_world_process_zero": true,
@@ -1114,6 +1114,164 @@
1114
  "eval_samples_per_second": 73.098,
1115
  "eval_steps_per_second": 0.585,
1116
  "step": 14000
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1117
  }
1118
  ],
1119
  "logging_steps": 100,
 
2
  "best_global_step": null,
3
  "best_metric": null,
4
  "best_model_checkpoint": null,
5
+ "epoch": 0.32,
6
  "eval_steps": 1000,
7
+ "global_step": 16000,
8
  "is_hyper_param_search": false,
9
  "is_local_process_zero": true,
10
  "is_world_process_zero": true,
 
1114
  "eval_samples_per_second": 73.098,
1115
  "eval_steps_per_second": 0.585,
1116
  "step": 14000
1117
+ },
1118
+ {
1119
+ "epoch": 0.282,
1120
+ "grad_norm": 0.1512901335954666,
1121
+ "learning_rate": 0.0017198960007719611,
1122
+ "loss": 3.4777,
1123
+ "step": 14100
1124
+ },
1125
+ {
1126
+ "epoch": 0.284,
1127
+ "grad_norm": 0.13871945440769196,
1128
+ "learning_rate": 0.0017152897147518665,
1129
+ "loss": 3.5067,
1130
+ "step": 14200
1131
+ },
1132
+ {
1133
+ "epoch": 0.286,
1134
+ "grad_norm": 0.15246713161468506,
1135
+ "learning_rate": 0.001710652139642431,
1136
+ "loss": 3.5018,
1137
+ "step": 14300
1138
+ },
1139
+ {
1140
+ "epoch": 0.288,
1141
+ "grad_norm": 0.13609080016613007,
1142
+ "learning_rate": 0.0017059834783062142,
1143
+ "loss": 3.4762,
1144
+ "step": 14400
1145
+ },
1146
+ {
1147
+ "epoch": 0.29,
1148
+ "grad_norm": 0.15287351608276367,
1149
+ "learning_rate": 0.0017012839349655868,
1150
+ "loss": 3.4872,
1151
+ "step": 14500
1152
+ },
1153
+ {
1154
+ "epoch": 0.292,
1155
+ "grad_norm": 0.14040616154670715,
1156
+ "learning_rate": 0.001696553715193799,
1157
+ "loss": 3.5042,
1158
+ "step": 14600
1159
+ },
1160
+ {
1161
+ "epoch": 0.294,
1162
+ "grad_norm": 0.1571398377418518,
1163
+ "learning_rate": 0.0016917930259059879,
1164
+ "loss": 3.4744,
1165
+ "step": 14700
1166
+ },
1167
+ {
1168
+ "epoch": 0.296,
1169
+ "grad_norm": 0.1505391150712967,
1170
+ "learning_rate": 0.001687002075350125,
1171
+ "loss": 3.4749,
1172
+ "step": 14800
1173
+ },
1174
+ {
1175
+ "epoch": 0.298,
1176
+ "grad_norm": 0.14757487177848816,
1177
+ "learning_rate": 0.001682181073097908,
1178
+ "loss": 3.4852,
1179
+ "step": 14900
1180
+ },
1181
+ {
1182
+ "epoch": 0.3,
1183
+ "grad_norm": 0.15271714329719543,
1184
+ "learning_rate": 0.0016773302300355935,
1185
+ "loss": 3.486,
1186
+ "step": 15000
1187
+ },
1188
+ {
1189
+ "epoch": 0.3,
1190
+ "eval_accuracy": 0.36803326810176124,
1191
+ "eval_loss": 3.4481563568115234,
1192
+ "eval_runtime": 12.0908,
1193
+ "eval_samples_per_second": 82.707,
1194
+ "eval_steps_per_second": 0.662,
1195
+ "step": 15000
1196
+ },
1197
+ {
1198
+ "epoch": 0.302,
1199
+ "grad_norm": 0.15327778458595276,
1200
+ "learning_rate": 0.0016724497583547715,
1201
+ "loss": 3.478,
1202
+ "step": 15100
1203
+ },
1204
+ {
1205
+ "epoch": 0.304,
1206
+ "grad_norm": 0.16108167171478271,
1207
+ "learning_rate": 0.0016675398715430842,
1208
+ "loss": 3.4579,
1209
+ "step": 15200
1210
+ },
1211
+ {
1212
+ "epoch": 0.306,
1213
+ "grad_norm": 0.15231835842132568,
1214
+ "learning_rate": 0.001662600784374886,
1215
+ "loss": 3.4819,
1216
+ "step": 15300
1217
+ },
1218
+ {
1219
+ "epoch": 0.308,
1220
+ "grad_norm": 0.1505262553691864,
1221
+ "learning_rate": 0.0016576327129018504,
1222
+ "loss": 3.4808,
1223
+ "step": 15400
1224
+ },
1225
+ {
1226
+ "epoch": 0.31,
1227
+ "grad_norm": 0.15296302735805511,
1228
+ "learning_rate": 0.0016526358744435184,
1229
+ "loss": 3.459,
1230
+ "step": 15500
1231
+ },
1232
+ {
1233
+ "epoch": 0.312,
1234
+ "grad_norm": 0.2003161907196045,
1235
+ "learning_rate": 0.001647610487577791,
1236
+ "loss": 3.4751,
1237
+ "step": 15600
1238
+ },
1239
+ {
1240
+ "epoch": 0.314,
1241
+ "grad_norm": 0.130265474319458,
1242
+ "learning_rate": 0.0016425567721313694,
1243
+ "loss": 3.4819,
1244
+ "step": 15700
1245
+ },
1246
+ {
1247
+ "epoch": 0.316,
1248
+ "grad_norm": 0.14476525783538818,
1249
+ "learning_rate": 0.0016374749491701401,
1250
+ "loss": 3.4514,
1251
+ "step": 15800
1252
+ },
1253
+ {
1254
+ "epoch": 0.318,
1255
+ "grad_norm": 0.1549970805644989,
1256
+ "learning_rate": 0.0016323652409895013,
1257
+ "loss": 3.4684,
1258
+ "step": 15900
1259
+ },
1260
+ {
1261
+ "epoch": 0.32,
1262
+ "grad_norm": 0.14814923703670502,
1263
+ "learning_rate": 0.0016272278711046424,
1264
+ "loss": 3.4674,
1265
+ "step": 16000
1266
+ },
1267
+ {
1268
+ "epoch": 0.32,
1269
+ "eval_accuracy": 0.36914090019569473,
1270
+ "eval_loss": 3.435351848602295,
1271
+ "eval_runtime": 12.375,
1272
+ "eval_samples_per_second": 80.808,
1273
+ "eval_steps_per_second": 0.646,
1274
+ "step": 16000
1275
  }
1276
  ],
1277
  "logging_steps": 100,