CodeIsAbstract commited on
Commit
9723e47
·
verified ·
1 Parent(s): 4ba4cd4

Training in progress, step 16000, checkpoint

Browse files
last-checkpoint/model.safetensors CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:54139b974ddfae98ee7fb4da2695b05278ea502ebc86824b3e1c4f49c129b297
3
  size 579824888
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:a7c3e7cfbc9b6b5cbf70eb556e69c0e89a7feac7c489589a3bd75e6d5bb1f38b
3
  size 579824888
last-checkpoint/optimizer.pt CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:ff8e73939ebcb2d4e5ba75a94606f6611749ef65cbf2555cdefc0014ed49429b
3
  size 1159794763
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:cb3239c55a1abdd9eba611bcd166c3c48906471881b6a03190d17e7f82682db4
3
  size 1159794763
last-checkpoint/rng_state.pth CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:4379e0a27d0683dd964c1d70a99193598c03adb1d5cf2808558afd18cfc5f420
3
  size 14645
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:a1e6ca9f6a71acdc5481b681d658fb168e5db2fd263350651883dffaef0871cf
3
  size 14645
last-checkpoint/scheduler.pt CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:9fe9a6301d1d1aeac29e6021bcb10e2a37481f63ed32dd3e17e4ef1f6ab45e17
3
  size 1465
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:4cfc12145708b72afe7d410dd5ac1b16484b3ab33d6d903b227818b64d609309
3
  size 1465
last-checkpoint/trainer_state.json CHANGED
@@ -2,9 +2,9 @@
2
  "best_global_step": null,
3
  "best_metric": null,
4
  "best_model_checkpoint": null,
5
- "epoch": 0.28,
6
  "eval_steps": 1000,
7
- "global_step": 14000,
8
  "is_hyper_param_search": false,
9
  "is_local_process_zero": true,
10
  "is_world_process_zero": true,
@@ -1114,6 +1114,164 @@
1114
  "eval_samples_per_second": 304.507,
1115
  "eval_steps_per_second": 19.14,
1116
  "step": 14000
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1117
  }
1118
  ],
1119
  "logging_steps": 100,
@@ -1133,7 +1291,7 @@
1133
  "attributes": {}
1134
  }
1135
  },
1136
- "total_flos": 5.4879452135424e+17,
1137
  "train_batch_size": 120,
1138
  "trial_name": null,
1139
  "trial_params": null
 
2
  "best_global_step": null,
3
  "best_metric": null,
4
  "best_model_checkpoint": null,
5
+ "epoch": 0.32,
6
  "eval_steps": 1000,
7
+ "global_step": 16000,
8
  "is_hyper_param_search": false,
9
  "is_local_process_zero": true,
10
  "is_world_process_zero": true,
 
1114
  "eval_samples_per_second": 304.507,
1115
  "eval_steps_per_second": 19.14,
1116
  "step": 14000
1117
+ },
1118
+ {
1119
+ "epoch": 0.282,
1120
+ "grad_norm": 0.1499979943037033,
1121
+ "learning_rate": 0.0008189304566233547,
1122
+ "loss": 3.5474667358398437,
1123
+ "step": 14100
1124
+ },
1125
+ {
1126
+ "epoch": 0.284,
1127
+ "grad_norm": 0.1552744209766388,
1128
+ "learning_rate": 0.0008164973564370934,
1129
+ "loss": 3.5074334716796876,
1130
+ "step": 14200
1131
+ },
1132
+ {
1133
+ "epoch": 0.286,
1134
+ "grad_norm": 0.13462179899215698,
1135
+ "learning_rate": 0.0008140516861700238,
1136
+ "loss": 3.5272781372070314,
1137
+ "step": 14300
1138
+ },
1139
+ {
1140
+ "epoch": 0.288,
1141
+ "grad_norm": 0.1381780356168747,
1142
+ "learning_rate": 0.000811593542954941,
1143
+ "loss": 3.5094314575195313,
1144
+ "step": 14400
1145
+ },
1146
+ {
1147
+ "epoch": 0.29,
1148
+ "grad_norm": 0.13239678740501404,
1149
+ "learning_rate": 0.000809123024420019,
1150
+ "loss": 3.5180905151367186,
1151
+ "step": 14500
1152
+ },
1153
+ {
1154
+ "epoch": 0.292,
1155
+ "grad_norm": 0.15930698812007904,
1156
+ "learning_rate": 0.0008066402286849317,
1157
+ "loss": 3.5262945556640624,
1158
+ "step": 14600
1159
+ },
1160
+ {
1161
+ "epoch": 0.294,
1162
+ "grad_norm": 0.1524200737476349,
1163
+ "learning_rate": 0.0008041452543569583,
1164
+ "loss": 3.541943359375,
1165
+ "step": 14700
1166
+ },
1167
+ {
1168
+ "epoch": 0.296,
1169
+ "grad_norm": 0.14040064811706543,
1170
+ "learning_rate": 0.0008016382005270651,
1171
+ "loss": 3.543092041015625,
1172
+ "step": 14800
1173
+ },
1174
+ {
1175
+ "epoch": 0.298,
1176
+ "grad_norm": 0.14799822866916656,
1177
+ "learning_rate": 0.0007991191667659708,
1178
+ "loss": 3.5315762329101563,
1179
+ "step": 14900
1180
+ },
1181
+ {
1182
+ "epoch": 0.3,
1183
+ "grad_norm": 0.1449238359928131,
1184
+ "learning_rate": 0.0007965882531201913,
1185
+ "loss": 3.522008361816406,
1186
+ "step": 15000
1187
+ },
1188
+ {
1189
+ "epoch": 0.3,
1190
+ "eval_accuracy": 0.36332372503531274,
1191
+ "eval_loss": 3.4778010845184326,
1192
+ "eval_runtime": 6.6567,
1193
+ "eval_samples_per_second": 291.588,
1194
+ "eval_steps_per_second": 18.328,
1195
+ "step": 15000
1196
+ },
1197
+ {
1198
+ "epoch": 0.302,
1199
+ "grad_norm": 0.13593044877052307,
1200
+ "learning_rate": 0.0007940455601080678,
1201
+ "loss": 3.5114361572265627,
1202
+ "step": 15100
1203
+ },
1204
+ {
1205
+ "epoch": 0.304,
1206
+ "grad_norm": 0.1423630267381668,
1207
+ "learning_rate": 0.0007914911887157724,
1208
+ "loss": 3.5139959716796874,
1209
+ "step": 15200
1210
+ },
1211
+ {
1212
+ "epoch": 0.306,
1213
+ "grad_norm": 0.15380671620368958,
1214
+ "learning_rate": 0.0007889252403932986,
1215
+ "loss": 3.515833435058594,
1216
+ "step": 15300
1217
+ },
1218
+ {
1219
+ "epoch": 0.308,
1220
+ "grad_norm": 0.13759265840053558,
1221
+ "learning_rate": 0.0007863478170504326,
1222
+ "loss": 3.528351135253906,
1223
+ "step": 15400
1224
+ },
1225
+ {
1226
+ "epoch": 0.31,
1227
+ "grad_norm": 0.13887037336826324,
1228
+ "learning_rate": 0.0007837590210527042,
1229
+ "loss": 3.5276870727539062,
1230
+ "step": 15500
1231
+ },
1232
+ {
1233
+ "epoch": 0.312,
1234
+ "grad_norm": 0.15678516030311584,
1235
+ "learning_rate": 0.0007811589552173225,
1236
+ "loss": 3.515467224121094,
1237
+ "step": 15600
1238
+ },
1239
+ {
1240
+ "epoch": 0.314,
1241
+ "grad_norm": 0.2133788764476776,
1242
+ "learning_rate": 0.0007785477228090924,
1243
+ "loss": 3.5256777954101564,
1244
+ "step": 15700
1245
+ },
1246
+ {
1247
+ "epoch": 0.316,
1248
+ "grad_norm": 0.17379774153232574,
1249
+ "learning_rate": 0.0007759254275363124,
1250
+ "loss": 3.5354928588867187,
1251
+ "step": 15800
1252
+ },
1253
+ {
1254
+ "epoch": 0.318,
1255
+ "grad_norm": 0.15530315041542053,
1256
+ "learning_rate": 0.0007732921735466564,
1257
+ "loss": 3.5182159423828123,
1258
+ "step": 15900
1259
+ },
1260
+ {
1261
+ "epoch": 0.32,
1262
+ "grad_norm": 0.14711181819438934,
1263
+ "learning_rate": 0.0007706480654230373,
1264
+ "loss": 3.5050119018554686,
1265
+ "step": 16000
1266
+ },
1267
+ {
1268
+ "epoch": 0.32,
1269
+ "eval_accuracy": 0.3644458693896563,
1270
+ "eval_loss": 3.4653918743133545,
1271
+ "eval_runtime": 6.2866,
1272
+ "eval_samples_per_second": 308.75,
1273
+ "eval_steps_per_second": 19.406,
1274
+ "step": 16000
1275
  }
1276
  ],
1277
  "logging_steps": 100,
 
1291
  "attributes": {}
1292
  }
1293
  },
1294
+ "total_flos": 6.2719373869056e+17,
1295
  "train_batch_size": 120,
1296
  "trial_name": null,
1297
  "trial_params": null