CodeIsAbstract commited on
Commit
b4a74db
·
verified ·
1 Parent(s): b8a0f19

Training in progress, step 30000, checkpoint

Browse files
last-checkpoint/model.safetensors CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:cb0afa22ccef3c9a0ea3428b0ce49c7b49b701311e5530f6aed60817e79bf7b8
3
  size 529337896
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:7a06d3e4983c41dc765c1eeb6d6658168972c5471a58499281b23d7c94887016
3
  size 529337896
last-checkpoint/optimizer.pt CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:81aa75d70b877656bae98d60d9c24f3b5ef7089addac00c7ceb5e35601234b5b
3
  size 871247243
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:4de60ec340a338ae4512a57938b518f19425ddce90de24fb45b35add85e7ffcf
3
  size 871247243
last-checkpoint/rng_state.pth CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:90d5c80c4317aec1cdd8b32ba40e7d9a283d92dfcce7300ea3ed6edd63c76074
3
  size 14645
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:8a55af3df2d414ccfff007ed59f001ee92e87d61217a24dace06b2b7ddba80fa
3
  size 14645
last-checkpoint/scheduler.pt CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:72d75c8ad1707fd318e0f938501ec9134a4023e423bf08958c45c5e922653226
3
  size 1465
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:4ab5189814d428569ba62b550ae72cffeac88caf85e39082cf01ca7e7f9f982e
3
  size 1465
last-checkpoint/trainer_state.json CHANGED
@@ -2,9 +2,9 @@
2
  "best_global_step": null,
3
  "best_metric": null,
4
  "best_model_checkpoint": null,
5
- "epoch": 0.56,
6
  "eval_steps": 1000,
7
- "global_step": 28000,
8
  "is_hyper_param_search": false,
9
  "is_local_process_zero": true,
10
  "is_world_process_zero": true,
@@ -2220,6 +2220,164 @@
2220
  "eval_samples_per_second": 73.281,
2221
  "eval_steps_per_second": 0.586,
2222
  "step": 28000
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
2223
  }
2224
  ],
2225
  "logging_steps": 100,
 
2
  "best_global_step": null,
3
  "best_metric": null,
4
  "best_model_checkpoint": null,
5
+ "epoch": 0.6,
6
  "eval_steps": 1000,
7
+ "global_step": 30000,
8
  "is_hyper_param_search": false,
9
  "is_local_process_zero": true,
10
  "is_world_process_zero": true,
 
2220
  "eval_samples_per_second": 73.281,
2221
  "eval_steps_per_second": 0.586,
2222
  "step": 28000
2223
+ },
2224
+ {
2225
+ "epoch": 0.562,
2226
+ "grad_norm": 0.15159651637077332,
2227
+ "learning_rate": 0.00087801395378568,
2228
+ "loss": 3.3107,
2229
+ "step": 28100
2230
+ },
2231
+ {
2232
+ "epoch": 0.564,
2233
+ "grad_norm": 0.16269639134407043,
2234
+ "learning_rate": 0.0008714521840775893,
2235
+ "loss": 3.3182,
2236
+ "step": 28200
2237
+ },
2238
+ {
2239
+ "epoch": 0.566,
2240
+ "grad_norm": 0.16659656167030334,
2241
+ "learning_rate": 0.0008648960374674042,
2242
+ "loss": 3.3197,
2243
+ "step": 28300
2244
+ },
2245
+ {
2246
+ "epoch": 0.568,
2247
+ "grad_norm": 0.1418466717004776,
2248
+ "learning_rate": 0.0008583458007422165,
2249
+ "loss": 3.3122,
2250
+ "step": 28400
2251
+ },
2252
+ {
2253
+ "epoch": 0.57,
2254
+ "grad_norm": 0.14337651431560516,
2255
+ "learning_rate": 0.0008518017604306002,
2256
+ "loss": 3.3163,
2257
+ "step": 28500
2258
+ },
2259
+ {
2260
+ "epoch": 0.572,
2261
+ "grad_norm": 0.16096735000610352,
2262
+ "learning_rate": 0.0008452642027900783,
2263
+ "loss": 3.3061,
2264
+ "step": 28600
2265
+ },
2266
+ {
2267
+ "epoch": 0.574,
2268
+ "grad_norm": 0.18552157282829285,
2269
+ "learning_rate": 0.0008387334137946008,
2270
+ "loss": 3.318,
2271
+ "step": 28700
2272
+ },
2273
+ {
2274
+ "epoch": 0.576,
2275
+ "grad_norm": 0.16036978363990784,
2276
+ "learning_rate": 0.0008322096791220355,
2277
+ "loss": 3.3109,
2278
+ "step": 28800
2279
+ },
2280
+ {
2281
+ "epoch": 0.578,
2282
+ "grad_norm": 0.16824260354042053,
2283
+ "learning_rate": 0.0008256932841416705,
2284
+ "loss": 3.3074,
2285
+ "step": 28900
2286
+ },
2287
+ {
2288
+ "epoch": 0.58,
2289
+ "grad_norm": 0.16867192089557648,
2290
+ "learning_rate": 0.0008191845139017326,
2291
+ "loss": 3.3225,
2292
+ "step": 29000
2293
+ },
2294
+ {
2295
+ "epoch": 0.58,
2296
+ "eval_accuracy": 0.38399021526418786,
2297
+ "eval_loss": 3.3025898933410645,
2298
+ "eval_runtime": 11.9945,
2299
+ "eval_samples_per_second": 83.372,
2300
+ "eval_steps_per_second": 0.667,
2301
+ "step": 29000
2302
+ },
2303
+ {
2304
+ "epoch": 0.582,
2305
+ "grad_norm": 0.1469780057668686,
2306
+ "learning_rate": 0.0008126836531169177,
2307
+ "loss": 3.3142,
2308
+ "step": 29100
2309
+ },
2310
+ {
2311
+ "epoch": 0.584,
2312
+ "grad_norm": 0.15736377239227295,
2313
+ "learning_rate": 0.0008061909861559362,
2314
+ "loss": 3.2969,
2315
+ "step": 29200
2316
+ },
2317
+ {
2318
+ "epoch": 0.586,
2319
+ "grad_norm": 0.1577884554862976,
2320
+ "learning_rate": 0.0007997067970290741,
2321
+ "loss": 3.3034,
2322
+ "step": 29300
2323
+ },
2324
+ {
2325
+ "epoch": 0.588,
2326
+ "grad_norm": 0.1637413501739502,
2327
+ "learning_rate": 0.0007932313693757703,
2328
+ "loss": 3.3052,
2329
+ "step": 29400
2330
+ },
2331
+ {
2332
+ "epoch": 0.59,
2333
+ "grad_norm": 0.19296114146709442,
2334
+ "learning_rate": 0.0007867649864522074,
2335
+ "loss": 3.3069,
2336
+ "step": 29500
2337
+ },
2338
+ {
2339
+ "epoch": 0.592,
2340
+ "grad_norm": 0.14899814128875732,
2341
+ "learning_rate": 0.0007803079311189227,
2342
+ "loss": 3.3026,
2343
+ "step": 29600
2344
+ },
2345
+ {
2346
+ "epoch": 0.594,
2347
+ "grad_norm": 0.1329040378332138,
2348
+ "learning_rate": 0.0007738604858284345,
2349
+ "loss": 3.2944,
2350
+ "step": 29700
2351
+ },
2352
+ {
2353
+ "epoch": 0.596,
2354
+ "grad_norm": 0.15727417171001434,
2355
+ "learning_rate": 0.0007674229326128867,
2356
+ "loss": 3.3166,
2357
+ "step": 29800
2358
+ },
2359
+ {
2360
+ "epoch": 0.598,
2361
+ "grad_norm": 0.15141139924526215,
2362
+ "learning_rate": 0.0007609955530717117,
2363
+ "loss": 3.2907,
2364
+ "step": 29900
2365
+ },
2366
+ {
2367
+ "epoch": 0.6,
2368
+ "grad_norm": 0.13476119935512543,
2369
+ "learning_rate": 0.0007545786283593116,
2370
+ "loss": 3.2933,
2371
+ "step": 30000
2372
+ },
2373
+ {
2374
+ "epoch": 0.6,
2375
+ "eval_accuracy": 0.38492172211350295,
2376
+ "eval_loss": 3.2943880558013916,
2377
+ "eval_runtime": 11.9455,
2378
+ "eval_samples_per_second": 83.713,
2379
+ "eval_steps_per_second": 0.67,
2380
+ "step": 30000
2381
  }
2382
  ],
2383
  "logging_steps": 100,