CodeIsAbstract commited on
Commit
5ddbe07
·
verified ·
1 Parent(s): 8a01263

Training in progress, step 32000, checkpoint

Browse files
last-checkpoint/model.safetensors CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:7a06d3e4983c41dc765c1eeb6d6658168972c5471a58499281b23d7c94887016
3
  size 529337896
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:e13225a7520c413144c7c1c355420a5c229ae4cb9ee2fc3ee9e6ec481a263534
3
  size 529337896
last-checkpoint/optimizer.pt CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:4de60ec340a338ae4512a57938b518f19425ddce90de24fb45b35add85e7ffcf
3
  size 871247243
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:bc20992a7d2218d1b0875c85fb7d66067b2298850958dd0d9986500e15e7e571
3
  size 871247243
last-checkpoint/rng_state.pth CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:8a55af3df2d414ccfff007ed59f001ee92e87d61217a24dace06b2b7ddba80fa
3
  size 14645
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:77b2a9c9cdb925b9023364da46617175730aa23d1c7044261e0928c3c8b3fa89
3
  size 14645
last-checkpoint/scheduler.pt CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:4ab5189814d428569ba62b550ae72cffeac88caf85e39082cf01ca7e7f9f982e
3
  size 1465
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:39126e57e188afe7385c7c1c99d9aefd09279fe89a89d601c31fe9b0f88441d3
3
  size 1465
last-checkpoint/trainer_state.json CHANGED
@@ -2,9 +2,9 @@
2
  "best_global_step": null,
3
  "best_metric": null,
4
  "best_model_checkpoint": null,
5
- "epoch": 0.6,
6
  "eval_steps": 1000,
7
- "global_step": 30000,
8
  "is_hyper_param_search": false,
9
  "is_local_process_zero": true,
10
  "is_world_process_zero": true,
@@ -2378,6 +2378,164 @@
2378
  "eval_samples_per_second": 83.713,
2379
  "eval_steps_per_second": 0.67,
2380
  "step": 30000
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
2381
  }
2382
  ],
2383
  "logging_steps": 100,
 
2
  "best_global_step": null,
3
  "best_metric": null,
4
  "best_model_checkpoint": null,
5
+ "epoch": 0.64,
6
  "eval_steps": 1000,
7
+ "global_step": 32000,
8
  "is_hyper_param_search": false,
9
  "is_local_process_zero": true,
10
  "is_world_process_zero": true,
 
2378
  "eval_samples_per_second": 83.713,
2379
  "eval_steps_per_second": 0.67,
2380
  "step": 30000
2381
+ },
2382
+ {
2383
+ "epoch": 0.602,
2384
+ "grad_norm": 0.19772815704345703,
2385
+ "learning_rate": 0.0007481724391727628,
2386
+ "loss": 3.3089,
2387
+ "step": 30100
2388
+ },
2389
+ {
2390
+ "epoch": 0.604,
2391
+ "grad_norm": 0.16669701039791107,
2392
+ "learning_rate": 0.0007417772657395325,
2393
+ "loss": 3.3032,
2394
+ "step": 30200
2395
+ },
2396
+ {
2397
+ "epoch": 0.606,
2398
+ "grad_norm": 0.15029844641685486,
2399
+ "learning_rate": 0.0007353933878052245,
2400
+ "loss": 3.2961,
2401
+ "step": 30300
2402
+ },
2403
+ {
2404
+ "epoch": 0.608,
2405
+ "grad_norm": 0.1436147391796112,
2406
+ "learning_rate": 0.0007290210846213408,
2407
+ "loss": 3.2984,
2408
+ "step": 30400
2409
+ },
2410
+ {
2411
+ "epoch": 0.61,
2412
+ "grad_norm": 0.1456470638513565,
2413
+ "learning_rate": 0.0007226606349330653,
2414
+ "loss": 3.3059,
2415
+ "step": 30500
2416
+ },
2417
+ {
2418
+ "epoch": 0.612,
2419
+ "grad_norm": 0.15387193858623505,
2420
+ "learning_rate": 0.0007163123169670729,
2421
+ "loss": 3.3034,
2422
+ "step": 30600
2423
+ },
2424
+ {
2425
+ "epoch": 0.614,
2426
+ "grad_norm": 0.1466827392578125,
2427
+ "learning_rate": 0.0007099764084193565,
2428
+ "loss": 3.278,
2429
+ "step": 30700
2430
+ },
2431
+ {
2432
+ "epoch": 0.616,
2433
+ "grad_norm": 0.17281971871852875,
2434
+ "learning_rate": 0.0007036531864430824,
2435
+ "loss": 3.2818,
2436
+ "step": 30800
2437
+ },
2438
+ {
2439
+ "epoch": 0.618,
2440
+ "grad_norm": 0.15874525904655457,
2441
+ "learning_rate": 0.0006973429276364641,
2442
+ "loss": 3.3064,
2443
+ "step": 30900
2444
+ },
2445
+ {
2446
+ "epoch": 0.62,
2447
+ "grad_norm": 0.14938025176525116,
2448
+ "learning_rate": 0.0006910459080306636,
2449
+ "loss": 3.2793,
2450
+ "step": 31000
2451
+ },
2452
+ {
2453
+ "epoch": 0.62,
2454
+ "eval_accuracy": 0.3857945205479452,
2455
+ "eval_loss": 3.2896742820739746,
2456
+ "eval_runtime": 12.6346,
2457
+ "eval_samples_per_second": 79.148,
2458
+ "eval_steps_per_second": 0.633,
2459
+ "step": 31000
2460
+ },
2461
+ {
2462
+ "epoch": 0.622,
2463
+ "grad_norm": 0.12781454622745514,
2464
+ "learning_rate": 0.0006847624030777184,
2465
+ "loss": 3.2855,
2466
+ "step": 31100
2467
+ },
2468
+ {
2469
+ "epoch": 0.624,
2470
+ "grad_norm": 0.15578420460224152,
2471
+ "learning_rate": 0.0006784926876384907,
2472
+ "loss": 3.2931,
2473
+ "step": 31200
2474
+ },
2475
+ {
2476
+ "epoch": 0.626,
2477
+ "grad_norm": 0.1583343893289566,
2478
+ "learning_rate": 0.000672237035970645,
2479
+ "loss": 3.283,
2480
+ "step": 31300
2481
+ },
2482
+ {
2483
+ "epoch": 0.628,
2484
+ "grad_norm": 0.14310809969902039,
2485
+ "learning_rate": 0.0006659957217166504,
2486
+ "loss": 3.2721,
2487
+ "step": 31400
2488
+ },
2489
+ {
2490
+ "epoch": 0.63,
2491
+ "grad_norm": 0.19646517932415009,
2492
+ "learning_rate": 0.0006597690178918121,
2493
+ "loss": 3.2853,
2494
+ "step": 31500
2495
+ },
2496
+ {
2497
+ "epoch": 0.632,
2498
+ "grad_norm": 0.1555543690919876,
2499
+ "learning_rate": 0.0006535571968723266,
2500
+ "loss": 3.2907,
2501
+ "step": 31600
2502
+ },
2503
+ {
2504
+ "epoch": 0.634,
2505
+ "grad_norm": 0.15089106559753418,
2506
+ "learning_rate": 0.0006473605303833691,
2507
+ "loss": 3.2856,
2508
+ "step": 31700
2509
+ },
2510
+ {
2511
+ "epoch": 0.636,
2512
+ "grad_norm": 0.15569235384464264,
2513
+ "learning_rate": 0.000641179289487206,
2514
+ "loss": 3.268,
2515
+ "step": 31800
2516
+ },
2517
+ {
2518
+ "epoch": 0.638,
2519
+ "grad_norm": 0.15568938851356506,
2520
+ "learning_rate": 0.0006350137445713386,
2521
+ "loss": 3.2885,
2522
+ "step": 31900
2523
+ },
2524
+ {
2525
+ "epoch": 0.64,
2526
+ "grad_norm": 0.14168080687522888,
2527
+ "learning_rate": 0.0006288641653366752,
2528
+ "loss": 3.2906,
2529
+ "step": 32000
2530
+ },
2531
+ {
2532
+ "epoch": 0.64,
2533
+ "eval_accuracy": 0.38636986301369863,
2534
+ "eval_loss": 3.280740976333618,
2535
+ "eval_runtime": 12.2058,
2536
+ "eval_samples_per_second": 81.928,
2537
+ "eval_steps_per_second": 0.655,
2538
+ "step": 32000
2539
  }
2540
  ],
2541
  "logging_steps": 100,