CodeIsAbstract commited on
Commit
8f9547c
·
verified ·
1 Parent(s): 507cc86

Training in progress, step 34000, checkpoint

Browse files
last-checkpoint/model.safetensors CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:e13225a7520c413144c7c1c355420a5c229ae4cb9ee2fc3ee9e6ec481a263534
3
  size 529337896
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:eacd16009db792813323d990cfe5dae9dfaf2c1b2b6746f6ce4ee5c5abd05fa3
3
  size 529337896
last-checkpoint/optimizer.pt CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:bc20992a7d2218d1b0875c85fb7d66067b2298850958dd0d9986500e15e7e571
3
  size 871247243
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:86b59222e117c9663552ff919bf9d06c38349de96bfd51727eb1c2c51c1eef72
3
  size 871247243
last-checkpoint/rng_state.pth CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:77b2a9c9cdb925b9023364da46617175730aa23d1c7044261e0928c3c8b3fa89
3
  size 14645
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:efa0171c7cd70527d3a922da6317b15994f35a839e2d8505c68b0fc08f030110
3
  size 14645
last-checkpoint/scheduler.pt CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:39126e57e188afe7385c7c1c99d9aefd09279fe89a89d601c31fe9b0f88441d3
3
  size 1465
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:dcc336e7edab566b72f19c8cdbf557762e0e53e457ed4985a87b74bd22371a59
3
  size 1465
last-checkpoint/trainer_state.json CHANGED
@@ -2,9 +2,9 @@
2
  "best_global_step": null,
3
  "best_metric": null,
4
  "best_model_checkpoint": null,
5
- "epoch": 0.64,
6
  "eval_steps": 1000,
7
- "global_step": 32000,
8
  "is_hyper_param_search": false,
9
  "is_local_process_zero": true,
10
  "is_world_process_zero": true,
@@ -2536,6 +2536,164 @@
2536
  "eval_samples_per_second": 81.928,
2537
  "eval_steps_per_second": 0.655,
2538
  "step": 32000
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
2539
  }
2540
  ],
2541
  "logging_steps": 100,
 
2
  "best_global_step": null,
3
  "best_metric": null,
4
  "best_model_checkpoint": null,
5
+ "epoch": 0.68,
6
  "eval_steps": 1000,
7
+ "global_step": 34000,
8
  "is_hyper_param_search": false,
9
  "is_local_process_zero": true,
10
  "is_world_process_zero": true,
 
2536
  "eval_samples_per_second": 81.928,
2537
  "eval_steps_per_second": 0.655,
2538
  "step": 32000
2539
+ },
2540
+ {
2541
+ "epoch": 0.642,
2542
+ "grad_norm": 0.15901386737823486,
2543
+ "learning_rate": 0.0006227308207857332,
2544
+ "loss": 3.2593,
2545
+ "step": 32100
2546
+ },
2547
+ {
2548
+ "epoch": 0.644,
2549
+ "grad_norm": 0.20247270166873932,
2550
+ "learning_rate": 0.0006166139792108727,
2551
+ "loss": 3.2716,
2552
+ "step": 32200
2553
+ },
2554
+ {
2555
+ "epoch": 0.646,
2556
+ "grad_norm": 0.1866617053747177,
2557
+ "learning_rate": 0.0006105139081825601,
2558
+ "loss": 3.2867,
2559
+ "step": 32300
2560
+ },
2561
+ {
2562
+ "epoch": 0.648,
2563
+ "grad_norm": 0.14510272443294525,
2564
+ "learning_rate": 0.0006044308745376636,
2565
+ "loss": 3.273,
2566
+ "step": 32400
2567
+ },
2568
+ {
2569
+ "epoch": 0.65,
2570
+ "grad_norm": 0.13237079977989197,
2571
+ "learning_rate": 0.000598365144367781,
2572
+ "loss": 3.2621,
2573
+ "step": 32500
2574
+ },
2575
+ {
2576
+ "epoch": 0.652,
2577
+ "grad_norm": 0.15459007024765015,
2578
+ "learning_rate": 0.0005923169830076003,
2579
+ "loss": 3.2658,
2580
+ "step": 32600
2581
+ },
2582
+ {
2583
+ "epoch": 0.654,
2584
+ "grad_norm": 0.13574740290641785,
2585
+ "learning_rate": 0.0005862866550232925,
2586
+ "loss": 3.2789,
2587
+ "step": 32700
2588
+ },
2589
+ {
2590
+ "epoch": 0.656,
2591
+ "grad_norm": 0.15900640189647675,
2592
+ "learning_rate": 0.0005802744242009394,
2593
+ "loss": 3.2648,
2594
+ "step": 32800
2595
+ },
2596
+ {
2597
+ "epoch": 0.658,
2598
+ "grad_norm": 0.18648633360862732,
2599
+ "learning_rate": 0.000574280553534994,
2600
+ "loss": 3.2575,
2601
+ "step": 32900
2602
+ },
2603
+ {
2604
+ "epoch": 0.66,
2605
+ "grad_norm": 0.15465696156024933,
2606
+ "learning_rate": 0.0005683053052167772,
2607
+ "loss": 3.2787,
2608
+ "step": 33000
2609
+ },
2610
+ {
2611
+ "epoch": 0.66,
2612
+ "eval_accuracy": 0.3878962818003914,
2613
+ "eval_loss": 3.276221513748169,
2614
+ "eval_runtime": 11.2808,
2615
+ "eval_samples_per_second": 88.646,
2616
+ "eval_steps_per_second": 0.709,
2617
+ "step": 33000
2618
+ },
2619
+ {
2620
+ "epoch": 0.662,
2621
+ "grad_norm": 0.15960443019866943,
2622
+ "learning_rate": 0.000562348940623007,
2623
+ "loss": 3.2866,
2624
+ "step": 33100
2625
+ },
2626
+ {
2627
+ "epoch": 0.664,
2628
+ "grad_norm": 0.13718590140342712,
2629
+ "learning_rate": 0.0005564117203043664,
2630
+ "loss": 3.2549,
2631
+ "step": 33200
2632
+ },
2633
+ {
2634
+ "epoch": 0.666,
2635
+ "grad_norm": 0.1479761153459549,
2636
+ "learning_rate": 0.0005504939039741067,
2637
+ "loss": 3.2697,
2638
+ "step": 33300
2639
+ },
2640
+ {
2641
+ "epoch": 0.668,
2642
+ "grad_norm": 0.15424597263336182,
2643
+ "learning_rate": 0.0005445957504966848,
2644
+ "loss": 3.2743,
2645
+ "step": 33400
2646
+ },
2647
+ {
2648
+ "epoch": 0.67,
2649
+ "grad_norm": 0.13904234766960144,
2650
+ "learning_rate": 0.0005387175178764416,
2651
+ "loss": 3.2551,
2652
+ "step": 33500
2653
+ },
2654
+ {
2655
+ "epoch": 0.672,
2656
+ "grad_norm": 0.18515262007713318,
2657
+ "learning_rate": 0.000532859463246314,
2658
+ "loss": 3.2581,
2659
+ "step": 33600
2660
+ },
2661
+ {
2662
+ "epoch": 0.674,
2663
+ "grad_norm": 0.1791761815547943,
2664
+ "learning_rate": 0.0005270218428565896,
2665
+ "loss": 3.2701,
2666
+ "step": 33700
2667
+ },
2668
+ {
2669
+ "epoch": 0.676,
2670
+ "grad_norm": 0.17315128445625305,
2671
+ "learning_rate": 0.0005212049120636959,
2672
+ "loss": 3.2631,
2673
+ "step": 33800
2674
+ },
2675
+ {
2676
+ "epoch": 0.678,
2677
+ "grad_norm": 0.1509447544813156,
2678
+ "learning_rate": 0.000515408925319029,
2679
+ "loss": 3.2592,
2680
+ "step": 33900
2681
+ },
2682
+ {
2683
+ "epoch": 0.68,
2684
+ "grad_norm": 0.1570684164762497,
2685
+ "learning_rate": 0.0005096341361578265,
2686
+ "loss": 3.2685,
2687
+ "step": 34000
2688
+ },
2689
+ {
2690
+ "epoch": 0.68,
2691
+ "eval_accuracy": 0.3882113502935421,
2692
+ "eval_loss": 3.2670066356658936,
2693
+ "eval_runtime": 11.2814,
2694
+ "eval_samples_per_second": 88.642,
2695
+ "eval_steps_per_second": 0.709,
2696
+ "step": 34000
2697
  }
2698
  ],
2699
  "logging_steps": 100,