CodeIsAbstract commited on
Commit
e801acf
·
verified ·
1 Parent(s): 9d3ef5e

Training in progress, step 8000, checkpoint

Browse files
last-checkpoint/optimizer.pt CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:bbdf201f2ca7db57b8feb7c3fd112ee2da171978edf625a10c49da7fb6425229
3
  size 1442699
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:fd74e6589d3e456165c757752a4ea537b0dce0f12a9239822f8f0b87e6fcab08
3
  size 1442699
last-checkpoint/pytorch_model.bin CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:5209572e45d9d97e930e13c4cbefc87684d2f813ab7698d7f8601f7281f9d968
3
  size 499774435
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:5c0b03c00b2afb37434503ce30b41dc6f4cc779bf2123b15db0c1a37a46bde51
3
  size 499774435
last-checkpoint/rng_state.pth CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:97cacdba2a01c848150f6f5acf2400fd2530701580557a29b8e2ae0aa198e156
3
  size 14455
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:6b43fdf0f4b166ccbde53eac22fd3e3b4db7ae9dc053939b2b5bbebd405317f8
3
  size 14455
last-checkpoint/scheduler.pt CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:eb2a89a85e1c8ac7ee9b5678d857a4d99090faa37a24489f44839e0801dfe16a
3
  size 1465
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:e9567d76a2efaa946d19913fd9fe6f6f70f6f7101d7dcb8866c09743534f2d4d
3
  size 1465
last-checkpoint/trainer_state.json CHANGED
@@ -2,9 +2,9 @@
2
  "best_global_step": null,
3
  "best_metric": null,
4
  "best_model_checkpoint": null,
5
- "epoch": 0.12,
6
  "eval_steps": 1000,
7
- "global_step": 6000,
8
  "is_hyper_param_search": false,
9
  "is_local_process_zero": true,
10
  "is_world_process_zero": true,
@@ -482,6 +482,164 @@
482
  "eval_samples_per_second": 146.862,
483
  "eval_steps_per_second": 18.358,
484
  "step": 6000
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
485
  }
486
  ],
487
  "logging_steps": 100,
 
2
  "best_global_step": null,
3
  "best_metric": null,
4
  "best_model_checkpoint": null,
5
+ "epoch": 0.16,
6
  "eval_steps": 1000,
7
+ "global_step": 8000,
8
  "is_hyper_param_search": false,
9
  "is_local_process_zero": true,
10
  "is_world_process_zero": true,
 
482
  "eval_samples_per_second": 146.862,
483
  "eval_steps_per_second": 18.358,
484
  "step": 6000
485
+ },
486
+ {
487
+ "epoch": 0.122,
488
+ "grad_norm": 0.3777143955230713,
489
+ "learning_rate": 0.0019718035350990712,
490
+ "loss": 5.025782775878906,
491
+ "step": 6100
492
+ },
493
+ {
494
+ "epoch": 0.124,
495
+ "grad_norm": 0.32341495156288147,
496
+ "learning_rate": 0.0019702227914230566,
497
+ "loss": 5.048944702148438,
498
+ "step": 6200
499
+ },
500
+ {
501
+ "epoch": 0.126,
502
+ "grad_norm": 0.6978408098220825,
503
+ "learning_rate": 0.001968599607059059,
504
+ "loss": 5.073916015625,
505
+ "step": 6300
506
+ },
507
+ {
508
+ "epoch": 0.128,
509
+ "grad_norm": 0.32388925552368164,
510
+ "learning_rate": 0.0019669340530104207,
511
+ "loss": 5.03993896484375,
512
+ "step": 6400
513
+ },
514
+ {
515
+ "epoch": 0.13,
516
+ "grad_norm": 0.36633092164993286,
517
+ "learning_rate": 0.001965226202133872,
518
+ "loss": 5.047967529296875,
519
+ "step": 6500
520
+ },
521
+ {
522
+ "epoch": 0.132,
523
+ "grad_norm": 0.36229783296585083,
524
+ "learning_rate": 0.0019634761291363427,
525
+ "loss": 4.99884033203125,
526
+ "step": 6600
527
+ },
528
+ {
529
+ "epoch": 0.134,
530
+ "grad_norm": 0.26596584916114807,
531
+ "learning_rate": 0.0019616839105716954,
532
+ "loss": 4.971425476074219,
533
+ "step": 6700
534
+ },
535
+ {
536
+ "epoch": 0.136,
537
+ "grad_norm": 0.2571287751197815,
538
+ "learning_rate": 0.0019598496248373755,
539
+ "loss": 4.944924926757812,
540
+ "step": 6800
541
+ },
542
+ {
543
+ "epoch": 0.138,
544
+ "grad_norm": 0.33811017870903015,
545
+ "learning_rate": 0.001957973352170984,
546
+ "loss": 5.022549438476562,
547
+ "step": 6900
548
+ },
549
+ {
550
+ "epoch": 0.14,
551
+ "grad_norm": 0.3483704924583435,
552
+ "learning_rate": 0.001956055174646765,
553
+ "loss": 4.955761108398438,
554
+ "step": 7000
555
+ },
556
+ {
557
+ "epoch": 0.14,
558
+ "eval_accuracy": 0.2182211350293542,
559
+ "eval_loss": 5.020055770874023,
560
+ "eval_runtime": 6.8173,
561
+ "eval_samples_per_second": 146.686,
562
+ "eval_steps_per_second": 18.336,
563
+ "step": 7000
564
+ },
565
+ {
566
+ "epoch": 0.142,
567
+ "grad_norm": 0.29454681277275085,
568
+ "learning_rate": 0.0019540951761720174,
569
+ "loss": 4.994992370605469,
570
+ "step": 7100
571
+ },
572
+ {
573
+ "epoch": 0.144,
574
+ "grad_norm": 0.7461824417114258,
575
+ "learning_rate": 0.0019520934424834247,
576
+ "loss": 4.95612060546875,
577
+ "step": 7200
578
+ },
579
+ {
580
+ "epoch": 0.146,
581
+ "grad_norm": 0.2770542502403259,
582
+ "learning_rate": 0.0019500500611433025,
583
+ "loss": 4.9815975952148435,
584
+ "step": 7300
585
+ },
586
+ {
587
+ "epoch": 0.148,
588
+ "grad_norm": 0.627005934715271,
589
+ "learning_rate": 0.0019479651215357707,
590
+ "loss": 4.982627563476562,
591
+ "step": 7400
592
+ },
593
+ {
594
+ "epoch": 0.15,
595
+ "grad_norm": 0.5774574279785156,
596
+ "learning_rate": 0.0019458387148628417,
597
+ "loss": 4.9119635009765625,
598
+ "step": 7500
599
+ },
600
+ {
601
+ "epoch": 0.152,
602
+ "grad_norm": 0.6212947368621826,
603
+ "learning_rate": 0.001943670934140432,
604
+ "loss": 4.96866455078125,
605
+ "step": 7600
606
+ },
607
+ {
608
+ "epoch": 0.154,
609
+ "grad_norm": 0.4175465703010559,
610
+ "learning_rate": 0.0019414618741942936,
611
+ "loss": 4.972650146484375,
612
+ "step": 7700
613
+ },
614
+ {
615
+ "epoch": 0.156,
616
+ "grad_norm": 0.30829882621765137,
617
+ "learning_rate": 0.0019392116316558638,
618
+ "loss": 4.9120181274414065,
619
+ "step": 7800
620
+ },
621
+ {
622
+ "epoch": 0.158,
623
+ "grad_norm": 0.2758282423019409,
624
+ "learning_rate": 0.001936920304958042,
625
+ "loss": 4.90683837890625,
626
+ "step": 7900
627
+ },
628
+ {
629
+ "epoch": 0.16,
630
+ "grad_norm": 0.30226844549179077,
631
+ "learning_rate": 0.0019345879943308804,
632
+ "loss": 4.854488220214844,
633
+ "step": 8000
634
+ },
635
+ {
636
+ "epoch": 0.16,
637
+ "eval_accuracy": 0.22608414872798435,
638
+ "eval_loss": 4.913477420806885,
639
+ "eval_runtime": 6.8714,
640
+ "eval_samples_per_second": 145.531,
641
+ "eval_steps_per_second": 18.191,
642
+ "step": 8000
643
  }
644
  ],
645
  "logging_steps": 100,