CodeIsAbstract commited on
Commit
1c1535e
·
verified ·
1 Parent(s): ead1ec0

Training in progress, step 10000, checkpoint

Browse files
last-checkpoint/model.safetensors CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:8b5b2537f5142e6fa774f5229435c8fe08d7962419f4ec779873d8e1778b6a5a
3
  size 579824888
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:172b83ee8c0c178fc631d554a3d8e1a9ee973cecb6292c8a65ea9cf6b9413a5f
3
  size 579824888
last-checkpoint/optimizer.pt CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:fde75f324a8d5912df33d74af3539f7d5c0a866216e75d10d52848057c5278fd
3
  size 1159794763
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:4bb1ba220a967824aa67b3f408cb2411ac14a2a8f57c220950876c97a9607f93
3
  size 1159794763
last-checkpoint/rng_state.pth CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:231a1d74fdd644709c48076ea6500b1a4f8ca1620a6f210d62a4c539f1ee0b0f
3
  size 14645
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:62b01f9ae52b370a3c5177e3cbec51226c2ec58f411c1ee0496cca95d179b183
3
  size 14645
last-checkpoint/scheduler.pt CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:0182b4495f3c647cd51b29236a0c27e55ac1c8000e2e254b23fc4d917b1a56da
3
  size 1465
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:687c619a9c245be775b1ee059ceaff574f576584c143ed02ddcab0296c87f35b
3
  size 1465
last-checkpoint/trainer_state.json CHANGED
@@ -2,9 +2,9 @@
2
  "best_global_step": null,
3
  "best_metric": null,
4
  "best_model_checkpoint": null,
5
- "epoch": 0.16,
6
  "eval_steps": 1000,
7
- "global_step": 8000,
8
  "is_hyper_param_search": false,
9
  "is_local_process_zero": true,
10
  "is_world_process_zero": true,
@@ -640,6 +640,164 @@
640
  "eval_samples_per_second": 241.259,
641
  "eval_steps_per_second": 15.164,
642
  "step": 8000
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
643
  }
644
  ],
645
  "logging_steps": 100,
@@ -659,7 +817,7 @@
659
  "attributes": {}
660
  }
661
  },
662
- "total_flos": 3.1359686934528e+17,
663
  "train_batch_size": 120,
664
  "trial_name": null,
665
  "trial_params": null
 
2
  "best_global_step": null,
3
  "best_metric": null,
4
  "best_model_checkpoint": null,
5
+ "epoch": 0.2,
6
  "eval_steps": 1000,
7
+ "global_step": 10000,
8
  "is_hyper_param_search": false,
9
  "is_local_process_zero": true,
10
  "is_world_process_zero": true,
 
640
  "eval_samples_per_second": 241.259,
641
  "eval_steps_per_second": 15.164,
642
  "step": 8000
643
+ },
644
+ {
645
+ "epoch": 0.162,
646
+ "grad_norm": 0.16548939049243927,
647
+ "learning_rate": 0.0009385625730561914,
648
+ "loss": 3.588617248535156,
649
+ "step": 8100
650
+ },
651
+ {
652
+ "epoch": 0.164,
653
+ "grad_norm": 0.16542939841747284,
654
+ "learning_rate": 0.0009370405468572831,
655
+ "loss": 3.590567626953125,
656
+ "step": 8200
657
+ },
658
+ {
659
+ "epoch": 0.166,
660
+ "grad_norm": 0.18206581473350525,
661
+ "learning_rate": 0.0009355011630568697,
662
+ "loss": 3.636882629394531,
663
+ "step": 8300
664
+ },
665
+ {
666
+ "epoch": 0.168,
667
+ "grad_norm": 0.2654706835746765,
668
+ "learning_rate": 0.0009339444827934676,
669
+ "loss": 3.6797540283203123,
670
+ "step": 8400
671
+ },
672
+ {
673
+ "epoch": 0.17,
674
+ "grad_norm": 0.16825009882450104,
675
+ "learning_rate": 0.0009323705678925427,
676
+ "loss": 3.686376953125,
677
+ "step": 8500
678
+ },
679
+ {
680
+ "epoch": 0.172,
681
+ "grad_norm": 0.18937945365905762,
682
+ "learning_rate": 0.000930779480864057,
683
+ "loss": 3.6942425537109376,
684
+ "step": 8600
685
+ },
686
+ {
687
+ "epoch": 0.174,
688
+ "grad_norm": 0.19819994270801544,
689
+ "learning_rate": 0.0009291712848999833,
690
+ "loss": 3.6582196044921873,
691
+ "step": 8700
692
+ },
693
+ {
694
+ "epoch": 0.176,
695
+ "grad_norm": 0.1557057648897171,
696
+ "learning_rate": 0.0009275460438717975,
697
+ "loss": 3.6659271240234377,
698
+ "step": 8800
699
+ },
700
+ {
701
+ "epoch": 0.178,
702
+ "grad_norm": 0.16359280049800873,
703
+ "learning_rate": 0.0009259038223279413,
704
+ "loss": 3.66092529296875,
705
+ "step": 8900
706
+ },
707
+ {
708
+ "epoch": 0.18,
709
+ "grad_norm": 0.17897452414035797,
710
+ "learning_rate": 0.0009242446854912575,
711
+ "loss": 3.6642529296875,
712
+ "step": 9000
713
+ },
714
+ {
715
+ "epoch": 0.18,
716
+ "eval_accuracy": 0.3497692697794326,
717
+ "eval_loss": 3.617546319961548,
718
+ "eval_runtime": 6.279,
719
+ "eval_samples_per_second": 309.124,
720
+ "eval_steps_per_second": 19.43,
721
+ "step": 9000
722
+ },
723
+ {
724
+ "epoch": 0.182,
725
+ "grad_norm": 0.20515520870685577,
726
+ "learning_rate": 0.0009225686992564015,
727
+ "loss": 3.6445053100585936,
728
+ "step": 9100
729
+ },
730
+ {
731
+ "epoch": 0.184,
732
+ "grad_norm": 0.16788582503795624,
733
+ "learning_rate": 0.0009208759301872229,
734
+ "loss": 3.657896728515625,
735
+ "step": 9200
736
+ },
737
+ {
738
+ "epoch": 0.186,
739
+ "grad_norm": 0.1988508403301239,
740
+ "learning_rate": 0.0009191664455141217,
741
+ "loss": 3.616723937988281,
742
+ "step": 9300
743
+ },
744
+ {
745
+ "epoch": 0.188,
746
+ "grad_norm": 0.1822570413351059,
747
+ "learning_rate": 0.0009174403131313792,
748
+ "loss": 3.6103390502929686,
749
+ "step": 9400
750
+ },
751
+ {
752
+ "epoch": 0.19,
753
+ "grad_norm": 0.15679553151130676,
754
+ "learning_rate": 0.0009156976015944607,
755
+ "loss": 3.624302978515625,
756
+ "step": 9500
757
+ },
758
+ {
759
+ "epoch": 0.192,
760
+ "grad_norm": 0.15683937072753906,
761
+ "learning_rate": 0.0009139383801172929,
762
+ "loss": 3.6558917236328123,
763
+ "step": 9600
764
+ },
765
+ {
766
+ "epoch": 0.194,
767
+ "grad_norm": 0.1553466022014618,
768
+ "learning_rate": 0.0009121627185695152,
769
+ "loss": 3.6198284912109373,
770
+ "step": 9700
771
+ },
772
+ {
773
+ "epoch": 0.196,
774
+ "grad_norm": 0.14881721138954163,
775
+ "learning_rate": 0.0009103706874737043,
776
+ "loss": 3.60408203125,
777
+ "step": 9800
778
+ },
779
+ {
780
+ "epoch": 0.198,
781
+ "grad_norm": 0.1628589779138565,
782
+ "learning_rate": 0.0009085623580025737,
783
+ "loss": 3.6047940063476562,
784
+ "step": 9900
785
+ },
786
+ {
787
+ "epoch": 0.2,
788
+ "grad_norm": 0.15589991211891174,
789
+ "learning_rate": 0.0009067378019761472,
790
+ "loss": 3.599223327636719,
791
+ "step": 10000
792
+ },
793
+ {
794
+ "epoch": 0.2,
795
+ "eval_accuracy": 0.3534593401629882,
796
+ "eval_loss": 3.579674005508423,
797
+ "eval_runtime": 6.3176,
798
+ "eval_samples_per_second": 307.239,
799
+ "eval_steps_per_second": 19.311,
800
+ "step": 10000
801
  }
802
  ],
803
  "logging_steps": 100,
 
817
  "attributes": {}
818
  }
819
  },
820
+ "total_flos": 3.919960866816e+17,
821
  "train_batch_size": 120,
822
  "trial_name": null,
823
  "trial_params": null