CodeIsAbstract commited on
Commit
8a9f055
·
verified ·
1 Parent(s): 0de9920

Training in progress, step 48000, checkpoint

Browse files
last-checkpoint/model.safetensors CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:aba48a88f14f88d2c676b3120dd7519cd2ee052cab006b018c9a25681e031cfa
3
  size 579824888
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:f3fc4d626ad6c3cb4de1fc483d63ece29335b1ac5d3a3a09441069e06f25f0f4
3
  size 579824888
last-checkpoint/optimizer.pt CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:ad957f747373b217d0825dc13fc9b44c586655ceaf668fd0b235b21ea08e71e9
3
  size 1159794763
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:bf775a5e217ca74f861e212773e3c63eebc3516f8b6ebbb367ca371744b5691c
3
  size 1159794763
last-checkpoint/rng_state.pth CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:ae7080db6ca7826aa7327063ffbab1e6619bd0540a568acd2fb404342bae3b24
3
  size 14645
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:873d111460b6ba6e0cbf9822bc67f72ae2c2daf614f4ccf90863d9afb393298c
3
  size 14645
last-checkpoint/scheduler.pt CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:8d4c064c012204759619753d64e389586d8e5d36728d74e01c63e63ba6b44abd
3
  size 1465
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:b7889eb31311ac1db79a50295b4c3d90a6a18859f1afe377de3ed83ac3442007
3
  size 1465
last-checkpoint/trainer_state.json CHANGED
@@ -2,9 +2,9 @@
2
  "best_global_step": null,
3
  "best_metric": null,
4
  "best_model_checkpoint": null,
5
- "epoch": 0.28,
6
  "eval_steps": 1000,
7
- "global_step": 46000,
8
  "is_hyper_param_search": false,
9
  "is_local_process_zero": true,
10
  "is_world_process_zero": true,
@@ -3642,6 +3642,164 @@
3642
  "eval_samples_per_second": 226.054,
3643
  "eval_steps_per_second": 14.208,
3644
  "step": 46000
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
3645
  }
3646
  ],
3647
  "logging_steps": 100,
@@ -3661,7 +3819,7 @@
3661
  "attributes": {}
3662
  }
3663
  },
3664
- "total_flos": 1.80318199873536e+18,
3665
  "train_batch_size": 120,
3666
  "trial_name": null,
3667
  "trial_params": null
 
2
  "best_global_step": null,
3
  "best_metric": null,
4
  "best_model_checkpoint": null,
5
+ "epoch": 0.32,
6
  "eval_steps": 1000,
7
+ "global_step": 48000,
8
  "is_hyper_param_search": false,
9
  "is_local_process_zero": true,
10
  "is_world_process_zero": true,
 
3642
  "eval_samples_per_second": 226.054,
3643
  "eval_steps_per_second": 14.208,
3644
  "step": 46000
3645
+ },
3646
+ {
3647
+ "epoch": 0.282,
3648
+ "grad_norm": 0.15725959837436676,
3649
+ "learning_rate": 1.5033941149951102e-05,
3650
+ "loss": 2.9681582641601563,
3651
+ "step": 46100
3652
+ },
3653
+ {
3654
+ "epoch": 0.284,
3655
+ "grad_norm": 0.14279291033744812,
3656
+ "learning_rate": 1.4276689048930535e-05,
3657
+ "loss": 2.9894549560546877,
3658
+ "step": 46200
3659
+ },
3660
+ {
3661
+ "epoch": 0.286,
3662
+ "grad_norm": 0.14746861159801483,
3663
+ "learning_rate": 1.353872804511791e-05,
3664
+ "loss": 2.9572384643554686,
3665
+ "step": 46300
3666
+ },
3667
+ {
3668
+ "epoch": 0.288,
3669
+ "grad_norm": 0.1410951167345047,
3670
+ "learning_rate": 1.2820087447539874e-05,
3671
+ "loss": 2.956263427734375,
3672
+ "step": 46400
3673
+ },
3674
+ {
3675
+ "epoch": 0.29,
3676
+ "grad_norm": 0.1605064570903778,
3677
+ "learning_rate": 1.212079579788955e-05,
3678
+ "loss": 2.9751992797851563,
3679
+ "step": 46500
3680
+ },
3681
+ {
3682
+ "epoch": 0.292,
3683
+ "grad_norm": 0.24090786278247833,
3684
+ "learning_rate": 1.1440880869392545e-05,
3685
+ "loss": 2.9600045776367185,
3686
+ "step": 46600
3687
+ },
3688
+ {
3689
+ "epoch": 0.294,
3690
+ "grad_norm": 0.14448581635951996,
3691
+ "learning_rate": 1.0780369665704504e-05,
3692
+ "loss": 2.9817608642578124,
3693
+ "step": 46700
3694
+ },
3695
+ {
3696
+ "epoch": 0.296,
3697
+ "grad_norm": 0.1405927687883377,
3698
+ "learning_rate": 1.01392884198383e-05,
3699
+ "loss": 2.9607421875,
3700
+ "step": 46800
3701
+ },
3702
+ {
3703
+ "epoch": 0.298,
3704
+ "grad_norm": 0.1901511251926422,
3705
+ "learning_rate": 9.517662593122034e-06,
3706
+ "loss": 2.9657598876953126,
3707
+ "step": 46900
3708
+ },
3709
+ {
3710
+ "epoch": 0.3,
3711
+ "grad_norm": 0.14527775347232819,
3712
+ "learning_rate": 8.915516874188124e-06,
3713
+ "loss": 2.9576675415039064,
3714
+ "step": 47000
3715
+ },
3716
+ {
3717
+ "epoch": 0.3,
3718
+ "eval_accuracy": 0.38471705931636907,
3719
+ "eval_loss": 3.275611639022827,
3720
+ "eval_runtime": 8.6293,
3721
+ "eval_samples_per_second": 224.931,
3722
+ "eval_steps_per_second": 14.138,
3723
+ "step": 47000
3724
+ },
3725
+ {
3726
+ "epoch": 0.302,
3727
+ "grad_norm": 0.14045824110507965,
3728
+ "learning_rate": 8.332875177992472e-06,
3729
+ "loss": 2.9552996826171873,
3730
+ "step": 47100
3731
+ },
3732
+ {
3733
+ "epoch": 0.304,
3734
+ "grad_norm": 0.14749419689178467,
3735
+ "learning_rate": 7.769760644864899e-06,
3736
+ "loss": 2.9305706787109376,
3737
+ "step": 47200
3738
+ },
3739
+ {
3740
+ "epoch": 0.306,
3741
+ "grad_norm": 0.144828200340271,
3742
+ "learning_rate": 7.2261956395899274e-06,
3743
+ "loss": 2.9670144653320314,
3744
+ "step": 47300
3745
+ },
3746
+ {
3747
+ "epoch": 0.308,
3748
+ "grad_norm": 0.15692554414272308,
3749
+ "learning_rate": 6.702201750518666e-06,
3750
+ "loss": 2.979140319824219,
3751
+ "step": 47400
3752
+ },
3753
+ {
3754
+ "epoch": 0.31,
3755
+ "grad_norm": 0.16095846891403198,
3756
+ "learning_rate": 6.197799788711267e-06,
3757
+ "loss": 2.9376812744140626,
3758
+ "step": 47500
3759
+ },
3760
+ {
3761
+ "epoch": 0.312,
3762
+ "grad_norm": 0.1510581076145172,
3763
+ "learning_rate": 5.713009787110424e-06,
3764
+ "loss": 2.9954681396484375,
3765
+ "step": 47600
3766
+ },
3767
+ {
3768
+ "epoch": 0.314,
3769
+ "grad_norm": 0.15443721413612366,
3770
+ "learning_rate": 5.247850999745951e-06,
3771
+ "loss": 2.9577410888671873,
3772
+ "step": 47700
3773
+ },
3774
+ {
3775
+ "epoch": 0.316,
3776
+ "grad_norm": 0.14504078030586243,
3777
+ "learning_rate": 4.80234190096962e-06,
3778
+ "loss": 2.9848419189453126,
3779
+ "step": 47800
3780
+ },
3781
+ {
3782
+ "epoch": 0.318,
3783
+ "grad_norm": 0.14038383960723877,
3784
+ "learning_rate": 4.37650018472191e-06,
3785
+ "loss": 2.9577120971679687,
3786
+ "step": 47900
3787
+ },
3788
+ {
3789
+ "epoch": 0.32,
3790
+ "grad_norm": 0.17559103667736053,
3791
+ "learning_rate": 3.970342763829071e-06,
3792
+ "loss": 2.95732421875,
3793
+ "step": 48000
3794
+ },
3795
+ {
3796
+ "epoch": 0.32,
3797
+ "eval_accuracy": 0.3846958867813815,
3798
+ "eval_loss": 3.275059223175049,
3799
+ "eval_runtime": 11.741,
3800
+ "eval_samples_per_second": 165.318,
3801
+ "eval_steps_per_second": 10.391,
3802
+ "step": 48000
3803
  }
3804
  ],
3805
  "logging_steps": 100,
 
3819
  "attributes": {}
3820
  }
3821
  },
3822
+ "total_flos": 1.88158121607168e+18,
3823
  "train_batch_size": 120,
3824
  "trial_name": null,
3825
  "trial_params": null