CodeIsAbstract commited on
Commit
94523ce
·
verified ·
1 Parent(s): 34be781

Training in progress, step 46000, checkpoint

Browse files
last-checkpoint/model.safetensors CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:d51a0a5e453607425c848e0863d5a4ab36a4fc9fed901c4fb5e3d7c1d8bba2eb
3
  size 579824888
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:aba48a88f14f88d2c676b3120dd7519cd2ee052cab006b018c9a25681e031cfa
3
  size 579824888
last-checkpoint/optimizer.pt CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:5b93cb01513134734f79ec44022214e96eaad2625ec4fee9b3ae02d90392b2e2
3
  size 1159794763
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:ad957f747373b217d0825dc13fc9b44c586655ceaf668fd0b235b21ea08e71e9
3
  size 1159794763
last-checkpoint/rng_state.pth CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:ad8615a2bc8d5c9830c43502db09bac7159496906784a5e3e8858b493b86a74e
3
  size 14645
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:ae7080db6ca7826aa7327063ffbab1e6619bd0540a568acd2fb404342bae3b24
3
  size 14645
last-checkpoint/scheduler.pt CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:0bfb9abbd73e30c47a72af0932c2957ee7105fa4396a7522b57a756dacd1ff9d
3
  size 1465
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:8d4c064c012204759619753d64e389586d8e5d36728d74e01c63e63ba6b44abd
3
  size 1465
last-checkpoint/trainer_state.json CHANGED
@@ -2,9 +2,9 @@
2
  "best_global_step": null,
3
  "best_metric": null,
4
  "best_model_checkpoint": null,
5
- "epoch": 0.24,
6
  "eval_steps": 1000,
7
- "global_step": 44000,
8
  "is_hyper_param_search": false,
9
  "is_local_process_zero": true,
10
  "is_world_process_zero": true,
@@ -3484,6 +3484,164 @@
3484
  "eval_samples_per_second": 225.69,
3485
  "eval_steps_per_second": 14.186,
3486
  "step": 44000
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
3487
  }
3488
  ],
3489
  "logging_steps": 100,
@@ -3503,7 +3661,7 @@
3503
  "attributes": {}
3504
  }
3505
  },
3506
- "total_flos": 1.72478278139904e+18,
3507
  "train_batch_size": 120,
3508
  "trial_name": null,
3509
  "trial_params": null
 
2
  "best_global_step": null,
3
  "best_metric": null,
4
  "best_model_checkpoint": null,
5
+ "epoch": 0.28,
6
  "eval_steps": 1000,
7
+ "global_step": 46000,
8
  "is_hyper_param_search": false,
9
  "is_local_process_zero": true,
10
  "is_world_process_zero": true,
 
3484
  "eval_samples_per_second": 225.69,
3485
  "eval_steps_per_second": 14.186,
3486
  "step": 44000
3487
+ },
3488
+ {
3489
+ "epoch": 0.242,
3490
+ "grad_norm": 0.1386120468378067,
3491
+ "learning_rate": 3.4178236498548566e-05,
3492
+ "loss": 2.9823358154296873,
3493
+ "step": 44100
3494
+ },
3495
+ {
3496
+ "epoch": 0.244,
3497
+ "grad_norm": 0.14559704065322876,
3498
+ "learning_rate": 3.304248771632068e-05,
3499
+ "loss": 3.000511474609375,
3500
+ "step": 44200
3501
+ },
3502
+ {
3503
+ "epoch": 0.246,
3504
+ "grad_norm": 0.1556394100189209,
3505
+ "learning_rate": 3.192528472458356e-05,
3506
+ "loss": 2.974275817871094,
3507
+ "step": 44300
3508
+ },
3509
+ {
3510
+ "epoch": 0.248,
3511
+ "grad_norm": 0.14107827842235565,
3512
+ "learning_rate": 3.0826671894424896e-05,
3513
+ "loss": 2.9849594116210936,
3514
+ "step": 44400
3515
+ },
3516
+ {
3517
+ "epoch": 0.25,
3518
+ "grad_norm": 0.1435183584690094,
3519
+ "learning_rate": 2.9746692858601153e-05,
3520
+ "loss": 2.986834716796875,
3521
+ "step": 44500
3522
+ },
3523
+ {
3524
+ "epoch": 0.252,
3525
+ "grad_norm": 0.14042021334171295,
3526
+ "learning_rate": 2.86853905098044e-05,
3527
+ "loss": 2.9832034301757813,
3528
+ "step": 44600
3529
+ },
3530
+ {
3531
+ "epoch": 0.254,
3532
+ "grad_norm": 0.14901328086853027,
3533
+ "learning_rate": 2.7642806998959825e-05,
3534
+ "loss": 2.9711032104492188,
3535
+ "step": 44700
3536
+ },
3537
+ {
3538
+ "epoch": 0.256,
3539
+ "grad_norm": 0.1637275367975235,
3540
+ "learning_rate": 2.6618983733550428e-05,
3541
+ "loss": 3.0130319213867187,
3542
+ "step": 44800
3543
+ },
3544
+ {
3545
+ "epoch": 0.258,
3546
+ "grad_norm": 0.15092074871063232,
3547
+ "learning_rate": 2.5613961375973384e-05,
3548
+ "loss": 2.976082458496094,
3549
+ "step": 44900
3550
+ },
3551
+ {
3552
+ "epoch": 0.26,
3553
+ "grad_norm": 0.15425318479537964,
3554
+ "learning_rate": 2.46277798419246e-05,
3555
+ "loss": 2.9721246337890626,
3556
+ "step": 45000
3557
+ },
3558
+ {
3559
+ "epoch": 0.26,
3560
+ "eval_accuracy": 0.3843389783344474,
3561
+ "eval_loss": 3.277207612991333,
3562
+ "eval_runtime": 9.0174,
3563
+ "eval_samples_per_second": 215.251,
3564
+ "eval_steps_per_second": 13.529,
3565
+ "step": 45000
3566
+ },
3567
+ {
3568
+ "epoch": 0.262,
3569
+ "grad_norm": 0.14529016613960266,
3570
+ "learning_rate": 2.3660478298813682e-05,
3571
+ "loss": 2.955975341796875,
3572
+ "step": 45100
3573
+ },
3574
+ {
3575
+ "epoch": 0.264,
3576
+ "grad_norm": 0.1409466564655304,
3577
+ "learning_rate": 2.271209516420808e-05,
3578
+ "loss": 2.9534814453125,
3579
+ "step": 45200
3580
+ },
3581
+ {
3582
+ "epoch": 0.266,
3583
+ "grad_norm": 0.1580328494310379,
3584
+ "learning_rate": 2.1782668104307513e-05,
3585
+ "loss": 2.9937799072265623,
3586
+ "step": 45300
3587
+ },
3588
+ {
3589
+ "epoch": 0.268,
3590
+ "grad_norm": 0.1395774632692337,
3591
+ "learning_rate": 2.087223403244809e-05,
3592
+ "loss": 2.9789169311523436,
3593
+ "step": 45400
3594
+ },
3595
+ {
3596
+ "epoch": 0.27,
3597
+ "grad_norm": 0.1499042958021164,
3598
+ "learning_rate": 1.9980829107635658e-05,
3599
+ "loss": 2.9510009765625,
3600
+ "step": 45500
3601
+ },
3602
+ {
3603
+ "epoch": 0.272,
3604
+ "grad_norm": 0.1363893300294876,
3605
+ "learning_rate": 1.9108488733110718e-05,
3606
+ "loss": 2.9952117919921877,
3607
+ "step": 45600
3608
+ },
3609
+ {
3610
+ "epoch": 0.274,
3611
+ "grad_norm": 0.15024074912071228,
3612
+ "learning_rate": 1.8255247554941346e-05,
3613
+ "loss": 2.942423095703125,
3614
+ "step": 45700
3615
+ },
3616
+ {
3617
+ "epoch": 0.276,
3618
+ "grad_norm": 0.1419738084077835,
3619
+ "learning_rate": 1.7421139460647716e-05,
3620
+ "loss": 2.964244689941406,
3621
+ "step": 45800
3622
+ },
3623
+ {
3624
+ "epoch": 0.278,
3625
+ "grad_norm": 0.14513224363327026,
3626
+ "learning_rate": 1.6606197577856196e-05,
3627
+ "loss": 2.977562255859375,
3628
+ "step": 45900
3629
+ },
3630
+ {
3631
+ "epoch": 0.28,
3632
+ "grad_norm": 0.1422048956155777,
3633
+ "learning_rate": 1.5810454272983443e-05,
3634
+ "loss": 2.969391174316406,
3635
+ "step": 46000
3636
+ },
3637
+ {
3638
+ "epoch": 0.28,
3639
+ "eval_accuracy": 0.38465757457521343,
3640
+ "eval_loss": 3.2764923572540283,
3641
+ "eval_runtime": 8.5865,
3642
+ "eval_samples_per_second": 226.054,
3643
+ "eval_steps_per_second": 14.208,
3644
+ "step": 46000
3645
  }
3646
  ],
3647
  "logging_steps": 100,
 
3661
  "attributes": {}
3662
  }
3663
  },
3664
+ "total_flos": 1.80318199873536e+18,
3665
  "train_batch_size": 120,
3666
  "trial_name": null,
3667
  "trial_params": null