texanrangee commited on
Commit
d250fbe
·
verified ·
1 Parent(s): a8eb2df

Training in progress, step 4800, checkpoint

Browse files
last-checkpoint/adapter_model.safetensors CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:8242f52a92c62a845041c41728143318a52d80c74355c0c02a20f176eed8bd63
3
- size 4418777208
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:4a48677be121fbdceeeabfe986e73dec1b480151800c1936b91cc4ace7b80e51
3
+ size 1266749168
last-checkpoint/optimizer.pt CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:46a41db12538a58cad6b9d522e056c088a7a857702ac7e5097cb6fc720ab5ad7
3
  size 2499769978
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:44e4a6a867bbc060d0c9facba78b7da76aadb4c3e6f9cafb001ecea1e69880d2
3
  size 2499769978
last-checkpoint/rng_state.pth CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:aac74e44c1a71dcbfa59145d91d50775d82428985363a6ca4220b6d26afd299a
3
  size 14244
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:5e347613182c5807d2f6db7accfb1c61cd49dff9dda43fd034155068ae72f90f
3
  size 14244
last-checkpoint/scheduler.pt CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:e975ebe14c129d8a83d4ef06bea88fea4e2469d748bead3dc1ea1004bbe72dfe
3
  size 1256
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:e8493cf662a0ef9cc409c1e71c561b4f018c668b3acc0b65f5c029d848604c14
3
  size 1256
last-checkpoint/trainer_state.json CHANGED
@@ -1,9 +1,9 @@
1
  {
2
- "best_metric": 2.8101491928100586,
3
- "best_model_checkpoint": "./output/checkpoint-4500",
4
- "epoch": 0.1444020152103456,
5
  "eval_steps": 150,
6
- "global_step": 4500,
7
  "is_hyper_param_search": false,
8
  "is_local_process_zero": true,
9
  "is_world_process_zero": true,
@@ -3397,6 +3397,232 @@
3397
  "eval_samples_per_second": 10.396,
3398
  "eval_steps_per_second": 10.396,
3399
  "step": 4500
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
3400
  }
3401
  ],
3402
  "logging_steps": 10,
@@ -3416,7 +3642,7 @@
3416
  "attributes": {}
3417
  }
3418
  },
3419
- "total_flos": 6.628119284149862e+17,
3420
  "train_batch_size": 8,
3421
  "trial_name": null,
3422
  "trial_params": null
 
1
  {
2
+ "best_metric": 2.8088018894195557,
3
+ "best_model_checkpoint": "./output/checkpoint-4800",
4
+ "epoch": 0.15402881622436865,
5
  "eval_steps": 150,
6
+ "global_step": 4800,
7
  "is_hyper_param_search": false,
8
  "is_local_process_zero": true,
9
  "is_world_process_zero": true,
 
3397
  "eval_samples_per_second": 10.396,
3398
  "eval_steps_per_second": 10.396,
3399
  "step": 4500
3400
+ },
3401
+ {
3402
+ "epoch": 0.14472290857747971,
3403
+ "grad_norm": 16.851276397705078,
3404
+ "learning_rate": 2.447174185242324e-06,
3405
+ "loss": 2.711,
3406
+ "step": 4510
3407
+ },
3408
+ {
3409
+ "epoch": 0.1450438019446138,
3410
+ "grad_norm": 14.372878074645996,
3411
+ "learning_rate": 2.3490904314356415e-06,
3412
+ "loss": 2.5261,
3413
+ "step": 4520
3414
+ },
3415
+ {
3416
+ "epoch": 0.1453646953117479,
3417
+ "grad_norm": 15.558879852294922,
3418
+ "learning_rate": 2.252965419885484e-06,
3419
+ "loss": 2.7099,
3420
+ "step": 4530
3421
+ },
3422
+ {
3423
+ "epoch": 0.145685588678882,
3424
+ "grad_norm": 28.370328903198242,
3425
+ "learning_rate": 2.1588031019145645e-06,
3426
+ "loss": 2.822,
3427
+ "step": 4540
3428
+ },
3429
+ {
3430
+ "epoch": 0.1460064820460161,
3431
+ "grad_norm": 19.941558837890625,
3432
+ "learning_rate": 2.0666073481669716e-06,
3433
+ "loss": 2.7601,
3434
+ "step": 4550
3435
+ },
3436
+ {
3437
+ "epoch": 0.14632737541315022,
3438
+ "grad_norm": 21.773801803588867,
3439
+ "learning_rate": 1.976381948449036e-06,
3440
+ "loss": 2.8107,
3441
+ "step": 4560
3442
+ },
3443
+ {
3444
+ "epoch": 0.1466482687802843,
3445
+ "grad_norm": 20.395721435546875,
3446
+ "learning_rate": 1.8881306115735636e-06,
3447
+ "loss": 2.694,
3448
+ "step": 4570
3449
+ },
3450
+ {
3451
+ "epoch": 0.14696916214741843,
3452
+ "grad_norm": 17.162796020507812,
3453
+ "learning_rate": 1.8018569652073385e-06,
3454
+ "loss": 2.6769,
3455
+ "step": 4580
3456
+ },
3457
+ {
3458
+ "epoch": 0.14729005551455251,
3459
+ "grad_norm": 16.146156311035156,
3460
+ "learning_rate": 1.717564555722057e-06,
3461
+ "loss": 2.6239,
3462
+ "step": 4590
3463
+ },
3464
+ {
3465
+ "epoch": 0.1476109488816866,
3466
+ "grad_norm": 12.009928703308105,
3467
+ "learning_rate": 1.635256848048528e-06,
3468
+ "loss": 2.6344,
3469
+ "step": 4600
3470
+ },
3471
+ {
3472
+ "epoch": 0.14793184224882072,
3473
+ "grad_norm": 13.901936531066895,
3474
+ "learning_rate": 1.554937225534237e-06,
3475
+ "loss": 2.5777,
3476
+ "step": 4610
3477
+ },
3478
+ {
3479
+ "epoch": 0.1482527356159548,
3480
+ "grad_norm": 14.903900146484375,
3481
+ "learning_rate": 1.4766089898042682e-06,
3482
+ "loss": 2.7427,
3483
+ "step": 4620
3484
+ },
3485
+ {
3486
+ "epoch": 0.14857362898308893,
3487
+ "grad_norm": 19.381118774414062,
3488
+ "learning_rate": 1.4002753606256085e-06,
3489
+ "loss": 2.5458,
3490
+ "step": 4630
3491
+ },
3492
+ {
3493
+ "epoch": 0.14889452235022302,
3494
+ "grad_norm": 21.685401916503906,
3495
+ "learning_rate": 1.3259394757747681e-06,
3496
+ "loss": 2.8216,
3497
+ "step": 4640
3498
+ },
3499
+ {
3500
+ "epoch": 0.14921541571735714,
3501
+ "grad_norm": 14.941693305969238,
3502
+ "learning_rate": 1.2536043909088193e-06,
3503
+ "loss": 2.6604,
3504
+ "step": 4650
3505
+ },
3506
+ {
3507
+ "epoch": 0.14921541571735714,
3508
+ "eval_loss": 2.8094427585601807,
3509
+ "eval_runtime": 52.4562,
3510
+ "eval_samples_per_second": 9.532,
3511
+ "eval_steps_per_second": 9.532,
3512
+ "step": 4650
3513
+ },
3514
+ {
3515
+ "epoch": 0.14953630908449123,
3516
+ "grad_norm": 16.120569229125977,
3517
+ "learning_rate": 1.1832730794397954e-06,
3518
+ "loss": 2.7746,
3519
+ "step": 4660
3520
+ },
3521
+ {
3522
+ "epoch": 0.14985720245162532,
3523
+ "grad_norm": 18.705150604248047,
3524
+ "learning_rate": 1.1149484324124329e-06,
3525
+ "loss": 2.7896,
3526
+ "step": 4670
3527
+ },
3528
+ {
3529
+ "epoch": 0.15017809581875943,
3530
+ "grad_norm": 16.73013687133789,
3531
+ "learning_rate": 1.0486332583853567e-06,
3532
+ "loss": 2.8454,
3533
+ "step": 4680
3534
+ },
3535
+ {
3536
+ "epoch": 0.15049898918589352,
3537
+ "grad_norm": 20.093090057373047,
3538
+ "learning_rate": 9.843302833156378e-07,
3539
+ "loss": 2.7689,
3540
+ "step": 4690
3541
+ },
3542
+ {
3543
+ "epoch": 0.15081988255302764,
3544
+ "grad_norm": 14.328740119934082,
3545
+ "learning_rate": 9.220421504467283e-07,
3546
+ "loss": 2.7829,
3547
+ "step": 4700
3548
+ },
3549
+ {
3550
+ "epoch": 0.15114077592016173,
3551
+ "grad_norm": 19.58456039428711,
3552
+ "learning_rate": 8.617714201998086e-07,
3553
+ "loss": 2.6827,
3554
+ "step": 4710
3555
+ },
3556
+ {
3557
+ "epoch": 0.15146166928729582,
3558
+ "grad_norm": 15.039648056030273,
3559
+ "learning_rate": 8.035205700685169e-07,
3560
+ "loss": 2.6102,
3561
+ "step": 4720
3562
+ },
3563
+ {
3564
+ "epoch": 0.15178256265442994,
3565
+ "grad_norm": 19.384174346923828,
3566
+ "learning_rate": 7.472919945171633e-07,
3567
+ "loss": 2.9844,
3568
+ "step": 4730
3569
+ },
3570
+ {
3571
+ "epoch": 0.15210345602156403,
3572
+ "grad_norm": 16.812217712402344,
3573
+ "learning_rate": 6.930880048822532e-07,
3574
+ "loss": 2.5543,
3575
+ "step": 4740
3576
+ },
3577
+ {
3578
+ "epoch": 0.15242434938869814,
3579
+ "grad_norm": 15.829549789428711,
3580
+ "learning_rate": 6.409108292774915e-07,
3581
+ "loss": 2.6509,
3582
+ "step": 4750
3583
+ },
3584
+ {
3585
+ "epoch": 0.15274524275583223,
3586
+ "grad_norm": 22.132287979125977,
3587
+ "learning_rate": 5.90762612502216e-07,
3588
+ "loss": 2.7741,
3589
+ "step": 4760
3590
+ },
3591
+ {
3592
+ "epoch": 0.15306613612296635,
3593
+ "grad_norm": 17.18742561340332,
3594
+ "learning_rate": 5.426454159531915e-07,
3595
+ "loss": 2.7961,
3596
+ "step": 4770
3597
+ },
3598
+ {
3599
+ "epoch": 0.15338702949010044,
3600
+ "grad_norm": 14.886670112609863,
3601
+ "learning_rate": 4.965612175399094e-07,
3602
+ "loss": 2.8282,
3603
+ "step": 4780
3604
+ },
3605
+ {
3606
+ "epoch": 0.15370792285723453,
3607
+ "grad_norm": 14.25700569152832,
3608
+ "learning_rate": 4.5251191160326514e-07,
3609
+ "loss": 2.7724,
3610
+ "step": 4790
3611
+ },
3612
+ {
3613
+ "epoch": 0.15402881622436865,
3614
+ "grad_norm": 13.147507667541504,
3615
+ "learning_rate": 4.104993088376975e-07,
3616
+ "loss": 2.7902,
3617
+ "step": 4800
3618
+ },
3619
+ {
3620
+ "epoch": 0.15402881622436865,
3621
+ "eval_loss": 2.8088018894195557,
3622
+ "eval_runtime": 44.5579,
3623
+ "eval_samples_per_second": 11.221,
3624
+ "eval_steps_per_second": 11.221,
3625
+ "step": 4800
3626
  }
3627
  ],
3628
  "logging_steps": 10,
 
3642
  "attributes": {}
3643
  }
3644
  },
3645
+ "total_flos": 7.062562841064975e+17,
3646
  "train_batch_size": 8,
3647
  "trial_name": null,
3648
  "trial_params": null