CodeIsAbstract commited on
Commit
1251dbc
·
verified ·
1 Parent(s): 7e7556a

Training in progress, step 22000, checkpoint

Browse files
last-checkpoint/model.safetensors CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:751294f048537038e250758d573a29f1e0658edad8e94d39ab9d4d3a09e6f9e8
3
  size 529337896
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:5540b02c0c8b9718f4c8b163b89d2536d0a204a96872cc1813830ea2f5ff2def
3
  size 529337896
last-checkpoint/optimizer.pt CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:003047188ae7aacd3b6801dc800cc4445151ccae190e498568ef9ad5e60978c7
3
  size 871247243
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:07da83974549f0bd472e89e0306438f6ba6224e07eeffab08f1bdd4c06240b0c
3
  size 871247243
last-checkpoint/rng_state.pth CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:91540c364711a6d4c4520973b3a3f4e9bff7842caef75dc08d20a08085c05012
3
  size 14645
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:67beb949b8d9f7d418f57ffcfa3af010c6a734200eee76f8fffbb6c1af5da698
3
  size 14645
last-checkpoint/scheduler.pt CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:fc15c4e3a3da92e36573426a7711e53525f3873e45550434cb0365a46f480e71
3
  size 1465
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:76fc781feaf7f256475a659aa4c1161b5c2bf2ab5d085f394f920fa586f35178
3
  size 1465
last-checkpoint/trainer_state.json CHANGED
@@ -2,9 +2,9 @@
2
  "best_global_step": null,
3
  "best_metric": null,
4
  "best_model_checkpoint": null,
5
- "epoch": 0.4,
6
  "eval_steps": 1000,
7
- "global_step": 20000,
8
  "is_hyper_param_search": false,
9
  "is_local_process_zero": true,
10
  "is_world_process_zero": true,
@@ -1588,6 +1588,164 @@
1588
  "eval_samples_per_second": 78.648,
1589
  "eval_steps_per_second": 0.629,
1590
  "step": 20000
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1591
  }
1592
  ],
1593
  "logging_steps": 100,
 
2
  "best_global_step": null,
3
  "best_metric": null,
4
  "best_model_checkpoint": null,
5
+ "epoch": 0.44,
6
  "eval_steps": 1000,
7
+ "global_step": 22000,
8
  "is_hyper_param_search": false,
9
  "is_local_process_zero": true,
10
  "is_world_process_zero": true,
 
1588
  "eval_samples_per_second": 78.648,
1589
  "eval_steps_per_second": 0.629,
1590
  "step": 20000
1591
+ },
1592
+ {
1593
+ "epoch": 0.402,
1594
+ "grad_norm": 0.18359500169754028,
1595
+ "learning_rate": 0.0013956906105251406,
1596
+ "loss": 3.4094,
1597
+ "step": 20100
1598
+ },
1599
+ {
1600
+ "epoch": 0.404,
1601
+ "grad_norm": 0.1576140820980072,
1602
+ "learning_rate": 0.0013896079203445497,
1603
+ "loss": 3.3935,
1604
+ "step": 20200
1605
+ },
1606
+ {
1607
+ "epoch": 0.406,
1608
+ "grad_norm": 0.22549428045749664,
1609
+ "learning_rate": 0.0013835081874513679,
1610
+ "loss": 3.4006,
1611
+ "step": 20300
1612
+ },
1613
+ {
1614
+ "epoch": 0.408,
1615
+ "grad_norm": 0.15331390500068665,
1616
+ "learning_rate": 0.001377391678667673,
1617
+ "loss": 3.4129,
1618
+ "step": 20400
1619
+ },
1620
+ {
1621
+ "epoch": 0.41,
1622
+ "grad_norm": 0.16119052469730377,
1623
+ "learning_rate": 0.0013712586615493736,
1624
+ "loss": 3.4036,
1625
+ "step": 20500
1626
+ },
1627
+ {
1628
+ "epoch": 0.412,
1629
+ "grad_norm": 0.15083439648151398,
1630
+ "learning_rate": 0.0013651094043745067,
1631
+ "loss": 3.3857,
1632
+ "step": 20600
1633
+ },
1634
+ {
1635
+ "epoch": 0.414,
1636
+ "grad_norm": 0.14811307191848755,
1637
+ "learning_rate": 0.0013589441761315021,
1638
+ "loss": 3.4058,
1639
+ "step": 20700
1640
+ },
1641
+ {
1642
+ "epoch": 0.416,
1643
+ "grad_norm": 0.15205927193164825,
1644
+ "learning_rate": 0.0013527632465074157,
1645
+ "loss": 3.4109,
1646
+ "step": 20800
1647
+ },
1648
+ {
1649
+ "epoch": 0.418,
1650
+ "grad_norm": 0.164772629737854,
1651
+ "learning_rate": 0.0013465668858761326,
1652
+ "loss": 3.3811,
1653
+ "step": 20900
1654
+ },
1655
+ {
1656
+ "epoch": 0.42,
1657
+ "grad_norm": 0.15865328907966614,
1658
+ "learning_rate": 0.00134035536528654,
1659
+ "loss": 3.3878,
1660
+ "step": 21000
1661
+ },
1662
+ {
1663
+ "epoch": 0.42,
1664
+ "eval_accuracy": 0.37497260273972605,
1665
+ "eval_loss": 3.3792359828948975,
1666
+ "eval_runtime": 12.1681,
1667
+ "eval_samples_per_second": 82.182,
1668
+ "eval_steps_per_second": 0.657,
1669
+ "step": 21000
1670
+ },
1671
+ {
1672
+ "epoch": 0.422,
1673
+ "grad_norm": 0.18703462183475494,
1674
+ "learning_rate": 0.0013341289564506717,
1675
+ "loss": 3.401,
1676
+ "step": 21100
1677
+ },
1678
+ {
1679
+ "epoch": 0.424,
1680
+ "grad_norm": 0.15354931354522705,
1681
+ "learning_rate": 0.0013278879317318202,
1682
+ "loss": 3.3947,
1683
+ "step": 21200
1684
+ },
1685
+ {
1686
+ "epoch": 0.426,
1687
+ "grad_norm": 0.14713342487812042,
1688
+ "learning_rate": 0.0013216325641326255,
1689
+ "loss": 3.3774,
1690
+ "step": 21300
1691
+ },
1692
+ {
1693
+ "epoch": 0.428,
1694
+ "grad_norm": 0.17548827826976776,
1695
+ "learning_rate": 0.0013153631272831304,
1696
+ "loss": 3.3794,
1697
+ "step": 21400
1698
+ },
1699
+ {
1700
+ "epoch": 0.43,
1701
+ "grad_norm": 0.1897333562374115,
1702
+ "learning_rate": 0.001309079895428813,
1703
+ "loss": 3.3955,
1704
+ "step": 21500
1705
+ },
1706
+ {
1707
+ "epoch": 0.432,
1708
+ "grad_norm": 0.1576170176267624,
1709
+ "learning_rate": 0.0013027831434185898,
1710
+ "loss": 3.3884,
1711
+ "step": 21600
1712
+ },
1713
+ {
1714
+ "epoch": 0.434,
1715
+ "grad_norm": 0.18555521965026855,
1716
+ "learning_rate": 0.0012964731466927916,
1717
+ "loss": 3.3695,
1718
+ "step": 21700
1719
+ },
1720
+ {
1721
+ "epoch": 0.436,
1722
+ "grad_norm": 0.15987864136695862,
1723
+ "learning_rate": 0.0012901501812711176,
1724
+ "loss": 3.3891,
1725
+ "step": 21800
1726
+ },
1727
+ {
1728
+ "epoch": 0.438,
1729
+ "grad_norm": 0.16719584167003632,
1730
+ "learning_rate": 0.0012838145237405588,
1731
+ "loss": 3.4056,
1732
+ "step": 21900
1733
+ },
1734
+ {
1735
+ "epoch": 0.44,
1736
+ "grad_norm": 0.19731645286083221,
1737
+ "learning_rate": 0.0012774664512432996,
1738
+ "loss": 3.3772,
1739
+ "step": 22000
1740
+ },
1741
+ {
1742
+ "epoch": 0.44,
1743
+ "eval_accuracy": 0.3771624266144814,
1744
+ "eval_loss": 3.3640236854553223,
1745
+ "eval_runtime": 12.4106,
1746
+ "eval_samples_per_second": 80.576,
1747
+ "eval_steps_per_second": 0.645,
1748
+ "step": 22000
1749
  }
1750
  ],
1751
  "logging_steps": 100,