CodeIsAbstract commited on
Commit
51f065b
·
verified ·
1 Parent(s): e872148

Training in progress, step 24000, checkpoint

Browse files
last-checkpoint/model.safetensors CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:5540b02c0c8b9718f4c8b163b89d2536d0a204a96872cc1813830ea2f5ff2def
3
  size 529337896
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:a393eecc8859798c86704ccd1740b6f825f3063101dfb84fb1c0e1bb44fc8bb9
3
  size 529337896
last-checkpoint/optimizer.pt CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:07da83974549f0bd472e89e0306438f6ba6224e07eeffab08f1bdd4c06240b0c
3
  size 871247243
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:c1597d5dd75462983a2c5a48479f862672dc9074eaa7c62526cd140d73656352
3
  size 871247243
last-checkpoint/rng_state.pth CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:67beb949b8d9f7d418f57ffcfa3af010c6a734200eee76f8fffbb6c1af5da698
3
  size 14645
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:629924d74f807859938a2e0544d41b7fc7e7257734a23d6398e9f4c4c430a987
3
  size 14645
last-checkpoint/scheduler.pt CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:76fc781feaf7f256475a659aa4c1161b5c2bf2ab5d085f394f920fa586f35178
3
  size 1465
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:28b503174003f93898a1090cb2b211d63af9d1104e10530d32ee248925b03f40
3
  size 1465
last-checkpoint/trainer_state.json CHANGED
@@ -2,9 +2,9 @@
2
  "best_global_step": null,
3
  "best_metric": null,
4
  "best_model_checkpoint": null,
5
- "epoch": 0.44,
6
  "eval_steps": 1000,
7
- "global_step": 22000,
8
  "is_hyper_param_search": false,
9
  "is_local_process_zero": true,
10
  "is_world_process_zero": true,
@@ -1746,6 +1746,164 @@
1746
  "eval_samples_per_second": 80.576,
1747
  "eval_steps_per_second": 0.645,
1748
  "step": 22000
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1749
  }
1750
  ],
1751
  "logging_steps": 100,
 
2
  "best_global_step": null,
3
  "best_metric": null,
4
  "best_model_checkpoint": null,
5
+ "epoch": 0.48,
6
  "eval_steps": 1000,
7
+ "global_step": 24000,
8
  "is_hyper_param_search": false,
9
  "is_local_process_zero": true,
10
  "is_world_process_zero": true,
 
1746
  "eval_samples_per_second": 80.576,
1747
  "eval_steps_per_second": 0.645,
1748
  "step": 22000
1749
+ },
1750
+ {
1751
+ "epoch": 0.442,
1752
+ "grad_norm": 0.1659466177225113,
1753
+ "learning_rate": 0.0012711062414645967,
1754
+ "loss": 3.3785,
1755
+ "step": 22100
1756
+ },
1757
+ {
1758
+ "epoch": 0.444,
1759
+ "grad_norm": 0.15995340049266815,
1760
+ "learning_rate": 0.0012647341726206296,
1761
+ "loss": 3.389,
1762
+ "step": 22200
1763
+ },
1764
+ {
1765
+ "epoch": 0.446,
1766
+ "grad_norm": 0.17644192278385162,
1767
+ "learning_rate": 0.0012583505234463322,
1768
+ "loss": 3.3787,
1769
+ "step": 22300
1770
+ },
1771
+ {
1772
+ "epoch": 0.448,
1773
+ "grad_norm": 0.170969158411026,
1774
+ "learning_rate": 0.0012519555731831996,
1775
+ "loss": 3.365,
1776
+ "step": 22400
1777
+ },
1778
+ {
1779
+ "epoch": 0.45,
1780
+ "grad_norm": 0.1832742989063263,
1781
+ "learning_rate": 0.0012455496015670732,
1782
+ "loss": 3.3835,
1783
+ "step": 22500
1784
+ },
1785
+ {
1786
+ "epoch": 0.452,
1787
+ "grad_norm": 0.16345185041427612,
1788
+ "learning_rate": 0.001239132888815904,
1789
+ "loss": 3.3824,
1790
+ "step": 22600
1791
+ },
1792
+ {
1793
+ "epoch": 0.454,
1794
+ "grad_norm": 0.16044080257415771,
1795
+ "learning_rate": 0.0012327057156174945,
1796
+ "loss": 3.3691,
1797
+ "step": 22700
1798
+ },
1799
+ {
1800
+ "epoch": 0.456,
1801
+ "grad_norm": 0.1500287652015686,
1802
+ "learning_rate": 0.0012262683631172222,
1803
+ "loss": 3.3775,
1804
+ "step": 22800
1805
+ },
1806
+ {
1807
+ "epoch": 0.458,
1808
+ "grad_norm": 0.1463031768798828,
1809
+ "learning_rate": 0.0012198211129057393,
1810
+ "loss": 3.377,
1811
+ "step": 22900
1812
+ },
1813
+ {
1814
+ "epoch": 0.46,
1815
+ "grad_norm": 0.15354429185390472,
1816
+ "learning_rate": 0.0012133642470066562,
1817
+ "loss": 3.3741,
1818
+ "step": 23000
1819
+ },
1820
+ {
1821
+ "epoch": 0.46,
1822
+ "eval_accuracy": 0.3781017612524462,
1823
+ "eval_loss": 3.3543314933776855,
1824
+ "eval_runtime": 14.9495,
1825
+ "eval_samples_per_second": 66.892,
1826
+ "eval_steps_per_second": 0.535,
1827
+ "step": 23000
1828
+ },
1829
+ {
1830
+ "epoch": 0.462,
1831
+ "grad_norm": 0.16891853511333466,
1832
+ "learning_rate": 0.0012068980478642047,
1833
+ "loss": 3.3573,
1834
+ "step": 23100
1835
+ },
1836
+ {
1837
+ "epoch": 0.464,
1838
+ "grad_norm": 0.15053242444992065,
1839
+ "learning_rate": 0.0012004227983308828,
1840
+ "loss": 3.3767,
1841
+ "step": 23200
1842
+ },
1843
+ {
1844
+ "epoch": 0.466,
1845
+ "grad_norm": 0.13770438730716705,
1846
+ "learning_rate": 0.001193938781655082,
1847
+ "loss": 3.3735,
1848
+ "step": 23300
1849
+ },
1850
+ {
1851
+ "epoch": 0.468,
1852
+ "grad_norm": 0.16500090062618256,
1853
+ "learning_rate": 0.0011874462814686975,
1854
+ "loss": 3.3594,
1855
+ "step": 23400
1856
+ },
1857
+ {
1858
+ "epoch": 0.47,
1859
+ "grad_norm": 0.15050701797008514,
1860
+ "learning_rate": 0.0011809455817747194,
1861
+ "loss": 3.3736,
1862
+ "step": 23500
1863
+ },
1864
+ {
1865
+ "epoch": 0.472,
1866
+ "grad_norm": 0.14346493780612946,
1867
+ "learning_rate": 0.0011744369669348122,
1868
+ "loss": 3.3714,
1869
+ "step": 23600
1870
+ },
1871
+ {
1872
+ "epoch": 0.474,
1873
+ "grad_norm": 0.15672604739665985,
1874
+ "learning_rate": 0.0011679207216568738,
1875
+ "loss": 3.3547,
1876
+ "step": 23700
1877
+ },
1878
+ {
1879
+ "epoch": 0.476,
1880
+ "grad_norm": 0.20898281037807465,
1881
+ "learning_rate": 0.0011613971309825828,
1882
+ "loss": 3.3603,
1883
+ "step": 23800
1884
+ },
1885
+ {
1886
+ "epoch": 0.478,
1887
+ "grad_norm": 0.15672914683818817,
1888
+ "learning_rate": 0.001154866480274928,
1889
+ "loss": 3.363,
1890
+ "step": 23900
1891
+ },
1892
+ {
1893
+ "epoch": 0.48,
1894
+ "grad_norm": 0.15417250990867615,
1895
+ "learning_rate": 0.0011483290552057285,
1896
+ "loss": 3.3706,
1897
+ "step": 24000
1898
+ },
1899
+ {
1900
+ "epoch": 0.48,
1901
+ "eval_accuracy": 0.37883365949119374,
1902
+ "eval_loss": 3.344762086868286,
1903
+ "eval_runtime": 12.8887,
1904
+ "eval_samples_per_second": 77.587,
1905
+ "eval_steps_per_second": 0.621,
1906
+ "step": 24000
1907
  }
1908
  ],
1909
  "logging_steps": 100,