CodeIsAbstract commited on
Commit
ff67136
·
verified ·
1 Parent(s): 648b103

Training in progress, step 2000, checkpoint

Browse files
last-checkpoint/model.safetensors CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:f5705e7af05b27ed5ad80eeb0dae22c64e16bff581aaf95045a9a3c2b27d7f21
3
  size 734275920
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:f8a5c6f637a1a02dcc7ffaf9221661cd85b1333abef16fc488c6b215871a6822
3
  size 734275920
last-checkpoint/optimizer.pt CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:3e9ff05a88f38ae15dcd4e979b30ea6e420ba8aa2182c4adeee6f99722b56a5e
3
  size 1468687243
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:52c3777540c9cd45951a7ac81a4e2bd9cf7e915ec27607f40e65e0ff5e617376
3
  size 1468687243
last-checkpoint/rng_state_0.pth CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:ac82640fafcec4ed8ce64644dd9dc382f3c142b4db92d38741fbda9a0d9aa763
3
  size 14469
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:bab46455b81fe89286c0ac46f8274ae8d3f1816023d3983b6a1b462f39004a0d
3
  size 14469
last-checkpoint/rng_state_1.pth CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:78b31fd960caa060732c4a15ecd9d246ac0b9616bb6fb26ea726c7f67997fc86
3
  size 14469
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:47566dba2923569afde0e0a5ff4f2c437f9949274f917cc17b4936577ce63ab0
3
  size 14469
last-checkpoint/rng_state_2.pth CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:af82b03ee66a3766dd3122ac1bd62daf83a9a7fc283f1df0579a5c40ddfef85e
3
  size 14469
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:3324888af4fe870d448514f0b37d040d89d6aebdf2c735d51b734b3cbec36311
3
  size 14469
last-checkpoint/rng_state_3.pth CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:c03e28169c2c00e7fe490c6e4aa7935441cb75b55aeeb2e3bed7d76862fc0206
3
  size 14469
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:39b762073c3a91474269912b3ac897e24094100f62acadd0675372ec65e569e0
3
  size 14469
last-checkpoint/rng_state_4.pth CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:ce0140d9aef0aa9f9eff1f556146a51b440b5ca7bd8c9b6043e06890735ba840
3
  size 14469
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:a4f51ed2846fc1924bdb38919225f48ce1c91d4b4e7f33ffeffcc034c81c3137
3
  size 14469
last-checkpoint/rng_state_5.pth CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:d5362ad2368a4ee2c667be0d3d1a656244a24515027b86ba737e31a78d06f0d5
3
  size 14469
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:b3591e1beb54a633e255be3082ac8130dcb0fb2f006bfea6cd68b941d0fc906f
3
  size 14469
last-checkpoint/rng_state_6.pth CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:983aeb93e8b1ee3cd8c0ae6e23e1979775495cab73d44b292da46ee36a3343a5
3
  size 14469
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:d023a9bb27873f11f312f75e42b2c4fe8003df9343f38bb24a6ae408e1b22e14
3
  size 14469
last-checkpoint/rng_state_7.pth CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:d75816da70d512d83fb7557d7a5c717448c64bfd6d870f6115bed5b80d2a1e9f
3
  size 14469
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:04aea28178ef35e5c4d53227bf7103f8d69d1ab082c35d47cd15905005ed5538
3
  size 14469
last-checkpoint/scheduler.pt CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:97205df308aacb47c267cc39a5798ea630f3942b814c426e195523287df99abf
3
  size 1465
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:49159d7a99a47c2c1201791bfa611289fd4e18fce3afc4b5f5914a4bf7836d08
3
  size 1465
last-checkpoint/trainer_state.json CHANGED
@@ -11,158 +11,158 @@
11
  "log_history": [
12
  {
13
  "epoch": 0.002,
14
- "grad_norm": 5.65625,
15
- "learning_rate": 6.6e-05,
16
- "loss": 73.6,
17
  "step": 100
18
  },
19
  {
20
  "epoch": 0.004,
21
- "grad_norm": 3.375,
22
- "learning_rate": 9.999976160274871e-05,
23
- "loss": 57.8,
24
  "step": 200
25
  },
26
  {
27
  "epoch": 0.006,
28
- "grad_norm": 4.71875,
29
- "learning_rate": 9.999779565902032e-05,
30
- "loss": 53.08,
31
  "step": 300
32
  },
33
  {
34
  "epoch": 0.008,
35
- "grad_norm": 5.0,
36
- "learning_rate": 9.999384399149714e-05,
37
- "loss": 51.56,
38
  "step": 400
39
  },
40
  {
41
  "epoch": 0.01,
42
- "grad_norm": 4.5,
43
- "learning_rate": 9.998790675712448e-05,
44
- "loss": 50.32,
45
  "step": 500
46
  },
47
  {
48
  "epoch": 0.012,
49
- "grad_norm": 5.5,
50
- "learning_rate": 9.99799841917069e-05,
51
- "loss": 48.76,
52
  "step": 600
53
  },
54
  {
55
  "epoch": 0.014,
56
- "grad_norm": 6.65625,
57
- "learning_rate": 9.997007660989881e-05,
58
- "loss": 47.36,
59
  "step": 700
60
  },
61
  {
62
  "epoch": 0.016,
63
- "grad_norm": 10.8125,
64
- "learning_rate": 9.995818440519196e-05,
65
- "loss": 47.32,
66
  "step": 800
67
  },
68
  {
69
  "epoch": 0.018,
70
- "grad_norm": 11.9375,
71
- "learning_rate": 9.994430804989984e-05,
72
- "loss": 46.28,
73
  "step": 900
74
  },
75
  {
76
  "epoch": 0.02,
77
- "grad_norm": 17.625,
78
- "learning_rate": 9.992844809513897e-05,
79
- "loss": 46.84,
80
  "step": 1000
81
  },
82
  {
83
  "epoch": 0.02,
84
- "eval_loss": 46.71875,
85
- "eval_runtime": 9.8626,
86
- "eval_samples_per_second": 0.406,
87
- "eval_steps_per_second": 0.101,
88
  "step": 1000
89
  },
90
  {
91
  "epoch": 0.022,
92
- "grad_norm": 406.0,
93
- "learning_rate": 9.991060517080687e-05,
94
- "loss": 47.04,
95
  "step": 1100
96
  },
97
  {
98
  "epoch": 0.024,
99
- "grad_norm": 278.0,
100
- "learning_rate": 9.989077998555717e-05,
101
- "loss": 47.24,
102
  "step": 1200
103
  },
104
  {
105
  "epoch": 0.026,
106
- "grad_norm": 300.0,
107
- "learning_rate": 9.986897332677145e-05,
108
- "loss": 47.44,
109
  "step": 1300
110
  },
111
  {
112
  "epoch": 0.028,
113
- "grad_norm": 132.0,
114
- "learning_rate": 9.984518606052792e-05,
115
- "loss": 46.84,
116
  "step": 1400
117
  },
118
  {
119
  "epoch": 0.03,
120
- "grad_norm": 336.0,
121
- "learning_rate": 9.9819419131567e-05,
122
- "loss": 47.36,
123
  "step": 1500
124
  },
125
  {
126
  "epoch": 0.032,
127
- "grad_norm": 161.0,
128
- "learning_rate": 9.979167356325394e-05,
129
- "loss": 48.16,
130
  "step": 1600
131
  },
132
  {
133
  "epoch": 0.034,
134
- "grad_norm": 400.0,
135
- "learning_rate": 9.976195045753797e-05,
136
- "loss": 48.08,
137
  "step": 1700
138
  },
139
  {
140
  "epoch": 0.036,
141
- "grad_norm": 372.0,
142
- "learning_rate": 9.973025099490876e-05,
143
- "loss": 48.12,
144
  "step": 1800
145
  },
146
  {
147
  "epoch": 0.038,
148
- "grad_norm": 209.0,
149
- "learning_rate": 9.969657643434932e-05,
150
- "loss": 48.92,
151
  "step": 1900
152
  },
153
  {
154
  "epoch": 0.04,
155
- "grad_norm": 1192.0,
156
- "learning_rate": 9.966092811328614e-05,
157
- "loss": 47.6,
158
  "step": 2000
159
  },
160
  {
161
  "epoch": 0.04,
162
- "eval_loss": 47.21875,
163
- "eval_runtime": 0.2475,
164
- "eval_samples_per_second": 16.161,
165
- "eval_steps_per_second": 4.04,
166
  "step": 2000
167
  }
168
  ],
 
11
  "log_history": [
12
  {
13
  "epoch": 0.002,
14
+ "grad_norm": 4.729869365692139,
15
+ "learning_rate": 0.00033,
16
+ "loss": 64.03521484375,
17
  "step": 100
18
  },
19
  {
20
  "epoch": 0.004,
21
+ "grad_norm": 7.427474021911621,
22
+ "learning_rate": 0.0004999988080137436,
23
+ "loss": 50.4660400390625,
24
  "step": 200
25
  },
26
  {
27
  "epoch": 0.006,
28
+ "grad_norm": 499.43450927734375,
29
+ "learning_rate": 0.0004999889782951015,
30
+ "loss": 55.620224609375,
31
  "step": 300
32
  },
33
  {
34
  "epoch": 0.008,
35
+ "grad_norm": 5.543099880218506,
36
+ "learning_rate": 0.0004999692199574857,
37
+ "loss": 55.512568359375,
38
  "step": 400
39
  },
40
  {
41
  "epoch": 0.01,
42
+ "grad_norm": 3.913767099380493,
43
+ "learning_rate": 0.0004999395337856224,
44
+ "loss": 54.5164111328125,
45
  "step": 500
46
  },
47
  {
48
  "epoch": 0.012,
49
+ "grad_norm": 3.7103848457336426,
50
+ "learning_rate": 0.0004998999209585345,
51
+ "loss": 48.3706103515625,
52
  "step": 600
53
  },
54
  {
55
  "epoch": 0.014,
56
+ "grad_norm": 27.09828758239746,
57
+ "learning_rate": 0.0004998503830494941,
58
+ "loss": 48.7948681640625,
59
  "step": 700
60
  },
61
  {
62
  "epoch": 0.016,
63
+ "grad_norm": 357.75579833984375,
64
+ "learning_rate": 0.0004997909220259598,
65
+ "loss": 47.264482421875,
66
  "step": 800
67
  },
68
  {
69
  "epoch": 0.018,
70
+ "grad_norm": 21.32952117919922,
71
+ "learning_rate": 0.0004997215402494993,
72
+ "loss": 46.945810546875,
73
  "step": 900
74
  },
75
  {
76
  "epoch": 0.02,
77
+ "grad_norm": 1339.14501953125,
78
+ "learning_rate": 0.0004996422404756948,
79
+ "loss": 50.6924609375,
80
  "step": 1000
81
  },
82
  {
83
  "epoch": 0.02,
84
+ "eval_loss": 62.66343307495117,
85
+ "eval_runtime": 11.6524,
86
+ "eval_samples_per_second": 1.716,
87
+ "eval_steps_per_second": 0.086,
88
  "step": 1000
89
  },
90
  {
91
  "epoch": 0.022,
92
+ "grad_norm": 29.14947509765625,
93
+ "learning_rate": 0.0004995530258540343,
94
+ "loss": 49.645908203125,
95
  "step": 1100
96
  },
97
  {
98
  "epoch": 0.024,
99
+ "grad_norm": 199.71112060546875,
100
+ "learning_rate": 0.0004994538999277859,
101
+ "loss": 46.0685693359375,
102
  "step": 1200
103
  },
104
  {
105
  "epoch": 0.026,
106
+ "grad_norm": 26.30093002319336,
107
+ "learning_rate": 0.0004993448666338572,
108
+ "loss": 45.418486328125,
109
  "step": 1300
110
  },
111
  {
112
  "epoch": 0.028,
113
+ "grad_norm": 72.15017700195312,
114
+ "learning_rate": 0.0004992259303026396,
115
+ "loss": 46.6232666015625,
116
  "step": 1400
117
  },
118
  {
119
  "epoch": 0.03,
120
+ "grad_norm": 16.536649703979492,
121
+ "learning_rate": 0.0004990970956578351,
122
+ "loss": 52.807451171875,
123
  "step": 1500
124
  },
125
  {
126
  "epoch": 0.032,
127
+ "grad_norm": 75235.25,
128
+ "learning_rate": 0.0004989583678162697,
129
+ "loss": 58.359990234375,
130
  "step": 1600
131
  },
132
  {
133
  "epoch": 0.034,
134
+ "grad_norm": 7981.73974609375,
135
+ "learning_rate": 0.0004988097522876898,
136
+ "loss": 58.0731103515625,
137
  "step": 1700
138
  },
139
  {
140
  "epoch": 0.036,
141
+ "grad_norm": 10026.5595703125,
142
+ "learning_rate": 0.0004986512549745438,
143
+ "loss": 59.05083984375,
144
  "step": 1800
145
  },
146
  {
147
  "epoch": 0.038,
148
+ "grad_norm": 534.1368408203125,
149
+ "learning_rate": 0.0004984828821717466,
150
+ "loss": 54.8443310546875,
151
  "step": 1900
152
  },
153
  {
154
  "epoch": 0.04,
155
+ "grad_norm": 423.7434997558594,
156
+ "learning_rate": 0.0004983046405664306,
157
+ "loss": 54.6559326171875,
158
  "step": 2000
159
  },
160
  {
161
  "epoch": 0.04,
162
+ "eval_loss": 55.864173889160156,
163
+ "eval_runtime": 1.8383,
164
+ "eval_samples_per_second": 10.88,
165
+ "eval_steps_per_second": 0.544,
166
  "step": 2000
167
  }
168
  ],
last-checkpoint/training_args.bin CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:018db098c009b077a596bcd57ca4359ea322e874799c144a100d3d03ea3ce145
3
  size 5201
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:744f7f42a0433e89c0af056b3090bcf31492ca1b3769a40409cf21aea20f0c1f
3
  size 5201