CodeIsAbstract commited on
Commit
f116f66
·
verified ·
1 Parent(s): f6e5dbf

Training in progress, step 1000, checkpoint

Browse files
last-checkpoint/model.safetensors CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:b07794a4766223bc04ee621df668181809a9680efb7f3402e9062c1d647bca82
3
  size 847599616
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:b5918f923e94a1c71c1343bdcf10beeef3df1b930ad244fba32fd7f174ba907d
3
  size 847599616
last-checkpoint/optimizer.pt CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:600a58d2b953c32b2ed9d106d83156d177ccdf78fe0147dc9a9c11b343b6fb6a
3
  size 1386414411
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:3efa0ed49bd9be95076d7069e5e9edf45f6b79f66e0033c9a85e8f6d1f88f0b2
3
  size 1386414411
last-checkpoint/rng_state_0.pth CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:9cd45c472c02f69686aade1ec7cee7512c8dba6e6bde5e0bd023fd4f8f2f3548
3
  size 14917
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:536f3bf5d8d9a338dc3c13d4a9497341d1858e9170a623670fdf984c7300d07b
3
  size 14917
last-checkpoint/rng_state_1.pth CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:09714a2ef70dd987c21ebd404103aea88be622e980ab90fe03c4cb22a4d6d0de
3
  size 14917
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:feac55dc4e1aa4e2fb9533ef48c19881a76f1225ae029d1ded10aa6105f9d143
3
  size 14917
last-checkpoint/scheduler.pt CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:1d607aeebc80b296b5bbc4bdd6acb23e9a6ea5c0feecf9462250a533d1c816c4
3
  size 1465
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:a05fb06c8f2309f7e205252b1a3311f0b9687d7493c125c7e1233cf078e7b73e
3
  size 1465
last-checkpoint/trainer_state.json CHANGED
@@ -2,9 +2,9 @@
2
  "best_global_step": null,
3
  "best_metric": null,
4
  "best_model_checkpoint": null,
5
- "epoch": 0.16666666666666666,
6
  "eval_steps": 200,
7
- "global_step": 500,
8
  "is_hyper_param_search": false,
9
  "is_local_process_zero": true,
10
  "is_world_process_zero": true,
@@ -96,6 +96,103 @@
96
  "learning_rate": 9.634541575171929e-05,
97
  "loss": 77.5796,
98
  "step": 500
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
99
  }
100
  ],
101
  "logging_steps": 50,
 
2
  "best_global_step": null,
3
  "best_metric": null,
4
  "best_model_checkpoint": null,
5
+ "epoch": 0.3333333333333333,
6
  "eval_steps": 200,
7
+ "global_step": 1000,
8
  "is_hyper_param_search": false,
9
  "is_local_process_zero": true,
10
  "is_world_process_zero": true,
 
96
  "learning_rate": 9.634541575171929e-05,
97
  "loss": 77.5796,
98
  "step": 500
99
+ },
100
+ {
101
+ "epoch": 0.18333333333333332,
102
+ "grad_norm": 30660.970703125,
103
+ "learning_rate": 9.524135262330098e-05,
104
+ "loss": 77.067,
105
+ "step": 550
106
+ },
107
+ {
108
+ "epoch": 0.2,
109
+ "grad_norm": 55290.8203125,
110
+ "learning_rate": 9.399989299389661e-05,
111
+ "loss": 75.4663,
112
+ "step": 600
113
+ },
114
+ {
115
+ "epoch": 0.2,
116
+ "eval_accuracy": 0.24998188196442597,
117
+ "eval_loss": 4.73757791519165,
118
+ "eval_runtime": 8.0417,
119
+ "eval_samples_per_second": 62.176,
120
+ "eval_steps_per_second": 1.99,
121
+ "step": 600
122
+ },
123
+ {
124
+ "epoch": 0.21666666666666667,
125
+ "grad_norm": 28325.5859375,
126
+ "learning_rate": 9.262480713559808e-05,
127
+ "loss": 76.2754,
128
+ "step": 650
129
+ },
130
+ {
131
+ "epoch": 0.23333333333333334,
132
+ "grad_norm": 354199.03125,
133
+ "learning_rate": 9.112027113896262e-05,
134
+ "loss": 76.0095,
135
+ "step": 700
136
+ },
137
+ {
138
+ "epoch": 0.25,
139
+ "grad_norm": 1301901.625,
140
+ "learning_rate": 8.949085423036296e-05,
141
+ "loss": 76.6464,
142
+ "step": 750
143
+ },
144
+ {
145
+ "epoch": 0.26666666666666666,
146
+ "grad_norm": 118610.0,
147
+ "learning_rate": 8.774150489539707e-05,
148
+ "loss": 78.2808,
149
+ "step": 800
150
+ },
151
+ {
152
+ "epoch": 0.26666666666666666,
153
+ "eval_accuracy": 0.22522578989738337,
154
+ "eval_loss": 5.033573150634766,
155
+ "eval_runtime": 7.5988,
156
+ "eval_samples_per_second": 65.8,
157
+ "eval_steps_per_second": 2.106,
158
+ "step": 800
159
+ },
160
+ {
161
+ "epoch": 0.2833333333333333,
162
+ "grad_norm": 22132.029296875,
163
+ "learning_rate": 8.587753585050004e-05,
164
+ "loss": 79.5805,
165
+ "step": 850
166
+ },
167
+ {
168
+ "epoch": 0.3,
169
+ "grad_norm": 10536.388671875,
170
+ "learning_rate": 8.390460790839882e-05,
171
+ "loss": 77.5871,
172
+ "step": 900
173
+ },
174
+ {
175
+ "epoch": 0.31666666666666665,
176
+ "grad_norm": 15219.642578125,
177
+ "learning_rate": 8.182871278641009e-05,
178
+ "loss": 77.6208,
179
+ "step": 950
180
+ },
181
+ {
182
+ "epoch": 0.3333333333333333,
183
+ "grad_norm": 92554.859375,
184
+ "learning_rate": 7.965615490979163e-05,
185
+ "loss": 78.9266,
186
+ "step": 1000
187
+ },
188
+ {
189
+ "epoch": 0.3333333333333333,
190
+ "eval_accuracy": 0.2367096863914945,
191
+ "eval_loss": 4.885761737823486,
192
+ "eval_runtime": 7.9133,
193
+ "eval_samples_per_second": 63.185,
194
+ "eval_steps_per_second": 2.022,
195
+ "step": 1000
196
  }
197
  ],
198
  "logging_steps": 50,