matverest commited on
Commit
3ee3b92
·
verified ·
1 Parent(s): 7d11730

Upload 15 files

Browse files

MCQA epfl -Arc dataset

Files changed (6) hide show
  1. model.safetensors +1 -1
  2. rng_state.pth +3 -0
  3. scaler.pt +3 -0
  4. scheduler.pt +3 -0
  5. trainer_state.json +281 -0
  6. training_args.bin +2 -2
model.safetensors CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:b90f14f60a63c9651b7cb101fef180f066025ca228bba444acc8478264f14dd4
3
  size 2383145432
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:eed5160f51e829cf1378f639d982e4a6c1eb2adc3f4e1bc2b41b3a6c2ffa5352
3
  size 2383145432
rng_state.pth ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:470b36955468369ff24a31f177aac32d2d3f3dbbf0bae909b882d4b5a86b9cbe
3
+ size 14244
scaler.pt ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:79f86771e7e266279e59ca59b5466e514a509aded5e6a1886ec8e7d2af927a1c
3
+ size 988
scheduler.pt ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:a80934479302fee17d61a1eb41ca1b0435f1ae145e19a47b03f7724815fec23f
3
+ size 1064
trainer_state.json ADDED
@@ -0,0 +1,281 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "best_global_step": null,
3
+ "best_metric": null,
4
+ "best_model_checkpoint": null,
5
+ "epoch": 0.8298755186721992,
6
+ "eval_steps": 25,
7
+ "global_step": 400,
8
+ "is_hyper_param_search": false,
9
+ "is_local_process_zero": true,
10
+ "is_world_process_zero": true,
11
+ "log_history": [
12
+ {
13
+ "epoch": 0.002074688796680498,
14
+ "grad_norm": NaN,
15
+ "learning_rate": 0.0,
16
+ "loss": 0.9284,
17
+ "step": 1
18
+ },
19
+ {
20
+ "epoch": 0.05186721991701245,
21
+ "grad_norm": 79.10929107666016,
22
+ "learning_rate": 1.4201183431952663e-07,
23
+ "loss": 1.2205,
24
+ "step": 25
25
+ },
26
+ {
27
+ "epoch": 0.05186721991701245,
28
+ "eval_loss": 0.898228645324707,
29
+ "eval_runtime": 41.4826,
30
+ "eval_samples_per_second": 21.841,
31
+ "eval_steps_per_second": 5.472,
32
+ "step": 25
33
+ },
34
+ {
35
+ "epoch": 0.1037344398340249,
36
+ "grad_norm": 64.46797180175781,
37
+ "learning_rate": 2.8994082840236686e-07,
38
+ "loss": 0.8806,
39
+ "step": 50
40
+ },
41
+ {
42
+ "epoch": 0.1037344398340249,
43
+ "eval_loss": 0.783169686794281,
44
+ "eval_runtime": 41.8537,
45
+ "eval_samples_per_second": 21.647,
46
+ "eval_steps_per_second": 5.424,
47
+ "step": 50
48
+ },
49
+ {
50
+ "epoch": 0.15560165975103735,
51
+ "grad_norm": 61.91770553588867,
52
+ "learning_rate": 4.378698224852071e-07,
53
+ "loss": 0.8311,
54
+ "step": 75
55
+ },
56
+ {
57
+ "epoch": 0.15560165975103735,
58
+ "eval_loss": 0.7539569139480591,
59
+ "eval_runtime": 41.7737,
60
+ "eval_samples_per_second": 21.688,
61
+ "eval_steps_per_second": 5.434,
62
+ "step": 75
63
+ },
64
+ {
65
+ "epoch": 0.2074688796680498,
66
+ "grad_norm": 71.48536682128906,
67
+ "learning_rate": 5.857988165680473e-07,
68
+ "loss": 0.7368,
69
+ "step": 100
70
+ },
71
+ {
72
+ "epoch": 0.2074688796680498,
73
+ "eval_loss": 0.7413491606712341,
74
+ "eval_runtime": 41.7951,
75
+ "eval_samples_per_second": 21.677,
76
+ "eval_steps_per_second": 5.431,
77
+ "step": 100
78
+ },
79
+ {
80
+ "epoch": 0.25933609958506226,
81
+ "grad_norm": 109.77881622314453,
82
+ "learning_rate": 7.337278106508875e-07,
83
+ "loss": 0.6719,
84
+ "step": 125
85
+ },
86
+ {
87
+ "epoch": 0.25933609958506226,
88
+ "eval_loss": 0.7641308307647705,
89
+ "eval_runtime": 41.7732,
90
+ "eval_samples_per_second": 21.689,
91
+ "eval_steps_per_second": 5.434,
92
+ "step": 125
93
+ },
94
+ {
95
+ "epoch": 0.3112033195020747,
96
+ "grad_norm": 70.72398376464844,
97
+ "learning_rate": 8.816568047337278e-07,
98
+ "loss": 0.6884,
99
+ "step": 150
100
+ },
101
+ {
102
+ "epoch": 0.3112033195020747,
103
+ "eval_loss": 0.7019675970077515,
104
+ "eval_runtime": 41.805,
105
+ "eval_samples_per_second": 21.672,
106
+ "eval_steps_per_second": 5.43,
107
+ "step": 150
108
+ },
109
+ {
110
+ "epoch": 0.3630705394190871,
111
+ "grad_norm": 116.62774658203125,
112
+ "learning_rate": 9.999024041442455e-07,
113
+ "loss": 0.7906,
114
+ "step": 175
115
+ },
116
+ {
117
+ "epoch": 0.3630705394190871,
118
+ "eval_loss": 0.6973831057548523,
119
+ "eval_runtime": 41.8286,
120
+ "eval_samples_per_second": 21.66,
121
+ "eval_steps_per_second": 5.427,
122
+ "step": 175
123
+ },
124
+ {
125
+ "epoch": 0.4149377593360996,
126
+ "grad_norm": 96.68453216552734,
127
+ "learning_rate": 9.964905480067584e-07,
128
+ "loss": 0.6676,
129
+ "step": 200
130
+ },
131
+ {
132
+ "epoch": 0.4149377593360996,
133
+ "eval_loss": 0.7133656144142151,
134
+ "eval_runtime": 41.8429,
135
+ "eval_samples_per_second": 21.652,
136
+ "eval_steps_per_second": 5.425,
137
+ "step": 200
138
+ },
139
+ {
140
+ "epoch": 0.46680497925311204,
141
+ "grad_norm": 55.1112174987793,
142
+ "learning_rate": 9.882369320834068e-07,
143
+ "loss": 0.8055,
144
+ "step": 225
145
+ },
146
+ {
147
+ "epoch": 0.46680497925311204,
148
+ "eval_loss": 0.6769455075263977,
149
+ "eval_runtime": 41.8352,
150
+ "eval_samples_per_second": 21.656,
151
+ "eval_steps_per_second": 5.426,
152
+ "step": 225
153
+ },
154
+ {
155
+ "epoch": 0.5186721991701245,
156
+ "grad_norm": 90.48117065429688,
157
+ "learning_rate": 9.752220453700554e-07,
158
+ "loss": 0.7137,
159
+ "step": 250
160
+ },
161
+ {
162
+ "epoch": 0.5186721991701245,
163
+ "eval_loss": 0.6899203658103943,
164
+ "eval_runtime": 41.8154,
165
+ "eval_samples_per_second": 21.667,
166
+ "eval_steps_per_second": 5.429,
167
+ "step": 250
168
+ },
169
+ {
170
+ "epoch": 0.5705394190871369,
171
+ "grad_norm": 75.77264404296875,
172
+ "learning_rate": 9.575728086215091e-07,
173
+ "loss": 0.7415,
174
+ "step": 275
175
+ },
176
+ {
177
+ "epoch": 0.5705394190871369,
178
+ "eval_loss": 0.663297712802887,
179
+ "eval_runtime": 41.7881,
180
+ "eval_samples_per_second": 21.681,
181
+ "eval_steps_per_second": 5.432,
182
+ "step": 275
183
+ },
184
+ {
185
+ "epoch": 0.6224066390041494,
186
+ "grad_norm": 175.5083465576172,
187
+ "learning_rate": 9.354613366244106e-07,
188
+ "loss": 0.6871,
189
+ "step": 300
190
+ },
191
+ {
192
+ "epoch": 0.6224066390041494,
193
+ "eval_loss": 0.6589707136154175,
194
+ "eval_runtime": 41.8294,
195
+ "eval_samples_per_second": 21.659,
196
+ "eval_steps_per_second": 5.427,
197
+ "step": 300
198
+ },
199
+ {
200
+ "epoch": 0.6742738589211619,
201
+ "grad_norm": 80.65347290039062,
202
+ "learning_rate": 9.091032597394012e-07,
203
+ "loss": 0.6895,
204
+ "step": 325
205
+ },
206
+ {
207
+ "epoch": 0.6742738589211619,
208
+ "eval_loss": 0.6799529194831848,
209
+ "eval_runtime": 41.8081,
210
+ "eval_samples_per_second": 21.67,
211
+ "eval_steps_per_second": 5.43,
212
+ "step": 325
213
+ },
214
+ {
215
+ "epoch": 0.7261410788381742,
216
+ "grad_norm": 67.32386779785156,
217
+ "learning_rate": 8.7875562108081e-07,
218
+ "loss": 0.721,
219
+ "step": 350
220
+ },
221
+ {
222
+ "epoch": 0.7261410788381742,
223
+ "eval_loss": 0.6336647272109985,
224
+ "eval_runtime": 41.7777,
225
+ "eval_samples_per_second": 21.686,
226
+ "eval_steps_per_second": 5.434,
227
+ "step": 350
228
+ },
229
+ {
230
+ "epoch": 0.7780082987551867,
231
+ "grad_norm": 123.56040954589844,
232
+ "learning_rate": 8.447143698405059e-07,
233
+ "loss": 0.6144,
234
+ "step": 375
235
+ },
236
+ {
237
+ "epoch": 0.7780082987551867,
238
+ "eval_loss": 0.6625879406929016,
239
+ "eval_runtime": 41.749,
240
+ "eval_samples_per_second": 21.701,
241
+ "eval_steps_per_second": 5.437,
242
+ "step": 375
243
+ },
244
+ {
245
+ "epoch": 0.8298755186721992,
246
+ "grad_norm": 86.80571746826172,
247
+ "learning_rate": 8.073114752009387e-07,
248
+ "loss": 0.7663,
249
+ "step": 400
250
+ },
251
+ {
252
+ "epoch": 0.8298755186721992,
253
+ "eval_loss": 0.6124003529548645,
254
+ "eval_runtime": 41.7721,
255
+ "eval_samples_per_second": 21.689,
256
+ "eval_steps_per_second": 5.434,
257
+ "step": 400
258
+ }
259
+ ],
260
+ "logging_steps": 25,
261
+ "max_steps": 964,
262
+ "num_input_tokens_seen": 0,
263
+ "num_train_epochs": 2,
264
+ "save_steps": 400,
265
+ "stateful_callbacks": {
266
+ "TrainerControl": {
267
+ "args": {
268
+ "should_epoch_stop": false,
269
+ "should_evaluate": false,
270
+ "should_log": false,
271
+ "should_save": true,
272
+ "should_training_stop": false
273
+ },
274
+ "attributes": {}
275
+ }
276
+ },
277
+ "total_flos": 4329971279462400.0,
278
+ "train_batch_size": 4,
279
+ "trial_name": null,
280
+ "trial_params": null
281
+ }
training_args.bin CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:4b48cec7f2b2f0a3663c934c2748a1d49ce0eb50fcbee09303c5f9bfd417af8e
3
- size 5368
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:0787642dd65dc7346699a0ac756f762dc7c5fcb14d620679ba459f9015c33963
3
+ size 5304