File size: 8,447 Bytes
f11bfdd
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
2
3
4
5
6
7
8
9
10
11
12
13
14
15
16
17
18
19
20
21
22
23
24
25
26
27
28
29
30
31
32
33
34
35
36
37
38
39
40
41
42
43
44
45
46
47
48
49
50
51
52
53
54
55
56
57
58
59
60
61
62
63
64
65
66
67
68
69
70
71
72
73
74
75
76
77
78
79
80
81
82
83
84
85
86
87
88
89
90
91
92
93
94
95
96
97
98
99
100
101
102
103
104
105
106
107
108
109
110
111
112
113
114
115
116
117
118
119
120
121
122
123
124
125
126
127
128
129
130
131
132
133
134
135
136
137
138
139
140
141
142
143
144
145
146
147
148
149
150
151
152
153
154
155
156
157
158
159
160
161
162
163
164
165
166
167
168
169
170
171
172
173
174
175
176
177
178
179
180
181
182
183
184
185
186
187
188
189
190
191
192
193
194
195
196
197
198
199
200
201
202
203
204
205
206
207
208
209
210
211
212
213
214
215
216
217
218
219
220
221
222
223
224
225
226
227
228
229
230
231
232
233
234
235
236
237
238
239
240
241
242
243
244
245
246
247
248
249
250
251
252
253
254
255
256
257
258
259
260
261
262
263
264
265
266
267
268
269
270
271
272
273
274
275
276
277
278
279
280
281
282
283
284
285
286
287
288
289
290
291
292
293
294
295
296
297
298
299
300
301
302
303
304
305
306
307
308
309
310
311
312
313
314
315
316
317
318
319
320
321
322
323
324
325
326
327
328
329
330
331
332
{
  "best_global_step": 3000,
  "best_metric": 0.029462991282343864,
  "best_model_checkpoint": "bart-finetune/checkpoint-3000",
  "epoch": 2.602169197396963,
  "eval_steps": 500,
  "global_step": 3000,
  "is_hyper_param_search": false,
  "is_local_process_zero": true,
  "is_world_process_zero": true,
  "log_history": [
    {
      "epoch": 0.08676789587852494,
      "grad_norm": 21.48098373413086,
      "learning_rate": 9.900000000000002e-06,
      "loss": 6.7932,
      "step": 100
    },
    {
      "epoch": 0.1735357917570499,
      "grad_norm": 15.391678810119629,
      "learning_rate": 1.9900000000000003e-05,
      "loss": 1.9607,
      "step": 200
    },
    {
      "epoch": 0.2603036876355748,
      "grad_norm": 1.106106162071228,
      "learning_rate": 2.9900000000000002e-05,
      "loss": 0.3208,
      "step": 300
    },
    {
      "epoch": 0.3470715835140998,
      "grad_norm": 0.49806028604507446,
      "learning_rate": 3.99e-05,
      "loss": 0.1053,
      "step": 400
    },
    {
      "epoch": 0.43383947939262474,
      "grad_norm": 0.6099858283996582,
      "learning_rate": 4.99e-05,
      "loss": 0.0796,
      "step": 500
    },
    {
      "epoch": 0.43383947939262474,
      "eval_gen_len": 20.9534,
      "eval_loss": 0.07227330654859543,
      "eval_rouge1": 0.5527,
      "eval_rouge2": 0.48,
      "eval_rougeL": 0.5514,
      "eval_rougeLsum": 0.5512,
      "eval_runtime": 138.4831,
      "eval_samples_per_second": 36.105,
      "eval_steps_per_second": 1.134,
      "step": 500
    },
    {
      "epoch": 0.5206073752711496,
      "grad_norm": 0.6509439945220947,
      "learning_rate": 4.986202819587417e-05,
      "loss": 0.067,
      "step": 600
    },
    {
      "epoch": 0.6073752711496746,
      "grad_norm": 0.500281035900116,
      "learning_rate": 4.9444083154139556e-05,
      "loss": 0.0619,
      "step": 700
    },
    {
      "epoch": 0.6941431670281996,
      "grad_norm": 0.4781886637210846,
      "learning_rate": 4.8750857533072125e-05,
      "loss": 0.0548,
      "step": 800
    },
    {
      "epoch": 0.7809110629067245,
      "grad_norm": 0.7466514706611633,
      "learning_rate": 4.779015819330858e-05,
      "loss": 0.05,
      "step": 900
    },
    {
      "epoch": 0.8676789587852495,
      "grad_norm": 0.35372403264045715,
      "learning_rate": 4.657280418947031e-05,
      "loss": 0.0457,
      "step": 1000
    },
    {
      "epoch": 0.8676789587852495,
      "eval_gen_len": 20.9522,
      "eval_loss": 0.04318917542695999,
      "eval_rouge1": 0.5727,
      "eval_rouge2": 0.507,
      "eval_rougeL": 0.5719,
      "eval_rougeLsum": 0.5717,
      "eval_runtime": 137.86,
      "eval_samples_per_second": 36.269,
      "eval_steps_per_second": 1.139,
      "step": 1000
    },
    {
      "epoch": 0.9544468546637744,
      "grad_norm": 0.3598574697971344,
      "learning_rate": 4.5112504929814395e-05,
      "loss": 0.0428,
      "step": 1100
    },
    {
      "epoch": 1.0407809110629067,
      "grad_norm": 0.5030230283737183,
      "learning_rate": 4.3425705785748786e-05,
      "loss": 0.0391,
      "step": 1200
    },
    {
      "epoch": 1.1275488069414317,
      "grad_norm": 0.29542213678359985,
      "learning_rate": 4.1531402889902754e-05,
      "loss": 0.0354,
      "step": 1300
    },
    {
      "epoch": 1.2143167028199566,
      "grad_norm": 0.28244778513908386,
      "learning_rate": 3.94509292084306e-05,
      "loss": 0.033,
      "step": 1400
    },
    {
      "epoch": 1.3010845986984816,
      "grad_norm": 0.34228453040122986,
      "learning_rate": 3.72077142967266e-05,
      "loss": 0.0328,
      "step": 1500
    },
    {
      "epoch": 1.3010845986984816,
      "eval_gen_len": 20.9518,
      "eval_loss": 0.03781509771943092,
      "eval_rouge1": 0.5696,
      "eval_rouge2": 0.5047,
      "eval_rougeL": 0.5686,
      "eval_rougeLsum": 0.5684,
      "eval_runtime": 137.8154,
      "eval_samples_per_second": 36.28,
      "eval_steps_per_second": 1.139,
      "step": 1500
    },
    {
      "epoch": 1.3878524945770065,
      "grad_norm": 0.24588140845298767,
      "learning_rate": 3.4827020444096845e-05,
      "loss": 0.0319,
      "step": 1600
    },
    {
      "epoch": 1.4746203904555315,
      "grad_norm": 0.349103718996048,
      "learning_rate": 3.233565817883292e-05,
      "loss": 0.0326,
      "step": 1700
    },
    {
      "epoch": 1.5613882863340565,
      "grad_norm": 0.3223339915275574,
      "learning_rate": 2.9761684337568257e-05,
      "loss": 0.0292,
      "step": 1800
    },
    {
      "epoch": 1.6481561822125812,
      "grad_norm": 0.30051344633102417,
      "learning_rate": 2.7134086099152762e-05,
      "loss": 0.0283,
      "step": 1900
    },
    {
      "epoch": 1.7349240780911064,
      "grad_norm": 0.2447238564491272,
      "learning_rate": 2.4482454541343916e-05,
      "loss": 0.0285,
      "step": 2000
    },
    {
      "epoch": 1.7349240780911064,
      "eval_gen_len": 20.9532,
      "eval_loss": 0.03255747631192207,
      "eval_rouge1": 0.5758,
      "eval_rouge2": 0.5137,
      "eval_rougeL": 0.5751,
      "eval_rougeLsum": 0.5749,
      "eval_runtime": 138.1212,
      "eval_samples_per_second": 36.2,
      "eval_steps_per_second": 1.137,
      "step": 2000
    },
    {
      "epoch": 1.8216919739696311,
      "grad_norm": 0.457000732421875,
      "learning_rate": 2.1836651396603035e-05,
      "loss": 0.0263,
      "step": 2100
    },
    {
      "epoch": 1.9084598698481563,
      "grad_norm": 0.2774176001548767,
      "learning_rate": 1.922647275987431e-05,
      "loss": 0.0266,
      "step": 2200
    },
    {
      "epoch": 1.995227765726681,
      "grad_norm": 0.4951108694076538,
      "learning_rate": 1.668131353555037e-05,
      "loss": 0.0257,
      "step": 2300
    },
    {
      "epoch": 2.0815618221258134,
      "grad_norm": 0.20267550647258759,
      "learning_rate": 1.4229836402503139e-05,
      "loss": 0.0222,
      "step": 2400
    },
    {
      "epoch": 2.1683297180043386,
      "grad_norm": 0.24006444215774536,
      "learning_rate": 1.1899649025178486e-05,
      "loss": 0.0219,
      "step": 2500
    },
    {
      "epoch": 2.1683297180043386,
      "eval_gen_len": 20.9518,
      "eval_loss": 0.030334332957863808,
      "eval_rouge1": 0.5764,
      "eval_rouge2": 0.5152,
      "eval_rougeL": 0.5755,
      "eval_rougeLsum": 0.5754,
      "eval_runtime": 137.9642,
      "eval_samples_per_second": 36.241,
      "eval_steps_per_second": 1.138,
      "step": 2500
    },
    {
      "epoch": 2.2550976138828633,
      "grad_norm": 0.39135313034057617,
      "learning_rate": 9.716993145888406e-06,
      "loss": 0.0198,
      "step": 2600
    },
    {
      "epoch": 2.341865509761388,
      "grad_norm": 0.23596180975437164,
      "learning_rate": 7.706449059632987e-06,
      "loss": 0.0209,
      "step": 2700
    },
    {
      "epoch": 2.4286334056399133,
      "grad_norm": 0.21738794445991516,
      "learning_rate": 5.890658799551618e-06,
      "loss": 0.0223,
      "step": 2800
    },
    {
      "epoch": 2.5154013015184384,
      "grad_norm": 0.2256348580121994,
      "learning_rate": 4.29007115039071e-06,
      "loss": 0.0199,
      "step": 2900
    },
    {
      "epoch": 2.602169197396963,
      "grad_norm": 0.2328837364912033,
      "learning_rate": 2.9227113615554275e-06,
      "loss": 0.0218,
      "step": 3000
    },
    {
      "epoch": 2.602169197396963,
      "eval_gen_len": 20.9522,
      "eval_loss": 0.029462991282343864,
      "eval_rouge1": 0.5768,
      "eval_rouge2": 0.5152,
      "eval_rougeL": 0.5757,
      "eval_rougeLsum": 0.5757,
      "eval_runtime": 138.2266,
      "eval_samples_per_second": 36.172,
      "eval_steps_per_second": 1.136,
      "step": 3000
    }
  ],
  "logging_steps": 100,
  "max_steps": 3459,
  "num_input_tokens_seen": 0,
  "num_train_epochs": 3,
  "save_steps": 500,
  "stateful_callbacks": {
    "EarlyStoppingCallback": {
      "args": {
        "early_stopping_patience": 3,
        "early_stopping_threshold": 0.0
      },
      "attributes": {
        "early_stopping_patience_counter": 0
      }
    },
    "TrainerControl": {
      "args": {
        "should_epoch_stop": false,
        "should_evaluate": false,
        "should_log": false,
        "should_save": true,
        "should_training_stop": false
      },
      "attributes": {}
    }
  },
  "total_flos": 6170237616291840.0,
  "train_batch_size": 32,
  "trial_name": null,
  "trial_params": null
}