CodeIsAbstract commited on
Commit
b735b1c
·
verified ·
1 Parent(s): 4771fd0

Training in progress, step 2000, checkpoint

Browse files
last-checkpoint/model.safetensors CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:481549fd92bfa33b3ca3ee59d5bc352b3a2c5f4809eb649581a381291df624cc
3
  size 847599616
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:3e844c140f0b364ef240d9d283f3474471aa887e9a4e7f8afe6ca0d5062fa1d8
3
  size 847599616
last-checkpoint/optimizer.pt CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:c4a7cf0ed2c81fc32c151e4b208e492f66b21183d21c3703bc7d39409f809f7a
3
  size 1386414411
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:d6e57c8be8d618705f188b94fc5169164f579e23fc7d687c76672146f866dfc5
3
  size 1386414411
last-checkpoint/rng_state_0.pth ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:9cd45c472c02f69686aade1ec7cee7512c8dba6e6bde5e0bd023fd4f8f2f3548
3
+ size 14917
last-checkpoint/rng_state_1.pth ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:09714a2ef70dd987c21ebd404103aea88be622e980ab90fe03c4cb22a4d6d0de
3
+ size 14917
last-checkpoint/scheduler.pt CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:0008eaf86467511a3b74b3792388bc89587db0af5fba1e98578d98def9815f59
3
  size 1465
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:c0ed1549b52af39b27c28b24276ca81b4d37dad6af883ad09a3c1268b5bcb1b0
3
  size 1465
last-checkpoint/trainer_state.json CHANGED
@@ -2,210 +2,174 @@
2
  "best_global_step": null,
3
  "best_metric": null,
4
  "best_model_checkpoint": null,
5
- "epoch": 0.01,
6
- "eval_steps": 300,
7
  "global_step": 2000,
8
  "is_hyper_param_search": false,
9
  "is_local_process_zero": true,
10
  "is_world_process_zero": true,
11
  "log_history": [
12
  {
13
- "epoch": 0.0005,
14
- "grad_norm": 6.011565208435059,
15
- "learning_rate": 3.96e-06,
16
- "loss": 20.981669921875,
17
  "step": 100
18
  },
19
  {
20
- "epoch": 0.001,
21
- "grad_norm": 4.79960823059082,
22
- "learning_rate": 7.96e-06,
23
- "loss": 18.630086669921877,
24
  "step": 200
25
  },
26
  {
27
- "epoch": 0.0015,
28
- "grad_norm": 4.753690242767334,
29
- "learning_rate": 1.196e-05,
30
- "loss": 17.497738037109375,
31
  "step": 300
32
  },
33
  {
34
- "epoch": 0.0015,
35
- "eval_accuracy": 0.08108023483365949,
36
- "eval_loss": 16.94498062133789,
37
- "eval_runtime": 72.1019,
38
- "eval_samples_per_second": 13.869,
39
- "eval_steps_per_second": 3.467,
40
- "step": 300
41
- },
42
- {
43
- "epoch": 0.002,
44
- "grad_norm": 3.2824501991271973,
45
- "learning_rate": 1.596e-05,
46
- "loss": 16.3246142578125,
47
  "step": 400
48
  },
49
  {
50
- "epoch": 0.0025,
51
- "grad_norm": 4.837945461273193,
52
- "learning_rate": 1.9960000000000002e-05,
53
- "loss": 15.711016845703124,
54
  "step": 500
55
  },
56
  {
57
- "epoch": 0.003,
58
- "grad_norm": 4.028888702392578,
59
- "learning_rate": 2.396e-05,
60
- "loss": 14.91444580078125,
61
  "step": 600
62
  },
63
  {
64
- "epoch": 0.003,
65
- "eval_accuracy": 0.10803913894324853,
66
- "eval_loss": 14.84846305847168,
67
- "eval_runtime": 71.0639,
68
- "eval_samples_per_second": 14.072,
69
- "eval_steps_per_second": 3.518,
70
- "step": 600
71
- },
72
- {
73
- "epoch": 0.0035,
74
- "grad_norm": 2.6233296394348145,
75
- "learning_rate": 2.7960000000000003e-05,
76
- "loss": 14.73691650390625,
77
  "step": 700
78
  },
79
  {
80
- "epoch": 0.004,
81
- "grad_norm": 3.3784563541412354,
82
- "learning_rate": 3.196e-05,
83
- "loss": 14.402127685546875,
84
  "step": 800
85
  },
86
  {
87
- "epoch": 0.0045,
88
- "grad_norm": 4.078140735626221,
89
- "learning_rate": 3.596e-05,
90
- "loss": 14.276339111328125,
91
  "step": 900
92
  },
93
  {
94
- "epoch": 0.0045,
95
- "eval_accuracy": 0.12540117416829746,
96
- "eval_loss": 14.246834754943848,
97
- "eval_runtime": 70.5499,
98
- "eval_samples_per_second": 14.174,
99
- "eval_steps_per_second": 3.544,
100
- "step": 900
101
  },
102
  {
103
- "epoch": 0.005,
104
- "grad_norm": 2.698321580886841,
105
- "learning_rate": 3.9960000000000004e-05,
106
- "loss": 14.103670654296875,
 
 
107
  "step": 1000
108
  },
109
  {
110
- "epoch": 0.0055,
111
- "grad_norm": 2.6977009773254395,
112
- "learning_rate": 4.396e-05,
113
- "loss": 13.91288330078125,
114
  "step": 1100
115
  },
116
  {
117
- "epoch": 0.006,
118
- "grad_norm": 2.813852071762085,
119
- "learning_rate": 4.796e-05,
120
- "loss": 13.750213623046875,
121
- "step": 1200
122
- },
123
- {
124
- "epoch": 0.006,
125
- "eval_accuracy": 0.13354794520547944,
126
- "eval_loss": 13.796219825744629,
127
- "eval_runtime": 70.4436,
128
- "eval_samples_per_second": 14.196,
129
- "eval_steps_per_second": 3.549,
130
  "step": 1200
131
  },
132
  {
133
- "epoch": 0.0065,
134
- "grad_norm": 2.7015318870544434,
135
- "learning_rate": 5.196e-05,
136
- "loss": 13.593814697265625,
137
  "step": 1300
138
  },
139
  {
140
- "epoch": 0.007,
141
- "grad_norm": 2.6103267669677734,
142
- "learning_rate": 5.596e-05,
143
- "loss": 13.418026123046875,
144
  "step": 1400
145
  },
146
  {
147
- "epoch": 0.0075,
148
- "grad_norm": 2.5891685485839844,
149
- "learning_rate": 5.996e-05,
150
- "loss": 13.413653564453124,
151
- "step": 1500
152
- },
153
- {
154
- "epoch": 0.0075,
155
- "eval_accuracy": 0.14203326810176126,
156
- "eval_loss": 13.424027442932129,
157
- "eval_runtime": 70.7197,
158
- "eval_samples_per_second": 14.14,
159
- "eval_steps_per_second": 3.535,
160
  "step": 1500
161
  },
162
  {
163
- "epoch": 0.008,
164
- "grad_norm": 2.7721621990203857,
165
- "learning_rate": 6.396e-05,
166
- "loss": 13.18080810546875,
167
  "step": 1600
168
  },
169
  {
170
- "epoch": 0.0085,
171
- "grad_norm": 4.532048225402832,
172
- "learning_rate": 6.796e-05,
173
- "loss": 13.176103515625,
174
  "step": 1700
175
  },
176
  {
177
- "epoch": 0.009,
178
- "grad_norm": 2.760545015335083,
179
- "learning_rate": 7.196000000000001e-05,
180
- "loss": 13.289417724609375,
181
  "step": 1800
182
  },
183
  {
184
- "epoch": 0.009,
185
- "eval_accuracy": 0.1470078277886497,
186
- "eval_loss": 13.157907485961914,
187
- "eval_runtime": 70.4071,
188
- "eval_samples_per_second": 14.203,
189
- "eval_steps_per_second": 3.551,
190
- "step": 1800
191
  },
192
  {
193
- "epoch": 0.0095,
194
- "grad_norm": 2.832441806793213,
195
- "learning_rate": 7.596000000000001e-05,
196
- "loss": 12.94510009765625,
197
- "step": 1900
198
  },
199
  {
200
- "epoch": 0.01,
201
- "grad_norm": 2.487884759902954,
202
- "learning_rate": 7.996e-05,
203
- "loss": 12.798345947265625,
 
 
204
  "step": 2000
205
  }
206
  ],
207
  "logging_steps": 100,
208
- "max_steps": 200000,
209
  "num_input_tokens_seen": 0,
210
  "num_train_epochs": 9223372036854775807,
211
  "save_steps": 2000,
@@ -222,7 +186,7 @@
222
  }
223
  },
224
  "total_flos": 0.0,
225
- "train_batch_size": 4,
226
  "trial_name": null,
227
  "trial_params": null
228
  }
 
2
  "best_global_step": null,
3
  "best_metric": null,
4
  "best_model_checkpoint": null,
5
+ "epoch": 0.13333333333333333,
6
+ "eval_steps": 1000,
7
  "global_step": 2000,
8
  "is_hyper_param_search": false,
9
  "is_local_process_zero": true,
10
  "is_world_process_zero": true,
11
  "log_history": [
12
  {
13
+ "epoch": 0.006666666666666667,
14
+ "grad_norm": 2.854929208755493,
15
+ "learning_rate": 5.28e-05,
16
+ "loss": 18.5724072265625,
17
  "step": 100
18
  },
19
  {
20
+ "epoch": 0.013333333333333334,
21
+ "grad_norm": 1.6583245992660522,
22
+ "learning_rate": 0.00010613333333333333,
23
+ "loss": 14.702509765625,
24
  "step": 200
25
  },
26
  {
27
+ "epoch": 0.02,
28
+ "grad_norm": 1.6954909563064575,
29
+ "learning_rate": 0.00015946666666666668,
30
+ "loss": 13.69074951171875,
31
  "step": 300
32
  },
33
  {
34
+ "epoch": 0.02666666666666667,
35
+ "grad_norm": 1.783247470855713,
36
+ "learning_rate": 0.00021280000000000002,
37
+ "loss": 13.1521044921875,
 
 
 
 
 
 
 
 
 
38
  "step": 400
39
  },
40
  {
41
+ "epoch": 0.03333333333333333,
42
+ "grad_norm": 1.4421945810317993,
43
+ "learning_rate": 0.00026613333333333337,
44
+ "loss": 12.824429931640625,
45
  "step": 500
46
  },
47
  {
48
+ "epoch": 0.04,
49
+ "grad_norm": 1.5354344844818115,
50
+ "learning_rate": 0.00031946666666666666,
51
+ "loss": 12.49961181640625,
52
  "step": 600
53
  },
54
  {
55
+ "epoch": 0.04666666666666667,
56
+ "grad_norm": 1.3272199630737305,
57
+ "learning_rate": 0.00037280000000000006,
58
+ "loss": 12.145262451171876,
 
 
 
 
 
 
 
 
 
59
  "step": 700
60
  },
61
  {
62
+ "epoch": 0.05333333333333334,
63
+ "grad_norm": 1.706987977027893,
64
+ "learning_rate": 0.0003999883303467061,
65
+ "loss": 11.98048095703125,
66
  "step": 800
67
  },
68
  {
69
+ "epoch": 0.06,
70
+ "grad_norm": 1.2479976415634155,
71
+ "learning_rate": 0.00039989210445800615,
72
+ "loss": 11.621953125,
73
  "step": 900
74
  },
75
  {
76
+ "epoch": 0.06666666666666667,
77
+ "grad_norm": 1.2310028076171875,
78
+ "learning_rate": 0.00039969872739228826,
79
+ "loss": 11.573458251953125,
80
+ "step": 1000
 
 
81
  },
82
  {
83
+ "epoch": 0.06666666666666667,
84
+ "eval_accuracy": 0.18273972602739727,
85
+ "eval_loss": 11.462567329406738,
86
+ "eval_runtime": 65.4243,
87
+ "eval_samples_per_second": 7.642,
88
+ "eval_steps_per_second": 0.382,
89
  "step": 1000
90
  },
91
  {
92
+ "epoch": 0.07333333333333333,
93
+ "grad_norm": 1.2715719938278198,
94
+ "learning_rate": 0.00039940829313430293,
95
+ "loss": 11.32210205078125,
96
  "step": 1100
97
  },
98
  {
99
+ "epoch": 0.08,
100
+ "grad_norm": 1.7137954235076904,
101
+ "learning_rate": 0.00039902094284035075,
102
+ "loss": 11.18190185546875,
 
 
 
 
 
 
 
 
 
103
  "step": 1200
104
  },
105
  {
106
+ "epoch": 0.08666666666666667,
107
+ "grad_norm": 1.48090660572052,
108
+ "learning_rate": 0.0003985368647696784,
109
+ "loss": 11.0220166015625,
110
  "step": 1300
111
  },
112
  {
113
+ "epoch": 0.09333333333333334,
114
+ "grad_norm": 1.1374964714050293,
115
+ "learning_rate": 0.0003979562941929808,
116
+ "loss": 10.822305908203125,
117
  "step": 1400
118
  },
119
  {
120
+ "epoch": 0.1,
121
+ "grad_norm": 1.3714447021484375,
122
+ "learning_rate": 0.0003972795132780554,
123
+ "loss": 10.762421875,
 
 
 
 
 
 
 
 
 
124
  "step": 1500
125
  },
126
  {
127
+ "epoch": 0.10666666666666667,
128
+ "grad_norm": 1.1782511472702026,
129
+ "learning_rate": 0.00039650685095266405,
130
+ "loss": 10.602275390625,
131
  "step": 1600
132
  },
133
  {
134
+ "epoch": 0.11333333333333333,
135
+ "grad_norm": 1.0709394216537476,
136
+ "learning_rate": 0.0003956386827446671,
137
+ "loss": 10.4713134765625,
138
  "step": 1700
139
  },
140
  {
141
+ "epoch": 0.12,
142
+ "grad_norm": 1.1138310432434082,
143
+ "learning_rate": 0.00039467543059951106,
144
+ "loss": 10.50548095703125,
145
  "step": 1800
146
  },
147
  {
148
+ "epoch": 0.12666666666666668,
149
+ "grad_norm": 1.283762812614441,
150
+ "learning_rate": 0.0003936175626751552,
151
+ "loss": 10.4138134765625,
152
+ "step": 1900
 
 
153
  },
154
  {
155
+ "epoch": 0.13333333333333333,
156
+ "grad_norm": 1.3275446891784668,
157
+ "learning_rate": 0.00039246559311453794,
158
+ "loss": 10.335478515625,
159
+ "step": 2000
160
  },
161
  {
162
+ "epoch": 0.13333333333333333,
163
+ "eval_accuracy": 0.21337964774951076,
164
+ "eval_loss": 10.411324501037598,
165
+ "eval_runtime": 65.3972,
166
+ "eval_samples_per_second": 7.646,
167
+ "eval_steps_per_second": 0.382,
168
  "step": 2000
169
  }
170
  ],
171
  "logging_steps": 100,
172
+ "max_steps": 15000,
173
  "num_input_tokens_seen": 0,
174
  "num_train_epochs": 9223372036854775807,
175
  "save_steps": 2000,
 
186
  }
187
  },
188
  "total_flos": 0.0,
189
+ "train_batch_size": 10,
190
  "trial_name": null,
191
  "trial_params": null
192
  }
last-checkpoint/training_args.bin CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:d28e2b5843184725d1b8a4fbebe4630c5d5705edaadbc1cb4642d87884e1e3e9
3
  size 5265
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:f471a8fab1d3fe9130aacb1db6fd8b7b3e66edecb9210651c26dd497a9c1abea
3
  size 5265