CodeIsAbstract commited on
Commit
3a23c36
·
verified ·
1 Parent(s): 19946dc

Training in progress, step 500, checkpoint

Browse files
last-checkpoint/optimizer.pt CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:4a18eb66379b6698af86fb08013da4c523bb44e653fdb99cabf0ce326b80d22f
3
- size 386379
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:3bade0394fffddee210809f85ef580bee9253cbdc63658c93609636b50849132
3
+ size 2252747
last-checkpoint/pytorch_model.bin CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:b1e3a7767d132b2cee73f8c2a62b5f678a31e9a87e52b1878a4eb94b5ebeb94c
3
- size 1540661735
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:abb28c9de07f152f7162a5afb9fa57feec1bb26c13b04027682db0fc06632987
3
+ size 847648963
last-checkpoint/rng_state_0.pth CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:daae0cc70f9e7824a39e0868e7bbd5f4ee69ddcba63b1d42d1220972622fb262
3
  size 14469
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:76e07cf0345bf512c151f0957ea0731d69830b690d0d47fe9335a01fd87ff0d5
3
  size 14469
last-checkpoint/rng_state_1.pth CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:2b02a3ca08e76a328358ed359724403d0daf90280ad6996ccb99129eabd7933b
3
  size 14469
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:4b1e066d0ede72061c950708a201039b55678b711860b01a8850b06ca136b2f7
3
  size 14469
last-checkpoint/rng_state_2.pth CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:881a4302f7ca452bf068ae4fa72a3351c17d2f02cc3ed78ed4d81d0440b092ef
3
  size 14469
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:c83436d7d707c3d61b15981b0298ffc689a42626328497b706511643f5ceb662
3
  size 14469
last-checkpoint/rng_state_3.pth CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:7bbad872a50b1b043373278688384873e9ce6d4b170a2b9147ea2e7045b6f08f
3
  size 14469
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:dcdd3e13e6b97f6783c4798cd70e6e48a2104ccaacf287e70c62bf0c09ec3f22
3
  size 14469
last-checkpoint/rng_state_4.pth CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:5f5c33f86cd61c95af37958664568bdef66b045a7dd327e2e4a87418eb5c2617
3
  size 14469
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:aa71eeae497ae80be5331ba680216cbc540af220332f0c56f028ebfc2f445e20
3
  size 14469
last-checkpoint/rng_state_5.pth CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:745adc34fef116335c62d35da815ab1e6c8444b933918aed8cd7d137cd7d3e67
3
  size 14469
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:c70b31dc63a3cc8a092a19500455139bf70b0744911cd2bfd2067660e23a2f80
3
  size 14469
last-checkpoint/rng_state_6.pth CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:b9873ce205beb3108aa535f93d98d3355954ff6b888a8d98df447b2c97fc448a
3
  size 14469
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:b86db638d3fa6bb27db28786ecb6ac4913c0fd4a25f7498fd0ae3429244b41eb
3
  size 14469
last-checkpoint/rng_state_7.pth CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:992d5b22958331017a9e6fa5d52716b2c115acc308f2f7b00c82ee11a1c1b070
3
  size 14469
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:840457dd3ad214440eed9722d63d2231facaf5d2730c8917e33dd9d3a6078932
3
  size 14469
last-checkpoint/scheduler.pt CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:94b7b1a014f5dad743694fda5858015bfe3bd4c82eac608d649238b91858a560
3
  size 1465
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:5b79cc0df1e63ecef3adaaf8ef4c455eb58ccb70431c624030057057995b60a8
3
  size 1465
last-checkpoint/trainer_state.json CHANGED
@@ -2,179 +2,144 @@
2
  "best_global_step": null,
3
  "best_metric": null,
4
  "best_model_checkpoint": null,
5
- "epoch": 1.0,
6
- "eval_steps": 100,
7
- "global_step": 1000,
8
  "is_hyper_param_search": false,
9
  "is_local_process_zero": false,
10
  "is_world_process_zero": true,
11
  "log_history": [
 
 
 
 
 
 
 
 
 
12
  {
13
  "epoch": 0.1,
14
- "grad_norm": 12.30762004852295,
15
- "learning_rate": 0.00039207643405906093,
16
- "loss": 216.7740625,
17
  "step": 100
18
  },
19
  {
20
  "epoch": 0.1,
21
- "eval_accuracy": 0.1816001955034213,
22
- "eval_loss": 47.57754135131836,
23
- "eval_runtime": 23.1275,
24
- "eval_samples_per_second": 5.405,
25
- "eval_steps_per_second": 0.173,
26
  "step": 100
27
  },
 
 
 
 
 
 
 
 
 
28
  {
29
  "epoch": 0.2,
30
- "grad_norm": 9.95341968536377,
31
- "learning_rate": 0.0003650943793925548,
32
- "loss": 185.82048828125,
33
  "step": 200
34
  },
35
  {
36
  "epoch": 0.2,
37
- "eval_accuracy": 0.19564027370478984,
38
- "eval_loss": 45.45988082885742,
39
- "eval_runtime": 7.2182,
40
- "eval_samples_per_second": 17.317,
41
- "eval_steps_per_second": 0.554,
42
  "step": 200
43
  },
 
 
 
 
 
 
 
 
 
44
  {
45
  "epoch": 0.3,
46
- "grad_norm": 9.293137550354004,
47
- "learning_rate": 0.0003216263690654036,
48
- "loss": 180.35142578125,
49
  "step": 300
50
  },
51
  {
52
  "epoch": 0.3,
53
- "eval_accuracy": 0.2023049853372434,
54
- "eval_loss": 44.628074645996094,
55
- "eval_runtime": 7.037,
56
- "eval_samples_per_second": 17.763,
57
- "eval_steps_per_second": 0.568,
58
  "step": 300
59
  },
 
 
 
 
 
 
 
 
 
60
  {
61
  "epoch": 0.4,
62
- "grad_norm": 9.892265319824219,
63
- "learning_rate": 0.00026601302141692667,
64
- "loss": 178.04525390625,
65
  "step": 400
66
  },
67
  {
68
  "epoch": 0.4,
69
- "eval_accuracy": 0.20574193548387096,
70
- "eval_loss": 44.19523239135742,
71
- "eval_runtime": 7.0599,
72
- "eval_samples_per_second": 17.706,
73
- "eval_steps_per_second": 0.567,
74
  "step": 400
75
  },
76
  {
77
- "epoch": 0.5,
78
- "grad_norm": 8.574827194213867,
79
- "learning_rate": 0.00020380776102066933,
80
- "loss": 176.7007421875,
81
- "step": 500
 
 
82
  },
83
  {
84
  "epoch": 0.5,
85
- "eval_accuracy": 0.20855425219941348,
86
- "eval_loss": 43.90693283081055,
87
- "eval_runtime": 6.876,
88
- "eval_samples_per_second": 18.179,
89
- "eval_steps_per_second": 0.582,
90
  "step": 500
91
  },
92
  {
93
- "epoch": 0.6,
94
- "grad_norm": 10.545783042907715,
95
- "learning_rate": 0.00014122226612106885,
96
- "loss": 175.240859375,
97
- "step": 600
98
- },
99
- {
100
- "epoch": 0.6,
101
- "eval_accuracy": 0.2102414467253177,
102
- "eval_loss": 43.72456741333008,
103
- "eval_runtime": 6.9048,
104
- "eval_samples_per_second": 18.103,
105
- "eval_steps_per_second": 0.579,
106
- "step": 600
107
- },
108
- {
109
- "epoch": 0.7,
110
- "grad_norm": 10.784721374511719,
111
- "learning_rate": 8.450618433005866e-05,
112
- "loss": 175.0915234375,
113
- "step": 700
114
- },
115
- {
116
- "epoch": 0.7,
117
- "eval_accuracy": 0.2116852394916911,
118
- "eval_loss": 43.59967803955078,
119
- "eval_runtime": 6.9268,
120
- "eval_samples_per_second": 18.046,
121
- "eval_steps_per_second": 0.577,
122
- "step": 700
123
- },
124
- {
125
- "epoch": 0.8,
126
- "grad_norm": 7.553999423980713,
127
- "learning_rate": 3.932305678751549e-05,
128
- "loss": 174.05962890625,
129
- "step": 800
130
- },
131
- {
132
- "epoch": 0.8,
133
- "eval_accuracy": 0.21238318670576736,
134
- "eval_loss": 43.53715515136719,
135
- "eval_runtime": 6.7444,
136
- "eval_samples_per_second": 18.534,
137
- "eval_steps_per_second": 0.593,
138
- "step": 800
139
- },
140
- {
141
- "epoch": 0.9,
142
- "grad_norm": 8.83249282836914,
143
- "learning_rate": 1.0184769603774148e-05,
144
- "loss": 174.92396484375,
145
- "step": 900
146
- },
147
- {
148
- "epoch": 0.9,
149
- "eval_accuracy": 0.21264418377321603,
150
- "eval_loss": 43.506919860839844,
151
- "eval_runtime": 6.9005,
152
- "eval_samples_per_second": 18.115,
153
- "eval_steps_per_second": 0.58,
154
- "step": 900
155
- },
156
- {
157
- "epoch": 1.0,
158
- "grad_norm": 8.517117500305176,
159
- "learning_rate": 1.0069988897853933e-09,
160
- "loss": 173.867734375,
161
- "step": 1000
162
- },
163
- {
164
- "epoch": 1.0,
165
- "eval_accuracy": 0.21278690127077224,
166
- "eval_loss": 43.502532958984375,
167
- "eval_runtime": 6.8719,
168
- "eval_samples_per_second": 18.19,
169
- "eval_steps_per_second": 0.582,
170
- "step": 1000
171
  }
172
  ],
173
  "logging_steps": 100,
174
  "max_steps": 1000,
175
  "num_input_tokens_seen": 0,
176
  "num_train_epochs": 9223372036854775807,
177
- "save_steps": 2000,
178
  "stateful_callbacks": {
179
  "TrainerControl": {
180
  "args": {
@@ -182,13 +147,13 @@
182
  "should_evaluate": false,
183
  "should_log": false,
184
  "should_save": true,
185
- "should_training_stop": true
186
  },
187
  "attributes": {}
188
  }
189
  },
190
  "total_flos": 0.0,
191
- "train_batch_size": 4,
192
  "trial_name": null,
193
  "trial_params": null
194
  }
 
2
  "best_global_step": null,
3
  "best_metric": null,
4
  "best_model_checkpoint": null,
5
+ "epoch": 0.5,
6
+ "eval_steps": 50,
7
+ "global_step": 500,
8
  "is_hyper_param_search": false,
9
  "is_local_process_zero": false,
10
  "is_world_process_zero": true,
11
  "log_history": [
12
+ {
13
+ "epoch": 0.05,
14
+ "eval_accuracy": 0.07674803149606299,
15
+ "eval_loss": 59.70803451538086,
16
+ "eval_runtime": 27.1066,
17
+ "eval_samples_per_second": 4.611,
18
+ "eval_steps_per_second": 0.59,
19
+ "step": 50
20
+ },
21
  {
22
  "epoch": 0.1,
23
+ "grad_norm": 1437.81298828125,
24
+ "learning_rate": 0.000264,
25
+ "loss": 1842.08875,
26
  "step": 100
27
  },
28
  {
29
  "epoch": 0.1,
30
+ "eval_accuracy": 0.11214173228346457,
31
+ "eval_loss": 56.53706359863281,
32
+ "eval_runtime": 9.6201,
33
+ "eval_samples_per_second": 12.994,
34
+ "eval_steps_per_second": 1.663,
35
  "step": 100
36
  },
37
+ {
38
+ "epoch": 0.15,
39
+ "eval_accuracy": 0.1248740157480315,
40
+ "eval_loss": 53.10245132446289,
41
+ "eval_runtime": 13.0919,
42
+ "eval_samples_per_second": 9.548,
43
+ "eval_steps_per_second": 1.222,
44
+ "step": 150
45
+ },
46
  {
47
  "epoch": 0.2,
48
+ "grad_norm": 1170.414794921875,
49
+ "learning_rate": 0.0003967291041791484,
50
+ "loss": 1604.2784375,
51
  "step": 200
52
  },
53
  {
54
  "epoch": 0.2,
55
+ "eval_accuracy": 0.14473228346456693,
56
+ "eval_loss": 49.9360237121582,
57
+ "eval_runtime": 9.3123,
58
+ "eval_samples_per_second": 13.423,
59
+ "eval_steps_per_second": 1.718,
60
  "step": 200
61
  },
62
+ {
63
+ "epoch": 0.25,
64
+ "eval_accuracy": 0.17015748031496064,
65
+ "eval_loss": 47.78742218017578,
66
+ "eval_runtime": 10.4409,
67
+ "eval_samples_per_second": 11.972,
68
+ "eval_steps_per_second": 1.532,
69
+ "step": 250
70
+ },
71
  {
72
  "epoch": 0.3,
73
+ "grad_norm": 627.5261840820312,
74
+ "learning_rate": 0.0003704314025795668,
75
+ "loss": 1458.88296875,
76
  "step": 300
77
  },
78
  {
79
  "epoch": 0.3,
80
+ "eval_accuracy": 0.16708661417322834,
81
+ "eval_loss": 47.620853424072266,
82
+ "eval_runtime": 9.5812,
83
+ "eval_samples_per_second": 13.046,
84
+ "eval_steps_per_second": 1.67,
85
  "step": 300
86
  },
87
+ {
88
+ "epoch": 0.35,
89
+ "eval_accuracy": 0.18376377952755907,
90
+ "eval_loss": 46.354679107666016,
91
+ "eval_runtime": 8.2523,
92
+ "eval_samples_per_second": 15.147,
93
+ "eval_steps_per_second": 1.939,
94
+ "step": 350
95
+ },
96
  {
97
  "epoch": 0.4,
98
+ "grad_norm": 1531.896484375,
99
+ "learning_rate": 0.0003211159956686115,
100
+ "loss": 1410.06390625,
101
  "step": 400
102
  },
103
  {
104
  "epoch": 0.4,
105
+ "eval_accuracy": 0.18334645669291338,
106
+ "eval_loss": 45.935264587402344,
107
+ "eval_runtime": 9.4355,
108
+ "eval_samples_per_second": 13.248,
109
+ "eval_steps_per_second": 1.696,
110
  "step": 400
111
  },
112
  {
113
+ "epoch": 0.45,
114
+ "eval_accuracy": 0.18777165354330708,
115
+ "eval_loss": 45.47114944458008,
116
+ "eval_runtime": 14.0955,
117
+ "eval_samples_per_second": 8.868,
118
+ "eval_steps_per_second": 1.135,
119
+ "step": 450
120
  },
121
  {
122
  "epoch": 0.5,
123
+ "grad_norm": 19442.306640625,
124
+ "learning_rate": 0.00025544320241571017,
125
+ "loss": 1381.1546875,
 
 
126
  "step": 500
127
  },
128
  {
129
+ "epoch": 0.5,
130
+ "eval_accuracy": 0.18888188976377954,
131
+ "eval_loss": 45.3370475769043,
132
+ "eval_runtime": 9.3555,
133
+ "eval_samples_per_second": 13.361,
134
+ "eval_steps_per_second": 1.71,
135
+ "step": 500
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
136
  }
137
  ],
138
  "logging_steps": 100,
139
  "max_steps": 1000,
140
  "num_input_tokens_seen": 0,
141
  "num_train_epochs": 9223372036854775807,
142
+ "save_steps": 500,
143
  "stateful_callbacks": {
144
  "TrainerControl": {
145
  "args": {
 
147
  "should_evaluate": false,
148
  "should_log": false,
149
  "should_save": true,
150
+ "should_training_stop": false
151
  },
152
  "attributes": {}
153
  }
154
  },
155
  "total_flos": 0.0,
156
+ "train_batch_size": 1,
157
  "trial_name": null,
158
  "trial_params": null
159
  }
last-checkpoint/training_args.bin CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:e42ac3e5a09bb56fc92faab3744d893d5a5809db1bd4cadabb4c3a55653610d2
3
  size 5265
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:b4104560ef5b6e6db26b36daa57a06deeead0a170fcb81c70f3e9dbd8207e3ca
3
  size 5265