CodeIsAbstract commited on
Commit
b49535a
·
verified ·
1 Parent(s): 113ab5e

Training in progress, step 2000, checkpoint

Browse files
last-checkpoint/optimizer.pt CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:4f6699d01f8e164228a8dd52c97ad373cf8f385ea3db3cf918436dad5dc85d09
3
  size 386379
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:70a32488c42d94bc68537838fd59bace50bad9a491961be86f3738a6910755e4
3
  size 386379
last-checkpoint/pytorch_model.bin CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:97fd4ca2baf513dd7e640129586738e37fb64c9da14592e89cd1cb308bf9e40a
3
  size 1540661735
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:47fd29bde813c33926e0c9c10cf9775d231d7930b7aa4abd47133c29f24ed7c5
3
  size 1540661735
last-checkpoint/rng_state_0.pth CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:934ae4672c85df4a03b901039c48484c6d48940b666eb9da6abdadd0bfd7ca2e
3
  size 14469
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:2a2a4adad934312ea001cd84349883cb6c15698df9bb6c090af6bf88181fb06b
3
  size 14469
last-checkpoint/rng_state_1.pth CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:f8e7ba67417374f28eafc52fb09cd1635fb90aeae797c287fb344cf608c324f7
3
  size 14469
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:649e8cc37e14e4911064da2b8cb9ef2ade87f6e78d1185d4b8e5b14453b1c83d
3
  size 14469
last-checkpoint/rng_state_2.pth CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:b34aebebdff0fa5078105ea2165525a062f2af01267a2bc4a5277f926a1ddf87
3
  size 14469
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:f6403efa0c30bbacae871a7df874ec4bbdb5b528b6d86d3b5609a837c3eb80b9
3
  size 14469
last-checkpoint/rng_state_3.pth CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:bbad142d3225fe2301edd7a4526b586614f8cdf35859a150aa76ce623d42e698
3
  size 14469
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:fedd614c5b3fb7e22cbb42e3d69fcde0d7a32f2e678c37f7c99bb5a167b975e8
3
  size 14469
last-checkpoint/rng_state_4.pth CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:08730831ebd5924954c36016585e26ed2876b02574126a5a7953c60d82be5570
3
  size 14469
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:f72141908b3038f5d527be0a4afe331900fd2cd98b763078b556a00ecca0eca1
3
  size 14469
last-checkpoint/rng_state_5.pth CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:7d18edd5743601b28a2cec06aa40d0c6c594939906326809da6ebe1722314306
3
  size 14469
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:c958787b74a3aefeefe565a04ee3471c563655a4aa29b37f82c1b78d0c1b5a6c
3
  size 14469
last-checkpoint/rng_state_6.pth CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:83bfd9473be8368ac6ad0e43a10656820b148df93417308e1170b538c5843f29
3
  size 14469
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:8a198a4edc5b0a0c0735b02620e42eae859d7b0a942bf7c1a21b08b1885eff98
3
  size 14469
last-checkpoint/rng_state_7.pth CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:319739ad7d60d541f5641918cc521dd6473e39cc771d09fd1d8985261cc880a0
3
  size 14469
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:1403f69e2c99c4fcaf2999db32c4368d388bb9ac696855db926ab4209f647997
3
  size 14469
last-checkpoint/scheduler.pt CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:3c3db7392f9c6280c917a9b32f54db3418a51b7cc8ad693de700680693a06e6b
3
  size 1465
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:19317e67cea234fe3e615230a11e75ee190fdec27b0f95904042181fcbf16742
3
  size 1465
last-checkpoint/trainer_state.json CHANGED
@@ -2,179 +2,177 @@
2
  "best_global_step": null,
3
  "best_metric": null,
4
  "best_model_checkpoint": null,
5
- "epoch": 1.0,
6
- "eval_steps": 100,
7
- "global_step": 1000,
8
  "is_hyper_param_search": false,
9
  "is_local_process_zero": false,
10
  "is_world_process_zero": true,
11
  "log_history": [
12
  {
13
- "epoch": 0.1,
14
- "grad_norm": 1.0674346685409546,
15
- "learning_rate": 0.003920764340590609,
16
- "loss": 59.4722705078125,
17
  "step": 100
18
  },
19
  {
20
- "epoch": 0.1,
21
- "eval_accuracy": 0.14505767350928642,
22
- "eval_loss": 57.5521240234375,
23
- "eval_runtime": 23.0144,
24
- "eval_samples_per_second": 5.431,
25
- "eval_steps_per_second": 0.174,
26
- "step": 100
27
  },
28
  {
29
- "epoch": 0.2,
30
- "grad_norm": 0.8365403413772583,
31
- "learning_rate": 0.003650943793925548,
32
- "loss": 57.0307275390625,
33
- "step": 200
34
  },
35
  {
36
- "epoch": 0.2,
37
- "eval_accuracy": 0.14682111436950146,
38
- "eval_loss": 56.763153076171875,
39
- "eval_runtime": 6.889,
40
- "eval_samples_per_second": 18.145,
41
- "eval_steps_per_second": 0.581,
42
- "step": 200
43
  },
44
  {
45
- "epoch": 0.3,
46
- "grad_norm": 0.6420626044273376,
47
- "learning_rate": 0.0032162636906540357,
48
- "loss": 56.4287109375,
49
- "step": 300
50
  },
51
  {
52
- "epoch": 0.3,
53
- "eval_accuracy": 0.15105865102639296,
54
- "eval_loss": 56.29315185546875,
55
- "eval_runtime": 7.4741,
56
- "eval_samples_per_second": 16.724,
57
- "eval_steps_per_second": 0.535,
58
- "step": 300
59
  },
60
  {
61
- "epoch": 0.4,
62
- "grad_norm": 0.6022240519523621,
63
- "learning_rate": 0.0026601302141692667,
64
- "loss": 56.0290380859375,
65
- "step": 400
66
  },
67
  {
68
- "epoch": 0.4,
69
- "eval_accuracy": 0.1521642228739003,
70
- "eval_loss": 55.97286605834961,
71
- "eval_runtime": 6.9186,
72
- "eval_samples_per_second": 18.067,
73
- "eval_steps_per_second": 0.578,
74
- "step": 400
75
  },
76
  {
77
- "epoch": 0.5,
78
- "grad_norm": 0.6007410287857056,
79
- "learning_rate": 0.002038077610206693,
80
- "loss": 56.0603759765625,
81
- "step": 500
82
  },
83
  {
84
- "epoch": 0.5,
85
- "eval_accuracy": 0.15361681329423266,
86
- "eval_loss": 55.698612213134766,
87
- "eval_runtime": 6.7281,
88
- "eval_samples_per_second": 18.579,
89
- "eval_steps_per_second": 0.595,
90
- "step": 500
91
  },
92
  {
93
- "epoch": 0.6,
94
- "grad_norm": 0.5756194591522217,
95
- "learning_rate": 0.0014122226612106885,
96
- "loss": 55.7325390625,
97
- "step": 600
 
 
98
  },
99
  {
100
- "epoch": 0.6,
101
- "eval_accuracy": 0.15486021505376343,
102
- "eval_loss": 55.48189163208008,
103
- "eval_runtime": 6.8292,
104
- "eval_samples_per_second": 18.304,
105
- "eval_steps_per_second": 0.586,
106
- "step": 600
107
  },
108
  {
109
- "epoch": 0.7,
110
- "grad_norm": 0.5742236375808716,
111
- "learning_rate": 0.0008450618433005865,
112
- "loss": 55.4351513671875,
113
- "step": 700
114
  },
115
  {
116
- "epoch": 0.7,
117
- "eval_accuracy": 0.15646823069403715,
118
- "eval_loss": 55.330833435058594,
119
- "eval_runtime": 6.8567,
120
- "eval_samples_per_second": 18.23,
121
- "eval_steps_per_second": 0.583,
122
- "step": 700
123
  },
124
  {
125
- "epoch": 0.8,
126
- "grad_norm": 0.5711455345153809,
127
- "learning_rate": 0.0003932305678751549,
128
- "loss": 55.313212890625,
129
- "step": 800
130
  },
131
  {
132
- "epoch": 0.8,
133
- "eval_accuracy": 0.1573030303030303,
134
- "eval_loss": 55.21982192993164,
135
- "eval_runtime": 6.7731,
136
- "eval_samples_per_second": 18.455,
137
- "eval_steps_per_second": 0.591,
138
- "step": 800
139
  },
140
  {
141
- "epoch": 0.9,
142
- "grad_norm": 0.65065997838974,
143
- "learning_rate": 0.00010184769603774147,
144
- "loss": 55.213203125,
145
- "step": 900
146
  },
147
  {
148
- "epoch": 0.9,
149
- "eval_accuracy": 0.15794916911045942,
150
- "eval_loss": 55.16655731201172,
151
- "eval_runtime": 6.6852,
152
- "eval_samples_per_second": 18.698,
153
- "eval_steps_per_second": 0.598,
154
- "step": 900
155
  },
156
  {
157
- "epoch": 1.0,
158
- "grad_norm": 0.6348595023155212,
159
- "learning_rate": 1.0069988897853933e-08,
160
- "loss": 55.2790576171875,
161
- "step": 1000
162
  },
163
  {
164
- "epoch": 1.0,
165
- "eval_accuracy": 0.15813000977517105,
166
- "eval_loss": 55.15705490112305,
167
- "eval_runtime": 6.7487,
168
- "eval_samples_per_second": 18.522,
169
- "eval_steps_per_second": 0.593,
170
- "step": 1000
 
 
 
 
 
 
 
 
 
 
 
 
 
 
171
  }
172
  ],
173
  "logging_steps": 100,
174
- "max_steps": 1000,
175
  "num_input_tokens_seen": 0,
176
  "num_train_epochs": 9223372036854775807,
177
- "save_steps": 500,
178
  "stateful_callbacks": {
179
  "TrainerControl": {
180
  "args": {
@@ -182,7 +180,7 @@
182
  "should_evaluate": false,
183
  "should_log": false,
184
  "should_save": true,
185
- "should_training_stop": true
186
  },
187
  "attributes": {}
188
  }
 
2
  "best_global_step": null,
3
  "best_metric": null,
4
  "best_model_checkpoint": null,
5
+ "epoch": 0.08,
6
+ "eval_steps": 1000,
7
+ "global_step": 2000,
8
  "is_hyper_param_search": false,
9
  "is_local_process_zero": false,
10
  "is_world_process_zero": true,
11
  "log_history": [
12
  {
13
+ "epoch": 0.004,
14
+ "grad_norm": 0.6785533428192139,
15
+ "learning_rate": 0.003999874817760761,
16
+ "loss": 67.455439453125,
17
  "step": 100
18
  },
19
  {
20
+ "epoch": 0.008,
21
+ "grad_norm": 0.7726423144340515,
22
+ "learning_rate": 0.00399943549159807,
23
+ "loss": 60.8977392578125,
24
+ "step": 200
 
 
25
  },
26
  {
27
+ "epoch": 0.012,
28
+ "grad_norm": 0.5963970422744751,
29
+ "learning_rate": 0.003998680178657526,
30
+ "loss": 58.8469140625,
31
+ "step": 300
32
  },
33
  {
34
+ "epoch": 0.016,
35
+ "grad_norm": 0.5085615515708923,
36
+ "learning_rate": 0.003997608998307273,
37
+ "loss": 57.544306640625,
38
+ "step": 400
 
 
39
  },
40
  {
41
+ "epoch": 0.02,
42
+ "grad_norm": 0.5642688870429993,
43
+ "learning_rate": 0.003996222119834506,
44
+ "loss": 56.976044921875,
45
+ "step": 500
46
  },
47
  {
48
+ "epoch": 0.024,
49
+ "grad_norm": 0.47304418683052063,
50
+ "learning_rate": 0.003994519762418718,
51
+ "loss": 56.1641748046875,
52
+ "step": 600
 
 
53
  },
54
  {
55
+ "epoch": 0.028,
56
+ "grad_norm": 0.45104825496673584,
57
+ "learning_rate": 0.003992502195097064,
58
+ "loss": 55.4853173828125,
59
+ "step": 700
60
  },
61
  {
62
+ "epoch": 0.032,
63
+ "grad_norm": 0.5336799621582031,
64
+ "learning_rate": 0.00399016973672184,
65
+ "loss": 54.9941357421875,
66
+ "step": 800
 
 
67
  },
68
  {
69
+ "epoch": 0.036,
70
+ "grad_norm": 0.5774248242378235,
71
+ "learning_rate": 0.0039875227559100935,
72
+ "loss": 54.54736328125,
73
+ "step": 900
74
  },
75
  {
76
+ "epoch": 0.04,
77
+ "grad_norm": 0.7312104105949402,
78
+ "learning_rate": 0.003984561670985366,
79
+ "loss": 54.2763134765625,
80
+ "step": 1000
 
 
81
  },
82
  {
83
+ "epoch": 0.04,
84
+ "eval_accuracy": 0.1520635386119257,
85
+ "eval_loss": 53.98247146606445,
86
+ "eval_runtime": 23.3511,
87
+ "eval_samples_per_second": 5.353,
88
+ "eval_steps_per_second": 0.171,
89
+ "step": 1000
90
  },
91
  {
92
+ "epoch": 0.044,
93
+ "grad_norm": 0.6063086986541748,
94
+ "learning_rate": 0.003981286949911586,
95
+ "loss": 53.98443359375,
96
+ "step": 1100
 
 
97
  },
98
  {
99
+ "epoch": 0.048,
100
+ "grad_norm": 0.39948800206184387,
101
+ "learning_rate": 0.003977699110219106,
102
+ "loss": 53.585517578125,
103
+ "step": 1200
104
  },
105
  {
106
+ "epoch": 0.052,
107
+ "grad_norm": 0.5279461145401001,
108
+ "learning_rate": 0.0039737987189229235,
109
+ "loss": 53.4054736328125,
110
+ "step": 1300
 
 
111
  },
112
  {
113
+ "epoch": 0.056,
114
+ "grad_norm": 0.7522546648979187,
115
+ "learning_rate": 0.00396958639243306,
116
+ "loss": 53.0430322265625,
117
+ "step": 1400
118
  },
119
  {
120
+ "epoch": 0.06,
121
+ "grad_norm": 0.7735885381698608,
122
+ "learning_rate": 0.003965062796457152,
123
+ "loss": 52.7428564453125,
124
+ "step": 1500
 
 
125
  },
126
  {
127
+ "epoch": 0.064,
128
+ "grad_norm": 0.7539300322532654,
129
+ "learning_rate": 0.0039602286458952415,
130
+ "loss": 52.66658203125,
131
+ "step": 1600
132
  },
133
  {
134
+ "epoch": 0.068,
135
+ "grad_norm": 0.49980393052101135,
136
+ "learning_rate": 0.0039550847047267945,
137
+ "loss": 52.561875,
138
+ "step": 1700
 
 
139
  },
140
  {
141
+ "epoch": 0.072,
142
+ "grad_norm": 0.8233217000961304,
143
+ "learning_rate": 0.0039496317858899645,
144
+ "loss": 52.1762646484375,
145
+ "step": 1800
146
  },
147
  {
148
+ "epoch": 0.076,
149
+ "grad_norm": 0.5626161098480225,
150
+ "learning_rate": 0.003943870751153116,
151
+ "loss": 51.989736328125,
152
+ "step": 1900
153
+ },
154
+ {
155
+ "epoch": 0.08,
156
+ "grad_norm": 0.6408643126487732,
157
+ "learning_rate": 0.003937802510978631,
158
+ "loss": 51.8978759765625,
159
+ "step": 2000
160
+ },
161
+ {
162
+ "epoch": 0.08,
163
+ "eval_accuracy": 0.15603128054740958,
164
+ "eval_loss": 51.726192474365234,
165
+ "eval_runtime": 7.2542,
166
+ "eval_samples_per_second": 17.231,
167
+ "eval_steps_per_second": 0.551,
168
+ "step": 2000
169
  }
170
  ],
171
  "logging_steps": 100,
172
+ "max_steps": 25000,
173
  "num_input_tokens_seen": 0,
174
  "num_train_epochs": 9223372036854775807,
175
+ "save_steps": 2000,
176
  "stateful_callbacks": {
177
  "TrainerControl": {
178
  "args": {
 
180
  "should_evaluate": false,
181
  "should_log": false,
182
  "should_save": true,
183
+ "should_training_stop": false
184
  },
185
  "attributes": {}
186
  }
last-checkpoint/training_args.bin CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:4ca316f954a0e91646cfe7cc48ead82990c29283d2e6825936de0377c3707c2e
3
  size 5265
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:249f6f32e73d3d59f6736409b63eee22371849afb3a7101dfad4569505bfb4ec
3
  size 5265