CodeIsAbstract commited on
Commit
9802134
·
verified ·
1 Parent(s): bd17b76

Training in progress, step 10, checkpoint

Browse files
last-checkpoint/model.safetensors CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:cf8acb1736feb9f9c5744dff791935d4ee71340ef84e99e799cecec44ef1fba4
3
  size 847599616
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:43e8cce973730ae1df8b4f8a574251e0eb8d84e53f64786e1e366ca5fe36b401
3
  size 847599616
last-checkpoint/optimizer.pt CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:4e05d6bc58e1920866c2f6e583cd7a9d3c80b7f5e6a77d49cc0d9c8a26a08af8
3
  size 1386414411
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:a037b3fb1050b981c2566e360b0f7bc7e519dcafb84360257615f51166e12d0f
3
  size 1386414411
last-checkpoint/rng_state_0.pth CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:47750b38402e142f696be83e692f0dcaeaec3650f3a539a8172bb90643534bb3
3
  size 14917
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:df9402a6cb264811460962fe076b4b0afaf8b5c58042e7c96e291b0ab753e219
3
  size 14917
last-checkpoint/rng_state_1.pth CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:a571280ee41c7271d53b8310f62e388e2b05dcdc4ed27f67ba6b3018cacc34ae
3
  size 14917
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:b7a69ede4fdf179c7e9afdb737d70a6ea7d15e0d098b2d3fc81819822f211425
3
  size 14917
last-checkpoint/scheduler.pt CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:28ce995976843ea29dcf27303959f0b6a782b62ac5ec5d7682e78bdf61d82c85
3
  size 1465
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:d67d86f802b2679f6c40dd9bf098b476c8f516c4ab864429fede96230ce6fe23
3
  size 1465
last-checkpoint/trainer_state.json CHANGED
@@ -2,206 +2,37 @@
2
  "best_global_step": null,
3
  "best_metric": null,
4
  "best_model_checkpoint": null,
5
- "epoch": 0.1,
6
  "eval_steps": 5,
7
- "global_step": 100,
8
  "is_hyper_param_search": false,
9
  "is_local_process_zero": true,
10
  "is_world_process_zero": true,
11
  "log_history": [
12
  {
13
  "epoch": 0.005,
14
- "eval_accuracy": 3.92156862745098e-06,
15
- "eval_loss": 21.843835830688477,
16
- "eval_runtime": 45.1096,
17
- "eval_samples_per_second": 11.084,
18
- "eval_steps_per_second": 5.542,
19
  "step": 5
20
  },
21
  {
22
  "epoch": 0.01,
23
- "eval_accuracy": 0.005796078431372549,
24
- "eval_loss": 21.70684814453125,
25
- "eval_runtime": 44.6216,
26
- "eval_samples_per_second": 11.205,
27
- "eval_steps_per_second": 5.603,
28
  "step": 10
29
- },
30
- {
31
- "epoch": 0.015,
32
- "eval_accuracy": 0.019337254901960785,
33
- "eval_loss": 21.580129623413086,
34
- "eval_runtime": 45.0557,
35
- "eval_samples_per_second": 11.097,
36
- "eval_steps_per_second": 5.549,
37
- "step": 15
38
- },
39
- {
40
- "epoch": 0.02,
41
- "eval_accuracy": 0.022207843137254903,
42
- "eval_loss": 21.46198081970215,
43
- "eval_runtime": 45.1875,
44
- "eval_samples_per_second": 11.065,
45
- "eval_steps_per_second": 5.533,
46
- "step": 20
47
- },
48
- {
49
- "epoch": 0.025,
50
- "eval_accuracy": 0.029156862745098037,
51
- "eval_loss": 21.34127426147461,
52
- "eval_runtime": 45.3567,
53
- "eval_samples_per_second": 11.024,
54
- "eval_steps_per_second": 5.512,
55
- "step": 25
56
- },
57
- {
58
- "epoch": 0.03,
59
- "eval_accuracy": 0.03545098039215686,
60
- "eval_loss": 21.242088317871094,
61
- "eval_runtime": 45.3984,
62
- "eval_samples_per_second": 11.014,
63
- "eval_steps_per_second": 5.507,
64
- "step": 30
65
- },
66
- {
67
- "epoch": 0.035,
68
- "eval_accuracy": 0.042094117647058824,
69
- "eval_loss": 21.127534866333008,
70
- "eval_runtime": 46.4511,
71
- "eval_samples_per_second": 10.764,
72
- "eval_steps_per_second": 5.382,
73
- "step": 35
74
- },
75
- {
76
- "epoch": 0.04,
77
- "eval_accuracy": 0.05104313725490196,
78
- "eval_loss": 21.007797241210938,
79
- "eval_runtime": 45.2887,
80
- "eval_samples_per_second": 11.04,
81
- "eval_steps_per_second": 5.52,
82
- "step": 40
83
- },
84
- {
85
- "epoch": 0.045,
86
- "eval_accuracy": 0.05892549019607843,
87
- "eval_loss": 20.8879451751709,
88
- "eval_runtime": 45.4919,
89
- "eval_samples_per_second": 10.991,
90
- "eval_steps_per_second": 5.495,
91
- "step": 45
92
- },
93
- {
94
- "epoch": 0.05,
95
- "eval_accuracy": 0.06429411764705882,
96
- "eval_loss": 20.779932022094727,
97
- "eval_runtime": 45.3237,
98
- "eval_samples_per_second": 11.032,
99
- "eval_steps_per_second": 5.516,
100
- "step": 50
101
- },
102
- {
103
- "epoch": 0.055,
104
- "eval_accuracy": 0.06933333333333333,
105
- "eval_loss": 20.666351318359375,
106
- "eval_runtime": 45.5272,
107
- "eval_samples_per_second": 10.982,
108
- "eval_steps_per_second": 5.491,
109
- "step": 55
110
- },
111
- {
112
- "epoch": 0.06,
113
- "eval_accuracy": 0.0722156862745098,
114
- "eval_loss": 20.56865692138672,
115
- "eval_runtime": 45.4567,
116
- "eval_samples_per_second": 10.999,
117
- "eval_steps_per_second": 5.5,
118
- "step": 60
119
- },
120
- {
121
- "epoch": 0.065,
122
- "eval_accuracy": 0.07492549019607843,
123
- "eval_loss": 20.474367141723633,
124
- "eval_runtime": 45.2841,
125
- "eval_samples_per_second": 11.041,
126
- "eval_steps_per_second": 5.521,
127
- "step": 65
128
- },
129
- {
130
- "epoch": 0.07,
131
- "eval_accuracy": 0.07572941176470588,
132
- "eval_loss": 20.385995864868164,
133
- "eval_runtime": 45.3374,
134
- "eval_samples_per_second": 11.028,
135
- "eval_steps_per_second": 5.514,
136
- "step": 70
137
- },
138
- {
139
- "epoch": 0.075,
140
- "eval_accuracy": 0.07717254901960785,
141
- "eval_loss": 20.2958984375,
142
- "eval_runtime": 45.3438,
143
- "eval_samples_per_second": 11.027,
144
- "eval_steps_per_second": 5.513,
145
- "step": 75
146
- },
147
- {
148
- "epoch": 0.08,
149
- "eval_accuracy": 0.07829411764705882,
150
- "eval_loss": 20.204992294311523,
151
- "eval_runtime": 45.427,
152
- "eval_samples_per_second": 11.007,
153
- "eval_steps_per_second": 5.503,
154
- "step": 80
155
- },
156
- {
157
- "epoch": 0.085,
158
- "eval_accuracy": 0.07968235294117647,
159
- "eval_loss": 20.112102508544922,
160
- "eval_runtime": 45.0567,
161
- "eval_samples_per_second": 11.097,
162
- "eval_steps_per_second": 5.549,
163
- "step": 85
164
- },
165
- {
166
- "epoch": 0.09,
167
- "eval_accuracy": 0.07994509803921569,
168
- "eval_loss": 20.023468017578125,
169
- "eval_runtime": 45.1806,
170
- "eval_samples_per_second": 11.067,
171
- "eval_steps_per_second": 5.533,
172
- "step": 90
173
- },
174
- {
175
- "epoch": 0.095,
176
- "eval_accuracy": 0.07969411764705882,
177
- "eval_loss": 19.922317504882812,
178
- "eval_runtime": 45.3425,
179
- "eval_samples_per_second": 11.027,
180
- "eval_steps_per_second": 5.514,
181
- "step": 95
182
- },
183
- {
184
- "epoch": 0.1,
185
- "grad_norm": 3.734435558319092,
186
- "learning_rate": 3.973800426880847e-06,
187
- "loss": 167.01556640625,
188
- "step": 100
189
- },
190
- {
191
- "epoch": 0.1,
192
- "eval_accuracy": 0.07997254901960785,
193
- "eval_loss": 19.829484939575195,
194
- "eval_runtime": 45.4368,
195
- "eval_samples_per_second": 11.004,
196
- "eval_steps_per_second": 5.502,
197
- "step": 100
198
  }
199
  ],
200
  "logging_steps": 100,
201
  "max_steps": 1000,
202
  "num_input_tokens_seen": 0,
203
  "num_train_epochs": 9223372036854775807,
204
- "save_steps": 100,
205
  "stateful_callbacks": {
206
  "TrainerControl": {
207
  "args": {
 
2
  "best_global_step": null,
3
  "best_metric": null,
4
  "best_model_checkpoint": null,
5
+ "epoch": 0.01,
6
  "eval_steps": 5,
7
+ "global_step": 10,
8
  "is_hyper_param_search": false,
9
  "is_local_process_zero": true,
10
  "is_world_process_zero": true,
11
  "log_history": [
12
  {
13
  "epoch": 0.005,
14
+ "eval_accuracy": 0.05346666666666667,
15
+ "eval_loss": 20.794218063354492,
16
+ "eval_runtime": 35.3413,
17
+ "eval_samples_per_second": 14.148,
18
+ "eval_steps_per_second": 7.074,
19
  "step": 5
20
  },
21
  {
22
  "epoch": 0.01,
23
+ "eval_accuracy": 0.07933333333333334,
24
+ "eval_loss": 19.725038528442383,
25
+ "eval_runtime": 35.9943,
26
+ "eval_samples_per_second": 13.891,
27
+ "eval_steps_per_second": 6.946,
28
  "step": 10
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
29
  }
30
  ],
31
  "logging_steps": 100,
32
  "max_steps": 1000,
33
  "num_input_tokens_seen": 0,
34
  "num_train_epochs": 9223372036854775807,
35
+ "save_steps": 10,
36
  "stateful_callbacks": {
37
  "TrainerControl": {
38
  "args": {
last-checkpoint/training_args.bin CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:61901a80b548b22f93a9c3be114cffc81cb96a048a415d030c20431d54e95e01
3
  size 5265
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:9bdaf07830b33937d6f32edfcc276b67b7d1e1e7aade843e68aded14ec567bf9
3
  size 5265