ChiefTheLord commited on
Commit
26aa96c
·
verified ·
1 Parent(s): 8e1c344

Delete checkpoints-v3.0-discrete-conditional

Browse files
checkpoints-v3.0-discrete-conditional/checkpoint-1792/model.safetensors DELETED
@@ -1,3 +0,0 @@
1
- version https://git-lfs.github.com/spec/v1
2
- oid sha256:8b3ad70db4ed69d93fd168409c9fb8df7d893bf06aebd8d9a1546cf4bd671646
3
- size 24272320
 
 
 
 
checkpoints-v3.0-discrete-conditional/checkpoint-1792/optimizer.pt DELETED
@@ -1,3 +0,0 @@
1
- version https://git-lfs.github.com/spec/v1
2
- oid sha256:83207f207113cf981c258c88cca169fae259919129e37cd73de6fbfe322cbec4
3
- size 519947
 
 
 
 
checkpoints-v3.0-discrete-conditional/checkpoint-1792/rng_state.pth DELETED
@@ -1,3 +0,0 @@
1
- version https://git-lfs.github.com/spec/v1
2
- oid sha256:33195186be30d1f265b097129519b2867d0c3a6cba0ca5c3fe920aa11e1cd406
3
- size 14645
 
 
 
 
checkpoints-v3.0-discrete-conditional/checkpoint-1792/scaler.pt DELETED
@@ -1,3 +0,0 @@
1
- version https://git-lfs.github.com/spec/v1
2
- oid sha256:c53cf553f6434449959e590b32ad22ac0c6e07ffae962a4164d31ea3a75d345e
3
- size 1383
 
 
 
 
checkpoints-v3.0-discrete-conditional/checkpoint-1792/scheduler.pt DELETED
@@ -1,3 +0,0 @@
1
- version https://git-lfs.github.com/spec/v1
2
- oid sha256:970abb983a5a0197c365bc7fdfdc8155569e58b62f56513c3b9d937587189b2d
3
- size 1465
 
 
 
 
checkpoints-v3.0-discrete-conditional/checkpoint-1792/trainer_state.json DELETED
@@ -1,251 +0,0 @@
1
- {
2
- "best_global_step": null,
3
- "best_metric": null,
4
- "best_model_checkpoint": null,
5
- "epoch": 0.8849382716049383,
6
- "eval_steps": 256,
7
- "global_step": 1792,
8
- "is_hyper_param_search": false,
9
- "is_local_process_zero": true,
10
- "is_world_process_zero": true,
11
- "log_history": [
12
- {
13
- "epoch": 0.06320987654320988,
14
- "grad_norm": 0.23306457698345184,
15
- "learning_rate": 0.000248046875,
16
- "loss": 0.39816710352897644,
17
- "step": 128
18
- },
19
- {
20
- "epoch": 0.12641975308641976,
21
- "grad_norm": 0.22459745407104492,
22
- "learning_rate": 0.000498046875,
23
- "loss": 0.40399056673049927,
24
- "step": 256
25
- },
26
- {
27
- "epoch": 0.12641975308641976,
28
- "eval_cos_loss": 0.10607527632538866,
29
- "eval_loss": 0.3911797745925624,
30
- "eval_mse_loss": 0.38057224779594234,
31
- "step": 256
32
- },
33
- {
34
- "epoch": 0.12641975308641976,
35
- "eval_cos_loss": 0.10607527632538866,
36
- "eval_loss": 0.3911797745925624,
37
- "eval_mse_loss": 0.38057224779594234,
38
- "eval_runtime": 3.9087,
39
- "eval_samples_per_second": 669.78,
40
- "eval_steps_per_second": 10.489,
41
- "step": 256
42
- },
43
- {
44
- "epoch": 0.18962962962962962,
45
- "grad_norm": 1.4832631349563599,
46
- "learning_rate": 0.000748046875,
47
- "loss": 0.40022405982017517,
48
- "step": 384
49
- },
50
- {
51
- "epoch": 0.2528395061728395,
52
- "grad_norm": 0.28019025921821594,
53
- "learning_rate": 0.000998046875,
54
- "loss": 0.40096139907836914,
55
- "step": 512
56
- },
57
- {
58
- "epoch": 0.2528395061728395,
59
- "eval_cos_loss": 0.1108138523087269,
60
- "eval_loss": 0.4095045269989386,
61
- "eval_mse_loss": 0.39842314473012597,
62
- "step": 512
63
- },
64
- {
65
- "epoch": 0.2528395061728395,
66
- "eval_cos_loss": 0.1108138523087269,
67
- "eval_loss": 0.4095045269989386,
68
- "eval_mse_loss": 0.39842314473012597,
69
- "eval_runtime": 3.9424,
70
- "eval_samples_per_second": 664.061,
71
- "eval_steps_per_second": 10.4,
72
- "step": 512
73
- },
74
- {
75
- "epoch": 0.3160493827160494,
76
- "grad_norm": 0.2588430345058441,
77
- "learning_rate": 0.0009827157247249464,
78
- "loss": 0.39848989248275757,
79
- "step": 640
80
- },
81
- {
82
- "epoch": 0.37925925925925924,
83
- "grad_norm": 0.22329679131507874,
84
- "learning_rate": 0.0009315344337660421,
85
- "loss": 0.3891080319881439,
86
- "step": 768
87
- },
88
- {
89
- "epoch": 0.37925925925925924,
90
- "eval_cos_loss": 0.10478089422714419,
91
- "eval_loss": 0.38925740195483693,
92
- "eval_mse_loss": 0.37877931173254803,
93
- "step": 768
94
- },
95
- {
96
- "epoch": 0.37925925925925924,
97
- "eval_cos_loss": 0.10478089422714419,
98
- "eval_loss": 0.38925740195483693,
99
- "eval_mse_loss": 0.37877931173254803,
100
- "eval_runtime": 3.9118,
101
- "eval_samples_per_second": 669.26,
102
- "eval_steps_per_second": 10.481,
103
- "step": 768
104
- },
105
- {
106
- "epoch": 0.44246913580246916,
107
- "grad_norm": 0.20011205971240997,
108
- "learning_rate": 0.0008500491898731988,
109
- "loss": 0.3931492567062378,
110
- "step": 896
111
- },
112
- {
113
- "epoch": 0.505679012345679,
114
- "grad_norm": 0.1937173455953598,
115
- "learning_rate": 0.0007439821899385376,
116
- "loss": 0.391335129737854,
117
- "step": 1024
118
- },
119
- {
120
- "epoch": 0.505679012345679,
121
- "eval_cos_loss": 0.10188191693003584,
122
- "eval_loss": 0.3795151790467704,
123
- "eval_mse_loss": 0.3693269865541923,
124
- "step": 1024
125
- },
126
- {
127
- "epoch": 0.505679012345679,
128
- "eval_cos_loss": 0.10188191693003584,
129
- "eval_loss": 0.3795151790467704,
130
- "eval_mse_loss": 0.3693269865541923,
131
- "eval_runtime": 3.8456,
132
- "eval_samples_per_second": 680.77,
133
- "eval_steps_per_second": 10.661,
134
- "step": 1024
135
- },
136
- {
137
- "epoch": 0.5688888888888889,
138
- "grad_norm": 0.17722535133361816,
139
- "learning_rate": 0.0006207818531897271,
140
- "loss": 0.3856668770313263,
141
- "step": 1152
142
- },
143
- {
144
- "epoch": 0.6320987654320988,
145
- "grad_norm": 0.20393630862236023,
146
- "learning_rate": 0.0004890997654891032,
147
- "loss": 0.37992340326309204,
148
- "step": 1280
149
- },
150
- {
151
- "epoch": 0.6320987654320988,
152
- "eval_cos_loss": 0.10752386781500607,
153
- "eval_loss": 0.3945070817703154,
154
- "eval_mse_loss": 0.3837546953340856,
155
- "step": 1280
156
- },
157
- {
158
- "epoch": 0.6320987654320988,
159
- "eval_cos_loss": 0.10752386781500607,
160
- "eval_loss": 0.3945070817703154,
161
- "eval_mse_loss": 0.3837546953340856,
162
- "eval_runtime": 3.9318,
163
- "eval_samples_per_second": 665.855,
164
- "eval_steps_per_second": 10.428,
165
- "step": 1280
166
- },
167
- {
168
- "epoch": 0.6953086419753086,
169
- "grad_norm": 0.22595147788524628,
170
- "learning_rate": 0.00035818313279679524,
171
- "loss": 0.3873279094696045,
172
- "step": 1408
173
- },
174
- {
175
- "epoch": 0.7585185185185185,
176
- "grad_norm": 0.2019820213317871,
177
- "learning_rate": 0.00023722540797531234,
178
- "loss": 0.37948113679885864,
179
- "step": 1536
180
- },
181
- {
182
- "epoch": 0.7585185185185185,
183
- "eval_cos_loss": 0.1014540351745559,
184
- "eval_loss": 0.37390955628418343,
185
- "eval_mse_loss": 0.36376415229425196,
186
- "step": 1536
187
- },
188
- {
189
- "epoch": 0.7585185185185185,
190
- "eval_cos_loss": 0.1014540351745559,
191
- "eval_loss": 0.37390955628418343,
192
- "eval_mse_loss": 0.36376415229425196,
193
- "eval_runtime": 3.9553,
194
- "eval_samples_per_second": 661.902,
195
- "eval_steps_per_second": 10.366,
196
- "step": 1536
197
- },
198
- {
199
- "epoch": 0.8217283950617283,
200
- "grad_norm": 0.20358595252037048,
201
- "learning_rate": 0.00013472069233656453,
202
- "loss": 0.3810204267501831,
203
- "step": 1664
204
- },
205
- {
206
- "epoch": 0.8849382716049383,
207
- "grad_norm": 0.2263447791337967,
208
- "learning_rate": 5.786724825584927e-05,
209
- "loss": 0.3751329481601715,
210
- "step": 1792
211
- },
212
- {
213
- "epoch": 0.8849382716049383,
214
- "eval_cos_loss": 0.09955191503210765,
215
- "eval_loss": 0.3695452562192591,
216
- "eval_mse_loss": 0.35959006446163827,
217
- "step": 1792
218
- },
219
- {
220
- "epoch": 0.8849382716049383,
221
- "eval_cos_loss": 0.09955191503210765,
222
- "eval_loss": 0.3695452562192591,
223
- "eval_mse_loss": 0.35959006446163827,
224
- "eval_runtime": 3.8784,
225
- "eval_samples_per_second": 675.023,
226
- "eval_steps_per_second": 10.571,
227
- "step": 1792
228
- }
229
- ],
230
- "logging_steps": 128,
231
- "max_steps": 2025,
232
- "num_input_tokens_seen": 0,
233
- "num_train_epochs": 1,
234
- "save_steps": 256,
235
- "stateful_callbacks": {
236
- "TrainerControl": {
237
- "args": {
238
- "should_epoch_stop": false,
239
- "should_evaluate": false,
240
- "should_log": false,
241
- "should_save": true,
242
- "should_training_stop": false
243
- },
244
- "attributes": {}
245
- }
246
- },
247
- "total_flos": 0.0,
248
- "train_batch_size": 64,
249
- "trial_name": null,
250
- "trial_params": null
251
- }
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
checkpoints-v3.0-discrete-conditional/checkpoint-1792/training_args.bin DELETED
@@ -1,3 +0,0 @@
1
- version https://git-lfs.github.com/spec/v1
2
- oid sha256:c0839bffbc58eb6068cc228e4d756dbb22a9adf723766e40a7bc2a03aca92630
3
- size 5137