ChiefTheLord commited on
Commit
8e1c344
·
verified ·
1 Parent(s): 2d5724b

Upload folder using huggingface_hub

Browse files
checkpoints-v3.0-discrete-conditional/checkpoint-1792/model.safetensors ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:8b3ad70db4ed69d93fd168409c9fb8df7d893bf06aebd8d9a1546cf4bd671646
3
+ size 24272320
checkpoints-v3.0-discrete-conditional/checkpoint-1792/optimizer.pt ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:83207f207113cf981c258c88cca169fae259919129e37cd73de6fbfe322cbec4
3
+ size 519947
checkpoints-v3.0-discrete-conditional/checkpoint-1792/rng_state.pth ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:33195186be30d1f265b097129519b2867d0c3a6cba0ca5c3fe920aa11e1cd406
3
+ size 14645
checkpoints-v3.0-discrete-conditional/checkpoint-1792/scaler.pt ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:c53cf553f6434449959e590b32ad22ac0c6e07ffae962a4164d31ea3a75d345e
3
+ size 1383
checkpoints-v3.0-discrete-conditional/checkpoint-1792/scheduler.pt ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:970abb983a5a0197c365bc7fdfdc8155569e58b62f56513c3b9d937587189b2d
3
+ size 1465
checkpoints-v3.0-discrete-conditional/checkpoint-1792/trainer_state.json ADDED
@@ -0,0 +1,251 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "best_global_step": null,
3
+ "best_metric": null,
4
+ "best_model_checkpoint": null,
5
+ "epoch": 0.8849382716049383,
6
+ "eval_steps": 256,
7
+ "global_step": 1792,
8
+ "is_hyper_param_search": false,
9
+ "is_local_process_zero": true,
10
+ "is_world_process_zero": true,
11
+ "log_history": [
12
+ {
13
+ "epoch": 0.06320987654320988,
14
+ "grad_norm": 0.23306457698345184,
15
+ "learning_rate": 0.000248046875,
16
+ "loss": 0.39816710352897644,
17
+ "step": 128
18
+ },
19
+ {
20
+ "epoch": 0.12641975308641976,
21
+ "grad_norm": 0.22459745407104492,
22
+ "learning_rate": 0.000498046875,
23
+ "loss": 0.40399056673049927,
24
+ "step": 256
25
+ },
26
+ {
27
+ "epoch": 0.12641975308641976,
28
+ "eval_cos_loss": 0.10607527632538866,
29
+ "eval_loss": 0.3911797745925624,
30
+ "eval_mse_loss": 0.38057224779594234,
31
+ "step": 256
32
+ },
33
+ {
34
+ "epoch": 0.12641975308641976,
35
+ "eval_cos_loss": 0.10607527632538866,
36
+ "eval_loss": 0.3911797745925624,
37
+ "eval_mse_loss": 0.38057224779594234,
38
+ "eval_runtime": 3.9087,
39
+ "eval_samples_per_second": 669.78,
40
+ "eval_steps_per_second": 10.489,
41
+ "step": 256
42
+ },
43
+ {
44
+ "epoch": 0.18962962962962962,
45
+ "grad_norm": 1.4832631349563599,
46
+ "learning_rate": 0.000748046875,
47
+ "loss": 0.40022405982017517,
48
+ "step": 384
49
+ },
50
+ {
51
+ "epoch": 0.2528395061728395,
52
+ "grad_norm": 0.28019025921821594,
53
+ "learning_rate": 0.000998046875,
54
+ "loss": 0.40096139907836914,
55
+ "step": 512
56
+ },
57
+ {
58
+ "epoch": 0.2528395061728395,
59
+ "eval_cos_loss": 0.1108138523087269,
60
+ "eval_loss": 0.4095045269989386,
61
+ "eval_mse_loss": 0.39842314473012597,
62
+ "step": 512
63
+ },
64
+ {
65
+ "epoch": 0.2528395061728395,
66
+ "eval_cos_loss": 0.1108138523087269,
67
+ "eval_loss": 0.4095045269989386,
68
+ "eval_mse_loss": 0.39842314473012597,
69
+ "eval_runtime": 3.9424,
70
+ "eval_samples_per_second": 664.061,
71
+ "eval_steps_per_second": 10.4,
72
+ "step": 512
73
+ },
74
+ {
75
+ "epoch": 0.3160493827160494,
76
+ "grad_norm": 0.2588430345058441,
77
+ "learning_rate": 0.0009827157247249464,
78
+ "loss": 0.39848989248275757,
79
+ "step": 640
80
+ },
81
+ {
82
+ "epoch": 0.37925925925925924,
83
+ "grad_norm": 0.22329679131507874,
84
+ "learning_rate": 0.0009315344337660421,
85
+ "loss": 0.3891080319881439,
86
+ "step": 768
87
+ },
88
+ {
89
+ "epoch": 0.37925925925925924,
90
+ "eval_cos_loss": 0.10478089422714419,
91
+ "eval_loss": 0.38925740195483693,
92
+ "eval_mse_loss": 0.37877931173254803,
93
+ "step": 768
94
+ },
95
+ {
96
+ "epoch": 0.37925925925925924,
97
+ "eval_cos_loss": 0.10478089422714419,
98
+ "eval_loss": 0.38925740195483693,
99
+ "eval_mse_loss": 0.37877931173254803,
100
+ "eval_runtime": 3.9118,
101
+ "eval_samples_per_second": 669.26,
102
+ "eval_steps_per_second": 10.481,
103
+ "step": 768
104
+ },
105
+ {
106
+ "epoch": 0.44246913580246916,
107
+ "grad_norm": 0.20011205971240997,
108
+ "learning_rate": 0.0008500491898731988,
109
+ "loss": 0.3931492567062378,
110
+ "step": 896
111
+ },
112
+ {
113
+ "epoch": 0.505679012345679,
114
+ "grad_norm": 0.1937173455953598,
115
+ "learning_rate": 0.0007439821899385376,
116
+ "loss": 0.391335129737854,
117
+ "step": 1024
118
+ },
119
+ {
120
+ "epoch": 0.505679012345679,
121
+ "eval_cos_loss": 0.10188191693003584,
122
+ "eval_loss": 0.3795151790467704,
123
+ "eval_mse_loss": 0.3693269865541923,
124
+ "step": 1024
125
+ },
126
+ {
127
+ "epoch": 0.505679012345679,
128
+ "eval_cos_loss": 0.10188191693003584,
129
+ "eval_loss": 0.3795151790467704,
130
+ "eval_mse_loss": 0.3693269865541923,
131
+ "eval_runtime": 3.8456,
132
+ "eval_samples_per_second": 680.77,
133
+ "eval_steps_per_second": 10.661,
134
+ "step": 1024
135
+ },
136
+ {
137
+ "epoch": 0.5688888888888889,
138
+ "grad_norm": 0.17722535133361816,
139
+ "learning_rate": 0.0006207818531897271,
140
+ "loss": 0.3856668770313263,
141
+ "step": 1152
142
+ },
143
+ {
144
+ "epoch": 0.6320987654320988,
145
+ "grad_norm": 0.20393630862236023,
146
+ "learning_rate": 0.0004890997654891032,
147
+ "loss": 0.37992340326309204,
148
+ "step": 1280
149
+ },
150
+ {
151
+ "epoch": 0.6320987654320988,
152
+ "eval_cos_loss": 0.10752386781500607,
153
+ "eval_loss": 0.3945070817703154,
154
+ "eval_mse_loss": 0.3837546953340856,
155
+ "step": 1280
156
+ },
157
+ {
158
+ "epoch": 0.6320987654320988,
159
+ "eval_cos_loss": 0.10752386781500607,
160
+ "eval_loss": 0.3945070817703154,
161
+ "eval_mse_loss": 0.3837546953340856,
162
+ "eval_runtime": 3.9318,
163
+ "eval_samples_per_second": 665.855,
164
+ "eval_steps_per_second": 10.428,
165
+ "step": 1280
166
+ },
167
+ {
168
+ "epoch": 0.6953086419753086,
169
+ "grad_norm": 0.22595147788524628,
170
+ "learning_rate": 0.00035818313279679524,
171
+ "loss": 0.3873279094696045,
172
+ "step": 1408
173
+ },
174
+ {
175
+ "epoch": 0.7585185185185185,
176
+ "grad_norm": 0.2019820213317871,
177
+ "learning_rate": 0.00023722540797531234,
178
+ "loss": 0.37948113679885864,
179
+ "step": 1536
180
+ },
181
+ {
182
+ "epoch": 0.7585185185185185,
183
+ "eval_cos_loss": 0.1014540351745559,
184
+ "eval_loss": 0.37390955628418343,
185
+ "eval_mse_loss": 0.36376415229425196,
186
+ "step": 1536
187
+ },
188
+ {
189
+ "epoch": 0.7585185185185185,
190
+ "eval_cos_loss": 0.1014540351745559,
191
+ "eval_loss": 0.37390955628418343,
192
+ "eval_mse_loss": 0.36376415229425196,
193
+ "eval_runtime": 3.9553,
194
+ "eval_samples_per_second": 661.902,
195
+ "eval_steps_per_second": 10.366,
196
+ "step": 1536
197
+ },
198
+ {
199
+ "epoch": 0.8217283950617283,
200
+ "grad_norm": 0.20358595252037048,
201
+ "learning_rate": 0.00013472069233656453,
202
+ "loss": 0.3810204267501831,
203
+ "step": 1664
204
+ },
205
+ {
206
+ "epoch": 0.8849382716049383,
207
+ "grad_norm": 0.2263447791337967,
208
+ "learning_rate": 5.786724825584927e-05,
209
+ "loss": 0.3751329481601715,
210
+ "step": 1792
211
+ },
212
+ {
213
+ "epoch": 0.8849382716049383,
214
+ "eval_cos_loss": 0.09955191503210765,
215
+ "eval_loss": 0.3695452562192591,
216
+ "eval_mse_loss": 0.35959006446163827,
217
+ "step": 1792
218
+ },
219
+ {
220
+ "epoch": 0.8849382716049383,
221
+ "eval_cos_loss": 0.09955191503210765,
222
+ "eval_loss": 0.3695452562192591,
223
+ "eval_mse_loss": 0.35959006446163827,
224
+ "eval_runtime": 3.8784,
225
+ "eval_samples_per_second": 675.023,
226
+ "eval_steps_per_second": 10.571,
227
+ "step": 1792
228
+ }
229
+ ],
230
+ "logging_steps": 128,
231
+ "max_steps": 2025,
232
+ "num_input_tokens_seen": 0,
233
+ "num_train_epochs": 1,
234
+ "save_steps": 256,
235
+ "stateful_callbacks": {
236
+ "TrainerControl": {
237
+ "args": {
238
+ "should_epoch_stop": false,
239
+ "should_evaluate": false,
240
+ "should_log": false,
241
+ "should_save": true,
242
+ "should_training_stop": false
243
+ },
244
+ "attributes": {}
245
+ }
246
+ },
247
+ "total_flos": 0.0,
248
+ "train_batch_size": 64,
249
+ "trial_name": null,
250
+ "trial_params": null
251
+ }
checkpoints-v3.0-discrete-conditional/checkpoint-1792/training_args.bin ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:c0839bffbc58eb6068cc228e4d756dbb22a9adf723766e40a7bc2a03aca92630
3
+ size 5137