CodeIsAbstract commited on
Commit
c0d7524
·
verified ·
1 Parent(s): b99c329

Training in progress, step 100, checkpoint

Browse files
last-checkpoint/model.safetensors CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:9960ab9430f87386052f6f688f2b0ef29d3ef0703741a0a04e86c27a4c613458
3
  size 847599616
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:77c00e25cdc0159a953b89e31ee75fb9f4f04268f163b9148e898a67d1ad3fe2
3
  size 847599616
last-checkpoint/optimizer.pt CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:a4aa5f290eab6ad8c50e2e0e5ff48e2e9b3fda37a1cd0f19a806696d5a692747
3
  size 350603
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:75ec1a2907af41bcd49fe20d0461096a9770864c1c9061542df1c79e4a507473
3
  size 350603
last-checkpoint/rng_state.pth CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:3b6e88be627a1cf1c12456905775b93be8b9689df366bf1a41cd17e0652aa2d6
3
  size 14645
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:96a091ed1da45753ae33db029e7b844183915b5f9838c10180e2883aeefdf91d
3
  size 14645
last-checkpoint/scheduler.pt CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:1c2eb03e04e9ec3d534ee7aa67476af96452e64bad29591c419a0c652481ee2b
3
  size 1465
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:7815f17b7bd928390d8a057e2a19101b8f840de5d7f859603bfc35694ee86edf
3
  size 1465
last-checkpoint/trainer_state.json CHANGED
@@ -2,9 +2,9 @@
2
  "best_global_step": null,
3
  "best_metric": null,
4
  "best_model_checkpoint": null,
5
- "epoch": 0.3,
6
  "eval_steps": 20,
7
- "global_step": 60,
8
  "is_hyper_param_search": false,
9
  "is_local_process_zero": true,
10
  "is_world_process_zero": true,
@@ -119,6 +119,80 @@
119
  "eval_samples_per_second": 389.653,
120
  "eval_steps_per_second": 65.072,
121
  "step": 60
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
122
  }
123
  ],
124
  "logging_steps": 5,
 
2
  "best_global_step": null,
3
  "best_metric": null,
4
  "best_model_checkpoint": null,
5
+ "epoch": 0.5,
6
  "eval_steps": 20,
7
+ "global_step": 100,
8
  "is_hyper_param_search": false,
9
  "is_local_process_zero": true,
10
  "is_world_process_zero": true,
 
119
  "eval_samples_per_second": 389.653,
120
  "eval_steps_per_second": 65.072,
121
  "step": 60
122
+ },
123
+ {
124
+ "epoch": 0.325,
125
+ "grad_norm": 0.3432864248752594,
126
+ "learning_rate": 3.254352716947074e-06,
127
+ "loss": 10.377902221679687,
128
+ "step": 65
129
+ },
130
+ {
131
+ "epoch": 0.35,
132
+ "grad_norm": 0.4390406012535095,
133
+ "learning_rate": 3.1214301147033453e-06,
134
+ "loss": 10.318882751464844,
135
+ "step": 70
136
+ },
137
+ {
138
+ "epoch": 0.375,
139
+ "grad_norm": 0.39456093311309814,
140
+ "learning_rate": 2.9808470076610163e-06,
141
+ "loss": 10.358218383789062,
142
+ "step": 75
143
+ },
144
+ {
145
+ "epoch": 0.4,
146
+ "grad_norm": 0.3331209719181061,
147
+ "learning_rate": 2.833563720990581e-06,
148
+ "loss": 10.379315185546876,
149
+ "step": 80
150
+ },
151
+ {
152
+ "epoch": 0.4,
153
+ "eval_accuracy": 0.05953968253968254,
154
+ "eval_loss": 10.34837818145752,
155
+ "eval_runtime": 2.5456,
156
+ "eval_samples_per_second": 392.837,
157
+ "eval_steps_per_second": 65.604,
158
+ "step": 80
159
+ },
160
+ {
161
+ "epoch": 0.425,
162
+ "grad_norm": 0.394307941198349,
163
+ "learning_rate": 2.680586348883286e-06,
164
+ "loss": 10.364244842529297,
165
+ "step": 85
166
+ },
167
+ {
168
+ "epoch": 0.45,
169
+ "grad_norm": 0.6861296892166138,
170
+ "learning_rate": 2.5229598819076393e-06,
171
+ "loss": 10.229421997070313,
172
+ "step": 90
173
+ },
174
+ {
175
+ "epoch": 0.475,
176
+ "grad_norm": 0.39627140760421753,
177
+ "learning_rate": 2.36176106866422e-06,
178
+ "loss": 10.251496124267579,
179
+ "step": 95
180
+ },
181
+ {
182
+ "epoch": 0.5,
183
+ "grad_norm": 0.48685982823371887,
184
+ "learning_rate": 2.198091060500926e-06,
185
+ "loss": 10.250384521484374,
186
+ "step": 100
187
+ },
188
+ {
189
+ "epoch": 0.5,
190
+ "eval_accuracy": 0.06242857142857143,
191
+ "eval_loss": 10.20656967163086,
192
+ "eval_runtime": 2.4131,
193
+ "eval_samples_per_second": 414.406,
194
+ "eval_steps_per_second": 69.206,
195
+ "step": 100
196
  }
197
  ],
198
  "logging_steps": 5,