CodeIsAbstract commited on
Commit
e242a73
·
verified ·
1 Parent(s): e8dc633

Training in progress, step 80, checkpoint

Browse files
last-checkpoint/model.safetensors CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:17fce54bd0a6cc40b60ba225aa1c0d6428967ac23278b1e4779f9ff86cc19f95
3
  size 847599616
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:000527a3a265b9e05cd020128ba800f14f377bfbabae4998412c2918195d8125
3
  size 847599616
last-checkpoint/optimizer.pt CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:06d5748edc7979e819f3b71a0a40dee945e7c26acf2012c6a5ec934764f9dcee
3
  size 350603
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:e6432fe547941a7690c2fe66075c977ac4220863b31602ffec25432621ebfa96
3
  size 350603
last-checkpoint/rng_state.pth CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:f891a168fb4edd3efbb37e4906a84228928d2ce90f434f192d8f2e669611925b
3
  size 14645
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:08f69188d3c3cb82763f1a7c417921df2b36ee8c259c8364d649bc865aa50546
3
  size 14645
last-checkpoint/scheduler.pt CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:1c2eb03e04e9ec3d534ee7aa67476af96452e64bad29591c419a0c652481ee2b
3
  size 1465
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:328cdb13c08312010f0f3f68164c591fc4e8d678a48048f3b4795580c806f456
3
  size 1465
last-checkpoint/trainer_state.json CHANGED
@@ -2,9 +2,9 @@
2
  "best_global_step": null,
3
  "best_metric": null,
4
  "best_model_checkpoint": null,
5
- "epoch": 0.3,
6
  "eval_steps": 20,
7
- "global_step": 60,
8
  "is_hyper_param_search": false,
9
  "is_local_process_zero": true,
10
  "is_world_process_zero": true,
@@ -119,6 +119,43 @@
119
  "eval_samples_per_second": 389.199,
120
  "eval_steps_per_second": 64.996,
121
  "step": 60
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
122
  }
123
  ],
124
  "logging_steps": 5,
 
2
  "best_global_step": null,
3
  "best_metric": null,
4
  "best_model_checkpoint": null,
5
+ "epoch": 0.4,
6
  "eval_steps": 20,
7
+ "global_step": 80,
8
  "is_hyper_param_search": false,
9
  "is_local_process_zero": true,
10
  "is_world_process_zero": true,
 
119
  "eval_samples_per_second": 389.199,
120
  "eval_steps_per_second": 64.996,
121
  "step": 60
122
+ },
123
+ {
124
+ "epoch": 0.325,
125
+ "grad_norm": 0.5018299221992493,
126
+ "learning_rate": 3.254352716947074e-06,
127
+ "loss": 21.052398681640625,
128
+ "step": 65
129
+ },
130
+ {
131
+ "epoch": 0.35,
132
+ "grad_norm": 0.5535529255867004,
133
+ "learning_rate": 3.1214301147033453e-06,
134
+ "loss": 20.81998291015625,
135
+ "step": 70
136
+ },
137
+ {
138
+ "epoch": 0.375,
139
+ "grad_norm": 0.6942564249038696,
140
+ "learning_rate": 2.9808470076610163e-06,
141
+ "loss": 20.625360107421876,
142
+ "step": 75
143
+ },
144
+ {
145
+ "epoch": 0.4,
146
+ "grad_norm": 0.6362656950950623,
147
+ "learning_rate": 2.833563720990581e-06,
148
+ "loss": 20.59354248046875,
149
+ "step": 80
150
+ },
151
+ {
152
+ "epoch": 0.4,
153
+ "eval_accuracy": 0.06626984126984127,
154
+ "eval_loss": 10.32943344116211,
155
+ "eval_runtime": 2.5422,
156
+ "eval_samples_per_second": 393.359,
157
+ "eval_steps_per_second": 65.691,
158
+ "step": 80
159
  }
160
  ],
161
  "logging_steps": 5,