CodeIsAbstract commited on
Commit
a4efd1e
·
verified ·
1 Parent(s): d8611c0

Training in progress, step 80, checkpoint

Browse files
last-checkpoint/model.safetensors CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:8fbc25b315eaec6fdfa5a96894be799d4505aeaa0569efe9adef0b9c9c0e39f4
3
  size 847599616
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:8b84975742968de29fcc37417fd70fd74f60f37cd15555f7babcb1cdef75951e
3
  size 847599616
last-checkpoint/optimizer.pt CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:3fa7c0721a4a3d85b588484718933d2b751de2198ec9cfb9e99b53e008d4e3d5
3
  size 350603
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:c2f719b4df5d66bc5bd871112ccc5eb12d3fbfde0f855e6872e7a7160b2634b9
3
  size 350603
last-checkpoint/rng_state.pth CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:f891a168fb4edd3efbb37e4906a84228928d2ce90f434f192d8f2e669611925b
3
  size 14645
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:08f69188d3c3cb82763f1a7c417921df2b36ee8c259c8364d649bc865aa50546
3
  size 14645
last-checkpoint/scheduler.pt CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:1c2eb03e04e9ec3d534ee7aa67476af96452e64bad29591c419a0c652481ee2b
3
  size 1465
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:328cdb13c08312010f0f3f68164c591fc4e8d678a48048f3b4795580c806f456
3
  size 1465
last-checkpoint/trainer_state.json CHANGED
@@ -2,9 +2,9 @@
2
  "best_global_step": null,
3
  "best_metric": null,
4
  "best_model_checkpoint": null,
5
- "epoch": 0.3,
6
  "eval_steps": 20,
7
- "global_step": 60,
8
  "is_hyper_param_search": false,
9
  "is_local_process_zero": true,
10
  "is_world_process_zero": true,
@@ -119,6 +119,43 @@
119
  "eval_samples_per_second": 401.523,
120
  "eval_steps_per_second": 67.054,
121
  "step": 60
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
122
  }
123
  ],
124
  "logging_steps": 5,
 
2
  "best_global_step": null,
3
  "best_metric": null,
4
  "best_model_checkpoint": null,
5
+ "epoch": 0.4,
6
  "eval_steps": 20,
7
+ "global_step": 80,
8
  "is_hyper_param_search": false,
9
  "is_local_process_zero": true,
10
  "is_world_process_zero": true,
 
119
  "eval_samples_per_second": 401.523,
120
  "eval_steps_per_second": 67.054,
121
  "step": 60
122
+ },
123
+ {
124
+ "epoch": 0.325,
125
+ "grad_norm": 0.26950836181640625,
126
+ "learning_rate": 3.254352716947074e-06,
127
+ "loss": 22.037962341308592,
128
+ "step": 65
129
+ },
130
+ {
131
+ "epoch": 0.35,
132
+ "grad_norm": 0.25924476981163025,
133
+ "learning_rate": 3.1214301147033453e-06,
134
+ "loss": 22.014053344726562,
135
+ "step": 70
136
+ },
137
+ {
138
+ "epoch": 0.375,
139
+ "grad_norm": 0.31555065512657166,
140
+ "learning_rate": 2.9808470076610163e-06,
141
+ "loss": 21.961640930175783,
142
+ "step": 75
143
+ },
144
+ {
145
+ "epoch": 0.4,
146
+ "grad_norm": 0.2712528705596924,
147
+ "learning_rate": 2.833563720990581e-06,
148
+ "loss": 21.988558959960937,
149
+ "step": 80
150
+ },
151
+ {
152
+ "epoch": 0.4,
153
+ "eval_accuracy": 3.1746031746031745e-05,
154
+ "eval_loss": 11.01443099975586,
155
+ "eval_runtime": 2.612,
156
+ "eval_samples_per_second": 382.842,
157
+ "eval_steps_per_second": 63.935,
158
+ "step": 80
159
  }
160
  ],
161
  "logging_steps": 5,