CodeIsAbstract commited on
Commit
e5ef489
·
verified ·
1 Parent(s): ed9a9a0

Training in progress, step 20, checkpoint

Browse files
last-checkpoint/model.safetensors CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:74482d56d36e465549c20be2150fd2ef4b59d83accfc45b098eea9ef8a38e044
3
  size 847599616
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:62ea57d95f189e14afef9705561103ee91a6e9ba01e5482796d19fc2459d71e2
3
  size 847599616
last-checkpoint/optimizer.pt CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:23d680fefa7597e1b297207c4260840a411a6cf7b773c449f6e2ca2c5e13fb07
3
  size 350603
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:4b13a9b1047bb4b6f08d1c4cdf00a090f9620623f2a2765a0675250b296d77fd
3
  size 350603
last-checkpoint/trainer_state.json CHANGED
@@ -11,39 +11,39 @@
11
  "log_history": [
12
  {
13
  "epoch": 0.025,
14
- "grad_norm": 0.2091294378042221,
15
  "learning_rate": 1.6e-06,
16
- "loss": 21.9791015625,
17
  "step": 5
18
  },
19
  {
20
  "epoch": 0.05,
21
- "grad_norm": 0.21135330200195312,
22
  "learning_rate": 3.6e-06,
23
- "loss": 21.991165161132812,
24
  "step": 10
25
  },
26
  {
27
  "epoch": 0.075,
28
- "grad_norm": 0.2114953100681305,
29
  "learning_rate": 3.995627254437549e-06,
30
- "loss": 21.989112854003906,
31
  "step": 15
32
  },
33
  {
34
  "epoch": 0.1,
35
- "grad_norm": 0.1982107013463974,
36
  "learning_rate": 3.9778957412029366e-06,
37
- "loss": 21.98875274658203,
38
  "step": 20
39
  },
40
  {
41
  "epoch": 0.1,
42
- "eval_accuracy": 1.221001221001221e-05,
43
- "eval_loss": 10.98886489868164,
44
- "eval_runtime": 91.9166,
45
- "eval_samples_per_second": 10.879,
46
- "eval_steps_per_second": 1.817,
47
  "step": 20
48
  }
49
  ],
 
11
  "log_history": [
12
  {
13
  "epoch": 0.025,
14
+ "grad_norm": 0.1988103836774826,
15
  "learning_rate": 1.6e-06,
16
+ "loss": 21.93964385986328,
17
  "step": 5
18
  },
19
  {
20
  "epoch": 0.05,
21
+ "grad_norm": 0.19530963897705078,
22
  "learning_rate": 3.6e-06,
23
+ "loss": 21.938941955566406,
24
  "step": 10
25
  },
26
  {
27
  "epoch": 0.075,
28
+ "grad_norm": 0.20022961497306824,
29
  "learning_rate": 3.995627254437549e-06,
30
+ "loss": 21.935198974609374,
31
  "step": 15
32
  },
33
  {
34
  "epoch": 0.1,
35
+ "grad_norm": 0.18916556239128113,
36
  "learning_rate": 3.9778957412029366e-06,
37
+ "loss": 21.938011169433594,
38
  "step": 20
39
  },
40
  {
41
  "epoch": 0.1,
42
+ "eval_accuracy": 1.3431013431013431e-05,
43
+ "eval_loss": 10.96605396270752,
44
+ "eval_runtime": 91.788,
45
+ "eval_samples_per_second": 10.895,
46
+ "eval_steps_per_second": 1.819,
47
  "step": 20
48
  }
49
  ],