CodeIsAbstract commited on
Commit
70a26f5
·
verified ·
1 Parent(s): e78276d

Training in progress, step 500, checkpoint

Browse files
last-checkpoint/optimizer.pt CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:98fd124bf42aea777816d09325e7ffdff5b493ffa0dd09d7c3a34559fbbc57a1
3
  size 386379
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:e5f8208969c787c86b244b9e9a71626f98e35ffdfeaecbcc5ef207a5ddc9659d
3
  size 386379
last-checkpoint/pytorch_model.bin CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:8db1924741cee0f05554aeca4688871e1e114cabeb2ea4420e919cde46a884c9
3
  size 1540661735
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:965dc697c3ab28072f197959f194ef0efcc91bb79803752fd97f500aa7e8a5df
3
  size 1540661735
last-checkpoint/trainer_state.json CHANGED
@@ -11,82 +11,82 @@
11
  "log_history": [
12
  {
13
  "epoch": 0.1,
14
- "grad_norm": 2.3951845169067383,
15
  "learning_rate": 0.0003973800426880847,
16
- "loss": 9.800797119140626,
17
  "step": 100
18
  },
19
  {
20
  "epoch": 0.1,
21
- "eval_accuracy": 0.09641291585127201,
22
- "eval_loss": 9.091407775878906,
23
- "eval_runtime": 39.6773,
24
- "eval_samples_per_second": 25.203,
25
- "eval_steps_per_second": 25.203,
26
  "step": 100
27
  },
28
  {
29
  "epoch": 0.2,
30
- "grad_norm": 2.5533459186553955,
31
  "learning_rate": 0.0003762085737488283,
32
- "loss": 8.910618286132813,
33
  "step": 200
34
  },
35
  {
36
  "epoch": 0.2,
37
- "eval_accuracy": 0.09622896281800392,
38
- "eval_loss": 8.752147674560547,
39
- "eval_runtime": 33.1575,
40
- "eval_samples_per_second": 30.159,
41
- "eval_steps_per_second": 30.159,
42
  "step": 200
43
  },
44
  {
45
  "epoch": 0.3,
46
- "grad_norm": 2.921639919281006,
47
  "learning_rate": 0.00033594217168615465,
48
- "loss": 8.53966796875,
49
  "step": 300
50
  },
51
  {
52
  "epoch": 0.3,
53
- "eval_accuracy": 0.0970450097847358,
54
- "eval_loss": 8.573400497436523,
55
- "eval_runtime": 31.8348,
56
- "eval_samples_per_second": 31.412,
57
- "eval_steps_per_second": 31.412,
58
  "step": 300
59
  },
60
  {
61
  "epoch": 0.4,
62
- "grad_norm": 2.1571640968322754,
63
  "learning_rate": 0.00028094432596115747,
64
- "loss": 8.399310302734374,
65
  "step": 400
66
  },
67
  {
68
  "epoch": 0.4,
69
- "eval_accuracy": 0.10219373776908024,
70
- "eval_loss": 8.501660346984863,
71
- "eval_runtime": 32.4742,
72
- "eval_samples_per_second": 30.794,
73
- "eval_steps_per_second": 30.794,
74
  "step": 400
75
  },
76
  {
77
  "epoch": 0.5,
78
- "grad_norm": 2.42037034034729,
79
  "learning_rate": 0.00021717490653764342,
80
- "loss": 8.401516723632813,
81
  "step": 500
82
  },
83
  {
84
  "epoch": 0.5,
85
- "eval_accuracy": 0.10070058708414872,
86
- "eval_loss": 8.452370643615723,
87
- "eval_runtime": 32.4058,
88
- "eval_samples_per_second": 30.859,
89
- "eval_steps_per_second": 30.859,
90
  "step": 500
91
  }
92
  ],
 
11
  "log_history": [
12
  {
13
  "epoch": 0.1,
14
+ "grad_norm": 2.191904306411743,
15
  "learning_rate": 0.0003973800426880847,
16
+ "loss": 9.861549072265625,
17
  "step": 100
18
  },
19
  {
20
  "epoch": 0.1,
21
+ "eval_accuracy": 0.09354794520547945,
22
+ "eval_loss": 9.128084182739258,
23
+ "eval_runtime": 32.2982,
24
+ "eval_samples_per_second": 30.962,
25
+ "eval_steps_per_second": 30.962,
26
  "step": 100
27
  },
28
  {
29
  "epoch": 0.2,
30
+ "grad_norm": 1.9173266887664795,
31
  "learning_rate": 0.0003762085737488283,
32
+ "loss": 8.851971435546876,
33
  "step": 200
34
  },
35
  {
36
  "epoch": 0.2,
37
+ "eval_accuracy": 0.10289236790606654,
38
+ "eval_loss": 8.73751163482666,
39
+ "eval_runtime": 26.6022,
40
+ "eval_samples_per_second": 37.591,
41
+ "eval_steps_per_second": 37.591,
42
  "step": 200
43
  },
44
  {
45
  "epoch": 0.3,
46
+ "grad_norm": 2.392211437225342,
47
  "learning_rate": 0.00033594217168615465,
48
+ "loss": 8.558801879882813,
49
  "step": 300
50
  },
51
  {
52
  "epoch": 0.3,
53
+ "eval_accuracy": 0.10008610567514677,
54
+ "eval_loss": 8.624308586120605,
55
+ "eval_runtime": 26.8044,
56
+ "eval_samples_per_second": 37.307,
57
+ "eval_steps_per_second": 37.307,
58
  "step": 300
59
  },
60
  {
61
  "epoch": 0.4,
62
+ "grad_norm": 3.655690908432007,
63
  "learning_rate": 0.00028094432596115747,
64
+ "loss": 8.405433349609375,
65
  "step": 400
66
  },
67
  {
68
  "epoch": 0.4,
69
+ "eval_accuracy": 0.10092172211350293,
70
+ "eval_loss": 8.508211135864258,
71
+ "eval_runtime": 26.8389,
72
+ "eval_samples_per_second": 37.259,
73
+ "eval_steps_per_second": 37.259,
74
  "step": 400
75
  },
76
  {
77
  "epoch": 0.5,
78
+ "grad_norm": 8.362494468688965,
79
  "learning_rate": 0.00021717490653764342,
80
+ "loss": 8.498648681640624,
81
  "step": 500
82
  },
83
  {
84
  "epoch": 0.5,
85
+ "eval_accuracy": 0.07594911937377691,
86
+ "eval_loss": 9.306892395019531,
87
+ "eval_runtime": 26.9571,
88
+ "eval_samples_per_second": 37.096,
89
+ "eval_steps_per_second": 37.096,
90
  "step": 500
91
  }
92
  ],
last-checkpoint/training_args.bin CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:8f0098da0a3455c5880575320ae51291e35e8d0961f89a145f0520da235cee9b
3
  size 5329
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:b47eb6e798b2dfe4e0fdea550782a8eb56b1b579932ae1b65db9c8ecf145627d
3
  size 5329