CodeIsAbstract commited on
Commit
051a363
·
verified ·
1 Parent(s): b2428c6

Training in progress, step 500, checkpoint

Browse files
last-checkpoint/optimizer.pt CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:8dacb143c7ab743e9aaddb52ceaf8b2d3084857f91906714dacd8f4f10e36a82
3
  size 386379
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:bb43ce76c4f73c62e5a6e85da42fdc904f58fe828e868bbdf0be267f32e07824
3
  size 386379
last-checkpoint/pytorch_model.bin CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:a2c3217f16b577cba185ae98ad2a5674a8db2b9276059cf21350bdea694fad62
3
  size 1540661735
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:1312dd678cab7506a32c4aa5817acdf405183ef96aaa93d2a4596d6393378d5e
3
  size 1540661735
last-checkpoint/rng_state_0.pth ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:471c196d464571a2d3eaa8b56640d706baf43a5fa29db23527981ea674d1cc5d
3
+ size 14469
last-checkpoint/rng_state_1.pth ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:6c4d5d330fd2d21389f18d92d837b7b74326019eda8d0aeef699b67f0b194b16
3
+ size 14469
last-checkpoint/rng_state_2.pth ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:6f41ef2dc3a9c7dccaf66ef3850e86a97c631081c0fdfdaff5d6a0ce628b0f4f
3
+ size 14469
last-checkpoint/rng_state_3.pth ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:e510800460c42b7b67d24fb27b7099f5c726a948ffebcd7c17501379991ee2ac
3
+ size 14469
last-checkpoint/rng_state_4.pth ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:efbb381c554d799e91db094a8bca7f05b6f679e8066823bcdfc6ea2811eb3c3f
3
+ size 14469
last-checkpoint/rng_state_5.pth ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:6cd2f2645726a3a2f552a52307dc452892e105e7f362ac69985b42f39311f70b
3
+ size 14469
last-checkpoint/rng_state_6.pth ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:b974ebc6afa793677214cfcffe57d9f4d7c8e0bd2a082dbc6a3d57bc57e69ab3
3
+ size 14469
last-checkpoint/rng_state_7.pth ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:1df311cc38c26f5641e0477ca47e8af66bb548ffec021086203c4970526e3a77
3
+ size 14469
last-checkpoint/trainer_state.json CHANGED
@@ -6,87 +6,87 @@
6
  "eval_steps": 100,
7
  "global_step": 500,
8
  "is_hyper_param_search": false,
9
- "is_local_process_zero": true,
10
  "is_world_process_zero": true,
11
  "log_history": [
12
  {
13
  "epoch": 0.1,
14
- "grad_norm": 1.297243595123291,
15
  "learning_rate": 0.0003973800426880847,
16
- "loss": 9.179060668945313,
17
  "step": 100
18
  },
19
  {
20
  "epoch": 0.1,
21
- "eval_accuracy": 0.09053816046966733,
22
- "eval_loss": 8.474776268005371,
23
- "eval_runtime": 32.6103,
24
- "eval_samples_per_second": 30.665,
25
- "eval_steps_per_second": 30.665,
26
  "step": 100
27
  },
28
  {
29
  "epoch": 0.2,
30
- "grad_norm": 1.142166256904602,
31
  "learning_rate": 0.0003762085737488283,
32
- "loss": 8.30135498046875,
33
  "step": 200
34
  },
35
  {
36
  "epoch": 0.2,
37
- "eval_accuracy": 0.10549706457925637,
38
- "eval_loss": 8.138654708862305,
39
- "eval_runtime": 26.7248,
40
- "eval_samples_per_second": 37.418,
41
- "eval_steps_per_second": 37.418,
42
  "step": 200
43
  },
44
  {
45
  "epoch": 0.3,
46
- "grad_norm": 1.286571741104126,
47
  "learning_rate": 0.00033594217168615465,
48
- "loss": 7.987710571289062,
49
  "step": 300
50
  },
51
  {
52
  "epoch": 0.3,
53
- "eval_accuracy": 0.11159295499021527,
54
- "eval_loss": 7.991443157196045,
55
- "eval_runtime": 26.5785,
56
- "eval_samples_per_second": 37.624,
57
- "eval_steps_per_second": 37.624,
58
  "step": 300
59
  },
60
  {
61
  "epoch": 0.4,
62
- "grad_norm": 1.262372612953186,
63
  "learning_rate": 0.00028094432596115747,
64
- "loss": 7.810901489257812,
65
  "step": 400
66
  },
67
  {
68
  "epoch": 0.4,
69
- "eval_accuracy": 0.10483365949119373,
70
- "eval_loss": 7.9381818771362305,
71
- "eval_runtime": 26.6986,
72
- "eval_samples_per_second": 37.455,
73
- "eval_steps_per_second": 37.455,
74
  "step": 400
75
  },
76
  {
77
  "epoch": 0.5,
78
- "grad_norm": 1.2876827716827393,
79
  "learning_rate": 0.00021717490653764342,
80
- "loss": 7.900021362304687,
81
  "step": 500
82
  },
83
  {
84
  "epoch": 0.5,
85
- "eval_accuracy": 0.11435420743639922,
86
- "eval_loss": 7.851724624633789,
87
- "eval_runtime": 26.5522,
88
- "eval_samples_per_second": 37.662,
89
- "eval_steps_per_second": 37.662,
90
  "step": 500
91
  }
92
  ],
 
6
  "eval_steps": 100,
7
  "global_step": 500,
8
  "is_hyper_param_search": false,
9
+ "is_local_process_zero": false,
10
  "is_world_process_zero": true,
11
  "log_history": [
12
  {
13
  "epoch": 0.1,
14
+ "grad_norm": 11.13700008392334,
15
  "learning_rate": 0.0003973800426880847,
16
+ "loss": 66.094375,
17
  "step": 100
18
  },
19
  {
20
  "epoch": 0.1,
21
+ "eval_accuracy": 0.10251663405088063,
22
+ "eval_loss": 62.88532638549805,
23
+ "eval_runtime": 12.9078,
24
+ "eval_samples_per_second": 9.684,
25
+ "eval_steps_per_second": 1.24,
26
  "step": 100
27
  },
28
  {
29
  "epoch": 0.2,
30
+ "grad_norm": 6.741835117340088,
31
  "learning_rate": 0.0003762085737488283,
32
+ "loss": 62.0001123046875,
33
  "step": 200
34
  },
35
  {
36
  "epoch": 0.2,
37
+ "eval_accuracy": 0.11803913894324854,
38
+ "eval_loss": 61.526912689208984,
39
+ "eval_runtime": 8.6535,
40
+ "eval_samples_per_second": 14.445,
41
+ "eval_steps_per_second": 1.849,
42
  "step": 200
43
  },
44
  {
45
  "epoch": 0.3,
46
+ "grad_norm": 7.0108513832092285,
47
  "learning_rate": 0.00033594217168615465,
48
+ "loss": 61.543701171875,
49
  "step": 300
50
  },
51
  {
52
  "epoch": 0.3,
53
+ "eval_accuracy": 0.11293346379647749,
54
+ "eval_loss": 60.98686599731445,
55
+ "eval_runtime": 8.6635,
56
+ "eval_samples_per_second": 14.428,
57
+ "eval_steps_per_second": 1.847,
58
  "step": 300
59
  },
60
  {
61
  "epoch": 0.4,
62
+ "grad_norm": 10.79574203491211,
63
  "learning_rate": 0.00028094432596115747,
64
+ "loss": 61.318671875,
65
  "step": 400
66
  },
67
  {
68
  "epoch": 0.4,
69
+ "eval_accuracy": 0.1016477495107632,
70
+ "eval_loss": 61.48467254638672,
71
+ "eval_runtime": 8.6224,
72
+ "eval_samples_per_second": 14.497,
73
+ "eval_steps_per_second": 1.856,
74
  "step": 400
75
  },
76
  {
77
  "epoch": 0.5,
78
+ "grad_norm": 6.4634199142456055,
79
  "learning_rate": 0.00021717490653764342,
80
+ "loss": 60.952919921875,
81
  "step": 500
82
  },
83
  {
84
  "epoch": 0.5,
85
+ "eval_accuracy": 0.09600978473581213,
86
+ "eval_loss": 61.699729919433594,
87
+ "eval_runtime": 8.3835,
88
+ "eval_samples_per_second": 14.91,
89
+ "eval_steps_per_second": 1.909,
90
  "step": 500
91
  }
92
  ],
last-checkpoint/training_args.bin CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:b47eb6e798b2dfe4e0fdea550782a8eb56b1b579932ae1b65db9c8ecf145627d
3
- size 5329
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:7eaf4364d37f9f4ceb03f7b16a5643504bb95eb9da30e7cced827582fa3d3389
3
+ size 5265