CodeIsAbstract commited on
Commit
0abf5ba
·
verified ·
1 Parent(s): f31ebd6

Training in progress, step 1000, checkpoint

Browse files
last-checkpoint/optimizer.pt CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:bb43ce76c4f73c62e5a6e85da42fdc904f58fe828e868bbdf0be267f32e07824
3
  size 386379
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:cd588dbc728c53e33444470b35f0ec00b32b282a4a741258c3b25ac3abed7937
3
  size 386379
last-checkpoint/pytorch_model.bin CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:1312dd678cab7506a32c4aa5817acdf405183ef96aaa93d2a4596d6393378d5e
3
  size 1540661735
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:2aad02749c94610ad407ffb13a3c15d2904a2ee0a9ac6a2f501b604d4fadc0ef
3
  size 1540661735
last-checkpoint/rng_state.pth CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:5fb8116194227284009af0f32eb6c9bf39b120912678b54e07fcb6539f29b5b2
3
  size 14455
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:b815622b7dfb0359193f2c3e6cdc190a4c07e6c28cfbaf526d6da260173bd4a4
3
  size 14455
last-checkpoint/scheduler.pt CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:b3161ebc22e167d90d7ee5cc1bfde367c6af5f0b04db44c912617eb26a593223
3
  size 1465
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:94b7b1a014f5dad743694fda5858015bfe3bd4c82eac608d649238b91858a560
3
  size 1465
last-checkpoint/trainer_state.json CHANGED
@@ -2,92 +2,172 @@
2
  "best_global_step": null,
3
  "best_metric": null,
4
  "best_model_checkpoint": null,
5
- "epoch": 0.5,
6
  "eval_steps": 100,
7
- "global_step": 500,
8
  "is_hyper_param_search": false,
9
- "is_local_process_zero": false,
10
  "is_world_process_zero": true,
11
  "log_history": [
12
  {
13
  "epoch": 0.1,
14
- "grad_norm": 11.13700008392334,
15
  "learning_rate": 0.0003973800426880847,
16
- "loss": 66.094375,
17
  "step": 100
18
  },
19
  {
20
  "epoch": 0.1,
21
- "eval_accuracy": 0.10251663405088063,
22
- "eval_loss": 62.88532638549805,
23
- "eval_runtime": 12.9078,
24
- "eval_samples_per_second": 9.684,
25
- "eval_steps_per_second": 1.24,
26
  "step": 100
27
  },
28
  {
29
  "epoch": 0.2,
30
- "grad_norm": 6.741835117340088,
31
  "learning_rate": 0.0003762085737488283,
32
- "loss": 62.0001123046875,
33
  "step": 200
34
  },
35
  {
36
  "epoch": 0.2,
37
- "eval_accuracy": 0.11803913894324854,
38
- "eval_loss": 61.526912689208984,
39
- "eval_runtime": 8.6535,
40
- "eval_samples_per_second": 14.445,
41
- "eval_steps_per_second": 1.849,
42
  "step": 200
43
  },
44
  {
45
  "epoch": 0.3,
46
- "grad_norm": 7.0108513832092285,
47
  "learning_rate": 0.00033594217168615465,
48
- "loss": 61.543701171875,
49
  "step": 300
50
  },
51
  {
52
  "epoch": 0.3,
53
- "eval_accuracy": 0.11293346379647749,
54
- "eval_loss": 60.98686599731445,
55
- "eval_runtime": 8.6635,
56
- "eval_samples_per_second": 14.428,
57
- "eval_steps_per_second": 1.847,
58
  "step": 300
59
  },
60
  {
61
  "epoch": 0.4,
62
- "grad_norm": 10.79574203491211,
63
  "learning_rate": 0.00028094432596115747,
64
- "loss": 61.318671875,
65
  "step": 400
66
  },
67
  {
68
  "epoch": 0.4,
69
- "eval_accuracy": 0.1016477495107632,
70
- "eval_loss": 61.48467254638672,
71
- "eval_runtime": 8.6224,
72
- "eval_samples_per_second": 14.497,
73
- "eval_steps_per_second": 1.856,
74
  "step": 400
75
  },
76
  {
77
  "epoch": 0.5,
78
- "grad_norm": 6.4634199142456055,
79
  "learning_rate": 0.00021717490653764342,
80
- "loss": 60.952919921875,
81
  "step": 500
82
  },
83
  {
84
  "epoch": 0.5,
85
- "eval_accuracy": 0.09600978473581213,
86
- "eval_loss": 61.699729919433594,
87
- "eval_runtime": 8.3835,
88
- "eval_samples_per_second": 14.91,
89
- "eval_steps_per_second": 1.909,
90
  "step": 500
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
91
  }
92
  ],
93
  "logging_steps": 100,
@@ -102,7 +182,7 @@
102
  "should_evaluate": false,
103
  "should_log": false,
104
  "should_save": true,
105
- "should_training_stop": false
106
  },
107
  "attributes": {}
108
  }
 
2
  "best_global_step": null,
3
  "best_metric": null,
4
  "best_model_checkpoint": null,
5
+ "epoch": 1.0,
6
  "eval_steps": 100,
7
+ "global_step": 1000,
8
  "is_hyper_param_search": false,
9
+ "is_local_process_zero": true,
10
  "is_world_process_zero": true,
11
  "log_history": [
12
  {
13
  "epoch": 0.1,
14
+ "grad_norm": 1.297243595123291,
15
  "learning_rate": 0.0003973800426880847,
16
+ "loss": 9.179060668945313,
17
  "step": 100
18
  },
19
  {
20
  "epoch": 0.1,
21
+ "eval_accuracy": 0.09053816046966733,
22
+ "eval_loss": 8.474776268005371,
23
+ "eval_runtime": 32.6103,
24
+ "eval_samples_per_second": 30.665,
25
+ "eval_steps_per_second": 30.665,
26
  "step": 100
27
  },
28
  {
29
  "epoch": 0.2,
30
+ "grad_norm": 1.142166256904602,
31
  "learning_rate": 0.0003762085737488283,
32
+ "loss": 8.30135498046875,
33
  "step": 200
34
  },
35
  {
36
  "epoch": 0.2,
37
+ "eval_accuracy": 0.10549706457925637,
38
+ "eval_loss": 8.138654708862305,
39
+ "eval_runtime": 26.7248,
40
+ "eval_samples_per_second": 37.418,
41
+ "eval_steps_per_second": 37.418,
42
  "step": 200
43
  },
44
  {
45
  "epoch": 0.3,
46
+ "grad_norm": 1.286571741104126,
47
  "learning_rate": 0.00033594217168615465,
48
+ "loss": 7.987710571289062,
49
  "step": 300
50
  },
51
  {
52
  "epoch": 0.3,
53
+ "eval_accuracy": 0.11159295499021527,
54
+ "eval_loss": 7.991443157196045,
55
+ "eval_runtime": 26.5785,
56
+ "eval_samples_per_second": 37.624,
57
+ "eval_steps_per_second": 37.624,
58
  "step": 300
59
  },
60
  {
61
  "epoch": 0.4,
62
+ "grad_norm": 1.262372612953186,
63
  "learning_rate": 0.00028094432596115747,
64
+ "loss": 7.810901489257812,
65
  "step": 400
66
  },
67
  {
68
  "epoch": 0.4,
69
+ "eval_accuracy": 0.10483365949119373,
70
+ "eval_loss": 7.9381818771362305,
71
+ "eval_runtime": 26.6986,
72
+ "eval_samples_per_second": 37.455,
73
+ "eval_steps_per_second": 37.455,
74
  "step": 400
75
  },
76
  {
77
  "epoch": 0.5,
78
+ "grad_norm": 1.2876827716827393,
79
  "learning_rate": 0.00021717490653764342,
80
+ "loss": 7.900021362304687,
81
  "step": 500
82
  },
83
  {
84
  "epoch": 0.5,
85
+ "eval_accuracy": 0.11435420743639922,
86
+ "eval_loss": 7.851724624633789,
87
+ "eval_runtime": 26.5522,
88
+ "eval_samples_per_second": 37.662,
89
+ "eval_steps_per_second": 37.662,
90
  "step": 500
91
+ },
92
+ {
93
+ "epoch": 0.6,
94
+ "grad_norm": 1.2628377676010132,
95
+ "learning_rate": 0.00015154431949464275,
96
+ "loss": 7.744283447265625,
97
+ "step": 600
98
+ },
99
+ {
100
+ "epoch": 0.6,
101
+ "eval_accuracy": 0.1190665362035225,
102
+ "eval_loss": 7.8012566566467285,
103
+ "eval_runtime": 27.3957,
104
+ "eval_samples_per_second": 36.502,
105
+ "eval_steps_per_second": 36.502,
106
+ "step": 600
107
+ },
108
+ {
109
+ "epoch": 0.7,
110
+ "grad_norm": 1.3543407917022705,
111
+ "learning_rate": 9.11646573017482e-05,
112
+ "loss": 7.696810302734375,
113
+ "step": 700
114
+ },
115
+ {
116
+ "epoch": 0.7,
117
+ "eval_accuracy": 0.12185714285714286,
118
+ "eval_loss": 7.775871276855469,
119
+ "eval_runtime": 26.9132,
120
+ "eval_samples_per_second": 37.157,
121
+ "eval_steps_per_second": 37.157,
122
+ "step": 700
123
+ },
124
+ {
125
+ "epoch": 0.8,
126
+ "grad_norm": 1.2917762994766235,
127
+ "learning_rate": 4.2578993244549506e-05,
128
+ "loss": 7.771747436523437,
129
+ "step": 800
130
+ },
131
+ {
132
+ "epoch": 0.8,
133
+ "eval_accuracy": 0.12456751467710372,
134
+ "eval_loss": 7.751345157623291,
135
+ "eval_runtime": 26.6293,
136
+ "eval_samples_per_second": 37.553,
137
+ "eval_steps_per_second": 37.553,
138
+ "step": 800
139
+ },
140
+ {
141
+ "epoch": 0.9,
142
+ "grad_norm": 1.3219099044799805,
143
+ "learning_rate": 1.1052337907897503e-05,
144
+ "loss": 7.84291015625,
145
+ "step": 900
146
+ },
147
+ {
148
+ "epoch": 0.9,
149
+ "eval_accuracy": 0.1239921722113503,
150
+ "eval_loss": 7.749647617340088,
151
+ "eval_runtime": 26.5278,
152
+ "eval_samples_per_second": 37.696,
153
+ "eval_steps_per_second": 37.696,
154
+ "step": 900
155
+ },
156
+ {
157
+ "epoch": 1.0,
158
+ "grad_norm": 1.334007978439331,
159
+ "learning_rate": 1.093583978573065e-09,
160
+ "loss": 7.778873291015625,
161
+ "step": 1000
162
+ },
163
+ {
164
+ "epoch": 1.0,
165
+ "eval_accuracy": 0.12396868884540117,
166
+ "eval_loss": 7.747113227844238,
167
+ "eval_runtime": 26.6654,
168
+ "eval_samples_per_second": 37.502,
169
+ "eval_steps_per_second": 37.502,
170
+ "step": 1000
171
  }
172
  ],
173
  "logging_steps": 100,
 
182
  "should_evaluate": false,
183
  "should_log": false,
184
  "should_save": true,
185
+ "should_training_stop": true
186
  },
187
  "attributes": {}
188
  }
last-checkpoint/training_args.bin CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:7eaf4364d37f9f4ceb03f7b16a5643504bb95eb9da30e7cced827582fa3d3389
3
- size 5265
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:b47eb6e798b2dfe4e0fdea550782a8eb56b1b579932ae1b65db9c8ecf145627d
3
+ size 5329