CodeIsAbstract commited on
Commit
e548528
·
verified ·
1 Parent(s): 23481c5

Training in progress, step 1000, checkpoint

Browse files
last-checkpoint/optimizer.pt CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:cd588dbc728c53e33444470b35f0ec00b32b282a4a741258c3b25ac3abed7937
3
  size 386379
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:2aad20074673be565196c2d84a37e45794bf985e8e924217ecf9324b6beafe71
3
  size 386379
last-checkpoint/pytorch_model.bin CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:2aad02749c94610ad407ffb13a3c15d2904a2ee0a9ac6a2f501b604d4fadc0ef
3
  size 1540661735
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:2dba33db04b589dba3d8b7f81fc17b5f2c4b85c99cc07e01060cf64fe30716a8
3
  size 1540661735
last-checkpoint/rng_state_0.pth CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:471c196d464571a2d3eaa8b56640d706baf43a5fa29db23527981ea674d1cc5d
3
  size 14469
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:22df2bd0d59061a382c04efe9789950f253cd4e31ab17e2059fa4c27cc4a6efa
3
  size 14469
last-checkpoint/rng_state_1.pth CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:6c4d5d330fd2d21389f18d92d837b7b74326019eda8d0aeef699b67f0b194b16
3
  size 14469
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:5840394b2337e599c4aa005d8e914e87413a0ba6b6dc9fc0e6ef11ae5136e4b7
3
  size 14469
last-checkpoint/rng_state_2.pth CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:6f41ef2dc3a9c7dccaf66ef3850e86a97c631081c0fdfdaff5d6a0ce628b0f4f
3
  size 14469
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:b407220d2babdb8285fdb646664c7e9828e3b6748cb46222c7a0af7e23eeea38
3
  size 14469
last-checkpoint/rng_state_3.pth CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:e510800460c42b7b67d24fb27b7099f5c726a948ffebcd7c17501379991ee2ac
3
  size 14469
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:89de852af1b3140eaacd19d758de06a7391d2843e66525fb5f4a916e1aaa0844
3
  size 14469
last-checkpoint/rng_state_4.pth CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:efbb381c554d799e91db094a8bca7f05b6f679e8066823bcdfc6ea2811eb3c3f
3
  size 14469
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:7035846fe01e1add8b5347f2ac5e39db23b141016ab67fbf3c73bc134ed727a9
3
  size 14469
last-checkpoint/rng_state_5.pth CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:6cd2f2645726a3a2f552a52307dc452892e105e7f362ac69985b42f39311f70b
3
  size 14469
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:b6a21cff1db5937910f9ed43a94ae111bbf1146c9e9881b7d0eb53eb4beac8bd
3
  size 14469
last-checkpoint/rng_state_6.pth CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:b974ebc6afa793677214cfcffe57d9f4d7c8e0bd2a082dbc6a3d57bc57e69ab3
3
  size 14469
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:98920b86b1203f91d07132a60121cf9c75c29955c2498a35dcadcff8b0ec4dd8
3
  size 14469
last-checkpoint/rng_state_7.pth CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:1df311cc38c26f5641e0477ca47e8af66bb548ffec021086203c4970526e3a77
3
  size 14469
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:57fce693c5b4d0d80e0251092011493286bfb528b7f1955388583bda91701152
3
  size 14469
last-checkpoint/trainer_state.json CHANGED
@@ -6,167 +6,167 @@
6
  "eval_steps": 100,
7
  "global_step": 1000,
8
  "is_hyper_param_search": false,
9
- "is_local_process_zero": true,
10
  "is_world_process_zero": true,
11
  "log_history": [
12
  {
13
  "epoch": 0.1,
14
- "grad_norm": 1.297243595123291,
15
  "learning_rate": 0.0003973800426880847,
16
- "loss": 9.179060668945313,
17
  "step": 100
18
  },
19
  {
20
  "epoch": 0.1,
21
- "eval_accuracy": 0.09053816046966733,
22
- "eval_loss": 8.474776268005371,
23
- "eval_runtime": 32.6103,
24
- "eval_samples_per_second": 30.665,
25
- "eval_steps_per_second": 30.665,
26
  "step": 100
27
  },
28
  {
29
  "epoch": 0.2,
30
- "grad_norm": 1.142166256904602,
31
  "learning_rate": 0.0003762085737488283,
32
- "loss": 8.30135498046875,
33
  "step": 200
34
  },
35
  {
36
  "epoch": 0.2,
37
- "eval_accuracy": 0.10549706457925637,
38
- "eval_loss": 8.138654708862305,
39
- "eval_runtime": 26.7248,
40
- "eval_samples_per_second": 37.418,
41
- "eval_steps_per_second": 37.418,
42
  "step": 200
43
  },
44
  {
45
  "epoch": 0.3,
46
- "grad_norm": 1.286571741104126,
47
  "learning_rate": 0.00033594217168615465,
48
- "loss": 7.987710571289062,
49
  "step": 300
50
  },
51
  {
52
  "epoch": 0.3,
53
- "eval_accuracy": 0.11159295499021527,
54
- "eval_loss": 7.991443157196045,
55
- "eval_runtime": 26.5785,
56
- "eval_samples_per_second": 37.624,
57
- "eval_steps_per_second": 37.624,
58
  "step": 300
59
  },
60
  {
61
  "epoch": 0.4,
62
- "grad_norm": 1.262372612953186,
63
  "learning_rate": 0.00028094432596115747,
64
- "loss": 7.810901489257812,
65
  "step": 400
66
  },
67
  {
68
  "epoch": 0.4,
69
- "eval_accuracy": 0.10483365949119373,
70
- "eval_loss": 7.9381818771362305,
71
- "eval_runtime": 26.6986,
72
- "eval_samples_per_second": 37.455,
73
- "eval_steps_per_second": 37.455,
74
  "step": 400
75
  },
76
  {
77
  "epoch": 0.5,
78
- "grad_norm": 1.2876827716827393,
79
  "learning_rate": 0.00021717490653764342,
80
- "loss": 7.900021362304687,
81
  "step": 500
82
  },
83
  {
84
  "epoch": 0.5,
85
- "eval_accuracy": 0.11435420743639922,
86
- "eval_loss": 7.851724624633789,
87
- "eval_runtime": 26.5522,
88
- "eval_samples_per_second": 37.662,
89
- "eval_steps_per_second": 37.662,
90
  "step": 500
91
  },
92
  {
93
  "epoch": 0.6,
94
- "grad_norm": 1.2628377676010132,
95
  "learning_rate": 0.00015154431949464275,
96
- "loss": 7.744283447265625,
97
  "step": 600
98
  },
99
  {
100
  "epoch": 0.6,
101
- "eval_accuracy": 0.1190665362035225,
102
- "eval_loss": 7.8012566566467285,
103
- "eval_runtime": 27.3957,
104
- "eval_samples_per_second": 36.502,
105
- "eval_steps_per_second": 36.502,
106
  "step": 600
107
  },
108
  {
109
  "epoch": 0.7,
110
- "grad_norm": 1.3543407917022705,
111
  "learning_rate": 9.11646573017482e-05,
112
- "loss": 7.696810302734375,
113
  "step": 700
114
  },
115
  {
116
  "epoch": 0.7,
117
- "eval_accuracy": 0.12185714285714286,
118
- "eval_loss": 7.775871276855469,
119
- "eval_runtime": 26.9132,
120
- "eval_samples_per_second": 37.157,
121
- "eval_steps_per_second": 37.157,
122
  "step": 700
123
  },
124
  {
125
  "epoch": 0.8,
126
- "grad_norm": 1.2917762994766235,
127
  "learning_rate": 4.2578993244549506e-05,
128
- "loss": 7.771747436523437,
129
  "step": 800
130
  },
131
  {
132
  "epoch": 0.8,
133
- "eval_accuracy": 0.12456751467710372,
134
- "eval_loss": 7.751345157623291,
135
- "eval_runtime": 26.6293,
136
- "eval_samples_per_second": 37.553,
137
- "eval_steps_per_second": 37.553,
138
  "step": 800
139
  },
140
  {
141
  "epoch": 0.9,
142
- "grad_norm": 1.3219099044799805,
143
  "learning_rate": 1.1052337907897503e-05,
144
- "loss": 7.84291015625,
145
  "step": 900
146
  },
147
  {
148
  "epoch": 0.9,
149
- "eval_accuracy": 0.1239921722113503,
150
- "eval_loss": 7.749647617340088,
151
- "eval_runtime": 26.5278,
152
- "eval_samples_per_second": 37.696,
153
- "eval_steps_per_second": 37.696,
154
  "step": 900
155
  },
156
  {
157
  "epoch": 1.0,
158
- "grad_norm": 1.334007978439331,
159
  "learning_rate": 1.093583978573065e-09,
160
- "loss": 7.778873291015625,
161
  "step": 1000
162
  },
163
  {
164
  "epoch": 1.0,
165
- "eval_accuracy": 0.12396868884540117,
166
- "eval_loss": 7.747113227844238,
167
- "eval_runtime": 26.6654,
168
- "eval_samples_per_second": 37.502,
169
- "eval_steps_per_second": 37.502,
170
  "step": 1000
171
  }
172
  ],
 
6
  "eval_steps": 100,
7
  "global_step": 1000,
8
  "is_hyper_param_search": false,
9
+ "is_local_process_zero": false,
10
  "is_world_process_zero": true,
11
  "log_history": [
12
  {
13
  "epoch": 0.1,
14
+ "grad_norm": 11.13700008392334,
15
  "learning_rate": 0.0003973800426880847,
16
+ "loss": 66.094375,
17
  "step": 100
18
  },
19
  {
20
  "epoch": 0.1,
21
+ "eval_accuracy": 0.10251663405088063,
22
+ "eval_loss": 62.88532638549805,
23
+ "eval_runtime": 12.9078,
24
+ "eval_samples_per_second": 9.684,
25
+ "eval_steps_per_second": 1.24,
26
  "step": 100
27
  },
28
  {
29
  "epoch": 0.2,
30
+ "grad_norm": 6.741835117340088,
31
  "learning_rate": 0.0003762085737488283,
32
+ "loss": 62.0001123046875,
33
  "step": 200
34
  },
35
  {
36
  "epoch": 0.2,
37
+ "eval_accuracy": 0.11803913894324854,
38
+ "eval_loss": 61.526912689208984,
39
+ "eval_runtime": 8.6535,
40
+ "eval_samples_per_second": 14.445,
41
+ "eval_steps_per_second": 1.849,
42
  "step": 200
43
  },
44
  {
45
  "epoch": 0.3,
46
+ "grad_norm": 7.0108513832092285,
47
  "learning_rate": 0.00033594217168615465,
48
+ "loss": 61.543701171875,
49
  "step": 300
50
  },
51
  {
52
  "epoch": 0.3,
53
+ "eval_accuracy": 0.11293346379647749,
54
+ "eval_loss": 60.98686599731445,
55
+ "eval_runtime": 8.6635,
56
+ "eval_samples_per_second": 14.428,
57
+ "eval_steps_per_second": 1.847,
58
  "step": 300
59
  },
60
  {
61
  "epoch": 0.4,
62
+ "grad_norm": 10.79574203491211,
63
  "learning_rate": 0.00028094432596115747,
64
+ "loss": 61.318671875,
65
  "step": 400
66
  },
67
  {
68
  "epoch": 0.4,
69
+ "eval_accuracy": 0.1016477495107632,
70
+ "eval_loss": 61.48467254638672,
71
+ "eval_runtime": 8.6224,
72
+ "eval_samples_per_second": 14.497,
73
+ "eval_steps_per_second": 1.856,
74
  "step": 400
75
  },
76
  {
77
  "epoch": 0.5,
78
+ "grad_norm": 6.4634199142456055,
79
  "learning_rate": 0.00021717490653764342,
80
+ "loss": 60.952919921875,
81
  "step": 500
82
  },
83
  {
84
  "epoch": 0.5,
85
+ "eval_accuracy": 0.09600978473581213,
86
+ "eval_loss": 61.699729919433594,
87
+ "eval_runtime": 8.3835,
88
+ "eval_samples_per_second": 14.91,
89
+ "eval_steps_per_second": 1.909,
90
  "step": 500
91
  },
92
  {
93
  "epoch": 0.6,
94
+ "grad_norm": 9.323127746582031,
95
  "learning_rate": 0.00015154431949464275,
96
+ "loss": 60.478193359375,
97
  "step": 600
98
  },
99
  {
100
  "epoch": 0.6,
101
+ "eval_accuracy": 0.122,
102
+ "eval_loss": 60.42253494262695,
103
+ "eval_runtime": 9.026,
104
+ "eval_samples_per_second": 13.849,
105
+ "eval_steps_per_second": 1.773,
106
  "step": 600
107
  },
108
  {
109
  "epoch": 0.7,
110
+ "grad_norm": 9.785552978515625,
111
  "learning_rate": 9.11646573017482e-05,
112
+ "loss": 60.1034619140625,
113
  "step": 700
114
  },
115
  {
116
  "epoch": 0.7,
117
+ "eval_accuracy": 0.1186399217221135,
118
+ "eval_loss": 60.06114196777344,
119
+ "eval_runtime": 8.5914,
120
+ "eval_samples_per_second": 14.55,
121
+ "eval_steps_per_second": 1.862,
122
  "step": 700
123
  },
124
  {
125
  "epoch": 0.8,
126
+ "grad_norm": 8.054394721984863,
127
  "learning_rate": 4.2578993244549506e-05,
128
+ "loss": 59.673642578125,
129
  "step": 800
130
  },
131
  {
132
  "epoch": 0.8,
133
+ "eval_accuracy": 0.13012133072407045,
134
+ "eval_loss": 59.73853302001953,
135
+ "eval_runtime": 8.4067,
136
+ "eval_samples_per_second": 14.869,
137
+ "eval_steps_per_second": 1.903,
138
  "step": 800
139
  },
140
  {
141
  "epoch": 0.9,
142
+ "grad_norm": 8.334230422973633,
143
  "learning_rate": 1.1052337907897503e-05,
144
+ "loss": 59.854453125,
145
  "step": 900
146
  },
147
  {
148
  "epoch": 0.9,
149
+ "eval_accuracy": 0.12184931506849316,
150
+ "eval_loss": 59.623390197753906,
151
+ "eval_runtime": 8.5711,
152
+ "eval_samples_per_second": 14.584,
153
+ "eval_steps_per_second": 1.867,
154
  "step": 900
155
  },
156
  {
157
  "epoch": 1.0,
158
+ "grad_norm": 8.61923599243164,
159
  "learning_rate": 1.093583978573065e-09,
160
+ "loss": 59.846630859375,
161
  "step": 1000
162
  },
163
  {
164
  "epoch": 1.0,
165
+ "eval_accuracy": 0.123146771037182,
166
+ "eval_loss": 59.59795379638672,
167
+ "eval_runtime": 8.6863,
168
+ "eval_samples_per_second": 14.39,
169
+ "eval_steps_per_second": 1.842,
170
  "step": 1000
171
  }
172
  ],
last-checkpoint/training_args.bin CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:b47eb6e798b2dfe4e0fdea550782a8eb56b1b579932ae1b65db9c8ecf145627d
3
- size 5329
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:7eaf4364d37f9f4ceb03f7b16a5643504bb95eb9da30e7cced827582fa3d3389
3
+ size 5265