CodeIsAbstract commited on
Commit
f4c3492
·
verified ·
1 Parent(s): 68fdc99

Training in progress, step 1000, checkpoint

Browse files
last-checkpoint/optimizer.pt CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:e5f8208969c787c86b244b9e9a71626f98e35ffdfeaecbcc5ef207a5ddc9659d
3
  size 386379
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:01fa6858421fdb015bb654a425c3f690795d9e1cf96f456f6b27a6326b7d244c
3
  size 386379
last-checkpoint/pytorch_model.bin CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:965dc697c3ab28072f197959f194ef0efcc91bb79803752fd97f500aa7e8a5df
3
  size 1540661735
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:a4223bec74f7da5212aa0de8c7257e806561a45c5fccd2838265f2d310699b11
3
  size 1540661735
last-checkpoint/rng_state.pth CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:5fb8116194227284009af0f32eb6c9bf39b120912678b54e07fcb6539f29b5b2
3
  size 14455
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:b815622b7dfb0359193f2c3e6cdc190a4c07e6c28cfbaf526d6da260173bd4a4
3
  size 14455
last-checkpoint/scheduler.pt CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:b3161ebc22e167d90d7ee5cc1bfde367c6af5f0b04db44c912617eb26a593223
3
  size 1465
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:94b7b1a014f5dad743694fda5858015bfe3bd4c82eac608d649238b91858a560
3
  size 1465
last-checkpoint/trainer_state.json CHANGED
@@ -2,9 +2,9 @@
2
  "best_global_step": null,
3
  "best_metric": null,
4
  "best_model_checkpoint": null,
5
- "epoch": 0.5,
6
  "eval_steps": 100,
7
- "global_step": 500,
8
  "is_hyper_param_search": false,
9
  "is_local_process_zero": true,
10
  "is_world_process_zero": true,
@@ -88,6 +88,86 @@
88
  "eval_samples_per_second": 37.096,
89
  "eval_steps_per_second": 37.096,
90
  "step": 500
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
91
  }
92
  ],
93
  "logging_steps": 100,
@@ -102,7 +182,7 @@
102
  "should_evaluate": false,
103
  "should_log": false,
104
  "should_save": true,
105
- "should_training_stop": false
106
  },
107
  "attributes": {}
108
  }
 
2
  "best_global_step": null,
3
  "best_metric": null,
4
  "best_model_checkpoint": null,
5
+ "epoch": 1.0,
6
  "eval_steps": 100,
7
+ "global_step": 1000,
8
  "is_hyper_param_search": false,
9
  "is_local_process_zero": true,
10
  "is_world_process_zero": true,
 
88
  "eval_samples_per_second": 37.096,
89
  "eval_steps_per_second": 37.096,
90
  "step": 500
91
+ },
92
+ {
93
+ "epoch": 0.6,
94
+ "grad_norm": 31.606178283691406,
95
+ "learning_rate": 0.00015154431949464275,
96
+ "loss": 11.733912353515626,
97
+ "step": 600
98
+ },
99
+ {
100
+ "epoch": 0.6,
101
+ "eval_accuracy": 0.05017808219178082,
102
+ "eval_loss": 12.344472885131836,
103
+ "eval_runtime": 27.8267,
104
+ "eval_samples_per_second": 35.937,
105
+ "eval_steps_per_second": 35.937,
106
+ "step": 600
107
+ },
108
+ {
109
+ "epoch": 0.7,
110
+ "grad_norm": 60.602169036865234,
111
+ "learning_rate": 9.11646573017482e-05,
112
+ "loss": 12.59990234375,
113
+ "step": 700
114
+ },
115
+ {
116
+ "epoch": 0.7,
117
+ "eval_accuracy": 0.07920547945205479,
118
+ "eval_loss": 11.4829683303833,
119
+ "eval_runtime": 26.8514,
120
+ "eval_samples_per_second": 37.242,
121
+ "eval_steps_per_second": 37.242,
122
+ "step": 700
123
+ },
124
+ {
125
+ "epoch": 0.8,
126
+ "grad_norm": 28.155149459838867,
127
+ "learning_rate": 4.2578993244549506e-05,
128
+ "loss": 10.478193359375,
129
+ "step": 800
130
+ },
131
+ {
132
+ "epoch": 0.8,
133
+ "eval_accuracy": 0.08408610567514677,
134
+ "eval_loss": 9.93655776977539,
135
+ "eval_runtime": 26.6366,
136
+ "eval_samples_per_second": 37.542,
137
+ "eval_steps_per_second": 37.542,
138
+ "step": 800
139
+ },
140
+ {
141
+ "epoch": 0.9,
142
+ "grad_norm": 26.28119468688965,
143
+ "learning_rate": 1.1052337907897503e-05,
144
+ "loss": 9.994468383789062,
145
+ "step": 900
146
+ },
147
+ {
148
+ "epoch": 0.9,
149
+ "eval_accuracy": 0.0641252446183953,
150
+ "eval_loss": 9.959942817687988,
151
+ "eval_runtime": 26.6315,
152
+ "eval_samples_per_second": 37.549,
153
+ "eval_steps_per_second": 37.549,
154
+ "step": 900
155
+ },
156
+ {
157
+ "epoch": 1.0,
158
+ "grad_norm": 41.307456970214844,
159
+ "learning_rate": 1.093583978573065e-09,
160
+ "loss": 9.751447143554687,
161
+ "step": 1000
162
+ },
163
+ {
164
+ "epoch": 1.0,
165
+ "eval_accuracy": 0.06885127201565558,
166
+ "eval_loss": 9.537232398986816,
167
+ "eval_runtime": 26.8522,
168
+ "eval_samples_per_second": 37.241,
169
+ "eval_steps_per_second": 37.241,
170
+ "step": 1000
171
  }
172
  ],
173
  "logging_steps": 100,
 
182
  "should_evaluate": false,
183
  "should_log": false,
184
  "should_save": true,
185
+ "should_training_stop": true
186
  },
187
  "attributes": {}
188
  }