CodeIsAbstract commited on
Commit
2168b24
·
verified ·
1 Parent(s): 992460d

Training in progress, step 1000, checkpoint

Browse files
last-checkpoint/optimizer.pt CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:69ca6905e70e7a92d02eeddbdeb7103009b83d9f0f234789efb4904d68ed5838
3
  size 386379
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:4f6699d01f8e164228a8dd52c97ad373cf8f385ea3db3cf918436dad5dc85d09
3
  size 386379
last-checkpoint/pytorch_model.bin CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:82cc3acf680d85a95964b4366417613a590457a2020ce3a7574762bb50f5df4d
3
  size 1540661735
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:97fd4ca2baf513dd7e640129586738e37fb64c9da14592e89cd1cb308bf9e40a
3
  size 1540661735
last-checkpoint/rng_state_0.pth CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:88b48f43625e8919759a700846736ad1c67a9fb02b424ca27c045fdf11ebec4d
3
  size 14469
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:934ae4672c85df4a03b901039c48484c6d48940b666eb9da6abdadd0bfd7ca2e
3
  size 14469
last-checkpoint/rng_state_1.pth CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:a3df8bbf0aa54958cebb063d8843254a6ca7fa9a4ecc3a91470b305106963beb
3
  size 14469
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:f8e7ba67417374f28eafc52fb09cd1635fb90aeae797c287fb344cf608c324f7
3
  size 14469
last-checkpoint/rng_state_2.pth CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:0c2aba2784b08e863f59f03cfa3309c63893fb49cde8f0070f10410339e4d7fd
3
  size 14469
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:b34aebebdff0fa5078105ea2165525a062f2af01267a2bc4a5277f926a1ddf87
3
  size 14469
last-checkpoint/rng_state_3.pth CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:827e90af5517da4bb9113a66cb2136b09f8d4c852d96861d993b1d3b68201f38
3
  size 14469
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:bbad142d3225fe2301edd7a4526b586614f8cdf35859a150aa76ce623d42e698
3
  size 14469
last-checkpoint/rng_state_4.pth CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:4db1556f9cda170711f81bfb9343feab14e545a26997a7968c5820a578a542c7
3
  size 14469
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:08730831ebd5924954c36016585e26ed2876b02574126a5a7953c60d82be5570
3
  size 14469
last-checkpoint/rng_state_5.pth CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:165ab5fc90c8c3dd2e6e924be06814806faf1d60acb8d14cc4b0676f6f5737f1
3
  size 14469
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:7d18edd5743601b28a2cec06aa40d0c6c594939906326809da6ebe1722314306
3
  size 14469
last-checkpoint/rng_state_6.pth CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:017ce61066c39ae46b1e2925435311fe07b1d409bfd8cdcf79a1c7f1a9b9127b
3
  size 14469
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:83bfd9473be8368ac6ad0e43a10656820b148df93417308e1170b538c5843f29
3
  size 14469
last-checkpoint/rng_state_7.pth CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:64b97a485d2b1a72ff869a0ba55eed82c522e3229735d8894bfab7c67a78fe16
3
  size 14469
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:319739ad7d60d541f5641918cc521dd6473e39cc771d09fd1d8985261cc880a0
3
  size 14469
last-checkpoint/scheduler.pt CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:9f532a77c9963a928cf7277c87e919c365cd36b1e11776f70173ba96ec9da717
3
  size 1465
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:3c3db7392f9c6280c917a9b32f54db3418a51b7cc8ad693de700680693a06e6b
3
  size 1465
last-checkpoint/trainer_state.json CHANGED
@@ -2,9 +2,9 @@
2
  "best_global_step": null,
3
  "best_metric": null,
4
  "best_model_checkpoint": null,
5
- "epoch": 0.5,
6
  "eval_steps": 100,
7
- "global_step": 500,
8
  "is_hyper_param_search": false,
9
  "is_local_process_zero": false,
10
  "is_world_process_zero": true,
@@ -88,6 +88,86 @@
88
  "eval_samples_per_second": 18.579,
89
  "eval_steps_per_second": 0.595,
90
  "step": 500
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
91
  }
92
  ],
93
  "logging_steps": 100,
@@ -102,7 +182,7 @@
102
  "should_evaluate": false,
103
  "should_log": false,
104
  "should_save": true,
105
- "should_training_stop": false
106
  },
107
  "attributes": {}
108
  }
 
2
  "best_global_step": null,
3
  "best_metric": null,
4
  "best_model_checkpoint": null,
5
+ "epoch": 1.0,
6
  "eval_steps": 100,
7
+ "global_step": 1000,
8
  "is_hyper_param_search": false,
9
  "is_local_process_zero": false,
10
  "is_world_process_zero": true,
 
88
  "eval_samples_per_second": 18.579,
89
  "eval_steps_per_second": 0.595,
90
  "step": 500
91
+ },
92
+ {
93
+ "epoch": 0.6,
94
+ "grad_norm": 0.5756194591522217,
95
+ "learning_rate": 0.0014122226612106885,
96
+ "loss": 55.7325390625,
97
+ "step": 600
98
+ },
99
+ {
100
+ "epoch": 0.6,
101
+ "eval_accuracy": 0.15486021505376343,
102
+ "eval_loss": 55.48189163208008,
103
+ "eval_runtime": 6.8292,
104
+ "eval_samples_per_second": 18.304,
105
+ "eval_steps_per_second": 0.586,
106
+ "step": 600
107
+ },
108
+ {
109
+ "epoch": 0.7,
110
+ "grad_norm": 0.5742236375808716,
111
+ "learning_rate": 0.0008450618433005865,
112
+ "loss": 55.4351513671875,
113
+ "step": 700
114
+ },
115
+ {
116
+ "epoch": 0.7,
117
+ "eval_accuracy": 0.15646823069403715,
118
+ "eval_loss": 55.330833435058594,
119
+ "eval_runtime": 6.8567,
120
+ "eval_samples_per_second": 18.23,
121
+ "eval_steps_per_second": 0.583,
122
+ "step": 700
123
+ },
124
+ {
125
+ "epoch": 0.8,
126
+ "grad_norm": 0.5711455345153809,
127
+ "learning_rate": 0.0003932305678751549,
128
+ "loss": 55.313212890625,
129
+ "step": 800
130
+ },
131
+ {
132
+ "epoch": 0.8,
133
+ "eval_accuracy": 0.1573030303030303,
134
+ "eval_loss": 55.21982192993164,
135
+ "eval_runtime": 6.7731,
136
+ "eval_samples_per_second": 18.455,
137
+ "eval_steps_per_second": 0.591,
138
+ "step": 800
139
+ },
140
+ {
141
+ "epoch": 0.9,
142
+ "grad_norm": 0.65065997838974,
143
+ "learning_rate": 0.00010184769603774147,
144
+ "loss": 55.213203125,
145
+ "step": 900
146
+ },
147
+ {
148
+ "epoch": 0.9,
149
+ "eval_accuracy": 0.15794916911045942,
150
+ "eval_loss": 55.16655731201172,
151
+ "eval_runtime": 6.6852,
152
+ "eval_samples_per_second": 18.698,
153
+ "eval_steps_per_second": 0.598,
154
+ "step": 900
155
+ },
156
+ {
157
+ "epoch": 1.0,
158
+ "grad_norm": 0.6348595023155212,
159
+ "learning_rate": 1.0069988897853933e-08,
160
+ "loss": 55.2790576171875,
161
+ "step": 1000
162
+ },
163
+ {
164
+ "epoch": 1.0,
165
+ "eval_accuracy": 0.15813000977517105,
166
+ "eval_loss": 55.15705490112305,
167
+ "eval_runtime": 6.7487,
168
+ "eval_samples_per_second": 18.522,
169
+ "eval_steps_per_second": 0.593,
170
+ "step": 1000
171
  }
172
  ],
173
  "logging_steps": 100,
 
182
  "should_evaluate": false,
183
  "should_log": false,
184
  "should_save": true,
185
+ "should_training_stop": true
186
  },
187
  "attributes": {}
188
  }