CodeIsAbstract commited on
Commit
1beaea9
·
verified ·
1 Parent(s): aa66ca0

Training in progress, step 42000, checkpoint

Browse files
last-checkpoint/model.safetensors CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:6ed761b6beba77fb535cbed31c0aa2e899d00d55d8771441f7ca65e1ed885e7b
3
  size 579824888
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:90615d1d2178f5b43d414dd7d578f864f00b4f2a8cd51186bc86a62375823fa5
3
  size 579824888
last-checkpoint/optimizer.pt CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:3a2850114abd645eb97f3c25c47199cf3e8cf4b9bc81d7c505f6e6dc8f2a5e61
3
  size 1159794763
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:13df368800beae9d4318c6d8b41062821af4d94ce7343c05db2b88f701598d75
3
  size 1159794763
last-checkpoint/rng_state.pth CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:319c69ec456b4fcce9018c73539aecc383b0cb34ee142655e66ea42576668bfe
3
  size 14645
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:1900219b8b9edacee7fac6b19a0563f8d104e8198851f8681ad0fcf475ad606d
3
  size 14645
last-checkpoint/scheduler.pt CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:be73e97160af6aa989641ee6aa859d208a12c6f78430f9ec70c726fde6de838d
3
  size 1465
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:d406c9f3bd6b7c91833c1f6b701e14e2778777027556d7f617683149adeaebed
3
  size 1465
last-checkpoint/trainer_state.json CHANGED
@@ -2,9 +2,9 @@
2
  "best_global_step": null,
3
  "best_metric": null,
4
  "best_model_checkpoint": null,
5
- "epoch": 0.16,
6
  "eval_steps": 1000,
7
- "global_step": 40000,
8
  "is_hyper_param_search": false,
9
  "is_local_process_zero": true,
10
  "is_world_process_zero": true,
@@ -3168,6 +3168,164 @@
3168
  "eval_samples_per_second": 225.184,
3169
  "eval_steps_per_second": 14.154,
3170
  "step": 40000
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
3171
  }
3172
  ],
3173
  "logging_steps": 100,
@@ -3187,7 +3345,7 @@
3187
  "attributes": {}
3188
  }
3189
  },
3190
- "total_flos": 1.5679843467264e+18,
3191
  "train_batch_size": 120,
3192
  "trial_name": null,
3193
  "trial_params": null
 
2
  "best_global_step": null,
3
  "best_metric": null,
4
  "best_model_checkpoint": null,
5
+ "epoch": 0.2,
6
  "eval_steps": 1000,
7
+ "global_step": 42000,
8
  "is_hyper_param_search": false,
9
  "is_local_process_zero": true,
10
  "is_world_process_zero": true,
 
3168
  "eval_samples_per_second": 225.184,
3169
  "eval_steps_per_second": 14.154,
3170
  "step": 40000
3171
+ },
3172
+ {
3173
+ "epoch": 0.162,
3174
+ "grad_norm": 0.15037383139133453,
3175
+ "learning_rate": 9.421735586195107e-05,
3176
+ "loss": 2.9509246826171873,
3177
+ "step": 40100
3178
+ },
3179
+ {
3180
+ "epoch": 0.164,
3181
+ "grad_norm": 0.1613582968711853,
3182
+ "learning_rate": 9.238439062409743e-05,
3183
+ "loss": 2.9910101318359374,
3184
+ "step": 40200
3185
+ },
3186
+ {
3187
+ "epoch": 0.166,
3188
+ "grad_norm": 0.14735275506973267,
3189
+ "learning_rate": 9.056761434025673e-05,
3190
+ "loss": 2.9853973388671875,
3191
+ "step": 40300
3192
+ },
3193
+ {
3194
+ "epoch": 0.168,
3195
+ "grad_norm": 0.1489039957523346,
3196
+ "learning_rate": 8.876709916592768e-05,
3197
+ "loss": 2.9695831298828126,
3198
+ "step": 40400
3199
+ },
3200
+ {
3201
+ "epoch": 0.17,
3202
+ "grad_norm": 0.15305224061012268,
3203
+ "learning_rate": 8.698291661077995e-05,
3204
+ "loss": 2.9895590209960936,
3205
+ "step": 40500
3206
+ },
3207
+ {
3208
+ "epoch": 0.172,
3209
+ "grad_norm": 0.14815682172775269,
3210
+ "learning_rate": 8.521513753581222e-05,
3211
+ "loss": 2.991077880859375,
3212
+ "step": 40600
3213
+ },
3214
+ {
3215
+ "epoch": 0.174,
3216
+ "grad_norm": 0.16085270047187805,
3217
+ "learning_rate": 8.346383215053938e-05,
3218
+ "loss": 2.9522689819335937,
3219
+ "step": 40700
3220
+ },
3221
+ {
3222
+ "epoch": 0.176,
3223
+ "grad_norm": 0.15213212370872498,
3224
+ "learning_rate": 8.172907001020341e-05,
3225
+ "loss": 2.9664620971679687,
3226
+ "step": 40800
3227
+ },
3228
+ {
3229
+ "epoch": 0.178,
3230
+ "grad_norm": 0.1419726014137268,
3231
+ "learning_rate": 8.001092001301107e-05,
3232
+ "loss": 2.97818115234375,
3233
+ "step": 40900
3234
+ },
3235
+ {
3236
+ "epoch": 0.18,
3237
+ "grad_norm": 0.15810449421405792,
3238
+ "learning_rate": 7.830945039739745e-05,
3239
+ "loss": 2.9653594970703123,
3240
+ "step": 41000
3241
+ },
3242
+ {
3243
+ "epoch": 0.18,
3244
+ "eval_accuracy": 0.383703802284819,
3245
+ "eval_loss": 3.2846739292144775,
3246
+ "eval_runtime": 8.7053,
3247
+ "eval_samples_per_second": 222.968,
3248
+ "eval_steps_per_second": 14.014,
3249
+ "step": 41000
3250
+ },
3251
+ {
3252
+ "epoch": 0.182,
3253
+ "grad_norm": 0.13863492012023926,
3254
+ "learning_rate": 7.66247287393157e-05,
3255
+ "loss": 2.974002685546875,
3256
+ "step": 41100
3257
+ },
3258
+ {
3259
+ "epoch": 0.184,
3260
+ "grad_norm": 0.14595595002174377,
3261
+ "learning_rate": 7.495682194955355e-05,
3262
+ "loss": 2.95628173828125,
3263
+ "step": 41200
3264
+ },
3265
+ {
3266
+ "epoch": 0.186,
3267
+ "grad_norm": 0.1462547481060028,
3268
+ "learning_rate": 7.330579627107508e-05,
3269
+ "loss": 2.9797796630859374,
3270
+ "step": 41300
3271
+ },
3272
+ {
3273
+ "epoch": 0.188,
3274
+ "grad_norm": 0.14023055136203766,
3275
+ "learning_rate": 7.167171727639105e-05,
3276
+ "loss": 2.97584716796875,
3277
+ "step": 41400
3278
+ },
3279
+ {
3280
+ "epoch": 0.19,
3281
+ "grad_norm": 0.15168802440166473,
3282
+ "learning_rate": 7.005464986495352e-05,
3283
+ "loss": 2.971091613769531,
3284
+ "step": 41500
3285
+ },
3286
+ {
3287
+ "epoch": 0.192,
3288
+ "grad_norm": 0.15589351952075958,
3289
+ "learning_rate": 6.845465826057828e-05,
3290
+ "loss": 2.972411804199219,
3291
+ "step": 41600
3292
+ },
3293
+ {
3294
+ "epoch": 0.194,
3295
+ "grad_norm": 0.15626484155654907,
3296
+ "learning_rate": 6.68718060088953e-05,
3297
+ "loss": 2.947337341308594,
3298
+ "step": 41700
3299
+ },
3300
+ {
3301
+ "epoch": 0.196,
3302
+ "grad_norm": 0.1376980096101761,
3303
+ "learning_rate": 6.530615597482342e-05,
3304
+ "loss": 2.9626498413085938,
3305
+ "step": 41800
3306
+ },
3307
+ {
3308
+ "epoch": 0.198,
3309
+ "grad_norm": 0.14533552527427673,
3310
+ "learning_rate": 6.375777034007463e-05,
3311
+ "loss": 3.0008612060546875,
3312
+ "step": 41900
3313
+ },
3314
+ {
3315
+ "epoch": 0.2,
3316
+ "grad_norm": 0.15397998690605164,
3317
+ "learning_rate": 6.222671060068407e-05,
3318
+ "loss": 2.9751876831054687,
3319
+ "step": 42000
3320
+ },
3321
+ {
3322
+ "epoch": 0.2,
3323
+ "eval_accuracy": 0.3838933468837557,
3324
+ "eval_loss": 3.282271385192871,
3325
+ "eval_runtime": 8.7427,
3326
+ "eval_samples_per_second": 222.015,
3327
+ "eval_steps_per_second": 13.955,
3328
+ "step": 42000
3329
  }
3330
  ],
3331
  "logging_steps": 100,
 
3345
  "attributes": {}
3346
  }
3347
  },
3348
+ "total_flos": 1.64638356406272e+18,
3349
  "train_batch_size": 120,
3350
  "trial_name": null,
3351
  "trial_params": null