anhdai312 commited on
Commit
771d299
·
verified ·
1 Parent(s): 1c4dfd9

Training in progress, step 408, checkpoint

Browse files
last-checkpoint/adapter_model.safetensors CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:11bceb5e08b8718decb65db742c52a5739796423c069ec0a8a6d9211891aa9e3
3
  size 161533192
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:96284a4b1392614c523c3255652c7551518662ea2a124d2f983daa73adf17958
3
  size 161533192
last-checkpoint/optimizer.pt CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:8552cb299e3b92550764d6b066e5480bb5b500c886be54518dc57bd7666e4f02
3
  size 82465413
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:82d2dbf6406017979f81c144f501157ce7316b647cefc393c420dbc793a2b0f3
3
  size 82465413
last-checkpoint/rng_state.pth CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:1b676af2f42e04d02e87fd4a9d835b90da0ad1ded8534696972b881798ad0ba0
3
  size 14645
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:7c3f77b7459f441b76ed48c2a706f466e60e41b340446bcd79f06cc225528cb6
3
  size 14645
last-checkpoint/scaler.pt CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:627bbb84c945c6d86cebd701faf2322d071ee5bad1f4ba0e1e0dc02cdeb413b2
3
  size 1383
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:743837d2c104d9a7e4469ef2df904879cedfd16f5b6f1c1800c57f24e23d6664
3
  size 1383
last-checkpoint/scheduler.pt CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:2e2c69e206be010d70483962f0693bb218a974b09200786cb8e307a3ea6a1709
3
  size 1465
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:c2b1a8f6f22dc8cc638d8eead1fc33bb9ec79f1b92763dd81711b31971dda1e5
3
  size 1465
last-checkpoint/trainer_state.json CHANGED
@@ -1,10 +1,10 @@
1
  {
2
- "best_global_step": 400,
3
- "best_metric": 0.6753122210502625,
4
- "best_model_checkpoint": "/kaggle/working/sep490_checkpoints/job_ce30cf18-8eef-4444-8cae-3f972a780634/checkpoint-400",
5
- "epoch": 2.946395563770795,
6
  "eval_steps": 10,
7
- "global_step": 400,
8
  "is_hyper_param_search": false,
9
  "is_local_process_zero": true,
10
  "is_world_process_zero": true,
@@ -3128,6 +3128,70 @@
3128
  "eval_samples_per_second": 4.009,
3129
  "eval_steps_per_second": 1.042,
3130
  "step": 400
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
3131
  }
3132
  ],
3133
  "logging_steps": 1,
@@ -3142,12 +3206,12 @@
3142
  "should_evaluate": false,
3143
  "should_log": false,
3144
  "should_save": true,
3145
- "should_training_stop": false
3146
  },
3147
  "attributes": {}
3148
  }
3149
  },
3150
- "total_flos": 1.1247082023346176e+16,
3151
  "train_batch_size": 1,
3152
  "trial_name": null,
3153
  "trial_params": null
 
1
  {
2
+ "best_global_step": 408,
3
+ "best_metric": 0.6750363707542419,
4
+ "best_model_checkpoint": "/kaggle/working/sep490_checkpoints/job_ce30cf18-8eef-4444-8cae-3f972a780634/checkpoint-408",
5
+ "epoch": 3.0,
6
  "eval_steps": 10,
7
+ "global_step": 408,
8
  "is_hyper_param_search": false,
9
  "is_local_process_zero": true,
10
  "is_world_process_zero": true,
 
3128
  "eval_samples_per_second": 4.009,
3129
  "eval_steps_per_second": 1.042,
3130
  "step": 400
3131
+ },
3132
+ {
3133
+ "epoch": 2.9537892791127542,
3134
+ "grad_norm": 4.688410758972168,
3135
+ "learning_rate": 1.1166253101736972e-06,
3136
+ "loss": 0.31728246808052063,
3137
+ "step": 401
3138
+ },
3139
+ {
3140
+ "epoch": 2.9611829944547132,
3141
+ "grad_norm": 3.6959214210510254,
3142
+ "learning_rate": 9.925558312655088e-07,
3143
+ "loss": 0.296553373336792,
3144
+ "step": 402
3145
+ },
3146
+ {
3147
+ "epoch": 2.9685767097966727,
3148
+ "grad_norm": 4.490988254547119,
3149
+ "learning_rate": 8.684863523573202e-07,
3150
+ "loss": 0.41596537828445435,
3151
+ "step": 403
3152
+ },
3153
+ {
3154
+ "epoch": 2.975970425138632,
3155
+ "grad_norm": 5.713006019592285,
3156
+ "learning_rate": 7.444168734491315e-07,
3157
+ "loss": 0.5145145654678345,
3158
+ "step": 404
3159
+ },
3160
+ {
3161
+ "epoch": 2.9833641404805915,
3162
+ "grad_norm": 4.68435001373291,
3163
+ "learning_rate": 6.20347394540943e-07,
3164
+ "loss": 0.47570955753326416,
3165
+ "step": 405
3166
+ },
3167
+ {
3168
+ "epoch": 2.990757855822551,
3169
+ "grad_norm": 3.961190938949585,
3170
+ "learning_rate": 4.962779156327544e-07,
3171
+ "loss": 0.4042632579803467,
3172
+ "step": 406
3173
+ },
3174
+ {
3175
+ "epoch": 2.9981515711645104,
3176
+ "grad_norm": 5.057858467102051,
3177
+ "learning_rate": 3.7220843672456576e-07,
3178
+ "loss": 0.4465891718864441,
3179
+ "step": 407
3180
+ },
3181
+ {
3182
+ "epoch": 3.0,
3183
+ "grad_norm": 8.670039176940918,
3184
+ "learning_rate": 2.481389578163772e-07,
3185
+ "loss": 0.4737997353076935,
3186
+ "step": 408
3187
+ },
3188
+ {
3189
+ "epoch": 3.0,
3190
+ "eval_loss": 0.6750363707542419,
3191
+ "eval_runtime": 12.4809,
3192
+ "eval_samples_per_second": 4.006,
3193
+ "eval_steps_per_second": 1.042,
3194
+ "step": 408
3195
  }
3196
  ],
3197
  "logging_steps": 1,
 
3206
  "should_evaluate": false,
3207
  "should_log": false,
3208
  "should_save": true,
3209
+ "should_training_stop": true
3210
  },
3211
  "attributes": {}
3212
  }
3213
  },
3214
+ "total_flos": 1.1448379908790272e+16,
3215
  "train_batch_size": 1,
3216
  "trial_name": null,
3217
  "trial_params": null