PEFT
Safetensors
lora-checkpoint-800 / trainer_state.json
ogaa12's picture
Upload LoRA adapter from Kaggle checkpoint-800
20f5f09 verified
Raw
History Blame Contribute Delete
6.99 kB
{
"best_global_step": null,
"best_metric": null,
"best_model_checkpoint": null,
"epoch": 0.9913258983890955,
"eval_steps": 50,
"global_step": 800,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"epoch": 0.061957868649318466,
"grad_norm": 1.2862273454666138,
"learning_rate": 2.37987987987988e-05,
"loss": 0.9967,
"step": 50
},
{
"epoch": 0.061957868649318466,
"eval_loss": 0.6054196357727051,
"eval_runtime": 113.1174,
"eval_samples_per_second": 1.786,
"eval_steps_per_second": 0.23,
"step": 50
},
{
"epoch": 0.12391573729863693,
"grad_norm": 1.1672418117523193,
"learning_rate": 2.2547547547547548e-05,
"loss": 0.5784,
"step": 100
},
{
"epoch": 0.12391573729863693,
"eval_loss": 0.5818283557891846,
"eval_runtime": 113.0178,
"eval_samples_per_second": 1.787,
"eval_steps_per_second": 0.23,
"step": 100
},
{
"epoch": 0.18587360594795538,
"grad_norm": 1.5880266427993774,
"learning_rate": 2.1296296296296296e-05,
"loss": 0.541,
"step": 150
},
{
"epoch": 0.18587360594795538,
"eval_loss": 0.5644930005073547,
"eval_runtime": 113.2567,
"eval_samples_per_second": 1.784,
"eval_steps_per_second": 0.23,
"step": 150
},
{
"epoch": 0.24783147459727387,
"grad_norm": 1.7589224576950073,
"learning_rate": 2.0045045045045048e-05,
"loss": 0.5533,
"step": 200
},
{
"epoch": 0.24783147459727387,
"eval_loss": 0.5503261089324951,
"eval_runtime": 113.0371,
"eval_samples_per_second": 1.787,
"eval_steps_per_second": 0.23,
"step": 200
},
{
"epoch": 0.3097893432465923,
"grad_norm": 1.5382256507873535,
"learning_rate": 1.8793793793793796e-05,
"loss": 0.5148,
"step": 250
},
{
"epoch": 0.3097893432465923,
"eval_loss": 0.536943793296814,
"eval_runtime": 113.1985,
"eval_samples_per_second": 1.784,
"eval_steps_per_second": 0.23,
"step": 250
},
{
"epoch": 0.37174721189591076,
"grad_norm": 1.673969030380249,
"learning_rate": 1.754254254254254e-05,
"loss": 0.5416,
"step": 300
},
{
"epoch": 0.37174721189591076,
"eval_loss": 0.5312764644622803,
"eval_runtime": 113.1787,
"eval_samples_per_second": 1.785,
"eval_steps_per_second": 0.23,
"step": 300
},
{
"epoch": 0.43370508054522927,
"grad_norm": 1.2669477462768555,
"learning_rate": 1.629129129129129e-05,
"loss": 0.5168,
"step": 350
},
{
"epoch": 0.43370508054522927,
"eval_loss": 0.5231972932815552,
"eval_runtime": 112.8353,
"eval_samples_per_second": 1.79,
"eval_steps_per_second": 0.23,
"step": 350
},
{
"epoch": 0.49566294919454773,
"grad_norm": 1.5182968378067017,
"learning_rate": 1.504004004004004e-05,
"loss": 0.508,
"step": 400
},
{
"epoch": 0.49566294919454773,
"eval_loss": 0.5176748633384705,
"eval_runtime": 112.9134,
"eval_samples_per_second": 1.789,
"eval_steps_per_second": 0.23,
"step": 400
},
{
"epoch": 0.5576208178438662,
"grad_norm": 2.9578964710235596,
"learning_rate": 1.378878878878879e-05,
"loss": 0.5021,
"step": 450
},
{
"epoch": 0.5576208178438662,
"eval_loss": 0.5131492614746094,
"eval_runtime": 112.9644,
"eval_samples_per_second": 1.788,
"eval_steps_per_second": 0.23,
"step": 450
},
{
"epoch": 0.6195786864931846,
"grad_norm": 2.4446771144866943,
"learning_rate": 1.2537537537537538e-05,
"loss": 0.4929,
"step": 500
},
{
"epoch": 0.6195786864931846,
"eval_loss": 0.5092382431030273,
"eval_runtime": 113.0528,
"eval_samples_per_second": 1.787,
"eval_steps_per_second": 0.23,
"step": 500
},
{
"epoch": 0.6815365551425031,
"grad_norm": 1.5840567350387573,
"learning_rate": 1.1286286286286286e-05,
"loss": 0.5108,
"step": 550
},
{
"epoch": 0.6815365551425031,
"eval_loss": 0.5048378705978394,
"eval_runtime": 112.995,
"eval_samples_per_second": 1.788,
"eval_steps_per_second": 0.23,
"step": 550
},
{
"epoch": 0.7434944237918215,
"grad_norm": 1.5897728204727173,
"learning_rate": 1.0035035035035035e-05,
"loss": 0.4952,
"step": 600
},
{
"epoch": 0.7434944237918215,
"eval_loss": 0.5033619999885559,
"eval_runtime": 112.9428,
"eval_samples_per_second": 1.789,
"eval_steps_per_second": 0.23,
"step": 600
},
{
"epoch": 0.80545229244114,
"grad_norm": 2.2665419578552246,
"learning_rate": 8.783783783783785e-06,
"loss": 0.5028,
"step": 650
},
{
"epoch": 0.80545229244114,
"eval_loss": 0.4959164559841156,
"eval_runtime": 113.0478,
"eval_samples_per_second": 1.787,
"eval_steps_per_second": 0.23,
"step": 650
},
{
"epoch": 0.8674101610904585,
"grad_norm": 2.0126755237579346,
"learning_rate": 7.532532532532532e-06,
"loss": 0.5094,
"step": 700
},
{
"epoch": 0.8674101610904585,
"eval_loss": 0.4948059320449829,
"eval_runtime": 113.1788,
"eval_samples_per_second": 1.785,
"eval_steps_per_second": 0.23,
"step": 700
},
{
"epoch": 0.929368029739777,
"grad_norm": 2.2332139015197754,
"learning_rate": 6.2812812812812815e-06,
"loss": 0.491,
"step": 750
},
{
"epoch": 0.929368029739777,
"eval_loss": 0.49081042408943176,
"eval_runtime": 112.7157,
"eval_samples_per_second": 1.792,
"eval_steps_per_second": 0.231,
"step": 750
},
{
"epoch": 0.9913258983890955,
"grad_norm": 1.5069801807403564,
"learning_rate": 5.03003003003003e-06,
"loss": 0.4795,
"step": 800
},
{
"epoch": 0.9913258983890955,
"eval_loss": 0.48919081687927246,
"eval_runtime": 113.1009,
"eval_samples_per_second": 1.786,
"eval_steps_per_second": 0.23,
"step": 800
}
],
"logging_steps": 50,
"max_steps": 1000,
"num_input_tokens_seen": 0,
"num_train_epochs": 2,
"save_steps": 50,
"stateful_callbacks": {
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": true,
"should_training_stop": false
},
"attributes": {}
}
},
"total_flos": 4494640152576000.0,
"train_batch_size": 2,
"trial_name": null,
"trial_params": null
}