Instructions to use ogaa12/lora-checkpoint-800 with libraries, inference providers, notebooks, and local apps. Follow these links to get started.
- Libraries
- PEFT
How to use ogaa12/lora-checkpoint-800 with PEFT:
Base model is not found.
- Notebooks
- Google Colab
- Kaggle
| { | |
| "best_global_step": null, | |
| "best_metric": null, | |
| "best_model_checkpoint": null, | |
| "epoch": 0.9913258983890955, | |
| "eval_steps": 50, | |
| "global_step": 800, | |
| "is_hyper_param_search": false, | |
| "is_local_process_zero": true, | |
| "is_world_process_zero": true, | |
| "log_history": [ | |
| { | |
| "epoch": 0.061957868649318466, | |
| "grad_norm": 1.2862273454666138, | |
| "learning_rate": 2.37987987987988e-05, | |
| "loss": 0.9967, | |
| "step": 50 | |
| }, | |
| { | |
| "epoch": 0.061957868649318466, | |
| "eval_loss": 0.6054196357727051, | |
| "eval_runtime": 113.1174, | |
| "eval_samples_per_second": 1.786, | |
| "eval_steps_per_second": 0.23, | |
| "step": 50 | |
| }, | |
| { | |
| "epoch": 0.12391573729863693, | |
| "grad_norm": 1.1672418117523193, | |
| "learning_rate": 2.2547547547547548e-05, | |
| "loss": 0.5784, | |
| "step": 100 | |
| }, | |
| { | |
| "epoch": 0.12391573729863693, | |
| "eval_loss": 0.5818283557891846, | |
| "eval_runtime": 113.0178, | |
| "eval_samples_per_second": 1.787, | |
| "eval_steps_per_second": 0.23, | |
| "step": 100 | |
| }, | |
| { | |
| "epoch": 0.18587360594795538, | |
| "grad_norm": 1.5880266427993774, | |
| "learning_rate": 2.1296296296296296e-05, | |
| "loss": 0.541, | |
| "step": 150 | |
| }, | |
| { | |
| "epoch": 0.18587360594795538, | |
| "eval_loss": 0.5644930005073547, | |
| "eval_runtime": 113.2567, | |
| "eval_samples_per_second": 1.784, | |
| "eval_steps_per_second": 0.23, | |
| "step": 150 | |
| }, | |
| { | |
| "epoch": 0.24783147459727387, | |
| "grad_norm": 1.7589224576950073, | |
| "learning_rate": 2.0045045045045048e-05, | |
| "loss": 0.5533, | |
| "step": 200 | |
| }, | |
| { | |
| "epoch": 0.24783147459727387, | |
| "eval_loss": 0.5503261089324951, | |
| "eval_runtime": 113.0371, | |
| "eval_samples_per_second": 1.787, | |
| "eval_steps_per_second": 0.23, | |
| "step": 200 | |
| }, | |
| { | |
| "epoch": 0.3097893432465923, | |
| "grad_norm": 1.5382256507873535, | |
| "learning_rate": 1.8793793793793796e-05, | |
| "loss": 0.5148, | |
| "step": 250 | |
| }, | |
| { | |
| "epoch": 0.3097893432465923, | |
| "eval_loss": 0.536943793296814, | |
| "eval_runtime": 113.1985, | |
| "eval_samples_per_second": 1.784, | |
| "eval_steps_per_second": 0.23, | |
| "step": 250 | |
| }, | |
| { | |
| "epoch": 0.37174721189591076, | |
| "grad_norm": 1.673969030380249, | |
| "learning_rate": 1.754254254254254e-05, | |
| "loss": 0.5416, | |
| "step": 300 | |
| }, | |
| { | |
| "epoch": 0.37174721189591076, | |
| "eval_loss": 0.5312764644622803, | |
| "eval_runtime": 113.1787, | |
| "eval_samples_per_second": 1.785, | |
| "eval_steps_per_second": 0.23, | |
| "step": 300 | |
| }, | |
| { | |
| "epoch": 0.43370508054522927, | |
| "grad_norm": 1.2669477462768555, | |
| "learning_rate": 1.629129129129129e-05, | |
| "loss": 0.5168, | |
| "step": 350 | |
| }, | |
| { | |
| "epoch": 0.43370508054522927, | |
| "eval_loss": 0.5231972932815552, | |
| "eval_runtime": 112.8353, | |
| "eval_samples_per_second": 1.79, | |
| "eval_steps_per_second": 0.23, | |
| "step": 350 | |
| }, | |
| { | |
| "epoch": 0.49566294919454773, | |
| "grad_norm": 1.5182968378067017, | |
| "learning_rate": 1.504004004004004e-05, | |
| "loss": 0.508, | |
| "step": 400 | |
| }, | |
| { | |
| "epoch": 0.49566294919454773, | |
| "eval_loss": 0.5176748633384705, | |
| "eval_runtime": 112.9134, | |
| "eval_samples_per_second": 1.789, | |
| "eval_steps_per_second": 0.23, | |
| "step": 400 | |
| }, | |
| { | |
| "epoch": 0.5576208178438662, | |
| "grad_norm": 2.9578964710235596, | |
| "learning_rate": 1.378878878878879e-05, | |
| "loss": 0.5021, | |
| "step": 450 | |
| }, | |
| { | |
| "epoch": 0.5576208178438662, | |
| "eval_loss": 0.5131492614746094, | |
| "eval_runtime": 112.9644, | |
| "eval_samples_per_second": 1.788, | |
| "eval_steps_per_second": 0.23, | |
| "step": 450 | |
| }, | |
| { | |
| "epoch": 0.6195786864931846, | |
| "grad_norm": 2.4446771144866943, | |
| "learning_rate": 1.2537537537537538e-05, | |
| "loss": 0.4929, | |
| "step": 500 | |
| }, | |
| { | |
| "epoch": 0.6195786864931846, | |
| "eval_loss": 0.5092382431030273, | |
| "eval_runtime": 113.0528, | |
| "eval_samples_per_second": 1.787, | |
| "eval_steps_per_second": 0.23, | |
| "step": 500 | |
| }, | |
| { | |
| "epoch": 0.6815365551425031, | |
| "grad_norm": 1.5840567350387573, | |
| "learning_rate": 1.1286286286286286e-05, | |
| "loss": 0.5108, | |
| "step": 550 | |
| }, | |
| { | |
| "epoch": 0.6815365551425031, | |
| "eval_loss": 0.5048378705978394, | |
| "eval_runtime": 112.995, | |
| "eval_samples_per_second": 1.788, | |
| "eval_steps_per_second": 0.23, | |
| "step": 550 | |
| }, | |
| { | |
| "epoch": 0.7434944237918215, | |
| "grad_norm": 1.5897728204727173, | |
| "learning_rate": 1.0035035035035035e-05, | |
| "loss": 0.4952, | |
| "step": 600 | |
| }, | |
| { | |
| "epoch": 0.7434944237918215, | |
| "eval_loss": 0.5033619999885559, | |
| "eval_runtime": 112.9428, | |
| "eval_samples_per_second": 1.789, | |
| "eval_steps_per_second": 0.23, | |
| "step": 600 | |
| }, | |
| { | |
| "epoch": 0.80545229244114, | |
| "grad_norm": 2.2665419578552246, | |
| "learning_rate": 8.783783783783785e-06, | |
| "loss": 0.5028, | |
| "step": 650 | |
| }, | |
| { | |
| "epoch": 0.80545229244114, | |
| "eval_loss": 0.4959164559841156, | |
| "eval_runtime": 113.0478, | |
| "eval_samples_per_second": 1.787, | |
| "eval_steps_per_second": 0.23, | |
| "step": 650 | |
| }, | |
| { | |
| "epoch": 0.8674101610904585, | |
| "grad_norm": 2.0126755237579346, | |
| "learning_rate": 7.532532532532532e-06, | |
| "loss": 0.5094, | |
| "step": 700 | |
| }, | |
| { | |
| "epoch": 0.8674101610904585, | |
| "eval_loss": 0.4948059320449829, | |
| "eval_runtime": 113.1788, | |
| "eval_samples_per_second": 1.785, | |
| "eval_steps_per_second": 0.23, | |
| "step": 700 | |
| }, | |
| { | |
| "epoch": 0.929368029739777, | |
| "grad_norm": 2.2332139015197754, | |
| "learning_rate": 6.2812812812812815e-06, | |
| "loss": 0.491, | |
| "step": 750 | |
| }, | |
| { | |
| "epoch": 0.929368029739777, | |
| "eval_loss": 0.49081042408943176, | |
| "eval_runtime": 112.7157, | |
| "eval_samples_per_second": 1.792, | |
| "eval_steps_per_second": 0.231, | |
| "step": 750 | |
| }, | |
| { | |
| "epoch": 0.9913258983890955, | |
| "grad_norm": 1.5069801807403564, | |
| "learning_rate": 5.03003003003003e-06, | |
| "loss": 0.4795, | |
| "step": 800 | |
| }, | |
| { | |
| "epoch": 0.9913258983890955, | |
| "eval_loss": 0.48919081687927246, | |
| "eval_runtime": 113.1009, | |
| "eval_samples_per_second": 1.786, | |
| "eval_steps_per_second": 0.23, | |
| "step": 800 | |
| } | |
| ], | |
| "logging_steps": 50, | |
| "max_steps": 1000, | |
| "num_input_tokens_seen": 0, | |
| "num_train_epochs": 2, | |
| "save_steps": 50, | |
| "stateful_callbacks": { | |
| "TrainerControl": { | |
| "args": { | |
| "should_epoch_stop": false, | |
| "should_evaluate": false, | |
| "should_log": false, | |
| "should_save": true, | |
| "should_training_stop": false | |
| }, | |
| "attributes": {} | |
| } | |
| }, | |
| "total_flos": 4494640152576000.0, | |
| "train_batch_size": 2, | |
| "trial_name": null, | |
| "trial_params": null | |
| } | |