| { |
| "best_global_step": null, |
| "best_metric": null, |
| "best_model_checkpoint": null, |
| "epoch": 0.9230769230769231, |
| "eval_steps": 500, |
| "global_step": 12, |
| "is_hyper_param_search": false, |
| "is_local_process_zero": true, |
| "is_world_process_zero": true, |
| "log_history": [ |
| { |
| "epoch": 0.38461538461538464, |
| "grad_norm": 324.0, |
| "learning_rate": 2.8032770122273748e-05, |
| "logits/chosen": -4.008616924285889, |
| "logits/rejected": -3.9074325561523438, |
| "logps/chosen": -6.578675746917725, |
| "logps/rejected": -6.709109306335449, |
| "loss": 25.12, |
| "rewards/accuracies": 0.515625, |
| "rewards/chosen": -0.014975759200751781, |
| "rewards/margins": 0.00037566880928352475, |
| "rewards/rejected": -0.015351429581642151, |
| "step": 5 |
| }, |
| { |
| "epoch": 0.7692307692307693, |
| "grad_norm": 326.0, |
| "learning_rate": 6.307373277511592e-05, |
| "logits/chosen": -3.9267916679382324, |
| "logits/rejected": -3.806602954864502, |
| "logps/chosen": -6.459668159484863, |
| "logps/rejected": -7.284135341644287, |
| "loss": 21.4875, |
| "rewards/accuracies": 0.621874988079071, |
| "rewards/chosen": -0.009770961478352547, |
| "rewards/margins": 0.058142371475696564, |
| "rewards/rejected": -0.06791333854198456, |
| "step": 10 |
| }, |
| { |
| "epoch": 0.9230769230769231, |
| "eval_logits/chosen": -3.4977667331695557, |
| "eval_logits/rejected": -3.4567360877990723, |
| "eval_logps/chosen": -7.072432041168213, |
| "eval_logps/rejected": -7.649731636047363, |
| "eval_loss": 22.01285171508789, |
| "eval_rewards/accuracies": 0.6650000214576721, |
| "eval_rewards/chosen": -0.05798153579235077, |
| "eval_rewards/margins": 0.05125926434993744, |
| "eval_rewards/rejected": -0.10924080014228821, |
| "eval_runtime": 2.3364, |
| "eval_samples_per_second": 85.6, |
| "eval_steps_per_second": 85.6, |
| "step": 12 |
| } |
| ], |
| "logging_steps": 5, |
| "max_steps": 65, |
| "num_input_tokens_seen": 0, |
| "num_train_epochs": 5, |
| "save_steps": 500, |
| "stateful_callbacks": { |
| "TrainerControl": { |
| "args": { |
| "should_epoch_stop": false, |
| "should_evaluate": false, |
| "should_log": false, |
| "should_save": true, |
| "should_training_stop": false |
| }, |
| "attributes": {} |
| } |
| }, |
| "total_flos": 0.0, |
| "train_batch_size": 64, |
| "trial_name": null, |
| "trial_params": null |
| } |
|
|