{ "best_global_step": null, "best_metric": null, "best_model_checkpoint": null, "epoch": 0.9230769230769231, "eval_steps": 500, "global_step": 12, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "epoch": 0.38461538461538464, "grad_norm": 324.0, "learning_rate": 2.8032770122273748e-05, "logits/chosen": -4.008616924285889, "logits/rejected": -3.9074325561523438, "logps/chosen": -6.578675746917725, "logps/rejected": -6.709109306335449, "loss": 25.12, "rewards/accuracies": 0.515625, "rewards/chosen": -0.014975759200751781, "rewards/margins": 0.00037566880928352475, "rewards/rejected": -0.015351429581642151, "step": 5 }, { "epoch": 0.7692307692307693, "grad_norm": 326.0, "learning_rate": 6.307373277511592e-05, "logits/chosen": -3.9267916679382324, "logits/rejected": -3.806602954864502, "logps/chosen": -6.459668159484863, "logps/rejected": -7.284135341644287, "loss": 21.4875, "rewards/accuracies": 0.621874988079071, "rewards/chosen": -0.009770961478352547, "rewards/margins": 0.058142371475696564, "rewards/rejected": -0.06791333854198456, "step": 10 }, { "epoch": 0.9230769230769231, "eval_logits/chosen": -3.4977667331695557, "eval_logits/rejected": -3.4567360877990723, "eval_logps/chosen": -7.072432041168213, "eval_logps/rejected": -7.649731636047363, "eval_loss": 22.01285171508789, "eval_rewards/accuracies": 0.6650000214576721, "eval_rewards/chosen": -0.05798153579235077, "eval_rewards/margins": 0.05125926434993744, "eval_rewards/rejected": -0.10924080014228821, "eval_runtime": 2.3364, "eval_samples_per_second": 85.6, "eval_steps_per_second": 85.6, "step": 12 } ], "logging_steps": 5, "max_steps": 65, "num_input_tokens_seen": 0, "num_train_epochs": 5, "save_steps": 500, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": false }, "attributes": {} } }, "total_flos": 0.0, "train_batch_size": 64, "trial_name": null, "trial_params": null }