{ "best_global_step": null, "best_metric": null, "best_model_checkpoint": null, "epoch": 2.769230769230769, "eval_steps": 500, "global_step": 36, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "epoch": 0.38461538461538464, "grad_norm": 328.0, "learning_rate": 9.837012665064328e-06, "logits/chosen": -4.011571884155273, "logits/rejected": -3.9108498096466064, "logps/chosen": -6.5757951736450195, "logps/rejected": -6.684106349945068, "loss": 25.3313, "rewards/accuracies": 0.503125011920929, "rewards/chosen": -0.01468772441148758, "rewards/margins": -0.0018365973373875022, "rewards/rejected": -0.012851126492023468, "step": 5 }, { "epoch": 0.7692307692307693, "grad_norm": 336.0, "learning_rate": 2.2133278496394738e-05, "logits/chosen": -4.007956504821777, "logits/rejected": -3.892199993133545, "logps/chosen": -6.476508140563965, "logps/rejected": -6.814597129821777, "loss": 24.2428, "rewards/accuracies": 0.550000011920929, "rewards/chosen": -0.011455019935965538, "rewards/margins": 0.009504524990916252, "rewards/rejected": -0.02095954492688179, "step": 10 }, { "epoch": 0.9230769230769231, "eval_logits/chosen": -3.8648571968078613, "eval_logits/rejected": -3.8175787925720215, "eval_logps/chosen": -6.708494663238525, "eval_logps/rejected": -6.904192924499512, "eval_loss": 23.919443130493164, "eval_rewards/accuracies": 0.6650000214576721, "eval_rewards/chosen": -0.021587923169136047, "eval_rewards/margins": 0.013099126517772675, "eval_rewards/rejected": -0.03468705341219902, "eval_runtime": 2.3045, "eval_samples_per_second": 86.785, "eval_steps_per_second": 86.785, "step": 12 }, { "epoch": 1.1538461538461537, "grad_norm": 316.0, "learning_rate": 3.442954432772515e-05, "logits/chosen": -3.931385040283203, "logits/rejected": -3.7742533683776855, "logps/chosen": -6.383437156677246, "logps/rejected": -7.210443019866943, "loss": 21.1059, "rewards/accuracies": 0.6767045259475708, "rewards/chosen": -0.013774263672530651, "rewards/margins": 0.052963126450777054, "rewards/rejected": -0.06673739105463028, "step": 15 }, { "epoch": 1.5384615384615383, "grad_norm": 294.0, "learning_rate": 4.6725810159055555e-05, "logits/chosen": -3.8227486610412598, "logits/rejected": -3.7290396690368652, "logps/chosen": -6.481485843658447, "logps/rejected": -7.9080963134765625, "loss": 18.1209, "rewards/accuracies": 0.815625011920929, "rewards/chosen": -0.00985046662390232, "rewards/margins": 0.11460874229669571, "rewards/rejected": -0.12445919215679169, "step": 20 }, { "epoch": 1.8461538461538463, "eval_logits/chosen": -3.344850778579712, "eval_logits/rejected": -3.3098304271698, "eval_logps/chosen": -6.919511318206787, "eval_logps/rejected": -7.514927864074707, "eval_loss": 22.132890701293945, "eval_rewards/accuracies": 0.6449999809265137, "eval_rewards/chosen": -0.04268946498632431, "eval_rewards/margins": 0.0530710332095623, "eval_rewards/rejected": -0.09576048702001572, "eval_runtime": 2.2925, "eval_samples_per_second": 87.242, "eval_steps_per_second": 87.242, "step": 24 }, { "epoch": 1.9230769230769231, "grad_norm": 360.0, "learning_rate": 5.902207599038597e-05, "logits/chosen": -3.528168201446533, "logits/rejected": -3.4186885356903076, "logps/chosen": -6.307492733001709, "logps/rejected": -8.121912956237793, "loss": 16.7445, "rewards/accuracies": 0.7718750238418579, "rewards/chosen": -0.0019027795642614365, "rewards/margins": 0.16127251088619232, "rewards/rejected": -0.1631752997636795, "step": 25 }, { "epoch": 2.3076923076923075, "grad_norm": 300.0, "learning_rate": 7.131834182171638e-05, "logits/chosen": -3.377274751663208, "logits/rejected": -3.336735963821411, "logps/chosen": -5.822231769561768, "logps/rejected": -8.159224510192871, "loss": 12.9372, "rewards/accuracies": 0.8737689852714539, "rewards/chosen": 0.05885304883122444, "rewards/margins": 0.20639033615589142, "rewards/rejected": -0.14753730595111847, "step": 30 }, { "epoch": 2.6923076923076925, "grad_norm": 380.0, "learning_rate": 8.361460765304679e-05, "logits/chosen": -3.175584077835083, "logits/rejected": -3.0830180644989014, "logps/chosen": -5.457265377044678, "logps/rejected": -8.095593452453613, "loss": 11.0462, "rewards/accuracies": 0.890625, "rewards/chosen": 0.08443113416433334, "rewards/margins": 0.236581951379776, "rewards/rejected": -0.15215083956718445, "step": 35 }, { "epoch": 2.769230769230769, "eval_logits/chosen": -2.8886406421661377, "eval_logits/rejected": -2.8580570220947266, "eval_logps/chosen": -7.031093120574951, "eval_logps/rejected": -7.9110846519470215, "eval_loss": 21.225357055664062, "eval_rewards/accuracies": 0.6800000071525574, "eval_rewards/chosen": -0.053847651928663254, "eval_rewards/margins": 0.08152848482131958, "eval_rewards/rejected": -0.13537615537643433, "eval_runtime": 2.2803, "eval_samples_per_second": 87.707, "eval_steps_per_second": 87.707, "step": 36 } ], "logging_steps": 5, "max_steps": 65, "num_input_tokens_seen": 0, "num_train_epochs": 5, "save_steps": 500, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": false }, "attributes": {} } }, "total_flos": 0.0, "train_batch_size": 64, "trial_name": null, "trial_params": null }