{ "best_global_step": null, "best_metric": null, "best_model_checkpoint": null, "epoch": 3.6923076923076925, "eval_steps": 500, "global_step": 48, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "epoch": 0.38461538461538464, "grad_norm": 6.9375, "learning_rate": 4.708290280058699e-07, "logits/chosen": -4.012143611907959, "logits/rejected": -3.9117088317871094, "logps/chosen": -27.54085350036621, "logps/rejected": -28.105239868164062, "loss": 0.6996, "rewards/accuracies": 0.49687498807907104, "rewards/chosen": -0.060307908803224564, "rewards/margins": -0.006133540067821741, "rewards/rejected": -0.05417437106370926, "step": 5 }, { "epoch": 0.7692307692307693, "grad_norm": 7.375, "learning_rate": 1.0593653130132072e-06, "logits/chosen": -4.017362117767334, "logits/rejected": -3.906172513961792, "logps/chosen": -27.55423355102539, "logps/rejected": -28.075714111328125, "loss": 0.7001, "rewards/accuracies": 0.4593749940395355, "rewards/chosen": -0.05914067476987839, "rewards/margins": -0.008280659094452858, "rewards/rejected": -0.05086001753807068, "step": 10 }, { "epoch": 0.9230769230769231, "eval_logits/chosen": -3.926405906677246, "eval_logits/rejected": -3.88484263420105, "eval_logps/chosen": -28.034067153930664, "eval_logps/rejected": -30.699705123901367, "eval_loss": 0.6927853226661682, "eval_rewards/accuracies": 0.5350000262260437, "eval_rewards/chosen": 0.0003482414176687598, "eval_rewards/margins": 0.0007382288458757102, "eval_rewards/rejected": -0.00038998748641461134, "eval_runtime": 2.3408, "eval_samples_per_second": 85.439, "eval_steps_per_second": 85.439, "step": 12 }, { "epoch": 1.1538461538461537, "grad_norm": 7.34375, "learning_rate": 1.6479015980205448e-06, "logits/chosen": -3.9834656715393066, "logits/rejected": -3.840578556060791, "logps/chosen": -27.485614776611328, "logps/rejected": -28.10161781311035, "loss": 0.6972, "rewards/accuracies": 0.49621209502220154, "rewards/chosen": -0.06247218698263168, "rewards/margins": -0.0015615280717611313, "rewards/rejected": -0.0609106607735157, "step": 15 }, { "epoch": 1.5384615384615383, "grad_norm": 7.75, "learning_rate": 2.236437883027882e-06, "logits/chosen": -4.032500743865967, "logits/rejected": -3.943988800048828, "logps/chosen": -27.166378021240234, "logps/rejected": -27.592472076416016, "loss": 0.6971, "rewards/accuracies": 0.5, "rewards/chosen": -0.056408680975437164, "rewards/margins": -0.001882375800050795, "rewards/rejected": -0.05452630668878555, "step": 20 }, { "epoch": 1.8461538461538463, "eval_logits/chosen": -3.9240834712982178, "eval_logits/rejected": -3.8822319507598877, "eval_logps/chosen": -28.04541778564453, "eval_logps/rejected": -30.720582962036133, "eval_loss": 0.6926065683364868, "eval_rewards/accuracies": 0.5550000071525574, "eval_rewards/chosen": -0.00017397981719113886, "eval_rewards/margins": 0.0010972179006785154, "eval_rewards/rejected": -0.0012711978051811457, "eval_runtime": 2.306, "eval_samples_per_second": 86.731, "eval_steps_per_second": 86.731, "step": 24 }, { "epoch": 1.9230769230769231, "grad_norm": 8.6875, "learning_rate": 2.8249741680352196e-06, "logits/chosen": -3.9794921875, "logits/rejected": -3.852832078933716, "logps/chosen": -27.62384033203125, "logps/rejected": -28.47451400756836, "loss": 0.6936, "rewards/accuracies": 0.5062500238418579, "rewards/chosen": -0.0576423816382885, "rewards/margins": 0.006730812601745129, "rewards/rejected": -0.0643731951713562, "step": 25 }, { "epoch": 2.3076923076923075, "grad_norm": 8.3125, "learning_rate": 3.4135104530425568e-06, "logits/chosen": -4.015521049499512, "logits/rejected": -3.958658218383789, "logps/chosen": -27.597198486328125, "logps/rejected": -28.10772132873535, "loss": 0.7022, "rewards/accuracies": 0.4940341114997864, "rewards/chosen": -0.05957310274243355, "rewards/margins": -0.011498005129396915, "rewards/rejected": -0.04807509481906891, "step": 30 }, { "epoch": 2.6923076923076925, "grad_norm": 8.0, "learning_rate": 4.002046738049894e-06, "logits/chosen": -3.974912643432617, "logits/rejected": -3.8793323040008545, "logps/chosen": -27.144947052001953, "logps/rejected": -27.934412002563477, "loss": 0.6963, "rewards/accuracies": 0.515625, "rewards/chosen": -0.06426174938678741, "rewards/margins": 0.0010266598546877503, "rewards/rejected": -0.06528842449188232, "step": 35 }, { "epoch": 2.769230769230769, "eval_logits/chosen": -3.918003797531128, "eval_logits/rejected": -3.875520944595337, "eval_logps/chosen": -28.07503890991211, "eval_logps/rejected": -30.783376693725586, "eval_loss": 0.6909805536270142, "eval_rewards/accuracies": 0.574999988079071, "eval_rewards/chosen": -0.0031362976878881454, "eval_rewards/margins": 0.004414236638695002, "eval_rewards/rejected": -0.007550534792244434, "eval_runtime": 2.3146, "eval_samples_per_second": 86.408, "eval_steps_per_second": 86.408, "step": 36 }, { "epoch": 3.076923076923077, "grad_norm": 7.8125, "learning_rate": 3.9861897027011495e-06, "logits/chosen": -4.010741710662842, "logits/rejected": -3.8427538871765137, "logps/chosen": -27.8968448638916, "logps/rejected": -28.60370445251465, "loss": 0.6927, "rewards/accuracies": 0.5026515126228333, "rewards/chosen": -0.07123393565416336, "rewards/margins": 0.00865729060024023, "rewards/rejected": -0.07989122718572617, "step": 40 }, { "epoch": 3.4615384615384617, "grad_norm": 7.53125, "learning_rate": 3.4829202374186716e-06, "logits/chosen": -4.0228962898254395, "logits/rejected": -3.9077537059783936, "logps/chosen": -27.418827056884766, "logps/rejected": -28.112506866455078, "loss": 0.6957, "rewards/accuracies": 0.5062500238418579, "rewards/chosen": -0.06953997910022736, "rewards/margins": 0.000948831788264215, "rewards/rejected": -0.0704888105392456, "step": 45 }, { "epoch": 3.6923076923076925, "eval_logits/chosen": -3.9120235443115234, "eval_logits/rejected": -3.869976758956909, "eval_logps/chosen": -28.11831283569336, "eval_logps/rejected": -30.877779006958008, "eval_loss": 0.6903982758522034, "eval_rewards/accuracies": 0.6000000238418579, "eval_rewards/chosen": -0.005011914297938347, "eval_rewards/margins": 0.005597901530563831, "eval_rewards/rejected": -0.010609814897179604, "eval_runtime": 2.311, "eval_samples_per_second": 86.541, "eval_steps_per_second": 86.541, "step": 48 } ], "logging_steps": 5, "max_steps": 65, "num_input_tokens_seen": 0, "num_train_epochs": 5, "save_steps": 500, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": false }, "attributes": {} } }, "total_flos": 0.0, "train_batch_size": 64, "trial_name": null, "trial_params": null }