| { |
| "best_global_step": null, |
| "best_metric": null, |
| "best_model_checkpoint": null, |
| "epoch": 2.769230769230769, |
| "eval_steps": 500, |
| "global_step": 36, |
| "is_hyper_param_search": false, |
| "is_local_process_zero": true, |
| "is_world_process_zero": true, |
| "log_history": [ |
| { |
| "epoch": 0.38461538461538464, |
| "grad_norm": 328.0, |
| "learning_rate": 9.837012665064328e-06, |
| "logits/chosen": -4.011571884155273, |
| "logits/rejected": -3.9108498096466064, |
| "logps/chosen": -6.5757951736450195, |
| "logps/rejected": -6.684106349945068, |
| "loss": 25.3313, |
| "rewards/accuracies": 0.503125011920929, |
| "rewards/chosen": -0.01468772441148758, |
| "rewards/margins": -0.0018365973373875022, |
| "rewards/rejected": -0.012851126492023468, |
| "step": 5 |
| }, |
| { |
| "epoch": 0.7692307692307693, |
| "grad_norm": 336.0, |
| "learning_rate": 2.2133278496394738e-05, |
| "logits/chosen": -4.007956504821777, |
| "logits/rejected": -3.892199993133545, |
| "logps/chosen": -6.476508140563965, |
| "logps/rejected": -6.814597129821777, |
| "loss": 24.2428, |
| "rewards/accuracies": 0.550000011920929, |
| "rewards/chosen": -0.011455019935965538, |
| "rewards/margins": 0.009504524990916252, |
| "rewards/rejected": -0.02095954492688179, |
| "step": 10 |
| }, |
| { |
| "epoch": 0.9230769230769231, |
| "eval_logits/chosen": -3.8648571968078613, |
| "eval_logits/rejected": -3.8175787925720215, |
| "eval_logps/chosen": -6.708494663238525, |
| "eval_logps/rejected": -6.904192924499512, |
| "eval_loss": 23.919443130493164, |
| "eval_rewards/accuracies": 0.6650000214576721, |
| "eval_rewards/chosen": -0.021587923169136047, |
| "eval_rewards/margins": 0.013099126517772675, |
| "eval_rewards/rejected": -0.03468705341219902, |
| "eval_runtime": 2.3045, |
| "eval_samples_per_second": 86.785, |
| "eval_steps_per_second": 86.785, |
| "step": 12 |
| }, |
| { |
| "epoch": 1.1538461538461537, |
| "grad_norm": 316.0, |
| "learning_rate": 3.442954432772515e-05, |
| "logits/chosen": -3.931385040283203, |
| "logits/rejected": -3.7742533683776855, |
| "logps/chosen": -6.383437156677246, |
| "logps/rejected": -7.210443019866943, |
| "loss": 21.1059, |
| "rewards/accuracies": 0.6767045259475708, |
| "rewards/chosen": -0.013774263672530651, |
| "rewards/margins": 0.052963126450777054, |
| "rewards/rejected": -0.06673739105463028, |
| "step": 15 |
| }, |
| { |
| "epoch": 1.5384615384615383, |
| "grad_norm": 294.0, |
| "learning_rate": 4.6725810159055555e-05, |
| "logits/chosen": -3.8227486610412598, |
| "logits/rejected": -3.7290396690368652, |
| "logps/chosen": -6.481485843658447, |
| "logps/rejected": -7.9080963134765625, |
| "loss": 18.1209, |
| "rewards/accuracies": 0.815625011920929, |
| "rewards/chosen": -0.00985046662390232, |
| "rewards/margins": 0.11460874229669571, |
| "rewards/rejected": -0.12445919215679169, |
| "step": 20 |
| }, |
| { |
| "epoch": 1.8461538461538463, |
| "eval_logits/chosen": -3.344850778579712, |
| "eval_logits/rejected": -3.3098304271698, |
| "eval_logps/chosen": -6.919511318206787, |
| "eval_logps/rejected": -7.514927864074707, |
| "eval_loss": 22.132890701293945, |
| "eval_rewards/accuracies": 0.6449999809265137, |
| "eval_rewards/chosen": -0.04268946498632431, |
| "eval_rewards/margins": 0.0530710332095623, |
| "eval_rewards/rejected": -0.09576048702001572, |
| "eval_runtime": 2.2925, |
| "eval_samples_per_second": 87.242, |
| "eval_steps_per_second": 87.242, |
| "step": 24 |
| }, |
| { |
| "epoch": 1.9230769230769231, |
| "grad_norm": 360.0, |
| "learning_rate": 5.902207599038597e-05, |
| "logits/chosen": -3.528168201446533, |
| "logits/rejected": -3.4186885356903076, |
| "logps/chosen": -6.307492733001709, |
| "logps/rejected": -8.121912956237793, |
| "loss": 16.7445, |
| "rewards/accuracies": 0.7718750238418579, |
| "rewards/chosen": -0.0019027795642614365, |
| "rewards/margins": 0.16127251088619232, |
| "rewards/rejected": -0.1631752997636795, |
| "step": 25 |
| }, |
| { |
| "epoch": 2.3076923076923075, |
| "grad_norm": 300.0, |
| "learning_rate": 7.131834182171638e-05, |
| "logits/chosen": -3.377274751663208, |
| "logits/rejected": -3.336735963821411, |
| "logps/chosen": -5.822231769561768, |
| "logps/rejected": -8.159224510192871, |
| "loss": 12.9372, |
| "rewards/accuracies": 0.8737689852714539, |
| "rewards/chosen": 0.05885304883122444, |
| "rewards/margins": 0.20639033615589142, |
| "rewards/rejected": -0.14753730595111847, |
| "step": 30 |
| }, |
| { |
| "epoch": 2.6923076923076925, |
| "grad_norm": 380.0, |
| "learning_rate": 8.361460765304679e-05, |
| "logits/chosen": -3.175584077835083, |
| "logits/rejected": -3.0830180644989014, |
| "logps/chosen": -5.457265377044678, |
| "logps/rejected": -8.095593452453613, |
| "loss": 11.0462, |
| "rewards/accuracies": 0.890625, |
| "rewards/chosen": 0.08443113416433334, |
| "rewards/margins": 0.236581951379776, |
| "rewards/rejected": -0.15215083956718445, |
| "step": 35 |
| }, |
| { |
| "epoch": 2.769230769230769, |
| "eval_logits/chosen": -2.8886406421661377, |
| "eval_logits/rejected": -2.8580570220947266, |
| "eval_logps/chosen": -7.031093120574951, |
| "eval_logps/rejected": -7.9110846519470215, |
| "eval_loss": 21.225357055664062, |
| "eval_rewards/accuracies": 0.6800000071525574, |
| "eval_rewards/chosen": -0.053847651928663254, |
| "eval_rewards/margins": 0.08152848482131958, |
| "eval_rewards/rejected": -0.13537615537643433, |
| "eval_runtime": 2.2803, |
| "eval_samples_per_second": 87.707, |
| "eval_steps_per_second": 87.707, |
| "step": 36 |
| } |
| ], |
| "logging_steps": 5, |
| "max_steps": 65, |
| "num_input_tokens_seen": 0, |
| "num_train_epochs": 5, |
| "save_steps": 500, |
| "stateful_callbacks": { |
| "TrainerControl": { |
| "args": { |
| "should_epoch_stop": false, |
| "should_evaluate": false, |
| "should_log": false, |
| "should_save": true, |
| "should_training_stop": false |
| }, |
| "attributes": {} |
| } |
| }, |
| "total_flos": 0.0, |
| "train_batch_size": 64, |
| "trial_name": null, |
| "trial_params": null |
| } |
|
|