dpotest_gg_3 / trainer_state.json
Gege24's picture
Upload task output 5fbe61c9-2138-459b-b386-fdff9df1e95f
d7ab69b verified
Raw
History Blame Contribute Delete
6.28 kB
{
"best_global_step": null,
"best_metric": null,
"best_model_checkpoint": null,
"epoch": 2.769230769230769,
"eval_steps": 500,
"global_step": 36,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"epoch": 0.38461538461538464,
"grad_norm": 328.0,
"learning_rate": 9.837012665064328e-06,
"logits/chosen": -4.011571884155273,
"logits/rejected": -3.9108498096466064,
"logps/chosen": -6.5757951736450195,
"logps/rejected": -6.684106349945068,
"loss": 25.3313,
"rewards/accuracies": 0.503125011920929,
"rewards/chosen": -0.01468772441148758,
"rewards/margins": -0.0018365973373875022,
"rewards/rejected": -0.012851126492023468,
"step": 5
},
{
"epoch": 0.7692307692307693,
"grad_norm": 336.0,
"learning_rate": 2.2133278496394738e-05,
"logits/chosen": -4.007956504821777,
"logits/rejected": -3.892199993133545,
"logps/chosen": -6.476508140563965,
"logps/rejected": -6.814597129821777,
"loss": 24.2428,
"rewards/accuracies": 0.550000011920929,
"rewards/chosen": -0.011455019935965538,
"rewards/margins": 0.009504524990916252,
"rewards/rejected": -0.02095954492688179,
"step": 10
},
{
"epoch": 0.9230769230769231,
"eval_logits/chosen": -3.8648571968078613,
"eval_logits/rejected": -3.8175787925720215,
"eval_logps/chosen": -6.708494663238525,
"eval_logps/rejected": -6.904192924499512,
"eval_loss": 23.919443130493164,
"eval_rewards/accuracies": 0.6650000214576721,
"eval_rewards/chosen": -0.021587923169136047,
"eval_rewards/margins": 0.013099126517772675,
"eval_rewards/rejected": -0.03468705341219902,
"eval_runtime": 2.3045,
"eval_samples_per_second": 86.785,
"eval_steps_per_second": 86.785,
"step": 12
},
{
"epoch": 1.1538461538461537,
"grad_norm": 316.0,
"learning_rate": 3.442954432772515e-05,
"logits/chosen": -3.931385040283203,
"logits/rejected": -3.7742533683776855,
"logps/chosen": -6.383437156677246,
"logps/rejected": -7.210443019866943,
"loss": 21.1059,
"rewards/accuracies": 0.6767045259475708,
"rewards/chosen": -0.013774263672530651,
"rewards/margins": 0.052963126450777054,
"rewards/rejected": -0.06673739105463028,
"step": 15
},
{
"epoch": 1.5384615384615383,
"grad_norm": 294.0,
"learning_rate": 4.6725810159055555e-05,
"logits/chosen": -3.8227486610412598,
"logits/rejected": -3.7290396690368652,
"logps/chosen": -6.481485843658447,
"logps/rejected": -7.9080963134765625,
"loss": 18.1209,
"rewards/accuracies": 0.815625011920929,
"rewards/chosen": -0.00985046662390232,
"rewards/margins": 0.11460874229669571,
"rewards/rejected": -0.12445919215679169,
"step": 20
},
{
"epoch": 1.8461538461538463,
"eval_logits/chosen": -3.344850778579712,
"eval_logits/rejected": -3.3098304271698,
"eval_logps/chosen": -6.919511318206787,
"eval_logps/rejected": -7.514927864074707,
"eval_loss": 22.132890701293945,
"eval_rewards/accuracies": 0.6449999809265137,
"eval_rewards/chosen": -0.04268946498632431,
"eval_rewards/margins": 0.0530710332095623,
"eval_rewards/rejected": -0.09576048702001572,
"eval_runtime": 2.2925,
"eval_samples_per_second": 87.242,
"eval_steps_per_second": 87.242,
"step": 24
},
{
"epoch": 1.9230769230769231,
"grad_norm": 360.0,
"learning_rate": 5.902207599038597e-05,
"logits/chosen": -3.528168201446533,
"logits/rejected": -3.4186885356903076,
"logps/chosen": -6.307492733001709,
"logps/rejected": -8.121912956237793,
"loss": 16.7445,
"rewards/accuracies": 0.7718750238418579,
"rewards/chosen": -0.0019027795642614365,
"rewards/margins": 0.16127251088619232,
"rewards/rejected": -0.1631752997636795,
"step": 25
},
{
"epoch": 2.3076923076923075,
"grad_norm": 300.0,
"learning_rate": 7.131834182171638e-05,
"logits/chosen": -3.377274751663208,
"logits/rejected": -3.336735963821411,
"logps/chosen": -5.822231769561768,
"logps/rejected": -8.159224510192871,
"loss": 12.9372,
"rewards/accuracies": 0.8737689852714539,
"rewards/chosen": 0.05885304883122444,
"rewards/margins": 0.20639033615589142,
"rewards/rejected": -0.14753730595111847,
"step": 30
},
{
"epoch": 2.6923076923076925,
"grad_norm": 380.0,
"learning_rate": 8.361460765304679e-05,
"logits/chosen": -3.175584077835083,
"logits/rejected": -3.0830180644989014,
"logps/chosen": -5.457265377044678,
"logps/rejected": -8.095593452453613,
"loss": 11.0462,
"rewards/accuracies": 0.890625,
"rewards/chosen": 0.08443113416433334,
"rewards/margins": 0.236581951379776,
"rewards/rejected": -0.15215083956718445,
"step": 35
},
{
"epoch": 2.769230769230769,
"eval_logits/chosen": -2.8886406421661377,
"eval_logits/rejected": -2.8580570220947266,
"eval_logps/chosen": -7.031093120574951,
"eval_logps/rejected": -7.9110846519470215,
"eval_loss": 21.225357055664062,
"eval_rewards/accuracies": 0.6800000071525574,
"eval_rewards/chosen": -0.053847651928663254,
"eval_rewards/margins": 0.08152848482131958,
"eval_rewards/rejected": -0.13537615537643433,
"eval_runtime": 2.2803,
"eval_samples_per_second": 87.707,
"eval_steps_per_second": 87.707,
"step": 36
}
],
"logging_steps": 5,
"max_steps": 65,
"num_input_tokens_seen": 0,
"num_train_epochs": 5,
"save_steps": 500,
"stateful_callbacks": {
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": true,
"should_training_stop": false
},
"attributes": {}
}
},
"total_flos": 0.0,
"train_batch_size": 64,
"trial_name": null,
"trial_params": null
}