Direct-MedQA-DPO / trainer_state.json
RAG-Gym's picture
Upload 8 files
f09d47e verified
Raw
History Blame Contribute Delete
8.57 kB
{
"best_metric": null,
"best_model_checkpoint": null,
"epoch": 0.951048951048951,
"eval_steps": 500,
"global_step": 17,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"epoch": 0.055944055944055944,
"grad_norm": 112.59270477294922,
"learning_rate": 1.8823529411764705e-06,
"logits/chosen": 1.0625,
"logits/rejected": 1.125,
"logps/chosen": -17.75,
"logps/rejected": -15.75,
"loss": 0.691,
"rewards/accuracies": 0.03125,
"rewards/chosen": 0.000782012939453125,
"rewards/margins": 0.000782012939453125,
"rewards/rejected": 0.0,
"step": 1
},
{
"epoch": 0.11188811188811189,
"grad_norm": 112.73638153076172,
"learning_rate": 1.764705882352941e-06,
"logits/chosen": 1.046875,
"logits/rejected": 1.09375,
"logps/chosen": -17.625,
"logps/rejected": -15.9375,
"loss": 0.691,
"rewards/accuracies": 0.46875,
"rewards/chosen": 0.0009765625,
"rewards/margins": 0.0033111572265625,
"rewards/rejected": -0.0023345947265625,
"step": 2
},
{
"epoch": 0.16783216783216784,
"grad_norm": 108.02386474609375,
"learning_rate": 1.6470588235294116e-06,
"logits/chosen": 1.03125,
"logits/rejected": 1.1015625,
"logps/chosen": -17.5,
"logps/rejected": -16.0,
"loss": 0.6902,
"rewards/accuracies": 0.40625,
"rewards/chosen": 0.00921630859375,
"rewards/margins": 0.00567626953125,
"rewards/rejected": 0.0035247802734375,
"step": 3
},
{
"epoch": 0.22377622377622378,
"grad_norm": 96.84840393066406,
"learning_rate": 1.5294117647058821e-06,
"logits/chosen": 1.078125,
"logits/rejected": 1.125,
"logps/chosen": -17.25,
"logps/rejected": -15.8125,
"loss": 0.6899,
"rewards/accuracies": 0.53125,
"rewards/chosen": 0.00921630859375,
"rewards/margins": 0.00567626953125,
"rewards/rejected": 0.0035247802734375,
"step": 4
},
{
"epoch": 0.27972027972027974,
"grad_norm": 104.06653594970703,
"learning_rate": 1.411764705882353e-06,
"logits/chosen": 1.0859375,
"logits/rejected": 1.1328125,
"logps/chosen": -17.375,
"logps/rejected": -15.875,
"loss": 0.6913,
"rewards/accuracies": 0.4375,
"rewards/chosen": 0.0113525390625,
"rewards/margins": 0.0035247802734375,
"rewards/rejected": 0.0078125,
"step": 5
},
{
"epoch": 0.3356643356643357,
"grad_norm": 103.72679901123047,
"learning_rate": 1.2941176470588235e-06,
"logits/chosen": 1.0546875,
"logits/rejected": 1.1015625,
"logps/chosen": -16.75,
"logps/rejected": -16.0,
"loss": 0.6918,
"rewards/accuracies": 0.4375,
"rewards/chosen": 0.015625,
"rewards/margins": 0.0025482177734375,
"rewards/rejected": 0.01312255859375,
"step": 6
},
{
"epoch": 0.3916083916083916,
"grad_norm": 91.84857177734375,
"learning_rate": 1.176470588235294e-06,
"logits/chosen": 1.09375,
"logits/rejected": 1.109375,
"logps/chosen": -16.5,
"logps/rejected": -15.8125,
"loss": 0.6897,
"rewards/accuracies": 0.59375,
"rewards/chosen": 0.0208740234375,
"rewards/margins": 0.007049560546875,
"rewards/rejected": 0.01385498046875,
"step": 7
},
{
"epoch": 0.44755244755244755,
"grad_norm": 95.65518188476562,
"learning_rate": 1.0588235294117646e-06,
"logits/chosen": 1.0234375,
"logits/rejected": 1.0859375,
"logps/chosen": -17.5,
"logps/rejected": -15.6875,
"loss": 0.689,
"rewards/accuracies": 0.53125,
"rewards/chosen": 0.0263671875,
"rewards/margins": 0.00836181640625,
"rewards/rejected": 0.0179443359375,
"step": 8
},
{
"epoch": 0.5034965034965035,
"grad_norm": 96.71415710449219,
"learning_rate": 9.411764705882352e-07,
"logits/chosen": 1.078125,
"logits/rejected": 1.109375,
"logps/chosen": -16.75,
"logps/rejected": -15.9375,
"loss": 0.6836,
"rewards/accuracies": 0.59375,
"rewards/chosen": 0.03125,
"rewards/margins": 0.01953125,
"rewards/rejected": 0.01171875,
"step": 9
},
{
"epoch": 0.5594405594405595,
"grad_norm": 101.46381378173828,
"learning_rate": 8.235294117647058e-07,
"logits/chosen": 1.046875,
"logits/rejected": 1.09375,
"logps/chosen": -16.875,
"logps/rejected": -15.625,
"loss": 0.6866,
"rewards/accuracies": 0.625,
"rewards/chosen": 0.032470703125,
"rewards/margins": 0.0133056640625,
"rewards/rejected": 0.0191650390625,
"step": 10
},
{
"epoch": 0.6153846153846154,
"grad_norm": 102.90161895751953,
"learning_rate": 7.058823529411765e-07,
"logits/chosen": 1.0859375,
"logits/rejected": 1.1171875,
"logps/chosen": -16.875,
"logps/rejected": -15.8125,
"loss": 0.6827,
"rewards/accuracies": 0.65625,
"rewards/chosen": 0.0390625,
"rewards/margins": 0.0208740234375,
"rewards/rejected": 0.0181884765625,
"step": 11
},
{
"epoch": 0.6713286713286714,
"grad_norm": 97.20207214355469,
"learning_rate": 5.88235294117647e-07,
"logits/chosen": 1.078125,
"logits/rejected": 1.09375,
"logps/chosen": -16.5,
"logps/rejected": -15.9375,
"loss": 0.691,
"rewards/accuracies": 0.53125,
"rewards/chosen": 0.0213623046875,
"rewards/margins": 0.004730224609375,
"rewards/rejected": 0.0166015625,
"step": 12
},
{
"epoch": 0.7272727272727273,
"grad_norm": 88.96224975585938,
"learning_rate": 4.705882352941176e-07,
"logits/chosen": 1.0859375,
"logits/rejected": 1.125,
"logps/chosen": -16.875,
"logps/rejected": -15.625,
"loss": 0.6809,
"rewards/accuracies": 0.6875,
"rewards/chosen": 0.03955078125,
"rewards/margins": 0.025146484375,
"rewards/rejected": 0.01446533203125,
"step": 13
},
{
"epoch": 0.7832167832167832,
"grad_norm": 85.17412567138672,
"learning_rate": 3.529411764705882e-07,
"logits/chosen": 1.0859375,
"logits/rejected": 1.1171875,
"logps/chosen": -16.625,
"logps/rejected": -15.8125,
"loss": 0.6852,
"rewards/accuracies": 0.5625,
"rewards/chosen": 0.0380859375,
"rewards/margins": 0.0164794921875,
"rewards/rejected": 0.021728515625,
"step": 14
},
{
"epoch": 0.8391608391608392,
"grad_norm": 99.89457702636719,
"learning_rate": 2.352941176470588e-07,
"logits/chosen": 1.0703125,
"logits/rejected": 1.1171875,
"logps/chosen": -17.25,
"logps/rejected": -15.75,
"loss": 0.678,
"rewards/accuracies": 0.71875,
"rewards/chosen": 0.048095703125,
"rewards/margins": 0.03125,
"rewards/rejected": 0.016845703125,
"step": 15
},
{
"epoch": 0.8951048951048951,
"grad_norm": 100.7333984375,
"learning_rate": 1.176470588235294e-07,
"logits/chosen": 1.0703125,
"logits/rejected": 1.1171875,
"logps/chosen": -17.25,
"logps/rejected": -15.75,
"loss": 0.6777,
"rewards/accuracies": 0.59375,
"rewards/chosen": 0.060546875,
"rewards/margins": 0.0322265625,
"rewards/rejected": 0.0283203125,
"step": 16
},
{
"epoch": 0.951048951048951,
"grad_norm": 92.44598388671875,
"learning_rate": 0.0,
"logits/chosen": 1.0546875,
"logits/rejected": 1.09375,
"logps/chosen": -16.875,
"logps/rejected": -16.0,
"loss": 0.683,
"rewards/accuracies": 0.5625,
"rewards/chosen": 0.043701171875,
"rewards/margins": 0.021240234375,
"rewards/rejected": 0.0224609375,
"step": 17
}
],
"logging_steps": 1,
"max_steps": 17,
"num_input_tokens_seen": 0,
"num_train_epochs": 1,
"save_steps": 500,
"stateful_callbacks": {
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": true,
"should_training_stop": true
},
"attributes": {}
}
},
"total_flos": 0.0,
"train_batch_size": 1,
"trial_name": null,
"trial_params": null
}