RAG-MedQA-DPO / trainer_state.json
RAG-Gym's picture
Upload 8 files
e083b3e verified
Raw
History Blame Contribute Delete
126 kB
{
"best_metric": null,
"best_model_checkpoint": null,
"epoch": 0.9989708404802744,
"eval_steps": 500,
"global_step": 273,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"epoch": 0.003659233847913093,
"grad_norm": 346.33831787109375,
"learning_rate": 1.9926739926739927e-06,
"logits/chosen": -0.64453125,
"logits/rejected": -0.62890625,
"logps/chosen": -162.0,
"logps/rejected": -163.0,
"loss": 0.6914,
"rewards/accuracies": 0.0,
"rewards/chosen": 0.0,
"rewards/margins": 0.0,
"rewards/rejected": 0.0,
"step": 1
},
{
"epoch": 0.007318467695826186,
"grad_norm": 344.1603698730469,
"learning_rate": 1.9853479853479855e-06,
"logits/chosen": -0.609375,
"logits/rejected": -0.625,
"logps/chosen": -139.0,
"logps/rejected": -188.0,
"loss": 0.7092,
"rewards/accuracies": 0.25,
"rewards/chosen": -0.00860595703125,
"rewards/margins": -0.038330078125,
"rewards/rejected": 0.0296630859375,
"step": 2
},
{
"epoch": 0.010977701543739279,
"grad_norm": 321.5267028808594,
"learning_rate": 1.978021978021978e-06,
"logits/chosen": -0.65625,
"logits/rejected": -0.6171875,
"logps/chosen": -145.0,
"logps/rejected": -188.0,
"loss": 0.6973,
"rewards/accuracies": 0.28125,
"rewards/chosen": -0.005462646484375,
"rewards/margins": -0.00860595703125,
"rewards/rejected": 0.0031280517578125,
"step": 3
},
{
"epoch": 0.014636935391652372,
"grad_norm": 338.7471923828125,
"learning_rate": 1.9706959706959706e-06,
"logits/chosen": -0.5625,
"logits/rejected": -0.60546875,
"logps/chosen": -160.0,
"logps/rejected": -189.0,
"loss": 0.6735,
"rewards/accuracies": 0.46875,
"rewards/chosen": 0.0218505859375,
"rewards/margins": 0.035888671875,
"rewards/rejected": -0.01409912109375,
"step": 4
},
{
"epoch": 0.018296169239565466,
"grad_norm": 315.54010009765625,
"learning_rate": 1.9633699633699634e-06,
"logits/chosen": -0.55859375,
"logits/rejected": -0.58203125,
"logps/chosen": -181.0,
"logps/rejected": -195.0,
"loss": 0.6837,
"rewards/accuracies": 0.46875,
"rewards/chosen": 0.0031280517578125,
"rewards/margins": 0.0218505859375,
"rewards/rejected": -0.018798828125,
"step": 5
},
{
"epoch": 0.021955403087478557,
"grad_norm": 321.4845886230469,
"learning_rate": 1.9560439560439557e-06,
"logits/chosen": -0.6484375,
"logits/rejected": -0.6484375,
"logps/chosen": -177.0,
"logps/rejected": -179.0,
"loss": 0.6964,
"rewards/accuracies": 0.375,
"rewards/chosen": -0.0234375,
"rewards/margins": -7.62939453125e-06,
"rewards/rejected": -0.0234375,
"step": 6
},
{
"epoch": 0.025614636935391653,
"grad_norm": 330.94757080078125,
"learning_rate": 1.9487179487179485e-06,
"logits/chosen": -0.640625,
"logits/rejected": -0.63671875,
"logps/chosen": -145.0,
"logps/rejected": -167.0,
"loss": 0.6996,
"rewards/accuracies": 0.375,
"rewards/chosen": -0.0218505859375,
"rewards/margins": -0.01251220703125,
"rewards/rejected": -0.0093994140625,
"step": 7
},
{
"epoch": 0.029273870783304744,
"grad_norm": 348.64080810546875,
"learning_rate": 1.9413919413919413e-06,
"logits/chosen": -0.59765625,
"logits/rejected": -0.609375,
"logps/chosen": -169.0,
"logps/rejected": -186.0,
"loss": 0.692,
"rewards/accuracies": 0.375,
"rewards/chosen": -0.016357421875,
"rewards/margins": 0.01019287109375,
"rewards/rejected": -0.026611328125,
"step": 8
},
{
"epoch": 0.03293310463121784,
"grad_norm": 331.8152770996094,
"learning_rate": 1.934065934065934e-06,
"logits/chosen": -0.66015625,
"logits/rejected": -0.640625,
"logps/chosen": -173.0,
"logps/rejected": -182.0,
"loss": 0.6917,
"rewards/accuracies": 0.46875,
"rewards/chosen": -0.039794921875,
"rewards/margins": 0.0015106201171875,
"rewards/rejected": -0.04150390625,
"step": 9
},
{
"epoch": 0.03659233847913093,
"grad_norm": 341.0348205566406,
"learning_rate": 1.926739926739927e-06,
"logits/chosen": -0.58984375,
"logits/rejected": -0.6171875,
"logps/chosen": -156.0,
"logps/rejected": -216.0,
"loss": 0.6727,
"rewards/accuracies": 0.46875,
"rewards/chosen": -0.034423828125,
"rewards/margins": 0.042236328125,
"rewards/rejected": -0.07666015625,
"step": 10
},
{
"epoch": 0.04025157232704402,
"grad_norm": 314.3051452636719,
"learning_rate": 1.9194139194139196e-06,
"logits/chosen": -0.65234375,
"logits/rejected": -0.64453125,
"logps/chosen": -152.0,
"logps/rejected": -176.0,
"loss": 0.6743,
"rewards/accuracies": 0.5,
"rewards/chosen": -0.0250244140625,
"rewards/margins": 0.042236328125,
"rewards/rejected": -0.0673828125,
"step": 11
},
{
"epoch": 0.043910806174957115,
"grad_norm": 315.991943359375,
"learning_rate": 1.912087912087912e-06,
"logits/chosen": -0.68359375,
"logits/rejected": -0.62890625,
"logps/chosen": -137.0,
"logps/rejected": -167.0,
"loss": 0.6733,
"rewards/accuracies": 0.5625,
"rewards/chosen": -0.044677734375,
"rewards/margins": 0.038330078125,
"rewards/rejected": -0.0830078125,
"step": 12
},
{
"epoch": 0.047570040022870214,
"grad_norm": 302.81024169921875,
"learning_rate": 1.9047619047619045e-06,
"logits/chosen": -0.62890625,
"logits/rejected": -0.6171875,
"logps/chosen": -162.0,
"logps/rejected": -162.0,
"loss": 0.7054,
"rewards/accuracies": 0.28125,
"rewards/chosen": -0.078125,
"rewards/margins": -0.01806640625,
"rewards/rejected": -0.060302734375,
"step": 13
},
{
"epoch": 0.051229273870783305,
"grad_norm": 312.2680969238281,
"learning_rate": 1.8974358974358973e-06,
"logits/chosen": -0.5859375,
"logits/rejected": -0.5625,
"logps/chosen": -141.0,
"logps/rejected": -140.0,
"loss": 0.6847,
"rewards/accuracies": 0.5,
"rewards/chosen": -0.036865234375,
"rewards/margins": 0.01953125,
"rewards/rejected": -0.056396484375,
"step": 14
},
{
"epoch": 0.0548885077186964,
"grad_norm": 450.512451171875,
"learning_rate": 1.89010989010989e-06,
"logits/chosen": -0.5703125,
"logits/rejected": -0.5703125,
"logps/chosen": -170.0,
"logps/rejected": -186.0,
"loss": 0.703,
"rewards/accuracies": 0.3125,
"rewards/chosen": -0.09912109375,
"rewards/margins": -0.0194091796875,
"rewards/rejected": -0.07958984375,
"step": 15
},
{
"epoch": 0.05854774156660949,
"grad_norm": 319.3954772949219,
"learning_rate": 1.8827838827838826e-06,
"logits/chosen": -0.62890625,
"logits/rejected": -0.62109375,
"logps/chosen": -183.0,
"logps/rejected": -161.0,
"loss": 0.6943,
"rewards/accuracies": 0.46875,
"rewards/chosen": -0.06591796875,
"rewards/margins": 0.004730224609375,
"rewards/rejected": -0.0703125,
"step": 16
},
{
"epoch": 0.06220697541452259,
"grad_norm": 328.090087890625,
"learning_rate": 1.8754578754578754e-06,
"logits/chosen": -0.58984375,
"logits/rejected": -0.6328125,
"logps/chosen": -158.0,
"logps/rejected": -169.0,
"loss": 0.6694,
"rewards/accuracies": 0.5625,
"rewards/chosen": -0.02587890625,
"rewards/margins": 0.053955078125,
"rewards/rejected": -0.07958984375,
"step": 17
},
{
"epoch": 0.06586620926243568,
"grad_norm": 339.8540954589844,
"learning_rate": 1.8681318681318681e-06,
"logits/chosen": -0.6328125,
"logits/rejected": -0.59375,
"logps/chosen": -147.0,
"logps/rejected": -165.0,
"loss": 0.6788,
"rewards/accuracies": 0.5,
"rewards/chosen": -0.046875,
"rewards/margins": 0.035888671875,
"rewards/rejected": -0.0830078125,
"step": 18
},
{
"epoch": 0.06952544311034876,
"grad_norm": 316.8853759765625,
"learning_rate": 1.8608058608058607e-06,
"logits/chosen": -0.60546875,
"logits/rejected": -0.609375,
"logps/chosen": -150.0,
"logps/rejected": -171.0,
"loss": 0.682,
"rewards/accuracies": 0.40625,
"rewards/chosen": -0.050048828125,
"rewards/margins": 0.0289306640625,
"rewards/rejected": -0.0791015625,
"step": 19
},
{
"epoch": 0.07318467695826186,
"grad_norm": 318.4516296386719,
"learning_rate": 1.8534798534798535e-06,
"logits/chosen": -0.6484375,
"logits/rejected": -0.6484375,
"logps/chosen": -138.0,
"logps/rejected": -179.0,
"loss": 0.6903,
"rewards/accuracies": 0.46875,
"rewards/chosen": -0.05322265625,
"rewards/margins": 0.010986328125,
"rewards/rejected": -0.06396484375,
"step": 20
},
{
"epoch": 0.07684391080617496,
"grad_norm": 382.6263122558594,
"learning_rate": 1.8461538461538462e-06,
"logits/chosen": -0.58203125,
"logits/rejected": -0.5546875,
"logps/chosen": -143.0,
"logps/rejected": -256.0,
"loss": 0.6578,
"rewards/accuracies": 0.46875,
"rewards/chosen": -0.04541015625,
"rewards/margins": 0.08154296875,
"rewards/rejected": -0.126953125,
"step": 21
},
{
"epoch": 0.08050314465408805,
"grad_norm": 351.90972900390625,
"learning_rate": 1.8388278388278386e-06,
"logits/chosen": -0.63671875,
"logits/rejected": -0.578125,
"logps/chosen": -152.0,
"logps/rejected": -213.0,
"loss": 0.6783,
"rewards/accuracies": 0.46875,
"rewards/chosen": -0.059326171875,
"rewards/margins": 0.0296630859375,
"rewards/rejected": -0.08935546875,
"step": 22
},
{
"epoch": 0.08416237850200115,
"grad_norm": 306.3103332519531,
"learning_rate": 1.8315018315018314e-06,
"logits/chosen": -0.59765625,
"logits/rejected": -0.578125,
"logps/chosen": -140.0,
"logps/rejected": -173.0,
"loss": 0.6982,
"rewards/accuracies": 0.4375,
"rewards/chosen": -0.07177734375,
"rewards/margins": 0.00628662109375,
"rewards/rejected": -0.078125,
"step": 23
},
{
"epoch": 0.08782161234991423,
"grad_norm": 322.9337158203125,
"learning_rate": 1.8241758241758241e-06,
"logits/chosen": -0.6015625,
"logits/rejected": -0.57421875,
"logps/chosen": -149.0,
"logps/rejected": -160.0,
"loss": 0.6774,
"rewards/accuracies": 0.5,
"rewards/chosen": -0.0595703125,
"rewards/margins": 0.03759765625,
"rewards/rejected": -0.09716796875,
"step": 24
},
{
"epoch": 0.09148084619782733,
"grad_norm": 348.9863586425781,
"learning_rate": 1.8168498168498167e-06,
"logits/chosen": -0.59765625,
"logits/rejected": -0.57421875,
"logps/chosen": -183.0,
"logps/rejected": -224.0,
"loss": 0.6976,
"rewards/accuracies": 0.34375,
"rewards/chosen": -0.10498046875,
"rewards/margins": 0.0078125,
"rewards/rejected": -0.11279296875,
"step": 25
},
{
"epoch": 0.09514008004574043,
"grad_norm": 312.5710144042969,
"learning_rate": 1.8095238095238095e-06,
"logits/chosen": -0.59375,
"logits/rejected": -0.57421875,
"logps/chosen": -160.0,
"logps/rejected": -156.0,
"loss": 0.6707,
"rewards/accuracies": 0.5,
"rewards/chosen": -0.078125,
"rewards/margins": 0.0361328125,
"rewards/rejected": -0.1142578125,
"step": 26
},
{
"epoch": 0.09879931389365351,
"grad_norm": 312.729736328125,
"learning_rate": 1.8021978021978023e-06,
"logits/chosen": -0.58984375,
"logits/rejected": -0.56640625,
"logps/chosen": -152.0,
"logps/rejected": -177.0,
"loss": 0.6608,
"rewards/accuracies": 0.59375,
"rewards/chosen": -0.06884765625,
"rewards/margins": 0.0703125,
"rewards/rejected": -0.1396484375,
"step": 27
},
{
"epoch": 0.10245854774156661,
"grad_norm": 335.3136291503906,
"learning_rate": 1.7948717948717948e-06,
"logits/chosen": -0.64453125,
"logits/rejected": -0.6484375,
"logps/chosen": -178.0,
"logps/rejected": -159.0,
"loss": 0.7061,
"rewards/accuracies": 0.375,
"rewards/chosen": -0.142578125,
"rewards/margins": -0.0186767578125,
"rewards/rejected": -0.12353515625,
"step": 28
},
{
"epoch": 0.10611778158947971,
"grad_norm": 308.06744384765625,
"learning_rate": 1.7875457875457876e-06,
"logits/chosen": -0.66796875,
"logits/rejected": -0.62890625,
"logps/chosen": -177.0,
"logps/rejected": -165.0,
"loss": 0.6785,
"rewards/accuracies": 0.46875,
"rewards/chosen": -0.10009765625,
"rewards/margins": 0.035888671875,
"rewards/rejected": -0.1357421875,
"step": 29
},
{
"epoch": 0.1097770154373928,
"grad_norm": 324.392333984375,
"learning_rate": 1.78021978021978e-06,
"logits/chosen": -0.62890625,
"logits/rejected": -0.6484375,
"logps/chosen": -169.0,
"logps/rejected": -166.0,
"loss": 0.6895,
"rewards/accuracies": 0.375,
"rewards/chosen": -0.0908203125,
"rewards/margins": 0.01409912109375,
"rewards/rejected": -0.10498046875,
"step": 30
},
{
"epoch": 0.11343624928530589,
"grad_norm": 348.1455993652344,
"learning_rate": 1.7728937728937727e-06,
"logits/chosen": -0.640625,
"logits/rejected": -0.62890625,
"logps/chosen": -150.0,
"logps/rejected": -173.0,
"loss": 0.6512,
"rewards/accuracies": 0.625,
"rewards/chosen": -0.057861328125,
"rewards/margins": 0.0859375,
"rewards/rejected": -0.1435546875,
"step": 31
},
{
"epoch": 0.11709548313321898,
"grad_norm": 310.3366394042969,
"learning_rate": 1.7655677655677655e-06,
"logits/chosen": -0.6171875,
"logits/rejected": -0.62890625,
"logps/chosen": -185.0,
"logps/rejected": -176.0,
"loss": 0.6638,
"rewards/accuracies": 0.5,
"rewards/chosen": -0.08154296875,
"rewards/margins": 0.06494140625,
"rewards/rejected": -0.146484375,
"step": 32
},
{
"epoch": 0.12075471698113208,
"grad_norm": 367.6607971191406,
"learning_rate": 1.758241758241758e-06,
"logits/chosen": -0.609375,
"logits/rejected": -0.640625,
"logps/chosen": -213.0,
"logps/rejected": -152.0,
"loss": 0.7106,
"rewards/accuracies": 0.40625,
"rewards/chosen": -0.15625,
"rewards/margins": -0.0234375,
"rewards/rejected": -0.1328125,
"step": 33
},
{
"epoch": 0.12441395082904518,
"grad_norm": 304.85638427734375,
"learning_rate": 1.7509157509157508e-06,
"logits/chosen": -0.55859375,
"logits/rejected": -0.58203125,
"logps/chosen": -155.0,
"logps/rejected": -179.0,
"loss": 0.676,
"rewards/accuracies": 0.5,
"rewards/chosen": -0.0859375,
"rewards/margins": 0.0390625,
"rewards/rejected": -0.125,
"step": 34
},
{
"epoch": 0.12807318467695827,
"grad_norm": 344.142333984375,
"learning_rate": 1.7435897435897436e-06,
"logits/chosen": -0.65625,
"logits/rejected": -0.6171875,
"logps/chosen": -148.0,
"logps/rejected": -158.0,
"loss": 0.7004,
"rewards/accuracies": 0.28125,
"rewards/chosen": -0.10693359375,
"rewards/margins": -0.0133056640625,
"rewards/rejected": -0.09375,
"step": 35
},
{
"epoch": 0.13173241852487136,
"grad_norm": 330.11029052734375,
"learning_rate": 1.7362637362637362e-06,
"logits/chosen": -0.5859375,
"logits/rejected": -0.59765625,
"logps/chosen": -138.0,
"logps/rejected": -165.0,
"loss": 0.6927,
"rewards/accuracies": 0.46875,
"rewards/chosen": -0.0859375,
"rewards/margins": 0.010986328125,
"rewards/rejected": -0.09716796875,
"step": 36
},
{
"epoch": 0.13539165237278444,
"grad_norm": 367.31817626953125,
"learning_rate": 1.728937728937729e-06,
"logits/chosen": -0.61328125,
"logits/rejected": -0.64453125,
"logps/chosen": -150.0,
"logps/rejected": -159.0,
"loss": 0.6768,
"rewards/accuracies": 0.5,
"rewards/chosen": -0.08544921875,
"rewards/margins": 0.046142578125,
"rewards/rejected": -0.1318359375,
"step": 37
},
{
"epoch": 0.13905088622069753,
"grad_norm": 332.1564025878906,
"learning_rate": 1.7216117216117217e-06,
"logits/chosen": -0.62109375,
"logits/rejected": -0.59375,
"logps/chosen": -158.0,
"logps/rejected": -179.0,
"loss": 0.6858,
"rewards/accuracies": 0.53125,
"rewards/chosen": -0.0859375,
"rewards/margins": 0.02587890625,
"rewards/rejected": -0.11181640625,
"step": 38
},
{
"epoch": 0.14271012006861064,
"grad_norm": 358.6282653808594,
"learning_rate": 1.714285714285714e-06,
"logits/chosen": -0.67578125,
"logits/rejected": -0.64453125,
"logps/chosen": -151.0,
"logps/rejected": -169.0,
"loss": 0.6743,
"rewards/accuracies": 0.4375,
"rewards/chosen": -0.0830078125,
"rewards/margins": 0.0390625,
"rewards/rejected": -0.1220703125,
"step": 39
},
{
"epoch": 0.14636935391652373,
"grad_norm": 344.2862548828125,
"learning_rate": 1.7069597069597068e-06,
"logits/chosen": -0.5859375,
"logits/rejected": -0.56640625,
"logps/chosen": -144.0,
"logps/rejected": -224.0,
"loss": 0.653,
"rewards/accuracies": 0.71875,
"rewards/chosen": -0.0625,
"rewards/margins": 0.10791015625,
"rewards/rejected": -0.1708984375,
"step": 40
},
{
"epoch": 0.1500285877644368,
"grad_norm": 317.97698974609375,
"learning_rate": 1.6996336996336996e-06,
"logits/chosen": -0.65234375,
"logits/rejected": -0.6328125,
"logps/chosen": -157.0,
"logps/rejected": -177.0,
"loss": 0.6595,
"rewards/accuracies": 0.625,
"rewards/chosen": -0.051513671875,
"rewards/margins": 0.07763671875,
"rewards/rejected": -0.12890625,
"step": 41
},
{
"epoch": 0.15368782161234992,
"grad_norm": 336.11773681640625,
"learning_rate": 1.6923076923076922e-06,
"logits/chosen": -0.65234375,
"logits/rejected": -0.6171875,
"logps/chosen": -172.0,
"logps/rejected": -168.0,
"loss": 0.6805,
"rewards/accuracies": 0.53125,
"rewards/chosen": -0.09521484375,
"rewards/margins": 0.03125,
"rewards/rejected": -0.126953125,
"step": 42
},
{
"epoch": 0.157347055460263,
"grad_norm": 306.1403503417969,
"learning_rate": 1.684981684981685e-06,
"logits/chosen": -0.6328125,
"logits/rejected": -0.6015625,
"logps/chosen": -146.0,
"logps/rejected": -149.0,
"loss": 0.6506,
"rewards/accuracies": 0.5625,
"rewards/chosen": -0.06103515625,
"rewards/margins": 0.0947265625,
"rewards/rejected": -0.1552734375,
"step": 43
},
{
"epoch": 0.1610062893081761,
"grad_norm": 330.2728271484375,
"learning_rate": 1.6776556776556777e-06,
"logits/chosen": -0.609375,
"logits/rejected": -0.55859375,
"logps/chosen": -141.0,
"logps/rejected": -180.0,
"loss": 0.6661,
"rewards/accuracies": 0.59375,
"rewards/chosen": -0.0703125,
"rewards/margins": 0.06103515625,
"rewards/rejected": -0.1318359375,
"step": 44
},
{
"epoch": 0.1646655231560892,
"grad_norm": 300.4102783203125,
"learning_rate": 1.6703296703296703e-06,
"logits/chosen": -0.63671875,
"logits/rejected": -0.66015625,
"logps/chosen": -148.0,
"logps/rejected": -156.0,
"loss": 0.6313,
"rewards/accuracies": 0.625,
"rewards/chosen": -0.046142578125,
"rewards/margins": 0.1357421875,
"rewards/rejected": -0.181640625,
"step": 45
},
{
"epoch": 0.1683247570040023,
"grad_norm": 314.258056640625,
"learning_rate": 1.663003663003663e-06,
"logits/chosen": -0.63671875,
"logits/rejected": -0.6328125,
"logps/chosen": -145.0,
"logps/rejected": -164.0,
"loss": 0.658,
"rewards/accuracies": 0.75,
"rewards/chosen": -0.08935546875,
"rewards/margins": 0.08056640625,
"rewards/rejected": -0.169921875,
"step": 46
},
{
"epoch": 0.17198399085191537,
"grad_norm": 300.92364501953125,
"learning_rate": 1.6556776556776554e-06,
"logits/chosen": -0.625,
"logits/rejected": -0.625,
"logps/chosen": -152.0,
"logps/rejected": -189.0,
"loss": 0.6508,
"rewards/accuracies": 0.59375,
"rewards/chosen": -0.04541015625,
"rewards/margins": 0.09716796875,
"rewards/rejected": -0.142578125,
"step": 47
},
{
"epoch": 0.17564322469982846,
"grad_norm": 281.744384765625,
"learning_rate": 1.6483516483516482e-06,
"logits/chosen": -0.609375,
"logits/rejected": -0.6328125,
"logps/chosen": -131.0,
"logps/rejected": -165.0,
"loss": 0.655,
"rewards/accuracies": 0.625,
"rewards/chosen": -0.07373046875,
"rewards/margins": 0.0888671875,
"rewards/rejected": -0.1630859375,
"step": 48
},
{
"epoch": 0.17930245854774157,
"grad_norm": 373.736328125,
"learning_rate": 1.641025641025641e-06,
"logits/chosen": -0.6484375,
"logits/rejected": -0.62890625,
"logps/chosen": -147.0,
"logps/rejected": -176.0,
"loss": 0.6635,
"rewards/accuracies": 0.5625,
"rewards/chosen": -0.08447265625,
"rewards/margins": 0.0751953125,
"rewards/rejected": -0.1591796875,
"step": 49
},
{
"epoch": 0.18296169239565466,
"grad_norm": 319.23675537109375,
"learning_rate": 1.6336996336996335e-06,
"logits/chosen": -0.62109375,
"logits/rejected": -0.64453125,
"logps/chosen": -168.0,
"logps/rejected": -183.0,
"loss": 0.6371,
"rewards/accuracies": 0.6875,
"rewards/chosen": -0.0751953125,
"rewards/margins": 0.134765625,
"rewards/rejected": -0.2099609375,
"step": 50
},
{
"epoch": 0.18662092624356774,
"grad_norm": 454.0714416503906,
"learning_rate": 1.6263736263736263e-06,
"logits/chosen": -0.62890625,
"logits/rejected": -0.59375,
"logps/chosen": -171.0,
"logps/rejected": -196.0,
"loss": 0.6519,
"rewards/accuracies": 0.59375,
"rewards/chosen": -0.08740234375,
"rewards/margins": 0.0908203125,
"rewards/rejected": -0.1787109375,
"step": 51
},
{
"epoch": 0.19028016009148085,
"grad_norm": 316.0301513671875,
"learning_rate": 1.619047619047619e-06,
"logits/chosen": -0.62109375,
"logits/rejected": -0.6484375,
"logps/chosen": -144.0,
"logps/rejected": -183.0,
"loss": 0.6611,
"rewards/accuracies": 0.53125,
"rewards/chosen": -0.107421875,
"rewards/margins": 0.08544921875,
"rewards/rejected": -0.1923828125,
"step": 52
},
{
"epoch": 0.19393939393939394,
"grad_norm": 345.9140625,
"learning_rate": 1.6117216117216116e-06,
"logits/chosen": -0.65625,
"logits/rejected": -0.625,
"logps/chosen": -169.0,
"logps/rejected": -173.0,
"loss": 0.658,
"rewards/accuracies": 0.46875,
"rewards/chosen": -0.09375,
"rewards/margins": 0.08740234375,
"rewards/rejected": -0.181640625,
"step": 53
},
{
"epoch": 0.19759862778730702,
"grad_norm": 334.124755859375,
"learning_rate": 1.6043956043956044e-06,
"logits/chosen": -0.66015625,
"logits/rejected": -0.6484375,
"logps/chosen": -178.0,
"logps/rejected": -202.0,
"loss": 0.6633,
"rewards/accuracies": 0.5625,
"rewards/chosen": -0.1630859375,
"rewards/margins": 0.0751953125,
"rewards/rejected": -0.2373046875,
"step": 54
},
{
"epoch": 0.20125786163522014,
"grad_norm": 330.6783142089844,
"learning_rate": 1.5970695970695972e-06,
"logits/chosen": -0.6875,
"logits/rejected": -0.69140625,
"logps/chosen": -163.0,
"logps/rejected": -140.0,
"loss": 0.698,
"rewards/accuracies": 0.46875,
"rewards/chosen": -0.1533203125,
"rewards/margins": -0.010986328125,
"rewards/rejected": -0.142578125,
"step": 55
},
{
"epoch": 0.20491709548313322,
"grad_norm": 370.80706787109375,
"learning_rate": 1.5897435897435895e-06,
"logits/chosen": -0.63671875,
"logits/rejected": -0.66796875,
"logps/chosen": -166.0,
"logps/rejected": -181.0,
"loss": 0.6512,
"rewards/accuracies": 0.6875,
"rewards/chosen": -0.1689453125,
"rewards/margins": 0.09375,
"rewards/rejected": -0.263671875,
"step": 56
},
{
"epoch": 0.2085763293310463,
"grad_norm": 323.4024353027344,
"learning_rate": 1.5824175824175823e-06,
"logits/chosen": -0.66015625,
"logits/rejected": -0.62890625,
"logps/chosen": -171.0,
"logps/rejected": -157.0,
"loss": 0.6428,
"rewards/accuracies": 0.65625,
"rewards/chosen": -0.1318359375,
"rewards/margins": 0.115234375,
"rewards/rejected": -0.24609375,
"step": 57
},
{
"epoch": 0.21223556317895942,
"grad_norm": 325.7928771972656,
"learning_rate": 1.575091575091575e-06,
"logits/chosen": -0.62109375,
"logits/rejected": -0.59765625,
"logps/chosen": -154.0,
"logps/rejected": -167.0,
"loss": 0.6663,
"rewards/accuracies": 0.59375,
"rewards/chosen": -0.12451171875,
"rewards/margins": 0.07421875,
"rewards/rejected": -0.1982421875,
"step": 58
},
{
"epoch": 0.2158947970268725,
"grad_norm": 365.8585510253906,
"learning_rate": 1.5677655677655676e-06,
"logits/chosen": -0.62109375,
"logits/rejected": -0.61328125,
"logps/chosen": -192.0,
"logps/rejected": -202.0,
"loss": 0.6435,
"rewards/accuracies": 0.65625,
"rewards/chosen": -0.1611328125,
"rewards/margins": 0.125,
"rewards/rejected": -0.287109375,
"step": 59
},
{
"epoch": 0.2195540308747856,
"grad_norm": 339.77593994140625,
"learning_rate": 1.5604395604395604e-06,
"logits/chosen": -0.640625,
"logits/rejected": -0.640625,
"logps/chosen": -162.0,
"logps/rejected": -207.0,
"loss": 0.6537,
"rewards/accuracies": 0.59375,
"rewards/chosen": -0.15234375,
"rewards/margins": 0.10595703125,
"rewards/rejected": -0.2578125,
"step": 60
},
{
"epoch": 0.22321326472269867,
"grad_norm": 316.12646484375,
"learning_rate": 1.5531135531135532e-06,
"logits/chosen": -0.6796875,
"logits/rejected": -0.640625,
"logps/chosen": -137.0,
"logps/rejected": -166.0,
"loss": 0.6564,
"rewards/accuracies": 0.625,
"rewards/chosen": -0.1494140625,
"rewards/margins": 0.0908203125,
"rewards/rejected": -0.240234375,
"step": 61
},
{
"epoch": 0.22687249857061179,
"grad_norm": 315.9810485839844,
"learning_rate": 1.5457875457875457e-06,
"logits/chosen": -0.5546875,
"logits/rejected": -0.5703125,
"logps/chosen": -173.0,
"logps/rejected": -170.0,
"loss": 0.6639,
"rewards/accuracies": 0.53125,
"rewards/chosen": -0.166015625,
"rewards/margins": 0.0703125,
"rewards/rejected": -0.236328125,
"step": 62
},
{
"epoch": 0.23053173241852487,
"grad_norm": 312.3990478515625,
"learning_rate": 1.5384615384615385e-06,
"logits/chosen": -0.58984375,
"logits/rejected": -0.58984375,
"logps/chosen": -160.0,
"logps/rejected": -205.0,
"loss": 0.6407,
"rewards/accuracies": 0.59375,
"rewards/chosen": -0.1416015625,
"rewards/margins": 0.1416015625,
"rewards/rejected": -0.283203125,
"step": 63
},
{
"epoch": 0.23419096626643796,
"grad_norm": 374.50360107421875,
"learning_rate": 1.5311355311355309e-06,
"logits/chosen": -0.6484375,
"logits/rejected": -0.64453125,
"logps/chosen": -229.0,
"logps/rejected": -189.0,
"loss": 0.6736,
"rewards/accuracies": 0.5625,
"rewards/chosen": -0.1962890625,
"rewards/margins": 0.056640625,
"rewards/rejected": -0.251953125,
"step": 64
},
{
"epoch": 0.23785020011435107,
"grad_norm": 322.1225280761719,
"learning_rate": 1.5238095238095236e-06,
"logits/chosen": -0.62109375,
"logits/rejected": -0.640625,
"logps/chosen": -168.0,
"logps/rejected": -151.0,
"loss": 0.6749,
"rewards/accuracies": 0.5625,
"rewards/chosen": -0.125,
"rewards/margins": 0.0390625,
"rewards/rejected": -0.1640625,
"step": 65
},
{
"epoch": 0.24150943396226415,
"grad_norm": 322.7266845703125,
"learning_rate": 1.5164835164835164e-06,
"logits/chosen": -0.67578125,
"logits/rejected": -0.67578125,
"logps/chosen": -165.0,
"logps/rejected": -178.0,
"loss": 0.6255,
"rewards/accuracies": 0.8125,
"rewards/chosen": -0.0673828125,
"rewards/margins": 0.1455078125,
"rewards/rejected": -0.212890625,
"step": 66
},
{
"epoch": 0.24516866781017724,
"grad_norm": 317.9302978515625,
"learning_rate": 1.509157509157509e-06,
"logits/chosen": -0.69140625,
"logits/rejected": -0.64453125,
"logps/chosen": -163.0,
"logps/rejected": -211.0,
"loss": 0.6194,
"rewards/accuracies": 0.6875,
"rewards/chosen": -0.11279296875,
"rewards/margins": 0.158203125,
"rewards/rejected": -0.26953125,
"step": 67
},
{
"epoch": 0.24882790165809035,
"grad_norm": 328.2178955078125,
"learning_rate": 1.5018315018315017e-06,
"logits/chosen": -0.65625,
"logits/rejected": -0.6171875,
"logps/chosen": -162.0,
"logps/rejected": -165.0,
"loss": 0.6609,
"rewards/accuracies": 0.5,
"rewards/chosen": -0.1513671875,
"rewards/margins": 0.0888671875,
"rewards/rejected": -0.2412109375,
"step": 68
},
{
"epoch": 0.25248713550600344,
"grad_norm": 350.5845642089844,
"learning_rate": 1.4945054945054945e-06,
"logits/chosen": -0.63671875,
"logits/rejected": -0.6484375,
"logps/chosen": -188.0,
"logps/rejected": -182.0,
"loss": 0.6567,
"rewards/accuracies": 0.65625,
"rewards/chosen": -0.1591796875,
"rewards/margins": 0.08056640625,
"rewards/rejected": -0.2392578125,
"step": 69
},
{
"epoch": 0.25614636935391655,
"grad_norm": 329.70184326171875,
"learning_rate": 1.487179487179487e-06,
"logits/chosen": -0.6484375,
"logits/rejected": -0.6875,
"logps/chosen": -162.0,
"logps/rejected": -145.0,
"loss": 0.6819,
"rewards/accuracies": 0.5,
"rewards/chosen": -0.158203125,
"rewards/margins": 0.0281982421875,
"rewards/rejected": -0.1865234375,
"step": 70
},
{
"epoch": 0.2598056032018296,
"grad_norm": 324.77587890625,
"learning_rate": 1.4798534798534798e-06,
"logits/chosen": -0.60546875,
"logits/rejected": -0.63671875,
"logps/chosen": -149.0,
"logps/rejected": -177.0,
"loss": 0.6274,
"rewards/accuracies": 0.59375,
"rewards/chosen": -0.119140625,
"rewards/margins": 0.15625,
"rewards/rejected": -0.275390625,
"step": 71
},
{
"epoch": 0.2634648370497427,
"grad_norm": 348.8105773925781,
"learning_rate": 1.4725274725274726e-06,
"logits/chosen": -0.6484375,
"logits/rejected": -0.62890625,
"logps/chosen": -164.0,
"logps/rejected": -217.0,
"loss": 0.6568,
"rewards/accuracies": 0.5,
"rewards/chosen": -0.1455078125,
"rewards/margins": 0.109375,
"rewards/rejected": -0.255859375,
"step": 72
},
{
"epoch": 0.26712407089765583,
"grad_norm": 293.3565368652344,
"learning_rate": 1.465201465201465e-06,
"logits/chosen": -0.65625,
"logits/rejected": -0.6328125,
"logps/chosen": -150.0,
"logps/rejected": -162.0,
"loss": 0.6266,
"rewards/accuracies": 0.75,
"rewards/chosen": -0.15234375,
"rewards/margins": 0.1552734375,
"rewards/rejected": -0.30859375,
"step": 73
},
{
"epoch": 0.2707833047455689,
"grad_norm": 322.1363220214844,
"learning_rate": 1.4578754578754577e-06,
"logits/chosen": -0.65625,
"logits/rejected": -0.65234375,
"logps/chosen": -167.0,
"logps/rejected": -164.0,
"loss": 0.6566,
"rewards/accuracies": 0.59375,
"rewards/chosen": -0.150390625,
"rewards/margins": 0.08984375,
"rewards/rejected": -0.240234375,
"step": 74
},
{
"epoch": 0.274442538593482,
"grad_norm": 337.89581298828125,
"learning_rate": 1.4505494505494505e-06,
"logits/chosen": -0.625,
"logits/rejected": -0.62109375,
"logps/chosen": -166.0,
"logps/rejected": -174.0,
"loss": 0.6544,
"rewards/accuracies": 0.65625,
"rewards/chosen": -0.1689453125,
"rewards/margins": 0.0869140625,
"rewards/rejected": -0.255859375,
"step": 75
},
{
"epoch": 0.27810177244139506,
"grad_norm": 309.1400146484375,
"learning_rate": 1.443223443223443e-06,
"logits/chosen": -0.64453125,
"logits/rejected": -0.6171875,
"logps/chosen": -143.0,
"logps/rejected": -160.0,
"loss": 0.6221,
"rewards/accuracies": 0.6875,
"rewards/chosen": -0.10498046875,
"rewards/margins": 0.171875,
"rewards/rejected": -0.27734375,
"step": 76
},
{
"epoch": 0.28176100628930817,
"grad_norm": 338.5057373046875,
"learning_rate": 1.4358974358974359e-06,
"logits/chosen": -0.625,
"logits/rejected": -0.59765625,
"logps/chosen": -139.0,
"logps/rejected": -171.0,
"loss": 0.6537,
"rewards/accuracies": 0.65625,
"rewards/chosen": -0.1572265625,
"rewards/margins": 0.0947265625,
"rewards/rejected": -0.251953125,
"step": 77
},
{
"epoch": 0.2854202401372213,
"grad_norm": 332.32794189453125,
"learning_rate": 1.4285714285714286e-06,
"logits/chosen": -0.609375,
"logits/rejected": -0.6484375,
"logps/chosen": -154.0,
"logps/rejected": -185.0,
"loss": 0.6379,
"rewards/accuracies": 0.78125,
"rewards/chosen": -0.142578125,
"rewards/margins": 0.126953125,
"rewards/rejected": -0.26953125,
"step": 78
},
{
"epoch": 0.28907947398513434,
"grad_norm": 333.6225280761719,
"learning_rate": 1.4212454212454212e-06,
"logits/chosen": -0.68359375,
"logits/rejected": -0.65234375,
"logps/chosen": -151.0,
"logps/rejected": -183.0,
"loss": 0.6387,
"rewards/accuracies": 0.65625,
"rewards/chosen": -0.1298828125,
"rewards/margins": 0.1328125,
"rewards/rejected": -0.263671875,
"step": 79
},
{
"epoch": 0.29273870783304745,
"grad_norm": 302.85931396484375,
"learning_rate": 1.413919413919414e-06,
"logits/chosen": -0.6015625,
"logits/rejected": -0.6015625,
"logps/chosen": -153.0,
"logps/rejected": -169.0,
"loss": 0.6433,
"rewards/accuracies": 0.59375,
"rewards/chosen": -0.1708984375,
"rewards/margins": 0.111328125,
"rewards/rejected": -0.28125,
"step": 80
},
{
"epoch": 0.29639794168096056,
"grad_norm": 329.51885986328125,
"learning_rate": 1.4065934065934067e-06,
"logits/chosen": -0.63671875,
"logits/rejected": -0.62890625,
"logps/chosen": -158.0,
"logps/rejected": -162.0,
"loss": 0.6799,
"rewards/accuracies": 0.5,
"rewards/chosen": -0.1708984375,
"rewards/margins": 0.034423828125,
"rewards/rejected": -0.205078125,
"step": 81
},
{
"epoch": 0.3000571755288736,
"grad_norm": 311.5542907714844,
"learning_rate": 1.399267399267399e-06,
"logits/chosen": -0.6875,
"logits/rejected": -0.65234375,
"logps/chosen": -131.0,
"logps/rejected": -158.0,
"loss": 0.6389,
"rewards/accuracies": 0.65625,
"rewards/chosen": -0.1611328125,
"rewards/margins": 0.140625,
"rewards/rejected": -0.302734375,
"step": 82
},
{
"epoch": 0.30371640937678673,
"grad_norm": 442.2575378417969,
"learning_rate": 1.3919413919413919e-06,
"logits/chosen": -0.6875,
"logits/rejected": -0.625,
"logps/chosen": -158.0,
"logps/rejected": -195.0,
"loss": 0.6479,
"rewards/accuracies": 0.53125,
"rewards/chosen": -0.173828125,
"rewards/margins": 0.11279296875,
"rewards/rejected": -0.287109375,
"step": 83
},
{
"epoch": 0.30737564322469985,
"grad_norm": 341.3179016113281,
"learning_rate": 1.3846153846153844e-06,
"logits/chosen": -0.65234375,
"logits/rejected": -0.6875,
"logps/chosen": -144.0,
"logps/rejected": -176.0,
"loss": 0.6302,
"rewards/accuracies": 0.6875,
"rewards/chosen": -0.126953125,
"rewards/margins": 0.1474609375,
"rewards/rejected": -0.2734375,
"step": 84
},
{
"epoch": 0.3110348770726129,
"grad_norm": 305.62109375,
"learning_rate": 1.3772893772893772e-06,
"logits/chosen": -0.63671875,
"logits/rejected": -0.6328125,
"logps/chosen": -140.0,
"logps/rejected": -159.0,
"loss": 0.6205,
"rewards/accuracies": 0.6875,
"rewards/chosen": -0.0751953125,
"rewards/margins": 0.158203125,
"rewards/rejected": -0.2333984375,
"step": 85
},
{
"epoch": 0.314694110920526,
"grad_norm": 300.09014892578125,
"learning_rate": 1.36996336996337e-06,
"logits/chosen": -0.59765625,
"logits/rejected": -0.578125,
"logps/chosen": -142.0,
"logps/rejected": -157.0,
"loss": 0.5966,
"rewards/accuracies": 0.8125,
"rewards/chosen": -0.038330078125,
"rewards/margins": 0.2138671875,
"rewards/rejected": -0.251953125,
"step": 86
},
{
"epoch": 0.31835334476843913,
"grad_norm": 325.3841247558594,
"learning_rate": 1.3626373626373625e-06,
"logits/chosen": -0.66796875,
"logits/rejected": -0.67578125,
"logps/chosen": -164.0,
"logps/rejected": -170.0,
"loss": 0.6437,
"rewards/accuracies": 0.65625,
"rewards/chosen": -0.10546875,
"rewards/margins": 0.12060546875,
"rewards/rejected": -0.2255859375,
"step": 87
},
{
"epoch": 0.3220125786163522,
"grad_norm": 347.8658447265625,
"learning_rate": 1.3553113553113553e-06,
"logits/chosen": -0.703125,
"logits/rejected": -0.65234375,
"logps/chosen": -154.0,
"logps/rejected": -167.0,
"loss": 0.6111,
"rewards/accuracies": 0.65625,
"rewards/chosen": -0.109375,
"rewards/margins": 0.185546875,
"rewards/rejected": -0.294921875,
"step": 88
},
{
"epoch": 0.3256718124642653,
"grad_norm": 319.26513671875,
"learning_rate": 1.347985347985348e-06,
"logits/chosen": -0.6875,
"logits/rejected": -0.66015625,
"logps/chosen": -140.0,
"logps/rejected": -184.0,
"loss": 0.6299,
"rewards/accuracies": 0.5625,
"rewards/chosen": -0.1279296875,
"rewards/margins": 0.1611328125,
"rewards/rejected": -0.2890625,
"step": 89
},
{
"epoch": 0.3293310463121784,
"grad_norm": 326.7582702636719,
"learning_rate": 1.3406593406593404e-06,
"logits/chosen": -0.6640625,
"logits/rejected": -0.67578125,
"logps/chosen": -159.0,
"logps/rejected": -178.0,
"loss": 0.6315,
"rewards/accuracies": 0.65625,
"rewards/chosen": -0.1376953125,
"rewards/margins": 0.1640625,
"rewards/rejected": -0.302734375,
"step": 90
},
{
"epoch": 0.33299028016009147,
"grad_norm": 296.3334655761719,
"learning_rate": 1.3333333333333332e-06,
"logits/chosen": -0.65625,
"logits/rejected": -0.640625,
"logps/chosen": -127.5,
"logps/rejected": -174.0,
"loss": 0.6214,
"rewards/accuracies": 0.625,
"rewards/chosen": -0.158203125,
"rewards/margins": 0.1767578125,
"rewards/rejected": -0.333984375,
"step": 91
},
{
"epoch": 0.3366495140080046,
"grad_norm": 352.0799865722656,
"learning_rate": 1.326007326007326e-06,
"logits/chosen": -0.640625,
"logits/rejected": -0.62109375,
"logps/chosen": -165.0,
"logps/rejected": -151.0,
"loss": 0.6456,
"rewards/accuracies": 0.5625,
"rewards/chosen": -0.1826171875,
"rewards/margins": 0.111328125,
"rewards/rejected": -0.294921875,
"step": 92
},
{
"epoch": 0.3403087478559177,
"grad_norm": 342.6123962402344,
"learning_rate": 1.3186813186813185e-06,
"logits/chosen": -0.65625,
"logits/rejected": -0.671875,
"logps/chosen": -153.0,
"logps/rejected": -198.0,
"loss": 0.6411,
"rewards/accuracies": 0.71875,
"rewards/chosen": -0.1748046875,
"rewards/margins": 0.1318359375,
"rewards/rejected": -0.306640625,
"step": 93
},
{
"epoch": 0.34396798170383075,
"grad_norm": 400.05133056640625,
"learning_rate": 1.3113553113553113e-06,
"logits/chosen": -0.6796875,
"logits/rejected": -0.70703125,
"logps/chosen": -154.0,
"logps/rejected": -185.0,
"loss": 0.6475,
"rewards/accuracies": 0.59375,
"rewards/chosen": -0.1455078125,
"rewards/margins": 0.10595703125,
"rewards/rejected": -0.251953125,
"step": 94
},
{
"epoch": 0.34762721555174386,
"grad_norm": 314.9571838378906,
"learning_rate": 1.304029304029304e-06,
"logits/chosen": -0.6640625,
"logits/rejected": -0.62890625,
"logps/chosen": -160.0,
"logps/rejected": -175.0,
"loss": 0.6207,
"rewards/accuracies": 0.6875,
"rewards/chosen": -0.169921875,
"rewards/margins": 0.1650390625,
"rewards/rejected": -0.333984375,
"step": 95
},
{
"epoch": 0.3512864493996569,
"grad_norm": 333.59881591796875,
"learning_rate": 1.2967032967032966e-06,
"logits/chosen": -0.68359375,
"logits/rejected": -0.703125,
"logps/chosen": -143.0,
"logps/rejected": -218.0,
"loss": 0.617,
"rewards/accuracies": 0.6875,
"rewards/chosen": -0.126953125,
"rewards/margins": 0.1826171875,
"rewards/rejected": -0.310546875,
"step": 96
},
{
"epoch": 0.35494568324757003,
"grad_norm": 356.0664978027344,
"learning_rate": 1.2893772893772894e-06,
"logits/chosen": -0.6484375,
"logits/rejected": -0.6875,
"logps/chosen": -164.0,
"logps/rejected": -185.0,
"loss": 0.6273,
"rewards/accuracies": 0.6875,
"rewards/chosen": -0.1669921875,
"rewards/margins": 0.1865234375,
"rewards/rejected": -0.353515625,
"step": 97
},
{
"epoch": 0.35860491709548314,
"grad_norm": 354.0408630371094,
"learning_rate": 1.2820512820512822e-06,
"logits/chosen": -0.66015625,
"logits/rejected": -0.70703125,
"logps/chosen": -145.0,
"logps/rejected": -165.0,
"loss": 0.6429,
"rewards/accuracies": 0.6875,
"rewards/chosen": -0.1494140625,
"rewards/margins": 0.119140625,
"rewards/rejected": -0.267578125,
"step": 98
},
{
"epoch": 0.3622641509433962,
"grad_norm": 350.7596130371094,
"learning_rate": 1.2747252747252745e-06,
"logits/chosen": -0.6640625,
"logits/rejected": -0.61328125,
"logps/chosen": -186.0,
"logps/rejected": -204.0,
"loss": 0.5828,
"rewards/accuracies": 0.78125,
"rewards/chosen": -0.140625,
"rewards/margins": 0.25,
"rewards/rejected": -0.390625,
"step": 99
},
{
"epoch": 0.3659233847913093,
"grad_norm": 314.3235778808594,
"learning_rate": 1.2673992673992673e-06,
"logits/chosen": -0.640625,
"logits/rejected": -0.6171875,
"logps/chosen": -159.0,
"logps/rejected": -175.0,
"loss": 0.6156,
"rewards/accuracies": 0.6875,
"rewards/chosen": -0.1953125,
"rewards/margins": 0.1845703125,
"rewards/rejected": -0.380859375,
"step": 100
},
{
"epoch": 0.3695826186392224,
"grad_norm": 308.3187561035156,
"learning_rate": 1.2600732600732599e-06,
"logits/chosen": -0.66015625,
"logits/rejected": -0.64453125,
"logps/chosen": -152.0,
"logps/rejected": -206.0,
"loss": 0.6235,
"rewards/accuracies": 0.6875,
"rewards/chosen": -0.1728515625,
"rewards/margins": 0.16015625,
"rewards/rejected": -0.333984375,
"step": 101
},
{
"epoch": 0.3732418524871355,
"grad_norm": 339.0077209472656,
"learning_rate": 1.2527472527472527e-06,
"logits/chosen": -0.671875,
"logits/rejected": -0.6796875,
"logps/chosen": -150.0,
"logps/rejected": -198.0,
"loss": 0.6145,
"rewards/accuracies": 0.65625,
"rewards/chosen": -0.1669921875,
"rewards/margins": 0.1796875,
"rewards/rejected": -0.34765625,
"step": 102
},
{
"epoch": 0.3769010863350486,
"grad_norm": 333.14642333984375,
"learning_rate": 1.2454212454212454e-06,
"logits/chosen": -0.65625,
"logits/rejected": -0.63671875,
"logps/chosen": -160.0,
"logps/rejected": -172.0,
"loss": 0.5947,
"rewards/accuracies": 0.75,
"rewards/chosen": -0.125,
"rewards/margins": 0.2265625,
"rewards/rejected": -0.3515625,
"step": 103
},
{
"epoch": 0.3805603201829617,
"grad_norm": 327.3541564941406,
"learning_rate": 1.238095238095238e-06,
"logits/chosen": -0.64453125,
"logits/rejected": -0.62890625,
"logps/chosen": -173.0,
"logps/rejected": -195.0,
"loss": 0.6166,
"rewards/accuracies": 0.71875,
"rewards/chosen": -0.1904296875,
"rewards/margins": 0.1796875,
"rewards/rejected": -0.37109375,
"step": 104
},
{
"epoch": 0.38421955403087477,
"grad_norm": 353.1539611816406,
"learning_rate": 1.2307692307692308e-06,
"logits/chosen": -0.67578125,
"logits/rejected": -0.66015625,
"logps/chosen": -157.0,
"logps/rejected": -188.0,
"loss": 0.6166,
"rewards/accuracies": 0.65625,
"rewards/chosen": -0.2158203125,
"rewards/margins": 0.189453125,
"rewards/rejected": -0.40625,
"step": 105
},
{
"epoch": 0.3878787878787879,
"grad_norm": 338.275390625,
"learning_rate": 1.2234432234432235e-06,
"logits/chosen": -0.69921875,
"logits/rejected": -0.6875,
"logps/chosen": -150.0,
"logps/rejected": -162.0,
"loss": 0.5969,
"rewards/accuracies": 0.6875,
"rewards/chosen": -0.1337890625,
"rewards/margins": 0.2177734375,
"rewards/rejected": -0.3515625,
"step": 106
},
{
"epoch": 0.391538021726701,
"grad_norm": 338.1829528808594,
"learning_rate": 1.2161172161172159e-06,
"logits/chosen": -0.65234375,
"logits/rejected": -0.6171875,
"logps/chosen": -157.0,
"logps/rejected": -145.0,
"loss": 0.645,
"rewards/accuracies": 0.5,
"rewards/chosen": -0.1943359375,
"rewards/margins": 0.10546875,
"rewards/rejected": -0.30078125,
"step": 107
},
{
"epoch": 0.39519725557461405,
"grad_norm": 334.7667236328125,
"learning_rate": 1.2087912087912087e-06,
"logits/chosen": -0.69921875,
"logits/rejected": -0.6640625,
"logps/chosen": -132.0,
"logps/rejected": -213.0,
"loss": 0.5587,
"rewards/accuracies": 0.875,
"rewards/chosen": -0.138671875,
"rewards/margins": 0.314453125,
"rewards/rejected": -0.453125,
"step": 108
},
{
"epoch": 0.39885648942252716,
"grad_norm": 328.79302978515625,
"learning_rate": 1.2014652014652014e-06,
"logits/chosen": -0.65625,
"logits/rejected": -0.6796875,
"logps/chosen": -180.0,
"logps/rejected": -173.0,
"loss": 0.6177,
"rewards/accuracies": 0.65625,
"rewards/chosen": -0.205078125,
"rewards/margins": 0.189453125,
"rewards/rejected": -0.39453125,
"step": 109
},
{
"epoch": 0.4025157232704403,
"grad_norm": 397.0133056640625,
"learning_rate": 1.194139194139194e-06,
"logits/chosen": -0.6796875,
"logits/rejected": -0.6640625,
"logps/chosen": -157.0,
"logps/rejected": -169.0,
"loss": 0.6269,
"rewards/accuracies": 0.65625,
"rewards/chosen": -0.203125,
"rewards/margins": 0.171875,
"rewards/rejected": -0.375,
"step": 110
},
{
"epoch": 0.40617495711835333,
"grad_norm": 333.8108825683594,
"learning_rate": 1.1868131868131868e-06,
"logits/chosen": -0.68359375,
"logits/rejected": -0.671875,
"logps/chosen": -176.0,
"logps/rejected": -204.0,
"loss": 0.6445,
"rewards/accuracies": 0.59375,
"rewards/chosen": -0.2177734375,
"rewards/margins": 0.1220703125,
"rewards/rejected": -0.33984375,
"step": 111
},
{
"epoch": 0.40983419096626644,
"grad_norm": 340.60955810546875,
"learning_rate": 1.1794871794871795e-06,
"logits/chosen": -0.69921875,
"logits/rejected": -0.6953125,
"logps/chosen": -152.0,
"logps/rejected": -188.0,
"loss": 0.6043,
"rewards/accuracies": 0.78125,
"rewards/chosen": -0.1669921875,
"rewards/margins": 0.212890625,
"rewards/rejected": -0.380859375,
"step": 112
},
{
"epoch": 0.41349342481417956,
"grad_norm": 338.4276123046875,
"learning_rate": 1.172161172161172e-06,
"logits/chosen": -0.69140625,
"logits/rejected": -0.65625,
"logps/chosen": -145.0,
"logps/rejected": -161.0,
"loss": 0.6066,
"rewards/accuracies": 0.71875,
"rewards/chosen": -0.1865234375,
"rewards/margins": 0.203125,
"rewards/rejected": -0.388671875,
"step": 113
},
{
"epoch": 0.4171526586620926,
"grad_norm": 357.9419250488281,
"learning_rate": 1.1648351648351649e-06,
"logits/chosen": -0.68359375,
"logits/rejected": -0.6484375,
"logps/chosen": -176.0,
"logps/rejected": -196.0,
"loss": 0.6153,
"rewards/accuracies": 0.71875,
"rewards/chosen": -0.291015625,
"rewards/margins": 0.189453125,
"rewards/rejected": -0.48046875,
"step": 114
},
{
"epoch": 0.4208118925100057,
"grad_norm": 319.607177734375,
"learning_rate": 1.1575091575091577e-06,
"logits/chosen": -0.65234375,
"logits/rejected": -0.625,
"logps/chosen": -153.0,
"logps/rejected": -165.0,
"loss": 0.5956,
"rewards/accuracies": 0.75,
"rewards/chosen": -0.1865234375,
"rewards/margins": 0.2109375,
"rewards/rejected": -0.396484375,
"step": 115
},
{
"epoch": 0.42447112635791884,
"grad_norm": 332.0836181640625,
"learning_rate": 1.15018315018315e-06,
"logits/chosen": -0.6953125,
"logits/rejected": -0.69921875,
"logps/chosen": -160.0,
"logps/rejected": -176.0,
"loss": 0.6059,
"rewards/accuracies": 0.75,
"rewards/chosen": -0.1767578125,
"rewards/margins": 0.2099609375,
"rewards/rejected": -0.38671875,
"step": 116
},
{
"epoch": 0.4281303602058319,
"grad_norm": 327.6258544921875,
"learning_rate": 1.1428571428571428e-06,
"logits/chosen": -0.65625,
"logits/rejected": -0.734375,
"logps/chosen": -152.0,
"logps/rejected": -161.0,
"loss": 0.639,
"rewards/accuracies": 0.5625,
"rewards/chosen": -0.2177734375,
"rewards/margins": 0.1357421875,
"rewards/rejected": -0.353515625,
"step": 117
},
{
"epoch": 0.431789594053745,
"grad_norm": 348.0113525390625,
"learning_rate": 1.1355311355311353e-06,
"logits/chosen": -0.62109375,
"logits/rejected": -0.64453125,
"logps/chosen": -180.0,
"logps/rejected": -178.0,
"loss": 0.6324,
"rewards/accuracies": 0.65625,
"rewards/chosen": -0.302734375,
"rewards/margins": 0.1611328125,
"rewards/rejected": -0.46484375,
"step": 118
},
{
"epoch": 0.43544882790165806,
"grad_norm": 323.5909729003906,
"learning_rate": 1.1282051282051281e-06,
"logits/chosen": -0.65234375,
"logits/rejected": -0.66796875,
"logps/chosen": -171.0,
"logps/rejected": -162.0,
"loss": 0.6286,
"rewards/accuracies": 0.6875,
"rewards/chosen": -0.205078125,
"rewards/margins": 0.1630859375,
"rewards/rejected": -0.3671875,
"step": 119
},
{
"epoch": 0.4391080617495712,
"grad_norm": 356.1521301269531,
"learning_rate": 1.1208791208791209e-06,
"logits/chosen": -0.671875,
"logits/rejected": -0.69140625,
"logps/chosen": -141.0,
"logps/rejected": -170.0,
"loss": 0.6358,
"rewards/accuracies": 0.625,
"rewards/chosen": -0.224609375,
"rewards/margins": 0.142578125,
"rewards/rejected": -0.3671875,
"step": 120
},
{
"epoch": 0.4427672955974843,
"grad_norm": 323.0431213378906,
"learning_rate": 1.1135531135531134e-06,
"logits/chosen": -0.58984375,
"logits/rejected": -0.63671875,
"logps/chosen": -149.0,
"logps/rejected": -205.0,
"loss": 0.5646,
"rewards/accuracies": 0.78125,
"rewards/chosen": -0.1533203125,
"rewards/margins": 0.314453125,
"rewards/rejected": -0.466796875,
"step": 121
},
{
"epoch": 0.44642652944539735,
"grad_norm": 394.70880126953125,
"learning_rate": 1.1062271062271062e-06,
"logits/chosen": -0.68359375,
"logits/rejected": -0.734375,
"logps/chosen": -145.0,
"logps/rejected": -171.0,
"loss": 0.6443,
"rewards/accuracies": 0.65625,
"rewards/chosen": -0.2138671875,
"rewards/margins": 0.1171875,
"rewards/rejected": -0.33203125,
"step": 122
},
{
"epoch": 0.45008576329331046,
"grad_norm": 361.07220458984375,
"learning_rate": 1.098901098901099e-06,
"logits/chosen": -0.65625,
"logits/rejected": -0.67578125,
"logps/chosen": -174.0,
"logps/rejected": -179.0,
"loss": 0.6489,
"rewards/accuracies": 0.59375,
"rewards/chosen": -0.279296875,
"rewards/margins": 0.1123046875,
"rewards/rejected": -0.390625,
"step": 123
},
{
"epoch": 0.45374499714122357,
"grad_norm": 378.9485778808594,
"learning_rate": 1.0915750915750913e-06,
"logits/chosen": -0.640625,
"logits/rejected": -0.640625,
"logps/chosen": -166.0,
"logps/rejected": -181.0,
"loss": 0.6277,
"rewards/accuracies": 0.71875,
"rewards/chosen": -0.2314453125,
"rewards/margins": 0.158203125,
"rewards/rejected": -0.388671875,
"step": 124
},
{
"epoch": 0.45740423098913663,
"grad_norm": 361.32470703125,
"learning_rate": 1.0842490842490841e-06,
"logits/chosen": -0.70703125,
"logits/rejected": -0.65625,
"logps/chosen": -162.0,
"logps/rejected": -201.0,
"loss": 0.6276,
"rewards/accuracies": 0.625,
"rewards/chosen": -0.2314453125,
"rewards/margins": 0.1826171875,
"rewards/rejected": -0.4140625,
"step": 125
},
{
"epoch": 0.46106346483704974,
"grad_norm": 344.46905517578125,
"learning_rate": 1.0769230769230769e-06,
"logits/chosen": -0.63671875,
"logits/rejected": -0.671875,
"logps/chosen": -175.0,
"logps/rejected": -169.0,
"loss": 0.6512,
"rewards/accuracies": 0.65625,
"rewards/chosen": -0.255859375,
"rewards/margins": 0.10400390625,
"rewards/rejected": -0.361328125,
"step": 126
},
{
"epoch": 0.46472269868496285,
"grad_norm": 350.5096130371094,
"learning_rate": 1.0695970695970695e-06,
"logits/chosen": -0.69921875,
"logits/rejected": -0.72265625,
"logps/chosen": -177.0,
"logps/rejected": -169.0,
"loss": 0.621,
"rewards/accuracies": 0.6875,
"rewards/chosen": -0.2265625,
"rewards/margins": 0.185546875,
"rewards/rejected": -0.412109375,
"step": 127
},
{
"epoch": 0.4683819325328759,
"grad_norm": 321.7780456542969,
"learning_rate": 1.0622710622710622e-06,
"logits/chosen": -0.6953125,
"logits/rejected": -0.6640625,
"logps/chosen": -144.0,
"logps/rejected": -200.0,
"loss": 0.5705,
"rewards/accuracies": 0.71875,
"rewards/chosen": -0.1669921875,
"rewards/margins": 0.3046875,
"rewards/rejected": -0.47265625,
"step": 128
},
{
"epoch": 0.472041166380789,
"grad_norm": 312.19964599609375,
"learning_rate": 1.054945054945055e-06,
"logits/chosen": -0.60546875,
"logits/rejected": -0.58203125,
"logps/chosen": -150.0,
"logps/rejected": -210.0,
"loss": 0.5723,
"rewards/accuracies": 0.75,
"rewards/chosen": -0.1396484375,
"rewards/margins": 0.3359375,
"rewards/rejected": -0.474609375,
"step": 129
},
{
"epoch": 0.47570040022870214,
"grad_norm": 354.0895080566406,
"learning_rate": 1.0476190476190476e-06,
"logits/chosen": -0.6640625,
"logits/rejected": -0.66796875,
"logps/chosen": -166.0,
"logps/rejected": -170.0,
"loss": 0.6128,
"rewards/accuracies": 0.71875,
"rewards/chosen": -0.2890625,
"rewards/margins": 0.1875,
"rewards/rejected": -0.4765625,
"step": 130
},
{
"epoch": 0.4793596340766152,
"grad_norm": 359.5901184082031,
"learning_rate": 1.0402930402930403e-06,
"logits/chosen": -0.69921875,
"logits/rejected": -0.6953125,
"logps/chosen": -155.0,
"logps/rejected": -184.0,
"loss": 0.6275,
"rewards/accuracies": 0.6875,
"rewards/chosen": -0.1689453125,
"rewards/margins": 0.1669921875,
"rewards/rejected": -0.3359375,
"step": 131
},
{
"epoch": 0.4830188679245283,
"grad_norm": 325.01580810546875,
"learning_rate": 1.0329670329670331e-06,
"logits/chosen": -0.6640625,
"logits/rejected": -0.61328125,
"logps/chosen": -155.0,
"logps/rejected": -172.0,
"loss": 0.6331,
"rewards/accuracies": 0.6875,
"rewards/chosen": -0.2021484375,
"rewards/margins": 0.169921875,
"rewards/rejected": -0.37109375,
"step": 132
},
{
"epoch": 0.4866781017724414,
"grad_norm": 306.410888671875,
"learning_rate": 1.0256410256410255e-06,
"logits/chosen": -0.66796875,
"logits/rejected": -0.671875,
"logps/chosen": -146.0,
"logps/rejected": -181.0,
"loss": 0.5833,
"rewards/accuracies": 0.78125,
"rewards/chosen": -0.1416015625,
"rewards/margins": 0.248046875,
"rewards/rejected": -0.388671875,
"step": 133
},
{
"epoch": 0.4903373356203545,
"grad_norm": 330.1487121582031,
"learning_rate": 1.0183150183150182e-06,
"logits/chosen": -0.66015625,
"logits/rejected": -0.68359375,
"logps/chosen": -176.0,
"logps/rejected": -228.0,
"loss": 0.5701,
"rewards/accuracies": 0.71875,
"rewards/chosen": -0.2099609375,
"rewards/margins": 0.314453125,
"rewards/rejected": -0.5234375,
"step": 134
},
{
"epoch": 0.4939965694682676,
"grad_norm": 355.6802673339844,
"learning_rate": 1.010989010989011e-06,
"logits/chosen": -0.6875,
"logits/rejected": -0.65234375,
"logps/chosen": -166.0,
"logps/rejected": -146.0,
"loss": 0.6357,
"rewards/accuracies": 0.65625,
"rewards/chosen": -0.150390625,
"rewards/margins": 0.150390625,
"rewards/rejected": -0.30078125,
"step": 135
},
{
"epoch": 0.4976558033161807,
"grad_norm": 325.06951904296875,
"learning_rate": 1.0036630036630036e-06,
"logits/chosen": -0.6796875,
"logits/rejected": -0.609375,
"logps/chosen": -151.0,
"logps/rejected": -168.0,
"loss": 0.62,
"rewards/accuracies": 0.6875,
"rewards/chosen": -0.1455078125,
"rewards/margins": 0.17578125,
"rewards/rejected": -0.322265625,
"step": 136
},
{
"epoch": 0.5013150371640938,
"grad_norm": 342.5461120605469,
"learning_rate": 9.963369963369963e-07,
"logits/chosen": -0.6328125,
"logits/rejected": -0.625,
"logps/chosen": -179.0,
"logps/rejected": -178.0,
"loss": 0.6149,
"rewards/accuracies": 0.71875,
"rewards/chosen": -0.1533203125,
"rewards/margins": 0.1826171875,
"rewards/rejected": -0.3359375,
"step": 137
},
{
"epoch": 0.5049742710120069,
"grad_norm": 294.18218994140625,
"learning_rate": 9.89010989010989e-07,
"logits/chosen": -0.671875,
"logits/rejected": -0.640625,
"logps/chosen": -158.0,
"logps/rejected": -189.0,
"loss": 0.5771,
"rewards/accuracies": 0.78125,
"rewards/chosen": -0.1455078125,
"rewards/margins": 0.287109375,
"rewards/rejected": -0.43359375,
"step": 138
},
{
"epoch": 0.50863350485992,
"grad_norm": 349.0784606933594,
"learning_rate": 9.816849816849817e-07,
"logits/chosen": -0.68359375,
"logits/rejected": -0.6171875,
"logps/chosen": -141.0,
"logps/rejected": -147.0,
"loss": 0.6296,
"rewards/accuracies": 0.6875,
"rewards/chosen": -0.08154296875,
"rewards/margins": 0.15234375,
"rewards/rejected": -0.2333984375,
"step": 139
},
{
"epoch": 0.5122927387078331,
"grad_norm": 296.64013671875,
"learning_rate": 9.743589743589742e-07,
"logits/chosen": -0.69140625,
"logits/rejected": -0.671875,
"logps/chosen": -142.0,
"logps/rejected": -157.0,
"loss": 0.5943,
"rewards/accuracies": 0.8125,
"rewards/chosen": -0.10498046875,
"rewards/margins": 0.224609375,
"rewards/rejected": -0.330078125,
"step": 140
},
{
"epoch": 0.5159519725557461,
"grad_norm": 366.21868896484375,
"learning_rate": 9.67032967032967e-07,
"logits/chosen": -0.66015625,
"logits/rejected": -0.61328125,
"logps/chosen": -158.0,
"logps/rejected": -163.0,
"loss": 0.6171,
"rewards/accuracies": 0.65625,
"rewards/chosen": -0.1376953125,
"rewards/margins": 0.1796875,
"rewards/rejected": -0.318359375,
"step": 141
},
{
"epoch": 0.5196112064036592,
"grad_norm": 356.66766357421875,
"learning_rate": 9.597069597069598e-07,
"logits/chosen": -0.625,
"logits/rejected": -0.671875,
"logps/chosen": -137.0,
"logps/rejected": -187.0,
"loss": 0.5703,
"rewards/accuracies": 0.8125,
"rewards/chosen": -0.16015625,
"rewards/margins": 0.322265625,
"rewards/rejected": -0.482421875,
"step": 142
},
{
"epoch": 0.5232704402515723,
"grad_norm": 328.0158996582031,
"learning_rate": 9.523809523809522e-07,
"logits/chosen": -0.625,
"logits/rejected": -0.64453125,
"logps/chosen": -176.0,
"logps/rejected": -209.0,
"loss": 0.6207,
"rewards/accuracies": 0.6875,
"rewards/chosen": -0.244140625,
"rewards/margins": 0.1884765625,
"rewards/rejected": -0.43359375,
"step": 143
},
{
"epoch": 0.5269296740994854,
"grad_norm": 343.86138916015625,
"learning_rate": 9.45054945054945e-07,
"logits/chosen": -0.6796875,
"logits/rejected": -0.703125,
"logps/chosen": -152.0,
"logps/rejected": -203.0,
"loss": 0.5776,
"rewards/accuracies": 0.78125,
"rewards/chosen": -0.04541015625,
"rewards/margins": 0.291015625,
"rewards/rejected": -0.3359375,
"step": 144
},
{
"epoch": 0.5305889079473985,
"grad_norm": 339.378662109375,
"learning_rate": 9.377289377289377e-07,
"logits/chosen": -0.64453125,
"logits/rejected": -0.61328125,
"logps/chosen": -133.0,
"logps/rejected": -168.0,
"loss": 0.5869,
"rewards/accuracies": 0.875,
"rewards/chosen": -0.0908203125,
"rewards/margins": 0.2451171875,
"rewards/rejected": -0.3359375,
"step": 145
},
{
"epoch": 0.5342481417953117,
"grad_norm": 357.1183166503906,
"learning_rate": 9.304029304029304e-07,
"logits/chosen": -0.72265625,
"logits/rejected": -0.71484375,
"logps/chosen": -152.0,
"logps/rejected": -175.0,
"loss": 0.6175,
"rewards/accuracies": 0.75,
"rewards/chosen": -0.134765625,
"rewards/margins": 0.197265625,
"rewards/rejected": -0.33203125,
"step": 146
},
{
"epoch": 0.5379073756432247,
"grad_norm": 315.3673095703125,
"learning_rate": 9.230769230769231e-07,
"logits/chosen": -0.69921875,
"logits/rejected": -0.70703125,
"logps/chosen": -151.0,
"logps/rejected": -154.0,
"loss": 0.5938,
"rewards/accuracies": 0.8125,
"rewards/chosen": -0.08837890625,
"rewards/margins": 0.228515625,
"rewards/rejected": -0.31640625,
"step": 147
},
{
"epoch": 0.5415666094911378,
"grad_norm": 378.76580810546875,
"learning_rate": 9.157509157509157e-07,
"logits/chosen": -0.65625,
"logits/rejected": -0.66015625,
"logps/chosen": -163.0,
"logps/rejected": -184.0,
"loss": 0.581,
"rewards/accuracies": 0.8125,
"rewards/chosen": -0.087890625,
"rewards/margins": 0.263671875,
"rewards/rejected": -0.3515625,
"step": 148
},
{
"epoch": 0.5452258433390509,
"grad_norm": 315.32427978515625,
"learning_rate": 9.084249084249084e-07,
"logits/chosen": -0.68359375,
"logits/rejected": -0.6875,
"logps/chosen": -160.0,
"logps/rejected": -180.0,
"loss": 0.615,
"rewards/accuracies": 0.78125,
"rewards/chosen": -0.12060546875,
"rewards/margins": 0.1826171875,
"rewards/rejected": -0.302734375,
"step": 149
},
{
"epoch": 0.548885077186964,
"grad_norm": 302.259521484375,
"learning_rate": 9.010989010989011e-07,
"logits/chosen": -0.62890625,
"logits/rejected": -0.64453125,
"logps/chosen": -147.0,
"logps/rejected": -189.0,
"loss": 0.5753,
"rewards/accuracies": 0.78125,
"rewards/chosen": -0.0634765625,
"rewards/margins": 0.291015625,
"rewards/rejected": -0.35546875,
"step": 150
},
{
"epoch": 0.5525443110348771,
"grad_norm": 327.5895690917969,
"learning_rate": 8.937728937728938e-07,
"logits/chosen": -0.68359375,
"logits/rejected": -0.68359375,
"logps/chosen": -168.0,
"logps/rejected": -167.0,
"loss": 0.5899,
"rewards/accuracies": 0.6875,
"rewards/chosen": -0.0654296875,
"rewards/margins": 0.23828125,
"rewards/rejected": -0.302734375,
"step": 151
},
{
"epoch": 0.5562035448827901,
"grad_norm": 323.4364929199219,
"learning_rate": 8.864468864468864e-07,
"logits/chosen": -0.66796875,
"logits/rejected": -0.6796875,
"logps/chosen": -150.0,
"logps/rejected": -155.0,
"loss": 0.6307,
"rewards/accuracies": 0.6875,
"rewards/chosen": -0.07958984375,
"rewards/margins": 0.1435546875,
"rewards/rejected": -0.2236328125,
"step": 152
},
{
"epoch": 0.5598627787307032,
"grad_norm": 307.4286804199219,
"learning_rate": 8.79120879120879e-07,
"logits/chosen": -0.6796875,
"logits/rejected": -0.65625,
"logps/chosen": -136.0,
"logps/rejected": -162.0,
"loss": 0.5807,
"rewards/accuracies": 0.6875,
"rewards/chosen": -0.09375,
"rewards/margins": 0.26953125,
"rewards/rejected": -0.36328125,
"step": 153
},
{
"epoch": 0.5635220125786163,
"grad_norm": 307.41644287109375,
"learning_rate": 8.717948717948718e-07,
"logits/chosen": -0.71484375,
"logits/rejected": -0.62890625,
"logps/chosen": -136.0,
"logps/rejected": -173.0,
"loss": 0.5708,
"rewards/accuracies": 0.75,
"rewards/chosen": -0.0546875,
"rewards/margins": 0.283203125,
"rewards/rejected": -0.337890625,
"step": 154
},
{
"epoch": 0.5671812464265295,
"grad_norm": 329.59661865234375,
"learning_rate": 8.644688644688645e-07,
"logits/chosen": -0.64453125,
"logits/rejected": -0.66796875,
"logps/chosen": -143.0,
"logps/rejected": -196.0,
"loss": 0.6014,
"rewards/accuracies": 0.75,
"rewards/chosen": -0.1669921875,
"rewards/margins": 0.2255859375,
"rewards/rejected": -0.392578125,
"step": 155
},
{
"epoch": 0.5708404802744426,
"grad_norm": 330.7326354980469,
"learning_rate": 8.57142857142857e-07,
"logits/chosen": -0.5859375,
"logits/rejected": -0.609375,
"logps/chosen": -154.0,
"logps/rejected": -199.0,
"loss": 0.5914,
"rewards/accuracies": 0.6875,
"rewards/chosen": -0.09130859375,
"rewards/margins": 0.265625,
"rewards/rejected": -0.357421875,
"step": 156
},
{
"epoch": 0.5744997141223557,
"grad_norm": 335.531494140625,
"learning_rate": 8.498168498168498e-07,
"logits/chosen": -0.671875,
"logits/rejected": -0.65234375,
"logps/chosen": -145.0,
"logps/rejected": -178.0,
"loss": 0.59,
"rewards/accuracies": 0.75,
"rewards/chosen": -0.018798828125,
"rewards/margins": 0.259765625,
"rewards/rejected": -0.27734375,
"step": 157
},
{
"epoch": 0.5781589479702687,
"grad_norm": 324.5040588378906,
"learning_rate": 8.424908424908425e-07,
"logits/chosen": -0.71875,
"logits/rejected": -0.68359375,
"logps/chosen": -159.0,
"logps/rejected": -193.0,
"loss": 0.575,
"rewards/accuracies": 0.8125,
"rewards/chosen": -0.03125,
"rewards/margins": 0.279296875,
"rewards/rejected": -0.310546875,
"step": 158
},
{
"epoch": 0.5818181818181818,
"grad_norm": 370.49615478515625,
"learning_rate": 8.351648351648351e-07,
"logits/chosen": -0.71484375,
"logits/rejected": -0.69140625,
"logps/chosen": -158.0,
"logps/rejected": -142.0,
"loss": 0.6056,
"rewards/accuracies": 0.78125,
"rewards/chosen": -0.0830078125,
"rewards/margins": 0.2099609375,
"rewards/rejected": -0.29296875,
"step": 159
},
{
"epoch": 0.5854774156660949,
"grad_norm": 320.1568603515625,
"learning_rate": 8.278388278388277e-07,
"logits/chosen": -0.7109375,
"logits/rejected": -0.6953125,
"logps/chosen": -161.0,
"logps/rejected": -146.0,
"loss": 0.6121,
"rewards/accuracies": 0.84375,
"rewards/chosen": -0.053955078125,
"rewards/margins": 0.1904296875,
"rewards/rejected": -0.244140625,
"step": 160
},
{
"epoch": 0.589136649514008,
"grad_norm": 313.9174499511719,
"learning_rate": 8.205128205128205e-07,
"logits/chosen": -0.62109375,
"logits/rejected": -0.64453125,
"logps/chosen": -153.0,
"logps/rejected": -178.0,
"loss": 0.6049,
"rewards/accuracies": 0.65625,
"rewards/chosen": -0.08984375,
"rewards/margins": 0.2197265625,
"rewards/rejected": -0.30859375,
"step": 161
},
{
"epoch": 0.5927958833619211,
"grad_norm": 373.2075500488281,
"learning_rate": 8.131868131868131e-07,
"logits/chosen": -0.66015625,
"logits/rejected": -0.6953125,
"logps/chosen": -159.0,
"logps/rejected": -190.0,
"loss": 0.5909,
"rewards/accuracies": 0.71875,
"rewards/chosen": -0.03759765625,
"rewards/margins": 0.2412109375,
"rewards/rejected": -0.279296875,
"step": 162
},
{
"epoch": 0.5964551172098342,
"grad_norm": 335.1282958984375,
"learning_rate": 8.058608058608058e-07,
"logits/chosen": -0.671875,
"logits/rejected": -0.6328125,
"logps/chosen": -164.0,
"logps/rejected": -181.0,
"loss": 0.5697,
"rewards/accuracies": 0.71875,
"rewards/chosen": -0.04541015625,
"rewards/margins": 0.296875,
"rewards/rejected": -0.341796875,
"step": 163
},
{
"epoch": 0.6001143510577472,
"grad_norm": 335.8233642578125,
"learning_rate": 7.985347985347986e-07,
"logits/chosen": -0.7421875,
"logits/rejected": -0.6796875,
"logps/chosen": -146.0,
"logps/rejected": -187.0,
"loss": 0.5668,
"rewards/accuracies": 0.84375,
"rewards/chosen": 0.02197265625,
"rewards/margins": 0.306640625,
"rewards/rejected": -0.28515625,
"step": 164
},
{
"epoch": 0.6037735849056604,
"grad_norm": 321.95721435546875,
"learning_rate": 7.912087912087911e-07,
"logits/chosen": -0.64453125,
"logits/rejected": -0.6328125,
"logps/chosen": -156.0,
"logps/rejected": -180.0,
"loss": 0.5832,
"rewards/accuracies": 0.8125,
"rewards/chosen": -0.08984375,
"rewards/margins": 0.2890625,
"rewards/rejected": -0.380859375,
"step": 165
},
{
"epoch": 0.6074328187535735,
"grad_norm": 311.0093078613281,
"learning_rate": 7.838827838827838e-07,
"logits/chosen": -0.71875,
"logits/rejected": -0.69140625,
"logps/chosen": -143.0,
"logps/rejected": -170.0,
"loss": 0.5898,
"rewards/accuracies": 0.8125,
"rewards/chosen": -0.07373046875,
"rewards/margins": 0.244140625,
"rewards/rejected": -0.318359375,
"step": 166
},
{
"epoch": 0.6110920526014866,
"grad_norm": 370.56341552734375,
"learning_rate": 7.765567765567766e-07,
"logits/chosen": -0.66015625,
"logits/rejected": -0.6640625,
"logps/chosen": -162.0,
"logps/rejected": -193.0,
"loss": 0.6026,
"rewards/accuracies": 0.71875,
"rewards/chosen": -0.12060546875,
"rewards/margins": 0.2216796875,
"rewards/rejected": -0.341796875,
"step": 167
},
{
"epoch": 0.6147512864493997,
"grad_norm": 338.77239990234375,
"learning_rate": 7.692307692307693e-07,
"logits/chosen": -0.7109375,
"logits/rejected": -0.69921875,
"logps/chosen": -149.0,
"logps/rejected": -163.0,
"loss": 0.5883,
"rewards/accuracies": 0.8125,
"rewards/chosen": -0.032958984375,
"rewards/margins": 0.2412109375,
"rewards/rejected": -0.2734375,
"step": 168
},
{
"epoch": 0.6184105202973128,
"grad_norm": 408.2104187011719,
"learning_rate": 7.619047619047618e-07,
"logits/chosen": -0.66015625,
"logits/rejected": -0.65234375,
"logps/chosen": -187.0,
"logps/rejected": -174.0,
"loss": 0.6561,
"rewards/accuracies": 0.5625,
"rewards/chosen": -0.1357421875,
"rewards/margins": 0.0947265625,
"rewards/rejected": -0.23046875,
"step": 169
},
{
"epoch": 0.6220697541452258,
"grad_norm": 321.3171691894531,
"learning_rate": 7.545787545787545e-07,
"logits/chosen": -0.7421875,
"logits/rejected": -0.70703125,
"logps/chosen": -164.0,
"logps/rejected": -182.0,
"loss": 0.5742,
"rewards/accuracies": 0.75,
"rewards/chosen": -0.0281982421875,
"rewards/margins": 0.296875,
"rewards/rejected": -0.32421875,
"step": 170
},
{
"epoch": 0.6257289879931389,
"grad_norm": 327.4810485839844,
"learning_rate": 7.472527472527473e-07,
"logits/chosen": -0.640625,
"logits/rejected": -0.66796875,
"logps/chosen": -151.0,
"logps/rejected": -160.0,
"loss": 0.6061,
"rewards/accuracies": 0.8125,
"rewards/chosen": -0.07666015625,
"rewards/margins": 0.2021484375,
"rewards/rejected": -0.279296875,
"step": 171
},
{
"epoch": 0.629388221841052,
"grad_norm": 357.8804016113281,
"learning_rate": 7.399267399267399e-07,
"logits/chosen": -0.734375,
"logits/rejected": -0.703125,
"logps/chosen": -154.0,
"logps/rejected": -172.0,
"loss": 0.5742,
"rewards/accuracies": 0.6875,
"rewards/chosen": -0.050048828125,
"rewards/margins": 0.28515625,
"rewards/rejected": -0.333984375,
"step": 172
},
{
"epoch": 0.6330474556889651,
"grad_norm": 320.7285461425781,
"learning_rate": 7.326007326007325e-07,
"logits/chosen": -0.67578125,
"logits/rejected": -0.6875,
"logps/chosen": -161.0,
"logps/rejected": -184.0,
"loss": 0.564,
"rewards/accuracies": 0.8125,
"rewards/chosen": -0.0361328125,
"rewards/margins": 0.30859375,
"rewards/rejected": -0.345703125,
"step": 173
},
{
"epoch": 0.6367066895368783,
"grad_norm": 321.6654968261719,
"learning_rate": 7.252747252747253e-07,
"logits/chosen": -0.69140625,
"logits/rejected": -0.69921875,
"logps/chosen": -145.0,
"logps/rejected": -153.0,
"loss": 0.6049,
"rewards/accuracies": 0.65625,
"rewards/chosen": -0.038330078125,
"rewards/margins": 0.22265625,
"rewards/rejected": -0.26171875,
"step": 174
},
{
"epoch": 0.6403659233847913,
"grad_norm": 354.5701599121094,
"learning_rate": 7.179487179487179e-07,
"logits/chosen": -0.6953125,
"logits/rejected": -0.71875,
"logps/chosen": -180.0,
"logps/rejected": -174.0,
"loss": 0.5979,
"rewards/accuracies": 0.78125,
"rewards/chosen": -0.09521484375,
"rewards/margins": 0.2265625,
"rewards/rejected": -0.322265625,
"step": 175
},
{
"epoch": 0.6440251572327044,
"grad_norm": 333.7059020996094,
"learning_rate": 7.106227106227106e-07,
"logits/chosen": -0.68359375,
"logits/rejected": -0.68359375,
"logps/chosen": -157.0,
"logps/rejected": -198.0,
"loss": 0.5878,
"rewards/accuracies": 0.84375,
"rewards/chosen": -0.09228515625,
"rewards/margins": 0.24609375,
"rewards/rejected": -0.337890625,
"step": 176
},
{
"epoch": 0.6476843910806175,
"grad_norm": 325.05035400390625,
"learning_rate": 7.032967032967034e-07,
"logits/chosen": -0.67578125,
"logits/rejected": -0.671875,
"logps/chosen": -146.0,
"logps/rejected": -186.0,
"loss": 0.5739,
"rewards/accuracies": 0.78125,
"rewards/chosen": -0.0008392333984375,
"rewards/margins": 0.3046875,
"rewards/rejected": -0.306640625,
"step": 177
},
{
"epoch": 0.6513436249285306,
"grad_norm": 352.8323974609375,
"learning_rate": 6.959706959706959e-07,
"logits/chosen": -0.6640625,
"logits/rejected": -0.640625,
"logps/chosen": -179.0,
"logps/rejected": -218.0,
"loss": 0.5719,
"rewards/accuracies": 0.8125,
"rewards/chosen": -0.10009765625,
"rewards/margins": 0.314453125,
"rewards/rejected": -0.4140625,
"step": 178
},
{
"epoch": 0.6550028587764437,
"grad_norm": 307.6293029785156,
"learning_rate": 6.886446886446886e-07,
"logits/chosen": -0.6328125,
"logits/rejected": -0.66796875,
"logps/chosen": -146.0,
"logps/rejected": -172.0,
"loss": 0.5661,
"rewards/accuracies": 0.9375,
"rewards/chosen": -0.046142578125,
"rewards/margins": 0.302734375,
"rewards/rejected": -0.349609375,
"step": 179
},
{
"epoch": 0.6586620926243568,
"grad_norm": 356.95587158203125,
"learning_rate": 6.813186813186813e-07,
"logits/chosen": -0.66015625,
"logits/rejected": -0.67578125,
"logps/chosen": -149.0,
"logps/rejected": -164.0,
"loss": 0.6138,
"rewards/accuracies": 0.71875,
"rewards/chosen": -0.10009765625,
"rewards/margins": 0.1865234375,
"rewards/rejected": -0.287109375,
"step": 180
},
{
"epoch": 0.6623213264722698,
"grad_norm": 290.56317138671875,
"learning_rate": 6.73992673992674e-07,
"logits/chosen": -0.70703125,
"logits/rejected": -0.671875,
"logps/chosen": -136.0,
"logps/rejected": -171.0,
"loss": 0.5764,
"rewards/accuracies": 0.78125,
"rewards/chosen": -0.031982421875,
"rewards/margins": 0.29296875,
"rewards/rejected": -0.32421875,
"step": 181
},
{
"epoch": 0.6659805603201829,
"grad_norm": 313.93927001953125,
"learning_rate": 6.666666666666666e-07,
"logits/chosen": -0.66796875,
"logits/rejected": -0.64453125,
"logps/chosen": -145.0,
"logps/rejected": -164.0,
"loss": 0.5668,
"rewards/accuracies": 0.84375,
"rewards/chosen": -0.0015411376953125,
"rewards/margins": 0.287109375,
"rewards/rejected": -0.287109375,
"step": 182
},
{
"epoch": 0.669639794168096,
"grad_norm": 315.1253967285156,
"learning_rate": 6.593406593406593e-07,
"logits/chosen": -0.734375,
"logits/rejected": -0.71875,
"logps/chosen": -125.5,
"logps/rejected": -232.0,
"loss": 0.5599,
"rewards/accuracies": 0.8125,
"rewards/chosen": 0.0186767578125,
"rewards/margins": 0.3515625,
"rewards/rejected": -0.333984375,
"step": 183
},
{
"epoch": 0.6732990280160092,
"grad_norm": 326.492431640625,
"learning_rate": 6.52014652014652e-07,
"logits/chosen": -0.62890625,
"logits/rejected": -0.61328125,
"logps/chosen": -162.0,
"logps/rejected": -222.0,
"loss": 0.5437,
"rewards/accuracies": 0.8125,
"rewards/chosen": -0.030517578125,
"rewards/margins": 0.36328125,
"rewards/rejected": -0.392578125,
"step": 184
},
{
"epoch": 0.6769582618639223,
"grad_norm": 348.7772521972656,
"learning_rate": 6.446886446886447e-07,
"logits/chosen": -0.6640625,
"logits/rejected": -0.6484375,
"logps/chosen": -167.0,
"logps/rejected": -177.0,
"loss": 0.5911,
"rewards/accuracies": 0.71875,
"rewards/chosen": -0.0947265625,
"rewards/margins": 0.2431640625,
"rewards/rejected": -0.337890625,
"step": 185
},
{
"epoch": 0.6806174957118354,
"grad_norm": 336.41827392578125,
"learning_rate": 6.373626373626373e-07,
"logits/chosen": -0.6875,
"logits/rejected": -0.64453125,
"logps/chosen": -150.0,
"logps/rejected": -175.0,
"loss": 0.5616,
"rewards/accuracies": 0.8125,
"rewards/chosen": -0.01165771484375,
"rewards/margins": 0.298828125,
"rewards/rejected": -0.310546875,
"step": 186
},
{
"epoch": 0.6842767295597484,
"grad_norm": 328.49530029296875,
"learning_rate": 6.300366300366299e-07,
"logits/chosen": -0.69921875,
"logits/rejected": -0.70703125,
"logps/chosen": -146.0,
"logps/rejected": -151.0,
"loss": 0.5895,
"rewards/accuracies": 0.8125,
"rewards/chosen": -0.047607421875,
"rewards/margins": 0.232421875,
"rewards/rejected": -0.279296875,
"step": 187
},
{
"epoch": 0.6879359634076615,
"grad_norm": 351.6430969238281,
"learning_rate": 6.227106227106227e-07,
"logits/chosen": -0.65234375,
"logits/rejected": -0.671875,
"logps/chosen": -148.0,
"logps/rejected": -218.0,
"loss": 0.5731,
"rewards/accuracies": 0.75,
"rewards/chosen": -0.1025390625,
"rewards/margins": 0.30859375,
"rewards/rejected": -0.41015625,
"step": 188
},
{
"epoch": 0.6915951972555746,
"grad_norm": 318.9908752441406,
"learning_rate": 6.153846153846154e-07,
"logits/chosen": -0.73828125,
"logits/rejected": -0.6640625,
"logps/chosen": -145.0,
"logps/rejected": -169.0,
"loss": 0.5258,
"rewards/accuracies": 0.90625,
"rewards/chosen": -1.52587890625e-05,
"rewards/margins": 0.390625,
"rewards/rejected": -0.388671875,
"step": 189
},
{
"epoch": 0.6952544311034877,
"grad_norm": 342.9971618652344,
"learning_rate": 6.080586080586079e-07,
"logits/chosen": -0.70703125,
"logits/rejected": -0.69921875,
"logps/chosen": -157.0,
"logps/rejected": -189.0,
"loss": 0.5966,
"rewards/accuracies": 0.6875,
"rewards/chosen": -0.07666015625,
"rewards/margins": 0.234375,
"rewards/rejected": -0.310546875,
"step": 190
},
{
"epoch": 0.6989136649514008,
"grad_norm": 309.0221862792969,
"learning_rate": 6.007326007326007e-07,
"logits/chosen": -0.6484375,
"logits/rejected": -0.64453125,
"logps/chosen": -146.0,
"logps/rejected": -201.0,
"loss": 0.5492,
"rewards/accuracies": 0.84375,
"rewards/chosen": -0.04931640625,
"rewards/margins": 0.37109375,
"rewards/rejected": -0.419921875,
"step": 191
},
{
"epoch": 0.7025728987993138,
"grad_norm": 384.8427429199219,
"learning_rate": 5.934065934065934e-07,
"logits/chosen": -0.6875,
"logits/rejected": -0.671875,
"logps/chosen": -182.0,
"logps/rejected": -179.0,
"loss": 0.6272,
"rewards/accuracies": 0.65625,
"rewards/chosen": -0.12353515625,
"rewards/margins": 0.1796875,
"rewards/rejected": -0.302734375,
"step": 192
},
{
"epoch": 0.706232132647227,
"grad_norm": 345.20538330078125,
"learning_rate": 5.86080586080586e-07,
"logits/chosen": -0.6875,
"logits/rejected": -0.6875,
"logps/chosen": -152.0,
"logps/rejected": -150.0,
"loss": 0.6308,
"rewards/accuracies": 0.65625,
"rewards/chosen": -0.08447265625,
"rewards/margins": 0.1513671875,
"rewards/rejected": -0.236328125,
"step": 193
},
{
"epoch": 0.7098913664951401,
"grad_norm": 373.9530334472656,
"learning_rate": 5.787545787545788e-07,
"logits/chosen": -0.71484375,
"logits/rejected": -0.7265625,
"logps/chosen": -174.0,
"logps/rejected": -163.0,
"loss": 0.619,
"rewards/accuracies": 0.78125,
"rewards/chosen": -0.09228515625,
"rewards/margins": 0.1767578125,
"rewards/rejected": -0.26953125,
"step": 194
},
{
"epoch": 0.7135506003430532,
"grad_norm": 378.72406005859375,
"learning_rate": 5.714285714285714e-07,
"logits/chosen": -0.7109375,
"logits/rejected": -0.7109375,
"logps/chosen": -160.0,
"logps/rejected": -201.0,
"loss": 0.5354,
"rewards/accuracies": 0.8125,
"rewards/chosen": -0.0311279296875,
"rewards/margins": 0.380859375,
"rewards/rejected": -0.412109375,
"step": 195
},
{
"epoch": 0.7172098341909663,
"grad_norm": 326.7547912597656,
"learning_rate": 5.641025641025641e-07,
"logits/chosen": -0.67578125,
"logits/rejected": -0.68359375,
"logps/chosen": -152.0,
"logps/rejected": -164.0,
"loss": 0.594,
"rewards/accuracies": 0.78125,
"rewards/chosen": -0.04541015625,
"rewards/margins": 0.2392578125,
"rewards/rejected": -0.28515625,
"step": 196
},
{
"epoch": 0.7208690680388794,
"grad_norm": 332.29193115234375,
"learning_rate": 5.567765567765567e-07,
"logits/chosen": -0.68359375,
"logits/rejected": -0.71875,
"logps/chosen": -152.0,
"logps/rejected": -191.0,
"loss": 0.5926,
"rewards/accuracies": 0.75,
"rewards/chosen": -0.0703125,
"rewards/margins": 0.232421875,
"rewards/rejected": -0.302734375,
"step": 197
},
{
"epoch": 0.7245283018867924,
"grad_norm": 345.8672180175781,
"learning_rate": 5.494505494505495e-07,
"logits/chosen": -0.71484375,
"logits/rejected": -0.671875,
"logps/chosen": -153.0,
"logps/rejected": -190.0,
"loss": 0.5678,
"rewards/accuracies": 0.71875,
"rewards/chosen": -0.07177734375,
"rewards/margins": 0.310546875,
"rewards/rejected": -0.3828125,
"step": 198
},
{
"epoch": 0.7281875357347055,
"grad_norm": 418.1891174316406,
"learning_rate": 5.421245421245421e-07,
"logits/chosen": -0.69921875,
"logits/rejected": -0.68359375,
"logps/chosen": -167.0,
"logps/rejected": -182.0,
"loss": 0.5964,
"rewards/accuracies": 0.6875,
"rewards/chosen": -0.10302734375,
"rewards/margins": 0.2392578125,
"rewards/rejected": -0.341796875,
"step": 199
},
{
"epoch": 0.7318467695826186,
"grad_norm": 364.3031921386719,
"learning_rate": 5.347985347985347e-07,
"logits/chosen": -0.65234375,
"logits/rejected": -0.671875,
"logps/chosen": -186.0,
"logps/rejected": -180.0,
"loss": 0.5733,
"rewards/accuracies": 0.71875,
"rewards/chosen": -0.058837890625,
"rewards/margins": 0.28515625,
"rewards/rejected": -0.34375,
"step": 200
},
{
"epoch": 0.7355060034305317,
"grad_norm": 344.48663330078125,
"learning_rate": 5.274725274725275e-07,
"logits/chosen": -0.76171875,
"logits/rejected": -0.765625,
"logps/chosen": -141.0,
"logps/rejected": -156.0,
"loss": 0.571,
"rewards/accuracies": 0.90625,
"rewards/chosen": -0.03125,
"rewards/margins": 0.275390625,
"rewards/rejected": -0.306640625,
"step": 201
},
{
"epoch": 0.7391652372784449,
"grad_norm": 341.8359069824219,
"learning_rate": 5.201465201465202e-07,
"logits/chosen": -0.66796875,
"logits/rejected": -0.69140625,
"logps/chosen": -152.0,
"logps/rejected": -169.0,
"loss": 0.5828,
"rewards/accuracies": 0.71875,
"rewards/chosen": -0.109375,
"rewards/margins": 0.27734375,
"rewards/rejected": -0.38671875,
"step": 202
},
{
"epoch": 0.742824471126358,
"grad_norm": 331.3113708496094,
"learning_rate": 5.128205128205127e-07,
"logits/chosen": -0.69921875,
"logits/rejected": -0.64453125,
"logps/chosen": -160.0,
"logps/rejected": -174.0,
"loss": 0.5509,
"rewards/accuracies": 0.875,
"rewards/chosen": -0.0211181640625,
"rewards/margins": 0.328125,
"rewards/rejected": -0.349609375,
"step": 203
},
{
"epoch": 0.746483704974271,
"grad_norm": 331.06451416015625,
"learning_rate": 5.054945054945055e-07,
"logits/chosen": -0.640625,
"logits/rejected": -0.64453125,
"logps/chosen": -146.0,
"logps/rejected": -145.0,
"loss": 0.5928,
"rewards/accuracies": 0.8125,
"rewards/chosen": -0.050048828125,
"rewards/margins": 0.2333984375,
"rewards/rejected": -0.283203125,
"step": 204
},
{
"epoch": 0.7501429388221841,
"grad_norm": 386.7975769042969,
"learning_rate": 4.981684981684982e-07,
"logits/chosen": -0.640625,
"logits/rejected": -0.6328125,
"logps/chosen": -131.0,
"logps/rejected": -168.0,
"loss": 0.5466,
"rewards/accuracies": 0.8125,
"rewards/chosen": -0.050048828125,
"rewards/margins": 0.34765625,
"rewards/rejected": -0.396484375,
"step": 205
},
{
"epoch": 0.7538021726700972,
"grad_norm": 773.7296142578125,
"learning_rate": 4.908424908424908e-07,
"logits/chosen": -0.69140625,
"logits/rejected": -0.71875,
"logps/chosen": -143.0,
"logps/rejected": -178.0,
"loss": 0.6085,
"rewards/accuracies": 0.75,
"rewards/chosen": -0.1611328125,
"rewards/margins": 0.2138671875,
"rewards/rejected": -0.375,
"step": 206
},
{
"epoch": 0.7574614065180103,
"grad_norm": 327.77874755859375,
"learning_rate": 4.835164835164835e-07,
"logits/chosen": -0.68359375,
"logits/rejected": -0.66015625,
"logps/chosen": -168.0,
"logps/rejected": -157.0,
"loss": 0.5521,
"rewards/accuracies": 0.875,
"rewards/chosen": -0.040771484375,
"rewards/margins": 0.318359375,
"rewards/rejected": -0.359375,
"step": 207
},
{
"epoch": 0.7611206403659234,
"grad_norm": 380.7069396972656,
"learning_rate": 4.761904761904761e-07,
"logits/chosen": -0.7265625,
"logits/rejected": -0.6796875,
"logps/chosen": -148.0,
"logps/rejected": -183.0,
"loss": 0.5838,
"rewards/accuracies": 0.71875,
"rewards/chosen": -0.04541015625,
"rewards/margins": 0.2578125,
"rewards/rejected": -0.302734375,
"step": 208
},
{
"epoch": 0.7647798742138365,
"grad_norm": 362.50927734375,
"learning_rate": 4.6886446886446884e-07,
"logits/chosen": -0.73828125,
"logits/rejected": -0.72265625,
"logps/chosen": -177.0,
"logps/rejected": -156.0,
"loss": 0.5818,
"rewards/accuracies": 0.84375,
"rewards/chosen": -0.0517578125,
"rewards/margins": 0.2490234375,
"rewards/rejected": -0.30078125,
"step": 209
},
{
"epoch": 0.7684391080617495,
"grad_norm": 374.5245666503906,
"learning_rate": 4.6153846153846156e-07,
"logits/chosen": -0.66796875,
"logits/rejected": -0.6953125,
"logps/chosen": -140.0,
"logps/rejected": -198.0,
"loss": 0.6289,
"rewards/accuracies": 0.59375,
"rewards/chosen": -0.14453125,
"rewards/margins": 0.193359375,
"rewards/rejected": -0.337890625,
"step": 210
},
{
"epoch": 0.7720983419096626,
"grad_norm": 341.1881103515625,
"learning_rate": 4.542124542124542e-07,
"logits/chosen": -0.70703125,
"logits/rejected": -0.68359375,
"logps/chosen": -143.0,
"logps/rejected": -178.0,
"loss": 0.576,
"rewards/accuracies": 0.71875,
"rewards/chosen": -0.0203857421875,
"rewards/margins": 0.279296875,
"rewards/rejected": -0.30078125,
"step": 211
},
{
"epoch": 0.7757575757575758,
"grad_norm": 337.7765808105469,
"learning_rate": 4.468864468864469e-07,
"logits/chosen": -0.68359375,
"logits/rejected": -0.6875,
"logps/chosen": -135.0,
"logps/rejected": -186.0,
"loss": 0.5106,
"rewards/accuracies": 0.90625,
"rewards/chosen": 0.005462646484375,
"rewards/margins": 0.44140625,
"rewards/rejected": -0.435546875,
"step": 212
},
{
"epoch": 0.7794168096054889,
"grad_norm": 355.8410339355469,
"learning_rate": 4.395604395604395e-07,
"logits/chosen": -0.6796875,
"logits/rejected": -0.68359375,
"logps/chosen": -158.0,
"logps/rejected": -233.0,
"loss": 0.5145,
"rewards/accuracies": 0.84375,
"rewards/chosen": -0.04541015625,
"rewards/margins": 0.44140625,
"rewards/rejected": -0.48828125,
"step": 213
},
{
"epoch": 0.783076043453402,
"grad_norm": 336.0704345703125,
"learning_rate": 4.3223443223443223e-07,
"logits/chosen": -0.71484375,
"logits/rejected": -0.6953125,
"logps/chosen": -152.0,
"logps/rejected": -166.0,
"loss": 0.5754,
"rewards/accuracies": 0.71875,
"rewards/chosen": -0.0517578125,
"rewards/margins": 0.2890625,
"rewards/rejected": -0.341796875,
"step": 214
},
{
"epoch": 0.786735277301315,
"grad_norm": 361.47052001953125,
"learning_rate": 4.249084249084249e-07,
"logits/chosen": -0.7265625,
"logits/rejected": -0.73046875,
"logps/chosen": -148.0,
"logps/rejected": -169.0,
"loss": 0.5704,
"rewards/accuracies": 0.78125,
"rewards/chosen": -0.043701171875,
"rewards/margins": 0.298828125,
"rewards/rejected": -0.341796875,
"step": 215
},
{
"epoch": 0.7903945111492281,
"grad_norm": 323.4903259277344,
"learning_rate": 4.1758241758241757e-07,
"logits/chosen": -0.6953125,
"logits/rejected": -0.73046875,
"logps/chosen": -171.0,
"logps/rejected": -186.0,
"loss": 0.5572,
"rewards/accuracies": 0.84375,
"rewards/chosen": -0.095703125,
"rewards/margins": 0.3359375,
"rewards/rejected": -0.431640625,
"step": 216
},
{
"epoch": 0.7940537449971412,
"grad_norm": 334.9060363769531,
"learning_rate": 4.1025641025641024e-07,
"logits/chosen": -0.63671875,
"logits/rejected": -0.66796875,
"logps/chosen": -174.0,
"logps/rejected": -170.0,
"loss": 0.59,
"rewards/accuracies": 0.75,
"rewards/chosen": -0.05078125,
"rewards/margins": 0.2421875,
"rewards/rejected": -0.29296875,
"step": 217
},
{
"epoch": 0.7977129788450543,
"grad_norm": 318.1783142089844,
"learning_rate": 4.029304029304029e-07,
"logits/chosen": -0.69921875,
"logits/rejected": -0.72265625,
"logps/chosen": -146.0,
"logps/rejected": -157.0,
"loss": 0.5676,
"rewards/accuracies": 0.875,
"rewards/chosen": -0.08056640625,
"rewards/margins": 0.2890625,
"rewards/rejected": -0.369140625,
"step": 218
},
{
"epoch": 0.8013722126929674,
"grad_norm": 361.3813171386719,
"learning_rate": 3.9560439560439557e-07,
"logits/chosen": -0.69140625,
"logits/rejected": -0.69921875,
"logps/chosen": -168.0,
"logps/rejected": -171.0,
"loss": 0.5864,
"rewards/accuracies": 0.75,
"rewards/chosen": -0.1064453125,
"rewards/margins": 0.23828125,
"rewards/rejected": -0.345703125,
"step": 219
},
{
"epoch": 0.8050314465408805,
"grad_norm": 366.4966735839844,
"learning_rate": 3.882783882783883e-07,
"logits/chosen": -0.69140625,
"logits/rejected": -0.69921875,
"logps/chosen": -167.0,
"logps/rejected": -196.0,
"loss": 0.5481,
"rewards/accuracies": 0.75,
"rewards/chosen": -0.12451171875,
"rewards/margins": 0.416015625,
"rewards/rejected": -0.5390625,
"step": 220
},
{
"epoch": 0.8086906803887935,
"grad_norm": 337.0361022949219,
"learning_rate": 3.809523809523809e-07,
"logits/chosen": -0.69921875,
"logits/rejected": -0.69140625,
"logps/chosen": -155.0,
"logps/rejected": -188.0,
"loss": 0.5627,
"rewards/accuracies": 0.8125,
"rewards/chosen": -0.072265625,
"rewards/margins": 0.322265625,
"rewards/rejected": -0.39453125,
"step": 221
},
{
"epoch": 0.8123499142367067,
"grad_norm": 323.75201416015625,
"learning_rate": 3.7362637362637363e-07,
"logits/chosen": -0.7421875,
"logits/rejected": -0.6796875,
"logps/chosen": -150.0,
"logps/rejected": -199.0,
"loss": 0.5634,
"rewards/accuracies": 0.75,
"rewards/chosen": -0.09521484375,
"rewards/margins": 0.37109375,
"rewards/rejected": -0.466796875,
"step": 222
},
{
"epoch": 0.8160091480846198,
"grad_norm": 367.0987243652344,
"learning_rate": 3.6630036630036624e-07,
"logits/chosen": -0.67578125,
"logits/rejected": -0.67578125,
"logps/chosen": -168.0,
"logps/rejected": -156.0,
"loss": 0.5681,
"rewards/accuracies": 0.75,
"rewards/chosen": -0.04052734375,
"rewards/margins": 0.294921875,
"rewards/rejected": -0.3359375,
"step": 223
},
{
"epoch": 0.8196683819325329,
"grad_norm": 362.4571838378906,
"learning_rate": 3.5897435897435896e-07,
"logits/chosen": -0.70703125,
"logits/rejected": -0.73046875,
"logps/chosen": -142.0,
"logps/rejected": -204.0,
"loss": 0.5521,
"rewards/accuracies": 0.71875,
"rewards/chosen": -0.07373046875,
"rewards/margins": 0.34765625,
"rewards/rejected": -0.421875,
"step": 224
},
{
"epoch": 0.823327615780446,
"grad_norm": 340.5346374511719,
"learning_rate": 3.516483516483517e-07,
"logits/chosen": -0.76953125,
"logits/rejected": -0.6875,
"logps/chosen": -173.0,
"logps/rejected": -190.0,
"loss": 0.5436,
"rewards/accuracies": 0.8125,
"rewards/chosen": -0.0250244140625,
"rewards/margins": 0.37890625,
"rewards/rejected": -0.40234375,
"step": 225
},
{
"epoch": 0.8269868496283591,
"grad_norm": 369.2457580566406,
"learning_rate": 3.443223443223443e-07,
"logits/chosen": -0.69140625,
"logits/rejected": -0.70703125,
"logps/chosen": -153.0,
"logps/rejected": -188.0,
"loss": 0.6034,
"rewards/accuracies": 0.6875,
"rewards/chosen": -0.1328125,
"rewards/margins": 0.2265625,
"rewards/rejected": -0.359375,
"step": 226
},
{
"epoch": 0.8306460834762721,
"grad_norm": 373.647216796875,
"learning_rate": 3.36996336996337e-07,
"logits/chosen": -0.734375,
"logits/rejected": -0.75390625,
"logps/chosen": -176.0,
"logps/rejected": -161.0,
"loss": 0.5767,
"rewards/accuracies": 0.6875,
"rewards/chosen": -0.0751953125,
"rewards/margins": 0.283203125,
"rewards/rejected": -0.357421875,
"step": 227
},
{
"epoch": 0.8343053173241852,
"grad_norm": 391.55511474609375,
"learning_rate": 3.2967032967032963e-07,
"logits/chosen": -0.7109375,
"logits/rejected": -0.6640625,
"logps/chosen": -167.0,
"logps/rejected": -149.0,
"loss": 0.5791,
"rewards/accuracies": 0.8125,
"rewards/chosen": -0.0947265625,
"rewards/margins": 0.265625,
"rewards/rejected": -0.361328125,
"step": 228
},
{
"epoch": 0.8379645511720983,
"grad_norm": 340.9716796875,
"learning_rate": 3.2234432234432236e-07,
"logits/chosen": -0.74609375,
"logits/rejected": -0.70703125,
"logps/chosen": -140.0,
"logps/rejected": -163.0,
"loss": 0.5575,
"rewards/accuracies": 0.75,
"rewards/chosen": -0.06103515625,
"rewards/margins": 0.322265625,
"rewards/rejected": -0.3828125,
"step": 229
},
{
"epoch": 0.8416237850200115,
"grad_norm": 334.7230529785156,
"learning_rate": 3.1501831501831497e-07,
"logits/chosen": -0.7265625,
"logits/rejected": -0.734375,
"logps/chosen": -148.0,
"logps/rejected": -168.0,
"loss": 0.6023,
"rewards/accuracies": 0.75,
"rewards/chosen": -0.06640625,
"rewards/margins": 0.22265625,
"rewards/rejected": -0.2890625,
"step": 230
},
{
"epoch": 0.8452830188679246,
"grad_norm": 351.0285339355469,
"learning_rate": 3.076923076923077e-07,
"logits/chosen": -0.7265625,
"logits/rejected": -0.69140625,
"logps/chosen": -151.0,
"logps/rejected": -160.0,
"loss": 0.5653,
"rewards/accuracies": 0.75,
"rewards/chosen": -0.07666015625,
"rewards/margins": 0.3046875,
"rewards/rejected": -0.380859375,
"step": 231
},
{
"epoch": 0.8489422527158377,
"grad_norm": 340.0621337890625,
"learning_rate": 3.0036630036630036e-07,
"logits/chosen": -0.75390625,
"logits/rejected": -0.7421875,
"logps/chosen": -145.0,
"logps/rejected": -157.0,
"loss": 0.5784,
"rewards/accuracies": 0.8125,
"rewards/chosen": -0.015625,
"rewards/margins": 0.26953125,
"rewards/rejected": -0.28515625,
"step": 232
},
{
"epoch": 0.8526014865637507,
"grad_norm": 373.56488037109375,
"learning_rate": 2.93040293040293e-07,
"logits/chosen": -0.71875,
"logits/rejected": -0.703125,
"logps/chosen": -156.0,
"logps/rejected": -218.0,
"loss": 0.5762,
"rewards/accuracies": 0.71875,
"rewards/chosen": -0.12451171875,
"rewards/margins": 0.275390625,
"rewards/rejected": -0.400390625,
"step": 233
},
{
"epoch": 0.8562607204116638,
"grad_norm": 340.0142517089844,
"learning_rate": 2.857142857142857e-07,
"logits/chosen": -0.671875,
"logits/rejected": -0.71875,
"logps/chosen": -149.0,
"logps/rejected": -139.0,
"loss": 0.6108,
"rewards/accuracies": 0.75,
"rewards/chosen": -0.09375,
"rewards/margins": 0.18359375,
"rewards/rejected": -0.27734375,
"step": 234
},
{
"epoch": 0.8599199542595769,
"grad_norm": 363.7709655761719,
"learning_rate": 2.7838827838827836e-07,
"logits/chosen": -0.68359375,
"logits/rejected": -0.7109375,
"logps/chosen": -168.0,
"logps/rejected": -213.0,
"loss": 0.551,
"rewards/accuracies": 0.8125,
"rewards/chosen": -0.0859375,
"rewards/margins": 0.353515625,
"rewards/rejected": -0.439453125,
"step": 235
},
{
"epoch": 0.86357918810749,
"grad_norm": 354.7901916503906,
"learning_rate": 2.7106227106227103e-07,
"logits/chosen": -0.66796875,
"logits/rejected": -0.671875,
"logps/chosen": -137.0,
"logps/rejected": -155.0,
"loss": 0.6004,
"rewards/accuracies": 0.6875,
"rewards/chosen": -0.126953125,
"rewards/margins": 0.2265625,
"rewards/rejected": -0.353515625,
"step": 236
},
{
"epoch": 0.8672384219554031,
"grad_norm": 331.5390930175781,
"learning_rate": 2.6373626373626375e-07,
"logits/chosen": -0.69140625,
"logits/rejected": -0.6875,
"logps/chosen": -164.0,
"logps/rejected": -212.0,
"loss": 0.5416,
"rewards/accuracies": 0.84375,
"rewards/chosen": -0.0791015625,
"rewards/margins": 0.4140625,
"rewards/rejected": -0.4921875,
"step": 237
},
{
"epoch": 0.8708976558033161,
"grad_norm": 316.5717468261719,
"learning_rate": 2.5641025641025636e-07,
"logits/chosen": -0.71875,
"logits/rejected": -0.74609375,
"logps/chosen": -136.0,
"logps/rejected": -169.0,
"loss": 0.5723,
"rewards/accuracies": 0.75,
"rewards/chosen": 3.0517578125e-05,
"rewards/margins": 0.294921875,
"rewards/rejected": -0.294921875,
"step": 238
},
{
"epoch": 0.8745568896512292,
"grad_norm": 317.3512268066406,
"learning_rate": 2.490842490842491e-07,
"logits/chosen": -0.69140625,
"logits/rejected": -0.671875,
"logps/chosen": -180.0,
"logps/rejected": -165.0,
"loss": 0.5302,
"rewards/accuracies": 0.875,
"rewards/chosen": -0.006256103515625,
"rewards/margins": 0.388671875,
"rewards/rejected": -0.39453125,
"step": 239
},
{
"epoch": 0.8782161234991424,
"grad_norm": 365.77197265625,
"learning_rate": 2.4175824175824175e-07,
"logits/chosen": -0.71875,
"logits/rejected": -0.67578125,
"logps/chosen": -191.0,
"logps/rejected": -222.0,
"loss": 0.5382,
"rewards/accuracies": 0.875,
"rewards/chosen": -0.06884765625,
"rewards/margins": 0.390625,
"rewards/rejected": -0.458984375,
"step": 240
},
{
"epoch": 0.8818753573470555,
"grad_norm": 344.7721252441406,
"learning_rate": 2.3443223443223442e-07,
"logits/chosen": -0.6875,
"logits/rejected": -0.6640625,
"logps/chosen": -142.0,
"logps/rejected": -182.0,
"loss": 0.5768,
"rewards/accuracies": 0.84375,
"rewards/chosen": -0.10400390625,
"rewards/margins": 0.271484375,
"rewards/rejected": -0.375,
"step": 241
},
{
"epoch": 0.8855345911949686,
"grad_norm": 343.99896240234375,
"learning_rate": 2.271062271062271e-07,
"logits/chosen": -0.68359375,
"logits/rejected": -0.69140625,
"logps/chosen": -167.0,
"logps/rejected": -187.0,
"loss": 0.5477,
"rewards/accuracies": 0.8125,
"rewards/chosen": -0.0908203125,
"rewards/margins": 0.345703125,
"rewards/rejected": -0.435546875,
"step": 242
},
{
"epoch": 0.8891938250428817,
"grad_norm": 351.04913330078125,
"learning_rate": 2.1978021978021976e-07,
"logits/chosen": -0.69140625,
"logits/rejected": -0.67578125,
"logps/chosen": -154.0,
"logps/rejected": -162.0,
"loss": 0.5964,
"rewards/accuracies": 0.75,
"rewards/chosen": -0.01806640625,
"rewards/margins": 0.2431640625,
"rewards/rejected": -0.26171875,
"step": 243
},
{
"epoch": 0.8928530588907947,
"grad_norm": 331.8519287109375,
"learning_rate": 2.1245421245421245e-07,
"logits/chosen": -0.734375,
"logits/rejected": -0.73046875,
"logps/chosen": -137.0,
"logps/rejected": -184.0,
"loss": 0.5541,
"rewards/accuracies": 0.78125,
"rewards/chosen": -0.0140380859375,
"rewards/margins": 0.33984375,
"rewards/rejected": -0.353515625,
"step": 244
},
{
"epoch": 0.8965122927387078,
"grad_norm": 343.590087890625,
"learning_rate": 2.0512820512820512e-07,
"logits/chosen": -0.66796875,
"logits/rejected": -0.65625,
"logps/chosen": -147.0,
"logps/rejected": -196.0,
"loss": 0.5594,
"rewards/accuracies": 0.78125,
"rewards/chosen": 0.00628662109375,
"rewards/margins": 0.314453125,
"rewards/rejected": -0.30859375,
"step": 245
},
{
"epoch": 0.9001715265866209,
"grad_norm": 400.9288635253906,
"learning_rate": 1.9780219780219779e-07,
"logits/chosen": -0.70703125,
"logits/rejected": -0.6953125,
"logps/chosen": -150.0,
"logps/rejected": -184.0,
"loss": 0.5757,
"rewards/accuracies": 0.78125,
"rewards/chosen": -0.06103515625,
"rewards/margins": 0.291015625,
"rewards/rejected": -0.3515625,
"step": 246
},
{
"epoch": 0.903830760434534,
"grad_norm": 346.36065673828125,
"learning_rate": 1.9047619047619045e-07,
"logits/chosen": -0.69140625,
"logits/rejected": -0.67578125,
"logps/chosen": -153.0,
"logps/rejected": -198.0,
"loss": 0.5306,
"rewards/accuracies": 0.875,
"rewards/chosen": -0.045166015625,
"rewards/margins": 0.380859375,
"rewards/rejected": -0.42578125,
"step": 247
},
{
"epoch": 0.9074899942824471,
"grad_norm": 312.3040466308594,
"learning_rate": 1.8315018315018312e-07,
"logits/chosen": -0.6875,
"logits/rejected": -0.67578125,
"logps/chosen": -149.0,
"logps/rejected": -218.0,
"loss": 0.5116,
"rewards/accuracies": 0.875,
"rewards/chosen": -0.048583984375,
"rewards/margins": 0.48828125,
"rewards/rejected": -0.53515625,
"step": 248
},
{
"epoch": 0.9111492281303603,
"grad_norm": 320.7344665527344,
"learning_rate": 1.7582417582417584e-07,
"logits/chosen": -0.67578125,
"logits/rejected": -0.6796875,
"logps/chosen": -138.0,
"logps/rejected": -164.0,
"loss": 0.5797,
"rewards/accuracies": 0.78125,
"rewards/chosen": -0.035888671875,
"rewards/margins": 0.267578125,
"rewards/rejected": -0.302734375,
"step": 249
},
{
"epoch": 0.9148084619782733,
"grad_norm": 331.97637939453125,
"learning_rate": 1.684981684981685e-07,
"logits/chosen": -0.74609375,
"logits/rejected": -0.6953125,
"logps/chosen": -158.0,
"logps/rejected": -200.0,
"loss": 0.5593,
"rewards/accuracies": 0.8125,
"rewards/chosen": -0.04541015625,
"rewards/margins": 0.333984375,
"rewards/rejected": -0.380859375,
"step": 250
},
{
"epoch": 0.9184676958261864,
"grad_norm": 334.0833435058594,
"learning_rate": 1.6117216117216118e-07,
"logits/chosen": -0.73046875,
"logits/rejected": -0.70703125,
"logps/chosen": -153.0,
"logps/rejected": -223.0,
"loss": 0.5211,
"rewards/accuracies": 0.875,
"rewards/chosen": -0.0133056640625,
"rewards/margins": 0.40625,
"rewards/rejected": -0.419921875,
"step": 251
},
{
"epoch": 0.9221269296740995,
"grad_norm": 315.7561950683594,
"learning_rate": 1.5384615384615385e-07,
"logits/chosen": -0.70703125,
"logits/rejected": -0.69921875,
"logps/chosen": -163.0,
"logps/rejected": -171.0,
"loss": 0.5767,
"rewards/accuracies": 0.84375,
"rewards/chosen": -0.01483154296875,
"rewards/margins": 0.27734375,
"rewards/rejected": -0.291015625,
"step": 252
},
{
"epoch": 0.9257861635220126,
"grad_norm": 340.6386413574219,
"learning_rate": 1.465201465201465e-07,
"logits/chosen": -0.65234375,
"logits/rejected": -0.69140625,
"logps/chosen": -142.0,
"logps/rejected": -180.0,
"loss": 0.5369,
"rewards/accuracies": 0.84375,
"rewards/chosen": -0.051025390625,
"rewards/margins": 0.380859375,
"rewards/rejected": -0.431640625,
"step": 253
},
{
"epoch": 0.9294453973699257,
"grad_norm": 325.98187255859375,
"learning_rate": 1.3919413919413918e-07,
"logits/chosen": -0.6875,
"logits/rejected": -0.63671875,
"logps/chosen": -150.0,
"logps/rejected": -147.0,
"loss": 0.5456,
"rewards/accuracies": 0.84375,
"rewards/chosen": -0.0250244140625,
"rewards/margins": 0.34375,
"rewards/rejected": -0.369140625,
"step": 254
},
{
"epoch": 0.9331046312178388,
"grad_norm": 355.2104187011719,
"learning_rate": 1.3186813186813187e-07,
"logits/chosen": -0.671875,
"logits/rejected": -0.6953125,
"logps/chosen": -154.0,
"logps/rejected": -208.0,
"loss": 0.5472,
"rewards/accuracies": 0.75,
"rewards/chosen": -0.05078125,
"rewards/margins": 0.404296875,
"rewards/rejected": -0.455078125,
"step": 255
},
{
"epoch": 0.9367638650657518,
"grad_norm": 366.7920227050781,
"learning_rate": 1.2454212454212454e-07,
"logits/chosen": -0.703125,
"logits/rejected": -0.7109375,
"logps/chosen": -161.0,
"logps/rejected": -159.0,
"loss": 0.5634,
"rewards/accuracies": 0.84375,
"rewards/chosen": -0.043701171875,
"rewards/margins": 0.318359375,
"rewards/rejected": -0.361328125,
"step": 256
},
{
"epoch": 0.9404230989136649,
"grad_norm": 345.1733093261719,
"learning_rate": 1.1721611721611721e-07,
"logits/chosen": -0.70703125,
"logits/rejected": -0.703125,
"logps/chosen": -182.0,
"logps/rejected": -167.0,
"loss": 0.5864,
"rewards/accuracies": 0.71875,
"rewards/chosen": -0.10498046875,
"rewards/margins": 0.255859375,
"rewards/rejected": -0.361328125,
"step": 257
},
{
"epoch": 0.944082332761578,
"grad_norm": 342.8348083496094,
"learning_rate": 1.0989010989010988e-07,
"logits/chosen": -0.69921875,
"logits/rejected": -0.71875,
"logps/chosen": -165.0,
"logps/rejected": -150.0,
"loss": 0.5539,
"rewards/accuracies": 0.875,
"rewards/chosen": -0.00311279296875,
"rewards/margins": 0.328125,
"rewards/rejected": -0.330078125,
"step": 258
},
{
"epoch": 0.9477415666094912,
"grad_norm": 317.3765563964844,
"learning_rate": 1.0256410256410256e-07,
"logits/chosen": -0.75,
"logits/rejected": -0.71875,
"logps/chosen": -133.0,
"logps/rejected": -194.0,
"loss": 0.5248,
"rewards/accuracies": 0.84375,
"rewards/chosen": -0.00946044921875,
"rewards/margins": 0.41796875,
"rewards/rejected": -0.427734375,
"step": 259
},
{
"epoch": 0.9514008004574043,
"grad_norm": 334.01129150390625,
"learning_rate": 9.523809523809523e-08,
"logits/chosen": -0.7109375,
"logits/rejected": -0.68359375,
"logps/chosen": -142.0,
"logps/rejected": -180.0,
"loss": 0.5478,
"rewards/accuracies": 0.8125,
"rewards/chosen": 0.003936767578125,
"rewards/margins": 0.353515625,
"rewards/rejected": -0.349609375,
"step": 260
},
{
"epoch": 0.9550600343053173,
"grad_norm": 384.39617919921875,
"learning_rate": 8.791208791208792e-08,
"logits/chosen": -0.671875,
"logits/rejected": -0.62890625,
"logps/chosen": -160.0,
"logps/rejected": -151.0,
"loss": 0.5869,
"rewards/accuracies": 0.8125,
"rewards/chosen": -0.078125,
"rewards/margins": 0.2392578125,
"rewards/rejected": -0.318359375,
"step": 261
},
{
"epoch": 0.9587192681532304,
"grad_norm": 355.11517333984375,
"learning_rate": 8.058608058608059e-08,
"logits/chosen": -0.7421875,
"logits/rejected": -0.7734375,
"logps/chosen": -159.0,
"logps/rejected": -186.0,
"loss": 0.5905,
"rewards/accuracies": 0.75,
"rewards/chosen": -0.1220703125,
"rewards/margins": 0.2314453125,
"rewards/rejected": -0.353515625,
"step": 262
},
{
"epoch": 0.9623785020011435,
"grad_norm": 361.0973815917969,
"learning_rate": 7.326007326007326e-08,
"logits/chosen": -0.70703125,
"logits/rejected": -0.6875,
"logps/chosen": -151.0,
"logps/rejected": -163.0,
"loss": 0.5654,
"rewards/accuracies": 0.84375,
"rewards/chosen": -0.0859375,
"rewards/margins": 0.30078125,
"rewards/rejected": -0.38671875,
"step": 263
},
{
"epoch": 0.9660377358490566,
"grad_norm": 341.8106994628906,
"learning_rate": 6.593406593406594e-08,
"logits/chosen": -0.6640625,
"logits/rejected": -0.6796875,
"logps/chosen": -155.0,
"logps/rejected": -181.0,
"loss": 0.567,
"rewards/accuracies": 0.84375,
"rewards/chosen": -0.078125,
"rewards/margins": 0.291015625,
"rewards/rejected": -0.369140625,
"step": 264
},
{
"epoch": 0.9696969696969697,
"grad_norm": 306.0340576171875,
"learning_rate": 5.8608058608058605e-08,
"logits/chosen": -0.765625,
"logits/rejected": -0.71484375,
"logps/chosen": -132.0,
"logps/rejected": -165.0,
"loss": 0.5439,
"rewards/accuracies": 0.84375,
"rewards/chosen": -0.052490234375,
"rewards/margins": 0.359375,
"rewards/rejected": -0.41015625,
"step": 265
},
{
"epoch": 0.9733562035448828,
"grad_norm": 353.2430114746094,
"learning_rate": 5.128205128205128e-08,
"logits/chosen": -0.7109375,
"logits/rejected": -0.69140625,
"logps/chosen": -181.0,
"logps/rejected": -171.0,
"loss": 0.6016,
"rewards/accuracies": 0.65625,
"rewards/chosen": -0.033447265625,
"rewards/margins": 0.22265625,
"rewards/rejected": -0.255859375,
"step": 266
},
{
"epoch": 0.9770154373927958,
"grad_norm": 316.0684509277344,
"learning_rate": 4.395604395604396e-08,
"logits/chosen": -0.71484375,
"logits/rejected": -0.71875,
"logps/chosen": -137.0,
"logps/rejected": -163.0,
"loss": 0.551,
"rewards/accuracies": 0.875,
"rewards/chosen": -0.031982421875,
"rewards/margins": 0.330078125,
"rewards/rejected": -0.36328125,
"step": 267
},
{
"epoch": 0.980674671240709,
"grad_norm": 334.58050537109375,
"learning_rate": 3.663003663003663e-08,
"logits/chosen": -0.703125,
"logits/rejected": -0.66015625,
"logps/chosen": -165.0,
"logps/rejected": -170.0,
"loss": 0.6031,
"rewards/accuracies": 0.78125,
"rewards/chosen": -0.1416015625,
"rewards/margins": 0.2060546875,
"rewards/rejected": -0.34765625,
"step": 268
},
{
"epoch": 0.9843339050886221,
"grad_norm": 328.41644287109375,
"learning_rate": 2.9304029304029303e-08,
"logits/chosen": -0.6640625,
"logits/rejected": -0.66796875,
"logps/chosen": -143.0,
"logps/rejected": -156.0,
"loss": 0.579,
"rewards/accuracies": 0.6875,
"rewards/chosen": -0.06787109375,
"rewards/margins": 0.26171875,
"rewards/rejected": -0.330078125,
"step": 269
},
{
"epoch": 0.9879931389365352,
"grad_norm": 307.48974609375,
"learning_rate": 2.197802197802198e-08,
"logits/chosen": -0.65625,
"logits/rejected": -0.68359375,
"logps/chosen": -145.0,
"logps/rejected": -164.0,
"loss": 0.5715,
"rewards/accuracies": 0.8125,
"rewards/chosen": -0.0546875,
"rewards/margins": 0.283203125,
"rewards/rejected": -0.337890625,
"step": 270
},
{
"epoch": 0.9916523727844483,
"grad_norm": 323.255126953125,
"learning_rate": 1.4652014652014651e-08,
"logits/chosen": -0.73828125,
"logits/rejected": -0.69140625,
"logps/chosen": -135.0,
"logps/rejected": -147.0,
"loss": 0.5377,
"rewards/accuracies": 0.90625,
"rewards/chosen": -0.01092529296875,
"rewards/margins": 0.36328125,
"rewards/rejected": -0.375,
"step": 271
},
{
"epoch": 0.9953116066323614,
"grad_norm": 365.11749267578125,
"learning_rate": 7.326007326007326e-09,
"logits/chosen": -0.74609375,
"logits/rejected": -0.734375,
"logps/chosen": -157.0,
"logps/rejected": -194.0,
"loss": 0.5576,
"rewards/accuracies": 0.84375,
"rewards/chosen": -0.07275390625,
"rewards/margins": 0.3203125,
"rewards/rejected": -0.39453125,
"step": 272
},
{
"epoch": 0.9989708404802744,
"grad_norm": 335.74774169921875,
"learning_rate": 0.0,
"logits/chosen": -0.71875,
"logits/rejected": -0.74609375,
"logps/chosen": -155.0,
"logps/rejected": -183.0,
"loss": 0.5493,
"rewards/accuracies": 0.75,
"rewards/chosen": -0.0296630859375,
"rewards/margins": 0.353515625,
"rewards/rejected": -0.3828125,
"step": 273
}
],
"logging_steps": 1,
"max_steps": 273,
"num_input_tokens_seen": 0,
"num_train_epochs": 1,
"save_steps": 500,
"stateful_callbacks": {
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": true,
"should_training_stop": true
},
"attributes": {}
}
},
"total_flos": 0.0,
"train_batch_size": 1,
"trial_name": null,
"trial_params": null
}