Direct-HotpotQA-DPO / trainer_state.json
RAG-Gym's picture
Upload 8 files
3ee3d7f verified
Raw
History Blame Contribute Delete
61.3 kB
{
"best_metric": null,
"best_model_checkpoint": null,
"epoch": 0.9957884885353299,
"eval_steps": 500,
"global_step": 133,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"epoch": 0.007487131492746842,
"grad_norm": 183.32981872558594,
"learning_rate": 1.9849624060150372e-06,
"logits/chosen": 0.32421875,
"logits/rejected": 0.2470703125,
"logps/chosen": -26.875,
"logps/rejected": -25.75,
"loss": 0.6914,
"rewards/accuracies": 0.0,
"rewards/chosen": 0.0,
"rewards/margins": 0.0,
"rewards/rejected": 0.0,
"step": 1
},
{
"epoch": 0.014974262985493684,
"grad_norm": 162.7139129638672,
"learning_rate": 1.969924812030075e-06,
"logits/chosen": 0.2734375,
"logits/rejected": 0.232421875,
"logps/chosen": -27.0,
"logps/rejected": -22.25,
"loss": 0.6931,
"rewards/accuracies": 0.34375,
"rewards/chosen": 0.0007781982421875,
"rewards/margins": -0.00098419189453125,
"rewards/rejected": 0.0017547607421875,
"step": 2
},
{
"epoch": 0.022461394478240523,
"grad_norm": 448.287353515625,
"learning_rate": 1.9548872180451127e-06,
"logits/chosen": 0.26953125,
"logits/rejected": 0.259765625,
"logps/chosen": -29.625,
"logps/rejected": -232.0,
"loss": 0.6897,
"rewards/accuracies": 0.53125,
"rewards/chosen": 0.00078582763671875,
"rewards/margins": 0.010009765625,
"rewards/rejected": -0.00921630859375,
"step": 3
},
{
"epoch": 0.029948525970987367,
"grad_norm": 194.5895538330078,
"learning_rate": 1.9398496240601504e-06,
"logits/chosen": 0.1767578125,
"logits/rejected": 0.267578125,
"logps/chosen": -29.75,
"logps/rejected": -20.375,
"loss": 0.681,
"rewards/accuracies": 0.65625,
"rewards/chosen": 0.01153564453125,
"rewards/margins": 0.02490234375,
"rewards/rejected": -0.0133056640625,
"step": 4
},
{
"epoch": 0.03743565746373421,
"grad_norm": 147.04005432128906,
"learning_rate": 1.9248120300751877e-06,
"logits/chosen": 0.349609375,
"logits/rejected": 0.275390625,
"logps/chosen": -25.375,
"logps/rejected": -25.875,
"loss": 0.6776,
"rewards/accuracies": 0.71875,
"rewards/chosen": 0.0242919921875,
"rewards/margins": 0.0311279296875,
"rewards/rejected": -0.0068359375,
"step": 5
},
{
"epoch": 0.044922788956481045,
"grad_norm": 146.45497131347656,
"learning_rate": 1.9097744360902255e-06,
"logits/chosen": 0.216796875,
"logits/rejected": 0.240234375,
"logps/chosen": -28.875,
"logps/rejected": -24.5,
"loss": 0.6782,
"rewards/accuracies": 0.65625,
"rewards/chosen": 0.0211181640625,
"rewards/margins": 0.0299072265625,
"rewards/rejected": -0.0087890625,
"step": 6
},
{
"epoch": 0.05240992044922789,
"grad_norm": 167.77880859375,
"learning_rate": 1.894736842105263e-06,
"logits/chosen": 0.33203125,
"logits/rejected": 0.275390625,
"logps/chosen": -28.0,
"logps/rejected": -19.875,
"loss": 0.6752,
"rewards/accuracies": 0.625,
"rewards/chosen": 0.03173828125,
"rewards/margins": 0.03662109375,
"rewards/rejected": -0.00506591796875,
"step": 7
},
{
"epoch": 0.059897051941974734,
"grad_norm": 264.6982727050781,
"learning_rate": 1.8796992481203007e-06,
"logits/chosen": 0.21875,
"logits/rejected": 0.18359375,
"logps/chosen": -32.0,
"logps/rejected": -87.5,
"loss": 0.6571,
"rewards/accuracies": 0.84375,
"rewards/chosen": 0.06640625,
"rewards/margins": 0.0771484375,
"rewards/rejected": -0.0103759765625,
"step": 8
},
{
"epoch": 0.06738418343472158,
"grad_norm": 267.3852233886719,
"learning_rate": 1.8646616541353382e-06,
"logits/chosen": 0.205078125,
"logits/rejected": 0.1259765625,
"logps/chosen": -28.125,
"logps/rejected": -118.5,
"loss": 0.6501,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.06982421875,
"rewards/margins": 0.09228515625,
"rewards/rejected": -0.0225830078125,
"step": 9
},
{
"epoch": 0.07487131492746842,
"grad_norm": 167.42930603027344,
"learning_rate": 1.849624060150376e-06,
"logits/chosen": 0.203125,
"logits/rejected": 0.1416015625,
"logps/chosen": -27.875,
"logps/rejected": -210.0,
"loss": 0.6128,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.07275390625,
"rewards/margins": 0.1962890625,
"rewards/rejected": -0.12353515625,
"step": 10
},
{
"epoch": 0.08235844642021525,
"grad_norm": 173.68484497070312,
"learning_rate": 1.8345864661654133e-06,
"logits/chosen": 0.3125,
"logits/rejected": 0.2158203125,
"logps/chosen": -24.625,
"logps/rejected": -199.0,
"loss": 0.6319,
"rewards/accuracies": 0.75,
"rewards/chosen": 0.05712890625,
"rewards/margins": 0.1689453125,
"rewards/rejected": -0.1123046875,
"step": 11
},
{
"epoch": 0.08984557791296209,
"grad_norm": 147.03286743164062,
"learning_rate": 1.819548872180451e-06,
"logits/chosen": 0.29296875,
"logits/rejected": 0.150390625,
"logps/chosen": -26.25,
"logps/rejected": -28.0,
"loss": 0.6515,
"rewards/accuracies": 0.78125,
"rewards/chosen": 0.06787109375,
"rewards/margins": 0.091796875,
"rewards/rejected": -0.0240478515625,
"step": 12
},
{
"epoch": 0.09733270940570894,
"grad_norm": 163.2376251220703,
"learning_rate": 1.8045112781954885e-06,
"logits/chosen": 0.2001953125,
"logits/rejected": 0.2734375,
"logps/chosen": -28.125,
"logps/rejected": -143.0,
"loss": 0.6138,
"rewards/accuracies": 0.78125,
"rewards/chosen": 0.0927734375,
"rewards/margins": 0.208984375,
"rewards/rejected": -0.11669921875,
"step": 13
},
{
"epoch": 0.10481984089845578,
"grad_norm": 149.04415893554688,
"learning_rate": 1.7894736842105262e-06,
"logits/chosen": 0.3125,
"logits/rejected": 0.1279296875,
"logps/chosen": -23.5,
"logps/rejected": -21.875,
"loss": 0.633,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.11181640625,
"rewards/margins": 0.12890625,
"rewards/rejected": -0.017333984375,
"step": 14
},
{
"epoch": 0.11230697239120262,
"grad_norm": 144.06060791015625,
"learning_rate": 1.7744360902255638e-06,
"logits/chosen": 0.2314453125,
"logits/rejected": 0.23828125,
"logps/chosen": -27.0,
"logps/rejected": -21.5,
"loss": 0.616,
"rewards/accuracies": 0.90625,
"rewards/chosen": 0.142578125,
"rewards/margins": 0.1640625,
"rewards/rejected": -0.022216796875,
"step": 15
},
{
"epoch": 0.11979410388394947,
"grad_norm": 138.48106384277344,
"learning_rate": 1.7593984962406015e-06,
"logits/chosen": 0.296875,
"logits/rejected": 0.1923828125,
"logps/chosen": -27.0,
"logps/rejected": -151.0,
"loss": 0.5917,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.111328125,
"rewards/margins": 0.30859375,
"rewards/rejected": -0.197265625,
"step": 16
},
{
"epoch": 0.1272812353766963,
"grad_norm": 125.52348327636719,
"learning_rate": 1.744360902255639e-06,
"logits/chosen": 0.265625,
"logits/rejected": 0.271484375,
"logps/chosen": -26.5,
"logps/rejected": -41.75,
"loss": 0.6047,
"rewards/accuracies": 0.90625,
"rewards/chosen": 0.1328125,
"rewards/margins": 0.2158203125,
"rewards/rejected": -0.08251953125,
"step": 17
},
{
"epoch": 0.13476836686944316,
"grad_norm": 135.62704467773438,
"learning_rate": 1.7293233082706765e-06,
"logits/chosen": 0.2275390625,
"logits/rejected": 0.234375,
"logps/chosen": -25.75,
"logps/rejected": -116.5,
"loss": 0.6024,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.1416015625,
"rewards/margins": 0.25390625,
"rewards/rejected": -0.1123046875,
"step": 18
},
{
"epoch": 0.14225549836218998,
"grad_norm": 135.725830078125,
"learning_rate": 1.714285714285714e-06,
"logits/chosen": 0.265625,
"logits/rejected": 0.2021484375,
"logps/chosen": -24.75,
"logps/rejected": -78.5,
"loss": 0.6002,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.1259765625,
"rewards/margins": 0.263671875,
"rewards/rejected": -0.138671875,
"step": 19
},
{
"epoch": 0.14974262985493683,
"grad_norm": 143.98516845703125,
"learning_rate": 1.6992481203007518e-06,
"logits/chosen": 0.1904296875,
"logits/rejected": 0.14453125,
"logps/chosen": -29.0,
"logps/rejected": -40.25,
"loss": 0.5717,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.193359375,
"rewards/margins": 0.27734375,
"rewards/rejected": -0.08447265625,
"step": 20
},
{
"epoch": 0.15722976134768366,
"grad_norm": 120.902099609375,
"learning_rate": 1.6842105263157893e-06,
"logits/chosen": 0.23046875,
"logits/rejected": 0.2412109375,
"logps/chosen": -25.375,
"logps/rejected": -18.875,
"loss": 0.6137,
"rewards/accuracies": 0.84375,
"rewards/chosen": 0.1708984375,
"rewards/margins": 0.171875,
"rewards/rejected": -0.001556396484375,
"step": 21
},
{
"epoch": 0.1647168928404305,
"grad_norm": 124.2569580078125,
"learning_rate": 1.669172932330827e-06,
"logits/chosen": 0.337890625,
"logits/rejected": 0.171875,
"logps/chosen": -25.25,
"logps/rejected": -22.75,
"loss": 0.6059,
"rewards/accuracies": 0.90625,
"rewards/chosen": 0.1279296875,
"rewards/margins": 0.1943359375,
"rewards/rejected": -0.06591796875,
"step": 22
},
{
"epoch": 0.17220402433317736,
"grad_norm": 129.59535217285156,
"learning_rate": 1.6541353383458646e-06,
"logits/chosen": 0.1884765625,
"logits/rejected": 0.12255859375,
"logps/chosen": -28.375,
"logps/rejected": -26.75,
"loss": 0.5615,
"rewards/accuracies": 0.96875,
"rewards/chosen": 0.2021484375,
"rewards/margins": 0.30078125,
"rewards/rejected": -0.09912109375,
"step": 23
},
{
"epoch": 0.17969115582592418,
"grad_norm": 119.532958984375,
"learning_rate": 1.6390977443609023e-06,
"logits/chosen": 0.283203125,
"logits/rejected": 0.1279296875,
"logps/chosen": -24.25,
"logps/rejected": -37.5,
"loss": 0.5599,
"rewards/accuracies": 0.90625,
"rewards/chosen": 0.1689453125,
"rewards/margins": 0.322265625,
"rewards/rejected": -0.1533203125,
"step": 24
},
{
"epoch": 0.18717828731867103,
"grad_norm": 105.28582763671875,
"learning_rate": 1.6240601503759396e-06,
"logits/chosen": 0.26953125,
"logits/rejected": 0.2451171875,
"logps/chosen": -24.75,
"logps/rejected": -25.375,
"loss": 0.593,
"rewards/accuracies": 0.8125,
"rewards/chosen": 0.1650390625,
"rewards/margins": 0.2431640625,
"rewards/rejected": -0.078125,
"step": 25
},
{
"epoch": 0.19466541881141788,
"grad_norm": 123.53404998779297,
"learning_rate": 1.6090225563909773e-06,
"logits/chosen": 0.275390625,
"logits/rejected": 0.1298828125,
"logps/chosen": -25.5,
"logps/rejected": -160.0,
"loss": 0.5258,
"rewards/accuracies": 0.90625,
"rewards/chosen": 0.2099609375,
"rewards/margins": 0.55078125,
"rewards/rejected": -0.33984375,
"step": 26
},
{
"epoch": 0.2021525503041647,
"grad_norm": 122.69832611083984,
"learning_rate": 1.5939849624060149e-06,
"logits/chosen": 0.162109375,
"logits/rejected": 0.310546875,
"logps/chosen": -28.625,
"logps/rejected": -21.0,
"loss": 0.595,
"rewards/accuracies": 0.96875,
"rewards/chosen": 0.1875,
"rewards/margins": 0.2119140625,
"rewards/rejected": -0.024658203125,
"step": 27
},
{
"epoch": 0.20963968179691156,
"grad_norm": 107.87254333496094,
"learning_rate": 1.5789473684210526e-06,
"logits/chosen": 0.2490234375,
"logits/rejected": 0.11083984375,
"logps/chosen": -25.25,
"logps/rejected": -127.0,
"loss": 0.5614,
"rewards/accuracies": 0.90625,
"rewards/chosen": 0.1826171875,
"rewards/margins": 0.484375,
"rewards/rejected": -0.30078125,
"step": 28
},
{
"epoch": 0.2171268132896584,
"grad_norm": 121.16978454589844,
"learning_rate": 1.56390977443609e-06,
"logits/chosen": 0.2275390625,
"logits/rejected": 0.1474609375,
"logps/chosen": -26.5,
"logps/rejected": -179.0,
"loss": 0.4801,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.251953125,
"rewards/margins": 0.75,
"rewards/rejected": -0.5,
"step": 29
},
{
"epoch": 0.22461394478240523,
"grad_norm": 127.31982421875,
"learning_rate": 1.5488721804511278e-06,
"logits/chosen": 0.275390625,
"logits/rejected": 0.240234375,
"logps/chosen": -27.125,
"logps/rejected": -84.0,
"loss": 0.5083,
"rewards/accuracies": 0.96875,
"rewards/chosen": 0.283203125,
"rewards/margins": 0.578125,
"rewards/rejected": -0.294921875,
"step": 30
},
{
"epoch": 0.23210107627515209,
"grad_norm": 102.35781860351562,
"learning_rate": 1.5338345864661654e-06,
"logits/chosen": 0.255859375,
"logits/rejected": 0.1728515625,
"logps/chosen": -25.875,
"logps/rejected": -33.0,
"loss": 0.5519,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.2373046875,
"rewards/margins": 0.35546875,
"rewards/rejected": -0.11767578125,
"step": 31
},
{
"epoch": 0.23958820776789894,
"grad_norm": 122.3163070678711,
"learning_rate": 1.5187969924812029e-06,
"logits/chosen": 0.166015625,
"logits/rejected": 0.1787109375,
"logps/chosen": -29.125,
"logps/rejected": -121.5,
"loss": 0.4974,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.26171875,
"rewards/margins": 0.6328125,
"rewards/rejected": -0.373046875,
"step": 32
},
{
"epoch": 0.24707533926064576,
"grad_norm": 114.36420440673828,
"learning_rate": 1.5037593984962404e-06,
"logits/chosen": 0.2734375,
"logits/rejected": 0.263671875,
"logps/chosen": -24.5,
"logps/rejected": -26.25,
"loss": 0.5807,
"rewards/accuracies": 0.75,
"rewards/chosen": 0.173828125,
"rewards/margins": 0.26171875,
"rewards/rejected": -0.08837890625,
"step": 33
},
{
"epoch": 0.2545624707533926,
"grad_norm": 103.6934585571289,
"learning_rate": 1.4887218045112781e-06,
"logits/chosen": 0.1328125,
"logits/rejected": 0.051513671875,
"logps/chosen": -27.75,
"logps/rejected": -101.5,
"loss": 0.4898,
"rewards/accuracies": 0.96875,
"rewards/chosen": 0.2412109375,
"rewards/margins": 0.65625,
"rewards/rejected": -0.416015625,
"step": 34
},
{
"epoch": 0.26204960224613943,
"grad_norm": 95.02819061279297,
"learning_rate": 1.4736842105263156e-06,
"logits/chosen": 0.1884765625,
"logits/rejected": 0.11181640625,
"logps/chosen": -27.625,
"logps/rejected": -29.375,
"loss": 0.5312,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.232421875,
"rewards/margins": 0.41015625,
"rewards/rejected": -0.177734375,
"step": 35
},
{
"epoch": 0.2695367337388863,
"grad_norm": 94.60529327392578,
"learning_rate": 1.4586466165413534e-06,
"logits/chosen": 0.2373046875,
"logits/rejected": 0.1474609375,
"logps/chosen": -24.875,
"logps/rejected": -38.75,
"loss": 0.5326,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.263671875,
"rewards/margins": 0.439453125,
"rewards/rejected": -0.17578125,
"step": 36
},
{
"epoch": 0.27702386523163314,
"grad_norm": 97.94026947021484,
"learning_rate": 1.443609022556391e-06,
"logits/chosen": 0.21484375,
"logits/rejected": 0.197265625,
"logps/chosen": -27.0,
"logps/rejected": -90.0,
"loss": 0.5326,
"rewards/accuracies": 0.90625,
"rewards/chosen": 0.267578125,
"rewards/margins": 0.52734375,
"rewards/rejected": -0.26171875,
"step": 37
},
{
"epoch": 0.28451099672437996,
"grad_norm": 84.70133209228516,
"learning_rate": 1.4285714285714286e-06,
"logits/chosen": 0.2109375,
"logits/rejected": 0.23046875,
"logps/chosen": -25.625,
"logps/rejected": -39.5,
"loss": 0.5299,
"rewards/accuracies": 0.84375,
"rewards/chosen": 0.26171875,
"rewards/margins": 0.47265625,
"rewards/rejected": -0.2109375,
"step": 38
},
{
"epoch": 0.29199812821712684,
"grad_norm": 108.93930053710938,
"learning_rate": 1.413533834586466e-06,
"logits/chosen": 0.1904296875,
"logits/rejected": 0.0947265625,
"logps/chosen": -27.375,
"logps/rejected": -27.625,
"loss": 0.5089,
"rewards/accuracies": 0.84375,
"rewards/chosen": 0.3203125,
"rewards/margins": 0.474609375,
"rewards/rejected": -0.154296875,
"step": 39
},
{
"epoch": 0.29948525970987366,
"grad_norm": 95.77433013916016,
"learning_rate": 1.3984962406015037e-06,
"logits/chosen": 0.23828125,
"logits/rejected": 0.267578125,
"logps/chosen": -27.875,
"logps/rejected": -20.75,
"loss": 0.5214,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.29296875,
"rewards/margins": 0.404296875,
"rewards/rejected": -0.11181640625,
"step": 40
},
{
"epoch": 0.3069723912026205,
"grad_norm": 93.18071746826172,
"learning_rate": 1.3834586466165412e-06,
"logits/chosen": 0.2490234375,
"logits/rejected": 0.205078125,
"logps/chosen": -24.0,
"logps/rejected": -28.25,
"loss": 0.5503,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.2060546875,
"rewards/margins": 0.380859375,
"rewards/rejected": -0.173828125,
"step": 41
},
{
"epoch": 0.3144595226953673,
"grad_norm": 109.81500244140625,
"learning_rate": 1.368421052631579e-06,
"logits/chosen": 0.185546875,
"logits/rejected": 0.240234375,
"logps/chosen": -26.5,
"logps/rejected": -34.25,
"loss": 0.495,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.33984375,
"rewards/margins": 0.55859375,
"rewards/rejected": -0.2177734375,
"step": 42
},
{
"epoch": 0.3219466541881142,
"grad_norm": 101.38113403320312,
"learning_rate": 1.3533834586466164e-06,
"logits/chosen": 0.28125,
"logits/rejected": 0.10693359375,
"logps/chosen": -24.0,
"logps/rejected": -116.5,
"loss": 0.4809,
"rewards/accuracies": 0.84375,
"rewards/chosen": 0.25390625,
"rewards/margins": 0.7421875,
"rewards/rejected": -0.490234375,
"step": 43
},
{
"epoch": 0.329433785680861,
"grad_norm": 81.20439147949219,
"learning_rate": 1.3383458646616542e-06,
"logits/chosen": 0.279296875,
"logits/rejected": 0.283203125,
"logps/chosen": -24.625,
"logps/rejected": -19.75,
"loss": 0.5115,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.328125,
"rewards/margins": 0.451171875,
"rewards/rejected": -0.12353515625,
"step": 44
},
{
"epoch": 0.33692091717360784,
"grad_norm": 72.38237762451172,
"learning_rate": 1.3233082706766917e-06,
"logits/chosen": 0.1865234375,
"logits/rejected": 0.146484375,
"logps/chosen": -26.0,
"logps/rejected": -86.0,
"loss": 0.4921,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.263671875,
"rewards/margins": 0.765625,
"rewards/rejected": -0.5,
"step": 45
},
{
"epoch": 0.3444080486663547,
"grad_norm": 75.40729522705078,
"learning_rate": 1.3082706766917292e-06,
"logits/chosen": 0.1962890625,
"logits/rejected": 0.12158203125,
"logps/chosen": -26.125,
"logps/rejected": -141.0,
"loss": 0.4922,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.259765625,
"rewards/margins": 0.80078125,
"rewards/rejected": -0.54296875,
"step": 46
},
{
"epoch": 0.35189518015910154,
"grad_norm": 80.21080017089844,
"learning_rate": 1.2932330827067667e-06,
"logits/chosen": 0.251953125,
"logits/rejected": 0.1669921875,
"logps/chosen": -25.0,
"logps/rejected": -57.5,
"loss": 0.5186,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.2294921875,
"rewards/margins": 0.51953125,
"rewards/rejected": -0.291015625,
"step": 47
},
{
"epoch": 0.35938231165184836,
"grad_norm": 76.38800048828125,
"learning_rate": 1.2781954887218045e-06,
"logits/chosen": 0.3203125,
"logits/rejected": 0.19921875,
"logps/chosen": -22.25,
"logps/rejected": -116.5,
"loss": 0.5045,
"rewards/accuracies": 0.96875,
"rewards/chosen": 0.228515625,
"rewards/margins": 0.6796875,
"rewards/rejected": -0.451171875,
"step": 48
},
{
"epoch": 0.36686944314459524,
"grad_norm": 84.38673400878906,
"learning_rate": 1.263157894736842e-06,
"logits/chosen": 0.2197265625,
"logits/rejected": 0.125,
"logps/chosen": -22.375,
"logps/rejected": -91.5,
"loss": 0.4797,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.234375,
"rewards/margins": 0.7265625,
"rewards/rejected": -0.4921875,
"step": 49
},
{
"epoch": 0.37435657463734207,
"grad_norm": 79.1534423828125,
"learning_rate": 1.2481203007518797e-06,
"logits/chosen": 0.205078125,
"logits/rejected": 0.21484375,
"logps/chosen": -25.125,
"logps/rejected": -128.0,
"loss": 0.4809,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.326171875,
"rewards/margins": 0.79296875,
"rewards/rejected": -0.466796875,
"step": 50
},
{
"epoch": 0.3818437061300889,
"grad_norm": 95.26607513427734,
"learning_rate": 1.2330827067669172e-06,
"logits/chosen": 0.244140625,
"logits/rejected": 0.06494140625,
"logps/chosen": -24.0,
"logps/rejected": -169.0,
"loss": 0.414,
"rewards/accuracies": 0.96875,
"rewards/chosen": 0.3515625,
"rewards/margins": 1.2109375,
"rewards/rejected": -0.86328125,
"step": 51
},
{
"epoch": 0.38933083762283577,
"grad_norm": 79.70458221435547,
"learning_rate": 1.218045112781955e-06,
"logits/chosen": 0.185546875,
"logits/rejected": 0.050048828125,
"logps/chosen": -25.875,
"logps/rejected": -27.75,
"loss": 0.4711,
"rewards/accuracies": 0.96875,
"rewards/chosen": 0.29296875,
"rewards/margins": 0.62109375,
"rewards/rejected": -0.328125,
"step": 52
},
{
"epoch": 0.3968179691155826,
"grad_norm": 78.77261352539062,
"learning_rate": 1.2030075187969923e-06,
"logits/chosen": 0.263671875,
"logits/rejected": 0.099609375,
"logps/chosen": -24.25,
"logps/rejected": -32.5,
"loss": 0.4703,
"rewards/accuracies": 0.90625,
"rewards/chosen": 0.2734375,
"rewards/margins": 0.61328125,
"rewards/rejected": -0.33984375,
"step": 53
},
{
"epoch": 0.4043051006083294,
"grad_norm": 64.24870300292969,
"learning_rate": 1.18796992481203e-06,
"logits/chosen": 0.26953125,
"logits/rejected": 0.2099609375,
"logps/chosen": -23.375,
"logps/rejected": -24.5,
"loss": 0.5525,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.1689453125,
"rewards/margins": 0.37109375,
"rewards/rejected": -0.203125,
"step": 54
},
{
"epoch": 0.4117922321010763,
"grad_norm": 71.2979965209961,
"learning_rate": 1.1729323308270675e-06,
"logits/chosen": 0.287109375,
"logits/rejected": 0.3125,
"logps/chosen": -25.625,
"logps/rejected": -22.0,
"loss": 0.498,
"rewards/accuracies": 0.96875,
"rewards/chosen": 0.279296875,
"rewards/margins": 0.486328125,
"rewards/rejected": -0.2080078125,
"step": 55
},
{
"epoch": 0.4192793635938231,
"grad_norm": 78.7899169921875,
"learning_rate": 1.1578947368421053e-06,
"logits/chosen": 0.255859375,
"logits/rejected": 0.232421875,
"logps/chosen": -24.125,
"logps/rejected": -98.0,
"loss": 0.5037,
"rewards/accuracies": 0.84375,
"rewards/chosen": 0.232421875,
"rewards/margins": 0.671875,
"rewards/rejected": -0.4375,
"step": 56
},
{
"epoch": 0.42676649508656994,
"grad_norm": 74.6025619506836,
"learning_rate": 1.1428571428571428e-06,
"logits/chosen": 0.23828125,
"logits/rejected": 0.224609375,
"logps/chosen": -24.25,
"logps/rejected": -24.625,
"loss": 0.4781,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.2890625,
"rewards/margins": 0.56640625,
"rewards/rejected": -0.279296875,
"step": 57
},
{
"epoch": 0.4342536265793168,
"grad_norm": 77.2677993774414,
"learning_rate": 1.1278195488721805e-06,
"logits/chosen": 0.205078125,
"logits/rejected": 0.1640625,
"logps/chosen": -24.75,
"logps/rejected": -29.25,
"loss": 0.4841,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.349609375,
"rewards/margins": 0.62109375,
"rewards/rejected": -0.271484375,
"step": 58
},
{
"epoch": 0.44174075807206364,
"grad_norm": 72.21055603027344,
"learning_rate": 1.112781954887218e-06,
"logits/chosen": 0.212890625,
"logits/rejected": 0.126953125,
"logps/chosen": -28.875,
"logps/rejected": -26.5,
"loss": 0.433,
"rewards/accuracies": 0.90625,
"rewards/chosen": 0.373046875,
"rewards/margins": 0.71875,
"rewards/rejected": -0.34375,
"step": 59
},
{
"epoch": 0.44922788956481047,
"grad_norm": 59.05992889404297,
"learning_rate": 1.0977443609022555e-06,
"logits/chosen": 0.28515625,
"logits/rejected": 0.2236328125,
"logps/chosen": -23.75,
"logps/rejected": -234.0,
"loss": 0.4477,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.19921875,
"rewards/margins": 1.296875,
"rewards/rejected": -1.1015625,
"step": 60
},
{
"epoch": 0.45671502105755735,
"grad_norm": 71.27205657958984,
"learning_rate": 1.082706766917293e-06,
"logits/chosen": 0.1806640625,
"logits/rejected": 0.228515625,
"logps/chosen": -23.375,
"logps/rejected": -20.625,
"loss": 0.5128,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.23828125,
"rewards/margins": 0.44921875,
"rewards/rejected": -0.2109375,
"step": 61
},
{
"epoch": 0.46420215255030417,
"grad_norm": 66.39558410644531,
"learning_rate": 1.0676691729323308e-06,
"logits/chosen": 0.294921875,
"logits/rejected": 0.29296875,
"logps/chosen": -24.125,
"logps/rejected": -60.5,
"loss": 0.4676,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.28125,
"rewards/margins": 0.73046875,
"rewards/rejected": -0.44921875,
"step": 62
},
{
"epoch": 0.471689284043051,
"grad_norm": 74.42204284667969,
"learning_rate": 1.0526315789473683e-06,
"logits/chosen": 0.30078125,
"logits/rejected": 0.22265625,
"logps/chosen": -24.875,
"logps/rejected": -37.5,
"loss": 0.4886,
"rewards/accuracies": 0.8125,
"rewards/chosen": 0.259765625,
"rewards/margins": 0.59375,
"rewards/rejected": -0.333984375,
"step": 63
},
{
"epoch": 0.4791764155357979,
"grad_norm": 60.48930358886719,
"learning_rate": 1.037593984962406e-06,
"logits/chosen": 0.2490234375,
"logits/rejected": 0.298828125,
"logps/chosen": -27.125,
"logps/rejected": -183.0,
"loss": 0.4197,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.462890625,
"rewards/margins": 1.3046875,
"rewards/rejected": -0.84375,
"step": 64
},
{
"epoch": 0.4866635470285447,
"grad_norm": 68.27130126953125,
"learning_rate": 1.0225563909774436e-06,
"logits/chosen": 0.2138671875,
"logits/rejected": 0.25390625,
"logps/chosen": -28.125,
"logps/rejected": -38.5,
"loss": 0.4482,
"rewards/accuracies": 0.96875,
"rewards/chosen": 0.373046875,
"rewards/margins": 0.7734375,
"rewards/rejected": -0.400390625,
"step": 65
},
{
"epoch": 0.4941506785212915,
"grad_norm": 61.67387771606445,
"learning_rate": 1.0075187969924813e-06,
"logits/chosen": 0.244140625,
"logits/rejected": 0.1494140625,
"logps/chosen": -25.875,
"logps/rejected": -146.0,
"loss": 0.4096,
"rewards/accuracies": 0.96875,
"rewards/chosen": 0.375,
"rewards/margins": 1.3125,
"rewards/rejected": -0.9375,
"step": 66
},
{
"epoch": 0.5016378100140384,
"grad_norm": 76.5013656616211,
"learning_rate": 9.924812030075186e-07,
"logits/chosen": 0.275390625,
"logits/rejected": 0.212890625,
"logps/chosen": -23.5,
"logps/rejected": -41.25,
"loss": 0.4666,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.22265625,
"rewards/margins": 0.66015625,
"rewards/rejected": -0.4375,
"step": 67
},
{
"epoch": 0.5091249415067852,
"grad_norm": 50.46118927001953,
"learning_rate": 9.774436090225563e-07,
"logits/chosen": 0.306640625,
"logits/rejected": 0.15234375,
"logps/chosen": -25.5,
"logps/rejected": -205.0,
"loss": 0.4047,
"rewards/accuracies": 0.96875,
"rewards/chosen": 0.32421875,
"rewards/margins": 1.609375,
"rewards/rejected": -1.2890625,
"step": 68
},
{
"epoch": 0.516612072999532,
"grad_norm": 63.7412223815918,
"learning_rate": 9.624060150375939e-07,
"logits/chosen": 0.162109375,
"logits/rejected": 0.216796875,
"logps/chosen": -27.625,
"logps/rejected": -30.0,
"loss": 0.4645,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.306640625,
"rewards/margins": 0.70703125,
"rewards/rejected": -0.40234375,
"step": 69
},
{
"epoch": 0.5240992044922789,
"grad_norm": 52.42015838623047,
"learning_rate": 9.473684210526315e-07,
"logits/chosen": 0.2265625,
"logits/rejected": 0.11865234375,
"logps/chosen": -25.875,
"logps/rejected": -117.5,
"loss": 0.4393,
"rewards/accuracies": 0.84375,
"rewards/chosen": 0.2734375,
"rewards/margins": 1.078125,
"rewards/rejected": -0.80859375,
"step": 70
},
{
"epoch": 0.5315863359850257,
"grad_norm": 79.23849487304688,
"learning_rate": 9.323308270676691e-07,
"logits/chosen": 0.275390625,
"logits/rejected": 0.1923828125,
"logps/chosen": -24.75,
"logps/rejected": -160.0,
"loss": 0.4218,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.353515625,
"rewards/margins": 1.4765625,
"rewards/rejected": -1.125,
"step": 71
},
{
"epoch": 0.5390734674777726,
"grad_norm": 55.779964447021484,
"learning_rate": 9.172932330827066e-07,
"logits/chosen": 0.318359375,
"logits/rejected": 0.185546875,
"logps/chosen": -24.375,
"logps/rejected": -33.75,
"loss": 0.43,
"rewards/accuracies": 0.96875,
"rewards/chosen": 0.2177734375,
"rewards/margins": 0.84765625,
"rewards/rejected": -0.62890625,
"step": 72
},
{
"epoch": 0.5465605989705195,
"grad_norm": 60.20227813720703,
"learning_rate": 9.022556390977443e-07,
"logits/chosen": 0.2080078125,
"logits/rejected": 0.1767578125,
"logps/chosen": -26.375,
"logps/rejected": -139.0,
"loss": 0.3933,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.3828125,
"rewards/margins": 1.2578125,
"rewards/rejected": -0.875,
"step": 73
},
{
"epoch": 0.5540477304632663,
"grad_norm": 51.512977600097656,
"learning_rate": 8.872180451127819e-07,
"logits/chosen": 0.23046875,
"logits/rejected": 0.09423828125,
"logps/chosen": -25.5,
"logps/rejected": -75.5,
"loss": 0.3989,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.263671875,
"rewards/margins": 1.0859375,
"rewards/rejected": -0.82421875,
"step": 74
},
{
"epoch": 0.5615348619560131,
"grad_norm": 67.2686538696289,
"learning_rate": 8.721804511278195e-07,
"logits/chosen": 0.3125,
"logits/rejected": 0.2041015625,
"logps/chosen": -24.125,
"logps/rejected": -256.0,
"loss": 0.4315,
"rewards/accuracies": 0.90625,
"rewards/chosen": 0.21484375,
"rewards/margins": 1.546875,
"rewards/rejected": -1.3359375,
"step": 75
},
{
"epoch": 0.5690219934487599,
"grad_norm": 70.67787170410156,
"learning_rate": 8.57142857142857e-07,
"logits/chosen": 0.216796875,
"logits/rejected": 0.1513671875,
"logps/chosen": -25.0,
"logps/rejected": -109.0,
"loss": 0.3992,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.26953125,
"rewards/margins": 1.265625,
"rewards/rejected": -1.0,
"step": 76
},
{
"epoch": 0.5765091249415067,
"grad_norm": 51.3372917175293,
"learning_rate": 8.421052631578947e-07,
"logits/chosen": 0.185546875,
"logits/rejected": 0.2353515625,
"logps/chosen": -25.25,
"logps/rejected": -178.0,
"loss": 0.4455,
"rewards/accuracies": 0.96875,
"rewards/chosen": 0.21484375,
"rewards/margins": 1.2890625,
"rewards/rejected": -1.0703125,
"step": 77
},
{
"epoch": 0.5839962564342537,
"grad_norm": 49.59202194213867,
"learning_rate": 8.270676691729323e-07,
"logits/chosen": 0.298828125,
"logits/rejected": 0.265625,
"logps/chosen": -26.0,
"logps/rejected": -32.25,
"loss": 0.4116,
"rewards/accuracies": 0.96875,
"rewards/chosen": 0.37109375,
"rewards/margins": 0.87890625,
"rewards/rejected": -0.5078125,
"step": 78
},
{
"epoch": 0.5914833879270005,
"grad_norm": 52.285152435302734,
"learning_rate": 8.120300751879698e-07,
"logits/chosen": 0.2431640625,
"logits/rejected": 0.271484375,
"logps/chosen": -25.75,
"logps/rejected": -86.5,
"loss": 0.4358,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.314453125,
"rewards/margins": 1.015625,
"rewards/rejected": -0.69921875,
"step": 79
},
{
"epoch": 0.5989705194197473,
"grad_norm": 52.016822814941406,
"learning_rate": 7.969924812030074e-07,
"logits/chosen": 0.25390625,
"logits/rejected": 0.1826171875,
"logps/chosen": -24.875,
"logps/rejected": -54.0,
"loss": 0.4305,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.25390625,
"rewards/margins": 1.0,
"rewards/rejected": -0.7421875,
"step": 80
},
{
"epoch": 0.6064576509124942,
"grad_norm": 50.19512176513672,
"learning_rate": 7.81954887218045e-07,
"logits/chosen": 0.27734375,
"logits/rejected": 0.15625,
"logps/chosen": -23.5,
"logps/rejected": -95.0,
"loss": 0.4684,
"rewards/accuracies": 0.90625,
"rewards/chosen": 0.158203125,
"rewards/margins": 0.87890625,
"rewards/rejected": -0.71875,
"step": 81
},
{
"epoch": 0.613944782405241,
"grad_norm": 85.73662567138672,
"learning_rate": 7.669172932330827e-07,
"logits/chosen": 0.1982421875,
"logits/rejected": 0.2265625,
"logps/chosen": -26.75,
"logps/rejected": -27.25,
"loss": 0.4545,
"rewards/accuracies": 0.90625,
"rewards/chosen": 0.361328125,
"rewards/margins": 0.7265625,
"rewards/rejected": -0.365234375,
"step": 82
},
{
"epoch": 0.6214319138979878,
"grad_norm": 61.057830810546875,
"learning_rate": 7.518796992481202e-07,
"logits/chosen": 0.19140625,
"logits/rejected": 0.1318359375,
"logps/chosen": -27.375,
"logps/rejected": -32.5,
"loss": 0.4299,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.2119140625,
"rewards/margins": 0.7578125,
"rewards/rejected": -0.54296875,
"step": 83
},
{
"epoch": 0.6289190453907346,
"grad_norm": 53.54865264892578,
"learning_rate": 7.368421052631578e-07,
"logits/chosen": 0.25390625,
"logits/rejected": 0.10595703125,
"logps/chosen": -25.0,
"logps/rejected": -86.5,
"loss": 0.3744,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.322265625,
"rewards/margins": 1.421875,
"rewards/rejected": -1.1015625,
"step": 84
},
{
"epoch": 0.6364061768834816,
"grad_norm": 48.02566146850586,
"learning_rate": 7.218045112781954e-07,
"logits/chosen": 0.310546875,
"logits/rejected": 0.193359375,
"logps/chosen": -23.75,
"logps/rejected": -114.5,
"loss": 0.4171,
"rewards/accuracies": 0.90625,
"rewards/chosen": 0.265625,
"rewards/margins": 1.171875,
"rewards/rejected": -0.91015625,
"step": 85
},
{
"epoch": 0.6438933083762284,
"grad_norm": 42.602638244628906,
"learning_rate": 7.06766917293233e-07,
"logits/chosen": 0.333984375,
"logits/rejected": 0.1318359375,
"logps/chosen": -24.25,
"logps/rejected": -45.0,
"loss": 0.3654,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.322265625,
"rewards/margins": 1.1796875,
"rewards/rejected": -0.859375,
"step": 86
},
{
"epoch": 0.6513804398689752,
"grad_norm": 50.09026336669922,
"learning_rate": 6.917293233082706e-07,
"logits/chosen": 0.265625,
"logits/rejected": 0.1953125,
"logps/chosen": -24.5,
"logps/rejected": -31.625,
"loss": 0.4452,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.1962890625,
"rewards/margins": 0.80859375,
"rewards/rejected": -0.61328125,
"step": 87
},
{
"epoch": 0.658867571361722,
"grad_norm": 46.998741149902344,
"learning_rate": 6.766917293233082e-07,
"logits/chosen": 0.330078125,
"logits/rejected": 0.2158203125,
"logps/chosen": -23.375,
"logps/rejected": -27.625,
"loss": 0.4262,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.302734375,
"rewards/margins": 0.765625,
"rewards/rejected": -0.46484375,
"step": 88
},
{
"epoch": 0.6663547028544688,
"grad_norm": 69.94436645507812,
"learning_rate": 6.616541353383458e-07,
"logits/chosen": 0.1884765625,
"logits/rejected": 0.064453125,
"logps/chosen": -25.75,
"logps/rejected": -53.5,
"loss": 0.4273,
"rewards/accuracies": 0.96875,
"rewards/chosen": 0.234375,
"rewards/margins": 1.03125,
"rewards/rejected": -0.796875,
"step": 89
},
{
"epoch": 0.6738418343472157,
"grad_norm": 51.591617584228516,
"learning_rate": 6.466165413533834e-07,
"logits/chosen": 0.234375,
"logits/rejected": 0.169921875,
"logps/chosen": -25.375,
"logps/rejected": -26.0,
"loss": 0.4324,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.216796875,
"rewards/margins": 0.69921875,
"rewards/rejected": -0.482421875,
"step": 90
},
{
"epoch": 0.6813289658399626,
"grad_norm": 43.72792434692383,
"learning_rate": 6.31578947368421e-07,
"logits/chosen": 0.32421875,
"logits/rejected": 0.27734375,
"logps/chosen": -26.0,
"logps/rejected": -120.5,
"loss": 0.4289,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.306640625,
"rewards/margins": 1.109375,
"rewards/rejected": -0.80078125,
"step": 91
},
{
"epoch": 0.6888160973327094,
"grad_norm": 48.30878448486328,
"learning_rate": 6.165413533834586e-07,
"logits/chosen": 0.3203125,
"logits/rejected": 0.287109375,
"logps/chosen": -22.5,
"logps/rejected": -25.375,
"loss": 0.4916,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.095703125,
"rewards/margins": 0.58984375,
"rewards/rejected": -0.494140625,
"step": 92
},
{
"epoch": 0.6963032288254563,
"grad_norm": 46.46865463256836,
"learning_rate": 6.015037593984961e-07,
"logits/chosen": 0.30078125,
"logits/rejected": 0.1279296875,
"logps/chosen": -24.5,
"logps/rejected": -225.0,
"loss": 0.3761,
"rewards/accuracies": 0.96875,
"rewards/chosen": 0.2001953125,
"rewards/margins": 1.796875,
"rewards/rejected": -1.6015625,
"step": 93
},
{
"epoch": 0.7037903603182031,
"grad_norm": 36.16524887084961,
"learning_rate": 5.864661654135338e-07,
"logits/chosen": 0.36328125,
"logits/rejected": 0.248046875,
"logps/chosen": -22.75,
"logps/rejected": -436.0,
"loss": 0.3547,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.2265625,
"rewards/margins": 2.625,
"rewards/rejected": -2.390625,
"step": 94
},
{
"epoch": 0.7112774918109499,
"grad_norm": 82.83430480957031,
"learning_rate": 5.714285714285714e-07,
"logits/chosen": 0.1513671875,
"logits/rejected": 0.251953125,
"logps/chosen": -28.0,
"logps/rejected": -24.625,
"loss": 0.5123,
"rewards/accuracies": 0.84375,
"rewards/chosen": 0.1484375,
"rewards/margins": 0.5390625,
"rewards/rejected": -0.390625,
"step": 95
},
{
"epoch": 0.7187646233036967,
"grad_norm": 38.68367385864258,
"learning_rate": 5.56390977443609e-07,
"logits/chosen": 0.248046875,
"logits/rejected": 0.1533203125,
"logps/chosen": -25.625,
"logps/rejected": -140.0,
"loss": 0.4303,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.1787109375,
"rewards/margins": 1.265625,
"rewards/rejected": -1.0859375,
"step": 96
},
{
"epoch": 0.7262517547964437,
"grad_norm": 53.11600875854492,
"learning_rate": 5.413533834586465e-07,
"logits/chosen": 0.26953125,
"logits/rejected": 0.27734375,
"logps/chosen": -23.75,
"logps/rejected": -27.75,
"loss": 0.5037,
"rewards/accuracies": 0.84375,
"rewards/chosen": 0.13671875,
"rewards/margins": 0.59375,
"rewards/rejected": -0.458984375,
"step": 97
},
{
"epoch": 0.7337388862891905,
"grad_norm": 49.679344177246094,
"learning_rate": 5.263157894736842e-07,
"logits/chosen": 0.30859375,
"logits/rejected": 0.2060546875,
"logps/chosen": -23.625,
"logps/rejected": -144.0,
"loss": 0.4902,
"rewards/accuracies": 0.84375,
"rewards/chosen": 0.07080078125,
"rewards/margins": 1.171875,
"rewards/rejected": -1.09375,
"step": 98
},
{
"epoch": 0.7412260177819373,
"grad_norm": 72.93644714355469,
"learning_rate": 5.112781954887218e-07,
"logits/chosen": 0.2421875,
"logits/rejected": 0.2138671875,
"logps/chosen": -25.75,
"logps/rejected": -23.5,
"loss": 0.4311,
"rewards/accuracies": 0.96875,
"rewards/chosen": 0.337890625,
"rewards/margins": 0.703125,
"rewards/rejected": -0.36328125,
"step": 99
},
{
"epoch": 0.7487131492746841,
"grad_norm": 40.050777435302734,
"learning_rate": 4.962406015037593e-07,
"logits/chosen": 0.2578125,
"logits/rejected": 0.1982421875,
"logps/chosen": -26.0,
"logps/rejected": -44.0,
"loss": 0.4212,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.345703125,
"rewards/margins": 0.98828125,
"rewards/rejected": -0.640625,
"step": 100
},
{
"epoch": 0.756200280767431,
"grad_norm": 45.1883544921875,
"learning_rate": 4.812030075187969e-07,
"logits/chosen": 0.26171875,
"logits/rejected": 0.310546875,
"logps/chosen": -26.5,
"logps/rejected": -22.375,
"loss": 0.4283,
"rewards/accuracies": 0.90625,
"rewards/chosen": 0.3515625,
"rewards/margins": 0.71875,
"rewards/rejected": -0.3671875,
"step": 101
},
{
"epoch": 0.7636874122601778,
"grad_norm": 40.10118103027344,
"learning_rate": 4.6616541353383456e-07,
"logits/chosen": 0.28125,
"logits/rejected": 0.208984375,
"logps/chosen": -26.375,
"logps/rejected": -219.0,
"loss": 0.3421,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.310546875,
"rewards/margins": 2.078125,
"rewards/rejected": -1.765625,
"step": 102
},
{
"epoch": 0.7711745437529247,
"grad_norm": 107.4455795288086,
"learning_rate": 4.5112781954887213e-07,
"logits/chosen": 0.1884765625,
"logits/rejected": 0.15625,
"logps/chosen": -24.75,
"logps/rejected": -182.0,
"loss": 0.4027,
"rewards/accuracies": 0.90625,
"rewards/chosen": 0.2236328125,
"rewards/margins": 1.53125,
"rewards/rejected": -1.3125,
"step": 103
},
{
"epoch": 0.7786616752456715,
"grad_norm": 51.714324951171875,
"learning_rate": 4.3609022556390975e-07,
"logits/chosen": 0.251953125,
"logits/rejected": 0.1318359375,
"logps/chosen": -24.625,
"logps/rejected": -38.0,
"loss": 0.391,
"rewards/accuracies": 0.96875,
"rewards/chosen": 0.25390625,
"rewards/margins": 1.0390625,
"rewards/rejected": -0.78515625,
"step": 104
},
{
"epoch": 0.7861488067384184,
"grad_norm": 54.54036331176758,
"learning_rate": 4.2105263157894733e-07,
"logits/chosen": 0.1640625,
"logits/rejected": 0.037109375,
"logps/chosen": -26.25,
"logps/rejected": -56.0,
"loss": 0.3871,
"rewards/accuracies": 0.90625,
"rewards/chosen": 0.2158203125,
"rewards/margins": 1.34375,
"rewards/rejected": -1.1328125,
"step": 105
},
{
"epoch": 0.7936359382311652,
"grad_norm": 47.15876007080078,
"learning_rate": 4.060150375939849e-07,
"logits/chosen": 0.2392578125,
"logits/rejected": 0.1875,
"logps/chosen": -26.625,
"logps/rejected": -32.25,
"loss": 0.3612,
"rewards/accuracies": 0.96875,
"rewards/chosen": 0.43359375,
"rewards/margins": 1.078125,
"rewards/rejected": -0.64453125,
"step": 106
},
{
"epoch": 0.801123069723912,
"grad_norm": 54.331844329833984,
"learning_rate": 3.909774436090225e-07,
"logits/chosen": 0.3046875,
"logits/rejected": 0.158203125,
"logps/chosen": -24.875,
"logps/rejected": -37.5,
"loss": 0.3862,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.318359375,
"rewards/margins": 1.078125,
"rewards/rejected": -0.76171875,
"step": 107
},
{
"epoch": 0.8086102012166588,
"grad_norm": 39.809444427490234,
"learning_rate": 3.759398496240601e-07,
"logits/chosen": 0.2197265625,
"logits/rejected": 0.16796875,
"logps/chosen": -27.125,
"logps/rejected": -103.5,
"loss": 0.4545,
"rewards/accuracies": 0.84375,
"rewards/chosen": 0.1484375,
"rewards/margins": 1.2734375,
"rewards/rejected": -1.125,
"step": 108
},
{
"epoch": 0.8160973327094057,
"grad_norm": 49.4395751953125,
"learning_rate": 3.609022556390977e-07,
"logits/chosen": 0.2060546875,
"logits/rejected": 0.162109375,
"logps/chosen": -26.125,
"logps/rejected": -39.0,
"loss": 0.3786,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.416015625,
"rewards/margins": 1.15625,
"rewards/rejected": -0.73828125,
"step": 109
},
{
"epoch": 0.8235844642021526,
"grad_norm": 68.54365539550781,
"learning_rate": 3.458646616541353e-07,
"logits/chosen": 0.166015625,
"logits/rejected": 0.1005859375,
"logps/chosen": -26.125,
"logps/rejected": -30.0,
"loss": 0.3824,
"rewards/accuracies": 0.96875,
"rewards/chosen": 0.287109375,
"rewards/margins": 0.96484375,
"rewards/rejected": -0.6796875,
"step": 110
},
{
"epoch": 0.8310715956948994,
"grad_norm": 57.101627349853516,
"learning_rate": 3.308270676691729e-07,
"logits/chosen": 0.28125,
"logits/rejected": 0.302734375,
"logps/chosen": -25.0,
"logps/rejected": -96.5,
"loss": 0.4199,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.341796875,
"rewards/margins": 1.0703125,
"rewards/rejected": -0.7265625,
"step": 111
},
{
"epoch": 0.8385587271876462,
"grad_norm": 42.954647064208984,
"learning_rate": 3.157894736842105e-07,
"logits/chosen": 0.21875,
"logits/rejected": 0.2373046875,
"logps/chosen": -26.5,
"logps/rejected": -24.375,
"loss": 0.4437,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.267578125,
"rewards/margins": 0.71484375,
"rewards/rejected": -0.44921875,
"step": 112
},
{
"epoch": 0.8460458586803931,
"grad_norm": 44.198177337646484,
"learning_rate": 3.0075187969924807e-07,
"logits/chosen": 0.287109375,
"logits/rejected": 0.1875,
"logps/chosen": -26.125,
"logps/rejected": -30.25,
"loss": 0.4037,
"rewards/accuracies": 0.90625,
"rewards/chosen": 0.25390625,
"rewards/margins": 0.90625,
"rewards/rejected": -0.65234375,
"step": 113
},
{
"epoch": 0.8535329901731399,
"grad_norm": 45.43602752685547,
"learning_rate": 2.857142857142857e-07,
"logits/chosen": 0.224609375,
"logits/rejected": 0.1474609375,
"logps/chosen": -25.875,
"logps/rejected": -189.0,
"loss": 0.3862,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.27734375,
"rewards/margins": 1.8046875,
"rewards/rejected": -1.5234375,
"step": 114
},
{
"epoch": 0.8610201216658867,
"grad_norm": 44.5158805847168,
"learning_rate": 2.7067669172932327e-07,
"logits/chosen": 0.208984375,
"logits/rejected": 0.09716796875,
"logps/chosen": -25.5,
"logps/rejected": -33.25,
"loss": 0.436,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.25,
"rewards/margins": 0.87890625,
"rewards/rejected": -0.62890625,
"step": 115
},
{
"epoch": 0.8685072531586336,
"grad_norm": 60.82008743286133,
"learning_rate": 2.556390977443609e-07,
"logits/chosen": 0.283203125,
"logits/rejected": 0.2431640625,
"logps/chosen": -23.5,
"logps/rejected": -50.0,
"loss": 0.4736,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.2158203125,
"rewards/margins": 0.76953125,
"rewards/rejected": -0.5546875,
"step": 116
},
{
"epoch": 0.8759943846513805,
"grad_norm": 65.28529357910156,
"learning_rate": 2.4060150375939847e-07,
"logits/chosen": 0.134765625,
"logits/rejected": 0.0751953125,
"logps/chosen": -26.25,
"logps/rejected": -35.0,
"loss": 0.3799,
"rewards/accuracies": 0.96875,
"rewards/chosen": 0.306640625,
"rewards/margins": 1.1015625,
"rewards/rejected": -0.79296875,
"step": 117
},
{
"epoch": 0.8834815161441273,
"grad_norm": 54.721885681152344,
"learning_rate": 2.2556390977443606e-07,
"logits/chosen": 0.236328125,
"logits/rejected": 0.12158203125,
"logps/chosen": -24.125,
"logps/rejected": -27.625,
"loss": 0.4465,
"rewards/accuracies": 0.8125,
"rewards/chosen": 0.2333984375,
"rewards/margins": 0.7421875,
"rewards/rejected": -0.5078125,
"step": 118
},
{
"epoch": 0.8909686476368741,
"grad_norm": 47.69539260864258,
"learning_rate": 2.1052631578947366e-07,
"logits/chosen": 0.26953125,
"logits/rejected": 0.1953125,
"logps/chosen": -24.25,
"logps/rejected": -30.25,
"loss": 0.4815,
"rewards/accuracies": 0.90625,
"rewards/chosen": 0.1015625,
"rewards/margins": 0.625,
"rewards/rejected": -0.5234375,
"step": 119
},
{
"epoch": 0.8984557791296209,
"grad_norm": 37.75003433227539,
"learning_rate": 1.9548872180451126e-07,
"logits/chosen": 0.29296875,
"logits/rejected": 0.146484375,
"logps/chosen": -24.875,
"logps/rejected": -112.5,
"loss": 0.4232,
"rewards/accuracies": 0.96875,
"rewards/chosen": 0.1650390625,
"rewards/margins": 1.1875,
"rewards/rejected": -1.0234375,
"step": 120
},
{
"epoch": 0.9059429106223678,
"grad_norm": 65.35391235351562,
"learning_rate": 1.8045112781954886e-07,
"logits/chosen": 0.330078125,
"logits/rejected": 0.205078125,
"logps/chosen": -24.375,
"logps/rejected": -36.25,
"loss": 0.3961,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.201171875,
"rewards/margins": 0.9921875,
"rewards/rejected": -0.79296875,
"step": 121
},
{
"epoch": 0.9134300421151147,
"grad_norm": 41.64967727661133,
"learning_rate": 1.6541353383458646e-07,
"logits/chosen": 0.2353515625,
"logits/rejected": 0.2216796875,
"logps/chosen": -24.25,
"logps/rejected": -78.5,
"loss": 0.3987,
"rewards/accuracies": 0.96875,
"rewards/chosen": 0.2236328125,
"rewards/margins": 1.3125,
"rewards/rejected": -1.09375,
"step": 122
},
{
"epoch": 0.9209171736078615,
"grad_norm": 45.184326171875,
"learning_rate": 1.5037593984962403e-07,
"logits/chosen": 0.267578125,
"logits/rejected": 0.1630859375,
"logps/chosen": -25.25,
"logps/rejected": -99.0,
"loss": 0.4022,
"rewards/accuracies": 0.96875,
"rewards/chosen": 0.212890625,
"rewards/margins": 1.3359375,
"rewards/rejected": -1.1171875,
"step": 123
},
{
"epoch": 0.9284043051006083,
"grad_norm": 37.19181823730469,
"learning_rate": 1.3533834586466163e-07,
"logits/chosen": 0.2314453125,
"logits/rejected": 0.14453125,
"logps/chosen": -26.375,
"logps/rejected": -190.0,
"loss": 0.3883,
"rewards/accuracies": 0.84375,
"rewards/chosen": 0.302734375,
"rewards/margins": 1.90625,
"rewards/rejected": -1.609375,
"step": 124
},
{
"epoch": 0.9358914365933552,
"grad_norm": 48.21459197998047,
"learning_rate": 1.2030075187969923e-07,
"logits/chosen": 0.26953125,
"logits/rejected": 0.2216796875,
"logps/chosen": -24.625,
"logps/rejected": -23.125,
"loss": 0.4731,
"rewards/accuracies": 0.90625,
"rewards/chosen": 0.134765625,
"rewards/margins": 0.5625,
"rewards/rejected": -0.42578125,
"step": 125
},
{
"epoch": 0.943378568086102,
"grad_norm": 46.0123176574707,
"learning_rate": 1.0526315789473683e-07,
"logits/chosen": 0.2177734375,
"logits/rejected": 0.1728515625,
"logps/chosen": -25.0,
"logps/rejected": -28.25,
"loss": 0.3912,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.1787109375,
"rewards/margins": 0.83984375,
"rewards/rejected": -0.66015625,
"step": 126
},
{
"epoch": 0.9508656995788488,
"grad_norm": 52.23374938964844,
"learning_rate": 9.022556390977443e-08,
"logits/chosen": 0.2314453125,
"logits/rejected": 0.1796875,
"logps/chosen": -24.25,
"logps/rejected": -86.0,
"loss": 0.4142,
"rewards/accuracies": 0.78125,
"rewards/chosen": 0.28515625,
"rewards/margins": 1.3125,
"rewards/rejected": -1.03125,
"step": 127
},
{
"epoch": 0.9583528310715957,
"grad_norm": 39.65555953979492,
"learning_rate": 7.518796992481202e-08,
"logits/chosen": 0.1796875,
"logits/rejected": 0.1103515625,
"logps/chosen": -28.0,
"logps/rejected": -130.0,
"loss": 0.3215,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.40234375,
"rewards/margins": 2.046875,
"rewards/rejected": -1.6328125,
"step": 128
},
{
"epoch": 0.9658399625643426,
"grad_norm": 41.55595016479492,
"learning_rate": 6.015037593984962e-08,
"logits/chosen": 0.267578125,
"logits/rejected": 0.251953125,
"logps/chosen": -24.25,
"logps/rejected": -27.25,
"loss": 0.4264,
"rewards/accuracies": 0.90625,
"rewards/chosen": 0.220703125,
"rewards/margins": 0.84765625,
"rewards/rejected": -0.625,
"step": 129
},
{
"epoch": 0.9733270940570894,
"grad_norm": 44.8392333984375,
"learning_rate": 4.5112781954887216e-08,
"logits/chosen": 0.353515625,
"logits/rejected": 0.27734375,
"logps/chosen": -22.375,
"logps/rejected": -177.0,
"loss": 0.4437,
"rewards/accuracies": 0.90625,
"rewards/chosen": 0.146484375,
"rewards/margins": 1.4765625,
"rewards/rejected": -1.328125,
"step": 130
},
{
"epoch": 0.9808142255498362,
"grad_norm": 46.03443145751953,
"learning_rate": 3.007518796992481e-08,
"logits/chosen": 0.296875,
"logits/rejected": 0.216796875,
"logps/chosen": -25.0,
"logps/rejected": -26.375,
"loss": 0.4178,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.2890625,
"rewards/margins": 0.83203125,
"rewards/rejected": -0.54296875,
"step": 131
},
{
"epoch": 0.988301357042583,
"grad_norm": 39.30998611450195,
"learning_rate": 1.5037593984962404e-08,
"logits/chosen": 0.326171875,
"logits/rejected": 0.2451171875,
"logps/chosen": -23.25,
"logps/rejected": -100.5,
"loss": 0.4292,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.181640625,
"rewards/margins": 1.1484375,
"rewards/rejected": -0.96484375,
"step": 132
},
{
"epoch": 0.9957884885353299,
"grad_norm": 35.90797424316406,
"learning_rate": 0.0,
"logits/chosen": 0.1376953125,
"logits/rejected": 0.1220703125,
"logps/chosen": -29.0,
"logps/rejected": -190.0,
"loss": 0.3593,
"rewards/accuracies": 0.90625,
"rewards/chosen": 0.34765625,
"rewards/margins": 2.046875,
"rewards/rejected": -1.6953125,
"step": 133
}
],
"logging_steps": 1,
"max_steps": 133,
"num_input_tokens_seen": 0,
"num_train_epochs": 1,
"save_steps": 500,
"stateful_callbacks": {
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": true,
"should_training_stop": true
},
"attributes": {}
}
},
"total_flos": 0.0,
"train_batch_size": 1,
"trial_name": null,
"trial_params": null
}