Bigtrain_3.1 / trainer_state.json
jciardo's picture
Upload 15 files
f9ddf92 verified
Raw
History Blame Contribute Delete
49 kB
{
"best_global_step": null,
"best_metric": null,
"best_model_checkpoint": null,
"epoch": 1.4403957292584975,
"eval_steps": 35,
"global_step": 920,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"epoch": 0.023508668821627974,
"grad_norm": 94.17500305175781,
"learning_rate": 9.333333333333334e-08,
"logits/chosen": -2.9187049865722656,
"logits/rejected": -2.75704288482666,
"logps/chosen": -469.19525146484375,
"logps/rejected": -380.0172424316406,
"loss": 0.6763,
"rewards/accuracies": 0.5375000238418579,
"rewards/chosen": 0.08780575543642044,
"rewards/margins": 0.040122274309396744,
"rewards/rejected": 0.047683484852313995,
"step": 15
},
{
"epoch": 0.04701733764325595,
"grad_norm": 91.0787353515625,
"learning_rate": 1.9333333333333332e-07,
"logits/chosen": -2.999070644378662,
"logits/rejected": -2.760476589202881,
"logps/chosen": -468.59783935546875,
"logps/rejected": -361.46875,
"loss": 0.6239,
"rewards/accuracies": 0.6875,
"rewards/chosen": 0.42466142773628235,
"rewards/margins": 0.18366314470767975,
"rewards/rejected": 0.2409982681274414,
"step": 30
},
{
"epoch": 0.05485356058379861,
"eval_logits/chosen": -2.9845082759857178,
"eval_logits/rejected": -2.7968697547912598,
"eval_logps/chosen": -455.1330261230469,
"eval_logps/rejected": -369.554931640625,
"eval_loss": 0.612461507320404,
"eval_rewards/accuracies": 0.6765195727348328,
"eval_rewards/chosen": 0.592057466506958,
"eval_rewards/margins": 0.23903077840805054,
"eval_rewards/rejected": 0.35302671790122986,
"eval_runtime": 181.9833,
"eval_samples_per_second": 13.199,
"eval_steps_per_second": 6.6,
"step": 35
},
{
"epoch": 0.07052600646488393,
"grad_norm": 79.9468994140625,
"learning_rate": 2.933333333333333e-07,
"logits/chosen": -3.013662099838257,
"logits/rejected": -2.8054909706115723,
"logps/chosen": -446.2762756347656,
"logps/rejected": -384.8152770996094,
"loss": 0.6178,
"rewards/accuracies": 0.6645833253860474,
"rewards/chosen": 0.615195631980896,
"rewards/margins": 0.2345016449689865,
"rewards/rejected": 0.3806939721107483,
"step": 45
},
{
"epoch": 0.0940346752865119,
"grad_norm": 77.7275619506836,
"learning_rate": 3.933333333333333e-07,
"logits/chosen": -2.934065341949463,
"logits/rejected": -2.7790465354919434,
"logps/chosen": -489.3516540527344,
"logps/rejected": -384.1716613769531,
"loss": 0.5679,
"rewards/accuracies": 0.7166666388511658,
"rewards/chosen": 0.8837584853172302,
"rewards/margins": 0.41531360149383545,
"rewards/rejected": 0.46844482421875,
"step": 60
},
{
"epoch": 0.10970712116759722,
"eval_logits/chosen": -2.9480597972869873,
"eval_logits/rejected": -2.767725706100464,
"eval_logps/chosen": -450.7250671386719,
"eval_logps/rejected": -367.63983154296875,
"eval_loss": 0.5620076656341553,
"eval_rewards/accuracies": 0.7189841866493225,
"eval_rewards/chosen": 1.0328545570373535,
"eval_rewards/margins": 0.4883180558681488,
"eval_rewards/rejected": 0.5445364713668823,
"eval_runtime": 182.4653,
"eval_samples_per_second": 13.164,
"eval_steps_per_second": 6.582,
"step": 70
},
{
"epoch": 0.11754334410813988,
"grad_norm": 72.56718444824219,
"learning_rate": 4.933333333333333e-07,
"logits/chosen": -2.913278818130493,
"logits/rejected": -2.7157583236694336,
"logps/chosen": -438.0467529296875,
"logps/rejected": -365.61798095703125,
"loss": 0.5657,
"rewards/accuracies": 0.7145833373069763,
"rewards/chosen": 0.9045347571372986,
"rewards/margins": 0.449837327003479,
"rewards/rejected": 0.4546974301338196,
"step": 75
},
{
"epoch": 0.14105201292976785,
"grad_norm": 79.41279602050781,
"learning_rate": 5.933333333333334e-07,
"logits/chosen": -2.9613964557647705,
"logits/rejected": -2.75221586227417,
"logps/chosen": -455.7210388183594,
"logps/rejected": -348.0450744628906,
"loss": 0.5183,
"rewards/accuracies": 0.7666666507720947,
"rewards/chosen": 1.0422641038894653,
"rewards/margins": 0.6262082457542419,
"rewards/rejected": 0.4160558581352234,
"step": 90
},
{
"epoch": 0.16456068175139582,
"grad_norm": 71.57633209228516,
"learning_rate": 6.933333333333333e-07,
"logits/chosen": -2.938500165939331,
"logits/rejected": -2.73604416847229,
"logps/chosen": -463.0316467285156,
"logps/rejected": -380.5111389160156,
"loss": 0.5407,
"rewards/accuracies": 0.7229166626930237,
"rewards/chosen": 1.022507905960083,
"rewards/margins": 0.6094505190849304,
"rewards/rejected": 0.41305726766586304,
"step": 105
},
{
"epoch": 0.16456068175139582,
"eval_logits/chosen": -2.985232353210449,
"eval_logits/rejected": -2.8150649070739746,
"eval_logps/chosen": -450.6111145019531,
"eval_logps/rejected": -369.0615234375,
"eval_loss": 0.5306517481803894,
"eval_rewards/accuracies": 0.741881787776947,
"eval_rewards/chosen": 1.0442498922348022,
"eval_rewards/margins": 0.641879141330719,
"eval_rewards/rejected": 0.40237072110176086,
"eval_runtime": 182.4384,
"eval_samples_per_second": 13.166,
"eval_steps_per_second": 6.583,
"step": 105
},
{
"epoch": 0.1880693505730238,
"grad_norm": 69.94996643066406,
"learning_rate": 7.933333333333333e-07,
"logits/chosen": -2.9730515480041504,
"logits/rejected": -2.772322654724121,
"logps/chosen": -468.67315673828125,
"logps/rejected": -395.2209167480469,
"loss": 0.5009,
"rewards/accuracies": 0.7666666507720947,
"rewards/chosen": 1.1156314611434937,
"rewards/margins": 0.7098201513290405,
"rewards/rejected": 0.4058113694190979,
"step": 120
},
{
"epoch": 0.2115780193946518,
"grad_norm": 77.51742553710938,
"learning_rate": 8.933333333333333e-07,
"logits/chosen": -2.9735770225524902,
"logits/rejected": -2.7964773178100586,
"logps/chosen": -449.1340637207031,
"logps/rejected": -364.1695251464844,
"loss": 0.5277,
"rewards/accuracies": 0.7541666626930237,
"rewards/chosen": 1.1800711154937744,
"rewards/margins": 0.6686728000640869,
"rewards/rejected": 0.5113983750343323,
"step": 135
},
{
"epoch": 0.21941424233519444,
"eval_logits/chosen": -3.01723575592041,
"eval_logits/rejected": -2.856294631958008,
"eval_logps/chosen": -449.0035400390625,
"eval_logps/rejected": -368.5563659667969,
"eval_loss": 0.5107097625732422,
"eval_rewards/accuracies": 0.7635303735733032,
"eval_rewards/chosen": 1.2050074338912964,
"eval_rewards/margins": 0.7521231174468994,
"eval_rewards/rejected": 0.4528845250606537,
"eval_runtime": 182.658,
"eval_samples_per_second": 13.15,
"eval_steps_per_second": 6.575,
"step": 140
},
{
"epoch": 0.23508668821627976,
"grad_norm": 86.60038757324219,
"learning_rate": 9.933333333333333e-07,
"logits/chosen": -2.9938228130340576,
"logits/rejected": -2.764103651046753,
"logps/chosen": -459.8388671875,
"logps/rejected": -371.2470703125,
"loss": 0.5268,
"rewards/accuracies": 0.7520833611488342,
"rewards/chosen": 1.2029531002044678,
"rewards/margins": 0.7044091820716858,
"rewards/rejected": 0.4985438585281372,
"step": 150
},
{
"epoch": 0.2585953570379077,
"grad_norm": 62.65684509277344,
"learning_rate": 9.998451182298019e-07,
"logits/chosen": -2.98136305809021,
"logits/rejected": -2.761441707611084,
"logps/chosen": -436.3692321777344,
"logps/rejected": -367.0105285644531,
"loss": 0.493,
"rewards/accuracies": 0.7729166746139526,
"rewards/chosen": 1.189981460571289,
"rewards/margins": 0.7949865460395813,
"rewards/rejected": 0.39499494433403015,
"step": 165
},
{
"epoch": 0.27426780291899305,
"eval_logits/chosen": -3.0445635318756104,
"eval_logits/rejected": -2.888272523880005,
"eval_logps/chosen": -449.422607421875,
"eval_logps/rejected": -369.7976379394531,
"eval_loss": 0.4949776828289032,
"eval_rewards/accuracies": 0.7785179018974304,
"eval_rewards/chosen": 1.1631028652191162,
"eval_rewards/margins": 0.8343473076820374,
"eval_rewards/rejected": 0.32875561714172363,
"eval_runtime": 182.4446,
"eval_samples_per_second": 13.166,
"eval_steps_per_second": 6.583,
"step": 175
},
{
"epoch": 0.2821040258595357,
"grad_norm": 65.13655090332031,
"learning_rate": 9.993355436786068e-07,
"logits/chosen": -3.0274109840393066,
"logits/rejected": -2.807159185409546,
"logps/chosen": -451.6954345703125,
"logps/rejected": -389.3435974121094,
"loss": 0.5027,
"rewards/accuracies": 0.7458333373069763,
"rewards/chosen": 1.1719075441360474,
"rewards/margins": 0.8119107484817505,
"rewards/rejected": 0.3599967360496521,
"step": 180
},
{
"epoch": 0.3056126946811637,
"grad_norm": 63.794944763183594,
"learning_rate": 9.98470848495185e-07,
"logits/chosen": -3.018803358078003,
"logits/rejected": -2.8374457359313965,
"logps/chosen": -467.7348937988281,
"logps/rejected": -358.5385437011719,
"loss": 0.4892,
"rewards/accuracies": 0.7729166746139526,
"rewards/chosen": 1.3426380157470703,
"rewards/margins": 0.8895413279533386,
"rewards/rejected": 0.45309677720069885,
"step": 195
},
{
"epoch": 0.32912136350279164,
"grad_norm": 59.325931549072266,
"learning_rate": 9.972516476389642e-07,
"logits/chosen": -3.010078191757202,
"logits/rejected": -2.8023157119750977,
"logps/chosen": -483.93109130859375,
"logps/rejected": -363.4820861816406,
"loss": 0.4863,
"rewards/accuracies": 0.7895833253860474,
"rewards/chosen": 1.499975323677063,
"rewards/margins": 0.9867887496948242,
"rewards/rejected": 0.5131866931915283,
"step": 210
},
{
"epoch": 0.32912136350279164,
"eval_logits/chosen": -2.9908792972564697,
"eval_logits/rejected": -2.841421127319336,
"eval_logps/chosen": -445.6985778808594,
"eval_logps/rejected": -367.1920166015625,
"eval_loss": 0.4917643070220947,
"eval_rewards/accuracies": 0.7714404463768005,
"eval_rewards/chosen": 1.5355042219161987,
"eval_rewards/margins": 0.9461879134178162,
"eval_rewards/rejected": 0.5893163084983826,
"eval_runtime": 182.823,
"eval_samples_per_second": 13.138,
"eval_steps_per_second": 6.569,
"step": 210
},
{
"epoch": 0.35263003232441964,
"grad_norm": 70.83655548095703,
"learning_rate": 9.956788081889744e-07,
"logits/chosen": -2.960338592529297,
"logits/rejected": -2.795625925064087,
"logps/chosen": -420.8348693847656,
"logps/rejected": -371.9022216796875,
"loss": 0.5069,
"rewards/accuracies": 0.7541666626930237,
"rewards/chosen": 1.327363133430481,
"rewards/margins": 0.8786435723304749,
"rewards/rejected": 0.4487195312976837,
"step": 225
},
{
"epoch": 0.3761387011460476,
"grad_norm": 68.10982513427734,
"learning_rate": 9.93753448727193e-07,
"logits/chosen": -3.019317865371704,
"logits/rejected": -2.824141502380371,
"logps/chosen": -454.7313232421875,
"logps/rejected": -362.6961669921875,
"loss": 0.4525,
"rewards/accuracies": 0.800000011920929,
"rewards/chosen": 1.4697461128234863,
"rewards/margins": 1.0406087636947632,
"rewards/rejected": 0.4291374385356903,
"step": 240
},
{
"epoch": 0.3839749240865903,
"eval_logits/chosen": -2.9617090225219727,
"eval_logits/rejected": -2.813918113708496,
"eval_logps/chosen": -444.755615234375,
"eval_logps/rejected": -366.7734069824219,
"eval_loss": 0.4914787709712982,
"eval_rewards/accuracies": 0.7631140947341919,
"eval_rewards/chosen": 1.6298017501831055,
"eval_rewards/margins": 0.9986252188682556,
"eval_rewards/rejected": 0.6311766505241394,
"eval_runtime": 183.7769,
"eval_samples_per_second": 13.07,
"eval_steps_per_second": 6.535,
"step": 245
},
{
"epoch": 0.3996473699676756,
"grad_norm": 57.24860382080078,
"learning_rate": 9.914769385430247e-07,
"logits/chosen": -2.9585585594177246,
"logits/rejected": -2.747401475906372,
"logps/chosen": -453.3490905761719,
"logps/rejected": -383.33203125,
"loss": 0.5226,
"rewards/accuracies": 0.7416666746139526,
"rewards/chosen": 1.5862523317337036,
"rewards/margins": 0.9523304104804993,
"rewards/rejected": 0.6339219808578491,
"step": 255
},
{
"epoch": 0.4231560387893036,
"grad_norm": 102.9881820678711,
"learning_rate": 9.888508966594814e-07,
"logits/chosen": -2.9838056564331055,
"logits/rejected": -2.80302357673645,
"logps/chosen": -458.0950012207031,
"logps/rejected": -371.9687805175781,
"loss": 0.488,
"rewards/accuracies": 0.7729166746139526,
"rewards/chosen": 1.4627233743667603,
"rewards/margins": 0.95100337266922,
"rewards/rejected": 0.5117199420928955,
"step": 270
},
{
"epoch": 0.4388284846703889,
"eval_logits/chosen": -2.9294016361236572,
"eval_logits/rejected": -2.7830867767333984,
"eval_logps/chosen": -445.0923767089844,
"eval_logps/rejected": -367.69287109375,
"eval_loss": 0.48294496536254883,
"eval_rewards/accuracies": 0.7651956677436829,
"eval_rewards/chosen": 1.5961238145828247,
"eval_rewards/margins": 1.0568901300430298,
"eval_rewards/rejected": 0.5392336845397949,
"eval_runtime": 183.0491,
"eval_samples_per_second": 13.122,
"eval_steps_per_second": 6.561,
"step": 280
},
{
"epoch": 0.4466647076109315,
"grad_norm": 55.373291015625,
"learning_rate": 9.85877190681755e-07,
"logits/chosen": -2.9584264755249023,
"logits/rejected": -2.8002991676330566,
"logps/chosen": -467.3027648925781,
"logps/rejected": -373.3812561035156,
"loss": 0.4784,
"rewards/accuracies": 0.7791666388511658,
"rewards/chosen": 1.5210446119308472,
"rewards/margins": 1.0039273500442505,
"rewards/rejected": 0.5171175003051758,
"step": 285
},
{
"epoch": 0.4701733764325595,
"grad_norm": 80.90605163574219,
"learning_rate": 9.825579354690029e-07,
"logits/chosen": -2.9166040420532227,
"logits/rejected": -2.7068498134613037,
"logps/chosen": -443.4498291015625,
"logps/rejected": -359.88787841796875,
"loss": 0.4947,
"rewards/accuracies": 0.7395833134651184,
"rewards/chosen": 1.549621343612671,
"rewards/margins": 0.9639669060707092,
"rewards/rejected": 0.5856544375419617,
"step": 300
},
{
"epoch": 0.49368204525418746,
"grad_norm": 58.752540588378906,
"learning_rate": 9.788954916302867e-07,
"logits/chosen": -2.918592929840088,
"logits/rejected": -2.7391176223754883,
"logps/chosen": -445.65692138671875,
"logps/rejected": -375.7033386230469,
"loss": 0.4844,
"rewards/accuracies": 0.7458333373069763,
"rewards/chosen": 1.6397162675857544,
"rewards/margins": 1.1213122606277466,
"rewards/rejected": 0.5184040069580078,
"step": 315
},
{
"epoch": 0.49368204525418746,
"eval_logits/chosen": -2.946758270263672,
"eval_logits/rejected": -2.8033602237701416,
"eval_logps/chosen": -445.91162109375,
"eval_logps/rejected": -368.79913330078125,
"eval_loss": 0.4768896698951721,
"eval_rewards/accuracies": 0.7756036520004272,
"eval_rewards/chosen": 1.5141996145248413,
"eval_rewards/margins": 1.0855913162231445,
"eval_rewards/rejected": 0.4286082684993744,
"eval_runtime": 182.7832,
"eval_samples_per_second": 13.141,
"eval_steps_per_second": 6.571,
"step": 315
},
{
"epoch": 0.5171907140758154,
"grad_norm": 72.6146011352539,
"learning_rate": 9.748924638457425e-07,
"logits/chosen": -3.0164575576782227,
"logits/rejected": -2.7821667194366455,
"logps/chosen": -461.7873840332031,
"logps/rejected": -387.76312255859375,
"loss": 0.448,
"rewards/accuracies": 0.7833333611488342,
"rewards/chosen": 1.5970878601074219,
"rewards/margins": 1.1854947805404663,
"rewards/rejected": 0.41159313917160034,
"step": 330
},
{
"epoch": 0.5406993828974435,
"grad_norm": 78.9859848022461,
"learning_rate": 9.705516990141652e-07,
"logits/chosen": -2.9356918334960938,
"logits/rejected": -2.7638401985168457,
"logps/chosen": -471.6175231933594,
"logps/rejected": -419.6571350097656,
"loss": 0.4583,
"rewards/accuracies": 0.7583333253860474,
"rewards/chosen": 1.4139249324798584,
"rewards/margins": 1.0874642133712769,
"rewards/rejected": 0.32646065950393677,
"step": 345
},
{
"epoch": 0.5485356058379861,
"eval_logits/chosen": -3.0017576217651367,
"eval_logits/rejected": -2.8627164363861084,
"eval_logps/chosen": -447.2599792480469,
"eval_logps/rejected": -370.40399169921875,
"eval_loss": 0.47239452600479126,
"eval_rewards/accuracies": 0.7801831960678101,
"eval_rewards/chosen": 1.3793617486953735,
"eval_rewards/margins": 1.111243486404419,
"eval_rewards/rejected": 0.2681184411048889,
"eval_runtime": 183.3777,
"eval_samples_per_second": 13.099,
"eval_steps_per_second": 6.549,
"step": 350
},
{
"epoch": 0.5642080517190714,
"grad_norm": 84.21063995361328,
"learning_rate": 9.658762842283341e-07,
"logits/chosen": -2.990657329559326,
"logits/rejected": -2.8259623050689697,
"logps/chosen": -481.35552978515625,
"logps/rejected": -396.5709533691406,
"loss": 0.4491,
"rewards/accuracies": 0.7895833253860474,
"rewards/chosen": 1.3929458856582642,
"rewards/margins": 1.1319301128387451,
"rewards/rejected": 0.2610156834125519,
"step": 360
},
{
"epoch": 0.5877167205406993,
"grad_norm": 69.14201354980469,
"learning_rate": 9.608695445795146e-07,
"logits/chosen": -3.019925594329834,
"logits/rejected": -2.8734469413757324,
"logps/chosen": -471.0541076660156,
"logps/rejected": -388.4405517578125,
"loss": 0.4159,
"rewards/accuracies": 0.8104166388511658,
"rewards/chosen": 1.6452898979187012,
"rewards/margins": 1.3720909357070923,
"rewards/rejected": 0.27319908142089844,
"step": 375
},
{
"epoch": 0.6033891664217848,
"eval_logits/chosen": -2.9827041625976562,
"eval_logits/rejected": -2.843700408935547,
"eval_logps/chosen": -445.8433532714844,
"eval_logps/rejected": -369.46636962890625,
"eval_loss": 0.47262606024742126,
"eval_rewards/accuracies": 0.779766857624054,
"eval_rewards/chosen": 1.5210249423980713,
"eval_rewards/margins": 1.1591413021087646,
"eval_rewards/rejected": 0.36188361048698425,
"eval_runtime": 182.9492,
"eval_samples_per_second": 13.129,
"eval_steps_per_second": 6.565,
"step": 385
},
{
"epoch": 0.6112253893623274,
"grad_norm": 89.24090576171875,
"learning_rate": 9.555350407926977e-07,
"logits/chosen": -2.9598388671875,
"logits/rejected": -2.8019778728485107,
"logps/chosen": -458.2909240722656,
"logps/rejected": -379.5040283203125,
"loss": 0.5023,
"rewards/accuracies": 0.768750011920929,
"rewards/chosen": 1.4271316528320312,
"rewards/margins": 1.0898312330245972,
"rewards/rejected": 0.33730027079582214,
"step": 390
},
{
"epoch": 0.6347340581839553,
"grad_norm": 84.49832916259766,
"learning_rate": 9.498765666942621e-07,
"logits/chosen": -3.053419351577759,
"logits/rejected": -2.8401293754577637,
"logps/chosen": -430.2739562988281,
"logps/rejected": -377.2356872558594,
"loss": 0.4732,
"rewards/accuracies": 0.7729166746139526,
"rewards/chosen": 1.3829543590545654,
"rewards/margins": 1.1306571960449219,
"rewards/rejected": 0.25229716300964355,
"step": 405
},
{
"epoch": 0.6582427270055833,
"grad_norm": 80.26911926269531,
"learning_rate": 9.438981465138564e-07,
"logits/chosen": -2.9762353897094727,
"logits/rejected": -2.8631834983825684,
"logps/chosen": -464.1763916015625,
"logps/rejected": -372.65423583984375,
"loss": 0.4611,
"rewards/accuracies": 0.7749999761581421,
"rewards/chosen": 1.389533281326294,
"rewards/margins": 1.1575042009353638,
"rewards/rejected": 0.23202911019325256,
"step": 420
},
{
"epoch": 0.6582427270055833,
"eval_logits/chosen": -2.979790687561035,
"eval_logits/rejected": -2.84635329246521,
"eval_logps/chosen": -445.2568054199219,
"eval_logps/rejected": -369.1412048339844,
"eval_loss": 0.46475231647491455,
"eval_rewards/accuracies": 0.779766857624054,
"eval_rewards/chosen": 1.5796784162521362,
"eval_rewards/margins": 1.1852765083312988,
"eval_rewards/rejected": 0.3944019079208374,
"eval_runtime": 183.2941,
"eval_samples_per_second": 13.105,
"eval_steps_per_second": 6.552,
"step": 420
},
{
"epoch": 0.6817513958272113,
"grad_norm": 78.24493408203125,
"learning_rate": 9.376040320224207e-07,
"logits/chosen": -2.9707512855529785,
"logits/rejected": -2.756378412246704,
"logps/chosen": -444.6748046875,
"logps/rejected": -364.9356994628906,
"loss": 0.5195,
"rewards/accuracies": 0.7416666746139526,
"rewards/chosen": 1.4916802644729614,
"rewards/margins": 1.0260388851165771,
"rewards/rejected": 0.4656413197517395,
"step": 435
},
{
"epoch": 0.7052600646488393,
"grad_norm": 65.54131317138672,
"learning_rate": 9.309986995083865e-07,
"logits/chosen": -2.9713919162750244,
"logits/rejected": -2.853391170501709,
"logps/chosen": -437.1709289550781,
"logps/rejected": -380.7355041503906,
"loss": 0.4612,
"rewards/accuracies": 0.768750011920929,
"rewards/chosen": 1.518881916999817,
"rewards/margins": 1.1546814441680908,
"rewards/rejected": 0.3642004728317261,
"step": 450
},
{
"epoch": 0.7130962875893819,
"eval_logits/chosen": -2.9684040546417236,
"eval_logits/rejected": -2.835289716720581,
"eval_logps/chosen": -444.91162109375,
"eval_logps/rejected": -369.0731506347656,
"eval_loss": 0.4633679687976837,
"eval_rewards/accuracies": 0.7814321517944336,
"eval_rewards/chosen": 1.6142022609710693,
"eval_rewards/margins": 1.2129993438720703,
"eval_rewards/rejected": 0.4012027978897095,
"eval_runtime": 183.2161,
"eval_samples_per_second": 13.11,
"eval_steps_per_second": 6.555,
"step": 455
},
{
"epoch": 0.7287687334704672,
"grad_norm": 49.11262130737305,
"learning_rate": 9.240868465942004e-07,
"logits/chosen": -2.9776499271392822,
"logits/rejected": -2.8117339611053467,
"logps/chosen": -463.0809020996094,
"logps/rejected": -372.5666809082031,
"loss": 0.4164,
"rewards/accuracies": 0.8062499761581421,
"rewards/chosen": 1.703311800956726,
"rewards/margins": 1.3144255876541138,
"rewards/rejected": 0.3888862729072571,
"step": 465
},
{
"epoch": 0.7522774022920952,
"grad_norm": 88.16354370117188,
"learning_rate": 9.168733888954398e-07,
"logits/chosen": -2.9618024826049805,
"logits/rejected": -2.816535472869873,
"logps/chosen": -462.2527770996094,
"logps/rejected": -384.9928283691406,
"loss": 0.4777,
"rewards/accuracies": 0.7916666865348816,
"rewards/chosen": 1.523806095123291,
"rewards/margins": 1.139542818069458,
"rewards/rejected": 0.3842634856700897,
"step": 480
},
{
"epoch": 0.7679498481731806,
"eval_logits/chosen": -3.0340590476989746,
"eval_logits/rejected": -2.9054691791534424,
"eval_logps/chosen": -446.62152099609375,
"eval_logps/rejected": -370.80877685546875,
"eval_loss": 0.45889604091644287,
"eval_rewards/accuracies": 0.7880932688713074,
"eval_rewards/chosen": 1.4432086944580078,
"eval_rewards/margins": 1.2155660390853882,
"eval_rewards/rejected": 0.22764264047145844,
"eval_runtime": 183.4706,
"eval_samples_per_second": 13.092,
"eval_steps_per_second": 6.546,
"step": 490
},
{
"epoch": 0.7757860711137232,
"grad_norm": 64.71389770507812,
"learning_rate": 9.093634565248934e-07,
"logits/chosen": -2.998199462890625,
"logits/rejected": -2.8670761585235596,
"logps/chosen": -439.2498474121094,
"logps/rejected": -379.03826904296875,
"loss": 0.4378,
"rewards/accuracies": 0.7833333611488342,
"rewards/chosen": 1.474950909614563,
"rewards/margins": 1.2197434902191162,
"rewards/rejected": 0.2552074193954468,
"step": 495
},
{
"epoch": 0.7992947399353512,
"grad_norm": 81.95059967041016,
"learning_rate": 9.015623904440955e-07,
"logits/chosen": -3.033099412918091,
"logits/rejected": -2.872230052947998,
"logps/chosen": -453.91607666015625,
"logps/rejected": -385.92999267578125,
"loss": 0.4317,
"rewards/accuracies": 0.793749988079071,
"rewards/chosen": 1.5632601976394653,
"rewards/margins": 1.298865556716919,
"rewards/rejected": 0.26439470052719116,
"step": 510
},
{
"epoch": 0.8228034087569791,
"grad_norm": 63.492652893066406,
"learning_rate": 8.934757386649061e-07,
"logits/chosen": -3.0300612449645996,
"logits/rejected": -2.860938787460327,
"logps/chosen": -418.1768798828125,
"logps/rejected": -359.6458740234375,
"loss": 0.448,
"rewards/accuracies": 0.7854166626930237,
"rewards/chosen": 1.449339747428894,
"rewards/margins": 1.289171814918518,
"rewards/rejected": 0.16016803681850433,
"step": 525
},
{
"epoch": 0.8228034087569791,
"eval_logits/chosen": -3.0507404804229736,
"eval_logits/rejected": -2.929443836212158,
"eval_logps/chosen": -446.1484680175781,
"eval_logps/rejected": -371.0081481933594,
"eval_loss": 0.4595262110233307,
"eval_rewards/accuracies": 0.7860116362571716,
"eval_rewards/chosen": 1.4905126094818115,
"eval_rewards/margins": 1.2828094959259033,
"eval_rewards/rejected": 0.20770323276519775,
"eval_runtime": 184.1856,
"eval_samples_per_second": 13.041,
"eval_steps_per_second": 6.521,
"step": 525
},
{
"epoch": 0.8463120775786072,
"grad_norm": 62.45206832885742,
"learning_rate": 8.851092523038417e-07,
"logits/chosen": -3.0484862327575684,
"logits/rejected": -2.906770944595337,
"logps/chosen": -458.0007019042969,
"logps/rejected": -373.7229919433594,
"loss": 0.4522,
"rewards/accuracies": 0.7645833492279053,
"rewards/chosen": 1.579330325126648,
"rewards/margins": 1.3272625207901,
"rewards/rejected": 0.2520677447319031,
"step": 540
},
{
"epoch": 0.8698207464002351,
"grad_norm": 79.46917724609375,
"learning_rate": 8.764688814919589e-07,
"logits/chosen": -2.996983289718628,
"logits/rejected": -2.865999937057495,
"logps/chosen": -481.4201965332031,
"logps/rejected": -376.74200439453125,
"loss": 0.4349,
"rewards/accuracies": 0.7895833253860474,
"rewards/chosen": 1.7141087055206299,
"rewards/margins": 1.316036581993103,
"rewards/rejected": 0.3980720341205597,
"step": 555
},
{
"epoch": 0.8776569693407777,
"eval_logits/chosen": -2.9852750301361084,
"eval_logits/rejected": -2.865750312805176,
"eval_logps/chosen": -443.4287109375,
"eval_logps/rejected": -368.6723937988281,
"eval_loss": 0.4570087790489197,
"eval_rewards/accuracies": 0.7851790189743042,
"eval_rewards/chosen": 1.762492060661316,
"eval_rewards/margins": 1.321212649345398,
"eval_rewards/rejected": 0.44127941131591797,
"eval_runtime": 183.4018,
"eval_samples_per_second": 13.097,
"eval_steps_per_second": 6.548,
"step": 560
},
{
"epoch": 0.893329415221863,
"grad_norm": 84.6218032836914,
"learning_rate": 8.675607711432023e-07,
"logits/chosen": -2.9534671306610107,
"logits/rejected": -2.87934947013855,
"logps/chosen": -439.9498291015625,
"logps/rejected": -368.0388488769531,
"loss": 0.4431,
"rewards/accuracies": 0.7854166626930237,
"rewards/chosen": 1.7760926485061646,
"rewards/margins": 1.3532804250717163,
"rewards/rejected": 0.42281219363212585,
"step": 570
},
{
"epoch": 0.916838084043491,
"grad_norm": 99.58641052246094,
"learning_rate": 8.583912565842256e-07,
"logits/chosen": -3.0073468685150146,
"logits/rejected": -2.877568483352661,
"logps/chosen": -453.67877197265625,
"logps/rejected": -404.41595458984375,
"loss": 0.453,
"rewards/accuracies": 0.78125,
"rewards/chosen": 1.554824948310852,
"rewards/margins": 1.3386683464050293,
"rewards/rejected": 0.21615657210350037,
"step": 585
},
{
"epoch": 0.9325105299245764,
"eval_logits/chosen": -3.022214651107788,
"eval_logits/rejected": -2.903691530227661,
"eval_logps/chosen": -444.5338134765625,
"eval_logps/rejected": -369.7436828613281,
"eval_loss": 0.4549033045768738,
"eval_rewards/accuracies": 0.7876769304275513,
"eval_rewards/chosen": 1.651978611946106,
"eval_rewards/margins": 1.317826271057129,
"eval_rewards/rejected": 0.3341525197029114,
"eval_runtime": 183.2329,
"eval_samples_per_second": 13.109,
"eval_steps_per_second": 6.555,
"step": 595
},
{
"epoch": 0.940346752865119,
"grad_norm": 78.86089324951172,
"learning_rate": 8.489668590487934e-07,
"logits/chosen": -3.0001256465911865,
"logits/rejected": -2.8593249320983887,
"logps/chosen": -477.72747802734375,
"logps/rejected": -387.3090515136719,
"loss": 0.4064,
"rewards/accuracies": 0.8166666626930237,
"rewards/chosen": 1.7754851579666138,
"rewards/margins": 1.4204692840576172,
"rewards/rejected": 0.3550158143043518,
"step": 600
},
{
"epoch": 0.963855421686747,
"grad_norm": 62.35348129272461,
"learning_rate": 8.392942810399692e-07,
"logits/chosen": -2.9913129806518555,
"logits/rejected": -2.817882537841797,
"logps/chosen": -444.8560485839844,
"logps/rejected": -363.76031494140625,
"loss": 0.4734,
"rewards/accuracies": 0.7895833253860474,
"rewards/chosen": 1.713532567024231,
"rewards/margins": 1.252496600151062,
"rewards/rejected": 0.4610358476638794,
"step": 615
},
{
"epoch": 0.9873640905083749,
"grad_norm": 72.48424530029297,
"learning_rate": 8.293804015633861e-07,
"logits/chosen": -2.9733986854553223,
"logits/rejected": -2.888038158416748,
"logps/chosen": -456.3985290527344,
"logps/rejected": -381.1490783691406,
"loss": 0.4619,
"rewards/accuracies": 0.7583333253860474,
"rewards/chosen": 1.6326733827590942,
"rewards/margins": 1.3371747732162476,
"rewards/rejected": 0.2954985797405243,
"step": 630
},
{
"epoch": 0.9873640905083749,
"eval_logits/chosen": -3.049649477005005,
"eval_logits/rejected": -2.9301326274871826,
"eval_logps/chosen": -445.55535888671875,
"eval_logps/rejected": -370.92901611328125,
"eval_loss": 0.45518428087234497,
"eval_rewards/accuracies": 0.7860116362571716,
"eval_rewards/chosen": 1.5498268604278564,
"eval_rewards/margins": 1.334204912185669,
"eval_rewards/rejected": 0.21562182903289795,
"eval_runtime": 183.3369,
"eval_samples_per_second": 13.102,
"eval_steps_per_second": 6.551,
"step": 630
},
{
"epoch": 1.0094034675286512,
"grad_norm": 22.814455032348633,
"learning_rate": 8.192322712349917e-07,
"logits/chosen": -3.098414182662964,
"logits/rejected": -2.939121961593628,
"logps/chosen": -462.97576904296875,
"logps/rejected": -390.0594787597656,
"loss": 0.309,
"rewards/accuracies": 0.8488888740539551,
"rewards/chosen": 1.9965033531188965,
"rewards/margins": 1.9893156290054321,
"rewards/rejected": 0.007187690585851669,
"step": 645
},
{
"epoch": 1.0329121363502791,
"grad_norm": 15.870294570922852,
"learning_rate": 8.088571072667467e-07,
"logits/chosen": -3.0244786739349365,
"logits/rejected": -2.9035534858703613,
"logps/chosen": -445.8445739746094,
"logps/rejected": -387.0111999511719,
"loss": 0.1563,
"rewards/accuracies": 0.9604166746139526,
"rewards/chosen": 2.3765647411346436,
"rewards/margins": 2.8836135864257812,
"rewards/rejected": -0.5070487260818481,
"step": 660
},
{
"epoch": 1.0407483592908218,
"eval_logits/chosen": -3.0475077629089355,
"eval_logits/rejected": -2.932504653930664,
"eval_logps/chosen": -443.696044921875,
"eval_logps/rejected": -369.9301452636719,
"eval_loss": 0.4569734036922455,
"eval_rewards/accuracies": 0.7864279747009277,
"eval_rewards/chosen": 1.7357611656188965,
"eval_rewards/margins": 1.4202516078948975,
"eval_rewards/rejected": 0.31550952792167664,
"eval_runtime": 183.8109,
"eval_samples_per_second": 13.068,
"eval_steps_per_second": 6.534,
"step": 665
},
{
"epoch": 1.056420805171907,
"grad_norm": 22.613313674926758,
"learning_rate": 7.982622883338412e-07,
"logits/chosen": -3.0598597526550293,
"logits/rejected": -2.8916327953338623,
"logps/chosen": -443.3858337402344,
"logps/rejected": -372.9571533203125,
"loss": 0.1456,
"rewards/accuracies": 0.9750000238418579,
"rewards/chosen": 2.485177516937256,
"rewards/margins": 2.976323366165161,
"rewards/rejected": -0.4911458194255829,
"step": 675
},
{
"epoch": 1.079929473993535,
"grad_norm": 28.832002639770508,
"learning_rate": 7.87455349327083e-07,
"logits/chosen": -3.0330069065093994,
"logits/rejected": -2.9795467853546143,
"logps/chosen": -445.0064392089844,
"logps/rejected": -388.0311584472656,
"loss": 0.1461,
"rewards/accuracies": 0.9666666388511658,
"rewards/chosen": 2.396218776702881,
"rewards/margins": 2.9112985134124756,
"rewards/rejected": -0.5150795578956604,
"step": 690
},
{
"epoch": 1.0956019198746205,
"eval_logits/chosen": -3.052074670791626,
"eval_logits/rejected": -2.944197177886963,
"eval_logps/chosen": -443.52960205078125,
"eval_logps/rejected": -370.5727233886719,
"eval_loss": 0.46059471368789673,
"eval_rewards/accuracies": 0.7855953574180603,
"eval_rewards/chosen": 1.7523990869522095,
"eval_rewards/margins": 1.50115168094635,
"eval_rewards/rejected": 0.2512475848197937,
"eval_runtime": 183.617,
"eval_samples_per_second": 13.082,
"eval_steps_per_second": 6.541,
"step": 700
},
{
"epoch": 1.1034381428151632,
"grad_norm": 25.791044235229492,
"learning_rate": 7.76443975994184e-07,
"logits/chosen": -3.0462889671325684,
"logits/rejected": -2.879300117492676,
"logps/chosen": -456.4526062011719,
"logps/rejected": -370.51763916015625,
"loss": 0.1463,
"rewards/accuracies": 0.9708333611488342,
"rewards/chosen": 2.561633825302124,
"rewards/margins": 2.946091413497925,
"rewards/rejected": -0.3844579756259918,
"step": 705
},
{
"epoch": 1.1269468116367911,
"grad_norm": 15.894529342651367,
"learning_rate": 7.652359994737627e-07,
"logits/chosen": -3.055009603500366,
"logits/rejected": -2.938103675842285,
"logps/chosen": -467.1528015136719,
"logps/rejected": -390.6349182128906,
"loss": 0.1499,
"rewards/accuracies": 0.96875,
"rewards/chosen": 2.6020219326019287,
"rewards/margins": 3.0352766513824463,
"rewards/rejected": -0.4332546293735504,
"step": 720
},
{
"epoch": 1.150455480458419,
"grad_norm": 17.791542053222656,
"learning_rate": 7.538393907259448e-07,
"logits/chosen": -3.0315895080566406,
"logits/rejected": -2.9430055618286133,
"logps/chosen": -468.55157470703125,
"logps/rejected": -401.8276062011719,
"loss": 0.1605,
"rewards/accuracies": 0.956250011920929,
"rewards/chosen": 2.554004192352295,
"rewards/margins": 3.0603597164154053,
"rewards/rejected": -0.5063558220863342,
"step": 735
},
{
"epoch": 1.150455480458419,
"eval_logits/chosen": -3.0718164443969727,
"eval_logits/rejected": -2.971501350402832,
"eval_logps/chosen": -444.8257751464844,
"eval_logps/rejected": -372.25592041015625,
"eval_loss": 0.4678542912006378,
"eval_rewards/accuracies": 0.7805994749069214,
"eval_rewards/chosen": 1.622782588005066,
"eval_rewards/margins": 1.5398544073104858,
"eval_rewards/rejected": 0.08292820304632187,
"eval_runtime": 183.688,
"eval_samples_per_second": 13.077,
"eval_steps_per_second": 6.538,
"step": 735
},
{
"epoch": 1.173964149280047,
"grad_norm": 23.560726165771484,
"learning_rate": 7.422622548635244e-07,
"logits/chosen": -3.096224546432495,
"logits/rejected": -2.9745876789093018,
"logps/chosen": -450.9057922363281,
"logps/rejected": -399.2366027832031,
"loss": 0.143,
"rewards/accuracies": 0.9645833373069763,
"rewards/chosen": 2.4323058128356934,
"rewards/margins": 3.095184087753296,
"rewards/rejected": -0.6628779172897339,
"step": 750
},
{
"epoch": 1.197472818101675,
"grad_norm": 23.054336547851562,
"learning_rate": 7.305128253877195e-07,
"logits/chosen": -3.073312997817993,
"logits/rejected": -2.927847146987915,
"logps/chosen": -423.4072265625,
"logps/rejected": -385.5615234375,
"loss": 0.1675,
"rewards/accuracies": 0.949999988079071,
"rewards/chosen": 2.300083875656128,
"rewards/margins": 2.8607194423675537,
"rewards/rejected": -0.5606356859207153,
"step": 765
},
{
"epoch": 1.2053090410422176,
"eval_logits/chosen": -3.0651752948760986,
"eval_logits/rejected": -2.966801643371582,
"eval_logps/chosen": -443.92303466796875,
"eval_logps/rejected": -371.2677307128906,
"eval_loss": 0.4661538600921631,
"eval_rewards/accuracies": 0.7814321517944336,
"eval_rewards/chosen": 1.7130577564239502,
"eval_rewards/margins": 1.531309962272644,
"eval_rewards/rejected": 0.18174783885478973,
"eval_runtime": 184.0722,
"eval_samples_per_second": 13.049,
"eval_steps_per_second": 6.525,
"step": 770
},
{
"epoch": 1.2209814869233029,
"grad_norm": 50.852630615234375,
"learning_rate": 7.185994583326165e-07,
"logits/chosen": -3.0307400226593018,
"logits/rejected": -2.9518849849700928,
"logps/chosen": -470.7020263671875,
"logps/rejected": -412.01263427734375,
"loss": 0.1485,
"rewards/accuracies": 0.9604166746139526,
"rewards/chosen": 2.443692445755005,
"rewards/margins": 3.001075267791748,
"rewards/rejected": -0.5573827624320984,
"step": 780
},
{
"epoch": 1.244490155744931,
"grad_norm": 32.02826690673828,
"learning_rate": 7.065306263224742e-07,
"logits/chosen": -3.034208059310913,
"logits/rejected": -2.946662187576294,
"logps/chosen": -452.17510986328125,
"logps/rejected": -378.6875915527344,
"loss": 0.1404,
"rewards/accuracies": 0.9729166626930237,
"rewards/chosen": 2.499049186706543,
"rewards/margins": 3.009442090988159,
"rewards/rejected": -0.5103930234909058,
"step": 795
},
{
"epoch": 1.2601626016260163,
"eval_logits/chosen": -3.055967092514038,
"eval_logits/rejected": -2.959458112716675,
"eval_logps/chosen": -442.50604248046875,
"eval_logps/rejected": -370.1313171386719,
"eval_loss": 0.4701775014400482,
"eval_rewards/accuracies": 0.7810158133506775,
"eval_rewards/chosen": 1.854756236076355,
"eval_rewards/margins": 1.5593678951263428,
"eval_rewards/rejected": 0.29538866877555847,
"eval_runtime": 183.9893,
"eval_samples_per_second": 13.055,
"eval_steps_per_second": 6.528,
"step": 805
},
{
"epoch": 1.267998824566559,
"grad_norm": 19.781421661376953,
"learning_rate": 6.94314912546108e-07,
"logits/chosen": -3.0934197902679443,
"logits/rejected": -2.943648338317871,
"logps/chosen": -434.4991455078125,
"logps/rejected": -383.34942626953125,
"loss": 0.1514,
"rewards/accuracies": 0.9666666388511658,
"rewards/chosen": 2.4978482723236084,
"rewards/margins": 2.9856154918670654,
"rewards/rejected": -0.4877675473690033,
"step": 810
},
{
"epoch": 1.291507493388187,
"grad_norm": 21.01584243774414,
"learning_rate": 6.819610046526436e-07,
"logits/chosen": -3.031203269958496,
"logits/rejected": -2.900461435317993,
"logps/chosen": -447.2250061035156,
"logps/rejected": -378.15765380859375,
"loss": 0.15,
"rewards/accuracies": 0.9624999761581421,
"rewards/chosen": 2.589458703994751,
"rewards/margins": 3.081743001937866,
"rewards/rejected": -0.4922843277454376,
"step": 825
},
{
"epoch": 1.3150161622098149,
"grad_norm": 23.983322143554688,
"learning_rate": 6.694776885729787e-07,
"logits/chosen": -3.047663450241089,
"logits/rejected": -2.9616012573242188,
"logps/chosen": -425.3288879394531,
"logps/rejected": -374.11883544921875,
"loss": 0.1566,
"rewards/accuracies": 0.9624999761581421,
"rewards/chosen": 2.436234474182129,
"rewards/margins": 2.96016526222229,
"rewards/rejected": -0.5239306688308716,
"step": 840
},
{
"epoch": 1.3150161622098149,
"eval_logits/chosen": -3.0929863452911377,
"eval_logits/rejected": -3.001952886581421,
"eval_logps/chosen": -444.5914306640625,
"eval_logps/rejected": -372.7008056640625,
"eval_loss": 0.4728166460990906,
"eval_rewards/accuracies": 0.7735220789909363,
"eval_rewards/chosen": 1.6462178230285645,
"eval_rewards/margins": 1.607776403427124,
"eval_rewards/rejected": 0.038441285490989685,
"eval_runtime": 184.5266,
"eval_samples_per_second": 13.017,
"eval_steps_per_second": 6.509,
"step": 840
},
{
"epoch": 1.3385248310314428,
"grad_norm": 32.3392333984375,
"learning_rate": 6.568738422713492e-07,
"logits/chosen": -3.1332592964172363,
"logits/rejected": -2.9946446418762207,
"logps/chosen": -440.1960144042969,
"logps/rejected": -392.2298889160156,
"loss": 0.138,
"rewards/accuracies": 0.9624999761581421,
"rewards/chosen": 2.451441764831543,
"rewards/margins": 3.202233076095581,
"rewards/rejected": -0.7507913112640381,
"step": 855
},
{
"epoch": 1.3620334998530708,
"grad_norm": 40.718143463134766,
"learning_rate": 6.441584294314419e-07,
"logits/chosen": -3.103970766067505,
"logits/rejected": -2.995086908340454,
"logps/chosen": -446.1394348144531,
"logps/rejected": -397.54803466796875,
"loss": 0.1807,
"rewards/accuracies": 0.9416666626930237,
"rewards/chosen": 2.3909621238708496,
"rewards/margins": 3.009140968322754,
"rewards/rejected": -0.6181787848472595,
"step": 870
},
{
"epoch": 1.3698697227936134,
"eval_logits/chosen": -3.075275421142578,
"eval_logits/rejected": -2.984144687652588,
"eval_logps/chosen": -444.3154602050781,
"eval_logps/rejected": -372.4288024902344,
"eval_loss": 0.4710211455821991,
"eval_rewards/accuracies": 0.7805994749069214,
"eval_rewards/chosen": 1.673814296722412,
"eval_rewards/margins": 1.6081753969192505,
"eval_rewards/rejected": 0.06563897430896759,
"eval_runtime": 184.2436,
"eval_samples_per_second": 13.037,
"eval_steps_per_second": 6.519,
"step": 875
},
{
"epoch": 1.3855421686746987,
"grad_norm": 26.928159713745117,
"learning_rate": 6.313404930815452e-07,
"logits/chosen": -3.0152738094329834,
"logits/rejected": -2.924572467803955,
"logps/chosen": -438.9689025878906,
"logps/rejected": -378.1722717285156,
"loss": 0.1487,
"rewards/accuracies": 0.9624999761581421,
"rewards/chosen": 2.390946865081787,
"rewards/margins": 3.0917012691497803,
"rewards/rejected": -0.7007540464401245,
"step": 885
},
{
"epoch": 1.4090508374963266,
"grad_norm": 22.164506912231445,
"learning_rate": 6.184291491632694e-07,
"logits/chosen": -3.013108730316162,
"logits/rejected": -2.856964349746704,
"logps/chosen": -420.7685241699219,
"logps/rejected": -373.77935791015625,
"loss": 0.1509,
"rewards/accuracies": 0.9624999761581421,
"rewards/chosen": 2.381741523742676,
"rewards/margins": 3.0351641178131104,
"rewards/rejected": -0.6534225940704346,
"step": 900
},
{
"epoch": 1.4247232833774122,
"eval_logits/chosen": -3.095111846923828,
"eval_logits/rejected": -3.007040500640869,
"eval_logps/chosen": -444.8636474609375,
"eval_logps/rejected": -373.3858642578125,
"eval_loss": 0.4735547602176666,
"eval_rewards/accuracies": 0.7810158133506775,
"eval_rewards/chosen": 1.618994116783142,
"eval_rewards/margins": 1.649065613746643,
"eval_rewards/rejected": -0.030071496963500977,
"eval_runtime": 186.2704,
"eval_samples_per_second": 12.895,
"eval_steps_per_second": 6.448,
"step": 910
},
{
"epoch": 1.4325595063179548,
"grad_norm": 42.56847381591797,
"learning_rate": 6.054335800484152e-07,
"logits/chosen": -3.132779836654663,
"logits/rejected": -2.9779021739959717,
"logps/chosen": -460.9392395019531,
"logps/rejected": -412.65423583984375,
"loss": 0.1386,
"rewards/accuracies": 0.956250011920929,
"rewards/chosen": 2.6274330615997314,
"rewards/margins": 3.321784019470215,
"rewards/rejected": -0.694351077079773,
"step": 915
}
],
"logging_steps": 15,
"max_steps": 1917,
"num_input_tokens_seen": 0,
"num_train_epochs": 3,
"save_steps": 40,
"stateful_callbacks": {
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": true,
"should_training_stop": false
},
"attributes": {}
}
},
"total_flos": 0.0,
"train_batch_size": 2,
"trial_name": null,
"trial_params": null
}