PEFT
Safetensors
task1add3-200 / trainer_state.json
windgrin's picture
Upload folder using huggingface_hub
e718910 verified
Raw
History Blame Contribute Delete
129 kB
{
"best_global_step": null,
"best_metric": null,
"best_model_checkpoint": null,
"epoch": 1.198720361309748,
"eval_steps": 300,
"global_step": 200,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"epoch": 0.0060218291305984195,
"grad_norm": 7.15871000289917,
"learning_rate": 1.1764705882352942e-05,
"logits/chosen": -0.32459306716918945,
"logits/rejected": -0.5000401735305786,
"logps/chosen": -3.3705074787139893,
"logps/rejected": -19.54801368713379,
"loss": 1.1142030954360962,
"memory(GiB)": 46.13,
"nll_loss": 0.4210559129714966,
"rewards/accuracies": 0.0,
"rewards/chosen": 0.0,
"rewards/margins": 0.0,
"rewards/rejected": 0.0,
"step": 1,
"train_speed(iter/s)": 0.005428
},
{
"epoch": 0.012043658261196839,
"grad_norm": 6.311911106109619,
"learning_rate": 2.3529411764705884e-05,
"logits/chosen": -0.41802966594696045,
"logits/rejected": -0.5096024870872498,
"logps/chosen": -8.828028678894043,
"logps/rejected": -13.557395935058594,
"loss": 1.4290869235992432,
"memory(GiB)": 46.13,
"nll_loss": 0.7359397411346436,
"rewards/accuracies": 0.0,
"rewards/chosen": 0.0,
"rewards/margins": 0.0,
"rewards/rejected": 0.0,
"step": 2,
"train_speed(iter/s)": 0.005545
},
{
"epoch": 0.018065487391795258,
"grad_norm": 6.693342685699463,
"learning_rate": 3.529411764705883e-05,
"logits/chosen": -0.3694347143173218,
"logits/rejected": -0.4798021912574768,
"logps/chosen": -6.542965412139893,
"logps/rejected": -17.62507438659668,
"loss": 1.2220425605773926,
"memory(GiB)": 46.13,
"nll_loss": 0.5347560048103333,
"rewards/accuracies": 0.734375,
"rewards/chosen": 0.007337508723139763,
"rewards/margins": 0.011953208595514297,
"rewards/rejected": -0.004615699406713247,
"step": 3,
"train_speed(iter/s)": 0.005572
},
{
"epoch": 0.024087316522393678,
"grad_norm": 4.8458251953125,
"learning_rate": 4.705882352941177e-05,
"logits/chosen": -0.36237555742263794,
"logits/rejected": -0.5201014280319214,
"logps/chosen": -5.53680944442749,
"logps/rejected": -16.475929260253906,
"loss": 1.2521781921386719,
"memory(GiB)": 46.13,
"nll_loss": 0.579364538192749,
"rewards/accuracies": 0.734375,
"rewards/chosen": 0.01270484272390604,
"rewards/margins": 0.04416074603796005,
"rewards/rejected": -0.03145590424537659,
"step": 4,
"train_speed(iter/s)": 0.005594
},
{
"epoch": 0.030109145652992095,
"grad_norm": 3.684136152267456,
"learning_rate": 5.882352941176471e-05,
"logits/chosen": -0.3457816541194916,
"logits/rejected": -0.48865967988967896,
"logps/chosen": -4.437034606933594,
"logps/rejected": -20.260162353515625,
"loss": 0.9991621375083923,
"memory(GiB)": 46.13,
"nll_loss": 0.38671040534973145,
"rewards/accuracies": 0.734375,
"rewards/chosen": 0.002155877649784088,
"rewards/margins": 0.2208954095840454,
"rewards/rejected": -0.21873953938484192,
"step": 5,
"train_speed(iter/s)": 0.005606
},
{
"epoch": 0.036130974783590515,
"grad_norm": 6.8094706535339355,
"learning_rate": 7.058823529411765e-05,
"logits/chosen": -0.37496131658554077,
"logits/rejected": -0.499918133020401,
"logps/chosen": -5.312520980834961,
"logps/rejected": -18.596221923828125,
"loss": 1.1320774555206299,
"memory(GiB)": 46.13,
"nll_loss": 0.5494582056999207,
"rewards/accuracies": 0.75,
"rewards/chosen": -0.11241161823272705,
"rewards/margins": 0.37036794424057007,
"rewards/rejected": -0.4827795624732971,
"step": 6,
"train_speed(iter/s)": 0.005617
},
{
"epoch": 0.042152803914188935,
"grad_norm": 6.563366889953613,
"learning_rate": 8.23529411764706e-05,
"logits/chosen": -0.3803170323371887,
"logits/rejected": -0.43647128343582153,
"logps/chosen": -12.155686378479004,
"logps/rejected": -19.252357482910156,
"loss": 1.275801420211792,
"memory(GiB)": 46.13,
"nll_loss": 0.6294467449188232,
"rewards/accuracies": 0.609375,
"rewards/chosen": -0.2581723928451538,
"rewards/margins": 0.26009732484817505,
"rewards/rejected": -0.5182697176933289,
"step": 7,
"train_speed(iter/s)": 0.005615
},
{
"epoch": 0.048174633044787356,
"grad_norm": 5.275461673736572,
"learning_rate": 9.411764705882353e-05,
"logits/chosen": -0.30787912011146545,
"logits/rejected": -0.420376718044281,
"logps/chosen": -7.271793842315674,
"logps/rejected": -17.376087188720703,
"loss": 1.2506061792373657,
"memory(GiB)": 46.13,
"nll_loss": 0.6039291024208069,
"rewards/accuracies": 0.609375,
"rewards/chosen": -0.07998734712600708,
"rewards/margins": 0.2555825710296631,
"rewards/rejected": -0.3355698883533478,
"step": 8,
"train_speed(iter/s)": 0.005615
},
{
"epoch": 0.054196462175385776,
"grad_norm": 3.0540287494659424,
"learning_rate": 0.00010588235294117647,
"logits/chosen": -0.30379173159599304,
"logits/rejected": -0.41216912865638733,
"logps/chosen": -6.820768356323242,
"logps/rejected": -16.3853816986084,
"loss": 1.1634117364883423,
"memory(GiB)": 46.13,
"nll_loss": 0.5367689728736877,
"rewards/accuracies": 0.65625,
"rewards/chosen": 0.04989926144480705,
"rewards/margins": 0.1963551640510559,
"rewards/rejected": -0.14645591378211975,
"step": 9,
"train_speed(iter/s)": 0.005615
},
{
"epoch": 0.06021829130598419,
"grad_norm": 2.3425395488739014,
"learning_rate": 0.00011764705882352942,
"logits/chosen": -0.3369804918766022,
"logits/rejected": -0.4523884356021881,
"logps/chosen": -7.222663402557373,
"logps/rejected": -17.98470687866211,
"loss": 1.0803574323654175,
"memory(GiB)": 46.13,
"nll_loss": 0.4635474979877472,
"rewards/accuracies": 0.75,
"rewards/chosen": 0.0936385914683342,
"rewards/margins": 0.19075465202331543,
"rewards/rejected": -0.09711606800556183,
"step": 10,
"train_speed(iter/s)": 0.005616
},
{
"epoch": 0.06624012043658262,
"grad_norm": 2.2927637100219727,
"learning_rate": 0.00012941176470588237,
"logits/chosen": -0.37337860465049744,
"logits/rejected": -0.4716382920742035,
"logps/chosen": -8.593006134033203,
"logps/rejected": -17.979745864868164,
"loss": 1.1164621114730835,
"memory(GiB)": 46.13,
"nll_loss": 0.49796244502067566,
"rewards/accuracies": 0.625,
"rewards/chosen": 0.06070924177765846,
"rewards/margins": 0.19886666536331177,
"rewards/rejected": -0.1381574273109436,
"step": 11,
"train_speed(iter/s)": 0.005619
},
{
"epoch": 0.07226194956718103,
"grad_norm": 2.380297899246216,
"learning_rate": 0.0001411764705882353,
"logits/chosen": -0.4056618809700012,
"logits/rejected": -0.47582757472991943,
"logps/chosen": -7.429853916168213,
"logps/rejected": -16.317821502685547,
"loss": 1.167059302330017,
"memory(GiB)": 46.13,
"nll_loss": 0.5555555820465088,
"rewards/accuracies": 0.65625,
"rewards/chosen": -0.0010902846697717905,
"rewards/margins": 0.21717122197151184,
"rewards/rejected": -0.2182615101337433,
"step": 12,
"train_speed(iter/s)": 0.005622
},
{
"epoch": 0.07828377869777944,
"grad_norm": 1.7392877340316772,
"learning_rate": 0.00015294117647058822,
"logits/chosen": -0.4110736846923828,
"logits/rejected": -0.4770917296409607,
"logps/chosen": -8.422821044921875,
"logps/rejected": -16.356956481933594,
"loss": 1.1002569198608398,
"memory(GiB)": 46.13,
"nll_loss": 0.5357962250709534,
"rewards/accuracies": 0.796875,
"rewards/chosen": 0.12992499768733978,
"rewards/margins": 0.3372637927532196,
"rewards/rejected": -0.20733879506587982,
"step": 13,
"train_speed(iter/s)": 0.005625
},
{
"epoch": 0.08430560782837787,
"grad_norm": 5.562183856964111,
"learning_rate": 0.0001647058823529412,
"logits/chosen": -0.32676243782043457,
"logits/rejected": -0.4272843599319458,
"logps/chosen": -8.393424034118652,
"logps/rejected": -19.974212646484375,
"loss": 1.156798005104065,
"memory(GiB)": 46.13,
"nll_loss": 0.6415989995002747,
"rewards/accuracies": 0.78125,
"rewards/chosen": -0.03989575803279877,
"rewards/margins": 0.5587274432182312,
"rewards/rejected": -0.5986231565475464,
"step": 14,
"train_speed(iter/s)": 0.005627
},
{
"epoch": 0.09032743695897628,
"grad_norm": 3.5578579902648926,
"learning_rate": 0.00017647058823529413,
"logits/chosen": -0.36884137988090515,
"logits/rejected": -0.47317999601364136,
"logps/chosen": -6.998829364776611,
"logps/rejected": -18.39483642578125,
"loss": 1.265438199043274,
"memory(GiB)": 46.13,
"nll_loss": 0.7606177926063538,
"rewards/accuracies": 0.859375,
"rewards/chosen": 0.002129599452018738,
"rewards/margins": 0.5497386455535889,
"rewards/rejected": -0.5476090908050537,
"step": 15,
"train_speed(iter/s)": 0.00563
},
{
"epoch": 0.09634926608957471,
"grad_norm": 3.6414742469787598,
"learning_rate": 0.00018823529411764707,
"logits/chosen": -0.3789006471633911,
"logits/rejected": -0.4743453860282898,
"logps/chosen": -6.895637512207031,
"logps/rejected": -20.256675720214844,
"loss": 1.064023494720459,
"memory(GiB)": 46.13,
"nll_loss": 0.5308047533035278,
"rewards/accuracies": 0.8125,
"rewards/chosen": 0.055957891047000885,
"rewards/margins": 0.40152865648269653,
"rewards/rejected": -0.34557074308395386,
"step": 16,
"train_speed(iter/s)": 0.005632
},
{
"epoch": 0.10237109522017313,
"grad_norm": 3.263599157333374,
"learning_rate": 0.0002,
"logits/chosen": -0.28460752964019775,
"logits/rejected": -0.42314791679382324,
"logps/chosen": -5.295862197875977,
"logps/rejected": -21.666519165039062,
"loss": 0.9750788807868958,
"memory(GiB)": 46.13,
"nll_loss": 0.5031211376190186,
"rewards/accuracies": 0.90625,
"rewards/chosen": 0.08322687447071075,
"rewards/margins": 0.5906113386154175,
"rewards/rejected": -0.5073844194412231,
"step": 17,
"train_speed(iter/s)": 0.005633
},
{
"epoch": 0.10839292435077155,
"grad_norm": 2.0240275859832764,
"learning_rate": 0.00019999502669559432,
"logits/chosen": -0.3283552825450897,
"logits/rejected": -0.40596985816955566,
"logps/chosen": -6.424624919891357,
"logps/rejected": -17.71906852722168,
"loss": 0.9781989455223083,
"memory(GiB)": 46.13,
"nll_loss": 0.47217291593551636,
"rewards/accuracies": 0.796875,
"rewards/chosen": -0.0207663644105196,
"rewards/margins": 0.5476341247558594,
"rewards/rejected": -0.568400502204895,
"step": 18,
"train_speed(iter/s)": 0.005634
},
{
"epoch": 0.11441475348136997,
"grad_norm": 1.682889699935913,
"learning_rate": 0.00019998010727705236,
"logits/chosen": -0.2821420729160309,
"logits/rejected": -0.38918256759643555,
"logps/chosen": -5.882609844207764,
"logps/rejected": -20.25113296508789,
"loss": 0.9472936391830444,
"memory(GiB)": 46.13,
"nll_loss": 0.4797293543815613,
"rewards/accuracies": 0.78125,
"rewards/chosen": 0.06502628326416016,
"rewards/margins": 0.6772950291633606,
"rewards/rejected": -0.6122686862945557,
"step": 19,
"train_speed(iter/s)": 0.005633
},
{
"epoch": 0.12043658261196838,
"grad_norm": 2.9386143684387207,
"learning_rate": 0.00019995524322835034,
"logits/chosen": -0.2649421691894531,
"logits/rejected": -0.34010952711105347,
"logps/chosen": -10.95669174194336,
"logps/rejected": -24.044157028198242,
"loss": 1.1134816408157349,
"memory(GiB)": 46.13,
"nll_loss": 0.546178936958313,
"rewards/accuracies": 0.796875,
"rewards/chosen": -0.18016880750656128,
"rewards/margins": 0.5494988560676575,
"rewards/rejected": -0.729667603969574,
"step": 20,
"train_speed(iter/s)": 0.00563
},
{
"epoch": 0.1264584117425668,
"grad_norm": 1.6700323820114136,
"learning_rate": 0.00019992043702261793,
"logits/chosen": -0.2561277151107788,
"logits/rejected": -0.3126121163368225,
"logps/chosen": -6.485073566436768,
"logps/rejected": -19.772449493408203,
"loss": 0.9205772876739502,
"memory(GiB)": 46.13,
"nll_loss": 0.42214635014533997,
"rewards/accuracies": 0.765625,
"rewards/chosen": -0.0028960183262825012,
"rewards/margins": 0.6638913750648499,
"rewards/rejected": -0.6667873859405518,
"step": 21,
"train_speed(iter/s)": 0.00563
},
{
"epoch": 0.13248024087316523,
"grad_norm": 2.0114383697509766,
"learning_rate": 0.00019987569212189224,
"logits/chosen": -0.2601704001426697,
"logits/rejected": -0.3789623975753784,
"logps/chosen": -6.645152568817139,
"logps/rejected": -21.876020431518555,
"loss": 1.1017377376556396,
"memory(GiB)": 46.13,
"nll_loss": 0.6103405356407166,
"rewards/accuracies": 0.828125,
"rewards/chosen": 0.04465393349528313,
"rewards/margins": 0.6134660840034485,
"rewards/rejected": -0.5688121318817139,
"step": 22,
"train_speed(iter/s)": 0.005629
},
{
"epoch": 0.13850207000376363,
"grad_norm": 3.031888961791992,
"learning_rate": 0.0001998210129767735,
"logits/chosen": -0.26405903697013855,
"logits/rejected": -0.3669392466545105,
"logps/chosen": -6.921745300292969,
"logps/rejected": -21.70663070678711,
"loss": 0.9795225858688354,
"memory(GiB)": 46.13,
"nll_loss": 0.4959058463573456,
"rewards/accuracies": 0.796875,
"rewards/chosen": 0.10062012821435928,
"rewards/margins": 0.6365569829940796,
"rewards/rejected": -0.5359368324279785,
"step": 23,
"train_speed(iter/s)": 0.005629
},
{
"epoch": 0.14452389913436206,
"grad_norm": 2.15742564201355,
"learning_rate": 0.00019975640502598244,
"logits/chosen": -0.2354922890663147,
"logits/rejected": -0.36152032017707825,
"logps/chosen": -4.718395709991455,
"logps/rejected": -24.57033348083496,
"loss": 0.7706338763237,
"memory(GiB)": 46.13,
"nll_loss": 0.3560357987880707,
"rewards/accuracies": 0.84375,
"rewards/chosen": 0.09812817722558975,
"rewards/margins": 0.9238024950027466,
"rewards/rejected": -0.825674295425415,
"step": 24,
"train_speed(iter/s)": 0.005629
},
{
"epoch": 0.1505457282649605,
"grad_norm": 3.1512320041656494,
"learning_rate": 0.0001996818746958191,
"logits/chosen": -0.21456243097782135,
"logits/rejected": -0.34130796790122986,
"logps/chosen": -6.996722221374512,
"logps/rejected": -30.622554779052734,
"loss": 0.8399394750595093,
"memory(GiB)": 46.13,
"nll_loss": 0.49700063467025757,
"rewards/accuracies": 0.84375,
"rewards/chosen": -0.024456650018692017,
"rewards/margins": 1.4392318725585938,
"rewards/rejected": -1.4636887311935425,
"step": 25,
"train_speed(iter/s)": 0.005628
},
{
"epoch": 0.1565675573955589,
"grad_norm": 2.9886889457702637,
"learning_rate": 0.00019959742939952392,
"logits/chosen": -0.2622988224029541,
"logits/rejected": -0.3251183331012726,
"logps/chosen": -12.495084762573242,
"logps/rejected": -25.176090240478516,
"loss": 1.1550263166427612,
"memory(GiB)": 46.13,
"nll_loss": 0.7094165086746216,
"rewards/accuracies": 0.8125,
"rewards/chosen": -0.19754531979560852,
"rewards/margins": 1.1228585243225098,
"rewards/rejected": -1.3204039335250854,
"step": 26,
"train_speed(iter/s)": 0.00563
},
{
"epoch": 0.16258938652615731,
"grad_norm": 2.7348685264587402,
"learning_rate": 0.00019950307753654017,
"logits/chosen": -0.23797279596328735,
"logits/rejected": -0.3161388337612152,
"logps/chosen": -8.345640182495117,
"logps/rejected": -24.480266571044922,
"loss": 1.0113354921340942,
"memory(GiB)": 46.13,
"nll_loss": 0.5643945336341858,
"rewards/accuracies": 0.859375,
"rewards/chosen": 0.05142675340175629,
"rewards/margins": 1.0910050868988037,
"rewards/rejected": -1.0395784378051758,
"step": 27,
"train_speed(iter/s)": 0.00563
},
{
"epoch": 0.16861121565675574,
"grad_norm": 3.4209959506988525,
"learning_rate": 0.00019939882849167852,
"logits/chosen": -0.2834317684173584,
"logits/rejected": -0.4013361930847168,
"logps/chosen": -6.27006196975708,
"logps/rejected": -23.9411678314209,
"loss": 0.9620530605316162,
"memory(GiB)": 46.13,
"nll_loss": 0.5452341437339783,
"rewards/accuracies": 0.84375,
"rewards/chosen": 0.08509417623281479,
"rewards/margins": 1.0887510776519775,
"rewards/rejected": -1.0036569833755493,
"step": 28,
"train_speed(iter/s)": 0.005632
},
{
"epoch": 0.17463304478735417,
"grad_norm": 3.021099805831909,
"learning_rate": 0.00019928469263418374,
"logits/chosen": -0.29641368985176086,
"logits/rejected": -0.3944772779941559,
"logps/chosen": -6.065124988555908,
"logps/rejected": -19.367380142211914,
"loss": 0.8545750379562378,
"memory(GiB)": 46.13,
"nll_loss": 0.3696524500846863,
"rewards/accuracies": 0.859375,
"rewards/chosen": -0.008128602989017963,
"rewards/margins": 0.7214774489402771,
"rewards/rejected": -0.729606032371521,
"step": 29,
"train_speed(iter/s)": 0.005633
},
{
"epoch": 0.18065487391795257,
"grad_norm": 2.237170457839966,
"learning_rate": 0.00019916068131670302,
"logits/chosen": -0.2665432393550873,
"logits/rejected": -0.41999131441116333,
"logps/chosen": -3.6829960346221924,
"logps/rejected": -24.998981475830078,
"loss": 0.7719818353652954,
"memory(GiB)": 46.13,
"nll_loss": 0.3786780834197998,
"rewards/accuracies": 0.890625,
"rewards/chosen": 0.15382343530654907,
"rewards/margins": 1.0922845602035522,
"rewards/rejected": -0.9384610652923584,
"step": 30,
"train_speed(iter/s)": 0.005633
},
{
"epoch": 0.186676703048551,
"grad_norm": 2.299628496170044,
"learning_rate": 0.00019902680687415705,
"logits/chosen": -0.33755987882614136,
"logits/rejected": -0.37323832511901855,
"logps/chosen": -11.234481811523438,
"logps/rejected": -24.92943000793457,
"loss": 1.0785183906555176,
"memory(GiB)": 46.13,
"nll_loss": 0.6123806834220886,
"rewards/accuracies": 0.765625,
"rewards/chosen": 0.03546600416302681,
"rewards/margins": 0.9260610342025757,
"rewards/rejected": -0.890595018863678,
"step": 31,
"train_speed(iter/s)": 0.005633
},
{
"epoch": 0.19269853217914942,
"grad_norm": 2.0755157470703125,
"learning_rate": 0.00019888308262251285,
"logits/chosen": -0.2504952847957611,
"logits/rejected": -0.3852018713951111,
"logps/chosen": -5.893071174621582,
"logps/rejected": -33.010154724121094,
"loss": 0.7333768010139465,
"memory(GiB)": 46.13,
"nll_loss": 0.4039708375930786,
"rewards/accuracies": 0.859375,
"rewards/chosen": -0.07270973920822144,
"rewards/margins": 1.7266591787338257,
"rewards/rejected": -1.7993686199188232,
"step": 32,
"train_speed(iter/s)": 0.005634
},
{
"epoch": 0.19872036130974782,
"grad_norm": 3.686795711517334,
"learning_rate": 0.00019872952285745959,
"logits/chosen": -0.30149099230766296,
"logits/rejected": -0.4157900810241699,
"logps/chosen": -7.993706703186035,
"logps/rejected": -27.117816925048828,
"loss": 1.0753562450408936,
"memory(GiB)": 46.13,
"nll_loss": 0.6016828417778015,
"rewards/accuracies": 0.796875,
"rewards/chosen": -0.10546419769525528,
"rewards/margins": 1.0370161533355713,
"rewards/rejected": -1.1424803733825684,
"step": 33,
"train_speed(iter/s)": 0.005634
},
{
"epoch": 0.20474219044034625,
"grad_norm": 3.085048198699951,
"learning_rate": 0.0001985661428529863,
"logits/chosen": -0.31711238622665405,
"logits/rejected": -0.41008925437927246,
"logps/chosen": -6.8641557693481445,
"logps/rejected": -27.393281936645508,
"loss": 1.054256558418274,
"memory(GiB)": 46.13,
"nll_loss": 0.6109166741371155,
"rewards/accuracies": 0.765625,
"rewards/chosen": -0.06303416192531586,
"rewards/margins": 1.1662019491195679,
"rewards/rejected": -1.229236125946045,
"step": 34,
"train_speed(iter/s)": 0.005634
},
{
"epoch": 0.21076401957094468,
"grad_norm": 1.7560195922851562,
"learning_rate": 0.00019839295885986296,
"logits/chosen": -0.337604820728302,
"logits/rejected": -0.39799487590789795,
"logps/chosen": -6.864170551300049,
"logps/rejected": -20.806344985961914,
"loss": 0.9619123339653015,
"memory(GiB)": 46.13,
"nll_loss": 0.48513123393058777,
"rewards/accuracies": 0.828125,
"rewards/chosen": 0.10183387249708176,
"rewards/margins": 0.7188172340393066,
"rewards/rejected": -0.6169832944869995,
"step": 35,
"train_speed(iter/s)": 0.005634
},
{
"epoch": 0.2167858487015431,
"grad_norm": 2.6364471912384033,
"learning_rate": 0.0001982099881040239,
"logits/chosen": -0.36966580152511597,
"logits/rejected": -0.43631935119628906,
"logps/chosen": -6.647594451904297,
"logps/rejected": -21.291913986206055,
"loss": 0.9380239844322205,
"memory(GiB)": 46.13,
"nll_loss": 0.4613775312900543,
"rewards/accuracies": 0.78125,
"rewards/chosen": 0.06358329951763153,
"rewards/margins": 0.7893975973129272,
"rewards/rejected": -0.7258143424987793,
"step": 36,
"train_speed(iter/s)": 0.005634
},
{
"epoch": 0.2228076778321415,
"grad_norm": 2.354177474975586,
"learning_rate": 0.00019801724878485438,
"logits/chosen": -0.36403897404670715,
"logits/rejected": -0.45796939730644226,
"logps/chosen": -5.62083625793457,
"logps/rejected": -23.648834228515625,
"loss": 0.9243438243865967,
"memory(GiB)": 46.13,
"nll_loss": 0.46970799565315247,
"rewards/accuracies": 0.828125,
"rewards/chosen": 0.06422886252403259,
"rewards/margins": 0.8610265851020813,
"rewards/rejected": -0.7967977523803711,
"step": 37,
"train_speed(iter/s)": 0.005634
},
{
"epoch": 0.22882950696273993,
"grad_norm": 2.2988836765289307,
"learning_rate": 0.00019781476007338058,
"logits/chosen": -0.3704385459423065,
"logits/rejected": -0.47973009943962097,
"logps/chosen": -4.231719017028809,
"logps/rejected": -20.56240463256836,
"loss": 0.916353702545166,
"memory(GiB)": 46.13,
"nll_loss": 0.4209356904029846,
"rewards/accuracies": 0.859375,
"rewards/chosen": 0.06186368316411972,
"rewards/margins": 0.7635293006896973,
"rewards/rejected": -0.7016656398773193,
"step": 38,
"train_speed(iter/s)": 0.005635
},
{
"epoch": 0.23485133609333836,
"grad_norm": 2.009106397628784,
"learning_rate": 0.00019760254211036244,
"logits/chosen": -0.3372359573841095,
"logits/rejected": -0.453107088804245,
"logps/chosen": -5.785426616668701,
"logps/rejected": -23.19124412536621,
"loss": 0.9124959707260132,
"memory(GiB)": 46.13,
"nll_loss": 0.44838690757751465,
"rewards/accuracies": 0.859375,
"rewards/chosen": 0.04832564294338226,
"rewards/margins": 0.937610387802124,
"rewards/rejected": -0.8892846703529358,
"step": 39,
"train_speed(iter/s)": 0.005635
},
{
"epoch": 0.24087316522393676,
"grad_norm": 2.5412213802337646,
"learning_rate": 0.00019738061600429064,
"logits/chosen": -0.39427676796913147,
"logits/rejected": -0.48203372955322266,
"logps/chosen": -5.785412311553955,
"logps/rejected": -19.031665802001953,
"loss": 0.9683349132537842,
"memory(GiB)": 46.13,
"nll_loss": 0.5110080242156982,
"rewards/accuracies": 0.84375,
"rewards/chosen": 0.022132933139801025,
"rewards/margins": 0.8074027299880981,
"rewards/rejected": -0.7852697372436523,
"step": 40,
"train_speed(iter/s)": 0.005637
},
{
"epoch": 0.24689499435453519,
"grad_norm": 2.0049972534179688,
"learning_rate": 0.00019714900382928675,
"logits/chosen": -0.3044354021549225,
"logits/rejected": -0.41962650418281555,
"logps/chosen": -4.612288475036621,
"logps/rejected": -24.228839874267578,
"loss": 0.8179229497909546,
"memory(GiB)": 46.13,
"nll_loss": 0.4278942048549652,
"rewards/accuracies": 0.8125,
"rewards/chosen": 0.07943032681941986,
"rewards/margins": 1.1561895608901978,
"rewards/rejected": -1.0767593383789062,
"step": 41,
"train_speed(iter/s)": 0.005636
},
{
"epoch": 0.2529168234851336,
"grad_norm": 2.0874667167663574,
"learning_rate": 0.0001969077286229078,
"logits/chosen": -0.2736699879169464,
"logits/rejected": -0.4168338179588318,
"logps/chosen": -7.539179801940918,
"logps/rejected": -30.339994430541992,
"loss": 0.9962757229804993,
"memory(GiB)": 46.13,
"nll_loss": 0.6084927320480347,
"rewards/accuracies": 0.796875,
"rewards/chosen": 0.046928200870752335,
"rewards/margins": 1.4784610271453857,
"rewards/rejected": -1.431532859802246,
"step": 42,
"train_speed(iter/s)": 0.005636
},
{
"epoch": 0.258938652615732,
"grad_norm": 3.2748661041259766,
"learning_rate": 0.00019665681438385473,
"logits/chosen": -0.26249000430107117,
"logits/rejected": -0.3955192565917969,
"logps/chosen": -6.726841449737549,
"logps/rejected": -26.447267532348633,
"loss": 0.9923527836799622,
"memory(GiB)": 46.13,
"nll_loss": 0.5636712312698364,
"rewards/accuracies": 0.859375,
"rewards/chosen": -0.02616805024445057,
"rewards/margins": 1.2797741889953613,
"rewards/rejected": -1.3059422969818115,
"step": 43,
"train_speed(iter/s)": 0.005637
},
{
"epoch": 0.26496048174633047,
"grad_norm": 4.499722957611084,
"learning_rate": 0.00019639628606958533,
"logits/chosen": -0.3380294442176819,
"logits/rejected": -0.4303723871707916,
"logps/chosen": -7.925315856933594,
"logps/rejected": -23.916906356811523,
"loss": 1.136991024017334,
"memory(GiB)": 46.13,
"nll_loss": 0.6508135795593262,
"rewards/accuracies": 0.765625,
"rewards/chosen": -0.1142488494515419,
"rewards/margins": 1.0733367204666138,
"rewards/rejected": -1.1875855922698975,
"step": 44,
"train_speed(iter/s)": 0.005638
},
{
"epoch": 0.27098231087692887,
"grad_norm": 3.695734739303589,
"learning_rate": 0.0001961261695938319,
"logits/chosen": -0.2465212196111679,
"logits/rejected": -0.39715391397476196,
"logps/chosen": -7.8324666023254395,
"logps/rejected": -24.97869110107422,
"loss": 0.9623777270317078,
"memory(GiB)": 46.13,
"nll_loss": 0.5307109951972961,
"rewards/accuracies": 0.828125,
"rewards/chosen": 0.08475106954574585,
"rewards/margins": 0.9390297532081604,
"rewards/rejected": -0.8542786836624146,
"step": 45,
"train_speed(iter/s)": 0.005638
},
{
"epoch": 0.27700414000752727,
"grad_norm": 3.1841602325439453,
"learning_rate": 0.00019584649182402357,
"logits/chosen": -0.22775670886039734,
"logits/rejected": -0.3454330265522003,
"logps/chosen": -6.5436859130859375,
"logps/rejected": -24.402027130126953,
"loss": 1.0284608602523804,
"memory(GiB)": 46.13,
"nll_loss": 0.5513083338737488,
"rewards/accuracies": 0.75,
"rewards/chosen": 0.05229588598012924,
"rewards/margins": 0.9507507085800171,
"rewards/rejected": -0.8984547853469849,
"step": 46,
"train_speed(iter/s)": 0.005637
},
{
"epoch": 0.2830259691381257,
"grad_norm": 2.0325071811676025,
"learning_rate": 0.0001955572805786141,
"logits/chosen": -0.19194024801254272,
"logits/rejected": -0.32474127411842346,
"logps/chosen": -4.646670341491699,
"logps/rejected": -27.415727615356445,
"loss": 0.7930896878242493,
"memory(GiB)": 46.13,
"nll_loss": 0.38733866810798645,
"rewards/accuracies": 0.828125,
"rewards/chosen": 0.11078543961048126,
"rewards/margins": 1.1206859350204468,
"rewards/rejected": -1.009900450706482,
"step": 47,
"train_speed(iter/s)": 0.005637
},
{
"epoch": 0.2890477982687241,
"grad_norm": 2.07770037651062,
"learning_rate": 0.0001952585646243146,
"logits/chosen": -0.25676336884498596,
"logits/rejected": -0.3494555950164795,
"logps/chosen": -7.388433933258057,
"logps/rejected": -23.070579528808594,
"loss": 0.8534475564956665,
"memory(GiB)": 46.13,
"nll_loss": 0.42261388897895813,
"rewards/accuracies": 0.796875,
"rewards/chosen": 0.006194199435412884,
"rewards/margins": 0.9558709859848022,
"rewards/rejected": -0.9496768712997437,
"step": 48,
"train_speed(iter/s)": 0.005637
},
{
"epoch": 0.2950696273993225,
"grad_norm": 1.6862146854400635,
"learning_rate": 0.00019495037367323262,
"logits/chosen": -0.22853028774261475,
"logits/rejected": -0.3647540211677551,
"logps/chosen": -3.3972930908203125,
"logps/rejected": -25.391393661499023,
"loss": 0.7584111094474792,
"memory(GiB)": 46.13,
"nll_loss": 0.35165295004844666,
"rewards/accuracies": 0.796875,
"rewards/chosen": 0.12043334543704987,
"rewards/margins": 1.1430784463882446,
"rewards/rejected": -1.022645115852356,
"step": 49,
"train_speed(iter/s)": 0.005638
},
{
"epoch": 0.301091456529921,
"grad_norm": 3.027331829071045,
"learning_rate": 0.00019463273837991643,
"logits/chosen": -0.2110910564661026,
"logits/rejected": -0.38482916355133057,
"logps/chosen": -4.55904483795166,
"logps/rejected": -31.877506256103516,
"loss": 0.675049901008606,
"memory(GiB)": 46.13,
"nll_loss": 0.32799023389816284,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.05019056051969528,
"rewards/margins": 1.6790026426315308,
"rewards/rejected": -1.6288120746612549,
"step": 50,
"train_speed(iter/s)": 0.005638
},
{
"epoch": 0.3071132856605194,
"grad_norm": 2.950259208679199,
"learning_rate": 0.00019430569033830605,
"logits/chosen": -0.19638891518115997,
"logits/rejected": -0.3516000807285309,
"logps/chosen": -7.3598952293396,
"logps/rejected": -32.14203643798828,
"loss": 0.9957353472709656,
"memory(GiB)": 46.13,
"nll_loss": 0.6411410570144653,
"rewards/accuracies": 0.796875,
"rewards/chosen": -0.031813204288482666,
"rewards/margins": 1.6832952499389648,
"rewards/rejected": -1.7151083946228027,
"step": 51,
"train_speed(iter/s)": 0.005628
},
{
"epoch": 0.3131351147911178,
"grad_norm": 3.4817123413085938,
"learning_rate": 0.00019396926207859084,
"logits/chosen": -0.2925015687942505,
"logits/rejected": -0.4453135132789612,
"logps/chosen": -6.357159614562988,
"logps/rejected": -34.39080047607422,
"loss": 0.9899907112121582,
"memory(GiB)": 46.13,
"nll_loss": 0.6184481382369995,
"rewards/accuracies": 0.828125,
"rewards/chosen": -0.06884388625621796,
"rewards/margins": 1.8842136859893799,
"rewards/rejected": -1.9530572891235352,
"step": 52,
"train_speed(iter/s)": 0.005629
},
{
"epoch": 0.31915694392171623,
"grad_norm": 3.4239518642425537,
"learning_rate": 0.00019362348706397373,
"logits/chosen": -0.22639772295951843,
"logits/rejected": -0.4221537709236145,
"logps/chosen": -5.600902080535889,
"logps/rejected": -36.40532684326172,
"loss": 0.8088786602020264,
"memory(GiB)": 46.13,
"nll_loss": 0.4771510660648346,
"rewards/accuracies": 0.859375,
"rewards/chosen": 0.0569700188934803,
"rewards/margins": 1.8676366806030273,
"rewards/rejected": -1.810666561126709,
"step": 53,
"train_speed(iter/s)": 0.005628
},
{
"epoch": 0.32517877305231463,
"grad_norm": 3.8685495853424072,
"learning_rate": 0.00019326839968734279,
"logits/chosen": -0.2569487690925598,
"logits/rejected": -0.40343666076660156,
"logps/chosen": -5.900696277618408,
"logps/rejected": -36.28150177001953,
"loss": 0.7994194030761719,
"memory(GiB)": 46.13,
"nll_loss": 0.43986907601356506,
"rewards/accuracies": 0.8125,
"rewards/chosen": 0.030100831761956215,
"rewards/margins": 1.9989190101623535,
"rewards/rejected": -1.968818187713623,
"step": 54,
"train_speed(iter/s)": 0.005629
},
{
"epoch": 0.3312006021829131,
"grad_norm": 3.0355138778686523,
"learning_rate": 0.00019290403526785025,
"logits/chosen": -0.25347286462783813,
"logits/rejected": -0.3757534623146057,
"logps/chosen": -7.442959308624268,
"logps/rejected": -32.45537567138672,
"loss": 0.903397798538208,
"memory(GiB)": 46.13,
"nll_loss": 0.531738817691803,
"rewards/accuracies": 0.859375,
"rewards/chosen": 0.0414905920624733,
"rewards/margins": 1.6564455032348633,
"rewards/rejected": -1.614954948425293,
"step": 55,
"train_speed(iter/s)": 0.005629
},
{
"epoch": 0.3372224313135115,
"grad_norm": 3.739659070968628,
"learning_rate": 0.00019253043004739968,
"logits/chosen": -0.20877386629581451,
"logits/rejected": -0.37541496753692627,
"logps/chosen": -7.142071723937988,
"logps/rejected": -32.15766906738281,
"loss": 0.9619933366775513,
"memory(GiB)": 46.13,
"nll_loss": 0.4930208921432495,
"rewards/accuracies": 0.8125,
"rewards/chosen": -0.08227778971195221,
"rewards/margins": 1.5348973274230957,
"rewards/rejected": -1.6171751022338867,
"step": 56,
"train_speed(iter/s)": 0.005628
},
{
"epoch": 0.3432442604441099,
"grad_norm": 2.4167847633361816,
"learning_rate": 0.00019214762118704076,
"logits/chosen": -0.32553619146347046,
"logits/rejected": -0.44049111008644104,
"logps/chosen": -6.96627140045166,
"logps/rejected": -24.777843475341797,
"loss": 0.8523041605949402,
"memory(GiB)": 46.13,
"nll_loss": 0.44423431158065796,
"rewards/accuracies": 0.828125,
"rewards/chosen": 0.08760333806276321,
"rewards/margins": 1.0987879037857056,
"rewards/rejected": -1.011184573173523,
"step": 57,
"train_speed(iter/s)": 0.005629
},
{
"epoch": 0.34926608957470834,
"grad_norm": 1.849902629852295,
"learning_rate": 0.00019175564676327339,
"logits/chosen": -0.29927390813827515,
"logits/rejected": -0.4095182418823242,
"logps/chosen": -6.824729919433594,
"logps/rejected": -31.636598587036133,
"loss": 0.827016294002533,
"memory(GiB)": 46.13,
"nll_loss": 0.432888925075531,
"rewards/accuracies": 0.828125,
"rewards/chosen": 0.10196143388748169,
"rewards/margins": 1.6724345684051514,
"rewards/rejected": -1.5704729557037354,
"step": 58,
"train_speed(iter/s)": 0.005629
},
{
"epoch": 0.35528791870530674,
"grad_norm": 2.3601560592651367,
"learning_rate": 0.0001913545457642601,
"logits/chosen": -0.31936806440353394,
"logits/rejected": -0.42600923776626587,
"logps/chosen": -6.396060943603516,
"logps/rejected": -26.946306228637695,
"loss": 0.9836419224739075,
"memory(GiB)": 46.13,
"nll_loss": 0.5654138326644897,
"rewards/accuracies": 0.84375,
"rewards/chosen": 0.013314278796315193,
"rewards/margins": 1.2707021236419678,
"rewards/rejected": -1.2573878765106201,
"step": 59,
"train_speed(iter/s)": 0.005629
},
{
"epoch": 0.36130974783590514,
"grad_norm": 2.7022287845611572,
"learning_rate": 0.00019094435808594823,
"logits/chosen": -0.3565162420272827,
"logits/rejected": -0.48129239678382874,
"logps/chosen": -4.523666858673096,
"logps/rejected": -30.854751586914062,
"loss": 0.7463247776031494,
"memory(GiB)": 46.13,
"nll_loss": 0.41281038522720337,
"rewards/accuracies": 0.84375,
"rewards/chosen": 0.06385684013366699,
"rewards/margins": 1.8442981243133545,
"rewards/rejected": -1.7804412841796875,
"step": 60,
"train_speed(iter/s)": 0.00563
},
{
"epoch": 0.3673315769665036,
"grad_norm": 2.549546957015991,
"learning_rate": 0.0001905251245281015,
"logits/chosen": -0.2870449125766754,
"logits/rejected": -0.4699952006340027,
"logps/chosen": -3.242504596710205,
"logps/rejected": -35.58238220214844,
"loss": 0.6698994636535645,
"memory(GiB)": 46.13,
"nll_loss": 0.3660232126712799,
"rewards/accuracies": 0.890625,
"rewards/chosen": 0.03870222344994545,
"rewards/margins": 1.8160982131958008,
"rewards/rejected": -1.7773959636688232,
"step": 61,
"train_speed(iter/s)": 0.005631
},
{
"epoch": 0.373353406097102,
"grad_norm": 3.344719409942627,
"learning_rate": 0.0001900968867902419,
"logits/chosen": -0.26915398240089417,
"logits/rejected": -0.38059523701667786,
"logps/chosen": -6.996611595153809,
"logps/rejected": -36.200714111328125,
"loss": 0.8631665110588074,
"memory(GiB)": 46.13,
"nll_loss": 0.5069284439086914,
"rewards/accuracies": 0.828125,
"rewards/chosen": -0.0650690495967865,
"rewards/margins": 1.7960646152496338,
"rewards/rejected": -1.8611338138580322,
"step": 62,
"train_speed(iter/s)": 0.00563
},
{
"epoch": 0.3793752352277004,
"grad_norm": 1.7888697385787964,
"learning_rate": 0.0001896596874675021,
"logits/chosen": -0.25557130575180054,
"logits/rejected": -0.4095707833766937,
"logps/chosen": -5.574047088623047,
"logps/rejected": -31.464292526245117,
"loss": 0.6977128386497498,
"memory(GiB)": 46.13,
"nll_loss": 0.3594370484352112,
"rewards/accuracies": 0.84375,
"rewards/chosen": 0.08366499841213226,
"rewards/margins": 1.6534584760665894,
"rewards/rejected": -1.569793462753296,
"step": 63,
"train_speed(iter/s)": 0.00563
},
{
"epoch": 0.38539706435829885,
"grad_norm": 2.8035733699798584,
"learning_rate": 0.00018921357004638835,
"logits/chosen": -0.22736577689647675,
"logits/rejected": -0.3719921410083771,
"logps/chosen": -6.317353248596191,
"logps/rejected": -30.95716094970703,
"loss": 0.8575116991996765,
"memory(GiB)": 46.13,
"nll_loss": 0.5229077339172363,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.13013550639152527,
"rewards/margins": 1.687712550163269,
"rewards/rejected": -1.5575770139694214,
"step": 64,
"train_speed(iter/s)": 0.00563
},
{
"epoch": 0.39141889348889725,
"grad_norm": 2.560202121734619,
"learning_rate": 0.00018875857890045543,
"logits/chosen": -0.24293088912963867,
"logits/rejected": -0.35710442066192627,
"logps/chosen": -7.503670692443848,
"logps/rejected": -32.99870300292969,
"loss": 0.8683996796607971,
"memory(GiB)": 46.13,
"nll_loss": 0.49205920100212097,
"rewards/accuracies": 0.796875,
"rewards/chosen": 0.03412435203790665,
"rewards/margins": 1.4795939922332764,
"rewards/rejected": -1.4454697370529175,
"step": 65,
"train_speed(iter/s)": 0.005629
},
{
"epoch": 0.39744072261949565,
"grad_norm": 1.993003487586975,
"learning_rate": 0.00018829475928589271,
"logits/chosen": -0.23541702330112457,
"logits/rejected": -0.3272259533405304,
"logps/chosen": -5.38151216506958,
"logps/rejected": -29.121570587158203,
"loss": 0.7320932149887085,
"memory(GiB)": 46.13,
"nll_loss": 0.36119604110717773,
"rewards/accuracies": 0.828125,
"rewards/chosen": 0.0803036242723465,
"rewards/margins": 1.6109750270843506,
"rewards/rejected": -1.53067147731781,
"step": 66,
"train_speed(iter/s)": 0.00563
},
{
"epoch": 0.4034625517500941,
"grad_norm": 2.9964606761932373,
"learning_rate": 0.00018782215733702286,
"logits/chosen": -0.20383372902870178,
"logits/rejected": -0.34373044967651367,
"logps/chosen": -6.649240493774414,
"logps/rejected": -31.494646072387695,
"loss": 0.8884384036064148,
"memory(GiB)": 46.13,
"nll_loss": 0.5308991074562073,
"rewards/accuracies": 0.828125,
"rewards/chosen": 0.10617589205503464,
"rewards/margins": 1.5828511714935303,
"rewards/rejected": -1.4766751527786255,
"step": 67,
"train_speed(iter/s)": 0.00563
},
{
"epoch": 0.4094843808806925,
"grad_norm": 2.774994134902954,
"learning_rate": 0.00018734082006171299,
"logits/chosen": -0.25100839138031006,
"logits/rejected": -0.4020751118659973,
"logps/chosen": -7.144831657409668,
"logps/rejected": -29.9566707611084,
"loss": 0.8242477178573608,
"memory(GiB)": 46.13,
"nll_loss": 0.5139617919921875,
"rewards/accuracies": 0.90625,
"rewards/chosen": 0.13794061541557312,
"rewards/margins": 1.6364552974700928,
"rewards/rejected": -1.4985146522521973,
"step": 68,
"train_speed(iter/s)": 0.005631
},
{
"epoch": 0.41550621001129096,
"grad_norm": 3.4358551502227783,
"learning_rate": 0.0001868507953366989,
"logits/chosen": -0.24417072534561157,
"logits/rejected": -0.36953434348106384,
"logps/chosen": -6.3338799476623535,
"logps/rejected": -32.21156311035156,
"loss": 0.7758980989456177,
"memory(GiB)": 46.13,
"nll_loss": 0.48221129179000854,
"rewards/accuracies": 0.90625,
"rewards/chosen": 0.14049482345581055,
"rewards/margins": 1.806667447090149,
"rewards/rejected": -1.666172742843628,
"step": 69,
"train_speed(iter/s)": 0.005631
},
{
"epoch": 0.42152803914188935,
"grad_norm": 2.821110248565674,
"learning_rate": 0.0001863521319028231,
"logits/chosen": -0.2586533725261688,
"logits/rejected": -0.36297786235809326,
"logps/chosen": -7.11786413192749,
"logps/rejected": -31.115772247314453,
"loss": 0.8807559013366699,
"memory(GiB)": 46.13,
"nll_loss": 0.5770330429077148,
"rewards/accuracies": 0.828125,
"rewards/chosen": 0.07292432337999344,
"rewards/margins": 2.026425838470459,
"rewards/rejected": -1.9535014629364014,
"step": 70,
"train_speed(iter/s)": 0.005632
},
{
"epoch": 0.42754986827248775,
"grad_norm": 2.6153159141540527,
"learning_rate": 0.00018584487936018661,
"logits/chosen": -0.305365651845932,
"logits/rejected": -0.4076971709728241,
"logps/chosen": -4.401376247406006,
"logps/rejected": -25.76744842529297,
"loss": 0.7574676275253296,
"memory(GiB)": 46.13,
"nll_loss": 0.3759956955909729,
"rewards/accuracies": 0.796875,
"rewards/chosen": -0.015199379995465279,
"rewards/margins": 1.5401445627212524,
"rewards/rejected": -1.5553438663482666,
"step": 71,
"train_speed(iter/s)": 0.005632
},
{
"epoch": 0.4335716974030862,
"grad_norm": 4.708693027496338,
"learning_rate": 0.00018532908816321558,
"logits/chosen": -0.22257624566555023,
"logits/rejected": -0.36776047945022583,
"logps/chosen": -5.041079998016357,
"logps/rejected": -31.822460174560547,
"loss": 0.7604058980941772,
"memory(GiB)": 46.13,
"nll_loss": 0.3996947705745697,
"rewards/accuracies": 0.84375,
"rewards/chosen": 0.0631202757358551,
"rewards/margins": 1.8200846910476685,
"rewards/rejected": -1.7569644451141357,
"step": 72,
"train_speed(iter/s)": 0.005633
},
{
"epoch": 0.4395935265336846,
"grad_norm": 4.16855001449585,
"learning_rate": 0.0001848048096156426,
"logits/chosen": -0.1833086460828781,
"logits/rejected": -0.40944039821624756,
"logps/chosen": -7.540615081787109,
"logps/rejected": -41.107208251953125,
"loss": 1.1337863206863403,
"memory(GiB)": 46.13,
"nll_loss": 0.7324954271316528,
"rewards/accuracies": 0.828125,
"rewards/chosen": -0.13253508508205414,
"rewards/margins": 2.3366596698760986,
"rewards/rejected": -2.4691946506500244,
"step": 73,
"train_speed(iter/s)": 0.005633
},
{
"epoch": 0.445615355664283,
"grad_norm": 2.806788444519043,
"learning_rate": 0.0001842720958654039,
"logits/chosen": -0.3181215524673462,
"logits/rejected": -0.39911144971847534,
"logps/chosen": -5.607314586639404,
"logps/rejected": -28.428564071655273,
"loss": 0.6960507035255432,
"memory(GiB)": 46.13,
"nll_loss": 0.40211787819862366,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.15752148628234863,
"rewards/margins": 1.9513351917266846,
"rewards/rejected": -1.7938138246536255,
"step": 74,
"train_speed(iter/s)": 0.005634
},
{
"epoch": 0.45163718479488146,
"grad_norm": 3.420902967453003,
"learning_rate": 0.00018373099989945236,
"logits/chosen": -0.22940213978290558,
"logits/rejected": -0.4191284477710724,
"logps/chosen": -6.713252067565918,
"logps/rejected": -37.6962890625,
"loss": 0.920997679233551,
"memory(GiB)": 46.13,
"nll_loss": 0.5668741464614868,
"rewards/accuracies": 0.890625,
"rewards/chosen": -0.0326458215713501,
"rewards/margins": 2.1453044414520264,
"rewards/rejected": -2.177950382232666,
"step": 75,
"train_speed(iter/s)": 0.005634
},
{
"epoch": 0.45765901392547986,
"grad_norm": 3.6164190769195557,
"learning_rate": 0.0001831815755384869,
"logits/chosen": -0.20445629954338074,
"logits/rejected": -0.3627314567565918,
"logps/chosen": -5.958117485046387,
"logps/rejected": -38.63805389404297,
"loss": 0.884059727191925,
"memory(GiB)": 46.13,
"nll_loss": 0.5545799732208252,
"rewards/accuracies": 0.828125,
"rewards/chosen": -0.049575597047805786,
"rewards/margins": 2.2317745685577393,
"rewards/rejected": -2.2813501358032227,
"step": 76,
"train_speed(iter/s)": 0.005634
},
{
"epoch": 0.46368084305607826,
"grad_norm": 2.9762485027313232,
"learning_rate": 0.0001826238774315995,
"logits/chosen": -0.23990976810455322,
"logits/rejected": -0.38009804487228394,
"logps/chosen": -5.436191082000732,
"logps/rejected": -34.6729850769043,
"loss": 0.7682054042816162,
"memory(GiB)": 46.13,
"nll_loss": 0.4302901029586792,
"rewards/accuracies": 0.859375,
"rewards/chosen": 0.1761879026889801,
"rewards/margins": 2.175489902496338,
"rewards/rejected": -1.9993020296096802,
"step": 77,
"train_speed(iter/s)": 0.005634
},
{
"epoch": 0.4697026721866767,
"grad_norm": 2.6883339881896973,
"learning_rate": 0.00018205796105083915,
"logits/chosen": -0.27416834235191345,
"logits/rejected": -0.387048602104187,
"logps/chosen": -6.189967155456543,
"logps/rejected": -30.830598831176758,
"loss": 0.8499253988265991,
"memory(GiB)": 46.13,
"nll_loss": 0.46602901816368103,
"rewards/accuracies": 0.859375,
"rewards/chosen": 0.06820189207792282,
"rewards/margins": 1.8341140747070312,
"rewards/rejected": -1.7659121751785278,
"step": 78,
"train_speed(iter/s)": 0.005635
},
{
"epoch": 0.4757245013172751,
"grad_norm": 2.6955106258392334,
"learning_rate": 0.00018148388268569453,
"logits/chosen": -0.22744283080101013,
"logits/rejected": -0.35057857632637024,
"logps/chosen": -4.485665798187256,
"logps/rejected": -29.74733543395996,
"loss": 0.7549667954444885,
"memory(GiB)": 46.13,
"nll_loss": 0.4278162717819214,
"rewards/accuracies": 0.828125,
"rewards/chosen": 0.20732006430625916,
"rewards/margins": 2.0227808952331543,
"rewards/rejected": -1.8154606819152832,
"step": 79,
"train_speed(iter/s)": 0.005635
},
{
"epoch": 0.4817463304478735,
"grad_norm": 2.907402515411377,
"learning_rate": 0.00018090169943749476,
"logits/chosen": -0.13104476034641266,
"logits/rejected": -0.36177706718444824,
"logps/chosen": -3.6902096271514893,
"logps/rejected": -34.731773376464844,
"loss": 0.6847038269042969,
"memory(GiB)": 46.13,
"nll_loss": 0.34349215030670166,
"rewards/accuracies": 0.890625,
"rewards/chosen": 0.11521060019731522,
"rewards/margins": 1.8666913509368896,
"rewards/rejected": -1.7514808177947998,
"step": 80,
"train_speed(iter/s)": 0.005635
},
{
"epoch": 0.48776815957847197,
"grad_norm": 2.823246955871582,
"learning_rate": 0.00018031146921373018,
"logits/chosen": -0.22965751588344574,
"logits/rejected": -0.3291424512863159,
"logps/chosen": -5.761353969573975,
"logps/rejected": -36.051082611083984,
"loss": 0.7157370448112488,
"memory(GiB)": 46.13,
"nll_loss": 0.4026964008808136,
"rewards/accuracies": 0.859375,
"rewards/chosen": 0.07981520146131516,
"rewards/margins": 2.387995958328247,
"rewards/rejected": -2.308180809020996,
"step": 81,
"train_speed(iter/s)": 0.005636
},
{
"epoch": 0.49378998870907037,
"grad_norm": 2.73394513130188,
"learning_rate": 0.00017971325072229226,
"logits/chosen": -0.19317063689231873,
"logits/rejected": -0.40784093737602234,
"logps/chosen": -5.166616916656494,
"logps/rejected": -40.66303634643555,
"loss": 0.6980624198913574,
"memory(GiB)": 46.13,
"nll_loss": 0.4219977855682373,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.030578728765249252,
"rewards/margins": 2.3669514656066895,
"rewards/rejected": -2.3363726139068604,
"step": 82,
"train_speed(iter/s)": 0.005635
},
{
"epoch": 0.4998118178396688,
"grad_norm": 5.509173393249512,
"learning_rate": 0.00017910710346563416,
"logits/chosen": -0.1950196623802185,
"logits/rejected": -0.3517180383205414,
"logps/chosen": -8.197553634643555,
"logps/rejected": -42.4526252746582,
"loss": 0.9209753274917603,
"memory(GiB)": 46.13,
"nll_loss": 0.608447790145874,
"rewards/accuracies": 0.859375,
"rewards/chosen": 0.012901969254016876,
"rewards/margins": 2.6168861389160156,
"rewards/rejected": -2.6039838790893555,
"step": 83,
"train_speed(iter/s)": 0.005636
},
{
"epoch": 0.5058336469702672,
"grad_norm": 3.090348482131958,
"learning_rate": 0.00017849308773485226,
"logits/chosen": -0.2090476155281067,
"logits/rejected": -0.3706829845905304,
"logps/chosen": -10.569226264953613,
"logps/rejected": -43.29594421386719,
"loss": 1.0815891027450562,
"memory(GiB)": 46.13,
"nll_loss": 0.7449980974197388,
"rewards/accuracies": 0.796875,
"rewards/chosen": -0.03622851148247719,
"rewards/margins": 2.7713966369628906,
"rewards/rejected": -2.8076250553131104,
"step": 84,
"train_speed(iter/s)": 0.005636
},
{
"epoch": 0.5118554761008657,
"grad_norm": 3.75370717048645,
"learning_rate": 0.0001778712646036894,
"logits/chosen": -0.2378547489643097,
"logits/rejected": -0.3873806297779083,
"logps/chosen": -8.168487548828125,
"logps/rejected": -37.17033386230469,
"loss": 1.0251762866973877,
"memory(GiB)": 46.13,
"nll_loss": 0.6340765953063965,
"rewards/accuracies": 0.765625,
"rewards/chosen": -0.11355286091566086,
"rewards/margins": 2.2919938564300537,
"rewards/rejected": -2.4055469036102295,
"step": 85,
"train_speed(iter/s)": 0.005636
},
{
"epoch": 0.517877305231464,
"grad_norm": 3.9649507999420166,
"learning_rate": 0.00017724169592245995,
"logits/chosen": -0.20498239994049072,
"logits/rejected": -0.369476854801178,
"logps/chosen": -6.779036521911621,
"logps/rejected": -37.98490905761719,
"loss": 0.797798216342926,
"memory(GiB)": 46.13,
"nll_loss": 0.5137072801589966,
"rewards/accuracies": 0.890625,
"rewards/chosen": 0.07833351194858551,
"rewards/margins": 2.144557476043701,
"rewards/rejected": -2.0662238597869873,
"step": 86,
"train_speed(iter/s)": 0.005636
},
{
"epoch": 0.5238991343620625,
"grad_norm": 3.4646809101104736,
"learning_rate": 0.0001766044443118978,
"logits/chosen": -0.22029685974121094,
"logits/rejected": -0.33659541606903076,
"logps/chosen": -5.358316421508789,
"logps/rejected": -24.96926498413086,
"loss": 0.809937596321106,
"memory(GiB)": 46.13,
"nll_loss": 0.3953189551830292,
"rewards/accuracies": 0.796875,
"rewards/chosen": 0.08655387908220291,
"rewards/margins": 1.2862589359283447,
"rewards/rejected": -1.1997051239013672,
"step": 87,
"train_speed(iter/s)": 0.005636
},
{
"epoch": 0.5299209634926609,
"grad_norm": 2.3174376487731934,
"learning_rate": 0.00017595957315692782,
"logits/chosen": -0.23393434286117554,
"logits/rejected": -0.37657639384269714,
"logps/chosen": -5.694438934326172,
"logps/rejected": -26.54452896118164,
"loss": 0.8167567253112793,
"memory(GiB)": 46.13,
"nll_loss": 0.46906933188438416,
"rewards/accuracies": 0.890625,
"rewards/chosen": 0.12023281306028366,
"rewards/margins": 1.344594120979309,
"rewards/rejected": -1.2243614196777344,
"step": 88,
"train_speed(iter/s)": 0.005636
},
{
"epoch": 0.5359427926232593,
"grad_norm": 2.29378342628479,
"learning_rate": 0.00017530714660036112,
"logits/chosen": -0.23060575127601624,
"logits/rejected": -0.34717997908592224,
"logps/chosen": -8.571242332458496,
"logps/rejected": -27.7784423828125,
"loss": 0.9238011837005615,
"memory(GiB)": 46.13,
"nll_loss": 0.5501088500022888,
"rewards/accuracies": 0.8125,
"rewards/chosen": 0.21566246449947357,
"rewards/margins": 1.4910237789154053,
"rewards/rejected": -1.2753612995147705,
"step": 89,
"train_speed(iter/s)": 0.005636
},
{
"epoch": 0.5419646217538577,
"grad_norm": 4.33613395690918,
"learning_rate": 0.00017464722953651504,
"logits/chosen": -0.17152062058448792,
"logits/rejected": -0.3561325669288635,
"logps/chosen": -6.058459281921387,
"logps/rejected": -32.55611801147461,
"loss": 0.8752692341804504,
"memory(GiB)": 46.13,
"nll_loss": 0.5144660472869873,
"rewards/accuracies": 0.84375,
"rewards/chosen": 0.0842672809958458,
"rewards/margins": 1.5552325248718262,
"rewards/rejected": -1.4709652662277222,
"step": 90,
"train_speed(iter/s)": 0.005636
},
{
"epoch": 0.5479864508844562,
"grad_norm": 2.2437572479248047,
"learning_rate": 0.0001739798876047584,
"logits/chosen": -0.23511910438537598,
"logits/rejected": -0.3851989507675171,
"logps/chosen": -4.1521100997924805,
"logps/rejected": -28.886817932128906,
"loss": 0.7264631390571594,
"memory(GiB)": 46.13,
"nll_loss": 0.36743801832199097,
"rewards/accuracies": 0.859375,
"rewards/chosen": 0.10910709202289581,
"rewards/margins": 1.5735148191452026,
"rewards/rejected": -1.4644078016281128,
"step": 91,
"train_speed(iter/s)": 0.005636
},
{
"epoch": 0.5540082800150545,
"grad_norm": 2.482116460800171,
"learning_rate": 0.00017330518718298264,
"logits/chosen": -0.19554060697555542,
"logits/rejected": -0.38464802503585815,
"logps/chosen": -5.105670928955078,
"logps/rejected": -42.76155471801758,
"loss": 0.6233892440795898,
"memory(GiB)": 46.13,
"nll_loss": 0.36078184843063354,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.06755763292312622,
"rewards/margins": 2.4900288581848145,
"rewards/rejected": -2.422471523284912,
"step": 92,
"train_speed(iter/s)": 0.005635
},
{
"epoch": 0.560030109145653,
"grad_norm": 3.629793167114258,
"learning_rate": 0.0001726231953809993,
"logits/chosen": -0.23075315356254578,
"logits/rejected": -0.4017852246761322,
"logps/chosen": -7.799711227416992,
"logps/rejected": -38.58491516113281,
"loss": 0.7807697057723999,
"memory(GiB)": 46.13,
"nll_loss": 0.5262271165847778,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.15829423069953918,
"rewards/margins": 2.4986987113952637,
"rewards/rejected": -2.340404510498047,
"step": 93,
"train_speed(iter/s)": 0.005635
},
{
"epoch": 0.5660519382762514,
"grad_norm": 10.366227149963379,
"learning_rate": 0.0001719339800338651,
"logits/chosen": -0.29187849164009094,
"logits/rejected": -0.42478230595588684,
"logps/chosen": -7.801548004150391,
"logps/rejected": -34.29828643798828,
"loss": 1.1007416248321533,
"memory(GiB)": 46.13,
"nll_loss": 0.7008671164512634,
"rewards/accuracies": 0.828125,
"rewards/chosen": -0.0017978232353925705,
"rewards/margins": 1.9699221849441528,
"rewards/rejected": -1.9717202186584473,
"step": 94,
"train_speed(iter/s)": 0.005635
},
{
"epoch": 0.5720737674068498,
"grad_norm": 4.7859039306640625,
"learning_rate": 0.0001712376096951345,
"logits/chosen": -0.2881244421005249,
"logits/rejected": -0.39795249700546265,
"logps/chosen": -6.9338459968566895,
"logps/rejected": -34.682186126708984,
"loss": 0.8693129420280457,
"memory(GiB)": 46.13,
"nll_loss": 0.5744621157646179,
"rewards/accuracies": 0.90625,
"rewards/chosen": 0.12829959392547607,
"rewards/margins": 2.2821671962738037,
"rewards/rejected": -2.153867244720459,
"step": 95,
"train_speed(iter/s)": 0.005636
},
{
"epoch": 0.5780955965374482,
"grad_norm": 2.521221160888672,
"learning_rate": 0.0001705341536300409,
"logits/chosen": -0.2661621868610382,
"logits/rejected": -0.3923559784889221,
"logps/chosen": -4.780788898468018,
"logps/rejected": -28.810710906982422,
"loss": 0.7346460819244385,
"memory(GiB)": 46.13,
"nll_loss": 0.40230822563171387,
"rewards/accuracies": 0.796875,
"rewards/chosen": 0.10683214664459229,
"rewards/margins": 1.7658103704452515,
"rewards/rejected": -1.6589782238006592,
"step": 96,
"train_speed(iter/s)": 0.005636
},
{
"epoch": 0.5841174256680467,
"grad_norm": 5.023887634277344,
"learning_rate": 0.00016982368180860728,
"logits/chosen": -0.25105586647987366,
"logits/rejected": -0.3866545855998993,
"logps/chosen": -7.320672512054443,
"logps/rejected": -34.95018005371094,
"loss": 0.9987191557884216,
"memory(GiB)": 46.13,
"nll_loss": 0.6328321695327759,
"rewards/accuracies": 0.8125,
"rewards/chosen": -0.07585513591766357,
"rewards/margins": 2.0516769886016846,
"rewards/rejected": -2.127532482147217,
"step": 97,
"train_speed(iter/s)": 0.005636
},
{
"epoch": 0.590139254798645,
"grad_norm": 1.8328591585159302,
"learning_rate": 0.00016910626489868649,
"logits/chosen": -0.2209641933441162,
"logits/rejected": -0.398262083530426,
"logps/chosen": -4.149725437164307,
"logps/rejected": -35.193931579589844,
"loss": 0.6401265263557434,
"memory(GiB)": 46.13,
"nll_loss": 0.31758564710617065,
"rewards/accuracies": 0.84375,
"rewards/chosen": 0.14480024576187134,
"rewards/margins": 2.074404716491699,
"rewards/rejected": -1.9296045303344727,
"step": 98,
"train_speed(iter/s)": 0.005637
},
{
"epoch": 0.5961610839292435,
"grad_norm": 1.696344017982483,
"learning_rate": 0.00016838197425893202,
"logits/chosen": -0.2796581983566284,
"logits/rejected": -0.4003712832927704,
"logps/chosen": -5.847466468811035,
"logps/rejected": -30.844961166381836,
"loss": 0.7925845384597778,
"memory(GiB)": 46.13,
"nll_loss": 0.4691714644432068,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.15563875436782837,
"rewards/margins": 1.9312589168548584,
"rewards/rejected": -1.7756202220916748,
"step": 99,
"train_speed(iter/s)": 0.005637
},
{
"epoch": 0.602182913059842,
"grad_norm": 2.3960113525390625,
"learning_rate": 0.00016765088193170053,
"logits/chosen": -0.2749744653701782,
"logits/rejected": -0.39394593238830566,
"logps/chosen": -6.603066444396973,
"logps/rejected": -25.912214279174805,
"loss": 0.9519745707511902,
"memory(GiB)": 46.13,
"nll_loss": 0.5554052591323853,
"rewards/accuracies": 0.890625,
"rewards/chosen": 0.11803217232227325,
"rewards/margins": 1.5442473888397217,
"rewards/rejected": -1.4262150526046753,
"step": 100,
"train_speed(iter/s)": 0.005637
},
{
"epoch": 0.6082047421904403,
"grad_norm": 2.1803297996520996,
"learning_rate": 0.00016691306063588583,
"logits/chosen": -0.14278045296669006,
"logits/rejected": -0.32641783356666565,
"logps/chosen": -6.367352485656738,
"logps/rejected": -36.09748077392578,
"loss": 0.7241327166557312,
"memory(GiB)": 46.13,
"nll_loss": 0.4310902953147888,
"rewards/accuracies": 0.90625,
"rewards/chosen": 0.20738306641578674,
"rewards/margins": 1.9153938293457031,
"rewards/rejected": -1.7080106735229492,
"step": 101,
"train_speed(iter/s)": 0.005632
},
{
"epoch": 0.6142265713210388,
"grad_norm": 2.27510142326355,
"learning_rate": 0.00016616858375968595,
"logits/chosen": -0.20140963792800903,
"logits/rejected": -0.34892868995666504,
"logps/chosen": -4.8850579261779785,
"logps/rejected": -34.458396911621094,
"loss": 0.6944241523742676,
"memory(GiB)": 46.13,
"nll_loss": 0.39014381170272827,
"rewards/accuracies": 0.828125,
"rewards/chosen": 0.05396907776594162,
"rewards/margins": 2.1584324836730957,
"rewards/rejected": -2.1044633388519287,
"step": 102,
"train_speed(iter/s)": 0.005633
},
{
"epoch": 0.6202484004516372,
"grad_norm": 3.8538124561309814,
"learning_rate": 0.00016541752535330345,
"logits/chosen": -0.15393608808517456,
"logits/rejected": -0.32232990860939026,
"logps/chosen": -7.490941047668457,
"logps/rejected": -38.019405364990234,
"loss": 0.899553656578064,
"memory(GiB)": 46.13,
"nll_loss": 0.5592579245567322,
"rewards/accuracies": 0.875,
"rewards/chosen": -0.04624926298856735,
"rewards/margins": 2.2129275798797607,
"rewards/rejected": -2.259176731109619,
"step": 103,
"train_speed(iter/s)": 0.005633
},
{
"epoch": 0.6262702295822355,
"grad_norm": 3.2243363857269287,
"learning_rate": 0.00016465996012157995,
"logits/chosen": -0.1763302981853485,
"logits/rejected": -0.30002710223197937,
"logps/chosen": -7.91542387008667,
"logps/rejected": -35.163421630859375,
"loss": 0.8102483153343201,
"memory(GiB)": 46.13,
"nll_loss": 0.5111361145973206,
"rewards/accuracies": 0.859375,
"rewards/chosen": 0.1345573365688324,
"rewards/margins": 2.1800684928894043,
"rewards/rejected": -2.045511245727539,
"step": 104,
"train_speed(iter/s)": 0.005633
},
{
"epoch": 0.632292058712834,
"grad_norm": 2.4296176433563232,
"learning_rate": 0.0001638959634165656,
"logits/chosen": -0.2042100727558136,
"logits/rejected": -0.3498837947845459,
"logps/chosen": -5.70271635055542,
"logps/rejected": -33.96530532836914,
"loss": 0.7614078521728516,
"memory(GiB)": 46.13,
"nll_loss": 0.46085914969444275,
"rewards/accuracies": 0.84375,
"rewards/chosen": 0.10853511095046997,
"rewards/margins": 2.407238483428955,
"rewards/rejected": -2.298703670501709,
"step": 105,
"train_speed(iter/s)": 0.005633
},
{
"epoch": 0.6383138878434325,
"grad_norm": 5.010378837585449,
"learning_rate": 0.0001631256112300239,
"logits/chosen": -0.17106319963932037,
"logits/rejected": -0.3643282651901245,
"logps/chosen": -5.012183666229248,
"logps/rejected": -39.59567642211914,
"loss": 0.7013410329818726,
"memory(GiB)": 46.13,
"nll_loss": 0.4339035153388977,
"rewards/accuracies": 0.859375,
"rewards/chosen": 0.07484348863363266,
"rewards/margins": 2.594076156616211,
"rewards/rejected": -2.5192322731018066,
"step": 106,
"train_speed(iter/s)": 0.005633
},
{
"epoch": 0.6443357169740309,
"grad_norm": 3.9870245456695557,
"learning_rate": 0.00016234898018587337,
"logits/chosen": -0.13750208914279938,
"logits/rejected": -0.3746242821216583,
"logps/chosen": -5.721056938171387,
"logps/rejected": -44.44032287597656,
"loss": 0.7298431396484375,
"memory(GiB)": 46.13,
"nll_loss": 0.4898163080215454,
"rewards/accuracies": 0.921875,
"rewards/chosen": 0.036943770945072174,
"rewards/margins": 2.8432068824768066,
"rewards/rejected": -2.806262969970703,
"step": 107,
"train_speed(iter/s)": 0.005633
},
{
"epoch": 0.6503575461046293,
"grad_norm": 2.7155423164367676,
"learning_rate": 0.0001615661475325658,
"logits/chosen": -0.1980631947517395,
"logits/rejected": -0.36777210235595703,
"logps/chosen": -5.860571384429932,
"logps/rejected": -45.095069885253906,
"loss": 0.6415181756019592,
"memory(GiB)": 46.13,
"nll_loss": 0.43772590160369873,
"rewards/accuracies": 0.921875,
"rewards/chosen": 0.029481690376996994,
"rewards/margins": 2.904158115386963,
"rewards/rejected": -2.874676465988159,
"step": 108,
"train_speed(iter/s)": 0.005633
},
{
"epoch": 0.6563793752352277,
"grad_norm": 3.9366610050201416,
"learning_rate": 0.00016077719113540302,
"logits/chosen": -0.201637402176857,
"logits/rejected": -0.36231857538223267,
"logps/chosen": -8.20331859588623,
"logps/rejected": -47.63356018066406,
"loss": 0.8109980821609497,
"memory(GiB)": 46.13,
"nll_loss": 0.588591456413269,
"rewards/accuracies": 0.90625,
"rewards/chosen": -0.11406072974205017,
"rewards/margins": 3.15336275100708,
"rewards/rejected": -3.267423629760742,
"step": 109,
"train_speed(iter/s)": 0.005633
},
{
"epoch": 0.6624012043658262,
"grad_norm": 1.8952491283416748,
"learning_rate": 0.00015998218946879138,
"logits/chosen": -0.20580148696899414,
"logits/rejected": -0.37684956192970276,
"logps/chosen": -4.04914665222168,
"logps/rejected": -40.22568130493164,
"loss": 0.6388105154037476,
"memory(GiB)": 46.13,
"nll_loss": 0.39933112263679504,
"rewards/accuracies": 0.921875,
"rewards/chosen": 0.07669900357723236,
"rewards/margins": 2.701504945755005,
"rewards/rejected": -2.6248061656951904,
"step": 110,
"train_speed(iter/s)": 0.005634
},
{
"epoch": 0.6684230334964245,
"grad_norm": 2.1146159172058105,
"learning_rate": 0.00015918122160843678,
"logits/chosen": -0.21242693066596985,
"logits/rejected": -0.3542603850364685,
"logps/chosen": -7.400607109069824,
"logps/rejected": -41.83246612548828,
"loss": 0.9009187817573547,
"memory(GiB)": 46.13,
"nll_loss": 0.6562238931655884,
"rewards/accuracies": 0.90625,
"rewards/chosen": 0.07808566093444824,
"rewards/margins": 2.6408753395080566,
"rewards/rejected": -2.5627896785736084,
"step": 111,
"train_speed(iter/s)": 0.005634
},
{
"epoch": 0.674444862627023,
"grad_norm": 3.891860008239746,
"learning_rate": 0.000158374367223479,
"logits/chosen": -0.2456948161125183,
"logits/rejected": -0.3476937413215637,
"logps/chosen": -6.91848087310791,
"logps/rejected": -35.34187698364258,
"loss": 0.9391785860061646,
"memory(GiB)": 46.13,
"nll_loss": 0.618550181388855,
"rewards/accuracies": 0.8125,
"rewards/chosen": -0.011886654421687126,
"rewards/margins": 2.1392247676849365,
"rewards/rejected": -2.151111602783203,
"step": 112,
"train_speed(iter/s)": 0.005635
},
{
"epoch": 0.6804666917576214,
"grad_norm": 4.234856128692627,
"learning_rate": 0.00015756170656856737,
"logits/chosen": -0.11636840552091599,
"logits/rejected": -0.23480768501758575,
"logps/chosen": -7.3483710289001465,
"logps/rejected": -33.948822021484375,
"loss": 0.8160063624382019,
"memory(GiB)": 46.13,
"nll_loss": 0.5110282301902771,
"rewards/accuracies": 0.953125,
"rewards/chosen": 0.08705638349056244,
"rewards/margins": 2.111095905303955,
"rewards/rejected": -2.0240395069122314,
"step": 113,
"train_speed(iter/s)": 0.005634
},
{
"epoch": 0.6864885208882198,
"grad_norm": 1.5901049375534058,
"learning_rate": 0.0001567433204758782,
"logits/chosen": -0.15935438871383667,
"logits/rejected": -0.3056758642196655,
"logps/chosen": -5.887468338012695,
"logps/rejected": -39.561500549316406,
"loss": 0.7292969226837158,
"memory(GiB)": 46.13,
"nll_loss": 0.4773525893688202,
"rewards/accuracies": 0.921875,
"rewards/chosen": 0.141588032245636,
"rewards/margins": 2.442899703979492,
"rewards/rejected": -2.301311731338501,
"step": 114,
"train_speed(iter/s)": 0.005634
},
{
"epoch": 0.6925103500188182,
"grad_norm": 2.1147372722625732,
"learning_rate": 0.0001559192903470747,
"logits/chosen": -0.1537177711725235,
"logits/rejected": -0.2976364493370056,
"logps/chosen": -7.735870361328125,
"logps/rejected": -36.14551544189453,
"loss": 0.822877049446106,
"memory(GiB)": 46.13,
"nll_loss": 0.5838936567306519,
"rewards/accuracies": 0.90625,
"rewards/chosen": 0.16609230637550354,
"rewards/margins": 2.184666633605957,
"rewards/rejected": -2.0185742378234863,
"step": 115,
"train_speed(iter/s)": 0.005634
},
{
"epoch": 0.6985321791494167,
"grad_norm": 3.8271219730377197,
"learning_rate": 0.00015508969814521025,
"logits/chosen": -0.16476985812187195,
"logits/rejected": -0.2944994568824768,
"logps/chosen": -4.954969882965088,
"logps/rejected": -31.42076301574707,
"loss": 0.8119629621505737,
"memory(GiB)": 46.13,
"nll_loss": 0.4658912420272827,
"rewards/accuracies": 0.828125,
"rewards/chosen": 0.09785570204257965,
"rewards/margins": 1.8094596862792969,
"rewards/rejected": -1.711604118347168,
"step": 116,
"train_speed(iter/s)": 0.005634
},
{
"epoch": 0.704554008280015,
"grad_norm": 1.9744106531143188,
"learning_rate": 0.00015425462638657595,
"logits/chosen": -0.2048090547323227,
"logits/rejected": -0.2695329189300537,
"logps/chosen": -5.02174711227417,
"logps/rejected": -31.327930450439453,
"loss": 0.6611427068710327,
"memory(GiB)": 46.13,
"nll_loss": 0.3884551525115967,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.18278352916240692,
"rewards/margins": 2.1040430068969727,
"rewards/rejected": -1.9212596416473389,
"step": 117,
"train_speed(iter/s)": 0.005634
},
{
"epoch": 0.7105758374106135,
"grad_norm": 2.7671103477478027,
"learning_rate": 0.00015341415813249288,
"logits/chosen": -0.18153494596481323,
"logits/rejected": -0.31533682346343994,
"logps/chosen": -3.5208582878112793,
"logps/rejected": -28.974889755249023,
"loss": 0.6663014888763428,
"memory(GiB)": 46.13,
"nll_loss": 0.31734898686408997,
"rewards/accuracies": 0.859375,
"rewards/chosen": 0.08336202800273895,
"rewards/margins": 1.5573171377182007,
"rewards/rejected": -1.4739550352096558,
"step": 118,
"train_speed(iter/s)": 0.005635
},
{
"epoch": 0.7165976665412119,
"grad_norm": 2.2519025802612305,
"learning_rate": 0.00015256837698105047,
"logits/chosen": -0.18909907341003418,
"logits/rejected": -0.32073426246643066,
"logps/chosen": -5.691015243530273,
"logps/rejected": -38.229949951171875,
"loss": 0.6945815086364746,
"memory(GiB)": 46.13,
"nll_loss": 0.4534215033054352,
"rewards/accuracies": 0.9375,
"rewards/chosen": -0.016410622745752335,
"rewards/margins": 2.294341564178467,
"rewards/rejected": -2.3107523918151855,
"step": 119,
"train_speed(iter/s)": 0.005635
},
{
"epoch": 0.7226194956718103,
"grad_norm": 2.6865475177764893,
"learning_rate": 0.00015171736705879126,
"logits/chosen": -0.11694711446762085,
"logits/rejected": -0.30947864055633545,
"logps/chosen": -4.004083156585693,
"logps/rejected": -42.21112060546875,
"loss": 0.5099095702171326,
"memory(GiB)": 46.13,
"nll_loss": 0.2805330157279968,
"rewards/accuracies": 0.90625,
"rewards/chosen": 0.08305128663778305,
"rewards/margins": 2.5462100505828857,
"rewards/rejected": -2.46315860748291,
"step": 120,
"train_speed(iter/s)": 0.005635
},
{
"epoch": 0.7286413248024087,
"grad_norm": 5.433821201324463,
"learning_rate": 0.00015086121301234316,
"logits/chosen": -0.15977299213409424,
"logits/rejected": -0.30839866399765015,
"logps/chosen": -7.34042501449585,
"logps/rejected": -38.30808639526367,
"loss": 0.9920263886451721,
"memory(GiB)": 46.13,
"nll_loss": 0.6664140224456787,
"rewards/accuracies": 0.84375,
"rewards/chosen": -0.023471834138035774,
"rewards/margins": 2.068791151046753,
"rewards/rejected": -2.0922627449035645,
"step": 121,
"train_speed(iter/s)": 0.005635
},
{
"epoch": 0.7346631539330072,
"grad_norm": 1.8786602020263672,
"learning_rate": 0.00015000000000000001,
"logits/chosen": -0.12786100804805756,
"logits/rejected": -0.2967092990875244,
"logps/chosen": -4.349850654602051,
"logps/rejected": -32.289390563964844,
"loss": 0.6910618543624878,
"memory(GiB)": 46.13,
"nll_loss": 0.37633225321769714,
"rewards/accuracies": 0.84375,
"rewards/chosen": 0.09151757508516312,
"rewards/margins": 1.6974818706512451,
"rewards/rejected": -1.6059644222259521,
"step": 122,
"train_speed(iter/s)": 0.005634
},
{
"epoch": 0.7406849830636055,
"grad_norm": 2.327937364578247,
"learning_rate": 0.00014913381368325115,
"logits/chosen": -0.12772715091705322,
"logits/rejected": -0.3204698860645294,
"logps/chosen": -3.4514901638031006,
"logps/rejected": -40.17311096191406,
"loss": 0.5442243814468384,
"memory(GiB)": 46.13,
"nll_loss": 0.2678568661212921,
"rewards/accuracies": 0.84375,
"rewards/chosen": 0.06198100745677948,
"rewards/margins": 2.348788022994995,
"rewards/rejected": -2.286807060241699,
"step": 123,
"train_speed(iter/s)": 0.005634
},
{
"epoch": 0.746706812194204,
"grad_norm": 3.345496892929077,
"learning_rate": 0.0001482627402182611,
"logits/chosen": -0.23605135083198547,
"logits/rejected": -0.3248905539512634,
"logps/chosen": -6.426857948303223,
"logps/rejected": -27.78033447265625,
"loss": 0.8108398914337158,
"memory(GiB)": 46.13,
"nll_loss": 0.4387803077697754,
"rewards/accuracies": 0.828125,
"rewards/chosen": 0.12587979435920715,
"rewards/margins": 1.6669539213180542,
"rewards/rejected": -1.5410741567611694,
"step": 124,
"train_speed(iter/s)": 0.005634
},
{
"epoch": 0.7527286413248024,
"grad_norm": 2.567275285720825,
"learning_rate": 0.00014738686624729986,
"logits/chosen": -0.19267147779464722,
"logits/rejected": -0.3316629230976105,
"logps/chosen": -5.075592994689941,
"logps/rejected": -33.312400817871094,
"loss": 0.7099701166152954,
"memory(GiB)": 46.13,
"nll_loss": 0.3936714828014374,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.13089658319950104,
"rewards/margins": 1.870408535003662,
"rewards/rejected": -1.7395117282867432,
"step": 125,
"train_speed(iter/s)": 0.005635
},
{
"epoch": 0.7587504704554008,
"grad_norm": 3.0261592864990234,
"learning_rate": 0.00014650627889012507,
"logits/chosen": -0.2155275195837021,
"logits/rejected": -0.37678274512290955,
"logps/chosen": -4.682234764099121,
"logps/rejected": -28.974559783935547,
"loss": 0.7498282790184021,
"memory(GiB)": 46.13,
"nll_loss": 0.4256855249404907,
"rewards/accuracies": 0.890625,
"rewards/chosen": 0.15469788014888763,
"rewards/margins": 1.657031774520874,
"rewards/rejected": -1.502333641052246,
"step": 126,
"train_speed(iter/s)": 0.005635
},
{
"epoch": 0.7647722995859992,
"grad_norm": 2.6022913455963135,
"learning_rate": 0.0001456210657353163,
"logits/chosen": -0.19964055716991425,
"logits/rejected": -0.35465607047080994,
"logps/chosen": -3.941540479660034,
"logps/rejected": -32.9716682434082,
"loss": 0.6142888069152832,
"memory(GiB)": 46.13,
"nll_loss": 0.3339819610118866,
"rewards/accuracies": 0.953125,
"rewards/chosen": 0.15736861526966095,
"rewards/margins": 2.048983335494995,
"rewards/rejected": -1.8916147947311401,
"step": 127,
"train_speed(iter/s)": 0.005635
},
{
"epoch": 0.7707941287165977,
"grad_norm": 2.2070999145507812,
"learning_rate": 0.00014473131483156327,
"logits/chosen": -0.24945035576820374,
"logits/rejected": -0.32592612504959106,
"logps/chosen": -5.566514015197754,
"logps/rejected": -27.138111114501953,
"loss": 0.7188521027565002,
"memory(GiB)": 46.13,
"nll_loss": 0.4044472575187683,
"rewards/accuracies": 0.921875,
"rewards/chosen": 0.16954132914543152,
"rewards/margins": 1.7891260385513306,
"rewards/rejected": -1.6195846796035767,
"step": 128,
"train_speed(iter/s)": 0.005635
},
{
"epoch": 0.776815957847196,
"grad_norm": 1.9873756170272827,
"learning_rate": 0.00014383711467890774,
"logits/chosen": -0.18453390896320343,
"logits/rejected": -0.3942897319793701,
"logps/chosen": -4.547736167907715,
"logps/rejected": -43.979976654052734,
"loss": 0.5406314730644226,
"memory(GiB)": 46.13,
"nll_loss": 0.3523382544517517,
"rewards/accuracies": 0.953125,
"rewards/chosen": 0.08807562291622162,
"rewards/margins": 2.9467825889587402,
"rewards/rejected": -2.8587071895599365,
"step": 129,
"train_speed(iter/s)": 0.005635
},
{
"epoch": 0.7828377869777945,
"grad_norm": 3.6719274520874023,
"learning_rate": 0.00014293855421994094,
"logits/chosen": -0.20188507437705994,
"logits/rejected": -0.34430867433547974,
"logps/chosen": -5.333648204803467,
"logps/rejected": -41.819515228271484,
"loss": 0.7074599862098694,
"memory(GiB)": 46.13,
"nll_loss": 0.44100311398506165,
"rewards/accuracies": 0.921875,
"rewards/chosen": 0.027486218139529228,
"rewards/margins": 2.8748302459716797,
"rewards/rejected": -2.847343921661377,
"step": 130,
"train_speed(iter/s)": 0.005636
},
{
"epoch": 0.788859616108393,
"grad_norm": 3.5544822216033936,
"learning_rate": 0.00014203572283095657,
"logits/chosen": -0.1257411241531372,
"logits/rejected": -0.35228949785232544,
"logps/chosen": -5.203995704650879,
"logps/rejected": -53.26233673095703,
"loss": 0.763848602771759,
"memory(GiB)": 46.13,
"nll_loss": 0.5348649024963379,
"rewards/accuracies": 0.90625,
"rewards/chosen": 0.0426684133708477,
"rewards/margins": 3.6239006519317627,
"rewards/rejected": -3.5812320709228516,
"step": 131,
"train_speed(iter/s)": 0.005636
},
{
"epoch": 0.7948814452389913,
"grad_norm": 2.9171648025512695,
"learning_rate": 0.00014112871031306119,
"logits/chosen": -0.19912837445735931,
"logits/rejected": -0.3755126893520355,
"logps/chosen": -7.589679718017578,
"logps/rejected": -46.79793930053711,
"loss": 0.7475419640541077,
"memory(GiB)": 46.13,
"nll_loss": 0.5176687240600586,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.19966475665569305,
"rewards/margins": 3.243659496307373,
"rewards/rejected": -3.043994426727295,
"step": 132,
"train_speed(iter/s)": 0.005635
},
{
"epoch": 0.8009032743695897,
"grad_norm": 3.5576326847076416,
"learning_rate": 0.00014021760688324176,
"logits/chosen": -0.17760571837425232,
"logits/rejected": -0.34351277351379395,
"logps/chosen": -6.067855358123779,
"logps/rejected": -45.17057800292969,
"loss": 0.7542024850845337,
"memory(GiB)": 46.13,
"nll_loss": 0.46581241488456726,
"rewards/accuracies": 0.859375,
"rewards/chosen": -0.06834451109170914,
"rewards/margins": 2.9498496055603027,
"rewards/rejected": -3.0181939601898193,
"step": 133,
"train_speed(iter/s)": 0.005635
},
{
"epoch": 0.8069251035001882,
"grad_norm": 3.7524359226226807,
"learning_rate": 0.00013930250316539238,
"logits/chosen": -0.24070125818252563,
"logits/rejected": -0.36900123953819275,
"logps/chosen": -6.3118109703063965,
"logps/rejected": -41.5582389831543,
"loss": 0.8333712220191956,
"memory(GiB)": 46.13,
"nll_loss": 0.5454068183898926,
"rewards/accuracies": 0.90625,
"rewards/chosen": 0.0363120511174202,
"rewards/margins": 2.832289695739746,
"rewards/rejected": -2.7959775924682617,
"step": 134,
"train_speed(iter/s)": 0.005636
},
{
"epoch": 0.8129469326307867,
"grad_norm": 4.076293468475342,
"learning_rate": 0.00013838349018130007,
"logits/chosen": -0.22921916842460632,
"logits/rejected": -0.3980764150619507,
"logps/chosen": -6.020735263824463,
"logps/rejected": -36.49159622192383,
"loss": 0.7660678029060364,
"memory(GiB)": 46.13,
"nll_loss": 0.5027486085891724,
"rewards/accuracies": 0.84375,
"rewards/chosen": 0.11397107690572739,
"rewards/margins": 2.2893691062927246,
"rewards/rejected": -2.175398349761963,
"step": 135,
"train_speed(iter/s)": 0.005636
},
{
"epoch": 0.818968761761385,
"grad_norm": 3.8375930786132812,
"learning_rate": 0.00013746065934159123,
"logits/chosen": -0.21597175300121307,
"logits/rejected": -0.3748128414154053,
"logps/chosen": -5.917651176452637,
"logps/rejected": -34.7623176574707,
"loss": 0.7133091688156128,
"memory(GiB)": 46.13,
"nll_loss": 0.43554598093032837,
"rewards/accuracies": 0.90625,
"rewards/chosen": 0.14565804600715637,
"rewards/margins": 2.124354124069214,
"rewards/rejected": -1.9786962270736694,
"step": 136,
"train_speed(iter/s)": 0.005636
},
{
"epoch": 0.8249905908919835,
"grad_norm": 3.4924089908599854,
"learning_rate": 0.00013653410243663952,
"logits/chosen": -0.18882140517234802,
"logits/rejected": -0.39621540904045105,
"logps/chosen": -3.5247278213500977,
"logps/rejected": -39.52235794067383,
"loss": 0.5699490308761597,
"memory(GiB)": 46.13,
"nll_loss": 0.3287566304206848,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.16140440106391907,
"rewards/margins": 2.0828282833099365,
"rewards/rejected": -1.9214237928390503,
"step": 137,
"train_speed(iter/s)": 0.005635
},
{
"epoch": 0.8310124200225819,
"grad_norm": 2.952988386154175,
"learning_rate": 0.00013560391162743569,
"logits/chosen": -0.1859571784734726,
"logits/rejected": -0.381632536649704,
"logps/chosen": -4.896010398864746,
"logps/rejected": -35.494384765625,
"loss": 0.7929538488388062,
"memory(GiB)": 46.13,
"nll_loss": 0.4508986473083496,
"rewards/accuracies": 0.890625,
"rewards/chosen": 0.021028656512498856,
"rewards/margins": 1.990783452987671,
"rewards/rejected": -1.969754695892334,
"step": 138,
"train_speed(iter/s)": 0.005635
},
{
"epoch": 0.8370342491531803,
"grad_norm": 2.0521535873413086,
"learning_rate": 0.00013467017943642073,
"logits/chosen": -0.24490389227867126,
"logits/rejected": -0.42894116044044495,
"logps/chosen": -4.2235565185546875,
"logps/rejected": -38.84959411621094,
"loss": 0.6944494247436523,
"memory(GiB)": 46.13,
"nll_loss": 0.43725934624671936,
"rewards/accuracies": 0.90625,
"rewards/chosen": 0.12278101593255997,
"rewards/margins": 2.2289106845855713,
"rewards/rejected": -2.1061296463012695,
"step": 139,
"train_speed(iter/s)": 0.005635
},
{
"epoch": 0.8430560782837787,
"grad_norm": 3.664316415786743,
"learning_rate": 0.00013373299873828303,
"logits/chosen": -0.29347366094589233,
"logits/rejected": -0.41366317868232727,
"logps/chosen": -4.828797340393066,
"logps/rejected": -31.14942169189453,
"loss": 0.6968463659286499,
"memory(GiB)": 46.13,
"nll_loss": 0.41966789960861206,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.13118553161621094,
"rewards/margins": 1.9206351041793823,
"rewards/rejected": -1.7894494533538818,
"step": 140,
"train_speed(iter/s)": 0.005635
},
{
"epoch": 0.8490779074143772,
"grad_norm": 3.614262580871582,
"learning_rate": 0.00013279246275072046,
"logits/chosen": -0.31295719742774963,
"logits/rejected": -0.4447307288646698,
"logps/chosen": -8.66226577758789,
"logps/rejected": -31.42186737060547,
"loss": 1.0331419706344604,
"memory(GiB)": 46.13,
"nll_loss": 0.6634517312049866,
"rewards/accuracies": 0.78125,
"rewards/chosen": 0.08492518961429596,
"rewards/margins": 1.7986928224563599,
"rewards/rejected": -1.713767647743225,
"step": 141,
"train_speed(iter/s)": 0.005636
},
{
"epoch": 0.8550997365449755,
"grad_norm": 1.7650597095489502,
"learning_rate": 0.00013184866502516845,
"logits/chosen": -0.26669561862945557,
"logits/rejected": -0.4871166944503784,
"logps/chosen": -3.3100223541259766,
"logps/rejected": -39.79899215698242,
"loss": 0.5506975650787354,
"memory(GiB)": 46.13,
"nll_loss": 0.29588890075683594,
"rewards/accuracies": 0.890625,
"rewards/chosen": 0.10198746621608734,
"rewards/margins": 2.259812831878662,
"rewards/rejected": -2.157825231552124,
"step": 142,
"train_speed(iter/s)": 0.005636
},
{
"epoch": 0.861121565675574,
"grad_norm": 3.4034411907196045,
"learning_rate": 0.00013090169943749476,
"logits/chosen": -0.3030458390712738,
"logits/rejected": -0.45216381549835205,
"logps/chosen": -5.469812393188477,
"logps/rejected": -35.740806579589844,
"loss": 0.6628592610359192,
"memory(GiB)": 46.13,
"nll_loss": 0.34965524077415466,
"rewards/accuracies": 0.84375,
"rewards/chosen": 0.07742348313331604,
"rewards/margins": 2.012543201446533,
"rewards/rejected": -1.935119867324829,
"step": 143,
"train_speed(iter/s)": 0.005636
},
{
"epoch": 0.8671433948061724,
"grad_norm": 2.271817922592163,
"learning_rate": 0.00012995166017866193,
"logits/chosen": -0.35303038358688354,
"logits/rejected": -0.4534931778907776,
"logps/chosen": -7.304016590118408,
"logps/rejected": -30.363569259643555,
"loss": 0.8833200931549072,
"memory(GiB)": 46.13,
"nll_loss": 0.5442834496498108,
"rewards/accuracies": 0.765625,
"rewards/chosen": 0.18977457284927368,
"rewards/margins": 2.04044508934021,
"rewards/rejected": -1.850670576095581,
"step": 144,
"train_speed(iter/s)": 0.005636
},
{
"epoch": 0.8731652239367708,
"grad_norm": 1.6546629667282104,
"learning_rate": 0.00012899864174535864,
"logits/chosen": -0.30710387229919434,
"logits/rejected": -0.47071051597595215,
"logps/chosen": -4.921065330505371,
"logps/rejected": -37.83810043334961,
"loss": 0.611689567565918,
"memory(GiB)": 46.13,
"nll_loss": 0.36449986696243286,
"rewards/accuracies": 0.90625,
"rewards/chosen": 0.14039897918701172,
"rewards/margins": 2.364004373550415,
"rewards/rejected": -2.2236056327819824,
"step": 145,
"train_speed(iter/s)": 0.005636
},
{
"epoch": 0.8791870530673692,
"grad_norm": 1.4133797883987427,
"learning_rate": 0.00012804273893060028,
"logits/chosen": -0.35278186202049255,
"logits/rejected": -0.4680350422859192,
"logps/chosen": -4.455732345581055,
"logps/rejected": -32.905887603759766,
"loss": 0.5695258975028992,
"memory(GiB)": 46.13,
"nll_loss": 0.3188043534755707,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.18160954117774963,
"rewards/margins": 2.25382137298584,
"rewards/rejected": -2.072211742401123,
"step": 146,
"train_speed(iter/s)": 0.005636
},
{
"epoch": 0.8852088821979677,
"grad_norm": 1.8506555557250977,
"learning_rate": 0.00012708404681430053,
"logits/chosen": -0.3219718635082245,
"logits/rejected": -0.4345773756504059,
"logps/chosen": -5.016592979431152,
"logps/rejected": -34.69657516479492,
"loss": 0.6405315399169922,
"memory(GiB)": 46.13,
"nll_loss": 0.35303816199302673,
"rewards/accuracies": 0.921875,
"rewards/chosen": 0.13450342416763306,
"rewards/margins": 2.0750272274017334,
"rewards/rejected": -1.9405235052108765,
"step": 147,
"train_speed(iter/s)": 0.005636
},
{
"epoch": 0.891230711328566,
"grad_norm": 2.6582088470458984,
"learning_rate": 0.00012612266075381386,
"logits/chosen": -0.2835950255393982,
"logits/rejected": -0.4708768129348755,
"logps/chosen": -6.048505783081055,
"logps/rejected": -42.608131408691406,
"loss": 0.676105260848999,
"memory(GiB)": 46.13,
"nll_loss": 0.4015389084815979,
"rewards/accuracies": 0.90625,
"rewards/chosen": 0.033125825226306915,
"rewards/margins": 2.4881484508514404,
"rewards/rejected": -2.4550228118896484,
"step": 148,
"train_speed(iter/s)": 0.005636
},
{
"epoch": 0.8972525404591645,
"grad_norm": 3.3612794876098633,
"learning_rate": 0.00012515867637445086,
"logits/chosen": -0.3777806758880615,
"logits/rejected": -0.477069228887558,
"logps/chosen": -6.0037922859191895,
"logps/rejected": -32.48824691772461,
"loss": 0.825937032699585,
"memory(GiB)": 46.13,
"nll_loss": 0.5271134972572327,
"rewards/accuracies": 0.90625,
"rewards/chosen": 0.07130320370197296,
"rewards/margins": 2.3660011291503906,
"rewards/rejected": -2.2946979999542236,
"step": 149,
"train_speed(iter/s)": 0.005636
},
{
"epoch": 0.9032743695897629,
"grad_norm": 1.5847569704055786,
"learning_rate": 0.00012419218955996676,
"logits/chosen": -0.31665414571762085,
"logits/rejected": -0.4995279312133789,
"logps/chosen": -6.320664882659912,
"logps/rejected": -52.651451110839844,
"loss": 0.5624623894691467,
"memory(GiB)": 46.13,
"nll_loss": 0.368425577878952,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.14041581749916077,
"rewards/margins": 3.4388084411621094,
"rewards/rejected": -3.2983925342559814,
"step": 150,
"train_speed(iter/s)": 0.005636
},
{
"epoch": 0.9092961987203613,
"grad_norm": 1.733017921447754,
"learning_rate": 0.00012322329644302426,
"logits/chosen": -0.3288433849811554,
"logits/rejected": -0.5056887865066528,
"logps/chosen": -4.5702128410339355,
"logps/rejected": -42.928321838378906,
"loss": 0.534808337688446,
"memory(GiB)": 46.13,
"nll_loss": 0.3458808958530426,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.14961260557174683,
"rewards/margins": 3.0105981826782227,
"rewards/rejected": -2.860985279083252,
"step": 151,
"train_speed(iter/s)": 0.005633
},
{
"epoch": 0.9153180278509597,
"grad_norm": 1.9891310930252075,
"learning_rate": 0.00012225209339563145,
"logits/chosen": -0.34356942772865295,
"logits/rejected": -0.46553438901901245,
"logps/chosen": -8.254244804382324,
"logps/rejected": -43.76982116699219,
"loss": 0.7122747302055359,
"memory(GiB)": 46.13,
"nll_loss": 0.5048399567604065,
"rewards/accuracies": 0.921875,
"rewards/chosen": 0.2129802703857422,
"rewards/margins": 3.227698802947998,
"rewards/rejected": -3.0147182941436768,
"step": 152,
"train_speed(iter/s)": 0.005633
},
{
"epoch": 0.9213398569815582,
"grad_norm": 4.222365856170654,
"learning_rate": 0.00012127867701955622,
"logits/chosen": -0.3883526921272278,
"logits/rejected": -0.5774507522583008,
"logps/chosen": -6.422748565673828,
"logps/rejected": -53.63523483276367,
"loss": 0.6593223214149475,
"memory(GiB)": 46.13,
"nll_loss": 0.48106443881988525,
"rewards/accuracies": 0.9375,
"rewards/chosen": -0.016244899481534958,
"rewards/margins": 4.012790203094482,
"rewards/rejected": -4.029035568237305,
"step": 153,
"train_speed(iter/s)": 0.005633
},
{
"epoch": 0.9273616861121565,
"grad_norm": 14.615867614746094,
"learning_rate": 0.00012030314413671762,
"logits/chosen": -0.39986497163772583,
"logits/rejected": -0.6344658136367798,
"logps/chosen": -4.43770170211792,
"logps/rejected": -55.2861213684082,
"loss": 0.5306422710418701,
"memory(GiB)": 46.13,
"nll_loss": 0.3766982853412628,
"rewards/accuracies": 0.90625,
"rewards/chosen": 0.10156996548175812,
"rewards/margins": 3.934446334838867,
"rewards/rejected": -3.832875967025757,
"step": 154,
"train_speed(iter/s)": 0.005633
},
{
"epoch": 0.933383515242755,
"grad_norm": 4.434772491455078,
"learning_rate": 0.00011932559177955533,
"logits/chosen": -0.4241827726364136,
"logits/rejected": -0.6216625571250916,
"logps/chosen": -5.785084247589111,
"logps/rejected": -56.10906982421875,
"loss": 0.7327705025672913,
"memory(GiB)": 46.13,
"nll_loss": 0.5102080702781677,
"rewards/accuracies": 0.921875,
"rewards/chosen": 0.01768992468714714,
"rewards/margins": 4.036444187164307,
"rewards/rejected": -4.018754005432129,
"step": 155,
"train_speed(iter/s)": 0.005633
},
{
"epoch": 0.9394053443733534,
"grad_norm": 3.1120123863220215,
"learning_rate": 0.00011834611718137824,
"logits/chosen": -0.364039808511734,
"logits/rejected": -0.6007083654403687,
"logps/chosen": -5.2767415046691895,
"logps/rejected": -66.11264038085938,
"loss": 0.5869796276092529,
"memory(GiB)": 46.13,
"nll_loss": 0.47315409779548645,
"rewards/accuracies": 0.96875,
"rewards/chosen": 0.10729408264160156,
"rewards/margins": 4.741492748260498,
"rewards/rejected": -4.6341986656188965,
"step": 156,
"train_speed(iter/s)": 0.005633
},
{
"epoch": 0.9454271735039518,
"grad_norm": 9.935791015625,
"learning_rate": 0.00011736481776669306,
"logits/chosen": -0.43170925974845886,
"logits/rejected": -0.5715627670288086,
"logps/chosen": -9.369845390319824,
"logps/rejected": -57.28983688354492,
"loss": 1.0344016551971436,
"memory(GiB)": 46.13,
"nll_loss": 0.7142276763916016,
"rewards/accuracies": 0.875,
"rewards/chosen": -0.12030352652072906,
"rewards/margins": 3.983743190765381,
"rewards/rejected": -4.1040472984313965,
"step": 157,
"train_speed(iter/s)": 0.005633
},
{
"epoch": 0.9514490026345502,
"grad_norm": 3.4565649032592773,
"learning_rate": 0.00011638179114151377,
"logits/chosen": -0.4627074599266052,
"logits/rejected": -0.6269153952598572,
"logps/chosen": -6.801128387451172,
"logps/rejected": -50.93914031982422,
"loss": 0.7641481757164001,
"memory(GiB)": 46.13,
"nll_loss": 0.5224257111549377,
"rewards/accuracies": 0.859375,
"rewards/chosen": 0.020412985235452652,
"rewards/margins": 3.8560848236083984,
"rewards/rejected": -3.835671901702881,
"step": 158,
"train_speed(iter/s)": 0.005633
},
{
"epoch": 0.9574708317651487,
"grad_norm": 7.00652551651001,
"learning_rate": 0.00011539713508365335,
"logits/chosen": -0.4332171678543091,
"logits/rejected": -0.589859127998352,
"logps/chosen": -6.74440860748291,
"logps/rejected": -51.30781173706055,
"loss": 0.8142269253730774,
"memory(GiB)": 46.13,
"nll_loss": 0.6082335710525513,
"rewards/accuracies": 0.890625,
"rewards/chosen": 0.04817220941185951,
"rewards/margins": 3.839707136154175,
"rewards/rejected": -3.791534662246704,
"step": 159,
"train_speed(iter/s)": 0.005633
},
{
"epoch": 0.963492660895747,
"grad_norm": 4.027029514312744,
"learning_rate": 0.00011441094753299801,
"logits/chosen": -0.4457279443740845,
"logits/rejected": -0.5885544419288635,
"logps/chosen": -7.359399318695068,
"logps/rejected": -45.14234924316406,
"loss": 0.572091281414032,
"memory(GiB)": 46.13,
"nll_loss": 0.35912448167800903,
"rewards/accuracies": 0.890625,
"rewards/chosen": 0.04880950227379799,
"rewards/margins": 3.246192216873169,
"rewards/rejected": -3.1973824501037598,
"step": 160,
"train_speed(iter/s)": 0.005634
},
{
"epoch": 0.9695144900263455,
"grad_norm": 3.832231044769287,
"learning_rate": 0.00011342332658176555,
"logits/chosen": -0.3761252760887146,
"logits/rejected": -0.5621005892753601,
"logps/chosen": -5.201396942138672,
"logps/rejected": -43.30262756347656,
"loss": 0.601041853427887,
"memory(GiB)": 46.13,
"nll_loss": 0.37146201729774475,
"rewards/accuracies": 0.890625,
"rewards/chosen": 0.1526133269071579,
"rewards/margins": 3.075632095336914,
"rewards/rejected": -2.92301869392395,
"step": 161,
"train_speed(iter/s)": 0.005634
},
{
"epoch": 0.9755363191569439,
"grad_norm": 3.592341184616089,
"learning_rate": 0.00011243437046474853,
"logits/chosen": -0.2978363037109375,
"logits/rejected": -0.5343031883239746,
"logps/chosen": -5.316001892089844,
"logps/rejected": -56.440513610839844,
"loss": 0.5654405951499939,
"memory(GiB)": 46.13,
"nll_loss": 0.40133601427078247,
"rewards/accuracies": 0.96875,
"rewards/chosen": 0.0053778961300849915,
"rewards/margins": 3.901097536087036,
"rewards/rejected": -3.895719289779663,
"step": 162,
"train_speed(iter/s)": 0.005633
},
{
"epoch": 0.9815581482875423,
"grad_norm": 3.0024077892303467,
"learning_rate": 0.0001114441775495432,
"logits/chosen": -0.3479576110839844,
"logits/rejected": -0.5726731419563293,
"logps/chosen": -5.025125026702881,
"logps/rejected": -43.54122543334961,
"loss": 0.7037834525108337,
"memory(GiB)": 46.13,
"nll_loss": 0.48029187321662903,
"rewards/accuracies": 0.96875,
"rewards/chosen": 0.18540027737617493,
"rewards/margins": 2.662545919418335,
"rewards/rejected": -2.4771456718444824,
"step": 163,
"train_speed(iter/s)": 0.005633
},
{
"epoch": 0.9875799774181407,
"grad_norm": 5.379988670349121,
"learning_rate": 0.00011045284632676536,
"logits/chosen": -0.3792319893836975,
"logits/rejected": -0.5281450152397156,
"logps/chosen": -8.132346153259277,
"logps/rejected": -42.75868606567383,
"loss": 0.7357421517372131,
"memory(GiB)": 46.13,
"nll_loss": 0.4848954677581787,
"rewards/accuracies": 0.890625,
"rewards/chosen": 0.09983620047569275,
"rewards/margins": 2.911416530609131,
"rewards/rejected": -2.8115804195404053,
"step": 164,
"train_speed(iter/s)": 0.005633
},
{
"epoch": 0.9936018065487392,
"grad_norm": 7.149594306945801,
"learning_rate": 0.00010946047540025372,
"logits/chosen": -0.362922728061676,
"logits/rejected": -0.5330293774604797,
"logps/chosen": -5.657723903656006,
"logps/rejected": -44.190521240234375,
"loss": 0.777948796749115,
"memory(GiB)": 46.13,
"nll_loss": 0.4741102457046509,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.0894114077091217,
"rewards/margins": 2.840927839279175,
"rewards/rejected": -2.751516580581665,
"step": 165,
"train_speed(iter/s)": 0.005633
},
{
"epoch": 0.9996236356793377,
"grad_norm": 2.048894166946411,
"learning_rate": 0.00010846716347726233,
"logits/chosen": -0.4384031891822815,
"logits/rejected": -0.5566267371177673,
"logps/chosen": -3.853196382522583,
"logps/rejected": -43.331207275390625,
"loss": 0.5384762287139893,
"memory(GiB)": 46.13,
"nll_loss": 0.346954882144928,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.1474352478981018,
"rewards/margins": 3.1648757457733154,
"rewards/rejected": -3.0174405574798584,
"step": 166,
"train_speed(iter/s)": 0.005633
},
{
"epoch": 1.0,
"grad_norm": 2.048894166946411,
"learning_rate": 0.00010747300935864243,
"logits/chosen": -0.37010034918785095,
"logits/rejected": -0.6208374500274658,
"logps/chosen": -8.17520809173584,
"logps/rejected": -61.29972839355469,
"loss": 0.12779855728149414,
"memory(GiB)": 46.13,
"nll_loss": 1.3625344038009644,
"rewards/accuracies": 0.5,
"rewards/chosen": -0.4605603814125061,
"rewards/margins": 4.346360683441162,
"rewards/rejected": -4.806921005249023,
"step": 167,
"train_speed(iter/s)": 0.005666
},
{
"epoch": 1.0060218291305985,
"grad_norm": 13.219114303588867,
"learning_rate": 0.00010647811192901518,
"logits/chosen": -0.34268608689308167,
"logits/rejected": -0.5246624946594238,
"logps/chosen": -4.731266975402832,
"logps/rejected": -46.866214752197266,
"loss": 0.5699129104614258,
"memory(GiB)": 46.13,
"nll_loss": 0.35907092690467834,
"rewards/accuracies": 0.921875,
"rewards/chosen": 0.17517316341400146,
"rewards/margins": 3.2273640632629395,
"rewards/rejected": -3.0521905422210693,
"step": 168,
"train_speed(iter/s)": 0.005665
},
{
"epoch": 1.012043658261197,
"grad_norm": 1.8148096799850464,
"learning_rate": 0.00010548257014693601,
"logits/chosen": -0.3512643575668335,
"logits/rejected": -0.5287365913391113,
"logps/chosen": -3.7313232421875,
"logps/rejected": -46.643409729003906,
"loss": 0.39852774143218994,
"memory(GiB)": 46.13,
"nll_loss": 0.22772511839866638,
"rewards/accuracies": 0.984375,
"rewards/chosen": 0.18213030695915222,
"rewards/margins": 3.319718837738037,
"rewards/rejected": -3.1375885009765625,
"step": 169,
"train_speed(iter/s)": 0.005665
},
{
"epoch": 1.0180654873917954,
"grad_norm": 3.1325247287750244,
"learning_rate": 0.00010448648303505151,
"logits/chosen": -0.3514709770679474,
"logits/rejected": -0.5060309171676636,
"logps/chosen": -2.770275592803955,
"logps/rejected": -42.078311920166016,
"loss": 0.4157463312149048,
"memory(GiB)": 46.13,
"nll_loss": 0.2555791139602661,
"rewards/accuracies": 0.96875,
"rewards/chosen": 0.31045016646385193,
"rewards/margins": 3.08093523979187,
"rewards/rejected": -2.770484685897827,
"step": 170,
"train_speed(iter/s)": 0.005665
},
{
"epoch": 1.0240873165223936,
"grad_norm": 2.593531370162964,
"learning_rate": 0.00010348994967025012,
"logits/chosen": -0.39463332295417786,
"logits/rejected": -0.5413990616798401,
"logps/chosen": -5.247183322906494,
"logps/rejected": -46.65768051147461,
"loss": 0.5715495347976685,
"memory(GiB)": 46.13,
"nll_loss": 0.3746676445007324,
"rewards/accuracies": 0.921875,
"rewards/chosen": 0.16656973958015442,
"rewards/margins": 3.0420989990234375,
"rewards/rejected": -2.8755292892456055,
"step": 171,
"train_speed(iter/s)": 0.005665
},
{
"epoch": 1.030109145652992,
"grad_norm": 1.7776541709899902,
"learning_rate": 0.0001024930691738073,
"logits/chosen": -0.3912968635559082,
"logits/rejected": -0.514131486415863,
"logps/chosen": -6.068740367889404,
"logps/rejected": -39.78652572631836,
"loss": 0.590811550617218,
"memory(GiB)": 46.13,
"nll_loss": 0.396287202835083,
"rewards/accuracies": 0.984375,
"rewards/chosen": 0.2542215585708618,
"rewards/margins": 2.7374861240386963,
"rewards/rejected": -2.483264923095703,
"step": 172,
"train_speed(iter/s)": 0.005664
},
{
"epoch": 1.0361309747835905,
"grad_norm": 1.4022067785263062,
"learning_rate": 0.00010149594070152638,
"logits/chosen": -0.3674977123737335,
"logits/rejected": -0.5223217606544495,
"logps/chosen": -2.335606098175049,
"logps/rejected": -41.703453063964844,
"loss": 0.42932039499282837,
"memory(GiB)": 46.13,
"nll_loss": 0.24382930994033813,
"rewards/accuracies": 0.953125,
"rewards/chosen": 0.26927071809768677,
"rewards/margins": 2.965996503829956,
"rewards/rejected": -2.696725845336914,
"step": 173,
"train_speed(iter/s)": 0.005664
},
{
"epoch": 1.042152803914189,
"grad_norm": 2.1577670574188232,
"learning_rate": 0.00010049866343387581,
"logits/chosen": -0.33516278862953186,
"logits/rejected": -0.4972761273384094,
"logps/chosen": -3.2422990798950195,
"logps/rejected": -43.91548538208008,
"loss": 0.4766288697719574,
"memory(GiB)": 46.13,
"nll_loss": 0.2899796962738037,
"rewards/accuracies": 0.984375,
"rewards/chosen": 0.25678345561027527,
"rewards/margins": 3.0347728729248047,
"rewards/rejected": -2.777989149093628,
"step": 174,
"train_speed(iter/s)": 0.005664
},
{
"epoch": 1.0481746330447874,
"grad_norm": 1.4100942611694336,
"learning_rate": 9.950133656612421e-05,
"logits/chosen": -0.3753768503665924,
"logits/rejected": -0.49912041425704956,
"logps/chosen": -3.9077322483062744,
"logps/rejected": -36.67354965209961,
"loss": 0.44091612100601196,
"memory(GiB)": 46.13,
"nll_loss": 0.2640770673751831,
"rewards/accuracies": 0.984375,
"rewards/chosen": 0.37277600169181824,
"rewards/margins": 2.572587013244629,
"rewards/rejected": -2.1998109817504883,
"step": 175,
"train_speed(iter/s)": 0.005664
},
{
"epoch": 1.0541964621753859,
"grad_norm": 1.346986174583435,
"learning_rate": 9.850405929847366e-05,
"logits/chosen": -0.38442033529281616,
"logits/rejected": -0.5594974160194397,
"logps/chosen": -3.173485040664673,
"logps/rejected": -43.258094787597656,
"loss": 0.43492069840431213,
"memory(GiB)": 46.13,
"nll_loss": 0.28007155656814575,
"rewards/accuracies": 0.984375,
"rewards/chosen": 0.28305596113204956,
"rewards/margins": 3.2277960777282715,
"rewards/rejected": -2.9447402954101562,
"step": 176,
"train_speed(iter/s)": 0.005664
},
{
"epoch": 1.060218291305984,
"grad_norm": 1.9254361391067505,
"learning_rate": 9.750693082619273e-05,
"logits/chosen": -0.3788023889064789,
"logits/rejected": -0.5781509876251221,
"logps/chosen": -2.432941198348999,
"logps/rejected": -43.248146057128906,
"loss": 0.40009191632270813,
"memory(GiB)": 46.13,
"nll_loss": 0.26620903611183167,
"rewards/accuracies": 0.984375,
"rewards/chosen": 0.17993758618831635,
"rewards/margins": 3.0553667545318604,
"rewards/rejected": -2.8754286766052246,
"step": 177,
"train_speed(iter/s)": 0.005664
},
{
"epoch": 1.0662401204365826,
"grad_norm": 3.2801098823547363,
"learning_rate": 9.651005032974994e-05,
"logits/chosen": -0.33594202995300293,
"logits/rejected": -0.564365029335022,
"logps/chosen": -3.6123833656311035,
"logps/rejected": -49.69728088378906,
"loss": 0.4477875828742981,
"memory(GiB)": 46.13,
"nll_loss": 0.2894076108932495,
"rewards/accuracies": 0.953125,
"rewards/chosen": 0.19575706124305725,
"rewards/margins": 3.35469388961792,
"rewards/rejected": -3.1589369773864746,
"step": 178,
"train_speed(iter/s)": 0.005664
},
{
"epoch": 1.072261949567181,
"grad_norm": 1.4043627977371216,
"learning_rate": 9.551351696494854e-05,
"logits/chosen": -0.37707191705703735,
"logits/rejected": -0.5827841758728027,
"logps/chosen": -2.930352210998535,
"logps/rejected": -50.44269943237305,
"loss": 0.3742366135120392,
"memory(GiB)": 46.13,
"nll_loss": 0.2148890197277069,
"rewards/accuracies": 0.953125,
"rewards/chosen": 0.21785704791545868,
"rewards/margins": 3.5218472480773926,
"rewards/rejected": -3.303990364074707,
"step": 179,
"train_speed(iter/s)": 0.005664
},
{
"epoch": 1.0782837786977795,
"grad_norm": 1.5572144985198975,
"learning_rate": 9.451742985306398e-05,
"logits/chosen": -0.45742160081863403,
"logits/rejected": -0.6289136409759521,
"logps/chosen": -4.650609016418457,
"logps/rejected": -44.8750114440918,
"loss": 0.4705524444580078,
"memory(GiB)": 46.13,
"nll_loss": 0.3358931541442871,
"rewards/accuracies": 0.96875,
"rewards/chosen": 0.2931283414363861,
"rewards/margins": 3.50144624710083,
"rewards/rejected": -3.2083182334899902,
"step": 180,
"train_speed(iter/s)": 0.005664
},
{
"epoch": 1.084305607828378,
"grad_norm": 2.9546408653259277,
"learning_rate": 9.352188807098481e-05,
"logits/chosen": -0.4296163320541382,
"logits/rejected": -0.5809882879257202,
"logps/chosen": -4.599586009979248,
"logps/rejected": -42.98283386230469,
"loss": 0.5064187049865723,
"memory(GiB)": 46.13,
"nll_loss": 0.32983240485191345,
"rewards/accuracies": 0.953125,
"rewards/chosen": 0.33693230152130127,
"rewards/margins": 3.1911778450012207,
"rewards/rejected": -2.854245662689209,
"step": 181,
"train_speed(iter/s)": 0.005663
},
{
"epoch": 1.0903274369589764,
"grad_norm": 1.369982123374939,
"learning_rate": 9.252699064135758e-05,
"logits/chosen": -0.5194458961486816,
"logits/rejected": -0.7049198746681213,
"logps/chosen": -2.871542453765869,
"logps/rejected": -51.704444885253906,
"loss": 0.36053964495658875,
"memory(GiB)": 46.13,
"nll_loss": 0.25251564383506775,
"rewards/accuracies": 0.984375,
"rewards/chosen": 0.25039854645729065,
"rewards/margins": 4.2018303871154785,
"rewards/rejected": -3.9514317512512207,
"step": 182,
"train_speed(iter/s)": 0.005664
},
{
"epoch": 1.0963492660895746,
"grad_norm": 3.087183713912964,
"learning_rate": 9.153283652273768e-05,
"logits/chosen": -0.42322614789009094,
"logits/rejected": -0.687001645565033,
"logps/chosen": -5.198493957519531,
"logps/rejected": -59.92394256591797,
"loss": 0.49455440044403076,
"memory(GiB)": 46.13,
"nll_loss": 0.391512006521225,
"rewards/accuracies": 0.984375,
"rewards/chosen": 0.19199909269809723,
"rewards/margins": 4.593501091003418,
"rewards/rejected": -4.401501178741455,
"step": 183,
"train_speed(iter/s)": 0.005663
},
{
"epoch": 1.102371095220173,
"grad_norm": 2.106433391571045,
"learning_rate": 9.05395245997463e-05,
"logits/chosen": -0.44497790932655334,
"logits/rejected": -0.6745092272758484,
"logps/chosen": -4.499228477478027,
"logps/rejected": -65.7539291381836,
"loss": 0.4104112982749939,
"memory(GiB)": 46.13,
"nll_loss": 0.3255768418312073,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.31253090500831604,
"rewards/margins": 5.569586753845215,
"rewards/rejected": -5.257055759429932,
"step": 184,
"train_speed(iter/s)": 0.005663
},
{
"epoch": 1.1083929243507715,
"grad_norm": 3.478254556655884,
"learning_rate": 8.954715367323468e-05,
"logits/chosen": -0.4755058288574219,
"logits/rejected": -0.7400538325309753,
"logps/chosen": -4.192931175231934,
"logps/rejected": -58.25489044189453,
"loss": 0.49360448122024536,
"memory(GiB)": 46.13,
"nll_loss": 0.3856234550476074,
"rewards/accuracies": 0.984375,
"rewards/chosen": 0.23331968486309052,
"rewards/margins": 4.7285542488098145,
"rewards/rejected": -4.495234489440918,
"step": 185,
"train_speed(iter/s)": 0.005663
},
{
"epoch": 1.11441475348137,
"grad_norm": 3.7779037952423096,
"learning_rate": 8.855582245045683e-05,
"logits/chosen": -0.47070175409317017,
"logits/rejected": -0.6918365955352783,
"logps/chosen": -5.071094036102295,
"logps/rejected": -53.90576934814453,
"loss": 0.6311454772949219,
"memory(GiB)": 46.13,
"nll_loss": 0.44870883226394653,
"rewards/accuracies": 0.921875,
"rewards/chosen": 0.04279123246669769,
"rewards/margins": 4.136241912841797,
"rewards/rejected": -4.093451023101807,
"step": 186,
"train_speed(iter/s)": 0.005663
},
{
"epoch": 1.1204365826119684,
"grad_norm": 7.022064685821533,
"learning_rate": 8.756562953525152e-05,
"logits/chosen": -0.432133287191391,
"logits/rejected": -0.776434063911438,
"logps/chosen": -3.279095411300659,
"logps/rejected": -69.65541076660156,
"loss": 0.3344402611255646,
"memory(GiB)": 46.13,
"nll_loss": 0.2780175805091858,
"rewards/accuracies": 0.984375,
"rewards/chosen": 0.25577378273010254,
"rewards/margins": 5.72814416885376,
"rewards/rejected": -5.472370624542236,
"step": 187,
"train_speed(iter/s)": 0.005663
},
{
"epoch": 1.126458411742567,
"grad_norm": 2.485914945602417,
"learning_rate": 8.657667341823448e-05,
"logits/chosen": -0.49354246258735657,
"logits/rejected": -0.7343668341636658,
"logps/chosen": -4.402050971984863,
"logps/rejected": -56.273170471191406,
"loss": 0.454555481672287,
"memory(GiB)": 46.13,
"nll_loss": 0.3319138288497925,
"rewards/accuracies": 0.96875,
"rewards/chosen": 0.23367615044116974,
"rewards/margins": 4.513181209564209,
"rewards/rejected": -4.279505252838135,
"step": 188,
"train_speed(iter/s)": 0.005663
},
{
"epoch": 1.1324802408731651,
"grad_norm": 1.653633713722229,
"learning_rate": 8.558905246700201e-05,
"logits/chosen": -0.47012466192245483,
"logits/rejected": -0.7377257943153381,
"logps/chosen": -2.28665828704834,
"logps/rejected": -65.824462890625,
"loss": 0.31783220171928406,
"memory(GiB)": 46.13,
"nll_loss": 0.21150296926498413,
"rewards/accuracies": 0.984375,
"rewards/chosen": 0.2025526762008667,
"rewards/margins": 5.142179012298584,
"rewards/rejected": -4.939626216888428,
"step": 189,
"train_speed(iter/s)": 0.005663
},
{
"epoch": 1.1385020700037636,
"grad_norm": 1.506331443786621,
"learning_rate": 8.460286491634663e-05,
"logits/chosen": -0.45535990595817566,
"logits/rejected": -0.6702480316162109,
"logps/chosen": -6.301774978637695,
"logps/rejected": -60.1036262512207,
"loss": 0.41861438751220703,
"memory(GiB)": 46.13,
"nll_loss": 0.35035622119903564,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.4653804302215576,
"rewards/margins": 4.745593547821045,
"rewards/rejected": -4.280213356018066,
"step": 190,
"train_speed(iter/s)": 0.005662
},
{
"epoch": 1.144523899134362,
"grad_norm": 7.771515369415283,
"learning_rate": 8.361820885848624e-05,
"logits/chosen": -0.559324324131012,
"logits/rejected": -0.7053715586662292,
"logps/chosen": -6.118768692016602,
"logps/rejected": -52.78406524658203,
"loss": 0.6141310930252075,
"memory(GiB)": 46.13,
"nll_loss": 0.4540223479270935,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.3042090833187103,
"rewards/margins": 4.374350547790527,
"rewards/rejected": -4.070141792297363,
"step": 191,
"train_speed(iter/s)": 0.005662
},
{
"epoch": 1.1505457282649605,
"grad_norm": 2.293672800064087,
"learning_rate": 8.263518223330697e-05,
"logits/chosen": -0.49931055307388306,
"logits/rejected": -0.7118666768074036,
"logps/chosen": -4.773472785949707,
"logps/rejected": -52.72026824951172,
"loss": 0.43889304995536804,
"memory(GiB)": 46.13,
"nll_loss": 0.34974291920661926,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.32993441820144653,
"rewards/margins": 4.337234973907471,
"rewards/rejected": -4.00730037689209,
"step": 192,
"train_speed(iter/s)": 0.005662
},
{
"epoch": 1.156567557395559,
"grad_norm": 2.9582977294921875,
"learning_rate": 8.165388281862178e-05,
"logits/chosen": -0.5245535373687744,
"logits/rejected": -0.7488053441047668,
"logps/chosen": -4.319539546966553,
"logps/rejected": -49.7554817199707,
"loss": 0.4565528333187103,
"memory(GiB)": 46.13,
"nll_loss": 0.34413373470306396,
"rewards/accuracies": 0.984375,
"rewards/chosen": 0.2616381347179413,
"rewards/margins": 3.892477512359619,
"rewards/rejected": -3.6308393478393555,
"step": 193,
"train_speed(iter/s)": 0.005662
},
{
"epoch": 1.1625893865261574,
"grad_norm": 2.9784886837005615,
"learning_rate": 8.067440822044469e-05,
"logits/chosen": -0.548271894454956,
"logits/rejected": -0.7532668113708496,
"logps/chosen": -6.1191020011901855,
"logps/rejected": -50.176265716552734,
"loss": 0.6044948101043701,
"memory(GiB)": 46.13,
"nll_loss": 0.49495670199394226,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.20567229390144348,
"rewards/margins": 4.019640922546387,
"rewards/rejected": -3.8139681816101074,
"step": 194,
"train_speed(iter/s)": 0.005662
},
{
"epoch": 1.1686112156567559,
"grad_norm": 1.896803617477417,
"learning_rate": 7.96968558632824e-05,
"logits/chosen": -0.4820174276828766,
"logits/rejected": -0.7427547574043274,
"logps/chosen": -6.175469875335693,
"logps/rejected": -60.446834564208984,
"loss": 0.5533992648124695,
"memory(GiB)": 46.13,
"nll_loss": 0.4257928133010864,
"rewards/accuracies": 0.953125,
"rewards/chosen": 0.25794556736946106,
"rewards/margins": 4.815202236175537,
"rewards/rejected": -4.557256698608398,
"step": 195,
"train_speed(iter/s)": 0.005662
},
{
"epoch": 1.174633044787354,
"grad_norm": 2.890577554702759,
"learning_rate": 7.872132298044382e-05,
"logits/chosen": -0.47485801577568054,
"logits/rejected": -0.7618663311004639,
"logps/chosen": -2.814539909362793,
"logps/rejected": -54.596343994140625,
"loss": 0.3804952800273895,
"memory(GiB)": 46.13,
"nll_loss": 0.24290579557418823,
"rewards/accuracies": 0.953125,
"rewards/chosen": 0.3001152276992798,
"rewards/margins": 4.137256622314453,
"rewards/rejected": -3.8371410369873047,
"step": 196,
"train_speed(iter/s)": 0.005662
},
{
"epoch": 1.1806548739179525,
"grad_norm": 3.058959722518921,
"learning_rate": 7.774790660436858e-05,
"logits/chosen": -0.5394716262817383,
"logits/rejected": -0.7631605267524719,
"logps/chosen": -5.447549819946289,
"logps/rejected": -47.610145568847656,
"loss": 0.5637054443359375,
"memory(GiB)": 46.13,
"nll_loss": 0.4707457423210144,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.3298027515411377,
"rewards/margins": 3.690687656402588,
"rewards/rejected": -3.36088490486145,
"step": 197,
"train_speed(iter/s)": 0.005662
},
{
"epoch": 1.186676703048551,
"grad_norm": 1.5582202672958374,
"learning_rate": 7.677670355697577e-05,
"logits/chosen": -0.3999323546886444,
"logits/rejected": -0.7442487478256226,
"logps/chosen": -2.5974080562591553,
"logps/rejected": -62.564483642578125,
"loss": 0.33909475803375244,
"memory(GiB)": 46.13,
"nll_loss": 0.25633975863456726,
"rewards/accuracies": 0.96875,
"rewards/chosen": 0.32342803478240967,
"rewards/margins": 4.781001091003418,
"rewards/rejected": -4.457572937011719,
"step": 198,
"train_speed(iter/s)": 0.005662
},
{
"epoch": 1.1926985321791495,
"grad_norm": 1.2910958528518677,
"learning_rate": 7.580781044003324e-05,
"logits/chosen": -0.4777570068836212,
"logits/rejected": -0.7280046343803406,
"logps/chosen": -3.076066493988037,
"logps/rejected": -55.281494140625,
"loss": 0.32068008184432983,
"memory(GiB)": 46.13,
"nll_loss": 0.2149108499288559,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.284832626581192,
"rewards/margins": 4.372798442840576,
"rewards/rejected": -4.087965488433838,
"step": 199,
"train_speed(iter/s)": 0.005661
},
{
"epoch": 1.198720361309748,
"grad_norm": 2.6249725818634033,
"learning_rate": 7.484132362554915e-05,
"logits/chosen": -0.5193163752555847,
"logits/rejected": -0.7307865619659424,
"logps/chosen": -6.235736846923828,
"logps/rejected": -44.48322677612305,
"loss": 0.6363410353660583,
"memory(GiB)": 46.13,
"nll_loss": 0.44810640811920166,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.32792535424232483,
"rewards/margins": 3.486876964569092,
"rewards/rejected": -3.158951759338379,
"step": 200,
"train_speed(iter/s)": 0.005661
}
],
"logging_steps": 1,
"max_steps": 332,
"num_input_tokens_seen": 0,
"num_train_epochs": 2,
"save_steps": 50,
"stateful_callbacks": {
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": true,
"should_training_stop": false
},
"attributes": {}
}
},
"total_flos": 2.2880892584198144e+17,
"train_batch_size": 4,
"trial_name": null,
"trial_params": null
}