PEFT
Safetensors
pairgt705r16-200 / trainer_state.json
windgrin's picture
Upload folder using huggingface_hub
14a9621 verified
Raw
History Blame Contribute Delete
32.7 kB
{
"best_global_step": null,
"best_metric": null,
"best_model_checkpoint": null,
"epoch": 0.11157601115760112,
"eval_steps": 300,
"global_step": 50,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"epoch": 0.0022315202231520223,
"grad_norm": 8.175573348999023,
"learning_rate": 4.444444444444445e-06,
"logits/chosen": -0.48349103331565857,
"logits/rejected": -0.652603030204773,
"logps/chosen": -8.859519004821777,
"logps/rejected": -16.016435623168945,
"loss": 1.3468515872955322,
"memory(GiB)": 33.44,
"nll_loss": 0.6537042856216431,
"rewards/accuracies": 0.0,
"rewards/chosen": 0.0,
"rewards/margins": 0.0,
"rewards/rejected": 0.0,
"step": 1,
"train_speed(iter/s)": 0.010093
},
{
"epoch": 0.004463040446304045,
"grad_norm": 6.496051788330078,
"learning_rate": 8.88888888888889e-06,
"logits/chosen": -0.5174899101257324,
"logits/rejected": -0.6262180805206299,
"logps/chosen": -9.287378311157227,
"logps/rejected": -13.981985092163086,
"loss": 1.290852665901184,
"memory(GiB)": 36.3,
"nll_loss": 0.5977055430412292,
"rewards/accuracies": 0.0,
"rewards/chosen": 0.0,
"rewards/margins": 0.0,
"rewards/rejected": 0.0,
"step": 2,
"train_speed(iter/s)": 0.010436
},
{
"epoch": 0.0066945606694560665,
"grad_norm": 5.3426923751831055,
"learning_rate": 1.3333333333333333e-05,
"logits/chosen": -0.4254978895187378,
"logits/rejected": -0.6118676662445068,
"logps/chosen": -6.5775346755981445,
"logps/rejected": -16.196733474731445,
"loss": 1.1887776851654053,
"memory(GiB)": 36.3,
"nll_loss": 0.49580031633377075,
"rewards/accuracies": 0.46875,
"rewards/chosen": -0.0025197849608957767,
"rewards/margins": 0.0005687186494469643,
"rewards/rejected": -0.0030885031446814537,
"step": 3,
"train_speed(iter/s)": 0.010535
},
{
"epoch": 0.00892608089260809,
"grad_norm": 5.717321395874023,
"learning_rate": 1.777777777777778e-05,
"logits/chosen": -0.5246356129646301,
"logits/rejected": -0.651706337928772,
"logps/chosen": -7.447962760925293,
"logps/rejected": -16.996183395385742,
"loss": 1.3215211629867554,
"memory(GiB)": 39.38,
"nll_loss": 0.632453203201294,
"rewards/accuracies": 0.53125,
"rewards/chosen": 0.004622042179107666,
"rewards/margins": 0.008373789489269257,
"rewards/rejected": -0.0037517473101615906,
"step": 4,
"train_speed(iter/s)": 0.010586
},
{
"epoch": 0.011157601115760111,
"grad_norm": 7.188594341278076,
"learning_rate": 2.2222222222222223e-05,
"logits/chosen": -0.5062788128852844,
"logits/rejected": -0.6033568382263184,
"logps/chosen": -7.093954086303711,
"logps/rejected": -15.186193466186523,
"loss": 1.0765105485916138,
"memory(GiB)": 39.38,
"nll_loss": 0.4042052626609802,
"rewards/accuracies": 0.75,
"rewards/chosen": 0.018988817930221558,
"rewards/margins": 0.04282933473587036,
"rewards/rejected": -0.023840520530939102,
"step": 5,
"train_speed(iter/s)": 0.010619
},
{
"epoch": 0.013389121338912133,
"grad_norm": 3.8232157230377197,
"learning_rate": 2.6666666666666667e-05,
"logits/chosen": -0.4826778173446655,
"logits/rejected": -0.5863982439041138,
"logps/chosen": -6.322361946105957,
"logps/rejected": -16.8499755859375,
"loss": 1.2770025730133057,
"memory(GiB)": 39.38,
"nll_loss": 0.6041065454483032,
"rewards/accuracies": 0.65625,
"rewards/chosen": 0.007987724617123604,
"rewards/margins": 0.0449829027056694,
"rewards/rejected": -0.03699517622590065,
"step": 6,
"train_speed(iter/s)": 0.010645
},
{
"epoch": 0.015620641562064157,
"grad_norm": 3.0141377449035645,
"learning_rate": 3.111111111111111e-05,
"logits/chosen": -0.557126522064209,
"logits/rejected": -0.6060188412666321,
"logps/chosen": -5.420467853546143,
"logps/rejected": -11.815977096557617,
"loss": 1.1219334602355957,
"memory(GiB)": 39.38,
"nll_loss": 0.46769219636917114,
"rewards/accuracies": 0.65625,
"rewards/chosen": 0.010057949461042881,
"rewards/margins": 0.10709290951490402,
"rewards/rejected": -0.09703496098518372,
"step": 7,
"train_speed(iter/s)": 0.010666
},
{
"epoch": 0.01785216178521618,
"grad_norm": 2.8756191730499268,
"learning_rate": 3.555555555555556e-05,
"logits/chosen": -0.5616711378097534,
"logits/rejected": -0.6365323066711426,
"logps/chosen": -6.283439636230469,
"logps/rejected": -19.981098175048828,
"loss": 0.8637306690216064,
"memory(GiB)": 39.38,
"nll_loss": 0.33207178115844727,
"rewards/accuracies": 0.8125,
"rewards/chosen": -0.011994147673249245,
"rewards/margins": 0.4002670347690582,
"rewards/rejected": -0.4122611880302429,
"step": 8,
"train_speed(iter/s)": 0.010684
},
{
"epoch": 0.0200836820083682,
"grad_norm": 5.291012763977051,
"learning_rate": 4e-05,
"logits/chosen": -0.502879798412323,
"logits/rejected": -0.5977268815040588,
"logps/chosen": -16.167051315307617,
"logps/rejected": -20.485633850097656,
"loss": 1.618671178817749,
"memory(GiB)": 39.38,
"nll_loss": 1.0418576002120972,
"rewards/accuracies": 0.71875,
"rewards/chosen": -0.21173161268234253,
"rewards/margins": 0.39757153391838074,
"rewards/rejected": -0.6093031167984009,
"step": 9,
"train_speed(iter/s)": 0.010694
},
{
"epoch": 0.022315202231520222,
"grad_norm": 5.504859447479248,
"learning_rate": 4.4444444444444447e-05,
"logits/chosen": -0.4140257239341736,
"logits/rejected": -0.5436943173408508,
"logps/chosen": -10.317049026489258,
"logps/rejected": -26.558115005493164,
"loss": 1.271435260772705,
"memory(GiB)": 39.38,
"nll_loss": 0.6719653606414795,
"rewards/accuracies": 0.65625,
"rewards/chosen": -0.2977833151817322,
"rewards/margins": 0.4953876733779907,
"rewards/rejected": -0.7931710481643677,
"step": 10,
"train_speed(iter/s)": 0.010695
},
{
"epoch": 0.024546722454672244,
"grad_norm": 8.8348970413208,
"learning_rate": 4.888888888888889e-05,
"logits/chosen": -0.4538601040840149,
"logits/rejected": -0.5884804129600525,
"logps/chosen": -15.600846290588379,
"logps/rejected": -27.856977462768555,
"loss": 1.6294305324554443,
"memory(GiB)": 39.38,
"nll_loss": 1.0609474182128906,
"rewards/accuracies": 0.71875,
"rewards/chosen": -0.48508310317993164,
"rewards/margins": 0.41195282340049744,
"rewards/rejected": -0.8970359563827515,
"step": 11,
"train_speed(iter/s)": 0.0107
},
{
"epoch": 0.026778242677824266,
"grad_norm": 4.871168613433838,
"learning_rate": 5.333333333333333e-05,
"logits/chosen": -0.4462035596370697,
"logits/rejected": -0.5622009634971619,
"logps/chosen": -10.827975273132324,
"logps/rejected": -27.8737850189209,
"loss": 1.309844732284546,
"memory(GiB)": 42.78,
"nll_loss": 0.6817098259925842,
"rewards/accuracies": 0.59375,
"rewards/chosen": -0.34655484557151794,
"rewards/margins": 0.38605934381484985,
"rewards/rejected": -0.7326142191886902,
"step": 12,
"train_speed(iter/s)": 0.010701
},
{
"epoch": 0.02900976290097629,
"grad_norm": 5.154696464538574,
"learning_rate": 5.7777777777777776e-05,
"logits/chosen": -0.45840126276016235,
"logits/rejected": -0.5749193429946899,
"logps/chosen": -9.034074783325195,
"logps/rejected": -23.558507919311523,
"loss": 1.3584285974502563,
"memory(GiB)": 42.78,
"nll_loss": 0.8017209768295288,
"rewards/accuracies": 0.75,
"rewards/chosen": -0.15672500431537628,
"rewards/margins": 0.44559869170188904,
"rewards/rejected": -0.6023237109184265,
"step": 13,
"train_speed(iter/s)": 0.010704
},
{
"epoch": 0.031241283124128313,
"grad_norm": 2.928802013397217,
"learning_rate": 6.222222222222222e-05,
"logits/chosen": -0.4339243173599243,
"logits/rejected": -0.5222603678703308,
"logps/chosen": -7.9224724769592285,
"logps/rejected": -25.263307571411133,
"loss": 1.176775574684143,
"memory(GiB)": 46.23,
"nll_loss": 0.548651397228241,
"rewards/accuracies": 0.6875,
"rewards/chosen": -0.09932564944028854,
"rewards/margins": 0.27659934759140015,
"rewards/rejected": -0.3759249448776245,
"step": 14,
"train_speed(iter/s)": 0.010698
},
{
"epoch": 0.03347280334728033,
"grad_norm": 1.9422496557235718,
"learning_rate": 6.666666666666667e-05,
"logits/chosen": -0.4753529131412506,
"logits/rejected": -0.5179453492164612,
"logps/chosen": -8.660318374633789,
"logps/rejected": -16.743135452270508,
"loss": 1.1362940073013306,
"memory(GiB)": 46.23,
"nll_loss": 0.5188332796096802,
"rewards/accuracies": 0.71875,
"rewards/chosen": -0.09274716675281525,
"rewards/margins": 0.20326045155525208,
"rewards/rejected": -0.29600760340690613,
"step": 15,
"train_speed(iter/s)": 0.010702
},
{
"epoch": 0.03570432357043236,
"grad_norm": 1.7832196950912476,
"learning_rate": 7.111111111111112e-05,
"logits/chosen": -0.39417293667793274,
"logits/rejected": -0.5316826701164246,
"logps/chosen": -4.724964618682861,
"logps/rejected": -19.69357681274414,
"loss": 1.0538526773452759,
"memory(GiB)": 46.23,
"nll_loss": 0.4770840108394623,
"rewards/accuracies": 0.84375,
"rewards/chosen": 0.06691457331180573,
"rewards/margins": 0.27725517749786377,
"rewards/rejected": -0.21034058928489685,
"step": 16,
"train_speed(iter/s)": 0.010702
},
{
"epoch": 0.03793584379358438,
"grad_norm": 1.5563856363296509,
"learning_rate": 7.555555555555556e-05,
"logits/chosen": -0.4563882350921631,
"logits/rejected": -0.5541551113128662,
"logps/chosen": -9.05321979522705,
"logps/rejected": -18.82474708557129,
"loss": 1.2152374982833862,
"memory(GiB)": 46.23,
"nll_loss": 0.6201823353767395,
"rewards/accuracies": 0.75,
"rewards/chosen": 0.11768844723701477,
"rewards/margins": 0.2521967887878418,
"rewards/rejected": -0.13450834155082703,
"step": 17,
"train_speed(iter/s)": 0.010706
},
{
"epoch": 0.0401673640167364,
"grad_norm": 1.9268314838409424,
"learning_rate": 8e-05,
"logits/chosen": -0.4476441740989685,
"logits/rejected": -0.4938126504421234,
"logps/chosen": -9.981496810913086,
"logps/rejected": -14.752214431762695,
"loss": 1.1654764413833618,
"memory(GiB)": 46.23,
"nll_loss": 0.46348586678504944,
"rewards/accuracies": 0.53125,
"rewards/chosen": 0.008895257487893105,
"rewards/margins": 0.039339594542980194,
"rewards/rejected": -0.030444344505667686,
"step": 18,
"train_speed(iter/s)": 0.010707
},
{
"epoch": 0.042398884239888426,
"grad_norm": 1.6981456279754639,
"learning_rate": 8.444444444444444e-05,
"logits/chosen": -0.49693721532821655,
"logits/rejected": -0.5383259057998657,
"logps/chosen": -7.632569313049316,
"logps/rejected": -17.26980209350586,
"loss": 1.1578692197799683,
"memory(GiB)": 46.23,
"nll_loss": 0.5097256898880005,
"rewards/accuracies": 0.59375,
"rewards/chosen": 0.06525340676307678,
"rewards/margins": 0.123507060110569,
"rewards/rejected": -0.05825363099575043,
"step": 19,
"train_speed(iter/s)": 0.010709
},
{
"epoch": 0.044630404463040445,
"grad_norm": 2.013322591781616,
"learning_rate": 8.888888888888889e-05,
"logits/chosen": -0.4885023236274719,
"logits/rejected": -0.5652343034744263,
"logps/chosen": -6.508520603179932,
"logps/rejected": -13.635923385620117,
"loss": 1.0892918109893799,
"memory(GiB)": 46.23,
"nll_loss": 0.45972177386283875,
"rewards/accuracies": 0.53125,
"rewards/chosen": 0.06720655411481857,
"rewards/margins": 0.18712735176086426,
"rewards/rejected": -0.11992079019546509,
"step": 20,
"train_speed(iter/s)": 0.010713
},
{
"epoch": 0.04686192468619247,
"grad_norm": 1.775608777999878,
"learning_rate": 9.333333333333334e-05,
"logits/chosen": -0.4235825836658478,
"logits/rejected": -0.4997040629386902,
"logps/chosen": -7.756269454956055,
"logps/rejected": -22.05597496032715,
"loss": 1.1610935926437378,
"memory(GiB)": 46.81,
"nll_loss": 0.5124741792678833,
"rewards/accuracies": 0.71875,
"rewards/chosen": 0.056686438620090485,
"rewards/margins": 0.15342777967453003,
"rewards/rejected": -0.09674134850502014,
"step": 21,
"train_speed(iter/s)": 0.010711
},
{
"epoch": 0.04909344490934449,
"grad_norm": 1.6878494024276733,
"learning_rate": 9.777777777777778e-05,
"logits/chosen": -0.448173850774765,
"logits/rejected": -0.46942824125289917,
"logps/chosen": -9.774542808532715,
"logps/rejected": -14.852673530578613,
"loss": 1.1857895851135254,
"memory(GiB)": 46.81,
"nll_loss": 0.5429187417030334,
"rewards/accuracies": 0.53125,
"rewards/chosen": 0.08716461062431335,
"rewards/margins": 0.17264463007450104,
"rewards/rejected": -0.08548003435134888,
"step": 22,
"train_speed(iter/s)": 0.01071
},
{
"epoch": 0.051324965132496514,
"grad_norm": 1.9283621311187744,
"learning_rate": 0.00010222222222222222,
"logits/chosen": -0.4297652244567871,
"logits/rejected": -0.5464367866516113,
"logps/chosen": -7.680075168609619,
"logps/rejected": -20.64339828491211,
"loss": 1.1528663635253906,
"memory(GiB)": 46.81,
"nll_loss": 0.48048245906829834,
"rewards/accuracies": 0.46875,
"rewards/chosen": 0.05369298905134201,
"rewards/margins": 0.09629381448030472,
"rewards/rejected": -0.04260082542896271,
"step": 23,
"train_speed(iter/s)": 0.01071
},
{
"epoch": 0.05355648535564853,
"grad_norm": 1.8897244930267334,
"learning_rate": 0.00010666666666666667,
"logits/chosen": -0.4073754847049713,
"logits/rejected": -0.4649578034877777,
"logps/chosen": -9.451826095581055,
"logps/rejected": -20.540328979492188,
"loss": 1.0510568618774414,
"memory(GiB)": 46.81,
"nll_loss": 0.431056946516037,
"rewards/accuracies": 0.625,
"rewards/chosen": 0.055333852767944336,
"rewards/margins": 0.23058435320854187,
"rewards/rejected": -0.17525050044059753,
"step": 24,
"train_speed(iter/s)": 0.010709
},
{
"epoch": 0.05578800557880056,
"grad_norm": 1.968520998954773,
"learning_rate": 0.00011111111111111112,
"logits/chosen": -0.4085446000099182,
"logits/rejected": -0.49927735328674316,
"logps/chosen": -9.85863971710205,
"logps/rejected": -21.732637405395508,
"loss": 1.166273593902588,
"memory(GiB)": 46.81,
"nll_loss": 0.5423365831375122,
"rewards/accuracies": 0.71875,
"rewards/chosen": 0.03325103968381882,
"rewards/margins": 0.2285088747739792,
"rewards/rejected": -0.19525781273841858,
"step": 25,
"train_speed(iter/s)": 0.010709
},
{
"epoch": 0.05801952580195258,
"grad_norm": 3.0135302543640137,
"learning_rate": 0.00011555555555555555,
"logits/chosen": -0.44835054874420166,
"logits/rejected": -0.5419439077377319,
"logps/chosen": -4.6747965812683105,
"logps/rejected": -18.435997009277344,
"loss": 0.9960591793060303,
"memory(GiB)": 46.81,
"nll_loss": 0.39432889223098755,
"rewards/accuracies": 0.6875,
"rewards/chosen": -0.017948223277926445,
"rewards/margins": 0.27569395303726196,
"rewards/rejected": -0.29364219307899475,
"step": 26,
"train_speed(iter/s)": 0.010712
},
{
"epoch": 0.0602510460251046,
"grad_norm": 2.0994958877563477,
"learning_rate": 0.00012,
"logits/chosen": -0.4755466878414154,
"logits/rejected": -0.513874888420105,
"logps/chosen": -14.17818832397461,
"logps/rejected": -15.192220687866211,
"loss": 1.3128914833068848,
"memory(GiB)": 46.81,
"nll_loss": 0.732846736907959,
"rewards/accuracies": 0.84375,
"rewards/chosen": 0.11946821957826614,
"rewards/margins": 0.27503034472465515,
"rewards/rejected": -0.1555621325969696,
"step": 27,
"train_speed(iter/s)": 0.010714
},
{
"epoch": 0.06248256624825663,
"grad_norm": 2.619943857192993,
"learning_rate": 0.00012444444444444444,
"logits/chosen": -0.33525484800338745,
"logits/rejected": -0.4649803340435028,
"logps/chosen": -6.553568363189697,
"logps/rejected": -23.942062377929688,
"loss": 1.007144808769226,
"memory(GiB)": 46.81,
"nll_loss": 0.4446461498737335,
"rewards/accuracies": 0.78125,
"rewards/chosen": 0.07584571838378906,
"rewards/margins": 0.3631606996059418,
"rewards/rejected": -0.2873149812221527,
"step": 28,
"train_speed(iter/s)": 0.010711
},
{
"epoch": 0.06471408647140865,
"grad_norm": 2.1066770553588867,
"learning_rate": 0.00012888888888888892,
"logits/chosen": -0.37913525104522705,
"logits/rejected": -0.4620123505592346,
"logps/chosen": -7.321231842041016,
"logps/rejected": -21.526382446289062,
"loss": 1.0192487239837646,
"memory(GiB)": 46.81,
"nll_loss": 0.4804428219795227,
"rewards/accuracies": 0.84375,
"rewards/chosen": 0.026389580219984055,
"rewards/margins": 0.46746930480003357,
"rewards/rejected": -0.441079705953598,
"step": 29,
"train_speed(iter/s)": 0.010712
},
{
"epoch": 0.06694560669456066,
"grad_norm": 1.8226919174194336,
"learning_rate": 0.00013333333333333334,
"logits/chosen": -0.3827905058860779,
"logits/rejected": -0.48159855604171753,
"logps/chosen": -6.776709079742432,
"logps/rejected": -22.80392074584961,
"loss": 1.0347448587417603,
"memory(GiB)": 46.81,
"nll_loss": 0.500119149684906,
"rewards/accuracies": 0.8125,
"rewards/chosen": 0.10474913567304611,
"rewards/margins": 0.39701035618782043,
"rewards/rejected": -0.2922612428665161,
"step": 30,
"train_speed(iter/s)": 0.010712
},
{
"epoch": 0.06917712691771269,
"grad_norm": 1.8681020736694336,
"learning_rate": 0.0001377777777777778,
"logits/chosen": -0.3609718978404999,
"logits/rejected": -0.43842607736587524,
"logps/chosen": -5.881144046783447,
"logps/rejected": -21.236047744750977,
"loss": 0.9905272126197815,
"memory(GiB)": 46.81,
"nll_loss": 0.43477141857147217,
"rewards/accuracies": 0.6875,
"rewards/chosen": 0.04010690003633499,
"rewards/margins": 0.3823702037334442,
"rewards/rejected": -0.34226328134536743,
"step": 31,
"train_speed(iter/s)": 0.010714
},
{
"epoch": 0.07140864714086471,
"grad_norm": 2.225977897644043,
"learning_rate": 0.00014222222222222224,
"logits/chosen": -0.39412301778793335,
"logits/rejected": -0.4322904050350189,
"logps/chosen": -10.140836715698242,
"logps/rejected": -18.79208755493164,
"loss": 1.0995820760726929,
"memory(GiB)": 46.81,
"nll_loss": 0.5035545229911804,
"rewards/accuracies": 0.6875,
"rewards/chosen": 0.04120786115527153,
"rewards/margins": 0.2624339461326599,
"rewards/rejected": -0.22122608125209808,
"step": 32,
"train_speed(iter/s)": 0.010716
},
{
"epoch": 0.07364016736401674,
"grad_norm": 2.788853406906128,
"learning_rate": 0.00014666666666666666,
"logits/chosen": -0.27406275272369385,
"logits/rejected": -0.371414452791214,
"logps/chosen": -12.10950756072998,
"logps/rejected": -24.930038452148438,
"loss": 1.2428903579711914,
"memory(GiB)": 46.81,
"nll_loss": 0.6102337837219238,
"rewards/accuracies": 0.65625,
"rewards/chosen": -0.08664405345916748,
"rewards/margins": 0.2861720621585846,
"rewards/rejected": -0.3728161156177521,
"step": 33,
"train_speed(iter/s)": 0.010715
},
{
"epoch": 0.07587168758716877,
"grad_norm": 2.416369676589966,
"learning_rate": 0.0001511111111111111,
"logits/chosen": -0.24224025011062622,
"logits/rejected": -0.3833686113357544,
"logps/chosen": -6.028831958770752,
"logps/rejected": -22.455066680908203,
"loss": 0.9914643168449402,
"memory(GiB)": 46.81,
"nll_loss": 0.44179052114486694,
"rewards/accuracies": 0.75,
"rewards/chosen": 0.011510152369737625,
"rewards/margins": 0.5171858668327332,
"rewards/rejected": -0.5056756734848022,
"step": 34,
"train_speed(iter/s)": 0.010714
},
{
"epoch": 0.07810320781032078,
"grad_norm": 4.029798984527588,
"learning_rate": 0.00015555555555555556,
"logits/chosen": -0.2615310847759247,
"logits/rejected": -0.39800190925598145,
"logps/chosen": -5.90588903427124,
"logps/rejected": -24.642311096191406,
"loss": 0.8372505307197571,
"memory(GiB)": 46.81,
"nll_loss": 0.4036243259906769,
"rewards/accuracies": 0.84375,
"rewards/chosen": -0.03906700387597084,
"rewards/margins": 0.8896325826644897,
"rewards/rejected": -0.9286996126174927,
"step": 35,
"train_speed(iter/s)": 0.010715
},
{
"epoch": 0.0803347280334728,
"grad_norm": 2.4356110095977783,
"learning_rate": 0.00016,
"logits/chosen": -0.25296953320503235,
"logits/rejected": -0.3325399160385132,
"logps/chosen": -9.764960289001465,
"logps/rejected": -23.14637565612793,
"loss": 1.0952283143997192,
"memory(GiB)": 46.81,
"nll_loss": 0.641168475151062,
"rewards/accuracies": 0.84375,
"rewards/chosen": 0.002499673515558243,
"rewards/margins": 0.8523399829864502,
"rewards/rejected": -0.8498403429985046,
"step": 36,
"train_speed(iter/s)": 0.010716
},
{
"epoch": 0.08256624825662483,
"grad_norm": 1.9291634559631348,
"learning_rate": 0.00016444444444444444,
"logits/chosen": -0.20930960774421692,
"logits/rejected": -0.3604508936405182,
"logps/chosen": -2.847867488861084,
"logps/rejected": -30.63514518737793,
"loss": 0.6885566711425781,
"memory(GiB)": 46.81,
"nll_loss": 0.2891227900981903,
"rewards/accuracies": 0.84375,
"rewards/chosen": 0.061974309384822845,
"rewards/margins": 1.0785088539123535,
"rewards/rejected": -1.0165345668792725,
"step": 37,
"train_speed(iter/s)": 0.010715
},
{
"epoch": 0.08479776847977685,
"grad_norm": 1.6937510967254639,
"learning_rate": 0.00016888888888888889,
"logits/chosen": -0.2987847626209259,
"logits/rejected": -0.37470635771751404,
"logps/chosen": -6.199091911315918,
"logps/rejected": -19.3011474609375,
"loss": 0.8923996090888977,
"memory(GiB)": 46.81,
"nll_loss": 0.38914668560028076,
"rewards/accuracies": 0.84375,
"rewards/chosen": 0.0021905135363340378,
"rewards/margins": 0.6954408288002014,
"rewards/rejected": -0.6932503581047058,
"step": 38,
"train_speed(iter/s)": 0.010716
},
{
"epoch": 0.08702928870292886,
"grad_norm": 2.106278896331787,
"learning_rate": 0.00017333333333333334,
"logits/chosen": -0.28487277030944824,
"logits/rejected": -0.34711676836013794,
"logps/chosen": -8.657167434692383,
"logps/rejected": -26.564130783081055,
"loss": 1.023146390914917,
"memory(GiB)": 46.81,
"nll_loss": 0.5919384956359863,
"rewards/accuracies": 0.84375,
"rewards/chosen": 0.05617165565490723,
"rewards/margins": 1.1481283903121948,
"rewards/rejected": -1.091956615447998,
"step": 39,
"train_speed(iter/s)": 0.010717
},
{
"epoch": 0.08926080892608089,
"grad_norm": 2.619154214859009,
"learning_rate": 0.00017777777777777779,
"logits/chosen": -0.2898882031440735,
"logits/rejected": -0.3393169343471527,
"logps/chosen": -8.001999855041504,
"logps/rejected": -20.189369201660156,
"loss": 0.9479650855064392,
"memory(GiB)": 46.81,
"nll_loss": 0.42854148149490356,
"rewards/accuracies": 0.6875,
"rewards/chosen": 0.0008942075073719025,
"rewards/margins": 0.7672775983810425,
"rewards/rejected": -0.7663832902908325,
"step": 40,
"train_speed(iter/s)": 0.010719
},
{
"epoch": 0.09149232914923291,
"grad_norm": 2.770841360092163,
"learning_rate": 0.00018222222222222224,
"logits/chosen": -0.22048279643058777,
"logits/rejected": -0.30986371636390686,
"logps/chosen": -5.240083694458008,
"logps/rejected": -22.307451248168945,
"loss": 0.8702710866928101,
"memory(GiB)": 46.81,
"nll_loss": 0.39226293563842773,
"rewards/accuracies": 0.65625,
"rewards/chosen": 0.017199480906128883,
"rewards/margins": 0.9372033476829529,
"rewards/rejected": -0.9200038313865662,
"step": 41,
"train_speed(iter/s)": 0.010719
},
{
"epoch": 0.09372384937238494,
"grad_norm": 4.61620569229126,
"learning_rate": 0.0001866666666666667,
"logits/chosen": -0.30797824263572693,
"logits/rejected": -0.3721832036972046,
"logps/chosen": -10.481635093688965,
"logps/rejected": -23.132564544677734,
"loss": 1.2510943412780762,
"memory(GiB)": 46.81,
"nll_loss": 0.6913026571273804,
"rewards/accuracies": 0.65625,
"rewards/chosen": -0.25621044635772705,
"rewards/margins": 0.5585607886314392,
"rewards/rejected": -0.814771294593811,
"step": 42,
"train_speed(iter/s)": 0.010721
},
{
"epoch": 0.09595536959553697,
"grad_norm": 3.806872844696045,
"learning_rate": 0.00019111111111111114,
"logits/chosen": -0.22567886114120483,
"logits/rejected": -0.3761019706726074,
"logps/chosen": -8.201981544494629,
"logps/rejected": -34.75733184814453,
"loss": 1.0068457126617432,
"memory(GiB)": 46.81,
"nll_loss": 0.6396302580833435,
"rewards/accuracies": 0.78125,
"rewards/chosen": -0.12671321630477905,
"rewards/margins": 1.7875899076461792,
"rewards/rejected": -1.914302945137024,
"step": 43,
"train_speed(iter/s)": 0.010722
},
{
"epoch": 0.09818688981868898,
"grad_norm": 3.342564821243286,
"learning_rate": 0.00019555555555555556,
"logits/chosen": -0.259334534406662,
"logits/rejected": -0.33293721079826355,
"logps/chosen": -9.735747337341309,
"logps/rejected": -34.48583221435547,
"loss": 0.9845027327537537,
"memory(GiB)": 46.81,
"nll_loss": 0.5914844870567322,
"rewards/accuracies": 0.71875,
"rewards/chosen": -0.2998116612434387,
"rewards/margins": 1.7843880653381348,
"rewards/rejected": -2.084199905395508,
"step": 44,
"train_speed(iter/s)": 0.010723
},
{
"epoch": 0.100418410041841,
"grad_norm": 3.4293951988220215,
"learning_rate": 0.0002,
"logits/chosen": -0.34163057804107666,
"logits/rejected": -0.36223551630973816,
"logps/chosen": -9.353399276733398,
"logps/rejected": -21.651199340820312,
"loss": 1.0366103649139404,
"memory(GiB)": 46.81,
"nll_loss": 0.5141280889511108,
"rewards/accuracies": 0.625,
"rewards/chosen": -0.003630978986620903,
"rewards/margins": 0.7049190402030945,
"rewards/rejected": -0.7085499167442322,
"step": 45,
"train_speed(iter/s)": 0.010724
},
{
"epoch": 0.10264993026499303,
"grad_norm": 2.1774137020111084,
"learning_rate": 0.0001999993185874369,
"logits/chosen": -0.3677416443824768,
"logits/rejected": -0.3854161500930786,
"logps/chosen": -11.536070823669434,
"logps/rejected": -27.305158615112305,
"loss": 0.9515228271484375,
"memory(GiB)": 46.81,
"nll_loss": 0.5171921849250793,
"rewards/accuracies": 0.71875,
"rewards/chosen": -0.09924840927124023,
"rewards/margins": 1.116947889328003,
"rewards/rejected": -1.2161962985992432,
"step": 46,
"train_speed(iter/s)": 0.010724
},
{
"epoch": 0.10488145048814505,
"grad_norm": 2.2629730701446533,
"learning_rate": 0.00019999727435903407,
"logits/chosen": -0.3420083522796631,
"logits/rejected": -0.4473438858985901,
"logps/chosen": -4.170689582824707,
"logps/rejected": -21.129119873046875,
"loss": 0.9114863276481628,
"memory(GiB)": 46.81,
"nll_loss": 0.3966943621635437,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.1746423840522766,
"rewards/margins": 0.61202472448349,
"rewards/rejected": -0.43738237023353577,
"step": 47,
"train_speed(iter/s)": 0.010725
},
{
"epoch": 0.10711297071129706,
"grad_norm": 1.6574047803878784,
"learning_rate": 0.0001999938673426507,
"logits/chosen": -0.31779757142066956,
"logits/rejected": -0.4338604807853699,
"logps/chosen": -5.825237274169922,
"logps/rejected": -20.981552124023438,
"loss": 0.9128789305686951,
"memory(GiB)": 46.81,
"nll_loss": 0.4218422770500183,
"rewards/accuracies": 0.84375,
"rewards/chosen": 0.1773630529642105,
"rewards/margins": 0.718612551689148,
"rewards/rejected": -0.5412494540214539,
"step": 48,
"train_speed(iter/s)": 0.010725
},
{
"epoch": 0.10934449093444909,
"grad_norm": 2.0683908462524414,
"learning_rate": 0.00019998909758471852,
"logits/chosen": -0.3863949179649353,
"logits/rejected": -0.4458945393562317,
"logps/chosen": -7.798675537109375,
"logps/rejected": -21.307409286499023,
"loss": 1.0268117189407349,
"memory(GiB)": 46.81,
"nll_loss": 0.5051021575927734,
"rewards/accuracies": 0.6875,
"rewards/chosen": 0.08097527176141739,
"rewards/margins": 0.7529874444007874,
"rewards/rejected": -0.672012209892273,
"step": 49,
"train_speed(iter/s)": 0.010726
},
{
"epoch": 0.11157601115760112,
"grad_norm": 2.338461399078369,
"learning_rate": 0.000199982965150241,
"logits/chosen": -0.34079253673553467,
"logits/rejected": -0.3965541124343872,
"logps/chosen": -11.766353607177734,
"logps/rejected": -19.651931762695312,
"loss": 1.1824036836624146,
"memory(GiB)": 46.81,
"nll_loss": 0.609149158000946,
"rewards/accuracies": 0.78125,
"rewards/chosen": -0.08129046857357025,
"rewards/margins": 0.3777032196521759,
"rewards/rejected": -0.4589936435222626,
"step": 50,
"train_speed(iter/s)": 0.010726
}
],
"logging_steps": 1,
"max_steps": 896,
"num_input_tokens_seen": 0,
"num_train_epochs": 2,
"save_steps": 50,
"stateful_callbacks": {
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": true,
"should_training_stop": false
},
"attributes": {}
}
},
"total_flos": 2.73582429044736e+16,
"train_batch_size": 2,
"trial_name": null,
"trial_params": null
}