{ "best_global_step": null, "best_metric": null, "best_model_checkpoint": null, "epoch": 0.33472803347280333, "eval_steps": 300, "global_step": 150, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "epoch": 0.0022315202231520223, "grad_norm": 8.175573348999023, "learning_rate": 4.444444444444445e-06, "logits/chosen": -0.48349103331565857, "logits/rejected": -0.652603030204773, "logps/chosen": -8.859519004821777, "logps/rejected": -16.016435623168945, "loss": 1.3468515872955322, "memory(GiB)": 33.44, "nll_loss": 0.6537042856216431, "rewards/accuracies": 0.0, "rewards/chosen": 0.0, "rewards/margins": 0.0, "rewards/rejected": 0.0, "step": 1, "train_speed(iter/s)": 0.010093 }, { "epoch": 0.004463040446304045, "grad_norm": 6.496051788330078, "learning_rate": 8.88888888888889e-06, "logits/chosen": -0.5174899101257324, "logits/rejected": -0.6262180805206299, "logps/chosen": -9.287378311157227, "logps/rejected": -13.981985092163086, "loss": 1.290852665901184, "memory(GiB)": 36.3, "nll_loss": 0.5977055430412292, "rewards/accuracies": 0.0, "rewards/chosen": 0.0, "rewards/margins": 0.0, "rewards/rejected": 0.0, "step": 2, "train_speed(iter/s)": 0.010436 }, { "epoch": 0.0066945606694560665, "grad_norm": 5.3426923751831055, "learning_rate": 1.3333333333333333e-05, "logits/chosen": -0.4254978895187378, "logits/rejected": -0.6118676662445068, "logps/chosen": -6.5775346755981445, "logps/rejected": -16.196733474731445, "loss": 1.1887776851654053, "memory(GiB)": 36.3, "nll_loss": 0.49580031633377075, "rewards/accuracies": 0.46875, "rewards/chosen": -0.0025197849608957767, "rewards/margins": 0.0005687186494469643, "rewards/rejected": -0.0030885031446814537, "step": 3, "train_speed(iter/s)": 0.010535 }, { "epoch": 0.00892608089260809, "grad_norm": 5.717321395874023, "learning_rate": 1.777777777777778e-05, "logits/chosen": -0.5246356129646301, "logits/rejected": -0.651706337928772, "logps/chosen": -7.447962760925293, "logps/rejected": -16.996183395385742, "loss": 1.3215211629867554, "memory(GiB)": 39.38, "nll_loss": 0.632453203201294, "rewards/accuracies": 0.53125, "rewards/chosen": 0.004622042179107666, "rewards/margins": 0.008373789489269257, "rewards/rejected": -0.0037517473101615906, "step": 4, "train_speed(iter/s)": 0.010586 }, { "epoch": 0.011157601115760111, "grad_norm": 7.188594341278076, "learning_rate": 2.2222222222222223e-05, "logits/chosen": -0.5062788128852844, "logits/rejected": -0.6033568382263184, "logps/chosen": -7.093954086303711, "logps/rejected": -15.186193466186523, "loss": 1.0765105485916138, "memory(GiB)": 39.38, "nll_loss": 0.4042052626609802, "rewards/accuracies": 0.75, "rewards/chosen": 0.018988817930221558, "rewards/margins": 0.04282933473587036, "rewards/rejected": -0.023840520530939102, "step": 5, "train_speed(iter/s)": 0.010619 }, { "epoch": 0.013389121338912133, "grad_norm": 3.8232157230377197, "learning_rate": 2.6666666666666667e-05, "logits/chosen": -0.4826778173446655, "logits/rejected": -0.5863982439041138, "logps/chosen": -6.322361946105957, "logps/rejected": -16.8499755859375, "loss": 1.2770025730133057, "memory(GiB)": 39.38, "nll_loss": 0.6041065454483032, "rewards/accuracies": 0.65625, "rewards/chosen": 0.007987724617123604, "rewards/margins": 0.0449829027056694, "rewards/rejected": -0.03699517622590065, "step": 6, "train_speed(iter/s)": 0.010645 }, { "epoch": 0.015620641562064157, "grad_norm": 3.0141377449035645, "learning_rate": 3.111111111111111e-05, "logits/chosen": -0.557126522064209, "logits/rejected": -0.6060188412666321, "logps/chosen": -5.420467853546143, "logps/rejected": -11.815977096557617, "loss": 1.1219334602355957, "memory(GiB)": 39.38, "nll_loss": 0.46769219636917114, "rewards/accuracies": 0.65625, "rewards/chosen": 0.010057949461042881, "rewards/margins": 0.10709290951490402, "rewards/rejected": -0.09703496098518372, "step": 7, "train_speed(iter/s)": 0.010666 }, { "epoch": 0.01785216178521618, "grad_norm": 2.8756191730499268, "learning_rate": 3.555555555555556e-05, "logits/chosen": -0.5616711378097534, "logits/rejected": -0.6365323066711426, "logps/chosen": -6.283439636230469, "logps/rejected": -19.981098175048828, "loss": 0.8637306690216064, "memory(GiB)": 39.38, "nll_loss": 0.33207178115844727, "rewards/accuracies": 0.8125, "rewards/chosen": -0.011994147673249245, "rewards/margins": 0.4002670347690582, "rewards/rejected": -0.4122611880302429, "step": 8, "train_speed(iter/s)": 0.010684 }, { "epoch": 0.0200836820083682, "grad_norm": 5.291012763977051, "learning_rate": 4e-05, "logits/chosen": -0.502879798412323, "logits/rejected": -0.5977268815040588, "logps/chosen": -16.167051315307617, "logps/rejected": -20.485633850097656, "loss": 1.618671178817749, "memory(GiB)": 39.38, "nll_loss": 1.0418576002120972, "rewards/accuracies": 0.71875, "rewards/chosen": -0.21173161268234253, "rewards/margins": 0.39757153391838074, "rewards/rejected": -0.6093031167984009, "step": 9, "train_speed(iter/s)": 0.010694 }, { "epoch": 0.022315202231520222, "grad_norm": 5.504859447479248, "learning_rate": 4.4444444444444447e-05, "logits/chosen": -0.4140257239341736, "logits/rejected": -0.5436943173408508, "logps/chosen": -10.317049026489258, "logps/rejected": -26.558115005493164, "loss": 1.271435260772705, "memory(GiB)": 39.38, "nll_loss": 0.6719653606414795, "rewards/accuracies": 0.65625, "rewards/chosen": -0.2977833151817322, "rewards/margins": 0.4953876733779907, "rewards/rejected": -0.7931710481643677, "step": 10, "train_speed(iter/s)": 0.010695 }, { "epoch": 0.024546722454672244, "grad_norm": 8.8348970413208, "learning_rate": 4.888888888888889e-05, "logits/chosen": -0.4538601040840149, "logits/rejected": -0.5884804129600525, "logps/chosen": -15.600846290588379, "logps/rejected": -27.856977462768555, "loss": 1.6294305324554443, "memory(GiB)": 39.38, "nll_loss": 1.0609474182128906, "rewards/accuracies": 0.71875, "rewards/chosen": -0.48508310317993164, "rewards/margins": 0.41195282340049744, "rewards/rejected": -0.8970359563827515, "step": 11, "train_speed(iter/s)": 0.0107 }, { "epoch": 0.026778242677824266, "grad_norm": 4.871168613433838, "learning_rate": 5.333333333333333e-05, "logits/chosen": -0.4462035596370697, "logits/rejected": -0.5622009634971619, "logps/chosen": -10.827975273132324, "logps/rejected": -27.8737850189209, "loss": 1.309844732284546, "memory(GiB)": 42.78, "nll_loss": 0.6817098259925842, "rewards/accuracies": 0.59375, "rewards/chosen": -0.34655484557151794, "rewards/margins": 0.38605934381484985, "rewards/rejected": -0.7326142191886902, "step": 12, "train_speed(iter/s)": 0.010701 }, { "epoch": 0.02900976290097629, "grad_norm": 5.154696464538574, "learning_rate": 5.7777777777777776e-05, "logits/chosen": -0.45840126276016235, "logits/rejected": -0.5749193429946899, "logps/chosen": -9.034074783325195, "logps/rejected": -23.558507919311523, "loss": 1.3584285974502563, "memory(GiB)": 42.78, "nll_loss": 0.8017209768295288, "rewards/accuracies": 0.75, "rewards/chosen": -0.15672500431537628, "rewards/margins": 0.44559869170188904, "rewards/rejected": -0.6023237109184265, "step": 13, "train_speed(iter/s)": 0.010704 }, { "epoch": 0.031241283124128313, "grad_norm": 2.928802013397217, "learning_rate": 6.222222222222222e-05, "logits/chosen": -0.4339243173599243, "logits/rejected": -0.5222603678703308, "logps/chosen": -7.9224724769592285, "logps/rejected": -25.263307571411133, "loss": 1.176775574684143, "memory(GiB)": 46.23, "nll_loss": 0.548651397228241, "rewards/accuracies": 0.6875, "rewards/chosen": -0.09932564944028854, "rewards/margins": 0.27659934759140015, "rewards/rejected": -0.3759249448776245, "step": 14, "train_speed(iter/s)": 0.010698 }, { "epoch": 0.03347280334728033, "grad_norm": 1.9422496557235718, "learning_rate": 6.666666666666667e-05, "logits/chosen": -0.4753529131412506, "logits/rejected": -0.5179453492164612, "logps/chosen": -8.660318374633789, "logps/rejected": -16.743135452270508, "loss": 1.1362940073013306, "memory(GiB)": 46.23, "nll_loss": 0.5188332796096802, "rewards/accuracies": 0.71875, "rewards/chosen": -0.09274716675281525, "rewards/margins": 0.20326045155525208, "rewards/rejected": -0.29600760340690613, "step": 15, "train_speed(iter/s)": 0.010702 }, { "epoch": 0.03570432357043236, "grad_norm": 1.7832196950912476, "learning_rate": 7.111111111111112e-05, "logits/chosen": -0.39417293667793274, "logits/rejected": -0.5316826701164246, "logps/chosen": -4.724964618682861, "logps/rejected": -19.69357681274414, "loss": 1.0538526773452759, "memory(GiB)": 46.23, "nll_loss": 0.4770840108394623, "rewards/accuracies": 0.84375, "rewards/chosen": 0.06691457331180573, "rewards/margins": 0.27725517749786377, "rewards/rejected": -0.21034058928489685, "step": 16, "train_speed(iter/s)": 0.010702 }, { "epoch": 0.03793584379358438, "grad_norm": 1.5563856363296509, "learning_rate": 7.555555555555556e-05, "logits/chosen": -0.4563882350921631, "logits/rejected": -0.5541551113128662, "logps/chosen": -9.05321979522705, "logps/rejected": -18.82474708557129, "loss": 1.2152374982833862, "memory(GiB)": 46.23, "nll_loss": 0.6201823353767395, "rewards/accuracies": 0.75, "rewards/chosen": 0.11768844723701477, "rewards/margins": 0.2521967887878418, "rewards/rejected": -0.13450834155082703, "step": 17, "train_speed(iter/s)": 0.010706 }, { "epoch": 0.0401673640167364, "grad_norm": 1.9268314838409424, "learning_rate": 8e-05, "logits/chosen": -0.4476441740989685, "logits/rejected": -0.4938126504421234, "logps/chosen": -9.981496810913086, "logps/rejected": -14.752214431762695, "loss": 1.1654764413833618, "memory(GiB)": 46.23, "nll_loss": 0.46348586678504944, "rewards/accuracies": 0.53125, "rewards/chosen": 0.008895257487893105, "rewards/margins": 0.039339594542980194, "rewards/rejected": -0.030444344505667686, "step": 18, "train_speed(iter/s)": 0.010707 }, { "epoch": 0.042398884239888426, "grad_norm": 1.6981456279754639, "learning_rate": 8.444444444444444e-05, "logits/chosen": -0.49693721532821655, "logits/rejected": -0.5383259057998657, "logps/chosen": -7.632569313049316, "logps/rejected": -17.26980209350586, "loss": 1.1578692197799683, "memory(GiB)": 46.23, "nll_loss": 0.5097256898880005, "rewards/accuracies": 0.59375, "rewards/chosen": 0.06525340676307678, "rewards/margins": 0.123507060110569, "rewards/rejected": -0.05825363099575043, "step": 19, "train_speed(iter/s)": 0.010709 }, { "epoch": 0.044630404463040445, "grad_norm": 2.013322591781616, "learning_rate": 8.888888888888889e-05, "logits/chosen": -0.4885023236274719, "logits/rejected": -0.5652343034744263, "logps/chosen": -6.508520603179932, "logps/rejected": -13.635923385620117, "loss": 1.0892918109893799, "memory(GiB)": 46.23, "nll_loss": 0.45972177386283875, "rewards/accuracies": 0.53125, "rewards/chosen": 0.06720655411481857, "rewards/margins": 0.18712735176086426, "rewards/rejected": -0.11992079019546509, "step": 20, "train_speed(iter/s)": 0.010713 }, { "epoch": 0.04686192468619247, "grad_norm": 1.775608777999878, "learning_rate": 9.333333333333334e-05, "logits/chosen": -0.4235825836658478, "logits/rejected": -0.4997040629386902, "logps/chosen": -7.756269454956055, "logps/rejected": -22.05597496032715, "loss": 1.1610935926437378, "memory(GiB)": 46.81, "nll_loss": 0.5124741792678833, "rewards/accuracies": 0.71875, "rewards/chosen": 0.056686438620090485, "rewards/margins": 0.15342777967453003, "rewards/rejected": -0.09674134850502014, "step": 21, "train_speed(iter/s)": 0.010711 }, { "epoch": 0.04909344490934449, "grad_norm": 1.6878494024276733, "learning_rate": 9.777777777777778e-05, "logits/chosen": -0.448173850774765, "logits/rejected": -0.46942824125289917, "logps/chosen": -9.774542808532715, "logps/rejected": -14.852673530578613, "loss": 1.1857895851135254, "memory(GiB)": 46.81, "nll_loss": 0.5429187417030334, "rewards/accuracies": 0.53125, "rewards/chosen": 0.08716461062431335, "rewards/margins": 0.17264463007450104, "rewards/rejected": -0.08548003435134888, "step": 22, "train_speed(iter/s)": 0.01071 }, { "epoch": 0.051324965132496514, "grad_norm": 1.9283621311187744, "learning_rate": 0.00010222222222222222, "logits/chosen": -0.4297652244567871, "logits/rejected": -0.5464367866516113, "logps/chosen": -7.680075168609619, "logps/rejected": -20.64339828491211, "loss": 1.1528663635253906, "memory(GiB)": 46.81, "nll_loss": 0.48048245906829834, "rewards/accuracies": 0.46875, "rewards/chosen": 0.05369298905134201, "rewards/margins": 0.09629381448030472, "rewards/rejected": -0.04260082542896271, "step": 23, "train_speed(iter/s)": 0.01071 }, { "epoch": 0.05355648535564853, "grad_norm": 1.8897244930267334, "learning_rate": 0.00010666666666666667, "logits/chosen": -0.4073754847049713, "logits/rejected": -0.4649578034877777, "logps/chosen": -9.451826095581055, "logps/rejected": -20.540328979492188, "loss": 1.0510568618774414, "memory(GiB)": 46.81, "nll_loss": 0.431056946516037, "rewards/accuracies": 0.625, "rewards/chosen": 0.055333852767944336, "rewards/margins": 0.23058435320854187, "rewards/rejected": -0.17525050044059753, "step": 24, "train_speed(iter/s)": 0.010709 }, { "epoch": 0.05578800557880056, "grad_norm": 1.968520998954773, "learning_rate": 0.00011111111111111112, "logits/chosen": -0.4085446000099182, "logits/rejected": -0.49927735328674316, "logps/chosen": -9.85863971710205, "logps/rejected": -21.732637405395508, "loss": 1.166273593902588, "memory(GiB)": 46.81, "nll_loss": 0.5423365831375122, "rewards/accuracies": 0.71875, "rewards/chosen": 0.03325103968381882, "rewards/margins": 0.2285088747739792, "rewards/rejected": -0.19525781273841858, "step": 25, "train_speed(iter/s)": 0.010709 }, { "epoch": 0.05801952580195258, "grad_norm": 3.0135302543640137, "learning_rate": 0.00011555555555555555, "logits/chosen": -0.44835054874420166, "logits/rejected": -0.5419439077377319, "logps/chosen": -4.6747965812683105, "logps/rejected": -18.435997009277344, "loss": 0.9960591793060303, "memory(GiB)": 46.81, "nll_loss": 0.39432889223098755, "rewards/accuracies": 0.6875, "rewards/chosen": -0.017948223277926445, "rewards/margins": 0.27569395303726196, "rewards/rejected": -0.29364219307899475, "step": 26, "train_speed(iter/s)": 0.010712 }, { "epoch": 0.0602510460251046, "grad_norm": 2.0994958877563477, "learning_rate": 0.00012, "logits/chosen": -0.4755466878414154, "logits/rejected": -0.513874888420105, "logps/chosen": -14.17818832397461, "logps/rejected": -15.192220687866211, "loss": 1.3128914833068848, "memory(GiB)": 46.81, "nll_loss": 0.732846736907959, "rewards/accuracies": 0.84375, "rewards/chosen": 0.11946821957826614, "rewards/margins": 0.27503034472465515, "rewards/rejected": -0.1555621325969696, "step": 27, "train_speed(iter/s)": 0.010714 }, { "epoch": 0.06248256624825663, "grad_norm": 2.619943857192993, "learning_rate": 0.00012444444444444444, "logits/chosen": -0.33525484800338745, "logits/rejected": -0.4649803340435028, "logps/chosen": -6.553568363189697, "logps/rejected": -23.942062377929688, "loss": 1.007144808769226, "memory(GiB)": 46.81, "nll_loss": 0.4446461498737335, "rewards/accuracies": 0.78125, "rewards/chosen": 0.07584571838378906, "rewards/margins": 0.3631606996059418, "rewards/rejected": -0.2873149812221527, "step": 28, "train_speed(iter/s)": 0.010711 }, { "epoch": 0.06471408647140865, "grad_norm": 2.1066770553588867, "learning_rate": 0.00012888888888888892, "logits/chosen": -0.37913525104522705, "logits/rejected": -0.4620123505592346, "logps/chosen": -7.321231842041016, "logps/rejected": -21.526382446289062, "loss": 1.0192487239837646, "memory(GiB)": 46.81, "nll_loss": 0.4804428219795227, "rewards/accuracies": 0.84375, "rewards/chosen": 0.026389580219984055, "rewards/margins": 0.46746930480003357, "rewards/rejected": -0.441079705953598, "step": 29, "train_speed(iter/s)": 0.010712 }, { "epoch": 0.06694560669456066, "grad_norm": 1.8226919174194336, "learning_rate": 0.00013333333333333334, "logits/chosen": -0.3827905058860779, "logits/rejected": -0.48159855604171753, "logps/chosen": -6.776709079742432, "logps/rejected": -22.80392074584961, "loss": 1.0347448587417603, "memory(GiB)": 46.81, "nll_loss": 0.500119149684906, "rewards/accuracies": 0.8125, "rewards/chosen": 0.10474913567304611, "rewards/margins": 0.39701035618782043, "rewards/rejected": -0.2922612428665161, "step": 30, "train_speed(iter/s)": 0.010712 }, { "epoch": 0.06917712691771269, "grad_norm": 1.8681020736694336, "learning_rate": 0.0001377777777777778, "logits/chosen": -0.3609718978404999, "logits/rejected": -0.43842607736587524, "logps/chosen": -5.881144046783447, "logps/rejected": -21.236047744750977, "loss": 0.9905272126197815, "memory(GiB)": 46.81, "nll_loss": 0.43477141857147217, "rewards/accuracies": 0.6875, "rewards/chosen": 0.04010690003633499, "rewards/margins": 0.3823702037334442, "rewards/rejected": -0.34226328134536743, "step": 31, "train_speed(iter/s)": 0.010714 }, { "epoch": 0.07140864714086471, "grad_norm": 2.225977897644043, "learning_rate": 0.00014222222222222224, "logits/chosen": -0.39412301778793335, "logits/rejected": -0.4322904050350189, "logps/chosen": -10.140836715698242, "logps/rejected": -18.79208755493164, "loss": 1.0995820760726929, "memory(GiB)": 46.81, "nll_loss": 0.5035545229911804, "rewards/accuracies": 0.6875, "rewards/chosen": 0.04120786115527153, "rewards/margins": 0.2624339461326599, "rewards/rejected": -0.22122608125209808, "step": 32, "train_speed(iter/s)": 0.010716 }, { "epoch": 0.07364016736401674, "grad_norm": 2.788853406906128, "learning_rate": 0.00014666666666666666, "logits/chosen": -0.27406275272369385, "logits/rejected": -0.371414452791214, "logps/chosen": -12.10950756072998, "logps/rejected": -24.930038452148438, "loss": 1.2428903579711914, "memory(GiB)": 46.81, "nll_loss": 0.6102337837219238, "rewards/accuracies": 0.65625, "rewards/chosen": -0.08664405345916748, "rewards/margins": 0.2861720621585846, "rewards/rejected": -0.3728161156177521, "step": 33, "train_speed(iter/s)": 0.010715 }, { "epoch": 0.07587168758716877, "grad_norm": 2.416369676589966, "learning_rate": 0.0001511111111111111, "logits/chosen": -0.24224025011062622, "logits/rejected": -0.3833686113357544, "logps/chosen": -6.028831958770752, "logps/rejected": -22.455066680908203, "loss": 0.9914643168449402, "memory(GiB)": 46.81, "nll_loss": 0.44179052114486694, "rewards/accuracies": 0.75, "rewards/chosen": 0.011510152369737625, "rewards/margins": 0.5171858668327332, "rewards/rejected": -0.5056756734848022, "step": 34, "train_speed(iter/s)": 0.010714 }, { "epoch": 0.07810320781032078, "grad_norm": 4.029798984527588, "learning_rate": 0.00015555555555555556, "logits/chosen": -0.2615310847759247, "logits/rejected": -0.39800190925598145, "logps/chosen": -5.90588903427124, "logps/rejected": -24.642311096191406, "loss": 0.8372505307197571, "memory(GiB)": 46.81, "nll_loss": 0.4036243259906769, "rewards/accuracies": 0.84375, "rewards/chosen": -0.03906700387597084, "rewards/margins": 0.8896325826644897, "rewards/rejected": -0.9286996126174927, "step": 35, "train_speed(iter/s)": 0.010715 }, { "epoch": 0.0803347280334728, "grad_norm": 2.4356110095977783, "learning_rate": 0.00016, "logits/chosen": -0.25296953320503235, "logits/rejected": -0.3325399160385132, "logps/chosen": -9.764960289001465, "logps/rejected": -23.14637565612793, "loss": 1.0952283143997192, "memory(GiB)": 46.81, "nll_loss": 0.641168475151062, "rewards/accuracies": 0.84375, "rewards/chosen": 0.002499673515558243, "rewards/margins": 0.8523399829864502, "rewards/rejected": -0.8498403429985046, "step": 36, "train_speed(iter/s)": 0.010716 }, { "epoch": 0.08256624825662483, "grad_norm": 1.9291634559631348, "learning_rate": 0.00016444444444444444, "logits/chosen": -0.20930960774421692, "logits/rejected": -0.3604508936405182, "logps/chosen": -2.847867488861084, "logps/rejected": -30.63514518737793, "loss": 0.6885566711425781, "memory(GiB)": 46.81, "nll_loss": 0.2891227900981903, "rewards/accuracies": 0.84375, "rewards/chosen": 0.061974309384822845, "rewards/margins": 1.0785088539123535, "rewards/rejected": -1.0165345668792725, "step": 37, "train_speed(iter/s)": 0.010715 }, { "epoch": 0.08479776847977685, "grad_norm": 1.6937510967254639, "learning_rate": 0.00016888888888888889, "logits/chosen": -0.2987847626209259, "logits/rejected": -0.37470635771751404, "logps/chosen": -6.199091911315918, "logps/rejected": -19.3011474609375, "loss": 0.8923996090888977, "memory(GiB)": 46.81, "nll_loss": 0.38914668560028076, "rewards/accuracies": 0.84375, "rewards/chosen": 0.0021905135363340378, "rewards/margins": 0.6954408288002014, "rewards/rejected": -0.6932503581047058, "step": 38, "train_speed(iter/s)": 0.010716 }, { "epoch": 0.08702928870292886, "grad_norm": 2.106278896331787, "learning_rate": 0.00017333333333333334, "logits/chosen": -0.28487277030944824, "logits/rejected": -0.34711676836013794, "logps/chosen": -8.657167434692383, "logps/rejected": -26.564130783081055, "loss": 1.023146390914917, "memory(GiB)": 46.81, "nll_loss": 0.5919384956359863, "rewards/accuracies": 0.84375, "rewards/chosen": 0.05617165565490723, "rewards/margins": 1.1481283903121948, "rewards/rejected": -1.091956615447998, "step": 39, "train_speed(iter/s)": 0.010717 }, { "epoch": 0.08926080892608089, "grad_norm": 2.619154214859009, "learning_rate": 0.00017777777777777779, "logits/chosen": -0.2898882031440735, "logits/rejected": -0.3393169343471527, "logps/chosen": -8.001999855041504, "logps/rejected": -20.189369201660156, "loss": 0.9479650855064392, "memory(GiB)": 46.81, "nll_loss": 0.42854148149490356, "rewards/accuracies": 0.6875, "rewards/chosen": 0.0008942075073719025, "rewards/margins": 0.7672775983810425, "rewards/rejected": -0.7663832902908325, "step": 40, "train_speed(iter/s)": 0.010719 }, { "epoch": 0.09149232914923291, "grad_norm": 2.770841360092163, "learning_rate": 0.00018222222222222224, "logits/chosen": -0.22048279643058777, "logits/rejected": -0.30986371636390686, "logps/chosen": -5.240083694458008, "logps/rejected": -22.307451248168945, "loss": 0.8702710866928101, "memory(GiB)": 46.81, "nll_loss": 0.39226293563842773, "rewards/accuracies": 0.65625, "rewards/chosen": 0.017199480906128883, "rewards/margins": 0.9372033476829529, "rewards/rejected": -0.9200038313865662, "step": 41, "train_speed(iter/s)": 0.010719 }, { "epoch": 0.09372384937238494, "grad_norm": 4.61620569229126, "learning_rate": 0.0001866666666666667, "logits/chosen": -0.30797824263572693, "logits/rejected": -0.3721832036972046, "logps/chosen": -10.481635093688965, "logps/rejected": -23.132564544677734, "loss": 1.2510943412780762, "memory(GiB)": 46.81, "nll_loss": 0.6913026571273804, "rewards/accuracies": 0.65625, "rewards/chosen": -0.25621044635772705, "rewards/margins": 0.5585607886314392, "rewards/rejected": -0.814771294593811, "step": 42, "train_speed(iter/s)": 0.010721 }, { "epoch": 0.09595536959553697, "grad_norm": 3.806872844696045, "learning_rate": 0.00019111111111111114, "logits/chosen": -0.22567886114120483, "logits/rejected": -0.3761019706726074, "logps/chosen": -8.201981544494629, "logps/rejected": -34.75733184814453, "loss": 1.0068457126617432, "memory(GiB)": 46.81, "nll_loss": 0.6396302580833435, "rewards/accuracies": 0.78125, "rewards/chosen": -0.12671321630477905, "rewards/margins": 1.7875899076461792, "rewards/rejected": -1.914302945137024, "step": 43, "train_speed(iter/s)": 0.010722 }, { "epoch": 0.09818688981868898, "grad_norm": 3.342564821243286, "learning_rate": 0.00019555555555555556, "logits/chosen": -0.259334534406662, "logits/rejected": -0.33293721079826355, "logps/chosen": -9.735747337341309, "logps/rejected": -34.48583221435547, "loss": 0.9845027327537537, "memory(GiB)": 46.81, "nll_loss": 0.5914844870567322, "rewards/accuracies": 0.71875, "rewards/chosen": -0.2998116612434387, "rewards/margins": 1.7843880653381348, "rewards/rejected": -2.084199905395508, "step": 44, "train_speed(iter/s)": 0.010723 }, { "epoch": 0.100418410041841, "grad_norm": 3.4293951988220215, "learning_rate": 0.0002, "logits/chosen": -0.34163057804107666, "logits/rejected": -0.36223551630973816, "logps/chosen": -9.353399276733398, "logps/rejected": -21.651199340820312, "loss": 1.0366103649139404, "memory(GiB)": 46.81, "nll_loss": 0.5141280889511108, "rewards/accuracies": 0.625, "rewards/chosen": -0.003630978986620903, "rewards/margins": 0.7049190402030945, "rewards/rejected": -0.7085499167442322, "step": 45, "train_speed(iter/s)": 0.010724 }, { "epoch": 0.10264993026499303, "grad_norm": 2.1774137020111084, "learning_rate": 0.0001999993185874369, "logits/chosen": -0.3677416443824768, "logits/rejected": -0.3854161500930786, "logps/chosen": -11.536070823669434, "logps/rejected": -27.305158615112305, "loss": 0.9515228271484375, "memory(GiB)": 46.81, "nll_loss": 0.5171921849250793, "rewards/accuracies": 0.71875, "rewards/chosen": -0.09924840927124023, "rewards/margins": 1.116947889328003, "rewards/rejected": -1.2161962985992432, "step": 46, "train_speed(iter/s)": 0.010724 }, { "epoch": 0.10488145048814505, "grad_norm": 2.2629730701446533, "learning_rate": 0.00019999727435903407, "logits/chosen": -0.3420083522796631, "logits/rejected": -0.4473438858985901, "logps/chosen": -4.170689582824707, "logps/rejected": -21.129119873046875, "loss": 0.9114863276481628, "memory(GiB)": 46.81, "nll_loss": 0.3966943621635437, "rewards/accuracies": 0.875, "rewards/chosen": 0.1746423840522766, "rewards/margins": 0.61202472448349, "rewards/rejected": -0.43738237023353577, "step": 47, "train_speed(iter/s)": 0.010725 }, { "epoch": 0.10711297071129706, "grad_norm": 1.6574047803878784, "learning_rate": 0.0001999938673426507, "logits/chosen": -0.31779757142066956, "logits/rejected": -0.4338604807853699, "logps/chosen": -5.825237274169922, "logps/rejected": -20.981552124023438, "loss": 0.9128789305686951, "memory(GiB)": 46.81, "nll_loss": 0.4218422770500183, "rewards/accuracies": 0.84375, "rewards/chosen": 0.1773630529642105, "rewards/margins": 0.718612551689148, "rewards/rejected": -0.5412494540214539, "step": 48, "train_speed(iter/s)": 0.010725 }, { "epoch": 0.10934449093444909, "grad_norm": 2.0683908462524414, "learning_rate": 0.00019998909758471852, "logits/chosen": -0.3863949179649353, "logits/rejected": -0.4458945393562317, "logps/chosen": -7.798675537109375, "logps/rejected": -21.307409286499023, "loss": 1.0268117189407349, "memory(GiB)": 46.81, "nll_loss": 0.5051021575927734, "rewards/accuracies": 0.6875, "rewards/chosen": 0.08097527176141739, "rewards/margins": 0.7529874444007874, "rewards/rejected": -0.672012209892273, "step": 49, "train_speed(iter/s)": 0.010726 }, { "epoch": 0.11157601115760112, "grad_norm": 2.338461399078369, "learning_rate": 0.000199982965150241, "logits/chosen": -0.34079253673553467, "logits/rejected": -0.3965541124343872, "logps/chosen": -11.766353607177734, "logps/rejected": -19.651931762695312, "loss": 1.1824036836624146, "memory(GiB)": 46.81, "nll_loss": 0.609149158000946, "rewards/accuracies": 0.78125, "rewards/chosen": -0.08129046857357025, "rewards/margins": 0.3777032196521759, "rewards/rejected": -0.4589936435222626, "step": 50, "train_speed(iter/s)": 0.010726 }, { "epoch": 0.11380753138075314, "grad_norm": 1.6744564771652222, "learning_rate": 0.00019997547012279244, "logits/chosen": -0.31765079498291016, "logits/rejected": -0.42205262184143066, "logps/chosen": -5.897686958312988, "logps/rejected": -25.42192268371582, "loss": 0.8473464846611023, "memory(GiB)": 46.81, "nll_loss": 0.4084213376045227, "rewards/accuracies": 0.875, "rewards/chosen": 0.2017829716205597, "rewards/margins": 0.7832211256027222, "rewards/rejected": -0.5814382433891296, "step": 51, "train_speed(iter/s)": 0.010685 }, { "epoch": 0.11603905160390517, "grad_norm": 1.8061268329620361, "learning_rate": 0.00019996661260451704, "logits/chosen": -0.32708457112312317, "logits/rejected": -0.41108813881874084, "logps/chosen": -8.663649559020996, "logps/rejected": -32.308448791503906, "loss": 0.8938776850700378, "memory(GiB)": 46.81, "nll_loss": 0.48662397265434265, "rewards/accuracies": 0.78125, "rewards/chosen": -0.01828554831445217, "rewards/margins": 1.3651036024093628, "rewards/rejected": -1.3833892345428467, "step": 52, "train_speed(iter/s)": 0.010686 }, { "epoch": 0.11827057182705718, "grad_norm": 1.9129594564437866, "learning_rate": 0.00019995639271612722, "logits/chosen": -0.3344545364379883, "logits/rejected": -0.43980082869529724, "logps/chosen": -9.373285293579102, "logps/rejected": -30.374614715576172, "loss": 0.8187388181686401, "memory(GiB)": 46.81, "nll_loss": 0.3988412916660309, "rewards/accuracies": 0.8125, "rewards/chosen": -0.04744601994752884, "rewards/margins": 1.1539989709854126, "rewards/rejected": -1.2014449834823608, "step": 53, "train_speed(iter/s)": 0.010687 }, { "epoch": 0.1205020920502092, "grad_norm": 6.22075891494751, "learning_rate": 0.00019994481059690223, "logits/chosen": -0.3710540533065796, "logits/rejected": -0.45295441150665283, "logps/chosen": -11.353669166564941, "logps/rejected": -35.60136795043945, "loss": 1.3072545528411865, "memory(GiB)": 46.81, "nll_loss": 0.8566557168960571, "rewards/accuracies": 0.71875, "rewards/chosen": -0.1803397834300995, "rewards/margins": 2.1112091541290283, "rewards/rejected": -2.29154896736145, "step": 54, "train_speed(iter/s)": 0.010688 }, { "epoch": 0.12273361227336123, "grad_norm": 3.538923501968384, "learning_rate": 0.00019993186640468604, "logits/chosen": -0.2791898250579834, "logits/rejected": -0.3996254801750183, "logps/chosen": -12.779634475708008, "logps/rejected": -37.21310043334961, "loss": 1.0243951082229614, "memory(GiB)": 46.81, "nll_loss": 0.6127378940582275, "rewards/accuracies": 0.75, "rewards/chosen": -0.261193186044693, "rewards/margins": 1.434675693511963, "rewards/rejected": -1.695868968963623, "step": 55, "train_speed(iter/s)": 0.010688 }, { "epoch": 0.12496513249651325, "grad_norm": 2.5944247245788574, "learning_rate": 0.0001999175603158854, "logits/chosen": -0.2531765401363373, "logits/rejected": -0.4114147424697876, "logps/chosen": -9.740252494812012, "logps/rejected": -36.96112823486328, "loss": 0.8653287291526794, "memory(GiB)": 46.81, "nll_loss": 0.5133413076400757, "rewards/accuracies": 0.84375, "rewards/chosen": -0.015189380384981632, "rewards/margins": 1.5309333801269531, "rewards/rejected": -1.5461229085922241, "step": 56, "train_speed(iter/s)": 0.010688 }, { "epoch": 0.12719665271966527, "grad_norm": 3.273171901702881, "learning_rate": 0.0001999018925254673, "logits/chosen": -0.3509857654571533, "logits/rejected": -0.4661892056465149, "logps/chosen": -8.814093589782715, "logps/rejected": -30.390697479248047, "loss": 0.9130730032920837, "memory(GiB)": 46.81, "nll_loss": 0.5733908414840698, "rewards/accuracies": 0.9375, "rewards/chosen": 0.0046962546184659, "rewards/margins": 1.3072673082351685, "rewards/rejected": -1.3025707006454468, "step": 57, "train_speed(iter/s)": 0.010689 }, { "epoch": 0.1294281729428173, "grad_norm": 2.717229127883911, "learning_rate": 0.00019988486324695628, "logits/chosen": -0.33554819226264954, "logits/rejected": -0.4281303584575653, "logps/chosen": -14.103944778442383, "logps/rejected": -32.3876838684082, "loss": 0.9715602397918701, "memory(GiB)": 46.81, "nll_loss": 0.5424861311912537, "rewards/accuracies": 0.78125, "rewards/chosen": -0.0524468794465065, "rewards/margins": 1.0883628129959106, "rewards/rejected": -1.1408096551895142, "step": 58, "train_speed(iter/s)": 0.010687 }, { "epoch": 0.13165969316596932, "grad_norm": 2.887491226196289, "learning_rate": 0.00019986647271243163, "logits/chosen": -0.3923209011554718, "logits/rejected": -0.48743686079978943, "logps/chosen": -6.2308878898620605, "logps/rejected": -21.537296295166016, "loss": 0.9816198945045471, "memory(GiB)": 46.81, "nll_loss": 0.4462883472442627, "rewards/accuracies": 0.71875, "rewards/chosen": -0.06832532584667206, "rewards/margins": 0.5661296844482422, "rewards/rejected": -0.6344550251960754, "step": 59, "train_speed(iter/s)": 0.010688 }, { "epoch": 0.13389121338912133, "grad_norm": 2.2311718463897705, "learning_rate": 0.00019984672117252423, "logits/chosen": -0.33507245779037476, "logits/rejected": -0.49380406737327576, "logps/chosen": -9.220368385314941, "logps/rejected": -37.96326446533203, "loss": 0.9401113986968994, "memory(GiB)": 46.81, "nll_loss": 0.5612199902534485, "rewards/accuracies": 0.78125, "rewards/chosen": 0.06330323219299316, "rewards/margins": 1.686211347579956, "rewards/rejected": -1.622908115386963, "step": 60, "train_speed(iter/s)": 0.010687 }, { "epoch": 0.13612273361227337, "grad_norm": 1.992959976196289, "learning_rate": 0.00019982560889641296, "logits/chosen": -0.35564690828323364, "logits/rejected": -0.5200420618057251, "logps/chosen": -3.4553239345550537, "logps/rejected": -32.64472198486328, "loss": 0.640341579914093, "memory(GiB)": 46.81, "nll_loss": 0.3033585250377655, "rewards/accuracies": 0.84375, "rewards/chosen": 0.08748181164264679, "rewards/margins": 1.5070304870605469, "rewards/rejected": -1.419548511505127, "step": 61, "train_speed(iter/s)": 0.010687 }, { "epoch": 0.13835425383542538, "grad_norm": 3.40260648727417, "learning_rate": 0.00019980313617182127, "logits/chosen": -0.3457183837890625, "logits/rejected": -0.5498067736625671, "logps/chosen": -6.69366455078125, "logps/rejected": -37.40818405151367, "loss": 0.9436236619949341, "memory(GiB)": 46.81, "nll_loss": 0.6088553667068481, "rewards/accuracies": 0.84375, "rewards/chosen": -0.10982945561408997, "rewards/margins": 1.797737956047058, "rewards/rejected": -1.9075673818588257, "step": 62, "train_speed(iter/s)": 0.010687 }, { "epoch": 0.14058577405857742, "grad_norm": 4.374825954437256, "learning_rate": 0.00019977930330501308, "logits/chosen": -0.42058196663856506, "logits/rejected": -0.5126227736473083, "logps/chosen": -10.140219688415527, "logps/rejected": -33.032615661621094, "loss": 1.193029522895813, "memory(GiB)": 46.81, "nll_loss": 0.6540992856025696, "rewards/accuracies": 0.625, "rewards/chosen": -0.22300566732883453, "rewards/margins": 1.272392988204956, "rewards/rejected": -1.495398759841919, "step": 63, "train_speed(iter/s)": 0.010688 }, { "epoch": 0.14281729428172943, "grad_norm": 4.756910800933838, "learning_rate": 0.0001997541106207887, "logits/chosen": -0.4631284475326538, "logits/rejected": -0.5332682728767395, "logps/chosen": -8.054980278015137, "logps/rejected": -31.029682159423828, "loss": 1.0884121656417847, "memory(GiB)": 46.81, "nll_loss": 0.6862107515335083, "rewards/accuracies": 0.6875, "rewards/chosen": -0.1161859929561615, "rewards/margins": 1.4922480583190918, "rewards/rejected": -1.6084339618682861, "step": 64, "train_speed(iter/s)": 0.01069 }, { "epoch": 0.14504881450488144, "grad_norm": 3.428164005279541, "learning_rate": 0.0001997275584624803, "logits/chosen": -0.3415633738040924, "logits/rejected": -0.49688977003097534, "logps/chosen": -7.313436031341553, "logps/rejected": -35.58869934082031, "loss": 0.957207977771759, "memory(GiB)": 46.81, "nll_loss": 0.590711772441864, "rewards/accuracies": 0.875, "rewards/chosen": 0.05026661604642868, "rewards/margins": 1.5162088871002197, "rewards/rejected": -1.4659425020217896, "step": 65, "train_speed(iter/s)": 0.010689 }, { "epoch": 0.14728033472803348, "grad_norm": 3.1654562950134277, "learning_rate": 0.00019969964719194745, "logits/chosen": -0.4512020945549011, "logits/rejected": -0.5287590026855469, "logps/chosen": -8.630544662475586, "logps/rejected": -15.341949462890625, "loss": 1.1465851068496704, "memory(GiB)": 46.81, "nll_loss": 0.5758541822433472, "rewards/accuracies": 0.6875, "rewards/chosen": 0.06041776388883591, "rewards/margins": 0.51249760389328, "rewards/rejected": -0.45207977294921875, "step": 66, "train_speed(iter/s)": 0.010691 }, { "epoch": 0.1495118549511855, "grad_norm": 2.0986812114715576, "learning_rate": 0.0001996703771895719, "logits/chosen": -0.5272831320762634, "logits/rejected": -0.517794668674469, "logps/chosen": -12.980257034301758, "logps/rejected": -18.752052307128906, "loss": 1.3610563278198242, "memory(GiB)": 46.81, "nll_loss": 0.6797517538070679, "rewards/accuracies": 0.59375, "rewards/chosen": 0.026422299444675446, "rewards/margins": 0.5318213105201721, "rewards/rejected": -0.5053990483283997, "step": 67, "train_speed(iter/s)": 0.010693 }, { "epoch": 0.15174337517433753, "grad_norm": 1.9081969261169434, "learning_rate": 0.00019963974885425266, "logits/chosen": -0.4080069661140442, "logits/rejected": -0.47813406586647034, "logps/chosen": -7.824826717376709, "logps/rejected": -18.751680374145508, "loss": 1.0740342140197754, "memory(GiB)": 46.81, "nll_loss": 0.45793265104293823, "rewards/accuracies": 0.5625, "rewards/chosen": 0.04187186062335968, "rewards/margins": 0.3901542127132416, "rewards/rejected": -0.3482823669910431, "step": 68, "train_speed(iter/s)": 0.010693 }, { "epoch": 0.15397489539748954, "grad_norm": 1.700203537940979, "learning_rate": 0.0001996077626034003, "logits/chosen": -0.45641785860061646, "logits/rejected": -0.5060834884643555, "logps/chosen": -11.462532043457031, "logps/rejected": -16.27201271057129, "loss": 1.1681339740753174, "memory(GiB)": 46.81, "nll_loss": 0.6015636920928955, "rewards/accuracies": 0.6875, "rewards/chosen": 0.136613130569458, "rewards/margins": 0.3738591969013214, "rewards/rejected": -0.2372460514307022, "step": 69, "train_speed(iter/s)": 0.010694 }, { "epoch": 0.15620641562064155, "grad_norm": 1.9888875484466553, "learning_rate": 0.00019957441887293156, "logits/chosen": -0.4031111001968384, "logits/rejected": -0.47320762276649475, "logps/chosen": -7.325850009918213, "logps/rejected": -25.553611755371094, "loss": 1.002021074295044, "memory(GiB)": 46.81, "nll_loss": 0.4237433671951294, "rewards/accuracies": 0.65625, "rewards/chosen": 0.013660086318850517, "rewards/margins": 0.49219831824302673, "rewards/rejected": -0.4785382151603699, "step": 70, "train_speed(iter/s)": 0.010694 }, { "epoch": 0.1584379358437936, "grad_norm": 1.5379258394241333, "learning_rate": 0.0001995397181172631, "logits/chosen": -0.40455764532089233, "logits/rejected": -0.518138587474823, "logps/chosen": -3.8365478515625, "logps/rejected": -26.37249755859375, "loss": 0.8130152225494385, "memory(GiB)": 46.81, "nll_loss": 0.34526968002319336, "rewards/accuracies": 0.84375, "rewards/chosen": 0.10106083005666733, "rewards/margins": 0.8268870115280151, "rewards/rejected": -0.7258262038230896, "step": 71, "train_speed(iter/s)": 0.010695 }, { "epoch": 0.1606694560669456, "grad_norm": 1.612131953239441, "learning_rate": 0.0001995036608093056, "logits/chosen": -0.4558025002479553, "logits/rejected": -0.48799094557762146, "logps/chosen": -8.70871639251709, "logps/rejected": -17.577770233154297, "loss": 0.8906623125076294, "memory(GiB)": 46.81, "nll_loss": 0.3765795826911926, "rewards/accuracies": 0.75, "rewards/chosen": 0.05890116095542908, "rewards/margins": 0.6036397814750671, "rewards/rejected": -0.5447385907173157, "step": 72, "train_speed(iter/s)": 0.010695 }, { "epoch": 0.16290097629009762, "grad_norm": 1.3791937828063965, "learning_rate": 0.00019946624744045704, "logits/chosen": -0.4362650215625763, "logits/rejected": -0.48206600546836853, "logps/chosen": -10.413619995117188, "logps/rejected": -27.357479095458984, "loss": 0.8979863524436951, "memory(GiB)": 46.81, "nll_loss": 0.3758661448955536, "rewards/accuracies": 0.6875, "rewards/chosen": -0.009980186820030212, "rewards/margins": 0.9504665732383728, "rewards/rejected": -0.960446834564209, "step": 73, "train_speed(iter/s)": 0.010695 }, { "epoch": 0.16513249651324965, "grad_norm": 1.7471097707748413, "learning_rate": 0.00019942747852059632, "logits/chosen": -0.423688143491745, "logits/rejected": -0.49418017268180847, "logps/chosen": -8.749202728271484, "logps/rejected": -33.218692779541016, "loss": 0.8359287977218628, "memory(GiB)": 46.81, "nll_loss": 0.36860865354537964, "rewards/accuracies": 0.8125, "rewards/chosen": -0.05798308178782463, "rewards/margins": 1.4300649166107178, "rewards/rejected": -1.4880479574203491, "step": 74, "train_speed(iter/s)": 0.010695 }, { "epoch": 0.16736401673640167, "grad_norm": 2.2621185779571533, "learning_rate": 0.00019938735457807592, "logits/chosen": -0.40228813886642456, "logits/rejected": -0.47656214237213135, "logps/chosen": -10.918057441711426, "logps/rejected": -30.61962890625, "loss": 0.9725239872932434, "memory(GiB)": 46.81, "nll_loss": 0.499444842338562, "rewards/accuracies": 0.75, "rewards/chosen": -0.06699477136135101, "rewards/margins": 0.938097357749939, "rewards/rejected": -1.0050921440124512, "step": 75, "train_speed(iter/s)": 0.010695 }, { "epoch": 0.1695955369595537, "grad_norm": 2.474619150161743, "learning_rate": 0.00019934587615971506, "logits/chosen": -0.38186344504356384, "logits/rejected": -0.4598054587841034, "logps/chosen": -6.823958873748779, "logps/rejected": -29.09862518310547, "loss": 0.9761800765991211, "memory(GiB)": 46.81, "nll_loss": 0.48571133613586426, "rewards/accuracies": 0.75, "rewards/chosen": -0.05072644352912903, "rewards/margins": 0.8625801205635071, "rewards/rejected": -0.9133066534996033, "step": 76, "train_speed(iter/s)": 0.010695 }, { "epoch": 0.17182705718270572, "grad_norm": 1.823959231376648, "learning_rate": 0.00019930304383079204, "logits/chosen": -0.4149280786514282, "logits/rejected": -0.5062562227249146, "logps/chosen": -8.54432201385498, "logps/rejected": -29.242015838623047, "loss": 0.8722183108329773, "memory(GiB)": 46.81, "nll_loss": 0.4606979191303253, "rewards/accuracies": 0.8125, "rewards/chosen": 0.01995794102549553, "rewards/margins": 1.4311785697937012, "rewards/rejected": -1.4112205505371094, "step": 77, "train_speed(iter/s)": 0.010695 }, { "epoch": 0.17405857740585773, "grad_norm": 1.793901801109314, "learning_rate": 0.00019925885817503663, "logits/chosen": -0.4355413317680359, "logits/rejected": -0.5245873332023621, "logps/chosen": -4.893879413604736, "logps/rejected": -25.42880630493164, "loss": 0.7558175921440125, "memory(GiB)": 46.81, "nll_loss": 0.38899344205856323, "rewards/accuracies": 0.9375, "rewards/chosen": 0.08300305157899857, "rewards/margins": 1.0970323085784912, "rewards/rejected": -1.0140292644500732, "step": 78, "train_speed(iter/s)": 0.010696 }, { "epoch": 0.17629009762900977, "grad_norm": 2.114241123199463, "learning_rate": 0.00019921331979462197, "logits/chosen": -0.3358357548713684, "logits/rejected": -0.47999072074890137, "logps/chosen": -5.950570583343506, "logps/rejected": -28.20298957824707, "loss": 0.8057999610900879, "memory(GiB)": 46.81, "nll_loss": 0.4144690930843353, "rewards/accuracies": 0.84375, "rewards/chosen": 0.05946407839655876, "rewards/margins": 1.0457231998443604, "rewards/rejected": -0.9862591028213501, "step": 79, "train_speed(iter/s)": 0.010697 }, { "epoch": 0.17852161785216178, "grad_norm": 2.7315855026245117, "learning_rate": 0.00019916642931015662, "logits/chosen": -0.43205446004867554, "logits/rejected": -0.5006397366523743, "logps/chosen": -7.170259952545166, "logps/rejected": -22.804529190063477, "loss": 1.0863537788391113, "memory(GiB)": 46.81, "nll_loss": 0.6158946752548218, "rewards/accuracies": 0.78125, "rewards/chosen": -0.03549172729253769, "rewards/margins": 0.8894610404968262, "rewards/rejected": -0.9249527454376221, "step": 80, "train_speed(iter/s)": 0.010698 }, { "epoch": 0.18075313807531382, "grad_norm": 2.479121685028076, "learning_rate": 0.00019911818736067586, "logits/chosen": -0.40614452958106995, "logits/rejected": -0.5118440389633179, "logps/chosen": -4.780482769012451, "logps/rejected": -22.085041046142578, "loss": 0.7858155965805054, "memory(GiB)": 46.81, "nll_loss": 0.44690829515457153, "rewards/accuracies": 0.9375, "rewards/chosen": 0.21181246638298035, "rewards/margins": 1.2262333631515503, "rewards/rejected": -1.0144208669662476, "step": 81, "train_speed(iter/s)": 0.010699 }, { "epoch": 0.18298465829846583, "grad_norm": 1.6746541261672974, "learning_rate": 0.00019906859460363307, "logits/chosen": -0.4001500606536865, "logits/rejected": -0.45929989218711853, "logps/chosen": -7.395153045654297, "logps/rejected": -25.426557540893555, "loss": 0.7357066869735718, "memory(GiB)": 46.81, "nll_loss": 0.4178068935871124, "rewards/accuracies": 0.84375, "rewards/chosen": 0.16341763734817505, "rewards/margins": 1.525546669960022, "rewards/rejected": -1.3621290922164917, "step": 82, "train_speed(iter/s)": 0.0107 }, { "epoch": 0.18521617852161784, "grad_norm": 4.773955821990967, "learning_rate": 0.00019901765171489086, "logits/chosen": -0.30332040786743164, "logits/rejected": -0.4577845633029938, "logps/chosen": -10.913299560546875, "logps/rejected": -46.28175354003906, "loss": 1.1305065155029297, "memory(GiB)": 46.81, "nll_loss": 0.7709158658981323, "rewards/accuracies": 0.8125, "rewards/chosen": -0.34224939346313477, "rewards/margins": 2.636122703552246, "rewards/rejected": -2.9783718585968018, "step": 83, "train_speed(iter/s)": 0.0107 }, { "epoch": 0.18744769874476988, "grad_norm": 2.5695321559906006, "learning_rate": 0.0001989653593887117, "logits/chosen": -0.3644600212574005, "logits/rejected": -0.43475809693336487, "logps/chosen": -6.348275661468506, "logps/rejected": -29.636547088623047, "loss": 0.8502273559570312, "memory(GiB)": 46.81, "nll_loss": 0.4918310344219208, "rewards/accuracies": 0.90625, "rewards/chosen": 0.07552118599414825, "rewards/margins": 1.7124391794204712, "rewards/rejected": -1.636918067932129, "step": 84, "train_speed(iter/s)": 0.010702 }, { "epoch": 0.1896792189679219, "grad_norm": 3.117232322692871, "learning_rate": 0.00019891171833774854, "logits/chosen": -0.31497788429260254, "logits/rejected": -0.40428590774536133, "logps/chosen": -10.195795059204102, "logps/rejected": -43.74475860595703, "loss": 1.0120048522949219, "memory(GiB)": 46.81, "nll_loss": 0.6030641198158264, "rewards/accuracies": 0.78125, "rewards/chosen": -0.17749960720539093, "rewards/margins": 2.177133083343506, "rewards/rejected": -2.35463285446167, "step": 85, "train_speed(iter/s)": 0.010701 }, { "epoch": 0.19191073919107393, "grad_norm": 2.5167582035064697, "learning_rate": 0.00019885672929303508, "logits/chosen": -0.3179773986339569, "logits/rejected": -0.42796629667282104, "logps/chosen": -10.96944522857666, "logps/rejected": -40.80889129638672, "loss": 0.8473846912384033, "memory(GiB)": 46.81, "nll_loss": 0.5096143484115601, "rewards/accuracies": 0.8125, "rewards/chosen": -0.08502935618162155, "rewards/margins": 2.197641134262085, "rewards/rejected": -2.282670259475708, "step": 86, "train_speed(iter/s)": 0.010702 }, { "epoch": 0.19414225941422594, "grad_norm": 2.2492237091064453, "learning_rate": 0.00019880039300397591, "logits/chosen": -0.4064781665802002, "logits/rejected": -0.4387715458869934, "logps/chosen": -7.350955009460449, "logps/rejected": -30.075700759887695, "loss": 0.9061151742935181, "memory(GiB)": 46.81, "nll_loss": 0.5411654710769653, "rewards/accuracies": 0.78125, "rewards/chosen": 0.04652661085128784, "rewards/margins": 1.5254417657852173, "rewards/rejected": -1.4789149761199951, "step": 87, "train_speed(iter/s)": 0.010703 }, { "epoch": 0.19637377963737795, "grad_norm": 1.698593258857727, "learning_rate": 0.00019874271023833604, "logits/chosen": -0.36257320642471313, "logits/rejected": -0.4434874653816223, "logps/chosen": -8.048574447631836, "logps/rejected": -30.737728118896484, "loss": 0.8314277529716492, "memory(GiB)": 46.81, "nll_loss": 0.47138625383377075, "rewards/accuracies": 0.84375, "rewards/chosen": 0.10594448447227478, "rewards/margins": 1.524275541305542, "rewards/rejected": -1.4183311462402344, "step": 88, "train_speed(iter/s)": 0.010703 }, { "epoch": 0.19860529986053, "grad_norm": 3.0257344245910645, "learning_rate": 0.00019868368178223075, "logits/chosen": -0.3720957636833191, "logits/rejected": -0.45681309700012207, "logps/chosen": -9.780877113342285, "logps/rejected": -23.92654037475586, "loss": 1.1227757930755615, "memory(GiB)": 46.81, "nll_loss": 0.6208180785179138, "rewards/accuracies": 0.71875, "rewards/chosen": -0.049955643713474274, "rewards/margins": 0.7902018427848816, "rewards/rejected": -0.8401575088500977, "step": 89, "train_speed(iter/s)": 0.010704 }, { "epoch": 0.200836820083682, "grad_norm": 1.996423363685608, "learning_rate": 0.00019862330844011466, "logits/chosen": -0.4094502031803131, "logits/rejected": -0.5237057209014893, "logps/chosen": -7.119333744049072, "logps/rejected": -27.10557746887207, "loss": 0.9298258423805237, "memory(GiB)": 46.81, "nll_loss": 0.5608960390090942, "rewards/accuracies": 0.875, "rewards/chosen": 0.13814933598041534, "rewards/margins": 1.2807323932647705, "rewards/rejected": -1.1425830125808716, "step": 90, "train_speed(iter/s)": 0.010705 }, { "epoch": 0.20306834030683404, "grad_norm": 2.4107954502105713, "learning_rate": 0.00019856159103477086, "logits/chosen": -0.38746166229248047, "logits/rejected": -0.488497257232666, "logps/chosen": -4.5973896980285645, "logps/rejected": -27.419519424438477, "loss": 0.710839033126831, "memory(GiB)": 46.81, "nll_loss": 0.30818992853164673, "rewards/accuracies": 0.84375, "rewards/chosen": 0.038327932357788086, "rewards/margins": 1.1028857231140137, "rewards/rejected": -1.064557671546936, "step": 91, "train_speed(iter/s)": 0.010705 }, { "epoch": 0.20529986052998606, "grad_norm": 1.7134486436843872, "learning_rate": 0.00019849853040729962, "logits/chosen": -0.39711794257164, "logits/rejected": -0.5056676268577576, "logps/chosen": -3.698580265045166, "logps/rejected": -35.89771270751953, "loss": 0.6057847142219543, "memory(GiB)": 46.81, "nll_loss": 0.28385108709335327, "rewards/accuracies": 0.9375, "rewards/chosen": 0.012411292642354965, "rewards/margins": 1.7848464250564575, "rewards/rejected": -1.7724350690841675, "step": 92, "train_speed(iter/s)": 0.010705 }, { "epoch": 0.20753138075313807, "grad_norm": 3.236150026321411, "learning_rate": 0.00019843412741710705, "logits/chosen": -0.4137122631072998, "logits/rejected": -0.5312527418136597, "logps/chosen": -8.622723579406738, "logps/rejected": -32.65446853637695, "loss": 0.923988938331604, "memory(GiB)": 46.81, "nll_loss": 0.5595443248748779, "rewards/accuracies": 0.78125, "rewards/chosen": -0.008658979088068008, "rewards/margins": 1.6513465642929077, "rewards/rejected": -1.6600055694580078, "step": 93, "train_speed(iter/s)": 0.010706 }, { "epoch": 0.2097629009762901, "grad_norm": 3.0684919357299805, "learning_rate": 0.00019836838294189327, "logits/chosen": -0.30109331011772156, "logits/rejected": -0.5258408784866333, "logps/chosen": -4.7982635498046875, "logps/rejected": -46.58249282836914, "loss": 0.6704127788543701, "memory(GiB)": 46.81, "nll_loss": 0.41316378116607666, "rewards/accuracies": 0.90625, "rewards/chosen": -0.022386539727449417, "rewards/margins": 2.3209354877471924, "rewards/rejected": -2.3433220386505127, "step": 94, "train_speed(iter/s)": 0.010705 }, { "epoch": 0.21199442119944212, "grad_norm": 1.8835054636001587, "learning_rate": 0.00019830129787764048, "logits/chosen": -0.41429489850997925, "logits/rejected": -0.5583072304725647, "logps/chosen": -7.361013412475586, "logps/rejected": -39.35795211791992, "loss": 0.6725447773933411, "memory(GiB)": 46.81, "nll_loss": 0.368007630109787, "rewards/accuracies": 0.84375, "rewards/chosen": -0.1507667899131775, "rewards/margins": 2.0595011711120605, "rewards/rejected": -2.210268020629883, "step": 95, "train_speed(iter/s)": 0.010706 }, { "epoch": 0.21422594142259413, "grad_norm": 2.3120245933532715, "learning_rate": 0.00019823287313860087, "logits/chosen": -0.372950941324234, "logits/rejected": -0.49759799242019653, "logps/chosen": -11.2495756149292, "logps/rejected": -34.734066009521484, "loss": 1.1070480346679688, "memory(GiB)": 46.81, "nll_loss": 0.6910135746002197, "rewards/accuracies": 0.71875, "rewards/chosen": -0.07585638761520386, "rewards/margins": 1.6244981288909912, "rewards/rejected": -1.7003545761108398, "step": 96, "train_speed(iter/s)": 0.010706 }, { "epoch": 0.21645746164574617, "grad_norm": 2.277174711227417, "learning_rate": 0.00019816310965728388, "logits/chosen": -0.4299129247665405, "logits/rejected": -0.4980982542037964, "logps/chosen": -9.542954444885254, "logps/rejected": -25.756847381591797, "loss": 0.9643784165382385, "memory(GiB)": 46.81, "nll_loss": 0.4663383364677429, "rewards/accuracies": 0.6875, "rewards/chosen": -0.04499448090791702, "rewards/margins": 1.144527554512024, "rewards/rejected": -1.1895220279693604, "step": 97, "train_speed(iter/s)": 0.010706 }, { "epoch": 0.21868898186889818, "grad_norm": 1.9245892763137817, "learning_rate": 0.00019809200838444383, "logits/chosen": -0.4750334322452545, "logits/rejected": -0.5499654412269592, "logps/chosen": -7.279554843902588, "logps/rejected": -27.49015998840332, "loss": 0.7538543343544006, "memory(GiB)": 46.81, "nll_loss": 0.37693145871162415, "rewards/accuracies": 0.875, "rewards/chosen": 0.19298376142978668, "rewards/margins": 1.2535287141799927, "rewards/rejected": -1.0605449676513672, "step": 98, "train_speed(iter/s)": 0.010707 }, { "epoch": 0.22092050209205022, "grad_norm": 2.6517419815063477, "learning_rate": 0.0001980195702890667, "logits/chosen": -0.3958469033241272, "logits/rejected": -0.5089414715766907, "logps/chosen": -7.152680397033691, "logps/rejected": -34.461917877197266, "loss": 0.8412438035011292, "memory(GiB)": 46.81, "nll_loss": 0.3738154470920563, "rewards/accuracies": 0.8125, "rewards/chosen": -0.022486146539449692, "rewards/margins": 1.67362380027771, "rewards/rejected": -1.6961098909378052, "step": 99, "train_speed(iter/s)": 0.010708 }, { "epoch": 0.22315202231520223, "grad_norm": 2.8246142864227295, "learning_rate": 0.00019794579635835704, "logits/chosen": -0.4292357861995697, "logits/rejected": -0.5326910614967346, "logps/chosen": -7.5378594398498535, "logps/rejected": -21.57219696044922, "loss": 1.0386667251586914, "memory(GiB)": 46.81, "nll_loss": 0.5401602387428284, "rewards/accuracies": 0.75, "rewards/chosen": 0.06580009311437607, "rewards/margins": 0.625900149345398, "rewards/rejected": -0.5601000189781189, "step": 100, "train_speed(iter/s)": 0.010708 }, { "epoch": 0.22538354253835424, "grad_norm": 2.5541062355041504, "learning_rate": 0.00019787068759772458, "logits/chosen": -0.2897275686264038, "logits/rejected": -0.469921737909317, "logps/chosen": -5.731183052062988, "logps/rejected": -42.3974494934082, "loss": 0.6600039005279541, "memory(GiB)": 46.81, "nll_loss": 0.34703782200813293, "rewards/accuracies": 0.9375, "rewards/chosen": 0.03177756816148758, "rewards/margins": 2.005840539932251, "rewards/rejected": -1.9740626811981201, "step": 101, "train_speed(iter/s)": 0.010686 }, { "epoch": 0.22761506276150628, "grad_norm": 1.7807402610778809, "learning_rate": 0.0001977942450307703, "logits/chosen": -0.4453420042991638, "logits/rejected": -0.5632447004318237, "logps/chosen": -2.4129638671875, "logps/rejected": -25.95719337463379, "loss": 0.5793961882591248, "memory(GiB)": 46.81, "nll_loss": 0.23024141788482666, "rewards/accuracies": 0.9375, "rewards/chosen": 0.14239919185638428, "rewards/margins": 1.4281731843948364, "rewards/rejected": -1.2857739925384521, "step": 102, "train_speed(iter/s)": 0.010687 }, { "epoch": 0.2298465829846583, "grad_norm": 2.2132644653320312, "learning_rate": 0.00019771646969927276, "logits/chosen": -0.35926875472068787, "logits/rejected": -0.520535945892334, "logps/chosen": -13.426995277404785, "logps/rejected": -45.62168884277344, "loss": 1.015347957611084, "memory(GiB)": 46.81, "nll_loss": 0.7125861644744873, "rewards/accuracies": 0.9375, "rewards/chosen": -0.29009538888931274, "rewards/margins": 2.0907297134399414, "rewards/rejected": -2.3808252811431885, "step": 103, "train_speed(iter/s)": 0.010687 }, { "epoch": 0.23207810320781033, "grad_norm": 3.2295114994049072, "learning_rate": 0.00019763736266317373, "logits/chosen": -0.40255796909332275, "logits/rejected": -0.48326143622398376, "logps/chosen": -11.606037139892578, "logps/rejected": -31.71380043029785, "loss": 1.1166499853134155, "memory(GiB)": 46.81, "nll_loss": 0.6979129910469055, "rewards/accuracies": 0.875, "rewards/chosen": -0.08108239620923996, "rewards/margins": 1.4596813917160034, "rewards/rejected": -1.5407637357711792, "step": 104, "train_speed(iter/s)": 0.010687 }, { "epoch": 0.23430962343096234, "grad_norm": 10.526008605957031, "learning_rate": 0.00019755692500056377, "logits/chosen": -0.39488697052001953, "logits/rejected": -0.4993595480918884, "logps/chosen": -8.515541076660156, "logps/rejected": -43.509639739990234, "loss": 0.9588133096694946, "memory(GiB)": 46.81, "nll_loss": 0.6071394085884094, "rewards/accuracies": 0.90625, "rewards/chosen": -0.21072883903980255, "rewards/margins": 2.291653633117676, "rewards/rejected": -2.502382278442383, "step": 105, "train_speed(iter/s)": 0.010688 }, { "epoch": 0.23654114365411436, "grad_norm": 4.369258880615234, "learning_rate": 0.0001974751578076675, "logits/chosen": -0.47596731781959534, "logits/rejected": -0.567024827003479, "logps/chosen": -9.769340515136719, "logps/rejected": -36.51396560668945, "loss": 1.1472177505493164, "memory(GiB)": 46.81, "nll_loss": 0.7814697623252869, "rewards/accuracies": 0.875, "rewards/chosen": -0.07862536609172821, "rewards/margins": 1.9599454402923584, "rewards/rejected": -2.0385708808898926, "step": 106, "train_speed(iter/s)": 0.010688 }, { "epoch": 0.2387726638772664, "grad_norm": 2.6377806663513184, "learning_rate": 0.0001973920621988288, "logits/chosen": -0.4363410472869873, "logits/rejected": -0.5180681943893433, "logps/chosen": -8.525186538696289, "logps/rejected": -36.119422912597656, "loss": 0.8840208053588867, "memory(GiB)": 46.81, "nll_loss": 0.5660971999168396, "rewards/accuracies": 0.84375, "rewards/chosen": -0.11222146451473236, "rewards/margins": 2.031522035598755, "rewards/rejected": -2.1437435150146484, "step": 107, "train_speed(iter/s)": 0.010689 }, { "epoch": 0.2410041841004184, "grad_norm": 3.5556135177612305, "learning_rate": 0.00019730763930649557, "logits/chosen": -0.4549260139465332, "logits/rejected": -0.5709996223449707, "logps/chosen": -6.807540416717529, "logps/rejected": -35.386817932128906, "loss": 1.0365853309631348, "memory(GiB)": 46.81, "nll_loss": 0.6718467473983765, "rewards/accuracies": 0.90625, "rewards/chosen": -0.010064257308840752, "rewards/margins": 2.010096549987793, "rewards/rejected": -2.0201611518859863, "step": 108, "train_speed(iter/s)": 0.01069 }, { "epoch": 0.24323570432357045, "grad_norm": 2.9586894512176514, "learning_rate": 0.0001972218902812041, "logits/chosen": -0.5169477462768555, "logits/rejected": -0.5766913890838623, "logps/chosen": -9.75178050994873, "logps/rejected": -26.94969940185547, "loss": 1.03122079372406, "memory(GiB)": 46.81, "nll_loss": 0.6585339307785034, "rewards/accuracies": 0.90625, "rewards/chosen": -0.047493062913417816, "rewards/margins": 1.4683667421340942, "rewards/rejected": -1.5158597230911255, "step": 109, "train_speed(iter/s)": 0.010691 }, { "epoch": 0.24546722454672246, "grad_norm": 2.40643310546875, "learning_rate": 0.0001971348162915637, "logits/chosen": -0.40012210607528687, "logits/rejected": -0.5228334665298462, "logps/chosen": -12.064148902893066, "logps/rejected": -42.65177917480469, "loss": 1.028669834136963, "memory(GiB)": 46.81, "nll_loss": 0.584478497505188, "rewards/accuracies": 0.8125, "rewards/chosen": 0.0045367032289505005, "rewards/margins": 1.1938111782073975, "rewards/rejected": -1.189274549484253, "step": 110, "train_speed(iter/s)": 0.01069 }, { "epoch": 0.24769874476987447, "grad_norm": 1.9528326988220215, "learning_rate": 0.0001970464185242406, "logits/chosen": -0.48454731702804565, "logits/rejected": -0.5713267922401428, "logps/chosen": -8.57382869720459, "logps/rejected": -28.3697452545166, "loss": 0.9442793130874634, "memory(GiB)": 46.81, "nll_loss": 0.5884312987327576, "rewards/accuracies": 0.96875, "rewards/chosen": -0.007765632122755051, "rewards/margins": 1.1733622550964355, "rewards/rejected": -1.181127905845642, "step": 111, "train_speed(iter/s)": 0.01069 }, { "epoch": 0.2499302649930265, "grad_norm": 1.6935343742370605, "learning_rate": 0.00019695669818394176, "logits/chosen": -0.49247032403945923, "logits/rejected": -0.5529605150222778, "logps/chosen": -6.149413108825684, "logps/rejected": -26.09927749633789, "loss": 0.8117169141769409, "memory(GiB)": 46.81, "nll_loss": 0.36330851912498474, "rewards/accuracies": 0.8125, "rewards/chosen": 0.11475833505392075, "rewards/margins": 0.9903795719146729, "rewards/rejected": -0.8756212592124939, "step": 112, "train_speed(iter/s)": 0.010691 }, { "epoch": 0.25216178521617855, "grad_norm": 1.7400895357131958, "learning_rate": 0.00019686565649339852, "logits/chosen": -0.47781193256378174, "logits/rejected": -0.541789174079895, "logps/chosen": -7.246283054351807, "logps/rejected": -28.977123260498047, "loss": 0.8169933557510376, "memory(GiB)": 46.81, "nll_loss": 0.46227994561195374, "rewards/accuracies": 0.875, "rewards/chosen": 0.1930399090051651, "rewards/margins": 1.5713894367218018, "rewards/rejected": -1.3783494234085083, "step": 113, "train_speed(iter/s)": 0.010692 }, { "epoch": 0.25439330543933053, "grad_norm": 2.0717272758483887, "learning_rate": 0.0001967732946933499, "logits/chosen": -0.48887836933135986, "logits/rejected": -0.5135952234268188, "logps/chosen": -9.175788879394531, "logps/rejected": -19.074743270874023, "loss": 1.0894757509231567, "memory(GiB)": 46.81, "nll_loss": 0.5358699560165405, "rewards/accuracies": 0.75, "rewards/chosen": -0.011165066622197628, "rewards/margins": 0.7140389084815979, "rewards/rejected": -0.7252039313316345, "step": 114, "train_speed(iter/s)": 0.010692 }, { "epoch": 0.25662482566248257, "grad_norm": 1.8609806299209595, "learning_rate": 0.00019667961404252573, "logits/chosen": -0.46024733781814575, "logits/rejected": -0.5330649018287659, "logps/chosen": -6.905147552490234, "logps/rejected": -30.54239273071289, "loss": 0.8680601119995117, "memory(GiB)": 46.81, "nll_loss": 0.44586634635925293, "rewards/accuracies": 0.78125, "rewards/chosen": 0.03578485921025276, "rewards/margins": 1.5293731689453125, "rewards/rejected": -1.4935882091522217, "step": 115, "train_speed(iter/s)": 0.010693 }, { "epoch": 0.2588563458856346, "grad_norm": 1.66657292842865, "learning_rate": 0.00019658461581762948, "logits/chosen": -0.430117666721344, "logits/rejected": -0.5585033297538757, "logps/chosen": -5.328842639923096, "logps/rejected": -37.261329650878906, "loss": 0.6072223782539368, "memory(GiB)": 46.81, "nll_loss": 0.3235556483268738, "rewards/accuracies": 0.9375, "rewards/chosen": 0.11161011457443237, "rewards/margins": 2.0768401622772217, "rewards/rejected": -1.965229868888855, "step": 116, "train_speed(iter/s)": 0.010693 }, { "epoch": 0.2610878661087866, "grad_norm": 1.51878821849823, "learning_rate": 0.0001964883013133208, "logits/chosen": -0.419185996055603, "logits/rejected": -0.5297868251800537, "logps/chosen": -8.04638385772705, "logps/rejected": -37.03801727294922, "loss": 0.7135862708091736, "memory(GiB)": 46.81, "nll_loss": 0.40418556332588196, "rewards/accuracies": 0.84375, "rewards/chosen": -0.003706634044647217, "rewards/margins": 2.0922625064849854, "rewards/rejected": -2.0959692001342773, "step": 117, "train_speed(iter/s)": 0.010693 }, { "epoch": 0.26331938633193863, "grad_norm": 1.7501200437545776, "learning_rate": 0.00019639067184219796, "logits/chosen": -0.4789353609085083, "logits/rejected": -0.5624681711196899, "logps/chosen": -2.698453426361084, "logps/rejected": -30.66053009033203, "loss": 0.4839392304420471, "memory(GiB)": 46.81, "nll_loss": 0.23937827348709106, "rewards/accuracies": 0.9375, "rewards/chosen": 0.1991066038608551, "rewards/margins": 2.1478512287139893, "rewards/rejected": -1.948744773864746, "step": 118, "train_speed(iter/s)": 0.010693 }, { "epoch": 0.26555090655509067, "grad_norm": 5.462699890136719, "learning_rate": 0.00019629172873477995, "logits/chosen": -0.4896751642227173, "logits/rejected": -0.6056660413742065, "logps/chosen": -9.186168670654297, "logps/rejected": -43.67456817626953, "loss": 1.0974973440170288, "memory(GiB)": 46.81, "nll_loss": 0.7505476474761963, "rewards/accuracies": 0.75, "rewards/chosen": -0.26940032839775085, "rewards/margins": 2.277892589569092, "rewards/rejected": -2.547292709350586, "step": 119, "train_speed(iter/s)": 0.010694 }, { "epoch": 0.26778242677824265, "grad_norm": 2.521127462387085, "learning_rate": 0.00019619147333948823, "logits/chosen": -0.40272024273872375, "logits/rejected": -0.6465494632720947, "logps/chosen": -4.102967262268066, "logps/rejected": -46.14149475097656, "loss": 0.6112779974937439, "memory(GiB)": 46.81, "nll_loss": 0.35009804368019104, "rewards/accuracies": 0.875, "rewards/chosen": -0.06559442728757858, "rewards/margins": 2.652864456176758, "rewards/rejected": -2.718458652496338, "step": 120, "train_speed(iter/s)": 0.010694 }, { "epoch": 0.2700139470013947, "grad_norm": 6.966860771179199, "learning_rate": 0.00019608990702262862, "logits/chosen": -0.46823495626449585, "logits/rejected": -0.5669148564338684, "logps/chosen": -11.427492141723633, "logps/rejected": -41.708621978759766, "loss": 0.9116367101669312, "memory(GiB)": 46.81, "nll_loss": 0.5967401266098022, "rewards/accuracies": 0.75, "rewards/chosen": -0.1262148916721344, "rewards/margins": 2.7404427528381348, "rewards/rejected": -2.8666577339172363, "step": 121, "train_speed(iter/s)": 0.010694 }, { "epoch": 0.27224546722454673, "grad_norm": 3.0951266288757324, "learning_rate": 0.0001959870311683723, "logits/chosen": -0.4486353099346161, "logits/rejected": -0.5479130744934082, "logps/chosen": -12.51127815246582, "logps/rejected": -38.43931198120117, "loss": 0.9770362377166748, "memory(GiB)": 46.81, "nll_loss": 0.5739753246307373, "rewards/accuracies": 0.8125, "rewards/chosen": -0.2812083661556244, "rewards/margins": 1.7542171478271484, "rewards/rejected": -2.0354256629943848, "step": 122, "train_speed(iter/s)": 0.010694 }, { "epoch": 0.2744769874476987, "grad_norm": 2.664623498916626, "learning_rate": 0.00019588284717873738, "logits/chosen": -0.48905450105667114, "logits/rejected": -0.5784589052200317, "logps/chosen": -11.445174217224121, "logps/rejected": -45.63172149658203, "loss": 0.8187350630760193, "memory(GiB)": 46.81, "nll_loss": 0.5693225860595703, "rewards/accuracies": 0.875, "rewards/chosen": -0.07134091854095459, "rewards/margins": 2.74631929397583, "rewards/rejected": -2.8176605701446533, "step": 123, "train_speed(iter/s)": 0.010693 }, { "epoch": 0.27670850767085076, "grad_norm": 1.5270544290542603, "learning_rate": 0.00019577735647356928, "logits/chosen": -0.42984533309936523, "logits/rejected": -0.5359001159667969, "logps/chosen": -6.653199195861816, "logps/rejected": -29.57577133178711, "loss": 0.7354912757873535, "memory(GiB)": 46.81, "nll_loss": 0.3922813832759857, "rewards/accuracies": 0.875, "rewards/chosen": 0.1660708487033844, "rewards/margins": 1.5390381813049316, "rewards/rejected": -1.3729673624038696, "step": 124, "train_speed(iter/s)": 0.010694 }, { "epoch": 0.2789400278940028, "grad_norm": 3.5429413318634033, "learning_rate": 0.00019567056049052203, "logits/chosen": -0.3107150197029114, "logits/rejected": -0.4991438388824463, "logps/chosen": -5.079807758331299, "logps/rejected": -40.358970642089844, "loss": 0.6619258522987366, "memory(GiB)": 46.81, "nll_loss": 0.36486440896987915, "rewards/accuracies": 0.90625, "rewards/chosen": 0.030078772455453873, "rewards/margins": 1.9852522611618042, "rewards/rejected": -1.955173373222351, "step": 125, "train_speed(iter/s)": 0.010693 }, { "epoch": 0.28117154811715483, "grad_norm": 1.961870551109314, "learning_rate": 0.00019556246068503795, "logits/chosen": -0.44410189986228943, "logits/rejected": -0.4920841455459595, "logps/chosen": -11.91314697265625, "logps/rejected": -31.1485595703125, "loss": 0.8891083598136902, "memory(GiB)": 46.81, "nll_loss": 0.5505969524383545, "rewards/accuracies": 0.84375, "rewards/chosen": 0.03779969736933708, "rewards/margins": 1.8280887603759766, "rewards/rejected": -1.790289044380188, "step": 126, "train_speed(iter/s)": 0.010694 }, { "epoch": 0.2834030683403068, "grad_norm": 2.261699676513672, "learning_rate": 0.00019545305853032848, "logits/chosen": -0.3864215016365051, "logits/rejected": -0.4863501191139221, "logps/chosen": -7.286771774291992, "logps/rejected": -30.703035354614258, "loss": 0.8944107294082642, "memory(GiB)": 46.81, "nll_loss": 0.5101214051246643, "rewards/accuracies": 0.875, "rewards/chosen": 0.018673699349164963, "rewards/margins": 1.4196372032165527, "rewards/rejected": -1.400963544845581, "step": 127, "train_speed(iter/s)": 0.010694 }, { "epoch": 0.28563458856345886, "grad_norm": 1.475645899772644, "learning_rate": 0.0001953423555173536, "logits/chosen": -0.36042094230651855, "logits/rejected": -0.5007886290550232, "logps/chosen": -5.484119892120361, "logps/rejected": -41.732566833496094, "loss": 0.587951123714447, "memory(GiB)": 46.81, "nll_loss": 0.33234262466430664, "rewards/accuracies": 0.96875, "rewards/chosen": 0.022678524255752563, "rewards/margins": 1.7825675010681152, "rewards/rejected": -1.7598888874053955, "step": 128, "train_speed(iter/s)": 0.010694 }, { "epoch": 0.2878661087866109, "grad_norm": 1.8218269348144531, "learning_rate": 0.0001952303531548018, "logits/chosen": -0.33974117040634155, "logits/rejected": -0.44949695467948914, "logps/chosen": -5.385599136352539, "logps/rejected": -34.09246063232422, "loss": 0.566850483417511, "memory(GiB)": 46.81, "nll_loss": 0.25613701343536377, "rewards/accuracies": 0.90625, "rewards/chosen": 0.12256469577550888, "rewards/margins": 1.9903541803359985, "rewards/rejected": -1.8677895069122314, "step": 129, "train_speed(iter/s)": 0.010694 }, { "epoch": 0.2900976290097629, "grad_norm": 1.8668869733810425, "learning_rate": 0.00019511705296906945, "logits/chosen": -0.3487342596054077, "logits/rejected": -0.4806521534919739, "logps/chosen": -4.425655841827393, "logps/rejected": -30.515653610229492, "loss": 0.5262651443481445, "memory(GiB)": 46.81, "nll_loss": 0.25739917159080505, "rewards/accuracies": 0.90625, "rewards/chosen": 0.12762486934661865, "rewards/margins": 1.6179413795471191, "rewards/rejected": -1.4903165102005005, "step": 130, "train_speed(iter/s)": 0.010695 }, { "epoch": 0.2923291492329149, "grad_norm": 2.4468886852264404, "learning_rate": 0.00019500245650423987, "logits/chosen": -0.3514082133769989, "logits/rejected": -0.4678734242916107, "logps/chosen": -9.789356231689453, "logps/rejected": -43.26856231689453, "loss": 0.8514004349708557, "memory(GiB)": 46.81, "nll_loss": 0.5882378816604614, "rewards/accuracies": 0.9375, "rewards/chosen": -0.00511053204536438, "rewards/margins": 2.595022678375244, "rewards/rejected": -2.600132942199707, "step": 131, "train_speed(iter/s)": 0.010695 }, { "epoch": 0.29456066945606696, "grad_norm": 1.4899861812591553, "learning_rate": 0.00019488656532206256, "logits/chosen": -0.32015788555145264, "logits/rejected": -0.5057851672172546, "logps/chosen": -5.5769572257995605, "logps/rejected": -39.262237548828125, "loss": 0.5258051156997681, "memory(GiB)": 46.81, "nll_loss": 0.2577199935913086, "rewards/accuracies": 0.9375, "rewards/chosen": 0.012265877798199654, "rewards/margins": 1.970078945159912, "rewards/rejected": -1.957813024520874, "step": 132, "train_speed(iter/s)": 0.010695 }, { "epoch": 0.29679218967921894, "grad_norm": 2.7044637203216553, "learning_rate": 0.00019476938100193166, "logits/chosen": -0.3656051754951477, "logits/rejected": -0.4236447215080261, "logps/chosen": -10.65760612487793, "logps/rejected": -38.63339614868164, "loss": 0.9246849417686462, "memory(GiB)": 46.81, "nll_loss": 0.6106225848197937, "rewards/accuracies": 0.84375, "rewards/chosen": 0.030058247968554497, "rewards/margins": 2.29494047164917, "rewards/rejected": -2.2648820877075195, "step": 133, "train_speed(iter/s)": 0.010695 }, { "epoch": 0.299023709902371, "grad_norm": 1.82398521900177, "learning_rate": 0.00019465090514086448, "logits/chosen": -0.2924862504005432, "logits/rejected": -0.49178171157836914, "logps/chosen": -5.639602184295654, "logps/rejected": -44.825313568115234, "loss": 0.5453966856002808, "memory(GiB)": 46.81, "nll_loss": 0.3345707952976227, "rewards/accuracies": 0.90625, "rewards/chosen": 0.07429855316877365, "rewards/margins": 2.4938178062438965, "rewards/rejected": -2.4195189476013184, "step": 134, "train_speed(iter/s)": 0.010695 }, { "epoch": 0.301255230125523, "grad_norm": 3.8286569118499756, "learning_rate": 0.00019453113935347983, "logits/chosen": -0.29531559348106384, "logits/rejected": -0.43998682498931885, "logps/chosen": -10.71696662902832, "logps/rejected": -31.618389129638672, "loss": 1.1089136600494385, "memory(GiB)": 46.81, "nll_loss": 0.7216206789016724, "rewards/accuracies": 0.84375, "rewards/chosen": -0.1611023098230362, "rewards/margins": 1.5489929914474487, "rewards/rejected": -1.7100951671600342, "step": 135, "train_speed(iter/s)": 0.010695 }, { "epoch": 0.30348675034867506, "grad_norm": 2.3694629669189453, "learning_rate": 0.000194410085271976, "logits/chosen": -0.3209247291088104, "logits/rejected": -0.47681719064712524, "logps/chosen": -8.806313514709473, "logps/rejected": -42.08256912231445, "loss": 0.8723977208137512, "memory(GiB)": 46.81, "nll_loss": 0.6001561880111694, "rewards/accuracies": 0.90625, "rewards/chosen": -0.08420376479625702, "rewards/margins": 2.307250499725342, "rewards/rejected": -2.3914542198181152, "step": 136, "train_speed(iter/s)": 0.010695 }, { "epoch": 0.30571827057182704, "grad_norm": 4.322510719299316, "learning_rate": 0.00019428774454610843, "logits/chosen": -0.3234959542751312, "logits/rejected": -0.43433526158332825, "logps/chosen": -8.827983856201172, "logps/rejected": -38.56624984741211, "loss": 0.8363085985183716, "memory(GiB)": 46.81, "nll_loss": 0.5304505825042725, "rewards/accuracies": 0.9375, "rewards/chosen": -0.03617179021239281, "rewards/margins": 2.3936820030212402, "rewards/rejected": -2.429853677749634, "step": 137, "train_speed(iter/s)": 0.010695 }, { "epoch": 0.3079497907949791, "grad_norm": 1.8575319051742554, "learning_rate": 0.00019416411884316722, "logits/chosen": -0.19573748111724854, "logits/rejected": -0.39096614718437195, "logps/chosen": -5.302525043487549, "logps/rejected": -39.366905212402344, "loss": 0.5817482471466064, "memory(GiB)": 46.81, "nll_loss": 0.3171233534812927, "rewards/accuracies": 0.875, "rewards/chosen": 0.06202463060617447, "rewards/margins": 2.1402504444122314, "rewards/rejected": -2.07822585105896, "step": 138, "train_speed(iter/s)": 0.010695 }, { "epoch": 0.3101813110181311, "grad_norm": 1.6324138641357422, "learning_rate": 0.00019403920984795454, "logits/chosen": -0.18411299586296082, "logits/rejected": -0.3911224901676178, "logps/chosen": -4.253074645996094, "logps/rejected": -37.889976501464844, "loss": 0.6420720815658569, "memory(GiB)": 46.81, "nll_loss": 0.3620051145553589, "rewards/accuracies": 0.875, "rewards/chosen": 0.1460508555173874, "rewards/margins": 2.2889294624328613, "rewards/rejected": -2.142878770828247, "step": 139, "train_speed(iter/s)": 0.010695 }, { "epoch": 0.3124128312412831, "grad_norm": 2.665651798248291, "learning_rate": 0.00019391301926276156, "logits/chosen": -0.22396986186504364, "logits/rejected": -0.3946935534477234, "logps/chosen": -4.665857315063477, "logps/rejected": -40.48711395263672, "loss": 0.7322566509246826, "memory(GiB)": 46.81, "nll_loss": 0.41601666808128357, "rewards/accuracies": 0.875, "rewards/chosen": -0.039280496537685394, "rewards/margins": 2.420466899871826, "rewards/rejected": -2.459747314453125, "step": 140, "train_speed(iter/s)": 0.010695 }, { "epoch": 0.31464435146443515, "grad_norm": 2.0447568893432617, "learning_rate": 0.00019378554880734527, "logits/chosen": -0.22006088495254517, "logits/rejected": -0.3875121772289276, "logps/chosen": -5.640967845916748, "logps/rejected": -47.2126579284668, "loss": 0.6299532651901245, "memory(GiB)": 46.81, "nll_loss": 0.4075142443180084, "rewards/accuracies": 0.9375, "rewards/chosen": 0.07418311387300491, "rewards/margins": 3.378464460372925, "rewards/rejected": -3.304281711578369, "step": 141, "train_speed(iter/s)": 0.010695 }, { "epoch": 0.3168758716875872, "grad_norm": 3.150909185409546, "learning_rate": 0.00019365680021890506, "logits/chosen": -0.2578600347042084, "logits/rejected": -0.35254308581352234, "logps/chosen": -8.539968490600586, "logps/rejected": -34.56965637207031, "loss": 0.9595645070075989, "memory(GiB)": 46.81, "nll_loss": 0.5309237241744995, "rewards/accuracies": 0.75, "rewards/chosen": -0.1485617607831955, "rewards/margins": 1.7760200500488281, "rewards/rejected": -1.9245820045471191, "step": 142, "train_speed(iter/s)": 0.010696 }, { "epoch": 0.31910739191073917, "grad_norm": 3.2599754333496094, "learning_rate": 0.0001935267752520591, "logits/chosen": -0.3178224563598633, "logits/rejected": -0.43051257729530334, "logps/chosen": -9.458460807800293, "logps/rejected": -43.98479080200195, "loss": 0.8238604068756104, "memory(GiB)": 46.81, "nll_loss": 0.5105634331703186, "rewards/accuracies": 0.84375, "rewards/chosen": -0.19997264444828033, "rewards/margins": 2.638275146484375, "rewards/rejected": -2.8382480144500732, "step": 143, "train_speed(iter/s)": 0.010696 }, { "epoch": 0.3213389121338912, "grad_norm": 7.584465503692627, "learning_rate": 0.00019339547567882024, "logits/chosen": -0.2016015499830246, "logits/rejected": -0.36200886964797974, "logps/chosen": -9.776619911193848, "logps/rejected": -48.03835678100586, "loss": 0.9604641199111938, "memory(GiB)": 46.81, "nll_loss": 0.7163732647895813, "rewards/accuracies": 0.90625, "rewards/chosen": 0.24650944769382477, "rewards/margins": 3.3983724117279053, "rewards/rejected": -3.151862621307373, "step": 144, "train_speed(iter/s)": 0.010696 }, { "epoch": 0.32357043235704325, "grad_norm": 3.555295944213867, "learning_rate": 0.0001932629032885721, "logits/chosen": -0.26102834939956665, "logits/rejected": -0.3585357069969177, "logps/chosen": -12.133922576904297, "logps/rejected": -48.155155181884766, "loss": 0.9948782920837402, "memory(GiB)": 46.81, "nll_loss": 0.6610950231552124, "rewards/accuracies": 0.90625, "rewards/chosen": -0.4001372456550598, "rewards/margins": 2.751622200012207, "rewards/rejected": -3.151759386062622, "step": 145, "train_speed(iter/s)": 0.010697 }, { "epoch": 0.32580195258019523, "grad_norm": 2.2978155612945557, "learning_rate": 0.0001931290598880445, "logits/chosen": -0.20670001208782196, "logits/rejected": -0.38169875741004944, "logps/chosen": -6.4796600341796875, "logps/rejected": -41.426429748535156, "loss": 0.6576346158981323, "memory(GiB)": 46.81, "nll_loss": 0.42290252447128296, "rewards/accuracies": 0.84375, "rewards/chosen": 0.11042710393667221, "rewards/margins": 2.6782710552215576, "rewards/rejected": -2.5678436756134033, "step": 146, "train_speed(iter/s)": 0.010697 }, { "epoch": 0.32803347280334727, "grad_norm": 2.1882224082946777, "learning_rate": 0.00019299394730128895, "logits/chosen": -0.20903249084949493, "logits/rejected": -0.2923564314842224, "logps/chosen": -12.293680191040039, "logps/rejected": -50.68069076538086, "loss": 0.8728819489479065, "memory(GiB)": 46.81, "nll_loss": 0.5617231130599976, "rewards/accuracies": 0.875, "rewards/chosen": -0.08868011832237244, "rewards/margins": 3.250684976577759, "rewards/rejected": -3.339365005493164, "step": 147, "train_speed(iter/s)": 0.010696 }, { "epoch": 0.3302649930264993, "grad_norm": 2.5009729862213135, "learning_rate": 0.00019285756736965367, "logits/chosen": -0.2492772340774536, "logits/rejected": -0.3531278669834137, "logps/chosen": -7.951318264007568, "logps/rejected": -34.95103073120117, "loss": 0.9188458323478699, "memory(GiB)": 46.81, "nll_loss": 0.5677845478057861, "rewards/accuracies": 0.84375, "rewards/chosen": 0.015583137050271034, "rewards/margins": 2.127014398574829, "rewards/rejected": -2.111431360244751, "step": 148, "train_speed(iter/s)": 0.010697 }, { "epoch": 0.33249651324965135, "grad_norm": 2.460752487182617, "learning_rate": 0.00019271992195175875, "logits/chosen": -0.31061843037605286, "logits/rejected": -0.42540180683135986, "logps/chosen": -8.994503021240234, "logps/rejected": -38.728179931640625, "loss": 0.9080746173858643, "memory(GiB)": 46.81, "nll_loss": 0.5827285051345825, "rewards/accuracies": 0.8125, "rewards/chosen": 0.09331205487251282, "rewards/margins": 2.394498348236084, "rewards/rejected": -2.3011860847473145, "step": 149, "train_speed(iter/s)": 0.010697 }, { "epoch": 0.33472803347280333, "grad_norm": 1.7428467273712158, "learning_rate": 0.00019258101292347042, "logits/chosen": -0.19874219596385956, "logits/rejected": -0.36566510796546936, "logps/chosen": -8.282856941223145, "logps/rejected": -47.80164337158203, "loss": 0.6850791573524475, "memory(GiB)": 46.81, "nll_loss": 0.5025182366371155, "rewards/accuracies": 0.96875, "rewards/chosen": 0.09450387954711914, "rewards/margins": 2.836395502090454, "rewards/rejected": -2.741891622543335, "step": 150, "train_speed(iter/s)": 0.010697 } ], "logging_steps": 1, "max_steps": 896, "num_input_tokens_seen": 0, "num_train_epochs": 2, "save_steps": 50, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": false }, "attributes": {} } }, "total_flos": 8.266512662842573e+16, "train_batch_size": 2, "trial_name": null, "trial_params": null }