{ "best_global_step": null, "best_metric": null, "best_model_checkpoint": null, "epoch": 0.1708580276576432, "eval_steps": 300, "global_step": 100, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "epoch": 0.0017085802765764322, "grad_norm": 9.203307151794434, "learning_rate": 3.3898305084745763e-06, "logits/chosen": -0.6409764885902405, "logits/rejected": -0.6413162350654602, "logps/chosen": -8.591513633728027, "logps/rejected": -9.922354698181152, "loss": 1.2514135837554932, "memory(GiB)": 45.3, "nll_loss": 0.5582665801048279, "rewards/accuracies": 0.0, "rewards/chosen": 0.0, "rewards/margins": 0.0, "rewards/rejected": 0.0, "step": 1, "train_speed(iter/s)": 0.005423 }, { "epoch": 0.0034171605531528645, "grad_norm": 4.572653293609619, "learning_rate": 6.779661016949153e-06, "logits/chosen": -0.6253237724304199, "logits/rejected": -0.6232100129127502, "logps/chosen": -9.215431213378906, "logps/rejected": -6.302733898162842, "loss": 1.1804862022399902, "memory(GiB)": 45.3, "nll_loss": 0.4873391091823578, "rewards/accuracies": 0.0, "rewards/chosen": 0.0, "rewards/margins": 0.0, "rewards/rejected": 0.0, "step": 2, "train_speed(iter/s)": 0.005426 }, { "epoch": 0.005125740829729297, "grad_norm": 10.135663986206055, "learning_rate": 1.016949152542373e-05, "logits/chosen": -0.5830379724502563, "logits/rejected": -0.5847949981689453, "logps/chosen": -6.387916088104248, "logps/rejected": -12.526434898376465, "loss": 1.1388403177261353, "memory(GiB)": 46.08, "nll_loss": 0.44991743564605713, "rewards/accuracies": 0.71875, "rewards/chosen": 0.0018886500038206577, "rewards/margins": 0.008566470816731453, "rewards/rejected": -0.006677820347249508, "step": 3, "train_speed(iter/s)": 0.005372 }, { "epoch": 0.006834321106305729, "grad_norm": 8.09815788269043, "learning_rate": 1.3559322033898305e-05, "logits/chosen": -0.5831664800643921, "logits/rejected": -0.5881690382957458, "logps/chosen": -9.77461051940918, "logps/rejected": -15.103912353515625, "loss": 1.2644962072372437, "memory(GiB)": 46.08, "nll_loss": 0.5699671506881714, "rewards/accuracies": 0.4375, "rewards/chosen": -0.0013185496209189296, "rewards/margins": -0.0025646828580647707, "rewards/rejected": 0.0012461334699764848, "step": 4, "train_speed(iter/s)": 0.005433 }, { "epoch": 0.008542901382882162, "grad_norm": 10.546202659606934, "learning_rate": 1.694915254237288e-05, "logits/chosen": -0.6210501194000244, "logits/rejected": -0.6261105537414551, "logps/chosen": -9.743502616882324, "logps/rejected": -13.954730987548828, "loss": 1.2041635513305664, "memory(GiB)": 46.08, "nll_loss": 0.5165743231773376, "rewards/accuracies": 0.53125, "rewards/chosen": 0.014782106503844261, "rewards/margins": 0.011779396794736385, "rewards/rejected": 0.0030027113389223814, "step": 5, "train_speed(iter/s)": 0.005434 }, { "epoch": 0.010251481659458593, "grad_norm": 5.953731060028076, "learning_rate": 2.033898305084746e-05, "logits/chosen": -0.6194843649864197, "logits/rejected": -0.6225060224533081, "logps/chosen": -8.993276596069336, "logps/rejected": -11.800742149353027, "loss": 1.2383989095687866, "memory(GiB)": 46.08, "nll_loss": 0.5413038730621338, "rewards/accuracies": 0.46875, "rewards/chosen": 0.02151685394346714, "rewards/margins": -0.004275719169527292, "rewards/rejected": 0.025792576372623444, "step": 6, "train_speed(iter/s)": 0.005421 }, { "epoch": 0.011960061936035027, "grad_norm": 3.4447383880615234, "learning_rate": 2.3728813559322036e-05, "logits/chosen": -0.5979399681091309, "logits/rejected": -0.597865104675293, "logps/chosen": -11.88587760925293, "logps/rejected": -12.513296127319336, "loss": 1.1787316799163818, "memory(GiB)": 46.08, "nll_loss": 0.4771195948123932, "rewards/accuracies": 0.46875, "rewards/chosen": 0.001614744309335947, "rewards/margins": -0.006370083428919315, "rewards/rejected": 0.007984823547303677, "step": 7, "train_speed(iter/s)": 0.005421 }, { "epoch": 0.013668642212611458, "grad_norm": 4.3422627449035645, "learning_rate": 2.711864406779661e-05, "logits/chosen": -0.5695681571960449, "logits/rejected": -0.5736703276634216, "logps/chosen": -8.691235542297363, "logps/rejected": -17.510940551757812, "loss": 1.085353970527649, "memory(GiB)": 46.08, "nll_loss": 0.4569101631641388, "rewards/accuracies": 0.65625, "rewards/chosen": 0.061018284410238266, "rewards/margins": 0.16366331279277802, "rewards/rejected": -0.10264502465724945, "step": 8, "train_speed(iter/s)": 0.005421 }, { "epoch": 0.015377222489187891, "grad_norm": 6.347766399383545, "learning_rate": 3.050847457627119e-05, "logits/chosen": -0.6150330305099487, "logits/rejected": -0.6163787841796875, "logps/chosen": -14.26973819732666, "logps/rejected": -12.656587600708008, "loss": 1.3125040531158447, "memory(GiB)": 46.08, "nll_loss": 0.6051884293556213, "rewards/accuracies": 0.59375, "rewards/chosen": -0.06490564346313477, "rewards/margins": 0.03234899416565895, "rewards/rejected": -0.09725463390350342, "step": 9, "train_speed(iter/s)": 0.005427 }, { "epoch": 0.017085802765764324, "grad_norm": 3.609342575073242, "learning_rate": 3.389830508474576e-05, "logits/chosen": -0.5823943018913269, "logits/rejected": -0.5893073678016663, "logps/chosen": -12.539135932922363, "logps/rejected": -19.231651306152344, "loss": 1.154615044593811, "memory(GiB)": 46.08, "nll_loss": 0.5292682647705078, "rewards/accuracies": 0.71875, "rewards/chosen": -0.0102485166862607, "rewards/margins": 0.24539220333099365, "rewards/rejected": -0.2556407153606415, "step": 10, "train_speed(iter/s)": 0.00544 }, { "epoch": 0.018794383042340754, "grad_norm": 4.803543567657471, "learning_rate": 3.728813559322034e-05, "logits/chosen": -0.6298958659172058, "logits/rejected": -0.6301961541175842, "logps/chosen": -10.286799430847168, "logps/rejected": -11.364641189575195, "loss": 1.143830418586731, "memory(GiB)": 46.08, "nll_loss": 0.43475160002708435, "rewards/accuracies": 0.46875, "rewards/chosen": -0.06166127696633339, "rewards/margins": 0.1280723363161087, "rewards/rejected": -0.189733624458313, "step": 11, "train_speed(iter/s)": 0.005459 }, { "epoch": 0.020502963318917187, "grad_norm": 6.843598365783691, "learning_rate": 4.067796610169492e-05, "logits/chosen": -0.6147834062576294, "logits/rejected": -0.6201154589653015, "logps/chosen": -11.104015350341797, "logps/rejected": -14.71792221069336, "loss": 1.2689580917358398, "memory(GiB)": 46.08, "nll_loss": 0.4583723843097687, "rewards/accuracies": 0.375, "rewards/chosen": -0.1446399688720703, "rewards/margins": -0.06440749764442444, "rewards/rejected": -0.08023246377706528, "step": 12, "train_speed(iter/s)": 0.005454 }, { "epoch": 0.02221154359549362, "grad_norm": 4.361201286315918, "learning_rate": 4.4067796610169495e-05, "logits/chosen": -0.6593450307846069, "logits/rejected": -0.6623726487159729, "logps/chosen": -8.788830757141113, "logps/rejected": -12.09660530090332, "loss": 1.091460108757019, "memory(GiB)": 46.08, "nll_loss": 0.38157719373703003, "rewards/accuracies": 0.5625, "rewards/chosen": -0.03397805988788605, "rewards/margins": 0.08494514226913452, "rewards/rejected": -0.11892320215702057, "step": 13, "train_speed(iter/s)": 0.005465 }, { "epoch": 0.023920123872070053, "grad_norm": 4.36707067489624, "learning_rate": 4.745762711864407e-05, "logits/chosen": -0.6003404259681702, "logits/rejected": -0.6018444895744324, "logps/chosen": -9.472915649414062, "logps/rejected": -12.008777618408203, "loss": 1.2156641483306885, "memory(GiB)": 46.08, "nll_loss": 0.42055219411849976, "rewards/accuracies": 0.40625, "rewards/chosen": -0.07689498364925385, "rewards/margins": -0.1264859437942505, "rewards/rejected": 0.049590952694416046, "step": 14, "train_speed(iter/s)": 0.00548 }, { "epoch": 0.025628704148646483, "grad_norm": 3.2864296436309814, "learning_rate": 5.0847457627118643e-05, "logits/chosen": -0.6285042762756348, "logits/rejected": -0.6272621154785156, "logps/chosen": -14.201019287109375, "logps/rejected": -10.998590469360352, "loss": 1.2311502695083618, "memory(GiB)": 46.08, "nll_loss": 0.5152750015258789, "rewards/accuracies": 0.5625, "rewards/chosen": 0.06618006527423859, "rewards/margins": 0.029741406440734863, "rewards/rejected": 0.036438651382923126, "step": 15, "train_speed(iter/s)": 0.005474 }, { "epoch": 0.027337284425222916, "grad_norm": 2.4144492149353027, "learning_rate": 5.423728813559322e-05, "logits/chosen": -0.6098039746284485, "logits/rejected": -0.6130300760269165, "logps/chosen": -3.4820291996002197, "logps/rejected": -16.196063995361328, "loss": 0.8393359780311584, "memory(GiB)": 46.08, "nll_loss": 0.214947909116745, "rewards/accuracies": 0.6875, "rewards/chosen": 0.0826798751950264, "rewards/margins": 0.17492221295833588, "rewards/rejected": -0.09224233776330948, "step": 16, "train_speed(iter/s)": 0.005477 }, { "epoch": 0.02904586470179935, "grad_norm": 2.3232851028442383, "learning_rate": 5.76271186440678e-05, "logits/chosen": -0.5909145474433899, "logits/rejected": -0.593756377696991, "logps/chosen": -7.929438591003418, "logps/rejected": -14.363272666931152, "loss": 0.9911059737205505, "memory(GiB)": 46.08, "nll_loss": 0.34508591890335083, "rewards/accuracies": 0.65625, "rewards/chosen": 0.10390710830688477, "rewards/margins": 0.13225752115249634, "rewards/rejected": -0.028350409120321274, "step": 17, "train_speed(iter/s)": 0.005482 }, { "epoch": 0.030754444978375782, "grad_norm": 2.344477891921997, "learning_rate": 6.101694915254238e-05, "logits/chosen": -0.5697246789932251, "logits/rejected": -0.5692474246025085, "logps/chosen": -6.287097930908203, "logps/rejected": -10.676097869873047, "loss": 0.9974570274353027, "memory(GiB)": 46.08, "nll_loss": 0.3142527639865875, "rewards/accuracies": 0.5625, "rewards/chosen": 0.09520465135574341, "rewards/margins": 0.04853628948330879, "rewards/rejected": 0.046668365597724915, "step": 18, "train_speed(iter/s)": 0.005489 }, { "epoch": 0.03246302525495221, "grad_norm": 2.361417531967163, "learning_rate": 6.440677966101695e-05, "logits/chosen": -0.5909584164619446, "logits/rejected": -0.596694827079773, "logps/chosen": -4.706894874572754, "logps/rejected": -12.18591022491455, "loss": 0.8993738889694214, "memory(GiB)": 46.08, "nll_loss": 0.2403678447008133, "rewards/accuracies": 0.65625, "rewards/chosen": 0.1180216372013092, "rewards/margins": 0.09891890734434128, "rewards/rejected": 0.01910274103283882, "step": 19, "train_speed(iter/s)": 0.005497 }, { "epoch": 0.03417160553152865, "grad_norm": 2.1051840782165527, "learning_rate": 6.779661016949152e-05, "logits/chosen": -0.5925375819206238, "logits/rejected": -0.5939764380455017, "logps/chosen": -7.690135478973389, "logps/rejected": -11.360199928283691, "loss": 0.9811086058616638, "memory(GiB)": 46.08, "nll_loss": 0.27671271562576294, "rewards/accuracies": 0.53125, "rewards/chosen": 0.15354080498218536, "rewards/margins": 0.02018781006336212, "rewards/rejected": 0.13335299491882324, "step": 20, "train_speed(iter/s)": 0.005507 }, { "epoch": 0.03588018580810508, "grad_norm": 2.453577995300293, "learning_rate": 7.11864406779661e-05, "logits/chosen": -0.589929461479187, "logits/rejected": -0.5913950800895691, "logps/chosen": -6.006174564361572, "logps/rejected": -12.356660842895508, "loss": 0.8762722015380859, "memory(GiB)": 46.08, "nll_loss": 0.26102662086486816, "rewards/accuracies": 0.6875, "rewards/chosen": 0.15477147698402405, "rewards/margins": 0.20186343789100647, "rewards/rejected": -0.047091953456401825, "step": 21, "train_speed(iter/s)": 0.005501 }, { "epoch": 0.03758876608468151, "grad_norm": 2.334592819213867, "learning_rate": 7.457627118644068e-05, "logits/chosen": -0.6286447048187256, "logits/rejected": -0.6310911178588867, "logps/chosen": -9.828102111816406, "logps/rejected": -16.171802520751953, "loss": 0.9827708601951599, "memory(GiB)": 46.08, "nll_loss": 0.40016523003578186, "rewards/accuracies": 0.78125, "rewards/chosen": 0.22255462408065796, "rewards/margins": 0.2890108525753021, "rewards/rejected": -0.06645623594522476, "step": 22, "train_speed(iter/s)": 0.005501 }, { "epoch": 0.039297346361257944, "grad_norm": 2.763946533203125, "learning_rate": 7.796610169491526e-05, "logits/chosen": -0.6423724889755249, "logits/rejected": -0.6475900411605835, "logps/chosen": -7.048077583312988, "logps/rejected": -17.518115997314453, "loss": 1.029776692390442, "memory(GiB)": 46.08, "nll_loss": 0.4258265495300293, "rewards/accuracies": 0.78125, "rewards/chosen": 0.13568007946014404, "rewards/margins": 0.24192118644714355, "rewards/rejected": -0.10624107718467712, "step": 23, "train_speed(iter/s)": 0.005498 }, { "epoch": 0.041005926637834374, "grad_norm": 5.438773155212402, "learning_rate": 8.135593220338983e-05, "logits/chosen": -0.611075758934021, "logits/rejected": -0.6109172701835632, "logps/chosen": -8.579011917114258, "logps/rejected": -12.74751091003418, "loss": 1.2176915407180786, "memory(GiB)": 46.08, "nll_loss": 0.5213994979858398, "rewards/accuracies": 0.59375, "rewards/chosen": -0.010570855811238289, "rewards/margins": 0.06740333139896393, "rewards/rejected": -0.07797417044639587, "step": 24, "train_speed(iter/s)": 0.005493 }, { "epoch": 0.0427145069144108, "grad_norm": 3.8305866718292236, "learning_rate": 8.474576271186441e-05, "logits/chosen": -0.6644467711448669, "logits/rejected": -0.6674079298973083, "logps/chosen": -6.975298881530762, "logps/rejected": -15.503819465637207, "loss": 0.922063410282135, "memory(GiB)": 46.08, "nll_loss": 0.3326256275177002, "rewards/accuracies": 0.71875, "rewards/chosen": 0.06792093813419342, "rewards/margins": 0.324211061000824, "rewards/rejected": -0.25629013776779175, "step": 25, "train_speed(iter/s)": 0.00549 }, { "epoch": 0.04442308719098724, "grad_norm": 4.446774959564209, "learning_rate": 8.813559322033899e-05, "logits/chosen": -0.6409133076667786, "logits/rejected": -0.6452510356903076, "logps/chosen": -5.22960090637207, "logps/rejected": -16.918365478515625, "loss": 0.7774365544319153, "memory(GiB)": 46.08, "nll_loss": 0.2448062300682068, "rewards/accuracies": 0.84375, "rewards/chosen": 0.2400483787059784, "rewards/margins": 0.39764925837516785, "rewards/rejected": -0.15760089457035065, "step": 26, "train_speed(iter/s)": 0.005489 }, { "epoch": 0.04613166746756367, "grad_norm": 2.5869643688201904, "learning_rate": 9.152542372881357e-05, "logits/chosen": -0.6091906428337097, "logits/rejected": -0.6120930910110474, "logps/chosen": -7.03964376449585, "logps/rejected": -18.091930389404297, "loss": 0.8498358726501465, "memory(GiB)": 46.08, "nll_loss": 0.3106813132762909, "rewards/accuracies": 0.78125, "rewards/chosen": 0.1571023166179657, "rewards/margins": 0.4190843403339386, "rewards/rejected": -0.2619820237159729, "step": 27, "train_speed(iter/s)": 0.005489 }, { "epoch": 0.047840247744140106, "grad_norm": 3.0630600452423096, "learning_rate": 9.491525423728815e-05, "logits/chosen": -0.6014366745948792, "logits/rejected": -0.6016579270362854, "logps/chosen": -9.281977653503418, "logps/rejected": -13.255182266235352, "loss": 0.9999822974205017, "memory(GiB)": 46.08, "nll_loss": 0.3916056454181671, "rewards/accuracies": 0.71875, "rewards/chosen": 0.0838853195309639, "rewards/margins": 0.22357328236103058, "rewards/rejected": -0.13968798518180847, "step": 28, "train_speed(iter/s)": 0.005488 }, { "epoch": 0.049548828020716536, "grad_norm": 4.956308364868164, "learning_rate": 9.830508474576272e-05, "logits/chosen": -0.6361557841300964, "logits/rejected": -0.6375819444656372, "logps/chosen": -5.407459735870361, "logps/rejected": -12.960749626159668, "loss": 0.9380594491958618, "memory(GiB)": 46.08, "nll_loss": 0.39800193905830383, "rewards/accuracies": 0.75, "rewards/chosen": 0.14713114500045776, "rewards/margins": 0.4169777035713196, "rewards/rejected": -0.2698465585708618, "step": 29, "train_speed(iter/s)": 0.005494 }, { "epoch": 0.051257408297292965, "grad_norm": 6.679542541503906, "learning_rate": 0.00010169491525423729, "logits/chosen": -0.6229231357574463, "logits/rejected": -0.6250395178794861, "logps/chosen": -11.77493667602539, "logps/rejected": -18.192317962646484, "loss": 0.7899165749549866, "memory(GiB)": 46.08, "nll_loss": 0.2795858085155487, "rewards/accuracies": 0.875, "rewards/chosen": 0.09651458263397217, "rewards/margins": 0.49087047576904297, "rewards/rejected": -0.3943559229373932, "step": 30, "train_speed(iter/s)": 0.005497 }, { "epoch": 0.0529659885738694, "grad_norm": 4.011873245239258, "learning_rate": 0.00010508474576271188, "logits/chosen": -0.6524882912635803, "logits/rejected": -0.6541539430618286, "logps/chosen": -7.8713202476501465, "logps/rejected": -11.641451835632324, "loss": 0.9657379984855652, "memory(GiB)": 46.08, "nll_loss": 0.40233710408210754, "rewards/accuracies": 0.71875, "rewards/chosen": 0.11578395962715149, "rewards/margins": 0.36746829748153687, "rewards/rejected": -0.25168436765670776, "step": 31, "train_speed(iter/s)": 0.005488 }, { "epoch": 0.05467456885044583, "grad_norm": 4.144499778747559, "learning_rate": 0.00010847457627118644, "logits/chosen": -0.6458109617233276, "logits/rejected": -0.6519441604614258, "logps/chosen": -8.17459487915039, "logps/rejected": -19.17450714111328, "loss": 0.9243566989898682, "memory(GiB)": 46.08, "nll_loss": 0.3649522066116333, "rewards/accuracies": 0.71875, "rewards/chosen": 0.17762523889541626, "rewards/margins": 0.41990581154823303, "rewards/rejected": -0.24228057265281677, "step": 32, "train_speed(iter/s)": 0.005494 }, { "epoch": 0.05638314912702227, "grad_norm": 2.5846283435821533, "learning_rate": 0.00011186440677966102, "logits/chosen": -0.6422857046127319, "logits/rejected": -0.64764004945755, "logps/chosen": -7.8391828536987305, "logps/rejected": -16.905941009521484, "loss": 0.8121039867401123, "memory(GiB)": 46.08, "nll_loss": 0.3524104952812195, "rewards/accuracies": 0.84375, "rewards/chosen": 0.21112650632858276, "rewards/margins": 0.6391255259513855, "rewards/rejected": -0.42799898982048035, "step": 33, "train_speed(iter/s)": 0.005495 }, { "epoch": 0.0580917294035987, "grad_norm": 2.831099271774292, "learning_rate": 0.0001152542372881356, "logits/chosen": -0.6351624727249146, "logits/rejected": -0.6340872645378113, "logps/chosen": -8.873239517211914, "logps/rejected": -14.13478946685791, "loss": 0.9939954280853271, "memory(GiB)": 46.08, "nll_loss": 0.5031149983406067, "rewards/accuracies": 0.8125, "rewards/chosen": 0.15203362703323364, "rewards/margins": 0.5661364793777466, "rewards/rejected": -0.41410285234451294, "step": 34, "train_speed(iter/s)": 0.005494 }, { "epoch": 0.05980030968017513, "grad_norm": 6.754673004150391, "learning_rate": 0.00011864406779661017, "logits/chosen": -0.6350009441375732, "logits/rejected": -0.6345161199569702, "logps/chosen": -9.049372673034668, "logps/rejected": -13.872842788696289, "loss": 0.9677298069000244, "memory(GiB)": 46.08, "nll_loss": 0.4823642373085022, "rewards/accuracies": 0.8125, "rewards/chosen": 0.18822304904460907, "rewards/margins": 0.5690968632698059, "rewards/rejected": -0.38087382912635803, "step": 35, "train_speed(iter/s)": 0.005494 }, { "epoch": 0.061508889956751564, "grad_norm": 5.09066915512085, "learning_rate": 0.00012203389830508477, "logits/chosen": -0.5940477252006531, "logits/rejected": -0.5995637774467468, "logps/chosen": -6.552436351776123, "logps/rejected": -22.02668571472168, "loss": 1.0198695659637451, "memory(GiB)": 46.08, "nll_loss": 0.5385282635688782, "rewards/accuracies": 0.78125, "rewards/chosen": 0.09731997549533844, "rewards/margins": 0.7183221578598022, "rewards/rejected": -0.621002197265625, "step": 36, "train_speed(iter/s)": 0.005496 }, { "epoch": 0.063217470233328, "grad_norm": 6.366957664489746, "learning_rate": 0.00012542372881355933, "logits/chosen": -0.5671308040618896, "logits/rejected": -0.5699396133422852, "logps/chosen": -8.690061569213867, "logps/rejected": -18.227741241455078, "loss": 0.9119342565536499, "memory(GiB)": 46.08, "nll_loss": 0.4206831753253937, "rewards/accuracies": 0.84375, "rewards/chosen": 0.008592324331402779, "rewards/margins": 0.7837947010993958, "rewards/rejected": -0.7752023935317993, "step": 37, "train_speed(iter/s)": 0.005499 }, { "epoch": 0.06492605050990442, "grad_norm": 8.224360466003418, "learning_rate": 0.0001288135593220339, "logits/chosen": -0.6006415486335754, "logits/rejected": -0.6039485931396484, "logps/chosen": -7.98246955871582, "logps/rejected": -19.214567184448242, "loss": 1.020494818687439, "memory(GiB)": 46.08, "nll_loss": 0.47989213466644287, "rewards/accuracies": 0.65625, "rewards/chosen": -0.017101695761084557, "rewards/margins": 0.7686665654182434, "rewards/rejected": -0.7857682704925537, "step": 38, "train_speed(iter/s)": 0.005499 }, { "epoch": 0.06663463078648085, "grad_norm": 5.284773349761963, "learning_rate": 0.00013220338983050849, "logits/chosen": -0.5746678709983826, "logits/rejected": -0.5742544531822205, "logps/chosen": -10.300456047058105, "logps/rejected": -14.731122970581055, "loss": 1.1951102018356323, "memory(GiB)": 46.08, "nll_loss": 0.6024460196495056, "rewards/accuracies": 0.6875, "rewards/chosen": -0.005457160994410515, "rewards/margins": 0.43640822172164917, "rewards/rejected": -0.44186532497406006, "step": 39, "train_speed(iter/s)": 0.005499 }, { "epoch": 0.0683432110630573, "grad_norm": 4.581506252288818, "learning_rate": 0.00013559322033898305, "logits/chosen": -0.5436846613883972, "logits/rejected": -0.5412294268608093, "logps/chosen": -11.306229591369629, "logps/rejected": -15.808780670166016, "loss": 0.9979494214057922, "memory(GiB)": 46.08, "nll_loss": 0.4069577753543854, "rewards/accuracies": 0.6875, "rewards/chosen": -0.10538371652364731, "rewards/margins": 0.4707936942577362, "rewards/rejected": -0.5761774778366089, "step": 40, "train_speed(iter/s)": 0.005496 }, { "epoch": 0.07005179133963373, "grad_norm": 4.280210018157959, "learning_rate": 0.00013898305084745764, "logits/chosen": -0.5919702649116516, "logits/rejected": -0.5944460034370422, "logps/chosen": -4.601211071014404, "logps/rejected": -18.39055061340332, "loss": 0.7289348244667053, "memory(GiB)": 46.08, "nll_loss": 0.2620496451854706, "rewards/accuracies": 0.8125, "rewards/chosen": 0.1577654778957367, "rewards/margins": 0.7140093445777893, "rewards/rejected": -0.5562438368797302, "step": 41, "train_speed(iter/s)": 0.005492 }, { "epoch": 0.07176037161621016, "grad_norm": 2.8965229988098145, "learning_rate": 0.0001423728813559322, "logits/chosen": -0.5226963758468628, "logits/rejected": -0.5210604667663574, "logps/chosen": -8.042407035827637, "logps/rejected": -13.117356300354004, "loss": 0.8382841944694519, "memory(GiB)": 46.08, "nll_loss": 0.3229953646659851, "rewards/accuracies": 0.78125, "rewards/chosen": 0.15337654948234558, "rewards/margins": 0.5258168578147888, "rewards/rejected": -0.3724403381347656, "step": 42, "train_speed(iter/s)": 0.005494 }, { "epoch": 0.07346895189278659, "grad_norm": 4.7869791984558105, "learning_rate": 0.00014576271186440677, "logits/chosen": -0.5595600605010986, "logits/rejected": -0.5619646310806274, "logps/chosen": -5.741379261016846, "logps/rejected": -14.867729187011719, "loss": 0.9325981140136719, "memory(GiB)": 46.08, "nll_loss": 0.34299078583717346, "rewards/accuracies": 0.75, "rewards/chosen": 0.06792251765727997, "rewards/margins": 0.3079211115837097, "rewards/rejected": -0.23999860882759094, "step": 43, "train_speed(iter/s)": 0.005494 }, { "epoch": 0.07517753216936301, "grad_norm": 3.8402724266052246, "learning_rate": 0.00014915254237288136, "logits/chosen": -0.5551996231079102, "logits/rejected": -0.5583171248435974, "logps/chosen": -7.729850769042969, "logps/rejected": -14.535001754760742, "loss": 0.985005795955658, "memory(GiB)": 46.08, "nll_loss": 0.37224525213241577, "rewards/accuracies": 0.6875, "rewards/chosen": 0.0475621297955513, "rewards/margins": 0.2842516601085663, "rewards/rejected": -0.23668958246707916, "step": 44, "train_speed(iter/s)": 0.005495 }, { "epoch": 0.07688611244593946, "grad_norm": 3.136073112487793, "learning_rate": 0.00015254237288135592, "logits/chosen": -0.5538796186447144, "logits/rejected": -0.5563740730285645, "logps/chosen": -8.61514663696289, "logps/rejected": -20.434301376342773, "loss": 0.8447250723838806, "memory(GiB)": 46.08, "nll_loss": 0.3852572441101074, "rewards/accuracies": 0.90625, "rewards/chosen": 0.17051486670970917, "rewards/margins": 0.695674479007721, "rewards/rejected": -0.5251596570014954, "step": 45, "train_speed(iter/s)": 0.005495 }, { "epoch": 0.07859469272251589, "grad_norm": 2.950076103210449, "learning_rate": 0.00015593220338983051, "logits/chosen": -0.588573694229126, "logits/rejected": -0.5898380875587463, "logps/chosen": -8.49618911743164, "logps/rejected": -16.47633171081543, "loss": 0.8776077032089233, "memory(GiB)": 46.08, "nll_loss": 0.3434315621852875, "rewards/accuracies": 0.78125, "rewards/chosen": 0.1189945787191391, "rewards/margins": 0.5393712520599365, "rewards/rejected": -0.42037665843963623, "step": 46, "train_speed(iter/s)": 0.005498 }, { "epoch": 0.08030327299909232, "grad_norm": 2.918926954269409, "learning_rate": 0.00015932203389830508, "logits/chosen": -0.5735058188438416, "logits/rejected": -0.5742441415786743, "logps/chosen": -10.007829666137695, "logps/rejected": -15.225828170776367, "loss": 0.9683640003204346, "memory(GiB)": 46.08, "nll_loss": 0.4518345892429352, "rewards/accuracies": 0.8125, "rewards/chosen": 0.29521822929382324, "rewards/margins": 0.5080306529998779, "rewards/rejected": -0.2128123939037323, "step": 47, "train_speed(iter/s)": 0.005501 }, { "epoch": 0.08201185327566875, "grad_norm": 2.885613441467285, "learning_rate": 0.00016271186440677967, "logits/chosen": -0.5690568089485168, "logits/rejected": -0.570725679397583, "logps/chosen": -6.9214887619018555, "logps/rejected": -17.073692321777344, "loss": 0.8013411164283752, "memory(GiB)": 46.08, "nll_loss": 0.2747730612754822, "rewards/accuracies": 0.78125, "rewards/chosen": 0.1803244799375534, "rewards/margins": 0.5454539060592651, "rewards/rejected": -0.36512941122055054, "step": 48, "train_speed(iter/s)": 0.005502 }, { "epoch": 0.08372043355224518, "grad_norm": 2.8386495113372803, "learning_rate": 0.00016610169491525423, "logits/chosen": -0.5691187381744385, "logits/rejected": -0.5723721981048584, "logps/chosen": -6.647555828094482, "logps/rejected": -18.68927764892578, "loss": 0.731940746307373, "memory(GiB)": 46.08, "nll_loss": 0.31857162714004517, "rewards/accuracies": 0.90625, "rewards/chosen": 0.15964265167713165, "rewards/margins": 0.8172457218170166, "rewards/rejected": -0.6576029062271118, "step": 49, "train_speed(iter/s)": 0.005503 }, { "epoch": 0.0854290138288216, "grad_norm": 6.678228855133057, "learning_rate": 0.00016949152542372882, "logits/chosen": -0.569486141204834, "logits/rejected": -0.5724078416824341, "logps/chosen": -7.978659629821777, "logps/rejected": -18.0915584564209, "loss": 0.8816509246826172, "memory(GiB)": 46.08, "nll_loss": 0.41086509823799133, "rewards/accuracies": 0.84375, "rewards/chosen": 0.16925573348999023, "rewards/margins": 0.6901466846466064, "rewards/rejected": -0.520891010761261, "step": 50, "train_speed(iter/s)": 0.0055 }, { "epoch": 0.08713759410539805, "grad_norm": 3.4269354343414307, "learning_rate": 0.00017288135593220342, "logits/chosen": -0.6229482889175415, "logits/rejected": -0.624045193195343, "logps/chosen": -8.981767654418945, "logps/rejected": -18.87827491760254, "loss": 0.902818500995636, "memory(GiB)": 46.08, "nll_loss": 0.4753139615058899, "rewards/accuracies": 0.875, "rewards/chosen": 0.12949834764003754, "rewards/margins": 0.91382896900177, "rewards/rejected": -0.7843306064605713, "step": 51, "train_speed(iter/s)": 0.005488 }, { "epoch": 0.08884617438197448, "grad_norm": 3.730417013168335, "learning_rate": 0.00017627118644067798, "logits/chosen": -0.5907954573631287, "logits/rejected": -0.5928065776824951, "logps/chosen": -8.826777458190918, "logps/rejected": -25.743032455444336, "loss": 0.8241711854934692, "memory(GiB)": 46.08, "nll_loss": 0.4183700382709503, "rewards/accuracies": 0.84375, "rewards/chosen": 0.15070247650146484, "rewards/margins": 1.0849279165267944, "rewards/rejected": -0.9342254400253296, "step": 52, "train_speed(iter/s)": 0.00549 }, { "epoch": 0.09055475465855091, "grad_norm": 6.543994426727295, "learning_rate": 0.00017966101694915257, "logits/chosen": -0.5657305717468262, "logits/rejected": -0.5669429898262024, "logps/chosen": -11.976017951965332, "logps/rejected": -18.324581146240234, "loss": 1.1098811626434326, "memory(GiB)": 46.08, "nll_loss": 0.5012481808662415, "rewards/accuracies": 0.625, "rewards/chosen": -0.04995343089103699, "rewards/margins": 0.5761421918869019, "rewards/rejected": -0.6260955929756165, "step": 53, "train_speed(iter/s)": 0.005492 }, { "epoch": 0.09226333493512734, "grad_norm": 7.451931476593018, "learning_rate": 0.00018305084745762714, "logits/chosen": -0.5736872553825378, "logits/rejected": -0.5727863907814026, "logps/chosen": -9.956096649169922, "logps/rejected": -17.354209899902344, "loss": 1.0036059617996216, "memory(GiB)": 46.38, "nll_loss": 0.35273733735084534, "rewards/accuracies": 0.65625, "rewards/chosen": -0.07980930060148239, "rewards/margins": 0.5828754901885986, "rewards/rejected": -0.6626847982406616, "step": 54, "train_speed(iter/s)": 0.005492 }, { "epoch": 0.09397191521170377, "grad_norm": 4.901066303253174, "learning_rate": 0.0001864406779661017, "logits/chosen": -0.5865222811698914, "logits/rejected": -0.5857770442962646, "logps/chosen": -6.749457359313965, "logps/rejected": -19.966379165649414, "loss": 0.836351215839386, "memory(GiB)": 46.38, "nll_loss": 0.30449604988098145, "rewards/accuracies": 0.6875, "rewards/chosen": 0.11927387118339539, "rewards/margins": 0.7463572025299072, "rewards/rejected": -0.6270833611488342, "step": 55, "train_speed(iter/s)": 0.005491 }, { "epoch": 0.09568049548828021, "grad_norm": 3.0312962532043457, "learning_rate": 0.0001898305084745763, "logits/chosen": -0.5644817352294922, "logits/rejected": -0.5671055912971497, "logps/chosen": -6.525354862213135, "logps/rejected": -18.556304931640625, "loss": 0.7299084663391113, "memory(GiB)": 46.38, "nll_loss": 0.2566152811050415, "rewards/accuracies": 0.8125, "rewards/chosen": 0.051953963935375214, "rewards/margins": 0.8131421804428101, "rewards/rejected": -0.7611882090568542, "step": 56, "train_speed(iter/s)": 0.005492 }, { "epoch": 0.09738907576485664, "grad_norm": 6.161406517028809, "learning_rate": 0.00019322033898305085, "logits/chosen": -0.5638913512229919, "logits/rejected": -0.5684786438941956, "logps/chosen": -8.483434677124023, "logps/rejected": -20.397701263427734, "loss": 0.988010585308075, "memory(GiB)": 46.38, "nll_loss": 0.4928280711174011, "rewards/accuracies": 0.71875, "rewards/chosen": 0.17585664987564087, "rewards/margins": 0.6749651432037354, "rewards/rejected": -0.4991084933280945, "step": 57, "train_speed(iter/s)": 0.00549 }, { "epoch": 0.09909765604143307, "grad_norm": 4.03005313873291, "learning_rate": 0.00019661016949152545, "logits/chosen": -0.5518775582313538, "logits/rejected": -0.552839994430542, "logps/chosen": -6.419961929321289, "logps/rejected": -20.10483169555664, "loss": 0.7270359396934509, "memory(GiB)": 46.38, "nll_loss": 0.2987552881240845, "rewards/accuracies": 0.875, "rewards/chosen": 0.23015271127223969, "rewards/margins": 0.8427435159683228, "rewards/rejected": -0.6125907897949219, "step": 58, "train_speed(iter/s)": 0.00549 }, { "epoch": 0.1008062363180095, "grad_norm": 2.9903881549835205, "learning_rate": 0.0002, "logits/chosen": -0.558972954750061, "logits/rejected": -0.559365451335907, "logps/chosen": -7.266337871551514, "logps/rejected": -19.700899124145508, "loss": 0.8035504221916199, "memory(GiB)": 46.38, "nll_loss": 0.35604721307754517, "rewards/accuracies": 0.90625, "rewards/chosen": 0.23076069355010986, "rewards/margins": 0.6581640243530273, "rewards/rejected": -0.4274032711982727, "step": 59, "train_speed(iter/s)": 0.005494 }, { "epoch": 0.10251481659458593, "grad_norm": 2.308953046798706, "learning_rate": 0.00019999960020133237, "logits/chosen": -0.5721818804740906, "logits/rejected": -0.5736841559410095, "logps/chosen": -5.192386150360107, "logps/rejected": -16.873666763305664, "loss": 0.6971458196640015, "memory(GiB)": 46.38, "nll_loss": 0.25499823689460754, "rewards/accuracies": 0.84375, "rewards/chosen": 0.14774081110954285, "rewards/margins": 0.7478816509246826, "rewards/rejected": -0.6001408696174622, "step": 60, "train_speed(iter/s)": 0.005494 }, { "epoch": 0.10422339687116237, "grad_norm": 6.15336275100708, "learning_rate": 0.00019999840080852627, "logits/chosen": -0.6088159680366516, "logits/rejected": -0.6091991662979126, "logps/chosen": -10.085458755493164, "logps/rejected": -16.714794158935547, "loss": 1.2082210779190063, "memory(GiB)": 46.38, "nll_loss": 0.6319302320480347, "rewards/accuracies": 0.6875, "rewards/chosen": -0.015833575278520584, "rewards/margins": 0.46795743703842163, "rewards/rejected": -0.4837909936904907, "step": 61, "train_speed(iter/s)": 0.005494 }, { "epoch": 0.1059319771477388, "grad_norm": 4.543377876281738, "learning_rate": 0.00019999640183117196, "logits/chosen": -0.6160375475883484, "logits/rejected": -0.6183785796165466, "logps/chosen": -7.354756832122803, "logps/rejected": -17.332752227783203, "loss": 0.9280235767364502, "memory(GiB)": 46.38, "nll_loss": 0.39269304275512695, "rewards/accuracies": 0.65625, "rewards/chosen": 0.00012398138642311096, "rewards/margins": 0.7065204381942749, "rewards/rejected": -0.7063965797424316, "step": 62, "train_speed(iter/s)": 0.005497 }, { "epoch": 0.10764055742431523, "grad_norm": 3.700834035873413, "learning_rate": 0.00019999360328525325, "logits/chosen": -0.5955262780189514, "logits/rejected": -0.5960131287574768, "logps/chosen": -7.038027763366699, "logps/rejected": -19.62297248840332, "loss": 0.8426406383514404, "memory(GiB)": 46.38, "nll_loss": 0.304790735244751, "rewards/accuracies": 0.78125, "rewards/chosen": 0.04702156037092209, "rewards/margins": 0.6756925582885742, "rewards/rejected": -0.6286709904670715, "step": 63, "train_speed(iter/s)": 0.005495 }, { "epoch": 0.10934913770089166, "grad_norm": 3.616783857345581, "learning_rate": 0.00019999000519314722, "logits/chosen": -0.5933761596679688, "logits/rejected": -0.5956672430038452, "logps/chosen": -10.029403686523438, "logps/rejected": -19.743268966674805, "loss": 0.8910276889801025, "memory(GiB)": 46.38, "nll_loss": 0.4178580045700073, "rewards/accuracies": 0.8125, "rewards/chosen": 0.059932250529527664, "rewards/margins": 0.7701122164726257, "rewards/rejected": -0.7101800441741943, "step": 64, "train_speed(iter/s)": 0.005494 }, { "epoch": 0.11105771797746809, "grad_norm": 2.8669040203094482, "learning_rate": 0.00019998560758362416, "logits/chosen": -0.6144078373908997, "logits/rejected": -0.6167560815811157, "logps/chosen": -10.685945510864258, "logps/rejected": -23.724315643310547, "loss": 0.7696695923805237, "memory(GiB)": 46.38, "nll_loss": 0.3780427873134613, "rewards/accuracies": 0.90625, "rewards/chosen": 0.1446903944015503, "rewards/margins": 1.0186232328414917, "rewards/rejected": -0.873932957649231, "step": 65, "train_speed(iter/s)": 0.005493 }, { "epoch": 0.11276629825404454, "grad_norm": 4.312869548797607, "learning_rate": 0.00019998041049184719, "logits/chosen": -0.620762050151825, "logits/rejected": -0.6244264245033264, "logps/chosen": -11.728214263916016, "logps/rejected": -26.204395294189453, "loss": 0.7992648482322693, "memory(GiB)": 46.38, "nll_loss": 0.4216463565826416, "rewards/accuracies": 0.8125, "rewards/chosen": 0.14800474047660828, "rewards/margins": 1.0791853666305542, "rewards/rejected": -0.9311806559562683, "step": 66, "train_speed(iter/s)": 0.005493 }, { "epoch": 0.11447487853062097, "grad_norm": 7.865874290466309, "learning_rate": 0.00019997441395937213, "logits/chosen": -0.6298569440841675, "logits/rejected": -0.6332789659500122, "logps/chosen": -7.128231525421143, "logps/rejected": -22.970563888549805, "loss": 0.7514320015907288, "memory(GiB)": 46.38, "nll_loss": 0.33478716015815735, "rewards/accuracies": 0.84375, "rewards/chosen": 0.05204010754823685, "rewards/margins": 0.9836788773536682, "rewards/rejected": -0.931638777256012, "step": 67, "train_speed(iter/s)": 0.005494 }, { "epoch": 0.1161834588071974, "grad_norm": 6.099157810211182, "learning_rate": 0.0001999676180341471, "logits/chosen": -0.6536255478858948, "logits/rejected": -0.6564731597900391, "logps/chosen": -10.524028778076172, "logps/rejected": -19.91427993774414, "loss": 1.1307811737060547, "memory(GiB)": 46.38, "nll_loss": 0.7356545925140381, "rewards/accuracies": 0.84375, "rewards/chosen": 0.028077581897377968, "rewards/margins": 0.9777989387512207, "rewards/rejected": -0.9497213363647461, "step": 68, "train_speed(iter/s)": 0.005495 }, { "epoch": 0.11789203908377383, "grad_norm": 5.27453088760376, "learning_rate": 0.00019996002277051218, "logits/chosen": -0.6637449264526367, "logits/rejected": -0.6651371717453003, "logps/chosen": -9.458850860595703, "logps/rejected": -16.127042770385742, "loss": 1.4500970840454102, "memory(GiB)": 46.38, "nll_loss": 0.8368474841117859, "rewards/accuracies": 0.71875, "rewards/chosen": -0.15293718874454498, "rewards/margins": 0.500515878200531, "rewards/rejected": -0.6534531116485596, "step": 69, "train_speed(iter/s)": 0.005497 }, { "epoch": 0.11960061936035025, "grad_norm": 4.469899654388428, "learning_rate": 0.00019995162822919883, "logits/chosen": -0.6642380356788635, "logits/rejected": -0.664824366569519, "logps/chosen": -8.725358963012695, "logps/rejected": -16.164390563964844, "loss": 0.8428195714950562, "memory(GiB)": 46.38, "nll_loss": 0.3803461194038391, "rewards/accuracies": 0.8125, "rewards/chosen": 0.08946336805820465, "rewards/margins": 0.7338303327560425, "rewards/rejected": -0.644366979598999, "step": 70, "train_speed(iter/s)": 0.005495 }, { "epoch": 0.12130919963692668, "grad_norm": 4.995606422424316, "learning_rate": 0.00019994243447732957, "logits/chosen": -0.6431492567062378, "logits/rejected": -0.6473235487937927, "logps/chosen": -8.270989418029785, "logps/rejected": -24.483354568481445, "loss": 0.8698587417602539, "memory(GiB)": 46.38, "nll_loss": 0.4563717544078827, "rewards/accuracies": 0.84375, "rewards/chosen": 0.07262411713600159, "rewards/margins": 1.0772123336791992, "rewards/rejected": -1.0045881271362305, "step": 71, "train_speed(iter/s)": 0.005495 }, { "epoch": 0.12301777991350313, "grad_norm": 3.5250916481018066, "learning_rate": 0.00019993244158841747, "logits/chosen": -0.6772405505180359, "logits/rejected": -0.6789288520812988, "logps/chosen": -9.19353199005127, "logps/rejected": -27.746652603149414, "loss": 0.8238008618354797, "memory(GiB)": 46.38, "nll_loss": 0.39661213755607605, "rewards/accuracies": 0.6875, "rewards/chosen": 0.09302112460136414, "rewards/margins": 1.367937684059143, "rewards/rejected": -1.274916410446167, "step": 72, "train_speed(iter/s)": 0.005495 }, { "epoch": 0.12472636019007956, "grad_norm": 3.276311159133911, "learning_rate": 0.00019992164964236533, "logits/chosen": -0.6857064962387085, "logits/rejected": -0.685559868812561, "logps/chosen": -11.672329902648926, "logps/rejected": -21.510480880737305, "loss": 0.9018468856811523, "memory(GiB)": 46.38, "nll_loss": 0.41466090083122253, "rewards/accuracies": 0.75, "rewards/chosen": 0.07735104858875275, "rewards/margins": 0.9590628147125244, "rewards/rejected": -0.8817118406295776, "step": 73, "train_speed(iter/s)": 0.005495 }, { "epoch": 0.126434940466656, "grad_norm": 3.369281768798828, "learning_rate": 0.00019991005872546527, "logits/chosen": -0.6608355641365051, "logits/rejected": -0.6626392602920532, "logps/chosen": -7.696371078491211, "logps/rejected": -16.016326904296875, "loss": 0.8347861766815186, "memory(GiB)": 46.38, "nll_loss": 0.3552168607711792, "rewards/accuracies": 0.90625, "rewards/chosen": 0.13171803951263428, "rewards/margins": 0.7066640853881836, "rewards/rejected": -0.5749460458755493, "step": 74, "train_speed(iter/s)": 0.005494 }, { "epoch": 0.12814352074323243, "grad_norm": 2.894788980484009, "learning_rate": 0.00019989766893039804, "logits/chosen": -0.6222079992294312, "logits/rejected": -0.6232355833053589, "logps/chosen": -5.741198539733887, "logps/rejected": -21.31194305419922, "loss": 0.7077224850654602, "memory(GiB)": 46.38, "nll_loss": 0.2760768234729767, "rewards/accuracies": 0.84375, "rewards/chosen": 0.08473706245422363, "rewards/margins": 0.9282934665679932, "rewards/rejected": -0.8435564041137695, "step": 75, "train_speed(iter/s)": 0.005493 }, { "epoch": 0.12985210101980885, "grad_norm": 2.1586077213287354, "learning_rate": 0.00019988448035623203, "logits/chosen": -0.6409361958503723, "logits/rejected": -0.6418861150741577, "logps/chosen": -7.263876438140869, "logps/rejected": -17.95524024963379, "loss": 0.8056262731552124, "memory(GiB)": 46.38, "nll_loss": 0.2723458409309387, "rewards/accuracies": 0.71875, "rewards/chosen": 0.10251796990633011, "rewards/margins": 0.5812361240386963, "rewards/rejected": -0.4787181317806244, "step": 76, "train_speed(iter/s)": 0.005491 }, { "epoch": 0.1315606812963853, "grad_norm": 3.0591204166412354, "learning_rate": 0.00019987049310842272, "logits/chosen": -0.6324824690818787, "logits/rejected": -0.6336201429367065, "logps/chosen": -10.325702667236328, "logps/rejected": -15.849100112915039, "loss": 0.8897943496704102, "memory(GiB)": 46.38, "nll_loss": 0.3855420649051666, "rewards/accuracies": 0.84375, "rewards/chosen": 0.16009055078029633, "rewards/margins": 0.6010256409645081, "rewards/rejected": -0.4409351050853729, "step": 77, "train_speed(iter/s)": 0.005491 }, { "epoch": 0.1332692615729617, "grad_norm": 2.668419122695923, "learning_rate": 0.00019985570729881184, "logits/chosen": -0.6462000012397766, "logits/rejected": -0.6490585207939148, "logps/chosen": -5.475035667419434, "logps/rejected": -20.422216415405273, "loss": 0.7187508344650269, "memory(GiB)": 46.38, "nll_loss": 0.26306530833244324, "rewards/accuracies": 0.84375, "rewards/chosen": 0.13646253943443298, "rewards/margins": 0.6754783391952515, "rewards/rejected": -0.5390157699584961, "step": 78, "train_speed(iter/s)": 0.005491 }, { "epoch": 0.13497784184953815, "grad_norm": 4.360518932342529, "learning_rate": 0.00019984012304562622, "logits/chosen": -0.6780133247375488, "logits/rejected": -0.6758167147636414, "logps/chosen": -11.310664176940918, "logps/rejected": -15.12096881866455, "loss": 0.9152082800865173, "memory(GiB)": 46.38, "nll_loss": 0.45073550939559937, "rewards/accuracies": 0.875, "rewards/chosen": 0.15347006916999817, "rewards/margins": 0.7282993197441101, "rewards/rejected": -0.5748292207717896, "step": 79, "train_speed(iter/s)": 0.00549 }, { "epoch": 0.1366864221261146, "grad_norm": 2.7597768306732178, "learning_rate": 0.00019982374047347723, "logits/chosen": -0.6909894943237305, "logits/rejected": -0.694047212600708, "logps/chosen": -6.004232406616211, "logps/rejected": -23.221824645996094, "loss": 0.6792643666267395, "memory(GiB)": 46.38, "nll_loss": 0.31354260444641113, "rewards/accuracies": 0.96875, "rewards/chosen": 0.21520498394966125, "rewards/margins": 1.1965129375457764, "rewards/rejected": -0.9813080430030823, "step": 80, "train_speed(iter/s)": 0.00549 }, { "epoch": 0.138395002402691, "grad_norm": 4.00593900680542, "learning_rate": 0.00019980655971335945, "logits/chosen": -0.666761577129364, "logits/rejected": -0.6698122620582581, "logps/chosen": -11.200495719909668, "logps/rejected": -20.89803123474121, "loss": 1.0373343229293823, "memory(GiB)": 46.38, "nll_loss": 0.5717941522598267, "rewards/accuracies": 0.8125, "rewards/chosen": -0.03891691192984581, "rewards/margins": 0.8691489696502686, "rewards/rejected": -0.9080657958984375, "step": 81, "train_speed(iter/s)": 0.00549 }, { "epoch": 0.14010358267926745, "grad_norm": 3.7606523036956787, "learning_rate": 0.00019978858090264975, "logits/chosen": -0.6808147430419922, "logits/rejected": -0.683088481426239, "logps/chosen": -8.414874076843262, "logps/rejected": -28.505592346191406, "loss": 0.7084274888038635, "memory(GiB)": 46.38, "nll_loss": 0.3828541338443756, "rewards/accuracies": 0.90625, "rewards/chosen": 0.1215677559375763, "rewards/margins": 1.7334877252578735, "rewards/rejected": -1.6119199991226196, "step": 82, "train_speed(iter/s)": 0.005491 }, { "epoch": 0.14181216295584387, "grad_norm": 4.108179569244385, "learning_rate": 0.0001997698041851063, "logits/chosen": -0.6897909045219421, "logits/rejected": -0.6913143396377563, "logps/chosen": -4.813051223754883, "logps/rejected": -26.06230926513672, "loss": 0.572483241558075, "memory(GiB)": 46.38, "nll_loss": 0.24444976449012756, "rewards/accuracies": 0.875, "rewards/chosen": 0.15832601487636566, "rewards/margins": 1.6045297384262085, "rewards/rejected": -1.4462038278579712, "step": 83, "train_speed(iter/s)": 0.005491 }, { "epoch": 0.1435207432324203, "grad_norm": 5.49106502532959, "learning_rate": 0.00019975022971086714, "logits/chosen": -0.6466387510299683, "logits/rejected": -0.6520243883132935, "logps/chosen": -7.595500946044922, "logps/rejected": -33.218482971191406, "loss": 0.9090702533721924, "memory(GiB)": 46.38, "nll_loss": 0.5250993371009827, "rewards/accuracies": 0.75, "rewards/chosen": 0.13341139256954193, "rewards/margins": 1.5776695013046265, "rewards/rejected": -1.444258213043213, "step": 84, "train_speed(iter/s)": 0.005492 }, { "epoch": 0.14522932350899675, "grad_norm": 4.539761543273926, "learning_rate": 0.00019972985763644932, "logits/chosen": -0.6421160101890564, "logits/rejected": -0.6411360502243042, "logps/chosen": -7.4049482345581055, "logps/rejected": -21.37047576904297, "loss": 0.8407540917396545, "memory(GiB)": 46.38, "nll_loss": 0.4470757246017456, "rewards/accuracies": 0.8125, "rewards/chosen": 0.1697394847869873, "rewards/margins": 1.345821738243103, "rewards/rejected": -1.1760823726654053, "step": 85, "train_speed(iter/s)": 0.005493 }, { "epoch": 0.14693790378557317, "grad_norm": 4.877723217010498, "learning_rate": 0.00019970868812474736, "logits/chosen": -0.6163697242736816, "logits/rejected": -0.6189360022544861, "logps/chosen": -12.07491683959961, "logps/rejected": -29.372955322265625, "loss": 0.848598301410675, "memory(GiB)": 46.38, "nll_loss": 0.49112260341644287, "rewards/accuracies": 0.8125, "rewards/chosen": 0.1017676591873169, "rewards/margins": 1.7578887939453125, "rewards/rejected": -1.6561211347579956, "step": 86, "train_speed(iter/s)": 0.005493 }, { "epoch": 0.14864648406214961, "grad_norm": 5.431716442108154, "learning_rate": 0.00019968672134503213, "logits/chosen": -0.6225081086158752, "logits/rejected": -0.6252766251564026, "logps/chosen": -7.893375873565674, "logps/rejected": -24.980260848999023, "loss": 0.7993619441986084, "memory(GiB)": 46.38, "nll_loss": 0.3846016228199005, "rewards/accuracies": 0.8125, "rewards/chosen": 0.16642117500305176, "rewards/margins": 1.3823862075805664, "rewards/rejected": -1.215964913368225, "step": 87, "train_speed(iter/s)": 0.005493 }, { "epoch": 0.15035506433872603, "grad_norm": 3.7740750312805176, "learning_rate": 0.00019966395747294938, "logits/chosen": -0.5984699130058289, "logits/rejected": -0.6030604839324951, "logps/chosen": -5.385066032409668, "logps/rejected": -25.168312072753906, "loss": 0.6654453873634338, "memory(GiB)": 46.38, "nll_loss": 0.3348524868488312, "rewards/accuracies": 0.875, "rewards/chosen": 0.16900494694709778, "rewards/margins": 1.3018345832824707, "rewards/rejected": -1.1328295469284058, "step": 88, "train_speed(iter/s)": 0.005492 }, { "epoch": 0.15206364461530247, "grad_norm": 3.6669890880584717, "learning_rate": 0.0001996403966905185, "logits/chosen": -0.6115779280662537, "logits/rejected": -0.615218997001648, "logps/chosen": -8.385238647460938, "logps/rejected": -20.905569076538086, "loss": 0.8084090948104858, "memory(GiB)": 46.38, "nll_loss": 0.39410629868507385, "rewards/accuracies": 0.875, "rewards/chosen": 0.07257324457168579, "rewards/margins": 1.0608566999435425, "rewards/rejected": -0.9882834553718567, "step": 89, "train_speed(iter/s)": 0.00549 }, { "epoch": 0.15377222489187892, "grad_norm": 8.954024314880371, "learning_rate": 0.00019961603918613077, "logits/chosen": -0.6033557653427124, "logits/rejected": -0.6063033938407898, "logps/chosen": -7.85408878326416, "logps/rejected": -24.28641700744629, "loss": 0.8988556861877441, "memory(GiB)": 46.38, "nll_loss": 0.4972013235092163, "rewards/accuracies": 0.78125, "rewards/chosen": 0.1499406397342682, "rewards/margins": 1.2390244007110596, "rewards/rejected": -1.0890836715698242, "step": 90, "train_speed(iter/s)": 0.005489 }, { "epoch": 0.15548080516845533, "grad_norm": 2.68121075630188, "learning_rate": 0.00019959088515454827, "logits/chosen": -0.6473177075386047, "logits/rejected": -0.6510601043701172, "logps/chosen": -6.986569404602051, "logps/rejected": -28.0955810546875, "loss": 0.6454746723175049, "memory(GiB)": 46.38, "nll_loss": 0.3593181073665619, "rewards/accuracies": 0.875, "rewards/chosen": 0.310781866312027, "rewards/margins": 1.7279632091522217, "rewards/rejected": -1.417181372642517, "step": 91, "train_speed(iter/s)": 0.005489 }, { "epoch": 0.15718938544503178, "grad_norm": 7.000541687011719, "learning_rate": 0.0001995649347969019, "logits/chosen": -0.7174542546272278, "logits/rejected": -0.7201290726661682, "logps/chosen": -11.954474449157715, "logps/rejected": -24.34893226623535, "loss": 1.0948961973190308, "memory(GiB)": 46.38, "nll_loss": 0.6069883704185486, "rewards/accuracies": 0.75, "rewards/chosen": -0.005067221820354462, "rewards/margins": 1.2273277044296265, "rewards/rejected": -1.232394814491272, "step": 92, "train_speed(iter/s)": 0.005491 }, { "epoch": 0.1588979657216082, "grad_norm": 4.3811211585998535, "learning_rate": 0.00019953818832069, "logits/chosen": -0.6739280223846436, "logits/rejected": -0.6795160174369812, "logps/chosen": -6.881966590881348, "logps/rejected": -37.4478645324707, "loss": 0.6469016075134277, "memory(GiB)": 46.38, "nll_loss": 0.40633073449134827, "rewards/accuracies": 0.84375, "rewards/chosen": 0.20596878230571747, "rewards/margins": 2.5138516426086426, "rewards/rejected": -2.3078830242156982, "step": 93, "train_speed(iter/s)": 0.005491 }, { "epoch": 0.16060654599818464, "grad_norm": 12.26343822479248, "learning_rate": 0.00019951064593977668, "logits/chosen": -0.6859129667282104, "logits/rejected": -0.6899083852767944, "logps/chosen": -13.38476848602295, "logps/rejected": -30.595182418823242, "loss": 1.2918721437454224, "memory(GiB)": 46.38, "nll_loss": 0.6223256587982178, "rewards/accuracies": 0.71875, "rewards/chosen": -0.30435577034950256, "rewards/margins": 1.605468988418579, "rewards/rejected": -1.9098248481750488, "step": 94, "train_speed(iter/s)": 0.005491 }, { "epoch": 0.16231512627476108, "grad_norm": 6.570938587188721, "learning_rate": 0.00019948230787439017, "logits/chosen": -0.7028453946113586, "logits/rejected": -0.7050482034683228, "logps/chosen": -6.761815071105957, "logps/rejected": -27.314367294311523, "loss": 0.9538392424583435, "memory(GiB)": 46.38, "nll_loss": 0.39429235458374023, "rewards/accuracies": 0.6875, "rewards/chosen": 0.012213893234729767, "rewards/margins": 1.6957728862762451, "rewards/rejected": -1.6835590600967407, "step": 95, "train_speed(iter/s)": 0.005493 }, { "epoch": 0.1640237065513375, "grad_norm": 2.8915793895721436, "learning_rate": 0.0001994531743511208, "logits/chosen": -0.6953604817390442, "logits/rejected": -0.6982015371322632, "logps/chosen": -7.192444801330566, "logps/rejected": -26.632644653320312, "loss": 0.6771315336227417, "memory(GiB)": 46.38, "nll_loss": 0.3128400444984436, "rewards/accuracies": 0.84375, "rewards/chosen": 0.21012118458747864, "rewards/margins": 1.6979337930679321, "rewards/rejected": -1.4878127574920654, "step": 96, "train_speed(iter/s)": 0.005494 }, { "epoch": 0.16573228682791394, "grad_norm": 2.7815051078796387, "learning_rate": 0.00019942324560291952, "logits/chosen": -0.6696122884750366, "logits/rejected": -0.6713677644729614, "logps/chosen": -4.250362396240234, "logps/rejected": -22.2177791595459, "loss": 0.6821787357330322, "memory(GiB)": 46.38, "nll_loss": 0.26163250207901, "rewards/accuracies": 0.75, "rewards/chosen": 0.09910638630390167, "rewards/margins": 1.2715519666671753, "rewards/rejected": -1.1724457740783691, "step": 97, "train_speed(iter/s)": 0.005495 }, { "epoch": 0.16744086710449035, "grad_norm": 2.4311976432800293, "learning_rate": 0.00019939252186909574, "logits/chosen": -0.6763203740119934, "logits/rejected": -0.6752580404281616, "logps/chosen": -6.972185134887695, "logps/rejected": -21.0667667388916, "loss": 0.5966892838478088, "memory(GiB)": 46.38, "nll_loss": 0.2420358657836914, "rewards/accuracies": 0.9375, "rewards/chosen": 0.14732374250888824, "rewards/margins": 1.0790168046951294, "rewards/rejected": -0.9316931366920471, "step": 98, "train_speed(iter/s)": 0.005495 }, { "epoch": 0.1691494473810668, "grad_norm": 5.822193622589111, "learning_rate": 0.00019936100339531564, "logits/chosen": -0.6894733905792236, "logits/rejected": -0.6909453272819519, "logps/chosen": -6.009974479675293, "logps/rejected": -21.0426025390625, "loss": 0.7569796442985535, "memory(GiB)": 46.38, "nll_loss": 0.4093407690525055, "rewards/accuracies": 0.84375, "rewards/chosen": 0.26579749584198, "rewards/margins": 1.3290454149246216, "rewards/rejected": -1.0632479190826416, "step": 99, "train_speed(iter/s)": 0.005495 }, { "epoch": 0.1708580276576432, "grad_norm": 3.2212934494018555, "learning_rate": 0.0001993286904336001, "logits/chosen": -0.7202757000923157, "logits/rejected": -0.7197086215019226, "logps/chosen": -6.131860733032227, "logps/rejected": -21.27735137939453, "loss": 0.622944712638855, "memory(GiB)": 46.38, "nll_loss": 0.28273510932922363, "rewards/accuracies": 0.9375, "rewards/chosen": 0.26464149355888367, "rewards/margins": 1.1921066045761108, "rewards/rejected": -0.9274651408195496, "step": 100, "train_speed(iter/s)": 0.005496 } ], "logging_steps": 1, "max_steps": 1170, "num_input_tokens_seen": 0, "num_train_epochs": 2, "save_steps": 50, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": false }, "attributes": {} } }, "total_flos": 7.266692861809132e+17, "train_batch_size": 1, "trial_name": null, "trial_params": null }