{ "best_global_step": 600, "best_metric": 0.26477173, "best_model_checkpoint": "/data2/kdd/crag/cjz/output/task3_dpo_no_task2_gt60.5+task3gt5/v0-20250609-005919/checkpoint-600", "epoch": 1.685491723466407, "eval_steps": 300, "global_step": 650, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "epoch": 0.002596559558584875, "grad_norm": 4.769598007202148, "learning_rate": 5.128205128205128e-06, "logits/chosen": -0.5944205522537231, "logits/rejected": -0.5917393565177917, "logps/chosen": -11.821638107299805, "logps/rejected": -10.731678009033203, "loss": 1.193467140197754, "memory(GiB)": 46.82, "nll_loss": 0.50031977891922, "rewards/accuracies": 0.0, "rewards/chosen": 0.0, "rewards/margins": 0.0, "rewards/rejected": 0.0, "step": 1, "train_speed(iter/s)": 0.004987 }, { "epoch": 0.00519311911716975, "grad_norm": 7.638933181762695, "learning_rate": 1.0256410256410256e-05, "logits/chosen": -0.6539207696914673, "logits/rejected": -0.6607442498207092, "logps/chosen": -9.628549575805664, "logps/rejected": -15.572840690612793, "loss": 1.1913397312164307, "memory(GiB)": 46.82, "nll_loss": 0.4981924891471863, "rewards/accuracies": 0.0, "rewards/chosen": 0.0, "rewards/margins": 0.0, "rewards/rejected": 0.0, "step": 2, "train_speed(iter/s)": 0.005274 }, { "epoch": 0.007789678675754625, "grad_norm": 8.172294616699219, "learning_rate": 1.5384615384615387e-05, "logits/chosen": -0.6215255260467529, "logits/rejected": -0.6243188381195068, "logps/chosen": -10.225044250488281, "logps/rejected": -12.433060646057129, "loss": 1.3010810613632202, "memory(GiB)": 46.82, "nll_loss": 0.6032217741012573, "rewards/accuracies": 0.40625, "rewards/chosen": -0.002520320238545537, "rewards/margins": -0.00917358510196209, "rewards/rejected": 0.006653264630585909, "step": 3, "train_speed(iter/s)": 0.005242 }, { "epoch": 0.0103862382343395, "grad_norm": 7.314579010009766, "learning_rate": 2.0512820512820512e-05, "logits/chosen": -0.6062605381011963, "logits/rejected": -0.6072395443916321, "logps/chosen": -9.956047058105469, "logps/rejected": -11.640246391296387, "loss": 1.2542610168457031, "memory(GiB)": 46.82, "nll_loss": 0.5589770674705505, "rewards/accuracies": 0.46875, "rewards/chosen": 0.007420660927891731, "rewards/margins": -0.004003261215984821, "rewards/rejected": 0.011423922143876553, "step": 4, "train_speed(iter/s)": 0.005268 }, { "epoch": 0.012982797792924375, "grad_norm": 3.7953975200653076, "learning_rate": 2.564102564102564e-05, "logits/chosen": -0.5976298451423645, "logits/rejected": -0.5966740846633911, "logps/chosen": -13.070164680480957, "logps/rejected": -9.661067008972168, "loss": 1.215171456336975, "memory(GiB)": 46.82, "nll_loss": 0.5106430649757385, "rewards/accuracies": 0.375, "rewards/chosen": 0.00016488437540829182, "rewards/margins": -0.020555444061756134, "rewards/rejected": 0.02072032354772091, "step": 5, "train_speed(iter/s)": 0.00529 }, { "epoch": 0.01557935735150925, "grad_norm": 7.202587604522705, "learning_rate": 3.0769230769230774e-05, "logits/chosen": -0.6029255390167236, "logits/rejected": -0.6082680225372314, "logps/chosen": -6.68419075012207, "logps/rejected": -14.836040496826172, "loss": 1.1022435426712036, "memory(GiB)": 46.82, "nll_loss": 0.4213921129703522, "rewards/accuracies": 0.59375, "rewards/chosen": 0.05949082225561142, "rewards/margins": 0.03669985011219978, "rewards/rejected": 0.02279096469283104, "step": 6, "train_speed(iter/s)": 0.00532 }, { "epoch": 0.018175916910094125, "grad_norm": 4.17504358291626, "learning_rate": 3.58974358974359e-05, "logits/chosen": -0.5737150311470032, "logits/rejected": -0.5751169919967651, "logps/chosen": -10.05550479888916, "logps/rejected": -10.229061126708984, "loss": 1.1968086957931519, "memory(GiB)": 46.82, "nll_loss": 0.451814740896225, "rewards/accuracies": 0.40625, "rewards/chosen": 0.018731240183115005, "rewards/margins": -0.06073049083352089, "rewards/rejected": 0.0794617310166359, "step": 7, "train_speed(iter/s)": 0.005319 }, { "epoch": 0.020772476468679, "grad_norm": 4.966729164123535, "learning_rate": 4.1025641025641023e-05, "logits/chosen": -0.6149957180023193, "logits/rejected": -0.619285523891449, "logps/chosen": -10.129886627197266, "logps/rejected": -14.14559268951416, "loss": 1.1496262550354004, "memory(GiB)": 46.82, "nll_loss": 0.45597678422927856, "rewards/accuracies": 0.5, "rewards/chosen": -0.048677604645490646, "rewards/margins": 0.07307372987270355, "rewards/rejected": -0.1217513307929039, "step": 8, "train_speed(iter/s)": 0.005322 }, { "epoch": 0.023369036027263874, "grad_norm": 4.258759021759033, "learning_rate": 4.615384615384616e-05, "logits/chosen": -0.6464206576347351, "logits/rejected": -0.649814248085022, "logps/chosen": -6.2765960693359375, "logps/rejected": -14.259992599487305, "loss": 0.9683928489685059, "memory(GiB)": 46.82, "nll_loss": 0.27603328227996826, "rewards/accuracies": 0.59375, "rewards/chosen": -0.028385277837514877, "rewards/margins": 0.1275366246700287, "rewards/rejected": -0.15592190623283386, "step": 9, "train_speed(iter/s)": 0.005346 }, { "epoch": 0.02596559558584875, "grad_norm": 3.5765655040740967, "learning_rate": 5.128205128205128e-05, "logits/chosen": -0.5905835628509521, "logits/rejected": -0.5969584584236145, "logps/chosen": -14.795049667358398, "logps/rejected": -15.656811714172363, "loss": 1.238275408744812, "memory(GiB)": 46.82, "nll_loss": 0.5923190116882324, "rewards/accuracies": 0.5625, "rewards/chosen": -0.012541369535028934, "rewards/margins": 0.1883796602487564, "rewards/rejected": -0.20092105865478516, "step": 10, "train_speed(iter/s)": 0.005347 }, { "epoch": 0.028562155144433627, "grad_norm": 5.3241682052612305, "learning_rate": 5.6410256410256414e-05, "logits/chosen": -0.5469571948051453, "logits/rejected": -0.5478999614715576, "logps/chosen": -11.43381118774414, "logps/rejected": -13.521588325500488, "loss": 1.2181414365768433, "memory(GiB)": 46.82, "nll_loss": 0.4799095690250397, "rewards/accuracies": 0.5, "rewards/chosen": -0.11080781370401382, "rewards/margins": -0.000970199704170227, "rewards/rejected": -0.109837606549263, "step": 11, "train_speed(iter/s)": 0.005357 }, { "epoch": 0.0311587147030185, "grad_norm": 3.739349126815796, "learning_rate": 6.153846153846155e-05, "logits/chosen": -0.5663439631462097, "logits/rejected": -0.5685043931007385, "logps/chosen": -9.113786697387695, "logps/rejected": -12.898387908935547, "loss": 1.1865863800048828, "memory(GiB)": 46.82, "nll_loss": 0.5080631971359253, "rewards/accuracies": 0.59375, "rewards/chosen": 0.07351399958133698, "rewards/margins": 0.09553620219230652, "rewards/rejected": -0.022022202610969543, "step": 12, "train_speed(iter/s)": 0.00536 }, { "epoch": 0.03375527426160337, "grad_norm": 2.732536792755127, "learning_rate": 6.666666666666667e-05, "logits/chosen": -0.6258959770202637, "logits/rejected": -0.628243088722229, "logps/chosen": -11.908061027526855, "logps/rejected": -14.742002487182617, "loss": 1.0720946788787842, "memory(GiB)": 46.82, "nll_loss": 0.44474831223487854, "rewards/accuracies": 0.65625, "rewards/chosen": 0.0872192531824112, "rewards/margins": 0.16859112679958344, "rewards/rejected": -0.08137187361717224, "step": 13, "train_speed(iter/s)": 0.005365 }, { "epoch": 0.03635183382018825, "grad_norm": 2.286402702331543, "learning_rate": 7.17948717948718e-05, "logits/chosen": -0.5518996119499207, "logits/rejected": -0.5536460280418396, "logps/chosen": -7.985256195068359, "logps/rejected": -9.997514724731445, "loss": 1.0465917587280273, "memory(GiB)": 46.82, "nll_loss": 0.37517642974853516, "rewards/accuracies": 0.5625, "rewards/chosen": 0.09782104939222336, "rewards/margins": 0.08964069932699203, "rewards/rejected": 0.008180351927876472, "step": 14, "train_speed(iter/s)": 0.005362 }, { "epoch": 0.03894839337877313, "grad_norm": 2.8793153762817383, "learning_rate": 7.692307692307693e-05, "logits/chosen": -0.5976672172546387, "logits/rejected": -0.5990516543388367, "logps/chosen": -11.681562423706055, "logps/rejected": -15.269111633300781, "loss": 1.0413833856582642, "memory(GiB)": 46.82, "nll_loss": 0.44159939885139465, "rewards/accuracies": 0.6875, "rewards/chosen": 0.18112002313137054, "rewards/margins": 0.246211975812912, "rewards/rejected": -0.06509192287921906, "step": 15, "train_speed(iter/s)": 0.005369 }, { "epoch": 0.041544952937358, "grad_norm": 3.362415313720703, "learning_rate": 8.205128205128205e-05, "logits/chosen": -0.6091838479042053, "logits/rejected": -0.6097983717918396, "logps/chosen": -6.9782915115356445, "logps/rejected": -9.985608100891113, "loss": 1.0336495637893677, "memory(GiB)": 46.82, "nll_loss": 0.3420756161212921, "rewards/accuracies": 0.5, "rewards/chosen": 0.05590391904115677, "rewards/margins": 0.03598181903362274, "rewards/rejected": 0.019922103732824326, "step": 16, "train_speed(iter/s)": 0.005368 }, { "epoch": 0.04414151249594288, "grad_norm": 2.314833641052246, "learning_rate": 8.717948717948718e-05, "logits/chosen": -0.6001038551330566, "logits/rejected": -0.6009984612464905, "logps/chosen": -8.711943626403809, "logps/rejected": -8.347241401672363, "loss": 1.0018643140792847, "memory(GiB)": 46.82, "nll_loss": 0.3586280345916748, "rewards/accuracies": 0.53125, "rewards/chosen": 0.17141370475292206, "rewards/margins": 0.15122823417186737, "rewards/rejected": 0.020185478031635284, "step": 17, "train_speed(iter/s)": 0.005365 }, { "epoch": 0.04673807205452775, "grad_norm": 2.6080470085144043, "learning_rate": 9.230769230769232e-05, "logits/chosen": -0.6079075932502747, "logits/rejected": -0.6091002225875854, "logps/chosen": -9.866250991821289, "logps/rejected": -9.885502815246582, "loss": 1.0599387884140015, "memory(GiB)": 46.82, "nll_loss": 0.3953135013580322, "rewards/accuracies": 0.625, "rewards/chosen": 0.1653863787651062, "rewards/margins": 0.13114988803863525, "rewards/rejected": 0.03423647955060005, "step": 18, "train_speed(iter/s)": 0.005363 }, { "epoch": 0.04933463161311263, "grad_norm": 2.5750620365142822, "learning_rate": 9.743589743589744e-05, "logits/chosen": -0.5754107236862183, "logits/rejected": -0.5755229592323303, "logps/chosen": -9.663117408752441, "logps/rejected": -14.233282089233398, "loss": 0.9537867307662964, "memory(GiB)": 46.82, "nll_loss": 0.35284289717674255, "rewards/accuracies": 0.6875, "rewards/chosen": 0.12623246014118195, "rewards/margins": 0.24378177523612976, "rewards/rejected": -0.11754930019378662, "step": 19, "train_speed(iter/s)": 0.00537 }, { "epoch": 0.0519311911716975, "grad_norm": 4.289522171020508, "learning_rate": 0.00010256410256410256, "logits/chosen": -0.5981144905090332, "logits/rejected": -0.6002673506736755, "logps/chosen": -8.273541450500488, "logps/rejected": -12.811166763305664, "loss": 1.422603964805603, "memory(GiB)": 46.82, "nll_loss": 0.8183298707008362, "rewards/accuracies": 0.65625, "rewards/chosen": 0.21172407269477844, "rewards/margins": 0.2575765550136566, "rewards/rejected": -0.04585248976945877, "step": 20, "train_speed(iter/s)": 0.005365 }, { "epoch": 0.054527750730282376, "grad_norm": 2.396873712539673, "learning_rate": 0.0001076923076923077, "logits/chosen": -0.5655781030654907, "logits/rejected": -0.5672769546508789, "logps/chosen": -7.642134189605713, "logps/rejected": -16.37198257446289, "loss": 0.8944156765937805, "memory(GiB)": 46.82, "nll_loss": 0.28976452350616455, "rewards/accuracies": 0.6875, "rewards/chosen": 0.2191261202096939, "rewards/margins": 0.2641218602657318, "rewards/rejected": -0.04499572888016701, "step": 21, "train_speed(iter/s)": 0.005364 }, { "epoch": 0.057124310288867254, "grad_norm": 3.0281121730804443, "learning_rate": 0.00011282051282051283, "logits/chosen": -0.5596702694892883, "logits/rejected": -0.5609368681907654, "logps/chosen": -7.446313381195068, "logps/rejected": -12.651912689208984, "loss": 0.9526722431182861, "memory(GiB)": 46.82, "nll_loss": 0.33721715211868286, "rewards/accuracies": 0.75, "rewards/chosen": 0.15709233283996582, "rewards/margins": 0.2245473712682724, "rewards/rejected": -0.06745504587888718, "step": 22, "train_speed(iter/s)": 0.005362 }, { "epoch": 0.059720869847452125, "grad_norm": 2.6955020427703857, "learning_rate": 0.00011794871794871796, "logits/chosen": -0.5400959849357605, "logits/rejected": -0.5422949194908142, "logps/chosen": -6.002541542053223, "logps/rejected": -12.28770637512207, "loss": 0.9044801592826843, "memory(GiB)": 46.82, "nll_loss": 0.2814594805240631, "rewards/accuracies": 0.6875, "rewards/chosen": 0.11246027797460556, "rewards/margins": 0.21622154116630554, "rewards/rejected": -0.10376127809286118, "step": 23, "train_speed(iter/s)": 0.005363 }, { "epoch": 0.062317429406037, "grad_norm": 3.1954290866851807, "learning_rate": 0.0001230769230769231, "logits/chosen": -0.5763551592826843, "logits/rejected": -0.5829795598983765, "logps/chosen": -8.22636890411377, "logps/rejected": -12.94092845916748, "loss": 0.9596253037452698, "memory(GiB)": 46.82, "nll_loss": 0.3679075837135315, "rewards/accuracies": 0.75, "rewards/chosen": 0.17844173312187195, "rewards/margins": 0.2646990418434143, "rewards/rejected": -0.08625732362270355, "step": 24, "train_speed(iter/s)": 0.005367 }, { "epoch": 0.06491398896462187, "grad_norm": 3.440917730331421, "learning_rate": 0.00012820512820512823, "logits/chosen": -0.5423401594161987, "logits/rejected": -0.5454680919647217, "logps/chosen": -6.751742362976074, "logps/rejected": -14.677633285522461, "loss": 0.8222842216491699, "memory(GiB)": 46.82, "nll_loss": 0.2530384063720703, "rewards/accuracies": 0.6875, "rewards/chosen": 0.20278047025203705, "rewards/margins": 0.37300848960876465, "rewards/rejected": -0.1702280342578888, "step": 25, "train_speed(iter/s)": 0.005363 }, { "epoch": 0.06751054852320675, "grad_norm": 7.046718120574951, "learning_rate": 0.00013333333333333334, "logits/chosen": -0.531994640827179, "logits/rejected": -0.5324733257293701, "logps/chosen": -7.691443920135498, "logps/rejected": -12.912195205688477, "loss": 0.8851491212844849, "memory(GiB)": 46.82, "nll_loss": 0.2668984532356262, "rewards/accuracies": 0.65625, "rewards/chosen": 0.03996456041932106, "rewards/margins": 0.30043962597846985, "rewards/rejected": -0.2604750692844391, "step": 26, "train_speed(iter/s)": 0.005354 }, { "epoch": 0.07010710808179163, "grad_norm": 3.7837774753570557, "learning_rate": 0.00013846153846153847, "logits/chosen": -0.5356835722923279, "logits/rejected": -0.535167932510376, "logps/chosen": -7.836236476898193, "logps/rejected": -12.5257568359375, "loss": 0.9785585999488831, "memory(GiB)": 46.82, "nll_loss": 0.39958691596984863, "rewards/accuracies": 0.625, "rewards/chosen": 0.11726226657629013, "rewards/margins": 0.30467987060546875, "rewards/rejected": -0.18741759657859802, "step": 27, "train_speed(iter/s)": 0.005353 }, { "epoch": 0.0727036676403765, "grad_norm": 2.986128568649292, "learning_rate": 0.0001435897435897436, "logits/chosen": -0.5374022126197815, "logits/rejected": -0.5330510139465332, "logps/chosen": -10.774028778076172, "logps/rejected": -10.21718692779541, "loss": 1.0210673809051514, "memory(GiB)": 46.82, "nll_loss": 0.44256913661956787, "rewards/accuracies": 0.78125, "rewards/chosen": 0.08123424649238586, "rewards/margins": 0.32150229811668396, "rewards/rejected": -0.2402680516242981, "step": 28, "train_speed(iter/s)": 0.00536 }, { "epoch": 0.07530022719896137, "grad_norm": 8.227151870727539, "learning_rate": 0.00014871794871794872, "logits/chosen": -0.555951714515686, "logits/rejected": -0.5587239265441895, "logps/chosen": -7.656264781951904, "logps/rejected": -16.2135066986084, "loss": 1.024498701095581, "memory(GiB)": 46.82, "nll_loss": 0.467337429523468, "rewards/accuracies": 0.71875, "rewards/chosen": 0.1679726243019104, "rewards/margins": 0.43920189142227173, "rewards/rejected": -0.2712292969226837, "step": 29, "train_speed(iter/s)": 0.005367 }, { "epoch": 0.07789678675754626, "grad_norm": 3.866678476333618, "learning_rate": 0.00015384615384615385, "logits/chosen": -0.5329037308692932, "logits/rejected": -0.5308660864830017, "logps/chosen": -13.327455520629883, "logps/rejected": -12.309192657470703, "loss": 1.1753352880477905, "memory(GiB)": 46.82, "nll_loss": 0.5743139386177063, "rewards/accuracies": 0.65625, "rewards/chosen": 0.10232796519994736, "rewards/margins": 0.27346518635749817, "rewards/rejected": -0.1711372286081314, "step": 30, "train_speed(iter/s)": 0.00537 }, { "epoch": 0.08049334631613113, "grad_norm": 2.7835240364074707, "learning_rate": 0.00015897435897435896, "logits/chosen": -0.5286478996276855, "logits/rejected": -0.5297562479972839, "logps/chosen": -8.105016708374023, "logps/rejected": -18.577655792236328, "loss": 0.8083048462867737, "memory(GiB)": 46.82, "nll_loss": 0.3598409593105316, "rewards/accuracies": 0.875, "rewards/chosen": 0.3429361879825592, "rewards/margins": 0.6762320399284363, "rewards/rejected": -0.3332958221435547, "step": 31, "train_speed(iter/s)": 0.005368 }, { "epoch": 0.083089905874716, "grad_norm": 2.621320962905884, "learning_rate": 0.0001641025641025641, "logits/chosen": -0.5535257458686829, "logits/rejected": -0.5577558279037476, "logps/chosen": -7.381773948669434, "logps/rejected": -20.8293514251709, "loss": 0.7857053279876709, "memory(GiB)": 46.82, "nll_loss": 0.3121376037597656, "rewards/accuracies": 0.84375, "rewards/chosen": 0.11771110445261002, "rewards/margins": 0.6395547389984131, "rewards/rejected": -0.5218436121940613, "step": 32, "train_speed(iter/s)": 0.005373 }, { "epoch": 0.08568646543330087, "grad_norm": 5.273679256439209, "learning_rate": 0.00016923076923076923, "logits/chosen": -0.5348193645477295, "logits/rejected": -0.5335426330566406, "logps/chosen": -16.012008666992188, "logps/rejected": -16.090946197509766, "loss": 1.150058388710022, "memory(GiB)": 46.82, "nll_loss": 0.5311561822891235, "rewards/accuracies": 0.6875, "rewards/chosen": -0.09080329537391663, "rewards/margins": 0.3698381185531616, "rewards/rejected": -0.46064135432243347, "step": 33, "train_speed(iter/s)": 0.005375 }, { "epoch": 0.08828302499188576, "grad_norm": 3.7380588054656982, "learning_rate": 0.00017435897435897436, "logits/chosen": -0.526316225528717, "logits/rejected": -0.5241590738296509, "logps/chosen": -13.188718795776367, "logps/rejected": -18.877933502197266, "loss": 0.8901183009147644, "memory(GiB)": 46.82, "nll_loss": 0.4010193347930908, "rewards/accuracies": 0.78125, "rewards/chosen": 0.13551224768161774, "rewards/margins": 0.7849555015563965, "rewards/rejected": -0.6494433283805847, "step": 34, "train_speed(iter/s)": 0.005376 }, { "epoch": 0.09087958455047063, "grad_norm": 3.2903590202331543, "learning_rate": 0.0001794871794871795, "logits/chosen": -0.5694751739501953, "logits/rejected": -0.5714199542999268, "logps/chosen": -13.836735725402832, "logps/rejected": -17.397571563720703, "loss": 0.9489783644676208, "memory(GiB)": 46.82, "nll_loss": 0.4817684292793274, "rewards/accuracies": 0.84375, "rewards/chosen": 0.17933052778244019, "rewards/margins": 0.7199034690856934, "rewards/rejected": -0.5405729413032532, "step": 35, "train_speed(iter/s)": 0.005374 }, { "epoch": 0.0934761441090555, "grad_norm": 7.443658351898193, "learning_rate": 0.00018461538461538463, "logits/chosen": -0.5579850077629089, "logits/rejected": -0.5598161220550537, "logps/chosen": -9.724953651428223, "logps/rejected": -19.001192092895508, "loss": 1.025741696357727, "memory(GiB)": 46.82, "nll_loss": 0.4933169484138489, "rewards/accuracies": 0.8125, "rewards/chosen": 0.09439410269260406, "rewards/margins": 0.531223714351654, "rewards/rejected": -0.4368295967578888, "step": 36, "train_speed(iter/s)": 0.005367 }, { "epoch": 0.09607270366764038, "grad_norm": 4.221776962280273, "learning_rate": 0.00018974358974358974, "logits/chosen": -0.5673465728759766, "logits/rejected": -0.568681001663208, "logps/chosen": -7.996758937835693, "logps/rejected": -16.828737258911133, "loss": 0.768932044506073, "memory(GiB)": 46.82, "nll_loss": 0.3632465600967407, "rewards/accuracies": 0.90625, "rewards/chosen": 0.20153376460075378, "rewards/margins": 0.8081123232841492, "rewards/rejected": -0.6065785884857178, "step": 37, "train_speed(iter/s)": 0.00536 }, { "epoch": 0.09866926322622525, "grad_norm": 4.438755989074707, "learning_rate": 0.00019487179487179487, "logits/chosen": -0.5432108640670776, "logits/rejected": -0.5440645217895508, "logps/chosen": -11.19113826751709, "logps/rejected": -16.801233291625977, "loss": 0.9643179178237915, "memory(GiB)": 46.82, "nll_loss": 0.5330875515937805, "rewards/accuracies": 0.875, "rewards/chosen": 0.212477445602417, "rewards/margins": 0.7622401714324951, "rewards/rejected": -0.5497627258300781, "step": 38, "train_speed(iter/s)": 0.005362 }, { "epoch": 0.10126582278481013, "grad_norm": 3.844766855239868, "learning_rate": 0.0002, "logits/chosen": -0.5104550719261169, "logits/rejected": -0.5119606852531433, "logps/chosen": -11.040297508239746, "logps/rejected": -18.91219711303711, "loss": 0.9704711437225342, "memory(GiB)": 46.82, "nll_loss": 0.5230136513710022, "rewards/accuracies": 0.84375, "rewards/chosen": 0.14157143235206604, "rewards/margins": 0.7000695466995239, "rewards/rejected": -0.5584981441497803, "step": 39, "train_speed(iter/s)": 0.005358 }, { "epoch": 0.103862382343395, "grad_norm": 5.2911272048950195, "learning_rate": 0.00019999907650547008, "logits/chosen": -0.563255250453949, "logits/rejected": -0.5627263784408569, "logps/chosen": -8.962218284606934, "logps/rejected": -20.214658737182617, "loss": 0.9730861783027649, "memory(GiB)": 46.82, "nll_loss": 0.4494069516658783, "rewards/accuracies": 0.71875, "rewards/chosen": 0.03735905885696411, "rewards/margins": 0.7039426565170288, "rewards/rejected": -0.6665836572647095, "step": 40, "train_speed(iter/s)": 0.00536 }, { "epoch": 0.10645894190197988, "grad_norm": 3.2932822704315186, "learning_rate": 0.0001999963060389371, "logits/chosen": -0.49407708644866943, "logits/rejected": -0.4951040744781494, "logps/chosen": -4.336781978607178, "logps/rejected": -23.352622985839844, "loss": 0.5769761800765991, "memory(GiB)": 46.82, "nll_loss": 0.21373578906059265, "rewards/accuracies": 0.84375, "rewards/chosen": 0.2602457106113434, "rewards/margins": 1.0540037155151367, "rewards/rejected": -0.7937580347061157, "step": 41, "train_speed(iter/s)": 0.005359 }, { "epoch": 0.10905550146056475, "grad_norm": 3.550082206726074, "learning_rate": 0.00019999168865157137, "logits/chosen": -0.5316025018692017, "logits/rejected": -0.5340486764907837, "logps/chosen": -8.441543579101562, "logps/rejected": -18.124588012695312, "loss": 0.9663518071174622, "memory(GiB)": 46.82, "nll_loss": 0.47912853956222534, "rewards/accuracies": 0.78125, "rewards/chosen": 0.14834752678871155, "rewards/margins": 0.7632903456687927, "rewards/rejected": -0.6149427890777588, "step": 42, "train_speed(iter/s)": 0.005356 }, { "epoch": 0.11165206101914962, "grad_norm": 3.8798763751983643, "learning_rate": 0.0001999852244286554, "logits/chosen": -0.5125827193260193, "logits/rejected": -0.5118388533592224, "logps/chosen": -8.259347915649414, "logps/rejected": -18.246912002563477, "loss": 0.8706857562065125, "memory(GiB)": 46.82, "nll_loss": 0.3688449263572693, "rewards/accuracies": 0.78125, "rewards/chosen": 0.1189112439751625, "rewards/margins": 0.5402826070785522, "rewards/rejected": -0.4213714003562927, "step": 43, "train_speed(iter/s)": 0.005355 }, { "epoch": 0.11424862057773451, "grad_norm": 5.702610015869141, "learning_rate": 0.0001999769134895828, "logits/chosen": -0.5676945447921753, "logits/rejected": -0.5712423324584961, "logps/chosen": -7.507511138916016, "logps/rejected": -17.306344985961914, "loss": 0.9447178840637207, "memory(GiB)": 46.82, "nll_loss": 0.5068771839141846, "rewards/accuracies": 0.84375, "rewards/chosen": 0.1572760045528412, "rewards/margins": 0.8183934688568115, "rewards/rejected": -0.6611174941062927, "step": 44, "train_speed(iter/s)": 0.005357 }, { "epoch": 0.11684518013631938, "grad_norm": 5.846091270446777, "learning_rate": 0.0001999667559878556, "logits/chosen": -0.5530126094818115, "logits/rejected": -0.5544271469116211, "logps/chosen": -9.34422779083252, "logps/rejected": -21.99274444580078, "loss": 1.0033745765686035, "memory(GiB)": 46.82, "nll_loss": 0.5510709285736084, "rewards/accuracies": 0.75, "rewards/chosen": 0.06781984120607376, "rewards/margins": 0.8660807609558105, "rewards/rejected": -0.7982609868049622, "step": 45, "train_speed(iter/s)": 0.005358 }, { "epoch": 0.11944173969490425, "grad_norm": 3.4377248287200928, "learning_rate": 0.00019995475211108185, "logits/chosen": -0.5516988039016724, "logits/rejected": -0.5513719916343689, "logps/chosen": -9.321004867553711, "logps/rejected": -18.94799041748047, "loss": 0.838591992855072, "memory(GiB)": 46.82, "nll_loss": 0.44976377487182617, "rewards/accuracies": 0.875, "rewards/chosen": 0.15304125845432281, "rewards/margins": 0.9354310631752014, "rewards/rejected": -0.782389760017395, "step": 46, "train_speed(iter/s)": 0.00536 }, { "epoch": 0.12203829925348912, "grad_norm": 3.021584987640381, "learning_rate": 0.00019994090208097176, "logits/chosen": -0.5453197956085205, "logits/rejected": -0.5457130670547485, "logps/chosen": -7.513545036315918, "logps/rejected": -19.929990768432617, "loss": 0.7878033518791199, "memory(GiB)": 46.82, "nll_loss": 0.2906043827533722, "rewards/accuracies": 0.71875, "rewards/chosen": 0.04635176807641983, "rewards/margins": 0.8055768609046936, "rewards/rejected": -0.759225070476532, "step": 47, "train_speed(iter/s)": 0.005359 }, { "epoch": 0.124634858812074, "grad_norm": 2.4632484912872314, "learning_rate": 0.00019992520615333393, "logits/chosen": -0.5288453102111816, "logits/rejected": -0.5294773578643799, "logps/chosen": -4.316083908081055, "logps/rejected": -16.75088119506836, "loss": 0.6369743347167969, "memory(GiB)": 46.82, "nll_loss": 0.19174346327781677, "rewards/accuracies": 0.8125, "rewards/chosen": 0.1844159960746765, "rewards/margins": 0.7728991508483887, "rewards/rejected": -0.5884830951690674, "step": 48, "train_speed(iter/s)": 0.005357 }, { "epoch": 0.12723141837065888, "grad_norm": 2.225041627883911, "learning_rate": 0.00019990766461807039, "logits/chosen": -0.5786827802658081, "logits/rejected": -0.5775803923606873, "logps/chosen": -7.1691179275512695, "logps/rejected": -19.747949600219727, "loss": 0.611931562423706, "memory(GiB)": 46.82, "nll_loss": 0.26027703285217285, "rewards/accuracies": 0.9375, "rewards/chosen": 0.32533061504364014, "rewards/margins": 1.0796949863433838, "rewards/rejected": -0.7543643712997437, "step": 49, "train_speed(iter/s)": 0.005358 }, { "epoch": 0.12982797792924375, "grad_norm": 3.631110429763794, "learning_rate": 0.00019988827779917137, "logits/chosen": -0.5347975492477417, "logits/rejected": -0.5404946804046631, "logps/chosen": -8.115504264831543, "logps/rejected": -22.913742065429688, "loss": 0.8714032769203186, "memory(GiB)": 46.82, "nll_loss": 0.4530017375946045, "rewards/accuracies": 0.875, "rewards/chosen": 0.22861376404762268, "rewards/margins": 0.9870915412902832, "rewards/rejected": -0.7584777474403381, "step": 50, "train_speed(iter/s)": 0.00536 }, { "epoch": 0.13242453748782862, "grad_norm": 4.098914623260498, "learning_rate": 0.0001998670460547093, "logits/chosen": -0.5628920197486877, "logits/rejected": -0.5603100657463074, "logps/chosen": -12.636977195739746, "logps/rejected": -17.273649215698242, "loss": 1.033919095993042, "memory(GiB)": 46.82, "nll_loss": 0.4824763834476471, "rewards/accuracies": 0.75, "rewards/chosen": 0.011750273406505585, "rewards/margins": 0.7105109095573425, "rewards/rejected": -0.6987606287002563, "step": 51, "train_speed(iter/s)": 0.00535 }, { "epoch": 0.1350210970464135, "grad_norm": 2.982447385787964, "learning_rate": 0.00019984396977683222, "logits/chosen": -0.5565685629844666, "logits/rejected": -0.5531243085861206, "logps/chosen": -9.393210411071777, "logps/rejected": -17.276996612548828, "loss": 0.7912466526031494, "memory(GiB)": 46.82, "nll_loss": 0.44081103801727295, "rewards/accuracies": 0.9375, "rewards/chosen": 0.22525233030319214, "rewards/margins": 1.060104250907898, "rewards/rejected": -0.8348519206047058, "step": 52, "train_speed(iter/s)": 0.005355 }, { "epoch": 0.1376176566049984, "grad_norm": 5.296391010284424, "learning_rate": 0.0001998190493917564, "logits/chosen": -0.5625238418579102, "logits/rejected": -0.5669078826904297, "logps/chosen": -9.36229133605957, "logps/rejected": -21.19735336303711, "loss": 0.9399389028549194, "memory(GiB)": 46.82, "nll_loss": 0.5554667115211487, "rewards/accuracies": 0.875, "rewards/chosen": 0.25273460149765015, "rewards/margins": 1.137141227722168, "rewards/rejected": -0.8844066858291626, "step": 53, "train_speed(iter/s)": 0.005355 }, { "epoch": 0.14021421616358326, "grad_norm": 5.798766136169434, "learning_rate": 0.00019979228535975865, "logits/chosen": -0.5416492223739624, "logits/rejected": -0.5440787076950073, "logps/chosen": -9.865373611450195, "logps/rejected": -29.639345169067383, "loss": 0.7824708223342896, "memory(GiB)": 46.82, "nll_loss": 0.4418797492980957, "rewards/accuracies": 0.84375, "rewards/chosen": 0.05873842537403107, "rewards/margins": 1.351473093032837, "rewards/rejected": -1.2927345037460327, "step": 54, "train_speed(iter/s)": 0.005356 }, { "epoch": 0.14281077572216813, "grad_norm": 2.68666934967041, "learning_rate": 0.00019976367817516773, "logits/chosen": -0.5077602863311768, "logits/rejected": -0.5117127299308777, "logps/chosen": -6.119892120361328, "logps/rejected": -24.990623474121094, "loss": 0.7171817421913147, "memory(GiB)": 46.82, "nll_loss": 0.3807484805583954, "rewards/accuracies": 0.90625, "rewards/chosen": 0.23153242468833923, "rewards/margins": 1.3034626245498657, "rewards/rejected": -1.0719302892684937, "step": 55, "train_speed(iter/s)": 0.005356 }, { "epoch": 0.145407335280753, "grad_norm": 12.753750801086426, "learning_rate": 0.00019973322836635518, "logits/chosen": -0.5142076015472412, "logits/rejected": -0.5133773684501648, "logps/chosen": -10.577905654907227, "logps/rejected": -17.775619506835938, "loss": 1.0084953308105469, "memory(GiB)": 46.82, "nll_loss": 0.5207356214523315, "rewards/accuracies": 0.78125, "rewards/chosen": 0.055092498660087585, "rewards/margins": 0.8445413708686829, "rewards/rejected": -0.7894489169120789, "step": 56, "train_speed(iter/s)": 0.005357 }, { "epoch": 0.14800389483933787, "grad_norm": 4.176927089691162, "learning_rate": 0.00019970093649572564, "logits/chosen": -0.4988924562931061, "logits/rejected": -0.5031363368034363, "logps/chosen": -5.868337631225586, "logps/rejected": -32.978477478027344, "loss": 0.5518871545791626, "memory(GiB)": 46.82, "nll_loss": 0.23210853338241577, "rewards/accuracies": 0.875, "rewards/chosen": 0.1517554670572281, "rewards/margins": 1.8292872905731201, "rewards/rejected": -1.6775319576263428, "step": 57, "train_speed(iter/s)": 0.005357 }, { "epoch": 0.15060045439792275, "grad_norm": 5.881600856781006, "learning_rate": 0.00019966680315970648, "logits/chosen": -0.5035607218742371, "logits/rejected": -0.5062836408615112, "logps/chosen": -12.07951831817627, "logps/rejected": -29.57831573486328, "loss": 1.039928674697876, "memory(GiB)": 46.82, "nll_loss": 0.4533731937408447, "rewards/accuracies": 0.75, "rewards/chosen": -0.19116882979869843, "rewards/margins": 1.3504120111465454, "rewards/rejected": -1.5415807962417603, "step": 58, "train_speed(iter/s)": 0.005356 }, { "epoch": 0.15319701395650762, "grad_norm": 5.895066738128662, "learning_rate": 0.0001996308289887366, "logits/chosen": -0.504879355430603, "logits/rejected": -0.5091466903686523, "logps/chosen": -8.11007022857666, "logps/rejected": -27.097564697265625, "loss": 0.9131656289100647, "memory(GiB)": 46.82, "nll_loss": 0.47925126552581787, "rewards/accuracies": 0.78125, "rewards/chosen": 0.04523879289627075, "rewards/margins": 1.2242006063461304, "rewards/rejected": -1.178961992263794, "step": 59, "train_speed(iter/s)": 0.005359 }, { "epoch": 0.15579357351509251, "grad_norm": 2.7233798503875732, "learning_rate": 0.00019959301464725506, "logits/chosen": -0.5388925671577454, "logits/rejected": -0.5401982665061951, "logps/chosen": -5.20983362197876, "logps/rejected": -22.794513702392578, "loss": 0.6133744716644287, "memory(GiB)": 46.82, "nll_loss": 0.2746528089046478, "rewards/accuracies": 0.9375, "rewards/chosen": 0.06251248717308044, "rewards/margins": 1.3268343210220337, "rewards/rejected": -1.2643219232559204, "step": 60, "train_speed(iter/s)": 0.005362 }, { "epoch": 0.15839013307367739, "grad_norm": 5.102992057800293, "learning_rate": 0.00019955336083368858, "logits/chosen": -0.5972931385040283, "logits/rejected": -0.601641058921814, "logps/chosen": -8.611083984375, "logps/rejected": -22.611942291259766, "loss": 1.1286181211471558, "memory(GiB)": 46.82, "nll_loss": 0.6720573902130127, "rewards/accuracies": 0.8125, "rewards/chosen": 0.05290444567799568, "rewards/margins": 0.9988237619400024, "rewards/rejected": -0.9459192752838135, "step": 61, "train_speed(iter/s)": 0.005361 }, { "epoch": 0.16098669263226226, "grad_norm": 6.744442462921143, "learning_rate": 0.00019951186828043877, "logits/chosen": -0.5748434662818909, "logits/rejected": -0.5786728858947754, "logps/chosen": -7.9780778884887695, "logps/rejected": -19.627988815307617, "loss": 1.0838773250579834, "memory(GiB)": 46.82, "nll_loss": 0.5846377611160278, "rewards/accuracies": 0.78125, "rewards/chosen": -0.011326288804411888, "rewards/margins": 0.7546138167381287, "rewards/rejected": -0.7659401297569275, "step": 62, "train_speed(iter/s)": 0.005359 }, { "epoch": 0.16358325219084713, "grad_norm": 3.6435351371765137, "learning_rate": 0.00019946853775386857, "logits/chosen": -0.6392778158187866, "logits/rejected": -0.6405251622200012, "logps/chosen": -7.981713771820068, "logps/rejected": -18.500165939331055, "loss": 0.8841695189476013, "memory(GiB)": 46.82, "nll_loss": 0.4594660997390747, "rewards/accuracies": 0.875, "rewards/chosen": 0.1688350886106491, "rewards/margins": 0.8609640598297119, "rewards/rejected": -0.6921288967132568, "step": 63, "train_speed(iter/s)": 0.005359 }, { "epoch": 0.166179811749432, "grad_norm": 2.4889438152313232, "learning_rate": 0.00019942337005428803, "logits/chosen": -0.614960253238678, "logits/rejected": -0.6170456409454346, "logps/chosen": -6.154093265533447, "logps/rejected": -14.32476806640625, "loss": 0.8417397737503052, "memory(GiB)": 46.82, "nll_loss": 0.42383700609207153, "rewards/accuracies": 0.90625, "rewards/chosen": 0.22809524834156036, "rewards/margins": 0.7583045959472656, "rewards/rejected": -0.5302093625068665, "step": 64, "train_speed(iter/s)": 0.005356 }, { "epoch": 0.16877637130801687, "grad_norm": 3.13456654548645, "learning_rate": 0.00019937636601593964, "logits/chosen": -0.6562027335166931, "logits/rejected": -0.657011091709137, "logps/chosen": -11.849466323852539, "logps/rejected": -21.00613021850586, "loss": 0.8801897168159485, "memory(GiB)": 46.82, "nll_loss": 0.417907178401947, "rewards/accuracies": 0.75, "rewards/chosen": 0.217839315533638, "rewards/margins": 0.9292322397232056, "rewards/rejected": -0.711392879486084, "step": 65, "train_speed(iter/s)": 0.005357 }, { "epoch": 0.17137293086660174, "grad_norm": 2.492602586746216, "learning_rate": 0.00019932752650698285, "logits/chosen": -0.6384371519088745, "logits/rejected": -0.639873743057251, "logps/chosen": -7.750038146972656, "logps/rejected": -19.651975631713867, "loss": 0.7662312984466553, "memory(GiB)": 46.82, "nll_loss": 0.34055230021476746, "rewards/accuracies": 0.75, "rewards/chosen": 0.30775657296180725, "rewards/margins": 1.0670785903930664, "rewards/rejected": -0.7593219876289368, "step": 66, "train_speed(iter/s)": 0.005355 }, { "epoch": 0.17396949042518664, "grad_norm": 3.4701662063598633, "learning_rate": 0.00019927685242947805, "logits/chosen": -0.6081066131591797, "logits/rejected": -0.60552579164505, "logps/chosen": -8.996465682983398, "logps/rejected": -16.082275390625, "loss": 0.8045691251754761, "memory(GiB)": 46.82, "nll_loss": 0.3208611011505127, "rewards/accuracies": 0.78125, "rewards/chosen": 0.17242535948753357, "rewards/margins": 0.7575393915176392, "rewards/rejected": -0.5851140022277832, "step": 67, "train_speed(iter/s)": 0.005356 }, { "epoch": 0.1765660499837715, "grad_norm": 2.7060115337371826, "learning_rate": 0.00019922434471936987, "logits/chosen": -0.6539565324783325, "logits/rejected": -0.6539203524589539, "logps/chosen": -11.010636329650879, "logps/rejected": -20.040176391601562, "loss": 0.8421358466148376, "memory(GiB)": 46.82, "nll_loss": 0.4449455142021179, "rewards/accuracies": 0.875, "rewards/chosen": 0.2390671670436859, "rewards/margins": 0.9861317873001099, "rewards/rejected": -0.7470647096633911, "step": 68, "train_speed(iter/s)": 0.005355 }, { "epoch": 0.17916260954235638, "grad_norm": 3.1315884590148926, "learning_rate": 0.00019917000434647, "logits/chosen": -0.6536306738853455, "logits/rejected": -0.6518079042434692, "logps/chosen": -8.555349349975586, "logps/rejected": -16.54492950439453, "loss": 0.8154255151748657, "memory(GiB)": 46.82, "nll_loss": 0.3061010241508484, "rewards/accuracies": 0.8125, "rewards/chosen": 0.10620275139808655, "rewards/margins": 0.7189066410064697, "rewards/rejected": -0.6127039194107056, "step": 69, "train_speed(iter/s)": 0.005355 }, { "epoch": 0.18175916910094125, "grad_norm": 4.3252716064453125, "learning_rate": 0.0001991138323144392, "logits/chosen": -0.6485374569892883, "logits/rejected": -0.6516393423080444, "logps/chosen": -8.738260269165039, "logps/rejected": -25.283050537109375, "loss": 0.7622725963592529, "memory(GiB)": 46.82, "nll_loss": 0.4182221591472626, "rewards/accuracies": 0.9375, "rewards/chosen": 0.32638847827911377, "rewards/margins": 1.3203245401382446, "rewards/rejected": -0.9939361810684204, "step": 70, "train_speed(iter/s)": 0.005357 }, { "epoch": 0.18435572865952612, "grad_norm": 2.5611085891723633, "learning_rate": 0.0001990558296607687, "logits/chosen": -0.6623813509941101, "logits/rejected": -0.6669056415557861, "logps/chosen": -6.732373237609863, "logps/rejected": -28.474903106689453, "loss": 0.6175573468208313, "memory(GiB)": 46.82, "nll_loss": 0.30857983231544495, "rewards/accuracies": 0.90625, "rewards/chosen": 0.274377703666687, "rewards/margins": 1.688110589981079, "rewards/rejected": -1.4137327671051025, "step": 71, "train_speed(iter/s)": 0.005356 }, { "epoch": 0.186952288218111, "grad_norm": 4.000219821929932, "learning_rate": 0.00019899599745676122, "logits/chosen": -0.6445091366767883, "logits/rejected": -0.6437230706214905, "logps/chosen": -9.047367095947266, "logps/rejected": -24.770275115966797, "loss": 0.6452784538269043, "memory(GiB)": 46.82, "nll_loss": 0.3213377594947815, "rewards/accuracies": 0.9375, "rewards/chosen": 0.2230340838432312, "rewards/margins": 1.4539806842803955, "rewards/rejected": -1.230946660041809, "step": 72, "train_speed(iter/s)": 0.005356 }, { "epoch": 0.18954884777669587, "grad_norm": 6.319863319396973, "learning_rate": 0.00019893433680751103, "logits/chosen": -0.6865643262863159, "logits/rejected": -0.6869932413101196, "logps/chosen": -7.858439922332764, "logps/rejected": -23.94890785217285, "loss": 0.686578631401062, "memory(GiB)": 46.82, "nll_loss": 0.3744764029979706, "rewards/accuracies": 0.9375, "rewards/chosen": 0.1327737271785736, "rewards/margins": 1.4861775636672974, "rewards/rejected": -1.3534038066864014, "step": 73, "train_speed(iter/s)": 0.005357 }, { "epoch": 0.19214540733528077, "grad_norm": 6.422192573547363, "learning_rate": 0.00019887084885188353, "logits/chosen": -0.6767789125442505, "logits/rejected": -0.6818562746047974, "logps/chosen": -10.235507011413574, "logps/rejected": -27.55042266845703, "loss": 1.0105760097503662, "memory(GiB)": 46.82, "nll_loss": 0.45665743947029114, "rewards/accuracies": 0.8125, "rewards/chosen": -0.17956775426864624, "rewards/margins": 1.3902134895324707, "rewards/rejected": -1.5697813034057617, "step": 74, "train_speed(iter/s)": 0.005356 }, { "epoch": 0.19474196689386564, "grad_norm": 5.481616973876953, "learning_rate": 0.00019880553476249436, "logits/chosen": -0.7030400037765503, "logits/rejected": -0.7033373713493347, "logps/chosen": -10.782912254333496, "logps/rejected": -32.654239654541016, "loss": 0.9248250722885132, "memory(GiB)": 46.82, "nll_loss": 0.4116487205028534, "rewards/accuracies": 0.75, "rewards/chosen": -0.2691394090652466, "rewards/margins": 1.6453478336334229, "rewards/rejected": -1.914487361907959, "step": 75, "train_speed(iter/s)": 0.005353 }, { "epoch": 0.1973385264524505, "grad_norm": 4.9708380699157715, "learning_rate": 0.00019873839574568756, "logits/chosen": -0.7089657783508301, "logits/rejected": -0.7070764303207397, "logps/chosen": -15.426520347595215, "logps/rejected": -19.238183975219727, "loss": 0.9280877113342285, "memory(GiB)": 46.82, "nll_loss": 0.4586380124092102, "rewards/accuracies": 0.71875, "rewards/chosen": 0.10893960297107697, "rewards/margins": 1.0797489881515503, "rewards/rejected": -0.9708094000816345, "step": 76, "train_speed(iter/s)": 0.005353 }, { "epoch": 0.19993508601103538, "grad_norm": 6.939232349395752, "learning_rate": 0.00019866943304151343, "logits/chosen": -0.7235709428787231, "logits/rejected": -0.7286774516105652, "logps/chosen": -8.378010749816895, "logps/rejected": -22.562332153320312, "loss": 0.7349967956542969, "memory(GiB)": 46.82, "nll_loss": 0.4009379744529724, "rewards/accuracies": 0.90625, "rewards/chosen": 0.21920469403266907, "rewards/margins": 1.1362016201019287, "rewards/rejected": -0.916996955871582, "step": 77, "train_speed(iter/s)": 0.005351 }, { "epoch": 0.20253164556962025, "grad_norm": 7.251801013946533, "learning_rate": 0.00019859864792370563, "logits/chosen": -0.7075158357620239, "logits/rejected": -0.7119045257568359, "logps/chosen": -6.7388834953308105, "logps/rejected": -26.275516510009766, "loss": 0.6517897844314575, "memory(GiB)": 46.82, "nll_loss": 0.36059334874153137, "rewards/accuracies": 0.875, "rewards/chosen": 0.1867286115884781, "rewards/margins": 1.5948593616485596, "rewards/rejected": -1.4081308841705322, "step": 78, "train_speed(iter/s)": 0.005351 }, { "epoch": 0.20512820512820512, "grad_norm": 2.740595579147339, "learning_rate": 0.00019852604169965748, "logits/chosen": -0.7263121604919434, "logits/rejected": -0.7323212027549744, "logps/chosen": -8.532756805419922, "logps/rejected": -26.737321853637695, "loss": 0.7062958478927612, "memory(GiB)": 46.82, "nll_loss": 0.3304542601108551, "rewards/accuracies": 0.90625, "rewards/chosen": 0.15770669281482697, "rewards/margins": 1.20403254032135, "rewards/rejected": -1.0463258028030396, "step": 79, "train_speed(iter/s)": 0.005353 }, { "epoch": 0.20772476468679, "grad_norm": 8.650463104248047, "learning_rate": 0.00019845161571039802, "logits/chosen": -0.665086567401886, "logits/rejected": -0.6679493188858032, "logps/chosen": -6.538414001464844, "logps/rejected": -23.43639373779297, "loss": 0.6757080554962158, "memory(GiB)": 46.82, "nll_loss": 0.3169613480567932, "rewards/accuracies": 0.84375, "rewards/chosen": 0.1747138351202011, "rewards/margins": 1.2467294931411743, "rewards/rejected": -1.072015643119812, "step": 80, "train_speed(iter/s)": 0.005354 }, { "epoch": 0.2103213242453749, "grad_norm": 2.5581393241882324, "learning_rate": 0.00019837537133056716, "logits/chosen": -0.7091171145439148, "logits/rejected": -0.7068539261817932, "logps/chosen": -7.670237064361572, "logps/rejected": -22.62818717956543, "loss": 0.6010414958000183, "memory(GiB)": 46.82, "nll_loss": 0.2785060405731201, "rewards/accuracies": 0.90625, "rewards/chosen": 0.23199363052845, "rewards/margins": 1.2859355211257935, "rewards/rejected": -1.0539417266845703, "step": 81, "train_speed(iter/s)": 0.005353 }, { "epoch": 0.21291788380395976, "grad_norm": 5.669743537902832, "learning_rate": 0.0001982973099683902, "logits/chosen": -0.6808027029037476, "logits/rejected": -0.6830285787582397, "logps/chosen": -9.610679626464844, "logps/rejected": -27.96251678466797, "loss": 0.6995903849601746, "memory(GiB)": 46.82, "nll_loss": 0.4465019702911377, "rewards/accuracies": 0.96875, "rewards/chosen": 0.23076733946800232, "rewards/margins": 1.6701395511627197, "rewards/rejected": -1.4393723011016846, "step": 82, "train_speed(iter/s)": 0.005355 }, { "epoch": 0.21551444336254463, "grad_norm": 3.1134045124053955, "learning_rate": 0.00019821743306565196, "logits/chosen": -0.6749523878097534, "logits/rejected": -0.6780697107315063, "logps/chosen": -7.1323065757751465, "logps/rejected": -20.9448299407959, "loss": 0.8713948726654053, "memory(GiB)": 46.82, "nll_loss": 0.39334219694137573, "rewards/accuracies": 0.71875, "rewards/chosen": 0.03965923935174942, "rewards/margins": 1.1248116493225098, "rewards/rejected": -1.0851523876190186, "step": 83, "train_speed(iter/s)": 0.005357 }, { "epoch": 0.2181110029211295, "grad_norm": 4.337428569793701, "learning_rate": 0.00019813574209767012, "logits/chosen": -0.7203540205955505, "logits/rejected": -0.7236320972442627, "logps/chosen": -5.232553482055664, "logps/rejected": -20.862529754638672, "loss": 0.766181230545044, "memory(GiB)": 46.82, "nll_loss": 0.35961851477622986, "rewards/accuracies": 0.75, "rewards/chosen": 0.18721464276313782, "rewards/margins": 1.240044116973877, "rewards/rejected": -1.052829384803772, "step": 84, "train_speed(iter/s)": 0.005361 }, { "epoch": 0.22070756247971438, "grad_norm": 3.9627957344055176, "learning_rate": 0.00019805223857326793, "logits/chosen": -0.6975981593132019, "logits/rejected": -0.69466632604599, "logps/chosen": -10.297499656677246, "logps/rejected": -18.96347999572754, "loss": 0.791930615901947, "memory(GiB)": 46.82, "nll_loss": 0.43207138776779175, "rewards/accuracies": 0.84375, "rewards/chosen": 0.31037044525146484, "rewards/margins": 1.2147060632705688, "rewards/rejected": -0.904335618019104, "step": 85, "train_speed(iter/s)": 0.005363 }, { "epoch": 0.22330412203829925, "grad_norm": 5.315914630889893, "learning_rate": 0.00019796692403474634, "logits/chosen": -0.7207286953926086, "logits/rejected": -0.7248555421829224, "logps/chosen": -7.064785480499268, "logps/rejected": -26.38395881652832, "loss": 0.6355230212211609, "memory(GiB)": 46.82, "nll_loss": 0.31730470061302185, "rewards/accuracies": 0.84375, "rewards/chosen": 0.19611045718193054, "rewards/margins": 1.5834972858428955, "rewards/rejected": -1.3873869180679321, "step": 86, "train_speed(iter/s)": 0.005363 }, { "epoch": 0.22590068159688412, "grad_norm": 3.8507533073425293, "learning_rate": 0.0001978798000578555, "logits/chosen": -0.6815958619117737, "logits/rejected": -0.6819433569908142, "logps/chosen": -10.517496109008789, "logps/rejected": -21.736141204833984, "loss": 0.7764264941215515, "memory(GiB)": 46.82, "nll_loss": 0.3441038131713867, "rewards/accuracies": 0.8125, "rewards/chosen": 0.11584789305925369, "rewards/margins": 1.0969102382659912, "rewards/rejected": -0.9810622930526733, "step": 87, "train_speed(iter/s)": 0.005364 }, { "epoch": 0.22849724115546902, "grad_norm": 2.613917350769043, "learning_rate": 0.0001977908682517658, "logits/chosen": -0.7139868140220642, "logits/rejected": -0.7127493023872375, "logps/chosen": -7.027731418609619, "logps/rejected": -21.87887954711914, "loss": 0.5793716907501221, "memory(GiB)": 46.82, "nll_loss": 0.24400269985198975, "rewards/accuracies": 0.84375, "rewards/chosen": 0.159662663936615, "rewards/margins": 1.3076614141464233, "rewards/rejected": -1.1479988098144531, "step": 88, "train_speed(iter/s)": 0.005365 }, { "epoch": 0.2310938007140539, "grad_norm": 2.5475218296051025, "learning_rate": 0.00019770013025903794, "logits/chosen": -0.7572659254074097, "logits/rejected": -0.7608864307403564, "logps/chosen": -7.705483436584473, "logps/rejected": -23.772804260253906, "loss": 0.7914519906044006, "memory(GiB)": 46.82, "nll_loss": 0.4494747221469879, "rewards/accuracies": 0.875, "rewards/chosen": 0.029678428545594215, "rewards/margins": 1.3612412214279175, "rewards/rejected": -1.3315627574920654, "step": 89, "train_speed(iter/s)": 0.005365 }, { "epoch": 0.23369036027263876, "grad_norm": 2.815131902694702, "learning_rate": 0.00019760758775559274, "logits/chosen": -0.7308779954910278, "logits/rejected": -0.7346111536026001, "logps/chosen": -6.071584224700928, "logps/rejected": -31.994752883911133, "loss": 0.45671066641807556, "memory(GiB)": 46.82, "nll_loss": 0.21047784388065338, "rewards/accuracies": 0.90625, "rewards/chosen": 0.14397624135017395, "rewards/margins": 1.9211211204528809, "rewards/rejected": -1.7771449089050293, "step": 90, "train_speed(iter/s)": 0.005366 }, { "epoch": 0.23628691983122363, "grad_norm": 2.638777494430542, "learning_rate": 0.00019751324245068005, "logits/chosen": -0.7884888648986816, "logits/rejected": -0.7910454273223877, "logps/chosen": -7.571388244628906, "logps/rejected": -31.14786720275879, "loss": 0.47864896059036255, "memory(GiB)": 46.82, "nll_loss": 0.28661027550697327, "rewards/accuracies": 0.9375, "rewards/chosen": 0.23762081563472748, "rewards/margins": 2.1247057914733887, "rewards/rejected": -1.887085199356079, "step": 91, "train_speed(iter/s)": 0.005367 }, { "epoch": 0.2388834793898085, "grad_norm": 2.7935073375701904, "learning_rate": 0.0001974170960868474, "logits/chosen": -0.7978686094284058, "logits/rejected": -0.7982107996940613, "logps/chosen": -9.373262405395508, "logps/rejected": -31.14629364013672, "loss": 0.7341030240058899, "memory(GiB)": 46.82, "nll_loss": 0.45608797669410706, "rewards/accuracies": 0.875, "rewards/chosen": 0.1958312690258026, "rewards/margins": 2.0244781970977783, "rewards/rejected": -1.8286471366882324, "step": 92, "train_speed(iter/s)": 0.005366 }, { "epoch": 0.24148003894839337, "grad_norm": 9.233238220214844, "learning_rate": 0.00019731915043990757, "logits/chosen": -0.8195321559906006, "logits/rejected": -0.8183485269546509, "logps/chosen": -9.839788436889648, "logps/rejected": -29.437850952148438, "loss": 0.6806643009185791, "memory(GiB)": 46.82, "nll_loss": 0.4058592915534973, "rewards/accuracies": 0.90625, "rewards/chosen": 0.22106225788593292, "rewards/margins": 1.8086858987808228, "rewards/rejected": -1.5876235961914062, "step": 93, "train_speed(iter/s)": 0.005364 }, { "epoch": 0.24407659850697824, "grad_norm": 16.396970748901367, "learning_rate": 0.00019721940731890598, "logits/chosen": -0.8492038249969482, "logits/rejected": -0.854621946811676, "logps/chosen": -10.201713562011719, "logps/rejected": -26.62791633605957, "loss": 0.8960828185081482, "memory(GiB)": 46.82, "nll_loss": 0.5508711338043213, "rewards/accuracies": 0.875, "rewards/chosen": 0.06682707369327545, "rewards/margins": 1.7468764781951904, "rewards/rejected": -1.6800494194030762, "step": 94, "train_speed(iter/s)": 0.005365 }, { "epoch": 0.24667315806556314, "grad_norm": 4.18104887008667, "learning_rate": 0.00019711786856608713, "logits/chosen": -0.8644828796386719, "logits/rejected": -0.8670830726623535, "logps/chosen": -8.474161148071289, "logps/rejected": -27.058048248291016, "loss": 0.9486290216445923, "memory(GiB)": 46.82, "nll_loss": 0.6114800572395325, "rewards/accuracies": 0.875, "rewards/chosen": 0.1142926812171936, "rewards/margins": 1.905853509902954, "rewards/rejected": -1.7915611267089844, "step": 95, "train_speed(iter/s)": 0.005365 }, { "epoch": 0.249269717624148, "grad_norm": 4.6679511070251465, "learning_rate": 0.00019701453605686068, "logits/chosen": -0.807258129119873, "logits/rejected": -0.8097864985466003, "logps/chosen": -12.544672966003418, "logps/rejected": -33.301963806152344, "loss": 0.7105246186256409, "memory(GiB)": 46.82, "nll_loss": 0.4519771933555603, "rewards/accuracies": 0.9375, "rewards/chosen": 0.13032159209251404, "rewards/margins": 2.0599286556243896, "rewards/rejected": -1.9296070337295532, "step": 96, "train_speed(iter/s)": 0.005365 }, { "epoch": 0.25186627718273286, "grad_norm": 9.922234535217285, "learning_rate": 0.0001969094116997668, "logits/chosen": -0.82038813829422, "logits/rejected": -0.8280550837516785, "logps/chosen": -6.2751688957214355, "logps/rejected": -35.381473541259766, "loss": 0.6427486538887024, "memory(GiB)": 46.82, "nll_loss": 0.40357428789138794, "rewards/accuracies": 0.90625, "rewards/chosen": 0.10702433437108994, "rewards/margins": 2.1959128379821777, "rewards/rejected": -2.088888168334961, "step": 97, "train_speed(iter/s)": 0.005364 }, { "epoch": 0.25446283674131775, "grad_norm": 2.88350248336792, "learning_rate": 0.00019680249743644082, "logits/chosen": -0.8155514001846313, "logits/rejected": -0.8185899257659912, "logps/chosen": -8.072955131530762, "logps/rejected": -31.97516632080078, "loss": 0.4997653067111969, "memory(GiB)": 46.82, "nll_loss": 0.29022216796875, "rewards/accuracies": 0.96875, "rewards/chosen": 0.18802499771118164, "rewards/margins": 2.076292037963867, "rewards/rejected": -1.8882670402526855, "step": 98, "train_speed(iter/s)": 0.005364 }, { "epoch": 0.25705939629990265, "grad_norm": 6.562138080596924, "learning_rate": 0.00019669379524157754, "logits/chosen": -0.7990139722824097, "logits/rejected": -0.7997216582298279, "logps/chosen": -10.97663688659668, "logps/rejected": -38.73711395263672, "loss": 1.0108985900878906, "memory(GiB)": 46.82, "nll_loss": 0.6511343121528625, "rewards/accuracies": 0.84375, "rewards/chosen": -0.15600137412548065, "rewards/margins": 2.344217538833618, "rewards/rejected": -2.5002188682556152, "step": 99, "train_speed(iter/s)": 0.005363 }, { "epoch": 0.2596559558584875, "grad_norm": 3.38523530960083, "learning_rate": 0.00019658330712289454, "logits/chosen": -0.7976465225219727, "logits/rejected": -0.8036509156227112, "logps/chosen": -5.74189567565918, "logps/rejected": -38.44095993041992, "loss": 0.44277071952819824, "memory(GiB)": 46.82, "nll_loss": 0.23434144258499146, "rewards/accuracies": 0.90625, "rewards/chosen": 0.08411058783531189, "rewards/margins": 2.847978115081787, "rewards/rejected": -2.7638673782348633, "step": 100, "train_speed(iter/s)": 0.005363 }, { "epoch": 0.2622525154170724, "grad_norm": 4.052488327026367, "learning_rate": 0.00019647103512109536, "logits/chosen": -0.7472208738327026, "logits/rejected": -0.7484402656555176, "logps/chosen": -8.85651683807373, "logps/rejected": -31.95272445678711, "loss": 0.7574372291564941, "memory(GiB)": 46.82, "nll_loss": 0.4765327274799347, "rewards/accuracies": 0.90625, "rewards/chosen": 0.06969474256038666, "rewards/margins": 2.256247043609619, "rewards/rejected": -2.1865522861480713, "step": 101, "train_speed(iter/s)": 0.005359 }, { "epoch": 0.26484907497565724, "grad_norm": 9.65314769744873, "learning_rate": 0.0001963569813098315, "logits/chosen": -0.7638405561447144, "logits/rejected": -0.7673444747924805, "logps/chosen": -9.536478042602539, "logps/rejected": -24.767440795898438, "loss": 0.9202646017074585, "memory(GiB)": 46.82, "nll_loss": 0.5910370945930481, "rewards/accuracies": 0.90625, "rewards/chosen": 0.0962737649679184, "rewards/margins": 1.5450704097747803, "rewards/rejected": -1.4487966299057007, "step": 102, "train_speed(iter/s)": 0.005358 }, { "epoch": 0.26744563453424214, "grad_norm": 9.249479293823242, "learning_rate": 0.00019624114779566448, "logits/chosen": -0.7637047171592712, "logits/rejected": -0.7682798504829407, "logps/chosen": -9.765649795532227, "logps/rejected": -26.720335006713867, "loss": 0.7715259790420532, "memory(GiB)": 46.82, "nll_loss": 0.40688371658325195, "rewards/accuracies": 0.875, "rewards/chosen": -0.025217050686478615, "rewards/margins": 1.340709924697876, "rewards/rejected": -1.36592698097229, "step": 103, "train_speed(iter/s)": 0.005359 }, { "epoch": 0.270042194092827, "grad_norm": 18.381378173828125, "learning_rate": 0.00019612353671802656, "logits/chosen": -0.7441118955612183, "logits/rejected": -0.7465165853500366, "logps/chosen": -10.135462760925293, "logps/rejected": -24.317302703857422, "loss": 1.0861011743545532, "memory(GiB)": 46.82, "nll_loss": 0.6500208377838135, "rewards/accuracies": 0.8125, "rewards/chosen": -0.0288698673248291, "rewards/margins": 1.2047085762023926, "rewards/rejected": -1.2335785627365112, "step": 104, "train_speed(iter/s)": 0.005361 }, { "epoch": 0.2726387536514119, "grad_norm": 3.6603286266326904, "learning_rate": 0.0001960041502491815, "logits/chosen": -0.7493617534637451, "logits/rejected": -0.7547396421432495, "logps/chosen": -9.255151748657227, "logps/rejected": -26.553424835205078, "loss": 0.7831539511680603, "memory(GiB)": 46.82, "nll_loss": 0.4715706706047058, "rewards/accuracies": 0.875, "rewards/chosen": 0.23407554626464844, "rewards/margins": 1.5187476873397827, "rewards/rejected": -1.2846721410751343, "step": 105, "train_speed(iter/s)": 0.00536 }, { "epoch": 0.2752353132099968, "grad_norm": 3.8713457584381104, "learning_rate": 0.00019588299059418432, "logits/chosen": -0.7057076692581177, "logits/rejected": -0.7100006341934204, "logps/chosen": -7.245676517486572, "logps/rejected": -30.364728927612305, "loss": 0.47607186436653137, "memory(GiB)": 46.82, "nll_loss": 0.2242860198020935, "rewards/accuracies": 0.90625, "rewards/chosen": 0.16006791591644287, "rewards/margins": 1.8761022090911865, "rewards/rejected": -1.7160344123840332, "step": 106, "train_speed(iter/s)": 0.00536 }, { "epoch": 0.2778318727685816, "grad_norm": 4.534320831298828, "learning_rate": 0.0001957600599908406, "logits/chosen": -0.7508159875869751, "logits/rejected": -0.7570351958274841, "logps/chosen": -7.806947708129883, "logps/rejected": -35.8264274597168, "loss": 0.7150964140892029, "memory(GiB)": 46.82, "nll_loss": 0.3946303129196167, "rewards/accuracies": 0.875, "rewards/chosen": 0.08480332791805267, "rewards/margins": 2.440999984741211, "rewards/rejected": -2.356196880340576, "step": 107, "train_speed(iter/s)": 0.005361 }, { "epoch": 0.2804284323271665, "grad_norm": 4.433022975921631, "learning_rate": 0.00019563536070966512, "logits/chosen": -0.7469314932823181, "logits/rejected": -0.7510149478912354, "logps/chosen": -6.266570568084717, "logps/rejected": -27.143407821655273, "loss": 0.7763616442680359, "memory(GiB)": 46.82, "nll_loss": 0.3898002505302429, "rewards/accuracies": 0.78125, "rewards/chosen": 0.2665005028247833, "rewards/margins": 1.8339991569519043, "rewards/rejected": -1.5674986839294434, "step": 108, "train_speed(iter/s)": 0.005362 }, { "epoch": 0.28302499188575136, "grad_norm": 3.777085065841675, "learning_rate": 0.00019550889505383996, "logits/chosen": -0.7664754986763, "logits/rejected": -0.7695226669311523, "logps/chosen": -8.639087677001953, "logps/rejected": -32.59357833862305, "loss": 0.6963664889335632, "memory(GiB)": 46.82, "nll_loss": 0.3630713224411011, "rewards/accuracies": 0.8125, "rewards/chosen": 0.09401198476552963, "rewards/margins": 2.053591728210449, "rewards/rejected": -1.9595798254013062, "step": 109, "train_speed(iter/s)": 0.005362 }, { "epoch": 0.28562155144433626, "grad_norm": 3.1223268508911133, "learning_rate": 0.00019538066535917196, "logits/chosen": -0.7881599068641663, "logits/rejected": -0.7903666496276855, "logps/chosen": -10.761030197143555, "logps/rejected": -24.686668395996094, "loss": 0.812722384929657, "memory(GiB)": 46.82, "nll_loss": 0.4688267707824707, "rewards/accuracies": 0.75, "rewards/chosen": 0.07528804242610931, "rewards/margins": 1.5661133527755737, "rewards/rejected": -1.4908254146575928, "step": 110, "train_speed(iter/s)": 0.005362 }, { "epoch": 0.2882181110029211, "grad_norm": 3.300981283187866, "learning_rate": 0.00019525067399404957, "logits/chosen": -0.7968149185180664, "logits/rejected": -0.7997515797615051, "logps/chosen": -6.535473346710205, "logps/rejected": -19.67113494873047, "loss": 0.577447772026062, "memory(GiB)": 46.82, "nll_loss": 0.27950558066368103, "rewards/accuracies": 0.9375, "rewards/chosen": 0.3308606743812561, "rewards/margins": 1.4230268001556396, "rewards/rejected": -1.0921661853790283, "step": 111, "train_speed(iter/s)": 0.005362 }, { "epoch": 0.290814670561506, "grad_norm": 4.260409832000732, "learning_rate": 0.00019511892335939904, "logits/chosen": -0.7704994678497314, "logits/rejected": -0.773585855960846, "logps/chosen": -7.999111175537109, "logps/rejected": -23.012435913085938, "loss": 0.8953735828399658, "memory(GiB)": 46.82, "nll_loss": 0.38217711448669434, "rewards/accuracies": 0.78125, "rewards/chosen": -0.008818171918392181, "rewards/margins": 1.0762327909469604, "rewards/rejected": -1.0850509405136108, "step": 112, "train_speed(iter/s)": 0.005363 }, { "epoch": 0.2934112301200909, "grad_norm": 2.6586623191833496, "learning_rate": 0.0001949854158886402, "logits/chosen": -0.8259446024894714, "logits/rejected": -0.8321948647499084, "logps/chosen": -5.621776580810547, "logps/rejected": -21.676912307739258, "loss": 0.5901638269424438, "memory(GiB)": 46.82, "nll_loss": 0.2607543170452118, "rewards/accuracies": 0.90625, "rewards/chosen": 0.231726735830307, "rewards/margins": 1.2758175134658813, "rewards/rejected": -1.0440906286239624, "step": 113, "train_speed(iter/s)": 0.005364 }, { "epoch": 0.29600778967867575, "grad_norm": 2.47329044342041, "learning_rate": 0.00019485015404764142, "logits/chosen": -0.8323794007301331, "logits/rejected": -0.8363099098205566, "logps/chosen": -7.094597339630127, "logps/rejected": -23.47966766357422, "loss": 0.5581099987030029, "memory(GiB)": 46.82, "nll_loss": 0.2674333155155182, "rewards/accuracies": 1.0, "rewards/chosen": 0.24452531337738037, "rewards/margins": 1.409566879272461, "rewards/rejected": -1.1650415658950806, "step": 114, "train_speed(iter/s)": 0.005365 }, { "epoch": 0.29860434923726065, "grad_norm": 2.6978213787078857, "learning_rate": 0.00019471314033467412, "logits/chosen": -0.8472287654876709, "logits/rejected": -0.8518344163894653, "logps/chosen": -6.279523849487305, "logps/rejected": -26.379831314086914, "loss": 0.6252153515815735, "memory(GiB)": 46.82, "nll_loss": 0.3001650869846344, "rewards/accuracies": 0.90625, "rewards/chosen": 0.2660066485404968, "rewards/margins": 1.4429866075515747, "rewards/rejected": -1.1769800186157227, "step": 115, "train_speed(iter/s)": 0.005365 }, { "epoch": 0.3012009087958455, "grad_norm": 3.7869536876678467, "learning_rate": 0.00019457437728036657, "logits/chosen": -0.9077713489532471, "logits/rejected": -0.9146382212638855, "logps/chosen": -7.037418842315674, "logps/rejected": -28.10509490966797, "loss": 0.6573376059532166, "memory(GiB)": 46.82, "nll_loss": 0.39039283990859985, "rewards/accuracies": 0.96875, "rewards/chosen": 0.2199217826128006, "rewards/margins": 1.892009973526001, "rewards/rejected": -1.6720881462097168, "step": 116, "train_speed(iter/s)": 0.005364 }, { "epoch": 0.3037974683544304, "grad_norm": 7.053493022918701, "learning_rate": 0.00019443386744765723, "logits/chosen": -0.9531128406524658, "logits/rejected": -0.960386335849762, "logps/chosen": -6.833982467651367, "logps/rejected": -32.22799301147461, "loss": 0.5475011467933655, "memory(GiB)": 46.82, "nll_loss": 0.30003488063812256, "rewards/accuracies": 0.9375, "rewards/chosen": 0.2115585058927536, "rewards/margins": 1.97544527053833, "rewards/rejected": -1.7638866901397705, "step": 117, "train_speed(iter/s)": 0.005364 }, { "epoch": 0.30639402791301523, "grad_norm": 10.012398719787598, "learning_rate": 0.00019429161343174732, "logits/chosen": -0.9923131465911865, "logits/rejected": -0.9990757703781128, "logps/chosen": -6.25333309173584, "logps/rejected": -37.52185821533203, "loss": 0.47200581431388855, "memory(GiB)": 46.82, "nll_loss": 0.2796837091445923, "rewards/accuracies": 0.9375, "rewards/chosen": 0.15778988599777222, "rewards/margins": 2.6613681316375732, "rewards/rejected": -2.5035781860351562, "step": 118, "train_speed(iter/s)": 0.005363 }, { "epoch": 0.30899058747160013, "grad_norm": 6.096463203430176, "learning_rate": 0.00019414761786005293, "logits/chosen": -1.0189846754074097, "logits/rejected": -1.0254305601119995, "logps/chosen": -10.205361366271973, "logps/rejected": -36.81409454345703, "loss": 0.8465672731399536, "memory(GiB)": 46.82, "nll_loss": 0.41437357664108276, "rewards/accuracies": 0.78125, "rewards/chosen": 0.21620658040046692, "rewards/margins": 2.7219061851501465, "rewards/rejected": -2.505699634552002, "step": 119, "train_speed(iter/s)": 0.005365 }, { "epoch": 0.31158714703018503, "grad_norm": 5.313393592834473, "learning_rate": 0.00019400188339215656, "logits/chosen": -1.046160340309143, "logits/rejected": -1.0573420524597168, "logps/chosen": -7.700190544128418, "logps/rejected": -47.04288101196289, "loss": 0.6054658889770508, "memory(GiB)": 46.82, "nll_loss": 0.3044295608997345, "rewards/accuracies": 0.84375, "rewards/chosen": 0.0029486743733286858, "rewards/margins": 3.3137736320495605, "rewards/rejected": -3.3108251094818115, "step": 120, "train_speed(iter/s)": 0.005365 }, { "epoch": 0.3141837065887699, "grad_norm": 4.291571140289307, "learning_rate": 0.00019385441271975787, "logits/chosen": -0.9954756498336792, "logits/rejected": -1.0022181272506714, "logps/chosen": -8.529633522033691, "logps/rejected": -45.85521697998047, "loss": 0.5717029571533203, "memory(GiB)": 46.82, "nll_loss": 0.26478123664855957, "rewards/accuracies": 0.90625, "rewards/chosen": 0.10705923289060593, "rewards/margins": 3.2083029747009277, "rewards/rejected": -3.101243734359741, "step": 121, "train_speed(iter/s)": 0.005365 }, { "epoch": 0.31678026614735477, "grad_norm": 4.251352310180664, "learning_rate": 0.00019370520856662403, "logits/chosen": -0.9976125359535217, "logits/rejected": -1.0026432275772095, "logps/chosen": -8.120194435119629, "logps/rejected": -29.240516662597656, "loss": 0.5614541172981262, "memory(GiB)": 46.82, "nll_loss": 0.28819626569747925, "rewards/accuracies": 0.875, "rewards/chosen": 0.25042724609375, "rewards/margins": 2.2021260261535645, "rewards/rejected": -1.9516987800598145, "step": 122, "train_speed(iter/s)": 0.005365 }, { "epoch": 0.3193768257059396, "grad_norm": 3.4627809524536133, "learning_rate": 0.00019355427368853944, "logits/chosen": -0.9717710614204407, "logits/rejected": -0.9764275550842285, "logps/chosen": -6.992214679718018, "logps/rejected": -39.05671691894531, "loss": 0.4260398745536804, "memory(GiB)": 46.82, "nll_loss": 0.22311873733997345, "rewards/accuracies": 0.9375, "rewards/chosen": 0.1755235493183136, "rewards/margins": 2.8104753494262695, "rewards/rejected": -2.6349518299102783, "step": 123, "train_speed(iter/s)": 0.005363 }, { "epoch": 0.3219733852645245, "grad_norm": 5.5872344970703125, "learning_rate": 0.0001934016108732548, "logits/chosen": -0.9085801243782043, "logits/rejected": -0.9201411008834839, "logps/chosen": -6.697179794311523, "logps/rejected": -39.4910774230957, "loss": 0.5134581327438354, "memory(GiB)": 46.82, "nll_loss": 0.22149759531021118, "rewards/accuracies": 0.9375, "rewards/chosen": 0.12765586376190186, "rewards/margins": 2.5553700923919678, "rewards/rejected": -2.4277141094207764, "step": 124, "train_speed(iter/s)": 0.005363 }, { "epoch": 0.32456994482310936, "grad_norm": 4.304178237915039, "learning_rate": 0.00019324722294043558, "logits/chosen": -0.9116522073745728, "logits/rejected": -0.9168075323104858, "logps/chosen": -11.646254539489746, "logps/rejected": -32.823944091796875, "loss": 0.9349632859230042, "memory(GiB)": 46.82, "nll_loss": 0.6308795213699341, "rewards/accuracies": 0.9375, "rewards/chosen": -0.16005653142929077, "rewards/margins": 1.716849684715271, "rewards/rejected": -1.8769065141677856, "step": 125, "train_speed(iter/s)": 0.005363 }, { "epoch": 0.32716650438169426, "grad_norm": 8.176533699035645, "learning_rate": 0.00019309111274161005, "logits/chosen": -0.9096921682357788, "logits/rejected": -0.9123918414115906, "logps/chosen": -7.077070236206055, "logps/rejected": -30.848291397094727, "loss": 0.7031348943710327, "memory(GiB)": 46.82, "nll_loss": 0.4654442369937897, "rewards/accuracies": 0.96875, "rewards/chosen": 0.14152386784553528, "rewards/margins": 1.975406527519226, "rewards/rejected": -1.8338826894760132, "step": 126, "train_speed(iter/s)": 0.005364 }, { "epoch": 0.32976306394027916, "grad_norm": 2.428119659423828, "learning_rate": 0.00019293328316011643, "logits/chosen": -0.8453407287597656, "logits/rejected": -0.8446547985076904, "logps/chosen": -5.936784744262695, "logps/rejected": -24.515966415405273, "loss": 0.5038060545921326, "memory(GiB)": 46.82, "nll_loss": 0.2542741894721985, "rewards/accuracies": 0.9375, "rewards/chosen": 0.29046115279197693, "rewards/margins": 1.757112741470337, "rewards/rejected": -1.4666515588760376, "step": 127, "train_speed(iter/s)": 0.005364 }, { "epoch": 0.332359623498864, "grad_norm": 6.065800666809082, "learning_rate": 0.00019277373711104988, "logits/chosen": -0.79842609167099, "logits/rejected": -0.8017737865447998, "logps/chosen": -11.66524887084961, "logps/rejected": -29.264678955078125, "loss": 0.9522978067398071, "memory(GiB)": 46.82, "nll_loss": 0.6585720777511597, "rewards/accuracies": 0.84375, "rewards/chosen": 0.18028652667999268, "rewards/margins": 1.8596545457839966, "rewards/rejected": -1.679368257522583, "step": 128, "train_speed(iter/s)": 0.005363 }, { "epoch": 0.3349561830574489, "grad_norm": 1.9705984592437744, "learning_rate": 0.00019261247754120845, "logits/chosen": -0.8193144202232361, "logits/rejected": -0.8230156302452087, "logps/chosen": -6.537097454071045, "logps/rejected": -34.18002700805664, "loss": 0.45630478858947754, "memory(GiB)": 46.82, "nll_loss": 0.26018983125686646, "rewards/accuracies": 1.0, "rewards/chosen": 0.31401899456977844, "rewards/margins": 2.220799446105957, "rewards/rejected": -1.906780481338501, "step": 129, "train_speed(iter/s)": 0.005363 }, { "epoch": 0.33755274261603374, "grad_norm": 8.319106101989746, "learning_rate": 0.00019244950742903878, "logits/chosen": -0.8408774137496948, "logits/rejected": -0.8418459892272949, "logps/chosen": -11.665637969970703, "logps/rejected": -31.675600051879883, "loss": 0.8428304195404053, "memory(GiB)": 46.82, "nll_loss": 0.5734348297119141, "rewards/accuracies": 0.90625, "rewards/chosen": 0.2836587727069855, "rewards/margins": 2.027439832687378, "rewards/rejected": -1.7437809705734253, "step": 130, "train_speed(iter/s)": 0.005361 }, { "epoch": 0.34014930217461864, "grad_norm": 41.45463943481445, "learning_rate": 0.00019228482978458098, "logits/chosen": -0.838470995426178, "logits/rejected": -0.8445388078689575, "logps/chosen": -9.106077194213867, "logps/rejected": -35.46880340576172, "loss": 0.5834946036338806, "memory(GiB)": 46.82, "nll_loss": 0.3602459132671356, "rewards/accuracies": 0.90625, "rewards/chosen": 0.17075614631175995, "rewards/margins": 2.3818886280059814, "rewards/rejected": -2.211132526397705, "step": 131, "train_speed(iter/s)": 0.005362 }, { "epoch": 0.3427458617332035, "grad_norm": 3.643427848815918, "learning_rate": 0.00019211844764941316, "logits/chosen": -0.8022149801254272, "logits/rejected": -0.8042948842048645, "logps/chosen": -6.459863662719727, "logps/rejected": -25.415029525756836, "loss": 0.6114150285720825, "memory(GiB)": 46.82, "nll_loss": 0.275367796421051, "rewards/accuracies": 0.90625, "rewards/chosen": 0.15174095332622528, "rewards/margins": 1.8365050554275513, "rewards/rejected": -1.68476402759552, "step": 132, "train_speed(iter/s)": 0.005362 }, { "epoch": 0.3453424212917884, "grad_norm": 5.966490268707275, "learning_rate": 0.0001919503640965951, "logits/chosen": -0.8290812969207764, "logits/rejected": -0.8256518840789795, "logps/chosen": -11.998124122619629, "logps/rejected": -33.305782318115234, "loss": 0.8110654950141907, "memory(GiB)": 46.82, "nll_loss": 0.4670514762401581, "rewards/accuracies": 0.875, "rewards/chosen": -0.07125922292470932, "rewards/margins": 2.1010446548461914, "rewards/rejected": -2.1723036766052246, "step": 133, "train_speed(iter/s)": 0.005362 }, { "epoch": 0.3479389808503733, "grad_norm": 7.3433074951171875, "learning_rate": 0.00019178058223061172, "logits/chosen": -0.8187044262886047, "logits/rejected": -0.8188722133636475, "logps/chosen": -10.026674270629883, "logps/rejected": -34.666481018066406, "loss": 0.714328944683075, "memory(GiB)": 46.82, "nll_loss": 0.3863736093044281, "rewards/accuracies": 0.875, "rewards/chosen": -0.03853297978639603, "rewards/margins": 2.199920415878296, "rewards/rejected": -2.2384533882141113, "step": 134, "train_speed(iter/s)": 0.005362 }, { "epoch": 0.3505355404089581, "grad_norm": 3.3124072551727295, "learning_rate": 0.0001916091051873154, "logits/chosen": -0.8322088122367859, "logits/rejected": -0.8396530151367188, "logps/chosen": -7.216854095458984, "logps/rejected": -37.36469650268555, "loss": 0.6344051361083984, "memory(GiB)": 46.82, "nll_loss": 0.33177444338798523, "rewards/accuracies": 0.875, "rewards/chosen": 0.11395619809627533, "rewards/margins": 2.6887590885162354, "rewards/rejected": -2.574802875518799, "step": 135, "train_speed(iter/s)": 0.005362 }, { "epoch": 0.353132099967543, "grad_norm": 5.023634910583496, "learning_rate": 0.00019143593613386845, "logits/chosen": -0.8675904870033264, "logits/rejected": -0.8706792593002319, "logps/chosen": -11.020098686218262, "logps/rejected": -27.420391082763672, "loss": 0.9489123821258545, "memory(GiB)": 46.82, "nll_loss": 0.5339450836181641, "rewards/accuracies": 0.84375, "rewards/chosen": -0.009774968028068542, "rewards/margins": 1.8276335000991821, "rewards/rejected": -1.837408423423767, "step": 136, "train_speed(iter/s)": 0.005363 }, { "epoch": 0.35572865952612787, "grad_norm": 7.146136283874512, "learning_rate": 0.00019126107826868434, "logits/chosen": -0.8088135123252869, "logits/rejected": -0.8119392395019531, "logps/chosen": -6.920078277587891, "logps/rejected": -27.85674285888672, "loss": 0.5413922071456909, "memory(GiB)": 46.82, "nll_loss": 0.3426899015903473, "rewards/accuracies": 0.90625, "rewards/chosen": 0.3540826737880707, "rewards/margins": 2.053499698638916, "rewards/rejected": -1.6994171142578125, "step": 137, "train_speed(iter/s)": 0.005363 }, { "epoch": 0.35832521908471276, "grad_norm": 3.10225772857666, "learning_rate": 0.00019108453482136864, "logits/chosen": -0.797788679599762, "logits/rejected": -0.801692008972168, "logps/chosen": -7.574698448181152, "logps/rejected": -27.11581039428711, "loss": 0.5337320566177368, "memory(GiB)": 46.82, "nll_loss": 0.2580120861530304, "rewards/accuracies": 0.9375, "rewards/chosen": 0.1669113039970398, "rewards/margins": 1.648089051246643, "rewards/rejected": -1.4811776876449585, "step": 138, "train_speed(iter/s)": 0.005364 }, { "epoch": 0.3609217786432976, "grad_norm": 4.059778213500977, "learning_rate": 0.00019090630905265962, "logits/chosen": -0.7970037460327148, "logits/rejected": -0.8018133640289307, "logps/chosen": -6.6308183670043945, "logps/rejected": -31.498334884643555, "loss": 0.526771068572998, "memory(GiB)": 46.82, "nll_loss": 0.2799426317214966, "rewards/accuracies": 0.9375, "rewards/chosen": 0.1864967793226242, "rewards/margins": 1.9347224235534668, "rewards/rejected": -1.7482255697250366, "step": 139, "train_speed(iter/s)": 0.005364 }, { "epoch": 0.3635183382018825, "grad_norm": 3.430341958999634, "learning_rate": 0.00019072640425436764, "logits/chosen": -0.7270718216896057, "logits/rejected": -0.7312384843826294, "logps/chosen": -8.781835556030273, "logps/rejected": -27.820384979248047, "loss": 0.9166272878646851, "memory(GiB)": 46.82, "nll_loss": 0.6030000448226929, "rewards/accuracies": 0.84375, "rewards/chosen": 0.1951862871646881, "rewards/margins": 1.9607356786727905, "rewards/rejected": -1.7655493021011353, "step": 140, "train_speed(iter/s)": 0.005364 }, { "epoch": 0.3661148977604674, "grad_norm": 7.683961391448975, "learning_rate": 0.00019054482374931467, "logits/chosen": -0.7383142709732056, "logits/rejected": -0.7448272705078125, "logps/chosen": -8.916434288024902, "logps/rejected": -25.045127868652344, "loss": 0.7173936367034912, "memory(GiB)": 46.82, "nll_loss": 0.37474605441093445, "rewards/accuracies": 0.875, "rewards/chosen": 0.10682700574398041, "rewards/margins": 1.3628969192504883, "rewards/rejected": -1.2560698986053467, "step": 141, "train_speed(iter/s)": 0.005365 }, { "epoch": 0.36871145731905225, "grad_norm": 1.7709827423095703, "learning_rate": 0.0001903615708912728, "logits/chosen": -0.7578890919685364, "logits/rejected": -0.7647184729576111, "logps/chosen": -7.2641496658325195, "logps/rejected": -36.448509216308594, "loss": 0.4749196469783783, "memory(GiB)": 46.82, "nll_loss": 0.3057454228401184, "rewards/accuracies": 0.96875, "rewards/chosen": 0.32155346870422363, "rewards/margins": 2.4896819591522217, "rewards/rejected": -2.168128728866577, "step": 142, "train_speed(iter/s)": 0.005364 }, { "epoch": 0.37130801687763715, "grad_norm": 3.9916441440582275, "learning_rate": 0.00019017664906490218, "logits/chosen": -0.725705087184906, "logits/rejected": -0.7305294275283813, "logps/chosen": -7.681970119476318, "logps/rejected": -25.85850715637207, "loss": 0.720486581325531, "memory(GiB)": 46.82, "nll_loss": 0.41218873858451843, "rewards/accuracies": 0.875, "rewards/chosen": 0.3683932423591614, "rewards/margins": 1.7790489196777344, "rewards/rejected": -1.4106559753417969, "step": 143, "train_speed(iter/s)": 0.005364 }, { "epoch": 0.373904576436222, "grad_norm": 3.9804799556732178, "learning_rate": 0.00018999006168568883, "logits/chosen": -0.7427334785461426, "logits/rejected": -0.7495901584625244, "logps/chosen": -9.262022018432617, "logps/rejected": -25.315187454223633, "loss": 0.6805542707443237, "memory(GiB)": 46.82, "nll_loss": 0.2929586172103882, "rewards/accuracies": 0.84375, "rewards/chosen": 0.05294320732355118, "rewards/margins": 1.5572216510772705, "rewards/rejected": -1.5042784214019775, "step": 144, "train_speed(iter/s)": 0.005365 }, { "epoch": 0.3765011359948069, "grad_norm": 2.4131383895874023, "learning_rate": 0.00018980181219988116, "logits/chosen": -0.7519474029541016, "logits/rejected": -0.7524614930152893, "logps/chosen": -7.246754169464111, "logps/rejected": -24.415956497192383, "loss": 0.6144455075263977, "memory(GiB)": 46.82, "nll_loss": 0.33591488003730774, "rewards/accuracies": 0.84375, "rewards/chosen": 0.36078375577926636, "rewards/margins": 1.827178716659546, "rewards/rejected": -1.4663947820663452, "step": 145, "train_speed(iter/s)": 0.005365 }, { "epoch": 0.37909769555339173, "grad_norm": 3.9731338024139404, "learning_rate": 0.00018961190408442658, "logits/chosen": -0.7098850011825562, "logits/rejected": -0.7081133127212524, "logps/chosen": -11.87010669708252, "logps/rejected": -28.748165130615234, "loss": 0.7033959627151489, "memory(GiB)": 46.82, "nll_loss": 0.38679245114326477, "rewards/accuracies": 0.84375, "rewards/chosen": 0.13101431727409363, "rewards/margins": 1.9088966846466064, "rewards/rejected": -1.7778825759887695, "step": 146, "train_speed(iter/s)": 0.005365 }, { "epoch": 0.38169425511197663, "grad_norm": 5.180086135864258, "learning_rate": 0.00018942034084690724, "logits/chosen": -0.7729518413543701, "logits/rejected": -0.7725076675415039, "logps/chosen": -10.054743766784668, "logps/rejected": -27.725801467895508, "loss": 0.7672705054283142, "memory(GiB)": 46.82, "nll_loss": 0.32955068349838257, "rewards/accuracies": 0.84375, "rewards/chosen": -0.007290400564670563, "rewards/margins": 1.9963154792785645, "rewards/rejected": -2.003605842590332, "step": 147, "train_speed(iter/s)": 0.005365 }, { "epoch": 0.38429081467056153, "grad_norm": 3.313408374786377, "learning_rate": 0.00018922712602547517, "logits/chosen": -0.7976462244987488, "logits/rejected": -0.7998054623603821, "logps/chosen": -9.814254760742188, "logps/rejected": -36.34145736694336, "loss": 0.648523211479187, "memory(GiB)": 46.82, "nll_loss": 0.38048407435417175, "rewards/accuracies": 0.9375, "rewards/chosen": 0.21935109794139862, "rewards/margins": 2.4820148944854736, "rewards/rejected": -2.2626638412475586, "step": 148, "train_speed(iter/s)": 0.005365 }, { "epoch": 0.3868873742291464, "grad_norm": 4.517300128936768, "learning_rate": 0.00018903226318878698, "logits/chosen": -0.8082268238067627, "logits/rejected": -0.8085505962371826, "logps/chosen": -7.290218830108643, "logps/rejected": -28.533199310302734, "loss": 0.49404019117355347, "memory(GiB)": 46.82, "nll_loss": 0.3020762801170349, "rewards/accuracies": 0.96875, "rewards/chosen": 0.1652073860168457, "rewards/margins": 1.9900455474853516, "rewards/rejected": -1.8248380422592163, "step": 149, "train_speed(iter/s)": 0.005365 }, { "epoch": 0.3894839337877313, "grad_norm": 23.563270568847656, "learning_rate": 0.00018883575593593791, "logits/chosen": -0.7831783294677734, "logits/rejected": -0.7918115854263306, "logps/chosen": -5.868438243865967, "logps/rejected": -36.0763053894043, "loss": 0.833998441696167, "memory(GiB)": 46.82, "nll_loss": 0.5523523688316345, "rewards/accuracies": 0.84375, "rewards/chosen": 0.07082141935825348, "rewards/margins": 2.5503041744232178, "rewards/rejected": -2.479482889175415, "step": 150, "train_speed(iter/s)": 0.005364 }, { "epoch": 0.3920804933463161, "grad_norm": 2.2661221027374268, "learning_rate": 0.00018863760789639548, "logits/chosen": -0.8205257058143616, "logits/rejected": -0.8205671310424805, "logps/chosen": -8.58309268951416, "logps/rejected": -31.51813507080078, "loss": 0.5230035781860352, "memory(GiB)": 46.82, "nll_loss": 0.34633222222328186, "rewards/accuracies": 0.96875, "rewards/chosen": 0.2879600524902344, "rewards/margins": 2.3763887882232666, "rewards/rejected": -2.0884287357330322, "step": 151, "train_speed(iter/s)": 0.00536 }, { "epoch": 0.394677052904901, "grad_norm": 3.6260762214660645, "learning_rate": 0.00018843782272993224, "logits/chosen": -0.7732735872268677, "logits/rejected": -0.7779878973960876, "logps/chosen": -7.900063514709473, "logps/rejected": -36.353912353515625, "loss": 1.1941097974777222, "memory(GiB)": 46.82, "nll_loss": 0.7860652208328247, "rewards/accuracies": 0.84375, "rewards/chosen": -0.1569097638130188, "rewards/margins": 2.229072093963623, "rewards/rejected": -2.385981798171997, "step": 152, "train_speed(iter/s)": 0.005361 }, { "epoch": 0.39727361246348586, "grad_norm": 3.8922035694122314, "learning_rate": 0.00018823640412655844, "logits/chosen": -0.7862505316734314, "logits/rejected": -0.7926680445671082, "logps/chosen": -7.828291893005371, "logps/rejected": -39.66058349609375, "loss": 0.6880181431770325, "memory(GiB)": 46.82, "nll_loss": 0.5066484808921814, "rewards/accuracies": 0.9375, "rewards/chosen": 0.14748194813728333, "rewards/margins": 3.0227272510528564, "rewards/rejected": -2.8752455711364746, "step": 153, "train_speed(iter/s)": 0.00536 }, { "epoch": 0.39987017202207076, "grad_norm": 7.4526047706604, "learning_rate": 0.00018803335580645358, "logits/chosen": -0.7698212265968323, "logits/rejected": -0.7689813375473022, "logps/chosen": -13.24219036102295, "logps/rejected": -25.66214942932129, "loss": 0.9967556595802307, "memory(GiB)": 46.82, "nll_loss": 0.6198260188102722, "rewards/accuracies": 0.8125, "rewards/chosen": 0.07408954948186874, "rewards/margins": 1.6275382041931152, "rewards/rejected": -1.5534486770629883, "step": 154, "train_speed(iter/s)": 0.005359 }, { "epoch": 0.40246673158065566, "grad_norm": 4.633146286010742, "learning_rate": 0.0001878286815198979, "logits/chosen": -0.7589452266693115, "logits/rejected": -0.7617721557617188, "logps/chosen": -7.7529802322387695, "logps/rejected": -27.287784576416016, "loss": 0.6172698140144348, "memory(GiB)": 46.82, "nll_loss": 0.3214649558067322, "rewards/accuracies": 0.875, "rewards/chosen": 0.12731438875198364, "rewards/margins": 1.5837674140930176, "rewards/rejected": -1.4564530849456787, "step": 155, "train_speed(iter/s)": 0.00536 }, { "epoch": 0.4050632911392405, "grad_norm": 3.162893772125244, "learning_rate": 0.0001876223850472032, "logits/chosen": -0.7637428045272827, "logits/rejected": -0.7626054286956787, "logps/chosen": -8.649560928344727, "logps/rejected": -27.37163543701172, "loss": 0.616457462310791, "memory(GiB)": 46.82, "nll_loss": 0.3673415780067444, "rewards/accuracies": 0.9375, "rewards/chosen": 0.23885931074619293, "rewards/margins": 1.9427287578582764, "rewards/rejected": -1.7038694620132446, "step": 156, "train_speed(iter/s)": 0.005361 }, { "epoch": 0.4076598506978254, "grad_norm": 2.893603563308716, "learning_rate": 0.0001874144701986426, "logits/chosen": -0.7310610413551331, "logits/rejected": -0.7361200451850891, "logps/chosen": -6.76317024230957, "logps/rejected": -33.79893112182617, "loss": 0.4578598737716675, "memory(GiB)": 46.82, "nll_loss": 0.24759513139724731, "rewards/accuracies": 0.96875, "rewards/chosen": 0.255088746547699, "rewards/margins": 2.5995802879333496, "rewards/rejected": -2.344491720199585, "step": 157, "train_speed(iter/s)": 0.005359 }, { "epoch": 0.41025641025641024, "grad_norm": 2.6806418895721436, "learning_rate": 0.00018720494081438078, "logits/chosen": -0.7193287014961243, "logits/rejected": -0.7268579006195068, "logps/chosen": -6.555389404296875, "logps/rejected": -33.83311462402344, "loss": 0.5056754350662231, "memory(GiB)": 46.82, "nll_loss": 0.2390821874141693, "rewards/accuracies": 0.875, "rewards/chosen": 0.20247599482536316, "rewards/margins": 2.335620403289795, "rewards/rejected": -2.1331448554992676, "step": 158, "train_speed(iter/s)": 0.005359 }, { "epoch": 0.41285296981499514, "grad_norm": 6.877208232879639, "learning_rate": 0.0001869938007644024, "logits/chosen": -0.774702787399292, "logits/rejected": -0.7733670473098755, "logps/chosen": -12.015567779541016, "logps/rejected": -39.611549377441406, "loss": 0.8152862191200256, "memory(GiB)": 46.82, "nll_loss": 0.35584431886672974, "rewards/accuracies": 0.78125, "rewards/chosen": -0.06409724056720734, "rewards/margins": 2.519212007522583, "rewards/rejected": -2.5833089351654053, "step": 159, "train_speed(iter/s)": 0.005358 }, { "epoch": 0.41544952937358, "grad_norm": 4.4329938888549805, "learning_rate": 0.00018678105394844113, "logits/chosen": -0.705638587474823, "logits/rejected": -0.7075241208076477, "logps/chosen": -8.828238487243652, "logps/rejected": -34.07341766357422, "loss": 0.7131232023239136, "memory(GiB)": 46.82, "nll_loss": 0.38522323966026306, "rewards/accuracies": 0.875, "rewards/chosen": 0.08116397261619568, "rewards/margins": 2.2081894874572754, "rewards/rejected": -2.1270253658294678, "step": 160, "train_speed(iter/s)": 0.005358 }, { "epoch": 0.4180460889321649, "grad_norm": 3.8587117195129395, "learning_rate": 0.00018656670429590744, "logits/chosen": -0.7865703105926514, "logits/rejected": -0.7856872081756592, "logps/chosen": -7.486833572387695, "logps/rejected": -26.6343936920166, "loss": 0.6464986801147461, "memory(GiB)": 46.82, "nll_loss": 0.320234477519989, "rewards/accuracies": 0.8125, "rewards/chosen": 0.1649102419614792, "rewards/margins": 1.9207243919372559, "rewards/rejected": -1.7558141946792603, "step": 161, "train_speed(iter/s)": 0.005357 }, { "epoch": 0.4206426484907498, "grad_norm": 5.098015308380127, "learning_rate": 0.00018635075576581587, "logits/chosen": -0.815811276435852, "logits/rejected": -0.8179509043693542, "logps/chosen": -8.045232772827148, "logps/rejected": -26.606388092041016, "loss": 0.6883640289306641, "memory(GiB)": 46.82, "nll_loss": 0.3271428346633911, "rewards/accuracies": 0.875, "rewards/chosen": 0.21010762453079224, "rewards/margins": 1.64859139919281, "rewards/rejected": -1.438483715057373, "step": 162, "train_speed(iter/s)": 0.005356 }, { "epoch": 0.4232392080493346, "grad_norm": 5.79577112197876, "learning_rate": 0.0001861332123467122, "logits/chosen": -0.7825253009796143, "logits/rejected": -0.7867128252983093, "logps/chosen": -7.512404441833496, "logps/rejected": -33.15559387207031, "loss": 0.4946397542953491, "memory(GiB)": 46.82, "nll_loss": 0.26739412546157837, "rewards/accuracies": 0.96875, "rewards/chosen": 0.2013475000858307, "rewards/margins": 2.0465731620788574, "rewards/rejected": -1.84522545337677, "step": 163, "train_speed(iter/s)": 0.005357 }, { "epoch": 0.4258357676079195, "grad_norm": 3.521145820617676, "learning_rate": 0.0001859140780565996, "logits/chosen": -0.7922295331954956, "logits/rejected": -0.7915840148925781, "logps/chosen": -8.717174530029297, "logps/rejected": -24.929059982299805, "loss": 0.6819888949394226, "memory(GiB)": 46.82, "nll_loss": 0.4021107256412506, "rewards/accuracies": 0.90625, "rewards/chosen": 0.1168108582496643, "rewards/margins": 1.8219399452209473, "rewards/rejected": -1.7051292657852173, "step": 164, "train_speed(iter/s)": 0.005358 }, { "epoch": 0.42843232716650437, "grad_norm": 17.069190979003906, "learning_rate": 0.0001856933569428644, "logits/chosen": -0.7880842089653015, "logits/rejected": -0.7944654822349548, "logps/chosen": -10.384450912475586, "logps/rejected": -25.57999610900879, "loss": 1.0119094848632812, "memory(GiB)": 46.82, "nll_loss": 0.6152634024620056, "rewards/accuracies": 0.78125, "rewards/chosen": 0.14946657419204712, "rewards/margins": 1.2663317918777466, "rewards/rejected": -1.1168652772903442, "step": 165, "train_speed(iter/s)": 0.005357 }, { "epoch": 0.43102888672508927, "grad_norm": 3.2614221572875977, "learning_rate": 0.0001854710530822014, "logits/chosen": -0.7307618856430054, "logits/rejected": -0.7359931468963623, "logps/chosen": -6.218672752380371, "logps/rejected": -25.049577713012695, "loss": 0.6519892811775208, "memory(GiB)": 46.82, "nll_loss": 0.363025426864624, "rewards/accuracies": 0.96875, "rewards/chosen": 0.21699494123458862, "rewards/margins": 1.6366937160491943, "rewards/rejected": -1.4196988344192505, "step": 166, "train_speed(iter/s)": 0.005357 }, { "epoch": 0.4336254462836741, "grad_norm": 3.8368124961853027, "learning_rate": 0.00018524717058053866, "logits/chosen": -0.741214394569397, "logits/rejected": -0.7512940764427185, "logps/chosen": -6.5773725509643555, "logps/rejected": -29.348596572875977, "loss": 0.8446623682975769, "memory(GiB)": 46.82, "nll_loss": 0.5003358721733093, "rewards/accuracies": 0.90625, "rewards/chosen": 0.029447460547089577, "rewards/margins": 1.5836502313613892, "rewards/rejected": -1.554202914237976, "step": 167, "train_speed(iter/s)": 0.005357 }, { "epoch": 0.436222005842259, "grad_norm": 1.9537255764007568, "learning_rate": 0.00018502171357296144, "logits/chosen": -0.7404088377952576, "logits/rejected": -0.7386180758476257, "logps/chosen": -8.013400077819824, "logps/rejected": -28.649869918823242, "loss": 0.5149758458137512, "memory(GiB)": 46.82, "nll_loss": 0.32292458415031433, "rewards/accuracies": 1.0, "rewards/chosen": 0.2221800982952118, "rewards/margins": 1.952845811843872, "rewards/rejected": -1.730665683746338, "step": 168, "train_speed(iter/s)": 0.005358 }, { "epoch": 0.4388185654008439, "grad_norm": 3.6709702014923096, "learning_rate": 0.000184794686223636, "logits/chosen": -0.7925949096679688, "logits/rejected": -0.7922758460044861, "logps/chosen": -8.695777893066406, "logps/rejected": -24.725303649902344, "loss": 0.5783385634422302, "memory(GiB)": 46.82, "nll_loss": 0.30575335025787354, "rewards/accuracies": 0.90625, "rewards/chosen": 0.208786278963089, "rewards/margins": 1.6382977962493896, "rewards/rejected": -1.429511308670044, "step": 169, "train_speed(iter/s)": 0.005358 }, { "epoch": 0.44141512495942875, "grad_norm": 6.263500690460205, "learning_rate": 0.00018456609272573266, "logits/chosen": -0.7436801791191101, "logits/rejected": -0.7518426179885864, "logps/chosen": -5.066699981689453, "logps/rejected": -31.86433982849121, "loss": 0.5026156306266785, "memory(GiB)": 46.82, "nll_loss": 0.3272435665130615, "rewards/accuracies": 1.0, "rewards/chosen": 0.1566862165927887, "rewards/margins": 2.2096331119537354, "rewards/rejected": -2.0529470443725586, "step": 170, "train_speed(iter/s)": 0.005359 }, { "epoch": 0.44401168451801365, "grad_norm": 2.6846933364868164, "learning_rate": 0.00018433593730134831, "logits/chosen": -0.8177323937416077, "logits/rejected": -0.8159899711608887, "logps/chosen": -10.043192863464355, "logps/rejected": -36.874168395996094, "loss": 0.5169069766998291, "memory(GiB)": 46.82, "nll_loss": 0.280762255191803, "rewards/accuracies": 0.90625, "rewards/chosen": 0.15715357661247253, "rewards/margins": 2.441157341003418, "rewards/rejected": -2.284003973007202, "step": 171, "train_speed(iter/s)": 0.005358 }, { "epoch": 0.4466082440765985, "grad_norm": 3.354492664337158, "learning_rate": 0.0001841042242014285, "logits/chosen": -0.7943728566169739, "logits/rejected": -0.8022831082344055, "logps/chosen": -4.931389808654785, "logps/rejected": -46.30964279174805, "loss": 0.3581126630306244, "memory(GiB)": 46.82, "nll_loss": 0.17072941362857819, "rewards/accuracies": 0.90625, "rewards/chosen": 0.2874028980731964, "rewards/margins": 3.4458858966827393, "rewards/rejected": -3.1584832668304443, "step": 172, "train_speed(iter/s)": 0.005358 }, { "epoch": 0.4492048036351834, "grad_norm": 2.2436320781707764, "learning_rate": 0.00018387095770568877, "logits/chosen": -0.8137360215187073, "logits/rejected": -0.8178499937057495, "logps/chosen": -8.257625579833984, "logps/rejected": -41.017391204833984, "loss": 0.5087756514549255, "memory(GiB)": 46.82, "nll_loss": 0.34518077969551086, "rewards/accuracies": 0.9375, "rewards/chosen": 0.40273773670196533, "rewards/margins": 3.349743127822876, "rewards/rejected": -2.9470055103302, "step": 173, "train_speed(iter/s)": 0.005358 }, { "epoch": 0.45180136319376824, "grad_norm": 3.1421475410461426, "learning_rate": 0.00018363614212253584, "logits/chosen": -0.8107144236564636, "logits/rejected": -0.8169907331466675, "logps/chosen": -6.6368021965026855, "logps/rejected": -47.06969451904297, "loss": 0.4038211703300476, "memory(GiB)": 46.82, "nll_loss": 0.22018837928771973, "rewards/accuracies": 0.9375, "rewards/chosen": 0.21348311007022858, "rewards/margins": 3.67350697517395, "rewards/rejected": -3.4600236415863037, "step": 174, "train_speed(iter/s)": 0.005357 }, { "epoch": 0.45439792275235313, "grad_norm": 4.707547664642334, "learning_rate": 0.0001833997817889878, "logits/chosen": -0.7821629047393799, "logits/rejected": -0.7885245084762573, "logps/chosen": -6.257838249206543, "logps/rejected": -47.79384231567383, "loss": 0.43321770429611206, "memory(GiB)": 46.82, "nll_loss": 0.3060261607170105, "rewards/accuracies": 0.96875, "rewards/chosen": 0.2357151210308075, "rewards/margins": 3.7243151664733887, "rewards/rejected": -3.4885997772216797, "step": 175, "train_speed(iter/s)": 0.005359 }, { "epoch": 0.45699448231093803, "grad_norm": 6.834311008453369, "learning_rate": 0.00018316188107059419, "logits/chosen": -0.8164551854133606, "logits/rejected": -0.8227632641792297, "logps/chosen": -8.357691764831543, "logps/rejected": -53.20665740966797, "loss": 0.5088233351707458, "memory(GiB)": 46.82, "nll_loss": 0.34228751063346863, "rewards/accuracies": 0.96875, "rewards/chosen": 0.1479293704032898, "rewards/margins": 4.200577735900879, "rewards/rejected": -4.052648544311523, "step": 176, "train_speed(iter/s)": 0.005358 }, { "epoch": 0.4595910418695229, "grad_norm": 1.9933769702911377, "learning_rate": 0.00018292244436135516, "logits/chosen": -0.8226829767227173, "logits/rejected": -0.8278478384017944, "logps/chosen": -8.886636734008789, "logps/rejected": -43.808494567871094, "loss": 0.4773145914077759, "memory(GiB)": 46.82, "nll_loss": 0.2843259274959564, "rewards/accuracies": 0.90625, "rewards/chosen": 0.21271556615829468, "rewards/margins": 3.3535256385803223, "rewards/rejected": -3.140810489654541, "step": 177, "train_speed(iter/s)": 0.005359 }, { "epoch": 0.4621876014281078, "grad_norm": 2.1277883052825928, "learning_rate": 0.00018268147608364066, "logits/chosen": -0.8168373107910156, "logits/rejected": -0.8192884922027588, "logps/chosen": -10.113336563110352, "logps/rejected": -44.43722152709961, "loss": 0.47269877791404724, "memory(GiB)": 46.82, "nll_loss": 0.33138713240623474, "rewards/accuracies": 0.96875, "rewards/chosen": 0.20839698612689972, "rewards/margins": 3.481367349624634, "rewards/rejected": -3.272970199584961, "step": 178, "train_speed(iter/s)": 0.005358 }, { "epoch": 0.4647841609866926, "grad_norm": 3.652038335800171, "learning_rate": 0.00018243898068810835, "logits/chosen": -0.8304356932640076, "logits/rejected": -0.8354857563972473, "logps/chosen": -7.381147384643555, "logps/rejected": -37.62067794799805, "loss": 0.598408579826355, "memory(GiB)": 46.82, "nll_loss": 0.41189002990722656, "rewards/accuracies": 0.96875, "rewards/chosen": 0.20993797481060028, "rewards/margins": 2.9361226558685303, "rewards/rejected": -2.726184844970703, "step": 179, "train_speed(iter/s)": 0.005359 }, { "epoch": 0.4673807205452775, "grad_norm": 5.588886737823486, "learning_rate": 0.00018219496265362164, "logits/chosen": -0.7966144680976868, "logits/rejected": -0.7976107597351074, "logps/chosen": -5.64756441116333, "logps/rejected": -41.18315124511719, "loss": 0.4210509657859802, "memory(GiB)": 46.82, "nll_loss": 0.3009505271911621, "rewards/accuracies": 1.0, "rewards/chosen": 0.2384023666381836, "rewards/margins": 3.277693033218384, "rewards/rejected": -3.0392909049987793, "step": 180, "train_speed(iter/s)": 0.005358 }, { "epoch": 0.46997728010386236, "grad_norm": 3.0966458320617676, "learning_rate": 0.00018194942648716697, "logits/chosen": -0.8336725234985352, "logits/rejected": -0.8417295813560486, "logps/chosen": -6.757675647735596, "logps/rejected": -42.556461334228516, "loss": 0.46501806378364563, "memory(GiB)": 46.82, "nll_loss": 0.27556124329566956, "rewards/accuracies": 0.9375, "rewards/chosen": 0.1294286698102951, "rewards/margins": 3.264049530029297, "rewards/rejected": -3.1346213817596436, "step": 181, "train_speed(iter/s)": 0.00536 }, { "epoch": 0.47257383966244726, "grad_norm": 1.5267800092697144, "learning_rate": 0.00018170237672377043, "logits/chosen": -0.8151792883872986, "logits/rejected": -0.8204985857009888, "logps/chosen": -6.037264347076416, "logps/rejected": -40.91991424560547, "loss": 0.30481547117233276, "memory(GiB)": 46.82, "nll_loss": 0.22177544236183167, "rewards/accuracies": 1.0, "rewards/chosen": 0.28671082854270935, "rewards/margins": 3.2523105144500732, "rewards/rejected": -2.965599775314331, "step": 182, "train_speed(iter/s)": 0.00536 }, { "epoch": 0.47517039922103216, "grad_norm": 5.700167655944824, "learning_rate": 0.0001814538179264142, "logits/chosen": -0.8828625082969666, "logits/rejected": -0.8847114443778992, "logps/chosen": -11.471461296081543, "logps/rejected": -36.56057357788086, "loss": 0.9585452675819397, "memory(GiB)": 46.82, "nll_loss": 0.6207931041717529, "rewards/accuracies": 0.875, "rewards/chosen": 0.10233151167631149, "rewards/margins": 2.520526885986328, "rewards/rejected": -2.4181957244873047, "step": 183, "train_speed(iter/s)": 0.005361 }, { "epoch": 0.477766958779617, "grad_norm": 4.820940971374512, "learning_rate": 0.00018120375468595198, "logits/chosen": -0.8398681282997131, "logits/rejected": -0.843747615814209, "logps/chosen": -9.928145408630371, "logps/rejected": -35.531009674072266, "loss": 0.7689952254295349, "memory(GiB)": 46.82, "nll_loss": 0.5200174450874329, "rewards/accuracies": 0.9375, "rewards/chosen": 0.15448038280010223, "rewards/margins": 2.677025318145752, "rewards/rejected": -2.522545099258423, "step": 184, "train_speed(iter/s)": 0.00536 }, { "epoch": 0.4803635183382019, "grad_norm": 2.308289051055908, "learning_rate": 0.00018095219162102453, "logits/chosen": -0.8587791919708252, "logits/rejected": -0.8568933606147766, "logps/chosen": -6.138177394866943, "logps/rejected": -36.87736129760742, "loss": 0.5506963133811951, "memory(GiB)": 46.82, "nll_loss": 0.35889768600463867, "rewards/accuracies": 0.96875, "rewards/chosen": 0.09419973194599152, "rewards/margins": 2.7206168174743652, "rewards/rejected": -2.6264166831970215, "step": 185, "train_speed(iter/s)": 0.00536 }, { "epoch": 0.48296007789678674, "grad_norm": 3.0462734699249268, "learning_rate": 0.00018069913337797412, "logits/chosen": -0.82170170545578, "logits/rejected": -0.8261471390724182, "logps/chosen": -9.066842079162598, "logps/rejected": -47.4820671081543, "loss": 0.6803156137466431, "memory(GiB)": 46.82, "nll_loss": 0.46885693073272705, "rewards/accuracies": 0.90625, "rewards/chosen": 0.17911966145038605, "rewards/margins": 3.736632823944092, "rewards/rejected": -3.5575132369995117, "step": 186, "train_speed(iter/s)": 0.00536 }, { "epoch": 0.48555663745537164, "grad_norm": 12.903093338012695, "learning_rate": 0.0001804445846307588, "logits/chosen": -0.8383846879005432, "logits/rejected": -0.8428988456726074, "logps/chosen": -13.801538467407227, "logps/rejected": -41.331783294677734, "loss": 1.4305500984191895, "memory(GiB)": 46.82, "nll_loss": 1.0338698625564575, "rewards/accuracies": 0.84375, "rewards/chosen": -0.2808900773525238, "rewards/margins": 2.8232994079589844, "rewards/rejected": -3.104188919067383, "step": 187, "train_speed(iter/s)": 0.005359 }, { "epoch": 0.4881531970139565, "grad_norm": 1.0728437900543213, "learning_rate": 0.0001801885500808661, "logits/chosen": -0.7999005317687988, "logits/rejected": -0.8075475096702576, "logps/chosen": -6.161966323852539, "logps/rejected": -52.183937072753906, "loss": 0.32457199692726135, "memory(GiB)": 46.82, "nll_loss": 0.26306816935539246, "rewards/accuracies": 1.0, "rewards/chosen": 0.30446696281433105, "rewards/margins": 4.325974464416504, "rewards/rejected": -4.0215067863464355, "step": 188, "train_speed(iter/s)": 0.005359 }, { "epoch": 0.4907497565725414, "grad_norm": 2.3573195934295654, "learning_rate": 0.00017993103445722614, "logits/chosen": -0.8147333860397339, "logits/rejected": -0.8255075216293335, "logps/chosen": -5.808372497558594, "logps/rejected": -48.91783142089844, "loss": 0.39948803186416626, "memory(GiB)": 46.82, "nll_loss": 0.22272005677223206, "rewards/accuracies": 0.96875, "rewards/chosen": 0.18873995542526245, "rewards/margins": 3.7226080894470215, "rewards/rejected": -3.533867835998535, "step": 189, "train_speed(iter/s)": 0.005359 }, { "epoch": 0.4933463161311263, "grad_norm": 2.2260046005249023, "learning_rate": 0.00017967204251612433, "logits/chosen": -0.7621344923973083, "logits/rejected": -0.7712112069129944, "logps/chosen": -5.210122108459473, "logps/rejected": -57.8108024597168, "loss": 0.4442843496799469, "memory(GiB)": 46.82, "nll_loss": 0.2754063904285431, "rewards/accuracies": 0.96875, "rewards/chosen": 0.19802872836589813, "rewards/margins": 4.561690807342529, "rewards/rejected": -4.363662242889404, "step": 190, "train_speed(iter/s)": 0.005359 }, { "epoch": 0.4959428756897111, "grad_norm": 5.498357772827148, "learning_rate": 0.00017941157904111346, "logits/chosen": -0.7840267419815063, "logits/rejected": -0.7963895797729492, "logps/chosen": -6.320296764373779, "logps/rejected": -63.66170120239258, "loss": 0.4151027798652649, "memory(GiB)": 46.82, "nll_loss": 0.2456730306148529, "rewards/accuracies": 0.875, "rewards/chosen": 0.1802489459514618, "rewards/margins": 5.30258846282959, "rewards/rejected": -5.122340202331543, "step": 191, "train_speed(iter/s)": 0.005358 }, { "epoch": 0.498539435248296, "grad_norm": 2.877337694168091, "learning_rate": 0.00017914964884292544, "logits/chosen": -0.8350490927696228, "logits/rejected": -0.8606675863265991, "logps/chosen": -8.253477096557617, "logps/rejected": -83.04051971435547, "loss": 0.4113784730434418, "memory(GiB)": 46.82, "nll_loss": 0.2746655344963074, "rewards/accuracies": 0.9375, "rewards/chosen": 0.2550317049026489, "rewards/margins": 6.853097438812256, "rewards/rejected": -6.598065376281738, "step": 192, "train_speed(iter/s)": 0.005359 }, { "epoch": 0.5011359948068809, "grad_norm": 9.82312297821045, "learning_rate": 0.00017888625675938235, "logits/chosen": -0.8031945824623108, "logits/rejected": -0.814129650592804, "logps/chosen": -7.723809719085693, "logps/rejected": -71.692626953125, "loss": 0.5333746671676636, "memory(GiB)": 46.82, "nll_loss": 0.2982180714607239, "rewards/accuracies": 0.90625, "rewards/chosen": -0.03098137304186821, "rewards/margins": 5.821050643920898, "rewards/rejected": -5.85203218460083, "step": 193, "train_speed(iter/s)": 0.005359 }, { "epoch": 0.5037325543654657, "grad_norm": 1.5864787101745605, "learning_rate": 0.00017862140765530717, "logits/chosen": -0.7884975671768188, "logits/rejected": -0.8070309162139893, "logps/chosen": -6.657387733459473, "logps/rejected": -88.2061538696289, "loss": 0.3408563733100891, "memory(GiB)": 46.82, "nll_loss": 0.23068124055862427, "rewards/accuracies": 1.0, "rewards/chosen": 0.25283610820770264, "rewards/margins": 7.557528972625732, "rewards/rejected": -7.304693222045898, "step": 194, "train_speed(iter/s)": 0.005359 }, { "epoch": 0.5063291139240507, "grad_norm": 2.8981215953826904, "learning_rate": 0.0001783551064224339, "logits/chosen": -0.8138140439987183, "logits/rejected": -0.8286132216453552, "logps/chosen": -5.021820545196533, "logps/rejected": -76.1704330444336, "loss": 0.43742382526397705, "memory(GiB)": 46.82, "nll_loss": 0.2779857814311981, "rewards/accuracies": 0.9375, "rewards/chosen": 0.15874776244163513, "rewards/margins": 6.478954792022705, "rewards/rejected": -6.320207118988037, "step": 195, "train_speed(iter/s)": 0.00536 }, { "epoch": 0.5089256734826355, "grad_norm": 3.9564876556396484, "learning_rate": 0.00017808735797931715, "logits/chosen": -0.8671743869781494, "logits/rejected": -0.8750807046890259, "logps/chosen": -7.3802947998046875, "logps/rejected": -63.22589874267578, "loss": 0.5510232448577881, "memory(GiB)": 46.82, "nll_loss": 0.3880046606063843, "rewards/accuracies": 0.9375, "rewards/chosen": 0.3043110966682434, "rewards/margins": 5.6318769454956055, "rewards/rejected": -5.327565670013428, "step": 196, "train_speed(iter/s)": 0.005359 }, { "epoch": 0.5115222330412204, "grad_norm": 7.476530075073242, "learning_rate": 0.0001778181672712414, "logits/chosen": -0.8401522636413574, "logits/rejected": -0.8446535468101501, "logps/chosen": -10.472354888916016, "logps/rejected": -55.56855010986328, "loss": 0.5609198212623596, "memory(GiB)": 46.82, "nll_loss": 0.4021284878253937, "rewards/accuracies": 0.90625, "rewards/chosen": 0.33400610089302063, "rewards/margins": 4.6901750564575195, "rewards/rejected": -4.356168746948242, "step": 197, "train_speed(iter/s)": 0.005359 }, { "epoch": 0.5141187925998053, "grad_norm": 1.5591124296188354, "learning_rate": 0.00017754753927012954, "logits/chosen": -0.881521463394165, "logits/rejected": -0.8908553123474121, "logps/chosen": -7.769586086273193, "logps/rejected": -70.43656158447266, "loss": 0.40073180198669434, "memory(GiB)": 46.82, "nll_loss": 0.2971632182598114, "rewards/accuracies": 1.0, "rewards/chosen": 0.23546172678470612, "rewards/margins": 6.18820858001709, "rewards/rejected": -5.952746868133545, "step": 198, "train_speed(iter/s)": 0.005358 }, { "epoch": 0.5167153521583902, "grad_norm": 3.914903163909912, "learning_rate": 0.00017727547897445118, "logits/chosen": -0.8886235952377319, "logits/rejected": -0.8989691138267517, "logps/chosen": -4.683451175689697, "logps/rejected": -60.072357177734375, "loss": 0.3925155997276306, "memory(GiB)": 46.82, "nll_loss": 0.2971319854259491, "rewards/accuracies": 1.0, "rewards/chosen": 0.33483725786209106, "rewards/margins": 5.336654186248779, "rewards/rejected": -5.001816749572754, "step": 199, "train_speed(iter/s)": 0.005358 }, { "epoch": 0.519311911716975, "grad_norm": 10.00102424621582, "learning_rate": 0.00017700199140913017, "logits/chosen": -0.9024062752723694, "logits/rejected": -0.8995949029922485, "logps/chosen": -13.132458686828613, "logps/rejected": -58.003902435302734, "loss": 0.9102693200111389, "memory(GiB)": 46.82, "nll_loss": 0.6192734241485596, "rewards/accuracies": 0.90625, "rewards/chosen": -0.10886114090681076, "rewards/margins": 4.763448238372803, "rewards/rejected": -4.872309684753418, "step": 200, "train_speed(iter/s)": 0.005358 }, { "epoch": 0.5219084712755598, "grad_norm": 12.833686828613281, "learning_rate": 0.000176727081625452, "logits/chosen": -0.8882104158401489, "logits/rejected": -0.9030141830444336, "logps/chosen": -7.329769134521484, "logps/rejected": -84.83427429199219, "loss": 0.6302378177642822, "memory(GiB)": 46.82, "nll_loss": 0.4732781648635864, "rewards/accuracies": 0.9375, "rewards/chosen": 0.08130178600549698, "rewards/margins": 7.068781852722168, "rewards/rejected": -6.987480640411377, "step": 201, "train_speed(iter/s)": 0.005355 }, { "epoch": 0.5245050308341448, "grad_norm": 27.52665138244629, "learning_rate": 0.00017645075470097024, "logits/chosen": -0.9375100135803223, "logits/rejected": -0.9529730677604675, "logps/chosen": -6.13963508605957, "logps/rejected": -66.99122619628906, "loss": 0.5372448563575745, "memory(GiB)": 46.82, "nll_loss": 0.37428009510040283, "rewards/accuracies": 0.9375, "rewards/chosen": 0.11455152183771133, "rewards/margins": 5.315877914428711, "rewards/rejected": -5.2013258934021, "step": 202, "train_speed(iter/s)": 0.005356 }, { "epoch": 0.5271015903927296, "grad_norm": 2.7620508670806885, "learning_rate": 0.00017617301573941296, "logits/chosen": -0.8983043432235718, "logits/rejected": -0.8981289863586426, "logps/chosen": -11.069366455078125, "logps/rejected": -39.12937927246094, "loss": 0.6441234350204468, "memory(GiB)": 46.82, "nll_loss": 0.4368978440761566, "rewards/accuracies": 0.90625, "rewards/chosen": 0.21257682144641876, "rewards/margins": 3.110691785812378, "rewards/rejected": -2.8981149196624756, "step": 203, "train_speed(iter/s)": 0.005355 }, { "epoch": 0.5296981499513145, "grad_norm": 12.48902702331543, "learning_rate": 0.0001758938698705884, "logits/chosen": -0.8725972771644592, "logits/rejected": -0.8844687342643738, "logps/chosen": -8.939924240112305, "logps/rejected": -76.01535034179688, "loss": 0.7113180756568909, "memory(GiB)": 46.82, "nll_loss": 0.39448532462120056, "rewards/accuracies": 0.90625, "rewards/chosen": 0.13535423576831818, "rewards/margins": 6.58955192565918, "rewards/rejected": -6.454197883605957, "step": 204, "train_speed(iter/s)": 0.005355 }, { "epoch": 0.5322947095098994, "grad_norm": 5.789051055908203, "learning_rate": 0.0001756133222502902, "logits/chosen": -0.835827648639679, "logits/rejected": -0.848646342754364, "logps/chosen": -10.195419311523438, "logps/rejected": -72.34866333007812, "loss": 0.46852654218673706, "memory(GiB)": 46.82, "nll_loss": 0.31231871247291565, "rewards/accuracies": 0.90625, "rewards/chosen": -0.03889274597167969, "rewards/margins": 5.886906147003174, "rewards/rejected": -5.925798416137695, "step": 205, "train_speed(iter/s)": 0.005355 }, { "epoch": 0.5348912690684843, "grad_norm": 11.01954174041748, "learning_rate": 0.00017533137806020226, "logits/chosen": -0.8194984197616577, "logits/rejected": -0.8232303261756897, "logps/chosen": -8.20671272277832, "logps/rejected": -57.72869873046875, "loss": 0.5476050972938538, "memory(GiB)": 46.82, "nll_loss": 0.3084986209869385, "rewards/accuracies": 0.90625, "rewards/chosen": 0.09075944125652313, "rewards/margins": 4.59151554107666, "rewards/rejected": -4.50075626373291, "step": 206, "train_speed(iter/s)": 0.005355 }, { "epoch": 0.5374878286270691, "grad_norm": 4.141697406768799, "learning_rate": 0.0001750480425078029, "logits/chosen": -0.7913045287132263, "logits/rejected": -0.7959045171737671, "logps/chosen": -8.45845890045166, "logps/rejected": -47.05601501464844, "loss": 0.44736987352371216, "memory(GiB)": 46.82, "nll_loss": 0.28352388739585876, "rewards/accuracies": 0.90625, "rewards/chosen": 0.23959283530712128, "rewards/margins": 3.8303611278533936, "rewards/rejected": -3.5907678604125977, "step": 207, "train_speed(iter/s)": 0.005354 }, { "epoch": 0.540084388185654, "grad_norm": 3.359447717666626, "learning_rate": 0.00017476332082626877, "logits/chosen": -0.7912741899490356, "logits/rejected": -0.796455979347229, "logps/chosen": -5.394259452819824, "logps/rejected": -45.25196075439453, "loss": 0.36434927582740784, "memory(GiB)": 46.82, "nll_loss": 0.24980391561985016, "rewards/accuracies": 0.96875, "rewards/chosen": 0.2328459620475769, "rewards/margins": 3.577873945236206, "rewards/rejected": -3.3450279235839844, "step": 208, "train_speed(iter/s)": 0.005354 }, { "epoch": 0.5426809477442389, "grad_norm": 3.0909605026245117, "learning_rate": 0.0001744772182743782, "logits/chosen": -0.7767283916473389, "logits/rejected": -0.7861429452896118, "logps/chosen": -6.036921501159668, "logps/rejected": -43.4775390625, "loss": 0.42594030499458313, "memory(GiB)": 46.82, "nll_loss": 0.2773384153842926, "rewards/accuracies": 0.9375, "rewards/chosen": 0.3111240863800049, "rewards/margins": 3.5763254165649414, "rewards/rejected": -3.2652013301849365, "step": 209, "train_speed(iter/s)": 0.005354 }, { "epoch": 0.5452775073028238, "grad_norm": 2.5949363708496094, "learning_rate": 0.000174189740136414, "logits/chosen": -0.7519343495368958, "logits/rejected": -0.758810818195343, "logps/chosen": -6.644616603851318, "logps/rejected": -38.87832260131836, "loss": 0.4237949848175049, "memory(GiB)": 46.82, "nll_loss": 0.26098260283470154, "rewards/accuracies": 0.9375, "rewards/chosen": 0.27363157272338867, "rewards/margins": 3.0662317276000977, "rewards/rejected": -2.792600393295288, "step": 210, "train_speed(iter/s)": 0.005354 }, { "epoch": 0.5478740668614086, "grad_norm": 1.992567777633667, "learning_rate": 0.00017390089172206592, "logits/chosen": -0.7961949706077576, "logits/rejected": -0.7975110411643982, "logps/chosen": -5.077378749847412, "logps/rejected": -37.03203201293945, "loss": 0.37955719232559204, "memory(GiB)": 46.82, "nll_loss": 0.23032808303833008, "rewards/accuracies": 0.9375, "rewards/chosen": 0.16159504652023315, "rewards/margins": 2.815537929534912, "rewards/rejected": -2.653942584991455, "step": 211, "train_speed(iter/s)": 0.005354 }, { "epoch": 0.5504706264199936, "grad_norm": 1.784830093383789, "learning_rate": 0.0001736106783663326, "logits/chosen": -0.7778050899505615, "logits/rejected": -0.7829293012619019, "logps/chosen": -6.269719123840332, "logps/rejected": -39.09969711303711, "loss": 0.6080423593521118, "memory(GiB)": 46.82, "nll_loss": 0.3602517247200012, "rewards/accuracies": 0.9375, "rewards/chosen": 0.16860854625701904, "rewards/margins": 2.596688747406006, "rewards/rejected": -2.4280805587768555, "step": 212, "train_speed(iter/s)": 0.005354 }, { "epoch": 0.5530671859785784, "grad_norm": 3.7514870166778564, "learning_rate": 0.000173319105429423, "logits/chosen": -0.7780061364173889, "logits/rejected": -0.7814825773239136, "logps/chosen": -9.701554298400879, "logps/rejected": -42.14776611328125, "loss": 0.5809894800186157, "memory(GiB)": 46.82, "nll_loss": 0.4458245038986206, "rewards/accuracies": 0.96875, "rewards/chosen": 0.22117674350738525, "rewards/margins": 3.311382532119751, "rewards/rejected": -3.090205669403076, "step": 213, "train_speed(iter/s)": 0.005354 }, { "epoch": 0.5556637455371632, "grad_norm": 1.574320912361145, "learning_rate": 0.00017302617829665723, "logits/chosen": -0.7605854272842407, "logits/rejected": -0.7681394219398499, "logps/chosen": -7.890401840209961, "logps/rejected": -43.07416534423828, "loss": 0.46951717138290405, "memory(GiB)": 46.82, "nll_loss": 0.3557964861392975, "rewards/accuracies": 1.0, "rewards/chosen": 0.2927654981613159, "rewards/margins": 3.377017021179199, "rewards/rejected": -3.084251880645752, "step": 214, "train_speed(iter/s)": 0.005355 }, { "epoch": 0.5582603050957481, "grad_norm": 3.259098529815674, "learning_rate": 0.00017273190237836756, "logits/chosen": -0.8040423393249512, "logits/rejected": -0.812609076499939, "logps/chosen": -8.544995307922363, "logps/rejected": -43.30592346191406, "loss": 0.39441177248954773, "memory(GiB)": 46.82, "nll_loss": 0.3016667366027832, "rewards/accuracies": 1.0, "rewards/chosen": 0.24430298805236816, "rewards/margins": 3.4823904037475586, "rewards/rejected": -3.2380871772766113, "step": 215, "train_speed(iter/s)": 0.005354 }, { "epoch": 0.560856864654333, "grad_norm": 10.052566528320312, "learning_rate": 0.0001724362831097979, "logits/chosen": -0.8765899538993835, "logits/rejected": -0.8773387670516968, "logps/chosen": -9.490972518920898, "logps/rejected": -41.05526351928711, "loss": 0.8065330982208252, "memory(GiB)": 46.82, "nll_loss": 0.5094266533851624, "rewards/accuracies": 0.90625, "rewards/chosen": 0.13303275406360626, "rewards/margins": 3.132627010345459, "rewards/rejected": -2.999594211578369, "step": 216, "train_speed(iter/s)": 0.005356 }, { "epoch": 0.5634534242129179, "grad_norm": 2.0193867683410645, "learning_rate": 0.00017213932595100384, "logits/chosen": -0.839668869972229, "logits/rejected": -0.8433064222335815, "logps/chosen": -8.96350383758545, "logps/rejected": -43.15342330932617, "loss": 0.5949581861495972, "memory(GiB)": 46.82, "nll_loss": 0.4349959194660187, "rewards/accuracies": 0.9375, "rewards/chosen": 0.156009703874588, "rewards/margins": 3.079315662384033, "rewards/rejected": -2.9233059883117676, "step": 217, "train_speed(iter/s)": 0.005355 }, { "epoch": 0.5660499837715027, "grad_norm": 7.255380153656006, "learning_rate": 0.00017184103638675157, "logits/chosen": -0.8508449792861938, "logits/rejected": -0.8561905026435852, "logps/chosen": -13.53388786315918, "logps/rejected": -47.0406608581543, "loss": 0.739139974117279, "memory(GiB)": 46.82, "nll_loss": 0.4106239676475525, "rewards/accuracies": 0.90625, "rewards/chosen": -0.030060507357120514, "rewards/margins": 3.0796077251434326, "rewards/rejected": -3.109668254852295, "step": 218, "train_speed(iter/s)": 0.005355 }, { "epoch": 0.5686465433300877, "grad_norm": 2.1521670818328857, "learning_rate": 0.0001715414199264168, "logits/chosen": -0.8377723693847656, "logits/rejected": -0.8416836857795715, "logps/chosen": -11.449177742004395, "logps/rejected": -51.93082046508789, "loss": 0.5678492784500122, "memory(GiB)": 46.82, "nll_loss": 0.4639051854610443, "rewards/accuracies": 0.90625, "rewards/chosen": 0.4290061891078949, "rewards/margins": 4.352783203125, "rewards/rejected": -3.923776865005493, "step": 219, "train_speed(iter/s)": 0.005356 }, { "epoch": 0.5712431028886725, "grad_norm": 5.820508003234863, "learning_rate": 0.00017124048210388266, "logits/chosen": -0.8189604878425598, "logits/rejected": -0.8287642002105713, "logps/chosen": -7.280913352966309, "logps/rejected": -58.91409683227539, "loss": 0.3058544397354126, "memory(GiB)": 46.82, "nll_loss": 0.19983381032943726, "rewards/accuracies": 0.96875, "rewards/chosen": 0.12054422497749329, "rewards/margins": 4.547727108001709, "rewards/rejected": -4.427183628082275, "step": 220, "train_speed(iter/s)": 0.005355 }, { "epoch": 0.5738396624472574, "grad_norm": 1.530921220779419, "learning_rate": 0.0001709382284774379, "logits/chosen": -0.8419314622879028, "logits/rejected": -0.8482197523117065, "logps/chosen": -10.496171951293945, "logps/rejected": -49.721099853515625, "loss": 0.4132998585700989, "memory(GiB)": 46.82, "nll_loss": 0.3439655900001526, "rewards/accuracies": 1.0, "rewards/chosen": 0.18015247583389282, "rewards/margins": 3.97615122795105, "rewards/rejected": -3.7959985733032227, "step": 221, "train_speed(iter/s)": 0.005356 }, { "epoch": 0.5764362220058422, "grad_norm": 1.9025592803955078, "learning_rate": 0.00017063466462967388, "logits/chosen": -0.8564705848693848, "logits/rejected": -0.8616027235984802, "logps/chosen": -7.931392669677734, "logps/rejected": -49.22194290161133, "loss": 0.610306978225708, "memory(GiB)": 46.82, "nll_loss": 0.4569806456565857, "rewards/accuracies": 0.96875, "rewards/chosen": 0.22110262513160706, "rewards/margins": 4.034682750701904, "rewards/rejected": -3.81358003616333, "step": 222, "train_speed(iter/s)": 0.005356 }, { "epoch": 0.5790327815644272, "grad_norm": 3.6240224838256836, "learning_rate": 0.00017032979616738169, "logits/chosen": -0.8264967203140259, "logits/rejected": -0.8325719833374023, "logps/chosen": -6.653590202331543, "logps/rejected": -59.540992736816406, "loss": 0.49167004227638245, "memory(GiB)": 46.82, "nll_loss": 0.402230829000473, "rewards/accuracies": 1.0, "rewards/chosen": 0.1619190275669098, "rewards/margins": 4.9636969566345215, "rewards/rejected": -4.8017778396606445, "step": 223, "train_speed(iter/s)": 0.005356 }, { "epoch": 0.581629341123012, "grad_norm": 26.20123291015625, "learning_rate": 0.00017002362872144843, "logits/chosen": -0.84416663646698, "logits/rejected": -0.8446400761604309, "logps/chosen": -7.779309272766113, "logps/rejected": -48.635101318359375, "loss": 0.4477548599243164, "memory(GiB)": 46.82, "nll_loss": 0.31716760993003845, "rewards/accuracies": 0.96875, "rewards/chosen": 0.12198957055807114, "rewards/margins": 3.744682788848877, "rewards/rejected": -3.622692823410034, "step": 224, "train_speed(iter/s)": 0.005356 }, { "epoch": 0.5842259006815969, "grad_norm": 3.45158052444458, "learning_rate": 0.0001697161679467534, "logits/chosen": -0.8399550914764404, "logits/rejected": -0.8448391556739807, "logps/chosen": -8.095958709716797, "logps/rejected": -57.113128662109375, "loss": 0.4480040967464447, "memory(GiB)": 46.82, "nll_loss": 0.3591548800468445, "rewards/accuracies": 0.96875, "rewards/chosen": 0.097431480884552, "rewards/margins": 4.470404624938965, "rewards/rejected": -4.372973442077637, "step": 225, "train_speed(iter/s)": 0.005356 }, { "epoch": 0.5868224602401818, "grad_norm": 9.01218318939209, "learning_rate": 0.0001694074195220634, "logits/chosen": -0.8154175281524658, "logits/rejected": -0.8212026357650757, "logps/chosen": -9.016716957092285, "logps/rejected": -48.810791015625, "loss": 0.6711245179176331, "memory(GiB)": 46.82, "nll_loss": 0.4295364022254944, "rewards/accuracies": 0.9375, "rewards/chosen": 0.1990734040737152, "rewards/margins": 3.8862059116363525, "rewards/rejected": -3.6871328353881836, "step": 226, "train_speed(iter/s)": 0.005356 }, { "epoch": 0.5894190197987667, "grad_norm": 5.020142078399658, "learning_rate": 0.00016909738914992813, "logits/chosen": -0.7923344969749451, "logits/rejected": -0.7923219203948975, "logps/chosen": -10.089529037475586, "logps/rejected": -45.86975860595703, "loss": 0.6674864888191223, "memory(GiB)": 46.82, "nll_loss": 0.47657352685928345, "rewards/accuracies": 0.90625, "rewards/chosen": 0.04541245102882385, "rewards/margins": 3.1376214027404785, "rewards/rejected": -3.0922091007232666, "step": 227, "train_speed(iter/s)": 0.005356 }, { "epoch": 0.5920155793573515, "grad_norm": 3.975611925125122, "learning_rate": 0.00016878608255657457, "logits/chosen": -0.7756553292274475, "logits/rejected": -0.7805052399635315, "logps/chosen": -6.576499938964844, "logps/rejected": -48.288204193115234, "loss": 0.36480942368507385, "memory(GiB)": 46.82, "nll_loss": 0.24316585063934326, "rewards/accuracies": 0.96875, "rewards/chosen": 0.21090297400951385, "rewards/margins": 3.6886119842529297, "rewards/rejected": -3.4777092933654785, "step": 228, "train_speed(iter/s)": 0.005356 }, { "epoch": 0.5946121389159363, "grad_norm": 3.324848175048828, "learning_rate": 0.00016847350549180148, "logits/chosen": -0.7683195471763611, "logits/rejected": -0.7729092836380005, "logps/chosen": -5.581432819366455, "logps/rejected": -42.25553894042969, "loss": 0.5814209580421448, "memory(GiB)": 46.82, "nll_loss": 0.33762359619140625, "rewards/accuracies": 0.875, "rewards/chosen": 0.08220689743757248, "rewards/margins": 3.051085948944092, "rewards/rejected": -2.968878984451294, "step": 229, "train_speed(iter/s)": 0.005357 }, { "epoch": 0.5972086984745213, "grad_norm": 1.8596134185791016, "learning_rate": 0.00016815966372887305, "logits/chosen": -0.7532698512077332, "logits/rejected": -0.7569671273231506, "logps/chosen": -6.81831169128418, "logps/rejected": -32.88819885253906, "loss": 0.4662015438079834, "memory(GiB)": 46.82, "nll_loss": 0.31704533100128174, "rewards/accuracies": 1.0, "rewards/chosen": 0.3468167185783386, "rewards/margins": 2.541092872619629, "rewards/rejected": -2.1942760944366455, "step": 230, "train_speed(iter/s)": 0.005357 }, { "epoch": 0.5998052580331061, "grad_norm": 9.191289901733398, "learning_rate": 0.00016784456306441234, "logits/chosen": -0.7527615427970886, "logits/rejected": -0.7603521347045898, "logps/chosen": -8.545462608337402, "logps/rejected": -34.113487243652344, "loss": 0.6046890020370483, "memory(GiB)": 46.82, "nll_loss": 0.35081756114959717, "rewards/accuracies": 0.96875, "rewards/chosen": 0.12367656826972961, "rewards/margins": 2.2450129985809326, "rewards/rejected": -2.1213364601135254, "step": 231, "train_speed(iter/s)": 0.005358 }, { "epoch": 0.602401817591691, "grad_norm": 2.0885210037231445, "learning_rate": 0.0001675282093182941, "logits/chosen": -0.7435917854309082, "logits/rejected": -0.7469019889831543, "logps/chosen": -9.624258041381836, "logps/rejected": -38.40724563598633, "loss": 0.6471220850944519, "memory(GiB)": 46.82, "nll_loss": 0.44592684507369995, "rewards/accuracies": 0.9375, "rewards/chosen": 0.2652357518672943, "rewards/margins": 2.823615312576294, "rewards/rejected": -2.558379650115967, "step": 232, "train_speed(iter/s)": 0.005357 }, { "epoch": 0.6049983771502759, "grad_norm": 4.651163101196289, "learning_rate": 0.0001672106083335374, "logits/chosen": -0.7706339955329895, "logits/rejected": -0.7752231955528259, "logps/chosen": -9.609830856323242, "logps/rejected": -36.36707305908203, "loss": 0.7082432508468628, "memory(GiB)": 46.82, "nll_loss": 0.4555765986442566, "rewards/accuracies": 0.9375, "rewards/chosen": 0.22910386323928833, "rewards/margins": 2.703925609588623, "rewards/rejected": -2.4748215675354004, "step": 233, "train_speed(iter/s)": 0.005358 }, { "epoch": 0.6075949367088608, "grad_norm": 12.39693832397461, "learning_rate": 0.00016689176597619774, "logits/chosen": -0.7196263074874878, "logits/rejected": -0.7302131652832031, "logps/chosen": -7.361204624176025, "logps/rejected": -40.15000534057617, "loss": 0.7524147033691406, "memory(GiB)": 46.82, "nll_loss": 0.5045353770256042, "rewards/accuracies": 0.90625, "rewards/chosen": 0.14129626750946045, "rewards/margins": 2.2885243892669678, "rewards/rejected": -2.1472277641296387, "step": 234, "train_speed(iter/s)": 0.005358 }, { "epoch": 0.6101914962674456, "grad_norm": 6.736759185791016, "learning_rate": 0.00016657168813525853, "logits/chosen": -0.7526311278343201, "logits/rejected": -0.752763032913208, "logps/chosen": -7.331406116485596, "logps/rejected": -32.31086730957031, "loss": 0.754887580871582, "memory(GiB)": 46.82, "nll_loss": 0.48174968361854553, "rewards/accuracies": 0.875, "rewards/chosen": 0.0755733847618103, "rewards/margins": 2.1878206729888916, "rewards/rejected": -2.1122474670410156, "step": 235, "train_speed(iter/s)": 0.005359 }, { "epoch": 0.6127880558260305, "grad_norm": 2.6155624389648438, "learning_rate": 0.0001662503807225225, "logits/chosen": -0.7355427742004395, "logits/rejected": -0.7384796738624573, "logps/chosen": -8.030364036560059, "logps/rejected": -31.442228317260742, "loss": 0.5243774652481079, "memory(GiB)": 46.82, "nll_loss": 0.3355557322502136, "rewards/accuracies": 0.9375, "rewards/chosen": 0.19963966310024261, "rewards/margins": 2.296480655670166, "rewards/rejected": -2.096841335296631, "step": 236, "train_speed(iter/s)": 0.00536 }, { "epoch": 0.6153846153846154, "grad_norm": 18.65455436706543, "learning_rate": 0.0001659278496725024, "logits/chosen": -0.7295012474060059, "logits/rejected": -0.7436960935592651, "logps/chosen": -2.705686569213867, "logps/rejected": -41.4896354675293, "loss": 0.34673982858657837, "memory(GiB)": 46.82, "nll_loss": 0.17969390749931335, "rewards/accuracies": 0.96875, "rewards/chosen": 0.24503067135810852, "rewards/margins": 3.1294853687286377, "rewards/rejected": -2.8844549655914307, "step": 237, "train_speed(iter/s)": 0.00536 }, { "epoch": 0.6179811749432003, "grad_norm": 7.085238456726074, "learning_rate": 0.00016560410094231144, "logits/chosen": -0.7452048063278198, "logits/rejected": -0.7516958713531494, "logps/chosen": -7.530111789703369, "logps/rejected": -34.36936569213867, "loss": 0.6021293997764587, "memory(GiB)": 46.82, "nll_loss": 0.3124768137931824, "rewards/accuracies": 0.90625, "rewards/chosen": 0.21694707870483398, "rewards/margins": 2.285515785217285, "rewards/rejected": -2.068568706512451, "step": 238, "train_speed(iter/s)": 0.005361 }, { "epoch": 0.6205777345017851, "grad_norm": 4.304277420043945, "learning_rate": 0.00016527914051155327, "logits/chosen": -0.7648165822029114, "logits/rejected": -0.7681047320365906, "logps/chosen": -10.339492797851562, "logps/rejected": -35.120906829833984, "loss": 0.6538665890693665, "memory(GiB)": 46.82, "nll_loss": 0.35871338844299316, "rewards/accuracies": 0.90625, "rewards/chosen": 0.31186383962631226, "rewards/margins": 2.426875591278076, "rewards/rejected": -2.11501145362854, "step": 239, "train_speed(iter/s)": 0.005361 }, { "epoch": 0.6231742940603701, "grad_norm": 2.158324718475342, "learning_rate": 0.00016495297438221145, "logits/chosen": -0.8034281730651855, "logits/rejected": -0.807834267616272, "logps/chosen": -5.897243976593018, "logps/rejected": -28.772375106811523, "loss": 0.49097374081611633, "memory(GiB)": 46.82, "nll_loss": 0.2912865877151489, "rewards/accuracies": 0.96875, "rewards/chosen": 0.41394859552383423, "rewards/margins": 2.25996994972229, "rewards/rejected": -1.8460214138031006, "step": 240, "train_speed(iter/s)": 0.005361 }, { "epoch": 0.6257708536189549, "grad_norm": 3.6357457637786865, "learning_rate": 0.00016462560857853875, "logits/chosen": -0.7996818423271179, "logits/rejected": -0.8091530203819275, "logps/chosen": -7.473721981048584, "logps/rejected": -54.37172317504883, "loss": 0.38115888833999634, "memory(GiB)": 46.82, "nll_loss": 0.21902790665626526, "rewards/accuracies": 0.90625, "rewards/chosen": 0.033102504909038544, "rewards/margins": 3.986940383911133, "rewards/rejected": -3.9538376331329346, "step": 241, "train_speed(iter/s)": 0.005361 }, { "epoch": 0.6283674131775397, "grad_norm": 2.7460196018218994, "learning_rate": 0.00016429704914694573, "logits/chosen": -0.7820178866386414, "logits/rejected": -0.7842017412185669, "logps/chosen": -5.335976600646973, "logps/rejected": -42.033546447753906, "loss": 0.3013039231300354, "memory(GiB)": 46.82, "nll_loss": 0.18570105731487274, "rewards/accuracies": 1.0, "rewards/chosen": 0.1724267154932022, "rewards/margins": 3.339083194732666, "rewards/rejected": -3.166656494140625, "step": 242, "train_speed(iter/s)": 0.005361 }, { "epoch": 0.6309639727361246, "grad_norm": 5.302358627319336, "learning_rate": 0.00016396730215588915, "logits/chosen": -0.8216249942779541, "logits/rejected": -0.8270251750946045, "logps/chosen": -6.513396263122559, "logps/rejected": -36.97430419921875, "loss": 0.5384330749511719, "memory(GiB)": 46.82, "nll_loss": 0.2902465760707855, "rewards/accuracies": 0.90625, "rewards/chosen": 0.3697386085987091, "rewards/margins": 3.0714187622070312, "rewards/rejected": -2.7016794681549072, "step": 243, "train_speed(iter/s)": 0.005362 }, { "epoch": 0.6335605322947095, "grad_norm": 3.1649816036224365, "learning_rate": 0.00016363637369575985, "logits/chosen": -0.8752993941307068, "logits/rejected": -0.8820919990539551, "logps/chosen": -7.153526306152344, "logps/rejected": -39.54959487915039, "loss": 0.46389204263687134, "memory(GiB)": 46.82, "nll_loss": 0.27045994997024536, "rewards/accuracies": 0.9375, "rewards/chosen": 0.20367804169654846, "rewards/margins": 2.886066436767578, "rewards/rejected": -2.6823883056640625, "step": 244, "train_speed(iter/s)": 0.005361 }, { "epoch": 0.6361570918532944, "grad_norm": 1.2264916896820068, "learning_rate": 0.00016330426987877029, "logits/chosen": -0.8916351199150085, "logits/rejected": -0.903096616268158, "logps/chosen": -7.63686990737915, "logps/rejected": -45.377986907958984, "loss": 0.4263359308242798, "memory(GiB)": 46.82, "nll_loss": 0.33412155508995056, "rewards/accuracies": 1.0, "rewards/chosen": 0.44734618067741394, "rewards/margins": 3.656412124633789, "rewards/rejected": -3.2090659141540527, "step": 245, "train_speed(iter/s)": 0.005361 }, { "epoch": 0.6387536514118792, "grad_norm": 2.662604570388794, "learning_rate": 0.00016297099683884163, "logits/chosen": -0.9035799503326416, "logits/rejected": -0.9036927223205566, "logps/chosen": -7.97056770324707, "logps/rejected": -39.277339935302734, "loss": 0.4779468774795532, "memory(GiB)": 46.82, "nll_loss": 0.3122636079788208, "rewards/accuracies": 0.9375, "rewards/chosen": 0.11914081126451492, "rewards/margins": 3.0797340869903564, "rewards/rejected": -2.9605932235717773, "step": 246, "train_speed(iter/s)": 0.00536 }, { "epoch": 0.6413502109704642, "grad_norm": 1.7811486721038818, "learning_rate": 0.0001626365607314905, "logits/chosen": -0.9211519956588745, "logits/rejected": -0.9266526699066162, "logps/chosen": -12.947280883789062, "logps/rejected": -44.871585845947266, "loss": 0.4722021222114563, "memory(GiB)": 46.82, "nll_loss": 0.37982484698295593, "rewards/accuracies": 1.0, "rewards/chosen": 0.2566950023174286, "rewards/margins": 3.416555881500244, "rewards/rejected": -3.1598610877990723, "step": 247, "train_speed(iter/s)": 0.005361 }, { "epoch": 0.643946770529049, "grad_norm": 12.365011215209961, "learning_rate": 0.00016230096773371514, "logits/chosen": -0.9951969385147095, "logits/rejected": -0.9942623376846313, "logps/chosen": -8.581663131713867, "logps/rejected": -43.716217041015625, "loss": 0.518119215965271, "memory(GiB)": 46.82, "nll_loss": 0.38296759128570557, "rewards/accuracies": 0.96875, "rewards/chosen": 0.09159248322248459, "rewards/margins": 3.335644006729126, "rewards/rejected": -3.244051456451416, "step": 248, "train_speed(iter/s)": 0.005361 }, { "epoch": 0.6465433300876339, "grad_norm": 11.83633041381836, "learning_rate": 0.00016196422404388157, "logits/chosen": -0.9826600551605225, "logits/rejected": -0.9850393533706665, "logps/chosen": -9.135320663452148, "logps/rejected": -46.018798828125, "loss": 0.5105503797531128, "memory(GiB)": 46.82, "nll_loss": 0.39638927578926086, "rewards/accuracies": 0.96875, "rewards/chosen": 0.10775209963321686, "rewards/margins": 3.4860193729400635, "rewards/rejected": -3.378267526626587, "step": 249, "train_speed(iter/s)": 0.005361 }, { "epoch": 0.6491398896462187, "grad_norm": 4.603750228881836, "learning_rate": 0.0001616263358816089, "logits/chosen": -1.0238407850265503, "logits/rejected": -1.0272432565689087, "logps/chosen": -5.940099716186523, "logps/rejected": -52.49337387084961, "loss": 0.36938077211380005, "memory(GiB)": 46.82, "nll_loss": 0.2231290638446808, "rewards/accuracies": 0.90625, "rewards/chosen": 0.25854048132896423, "rewards/margins": 4.265020847320557, "rewards/rejected": -4.0064802169799805, "step": 250, "train_speed(iter/s)": 0.005361 }, { "epoch": 0.6517364492048037, "grad_norm": 52.063899993896484, "learning_rate": 0.00016128730948765447, "logits/chosen": -1.0816775560379028, "logits/rejected": -1.089053750038147, "logps/chosen": -5.90020227432251, "logps/rejected": -48.5638542175293, "loss": 0.43552514910697937, "memory(GiB)": 46.82, "nll_loss": 0.3044917583465576, "rewards/accuracies": 0.9375, "rewards/chosen": 0.26977428793907166, "rewards/margins": 3.8167455196380615, "rewards/rejected": -3.546971321105957, "step": 251, "train_speed(iter/s)": 0.005359 }, { "epoch": 0.6543330087633885, "grad_norm": 4.294113636016846, "learning_rate": 0.0001609471511237987, "logits/chosen": -1.014509677886963, "logits/rejected": -1.0186957120895386, "logps/chosen": -7.97694730758667, "logps/rejected": -56.545310974121094, "loss": 0.36489278078079224, "memory(GiB)": 46.82, "nll_loss": 0.2762773334980011, "rewards/accuracies": 0.96875, "rewards/chosen": -0.022740613669157028, "rewards/margins": 4.397303581237793, "rewards/rejected": -4.4200439453125, "step": 252, "train_speed(iter/s)": 0.005359 }, { "epoch": 0.6569295683219734, "grad_norm": 3.516819477081299, "learning_rate": 0.00016060586707272942, "logits/chosen": -1.0790157318115234, "logits/rejected": -1.0865930318832397, "logps/chosen": -8.454242706298828, "logps/rejected": -54.464717864990234, "loss": 0.3686315417289734, "memory(GiB)": 46.82, "nll_loss": 0.27849066257476807, "rewards/accuracies": 0.96875, "rewards/chosen": 0.13144642114639282, "rewards/margins": 4.120382308959961, "rewards/rejected": -3.988936424255371, "step": 253, "train_speed(iter/s)": 0.005359 }, { "epoch": 0.6595261278805583, "grad_norm": 10.735478401184082, "learning_rate": 0.00016026346363792567, "logits/chosen": -1.0199754238128662, "logits/rejected": -1.024275779724121, "logps/chosen": -10.477851867675781, "logps/rejected": -48.380496978759766, "loss": 0.6012676358222961, "memory(GiB)": 46.82, "nll_loss": 0.42399072647094727, "rewards/accuracies": 0.875, "rewards/chosen": 0.174387127161026, "rewards/margins": 3.8456358909606934, "rewards/rejected": -3.671248435974121, "step": 254, "train_speed(iter/s)": 0.005359 }, { "epoch": 0.6621226874391432, "grad_norm": 4.77883243560791, "learning_rate": 0.0001599199471435414, "logits/chosen": -1.0578190088272095, "logits/rejected": -1.0658252239227295, "logps/chosen": -9.42254638671875, "logps/rejected": -52.36109924316406, "loss": 0.4474544823169708, "memory(GiB)": 46.82, "nll_loss": 0.3092021942138672, "rewards/accuracies": 0.96875, "rewards/chosen": 0.1929168850183487, "rewards/margins": 4.269603729248047, "rewards/rejected": -4.076685905456543, "step": 255, "train_speed(iter/s)": 0.005359 }, { "epoch": 0.664719246997728, "grad_norm": 9.897768020629883, "learning_rate": 0.00015957532393428872, "logits/chosen": -1.0346934795379639, "logits/rejected": -1.0372470617294312, "logps/chosen": -9.071995735168457, "logps/rejected": -49.584144592285156, "loss": 0.617793083190918, "memory(GiB)": 46.82, "nll_loss": 0.49921637773513794, "rewards/accuracies": 0.96875, "rewards/chosen": 0.16571339964866638, "rewards/margins": 3.9660375118255615, "rewards/rejected": -3.800323963165283, "step": 256, "train_speed(iter/s)": 0.005359 }, { "epoch": 0.6673158065563128, "grad_norm": 1.2311677932739258, "learning_rate": 0.00015922960037532055, "logits/chosen": -1.108057975769043, "logits/rejected": -1.1105315685272217, "logps/chosen": -6.960026741027832, "logps/rejected": -53.92729568481445, "loss": 0.3580763638019562, "memory(GiB)": 46.82, "nll_loss": 0.32845476269721985, "rewards/accuracies": 1.0, "rewards/chosen": 0.28917384147644043, "rewards/margins": 4.447230339050293, "rewards/rejected": -4.15805721282959, "step": 257, "train_speed(iter/s)": 0.005359 }, { "epoch": 0.6699123661148978, "grad_norm": 45.17562484741211, "learning_rate": 0.0001588827828521133, "logits/chosen": -1.050451397895813, "logits/rejected": -1.0607093572616577, "logps/chosen": -8.958418846130371, "logps/rejected": -57.699886322021484, "loss": 0.7421323657035828, "memory(GiB)": 46.82, "nll_loss": 0.4822649359703064, "rewards/accuracies": 0.875, "rewards/chosen": 0.22899343073368073, "rewards/margins": 4.515078544616699, "rewards/rejected": -4.286085605621338, "step": 258, "train_speed(iter/s)": 0.005359 }, { "epoch": 0.6725089256734826, "grad_norm": 1.422256588935852, "learning_rate": 0.00015853487777034862, "logits/chosen": -1.0635780096054077, "logits/rejected": -1.0673224925994873, "logps/chosen": -8.635517120361328, "logps/rejected": -58.0097541809082, "loss": 0.3220076858997345, "memory(GiB)": 46.82, "nll_loss": 0.30796006321907043, "rewards/accuracies": 1.0, "rewards/chosen": 0.3498881161212921, "rewards/margins": 4.858260154724121, "rewards/rejected": -4.5083723068237305, "step": 259, "train_speed(iter/s)": 0.005359 }, { "epoch": 0.6751054852320675, "grad_norm": 2.5571460723876953, "learning_rate": 0.0001581858915557953, "logits/chosen": -1.0401530265808105, "logits/rejected": -1.056994915008545, "logps/chosen": -7.485888481140137, "logps/rejected": -66.18753814697266, "loss": 0.34027281403541565, "memory(GiB)": 46.82, "nll_loss": 0.24791380763053894, "rewards/accuracies": 0.96875, "rewards/chosen": 0.1610621213912964, "rewards/margins": 5.100013732910156, "rewards/rejected": -4.938951015472412, "step": 260, "train_speed(iter/s)": 0.005359 }, { "epoch": 0.6777020447906524, "grad_norm": 2.7434134483337402, "learning_rate": 0.00015783583065419055, "logits/chosen": -1.0726388692855835, "logits/rejected": -1.0658763647079468, "logps/chosen": -9.934000968933105, "logps/rejected": -43.6441764831543, "loss": 0.48066970705986023, "memory(GiB)": 46.82, "nll_loss": 0.3425687551498413, "rewards/accuracies": 0.9375, "rewards/chosen": 0.2836655080318451, "rewards/margins": 3.740111827850342, "rewards/rejected": -3.456446647644043, "step": 261, "train_speed(iter/s)": 0.005359 }, { "epoch": 0.6802986043492373, "grad_norm": 11.48259162902832, "learning_rate": 0.00015748470153112093, "logits/chosen": -1.02780020236969, "logits/rejected": -1.0415828227996826, "logps/chosen": -5.212684631347656, "logps/rejected": -61.468292236328125, "loss": 0.4467061758041382, "memory(GiB)": 46.82, "nll_loss": 0.2766522765159607, "rewards/accuracies": 0.90625, "rewards/chosen": 0.25993314385414124, "rewards/margins": 5.092804908752441, "rewards/rejected": -4.832871437072754, "step": 262, "train_speed(iter/s)": 0.005358 }, { "epoch": 0.6828951639078221, "grad_norm": 8.564838409423828, "learning_rate": 0.00015713251067190297, "logits/chosen": -1.0391637086868286, "logits/rejected": -1.0465219020843506, "logps/chosen": -10.817865371704102, "logps/rejected": -51.074317932128906, "loss": 0.5829335451126099, "memory(GiB)": 46.82, "nll_loss": 0.32782095670700073, "rewards/accuracies": 0.90625, "rewards/chosen": -0.04439431428909302, "rewards/margins": 3.851675510406494, "rewards/rejected": -3.8960695266723633, "step": 263, "train_speed(iter/s)": 0.005359 }, { "epoch": 0.685491723466407, "grad_norm": 4.39657735824585, "learning_rate": 0.00015677926458146325, "logits/chosen": -1.0428134202957153, "logits/rejected": -1.0442464351654053, "logps/chosen": -9.461180686950684, "logps/rejected": -50.168216705322266, "loss": 0.527190625667572, "memory(GiB)": 46.82, "nll_loss": 0.39044150710105896, "rewards/accuracies": 0.96875, "rewards/chosen": 0.2586324214935303, "rewards/margins": 4.324131488800049, "rewards/rejected": -4.065499305725098, "step": 264, "train_speed(iter/s)": 0.005359 }, { "epoch": 0.6880882830249919, "grad_norm": 33.24240493774414, "learning_rate": 0.00015642496978421843, "logits/chosen": -0.9720567464828491, "logits/rejected": -0.9765857458114624, "logps/chosen": -6.901163578033447, "logps/rejected": -53.93683624267578, "loss": 0.42922741174697876, "memory(GiB)": 46.82, "nll_loss": 0.3468468487262726, "rewards/accuracies": 0.96875, "rewards/chosen": 0.45161283016204834, "rewards/margins": 4.4618635177612305, "rewards/rejected": -4.010250568389893, "step": 265, "train_speed(iter/s)": 0.005359 }, { "epoch": 0.6906848425835768, "grad_norm": 5.137800693511963, "learning_rate": 0.00015606963282395467, "logits/chosen": -1.0221166610717773, "logits/rejected": -1.030777931213379, "logps/chosen": -6.099124908447266, "logps/rejected": -51.621883392333984, "loss": 0.44425708055496216, "memory(GiB)": 46.82, "nll_loss": 0.34302324056625366, "rewards/accuracies": 0.96875, "rewards/chosen": 0.26895275712013245, "rewards/margins": 4.289248943328857, "rewards/rejected": -4.020296096801758, "step": 266, "train_speed(iter/s)": 0.005358 }, { "epoch": 0.6932814021421616, "grad_norm": 1.4863890409469604, "learning_rate": 0.00015571326026370675, "logits/chosen": -1.0046309232711792, "logits/rejected": -1.0050278902053833, "logps/chosen": -7.830292701721191, "logps/rejected": -52.04121017456055, "loss": 0.30963078141212463, "memory(GiB)": 46.82, "nll_loss": 0.23877012729644775, "rewards/accuracies": 1.0, "rewards/chosen": 0.16400472819805145, "rewards/margins": 4.016274452209473, "rewards/rejected": -3.8522696495056152, "step": 267, "train_speed(iter/s)": 0.005358 }, { "epoch": 0.6958779617007466, "grad_norm": 1.783074140548706, "learning_rate": 0.00015535585868563687, "logits/chosen": -0.9659662842750549, "logits/rejected": -0.9642824530601501, "logps/chosen": -7.803462505340576, "logps/rejected": -40.019229888916016, "loss": 0.45223909616470337, "memory(GiB)": 46.82, "nll_loss": 0.2870696485042572, "rewards/accuracies": 0.9375, "rewards/chosen": 0.3678834140300751, "rewards/margins": 3.325589895248413, "rewards/rejected": -2.9577064514160156, "step": 268, "train_speed(iter/s)": 0.005358 }, { "epoch": 0.6984745212593314, "grad_norm": 2.9299373626708984, "learning_rate": 0.00015499743469091305, "logits/chosen": -0.9901977181434631, "logits/rejected": -0.9931589365005493, "logps/chosen": -9.296809196472168, "logps/rejected": -42.269630432128906, "loss": 0.45571860671043396, "memory(GiB)": 46.82, "nll_loss": 0.2836253046989441, "rewards/accuracies": 0.9375, "rewards/chosen": 0.3169897794723511, "rewards/margins": 3.4090187549591064, "rewards/rejected": -3.092029094696045, "step": 269, "train_speed(iter/s)": 0.005357 }, { "epoch": 0.7010710808179162, "grad_norm": 2.768286943435669, "learning_rate": 0.00015463799489958728, "logits/chosen": -0.9836040139198303, "logits/rejected": -0.9821513295173645, "logps/chosen": -8.032227516174316, "logps/rejected": -46.852630615234375, "loss": 0.3594820201396942, "memory(GiB)": 46.82, "nll_loss": 0.301334023475647, "rewards/accuracies": 1.0, "rewards/chosen": 0.21750850975513458, "rewards/margins": 3.9014554023742676, "rewards/rejected": -3.6839470863342285, "step": 270, "train_speed(iter/s)": 0.005358 }, { "epoch": 0.7036676403765011, "grad_norm": 11.645221710205078, "learning_rate": 0.0001542775459504732, "logits/chosen": -0.977642297744751, "logits/rejected": -0.983423113822937, "logps/chosen": -7.453811168670654, "logps/rejected": -41.04922866821289, "loss": 0.7860956788063049, "memory(GiB)": 46.82, "nll_loss": 0.5319768786430359, "rewards/accuracies": 0.9375, "rewards/chosen": 0.1531173586845398, "rewards/margins": 3.1887106895446777, "rewards/rejected": -3.035593271255493, "step": 271, "train_speed(iter/s)": 0.005358 }, { "epoch": 0.706264199935086, "grad_norm": 2.451678514480591, "learning_rate": 0.00015391609450102344, "logits/chosen": -1.023182988166809, "logits/rejected": -1.0244897603988647, "logps/chosen": -7.354053497314453, "logps/rejected": -44.0927619934082, "loss": 0.39909517765045166, "memory(GiB)": 46.82, "nll_loss": 0.3177676796913147, "rewards/accuracies": 1.0, "rewards/chosen": 0.3391517996788025, "rewards/margins": 3.611537218093872, "rewards/rejected": -3.272385597229004, "step": 272, "train_speed(iter/s)": 0.005359 }, { "epoch": 0.7088607594936709, "grad_norm": 1.9267401695251465, "learning_rate": 0.00015355364722720674, "logits/chosen": -0.9752072691917419, "logits/rejected": -0.9693701863288879, "logps/chosen": -11.397211074829102, "logps/rejected": -48.029632568359375, "loss": 0.39653921127319336, "memory(GiB)": 46.82, "nll_loss": 0.3201441764831543, "rewards/accuracies": 0.96875, "rewards/chosen": 0.3673996925354004, "rewards/margins": 3.925154209136963, "rewards/rejected": -3.5577547550201416, "step": 273, "train_speed(iter/s)": 0.005359 }, { "epoch": 0.7114573190522557, "grad_norm": 8.30762767791748, "learning_rate": 0.0001531902108233846, "logits/chosen": -1.005213737487793, "logits/rejected": -1.0123414993286133, "logps/chosen": -10.145181655883789, "logps/rejected": -43.201988220214844, "loss": 0.9267427921295166, "memory(GiB)": 46.82, "nll_loss": 0.5765597224235535, "rewards/accuracies": 0.90625, "rewards/chosen": 0.0955648422241211, "rewards/margins": 3.0650508403778076, "rewards/rejected": -2.9694862365722656, "step": 274, "train_speed(iter/s)": 0.005359 }, { "epoch": 0.7140538786108407, "grad_norm": 1.9015525579452515, "learning_rate": 0.00015282579200218762, "logits/chosen": -0.9652273654937744, "logits/rejected": -0.9685376882553101, "logps/chosen": -5.937908172607422, "logps/rejected": -48.166961669921875, "loss": 0.3091265857219696, "memory(GiB)": 46.82, "nll_loss": 0.19744150340557098, "rewards/accuracies": 0.9375, "rewards/chosen": 0.10177955776453018, "rewards/margins": 3.805178642272949, "rewards/rejected": -3.7033989429473877, "step": 275, "train_speed(iter/s)": 0.005359 }, { "epoch": 0.7166504381694255, "grad_norm": 6.060371398925781, "learning_rate": 0.00015246039749439158, "logits/chosen": -0.9658158421516418, "logits/rejected": -0.9731608033180237, "logps/chosen": -7.255200386047363, "logps/rejected": -50.502464294433594, "loss": 0.6045569777488708, "memory(GiB)": 46.82, "nll_loss": 0.3833393156528473, "rewards/accuracies": 0.9375, "rewards/chosen": -0.06260780245065689, "rewards/margins": 3.6017262935638428, "rewards/rejected": -3.6643340587615967, "step": 276, "train_speed(iter/s)": 0.005359 }, { "epoch": 0.7192469977280104, "grad_norm": 3.960418462753296, "learning_rate": 0.00015209403404879303, "logits/chosen": -0.8965452909469604, "logits/rejected": -0.9077386260032654, "logps/chosen": -7.974431991577148, "logps/rejected": -51.04905700683594, "loss": 0.5292239785194397, "memory(GiB)": 46.82, "nll_loss": 0.44278621673583984, "rewards/accuracies": 1.0, "rewards/chosen": 0.2756114602088928, "rewards/margins": 3.676894187927246, "rewards/rejected": -3.401282548904419, "step": 277, "train_speed(iter/s)": 0.005359 }, { "epoch": 0.7218435572865952, "grad_norm": 7.708714008331299, "learning_rate": 0.00015172670843208475, "logits/chosen": -0.9474626779556274, "logits/rejected": -0.9558745622634888, "logps/chosen": -6.619680404663086, "logps/rejected": -55.76416778564453, "loss": 0.33095428347587585, "memory(GiB)": 46.82, "nll_loss": 0.2111760675907135, "rewards/accuracies": 0.9375, "rewards/chosen": 0.31980329751968384, "rewards/margins": 4.286462783813477, "rewards/rejected": -3.9666595458984375, "step": 278, "train_speed(iter/s)": 0.005359 }, { "epoch": 0.7244401168451802, "grad_norm": 3.547145128250122, "learning_rate": 0.00015135842742873077, "logits/chosen": -0.9616857767105103, "logits/rejected": -0.9554501175880432, "logps/chosen": -13.64553451538086, "logps/rejected": -47.13714599609375, "loss": 0.5570240020751953, "memory(GiB)": 46.82, "nll_loss": 0.34419986605644226, "rewards/accuracies": 0.9375, "rewards/chosen": 0.17980074882507324, "rewards/margins": 3.7363922595977783, "rewards/rejected": -3.556591510772705, "step": 279, "train_speed(iter/s)": 0.005359 }, { "epoch": 0.727036676403765, "grad_norm": 2.789520740509033, "learning_rate": 0.00015098919784084082, "logits/chosen": -0.9526619911193848, "logits/rejected": -0.9585291743278503, "logps/chosen": -5.527890682220459, "logps/rejected": -48.09929656982422, "loss": 0.3063603341579437, "memory(GiB)": 46.82, "nll_loss": 0.19290734827518463, "rewards/accuracies": 0.9375, "rewards/chosen": 0.27611908316612244, "rewards/margins": 3.8319613933563232, "rewards/rejected": -3.5558416843414307, "step": 280, "train_speed(iter/s)": 0.005359 }, { "epoch": 0.7296332359623499, "grad_norm": 2.256161689758301, "learning_rate": 0.00015061902648804502, "logits/chosen": -0.913105309009552, "logits/rejected": -0.9261531829833984, "logps/chosen": -4.366436004638672, "logps/rejected": -42.916358947753906, "loss": 0.3409702777862549, "memory(GiB)": 46.82, "nll_loss": 0.2262687385082245, "rewards/accuracies": 0.96875, "rewards/chosen": 0.35636499524116516, "rewards/margins": 3.0527658462524414, "rewards/rejected": -2.6964004039764404, "step": 281, "train_speed(iter/s)": 0.005359 }, { "epoch": 0.7322297955209348, "grad_norm": 3.5901756286621094, "learning_rate": 0.0001502479202073678, "logits/chosen": -0.8968573808670044, "logits/rejected": -0.9044336676597595, "logps/chosen": -10.585033416748047, "logps/rejected": -49.008888244628906, "loss": 0.4977288842201233, "memory(GiB)": 46.82, "nll_loss": 0.3260158896446228, "rewards/accuracies": 0.96875, "rewards/chosen": 0.15746770799160004, "rewards/margins": 3.4977617263793945, "rewards/rejected": -3.3402938842773438, "step": 282, "train_speed(iter/s)": 0.005359 }, { "epoch": 0.7348263550795197, "grad_norm": 4.433828830718994, "learning_rate": 0.00014987588585310154, "logits/chosen": -0.9033176898956299, "logits/rejected": -0.9071294069290161, "logps/chosen": -10.011114120483398, "logps/rejected": -41.05360794067383, "loss": 0.5514770150184631, "memory(GiB)": 46.82, "nll_loss": 0.37259769439697266, "rewards/accuracies": 0.9375, "rewards/chosen": 0.07280327379703522, "rewards/margins": 3.06974720954895, "rewards/rejected": -2.996943950653076, "step": 283, "train_speed(iter/s)": 0.005359 }, { "epoch": 0.7374229146381045, "grad_norm": 4.148340225219727, "learning_rate": 0.00014950293029668003, "logits/chosen": -0.8784151077270508, "logits/rejected": -0.8862117528915405, "logps/chosen": -6.820345401763916, "logps/rejected": -54.827003479003906, "loss": 0.3150921165943146, "memory(GiB)": 46.82, "nll_loss": 0.24718376994132996, "rewards/accuracies": 0.96875, "rewards/chosen": 0.15254774689674377, "rewards/margins": 4.318949222564697, "rewards/rejected": -4.1664018630981445, "step": 284, "train_speed(iter/s)": 0.005359 }, { "epoch": 0.7400194741966893, "grad_norm": 1.0749166011810303, "learning_rate": 0.00014912906042655164, "logits/chosen": -0.8836584091186523, "logits/rejected": -0.8885093927383423, "logps/chosen": -6.686123847961426, "logps/rejected": -51.037071228027344, "loss": 0.2929588854312897, "memory(GiB)": 46.82, "nll_loss": 0.25999218225479126, "rewards/accuracies": 1.0, "rewards/chosen": 0.24088695645332336, "rewards/margins": 4.235246658325195, "rewards/rejected": -3.9943599700927734, "step": 285, "train_speed(iter/s)": 0.005359 }, { "epoch": 0.7426160337552743, "grad_norm": 3.1975772380828857, "learning_rate": 0.00014875428314805195, "logits/chosen": -0.8791793584823608, "logits/rejected": -0.8838009834289551, "logps/chosen": -4.482460975646973, "logps/rejected": -42.07259750366211, "loss": 0.45191437005996704, "memory(GiB)": 46.82, "nll_loss": 0.2820110023021698, "rewards/accuracies": 0.96875, "rewards/chosen": 0.17223408818244934, "rewards/margins": 3.3569703102111816, "rewards/rejected": -3.1847360134124756, "step": 286, "train_speed(iter/s)": 0.005359 }, { "epoch": 0.7452125933138591, "grad_norm": 4.853325366973877, "learning_rate": 0.0001483786053832763, "logits/chosen": -0.8666754961013794, "logits/rejected": -0.8730036020278931, "logps/chosen": -10.173751831054688, "logps/rejected": -42.610389709472656, "loss": 0.481548547744751, "memory(GiB)": 46.82, "nll_loss": 0.32319656014442444, "rewards/accuracies": 0.9375, "rewards/chosen": 0.1995163857936859, "rewards/margins": 3.381746292114258, "rewards/rejected": -3.182229518890381, "step": 287, "train_speed(iter/s)": 0.00536 }, { "epoch": 0.747809152872444, "grad_norm": 5.358548164367676, "learning_rate": 0.00014800203407095195, "logits/chosen": -0.8995557427406311, "logits/rejected": -0.9070794582366943, "logps/chosen": -4.7012481689453125, "logps/rejected": -49.54352569580078, "loss": 0.3500158190727234, "memory(GiB)": 46.82, "nll_loss": 0.2837740182876587, "rewards/accuracies": 1.0, "rewards/chosen": 0.3831089735031128, "rewards/margins": 4.144287586212158, "rewards/rejected": -3.761178493499756, "step": 288, "train_speed(iter/s)": 0.00536 }, { "epoch": 0.7504057124310289, "grad_norm": 2.933692693710327, "learning_rate": 0.0001476245761663097, "logits/chosen": -0.8843749165534973, "logits/rejected": -0.8904112577438354, "logps/chosen": -8.129939079284668, "logps/rejected": -47.64159393310547, "loss": 0.3809664249420166, "memory(GiB)": 46.82, "nll_loss": 0.30353543162345886, "rewards/accuracies": 1.0, "rewards/chosen": 0.43099674582481384, "rewards/margins": 3.9384264945983887, "rewards/rejected": -3.507429599761963, "step": 289, "train_speed(iter/s)": 0.00536 }, { "epoch": 0.7530022719896138, "grad_norm": 5.533115863800049, "learning_rate": 0.00014724623864095595, "logits/chosen": -0.8974816799163818, "logits/rejected": -0.8943885564804077, "logps/chosen": -12.756951332092285, "logps/rejected": -45.041236877441406, "loss": 0.5215253829956055, "memory(GiB)": 46.82, "nll_loss": 0.4008585512638092, "rewards/accuracies": 0.96875, "rewards/chosen": 0.28772494196891785, "rewards/margins": 3.7097461223602295, "rewards/rejected": -3.4220211505889893, "step": 290, "train_speed(iter/s)": 0.005359 }, { "epoch": 0.7555988315481986, "grad_norm": 2.6864752769470215, "learning_rate": 0.00014686702848274328, "logits/chosen": -0.9088398218154907, "logits/rejected": -0.9072700142860413, "logps/chosen": -7.4077606201171875, "logps/rejected": -46.239906311035156, "loss": 0.32609468698501587, "memory(GiB)": 46.82, "nll_loss": 0.2327779084444046, "rewards/accuracies": 0.96875, "rewards/chosen": 0.20570842921733856, "rewards/margins": 3.893001079559326, "rewards/rejected": -3.6872925758361816, "step": 291, "train_speed(iter/s)": 0.00536 }, { "epoch": 0.7581953911067835, "grad_norm": 9.521873474121094, "learning_rate": 0.0001464869526956418, "logits/chosen": -0.8602750301361084, "logits/rejected": -0.8622329235076904, "logps/chosen": -8.320989608764648, "logps/rejected": -44.78575134277344, "loss": 0.5608953237533569, "memory(GiB)": 46.82, "nll_loss": 0.36838674545288086, "rewards/accuracies": 0.9375, "rewards/chosen": 0.0709700807929039, "rewards/margins": 3.4943435192108154, "rewards/rejected": -3.4233739376068115, "step": 292, "train_speed(iter/s)": 0.005359 }, { "epoch": 0.7607919506653684, "grad_norm": 5.926126480102539, "learning_rate": 0.00014610601829960978, "logits/chosen": -0.892938494682312, "logits/rejected": -0.8982577323913574, "logps/chosen": -6.005653381347656, "logps/rejected": -44.90076446533203, "loss": 0.43931251764297485, "memory(GiB)": 46.82, "nll_loss": 0.2638612389564514, "rewards/accuracies": 0.875, "rewards/chosen": 0.12249821424484253, "rewards/margins": 3.140292167663574, "rewards/rejected": -3.017793893814087, "step": 293, "train_speed(iter/s)": 0.005359 }, { "epoch": 0.7633885102239533, "grad_norm": 2.9120235443115234, "learning_rate": 0.00014572423233046386, "logits/chosen": -0.8966829776763916, "logits/rejected": -0.9077416062355042, "logps/chosen": -8.57165241241455, "logps/rejected": -55.184844970703125, "loss": 0.45368537306785583, "memory(GiB)": 46.82, "nll_loss": 0.36300209164619446, "rewards/accuracies": 1.0, "rewards/chosen": 0.1118740364909172, "rewards/margins": 4.270344257354736, "rewards/rejected": -4.158470153808594, "step": 294, "train_speed(iter/s)": 0.005359 }, { "epoch": 0.7659850697825381, "grad_norm": 5.669841289520264, "learning_rate": 0.00014534160183974907, "logits/chosen": -0.8818827271461487, "logits/rejected": -0.8899796009063721, "logps/chosen": -5.550753593444824, "logps/rejected": -44.52480697631836, "loss": 0.5001478791236877, "memory(GiB)": 46.82, "nll_loss": 0.3267979621887207, "rewards/accuracies": 0.96875, "rewards/chosen": 0.22049690783023834, "rewards/margins": 3.405883312225342, "rewards/rejected": -3.1853861808776855, "step": 295, "train_speed(iter/s)": 0.005358 }, { "epoch": 0.7685816293411231, "grad_norm": 1.747400164604187, "learning_rate": 0.00014495813389460874, "logits/chosen": -0.9121143817901611, "logits/rejected": -0.9087746739387512, "logps/chosen": -9.585158348083496, "logps/rejected": -50.017791748046875, "loss": 0.4021596610546112, "memory(GiB)": 46.82, "nll_loss": 0.3450128436088562, "rewards/accuracies": 1.0, "rewards/chosen": 0.37154024839401245, "rewards/margins": 4.141083240509033, "rewards/rejected": -3.769543170928955, "step": 296, "train_speed(iter/s)": 0.005359 }, { "epoch": 0.7711781888997079, "grad_norm": 11.861947059631348, "learning_rate": 0.00014457383557765386, "logits/chosen": -0.8657410144805908, "logits/rejected": -0.8725622892379761, "logps/chosen": -8.42186450958252, "logps/rejected": -46.08644104003906, "loss": 0.559907078742981, "memory(GiB)": 46.82, "nll_loss": 0.4467519223690033, "rewards/accuracies": 0.96875, "rewards/chosen": 0.40526360273361206, "rewards/margins": 3.708038568496704, "rewards/rejected": -3.3027749061584473, "step": 297, "train_speed(iter/s)": 0.005358 }, { "epoch": 0.7737747484582927, "grad_norm": 3.2839434146881104, "learning_rate": 0.00014418871398683226, "logits/chosen": -0.8851770758628845, "logits/rejected": -0.8929255604743958, "logps/chosen": -6.95133113861084, "logps/rejected": -44.50846862792969, "loss": 0.3745541274547577, "memory(GiB)": 46.82, "nll_loss": 0.2655733525753021, "rewards/accuracies": 0.96875, "rewards/chosen": 0.381335973739624, "rewards/margins": 3.8720412254333496, "rewards/rejected": -3.4907052516937256, "step": 298, "train_speed(iter/s)": 0.005359 }, { "epoch": 0.7763713080168776, "grad_norm": 2.888361930847168, "learning_rate": 0.00014380277623529764, "logits/chosen": -0.853575587272644, "logits/rejected": -0.8686288595199585, "logps/chosen": -3.8131489753723145, "logps/rejected": -52.961769104003906, "loss": 0.22544604539871216, "memory(GiB)": 46.82, "nll_loss": 0.15638428926467896, "rewards/accuracies": 1.0, "rewards/chosen": 0.19273503124713898, "rewards/margins": 4.502290725708008, "rewards/rejected": -4.309555530548096, "step": 299, "train_speed(iter/s)": 0.005359 }, { "epoch": 0.7789678675754625, "grad_norm": 7.9267778396606445, "learning_rate": 0.00014341602945127806, "logits/chosen": -0.8887860774993896, "logits/rejected": -0.8979215621948242, "logps/chosen": -5.356024265289307, "logps/rejected": -51.7165412902832, "loss": 0.3821192979812622, "memory(GiB)": 46.82, "nll_loss": 0.2632734477519989, "rewards/accuracies": 0.9375, "rewards/chosen": 0.13820704817771912, "rewards/margins": 3.850296974182129, "rewards/rejected": -3.712090492248535, "step": 300, "train_speed(iter/s)": 0.005359 }, { "epoch": 0.7789678675754625, "eval_logits/chosen": -0.867992103099823, "eval_logits/rejected": -0.874204695224762, "eval_logps/chosen": -9.79829216003418, "eval_logps/rejected": -51.43035125732422, "eval_loss": 0.535804033279419, "eval_nll_loss": 0.41711926460266113, "eval_rewards/accuracies": 0.9677419066429138, "eval_rewards/chosen": 0.2565970718860626, "eval_rewards/margins": 4.159191608428955, "eval_rewards/rejected": -3.9025943279266357, "eval_runtime": 291.9135, "eval_samples_per_second": 0.425, "eval_steps_per_second": 0.425, "step": 300 }, { "epoch": 0.7815644271340474, "grad_norm": 1.242323637008667, "learning_rate": 0.00014302848077794427, "logits/chosen": -0.8723223209381104, "logits/rejected": -0.8770792484283447, "logps/chosen": -6.223211288452148, "logps/rejected": -52.06251907348633, "loss": 0.3036009967327118, "memory(GiB)": 46.82, "nll_loss": 0.22717300057411194, "rewards/accuracies": 1.0, "rewards/chosen": 0.3022981882095337, "rewards/margins": 4.106766700744629, "rewards/rejected": -3.8044683933258057, "step": 301, "train_speed(iter/s)": 0.00533 }, { "epoch": 0.7841609866926322, "grad_norm": 2.6004726886749268, "learning_rate": 0.00014264013737327788, "logits/chosen": -0.916274905204773, "logits/rejected": -0.9221408367156982, "logps/chosen": -8.104936599731445, "logps/rejected": -52.68116760253906, "loss": 0.3741414248943329, "memory(GiB)": 46.82, "nll_loss": 0.26373815536499023, "rewards/accuracies": 0.96875, "rewards/chosen": 0.1614115685224533, "rewards/margins": 4.1823883056640625, "rewards/rejected": -4.020977020263672, "step": 302, "train_speed(iter/s)": 0.00533 }, { "epoch": 0.7867575462512172, "grad_norm": 18.030475616455078, "learning_rate": 0.0001422510064099391, "logits/chosen": -0.9025695323944092, "logits/rejected": -0.9134030342102051, "logps/chosen": -5.3788228034973145, "logps/rejected": -56.01725769042969, "loss": 0.4833014905452728, "memory(GiB)": 46.82, "nll_loss": 0.35686278343200684, "rewards/accuracies": 0.96875, "rewards/chosen": 0.4239948093891144, "rewards/margins": 4.954083442687988, "rewards/rejected": -4.530088901519775, "step": 303, "train_speed(iter/s)": 0.005331 }, { "epoch": 0.789354105809802, "grad_norm": 1.25996732711792, "learning_rate": 0.00014186109507513425, "logits/chosen": -0.9152663946151733, "logits/rejected": -0.9181231260299683, "logps/chosen": -8.745201110839844, "logps/rejected": -53.348297119140625, "loss": 0.3430268168449402, "memory(GiB)": 46.82, "nll_loss": 0.2737351357936859, "rewards/accuracies": 0.96875, "rewards/chosen": 0.327117383480072, "rewards/margins": 4.604560852050781, "rewards/rejected": -4.2774434089660645, "step": 304, "train_speed(iter/s)": 0.005332 }, { "epoch": 0.7919506653683869, "grad_norm": 2.2379977703094482, "learning_rate": 0.00014147041057048303, "logits/chosen": -0.9164860248565674, "logits/rejected": -0.922378659248352, "logps/chosen": -7.221551895141602, "logps/rejected": -63.282691955566406, "loss": 0.3236457407474518, "memory(GiB)": 46.82, "nll_loss": 0.2571154534816742, "rewards/accuracies": 0.96875, "rewards/chosen": 0.33233726024627686, "rewards/margins": 5.439297676086426, "rewards/rejected": -5.106960296630859, "step": 305, "train_speed(iter/s)": 0.005332 }, { "epoch": 0.7945472249269717, "grad_norm": 2.401186227798462, "learning_rate": 0.00014107896011188547, "logits/chosen": -0.9090971946716309, "logits/rejected": -0.9093695878982544, "logps/chosen": -12.469802856445312, "logps/rejected": -52.85637664794922, "loss": 0.429090291261673, "memory(GiB)": 46.82, "nll_loss": 0.34026211500167847, "rewards/accuracies": 0.96875, "rewards/chosen": 0.262347936630249, "rewards/margins": 4.283257007598877, "rewards/rejected": -4.020909309387207, "step": 306, "train_speed(iter/s)": 0.005332 }, { "epoch": 0.7971437844855567, "grad_norm": 11.393203735351562, "learning_rate": 0.0001406867509293887, "logits/chosen": -0.87870854139328, "logits/rejected": -0.890485405921936, "logps/chosen": -10.30262279510498, "logps/rejected": -65.79576110839844, "loss": 0.3643527030944824, "memory(GiB)": 46.82, "nll_loss": 0.32104456424713135, "rewards/accuracies": 1.0, "rewards/chosen": 0.3608924150466919, "rewards/margins": 5.524012088775635, "rewards/rejected": -5.163119792938232, "step": 307, "train_speed(iter/s)": 0.005333 }, { "epoch": 0.7997403440441415, "grad_norm": 2.554598331451416, "learning_rate": 0.0001402937902670535, "logits/chosen": -0.9264713525772095, "logits/rejected": -0.9285149574279785, "logps/chosen": -10.006579399108887, "logps/rejected": -52.04652404785156, "loss": 0.860185444355011, "memory(GiB)": 46.82, "nll_loss": 0.6048625111579895, "rewards/accuracies": 0.90625, "rewards/chosen": 0.22397533059120178, "rewards/margins": 4.25376033782959, "rewards/rejected": -4.02978515625, "step": 308, "train_speed(iter/s)": 0.005333 }, { "epoch": 0.8023369036027264, "grad_norm": 1.8770607709884644, "learning_rate": 0.00013990008538282027, "logits/chosen": -0.8972032070159912, "logits/rejected": -0.8980765342712402, "logps/chosen": -14.556074142456055, "logps/rejected": -53.385929107666016, "loss": 0.510574460029602, "memory(GiB)": 46.82, "nll_loss": 0.45061612129211426, "rewards/accuracies": 1.0, "rewards/chosen": 0.3644930422306061, "rewards/margins": 4.575682640075684, "rewards/rejected": -4.2111897468566895, "step": 309, "train_speed(iter/s)": 0.005333 }, { "epoch": 0.8049334631613113, "grad_norm": 12.22037124633789, "learning_rate": 0.00013950564354837513, "logits/chosen": -0.9380626678466797, "logits/rejected": -0.9469397664070129, "logps/chosen": -10.450864791870117, "logps/rejected": -60.86605453491211, "loss": 0.47496286034584045, "memory(GiB)": 46.82, "nll_loss": 0.32565683126449585, "rewards/accuracies": 0.9375, "rewards/chosen": 0.27174729108810425, "rewards/margins": 5.215041160583496, "rewards/rejected": -4.943294048309326, "step": 310, "train_speed(iter/s)": 0.005333 }, { "epoch": 0.8075300227198962, "grad_norm": 1.5406510829925537, "learning_rate": 0.0001391104720490156, "logits/chosen": -0.8875188231468201, "logits/rejected": -0.889438807964325, "logps/chosen": -9.368861198425293, "logps/rejected": -60.18291473388672, "loss": 0.4254617393016815, "memory(GiB)": 46.82, "nll_loss": 0.33097419142723083, "rewards/accuracies": 0.96875, "rewards/chosen": 0.2585148215293884, "rewards/margins": 5.071025371551514, "rewards/rejected": -4.8125104904174805, "step": 311, "train_speed(iter/s)": 0.005333 }, { "epoch": 0.810126582278481, "grad_norm": 1.0935144424438477, "learning_rate": 0.0001387145781835161, "logits/chosen": -0.8894232511520386, "logits/rejected": -0.8968610763549805, "logps/chosen": -6.686229228973389, "logps/rejected": -62.9738655090332, "loss": 0.32542869448661804, "memory(GiB)": 46.82, "nll_loss": 0.31048065423965454, "rewards/accuracies": 1.0, "rewards/chosen": 0.4036734998226166, "rewards/margins": 5.581910610198975, "rewards/rejected": -5.178236961364746, "step": 312, "train_speed(iter/s)": 0.005333 }, { "epoch": 0.8127231418370658, "grad_norm": 3.8420419692993164, "learning_rate": 0.00013831796926399293, "logits/chosen": -0.8379157185554504, "logits/rejected": -0.8429592251777649, "logps/chosen": -11.607048034667969, "logps/rejected": -59.3102912902832, "loss": 0.5591235160827637, "memory(GiB)": 46.82, "nll_loss": 0.522581934928894, "rewards/accuracies": 1.0, "rewards/chosen": 0.2473653256893158, "rewards/margins": 4.927768707275391, "rewards/rejected": -4.680403232574463, "step": 313, "train_speed(iter/s)": 0.005333 }, { "epoch": 0.8153197013956508, "grad_norm": 1.6165937185287476, "learning_rate": 0.0001379206526157695, "logits/chosen": -0.837811291217804, "logits/rejected": -0.8444165587425232, "logps/chosen": -6.190374851226807, "logps/rejected": -51.07488250732422, "loss": 0.33069220185279846, "memory(GiB)": 46.82, "nll_loss": 0.22484685480594635, "rewards/accuracies": 0.96875, "rewards/chosen": 0.3744960129261017, "rewards/margins": 4.471968173980713, "rewards/rejected": -4.097471714019775, "step": 314, "train_speed(iter/s)": 0.005333 }, { "epoch": 0.8179162609542356, "grad_norm": 1.3219656944274902, "learning_rate": 0.00013752263557724088, "logits/chosen": -0.8476938009262085, "logits/rejected": -0.854124903678894, "logps/chosen": -4.460864543914795, "logps/rejected": -59.64604949951172, "loss": 0.24126547574996948, "memory(GiB)": 46.82, "nll_loss": 0.18051305413246155, "rewards/accuracies": 0.96875, "rewards/chosen": 0.3259335160255432, "rewards/margins": 4.853468894958496, "rewards/rejected": -4.527535915374756, "step": 315, "train_speed(iter/s)": 0.005333 }, { "epoch": 0.8205128205128205, "grad_norm": 1.3838900327682495, "learning_rate": 0.00013712392549973813, "logits/chosen": -0.8475697636604309, "logits/rejected": -0.8508798480033875, "logps/chosen": -8.591952323913574, "logps/rejected": -54.92388153076172, "loss": 0.33699649572372437, "memory(GiB)": 46.82, "nll_loss": 0.26192301511764526, "rewards/accuracies": 0.96875, "rewards/chosen": 0.45825159549713135, "rewards/margins": 4.5010480880737305, "rewards/rejected": -4.042796611785889, "step": 316, "train_speed(iter/s)": 0.005333 }, { "epoch": 0.8231093800714054, "grad_norm": 1.5406709909439087, "learning_rate": 0.00013672452974739278, "logits/chosen": -0.8334726095199585, "logits/rejected": -0.8387458324432373, "logps/chosen": -6.5857672691345215, "logps/rejected": -57.37644577026367, "loss": 0.3329037129878998, "memory(GiB)": 46.82, "nll_loss": 0.24443216621875763, "rewards/accuracies": 0.96875, "rewards/chosen": 0.26296567916870117, "rewards/margins": 4.921113014221191, "rewards/rejected": -4.658147811889648, "step": 317, "train_speed(iter/s)": 0.005333 }, { "epoch": 0.8257059396299903, "grad_norm": 1.1263025999069214, "learning_rate": 0.00013632445569700076, "logits/chosen": -0.8738721013069153, "logits/rejected": -0.8832994699478149, "logps/chosen": -4.713293552398682, "logps/rejected": -61.70130157470703, "loss": 0.24098971486091614, "memory(GiB)": 46.82, "nll_loss": 0.19781509041786194, "rewards/accuracies": 0.96875, "rewards/chosen": 0.3292510509490967, "rewards/margins": 5.506122589111328, "rewards/rejected": -5.176871299743652, "step": 318, "train_speed(iter/s)": 0.005334 }, { "epoch": 0.8283024991885751, "grad_norm": 1.8800857067108154, "learning_rate": 0.00013592371073788595, "logits/chosen": -0.8317723274230957, "logits/rejected": -0.8364999890327454, "logps/chosen": -9.805098533630371, "logps/rejected": -52.64741516113281, "loss": 0.5319538712501526, "memory(GiB)": 46.82, "nll_loss": 0.422235369682312, "rewards/accuracies": 1.0, "rewards/chosen": 0.20960083603858948, "rewards/margins": 4.515375137329102, "rewards/rejected": -4.305774211883545, "step": 319, "train_speed(iter/s)": 0.005334 }, { "epoch": 0.83089905874716, "grad_norm": 1.1608284711837769, "learning_rate": 0.0001355223022717639, "logits/chosen": -0.8772802948951721, "logits/rejected": -0.8848594427108765, "logps/chosen": -5.158228397369385, "logps/rejected": -62.835357666015625, "loss": 0.24610216915607452, "memory(GiB)": 46.82, "nll_loss": 0.2129330337047577, "rewards/accuracies": 1.0, "rewards/chosen": 0.20435252785682678, "rewards/margins": 5.209543228149414, "rewards/rejected": -5.005191326141357, "step": 320, "train_speed(iter/s)": 0.005335 }, { "epoch": 0.8334956183057449, "grad_norm": 1.036731243133545, "learning_rate": 0.00013512023771260507, "logits/chosen": -0.877793550491333, "logits/rejected": -0.8856680989265442, "logps/chosen": -6.130776882171631, "logps/rejected": -65.56432342529297, "loss": 0.2860373854637146, "memory(GiB)": 46.82, "nll_loss": 0.26745346188545227, "rewards/accuracies": 1.0, "rewards/chosen": 0.4021628201007843, "rewards/margins": 5.478217124938965, "rewards/rejected": -5.076053619384766, "step": 321, "train_speed(iter/s)": 0.005335 }, { "epoch": 0.8360921778643298, "grad_norm": 1.8117263317108154, "learning_rate": 0.0001347175244864979, "logits/chosen": -0.8334808349609375, "logits/rejected": -0.8376457095146179, "logps/chosen": -11.004887580871582, "logps/rejected": -66.70048522949219, "loss": 0.4500907361507416, "memory(GiB)": 46.82, "nll_loss": 0.42771589756011963, "rewards/accuracies": 1.0, "rewards/chosen": 0.33971378207206726, "rewards/margins": 5.777808666229248, "rewards/rejected": -5.4380950927734375, "step": 322, "train_speed(iter/s)": 0.005335 }, { "epoch": 0.8386887374229146, "grad_norm": 1.4639251232147217, "learning_rate": 0.00013431417003151162, "logits/chosen": -0.8392638564109802, "logits/rejected": -0.8471822142601013, "logps/chosen": -5.59528112411499, "logps/rejected": -63.85756301879883, "loss": 0.24815644323825836, "memory(GiB)": 46.82, "nll_loss": 0.22107534110546112, "rewards/accuracies": 1.0, "rewards/chosen": 0.43189477920532227, "rewards/margins": 5.589203834533691, "rewards/rejected": -5.157309055328369, "step": 323, "train_speed(iter/s)": 0.005335 }, { "epoch": 0.8412852969814996, "grad_norm": 3.701712131500244, "learning_rate": 0.00013391018179755886, "logits/chosen": -0.862777590751648, "logits/rejected": -0.863462507724762, "logps/chosen": -9.423402786254883, "logps/rejected": -57.09379577636719, "loss": 0.5075635313987732, "memory(GiB)": 46.82, "nll_loss": 0.4723358750343323, "rewards/accuracies": 1.0, "rewards/chosen": 0.17091917991638184, "rewards/margins": 4.957292079925537, "rewards/rejected": -4.786372661590576, "step": 324, "train_speed(iter/s)": 0.005335 }, { "epoch": 0.8438818565400844, "grad_norm": 3.2106587886810303, "learning_rate": 0.0001335055672462581, "logits/chosen": -0.8590080738067627, "logits/rejected": -0.8611211776733398, "logps/chosen": -9.565107345581055, "logps/rejected": -56.25175476074219, "loss": 0.7309077382087708, "memory(GiB)": 46.82, "nll_loss": 0.5393710732460022, "rewards/accuracies": 0.9375, "rewards/chosen": 0.37465783953666687, "rewards/margins": 5.114628791809082, "rewards/rejected": -4.739970684051514, "step": 325, "train_speed(iter/s)": 0.005335 }, { "epoch": 0.8464784160986693, "grad_norm": 1.718408465385437, "learning_rate": 0.00013310033385079587, "logits/chosen": -0.8548775911331177, "logits/rejected": -0.8569875955581665, "logps/chosen": -6.972779273986816, "logps/rejected": -53.69463348388672, "loss": 0.30815446376800537, "memory(GiB)": 46.82, "nll_loss": 0.2685162425041199, "rewards/accuracies": 1.0, "rewards/chosen": 0.3408139646053314, "rewards/margins": 4.932272911071777, "rewards/rejected": -4.591458797454834, "step": 326, "train_speed(iter/s)": 0.005336 }, { "epoch": 0.8490749756572541, "grad_norm": 30.29808235168457, "learning_rate": 0.00013269448909578865, "logits/chosen": -0.8808773756027222, "logits/rejected": -0.8881189227104187, "logps/chosen": -7.769625663757324, "logps/rejected": -64.69181823730469, "loss": 0.4174491763114929, "memory(GiB)": 46.82, "nll_loss": 0.29413902759552, "rewards/accuracies": 0.9375, "rewards/chosen": 0.1492745727300644, "rewards/margins": 5.491776466369629, "rewards/rejected": -5.342501640319824, "step": 327, "train_speed(iter/s)": 0.005336 }, { "epoch": 0.851671535215839, "grad_norm": 1.610142469406128, "learning_rate": 0.00013228804047714463, "logits/chosen": -0.8723031878471375, "logits/rejected": -0.8802396059036255, "logps/chosen": -6.0019707679748535, "logps/rejected": -67.33113861083984, "loss": 0.2763366401195526, "memory(GiB)": 46.82, "nll_loss": 0.25310149788856506, "rewards/accuracies": 1.0, "rewards/chosen": 0.25009822845458984, "rewards/margins": 5.477874755859375, "rewards/rejected": -5.227776050567627, "step": 328, "train_speed(iter/s)": 0.005336 }, { "epoch": 0.8542680947744239, "grad_norm": 18.318506240844727, "learning_rate": 0.00013188099550192535, "logits/chosen": -0.8295834064483643, "logits/rejected": -0.838620662689209, "logps/chosen": -5.431742191314697, "logps/rejected": -62.13144302368164, "loss": 0.6254780292510986, "memory(GiB)": 46.82, "nll_loss": 0.3839109241962433, "rewards/accuracies": 0.9375, "rewards/chosen": 0.09875370562076569, "rewards/margins": 5.322996139526367, "rewards/rejected": -5.224242210388184, "step": 329, "train_speed(iter/s)": 0.005336 }, { "epoch": 0.8568646543330087, "grad_norm": 1.2672317028045654, "learning_rate": 0.000131473361688207, "logits/chosen": -0.8911533355712891, "logits/rejected": -0.8940534591674805, "logps/chosen": -5.854481220245361, "logps/rejected": -50.02248001098633, "loss": 0.34439149498939514, "memory(GiB)": 46.82, "nll_loss": 0.268149733543396, "rewards/accuracies": 0.9375, "rewards/chosen": 0.32187986373901367, "rewards/margins": 4.458532810211182, "rewards/rejected": -4.136653423309326, "step": 330, "train_speed(iter/s)": 0.005336 }, { "epoch": 0.8594612138915937, "grad_norm": 1.345903754234314, "learning_rate": 0.00013106514656494148, "logits/chosen": -0.8426346182823181, "logits/rejected": -0.8419499397277832, "logps/chosen": -12.040822982788086, "logps/rejected": -51.06175231933594, "loss": 0.4810463786125183, "memory(GiB)": 46.82, "nll_loss": 0.42825689911842346, "rewards/accuracies": 1.0, "rewards/chosen": 0.2871994376182556, "rewards/margins": 4.3635358810424805, "rewards/rejected": -4.076336860656738, "step": 331, "train_speed(iter/s)": 0.005336 }, { "epoch": 0.8620577734501785, "grad_norm": 7.434391975402832, "learning_rate": 0.00013065635767181747, "logits/chosen": -0.8796988129615784, "logits/rejected": -0.8907098174095154, "logps/chosen": -4.122412204742432, "logps/rejected": -64.0143051147461, "loss": 0.30808770656585693, "memory(GiB)": 46.82, "nll_loss": 0.21978120505809784, "rewards/accuracies": 0.96875, "rewards/chosen": 0.24143238365650177, "rewards/margins": 5.337109088897705, "rewards/rejected": -5.095676422119141, "step": 332, "train_speed(iter/s)": 0.005336 }, { "epoch": 0.8646543330087634, "grad_norm": 42.690364837646484, "learning_rate": 0.0001302470025591211, "logits/chosen": -0.8691973686218262, "logits/rejected": -0.8755657076835632, "logps/chosen": -6.238379001617432, "logps/rejected": -57.67242431640625, "loss": 0.5189653635025024, "memory(GiB)": 46.82, "nll_loss": 0.360885351896286, "rewards/accuracies": 0.96875, "rewards/chosen": 0.26926398277282715, "rewards/margins": 4.828179836273193, "rewards/rejected": -4.558915615081787, "step": 333, "train_speed(iter/s)": 0.005335 }, { "epoch": 0.8672508925673482, "grad_norm": 8.9744873046875, "learning_rate": 0.00012983708878759655, "logits/chosen": -0.9184461832046509, "logits/rejected": -0.9249346256256104, "logps/chosen": -9.006379127502441, "logps/rejected": -58.630638122558594, "loss": 0.5170425772666931, "memory(GiB)": 46.82, "nll_loss": 0.4528915584087372, "rewards/accuracies": 1.0, "rewards/chosen": 0.3499585688114166, "rewards/margins": 4.760928153991699, "rewards/rejected": -4.4109697341918945, "step": 334, "train_speed(iter/s)": 0.005336 }, { "epoch": 0.8698474521259332, "grad_norm": 16.40105628967285, "learning_rate": 0.00012942662392830632, "logits/chosen": -0.8680149912834167, "logits/rejected": -0.8773718476295471, "logps/chosen": -4.468932151794434, "logps/rejected": -64.07333374023438, "loss": 0.29751056432724, "memory(GiB)": 46.82, "nll_loss": 0.20176543295383453, "rewards/accuracies": 0.9375, "rewards/chosen": 0.29612603783607483, "rewards/margins": 5.261467456817627, "rewards/rejected": -4.965341567993164, "step": 335, "train_speed(iter/s)": 0.005336 }, { "epoch": 0.872444011684518, "grad_norm": 13.411872863769531, "learning_rate": 0.0001290156155624914, "logits/chosen": -0.8806618452072144, "logits/rejected": -0.8878685832023621, "logps/chosen": -9.750197410583496, "logps/rejected": -64.2704849243164, "loss": 0.44853177666664124, "memory(GiB)": 46.82, "nll_loss": 0.30135855078697205, "rewards/accuracies": 0.96875, "rewards/chosen": 0.0591825433075428, "rewards/margins": 5.037668228149414, "rewards/rejected": -4.978486061096191, "step": 336, "train_speed(iter/s)": 0.005336 }, { "epoch": 0.8750405712431029, "grad_norm": 1.5141712427139282, "learning_rate": 0.0001286040712814314, "logits/chosen": -0.9008548855781555, "logits/rejected": -0.9143273830413818, "logps/chosen": -4.234499931335449, "logps/rejected": -74.0651626586914, "loss": 0.2379544973373413, "memory(GiB)": 46.82, "nll_loss": 0.2000884711742401, "rewards/accuracies": 1.0, "rewards/chosen": 0.4334224462509155, "rewards/margins": 6.484922409057617, "rewards/rejected": -6.051499366760254, "step": 337, "train_speed(iter/s)": 0.005336 }, { "epoch": 0.8776371308016878, "grad_norm": 0.8521820306777954, "learning_rate": 0.0001281919986863042, "logits/chosen": -0.8969717025756836, "logits/rejected": -0.9046814441680908, "logps/chosen": -7.235101699829102, "logps/rejected": -77.14093017578125, "loss": 0.273301899433136, "memory(GiB)": 46.82, "nll_loss": 0.2426755428314209, "rewards/accuracies": 1.0, "rewards/chosen": 0.320049524307251, "rewards/margins": 6.36985445022583, "rewards/rejected": -6.049805641174316, "step": 338, "train_speed(iter/s)": 0.005336 }, { "epoch": 0.8802336903602727, "grad_norm": 2.2374491691589355, "learning_rate": 0.00012777940538804544, "logits/chosen": -0.8919708132743835, "logits/rejected": -0.8931483626365662, "logps/chosen": -6.93287992477417, "logps/rejected": -61.636375427246094, "loss": 0.3472403883934021, "memory(GiB)": 46.82, "nll_loss": 0.2957107722759247, "rewards/accuracies": 0.96875, "rewards/chosen": 0.3734300136566162, "rewards/margins": 5.471829891204834, "rewards/rejected": -5.098400115966797, "step": 339, "train_speed(iter/s)": 0.005336 }, { "epoch": 0.8828302499188575, "grad_norm": 25.410560607910156, "learning_rate": 0.0001273662990072083, "logits/chosen": -0.8870843648910522, "logits/rejected": -0.8924081325531006, "logps/chosen": -7.52494478225708, "logps/rejected": -61.48851013183594, "loss": 0.7680293321609497, "memory(GiB)": 46.82, "nll_loss": 0.5508996844291687, "rewards/accuracies": 0.9375, "rewards/chosen": -0.006981657352298498, "rewards/margins": 5.215488433837891, "rewards/rejected": -5.222470283508301, "step": 340, "train_speed(iter/s)": 0.005336 }, { "epoch": 0.8854268094774423, "grad_norm": 3.612856864929199, "learning_rate": 0.0001269526871738224, "logits/chosen": -0.9017181992530823, "logits/rejected": -0.906170666217804, "logps/chosen": -7.857571125030518, "logps/rejected": -63.468265533447266, "loss": 0.38538140058517456, "memory(GiB)": 46.82, "nll_loss": 0.2516745924949646, "rewards/accuracies": 0.96875, "rewards/chosen": 0.179386705160141, "rewards/margins": 5.408325672149658, "rewards/rejected": -5.228938579559326, "step": 341, "train_speed(iter/s)": 0.005335 }, { "epoch": 0.8880233690360273, "grad_norm": 9.315306663513184, "learning_rate": 0.00012653857752725303, "logits/chosen": -0.88401198387146, "logits/rejected": -0.891493022441864, "logps/chosen": -7.122734546661377, "logps/rejected": -57.48167419433594, "loss": 0.5956651568412781, "memory(GiB)": 46.82, "nll_loss": 0.4049210548400879, "rewards/accuracies": 0.96875, "rewards/chosen": 0.09174284338951111, "rewards/margins": 4.561285972595215, "rewards/rejected": -4.469542503356934, "step": 342, "train_speed(iter/s)": 0.005336 }, { "epoch": 0.8906199285946121, "grad_norm": 0.7824282050132751, "learning_rate": 0.00012612397771606014, "logits/chosen": -0.9107692837715149, "logits/rejected": -0.9192830324172974, "logps/chosen": -5.18141508102417, "logps/rejected": -63.883949279785156, "loss": 0.2276170253753662, "memory(GiB)": 46.82, "nll_loss": 0.2009223848581314, "rewards/accuracies": 1.0, "rewards/chosen": 0.2666219174861908, "rewards/margins": 5.457507610321045, "rewards/rejected": -5.190885543823242, "step": 343, "train_speed(iter/s)": 0.005336 }, { "epoch": 0.893216488153197, "grad_norm": 1.105103850364685, "learning_rate": 0.0001257088953978568, "logits/chosen": -0.8562593460083008, "logits/rejected": -0.8662354350090027, "logps/chosen": -7.01981258392334, "logps/rejected": -60.08414077758789, "loss": 0.2912936210632324, "memory(GiB)": 46.82, "nll_loss": 0.23564513027668, "rewards/accuracies": 1.0, "rewards/chosen": 0.41656795144081116, "rewards/margins": 5.034234046936035, "rewards/rejected": -4.617666244506836, "step": 344, "train_speed(iter/s)": 0.005337 }, { "epoch": 0.8958130477117819, "grad_norm": 3.4230287075042725, "learning_rate": 0.00012529333823916807, "logits/chosen": -0.8783853650093079, "logits/rejected": -0.8884921073913574, "logps/chosen": -4.188514232635498, "logps/rejected": -66.61878967285156, "loss": 0.4436146914958954, "memory(GiB)": 46.82, "nll_loss": 0.2946454584598541, "rewards/accuracies": 0.96875, "rewards/chosen": 0.18403561413288116, "rewards/margins": 5.612396240234375, "rewards/rejected": -5.428360939025879, "step": 345, "train_speed(iter/s)": 0.005337 }, { "epoch": 0.8984096072703668, "grad_norm": 2.5396299362182617, "learning_rate": 0.00012487731391528918, "logits/chosen": -0.9642701745033264, "logits/rejected": -0.9674146175384521, "logps/chosen": -5.993198871612549, "logps/rejected": -60.531856536865234, "loss": 0.25893262028694153, "memory(GiB)": 46.82, "nll_loss": 0.19595590233802795, "rewards/accuracies": 1.0, "rewards/chosen": 0.26401805877685547, "rewards/margins": 5.092806339263916, "rewards/rejected": -4.828787803649902, "step": 346, "train_speed(iter/s)": 0.005337 }, { "epoch": 0.9010061668289516, "grad_norm": 2.3769822120666504, "learning_rate": 0.00012446083011014388, "logits/chosen": -0.9396705627441406, "logits/rejected": -0.9417209029197693, "logps/chosen": -7.586000919342041, "logps/rejected": -61.09663391113281, "loss": 0.36653196811676025, "memory(GiB)": 46.82, "nll_loss": 0.26543620228767395, "rewards/accuracies": 0.96875, "rewards/chosen": 0.2201276272535324, "rewards/margins": 5.081995010375977, "rewards/rejected": -4.8618669509887695, "step": 347, "train_speed(iter/s)": 0.005337 }, { "epoch": 0.9036027263875365, "grad_norm": 3.2100534439086914, "learning_rate": 0.00012404389451614253, "logits/chosen": -0.9353513121604919, "logits/rejected": -0.9401172995567322, "logps/chosen": -6.526828765869141, "logps/rejected": -56.59849548339844, "loss": 0.4251266419887543, "memory(GiB)": 46.82, "nll_loss": 0.35948801040649414, "rewards/accuracies": 0.96875, "rewards/chosen": 0.3049776554107666, "rewards/margins": 4.886538028717041, "rewards/rejected": -4.581560134887695, "step": 348, "train_speed(iter/s)": 0.005337 }, { "epoch": 0.9061992859461214, "grad_norm": 22.74829864501953, "learning_rate": 0.00012362651483403985, "logits/chosen": -0.9125022888183594, "logits/rejected": -0.9109125733375549, "logps/chosen": -8.987406730651855, "logps/rejected": -49.98797607421875, "loss": 0.5128880739212036, "memory(GiB)": 46.82, "nll_loss": 0.43219777941703796, "rewards/accuracies": 0.96875, "rewards/chosen": 0.27204346656799316, "rewards/margins": 4.296665191650391, "rewards/rejected": -4.024621486663818, "step": 349, "train_speed(iter/s)": 0.005337 }, { "epoch": 0.9087958455047063, "grad_norm": 2.0788931846618652, "learning_rate": 0.00012320869877279297, "logits/chosen": -0.9203197956085205, "logits/rejected": -0.9223061800003052, "logps/chosen": -10.433500289916992, "logps/rejected": -62.36846160888672, "loss": 0.4062730073928833, "memory(GiB)": 46.82, "nll_loss": 0.35132896900177, "rewards/accuracies": 0.96875, "rewards/chosen": 0.24331118166446686, "rewards/margins": 5.01633882522583, "rewards/rejected": -4.773027420043945, "step": 350, "train_speed(iter/s)": 0.005337 }, { "epoch": 0.9113924050632911, "grad_norm": 1.2080000638961792, "learning_rate": 0.0001227904540494188, "logits/chosen": -0.9349120855331421, "logits/rejected": -0.9338538646697998, "logps/chosen": -8.405929565429688, "logps/rejected": -57.93353271484375, "loss": 0.366677850484848, "memory(GiB)": 46.82, "nll_loss": 0.31156450510025024, "rewards/accuracies": 1.0, "rewards/chosen": 0.25386035442352295, "rewards/margins": 5.119736671447754, "rewards/rejected": -4.865876197814941, "step": 351, "train_speed(iter/s)": 0.005336 }, { "epoch": 0.9139889646218761, "grad_norm": 5.341267108917236, "learning_rate": 0.00012237178838885168, "logits/chosen": -0.9456449747085571, "logits/rejected": -0.9499503970146179, "logps/chosen": -6.785584926605225, "logps/rejected": -63.56637954711914, "loss": 0.3164372742176056, "memory(GiB)": 46.82, "nll_loss": 0.21375565230846405, "rewards/accuracies": 0.9375, "rewards/chosen": 0.3775550425052643, "rewards/margins": 5.603601455688477, "rewards/rejected": -5.226045608520508, "step": 352, "train_speed(iter/s)": 0.005336 }, { "epoch": 0.9165855241804609, "grad_norm": 20.04754066467285, "learning_rate": 0.00012195270952380051, "logits/chosen": -0.9753867387771606, "logits/rejected": -0.9728374481201172, "logps/chosen": -8.288665771484375, "logps/rejected": -50.586734771728516, "loss": 0.45580485463142395, "memory(GiB)": 46.82, "nll_loss": 0.38007235527038574, "rewards/accuracies": 0.96875, "rewards/chosen": 0.4403877258300781, "rewards/margins": 4.540890216827393, "rewards/rejected": -4.100502967834473, "step": 353, "train_speed(iter/s)": 0.005336 }, { "epoch": 0.9191820837390458, "grad_norm": 1.5026851892471313, "learning_rate": 0.0001215332251946061, "logits/chosen": -0.9055343866348267, "logits/rejected": -0.9097537398338318, "logps/chosen": -8.293628692626953, "logps/rejected": -65.0361099243164, "loss": 0.3375437557697296, "memory(GiB)": 46.82, "nll_loss": 0.2872999310493469, "rewards/accuracies": 1.0, "rewards/chosen": 0.3178735375404358, "rewards/margins": 5.573904991149902, "rewards/rejected": -5.2560319900512695, "step": 354, "train_speed(iter/s)": 0.005337 }, { "epoch": 0.9217786432976306, "grad_norm": 9.46897029876709, "learning_rate": 0.0001211133431490981, "logits/chosen": -0.9408826231956482, "logits/rejected": -0.9440443515777588, "logps/chosen": -7.679222583770752, "logps/rejected": -58.07322311401367, "loss": 0.4588177502155304, "memory(GiB)": 46.82, "nll_loss": 0.3633183538913727, "rewards/accuracies": 0.96875, "rewards/chosen": 0.35548433661460876, "rewards/margins": 5.1678056716918945, "rewards/rejected": -4.812321186065674, "step": 355, "train_speed(iter/s)": 0.005337 }, { "epoch": 0.9243752028562155, "grad_norm": 2.6942434310913086, "learning_rate": 0.00012069307114245196, "logits/chosen": -0.9773699045181274, "logits/rejected": -0.9839785099029541, "logps/chosen": -6.199317932128906, "logps/rejected": -51.811275482177734, "loss": 0.33174929022789, "memory(GiB)": 46.82, "nll_loss": 0.20409320294857025, "rewards/accuracies": 1.0, "rewards/chosen": 0.2277924120426178, "rewards/margins": 3.9625682830810547, "rewards/rejected": -3.734776020050049, "step": 356, "train_speed(iter/s)": 0.005337 }, { "epoch": 0.9269717624148004, "grad_norm": 1.542070746421814, "learning_rate": 0.00012027241693704567, "logits/chosen": -0.9564674496650696, "logits/rejected": -0.958985447883606, "logps/chosen": -4.848186016082764, "logps/rejected": -64.11177062988281, "loss": 0.2734638750553131, "memory(GiB)": 46.82, "nll_loss": 0.22212821245193481, "rewards/accuracies": 1.0, "rewards/chosen": 0.2529650330543518, "rewards/margins": 5.414011478424072, "rewards/rejected": -5.161045074462891, "step": 357, "train_speed(iter/s)": 0.005337 }, { "epoch": 0.9295683219733852, "grad_norm": 1.618640422821045, "learning_rate": 0.00011985138830231637, "logits/chosen": -0.952854573726654, "logits/rejected": -0.9557262063026428, "logps/chosen": -7.695744514465332, "logps/rejected": -64.7623062133789, "loss": 0.27667006850242615, "memory(GiB)": 46.82, "nll_loss": 0.2487485110759735, "rewards/accuracies": 1.0, "rewards/chosen": 0.18947187066078186, "rewards/margins": 5.626814365386963, "rewards/rejected": -5.437342166900635, "step": 358, "train_speed(iter/s)": 0.005337 }, { "epoch": 0.9321648815319702, "grad_norm": 9.904494285583496, "learning_rate": 0.00011942999301461693, "logits/chosen": -0.9912068247795105, "logits/rejected": -1.0118963718414307, "logps/chosen": -6.654687881469727, "logps/rejected": -68.99776458740234, "loss": 0.3964228332042694, "memory(GiB)": 46.82, "nll_loss": 0.27639806270599365, "rewards/accuracies": 0.9375, "rewards/chosen": 0.22217164933681488, "rewards/margins": 5.643857479095459, "rewards/rejected": -5.421686172485352, "step": 359, "train_speed(iter/s)": 0.005338 }, { "epoch": 0.934761441090555, "grad_norm": 2.499595880508423, "learning_rate": 0.00011900823885707215, "logits/chosen": -0.9873682260513306, "logits/rejected": -0.9983680248260498, "logps/chosen": -7.571791172027588, "logps/rejected": -69.42076110839844, "loss": 0.6393591165542603, "memory(GiB)": 46.82, "nll_loss": 0.4515572786331177, "rewards/accuracies": 0.9375, "rewards/chosen": 0.013363976031541824, "rewards/margins": 5.555707931518555, "rewards/rejected": -5.542343616485596, "step": 360, "train_speed(iter/s)": 0.005338 }, { "epoch": 0.9373580006491399, "grad_norm": 5.06946325302124, "learning_rate": 0.00011858613361943518, "logits/chosen": -0.9797115325927734, "logits/rejected": -0.9833052754402161, "logps/chosen": -7.266734600067139, "logps/rejected": -66.09844207763672, "loss": 0.27793920040130615, "memory(GiB)": 46.82, "nll_loss": 0.2126695215702057, "rewards/accuracies": 0.9375, "rewards/chosen": 0.08487731218338013, "rewards/margins": 5.504128456115723, "rewards/rejected": -5.419251441955566, "step": 361, "train_speed(iter/s)": 0.005338 }, { "epoch": 0.9399545602077247, "grad_norm": 1.6952695846557617, "learning_rate": 0.00011816368509794364, "logits/chosen": -0.9289021492004395, "logits/rejected": -0.933040201663971, "logps/chosen": -8.65612506866455, "logps/rejected": -65.69309997558594, "loss": 0.3674156665802002, "memory(GiB)": 46.82, "nll_loss": 0.3314497768878937, "rewards/accuracies": 0.96875, "rewards/chosen": 0.4269205629825592, "rewards/margins": 5.734676837921143, "rewards/rejected": -5.307756423950195, "step": 362, "train_speed(iter/s)": 0.005338 }, { "epoch": 0.9425511197663097, "grad_norm": 1.0782965421676636, "learning_rate": 0.00011774090109517551, "logits/chosen": -0.946650505065918, "logits/rejected": -0.9464154243469238, "logps/chosen": -5.612125396728516, "logps/rejected": -56.009986877441406, "loss": 0.30003514885902405, "memory(GiB)": 46.82, "nll_loss": 0.2715224027633667, "rewards/accuracies": 1.0, "rewards/chosen": 0.2884294390678406, "rewards/margins": 5.06643009185791, "rewards/rejected": -4.778000354766846, "step": 363, "train_speed(iter/s)": 0.005339 }, { "epoch": 0.9451476793248945, "grad_norm": 7.0804009437561035, "learning_rate": 0.00011731778941990496, "logits/chosen": -0.9121062755584717, "logits/rejected": -0.9164551496505737, "logps/chosen": -9.16533088684082, "logps/rejected": -54.61601257324219, "loss": 0.5863555073738098, "memory(GiB)": 46.82, "nll_loss": 0.43649864196777344, "rewards/accuracies": 0.9375, "rewards/chosen": 0.23763269186019897, "rewards/margins": 4.418910026550293, "rewards/rejected": -4.181277275085449, "step": 364, "train_speed(iter/s)": 0.00534 }, { "epoch": 0.9477442388834794, "grad_norm": 1.0685062408447266, "learning_rate": 0.00011689435788695844, "logits/chosen": -0.9457142353057861, "logits/rejected": -0.946734607219696, "logps/chosen": -7.535189151763916, "logps/rejected": -57.889957427978516, "loss": 0.3278339207172394, "memory(GiB)": 46.82, "nll_loss": 0.3113463819026947, "rewards/accuracies": 1.0, "rewards/chosen": 0.2534429132938385, "rewards/margins": 5.122234344482422, "rewards/rejected": -4.868791103363037, "step": 365, "train_speed(iter/s)": 0.00534 }, { "epoch": 0.9503407984420643, "grad_norm": 18.325923919677734, "learning_rate": 0.00011647061431707, "logits/chosen": -0.9664883017539978, "logits/rejected": -0.9706634283065796, "logps/chosen": -8.00462818145752, "logps/rejected": -58.485496520996094, "loss": 0.5252708792686462, "memory(GiB)": 46.82, "nll_loss": 0.40657514333724976, "rewards/accuracies": 0.96875, "rewards/chosen": 0.16244688630104065, "rewards/margins": 4.640269756317139, "rewards/rejected": -4.477822303771973, "step": 366, "train_speed(iter/s)": 0.00534 }, { "epoch": 0.9529373580006492, "grad_norm": 1.7476553916931152, "learning_rate": 0.00011604656653673707, "logits/chosen": -0.9371016025543213, "logits/rejected": -0.9420011639595032, "logps/chosen": -8.489301681518555, "logps/rejected": -60.067012786865234, "loss": 0.2864355146884918, "memory(GiB)": 46.82, "nll_loss": 0.2481742799282074, "rewards/accuracies": 1.0, "rewards/chosen": 0.3987981975078583, "rewards/margins": 5.001021862030029, "rewards/rejected": -4.602223873138428, "step": 367, "train_speed(iter/s)": 0.00534 }, { "epoch": 0.955533917559234, "grad_norm": 0.7240554094314575, "learning_rate": 0.0001156222223780757, "logits/chosen": -0.9764981865882874, "logits/rejected": -0.9823321104049683, "logps/chosen": -3.561066150665283, "logps/rejected": -64.69168853759766, "loss": 0.15193597972393036, "memory(GiB)": 46.82, "nll_loss": 0.13965152204036713, "rewards/accuracies": 1.0, "rewards/chosen": 0.31303656101226807, "rewards/margins": 5.628165245056152, "rewards/rejected": -5.315129280090332, "step": 368, "train_speed(iter/s)": 0.00534 }, { "epoch": 0.9581304771178188, "grad_norm": 0.8999217748641968, "learning_rate": 0.00011519758967867606, "logits/chosen": -0.9562562704086304, "logits/rejected": -0.9621536731719971, "logps/chosen": -4.751138210296631, "logps/rejected": -66.24119567871094, "loss": 0.19877935945987701, "memory(GiB)": 46.82, "nll_loss": 0.17447549104690552, "rewards/accuracies": 1.0, "rewards/chosen": 0.2585357129573822, "rewards/margins": 5.8691558837890625, "rewards/rejected": -5.610620498657227, "step": 369, "train_speed(iter/s)": 0.00534 }, { "epoch": 0.9607270366764038, "grad_norm": 7.604972839355469, "learning_rate": 0.00011477267628145776, "logits/chosen": -0.9861749410629272, "logits/rejected": -0.9912722706794739, "logps/chosen": -7.531174182891846, "logps/rejected": -59.80250549316406, "loss": 0.43909671902656555, "memory(GiB)": 46.82, "nll_loss": 0.34136056900024414, "rewards/accuracies": 0.96875, "rewards/chosen": 0.14466743171215057, "rewards/margins": 4.875586986541748, "rewards/rejected": -4.730918884277344, "step": 370, "train_speed(iter/s)": 0.005341 }, { "epoch": 0.9633235962349886, "grad_norm": 1.2200195789337158, "learning_rate": 0.00011434749003452467, "logits/chosen": -1.0024657249450684, "logits/rejected": -1.0117108821868896, "logps/chosen": -4.926345348358154, "logps/rejected": -64.41602325439453, "loss": 0.24037624895572662, "memory(GiB)": 46.82, "nll_loss": 0.19864444434642792, "rewards/accuracies": 0.96875, "rewards/chosen": 0.3361244201660156, "rewards/margins": 5.382260322570801, "rewards/rejected": -5.046136379241943, "step": 371, "train_speed(iter/s)": 0.005341 }, { "epoch": 0.9659201557935735, "grad_norm": 1.4470072984695435, "learning_rate": 0.00011392203879102025, "logits/chosen": -0.9764466881752014, "logits/rejected": -0.984937846660614, "logps/chosen": -4.395660400390625, "logps/rejected": -72.33343505859375, "loss": 0.21519267559051514, "memory(GiB)": 46.82, "nll_loss": 0.16430063545703888, "rewards/accuracies": 1.0, "rewards/chosen": 0.4711214303970337, "rewards/margins": 6.096909046173096, "rewards/rejected": -5.625787734985352, "step": 372, "train_speed(iter/s)": 0.005341 }, { "epoch": 0.9685167153521584, "grad_norm": 3.041203737258911, "learning_rate": 0.00011349633040898247, "logits/chosen": -1.0063599348068237, "logits/rejected": -1.015335202217102, "logps/chosen": -5.668739318847656, "logps/rejected": -67.33605194091797, "loss": 0.2572421133518219, "memory(GiB)": 46.82, "nll_loss": 0.1989455670118332, "rewards/accuracies": 0.96875, "rewards/chosen": 0.4027881622314453, "rewards/margins": 5.818880558013916, "rewards/rejected": -5.416092872619629, "step": 373, "train_speed(iter/s)": 0.005341 }, { "epoch": 0.9711132749107433, "grad_norm": 6.189421653747559, "learning_rate": 0.00011307037275119853, "logits/chosen": -1.072676181793213, "logits/rejected": -1.0726059675216675, "logps/chosen": -11.18874454498291, "logps/rejected": -57.087642669677734, "loss": 0.6298056840896606, "memory(GiB)": 46.82, "nll_loss": 0.4115663468837738, "rewards/accuracies": 0.96875, "rewards/chosen": 0.14192688465118408, "rewards/margins": 4.86482572555542, "rewards/rejected": -4.722898483276367, "step": 374, "train_speed(iter/s)": 0.005342 }, { "epoch": 0.9737098344693281, "grad_norm": 7.813536167144775, "learning_rate": 0.00011264417368505981, "logits/chosen": -0.9870294332504272, "logits/rejected": -0.9871564507484436, "logps/chosen": -7.496246337890625, "logps/rejected": -55.7673454284668, "loss": 0.5474833846092224, "memory(GiB)": 46.82, "nll_loss": 0.4691420793533325, "rewards/accuracies": 0.96875, "rewards/chosen": 0.2661711573600769, "rewards/margins": 4.8272881507873535, "rewards/rejected": -4.561116695404053, "step": 375, "train_speed(iter/s)": 0.005342 }, { "epoch": 0.976306394027913, "grad_norm": 1.4118865728378296, "learning_rate": 0.00011221774108241645, "logits/chosen": -1.0178087949752808, "logits/rejected": -1.0260872840881348, "logps/chosen": -4.35853910446167, "logps/rejected": -63.377872467041016, "loss": 0.2507343292236328, "memory(GiB)": 46.82, "nll_loss": 0.17132747173309326, "rewards/accuracies": 0.96875, "rewards/chosen": 0.22918272018432617, "rewards/margins": 5.319854736328125, "rewards/rejected": -5.090672016143799, "step": 376, "train_speed(iter/s)": 0.005342 }, { "epoch": 0.9789029535864979, "grad_norm": 1.3914563655853271, "learning_rate": 0.0001117910828194319, "logits/chosen": -1.004896640777588, "logits/rejected": -1.000983715057373, "logps/chosen": -7.156683444976807, "logps/rejected": -54.51406478881836, "loss": 0.30924680829048157, "memory(GiB)": 46.82, "nll_loss": 0.25739455223083496, "rewards/accuracies": 0.96875, "rewards/chosen": 0.24743176996707916, "rewards/margins": 4.668411731719971, "rewards/rejected": -4.4209794998168945, "step": 377, "train_speed(iter/s)": 0.005343 }, { "epoch": 0.9814995131450828, "grad_norm": 2.6997230052948, "learning_rate": 0.00011136420677643762, "logits/chosen": -1.02091646194458, "logits/rejected": -1.0249969959259033, "logps/chosen": -5.773136615753174, "logps/rejected": -64.33428955078125, "loss": 0.4387259781360626, "memory(GiB)": 46.82, "nll_loss": 0.31376269459724426, "rewards/accuracies": 0.9375, "rewards/chosen": 0.2982335686683655, "rewards/margins": 5.575780391693115, "rewards/rejected": -5.2775468826293945, "step": 378, "train_speed(iter/s)": 0.005343 }, { "epoch": 0.9840960727036676, "grad_norm": 2.8990633487701416, "learning_rate": 0.00011093712083778746, "logits/chosen": -1.0018008947372437, "logits/rejected": -1.0064812898635864, "logps/chosen": -6.614377021789551, "logps/rejected": -67.86730194091797, "loss": 0.309373140335083, "memory(GiB)": 46.82, "nll_loss": 0.2491704821586609, "rewards/accuracies": 0.96875, "rewards/chosen": 0.311954140663147, "rewards/margins": 5.89847469329834, "rewards/rejected": -5.586519718170166, "step": 379, "train_speed(iter/s)": 0.005343 }, { "epoch": 0.9866926322622526, "grad_norm": 1.8598626852035522, "learning_rate": 0.00011050983289171195, "logits/chosen": -1.0007565021514893, "logits/rejected": -1.0053094625473022, "logps/chosen": -4.953035354614258, "logps/rejected": -60.55445861816406, "loss": 0.22382761538028717, "memory(GiB)": 46.82, "nll_loss": 0.1699100136756897, "rewards/accuracies": 0.96875, "rewards/chosen": 0.2609115540981293, "rewards/margins": 5.4445085525512695, "rewards/rejected": -5.183596134185791, "step": 380, "train_speed(iter/s)": 0.005343 }, { "epoch": 0.9892891918208374, "grad_norm": 2.610196828842163, "learning_rate": 0.00011008235083017271, "logits/chosen": -1.0573437213897705, "logits/rejected": -1.059203028678894, "logps/chosen": -5.614582538604736, "logps/rejected": -67.13617706298828, "loss": 0.32841193675994873, "memory(GiB)": 46.82, "nll_loss": 0.21658550202846527, "rewards/accuracies": 0.96875, "rewards/chosen": 0.1962202787399292, "rewards/margins": 5.73972225189209, "rewards/rejected": -5.543501853942871, "step": 381, "train_speed(iter/s)": 0.005343 }, { "epoch": 0.9918857513794223, "grad_norm": 2.123706102371216, "learning_rate": 0.00010965468254871669, "logits/chosen": -1.0279793739318848, "logits/rejected": -1.027879238128662, "logps/chosen": -7.853454113006592, "logps/rejected": -57.6713752746582, "loss": 0.3230496346950531, "memory(GiB)": 46.82, "nll_loss": 0.2656661570072174, "rewards/accuracies": 1.0, "rewards/chosen": 0.1339038908481598, "rewards/margins": 4.969094276428223, "rewards/rejected": -4.835190296173096, "step": 382, "train_speed(iter/s)": 0.005343 }, { "epoch": 0.9944823109380071, "grad_norm": 1.48650062084198, "learning_rate": 0.00010922683594633021, "logits/chosen": -1.0191617012023926, "logits/rejected": -1.0311510562896729, "logps/chosen": -5.478486061096191, "logps/rejected": -63.874629974365234, "loss": 0.2811015844345093, "memory(GiB)": 46.82, "nll_loss": 0.2152327299118042, "rewards/accuracies": 0.96875, "rewards/chosen": 0.2903039753437042, "rewards/margins": 5.215958118438721, "rewards/rejected": -4.92565393447876, "step": 383, "train_speed(iter/s)": 0.005343 }, { "epoch": 0.997078870496592, "grad_norm": 6.09173059463501, "learning_rate": 0.00010879881892529324, "logits/chosen": -1.013049602508545, "logits/rejected": -1.0167346000671387, "logps/chosen": -6.224278450012207, "logps/rejected": -59.02324295043945, "loss": 0.29393669962882996, "memory(GiB)": 46.82, "nll_loss": 0.21503983438014984, "rewards/accuracies": 0.96875, "rewards/chosen": 0.43577679991722107, "rewards/margins": 4.863895416259766, "rewards/rejected": -4.428118705749512, "step": 384, "train_speed(iter/s)": 0.005343 }, { "epoch": 0.9996754300551769, "grad_norm": 3.398437976837158, "learning_rate": 0.00010837063939103332, "logits/chosen": -1.006939172744751, "logits/rejected": -1.0076408386230469, "logps/chosen": -7.99960470199585, "logps/rejected": -55.3328971862793, "loss": 0.586876392364502, "memory(GiB)": 46.82, "nll_loss": 0.4625084102153778, "rewards/accuracies": 0.96875, "rewards/chosen": 0.061562374234199524, "rewards/margins": 4.382445812225342, "rewards/rejected": -4.320883750915527, "step": 385, "train_speed(iter/s)": 0.005343 }, { "epoch": 1.0, "grad_norm": 3.398437976837158, "learning_rate": 0.0001079423052519796, "logits/chosen": -1.0445483922958374, "logits/rejected": -1.067384958267212, "logps/chosen": -0.5868608355522156, "logps/rejected": -66.0391616821289, "loss": 0.007936220616102219, "memory(GiB)": 46.82, "nll_loss": 0.04896550625562668, "rewards/accuracies": 1.0, "rewards/chosen": 0.21240469813346863, "rewards/margins": 5.356934070587158, "rewards/rejected": -5.144529819488525, "step": 386, "train_speed(iter/s)": 0.005355 }, { "epoch": 1.0025965595585848, "grad_norm": 19.228408813476562, "learning_rate": 0.00010751382441941678, "logits/chosen": -0.9817072749137878, "logits/rejected": -0.9876554012298584, "logps/chosen": -10.516595840454102, "logps/rejected": -58.05045700073242, "loss": 0.6290792226791382, "memory(GiB)": 46.82, "nll_loss": 0.4879079759120941, "rewards/accuracies": 0.96875, "rewards/chosen": 0.6398650407791138, "rewards/margins": 4.8145246505737305, "rewards/rejected": -4.174659729003906, "step": 387, "train_speed(iter/s)": 0.005355 }, { "epoch": 1.0051931191171697, "grad_norm": 20.29606819152832, "learning_rate": 0.00010708520480733894, "logits/chosen": -0.9528878331184387, "logits/rejected": -0.9571166038513184, "logps/chosen": -5.756232738494873, "logps/rejected": -55.34486389160156, "loss": 0.36920851469039917, "memory(GiB)": 46.82, "nll_loss": 0.3217727243900299, "rewards/accuracies": 0.96875, "rewards/chosen": 0.43254968523979187, "rewards/margins": 4.792313575744629, "rewards/rejected": -4.3597636222839355, "step": 388, "train_speed(iter/s)": 0.005355 }, { "epoch": 1.0077896786757545, "grad_norm": 1.2253527641296387, "learning_rate": 0.00010665645433230344, "logits/chosen": -0.963991105556488, "logits/rejected": -0.9693760275840759, "logps/chosen": -4.665340900421143, "logps/rejected": -49.67149353027344, "loss": 0.2663205564022064, "memory(GiB)": 46.82, "nll_loss": 0.2073584645986557, "rewards/accuracies": 1.0, "rewards/chosen": 0.5366206765174866, "rewards/margins": 4.278485298156738, "rewards/rejected": -3.7418649196624756, "step": 389, "train_speed(iter/s)": 0.005356 }, { "epoch": 1.0103862382343396, "grad_norm": 1.7141112089157104, "learning_rate": 0.00010622758091328469, "logits/chosen": -0.9876523613929749, "logits/rejected": -0.9932205677032471, "logps/chosen": -5.421288967132568, "logps/rejected": -53.175601959228516, "loss": 0.2864997982978821, "memory(GiB)": 46.82, "nll_loss": 0.22578980028629303, "rewards/accuracies": 1.0, "rewards/chosen": 0.650011420249939, "rewards/margins": 4.690655708312988, "rewards/rejected": -4.04064416885376, "step": 390, "train_speed(iter/s)": 0.005355 }, { "epoch": 1.0129827977929244, "grad_norm": 0.9784797430038452, "learning_rate": 0.00010579859247152772, "logits/chosen": -0.9702428579330444, "logits/rejected": -0.9770087599754333, "logps/chosen": -3.717294692993164, "logps/rejected": -54.88421630859375, "loss": 0.18811215460300446, "memory(GiB)": 46.82, "nll_loss": 0.15398232638835907, "rewards/accuracies": 1.0, "rewards/chosen": 0.5122168660163879, "rewards/margins": 4.824542999267578, "rewards/rejected": -4.312326431274414, "step": 391, "train_speed(iter/s)": 0.005356 }, { "epoch": 1.0155793573515093, "grad_norm": 1.4829105138778687, "learning_rate": 0.00010536949693040224, "logits/chosen": -0.9901302456855774, "logits/rejected": -0.9919001460075378, "logps/chosen": -4.703402519226074, "logps/rejected": -46.348514556884766, "loss": 0.23413625359535217, "memory(GiB)": 46.82, "nll_loss": 0.1849011927843094, "rewards/accuracies": 1.0, "rewards/chosen": 0.5978916883468628, "rewards/margins": 4.413217544555664, "rewards/rejected": -3.8153257369995117, "step": 392, "train_speed(iter/s)": 0.005356 }, { "epoch": 1.0181759169100941, "grad_norm": 0.8022202253341675, "learning_rate": 0.00010494030221525581, "logits/chosen": -1.0340824127197266, "logits/rejected": -1.040837049484253, "logps/chosen": -6.395625114440918, "logps/rejected": -58.842002868652344, "loss": 0.23915542662143707, "memory(GiB)": 46.82, "nll_loss": 0.2224937230348587, "rewards/accuracies": 1.0, "rewards/chosen": 0.25003036856651306, "rewards/margins": 4.86290168762207, "rewards/rejected": -4.612870693206787, "step": 393, "train_speed(iter/s)": 0.005356 }, { "epoch": 1.020772476468679, "grad_norm": 2.875991106033325, "learning_rate": 0.00010451101625326798, "logits/chosen": -1.0399117469787598, "logits/rejected": -1.0477368831634521, "logps/chosen": -5.4347615242004395, "logps/rejected": -62.94850158691406, "loss": 0.2218306064605713, "memory(GiB)": 46.82, "nll_loss": 0.18997295200824738, "rewards/accuracies": 1.0, "rewards/chosen": 0.5420814752578735, "rewards/margins": 5.414422988891602, "rewards/rejected": -4.872342109680176, "step": 394, "train_speed(iter/s)": 0.005355 }, { "epoch": 1.0233690360272638, "grad_norm": 2.076349973678589, "learning_rate": 0.00010408164697330347, "logits/chosen": -1.0666667222976685, "logits/rejected": -1.072896122932434, "logps/chosen": -4.46807336807251, "logps/rejected": -63.26573944091797, "loss": 0.25682011246681213, "memory(GiB)": 46.82, "nll_loss": 0.2303263247013092, "rewards/accuracies": 1.0, "rewards/chosen": 0.3944869935512543, "rewards/margins": 5.512956619262695, "rewards/rejected": -5.118469715118408, "step": 395, "train_speed(iter/s)": 0.005355 }, { "epoch": 1.0259655955858487, "grad_norm": 0.7809150815010071, "learning_rate": 0.0001036522023057659, "logits/chosen": -1.0214073657989502, "logits/rejected": -1.0335733890533447, "logps/chosen": -6.993215560913086, "logps/rejected": -76.31700134277344, "loss": 0.2290063351392746, "memory(GiB)": 46.82, "nll_loss": 0.21447491645812988, "rewards/accuracies": 1.0, "rewards/chosen": 0.6252080202102661, "rewards/margins": 6.392251014709473, "rewards/rejected": -5.767043113708496, "step": 396, "train_speed(iter/s)": 0.005355 }, { "epoch": 1.0285621551444337, "grad_norm": 0.9348388910293579, "learning_rate": 0.00010322269018245128, "logits/chosen": -1.0821815729141235, "logits/rejected": -1.09281587600708, "logps/chosen": -5.995283126831055, "logps/rejected": -68.71944427490234, "loss": 0.2534785866737366, "memory(GiB)": 46.82, "nll_loss": 0.23875081539154053, "rewards/accuracies": 1.0, "rewards/chosen": 0.42260050773620605, "rewards/margins": 6.026902198791504, "rewards/rejected": -5.604302406311035, "step": 397, "train_speed(iter/s)": 0.005355 }, { "epoch": 1.0311587147030186, "grad_norm": 2.3803582191467285, "learning_rate": 0.00010279311853640156, "logits/chosen": -1.0678625106811523, "logits/rejected": -1.0740766525268555, "logps/chosen": -4.724799633026123, "logps/rejected": -59.92235565185547, "loss": 0.26597142219543457, "memory(GiB)": 46.82, "nll_loss": 0.21491315960884094, "rewards/accuracies": 1.0, "rewards/chosen": 0.3383842706680298, "rewards/margins": 5.239107131958008, "rewards/rejected": -4.900722503662109, "step": 398, "train_speed(iter/s)": 0.005355 }, { "epoch": 1.0337552742616034, "grad_norm": 0.9540591835975647, "learning_rate": 0.00010236349530175806, "logits/chosen": -1.101372480392456, "logits/rejected": -1.1012152433395386, "logps/chosen": -8.496014595031738, "logps/rejected": -63.654239654541016, "loss": 0.2421647608280182, "memory(GiB)": 46.82, "nll_loss": 0.229741632938385, "rewards/accuracies": 1.0, "rewards/chosen": 0.5306934118270874, "rewards/margins": 5.865250587463379, "rewards/rejected": -5.33455753326416, "step": 399, "train_speed(iter/s)": 0.005355 }, { "epoch": 1.0363518338201883, "grad_norm": 38.899085998535156, "learning_rate": 0.0001019338284136149, "logits/chosen": -1.141862154006958, "logits/rejected": -1.1475955247879028, "logps/chosen": -7.130688667297363, "logps/rejected": -71.88350677490234, "loss": 0.2930022180080414, "memory(GiB)": 46.82, "nll_loss": 0.2670814096927643, "rewards/accuracies": 1.0, "rewards/chosen": 0.2902993857860565, "rewards/margins": 5.992380142211914, "rewards/rejected": -5.702080726623535, "step": 400, "train_speed(iter/s)": 0.005355 }, { "epoch": 1.038948393378773, "grad_norm": 2.7088816165924072, "learning_rate": 0.0001015041258078725, "logits/chosen": -1.1285897493362427, "logits/rejected": -1.1310758590698242, "logps/chosen": -5.603566646575928, "logps/rejected": -61.33863067626953, "loss": 0.3561743497848511, "memory(GiB)": 46.82, "nll_loss": 0.2987910509109497, "rewards/accuracies": 0.96875, "rewards/chosen": 0.5551941990852356, "rewards/margins": 5.580060005187988, "rewards/rejected": -5.024865627288818, "step": 401, "train_speed(iter/s)": 0.005353 }, { "epoch": 1.041544952937358, "grad_norm": 0.8148896098136902, "learning_rate": 0.00010107439542109096, "logits/chosen": -1.121638298034668, "logits/rejected": -1.1334351301193237, "logps/chosen": -3.9921107292175293, "logps/rejected": -73.31179809570312, "loss": 0.18677955865859985, "memory(GiB)": 46.82, "nll_loss": 0.1822265237569809, "rewards/accuracies": 1.0, "rewards/chosen": 0.5457329750061035, "rewards/margins": 6.892066955566406, "rewards/rejected": -6.346334457397461, "step": 402, "train_speed(iter/s)": 0.005353 }, { "epoch": 1.0441415124959428, "grad_norm": 1.029624104499817, "learning_rate": 0.00010064464519034358, "logits/chosen": -1.1337131261825562, "logits/rejected": -1.1473417282104492, "logps/chosen": -4.090713024139404, "logps/rejected": -77.2343978881836, "loss": 0.21103273332118988, "memory(GiB)": 46.82, "nll_loss": 0.18134111166000366, "rewards/accuracies": 0.96875, "rewards/chosen": 0.30427786707878113, "rewards/margins": 6.670842170715332, "rewards/rejected": -6.366564750671387, "step": 403, "train_speed(iter/s)": 0.005353 }, { "epoch": 1.0467380720545278, "grad_norm": 1.2710298299789429, "learning_rate": 0.00010021488305307002, "logits/chosen": -1.1442415714263916, "logits/rejected": -1.1480284929275513, "logps/chosen": -4.857927322387695, "logps/rejected": -64.70890045166016, "loss": 0.24422866106033325, "memory(GiB)": 46.82, "nll_loss": 0.21266308426856995, "rewards/accuracies": 1.0, "rewards/chosen": 0.46621280908584595, "rewards/margins": 5.662542343139648, "rewards/rejected": -5.1963300704956055, "step": 404, "train_speed(iter/s)": 0.005352 }, { "epoch": 1.0493346316131127, "grad_norm": 0.7117511034011841, "learning_rate": 9.978511694692999e-05, "logits/chosen": -1.1403015851974487, "logits/rejected": -1.1483004093170166, "logps/chosen": -6.501082897186279, "logps/rejected": -68.161865234375, "loss": 0.2804066836833954, "memory(GiB)": 46.82, "nll_loss": 0.22950297594070435, "rewards/accuracies": 0.96875, "rewards/chosen": 0.26065731048583984, "rewards/margins": 5.946385383605957, "rewards/rejected": -5.685728073120117, "step": 405, "train_speed(iter/s)": 0.005352 }, { "epoch": 1.0519311911716975, "grad_norm": 1.8634769916534424, "learning_rate": 9.935535480965648e-05, "logits/chosen": -1.174145221710205, "logits/rejected": -1.1830925941467285, "logps/chosen": -5.915862083435059, "logps/rejected": -81.09744262695312, "loss": 0.18793915212154388, "memory(GiB)": 46.82, "nll_loss": 0.18054337799549103, "rewards/accuracies": 1.0, "rewards/chosen": 0.49257692694664, "rewards/margins": 6.884129047393799, "rewards/rejected": -6.391551971435547, "step": 406, "train_speed(iter/s)": 0.005352 }, { "epoch": 1.0545277507302824, "grad_norm": 2.999732732772827, "learning_rate": 9.892560457890906e-05, "logits/chosen": -1.1771910190582275, "logits/rejected": -1.182723045349121, "logps/chosen": -4.092665672302246, "logps/rejected": -75.03519439697266, "loss": 0.2703268527984619, "memory(GiB)": 46.82, "nll_loss": 0.217498779296875, "rewards/accuracies": 1.0, "rewards/chosen": 0.5273224115371704, "rewards/margins": 6.906276226043701, "rewards/rejected": -6.378953456878662, "step": 407, "train_speed(iter/s)": 0.005352 }, { "epoch": 1.0571243102888672, "grad_norm": 1.1191706657409668, "learning_rate": 9.849587419212751e-05, "logits/chosen": -1.1794843673706055, "logits/rejected": -1.1921828985214233, "logps/chosen": -2.9631309509277344, "logps/rejected": -65.27130126953125, "loss": 0.15160685777664185, "memory(GiB)": 46.82, "nll_loss": 0.12793675065040588, "rewards/accuracies": 1.0, "rewards/chosen": 0.5282881855964661, "rewards/margins": 6.006821155548096, "rewards/rejected": -5.478532791137695, "step": 408, "train_speed(iter/s)": 0.005352 }, { "epoch": 1.059720869847452, "grad_norm": 1.0475082397460938, "learning_rate": 9.806617158638515e-05, "logits/chosen": -1.2007383108139038, "logits/rejected": -1.2024704217910767, "logps/chosen": -7.0153350830078125, "logps/rejected": -73.69622039794922, "loss": 0.22654809057712555, "memory(GiB)": 46.82, "nll_loss": 0.21019339561462402, "rewards/accuracies": 1.0, "rewards/chosen": 0.3381541073322296, "rewards/margins": 6.361845970153809, "rewards/rejected": -6.023691654205322, "step": 409, "train_speed(iter/s)": 0.005352 }, { "epoch": 1.062317429406037, "grad_norm": 0.9155303835868835, "learning_rate": 9.763650469824196e-05, "logits/chosen": -1.1522904634475708, "logits/rejected": -1.1580644845962524, "logps/chosen": -7.180323600769043, "logps/rejected": -70.96688842773438, "loss": 0.23980437219142914, "memory(GiB)": 46.82, "nll_loss": 0.23318149149417877, "rewards/accuracies": 1.0, "rewards/chosen": 0.4015149474143982, "rewards/margins": 6.299011707305908, "rewards/rejected": -5.897497177124023, "step": 410, "train_speed(iter/s)": 0.005352 }, { "epoch": 1.064913988964622, "grad_norm": 10.754075050354004, "learning_rate": 9.720688146359843e-05, "logits/chosen": -1.189253568649292, "logits/rejected": -1.1925952434539795, "logps/chosen": -9.017038345336914, "logps/rejected": -68.37117767333984, "loss": 0.346275269985199, "memory(GiB)": 46.82, "nll_loss": 0.2631103992462158, "rewards/accuracies": 0.96875, "rewards/chosen": 0.2936975359916687, "rewards/margins": 6.014129161834717, "rewards/rejected": -5.720431327819824, "step": 411, "train_speed(iter/s)": 0.005352 }, { "epoch": 1.0675105485232068, "grad_norm": 5.042325019836426, "learning_rate": 9.677730981754876e-05, "logits/chosen": -1.2106777429580688, "logits/rejected": -1.2027477025985718, "logps/chosen": -10.420255661010742, "logps/rejected": -61.35327911376953, "loss": 0.35904085636138916, "memory(GiB)": 46.82, "nll_loss": 0.3351891040802002, "rewards/accuracies": 1.0, "rewards/chosen": 0.5399136543273926, "rewards/margins": 5.419702529907227, "rewards/rejected": -4.879788875579834, "step": 412, "train_speed(iter/s)": 0.005352 }, { "epoch": 1.0701071080817917, "grad_norm": 1.102660894393921, "learning_rate": 9.63477976942341e-05, "logits/chosen": -1.2155516147613525, "logits/rejected": -1.2208374738693237, "logps/chosen": -4.927253723144531, "logps/rejected": -68.66384887695312, "loss": 0.2387477606534958, "memory(GiB)": 46.82, "nll_loss": 0.20795047283172607, "rewards/accuracies": 1.0, "rewards/chosen": 0.48150452971458435, "rewards/margins": 6.018568992614746, "rewards/rejected": -5.537064552307129, "step": 413, "train_speed(iter/s)": 0.005352 }, { "epoch": 1.0727036676403765, "grad_norm": 2.5885398387908936, "learning_rate": 9.591835302669657e-05, "logits/chosen": -1.2256488800048828, "logits/rejected": -1.2182636260986328, "logps/chosen": -7.875158309936523, "logps/rejected": -61.765113830566406, "loss": 0.28974008560180664, "memory(GiB)": 46.82, "nll_loss": 0.25022780895233154, "rewards/accuracies": 0.96875, "rewards/chosen": 0.4521024823188782, "rewards/margins": 5.778402328491211, "rewards/rejected": -5.326300144195557, "step": 414, "train_speed(iter/s)": 0.005352 }, { "epoch": 1.0753002271989613, "grad_norm": 2.834430456161499, "learning_rate": 9.548898374673204e-05, "logits/chosen": -1.2157726287841797, "logits/rejected": -1.220966100692749, "logps/chosen": -3.8334553241729736, "logps/rejected": -61.09181213378906, "loss": 0.41990533471107483, "memory(GiB)": 46.82, "nll_loss": 0.3681584596633911, "rewards/accuracies": 0.96875, "rewards/chosen": 0.19060057401657104, "rewards/margins": 5.299651622772217, "rewards/rejected": -5.109050750732422, "step": 415, "train_speed(iter/s)": 0.005352 }, { "epoch": 1.0778967867575462, "grad_norm": 1.1838082075119019, "learning_rate": 9.505969778474417e-05, "logits/chosen": -1.2442048788070679, "logits/rejected": -1.2560878992080688, "logps/chosen": -6.319258689880371, "logps/rejected": -69.6029052734375, "loss": 0.3231492340564728, "memory(GiB)": 46.82, "nll_loss": 0.30189916491508484, "rewards/accuracies": 1.0, "rewards/chosen": 0.43841037154197693, "rewards/margins": 6.017553329467773, "rewards/rejected": -5.5791425704956055, "step": 416, "train_speed(iter/s)": 0.005351 }, { "epoch": 1.080493346316131, "grad_norm": 1.357805609703064, "learning_rate": 9.463050306959781e-05, "logits/chosen": -1.2448838949203491, "logits/rejected": -1.2514715194702148, "logps/chosen": -4.3993000984191895, "logps/rejected": -73.56219482421875, "loss": 0.1892472356557846, "memory(GiB)": 46.82, "nll_loss": 0.16478529572486877, "rewards/accuracies": 1.0, "rewards/chosen": 0.26193705201148987, "rewards/margins": 6.293513298034668, "rewards/rejected": -6.031576156616211, "step": 417, "train_speed(iter/s)": 0.005351 }, { "epoch": 1.083089905874716, "grad_norm": 0.948700487613678, "learning_rate": 9.42014075284723e-05, "logits/chosen": -1.2140638828277588, "logits/rejected": -1.2203437089920044, "logps/chosen": -5.3918375968933105, "logps/rejected": -79.55841064453125, "loss": 0.1978967785835266, "memory(GiB)": 46.82, "nll_loss": 0.18335530161857605, "rewards/accuracies": 1.0, "rewards/chosen": 0.5024500489234924, "rewards/margins": 6.943933963775635, "rewards/rejected": -6.441484451293945, "step": 418, "train_speed(iter/s)": 0.005351 }, { "epoch": 1.085686465433301, "grad_norm": 0.8673838376998901, "learning_rate": 9.377241908671532e-05, "logits/chosen": -1.2066748142242432, "logits/rejected": -1.2199989557266235, "logps/chosen": -2.639554738998413, "logps/rejected": -72.2052001953125, "loss": 0.1263066977262497, "memory(GiB)": 46.82, "nll_loss": 0.09473444521427155, "rewards/accuracies": 1.0, "rewards/chosen": 0.511016845703125, "rewards/margins": 6.307302474975586, "rewards/rejected": -5.796286106109619, "step": 419, "train_speed(iter/s)": 0.005351 }, { "epoch": 1.0882830249918858, "grad_norm": 6.662075996398926, "learning_rate": 9.334354566769658e-05, "logits/chosen": -1.2155200242996216, "logits/rejected": -1.2136273384094238, "logps/chosen": -5.998470306396484, "logps/rejected": -68.34226989746094, "loss": 0.24206891655921936, "memory(GiB)": 46.82, "nll_loss": 0.17550605535507202, "rewards/accuracies": 0.96875, "rewards/chosen": 0.3885684013366699, "rewards/margins": 6.167290210723877, "rewards/rejected": -5.778721809387207, "step": 420, "train_speed(iter/s)": 0.005351 }, { "epoch": 1.0908795845504706, "grad_norm": 3.4863972663879395, "learning_rate": 9.291479519266108e-05, "logits/chosen": -1.1982496976852417, "logits/rejected": -1.2094392776489258, "logps/chosen": -4.311284065246582, "logps/rejected": -67.43600463867188, "loss": 0.24855858087539673, "memory(GiB)": 46.82, "nll_loss": 0.19574138522148132, "rewards/accuracies": 0.96875, "rewards/chosen": 0.373134583234787, "rewards/margins": 5.80324125289917, "rewards/rejected": -5.430107116699219, "step": 421, "train_speed(iter/s)": 0.005352 }, { "epoch": 1.0934761441090555, "grad_norm": 3.9711451530456543, "learning_rate": 9.248617558058327e-05, "logits/chosen": -1.1784768104553223, "logits/rejected": -1.190112590789795, "logps/chosen": -5.879142761230469, "logps/rejected": -73.49214935302734, "loss": 0.22467440366744995, "memory(GiB)": 46.82, "nll_loss": 0.2147173136472702, "rewards/accuracies": 1.0, "rewards/chosen": 0.48001062870025635, "rewards/margins": 6.742798805236816, "rewards/rejected": -6.26278829574585, "step": 422, "train_speed(iter/s)": 0.005352 }, { "epoch": 1.0960727036676403, "grad_norm": 1.5909618139266968, "learning_rate": 9.205769474802044e-05, "logits/chosen": -1.225572943687439, "logits/rejected": -1.237328052520752, "logps/chosen": -3.7763729095458984, "logps/rejected": -71.20807647705078, "loss": 0.17804725468158722, "memory(GiB)": 46.82, "nll_loss": 0.1526719480752945, "rewards/accuracies": 1.0, "rewards/chosen": 0.4742431342601776, "rewards/margins": 6.401832103729248, "rewards/rejected": -5.92758846282959, "step": 423, "train_speed(iter/s)": 0.005351 }, { "epoch": 1.0986692632262252, "grad_norm": 0.8102360963821411, "learning_rate": 9.16293606089667e-05, "logits/chosen": -1.240356683731079, "logits/rejected": -1.2470406293869019, "logps/chosen": -4.268908500671387, "logps/rejected": -65.2350845336914, "loss": 0.19071687757968903, "memory(GiB)": 46.82, "nll_loss": 0.17185813188552856, "rewards/accuracies": 1.0, "rewards/chosen": 0.41862109303474426, "rewards/margins": 5.682591438293457, "rewards/rejected": -5.263970375061035, "step": 424, "train_speed(iter/s)": 0.005351 }, { "epoch": 1.1012658227848102, "grad_norm": 0.9778416156768799, "learning_rate": 9.120118107470679e-05, "logits/chosen": -1.2163119316101074, "logits/rejected": -1.2221122980117798, "logps/chosen": -4.372983455657959, "logps/rejected": -78.68803405761719, "loss": 0.20959261059761047, "memory(GiB)": 46.82, "nll_loss": 0.19133754074573517, "rewards/accuracies": 1.0, "rewards/chosen": 0.60094153881073, "rewards/margins": 7.121860504150391, "rewards/rejected": -6.520918846130371, "step": 425, "train_speed(iter/s)": 0.005351 }, { "epoch": 1.103862382343395, "grad_norm": 0.983422040939331, "learning_rate": 9.077316405366981e-05, "logits/chosen": -1.2027230262756348, "logits/rejected": -1.2142469882965088, "logps/chosen": -5.299243927001953, "logps/rejected": -76.34408569335938, "loss": 0.22110909223556519, "memory(GiB)": 46.82, "nll_loss": 0.20182488858699799, "rewards/accuracies": 1.0, "rewards/chosen": 0.34696075320243835, "rewards/margins": 6.32121467590332, "rewards/rejected": -5.9742536544799805, "step": 426, "train_speed(iter/s)": 0.005351 }, { "epoch": 1.10645894190198, "grad_norm": 2.735224723815918, "learning_rate": 9.034531745128334e-05, "logits/chosen": -1.226122498512268, "logits/rejected": -1.2391126155853271, "logps/chosen": -3.4195706844329834, "logps/rejected": -81.26631927490234, "loss": 0.18169909715652466, "memory(GiB)": 46.82, "nll_loss": 0.14818009734153748, "rewards/accuracies": 0.96875, "rewards/chosen": 0.37102988362312317, "rewards/margins": 7.223745346069336, "rewards/rejected": -6.852715492248535, "step": 427, "train_speed(iter/s)": 0.00535 }, { "epoch": 1.1090555014605648, "grad_norm": 0.81003338098526, "learning_rate": 8.991764916982731e-05, "logits/chosen": -1.2129402160644531, "logits/rejected": -1.2193183898925781, "logps/chosen": -6.524440765380859, "logps/rejected": -79.71651458740234, "loss": 0.18506552278995514, "memory(GiB)": 46.82, "nll_loss": 0.17972829937934875, "rewards/accuracies": 1.0, "rewards/chosen": 0.5361291170120239, "rewards/margins": 7.205081939697266, "rewards/rejected": -6.668951988220215, "step": 428, "train_speed(iter/s)": 0.00535 }, { "epoch": 1.1116520610191496, "grad_norm": 1.204606056213379, "learning_rate": 8.949016710828808e-05, "logits/chosen": -1.2344969511032104, "logits/rejected": -1.2368295192718506, "logps/chosen": -6.601044178009033, "logps/rejected": -65.16004943847656, "loss": 0.29616430401802063, "memory(GiB)": 46.82, "nll_loss": 0.26787662506103516, "rewards/accuracies": 1.0, "rewards/chosen": 0.29541534185409546, "rewards/margins": 5.769859313964844, "rewards/rejected": -5.4744439125061035, "step": 429, "train_speed(iter/s)": 0.00535 }, { "epoch": 1.1142486205777344, "grad_norm": 1.5188134908676147, "learning_rate": 8.906287916221259e-05, "logits/chosen": -1.2113444805145264, "logits/rejected": -1.2227927446365356, "logps/chosen": -6.77754545211792, "logps/rejected": -77.72196960449219, "loss": 0.2043219655752182, "memory(GiB)": 46.82, "nll_loss": 0.19175611436367035, "rewards/accuracies": 1.0, "rewards/chosen": 0.29821890592575073, "rewards/margins": 6.7826690673828125, "rewards/rejected": -6.484450340270996, "step": 430, "train_speed(iter/s)": 0.00535 }, { "epoch": 1.1168451801363193, "grad_norm": 56.287654876708984, "learning_rate": 8.863579322356242e-05, "logits/chosen": -1.2380510568618774, "logits/rejected": -1.2490745782852173, "logps/chosen": -4.15383768081665, "logps/rejected": -79.29361724853516, "loss": 0.2723255157470703, "memory(GiB)": 46.82, "nll_loss": 0.2262512445449829, "rewards/accuracies": 0.96875, "rewards/chosen": 0.42212826013565063, "rewards/margins": 6.8273210525512695, "rewards/rejected": -6.405192852020264, "step": 431, "train_speed(iter/s)": 0.005351 }, { "epoch": 1.1194417396949043, "grad_norm": 0.6230031251907349, "learning_rate": 8.820891718056814e-05, "logits/chosen": -1.1983201503753662, "logits/rejected": -1.2093560695648193, "logps/chosen": -2.4044957160949707, "logps/rejected": -79.75895690917969, "loss": 0.13464465737342834, "memory(GiB)": 46.82, "nll_loss": 0.11272096633911133, "rewards/accuracies": 1.0, "rewards/chosen": 0.4173327684402466, "rewards/margins": 7.142539978027344, "rewards/rejected": -6.7252068519592285, "step": 432, "train_speed(iter/s)": 0.00535 }, { "epoch": 1.1220382992534892, "grad_norm": 4.727012634277344, "learning_rate": 8.77822589175836e-05, "logits/chosen": -1.200883388519287, "logits/rejected": -1.2039451599121094, "logps/chosen": -6.484433174133301, "logps/rejected": -62.913082122802734, "loss": 0.3451792001724243, "memory(GiB)": 46.82, "nll_loss": 0.25801709294319153, "rewards/accuracies": 0.96875, "rewards/chosen": 0.5044211149215698, "rewards/margins": 5.68193244934082, "rewards/rejected": -5.1775102615356445, "step": 433, "train_speed(iter/s)": 0.00535 }, { "epoch": 1.124634858812074, "grad_norm": 0.9477587342262268, "learning_rate": 8.73558263149402e-05, "logits/chosen": -1.2326602935791016, "logits/rejected": -1.2371294498443604, "logps/chosen": -3.9643776416778564, "logps/rejected": -64.6446304321289, "loss": 0.17973466217517853, "memory(GiB)": 46.82, "nll_loss": 0.16231758892536163, "rewards/accuracies": 1.0, "rewards/chosen": 0.5142005681991577, "rewards/margins": 5.624721050262451, "rewards/rejected": -5.110519886016846, "step": 434, "train_speed(iter/s)": 0.00535 }, { "epoch": 1.1272314183706589, "grad_norm": 1.0718938112258911, "learning_rate": 8.692962724880148e-05, "logits/chosen": -1.1947612762451172, "logits/rejected": -1.1951274871826172, "logps/chosen": -11.542988777160645, "logps/rejected": -57.942604064941406, "loss": 0.4030612111091614, "memory(GiB)": 46.82, "nll_loss": 0.3767915964126587, "rewards/accuracies": 1.0, "rewards/chosen": 0.47994565963745117, "rewards/margins": 5.252399444580078, "rewards/rejected": -4.772454261779785, "step": 435, "train_speed(iter/s)": 0.00535 }, { "epoch": 1.1298279779292437, "grad_norm": 1.3139375448226929, "learning_rate": 8.650366959101757e-05, "logits/chosen": -1.2127829790115356, "logits/rejected": -1.2069275379180908, "logps/chosen": -7.090031623840332, "logps/rejected": -60.13610076904297, "loss": 0.2780110538005829, "memory(GiB)": 46.82, "nll_loss": 0.25617653131484985, "rewards/accuracies": 1.0, "rewards/chosen": 0.38807040452957153, "rewards/margins": 5.502678871154785, "rewards/rejected": -5.1146087646484375, "step": 436, "train_speed(iter/s)": 0.00535 }, { "epoch": 1.1324245374878286, "grad_norm": 2.8402469158172607, "learning_rate": 8.607796120897977e-05, "logits/chosen": -1.1895822286605835, "logits/rejected": -1.2009150981903076, "logps/chosen": -5.18463134765625, "logps/rejected": -76.09211730957031, "loss": 0.2019975334405899, "memory(GiB)": 46.82, "nll_loss": 0.1788557916879654, "rewards/accuracies": 1.0, "rewards/chosen": 0.44426459074020386, "rewards/margins": 6.382430553436279, "rewards/rejected": -5.938166618347168, "step": 437, "train_speed(iter/s)": 0.00535 }, { "epoch": 1.1350210970464134, "grad_norm": 0.8108645677566528, "learning_rate": 8.565250996547538e-05, "logits/chosen": -1.1975806951522827, "logits/rejected": -1.2050762176513672, "logps/chosen": -5.465963363647461, "logps/rejected": -73.16693878173828, "loss": 0.21301648020744324, "memory(GiB)": 46.82, "nll_loss": 0.1857440173625946, "rewards/accuracies": 1.0, "rewards/chosen": 0.45735448598861694, "rewards/margins": 6.357089042663574, "rewards/rejected": -5.8997344970703125, "step": 438, "train_speed(iter/s)": 0.00535 }, { "epoch": 1.1376176566049985, "grad_norm": 1.0116618871688843, "learning_rate": 8.522732371854228e-05, "logits/chosen": -1.2085466384887695, "logits/rejected": -1.211836814880371, "logps/chosen": -5.572229385375977, "logps/rejected": -65.51385498046875, "loss": 0.21719352900981903, "memory(GiB)": 46.82, "nll_loss": 0.18132297694683075, "rewards/accuracies": 1.0, "rewards/chosen": 0.5146795511245728, "rewards/margins": 5.9277167320251465, "rewards/rejected": -5.413036346435547, "step": 439, "train_speed(iter/s)": 0.00535 }, { "epoch": 1.1402142161635833, "grad_norm": 0.6072871088981628, "learning_rate": 8.480241032132393e-05, "logits/chosen": -1.2081148624420166, "logits/rejected": -1.2092756032943726, "logps/chosen": -4.102461814880371, "logps/rejected": -69.6110610961914, "loss": 0.17899087071418762, "memory(GiB)": 46.82, "nll_loss": 0.1723383665084839, "rewards/accuracies": 1.0, "rewards/chosen": 0.5367128849029541, "rewards/margins": 6.382415294647217, "rewards/rejected": -5.845702648162842, "step": 440, "train_speed(iter/s)": 0.00535 }, { "epoch": 1.1428107757221682, "grad_norm": 1.1503797769546509, "learning_rate": 8.437777762192434e-05, "logits/chosen": -1.1785545349121094, "logits/rejected": -1.1898421049118042, "logps/chosen": -5.658975601196289, "logps/rejected": -66.4476089477539, "loss": 0.2457386553287506, "memory(GiB)": 46.82, "nll_loss": 0.22795403003692627, "rewards/accuracies": 1.0, "rewards/chosen": 0.5527963638305664, "rewards/margins": 6.060329437255859, "rewards/rejected": -5.507533073425293, "step": 441, "train_speed(iter/s)": 0.00535 }, { "epoch": 1.145407335280753, "grad_norm": 1.063011884689331, "learning_rate": 8.395343346326295e-05, "logits/chosen": -1.2125415802001953, "logits/rejected": -1.2166345119476318, "logps/chosen": -11.403976440429688, "logps/rejected": -65.69091033935547, "loss": 0.3279325067996979, "memory(GiB)": 46.82, "nll_loss": 0.31457963585853577, "rewards/accuracies": 1.0, "rewards/chosen": 0.48648983240127563, "rewards/margins": 5.955573558807373, "rewards/rejected": -5.469082832336426, "step": 442, "train_speed(iter/s)": 0.00535 }, { "epoch": 1.1480038948393378, "grad_norm": 15.399893760681152, "learning_rate": 8.352938568292999e-05, "logits/chosen": -1.212915062904358, "logits/rejected": -1.2257941961288452, "logps/chosen": -5.4974541664123535, "logps/rejected": -74.6421890258789, "loss": 0.43098506331443787, "memory(GiB)": 46.82, "nll_loss": 0.3471585512161255, "rewards/accuracies": 0.96875, "rewards/chosen": 0.2913598418235779, "rewards/margins": 6.395876407623291, "rewards/rejected": -6.10451602935791, "step": 443, "train_speed(iter/s)": 0.005351 }, { "epoch": 1.1506004543979227, "grad_norm": 0.8971589803695679, "learning_rate": 8.310564211304158e-05, "logits/chosen": -1.2243199348449707, "logits/rejected": -1.233266830444336, "logps/chosen": -4.356855869293213, "logps/rejected": -82.03324127197266, "loss": 0.16546428203582764, "memory(GiB)": 46.82, "nll_loss": 0.15822210907936096, "rewards/accuracies": 1.0, "rewards/chosen": 0.4632646441459656, "rewards/margins": 7.142735481262207, "rewards/rejected": -6.679471015930176, "step": 444, "train_speed(iter/s)": 0.005351 }, { "epoch": 1.1531970139565075, "grad_norm": 0.9893987774848938, "learning_rate": 8.268221058009506e-05, "logits/chosen": -1.1960678100585938, "logits/rejected": -1.1931755542755127, "logps/chosen": -5.763791084289551, "logps/rejected": -67.48243713378906, "loss": 0.22159884870052338, "memory(GiB)": 46.82, "nll_loss": 0.20868626236915588, "rewards/accuracies": 1.0, "rewards/chosen": 0.44276654720306396, "rewards/margins": 6.342441558837891, "rewards/rejected": -5.899675369262695, "step": 445, "train_speed(iter/s)": 0.005351 }, { "epoch": 1.1557935735150926, "grad_norm": 0.9730236530303955, "learning_rate": 8.225909890482456e-05, "logits/chosen": -1.2410675287246704, "logits/rejected": -1.2531105279922485, "logps/chosen": -3.777689218521118, "logps/rejected": -73.96142578125, "loss": 0.17882992327213287, "memory(GiB)": 46.82, "nll_loss": 0.15262357890605927, "rewards/accuracies": 1.0, "rewards/chosen": 0.30238115787506104, "rewards/margins": 6.5273051261901855, "rewards/rejected": -6.224924087524414, "step": 446, "train_speed(iter/s)": 0.005352 }, { "epoch": 1.1583901330736774, "grad_norm": 0.9676756262779236, "learning_rate": 8.183631490205637e-05, "logits/chosen": -1.2334588766098022, "logits/rejected": -1.23115074634552, "logps/chosen": -5.909482002258301, "logps/rejected": -71.83121490478516, "loss": 0.21972762048244476, "memory(GiB)": 46.82, "nll_loss": 0.20232652127742767, "rewards/accuracies": 1.0, "rewards/chosen": 0.3557296097278595, "rewards/margins": 6.261346340179443, "rewards/rejected": -5.905617713928223, "step": 447, "train_speed(iter/s)": 0.005352 }, { "epoch": 1.1609866926322623, "grad_norm": 3.615070104598999, "learning_rate": 8.141386638056481e-05, "logits/chosen": -1.1984878778457642, "logits/rejected": -1.2202084064483643, "logps/chosen": -7.201460838317871, "logps/rejected": -83.67745208740234, "loss": 0.3116104006767273, "memory(GiB)": 46.82, "nll_loss": 0.25579264760017395, "rewards/accuracies": 0.96875, "rewards/chosen": 0.5771140456199646, "rewards/margins": 7.238218784332275, "rewards/rejected": -6.661106109619141, "step": 448, "train_speed(iter/s)": 0.005351 }, { "epoch": 1.1635832521908471, "grad_norm": 5.897024631500244, "learning_rate": 8.099176114292788e-05, "logits/chosen": -1.2283486127853394, "logits/rejected": -1.2268238067626953, "logps/chosen": -4.299000263214111, "logps/rejected": -63.7210578918457, "loss": 0.3152792155742645, "memory(GiB)": 46.82, "nll_loss": 0.25136417150497437, "rewards/accuracies": 0.9375, "rewards/chosen": 0.5095170140266418, "rewards/margins": 6.158134937286377, "rewards/rejected": -5.648618221282959, "step": 449, "train_speed(iter/s)": 0.005352 }, { "epoch": 1.166179811749432, "grad_norm": 0.8267269730567932, "learning_rate": 8.05700069853831e-05, "logits/chosen": -1.2181183099746704, "logits/rejected": -1.232823371887207, "logps/chosen": -2.3422133922576904, "logps/rejected": -81.08943176269531, "loss": 0.1261310577392578, "memory(GiB)": 46.82, "nll_loss": 0.11953935027122498, "rewards/accuracies": 1.0, "rewards/chosen": 0.5450170040130615, "rewards/margins": 7.200981140136719, "rewards/rejected": -6.655963897705078, "step": 450, "train_speed(iter/s)": 0.005352 }, { "epoch": 1.1687763713080168, "grad_norm": 0.7152145504951477, "learning_rate": 8.014861169768363e-05, "logits/chosen": -1.2072569131851196, "logits/rejected": -1.2154910564422607, "logps/chosen": -5.663619041442871, "logps/rejected": -83.33345031738281, "loss": 0.19898222386837006, "memory(GiB)": 46.82, "nll_loss": 0.18870678544044495, "rewards/accuracies": 1.0, "rewards/chosen": 0.6240676045417786, "rewards/margins": 7.413023948669434, "rewards/rejected": -6.788956165313721, "step": 451, "train_speed(iter/s)": 0.00535 }, { "epoch": 1.1713729308666017, "grad_norm": 1.1054271459579468, "learning_rate": 7.972758306295435e-05, "logits/chosen": -1.2423603534698486, "logits/rejected": -1.238939642906189, "logps/chosen": -9.10930347442627, "logps/rejected": -68.92269897460938, "loss": 0.2644210159778595, "memory(GiB)": 46.82, "nll_loss": 0.23959574103355408, "rewards/accuracies": 1.0, "rewards/chosen": 0.6885038018226624, "rewards/margins": 6.226180076599121, "rewards/rejected": -5.537675857543945, "step": 452, "train_speed(iter/s)": 0.00535 }, { "epoch": 1.1739694904251867, "grad_norm": 0.8297804594039917, "learning_rate": 7.930692885754806e-05, "logits/chosen": -1.2389461994171143, "logits/rejected": -1.2466444969177246, "logps/chosen": -4.285374641418457, "logps/rejected": -81.12661743164062, "loss": 0.20591987669467926, "memory(GiB)": 46.82, "nll_loss": 0.18140685558319092, "rewards/accuracies": 1.0, "rewards/chosen": 0.5226142406463623, "rewards/margins": 7.35651159286499, "rewards/rejected": -6.833897590637207, "step": 453, "train_speed(iter/s)": 0.00535 }, { "epoch": 1.1765660499837716, "grad_norm": 1.7889838218688965, "learning_rate": 7.888665685090193e-05, "logits/chosen": -1.2282047271728516, "logits/rejected": -1.240710973739624, "logps/chosen": -3.9668195247650146, "logps/rejected": -83.85064697265625, "loss": 0.3006521463394165, "memory(GiB)": 46.82, "nll_loss": 0.2842242121696472, "rewards/accuracies": 1.0, "rewards/chosen": 0.5261533856391907, "rewards/margins": 7.802785873413086, "rewards/rejected": -7.276631832122803, "step": 454, "train_speed(iter/s)": 0.00535 }, { "epoch": 1.1791626095423564, "grad_norm": 0.6768118143081665, "learning_rate": 7.846677480539392e-05, "logits/chosen": -1.2407575845718384, "logits/rejected": -1.2590632438659668, "logps/chosen": -3.9896676540374756, "logps/rejected": -88.54475402832031, "loss": 0.14948198199272156, "memory(GiB)": 46.82, "nll_loss": 0.14015856385231018, "rewards/accuracies": 1.0, "rewards/chosen": 0.5012010335922241, "rewards/margins": 7.759642601013184, "rewards/rejected": -7.25844144821167, "step": 455, "train_speed(iter/s)": 0.00535 }, { "epoch": 1.1817591691009413, "grad_norm": 1.0748811960220337, "learning_rate": 7.804729047619948e-05, "logits/chosen": -1.2838971614837646, "logits/rejected": -1.2972068786621094, "logps/chosen": -4.9451680183410645, "logps/rejected": -75.96924591064453, "loss": 0.19334405660629272, "memory(GiB)": 46.82, "nll_loss": 0.17472317814826965, "rewards/accuracies": 1.0, "rewards/chosen": 0.43368232250213623, "rewards/margins": 6.9603376388549805, "rewards/rejected": -6.526655197143555, "step": 456, "train_speed(iter/s)": 0.00535 }, { "epoch": 1.184355728659526, "grad_norm": 27.02585792541504, "learning_rate": 7.762821161114833e-05, "logits/chosen": -1.2738770246505737, "logits/rejected": -1.2871417999267578, "logps/chosen": -6.898077964782715, "logps/rejected": -70.33586883544922, "loss": 0.3962981700897217, "memory(GiB)": 46.82, "nll_loss": 0.30386969447135925, "rewards/accuracies": 0.9375, "rewards/chosen": 0.49996471405029297, "rewards/margins": 6.2457451820373535, "rewards/rejected": -5.745780944824219, "step": 457, "train_speed(iter/s)": 0.00535 }, { "epoch": 1.186952288218111, "grad_norm": 0.9774232506752014, "learning_rate": 7.720954595058118e-05, "logits/chosen": -1.270230770111084, "logits/rejected": -1.283980131149292, "logps/chosen": -3.3140833377838135, "logps/rejected": -72.56609344482422, "loss": 0.1822766661643982, "memory(GiB)": 46.82, "nll_loss": 0.13324937224388123, "rewards/accuracies": 1.0, "rewards/chosen": 0.31882578134536743, "rewards/margins": 6.227068901062012, "rewards/rejected": -5.908243179321289, "step": 458, "train_speed(iter/s)": 0.00535 }, { "epoch": 1.1895488477766958, "grad_norm": 0.9652191400527954, "learning_rate": 7.679130122720704e-05, "logits/chosen": -1.3034790754318237, "logits/rejected": -1.314261555671692, "logps/chosen": -7.06810998916626, "logps/rejected": -81.12928771972656, "loss": 0.2216591238975525, "memory(GiB)": 46.82, "nll_loss": 0.20493057370185852, "rewards/accuracies": 1.0, "rewards/chosen": 0.4113575220108032, "rewards/margins": 6.991024971008301, "rewards/rejected": -6.579666614532471, "step": 459, "train_speed(iter/s)": 0.00535 }, { "epoch": 1.1921454073352808, "grad_norm": 4.3938422203063965, "learning_rate": 7.637348516596016e-05, "logits/chosen": -1.288078784942627, "logits/rejected": -1.289923071861267, "logps/chosen": -6.353469371795654, "logps/rejected": -73.09895324707031, "loss": 0.275894433259964, "memory(GiB)": 46.82, "nll_loss": 0.2141137421131134, "rewards/accuracies": 0.96875, "rewards/chosen": 0.43534383177757263, "rewards/margins": 6.68284797668457, "rewards/rejected": -6.247504234313965, "step": 460, "train_speed(iter/s)": 0.00535 }, { "epoch": 1.1947419668938657, "grad_norm": 0.9771380424499512, "learning_rate": 7.59561054838575e-05, "logits/chosen": -1.3042765855789185, "logits/rejected": -1.317743182182312, "logps/chosen": -3.9304447174072266, "logps/rejected": -83.80009460449219, "loss": 0.1489650011062622, "memory(GiB)": 46.82, "nll_loss": 0.1390589475631714, "rewards/accuracies": 1.0, "rewards/chosen": 0.3365148901939392, "rewards/margins": 7.487484931945801, "rewards/rejected": -7.150969505310059, "step": 461, "train_speed(iter/s)": 0.00535 }, { "epoch": 1.1973385264524505, "grad_norm": 0.7796929478645325, "learning_rate": 7.553916988985613e-05, "logits/chosen": -1.3301423788070679, "logits/rejected": -1.3388516902923584, "logps/chosen": -3.854522943496704, "logps/rejected": -77.66817474365234, "loss": 0.16134774684906006, "memory(GiB)": 46.82, "nll_loss": 0.1557087004184723, "rewards/accuracies": 1.0, "rewards/chosen": 0.46156132221221924, "rewards/margins": 7.119222164154053, "rewards/rejected": -6.657661437988281, "step": 462, "train_speed(iter/s)": 0.00535 }, { "epoch": 1.1999350860110354, "grad_norm": 0.8544324636459351, "learning_rate": 7.512268608471083e-05, "logits/chosen": -1.3370078802108765, "logits/rejected": -1.3487505912780762, "logps/chosen": -4.693976879119873, "logps/rejected": -82.53611755371094, "loss": 0.1619998812675476, "memory(GiB)": 46.82, "nll_loss": 0.15308500826358795, "rewards/accuracies": 1.0, "rewards/chosen": 0.5657608509063721, "rewards/margins": 7.620563507080078, "rewards/rejected": -7.054802417755127, "step": 463, "train_speed(iter/s)": 0.00535 }, { "epoch": 1.2025316455696202, "grad_norm": 1.2491400241851807, "learning_rate": 7.470666176083192e-05, "logits/chosen": -1.3235511779785156, "logits/rejected": -1.3217864036560059, "logps/chosen": -5.475301265716553, "logps/rejected": -66.96241760253906, "loss": 0.22019821405410767, "memory(GiB)": 46.82, "nll_loss": 0.2117622047662735, "rewards/accuracies": 1.0, "rewards/chosen": 0.5525124669075012, "rewards/margins": 6.302184104919434, "rewards/rejected": -5.749671936035156, "step": 464, "train_speed(iter/s)": 0.00535 }, { "epoch": 1.205128205128205, "grad_norm": 4.391453266143799, "learning_rate": 7.429110460214319e-05, "logits/chosen": -1.324596881866455, "logits/rejected": -1.3249270915985107, "logps/chosen": -5.006054401397705, "logps/rejected": -79.24930572509766, "loss": 0.19958798587322235, "memory(GiB)": 46.82, "nll_loss": 0.17760564386844635, "rewards/accuracies": 1.0, "rewards/chosen": 0.529591977596283, "rewards/margins": 7.06871223449707, "rewards/rejected": -6.539119243621826, "step": 465, "train_speed(iter/s)": 0.00535 }, { "epoch": 1.20772476468679, "grad_norm": 1.2282588481903076, "learning_rate": 7.387602228393987e-05, "logits/chosen": -1.3140517473220825, "logits/rejected": -1.3105956315994263, "logps/chosen": -7.42270565032959, "logps/rejected": -66.26721954345703, "loss": 0.294545441865921, "memory(GiB)": 46.82, "nll_loss": 0.2685684859752655, "rewards/accuracies": 1.0, "rewards/chosen": 0.6955150961875916, "rewards/margins": 6.379220008850098, "rewards/rejected": -5.683704853057861, "step": 466, "train_speed(iter/s)": 0.00535 }, { "epoch": 1.210321324245375, "grad_norm": 0.9563242197036743, "learning_rate": 7.346142247274694e-05, "logits/chosen": -1.3215587139129639, "logits/rejected": -1.3361427783966064, "logps/chosen": -3.699913263320923, "logps/rejected": -88.9631118774414, "loss": 0.21111004054546356, "memory(GiB)": 46.82, "nll_loss": 0.18570095300674438, "rewards/accuracies": 1.0, "rewards/chosen": 0.40791285037994385, "rewards/margins": 8.11806583404541, "rewards/rejected": -7.710152626037598, "step": 467, "train_speed(iter/s)": 0.00535 }, { "epoch": 1.2129178838039598, "grad_norm": 1.081046462059021, "learning_rate": 7.304731282617762e-05, "logits/chosen": -1.3312351703643799, "logits/rejected": -1.3387830257415771, "logps/chosen": -5.243213653564453, "logps/rejected": -84.92706298828125, "loss": 0.2157626897096634, "memory(GiB)": 46.82, "nll_loss": 0.21122369170188904, "rewards/accuracies": 1.0, "rewards/chosen": 0.4976283013820648, "rewards/margins": 8.005891799926758, "rewards/rejected": -7.508264064788818, "step": 468, "train_speed(iter/s)": 0.00535 }, { "epoch": 1.2155144433625447, "grad_norm": 1.0331863164901733, "learning_rate": 7.263370099279172e-05, "logits/chosen": -1.3447762727737427, "logits/rejected": -1.3390498161315918, "logps/chosen": -6.393280982971191, "logps/rejected": -68.75172424316406, "loss": 0.2636359632015228, "memory(GiB)": 46.82, "nll_loss": 0.246793732047081, "rewards/accuracies": 1.0, "rewards/chosen": 0.6458650827407837, "rewards/margins": 6.282301425933838, "rewards/rejected": -5.636436939239502, "step": 469, "train_speed(iter/s)": 0.00535 }, { "epoch": 1.2181110029211295, "grad_norm": 0.8750536441802979, "learning_rate": 7.22205946119546e-05, "logits/chosen": -1.3133454322814941, "logits/rejected": -1.3110582828521729, "logps/chosen": -5.820354461669922, "logps/rejected": -71.29835510253906, "loss": 0.20814698934555054, "memory(GiB)": 46.82, "nll_loss": 0.1895810067653656, "rewards/accuracies": 1.0, "rewards/chosen": 0.5639092922210693, "rewards/margins": 6.466952323913574, "rewards/rejected": -5.903042793273926, "step": 470, "train_speed(iter/s)": 0.00535 }, { "epoch": 1.2207075624797143, "grad_norm": 1.3065314292907715, "learning_rate": 7.180800131369584e-05, "logits/chosen": -1.3447749614715576, "logits/rejected": -1.3477418422698975, "logps/chosen": -6.139316558837891, "logps/rejected": -62.90933609008789, "loss": 0.26562365889549255, "memory(GiB)": 46.82, "nll_loss": 0.21039319038391113, "rewards/accuracies": 1.0, "rewards/chosen": 0.537449836730957, "rewards/margins": 5.653042793273926, "rewards/rejected": -5.115592956542969, "step": 471, "train_speed(iter/s)": 0.005351 }, { "epoch": 1.2233041220382992, "grad_norm": 1.267687439918518, "learning_rate": 7.13959287185686e-05, "logits/chosen": -1.3199489116668701, "logits/rejected": -1.3398852348327637, "logps/chosen": -2.706737995147705, "logps/rejected": -79.95001983642578, "loss": 0.12426899373531342, "memory(GiB)": 46.82, "nll_loss": 0.11003828048706055, "rewards/accuracies": 1.0, "rewards/chosen": 0.47334274649620056, "rewards/margins": 7.157402992248535, "rewards/rejected": -6.684060096740723, "step": 472, "train_speed(iter/s)": 0.005351 }, { "epoch": 1.225900681596884, "grad_norm": 7.132215976715088, "learning_rate": 7.098438443750865e-05, "logits/chosen": -1.3689088821411133, "logits/rejected": -1.3883635997772217, "logps/chosen": -8.076455116271973, "logps/rejected": -82.17918395996094, "loss": 0.42827925086021423, "memory(GiB)": 46.82, "nll_loss": 0.3502614498138428, "rewards/accuracies": 0.96875, "rewards/chosen": 0.4545542001724243, "rewards/margins": 7.125252723693848, "rewards/rejected": -6.6706976890563965, "step": 473, "train_speed(iter/s)": 0.005351 }, { "epoch": 1.228497241155469, "grad_norm": 0.8221337795257568, "learning_rate": 7.057337607169371e-05, "logits/chosen": -1.3182464838027954, "logits/rejected": -1.3349087238311768, "logps/chosen": -4.247696876525879, "logps/rejected": -82.20696258544922, "loss": 0.16310645639896393, "memory(GiB)": 46.82, "nll_loss": 0.14582528173923492, "rewards/accuracies": 1.0, "rewards/chosen": 0.3645007908344269, "rewards/margins": 7.333131313323975, "rewards/rejected": -6.968629837036133, "step": 474, "train_speed(iter/s)": 0.005351 }, { "epoch": 1.231093800714054, "grad_norm": 0.9309591054916382, "learning_rate": 7.016291121240346e-05, "logits/chosen": -1.3715977668762207, "logits/rejected": -1.3699740171432495, "logps/chosen": -5.316465377807617, "logps/rejected": -68.14669799804688, "loss": 0.2627433240413666, "memory(GiB)": 46.82, "nll_loss": 0.21229830384254456, "rewards/accuracies": 1.0, "rewards/chosen": 0.5413371920585632, "rewards/margins": 6.536716461181641, "rewards/rejected": -5.995378494262695, "step": 475, "train_speed(iter/s)": 0.005352 }, { "epoch": 1.2336903602726388, "grad_norm": 8.09181022644043, "learning_rate": 6.975299744087891e-05, "logits/chosen": -1.3668107986450195, "logits/rejected": -1.371617078781128, "logps/chosen": -9.833568572998047, "logps/rejected": -82.02591705322266, "loss": 0.8664286136627197, "memory(GiB)": 46.82, "nll_loss": 0.5704513192176819, "rewards/accuracies": 0.9375, "rewards/chosen": 0.256930947303772, "rewards/margins": 7.255249977111816, "rewards/rejected": -6.998319149017334, "step": 476, "train_speed(iter/s)": 0.005351 }, { "epoch": 1.2362869198312236, "grad_norm": 2.064409017562866, "learning_rate": 6.934364232818254e-05, "logits/chosen": -1.3650354146957397, "logits/rejected": -1.3771873712539673, "logps/chosen": -4.302821636199951, "logps/rejected": -75.79000854492188, "loss": 0.16696852445602417, "memory(GiB)": 46.82, "nll_loss": 0.1503523886203766, "rewards/accuracies": 1.0, "rewards/chosen": 0.4869020879268646, "rewards/margins": 6.73642110824585, "rewards/rejected": -6.249518871307373, "step": 477, "train_speed(iter/s)": 0.005351 }, { "epoch": 1.2388834793898085, "grad_norm": 0.798882782459259, "learning_rate": 6.893485343505857e-05, "logits/chosen": -1.3637698888778687, "logits/rejected": -1.3578245639801025, "logps/chosen": -5.138448715209961, "logps/rejected": -66.73672485351562, "loss": 0.21367499232292175, "memory(GiB)": 46.82, "nll_loss": 0.1953822672367096, "rewards/accuracies": 1.0, "rewards/chosen": 0.3032958507537842, "rewards/margins": 6.190895080566406, "rewards/rejected": -5.887599945068359, "step": 478, "train_speed(iter/s)": 0.005351 }, { "epoch": 1.2414800389483933, "grad_norm": 1.1406197547912598, "learning_rate": 6.852663831179302e-05, "logits/chosen": -1.352840781211853, "logits/rejected": -1.35397207736969, "logps/chosen": -4.986490249633789, "logps/rejected": -73.43693542480469, "loss": 0.205072820186615, "memory(GiB)": 46.82, "nll_loss": 0.19722062349319458, "rewards/accuracies": 1.0, "rewards/chosen": 0.5596895217895508, "rewards/margins": 6.6583757400512695, "rewards/rejected": -6.0986857414245605, "step": 479, "train_speed(iter/s)": 0.005351 }, { "epoch": 1.2440765985069782, "grad_norm": 0.766574501991272, "learning_rate": 6.811900449807465e-05, "logits/chosen": -1.3501691818237305, "logits/rejected": -1.3594365119934082, "logps/chosen": -6.533414363861084, "logps/rejected": -66.47720336914062, "loss": 0.23299582302570343, "memory(GiB)": 46.82, "nll_loss": 0.22283174097537994, "rewards/accuracies": 1.0, "rewards/chosen": 0.7748389840126038, "rewards/margins": 6.291479587554932, "rewards/rejected": -5.516641139984131, "step": 480, "train_speed(iter/s)": 0.005351 }, { "epoch": 1.2466731580655632, "grad_norm": 0.9920905828475952, "learning_rate": 6.77119595228554e-05, "logits/chosen": -1.3646950721740723, "logits/rejected": -1.3720245361328125, "logps/chosen": -6.916625022888184, "logps/rejected": -73.02135467529297, "loss": 0.23078814148902893, "memory(GiB)": 46.82, "nll_loss": 0.21652816236019135, "rewards/accuracies": 1.0, "rewards/chosen": 0.4459760785102844, "rewards/margins": 6.14084005355835, "rewards/rejected": -5.694863796234131, "step": 481, "train_speed(iter/s)": 0.005351 }, { "epoch": 1.249269717624148, "grad_norm": 1.0885769128799438, "learning_rate": 6.730551090421137e-05, "logits/chosen": -1.3644369840621948, "logits/rejected": -1.3590939044952393, "logps/chosen": -7.648492813110352, "logps/rejected": -63.562782287597656, "loss": 0.24852637946605682, "memory(GiB)": 46.82, "nll_loss": 0.21991106867790222, "rewards/accuracies": 1.0, "rewards/chosen": 0.6735080480575562, "rewards/margins": 5.918203353881836, "rewards/rejected": -5.244695663452148, "step": 482, "train_speed(iter/s)": 0.005351 }, { "epoch": 1.251866277182733, "grad_norm": 0.7712500691413879, "learning_rate": 6.689966614920413e-05, "logits/chosen": -1.3166533708572388, "logits/rejected": -1.3218377828598022, "logps/chosen": -4.022350788116455, "logps/rejected": -71.528076171875, "loss": 0.13269458711147308, "memory(GiB)": 46.82, "nll_loss": 0.11788547039031982, "rewards/accuracies": 1.0, "rewards/chosen": 0.5740154981613159, "rewards/margins": 6.363125324249268, "rewards/rejected": -5.789109230041504, "step": 483, "train_speed(iter/s)": 0.005352 }, { "epoch": 1.2544628367413178, "grad_norm": 0.8549020886421204, "learning_rate": 6.649443275374193e-05, "logits/chosen": -1.3651435375213623, "logits/rejected": -1.3780406713485718, "logps/chosen": -4.872490406036377, "logps/rejected": -68.51624298095703, "loss": 0.1938597708940506, "memory(GiB)": 46.82, "nll_loss": 0.18332600593566895, "rewards/accuracies": 1.0, "rewards/chosen": 0.5763934254646301, "rewards/margins": 5.976587295532227, "rewards/rejected": -5.400193691253662, "step": 484, "train_speed(iter/s)": 0.005352 }, { "epoch": 1.2570593962999026, "grad_norm": 0.9369620084762573, "learning_rate": 6.608981820244115e-05, "logits/chosen": -1.3296164274215698, "logits/rejected": -1.3332488536834717, "logps/chosen": -4.46505069732666, "logps/rejected": -64.79832458496094, "loss": 0.17813126742839813, "memory(GiB)": 46.82, "nll_loss": 0.1691313236951828, "rewards/accuracies": 1.0, "rewards/chosen": 0.5418381690979004, "rewards/margins": 5.926529407501221, "rewards/rejected": -5.38469123840332, "step": 485, "train_speed(iter/s)": 0.005352 }, { "epoch": 1.2596559558584874, "grad_norm": 0.844835102558136, "learning_rate": 6.568582996848843e-05, "logits/chosen": -1.3325531482696533, "logits/rejected": -1.3392637968063354, "logps/chosen": -4.008181571960449, "logps/rejected": -71.48811340332031, "loss": 0.17114686965942383, "memory(GiB)": 46.82, "nll_loss": 0.15825404226779938, "rewards/accuracies": 1.0, "rewards/chosen": 0.5624055862426758, "rewards/margins": 6.441608905792236, "rewards/rejected": -5.8792033195495605, "step": 486, "train_speed(iter/s)": 0.005352 }, { "epoch": 1.2622525154170723, "grad_norm": 1.130921721458435, "learning_rate": 6.528247551350213e-05, "logits/chosen": -1.3767224550247192, "logits/rejected": -1.3819544315338135, "logps/chosen": -3.62576961517334, "logps/rejected": -68.78441619873047, "loss": 0.21932178735733032, "memory(GiB)": 46.82, "nll_loss": 0.19097000360488892, "rewards/accuracies": 0.96875, "rewards/chosen": 0.4108361601829529, "rewards/margins": 6.289252758026123, "rewards/rejected": -5.878417015075684, "step": 487, "train_speed(iter/s)": 0.005351 }, { "epoch": 1.2648490749756571, "grad_norm": 1.452879786491394, "learning_rate": 6.487976228739494e-05, "logits/chosen": -1.3391304016113281, "logits/rejected": -1.356032371520996, "logps/chosen": -4.974707126617432, "logps/rejected": -70.37326049804688, "loss": 0.21740569174289703, "memory(GiB)": 46.82, "nll_loss": 0.20510534942150116, "rewards/accuracies": 1.0, "rewards/chosen": 0.5399238467216492, "rewards/margins": 6.117460250854492, "rewards/rejected": -5.577536106109619, "step": 488, "train_speed(iter/s)": 0.005351 }, { "epoch": 1.2674456345342422, "grad_norm": 0.7685065865516663, "learning_rate": 6.447769772823614e-05, "logits/chosen": -1.319055199623108, "logits/rejected": -1.3363419771194458, "logps/chosen": -6.615801811218262, "logps/rejected": -83.4671630859375, "loss": 0.21475572884082794, "memory(GiB)": 46.82, "nll_loss": 0.18952563405036926, "rewards/accuracies": 1.0, "rewards/chosen": 0.4121897220611572, "rewards/margins": 7.273510932922363, "rewards/rejected": -6.861320972442627, "step": 489, "train_speed(iter/s)": 0.005352 }, { "epoch": 1.270042194092827, "grad_norm": 1.0484442710876465, "learning_rate": 6.407628926211409e-05, "logits/chosen": -1.33793044090271, "logits/rejected": -1.3429871797561646, "logps/chosen": -7.6060333251953125, "logps/rejected": -65.28913879394531, "loss": 0.2497866153717041, "memory(GiB)": 46.82, "nll_loss": 0.24507665634155273, "rewards/accuracies": 1.0, "rewards/chosen": 0.8890218734741211, "rewards/margins": 6.331787109375, "rewards/rejected": -5.442765235900879, "step": 490, "train_speed(iter/s)": 0.005352 }, { "epoch": 1.2726387536514119, "grad_norm": 0.9693198204040527, "learning_rate": 6.367554430299924e-05, "logits/chosen": -1.3228676319122314, "logits/rejected": -1.3340733051300049, "logps/chosen": -4.008767604827881, "logps/rejected": -71.55172729492188, "loss": 0.18880397081375122, "memory(GiB)": 46.82, "nll_loss": 0.1601686179637909, "rewards/accuracies": 1.0, "rewards/chosen": 0.4935658276081085, "rewards/margins": 6.400652885437012, "rewards/rejected": -5.907087326049805, "step": 491, "train_speed(iter/s)": 0.005352 }, { "epoch": 1.2752353132099967, "grad_norm": 1.0116583108901978, "learning_rate": 6.327547025260723e-05, "logits/chosen": -1.3240255117416382, "logits/rejected": -1.3320386409759521, "logps/chosen": -4.213266849517822, "logps/rejected": -72.59737396240234, "loss": 0.1900216042995453, "memory(GiB)": 46.82, "nll_loss": 0.1726846843957901, "rewards/accuracies": 1.0, "rewards/chosen": 0.48582398891448975, "rewards/margins": 6.556468963623047, "rewards/rejected": -6.070645332336426, "step": 492, "train_speed(iter/s)": 0.005351 }, { "epoch": 1.2778318727685816, "grad_norm": 1.002138614654541, "learning_rate": 6.287607450026189e-05, "logits/chosen": -1.3404346704483032, "logits/rejected": -1.34886634349823, "logps/chosen": -4.731965065002441, "logps/rejected": -74.24478149414062, "loss": 0.1853921115398407, "memory(GiB)": 46.82, "nll_loss": 0.1709199845790863, "rewards/accuracies": 1.0, "rewards/chosen": 0.44357895851135254, "rewards/margins": 6.4645490646362305, "rewards/rejected": -6.020970344543457, "step": 493, "train_speed(iter/s)": 0.005352 }, { "epoch": 1.2804284323271666, "grad_norm": 0.8741234540939331, "learning_rate": 6.247736442275917e-05, "logits/chosen": -1.287043571472168, "logits/rejected": -1.2934644222259521, "logps/chosen": -4.63891077041626, "logps/rejected": -74.50043487548828, "loss": 0.19321085512638092, "memory(GiB)": 46.82, "nll_loss": 0.1751416027545929, "rewards/accuracies": 1.0, "rewards/chosen": 0.582757830619812, "rewards/margins": 6.900094509124756, "rewards/rejected": -6.3173370361328125, "step": 494, "train_speed(iter/s)": 0.005352 }, { "epoch": 1.2830249918857515, "grad_norm": 0.6828720569610596, "learning_rate": 6.20793473842305e-05, "logits/chosen": -1.2890350818634033, "logits/rejected": -1.2999300956726074, "logps/chosen": -4.856447219848633, "logps/rejected": -72.6617431640625, "loss": 0.18545033037662506, "memory(GiB)": 46.82, "nll_loss": 0.16962683200836182, "rewards/accuracies": 1.0, "rewards/chosen": 0.5169156193733215, "rewards/margins": 6.635002136230469, "rewards/rejected": -6.118086338043213, "step": 495, "train_speed(iter/s)": 0.005352 }, { "epoch": 1.2856215514443363, "grad_norm": 1.0596202611923218, "learning_rate": 6.168203073600705e-05, "logits/chosen": -1.303747534751892, "logits/rejected": -1.3145846128463745, "logps/chosen": -5.57688045501709, "logps/rejected": -77.08624267578125, "loss": 0.19950714707374573, "memory(GiB)": 46.82, "nll_loss": 0.1948622763156891, "rewards/accuracies": 1.0, "rewards/chosen": 0.5272884368896484, "rewards/margins": 6.925128936767578, "rewards/rejected": -6.3978400230407715, "step": 496, "train_speed(iter/s)": 0.005352 }, { "epoch": 1.2882181110029212, "grad_norm": 1.029574990272522, "learning_rate": 6.128542181648394e-05, "logits/chosen": -1.3281769752502441, "logits/rejected": -1.3378801345825195, "logps/chosen": -5.10857629776001, "logps/rejected": -78.54777526855469, "loss": 0.2200167030096054, "memory(GiB)": 46.82, "nll_loss": 0.21050511300563812, "rewards/accuracies": 1.0, "rewards/chosen": 0.39650988578796387, "rewards/margins": 7.069237232208252, "rewards/rejected": -6.672727108001709, "step": 497, "train_speed(iter/s)": 0.005352 }, { "epoch": 1.290814670561506, "grad_norm": 2.646754741668701, "learning_rate": 6.0889527950984416e-05, "logits/chosen": -1.303905963897705, "logits/rejected": -1.295387625694275, "logps/chosen": -6.794533729553223, "logps/rejected": -66.7017822265625, "loss": 0.412862628698349, "memory(GiB)": 46.82, "nll_loss": 0.35357925295829773, "rewards/accuracies": 0.9375, "rewards/chosen": 0.3687395453453064, "rewards/margins": 6.016590118408203, "rewards/rejected": -5.647850036621094, "step": 498, "train_speed(iter/s)": 0.005352 }, { "epoch": 1.2934112301200908, "grad_norm": 0.8122525811195374, "learning_rate": 6.049435645162487e-05, "logits/chosen": -1.3104355335235596, "logits/rejected": -1.3152062892913818, "logps/chosen": -5.562468528747559, "logps/rejected": -74.46591186523438, "loss": 0.21052336692810059, "memory(GiB)": 46.82, "nll_loss": 0.20442822575569153, "rewards/accuracies": 1.0, "rewards/chosen": 0.6305204033851624, "rewards/margins": 7.020031452178955, "rewards/rejected": -6.3895111083984375, "step": 499, "train_speed(iter/s)": 0.005352 }, { "epoch": 1.2960077896786757, "grad_norm": 0.7511181831359863, "learning_rate": 6.0099914617179764e-05, "logits/chosen": -1.2803047895431519, "logits/rejected": -1.2894065380096436, "logps/chosen": -4.588591575622559, "logps/rejected": -85.19679260253906, "loss": 0.17056904733181, "memory(GiB)": 46.82, "nll_loss": 0.1638702154159546, "rewards/accuracies": 1.0, "rewards/chosen": 0.4681891202926636, "rewards/margins": 7.461175918579102, "rewards/rejected": -6.992986679077148, "step": 500, "train_speed(iter/s)": 0.005352 }, { "epoch": 1.2986043492372605, "grad_norm": 0.708882749080658, "learning_rate": 5.970620973294649e-05, "logits/chosen": -1.2864353656768799, "logits/rejected": -1.2991129159927368, "logps/chosen": -2.7639682292938232, "logps/rejected": -77.82109832763672, "loss": 0.13476227223873138, "memory(GiB)": 46.82, "nll_loss": 0.129118874669075, "rewards/accuracies": 1.0, "rewards/chosen": 0.4478917717933655, "rewards/margins": 6.971372604370117, "rewards/rejected": -6.5234808921813965, "step": 501, "train_speed(iter/s)": 0.005351 }, { "epoch": 1.3012009087958454, "grad_norm": 2.3029229640960693, "learning_rate": 5.931324907061131e-05, "logits/chosen": -1.2641024589538574, "logits/rejected": -1.2685556411743164, "logps/chosen": -5.792514324188232, "logps/rejected": -76.38786315917969, "loss": 0.4058936536312103, "memory(GiB)": 46.82, "nll_loss": 0.36178189516067505, "rewards/accuracies": 0.96875, "rewards/chosen": 0.32265374064445496, "rewards/margins": 6.516972064971924, "rewards/rejected": -6.1943182945251465, "step": 502, "train_speed(iter/s)": 0.005351 }, { "epoch": 1.3037974683544304, "grad_norm": 0.9166151285171509, "learning_rate": 5.892103988811457e-05, "logits/chosen": -1.2319368124008179, "logits/rejected": -1.2350472211837769, "logps/chosen": -6.415447235107422, "logps/rejected": -75.25454711914062, "loss": 0.2667836844921112, "memory(GiB)": 46.82, "nll_loss": 0.23221434652805328, "rewards/accuracies": 1.0, "rewards/chosen": 0.6779787540435791, "rewards/margins": 6.834658145904541, "rewards/rejected": -6.156679153442383, "step": 503, "train_speed(iter/s)": 0.005351 }, { "epoch": 1.3063940279130153, "grad_norm": 6.748708248138428, "learning_rate": 5.8529589429517003e-05, "logits/chosen": -1.2778469324111938, "logits/rejected": -1.2807527780532837, "logps/chosen": -6.256143569946289, "logps/rejected": -72.61140441894531, "loss": 0.24257849156856537, "memory(GiB)": 46.82, "nll_loss": 0.2350560873746872, "rewards/accuracies": 1.0, "rewards/chosen": 0.6175004243850708, "rewards/margins": 6.710084438323975, "rewards/rejected": -6.092584609985352, "step": 504, "train_speed(iter/s)": 0.005352 }, { "epoch": 1.3089905874716001, "grad_norm": 0.8000685572624207, "learning_rate": 5.8138904924865766e-05, "logits/chosen": -1.2935757637023926, "logits/rejected": -1.3018581867218018, "logps/chosen": -4.087766647338867, "logps/rejected": -79.02437591552734, "loss": 0.2187802791595459, "memory(GiB)": 46.82, "nll_loss": 0.19569718837738037, "rewards/accuracies": 1.0, "rewards/chosen": 0.4645954966545105, "rewards/margins": 7.049061298370361, "rewards/rejected": -6.584465980529785, "step": 505, "train_speed(iter/s)": 0.005351 }, { "epoch": 1.311587147030185, "grad_norm": 1.0485024452209473, "learning_rate": 5.774899359006092e-05, "logits/chosen": -1.2387014627456665, "logits/rejected": -1.2328811883926392, "logps/chosen": -5.889930248260498, "logps/rejected": -71.13211059570312, "loss": 0.20536896586418152, "memory(GiB)": 46.82, "nll_loss": 0.18820105493068695, "rewards/accuracies": 1.0, "rewards/chosen": 0.4390983283519745, "rewards/margins": 6.4834065437316895, "rewards/rejected": -6.044308185577393, "step": 506, "train_speed(iter/s)": 0.005351 }, { "epoch": 1.3141837065887698, "grad_norm": 1.3112807273864746, "learning_rate": 5.7359862626722106e-05, "logits/chosen": -1.221153736114502, "logits/rejected": -1.2322664260864258, "logps/chosen": -8.636886596679688, "logps/rejected": -80.09297180175781, "loss": 0.276731938123703, "memory(GiB)": 46.82, "nll_loss": 0.26180499792099, "rewards/accuracies": 1.0, "rewards/chosen": 0.34714198112487793, "rewards/margins": 6.943133354187012, "rewards/rejected": -6.595992088317871, "step": 507, "train_speed(iter/s)": 0.005351 }, { "epoch": 1.3167802661473549, "grad_norm": 4.199530601501465, "learning_rate": 5.6971519222055745e-05, "logits/chosen": -1.2388005256652832, "logits/rejected": -1.2482101917266846, "logps/chosen": -3.7984771728515625, "logps/rejected": -67.59223937988281, "loss": 0.2313919961452484, "memory(GiB)": 46.82, "nll_loss": 0.15446686744689941, "rewards/accuracies": 0.9375, "rewards/chosen": 0.46181103587150574, "rewards/margins": 6.2272748947143555, "rewards/rejected": -5.765463829040527, "step": 508, "train_speed(iter/s)": 0.005351 }, { "epoch": 1.3193768257059397, "grad_norm": 0.5734891891479492, "learning_rate": 5.658397054872197e-05, "logits/chosen": -1.2510944604873657, "logits/rejected": -1.2634743452072144, "logps/chosen": -2.7403945922851562, "logps/rejected": -83.09203338623047, "loss": 0.10001116245985031, "memory(GiB)": 46.82, "nll_loss": 0.09578342735767365, "rewards/accuracies": 1.0, "rewards/chosen": 0.4184391498565674, "rewards/margins": 7.603847980499268, "rewards/rejected": -7.185409069061279, "step": 509, "train_speed(iter/s)": 0.005351 }, { "epoch": 1.3219733852645246, "grad_norm": 2.557685136795044, "learning_rate": 5.6197223764702376e-05, "logits/chosen": -1.2410025596618652, "logits/rejected": -1.2566806077957153, "logps/chosen": -5.59817361831665, "logps/rejected": -81.26180267333984, "loss": 0.2501680254936218, "memory(GiB)": 46.82, "nll_loss": 0.22971931099891663, "rewards/accuracies": 1.0, "rewards/chosen": 0.1663077175617218, "rewards/margins": 6.9138503074646, "rewards/rejected": -6.747541904449463, "step": 510, "train_speed(iter/s)": 0.005351 }, { "epoch": 1.3245699448231094, "grad_norm": 0.7034062743186951, "learning_rate": 5.581128601316774e-05, "logits/chosen": -1.271955132484436, "logits/rejected": -1.2791032791137695, "logps/chosen": -5.076821804046631, "logps/rejected": -72.70384216308594, "loss": 0.21184766292572021, "memory(GiB)": 46.82, "nll_loss": 0.18928952515125275, "rewards/accuracies": 1.0, "rewards/chosen": 0.5331236124038696, "rewards/margins": 6.811183929443359, "rewards/rejected": -6.278060436248779, "step": 511, "train_speed(iter/s)": 0.005351 }, { "epoch": 1.3271665043816943, "grad_norm": 0.8642941117286682, "learning_rate": 5.542616442234618e-05, "logits/chosen": -1.1959160566329956, "logits/rejected": -1.1944928169250488, "logps/chosen": -4.370607376098633, "logps/rejected": -59.13761520385742, "loss": 0.210297629237175, "memory(GiB)": 46.82, "nll_loss": 0.1646156907081604, "rewards/accuracies": 1.0, "rewards/chosen": 0.49285203218460083, "rewards/margins": 5.4679365158081055, "rewards/rejected": -4.9750847816467285, "step": 512, "train_speed(iter/s)": 0.005351 }, { "epoch": 1.329763063940279, "grad_norm": 0.9332461953163147, "learning_rate": 5.50418661053913e-05, "logits/chosen": -1.2382476329803467, "logits/rejected": -1.242477536201477, "logps/chosen": -6.872227191925049, "logps/rejected": -74.04458618164062, "loss": 0.2718394994735718, "memory(GiB)": 46.82, "nll_loss": 0.2601723074913025, "rewards/accuracies": 1.0, "rewards/chosen": 0.39546260237693787, "rewards/margins": 6.640940189361572, "rewards/rejected": -6.245477199554443, "step": 513, "train_speed(iter/s)": 0.005351 }, { "epoch": 1.332359623498864, "grad_norm": 23.864660263061523, "learning_rate": 5.4658398160250935e-05, "logits/chosen": -1.2790114879608154, "logits/rejected": -1.2800090312957764, "logps/chosen": -5.093778610229492, "logps/rejected": -66.47357177734375, "loss": 0.3131547272205353, "memory(GiB)": 46.82, "nll_loss": 0.24423646926879883, "rewards/accuracies": 0.96875, "rewards/chosen": 0.4665161073207855, "rewards/margins": 5.967519283294678, "rewards/rejected": -5.501004219055176, "step": 514, "train_speed(iter/s)": 0.005352 }, { "epoch": 1.3349561830574488, "grad_norm": 1.120458960533142, "learning_rate": 5.4275767669536146e-05, "logits/chosen": -1.2243143320083618, "logits/rejected": -1.23822021484375, "logps/chosen": -5.449795722961426, "logps/rejected": -68.27152252197266, "loss": 0.2214929461479187, "memory(GiB)": 46.82, "nll_loss": 0.20409227907657623, "rewards/accuracies": 1.0, "rewards/chosen": 0.484249085187912, "rewards/margins": 6.0561323165893555, "rewards/rejected": -5.571883201599121, "step": 515, "train_speed(iter/s)": 0.005352 }, { "epoch": 1.3375527426160336, "grad_norm": 0.6455298066139221, "learning_rate": 5.3893981700390217e-05, "logits/chosen": -1.2467719316482544, "logits/rejected": -1.248091459274292, "logps/chosen": -5.1662678718566895, "logps/rejected": -69.29208374023438, "loss": 0.16640540957450867, "memory(GiB)": 46.82, "nll_loss": 0.1609758585691452, "rewards/accuracies": 1.0, "rewards/chosen": 0.7331331968307495, "rewards/margins": 6.481633186340332, "rewards/rejected": -5.748499870300293, "step": 516, "train_speed(iter/s)": 0.005352 }, { "epoch": 1.3401493021746187, "grad_norm": 1.8854632377624512, "learning_rate": 5.35130473043582e-05, "logits/chosen": -1.2681548595428467, "logits/rejected": -1.2783433198928833, "logps/chosen": -4.961431503295898, "logps/rejected": -66.57093811035156, "loss": 0.21522153913974762, "memory(GiB)": 46.82, "nll_loss": 0.17638429999351501, "rewards/accuracies": 0.96875, "rewards/chosen": 0.37839043140411377, "rewards/margins": 5.8021626472473145, "rewards/rejected": -5.423771858215332, "step": 517, "train_speed(iter/s)": 0.005352 }, { "epoch": 1.3427458617332035, "grad_norm": 2.53611159324646, "learning_rate": 5.313297151725679e-05, "logits/chosen": -1.2609970569610596, "logits/rejected": -1.2676525115966797, "logps/chosen": -3.5458755493164062, "logps/rejected": -64.48684692382812, "loss": 0.17321892082691193, "memory(GiB)": 46.82, "nll_loss": 0.1277797669172287, "rewards/accuracies": 1.0, "rewards/chosen": 0.5875951051712036, "rewards/margins": 5.845522403717041, "rewards/rejected": -5.2579264640808105, "step": 518, "train_speed(iter/s)": 0.005352 }, { "epoch": 1.3453424212917884, "grad_norm": 0.7559269666671753, "learning_rate": 5.275376135904408e-05, "logits/chosen": -1.2371904850006104, "logits/rejected": -1.251573085784912, "logps/chosen": -3.288680076599121, "logps/rejected": -72.45018005371094, "loss": 0.14326097071170807, "memory(GiB)": 46.82, "nll_loss": 0.12870629131793976, "rewards/accuracies": 1.0, "rewards/chosen": 0.5437870025634766, "rewards/margins": 6.532266616821289, "rewards/rejected": -5.988478660583496, "step": 519, "train_speed(iter/s)": 0.005352 }, { "epoch": 1.3479389808503732, "grad_norm": 0.9264482855796814, "learning_rate": 5.237542383369025e-05, "logits/chosen": -1.2770700454711914, "logits/rejected": -1.2863562107086182, "logps/chosen": -6.186993598937988, "logps/rejected": -72.9734115600586, "loss": 0.21653519570827484, "memory(GiB)": 46.82, "nll_loss": 0.2064797580242157, "rewards/accuracies": 1.0, "rewards/chosen": 0.5985318422317505, "rewards/margins": 6.420475482940674, "rewards/rejected": -5.821944236755371, "step": 520, "train_speed(iter/s)": 0.005352 }, { "epoch": 1.350535540408958, "grad_norm": 0.927513062953949, "learning_rate": 5.199796592904812e-05, "logits/chosen": -1.3056390285491943, "logits/rejected": -1.3078558444976807, "logps/chosen": -6.011695861816406, "logps/rejected": -61.83517837524414, "loss": 0.2499130517244339, "memory(GiB)": 46.82, "nll_loss": 0.22844329476356506, "rewards/accuracies": 1.0, "rewards/chosen": 0.6435909271240234, "rewards/margins": 5.511775016784668, "rewards/rejected": -4.868184566497803, "step": 521, "train_speed(iter/s)": 0.005352 }, { "epoch": 1.3531320999675431, "grad_norm": 0.8462246060371399, "learning_rate": 5.16213946167237e-05, "logits/chosen": -1.2712773084640503, "logits/rejected": -1.2814041376113892, "logps/chosen": -4.3128533363342285, "logps/rejected": -75.32404327392578, "loss": 0.18354232609272003, "memory(GiB)": 46.82, "nll_loss": 0.14595916867256165, "rewards/accuracies": 1.0, "rewards/chosen": 0.44975709915161133, "rewards/margins": 6.685505390167236, "rewards/rejected": -6.235748291015625, "step": 522, "train_speed(iter/s)": 0.005352 }, { "epoch": 1.355728659526128, "grad_norm": 0.7453184127807617, "learning_rate": 5.1245716851948036e-05, "logits/chosen": -1.282777190208435, "logits/rejected": -1.2888199090957642, "logps/chosen": -4.018249988555908, "logps/rejected": -71.82275390625, "loss": 0.17397840321063995, "memory(GiB)": 46.82, "nll_loss": 0.17042097449302673, "rewards/accuracies": 1.0, "rewards/chosen": 0.5543403625488281, "rewards/margins": 6.740978717803955, "rewards/rejected": -6.186638355255127, "step": 523, "train_speed(iter/s)": 0.005352 }, { "epoch": 1.3583252190847128, "grad_norm": 0.7847375273704529, "learning_rate": 5.087093957344841e-05, "logits/chosen": -1.263948678970337, "logits/rejected": -1.285239577293396, "logps/chosen": -2.6982815265655518, "logps/rejected": -83.65795135498047, "loss": 0.13130351901054382, "memory(GiB)": 46.82, "nll_loss": 0.11251454055309296, "rewards/accuracies": 1.0, "rewards/chosen": 0.41817164421081543, "rewards/margins": 7.289690017700195, "rewards/rejected": -6.871518135070801, "step": 524, "train_speed(iter/s)": 0.005352 }, { "epoch": 1.3609217786432977, "grad_norm": 7.355116844177246, "learning_rate": 5.049706970332e-05, "logits/chosen": -1.3026247024536133, "logits/rejected": -1.3189667463302612, "logps/chosen": -4.715170383453369, "logps/rejected": -71.38179016113281, "loss": 0.1960161328315735, "memory(GiB)": 46.82, "nll_loss": 0.16761450469493866, "rewards/accuracies": 1.0, "rewards/chosen": 0.4897134304046631, "rewards/margins": 6.54774284362793, "rewards/rejected": -6.058030128479004, "step": 525, "train_speed(iter/s)": 0.005353 }, { "epoch": 1.3635183382018825, "grad_norm": 0.5812721848487854, "learning_rate": 5.012411414689851e-05, "logits/chosen": -1.2992465496063232, "logits/rejected": -1.32021164894104, "logps/chosen": -2.617116928100586, "logps/rejected": -77.7351303100586, "loss": 0.13271179795265198, "memory(GiB)": 46.82, "nll_loss": 0.11518695950508118, "rewards/accuracies": 1.0, "rewards/chosen": 0.45856040716171265, "rewards/margins": 6.7828898429870605, "rewards/rejected": -6.324328899383545, "step": 526, "train_speed(iter/s)": 0.005353 }, { "epoch": 1.3661148977604674, "grad_norm": 1.8369522094726562, "learning_rate": 4.9752079792632246e-05, "logits/chosen": -1.318105936050415, "logits/rejected": -1.327620029449463, "logps/chosen": -4.5236616134643555, "logps/rejected": -76.44921112060547, "loss": 0.18702739477157593, "memory(GiB)": 46.82, "nll_loss": 0.15841788053512573, "rewards/accuracies": 1.0, "rewards/chosen": 0.5277929306030273, "rewards/margins": 6.9209723472595215, "rewards/rejected": -6.393178939819336, "step": 527, "train_speed(iter/s)": 0.005353 }, { "epoch": 1.3687114573190522, "grad_norm": 0.8088624477386475, "learning_rate": 4.938097351195499e-05, "logits/chosen": -1.3427401781082153, "logits/rejected": -1.3583595752716064, "logps/chosen": -4.807055473327637, "logps/rejected": -86.13604736328125, "loss": 0.16440600156784058, "memory(GiB)": 46.82, "nll_loss": 0.14281649887561798, "rewards/accuracies": 1.0, "rewards/chosen": 0.42351657152175903, "rewards/margins": 7.823343753814697, "rewards/rejected": -7.399827003479004, "step": 528, "train_speed(iter/s)": 0.005353 }, { "epoch": 1.371308016877637, "grad_norm": 0.6622845530509949, "learning_rate": 4.901080215915922e-05, "logits/chosen": -1.2923277616500854, "logits/rejected": -1.307023525238037, "logps/chosen": -5.0182881355285645, "logps/rejected": -82.5390853881836, "loss": 0.21107839047908783, "memory(GiB)": 46.82, "nll_loss": 0.20138172805309296, "rewards/accuracies": 1.0, "rewards/chosen": 0.5142525434494019, "rewards/margins": 7.308236122131348, "rewards/rejected": -6.7939839363098145, "step": 529, "train_speed(iter/s)": 0.005353 }, { "epoch": 1.3739045764362219, "grad_norm": 1.2780404090881348, "learning_rate": 4.864157257126928e-05, "logits/chosen": -1.3358229398727417, "logits/rejected": -1.3411754369735718, "logps/chosen": -6.996187210083008, "logps/rejected": -75.58708953857422, "loss": 0.2538679838180542, "memory(GiB)": 46.82, "nll_loss": 0.24866743385791779, "rewards/accuracies": 1.0, "rewards/chosen": 0.5523662567138672, "rewards/margins": 6.849069595336914, "rewards/rejected": -6.296703815460205, "step": 530, "train_speed(iter/s)": 0.005353 }, { "epoch": 1.376501135994807, "grad_norm": 1.143084168434143, "learning_rate": 4.827329156791522e-05, "logits/chosen": -1.3413739204406738, "logits/rejected": -1.3325977325439453, "logps/chosen": -6.320285797119141, "logps/rejected": -55.596866607666016, "loss": 0.2689521014690399, "memory(GiB)": 46.82, "nll_loss": 0.2311260998249054, "rewards/accuracies": 1.0, "rewards/chosen": 0.7088637948036194, "rewards/margins": 5.551700592041016, "rewards/rejected": -4.842836856842041, "step": 531, "train_speed(iter/s)": 0.005353 }, { "epoch": 1.3790976955533918, "grad_norm": 0.9891291856765747, "learning_rate": 4.790596595120699e-05, "logits/chosen": -1.353549838066101, "logits/rejected": -1.3516517877578735, "logps/chosen": -5.421792984008789, "logps/rejected": -74.89588165283203, "loss": 0.19859538972377777, "memory(GiB)": 46.82, "nll_loss": 0.19306476414203644, "rewards/accuracies": 1.0, "rewards/chosen": 0.5956583619117737, "rewards/margins": 6.918511390686035, "rewards/rejected": -6.322854042053223, "step": 532, "train_speed(iter/s)": 0.005353 }, { "epoch": 1.3816942551119766, "grad_norm": 0.7545592784881592, "learning_rate": 4.753960250560843e-05, "logits/chosen": -1.3177759647369385, "logits/rejected": -1.3262300491333008, "logps/chosen": -4.168139934539795, "logps/rejected": -80.60372924804688, "loss": 0.15544827282428741, "memory(GiB)": 46.82, "nll_loss": 0.13690081238746643, "rewards/accuracies": 1.0, "rewards/chosen": 0.5192233324050903, "rewards/margins": 7.489371299743652, "rewards/rejected": -6.970148086547852, "step": 533, "train_speed(iter/s)": 0.005353 }, { "epoch": 1.3842908146705615, "grad_norm": 0.9258074164390564, "learning_rate": 4.7174207997812434e-05, "logits/chosen": -1.3286628723144531, "logits/rejected": -1.3313071727752686, "logps/chosen": -5.146695613861084, "logps/rejected": -74.13917541503906, "loss": 0.18875287473201752, "memory(GiB)": 46.82, "nll_loss": 0.18020354211330414, "rewards/accuracies": 1.0, "rewards/chosen": 0.6697993874549866, "rewards/margins": 7.111582279205322, "rewards/rejected": -6.441783428192139, "step": 534, "train_speed(iter/s)": 0.005353 }, { "epoch": 1.3868873742291463, "grad_norm": 0.7437857389450073, "learning_rate": 4.680978917661544e-05, "logits/chosen": -1.3763070106506348, "logits/rejected": -1.3904519081115723, "logps/chosen": -3.5649471282958984, "logps/rejected": -98.40135955810547, "loss": 0.15277497470378876, "memory(GiB)": 46.82, "nll_loss": 0.14997752010822296, "rewards/accuracies": 1.0, "rewards/chosen": 0.4047650396823883, "rewards/margins": 8.529120445251465, "rewards/rejected": -8.12435531616211, "step": 535, "train_speed(iter/s)": 0.005353 }, { "epoch": 1.3894839337877314, "grad_norm": 0.7930772304534912, "learning_rate": 4.644635277279326e-05, "logits/chosen": -1.2950698137283325, "logits/rejected": -1.301226019859314, "logps/chosen": -3.2517616748809814, "logps/rejected": -73.68115997314453, "loss": 0.13988333940505981, "memory(GiB)": 46.82, "nll_loss": 0.1251326948404312, "rewards/accuracies": 1.0, "rewards/chosen": 0.5784369707107544, "rewards/margins": 6.892407417297363, "rewards/rejected": -6.313970565795898, "step": 536, "train_speed(iter/s)": 0.005353 }, { "epoch": 1.3920804933463162, "grad_norm": 3.1857376098632812, "learning_rate": 4.608390549897661e-05, "logits/chosen": -1.312851071357727, "logits/rejected": -1.31553316116333, "logps/chosen": -4.813056945800781, "logps/rejected": -72.02601623535156, "loss": 0.17908523976802826, "memory(GiB)": 46.82, "nll_loss": 0.1712900847196579, "rewards/accuracies": 1.0, "rewards/chosen": 0.5639367699623108, "rewards/margins": 6.651814937591553, "rewards/rejected": -6.087879180908203, "step": 537, "train_speed(iter/s)": 0.005353 }, { "epoch": 1.394677052904901, "grad_norm": 0.6969592571258545, "learning_rate": 4.572245404952682e-05, "logits/chosen": -1.3196005821228027, "logits/rejected": -1.3400623798370361, "logps/chosen": -2.851443290710449, "logps/rejected": -84.36784362792969, "loss": 0.14703302085399628, "memory(GiB)": 46.82, "nll_loss": 0.13512712717056274, "rewards/accuracies": 1.0, "rewards/chosen": 0.4452558755874634, "rewards/margins": 7.475783824920654, "rewards/rejected": -7.030528545379639, "step": 538, "train_speed(iter/s)": 0.005353 }, { "epoch": 1.397273612463486, "grad_norm": 1.1035842895507812, "learning_rate": 4.536200510041271e-05, "logits/chosen": -1.3497779369354248, "logits/rejected": -1.3533220291137695, "logps/chosen": -6.113505840301514, "logps/rejected": -82.510986328125, "loss": 0.1953519731760025, "memory(GiB)": 46.82, "nll_loss": 0.17564868927001953, "rewards/accuracies": 1.0, "rewards/chosen": 0.2876747250556946, "rewards/margins": 7.36361837387085, "rewards/rejected": -7.075943470001221, "step": 539, "train_speed(iter/s)": 0.005353 }, { "epoch": 1.3998701720220708, "grad_norm": 1.0004595518112183, "learning_rate": 4.5002565309087e-05, "logits/chosen": -1.320373296737671, "logits/rejected": -1.3390169143676758, "logps/chosen": -3.581512689590454, "logps/rejected": -83.01679992675781, "loss": 0.1440872699022293, "memory(GiB)": 46.82, "nll_loss": 0.13884009420871735, "rewards/accuracies": 1.0, "rewards/chosen": 0.5866944789886475, "rewards/margins": 7.652634143829346, "rewards/rejected": -7.065939903259277, "step": 540, "train_speed(iter/s)": 0.005353 }, { "epoch": 1.4024667315806556, "grad_norm": 0.9309626221656799, "learning_rate": 4.464414131436317e-05, "logits/chosen": -1.3228111267089844, "logits/rejected": -1.3259844779968262, "logps/chosen": -5.710712432861328, "logps/rejected": -86.91190338134766, "loss": 0.18705937266349792, "memory(GiB)": 46.82, "nll_loss": 0.17348426580429077, "rewards/accuracies": 1.0, "rewards/chosen": 0.5686015486717224, "rewards/margins": 8.052790641784668, "rewards/rejected": -7.484189033508301, "step": 541, "train_speed(iter/s)": 0.005353 }, { "epoch": 1.4050632911392404, "grad_norm": 2.3234517574310303, "learning_rate": 4.428673973629328e-05, "logits/chosen": -1.2998096942901611, "logits/rejected": -1.30985689163208, "logps/chosen": -7.139487266540527, "logps/rejected": -82.738037109375, "loss": 0.25522780418395996, "memory(GiB)": 46.82, "nll_loss": 0.22490915656089783, "rewards/accuracies": 1.0, "rewards/chosen": 0.5230386257171631, "rewards/margins": 7.560036659240723, "rewards/rejected": -7.036998748779297, "step": 542, "train_speed(iter/s)": 0.005353 }, { "epoch": 1.4076598506978253, "grad_norm": 0.7589312195777893, "learning_rate": 4.393036717604536e-05, "logits/chosen": -1.3219821453094482, "logits/rejected": -1.3300949335098267, "logps/chosen": -3.9188337326049805, "logps/rejected": -79.20855712890625, "loss": 0.15153641998767853, "memory(GiB)": 46.82, "nll_loss": 0.14401042461395264, "rewards/accuracies": 1.0, "rewards/chosen": 0.4560588300228119, "rewards/margins": 7.192531108856201, "rewards/rejected": -6.736471652984619, "step": 543, "train_speed(iter/s)": 0.005353 }, { "epoch": 1.4102564102564101, "grad_norm": 0.7089377045631409, "learning_rate": 4.357503021578157e-05, "logits/chosen": -1.3246771097183228, "logits/rejected": -1.331357479095459, "logps/chosen": -5.504782199859619, "logps/rejected": -79.88471221923828, "loss": 0.5075070858001709, "memory(GiB)": 46.82, "nll_loss": 0.371629536151886, "rewards/accuracies": 0.96875, "rewards/chosen": 0.43268999457359314, "rewards/margins": 7.278794288635254, "rewards/rejected": -6.846104145050049, "step": 544, "train_speed(iter/s)": 0.005353 }, { "epoch": 1.4128529698149952, "grad_norm": 6.009806156158447, "learning_rate": 4.3220735418536774e-05, "logits/chosen": -1.3304033279418945, "logits/rejected": -1.3362674713134766, "logps/chosen": -4.7876715660095215, "logps/rejected": -77.58482360839844, "loss": 0.21589714288711548, "memory(GiB)": 46.82, "nll_loss": 0.17250403761863708, "rewards/accuracies": 0.96875, "rewards/chosen": 0.43926605582237244, "rewards/margins": 7.207821369171143, "rewards/rejected": -6.7685546875, "step": 545, "train_speed(iter/s)": 0.005353 }, { "epoch": 1.41544952937358, "grad_norm": 0.8883028626441956, "learning_rate": 4.2867489328097066e-05, "logits/chosen": -1.286049723625183, "logits/rejected": -1.3016682863235474, "logps/chosen": -4.48312520980835, "logps/rejected": -80.04753112792969, "loss": 0.18265032768249512, "memory(GiB)": 46.82, "nll_loss": 0.16458269953727722, "rewards/accuracies": 1.0, "rewards/chosen": 0.3826461732387543, "rewards/margins": 7.131008148193359, "rewards/rejected": -6.748361587524414, "step": 546, "train_speed(iter/s)": 0.005353 }, { "epoch": 1.4180460889321649, "grad_norm": 0.8117271661758423, "learning_rate": 4.251529846887906e-05, "logits/chosen": -1.3500478267669678, "logits/rejected": -1.3516051769256592, "logps/chosen": -5.849126815795898, "logps/rejected": -75.34406280517578, "loss": 0.21577468514442444, "memory(GiB)": 46.82, "nll_loss": 0.21225160360336304, "rewards/accuracies": 1.0, "rewards/chosen": 0.787651538848877, "rewards/margins": 7.277240753173828, "rewards/rejected": -6.489588737487793, "step": 547, "train_speed(iter/s)": 0.005352 }, { "epoch": 1.4206426484907497, "grad_norm": 0.7191773056983948, "learning_rate": 4.216416934580947e-05, "logits/chosen": -1.3170534372329712, "logits/rejected": -1.3186712265014648, "logps/chosen": -5.588179111480713, "logps/rejected": -73.8975830078125, "loss": 0.19539664685726166, "memory(GiB)": 46.82, "nll_loss": 0.19075627624988556, "rewards/accuracies": 1.0, "rewards/chosen": 0.46979498863220215, "rewards/margins": 6.78049373626709, "rewards/rejected": -6.310698986053467, "step": 548, "train_speed(iter/s)": 0.005352 }, { "epoch": 1.4232392080493346, "grad_norm": 0.6664804816246033, "learning_rate": 4.181410844420474e-05, "logits/chosen": -1.304147481918335, "logits/rejected": -1.3245407342910767, "logps/chosen": -3.386530876159668, "logps/rejected": -84.88090515136719, "loss": 0.14330296218395233, "memory(GiB)": 46.82, "nll_loss": 0.13968124985694885, "rewards/accuracies": 1.0, "rewards/chosen": 0.6671038269996643, "rewards/margins": 8.031911849975586, "rewards/rejected": -7.364808082580566, "step": 549, "train_speed(iter/s)": 0.005353 }, { "epoch": 1.4258357676079196, "grad_norm": 0.7066012024879456, "learning_rate": 4.146512222965143e-05, "logits/chosen": -1.3411874771118164, "logits/rejected": -1.3574979305267334, "logps/chosen": -2.9142534732818604, "logps/rejected": -88.72208404541016, "loss": 0.1130063459277153, "memory(GiB)": 46.82, "nll_loss": 0.10818038135766983, "rewards/accuracies": 1.0, "rewards/chosen": 0.4542260766029358, "rewards/margins": 8.142085075378418, "rewards/rejected": -7.687858581542969, "step": 550, "train_speed(iter/s)": 0.005353 }, { "epoch": 1.4284323271665045, "grad_norm": 0.7845104932785034, "learning_rate": 4.111721714788671e-05, "logits/chosen": -1.3469820022583008, "logits/rejected": -1.3495479822158813, "logps/chosen": -4.226562976837158, "logps/rejected": -70.08132934570312, "loss": 0.18562032282352448, "memory(GiB)": 46.82, "nll_loss": 0.16532127559185028, "rewards/accuracies": 1.0, "rewards/chosen": 0.6004529595375061, "rewards/margins": 6.635247230529785, "rewards/rejected": -6.034794330596924, "step": 551, "train_speed(iter/s)": 0.005352 }, { "epoch": 1.4310288867250893, "grad_norm": 0.9597321152687073, "learning_rate": 4.0770399624679456e-05, "logits/chosen": -1.3411657810211182, "logits/rejected": -1.353317379951477, "logps/chosen": -5.72759485244751, "logps/rejected": -84.97734069824219, "loss": 0.22993287444114685, "memory(GiB)": 46.82, "nll_loss": 0.21702148020267487, "rewards/accuracies": 1.0, "rewards/chosen": 0.5299229025840759, "rewards/margins": 7.509583473205566, "rewards/rejected": -6.979660511016846, "step": 552, "train_speed(iter/s)": 0.005352 }, { "epoch": 1.4336254462836742, "grad_norm": 2.079641580581665, "learning_rate": 4.042467606571134e-05, "logits/chosen": -1.3426014184951782, "logits/rejected": -1.3533074855804443, "logps/chosen": -7.159404754638672, "logps/rejected": -73.98983764648438, "loss": 0.5649017691612244, "memory(GiB)": 46.82, "nll_loss": 0.4176748991012573, "rewards/accuracies": 0.96875, "rewards/chosen": 0.36085012555122375, "rewards/margins": 6.391058444976807, "rewards/rejected": -6.030208110809326, "step": 553, "train_speed(iter/s)": 0.005352 }, { "epoch": 1.436222005842259, "grad_norm": 0.7903665900230408, "learning_rate": 4.0080052856458626e-05, "logits/chosen": -1.3065292835235596, "logits/rejected": -1.326464056968689, "logps/chosen": -3.64105224609375, "logps/rejected": -86.52337646484375, "loss": 0.13767823576927185, "memory(GiB)": 46.82, "nll_loss": 0.1341703087091446, "rewards/accuracies": 1.0, "rewards/chosen": 0.3208577036857605, "rewards/margins": 7.719215393066406, "rewards/rejected": -7.39835786819458, "step": 554, "train_speed(iter/s)": 0.005352 }, { "epoch": 1.4388185654008439, "grad_norm": 5.593478679656982, "learning_rate": 3.973653636207437e-05, "logits/chosen": -1.3405157327651978, "logits/rejected": -1.3490185737609863, "logps/chosen": -5.513555526733398, "logps/rejected": -79.61082458496094, "loss": 0.4690606892108917, "memory(GiB)": 46.82, "nll_loss": 0.2211458384990692, "rewards/accuracies": 0.96875, "rewards/chosen": 0.24729761481285095, "rewards/margins": 7.00010871887207, "rewards/rejected": -6.752811431884766, "step": 555, "train_speed(iter/s)": 0.005352 }, { "epoch": 1.4414151249594287, "grad_norm": 0.7707073092460632, "learning_rate": 3.9394132927270613e-05, "logits/chosen": -1.3235504627227783, "logits/rejected": -1.3401741981506348, "logps/chosen": -4.119601249694824, "logps/rejected": -86.29273986816406, "loss": 0.16342757642269135, "memory(GiB)": 46.82, "nll_loss": 0.1537020206451416, "rewards/accuracies": 1.0, "rewards/chosen": 0.46904829144477844, "rewards/margins": 7.555969715118408, "rewards/rejected": -7.086921215057373, "step": 556, "train_speed(iter/s)": 0.005352 }, { "epoch": 1.4440116845180135, "grad_norm": 1.0258326530456543, "learning_rate": 3.9052848876201284e-05, "logits/chosen": -1.2859511375427246, "logits/rejected": -1.2992178201675415, "logps/chosen": -4.974706172943115, "logps/rejected": -72.67876434326172, "loss": 0.20728819072246552, "memory(GiB)": 46.82, "nll_loss": 0.19392336905002594, "rewards/accuracies": 1.0, "rewards/chosen": 0.6317263841629028, "rewards/margins": 6.647282123565674, "rewards/rejected": -6.0155558586120605, "step": 557, "train_speed(iter/s)": 0.005352 }, { "epoch": 1.4466082440765984, "grad_norm": 0.8165487051010132, "learning_rate": 3.871269051234555e-05, "logits/chosen": -1.3127992153167725, "logits/rejected": -1.329878330230713, "logps/chosen": -3.2941739559173584, "logps/rejected": -87.43807220458984, "loss": 0.17191743850708008, "memory(GiB)": 46.82, "nll_loss": 0.16360032558441162, "rewards/accuracies": 1.0, "rewards/chosen": 0.5402951240539551, "rewards/margins": 7.842915058135986, "rewards/rejected": -7.3026204109191895, "step": 558, "train_speed(iter/s)": 0.005352 }, { "epoch": 1.4492048036351834, "grad_norm": 0.7644895315170288, "learning_rate": 3.837366411839114e-05, "logits/chosen": -1.322697639465332, "logits/rejected": -1.3291290998458862, "logps/chosen": -3.767364025115967, "logps/rejected": -79.43592071533203, "loss": 0.13489316403865814, "memory(GiB)": 46.82, "nll_loss": 0.12984776496887207, "rewards/accuracies": 1.0, "rewards/chosen": 0.47781094908714294, "rewards/margins": 7.167353630065918, "rewards/rejected": -6.6895432472229, "step": 559, "train_speed(iter/s)": 0.005352 }, { "epoch": 1.4518013631937683, "grad_norm": 0.6488920450210571, "learning_rate": 3.8035775956118415e-05, "logits/chosen": -1.3089568614959717, "logits/rejected": -1.333059549331665, "logps/chosen": -3.604278087615967, "logps/rejected": -75.26642608642578, "loss": 0.12487327307462692, "memory(GiB)": 46.82, "nll_loss": 0.11769910156726837, "rewards/accuracies": 1.0, "rewards/chosen": 0.5058732032775879, "rewards/margins": 6.758044242858887, "rewards/rejected": -6.252170562744141, "step": 560, "train_speed(iter/s)": 0.005352 }, { "epoch": 1.4543979227523531, "grad_norm": 0.7780476212501526, "learning_rate": 3.7699032266284865e-05, "logits/chosen": -1.3105119466781616, "logits/rejected": -1.3256127834320068, "logps/chosen": -4.206973075866699, "logps/rejected": -81.01417541503906, "loss": 0.1642312854528427, "memory(GiB)": 46.82, "nll_loss": 0.1462475061416626, "rewards/accuracies": 1.0, "rewards/chosen": 0.469632625579834, "rewards/margins": 7.197355270385742, "rewards/rejected": -6.72772216796875, "step": 561, "train_speed(iter/s)": 0.005352 }, { "epoch": 1.456994482310938, "grad_norm": 1.534871220588684, "learning_rate": 3.7363439268509535e-05, "logits/chosen": -1.324033498764038, "logits/rejected": -1.3254599571228027, "logps/chosen": -6.707502365112305, "logps/rejected": -66.20709991455078, "loss": 0.34620898962020874, "memory(GiB)": 46.82, "nll_loss": 0.3185166120529175, "rewards/accuracies": 0.96875, "rewards/chosen": 0.49867385625839233, "rewards/margins": 6.206461429595947, "rewards/rejected": -5.707787036895752, "step": 562, "train_speed(iter/s)": 0.005351 }, { "epoch": 1.4595910418695228, "grad_norm": 0.9614840745925903, "learning_rate": 3.702900316115836e-05, "logits/chosen": -1.312652587890625, "logits/rejected": -1.3183560371398926, "logps/chosen": -6.137225151062012, "logps/rejected": -76.21929931640625, "loss": 0.24062488973140717, "memory(GiB)": 46.82, "nll_loss": 0.20657041668891907, "rewards/accuracies": 1.0, "rewards/chosen": 0.38741621375083923, "rewards/margins": 6.601250648498535, "rewards/rejected": -6.213834285736084, "step": 563, "train_speed(iter/s)": 0.005351 }, { "epoch": 1.4621876014281079, "grad_norm": 1.2924113273620605, "learning_rate": 3.669573012122973e-05, "logits/chosen": -1.2920567989349365, "logits/rejected": -1.29514741897583, "logps/chosen": -6.05202054977417, "logps/rejected": -62.32487106323242, "loss": 0.3004983067512512, "memory(GiB)": 46.82, "nll_loss": 0.27208033204078674, "rewards/accuracies": 1.0, "rewards/chosen": 0.6880547404289246, "rewards/margins": 5.9696760177612305, "rewards/rejected": -5.281620979309082, "step": 564, "train_speed(iter/s)": 0.005351 }, { "epoch": 1.4647841609866927, "grad_norm": 1.697675347328186, "learning_rate": 3.6363626304240184e-05, "logits/chosen": -1.3259660005569458, "logits/rejected": -1.3245418071746826, "logps/chosen": -4.952503681182861, "logps/rejected": -66.86807250976562, "loss": 0.20483994483947754, "memory(GiB)": 46.82, "nll_loss": 0.17799176275730133, "rewards/accuracies": 1.0, "rewards/chosen": 0.64216148853302, "rewards/margins": 6.409905433654785, "rewards/rejected": -5.767744064331055, "step": 565, "train_speed(iter/s)": 0.005351 }, { "epoch": 1.4673807205452776, "grad_norm": 0.9418896436691284, "learning_rate": 3.60326978441109e-05, "logits/chosen": -1.2750047445297241, "logits/rejected": -1.2927812337875366, "logps/chosen": -5.463886260986328, "logps/rejected": -86.8280258178711, "loss": 0.19925126433372498, "memory(GiB)": 46.82, "nll_loss": 0.18372556567192078, "rewards/accuracies": 1.0, "rewards/chosen": 0.38306546211242676, "rewards/margins": 7.263001441955566, "rewards/rejected": -6.879936218261719, "step": 566, "train_speed(iter/s)": 0.005351 }, { "epoch": 1.4699772801038624, "grad_norm": 1.4005364179611206, "learning_rate": 3.5702950853054284e-05, "logits/chosen": -1.2621244192123413, "logits/rejected": -1.2756032943725586, "logps/chosen": -4.0591864585876465, "logps/rejected": -76.57896423339844, "loss": 0.16474060714244843, "memory(GiB)": 46.82, "nll_loss": 0.15141594409942627, "rewards/accuracies": 1.0, "rewards/chosen": 0.3780522644519806, "rewards/margins": 6.907110691070557, "rewards/rejected": -6.529058933258057, "step": 567, "train_speed(iter/s)": 0.005351 }, { "epoch": 1.4725738396624473, "grad_norm": 0.6262617111206055, "learning_rate": 3.5374391421461274e-05, "logits/chosen": -1.3366174697875977, "logits/rejected": -1.3425589799880981, "logps/chosen": -5.0637078285217285, "logps/rejected": -75.93576049804688, "loss": 0.14967593550682068, "memory(GiB)": 46.82, "nll_loss": 0.13986575603485107, "rewards/accuracies": 1.0, "rewards/chosen": 0.45764419436454773, "rewards/margins": 6.864101409912109, "rewards/rejected": -6.406457901000977, "step": 568, "train_speed(iter/s)": 0.005351 }, { "epoch": 1.475170399221032, "grad_norm": 1.0724283456802368, "learning_rate": 3.5047025617788576e-05, "logits/chosen": -1.318103551864624, "logits/rejected": -1.3257315158843994, "logps/chosen": -4.4997782707214355, "logps/rejected": -69.55330657958984, "loss": 0.21760107576847076, "memory(GiB)": 46.82, "nll_loss": 0.20659759640693665, "rewards/accuracies": 1.0, "rewards/chosen": 0.36253267526626587, "rewards/margins": 6.121118545532227, "rewards/rejected": -5.758585453033447, "step": 569, "train_speed(iter/s)": 0.005351 }, { "epoch": 1.477766958779617, "grad_norm": 0.8618238568305969, "learning_rate": 3.472085948844674e-05, "logits/chosen": -1.3077456951141357, "logits/rejected": -1.3146158456802368, "logps/chosen": -4.7398481369018555, "logps/rejected": -75.23126220703125, "loss": 0.2030331939458847, "memory(GiB)": 46.82, "nll_loss": 0.19906149804592133, "rewards/accuracies": 1.0, "rewards/chosen": 0.6159305572509766, "rewards/margins": 6.953237533569336, "rewards/rejected": -6.337306499481201, "step": 570, "train_speed(iter/s)": 0.005351 }, { "epoch": 1.4803635183382018, "grad_norm": 2.220825433731079, "learning_rate": 3.439589905768857e-05, "logits/chosen": -1.3038007020950317, "logits/rejected": -1.314782977104187, "logps/chosen": -4.8768205642700195, "logps/rejected": -78.61490631103516, "loss": 0.2124282568693161, "memory(GiB)": 46.82, "nll_loss": 0.20312494039535522, "rewards/accuracies": 1.0, "rewards/chosen": 0.42080211639404297, "rewards/margins": 6.928518295288086, "rewards/rejected": -6.507716178894043, "step": 571, "train_speed(iter/s)": 0.005351 }, { "epoch": 1.4829600778967866, "grad_norm": 0.9802061915397644, "learning_rate": 3.407215032749763e-05, "logits/chosen": -1.2862904071807861, "logits/rejected": -1.2907946109771729, "logps/chosen": -6.141645431518555, "logps/rejected": -61.32841110229492, "loss": 0.2664101719856262, "memory(GiB)": 46.82, "nll_loss": 0.23925836384296417, "rewards/accuracies": 1.0, "rewards/chosen": 0.6145697832107544, "rewards/margins": 5.361448764801025, "rewards/rejected": -4.7468791007995605, "step": 572, "train_speed(iter/s)": 0.005351 }, { "epoch": 1.4855566374553717, "grad_norm": 0.7380911111831665, "learning_rate": 3.374961927747751e-05, "logits/chosen": -1.2636692523956299, "logits/rejected": -1.259122610092163, "logps/chosen": -5.851538181304932, "logps/rejected": -62.0422477722168, "loss": 0.2571408450603485, "memory(GiB)": 46.82, "nll_loss": 0.24986571073532104, "rewards/accuracies": 1.0, "rewards/chosen": 0.6978765726089478, "rewards/margins": 5.906915664672852, "rewards/rejected": -5.209038734436035, "step": 573, "train_speed(iter/s)": 0.005351 }, { "epoch": 1.4881531970139565, "grad_norm": 1.2015725374221802, "learning_rate": 3.342831186474149e-05, "logits/chosen": -1.2451616525650024, "logits/rejected": -1.2526040077209473, "logps/chosen": -6.031259536743164, "logps/rejected": -66.83104705810547, "loss": 0.23752854764461517, "memory(GiB)": 46.82, "nll_loss": 0.20862002670764923, "rewards/accuracies": 1.0, "rewards/chosen": 0.3990924656391144, "rewards/margins": 5.784240245819092, "rewards/rejected": -5.385148525238037, "step": 574, "train_speed(iter/s)": 0.005351 }, { "epoch": 1.4907497565725414, "grad_norm": 26.948949813842773, "learning_rate": 3.31082340238023e-05, "logits/chosen": -1.2702953815460205, "logits/rejected": -1.2942155599594116, "logps/chosen": -5.758556365966797, "logps/rejected": -79.33439636230469, "loss": 0.7174453735351562, "memory(GiB)": 46.82, "nll_loss": 0.5235574245452881, "rewards/accuracies": 0.9375, "rewards/chosen": 0.16809692978858948, "rewards/margins": 6.522285461425781, "rewards/rejected": -6.354187965393066, "step": 575, "train_speed(iter/s)": 0.005351 }, { "epoch": 1.4933463161311262, "grad_norm": 0.7220916748046875, "learning_rate": 3.2789391666462596e-05, "logits/chosen": -1.2505327463150024, "logits/rejected": -1.2620594501495361, "logps/chosen": -3.8762307167053223, "logps/rejected": -84.97810363769531, "loss": 0.15173956751823425, "memory(GiB)": 46.82, "nll_loss": 0.1497780978679657, "rewards/accuracies": 1.0, "rewards/chosen": 0.4926835298538208, "rewards/margins": 7.460906028747559, "rewards/rejected": -6.968222618103027, "step": 576, "train_speed(iter/s)": 0.005351 }, { "epoch": 1.495942875689711, "grad_norm": 1.8231993913650513, "learning_rate": 3.247179068170593e-05, "logits/chosen": -1.263367772102356, "logits/rejected": -1.272806167602539, "logps/chosen": -3.779219388961792, "logps/rejected": -70.675048828125, "loss": 0.18493540585041046, "memory(GiB)": 46.82, "nll_loss": 0.15074032545089722, "rewards/accuracies": 1.0, "rewards/chosen": 0.5790086984634399, "rewards/margins": 6.532997131347656, "rewards/rejected": -5.953989028930664, "step": 577, "train_speed(iter/s)": 0.005351 }, { "epoch": 1.4985394352482961, "grad_norm": 1.029189109802246, "learning_rate": 3.215543693558769e-05, "logits/chosen": -1.2609919309616089, "logits/rejected": -1.2647769451141357, "logps/chosen": -5.3333539962768555, "logps/rejected": -65.2447509765625, "loss": 0.23766495287418365, "memory(GiB)": 46.82, "nll_loss": 0.19680431485176086, "rewards/accuracies": 1.0, "rewards/chosen": 0.5142011642456055, "rewards/margins": 6.050221920013428, "rewards/rejected": -5.536020755767822, "step": 578, "train_speed(iter/s)": 0.005351 }, { "epoch": 1.501135994806881, "grad_norm": 1.0110372304916382, "learning_rate": 3.184033627112694e-05, "logits/chosen": -1.233156681060791, "logits/rejected": -1.2387574911117554, "logps/chosen": -7.914291858673096, "logps/rejected": -66.5923080444336, "loss": 0.26373106241226196, "memory(GiB)": 46.82, "nll_loss": 0.233109250664711, "rewards/accuracies": 1.0, "rewards/chosen": 0.7227498888969421, "rewards/margins": 6.343271255493164, "rewards/rejected": -5.620521545410156, "step": 579, "train_speed(iter/s)": 0.005351 }, { "epoch": 1.5037325543654658, "grad_norm": 0.8185076117515564, "learning_rate": 3.1526494508198525e-05, "logits/chosen": -1.2909034490585327, "logits/rejected": -1.3032139539718628, "logps/chosen": -5.271670818328857, "logps/rejected": -70.27622985839844, "loss": 0.22915054857730865, "memory(GiB)": 46.82, "nll_loss": 0.2062722146511078, "rewards/accuracies": 1.0, "rewards/chosen": 0.4416859745979309, "rewards/margins": 6.420576095581055, "rewards/rejected": -5.978890419006348, "step": 580, "train_speed(iter/s)": 0.005352 }, { "epoch": 1.5063291139240507, "grad_norm": 0.7780730128288269, "learning_rate": 3.121391744342546e-05, "logits/chosen": -1.27274489402771, "logits/rejected": -1.2946935892105103, "logps/chosen": -2.167703628540039, "logps/rejected": -82.38484191894531, "loss": 0.1313847005367279, "memory(GiB)": 46.82, "nll_loss": 0.124984011054039, "rewards/accuracies": 1.0, "rewards/chosen": 0.4470738470554352, "rewards/margins": 7.279787063598633, "rewards/rejected": -6.832714557647705, "step": 581, "train_speed(iter/s)": 0.005352 }, { "epoch": 1.5089256734826355, "grad_norm": 0.7834947109222412, "learning_rate": 3.0902610850071924e-05, "logits/chosen": -1.2649881839752197, "logits/rejected": -1.270396113395691, "logps/chosen": -4.809529781341553, "logps/rejected": -75.95304107666016, "loss": 0.21607160568237305, "memory(GiB)": 46.82, "nll_loss": 0.19319041073322296, "rewards/accuracies": 1.0, "rewards/chosen": 0.6121608018875122, "rewards/margins": 7.184690475463867, "rewards/rejected": -6.572530269622803, "step": 582, "train_speed(iter/s)": 0.005352 }, { "epoch": 1.5115222330412204, "grad_norm": 1.0974911451339722, "learning_rate": 3.059258047793661e-05, "logits/chosen": -1.2686303853988647, "logits/rejected": -1.266996145248413, "logps/chosen": -6.2699503898620605, "logps/rejected": -75.85345458984375, "loss": 0.20134985446929932, "memory(GiB)": 46.82, "nll_loss": 0.19503507018089294, "rewards/accuracies": 1.0, "rewards/chosen": 0.5324012041091919, "rewards/margins": 6.867381572723389, "rewards/rejected": -6.334980487823486, "step": 583, "train_speed(iter/s)": 0.005352 }, { "epoch": 1.5141187925998052, "grad_norm": 0.8552331924438477, "learning_rate": 3.028383205324664e-05, "logits/chosen": -1.2964813709259033, "logits/rejected": -1.2977771759033203, "logps/chosen": -4.300373077392578, "logps/rejected": -71.34073638916016, "loss": 0.1761379987001419, "memory(GiB)": 46.82, "nll_loss": 0.16346776485443115, "rewards/accuracies": 1.0, "rewards/chosen": 0.5423522591590881, "rewards/margins": 6.4881744384765625, "rewards/rejected": -5.945821762084961, "step": 584, "train_speed(iter/s)": 0.005352 }, { "epoch": 1.51671535215839, "grad_norm": 2.7961208820343018, "learning_rate": 2.9976371278551596e-05, "logits/chosen": -1.26725172996521, "logits/rejected": -1.2702522277832031, "logps/chosen": -6.598125457763672, "logps/rejected": -75.9102783203125, "loss": 0.21579381823539734, "memory(GiB)": 46.82, "nll_loss": 0.2034890353679657, "rewards/accuracies": 1.0, "rewards/chosen": 0.5635837912559509, "rewards/margins": 6.742549419403076, "rewards/rejected": -6.178965091705322, "step": 585, "train_speed(iter/s)": 0.005352 }, { "epoch": 1.5193119117169749, "grad_norm": 0.7595794796943665, "learning_rate": 2.9670203832618338e-05, "logits/chosen": -1.3211987018585205, "logits/rejected": -1.3264515399932861, "logps/chosen": -5.026176452636719, "logps/rejected": -73.40199279785156, "loss": 0.2131197303533554, "memory(GiB)": 46.82, "nll_loss": 0.20605915784835815, "rewards/accuracies": 1.0, "rewards/chosen": 0.5510646104812622, "rewards/margins": 6.663293361663818, "rewards/rejected": -6.112229347229004, "step": 586, "train_speed(iter/s)": 0.005352 }, { "epoch": 1.5219084712755597, "grad_norm": 0.5875643491744995, "learning_rate": 2.9365335370326142e-05, "logits/chosen": -1.2664649486541748, "logits/rejected": -1.2790292501449585, "logps/chosen": -4.272137641906738, "logps/rejected": -78.49589538574219, "loss": 0.16073563694953918, "memory(GiB)": 46.82, "nll_loss": 0.14196071028709412, "rewards/accuracies": 1.0, "rewards/chosen": 0.5238849520683289, "rewards/margins": 7.083423614501953, "rewards/rejected": -6.559538841247559, "step": 587, "train_speed(iter/s)": 0.005352 }, { "epoch": 1.5245050308341448, "grad_norm": 0.5453342795372009, "learning_rate": 2.906177152256214e-05, "logits/chosen": -1.2802778482437134, "logits/rejected": -1.287778615951538, "logps/chosen": -3.453296661376953, "logps/rejected": -80.28994750976562, "loss": 0.11858940124511719, "memory(GiB)": 46.82, "nll_loss": 0.114979088306427, "rewards/accuracies": 1.0, "rewards/chosen": 0.3646010160446167, "rewards/margins": 7.368077278137207, "rewards/rejected": -7.003476619720459, "step": 588, "train_speed(iter/s)": 0.005352 }, { "epoch": 1.5271015903927296, "grad_norm": 0.8347062468528748, "learning_rate": 2.875951789611734e-05, "logits/chosen": -1.2904810905456543, "logits/rejected": -1.2961167097091675, "logps/chosen": -7.039205551147461, "logps/rejected": -79.34686279296875, "loss": 0.20924313366413116, "memory(GiB)": 46.82, "nll_loss": 0.18833908438682556, "rewards/accuracies": 1.0, "rewards/chosen": 0.5033472180366516, "rewards/margins": 7.3004374504089355, "rewards/rejected": -6.797090530395508, "step": 589, "train_speed(iter/s)": 0.005352 }, { "epoch": 1.5296981499513145, "grad_norm": 0.6540753841400146, "learning_rate": 2.8458580073583264e-05, "logits/chosen": -1.266171932220459, "logits/rejected": -1.2721834182739258, "logps/chosen": -4.1306471824646, "logps/rejected": -74.91023254394531, "loss": 0.1655585914850235, "memory(GiB)": 46.82, "nll_loss": 0.1580181121826172, "rewards/accuracies": 1.0, "rewards/chosen": 0.32985809445381165, "rewards/margins": 6.546298980712891, "rewards/rejected": -6.216440677642822, "step": 590, "train_speed(iter/s)": 0.005352 }, { "epoch": 1.5322947095098995, "grad_norm": 0.6838015913963318, "learning_rate": 2.8158963613248433e-05, "logits/chosen": -1.303230881690979, "logits/rejected": -1.3014085292816162, "logps/chosen": -5.523627281188965, "logps/rejected": -60.67312240600586, "loss": 0.19359934329986572, "memory(GiB)": 46.82, "nll_loss": 0.15228185057640076, "rewards/accuracies": 1.0, "rewards/chosen": 0.5309136509895325, "rewards/margins": 5.451134204864502, "rewards/rejected": -4.920220851898193, "step": 591, "train_speed(iter/s)": 0.005352 }, { "epoch": 1.5348912690684844, "grad_norm": 1.0530349016189575, "learning_rate": 2.786067404899617e-05, "logits/chosen": -1.2414886951446533, "logits/rejected": -1.2445082664489746, "logps/chosen": -5.888449192047119, "logps/rejected": -71.38929748535156, "loss": 0.22650176286697388, "memory(GiB)": 46.82, "nll_loss": 0.20438861846923828, "rewards/accuracies": 1.0, "rewards/chosen": 0.49599599838256836, "rewards/margins": 6.550296306610107, "rewards/rejected": -6.054300785064697, "step": 592, "train_speed(iter/s)": 0.005352 }, { "epoch": 1.5374878286270692, "grad_norm": 0.9590216875076294, "learning_rate": 2.756371689020214e-05, "logits/chosen": -1.284089207649231, "logits/rejected": -1.291182041168213, "logps/chosen": -5.660233497619629, "logps/rejected": -78.09732055664062, "loss": 0.21897563338279724, "memory(GiB)": 46.82, "nll_loss": 0.20564842224121094, "rewards/accuracies": 1.0, "rewards/chosen": 0.6212056279182434, "rewards/margins": 7.130356311798096, "rewards/rejected": -6.509150981903076, "step": 593, "train_speed(iter/s)": 0.005353 }, { "epoch": 1.540084388185654, "grad_norm": 0.8171280026435852, "learning_rate": 2.726809762163247e-05, "logits/chosen": -1.2626338005065918, "logits/rejected": -1.2816903591156006, "logps/chosen": -3.3798415660858154, "logps/rejected": -79.01041412353516, "loss": 0.1683107167482376, "memory(GiB)": 46.82, "nll_loss": 0.1568489968776703, "rewards/accuracies": 1.0, "rewards/chosen": 0.6359814405441284, "rewards/margins": 7.243876934051514, "rewards/rejected": -6.607895374298096, "step": 594, "train_speed(iter/s)": 0.005353 }, { "epoch": 1.542680947744239, "grad_norm": 0.7614494562149048, "learning_rate": 2.697382170334275e-05, "logits/chosen": -1.2870750427246094, "logits/rejected": -1.2988437414169312, "logps/chosen": -3.8276844024658203, "logps/rejected": -80.0929946899414, "loss": 0.15257692337036133, "memory(GiB)": 46.82, "nll_loss": 0.14827337861061096, "rewards/accuracies": 1.0, "rewards/chosen": 0.44497260451316833, "rewards/margins": 7.25712776184082, "rewards/rejected": -6.812155246734619, "step": 595, "train_speed(iter/s)": 0.005353 }, { "epoch": 1.5452775073028238, "grad_norm": 0.7709101438522339, "learning_rate": 2.668089457057704e-05, "logits/chosen": -1.3179664611816406, "logits/rejected": -1.3277684450149536, "logps/chosen": -3.917905807495117, "logps/rejected": -73.78385162353516, "loss": 0.20244568586349487, "memory(GiB)": 46.82, "nll_loss": 0.1898242086172104, "rewards/accuracies": 1.0, "rewards/chosen": 0.408854603767395, "rewards/margins": 6.5159125328063965, "rewards/rejected": -6.107057571411133, "step": 596, "train_speed(iter/s)": 0.005353 }, { "epoch": 1.5478740668614086, "grad_norm": 1.1506835222244263, "learning_rate": 2.638932163366742e-05, "logits/chosen": -1.2968817949295044, "logits/rejected": -1.307157278060913, "logps/chosen": -3.7310962677001953, "logps/rejected": -79.50012969970703, "loss": 0.1415027379989624, "memory(GiB)": 46.82, "nll_loss": 0.12706293165683746, "rewards/accuracies": 1.0, "rewards/chosen": 0.38727837800979614, "rewards/margins": 7.095935344696045, "rewards/rejected": -6.708656311035156, "step": 597, "train_speed(iter/s)": 0.005354 }, { "epoch": 1.5504706264199934, "grad_norm": 1.2147072553634644, "learning_rate": 2.6099108277934103e-05, "logits/chosen": -1.3259124755859375, "logits/rejected": -1.3342318534851074, "logps/chosen": -5.113812446594238, "logps/rejected": -72.30021667480469, "loss": 0.23814579844474792, "memory(GiB)": 46.82, "nll_loss": 0.1989901065826416, "rewards/accuracies": 1.0, "rewards/chosen": 0.3370703458786011, "rewards/margins": 6.340109825134277, "rewards/rejected": -6.003039836883545, "step": 598, "train_speed(iter/s)": 0.005353 }, { "epoch": 1.5530671859785783, "grad_norm": 0.6469516754150391, "learning_rate": 2.5810259863586018e-05, "logits/chosen": -1.3008332252502441, "logits/rejected": -1.3114441633224487, "logps/chosen": -3.1887383460998535, "logps/rejected": -89.48507690429688, "loss": 0.10776513069868088, "memory(GiB)": 46.82, "nll_loss": 0.1028357744216919, "rewards/accuracies": 1.0, "rewards/chosen": 0.410270631313324, "rewards/margins": 7.939424514770508, "rewards/rejected": -7.529153823852539, "step": 599, "train_speed(iter/s)": 0.005354 }, { "epoch": 1.5556637455371631, "grad_norm": 0.5676211714744568, "learning_rate": 2.5522781725621813e-05, "logits/chosen": -1.3371210098266602, "logits/rejected": -1.3387823104858398, "logps/chosen": -3.7307708263397217, "logps/rejected": -80.85253143310547, "loss": 0.13133268058300018, "memory(GiB)": 46.82, "nll_loss": 0.12862281501293182, "rewards/accuracies": 1.0, "rewards/chosen": 0.5126275420188904, "rewards/margins": 7.358179092407227, "rewards/rejected": -6.845551013946533, "step": 600, "train_speed(iter/s)": 0.005354 }, { "epoch": 1.5556637455371631, "eval_logits/chosen": -1.304226040840149, "eval_logits/rejected": -1.3143255710601807, "eval_logps/chosen": -7.2022528648376465, "eval_logps/rejected": -78.7955551147461, "eval_loss": 0.2647717297077179, "eval_nll_loss": 0.2476370930671692, "eval_rewards/accuracies": 1.0, "eval_rewards/chosen": 0.5162011384963989, "eval_rewards/margins": 7.155314922332764, "eval_rewards/rejected": -6.639112949371338, "eval_runtime": 291.2848, "eval_samples_per_second": 0.426, "eval_steps_per_second": 0.426, "step": 600 }, { "epoch": 1.558260305095748, "grad_norm": 0.5284009575843811, "learning_rate": 2.523667917373125e-05, "logits/chosen": -1.2985765933990479, "logits/rejected": -1.3168220520019531, "logps/chosen": -2.943354368209839, "logps/rejected": -91.36310577392578, "loss": 0.09971652179956436, "memory(GiB)": 46.82, "nll_loss": 0.0945102795958519, "rewards/accuracies": 1.0, "rewards/chosen": 0.5126221776008606, "rewards/margins": 8.36147403717041, "rewards/rejected": -7.848851203918457, "step": 601, "train_speed(iter/s)": 0.005339 }, { "epoch": 1.560856864654333, "grad_norm": 0.5907682776451111, "learning_rate": 2.4951957492197097e-05, "logits/chosen": -1.2848440408706665, "logits/rejected": -1.2836586236953735, "logps/chosen": -3.989741563796997, "logps/rejected": -70.67216491699219, "loss": 0.14021284878253937, "memory(GiB)": 46.82, "nll_loss": 0.13644501566886902, "rewards/accuracies": 1.0, "rewards/chosen": 0.7150586843490601, "rewards/margins": 6.884438514709473, "rewards/rejected": -6.169380187988281, "step": 602, "train_speed(iter/s)": 0.005339 }, { "epoch": 1.5634534242129179, "grad_norm": 0.6943731904029846, "learning_rate": 2.4668621939797743e-05, "logits/chosen": -1.3670181035995483, "logits/rejected": -1.380336880683899, "logps/chosen": -4.377835273742676, "logps/rejected": -79.83389282226562, "loss": 0.16850493848323822, "memory(GiB)": 46.82, "nll_loss": 0.1525357961654663, "rewards/accuracies": 1.0, "rewards/chosen": 0.3955461382865906, "rewards/margins": 7.191918849945068, "rewards/rejected": -6.79637336730957, "step": 603, "train_speed(iter/s)": 0.005339 }, { "epoch": 1.5660499837715027, "grad_norm": 0.7594765424728394, "learning_rate": 2.438667774970981e-05, "logits/chosen": -1.3331427574157715, "logits/rejected": -1.3355261087417603, "logps/chosen": -3.4951040744781494, "logps/rejected": -73.5210189819336, "loss": 0.15708421170711517, "memory(GiB)": 46.82, "nll_loss": 0.14821352064609528, "rewards/accuracies": 1.0, "rewards/chosen": 0.6260663270950317, "rewards/margins": 6.858430862426758, "rewards/rejected": -6.232364654541016, "step": 604, "train_speed(iter/s)": 0.005339 }, { "epoch": 1.5686465433300878, "grad_norm": 0.7032631039619446, "learning_rate": 2.410613012941161e-05, "logits/chosen": -1.3653652667999268, "logits/rejected": -1.3712530136108398, "logps/chosen": -4.2118754386901855, "logps/rejected": -76.30243682861328, "loss": 0.1958620846271515, "memory(GiB)": 46.82, "nll_loss": 0.1903282105922699, "rewards/accuracies": 1.0, "rewards/chosen": 0.6078907251358032, "rewards/margins": 7.107419490814209, "rewards/rejected": -6.499528884887695, "step": 605, "train_speed(iter/s)": 0.005339 }, { "epoch": 1.5712431028886726, "grad_norm": 0.849923849105835, "learning_rate": 2.382698426058708e-05, "logits/chosen": -1.335965871810913, "logits/rejected": -1.3330975770950317, "logps/chosen": -6.150424003601074, "logps/rejected": -76.69558715820312, "loss": 0.20354051887989044, "memory(GiB)": 46.82, "nll_loss": 0.19987499713897705, "rewards/accuracies": 1.0, "rewards/chosen": 0.6220974922180176, "rewards/margins": 7.106598377227783, "rewards/rejected": -6.484500885009766, "step": 606, "train_speed(iter/s)": 0.005339 }, { "epoch": 1.5738396624472575, "grad_norm": 0.6774344444274902, "learning_rate": 2.3549245299029777e-05, "logits/chosen": -1.349198341369629, "logits/rejected": -1.3615375757217407, "logps/chosen": -3.236879348754883, "logps/rejected": -86.70790100097656, "loss": 0.104849673807621, "memory(GiB)": 46.82, "nll_loss": 0.10025446116924286, "rewards/accuracies": 1.0, "rewards/chosen": 0.6544709205627441, "rewards/margins": 7.710179805755615, "rewards/rejected": -7.055708885192871, "step": 607, "train_speed(iter/s)": 0.005339 }, { "epoch": 1.5764362220058423, "grad_norm": 0.9244331121444702, "learning_rate": 2.3272918374547993e-05, "logits/chosen": -1.353797197341919, "logits/rejected": -1.3594809770584106, "logps/chosen": -5.656945705413818, "logps/rejected": -75.61239624023438, "loss": 0.1939372569322586, "memory(GiB)": 46.82, "nll_loss": 0.172727569937706, "rewards/accuracies": 1.0, "rewards/chosen": 0.4641644358634949, "rewards/margins": 6.93808650970459, "rewards/rejected": -6.473921775817871, "step": 608, "train_speed(iter/s)": 0.005339 }, { "epoch": 1.5790327815644272, "grad_norm": 0.7308290600776672, "learning_rate": 2.2998008590869836e-05, "logits/chosen": -1.3354146480560303, "logits/rejected": -1.3375046253204346, "logps/chosen": -5.986130714416504, "logps/rejected": -75.91438293457031, "loss": 0.19244912266731262, "memory(GiB)": 46.82, "nll_loss": 0.1849290430545807, "rewards/accuracies": 1.0, "rewards/chosen": 0.5376923680305481, "rewards/margins": 6.803253173828125, "rewards/rejected": -6.265561103820801, "step": 609, "train_speed(iter/s)": 0.005339 }, { "epoch": 1.581629341123012, "grad_norm": 0.8735436797142029, "learning_rate": 2.2724521025548828e-05, "logits/chosen": -1.3188555240631104, "logits/rejected": -1.3274950981140137, "logps/chosen": -4.066837310791016, "logps/rejected": -85.56442260742188, "loss": 0.17418046295642853, "memory(GiB)": 46.82, "nll_loss": 0.16407504677772522, "rewards/accuracies": 1.0, "rewards/chosen": 0.4197569489479065, "rewards/margins": 7.919032096862793, "rewards/rejected": -7.499274253845215, "step": 610, "train_speed(iter/s)": 0.00534 }, { "epoch": 1.5842259006815969, "grad_norm": 2.2200708389282227, "learning_rate": 2.245246072987045e-05, "logits/chosen": -1.2984387874603271, "logits/rejected": -1.3079633712768555, "logps/chosen": -6.325509071350098, "logps/rejected": -74.75194549560547, "loss": 0.26426559686660767, "memory(GiB)": 46.82, "nll_loss": 0.22844800353050232, "rewards/accuracies": 1.0, "rewards/chosen": 0.2353907823562622, "rewards/margins": 6.702395439147949, "rewards/rejected": -6.467005252838135, "step": 611, "train_speed(iter/s)": 0.00534 }, { "epoch": 1.5868224602401817, "grad_norm": 0.7086100578308105, "learning_rate": 2.2181832728758632e-05, "logits/chosen": -1.3292683362960815, "logits/rejected": -1.342342495918274, "logps/chosen": -7.971512794494629, "logps/rejected": -74.80581665039062, "loss": 0.2390933483839035, "memory(GiB)": 46.82, "nll_loss": 0.2257128208875656, "rewards/accuracies": 1.0, "rewards/chosen": 0.5516778826713562, "rewards/margins": 6.869455337524414, "rewards/rejected": -6.317777633666992, "step": 612, "train_speed(iter/s)": 0.005341 }, { "epoch": 1.5894190197987665, "grad_norm": 6.074515342712402, "learning_rate": 2.191264202068286e-05, "logits/chosen": -1.330883264541626, "logits/rejected": -1.3335540294647217, "logps/chosen": -4.599937438964844, "logps/rejected": -75.81354522705078, "loss": 0.20728431642055511, "memory(GiB)": 46.82, "nll_loss": 0.19485875964164734, "rewards/accuracies": 1.0, "rewards/chosen": 0.49222689867019653, "rewards/margins": 7.163850784301758, "rewards/rejected": -6.671623706817627, "step": 613, "train_speed(iter/s)": 0.005341 }, { "epoch": 1.5920155793573514, "grad_norm": 0.7445679306983948, "learning_rate": 2.1644893577566116e-05, "logits/chosen": -1.3524935245513916, "logits/rejected": -1.3670296669006348, "logps/chosen": -4.401839733123779, "logps/rejected": -75.92784881591797, "loss": 0.17038778960704803, "memory(GiB)": 46.82, "nll_loss": 0.1660994589328766, "rewards/accuracies": 1.0, "rewards/chosen": 0.6142419576644897, "rewards/margins": 6.9780192375183105, "rewards/rejected": -6.363776683807373, "step": 614, "train_speed(iter/s)": 0.005341 }, { "epoch": 1.5946121389159362, "grad_norm": 0.6692366600036621, "learning_rate": 2.1378592344692862e-05, "logits/chosen": -1.3450599908828735, "logits/rejected": -1.3609131574630737, "logps/chosen": -2.963831901550293, "logps/rejected": -85.60203552246094, "loss": 0.11893543601036072, "memory(GiB)": 46.82, "nll_loss": 0.10431487113237381, "rewards/accuracies": 1.0, "rewards/chosen": 0.49938374757766724, "rewards/margins": 7.664846897125244, "rewards/rejected": -7.165462017059326, "step": 615, "train_speed(iter/s)": 0.005341 }, { "epoch": 1.5972086984745213, "grad_norm": 1.2328548431396484, "learning_rate": 2.1113743240617668e-05, "logits/chosen": -1.343220829963684, "logits/rejected": -1.3497005701065063, "logps/chosen": -4.603923797607422, "logps/rejected": -75.76362609863281, "loss": 0.18495653569698334, "memory(GiB)": 46.82, "nll_loss": 0.15200993418693542, "rewards/accuracies": 1.0, "rewards/chosen": 0.6504652500152588, "rewards/margins": 6.986648082733154, "rewards/rejected": -6.336182594299316, "step": 616, "train_speed(iter/s)": 0.005341 }, { "epoch": 1.5998052580331061, "grad_norm": 0.7638961672782898, "learning_rate": 2.0850351157074598e-05, "logits/chosen": -1.3338675498962402, "logits/rejected": -1.3393734693527222, "logps/chosen": -5.415805339813232, "logps/rejected": -76.63778686523438, "loss": 0.19142858684062958, "memory(GiB)": 46.82, "nll_loss": 0.17946861684322357, "rewards/accuracies": 1.0, "rewards/chosen": 0.5905900597572327, "rewards/margins": 7.105247974395752, "rewards/rejected": -6.514657974243164, "step": 617, "train_speed(iter/s)": 0.005341 }, { "epoch": 1.602401817591691, "grad_norm": 0.7070993185043335, "learning_rate": 2.0588420958886578e-05, "logits/chosen": -1.3037599325180054, "logits/rejected": -1.3092586994171143, "logps/chosen": -3.857360363006592, "logps/rejected": -74.8001708984375, "loss": 0.16437619924545288, "memory(GiB)": 46.82, "nll_loss": 0.13853932917118073, "rewards/accuracies": 1.0, "rewards/chosen": 0.31387850642204285, "rewards/margins": 6.748230934143066, "rewards/rejected": -6.434351921081543, "step": 618, "train_speed(iter/s)": 0.005341 }, { "epoch": 1.604998377150276, "grad_norm": 0.942775309085846, "learning_rate": 2.0327957483875694e-05, "logits/chosen": -1.3658478260040283, "logits/rejected": -1.3638713359832764, "logps/chosen": -5.2065839767456055, "logps/rejected": -75.38078308105469, "loss": 0.19663846492767334, "memory(GiB)": 46.82, "nll_loss": 0.15267634391784668, "rewards/accuracies": 1.0, "rewards/chosen": 0.4773911237716675, "rewards/margins": 6.9232282638549805, "rewards/rejected": -6.445837497711182, "step": 619, "train_speed(iter/s)": 0.005341 }, { "epoch": 1.6075949367088609, "grad_norm": 0.7806491255760193, "learning_rate": 2.0068965542773876e-05, "logits/chosen": -1.324061632156372, "logits/rejected": -1.3434507846832275, "logps/chosen": -2.706183671951294, "logps/rejected": -81.15982055664062, "loss": 0.14189621806144714, "memory(GiB)": 46.82, "nll_loss": 0.12525126338005066, "rewards/accuracies": 1.0, "rewards/chosen": 0.5728058815002441, "rewards/margins": 7.6588029861450195, "rewards/rejected": -7.085996150970459, "step": 620, "train_speed(iter/s)": 0.005341 }, { "epoch": 1.6101914962674457, "grad_norm": 0.7165568470954895, "learning_rate": 1.981144991913392e-05, "logits/chosen": -1.347527027130127, "logits/rejected": -1.3617969751358032, "logps/chosen": -3.1274702548980713, "logps/rejected": -89.35918426513672, "loss": 0.13759316504001617, "memory(GiB)": 46.82, "nll_loss": 0.12061534821987152, "rewards/accuracies": 1.0, "rewards/chosen": 0.5373324751853943, "rewards/margins": 8.121000289916992, "rewards/rejected": -7.583667755126953, "step": 621, "train_speed(iter/s)": 0.005341 }, { "epoch": 1.6127880558260306, "grad_norm": 0.7025841474533081, "learning_rate": 1.9555415369241225e-05, "logits/chosen": -1.3251571655273438, "logits/rejected": -1.3403229713439941, "logps/chosen": -2.860119104385376, "logps/rejected": -89.72604370117188, "loss": 0.12598752975463867, "memory(GiB)": 46.82, "nll_loss": 0.12241947650909424, "rewards/accuracies": 1.0, "rewards/chosen": 0.48666584491729736, "rewards/margins": 8.185951232910156, "rewards/rejected": -7.69928503036499, "step": 622, "train_speed(iter/s)": 0.005341 }, { "epoch": 1.6153846153846154, "grad_norm": 0.7084252834320068, "learning_rate": 1.9300866622025893e-05, "logits/chosen": -1.371070384979248, "logits/rejected": -1.383573293685913, "logps/chosen": -5.293520927429199, "logps/rejected": -87.0187759399414, "loss": 0.15480637550354004, "memory(GiB)": 46.82, "nll_loss": 0.1465662270784378, "rewards/accuracies": 1.0, "rewards/chosen": 0.3128480911254883, "rewards/margins": 7.824625492095947, "rewards/rejected": -7.511777877807617, "step": 623, "train_speed(iter/s)": 0.005341 }, { "epoch": 1.6179811749432003, "grad_norm": 0.7480162978172302, "learning_rate": 1.9047808378975486e-05, "logits/chosen": -1.3239214420318604, "logits/rejected": -1.3253374099731445, "logps/chosen": -6.071501731872559, "logps/rejected": -89.98245239257812, "loss": 0.18201348185539246, "memory(GiB)": 46.82, "nll_loss": 0.1786748617887497, "rewards/accuracies": 1.0, "rewards/chosen": 0.5310088396072388, "rewards/margins": 8.276474952697754, "rewards/rejected": -7.745467185974121, "step": 624, "train_speed(iter/s)": 0.005341 }, { "epoch": 1.620577734501785, "grad_norm": 0.7341568470001221, "learning_rate": 1.8796245314048044e-05, "logits/chosen": -1.350547432899475, "logits/rejected": -1.3660997152328491, "logps/chosen": -2.5804781913757324, "logps/rejected": -85.6153793334961, "loss": 0.12906776368618011, "memory(GiB)": 46.82, "nll_loss": 0.1090274304151535, "rewards/accuracies": 1.0, "rewards/chosen": 0.5288074612617493, "rewards/margins": 7.744842052459717, "rewards/rejected": -7.216034412384033, "step": 625, "train_speed(iter/s)": 0.005341 }, { "epoch": 1.62317429406037, "grad_norm": 0.6811425089836121, "learning_rate": 1.8546182073585828e-05, "logits/chosen": -1.3307138681411743, "logits/rejected": -1.3467280864715576, "logps/chosen": -4.399513244628906, "logps/rejected": -95.36567687988281, "loss": 0.17138627171516418, "memory(GiB)": 46.82, "nll_loss": 0.1693284511566162, "rewards/accuracies": 1.0, "rewards/chosen": 0.36113083362579346, "rewards/margins": 8.433231353759766, "rewards/rejected": -8.072100639343262, "step": 626, "train_speed(iter/s)": 0.005341 }, { "epoch": 1.6257708536189548, "grad_norm": 0.8490860462188721, "learning_rate": 1.829762327622958e-05, "logits/chosen": -1.328543782234192, "logits/rejected": -1.346970558166504, "logps/chosen": -4.569067001342773, "logps/rejected": -94.38148498535156, "loss": 0.15949155390262604, "memory(GiB)": 46.82, "nll_loss": 0.15811914205551147, "rewards/accuracies": 1.0, "rewards/chosen": 0.4599432945251465, "rewards/margins": 8.337040901184082, "rewards/rejected": -7.8770976066589355, "step": 627, "train_speed(iter/s)": 0.005341 }, { "epoch": 1.6283674131775396, "grad_norm": 0.8323735594749451, "learning_rate": 1.8050573512833068e-05, "logits/chosen": -1.3728554248809814, "logits/rejected": -1.388077735900879, "logps/chosen": -3.635087490081787, "logps/rejected": -84.30162811279297, "loss": 0.16639482975006104, "memory(GiB)": 46.82, "nll_loss": 0.1421230286359787, "rewards/accuracies": 1.0, "rewards/chosen": 0.4008945822715759, "rewards/margins": 7.5037126541137695, "rewards/rejected": -7.102817535400391, "step": 628, "train_speed(iter/s)": 0.005341 }, { "epoch": 1.6309639727361245, "grad_norm": 0.7016049027442932, "learning_rate": 1.7805037346378384e-05, "logits/chosen": -1.3624804019927979, "logits/rejected": -1.3788541555404663, "logps/chosen": -4.170276165008545, "logps/rejected": -90.93599700927734, "loss": 0.15539219975471497, "memory(GiB)": 46.82, "nll_loss": 0.14993149042129517, "rewards/accuracies": 1.0, "rewards/chosen": 0.5223506689071655, "rewards/margins": 8.19238567352295, "rewards/rejected": -7.670035362243652, "step": 629, "train_speed(iter/s)": 0.005341 }, { "epoch": 1.6335605322947095, "grad_norm": 5.010850429534912, "learning_rate": 1.7561019311891692e-05, "logits/chosen": -1.3748408555984497, "logits/rejected": -1.3848907947540283, "logps/chosen": -5.912624835968018, "logps/rejected": -90.88970184326172, "loss": 0.2722803056240082, "memory(GiB)": 46.82, "nll_loss": 0.22955626249313354, "rewards/accuracies": 0.96875, "rewards/chosen": 0.46179163455963135, "rewards/margins": 8.070945739746094, "rewards/rejected": -7.60915470123291, "step": 630, "train_speed(iter/s)": 0.005341 }, { "epoch": 1.6361570918532944, "grad_norm": 0.763546347618103, "learning_rate": 1.7318523916359375e-05, "logits/chosen": -1.324263572692871, "logits/rejected": -1.3297150135040283, "logps/chosen": -3.0377016067504883, "logps/rejected": -80.36509704589844, "loss": 0.13964565098285675, "memory(GiB)": 46.82, "nll_loss": 0.11970542371273041, "rewards/accuracies": 1.0, "rewards/chosen": 0.6791478395462036, "rewards/margins": 7.430585861206055, "rewards/rejected": -6.751438140869141, "step": 631, "train_speed(iter/s)": 0.005341 }, { "epoch": 1.6387536514118792, "grad_norm": 0.7758535742759705, "learning_rate": 1.707755563864484e-05, "logits/chosen": -1.3663057088851929, "logits/rejected": -1.3660892248153687, "logps/chosen": -7.182569980621338, "logps/rejected": -77.53275299072266, "loss": 0.20710787177085876, "memory(GiB)": 46.82, "nll_loss": 0.18503035604953766, "rewards/accuracies": 1.0, "rewards/chosen": 0.5746399164199829, "rewards/margins": 7.321009635925293, "rewards/rejected": -6.746369361877441, "step": 632, "train_speed(iter/s)": 0.005341 }, { "epoch": 1.6413502109704643, "grad_norm": 18.8266544342041, "learning_rate": 1.6838118929405854e-05, "logits/chosen": -1.3572516441345215, "logits/rejected": -1.3695107698440552, "logps/chosen": -4.2153215408325195, "logps/rejected": -70.64273834228516, "loss": 0.2971822917461395, "memory(GiB)": 46.82, "nll_loss": 0.28246480226516724, "rewards/accuracies": 1.0, "rewards/chosen": 0.355130672454834, "rewards/margins": 6.3078107833862305, "rewards/rejected": -5.952679634094238, "step": 633, "train_speed(iter/s)": 0.005341 }, { "epoch": 1.6439467705290491, "grad_norm": 0.8900645971298218, "learning_rate": 1.660021821101222e-05, "logits/chosen": -1.3750463724136353, "logits/rejected": -1.3676670789718628, "logps/chosen": -8.479406356811523, "logps/rejected": -74.21772003173828, "loss": 0.2598121166229248, "memory(GiB)": 46.82, "nll_loss": 0.2488086223602295, "rewards/accuracies": 1.0, "rewards/chosen": 0.7162144184112549, "rewards/margins": 7.078793048858643, "rewards/rejected": -6.36257791519165, "step": 634, "train_speed(iter/s)": 0.005341 }, { "epoch": 1.646543330087634, "grad_norm": 1.081635594367981, "learning_rate": 1.636385787746416e-05, "logits/chosen": -1.3343584537506104, "logits/rejected": -1.3506702184677124, "logps/chosen": -4.287896633148193, "logps/rejected": -82.9725112915039, "loss": 0.17199589312076569, "memory(GiB)": 46.82, "nll_loss": 0.14536339044570923, "rewards/accuracies": 1.0, "rewards/chosen": 0.6349250078201294, "rewards/margins": 7.4133148193359375, "rewards/rejected": -6.778390407562256, "step": 635, "train_speed(iter/s)": 0.005341 }, { "epoch": 1.6491398896462188, "grad_norm": 5.774163722991943, "learning_rate": 1.6129042294311226e-05, "logits/chosen": -1.343154788017273, "logits/rejected": -1.3550117015838623, "logps/chosen": -4.13479471206665, "logps/rejected": -68.96117401123047, "loss": 0.5674282908439636, "memory(GiB)": 46.82, "nll_loss": 0.40918517112731934, "rewards/accuracies": 0.96875, "rewards/chosen": 0.3416549861431122, "rewards/margins": 6.578398704528809, "rewards/rejected": -6.236744403839111, "step": 636, "train_speed(iter/s)": 0.005341 }, { "epoch": 1.6517364492048037, "grad_norm": 0.8650281429290771, "learning_rate": 1.5895775798571522e-05, "logits/chosen": -1.3902291059494019, "logits/rejected": -1.3937687873840332, "logps/chosen": -5.421413421630859, "logps/rejected": -78.23155212402344, "loss": 0.1860850304365158, "memory(GiB)": 46.82, "nll_loss": 0.1803363710641861, "rewards/accuracies": 1.0, "rewards/chosen": 0.4473956525325775, "rewards/margins": 7.034005641937256, "rewards/rejected": -6.586610317230225, "step": 637, "train_speed(iter/s)": 0.005341 }, { "epoch": 1.6543330087633885, "grad_norm": 0.75139319896698, "learning_rate": 1.5664062698651705e-05, "logits/chosen": -1.3419991731643677, "logits/rejected": -1.3535465002059937, "logps/chosen": -3.7635464668273926, "logps/rejected": -94.62512969970703, "loss": 0.1265435814857483, "memory(GiB)": 46.82, "nll_loss": 0.12444484233856201, "rewards/accuracies": 1.0, "rewards/chosen": 0.40557020902633667, "rewards/margins": 8.491599082946777, "rewards/rejected": -8.086028099060059, "step": 638, "train_speed(iter/s)": 0.005341 }, { "epoch": 1.6569295683219734, "grad_norm": 1.0433430671691895, "learning_rate": 1.5433907274267355e-05, "logits/chosen": -1.328079104423523, "logits/rejected": -1.3367297649383545, "logps/chosen": -5.806182861328125, "logps/rejected": -84.19864654541016, "loss": 0.2376406192779541, "memory(GiB)": 46.82, "nll_loss": 0.235676571726799, "rewards/accuracies": 1.0, "rewards/chosen": 0.45906656980514526, "rewards/margins": 7.460108757019043, "rewards/rejected": -7.001041889190674, "step": 639, "train_speed(iter/s)": 0.005341 }, { "epoch": 1.6595261278805582, "grad_norm": 0.6470867991447449, "learning_rate": 1.5205313776364027e-05, "logits/chosen": -1.3525469303131104, "logits/rejected": -1.3603522777557373, "logps/chosen": -3.8683226108551025, "logps/rejected": -82.79778289794922, "loss": 0.15905708074569702, "memory(GiB)": 46.82, "nll_loss": 0.15342724323272705, "rewards/accuracies": 1.0, "rewards/chosen": 0.5418492555618286, "rewards/margins": 7.654129505157471, "rewards/rejected": -7.11228084564209, "step": 640, "train_speed(iter/s)": 0.005341 }, { "epoch": 1.662122687439143, "grad_norm": 0.8814226388931274, "learning_rate": 1.4978286427038601e-05, "logits/chosen": -1.2953623533248901, "logits/rejected": -1.3175257444381714, "logps/chosen": -3.588663101196289, "logps/rejected": -83.4087905883789, "loss": 0.17859791219234467, "memory(GiB)": 46.82, "nll_loss": 0.14969876408576965, "rewards/accuracies": 1.0, "rewards/chosen": 0.3954733610153198, "rewards/margins": 7.318519115447998, "rewards/rejected": -6.923046112060547, "step": 641, "train_speed(iter/s)": 0.005341 }, { "epoch": 1.6647192469977279, "grad_norm": 0.9600425362586975, "learning_rate": 1.4752829419461356e-05, "logits/chosen": -1.3675446510314941, "logits/rejected": -1.3715183734893799, "logps/chosen": -5.777808666229248, "logps/rejected": -72.55799102783203, "loss": 0.21355006098747253, "memory(GiB)": 46.82, "nll_loss": 0.20122846961021423, "rewards/accuracies": 1.0, "rewards/chosen": 0.6262421607971191, "rewards/margins": 6.9362077713012695, "rewards/rejected": -6.309965133666992, "step": 642, "train_speed(iter/s)": 0.005341 }, { "epoch": 1.6673158065563127, "grad_norm": 0.7960318326950073, "learning_rate": 1.4528946917798603e-05, "logits/chosen": -1.3032656908035278, "logits/rejected": -1.308361291885376, "logps/chosen": -4.921981334686279, "logps/rejected": -72.86154174804688, "loss": 0.18860392272472382, "memory(GiB)": 46.82, "nll_loss": 0.1692950427532196, "rewards/accuracies": 1.0, "rewards/chosen": 0.5242667198181152, "rewards/margins": 6.5315327644348145, "rewards/rejected": -6.007266044616699, "step": 643, "train_speed(iter/s)": 0.005341 }, { "epoch": 1.6699123661148978, "grad_norm": 0.7154169678688049, "learning_rate": 1.4306643057135637e-05, "logits/chosen": -1.3495804071426392, "logits/rejected": -1.3487272262573242, "logps/chosen": -4.284914016723633, "logps/rejected": -82.88322448730469, "loss": 0.1530197262763977, "memory(GiB)": 46.82, "nll_loss": 0.13098730146884918, "rewards/accuracies": 1.0, "rewards/chosen": 0.6068970561027527, "rewards/margins": 7.615091323852539, "rewards/rejected": -7.008193492889404, "step": 644, "train_speed(iter/s)": 0.005341 }, { "epoch": 1.6725089256734826, "grad_norm": 0.9531897306442261, "learning_rate": 1.4085921943400415e-05, "logits/chosen": -1.3348288536071777, "logits/rejected": -1.3515242338180542, "logps/chosen": -5.095047950744629, "logps/rejected": -75.7342758178711, "loss": 0.24714748561382294, "memory(GiB)": 46.82, "nll_loss": 0.21035797894001007, "rewards/accuracies": 1.0, "rewards/chosen": 0.38048332929611206, "rewards/margins": 6.424774169921875, "rewards/rejected": -6.044290542602539, "step": 645, "train_speed(iter/s)": 0.005341 }, { "epoch": 1.6751054852320675, "grad_norm": 16.722322463989258, "learning_rate": 1.3866787653287805e-05, "logits/chosen": -1.3415000438690186, "logits/rejected": -1.359058141708374, "logps/chosen": -3.7091660499572754, "logps/rejected": -87.80061340332031, "loss": 0.1800370067358017, "memory(GiB)": 46.82, "nll_loss": 0.14961153268814087, "rewards/accuracies": 0.96875, "rewards/chosen": 0.5320316553115845, "rewards/margins": 7.5755228996276855, "rewards/rejected": -7.043491363525391, "step": 646, "train_speed(iter/s)": 0.005341 }, { "epoch": 1.6777020447906525, "grad_norm": 0.6856510043144226, "learning_rate": 1.3649244234184156e-05, "logits/chosen": -1.3474607467651367, "logits/rejected": -1.353614091873169, "logps/chosen": -3.7221789360046387, "logps/rejected": -81.68478393554688, "loss": 0.1335882842540741, "memory(GiB)": 46.82, "nll_loss": 0.13118202984333038, "rewards/accuracies": 1.0, "rewards/chosen": 0.6159143447875977, "rewards/margins": 7.432640075683594, "rewards/rejected": -6.816725730895996, "step": 647, "train_speed(iter/s)": 0.005341 }, { "epoch": 1.6802986043492374, "grad_norm": 0.6763714551925659, "learning_rate": 1.3433295704092585e-05, "logits/chosen": -1.3173692226409912, "logits/rejected": -1.3308582305908203, "logps/chosen": -4.244126796722412, "logps/rejected": -91.7069320678711, "loss": 0.15246841311454773, "memory(GiB)": 46.82, "nll_loss": 0.14819884300231934, "rewards/accuracies": 1.0, "rewards/chosen": 0.5995199084281921, "rewards/margins": 8.185004234313965, "rewards/rejected": -7.585484027862549, "step": 648, "train_speed(iter/s)": 0.005341 }, { "epoch": 1.6828951639078222, "grad_norm": 0.7699263691902161, "learning_rate": 1.3218946051558867e-05, "logits/chosen": -1.355929970741272, "logits/rejected": -1.3632704019546509, "logps/chosen": -3.4825494289398193, "logps/rejected": -76.4013442993164, "loss": 0.15149284899234772, "memory(GiB)": 46.82, "nll_loss": 0.12583358585834503, "rewards/accuracies": 1.0, "rewards/chosen": 0.6053353548049927, "rewards/margins": 7.040757179260254, "rewards/rejected": -6.435421943664551, "step": 649, "train_speed(iter/s)": 0.005341 }, { "epoch": 1.685491723466407, "grad_norm": 1.0006968975067139, "learning_rate": 1.3006199235597627e-05, "logits/chosen": -1.3747293949127197, "logits/rejected": -1.378046989440918, "logps/chosen": -4.248571395874023, "logps/rejected": -78.72927856445312, "loss": 0.21873235702514648, "memory(GiB)": 46.82, "nll_loss": 0.1984972208738327, "rewards/accuracies": 1.0, "rewards/chosen": 0.36940085887908936, "rewards/margins": 7.074660778045654, "rewards/rejected": -6.705259799957275, "step": 650, "train_speed(iter/s)": 0.005341 } ], "logging_steps": 1, "max_steps": 770, "num_input_tokens_seen": 0, "num_train_epochs": 2, "save_steps": 50, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": false }, "attributes": {} } }, "total_flos": 4.628166896246587e+18, "train_batch_size": 1, "trial_name": null, "trial_params": null }