{ "best_global_step": null, "best_metric": null, "best_model_checkpoint": null, "epoch": 0.12982797792924375, "eval_steps": 300, "global_step": 50, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "epoch": 0.002596559558584875, "grad_norm": 4.769598007202148, "learning_rate": 5.128205128205128e-06, "logits/chosen": -0.5944205522537231, "logits/rejected": -0.5917393565177917, "logps/chosen": -11.821638107299805, "logps/rejected": -10.731678009033203, "loss": 1.193467140197754, "memory(GiB)": 46.82, "nll_loss": 0.50031977891922, "rewards/accuracies": 0.0, "rewards/chosen": 0.0, "rewards/margins": 0.0, "rewards/rejected": 0.0, "step": 1, "train_speed(iter/s)": 0.004987 }, { "epoch": 0.00519311911716975, "grad_norm": 7.638933181762695, "learning_rate": 1.0256410256410256e-05, "logits/chosen": -0.6539207696914673, "logits/rejected": -0.6607442498207092, "logps/chosen": -9.628549575805664, "logps/rejected": -15.572840690612793, "loss": 1.1913397312164307, "memory(GiB)": 46.82, "nll_loss": 0.4981924891471863, "rewards/accuracies": 0.0, "rewards/chosen": 0.0, "rewards/margins": 0.0, "rewards/rejected": 0.0, "step": 2, "train_speed(iter/s)": 0.005274 }, { "epoch": 0.007789678675754625, "grad_norm": 8.172294616699219, "learning_rate": 1.5384615384615387e-05, "logits/chosen": -0.6215255260467529, "logits/rejected": -0.6243188381195068, "logps/chosen": -10.225044250488281, "logps/rejected": -12.433060646057129, "loss": 1.3010810613632202, "memory(GiB)": 46.82, "nll_loss": 0.6032217741012573, "rewards/accuracies": 0.40625, "rewards/chosen": -0.002520320238545537, "rewards/margins": -0.00917358510196209, "rewards/rejected": 0.006653264630585909, "step": 3, "train_speed(iter/s)": 0.005242 }, { "epoch": 0.0103862382343395, "grad_norm": 7.314579010009766, "learning_rate": 2.0512820512820512e-05, "logits/chosen": -0.6062605381011963, "logits/rejected": -0.6072395443916321, "logps/chosen": -9.956047058105469, "logps/rejected": -11.640246391296387, "loss": 1.2542610168457031, "memory(GiB)": 46.82, "nll_loss": 0.5589770674705505, "rewards/accuracies": 0.46875, "rewards/chosen": 0.007420660927891731, "rewards/margins": -0.004003261215984821, "rewards/rejected": 0.011423922143876553, "step": 4, "train_speed(iter/s)": 0.005268 }, { "epoch": 0.012982797792924375, "grad_norm": 3.7953975200653076, "learning_rate": 2.564102564102564e-05, "logits/chosen": -0.5976298451423645, "logits/rejected": -0.5966740846633911, "logps/chosen": -13.070164680480957, "logps/rejected": -9.661067008972168, "loss": 1.215171456336975, "memory(GiB)": 46.82, "nll_loss": 0.5106430649757385, "rewards/accuracies": 0.375, "rewards/chosen": 0.00016488437540829182, "rewards/margins": -0.020555444061756134, "rewards/rejected": 0.02072032354772091, "step": 5, "train_speed(iter/s)": 0.00529 }, { "epoch": 0.01557935735150925, "grad_norm": 7.202587604522705, "learning_rate": 3.0769230769230774e-05, "logits/chosen": -0.6029255390167236, "logits/rejected": -0.6082680225372314, "logps/chosen": -6.68419075012207, "logps/rejected": -14.836040496826172, "loss": 1.1022435426712036, "memory(GiB)": 46.82, "nll_loss": 0.4213921129703522, "rewards/accuracies": 0.59375, "rewards/chosen": 0.05949082225561142, "rewards/margins": 0.03669985011219978, "rewards/rejected": 0.02279096469283104, "step": 6, "train_speed(iter/s)": 0.00532 }, { "epoch": 0.018175916910094125, "grad_norm": 4.17504358291626, "learning_rate": 3.58974358974359e-05, "logits/chosen": -0.5737150311470032, "logits/rejected": -0.5751169919967651, "logps/chosen": -10.05550479888916, "logps/rejected": -10.229061126708984, "loss": 1.1968086957931519, "memory(GiB)": 46.82, "nll_loss": 0.451814740896225, "rewards/accuracies": 0.40625, "rewards/chosen": 0.018731240183115005, "rewards/margins": -0.06073049083352089, "rewards/rejected": 0.0794617310166359, "step": 7, "train_speed(iter/s)": 0.005319 }, { "epoch": 0.020772476468679, "grad_norm": 4.966729164123535, "learning_rate": 4.1025641025641023e-05, "logits/chosen": -0.6149957180023193, "logits/rejected": -0.619285523891449, "logps/chosen": -10.129886627197266, "logps/rejected": -14.14559268951416, "loss": 1.1496262550354004, "memory(GiB)": 46.82, "nll_loss": 0.45597678422927856, "rewards/accuracies": 0.5, "rewards/chosen": -0.048677604645490646, "rewards/margins": 0.07307372987270355, "rewards/rejected": -0.1217513307929039, "step": 8, "train_speed(iter/s)": 0.005322 }, { "epoch": 0.023369036027263874, "grad_norm": 4.258759021759033, "learning_rate": 4.615384615384616e-05, "logits/chosen": -0.6464206576347351, "logits/rejected": -0.649814248085022, "logps/chosen": -6.2765960693359375, "logps/rejected": -14.259992599487305, "loss": 0.9683928489685059, "memory(GiB)": 46.82, "nll_loss": 0.27603328227996826, "rewards/accuracies": 0.59375, "rewards/chosen": -0.028385277837514877, "rewards/margins": 0.1275366246700287, "rewards/rejected": -0.15592190623283386, "step": 9, "train_speed(iter/s)": 0.005346 }, { "epoch": 0.02596559558584875, "grad_norm": 3.5765655040740967, "learning_rate": 5.128205128205128e-05, "logits/chosen": -0.5905835628509521, "logits/rejected": -0.5969584584236145, "logps/chosen": -14.795049667358398, "logps/rejected": -15.656811714172363, "loss": 1.238275408744812, "memory(GiB)": 46.82, "nll_loss": 0.5923190116882324, "rewards/accuracies": 0.5625, "rewards/chosen": -0.012541369535028934, "rewards/margins": 0.1883796602487564, "rewards/rejected": -0.20092105865478516, "step": 10, "train_speed(iter/s)": 0.005347 }, { "epoch": 0.028562155144433627, "grad_norm": 5.3241682052612305, "learning_rate": 5.6410256410256414e-05, "logits/chosen": -0.5469571948051453, "logits/rejected": -0.5478999614715576, "logps/chosen": -11.43381118774414, "logps/rejected": -13.521588325500488, "loss": 1.2181414365768433, "memory(GiB)": 46.82, "nll_loss": 0.4799095690250397, "rewards/accuracies": 0.5, "rewards/chosen": -0.11080781370401382, "rewards/margins": -0.000970199704170227, "rewards/rejected": -0.109837606549263, "step": 11, "train_speed(iter/s)": 0.005357 }, { "epoch": 0.0311587147030185, "grad_norm": 3.739349126815796, "learning_rate": 6.153846153846155e-05, "logits/chosen": -0.5663439631462097, "logits/rejected": -0.5685043931007385, "logps/chosen": -9.113786697387695, "logps/rejected": -12.898387908935547, "loss": 1.1865863800048828, "memory(GiB)": 46.82, "nll_loss": 0.5080631971359253, "rewards/accuracies": 0.59375, "rewards/chosen": 0.07351399958133698, "rewards/margins": 0.09553620219230652, "rewards/rejected": -0.022022202610969543, "step": 12, "train_speed(iter/s)": 0.00536 }, { "epoch": 0.03375527426160337, "grad_norm": 2.732536792755127, "learning_rate": 6.666666666666667e-05, "logits/chosen": -0.6258959770202637, "logits/rejected": -0.628243088722229, "logps/chosen": -11.908061027526855, "logps/rejected": -14.742002487182617, "loss": 1.0720946788787842, "memory(GiB)": 46.82, "nll_loss": 0.44474831223487854, "rewards/accuracies": 0.65625, "rewards/chosen": 0.0872192531824112, "rewards/margins": 0.16859112679958344, "rewards/rejected": -0.08137187361717224, "step": 13, "train_speed(iter/s)": 0.005365 }, { "epoch": 0.03635183382018825, "grad_norm": 2.286402702331543, "learning_rate": 7.17948717948718e-05, "logits/chosen": -0.5518996119499207, "logits/rejected": -0.5536460280418396, "logps/chosen": -7.985256195068359, "logps/rejected": -9.997514724731445, "loss": 1.0465917587280273, "memory(GiB)": 46.82, "nll_loss": 0.37517642974853516, "rewards/accuracies": 0.5625, "rewards/chosen": 0.09782104939222336, "rewards/margins": 0.08964069932699203, "rewards/rejected": 0.008180351927876472, "step": 14, "train_speed(iter/s)": 0.005362 }, { "epoch": 0.03894839337877313, "grad_norm": 2.8793153762817383, "learning_rate": 7.692307692307693e-05, "logits/chosen": -0.5976672172546387, "logits/rejected": -0.5990516543388367, "logps/chosen": -11.681562423706055, "logps/rejected": -15.269111633300781, "loss": 1.0413833856582642, "memory(GiB)": 46.82, "nll_loss": 0.44159939885139465, "rewards/accuracies": 0.6875, "rewards/chosen": 0.18112002313137054, "rewards/margins": 0.246211975812912, "rewards/rejected": -0.06509192287921906, "step": 15, "train_speed(iter/s)": 0.005369 }, { "epoch": 0.041544952937358, "grad_norm": 3.362415313720703, "learning_rate": 8.205128205128205e-05, "logits/chosen": -0.6091838479042053, "logits/rejected": -0.6097983717918396, "logps/chosen": -6.9782915115356445, "logps/rejected": -9.985608100891113, "loss": 1.0336495637893677, "memory(GiB)": 46.82, "nll_loss": 0.3420756161212921, "rewards/accuracies": 0.5, "rewards/chosen": 0.05590391904115677, "rewards/margins": 0.03598181903362274, "rewards/rejected": 0.019922103732824326, "step": 16, "train_speed(iter/s)": 0.005368 }, { "epoch": 0.04414151249594288, "grad_norm": 2.314833641052246, "learning_rate": 8.717948717948718e-05, "logits/chosen": -0.6001038551330566, "logits/rejected": -0.6009984612464905, "logps/chosen": -8.711943626403809, "logps/rejected": -8.347241401672363, "loss": 1.0018643140792847, "memory(GiB)": 46.82, "nll_loss": 0.3586280345916748, "rewards/accuracies": 0.53125, "rewards/chosen": 0.17141370475292206, "rewards/margins": 0.15122823417186737, "rewards/rejected": 0.020185478031635284, "step": 17, "train_speed(iter/s)": 0.005365 }, { "epoch": 0.04673807205452775, "grad_norm": 2.6080470085144043, "learning_rate": 9.230769230769232e-05, "logits/chosen": -0.6079075932502747, "logits/rejected": -0.6091002225875854, "logps/chosen": -9.866250991821289, "logps/rejected": -9.885502815246582, "loss": 1.0599387884140015, "memory(GiB)": 46.82, "nll_loss": 0.3953135013580322, "rewards/accuracies": 0.625, "rewards/chosen": 0.1653863787651062, "rewards/margins": 0.13114988803863525, "rewards/rejected": 0.03423647955060005, "step": 18, "train_speed(iter/s)": 0.005363 }, { "epoch": 0.04933463161311263, "grad_norm": 2.5750620365142822, "learning_rate": 9.743589743589744e-05, "logits/chosen": -0.5754107236862183, "logits/rejected": -0.5755229592323303, "logps/chosen": -9.663117408752441, "logps/rejected": -14.233282089233398, "loss": 0.9537867307662964, "memory(GiB)": 46.82, "nll_loss": 0.35284289717674255, "rewards/accuracies": 0.6875, "rewards/chosen": 0.12623246014118195, "rewards/margins": 0.24378177523612976, "rewards/rejected": -0.11754930019378662, "step": 19, "train_speed(iter/s)": 0.00537 }, { "epoch": 0.0519311911716975, "grad_norm": 4.289522171020508, "learning_rate": 0.00010256410256410256, "logits/chosen": -0.5981144905090332, "logits/rejected": -0.6002673506736755, "logps/chosen": -8.273541450500488, "logps/rejected": -12.811166763305664, "loss": 1.422603964805603, "memory(GiB)": 46.82, "nll_loss": 0.8183298707008362, "rewards/accuracies": 0.65625, "rewards/chosen": 0.21172407269477844, "rewards/margins": 0.2575765550136566, "rewards/rejected": -0.04585248976945877, "step": 20, "train_speed(iter/s)": 0.005365 }, { "epoch": 0.054527750730282376, "grad_norm": 2.396873712539673, "learning_rate": 0.0001076923076923077, "logits/chosen": -0.5655781030654907, "logits/rejected": -0.5672769546508789, "logps/chosen": -7.642134189605713, "logps/rejected": -16.37198257446289, "loss": 0.8944156765937805, "memory(GiB)": 46.82, "nll_loss": 0.28976452350616455, "rewards/accuracies": 0.6875, "rewards/chosen": 0.2191261202096939, "rewards/margins": 0.2641218602657318, "rewards/rejected": -0.04499572888016701, "step": 21, "train_speed(iter/s)": 0.005364 }, { "epoch": 0.057124310288867254, "grad_norm": 3.0281121730804443, "learning_rate": 0.00011282051282051283, "logits/chosen": -0.5596702694892883, "logits/rejected": -0.5609368681907654, "logps/chosen": -7.446313381195068, "logps/rejected": -12.651912689208984, "loss": 0.9526722431182861, "memory(GiB)": 46.82, "nll_loss": 0.33721715211868286, "rewards/accuracies": 0.75, "rewards/chosen": 0.15709233283996582, "rewards/margins": 0.2245473712682724, "rewards/rejected": -0.06745504587888718, "step": 22, "train_speed(iter/s)": 0.005362 }, { "epoch": 0.059720869847452125, "grad_norm": 2.6955020427703857, "learning_rate": 0.00011794871794871796, "logits/chosen": -0.5400959849357605, "logits/rejected": -0.5422949194908142, "logps/chosen": -6.002541542053223, "logps/rejected": -12.28770637512207, "loss": 0.9044801592826843, "memory(GiB)": 46.82, "nll_loss": 0.2814594805240631, "rewards/accuracies": 0.6875, "rewards/chosen": 0.11246027797460556, "rewards/margins": 0.21622154116630554, "rewards/rejected": -0.10376127809286118, "step": 23, "train_speed(iter/s)": 0.005363 }, { "epoch": 0.062317429406037, "grad_norm": 3.1954290866851807, "learning_rate": 0.0001230769230769231, "logits/chosen": -0.5763551592826843, "logits/rejected": -0.5829795598983765, "logps/chosen": -8.22636890411377, "logps/rejected": -12.94092845916748, "loss": 0.9596253037452698, "memory(GiB)": 46.82, "nll_loss": 0.3679075837135315, "rewards/accuracies": 0.75, "rewards/chosen": 0.17844173312187195, "rewards/margins": 0.2646990418434143, "rewards/rejected": -0.08625732362270355, "step": 24, "train_speed(iter/s)": 0.005367 }, { "epoch": 0.06491398896462187, "grad_norm": 3.440917730331421, "learning_rate": 0.00012820512820512823, "logits/chosen": -0.5423401594161987, "logits/rejected": -0.5454680919647217, "logps/chosen": -6.751742362976074, "logps/rejected": -14.677633285522461, "loss": 0.8222842216491699, "memory(GiB)": 46.82, "nll_loss": 0.2530384063720703, "rewards/accuracies": 0.6875, "rewards/chosen": 0.20278047025203705, "rewards/margins": 0.37300848960876465, "rewards/rejected": -0.1702280342578888, "step": 25, "train_speed(iter/s)": 0.005363 }, { "epoch": 0.06751054852320675, "grad_norm": 7.046718120574951, "learning_rate": 0.00013333333333333334, "logits/chosen": -0.531994640827179, "logits/rejected": -0.5324733257293701, "logps/chosen": -7.691443920135498, "logps/rejected": -12.912195205688477, "loss": 0.8851491212844849, "memory(GiB)": 46.82, "nll_loss": 0.2668984532356262, "rewards/accuracies": 0.65625, "rewards/chosen": 0.03996456041932106, "rewards/margins": 0.30043962597846985, "rewards/rejected": -0.2604750692844391, "step": 26, "train_speed(iter/s)": 0.005354 }, { "epoch": 0.07010710808179163, "grad_norm": 3.7837774753570557, "learning_rate": 0.00013846153846153847, "logits/chosen": -0.5356835722923279, "logits/rejected": -0.535167932510376, "logps/chosen": -7.836236476898193, "logps/rejected": -12.5257568359375, "loss": 0.9785585999488831, "memory(GiB)": 46.82, "nll_loss": 0.39958691596984863, "rewards/accuracies": 0.625, "rewards/chosen": 0.11726226657629013, "rewards/margins": 0.30467987060546875, "rewards/rejected": -0.18741759657859802, "step": 27, "train_speed(iter/s)": 0.005353 }, { "epoch": 0.0727036676403765, "grad_norm": 2.986128568649292, "learning_rate": 0.0001435897435897436, "logits/chosen": -0.5374022126197815, "logits/rejected": -0.5330510139465332, "logps/chosen": -10.774028778076172, "logps/rejected": -10.21718692779541, "loss": 1.0210673809051514, "memory(GiB)": 46.82, "nll_loss": 0.44256913661956787, "rewards/accuracies": 0.78125, "rewards/chosen": 0.08123424649238586, "rewards/margins": 0.32150229811668396, "rewards/rejected": -0.2402680516242981, "step": 28, "train_speed(iter/s)": 0.00536 }, { "epoch": 0.07530022719896137, "grad_norm": 8.227151870727539, "learning_rate": 0.00014871794871794872, "logits/chosen": -0.555951714515686, "logits/rejected": -0.5587239265441895, "logps/chosen": -7.656264781951904, "logps/rejected": -16.2135066986084, "loss": 1.024498701095581, "memory(GiB)": 46.82, "nll_loss": 0.467337429523468, "rewards/accuracies": 0.71875, "rewards/chosen": 0.1679726243019104, "rewards/margins": 0.43920189142227173, "rewards/rejected": -0.2712292969226837, "step": 29, "train_speed(iter/s)": 0.005367 }, { "epoch": 0.07789678675754626, "grad_norm": 3.866678476333618, "learning_rate": 0.00015384615384615385, "logits/chosen": -0.5329037308692932, "logits/rejected": -0.5308660864830017, "logps/chosen": -13.327455520629883, "logps/rejected": -12.309192657470703, "loss": 1.1753352880477905, "memory(GiB)": 46.82, "nll_loss": 0.5743139386177063, "rewards/accuracies": 0.65625, "rewards/chosen": 0.10232796519994736, "rewards/margins": 0.27346518635749817, "rewards/rejected": -0.1711372286081314, "step": 30, "train_speed(iter/s)": 0.00537 }, { "epoch": 0.08049334631613113, "grad_norm": 2.7835240364074707, "learning_rate": 0.00015897435897435896, "logits/chosen": -0.5286478996276855, "logits/rejected": -0.5297562479972839, "logps/chosen": -8.105016708374023, "logps/rejected": -18.577655792236328, "loss": 0.8083048462867737, "memory(GiB)": 46.82, "nll_loss": 0.3598409593105316, "rewards/accuracies": 0.875, "rewards/chosen": 0.3429361879825592, "rewards/margins": 0.6762320399284363, "rewards/rejected": -0.3332958221435547, "step": 31, "train_speed(iter/s)": 0.005368 }, { "epoch": 0.083089905874716, "grad_norm": 2.621320962905884, "learning_rate": 0.0001641025641025641, "logits/chosen": -0.5535257458686829, "logits/rejected": -0.5577558279037476, "logps/chosen": -7.381773948669434, "logps/rejected": -20.8293514251709, "loss": 0.7857053279876709, "memory(GiB)": 46.82, "nll_loss": 0.3121376037597656, "rewards/accuracies": 0.84375, "rewards/chosen": 0.11771110445261002, "rewards/margins": 0.6395547389984131, "rewards/rejected": -0.5218436121940613, "step": 32, "train_speed(iter/s)": 0.005373 }, { "epoch": 0.08568646543330087, "grad_norm": 5.273679256439209, "learning_rate": 0.00016923076923076923, "logits/chosen": -0.5348193645477295, "logits/rejected": -0.5335426330566406, "logps/chosen": -16.012008666992188, "logps/rejected": -16.090946197509766, "loss": 1.150058388710022, "memory(GiB)": 46.82, "nll_loss": 0.5311561822891235, "rewards/accuracies": 0.6875, "rewards/chosen": -0.09080329537391663, "rewards/margins": 0.3698381185531616, "rewards/rejected": -0.46064135432243347, "step": 33, "train_speed(iter/s)": 0.005375 }, { "epoch": 0.08828302499188576, "grad_norm": 3.7380588054656982, "learning_rate": 0.00017435897435897436, "logits/chosen": -0.526316225528717, "logits/rejected": -0.5241590738296509, "logps/chosen": -13.188718795776367, "logps/rejected": -18.877933502197266, "loss": 0.8901183009147644, "memory(GiB)": 46.82, "nll_loss": 0.4010193347930908, "rewards/accuracies": 0.78125, "rewards/chosen": 0.13551224768161774, "rewards/margins": 0.7849555015563965, "rewards/rejected": -0.6494433283805847, "step": 34, "train_speed(iter/s)": 0.005376 }, { "epoch": 0.09087958455047063, "grad_norm": 3.2903590202331543, "learning_rate": 0.0001794871794871795, "logits/chosen": -0.5694751739501953, "logits/rejected": -0.5714199542999268, "logps/chosen": -13.836735725402832, "logps/rejected": -17.397571563720703, "loss": 0.9489783644676208, "memory(GiB)": 46.82, "nll_loss": 0.4817684292793274, "rewards/accuracies": 0.84375, "rewards/chosen": 0.17933052778244019, "rewards/margins": 0.7199034690856934, "rewards/rejected": -0.5405729413032532, "step": 35, "train_speed(iter/s)": 0.005374 }, { "epoch": 0.0934761441090555, "grad_norm": 7.443658351898193, "learning_rate": 0.00018461538461538463, "logits/chosen": -0.5579850077629089, "logits/rejected": -0.5598161220550537, "logps/chosen": -9.724953651428223, "logps/rejected": -19.001192092895508, "loss": 1.025741696357727, "memory(GiB)": 46.82, "nll_loss": 0.4933169484138489, "rewards/accuracies": 0.8125, "rewards/chosen": 0.09439410269260406, "rewards/margins": 0.531223714351654, "rewards/rejected": -0.4368295967578888, "step": 36, "train_speed(iter/s)": 0.005367 }, { "epoch": 0.09607270366764038, "grad_norm": 4.221776962280273, "learning_rate": 0.00018974358974358974, "logits/chosen": -0.5673465728759766, "logits/rejected": -0.568681001663208, "logps/chosen": -7.996758937835693, "logps/rejected": -16.828737258911133, "loss": 0.768932044506073, "memory(GiB)": 46.82, "nll_loss": 0.3632465600967407, "rewards/accuracies": 0.90625, "rewards/chosen": 0.20153376460075378, "rewards/margins": 0.8081123232841492, "rewards/rejected": -0.6065785884857178, "step": 37, "train_speed(iter/s)": 0.00536 }, { "epoch": 0.09866926322622525, "grad_norm": 4.438755989074707, "learning_rate": 0.00019487179487179487, "logits/chosen": -0.5432108640670776, "logits/rejected": -0.5440645217895508, "logps/chosen": -11.19113826751709, "logps/rejected": -16.801233291625977, "loss": 0.9643179178237915, "memory(GiB)": 46.82, "nll_loss": 0.5330875515937805, "rewards/accuracies": 0.875, "rewards/chosen": 0.212477445602417, "rewards/margins": 0.7622401714324951, "rewards/rejected": -0.5497627258300781, "step": 38, "train_speed(iter/s)": 0.005362 }, { "epoch": 0.10126582278481013, "grad_norm": 3.844766855239868, "learning_rate": 0.0002, "logits/chosen": -0.5104550719261169, "logits/rejected": -0.5119606852531433, "logps/chosen": -11.040297508239746, "logps/rejected": -18.91219711303711, "loss": 0.9704711437225342, "memory(GiB)": 46.82, "nll_loss": 0.5230136513710022, "rewards/accuracies": 0.84375, "rewards/chosen": 0.14157143235206604, "rewards/margins": 0.7000695466995239, "rewards/rejected": -0.5584981441497803, "step": 39, "train_speed(iter/s)": 0.005358 }, { "epoch": 0.103862382343395, "grad_norm": 5.2911272048950195, "learning_rate": 0.00019999907650547008, "logits/chosen": -0.563255250453949, "logits/rejected": -0.5627263784408569, "logps/chosen": -8.962218284606934, "logps/rejected": -20.214658737182617, "loss": 0.9730861783027649, "memory(GiB)": 46.82, "nll_loss": 0.4494069516658783, "rewards/accuracies": 0.71875, "rewards/chosen": 0.03735905885696411, "rewards/margins": 0.7039426565170288, "rewards/rejected": -0.6665836572647095, "step": 40, "train_speed(iter/s)": 0.00536 }, { "epoch": 0.10645894190197988, "grad_norm": 3.2932822704315186, "learning_rate": 0.0001999963060389371, "logits/chosen": -0.49407708644866943, "logits/rejected": -0.4951040744781494, "logps/chosen": -4.336781978607178, "logps/rejected": -23.352622985839844, "loss": 0.5769761800765991, "memory(GiB)": 46.82, "nll_loss": 0.21373578906059265, "rewards/accuracies": 0.84375, "rewards/chosen": 0.2602457106113434, "rewards/margins": 1.0540037155151367, "rewards/rejected": -0.7937580347061157, "step": 41, "train_speed(iter/s)": 0.005359 }, { "epoch": 0.10905550146056475, "grad_norm": 3.550082206726074, "learning_rate": 0.00019999168865157137, "logits/chosen": -0.5316025018692017, "logits/rejected": -0.5340486764907837, "logps/chosen": -8.441543579101562, "logps/rejected": -18.124588012695312, "loss": 0.9663518071174622, "memory(GiB)": 46.82, "nll_loss": 0.47912853956222534, "rewards/accuracies": 0.78125, "rewards/chosen": 0.14834752678871155, "rewards/margins": 0.7632903456687927, "rewards/rejected": -0.6149427890777588, "step": 42, "train_speed(iter/s)": 0.005356 }, { "epoch": 0.11165206101914962, "grad_norm": 3.8798763751983643, "learning_rate": 0.0001999852244286554, "logits/chosen": -0.5125827193260193, "logits/rejected": -0.5118388533592224, "logps/chosen": -8.259347915649414, "logps/rejected": -18.246912002563477, "loss": 0.8706857562065125, "memory(GiB)": 46.82, "nll_loss": 0.3688449263572693, "rewards/accuracies": 0.78125, "rewards/chosen": 0.1189112439751625, "rewards/margins": 0.5402826070785522, "rewards/rejected": -0.4213714003562927, "step": 43, "train_speed(iter/s)": 0.005355 }, { "epoch": 0.11424862057773451, "grad_norm": 5.702610015869141, "learning_rate": 0.0001999769134895828, "logits/chosen": -0.5676945447921753, "logits/rejected": -0.5712423324584961, "logps/chosen": -7.507511138916016, "logps/rejected": -17.306344985961914, "loss": 0.9447178840637207, "memory(GiB)": 46.82, "nll_loss": 0.5068771839141846, "rewards/accuracies": 0.84375, "rewards/chosen": 0.1572760045528412, "rewards/margins": 0.8183934688568115, "rewards/rejected": -0.6611174941062927, "step": 44, "train_speed(iter/s)": 0.005357 }, { "epoch": 0.11684518013631938, "grad_norm": 5.846091270446777, "learning_rate": 0.0001999667559878556, "logits/chosen": -0.5530126094818115, "logits/rejected": -0.5544271469116211, "logps/chosen": -9.34422779083252, "logps/rejected": -21.99274444580078, "loss": 1.0033745765686035, "memory(GiB)": 46.82, "nll_loss": 0.5510709285736084, "rewards/accuracies": 0.75, "rewards/chosen": 0.06781984120607376, "rewards/margins": 0.8660807609558105, "rewards/rejected": -0.7982609868049622, "step": 45, "train_speed(iter/s)": 0.005358 }, { "epoch": 0.11944173969490425, "grad_norm": 3.4377248287200928, "learning_rate": 0.00019995475211108185, "logits/chosen": -0.5516988039016724, "logits/rejected": -0.5513719916343689, "logps/chosen": -9.321004867553711, "logps/rejected": -18.94799041748047, "loss": 0.838591992855072, "memory(GiB)": 46.82, "nll_loss": 0.44976377487182617, "rewards/accuracies": 0.875, "rewards/chosen": 0.15304125845432281, "rewards/margins": 0.9354310631752014, "rewards/rejected": -0.782389760017395, "step": 46, "train_speed(iter/s)": 0.00536 }, { "epoch": 0.12203829925348912, "grad_norm": 3.021584987640381, "learning_rate": 0.00019994090208097176, "logits/chosen": -0.5453197956085205, "logits/rejected": -0.5457130670547485, "logps/chosen": -7.513545036315918, "logps/rejected": -19.929990768432617, "loss": 0.7878033518791199, "memory(GiB)": 46.82, "nll_loss": 0.2906043827533722, "rewards/accuracies": 0.71875, "rewards/chosen": 0.04635176807641983, "rewards/margins": 0.8055768609046936, "rewards/rejected": -0.759225070476532, "step": 47, "train_speed(iter/s)": 0.005359 }, { "epoch": 0.124634858812074, "grad_norm": 2.4632484912872314, "learning_rate": 0.00019992520615333393, "logits/chosen": -0.5288453102111816, "logits/rejected": -0.5294773578643799, "logps/chosen": -4.316083908081055, "logps/rejected": -16.75088119506836, "loss": 0.6369743347167969, "memory(GiB)": 46.82, "nll_loss": 0.19174346327781677, "rewards/accuracies": 0.8125, "rewards/chosen": 0.1844159960746765, "rewards/margins": 0.7728991508483887, "rewards/rejected": -0.5884830951690674, "step": 48, "train_speed(iter/s)": 0.005357 }, { "epoch": 0.12723141837065888, "grad_norm": 2.225041627883911, "learning_rate": 0.00019990766461807039, "logits/chosen": -0.5786827802658081, "logits/rejected": -0.5775803923606873, "logps/chosen": -7.1691179275512695, "logps/rejected": -19.747949600219727, "loss": 0.611931562423706, "memory(GiB)": 46.82, "nll_loss": 0.26027703285217285, "rewards/accuracies": 0.9375, "rewards/chosen": 0.32533061504364014, "rewards/margins": 1.0796949863433838, "rewards/rejected": -0.7543643712997437, "step": 49, "train_speed(iter/s)": 0.005358 }, { "epoch": 0.12982797792924375, "grad_norm": 3.631110429763794, "learning_rate": 0.00019988827779917137, "logits/chosen": -0.5347975492477417, "logits/rejected": -0.5404946804046631, "logps/chosen": -8.115504264831543, "logps/rejected": -22.913742065429688, "loss": 0.8714032769203186, "memory(GiB)": 46.82, "nll_loss": 0.4530017375946045, "rewards/accuracies": 0.875, "rewards/chosen": 0.22861376404762268, "rewards/margins": 0.9870915412902832, "rewards/rejected": -0.7584777474403381, "step": 50, "train_speed(iter/s)": 0.00536 } ], "logging_steps": 1, "max_steps": 770, "num_input_tokens_seen": 0, "num_train_epochs": 2, "save_steps": 50, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": false }, "attributes": {} } }, "total_flos": 3.5719756566337946e+17, "train_batch_size": 1, "trial_name": null, "trial_params": null }