{ "best_global_step": 500, "best_metric": 0.49153158, "best_model_checkpoint": "/data2/kdd/crag/cjz/output/task1_dpo_absgt10_noidk__pari0.8_0602/v0-20250602-171544/checkpoint-500", "epoch": 1.7469458987783595, "eval_steps": 500, "global_step": 500, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "epoch": 0.0034904013961605585, "grad_norm": 8.557130813598633, "learning_rate": 4.651162790697674e-06, "logits/chosen": -0.3853919506072998, "logits/rejected": -0.6177393794059753, "logps/chosen": -6.8596577644348145, "logps/rejected": -24.441532135009766, "loss": 1.0831061601638794, "memory(GiB)": 34.14, "nll_loss": 0.38995903730392456, "rewards/accuracies": 0.0, "rewards/chosen": 0.0, "rewards/margins": 0.0, "rewards/rejected": 0.0, "step": 1, "train_speed(iter/s)": 0.01012 }, { "epoch": 0.006980802792321117, "grad_norm": 4.541833400726318, "learning_rate": 9.302325581395349e-06, "logits/chosen": -0.4651119112968445, "logits/rejected": -0.5818633437156677, "logps/chosen": -7.042446136474609, "logps/rejected": -15.569698333740234, "loss": 1.1563867330551147, "memory(GiB)": 34.14, "nll_loss": 0.46323955059051514, "rewards/accuracies": 0.0, "rewards/chosen": 0.0, "rewards/margins": 0.0, "rewards/rejected": 0.0, "step": 2, "train_speed(iter/s)": 0.010413 }, { "epoch": 0.010471204188481676, "grad_norm": 5.130979061126709, "learning_rate": 1.3953488372093024e-05, "logits/chosen": -0.46299099922180176, "logits/rejected": -0.584057629108429, "logps/chosen": -10.678628921508789, "logps/rejected": -13.385712623596191, "loss": 1.3326630592346191, "memory(GiB)": 34.14, "nll_loss": 0.6397495865821838, "rewards/accuracies": 0.53125, "rewards/chosen": 0.005845161620527506, "rewards/margins": 0.0005908504826948047, "rewards/rejected": 0.005254311487078667, "step": 3, "train_speed(iter/s)": 0.010516 }, { "epoch": 0.013961605584642234, "grad_norm": 9.7429780960083, "learning_rate": 1.8604651162790697e-05, "logits/chosen": -0.5326871871948242, "logits/rejected": -0.6262682676315308, "logps/chosen": -6.428069114685059, "logps/rejected": -15.568026542663574, "loss": 1.1956652402877808, "memory(GiB)": 34.14, "nll_loss": 0.5060467720031738, "rewards/accuracies": 0.65625, "rewards/chosen": 0.006483433302491903, "rewards/margins": 0.0072298417799174786, "rewards/rejected": -0.0007464090595021844, "step": 4, "train_speed(iter/s)": 0.010579 }, { "epoch": 0.017452006980802792, "grad_norm": 5.269836902618408, "learning_rate": 2.3255813953488374e-05, "logits/chosen": -0.5215513706207275, "logits/rejected": -0.6214993000030518, "logps/chosen": -6.4991326332092285, "logps/rejected": -16.232433319091797, "loss": 1.144551396369934, "memory(GiB)": 34.14, "nll_loss": 0.46053266525268555, "rewards/accuracies": 0.625, "rewards/chosen": 0.004076660610735416, "rewards/margins": 0.018971633166074753, "rewards/rejected": -0.014894972555339336, "step": 5, "train_speed(iter/s)": 0.010622 }, { "epoch": 0.020942408376963352, "grad_norm": 6.636388301849365, "learning_rate": 2.7906976744186048e-05, "logits/chosen": -0.4555979073047638, "logits/rejected": -0.5607460737228394, "logps/chosen": -9.820672035217285, "logps/rejected": -15.622188568115234, "loss": 1.3625051975250244, "memory(GiB)": 34.14, "nll_loss": 0.6840521693229675, "rewards/accuracies": 0.625, "rewards/chosen": 0.018183868378400803, "rewards/margins": 0.03185040131211281, "rewards/rejected": -0.01366653386503458, "step": 6, "train_speed(iter/s)": 0.01064 }, { "epoch": 0.02443280977312391, "grad_norm": 5.103886127471924, "learning_rate": 3.2558139534883724e-05, "logits/chosen": -0.4968104660511017, "logits/rejected": -0.569257378578186, "logps/chosen": -10.183512687683105, "logps/rejected": -15.70079231262207, "loss": 1.4255497455596924, "memory(GiB)": 34.14, "nll_loss": 0.7536435127258301, "rewards/accuracies": 0.65625, "rewards/chosen": -0.010219119489192963, "rewards/margins": 0.054266996681690216, "rewards/rejected": -0.06448611617088318, "step": 7, "train_speed(iter/s)": 0.010656 }, { "epoch": 0.027923211169284468, "grad_norm": 3.999744176864624, "learning_rate": 3.7209302325581394e-05, "logits/chosen": -0.4695020914077759, "logits/rejected": -0.5785450339317322, "logps/chosen": -8.685606002807617, "logps/rejected": -19.699125289916992, "loss": 1.167594075202942, "memory(GiB)": 34.14, "nll_loss": 0.5315794944763184, "rewards/accuracies": 0.65625, "rewards/chosen": -0.033686134964227676, "rewards/margins": 0.14157818257808685, "rewards/rejected": -0.17526429891586304, "step": 8, "train_speed(iter/s)": 0.010669 }, { "epoch": 0.031413612565445025, "grad_norm": 7.809542179107666, "learning_rate": 4.186046511627907e-05, "logits/chosen": -0.5049821138381958, "logits/rejected": -0.5677512288093567, "logps/chosen": -10.067422866821289, "logps/rejected": -13.192615509033203, "loss": 1.3344353437423706, "memory(GiB)": 34.14, "nll_loss": 0.6376084089279175, "rewards/accuracies": 0.59375, "rewards/chosen": -0.1379907727241516, "rewards/margins": 0.05565176531672478, "rewards/rejected": -0.1936425417661667, "step": 9, "train_speed(iter/s)": 0.010683 }, { "epoch": 0.034904013961605584, "grad_norm": 10.225089073181152, "learning_rate": 4.651162790697675e-05, "logits/chosen": -0.5532017350196838, "logits/rejected": -0.5782958269119263, "logps/chosen": -13.762276649475098, "logps/rejected": -13.101286888122559, "loss": 1.5571683645248413, "memory(GiB)": 34.14, "nll_loss": 0.8523505330085754, "rewards/accuracies": 0.59375, "rewards/chosen": -0.15877792239189148, "rewards/margins": 0.03356418013572693, "rewards/rejected": -0.19234208762645721, "step": 10, "train_speed(iter/s)": 0.010697 }, { "epoch": 0.038394415357766144, "grad_norm": 4.407655239105225, "learning_rate": 5.1162790697674425e-05, "logits/chosen": -0.4217715263366699, "logits/rejected": -0.5799385905265808, "logps/chosen": -6.071174621582031, "logps/rejected": -21.04494857788086, "loss": 0.9959170818328857, "memory(GiB)": 34.14, "nll_loss": 0.4200224280357361, "rewards/accuracies": 0.75, "rewards/chosen": -0.03702637180685997, "rewards/margins": 0.3200541138648987, "rewards/rejected": -0.35708048939704895, "step": 11, "train_speed(iter/s)": 0.010696 }, { "epoch": 0.041884816753926704, "grad_norm": 6.385944366455078, "learning_rate": 5.5813953488372095e-05, "logits/chosen": -0.5289366841316223, "logits/rejected": -0.5345426201820374, "logps/chosen": -11.089645385742188, "logps/rejected": -13.696191787719727, "loss": 1.2887790203094482, "memory(GiB)": 34.14, "nll_loss": 0.5673516392707825, "rewards/accuracies": 0.4375, "rewards/chosen": -0.10325971990823746, "rewards/margins": -0.009972111321985722, "rewards/rejected": -0.09328760206699371, "step": 12, "train_speed(iter/s)": 0.010702 }, { "epoch": 0.04537521815008726, "grad_norm": 4.892186641693115, "learning_rate": 6.0465116279069765e-05, "logits/chosen": -0.48081111907958984, "logits/rejected": -0.5861090421676636, "logps/chosen": -7.97854471206665, "logps/rejected": -18.214845657348633, "loss": 1.23686683177948, "memory(GiB)": 34.14, "nll_loss": 0.5658432841300964, "rewards/accuracies": 0.5, "rewards/chosen": -0.07524491846561432, "rewards/margins": 0.07474859058856964, "rewards/rejected": -0.14999350905418396, "step": 13, "train_speed(iter/s)": 0.010708 }, { "epoch": 0.04886561954624782, "grad_norm": 3.9216458797454834, "learning_rate": 6.511627906976745e-05, "logits/chosen": -0.4399729073047638, "logits/rejected": -0.5742396116256714, "logps/chosen": -3.621753692626953, "logps/rejected": -17.848834991455078, "loss": 0.9254244565963745, "memory(GiB)": 34.14, "nll_loss": 0.26018136739730835, "rewards/accuracies": 0.625, "rewards/chosen": 0.069590725004673, "rewards/margins": 0.08134818077087402, "rewards/rejected": -0.01175746414810419, "step": 14, "train_speed(iter/s)": 0.010711 }, { "epoch": 0.05235602094240838, "grad_norm": 4.189650058746338, "learning_rate": 6.976744186046513e-05, "logits/chosen": -0.4310145378112793, "logits/rejected": -0.5189388990402222, "logps/chosen": -7.985783100128174, "logps/rejected": -17.343812942504883, "loss": 1.1174938678741455, "memory(GiB)": 34.14, "nll_loss": 0.4816132187843323, "rewards/accuracies": 0.6875, "rewards/chosen": 0.09267675131559372, "rewards/margins": 0.1413428634405136, "rewards/rejected": -0.04866611212491989, "step": 15, "train_speed(iter/s)": 0.010712 }, { "epoch": 0.055846422338568937, "grad_norm": 3.32806658744812, "learning_rate": 7.441860465116279e-05, "logits/chosen": -0.43775254487991333, "logits/rejected": -0.5088982582092285, "logps/chosen": -8.117635726928711, "logps/rejected": -19.758106231689453, "loss": 1.1459051370620728, "memory(GiB)": 34.14, "nll_loss": 0.5276587605476379, "rewards/accuracies": 0.75, "rewards/chosen": 0.10978943854570389, "rewards/margins": 0.18414708971977234, "rewards/rejected": -0.07435765117406845, "step": 16, "train_speed(iter/s)": 0.010712 }, { "epoch": 0.059336823734729496, "grad_norm": 2.725511312484741, "learning_rate": 7.906976744186047e-05, "logits/chosen": -0.47936227917671204, "logits/rejected": -0.5878744721412659, "logps/chosen": -9.313335418701172, "logps/rejected": -21.849124908447266, "loss": 1.058612585067749, "memory(GiB)": 34.14, "nll_loss": 0.4116324186325073, "rewards/accuracies": 0.65625, "rewards/chosen": 0.01833728700876236, "rewards/margins": 0.10961442440748215, "rewards/rejected": -0.09127713739871979, "step": 17, "train_speed(iter/s)": 0.010713 }, { "epoch": 0.06282722513089005, "grad_norm": 3.7582316398620605, "learning_rate": 8.372093023255814e-05, "logits/chosen": -0.476583331823349, "logits/rejected": -0.5290005803108215, "logps/chosen": -8.529088020324707, "logps/rejected": -16.1294002532959, "loss": 1.1786390542984009, "memory(GiB)": 34.14, "nll_loss": 0.578920841217041, "rewards/accuracies": 0.71875, "rewards/chosen": -0.02365059219300747, "rewards/margins": 0.23341532051563263, "rewards/rejected": -0.25706592202186584, "step": 18, "train_speed(iter/s)": 0.010716 }, { "epoch": 0.06631762652705062, "grad_norm": 3.4042398929595947, "learning_rate": 8.837209302325582e-05, "logits/chosen": -0.4703082740306854, "logits/rejected": -0.5102555155754089, "logps/chosen": -9.428271293640137, "logps/rejected": -16.359838485717773, "loss": 1.235347867012024, "memory(GiB)": 34.14, "nll_loss": 0.6085215210914612, "rewards/accuracies": 0.5625, "rewards/chosen": 0.01763956993818283, "rewards/margins": 0.1921030879020691, "rewards/rejected": -0.17446354031562805, "step": 19, "train_speed(iter/s)": 0.010716 }, { "epoch": 0.06980802792321117, "grad_norm": 3.1032357215881348, "learning_rate": 9.30232558139535e-05, "logits/chosen": -0.401233434677124, "logits/rejected": -0.494634747505188, "logps/chosen": -9.093883514404297, "logps/rejected": -18.11814308166504, "loss": 1.1991461515426636, "memory(GiB)": 34.14, "nll_loss": 0.5884966850280762, "rewards/accuracies": 0.6875, "rewards/chosen": 0.02572321705520153, "rewards/margins": 0.21222788095474243, "rewards/rejected": -0.18650466203689575, "step": 20, "train_speed(iter/s)": 0.010717 }, { "epoch": 0.07329842931937172, "grad_norm": 3.3876612186431885, "learning_rate": 9.767441860465116e-05, "logits/chosen": -0.46866974234580994, "logits/rejected": -0.530718207359314, "logps/chosen": -7.192732334136963, "logps/rejected": -14.595564842224121, "loss": 1.1225976943969727, "memory(GiB)": 34.14, "nll_loss": 0.5212462544441223, "rewards/accuracies": 0.71875, "rewards/chosen": 0.1131197139620781, "rewards/margins": 0.2251490354537964, "rewards/rejected": -0.1120293140411377, "step": 21, "train_speed(iter/s)": 0.01072 }, { "epoch": 0.07678883071553229, "grad_norm": 2.6822471618652344, "learning_rate": 0.00010232558139534885, "logits/chosen": -0.5048164129257202, "logits/rejected": -0.5435423851013184, "logps/chosen": -7.50157356262207, "logps/rejected": -14.21214485168457, "loss": 1.088458776473999, "memory(GiB)": 34.14, "nll_loss": 0.5341289043426514, "rewards/accuracies": 0.90625, "rewards/chosen": 0.16505159437656403, "rewards/margins": 0.3283952474594116, "rewards/rejected": -0.1633436679840088, "step": 22, "train_speed(iter/s)": 0.010723 }, { "epoch": 0.08027923211169284, "grad_norm": 2.733980417251587, "learning_rate": 0.00010697674418604651, "logits/chosen": -0.40645402669906616, "logits/rejected": -0.5064697861671448, "logps/chosen": -8.52833080291748, "logps/rejected": -21.627185821533203, "loss": 1.119882345199585, "memory(GiB)": 34.14, "nll_loss": 0.6272884607315063, "rewards/accuracies": 0.9375, "rewards/chosen": 0.21130108833312988, "rewards/margins": 0.5197649598121643, "rewards/rejected": -0.3084638714790344, "step": 23, "train_speed(iter/s)": 0.010724 }, { "epoch": 0.08376963350785341, "grad_norm": 3.6145081520080566, "learning_rate": 0.00011162790697674419, "logits/chosen": -0.40803515911102295, "logits/rejected": -0.4656044840812683, "logps/chosen": -7.790849208831787, "logps/rejected": -19.12059783935547, "loss": 1.073976755142212, "memory(GiB)": 34.14, "nll_loss": 0.5007548332214355, "rewards/accuracies": 0.6875, "rewards/chosen": 0.021760545670986176, "rewards/margins": 0.325797438621521, "rewards/rejected": -0.3040368854999542, "step": 24, "train_speed(iter/s)": 0.010727 }, { "epoch": 0.08726003490401396, "grad_norm": 3.5218026638031006, "learning_rate": 0.00011627906976744187, "logits/chosen": -0.38492777943611145, "logits/rejected": -0.4633912742137909, "logps/chosen": -9.945892333984375, "logps/rejected": -22.549875259399414, "loss": 1.099092960357666, "memory(GiB)": 34.14, "nll_loss": 0.6007935404777527, "rewards/accuracies": 0.78125, "rewards/chosen": -0.18332718312740326, "rewards/margins": 0.6362053155899048, "rewards/rejected": -0.8195324540138245, "step": 25, "train_speed(iter/s)": 0.010729 }, { "epoch": 0.09075043630017451, "grad_norm": 4.300631523132324, "learning_rate": 0.00012093023255813953, "logits/chosen": -0.3624393343925476, "logits/rejected": -0.40366220474243164, "logps/chosen": -13.089804649353027, "logps/rejected": -20.56357192993164, "loss": 1.241166114807129, "memory(GiB)": 34.14, "nll_loss": 0.6592291593551636, "rewards/accuracies": 0.625, "rewards/chosen": -0.10197470337152481, "rewards/margins": 0.3783476948738098, "rewards/rejected": -0.4803224205970764, "step": 26, "train_speed(iter/s)": 0.010728 }, { "epoch": 0.09424083769633508, "grad_norm": 6.326510906219482, "learning_rate": 0.0001255813953488372, "logits/chosen": -0.44795599579811096, "logits/rejected": -0.5086410045623779, "logps/chosen": -6.848785400390625, "logps/rejected": -16.293134689331055, "loss": 1.1223118305206299, "memory(GiB)": 34.14, "nll_loss": 0.5288960933685303, "rewards/accuracies": 0.5625, "rewards/chosen": -0.07493848353624344, "rewards/margins": 0.3489125967025757, "rewards/rejected": -0.4238511323928833, "step": 27, "train_speed(iter/s)": 0.010732 }, { "epoch": 0.09773123909249563, "grad_norm": 3.89947509765625, "learning_rate": 0.0001302325581395349, "logits/chosen": -0.3942677080631256, "logits/rejected": -0.44409164786338806, "logps/chosen": -12.765388488769531, "logps/rejected": -21.65694236755371, "loss": 1.2387657165527344, "memory(GiB)": 34.14, "nll_loss": 0.7279061675071716, "rewards/accuracies": 0.8125, "rewards/chosen": -0.10546489804983139, "rewards/margins": 0.5104267001152039, "rewards/rejected": -0.6158915758132935, "step": 28, "train_speed(iter/s)": 0.010734 }, { "epoch": 0.1012216404886562, "grad_norm": 2.5956175327301025, "learning_rate": 0.00013488372093023256, "logits/chosen": -0.4249032139778137, "logits/rejected": -0.47334301471710205, "logps/chosen": -8.39433765411377, "logps/rejected": -19.74716567993164, "loss": 1.050766110420227, "memory(GiB)": 34.14, "nll_loss": 0.5741204619407654, "rewards/accuracies": 0.84375, "rewards/chosen": 0.02486160770058632, "rewards/margins": 0.6779846549034119, "rewards/rejected": -0.6531230211257935, "step": 29, "train_speed(iter/s)": 0.010736 }, { "epoch": 0.10471204188481675, "grad_norm": 3.123206377029419, "learning_rate": 0.00013953488372093025, "logits/chosen": -0.3965456485748291, "logits/rejected": -0.5027358531951904, "logps/chosen": -4.980073928833008, "logps/rejected": -25.411418914794922, "loss": 0.8653208613395691, "memory(GiB)": 34.14, "nll_loss": 0.4148715138435364, "rewards/accuracies": 0.8125, "rewards/chosen": 0.021732095628976822, "rewards/margins": 0.7521398663520813, "rewards/rejected": -0.73040771484375, "step": 30, "train_speed(iter/s)": 0.010738 }, { "epoch": 0.1082024432809773, "grad_norm": 3.027268409729004, "learning_rate": 0.00014418604651162791, "logits/chosen": -0.40849679708480835, "logits/rejected": -0.47468990087509155, "logps/chosen": -7.037868499755859, "logps/rejected": -21.788843154907227, "loss": 1.0142453908920288, "memory(GiB)": 34.14, "nll_loss": 0.48545634746551514, "rewards/accuracies": 0.6875, "rewards/chosen": -0.026916703209280968, "rewards/margins": 0.5216760039329529, "rewards/rejected": -0.5485926866531372, "step": 31, "train_speed(iter/s)": 0.010739 }, { "epoch": 0.11169284467713787, "grad_norm": 4.0368146896362305, "learning_rate": 0.00014883720930232558, "logits/chosen": -0.3984982967376709, "logits/rejected": -0.47634080052375793, "logps/chosen": -14.304816246032715, "logps/rejected": -21.326597213745117, "loss": 1.2883504629135132, "memory(GiB)": 34.14, "nll_loss": 0.6627980470657349, "rewards/accuracies": 0.6875, "rewards/chosen": -0.268436074256897, "rewards/margins": 0.32418739795684814, "rewards/rejected": -0.5926234722137451, "step": 32, "train_speed(iter/s)": 0.010739 }, { "epoch": 0.11518324607329843, "grad_norm": 2.3341856002807617, "learning_rate": 0.00015348837209302327, "logits/chosen": -0.34923142194747925, "logits/rejected": -0.45246458053588867, "logps/chosen": -7.6517744064331055, "logps/rejected": -26.005094528198242, "loss": 0.8868998885154724, "memory(GiB)": 34.14, "nll_loss": 0.45535364747047424, "rewards/accuracies": 0.84375, "rewards/chosen": 0.009979171678423882, "rewards/margins": 0.8548348546028137, "rewards/rejected": -0.8448556661605835, "step": 33, "train_speed(iter/s)": 0.010739 }, { "epoch": 0.11867364746945899, "grad_norm": 3.8161845207214355, "learning_rate": 0.00015813953488372093, "logits/chosen": -0.4433535933494568, "logits/rejected": -0.4599112570285797, "logps/chosen": -7.665817737579346, "logps/rejected": -16.353017807006836, "loss": 0.9908475279808044, "memory(GiB)": 34.14, "nll_loss": 0.5115343332290649, "rewards/accuracies": 0.875, "rewards/chosen": 0.05993407219648361, "rewards/margins": 0.6281672716140747, "rewards/rejected": -0.5682331919670105, "step": 34, "train_speed(iter/s)": 0.010742 }, { "epoch": 0.12216404886561955, "grad_norm": 2.7297890186309814, "learning_rate": 0.00016279069767441862, "logits/chosen": -0.32466650009155273, "logits/rejected": -0.4645735025405884, "logps/chosen": -6.396218299865723, "logps/rejected": -25.87699317932129, "loss": 0.8697510957717896, "memory(GiB)": 34.14, "nll_loss": 0.38066551089286804, "rewards/accuracies": 0.84375, "rewards/chosen": 0.11624527722597122, "rewards/margins": 0.6377441883087158, "rewards/rejected": -0.5214988589286804, "step": 35, "train_speed(iter/s)": 0.010743 }, { "epoch": 0.1256544502617801, "grad_norm": 3.7659413814544678, "learning_rate": 0.00016744186046511629, "logits/chosen": -0.3423185348510742, "logits/rejected": -0.5114607214927673, "logps/chosen": -6.822861671447754, "logps/rejected": -25.182849884033203, "loss": 1.0008474588394165, "memory(GiB)": 34.14, "nll_loss": 0.5603237152099609, "rewards/accuracies": 0.84375, "rewards/chosen": 0.10806835442781448, "rewards/margins": 0.8264971375465393, "rewards/rejected": -0.7184286713600159, "step": 36, "train_speed(iter/s)": 0.010743 }, { "epoch": 0.12914485165794065, "grad_norm": 5.439046382904053, "learning_rate": 0.00017209302325581395, "logits/chosen": -0.4786157011985779, "logits/rejected": -0.4922429919242859, "logps/chosen": -6.435626983642578, "logps/rejected": -17.2198429107666, "loss": 0.9384127259254456, "memory(GiB)": 34.14, "nll_loss": 0.43419790267944336, "rewards/accuracies": 0.78125, "rewards/chosen": 0.02293190360069275, "rewards/margins": 0.5868319869041443, "rewards/rejected": -0.5639001131057739, "step": 37, "train_speed(iter/s)": 0.010745 }, { "epoch": 0.13263525305410123, "grad_norm": 3.3508763313293457, "learning_rate": 0.00017674418604651164, "logits/chosen": -0.42465993762016296, "logits/rejected": -0.4925902783870697, "logps/chosen": -8.958169937133789, "logps/rejected": -20.73528289794922, "loss": 1.111018180847168, "memory(GiB)": 34.14, "nll_loss": 0.7000492811203003, "rewards/accuracies": 0.875, "rewards/chosen": 0.15357299149036407, "rewards/margins": 1.0291643142700195, "rewards/rejected": -0.8755912780761719, "step": 38, "train_speed(iter/s)": 0.010747 }, { "epoch": 0.13612565445026178, "grad_norm": 3.021416664123535, "learning_rate": 0.0001813953488372093, "logits/chosen": -0.4066935181617737, "logits/rejected": -0.4705404043197632, "logps/chosen": -9.284646987915039, "logps/rejected": -20.46940803527832, "loss": 0.9931483864784241, "memory(GiB)": 34.14, "nll_loss": 0.5600231885910034, "rewards/accuracies": 0.90625, "rewards/chosen": 0.11639773845672607, "rewards/margins": 0.8292201161384583, "rewards/rejected": -0.7128223776817322, "step": 39, "train_speed(iter/s)": 0.010749 }, { "epoch": 0.13961605584642234, "grad_norm": 3.415731191635132, "learning_rate": 0.000186046511627907, "logits/chosen": -0.348653107881546, "logits/rejected": -0.5043780207633972, "logps/chosen": -2.844910144805908, "logps/rejected": -24.771116256713867, "loss": 0.7038365006446838, "memory(GiB)": 34.14, "nll_loss": 0.29491642117500305, "rewards/accuracies": 0.875, "rewards/chosen": 0.14402121305465698, "rewards/margins": 1.1453313827514648, "rewards/rejected": -1.0013102293014526, "step": 40, "train_speed(iter/s)": 0.010749 }, { "epoch": 0.1431064572425829, "grad_norm": 3.0232815742492676, "learning_rate": 0.00019069767441860466, "logits/chosen": -0.35887610912323, "logits/rejected": -0.38277357816696167, "logps/chosen": -10.264820098876953, "logps/rejected": -24.83388328552246, "loss": 0.8683040738105774, "memory(GiB)": 34.14, "nll_loss": 0.4005107581615448, "rewards/accuracies": 0.71875, "rewards/chosen": 0.013488545082509518, "rewards/margins": 0.8365979194641113, "rewards/rejected": -0.8231093883514404, "step": 41, "train_speed(iter/s)": 0.010749 }, { "epoch": 0.14659685863874344, "grad_norm": 16.639280319213867, "learning_rate": 0.00019534883720930232, "logits/chosen": -0.33245426416397095, "logits/rejected": -0.4030519127845764, "logps/chosen": -10.0272216796875, "logps/rejected": -25.483577728271484, "loss": 1.21886146068573, "memory(GiB)": 34.14, "nll_loss": 0.7048445343971252, "rewards/accuracies": 0.71875, "rewards/chosen": -0.14778879284858704, "rewards/margins": 1.201229453086853, "rewards/rejected": -1.3490180969238281, "step": 42, "train_speed(iter/s)": 0.010749 }, { "epoch": 0.15008726003490402, "grad_norm": 6.577022075653076, "learning_rate": 0.0002, "logits/chosen": -0.29526323080062866, "logits/rejected": -0.45897889137268066, "logps/chosen": -5.878642559051514, "logps/rejected": -39.53807830810547, "loss": 0.7673805356025696, "memory(GiB)": 35.89, "nll_loss": 0.4374830424785614, "rewards/accuracies": 0.875, "rewards/chosen": -0.023150455206632614, "rewards/margins": 1.816420555114746, "rewards/rejected": -1.8395708799362183, "step": 43, "train_speed(iter/s)": 0.010749 }, { "epoch": 0.15357766143106458, "grad_norm": 2.505460262298584, "learning_rate": 0.00019999925705956715, "logits/chosen": -0.37890657782554626, "logits/rejected": -0.44291937351226807, "logps/chosen": -8.378349304199219, "logps/rejected": -32.722042083740234, "loss": 0.8200633525848389, "memory(GiB)": 35.89, "nll_loss": 0.5234110355377197, "rewards/accuracies": 0.9375, "rewards/chosen": 0.08434319496154785, "rewards/margins": 1.911144495010376, "rewards/rejected": -1.8268014192581177, "step": 44, "train_speed(iter/s)": 0.01075 }, { "epoch": 0.15706806282722513, "grad_norm": 6.880366802215576, "learning_rate": 0.0001999970282493078, "logits/chosen": -0.328549325466156, "logits/rejected": -0.4838561713695526, "logps/chosen": -6.23681116104126, "logps/rejected": -29.523792266845703, "loss": 1.0678659677505493, "memory(GiB)": 35.89, "nll_loss": 0.5795442461967468, "rewards/accuracies": 0.84375, "rewards/chosen": 0.0050928061828017235, "rewards/margins": 1.2474907636642456, "rewards/rejected": -1.2423979043960571, "step": 45, "train_speed(iter/s)": 0.01075 }, { "epoch": 0.16055846422338568, "grad_norm": 6.962847709655762, "learning_rate": 0.00019999331360233944, "logits/chosen": -0.33589401841163635, "logits/rejected": -0.45322129130363464, "logps/chosen": -6.451783657073975, "logps/rejected": -32.003658294677734, "loss": 0.9696826338768005, "memory(GiB)": 35.89, "nll_loss": 0.5726639032363892, "rewards/accuracies": 0.78125, "rewards/chosen": -0.014406954869627953, "rewards/margins": 1.381211757659912, "rewards/rejected": -1.3956186771392822, "step": 46, "train_speed(iter/s)": 0.010751 }, { "epoch": 0.16404886561954624, "grad_norm": 7.938783168792725, "learning_rate": 0.00019998811317385729, "logits/chosen": -0.3734630346298218, "logits/rejected": -0.4592462480068207, "logps/chosen": -12.47143268585205, "logps/rejected": -26.8325138092041, "loss": 1.141100287437439, "memory(GiB)": 35.89, "nll_loss": 0.6339684724807739, "rewards/accuracies": 0.8125, "rewards/chosen": 0.027786267921328545, "rewards/margins": 0.6427249312400818, "rewards/rejected": -0.6149386167526245, "step": 47, "train_speed(iter/s)": 0.01075 }, { "epoch": 0.16753926701570682, "grad_norm": 2.760986804962158, "learning_rate": 0.0001999814270411335, "logits/chosen": -0.43143945932388306, "logits/rejected": -0.4347304701805115, "logps/chosen": -9.348878860473633, "logps/rejected": -24.229524612426758, "loss": 0.9695644974708557, "memory(GiB)": 35.89, "nll_loss": 0.5839965343475342, "rewards/accuracies": 0.84375, "rewards/chosen": 0.007340218871831894, "rewards/margins": 1.3898271322250366, "rewards/rejected": -1.3824869394302368, "step": 48, "train_speed(iter/s)": 0.010751 }, { "epoch": 0.17102966841186737, "grad_norm": 11.194586753845215, "learning_rate": 0.00019997325530351606, "logits/chosen": -0.3548398017883301, "logits/rejected": -0.4637337028980255, "logps/chosen": -16.913610458374023, "logps/rejected": -33.84115982055664, "loss": 1.521134614944458, "memory(GiB)": 35.89, "nll_loss": 1.0307905673980713, "rewards/accuracies": 0.8125, "rewards/chosen": -0.28235313296318054, "rewards/margins": 1.413867712020874, "rewards/rejected": -1.6962207555770874, "step": 49, "train_speed(iter/s)": 0.010751 }, { "epoch": 0.17452006980802792, "grad_norm": 3.4211995601654053, "learning_rate": 0.00019996359808242722, "logits/chosen": -0.32980048656463623, "logits/rejected": -0.5140572190284729, "logps/chosen": -4.228909492492676, "logps/rejected": -34.62148666381836, "loss": 0.6742458343505859, "memory(GiB)": 35.89, "nll_loss": 0.37631386518478394, "rewards/accuracies": 0.90625, "rewards/chosen": 0.08238644152879715, "rewards/margins": 1.9769954681396484, "rewards/rejected": -1.894608974456787, "step": 50, "train_speed(iter/s)": 0.010752 }, { "epoch": 0.17801047120418848, "grad_norm": 4.199666500091553, "learning_rate": 0.00019995245552136183, "logits/chosen": -0.38337764143943787, "logits/rejected": -0.5411950349807739, "logps/chosen": -7.726480484008789, "logps/rejected": -33.165184020996094, "loss": 0.8604421615600586, "memory(GiB)": 35.89, "nll_loss": 0.4990411400794983, "rewards/accuracies": 0.8125, "rewards/chosen": 0.0083555206656456, "rewards/margins": 1.5133056640625, "rewards/rejected": -1.5049501657485962, "step": 51, "train_speed(iter/s)": 0.010753 }, { "epoch": 0.18150087260034903, "grad_norm": 7.909679412841797, "learning_rate": 0.00019993982778588506, "logits/chosen": -0.42613935470581055, "logits/rejected": -0.5141798257827759, "logps/chosen": -12.04079818725586, "logps/rejected": -32.32722091674805, "loss": 1.079092264175415, "memory(GiB)": 35.89, "nll_loss": 0.5544219613075256, "rewards/accuracies": 0.6875, "rewards/chosen": -0.21235862374305725, "rewards/margins": 1.353042721748352, "rewards/rejected": -1.565401315689087, "step": 52, "train_speed(iter/s)": 0.010753 }, { "epoch": 0.1849912739965096, "grad_norm": 3.7452335357666016, "learning_rate": 0.00019992571506363, "logits/chosen": -0.3618060052394867, "logits/rejected": -0.5190442800521851, "logps/chosen": -6.607875347137451, "logps/rejected": -25.438873291015625, "loss": 1.0128110647201538, "memory(GiB)": 35.89, "nll_loss": 0.5347008109092712, "rewards/accuracies": 0.78125, "rewards/chosen": -0.0013710036873817444, "rewards/margins": 0.7542194724082947, "rewards/rejected": -0.7555904388427734, "step": 53, "train_speed(iter/s)": 0.010753 }, { "epoch": 0.18848167539267016, "grad_norm": 2.7128043174743652, "learning_rate": 0.00019991011756429486, "logits/chosen": -0.43821805715560913, "logits/rejected": -0.48400819301605225, "logps/chosen": -8.567977905273438, "logps/rejected": -19.301103591918945, "loss": 1.0873574018478394, "memory(GiB)": 35.89, "nll_loss": 0.5480538010597229, "rewards/accuracies": 0.65625, "rewards/chosen": 0.06769907474517822, "rewards/margins": 0.6852700114250183, "rewards/rejected": -0.6175709366798401, "step": 54, "train_speed(iter/s)": 0.010754 }, { "epoch": 0.19197207678883071, "grad_norm": 2.5323894023895264, "learning_rate": 0.00019989303551963997, "logits/chosen": -0.3141109347343445, "logits/rejected": -0.48292648792266846, "logps/chosen": -4.789846420288086, "logps/rejected": -26.765024185180664, "loss": 0.880359411239624, "memory(GiB)": 35.89, "nll_loss": 0.3599545359611511, "rewards/accuracies": 0.75, "rewards/chosen": 0.09160856902599335, "rewards/margins": 0.7724493145942688, "rewards/rejected": -0.6808407306671143, "step": 55, "train_speed(iter/s)": 0.010753 }, { "epoch": 0.19546247818499127, "grad_norm": 2.958927869796753, "learning_rate": 0.00019987446918348411, "logits/chosen": -0.3392045199871063, "logits/rejected": -0.4613609313964844, "logps/chosen": -6.773719310760498, "logps/rejected": -20.55025291442871, "loss": 1.0082640647888184, "memory(GiB)": 35.89, "nll_loss": 0.44486063718795776, "rewards/accuracies": 0.65625, "rewards/chosen": 0.06419242918491364, "rewards/margins": 0.5171071887016296, "rewards/rejected": -0.4529147446155548, "step": 56, "train_speed(iter/s)": 0.010754 }, { "epoch": 0.19895287958115182, "grad_norm": 3.204970359802246, "learning_rate": 0.00019985441883170094, "logits/chosen": -0.45556554198265076, "logits/rejected": -0.47999584674835205, "logps/chosen": -8.982965469360352, "logps/rejected": -18.054445266723633, "loss": 0.996261477470398, "memory(GiB)": 35.89, "nll_loss": 0.4766736924648285, "rewards/accuracies": 0.75, "rewards/chosen": 0.07613325119018555, "rewards/margins": 0.774691104888916, "rewards/rejected": -0.6985578536987305, "step": 57, "train_speed(iter/s)": 0.010755 }, { "epoch": 0.2024432809773124, "grad_norm": 3.0290675163269043, "learning_rate": 0.0001998328847622148, "logits/chosen": -0.43794357776641846, "logits/rejected": -0.4973166882991791, "logps/chosen": -6.941474437713623, "logps/rejected": -21.18113136291504, "loss": 0.9271993637084961, "memory(GiB)": 35.89, "nll_loss": 0.40610748529434204, "rewards/accuracies": 0.6875, "rewards/chosen": 0.031344618648290634, "rewards/margins": 0.7323437929153442, "rewards/rejected": -0.7009991407394409, "step": 58, "train_speed(iter/s)": 0.010756 }, { "epoch": 0.20593368237347295, "grad_norm": 3.3924288749694824, "learning_rate": 0.0001998098672949963, "logits/chosen": -0.43890056014060974, "logits/rejected": -0.47092944383621216, "logps/chosen": -6.540399074554443, "logps/rejected": -23.68883514404297, "loss": 0.8886168003082275, "memory(GiB)": 35.89, "nll_loss": 0.42720285058021545, "rewards/accuracies": 0.71875, "rewards/chosen": 0.062318772077560425, "rewards/margins": 1.219529151916504, "rewards/rejected": -1.1572105884552002, "step": 59, "train_speed(iter/s)": 0.010757 }, { "epoch": 0.2094240837696335, "grad_norm": 6.436001300811768, "learning_rate": 0.00019978536677205753, "logits/chosen": -0.3602336645126343, "logits/rejected": -0.49971872568130493, "logps/chosen": -7.300111770629883, "logps/rejected": -35.16114044189453, "loss": 0.893642783164978, "memory(GiB)": 35.89, "nll_loss": 0.5613251328468323, "rewards/accuracies": 0.875, "rewards/chosen": -0.04828762263059616, "rewards/margins": 2.0058753490448, "rewards/rejected": -2.0541629791259766, "step": 60, "train_speed(iter/s)": 0.010758 }, { "epoch": 0.21291448516579406, "grad_norm": 9.151269912719727, "learning_rate": 0.0001997593835574472, "logits/chosen": -0.2997259497642517, "logits/rejected": -0.4807735085487366, "logps/chosen": -7.510552406311035, "logps/rejected": -51.04875946044922, "loss": 0.7812849879264832, "memory(GiB)": 35.89, "nll_loss": 0.5295180082321167, "rewards/accuracies": 0.90625, "rewards/chosen": -0.27329760789871216, "rewards/margins": 3.0174202919006348, "rewards/rejected": -3.2907180786132812, "step": 61, "train_speed(iter/s)": 0.010759 }, { "epoch": 0.2164048865619546, "grad_norm": 3.0901706218719482, "learning_rate": 0.00019973191803724483, "logits/chosen": -0.3464053273200989, "logits/rejected": -0.43850764632225037, "logps/chosen": -5.784665107727051, "logps/rejected": -29.168745040893555, "loss": 0.6676730513572693, "memory(GiB)": 35.89, "nll_loss": 0.2769017219543457, "rewards/accuracies": 0.71875, "rewards/chosen": 0.09001894295215607, "rewards/margins": 1.1760774850845337, "rewards/rejected": -1.0860586166381836, "step": 62, "train_speed(iter/s)": 0.010759 }, { "epoch": 0.2198952879581152, "grad_norm": 3.0961596965789795, "learning_rate": 0.00019970297061955533, "logits/chosen": -0.35332319140434265, "logits/rejected": -0.5135117173194885, "logps/chosen": -5.485988616943359, "logps/rejected": -36.72576141357422, "loss": 0.7853246331214905, "memory(GiB)": 35.89, "nll_loss": 0.5297773480415344, "rewards/accuracies": 0.96875, "rewards/chosen": 0.02064245566725731, "rewards/margins": 2.3967862129211426, "rewards/rejected": -2.37614369392395, "step": 63, "train_speed(iter/s)": 0.01076 }, { "epoch": 0.22338568935427575, "grad_norm": 4.25160026550293, "learning_rate": 0.00019967254173450287, "logits/chosen": -0.2867816090583801, "logits/rejected": -0.44146350026130676, "logps/chosen": -5.827723026275635, "logps/rejected": -31.073637008666992, "loss": 0.7783889770507812, "memory(GiB)": 35.89, "nll_loss": 0.43023356795310974, "rewards/accuracies": 0.875, "rewards/chosen": 0.09779734909534454, "rewards/margins": 1.5616310834884644, "rewards/rejected": -1.4638336896896362, "step": 64, "train_speed(iter/s)": 0.01076 }, { "epoch": 0.2268760907504363, "grad_norm": 2.711167097091675, "learning_rate": 0.0001996406318342244, "logits/chosen": -0.351021945476532, "logits/rejected": -0.4185492694377899, "logps/chosen": -6.972557544708252, "logps/rejected": -29.75743865966797, "loss": 0.7590102553367615, "memory(GiB)": 35.89, "nll_loss": 0.42238616943359375, "rewards/accuracies": 0.875, "rewards/chosen": 0.07267698645591736, "rewards/margins": 1.7358276844024658, "rewards/rejected": -1.663150429725647, "step": 65, "train_speed(iter/s)": 0.010761 }, { "epoch": 0.23036649214659685, "grad_norm": 5.093292236328125, "learning_rate": 0.00019960724139286308, "logits/chosen": -0.29837629199028015, "logits/rejected": -0.38664788007736206, "logps/chosen": -11.696621894836426, "logps/rejected": -34.02775192260742, "loss": 1.0549557209014893, "memory(GiB)": 35.89, "nll_loss": 0.7019686102867126, "rewards/accuracies": 0.90625, "rewards/chosen": -0.16252195835113525, "rewards/margins": 1.5406640768051147, "rewards/rejected": -1.70318603515625, "step": 66, "train_speed(iter/s)": 0.010761 }, { "epoch": 0.2338568935427574, "grad_norm": 3.672001838684082, "learning_rate": 0.00019957237090656102, "logits/chosen": -0.2561183571815491, "logits/rejected": -0.4472733438014984, "logps/chosen": -6.693790912628174, "logps/rejected": -52.02687072753906, "loss": 0.6644150614738464, "memory(GiB)": 35.89, "nll_loss": 0.44371137022972107, "rewards/accuracies": 0.90625, "rewards/chosen": -0.018377352505922318, "rewards/margins": 2.62888765335083, "rewards/rejected": -2.6472654342651367, "step": 67, "train_speed(iter/s)": 0.01076 }, { "epoch": 0.23734729493891799, "grad_norm": 8.564802169799805, "learning_rate": 0.00019953602089345217, "logits/chosen": -0.3133094310760498, "logits/rejected": -0.45969486236572266, "logps/chosen": -7.815582275390625, "logps/rejected": -38.529781341552734, "loss": 1.0037181377410889, "memory(GiB)": 35.89, "nll_loss": 0.6282736659049988, "rewards/accuracies": 0.8125, "rewards/chosen": -0.1540919542312622, "rewards/margins": 1.7298449277877808, "rewards/rejected": -1.883936882019043, "step": 68, "train_speed(iter/s)": 0.01076 }, { "epoch": 0.24083769633507854, "grad_norm": 12.39240837097168, "learning_rate": 0.00019949819189365433, "logits/chosen": -0.3124208152294159, "logits/rejected": -0.43993785977363586, "logps/chosen": -7.740966796875, "logps/rejected": -34.374534606933594, "loss": 0.9371472001075745, "memory(GiB)": 35.89, "nll_loss": 0.46057644486427307, "rewards/accuracies": 0.71875, "rewards/chosen": -0.0446137860417366, "rewards/margins": 1.5109288692474365, "rewards/rejected": -1.5555427074432373, "step": 69, "train_speed(iter/s)": 0.01076 }, { "epoch": 0.2443280977312391, "grad_norm": 6.788973331451416, "learning_rate": 0.00019945888446926143, "logits/chosen": -0.3286086618900299, "logits/rejected": -0.40763434767723083, "logps/chosen": -10.763023376464844, "logps/rejected": -23.91502571105957, "loss": 1.182040810585022, "memory(GiB)": 35.89, "nll_loss": 0.6381036639213562, "rewards/accuracies": 0.75, "rewards/chosen": -0.1615467518568039, "rewards/margins": 0.6939660906791687, "rewards/rejected": -0.8555128574371338, "step": 70, "train_speed(iter/s)": 0.01076 }, { "epoch": 0.24781849912739964, "grad_norm": 4.333127975463867, "learning_rate": 0.000199418099204335, "logits/chosen": -0.3585875630378723, "logits/rejected": -0.44930267333984375, "logps/chosen": -8.16705322265625, "logps/rejected": -22.100000381469727, "loss": 0.9709787368774414, "memory(GiB)": 35.89, "nll_loss": 0.5348560214042664, "rewards/accuracies": 0.84375, "rewards/chosen": -0.04899175092577934, "rewards/margins": 0.8827412128448486, "rewards/rejected": -0.9317330121994019, "step": 71, "train_speed(iter/s)": 0.010761 }, { "epoch": 0.2513089005235602, "grad_norm": 3.37380051612854, "learning_rate": 0.00019937583670489545, "logits/chosen": -0.33419570326805115, "logits/rejected": -0.43994009494781494, "logps/chosen": -9.082391738891602, "logps/rejected": -28.777481079101562, "loss": 0.9270099401473999, "memory(GiB)": 35.89, "nll_loss": 0.48707476258277893, "rewards/accuracies": 0.75, "rewards/chosen": 0.024601396173238754, "rewards/margins": 1.1600151062011719, "rewards/rejected": -1.1354137659072876, "step": 72, "train_speed(iter/s)": 0.010761 }, { "epoch": 0.2547993019197208, "grad_norm": 3.593212366104126, "learning_rate": 0.00019933209759891317, "logits/chosen": -0.4130091071128845, "logits/rejected": -0.4818781018257141, "logps/chosen": -10.08952808380127, "logps/rejected": -34.58759307861328, "loss": 0.9288522601127625, "memory(GiB)": 35.89, "nll_loss": 0.6054138541221619, "rewards/accuracies": 0.875, "rewards/chosen": -0.11658284813165665, "rewards/margins": 2.089298963546753, "rewards/rejected": -2.2058815956115723, "step": 73, "train_speed(iter/s)": 0.010762 }, { "epoch": 0.2582897033158813, "grad_norm": 3.8672237396240234, "learning_rate": 0.00019928688253629916, "logits/chosen": -0.19415511190891266, "logits/rejected": -0.36130261421203613, "logps/chosen": -11.009477615356445, "logps/rejected": -43.973114013671875, "loss": 1.1013773679733276, "memory(GiB)": 35.89, "nll_loss": 0.6544516086578369, "rewards/accuracies": 0.875, "rewards/chosen": -0.030637577176094055, "rewards/margins": 2.5454745292663574, "rewards/rejected": -2.5761120319366455, "step": 74, "train_speed(iter/s)": 0.01076 }, { "epoch": 0.2617801047120419, "grad_norm": 4.066303730010986, "learning_rate": 0.00019924019218889536, "logits/chosen": -0.33296871185302734, "logits/rejected": -0.4902675747871399, "logps/chosen": -9.64806079864502, "logps/rejected": -37.88252639770508, "loss": 0.8953545093536377, "memory(GiB)": 35.89, "nll_loss": 0.5640730857849121, "rewards/accuracies": 0.84375, "rewards/chosen": 0.009408235549926758, "rewards/margins": 2.1965668201446533, "rewards/rejected": -2.1871585845947266, "step": 75, "train_speed(iter/s)": 0.01076 }, { "epoch": 0.26527050610820246, "grad_norm": 2.3979082107543945, "learning_rate": 0.00019919202725046477, "logits/chosen": -0.20567730069160461, "logits/rejected": -0.34439828991889954, "logps/chosen": -8.100298881530762, "logps/rejected": -39.28445816040039, "loss": 0.7528076767921448, "memory(GiB)": 39.42, "nll_loss": 0.39297810196876526, "rewards/accuracies": 0.875, "rewards/chosen": 0.025398975238204002, "rewards/margins": 1.6433254480361938, "rewards/rejected": -1.6179265975952148, "step": 76, "train_speed(iter/s)": 0.010759 }, { "epoch": 0.268760907504363, "grad_norm": 2.7927446365356445, "learning_rate": 0.00019914238843668096, "logits/chosen": -0.3428923785686493, "logits/rejected": -0.4334644675254822, "logps/chosen": -6.549041271209717, "logps/rejected": -27.63149070739746, "loss": 0.796095609664917, "memory(GiB)": 39.42, "nll_loss": 0.3915262818336487, "rewards/accuracies": 0.8125, "rewards/chosen": 0.06563803553581238, "rewards/margins": 1.2631423473358154, "rewards/rejected": -1.1975042819976807, "step": 77, "train_speed(iter/s)": 0.010759 }, { "epoch": 0.27225130890052357, "grad_norm": 4.248587608337402, "learning_rate": 0.00019909127648511755, "logits/chosen": -0.3395402431488037, "logits/rejected": -0.48165830969810486, "logps/chosen": -5.904273986816406, "logps/rejected": -27.16798973083496, "loss": 0.743380606174469, "memory(GiB)": 39.42, "nll_loss": 0.3838931918144226, "rewards/accuracies": 0.90625, "rewards/chosen": 0.10840368270874023, "rewards/margins": 1.24807870388031, "rewards/rejected": -1.1396750211715698, "step": 78, "train_speed(iter/s)": 0.010759 }, { "epoch": 0.2757417102966841, "grad_norm": 2.7059414386749268, "learning_rate": 0.00019903869215523733, "logits/chosen": -0.22887416183948517, "logits/rejected": -0.48973891139030457, "logps/chosen": -3.493281364440918, "logps/rejected": -34.020050048828125, "loss": 0.6441786885261536, "memory(GiB)": 39.42, "nll_loss": 0.3432372510433197, "rewards/accuracies": 0.90625, "rewards/chosen": 0.12880486249923706, "rewards/margins": 1.6592087745666504, "rewards/rejected": -1.5304038524627686, "step": 79, "train_speed(iter/s)": 0.010759 }, { "epoch": 0.2792321116928447, "grad_norm": 4.634321212768555, "learning_rate": 0.0001989846362283807, "logits/chosen": -0.29562249779701233, "logits/rejected": -0.34773433208465576, "logps/chosen": -11.475696563720703, "logps/rejected": -27.678905487060547, "loss": 1.1467502117156982, "memory(GiB)": 39.42, "nll_loss": 0.6945275664329529, "rewards/accuracies": 0.8125, "rewards/chosen": -0.10402540862560272, "rewards/margins": 1.2328475713729858, "rewards/rejected": -1.336873173713684, "step": 80, "train_speed(iter/s)": 0.010758 }, { "epoch": 0.28272251308900526, "grad_norm": 3.8445465564727783, "learning_rate": 0.00019892910950775435, "logits/chosen": -0.23248018324375153, "logits/rejected": -0.35242336988449097, "logps/chosen": -6.628226280212402, "logps/rejected": -33.20770263671875, "loss": 0.8408610224723816, "memory(GiB)": 39.42, "nll_loss": 0.5566035509109497, "rewards/accuracies": 0.90625, "rewards/chosen": 0.13027045130729675, "rewards/margins": 2.089359998703003, "rewards/rejected": -1.9590896368026733, "step": 81, "train_speed(iter/s)": 0.010759 }, { "epoch": 0.2862129144851658, "grad_norm": 2.7230985164642334, "learning_rate": 0.00019887211281841924, "logits/chosen": -0.2518586218357086, "logits/rejected": -0.31852811574935913, "logps/chosen": -8.052734375, "logps/rejected": -28.10201644897461, "loss": 0.7522032856941223, "memory(GiB)": 39.42, "nll_loss": 0.3988189697265625, "rewards/accuracies": 0.84375, "rewards/chosen": 0.162813201546669, "rewards/margins": 1.698049783706665, "rewards/rejected": -1.5352365970611572, "step": 82, "train_speed(iter/s)": 0.010759 }, { "epoch": 0.28970331588132636, "grad_norm": 5.669232368469238, "learning_rate": 0.00019881364700727823, "logits/chosen": -0.13075971603393555, "logits/rejected": -0.3868337869644165, "logps/chosen": -9.65750503540039, "logps/rejected": -36.58469772338867, "loss": 1.048365831375122, "memory(GiB)": 39.42, "nll_loss": 0.7252820730209351, "rewards/accuracies": 0.875, "rewards/chosen": 0.21855562925338745, "rewards/margins": 1.9177855253219604, "rewards/rejected": -1.6992299556732178, "step": 83, "train_speed(iter/s)": 0.010759 }, { "epoch": 0.2931937172774869, "grad_norm": 2.559206962585449, "learning_rate": 0.00019875371294306366, "logits/chosen": -0.07886800169944763, "logits/rejected": -0.302437424659729, "logps/chosen": -6.699373722076416, "logps/rejected": -43.041194915771484, "loss": 0.7339796423912048, "memory(GiB)": 39.42, "nll_loss": 0.4990921914577484, "rewards/accuracies": 0.96875, "rewards/chosen": 0.12242552638053894, "rewards/margins": 2.4995968341827393, "rewards/rejected": -2.377171277999878, "step": 84, "train_speed(iter/s)": 0.010759 }, { "epoch": 0.29668411867364747, "grad_norm": 3.492406129837036, "learning_rate": 0.0001986923115163243, "logits/chosen": -0.13503603637218475, "logits/rejected": -0.3026173710823059, "logps/chosen": -6.315262317657471, "logps/rejected": -38.55803680419922, "loss": 0.8880235552787781, "memory(GiB)": 39.42, "nll_loss": 0.5917512774467468, "rewards/accuracies": 0.875, "rewards/chosen": 0.04879331588745117, "rewards/margins": 1.9771116971969604, "rewards/rejected": -1.9283183813095093, "step": 85, "train_speed(iter/s)": 0.010759 }, { "epoch": 0.30017452006980805, "grad_norm": 3.961932897567749, "learning_rate": 0.00019862944363941218, "logits/chosen": -0.10436159372329712, "logits/rejected": -0.3089469075202942, "logps/chosen": -6.1503825187683105, "logps/rejected": -38.23727035522461, "loss": 0.90598064661026, "memory(GiB)": 39.42, "nll_loss": 0.633453905582428, "rewards/accuracies": 0.9375, "rewards/chosen": 0.14362435042858124, "rewards/margins": 2.058913469314575, "rewards/rejected": -1.915289044380188, "step": 86, "train_speed(iter/s)": 0.010759 }, { "epoch": 0.3036649214659686, "grad_norm": 3.4905996322631836, "learning_rate": 0.0001985651102464691, "logits/chosen": -0.11853908002376556, "logits/rejected": -0.24401453137397766, "logps/chosen": -7.3659820556640625, "logps/rejected": -38.6995849609375, "loss": 0.749198853969574, "memory(GiB)": 39.42, "nll_loss": 0.43377092480659485, "rewards/accuracies": 0.90625, "rewards/chosen": -0.14165769517421722, "rewards/margins": 2.025956630706787, "rewards/rejected": -2.167614459991455, "step": 87, "train_speed(iter/s)": 0.01076 }, { "epoch": 0.30715532286212915, "grad_norm": 3.6831657886505127, "learning_rate": 0.00019849931229341258, "logits/chosen": -0.1332027167081833, "logits/rejected": -0.24646437168121338, "logps/chosen": -8.003013610839844, "logps/rejected": -37.04756164550781, "loss": 0.8140410780906677, "memory(GiB)": 39.42, "nll_loss": 0.44854581356048584, "rewards/accuracies": 0.84375, "rewards/chosen": 0.034915290772914886, "rewards/margins": 1.382434606552124, "rewards/rejected": -1.3475191593170166, "step": 88, "train_speed(iter/s)": 0.01076 }, { "epoch": 0.3106457242582897, "grad_norm": 2.4958512783050537, "learning_rate": 0.00019843205075792186, "logits/chosen": -0.11535613983869553, "logits/rejected": -0.246973916888237, "logps/chosen": -7.1996660232543945, "logps/rejected": -32.96755599975586, "loss": 0.7998999357223511, "memory(GiB)": 39.42, "nll_loss": 0.49011173844337463, "rewards/accuracies": 0.90625, "rewards/chosen": 0.08970604836940765, "rewards/margins": 1.6430060863494873, "rewards/rejected": -1.553299903869629, "step": 89, "train_speed(iter/s)": 0.01076 }, { "epoch": 0.31413612565445026, "grad_norm": 2.470099687576294, "learning_rate": 0.0001983633266394232, "logits/chosen": -0.13420692086219788, "logits/rejected": -0.3025938868522644, "logps/chosen": -10.592232704162598, "logps/rejected": -43.20408630371094, "loss": 0.8399574160575867, "memory(GiB)": 39.42, "nll_loss": 0.5707088112831116, "rewards/accuracies": 0.9375, "rewards/chosen": 0.024432912468910217, "rewards/margins": 1.8845049142837524, "rewards/rejected": -1.8600718975067139, "step": 90, "train_speed(iter/s)": 0.01076 }, { "epoch": 0.31762652705061084, "grad_norm": 2.7454211711883545, "learning_rate": 0.00019829314095907516, "logits/chosen": -0.15840838849544525, "logits/rejected": -0.29640981554985046, "logps/chosen": -7.358951568603516, "logps/rejected": -35.788387298583984, "loss": 0.7901937961578369, "memory(GiB)": 39.42, "nll_loss": 0.48892611265182495, "rewards/accuracies": 0.9375, "rewards/chosen": 0.018669307231903076, "rewards/margins": 1.815453290939331, "rewards/rejected": -1.7967840433120728, "step": 91, "train_speed(iter/s)": 0.01076 }, { "epoch": 0.32111692844677137, "grad_norm": 2.443572998046875, "learning_rate": 0.0001982214947597533, "logits/chosen": -0.13980664312839508, "logits/rejected": -0.2785203754901886, "logps/chosen": -7.595067024230957, "logps/rejected": -29.64536476135254, "loss": 0.7760062217712402, "memory(GiB)": 39.42, "nll_loss": 0.417621374130249, "rewards/accuracies": 0.8125, "rewards/chosen": 0.18094170093536377, "rewards/margins": 1.5685675144195557, "rewards/rejected": -1.3876259326934814, "step": 92, "train_speed(iter/s)": 0.010759 }, { "epoch": 0.32460732984293195, "grad_norm": 2.695469856262207, "learning_rate": 0.00019814838910603481, "logits/chosen": -0.21802689135074615, "logits/rejected": -0.30977922677993774, "logps/chosen": -8.865757942199707, "logps/rejected": -31.998289108276367, "loss": 0.8171509504318237, "memory(GiB)": 39.42, "nll_loss": 0.46762198209762573, "rewards/accuracies": 0.875, "rewards/chosen": 0.08467155694961548, "rewards/margins": 1.8997126817703247, "rewards/rejected": -1.815041184425354, "step": 93, "train_speed(iter/s)": 0.010759 }, { "epoch": 0.32809773123909247, "grad_norm": 2.3831567764282227, "learning_rate": 0.0001980738250841826, "logits/chosen": -0.1939636468887329, "logits/rejected": -0.33366823196411133, "logps/chosen": -8.547904968261719, "logps/rejected": -36.44358444213867, "loss": 0.8093112707138062, "memory(GiB)": 39.42, "nll_loss": 0.46711432933807373, "rewards/accuracies": 0.84375, "rewards/chosen": 0.023340808227658272, "rewards/margins": 1.871730923652649, "rewards/rejected": -1.8483901023864746, "step": 94, "train_speed(iter/s)": 0.010759 }, { "epoch": 0.33158813263525305, "grad_norm": 4.449499130249023, "learning_rate": 0.0001979978038021292, "logits/chosen": -0.21011316776275635, "logits/rejected": -0.3800049126148224, "logps/chosen": -6.6607513427734375, "logps/rejected": -37.015220642089844, "loss": 0.7690098285675049, "memory(GiB)": 39.42, "nll_loss": 0.3787845969200134, "rewards/accuracies": 0.84375, "rewards/chosen": 0.022871140390634537, "rewards/margins": 1.7818647623062134, "rewards/rejected": -1.7589936256408691, "step": 95, "train_speed(iter/s)": 0.010758 }, { "epoch": 0.33507853403141363, "grad_norm": 8.076894760131836, "learning_rate": 0.00019792032638946027, "logits/chosen": -0.22930172085762024, "logits/rejected": -0.363534152507782, "logps/chosen": -9.168333053588867, "logps/rejected": -39.97100067138672, "loss": 0.999840497970581, "memory(GiB)": 39.42, "nll_loss": 0.5044428706169128, "rewards/accuracies": 0.75, "rewards/chosen": -0.19479180872440338, "rewards/margins": 2.030325174331665, "rewards/rejected": -2.225116729736328, "step": 96, "train_speed(iter/s)": 0.010759 }, { "epoch": 0.33856893542757416, "grad_norm": 2.602322578430176, "learning_rate": 0.00019784139399739794, "logits/chosen": -0.23653970658779144, "logits/rejected": -0.37720808386802673, "logps/chosen": -7.70982551574707, "logps/rejected": -46.72187423706055, "loss": 0.7515106797218323, "memory(GiB)": 39.42, "nll_loss": 0.49746939539909363, "rewards/accuracies": 0.8125, "rewards/chosen": -0.16890637576580048, "rewards/margins": 2.9459898471832275, "rewards/rejected": -3.114896297454834, "step": 97, "train_speed(iter/s)": 0.010759 }, { "epoch": 0.34205933682373474, "grad_norm": 2.917598009109497, "learning_rate": 0.00019776100779878345, "logits/chosen": -0.24879562854766846, "logits/rejected": -0.4712115526199341, "logps/chosen": -4.071171760559082, "logps/rejected": -39.8735237121582, "loss": 0.6295332908630371, "memory(GiB)": 39.42, "nll_loss": 0.3750327527523041, "rewards/accuracies": 0.90625, "rewards/chosen": 0.12702509760856628, "rewards/margins": 2.281287431716919, "rewards/rejected": -2.1542623043060303, "step": 98, "train_speed(iter/s)": 0.010759 }, { "epoch": 0.34554973821989526, "grad_norm": 3.531543016433716, "learning_rate": 0.00019767916898805993, "logits/chosen": -0.3587397038936615, "logits/rejected": -0.4245099723339081, "logps/chosen": -9.423014640808105, "logps/rejected": -32.22254943847656, "loss": 0.9320547580718994, "memory(GiB)": 39.42, "nll_loss": 0.5687791109085083, "rewards/accuracies": 0.78125, "rewards/chosen": -0.0431206040084362, "rewards/margins": 1.7739802598953247, "rewards/rejected": -1.8171007633209229, "step": 99, "train_speed(iter/s)": 0.010759 }, { "epoch": 0.34904013961605584, "grad_norm": 2.429708242416382, "learning_rate": 0.00019759587878125467, "logits/chosen": -0.38257211446762085, "logits/rejected": -0.46099749207496643, "logps/chosen": -6.002010345458984, "logps/rejected": -35.495018005371094, "loss": 0.7784558534622192, "memory(GiB)": 39.42, "nll_loss": 0.4933393895626068, "rewards/accuracies": 0.90625, "rewards/chosen": 0.10934662073850632, "rewards/margins": 2.241340160369873, "rewards/rejected": -2.1319937705993652, "step": 100, "train_speed(iter/s)": 0.01076 }, { "epoch": 0.3525305410122164, "grad_norm": 2.213499069213867, "learning_rate": 0.00019751113841596086, "logits/chosen": -0.37704822421073914, "logits/rejected": -0.4514527916908264, "logps/chosen": -6.885778427124023, "logps/rejected": -27.876874923706055, "loss": 0.704035758972168, "memory(GiB)": 39.42, "nll_loss": 0.4308836758136749, "rewards/accuracies": 0.96875, "rewards/chosen": 0.12775495648384094, "rewards/margins": 1.5644640922546387, "rewards/rejected": -1.4367092847824097, "step": 101, "train_speed(iter/s)": 0.010742 }, { "epoch": 0.35602094240837695, "grad_norm": 2.3929998874664307, "learning_rate": 0.00019742494915131942, "logits/chosen": -0.36924856901168823, "logits/rejected": -0.41376832127571106, "logps/chosen": -5.98624324798584, "logps/rejected": -36.84775161743164, "loss": 0.5458755493164062, "memory(GiB)": 39.42, "nll_loss": 0.35526004433631897, "rewards/accuracies": 0.96875, "rewards/chosen": 0.1133466586470604, "rewards/margins": 2.4806315898895264, "rewards/rejected": -2.3672847747802734, "step": 102, "train_speed(iter/s)": 0.010743 }, { "epoch": 0.35951134380453753, "grad_norm": 5.081653118133545, "learning_rate": 0.00019733731226800015, "logits/chosen": -0.2884291112422943, "logits/rejected": -0.41856223344802856, "logps/chosen": -7.244772911071777, "logps/rejected": -43.501136779785156, "loss": 1.0223764181137085, "memory(GiB)": 39.42, "nll_loss": 0.7268551588058472, "rewards/accuracies": 0.84375, "rewards/chosen": -0.17409339547157288, "rewards/margins": 2.4381885528564453, "rewards/rejected": -2.6122817993164062, "step": 103, "train_speed(iter/s)": 0.010743 }, { "epoch": 0.36300174520069806, "grad_norm": 4.38121223449707, "learning_rate": 0.00019724822906818265, "logits/chosen": -0.3204030692577362, "logits/rejected": -0.37165117263793945, "logps/chosen": -7.093808650970459, "logps/rejected": -36.024147033691406, "loss": 0.746134877204895, "memory(GiB)": 39.42, "nll_loss": 0.4921882450580597, "rewards/accuracies": 0.875, "rewards/chosen": 0.053046248853206635, "rewards/margins": 2.321000337600708, "rewards/rejected": -2.267954111099243, "step": 104, "train_speed(iter/s)": 0.010744 }, { "epoch": 0.36649214659685864, "grad_norm": 7.504276752471924, "learning_rate": 0.0001971577008755372, "logits/chosen": -0.2759462296962738, "logits/rejected": -0.3651443123817444, "logps/chosen": -11.585759162902832, "logps/rejected": -35.60843276977539, "loss": 1.0082931518554688, "memory(GiB)": 39.42, "nll_loss": 0.7006896734237671, "rewards/accuracies": 0.8125, "rewards/chosen": 0.08436793088912964, "rewards/margins": 2.2114996910095215, "rewards/rejected": -2.127131700515747, "step": 105, "train_speed(iter/s)": 0.010745 }, { "epoch": 0.3699825479930192, "grad_norm": 2.724567174911499, "learning_rate": 0.00019706572903520494, "logits/chosen": -0.3390807509422302, "logits/rejected": -0.3694685101509094, "logps/chosen": -9.778353691101074, "logps/rejected": -30.431264877319336, "loss": 0.8204815983772278, "memory(GiB)": 39.42, "nll_loss": 0.487753689289093, "rewards/accuracies": 0.78125, "rewards/chosen": 0.11946438252925873, "rewards/margins": 1.8712043762207031, "rewards/rejected": -1.7517400979995728, "step": 106, "train_speed(iter/s)": 0.010746 }, { "epoch": 0.37347294938917974, "grad_norm": 3.963045358657837, "learning_rate": 0.00019697231491377774, "logits/chosen": -0.3571932911872864, "logits/rejected": -0.41452813148498535, "logps/chosen": -6.354501724243164, "logps/rejected": -29.302684783935547, "loss": 0.8431603908538818, "memory(GiB)": 39.42, "nll_loss": 0.46558207273483276, "rewards/accuracies": 0.8125, "rewards/chosen": -0.0002909880131483078, "rewards/margins": 1.4369157552719116, "rewards/rejected": -1.437206745147705, "step": 107, "train_speed(iter/s)": 0.010746 }, { "epoch": 0.3769633507853403, "grad_norm": 4.0586652755737305, "learning_rate": 0.00019687745989927823, "logits/chosen": -0.3135523796081543, "logits/rejected": -0.3737596273422241, "logps/chosen": -9.778253555297852, "logps/rejected": -28.1949462890625, "loss": 0.966033935546875, "memory(GiB)": 39.42, "nll_loss": 0.6015961170196533, "rewards/accuracies": 0.90625, "rewards/chosen": 0.08021017909049988, "rewards/margins": 1.4340676069259644, "rewards/rejected": -1.353857398033142, "step": 108, "train_speed(iter/s)": 0.010747 }, { "epoch": 0.38045375218150085, "grad_norm": 5.568571090698242, "learning_rate": 0.0001967811654011389, "logits/chosen": -0.309251606464386, "logits/rejected": -0.3893003463745117, "logps/chosen": -7.1915602684021, "logps/rejected": -27.5125732421875, "loss": 0.9027649164199829, "memory(GiB)": 39.42, "nll_loss": 0.49153536558151245, "rewards/accuracies": 0.8125, "rewards/chosen": -0.14030015468597412, "rewards/margins": 1.3549611568450928, "rewards/rejected": -1.4952614307403564, "step": 109, "train_speed(iter/s)": 0.010748 }, { "epoch": 0.38394415357766143, "grad_norm": 3.212317943572998, "learning_rate": 0.00019668343285018125, "logits/chosen": -0.30074530839920044, "logits/rejected": -0.3879661560058594, "logps/chosen": -9.096397399902344, "logps/rejected": -42.42276382446289, "loss": 0.8074911236763, "memory(GiB)": 39.42, "nll_loss": 0.5355080962181091, "rewards/accuracies": 0.84375, "rewards/chosen": -0.040462881326675415, "rewards/margins": 2.193300247192383, "rewards/rejected": -2.2337629795074463, "step": 110, "train_speed(iter/s)": 0.010748 }, { "epoch": 0.387434554973822, "grad_norm": 4.342100620269775, "learning_rate": 0.0001965842636985946, "logits/chosen": -0.3064587414264679, "logits/rejected": -0.41097527742385864, "logps/chosen": -5.184054374694824, "logps/rejected": -36.894256591796875, "loss": 0.7728255987167358, "memory(GiB)": 39.42, "nll_loss": 0.5083194971084595, "rewards/accuracies": 0.9375, "rewards/chosen": 0.11109408736228943, "rewards/margins": 2.293015241622925, "rewards/rejected": -2.1819212436676025, "step": 111, "train_speed(iter/s)": 0.010749 }, { "epoch": 0.39092495636998253, "grad_norm": 9.064605712890625, "learning_rate": 0.00019648365941991438, "logits/chosen": -0.35194405913352966, "logits/rejected": -0.42771002650260925, "logps/chosen": -8.304715156555176, "logps/rejected": -32.21118927001953, "loss": 0.998765766620636, "memory(GiB)": 39.42, "nll_loss": 0.6066679954528809, "rewards/accuracies": 0.84375, "rewards/chosen": 0.15771695971488953, "rewards/margins": 1.7298005819320679, "rewards/rejected": -1.572083592414856, "step": 112, "train_speed(iter/s)": 0.010749 }, { "epoch": 0.3944153577661431, "grad_norm": 1.8839598894119263, "learning_rate": 0.00019638162150900027, "logits/chosen": -0.2599456310272217, "logits/rejected": -0.3942990303039551, "logps/chosen": -4.890069484710693, "logps/rejected": -48.83489227294922, "loss": 0.5059012770652771, "memory(GiB)": 39.42, "nll_loss": 0.31480100750923157, "rewards/accuracies": 1.0, "rewards/chosen": 0.19593901932239532, "rewards/margins": 2.834808588027954, "rewards/rejected": -2.638869524002075, "step": 113, "train_speed(iter/s)": 0.010749 }, { "epoch": 0.39790575916230364, "grad_norm": 2.1122896671295166, "learning_rate": 0.00019627815148201417, "logits/chosen": -0.35711023211479187, "logits/rejected": -0.3968570828437805, "logps/chosen": -7.015074729919434, "logps/rejected": -31.74431037902832, "loss": 0.6316798329353333, "memory(GiB)": 39.42, "nll_loss": 0.3775865137577057, "rewards/accuracies": 0.90625, "rewards/chosen": 0.09947216510772705, "rewards/margins": 2.002511739730835, "rewards/rejected": -1.9030394554138184, "step": 114, "train_speed(iter/s)": 0.01075 }, { "epoch": 0.4013961605584642, "grad_norm": 2.927731990814209, "learning_rate": 0.00019617325087639727, "logits/chosen": -0.38088345527648926, "logits/rejected": -0.435588538646698, "logps/chosen": -6.47522497177124, "logps/rejected": -24.941457748413086, "loss": 0.7609400749206543, "memory(GiB)": 39.42, "nll_loss": 0.4365846514701843, "rewards/accuracies": 0.84375, "rewards/chosen": 0.15598955750465393, "rewards/margins": 1.493629813194275, "rewards/rejected": -1.3376405239105225, "step": 115, "train_speed(iter/s)": 0.010751 }, { "epoch": 0.4048865619546248, "grad_norm": 2.6690480709075928, "learning_rate": 0.00019606692125084775, "logits/chosen": -0.1995878666639328, "logits/rejected": -0.4380982518196106, "logps/chosen": -4.782075881958008, "logps/rejected": -42.2791862487793, "loss": 0.7123544216156006, "memory(GiB)": 39.42, "nll_loss": 0.4524919390678406, "rewards/accuracies": 0.9375, "rewards/chosen": 0.12693020701408386, "rewards/margins": 2.1254653930664062, "rewards/rejected": -1.9985350370407104, "step": 116, "train_speed(iter/s)": 0.01075 }, { "epoch": 0.4083769633507853, "grad_norm": 3.349586248397827, "learning_rate": 0.00019595916418529706, "logits/chosen": -0.3445770740509033, "logits/rejected": -0.4120224118232727, "logps/chosen": -9.293133735656738, "logps/rejected": -35.069541931152344, "loss": 0.7675687074661255, "memory(GiB)": 39.42, "nll_loss": 0.47724154591560364, "rewards/accuracies": 0.90625, "rewards/chosen": 0.06645308434963226, "rewards/margins": 1.9597532749176025, "rewards/rejected": -1.8933004140853882, "step": 117, "train_speed(iter/s)": 0.01075 }, { "epoch": 0.4118673647469459, "grad_norm": 3.534466028213501, "learning_rate": 0.00019584998128088684, "logits/chosen": -0.30230188369750977, "logits/rejected": -0.43015873432159424, "logps/chosen": -6.687424659729004, "logps/rejected": -34.876686096191406, "loss": 0.830184817314148, "memory(GiB)": 39.42, "nll_loss": 0.5149248838424683, "rewards/accuracies": 0.96875, "rewards/chosen": 0.07988367974758148, "rewards/margins": 1.8753106594085693, "rewards/rejected": -1.795426845550537, "step": 118, "train_speed(iter/s)": 0.010751 }, { "epoch": 0.41535776614310643, "grad_norm": 2.4526314735412598, "learning_rate": 0.00019573937415994506, "logits/chosen": -0.3823411464691162, "logits/rejected": -0.3723237216472626, "logps/chosen": -8.30302906036377, "logps/rejected": -28.920549392700195, "loss": 0.6885042190551758, "memory(GiB)": 39.42, "nll_loss": 0.37792226672172546, "rewards/accuracies": 0.875, "rewards/chosen": 0.050916727632284164, "rewards/margins": 1.7539997100830078, "rewards/rejected": -1.7030829191207886, "step": 119, "train_speed(iter/s)": 0.010751 }, { "epoch": 0.418848167539267, "grad_norm": 5.966183185577393, "learning_rate": 0.00019562734446596162, "logits/chosen": -0.36912596225738525, "logits/rejected": -0.4693865478038788, "logps/chosen": -7.145996570587158, "logps/rejected": -37.43076705932617, "loss": 0.9455270767211914, "memory(GiB)": 39.42, "nll_loss": 0.48743128776550293, "rewards/accuracies": 0.8125, "rewards/chosen": -0.13650617003440857, "rewards/margins": 2.0651345252990723, "rewards/rejected": -2.2016406059265137, "step": 120, "train_speed(iter/s)": 0.010752 }, { "epoch": 0.4223385689354276, "grad_norm": 6.053987979888916, "learning_rate": 0.00019551389386356443, "logits/chosen": -0.35416483879089355, "logits/rejected": -0.4060932993888855, "logps/chosen": -11.305073738098145, "logps/rejected": -39.34588623046875, "loss": 1.0363645553588867, "memory(GiB)": 39.42, "nll_loss": 0.7409172058105469, "rewards/accuracies": 0.8125, "rewards/chosen": -0.3775523602962494, "rewards/margins": 2.277557611465454, "rewards/rejected": -2.6551101207733154, "step": 121, "train_speed(iter/s)": 0.010752 }, { "epoch": 0.4258289703315881, "grad_norm": 3.908426523208618, "learning_rate": 0.0001953990240384942, "logits/chosen": -0.2593086361885071, "logits/rejected": -0.45180562138557434, "logps/chosen": -7.346467018127441, "logps/rejected": -48.82087326049805, "loss": 0.7506681680679321, "memory(GiB)": 39.42, "nll_loss": 0.5086178779602051, "rewards/accuracies": 0.875, "rewards/chosen": 0.042671557515859604, "rewards/margins": 2.6901655197143555, "rewards/rejected": -2.647494077682495, "step": 122, "train_speed(iter/s)": 0.010752 }, { "epoch": 0.4293193717277487, "grad_norm": 10.322138786315918, "learning_rate": 0.00019528273669757972, "logits/chosen": -0.35214099287986755, "logits/rejected": -0.4367164373397827, "logps/chosen": -8.127342224121094, "logps/rejected": -38.454200744628906, "loss": 0.8126936554908752, "memory(GiB)": 39.42, "nll_loss": 0.5385327935218811, "rewards/accuracies": 0.84375, "rewards/chosen": 0.10964661836624146, "rewards/margins": 2.599274158477783, "rewards/rejected": -2.4896275997161865, "step": 123, "train_speed(iter/s)": 0.010752 }, { "epoch": 0.4328097731239092, "grad_norm": 5.38076114654541, "learning_rate": 0.00019516503356871234, "logits/chosen": -0.2883262634277344, "logits/rejected": -0.32226479053497314, "logps/chosen": -11.945974349975586, "logps/rejected": -43.99768829345703, "loss": 0.8885233998298645, "memory(GiB)": 39.42, "nll_loss": 0.5691980123519897, "rewards/accuracies": 0.84375, "rewards/chosen": -0.22344030439853668, "rewards/margins": 2.4954993724823, "rewards/rejected": -2.718939781188965, "step": 124, "train_speed(iter/s)": 0.010752 }, { "epoch": 0.4363001745200698, "grad_norm": 3.945094347000122, "learning_rate": 0.00019504591640082035, "logits/chosen": -0.3206433653831482, "logits/rejected": -0.3835434913635254, "logps/chosen": -9.910886764526367, "logps/rejected": -37.540409088134766, "loss": 0.8022382855415344, "memory(GiB)": 39.42, "nll_loss": 0.5557839870452881, "rewards/accuracies": 0.90625, "rewards/chosen": -0.04477905482053757, "rewards/margins": 2.5910792350769043, "rewards/rejected": -2.6358585357666016, "step": 125, "train_speed(iter/s)": 0.010753 }, { "epoch": 0.4397905759162304, "grad_norm": 4.2087531089782715, "learning_rate": 0.0001949253869638429, "logits/chosen": -0.28855112195014954, "logits/rejected": -0.3965805768966675, "logps/chosen": -2.8932034969329834, "logps/rejected": -33.3571662902832, "loss": 0.48199671506881714, "memory(GiB)": 39.42, "nll_loss": 0.2255885899066925, "rewards/accuracies": 0.9375, "rewards/chosen": 0.10981371998786926, "rewards/margins": 2.0570077896118164, "rewards/rejected": -1.9471940994262695, "step": 126, "train_speed(iter/s)": 0.010753 }, { "epoch": 0.4432809773123909, "grad_norm": 3.723099946975708, "learning_rate": 0.00019480344704870387, "logits/chosen": -0.4086211025714874, "logits/rejected": -0.4154241383075714, "logps/chosen": -11.32919692993164, "logps/rejected": -25.829769134521484, "loss": 1.3574812412261963, "memory(GiB)": 39.42, "nll_loss": 0.8371793627738953, "rewards/accuracies": 0.6875, "rewards/chosen": -0.18372564017772675, "rewards/margins": 1.1997389793395996, "rewards/rejected": -1.3834646940231323, "step": 127, "train_speed(iter/s)": 0.010754 }, { "epoch": 0.4467713787085515, "grad_norm": 3.090599775314331, "learning_rate": 0.00019468009846728513, "logits/chosen": -0.3228675127029419, "logits/rejected": -0.4174826741218567, "logps/chosen": -5.812500476837158, "logps/rejected": -34.774322509765625, "loss": 0.6064198017120361, "memory(GiB)": 39.42, "nll_loss": 0.3521398603916168, "rewards/accuracies": 0.9375, "rewards/chosen": 0.049313537776470184, "rewards/margins": 2.06463623046875, "rewards/rejected": -2.0153229236602783, "step": 128, "train_speed(iter/s)": 0.010755 }, { "epoch": 0.450261780104712, "grad_norm": 2.82310152053833, "learning_rate": 0.00019455534305239965, "logits/chosen": -0.3688339293003082, "logits/rejected": -0.3691863417625427, "logps/chosen": -10.617326736450195, "logps/rejected": -23.13429832458496, "loss": 0.9776577949523926, "memory(GiB)": 39.42, "nll_loss": 0.5499588251113892, "rewards/accuracies": 0.8125, "rewards/chosen": 0.03131576254963875, "rewards/margins": 1.1372824907302856, "rewards/rejected": -1.1059668064117432, "step": 129, "train_speed(iter/s)": 0.010755 }, { "epoch": 0.4537521815008726, "grad_norm": 2.351433038711548, "learning_rate": 0.00019442918265776422, "logits/chosen": -0.3329261839389801, "logits/rejected": -0.36310911178588867, "logps/chosen": -13.333334922790527, "logps/rejected": -23.961681365966797, "loss": 0.8306537866592407, "memory(GiB)": 39.42, "nll_loss": 0.5025785565376282, "rewards/accuracies": 0.90625, "rewards/chosen": 0.04980917274951935, "rewards/margins": 1.3957810401916504, "rewards/rejected": -1.3459720611572266, "step": 130, "train_speed(iter/s)": 0.010755 }, { "epoch": 0.4572425828970332, "grad_norm": 2.437668561935425, "learning_rate": 0.00019430161915797207, "logits/chosen": -0.3711564540863037, "logits/rejected": -0.40104660391807556, "logps/chosen": -4.970005512237549, "logps/rejected": -25.718761444091797, "loss": 0.6583466529846191, "memory(GiB)": 39.42, "nll_loss": 0.32833656668663025, "rewards/accuracies": 0.84375, "rewards/chosen": 0.15192265808582306, "rewards/margins": 1.5051937103271484, "rewards/rejected": -1.3532708883285522, "step": 131, "train_speed(iter/s)": 0.010756 }, { "epoch": 0.4607329842931937, "grad_norm": 2.258094310760498, "learning_rate": 0.00019417265444846476, "logits/chosen": -0.2738487422466278, "logits/rejected": -0.4087858200073242, "logps/chosen": -7.829878330230713, "logps/rejected": -34.82905578613281, "loss": 0.7665334343910217, "memory(GiB)": 39.42, "nll_loss": 0.5376078486442566, "rewards/accuracies": 0.90625, "rewards/chosen": 0.25566646456718445, "rewards/margins": 2.1234703063964844, "rewards/rejected": -1.8678035736083984, "step": 132, "train_speed(iter/s)": 0.010756 }, { "epoch": 0.4642233856893543, "grad_norm": 2.1597509384155273, "learning_rate": 0.00019404229044550433, "logits/chosen": -0.33906158804893494, "logits/rejected": -0.4303910434246063, "logps/chosen": -4.8524885177612305, "logps/rejected": -30.576656341552734, "loss": 0.7118875980377197, "memory(GiB)": 39.42, "nll_loss": 0.4106830060482025, "rewards/accuracies": 0.90625, "rewards/chosen": 0.17056593298912048, "rewards/margins": 1.768500804901123, "rewards/rejected": -1.5979350805282593, "step": 133, "train_speed(iter/s)": 0.010757 }, { "epoch": 0.4677137870855148, "grad_norm": 4.846266269683838, "learning_rate": 0.0001939105290861445, "logits/chosen": -0.1988743394613266, "logits/rejected": -0.41542911529541016, "logps/chosen": -7.35241174697876, "logps/rejected": -47.594486236572266, "loss": 0.8350856304168701, "memory(GiB)": 39.42, "nll_loss": 0.551296055316925, "rewards/accuracies": 0.90625, "rewards/chosen": 0.09475097805261612, "rewards/margins": 2.521266222000122, "rewards/rejected": -2.4265151023864746, "step": 134, "train_speed(iter/s)": 0.010757 }, { "epoch": 0.4712041884816754, "grad_norm": 2.220877170562744, "learning_rate": 0.00019377737232820208, "logits/chosen": -0.2817349433898926, "logits/rejected": -0.3702714443206787, "logps/chosen": -7.847001552581787, "logps/rejected": -44.94153594970703, "loss": 0.6441789269447327, "memory(GiB)": 39.42, "nll_loss": 0.44079264998435974, "rewards/accuracies": 0.90625, "rewards/chosen": 0.16393792629241943, "rewards/margins": 2.845656394958496, "rewards/rejected": -2.681718587875366, "step": 135, "train_speed(iter/s)": 0.010757 }, { "epoch": 0.47469458987783597, "grad_norm": 2.1187074184417725, "learning_rate": 0.00019364282215022786, "logits/chosen": -0.28489771485328674, "logits/rejected": -0.37565189599990845, "logps/chosen": -5.1259026527404785, "logps/rejected": -39.07181930541992, "loss": 0.5232971906661987, "memory(GiB)": 39.42, "nll_loss": 0.31729230284690857, "rewards/accuracies": 0.90625, "rewards/chosen": 0.14290614426136017, "rewards/margins": 2.855766773223877, "rewards/rejected": -2.712860345840454, "step": 136, "train_speed(iter/s)": 0.010757 }, { "epoch": 0.4781849912739965, "grad_norm": 4.652167320251465, "learning_rate": 0.00019350688055147725, "logits/chosen": -0.2049810290336609, "logits/rejected": -0.35532209277153015, "logps/chosen": -8.197148323059082, "logps/rejected": -50.812965393066406, "loss": 0.5982136130332947, "memory(GiB)": 39.42, "nll_loss": 0.3783411979675293, "rewards/accuracies": 0.9375, "rewards/chosen": 0.036504216492176056, "rewards/margins": 3.0081937313079834, "rewards/rejected": -2.9716897010803223, "step": 137, "train_speed(iter/s)": 0.010757 }, { "epoch": 0.4816753926701571, "grad_norm": 1.6813859939575195, "learning_rate": 0.0001933695495518804, "logits/chosen": -0.15937744081020355, "logits/rejected": -0.36899077892303467, "logps/chosen": -5.227466106414795, "logps/rejected": -57.80689239501953, "loss": 0.4328049421310425, "memory(GiB)": 39.42, "nll_loss": 0.3204546272754669, "rewards/accuracies": 1.0, "rewards/chosen": 0.08378630876541138, "rewards/margins": 3.9659409523010254, "rewards/rejected": -3.882154703140259, "step": 138, "train_speed(iter/s)": 0.010757 }, { "epoch": 0.4851657940663176, "grad_norm": 1.7590577602386475, "learning_rate": 0.00019323083119201235, "logits/chosen": -0.21911956369876862, "logits/rejected": -0.3360063135623932, "logps/chosen": -10.714500427246094, "logps/rejected": -44.478004455566406, "loss": 0.6973531246185303, "memory(GiB)": 39.42, "nll_loss": 0.5391013622283936, "rewards/accuracies": 0.96875, "rewards/chosen": 0.15974897146224976, "rewards/margins": 3.1409525871276855, "rewards/rejected": -2.981203556060791, "step": 139, "train_speed(iter/s)": 0.010757 }, { "epoch": 0.4886561954624782, "grad_norm": 4.423391342163086, "learning_rate": 0.0001930907275330627, "logits/chosen": -0.21830472350120544, "logits/rejected": -0.41240787506103516, "logps/chosen": -6.044207572937012, "logps/rejected": -47.71708679199219, "loss": 0.7773061990737915, "memory(GiB)": 39.42, "nll_loss": 0.4624183773994446, "rewards/accuracies": 0.78125, "rewards/chosen": -0.08216652274131775, "rewards/margins": 2.775662422180176, "rewards/rejected": -2.8578288555145264, "step": 140, "train_speed(iter/s)": 0.010757 }, { "epoch": 0.49214659685863876, "grad_norm": 5.617547988891602, "learning_rate": 0.00019294924065680488, "logits/chosen": -0.3345920145511627, "logits/rejected": -0.4564991593360901, "logps/chosen": -4.883607387542725, "logps/rejected": -50.870941162109375, "loss": 0.49507585167884827, "memory(GiB)": 39.42, "nll_loss": 0.3347318768501282, "rewards/accuracies": 0.90625, "rewards/chosen": 0.0749196857213974, "rewards/margins": 3.8949146270751953, "rewards/rejected": -3.819995164871216, "step": 141, "train_speed(iter/s)": 0.010758 }, { "epoch": 0.4956369982547993, "grad_norm": 6.824800491333008, "learning_rate": 0.00019280637266556533, "logits/chosen": -0.255269318819046, "logits/rejected": -0.38520547747612, "logps/chosen": -6.951573371887207, "logps/rejected": -43.31431579589844, "loss": 0.8777123689651489, "memory(GiB)": 39.42, "nll_loss": 0.6212184429168701, "rewards/accuracies": 0.875, "rewards/chosen": 0.1106327623128891, "rewards/margins": 3.119386672973633, "rewards/rejected": -3.008753538131714, "step": 142, "train_speed(iter/s)": 0.010758 }, { "epoch": 0.49912739965095987, "grad_norm": 3.7692058086395264, "learning_rate": 0.0001926621256821922, "logits/chosen": -0.15499627590179443, "logits/rejected": -0.30336061120033264, "logps/chosen": -11.738297462463379, "logps/rejected": -56.02423095703125, "loss": 0.7617011070251465, "memory(GiB)": 39.42, "nll_loss": 0.5688201189041138, "rewards/accuracies": 0.9375, "rewards/chosen": -0.04947775602340698, "rewards/margins": 3.5284841060638428, "rewards/rejected": -3.5779623985290527, "step": 143, "train_speed(iter/s)": 0.010758 }, { "epoch": 0.5026178010471204, "grad_norm": 2.1459271907806396, "learning_rate": 0.0001925165018500238, "logits/chosen": -0.21587318181991577, "logits/rejected": -0.3930494487285614, "logps/chosen": -9.389811515808105, "logps/rejected": -52.38633728027344, "loss": 0.6086324453353882, "memory(GiB)": 39.42, "nll_loss": 0.4416413903236389, "rewards/accuracies": 0.9375, "rewards/chosen": 0.32234904170036316, "rewards/margins": 3.8869223594665527, "rewards/rejected": -3.5645735263824463, "step": 144, "train_speed(iter/s)": 0.010758 }, { "epoch": 0.506108202443281, "grad_norm": 5.556336402893066, "learning_rate": 0.00019236950333285683, "logits/chosen": -0.2211378514766693, "logits/rejected": -0.3483867645263672, "logps/chosen": -8.280564308166504, "logps/rejected": -51.631282806396484, "loss": 0.7348828315734863, "memory(GiB)": 39.42, "nll_loss": 0.48733851313591003, "rewards/accuracies": 0.875, "rewards/chosen": -0.00019693002104759216, "rewards/margins": 3.514716148376465, "rewards/rejected": -3.514913320541382, "step": 145, "train_speed(iter/s)": 0.010758 }, { "epoch": 0.5095986038394416, "grad_norm": 2.229085683822632, "learning_rate": 0.00019222113231491409, "logits/chosen": -0.2527725100517273, "logits/rejected": -0.41788095235824585, "logps/chosen": -10.011974334716797, "logps/rejected": -52.808170318603516, "loss": 0.7164273858070374, "memory(GiB)": 39.42, "nll_loss": 0.5022612810134888, "rewards/accuracies": 0.9375, "rewards/chosen": 0.3206445574760437, "rewards/margins": 3.888902425765991, "rewards/rejected": -3.568258285522461, "step": 146, "train_speed(iter/s)": 0.010758 }, { "epoch": 0.5130890052356021, "grad_norm": 7.876246452331543, "learning_rate": 0.00019207139100081212, "logits/chosen": -0.19432660937309265, "logits/rejected": -0.33527010679244995, "logps/chosen": -7.427047252655029, "logps/rejected": -53.75447082519531, "loss": 0.760964035987854, "memory(GiB)": 39.42, "nll_loss": 0.5109995007514954, "rewards/accuracies": 0.875, "rewards/chosen": -0.08073252439498901, "rewards/margins": 3.443918228149414, "rewards/rejected": -3.524650812149048, "step": 147, "train_speed(iter/s)": 0.010757 }, { "epoch": 0.5165794066317626, "grad_norm": 4.659561634063721, "learning_rate": 0.00019192028161552847, "logits/chosen": -0.18484185636043549, "logits/rejected": -0.39253929257392883, "logps/chosen": -8.587300300598145, "logps/rejected": -52.95454788208008, "loss": 0.7159382104873657, "memory(GiB)": 39.42, "nll_loss": 0.5496724247932434, "rewards/accuracies": 0.9375, "rewards/chosen": 0.18269562721252441, "rewards/margins": 3.7814650535583496, "rewards/rejected": -3.598769187927246, "step": 148, "train_speed(iter/s)": 0.010757 }, { "epoch": 0.5200698080279232, "grad_norm": 3.1019811630249023, "learning_rate": 0.0001917678064043686, "logits/chosen": -0.27576160430908203, "logits/rejected": -0.4377831816673279, "logps/chosen": -5.784604549407959, "logps/rejected": -52.2569580078125, "loss": 0.6684166193008423, "memory(GiB)": 39.42, "nll_loss": 0.4899623990058899, "rewards/accuracies": 0.9375, "rewards/chosen": 0.07499371469020844, "rewards/margins": 3.7692465782165527, "rewards/rejected": -3.6942529678344727, "step": 149, "train_speed(iter/s)": 0.010757 }, { "epoch": 0.5235602094240838, "grad_norm": 5.6313676834106445, "learning_rate": 0.00019161396763293253, "logits/chosen": -0.24116772413253784, "logits/rejected": -0.4378838539123535, "logps/chosen": -8.672993659973145, "logps/rejected": -52.83271026611328, "loss": 0.9051390290260315, "memory(GiB)": 39.42, "nll_loss": 0.5615367889404297, "rewards/accuracies": 0.875, "rewards/chosen": -0.022281643003225327, "rewards/margins": 3.423705816268921, "rewards/rejected": -3.4459874629974365, "step": 150, "train_speed(iter/s)": 0.010757 }, { "epoch": 0.5270506108202443, "grad_norm": 30.42255973815918, "learning_rate": 0.00019145876758708106, "logits/chosen": -0.23821839690208435, "logits/rejected": -0.48250508308410645, "logps/chosen": -5.898958683013916, "logps/rejected": -51.13921356201172, "loss": 1.0185292959213257, "memory(GiB)": 39.42, "nll_loss": 0.6116878986358643, "rewards/accuracies": 0.78125, "rewards/chosen": -0.1395014375448227, "rewards/margins": 3.174698829650879, "rewards/rejected": -3.3142004013061523, "step": 151, "train_speed(iter/s)": 0.010757 }, { "epoch": 0.5305410122164049, "grad_norm": 3.989668369293213, "learning_rate": 0.00019130220857290202, "logits/chosen": -0.2887514531612396, "logits/rejected": -0.4765075743198395, "logps/chosen": -9.17143726348877, "logps/rejected": -41.9118766784668, "loss": 1.0394952297210693, "memory(GiB)": 39.42, "nll_loss": 0.7010207772254944, "rewards/accuracies": 0.90625, "rewards/chosen": 0.1842147558927536, "rewards/margins": 2.678420066833496, "rewards/rejected": -2.4942049980163574, "step": 152, "train_speed(iter/s)": 0.010757 }, { "epoch": 0.5340314136125655, "grad_norm": 3.6354000568389893, "learning_rate": 0.00019114429291667583, "logits/chosen": -0.3704184889793396, "logits/rejected": -0.44566863775253296, "logps/chosen": -13.917726516723633, "logps/rejected": -36.536293029785156, "loss": 0.9129284620285034, "memory(GiB)": 39.42, "nll_loss": 0.6521165370941162, "rewards/accuracies": 0.9375, "rewards/chosen": 0.30949151515960693, "rewards/margins": 3.0189402103424072, "rewards/rejected": -2.70944881439209, "step": 153, "train_speed(iter/s)": 0.010757 }, { "epoch": 0.537521815008726, "grad_norm": 3.1834535598754883, "learning_rate": 0.000190985022964841, "logits/chosen": -0.36771464347839355, "logits/rejected": -0.48058295249938965, "logps/chosen": -4.574065685272217, "logps/rejected": -36.14601135253906, "loss": 0.646094024181366, "memory(GiB)": 39.42, "nll_loss": 0.40117186307907104, "rewards/accuracies": 0.875, "rewards/chosen": 0.26323747634887695, "rewards/margins": 2.6909196376800537, "rewards/rejected": -2.4276821613311768, "step": 154, "train_speed(iter/s)": 0.010758 }, { "epoch": 0.5410122164048866, "grad_norm": 4.318117141723633, "learning_rate": 0.0001908244010839593, "logits/chosen": -0.3432493805885315, "logits/rejected": -0.47267085313796997, "logps/chosen": -6.45510196685791, "logps/rejected": -37.24266815185547, "loss": 0.6357433795928955, "memory(GiB)": 39.42, "nll_loss": 0.35821908712387085, "rewards/accuracies": 0.90625, "rewards/chosen": 0.1637301743030548, "rewards/margins": 2.375438690185547, "rewards/rejected": -2.2117085456848145, "step": 155, "train_speed(iter/s)": 0.010758 }, { "epoch": 0.5445026178010471, "grad_norm": 3.158153772354126, "learning_rate": 0.00019066242966068054, "logits/chosen": -0.43242546916007996, "logits/rejected": -0.47301432490348816, "logps/chosen": -9.04937744140625, "logps/rejected": -33.77018356323242, "loss": 0.8393766283988953, "memory(GiB)": 39.42, "nll_loss": 0.5358401536941528, "rewards/accuracies": 0.90625, "rewards/chosen": 0.1126929298043251, "rewards/margins": 2.264133930206299, "rewards/rejected": -2.1514410972595215, "step": 156, "train_speed(iter/s)": 0.010758 }, { "epoch": 0.5479930191972077, "grad_norm": 4.308590888977051, "learning_rate": 0.00019049911110170705, "logits/chosen": -0.3886866867542267, "logits/rejected": -0.4790132939815521, "logps/chosen": -9.111655235290527, "logps/rejected": -36.21464538574219, "loss": 0.8003115057945251, "memory(GiB)": 39.42, "nll_loss": 0.4989633858203888, "rewards/accuracies": 0.90625, "rewards/chosen": -0.07737411558628082, "rewards/margins": 2.306735038757324, "rewards/rejected": -2.3841090202331543, "step": 157, "train_speed(iter/s)": 0.010758 }, { "epoch": 0.5514834205933682, "grad_norm": 7.6933746337890625, "learning_rate": 0.00019033444783375804, "logits/chosen": -0.34298592805862427, "logits/rejected": -0.4637518525123596, "logps/chosen": -8.123557090759277, "logps/rejected": -50.31752014160156, "loss": 0.6172691583633423, "memory(GiB)": 39.42, "nll_loss": 0.40251481533050537, "rewards/accuracies": 0.875, "rewards/chosen": 0.028386808931827545, "rewards/margins": 3.503352403640747, "rewards/rejected": -3.4749653339385986, "step": 158, "train_speed(iter/s)": 0.010758 }, { "epoch": 0.5549738219895288, "grad_norm": 7.182351112365723, "learning_rate": 0.00019016844230353356, "logits/chosen": -0.3422991633415222, "logits/rejected": -0.42033761739730835, "logps/chosen": -8.310185432434082, "logps/rejected": -43.29906463623047, "loss": 0.7140598893165588, "memory(GiB)": 39.42, "nll_loss": 0.3994865417480469, "rewards/accuracies": 0.84375, "rewards/chosen": -0.060791049152612686, "rewards/margins": 2.747554302215576, "rewards/rejected": -2.808345079421997, "step": 159, "train_speed(iter/s)": 0.010758 }, { "epoch": 0.5584642233856894, "grad_norm": 2.537100076675415, "learning_rate": 0.00019000109697767798, "logits/chosen": -0.3541107475757599, "logits/rejected": -0.44592800736427307, "logps/chosen": -7.220765590667725, "logps/rejected": -36.86073684692383, "loss": 0.6231136918067932, "memory(GiB)": 39.42, "nll_loss": 0.3817756175994873, "rewards/accuracies": 0.96875, "rewards/chosen": 0.14087501168251038, "rewards/margins": 2.464402198791504, "rewards/rejected": -2.3235268592834473, "step": 160, "train_speed(iter/s)": 0.010758 }, { "epoch": 0.5619546247818499, "grad_norm": 5.032235145568848, "learning_rate": 0.00018983241434274351, "logits/chosen": -0.3592570722103119, "logits/rejected": -0.4694417417049408, "logps/chosen": -8.956731796264648, "logps/rejected": -36.53116989135742, "loss": 0.8788279294967651, "memory(GiB)": 39.42, "nll_loss": 0.5014119744300842, "rewards/accuracies": 0.84375, "rewards/chosen": 0.02851598709821701, "rewards/margins": 2.0984349250793457, "rewards/rejected": -2.0699188709259033, "step": 161, "train_speed(iter/s)": 0.010758 }, { "epoch": 0.5654450261780105, "grad_norm": 2.1505980491638184, "learning_rate": 0.00018966239690515309, "logits/chosen": -0.40191835165023804, "logits/rejected": -0.511231541633606, "logps/chosen": -8.61328125, "logps/rejected": -42.80579376220703, "loss": 0.650855302810669, "memory(GiB)": 39.42, "nll_loss": 0.3947713077068329, "rewards/accuracies": 0.84375, "rewards/chosen": 0.1195174977183342, "rewards/margins": 2.9840264320373535, "rewards/rejected": -2.864508628845215, "step": 162, "train_speed(iter/s)": 0.010759 }, { "epoch": 0.568935427574171, "grad_norm": 2.0593886375427246, "learning_rate": 0.00018949104719116332, "logits/chosen": -0.36368370056152344, "logits/rejected": -0.4502822458744049, "logps/chosen": -6.056973934173584, "logps/rejected": -42.781681060791016, "loss": 0.5314807891845703, "memory(GiB)": 39.42, "nll_loss": 0.31094634532928467, "rewards/accuracies": 0.9375, "rewards/chosen": 0.14926032721996307, "rewards/margins": 2.994180202484131, "rewards/rejected": -2.8449201583862305, "step": 163, "train_speed(iter/s)": 0.010759 }, { "epoch": 0.5724258289703316, "grad_norm": 3.314478635787964, "learning_rate": 0.00018931836774682687, "logits/chosen": -0.4336795210838318, "logits/rejected": -0.4525458812713623, "logps/chosen": -7.387899875640869, "logps/rejected": -32.55196762084961, "loss": 0.7532250285148621, "memory(GiB)": 39.42, "nll_loss": 0.37785154581069946, "rewards/accuracies": 0.75, "rewards/chosen": 0.06012080982327461, "rewards/margins": 2.1696441173553467, "rewards/rejected": -2.109523296356201, "step": 164, "train_speed(iter/s)": 0.010759 }, { "epoch": 0.5759162303664922, "grad_norm": 3.4192256927490234, "learning_rate": 0.00018914436113795448, "logits/chosen": -0.2911241948604584, "logits/rejected": -0.4634595513343811, "logps/chosen": -7.420339584350586, "logps/rejected": -39.048561096191406, "loss": 0.8260236978530884, "memory(GiB)": 39.42, "nll_loss": 0.5035777688026428, "rewards/accuracies": 0.84375, "rewards/chosen": 0.03999996930360794, "rewards/margins": 2.3207309246063232, "rewards/rejected": -2.280730724334717, "step": 165, "train_speed(iter/s)": 0.010759 }, { "epoch": 0.5794066317626527, "grad_norm": 4.191897392272949, "learning_rate": 0.0001889690299500771, "logits/chosen": -0.32450249791145325, "logits/rejected": -0.4613388776779175, "logps/chosen": -9.48214340209961, "logps/rejected": -39.381065368652344, "loss": 0.8530201315879822, "memory(GiB)": 39.42, "nll_loss": 0.59242844581604, "rewards/accuracies": 0.90625, "rewards/chosen": 0.08060712367296219, "rewards/margins": 2.242609977722168, "rewards/rejected": -2.1620030403137207, "step": 166, "train_speed(iter/s)": 0.010759 }, { "epoch": 0.5828970331588132, "grad_norm": 2.7431366443634033, "learning_rate": 0.0001887923767884073, "logits/chosen": -0.3079373836517334, "logits/rejected": -0.44786494970321655, "logps/chosen": -5.737804412841797, "logps/rejected": -36.809600830078125, "loss": 0.6614618301391602, "memory(GiB)": 39.42, "nll_loss": 0.4013901352882385, "rewards/accuracies": 0.9375, "rewards/chosen": 0.3159565329551697, "rewards/margins": 2.179208755493164, "rewards/rejected": -1.8632525205612183, "step": 167, "train_speed(iter/s)": 0.010759 }, { "epoch": 0.5863874345549738, "grad_norm": 3.6514716148376465, "learning_rate": 0.0001886144042778006, "logits/chosen": -0.39408621191978455, "logits/rejected": -0.43902865052223206, "logps/chosen": -9.832802772521973, "logps/rejected": -41.6961784362793, "loss": 0.7166361212730408, "memory(GiB)": 39.42, "nll_loss": 0.490989625453949, "rewards/accuracies": 0.9375, "rewards/chosen": 0.17612463235855103, "rewards/margins": 2.8474600315093994, "rewards/rejected": -2.671335458755493, "step": 168, "train_speed(iter/s)": 0.010759 }, { "epoch": 0.5898778359511344, "grad_norm": 3.6428065299987793, "learning_rate": 0.00018843511506271644, "logits/chosen": -0.4216082990169525, "logits/rejected": -0.44014686346054077, "logps/chosen": -8.206501960754395, "logps/rejected": -32.93410873413086, "loss": 0.7580087780952454, "memory(GiB)": 39.42, "nll_loss": 0.4095152020454407, "rewards/accuracies": 0.84375, "rewards/chosen": 0.0056315031833946705, "rewards/margins": 2.0248444080352783, "rewards/rejected": -2.0192127227783203, "step": 169, "train_speed(iter/s)": 0.010759 }, { "epoch": 0.5933682373472949, "grad_norm": 3.8498518466949463, "learning_rate": 0.00018825451180717905, "logits/chosen": -0.3026273846626282, "logits/rejected": -0.5032517910003662, "logps/chosen": -10.3818941116333, "logps/rejected": -51.91915512084961, "loss": 1.0770937204360962, "memory(GiB)": 39.42, "nll_loss": 0.713114857673645, "rewards/accuracies": 0.875, "rewards/chosen": -0.18697917461395264, "rewards/margins": 2.874116897583008, "rewards/rejected": -3.061095952987671, "step": 170, "train_speed(iter/s)": 0.010759 }, { "epoch": 0.5968586387434555, "grad_norm": 1.5238920450210571, "learning_rate": 0.00018807259719473757, "logits/chosen": -0.3206470012664795, "logits/rejected": -0.46274593472480774, "logps/chosen": -4.761229515075684, "logps/rejected": -47.91825866699219, "loss": 0.5495983362197876, "memory(GiB)": 39.42, "nll_loss": 0.3658239543437958, "rewards/accuracies": 0.96875, "rewards/chosen": 0.14044716954231262, "rewards/margins": 3.341961145401001, "rewards/rejected": -3.2015140056610107, "step": 171, "train_speed(iter/s)": 0.010759 }, { "epoch": 0.6003490401396161, "grad_norm": 2.570446252822876, "learning_rate": 0.00018788937392842647, "logits/chosen": -0.2903798520565033, "logits/rejected": -0.4074512720108032, "logps/chosen": -5.276430130004883, "logps/rejected": -48.5122184753418, "loss": 0.5867538452148438, "memory(GiB)": 39.42, "nll_loss": 0.34603506326675415, "rewards/accuracies": 0.90625, "rewards/chosen": 0.06058134138584137, "rewards/margins": 3.133744478225708, "rewards/rejected": -3.0731630325317383, "step": 172, "train_speed(iter/s)": 0.010759 }, { "epoch": 0.6038394415357766, "grad_norm": 3.918461799621582, "learning_rate": 0.0001877048447307252, "logits/chosen": -0.19242779910564423, "logits/rejected": -0.38455089926719666, "logps/chosen": -5.807734489440918, "logps/rejected": -52.73225784301758, "loss": 0.6217489838600159, "memory(GiB)": 39.42, "nll_loss": 0.38360434770584106, "rewards/accuracies": 0.90625, "rewards/chosen": 0.12222804874181747, "rewards/margins": 3.3160438537597656, "rewards/rejected": -3.1938157081604004, "step": 173, "train_speed(iter/s)": 0.010759 }, { "epoch": 0.6073298429319371, "grad_norm": 4.870952129364014, "learning_rate": 0.00018751901234351773, "logits/chosen": -0.36845889687538147, "logits/rejected": -0.4809192717075348, "logps/chosen": -8.235760688781738, "logps/rejected": -36.360076904296875, "loss": 0.8248316645622253, "memory(GiB)": 39.42, "nll_loss": 0.6022232174873352, "rewards/accuracies": 1.0, "rewards/chosen": 0.3026849031448364, "rewards/margins": 2.4412600994110107, "rewards/rejected": -2.1385750770568848, "step": 174, "train_speed(iter/s)": 0.010759 }, { "epoch": 0.6108202443280978, "grad_norm": 2.2720422744750977, "learning_rate": 0.00018733187952805203, "logits/chosen": -0.3710225522518158, "logits/rejected": -0.436270534992218, "logps/chosen": -6.721004009246826, "logps/rejected": -34.718502044677734, "loss": 0.709654688835144, "memory(GiB)": 39.42, "nll_loss": 0.452656626701355, "rewards/accuracies": 0.90625, "rewards/chosen": 0.06426668912172318, "rewards/margins": 2.3792333602905273, "rewards/rejected": -2.3149666786193848, "step": 175, "train_speed(iter/s)": 0.010759 }, { "epoch": 0.6143106457242583, "grad_norm": 3.7245795726776123, "learning_rate": 0.00018714344906489876, "logits/chosen": -0.4186531901359558, "logits/rejected": -0.43767866492271423, "logps/chosen": -9.161328315734863, "logps/rejected": -32.324134826660156, "loss": 0.7417446970939636, "memory(GiB)": 39.42, "nll_loss": 0.44037187099456787, "rewards/accuracies": 0.9375, "rewards/chosen": 0.13668972253799438, "rewards/margins": 2.1546599864959717, "rewards/rejected": -2.017970085144043, "step": 176, "train_speed(iter/s)": 0.01076 }, { "epoch": 0.6178010471204188, "grad_norm": 4.3425469398498535, "learning_rate": 0.00018695372375391014, "logits/chosen": -0.2733748257160187, "logits/rejected": -0.44424253702163696, "logps/chosen": -8.758390426635742, "logps/rejected": -50.36033630371094, "loss": 0.8111291527748108, "memory(GiB)": 39.42, "nll_loss": 0.4982152581214905, "rewards/accuracies": 0.8125, "rewards/chosen": -0.05674072727560997, "rewards/margins": 2.9798450469970703, "rewards/rejected": -3.036585807800293, "step": 177, "train_speed(iter/s)": 0.010759 }, { "epoch": 0.6212914485165794, "grad_norm": 3.7545742988586426, "learning_rate": 0.00018676270641417822, "logits/chosen": -0.2608646750450134, "logits/rejected": -0.4399104118347168, "logps/chosen": -9.50798225402832, "logps/rejected": -46.8238639831543, "loss": 0.86136394739151, "memory(GiB)": 39.42, "nll_loss": 0.6183493137359619, "rewards/accuracies": 0.875, "rewards/chosen": 0.07049836963415146, "rewards/margins": 3.0674405097961426, "rewards/rejected": -2.9969425201416016, "step": 178, "train_speed(iter/s)": 0.010759 }, { "epoch": 0.62478184991274, "grad_norm": 2.237074613571167, "learning_rate": 0.00018657039988399313, "logits/chosen": -0.29585880041122437, "logits/rejected": -0.44753074645996094, "logps/chosen": -11.109559059143066, "logps/rejected": -39.0783805847168, "loss": 0.9119770526885986, "memory(GiB)": 39.42, "nll_loss": 0.6092584133148193, "rewards/accuracies": 0.84375, "rewards/chosen": 0.1456558257341385, "rewards/margins": 2.451812505722046, "rewards/rejected": -2.306156873703003, "step": 179, "train_speed(iter/s)": 0.010759 }, { "epoch": 0.6282722513089005, "grad_norm": 2.476689577102661, "learning_rate": 0.00018637680702080083, "logits/chosen": -0.3464896082878113, "logits/rejected": -0.4352068305015564, "logps/chosen": -8.254376411437988, "logps/rejected": -35.282325744628906, "loss": 0.8010640740394592, "memory(GiB)": 39.42, "nll_loss": 0.4889823794364929, "rewards/accuracies": 0.875, "rewards/chosen": 0.008691787719726562, "rewards/margins": 2.055556058883667, "rewards/rejected": -2.0468640327453613, "step": 180, "train_speed(iter/s)": 0.010759 }, { "epoch": 0.631762652705061, "grad_norm": 2.8437464237213135, "learning_rate": 0.0001861819307011606, "logits/chosen": -0.2394547164440155, "logits/rejected": -0.4722561538219452, "logps/chosen": -3.5417962074279785, "logps/rejected": -64.08223724365234, "loss": 0.38956594467163086, "memory(GiB)": 39.42, "nll_loss": 0.25639209151268005, "rewards/accuracies": 0.9375, "rewards/chosen": 0.2628820538520813, "rewards/margins": 4.246987819671631, "rewards/rejected": -3.9841055870056152, "step": 181, "train_speed(iter/s)": 0.010759 }, { "epoch": 0.6352530541012217, "grad_norm": 2.4585416316986084, "learning_rate": 0.00018598577382070237, "logits/chosen": -0.31651991605758667, "logits/rejected": -0.45492100715637207, "logps/chosen": -4.335537910461426, "logps/rejected": -46.55557632446289, "loss": 0.5344107747077942, "memory(GiB)": 39.42, "nll_loss": 0.25841349363327026, "rewards/accuracies": 0.84375, "rewards/chosen": 0.044346973299980164, "rewards/margins": 3.0594677925109863, "rewards/rejected": -3.0151207447052, "step": 182, "train_speed(iter/s)": 0.01076 }, { "epoch": 0.6387434554973822, "grad_norm": 2.4348537921905518, "learning_rate": 0.0001857883392940837, "logits/chosen": -0.2961544990539551, "logits/rejected": -0.39695119857788086, "logps/chosen": -8.935890197753906, "logps/rejected": -40.11572265625, "loss": 0.7396747469902039, "memory(GiB)": 39.42, "nll_loss": 0.4514305889606476, "rewards/accuracies": 0.90625, "rewards/chosen": -0.09869125485420227, "rewards/margins": 2.4125261306762695, "rewards/rejected": -2.5112171173095703, "step": 183, "train_speed(iter/s)": 0.010759 }, { "epoch": 0.6422338568935427, "grad_norm": 1.7786816358566284, "learning_rate": 0.0001855896300549465, "logits/chosen": -0.2846543490886688, "logits/rejected": -0.4267013967037201, "logps/chosen": -9.809104919433594, "logps/rejected": -42.15507507324219, "loss": 0.7107999324798584, "memory(GiB)": 39.42, "nll_loss": 0.4528127908706665, "rewards/accuracies": 0.90625, "rewards/chosen": 0.12454140186309814, "rewards/margins": 2.582566976547241, "rewards/rejected": -2.4580256938934326, "step": 184, "train_speed(iter/s)": 0.010759 }, { "epoch": 0.6457242582897034, "grad_norm": 2.2489097118377686, "learning_rate": 0.00018538964905587325, "logits/chosen": -0.269091933965683, "logits/rejected": -0.42950770258903503, "logps/chosen": -5.967182159423828, "logps/rejected": -50.640193939208984, "loss": 0.49092888832092285, "memory(GiB)": 39.42, "nll_loss": 0.32368528842926025, "rewards/accuracies": 0.9375, "rewards/chosen": 0.08472105860710144, "rewards/margins": 3.3988823890686035, "rewards/rejected": -3.3141613006591797, "step": 185, "train_speed(iter/s)": 0.010759 }, { "epoch": 0.6492146596858639, "grad_norm": 2.9929044246673584, "learning_rate": 0.0001851883992683434, "logits/chosen": -0.3572680950164795, "logits/rejected": -0.4970206022262573, "logps/chosen": -5.416510105133057, "logps/rejected": -49.36286163330078, "loss": 0.6976485252380371, "memory(GiB)": 39.42, "nll_loss": 0.423793762922287, "rewards/accuracies": 0.84375, "rewards/chosen": 0.0580061599612236, "rewards/margins": 3.400108814239502, "rewards/rejected": -3.3421030044555664, "step": 186, "train_speed(iter/s)": 0.010759 }, { "epoch": 0.6527050610820244, "grad_norm": 4.574316501617432, "learning_rate": 0.00018498588368268907, "logits/chosen": -0.3062989413738251, "logits/rejected": -0.5117348432540894, "logps/chosen": -6.240719795227051, "logps/rejected": -48.549983978271484, "loss": 0.5926957130432129, "memory(GiB)": 39.42, "nll_loss": 0.40774649381637573, "rewards/accuracies": 1.0, "rewards/chosen": 0.2606131434440613, "rewards/margins": 3.447434186935425, "rewards/rejected": -3.1868209838867188, "step": 187, "train_speed(iter/s)": 0.010759 }, { "epoch": 0.6561954624781849, "grad_norm": 3.87235426902771, "learning_rate": 0.0001847821053080505, "logits/chosen": -0.19517812132835388, "logits/rejected": -0.3854786455631256, "logps/chosen": -6.145029544830322, "logps/rejected": -49.55529022216797, "loss": 0.5662611126899719, "memory(GiB)": 39.42, "nll_loss": 0.3513401746749878, "rewards/accuracies": 0.9375, "rewards/chosen": 0.07440924644470215, "rewards/margins": 3.343357563018799, "rewards/rejected": -3.268948554992676, "step": 188, "train_speed(iter/s)": 0.010759 }, { "epoch": 0.6596858638743456, "grad_norm": 2.1893322467803955, "learning_rate": 0.00018457706717233164, "logits/chosen": -0.31054210662841797, "logits/rejected": -0.49141132831573486, "logps/chosen": -6.330968379974365, "logps/rejected": -52.3120231628418, "loss": 0.6129257082939148, "memory(GiB)": 39.42, "nll_loss": 0.3919089436531067, "rewards/accuracies": 0.9375, "rewards/chosen": 0.09110119938850403, "rewards/margins": 3.511691093444824, "rewards/rejected": -3.4205901622772217, "step": 189, "train_speed(iter/s)": 0.010759 }, { "epoch": 0.6631762652705061, "grad_norm": 6.626704692840576, "learning_rate": 0.00018437077232215488, "logits/chosen": -0.19323404133319855, "logits/rejected": -0.44291025400161743, "logps/chosen": -5.826582431793213, "logps/rejected": -57.65163040161133, "loss": 0.5744651556015015, "memory(GiB)": 39.42, "nll_loss": 0.40510880947113037, "rewards/accuracies": 0.9375, "rewards/chosen": 0.14089857041835785, "rewards/margins": 4.094103813171387, "rewards/rejected": -3.953204870223999, "step": 190, "train_speed(iter/s)": 0.010759 }, { "epoch": 0.6666666666666666, "grad_norm": 3.4911742210388184, "learning_rate": 0.00018416322382281596, "logits/chosen": -0.33752942085266113, "logits/rejected": -0.4428948163986206, "logps/chosen": -8.038012504577637, "logps/rejected": -41.6568717956543, "loss": 0.8088080286979675, "memory(GiB)": 39.42, "nll_loss": 0.5819704532623291, "rewards/accuracies": 0.90625, "rewards/chosen": 0.10074374079704285, "rewards/margins": 3.1307780742645264, "rewards/rejected": -3.030034065246582, "step": 191, "train_speed(iter/s)": 0.010759 }, { "epoch": 0.6701570680628273, "grad_norm": 2.2780048847198486, "learning_rate": 0.0001839544247582383, "logits/chosen": -0.2744682729244232, "logits/rejected": -0.3990049362182617, "logps/chosen": -5.77654504776001, "logps/rejected": -49.46015167236328, "loss": 0.5131328105926514, "memory(GiB)": 39.42, "nll_loss": 0.3267570436000824, "rewards/accuracies": 0.9375, "rewards/chosen": 0.04739464819431305, "rewards/margins": 3.7212061882019043, "rewards/rejected": -3.673811674118042, "step": 192, "train_speed(iter/s)": 0.010759 }, { "epoch": 0.6736474694589878, "grad_norm": 2.1769142150878906, "learning_rate": 0.00018374437823092724, "logits/chosen": -0.22928477823734283, "logits/rejected": -0.4279863238334656, "logps/chosen": -4.774344444274902, "logps/rejected": -50.371253967285156, "loss": 0.5500450134277344, "memory(GiB)": 39.42, "nll_loss": 0.3786742091178894, "rewards/accuracies": 0.9375, "rewards/chosen": 0.1368112862110138, "rewards/margins": 3.6264164447784424, "rewards/rejected": -3.48960542678833, "step": 193, "train_speed(iter/s)": 0.010759 }, { "epoch": 0.6771378708551483, "grad_norm": 2.8660085201263428, "learning_rate": 0.00018353308736192395, "logits/chosen": -0.2577519714832306, "logits/rejected": -0.35627281665802, "logps/chosen": -8.359132766723633, "logps/rejected": -42.28339767456055, "loss": 0.7936825156211853, "memory(GiB)": 39.42, "nll_loss": 0.5378628969192505, "rewards/accuracies": 0.875, "rewards/chosen": 0.02582652121782303, "rewards/margins": 2.7675435543060303, "rewards/rejected": -2.7417168617248535, "step": 194, "train_speed(iter/s)": 0.010759 }, { "epoch": 0.680628272251309, "grad_norm": 4.319552898406982, "learning_rate": 0.000183320555290759, "logits/chosen": -0.2262856811285019, "logits/rejected": -0.44104352593421936, "logps/chosen": -5.736568927764893, "logps/rejected": -54.799659729003906, "loss": 0.6704956889152527, "memory(GiB)": 39.42, "nll_loss": 0.3680565059185028, "rewards/accuracies": 0.8125, "rewards/chosen": 0.14153015613555908, "rewards/margins": 3.8039064407348633, "rewards/rejected": -3.662376642227173, "step": 195, "train_speed(iter/s)": 0.010759 }, { "epoch": 0.6841186736474695, "grad_norm": 2.4287476539611816, "learning_rate": 0.0001831067851754058, "logits/chosen": -0.19324590265750885, "logits/rejected": -0.3578749895095825, "logps/chosen": -6.67017936706543, "logps/rejected": -52.006690979003906, "loss": 0.7265517115592957, "memory(GiB)": 39.42, "nll_loss": 0.4939360022544861, "rewards/accuracies": 0.90625, "rewards/chosen": 0.1414988934993744, "rewards/margins": 3.7974777221679688, "rewards/rejected": -3.6559786796569824, "step": 196, "train_speed(iter/s)": 0.010759 }, { "epoch": 0.68760907504363, "grad_norm": 4.368680000305176, "learning_rate": 0.00018289178019223362, "logits/chosen": -0.35040730237960815, "logits/rejected": -0.37726685404777527, "logps/chosen": -6.27101993560791, "logps/rejected": -35.45961380004883, "loss": 0.6579899191856384, "memory(GiB)": 39.42, "nll_loss": 0.35855987668037415, "rewards/accuracies": 0.875, "rewards/chosen": -0.014165613800287247, "rewards/margins": 2.6007533073425293, "rewards/rejected": -2.6149189472198486, "step": 197, "train_speed(iter/s)": 0.010759 }, { "epoch": 0.6910994764397905, "grad_norm": 2.2127246856689453, "learning_rate": 0.00018267554353596025, "logits/chosen": -0.18989573419094086, "logits/rejected": -0.3121846318244934, "logps/chosen": -9.079330444335938, "logps/rejected": -53.070701599121094, "loss": 0.6450351476669312, "memory(GiB)": 39.42, "nll_loss": 0.4518280029296875, "rewards/accuracies": 0.9375, "rewards/chosen": 0.07810258865356445, "rewards/margins": 3.928205966949463, "rewards/rejected": -3.8501036167144775, "step": 198, "train_speed(iter/s)": 0.01076 }, { "epoch": 0.6945898778359512, "grad_norm": 6.419010162353516, "learning_rate": 0.0001824580784196049, "logits/chosen": -0.15850739181041718, "logits/rejected": -0.3392256498336792, "logps/chosen": -4.089353561401367, "logps/rejected": -61.679054260253906, "loss": 0.3885970115661621, "memory(GiB)": 39.42, "nll_loss": 0.26330527663230896, "rewards/accuracies": 0.96875, "rewards/chosen": 0.06663137674331665, "rewards/margins": 4.802007675170898, "rewards/rejected": -4.735375881195068, "step": 199, "train_speed(iter/s)": 0.01076 }, { "epoch": 0.6980802792321117, "grad_norm": 24.48959732055664, "learning_rate": 0.00018223938807444012, "logits/chosen": -0.15304000675678253, "logits/rejected": -0.33186089992523193, "logps/chosen": -8.43168830871582, "logps/rejected": -54.678863525390625, "loss": 0.7258750200271606, "memory(GiB)": 39.42, "nll_loss": 0.5083752870559692, "rewards/accuracies": 0.9375, "rewards/chosen": 0.008410019800066948, "rewards/margins": 3.8021652698516846, "rewards/rejected": -3.793755292892456, "step": 200, "train_speed(iter/s)": 0.01076 }, { "epoch": 0.7015706806282722, "grad_norm": 16.57341194152832, "learning_rate": 0.00018201947574994384, "logits/chosen": -0.036614514887332916, "logits/rejected": -0.21098592877388, "logps/chosen": -15.165770530700684, "logps/rejected": -62.39512252807617, "loss": 0.9109693765640259, "memory(GiB)": 39.42, "nll_loss": 0.5643189549446106, "rewards/accuracies": 0.90625, "rewards/chosen": -0.21655045449733734, "rewards/margins": 3.875659465789795, "rewards/rejected": -4.092210292816162, "step": 201, "train_speed(iter/s)": 0.01075 }, { "epoch": 0.7050610820244329, "grad_norm": 14.475955963134766, "learning_rate": 0.00018179834471375125, "logits/chosen": -0.16321136057376862, "logits/rejected": -0.27808913588523865, "logps/chosen": -8.80876350402832, "logps/rejected": -45.93085479736328, "loss": 0.8436198830604553, "memory(GiB)": 39.42, "nll_loss": 0.47678321599960327, "rewards/accuracies": 0.78125, "rewards/chosen": 0.02830314263701439, "rewards/margins": 3.0820868015289307, "rewards/rejected": -3.053783893585205, "step": 202, "train_speed(iter/s)": 0.01075 }, { "epoch": 0.7085514834205934, "grad_norm": 3.0808913707733154, "learning_rate": 0.0001815759982516061, "logits/chosen": -0.13647180795669556, "logits/rejected": -0.2876810133457184, "logps/chosen": -6.556826114654541, "logps/rejected": -49.313106536865234, "loss": 0.5729860067367554, "memory(GiB)": 43.15, "nll_loss": 0.3778243660926819, "rewards/accuracies": 0.96875, "rewards/chosen": 0.19281527400016785, "rewards/margins": 3.0519158840179443, "rewards/rejected": -2.859100580215454, "step": 203, "train_speed(iter/s)": 0.01075 }, { "epoch": 0.7120418848167539, "grad_norm": 3.0599114894866943, "learning_rate": 0.00018135243966731194, "logits/chosen": -0.10809071362018585, "logits/rejected": -0.29678240418434143, "logps/chosen": -8.138949394226074, "logps/rejected": -55.99830627441406, "loss": 0.6175469160079956, "memory(GiB)": 43.15, "nll_loss": 0.4390767514705658, "rewards/accuracies": 0.90625, "rewards/chosen": 0.19007451832294464, "rewards/margins": 3.628199338912964, "rewards/rejected": -3.4381251335144043, "step": 204, "train_speed(iter/s)": 0.010749 }, { "epoch": 0.7155322862129145, "grad_norm": 2.4980595111846924, "learning_rate": 0.00018112767228268295, "logits/chosen": -0.2528156638145447, "logits/rejected": -0.35177648067474365, "logps/chosen": -6.878098011016846, "logps/rejected": -47.343318939208984, "loss": 0.49210962653160095, "memory(GiB)": 43.15, "nll_loss": 0.3529854416847229, "rewards/accuracies": 1.0, "rewards/chosen": 0.06216797977685928, "rewards/margins": 3.3334434032440186, "rewards/rejected": -3.271275520324707, "step": 205, "train_speed(iter/s)": 0.01075 }, { "epoch": 0.7190226876090751, "grad_norm": 3.8207039833068848, "learning_rate": 0.00018090169943749476, "logits/chosen": -0.2331896275281906, "logits/rejected": -0.32883408665657043, "logps/chosen": -7.805197715759277, "logps/rejected": -35.351806640625, "loss": 0.8236002922058105, "memory(GiB)": 43.15, "nll_loss": 0.5681911110877991, "rewards/accuracies": 0.9375, "rewards/chosen": 0.07105645537376404, "rewards/margins": 2.3730642795562744, "rewards/rejected": -2.3020079135894775, "step": 206, "train_speed(iter/s)": 0.01075 }, { "epoch": 0.7225130890052356, "grad_norm": 2.6041932106018066, "learning_rate": 0.00018067452448943455, "logits/chosen": -0.1293148696422577, "logits/rejected": -0.3031143844127655, "logps/chosen": -7.286511421203613, "logps/rejected": -39.59210205078125, "loss": 0.6952319145202637, "memory(GiB)": 43.15, "nll_loss": 0.46597838401794434, "rewards/accuracies": 1.0, "rewards/chosen": 0.1555314064025879, "rewards/margins": 2.2323882579803467, "rewards/rejected": -2.076856851577759, "step": 207, "train_speed(iter/s)": 0.01075 }, { "epoch": 0.7260034904013961, "grad_norm": 2.2537174224853516, "learning_rate": 0.00018044615081405153, "logits/chosen": -0.13209852576255798, "logits/rejected": -0.32356375455856323, "logps/chosen": -8.257270812988281, "logps/rejected": -49.27021789550781, "loss": 0.7890011668205261, "memory(GiB)": 43.15, "nll_loss": 0.5036588311195374, "rewards/accuracies": 0.875, "rewards/chosen": 0.13289037346839905, "rewards/margins": 2.8654632568359375, "rewards/rejected": -2.7325730323791504, "step": 208, "train_speed(iter/s)": 0.010749 }, { "epoch": 0.7294938917975567, "grad_norm": 1.861016869544983, "learning_rate": 0.0001802165818047063, "logits/chosen": -0.2812590003013611, "logits/rejected": -0.4031287133693695, "logps/chosen": -4.251603126525879, "logps/rejected": -41.79424285888672, "loss": 0.47951921820640564, "memory(GiB)": 43.15, "nll_loss": 0.2904518246650696, "rewards/accuracies": 0.9375, "rewards/chosen": 0.18484094738960266, "rewards/margins": 2.8290510177612305, "rewards/rejected": -2.644209861755371, "step": 209, "train_speed(iter/s)": 0.01075 }, { "epoch": 0.7329842931937173, "grad_norm": 1.9735944271087646, "learning_rate": 0.00017998582087252096, "logits/chosen": -0.26465538144111633, "logits/rejected": -0.34588366746902466, "logps/chosen": -8.212122917175293, "logps/rejected": -48.384342193603516, "loss": 0.5980856418609619, "memory(GiB)": 43.15, "nll_loss": 0.4945921003818512, "rewards/accuracies": 1.0, "rewards/chosen": 0.258284330368042, "rewards/margins": 3.618307113647461, "rewards/rejected": -3.36002254486084, "step": 210, "train_speed(iter/s)": 0.01075 }, { "epoch": 0.7364746945898778, "grad_norm": 4.080269813537598, "learning_rate": 0.000179753871446328, "logits/chosen": -0.3342297077178955, "logits/rejected": -0.45482489466667175, "logps/chosen": -4.805637359619141, "logps/rejected": -52.97557830810547, "loss": 0.5000529289245605, "memory(GiB)": 43.15, "nll_loss": 0.35857757925987244, "rewards/accuracies": 0.96875, "rewards/chosen": 0.08043038100004196, "rewards/margins": 4.170455455780029, "rewards/rejected": -4.090025901794434, "step": 211, "train_speed(iter/s)": 0.01075 }, { "epoch": 0.7399650959860384, "grad_norm": 2.64082932472229, "learning_rate": 0.00017952073697261953, "logits/chosen": -0.271504282951355, "logits/rejected": -0.3815239667892456, "logps/chosen": -9.383578300476074, "logps/rejected": -48.522979736328125, "loss": 0.7009327411651611, "memory(GiB)": 43.15, "nll_loss": 0.5086449384689331, "rewards/accuracies": 0.875, "rewards/chosen": 0.2527061700820923, "rewards/margins": 3.632561683654785, "rewards/rejected": -3.3798558712005615, "step": 212, "train_speed(iter/s)": 0.01075 }, { "epoch": 0.743455497382199, "grad_norm": 3.330623149871826, "learning_rate": 0.00017928642091549613, "logits/chosen": -0.242343470454216, "logits/rejected": -0.423129677772522, "logps/chosen": -4.796614170074463, "logps/rejected": -63.50012969970703, "loss": 0.44938358664512634, "memory(GiB)": 43.15, "nll_loss": 0.3825247585773468, "rewards/accuracies": 1.0, "rewards/chosen": 0.09516870975494385, "rewards/margins": 4.826410293579102, "rewards/rejected": -4.731241703033447, "step": 213, "train_speed(iter/s)": 0.01075 }, { "epoch": 0.7469458987783595, "grad_norm": 2.482487201690674, "learning_rate": 0.00017905092675661526, "logits/chosen": -0.34072667360305786, "logits/rejected": -0.4692738652229309, "logps/chosen": -5.442986011505127, "logps/rejected": -49.02458190917969, "loss": 0.4906308054924011, "memory(GiB)": 43.15, "nll_loss": 0.32957711815834045, "rewards/accuracies": 0.96875, "rewards/chosen": 0.27041277289390564, "rewards/margins": 3.7490029335021973, "rewards/rejected": -3.478590488433838, "step": 214, "train_speed(iter/s)": 0.010751 }, { "epoch": 0.7504363001745201, "grad_norm": 2.0258970260620117, "learning_rate": 0.00017881425799513956, "logits/chosen": -0.29332002997398376, "logits/rejected": -0.4313204884529114, "logps/chosen": -3.8019495010375977, "logps/rejected": -48.41462707519531, "loss": 0.4435490071773529, "memory(GiB)": 43.15, "nll_loss": 0.3045477867126465, "rewards/accuracies": 0.96875, "rewards/chosen": 0.21170072257518768, "rewards/margins": 3.814541816711426, "rewards/rejected": -3.602841854095459, "step": 215, "train_speed(iter/s)": 0.010751 }, { "epoch": 0.7539267015706806, "grad_norm": 4.538289546966553, "learning_rate": 0.00017857641814768486, "logits/chosen": -0.3277314305305481, "logits/rejected": -0.4610479176044464, "logps/chosen": -4.489333152770996, "logps/rejected": -40.003170013427734, "loss": 0.6065860986709595, "memory(GiB)": 43.15, "nll_loss": 0.3757091760635376, "rewards/accuracies": 0.96875, "rewards/chosen": 0.10844689607620239, "rewards/margins": 2.677161693572998, "rewards/rejected": -2.5687148571014404, "step": 216, "train_speed(iter/s)": 0.010751 }, { "epoch": 0.7574171029668412, "grad_norm": 1.9632673263549805, "learning_rate": 0.00017833741074826796, "logits/chosen": -0.3702457547187805, "logits/rejected": -0.4608480930328369, "logps/chosen": -6.7205352783203125, "logps/rejected": -46.00050354003906, "loss": 0.6259070038795471, "memory(GiB)": 43.15, "nll_loss": 0.43828409910202026, "rewards/accuracies": 0.9375, "rewards/chosen": 0.014492299407720566, "rewards/margins": 3.3422679901123047, "rewards/rejected": -3.3277759552001953, "step": 217, "train_speed(iter/s)": 0.010751 }, { "epoch": 0.7609075043630017, "grad_norm": 4.585688591003418, "learning_rate": 0.00017809723934825405, "logits/chosen": -0.30587339401245117, "logits/rejected": -0.39274415373802185, "logps/chosen": -7.410132884979248, "logps/rejected": -39.855010986328125, "loss": 0.666675865650177, "memory(GiB)": 43.15, "nll_loss": 0.44685378670692444, "rewards/accuracies": 0.90625, "rewards/chosen": 0.244940847158432, "rewards/margins": 2.851167678833008, "rewards/rejected": -2.606226921081543, "step": 218, "train_speed(iter/s)": 0.010751 }, { "epoch": 0.7643979057591623, "grad_norm": 2.123504877090454, "learning_rate": 0.00017785590751630403, "logits/chosen": -0.2982403039932251, "logits/rejected": -0.42090415954589844, "logps/chosen": -9.233821868896484, "logps/rejected": -49.84214401245117, "loss": 0.608307421207428, "memory(GiB)": 43.15, "nll_loss": 0.4753749966621399, "rewards/accuracies": 1.0, "rewards/chosen": 0.03608651086688042, "rewards/margins": 3.5284979343414307, "rewards/rejected": -3.492410898208618, "step": 219, "train_speed(iter/s)": 0.010752 }, { "epoch": 0.7678883071553229, "grad_norm": 6.390042781829834, "learning_rate": 0.0001776134188383214, "logits/chosen": -0.2736659646034241, "logits/rejected": -0.4519406855106354, "logps/chosen": -6.503651142120361, "logps/rejected": -57.02659606933594, "loss": 0.7497352957725525, "memory(GiB)": 43.15, "nll_loss": 0.5775147676467896, "rewards/accuracies": 0.9375, "rewards/chosen": 0.052752792835235596, "rewards/margins": 4.1409912109375, "rewards/rejected": -4.088238716125488, "step": 220, "train_speed(iter/s)": 0.010751 }, { "epoch": 0.7713787085514834, "grad_norm": 7.869540691375732, "learning_rate": 0.00017736977691739904, "logits/chosen": -0.2893148958683014, "logits/rejected": -0.45987799763679504, "logps/chosen": -7.436133861541748, "logps/rejected": -50.03794860839844, "loss": 0.7108630537986755, "memory(GiB)": 43.15, "nll_loss": 0.5081782341003418, "rewards/accuracies": 0.96875, "rewards/chosen": 0.02406979724764824, "rewards/margins": 3.2432000637054443, "rewards/rejected": -3.219129800796509, "step": 221, "train_speed(iter/s)": 0.010752 }, { "epoch": 0.774869109947644, "grad_norm": 2.0641894340515137, "learning_rate": 0.00017712498537376562, "logits/chosen": -0.2713238596916199, "logits/rejected": -0.4085955023765564, "logps/chosen": -4.430034637451172, "logps/rejected": -54.22665023803711, "loss": 0.44029539823532104, "memory(GiB)": 43.15, "nll_loss": 0.24963557720184326, "rewards/accuracies": 0.875, "rewards/chosen": 0.0637066438794136, "rewards/margins": 4.175436496734619, "rewards/rejected": -4.111729621887207, "step": 222, "train_speed(iter/s)": 0.010752 }, { "epoch": 0.7783595113438045, "grad_norm": 4.655381679534912, "learning_rate": 0.00017687904784473188, "logits/chosen": -0.32085755467414856, "logits/rejected": -0.4244834780693054, "logps/chosen": -9.161126136779785, "logps/rejected": -49.83354949951172, "loss": 0.7681727409362793, "memory(GiB)": 43.15, "nll_loss": 0.5344542860984802, "rewards/accuracies": 0.9375, "rewards/chosen": 0.11410484462976456, "rewards/margins": 3.6829593181610107, "rewards/rejected": -3.568854331970215, "step": 223, "train_speed(iter/s)": 0.010752 }, { "epoch": 0.7818499127399651, "grad_norm": 4.069851875305176, "learning_rate": 0.0001766319679846365, "logits/chosen": -0.34671980142593384, "logits/rejected": -0.4845532774925232, "logps/chosen": -5.1330132484436035, "logps/rejected": -49.80237579345703, "loss": 0.6742711067199707, "memory(GiB)": 43.15, "nll_loss": 0.44481760263442993, "rewards/accuracies": 0.9375, "rewards/chosen": 0.14206397533416748, "rewards/margins": 3.5617966651916504, "rewards/rejected": -3.4197328090667725, "step": 224, "train_speed(iter/s)": 0.010752 }, { "epoch": 0.7853403141361257, "grad_norm": 2.1478774547576904, "learning_rate": 0.00017638374946479178, "logits/chosen": -0.19995641708374023, "logits/rejected": -0.36974671483039856, "logps/chosen": -11.061859130859375, "logps/rejected": -55.27647399902344, "loss": 0.6111169457435608, "memory(GiB)": 43.15, "nll_loss": 0.42612090706825256, "rewards/accuracies": 0.9375, "rewards/chosen": 0.12187716364860535, "rewards/margins": 4.010047435760498, "rewards/rejected": -3.8881704807281494, "step": 225, "train_speed(iter/s)": 0.010752 }, { "epoch": 0.7888307155322862, "grad_norm": 2.974621295928955, "learning_rate": 0.00017613439597342928, "logits/chosen": -0.3379659056663513, "logits/rejected": -0.48346391320228577, "logps/chosen": -5.418050765991211, "logps/rejected": -52.225372314453125, "loss": 0.42137280106544495, "memory(GiB)": 43.15, "nll_loss": 0.29507750272750854, "rewards/accuracies": 0.9375, "rewards/chosen": 0.3996121883392334, "rewards/margins": 4.174943447113037, "rewards/rejected": -3.7753310203552246, "step": 226, "train_speed(iter/s)": 0.010752 }, { "epoch": 0.7923211169284468, "grad_norm": 2.614269733428955, "learning_rate": 0.0001758839112156448, "logits/chosen": -0.235207661986351, "logits/rejected": -0.4293682277202606, "logps/chosen": -6.221077919006348, "logps/rejected": -57.73169708251953, "loss": 0.5521800518035889, "memory(GiB)": 43.15, "nll_loss": 0.409783273935318, "rewards/accuracies": 0.90625, "rewards/chosen": 0.23889221251010895, "rewards/margins": 4.359738826751709, "rewards/rejected": -4.120846748352051, "step": 227, "train_speed(iter/s)": 0.010752 }, { "epoch": 0.7958115183246073, "grad_norm": 3.5413107872009277, "learning_rate": 0.00017563229891334338, "logits/chosen": -0.26919710636138916, "logits/rejected": -0.45086047053337097, "logps/chosen": -6.003745079040527, "logps/rejected": -56.92920684814453, "loss": 0.45959168672561646, "memory(GiB)": 43.15, "nll_loss": 0.3346911668777466, "rewards/accuracies": 1.0, "rewards/chosen": 0.23589728772640228, "rewards/margins": 4.437588691711426, "rewards/rejected": -4.201691627502441, "step": 228, "train_speed(iter/s)": 0.010752 }, { "epoch": 0.7993019197207679, "grad_norm": 6.556480407714844, "learning_rate": 0.00017537956280518416, "logits/chosen": -0.3422713875770569, "logits/rejected": -0.451128214597702, "logps/chosen": -7.599344253540039, "logps/rejected": -43.70567321777344, "loss": 0.7094074487686157, "memory(GiB)": 43.15, "nll_loss": 0.5201672315597534, "rewards/accuracies": 0.96875, "rewards/chosen": 0.12758715450763702, "rewards/margins": 3.260258197784424, "rewards/rejected": -3.1326711177825928, "step": 229, "train_speed(iter/s)": 0.010753 }, { "epoch": 0.8027923211169284, "grad_norm": 1.586064338684082, "learning_rate": 0.00017512570664652454, "logits/chosen": -0.28756070137023926, "logits/rejected": -0.38268500566482544, "logps/chosen": -8.602394104003906, "logps/rejected": -50.081172943115234, "loss": 0.6170235872268677, "memory(GiB)": 43.15, "nll_loss": 0.44623884558677673, "rewards/accuracies": 1.0, "rewards/chosen": 0.23854351043701172, "rewards/margins": 3.8032238483428955, "rewards/rejected": -3.564680337905884, "step": 230, "train_speed(iter/s)": 0.010753 }, { "epoch": 0.806282722513089, "grad_norm": 1.6582534313201904, "learning_rate": 0.00017487073420936465, "logits/chosen": -0.3135778605937958, "logits/rejected": -0.46431437134742737, "logps/chosen": -4.987645626068115, "logps/rejected": -52.46248245239258, "loss": 0.4446931779384613, "memory(GiB)": 43.15, "nll_loss": 0.30552300810813904, "rewards/accuracies": 0.96875, "rewards/chosen": 0.12139096856117249, "rewards/margins": 3.983121156692505, "rewards/rejected": -3.8617305755615234, "step": 231, "train_speed(iter/s)": 0.010753 }, { "epoch": 0.8097731239092496, "grad_norm": 1.2338401079177856, "learning_rate": 0.00017461464928229115, "logits/chosen": -0.379431813955307, "logits/rejected": -0.48820745944976807, "logps/chosen": -4.064929485321045, "logps/rejected": -43.8752555847168, "loss": 0.4461000859737396, "memory(GiB)": 43.15, "nll_loss": 0.31098049879074097, "rewards/accuracies": 1.0, "rewards/chosen": 0.10920354723930359, "rewards/margins": 3.3555779457092285, "rewards/rejected": -3.2463743686676025, "step": 232, "train_speed(iter/s)": 0.010753 }, { "epoch": 0.8132635253054101, "grad_norm": 3.2604479789733887, "learning_rate": 0.00017435745567042095, "logits/chosen": -0.2582184672355652, "logits/rejected": -0.4310912489891052, "logps/chosen": -7.691014289855957, "logps/rejected": -54.24932098388672, "loss": 0.6151188611984253, "memory(GiB)": 43.15, "nll_loss": 0.41653314232826233, "rewards/accuracies": 0.90625, "rewards/chosen": 0.0867326557636261, "rewards/margins": 3.933887481689453, "rewards/rejected": -3.8471546173095703, "step": 233, "train_speed(iter/s)": 0.010753 }, { "epoch": 0.8167539267015707, "grad_norm": 1.4706934690475464, "learning_rate": 0.0001740991571953447, "logits/chosen": -0.269050657749176, "logits/rejected": -0.5030261278152466, "logps/chosen": -3.481001615524292, "logps/rejected": -65.2177505493164, "loss": 0.3229425251483917, "memory(GiB)": 43.15, "nll_loss": 0.24098612368106842, "rewards/accuracies": 1.0, "rewards/chosen": 0.16970407962799072, "rewards/margins": 4.697527885437012, "rewards/rejected": -4.527822971343994, "step": 234, "train_speed(iter/s)": 0.010753 }, { "epoch": 0.8202443280977313, "grad_norm": 3.0432982444763184, "learning_rate": 0.00017383975769507006, "logits/chosen": -0.3666076064109802, "logits/rejected": -0.49905386567115784, "logps/chosen": -9.495936393737793, "logps/rejected": -48.320045471191406, "loss": 0.7838144302368164, "memory(GiB)": 43.15, "nll_loss": 0.5246264934539795, "rewards/accuracies": 0.9375, "rewards/chosen": -0.07730744034051895, "rewards/margins": 3.346642255783081, "rewards/rejected": -3.4239492416381836, "step": 235, "train_speed(iter/s)": 0.010753 }, { "epoch": 0.8237347294938918, "grad_norm": 2.1510214805603027, "learning_rate": 0.00017357926102396453, "logits/chosen": -0.3271171748638153, "logits/rejected": -0.5392114520072937, "logps/chosen": -6.4805731773376465, "logps/rejected": -59.16584777832031, "loss": 0.4900282919406891, "memory(GiB)": 43.15, "nll_loss": 0.34938499331474304, "rewards/accuracies": 0.96875, "rewards/chosen": 0.12114590406417847, "rewards/margins": 4.474804878234863, "rewards/rejected": -4.353658676147461, "step": 236, "train_speed(iter/s)": 0.010753 }, { "epoch": 0.8272251308900523, "grad_norm": 3.5285916328430176, "learning_rate": 0.00017331767105269833, "logits/chosen": -0.31751590967178345, "logits/rejected": -0.5495515465736389, "logps/chosen": -6.772843360900879, "logps/rejected": -54.508914947509766, "loss": 0.6024790406227112, "memory(GiB)": 43.15, "nll_loss": 0.39046281576156616, "rewards/accuracies": 0.875, "rewards/chosen": -0.011396676301956177, "rewards/margins": 3.849278688430786, "rewards/rejected": -3.860675096511841, "step": 237, "train_speed(iter/s)": 0.010753 }, { "epoch": 0.8307155322862129, "grad_norm": 4.1707329750061035, "learning_rate": 0.0001730549916681868, "logits/chosen": -0.3934589922428131, "logits/rejected": -0.5638350248336792, "logps/chosen": -7.145245552062988, "logps/rejected": -66.46633911132812, "loss": 0.5913079380989075, "memory(GiB)": 43.15, "nll_loss": 0.42689260840415955, "rewards/accuracies": 0.90625, "rewards/chosen": 0.09644685685634613, "rewards/margins": 5.219150543212891, "rewards/rejected": -5.122704982757568, "step": 238, "train_speed(iter/s)": 0.010753 }, { "epoch": 0.8342059336823735, "grad_norm": 2.7752156257629395, "learning_rate": 0.00017279122677353262, "logits/chosen": -0.2619190216064453, "logits/rejected": -0.569366455078125, "logps/chosen": -4.285702705383301, "logps/rejected": -64.56398010253906, "loss": 0.4372471272945404, "memory(GiB)": 43.15, "nll_loss": 0.3511802554130554, "rewards/accuracies": 1.0, "rewards/chosen": 0.18024781346321106, "rewards/margins": 4.906952857971191, "rewards/rejected": -4.726705551147461, "step": 239, "train_speed(iter/s)": 0.010753 }, { "epoch": 0.837696335078534, "grad_norm": 12.657561302185059, "learning_rate": 0.00017252638028796789, "logits/chosen": -0.4536377787590027, "logits/rejected": -0.4795590937137604, "logps/chosen": -10.30350112915039, "logps/rejected": -50.788246154785156, "loss": 0.806001603603363, "memory(GiB)": 43.15, "nll_loss": 0.533410906791687, "rewards/accuracies": 0.9375, "rewards/chosen": 0.0006981715559959412, "rewards/margins": 3.909877300262451, "rewards/rejected": -3.909179210662842, "step": 240, "train_speed(iter/s)": 0.010753 }, { "epoch": 0.8411867364746946, "grad_norm": 2.1404943466186523, "learning_rate": 0.00017226045614679588, "logits/chosen": -0.47950872778892517, "logits/rejected": -0.523240864276886, "logps/chosen": -7.280372619628906, "logps/rejected": -47.931678771972656, "loss": 0.5918366312980652, "memory(GiB)": 43.15, "nll_loss": 0.4288029670715332, "rewards/accuracies": 0.9375, "rewards/chosen": 0.12062430381774902, "rewards/margins": 3.814420461654663, "rewards/rejected": -3.693796396255493, "step": 241, "train_speed(iter/s)": 0.010754 }, { "epoch": 0.8446771378708552, "grad_norm": 5.467627048492432, "learning_rate": 0.00017199345830133252, "logits/chosen": -0.3690679669380188, "logits/rejected": -0.5561453700065613, "logps/chosen": -4.672489166259766, "logps/rejected": -62.01866912841797, "loss": 0.6225215196609497, "memory(GiB)": 43.15, "nll_loss": 0.43513110280036926, "rewards/accuracies": 0.96875, "rewards/chosen": -0.028843754902482033, "rewards/margins": 4.858260154724121, "rewards/rejected": -4.887104034423828, "step": 242, "train_speed(iter/s)": 0.010754 }, { "epoch": 0.8481675392670157, "grad_norm": 2.7799084186553955, "learning_rate": 0.0001717253907188477, "logits/chosen": -0.3674232065677643, "logits/rejected": -0.48529595136642456, "logps/chosen": -11.648327827453613, "logps/rejected": -51.57639694213867, "loss": 0.7946433424949646, "memory(GiB)": 43.15, "nll_loss": 0.5997886061668396, "rewards/accuracies": 0.9375, "rewards/chosen": 0.04861972853541374, "rewards/margins": 3.9191184043884277, "rewards/rejected": -3.8704986572265625, "step": 243, "train_speed(iter/s)": 0.010754 }, { "epoch": 0.8516579406631762, "grad_norm": 7.648078441619873, "learning_rate": 0.00017145625738250635, "logits/chosen": -0.24742871522903442, "logits/rejected": -0.48127883672714233, "logps/chosen": -5.881336212158203, "logps/rejected": -58.709659576416016, "loss": 0.6269736289978027, "memory(GiB)": 43.15, "nll_loss": 0.4364897310733795, "rewards/accuracies": 0.9375, "rewards/chosen": 0.2005631923675537, "rewards/margins": 4.109006404876709, "rewards/rejected": -3.9084432125091553, "step": 244, "train_speed(iter/s)": 0.010754 }, { "epoch": 0.8551483420593369, "grad_norm": 4.572084426879883, "learning_rate": 0.0001711860622913092, "logits/chosen": -0.41671591997146606, "logits/rejected": -0.49388235807418823, "logps/chosen": -9.111591339111328, "logps/rejected": -54.797916412353516, "loss": 0.7940463423728943, "memory(GiB)": 43.15, "nll_loss": 0.5814399123191833, "rewards/accuracies": 0.875, "rewards/chosen": -0.008319624699652195, "rewards/margins": 4.386847496032715, "rewards/rejected": -4.395166873931885, "step": 245, "train_speed(iter/s)": 0.010754 }, { "epoch": 0.8586387434554974, "grad_norm": 21.202533721923828, "learning_rate": 0.0001709148094600334, "logits/chosen": -0.28929275274276733, "logits/rejected": -0.46102988719940186, "logps/chosen": -7.337296962738037, "logps/rejected": -61.80494689941406, "loss": 0.8849119544029236, "memory(GiB)": 43.15, "nll_loss": 0.6312083005905151, "rewards/accuracies": 0.90625, "rewards/chosen": 0.0007691718637943268, "rewards/margins": 4.356324195861816, "rewards/rejected": -4.355555057525635, "step": 246, "train_speed(iter/s)": 0.010754 }, { "epoch": 0.8621291448516579, "grad_norm": 3.0293681621551514, "learning_rate": 0.00017064250291917295, "logits/chosen": -0.3044416308403015, "logits/rejected": -0.45788872241973877, "logps/chosen": -11.546972274780273, "logps/rejected": -68.43335723876953, "loss": 0.4920075833797455, "memory(GiB)": 43.15, "nll_loss": 0.39548447728157043, "rewards/accuracies": 1.0, "rewards/chosen": 0.28147220611572266, "rewards/margins": 5.060581207275391, "rewards/rejected": -4.779109001159668, "step": 247, "train_speed(iter/s)": 0.010754 }, { "epoch": 0.8656195462478184, "grad_norm": 1.1536225080490112, "learning_rate": 0.00017036914671487852, "logits/chosen": -0.29598888754844666, "logits/rejected": -0.5037257075309753, "logps/chosen": -4.555235862731934, "logps/rejected": -71.70169830322266, "loss": 0.29999658465385437, "memory(GiB)": 43.15, "nll_loss": 0.22001689672470093, "rewards/accuracies": 1.0, "rewards/chosen": 0.10969162732362747, "rewards/margins": 5.70869779586792, "rewards/rejected": -5.599005699157715, "step": 248, "train_speed(iter/s)": 0.010754 }, { "epoch": 0.8691099476439791, "grad_norm": 5.403660297393799, "learning_rate": 0.0001700947449088977, "logits/chosen": -0.29327866435050964, "logits/rejected": -0.5409445762634277, "logps/chosen": -6.3373589515686035, "logps/rejected": -61.361427307128906, "loss": 0.7032750248908997, "memory(GiB)": 43.15, "nll_loss": 0.49727386236190796, "rewards/accuracies": 0.90625, "rewards/chosen": -0.12291238456964493, "rewards/margins": 4.190377712249756, "rewards/rejected": -4.313290119171143, "step": 249, "train_speed(iter/s)": 0.010754 }, { "epoch": 0.8726003490401396, "grad_norm": 2.2364845275878906, "learning_rate": 0.00016981930157851442, "logits/chosen": -0.4206138253211975, "logits/rejected": -0.5452399253845215, "logps/chosen": -6.642912864685059, "logps/rejected": -55.26310348510742, "loss": 0.6106983423233032, "memory(GiB)": 43.15, "nll_loss": 0.46136975288391113, "rewards/accuracies": 0.96875, "rewards/chosen": 0.1548982709646225, "rewards/margins": 4.34593391418457, "rewards/rejected": -4.191035270690918, "step": 250, "train_speed(iter/s)": 0.010754 }, { "epoch": 0.8760907504363001, "grad_norm": 2.366743326187134, "learning_rate": 0.0001695428208164884, "logits/chosen": -0.3339673578739166, "logits/rejected": -0.46634042263031006, "logps/chosen": -12.371589660644531, "logps/rejected": -54.81672668457031, "loss": 0.7680290937423706, "memory(GiB)": 43.15, "nll_loss": 0.5548099279403687, "rewards/accuracies": 0.875, "rewards/chosen": 0.06331084668636322, "rewards/margins": 3.747202157974243, "rewards/rejected": -3.683891773223877, "step": 251, "train_speed(iter/s)": 0.010754 }, { "epoch": 0.8795811518324608, "grad_norm": 17.273366928100586, "learning_rate": 0.00016926530673099443, "logits/chosen": -0.25144901871681213, "logits/rejected": -0.5055121779441833, "logps/chosen": -4.04465389251709, "logps/rejected": -53.838226318359375, "loss": 0.5800854563713074, "memory(GiB)": 43.15, "nll_loss": 0.43476593494415283, "rewards/accuracies": 0.90625, "rewards/chosen": 0.09720754623413086, "rewards/margins": 3.768738031387329, "rewards/rejected": -3.6715304851531982, "step": 252, "train_speed(iter/s)": 0.010755 }, { "epoch": 0.8830715532286213, "grad_norm": 3.9538075923919678, "learning_rate": 0.00016898676344556118, "logits/chosen": -0.3590712547302246, "logits/rejected": -0.4731703996658325, "logps/chosen": -8.093548774719238, "logps/rejected": -44.39308547973633, "loss": 0.7438912391662598, "memory(GiB)": 43.15, "nll_loss": 0.5026392936706543, "rewards/accuracies": 0.9375, "rewards/chosen": 0.010781295597553253, "rewards/margins": 3.2361843585968018, "rewards/rejected": -3.22540283203125, "step": 253, "train_speed(iter/s)": 0.010755 }, { "epoch": 0.8865619546247818, "grad_norm": 4.43087100982666, "learning_rate": 0.00016870719509901, "logits/chosen": -0.32536038756370544, "logits/rejected": -0.5595154166221619, "logps/chosen": -3.823620319366455, "logps/rejected": -56.6773681640625, "loss": 0.545555591583252, "memory(GiB)": 43.15, "nll_loss": 0.3203794062137604, "rewards/accuracies": 0.875, "rewards/chosen": 0.06757771968841553, "rewards/margins": 3.751739978790283, "rewards/rejected": -3.684161901473999, "step": 254, "train_speed(iter/s)": 0.010755 }, { "epoch": 0.8900523560209425, "grad_norm": 1.5452710390090942, "learning_rate": 0.00016842660584539352, "logits/chosen": -0.4577394425868988, "logits/rejected": -0.5295063853263855, "logps/chosen": -4.856768608093262, "logps/rejected": -44.36632537841797, "loss": 0.5244438052177429, "memory(GiB)": 43.15, "nll_loss": 0.3651025891304016, "rewards/accuracies": 0.96875, "rewards/chosen": 0.22487697005271912, "rewards/margins": 3.4033455848693848, "rewards/rejected": -3.178468704223633, "step": 255, "train_speed(iter/s)": 0.010755 }, { "epoch": 0.893542757417103, "grad_norm": 1.9295581579208374, "learning_rate": 0.0001681449998539337, "logits/chosen": -0.3778080642223358, "logits/rejected": -0.5354687571525574, "logps/chosen": -7.896451950073242, "logps/rejected": -60.301177978515625, "loss": 0.5556483268737793, "memory(GiB)": 43.15, "nll_loss": 0.4384987950325012, "rewards/accuracies": 0.96875, "rewards/chosen": 0.263929545879364, "rewards/margins": 4.734387397766113, "rewards/rejected": -4.470458030700684, "step": 256, "train_speed(iter/s)": 0.010755 }, { "epoch": 0.8970331588132635, "grad_norm": 2.257227897644043, "learning_rate": 0.00016786238130896014, "logits/chosen": -0.4991389214992523, "logits/rejected": -0.563326895236969, "logps/chosen": -8.479850769042969, "logps/rejected": -38.3695182800293, "loss": 0.6856359243392944, "memory(GiB)": 43.15, "nll_loss": 0.49940675497055054, "rewards/accuracies": 0.96875, "rewards/chosen": 0.1654682606458664, "rewards/margins": 2.8511545658111572, "rewards/rejected": -2.6856863498687744, "step": 257, "train_speed(iter/s)": 0.010755 }, { "epoch": 0.900523560209424, "grad_norm": 19.965892791748047, "learning_rate": 0.00016757875440984768, "logits/chosen": -0.416139155626297, "logits/rejected": -0.4932768940925598, "logps/chosen": -8.089065551757812, "logps/rejected": -44.46285629272461, "loss": 0.870505690574646, "memory(GiB)": 43.15, "nll_loss": 0.6033220291137695, "rewards/accuracies": 0.875, "rewards/chosen": -0.02359044924378395, "rewards/margins": 3.3024742603302, "rewards/rejected": -3.3260645866394043, "step": 258, "train_speed(iter/s)": 0.010755 }, { "epoch": 0.9040139616055847, "grad_norm": 2.1116161346435547, "learning_rate": 0.00016729412337095417, "logits/chosen": -0.34614264965057373, "logits/rejected": -0.5283275246620178, "logps/chosen": -8.69775104522705, "logps/rejected": -58.33458709716797, "loss": 0.516063392162323, "memory(GiB)": 43.15, "nll_loss": 0.3785746097564697, "rewards/accuracies": 0.9375, "rewards/chosen": 0.15219049155712128, "rewards/margins": 4.3896002769470215, "rewards/rejected": -4.237410068511963, "step": 259, "train_speed(iter/s)": 0.010755 }, { "epoch": 0.9075043630017452, "grad_norm": 2.9699761867523193, "learning_rate": 0.00016700849242155775, "logits/chosen": -0.2944773733615875, "logits/rejected": -0.42303967475891113, "logps/chosen": -7.197884559631348, "logps/rejected": -58.377899169921875, "loss": 0.5171555280685425, "memory(GiB)": 43.15, "nll_loss": 0.3375796973705292, "rewards/accuracies": 0.90625, "rewards/chosen": -0.034792426973581314, "rewards/margins": 4.28358793258667, "rewards/rejected": -4.318380355834961, "step": 260, "train_speed(iter/s)": 0.010755 }, { "epoch": 0.9109947643979057, "grad_norm": 8.736255645751953, "learning_rate": 0.00016672186580579405, "logits/chosen": -0.3011060357093811, "logits/rejected": -0.5398942232131958, "logps/chosen": -5.949331760406494, "logps/rejected": -64.1772689819336, "loss": 0.6132771372795105, "memory(GiB)": 43.15, "nll_loss": 0.5076794624328613, "rewards/accuracies": 0.96875, "rewards/chosen": 0.010059421882033348, "rewards/margins": 4.510530948638916, "rewards/rejected": -4.500471115112305, "step": 261, "train_speed(iter/s)": 0.010755 }, { "epoch": 0.9144851657940664, "grad_norm": 5.83949613571167, "learning_rate": 0.0001664342477825931, "logits/chosen": -0.44913211464881897, "logits/rejected": -0.5108562707901001, "logps/chosen": -12.713695526123047, "logps/rejected": -51.189388275146484, "loss": 1.1607731580734253, "memory(GiB)": 43.15, "nll_loss": 0.979007363319397, "rewards/accuracies": 0.9375, "rewards/chosen": 0.07644180953502655, "rewards/margins": 4.067415237426758, "rewards/rejected": -3.9909729957580566, "step": 262, "train_speed(iter/s)": 0.010755 }, { "epoch": 0.9179755671902269, "grad_norm": 6.3965911865234375, "learning_rate": 0.00016614564262561608, "logits/chosen": -0.3431762456893921, "logits/rejected": -0.5227538347244263, "logps/chosen": -8.923004150390625, "logps/rejected": -66.28221893310547, "loss": 0.7520352602005005, "memory(GiB)": 43.15, "nll_loss": 0.6111706495285034, "rewards/accuracies": 0.9375, "rewards/chosen": 0.0333654060959816, "rewards/margins": 4.924405574798584, "rewards/rejected": -4.891040325164795, "step": 263, "train_speed(iter/s)": 0.010755 }, { "epoch": 0.9214659685863874, "grad_norm": 8.98039722442627, "learning_rate": 0.0001658560546231918, "logits/chosen": -0.40294116735458374, "logits/rejected": -0.5690099000930786, "logps/chosen": -5.10881233215332, "logps/rejected": -55.61248779296875, "loss": 0.469806045293808, "memory(GiB)": 43.15, "nll_loss": 0.31188011169433594, "rewards/accuracies": 0.9375, "rewards/chosen": 0.08330924063920975, "rewards/margins": 4.100750923156738, "rewards/rejected": -4.017441749572754, "step": 264, "train_speed(iter/s)": 0.010755 }, { "epoch": 0.924956369982548, "grad_norm": 2.279346466064453, "learning_rate": 0.00016556548807825295, "logits/chosen": -0.2596076726913452, "logits/rejected": -0.4245615601539612, "logps/chosen": -8.973737716674805, "logps/rejected": -63.824710845947266, "loss": 0.5860002636909485, "memory(GiB)": 43.15, "nll_loss": 0.4316725730895996, "rewards/accuracies": 0.9375, "rewards/chosen": 0.03057311289012432, "rewards/margins": 4.672904014587402, "rewards/rejected": -4.642330646514893, "step": 265, "train_speed(iter/s)": 0.010755 }, { "epoch": 0.9284467713787086, "grad_norm": 3.462368965148926, "learning_rate": 0.00016527394730827229, "logits/chosen": -0.39172494411468506, "logits/rejected": -0.5556192994117737, "logps/chosen": -6.451850891113281, "logps/rejected": -58.2652473449707, "loss": 0.6653540134429932, "memory(GiB)": 43.15, "nll_loss": 0.5281586647033691, "rewards/accuracies": 0.9375, "rewards/chosen": 0.09578607976436615, "rewards/margins": 4.3150811195373535, "rewards/rejected": -4.219295501708984, "step": 266, "train_speed(iter/s)": 0.010755 }, { "epoch": 0.9319371727748691, "grad_norm": 2.29887056350708, "learning_rate": 0.00016498143664519824, "logits/chosen": -0.3378483057022095, "logits/rejected": -0.5873894095420837, "logps/chosen": -5.2974629402160645, "logps/rejected": -76.44007110595703, "loss": 0.38004374504089355, "memory(GiB)": 43.15, "nll_loss": 0.2812269926071167, "rewards/accuracies": 0.90625, "rewards/chosen": 0.3595108091831207, "rewards/margins": 5.502060413360596, "rewards/rejected": -5.14254903793335, "step": 267, "train_speed(iter/s)": 0.010755 }, { "epoch": 0.9354275741710296, "grad_norm": 8.743305206298828, "learning_rate": 0.0001646879604353908, "logits/chosen": -0.3702645003795624, "logits/rejected": -0.5771125555038452, "logps/chosen": -9.347705841064453, "logps/rejected": -49.44694519042969, "loss": 1.1101744174957275, "memory(GiB)": 43.15, "nll_loss": 0.799601137638092, "rewards/accuracies": 0.90625, "rewards/chosen": -0.0540962852537632, "rewards/margins": 3.277214288711548, "rewards/rejected": -3.331310749053955, "step": 268, "train_speed(iter/s)": 0.010755 }, { "epoch": 0.9389179755671903, "grad_norm": 1.31393563747406, "learning_rate": 0.00016439352303955688, "logits/chosen": -0.39863336086273193, "logits/rejected": -0.5482807159423828, "logps/chosen": -6.748524188995361, "logps/rejected": -59.980262756347656, "loss": 0.4353381097316742, "memory(GiB)": 43.15, "nll_loss": 0.37013500928878784, "rewards/accuracies": 1.0, "rewards/chosen": 0.15098029375076294, "rewards/margins": 4.846394062042236, "rewards/rejected": -4.695413589477539, "step": 269, "train_speed(iter/s)": 0.010755 }, { "epoch": 0.9424083769633508, "grad_norm": 5.9643425941467285, "learning_rate": 0.00016409812883268535, "logits/chosen": -0.38031327724456787, "logits/rejected": -0.5494654178619385, "logps/chosen": -6.423410892486572, "logps/rejected": -69.69914245605469, "loss": 0.4006003141403198, "memory(GiB)": 43.15, "nll_loss": 0.3364032506942749, "rewards/accuracies": 1.0, "rewards/chosen": -0.10248701274394989, "rewards/margins": 5.274303436279297, "rewards/rejected": -5.376790523529053, "step": 270, "train_speed(iter/s)": 0.010755 }, { "epoch": 0.9458987783595113, "grad_norm": 7.4491047859191895, "learning_rate": 0.00016380178220398226, "logits/chosen": -0.415705144405365, "logits/rejected": -0.6392954587936401, "logps/chosen": -6.486244201660156, "logps/rejected": -56.07293701171875, "loss": 0.6918466687202454, "memory(GiB)": 43.15, "nll_loss": 0.5155448317527771, "rewards/accuracies": 0.9375, "rewards/chosen": 0.09501791000366211, "rewards/margins": 3.938845634460449, "rewards/rejected": -3.843827962875366, "step": 271, "train_speed(iter/s)": 0.010755 }, { "epoch": 0.9493891797556719, "grad_norm": 2.838250160217285, "learning_rate": 0.0001635044875568054, "logits/chosen": -0.36552664637565613, "logits/rejected": -0.4577628970146179, "logps/chosen": -10.308563232421875, "logps/rejected": -52.53562927246094, "loss": 0.4913533926010132, "memory(GiB)": 43.15, "nll_loss": 0.34640663862228394, "rewards/accuracies": 0.96875, "rewards/chosen": 0.10055547952651978, "rewards/margins": 4.087219715118408, "rewards/rejected": -3.986664056777954, "step": 272, "train_speed(iter/s)": 0.010755 }, { "epoch": 0.9528795811518325, "grad_norm": 8.961051940917969, "learning_rate": 0.00016320624930859904, "logits/chosen": -0.38108423352241516, "logits/rejected": -0.5300929546356201, "logps/chosen": -11.11557674407959, "logps/rejected": -57.43425750732422, "loss": 0.9454229474067688, "memory(GiB)": 43.15, "nll_loss": 0.7644782662391663, "rewards/accuracies": 0.96875, "rewards/chosen": -0.13230867683887482, "rewards/margins": 3.9995622634887695, "rewards/rejected": -4.131870746612549, "step": 273, "train_speed(iter/s)": 0.010755 }, { "epoch": 0.956369982547993, "grad_norm": 2.179896116256714, "learning_rate": 0.0001629070718908283, "logits/chosen": -0.39322447776794434, "logits/rejected": -0.5073328614234924, "logps/chosen": -7.645257949829102, "logps/rejected": -51.549869537353516, "loss": 0.5495847463607788, "memory(GiB)": 43.15, "nll_loss": 0.3960936665534973, "rewards/accuracies": 0.9375, "rewards/chosen": 0.038150034844875336, "rewards/margins": 4.1127800941467285, "rewards/rejected": -4.074629783630371, "step": 274, "train_speed(iter/s)": 0.010755 }, { "epoch": 0.9598603839441536, "grad_norm": 2.9412152767181396, "learning_rate": 0.0001626069597489132, "logits/chosen": -0.42589738965034485, "logits/rejected": -0.5628194808959961, "logps/chosen": -11.427227973937988, "logps/rejected": -51.27968978881836, "loss": 0.7387857437133789, "memory(GiB)": 43.15, "nll_loss": 0.5841793417930603, "rewards/accuracies": 0.96875, "rewards/chosen": 0.1430855542421341, "rewards/margins": 3.8389885425567627, "rewards/rejected": -3.6959028244018555, "step": 275, "train_speed(iter/s)": 0.010755 }, { "epoch": 0.9633507853403142, "grad_norm": 3.372194528579712, "learning_rate": 0.0001623059173421625, "logits/chosen": -0.2240457385778427, "logits/rejected": -0.5538793802261353, "logps/chosen": -5.805129051208496, "logps/rejected": -71.96966552734375, "loss": 0.5059239268302917, "memory(GiB)": 43.15, "nll_loss": 0.42470091581344604, "rewards/accuracies": 0.96875, "rewards/chosen": 0.06452590972185135, "rewards/margins": 5.022994041442871, "rewards/rejected": -4.958468437194824, "step": 276, "train_speed(iter/s)": 0.010755 }, { "epoch": 0.9668411867364747, "grad_norm": 4.933607578277588, "learning_rate": 0.00016200394914370788, "logits/chosen": -0.318347692489624, "logits/rejected": -0.47638392448425293, "logps/chosen": -8.253751754760742, "logps/rejected": -57.21156692504883, "loss": 0.8552437424659729, "memory(GiB)": 43.15, "nll_loss": 0.5107535719871521, "rewards/accuracies": 0.84375, "rewards/chosen": -0.028203103691339493, "rewards/margins": 3.587186336517334, "rewards/rejected": -3.615389585494995, "step": 277, "train_speed(iter/s)": 0.010755 }, { "epoch": 0.9703315881326352, "grad_norm": 1.967063069343567, "learning_rate": 0.00016170105964043695, "logits/chosen": -0.46634575724601746, "logits/rejected": -0.5018796920776367, "logps/chosen": -8.443771362304688, "logps/rejected": -36.8387336730957, "loss": 0.6206079125404358, "memory(GiB)": 43.15, "nll_loss": 0.3942241072654724, "rewards/accuracies": 0.90625, "rewards/chosen": 0.14703020453453064, "rewards/margins": 2.6712229251861572, "rewards/rejected": -2.5241925716400146, "step": 278, "train_speed(iter/s)": 0.010755 }, { "epoch": 0.9738219895287958, "grad_norm": 2.5119967460632324, "learning_rate": 0.0001613972533329269, "logits/chosen": -0.39050760865211487, "logits/rejected": -0.5310595035552979, "logps/chosen": -4.703199863433838, "logps/rejected": -50.82078552246094, "loss": 0.4742874801158905, "memory(GiB)": 43.15, "nll_loss": 0.2932378947734833, "rewards/accuracies": 0.90625, "rewards/chosen": 0.04821047931909561, "rewards/margins": 3.5806527137756348, "rewards/rejected": -3.5324418544769287, "step": 279, "train_speed(iter/s)": 0.010755 }, { "epoch": 0.9773123909249564, "grad_norm": 2.238361120223999, "learning_rate": 0.0001610925347353775, "logits/chosen": -0.37722715735435486, "logits/rejected": -0.5656870603561401, "logps/chosen": -5.8236494064331055, "logps/rejected": -50.120391845703125, "loss": 0.5826418995857239, "memory(GiB)": 43.15, "nll_loss": 0.4334554672241211, "rewards/accuracies": 1.0, "rewards/chosen": 0.16360187530517578, "rewards/margins": 3.4687533378601074, "rewards/rejected": -3.30515193939209, "step": 280, "train_speed(iter/s)": 0.010756 }, { "epoch": 0.9808027923211169, "grad_norm": 2.3494832515716553, "learning_rate": 0.00016078690837554408, "logits/chosen": -0.33358269929885864, "logits/rejected": -0.5591884255409241, "logps/chosen": -5.116516590118408, "logps/rejected": -49.51860046386719, "loss": 0.5960334539413452, "memory(GiB)": 43.15, "nll_loss": 0.3720979690551758, "rewards/accuracies": 0.90625, "rewards/chosen": 0.17815372347831726, "rewards/margins": 3.0898640155792236, "rewards/rejected": -2.911710262298584, "step": 281, "train_speed(iter/s)": 0.010756 }, { "epoch": 0.9842931937172775, "grad_norm": 3.6189231872558594, "learning_rate": 0.00016048037879467025, "logits/chosen": -0.37796086072921753, "logits/rejected": -0.5117664933204651, "logps/chosen": -4.1463236808776855, "logps/rejected": -48.00626754760742, "loss": 0.5160388946533203, "memory(GiB)": 43.15, "nll_loss": 0.31095653772354126, "rewards/accuracies": 0.90625, "rewards/chosen": 0.034109927713871, "rewards/margins": 3.225755453109741, "rewards/rejected": -3.191645383834839, "step": 282, "train_speed(iter/s)": 0.010756 }, { "epoch": 0.987783595113438, "grad_norm": 5.189328193664551, "learning_rate": 0.00016017295054742046, "logits/chosen": -0.33860644698143005, "logits/rejected": -0.5117906332015991, "logps/chosen": -11.231898307800293, "logps/rejected": -49.39238739013672, "loss": 0.8505796790122986, "memory(GiB)": 43.15, "nll_loss": 0.6683485507965088, "rewards/accuracies": 0.90625, "rewards/chosen": 0.10711870342493057, "rewards/margins": 3.197012424468994, "rewards/rejected": -3.089893341064453, "step": 283, "train_speed(iter/s)": 0.010756 }, { "epoch": 0.9912739965095986, "grad_norm": 26.61264419555664, "learning_rate": 0.0001598646282018121, "logits/chosen": -0.36234819889068604, "logits/rejected": -0.5464830994606018, "logps/chosen": -7.227906703948975, "logps/rejected": -53.168861389160156, "loss": 0.5734856724739075, "memory(GiB)": 43.15, "nll_loss": 0.41981199383735657, "rewards/accuracies": 0.96875, "rewards/chosen": 0.07493679225444794, "rewards/margins": 3.693037748336792, "rewards/rejected": -3.618101119995117, "step": 284, "train_speed(iter/s)": 0.010755 }, { "epoch": 0.9947643979057592, "grad_norm": 5.144956588745117, "learning_rate": 0.000159555416339148, "logits/chosen": -0.26111942529678345, "logits/rejected": -0.5374065041542053, "logps/chosen": -2.2055845260620117, "logps/rejected": -68.69379425048828, "loss": 0.3513576090335846, "memory(GiB)": 43.15, "nll_loss": 0.21501211822032928, "rewards/accuracies": 0.96875, "rewards/chosen": 0.09447957575321198, "rewards/margins": 4.662655830383301, "rewards/rejected": -4.56817626953125, "step": 285, "train_speed(iter/s)": 0.010755 }, { "epoch": 0.9982547993019197, "grad_norm": 2.222433090209961, "learning_rate": 0.00015924531955394802, "logits/chosen": -0.3610646724700928, "logits/rejected": -0.4617045521736145, "logps/chosen": -7.9295196533203125, "logps/rejected": -47.70429611206055, "loss": 0.5501912832260132, "memory(GiB)": 43.15, "nll_loss": 0.3641606867313385, "rewards/accuracies": 0.9375, "rewards/chosen": 0.13688504695892334, "rewards/margins": 3.380563735961914, "rewards/rejected": -3.243678569793701, "step": 286, "train_speed(iter/s)": 0.010755 }, { "epoch": 1.0034904013961605, "grad_norm": 2.3679821491241455, "learning_rate": 0.00015893434245388093, "logits/chosen": -0.39241814613342285, "logits/rejected": -0.5621130466461182, "logps/chosen": -4.523199081420898, "logps/rejected": -60.3804931640625, "loss": 0.48575231432914734, "memory(GiB)": 43.15, "nll_loss": 0.28081169724464417, "rewards/accuracies": 0.9411764740943909, "rewards/chosen": 0.13038994371891022, "rewards/margins": 4.663900375366211, "rewards/rejected": -4.533511161804199, "step": 287, "train_speed(iter/s)": 0.010752 }, { "epoch": 1.006980802792321, "grad_norm": 1.3687598705291748, "learning_rate": 0.00015862248965969604, "logits/chosen": -0.26206377148628235, "logits/rejected": -0.5492232441902161, "logps/chosen": -5.55544900894165, "logps/rejected": -82.16498565673828, "loss": 0.35956525802612305, "memory(GiB)": 43.15, "nll_loss": 0.28186729550361633, "rewards/accuracies": 1.0, "rewards/chosen": 0.26697322726249695, "rewards/margins": 6.157236576080322, "rewards/rejected": -5.89026403427124, "step": 288, "train_speed(iter/s)": 0.010752 }, { "epoch": 1.0104712041884816, "grad_norm": 4.600061893463135, "learning_rate": 0.00015830976580515432, "logits/chosen": -0.3973150849342346, "logits/rejected": -0.527411937713623, "logps/chosen": -11.000313758850098, "logps/rejected": -61.0347785949707, "loss": 0.7208768129348755, "memory(GiB)": 43.15, "nll_loss": 0.5785147547721863, "rewards/accuracies": 0.96875, "rewards/chosen": 0.18078193068504333, "rewards/margins": 4.359728813171387, "rewards/rejected": -4.1789469718933105, "step": 289, "train_speed(iter/s)": 0.010752 }, { "epoch": 1.0139616055846423, "grad_norm": 2.2930972576141357, "learning_rate": 0.00015799617553695957, "logits/chosen": -0.4011244773864746, "logits/rejected": -0.5036134719848633, "logps/chosen": -6.045261383056641, "logps/rejected": -57.71175765991211, "loss": 0.3789103627204895, "memory(GiB)": 43.15, "nll_loss": 0.3045409619808197, "rewards/accuracies": 1.0, "rewards/chosen": 0.3516743779182434, "rewards/margins": 4.524147033691406, "rewards/rejected": -4.1724724769592285, "step": 290, "train_speed(iter/s)": 0.010752 }, { "epoch": 1.0174520069808028, "grad_norm": 1.8977946043014526, "learning_rate": 0.00015768172351468974, "logits/chosen": -0.3493969142436981, "logits/rejected": -0.5791320204734802, "logps/chosen": -3.5215115547180176, "logps/rejected": -65.80962371826172, "loss": 0.36785203218460083, "memory(GiB)": 43.15, "nll_loss": 0.26871761679649353, "rewards/accuracies": 0.96875, "rewards/chosen": 0.3286406993865967, "rewards/margins": 5.31328010559082, "rewards/rejected": -4.984640121459961, "step": 291, "train_speed(iter/s)": 0.010752 }, { "epoch": 1.0209424083769634, "grad_norm": 8.48400592803955, "learning_rate": 0.0001573664144107272, "logits/chosen": -0.40092405676841736, "logits/rejected": -0.5814225077629089, "logps/chosen": -4.21975564956665, "logps/rejected": -66.2427978515625, "loss": 0.35437557101249695, "memory(GiB)": 43.15, "nll_loss": 0.27522024512290955, "rewards/accuracies": 0.96875, "rewards/chosen": 0.2891547381877899, "rewards/margins": 4.967032432556152, "rewards/rejected": -4.677878379821777, "step": 292, "train_speed(iter/s)": 0.010752 }, { "epoch": 1.024432809773124, "grad_norm": 2.3877346515655518, "learning_rate": 0.0001570502529101896, "logits/chosen": -0.4078039228916168, "logits/rejected": -0.6340718269348145, "logps/chosen": -4.7514328956604, "logps/rejected": -63.62433624267578, "loss": 0.2756602466106415, "memory(GiB)": 43.15, "nll_loss": 0.2308274805545807, "rewards/accuracies": 1.0, "rewards/chosen": 0.2891400456428528, "rewards/margins": 5.025572776794434, "rewards/rejected": -4.736433029174805, "step": 293, "train_speed(iter/s)": 0.010752 }, { "epoch": 1.0279232111692844, "grad_norm": 1.341036081314087, "learning_rate": 0.0001567332437108602, "logits/chosen": -0.4645722806453705, "logits/rejected": -0.6466395854949951, "logps/chosen": -4.918186187744141, "logps/rejected": -55.84804916381836, "loss": 0.3296290636062622, "memory(GiB)": 43.15, "nll_loss": 0.23185840249061584, "rewards/accuracies": 1.0, "rewards/chosen": 0.28173521161079407, "rewards/margins": 4.368047714233398, "rewards/rejected": -4.086312294006348, "step": 294, "train_speed(iter/s)": 0.010752 }, { "epoch": 1.031413612565445, "grad_norm": 1.4693691730499268, "learning_rate": 0.00015641539152311796, "logits/chosen": -0.42224860191345215, "logits/rejected": -0.6172808408737183, "logps/chosen": -5.080268859863281, "logps/rejected": -57.87543487548828, "loss": 0.4304788410663605, "memory(GiB)": 43.15, "nll_loss": 0.3393770754337311, "rewards/accuracies": 1.0, "rewards/chosen": 0.2397257685661316, "rewards/margins": 4.47007942199707, "rewards/rejected": -4.230354309082031, "step": 295, "train_speed(iter/s)": 0.010752 }, { "epoch": 1.0349040139616057, "grad_norm": 3.831491231918335, "learning_rate": 0.00015609670106986776, "logits/chosen": -0.5365476608276367, "logits/rejected": -0.6072984337806702, "logps/chosen": -5.30760383605957, "logps/rejected": -49.26717758178711, "loss": 0.36716127395629883, "memory(GiB)": 43.15, "nll_loss": 0.2641866207122803, "rewards/accuracies": 1.0, "rewards/chosen": 0.4461376667022705, "rewards/margins": 3.9801061153411865, "rewards/rejected": -3.533968687057495, "step": 296, "train_speed(iter/s)": 0.010752 }, { "epoch": 1.0383944153577662, "grad_norm": 8.527892112731934, "learning_rate": 0.0001557771770864701, "logits/chosen": -0.3701344430446625, "logits/rejected": -0.5703862309455872, "logps/chosen": -6.846416473388672, "logps/rejected": -65.28385925292969, "loss": 0.47399166226387024, "memory(GiB)": 43.15, "nll_loss": 0.32827308773994446, "rewards/accuracies": 0.96875, "rewards/chosen": 0.45203351974487305, "rewards/margins": 4.902979850769043, "rewards/rejected": -4.450946807861328, "step": 297, "train_speed(iter/s)": 0.010751 }, { "epoch": 1.0418848167539267, "grad_norm": 2.383213520050049, "learning_rate": 0.00015545682432067067, "logits/chosen": -0.4192945659160614, "logits/rejected": -0.663847804069519, "logps/chosen": -5.736666679382324, "logps/rejected": -72.8265380859375, "loss": 0.32853907346725464, "memory(GiB)": 43.15, "nll_loss": 0.29026535153388977, "rewards/accuracies": 1.0, "rewards/chosen": 0.47007882595062256, "rewards/margins": 5.804821014404297, "rewards/rejected": -5.334741592407227, "step": 298, "train_speed(iter/s)": 0.010751 }, { "epoch": 1.0453752181500873, "grad_norm": 2.514970064163208, "learning_rate": 0.00015513564753252994, "logits/chosen": -0.5625315308570862, "logits/rejected": -0.6955651044845581, "logps/chosen": -6.750204563140869, "logps/rejected": -58.264225006103516, "loss": 0.5013718605041504, "memory(GiB)": 43.15, "nll_loss": 0.3770815134048462, "rewards/accuracies": 0.96875, "rewards/chosen": 0.1921541839838028, "rewards/margins": 4.60443115234375, "rewards/rejected": -4.4122772216796875, "step": 299, "train_speed(iter/s)": 0.010751 }, { "epoch": 1.0488656195462478, "grad_norm": 8.446479797363281, "learning_rate": 0.00015481365149435235, "logits/chosen": -0.5021696090698242, "logits/rejected": -0.663796603679657, "logps/chosen": -6.143691062927246, "logps/rejected": -53.95307159423828, "loss": 0.46026065945625305, "memory(GiB)": 43.15, "nll_loss": 0.3280302882194519, "rewards/accuracies": 0.96875, "rewards/chosen": 0.2705683708190918, "rewards/margins": 4.268153190612793, "rewards/rejected": -3.9975852966308594, "step": 300, "train_speed(iter/s)": 0.010751 }, { "epoch": 1.0523560209424083, "grad_norm": 1.4564425945281982, "learning_rate": 0.00015449084099061538, "logits/chosen": -0.5470643043518066, "logits/rejected": -0.5662429332733154, "logps/chosen": -8.135005950927734, "logps/rejected": -61.87958908081055, "loss": 0.3989267945289612, "memory(GiB)": 43.15, "nll_loss": 0.35136380791664124, "rewards/accuracies": 1.0, "rewards/chosen": 0.475752592086792, "rewards/margins": 5.381492614746094, "rewards/rejected": -4.905740737915039, "step": 301, "train_speed(iter/s)": 0.010745 }, { "epoch": 1.0558464223385688, "grad_norm": 2.5607101917266846, "learning_rate": 0.00015416722081789864, "logits/chosen": -0.4304802715778351, "logits/rejected": -0.6808840036392212, "logps/chosen": -3.730553388595581, "logps/rejected": -77.83374786376953, "loss": 0.31356939673423767, "memory(GiB)": 43.15, "nll_loss": 0.23746523261070251, "rewards/accuracies": 1.0, "rewards/chosen": 0.32321637868881226, "rewards/margins": 5.76716423034668, "rewards/rejected": -5.443948745727539, "step": 302, "train_speed(iter/s)": 0.010745 }, { "epoch": 1.0593368237347296, "grad_norm": 3.4172539710998535, "learning_rate": 0.00015384279578481221, "logits/chosen": -0.5958032608032227, "logits/rejected": -0.6914587020874023, "logps/chosen": -11.875475883483887, "logps/rejected": -56.1957893371582, "loss": 0.6093863844871521, "memory(GiB)": 43.15, "nll_loss": 0.5033939480781555, "rewards/accuracies": 0.96875, "rewards/chosen": 0.5004825592041016, "rewards/margins": 4.409386157989502, "rewards/rejected": -3.9089038372039795, "step": 303, "train_speed(iter/s)": 0.010744 }, { "epoch": 1.0628272251308901, "grad_norm": 4.900504112243652, "learning_rate": 0.00015351757071192573, "logits/chosen": -0.36820149421691895, "logits/rejected": -0.689315676689148, "logps/chosen": -3.029294729232788, "logps/rejected": -76.44140625, "loss": 0.3941238224506378, "memory(GiB)": 43.15, "nll_loss": 0.2878090739250183, "rewards/accuracies": 0.96875, "rewards/chosen": 0.1027887836098671, "rewards/margins": 5.742969989776611, "rewards/rejected": -5.640181541442871, "step": 304, "train_speed(iter/s)": 0.010744 }, { "epoch": 1.0663176265270506, "grad_norm": 2.218637466430664, "learning_rate": 0.00015319155043169618, "logits/chosen": -0.5266806483268738, "logits/rejected": -0.7329103946685791, "logps/chosen": -6.292713642120361, "logps/rejected": -63.29831314086914, "loss": 0.409374862909317, "memory(GiB)": 43.15, "nll_loss": 0.3364257216453552, "rewards/accuracies": 0.96875, "rewards/chosen": 0.40051528811454773, "rewards/margins": 5.179149150848389, "rewards/rejected": -4.778634548187256, "step": 305, "train_speed(iter/s)": 0.010744 }, { "epoch": 1.0698080279232112, "grad_norm": 8.687586784362793, "learning_rate": 0.00015286473978839662, "logits/chosen": -0.6478016376495361, "logits/rejected": -0.7238842248916626, "logps/chosen": -5.924484729766846, "logps/rejected": -61.01313400268555, "loss": 0.4875742495059967, "memory(GiB)": 43.15, "nll_loss": 0.3984666168689728, "rewards/accuracies": 1.0, "rewards/chosen": 0.39782842993736267, "rewards/margins": 5.429813861846924, "rewards/rejected": -5.031985282897949, "step": 306, "train_speed(iter/s)": 0.010744 }, { "epoch": 1.0732984293193717, "grad_norm": 5.456116199493408, "learning_rate": 0.00015253714363804388, "logits/chosen": -0.5222834944725037, "logits/rejected": -0.7372316718101501, "logps/chosen": -5.703394889831543, "logps/rejected": -82.65278625488281, "loss": 0.42027172446250916, "memory(GiB)": 43.15, "nll_loss": 0.30709269642829895, "rewards/accuracies": 0.96875, "rewards/chosen": 0.19577693939208984, "rewards/margins": 6.722568988800049, "rewards/rejected": -6.526791572570801, "step": 307, "train_speed(iter/s)": 0.010744 }, { "epoch": 1.0767888307155322, "grad_norm": 1.5310981273651123, "learning_rate": 0.00015220876684832638, "logits/chosen": -0.6310667395591736, "logits/rejected": -0.7239534854888916, "logps/chosen": -5.980924606323242, "logps/rejected": -68.00843811035156, "loss": 0.34952861070632935, "memory(GiB)": 43.15, "nll_loss": 0.3003528416156769, "rewards/accuracies": 1.0, "rewards/chosen": 0.32078802585601807, "rewards/margins": 5.430644512176514, "rewards/rejected": -5.109856605529785, "step": 308, "train_speed(iter/s)": 0.010744 }, { "epoch": 1.0802792321116927, "grad_norm": 4.554830074310303, "learning_rate": 0.0001518796142985321, "logits/chosen": -0.6367871761322021, "logits/rejected": -0.7653591632843018, "logps/chosen": -6.020457744598389, "logps/rejected": -65.98897552490234, "loss": 0.4749387502670288, "memory(GiB)": 43.15, "nll_loss": 0.37060117721557617, "rewards/accuracies": 0.96875, "rewards/chosen": 0.19638437032699585, "rewards/margins": 5.541833877563477, "rewards/rejected": -5.345449447631836, "step": 309, "train_speed(iter/s)": 0.010744 }, { "epoch": 1.0837696335078535, "grad_norm": 1.6975951194763184, "learning_rate": 0.00015154969087947573, "logits/chosen": -0.48107388615608215, "logits/rejected": -0.7438764572143555, "logps/chosen": -3.089120864868164, "logps/rejected": -69.92082214355469, "loss": 0.2973018288612366, "memory(GiB)": 43.15, "nll_loss": 0.22607487440109253, "rewards/accuracies": 1.0, "rewards/chosen": 0.3830302953720093, "rewards/margins": 5.329667091369629, "rewards/rejected": -4.94663667678833, "step": 310, "train_speed(iter/s)": 0.010744 }, { "epoch": 1.087260034904014, "grad_norm": 2.6259241104125977, "learning_rate": 0.0001512190014934263, "logits/chosen": -0.5431985259056091, "logits/rejected": -0.7063261866569519, "logps/chosen": -5.224724769592285, "logps/rejected": -71.81791687011719, "loss": 0.3114906847476959, "memory(GiB)": 43.15, "nll_loss": 0.238429993391037, "rewards/accuracies": 1.0, "rewards/chosen": 0.20617195963859558, "rewards/margins": 5.925920009613037, "rewards/rejected": -5.719748497009277, "step": 311, "train_speed(iter/s)": 0.010744 }, { "epoch": 1.0907504363001745, "grad_norm": 1.2943837642669678, "learning_rate": 0.00015088755105403405, "logits/chosen": -0.5590757131576538, "logits/rejected": -0.8148021697998047, "logps/chosen": -4.819448947906494, "logps/rejected": -70.58955383300781, "loss": 0.34402620792388916, "memory(GiB)": 43.15, "nll_loss": 0.28382259607315063, "rewards/accuracies": 1.0, "rewards/chosen": 0.2690161168575287, "rewards/margins": 5.675660133361816, "rewards/rejected": -5.406644344329834, "step": 312, "train_speed(iter/s)": 0.010744 }, { "epoch": 1.094240837696335, "grad_norm": 1.4312578439712524, "learning_rate": 0.00015055534448625766, "logits/chosen": -0.49336162209510803, "logits/rejected": -0.7816673517227173, "logps/chosen": -6.685326099395752, "logps/rejected": -80.9956283569336, "loss": 0.4569896161556244, "memory(GiB)": 43.15, "nll_loss": 0.4009275436401367, "rewards/accuracies": 1.0, "rewards/chosen": 0.3557565212249756, "rewards/margins": 6.279770374298096, "rewards/rejected": -5.924014091491699, "step": 313, "train_speed(iter/s)": 0.010744 }, { "epoch": 1.0977312390924956, "grad_norm": 1.5266355276107788, "learning_rate": 0.00015022238672629095, "logits/chosen": -0.5756551623344421, "logits/rejected": -0.735444962978363, "logps/chosen": -5.3377766609191895, "logps/rejected": -67.37596130371094, "loss": 0.3693499267101288, "memory(GiB)": 43.15, "nll_loss": 0.2790605127811432, "rewards/accuracies": 1.0, "rewards/chosen": 0.3705032169818878, "rewards/margins": 5.493788242340088, "rewards/rejected": -5.123284816741943, "step": 314, "train_speed(iter/s)": 0.010744 }, { "epoch": 1.1012216404886561, "grad_norm": 1.9074639081954956, "learning_rate": 0.0001498886827214896, "logits/chosen": -0.6456474661827087, "logits/rejected": -0.7724269032478333, "logps/chosen": -5.277746677398682, "logps/rejected": -53.66168212890625, "loss": 0.44892674684524536, "memory(GiB)": 43.15, "nll_loss": 0.37271296977996826, "rewards/accuracies": 1.0, "rewards/chosen": 0.25592944025993347, "rewards/margins": 4.511635780334473, "rewards/rejected": -4.255705833435059, "step": 315, "train_speed(iter/s)": 0.010744 }, { "epoch": 1.1047120418848166, "grad_norm": 1.9207693338394165, "learning_rate": 0.0001495542374302975, "logits/chosen": -0.5007003545761108, "logits/rejected": -0.650519609451294, "logps/chosen": -5.601229190826416, "logps/rejected": -65.04399108886719, "loss": 0.418306440114975, "memory(GiB)": 43.15, "nll_loss": 0.32126715779304504, "rewards/accuracies": 0.96875, "rewards/chosen": 0.3169766068458557, "rewards/margins": 5.420646667480469, "rewards/rejected": -5.103670597076416, "step": 316, "train_speed(iter/s)": 0.010744 }, { "epoch": 1.1082024432809774, "grad_norm": 2.1684069633483887, "learning_rate": 0.00014921905582217332, "logits/chosen": -0.3752322793006897, "logits/rejected": -0.6496881246566772, "logps/chosen": -4.458385944366455, "logps/rejected": -83.53166198730469, "loss": 0.37263908982276917, "memory(GiB)": 43.15, "nll_loss": 0.3141525983810425, "rewards/accuracies": 0.96875, "rewards/chosen": 0.30656152963638306, "rewards/margins": 5.798944473266602, "rewards/rejected": -5.492383003234863, "step": 317, "train_speed(iter/s)": 0.010744 }, { "epoch": 1.111692844677138, "grad_norm": 1.412676453590393, "learning_rate": 0.0001488831428775164, "logits/chosen": -0.5132664442062378, "logits/rejected": -0.7257671356201172, "logps/chosen": -3.272702693939209, "logps/rejected": -57.20233917236328, "loss": 0.3777000308036804, "memory(GiB)": 43.15, "nll_loss": 0.31745412945747375, "rewards/accuracies": 1.0, "rewards/chosen": 0.22153383493423462, "rewards/margins": 4.813529014587402, "rewards/rejected": -4.5919952392578125, "step": 318, "train_speed(iter/s)": 0.010744 }, { "epoch": 1.1151832460732984, "grad_norm": 2.84291410446167, "learning_rate": 0.0001485465035875929, "logits/chosen": -0.5710486173629761, "logits/rejected": -0.6527326107025146, "logps/chosen": -7.473095417022705, "logps/rejected": -60.35542297363281, "loss": 0.5568766593933105, "memory(GiB)": 43.15, "nll_loss": 0.4240596890449524, "rewards/accuracies": 0.96875, "rewards/chosen": 0.12074887752532959, "rewards/margins": 4.750669002532959, "rewards/rejected": -4.62992000579834, "step": 319, "train_speed(iter/s)": 0.010744 }, { "epoch": 1.118673647469459, "grad_norm": 10.697195053100586, "learning_rate": 0.00014820914295446164, "logits/chosen": -0.48244622349739075, "logits/rejected": -0.6707563400268555, "logps/chosen": -4.583101272583008, "logps/rejected": -70.41757202148438, "loss": 0.45662960410118103, "memory(GiB)": 43.15, "nll_loss": 0.3494943082332611, "rewards/accuracies": 0.96875, "rewards/chosen": 0.22834914922714233, "rewards/margins": 5.394464492797852, "rewards/rejected": -5.166115760803223, "step": 320, "train_speed(iter/s)": 0.010744 }, { "epoch": 1.1221640488656195, "grad_norm": 7.470077037811279, "learning_rate": 0.00014787106599089967, "logits/chosen": -0.4395173192024231, "logits/rejected": -0.7748122215270996, "logps/chosen": -4.163114070892334, "logps/rejected": -87.97148132324219, "loss": 0.42231428623199463, "memory(GiB)": 43.15, "nll_loss": 0.3452557325363159, "rewards/accuracies": 0.96875, "rewards/chosen": 0.40086498856544495, "rewards/margins": 7.3803606033325195, "rewards/rejected": -6.979496002197266, "step": 321, "train_speed(iter/s)": 0.010745 }, { "epoch": 1.12565445026178, "grad_norm": 6.354022979736328, "learning_rate": 0.00014753227772032793, "logits/chosen": -0.4927988350391388, "logits/rejected": -0.6983435153961182, "logps/chosen": -9.013876914978027, "logps/rejected": -81.17129516601562, "loss": 0.9018564224243164, "memory(GiB)": 43.15, "nll_loss": 0.7067390084266663, "rewards/accuracies": 0.96875, "rewards/chosen": -0.17468257248401642, "rewards/margins": 6.47627067565918, "rewards/rejected": -6.650952339172363, "step": 322, "train_speed(iter/s)": 0.010745 }, { "epoch": 1.1291448516579408, "grad_norm": 6.593186378479004, "learning_rate": 0.00014719278317673655, "logits/chosen": -0.5038294196128845, "logits/rejected": -0.6811163425445557, "logps/chosen": -5.416735649108887, "logps/rejected": -68.10504150390625, "loss": 0.31916317343711853, "memory(GiB)": 43.15, "nll_loss": 0.2741475999355316, "rewards/accuracies": 1.0, "rewards/chosen": 0.33685386180877686, "rewards/margins": 5.806307792663574, "rewards/rejected": -5.469453811645508, "step": 323, "train_speed(iter/s)": 0.010745 }, { "epoch": 1.1326352530541013, "grad_norm": 1.6076407432556152, "learning_rate": 0.00014685258740460995, "logits/chosen": -0.4740574359893799, "logits/rejected": -0.6336863040924072, "logps/chosen": -5.115401268005371, "logps/rejected": -71.67650604248047, "loss": 0.42807137966156006, "memory(GiB)": 43.15, "nll_loss": 0.3246609568595886, "rewards/accuracies": 0.9375, "rewards/chosen": 0.2911081910133362, "rewards/margins": 5.678893089294434, "rewards/rejected": -5.387784957885742, "step": 324, "train_speed(iter/s)": 0.010745 }, { "epoch": 1.1361256544502618, "grad_norm": 4.390758991241455, "learning_rate": 0.00014651169545885199, "logits/chosen": -0.4668413996696472, "logits/rejected": -0.6320906281471252, "logps/chosen": -5.329308032989502, "logps/rejected": -63.19139862060547, "loss": 0.45732176303863525, "memory(GiB)": 43.15, "nll_loss": 0.39123204350471497, "rewards/accuracies": 0.96875, "rewards/chosen": 0.4576411843299866, "rewards/margins": 5.102199554443359, "rewards/rejected": -4.644558429718018, "step": 325, "train_speed(iter/s)": 0.010745 }, { "epoch": 1.1396160558464223, "grad_norm": 2.024564743041992, "learning_rate": 0.00014617011240471094, "logits/chosen": -0.5206573009490967, "logits/rejected": -0.6565874218940735, "logps/chosen": -5.336911678314209, "logps/rejected": -56.41254806518555, "loss": 0.46840786933898926, "memory(GiB)": 43.15, "nll_loss": 0.35700729489326477, "rewards/accuracies": 1.0, "rewards/chosen": 0.21654362976551056, "rewards/margins": 4.641784191131592, "rewards/rejected": -4.425240516662598, "step": 326, "train_speed(iter/s)": 0.010745 }, { "epoch": 1.1431064572425829, "grad_norm": 2.056162118911743, "learning_rate": 0.00014582784331770393, "logits/chosen": -0.5073651671409607, "logits/rejected": -0.659345269203186, "logps/chosen": -5.8628034591674805, "logps/rejected": -49.929962158203125, "loss": 0.5279353857040405, "memory(GiB)": 43.15, "nll_loss": 0.41238051652908325, "rewards/accuracies": 1.0, "rewards/chosen": 0.2424943745136261, "rewards/margins": 3.679898500442505, "rewards/rejected": -3.4374046325683594, "step": 327, "train_speed(iter/s)": 0.010745 }, { "epoch": 1.1465968586387434, "grad_norm": 2.5892443656921387, "learning_rate": 0.00014548489328354195, "logits/chosen": -0.4672063887119293, "logits/rejected": -0.6109826564788818, "logps/chosen": -5.497149467468262, "logps/rejected": -60.077178955078125, "loss": 0.4822987914085388, "memory(GiB)": 43.15, "nll_loss": 0.37062495946884155, "rewards/accuracies": 0.96875, "rewards/chosen": 0.36120548844337463, "rewards/margins": 5.0480451583862305, "rewards/rejected": -4.686839580535889, "step": 328, "train_speed(iter/s)": 0.010745 }, { "epoch": 1.150087260034904, "grad_norm": 1.3888144493103027, "learning_rate": 0.00014514126739805387, "logits/chosen": -0.5015818476676941, "logits/rejected": -0.6728599071502686, "logps/chosen": -3.3580546379089355, "logps/rejected": -54.8983268737793, "loss": 0.370685338973999, "memory(GiB)": 43.15, "nll_loss": 0.2433609664440155, "rewards/accuracies": 0.96875, "rewards/chosen": 0.18075354397296906, "rewards/margins": 4.068675994873047, "rewards/rejected": -3.8879222869873047, "step": 329, "train_speed(iter/s)": 0.010745 }, { "epoch": 1.1535776614310647, "grad_norm": 1.22072172164917, "learning_rate": 0.00014479697076711097, "logits/chosen": -0.533420741558075, "logits/rejected": -0.5922872424125671, "logps/chosen": -4.107625961303711, "logps/rejected": -53.41065979003906, "loss": 0.26737067103385925, "memory(GiB)": 43.15, "nll_loss": 0.2190181165933609, "rewards/accuracies": 0.96875, "rewards/chosen": 0.47103744745254517, "rewards/margins": 4.485008716583252, "rewards/rejected": -4.013971328735352, "step": 330, "train_speed(iter/s)": 0.010746 }, { "epoch": 1.1570680628272252, "grad_norm": 1.1153243780136108, "learning_rate": 0.00014445200850655106, "logits/chosen": -0.5124134421348572, "logits/rejected": -0.5720605254173279, "logps/chosen": -4.25541877746582, "logps/rejected": -47.59088897705078, "loss": 0.4234582781791687, "memory(GiB)": 43.15, "nll_loss": 0.29615476727485657, "rewards/accuracies": 0.9375, "rewards/chosen": 0.3857133984565735, "rewards/margins": 4.029388427734375, "rewards/rejected": -3.643674850463867, "step": 331, "train_speed(iter/s)": 0.010746 }, { "epoch": 1.1605584642233857, "grad_norm": 1.839998722076416, "learning_rate": 0.00014410638574210231, "logits/chosen": -0.5487766265869141, "logits/rejected": -0.6048561930656433, "logps/chosen": -2.9526216983795166, "logps/rejected": -49.01722717285156, "loss": 0.33782559633255005, "memory(GiB)": 43.15, "nll_loss": 0.25286024808883667, "rewards/accuracies": 0.96875, "rewards/chosen": 0.19235680997371674, "rewards/margins": 4.1119232177734375, "rewards/rejected": -3.9195663928985596, "step": 332, "train_speed(iter/s)": 0.010746 }, { "epoch": 1.1640488656195462, "grad_norm": 0.9550164937973022, "learning_rate": 0.00014376010760930728, "logits/chosen": -0.48927396535873413, "logits/rejected": -0.6853697299957275, "logps/chosen": -2.1129355430603027, "logps/rejected": -59.902103424072266, "loss": 0.2407364398241043, "memory(GiB)": 43.15, "nll_loss": 0.2040787637233734, "rewards/accuracies": 1.0, "rewards/chosen": 0.18717700242996216, "rewards/margins": 4.609613418579102, "rewards/rejected": -4.422436237335205, "step": 333, "train_speed(iter/s)": 0.010746 }, { "epoch": 1.1675392670157068, "grad_norm": 1.5491670370101929, "learning_rate": 0.00014341317925344645, "logits/chosen": -0.5509553551673889, "logits/rejected": -0.5921827554702759, "logps/chosen": -8.330162048339844, "logps/rejected": -54.603511810302734, "loss": 0.46315959095954895, "memory(GiB)": 43.15, "nll_loss": 0.37922072410583496, "rewards/accuracies": 0.96875, "rewards/chosen": 0.3218461573123932, "rewards/margins": 4.3676910400390625, "rewards/rejected": -4.045845031738281, "step": 334, "train_speed(iter/s)": 0.010746 }, { "epoch": 1.1710296684118673, "grad_norm": 3.619370460510254, "learning_rate": 0.00014306560582946193, "logits/chosen": -0.584208607673645, "logits/rejected": -0.665631890296936, "logps/chosen": -2.970817804336548, "logps/rejected": -52.78791046142578, "loss": 0.32715079188346863, "memory(GiB)": 43.15, "nll_loss": 0.23035843670368195, "rewards/accuracies": 0.96875, "rewards/chosen": 0.0841044932603836, "rewards/margins": 4.168006420135498, "rewards/rejected": -4.083901405334473, "step": 335, "train_speed(iter/s)": 0.010747 }, { "epoch": 1.174520069808028, "grad_norm": 1.3068387508392334, "learning_rate": 0.0001427173925018807, "logits/chosen": -0.459281861782074, "logits/rejected": -0.6941739320755005, "logps/chosen": -3.556865930557251, "logps/rejected": -60.05839538574219, "loss": 0.2930494248867035, "memory(GiB)": 43.15, "nll_loss": 0.21146121621131897, "rewards/accuracies": 1.0, "rewards/chosen": 0.2878793478012085, "rewards/margins": 4.445915699005127, "rewards/rejected": -4.158036231994629, "step": 336, "train_speed(iter/s)": 0.010747 }, { "epoch": 1.1780104712041886, "grad_norm": 1.542277216911316, "learning_rate": 0.00014236854444473794, "logits/chosen": -0.45352160930633545, "logits/rejected": -0.5974130034446716, "logps/chosen": -7.562567710876465, "logps/rejected": -66.69306945800781, "loss": 0.40887123346328735, "memory(GiB)": 43.15, "nll_loss": 0.38999485969543457, "rewards/accuracies": 1.0, "rewards/chosen": 0.5074263215065002, "rewards/margins": 5.6102190017700195, "rewards/rejected": -5.102793216705322, "step": 337, "train_speed(iter/s)": 0.010747 }, { "epoch": 1.181500872600349, "grad_norm": 1.908805012702942, "learning_rate": 0.0001420190668415002, "logits/chosen": -0.5282233953475952, "logits/rejected": -0.66242516040802, "logps/chosen": -8.06371021270752, "logps/rejected": -59.486412048339844, "loss": 0.48714980483055115, "memory(GiB)": 43.15, "nll_loss": 0.4481129050254822, "rewards/accuracies": 1.0, "rewards/chosen": 0.2379024177789688, "rewards/margins": 4.8613810539245605, "rewards/rejected": -4.623478889465332, "step": 338, "train_speed(iter/s)": 0.010747 }, { "epoch": 1.1849912739965096, "grad_norm": 1.9679303169250488, "learning_rate": 0.0001416689648849883, "logits/chosen": -0.5385857820510864, "logits/rejected": -0.7091735601425171, "logps/chosen": -4.285862922668457, "logps/rejected": -55.13109588623047, "loss": 0.3885069191455841, "memory(GiB)": 43.15, "nll_loss": 0.3152792453765869, "rewards/accuracies": 1.0, "rewards/chosen": 0.4284796416759491, "rewards/margins": 4.7022929191589355, "rewards/rejected": -4.273813247680664, "step": 339, "train_speed(iter/s)": 0.010747 }, { "epoch": 1.1884816753926701, "grad_norm": 6.159523010253906, "learning_rate": 0.00014131824377730024, "logits/chosen": -0.6195085048675537, "logits/rejected": -0.63163161277771, "logps/chosen": -5.583183288574219, "logps/rejected": -50.4035758972168, "loss": 0.4245375990867615, "memory(GiB)": 43.15, "nll_loss": 0.33572766184806824, "rewards/accuracies": 1.0, "rewards/chosen": 0.2565540373325348, "rewards/margins": 4.001959323883057, "rewards/rejected": -3.745405673980713, "step": 340, "train_speed(iter/s)": 0.010747 }, { "epoch": 1.1919720767888307, "grad_norm": 4.105616092681885, "learning_rate": 0.00014096690872973387, "logits/chosen": -0.5850836634635925, "logits/rejected": -0.6230161786079407, "logps/chosen": -6.9361677169799805, "logps/rejected": -55.36536407470703, "loss": 0.594155490398407, "memory(GiB)": 43.15, "nll_loss": 0.49159759283065796, "rewards/accuracies": 0.96875, "rewards/chosen": 0.17695164680480957, "rewards/margins": 4.677291393280029, "rewards/rejected": -4.500339984893799, "step": 341, "train_speed(iter/s)": 0.010747 }, { "epoch": 1.1954624781849912, "grad_norm": 1.673965334892273, "learning_rate": 0.00014061496496270943, "logits/chosen": -0.5429196357727051, "logits/rejected": -0.7085021734237671, "logps/chosen": -4.494854927062988, "logps/rejected": -58.405250549316406, "loss": 0.3368845283985138, "memory(GiB)": 43.15, "nll_loss": 0.24193470180034637, "rewards/accuracies": 0.96875, "rewards/chosen": 0.33928442001342773, "rewards/margins": 4.766523361206055, "rewards/rejected": -4.427238941192627, "step": 342, "train_speed(iter/s)": 0.010747 }, { "epoch": 1.1989528795811517, "grad_norm": 1.5858604907989502, "learning_rate": 0.00014026241770569197, "logits/chosen": -0.4735041856765747, "logits/rejected": -0.5973408222198486, "logps/chosen": -5.155520915985107, "logps/rejected": -61.884307861328125, "loss": 0.380929172039032, "memory(GiB)": 43.15, "nll_loss": 0.2979738116264343, "rewards/accuracies": 0.9375, "rewards/chosen": 0.3542560338973999, "rewards/margins": 5.134637832641602, "rewards/rejected": -4.78038215637207, "step": 343, "train_speed(iter/s)": 0.010747 }, { "epoch": 1.2024432809773125, "grad_norm": 1.420960783958435, "learning_rate": 0.00013990927219711377, "logits/chosen": -0.390002578496933, "logits/rejected": -0.7470687627792358, "logps/chosen": -3.7865405082702637, "logps/rejected": -72.54590606689453, "loss": 0.33121392130851746, "memory(GiB)": 43.15, "nll_loss": 0.285677433013916, "rewards/accuracies": 1.0, "rewards/chosen": 0.38604891300201416, "rewards/margins": 5.873488426208496, "rewards/rejected": -5.4874396324157715, "step": 344, "train_speed(iter/s)": 0.010747 }, { "epoch": 1.205933682373473, "grad_norm": 1.665773868560791, "learning_rate": 0.0001395555336842963, "logits/chosen": -0.4295946955680847, "logits/rejected": -0.6522460579872131, "logps/chosen": -4.432346820831299, "logps/rejected": -72.02410888671875, "loss": 0.31357499957084656, "memory(GiB)": 43.15, "nll_loss": 0.2627772390842438, "rewards/accuracies": 1.0, "rewards/chosen": 0.3896270990371704, "rewards/margins": 5.963184833526611, "rewards/rejected": -5.5735578536987305, "step": 345, "train_speed(iter/s)": 0.010747 }, { "epoch": 1.2094240837696335, "grad_norm": 1.5276520252227783, "learning_rate": 0.00013920120742337254, "logits/chosen": -0.4331398904323578, "logits/rejected": -0.6702686548233032, "logps/chosen": -5.334844589233398, "logps/rejected": -66.99110412597656, "loss": 0.41836920380592346, "memory(GiB)": 43.15, "nll_loss": 0.3846779465675354, "rewards/accuracies": 1.0, "rewards/chosen": 0.30076733231544495, "rewards/margins": 5.455785274505615, "rewards/rejected": -5.155017852783203, "step": 346, "train_speed(iter/s)": 0.010748 }, { "epoch": 1.212914485165794, "grad_norm": 2.6530966758728027, "learning_rate": 0.00013884629867920854, "logits/chosen": -0.42600876092910767, "logits/rejected": -0.6288998126983643, "logps/chosen": -4.370656967163086, "logps/rejected": -60.58926010131836, "loss": 0.5389068126678467, "memory(GiB)": 43.15, "nll_loss": 0.4162063002586365, "rewards/accuracies": 0.96875, "rewards/chosen": 0.2829643189907074, "rewards/margins": 4.741201400756836, "rewards/rejected": -4.4582366943359375, "step": 347, "train_speed(iter/s)": 0.010748 }, { "epoch": 1.2164048865619546, "grad_norm": 2.025510311126709, "learning_rate": 0.00013849081272532544, "logits/chosen": -0.42667314410209656, "logits/rejected": -0.6648786067962646, "logps/chosen": -5.017510414123535, "logps/rejected": -76.23703002929688, "loss": 0.4896831512451172, "memory(GiB)": 43.15, "nll_loss": 0.3755706548690796, "rewards/accuracies": 0.9375, "rewards/chosen": 0.2456466108560562, "rewards/margins": 6.204758167266846, "rewards/rejected": -5.95911169052124, "step": 348, "train_speed(iter/s)": 0.010748 }, { "epoch": 1.2198952879581153, "grad_norm": 1.5598872900009155, "learning_rate": 0.000138134754843821, "logits/chosen": -0.46219947934150696, "logits/rejected": -0.6632512211799622, "logps/chosen": -3.0970990657806396, "logps/rejected": -67.87566375732422, "loss": 0.24084413051605225, "memory(GiB)": 43.15, "nll_loss": 0.20238317549228668, "rewards/accuracies": 1.0, "rewards/chosen": 0.20403513312339783, "rewards/margins": 5.524411678314209, "rewards/rejected": -5.320376396179199, "step": 349, "train_speed(iter/s)": 0.010748 }, { "epoch": 1.2233856893542758, "grad_norm": 4.688317775726318, "learning_rate": 0.00013777813032529116, "logits/chosen": -0.5623309016227722, "logits/rejected": -0.6962246298789978, "logps/chosen": -4.781303405761719, "logps/rejected": -58.7125244140625, "loss": 0.4752863645553589, "memory(GiB)": 43.15, "nll_loss": 0.36557623744010925, "rewards/accuracies": 0.96875, "rewards/chosen": 0.3706919252872467, "rewards/margins": 4.9188079833984375, "rewards/rejected": -4.548116207122803, "step": 350, "train_speed(iter/s)": 0.010748 }, { "epoch": 1.2268760907504364, "grad_norm": 3.3078691959381104, "learning_rate": 0.0001374209444687514, "logits/chosen": -0.40793412923812866, "logits/rejected": -0.674126923084259, "logps/chosen": -4.038498401641846, "logps/rejected": -79.37727355957031, "loss": 0.3362622857093811, "memory(GiB)": 43.15, "nll_loss": 0.2403348684310913, "rewards/accuracies": 0.96875, "rewards/chosen": 0.1741873025894165, "rewards/margins": 6.036406517028809, "rewards/rejected": -5.862218856811523, "step": 351, "train_speed(iter/s)": 0.010748 }, { "epoch": 1.2303664921465969, "grad_norm": 26.792097091674805, "learning_rate": 0.000137063202581558, "logits/chosen": -0.5794625878334045, "logits/rejected": -0.5993282198905945, "logps/chosen": -6.951697826385498, "logps/rejected": -56.99049377441406, "loss": 0.5700662732124329, "memory(GiB)": 43.15, "nll_loss": 0.47176504135131836, "rewards/accuracies": 0.96875, "rewards/chosen": 0.23041146993637085, "rewards/margins": 4.97003698348999, "rewards/rejected": -4.739625453948975, "step": 352, "train_speed(iter/s)": 0.010748 }, { "epoch": 1.2338568935427574, "grad_norm": 1.5458157062530518, "learning_rate": 0.00013670490997932922, "logits/chosen": -0.4155159592628479, "logits/rejected": -0.6365483403205872, "logps/chosen": -5.431699752807617, "logps/rejected": -76.18798065185547, "loss": 0.401727557182312, "memory(GiB)": 43.15, "nll_loss": 0.3681918978691101, "rewards/accuracies": 1.0, "rewards/chosen": 0.21467794477939606, "rewards/margins": 6.059256076812744, "rewards/rejected": -5.844577312469482, "step": 353, "train_speed(iter/s)": 0.010748 }, { "epoch": 1.237347294938918, "grad_norm": 2.289004325866699, "learning_rate": 0.0001363460719858663, "logits/chosen": -0.4773619472980499, "logits/rejected": -0.6628973484039307, "logps/chosen": -4.388545513153076, "logps/rejected": -64.09728240966797, "loss": 0.4164501428604126, "memory(GiB)": 43.15, "nll_loss": 0.32804638147354126, "rewards/accuracies": 1.0, "rewards/chosen": 0.1376553624868393, "rewards/margins": 5.028504371643066, "rewards/rejected": -4.8908491134643555, "step": 354, "train_speed(iter/s)": 0.010748 }, { "epoch": 1.2408376963350785, "grad_norm": 4.971522808074951, "learning_rate": 0.00013598669393307427, "logits/chosen": -0.597011387348175, "logits/rejected": -0.6669636368751526, "logps/chosen": -6.635625839233398, "logps/rejected": -56.963565826416016, "loss": 0.6429786086082458, "memory(GiB)": 43.15, "nll_loss": 0.42030149698257446, "rewards/accuracies": 0.9375, "rewards/chosen": -0.17075896263122559, "rewards/margins": 4.277583122253418, "rewards/rejected": -4.448342323303223, "step": 355, "train_speed(iter/s)": 0.010748 }, { "epoch": 1.244328097731239, "grad_norm": 2.402831792831421, "learning_rate": 0.00013562678116088293, "logits/chosen": -0.5042529702186584, "logits/rejected": -0.6746811866760254, "logps/chosen": -4.892055988311768, "logps/rejected": -72.40818786621094, "loss": 0.4584486782550812, "memory(GiB)": 43.15, "nll_loss": 0.39387038350105286, "rewards/accuracies": 1.0, "rewards/chosen": 0.2380715012550354, "rewards/margins": 6.017812252044678, "rewards/rejected": -5.779740333557129, "step": 356, "train_speed(iter/s)": 0.010748 }, { "epoch": 1.2478184991273997, "grad_norm": 4.964642524719238, "learning_rate": 0.00013526633901716725, "logits/chosen": -0.4217373728752136, "logits/rejected": -0.5746545791625977, "logps/chosen": -4.907092571258545, "logps/rejected": -62.99272155761719, "loss": 0.42838555574417114, "memory(GiB)": 43.15, "nll_loss": 0.31198155879974365, "rewards/accuracies": 0.9375, "rewards/chosen": 0.18360355496406555, "rewards/margins": 5.089962482452393, "rewards/rejected": -4.90635871887207, "step": 357, "train_speed(iter/s)": 0.010748 }, { "epoch": 1.2513089005235603, "grad_norm": 1.2928236722946167, "learning_rate": 0.00013490537285766808, "logits/chosen": -0.5333009958267212, "logits/rejected": -0.7148969173431396, "logps/chosen": -4.048029899597168, "logps/rejected": -66.88418579101562, "loss": 0.32720184326171875, "memory(GiB)": 43.15, "nll_loss": 0.2798851728439331, "rewards/accuracies": 1.0, "rewards/chosen": 0.3548097014427185, "rewards/margins": 5.343298435211182, "rewards/rejected": -4.988488674163818, "step": 358, "train_speed(iter/s)": 0.010748 }, { "epoch": 1.2547993019197208, "grad_norm": 1.6423141956329346, "learning_rate": 0.00013454388804591254, "logits/chosen": -0.5600902438163757, "logits/rejected": -0.644845187664032, "logps/chosen": -5.385828018188477, "logps/rejected": -59.31862258911133, "loss": 0.45650359988212585, "memory(GiB)": 43.15, "nll_loss": 0.3494071960449219, "rewards/accuracies": 0.96875, "rewards/chosen": 0.23318687081336975, "rewards/margins": 4.714806079864502, "rewards/rejected": -4.481619358062744, "step": 359, "train_speed(iter/s)": 0.010748 }, { "epoch": 1.2582897033158813, "grad_norm": 1.255145788192749, "learning_rate": 0.00013418188995313423, "logits/chosen": -0.34982648491859436, "logits/rejected": -0.6173741221427917, "logps/chosen": -3.911236524581909, "logps/rejected": -74.90790557861328, "loss": 0.3336854577064514, "memory(GiB)": 43.15, "nll_loss": 0.2689821124076843, "rewards/accuracies": 1.0, "rewards/chosen": 0.27013736963272095, "rewards/margins": 5.215266227722168, "rewards/rejected": -4.945127487182617, "step": 360, "train_speed(iter/s)": 0.010748 }, { "epoch": 1.2617801047120418, "grad_norm": 1.7591581344604492, "learning_rate": 0.00013381938395819353, "logits/chosen": -0.40532568097114563, "logits/rejected": -0.597572922706604, "logps/chosen": -5.498960971832275, "logps/rejected": -64.85173034667969, "loss": 0.38682490587234497, "memory(GiB)": 43.15, "nll_loss": 0.29091084003448486, "rewards/accuracies": 1.0, "rewards/chosen": 0.25826895236968994, "rewards/margins": 4.7590532302856445, "rewards/rejected": -4.500784397125244, "step": 361, "train_speed(iter/s)": 0.010748 }, { "epoch": 1.2652705061082026, "grad_norm": 1.7910423278808594, "learning_rate": 0.00013345637544749775, "logits/chosen": -0.4055846035480499, "logits/rejected": -0.6238888502120972, "logps/chosen": -7.300588130950928, "logps/rejected": -61.26845169067383, "loss": 0.4961000680923462, "memory(GiB)": 43.15, "nll_loss": 0.42045268416404724, "rewards/accuracies": 1.0, "rewards/chosen": 0.22531506419181824, "rewards/margins": 4.594475269317627, "rewards/rejected": -4.369160175323486, "step": 362, "train_speed(iter/s)": 0.010748 }, { "epoch": 1.268760907504363, "grad_norm": 1.6129978895187378, "learning_rate": 0.00013309286981492085, "logits/chosen": -0.39129945635795593, "logits/rejected": -0.6439290046691895, "logps/chosen": -3.721993923187256, "logps/rejected": -69.40048217773438, "loss": 0.3446144163608551, "memory(GiB)": 43.15, "nll_loss": 0.2827191948890686, "rewards/accuracies": 1.0, "rewards/chosen": 0.15239138901233673, "rewards/margins": 4.774838447570801, "rewards/rejected": -4.622446537017822, "step": 363, "train_speed(iter/s)": 0.010748 }, { "epoch": 1.2722513089005236, "grad_norm": 1.268687129020691, "learning_rate": 0.00013272887246172343, "logits/chosen": -0.5232235193252563, "logits/rejected": -0.7373345494270325, "logps/chosen": -2.54833722114563, "logps/rejected": -60.53718566894531, "loss": 0.2926982343196869, "memory(GiB)": 43.15, "nll_loss": 0.229936420917511, "rewards/accuracies": 1.0, "rewards/chosen": 0.21947187185287476, "rewards/margins": 4.873050689697266, "rewards/rejected": -4.653579235076904, "step": 364, "train_speed(iter/s)": 0.010748 }, { "epoch": 1.2757417102966842, "grad_norm": 1.1374390125274658, "learning_rate": 0.00013236438879647255, "logits/chosen": -0.4346693158149719, "logits/rejected": -0.6651886105537415, "logps/chosen": -3.06109619140625, "logps/rejected": -58.315589904785156, "loss": 0.31402793526649475, "memory(GiB)": 43.15, "nll_loss": 0.23573513329029083, "rewards/accuracies": 1.0, "rewards/chosen": 0.2153843492269516, "rewards/margins": 4.50330924987793, "rewards/rejected": -4.2879252433776855, "step": 365, "train_speed(iter/s)": 0.010748 }, { "epoch": 1.2792321116928447, "grad_norm": 1.2531336545944214, "learning_rate": 0.00013199942423496123, "logits/chosen": -0.5495594143867493, "logits/rejected": -0.6571058034896851, "logps/chosen": -3.8754944801330566, "logps/rejected": -57.72053146362305, "loss": 0.37907201051712036, "memory(GiB)": 43.15, "nll_loss": 0.3117825984954834, "rewards/accuracies": 0.96875, "rewards/chosen": 0.25686168670654297, "rewards/margins": 4.914424896240234, "rewards/rejected": -4.657562732696533, "step": 366, "train_speed(iter/s)": 0.010748 }, { "epoch": 1.2827225130890052, "grad_norm": 1.3153668642044067, "learning_rate": 0.00013163398420012808, "logits/chosen": -0.4384489357471466, "logits/rejected": -0.603872537612915, "logps/chosen": -5.088449478149414, "logps/rejected": -58.85956573486328, "loss": 0.4146476984024048, "memory(GiB)": 43.15, "nll_loss": 0.3133094012737274, "rewards/accuracies": 1.0, "rewards/chosen": 0.34978798031806946, "rewards/margins": 4.592877388000488, "rewards/rejected": -4.243089199066162, "step": 367, "train_speed(iter/s)": 0.010748 }, { "epoch": 1.2862129144851657, "grad_norm": 1.0968199968338013, "learning_rate": 0.00013126807412197665, "logits/chosen": -0.5985041260719299, "logits/rejected": -0.6937984824180603, "logps/chosen": -3.8719797134399414, "logps/rejected": -63.86729049682617, "loss": 0.3036377727985382, "memory(GiB)": 43.15, "nll_loss": 0.2704383432865143, "rewards/accuracies": 1.0, "rewards/chosen": 0.30202141404151917, "rewards/margins": 5.531611442565918, "rewards/rejected": -5.229589462280273, "step": 368, "train_speed(iter/s)": 0.010748 }, { "epoch": 1.2897033158813263, "grad_norm": 1.6636030673980713, "learning_rate": 0.00013090169943749476, "logits/chosen": -0.35927969217300415, "logits/rejected": -0.6646055579185486, "logps/chosen": -2.9964470863342285, "logps/rejected": -71.79264831542969, "loss": 0.39267948269844055, "memory(GiB)": 43.15, "nll_loss": 0.3159026503562927, "rewards/accuracies": 1.0, "rewards/chosen": 0.28754928708076477, "rewards/margins": 5.463479995727539, "rewards/rejected": -5.175930976867676, "step": 369, "train_speed(iter/s)": 0.010748 }, { "epoch": 1.2931937172774868, "grad_norm": 5.024345397949219, "learning_rate": 0.00013053486559057374, "logits/chosen": -0.5237628221511841, "logits/rejected": -0.716973066329956, "logps/chosen": -2.4937894344329834, "logps/rejected": -60.08405303955078, "loss": 0.30608034133911133, "memory(GiB)": 43.15, "nll_loss": 0.2122155725955963, "rewards/accuracies": 0.96875, "rewards/chosen": 0.21323460340499878, "rewards/margins": 4.852639675140381, "rewards/rejected": -4.639405250549316, "step": 370, "train_speed(iter/s)": 0.010748 }, { "epoch": 1.2966841186736475, "grad_norm": 1.1299628019332886, "learning_rate": 0.00013016757803192757, "logits/chosen": -0.5134186744689941, "logits/rejected": -0.6998711228370667, "logps/chosen": -3.4617767333984375, "logps/rejected": -75.16548919677734, "loss": 0.2562916576862335, "memory(GiB)": 43.15, "nll_loss": 0.23842087388038635, "rewards/accuracies": 1.0, "rewards/chosen": 0.31686967611312866, "rewards/margins": 6.462481498718262, "rewards/rejected": -6.145611763000488, "step": 371, "train_speed(iter/s)": 0.010748 }, { "epoch": 1.300174520069808, "grad_norm": 1.3862718343734741, "learning_rate": 0.00012979984221901173, "logits/chosen": -0.5728235840797424, "logits/rejected": -0.7681739330291748, "logps/chosen": -3.975404739379883, "logps/rejected": -64.77377319335938, "loss": 0.37514734268188477, "memory(GiB)": 43.15, "nll_loss": 0.28942835330963135, "rewards/accuracies": 0.96875, "rewards/chosen": 0.19743427634239197, "rewards/margins": 5.269680976867676, "rewards/rejected": -5.072246551513672, "step": 372, "train_speed(iter/s)": 0.010748 }, { "epoch": 1.3036649214659686, "grad_norm": 1.4730603694915771, "learning_rate": 0.00012943166361594242, "logits/chosen": -0.5595740079879761, "logits/rejected": -0.703965425491333, "logps/chosen": -4.846633434295654, "logps/rejected": -65.64612579345703, "loss": 0.3534131348133087, "memory(GiB)": 43.15, "nll_loss": 0.3020310401916504, "rewards/accuracies": 0.96875, "rewards/chosen": 0.15922296047210693, "rewards/margins": 5.3241071701049805, "rewards/rejected": -5.164884567260742, "step": 373, "train_speed(iter/s)": 0.010748 }, { "epoch": 1.307155322862129, "grad_norm": 1.5823194980621338, "learning_rate": 0.00012906304769341493, "logits/chosen": -0.5636857151985168, "logits/rejected": -0.7057007551193237, "logps/chosen": -7.8343048095703125, "logps/rejected": -75.39463806152344, "loss": 0.4537757635116577, "memory(GiB)": 43.15, "nll_loss": 0.36747270822525024, "rewards/accuracies": 0.96875, "rewards/chosen": 0.44301411509513855, "rewards/margins": 6.434762477874756, "rewards/rejected": -5.991747856140137, "step": 374, "train_speed(iter/s)": 0.010748 }, { "epoch": 1.3106457242582896, "grad_norm": 2.39945650100708, "learning_rate": 0.0001286939999286228, "logits/chosen": -0.6491515636444092, "logits/rejected": -0.7588983774185181, "logps/chosen": -7.3910675048828125, "logps/rejected": -66.71189880371094, "loss": 0.46566852927207947, "memory(GiB)": 43.15, "nll_loss": 0.3986610472202301, "rewards/accuracies": 1.0, "rewards/chosen": 0.3218778073787689, "rewards/margins": 5.600278377532959, "rewards/rejected": -5.278400421142578, "step": 375, "train_speed(iter/s)": 0.010748 }, { "epoch": 1.3141361256544504, "grad_norm": 12.878860473632812, "learning_rate": 0.0001283245258051761, "logits/chosen": -0.6149054765701294, "logits/rejected": -0.7632960081100464, "logps/chosen": -3.6257922649383545, "logps/rejected": -65.39382934570312, "loss": 0.36752089858055115, "memory(GiB)": 43.15, "nll_loss": 0.2868227958679199, "rewards/accuracies": 0.96875, "rewards/chosen": 0.34518730640411377, "rewards/margins": 5.607741832733154, "rewards/rejected": -5.26255464553833, "step": 376, "train_speed(iter/s)": 0.010749 }, { "epoch": 1.317626527050611, "grad_norm": 4.349419593811035, "learning_rate": 0.00012795463081302018, "logits/chosen": -0.48424577713012695, "logits/rejected": -0.7138010263442993, "logps/chosen": -5.860461711883545, "logps/rejected": -69.88520812988281, "loss": 0.5185278654098511, "memory(GiB)": 43.15, "nll_loss": 0.3800834119319916, "rewards/accuracies": 0.9375, "rewards/chosen": 0.3379773497581482, "rewards/margins": 5.424846172332764, "rewards/rejected": -5.086869716644287, "step": 377, "train_speed(iter/s)": 0.010749 }, { "epoch": 1.3211169284467714, "grad_norm": 2.1673505306243896, "learning_rate": 0.00012758432044835392, "logits/chosen": -0.5925784111022949, "logits/rejected": -0.7586888670921326, "logps/chosen": -4.270134925842285, "logps/rejected": -70.65003967285156, "loss": 0.4049075245857239, "memory(GiB)": 43.15, "nll_loss": 0.33120524883270264, "rewards/accuracies": 1.0, "rewards/chosen": 0.20168441534042358, "rewards/margins": 5.87272834777832, "rewards/rejected": -5.67104434967041, "step": 378, "train_speed(iter/s)": 0.010749 }, { "epoch": 1.324607329842932, "grad_norm": 10.76476001739502, "learning_rate": 0.00012721360021354818, "logits/chosen": -0.5449612736701965, "logits/rejected": -0.7324461936950684, "logps/chosen": -8.914838790893555, "logps/rejected": -71.4675521850586, "loss": 0.5083584189414978, "memory(GiB)": 43.15, "nll_loss": 0.4726629853248596, "rewards/accuracies": 1.0, "rewards/chosen": 0.3555769622325897, "rewards/margins": 6.001497745513916, "rewards/rejected": -5.645921230316162, "step": 379, "train_speed(iter/s)": 0.010749 }, { "epoch": 1.3280977312390925, "grad_norm": 1.7700749635696411, "learning_rate": 0.00012684247561706402, "logits/chosen": -0.5105177760124207, "logits/rejected": -0.7782354950904846, "logps/chosen": -3.1164560317993164, "logps/rejected": -69.61066436767578, "loss": 0.40009862184524536, "memory(GiB)": 43.15, "nll_loss": 0.32328617572784424, "rewards/accuracies": 1.0, "rewards/chosen": 0.27115288376808167, "rewards/margins": 5.493119716644287, "rewards/rejected": -5.221966743469238, "step": 380, "train_speed(iter/s)": 0.010749 }, { "epoch": 1.331588132635253, "grad_norm": 1.5235404968261719, "learning_rate": 0.00012647095217337078, "logits/chosen": -0.576638400554657, "logits/rejected": -0.7515760660171509, "logps/chosen": -4.216984748840332, "logps/rejected": -76.12001037597656, "loss": 0.3426749110221863, "memory(GiB)": 43.15, "nll_loss": 0.28955399990081787, "rewards/accuracies": 0.96875, "rewards/chosen": 0.24891535937786102, "rewards/margins": 6.022099494934082, "rewards/rejected": -5.773184776306152, "step": 381, "train_speed(iter/s)": 0.010749 }, { "epoch": 1.3350785340314135, "grad_norm": 1.1489766836166382, "learning_rate": 0.00012609903540286422, "logits/chosen": -0.5197568535804749, "logits/rejected": -0.6939013004302979, "logps/chosen": -7.216485977172852, "logps/rejected": -77.32923889160156, "loss": 0.4592680335044861, "memory(GiB)": 43.15, "nll_loss": 0.39243242144584656, "rewards/accuracies": 0.96875, "rewards/chosen": 0.27840492129325867, "rewards/margins": 6.491175651550293, "rewards/rejected": -6.212770938873291, "step": 382, "train_speed(iter/s)": 0.010749 }, { "epoch": 1.338568935427574, "grad_norm": 1.7705833911895752, "learning_rate": 0.0001257267308317845, "logits/chosen": -0.49760669469833374, "logits/rejected": -0.7222346067428589, "logps/chosen": -5.577725410461426, "logps/rejected": -75.5153579711914, "loss": 0.39679276943206787, "memory(GiB)": 43.15, "nll_loss": 0.3286840319633484, "rewards/accuracies": 1.0, "rewards/chosen": 0.4885926842689514, "rewards/margins": 6.211091041564941, "rewards/rejected": -5.722498416900635, "step": 383, "train_speed(iter/s)": 0.010749 }, { "epoch": 1.3420593368237348, "grad_norm": 4.093616008758545, "learning_rate": 0.00012535404399213393, "logits/chosen": -0.6001275181770325, "logits/rejected": -0.7799440622329712, "logps/chosen": -4.971902847290039, "logps/rejected": -74.22907257080078, "loss": 0.40544986724853516, "memory(GiB)": 43.15, "nll_loss": 0.30647265911102295, "rewards/accuracies": 0.9375, "rewards/chosen": 0.222365140914917, "rewards/margins": 5.5865654945373535, "rewards/rejected": -5.364200592041016, "step": 384, "train_speed(iter/s)": 0.010749 }, { "epoch": 1.3455497382198953, "grad_norm": 1.860032081604004, "learning_rate": 0.000124980980421595, "logits/chosen": -0.49115800857543945, "logits/rejected": -0.70196932554245, "logps/chosen": -7.895517826080322, "logps/rejected": -78.90962982177734, "loss": 0.5182665586471558, "memory(GiB)": 43.15, "nll_loss": 0.46628567576408386, "rewards/accuracies": 1.0, "rewards/chosen": 0.32257279753685, "rewards/margins": 6.41339111328125, "rewards/rejected": -6.090818405151367, "step": 385, "train_speed(iter/s)": 0.010749 }, { "epoch": 1.3490401396160558, "grad_norm": 1.2258514165878296, "learning_rate": 0.00012460754566344796, "logits/chosen": -0.5766517519950867, "logits/rejected": -0.6811379194259644, "logps/chosen": -4.616692066192627, "logps/rejected": -62.37327194213867, "loss": 0.3498663902282715, "memory(GiB)": 43.15, "nll_loss": 0.26951494812965393, "rewards/accuracies": 1.0, "rewards/chosen": 0.3747017979621887, "rewards/margins": 5.300102710723877, "rewards/rejected": -4.925401210784912, "step": 386, "train_speed(iter/s)": 0.010749 }, { "epoch": 1.3525305410122164, "grad_norm": 2.228578805923462, "learning_rate": 0.0001242337452664884, "logits/chosen": -0.5187143683433533, "logits/rejected": -0.6932430863380432, "logps/chosen": -4.746977806091309, "logps/rejected": -69.02983856201172, "loss": 0.48509079217910767, "memory(GiB)": 43.15, "nll_loss": 0.41189730167388916, "rewards/accuracies": 1.0, "rewards/chosen": 0.26210126280784607, "rewards/margins": 5.590664863586426, "rewards/rejected": -5.328563213348389, "step": 387, "train_speed(iter/s)": 0.010749 }, { "epoch": 1.356020942408377, "grad_norm": 1.4744908809661865, "learning_rate": 0.00012385958478494487, "logits/chosen": -0.45504745841026306, "logits/rejected": -0.7032338976860046, "logps/chosen": -3.22519588470459, "logps/rejected": -84.13624572753906, "loss": 0.2042679786682129, "memory(GiB)": 43.15, "nll_loss": 0.17380760610103607, "rewards/accuracies": 1.0, "rewards/chosen": 0.3250097632408142, "rewards/margins": 6.8548583984375, "rewards/rejected": -6.529849529266357, "step": 388, "train_speed(iter/s)": 0.010749 }, { "epoch": 1.3595113438045376, "grad_norm": 1.0986099243164062, "learning_rate": 0.0001234850697783964, "logits/chosen": -0.537411093711853, "logits/rejected": -0.7160115242004395, "logps/chosen": -5.000178337097168, "logps/rejected": -64.82563781738281, "loss": 0.3837279975414276, "memory(GiB)": 43.15, "nll_loss": 0.324247807264328, "rewards/accuracies": 1.0, "rewards/chosen": 0.3417741656303406, "rewards/margins": 5.4918107986450195, "rewards/rejected": -5.150036811828613, "step": 389, "train_speed(iter/s)": 0.010749 }, { "epoch": 1.3630017452006982, "grad_norm": 1.2075557708740234, "learning_rate": 0.00012311020581168972, "logits/chosen": -0.550103485584259, "logits/rejected": -0.6733621954917908, "logps/chosen": -7.16984748840332, "logps/rejected": -66.13978576660156, "loss": 0.363157719373703, "memory(GiB)": 43.15, "nll_loss": 0.3398098349571228, "rewards/accuracies": 1.0, "rewards/chosen": 0.5980087518692017, "rewards/margins": 5.761294364929199, "rewards/rejected": -5.163285255432129, "step": 390, "train_speed(iter/s)": 0.010749 }, { "epoch": 1.3664921465968587, "grad_norm": 2.592634677886963, "learning_rate": 0.00012273499845485695, "logits/chosen": -0.5785650014877319, "logits/rejected": -0.754797637462616, "logps/chosen": -5.5793585777282715, "logps/rejected": -64.19160461425781, "loss": 0.3668617010116577, "memory(GiB)": 43.15, "nll_loss": 0.33123254776000977, "rewards/accuracies": 1.0, "rewards/chosen": 0.2795164883136749, "rewards/margins": 5.247326850891113, "rewards/rejected": -4.967810153961182, "step": 391, "train_speed(iter/s)": 0.010749 }, { "epoch": 1.3699825479930192, "grad_norm": 2.1149039268493652, "learning_rate": 0.00012235945328303226, "logits/chosen": -0.40138736367225647, "logits/rejected": -0.6702361702919006, "logps/chosen": -3.509735584259033, "logps/rejected": -76.15532684326172, "loss": 0.28672605752944946, "memory(GiB)": 43.15, "nll_loss": 0.2373819351196289, "rewards/accuracies": 1.0, "rewards/chosen": 0.31093913316726685, "rewards/margins": 5.402565002441406, "rewards/rejected": -5.091626167297363, "step": 392, "train_speed(iter/s)": 0.010749 }, { "epoch": 1.3734729493891797, "grad_norm": 0.9537525177001953, "learning_rate": 0.00012198357587636957, "logits/chosen": -0.5130572319030762, "logits/rejected": -0.7259546518325806, "logps/chosen": -4.134064674377441, "logps/rejected": -73.6041030883789, "loss": 0.34708356857299805, "memory(GiB)": 43.15, "nll_loss": 0.305166631937027, "rewards/accuracies": 1.0, "rewards/chosen": 0.39239123463630676, "rewards/margins": 6.155148506164551, "rewards/rejected": -5.762757301330566, "step": 393, "train_speed(iter/s)": 0.010749 }, { "epoch": 1.3769633507853403, "grad_norm": 2.37007999420166, "learning_rate": 0.00012160737181995936, "logits/chosen": -0.491438627243042, "logits/rejected": -0.6527938842773438, "logps/chosen": -7.896700382232666, "logps/rejected": -81.0208969116211, "loss": 0.3957880139350891, "memory(GiB)": 43.15, "nll_loss": 0.36261922121047974, "rewards/accuracies": 1.0, "rewards/chosen": 0.7101905941963196, "rewards/margins": 6.88217306137085, "rewards/rejected": -6.1719818115234375, "step": 394, "train_speed(iter/s)": 0.010749 }, { "epoch": 1.3804537521815008, "grad_norm": 1.6053402423858643, "learning_rate": 0.0001212308467037457, "logits/chosen": -0.5596390962600708, "logits/rejected": -0.6721497178077698, "logps/chosen": -5.880399703979492, "logps/rejected": -72.99723052978516, "loss": 0.3911302089691162, "memory(GiB)": 43.15, "nll_loss": 0.30207929015159607, "rewards/accuracies": 1.0, "rewards/chosen": 0.3339996039867401, "rewards/margins": 6.267764568328857, "rewards/rejected": -5.933764934539795, "step": 395, "train_speed(iter/s)": 0.010749 }, { "epoch": 1.3839441535776613, "grad_norm": 1.745980978012085, "learning_rate": 0.00012085400612244322, "logits/chosen": -0.4846367835998535, "logits/rejected": -0.6683922410011292, "logps/chosen": -6.298645496368408, "logps/rejected": -79.30961608886719, "loss": 0.43555381894111633, "memory(GiB)": 43.15, "nll_loss": 0.33482685685157776, "rewards/accuracies": 0.9375, "rewards/chosen": 0.17846114933490753, "rewards/margins": 6.246786594390869, "rewards/rejected": -6.068325519561768, "step": 396, "train_speed(iter/s)": 0.010749 }, { "epoch": 1.387434554973822, "grad_norm": 4.111983776092529, "learning_rate": 0.00012047685567545405, "logits/chosen": -0.3804283142089844, "logits/rejected": -0.7110333442687988, "logps/chosen": -5.558120250701904, "logps/rejected": -88.71563720703125, "loss": 0.5450111031532288, "memory(GiB)": 43.15, "nll_loss": 0.41072627902030945, "rewards/accuracies": 0.9375, "rewards/chosen": 0.2601194977760315, "rewards/margins": 6.857279300689697, "rewards/rejected": -6.597159385681152, "step": 397, "train_speed(iter/s)": 0.010749 }, { "epoch": 1.3909249563699826, "grad_norm": 1.6386064291000366, "learning_rate": 0.00012009940096678452, "logits/chosen": -0.44062259793281555, "logits/rejected": -0.7049256563186646, "logps/chosen": -5.1494059562683105, "logps/rejected": -77.1871337890625, "loss": 0.32311907410621643, "memory(GiB)": 43.15, "nll_loss": 0.24005520343780518, "rewards/accuracies": 1.0, "rewards/chosen": 0.36464688181877136, "rewards/margins": 6.342651844024658, "rewards/rejected": -5.978005409240723, "step": 398, "train_speed(iter/s)": 0.010748 }, { "epoch": 1.3944153577661431, "grad_norm": 1.3504530191421509, "learning_rate": 0.00011972164760496187, "logits/chosen": -0.42509207129478455, "logits/rejected": -0.7086035013198853, "logps/chosen": -3.266116142272949, "logps/rejected": -78.83551788330078, "loss": 0.3055873513221741, "memory(GiB)": 43.15, "nll_loss": 0.23884357511997223, "rewards/accuracies": 1.0, "rewards/chosen": 0.2924925684928894, "rewards/margins": 6.441683292388916, "rewards/rejected": -6.149190425872803, "step": 399, "train_speed(iter/s)": 0.010748 }, { "epoch": 1.3979057591623036, "grad_norm": 1.7327511310577393, "learning_rate": 0.00011934360120295106, "logits/chosen": -0.4947013556957245, "logits/rejected": -0.7843842506408691, "logps/chosen": -3.727259635925293, "logps/rejected": -82.5062255859375, "loss": 0.3797696828842163, "memory(GiB)": 43.15, "nll_loss": 0.3138769268989563, "rewards/accuracies": 1.0, "rewards/chosen": 0.26138922572135925, "rewards/margins": 6.876194000244141, "rewards/rejected": -6.614805221557617, "step": 400, "train_speed(iter/s)": 0.010748 }, { "epoch": 1.4013961605584642, "grad_norm": 2.4903643131256104, "learning_rate": 0.00011896526737807123, "logits/chosen": -0.4609818756580353, "logits/rejected": -0.7451502084732056, "logps/chosen": -5.295093536376953, "logps/rejected": -84.0618667602539, "loss": 0.4176844656467438, "memory(GiB)": 43.15, "nll_loss": 0.37628936767578125, "rewards/accuracies": 1.0, "rewards/chosen": 0.4193187952041626, "rewards/margins": 6.849295616149902, "rewards/rejected": -6.429976463317871, "step": 401, "train_speed(iter/s)": 0.010744 }, { "epoch": 1.404886561954625, "grad_norm": 4.363712787628174, "learning_rate": 0.00011858665175191232, "logits/chosen": -0.5121644139289856, "logits/rejected": -0.7446450591087341, "logps/chosen": -6.169421195983887, "logps/rejected": -78.18269348144531, "loss": 0.528075635433197, "memory(GiB)": 43.15, "nll_loss": 0.4192356467247009, "rewards/accuracies": 0.96875, "rewards/chosen": 0.1313595473766327, "rewards/margins": 6.1796555519104, "rewards/rejected": -6.0482964515686035, "step": 402, "train_speed(iter/s)": 0.010744 }, { "epoch": 1.4083769633507854, "grad_norm": 10.279874801635742, "learning_rate": 0.00011820775995025147, "logits/chosen": -0.5245956182479858, "logits/rejected": -0.701598584651947, "logps/chosen": -7.414410591125488, "logps/rejected": -72.86483764648438, "loss": 0.7285939455032349, "memory(GiB)": 43.15, "nll_loss": 0.5291787981987, "rewards/accuracies": 0.9375, "rewards/chosen": 0.1376880556344986, "rewards/margins": 6.163814544677734, "rewards/rejected": -6.026126861572266, "step": 403, "train_speed(iter/s)": 0.010744 }, { "epoch": 1.411867364746946, "grad_norm": 13.068238258361816, "learning_rate": 0.00011782859760296943, "logits/chosen": -0.5409221053123474, "logits/rejected": -0.7858689427375793, "logps/chosen": -7.152325630187988, "logps/rejected": -79.44561767578125, "loss": 0.878388524055481, "memory(GiB)": 43.15, "nll_loss": 0.7040680050849915, "rewards/accuracies": 0.96875, "rewards/chosen": 0.03869117796421051, "rewards/margins": 6.490888595581055, "rewards/rejected": -6.45219612121582, "step": 404, "train_speed(iter/s)": 0.010744 }, { "epoch": 1.4153577661431065, "grad_norm": 1.4294313192367554, "learning_rate": 0.00011744917034396697, "logits/chosen": -0.5631940960884094, "logits/rejected": -0.664790153503418, "logps/chosen": -5.726756572723389, "logps/rejected": -69.50979614257812, "loss": 0.40249183773994446, "memory(GiB)": 43.15, "nll_loss": 0.32488980889320374, "rewards/accuracies": 1.0, "rewards/chosen": 0.3584996461868286, "rewards/margins": 5.730526447296143, "rewards/rejected": -5.372026443481445, "step": 405, "train_speed(iter/s)": 0.010744 }, { "epoch": 1.418848167539267, "grad_norm": 1.297458529472351, "learning_rate": 0.00011706948381108116, "logits/chosen": -0.49395444989204407, "logits/rejected": -0.7352310419082642, "logps/chosen": -3.01485276222229, "logps/rejected": -72.34119415283203, "loss": 0.2647218108177185, "memory(GiB)": 43.15, "nll_loss": 0.2067299783229828, "rewards/accuracies": 1.0, "rewards/chosen": 0.1923447847366333, "rewards/margins": 5.942482948303223, "rewards/rejected": -5.750137805938721, "step": 406, "train_speed(iter/s)": 0.010744 }, { "epoch": 1.4223385689354275, "grad_norm": 1.5999650955200195, "learning_rate": 0.00011668954364600153, "logits/chosen": -0.456596702337265, "logits/rejected": -0.6609106063842773, "logps/chosen": -3.8558003902435303, "logps/rejected": -69.09425354003906, "loss": 0.32530221343040466, "memory(GiB)": 43.15, "nll_loss": 0.280635803937912, "rewards/accuracies": 1.0, "rewards/chosen": 0.20687787234783173, "rewards/margins": 5.761228084564209, "rewards/rejected": -5.554349899291992, "step": 407, "train_speed(iter/s)": 0.010744 }, { "epoch": 1.425828970331588, "grad_norm": 11.606874465942383, "learning_rate": 0.00011630935549418627, "logits/chosen": -0.562304675579071, "logits/rejected": -0.732158899307251, "logps/chosen": -4.860799312591553, "logps/rejected": -73.3448715209961, "loss": 0.412598192691803, "memory(GiB)": 43.15, "nll_loss": 0.2766556143760681, "rewards/accuracies": 0.90625, "rewards/chosen": 0.25393882393836975, "rewards/margins": 5.896204471588135, "rewards/rejected": -5.642266273498535, "step": 408, "train_speed(iter/s)": 0.010744 }, { "epoch": 1.4293193717277486, "grad_norm": 4.748804092407227, "learning_rate": 0.00011592892500477843, "logits/chosen": -0.5332602858543396, "logits/rejected": -0.7645926475524902, "logps/chosen": -6.279226303100586, "logps/rejected": -75.35002899169922, "loss": 0.6248916983604431, "memory(GiB)": 43.15, "nll_loss": 0.46002817153930664, "rewards/accuracies": 0.9375, "rewards/chosen": 0.025768298655748367, "rewards/margins": 5.945999622344971, "rewards/rejected": -5.920231342315674, "step": 409, "train_speed(iter/s)": 0.010744 }, { "epoch": 1.4328097731239091, "grad_norm": 1.5880932807922363, "learning_rate": 0.00011554825783052181, "logits/chosen": -0.5537830591201782, "logits/rejected": -0.7294723391532898, "logps/chosen": -7.196538925170898, "logps/rejected": -64.66232299804688, "loss": 0.4965304136276245, "memory(GiB)": 43.15, "nll_loss": 0.41626840829849243, "rewards/accuracies": 0.96875, "rewards/chosen": 0.30123329162597656, "rewards/margins": 5.4694390296936035, "rewards/rejected": -5.168205261230469, "step": 410, "train_speed(iter/s)": 0.010744 }, { "epoch": 1.4363001745200699, "grad_norm": 1.2536892890930176, "learning_rate": 0.00011516735962767716, "logits/chosen": -0.399604856967926, "logits/rejected": -0.6857424974441528, "logps/chosen": -5.57369327545166, "logps/rejected": -88.55608367919922, "loss": 0.3149430751800537, "memory(GiB)": 43.15, "nll_loss": 0.2797389030456543, "rewards/accuracies": 1.0, "rewards/chosen": 0.31008225679397583, "rewards/margins": 6.985775947570801, "rewards/rejected": -6.675694465637207, "step": 411, "train_speed(iter/s)": 0.010744 }, { "epoch": 1.4397905759162304, "grad_norm": 1.6588139533996582, "learning_rate": 0.00011478623605593795, "logits/chosen": -0.6225078105926514, "logits/rejected": -0.6670627593994141, "logps/chosen": -6.920505523681641, "logps/rejected": -61.97294235229492, "loss": 0.4648480713367462, "memory(GiB)": 43.15, "nll_loss": 0.3973652720451355, "rewards/accuracies": 0.96875, "rewards/chosen": 0.32238057255744934, "rewards/margins": 5.21965217590332, "rewards/rejected": -4.897271633148193, "step": 412, "train_speed(iter/s)": 0.010744 }, { "epoch": 1.443280977312391, "grad_norm": 2.0025949478149414, "learning_rate": 0.00011440489277834645, "logits/chosen": -0.5606848001480103, "logits/rejected": -0.669112503528595, "logps/chosen": -6.905231952667236, "logps/rejected": -62.44579315185547, "loss": 0.5008029341697693, "memory(GiB)": 43.15, "nll_loss": 0.3874211609363556, "rewards/accuracies": 0.96875, "rewards/chosen": 0.2375316321849823, "rewards/margins": 5.009645938873291, "rewards/rejected": -4.772113800048828, "step": 413, "train_speed(iter/s)": 0.010744 }, { "epoch": 1.4467713787085514, "grad_norm": 3.3872854709625244, "learning_rate": 0.0001140233354612094, "logits/chosen": -0.5606234669685364, "logits/rejected": -0.6871129870414734, "logps/chosen": -5.88873291015625, "logps/rejected": -76.19691467285156, "loss": 0.34879976511001587, "memory(GiB)": 43.15, "nll_loss": 0.296891450881958, "rewards/accuracies": 1.0, "rewards/chosen": 0.3382805585861206, "rewards/margins": 6.477003574371338, "rewards/rejected": -6.138722896575928, "step": 414, "train_speed(iter/s)": 0.010745 }, { "epoch": 1.450261780104712, "grad_norm": 1.3678333759307861, "learning_rate": 0.00011364156977401404, "logits/chosen": -0.5135593414306641, "logits/rejected": -0.7239964008331299, "logps/chosen": -5.929028511047363, "logps/rejected": -76.85517120361328, "loss": 0.43436723947525024, "memory(GiB)": 43.15, "nll_loss": 0.37630510330200195, "rewards/accuracies": 1.0, "rewards/chosen": 0.3310508131980896, "rewards/margins": 6.641447067260742, "rewards/rejected": -6.310396671295166, "step": 415, "train_speed(iter/s)": 0.010745 }, { "epoch": 1.4537521815008727, "grad_norm": 1.838230848312378, "learning_rate": 0.00011325960138934359, "logits/chosen": -0.4536757171154022, "logits/rejected": -0.6283993721008301, "logps/chosen": -6.089097023010254, "logps/rejected": -69.50761413574219, "loss": 0.3671635389328003, "memory(GiB)": 43.15, "nll_loss": 0.3000299036502838, "rewards/accuracies": 1.0, "rewards/chosen": 0.2476513832807541, "rewards/margins": 5.625397682189941, "rewards/rejected": -5.37774658203125, "step": 416, "train_speed(iter/s)": 0.010745 }, { "epoch": 1.4572425828970332, "grad_norm": 1.2322739362716675, "learning_rate": 0.00011287743598279324, "logits/chosen": -0.5539292097091675, "logits/rejected": -0.6913775205612183, "logps/chosen": -4.643549919128418, "logps/rejected": -69.86929321289062, "loss": 0.34559106826782227, "memory(GiB)": 43.15, "nll_loss": 0.2662113904953003, "rewards/accuracies": 1.0, "rewards/chosen": 0.18328435719013214, "rewards/margins": 5.924973964691162, "rewards/rejected": -5.741689205169678, "step": 417, "train_speed(iter/s)": 0.010745 }, { "epoch": 1.4607329842931938, "grad_norm": 1.800267219543457, "learning_rate": 0.00011249507923288562, "logits/chosen": -0.4190499186515808, "logits/rejected": -0.5892344117164612, "logps/chosen": -8.646174430847168, "logps/rejected": -73.5853042602539, "loss": 0.5353580713272095, "memory(GiB)": 43.15, "nll_loss": 0.45828354358673096, "rewards/accuracies": 0.96875, "rewards/chosen": 0.5416325926780701, "rewards/margins": 5.931480407714844, "rewards/rejected": -5.389847755432129, "step": 418, "train_speed(iter/s)": 0.010745 }, { "epoch": 1.4642233856893543, "grad_norm": 3.372116804122925, "learning_rate": 0.00011211253682098652, "logits/chosen": -0.5501023530960083, "logits/rejected": -0.7180389761924744, "logps/chosen": -3.604302167892456, "logps/rejected": -72.84112548828125, "loss": 0.3503636419773102, "memory(GiB)": 43.15, "nll_loss": 0.32656538486480713, "rewards/accuracies": 1.0, "rewards/chosen": 0.43345749378204346, "rewards/margins": 6.499542713165283, "rewards/rejected": -6.066085338592529, "step": 419, "train_speed(iter/s)": 0.010745 }, { "epoch": 1.4677137870855148, "grad_norm": 1.3007837533950806, "learning_rate": 0.00011172981443122048, "logits/chosen": -0.6193907260894775, "logits/rejected": -0.6977078914642334, "logps/chosen": -5.653091907501221, "logps/rejected": -58.53229522705078, "loss": 0.3499506115913391, "memory(GiB)": 43.15, "nll_loss": 0.2857433557510376, "rewards/accuracies": 1.0, "rewards/chosen": 0.31003448367118835, "rewards/margins": 5.088003635406494, "rewards/rejected": -4.777968883514404, "step": 420, "train_speed(iter/s)": 0.010745 }, { "epoch": 1.4712041884816753, "grad_norm": 2.268998384475708, "learning_rate": 0.0001113469177503862, "logits/chosen": -0.548383355140686, "logits/rejected": -0.7274916172027588, "logps/chosen": -4.028204441070557, "logps/rejected": -74.34265899658203, "loss": 0.3686060309410095, "memory(GiB)": 43.15, "nll_loss": 0.3145729899406433, "rewards/accuracies": 1.0, "rewards/chosen": 0.2974086403846741, "rewards/margins": 6.226130485534668, "rewards/rejected": -5.928721904754639, "step": 421, "train_speed(iter/s)": 0.010745 }, { "epoch": 1.4746945898778359, "grad_norm": 2.849327325820923, "learning_rate": 0.00011096385246787224, "logits/chosen": -0.4342499077320099, "logits/rejected": -0.58034747838974, "logps/chosen": -4.600721836090088, "logps/rejected": -74.7936782836914, "loss": 0.31432202458381653, "memory(GiB)": 43.15, "nll_loss": 0.2648724913597107, "rewards/accuracies": 1.0, "rewards/chosen": 0.46156781911849976, "rewards/margins": 6.070746898651123, "rewards/rejected": -5.6091790199279785, "step": 422, "train_speed(iter/s)": 0.010745 }, { "epoch": 1.4781849912739964, "grad_norm": 1.789528727531433, "learning_rate": 0.00011058062427557229, "logits/chosen": -0.5314887762069702, "logits/rejected": -0.6687928438186646, "logps/chosen": -3.7092649936676025, "logps/rejected": -70.43209838867188, "loss": 0.41692402958869934, "memory(GiB)": 43.15, "nll_loss": 0.3454267978668213, "rewards/accuracies": 0.96875, "rewards/chosen": 0.4879876375198364, "rewards/margins": 6.042082786560059, "rewards/rejected": -5.554095268249512, "step": 423, "train_speed(iter/s)": 0.010745 }, { "epoch": 1.4816753926701571, "grad_norm": 1.2130359411239624, "learning_rate": 0.00011019723886780076, "logits/chosen": -0.5408445596694946, "logits/rejected": -0.6576545238494873, "logps/chosen": -4.23127555847168, "logps/rejected": -73.83074951171875, "loss": 0.32007429003715515, "memory(GiB)": 43.15, "nll_loss": 0.23954784870147705, "rewards/accuracies": 0.96875, "rewards/chosen": 0.3880947232246399, "rewards/margins": 6.281963348388672, "rewards/rejected": -5.893868446350098, "step": 424, "train_speed(iter/s)": 0.010745 }, { "epoch": 1.4851657940663177, "grad_norm": 3.3867220878601074, "learning_rate": 0.00010981370194120808, "logits/chosen": -0.5246488451957703, "logits/rejected": -0.6161497235298157, "logps/chosen": -6.636181831359863, "logps/rejected": -54.938148498535156, "loss": 0.5445500612258911, "memory(GiB)": 43.15, "nll_loss": 0.40025097131729126, "rewards/accuracies": 0.9375, "rewards/chosen": 0.3486095070838928, "rewards/margins": 4.349201202392578, "rewards/rejected": -4.000591278076172, "step": 425, "train_speed(iter/s)": 0.010745 }, { "epoch": 1.4886561954624782, "grad_norm": 1.267012357711792, "learning_rate": 0.00010943001919469602, "logits/chosen": -0.5046868920326233, "logits/rejected": -0.6956534385681152, "logps/chosen": -3.8510453701019287, "logps/rejected": -72.2486343383789, "loss": 0.3183547258377075, "memory(GiB)": 43.15, "nll_loss": 0.26646360754966736, "rewards/accuracies": 1.0, "rewards/chosen": 0.24279548227787018, "rewards/margins": 6.0074357986450195, "rewards/rejected": -5.7646403312683105, "step": 426, "train_speed(iter/s)": 0.010745 }, { "epoch": 1.4921465968586387, "grad_norm": 5.630609035491943, "learning_rate": 0.00010904619632933313, "logits/chosen": -0.45180657505989075, "logits/rejected": -0.7082334756851196, "logps/chosen": -4.919317245483398, "logps/rejected": -92.1916275024414, "loss": 0.4040582478046417, "memory(GiB)": 43.15, "nll_loss": 0.35989558696746826, "rewards/accuracies": 1.0, "rewards/chosen": 0.1976865828037262, "rewards/margins": 7.597080230712891, "rewards/rejected": -7.399393558502197, "step": 427, "train_speed(iter/s)": 0.010745 }, { "epoch": 1.4956369982547992, "grad_norm": 1.2298264503479004, "learning_rate": 0.0001086622390482699, "logits/chosen": -0.4164445996284485, "logits/rejected": -0.6739879250526428, "logps/chosen": -3.47589373588562, "logps/rejected": -90.46715545654297, "loss": 0.2605077922344208, "memory(GiB)": 43.15, "nll_loss": 0.24074657261371613, "rewards/accuracies": 1.0, "rewards/chosen": 0.42819085717201233, "rewards/margins": 7.35953426361084, "rewards/rejected": -6.931342601776123, "step": 428, "train_speed(iter/s)": 0.010745 }, { "epoch": 1.49912739965096, "grad_norm": 7.767935752868652, "learning_rate": 0.00010827815305665412, "logits/chosen": -0.5705397129058838, "logits/rejected": -0.7187249660491943, "logps/chosen": -8.886819839477539, "logps/rejected": -78.2231674194336, "loss": 0.6680692434310913, "memory(GiB)": 43.15, "nll_loss": 0.5623351335525513, "rewards/accuracies": 0.9375, "rewards/chosen": 0.25776392221450806, "rewards/margins": 6.651043891906738, "rewards/rejected": -6.393280029296875, "step": 429, "train_speed(iter/s)": 0.010745 }, { "epoch": 1.5026178010471205, "grad_norm": 2.1218976974487305, "learning_rate": 0.00010789394406154602, "logits/chosen": -0.4624744653701782, "logits/rejected": -0.7085034251213074, "logps/chosen": -3.271778106689453, "logps/rejected": -77.90242004394531, "loss": 0.2982616424560547, "memory(GiB)": 43.15, "nll_loss": 0.237554132938385, "rewards/accuracies": 1.0, "rewards/chosen": 0.1897493451833725, "rewards/margins": 6.301713943481445, "rewards/rejected": -6.111965179443359, "step": 430, "train_speed(iter/s)": 0.010745 }, { "epoch": 1.506108202443281, "grad_norm": 1.2916324138641357, "learning_rate": 0.00010750961777183357, "logits/chosen": -0.4626178741455078, "logits/rejected": -0.6473190784454346, "logps/chosen": -6.6744914054870605, "logps/rejected": -85.55329895019531, "loss": 0.40405890345573425, "memory(GiB)": 43.15, "nll_loss": 0.31866455078125, "rewards/accuracies": 1.0, "rewards/chosen": 0.4000608026981354, "rewards/margins": 6.864266395568848, "rewards/rejected": -6.464205265045166, "step": 431, "train_speed(iter/s)": 0.010745 }, { "epoch": 1.5095986038394416, "grad_norm": 1.857893943786621, "learning_rate": 0.00010712517989814754, "logits/chosen": -0.49479395151138306, "logits/rejected": -0.6366540193557739, "logps/chosen": -5.596293926239014, "logps/rejected": -71.23036193847656, "loss": 0.45099005103111267, "memory(GiB)": 43.15, "nll_loss": 0.31333470344543457, "rewards/accuracies": 0.9375, "rewards/chosen": 0.2475249469280243, "rewards/margins": 5.814399242401123, "rewards/rejected": -5.5668745040893555, "step": 432, "train_speed(iter/s)": 0.010745 }, { "epoch": 1.513089005235602, "grad_norm": 1.5123834609985352, "learning_rate": 0.0001067406361527768, "logits/chosen": -0.5022237300872803, "logits/rejected": -0.6664936542510986, "logps/chosen": -5.3614912033081055, "logps/rejected": -72.45608520507812, "loss": 0.3943566679954529, "memory(GiB)": 43.15, "nll_loss": 0.3421926498413086, "rewards/accuracies": 1.0, "rewards/chosen": 0.20720945298671722, "rewards/margins": 5.731356143951416, "rewards/rejected": -5.524147033691406, "step": 433, "train_speed(iter/s)": 0.010745 }, { "epoch": 1.5165794066317626, "grad_norm": 1.4642670154571533, "learning_rate": 0.00010635599224958322, "logits/chosen": -0.5665416717529297, "logits/rejected": -0.5965166091918945, "logps/chosen": -7.792428970336914, "logps/rejected": -61.219356536865234, "loss": 0.4489312767982483, "memory(GiB)": 43.15, "nll_loss": 0.34731173515319824, "rewards/accuracies": 1.0, "rewards/chosen": 0.2655758857727051, "rewards/margins": 5.149145126342773, "rewards/rejected": -4.883568286895752, "step": 434, "train_speed(iter/s)": 0.010745 }, { "epoch": 1.5200698080279231, "grad_norm": 2.060508966445923, "learning_rate": 0.00010597125390391698, "logits/chosen": -0.4818264842033386, "logits/rejected": -0.6956694722175598, "logps/chosen": -5.463670253753662, "logps/rejected": -71.13404846191406, "loss": 0.3084399402141571, "memory(GiB)": 43.15, "nll_loss": 0.2919044494628906, "rewards/accuracies": 1.0, "rewards/chosen": 0.44975191354751587, "rewards/margins": 5.932075500488281, "rewards/rejected": -5.48232364654541, "step": 435, "train_speed(iter/s)": 0.010745 }, { "epoch": 1.5235602094240837, "grad_norm": 1.344682216644287, "learning_rate": 0.00010558642683253152, "logits/chosen": -0.4367799162864685, "logits/rejected": -0.6908420920372009, "logps/chosen": -5.97914981842041, "logps/rejected": -91.7225112915039, "loss": 0.38166770339012146, "memory(GiB)": 43.15, "nll_loss": 0.3533383011817932, "rewards/accuracies": 1.0, "rewards/chosen": 0.25942543148994446, "rewards/margins": 7.6511406898498535, "rewards/rejected": -7.3917155265808105, "step": 436, "train_speed(iter/s)": 0.010745 }, { "epoch": 1.5270506108202442, "grad_norm": 1.8352774381637573, "learning_rate": 0.00010520151675349871, "logits/chosen": -0.5730445384979248, "logits/rejected": -0.646553635597229, "logps/chosen": -5.68608283996582, "logps/rejected": -63.03091049194336, "loss": 0.4128214418888092, "memory(GiB)": 43.15, "nll_loss": 0.36257404088974, "rewards/accuracies": 1.0, "rewards/chosen": 0.5576317310333252, "rewards/margins": 5.7393364906311035, "rewards/rejected": -5.181704998016357, "step": 437, "train_speed(iter/s)": 0.010746 }, { "epoch": 1.530541012216405, "grad_norm": 1.5020852088928223, "learning_rate": 0.00010481652938612374, "logits/chosen": -0.5322219133377075, "logits/rejected": -0.6736618876457214, "logps/chosen": -5.650023460388184, "logps/rejected": -84.75536346435547, "loss": 0.3760172128677368, "memory(GiB)": 43.15, "nll_loss": 0.31763553619384766, "rewards/accuracies": 1.0, "rewards/chosen": 0.2672083079814911, "rewards/margins": 7.1481733322143555, "rewards/rejected": -6.880964756011963, "step": 438, "train_speed(iter/s)": 0.010746 }, { "epoch": 1.5340314136125655, "grad_norm": 1.2762045860290527, "learning_rate": 0.00010443147045086017, "logits/chosen": -0.5660447478294373, "logits/rejected": -0.7661846876144409, "logps/chosen": -3.1776599884033203, "logps/rejected": -77.935302734375, "loss": 0.3217516243457794, "memory(GiB)": 43.15, "nll_loss": 0.2736022472381592, "rewards/accuracies": 0.96875, "rewards/chosen": 0.1498115211725235, "rewards/margins": 6.538293361663818, "rewards/rejected": -6.388482093811035, "step": 439, "train_speed(iter/s)": 0.010746 }, { "epoch": 1.537521815008726, "grad_norm": 4.351047039031982, "learning_rate": 0.00010404634566922515, "logits/chosen": -0.4415951669216156, "logits/rejected": -0.6990665793418884, "logps/chosen": -3.981513023376465, "logps/rejected": -75.63274383544922, "loss": 0.35725584626197815, "memory(GiB)": 43.15, "nll_loss": 0.3062575161457062, "rewards/accuracies": 1.0, "rewards/chosen": 0.19793441891670227, "rewards/margins": 6.056670665740967, "rewards/rejected": -5.858736515045166, "step": 440, "train_speed(iter/s)": 0.010746 }, { "epoch": 1.5410122164048867, "grad_norm": 1.1987534761428833, "learning_rate": 0.00010366116076371406, "logits/chosen": -0.5242297649383545, "logits/rejected": -0.7449771165847778, "logps/chosen": -2.1849770545959473, "logps/rejected": -82.05471801757812, "loss": 0.2391047477722168, "memory(GiB)": 43.15, "nll_loss": 0.19235552847385406, "rewards/accuracies": 1.0, "rewards/chosen": 0.2233942449092865, "rewards/margins": 6.825995922088623, "rewards/rejected": -6.602601528167725, "step": 441, "train_speed(iter/s)": 0.010746 }, { "epoch": 1.5445026178010473, "grad_norm": 1.0310100317001343, "learning_rate": 0.00010327592145771574, "logits/chosen": -0.5226780772209167, "logits/rejected": -0.6522566676139832, "logps/chosen": -4.976744651794434, "logps/rejected": -77.1199722290039, "loss": 0.28156208992004395, "memory(GiB)": 43.15, "nll_loss": 0.25276780128479004, "rewards/accuracies": 1.0, "rewards/chosen": 0.3434697985649109, "rewards/margins": 6.673407077789307, "rewards/rejected": -6.32993745803833, "step": 442, "train_speed(iter/s)": 0.010746 }, { "epoch": 1.5479930191972078, "grad_norm": 1.6905871629714966, "learning_rate": 0.00010289063347542726, "logits/chosen": -0.49878814816474915, "logits/rejected": -0.7566611170768738, "logps/chosen": -5.842344284057617, "logps/rejected": -90.62516021728516, "loss": 0.3308601379394531, "memory(GiB)": 43.15, "nll_loss": 0.2835053503513336, "rewards/accuracies": 1.0, "rewards/chosen": 0.48695820569992065, "rewards/margins": 7.632462024688721, "rewards/rejected": -7.145503997802734, "step": 443, "train_speed(iter/s)": 0.010746 }, { "epoch": 1.5514834205933683, "grad_norm": 1.446353554725647, "learning_rate": 0.00010250530254176914, "logits/chosen": -0.5367974042892456, "logits/rejected": -0.6674500107765198, "logps/chosen": -7.052587032318115, "logps/rejected": -69.16866302490234, "loss": 0.48406222462654114, "memory(GiB)": 43.15, "nll_loss": 0.416780948638916, "rewards/accuracies": 1.0, "rewards/chosen": 0.4342191219329834, "rewards/margins": 5.5024871826171875, "rewards/rejected": -5.068268299102783, "step": 444, "train_speed(iter/s)": 0.010746 }, { "epoch": 1.5549738219895288, "grad_norm": 1.2833924293518066, "learning_rate": 0.00010211993438229985, "logits/chosen": -0.4966129958629608, "logits/rejected": -0.7367646098136902, "logps/chosen": -2.2900989055633545, "logps/rejected": -92.28775787353516, "loss": 0.23101164400577545, "memory(GiB)": 43.15, "nll_loss": 0.18072807788848877, "rewards/accuracies": 1.0, "rewards/chosen": 0.3229841887950897, "rewards/margins": 7.81334114074707, "rewards/rejected": -7.490356922149658, "step": 445, "train_speed(iter/s)": 0.010746 }, { "epoch": 1.5584642233856894, "grad_norm": 2.64135479927063, "learning_rate": 0.00010173453472313126, "logits/chosen": -0.43859654664993286, "logits/rejected": -0.72212153673172, "logps/chosen": -3.855778455734253, "logps/rejected": -102.45668029785156, "loss": 0.33878108859062195, "memory(GiB)": 43.15, "nll_loss": 0.3061646819114685, "rewards/accuracies": 1.0, "rewards/chosen": 0.28175267577171326, "rewards/margins": 8.548420906066895, "rewards/rejected": -8.266668319702148, "step": 446, "train_speed(iter/s)": 0.010746 }, { "epoch": 1.5619546247818499, "grad_norm": 0.9250645041465759, "learning_rate": 0.00010134910929084307, "logits/chosen": -0.49251896142959595, "logits/rejected": -0.7127062082290649, "logps/chosen": -3.829066276550293, "logps/rejected": -73.96434020996094, "loss": 0.30373579263687134, "memory(GiB)": 43.15, "nll_loss": 0.23478108644485474, "rewards/accuracies": 0.96875, "rewards/chosen": 0.4689459204673767, "rewards/margins": 6.388603210449219, "rewards/rejected": -5.919657230377197, "step": 447, "train_speed(iter/s)": 0.010746 }, { "epoch": 1.5654450261780104, "grad_norm": 1.2933753728866577, "learning_rate": 0.00010096366381239808, "logits/chosen": -0.5456343293190002, "logits/rejected": -0.7084980607032776, "logps/chosen": -5.273447036743164, "logps/rejected": -76.9305191040039, "loss": 0.38520318269729614, "memory(GiB)": 43.15, "nll_loss": 0.321531742811203, "rewards/accuracies": 0.96875, "rewards/chosen": 0.4554443657398224, "rewards/margins": 6.646027565002441, "rewards/rejected": -6.190584182739258, "step": 448, "train_speed(iter/s)": 0.010746 }, { "epoch": 1.568935427574171, "grad_norm": 1.217418909072876, "learning_rate": 0.00010057820401505691, "logits/chosen": -0.49013572931289673, "logits/rejected": -0.7416660785675049, "logps/chosen": -4.202518939971924, "logps/rejected": -81.60181427001953, "loss": 0.3519480526447296, "memory(GiB)": 43.15, "nll_loss": 0.2851409614086151, "rewards/accuracies": 0.96875, "rewards/chosen": 0.4234984517097473, "rewards/margins": 6.911059379577637, "rewards/rejected": -6.487560272216797, "step": 449, "train_speed(iter/s)": 0.010746 }, { "epoch": 1.5724258289703315, "grad_norm": 2.0490660667419434, "learning_rate": 0.0001001927356262929, "logits/chosen": -0.4484134316444397, "logits/rejected": -0.6950099468231201, "logps/chosen": -4.823796272277832, "logps/rejected": -94.5858154296875, "loss": 0.31138429045677185, "memory(GiB)": 43.15, "nll_loss": 0.23047974705696106, "rewards/accuracies": 0.96875, "rewards/chosen": 0.11626379191875458, "rewards/margins": 7.952792167663574, "rewards/rejected": -7.836528301239014, "step": 450, "train_speed(iter/s)": 0.010746 }, { "epoch": 1.5759162303664922, "grad_norm": 1.7198628187179565, "learning_rate": 9.980726437370712e-05, "logits/chosen": -0.45464956760406494, "logits/rejected": -0.7056002616882324, "logps/chosen": -5.082573890686035, "logps/rejected": -101.8458251953125, "loss": 0.31865912675857544, "memory(GiB)": 43.15, "nll_loss": 0.26458409428596497, "rewards/accuracies": 0.96875, "rewards/chosen": 0.31848958134651184, "rewards/margins": 8.600041389465332, "rewards/rejected": -8.281551361083984, "step": 451, "train_speed(iter/s)": 0.010746 }, { "epoch": 1.5794066317626527, "grad_norm": 6.508523941040039, "learning_rate": 9.94217959849431e-05, "logits/chosen": -0.4674018621444702, "logits/rejected": -0.7319305539131165, "logps/chosen": -6.289431095123291, "logps/rejected": -95.78480529785156, "loss": 0.6865589618682861, "memory(GiB)": 43.15, "nll_loss": 0.5592325329780579, "rewards/accuracies": 0.96875, "rewards/chosen": 0.015579154714941978, "rewards/margins": 8.017131805419922, "rewards/rejected": -8.001551628112793, "step": 452, "train_speed(iter/s)": 0.010746 }, { "epoch": 1.5828970331588132, "grad_norm": 13.3508939743042, "learning_rate": 9.903633618760195e-05, "logits/chosen": -0.4849949777126312, "logits/rejected": -0.7907320261001587, "logps/chosen": -4.951356410980225, "logps/rejected": -82.5472640991211, "loss": 0.8948383927345276, "memory(GiB)": 43.15, "nll_loss": 0.7533862590789795, "rewards/accuracies": 0.9375, "rewards/chosen": -0.12311647832393646, "rewards/margins": 6.550403118133545, "rewards/rejected": -6.673520088195801, "step": 453, "train_speed(iter/s)": 0.010746 }, { "epoch": 1.5863874345549738, "grad_norm": 6.573890209197998, "learning_rate": 9.865089070915696e-05, "logits/chosen": -0.4060344994068146, "logits/rejected": -0.7550903558731079, "logps/chosen": -5.221435070037842, "logps/rejected": -96.10535430908203, "loss": 0.5043012499809265, "memory(GiB)": 43.15, "nll_loss": 0.44070732593536377, "rewards/accuracies": 0.96875, "rewards/chosen": 0.2424362450838089, "rewards/margins": 7.383746147155762, "rewards/rejected": -7.14130973815918, "step": 454, "train_speed(iter/s)": 0.010746 }, { "epoch": 1.5898778359511345, "grad_norm": 9.605191230773926, "learning_rate": 9.826546527686879e-05, "logits/chosen": -0.5186147093772888, "logits/rejected": -0.6258412599563599, "logps/chosen": -7.3261566162109375, "logps/rejected": -69.6639633178711, "loss": 0.5112545490264893, "memory(GiB)": 43.15, "nll_loss": 0.4276677370071411, "rewards/accuracies": 0.9375, "rewards/chosen": 0.42547550797462463, "rewards/margins": 6.084844589233398, "rewards/rejected": -5.659369468688965, "step": 455, "train_speed(iter/s)": 0.010746 }, { "epoch": 1.593368237347295, "grad_norm": 26.42751121520996, "learning_rate": 9.788006561770016e-05, "logits/chosen": -0.49290916323661804, "logits/rejected": -0.6933097243309021, "logps/chosen": -3.184025764465332, "logps/rejected": -82.68756103515625, "loss": 0.26833221316337585, "memory(GiB)": 43.15, "nll_loss": 0.19985711574554443, "rewards/accuracies": 1.0, "rewards/chosen": 0.19965597987174988, "rewards/margins": 6.889904022216797, "rewards/rejected": -6.690248012542725, "step": 456, "train_speed(iter/s)": 0.010746 }, { "epoch": 1.5968586387434556, "grad_norm": 6.064898490905762, "learning_rate": 9.749469745823092e-05, "logits/chosen": -0.575084924697876, "logits/rejected": -0.6971481442451477, "logps/chosen": -8.84771728515625, "logps/rejected": -77.52954864501953, "loss": 0.7120727300643921, "memory(GiB)": 43.15, "nll_loss": 0.5085330009460449, "rewards/accuracies": 0.96875, "rewards/chosen": 0.2835085093975067, "rewards/margins": 7.017773151397705, "rewards/rejected": -6.734263896942139, "step": 457, "train_speed(iter/s)": 0.010746 }, { "epoch": 1.600349040139616, "grad_norm": 1.13936448097229, "learning_rate": 9.710936652457276e-05, "logits/chosen": -0.5578764081001282, "logits/rejected": -0.724193811416626, "logps/chosen": -4.292195796966553, "logps/rejected": -87.24616241455078, "loss": 0.2597983181476593, "memory(GiB)": 43.15, "nll_loss": 0.21350032091140747, "rewards/accuracies": 1.0, "rewards/chosen": 0.28079283237457275, "rewards/margins": 7.473378658294678, "rewards/rejected": -7.192586898803711, "step": 458, "train_speed(iter/s)": 0.010746 }, { "epoch": 1.6038394415357766, "grad_norm": 1.4284478425979614, "learning_rate": 9.672407854228427e-05, "logits/chosen": -0.5638883113861084, "logits/rejected": -0.6472236514091492, "logps/chosen": -7.458891868591309, "logps/rejected": -88.3903579711914, "loss": 0.33047589659690857, "memory(GiB)": 43.15, "nll_loss": 0.32156452536582947, "rewards/accuracies": 1.0, "rewards/chosen": 0.09782328456640244, "rewards/margins": 7.796804904937744, "rewards/rejected": -7.698981285095215, "step": 459, "train_speed(iter/s)": 0.010746 }, { "epoch": 1.6073298429319371, "grad_norm": 1.8427724838256836, "learning_rate": 9.633883923628593e-05, "logits/chosen": -0.5136711597442627, "logits/rejected": -0.670426070690155, "logps/chosen": -5.641696453094482, "logps/rejected": -68.54437255859375, "loss": 0.43776947259902954, "memory(GiB)": 43.15, "nll_loss": 0.32517340779304504, "rewards/accuracies": 0.96875, "rewards/chosen": 0.2341962605714798, "rewards/margins": 5.578415870666504, "rewards/rejected": -5.344220161437988, "step": 460, "train_speed(iter/s)": 0.010746 }, { "epoch": 1.6108202443280977, "grad_norm": 1.3355876207351685, "learning_rate": 9.595365433077483e-05, "logits/chosen": -0.5112326145172119, "logits/rejected": -0.6481039524078369, "logps/chosen": -5.295035362243652, "logps/rejected": -69.49890899658203, "loss": 0.3256393074989319, "memory(GiB)": 43.15, "nll_loss": 0.2783932089805603, "rewards/accuracies": 1.0, "rewards/chosen": 0.5631068348884583, "rewards/margins": 6.177706718444824, "rewards/rejected": -5.61460018157959, "step": 461, "train_speed(iter/s)": 0.010746 }, { "epoch": 1.6143106457242582, "grad_norm": 1.4627971649169922, "learning_rate": 9.556852954913981e-05, "logits/chosen": -0.5415772199630737, "logits/rejected": -0.6977207660675049, "logps/chosen": -3.7730510234832764, "logps/rejected": -70.53782653808594, "loss": 0.3772314786911011, "memory(GiB)": 43.15, "nll_loss": 0.3154931366443634, "rewards/accuracies": 0.96875, "rewards/chosen": 0.28429800271987915, "rewards/margins": 6.2479248046875, "rewards/rejected": -5.963626384735107, "step": 462, "train_speed(iter/s)": 0.010746 }, { "epoch": 1.6178010471204187, "grad_norm": 1.4400521516799927, "learning_rate": 9.518347061387628e-05, "logits/chosen": -0.5067111253738403, "logits/rejected": -0.7407639622688293, "logps/chosen": -3.358861207962036, "logps/rejected": -75.34605407714844, "loss": 0.31904613971710205, "memory(GiB)": 43.15, "nll_loss": 0.24776507914066315, "rewards/accuracies": 1.0, "rewards/chosen": 0.2687406539916992, "rewards/margins": 6.2818603515625, "rewards/rejected": -6.013119697570801, "step": 463, "train_speed(iter/s)": 0.010746 }, { "epoch": 1.6212914485165792, "grad_norm": 1.1085314750671387, "learning_rate": 9.47984832465013e-05, "logits/chosen": -0.5132672786712646, "logits/rejected": -0.7135886549949646, "logps/chosen": -3.035696506500244, "logps/rejected": -77.64856719970703, "loss": 0.2410428375005722, "memory(GiB)": 43.15, "nll_loss": 0.2050429880619049, "rewards/accuracies": 1.0, "rewards/chosen": 0.5391538143157959, "rewards/margins": 6.414307117462158, "rewards/rejected": -5.875153064727783, "step": 464, "train_speed(iter/s)": 0.010746 }, { "epoch": 1.62478184991274, "grad_norm": 1.2350654602050781, "learning_rate": 9.441357316746849e-05, "logits/chosen": -0.4304356575012207, "logits/rejected": -0.647516131401062, "logps/chosen": -3.670703887939453, "logps/rejected": -66.64935302734375, "loss": 0.290671706199646, "memory(GiB)": 43.15, "nll_loss": 0.2181183397769928, "rewards/accuracies": 1.0, "rewards/chosen": 0.40155574679374695, "rewards/margins": 5.363650798797607, "rewards/rejected": -4.962095260620117, "step": 465, "train_speed(iter/s)": 0.010746 }, { "epoch": 1.6282722513089005, "grad_norm": 1.0405222177505493, "learning_rate": 9.402874609608304e-05, "logits/chosen": -0.5338455438613892, "logits/rejected": -0.6881372928619385, "logps/chosen": -3.2838728427886963, "logps/rejected": -70.93064880371094, "loss": 0.26523253321647644, "memory(GiB)": 43.15, "nll_loss": 0.21268227696418762, "rewards/accuracies": 1.0, "rewards/chosen": 0.3254692554473877, "rewards/margins": 6.0326128005981445, "rewards/rejected": -5.707143783569336, "step": 466, "train_speed(iter/s)": 0.010746 }, { "epoch": 1.631762652705061, "grad_norm": 1.730974555015564, "learning_rate": 9.36440077504168e-05, "logits/chosen": -0.6126997470855713, "logits/rejected": -0.7266684770584106, "logps/chosen": -3.05517840385437, "logps/rejected": -80.148681640625, "loss": 0.2501164376735687, "memory(GiB)": 43.15, "nll_loss": 0.21693116426467896, "rewards/accuracies": 1.0, "rewards/chosen": 0.44437089562416077, "rewards/margins": 7.217838287353516, "rewards/rejected": -6.773467540740967, "step": 467, "train_speed(iter/s)": 0.010747 }, { "epoch": 1.6352530541012218, "grad_norm": 3.8707399368286133, "learning_rate": 9.325936384722321e-05, "logits/chosen": -0.49259650707244873, "logits/rejected": -0.6852439045906067, "logps/chosen": -5.644749641418457, "logps/rejected": -75.47988891601562, "loss": 0.401599258184433, "memory(GiB)": 43.15, "nll_loss": 0.31637659668922424, "rewards/accuracies": 1.0, "rewards/chosen": 0.2561740279197693, "rewards/margins": 5.929844379425049, "rewards/rejected": -5.673670768737793, "step": 468, "train_speed(iter/s)": 0.010747 }, { "epoch": 1.6387434554973823, "grad_norm": 1.9370460510253906, "learning_rate": 9.287482010185247e-05, "logits/chosen": -0.5154401659965515, "logits/rejected": -0.723540723323822, "logps/chosen": -6.370390892028809, "logps/rejected": -75.91340637207031, "loss": 0.4852099120616913, "memory(GiB)": 43.15, "nll_loss": 0.40603795647621155, "rewards/accuracies": 0.96875, "rewards/chosen": 0.24762868881225586, "rewards/margins": 6.241936206817627, "rewards/rejected": -5.994307994842529, "step": 469, "train_speed(iter/s)": 0.010747 }, { "epoch": 1.6422338568935428, "grad_norm": 1.6384847164154053, "learning_rate": 9.249038222816645e-05, "logits/chosen": -0.4204860329627991, "logits/rejected": -0.7506822943687439, "logps/chosen": -3.80747127532959, "logps/rejected": -93.09049224853516, "loss": 0.3156612813472748, "memory(GiB)": 43.15, "nll_loss": 0.25148946046829224, "rewards/accuracies": 1.0, "rewards/chosen": 0.34722334146499634, "rewards/margins": 7.566956520080566, "rewards/rejected": -7.219733715057373, "step": 470, "train_speed(iter/s)": 0.010747 }, { "epoch": 1.6457242582897034, "grad_norm": 2.041177272796631, "learning_rate": 9.210605593845401e-05, "logits/chosen": -0.6100115180015564, "logits/rejected": -0.7477937340736389, "logps/chosen": -6.873973846435547, "logps/rejected": -66.74372863769531, "loss": 0.5695972442626953, "memory(GiB)": 43.15, "nll_loss": 0.44725123047828674, "rewards/accuracies": 0.9375, "rewards/chosen": 0.3558385372161865, "rewards/margins": 5.833300590515137, "rewards/rejected": -5.4774627685546875, "step": 471, "train_speed(iter/s)": 0.010747 }, { "epoch": 1.649214659685864, "grad_norm": 2.2523133754730225, "learning_rate": 9.172184694334591e-05, "logits/chosen": -0.5835016965866089, "logits/rejected": -0.7850641012191772, "logps/chosen": -4.768137454986572, "logps/rejected": -88.08627319335938, "loss": 0.3464867174625397, "memory(GiB)": 43.15, "nll_loss": 0.3102959096431732, "rewards/accuracies": 1.0, "rewards/chosen": 0.4118156433105469, "rewards/margins": 7.500361442565918, "rewards/rejected": -7.088545799255371, "step": 472, "train_speed(iter/s)": 0.010747 }, { "epoch": 1.6527050610820244, "grad_norm": 2.1749207973480225, "learning_rate": 9.133776095173015e-05, "logits/chosen": -0.6270173788070679, "logits/rejected": -0.7678170204162598, "logps/chosen": -5.546754837036133, "logps/rejected": -79.69754028320312, "loss": 0.3659020662307739, "memory(GiB)": 43.15, "nll_loss": 0.31625014543533325, "rewards/accuracies": 1.0, "rewards/chosen": 0.21115486323833466, "rewards/margins": 6.8044962882995605, "rewards/rejected": -6.593341827392578, "step": 473, "train_speed(iter/s)": 0.010747 }, { "epoch": 1.656195462478185, "grad_norm": 2.448395252227783, "learning_rate": 9.09538036706669e-05, "logits/chosen": -0.481596440076828, "logits/rejected": -0.7727686166763306, "logps/chosen": -9.757466316223145, "logps/rejected": -99.3200912475586, "loss": 0.6309171319007874, "memory(GiB)": 43.15, "nll_loss": 0.541617751121521, "rewards/accuracies": 0.96875, "rewards/chosen": 0.1632377803325653, "rewards/margins": 8.147398948669434, "rewards/rejected": -7.984160900115967, "step": 474, "train_speed(iter/s)": 0.010747 }, { "epoch": 1.6596858638743455, "grad_norm": 9.251994132995605, "learning_rate": 9.056998080530398e-05, "logits/chosen": -0.562772274017334, "logits/rejected": -0.8359721302986145, "logps/chosen": -6.0720930099487305, "logps/rejected": -94.93759155273438, "loss": 0.4291512966156006, "memory(GiB)": 43.15, "nll_loss": 0.3865175247192383, "rewards/accuracies": 1.0, "rewards/chosen": 0.4334118664264679, "rewards/margins": 8.281164169311523, "rewards/rejected": -7.847752571105957, "step": 475, "train_speed(iter/s)": 0.010747 }, { "epoch": 1.663176265270506, "grad_norm": 2.4467082023620605, "learning_rate": 9.018629805879194e-05, "logits/chosen": -0.4421442449092865, "logits/rejected": -0.6901416182518005, "logps/chosen": -7.532122611999512, "logps/rejected": -91.17680358886719, "loss": 0.38504907488822937, "memory(GiB)": 43.15, "nll_loss": 0.36676025390625, "rewards/accuracies": 1.0, "rewards/chosen": 0.3057595491409302, "rewards/margins": 7.532265663146973, "rewards/rejected": -7.22650671005249, "step": 476, "train_speed(iter/s)": 0.010747 }, { "epoch": 1.6666666666666665, "grad_norm": 1.2942126989364624, "learning_rate": 8.980276113219924e-05, "logits/chosen": -0.5596615076065063, "logits/rejected": -0.8118699789047241, "logps/chosen": -3.7042813301086426, "logps/rejected": -86.83468627929688, "loss": 0.3292457163333893, "memory(GiB)": 43.15, "nll_loss": 0.2878093123435974, "rewards/accuracies": 0.96875, "rewards/chosen": 0.22699333727359772, "rewards/margins": 7.463640213012695, "rewards/rejected": -7.236647605895996, "step": 477, "train_speed(iter/s)": 0.010747 }, { "epoch": 1.6701570680628273, "grad_norm": 1.8572261333465576, "learning_rate": 8.941937572442773e-05, "logits/chosen": -0.4306020736694336, "logits/rejected": -0.7685049772262573, "logps/chosen": -5.437053203582764, "logps/rejected": -89.96847534179688, "loss": 0.36804744601249695, "memory(GiB)": 43.15, "nll_loss": 0.29312145709991455, "rewards/accuracies": 0.96875, "rewards/chosen": 0.30451783537864685, "rewards/margins": 7.180737495422363, "rewards/rejected": -6.876219749450684, "step": 478, "train_speed(iter/s)": 0.010747 }, { "epoch": 1.6736474694589878, "grad_norm": 1.1792480945587158, "learning_rate": 8.903614753212778e-05, "logits/chosen": -0.5531143546104431, "logits/rejected": -0.7622645497322083, "logps/chosen": -5.353999614715576, "logps/rejected": -92.50546264648438, "loss": 0.3255807161331177, "memory(GiB)": 43.15, "nll_loss": 0.28069090843200684, "rewards/accuracies": 1.0, "rewards/chosen": 0.28517261147499084, "rewards/margins": 8.108088493347168, "rewards/rejected": -7.822916030883789, "step": 479, "train_speed(iter/s)": 0.010747 }, { "epoch": 1.6771378708551483, "grad_norm": 1.6261513233184814, "learning_rate": 8.865308224961381e-05, "logits/chosen": -0.5815747380256653, "logits/rejected": -0.7042577266693115, "logps/chosen": -6.8108344078063965, "logps/rejected": -81.57181549072266, "loss": 0.3821701407432556, "memory(GiB)": 43.15, "nll_loss": 0.3587985038757324, "rewards/accuracies": 1.0, "rewards/chosen": 0.39591410756111145, "rewards/margins": 7.037505626678467, "rewards/rejected": -6.641592025756836, "step": 480, "train_speed(iter/s)": 0.010747 }, { "epoch": 1.680628272251309, "grad_norm": 1.7716622352600098, "learning_rate": 8.827018556877953e-05, "logits/chosen": -0.6016179323196411, "logits/rejected": -0.831665575504303, "logps/chosen": -4.813789367675781, "logps/rejected": -88.77471923828125, "loss": 0.40825486183166504, "memory(GiB)": 43.15, "nll_loss": 0.36596742272377014, "rewards/accuracies": 1.0, "rewards/chosen": 0.3279199004173279, "rewards/margins": 7.504549026489258, "rewards/rejected": -7.176629066467285, "step": 481, "train_speed(iter/s)": 0.010747 }, { "epoch": 1.6841186736474696, "grad_norm": 1.6834444999694824, "learning_rate": 8.788746317901349e-05, "logits/chosen": -0.5991214513778687, "logits/rejected": -0.7489640116691589, "logps/chosen": -5.925536632537842, "logps/rejected": -72.82659149169922, "loss": 0.46086686849594116, "memory(GiB)": 43.15, "nll_loss": 0.4042823314666748, "rewards/accuracies": 1.0, "rewards/chosen": 0.39119282364845276, "rewards/margins": 6.154544353485107, "rewards/rejected": -5.7633514404296875, "step": 482, "train_speed(iter/s)": 0.010747 }, { "epoch": 1.6876090750436301, "grad_norm": 1.5792211294174194, "learning_rate": 8.750492076711439e-05, "logits/chosen": -0.589457094669342, "logits/rejected": -0.7296780943870544, "logps/chosen": -4.901717185974121, "logps/rejected": -64.11253356933594, "loss": 0.4066055417060852, "memory(GiB)": 43.15, "nll_loss": 0.3368377983570099, "rewards/accuracies": 1.0, "rewards/chosen": 0.30969735980033875, "rewards/margins": 5.3579888343811035, "rewards/rejected": -5.0482916831970215, "step": 483, "train_speed(iter/s)": 0.010747 }, { "epoch": 1.6910994764397906, "grad_norm": 14.861246109008789, "learning_rate": 8.71225640172068e-05, "logits/chosen": -0.5961053967475891, "logits/rejected": -0.7103674411773682, "logps/chosen": -8.013514518737793, "logps/rejected": -73.48511505126953, "loss": 0.403678297996521, "memory(GiB)": 43.15, "nll_loss": 0.31652554869651794, "rewards/accuracies": 0.96875, "rewards/chosen": 0.20527437329292297, "rewards/margins": 6.156968593597412, "rewards/rejected": -5.951694011688232, "step": 484, "train_speed(iter/s)": 0.010747 }, { "epoch": 1.6945898778359512, "grad_norm": 4.586897850036621, "learning_rate": 8.674039861065643e-05, "logits/chosen": -0.5703863501548767, "logits/rejected": -0.7276860475540161, "logps/chosen": -9.062816619873047, "logps/rejected": -71.1295394897461, "loss": 0.9288193583488464, "memory(GiB)": 43.15, "nll_loss": 0.7453719973564148, "rewards/accuracies": 0.96875, "rewards/chosen": 0.12258605659008026, "rewards/margins": 5.861667156219482, "rewards/rejected": -5.739081382751465, "step": 485, "train_speed(iter/s)": 0.010747 }, { "epoch": 1.6980802792321117, "grad_norm": 4.373604774475098, "learning_rate": 8.635843022598601e-05, "logits/chosen": -0.5944116711616516, "logits/rejected": -0.7287894487380981, "logps/chosen": -8.35546875, "logps/rejected": -74.72799682617188, "loss": 0.7051505446434021, "memory(GiB)": 43.15, "nll_loss": 0.6106510162353516, "rewards/accuracies": 0.96875, "rewards/chosen": 0.24222475290298462, "rewards/margins": 6.460598945617676, "rewards/rejected": -6.218373775482178, "step": 486, "train_speed(iter/s)": 0.010747 }, { "epoch": 1.7015706806282722, "grad_norm": 2.3533213138580322, "learning_rate": 8.597666453879062e-05, "logits/chosen": -0.5893316864967346, "logits/rejected": -0.722305178642273, "logps/chosen": -3.870330333709717, "logps/rejected": -72.59976959228516, "loss": 0.23593875765800476, "memory(GiB)": 43.15, "nll_loss": 0.19806373119354248, "rewards/accuracies": 1.0, "rewards/chosen": 0.5103552937507629, "rewards/margins": 6.509716033935547, "rewards/rejected": -5.999361038208008, "step": 487, "train_speed(iter/s)": 0.010747 }, { "epoch": 1.7050610820244327, "grad_norm": 1.3914954662322998, "learning_rate": 8.55951072216536e-05, "logits/chosen": -0.5020650029182434, "logits/rejected": -0.7016733884811401, "logps/chosen": -6.336236953735352, "logps/rejected": -77.70530700683594, "loss": 0.41162416338920593, "memory(GiB)": 43.15, "nll_loss": 0.2839837670326233, "rewards/accuracies": 0.90625, "rewards/chosen": 0.31479066610336304, "rewards/margins": 6.008511543273926, "rewards/rejected": -5.693720817565918, "step": 488, "train_speed(iter/s)": 0.010747 }, { "epoch": 1.7085514834205933, "grad_norm": 1.889309287071228, "learning_rate": 8.52137639440621e-05, "logits/chosen": -0.6282503008842468, "logits/rejected": -0.8060559630393982, "logps/chosen": -6.973021984100342, "logps/rejected": -75.95047760009766, "loss": 0.3657294809818268, "memory(GiB)": 43.15, "nll_loss": 0.28552117943763733, "rewards/accuracies": 1.0, "rewards/chosen": 0.3438401520252228, "rewards/margins": 6.749382972717285, "rewards/rejected": -6.405542373657227, "step": 489, "train_speed(iter/s)": 0.010747 }, { "epoch": 1.7120418848167538, "grad_norm": 3.3332746028900146, "learning_rate": 8.483264037232284e-05, "logits/chosen": -0.5885301828384399, "logits/rejected": -0.7886412739753723, "logps/chosen": -7.287195682525635, "logps/rejected": -83.81373596191406, "loss": 0.5585455298423767, "memory(GiB)": 43.15, "nll_loss": 0.45055481791496277, "rewards/accuracies": 0.9375, "rewards/chosen": -0.00887676328420639, "rewards/margins": 6.767753601074219, "rewards/rejected": -6.776630401611328, "step": 490, "train_speed(iter/s)": 0.010747 }, { "epoch": 1.7155322862129145, "grad_norm": 1.113408088684082, "learning_rate": 8.445174216947819e-05, "logits/chosen": -0.5470391511917114, "logits/rejected": -0.7462581396102905, "logps/chosen": -2.588343381881714, "logps/rejected": -71.17115020751953, "loss": 0.2312757968902588, "memory(GiB)": 43.15, "nll_loss": 0.17606161534786224, "rewards/accuracies": 1.0, "rewards/chosen": 0.41102471947669983, "rewards/margins": 6.223390102386475, "rewards/rejected": -5.8123650550842285, "step": 491, "train_speed(iter/s)": 0.010747 }, { "epoch": 1.719022687609075, "grad_norm": 1.0025933980941772, "learning_rate": 8.407107499522158e-05, "logits/chosen": -0.4948168992996216, "logits/rejected": -0.7623763084411621, "logps/chosen": -4.8139729499816895, "logps/rejected": -95.55278015136719, "loss": 0.27136656641960144, "memory(GiB)": 43.15, "nll_loss": 0.2624860107898712, "rewards/accuracies": 1.0, "rewards/chosen": 0.4436112642288208, "rewards/margins": 8.318868637084961, "rewards/rejected": -7.8752570152282715, "step": 492, "train_speed(iter/s)": 0.010747 }, { "epoch": 1.7225130890052356, "grad_norm": 1.701587200164795, "learning_rate": 8.369064450581373e-05, "logits/chosen": -0.612269937992096, "logits/rejected": -0.7896562218666077, "logps/chosen": -5.041234970092773, "logps/rejected": -84.5491943359375, "loss": 0.40640538930892944, "memory(GiB)": 43.15, "nll_loss": 0.3292236924171448, "rewards/accuracies": 0.96875, "rewards/chosen": 0.43859872221946716, "rewards/margins": 7.184287071228027, "rewards/rejected": -6.7456889152526855, "step": 493, "train_speed(iter/s)": 0.010747 }, { "epoch": 1.7260034904013961, "grad_norm": 1.9424786567687988, "learning_rate": 8.33104563539985e-05, "logits/chosen": -0.5213719010353088, "logits/rejected": -0.7520919442176819, "logps/chosen": -4.295230865478516, "logps/rejected": -97.60242462158203, "loss": 0.34295564889907837, "memory(GiB)": 43.15, "nll_loss": 0.23993462324142456, "rewards/accuracies": 0.96875, "rewards/chosen": 0.24691414833068848, "rewards/margins": 8.112930297851562, "rewards/rejected": -7.866016387939453, "step": 494, "train_speed(iter/s)": 0.010747 }, { "epoch": 1.7294938917975569, "grad_norm": 1.8167755603790283, "learning_rate": 8.293051618891885e-05, "logits/chosen": -0.5651763677597046, "logits/rejected": -0.7933282852172852, "logps/chosen": -3.743563175201416, "logps/rejected": -84.2485580444336, "loss": 0.34840941429138184, "memory(GiB)": 43.15, "nll_loss": 0.24304822087287903, "rewards/accuracies": 0.9375, "rewards/chosen": 0.3500049412250519, "rewards/margins": 7.271448135375977, "rewards/rejected": -6.92144250869751, "step": 495, "train_speed(iter/s)": 0.010748 }, { "epoch": 1.7329842931937174, "grad_norm": 1.4177367687225342, "learning_rate": 8.255082965603306e-05, "logits/chosen": -0.4521150290966034, "logits/rejected": -0.7816924452781677, "logps/chosen": -2.747921943664551, "logps/rejected": -99.33414459228516, "loss": 0.26944684982299805, "memory(GiB)": 43.15, "nll_loss": 0.2259138524532318, "rewards/accuracies": 1.0, "rewards/chosen": 0.1833350956439972, "rewards/margins": 8.444989204406738, "rewards/rejected": -8.261652946472168, "step": 496, "train_speed(iter/s)": 0.010748 }, { "epoch": 1.736474694589878, "grad_norm": 1.7345248460769653, "learning_rate": 8.21714023970306e-05, "logits/chosen": -0.6219483017921448, "logits/rejected": -0.8654438853263855, "logps/chosen": -4.519089221954346, "logps/rejected": -79.08432006835938, "loss": 0.37975239753723145, "memory(GiB)": 43.15, "nll_loss": 0.3202629089355469, "rewards/accuracies": 0.96875, "rewards/chosen": 0.31086960434913635, "rewards/margins": 6.751467704772949, "rewards/rejected": -6.440598011016846, "step": 497, "train_speed(iter/s)": 0.010748 }, { "epoch": 1.7399650959860384, "grad_norm": 1.3441096544265747, "learning_rate": 8.179224004974857e-05, "logits/chosen": -0.7073596715927124, "logits/rejected": -0.8711289763450623, "logps/chosen": -4.434149265289307, "logps/rejected": -81.61371612548828, "loss": 0.3156903088092804, "memory(GiB)": 43.15, "nll_loss": 0.28625619411468506, "rewards/accuracies": 1.0, "rewards/chosen": 0.3435167074203491, "rewards/margins": 7.131415367126465, "rewards/rejected": -6.787898540496826, "step": 498, "train_speed(iter/s)": 0.010748 }, { "epoch": 1.743455497382199, "grad_norm": 1.561885952949524, "learning_rate": 8.141334824808769e-05, "logits/chosen": -0.5434170365333557, "logits/rejected": -0.8003084659576416, "logps/chosen": -4.422205924987793, "logps/rejected": -72.26570129394531, "loss": 0.35296329855918884, "memory(GiB)": 43.15, "nll_loss": 0.25030094385147095, "rewards/accuracies": 0.96875, "rewards/chosen": 0.3269076645374298, "rewards/margins": 5.8413004875183105, "rewards/rejected": -5.514392852783203, "step": 499, "train_speed(iter/s)": 0.010748 }, { "epoch": 1.7469458987783595, "grad_norm": 2.3898956775665283, "learning_rate": 8.103473262192879e-05, "logits/chosen": -0.4674520492553711, "logits/rejected": -0.6909574866294861, "logps/chosen": -8.937088966369629, "logps/rejected": -93.10710144042969, "loss": 0.7829589247703552, "memory(GiB)": 43.15, "nll_loss": 0.5921401977539062, "rewards/accuracies": 0.96875, "rewards/chosen": 0.20197468996047974, "rewards/margins": 7.561078071594238, "rewards/rejected": -7.359103202819824, "step": 500, "train_speed(iter/s)": 0.010748 }, { "epoch": 1.7469458987783595, "eval_logits/chosen": -0.5579695105552673, "eval_logits/rejected": -0.7757669687271118, "eval_logps/chosen": -7.580451488494873, "eval_logps/rejected": -75.10726928710938, "eval_loss": 0.4915315806865692, "eval_nll_loss": 0.4280147850513458, "eval_rewards/accuracies": 0.967391312122345, "eval_rewards/chosen": 0.42943841218948364, "eval_rewards/margins": 6.220393180847168, "eval_rewards/rejected": -5.79095458984375, "eval_runtime": 105.0113, "eval_samples_per_second": 0.876, "eval_steps_per_second": 0.438, "step": 500 } ], "logging_steps": 1, "max_steps": 858, "num_input_tokens_seen": 0, "num_train_epochs": 3, "save_steps": 100, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": false }, "attributes": {} } }, "total_flos": 2.7276809364884685e+17, "train_batch_size": 2, "trial_name": null, "trial_params": null }