{ "best_global_step": 300, "best_metric": 0.41139093, "best_model_checkpoint": "/data2/kdd/crag/cjz/output/task1_image_gt10_gt2_rewrite_False/v1-20250614-001049/checkpoint-300", "epoch": 0.8871023632961397, "eval_steps": 300, "global_step": 400, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "epoch": 0.0022177559082403493, "grad_norm": 7.276436805725098, "learning_rate": 4.444444444444445e-06, "logits/chosen": -0.7332726716995239, "logits/rejected": -0.7375782132148743, "logps/chosen": -10.463276863098145, "logps/rejected": -16.490936279296875, "loss": 1.3974095582962036, "memory(GiB)": 44.63, "nll_loss": 0.7042622566223145, "rewards/accuracies": 0.0, "rewards/chosen": 0.0, "rewards/margins": 0.0, "rewards/rejected": 0.0, "step": 1, "train_speed(iter/s)": 0.007748 }, { "epoch": 0.004435511816480699, "grad_norm": 10.07150936126709, "learning_rate": 8.88888888888889e-06, "logits/chosen": -0.7215312719345093, "logits/rejected": -0.7478011250495911, "logps/chosen": -8.118193626403809, "logps/rejected": -19.331707000732422, "loss": 1.5197914838790894, "memory(GiB)": 46.1, "nll_loss": 0.8266440629959106, "rewards/accuracies": 0.0, "rewards/chosen": 0.0, "rewards/margins": 0.0, "rewards/rejected": 0.0, "step": 2, "train_speed(iter/s)": 0.007824 }, { "epoch": 0.006653267724721048, "grad_norm": 10.19728946685791, "learning_rate": 1.3333333333333333e-05, "logits/chosen": -0.685354471206665, "logits/rejected": -0.7223411202430725, "logps/chosen": -8.368087768554688, "logps/rejected": -23.5802001953125, "loss": 1.4096384048461914, "memory(GiB)": 46.1, "nll_loss": 0.7168383002281189, "rewards/accuracies": 0.59375, "rewards/chosen": -3.958120942115784e-05, "rewards/margins": 0.0009151366539299488, "rewards/rejected": -0.0009547180961817503, "step": 3, "train_speed(iter/s)": 0.007859 }, { "epoch": 0.008871023632961397, "grad_norm": 8.582710266113281, "learning_rate": 1.777777777777778e-05, "logits/chosen": -0.6947981119155884, "logits/rejected": -0.7241417765617371, "logps/chosen": -13.892762184143066, "logps/rejected": -24.124719619750977, "loss": 1.5422468185424805, "memory(GiB)": 46.1, "nll_loss": 0.8507797122001648, "rewards/accuracies": 0.5, "rewards/chosen": 0.0054289610125124454, "rewards/margins": 0.0035484125837683678, "rewards/rejected": 0.0018805486615747213, "step": 4, "train_speed(iter/s)": 0.007846 }, { "epoch": 0.011088779541201747, "grad_norm": 8.61772632598877, "learning_rate": 2.2222222222222223e-05, "logits/chosen": -0.7581620216369629, "logits/rejected": -0.7803558111190796, "logps/chosen": -11.490116119384766, "logps/rejected": -17.942598342895508, "loss": 1.456505298614502, "memory(GiB)": 46.1, "nll_loss": 0.7721378803253174, "rewards/accuracies": 0.625, "rewards/chosen": 0.01581314392387867, "rewards/margins": 0.01840357482433319, "rewards/rejected": -0.0025904285721480846, "step": 5, "train_speed(iter/s)": 0.007817 }, { "epoch": 0.013306535449442096, "grad_norm": 11.505023956298828, "learning_rate": 2.6666666666666667e-05, "logits/chosen": -0.7362898588180542, "logits/rejected": -0.7709215879440308, "logps/chosen": -8.461962699890137, "logps/rejected": -27.864641189575195, "loss": 1.3553998470306396, "memory(GiB)": 46.1, "nll_loss": 0.6918811798095703, "rewards/accuracies": 0.75, "rewards/chosen": 0.06961186230182648, "rewards/margins": 0.06262461841106415, "rewards/rejected": 0.00698724202811718, "step": 6, "train_speed(iter/s)": 0.007858 }, { "epoch": 0.015524291357682445, "grad_norm": 7.58583402633667, "learning_rate": 3.111111111111111e-05, "logits/chosen": -0.7080317139625549, "logits/rejected": -0.7482547760009766, "logps/chosen": -6.92811393737793, "logps/rejected": -22.422035217285156, "loss": 1.1541662216186523, "memory(GiB)": 46.1, "nll_loss": 0.5072559118270874, "rewards/accuracies": 0.6875, "rewards/chosen": 0.10978628695011139, "rewards/margins": 0.10527929663658142, "rewards/rejected": 0.004506995901465416, "step": 7, "train_speed(iter/s)": 0.007928 }, { "epoch": 0.017742047265922795, "grad_norm": 7.752142429351807, "learning_rate": 3.555555555555556e-05, "logits/chosen": -0.68747478723526, "logits/rejected": -0.7212347388267517, "logps/chosen": -9.500894546508789, "logps/rejected": -23.92633056640625, "loss": 1.3329849243164062, "memory(GiB)": 46.1, "nll_loss": 0.7127149701118469, "rewards/accuracies": 0.65625, "rewards/chosen": 0.030532313510775566, "rewards/margins": 0.18240433931350708, "rewards/rejected": -0.15187203884124756, "step": 8, "train_speed(iter/s)": 0.007913 }, { "epoch": 0.019959803174163144, "grad_norm": 3.5858492851257324, "learning_rate": 4e-05, "logits/chosen": -0.73879075050354, "logits/rejected": -0.7796315550804138, "logps/chosen": -5.0881805419921875, "logps/rejected": -24.7738037109375, "loss": 0.8303911685943604, "memory(GiB)": 46.1, "nll_loss": 0.2771793305873871, "rewards/accuracies": 0.71875, "rewards/chosen": 0.11474708467721939, "rewards/margins": 0.37330126762390137, "rewards/rejected": -0.2585541307926178, "step": 9, "train_speed(iter/s)": 0.007944 }, { "epoch": 0.022177559082403493, "grad_norm": 7.612152099609375, "learning_rate": 4.4444444444444447e-05, "logits/chosen": -0.6987114548683167, "logits/rejected": -0.7058257460594177, "logps/chosen": -15.217192649841309, "logps/rejected": -22.54599380493164, "loss": 1.2511308193206787, "memory(GiB)": 46.1, "nll_loss": 0.6868589520454407, "rewards/accuracies": 0.625, "rewards/chosen": -0.12514850497245789, "rewards/margins": 0.4101864695549011, "rewards/rejected": -0.5353350043296814, "step": 10, "train_speed(iter/s)": 0.007962 }, { "epoch": 0.024395314990643843, "grad_norm": 6.01246976852417, "learning_rate": 4.888888888888889e-05, "logits/chosen": -0.6994076371192932, "logits/rejected": -0.7003622055053711, "logps/chosen": -14.472052574157715, "logps/rejected": -23.425853729248047, "loss": 1.284260630607605, "memory(GiB)": 46.1, "nll_loss": 0.6495041251182556, "rewards/accuracies": 0.6875, "rewards/chosen": -0.21374526619911194, "rewards/margins": 0.31260305643081665, "rewards/rejected": -0.5263482928276062, "step": 11, "train_speed(iter/s)": 0.007969 }, { "epoch": 0.026613070898884192, "grad_norm": 6.6873040199279785, "learning_rate": 5.333333333333333e-05, "logits/chosen": -0.719663143157959, "logits/rejected": -0.7418795824050903, "logps/chosen": -15.615825653076172, "logps/rejected": -24.63580322265625, "loss": 1.4747008085250854, "memory(GiB)": 46.1, "nll_loss": 0.847057044506073, "rewards/accuracies": 0.625, "rewards/chosen": -0.2930046319961548, "rewards/margins": 0.3898415267467499, "rewards/rejected": -0.682846188545227, "step": 12, "train_speed(iter/s)": 0.007993 }, { "epoch": 0.02883082680712454, "grad_norm": 4.942108631134033, "learning_rate": 5.7777777777777776e-05, "logits/chosen": -0.6910253167152405, "logits/rejected": -0.7100927829742432, "logps/chosen": -10.659884452819824, "logps/rejected": -25.604801177978516, "loss": 1.0991154909133911, "memory(GiB)": 46.1, "nll_loss": 0.529512882232666, "rewards/accuracies": 0.625, "rewards/chosen": -0.1485268771648407, "rewards/margins": 0.43985775113105774, "rewards/rejected": -0.5883846282958984, "step": 13, "train_speed(iter/s)": 0.008034 }, { "epoch": 0.03104858271536489, "grad_norm": 8.013643264770508, "learning_rate": 6.222222222222222e-05, "logits/chosen": -0.6786947846412659, "logits/rejected": -0.7003186345100403, "logps/chosen": -8.749262809753418, "logps/rejected": -22.5197811126709, "loss": 1.3776031732559204, "memory(GiB)": 46.1, "nll_loss": 0.7835733294487, "rewards/accuracies": 0.65625, "rewards/chosen": -0.08169429004192352, "rewards/margins": 0.344772070646286, "rewards/rejected": -0.42646634578704834, "step": 14, "train_speed(iter/s)": 0.008017 }, { "epoch": 0.033266338623605236, "grad_norm": 5.5514817237854, "learning_rate": 6.666666666666667e-05, "logits/chosen": -0.703814685344696, "logits/rejected": -0.7373018264770508, "logps/chosen": -6.65080451965332, "logps/rejected": -23.22998809814453, "loss": 1.1897517442703247, "memory(GiB)": 46.1, "nll_loss": 0.626986026763916, "rewards/accuracies": 0.6875, "rewards/chosen": 0.03274273872375488, "rewards/margins": 0.42112234234809875, "rewards/rejected": -0.38837966322898865, "step": 15, "train_speed(iter/s)": 0.008023 }, { "epoch": 0.03548409453184559, "grad_norm": 3.7225890159606934, "learning_rate": 7.111111111111112e-05, "logits/chosen": -0.6734000444412231, "logits/rejected": -0.6864615678787231, "logps/chosen": -11.966102600097656, "logps/rejected": -23.13942527770996, "loss": 1.2046136856079102, "memory(GiB)": 46.1, "nll_loss": 0.5588831901550293, "rewards/accuracies": 0.59375, "rewards/chosen": -0.07107432186603546, "rewards/margins": 0.2272331863641739, "rewards/rejected": -0.29830753803253174, "step": 16, "train_speed(iter/s)": 0.008033 }, { "epoch": 0.037701850440085935, "grad_norm": 3.068159580230713, "learning_rate": 7.555555555555556e-05, "logits/chosen": -0.6323463916778564, "logits/rejected": -0.6556217670440674, "logps/chosen": -7.376963138580322, "logps/rejected": -23.585092544555664, "loss": 0.990348756313324, "memory(GiB)": 46.1, "nll_loss": 0.377433717250824, "rewards/accuracies": 0.6875, "rewards/chosen": 0.09706290066242218, "rewards/margins": 0.31319916248321533, "rewards/rejected": -0.21613627672195435, "step": 17, "train_speed(iter/s)": 0.00803 }, { "epoch": 0.03991960634832629, "grad_norm": 2.306462526321411, "learning_rate": 8e-05, "logits/chosen": -0.652298092842102, "logits/rejected": -0.6973198056221008, "logps/chosen": -4.506044864654541, "logps/rejected": -23.26398468017578, "loss": 0.8916468024253845, "memory(GiB)": 46.1, "nll_loss": 0.35007452964782715, "rewards/accuracies": 0.6875, "rewards/chosen": 0.22034089267253876, "rewards/margins": 0.45051315426826477, "rewards/rejected": -0.23017224669456482, "step": 18, "train_speed(iter/s)": 0.008047 }, { "epoch": 0.042137362256566634, "grad_norm": 2.24660325050354, "learning_rate": 8.444444444444444e-05, "logits/chosen": -0.6684755086898804, "logits/rejected": -0.6921530365943909, "logps/chosen": -5.159789562225342, "logps/rejected": -20.33713722229004, "loss": 0.9385991096496582, "memory(GiB)": 46.1, "nll_loss": 0.3643404245376587, "rewards/accuracies": 0.78125, "rewards/chosen": 0.1963498443365097, "rewards/margins": 0.30785509943962097, "rewards/rejected": -0.11150527000427246, "step": 19, "train_speed(iter/s)": 0.008041 }, { "epoch": 0.044355118164806986, "grad_norm": 4.343178749084473, "learning_rate": 8.888888888888889e-05, "logits/chosen": -0.64969801902771, "logits/rejected": -0.6867151856422424, "logps/chosen": -8.542341232299805, "logps/rejected": -27.74468421936035, "loss": 1.159504771232605, "memory(GiB)": 46.1, "nll_loss": 0.5642345547676086, "rewards/accuracies": 0.6875, "rewards/chosen": 0.17812781035900116, "rewards/margins": 0.28209057450294495, "rewards/rejected": -0.10396274924278259, "step": 20, "train_speed(iter/s)": 0.008063 }, { "epoch": 0.04657287407304733, "grad_norm": 2.5781965255737305, "learning_rate": 9.333333333333334e-05, "logits/chosen": -0.7248848676681519, "logits/rejected": -0.7462906837463379, "logps/chosen": -8.212335586547852, "logps/rejected": -15.989672660827637, "loss": 1.174903392791748, "memory(GiB)": 46.1, "nll_loss": 0.5117508172988892, "rewards/accuracies": 0.59375, "rewards/chosen": 0.13524048030376434, "rewards/margins": 0.12396176159381866, "rewards/rejected": 0.011278722435235977, "step": 21, "train_speed(iter/s)": 0.008072 }, { "epoch": 0.048790629981287685, "grad_norm": 2.095536947250366, "learning_rate": 9.777777777777778e-05, "logits/chosen": -0.618206262588501, "logits/rejected": -0.6151365041732788, "logps/chosen": -8.146368026733398, "logps/rejected": -15.488615036010742, "loss": 1.011189579963684, "memory(GiB)": 46.1, "nll_loss": 0.4133646488189697, "rewards/accuracies": 0.625, "rewards/chosen": 0.2263016253709793, "rewards/margins": 0.25505900382995605, "rewards/rejected": -0.02875736728310585, "step": 22, "train_speed(iter/s)": 0.008074 }, { "epoch": 0.05100838588952803, "grad_norm": 2.504054307937622, "learning_rate": 0.00010222222222222222, "logits/chosen": -0.6510525345802307, "logits/rejected": -0.664685845375061, "logps/chosen": -8.884237289428711, "logps/rejected": -20.657085418701172, "loss": 1.1501473188400269, "memory(GiB)": 46.1, "nll_loss": 0.5572206974029541, "rewards/accuracies": 0.625, "rewards/chosen": 0.1401275396347046, "rewards/margins": 0.2846068739891052, "rewards/rejected": -0.14447934925556183, "step": 23, "train_speed(iter/s)": 0.008064 }, { "epoch": 0.053226141797768384, "grad_norm": 2.6294727325439453, "learning_rate": 0.00010666666666666667, "logits/chosen": -0.6562620997428894, "logits/rejected": -0.6580171585083008, "logps/chosen": -11.128717422485352, "logps/rejected": -19.960248947143555, "loss": 1.025831699371338, "memory(GiB)": 46.1, "nll_loss": 0.35331588983535767, "rewards/accuracies": 0.625, "rewards/chosen": 0.05753737688064575, "rewards/margins": 0.09378618001937866, "rewards/rejected": -0.03624879568815231, "step": 24, "train_speed(iter/s)": 0.008068 }, { "epoch": 0.05544389770600873, "grad_norm": 4.113434314727783, "learning_rate": 0.00011111111111111112, "logits/chosen": -0.7034849524497986, "logits/rejected": -0.703572154045105, "logps/chosen": -12.834946632385254, "logps/rejected": -22.007543563842773, "loss": 1.219478726387024, "memory(GiB)": 46.1, "nll_loss": 0.56423419713974, "rewards/accuracies": 0.65625, "rewards/chosen": 0.04055144265294075, "rewards/margins": 0.14624251425266266, "rewards/rejected": -0.10569106787443161, "step": 25, "train_speed(iter/s)": 0.008066 }, { "epoch": 0.05766165361424908, "grad_norm": 4.309391498565674, "learning_rate": 0.00011555555555555555, "logits/chosen": -0.662431001663208, "logits/rejected": -0.684702455997467, "logps/chosen": -11.661463737487793, "logps/rejected": -24.191795349121094, "loss": 1.1345590353012085, "memory(GiB)": 46.1, "nll_loss": 0.5379157662391663, "rewards/accuracies": 0.625, "rewards/chosen": 0.027302712202072144, "rewards/margins": 0.2985782027244568, "rewards/rejected": -0.27127546072006226, "step": 26, "train_speed(iter/s)": 0.008061 }, { "epoch": 0.05987940952248943, "grad_norm": 4.278309345245361, "learning_rate": 0.00012, "logits/chosen": -0.7126907706260681, "logits/rejected": -0.7174281477928162, "logps/chosen": -11.30073070526123, "logps/rejected": -19.983867645263672, "loss": 1.1452325582504272, "memory(GiB)": 46.1, "nll_loss": 0.5350662469863892, "rewards/accuracies": 0.65625, "rewards/chosen": 0.15527383983135223, "rewards/margins": 0.2666708827018738, "rewards/rejected": -0.11139706522226334, "step": 27, "train_speed(iter/s)": 0.008058 }, { "epoch": 0.06209716543072978, "grad_norm": 3.8597252368927, "learning_rate": 0.00012444444444444444, "logits/chosen": -0.7358130216598511, "logits/rejected": -0.7531285285949707, "logps/chosen": -6.426143169403076, "logps/rejected": -24.873878479003906, "loss": 0.8902767896652222, "memory(GiB)": 46.1, "nll_loss": 0.37025153636932373, "rewards/accuracies": 0.8125, "rewards/chosen": 0.17672136425971985, "rewards/margins": 0.4878941774368286, "rewards/rejected": -0.3111727833747864, "step": 28, "train_speed(iter/s)": 0.008062 }, { "epoch": 0.06431492133897013, "grad_norm": 5.0088348388671875, "learning_rate": 0.00012888888888888892, "logits/chosen": -0.6740167140960693, "logits/rejected": -0.7026465535163879, "logps/chosen": -6.703609466552734, "logps/rejected": -27.67329978942871, "loss": 1.0634881258010864, "memory(GiB)": 46.1, "nll_loss": 0.5235491991043091, "rewards/accuracies": 0.78125, "rewards/chosen": 0.11447454988956451, "rewards/margins": 0.4801509380340576, "rewards/rejected": -0.3656763732433319, "step": 29, "train_speed(iter/s)": 0.008064 }, { "epoch": 0.06653267724721047, "grad_norm": 7.510077953338623, "learning_rate": 0.00013333333333333334, "logits/chosen": -0.649000883102417, "logits/rejected": -0.6501227021217346, "logps/chosen": -9.731987953186035, "logps/rejected": -22.024688720703125, "loss": 1.4005825519561768, "memory(GiB)": 46.1, "nll_loss": 0.7944965362548828, "rewards/accuracies": 0.65625, "rewards/chosen": 0.0400068461894989, "rewards/margins": 0.3603759706020355, "rewards/rejected": -0.3203691244125366, "step": 30, "train_speed(iter/s)": 0.00806 }, { "epoch": 0.06875043315545083, "grad_norm": 2.7688963413238525, "learning_rate": 0.0001377777777777778, "logits/chosen": -0.683768093585968, "logits/rejected": -0.6991692781448364, "logps/chosen": -9.37608528137207, "logps/rejected": -19.639158248901367, "loss": 1.0507181882858276, "memory(GiB)": 46.1, "nll_loss": 0.45388615131378174, "rewards/accuracies": 0.75, "rewards/chosen": 0.11749469488859177, "rewards/margins": 0.371566504240036, "rewards/rejected": -0.25407183170318604, "step": 31, "train_speed(iter/s)": 0.00806 }, { "epoch": 0.07096818906369118, "grad_norm": 2.550858974456787, "learning_rate": 0.00014222222222222224, "logits/chosen": -0.6819652318954468, "logits/rejected": -0.6938492059707642, "logps/chosen": -12.82135009765625, "logps/rejected": -32.83695602416992, "loss": 1.083910346031189, "memory(GiB)": 46.1, "nll_loss": 0.5153654217720032, "rewards/accuracies": 0.78125, "rewards/chosen": 0.08128099143505096, "rewards/margins": 0.3762062191963196, "rewards/rejected": -0.2949252128601074, "step": 32, "train_speed(iter/s)": 0.008067 }, { "epoch": 0.07318594497193152, "grad_norm": 2.6052372455596924, "learning_rate": 0.00014666666666666666, "logits/chosen": -0.6425620317459106, "logits/rejected": -0.6855881214141846, "logps/chosen": -5.170282363891602, "logps/rejected": -25.80876922607422, "loss": 0.9529789090156555, "memory(GiB)": 46.1, "nll_loss": 0.420663058757782, "rewards/accuracies": 0.75, "rewards/chosen": 0.21988970041275024, "rewards/margins": 0.48745402693748474, "rewards/rejected": -0.2675642967224121, "step": 33, "train_speed(iter/s)": 0.008068 }, { "epoch": 0.07540370088017187, "grad_norm": 3.4502556324005127, "learning_rate": 0.0001511111111111111, "logits/chosen": -0.6484149694442749, "logits/rejected": -0.6727481484413147, "logps/chosen": -6.394935607910156, "logps/rejected": -20.673736572265625, "loss": 0.9740100502967834, "memory(GiB)": 46.1, "nll_loss": 0.39780640602111816, "rewards/accuracies": 0.75, "rewards/chosen": 0.23207196593284607, "rewards/margins": 0.35720905661582947, "rewards/rejected": -0.12513704597949982, "step": 34, "train_speed(iter/s)": 0.008066 }, { "epoch": 0.07762145678841223, "grad_norm": 2.5214908123016357, "learning_rate": 0.00015555555555555556, "logits/chosen": -0.6334148049354553, "logits/rejected": -0.6357681751251221, "logps/chosen": -7.275469779968262, "logps/rejected": -26.607770919799805, "loss": 0.8099223375320435, "memory(GiB)": 46.1, "nll_loss": 0.2854778468608856, "rewards/accuracies": 0.71875, "rewards/chosen": 0.12199296802282333, "rewards/margins": 0.5918037295341492, "rewards/rejected": -0.4698107838630676, "step": 35, "train_speed(iter/s)": 0.008065 }, { "epoch": 0.07983921269665258, "grad_norm": 4.882220268249512, "learning_rate": 0.00016, "logits/chosen": -0.6802562475204468, "logits/rejected": -0.7064938545227051, "logps/chosen": -15.904359817504883, "logps/rejected": -29.350811004638672, "loss": 1.5268551111221313, "memory(GiB)": 46.1, "nll_loss": 0.9425684809684753, "rewards/accuracies": 0.59375, "rewards/chosen": -0.18609833717346191, "rewards/margins": 0.4418560266494751, "rewards/rejected": -0.627954363822937, "step": 36, "train_speed(iter/s)": 0.008068 }, { "epoch": 0.08205696860489292, "grad_norm": 3.0210578441619873, "learning_rate": 0.00016444444444444444, "logits/chosen": -0.7036482095718384, "logits/rejected": -0.7044983506202698, "logps/chosen": -14.613797187805176, "logps/rejected": -30.51740837097168, "loss": 1.017217993736267, "memory(GiB)": 46.1, "nll_loss": 0.5247446298599243, "rewards/accuracies": 0.8125, "rewards/chosen": -0.03162863850593567, "rewards/margins": 0.6317514181137085, "rewards/rejected": -0.6633801460266113, "step": 37, "train_speed(iter/s)": 0.008059 }, { "epoch": 0.08427472451313327, "grad_norm": 3.098156213760376, "learning_rate": 0.00016888888888888889, "logits/chosen": -0.6714186072349548, "logits/rejected": -0.6812422871589661, "logps/chosen": -16.367725372314453, "logps/rejected": -28.301345825195312, "loss": 1.2068523168563843, "memory(GiB)": 46.1, "nll_loss": 0.6946620345115662, "rewards/accuracies": 0.75, "rewards/chosen": 0.015942862257361412, "rewards/margins": 0.6814810633659363, "rewards/rejected": -0.6655381917953491, "step": 38, "train_speed(iter/s)": 0.00807 }, { "epoch": 0.08649248042137363, "grad_norm": 3.322134256362915, "learning_rate": 0.00017333333333333334, "logits/chosen": -0.6880184412002563, "logits/rejected": -0.7056170701980591, "logps/chosen": -6.932201385498047, "logps/rejected": -23.875953674316406, "loss": 0.8887794613838196, "memory(GiB)": 46.1, "nll_loss": 0.32947438955307007, "rewards/accuracies": 0.75, "rewards/chosen": 0.09907499700784683, "rewards/margins": 0.4684091806411743, "rewards/rejected": -0.3693341612815857, "step": 39, "train_speed(iter/s)": 0.008055 }, { "epoch": 0.08871023632961397, "grad_norm": 3.0120160579681396, "learning_rate": 0.00017777777777777779, "logits/chosen": -0.6974343061447144, "logits/rejected": -0.7076331377029419, "logps/chosen": -10.623748779296875, "logps/rejected": -26.470630645751953, "loss": 1.1136667728424072, "memory(GiB)": 46.1, "nll_loss": 0.532155454158783, "rewards/accuracies": 0.625, "rewards/chosen": 0.0889241099357605, "rewards/margins": 0.455722838640213, "rewards/rejected": -0.3667986989021301, "step": 40, "train_speed(iter/s)": 0.008055 }, { "epoch": 0.09092799223785432, "grad_norm": 2.5109620094299316, "learning_rate": 0.00018222222222222224, "logits/chosen": -0.7382675409317017, "logits/rejected": -0.7507362961769104, "logps/chosen": -8.733287811279297, "logps/rejected": -22.5925350189209, "loss": 0.8756768703460693, "memory(GiB)": 46.1, "nll_loss": 0.3629510700702667, "rewards/accuracies": 0.71875, "rewards/chosen": 0.2706006169319153, "rewards/margins": 0.6100682616233826, "rewards/rejected": -0.3394676446914673, "step": 41, "train_speed(iter/s)": 0.008049 }, { "epoch": 0.09314574814609466, "grad_norm": 3.9691097736358643, "learning_rate": 0.0001866666666666667, "logits/chosen": -0.7684446573257446, "logits/rejected": -0.787712037563324, "logps/chosen": -11.393584251403809, "logps/rejected": -30.219039916992188, "loss": 1.211122751235962, "memory(GiB)": 46.1, "nll_loss": 0.6706364750862122, "rewards/accuracies": 0.65625, "rewards/chosen": -0.007796842604875565, "rewards/margins": 0.7110621333122253, "rewards/rejected": -0.7188589572906494, "step": 42, "train_speed(iter/s)": 0.008051 }, { "epoch": 0.09536350405433502, "grad_norm": 2.963203191757202, "learning_rate": 0.00019111111111111114, "logits/chosen": -0.6818578839302063, "logits/rejected": -0.6889616250991821, "logps/chosen": -12.270942687988281, "logps/rejected": -27.153846740722656, "loss": 0.9894061088562012, "memory(GiB)": 46.1, "nll_loss": 0.4868725836277008, "rewards/accuracies": 0.78125, "rewards/chosen": 0.012282166630029678, "rewards/margins": 0.6492558121681213, "rewards/rejected": -0.6369736194610596, "step": 43, "train_speed(iter/s)": 0.008043 }, { "epoch": 0.09758125996257537, "grad_norm": 3.587053060531616, "learning_rate": 0.00019555555555555556, "logits/chosen": -0.7400009632110596, "logits/rejected": -0.7725372314453125, "logps/chosen": -12.326873779296875, "logps/rejected": -22.454561233520508, "loss": 1.0897188186645508, "memory(GiB)": 46.1, "nll_loss": 0.5316156148910522, "rewards/accuracies": 0.65625, "rewards/chosen": 0.11403915286064148, "rewards/margins": 0.4852198362350464, "rewards/rejected": -0.3711806833744049, "step": 44, "train_speed(iter/s)": 0.00805 }, { "epoch": 0.09979901587081572, "grad_norm": 2.648092269897461, "learning_rate": 0.0002, "logits/chosen": -0.7456753849983215, "logits/rejected": -0.7561041116714478, "logps/chosen": -7.531292915344238, "logps/rejected": -21.980024337768555, "loss": 0.9317559003829956, "memory(GiB)": 46.1, "nll_loss": 0.3929036855697632, "rewards/accuracies": 0.65625, "rewards/chosen": 0.10482822358608246, "rewards/margins": 0.6396186351776123, "rewards/rejected": -0.5347905158996582, "step": 45, "train_speed(iter/s)": 0.008052 }, { "epoch": 0.10201677177905606, "grad_norm": 3.2653682231903076, "learning_rate": 0.0001999993249483057, "logits/chosen": -0.7328958511352539, "logits/rejected": -0.7547612190246582, "logps/chosen": -11.5140380859375, "logps/rejected": -22.490699768066406, "loss": 1.031274676322937, "memory(GiB)": 46.1, "nll_loss": 0.5204803943634033, "rewards/accuracies": 0.71875, "rewards/chosen": 0.19196264445781708, "rewards/margins": 0.651879072189331, "rewards/rejected": -0.45991644263267517, "step": 46, "train_speed(iter/s)": 0.008051 }, { "epoch": 0.10423452768729642, "grad_norm": 5.505344867706299, "learning_rate": 0.0001999972998023366, "logits/chosen": -0.7554954290390015, "logits/rejected": -0.7810638546943665, "logps/chosen": -5.766447067260742, "logps/rejected": -19.390804290771484, "loss": 1.2154221534729004, "memory(GiB)": 46.1, "nll_loss": 0.7068721055984497, "rewards/accuracies": 0.84375, "rewards/chosen": 0.2990206182003021, "rewards/margins": 0.5781352519989014, "rewards/rejected": -0.27911463379859924, "step": 47, "train_speed(iter/s)": 0.008058 }, { "epoch": 0.10645228359553677, "grad_norm": 2.649653911590576, "learning_rate": 0.00019999392458943432, "logits/chosen": -0.6805804967880249, "logits/rejected": -0.7093008756637573, "logps/chosen": -14.792132377624512, "logps/rejected": -24.17580795288086, "loss": 1.1033304929733276, "memory(GiB)": 46.1, "nll_loss": 0.5765480995178223, "rewards/accuracies": 0.6875, "rewards/chosen": 0.2228904664516449, "rewards/margins": 0.643200695514679, "rewards/rejected": -0.42031019926071167, "step": 48, "train_speed(iter/s)": 0.008059 }, { "epoch": 0.10867003950377711, "grad_norm": 3.4825599193573, "learning_rate": 0.00019998919935516768, "logits/chosen": -0.6554335951805115, "logits/rejected": -0.6713435053825378, "logps/chosen": -10.660847663879395, "logps/rejected": -35.06268310546875, "loss": 1.0064078569412231, "memory(GiB)": 46.1, "nll_loss": 0.6083590388298035, "rewards/accuracies": 0.875, "rewards/chosen": 0.3527636229991913, "rewards/margins": 0.9422526359558105, "rewards/rejected": -0.5894889831542969, "step": 49, "train_speed(iter/s)": 0.008061 }, { "epoch": 0.11088779541201746, "grad_norm": 2.771404504776001, "learning_rate": 0.00019998312416333227, "logits/chosen": -0.6812981367111206, "logits/rejected": -0.7410666942596436, "logps/chosen": -7.697882652282715, "logps/rejected": -44.32658386230469, "loss": 0.7727497816085815, "memory(GiB)": 46.1, "nll_loss": 0.4560812711715698, "rewards/accuracies": 0.9375, "rewards/chosen": 0.10594843327999115, "rewards/margins": 1.4077725410461426, "rewards/rejected": -1.3018239736557007, "step": 50, "train_speed(iter/s)": 0.008057 }, { "epoch": 0.11310555132025782, "grad_norm": 2.724386215209961, "learning_rate": 0.00019997569909594947, "logits/chosen": -0.6333714723587036, "logits/rejected": -0.6679136753082275, "logps/chosen": -5.1590166091918945, "logps/rejected": -28.71851348876953, "loss": 0.6836625933647156, "memory(GiB)": 46.1, "nll_loss": 0.27343082427978516, "rewards/accuracies": 0.84375, "rewards/chosen": 0.15617597103118896, "rewards/margins": 1.0674690008163452, "rewards/rejected": -0.9112929701805115, "step": 51, "train_speed(iter/s)": 0.008034 }, { "epoch": 0.11532330722849816, "grad_norm": 3.1469614505767822, "learning_rate": 0.00019996692425326533, "logits/chosen": -0.6757405996322632, "logits/rejected": -0.7173976898193359, "logps/chosen": -5.490239143371582, "logps/rejected": -35.709468841552734, "loss": 0.6690353751182556, "memory(GiB)": 46.1, "nll_loss": 0.3624095916748047, "rewards/accuracies": 0.90625, "rewards/chosen": 0.2558611333370209, "rewards/margins": 1.5283734798431396, "rewards/rejected": -1.272512435913086, "step": 52, "train_speed(iter/s)": 0.00803 }, { "epoch": 0.11754106313673851, "grad_norm": 3.79186749458313, "learning_rate": 0.0001999567997537493, "logits/chosen": -0.7215967774391174, "logits/rejected": -0.733575165271759, "logps/chosen": -14.72846794128418, "logps/rejected": -33.80124282836914, "loss": 0.8965668678283691, "memory(GiB)": 46.1, "nll_loss": 0.4457498788833618, "rewards/accuracies": 0.84375, "rewards/chosen": 0.06722234189510345, "rewards/margins": 1.353319764137268, "rewards/rejected": -1.286097526550293, "step": 53, "train_speed(iter/s)": 0.008032 }, { "epoch": 0.11975881904497886, "grad_norm": 4.82743501663208, "learning_rate": 0.00019994532573409262, "logits/chosen": -0.7556912899017334, "logits/rejected": -0.777891993522644, "logps/chosen": -8.923099517822266, "logps/rejected": -26.59355926513672, "loss": 0.9261423945426941, "memory(GiB)": 46.1, "nll_loss": 0.5014331936836243, "rewards/accuracies": 0.8125, "rewards/chosen": 0.2390597015619278, "rewards/margins": 1.2192004919052124, "rewards/rejected": -0.9801408648490906, "step": 54, "train_speed(iter/s)": 0.00803 }, { "epoch": 0.12197657495321922, "grad_norm": 5.3560004234313965, "learning_rate": 0.00019993250234920636, "logits/chosen": -0.8043528199195862, "logits/rejected": -0.8303660154342651, "logps/chosen": -8.159523010253906, "logps/rejected": -33.00286865234375, "loss": 0.9617294073104858, "memory(GiB)": 46.1, "nll_loss": 0.5782371759414673, "rewards/accuracies": 0.71875, "rewards/chosen": 0.04396045207977295, "rewards/margins": 1.489919900894165, "rewards/rejected": -1.4459596872329712, "step": 55, "train_speed(iter/s)": 0.008035 }, { "epoch": 0.12419433086145956, "grad_norm": 5.173131465911865, "learning_rate": 0.00019991832977221956, "logits/chosen": -0.7803252339363098, "logits/rejected": -0.8187588453292847, "logps/chosen": -10.553321838378906, "logps/rejected": -36.212623596191406, "loss": 0.8786243796348572, "memory(GiB)": 46.1, "nll_loss": 0.5231858491897583, "rewards/accuracies": 0.8125, "rewards/chosen": 0.05092973634600639, "rewards/margins": 1.722278356552124, "rewards/rejected": -1.6713483333587646, "step": 56, "train_speed(iter/s)": 0.008038 }, { "epoch": 0.12641208676969992, "grad_norm": 8.218033790588379, "learning_rate": 0.0001999028081944766, "logits/chosen": -0.8003982305526733, "logits/rejected": -0.8230556845664978, "logps/chosen": -9.953974723815918, "logps/rejected": -38.88124465942383, "loss": 0.9577436447143555, "memory(GiB)": 46.1, "nll_loss": 0.5776119232177734, "rewards/accuracies": 0.875, "rewards/chosen": -0.04882112890481949, "rewards/margins": 1.8343088626861572, "rewards/rejected": -1.8831300735473633, "step": 57, "train_speed(iter/s)": 0.008041 }, { "epoch": 0.12862984267794025, "grad_norm": 3.3079514503479004, "learning_rate": 0.00019988593782553483, "logits/chosen": -0.7837247252464294, "logits/rejected": -0.8169953227043152, "logps/chosen": -6.463255882263184, "logps/rejected": -35.57067108154297, "loss": 0.6752747893333435, "memory(GiB)": 46.1, "nll_loss": 0.37694644927978516, "rewards/accuracies": 0.84375, "rewards/chosen": 0.2689625918865204, "rewards/margins": 1.9062916040420532, "rewards/rejected": -1.6373289823532104, "step": 58, "train_speed(iter/s)": 0.008042 }, { "epoch": 0.1308475985861806, "grad_norm": 6.0413665771484375, "learning_rate": 0.00019986771889316172, "logits/chosen": -0.7406100034713745, "logits/rejected": -0.7850071787834167, "logps/chosen": -13.76762580871582, "logps/rejected": -43.040740966796875, "loss": 1.0095659494400024, "memory(GiB)": 46.1, "nll_loss": 0.6776630282402039, "rewards/accuracies": 0.84375, "rewards/chosen": -0.015833202749490738, "rewards/margins": 1.8320919275283813, "rewards/rejected": -1.8479251861572266, "step": 59, "train_speed(iter/s)": 0.008038 }, { "epoch": 0.13306535449442095, "grad_norm": 4.190580368041992, "learning_rate": 0.00019984815164333163, "logits/chosen": -0.7999930381774902, "logits/rejected": -0.8120794296264648, "logps/chosen": -7.115518569946289, "logps/rejected": -34.076663970947266, "loss": 1.0062350034713745, "memory(GiB)": 46.1, "nll_loss": 0.5622979402542114, "rewards/accuracies": 0.6875, "rewards/chosen": 0.14373064041137695, "rewards/margins": 1.5221604108810425, "rewards/rejected": -1.378429889678955, "step": 60, "train_speed(iter/s)": 0.008032 }, { "epoch": 0.1352831104026613, "grad_norm": 3.536224842071533, "learning_rate": 0.00019982723634022272, "logits/chosen": -0.7172912955284119, "logits/rejected": -0.7351298928260803, "logps/chosen": -11.005714416503906, "logps/rejected": -33.29360580444336, "loss": 0.7737724184989929, "memory(GiB)": 46.1, "nll_loss": 0.3809564411640167, "rewards/accuracies": 0.84375, "rewards/chosen": 0.19083550572395325, "rewards/margins": 1.2791187763214111, "rewards/rejected": -1.0882835388183594, "step": 61, "train_speed(iter/s)": 0.008033 }, { "epoch": 0.13750086631090166, "grad_norm": 4.615377426147461, "learning_rate": 0.00019980497326621316, "logits/chosen": -0.7390002012252808, "logits/rejected": -0.7629216909408569, "logps/chosen": -14.71272087097168, "logps/rejected": -28.800384521484375, "loss": 1.2719998359680176, "memory(GiB)": 46.1, "nll_loss": 0.6139569282531738, "rewards/accuracies": 0.65625, "rewards/chosen": 0.0792509913444519, "rewards/margins": 0.693626344203949, "rewards/rejected": -0.6143754124641418, "step": 62, "train_speed(iter/s)": 0.008031 }, { "epoch": 0.139718622219142, "grad_norm": 4.907950401306152, "learning_rate": 0.00019978136272187747, "logits/chosen": -0.757483720779419, "logits/rejected": -0.7904630899429321, "logps/chosen": -7.143397331237793, "logps/rejected": -37.529693603515625, "loss": 0.8591395020484924, "memory(GiB)": 46.1, "nll_loss": 0.47260788083076477, "rewards/accuracies": 0.8125, "rewards/chosen": 0.03792594373226166, "rewards/margins": 1.2297474145889282, "rewards/rejected": -1.1918214559555054, "step": 63, "train_speed(iter/s)": 0.008028 }, { "epoch": 0.14193637812738236, "grad_norm": 9.14727783203125, "learning_rate": 0.00019975640502598244, "logits/chosen": -0.7742553949356079, "logits/rejected": -0.8133993148803711, "logps/chosen": -10.656136512756348, "logps/rejected": -45.71231460571289, "loss": 0.9479065537452698, "memory(GiB)": 46.1, "nll_loss": 0.6450760364532471, "rewards/accuracies": 0.84375, "rewards/chosen": 0.07653652131557465, "rewards/margins": 2.4191930294036865, "rewards/rejected": -2.3426566123962402, "step": 64, "train_speed(iter/s)": 0.008025 }, { "epoch": 0.14415413403562272, "grad_norm": 6.157256603240967, "learning_rate": 0.00019973010051548275, "logits/chosen": -0.7872298955917358, "logits/rejected": -0.8282527923583984, "logps/chosen": -8.776991844177246, "logps/rejected": -43.008079528808594, "loss": 0.7078882455825806, "memory(GiB)": 46.1, "nll_loss": 0.43169137835502625, "rewards/accuracies": 0.9375, "rewards/chosen": 0.08513045310974121, "rewards/margins": 2.5409374237060547, "rewards/rejected": -2.4558072090148926, "step": 65, "train_speed(iter/s)": 0.008035 }, { "epoch": 0.14637188994386305, "grad_norm": 2.469653844833374, "learning_rate": 0.0001997024495455165, "logits/chosen": -0.7316989898681641, "logits/rejected": -0.7609662413597107, "logps/chosen": -9.443560600280762, "logps/rejected": -41.85050964355469, "loss": 0.6616421937942505, "memory(GiB)": 46.1, "nll_loss": 0.381237268447876, "rewards/accuracies": 0.9375, "rewards/chosen": 0.05163441598415375, "rewards/margins": 2.0620944499969482, "rewards/rejected": -2.010460138320923, "step": 66, "train_speed(iter/s)": 0.008034 }, { "epoch": 0.1485896458521034, "grad_norm": 5.567859172821045, "learning_rate": 0.00019967345248940034, "logits/chosen": -0.695087730884552, "logits/rejected": -0.708895206451416, "logps/chosen": -14.36052417755127, "logps/rejected": -31.9357852935791, "loss": 1.0636613368988037, "memory(GiB)": 46.1, "nll_loss": 0.6741958260536194, "rewards/accuracies": 0.8125, "rewards/chosen": 0.0757778137922287, "rewards/margins": 1.4089328050613403, "rewards/rejected": -1.3331550359725952, "step": 67, "train_speed(iter/s)": 0.008036 }, { "epoch": 0.15080740176034374, "grad_norm": 2.6372759342193604, "learning_rate": 0.00019964310973862455, "logits/chosen": -0.7357401847839355, "logits/rejected": -0.7486222982406616, "logps/chosen": -6.373124122619629, "logps/rejected": -39.36447525024414, "loss": 0.7257212996482849, "memory(GiB)": 46.1, "nll_loss": 0.36459508538246155, "rewards/accuracies": 0.875, "rewards/chosen": 0.18388086557388306, "rewards/margins": 1.8258121013641357, "rewards/rejected": -1.641931414604187, "step": 68, "train_speed(iter/s)": 0.008029 }, { "epoch": 0.1530251576685841, "grad_norm": 5.665070056915283, "learning_rate": 0.00019961142170284762, "logits/chosen": -0.7021870017051697, "logits/rejected": -0.7211427688598633, "logps/chosen": -12.284502983093262, "logps/rejected": -30.56876564025879, "loss": 1.1223974227905273, "memory(GiB)": 46.1, "nll_loss": 0.653534471988678, "rewards/accuracies": 0.71875, "rewards/chosen": 0.0864773616194725, "rewards/margins": 1.4587070941925049, "rewards/rejected": -1.3722295761108398, "step": 69, "train_speed(iter/s)": 0.008034 }, { "epoch": 0.15524291357682446, "grad_norm": 4.089859485626221, "learning_rate": 0.00019957838880989078, "logits/chosen": -0.6898348331451416, "logits/rejected": -0.6964607834815979, "logps/chosen": -14.947086334228516, "logps/rejected": -34.29672622680664, "loss": 1.0402615070343018, "memory(GiB)": 46.1, "nll_loss": 0.540707528591156, "rewards/accuracies": 0.65625, "rewards/chosen": -0.036627963185310364, "rewards/margins": 1.189173698425293, "rewards/rejected": -1.2258018255233765, "step": 70, "train_speed(iter/s)": 0.008037 }, { "epoch": 0.1574606694850648, "grad_norm": 3.818058729171753, "learning_rate": 0.00019954401150573222, "logits/chosen": -0.6947743892669678, "logits/rejected": -0.7197954654693604, "logps/chosen": -6.173555850982666, "logps/rejected": -28.507305145263672, "loss": 0.8432615399360657, "memory(GiB)": 46.1, "nll_loss": 0.4707663655281067, "rewards/accuracies": 0.8125, "rewards/chosen": 0.432411789894104, "rewards/margins": 1.5417673587799072, "rewards/rejected": -1.1093555688858032, "step": 71, "train_speed(iter/s)": 0.008037 }, { "epoch": 0.15967842539330515, "grad_norm": 4.713813304901123, "learning_rate": 0.00019950829025450114, "logits/chosen": -0.6722406148910522, "logits/rejected": -0.6857435703277588, "logps/chosen": -7.766820430755615, "logps/rejected": -26.340253829956055, "loss": 0.9169723391532898, "memory(GiB)": 46.1, "nll_loss": 0.5056720972061157, "rewards/accuracies": 0.78125, "rewards/chosen": 0.1677010953426361, "rewards/margins": 1.1372748613357544, "rewards/rejected": -0.9695737361907959, "step": 72, "train_speed(iter/s)": 0.008037 }, { "epoch": 0.1618961813015455, "grad_norm": 3.4665582180023193, "learning_rate": 0.00019947122553847136, "logits/chosen": -0.7526758909225464, "logits/rejected": -0.7613145112991333, "logps/chosen": -14.30706787109375, "logps/rejected": -30.180295944213867, "loss": 0.8724768161773682, "memory(GiB)": 46.1, "nll_loss": 0.41890856623649597, "rewards/accuracies": 0.75, "rewards/chosen": 0.1295187771320343, "rewards/margins": 1.2079225778579712, "rewards/rejected": -1.0784037113189697, "step": 73, "train_speed(iter/s)": 0.00803 }, { "epoch": 0.16411393720978584, "grad_norm": 12.609716415405273, "learning_rate": 0.0001994328178580548, "logits/chosen": -0.7560169696807861, "logits/rejected": -0.7651617527008057, "logps/chosen": -8.213447570800781, "logps/rejected": -43.658180236816406, "loss": 0.9154157042503357, "memory(GiB)": 46.1, "nll_loss": 0.6314950585365295, "rewards/accuracies": 0.9375, "rewards/chosen": 0.061887748539447784, "rewards/margins": 2.2252354621887207, "rewards/rejected": -2.1633477210998535, "step": 74, "train_speed(iter/s)": 0.008027 }, { "epoch": 0.1663316931180262, "grad_norm": 12.707162857055664, "learning_rate": 0.00019939306773179497, "logits/chosen": -0.7599114775657654, "logits/rejected": -0.7735819816589355, "logps/chosen": -7.509787082672119, "logps/rejected": -52.7489013671875, "loss": 0.7145227193832397, "memory(GiB)": 46.1, "nll_loss": 0.30735087394714355, "rewards/accuracies": 0.8125, "rewards/chosen": 0.028781913220882416, "rewards/margins": 2.859144926071167, "rewards/rejected": -2.8303627967834473, "step": 75, "train_speed(iter/s)": 0.008026 }, { "epoch": 0.16854944902626653, "grad_norm": 4.863827705383301, "learning_rate": 0.00019935197569635954, "logits/chosen": -0.7566101551055908, "logits/rejected": -0.7977889180183411, "logps/chosen": -8.841687202453613, "logps/rejected": -49.88290786743164, "loss": 0.7746098637580872, "memory(GiB)": 46.1, "nll_loss": 0.488862007856369, "rewards/accuracies": 0.90625, "rewards/chosen": 0.13911329209804535, "rewards/margins": 2.4493186473846436, "rewards/rejected": -2.3102054595947266, "step": 76, "train_speed(iter/s)": 0.008025 }, { "epoch": 0.1707672049345069, "grad_norm": 2.638216972351074, "learning_rate": 0.00019930954230653355, "logits/chosen": -0.7588043808937073, "logits/rejected": -0.7855987548828125, "logps/chosen": -4.888318061828613, "logps/rejected": -46.317176818847656, "loss": 0.5076995491981506, "memory(GiB)": 46.1, "nll_loss": 0.2771949768066406, "rewards/accuracies": 0.90625, "rewards/chosen": 0.2532336711883545, "rewards/margins": 2.56557035446167, "rewards/rejected": -2.3123364448547363, "step": 77, "train_speed(iter/s)": 0.008025 }, { "epoch": 0.17298496084274725, "grad_norm": 3.485717296600342, "learning_rate": 0.00019926576813521164, "logits/chosen": -0.8214580416679382, "logits/rejected": -0.8605206608772278, "logps/chosen": -8.181400299072266, "logps/rejected": -42.75120544433594, "loss": 0.7162066698074341, "memory(GiB)": 46.1, "nll_loss": 0.41232535243034363, "rewards/accuracies": 0.8125, "rewards/chosen": 0.1498756855726242, "rewards/margins": 2.346996784210205, "rewards/rejected": -2.1971211433410645, "step": 78, "train_speed(iter/s)": 0.008024 }, { "epoch": 0.17520271675098759, "grad_norm": 3.2950491905212402, "learning_rate": 0.00019922065377339036, "logits/chosen": -0.8543375730514526, "logits/rejected": -0.8765980005264282, "logps/chosen": -15.666474342346191, "logps/rejected": -36.56987380981445, "loss": 0.8590094447135925, "memory(GiB)": 46.1, "nll_loss": 0.5429059863090515, "rewards/accuracies": 0.875, "rewards/chosen": 0.2669352889060974, "rewards/margins": 1.803323745727539, "rewards/rejected": -1.5363885164260864, "step": 79, "train_speed(iter/s)": 0.00802 }, { "epoch": 0.17742047265922795, "grad_norm": 4.1412506103515625, "learning_rate": 0.00019917419983016025, "logits/chosen": -0.8439186215400696, "logits/rejected": -0.9001189470291138, "logps/chosen": -10.366392135620117, "logps/rejected": -49.56153106689453, "loss": 0.9545846581459045, "memory(GiB)": 46.1, "nll_loss": 0.7163697481155396, "rewards/accuracies": 0.9375, "rewards/chosen": 0.22070294618606567, "rewards/margins": 2.2959794998168945, "rewards/rejected": -2.0752763748168945, "step": 80, "train_speed(iter/s)": 0.00802 }, { "epoch": 0.1796382285674683, "grad_norm": 2.809291362762451, "learning_rate": 0.00019912640693269752, "logits/chosen": -0.7752825021743774, "logits/rejected": -0.8082448244094849, "logps/chosen": -6.980072021484375, "logps/rejected": -49.13923645019531, "loss": 0.7785353660583496, "memory(GiB)": 46.1, "nll_loss": 0.4162166714668274, "rewards/accuracies": 0.8125, "rewards/chosen": 0.3260034918785095, "rewards/margins": 2.5372085571289062, "rewards/rejected": -2.211205005645752, "step": 81, "train_speed(iter/s)": 0.008021 }, { "epoch": 0.18185598447570864, "grad_norm": 5.757961750030518, "learning_rate": 0.0001990772757262558, "logits/chosen": -0.8326177597045898, "logits/rejected": -0.8457602262496948, "logps/chosen": -14.738750457763672, "logps/rejected": -50.59590530395508, "loss": 1.1126980781555176, "memory(GiB)": 46.1, "nll_loss": 0.6883702874183655, "rewards/accuracies": 0.84375, "rewards/chosen": 0.017612110823392868, "rewards/margins": 3.0471317768096924, "rewards/rejected": -3.02951979637146, "step": 82, "train_speed(iter/s)": 0.008024 }, { "epoch": 0.184073740383949, "grad_norm": 43.46441650390625, "learning_rate": 0.00019902680687415705, "logits/chosen": -0.9140123128890991, "logits/rejected": -0.9116270542144775, "logps/chosen": -23.103540420532227, "logps/rejected": -48.863033294677734, "loss": 2.1918702125549316, "memory(GiB)": 46.1, "nll_loss": 1.8151426315307617, "rewards/accuracies": 0.8125, "rewards/chosen": -0.8213595747947693, "rewards/margins": 2.689864158630371, "rewards/rejected": -3.511223554611206, "step": 83, "train_speed(iter/s)": 0.008023 }, { "epoch": 0.18629149629218933, "grad_norm": 7.742120265960693, "learning_rate": 0.000198975001057783, "logits/chosen": -0.8376122713088989, "logits/rejected": -0.8708577752113342, "logps/chosen": -12.746369361877441, "logps/rejected": -67.55133819580078, "loss": 0.7703056335449219, "memory(GiB)": 46.1, "nll_loss": 0.4422933757305145, "rewards/accuracies": 0.71875, "rewards/chosen": 0.010235786437988281, "rewards/margins": 4.232974529266357, "rewards/rejected": -4.222738742828369, "step": 84, "train_speed(iter/s)": 0.008022 }, { "epoch": 0.1885092522004297, "grad_norm": 9.322490692138672, "learning_rate": 0.00019892185897656578, "logits/chosen": -0.8576998710632324, "logits/rejected": -0.8946700692176819, "logps/chosen": -16.83005142211914, "logps/rejected": -67.54959106445312, "loss": 1.138474464416504, "memory(GiB)": 46.1, "nll_loss": 0.8976783156394958, "rewards/accuracies": 0.90625, "rewards/chosen": -0.3624171316623688, "rewards/margins": 4.450318813323975, "rewards/rejected": -4.812736511230469, "step": 85, "train_speed(iter/s)": 0.008019 }, { "epoch": 0.19072700810867005, "grad_norm": 3.996424913406372, "learning_rate": 0.00019886738134797843, "logits/chosen": -0.8325670957565308, "logits/rejected": -0.9040736556053162, "logps/chosen": -9.318441390991211, "logps/rejected": -49.33755111694336, "loss": 0.8532267808914185, "memory(GiB)": 46.1, "nll_loss": 0.5119913220405579, "rewards/accuracies": 0.84375, "rewards/chosen": 0.10566120594739914, "rewards/margins": 2.421614170074463, "rewards/rejected": -2.315953254699707, "step": 86, "train_speed(iter/s)": 0.008018 }, { "epoch": 0.19294476401691038, "grad_norm": 7.568336009979248, "learning_rate": 0.00019881156890752517, "logits/chosen": -0.7875989079475403, "logits/rejected": -0.8255676627159119, "logps/chosen": -10.209391593933105, "logps/rejected": -38.12163162231445, "loss": 1.1016978025436401, "memory(GiB)": 46.1, "nll_loss": 0.5710477828979492, "rewards/accuracies": 0.78125, "rewards/chosen": -0.12029634416103363, "rewards/margins": 1.949970006942749, "rewards/rejected": -2.0702662467956543, "step": 87, "train_speed(iter/s)": 0.008019 }, { "epoch": 0.19516251992515074, "grad_norm": 4.460707187652588, "learning_rate": 0.00019875442240873173, "logits/chosen": -0.7924566268920898, "logits/rejected": -0.7932747602462769, "logps/chosen": -10.550544738769531, "logps/rejected": -29.39406967163086, "loss": 0.8096880912780762, "memory(GiB)": 46.1, "nll_loss": 0.42373886704444885, "rewards/accuracies": 0.8125, "rewards/chosen": 0.3358071446418762, "rewards/margins": 1.8472529649734497, "rewards/rejected": -1.5114457607269287, "step": 88, "train_speed(iter/s)": 0.00802 }, { "epoch": 0.1973802758333911, "grad_norm": 3.9834723472595215, "learning_rate": 0.0001986959426231349, "logits/chosen": -0.7446599006652832, "logits/rejected": -0.7426899075508118, "logps/chosen": -12.930614471435547, "logps/rejected": -26.922080993652344, "loss": 1.132792592048645, "memory(GiB)": 46.1, "nll_loss": 0.5469169616699219, "rewards/accuracies": 0.625, "rewards/chosen": -0.048162102699279785, "rewards/margins": 0.6297942996025085, "rewards/rejected": -0.6779564619064331, "step": 89, "train_speed(iter/s)": 0.008023 }, { "epoch": 0.19959803174163143, "grad_norm": 4.092418193817139, "learning_rate": 0.00019863613034027224, "logits/chosen": -0.7061215043067932, "logits/rejected": -0.7569677233695984, "logps/chosen": -6.195008754730225, "logps/rejected": -34.00957489013672, "loss": 0.8494804501533508, "memory(GiB)": 46.1, "nll_loss": 0.4875006675720215, "rewards/accuracies": 0.84375, "rewards/chosen": 0.26478877663612366, "rewards/margins": 1.2916200160980225, "rewards/rejected": -1.0268312692642212, "step": 90, "train_speed(iter/s)": 0.008024 }, { "epoch": 0.2018157876498718, "grad_norm": 3.3873367309570312, "learning_rate": 0.00019857498636767143, "logits/chosen": -0.6566476225852966, "logits/rejected": -0.7009319067001343, "logps/chosen": -6.160096645355225, "logps/rejected": -30.111385345458984, "loss": 0.8439165949821472, "memory(GiB)": 46.1, "nll_loss": 0.5105728507041931, "rewards/accuracies": 0.90625, "rewards/chosen": 0.41078829765319824, "rewards/margins": 1.2888054847717285, "rewards/rejected": -0.8780173063278198, "step": 91, "train_speed(iter/s)": 0.008022 }, { "epoch": 0.20403354355811212, "grad_norm": 2.58686900138855, "learning_rate": 0.0001985125115308393, "logits/chosen": -0.7298556566238403, "logits/rejected": -0.7364020347595215, "logps/chosen": -9.868298530578613, "logps/rejected": -22.635440826416016, "loss": 0.8916825652122498, "memory(GiB)": 46.1, "nll_loss": 0.466416597366333, "rewards/accuracies": 0.8125, "rewards/chosen": 0.39984455704689026, "rewards/margins": 0.953176736831665, "rewards/rejected": -0.5533321499824524, "step": 92, "train_speed(iter/s)": 0.008021 }, { "epoch": 0.20625129946635248, "grad_norm": 2.869520902633667, "learning_rate": 0.00019844870667325073, "logits/chosen": -0.6459857821464539, "logits/rejected": -0.6821721792221069, "logps/chosen": -10.646278381347656, "logps/rejected": -33.94523620605469, "loss": 0.8635712265968323, "memory(GiB)": 46.1, "nll_loss": 0.40875259041786194, "rewards/accuracies": 0.84375, "rewards/chosen": 0.17814505100250244, "rewards/margins": 1.1260223388671875, "rewards/rejected": -0.9478773474693298, "step": 93, "train_speed(iter/s)": 0.008017 }, { "epoch": 0.20846905537459284, "grad_norm": 2.5596885681152344, "learning_rate": 0.00019838357265633728, "logits/chosen": -0.6933214068412781, "logits/rejected": -0.7294182777404785, "logps/chosen": -9.423470497131348, "logps/rejected": -28.46645164489746, "loss": 0.8668123483657837, "memory(GiB)": 46.1, "nll_loss": 0.4432825744152069, "rewards/accuracies": 0.71875, "rewards/chosen": 0.2616448402404785, "rewards/margins": 1.0607826709747314, "rewards/rejected": -0.7991377711296082, "step": 94, "train_speed(iter/s)": 0.008017 }, { "epoch": 0.21068681128283318, "grad_norm": 2.987144947052002, "learning_rate": 0.0001983171103594755, "logits/chosen": -0.7186170816421509, "logits/rejected": -0.7554275989532471, "logps/chosen": -13.879290580749512, "logps/rejected": -41.82307434082031, "loss": 0.8854122161865234, "memory(GiB)": 46.1, "nll_loss": 0.5749840140342712, "rewards/accuracies": 0.875, "rewards/chosen": 0.34967276453971863, "rewards/margins": 2.095144510269165, "rewards/rejected": -1.7454715967178345, "step": 95, "train_speed(iter/s)": 0.008022 }, { "epoch": 0.21290456719107353, "grad_norm": 4.350345134735107, "learning_rate": 0.00019824932067997515, "logits/chosen": -0.6538293361663818, "logits/rejected": -0.7083633542060852, "logps/chosen": -13.237122535705566, "logps/rejected": -43.02968215942383, "loss": 1.1358224153518677, "memory(GiB)": 46.1, "nll_loss": 0.7784836292266846, "rewards/accuracies": 0.875, "rewards/chosen": 0.17013956606388092, "rewards/margins": 2.1158745288848877, "rewards/rejected": -1.945734977722168, "step": 96, "train_speed(iter/s)": 0.008026 }, { "epoch": 0.2151223230993139, "grad_norm": 10.145339965820312, "learning_rate": 0.00019818020453306697, "logits/chosen": -0.7033687829971313, "logits/rejected": -0.7348278760910034, "logps/chosen": -9.687533378601074, "logps/rejected": -38.41090774536133, "loss": 0.9101305603981018, "memory(GiB)": 46.1, "nll_loss": 0.6460333466529846, "rewards/accuracies": 0.875, "rewards/chosen": 0.22131364047527313, "rewards/margins": 2.366105079650879, "rewards/rejected": -2.1447913646698, "step": 97, "train_speed(iter/s)": 0.008028 }, { "epoch": 0.21734007900755423, "grad_norm": 4.888674736022949, "learning_rate": 0.00019810976285189038, "logits/chosen": -0.6517484784126282, "logits/rejected": -0.6647759079933167, "logps/chosen": -11.991264343261719, "logps/rejected": -40.05374526977539, "loss": 0.7888365983963013, "memory(GiB)": 46.1, "nll_loss": 0.5127142667770386, "rewards/accuracies": 0.875, "rewards/chosen": 0.08162616193294525, "rewards/margins": 2.0730180740356445, "rewards/rejected": -1.9913920164108276, "step": 98, "train_speed(iter/s)": 0.008028 }, { "epoch": 0.2195578349157946, "grad_norm": 2.9053163528442383, "learning_rate": 0.00019803799658748094, "logits/chosen": -0.6322453618049622, "logits/rejected": -0.6195716261863708, "logps/chosen": -11.029327392578125, "logps/rejected": -27.67604637145996, "loss": 0.8408295512199402, "memory(GiB)": 46.1, "nll_loss": 0.44112899899482727, "rewards/accuracies": 0.75, "rewards/chosen": 0.332018107175827, "rewards/margins": 1.5282344818115234, "rewards/rejected": -1.196216344833374, "step": 99, "train_speed(iter/s)": 0.00803 }, { "epoch": 0.22177559082403492, "grad_norm": 3.9380838871002197, "learning_rate": 0.0001979649067087574, "logits/chosen": -0.6178653240203857, "logits/rejected": -0.6780340075492859, "logps/chosen": -6.1165595054626465, "logps/rejected": -48.394866943359375, "loss": 0.6825374960899353, "memory(GiB)": 46.1, "nll_loss": 0.3889180123806, "rewards/accuracies": 0.84375, "rewards/chosen": 0.35112470388412476, "rewards/margins": 2.020500421524048, "rewards/rejected": -1.6693755388259888, "step": 100, "train_speed(iter/s)": 0.008028 }, { "epoch": 0.22399334673227528, "grad_norm": 4.091344356536865, "learning_rate": 0.0001978904942025087, "logits/chosen": -0.5362146496772766, "logits/rejected": -0.5435670018196106, "logps/chosen": -10.14964485168457, "logps/rejected": -33.93182373046875, "loss": 0.8511705994606018, "memory(GiB)": 46.1, "nll_loss": 0.4244406819343567, "rewards/accuracies": 0.71875, "rewards/chosen": -0.0012584757059812546, "rewards/margins": 1.5515294075012207, "rewards/rejected": -1.5527877807617188, "step": 101, "train_speed(iter/s)": 0.008013 }, { "epoch": 0.22621110264051564, "grad_norm": 3.6777844429016113, "learning_rate": 0.00019781476007338058, "logits/chosen": -0.519984245300293, "logits/rejected": -0.5302433371543884, "logps/chosen": -12.393686294555664, "logps/rejected": -28.21156883239746, "loss": 0.9213598966598511, "memory(GiB)": 46.1, "nll_loss": 0.5426865816116333, "rewards/accuracies": 0.78125, "rewards/chosen": 0.25866204500198364, "rewards/margins": 1.387097954750061, "rewards/rejected": -1.1284359693527222, "step": 102, "train_speed(iter/s)": 0.008018 }, { "epoch": 0.22842885854875597, "grad_norm": 2.3189024925231934, "learning_rate": 0.0001977377053438621, "logits/chosen": -0.6001867651939392, "logits/rejected": -0.632231593132019, "logps/chosen": -7.773558616638184, "logps/rejected": -34.698673248291016, "loss": 0.7014553546905518, "memory(GiB)": 46.1, "nll_loss": 0.3608202338218689, "rewards/accuracies": 0.875, "rewards/chosen": 0.3325607180595398, "rewards/margins": 1.3831188678741455, "rewards/rejected": -1.0505582094192505, "step": 103, "train_speed(iter/s)": 0.008017 }, { "epoch": 0.23064661445699633, "grad_norm": 3.2740068435668945, "learning_rate": 0.0001976593310542718, "logits/chosen": -0.578256368637085, "logits/rejected": -0.5909325480461121, "logps/chosen": -6.1796793937683105, "logps/rejected": -30.154891967773438, "loss": 0.8033835887908936, "memory(GiB)": 46.1, "nll_loss": 0.39110761880874634, "rewards/accuracies": 0.78125, "rewards/chosen": 0.1742677092552185, "rewards/margins": 1.1370247602462769, "rewards/rejected": -0.9627571702003479, "step": 104, "train_speed(iter/s)": 0.00802 }, { "epoch": 0.2328643703652367, "grad_norm": 3.2135934829711914, "learning_rate": 0.00019757963826274357, "logits/chosen": -0.5837016105651855, "logits/rejected": -0.588310182094574, "logps/chosen": -9.729472160339355, "logps/rejected": -34.4300422668457, "loss": 0.8487012386322021, "memory(GiB)": 46.1, "nll_loss": 0.37863489985466003, "rewards/accuracies": 0.75, "rewards/chosen": 0.037823110818862915, "rewards/margins": 1.5622057914733887, "rewards/rejected": -1.5243828296661377, "step": 105, "train_speed(iter/s)": 0.008018 }, { "epoch": 0.23508212627347702, "grad_norm": 3.867928981781006, "learning_rate": 0.00019749862804521254, "logits/chosen": -0.5833920836448669, "logits/rejected": -0.5896369218826294, "logps/chosen": -14.619677543640137, "logps/rejected": -39.831119537353516, "loss": 1.0550124645233154, "memory(GiB)": 46.1, "nll_loss": 0.6425492763519287, "rewards/accuracies": 0.75, "rewards/chosen": 0.002796528860926628, "rewards/margins": 1.8236141204833984, "rewards/rejected": -1.8208175897598267, "step": 106, "train_speed(iter/s)": 0.008015 }, { "epoch": 0.23729988218171738, "grad_norm": 4.911788463592529, "learning_rate": 0.00019741630149540035, "logits/chosen": -0.6418726444244385, "logits/rejected": -0.6708973050117493, "logps/chosen": -8.22497272491455, "logps/rejected": -45.075836181640625, "loss": 0.7518470287322998, "memory(GiB)": 46.1, "nll_loss": 0.4536428451538086, "rewards/accuracies": 0.84375, "rewards/chosen": -0.12467997521162033, "rewards/margins": 2.3994452953338623, "rewards/rejected": -2.524125337600708, "step": 107, "train_speed(iter/s)": 0.008018 }, { "epoch": 0.2395176380899577, "grad_norm": 4.135776519775391, "learning_rate": 0.0001973326597248006, "logits/chosen": -0.6478183269500732, "logits/rejected": -0.6533663272857666, "logps/chosen": -6.512712001800537, "logps/rejected": -40.08877944946289, "loss": 0.690629243850708, "memory(GiB)": 46.1, "nll_loss": 0.3907169997692108, "rewards/accuracies": 0.84375, "rewards/chosen": 0.21786418557167053, "rewards/margins": 2.6031618118286133, "rewards/rejected": -2.3852977752685547, "step": 108, "train_speed(iter/s)": 0.008018 }, { "epoch": 0.24173539399819807, "grad_norm": 4.422867298126221, "learning_rate": 0.00019724770386266363, "logits/chosen": -0.6119152307510376, "logits/rejected": -0.6426375508308411, "logps/chosen": -7.145269870758057, "logps/rejected": -49.40720748901367, "loss": 0.6389705538749695, "memory(GiB)": 46.1, "nll_loss": 0.3778725564479828, "rewards/accuracies": 0.875, "rewards/chosen": 0.0635518729686737, "rewards/margins": 2.8675644397735596, "rewards/rejected": -2.8040125370025635, "step": 109, "train_speed(iter/s)": 0.008019 }, { "epoch": 0.24395314990643843, "grad_norm": 6.416353702545166, "learning_rate": 0.0001971614350559814, "logits/chosen": -0.5623615384101868, "logits/rejected": -0.5931446552276611, "logps/chosen": -7.337302207946777, "logps/rejected": -48.94050979614258, "loss": 0.5740457773208618, "memory(GiB)": 46.1, "nll_loss": 0.42228132486343384, "rewards/accuracies": 0.96875, "rewards/chosen": 0.6646949052810669, "rewards/margins": 3.210062026977539, "rewards/rejected": -2.545367479324341, "step": 110, "train_speed(iter/s)": 0.00802 }, { "epoch": 0.24617090581467876, "grad_norm": 2.363133668899536, "learning_rate": 0.000197073854469472, "logits/chosen": -0.6107865571975708, "logits/rejected": -0.6239950060844421, "logps/chosen": -10.528251647949219, "logps/rejected": -37.559669494628906, "loss": 0.7298096418380737, "memory(GiB)": 46.1, "nll_loss": 0.4291239082813263, "rewards/accuracies": 0.875, "rewards/chosen": 0.32069048285484314, "rewards/margins": 2.222153663635254, "rewards/rejected": -1.9014630317687988, "step": 111, "train_speed(iter/s)": 0.008017 }, { "epoch": 0.24838866172291912, "grad_norm": 4.300288677215576, "learning_rate": 0.00019698496328556396, "logits/chosen": -0.6013592481613159, "logits/rejected": -0.6298633217811584, "logps/chosen": -12.510583877563477, "logps/rejected": -36.04363250732422, "loss": 0.9174787998199463, "memory(GiB)": 46.1, "nll_loss": 0.5793477296829224, "rewards/accuracies": 0.84375, "rewards/chosen": 0.19869008660316467, "rewards/margins": 1.6629492044448853, "rewards/rejected": -1.4642590284347534, "step": 112, "train_speed(iter/s)": 0.008015 }, { "epoch": 0.2506064176311595, "grad_norm": 7.3313493728637695, "learning_rate": 0.00019689476270438004, "logits/chosen": -0.5540329217910767, "logits/rejected": -0.5571173429489136, "logps/chosen": -8.091080665588379, "logps/rejected": -27.752933502197266, "loss": 0.8949199914932251, "memory(GiB)": 46.1, "nll_loss": 0.4742899537086487, "rewards/accuracies": 0.78125, "rewards/chosen": 0.1788148581981659, "rewards/margins": 1.2291390895843506, "rewards/rejected": -1.0503242015838623, "step": 113, "train_speed(iter/s)": 0.008016 }, { "epoch": 0.25282417353939984, "grad_norm": 2.6731913089752197, "learning_rate": 0.0001968032539437215, "logits/chosen": -0.5931655764579773, "logits/rejected": -0.6056005358695984, "logps/chosen": -5.9029951095581055, "logps/rejected": -40.255130767822266, "loss": 0.6467551589012146, "memory(GiB)": 46.1, "nll_loss": 0.4438669979572296, "rewards/accuracies": 0.96875, "rewards/chosen": 0.24888494610786438, "rewards/margins": 2.4213175773620605, "rewards/rejected": -2.1724328994750977, "step": 114, "train_speed(iter/s)": 0.008016 }, { "epoch": 0.25504192944764015, "grad_norm": 2.6930527687072754, "learning_rate": 0.0001967104382390511, "logits/chosen": -0.6651092767715454, "logits/rejected": -0.6895506978034973, "logps/chosen": -9.578208923339844, "logps/rejected": -34.64287185668945, "loss": 0.7224618792533875, "memory(GiB)": 46.1, "nll_loss": 0.4180094599723816, "rewards/accuracies": 0.875, "rewards/chosen": 0.3409712314605713, "rewards/margins": 2.1104307174682617, "rewards/rejected": -1.7694597244262695, "step": 115, "train_speed(iter/s)": 0.008012 }, { "epoch": 0.2572596853558805, "grad_norm": 3.387476682662964, "learning_rate": 0.00019661631684347685, "logits/chosen": -0.6467074155807495, "logits/rejected": -0.6696929335594177, "logps/chosen": -12.390437126159668, "logps/rejected": -44.5852165222168, "loss": 0.9567733407020569, "memory(GiB)": 46.1, "nll_loss": 0.5903316736221313, "rewards/accuracies": 0.8125, "rewards/chosen": 0.06747841835021973, "rewards/margins": 1.779471755027771, "rewards/rejected": -1.7119932174682617, "step": 116, "train_speed(iter/s)": 0.00801 }, { "epoch": 0.25947744126412087, "grad_norm": 3.1305816173553467, "learning_rate": 0.00019652089102773488, "logits/chosen": -0.6367936730384827, "logits/rejected": -0.6425185203552246, "logps/chosen": -11.601859092712402, "logps/rejected": -36.16029739379883, "loss": 0.9545689821243286, "memory(GiB)": 46.1, "nll_loss": 0.5791404247283936, "rewards/accuracies": 0.84375, "rewards/chosen": 0.139948308467865, "rewards/margins": 1.7838351726531982, "rewards/rejected": -1.6438865661621094, "step": 117, "train_speed(iter/s)": 0.008009 }, { "epoch": 0.2616951971723612, "grad_norm": 5.935551166534424, "learning_rate": 0.0001964241620801724, "logits/chosen": -0.7171432375907898, "logits/rejected": -0.7515658140182495, "logps/chosen": -12.206275939941406, "logps/rejected": -41.78958511352539, "loss": 1.0742188692092896, "memory(GiB)": 46.1, "nll_loss": 0.6272014379501343, "rewards/accuracies": 0.75, "rewards/chosen": -0.12931828200817108, "rewards/margins": 1.775916576385498, "rewards/rejected": -1.905234932899475, "step": 118, "train_speed(iter/s)": 0.008012 }, { "epoch": 0.2639129530806016, "grad_norm": 3.182480812072754, "learning_rate": 0.0001963261313067302, "logits/chosen": -0.6834742426872253, "logits/rejected": -0.7226250171661377, "logps/chosen": -6.070950984954834, "logps/rejected": -34.18709182739258, "loss": 0.8980444073677063, "memory(GiB)": 46.1, "nll_loss": 0.4420132637023926, "rewards/accuracies": 0.65625, "rewards/chosen": 0.2397366762161255, "rewards/margins": 1.7652424573898315, "rewards/rejected": -1.5255059003829956, "step": 119, "train_speed(iter/s)": 0.008013 }, { "epoch": 0.2661307089888419, "grad_norm": 4.235217094421387, "learning_rate": 0.00019622680003092503, "logits/chosen": -0.7337202429771423, "logits/rejected": -0.7412666082382202, "logps/chosen": -13.724693298339844, "logps/rejected": -46.71962356567383, "loss": 0.9812621474266052, "memory(GiB)": 46.1, "nll_loss": 0.6411746144294739, "rewards/accuracies": 0.8125, "rewards/chosen": -0.09581395983695984, "rewards/margins": 2.239417552947998, "rewards/rejected": -2.335231304168701, "step": 120, "train_speed(iter/s)": 0.008015 }, { "epoch": 0.26834846489708225, "grad_norm": 2.509409189224243, "learning_rate": 0.0001961261695938319, "logits/chosen": -0.6983414888381958, "logits/rejected": -0.7302532196044922, "logps/chosen": -12.647697448730469, "logps/rejected": -47.85969161987305, "loss": 0.7407037019729614, "memory(GiB)": 46.1, "nll_loss": 0.4768805503845215, "rewards/accuracies": 0.8125, "rewards/chosen": 0.3689803183078766, "rewards/margins": 3.114835023880005, "rewards/rejected": -2.745854377746582, "step": 121, "train_speed(iter/s)": 0.008014 }, { "epoch": 0.2705662208053226, "grad_norm": 3.401812791824341, "learning_rate": 0.00019602424135406569, "logits/chosen": -0.7398380041122437, "logits/rejected": -0.7770130634307861, "logps/chosen": -9.498916625976562, "logps/rejected": -52.57138442993164, "loss": 0.6471344828605652, "memory(GiB)": 46.1, "nll_loss": 0.46904683113098145, "rewards/accuracies": 0.9375, "rewards/chosen": 0.18257564306259155, "rewards/margins": 3.0506017208099365, "rewards/rejected": -2.868025779724121, "step": 122, "train_speed(iter/s)": 0.008015 }, { "epoch": 0.27278397671356297, "grad_norm": 3.7279372215270996, "learning_rate": 0.00019592101668776298, "logits/chosen": -0.7581114768981934, "logits/rejected": -0.7886280417442322, "logps/chosen": -8.954914093017578, "logps/rejected": -49.436580657958984, "loss": 0.7794913649559021, "memory(GiB)": 46.1, "nll_loss": 0.42245572805404663, "rewards/accuracies": 0.875, "rewards/chosen": 0.24546337127685547, "rewards/margins": 2.368910789489746, "rewards/rejected": -2.1234471797943115, "step": 123, "train_speed(iter/s)": 0.008011 }, { "epoch": 0.27500173262180333, "grad_norm": 2.763056993484497, "learning_rate": 0.00019581649698856358, "logits/chosen": -0.754249632358551, "logits/rejected": -0.7789746522903442, "logps/chosen": -6.999545097351074, "logps/rejected": -54.994590759277344, "loss": 0.49618056416511536, "memory(GiB)": 46.1, "nll_loss": 0.30507829785346985, "rewards/accuracies": 0.96875, "rewards/chosen": 0.30616074800491333, "rewards/margins": 3.148125171661377, "rewards/rejected": -2.8419644832611084, "step": 124, "train_speed(iter/s)": 0.008007 }, { "epoch": 0.2772194885300437, "grad_norm": 4.055456638336182, "learning_rate": 0.00019571068366759143, "logits/chosen": -0.7367149591445923, "logits/rejected": -0.7724103331565857, "logps/chosen": -7.0940070152282715, "logps/rejected": -38.532779693603516, "loss": 0.8412638306617737, "memory(GiB)": 46.1, "nll_loss": 0.5069564580917358, "rewards/accuracies": 0.875, "rewards/chosen": 0.26311713457107544, "rewards/margins": 2.167259693145752, "rewards/rejected": -1.9041424989700317, "step": 125, "train_speed(iter/s)": 0.008011 }, { "epoch": 0.279437244438284, "grad_norm": 7.62572717666626, "learning_rate": 0.00019560357815343577, "logits/chosen": -0.7477836608886719, "logits/rejected": -0.771050214767456, "logps/chosen": -9.567910194396973, "logps/rejected": -41.98735809326172, "loss": 0.6985211968421936, "memory(GiB)": 46.1, "nll_loss": 0.3839423358440399, "rewards/accuracies": 0.9375, "rewards/chosen": 0.3293745815753937, "rewards/margins": 2.38517165184021, "rewards/rejected": -2.0557968616485596, "step": 126, "train_speed(iter/s)": 0.008012 }, { "epoch": 0.28165500034652435, "grad_norm": 9.083622932434082, "learning_rate": 0.0001954951818921318, "logits/chosen": -0.6845836639404297, "logits/rejected": -0.7126042246818542, "logps/chosen": -10.922572135925293, "logps/rejected": -50.7385368347168, "loss": 0.7883904576301575, "memory(GiB)": 46.1, "nll_loss": 0.45509275794029236, "rewards/accuracies": 0.78125, "rewards/chosen": 0.08339966833591461, "rewards/margins": 2.7709593772888184, "rewards/rejected": -2.6875598430633545, "step": 127, "train_speed(iter/s)": 0.008012 }, { "epoch": 0.2838727562547647, "grad_norm": 6.918692111968994, "learning_rate": 0.00019538549634714108, "logits/chosen": -0.7463397979736328, "logits/rejected": -0.7875937819480896, "logps/chosen": -6.1263532638549805, "logps/rejected": -56.90166091918945, "loss": 0.5629154443740845, "memory(GiB)": 46.1, "nll_loss": 0.3863481283187866, "rewards/accuracies": 0.96875, "rewards/chosen": 0.3725871443748474, "rewards/margins": 3.788067579269409, "rewards/rejected": -3.415480375289917, "step": 128, "train_speed(iter/s)": 0.008013 }, { "epoch": 0.2860905121630051, "grad_norm": 3.020493507385254, "learning_rate": 0.0001952745229993319, "logits/chosen": -0.6778846383094788, "logits/rejected": -0.7200884819030762, "logps/chosen": -8.347317695617676, "logps/rejected": -45.266326904296875, "loss": 0.6461578011512756, "memory(GiB)": 46.1, "nll_loss": 0.4276276230812073, "rewards/accuracies": 0.9375, "rewards/chosen": 0.32448530197143555, "rewards/margins": 2.904148578643799, "rewards/rejected": -2.5796632766723633, "step": 129, "train_speed(iter/s)": 0.008013 }, { "epoch": 0.28830826807124543, "grad_norm": 6.105565071105957, "learning_rate": 0.0001951622633469592, "logits/chosen": -0.6739642024040222, "logits/rejected": -0.7229712009429932, "logps/chosen": -9.595758438110352, "logps/rejected": -61.285579681396484, "loss": 0.524199366569519, "memory(GiB)": 46.1, "nll_loss": 0.3470918536186218, "rewards/accuracies": 0.90625, "rewards/chosen": 0.26431241631507874, "rewards/margins": 3.8313231468200684, "rewards/rejected": -3.5670104026794434, "step": 130, "train_speed(iter/s)": 0.00801 }, { "epoch": 0.29052602397948574, "grad_norm": 3.1043567657470703, "learning_rate": 0.0001950487189056443, "logits/chosen": -0.725166916847229, "logits/rejected": -0.7790873646736145, "logps/chosen": -6.4268879890441895, "logps/rejected": -45.298736572265625, "loss": 0.7616266012191772, "memory(GiB)": 46.1, "nll_loss": 0.4726749062538147, "rewards/accuracies": 0.90625, "rewards/chosen": 0.20096376538276672, "rewards/margins": 2.216933250427246, "rewards/rejected": -2.0159695148468018, "step": 131, "train_speed(iter/s)": 0.008009 }, { "epoch": 0.2927437798877261, "grad_norm": 4.7475457191467285, "learning_rate": 0.00019493389120835462, "logits/chosen": -0.7168976068496704, "logits/rejected": -0.7184516191482544, "logps/chosen": -8.480973243713379, "logps/rejected": -39.217987060546875, "loss": 0.6954407691955566, "memory(GiB)": 46.1, "nll_loss": 0.3810206949710846, "rewards/accuracies": 0.90625, "rewards/chosen": 0.1063593327999115, "rewards/margins": 2.2143924236297607, "rewards/rejected": -2.1080331802368164, "step": 132, "train_speed(iter/s)": 0.008009 }, { "epoch": 0.29496153579596646, "grad_norm": 2.6074578762054443, "learning_rate": 0.0001948177818053827, "logits/chosen": -0.7467566132545471, "logits/rejected": -0.7593668699264526, "logps/chosen": -5.696949005126953, "logps/rejected": -39.8399543762207, "loss": 0.5127253532409668, "memory(GiB)": 46.1, "nll_loss": 0.2950189709663391, "rewards/accuracies": 0.90625, "rewards/chosen": 0.28634998202323914, "rewards/margins": 2.5809803009033203, "rewards/rejected": -2.2946300506591797, "step": 133, "train_speed(iter/s)": 0.008008 }, { "epoch": 0.2971792917042068, "grad_norm": 2.2834794521331787, "learning_rate": 0.0001947003922643256, "logits/chosen": -0.6837459802627563, "logits/rejected": -0.7182618975639343, "logps/chosen": -6.691904067993164, "logps/rejected": -50.19198226928711, "loss": 0.4669988751411438, "memory(GiB)": 46.1, "nll_loss": 0.2525062561035156, "rewards/accuracies": 0.96875, "rewards/chosen": 0.3388081192970276, "rewards/margins": 2.9852235317230225, "rewards/rejected": -2.6464154720306396, "step": 134, "train_speed(iter/s)": 0.008008 }, { "epoch": 0.2993970476124472, "grad_norm": 3.200366497039795, "learning_rate": 0.00019458172417006347, "logits/chosen": -0.7646272778511047, "logits/rejected": -0.7724561095237732, "logps/chosen": -11.684989929199219, "logps/rejected": -54.008689880371094, "loss": 0.6327359676361084, "memory(GiB)": 46.1, "nll_loss": 0.4540945291519165, "rewards/accuracies": 0.90625, "rewards/chosen": 0.0852358415722847, "rewards/margins": 3.4554994106292725, "rewards/rejected": -3.3702638149261475, "step": 135, "train_speed(iter/s)": 0.008008 }, { "epoch": 0.3016148035206875, "grad_norm": 3.3365910053253174, "learning_rate": 0.0001944617791247383, "logits/chosen": -0.7103350162506104, "logits/rejected": -0.7452230453491211, "logps/chosen": -8.785733222961426, "logps/rejected": -54.68450927734375, "loss": 0.5810406804084778, "memory(GiB)": 46.1, "nll_loss": 0.34376901388168335, "rewards/accuracies": 0.875, "rewards/chosen": 0.027914080768823624, "rewards/margins": 3.3302230834960938, "rewards/rejected": -3.302309036254883, "step": 136, "train_speed(iter/s)": 0.008009 }, { "epoch": 0.30383255942892784, "grad_norm": 2.9257876873016357, "learning_rate": 0.00019434055874773215, "logits/chosen": -0.8141021132469177, "logits/rejected": -0.8318851590156555, "logps/chosen": -9.164875984191895, "logps/rejected": -67.25471496582031, "loss": 0.5762239098548889, "memory(GiB)": 46.1, "nll_loss": 0.38338595628738403, "rewards/accuracies": 0.9375, "rewards/chosen": 0.13336460292339325, "rewards/margins": 4.796402454376221, "rewards/rejected": -4.66303825378418, "step": 137, "train_speed(iter/s)": 0.008011 }, { "epoch": 0.3060503153371682, "grad_norm": 11.465249061584473, "learning_rate": 0.00019421806467564544, "logits/chosen": -0.8505054712295532, "logits/rejected": -0.8561327457427979, "logps/chosen": -14.665526390075684, "logps/rejected": -62.366455078125, "loss": 1.0324087142944336, "memory(GiB)": 46.1, "nll_loss": 0.8431021571159363, "rewards/accuracies": 0.90625, "rewards/chosen": -0.13415789604187012, "rewards/margins": 4.457357883453369, "rewards/rejected": -4.591516017913818, "step": 138, "train_speed(iter/s)": 0.008009 }, { "epoch": 0.30826807124540856, "grad_norm": 9.11307144165039, "learning_rate": 0.00019409429856227485, "logits/chosen": -0.8643976449966431, "logits/rejected": -0.8899680376052856, "logps/chosen": -15.65466022491455, "logps/rejected": -67.30322265625, "loss": 0.9621648192405701, "memory(GiB)": 46.1, "nll_loss": 0.6606032848358154, "rewards/accuracies": 0.90625, "rewards/chosen": -0.6521536111831665, "rewards/margins": 4.181577205657959, "rewards/rejected": -4.833731174468994, "step": 139, "train_speed(iter/s)": 0.008006 }, { "epoch": 0.3104858271536489, "grad_norm": 4.7639479637146, "learning_rate": 0.00019396926207859084, "logits/chosen": -0.801943302154541, "logits/rejected": -0.8345421552658081, "logps/chosen": -12.861966133117676, "logps/rejected": -66.0527114868164, "loss": 0.8016439080238342, "memory(GiB)": 46.1, "nll_loss": 0.5596946477890015, "rewards/accuracies": 0.90625, "rewards/chosen": -0.06389661133289337, "rewards/margins": 4.517420291900635, "rewards/rejected": -4.581316947937012, "step": 140, "train_speed(iter/s)": 0.008006 }, { "epoch": 0.3127035830618892, "grad_norm": 2.60500431060791, "learning_rate": 0.00019384295691271522, "logits/chosen": -0.7634690999984741, "logits/rejected": -0.7890049815177917, "logps/chosen": -14.464373588562012, "logps/rejected": -45.3537712097168, "loss": 0.7553504109382629, "memory(GiB)": 46.1, "nll_loss": 0.4683433771133423, "rewards/accuracies": 0.875, "rewards/chosen": 0.1130230501294136, "rewards/margins": 2.7340469360351562, "rewards/rejected": -2.6210238933563232, "step": 141, "train_speed(iter/s)": 0.008008 }, { "epoch": 0.3149213389701296, "grad_norm": 14.524946212768555, "learning_rate": 0.0001937153847698983, "logits/chosen": -0.7227780818939209, "logits/rejected": -0.7420411705970764, "logps/chosen": -15.700582504272461, "logps/rejected": -41.36809539794922, "loss": 1.1037310361862183, "memory(GiB)": 46.1, "nll_loss": 0.6305118799209595, "rewards/accuracies": 0.84375, "rewards/chosen": 0.0189147237688303, "rewards/margins": 2.218311071395874, "rewards/rejected": -2.1993966102600098, "step": 142, "train_speed(iter/s)": 0.008012 }, { "epoch": 0.31713909487836994, "grad_norm": 2.8219783306121826, "learning_rate": 0.00019358654737249592, "logits/chosen": -0.6690309643745422, "logits/rejected": -0.7185367345809937, "logps/chosen": -14.496091842651367, "logps/rejected": -48.948814392089844, "loss": 0.785977840423584, "memory(GiB)": 46.1, "nll_loss": 0.508230984210968, "rewards/accuracies": 0.9375, "rewards/chosen": 0.3897581100463867, "rewards/margins": 2.4535489082336426, "rewards/rejected": -2.063790798187256, "step": 143, "train_speed(iter/s)": 0.008013 }, { "epoch": 0.3193568507866103, "grad_norm": 3.476428270339966, "learning_rate": 0.0001934564464599461, "logits/chosen": -0.6897503137588501, "logits/rejected": -0.7208132743835449, "logps/chosen": -7.115019798278809, "logps/rejected": -35.45432662963867, "loss": 0.6814590692520142, "memory(GiB)": 46.1, "nll_loss": 0.3637453615665436, "rewards/accuracies": 0.875, "rewards/chosen": 0.2670714855194092, "rewards/margins": 1.9641859531402588, "rewards/rejected": -1.6971145868301392, "step": 144, "train_speed(iter/s)": 0.008017 }, { "epoch": 0.32157460669485066, "grad_norm": 4.858798503875732, "learning_rate": 0.0001933250837887457, "logits/chosen": -0.6452350616455078, "logits/rejected": -0.6644193530082703, "logps/chosen": -11.701910018920898, "logps/rejected": -29.85957908630371, "loss": 1.0518276691436768, "memory(GiB)": 46.1, "nll_loss": 0.5833199620246887, "rewards/accuracies": 0.78125, "rewards/chosen": 0.1761394739151001, "rewards/margins": 0.9052659869194031, "rewards/rejected": -0.7291264533996582, "step": 145, "train_speed(iter/s)": 0.008017 }, { "epoch": 0.323792362603091, "grad_norm": 2.92645001411438, "learning_rate": 0.00019319246113242664, "logits/chosen": -0.6735572814941406, "logits/rejected": -0.6972106099128723, "logps/chosen": -9.01904296875, "logps/rejected": -23.485305786132812, "loss": 0.8951749205589294, "memory(GiB)": 46.1, "nll_loss": 0.5108327269554138, "rewards/accuracies": 0.9375, "rewards/chosen": 0.28073376417160034, "rewards/margins": 1.0756409168243408, "rewards/rejected": -0.7949072122573853, "step": 146, "train_speed(iter/s)": 0.008016 }, { "epoch": 0.3260101185113313, "grad_norm": 3.2365665435791016, "learning_rate": 0.00019305858028153186, "logits/chosen": -0.7025231719017029, "logits/rejected": -0.7322810888290405, "logps/chosen": -8.566629409790039, "logps/rejected": -40.44590377807617, "loss": 0.7701326012611389, "memory(GiB)": 46.1, "nll_loss": 0.42253950238227844, "rewards/accuracies": 0.875, "rewards/chosen": 0.22694279253482819, "rewards/margins": 1.8927738666534424, "rewards/rejected": -1.6658309698104858, "step": 147, "train_speed(iter/s)": 0.008018 }, { "epoch": 0.3282278744195717, "grad_norm": 3.0658862590789795, "learning_rate": 0.00019292344304359124, "logits/chosen": -0.6364326477050781, "logits/rejected": -0.6599412560462952, "logps/chosen": -9.841287612915039, "logps/rejected": -29.358394622802734, "loss": 0.7886962294578552, "memory(GiB)": 46.1, "nll_loss": 0.40780922770500183, "rewards/accuracies": 0.90625, "rewards/chosen": 0.2544412314891815, "rewards/margins": 1.3426122665405273, "rewards/rejected": -1.088171124458313, "step": 148, "train_speed(iter/s)": 0.00802 }, { "epoch": 0.33044563032781205, "grad_norm": 12.607818603515625, "learning_rate": 0.00019278705124309723, "logits/chosen": -0.6786209344863892, "logits/rejected": -0.7097568511962891, "logps/chosen": -5.964594841003418, "logps/rejected": -53.86275863647461, "loss": 0.5599427223205566, "memory(GiB)": 46.1, "nll_loss": 0.40204113721847534, "rewards/accuracies": 0.96875, "rewards/chosen": 0.21791748702526093, "rewards/margins": 3.074826240539551, "rewards/rejected": -2.8569085597991943, "step": 149, "train_speed(iter/s)": 0.008021 }, { "epoch": 0.3326633862360524, "grad_norm": 2.428448438644409, "learning_rate": 0.00019264940672148018, "logits/chosen": -0.7238892316818237, "logits/rejected": -0.7602605819702148, "logps/chosen": -10.805157661437988, "logps/rejected": -51.04298400878906, "loss": 0.6146640777587891, "memory(GiB)": 46.1, "nll_loss": 0.313792884349823, "rewards/accuracies": 0.84375, "rewards/chosen": -0.05205656588077545, "rewards/margins": 2.0433130264282227, "rewards/rejected": -2.095369577407837, "step": 150, "train_speed(iter/s)": 0.008022 }, { "epoch": 0.33488114214429276, "grad_norm": 3.576777458190918, "learning_rate": 0.0001925105113370834, "logits/chosen": -0.734486997127533, "logits/rejected": -0.7705245614051819, "logps/chosen": -9.474486351013184, "logps/rejected": -41.55698776245117, "loss": 0.8946757316589355, "memory(GiB)": 46.1, "nll_loss": 0.5271129608154297, "rewards/accuracies": 0.8125, "rewards/chosen": 0.17018195986747742, "rewards/margins": 2.1353487968444824, "rewards/rejected": -1.9651670455932617, "step": 151, "train_speed(iter/s)": 0.008012 }, { "epoch": 0.33709889805253307, "grad_norm": 13.971368789672852, "learning_rate": 0.00019237036696513818, "logits/chosen": -0.7242223620414734, "logits/rejected": -0.7463615536689758, "logps/chosen": -12.119179725646973, "logps/rejected": -39.10074996948242, "loss": 1.3560465574264526, "memory(GiB)": 46.1, "nll_loss": 1.0073633193969727, "rewards/accuracies": 0.8125, "rewards/chosen": 0.06672754883766174, "rewards/margins": 1.9847290515899658, "rewards/rejected": -1.9180015325546265, "step": 152, "train_speed(iter/s)": 0.008014 }, { "epoch": 0.33931665396077343, "grad_norm": 3.170781135559082, "learning_rate": 0.00019222897549773848, "logits/chosen": -0.7781574130058289, "logits/rejected": -0.7878897190093994, "logps/chosen": -9.464417457580566, "logps/rejected": -42.03047180175781, "loss": 0.7055684328079224, "memory(GiB)": 46.1, "nll_loss": 0.3885788023471832, "rewards/accuracies": 0.78125, "rewards/chosen": 0.05404181033372879, "rewards/margins": 2.449146270751953, "rewards/rejected": -2.39510440826416, "step": 153, "train_speed(iter/s)": 0.008015 }, { "epoch": 0.3415344098690138, "grad_norm": 2.7523646354675293, "learning_rate": 0.00019208633884381526, "logits/chosen": -0.7232592701911926, "logits/rejected": -0.7529851198196411, "logps/chosen": -7.77958345413208, "logps/rejected": -44.71973419189453, "loss": 0.6493588089942932, "memory(GiB)": 46.1, "nll_loss": 0.42470622062683105, "rewards/accuracies": 0.90625, "rewards/chosen": 0.388906866312027, "rewards/margins": 2.8554818630218506, "rewards/rejected": -2.4665746688842773, "step": 154, "train_speed(iter/s)": 0.008016 }, { "epoch": 0.34375216577725415, "grad_norm": 20.620134353637695, "learning_rate": 0.0001919424589291108, "logits/chosen": -0.7193765044212341, "logits/rejected": -0.7572377920150757, "logps/chosen": -11.307958602905273, "logps/rejected": -51.39036178588867, "loss": 1.0872689485549927, "memory(GiB)": 46.1, "nll_loss": 0.8757498860359192, "rewards/accuracies": 0.875, "rewards/chosen": 0.19819001853466034, "rewards/margins": 2.9048383235931396, "rewards/rejected": -2.706648111343384, "step": 155, "train_speed(iter/s)": 0.008016 }, { "epoch": 0.3459699216854945, "grad_norm": 14.992989540100098, "learning_rate": 0.0001917973376961527, "logits/chosen": -0.7125108242034912, "logits/rejected": -0.7249738574028015, "logps/chosen": -5.366758346557617, "logps/rejected": -33.353816986083984, "loss": 0.7495843768119812, "memory(GiB)": 46.1, "nll_loss": 0.4479677975177765, "rewards/accuracies": 0.875, "rewards/chosen": 0.20626316964626312, "rewards/margins": 1.818756341934204, "rewards/rejected": -1.6124933958053589, "step": 156, "train_speed(iter/s)": 0.008015 }, { "epoch": 0.3481876775937348, "grad_norm": 2.707430362701416, "learning_rate": 0.0001916509771042277, "logits/chosen": -0.7225325703620911, "logits/rejected": -0.7751076221466064, "logps/chosen": -7.558128356933594, "logps/rejected": -59.62013626098633, "loss": 0.3974663317203522, "memory(GiB)": 46.1, "nll_loss": 0.2714276611804962, "rewards/accuracies": 0.9375, "rewards/chosen": 0.11370375007390976, "rewards/margins": 3.6732826232910156, "rewards/rejected": -3.5595788955688477, "step": 157, "train_speed(iter/s)": 0.008016 }, { "epoch": 0.35040543350197517, "grad_norm": 8.831613540649414, "learning_rate": 0.0001915033791293551, "logits/chosen": -0.6869341731071472, "logits/rejected": -0.7035802006721497, "logps/chosen": -11.216403007507324, "logps/rejected": -38.74596405029297, "loss": 0.7746688723564148, "memory(GiB)": 46.1, "nll_loss": 0.45386001467704773, "rewards/accuracies": 0.875, "rewards/chosen": 0.166388601064682, "rewards/margins": 1.9721925258636475, "rewards/rejected": -1.8058040142059326, "step": 158, "train_speed(iter/s)": 0.008018 }, { "epoch": 0.35262318941021553, "grad_norm": 2.9480724334716797, "learning_rate": 0.0001913545457642601, "logits/chosen": -0.6564315557479858, "logits/rejected": -0.6884806752204895, "logps/chosen": -12.068757057189941, "logps/rejected": -44.580867767333984, "loss": 0.7749238610267639, "memory(GiB)": 46.1, "nll_loss": 0.5597700476646423, "rewards/accuracies": 0.90625, "rewards/chosen": 0.36497005820274353, "rewards/margins": 2.6146392822265625, "rewards/rejected": -2.249669075012207, "step": 159, "train_speed(iter/s)": 0.00802 }, { "epoch": 0.3548409453184559, "grad_norm": 2.8434133529663086, "learning_rate": 0.00019120447901834706, "logits/chosen": -0.7489297389984131, "logits/rejected": -0.777446985244751, "logps/chosen": -8.937162399291992, "logps/rejected": -36.274837493896484, "loss": 0.885219395160675, "memory(GiB)": 46.1, "nll_loss": 0.46223700046539307, "rewards/accuracies": 0.75, "rewards/chosen": 0.03733991086483002, "rewards/margins": 1.7854254245758057, "rewards/rejected": -1.7480854988098145, "step": 160, "train_speed(iter/s)": 0.008022 }, { "epoch": 0.35705870122669625, "grad_norm": 3.0293800830841064, "learning_rate": 0.0001910531809176722, "logits/chosen": -0.7100561261177063, "logits/rejected": -0.7253575921058655, "logps/chosen": -11.041877746582031, "logps/rejected": -45.55367660522461, "loss": 0.7278915643692017, "memory(GiB)": 46.1, "nll_loss": 0.4644385874271393, "rewards/accuracies": 0.875, "rewards/chosen": 0.07243353128433228, "rewards/margins": 2.7052664756774902, "rewards/rejected": -2.6328327655792236, "step": 161, "train_speed(iter/s)": 0.008025 }, { "epoch": 0.3592764571349366, "grad_norm": 4.234739780426025, "learning_rate": 0.00019090065350491626, "logits/chosen": -0.7882344126701355, "logits/rejected": -0.8183198571205139, "logps/chosen": -8.469147682189941, "logps/rejected": -49.76445007324219, "loss": 0.9398418664932251, "memory(GiB)": 46.1, "nll_loss": 0.6014910936355591, "rewards/accuracies": 0.96875, "rewards/chosen": 0.029901552945375443, "rewards/margins": 2.6962218284606934, "rewards/rejected": -2.6663200855255127, "step": 162, "train_speed(iter/s)": 0.008025 }, { "epoch": 0.3614942130431769, "grad_norm": 3.7181763648986816, "learning_rate": 0.00019074689883935705, "logits/chosen": -0.833709716796875, "logits/rejected": -0.8633042573928833, "logps/chosen": -9.177538871765137, "logps/rejected": -48.86741638183594, "loss": 0.6912304759025574, "memory(GiB)": 46.1, "nll_loss": 0.4258120059967041, "rewards/accuracies": 0.9375, "rewards/chosen": 0.2436945140361786, "rewards/margins": 3.05234432220459, "rewards/rejected": -2.808649778366089, "step": 163, "train_speed(iter/s)": 0.008026 }, { "epoch": 0.3637119689514173, "grad_norm": 3.1451849937438965, "learning_rate": 0.00019059191899684154, "logits/chosen": -0.8144320845603943, "logits/rejected": -0.8437734842300415, "logps/chosen": -11.074281692504883, "logps/rejected": -45.48798370361328, "loss": 0.6197302937507629, "memory(GiB)": 46.1, "nll_loss": 0.3811179995536804, "rewards/accuracies": 0.90625, "rewards/chosen": 0.15162959694862366, "rewards/margins": 2.7688112258911133, "rewards/rejected": -2.6171817779541016, "step": 164, "train_speed(iter/s)": 0.008025 }, { "epoch": 0.36592972485965763, "grad_norm": 4.043789386749268, "learning_rate": 0.00019043571606975777, "logits/chosen": -0.7649494409561157, "logits/rejected": -0.7870344519615173, "logps/chosen": -15.020736694335938, "logps/rejected": -43.62554931640625, "loss": 1.026597261428833, "memory(GiB)": 46.1, "nll_loss": 0.6712150573730469, "rewards/accuracies": 0.875, "rewards/chosen": 0.06518545746803284, "rewards/margins": 2.171983480453491, "rewards/rejected": -2.106797933578491, "step": 165, "train_speed(iter/s)": 0.008026 }, { "epoch": 0.368147480767898, "grad_norm": 3.109821081161499, "learning_rate": 0.00019027829216700678, "logits/chosen": -0.7875198721885681, "logits/rejected": -0.8325733542442322, "logps/chosen": -9.139036178588867, "logps/rejected": -56.36309051513672, "loss": 0.6341462731361389, "memory(GiB)": 46.1, "nll_loss": 0.451867938041687, "rewards/accuracies": 0.96875, "rewards/chosen": 0.23630189895629883, "rewards/margins": 3.3503074645996094, "rewards/rejected": -3.1140055656433105, "step": 166, "train_speed(iter/s)": 0.008027 }, { "epoch": 0.37036523667613835, "grad_norm": 2.6877574920654297, "learning_rate": 0.00019011964941397405, "logits/chosen": -0.7355461120605469, "logits/rejected": -0.7912125587463379, "logps/chosen": -7.943358421325684, "logps/rejected": -54.66022872924805, "loss": 0.6476521492004395, "memory(GiB)": 46.1, "nll_loss": 0.4549351930618286, "rewards/accuracies": 0.9375, "rewards/chosen": 0.3065571188926697, "rewards/margins": 3.0600643157958984, "rewards/rejected": -2.753507614135742, "step": 167, "train_speed(iter/s)": 0.008029 }, { "epoch": 0.37258299258437866, "grad_norm": 2.4588301181793213, "learning_rate": 0.0001899597899525007, "logits/chosen": -0.7490441799163818, "logits/rejected": -0.7880818843841553, "logps/chosen": -5.591465473175049, "logps/rejected": -50.0340690612793, "loss": 0.5648373961448669, "memory(GiB)": 46.1, "nll_loss": 0.3865860402584076, "rewards/accuracies": 0.9375, "rewards/chosen": 0.4422666132450104, "rewards/margins": 3.342369318008423, "rewards/rejected": -2.9001028537750244, "step": 168, "train_speed(iter/s)": 0.00803 }, { "epoch": 0.374800748492619, "grad_norm": 1.955082893371582, "learning_rate": 0.0001897987159408548, "logits/chosen": -0.7648451328277588, "logits/rejected": -0.7907530665397644, "logps/chosen": -4.5870208740234375, "logps/rejected": -48.017208099365234, "loss": 0.44469985365867615, "memory(GiB)": 46.1, "nll_loss": 0.24593624472618103, "rewards/accuracies": 0.96875, "rewards/chosen": 0.260402113199234, "rewards/margins": 3.37278151512146, "rewards/rejected": -3.112379312515259, "step": 169, "train_speed(iter/s)": 0.008031 }, { "epoch": 0.3770185044008594, "grad_norm": 4.219427585601807, "learning_rate": 0.00018963642955370201, "logits/chosen": -0.7837445139884949, "logits/rejected": -0.8009445667266846, "logps/chosen": -12.525315284729004, "logps/rejected": -44.30619430541992, "loss": 0.9331468939781189, "memory(GiB)": 46.1, "nll_loss": 0.5888757109642029, "rewards/accuracies": 0.90625, "rewards/chosen": -0.15850315988063812, "rewards/margins": 2.3680062294006348, "rewards/rejected": -2.5265092849731445, "step": 170, "train_speed(iter/s)": 0.008028 }, { "epoch": 0.37923626030909974, "grad_norm": 3.6719424724578857, "learning_rate": 0.00018947293298207635, "logits/chosen": -0.6751590967178345, "logits/rejected": -0.7674037218093872, "logps/chosen": -9.650009155273438, "logps/rejected": -63.452606201171875, "loss": 0.7752348184585571, "memory(GiB)": 46.1, "nll_loss": 0.6017739772796631, "rewards/accuracies": 0.9375, "rewards/chosen": 0.13403475284576416, "rewards/margins": 3.4565603733062744, "rewards/rejected": -3.3225257396698, "step": 171, "train_speed(iter/s)": 0.00803 }, { "epoch": 0.3814540162173401, "grad_norm": 3.4011969566345215, "learning_rate": 0.00018930822843335056, "logits/chosen": -0.704400360584259, "logits/rejected": -0.7298606634140015, "logps/chosen": -8.851949691772461, "logps/rejected": -45.742679595947266, "loss": 0.7604430317878723, "memory(GiB)": 46.1, "nll_loss": 0.5082038044929504, "rewards/accuracies": 0.90625, "rewards/chosen": 0.08242911100387573, "rewards/margins": 2.7466654777526855, "rewards/rejected": -2.664236307144165, "step": 172, "train_speed(iter/s)": 0.008032 }, { "epoch": 0.3836717721255804, "grad_norm": 3.709373712539673, "learning_rate": 0.00018914231813120635, "logits/chosen": -0.7612942457199097, "logits/rejected": -0.7619401216506958, "logps/chosen": -14.791999816894531, "logps/rejected": -39.538509368896484, "loss": 0.8681156635284424, "memory(GiB)": 46.1, "nll_loss": 0.5611632466316223, "rewards/accuracies": 0.875, "rewards/chosen": -0.0010512899607419968, "rewards/margins": 2.186850070953369, "rewards/rejected": -2.187901496887207, "step": 173, "train_speed(iter/s)": 0.008029 }, { "epoch": 0.38588952803382076, "grad_norm": 2.616783380508423, "learning_rate": 0.00018897520431560434, "logits/chosen": -0.7609409689903259, "logits/rejected": -0.7808184623718262, "logps/chosen": -5.7523698806762695, "logps/rejected": -45.965145111083984, "loss": 0.5051267743110657, "memory(GiB)": 46.1, "nll_loss": 0.2791001796722412, "rewards/accuracies": 0.875, "rewards/chosen": 0.376434326171875, "rewards/margins": 2.61958909034729, "rewards/rejected": -2.243154764175415, "step": 174, "train_speed(iter/s)": 0.008026 }, { "epoch": 0.3881072839420611, "grad_norm": 2.9114208221435547, "learning_rate": 0.00018880688924275378, "logits/chosen": -0.6863377094268799, "logits/rejected": -0.7190892696380615, "logps/chosen": -4.734968662261963, "logps/rejected": -39.10625076293945, "loss": 0.6738218069076538, "memory(GiB)": 46.1, "nll_loss": 0.40073657035827637, "rewards/accuracies": 0.90625, "rewards/chosen": 0.2266547530889511, "rewards/margins": 2.0988874435424805, "rewards/rejected": -1.8722326755523682, "step": 175, "train_speed(iter/s)": 0.008028 }, { "epoch": 0.3903250398503015, "grad_norm": 6.051851272583008, "learning_rate": 0.00018863737518508218, "logits/chosen": -0.7415744066238403, "logits/rejected": -0.773291826248169, "logps/chosen": -9.922603607177734, "logps/rejected": -46.90787887573242, "loss": 0.76039057970047, "memory(GiB)": 46.1, "nll_loss": 0.4856896996498108, "rewards/accuracies": 0.84375, "rewards/chosen": 0.12430408596992493, "rewards/margins": 2.302933692932129, "rewards/rejected": -2.1786296367645264, "step": 176, "train_speed(iter/s)": 0.008027 }, { "epoch": 0.39254279575854184, "grad_norm": 2.987578868865967, "learning_rate": 0.0001884666644312046, "logits/chosen": -0.7061051726341248, "logits/rejected": -0.7338166832923889, "logps/chosen": -15.18138599395752, "logps/rejected": -43.154415130615234, "loss": 0.7650496363639832, "memory(GiB)": 46.1, "nll_loss": 0.5320225954055786, "rewards/accuracies": 0.96875, "rewards/chosen": 0.2508482336997986, "rewards/margins": 2.6881744861602783, "rewards/rejected": -2.437325954437256, "step": 177, "train_speed(iter/s)": 0.008029 }, { "epoch": 0.3947605516667822, "grad_norm": 2.5779054164886475, "learning_rate": 0.00018829475928589271, "logits/chosen": -0.7169279456138611, "logits/rejected": -0.7530863285064697, "logps/chosen": -7.394716262817383, "logps/rejected": -49.48583221435547, "loss": 0.45556652545928955, "memory(GiB)": 46.1, "nll_loss": 0.30026838183403015, "rewards/accuracies": 0.9375, "rewards/chosen": 0.38607895374298096, "rewards/margins": 3.1158361434936523, "rewards/rejected": -2.729757070541382, "step": 178, "train_speed(iter/s)": 0.008029 }, { "epoch": 0.3969783075750225, "grad_norm": 3.9343268871307373, "learning_rate": 0.00018812166207004367, "logits/chosen": -0.6970735788345337, "logits/rejected": -0.724778413772583, "logps/chosen": -4.960330009460449, "logps/rejected": -49.74527359008789, "loss": 0.5463108420372009, "memory(GiB)": 46.1, "nll_loss": 0.3669103980064392, "rewards/accuracies": 0.90625, "rewards/chosen": 0.27587890625, "rewards/margins": 3.2249057292938232, "rewards/rejected": -2.9490268230438232, "step": 179, "train_speed(iter/s)": 0.008027 }, { "epoch": 0.39919606348326286, "grad_norm": 2.298149824142456, "learning_rate": 0.0001879473751206489, "logits/chosen": -0.7472426295280457, "logits/rejected": -0.7810541987419128, "logps/chosen": -5.616783142089844, "logps/rejected": -51.225318908691406, "loss": 0.5331763625144958, "memory(GiB)": 46.1, "nll_loss": 0.3780348300933838, "rewards/accuracies": 0.9375, "rewards/chosen": 0.3602917790412903, "rewards/margins": 3.3162002563476562, "rewards/rejected": -2.9559082984924316, "step": 180, "train_speed(iter/s)": 0.008026 }, { "epoch": 0.4014138193915032, "grad_norm": 3.723597764968872, "learning_rate": 0.00018777190079076242, "logits/chosen": -0.7926808595657349, "logits/rejected": -0.8186173439025879, "logps/chosen": -3.8802855014801025, "logps/rejected": -52.186126708984375, "loss": 0.5307185649871826, "memory(GiB)": 46.1, "nll_loss": 0.3474883437156677, "rewards/accuracies": 0.90625, "rewards/chosen": 0.3934330642223358, "rewards/margins": 3.725450038909912, "rewards/rejected": -3.332016706466675, "step": 181, "train_speed(iter/s)": 0.008026 }, { "epoch": 0.4036315752997436, "grad_norm": 7.891061305999756, "learning_rate": 0.00018759524144946904, "logits/chosen": -0.7886751294136047, "logits/rejected": -0.8069500923156738, "logps/chosen": -11.522048950195312, "logps/rejected": -51.2484130859375, "loss": 0.785020112991333, "memory(GiB)": 46.1, "nll_loss": 0.41102084517478943, "rewards/accuracies": 0.75, "rewards/chosen": 0.10307621210813522, "rewards/margins": 3.4609313011169434, "rewards/rejected": -3.3578553199768066, "step": 182, "train_speed(iter/s)": 0.008028 }, { "epoch": 0.40584933120798394, "grad_norm": 12.93850040435791, "learning_rate": 0.00018741739948185257, "logits/chosen": -0.8120619058609009, "logits/rejected": -0.852086067199707, "logps/chosen": -6.879787445068359, "logps/rejected": -65.4516830444336, "loss": 0.8547239303588867, "memory(GiB)": 46.1, "nll_loss": 0.7350503206253052, "rewards/accuracies": 0.9375, "rewards/chosen": 0.0880105122923851, "rewards/margins": 4.625463962554932, "rewards/rejected": -4.5374531745910645, "step": 183, "train_speed(iter/s)": 0.008028 }, { "epoch": 0.40806708711622425, "grad_norm": 3.9282493591308594, "learning_rate": 0.0001872383772889634, "logits/chosen": -0.8234286308288574, "logits/rejected": -0.8348793983459473, "logps/chosen": -9.335253715515137, "logps/rejected": -44.39677047729492, "loss": 0.7768021821975708, "memory(GiB)": 46.1, "nll_loss": 0.5781885981559753, "rewards/accuracies": 0.96875, "rewards/chosen": 0.2790551781654358, "rewards/margins": 3.196932077407837, "rewards/rejected": -2.917877197265625, "step": 184, "train_speed(iter/s)": 0.008027 }, { "epoch": 0.4102848430244646, "grad_norm": 15.93510913848877, "learning_rate": 0.00018705817728778624, "logits/chosen": -0.8253858685493469, "logits/rejected": -0.8627069592475891, "logps/chosen": -9.565252304077148, "logps/rejected": -53.15513610839844, "loss": 0.8498061895370483, "memory(GiB)": 46.1, "nll_loss": 0.6343203186988831, "rewards/accuracies": 0.90625, "rewards/chosen": 0.21805116534233093, "rewards/margins": 3.4257686138153076, "rewards/rejected": -3.207717180252075, "step": 185, "train_speed(iter/s)": 0.008028 }, { "epoch": 0.41250259893270497, "grad_norm": 15.02178955078125, "learning_rate": 0.00018687680191120743, "logits/chosen": -0.8546393513679504, "logits/rejected": -0.9091347455978394, "logps/chosen": -4.4741058349609375, "logps/rejected": -63.36324691772461, "loss": 1.0827393531799316, "memory(GiB)": 46.1, "nll_loss": 0.7935152649879456, "rewards/accuracies": 0.84375, "rewards/chosen": 0.1945604830980301, "rewards/margins": 3.8709142208099365, "rewards/rejected": -3.676353693008423, "step": 186, "train_speed(iter/s)": 0.008026 }, { "epoch": 0.4147203548409453, "grad_norm": 2.5898377895355225, "learning_rate": 0.00018669425360798205, "logits/chosen": -0.8482339382171631, "logits/rejected": -0.9088505506515503, "logps/chosen": -5.740197658538818, "logps/rejected": -51.71613311767578, "loss": 0.5818274021148682, "memory(GiB)": 46.1, "nll_loss": 0.3660181760787964, "rewards/accuracies": 0.9375, "rewards/chosen": 0.2397884875535965, "rewards/margins": 2.8303396701812744, "rewards/rejected": -2.5905513763427734, "step": 187, "train_speed(iter/s)": 0.008026 }, { "epoch": 0.4169381107491857, "grad_norm": 5.367336750030518, "learning_rate": 0.00018651053484270095, "logits/chosen": -0.7865353226661682, "logits/rejected": -0.8548979759216309, "logps/chosen": -7.190474987030029, "logps/rejected": -60.156734466552734, "loss": 0.5877411365509033, "memory(GiB)": 46.1, "nll_loss": 0.39522460103034973, "rewards/accuracies": 0.9375, "rewards/chosen": 0.21685907244682312, "rewards/margins": 3.5003058910369873, "rewards/rejected": -3.283446788787842, "step": 188, "train_speed(iter/s)": 0.008027 }, { "epoch": 0.419155866657426, "grad_norm": 2.8252148628234863, "learning_rate": 0.00018632564809575742, "logits/chosen": -0.9151175022125244, "logits/rejected": -0.956945538520813, "logps/chosen": -11.193031311035156, "logps/rejected": -50.2137451171875, "loss": 0.6273083090782166, "memory(GiB)": 46.1, "nll_loss": 0.44245627522468567, "rewards/accuracies": 0.90625, "rewards/chosen": 0.5056411027908325, "rewards/margins": 3.342442512512207, "rewards/rejected": -2.836801290512085, "step": 189, "train_speed(iter/s)": 0.008027 }, { "epoch": 0.42137362256566635, "grad_norm": 5.62361478805542, "learning_rate": 0.00018613959586331362, "logits/chosen": -0.957817792892456, "logits/rejected": -1.0089643001556396, "logps/chosen": -11.406503677368164, "logps/rejected": -59.45309829711914, "loss": 0.69350266456604, "memory(GiB)": 46.1, "nll_loss": 0.4786533713340759, "rewards/accuracies": 0.90625, "rewards/chosen": 0.26705771684646606, "rewards/margins": 3.8952856063842773, "rewards/rejected": -3.628227949142456, "step": 190, "train_speed(iter/s)": 0.008028 }, { "epoch": 0.4235913784739067, "grad_norm": 6.09588098526001, "learning_rate": 0.00018595238065726713, "logits/chosen": -0.9361623525619507, "logits/rejected": -0.9750722646713257, "logps/chosen": -11.82553482055664, "logps/rejected": -59.44593811035156, "loss": 0.8459053039550781, "memory(GiB)": 46.1, "nll_loss": 0.5596847534179688, "rewards/accuracies": 0.8125, "rewards/chosen": 0.2538452744483948, "rewards/margins": 3.787569999694824, "rewards/rejected": -3.533724784851074, "step": 191, "train_speed(iter/s)": 0.008029 }, { "epoch": 0.42580913438214707, "grad_norm": 5.49157190322876, "learning_rate": 0.00018576400500521672, "logits/chosen": -1.1267294883728027, "logits/rejected": -1.157508373260498, "logps/chosen": -9.233796119689941, "logps/rejected": -65.15520477294922, "loss": 0.7781911492347717, "memory(GiB)": 46.1, "nll_loss": 0.5769992470741272, "rewards/accuracies": 0.875, "rewards/chosen": -0.04808952659368515, "rewards/margins": 4.439774513244629, "rewards/rejected": -4.487864017486572, "step": 192, "train_speed(iter/s)": 0.008029 }, { "epoch": 0.42802689029038743, "grad_norm": 2.235313653945923, "learning_rate": 0.0001855744714504285, "logits/chosen": -1.0502121448516846, "logits/rejected": -1.0979869365692139, "logps/chosen": -7.734978675842285, "logps/rejected": -61.93341064453125, "loss": 0.5888234972953796, "memory(GiB)": 46.1, "nll_loss": 0.4166957437992096, "rewards/accuracies": 0.96875, "rewards/chosen": 0.4335370361804962, "rewards/margins": 4.3844313621521, "rewards/rejected": -3.9508938789367676, "step": 193, "train_speed(iter/s)": 0.008027 }, { "epoch": 0.4302446461986278, "grad_norm": 6.296457767486572, "learning_rate": 0.0001853837825518014, "logits/chosen": -1.0367488861083984, "logits/rejected": -1.058951497077942, "logps/chosen": -12.308891296386719, "logps/rejected": -56.541419982910156, "loss": 0.9084363579750061, "memory(GiB)": 46.1, "nll_loss": 0.6487494707107544, "rewards/accuracies": 0.875, "rewards/chosen": -0.29248520731925964, "rewards/margins": 3.4791908264160156, "rewards/rejected": -3.7716763019561768, "step": 194, "train_speed(iter/s)": 0.008027 }, { "epoch": 0.4324624021068681, "grad_norm": 4.8967132568359375, "learning_rate": 0.00018519194088383273, "logits/chosen": -1.0082939863204956, "logits/rejected": -1.0576558113098145, "logps/chosen": -9.070019721984863, "logps/rejected": -54.84600067138672, "loss": 0.8942745327949524, "memory(GiB)": 46.1, "nll_loss": 0.5133223533630371, "rewards/accuracies": 0.875, "rewards/chosen": 0.05057057738304138, "rewards/margins": 3.1192855834960938, "rewards/rejected": -3.0687148571014404, "step": 195, "train_speed(iter/s)": 0.008026 }, { "epoch": 0.43468015801510845, "grad_norm": 6.081669807434082, "learning_rate": 0.00018499894903658328, "logits/chosen": -0.907891035079956, "logits/rejected": -0.9242041110992432, "logps/chosen": -9.73530101776123, "logps/rejected": -37.79449462890625, "loss": 0.67271488904953, "memory(GiB)": 46.1, "nll_loss": 0.2690475881099701, "rewards/accuracies": 0.8125, "rewards/chosen": 0.10105058550834656, "rewards/margins": 1.979455828666687, "rewards/rejected": -1.878405213356018, "step": 196, "train_speed(iter/s)": 0.008026 }, { "epoch": 0.4368979139233488, "grad_norm": 3.40010666847229, "learning_rate": 0.0001848048096156426, "logits/chosen": -0.8272972106933594, "logits/rejected": -0.9016137719154358, "logps/chosen": -6.67510461807251, "logps/rejected": -48.94219970703125, "loss": 0.6460402607917786, "memory(GiB)": 46.1, "nll_loss": 0.3624219000339508, "rewards/accuracies": 0.90625, "rewards/chosen": 0.13816983997821808, "rewards/margins": 3.1119472980499268, "rewards/rejected": -2.9737775325775146, "step": 197, "train_speed(iter/s)": 0.008027 }, { "epoch": 0.4391156698315892, "grad_norm": 3.359297037124634, "learning_rate": 0.00018460952524209355, "logits/chosen": -0.877692699432373, "logits/rejected": -0.9115339517593384, "logps/chosen": -11.648417472839355, "logps/rejected": -37.90315246582031, "loss": 0.8015753626823425, "memory(GiB)": 46.1, "nll_loss": 0.5033032894134521, "rewards/accuracies": 0.84375, "rewards/chosen": 0.2795218527317047, "rewards/margins": 2.2155895233154297, "rewards/rejected": -1.9360675811767578, "step": 198, "train_speed(iter/s)": 0.008028 }, { "epoch": 0.44133342573982953, "grad_norm": 2.250875234603882, "learning_rate": 0.00018441309855247708, "logits/chosen": -0.787319004535675, "logits/rejected": -0.8128381371498108, "logps/chosen": -11.259406089782715, "logps/rejected": -48.81473922729492, "loss": 0.6350412964820862, "memory(GiB)": 46.1, "nll_loss": 0.3753763735294342, "rewards/accuracies": 0.875, "rewards/chosen": 0.42155084013938904, "rewards/margins": 2.7902255058288574, "rewards/rejected": -2.3686749935150146, "step": 199, "train_speed(iter/s)": 0.008027 }, { "epoch": 0.44355118164806984, "grad_norm": 3.3108201026916504, "learning_rate": 0.00018421553219875658, "logits/chosen": -0.8686717748641968, "logits/rejected": -0.8734286427497864, "logps/chosen": -13.712151527404785, "logps/rejected": -52.73145294189453, "loss": 0.6721420288085938, "memory(GiB)": 46.1, "nll_loss": 0.4126514196395874, "rewards/accuracies": 0.9375, "rewards/chosen": 0.028258126229047775, "rewards/margins": 2.731067180633545, "rewards/rejected": -2.7028088569641113, "step": 200, "train_speed(iter/s)": 0.008025 }, { "epoch": 0.4457689375563102, "grad_norm": 4.97205114364624, "learning_rate": 0.00018401682884828212, "logits/chosen": -0.7808172106742859, "logits/rejected": -0.7950178980827332, "logps/chosen": -11.171830177307129, "logps/rejected": -40.51845932006836, "loss": 0.6930698156356812, "memory(GiB)": 46.1, "nll_loss": 0.4298695921897888, "rewards/accuracies": 0.90625, "rewards/chosen": 0.20948606729507446, "rewards/margins": 2.620697498321533, "rewards/rejected": -2.4112114906311035, "step": 201, "train_speed(iter/s)": 0.008019 }, { "epoch": 0.44798669346455056, "grad_norm": 5.371218204498291, "learning_rate": 0.00018381699118375427, "logits/chosen": -0.7809624075889587, "logits/rejected": -0.8142802715301514, "logps/chosen": -5.608348846435547, "logps/rejected": -55.663177490234375, "loss": 0.4353767931461334, "memory(GiB)": 46.1, "nll_loss": 0.2700658440589905, "rewards/accuracies": 0.9375, "rewards/chosen": 0.20935064554214478, "rewards/margins": 3.5973005294799805, "rewards/rejected": -3.3879499435424805, "step": 202, "train_speed(iter/s)": 0.008019 }, { "epoch": 0.4502044493727909, "grad_norm": 16.89154815673828, "learning_rate": 0.00018361602190318822, "logits/chosen": -0.7608879208564758, "logits/rejected": -0.7771663665771484, "logps/chosen": -10.431235313415527, "logps/rejected": -37.032108306884766, "loss": 0.9102643728256226, "memory(GiB)": 46.1, "nll_loss": 0.635382354259491, "rewards/accuracies": 0.875, "rewards/chosen": 0.2574206590652466, "rewards/margins": 2.4064812660217285, "rewards/rejected": -2.1490604877471924, "step": 203, "train_speed(iter/s)": 0.008019 }, { "epoch": 0.4524222052810313, "grad_norm": 6.729372978210449, "learning_rate": 0.000183413923719877, "logits/chosen": -0.7215007543563843, "logits/rejected": -0.758901059627533, "logps/chosen": -8.58769416809082, "logps/rejected": -39.22972869873047, "loss": 0.8954074382781982, "memory(GiB)": 46.1, "nll_loss": 0.6078510284423828, "rewards/accuracies": 0.90625, "rewards/chosen": 0.25617051124572754, "rewards/margins": 2.248603343963623, "rewards/rejected": -1.992432713508606, "step": 204, "train_speed(iter/s)": 0.008018 }, { "epoch": 0.4546399611892716, "grad_norm": 3.6512980461120605, "learning_rate": 0.00018321069936235503, "logits/chosen": -0.6804372668266296, "logits/rejected": -0.718124508857727, "logps/chosen": -8.9603853225708, "logps/rejected": -47.75540542602539, "loss": 0.6032508611679077, "memory(GiB)": 46.1, "nll_loss": 0.41573473811149597, "rewards/accuracies": 0.96875, "rewards/chosen": 0.4219416379928589, "rewards/margins": 3.0125231742858887, "rewards/rejected": -2.5905814170837402, "step": 205, "train_speed(iter/s)": 0.008018 }, { "epoch": 0.45685771709751194, "grad_norm": 7.076963424682617, "learning_rate": 0.00018300635157436125, "logits/chosen": -0.7391089797019958, "logits/rejected": -0.745570182800293, "logps/chosen": -4.518499851226807, "logps/rejected": -34.36119079589844, "loss": 0.6407385468482971, "memory(GiB)": 46.1, "nll_loss": 0.3392406404018402, "rewards/accuracies": 0.84375, "rewards/chosen": 0.31493237614631653, "rewards/margins": 2.2406697273254395, "rewards/rejected": -1.9257375001907349, "step": 206, "train_speed(iter/s)": 0.008018 }, { "epoch": 0.4590754730057523, "grad_norm": 2.3934824466705322, "learning_rate": 0.00018280088311480201, "logits/chosen": -0.7122136354446411, "logits/rejected": -0.7361628413200378, "logps/chosen": -6.559683322906494, "logps/rejected": -39.97085189819336, "loss": 0.6831241846084595, "memory(GiB)": 46.1, "nll_loss": 0.3898596167564392, "rewards/accuracies": 0.875, "rewards/chosen": 0.3751702308654785, "rewards/margins": 2.362565279006958, "rewards/rejected": -1.987395167350769, "step": 207, "train_speed(iter/s)": 0.00802 }, { "epoch": 0.46129322891399266, "grad_norm": 2.4925472736358643, "learning_rate": 0.00018259429675771403, "logits/chosen": -0.6431427001953125, "logits/rejected": -0.6792439818382263, "logps/chosen": -6.0603485107421875, "logps/rejected": -43.98711395263672, "loss": 0.6350247859954834, "memory(GiB)": 46.1, "nll_loss": 0.40350115299224854, "rewards/accuracies": 0.90625, "rewards/chosen": 0.4135381281375885, "rewards/margins": 2.4943490028381348, "rewards/rejected": -2.0808112621307373, "step": 208, "train_speed(iter/s)": 0.00802 }, { "epoch": 0.463510984822233, "grad_norm": 2.020061492919922, "learning_rate": 0.0001823865952922267, "logits/chosen": -0.7055493593215942, "logits/rejected": -0.7343183755874634, "logps/chosen": -6.9183878898620605, "logps/rejected": -37.08061599731445, "loss": 0.5601203441619873, "memory(GiB)": 46.1, "nll_loss": 0.3676638901233673, "rewards/accuracies": 1.0, "rewards/chosen": 0.38555678725242615, "rewards/margins": 2.058412790298462, "rewards/rejected": -1.6728558540344238, "step": 209, "train_speed(iter/s)": 0.008019 }, { "epoch": 0.4657287407304734, "grad_norm": 2.5581166744232178, "learning_rate": 0.0001821777815225245, "logits/chosen": -0.6911201477050781, "logits/rejected": -0.7565470337867737, "logps/chosen": -7.890411376953125, "logps/rejected": -48.7196159362793, "loss": 0.6602129340171814, "memory(GiB)": 46.1, "nll_loss": 0.4272047281265259, "rewards/accuracies": 0.9375, "rewards/chosen": 0.27426618337631226, "rewards/margins": 2.3485374450683594, "rewards/rejected": -2.0742714405059814, "step": 210, "train_speed(iter/s)": 0.00802 }, { "epoch": 0.4679464966387137, "grad_norm": 3.0122952461242676, "learning_rate": 0.00018196785826780928, "logits/chosen": -0.6988839507102966, "logits/rejected": -0.7252997159957886, "logps/chosen": -11.326674461364746, "logps/rejected": -38.2576904296875, "loss": 0.7591457962989807, "memory(GiB)": 46.1, "nll_loss": 0.48633021116256714, "rewards/accuracies": 0.875, "rewards/chosen": 0.3746309280395508, "rewards/margins": 2.2771949768066406, "rewards/rejected": -1.9025641679763794, "step": 211, "train_speed(iter/s)": 0.00802 }, { "epoch": 0.47016425254695404, "grad_norm": 2.265782356262207, "learning_rate": 0.000181756828362262, "logits/chosen": -0.7268755435943604, "logits/rejected": -0.7466446161270142, "logps/chosen": -7.725147724151611, "logps/rejected": -51.996009826660156, "loss": 0.4454570412635803, "memory(GiB)": 46.1, "nll_loss": 0.2833636403083801, "rewards/accuracies": 0.96875, "rewards/chosen": 0.36816588044166565, "rewards/margins": 3.318744659423828, "rewards/rejected": -2.9505786895751953, "step": 212, "train_speed(iter/s)": 0.008021 }, { "epoch": 0.4723820084551944, "grad_norm": 2.547436237335205, "learning_rate": 0.00018154469465500448, "logits/chosen": -0.7705230712890625, "logits/rejected": -0.7850083112716675, "logps/chosen": -9.060789108276367, "logps/rejected": -43.8983154296875, "loss": 0.6688026189804077, "memory(GiB)": 46.1, "nll_loss": 0.44372719526290894, "rewards/accuracies": 0.90625, "rewards/chosen": 0.3685440421104431, "rewards/margins": 2.777890920639038, "rewards/rejected": -2.40934681892395, "step": 213, "train_speed(iter/s)": 0.008022 }, { "epoch": 0.47459976436343476, "grad_norm": 5.478801250457764, "learning_rate": 0.00018133146001006117, "logits/chosen": -0.7916015982627869, "logits/rejected": -0.8327130675315857, "logps/chosen": -12.882250785827637, "logps/rejected": -54.540977478027344, "loss": 0.7713211178779602, "memory(GiB)": 46.1, "nll_loss": 0.6156861782073975, "rewards/accuracies": 0.96875, "rewards/chosen": 0.4459156095981598, "rewards/margins": 3.8908560276031494, "rewards/rejected": -3.4449405670166016, "step": 214, "train_speed(iter/s)": 0.008023 }, { "epoch": 0.4768175202716751, "grad_norm": 9.98646354675293, "learning_rate": 0.00018111712730632022, "logits/chosen": -0.8455632328987122, "logits/rejected": -0.8789849877357483, "logps/chosen": -6.6688761711120605, "logps/rejected": -67.25550079345703, "loss": 0.4042738378047943, "memory(GiB)": 46.1, "nll_loss": 0.27104586362838745, "rewards/accuracies": 0.9375, "rewards/chosen": 0.2038407027721405, "rewards/margins": 4.787556171417236, "rewards/rejected": -4.583715438842773, "step": 215, "train_speed(iter/s)": 0.008023 }, { "epoch": 0.4790352761799154, "grad_norm": 8.007806777954102, "learning_rate": 0.00018090169943749476, "logits/chosen": -0.8711842894554138, "logits/rejected": -0.8995304703712463, "logps/chosen": -9.905319213867188, "logps/rejected": -61.446109771728516, "loss": 0.7026961445808411, "memory(GiB)": 46.1, "nll_loss": 0.5331434011459351, "rewards/accuracies": 0.9375, "rewards/chosen": 0.16945196688175201, "rewards/margins": 4.315336227416992, "rewards/rejected": -4.1458845138549805, "step": 216, "train_speed(iter/s)": 0.008023 }, { "epoch": 0.4812530320881558, "grad_norm": 2.730963706970215, "learning_rate": 0.0001806851793120837, "logits/chosen": -0.8149902820587158, "logits/rejected": -0.8820565342903137, "logps/chosen": -9.960224151611328, "logps/rejected": -72.3023681640625, "loss": 0.5872762799263, "memory(GiB)": 46.1, "nll_loss": 0.44592928886413574, "rewards/accuracies": 0.9375, "rewards/chosen": 0.16795015335083008, "rewards/margins": 5.117605686187744, "rewards/rejected": -4.949655055999756, "step": 217, "train_speed(iter/s)": 0.008024 }, { "epoch": 0.48347078799639615, "grad_norm": 16.840694427490234, "learning_rate": 0.00018046756985333256, "logits/chosen": -0.8040902018547058, "logits/rejected": -0.8409407138824463, "logps/chosen": -9.597344398498535, "logps/rejected": -60.84199523925781, "loss": 0.6265321373939514, "memory(GiB)": 46.1, "nll_loss": 0.39480292797088623, "rewards/accuracies": 0.84375, "rewards/chosen": 0.07195545732975006, "rewards/margins": 4.253119468688965, "rewards/rejected": -4.181163787841797, "step": 218, "train_speed(iter/s)": 0.008023 }, { "epoch": 0.4856885439046365, "grad_norm": 11.527325630187988, "learning_rate": 0.0001802488739991941, "logits/chosen": -0.8545507192611694, "logits/rejected": -0.8696693181991577, "logps/chosen": -8.045662879943848, "logps/rejected": -52.85993194580078, "loss": 1.0190614461898804, "memory(GiB)": 46.1, "nll_loss": 0.6636497974395752, "rewards/accuracies": 0.8125, "rewards/chosen": 0.0182030089199543, "rewards/margins": 3.632762908935547, "rewards/rejected": -3.614560127258301, "step": 219, "train_speed(iter/s)": 0.008022 }, { "epoch": 0.48790629981287686, "grad_norm": 2.8976073265075684, "learning_rate": 0.00018002909470228842, "logits/chosen": -0.8644663691520691, "logits/rejected": -0.873846709728241, "logps/chosen": -9.438857078552246, "logps/rejected": -60.52991485595703, "loss": 0.5179789066314697, "memory(GiB)": 46.1, "nll_loss": 0.365613728761673, "rewards/accuracies": 0.9375, "rewards/chosen": 0.08784684538841248, "rewards/margins": 4.254735469818115, "rewards/rejected": -4.16688871383667, "step": 220, "train_speed(iter/s)": 0.008021 }, { "epoch": 0.49012405572111717, "grad_norm": 3.299361228942871, "learning_rate": 0.00017980823492986324, "logits/chosen": -0.8386255502700806, "logits/rejected": -0.8992589712142944, "logps/chosen": -8.689769744873047, "logps/rejected": -60.96467590332031, "loss": 0.618039608001709, "memory(GiB)": 46.1, "nll_loss": 0.5055224299430847, "rewards/accuracies": 0.96875, "rewards/chosen": 0.2881576120853424, "rewards/margins": 4.106770992279053, "rewards/rejected": -3.8186135292053223, "step": 221, "train_speed(iter/s)": 0.008022 }, { "epoch": 0.49234181162935753, "grad_norm": 4.465257167816162, "learning_rate": 0.00017958629766375386, "logits/chosen": -0.8478450179100037, "logits/rejected": -0.9085181355476379, "logps/chosen": -6.204191207885742, "logps/rejected": -56.054569244384766, "loss": 0.47616931796073914, "memory(GiB)": 46.1, "nll_loss": 0.31598034501075745, "rewards/accuracies": 0.9375, "rewards/chosen": 0.258948415517807, "rewards/margins": 3.6201562881469727, "rewards/rejected": -3.3612074851989746, "step": 222, "train_speed(iter/s)": 0.00802 }, { "epoch": 0.4945595675375979, "grad_norm": 2.8880817890167236, "learning_rate": 0.0001793632859003428, "logits/chosen": -0.8514662384986877, "logits/rejected": -0.8807088732719421, "logps/chosen": -10.981437683105469, "logps/rejected": -55.400272369384766, "loss": 0.6770332455635071, "memory(GiB)": 46.1, "nll_loss": 0.5153285264968872, "rewards/accuracies": 0.9375, "rewards/chosen": 0.30325403809547424, "rewards/margins": 3.651240110397339, "rewards/rejected": -3.3479862213134766, "step": 223, "train_speed(iter/s)": 0.008022 }, { "epoch": 0.49677732344583825, "grad_norm": 3.5312280654907227, "learning_rate": 0.00017913920265051947, "logits/chosen": -0.8069252371788025, "logits/rejected": -0.8705534934997559, "logps/chosen": -8.313520431518555, "logps/rejected": -58.24019241333008, "loss": 0.6806789636611938, "memory(GiB)": 46.1, "nll_loss": 0.4746111035346985, "rewards/accuracies": 0.9375, "rewards/chosen": 0.10646762698888779, "rewards/margins": 3.66450834274292, "rewards/rejected": -3.5580403804779053, "step": 224, "train_speed(iter/s)": 0.008024 }, { "epoch": 0.4989950793540786, "grad_norm": 3.3835299015045166, "learning_rate": 0.00017891405093963938, "logits/chosen": -0.830254077911377, "logits/rejected": -0.861682653427124, "logps/chosen": -10.002070426940918, "logps/rejected": -47.45036315917969, "loss": 0.6337284445762634, "memory(GiB)": 46.1, "nll_loss": 0.4381062090396881, "rewards/accuracies": 0.90625, "rewards/chosen": 0.26333028078079224, "rewards/margins": 3.0331172943115234, "rewards/rejected": -2.769787073135376, "step": 225, "train_speed(iter/s)": 0.008026 }, { "epoch": 0.501212835262319, "grad_norm": 3.5198752880096436, "learning_rate": 0.00017868783380748342, "logits/chosen": -0.8473120331764221, "logits/rejected": -0.8709195852279663, "logps/chosen": -13.000303268432617, "logps/rejected": -42.49477767944336, "loss": 0.6278812885284424, "memory(GiB)": 46.1, "nll_loss": 0.4056437909603119, "rewards/accuracies": 0.875, "rewards/chosen": 0.39378899335861206, "rewards/margins": 2.7199783325195312, "rewards/rejected": -2.3261890411376953, "step": 226, "train_speed(iter/s)": 0.008027 }, { "epoch": 0.5034305911705593, "grad_norm": 3.3003716468811035, "learning_rate": 0.00017846055430821678, "logits/chosen": -0.8059426546096802, "logits/rejected": -0.8080525398254395, "logps/chosen": -9.30306339263916, "logps/rejected": -40.58232116699219, "loss": 0.6896506547927856, "memory(GiB)": 46.1, "nll_loss": 0.37519916892051697, "rewards/accuracies": 0.84375, "rewards/chosen": 0.3133179843425751, "rewards/margins": 2.731419324874878, "rewards/rejected": -2.4181013107299805, "step": 227, "train_speed(iter/s)": 0.008027 }, { "epoch": 0.5056483470787997, "grad_norm": 1.7876431941986084, "learning_rate": 0.00017823221551034764, "logits/chosen": -0.8154786229133606, "logits/rejected": -0.8503978848457336, "logps/chosen": -5.010475158691406, "logps/rejected": -48.111228942871094, "loss": 0.4449242055416107, "memory(GiB)": 46.1, "nll_loss": 0.2939717471599579, "rewards/accuracies": 0.9375, "rewards/chosen": 0.3824361264705658, "rewards/margins": 3.612694501876831, "rewards/rejected": -3.2302584648132324, "step": 228, "train_speed(iter/s)": 0.008029 }, { "epoch": 0.5078661029870399, "grad_norm": 2.703659772872925, "learning_rate": 0.00017800282049668594, "logits/chosen": -0.8498862981796265, "logits/rejected": -0.917186975479126, "logps/chosen": -7.1461615562438965, "logps/rejected": -59.192298889160156, "loss": 0.4826613962650299, "memory(GiB)": 46.1, "nll_loss": 0.3588803708553314, "rewards/accuracies": 1.0, "rewards/chosen": 0.3578621447086334, "rewards/margins": 3.88301944732666, "rewards/rejected": -3.5251574516296387, "step": 229, "train_speed(iter/s)": 0.008028 }, { "epoch": 0.5100838588952803, "grad_norm": 5.917115688323975, "learning_rate": 0.0001777723723643014, "logits/chosen": -0.8150835037231445, "logits/rejected": -0.8721492290496826, "logps/chosen": -15.683819770812988, "logps/rejected": -61.561241149902344, "loss": 0.9741629958152771, "memory(GiB)": 46.1, "nll_loss": 0.7258660197257996, "rewards/accuracies": 0.90625, "rewards/chosen": 0.29861539602279663, "rewards/margins": 3.3912651538848877, "rewards/rejected": -3.0926499366760254, "step": 230, "train_speed(iter/s)": 0.008029 }, { "epoch": 0.5123016148035207, "grad_norm": 2.1567375659942627, "learning_rate": 0.00017754087422448215, "logits/chosen": -0.8800138235092163, "logits/rejected": -0.9136852622032166, "logps/chosen": -9.487836837768555, "logps/rejected": -61.10226821899414, "loss": 0.5113418102264404, "memory(GiB)": 46.1, "nll_loss": 0.34745144844055176, "rewards/accuracies": 0.96875, "rewards/chosen": 0.20129577815532684, "rewards/margins": 4.3714752197265625, "rewards/rejected": -4.170179843902588, "step": 231, "train_speed(iter/s)": 0.00803 }, { "epoch": 0.514519370711761, "grad_norm": 4.626194000244141, "learning_rate": 0.0001773083292026924, "logits/chosen": -0.9154278039932251, "logits/rejected": -0.9261500239372253, "logps/chosen": -7.649507522583008, "logps/rejected": -66.75289154052734, "loss": 0.5653941631317139, "memory(GiB)": 46.1, "nll_loss": 0.36132049560546875, "rewards/accuracies": 0.875, "rewards/chosen": 0.16542571783065796, "rewards/margins": 5.1535139083862305, "rewards/rejected": -4.988088130950928, "step": 232, "train_speed(iter/s)": 0.00803 }, { "epoch": 0.5167371266200014, "grad_norm": 2.771819591522217, "learning_rate": 0.00017707474043853041, "logits/chosen": -0.8962085247039795, "logits/rejected": -0.9393426179885864, "logps/chosen": -4.859526634216309, "logps/rejected": -70.9289779663086, "loss": 0.528771698474884, "memory(GiB)": 46.1, "nll_loss": 0.32141542434692383, "rewards/accuracies": 0.9375, "rewards/chosen": 0.14139828085899353, "rewards/margins": 5.118078708648682, "rewards/rejected": -4.976680278778076, "step": 233, "train_speed(iter/s)": 0.008032 }, { "epoch": 0.5189548825282417, "grad_norm": 2.016167402267456, "learning_rate": 0.00017684011108568592, "logits/chosen": -0.89229416847229, "logits/rejected": -0.9399268627166748, "logps/chosen": -9.858261108398438, "logps/rejected": -73.9881591796875, "loss": 0.46442869305610657, "memory(GiB)": 46.1, "nll_loss": 0.3368317484855652, "rewards/accuracies": 0.96875, "rewards/chosen": 0.33955106139183044, "rewards/margins": 5.430692672729492, "rewards/rejected": -5.091141223907471, "step": 234, "train_speed(iter/s)": 0.008034 }, { "epoch": 0.5211726384364821, "grad_norm": 2.207803726196289, "learning_rate": 0.0001766044443118978, "logits/chosen": -0.8679851293563843, "logits/rejected": -0.9161220192909241, "logps/chosen": -8.69020938873291, "logps/rejected": -57.00996780395508, "loss": 0.5931269526481628, "memory(GiB)": 46.1, "nll_loss": 0.4199146032333374, "rewards/accuracies": 0.9375, "rewards/chosen": 0.28541409969329834, "rewards/margins": 3.884521245956421, "rewards/rejected": -3.599107503890991, "step": 235, "train_speed(iter/s)": 0.008033 }, { "epoch": 0.5233903943447225, "grad_norm": 3.842848062515259, "learning_rate": 0.00017636774329891122, "logits/chosen": -0.8388394713401794, "logits/rejected": -0.9103097915649414, "logps/chosen": -9.551056861877441, "logps/rejected": -68.45164489746094, "loss": 0.617426872253418, "memory(GiB)": 46.1, "nll_loss": 0.4130822420120239, "rewards/accuracies": 0.90625, "rewards/chosen": 0.2819046080112457, "rewards/margins": 4.378241062164307, "rewards/rejected": -4.096336841583252, "step": 236, "train_speed(iter/s)": 0.008034 }, { "epoch": 0.5256081502529628, "grad_norm": 2.8949806690216064, "learning_rate": 0.00017613001124243446, "logits/chosen": -0.8529986143112183, "logits/rejected": -0.9170435667037964, "logps/chosen": -8.742960929870605, "logps/rejected": -70.04315948486328, "loss": 0.5013477802276611, "memory(GiB)": 46.1, "nll_loss": 0.3726488947868347, "rewards/accuracies": 0.9375, "rewards/chosen": 0.19001907110214233, "rewards/margins": 4.866143226623535, "rewards/rejected": -4.676124572753906, "step": 237, "train_speed(iter/s)": 0.008034 }, { "epoch": 0.5278259061612032, "grad_norm": 2.255075454711914, "learning_rate": 0.00017589125135209616, "logits/chosen": -0.8355762958526611, "logits/rejected": -0.9108222126960754, "logps/chosen": -7.4976043701171875, "logps/rejected": -79.64945983886719, "loss": 0.5185106992721558, "memory(GiB)": 46.1, "nll_loss": 0.4060248136520386, "rewards/accuracies": 0.9375, "rewards/chosen": 0.4182281494140625, "rewards/margins": 5.220707416534424, "rewards/rejected": -4.802480220794678, "step": 238, "train_speed(iter/s)": 0.008034 }, { "epoch": 0.5300436620694435, "grad_norm": 5.300905704498291, "learning_rate": 0.00017565146685140167, "logits/chosen": -0.9112374782562256, "logits/rejected": -0.9718393683433533, "logps/chosen": -5.972594261169434, "logps/rejected": -67.36833190917969, "loss": 0.4636631906032562, "memory(GiB)": 46.1, "nll_loss": 0.3712203800678253, "rewards/accuracies": 0.96875, "rewards/chosen": 0.3854513168334961, "rewards/margins": 4.805893421173096, "rewards/rejected": -4.420441627502441, "step": 239, "train_speed(iter/s)": 0.008034 }, { "epoch": 0.5322614179776838, "grad_norm": 3.5167770385742188, "learning_rate": 0.00017541066097768963, "logits/chosen": -0.9272933006286621, "logits/rejected": -0.9693167209625244, "logps/chosen": -8.705961227416992, "logps/rejected": -68.90886688232422, "loss": 0.5253361463546753, "memory(GiB)": 46.1, "nll_loss": 0.3944278061389923, "rewards/accuracies": 0.9375, "rewards/chosen": 0.2587865889072418, "rewards/margins": 5.000888824462891, "rewards/rejected": -4.742102146148682, "step": 240, "train_speed(iter/s)": 0.008033 }, { "epoch": 0.5344791738859241, "grad_norm": 2.322474241256714, "learning_rate": 0.00017516883698208836, "logits/chosen": -0.9203046560287476, "logits/rejected": -0.9854355454444885, "logps/chosen": -6.003438949584961, "logps/rejected": -89.39216613769531, "loss": 0.35788312554359436, "memory(GiB)": 46.1, "nll_loss": 0.26435545086860657, "rewards/accuracies": 0.96875, "rewards/chosen": 0.31243598461151123, "rewards/margins": 6.715966701507568, "rewards/rejected": -6.403530597686768, "step": 241, "train_speed(iter/s)": 0.008033 }, { "epoch": 0.5366969297941645, "grad_norm": 2.527200937271118, "learning_rate": 0.00017492599812947174, "logits/chosen": -0.9331361651420593, "logits/rejected": -0.9946306347846985, "logps/chosen": -8.94567584991455, "logps/rejected": -69.54719543457031, "loss": 0.5303357839584351, "memory(GiB)": 46.1, "nll_loss": 0.3786414563655853, "rewards/accuracies": 0.9375, "rewards/chosen": 0.3045698404312134, "rewards/margins": 4.875159740447998, "rewards/rejected": -4.570590496063232, "step": 242, "train_speed(iter/s)": 0.008033 }, { "epoch": 0.5389146857024049, "grad_norm": 3.39489483833313, "learning_rate": 0.0001746821476984154, "logits/chosen": -1.0111048221588135, "logits/rejected": -1.0517295598983765, "logps/chosen": -7.177391052246094, "logps/rejected": -78.28370666503906, "loss": 0.4529821276664734, "memory(GiB)": 46.1, "nll_loss": 0.26994505524635315, "rewards/accuracies": 0.875, "rewards/chosen": 0.38182204961776733, "rewards/margins": 5.7827043533325195, "rewards/rejected": -5.400881767272949, "step": 243, "train_speed(iter/s)": 0.008034 }, { "epoch": 0.5411324416106452, "grad_norm": 2.4717650413513184, "learning_rate": 0.00017443728898115226, "logits/chosen": -0.880812406539917, "logits/rejected": -0.9722001552581787, "logps/chosen": -6.132741451263428, "logps/rejected": -88.99906158447266, "loss": 0.475276380777359, "memory(GiB)": 46.1, "nll_loss": 0.3436709940433502, "rewards/accuracies": 0.9375, "rewards/chosen": 0.3613809645175934, "rewards/margins": 6.569655895233154, "rewards/rejected": -6.2082743644714355, "step": 244, "train_speed(iter/s)": 0.008036 }, { "epoch": 0.5433501975188856, "grad_norm": 4.479578495025635, "learning_rate": 0.00017419142528352817, "logits/chosen": -0.960247278213501, "logits/rejected": -1.024147868156433, "logps/chosen": -10.586898803710938, "logps/rejected": -76.42874145507812, "loss": 0.6297825574874878, "memory(GiB)": 46.1, "nll_loss": 0.4393399953842163, "rewards/accuracies": 0.875, "rewards/chosen": 0.31354814767837524, "rewards/margins": 5.518167018890381, "rewards/rejected": -5.204617977142334, "step": 245, "train_speed(iter/s)": 0.008038 }, { "epoch": 0.5455679534271259, "grad_norm": 7.8160719871521, "learning_rate": 0.00017394455992495722, "logits/chosen": -0.9498053789138794, "logits/rejected": -0.9790096879005432, "logps/chosen": -15.403467178344727, "logps/rejected": -63.19144058227539, "loss": 0.8869673013687134, "memory(GiB)": 46.1, "nll_loss": 0.684601366519928, "rewards/accuracies": 0.90625, "rewards/chosen": 0.4287480115890503, "rewards/margins": 4.687766075134277, "rewards/rejected": -4.2590179443359375, "step": 246, "train_speed(iter/s)": 0.008038 }, { "epoch": 0.5477857093353663, "grad_norm": 4.335257530212402, "learning_rate": 0.00017369669623837702, "logits/chosen": -0.9585328102111816, "logits/rejected": -0.969738781452179, "logps/chosen": -7.035947322845459, "logps/rejected": -55.91766357421875, "loss": 0.5887908935546875, "memory(GiB)": 46.1, "nll_loss": 0.467349648475647, "rewards/accuracies": 1.0, "rewards/chosen": 0.3129452168941498, "rewards/margins": 4.274552345275879, "rewards/rejected": -3.961606979370117, "step": 247, "train_speed(iter/s)": 0.008039 }, { "epoch": 0.5500034652436067, "grad_norm": 4.468607425689697, "learning_rate": 0.00017344783757020356, "logits/chosen": -0.9219909906387329, "logits/rejected": -0.9567832350730896, "logps/chosen": -6.767885208129883, "logps/rejected": -64.09295654296875, "loss": 0.570389986038208, "memory(GiB)": 46.1, "nll_loss": 0.3981003165245056, "rewards/accuracies": 0.9375, "rewards/chosen": 0.21861377358436584, "rewards/margins": 4.632497310638428, "rewards/rejected": -4.413884162902832, "step": 248, "train_speed(iter/s)": 0.00804 }, { "epoch": 0.552221221151847, "grad_norm": 3.9139609336853027, "learning_rate": 0.00017319798728028619, "logits/chosen": -0.8682211637496948, "logits/rejected": -0.9467407464981079, "logps/chosen": -7.962907791137695, "logps/rejected": -57.789955139160156, "loss": 0.6136176586151123, "memory(GiB)": 46.1, "nll_loss": 0.36956262588500977, "rewards/accuracies": 0.9375, "rewards/chosen": 0.25562986731529236, "rewards/margins": 3.6893582344055176, "rewards/rejected": -3.4337282180786133, "step": 249, "train_speed(iter/s)": 0.008041 }, { "epoch": 0.5544389770600874, "grad_norm": 3.867413282394409, "learning_rate": 0.0001729471487418621, "logits/chosen": -0.9048889875411987, "logits/rejected": -0.9317964315414429, "logps/chosen": -8.489683151245117, "logps/rejected": -35.35362243652344, "loss": 0.6919417977333069, "memory(GiB)": 46.1, "nll_loss": 0.38164252042770386, "rewards/accuracies": 0.90625, "rewards/chosen": 0.31191277503967285, "rewards/margins": 2.2607834339141846, "rewards/rejected": -1.9488706588745117, "step": 250, "train_speed(iter/s)": 0.00804 }, { "epoch": 0.5566567329683276, "grad_norm": 2.298877239227295, "learning_rate": 0.00017269532534151092, "logits/chosen": -0.7615423202514648, "logits/rejected": -0.8214331865310669, "logps/chosen": -4.562041282653809, "logps/rejected": -50.8994140625, "loss": 0.4953613579273224, "memory(GiB)": 46.1, "nll_loss": 0.3353947401046753, "rewards/accuracies": 0.96875, "rewards/chosen": 0.3833675682544708, "rewards/margins": 3.5597290992736816, "rewards/rejected": -3.176361560821533, "step": 251, "train_speed(iter/s)": 0.008036 }, { "epoch": 0.558874488876568, "grad_norm": 2.6716578006744385, "learning_rate": 0.00017244252047910892, "logits/chosen": -0.7982797622680664, "logits/rejected": -0.8429900407791138, "logps/chosen": -7.085336685180664, "logps/rejected": -56.750762939453125, "loss": 0.6702145934104919, "memory(GiB)": 46.1, "nll_loss": 0.39718589186668396, "rewards/accuracies": 0.90625, "rewards/chosen": 0.08545264601707458, "rewards/margins": 3.4916038513183594, "rewards/rejected": -3.406151056289673, "step": 252, "train_speed(iter/s)": 0.008037 }, { "epoch": 0.5610922447848083, "grad_norm": 25.809972763061523, "learning_rate": 0.0001721887375677831, "logits/chosen": -0.8431349396705627, "logits/rejected": -0.8907182216644287, "logps/chosen": -9.1442289352417, "logps/rejected": -49.07356643676758, "loss": 0.6953955888748169, "memory(GiB)": 46.1, "nll_loss": 0.4963495135307312, "rewards/accuracies": 0.875, "rewards/chosen": 0.40793710947036743, "rewards/margins": 3.5371923446655273, "rewards/rejected": -3.129255533218384, "step": 253, "train_speed(iter/s)": 0.008039 }, { "epoch": 0.5633100006930487, "grad_norm": 3.9957404136657715, "learning_rate": 0.0001719339800338651, "logits/chosen": -0.8641637563705444, "logits/rejected": -0.9326637983322144, "logps/chosen": -6.770094394683838, "logps/rejected": -52.5345458984375, "loss": 0.5996891260147095, "memory(GiB)": 46.1, "nll_loss": 0.39112862944602966, "rewards/accuracies": 0.90625, "rewards/chosen": 0.35435986518859863, "rewards/margins": 3.2783637046813965, "rewards/rejected": -2.9240036010742188, "step": 254, "train_speed(iter/s)": 0.008038 }, { "epoch": 0.5655277566012891, "grad_norm": 2.1859161853790283, "learning_rate": 0.00017167825131684513, "logits/chosen": -0.8427779674530029, "logits/rejected": -0.8935760855674744, "logps/chosen": -6.190837383270264, "logps/rejected": -64.83207702636719, "loss": 0.41889873147010803, "memory(GiB)": 46.1, "nll_loss": 0.34747910499572754, "rewards/accuracies": 1.0, "rewards/chosen": 0.39933833479881287, "rewards/margins": 4.655778408050537, "rewards/rejected": -4.256440162658691, "step": 255, "train_speed(iter/s)": 0.008039 }, { "epoch": 0.5677455125095294, "grad_norm": 6.577281951904297, "learning_rate": 0.00017142155486932518, "logits/chosen": -0.9050501585006714, "logits/rejected": -0.9711922407150269, "logps/chosen": -5.258976936340332, "logps/rejected": -66.69300842285156, "loss": 0.5538998246192932, "memory(GiB)": 46.1, "nll_loss": 0.36948734521865845, "rewards/accuracies": 0.875, "rewards/chosen": 0.23015204071998596, "rewards/margins": 4.450538158416748, "rewards/rejected": -4.220386505126953, "step": 256, "train_speed(iter/s)": 0.008038 }, { "epoch": 0.5699632684177698, "grad_norm": 7.422839641571045, "learning_rate": 0.00017116389415697272, "logits/chosen": -0.8993850946426392, "logits/rejected": -0.9391924738883972, "logps/chosen": -7.405189514160156, "logps/rejected": -80.06634521484375, "loss": 0.45386412739753723, "memory(GiB)": 46.1, "nll_loss": 0.3150070011615753, "rewards/accuracies": 0.9375, "rewards/chosen": 0.22320273518562317, "rewards/margins": 6.410494804382324, "rewards/rejected": -6.187292098999023, "step": 257, "train_speed(iter/s)": 0.008039 }, { "epoch": 0.5721810243260101, "grad_norm": 2.2811427116394043, "learning_rate": 0.00017090527265847374, "logits/chosen": -0.9498234987258911, "logits/rejected": -1.023263692855835, "logps/chosen": -7.831456184387207, "logps/rejected": -94.71128845214844, "loss": 0.4886764883995056, "memory(GiB)": 46.1, "nll_loss": 0.37856870889663696, "rewards/accuracies": 0.90625, "rewards/chosen": 0.3619069457054138, "rewards/margins": 7.0146894454956055, "rewards/rejected": -6.652782440185547, "step": 258, "train_speed(iter/s)": 0.008038 }, { "epoch": 0.5743987802342505, "grad_norm": 13.671805381774902, "learning_rate": 0.00017064569386548585, "logits/chosen": -0.9374775290489197, "logits/rejected": -0.9560403227806091, "logps/chosen": -15.280105590820312, "logps/rejected": -59.25236129760742, "loss": 1.0413533449172974, "memory(GiB)": 46.1, "nll_loss": 0.7767413854598999, "rewards/accuracies": 0.9375, "rewards/chosen": -0.21862581372261047, "rewards/margins": 4.168983459472656, "rewards/rejected": -4.387609958648682, "step": 259, "train_speed(iter/s)": 0.008039 }, { "epoch": 0.5766165361424909, "grad_norm": 20.491348266601562, "learning_rate": 0.00017038516128259115, "logits/chosen": -0.9478408098220825, "logits/rejected": -0.9793086051940918, "logps/chosen": -5.960484504699707, "logps/rejected": -58.90625762939453, "loss": 0.8467053174972534, "memory(GiB)": 46.1, "nll_loss": 0.6261860728263855, "rewards/accuracies": 0.90625, "rewards/chosen": 0.22471851110458374, "rewards/margins": 4.334632873535156, "rewards/rejected": -4.109914302825928, "step": 260, "train_speed(iter/s)": 0.008036 }, { "epoch": 0.5788342920507311, "grad_norm": 4.862920761108398, "learning_rate": 0.00017012367842724887, "logits/chosen": -0.8967673778533936, "logits/rejected": -0.922260582447052, "logps/chosen": -8.773322105407715, "logps/rejected": -41.337547302246094, "loss": 0.5787839293479919, "memory(GiB)": 46.1, "nll_loss": 0.39914894104003906, "rewards/accuracies": 1.0, "rewards/chosen": 0.3420258164405823, "rewards/margins": 2.8629865646362305, "rewards/rejected": -2.520960807800293, "step": 261, "train_speed(iter/s)": 0.008035 }, { "epoch": 0.5810520479589715, "grad_norm": 6.606571674346924, "learning_rate": 0.0001698612488297479, "logits/chosen": -0.8431069254875183, "logits/rejected": -0.8718072772026062, "logps/chosen": -4.862249374389648, "logps/rejected": -69.5229721069336, "loss": 0.48749804496765137, "memory(GiB)": 46.1, "nll_loss": 0.298774778842926, "rewards/accuracies": 0.90625, "rewards/chosen": 0.2969810962677002, "rewards/margins": 5.211779594421387, "rewards/rejected": -4.914798736572266, "step": 262, "train_speed(iter/s)": 0.008036 }, { "epoch": 0.5832698038672118, "grad_norm": 8.771227836608887, "learning_rate": 0.0001695978760331591, "logits/chosen": -0.844187319278717, "logits/rejected": -0.8691195249557495, "logps/chosen": -10.602951049804688, "logps/rejected": -55.179969787597656, "loss": 0.7893258929252625, "memory(GiB)": 46.1, "nll_loss": 0.5229781866073608, "rewards/accuracies": 0.84375, "rewards/chosen": 0.20470717549324036, "rewards/margins": 3.2157349586486816, "rewards/rejected": -3.0110273361206055, "step": 263, "train_speed(iter/s)": 0.008036 }, { "epoch": 0.5854875597754522, "grad_norm": 4.490575313568115, "learning_rate": 0.00016933356359328757, "logits/chosen": -0.8540911674499512, "logits/rejected": -0.8924884796142578, "logps/chosen": -11.638439178466797, "logps/rejected": -56.00303649902344, "loss": 0.802644670009613, "memory(GiB)": 46.1, "nll_loss": 0.46404212713241577, "rewards/accuracies": 0.84375, "rewards/chosen": 0.22095105051994324, "rewards/margins": 3.449429512023926, "rewards/rejected": -3.228478193283081, "step": 264, "train_speed(iter/s)": 0.008037 }, { "epoch": 0.5877053156836926, "grad_norm": 2.0575592517852783, "learning_rate": 0.00016906831507862443, "logits/chosen": -0.879247784614563, "logits/rejected": -0.9168909788131714, "logps/chosen": -8.618342399597168, "logps/rejected": -58.41561508178711, "loss": 0.5658751726150513, "memory(GiB)": 46.1, "nll_loss": 0.424156129360199, "rewards/accuracies": 0.96875, "rewards/chosen": 0.47101202607154846, "rewards/margins": 4.365726470947266, "rewards/rejected": -3.89471435546875, "step": 265, "train_speed(iter/s)": 0.008036 }, { "epoch": 0.5899230715919329, "grad_norm": 5.172542095184326, "learning_rate": 0.00016880213407029899, "logits/chosen": -0.8254646062850952, "logits/rejected": -0.8460347652435303, "logps/chosen": -13.859678268432617, "logps/rejected": -62.08647537231445, "loss": 0.5818012952804565, "memory(GiB)": 46.1, "nll_loss": 0.42503443360328674, "rewards/accuracies": 0.96875, "rewards/chosen": 0.44672632217407227, "rewards/margins": 4.058588981628418, "rewards/rejected": -3.6118626594543457, "step": 266, "train_speed(iter/s)": 0.008037 }, { "epoch": 0.5921408275001733, "grad_norm": 6.763800144195557, "learning_rate": 0.00016853502416203, "logits/chosen": -0.8868339657783508, "logits/rejected": -0.9178940653800964, "logps/chosen": -10.896245002746582, "logps/rejected": -62.17267608642578, "loss": 0.8170678019523621, "memory(GiB)": 46.1, "nll_loss": 0.5326193571090698, "rewards/accuracies": 0.875, "rewards/chosen": 0.13541792333126068, "rewards/margins": 4.492279529571533, "rewards/rejected": -4.356861591339111, "step": 267, "train_speed(iter/s)": 0.008037 }, { "epoch": 0.5943585834084136, "grad_norm": 1.9904747009277344, "learning_rate": 0.00016826698896007733, "logits/chosen": -0.9039366841316223, "logits/rejected": -0.9352925419807434, "logps/chosen": -11.314581871032715, "logps/rejected": -61.60304260253906, "loss": 0.42121097445487976, "memory(GiB)": 46.1, "nll_loss": 0.3151026964187622, "rewards/accuracies": 0.96875, "rewards/chosen": 0.3598387837409973, "rewards/margins": 4.653321266174316, "rewards/rejected": -4.293482780456543, "step": 268, "train_speed(iter/s)": 0.008038 }, { "epoch": 0.596576339316654, "grad_norm": 5.165607452392578, "learning_rate": 0.0001679980320831934, "logits/chosen": -0.8385277986526489, "logits/rejected": -0.8792409300804138, "logps/chosen": -8.309085845947266, "logps/rejected": -64.71354675292969, "loss": 0.5031875371932983, "memory(GiB)": 46.1, "nll_loss": 0.3636503219604492, "rewards/accuracies": 0.9375, "rewards/chosen": 0.24522201716899872, "rewards/margins": 4.567659854888916, "rewards/rejected": -4.322437763214111, "step": 269, "train_speed(iter/s)": 0.008037 }, { "epoch": 0.5987940952248944, "grad_norm": 4.2751874923706055, "learning_rate": 0.00016772815716257412, "logits/chosen": -0.9187635779380798, "logits/rejected": -0.9605762958526611, "logps/chosen": -8.409623146057129, "logps/rejected": -52.862247467041016, "loss": 0.6836012005805969, "memory(GiB)": 46.1, "nll_loss": 0.44153153896331787, "rewards/accuracies": 0.9375, "rewards/chosen": 0.39110705256462097, "rewards/margins": 3.830803871154785, "rewards/rejected": -3.439696788787842, "step": 270, "train_speed(iter/s)": 0.008037 }, { "epoch": 0.6010118511331347, "grad_norm": 4.208390712738037, "learning_rate": 0.0001674573678418099, "logits/chosen": -0.8860863447189331, "logits/rejected": -0.9442291855812073, "logps/chosen": -4.314522743225098, "logps/rejected": -57.75453567504883, "loss": 0.5371519923210144, "memory(GiB)": 46.1, "nll_loss": 0.33125901222229004, "rewards/accuracies": 0.90625, "rewards/chosen": 0.22049468755722046, "rewards/margins": 4.082085132598877, "rewards/rejected": -3.8615903854370117, "step": 271, "train_speed(iter/s)": 0.008039 }, { "epoch": 0.603229607041375, "grad_norm": 4.579020977020264, "learning_rate": 0.00016718566777683655, "logits/chosen": -0.8948354721069336, "logits/rejected": -0.9177219271659851, "logps/chosen": -14.298483848571777, "logps/rejected": -62.74816131591797, "loss": 0.6376166939735413, "memory(GiB)": 46.1, "nll_loss": 0.5089208483695984, "rewards/accuracies": 0.96875, "rewards/chosen": 0.32330945134162903, "rewards/margins": 4.685830593109131, "rewards/rejected": -4.362521171569824, "step": 272, "train_speed(iter/s)": 0.008039 }, { "epoch": 0.6054473629496153, "grad_norm": 1.6271522045135498, "learning_rate": 0.00016691306063588583, "logits/chosen": -0.8025689125061035, "logits/rejected": -0.8775883316993713, "logps/chosen": -6.190898418426514, "logps/rejected": -67.3564453125, "loss": 0.512791633605957, "memory(GiB)": 46.1, "nll_loss": 0.33794161677360535, "rewards/accuracies": 0.96875, "rewards/chosen": 0.36618149280548096, "rewards/margins": 4.5750837326049805, "rewards/rejected": -4.208902359008789, "step": 273, "train_speed(iter/s)": 0.008041 }, { "epoch": 0.6076651188578557, "grad_norm": 1.6816551685333252, "learning_rate": 0.00016663955009943603, "logits/chosen": -0.8147826790809631, "logits/rejected": -0.8742930889129639, "logps/chosen": -3.890578508377075, "logps/rejected": -65.23680114746094, "loss": 0.3021196126937866, "memory(GiB)": 46.1, "nll_loss": 0.15443052351474762, "rewards/accuracies": 0.90625, "rewards/chosen": 0.26169687509536743, "rewards/margins": 4.66456413269043, "rewards/rejected": -4.402867317199707, "step": 274, "train_speed(iter/s)": 0.008041 }, { "epoch": 0.609882874766096, "grad_norm": 5.99432373046875, "learning_rate": 0.00016636513986016213, "logits/chosen": -0.7995700836181641, "logits/rejected": -0.8312158584594727, "logps/chosen": -8.787904739379883, "logps/rejected": -66.17198181152344, "loss": 0.6568697690963745, "memory(GiB)": 46.1, "nll_loss": 0.4868704080581665, "rewards/accuracies": 0.90625, "rewards/chosen": 0.334846168756485, "rewards/margins": 4.610203742980957, "rewards/rejected": -4.275357246398926, "step": 275, "train_speed(iter/s)": 0.008041 }, { "epoch": 0.6121006306743364, "grad_norm": 1.89693021774292, "learning_rate": 0.00016608983362288612, "logits/chosen": -0.7742518782615662, "logits/rejected": -0.8116195797920227, "logps/chosen": -8.038908958435059, "logps/rejected": -50.42762756347656, "loss": 0.6119199991226196, "memory(GiB)": 46.1, "nll_loss": 0.41143566370010376, "rewards/accuracies": 0.9375, "rewards/chosen": 0.38594791293144226, "rewards/margins": 3.199566125869751, "rewards/rejected": -2.8136179447174072, "step": 276, "train_speed(iter/s)": 0.00804 }, { "epoch": 0.6143183865825768, "grad_norm": 7.4511284828186035, "learning_rate": 0.00016581363510452684, "logits/chosen": -0.7676944136619568, "logits/rejected": -0.7938407063484192, "logps/chosen": -9.055317878723145, "logps/rejected": -58.31163787841797, "loss": 0.6325221061706543, "memory(GiB)": 46.1, "nll_loss": 0.42814794182777405, "rewards/accuracies": 0.9375, "rewards/chosen": 0.3626343905925751, "rewards/margins": 4.097815036773682, "rewards/rejected": -3.735180377960205, "step": 277, "train_speed(iter/s)": 0.008039 }, { "epoch": 0.6165361424908171, "grad_norm": 8.191842079162598, "learning_rate": 0.00016553654803404974, "logits/chosen": -0.8072691559791565, "logits/rejected": -0.8492940068244934, "logps/chosen": -9.613892555236816, "logps/rejected": -63.351585388183594, "loss": 0.7843741178512573, "memory(GiB)": 46.1, "nll_loss": 0.44085100293159485, "rewards/accuracies": 0.875, "rewards/chosen": 0.12112342566251755, "rewards/margins": 4.584871292114258, "rewards/rejected": -4.463747978210449, "step": 278, "train_speed(iter/s)": 0.008039 }, { "epoch": 0.6187538983990575, "grad_norm": 1.822716236114502, "learning_rate": 0.00016525857615241687, "logits/chosen": -0.7915133237838745, "logits/rejected": -0.834713876247406, "logps/chosen": -8.906228065490723, "logps/rejected": -65.07171630859375, "loss": 0.4892042279243469, "memory(GiB)": 46.1, "nll_loss": 0.34095320105552673, "rewards/accuracies": 0.90625, "rewards/chosen": 0.35025283694267273, "rewards/margins": 4.735526084899902, "rewards/rejected": -4.385272979736328, "step": 279, "train_speed(iter/s)": 0.008038 }, { "epoch": 0.6209716543072978, "grad_norm": 2.0796329975128174, "learning_rate": 0.000164979723212536, "logits/chosen": -0.820456326007843, "logits/rejected": -0.8396943807601929, "logps/chosen": -8.370631217956543, "logps/rejected": -63.127323150634766, "loss": 0.6209460496902466, "memory(GiB)": 46.1, "nll_loss": 0.45356690883636475, "rewards/accuracies": 0.96875, "rewards/chosen": 0.28135380148887634, "rewards/margins": 4.626897811889648, "rewards/rejected": -4.34554386138916, "step": 280, "train_speed(iter/s)": 0.008039 }, { "epoch": 0.6231894102155382, "grad_norm": 5.120301246643066, "learning_rate": 0.00016469999297921004, "logits/chosen": -0.8289170265197754, "logits/rejected": -0.857169508934021, "logps/chosen": -8.919156074523926, "logps/rejected": -68.47624206542969, "loss": 0.6525104641914368, "memory(GiB)": 46.1, "nll_loss": 0.544549822807312, "rewards/accuracies": 0.96875, "rewards/chosen": 0.32334885001182556, "rewards/margins": 5.191709995269775, "rewards/rejected": -4.868360996246338, "step": 281, "train_speed(iter/s)": 0.008039 }, { "epoch": 0.6254071661237784, "grad_norm": 3.569572687149048, "learning_rate": 0.00016441938922908645, "logits/chosen": -0.8497668504714966, "logits/rejected": -0.8852089047431946, "logps/chosen": -8.614233016967773, "logps/rejected": -86.08775329589844, "loss": 0.39198628067970276, "memory(GiB)": 46.1, "nll_loss": 0.29619306325912476, "rewards/accuracies": 0.96875, "rewards/chosen": 0.2805593013763428, "rewards/margins": 6.5137038230896, "rewards/rejected": -6.2331438064575195, "step": 282, "train_speed(iter/s)": 0.008038 }, { "epoch": 0.6276249220320188, "grad_norm": 3.6795778274536133, "learning_rate": 0.0001641379157506059, "logits/chosen": -0.8261008262634277, "logits/rejected": -0.8573625087738037, "logps/chosen": -8.30790901184082, "logps/rejected": -68.17735290527344, "loss": 0.4799172878265381, "memory(GiB)": 46.1, "nll_loss": 0.3408132791519165, "rewards/accuracies": 0.96875, "rewards/chosen": 0.45212632417678833, "rewards/margins": 5.448065757751465, "rewards/rejected": -4.995939254760742, "step": 283, "train_speed(iter/s)": 0.008037 }, { "epoch": 0.6298426779402592, "grad_norm": 4.690124034881592, "learning_rate": 0.00016385557634395137, "logits/chosen": -0.7986090183258057, "logits/rejected": -0.8487676978111267, "logps/chosen": -11.636720657348633, "logps/rejected": -72.38658142089844, "loss": 0.6701381206512451, "memory(GiB)": 46.1, "nll_loss": 0.3881206512451172, "rewards/accuracies": 0.90625, "rewards/chosen": 0.22570770978927612, "rewards/margins": 4.7588019371032715, "rewards/rejected": -4.5330939292907715, "step": 284, "train_speed(iter/s)": 0.008039 }, { "epoch": 0.6320604338484995, "grad_norm": 7.493976593017578, "learning_rate": 0.00016357237482099684, "logits/chosen": -0.8304284811019897, "logits/rejected": -0.8699071407318115, "logps/chosen": -5.870106220245361, "logps/rejected": -76.31659698486328, "loss": 0.5334377884864807, "memory(GiB)": 46.1, "nll_loss": 0.39371258020401, "rewards/accuracies": 0.90625, "rewards/chosen": 0.32191622257232666, "rewards/margins": 5.466432094573975, "rewards/rejected": -5.1445159912109375, "step": 285, "train_speed(iter/s)": 0.008039 }, { "epoch": 0.6342781897567399, "grad_norm": 3.969316005706787, "learning_rate": 0.00016328831500525554, "logits/chosen": -0.8328202366828918, "logits/rejected": -0.8629224896430969, "logps/chosen": -6.880237102508545, "logps/rejected": -74.27322387695312, "loss": 0.5944677591323853, "memory(GiB)": 46.1, "nll_loss": 0.3375623822212219, "rewards/accuracies": 0.8125, "rewards/chosen": 0.2438332587480545, "rewards/margins": 5.4755988121032715, "rewards/rejected": -5.231765270233154, "step": 286, "train_speed(iter/s)": 0.008038 }, { "epoch": 0.6364959456649802, "grad_norm": 7.615932464599609, "learning_rate": 0.00016300340073182877, "logits/chosen": -0.8713105916976929, "logits/rejected": -0.9103774428367615, "logps/chosen": -8.833354949951172, "logps/rejected": -71.67160034179688, "loss": 0.5350167751312256, "memory(GiB)": 46.1, "nll_loss": 0.3725404441356659, "rewards/accuracies": 0.9375, "rewards/chosen": 0.16415414214134216, "rewards/margins": 5.522144317626953, "rewards/rejected": -5.35798978805542, "step": 287, "train_speed(iter/s)": 0.008038 }, { "epoch": 0.6387137015732206, "grad_norm": 1.877372145652771, "learning_rate": 0.0001627176358473537, "logits/chosen": -0.7970234751701355, "logits/rejected": -0.8734095692634583, "logps/chosen": -6.636631011962891, "logps/rejected": -77.04444122314453, "loss": 0.4367782473564148, "memory(GiB)": 46.1, "nll_loss": 0.3150050640106201, "rewards/accuracies": 0.9375, "rewards/chosen": 0.2868354022502899, "rewards/margins": 5.483615875244141, "rewards/rejected": -5.196780204772949, "step": 288, "train_speed(iter/s)": 0.008037 }, { "epoch": 0.640931457481461, "grad_norm": 1.9805866479873657, "learning_rate": 0.00016243102420995182, "logits/chosen": -0.9195335507392883, "logits/rejected": -0.9563324451446533, "logps/chosen": -9.391670227050781, "logps/rejected": -74.65196228027344, "loss": 0.4557032883167267, "memory(GiB)": 46.1, "nll_loss": 0.3854813575744629, "rewards/accuracies": 1.0, "rewards/chosen": 0.2575431764125824, "rewards/margins": 5.831593990325928, "rewards/rejected": -5.5740509033203125, "step": 289, "train_speed(iter/s)": 0.008037 }, { "epoch": 0.6431492133897013, "grad_norm": 1.8995643854141235, "learning_rate": 0.00016214356968917648, "logits/chosen": -0.8684622645378113, "logits/rejected": -0.9041600823402405, "logps/chosen": -6.005845069885254, "logps/rejected": -63.756404876708984, "loss": 0.5114766359329224, "memory(GiB)": 46.1, "nll_loss": 0.34650737047195435, "rewards/accuracies": 0.90625, "rewards/chosen": 0.3093988299369812, "rewards/margins": 3.883380174636841, "rewards/rejected": -3.573981285095215, "step": 290, "train_speed(iter/s)": 0.008036 }, { "epoch": 0.6453669692979417, "grad_norm": 2.626262903213501, "learning_rate": 0.00016185527616596095, "logits/chosen": -0.8445376753807068, "logits/rejected": -0.9054903388023376, "logps/chosen": -8.279337882995605, "logps/rejected": -67.75119018554688, "loss": 0.5382622480392456, "memory(GiB)": 46.1, "nll_loss": 0.37347856163978577, "rewards/accuracies": 0.9375, "rewards/chosen": 0.31158941984176636, "rewards/margins": 5.205071926116943, "rewards/rejected": -4.893482208251953, "step": 291, "train_speed(iter/s)": 0.008037 }, { "epoch": 0.647584725206182, "grad_norm": 1.6392858028411865, "learning_rate": 0.0001615661475325658, "logits/chosen": -0.9225890636444092, "logits/rejected": -0.961870551109314, "logps/chosen": -8.307012557983398, "logps/rejected": -68.97980499267578, "loss": 0.4374139606952667, "memory(GiB)": 46.1, "nll_loss": 0.30878713726997375, "rewards/accuracies": 0.96875, "rewards/chosen": 0.4022150933742523, "rewards/margins": 4.990863800048828, "rewards/rejected": -4.588648319244385, "step": 292, "train_speed(iter/s)": 0.008037 }, { "epoch": 0.6498024811144223, "grad_norm": 2.5469810962677, "learning_rate": 0.0001612761876925266, "logits/chosen": -0.8949599266052246, "logits/rejected": -0.9571384191513062, "logps/chosen": -9.247197151184082, "logps/rejected": -69.23826599121094, "loss": 0.569223165512085, "memory(GiB)": 46.1, "nll_loss": 0.38202205300331116, "rewards/accuracies": 0.875, "rewards/chosen": 0.41862952709198, "rewards/margins": 4.359453201293945, "rewards/rejected": -3.940823554992676, "step": 293, "train_speed(iter/s)": 0.008036 }, { "epoch": 0.6520202370226627, "grad_norm": 1.9419584274291992, "learning_rate": 0.00016098540056060093, "logits/chosen": -0.9679895043373108, "logits/rejected": -1.007946491241455, "logps/chosen": -9.110626220703125, "logps/rejected": -64.00426483154297, "loss": 0.6166866421699524, "memory(GiB)": 46.1, "nll_loss": 0.4243084490299225, "rewards/accuracies": 0.90625, "rewards/chosen": 0.3954381048679352, "rewards/margins": 3.941873073577881, "rewards/rejected": -3.5464346408843994, "step": 294, "train_speed(iter/s)": 0.008037 }, { "epoch": 0.654237992930903, "grad_norm": 2.5056684017181396, "learning_rate": 0.00016069379006271566, "logits/chosen": -0.9131721258163452, "logits/rejected": -0.9555903673171997, "logps/chosen": -7.171519756317139, "logps/rejected": -65.33702087402344, "loss": 0.5050148963928223, "memory(GiB)": 46.1, "nll_loss": 0.35454410314559937, "rewards/accuracies": 0.9375, "rewards/chosen": 0.3253967761993408, "rewards/margins": 4.702347278594971, "rewards/rejected": -4.376949787139893, "step": 295, "train_speed(iter/s)": 0.008035 }, { "epoch": 0.6564557488391434, "grad_norm": 1.6568937301635742, "learning_rate": 0.0001604013601359141, "logits/chosen": -0.9838509559631348, "logits/rejected": -1.0402789115905762, "logps/chosen": -3.7990381717681885, "logps/rejected": -71.07801055908203, "loss": 0.3659912049770355, "memory(GiB)": 46.1, "nll_loss": 0.25355616211891174, "rewards/accuracies": 1.0, "rewards/chosen": 0.24511104822158813, "rewards/margins": 5.158456325531006, "rewards/rejected": -4.9133453369140625, "step": 296, "train_speed(iter/s)": 0.008035 }, { "epoch": 0.6586735047473837, "grad_norm": 3.638634443283081, "learning_rate": 0.00016010811472830252, "logits/chosen": -1.039500117301941, "logits/rejected": -1.0798026323318481, "logps/chosen": -6.155025482177734, "logps/rejected": -55.543113708496094, "loss": 0.533197283744812, "memory(GiB)": 46.1, "nll_loss": 0.36974427103996277, "rewards/accuracies": 0.9375, "rewards/chosen": 0.4299376308917999, "rewards/margins": 4.183603763580322, "rewards/rejected": -3.7536661624908447, "step": 297, "train_speed(iter/s)": 0.008035 }, { "epoch": 0.6608912606556241, "grad_norm": 1.9530096054077148, "learning_rate": 0.00015981405779899715, "logits/chosen": -1.0155575275421143, "logits/rejected": -1.0633889436721802, "logps/chosen": -9.130773544311523, "logps/rejected": -62.94365692138672, "loss": 0.47470739483833313, "memory(GiB)": 46.1, "nll_loss": 0.3274574279785156, "rewards/accuracies": 0.96875, "rewards/chosen": 0.2257828563451767, "rewards/margins": 4.259277820587158, "rewards/rejected": -4.03349494934082, "step": 298, "train_speed(iter/s)": 0.008035 }, { "epoch": 0.6631090165638645, "grad_norm": 2.4985907077789307, "learning_rate": 0.0001595191933180705, "logits/chosen": -1.0449122190475464, "logits/rejected": -1.0995962619781494, "logps/chosen": -5.003297805786133, "logps/rejected": -76.33629608154297, "loss": 0.4325657784938812, "memory(GiB)": 46.1, "nll_loss": 0.2864378094673157, "rewards/accuracies": 0.90625, "rewards/chosen": 0.1750936508178711, "rewards/margins": 5.564494609832764, "rewards/rejected": -5.389400482177734, "step": 299, "train_speed(iter/s)": 0.008035 }, { "epoch": 0.6653267724721048, "grad_norm": 4.527393817901611, "learning_rate": 0.00015922352526649803, "logits/chosen": -1.013086199760437, "logits/rejected": -1.0818321704864502, "logps/chosen": -7.39998197555542, "logps/rejected": -79.36940002441406, "loss": 0.5117042660713196, "memory(GiB)": 46.1, "nll_loss": 0.35834765434265137, "rewards/accuracies": 0.9375, "rewards/chosen": 0.22214177250862122, "rewards/margins": 5.567633152008057, "rewards/rejected": -5.345491409301758, "step": 300, "train_speed(iter/s)": 0.008034 }, { "epoch": 0.6653267724721048, "eval_logits/chosen": -1.051897406578064, "eval_logits/rejected": -1.1186614036560059, "eval_logps/chosen": -5.492368698120117, "eval_logps/rejected": -83.7062759399414, "eval_loss": 0.41139093041419983, "eval_nll_loss": 0.3018193244934082, "eval_rewards/accuracies": 0.9655172228813171, "eval_rewards/chosen": 0.31715357303619385, "eval_rewards/margins": 6.428208351135254, "eval_rewards/rejected": -6.111053466796875, "eval_runtime": 221.1454, "eval_samples_per_second": 0.656, "eval_steps_per_second": 0.656, "step": 300 }, { "epoch": 0.6675445283803452, "grad_norm": 2.912181854248047, "learning_rate": 0.00015892705763610398, "logits/chosen": -1.0837887525558472, "logits/rejected": -1.1028895378112793, "logps/chosen": -11.03648853302002, "logps/rejected": -74.05093383789062, "loss": 0.5985814929008484, "memory(GiB)": 46.1, "nll_loss": 0.39898425340652466, "rewards/accuracies": 0.90625, "rewards/chosen": 0.3419343829154968, "rewards/margins": 5.46358060836792, "rewards/rejected": -5.121645927429199, "step": 301, "train_speed(iter/s)": 0.007984 }, { "epoch": 0.6697622842885855, "grad_norm": 6.333323001861572, "learning_rate": 0.000158629794429508, "logits/chosen": -1.1112759113311768, "logits/rejected": -1.1460927724838257, "logps/chosen": -7.317679405212402, "logps/rejected": -69.5050048828125, "loss": 0.65586918592453, "memory(GiB)": 46.1, "nll_loss": 0.37288913130760193, "rewards/accuracies": 0.8125, "rewards/chosen": 0.0826641321182251, "rewards/margins": 5.427277088165283, "rewards/rejected": -5.344613075256348, "step": 302, "train_speed(iter/s)": 0.007984 }, { "epoch": 0.6719800401968259, "grad_norm": 15.77000904083252, "learning_rate": 0.00015833173966007066, "logits/chosen": -1.1002230644226074, "logits/rejected": -1.1550010442733765, "logps/chosen": -6.355401992797852, "logps/rejected": -96.39167022705078, "loss": 0.5191652774810791, "memory(GiB)": 46.1, "nll_loss": 0.359164834022522, "rewards/accuracies": 0.96875, "rewards/chosen": 0.48963892459869385, "rewards/margins": 8.402400970458984, "rewards/rejected": -7.912761688232422, "step": 303, "train_speed(iter/s)": 0.007984 }, { "epoch": 0.6741977961050661, "grad_norm": 2.923369884490967, "learning_rate": 0.00015803289735183952, "logits/chosen": -1.0692856311798096, "logits/rejected": -1.1164627075195312, "logps/chosen": -11.489358901977539, "logps/rejected": -65.28047943115234, "loss": 0.6315346360206604, "memory(GiB)": 46.1, "nll_loss": 0.5478549599647522, "rewards/accuracies": 0.96875, "rewards/chosen": 0.20820873975753784, "rewards/margins": 5.051858425140381, "rewards/rejected": -4.843649864196777, "step": 304, "train_speed(iter/s)": 0.007985 }, { "epoch": 0.6764155520133065, "grad_norm": 4.412753105163574, "learning_rate": 0.00015773327153949465, "logits/chosen": -1.123039960861206, "logits/rejected": -1.1700791120529175, "logps/chosen": -6.8377275466918945, "logps/rejected": -71.43708801269531, "loss": 0.6268560886383057, "memory(GiB)": 46.1, "nll_loss": 0.4594406187534332, "rewards/accuracies": 0.9375, "rewards/chosen": 0.25862306356430054, "rewards/margins": 5.758920192718506, "rewards/rejected": -5.500297546386719, "step": 305, "train_speed(iter/s)": 0.007985 }, { "epoch": 0.6786333079215469, "grad_norm": 4.7620530128479, "learning_rate": 0.00015743286626829437, "logits/chosen": -1.0160408020019531, "logits/rejected": -1.062739610671997, "logps/chosen": -9.769542694091797, "logps/rejected": -62.2449836730957, "loss": 0.9608262777328491, "memory(GiB)": 46.1, "nll_loss": 0.7778749465942383, "rewards/accuracies": 0.90625, "rewards/chosen": 0.25323987007141113, "rewards/margins": 4.6640191078186035, "rewards/rejected": -4.410778999328613, "step": 306, "train_speed(iter/s)": 0.007985 }, { "epoch": 0.6808510638297872, "grad_norm": 5.518799304962158, "learning_rate": 0.0001571316855940204, "logits/chosen": -1.0274622440338135, "logits/rejected": -1.0647941827774048, "logps/chosen": -12.439924240112305, "logps/rejected": -77.76188659667969, "loss": 0.5631053447723389, "memory(GiB)": 46.1, "nll_loss": 0.26418688893318176, "rewards/accuracies": 0.8125, "rewards/chosen": 0.08976743370294571, "rewards/margins": 5.368993282318115, "rewards/rejected": -5.279226303100586, "step": 307, "train_speed(iter/s)": 0.007986 }, { "epoch": 0.6830688197380276, "grad_norm": 3.4025986194610596, "learning_rate": 0.00015682973358292323, "logits/chosen": -0.9364197850227356, "logits/rejected": -0.9693114757537842, "logps/chosen": -6.508739471435547, "logps/rejected": -64.5718994140625, "loss": 0.4292842745780945, "memory(GiB)": 46.1, "nll_loss": 0.30177903175354004, "rewards/accuracies": 0.9375, "rewards/chosen": 0.355379581451416, "rewards/margins": 4.948610305786133, "rewards/rejected": -4.593230724334717, "step": 308, "train_speed(iter/s)": 0.007985 }, { "epoch": 0.6852865756462679, "grad_norm": 5.073081016540527, "learning_rate": 0.0001565270143116672, "logits/chosen": -0.9697186350822449, "logits/rejected": -1.0311468839645386, "logps/chosen": -10.48011302947998, "logps/rejected": -68.85475158691406, "loss": 0.63325434923172, "memory(GiB)": 46.1, "nll_loss": 0.4581890106201172, "rewards/accuracies": 0.9375, "rewards/chosen": 0.10327774286270142, "rewards/margins": 4.557413101196289, "rewards/rejected": -4.454134941101074, "step": 309, "train_speed(iter/s)": 0.007984 }, { "epoch": 0.6875043315545083, "grad_norm": 3.0755183696746826, "learning_rate": 0.00015622353186727544, "logits/chosen": -0.8866985440254211, "logits/rejected": -0.9442430138587952, "logps/chosen": -11.030970573425293, "logps/rejected": -63.98460388183594, "loss": 0.650689423084259, "memory(GiB)": 46.1, "nll_loss": 0.45447224378585815, "rewards/accuracies": 0.9375, "rewards/chosen": 0.23037654161453247, "rewards/margins": 4.3462677001953125, "rewards/rejected": -4.115890979766846, "step": 310, "train_speed(iter/s)": 0.007985 }, { "epoch": 0.6897220874627487, "grad_norm": 1.9100881814956665, "learning_rate": 0.0001559192903470747, "logits/chosen": -0.8884042501449585, "logits/rejected": -0.9456340074539185, "logps/chosen": -4.9610724449157715, "logps/rejected": -53.072811126708984, "loss": 0.4617457985877991, "memory(GiB)": 46.1, "nll_loss": 0.28007352352142334, "rewards/accuracies": 0.9375, "rewards/chosen": 0.36447668075561523, "rewards/margins": 3.690591335296631, "rewards/rejected": -3.3261144161224365, "step": 311, "train_speed(iter/s)": 0.007985 }, { "epoch": 0.691939843370989, "grad_norm": 2.4238641262054443, "learning_rate": 0.00015561429385864005, "logits/chosen": -0.908905565738678, "logits/rejected": -0.9534474611282349, "logps/chosen": -8.066839218139648, "logps/rejected": -45.6877326965332, "loss": 0.7352919578552246, "memory(GiB)": 46.1, "nll_loss": 0.5458393692970276, "rewards/accuracies": 0.9375, "rewards/chosen": 0.3332860767841339, "rewards/margins": 3.4314332008361816, "rewards/rejected": -3.098147392272949, "step": 312, "train_speed(iter/s)": 0.007985 }, { "epoch": 0.6941575992792294, "grad_norm": 2.4582879543304443, "learning_rate": 0.00015530854651973948, "logits/chosen": -0.9047088623046875, "logits/rejected": -0.9368931651115417, "logps/chosen": -11.2597017288208, "logps/rejected": -52.92218017578125, "loss": 0.674723207950592, "memory(GiB)": 46.1, "nll_loss": 0.49418923258781433, "rewards/accuracies": 0.9375, "rewards/chosen": 0.41948604583740234, "rewards/margins": 3.426848888397217, "rewards/rejected": -3.0073628425598145, "step": 313, "train_speed(iter/s)": 0.007986 }, { "epoch": 0.6963753551874696, "grad_norm": 2.3463730812072754, "learning_rate": 0.00015500205245827812, "logits/chosen": -0.9688816666603088, "logits/rejected": -1.001115322113037, "logps/chosen": -7.497335433959961, "logps/rejected": -52.40256118774414, "loss": 0.5067635774612427, "memory(GiB)": 46.1, "nll_loss": 0.3210291862487793, "rewards/accuracies": 0.9375, "rewards/chosen": 0.2679075002670288, "rewards/margins": 3.5391669273376465, "rewards/rejected": -3.2712595462799072, "step": 314, "train_speed(iter/s)": 0.007985 }, { "epoch": 0.69859311109571, "grad_norm": 1.4639019966125488, "learning_rate": 0.00015469481581224272, "logits/chosen": -0.9862826466560364, "logits/rejected": -1.0402218103408813, "logps/chosen": -11.151278495788574, "logps/rejected": -63.666648864746094, "loss": 0.542059063911438, "memory(GiB)": 46.1, "nll_loss": 0.42706289887428284, "rewards/accuracies": 0.9375, "rewards/chosen": 0.5953376293182373, "rewards/margins": 4.478287696838379, "rewards/rejected": -3.8829500675201416, "step": 315, "train_speed(iter/s)": 0.007986 }, { "epoch": 0.7008108670039503, "grad_norm": 1.0964159965515137, "learning_rate": 0.00015438684072964555, "logits/chosen": -0.9509701728820801, "logits/rejected": -1.0120131969451904, "logps/chosen": -3.282318115234375, "logps/rejected": -72.4108657836914, "loss": 0.23854827880859375, "memory(GiB)": 46.1, "nll_loss": 0.15861773490905762, "rewards/accuracies": 0.96875, "rewards/chosen": 0.3274027109146118, "rewards/margins": 5.171144008636475, "rewards/rejected": -4.8437418937683105, "step": 316, "train_speed(iter/s)": 0.007987 }, { "epoch": 0.7030286229121907, "grad_norm": 3.6565847396850586, "learning_rate": 0.00015407813136846877, "logits/chosen": -1.0520319938659668, "logits/rejected": -1.0684181451797485, "logps/chosen": -6.481374740600586, "logps/rejected": -50.84836959838867, "loss": 0.6093093752861023, "memory(GiB)": 46.1, "nll_loss": 0.4111699163913727, "rewards/accuracies": 0.9375, "rewards/chosen": 0.2717169523239136, "rewards/margins": 3.6485066413879395, "rewards/rejected": -3.3767895698547363, "step": 317, "train_speed(iter/s)": 0.007987 }, { "epoch": 0.7052463788204311, "grad_norm": 1.8486236333847046, "learning_rate": 0.00015376869189660783, "logits/chosen": -0.9767893552780151, "logits/rejected": -1.0699020624160767, "logps/chosen": -5.003157138824463, "logps/rejected": -61.613548278808594, "loss": 0.38953274488449097, "memory(GiB)": 46.1, "nll_loss": 0.2612164616584778, "rewards/accuracies": 0.96875, "rewards/chosen": 0.32774925231933594, "rewards/margins": 4.157557010650635, "rewards/rejected": -3.829807758331299, "step": 318, "train_speed(iter/s)": 0.007988 }, { "epoch": 0.7074641347286714, "grad_norm": 2.2850542068481445, "learning_rate": 0.00015345852649181556, "logits/chosen": -1.0067814588546753, "logits/rejected": -1.055223822593689, "logps/chosen": -9.41201114654541, "logps/rejected": -69.31196594238281, "loss": 0.47490939497947693, "memory(GiB)": 46.1, "nll_loss": 0.344195693731308, "rewards/accuracies": 0.90625, "rewards/chosen": 0.29239606857299805, "rewards/margins": 5.051109790802002, "rewards/rejected": -4.7587127685546875, "step": 319, "train_speed(iter/s)": 0.007989 }, { "epoch": 0.7096818906369118, "grad_norm": 2.4990978240966797, "learning_rate": 0.0001531476393416456, "logits/chosen": -1.0527924299240112, "logits/rejected": -1.0691872835159302, "logps/chosen": -8.629197120666504, "logps/rejected": -52.35713195800781, "loss": 0.5260642766952515, "memory(GiB)": 46.1, "nll_loss": 0.3726637661457062, "rewards/accuracies": 0.9375, "rewards/chosen": 0.46037670969963074, "rewards/margins": 3.889458656311035, "rewards/rejected": -3.429081916809082, "step": 320, "train_speed(iter/s)": 0.00799 }, { "epoch": 0.7118996465451521, "grad_norm": 2.756251096725464, "learning_rate": 0.0001528360346433959, "logits/chosen": -1.0590455532073975, "logits/rejected": -1.1003897190093994, "logps/chosen": -9.220525741577148, "logps/rejected": -66.90814971923828, "loss": 0.5508866906166077, "memory(GiB)": 46.1, "nll_loss": 0.43441012501716614, "rewards/accuracies": 0.90625, "rewards/chosen": 0.4031120538711548, "rewards/margins": 5.307968616485596, "rewards/rejected": -4.904856204986572, "step": 321, "train_speed(iter/s)": 0.007989 }, { "epoch": 0.7141174024533925, "grad_norm": 8.120321273803711, "learning_rate": 0.00015252371660405203, "logits/chosen": -1.045861005783081, "logits/rejected": -1.072197437286377, "logps/chosen": -8.183548927307129, "logps/rejected": -55.87236404418945, "loss": 0.5517191290855408, "memory(GiB)": 46.1, "nll_loss": 0.4383443593978882, "rewards/accuracies": 0.96875, "rewards/chosen": 0.5038261413574219, "rewards/margins": 4.238821983337402, "rewards/rejected": -3.7349960803985596, "step": 322, "train_speed(iter/s)": 0.00799 }, { "epoch": 0.7163351583616329, "grad_norm": 5.439812660217285, "learning_rate": 0.00015221068944023047, "logits/chosen": -0.9942280650138855, "logits/rejected": -1.0908329486846924, "logps/chosen": -4.599414348602295, "logps/rejected": -86.45954895019531, "loss": 0.5564896464347839, "memory(GiB)": 46.1, "nll_loss": 0.3748651444911957, "rewards/accuracies": 0.9375, "rewards/chosen": 0.21072176098823547, "rewards/margins": 6.380655288696289, "rewards/rejected": -6.169933319091797, "step": 323, "train_speed(iter/s)": 0.00799 }, { "epoch": 0.7185529142698732, "grad_norm": 2.908318519592285, "learning_rate": 0.00015189695737812152, "logits/chosen": -1.0733102560043335, "logits/rejected": -1.11064875125885, "logps/chosen": -7.096078872680664, "logps/rejected": -77.15171813964844, "loss": 0.41845327615737915, "memory(GiB)": 46.1, "nll_loss": 0.3608825206756592, "rewards/accuracies": 1.0, "rewards/chosen": 0.2574445605278015, "rewards/margins": 5.614250659942627, "rewards/rejected": -5.356806755065918, "step": 324, "train_speed(iter/s)": 0.00799 }, { "epoch": 0.7207706701781135, "grad_norm": 2.001560688018799, "learning_rate": 0.00015158252465343242, "logits/chosen": -1.0531553030014038, "logits/rejected": -1.0946694612503052, "logps/chosen": -8.788086891174316, "logps/rejected": -50.299198150634766, "loss": 0.5263574123382568, "memory(GiB)": 46.1, "nll_loss": 0.35159769654273987, "rewards/accuracies": 1.0, "rewards/chosen": 0.39179500937461853, "rewards/margins": 3.5899038314819336, "rewards/rejected": -3.198108673095703, "step": 325, "train_speed(iter/s)": 0.007989 }, { "epoch": 0.7229884260863538, "grad_norm": 2.0563783645629883, "learning_rate": 0.00015126739551132997, "logits/chosen": -0.9845147132873535, "logits/rejected": -1.024277687072754, "logps/chosen": -6.742694854736328, "logps/rejected": -66.78865051269531, "loss": 0.5805354714393616, "memory(GiB)": 46.1, "nll_loss": 0.4498131275177002, "rewards/accuracies": 0.96875, "rewards/chosen": 0.45866793394088745, "rewards/margins": 4.89275598526001, "rewards/rejected": -4.434087753295898, "step": 326, "train_speed(iter/s)": 0.007988 }, { "epoch": 0.7252061819945942, "grad_norm": 2.4432246685028076, "learning_rate": 0.00015095157420638348, "logits/chosen": -0.982561469078064, "logits/rejected": -1.0583231449127197, "logps/chosen": -3.3377718925476074, "logps/rejected": -73.46272277832031, "loss": 0.3824958801269531, "memory(GiB)": 46.1, "nll_loss": 0.25690242648124695, "rewards/accuracies": 0.9375, "rewards/chosen": 0.2936461567878723, "rewards/margins": 5.495882511138916, "rewards/rejected": -5.202236652374268, "step": 327, "train_speed(iter/s)": 0.007988 }, { "epoch": 0.7274239379028345, "grad_norm": 3.9595139026641846, "learning_rate": 0.00015063506500250708, "logits/chosen": -1.0502831935882568, "logits/rejected": -1.1004114151000977, "logps/chosen": -8.691965103149414, "logps/rejected": -71.41580200195312, "loss": 0.44681987166404724, "memory(GiB)": 46.1, "nll_loss": 0.31214770674705505, "rewards/accuracies": 0.96875, "rewards/chosen": 0.22634059190750122, "rewards/margins": 5.629345893859863, "rewards/rejected": -5.403005599975586, "step": 328, "train_speed(iter/s)": 0.007988 }, { "epoch": 0.7296416938110749, "grad_norm": 3.618638038635254, "learning_rate": 0.0001503178721729022, "logits/chosen": -1.021295428276062, "logits/rejected": -1.098530888557434, "logps/chosen": -8.527656555175781, "logps/rejected": -69.10211944580078, "loss": 0.6168586015701294, "memory(GiB)": 46.1, "nll_loss": 0.5225605964660645, "rewards/accuracies": 0.96875, "rewards/chosen": 0.42750608921051025, "rewards/margins": 5.383771896362305, "rewards/rejected": -4.956265449523926, "step": 329, "train_speed(iter/s)": 0.007987 }, { "epoch": 0.7318594497193153, "grad_norm": 17.75547218322754, "learning_rate": 0.00015000000000000001, "logits/chosen": -1.089531660079956, "logits/rejected": -1.162044644355774, "logps/chosen": -7.145535469055176, "logps/rejected": -97.1467514038086, "loss": 0.8052725195884705, "memory(GiB)": 46.1, "nll_loss": 0.6069628596305847, "rewards/accuracies": 0.96875, "rewards/chosen": 0.16202522814273834, "rewards/margins": 7.54561185836792, "rewards/rejected": -7.383586883544922, "step": 330, "train_speed(iter/s)": 0.007988 }, { "epoch": 0.7340772056275556, "grad_norm": 7.715478420257568, "learning_rate": 0.0001496814527754035, "logits/chosen": -1.021614670753479, "logits/rejected": -1.1059943437576294, "logps/chosen": -4.589797496795654, "logps/rejected": -98.64924621582031, "loss": 0.4247751235961914, "memory(GiB)": 46.1, "nll_loss": 0.2338293045759201, "rewards/accuracies": 0.96875, "rewards/chosen": 0.14829346537590027, "rewards/margins": 7.475074768066406, "rewards/rejected": -7.326781272888184, "step": 331, "train_speed(iter/s)": 0.007987 }, { "epoch": 0.736294961535796, "grad_norm": 5.703808784484863, "learning_rate": 0.00014936223479982953, "logits/chosen": -1.0938533544540405, "logits/rejected": -1.1311089992523193, "logps/chosen": -10.840590476989746, "logps/rejected": -83.04175567626953, "loss": 1.1042178869247437, "memory(GiB)": 46.1, "nll_loss": 0.72503662109375, "rewards/accuracies": 0.875, "rewards/chosen": 0.027026668190956116, "rewards/margins": 6.462612628936768, "rewards/rejected": -6.435585975646973, "step": 332, "train_speed(iter/s)": 0.007988 }, { "epoch": 0.7385127174440363, "grad_norm": 3.51871657371521, "learning_rate": 0.00014904235038305083, "logits/chosen": -1.0023188591003418, "logits/rejected": -1.0812650918960571, "logps/chosen": -9.990187644958496, "logps/rejected": -82.44390869140625, "loss": 0.4421953558921814, "memory(GiB)": 46.1, "nll_loss": 0.3568181097507477, "rewards/accuracies": 0.96875, "rewards/chosen": 0.3243933320045471, "rewards/margins": 6.271053791046143, "rewards/rejected": -5.94666051864624, "step": 333, "train_speed(iter/s)": 0.007988 }, { "epoch": 0.7407304733522767, "grad_norm": 2.359330654144287, "learning_rate": 0.00014872180384383773, "logits/chosen": -1.0005170106887817, "logits/rejected": -1.0614187717437744, "logps/chosen": -4.916748046875, "logps/rejected": -84.43028259277344, "loss": 0.5017070770263672, "memory(GiB)": 46.1, "nll_loss": 0.25003811717033386, "rewards/accuracies": 0.90625, "rewards/chosen": 0.17200681567192078, "rewards/margins": 5.694801330566406, "rewards/rejected": -5.522794246673584, "step": 334, "train_speed(iter/s)": 0.007987 }, { "epoch": 0.7429482292605171, "grad_norm": 2.417720317840576, "learning_rate": 0.0001484005995098999, "logits/chosen": -0.9173535108566284, "logits/rejected": -0.9738480448722839, "logps/chosen": -7.978065490722656, "logps/rejected": -52.23478317260742, "loss": 0.5884492993354797, "memory(GiB)": 46.1, "nll_loss": 0.3843919336795807, "rewards/accuracies": 0.9375, "rewards/chosen": 0.414502888917923, "rewards/margins": 3.7098348140716553, "rewards/rejected": -3.2953319549560547, "step": 335, "train_speed(iter/s)": 0.007989 }, { "epoch": 0.7451659851687573, "grad_norm": 5.175177097320557, "learning_rate": 0.00014807874171782795, "logits/chosen": -0.9095063209533691, "logits/rejected": -0.9394166469573975, "logps/chosen": -5.037604808807373, "logps/rejected": -48.952796936035156, "loss": 0.7686702013015747, "memory(GiB)": 46.1, "nll_loss": 0.5135473608970642, "rewards/accuracies": 0.84375, "rewards/chosen": 0.2529716193675995, "rewards/margins": 3.3015551567077637, "rewards/rejected": -3.0485832691192627, "step": 336, "train_speed(iter/s)": 0.00799 }, { "epoch": 0.7473837410769977, "grad_norm": 1.4395772218704224, "learning_rate": 0.00014775623481303487, "logits/chosen": -0.8478690981864929, "logits/rejected": -0.9579203128814697, "logps/chosen": -3.3176069259643555, "logps/rejected": -75.16621398925781, "loss": 0.25232070684432983, "memory(GiB)": 46.1, "nll_loss": 0.18015892803668976, "rewards/accuracies": 1.0, "rewards/chosen": 0.33292415738105774, "rewards/margins": 5.303890705108643, "rewards/rejected": -4.970966339111328, "step": 337, "train_speed(iter/s)": 0.007991 }, { "epoch": 0.749601496985238, "grad_norm": 4.6426920890808105, "learning_rate": 0.0001474330831496973, "logits/chosen": -0.8614159822463989, "logits/rejected": -0.8955745697021484, "logps/chosen": -7.800498962402344, "logps/rejected": -50.34724807739258, "loss": 0.5634305477142334, "memory(GiB)": 46.1, "nll_loss": 0.3574722111225128, "rewards/accuracies": 0.84375, "rewards/chosen": 0.1773032397031784, "rewards/margins": 3.574413776397705, "rewards/rejected": -3.3971107006073, "step": 338, "train_speed(iter/s)": 0.007992 }, { "epoch": 0.7518192528934784, "grad_norm": 2.0889782905578613, "learning_rate": 0.00014710929109069674, "logits/chosen": -0.8648290038108826, "logits/rejected": -0.9016939997673035, "logps/chosen": -9.325538635253906, "logps/rejected": -54.02799987792969, "loss": 0.5422332882881165, "memory(GiB)": 46.1, "nll_loss": 0.38347160816192627, "rewards/accuracies": 0.9375, "rewards/chosen": 0.4468119144439697, "rewards/margins": 3.857147693634033, "rewards/rejected": -3.4103355407714844, "step": 339, "train_speed(iter/s)": 0.007993 }, { "epoch": 0.7540370088017188, "grad_norm": 1.8795205354690552, "learning_rate": 0.0001467848630075608, "logits/chosen": -0.8260731101036072, "logits/rejected": -0.8987483382225037, "logps/chosen": -8.172541618347168, "logps/rejected": -68.80128479003906, "loss": 0.42829784750938416, "memory(GiB)": 46.1, "nll_loss": 0.33098679780960083, "rewards/accuracies": 1.0, "rewards/chosen": 0.463642418384552, "rewards/margins": 4.9933061599731445, "rewards/rejected": -4.5296630859375, "step": 340, "train_speed(iter/s)": 0.007992 }, { "epoch": 0.7562547647099591, "grad_norm": 1.8088308572769165, "learning_rate": 0.00014645980328040401, "logits/chosen": -0.83375483751297, "logits/rejected": -0.9051945805549622, "logps/chosen": -8.962587356567383, "logps/rejected": -55.46277618408203, "loss": 0.5223706364631653, "memory(GiB)": 46.1, "nll_loss": 0.3683018684387207, "rewards/accuracies": 0.96875, "rewards/chosen": 0.4433327615261078, "rewards/margins": 4.030201435089111, "rewards/rejected": -3.5868687629699707, "step": 341, "train_speed(iter/s)": 0.007994 }, { "epoch": 0.7584725206181995, "grad_norm": 1.6160343885421753, "learning_rate": 0.0001461341162978688, "logits/chosen": -0.8449936509132385, "logits/rejected": -0.921272873878479, "logps/chosen": -7.773403167724609, "logps/rejected": -82.05076599121094, "loss": 0.3855322301387787, "memory(GiB)": 46.1, "nll_loss": 0.3014349937438965, "rewards/accuracies": 1.0, "rewards/chosen": 0.3078088164329529, "rewards/margins": 5.843523025512695, "rewards/rejected": -5.535714626312256, "step": 342, "train_speed(iter/s)": 0.007995 }, { "epoch": 0.7606902765264398, "grad_norm": 2.3332436084747314, "learning_rate": 0.0001458078064570661, "logits/chosen": -0.865425705909729, "logits/rejected": -0.9039071202278137, "logps/chosen": -6.671085834503174, "logps/rejected": -74.30247497558594, "loss": 0.4341945946216583, "memory(GiB)": 46.1, "nll_loss": 0.3516058623790741, "rewards/accuracies": 0.96875, "rewards/chosen": 0.6183019876480103, "rewards/margins": 5.456951141357422, "rewards/rejected": -4.838649749755859, "step": 343, "train_speed(iter/s)": 0.007995 }, { "epoch": 0.7629080324346802, "grad_norm": 2.2075419425964355, "learning_rate": 0.00014548087816351616, "logits/chosen": -0.8886226415634155, "logits/rejected": -0.9319683313369751, "logps/chosen": -7.503270626068115, "logps/rejected": -69.36604309082031, "loss": 0.5470494627952576, "memory(GiB)": 46.1, "nll_loss": 0.40474218130111694, "rewards/accuracies": 0.9375, "rewards/chosen": 0.2907697558403015, "rewards/margins": 5.133359909057617, "rewards/rejected": -4.84259033203125, "step": 344, "train_speed(iter/s)": 0.007995 }, { "epoch": 0.7651257883429206, "grad_norm": 5.5458197593688965, "learning_rate": 0.00014515333583108896, "logits/chosen": -0.8889970779418945, "logits/rejected": -0.9374210834503174, "logps/chosen": -6.389466285705566, "logps/rejected": -64.43991088867188, "loss": 0.5072943568229675, "memory(GiB)": 46.1, "nll_loss": 0.3807336986064911, "rewards/accuracies": 0.9375, "rewards/chosen": 0.6497054100036621, "rewards/margins": 5.243303298950195, "rewards/rejected": -4.593598365783691, "step": 345, "train_speed(iter/s)": 0.007995 }, { "epoch": 0.7673435442511608, "grad_norm": 3.809356212615967, "learning_rate": 0.00014482518388194457, "logits/chosen": -0.850013792514801, "logits/rejected": -0.8974230289459229, "logps/chosen": -5.620848655700684, "logps/rejected": -72.27090454101562, "loss": 0.6183085441589355, "memory(GiB)": 46.1, "nll_loss": 0.444873571395874, "rewards/accuracies": 0.875, "rewards/chosen": 0.4231736660003662, "rewards/margins": 5.374911308288574, "rewards/rejected": -4.951737403869629, "step": 346, "train_speed(iter/s)": 0.007995 }, { "epoch": 0.7695613001594012, "grad_norm": 5.957520961761475, "learning_rate": 0.00014449642674647367, "logits/chosen": -0.903602659702301, "logits/rejected": -0.9699824452400208, "logps/chosen": -6.9516706466674805, "logps/rejected": -66.93140411376953, "loss": 0.4030936360359192, "memory(GiB)": 46.1, "nll_loss": 0.27591440081596375, "rewards/accuracies": 0.9375, "rewards/chosen": 0.5947475433349609, "rewards/margins": 4.9736480712890625, "rewards/rejected": -4.378900527954102, "step": 347, "train_speed(iter/s)": 0.007996 }, { "epoch": 0.7717790560676415, "grad_norm": 7.984817981719971, "learning_rate": 0.0001441670688632374, "logits/chosen": -0.9703332185745239, "logits/rejected": -0.9999107718467712, "logps/chosen": -13.621354103088379, "logps/rejected": -54.89396667480469, "loss": 0.8680185079574585, "memory(GiB)": 46.1, "nll_loss": 0.472337007522583, "rewards/accuracies": 0.8125, "rewards/chosen": 0.08581960201263428, "rewards/margins": 3.7399158477783203, "rewards/rejected": -3.6540961265563965, "step": 348, "train_speed(iter/s)": 0.007996 }, { "epoch": 0.7739968119758819, "grad_norm": 3.5452890396118164, "learning_rate": 0.00014383711467890774, "logits/chosen": -0.9808631539344788, "logits/rejected": -1.0241118669509888, "logps/chosen": -6.2970123291015625, "logps/rejected": -57.30949783325195, "loss": 0.5067135691642761, "memory(GiB)": 46.1, "nll_loss": 0.34234529733657837, "rewards/accuracies": 0.9375, "rewards/chosen": 0.4528099000453949, "rewards/margins": 4.415470123291016, "rewards/rejected": -3.962660789489746, "step": 349, "train_speed(iter/s)": 0.007995 }, { "epoch": 0.7762145678841222, "grad_norm": 2.270117998123169, "learning_rate": 0.00014350656864820733, "logits/chosen": -0.8902170062065125, "logits/rejected": -0.9376388192176819, "logps/chosen": -6.128102779388428, "logps/rejected": -84.18601989746094, "loss": 0.3887496292591095, "memory(GiB)": 46.1, "nll_loss": 0.29120758175849915, "rewards/accuracies": 1.0, "rewards/chosen": 0.410897433757782, "rewards/margins": 6.373892784118652, "rewards/rejected": -5.9629950523376465, "step": 350, "train_speed(iter/s)": 0.007995 }, { "epoch": 0.7784323237923626, "grad_norm": 1.537272334098816, "learning_rate": 0.00014317543523384928, "logits/chosen": -0.8935893177986145, "logits/rejected": -0.9689089059829712, "logps/chosen": -9.015190124511719, "logps/rejected": -72.697265625, "loss": 0.3616684079170227, "memory(GiB)": 46.1, "nll_loss": 0.26947712898254395, "rewards/accuracies": 1.0, "rewards/chosen": 0.5364948511123657, "rewards/margins": 5.098753929138184, "rewards/rejected": -4.562259197235107, "step": 351, "train_speed(iter/s)": 0.007992 }, { "epoch": 0.780650079700603, "grad_norm": 8.092968940734863, "learning_rate": 0.00014284371890647713, "logits/chosen": -0.9558290243148804, "logits/rejected": -0.9736660718917847, "logps/chosen": -9.879434585571289, "logps/rejected": -67.37289428710938, "loss": 0.5441817045211792, "memory(GiB)": 46.1, "nll_loss": 0.4073256552219391, "rewards/accuracies": 0.9375, "rewards/chosen": 0.2747573256492615, "rewards/margins": 4.777169227600098, "rewards/rejected": -4.502411842346191, "step": 352, "train_speed(iter/s)": 0.007992 }, { "epoch": 0.7828678356088433, "grad_norm": 2.3354103565216064, "learning_rate": 0.00014251142414460415, "logits/chosen": -0.9495961666107178, "logits/rejected": -1.0119011402130127, "logps/chosen": -7.465116500854492, "logps/rejected": -69.65184020996094, "loss": 0.40892308950424194, "memory(GiB)": 46.1, "nll_loss": 0.31010234355926514, "rewards/accuracies": 0.96875, "rewards/chosen": 0.29755479097366333, "rewards/margins": 5.3398756980896, "rewards/rejected": -5.042320728302002, "step": 353, "train_speed(iter/s)": 0.007993 }, { "epoch": 0.7850855915170837, "grad_norm": 3.8496086597442627, "learning_rate": 0.00014217855543455322, "logits/chosen": -0.9601128101348877, "logits/rejected": -0.9981716275215149, "logps/chosen": -6.954006195068359, "logps/rejected": -58.822914123535156, "loss": 0.6071369051933289, "memory(GiB)": 46.1, "nll_loss": 0.4900137186050415, "rewards/accuracies": 0.96875, "rewards/chosen": 0.032600052654743195, "rewards/margins": 4.149467945098877, "rewards/rejected": -4.116868019104004, "step": 354, "train_speed(iter/s)": 0.007992 }, { "epoch": 0.787303347425324, "grad_norm": 1.835015058517456, "learning_rate": 0.00014184511727039612, "logits/chosen": -1.031874656677246, "logits/rejected": -1.0789393186569214, "logps/chosen": -4.562386989593506, "logps/rejected": -66.75709533691406, "loss": 0.35645246505737305, "memory(GiB)": 46.1, "nll_loss": 0.2355533242225647, "rewards/accuracies": 0.96875, "rewards/chosen": 0.36652734875679016, "rewards/margins": 4.739514350891113, "rewards/rejected": -4.372987747192383, "step": 355, "train_speed(iter/s)": 0.007991 }, { "epoch": 0.7895211033335644, "grad_norm": 9.796154022216797, "learning_rate": 0.00014151111415389273, "logits/chosen": -0.9901955127716064, "logits/rejected": -1.027661919593811, "logps/chosen": -5.177408218383789, "logps/rejected": -83.82344055175781, "loss": 0.6649367809295654, "memory(GiB)": 46.1, "nll_loss": 0.5719815492630005, "rewards/accuracies": 0.96875, "rewards/chosen": 0.32677945494651794, "rewards/margins": 6.3124799728393555, "rewards/rejected": -5.985701084136963, "step": 356, "train_speed(iter/s)": 0.00799 }, { "epoch": 0.7917388592418046, "grad_norm": 4.476024150848389, "learning_rate": 0.0001411765505944305, "logits/chosen": -0.9815511703491211, "logits/rejected": -1.0286136865615845, "logps/chosen": -9.594337463378906, "logps/rejected": -65.8331069946289, "loss": 0.6891093850135803, "memory(GiB)": 46.1, "nll_loss": 0.4483054280281067, "rewards/accuracies": 0.875, "rewards/chosen": 0.20106908679008484, "rewards/margins": 4.649129867553711, "rewards/rejected": -4.448061466217041, "step": 357, "train_speed(iter/s)": 0.007991 }, { "epoch": 0.793956615150045, "grad_norm": 6.72329568862915, "learning_rate": 0.00014084143110896336, "logits/chosen": -0.9816399216651917, "logits/rejected": -1.0880467891693115, "logps/chosen": -10.076456069946289, "logps/rejected": -96.55436706542969, "loss": 0.5759286284446716, "memory(GiB)": 46.1, "nll_loss": 0.42951053380966187, "rewards/accuracies": 0.90625, "rewards/chosen": 0.3208717703819275, "rewards/margins": 6.648129463195801, "rewards/rejected": -6.3272576332092285, "step": 358, "train_speed(iter/s)": 0.00799 }, { "epoch": 0.7961743710582854, "grad_norm": 1.4733343124389648, "learning_rate": 0.00014050576022195084, "logits/chosen": -0.9938861131668091, "logits/rejected": -1.1024624109268188, "logps/chosen": -5.6730475425720215, "logps/rejected": -96.65937805175781, "loss": 0.3570317029953003, "memory(GiB)": 46.1, "nll_loss": 0.3157106339931488, "rewards/accuracies": 0.96875, "rewards/chosen": 0.35878437757492065, "rewards/margins": 7.850948333740234, "rewards/rejected": -7.49216365814209, "step": 359, "train_speed(iter/s)": 0.007993 }, { "epoch": 0.7983921269665257, "grad_norm": 6.765986919403076, "learning_rate": 0.00014016954246529696, "logits/chosen": -0.9971696138381958, "logits/rejected": -1.03761887550354, "logps/chosen": -7.510034561157227, "logps/rejected": -73.65198516845703, "loss": 0.46261534094810486, "memory(GiB)": 46.1, "nll_loss": 0.3362881541252136, "rewards/accuracies": 0.96875, "rewards/chosen": 0.27089494466781616, "rewards/margins": 5.386101245880127, "rewards/rejected": -5.115205764770508, "step": 360, "train_speed(iter/s)": 0.007993 }, { "epoch": 0.8006098828747661, "grad_norm": 7.017738342285156, "learning_rate": 0.00013983278237828905, "logits/chosen": -0.9837071299552917, "logits/rejected": -1.0181175470352173, "logps/chosen": -8.63487434387207, "logps/rejected": -83.47882843017578, "loss": 0.44132688641548157, "memory(GiB)": 46.1, "nll_loss": 0.3716186285018921, "rewards/accuracies": 1.0, "rewards/chosen": 0.41110920906066895, "rewards/margins": 6.7674946784973145, "rewards/rejected": -6.356384754180908, "step": 361, "train_speed(iter/s)": 0.007992 }, { "epoch": 0.8028276387830064, "grad_norm": 8.974201202392578, "learning_rate": 0.00013949548450753645, "logits/chosen": -0.9519540071487427, "logits/rejected": -1.0129084587097168, "logps/chosen": -5.2814507484436035, "logps/rejected": -72.11774444580078, "loss": 0.5307304859161377, "memory(GiB)": 46.1, "nll_loss": 0.4160841703414917, "rewards/accuracies": 0.9375, "rewards/chosen": 0.4031183123588562, "rewards/margins": 5.740135669708252, "rewards/rejected": -5.337017059326172, "step": 362, "train_speed(iter/s)": 0.007993 }, { "epoch": 0.8050453946912468, "grad_norm": 1.2695608139038086, "learning_rate": 0.00013915765340690917, "logits/chosen": -1.0254669189453125, "logits/rejected": -1.0584160089492798, "logps/chosen": -4.022584915161133, "logps/rejected": -76.5419692993164, "loss": 0.25830894708633423, "memory(GiB)": 46.1, "nll_loss": 0.15799354016780853, "rewards/accuracies": 0.9375, "rewards/chosen": 0.4456513822078705, "rewards/margins": 6.39218807220459, "rewards/rejected": -5.946537494659424, "step": 363, "train_speed(iter/s)": 0.007992 }, { "epoch": 0.8072631505994872, "grad_norm": 3.4139556884765625, "learning_rate": 0.00013881929363747627, "logits/chosen": -0.9054716229438782, "logits/rejected": -0.9829826951026917, "logps/chosen": -6.469770908355713, "logps/rejected": -81.60964965820312, "loss": 0.3816515803337097, "memory(GiB)": 46.1, "nll_loss": 0.2315388023853302, "rewards/accuracies": 0.96875, "rewards/chosen": 0.23071371018886566, "rewards/margins": 5.678869724273682, "rewards/rejected": -5.448155403137207, "step": 364, "train_speed(iter/s)": 0.007992 }, { "epoch": 0.8094809065077275, "grad_norm": 2.8562862873077393, "learning_rate": 0.00013848040976744457, "logits/chosen": -0.9915538430213928, "logits/rejected": -1.0249900817871094, "logps/chosen": -11.345012664794922, "logps/rejected": -60.174583435058594, "loss": 0.6162142753601074, "memory(GiB)": 46.1, "nll_loss": 0.5174874663352966, "rewards/accuracies": 0.96875, "rewards/chosen": 0.4874635338783264, "rewards/margins": 4.736081600189209, "rewards/rejected": -4.248618125915527, "step": 365, "train_speed(iter/s)": 0.007993 }, { "epoch": 0.8116986624159679, "grad_norm": 11.424062728881836, "learning_rate": 0.0001381410063720966, "logits/chosen": -0.885972261428833, "logits/rejected": -0.9483691453933716, "logps/chosen": -6.95948600769043, "logps/rejected": -67.90422821044922, "loss": 0.48116442561149597, "memory(GiB)": 46.1, "nll_loss": 0.3793320059776306, "rewards/accuracies": 0.96875, "rewards/chosen": 0.4664710462093353, "rewards/margins": 5.4724249839782715, "rewards/rejected": -5.005953788757324, "step": 366, "train_speed(iter/s)": 0.007993 }, { "epoch": 0.8139164183242082, "grad_norm": 2.13146710395813, "learning_rate": 0.00013780108803372916, "logits/chosen": -0.9675875902175903, "logits/rejected": -1.0174977779388428, "logps/chosen": -2.7178149223327637, "logps/rejected": -57.41184616088867, "loss": 0.2717885971069336, "memory(GiB)": 46.1, "nll_loss": 0.17145709693431854, "rewards/accuracies": 0.9375, "rewards/chosen": 0.41647231578826904, "rewards/margins": 4.505980968475342, "rewards/rejected": -4.089508533477783, "step": 367, "train_speed(iter/s)": 0.007993 }, { "epoch": 0.8161341742324485, "grad_norm": 2.014505386352539, "learning_rate": 0.00013746065934159123, "logits/chosen": -0.8749208450317383, "logits/rejected": -0.9097785949707031, "logps/chosen": -11.590734481811523, "logps/rejected": -61.093849182128906, "loss": 0.4811657667160034, "memory(GiB)": 46.1, "nll_loss": 0.4215659201145172, "rewards/accuracies": 1.0, "rewards/chosen": 0.5911797285079956, "rewards/margins": 4.6354546546936035, "rewards/rejected": -4.044274806976318, "step": 368, "train_speed(iter/s)": 0.007995 }, { "epoch": 0.8183519301406889, "grad_norm": 6.679834365844727, "learning_rate": 0.00013711972489182208, "logits/chosen": -0.9587826728820801, "logits/rejected": -0.9994091391563416, "logps/chosen": -4.139106273651123, "logps/rejected": -51.25725555419922, "loss": 0.5976202487945557, "memory(GiB)": 46.1, "nll_loss": 0.45815497636795044, "rewards/accuracies": 0.96875, "rewards/chosen": 0.4207558035850525, "rewards/margins": 4.1789679527282715, "rewards/rejected": -3.7582123279571533, "step": 369, "train_speed(iter/s)": 0.007995 }, { "epoch": 0.8205696860489292, "grad_norm": 4.250732421875, "learning_rate": 0.00013677828928738934, "logits/chosen": -0.8436453938484192, "logits/rejected": -0.9403105974197388, "logps/chosen": -8.053564071655273, "logps/rejected": -84.89209747314453, "loss": 0.6519731283187866, "memory(GiB)": 46.1, "nll_loss": 0.5838944911956787, "rewards/accuracies": 0.96875, "rewards/chosen": 0.6696658134460449, "rewards/margins": 7.059585094451904, "rewards/rejected": -6.389919757843018, "step": 370, "train_speed(iter/s)": 0.007996 }, { "epoch": 0.8227874419571696, "grad_norm": 3.9205992221832275, "learning_rate": 0.0001364363571380266, "logits/chosen": -0.955507755279541, "logits/rejected": -1.0599405765533447, "logps/chosen": -7.400586128234863, "logps/rejected": -74.92298889160156, "loss": 0.5989251732826233, "memory(GiB)": 46.1, "nll_loss": 0.5146618485450745, "rewards/accuracies": 0.96875, "rewards/chosen": 0.4105219542980194, "rewards/margins": 5.604883670806885, "rewards/rejected": -5.194361686706543, "step": 371, "train_speed(iter/s)": 0.007997 }, { "epoch": 0.8250051978654099, "grad_norm": 4.548377990722656, "learning_rate": 0.0001360939330601715, "logits/chosen": -0.9952760934829712, "logits/rejected": -1.0298787355422974, "logps/chosen": -6.161623477935791, "logps/rejected": -78.73953247070312, "loss": 0.5819877982139587, "memory(GiB)": 46.1, "nll_loss": 0.4920639097690582, "rewards/accuracies": 0.96875, "rewards/chosen": 0.07609675824642181, "rewards/margins": 5.800478935241699, "rewards/rejected": -5.724382400512695, "step": 372, "train_speed(iter/s)": 0.007996 }, { "epoch": 0.8272229537736503, "grad_norm": 1.8827123641967773, "learning_rate": 0.000135751021676903, "logits/chosen": -0.8674598336219788, "logits/rejected": -0.9275334477424622, "logps/chosen": -5.713299751281738, "logps/rejected": -87.57781219482422, "loss": 0.379931777715683, "memory(GiB)": 46.1, "nll_loss": 0.3211643397808075, "rewards/accuracies": 1.0, "rewards/chosen": 0.21036267280578613, "rewards/margins": 6.820375442504883, "rewards/rejected": -6.610012531280518, "step": 373, "train_speed(iter/s)": 0.007996 }, { "epoch": 0.8294407096818907, "grad_norm": 3.5420541763305664, "learning_rate": 0.00013540762761787937, "logits/chosen": -1.0363105535507202, "logits/rejected": -1.0776422023773193, "logps/chosen": -13.957275390625, "logps/rejected": -76.94481658935547, "loss": 0.5567349195480347, "memory(GiB)": 46.1, "nll_loss": 0.45086780190467834, "rewards/accuracies": 0.9375, "rewards/chosen": 0.28840070962905884, "rewards/margins": 5.7179765701293945, "rewards/rejected": -5.4295759201049805, "step": 374, "train_speed(iter/s)": 0.007996 }, { "epoch": 0.831658465590131, "grad_norm": 1.7102012634277344, "learning_rate": 0.00013506375551927547, "logits/chosen": -0.9630483388900757, "logits/rejected": -1.0484064817428589, "logps/chosen": -8.863858222961426, "logps/rejected": -87.95539093017578, "loss": 0.48169463872909546, "memory(GiB)": 46.1, "nll_loss": 0.3565702438354492, "rewards/accuracies": 0.9375, "rewards/chosen": 0.33859264850616455, "rewards/margins": 6.4991984367370605, "rewards/rejected": -6.160606384277344, "step": 375, "train_speed(iter/s)": 0.007997 }, { "epoch": 0.8338762214983714, "grad_norm": 5.707740306854248, "learning_rate": 0.00013471941002372005, "logits/chosen": -0.9741328954696655, "logits/rejected": -1.0323518514633179, "logps/chosen": -6.637020111083984, "logps/rejected": -93.5245132446289, "loss": 0.38472601771354675, "memory(GiB)": 46.1, "nll_loss": 0.310046911239624, "rewards/accuracies": 0.96875, "rewards/chosen": 0.3390035629272461, "rewards/margins": 7.584478855133057, "rewards/rejected": -7.245475769042969, "step": 376, "train_speed(iter/s)": 0.007997 }, { "epoch": 0.8360939774066117, "grad_norm": 18.117982864379883, "learning_rate": 0.00013437459578023343, "logits/chosen": -0.9638034105300903, "logits/rejected": -1.0537152290344238, "logps/chosen": -9.010321617126465, "logps/rejected": -106.76775360107422, "loss": 0.5627694725990295, "memory(GiB)": 46.1, "nll_loss": 0.5133727788925171, "rewards/accuracies": 1.0, "rewards/chosen": 0.2734406590461731, "rewards/margins": 8.917407989501953, "rewards/rejected": -8.643967628479004, "step": 377, "train_speed(iter/s)": 0.007997 }, { "epoch": 0.838311733314852, "grad_norm": 10.60085678100586, "learning_rate": 0.00013402931744416433, "logits/chosen": -0.9089164137840271, "logits/rejected": -0.9688107967376709, "logps/chosen": -10.777193069458008, "logps/rejected": -84.58053588867188, "loss": 0.6482276916503906, "memory(GiB)": 46.1, "nll_loss": 0.5216525793075562, "rewards/accuracies": 0.9375, "rewards/chosen": 0.347297728061676, "rewards/margins": 6.164276123046875, "rewards/rejected": -5.816978454589844, "step": 378, "train_speed(iter/s)": 0.007998 }, { "epoch": 0.8405294892230923, "grad_norm": 6.294896602630615, "learning_rate": 0.00013368357967712726, "logits/chosen": -0.962710976600647, "logits/rejected": -1.038513422012329, "logps/chosen": -10.020147323608398, "logps/rejected": -88.00511169433594, "loss": 0.6880609393119812, "memory(GiB)": 46.1, "nll_loss": 0.5630819797515869, "rewards/accuracies": 0.90625, "rewards/chosen": 0.3197646141052246, "rewards/margins": 6.758570671081543, "rewards/rejected": -6.438806533813477, "step": 379, "train_speed(iter/s)": 0.007998 }, { "epoch": 0.8427472451313327, "grad_norm": 4.594664096832275, "learning_rate": 0.00013333738714693956, "logits/chosen": -0.9401661157608032, "logits/rejected": -0.9714579582214355, "logps/chosen": -9.314223289489746, "logps/rejected": -65.65319061279297, "loss": 0.5762234330177307, "memory(GiB)": 46.1, "nll_loss": 0.49913567304611206, "rewards/accuracies": 0.96875, "rewards/chosen": 0.4756416380405426, "rewards/margins": 5.191895961761475, "rewards/rejected": -4.716253757476807, "step": 380, "train_speed(iter/s)": 0.007997 }, { "epoch": 0.8449650010395731, "grad_norm": 9.826415061950684, "learning_rate": 0.0001329907445275583, "logits/chosen": -0.8897924423217773, "logits/rejected": -0.9633165597915649, "logps/chosen": -12.073375701904297, "logps/rejected": -73.02918243408203, "loss": 0.912665069103241, "memory(GiB)": 46.1, "nll_loss": 0.656974196434021, "rewards/accuracies": 0.96875, "rewards/chosen": 0.3072448968887329, "rewards/margins": 4.9169487953186035, "rewards/rejected": -4.609704494476318, "step": 381, "train_speed(iter/s)": 0.007996 }, { "epoch": 0.8471827569478134, "grad_norm": 2.968611001968384, "learning_rate": 0.00013264365649901723, "logits/chosen": -0.9875434637069702, "logits/rejected": -1.0535120964050293, "logps/chosen": -6.4254536628723145, "logps/rejected": -93.53910064697266, "loss": 0.4106255769729614, "memory(GiB)": 46.1, "nll_loss": 0.30968165397644043, "rewards/accuracies": 0.96875, "rewards/chosen": 0.5462108850479126, "rewards/margins": 7.555147647857666, "rewards/rejected": -7.008937358856201, "step": 382, "train_speed(iter/s)": 0.007996 }, { "epoch": 0.8494005128560538, "grad_norm": 2.7569844722747803, "learning_rate": 0.00013229612774736359, "logits/chosen": -0.9040098786354065, "logits/rejected": -0.911220908164978, "logps/chosen": -11.235910415649414, "logps/rejected": -46.86307144165039, "loss": 0.6170834898948669, "memory(GiB)": 46.1, "nll_loss": 0.40689852833747864, "rewards/accuracies": 0.90625, "rewards/chosen": 0.34967976808547974, "rewards/margins": 3.505056858062744, "rewards/rejected": -3.155377149581909, "step": 383, "train_speed(iter/s)": 0.007997 }, { "epoch": 0.8516182687642941, "grad_norm": 1.343916654586792, "learning_rate": 0.0001319481629645948, "logits/chosen": -0.8736822009086609, "logits/rejected": -0.9404423832893372, "logps/chosen": -1.9940882921218872, "logps/rejected": -73.57098388671875, "loss": 0.19009298086166382, "memory(GiB)": 46.1, "nll_loss": 0.15470954775810242, "rewards/accuracies": 1.0, "rewards/chosen": 0.34637439250946045, "rewards/margins": 5.987215518951416, "rewards/rejected": -5.640841007232666, "step": 384, "train_speed(iter/s)": 0.007996 }, { "epoch": 0.8538360246725345, "grad_norm": 3.7166006565093994, "learning_rate": 0.00013159976684859527, "logits/chosen": -0.9331986308097839, "logits/rejected": -0.9687966108322144, "logps/chosen": -4.263778209686279, "logps/rejected": -58.46650314331055, "loss": 0.6141018867492676, "memory(GiB)": 46.1, "nll_loss": 0.3756692707538605, "rewards/accuracies": 0.90625, "rewards/chosen": 0.18798117339611053, "rewards/margins": 4.480571746826172, "rewards/rejected": -4.292590141296387, "step": 385, "train_speed(iter/s)": 0.007996 }, { "epoch": 0.8560537805807749, "grad_norm": 2.7633893489837646, "learning_rate": 0.00013125094410307265, "logits/chosen": -0.8766888976097107, "logits/rejected": -0.9078878164291382, "logps/chosen": -11.883410453796387, "logps/rejected": -59.319793701171875, "loss": 0.6583555340766907, "memory(GiB)": 46.1, "nll_loss": 0.4740571677684784, "rewards/accuracies": 0.875, "rewards/chosen": 0.31328243017196655, "rewards/margins": 4.362224578857422, "rewards/rejected": -4.0489420890808105, "step": 386, "train_speed(iter/s)": 0.007997 }, { "epoch": 0.8582715364890152, "grad_norm": 1.7285346984863281, "learning_rate": 0.00013090169943749476, "logits/chosen": -0.9330658912658691, "logits/rejected": -0.9578065872192383, "logps/chosen": -8.566822052001953, "logps/rejected": -59.75345993041992, "loss": 0.4198892116546631, "memory(GiB)": 46.1, "nll_loss": 0.2942117750644684, "rewards/accuracies": 0.9375, "rewards/chosen": 0.5056283473968506, "rewards/margins": 4.707999229431152, "rewards/rejected": -4.202371120452881, "step": 387, "train_speed(iter/s)": 0.007997 }, { "epoch": 0.8604892923972556, "grad_norm": 3.06683349609375, "learning_rate": 0.0001305520375670256, "logits/chosen": -0.8998062014579773, "logits/rejected": -0.9751926064491272, "logps/chosen": -6.561751365661621, "logps/rejected": -78.16478729248047, "loss": 0.4542686939239502, "memory(GiB)": 46.1, "nll_loss": 0.3592434525489807, "rewards/accuracies": 0.96875, "rewards/chosen": 0.416767954826355, "rewards/margins": 6.343855381011963, "rewards/rejected": -5.927087783813477, "step": 388, "train_speed(iter/s)": 0.007998 }, { "epoch": 0.8627070483054958, "grad_norm": 2.2208168506622314, "learning_rate": 0.0001302019632124619, "logits/chosen": -0.9485350847244263, "logits/rejected": -1.0033212900161743, "logps/chosen": -4.072909355163574, "logps/rejected": -65.76300048828125, "loss": 0.42102301120758057, "memory(GiB)": 46.1, "nll_loss": 0.26937127113342285, "rewards/accuracies": 0.9375, "rewards/chosen": 0.5535694360733032, "rewards/margins": 5.2655839920043945, "rewards/rejected": -4.712014198303223, "step": 389, "train_speed(iter/s)": 0.007998 }, { "epoch": 0.8649248042137362, "grad_norm": 1.9687930345535278, "learning_rate": 0.00012985148110016947, "logits/chosen": -1.0221461057662964, "logits/rejected": -1.0833958387374878, "logps/chosen": -5.025339603424072, "logps/rejected": -82.09105682373047, "loss": 0.46604421734809875, "memory(GiB)": 46.1, "nll_loss": 0.3294580578804016, "rewards/accuracies": 0.9375, "rewards/chosen": 0.3730618953704834, "rewards/margins": 6.059564590454102, "rewards/rejected": -5.6865034103393555, "step": 390, "train_speed(iter/s)": 0.007999 }, { "epoch": 0.8671425601219765, "grad_norm": 3.648024559020996, "learning_rate": 0.0001295005959620191, "logits/chosen": -1.051031231880188, "logits/rejected": -1.0930334329605103, "logps/chosen": -8.805713653564453, "logps/rejected": -72.9891357421875, "loss": 0.5263576507568359, "memory(GiB)": 46.1, "nll_loss": 0.35741278529167175, "rewards/accuracies": 0.90625, "rewards/chosen": 0.3289564549922943, "rewards/margins": 5.768798351287842, "rewards/rejected": -5.439842224121094, "step": 391, "train_speed(iter/s)": 0.007999 }, { "epoch": 0.8693603160302169, "grad_norm": 3.0183286666870117, "learning_rate": 0.00012914931253532304, "logits/chosen": -1.0728670358657837, "logits/rejected": -1.1561932563781738, "logps/chosen": -7.894364833831787, "logps/rejected": -91.58610534667969, "loss": 0.5266696214675903, "memory(GiB)": 46.1, "nll_loss": 0.4139808118343353, "rewards/accuracies": 1.0, "rewards/chosen": 0.32448941469192505, "rewards/margins": 6.884645462036133, "rewards/rejected": -6.560155868530273, "step": 392, "train_speed(iter/s)": 0.008 }, { "epoch": 0.8715780719384573, "grad_norm": 6.086115837097168, "learning_rate": 0.00012879763556277062, "logits/chosen": -1.1569675207138062, "logits/rejected": -1.1982351541519165, "logps/chosen": -8.720643997192383, "logps/rejected": -99.62559509277344, "loss": 0.45403456687927246, "memory(GiB)": 46.1, "nll_loss": 0.40008455514907837, "rewards/accuracies": 1.0, "rewards/chosen": 0.6170443296432495, "rewards/margins": 8.753840446472168, "rewards/rejected": -8.136796951293945, "step": 393, "train_speed(iter/s)": 0.007999 }, { "epoch": 0.8737958278466976, "grad_norm": 1.8687723875045776, "learning_rate": 0.0001284455697923646, "logits/chosen": -1.1504981517791748, "logits/rejected": -1.225466012954712, "logps/chosen": -6.932313442230225, "logps/rejected": -97.39447784423828, "loss": 0.40548500418663025, "memory(GiB)": 46.1, "nll_loss": 0.30781060457229614, "rewards/accuracies": 0.96875, "rewards/chosen": 0.5330286622047424, "rewards/margins": 7.959634780883789, "rewards/rejected": -7.426605701446533, "step": 394, "train_speed(iter/s)": 0.007999 }, { "epoch": 0.876013583754938, "grad_norm": 1.7781997919082642, "learning_rate": 0.00012809311997735696, "logits/chosen": -1.1534217596054077, "logits/rejected": -1.2358542680740356, "logps/chosen": -8.768854141235352, "logps/rejected": -91.94288635253906, "loss": 0.4044226408004761, "memory(GiB)": 46.1, "nll_loss": 0.3020440340042114, "rewards/accuracies": 1.0, "rewards/chosen": 0.46018874645233154, "rewards/margins": 7.929361343383789, "rewards/rejected": -7.469172477722168, "step": 395, "train_speed(iter/s)": 0.007999 }, { "epoch": 0.8782313396631783, "grad_norm": 12.74526309967041, "learning_rate": 0.00012774029087618446, "logits/chosen": -1.2151590585708618, "logits/rejected": -1.251021385192871, "logps/chosen": -10.305855751037598, "logps/rejected": -91.78905487060547, "loss": 0.6720870137214661, "memory(GiB)": 46.1, "nll_loss": 0.4713570773601532, "rewards/accuracies": 0.9375, "rewards/chosen": 0.16427800059318542, "rewards/margins": 7.4839887619018555, "rewards/rejected": -7.319710731506348, "step": 396, "train_speed(iter/s)": 0.007999 }, { "epoch": 0.8804490955714187, "grad_norm": 2.1509110927581787, "learning_rate": 0.00012738708725240484, "logits/chosen": -1.2225698232650757, "logits/rejected": -1.2627900838851929, "logps/chosen": -11.55994987487793, "logps/rejected": -98.7964096069336, "loss": 0.5669252276420593, "memory(GiB)": 46.1, "nll_loss": 0.3946492075920105, "rewards/accuracies": 0.90625, "rewards/chosen": 0.3987804055213928, "rewards/margins": 8.50069522857666, "rewards/rejected": -8.10191535949707, "step": 397, "train_speed(iter/s)": 0.007999 }, { "epoch": 0.8826668514796591, "grad_norm": 2.0327556133270264, "learning_rate": 0.0001270335138746322, "logits/chosen": -1.1845993995666504, "logits/rejected": -1.2103253602981567, "logps/chosen": -6.5673980712890625, "logps/rejected": -69.4446792602539, "loss": 0.5495756268501282, "memory(GiB)": 46.1, "nll_loss": 0.3730127215385437, "rewards/accuracies": 0.96875, "rewards/chosen": 0.29667022824287415, "rewards/margins": 5.815788745880127, "rewards/rejected": -5.519117832183838, "step": 398, "train_speed(iter/s)": 0.007999 }, { "epoch": 0.8848846073878994, "grad_norm": 5.390183925628662, "learning_rate": 0.00012667957551647262, "logits/chosen": -1.2288250923156738, "logits/rejected": -1.2931530475616455, "logps/chosen": -5.809046268463135, "logps/rejected": -112.88240051269531, "loss": 0.3403761684894562, "memory(GiB)": 46.1, "nll_loss": 0.21371078491210938, "rewards/accuracies": 0.90625, "rewards/chosen": 0.43278729915618896, "rewards/margins": 9.281527519226074, "rewards/rejected": -8.848739624023438, "step": 399, "train_speed(iter/s)": 0.008 }, { "epoch": 0.8871023632961397, "grad_norm": 3.3119659423828125, "learning_rate": 0.00012632527695645993, "logits/chosen": -1.2474465370178223, "logits/rejected": -1.3153529167175293, "logps/chosen": -5.87565803527832, "logps/rejected": -95.62116241455078, "loss": 0.43962395191192627, "memory(GiB)": 46.1, "nll_loss": 0.3828383982181549, "rewards/accuracies": 1.0, "rewards/chosen": 0.4066924750804901, "rewards/margins": 7.693698883056641, "rewards/rejected": -7.287006378173828, "step": 400, "train_speed(iter/s)": 0.008 } ], "logging_steps": 1, "max_steps": 900, "num_input_tokens_seen": 0, "num_train_epochs": 2, "save_steps": 50, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": false }, "attributes": {} } }, "total_flos": 1.1370776801606369e+18, "train_batch_size": 1, "trial_name": null, "trial_params": null }