PEFT
Safetensors
task1image-400 / trainer_state.json
windgrin's picture
Upload folder using huggingface_hub
245f3d0 verified
Raw
History Blame Contribute Delete
256 kB
{
"best_global_step": 300,
"best_metric": 0.41139093,
"best_model_checkpoint": "/data2/kdd/crag/cjz/output/task1_image_gt10_gt2_rewrite_False/v1-20250614-001049/checkpoint-300",
"epoch": 0.8871023632961397,
"eval_steps": 300,
"global_step": 400,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"epoch": 0.0022177559082403493,
"grad_norm": 7.276436805725098,
"learning_rate": 4.444444444444445e-06,
"logits/chosen": -0.7332726716995239,
"logits/rejected": -0.7375782132148743,
"logps/chosen": -10.463276863098145,
"logps/rejected": -16.490936279296875,
"loss": 1.3974095582962036,
"memory(GiB)": 44.63,
"nll_loss": 0.7042622566223145,
"rewards/accuracies": 0.0,
"rewards/chosen": 0.0,
"rewards/margins": 0.0,
"rewards/rejected": 0.0,
"step": 1,
"train_speed(iter/s)": 0.007748
},
{
"epoch": 0.004435511816480699,
"grad_norm": 10.07150936126709,
"learning_rate": 8.88888888888889e-06,
"logits/chosen": -0.7215312719345093,
"logits/rejected": -0.7478011250495911,
"logps/chosen": -8.118193626403809,
"logps/rejected": -19.331707000732422,
"loss": 1.5197914838790894,
"memory(GiB)": 46.1,
"nll_loss": 0.8266440629959106,
"rewards/accuracies": 0.0,
"rewards/chosen": 0.0,
"rewards/margins": 0.0,
"rewards/rejected": 0.0,
"step": 2,
"train_speed(iter/s)": 0.007824
},
{
"epoch": 0.006653267724721048,
"grad_norm": 10.19728946685791,
"learning_rate": 1.3333333333333333e-05,
"logits/chosen": -0.685354471206665,
"logits/rejected": -0.7223411202430725,
"logps/chosen": -8.368087768554688,
"logps/rejected": -23.5802001953125,
"loss": 1.4096384048461914,
"memory(GiB)": 46.1,
"nll_loss": 0.7168383002281189,
"rewards/accuracies": 0.59375,
"rewards/chosen": -3.958120942115784e-05,
"rewards/margins": 0.0009151366539299488,
"rewards/rejected": -0.0009547180961817503,
"step": 3,
"train_speed(iter/s)": 0.007859
},
{
"epoch": 0.008871023632961397,
"grad_norm": 8.582710266113281,
"learning_rate": 1.777777777777778e-05,
"logits/chosen": -0.6947981119155884,
"logits/rejected": -0.7241417765617371,
"logps/chosen": -13.892762184143066,
"logps/rejected": -24.124719619750977,
"loss": 1.5422468185424805,
"memory(GiB)": 46.1,
"nll_loss": 0.8507797122001648,
"rewards/accuracies": 0.5,
"rewards/chosen": 0.0054289610125124454,
"rewards/margins": 0.0035484125837683678,
"rewards/rejected": 0.0018805486615747213,
"step": 4,
"train_speed(iter/s)": 0.007846
},
{
"epoch": 0.011088779541201747,
"grad_norm": 8.61772632598877,
"learning_rate": 2.2222222222222223e-05,
"logits/chosen": -0.7581620216369629,
"logits/rejected": -0.7803558111190796,
"logps/chosen": -11.490116119384766,
"logps/rejected": -17.942598342895508,
"loss": 1.456505298614502,
"memory(GiB)": 46.1,
"nll_loss": 0.7721378803253174,
"rewards/accuracies": 0.625,
"rewards/chosen": 0.01581314392387867,
"rewards/margins": 0.01840357482433319,
"rewards/rejected": -0.0025904285721480846,
"step": 5,
"train_speed(iter/s)": 0.007817
},
{
"epoch": 0.013306535449442096,
"grad_norm": 11.505023956298828,
"learning_rate": 2.6666666666666667e-05,
"logits/chosen": -0.7362898588180542,
"logits/rejected": -0.7709215879440308,
"logps/chosen": -8.461962699890137,
"logps/rejected": -27.864641189575195,
"loss": 1.3553998470306396,
"memory(GiB)": 46.1,
"nll_loss": 0.6918811798095703,
"rewards/accuracies": 0.75,
"rewards/chosen": 0.06961186230182648,
"rewards/margins": 0.06262461841106415,
"rewards/rejected": 0.00698724202811718,
"step": 6,
"train_speed(iter/s)": 0.007858
},
{
"epoch": 0.015524291357682445,
"grad_norm": 7.58583402633667,
"learning_rate": 3.111111111111111e-05,
"logits/chosen": -0.7080317139625549,
"logits/rejected": -0.7482547760009766,
"logps/chosen": -6.92811393737793,
"logps/rejected": -22.422035217285156,
"loss": 1.1541662216186523,
"memory(GiB)": 46.1,
"nll_loss": 0.5072559118270874,
"rewards/accuracies": 0.6875,
"rewards/chosen": 0.10978628695011139,
"rewards/margins": 0.10527929663658142,
"rewards/rejected": 0.004506995901465416,
"step": 7,
"train_speed(iter/s)": 0.007928
},
{
"epoch": 0.017742047265922795,
"grad_norm": 7.752142429351807,
"learning_rate": 3.555555555555556e-05,
"logits/chosen": -0.68747478723526,
"logits/rejected": -0.7212347388267517,
"logps/chosen": -9.500894546508789,
"logps/rejected": -23.92633056640625,
"loss": 1.3329849243164062,
"memory(GiB)": 46.1,
"nll_loss": 0.7127149701118469,
"rewards/accuracies": 0.65625,
"rewards/chosen": 0.030532313510775566,
"rewards/margins": 0.18240433931350708,
"rewards/rejected": -0.15187203884124756,
"step": 8,
"train_speed(iter/s)": 0.007913
},
{
"epoch": 0.019959803174163144,
"grad_norm": 3.5858492851257324,
"learning_rate": 4e-05,
"logits/chosen": -0.73879075050354,
"logits/rejected": -0.7796315550804138,
"logps/chosen": -5.0881805419921875,
"logps/rejected": -24.7738037109375,
"loss": 0.8303911685943604,
"memory(GiB)": 46.1,
"nll_loss": 0.2771793305873871,
"rewards/accuracies": 0.71875,
"rewards/chosen": 0.11474708467721939,
"rewards/margins": 0.37330126762390137,
"rewards/rejected": -0.2585541307926178,
"step": 9,
"train_speed(iter/s)": 0.007944
},
{
"epoch": 0.022177559082403493,
"grad_norm": 7.612152099609375,
"learning_rate": 4.4444444444444447e-05,
"logits/chosen": -0.6987114548683167,
"logits/rejected": -0.7058257460594177,
"logps/chosen": -15.217192649841309,
"logps/rejected": -22.54599380493164,
"loss": 1.2511308193206787,
"memory(GiB)": 46.1,
"nll_loss": 0.6868589520454407,
"rewards/accuracies": 0.625,
"rewards/chosen": -0.12514850497245789,
"rewards/margins": 0.4101864695549011,
"rewards/rejected": -0.5353350043296814,
"step": 10,
"train_speed(iter/s)": 0.007962
},
{
"epoch": 0.024395314990643843,
"grad_norm": 6.01246976852417,
"learning_rate": 4.888888888888889e-05,
"logits/chosen": -0.6994076371192932,
"logits/rejected": -0.7003622055053711,
"logps/chosen": -14.472052574157715,
"logps/rejected": -23.425853729248047,
"loss": 1.284260630607605,
"memory(GiB)": 46.1,
"nll_loss": 0.6495041251182556,
"rewards/accuracies": 0.6875,
"rewards/chosen": -0.21374526619911194,
"rewards/margins": 0.31260305643081665,
"rewards/rejected": -0.5263482928276062,
"step": 11,
"train_speed(iter/s)": 0.007969
},
{
"epoch": 0.026613070898884192,
"grad_norm": 6.6873040199279785,
"learning_rate": 5.333333333333333e-05,
"logits/chosen": -0.719663143157959,
"logits/rejected": -0.7418795824050903,
"logps/chosen": -15.615825653076172,
"logps/rejected": -24.63580322265625,
"loss": 1.4747008085250854,
"memory(GiB)": 46.1,
"nll_loss": 0.847057044506073,
"rewards/accuracies": 0.625,
"rewards/chosen": -0.2930046319961548,
"rewards/margins": 0.3898415267467499,
"rewards/rejected": -0.682846188545227,
"step": 12,
"train_speed(iter/s)": 0.007993
},
{
"epoch": 0.02883082680712454,
"grad_norm": 4.942108631134033,
"learning_rate": 5.7777777777777776e-05,
"logits/chosen": -0.6910253167152405,
"logits/rejected": -0.7100927829742432,
"logps/chosen": -10.659884452819824,
"logps/rejected": -25.604801177978516,
"loss": 1.0991154909133911,
"memory(GiB)": 46.1,
"nll_loss": 0.529512882232666,
"rewards/accuracies": 0.625,
"rewards/chosen": -0.1485268771648407,
"rewards/margins": 0.43985775113105774,
"rewards/rejected": -0.5883846282958984,
"step": 13,
"train_speed(iter/s)": 0.008034
},
{
"epoch": 0.03104858271536489,
"grad_norm": 8.013643264770508,
"learning_rate": 6.222222222222222e-05,
"logits/chosen": -0.6786947846412659,
"logits/rejected": -0.7003186345100403,
"logps/chosen": -8.749262809753418,
"logps/rejected": -22.5197811126709,
"loss": 1.3776031732559204,
"memory(GiB)": 46.1,
"nll_loss": 0.7835733294487,
"rewards/accuracies": 0.65625,
"rewards/chosen": -0.08169429004192352,
"rewards/margins": 0.344772070646286,
"rewards/rejected": -0.42646634578704834,
"step": 14,
"train_speed(iter/s)": 0.008017
},
{
"epoch": 0.033266338623605236,
"grad_norm": 5.5514817237854,
"learning_rate": 6.666666666666667e-05,
"logits/chosen": -0.703814685344696,
"logits/rejected": -0.7373018264770508,
"logps/chosen": -6.65080451965332,
"logps/rejected": -23.22998809814453,
"loss": 1.1897517442703247,
"memory(GiB)": 46.1,
"nll_loss": 0.626986026763916,
"rewards/accuracies": 0.6875,
"rewards/chosen": 0.03274273872375488,
"rewards/margins": 0.42112234234809875,
"rewards/rejected": -0.38837966322898865,
"step": 15,
"train_speed(iter/s)": 0.008023
},
{
"epoch": 0.03548409453184559,
"grad_norm": 3.7225890159606934,
"learning_rate": 7.111111111111112e-05,
"logits/chosen": -0.6734000444412231,
"logits/rejected": -0.6864615678787231,
"logps/chosen": -11.966102600097656,
"logps/rejected": -23.13942527770996,
"loss": 1.2046136856079102,
"memory(GiB)": 46.1,
"nll_loss": 0.5588831901550293,
"rewards/accuracies": 0.59375,
"rewards/chosen": -0.07107432186603546,
"rewards/margins": 0.2272331863641739,
"rewards/rejected": -0.29830753803253174,
"step": 16,
"train_speed(iter/s)": 0.008033
},
{
"epoch": 0.037701850440085935,
"grad_norm": 3.068159580230713,
"learning_rate": 7.555555555555556e-05,
"logits/chosen": -0.6323463916778564,
"logits/rejected": -0.6556217670440674,
"logps/chosen": -7.376963138580322,
"logps/rejected": -23.585092544555664,
"loss": 0.990348756313324,
"memory(GiB)": 46.1,
"nll_loss": 0.377433717250824,
"rewards/accuracies": 0.6875,
"rewards/chosen": 0.09706290066242218,
"rewards/margins": 0.31319916248321533,
"rewards/rejected": -0.21613627672195435,
"step": 17,
"train_speed(iter/s)": 0.00803
},
{
"epoch": 0.03991960634832629,
"grad_norm": 2.306462526321411,
"learning_rate": 8e-05,
"logits/chosen": -0.652298092842102,
"logits/rejected": -0.6973198056221008,
"logps/chosen": -4.506044864654541,
"logps/rejected": -23.26398468017578,
"loss": 0.8916468024253845,
"memory(GiB)": 46.1,
"nll_loss": 0.35007452964782715,
"rewards/accuracies": 0.6875,
"rewards/chosen": 0.22034089267253876,
"rewards/margins": 0.45051315426826477,
"rewards/rejected": -0.23017224669456482,
"step": 18,
"train_speed(iter/s)": 0.008047
},
{
"epoch": 0.042137362256566634,
"grad_norm": 2.24660325050354,
"learning_rate": 8.444444444444444e-05,
"logits/chosen": -0.6684755086898804,
"logits/rejected": -0.6921530365943909,
"logps/chosen": -5.159789562225342,
"logps/rejected": -20.33713722229004,
"loss": 0.9385991096496582,
"memory(GiB)": 46.1,
"nll_loss": 0.3643404245376587,
"rewards/accuracies": 0.78125,
"rewards/chosen": 0.1963498443365097,
"rewards/margins": 0.30785509943962097,
"rewards/rejected": -0.11150527000427246,
"step": 19,
"train_speed(iter/s)": 0.008041
},
{
"epoch": 0.044355118164806986,
"grad_norm": 4.343178749084473,
"learning_rate": 8.888888888888889e-05,
"logits/chosen": -0.64969801902771,
"logits/rejected": -0.6867151856422424,
"logps/chosen": -8.542341232299805,
"logps/rejected": -27.74468421936035,
"loss": 1.159504771232605,
"memory(GiB)": 46.1,
"nll_loss": 0.5642345547676086,
"rewards/accuracies": 0.6875,
"rewards/chosen": 0.17812781035900116,
"rewards/margins": 0.28209057450294495,
"rewards/rejected": -0.10396274924278259,
"step": 20,
"train_speed(iter/s)": 0.008063
},
{
"epoch": 0.04657287407304733,
"grad_norm": 2.5781965255737305,
"learning_rate": 9.333333333333334e-05,
"logits/chosen": -0.7248848676681519,
"logits/rejected": -0.7462906837463379,
"logps/chosen": -8.212335586547852,
"logps/rejected": -15.989672660827637,
"loss": 1.174903392791748,
"memory(GiB)": 46.1,
"nll_loss": 0.5117508172988892,
"rewards/accuracies": 0.59375,
"rewards/chosen": 0.13524048030376434,
"rewards/margins": 0.12396176159381866,
"rewards/rejected": 0.011278722435235977,
"step": 21,
"train_speed(iter/s)": 0.008072
},
{
"epoch": 0.048790629981287685,
"grad_norm": 2.095536947250366,
"learning_rate": 9.777777777777778e-05,
"logits/chosen": -0.618206262588501,
"logits/rejected": -0.6151365041732788,
"logps/chosen": -8.146368026733398,
"logps/rejected": -15.488615036010742,
"loss": 1.011189579963684,
"memory(GiB)": 46.1,
"nll_loss": 0.4133646488189697,
"rewards/accuracies": 0.625,
"rewards/chosen": 0.2263016253709793,
"rewards/margins": 0.25505900382995605,
"rewards/rejected": -0.02875736728310585,
"step": 22,
"train_speed(iter/s)": 0.008074
},
{
"epoch": 0.05100838588952803,
"grad_norm": 2.504054307937622,
"learning_rate": 0.00010222222222222222,
"logits/chosen": -0.6510525345802307,
"logits/rejected": -0.664685845375061,
"logps/chosen": -8.884237289428711,
"logps/rejected": -20.657085418701172,
"loss": 1.1501473188400269,
"memory(GiB)": 46.1,
"nll_loss": 0.5572206974029541,
"rewards/accuracies": 0.625,
"rewards/chosen": 0.1401275396347046,
"rewards/margins": 0.2846068739891052,
"rewards/rejected": -0.14447934925556183,
"step": 23,
"train_speed(iter/s)": 0.008064
},
{
"epoch": 0.053226141797768384,
"grad_norm": 2.6294727325439453,
"learning_rate": 0.00010666666666666667,
"logits/chosen": -0.6562620997428894,
"logits/rejected": -0.6580171585083008,
"logps/chosen": -11.128717422485352,
"logps/rejected": -19.960248947143555,
"loss": 1.025831699371338,
"memory(GiB)": 46.1,
"nll_loss": 0.35331588983535767,
"rewards/accuracies": 0.625,
"rewards/chosen": 0.05753737688064575,
"rewards/margins": 0.09378618001937866,
"rewards/rejected": -0.03624879568815231,
"step": 24,
"train_speed(iter/s)": 0.008068
},
{
"epoch": 0.05544389770600873,
"grad_norm": 4.113434314727783,
"learning_rate": 0.00011111111111111112,
"logits/chosen": -0.7034849524497986,
"logits/rejected": -0.703572154045105,
"logps/chosen": -12.834946632385254,
"logps/rejected": -22.007543563842773,
"loss": 1.219478726387024,
"memory(GiB)": 46.1,
"nll_loss": 0.56423419713974,
"rewards/accuracies": 0.65625,
"rewards/chosen": 0.04055144265294075,
"rewards/margins": 0.14624251425266266,
"rewards/rejected": -0.10569106787443161,
"step": 25,
"train_speed(iter/s)": 0.008066
},
{
"epoch": 0.05766165361424908,
"grad_norm": 4.309391498565674,
"learning_rate": 0.00011555555555555555,
"logits/chosen": -0.662431001663208,
"logits/rejected": -0.684702455997467,
"logps/chosen": -11.661463737487793,
"logps/rejected": -24.191795349121094,
"loss": 1.1345590353012085,
"memory(GiB)": 46.1,
"nll_loss": 0.5379157662391663,
"rewards/accuracies": 0.625,
"rewards/chosen": 0.027302712202072144,
"rewards/margins": 0.2985782027244568,
"rewards/rejected": -0.27127546072006226,
"step": 26,
"train_speed(iter/s)": 0.008061
},
{
"epoch": 0.05987940952248943,
"grad_norm": 4.278309345245361,
"learning_rate": 0.00012,
"logits/chosen": -0.7126907706260681,
"logits/rejected": -0.7174281477928162,
"logps/chosen": -11.30073070526123,
"logps/rejected": -19.983867645263672,
"loss": 1.1452325582504272,
"memory(GiB)": 46.1,
"nll_loss": 0.5350662469863892,
"rewards/accuracies": 0.65625,
"rewards/chosen": 0.15527383983135223,
"rewards/margins": 0.2666708827018738,
"rewards/rejected": -0.11139706522226334,
"step": 27,
"train_speed(iter/s)": 0.008058
},
{
"epoch": 0.06209716543072978,
"grad_norm": 3.8597252368927,
"learning_rate": 0.00012444444444444444,
"logits/chosen": -0.7358130216598511,
"logits/rejected": -0.7531285285949707,
"logps/chosen": -6.426143169403076,
"logps/rejected": -24.873878479003906,
"loss": 0.8902767896652222,
"memory(GiB)": 46.1,
"nll_loss": 0.37025153636932373,
"rewards/accuracies": 0.8125,
"rewards/chosen": 0.17672136425971985,
"rewards/margins": 0.4878941774368286,
"rewards/rejected": -0.3111727833747864,
"step": 28,
"train_speed(iter/s)": 0.008062
},
{
"epoch": 0.06431492133897013,
"grad_norm": 5.0088348388671875,
"learning_rate": 0.00012888888888888892,
"logits/chosen": -0.6740167140960693,
"logits/rejected": -0.7026465535163879,
"logps/chosen": -6.703609466552734,
"logps/rejected": -27.67329978942871,
"loss": 1.0634881258010864,
"memory(GiB)": 46.1,
"nll_loss": 0.5235491991043091,
"rewards/accuracies": 0.78125,
"rewards/chosen": 0.11447454988956451,
"rewards/margins": 0.4801509380340576,
"rewards/rejected": -0.3656763732433319,
"step": 29,
"train_speed(iter/s)": 0.008064
},
{
"epoch": 0.06653267724721047,
"grad_norm": 7.510077953338623,
"learning_rate": 0.00013333333333333334,
"logits/chosen": -0.649000883102417,
"logits/rejected": -0.6501227021217346,
"logps/chosen": -9.731987953186035,
"logps/rejected": -22.024688720703125,
"loss": 1.4005825519561768,
"memory(GiB)": 46.1,
"nll_loss": 0.7944965362548828,
"rewards/accuracies": 0.65625,
"rewards/chosen": 0.0400068461894989,
"rewards/margins": 0.3603759706020355,
"rewards/rejected": -0.3203691244125366,
"step": 30,
"train_speed(iter/s)": 0.00806
},
{
"epoch": 0.06875043315545083,
"grad_norm": 2.7688963413238525,
"learning_rate": 0.0001377777777777778,
"logits/chosen": -0.683768093585968,
"logits/rejected": -0.6991692781448364,
"logps/chosen": -9.37608528137207,
"logps/rejected": -19.639158248901367,
"loss": 1.0507181882858276,
"memory(GiB)": 46.1,
"nll_loss": 0.45388615131378174,
"rewards/accuracies": 0.75,
"rewards/chosen": 0.11749469488859177,
"rewards/margins": 0.371566504240036,
"rewards/rejected": -0.25407183170318604,
"step": 31,
"train_speed(iter/s)": 0.00806
},
{
"epoch": 0.07096818906369118,
"grad_norm": 2.550858974456787,
"learning_rate": 0.00014222222222222224,
"logits/chosen": -0.6819652318954468,
"logits/rejected": -0.6938492059707642,
"logps/chosen": -12.82135009765625,
"logps/rejected": -32.83695602416992,
"loss": 1.083910346031189,
"memory(GiB)": 46.1,
"nll_loss": 0.5153654217720032,
"rewards/accuracies": 0.78125,
"rewards/chosen": 0.08128099143505096,
"rewards/margins": 0.3762062191963196,
"rewards/rejected": -0.2949252128601074,
"step": 32,
"train_speed(iter/s)": 0.008067
},
{
"epoch": 0.07318594497193152,
"grad_norm": 2.6052372455596924,
"learning_rate": 0.00014666666666666666,
"logits/chosen": -0.6425620317459106,
"logits/rejected": -0.6855881214141846,
"logps/chosen": -5.170282363891602,
"logps/rejected": -25.80876922607422,
"loss": 0.9529789090156555,
"memory(GiB)": 46.1,
"nll_loss": 0.420663058757782,
"rewards/accuracies": 0.75,
"rewards/chosen": 0.21988970041275024,
"rewards/margins": 0.48745402693748474,
"rewards/rejected": -0.2675642967224121,
"step": 33,
"train_speed(iter/s)": 0.008068
},
{
"epoch": 0.07540370088017187,
"grad_norm": 3.4502556324005127,
"learning_rate": 0.0001511111111111111,
"logits/chosen": -0.6484149694442749,
"logits/rejected": -0.6727481484413147,
"logps/chosen": -6.394935607910156,
"logps/rejected": -20.673736572265625,
"loss": 0.9740100502967834,
"memory(GiB)": 46.1,
"nll_loss": 0.39780640602111816,
"rewards/accuracies": 0.75,
"rewards/chosen": 0.23207196593284607,
"rewards/margins": 0.35720905661582947,
"rewards/rejected": -0.12513704597949982,
"step": 34,
"train_speed(iter/s)": 0.008066
},
{
"epoch": 0.07762145678841223,
"grad_norm": 2.5214908123016357,
"learning_rate": 0.00015555555555555556,
"logits/chosen": -0.6334148049354553,
"logits/rejected": -0.6357681751251221,
"logps/chosen": -7.275469779968262,
"logps/rejected": -26.607770919799805,
"loss": 0.8099223375320435,
"memory(GiB)": 46.1,
"nll_loss": 0.2854778468608856,
"rewards/accuracies": 0.71875,
"rewards/chosen": 0.12199296802282333,
"rewards/margins": 0.5918037295341492,
"rewards/rejected": -0.4698107838630676,
"step": 35,
"train_speed(iter/s)": 0.008065
},
{
"epoch": 0.07983921269665258,
"grad_norm": 4.882220268249512,
"learning_rate": 0.00016,
"logits/chosen": -0.6802562475204468,
"logits/rejected": -0.7064938545227051,
"logps/chosen": -15.904359817504883,
"logps/rejected": -29.350811004638672,
"loss": 1.5268551111221313,
"memory(GiB)": 46.1,
"nll_loss": 0.9425684809684753,
"rewards/accuracies": 0.59375,
"rewards/chosen": -0.18609833717346191,
"rewards/margins": 0.4418560266494751,
"rewards/rejected": -0.627954363822937,
"step": 36,
"train_speed(iter/s)": 0.008068
},
{
"epoch": 0.08205696860489292,
"grad_norm": 3.0210578441619873,
"learning_rate": 0.00016444444444444444,
"logits/chosen": -0.7036482095718384,
"logits/rejected": -0.7044983506202698,
"logps/chosen": -14.613797187805176,
"logps/rejected": -30.51740837097168,
"loss": 1.017217993736267,
"memory(GiB)": 46.1,
"nll_loss": 0.5247446298599243,
"rewards/accuracies": 0.8125,
"rewards/chosen": -0.03162863850593567,
"rewards/margins": 0.6317514181137085,
"rewards/rejected": -0.6633801460266113,
"step": 37,
"train_speed(iter/s)": 0.008059
},
{
"epoch": 0.08427472451313327,
"grad_norm": 3.098156213760376,
"learning_rate": 0.00016888888888888889,
"logits/chosen": -0.6714186072349548,
"logits/rejected": -0.6812422871589661,
"logps/chosen": -16.367725372314453,
"logps/rejected": -28.301345825195312,
"loss": 1.2068523168563843,
"memory(GiB)": 46.1,
"nll_loss": 0.6946620345115662,
"rewards/accuracies": 0.75,
"rewards/chosen": 0.015942862257361412,
"rewards/margins": 0.6814810633659363,
"rewards/rejected": -0.6655381917953491,
"step": 38,
"train_speed(iter/s)": 0.00807
},
{
"epoch": 0.08649248042137363,
"grad_norm": 3.322134256362915,
"learning_rate": 0.00017333333333333334,
"logits/chosen": -0.6880184412002563,
"logits/rejected": -0.7056170701980591,
"logps/chosen": -6.932201385498047,
"logps/rejected": -23.875953674316406,
"loss": 0.8887794613838196,
"memory(GiB)": 46.1,
"nll_loss": 0.32947438955307007,
"rewards/accuracies": 0.75,
"rewards/chosen": 0.09907499700784683,
"rewards/margins": 0.4684091806411743,
"rewards/rejected": -0.3693341612815857,
"step": 39,
"train_speed(iter/s)": 0.008055
},
{
"epoch": 0.08871023632961397,
"grad_norm": 3.0120160579681396,
"learning_rate": 0.00017777777777777779,
"logits/chosen": -0.6974343061447144,
"logits/rejected": -0.7076331377029419,
"logps/chosen": -10.623748779296875,
"logps/rejected": -26.470630645751953,
"loss": 1.1136667728424072,
"memory(GiB)": 46.1,
"nll_loss": 0.532155454158783,
"rewards/accuracies": 0.625,
"rewards/chosen": 0.0889241099357605,
"rewards/margins": 0.455722838640213,
"rewards/rejected": -0.3667986989021301,
"step": 40,
"train_speed(iter/s)": 0.008055
},
{
"epoch": 0.09092799223785432,
"grad_norm": 2.5109620094299316,
"learning_rate": 0.00018222222222222224,
"logits/chosen": -0.7382675409317017,
"logits/rejected": -0.7507362961769104,
"logps/chosen": -8.733287811279297,
"logps/rejected": -22.5925350189209,
"loss": 0.8756768703460693,
"memory(GiB)": 46.1,
"nll_loss": 0.3629510700702667,
"rewards/accuracies": 0.71875,
"rewards/chosen": 0.2706006169319153,
"rewards/margins": 0.6100682616233826,
"rewards/rejected": -0.3394676446914673,
"step": 41,
"train_speed(iter/s)": 0.008049
},
{
"epoch": 0.09314574814609466,
"grad_norm": 3.9691097736358643,
"learning_rate": 0.0001866666666666667,
"logits/chosen": -0.7684446573257446,
"logits/rejected": -0.787712037563324,
"logps/chosen": -11.393584251403809,
"logps/rejected": -30.219039916992188,
"loss": 1.211122751235962,
"memory(GiB)": 46.1,
"nll_loss": 0.6706364750862122,
"rewards/accuracies": 0.65625,
"rewards/chosen": -0.007796842604875565,
"rewards/margins": 0.7110621333122253,
"rewards/rejected": -0.7188589572906494,
"step": 42,
"train_speed(iter/s)": 0.008051
},
{
"epoch": 0.09536350405433502,
"grad_norm": 2.963203191757202,
"learning_rate": 0.00019111111111111114,
"logits/chosen": -0.6818578839302063,
"logits/rejected": -0.6889616250991821,
"logps/chosen": -12.270942687988281,
"logps/rejected": -27.153846740722656,
"loss": 0.9894061088562012,
"memory(GiB)": 46.1,
"nll_loss": 0.4868725836277008,
"rewards/accuracies": 0.78125,
"rewards/chosen": 0.012282166630029678,
"rewards/margins": 0.6492558121681213,
"rewards/rejected": -0.6369736194610596,
"step": 43,
"train_speed(iter/s)": 0.008043
},
{
"epoch": 0.09758125996257537,
"grad_norm": 3.587053060531616,
"learning_rate": 0.00019555555555555556,
"logits/chosen": -0.7400009632110596,
"logits/rejected": -0.7725372314453125,
"logps/chosen": -12.326873779296875,
"logps/rejected": -22.454561233520508,
"loss": 1.0897188186645508,
"memory(GiB)": 46.1,
"nll_loss": 0.5316156148910522,
"rewards/accuracies": 0.65625,
"rewards/chosen": 0.11403915286064148,
"rewards/margins": 0.4852198362350464,
"rewards/rejected": -0.3711806833744049,
"step": 44,
"train_speed(iter/s)": 0.00805
},
{
"epoch": 0.09979901587081572,
"grad_norm": 2.648092269897461,
"learning_rate": 0.0002,
"logits/chosen": -0.7456753849983215,
"logits/rejected": -0.7561041116714478,
"logps/chosen": -7.531292915344238,
"logps/rejected": -21.980024337768555,
"loss": 0.9317559003829956,
"memory(GiB)": 46.1,
"nll_loss": 0.3929036855697632,
"rewards/accuracies": 0.65625,
"rewards/chosen": 0.10482822358608246,
"rewards/margins": 0.6396186351776123,
"rewards/rejected": -0.5347905158996582,
"step": 45,
"train_speed(iter/s)": 0.008052
},
{
"epoch": 0.10201677177905606,
"grad_norm": 3.2653682231903076,
"learning_rate": 0.0001999993249483057,
"logits/chosen": -0.7328958511352539,
"logits/rejected": -0.7547612190246582,
"logps/chosen": -11.5140380859375,
"logps/rejected": -22.490699768066406,
"loss": 1.031274676322937,
"memory(GiB)": 46.1,
"nll_loss": 0.5204803943634033,
"rewards/accuracies": 0.71875,
"rewards/chosen": 0.19196264445781708,
"rewards/margins": 0.651879072189331,
"rewards/rejected": -0.45991644263267517,
"step": 46,
"train_speed(iter/s)": 0.008051
},
{
"epoch": 0.10423452768729642,
"grad_norm": 5.505344867706299,
"learning_rate": 0.0001999972998023366,
"logits/chosen": -0.7554954290390015,
"logits/rejected": -0.7810638546943665,
"logps/chosen": -5.766447067260742,
"logps/rejected": -19.390804290771484,
"loss": 1.2154221534729004,
"memory(GiB)": 46.1,
"nll_loss": 0.7068721055984497,
"rewards/accuracies": 0.84375,
"rewards/chosen": 0.2990206182003021,
"rewards/margins": 0.5781352519989014,
"rewards/rejected": -0.27911463379859924,
"step": 47,
"train_speed(iter/s)": 0.008058
},
{
"epoch": 0.10645228359553677,
"grad_norm": 2.649653911590576,
"learning_rate": 0.00019999392458943432,
"logits/chosen": -0.6805804967880249,
"logits/rejected": -0.7093008756637573,
"logps/chosen": -14.792132377624512,
"logps/rejected": -24.17580795288086,
"loss": 1.1033304929733276,
"memory(GiB)": 46.1,
"nll_loss": 0.5765480995178223,
"rewards/accuracies": 0.6875,
"rewards/chosen": 0.2228904664516449,
"rewards/margins": 0.643200695514679,
"rewards/rejected": -0.42031019926071167,
"step": 48,
"train_speed(iter/s)": 0.008059
},
{
"epoch": 0.10867003950377711,
"grad_norm": 3.4825599193573,
"learning_rate": 0.00019998919935516768,
"logits/chosen": -0.6554335951805115,
"logits/rejected": -0.6713435053825378,
"logps/chosen": -10.660847663879395,
"logps/rejected": -35.06268310546875,
"loss": 1.0064078569412231,
"memory(GiB)": 46.1,
"nll_loss": 0.6083590388298035,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.3527636229991913,
"rewards/margins": 0.9422526359558105,
"rewards/rejected": -0.5894889831542969,
"step": 49,
"train_speed(iter/s)": 0.008061
},
{
"epoch": 0.11088779541201746,
"grad_norm": 2.771404504776001,
"learning_rate": 0.00019998312416333227,
"logits/chosen": -0.6812981367111206,
"logits/rejected": -0.7410666942596436,
"logps/chosen": -7.697882652282715,
"logps/rejected": -44.32658386230469,
"loss": 0.7727497816085815,
"memory(GiB)": 46.1,
"nll_loss": 0.4560812711715698,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.10594843327999115,
"rewards/margins": 1.4077725410461426,
"rewards/rejected": -1.3018239736557007,
"step": 50,
"train_speed(iter/s)": 0.008057
},
{
"epoch": 0.11310555132025782,
"grad_norm": 2.724386215209961,
"learning_rate": 0.00019997569909594947,
"logits/chosen": -0.6333714723587036,
"logits/rejected": -0.6679136753082275,
"logps/chosen": -5.1590166091918945,
"logps/rejected": -28.71851348876953,
"loss": 0.6836625933647156,
"memory(GiB)": 46.1,
"nll_loss": 0.27343082427978516,
"rewards/accuracies": 0.84375,
"rewards/chosen": 0.15617597103118896,
"rewards/margins": 1.0674690008163452,
"rewards/rejected": -0.9112929701805115,
"step": 51,
"train_speed(iter/s)": 0.008034
},
{
"epoch": 0.11532330722849816,
"grad_norm": 3.1469614505767822,
"learning_rate": 0.00019996692425326533,
"logits/chosen": -0.6757405996322632,
"logits/rejected": -0.7173976898193359,
"logps/chosen": -5.490239143371582,
"logps/rejected": -35.709468841552734,
"loss": 0.6690353751182556,
"memory(GiB)": 46.1,
"nll_loss": 0.3624095916748047,
"rewards/accuracies": 0.90625,
"rewards/chosen": 0.2558611333370209,
"rewards/margins": 1.5283734798431396,
"rewards/rejected": -1.272512435913086,
"step": 52,
"train_speed(iter/s)": 0.00803
},
{
"epoch": 0.11754106313673851,
"grad_norm": 3.79186749458313,
"learning_rate": 0.0001999567997537493,
"logits/chosen": -0.7215967774391174,
"logits/rejected": -0.733575165271759,
"logps/chosen": -14.72846794128418,
"logps/rejected": -33.80124282836914,
"loss": 0.8965668678283691,
"memory(GiB)": 46.1,
"nll_loss": 0.4457498788833618,
"rewards/accuracies": 0.84375,
"rewards/chosen": 0.06722234189510345,
"rewards/margins": 1.353319764137268,
"rewards/rejected": -1.286097526550293,
"step": 53,
"train_speed(iter/s)": 0.008032
},
{
"epoch": 0.11975881904497886,
"grad_norm": 4.82743501663208,
"learning_rate": 0.00019994532573409262,
"logits/chosen": -0.7556912899017334,
"logits/rejected": -0.777891993522644,
"logps/chosen": -8.923099517822266,
"logps/rejected": -26.59355926513672,
"loss": 0.9261423945426941,
"memory(GiB)": 46.1,
"nll_loss": 0.5014331936836243,
"rewards/accuracies": 0.8125,
"rewards/chosen": 0.2390597015619278,
"rewards/margins": 1.2192004919052124,
"rewards/rejected": -0.9801408648490906,
"step": 54,
"train_speed(iter/s)": 0.00803
},
{
"epoch": 0.12197657495321922,
"grad_norm": 5.3560004234313965,
"learning_rate": 0.00019993250234920636,
"logits/chosen": -0.8043528199195862,
"logits/rejected": -0.8303660154342651,
"logps/chosen": -8.159523010253906,
"logps/rejected": -33.00286865234375,
"loss": 0.9617294073104858,
"memory(GiB)": 46.1,
"nll_loss": 0.5782371759414673,
"rewards/accuracies": 0.71875,
"rewards/chosen": 0.04396045207977295,
"rewards/margins": 1.489919900894165,
"rewards/rejected": -1.4459596872329712,
"step": 55,
"train_speed(iter/s)": 0.008035
},
{
"epoch": 0.12419433086145956,
"grad_norm": 5.173131465911865,
"learning_rate": 0.00019991832977221956,
"logits/chosen": -0.7803252339363098,
"logits/rejected": -0.8187588453292847,
"logps/chosen": -10.553321838378906,
"logps/rejected": -36.212623596191406,
"loss": 0.8786243796348572,
"memory(GiB)": 46.1,
"nll_loss": 0.5231858491897583,
"rewards/accuracies": 0.8125,
"rewards/chosen": 0.05092973634600639,
"rewards/margins": 1.722278356552124,
"rewards/rejected": -1.6713483333587646,
"step": 56,
"train_speed(iter/s)": 0.008038
},
{
"epoch": 0.12641208676969992,
"grad_norm": 8.218033790588379,
"learning_rate": 0.0001999028081944766,
"logits/chosen": -0.8003982305526733,
"logits/rejected": -0.8230556845664978,
"logps/chosen": -9.953974723815918,
"logps/rejected": -38.88124465942383,
"loss": 0.9577436447143555,
"memory(GiB)": 46.1,
"nll_loss": 0.5776119232177734,
"rewards/accuracies": 0.875,
"rewards/chosen": -0.04882112890481949,
"rewards/margins": 1.8343088626861572,
"rewards/rejected": -1.8831300735473633,
"step": 57,
"train_speed(iter/s)": 0.008041
},
{
"epoch": 0.12862984267794025,
"grad_norm": 3.3079514503479004,
"learning_rate": 0.00019988593782553483,
"logits/chosen": -0.7837247252464294,
"logits/rejected": -0.8169953227043152,
"logps/chosen": -6.463255882263184,
"logps/rejected": -35.57067108154297,
"loss": 0.6752747893333435,
"memory(GiB)": 46.1,
"nll_loss": 0.37694644927978516,
"rewards/accuracies": 0.84375,
"rewards/chosen": 0.2689625918865204,
"rewards/margins": 1.9062916040420532,
"rewards/rejected": -1.6373289823532104,
"step": 58,
"train_speed(iter/s)": 0.008042
},
{
"epoch": 0.1308475985861806,
"grad_norm": 6.0413665771484375,
"learning_rate": 0.00019986771889316172,
"logits/chosen": -0.7406100034713745,
"logits/rejected": -0.7850071787834167,
"logps/chosen": -13.76762580871582,
"logps/rejected": -43.040740966796875,
"loss": 1.0095659494400024,
"memory(GiB)": 46.1,
"nll_loss": 0.6776630282402039,
"rewards/accuracies": 0.84375,
"rewards/chosen": -0.015833202749490738,
"rewards/margins": 1.8320919275283813,
"rewards/rejected": -1.8479251861572266,
"step": 59,
"train_speed(iter/s)": 0.008038
},
{
"epoch": 0.13306535449442095,
"grad_norm": 4.190580368041992,
"learning_rate": 0.00019984815164333163,
"logits/chosen": -0.7999930381774902,
"logits/rejected": -0.8120794296264648,
"logps/chosen": -7.115518569946289,
"logps/rejected": -34.076663970947266,
"loss": 1.0062350034713745,
"memory(GiB)": 46.1,
"nll_loss": 0.5622979402542114,
"rewards/accuracies": 0.6875,
"rewards/chosen": 0.14373064041137695,
"rewards/margins": 1.5221604108810425,
"rewards/rejected": -1.378429889678955,
"step": 60,
"train_speed(iter/s)": 0.008032
},
{
"epoch": 0.1352831104026613,
"grad_norm": 3.536224842071533,
"learning_rate": 0.00019982723634022272,
"logits/chosen": -0.7172912955284119,
"logits/rejected": -0.7351298928260803,
"logps/chosen": -11.005714416503906,
"logps/rejected": -33.29360580444336,
"loss": 0.7737724184989929,
"memory(GiB)": 46.1,
"nll_loss": 0.3809564411640167,
"rewards/accuracies": 0.84375,
"rewards/chosen": 0.19083550572395325,
"rewards/margins": 1.2791187763214111,
"rewards/rejected": -1.0882835388183594,
"step": 61,
"train_speed(iter/s)": 0.008033
},
{
"epoch": 0.13750086631090166,
"grad_norm": 4.615377426147461,
"learning_rate": 0.00019980497326621316,
"logits/chosen": -0.7390002012252808,
"logits/rejected": -0.7629216909408569,
"logps/chosen": -14.71272087097168,
"logps/rejected": -28.800384521484375,
"loss": 1.2719998359680176,
"memory(GiB)": 46.1,
"nll_loss": 0.6139569282531738,
"rewards/accuracies": 0.65625,
"rewards/chosen": 0.0792509913444519,
"rewards/margins": 0.693626344203949,
"rewards/rejected": -0.6143754124641418,
"step": 62,
"train_speed(iter/s)": 0.008031
},
{
"epoch": 0.139718622219142,
"grad_norm": 4.907950401306152,
"learning_rate": 0.00019978136272187747,
"logits/chosen": -0.757483720779419,
"logits/rejected": -0.7904630899429321,
"logps/chosen": -7.143397331237793,
"logps/rejected": -37.529693603515625,
"loss": 0.8591395020484924,
"memory(GiB)": 46.1,
"nll_loss": 0.47260788083076477,
"rewards/accuracies": 0.8125,
"rewards/chosen": 0.03792594373226166,
"rewards/margins": 1.2297474145889282,
"rewards/rejected": -1.1918214559555054,
"step": 63,
"train_speed(iter/s)": 0.008028
},
{
"epoch": 0.14193637812738236,
"grad_norm": 9.14727783203125,
"learning_rate": 0.00019975640502598244,
"logits/chosen": -0.7742553949356079,
"logits/rejected": -0.8133993148803711,
"logps/chosen": -10.656136512756348,
"logps/rejected": -45.71231460571289,
"loss": 0.9479065537452698,
"memory(GiB)": 46.1,
"nll_loss": 0.6450760364532471,
"rewards/accuracies": 0.84375,
"rewards/chosen": 0.07653652131557465,
"rewards/margins": 2.4191930294036865,
"rewards/rejected": -2.3426566123962402,
"step": 64,
"train_speed(iter/s)": 0.008025
},
{
"epoch": 0.14415413403562272,
"grad_norm": 6.157256603240967,
"learning_rate": 0.00019973010051548275,
"logits/chosen": -0.7872298955917358,
"logits/rejected": -0.8282527923583984,
"logps/chosen": -8.776991844177246,
"logps/rejected": -43.008079528808594,
"loss": 0.7078882455825806,
"memory(GiB)": 46.1,
"nll_loss": 0.43169137835502625,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.08513045310974121,
"rewards/margins": 2.5409374237060547,
"rewards/rejected": -2.4558072090148926,
"step": 65,
"train_speed(iter/s)": 0.008035
},
{
"epoch": 0.14637188994386305,
"grad_norm": 2.469653844833374,
"learning_rate": 0.0001997024495455165,
"logits/chosen": -0.7316989898681641,
"logits/rejected": -0.7609662413597107,
"logps/chosen": -9.443560600280762,
"logps/rejected": -41.85050964355469,
"loss": 0.6616421937942505,
"memory(GiB)": 46.1,
"nll_loss": 0.381237268447876,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.05163441598415375,
"rewards/margins": 2.0620944499969482,
"rewards/rejected": -2.010460138320923,
"step": 66,
"train_speed(iter/s)": 0.008034
},
{
"epoch": 0.1485896458521034,
"grad_norm": 5.567859172821045,
"learning_rate": 0.00019967345248940034,
"logits/chosen": -0.695087730884552,
"logits/rejected": -0.708895206451416,
"logps/chosen": -14.36052417755127,
"logps/rejected": -31.9357852935791,
"loss": 1.0636613368988037,
"memory(GiB)": 46.1,
"nll_loss": 0.6741958260536194,
"rewards/accuracies": 0.8125,
"rewards/chosen": 0.0757778137922287,
"rewards/margins": 1.4089328050613403,
"rewards/rejected": -1.3331550359725952,
"step": 67,
"train_speed(iter/s)": 0.008036
},
{
"epoch": 0.15080740176034374,
"grad_norm": 2.6372759342193604,
"learning_rate": 0.00019964310973862455,
"logits/chosen": -0.7357401847839355,
"logits/rejected": -0.7486222982406616,
"logps/chosen": -6.373124122619629,
"logps/rejected": -39.36447525024414,
"loss": 0.7257212996482849,
"memory(GiB)": 46.1,
"nll_loss": 0.36459508538246155,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.18388086557388306,
"rewards/margins": 1.8258121013641357,
"rewards/rejected": -1.641931414604187,
"step": 68,
"train_speed(iter/s)": 0.008029
},
{
"epoch": 0.1530251576685841,
"grad_norm": 5.665070056915283,
"learning_rate": 0.00019961142170284762,
"logits/chosen": -0.7021870017051697,
"logits/rejected": -0.7211427688598633,
"logps/chosen": -12.284502983093262,
"logps/rejected": -30.56876564025879,
"loss": 1.1223974227905273,
"memory(GiB)": 46.1,
"nll_loss": 0.653534471988678,
"rewards/accuracies": 0.71875,
"rewards/chosen": 0.0864773616194725,
"rewards/margins": 1.4587070941925049,
"rewards/rejected": -1.3722295761108398,
"step": 69,
"train_speed(iter/s)": 0.008034
},
{
"epoch": 0.15524291357682446,
"grad_norm": 4.089859485626221,
"learning_rate": 0.00019957838880989078,
"logits/chosen": -0.6898348331451416,
"logits/rejected": -0.6964607834815979,
"logps/chosen": -14.947086334228516,
"logps/rejected": -34.29672622680664,
"loss": 1.0402615070343018,
"memory(GiB)": 46.1,
"nll_loss": 0.540707528591156,
"rewards/accuracies": 0.65625,
"rewards/chosen": -0.036627963185310364,
"rewards/margins": 1.189173698425293,
"rewards/rejected": -1.2258018255233765,
"step": 70,
"train_speed(iter/s)": 0.008037
},
{
"epoch": 0.1574606694850648,
"grad_norm": 3.818058729171753,
"learning_rate": 0.00019954401150573222,
"logits/chosen": -0.6947743892669678,
"logits/rejected": -0.7197954654693604,
"logps/chosen": -6.173555850982666,
"logps/rejected": -28.507305145263672,
"loss": 0.8432615399360657,
"memory(GiB)": 46.1,
"nll_loss": 0.4707663655281067,
"rewards/accuracies": 0.8125,
"rewards/chosen": 0.432411789894104,
"rewards/margins": 1.5417673587799072,
"rewards/rejected": -1.1093555688858032,
"step": 71,
"train_speed(iter/s)": 0.008037
},
{
"epoch": 0.15967842539330515,
"grad_norm": 4.713813304901123,
"learning_rate": 0.00019950829025450114,
"logits/chosen": -0.6722406148910522,
"logits/rejected": -0.6857435703277588,
"logps/chosen": -7.766820430755615,
"logps/rejected": -26.340253829956055,
"loss": 0.9169723391532898,
"memory(GiB)": 46.1,
"nll_loss": 0.5056720972061157,
"rewards/accuracies": 0.78125,
"rewards/chosen": 0.1677010953426361,
"rewards/margins": 1.1372748613357544,
"rewards/rejected": -0.9695737361907959,
"step": 72,
"train_speed(iter/s)": 0.008037
},
{
"epoch": 0.1618961813015455,
"grad_norm": 3.4665582180023193,
"learning_rate": 0.00019947122553847136,
"logits/chosen": -0.7526758909225464,
"logits/rejected": -0.7613145112991333,
"logps/chosen": -14.30706787109375,
"logps/rejected": -30.180295944213867,
"loss": 0.8724768161773682,
"memory(GiB)": 46.1,
"nll_loss": 0.41890856623649597,
"rewards/accuracies": 0.75,
"rewards/chosen": 0.1295187771320343,
"rewards/margins": 1.2079225778579712,
"rewards/rejected": -1.0784037113189697,
"step": 73,
"train_speed(iter/s)": 0.00803
},
{
"epoch": 0.16411393720978584,
"grad_norm": 12.609716415405273,
"learning_rate": 0.0001994328178580548,
"logits/chosen": -0.7560169696807861,
"logits/rejected": -0.7651617527008057,
"logps/chosen": -8.213447570800781,
"logps/rejected": -43.658180236816406,
"loss": 0.9154157042503357,
"memory(GiB)": 46.1,
"nll_loss": 0.6314950585365295,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.061887748539447784,
"rewards/margins": 2.2252354621887207,
"rewards/rejected": -2.1633477210998535,
"step": 74,
"train_speed(iter/s)": 0.008027
},
{
"epoch": 0.1663316931180262,
"grad_norm": 12.707162857055664,
"learning_rate": 0.00019939306773179497,
"logits/chosen": -0.7599114775657654,
"logits/rejected": -0.7735819816589355,
"logps/chosen": -7.509787082672119,
"logps/rejected": -52.7489013671875,
"loss": 0.7145227193832397,
"memory(GiB)": 46.1,
"nll_loss": 0.30735087394714355,
"rewards/accuracies": 0.8125,
"rewards/chosen": 0.028781913220882416,
"rewards/margins": 2.859144926071167,
"rewards/rejected": -2.8303627967834473,
"step": 75,
"train_speed(iter/s)": 0.008026
},
{
"epoch": 0.16854944902626653,
"grad_norm": 4.863827705383301,
"learning_rate": 0.00019935197569635954,
"logits/chosen": -0.7566101551055908,
"logits/rejected": -0.7977889180183411,
"logps/chosen": -8.841687202453613,
"logps/rejected": -49.88290786743164,
"loss": 0.7746098637580872,
"memory(GiB)": 46.1,
"nll_loss": 0.488862007856369,
"rewards/accuracies": 0.90625,
"rewards/chosen": 0.13911329209804535,
"rewards/margins": 2.4493186473846436,
"rewards/rejected": -2.3102054595947266,
"step": 76,
"train_speed(iter/s)": 0.008025
},
{
"epoch": 0.1707672049345069,
"grad_norm": 2.638216972351074,
"learning_rate": 0.00019930954230653355,
"logits/chosen": -0.7588043808937073,
"logits/rejected": -0.7855987548828125,
"logps/chosen": -4.888318061828613,
"logps/rejected": -46.317176818847656,
"loss": 0.5076995491981506,
"memory(GiB)": 46.1,
"nll_loss": 0.2771949768066406,
"rewards/accuracies": 0.90625,
"rewards/chosen": 0.2532336711883545,
"rewards/margins": 2.56557035446167,
"rewards/rejected": -2.3123364448547363,
"step": 77,
"train_speed(iter/s)": 0.008025
},
{
"epoch": 0.17298496084274725,
"grad_norm": 3.485717296600342,
"learning_rate": 0.00019926576813521164,
"logits/chosen": -0.8214580416679382,
"logits/rejected": -0.8605206608772278,
"logps/chosen": -8.181400299072266,
"logps/rejected": -42.75120544433594,
"loss": 0.7162066698074341,
"memory(GiB)": 46.1,
"nll_loss": 0.41232535243034363,
"rewards/accuracies": 0.8125,
"rewards/chosen": 0.1498756855726242,
"rewards/margins": 2.346996784210205,
"rewards/rejected": -2.1971211433410645,
"step": 78,
"train_speed(iter/s)": 0.008024
},
{
"epoch": 0.17520271675098759,
"grad_norm": 3.2950491905212402,
"learning_rate": 0.00019922065377339036,
"logits/chosen": -0.8543375730514526,
"logits/rejected": -0.8765980005264282,
"logps/chosen": -15.666474342346191,
"logps/rejected": -36.56987380981445,
"loss": 0.8590094447135925,
"memory(GiB)": 46.1,
"nll_loss": 0.5429059863090515,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.2669352889060974,
"rewards/margins": 1.803323745727539,
"rewards/rejected": -1.5363885164260864,
"step": 79,
"train_speed(iter/s)": 0.00802
},
{
"epoch": 0.17742047265922795,
"grad_norm": 4.1412506103515625,
"learning_rate": 0.00019917419983016025,
"logits/chosen": -0.8439186215400696,
"logits/rejected": -0.9001189470291138,
"logps/chosen": -10.366392135620117,
"logps/rejected": -49.56153106689453,
"loss": 0.9545846581459045,
"memory(GiB)": 46.1,
"nll_loss": 0.7163697481155396,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.22070294618606567,
"rewards/margins": 2.2959794998168945,
"rewards/rejected": -2.0752763748168945,
"step": 80,
"train_speed(iter/s)": 0.00802
},
{
"epoch": 0.1796382285674683,
"grad_norm": 2.809291362762451,
"learning_rate": 0.00019912640693269752,
"logits/chosen": -0.7752825021743774,
"logits/rejected": -0.8082448244094849,
"logps/chosen": -6.980072021484375,
"logps/rejected": -49.13923645019531,
"loss": 0.7785353660583496,
"memory(GiB)": 46.1,
"nll_loss": 0.4162166714668274,
"rewards/accuracies": 0.8125,
"rewards/chosen": 0.3260034918785095,
"rewards/margins": 2.5372085571289062,
"rewards/rejected": -2.211205005645752,
"step": 81,
"train_speed(iter/s)": 0.008021
},
{
"epoch": 0.18185598447570864,
"grad_norm": 5.757961750030518,
"learning_rate": 0.0001990772757262558,
"logits/chosen": -0.8326177597045898,
"logits/rejected": -0.8457602262496948,
"logps/chosen": -14.738750457763672,
"logps/rejected": -50.59590530395508,
"loss": 1.1126980781555176,
"memory(GiB)": 46.1,
"nll_loss": 0.6883702874183655,
"rewards/accuracies": 0.84375,
"rewards/chosen": 0.017612110823392868,
"rewards/margins": 3.0471317768096924,
"rewards/rejected": -3.02951979637146,
"step": 82,
"train_speed(iter/s)": 0.008024
},
{
"epoch": 0.184073740383949,
"grad_norm": 43.46441650390625,
"learning_rate": 0.00019902680687415705,
"logits/chosen": -0.9140123128890991,
"logits/rejected": -0.9116270542144775,
"logps/chosen": -23.103540420532227,
"logps/rejected": -48.863033294677734,
"loss": 2.1918702125549316,
"memory(GiB)": 46.1,
"nll_loss": 1.8151426315307617,
"rewards/accuracies": 0.8125,
"rewards/chosen": -0.8213595747947693,
"rewards/margins": 2.689864158630371,
"rewards/rejected": -3.511223554611206,
"step": 83,
"train_speed(iter/s)": 0.008023
},
{
"epoch": 0.18629149629218933,
"grad_norm": 7.742120265960693,
"learning_rate": 0.000198975001057783,
"logits/chosen": -0.8376122713088989,
"logits/rejected": -0.8708577752113342,
"logps/chosen": -12.746369361877441,
"logps/rejected": -67.55133819580078,
"loss": 0.7703056335449219,
"memory(GiB)": 46.1,
"nll_loss": 0.4422933757305145,
"rewards/accuracies": 0.71875,
"rewards/chosen": 0.010235786437988281,
"rewards/margins": 4.232974529266357,
"rewards/rejected": -4.222738742828369,
"step": 84,
"train_speed(iter/s)": 0.008022
},
{
"epoch": 0.1885092522004297,
"grad_norm": 9.322490692138672,
"learning_rate": 0.00019892185897656578,
"logits/chosen": -0.8576998710632324,
"logits/rejected": -0.8946700692176819,
"logps/chosen": -16.83005142211914,
"logps/rejected": -67.54959106445312,
"loss": 1.138474464416504,
"memory(GiB)": 46.1,
"nll_loss": 0.8976783156394958,
"rewards/accuracies": 0.90625,
"rewards/chosen": -0.3624171316623688,
"rewards/margins": 4.450318813323975,
"rewards/rejected": -4.812736511230469,
"step": 85,
"train_speed(iter/s)": 0.008019
},
{
"epoch": 0.19072700810867005,
"grad_norm": 3.996424913406372,
"learning_rate": 0.00019886738134797843,
"logits/chosen": -0.8325670957565308,
"logits/rejected": -0.9040736556053162,
"logps/chosen": -9.318441390991211,
"logps/rejected": -49.33755111694336,
"loss": 0.8532267808914185,
"memory(GiB)": 46.1,
"nll_loss": 0.5119913220405579,
"rewards/accuracies": 0.84375,
"rewards/chosen": 0.10566120594739914,
"rewards/margins": 2.421614170074463,
"rewards/rejected": -2.315953254699707,
"step": 86,
"train_speed(iter/s)": 0.008018
},
{
"epoch": 0.19294476401691038,
"grad_norm": 7.568336009979248,
"learning_rate": 0.00019881156890752517,
"logits/chosen": -0.7875989079475403,
"logits/rejected": -0.8255676627159119,
"logps/chosen": -10.209391593933105,
"logps/rejected": -38.12163162231445,
"loss": 1.1016978025436401,
"memory(GiB)": 46.1,
"nll_loss": 0.5710477828979492,
"rewards/accuracies": 0.78125,
"rewards/chosen": -0.12029634416103363,
"rewards/margins": 1.949970006942749,
"rewards/rejected": -2.0702662467956543,
"step": 87,
"train_speed(iter/s)": 0.008019
},
{
"epoch": 0.19516251992515074,
"grad_norm": 4.460707187652588,
"learning_rate": 0.00019875442240873173,
"logits/chosen": -0.7924566268920898,
"logits/rejected": -0.7932747602462769,
"logps/chosen": -10.550544738769531,
"logps/rejected": -29.39406967163086,
"loss": 0.8096880912780762,
"memory(GiB)": 46.1,
"nll_loss": 0.42373886704444885,
"rewards/accuracies": 0.8125,
"rewards/chosen": 0.3358071446418762,
"rewards/margins": 1.8472529649734497,
"rewards/rejected": -1.5114457607269287,
"step": 88,
"train_speed(iter/s)": 0.00802
},
{
"epoch": 0.1973802758333911,
"grad_norm": 3.9834723472595215,
"learning_rate": 0.0001986959426231349,
"logits/chosen": -0.7446599006652832,
"logits/rejected": -0.7426899075508118,
"logps/chosen": -12.930614471435547,
"logps/rejected": -26.922080993652344,
"loss": 1.132792592048645,
"memory(GiB)": 46.1,
"nll_loss": 0.5469169616699219,
"rewards/accuracies": 0.625,
"rewards/chosen": -0.048162102699279785,
"rewards/margins": 0.6297942996025085,
"rewards/rejected": -0.6779564619064331,
"step": 89,
"train_speed(iter/s)": 0.008023
},
{
"epoch": 0.19959803174163143,
"grad_norm": 4.092418193817139,
"learning_rate": 0.00019863613034027224,
"logits/chosen": -0.7061215043067932,
"logits/rejected": -0.7569677233695984,
"logps/chosen": -6.195008754730225,
"logps/rejected": -34.00957489013672,
"loss": 0.8494804501533508,
"memory(GiB)": 46.1,
"nll_loss": 0.4875006675720215,
"rewards/accuracies": 0.84375,
"rewards/chosen": 0.26478877663612366,
"rewards/margins": 1.2916200160980225,
"rewards/rejected": -1.0268312692642212,
"step": 90,
"train_speed(iter/s)": 0.008024
},
{
"epoch": 0.2018157876498718,
"grad_norm": 3.3873367309570312,
"learning_rate": 0.00019857498636767143,
"logits/chosen": -0.6566476225852966,
"logits/rejected": -0.7009319067001343,
"logps/chosen": -6.160096645355225,
"logps/rejected": -30.111385345458984,
"loss": 0.8439165949821472,
"memory(GiB)": 46.1,
"nll_loss": 0.5105728507041931,
"rewards/accuracies": 0.90625,
"rewards/chosen": 0.41078829765319824,
"rewards/margins": 1.2888054847717285,
"rewards/rejected": -0.8780173063278198,
"step": 91,
"train_speed(iter/s)": 0.008022
},
{
"epoch": 0.20403354355811212,
"grad_norm": 2.58686900138855,
"learning_rate": 0.0001985125115308393,
"logits/chosen": -0.7298556566238403,
"logits/rejected": -0.7364020347595215,
"logps/chosen": -9.868298530578613,
"logps/rejected": -22.635440826416016,
"loss": 0.8916825652122498,
"memory(GiB)": 46.1,
"nll_loss": 0.466416597366333,
"rewards/accuracies": 0.8125,
"rewards/chosen": 0.39984455704689026,
"rewards/margins": 0.953176736831665,
"rewards/rejected": -0.5533321499824524,
"step": 92,
"train_speed(iter/s)": 0.008021
},
{
"epoch": 0.20625129946635248,
"grad_norm": 2.869520902633667,
"learning_rate": 0.00019844870667325073,
"logits/chosen": -0.6459857821464539,
"logits/rejected": -0.6821721792221069,
"logps/chosen": -10.646278381347656,
"logps/rejected": -33.94523620605469,
"loss": 0.8635712265968323,
"memory(GiB)": 46.1,
"nll_loss": 0.40875259041786194,
"rewards/accuracies": 0.84375,
"rewards/chosen": 0.17814505100250244,
"rewards/margins": 1.1260223388671875,
"rewards/rejected": -0.9478773474693298,
"step": 93,
"train_speed(iter/s)": 0.008017
},
{
"epoch": 0.20846905537459284,
"grad_norm": 2.5596885681152344,
"learning_rate": 0.00019838357265633728,
"logits/chosen": -0.6933214068412781,
"logits/rejected": -0.7294182777404785,
"logps/chosen": -9.423470497131348,
"logps/rejected": -28.46645164489746,
"loss": 0.8668123483657837,
"memory(GiB)": 46.1,
"nll_loss": 0.4432825744152069,
"rewards/accuracies": 0.71875,
"rewards/chosen": 0.2616448402404785,
"rewards/margins": 1.0607826709747314,
"rewards/rejected": -0.7991377711296082,
"step": 94,
"train_speed(iter/s)": 0.008017
},
{
"epoch": 0.21068681128283318,
"grad_norm": 2.987144947052002,
"learning_rate": 0.0001983171103594755,
"logits/chosen": -0.7186170816421509,
"logits/rejected": -0.7554275989532471,
"logps/chosen": -13.879290580749512,
"logps/rejected": -41.82307434082031,
"loss": 0.8854122161865234,
"memory(GiB)": 46.1,
"nll_loss": 0.5749840140342712,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.34967276453971863,
"rewards/margins": 2.095144510269165,
"rewards/rejected": -1.7454715967178345,
"step": 95,
"train_speed(iter/s)": 0.008022
},
{
"epoch": 0.21290456719107353,
"grad_norm": 4.350345134735107,
"learning_rate": 0.00019824932067997515,
"logits/chosen": -0.6538293361663818,
"logits/rejected": -0.7083633542060852,
"logps/chosen": -13.237122535705566,
"logps/rejected": -43.02968215942383,
"loss": 1.1358224153518677,
"memory(GiB)": 46.1,
"nll_loss": 0.7784836292266846,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.17013956606388092,
"rewards/margins": 2.1158745288848877,
"rewards/rejected": -1.945734977722168,
"step": 96,
"train_speed(iter/s)": 0.008026
},
{
"epoch": 0.2151223230993139,
"grad_norm": 10.145339965820312,
"learning_rate": 0.00019818020453306697,
"logits/chosen": -0.7033687829971313,
"logits/rejected": -0.7348278760910034,
"logps/chosen": -9.687533378601074,
"logps/rejected": -38.41090774536133,
"loss": 0.9101305603981018,
"memory(GiB)": 46.1,
"nll_loss": 0.6460333466529846,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.22131364047527313,
"rewards/margins": 2.366105079650879,
"rewards/rejected": -2.1447913646698,
"step": 97,
"train_speed(iter/s)": 0.008028
},
{
"epoch": 0.21734007900755423,
"grad_norm": 4.888674736022949,
"learning_rate": 0.00019810976285189038,
"logits/chosen": -0.6517484784126282,
"logits/rejected": -0.6647759079933167,
"logps/chosen": -11.991264343261719,
"logps/rejected": -40.05374526977539,
"loss": 0.7888365983963013,
"memory(GiB)": 46.1,
"nll_loss": 0.5127142667770386,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.08162616193294525,
"rewards/margins": 2.0730180740356445,
"rewards/rejected": -1.9913920164108276,
"step": 98,
"train_speed(iter/s)": 0.008028
},
{
"epoch": 0.2195578349157946,
"grad_norm": 2.9053163528442383,
"learning_rate": 0.00019803799658748094,
"logits/chosen": -0.6322453618049622,
"logits/rejected": -0.6195716261863708,
"logps/chosen": -11.029327392578125,
"logps/rejected": -27.67604637145996,
"loss": 0.8408295512199402,
"memory(GiB)": 46.1,
"nll_loss": 0.44112899899482727,
"rewards/accuracies": 0.75,
"rewards/chosen": 0.332018107175827,
"rewards/margins": 1.5282344818115234,
"rewards/rejected": -1.196216344833374,
"step": 99,
"train_speed(iter/s)": 0.00803
},
{
"epoch": 0.22177559082403492,
"grad_norm": 3.9380838871002197,
"learning_rate": 0.0001979649067087574,
"logits/chosen": -0.6178653240203857,
"logits/rejected": -0.6780340075492859,
"logps/chosen": -6.1165595054626465,
"logps/rejected": -48.394866943359375,
"loss": 0.6825374960899353,
"memory(GiB)": 46.1,
"nll_loss": 0.3889180123806,
"rewards/accuracies": 0.84375,
"rewards/chosen": 0.35112470388412476,
"rewards/margins": 2.020500421524048,
"rewards/rejected": -1.6693755388259888,
"step": 100,
"train_speed(iter/s)": 0.008028
},
{
"epoch": 0.22399334673227528,
"grad_norm": 4.091344356536865,
"learning_rate": 0.0001978904942025087,
"logits/chosen": -0.5362146496772766,
"logits/rejected": -0.5435670018196106,
"logps/chosen": -10.14964485168457,
"logps/rejected": -33.93182373046875,
"loss": 0.8511705994606018,
"memory(GiB)": 46.1,
"nll_loss": 0.4244406819343567,
"rewards/accuracies": 0.71875,
"rewards/chosen": -0.0012584757059812546,
"rewards/margins": 1.5515294075012207,
"rewards/rejected": -1.5527877807617188,
"step": 101,
"train_speed(iter/s)": 0.008013
},
{
"epoch": 0.22621110264051564,
"grad_norm": 3.6777844429016113,
"learning_rate": 0.00019781476007338058,
"logits/chosen": -0.519984245300293,
"logits/rejected": -0.5302433371543884,
"logps/chosen": -12.393686294555664,
"logps/rejected": -28.21156883239746,
"loss": 0.9213598966598511,
"memory(GiB)": 46.1,
"nll_loss": 0.5426865816116333,
"rewards/accuracies": 0.78125,
"rewards/chosen": 0.25866204500198364,
"rewards/margins": 1.387097954750061,
"rewards/rejected": -1.1284359693527222,
"step": 102,
"train_speed(iter/s)": 0.008018
},
{
"epoch": 0.22842885854875597,
"grad_norm": 2.3189024925231934,
"learning_rate": 0.0001977377053438621,
"logits/chosen": -0.6001867651939392,
"logits/rejected": -0.632231593132019,
"logps/chosen": -7.773558616638184,
"logps/rejected": -34.698673248291016,
"loss": 0.7014553546905518,
"memory(GiB)": 46.1,
"nll_loss": 0.3608202338218689,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.3325607180595398,
"rewards/margins": 1.3831188678741455,
"rewards/rejected": -1.0505582094192505,
"step": 103,
"train_speed(iter/s)": 0.008017
},
{
"epoch": 0.23064661445699633,
"grad_norm": 3.2740068435668945,
"learning_rate": 0.0001976593310542718,
"logits/chosen": -0.578256368637085,
"logits/rejected": -0.5909325480461121,
"logps/chosen": -6.1796793937683105,
"logps/rejected": -30.154891967773438,
"loss": 0.8033835887908936,
"memory(GiB)": 46.1,
"nll_loss": 0.39110761880874634,
"rewards/accuracies": 0.78125,
"rewards/chosen": 0.1742677092552185,
"rewards/margins": 1.1370247602462769,
"rewards/rejected": -0.9627571702003479,
"step": 104,
"train_speed(iter/s)": 0.00802
},
{
"epoch": 0.2328643703652367,
"grad_norm": 3.2135934829711914,
"learning_rate": 0.00019757963826274357,
"logits/chosen": -0.5837016105651855,
"logits/rejected": -0.588310182094574,
"logps/chosen": -9.729472160339355,
"logps/rejected": -34.4300422668457,
"loss": 0.8487012386322021,
"memory(GiB)": 46.1,
"nll_loss": 0.37863489985466003,
"rewards/accuracies": 0.75,
"rewards/chosen": 0.037823110818862915,
"rewards/margins": 1.5622057914733887,
"rewards/rejected": -1.5243828296661377,
"step": 105,
"train_speed(iter/s)": 0.008018
},
{
"epoch": 0.23508212627347702,
"grad_norm": 3.867928981781006,
"learning_rate": 0.00019749862804521254,
"logits/chosen": -0.5833920836448669,
"logits/rejected": -0.5896369218826294,
"logps/chosen": -14.619677543640137,
"logps/rejected": -39.831119537353516,
"loss": 1.0550124645233154,
"memory(GiB)": 46.1,
"nll_loss": 0.6425492763519287,
"rewards/accuracies": 0.75,
"rewards/chosen": 0.002796528860926628,
"rewards/margins": 1.8236141204833984,
"rewards/rejected": -1.8208175897598267,
"step": 106,
"train_speed(iter/s)": 0.008015
},
{
"epoch": 0.23729988218171738,
"grad_norm": 4.911788463592529,
"learning_rate": 0.00019741630149540035,
"logits/chosen": -0.6418726444244385,
"logits/rejected": -0.6708973050117493,
"logps/chosen": -8.22497272491455,
"logps/rejected": -45.075836181640625,
"loss": 0.7518470287322998,
"memory(GiB)": 46.1,
"nll_loss": 0.4536428451538086,
"rewards/accuracies": 0.84375,
"rewards/chosen": -0.12467997521162033,
"rewards/margins": 2.3994452953338623,
"rewards/rejected": -2.524125337600708,
"step": 107,
"train_speed(iter/s)": 0.008018
},
{
"epoch": 0.2395176380899577,
"grad_norm": 4.135776519775391,
"learning_rate": 0.0001973326597248006,
"logits/chosen": -0.6478183269500732,
"logits/rejected": -0.6533663272857666,
"logps/chosen": -6.512712001800537,
"logps/rejected": -40.08877944946289,
"loss": 0.690629243850708,
"memory(GiB)": 46.1,
"nll_loss": 0.3907169997692108,
"rewards/accuracies": 0.84375,
"rewards/chosen": 0.21786418557167053,
"rewards/margins": 2.6031618118286133,
"rewards/rejected": -2.3852977752685547,
"step": 108,
"train_speed(iter/s)": 0.008018
},
{
"epoch": 0.24173539399819807,
"grad_norm": 4.422867298126221,
"learning_rate": 0.00019724770386266363,
"logits/chosen": -0.6119152307510376,
"logits/rejected": -0.6426375508308411,
"logps/chosen": -7.145269870758057,
"logps/rejected": -49.40720748901367,
"loss": 0.6389705538749695,
"memory(GiB)": 46.1,
"nll_loss": 0.3778725564479828,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.0635518729686737,
"rewards/margins": 2.8675644397735596,
"rewards/rejected": -2.8040125370025635,
"step": 109,
"train_speed(iter/s)": 0.008019
},
{
"epoch": 0.24395314990643843,
"grad_norm": 6.416353702545166,
"learning_rate": 0.0001971614350559814,
"logits/chosen": -0.5623615384101868,
"logits/rejected": -0.5931446552276611,
"logps/chosen": -7.337302207946777,
"logps/rejected": -48.94050979614258,
"loss": 0.5740457773208618,
"memory(GiB)": 46.1,
"nll_loss": 0.42228132486343384,
"rewards/accuracies": 0.96875,
"rewards/chosen": 0.6646949052810669,
"rewards/margins": 3.210062026977539,
"rewards/rejected": -2.545367479324341,
"step": 110,
"train_speed(iter/s)": 0.00802
},
{
"epoch": 0.24617090581467876,
"grad_norm": 2.363133668899536,
"learning_rate": 0.000197073854469472,
"logits/chosen": -0.6107865571975708,
"logits/rejected": -0.6239950060844421,
"logps/chosen": -10.528251647949219,
"logps/rejected": -37.559669494628906,
"loss": 0.7298096418380737,
"memory(GiB)": 46.1,
"nll_loss": 0.4291239082813263,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.32069048285484314,
"rewards/margins": 2.222153663635254,
"rewards/rejected": -1.9014630317687988,
"step": 111,
"train_speed(iter/s)": 0.008017
},
{
"epoch": 0.24838866172291912,
"grad_norm": 4.300288677215576,
"learning_rate": 0.00019698496328556396,
"logits/chosen": -0.6013592481613159,
"logits/rejected": -0.6298633217811584,
"logps/chosen": -12.510583877563477,
"logps/rejected": -36.04363250732422,
"loss": 0.9174787998199463,
"memory(GiB)": 46.1,
"nll_loss": 0.5793477296829224,
"rewards/accuracies": 0.84375,
"rewards/chosen": 0.19869008660316467,
"rewards/margins": 1.6629492044448853,
"rewards/rejected": -1.4642590284347534,
"step": 112,
"train_speed(iter/s)": 0.008015
},
{
"epoch": 0.2506064176311595,
"grad_norm": 7.3313493728637695,
"learning_rate": 0.00019689476270438004,
"logits/chosen": -0.5540329217910767,
"logits/rejected": -0.5571173429489136,
"logps/chosen": -8.091080665588379,
"logps/rejected": -27.752933502197266,
"loss": 0.8949199914932251,
"memory(GiB)": 46.1,
"nll_loss": 0.4742899537086487,
"rewards/accuracies": 0.78125,
"rewards/chosen": 0.1788148581981659,
"rewards/margins": 1.2291390895843506,
"rewards/rejected": -1.0503242015838623,
"step": 113,
"train_speed(iter/s)": 0.008016
},
{
"epoch": 0.25282417353939984,
"grad_norm": 2.6731913089752197,
"learning_rate": 0.0001968032539437215,
"logits/chosen": -0.5931655764579773,
"logits/rejected": -0.6056005358695984,
"logps/chosen": -5.9029951095581055,
"logps/rejected": -40.255130767822266,
"loss": 0.6467551589012146,
"memory(GiB)": 46.1,
"nll_loss": 0.4438669979572296,
"rewards/accuracies": 0.96875,
"rewards/chosen": 0.24888494610786438,
"rewards/margins": 2.4213175773620605,
"rewards/rejected": -2.1724328994750977,
"step": 114,
"train_speed(iter/s)": 0.008016
},
{
"epoch": 0.25504192944764015,
"grad_norm": 2.6930527687072754,
"learning_rate": 0.0001967104382390511,
"logits/chosen": -0.6651092767715454,
"logits/rejected": -0.6895506978034973,
"logps/chosen": -9.578208923339844,
"logps/rejected": -34.64287185668945,
"loss": 0.7224618792533875,
"memory(GiB)": 46.1,
"nll_loss": 0.4180094599723816,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.3409712314605713,
"rewards/margins": 2.1104307174682617,
"rewards/rejected": -1.7694597244262695,
"step": 115,
"train_speed(iter/s)": 0.008012
},
{
"epoch": 0.2572596853558805,
"grad_norm": 3.387476682662964,
"learning_rate": 0.00019661631684347685,
"logits/chosen": -0.6467074155807495,
"logits/rejected": -0.6696929335594177,
"logps/chosen": -12.390437126159668,
"logps/rejected": -44.5852165222168,
"loss": 0.9567733407020569,
"memory(GiB)": 46.1,
"nll_loss": 0.5903316736221313,
"rewards/accuracies": 0.8125,
"rewards/chosen": 0.06747841835021973,
"rewards/margins": 1.779471755027771,
"rewards/rejected": -1.7119932174682617,
"step": 116,
"train_speed(iter/s)": 0.00801
},
{
"epoch": 0.25947744126412087,
"grad_norm": 3.1305816173553467,
"learning_rate": 0.00019652089102773488,
"logits/chosen": -0.6367936730384827,
"logits/rejected": -0.6425185203552246,
"logps/chosen": -11.601859092712402,
"logps/rejected": -36.16029739379883,
"loss": 0.9545689821243286,
"memory(GiB)": 46.1,
"nll_loss": 0.5791404247283936,
"rewards/accuracies": 0.84375,
"rewards/chosen": 0.139948308467865,
"rewards/margins": 1.7838351726531982,
"rewards/rejected": -1.6438865661621094,
"step": 117,
"train_speed(iter/s)": 0.008009
},
{
"epoch": 0.2616951971723612,
"grad_norm": 5.935551166534424,
"learning_rate": 0.0001964241620801724,
"logits/chosen": -0.7171432375907898,
"logits/rejected": -0.7515658140182495,
"logps/chosen": -12.206275939941406,
"logps/rejected": -41.78958511352539,
"loss": 1.0742188692092896,
"memory(GiB)": 46.1,
"nll_loss": 0.6272014379501343,
"rewards/accuracies": 0.75,
"rewards/chosen": -0.12931828200817108,
"rewards/margins": 1.775916576385498,
"rewards/rejected": -1.905234932899475,
"step": 118,
"train_speed(iter/s)": 0.008012
},
{
"epoch": 0.2639129530806016,
"grad_norm": 3.182480812072754,
"learning_rate": 0.0001963261313067302,
"logits/chosen": -0.6834742426872253,
"logits/rejected": -0.7226250171661377,
"logps/chosen": -6.070950984954834,
"logps/rejected": -34.18709182739258,
"loss": 0.8980444073677063,
"memory(GiB)": 46.1,
"nll_loss": 0.4420132637023926,
"rewards/accuracies": 0.65625,
"rewards/chosen": 0.2397366762161255,
"rewards/margins": 1.7652424573898315,
"rewards/rejected": -1.5255059003829956,
"step": 119,
"train_speed(iter/s)": 0.008013
},
{
"epoch": 0.2661307089888419,
"grad_norm": 4.235217094421387,
"learning_rate": 0.00019622680003092503,
"logits/chosen": -0.7337202429771423,
"logits/rejected": -0.7412666082382202,
"logps/chosen": -13.724693298339844,
"logps/rejected": -46.71962356567383,
"loss": 0.9812621474266052,
"memory(GiB)": 46.1,
"nll_loss": 0.6411746144294739,
"rewards/accuracies": 0.8125,
"rewards/chosen": -0.09581395983695984,
"rewards/margins": 2.239417552947998,
"rewards/rejected": -2.335231304168701,
"step": 120,
"train_speed(iter/s)": 0.008015
},
{
"epoch": 0.26834846489708225,
"grad_norm": 2.509409189224243,
"learning_rate": 0.0001961261695938319,
"logits/chosen": -0.6983414888381958,
"logits/rejected": -0.7302532196044922,
"logps/chosen": -12.647697448730469,
"logps/rejected": -47.85969161987305,
"loss": 0.7407037019729614,
"memory(GiB)": 46.1,
"nll_loss": 0.4768805503845215,
"rewards/accuracies": 0.8125,
"rewards/chosen": 0.3689803183078766,
"rewards/margins": 3.114835023880005,
"rewards/rejected": -2.745854377746582,
"step": 121,
"train_speed(iter/s)": 0.008014
},
{
"epoch": 0.2705662208053226,
"grad_norm": 3.401812791824341,
"learning_rate": 0.00019602424135406569,
"logits/chosen": -0.7398380041122437,
"logits/rejected": -0.7770130634307861,
"logps/chosen": -9.498916625976562,
"logps/rejected": -52.57138442993164,
"loss": 0.6471344828605652,
"memory(GiB)": 46.1,
"nll_loss": 0.46904683113098145,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.18257564306259155,
"rewards/margins": 3.0506017208099365,
"rewards/rejected": -2.868025779724121,
"step": 122,
"train_speed(iter/s)": 0.008015
},
{
"epoch": 0.27278397671356297,
"grad_norm": 3.7279372215270996,
"learning_rate": 0.00019592101668776298,
"logits/chosen": -0.7581114768981934,
"logits/rejected": -0.7886280417442322,
"logps/chosen": -8.954914093017578,
"logps/rejected": -49.436580657958984,
"loss": 0.7794913649559021,
"memory(GiB)": 46.1,
"nll_loss": 0.42245572805404663,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.24546337127685547,
"rewards/margins": 2.368910789489746,
"rewards/rejected": -2.1234471797943115,
"step": 123,
"train_speed(iter/s)": 0.008011
},
{
"epoch": 0.27500173262180333,
"grad_norm": 2.763056993484497,
"learning_rate": 0.00019581649698856358,
"logits/chosen": -0.754249632358551,
"logits/rejected": -0.7789746522903442,
"logps/chosen": -6.999545097351074,
"logps/rejected": -54.994590759277344,
"loss": 0.49618056416511536,
"memory(GiB)": 46.1,
"nll_loss": 0.30507829785346985,
"rewards/accuracies": 0.96875,
"rewards/chosen": 0.30616074800491333,
"rewards/margins": 3.148125171661377,
"rewards/rejected": -2.8419644832611084,
"step": 124,
"train_speed(iter/s)": 0.008007
},
{
"epoch": 0.2772194885300437,
"grad_norm": 4.055456638336182,
"learning_rate": 0.00019571068366759143,
"logits/chosen": -0.7367149591445923,
"logits/rejected": -0.7724103331565857,
"logps/chosen": -7.0940070152282715,
"logps/rejected": -38.532779693603516,
"loss": 0.8412638306617737,
"memory(GiB)": 46.1,
"nll_loss": 0.5069564580917358,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.26311713457107544,
"rewards/margins": 2.167259693145752,
"rewards/rejected": -1.9041424989700317,
"step": 125,
"train_speed(iter/s)": 0.008011
},
{
"epoch": 0.279437244438284,
"grad_norm": 7.62572717666626,
"learning_rate": 0.00019560357815343577,
"logits/chosen": -0.7477836608886719,
"logits/rejected": -0.771050214767456,
"logps/chosen": -9.567910194396973,
"logps/rejected": -41.98735809326172,
"loss": 0.6985211968421936,
"memory(GiB)": 46.1,
"nll_loss": 0.3839423358440399,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.3293745815753937,
"rewards/margins": 2.38517165184021,
"rewards/rejected": -2.0557968616485596,
"step": 126,
"train_speed(iter/s)": 0.008012
},
{
"epoch": 0.28165500034652435,
"grad_norm": 9.083622932434082,
"learning_rate": 0.0001954951818921318,
"logits/chosen": -0.6845836639404297,
"logits/rejected": -0.7126042246818542,
"logps/chosen": -10.922572135925293,
"logps/rejected": -50.7385368347168,
"loss": 0.7883904576301575,
"memory(GiB)": 46.1,
"nll_loss": 0.45509275794029236,
"rewards/accuracies": 0.78125,
"rewards/chosen": 0.08339966833591461,
"rewards/margins": 2.7709593772888184,
"rewards/rejected": -2.6875598430633545,
"step": 127,
"train_speed(iter/s)": 0.008012
},
{
"epoch": 0.2838727562547647,
"grad_norm": 6.918692111968994,
"learning_rate": 0.00019538549634714108,
"logits/chosen": -0.7463397979736328,
"logits/rejected": -0.7875937819480896,
"logps/chosen": -6.1263532638549805,
"logps/rejected": -56.90166091918945,
"loss": 0.5629154443740845,
"memory(GiB)": 46.1,
"nll_loss": 0.3863481283187866,
"rewards/accuracies": 0.96875,
"rewards/chosen": 0.3725871443748474,
"rewards/margins": 3.788067579269409,
"rewards/rejected": -3.415480375289917,
"step": 128,
"train_speed(iter/s)": 0.008013
},
{
"epoch": 0.2860905121630051,
"grad_norm": 3.020493507385254,
"learning_rate": 0.0001952745229993319,
"logits/chosen": -0.6778846383094788,
"logits/rejected": -0.7200884819030762,
"logps/chosen": -8.347317695617676,
"logps/rejected": -45.266326904296875,
"loss": 0.6461578011512756,
"memory(GiB)": 46.1,
"nll_loss": 0.4276276230812073,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.32448530197143555,
"rewards/margins": 2.904148578643799,
"rewards/rejected": -2.5796632766723633,
"step": 129,
"train_speed(iter/s)": 0.008013
},
{
"epoch": 0.28830826807124543,
"grad_norm": 6.105565071105957,
"learning_rate": 0.0001951622633469592,
"logits/chosen": -0.6739642024040222,
"logits/rejected": -0.7229712009429932,
"logps/chosen": -9.595758438110352,
"logps/rejected": -61.285579681396484,
"loss": 0.524199366569519,
"memory(GiB)": 46.1,
"nll_loss": 0.3470918536186218,
"rewards/accuracies": 0.90625,
"rewards/chosen": 0.26431241631507874,
"rewards/margins": 3.8313231468200684,
"rewards/rejected": -3.5670104026794434,
"step": 130,
"train_speed(iter/s)": 0.00801
},
{
"epoch": 0.29052602397948574,
"grad_norm": 3.1043567657470703,
"learning_rate": 0.0001950487189056443,
"logits/chosen": -0.725166916847229,
"logits/rejected": -0.7790873646736145,
"logps/chosen": -6.4268879890441895,
"logps/rejected": -45.298736572265625,
"loss": 0.7616266012191772,
"memory(GiB)": 46.1,
"nll_loss": 0.4726749062538147,
"rewards/accuracies": 0.90625,
"rewards/chosen": 0.20096376538276672,
"rewards/margins": 2.216933250427246,
"rewards/rejected": -2.0159695148468018,
"step": 131,
"train_speed(iter/s)": 0.008009
},
{
"epoch": 0.2927437798877261,
"grad_norm": 4.7475457191467285,
"learning_rate": 0.00019493389120835462,
"logits/chosen": -0.7168976068496704,
"logits/rejected": -0.7184516191482544,
"logps/chosen": -8.480973243713379,
"logps/rejected": -39.217987060546875,
"loss": 0.6954407691955566,
"memory(GiB)": 46.1,
"nll_loss": 0.3810206949710846,
"rewards/accuracies": 0.90625,
"rewards/chosen": 0.1063593327999115,
"rewards/margins": 2.2143924236297607,
"rewards/rejected": -2.1080331802368164,
"step": 132,
"train_speed(iter/s)": 0.008009
},
{
"epoch": 0.29496153579596646,
"grad_norm": 2.6074578762054443,
"learning_rate": 0.0001948177818053827,
"logits/chosen": -0.7467566132545471,
"logits/rejected": -0.7593668699264526,
"logps/chosen": -5.696949005126953,
"logps/rejected": -39.8399543762207,
"loss": 0.5127253532409668,
"memory(GiB)": 46.1,
"nll_loss": 0.2950189709663391,
"rewards/accuracies": 0.90625,
"rewards/chosen": 0.28634998202323914,
"rewards/margins": 2.5809803009033203,
"rewards/rejected": -2.2946300506591797,
"step": 133,
"train_speed(iter/s)": 0.008008
},
{
"epoch": 0.2971792917042068,
"grad_norm": 2.2834794521331787,
"learning_rate": 0.0001947003922643256,
"logits/chosen": -0.6837459802627563,
"logits/rejected": -0.7182618975639343,
"logps/chosen": -6.691904067993164,
"logps/rejected": -50.19198226928711,
"loss": 0.4669988751411438,
"memory(GiB)": 46.1,
"nll_loss": 0.2525062561035156,
"rewards/accuracies": 0.96875,
"rewards/chosen": 0.3388081192970276,
"rewards/margins": 2.9852235317230225,
"rewards/rejected": -2.6464154720306396,
"step": 134,
"train_speed(iter/s)": 0.008008
},
{
"epoch": 0.2993970476124472,
"grad_norm": 3.200366497039795,
"learning_rate": 0.00019458172417006347,
"logits/chosen": -0.7646272778511047,
"logits/rejected": -0.7724561095237732,
"logps/chosen": -11.684989929199219,
"logps/rejected": -54.008689880371094,
"loss": 0.6327359676361084,
"memory(GiB)": 46.1,
"nll_loss": 0.4540945291519165,
"rewards/accuracies": 0.90625,
"rewards/chosen": 0.0852358415722847,
"rewards/margins": 3.4554994106292725,
"rewards/rejected": -3.3702638149261475,
"step": 135,
"train_speed(iter/s)": 0.008008
},
{
"epoch": 0.3016148035206875,
"grad_norm": 3.3365910053253174,
"learning_rate": 0.0001944617791247383,
"logits/chosen": -0.7103350162506104,
"logits/rejected": -0.7452230453491211,
"logps/chosen": -8.785733222961426,
"logps/rejected": -54.68450927734375,
"loss": 0.5810406804084778,
"memory(GiB)": 46.1,
"nll_loss": 0.34376901388168335,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.027914080768823624,
"rewards/margins": 3.3302230834960938,
"rewards/rejected": -3.302309036254883,
"step": 136,
"train_speed(iter/s)": 0.008009
},
{
"epoch": 0.30383255942892784,
"grad_norm": 2.9257876873016357,
"learning_rate": 0.00019434055874773215,
"logits/chosen": -0.8141021132469177,
"logits/rejected": -0.8318851590156555,
"logps/chosen": -9.164875984191895,
"logps/rejected": -67.25471496582031,
"loss": 0.5762239098548889,
"memory(GiB)": 46.1,
"nll_loss": 0.38338595628738403,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.13336460292339325,
"rewards/margins": 4.796402454376221,
"rewards/rejected": -4.66303825378418,
"step": 137,
"train_speed(iter/s)": 0.008011
},
{
"epoch": 0.3060503153371682,
"grad_norm": 11.465249061584473,
"learning_rate": 0.00019421806467564544,
"logits/chosen": -0.8505054712295532,
"logits/rejected": -0.8561327457427979,
"logps/chosen": -14.665526390075684,
"logps/rejected": -62.366455078125,
"loss": 1.0324087142944336,
"memory(GiB)": 46.1,
"nll_loss": 0.8431021571159363,
"rewards/accuracies": 0.90625,
"rewards/chosen": -0.13415789604187012,
"rewards/margins": 4.457357883453369,
"rewards/rejected": -4.591516017913818,
"step": 138,
"train_speed(iter/s)": 0.008009
},
{
"epoch": 0.30826807124540856,
"grad_norm": 9.11307144165039,
"learning_rate": 0.00019409429856227485,
"logits/chosen": -0.8643976449966431,
"logits/rejected": -0.8899680376052856,
"logps/chosen": -15.65466022491455,
"logps/rejected": -67.30322265625,
"loss": 0.9621648192405701,
"memory(GiB)": 46.1,
"nll_loss": 0.6606032848358154,
"rewards/accuracies": 0.90625,
"rewards/chosen": -0.6521536111831665,
"rewards/margins": 4.181577205657959,
"rewards/rejected": -4.833731174468994,
"step": 139,
"train_speed(iter/s)": 0.008006
},
{
"epoch": 0.3104858271536489,
"grad_norm": 4.7639479637146,
"learning_rate": 0.00019396926207859084,
"logits/chosen": -0.801943302154541,
"logits/rejected": -0.8345421552658081,
"logps/chosen": -12.861966133117676,
"logps/rejected": -66.0527114868164,
"loss": 0.8016439080238342,
"memory(GiB)": 46.1,
"nll_loss": 0.5596946477890015,
"rewards/accuracies": 0.90625,
"rewards/chosen": -0.06389661133289337,
"rewards/margins": 4.517420291900635,
"rewards/rejected": -4.581316947937012,
"step": 140,
"train_speed(iter/s)": 0.008006
},
{
"epoch": 0.3127035830618892,
"grad_norm": 2.60500431060791,
"learning_rate": 0.00019384295691271522,
"logits/chosen": -0.7634690999984741,
"logits/rejected": -0.7890049815177917,
"logps/chosen": -14.464373588562012,
"logps/rejected": -45.3537712097168,
"loss": 0.7553504109382629,
"memory(GiB)": 46.1,
"nll_loss": 0.4683433771133423,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.1130230501294136,
"rewards/margins": 2.7340469360351562,
"rewards/rejected": -2.6210238933563232,
"step": 141,
"train_speed(iter/s)": 0.008008
},
{
"epoch": 0.3149213389701296,
"grad_norm": 14.524946212768555,
"learning_rate": 0.0001937153847698983,
"logits/chosen": -0.7227780818939209,
"logits/rejected": -0.7420411705970764,
"logps/chosen": -15.700582504272461,
"logps/rejected": -41.36809539794922,
"loss": 1.1037310361862183,
"memory(GiB)": 46.1,
"nll_loss": 0.6305118799209595,
"rewards/accuracies": 0.84375,
"rewards/chosen": 0.0189147237688303,
"rewards/margins": 2.218311071395874,
"rewards/rejected": -2.1993966102600098,
"step": 142,
"train_speed(iter/s)": 0.008012
},
{
"epoch": 0.31713909487836994,
"grad_norm": 2.8219783306121826,
"learning_rate": 0.00019358654737249592,
"logits/chosen": -0.6690309643745422,
"logits/rejected": -0.7185367345809937,
"logps/chosen": -14.496091842651367,
"logps/rejected": -48.948814392089844,
"loss": 0.785977840423584,
"memory(GiB)": 46.1,
"nll_loss": 0.508230984210968,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.3897581100463867,
"rewards/margins": 2.4535489082336426,
"rewards/rejected": -2.063790798187256,
"step": 143,
"train_speed(iter/s)": 0.008013
},
{
"epoch": 0.3193568507866103,
"grad_norm": 3.476428270339966,
"learning_rate": 0.0001934564464599461,
"logits/chosen": -0.6897503137588501,
"logits/rejected": -0.7208132743835449,
"logps/chosen": -7.115019798278809,
"logps/rejected": -35.45432662963867,
"loss": 0.6814590692520142,
"memory(GiB)": 46.1,
"nll_loss": 0.3637453615665436,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.2670714855194092,
"rewards/margins": 1.9641859531402588,
"rewards/rejected": -1.6971145868301392,
"step": 144,
"train_speed(iter/s)": 0.008017
},
{
"epoch": 0.32157460669485066,
"grad_norm": 4.858798503875732,
"learning_rate": 0.0001933250837887457,
"logits/chosen": -0.6452350616455078,
"logits/rejected": -0.6644193530082703,
"logps/chosen": -11.701910018920898,
"logps/rejected": -29.85957908630371,
"loss": 1.0518276691436768,
"memory(GiB)": 46.1,
"nll_loss": 0.5833199620246887,
"rewards/accuracies": 0.78125,
"rewards/chosen": 0.1761394739151001,
"rewards/margins": 0.9052659869194031,
"rewards/rejected": -0.7291264533996582,
"step": 145,
"train_speed(iter/s)": 0.008017
},
{
"epoch": 0.323792362603091,
"grad_norm": 2.92645001411438,
"learning_rate": 0.00019319246113242664,
"logits/chosen": -0.6735572814941406,
"logits/rejected": -0.6972106099128723,
"logps/chosen": -9.01904296875,
"logps/rejected": -23.485305786132812,
"loss": 0.8951749205589294,
"memory(GiB)": 46.1,
"nll_loss": 0.5108327269554138,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.28073376417160034,
"rewards/margins": 1.0756409168243408,
"rewards/rejected": -0.7949072122573853,
"step": 146,
"train_speed(iter/s)": 0.008016
},
{
"epoch": 0.3260101185113313,
"grad_norm": 3.2365665435791016,
"learning_rate": 0.00019305858028153186,
"logits/chosen": -0.7025231719017029,
"logits/rejected": -0.7322810888290405,
"logps/chosen": -8.566629409790039,
"logps/rejected": -40.44590377807617,
"loss": 0.7701326012611389,
"memory(GiB)": 46.1,
"nll_loss": 0.42253950238227844,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.22694279253482819,
"rewards/margins": 1.8927738666534424,
"rewards/rejected": -1.6658309698104858,
"step": 147,
"train_speed(iter/s)": 0.008018
},
{
"epoch": 0.3282278744195717,
"grad_norm": 3.0658862590789795,
"learning_rate": 0.00019292344304359124,
"logits/chosen": -0.6364326477050781,
"logits/rejected": -0.6599412560462952,
"logps/chosen": -9.841287612915039,
"logps/rejected": -29.358394622802734,
"loss": 0.7886962294578552,
"memory(GiB)": 46.1,
"nll_loss": 0.40780922770500183,
"rewards/accuracies": 0.90625,
"rewards/chosen": 0.2544412314891815,
"rewards/margins": 1.3426122665405273,
"rewards/rejected": -1.088171124458313,
"step": 148,
"train_speed(iter/s)": 0.00802
},
{
"epoch": 0.33044563032781205,
"grad_norm": 12.607818603515625,
"learning_rate": 0.00019278705124309723,
"logits/chosen": -0.6786209344863892,
"logits/rejected": -0.7097568511962891,
"logps/chosen": -5.964594841003418,
"logps/rejected": -53.86275863647461,
"loss": 0.5599427223205566,
"memory(GiB)": 46.1,
"nll_loss": 0.40204113721847534,
"rewards/accuracies": 0.96875,
"rewards/chosen": 0.21791748702526093,
"rewards/margins": 3.074826240539551,
"rewards/rejected": -2.8569085597991943,
"step": 149,
"train_speed(iter/s)": 0.008021
},
{
"epoch": 0.3326633862360524,
"grad_norm": 2.428448438644409,
"learning_rate": 0.00019264940672148018,
"logits/chosen": -0.7238892316818237,
"logits/rejected": -0.7602605819702148,
"logps/chosen": -10.805157661437988,
"logps/rejected": -51.04298400878906,
"loss": 0.6146640777587891,
"memory(GiB)": 46.1,
"nll_loss": 0.313792884349823,
"rewards/accuracies": 0.84375,
"rewards/chosen": -0.05205656588077545,
"rewards/margins": 2.0433130264282227,
"rewards/rejected": -2.095369577407837,
"step": 150,
"train_speed(iter/s)": 0.008022
},
{
"epoch": 0.33488114214429276,
"grad_norm": 3.576777458190918,
"learning_rate": 0.0001925105113370834,
"logits/chosen": -0.734486997127533,
"logits/rejected": -0.7705245614051819,
"logps/chosen": -9.474486351013184,
"logps/rejected": -41.55698776245117,
"loss": 0.8946757316589355,
"memory(GiB)": 46.1,
"nll_loss": 0.5271129608154297,
"rewards/accuracies": 0.8125,
"rewards/chosen": 0.17018195986747742,
"rewards/margins": 2.1353487968444824,
"rewards/rejected": -1.9651670455932617,
"step": 151,
"train_speed(iter/s)": 0.008012
},
{
"epoch": 0.33709889805253307,
"grad_norm": 13.971368789672852,
"learning_rate": 0.00019237036696513818,
"logits/chosen": -0.7242223620414734,
"logits/rejected": -0.7463615536689758,
"logps/chosen": -12.119179725646973,
"logps/rejected": -39.10074996948242,
"loss": 1.3560465574264526,
"memory(GiB)": 46.1,
"nll_loss": 1.0073633193969727,
"rewards/accuracies": 0.8125,
"rewards/chosen": 0.06672754883766174,
"rewards/margins": 1.9847290515899658,
"rewards/rejected": -1.9180015325546265,
"step": 152,
"train_speed(iter/s)": 0.008014
},
{
"epoch": 0.33931665396077343,
"grad_norm": 3.170781135559082,
"learning_rate": 0.00019222897549773848,
"logits/chosen": -0.7781574130058289,
"logits/rejected": -0.7878897190093994,
"logps/chosen": -9.464417457580566,
"logps/rejected": -42.03047180175781,
"loss": 0.7055684328079224,
"memory(GiB)": 46.1,
"nll_loss": 0.3885788023471832,
"rewards/accuracies": 0.78125,
"rewards/chosen": 0.05404181033372879,
"rewards/margins": 2.449146270751953,
"rewards/rejected": -2.39510440826416,
"step": 153,
"train_speed(iter/s)": 0.008015
},
{
"epoch": 0.3415344098690138,
"grad_norm": 2.7523646354675293,
"learning_rate": 0.00019208633884381526,
"logits/chosen": -0.7232592701911926,
"logits/rejected": -0.7529851198196411,
"logps/chosen": -7.77958345413208,
"logps/rejected": -44.71973419189453,
"loss": 0.6493588089942932,
"memory(GiB)": 46.1,
"nll_loss": 0.42470622062683105,
"rewards/accuracies": 0.90625,
"rewards/chosen": 0.388906866312027,
"rewards/margins": 2.8554818630218506,
"rewards/rejected": -2.4665746688842773,
"step": 154,
"train_speed(iter/s)": 0.008016
},
{
"epoch": 0.34375216577725415,
"grad_norm": 20.620134353637695,
"learning_rate": 0.0001919424589291108,
"logits/chosen": -0.7193765044212341,
"logits/rejected": -0.7572377920150757,
"logps/chosen": -11.307958602905273,
"logps/rejected": -51.39036178588867,
"loss": 1.0872689485549927,
"memory(GiB)": 46.1,
"nll_loss": 0.8757498860359192,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.19819001853466034,
"rewards/margins": 2.9048383235931396,
"rewards/rejected": -2.706648111343384,
"step": 155,
"train_speed(iter/s)": 0.008016
},
{
"epoch": 0.3459699216854945,
"grad_norm": 14.992989540100098,
"learning_rate": 0.0001917973376961527,
"logits/chosen": -0.7125108242034912,
"logits/rejected": -0.7249738574028015,
"logps/chosen": -5.366758346557617,
"logps/rejected": -33.353816986083984,
"loss": 0.7495843768119812,
"memory(GiB)": 46.1,
"nll_loss": 0.4479677975177765,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.20626316964626312,
"rewards/margins": 1.818756341934204,
"rewards/rejected": -1.6124933958053589,
"step": 156,
"train_speed(iter/s)": 0.008015
},
{
"epoch": 0.3481876775937348,
"grad_norm": 2.707430362701416,
"learning_rate": 0.0001916509771042277,
"logits/chosen": -0.7225325703620911,
"logits/rejected": -0.7751076221466064,
"logps/chosen": -7.558128356933594,
"logps/rejected": -59.62013626098633,
"loss": 0.3974663317203522,
"memory(GiB)": 46.1,
"nll_loss": 0.2714276611804962,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.11370375007390976,
"rewards/margins": 3.6732826232910156,
"rewards/rejected": -3.5595788955688477,
"step": 157,
"train_speed(iter/s)": 0.008016
},
{
"epoch": 0.35040543350197517,
"grad_norm": 8.831613540649414,
"learning_rate": 0.0001915033791293551,
"logits/chosen": -0.6869341731071472,
"logits/rejected": -0.7035802006721497,
"logps/chosen": -11.216403007507324,
"logps/rejected": -38.74596405029297,
"loss": 0.7746688723564148,
"memory(GiB)": 46.1,
"nll_loss": 0.45386001467704773,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.166388601064682,
"rewards/margins": 1.9721925258636475,
"rewards/rejected": -1.8058040142059326,
"step": 158,
"train_speed(iter/s)": 0.008018
},
{
"epoch": 0.35262318941021553,
"grad_norm": 2.9480724334716797,
"learning_rate": 0.0001913545457642601,
"logits/chosen": -0.6564315557479858,
"logits/rejected": -0.6884806752204895,
"logps/chosen": -12.068757057189941,
"logps/rejected": -44.580867767333984,
"loss": 0.7749238610267639,
"memory(GiB)": 46.1,
"nll_loss": 0.5597700476646423,
"rewards/accuracies": 0.90625,
"rewards/chosen": 0.36497005820274353,
"rewards/margins": 2.6146392822265625,
"rewards/rejected": -2.249669075012207,
"step": 159,
"train_speed(iter/s)": 0.00802
},
{
"epoch": 0.3548409453184559,
"grad_norm": 2.8434133529663086,
"learning_rate": 0.00019120447901834706,
"logits/chosen": -0.7489297389984131,
"logits/rejected": -0.777446985244751,
"logps/chosen": -8.937162399291992,
"logps/rejected": -36.274837493896484,
"loss": 0.885219395160675,
"memory(GiB)": 46.1,
"nll_loss": 0.46223700046539307,
"rewards/accuracies": 0.75,
"rewards/chosen": 0.03733991086483002,
"rewards/margins": 1.7854254245758057,
"rewards/rejected": -1.7480854988098145,
"step": 160,
"train_speed(iter/s)": 0.008022
},
{
"epoch": 0.35705870122669625,
"grad_norm": 3.0293800830841064,
"learning_rate": 0.0001910531809176722,
"logits/chosen": -0.7100561261177063,
"logits/rejected": -0.7253575921058655,
"logps/chosen": -11.041877746582031,
"logps/rejected": -45.55367660522461,
"loss": 0.7278915643692017,
"memory(GiB)": 46.1,
"nll_loss": 0.4644385874271393,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.07243353128433228,
"rewards/margins": 2.7052664756774902,
"rewards/rejected": -2.6328327655792236,
"step": 161,
"train_speed(iter/s)": 0.008025
},
{
"epoch": 0.3592764571349366,
"grad_norm": 4.234739780426025,
"learning_rate": 0.00019090065350491626,
"logits/chosen": -0.7882344126701355,
"logits/rejected": -0.8183198571205139,
"logps/chosen": -8.469147682189941,
"logps/rejected": -49.76445007324219,
"loss": 0.9398418664932251,
"memory(GiB)": 46.1,
"nll_loss": 0.6014910936355591,
"rewards/accuracies": 0.96875,
"rewards/chosen": 0.029901552945375443,
"rewards/margins": 2.6962218284606934,
"rewards/rejected": -2.6663200855255127,
"step": 162,
"train_speed(iter/s)": 0.008025
},
{
"epoch": 0.3614942130431769,
"grad_norm": 3.7181763648986816,
"learning_rate": 0.00019074689883935705,
"logits/chosen": -0.833709716796875,
"logits/rejected": -0.8633042573928833,
"logps/chosen": -9.177538871765137,
"logps/rejected": -48.86741638183594,
"loss": 0.6912304759025574,
"memory(GiB)": 46.1,
"nll_loss": 0.4258120059967041,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.2436945140361786,
"rewards/margins": 3.05234432220459,
"rewards/rejected": -2.808649778366089,
"step": 163,
"train_speed(iter/s)": 0.008026
},
{
"epoch": 0.3637119689514173,
"grad_norm": 3.1451849937438965,
"learning_rate": 0.00019059191899684154,
"logits/chosen": -0.8144320845603943,
"logits/rejected": -0.8437734842300415,
"logps/chosen": -11.074281692504883,
"logps/rejected": -45.48798370361328,
"loss": 0.6197302937507629,
"memory(GiB)": 46.1,
"nll_loss": 0.3811179995536804,
"rewards/accuracies": 0.90625,
"rewards/chosen": 0.15162959694862366,
"rewards/margins": 2.7688112258911133,
"rewards/rejected": -2.6171817779541016,
"step": 164,
"train_speed(iter/s)": 0.008025
},
{
"epoch": 0.36592972485965763,
"grad_norm": 4.043789386749268,
"learning_rate": 0.00019043571606975777,
"logits/chosen": -0.7649494409561157,
"logits/rejected": -0.7870344519615173,
"logps/chosen": -15.020736694335938,
"logps/rejected": -43.62554931640625,
"loss": 1.026597261428833,
"memory(GiB)": 46.1,
"nll_loss": 0.6712150573730469,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.06518545746803284,
"rewards/margins": 2.171983480453491,
"rewards/rejected": -2.106797933578491,
"step": 165,
"train_speed(iter/s)": 0.008026
},
{
"epoch": 0.368147480767898,
"grad_norm": 3.109821081161499,
"learning_rate": 0.00019027829216700678,
"logits/chosen": -0.7875198721885681,
"logits/rejected": -0.8325733542442322,
"logps/chosen": -9.139036178588867,
"logps/rejected": -56.36309051513672,
"loss": 0.6341462731361389,
"memory(GiB)": 46.1,
"nll_loss": 0.451867938041687,
"rewards/accuracies": 0.96875,
"rewards/chosen": 0.23630189895629883,
"rewards/margins": 3.3503074645996094,
"rewards/rejected": -3.1140055656433105,
"step": 166,
"train_speed(iter/s)": 0.008027
},
{
"epoch": 0.37036523667613835,
"grad_norm": 2.6877574920654297,
"learning_rate": 0.00019011964941397405,
"logits/chosen": -0.7355461120605469,
"logits/rejected": -0.7912125587463379,
"logps/chosen": -7.943358421325684,
"logps/rejected": -54.66022872924805,
"loss": 0.6476521492004395,
"memory(GiB)": 46.1,
"nll_loss": 0.4549351930618286,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.3065571188926697,
"rewards/margins": 3.0600643157958984,
"rewards/rejected": -2.753507614135742,
"step": 167,
"train_speed(iter/s)": 0.008029
},
{
"epoch": 0.37258299258437866,
"grad_norm": 2.4588301181793213,
"learning_rate": 0.0001899597899525007,
"logits/chosen": -0.7490441799163818,
"logits/rejected": -0.7880818843841553,
"logps/chosen": -5.591465473175049,
"logps/rejected": -50.0340690612793,
"loss": 0.5648373961448669,
"memory(GiB)": 46.1,
"nll_loss": 0.3865860402584076,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.4422666132450104,
"rewards/margins": 3.342369318008423,
"rewards/rejected": -2.9001028537750244,
"step": 168,
"train_speed(iter/s)": 0.00803
},
{
"epoch": 0.374800748492619,
"grad_norm": 1.955082893371582,
"learning_rate": 0.0001897987159408548,
"logits/chosen": -0.7648451328277588,
"logits/rejected": -0.7907530665397644,
"logps/chosen": -4.5870208740234375,
"logps/rejected": -48.017208099365234,
"loss": 0.44469985365867615,
"memory(GiB)": 46.1,
"nll_loss": 0.24593624472618103,
"rewards/accuracies": 0.96875,
"rewards/chosen": 0.260402113199234,
"rewards/margins": 3.37278151512146,
"rewards/rejected": -3.112379312515259,
"step": 169,
"train_speed(iter/s)": 0.008031
},
{
"epoch": 0.3770185044008594,
"grad_norm": 4.219427585601807,
"learning_rate": 0.00018963642955370201,
"logits/chosen": -0.7837445139884949,
"logits/rejected": -0.8009445667266846,
"logps/chosen": -12.525315284729004,
"logps/rejected": -44.30619430541992,
"loss": 0.9331468939781189,
"memory(GiB)": 46.1,
"nll_loss": 0.5888757109642029,
"rewards/accuracies": 0.90625,
"rewards/chosen": -0.15850315988063812,
"rewards/margins": 2.3680062294006348,
"rewards/rejected": -2.5265092849731445,
"step": 170,
"train_speed(iter/s)": 0.008028
},
{
"epoch": 0.37923626030909974,
"grad_norm": 3.6719424724578857,
"learning_rate": 0.00018947293298207635,
"logits/chosen": -0.6751590967178345,
"logits/rejected": -0.7674037218093872,
"logps/chosen": -9.650009155273438,
"logps/rejected": -63.452606201171875,
"loss": 0.7752348184585571,
"memory(GiB)": 46.1,
"nll_loss": 0.6017739772796631,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.13403475284576416,
"rewards/margins": 3.4565603733062744,
"rewards/rejected": -3.3225257396698,
"step": 171,
"train_speed(iter/s)": 0.00803
},
{
"epoch": 0.3814540162173401,
"grad_norm": 3.4011969566345215,
"learning_rate": 0.00018930822843335056,
"logits/chosen": -0.704400360584259,
"logits/rejected": -0.7298606634140015,
"logps/chosen": -8.851949691772461,
"logps/rejected": -45.742679595947266,
"loss": 0.7604430317878723,
"memory(GiB)": 46.1,
"nll_loss": 0.5082038044929504,
"rewards/accuracies": 0.90625,
"rewards/chosen": 0.08242911100387573,
"rewards/margins": 2.7466654777526855,
"rewards/rejected": -2.664236307144165,
"step": 172,
"train_speed(iter/s)": 0.008032
},
{
"epoch": 0.3836717721255804,
"grad_norm": 3.709373712539673,
"learning_rate": 0.00018914231813120635,
"logits/chosen": -0.7612942457199097,
"logits/rejected": -0.7619401216506958,
"logps/chosen": -14.791999816894531,
"logps/rejected": -39.538509368896484,
"loss": 0.8681156635284424,
"memory(GiB)": 46.1,
"nll_loss": 0.5611632466316223,
"rewards/accuracies": 0.875,
"rewards/chosen": -0.0010512899607419968,
"rewards/margins": 2.186850070953369,
"rewards/rejected": -2.187901496887207,
"step": 173,
"train_speed(iter/s)": 0.008029
},
{
"epoch": 0.38588952803382076,
"grad_norm": 2.616783380508423,
"learning_rate": 0.00018897520431560434,
"logits/chosen": -0.7609409689903259,
"logits/rejected": -0.7808184623718262,
"logps/chosen": -5.7523698806762695,
"logps/rejected": -45.965145111083984,
"loss": 0.5051267743110657,
"memory(GiB)": 46.1,
"nll_loss": 0.2791001796722412,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.376434326171875,
"rewards/margins": 2.61958909034729,
"rewards/rejected": -2.243154764175415,
"step": 174,
"train_speed(iter/s)": 0.008026
},
{
"epoch": 0.3881072839420611,
"grad_norm": 2.9114208221435547,
"learning_rate": 0.00018880688924275378,
"logits/chosen": -0.6863377094268799,
"logits/rejected": -0.7190892696380615,
"logps/chosen": -4.734968662261963,
"logps/rejected": -39.10625076293945,
"loss": 0.6738218069076538,
"memory(GiB)": 46.1,
"nll_loss": 0.40073657035827637,
"rewards/accuracies": 0.90625,
"rewards/chosen": 0.2266547530889511,
"rewards/margins": 2.0988874435424805,
"rewards/rejected": -1.8722326755523682,
"step": 175,
"train_speed(iter/s)": 0.008028
},
{
"epoch": 0.3903250398503015,
"grad_norm": 6.051851272583008,
"learning_rate": 0.00018863737518508218,
"logits/chosen": -0.7415744066238403,
"logits/rejected": -0.773291826248169,
"logps/chosen": -9.922603607177734,
"logps/rejected": -46.90787887573242,
"loss": 0.76039057970047,
"memory(GiB)": 46.1,
"nll_loss": 0.4856896996498108,
"rewards/accuracies": 0.84375,
"rewards/chosen": 0.12430408596992493,
"rewards/margins": 2.302933692932129,
"rewards/rejected": -2.1786296367645264,
"step": 176,
"train_speed(iter/s)": 0.008027
},
{
"epoch": 0.39254279575854184,
"grad_norm": 2.987578868865967,
"learning_rate": 0.0001884666644312046,
"logits/chosen": -0.7061051726341248,
"logits/rejected": -0.7338166832923889,
"logps/chosen": -15.18138599395752,
"logps/rejected": -43.154415130615234,
"loss": 0.7650496363639832,
"memory(GiB)": 46.1,
"nll_loss": 0.5320225954055786,
"rewards/accuracies": 0.96875,
"rewards/chosen": 0.2508482336997986,
"rewards/margins": 2.6881744861602783,
"rewards/rejected": -2.437325954437256,
"step": 177,
"train_speed(iter/s)": 0.008029
},
{
"epoch": 0.3947605516667822,
"grad_norm": 2.5779054164886475,
"learning_rate": 0.00018829475928589271,
"logits/chosen": -0.7169279456138611,
"logits/rejected": -0.7530863285064697,
"logps/chosen": -7.394716262817383,
"logps/rejected": -49.48583221435547,
"loss": 0.45556652545928955,
"memory(GiB)": 46.1,
"nll_loss": 0.30026838183403015,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.38607895374298096,
"rewards/margins": 3.1158361434936523,
"rewards/rejected": -2.729757070541382,
"step": 178,
"train_speed(iter/s)": 0.008029
},
{
"epoch": 0.3969783075750225,
"grad_norm": 3.9343268871307373,
"learning_rate": 0.00018812166207004367,
"logits/chosen": -0.6970735788345337,
"logits/rejected": -0.724778413772583,
"logps/chosen": -4.960330009460449,
"logps/rejected": -49.74527359008789,
"loss": 0.5463108420372009,
"memory(GiB)": 46.1,
"nll_loss": 0.3669103980064392,
"rewards/accuracies": 0.90625,
"rewards/chosen": 0.27587890625,
"rewards/margins": 3.2249057292938232,
"rewards/rejected": -2.9490268230438232,
"step": 179,
"train_speed(iter/s)": 0.008027
},
{
"epoch": 0.39919606348326286,
"grad_norm": 2.298149824142456,
"learning_rate": 0.0001879473751206489,
"logits/chosen": -0.7472426295280457,
"logits/rejected": -0.7810541987419128,
"logps/chosen": -5.616783142089844,
"logps/rejected": -51.225318908691406,
"loss": 0.5331763625144958,
"memory(GiB)": 46.1,
"nll_loss": 0.3780348300933838,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.3602917790412903,
"rewards/margins": 3.3162002563476562,
"rewards/rejected": -2.9559082984924316,
"step": 180,
"train_speed(iter/s)": 0.008026
},
{
"epoch": 0.4014138193915032,
"grad_norm": 3.723597764968872,
"learning_rate": 0.00018777190079076242,
"logits/chosen": -0.7926808595657349,
"logits/rejected": -0.8186173439025879,
"logps/chosen": -3.8802855014801025,
"logps/rejected": -52.186126708984375,
"loss": 0.5307185649871826,
"memory(GiB)": 46.1,
"nll_loss": 0.3474883437156677,
"rewards/accuracies": 0.90625,
"rewards/chosen": 0.3934330642223358,
"rewards/margins": 3.725450038909912,
"rewards/rejected": -3.332016706466675,
"step": 181,
"train_speed(iter/s)": 0.008026
},
{
"epoch": 0.4036315752997436,
"grad_norm": 7.891061305999756,
"learning_rate": 0.00018759524144946904,
"logits/chosen": -0.7886751294136047,
"logits/rejected": -0.8069500923156738,
"logps/chosen": -11.522048950195312,
"logps/rejected": -51.2484130859375,
"loss": 0.785020112991333,
"memory(GiB)": 46.1,
"nll_loss": 0.41102084517478943,
"rewards/accuracies": 0.75,
"rewards/chosen": 0.10307621210813522,
"rewards/margins": 3.4609313011169434,
"rewards/rejected": -3.3578553199768066,
"step": 182,
"train_speed(iter/s)": 0.008028
},
{
"epoch": 0.40584933120798394,
"grad_norm": 12.93850040435791,
"learning_rate": 0.00018741739948185257,
"logits/chosen": -0.8120619058609009,
"logits/rejected": -0.852086067199707,
"logps/chosen": -6.879787445068359,
"logps/rejected": -65.4516830444336,
"loss": 0.8547239303588867,
"memory(GiB)": 46.1,
"nll_loss": 0.7350503206253052,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.0880105122923851,
"rewards/margins": 4.625463962554932,
"rewards/rejected": -4.5374531745910645,
"step": 183,
"train_speed(iter/s)": 0.008028
},
{
"epoch": 0.40806708711622425,
"grad_norm": 3.9282493591308594,
"learning_rate": 0.0001872383772889634,
"logits/chosen": -0.8234286308288574,
"logits/rejected": -0.8348793983459473,
"logps/chosen": -9.335253715515137,
"logps/rejected": -44.39677047729492,
"loss": 0.7768021821975708,
"memory(GiB)": 46.1,
"nll_loss": 0.5781885981559753,
"rewards/accuracies": 0.96875,
"rewards/chosen": 0.2790551781654358,
"rewards/margins": 3.196932077407837,
"rewards/rejected": -2.917877197265625,
"step": 184,
"train_speed(iter/s)": 0.008027
},
{
"epoch": 0.4102848430244646,
"grad_norm": 15.93510913848877,
"learning_rate": 0.00018705817728778624,
"logits/chosen": -0.8253858685493469,
"logits/rejected": -0.8627069592475891,
"logps/chosen": -9.565252304077148,
"logps/rejected": -53.15513610839844,
"loss": 0.8498061895370483,
"memory(GiB)": 46.1,
"nll_loss": 0.6343203186988831,
"rewards/accuracies": 0.90625,
"rewards/chosen": 0.21805116534233093,
"rewards/margins": 3.4257686138153076,
"rewards/rejected": -3.207717180252075,
"step": 185,
"train_speed(iter/s)": 0.008028
},
{
"epoch": 0.41250259893270497,
"grad_norm": 15.02178955078125,
"learning_rate": 0.00018687680191120743,
"logits/chosen": -0.8546393513679504,
"logits/rejected": -0.9091347455978394,
"logps/chosen": -4.4741058349609375,
"logps/rejected": -63.36324691772461,
"loss": 1.0827393531799316,
"memory(GiB)": 46.1,
"nll_loss": 0.7935152649879456,
"rewards/accuracies": 0.84375,
"rewards/chosen": 0.1945604830980301,
"rewards/margins": 3.8709142208099365,
"rewards/rejected": -3.676353693008423,
"step": 186,
"train_speed(iter/s)": 0.008026
},
{
"epoch": 0.4147203548409453,
"grad_norm": 2.5898377895355225,
"learning_rate": 0.00018669425360798205,
"logits/chosen": -0.8482339382171631,
"logits/rejected": -0.9088505506515503,
"logps/chosen": -5.740197658538818,
"logps/rejected": -51.71613311767578,
"loss": 0.5818274021148682,
"memory(GiB)": 46.1,
"nll_loss": 0.3660181760787964,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.2397884875535965,
"rewards/margins": 2.8303396701812744,
"rewards/rejected": -2.5905513763427734,
"step": 187,
"train_speed(iter/s)": 0.008026
},
{
"epoch": 0.4169381107491857,
"grad_norm": 5.367336750030518,
"learning_rate": 0.00018651053484270095,
"logits/chosen": -0.7865353226661682,
"logits/rejected": -0.8548979759216309,
"logps/chosen": -7.190474987030029,
"logps/rejected": -60.156734466552734,
"loss": 0.5877411365509033,
"memory(GiB)": 46.1,
"nll_loss": 0.39522460103034973,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.21685907244682312,
"rewards/margins": 3.5003058910369873,
"rewards/rejected": -3.283446788787842,
"step": 188,
"train_speed(iter/s)": 0.008027
},
{
"epoch": 0.419155866657426,
"grad_norm": 2.8252148628234863,
"learning_rate": 0.00018632564809575742,
"logits/chosen": -0.9151175022125244,
"logits/rejected": -0.956945538520813,
"logps/chosen": -11.193031311035156,
"logps/rejected": -50.2137451171875,
"loss": 0.6273083090782166,
"memory(GiB)": 46.1,
"nll_loss": 0.44245627522468567,
"rewards/accuracies": 0.90625,
"rewards/chosen": 0.5056411027908325,
"rewards/margins": 3.342442512512207,
"rewards/rejected": -2.836801290512085,
"step": 189,
"train_speed(iter/s)": 0.008027
},
{
"epoch": 0.42137362256566635,
"grad_norm": 5.62361478805542,
"learning_rate": 0.00018613959586331362,
"logits/chosen": -0.957817792892456,
"logits/rejected": -1.0089643001556396,
"logps/chosen": -11.406503677368164,
"logps/rejected": -59.45309829711914,
"loss": 0.69350266456604,
"memory(GiB)": 46.1,
"nll_loss": 0.4786533713340759,
"rewards/accuracies": 0.90625,
"rewards/chosen": 0.26705771684646606,
"rewards/margins": 3.8952856063842773,
"rewards/rejected": -3.628227949142456,
"step": 190,
"train_speed(iter/s)": 0.008028
},
{
"epoch": 0.4235913784739067,
"grad_norm": 6.09588098526001,
"learning_rate": 0.00018595238065726713,
"logits/chosen": -0.9361623525619507,
"logits/rejected": -0.9750722646713257,
"logps/chosen": -11.82553482055664,
"logps/rejected": -59.44593811035156,
"loss": 0.8459053039550781,
"memory(GiB)": 46.1,
"nll_loss": 0.5596847534179688,
"rewards/accuracies": 0.8125,
"rewards/chosen": 0.2538452744483948,
"rewards/margins": 3.787569999694824,
"rewards/rejected": -3.533724784851074,
"step": 191,
"train_speed(iter/s)": 0.008029
},
{
"epoch": 0.42580913438214707,
"grad_norm": 5.49157190322876,
"learning_rate": 0.00018576400500521672,
"logits/chosen": -1.1267294883728027,
"logits/rejected": -1.157508373260498,
"logps/chosen": -9.233796119689941,
"logps/rejected": -65.15520477294922,
"loss": 0.7781911492347717,
"memory(GiB)": 46.1,
"nll_loss": 0.5769992470741272,
"rewards/accuracies": 0.875,
"rewards/chosen": -0.04808952659368515,
"rewards/margins": 4.439774513244629,
"rewards/rejected": -4.487864017486572,
"step": 192,
"train_speed(iter/s)": 0.008029
},
{
"epoch": 0.42802689029038743,
"grad_norm": 2.235313653945923,
"learning_rate": 0.0001855744714504285,
"logits/chosen": -1.0502121448516846,
"logits/rejected": -1.0979869365692139,
"logps/chosen": -7.734978675842285,
"logps/rejected": -61.93341064453125,
"loss": 0.5888234972953796,
"memory(GiB)": 46.1,
"nll_loss": 0.4166957437992096,
"rewards/accuracies": 0.96875,
"rewards/chosen": 0.4335370361804962,
"rewards/margins": 4.3844313621521,
"rewards/rejected": -3.9508938789367676,
"step": 193,
"train_speed(iter/s)": 0.008027
},
{
"epoch": 0.4302446461986278,
"grad_norm": 6.296457767486572,
"learning_rate": 0.0001853837825518014,
"logits/chosen": -1.0367488861083984,
"logits/rejected": -1.058951497077942,
"logps/chosen": -12.308891296386719,
"logps/rejected": -56.541419982910156,
"loss": 0.9084363579750061,
"memory(GiB)": 46.1,
"nll_loss": 0.6487494707107544,
"rewards/accuracies": 0.875,
"rewards/chosen": -0.29248520731925964,
"rewards/margins": 3.4791908264160156,
"rewards/rejected": -3.7716763019561768,
"step": 194,
"train_speed(iter/s)": 0.008027
},
{
"epoch": 0.4324624021068681,
"grad_norm": 4.8967132568359375,
"learning_rate": 0.00018519194088383273,
"logits/chosen": -1.0082939863204956,
"logits/rejected": -1.0576558113098145,
"logps/chosen": -9.070019721984863,
"logps/rejected": -54.84600067138672,
"loss": 0.8942745327949524,
"memory(GiB)": 46.1,
"nll_loss": 0.5133223533630371,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.05057057738304138,
"rewards/margins": 3.1192855834960938,
"rewards/rejected": -3.0687148571014404,
"step": 195,
"train_speed(iter/s)": 0.008026
},
{
"epoch": 0.43468015801510845,
"grad_norm": 6.081669807434082,
"learning_rate": 0.00018499894903658328,
"logits/chosen": -0.907891035079956,
"logits/rejected": -0.9242041110992432,
"logps/chosen": -9.73530101776123,
"logps/rejected": -37.79449462890625,
"loss": 0.67271488904953,
"memory(GiB)": 46.1,
"nll_loss": 0.2690475881099701,
"rewards/accuracies": 0.8125,
"rewards/chosen": 0.10105058550834656,
"rewards/margins": 1.979455828666687,
"rewards/rejected": -1.878405213356018,
"step": 196,
"train_speed(iter/s)": 0.008026
},
{
"epoch": 0.4368979139233488,
"grad_norm": 3.40010666847229,
"learning_rate": 0.0001848048096156426,
"logits/chosen": -0.8272972106933594,
"logits/rejected": -0.9016137719154358,
"logps/chosen": -6.67510461807251,
"logps/rejected": -48.94219970703125,
"loss": 0.6460402607917786,
"memory(GiB)": 46.1,
"nll_loss": 0.3624219000339508,
"rewards/accuracies": 0.90625,
"rewards/chosen": 0.13816983997821808,
"rewards/margins": 3.1119472980499268,
"rewards/rejected": -2.9737775325775146,
"step": 197,
"train_speed(iter/s)": 0.008027
},
{
"epoch": 0.4391156698315892,
"grad_norm": 3.359297037124634,
"learning_rate": 0.00018460952524209355,
"logits/chosen": -0.877692699432373,
"logits/rejected": -0.9115339517593384,
"logps/chosen": -11.648417472839355,
"logps/rejected": -37.90315246582031,
"loss": 0.8015753626823425,
"memory(GiB)": 46.1,
"nll_loss": 0.5033032894134521,
"rewards/accuracies": 0.84375,
"rewards/chosen": 0.2795218527317047,
"rewards/margins": 2.2155895233154297,
"rewards/rejected": -1.9360675811767578,
"step": 198,
"train_speed(iter/s)": 0.008028
},
{
"epoch": 0.44133342573982953,
"grad_norm": 2.250875234603882,
"learning_rate": 0.00018441309855247708,
"logits/chosen": -0.787319004535675,
"logits/rejected": -0.8128381371498108,
"logps/chosen": -11.259406089782715,
"logps/rejected": -48.81473922729492,
"loss": 0.6350412964820862,
"memory(GiB)": 46.1,
"nll_loss": 0.3753763735294342,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.42155084013938904,
"rewards/margins": 2.7902255058288574,
"rewards/rejected": -2.3686749935150146,
"step": 199,
"train_speed(iter/s)": 0.008027
},
{
"epoch": 0.44355118164806984,
"grad_norm": 3.3108201026916504,
"learning_rate": 0.00018421553219875658,
"logits/chosen": -0.8686717748641968,
"logits/rejected": -0.8734286427497864,
"logps/chosen": -13.712151527404785,
"logps/rejected": -52.73145294189453,
"loss": 0.6721420288085938,
"memory(GiB)": 46.1,
"nll_loss": 0.4126514196395874,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.028258126229047775,
"rewards/margins": 2.731067180633545,
"rewards/rejected": -2.7028088569641113,
"step": 200,
"train_speed(iter/s)": 0.008025
},
{
"epoch": 0.4457689375563102,
"grad_norm": 4.97205114364624,
"learning_rate": 0.00018401682884828212,
"logits/chosen": -0.7808172106742859,
"logits/rejected": -0.7950178980827332,
"logps/chosen": -11.171830177307129,
"logps/rejected": -40.51845932006836,
"loss": 0.6930698156356812,
"memory(GiB)": 46.1,
"nll_loss": 0.4298695921897888,
"rewards/accuracies": 0.90625,
"rewards/chosen": 0.20948606729507446,
"rewards/margins": 2.620697498321533,
"rewards/rejected": -2.4112114906311035,
"step": 201,
"train_speed(iter/s)": 0.008019
},
{
"epoch": 0.44798669346455056,
"grad_norm": 5.371218204498291,
"learning_rate": 0.00018381699118375427,
"logits/chosen": -0.7809624075889587,
"logits/rejected": -0.8142802715301514,
"logps/chosen": -5.608348846435547,
"logps/rejected": -55.663177490234375,
"loss": 0.4353767931461334,
"memory(GiB)": 46.1,
"nll_loss": 0.2700658440589905,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.20935064554214478,
"rewards/margins": 3.5973005294799805,
"rewards/rejected": -3.3879499435424805,
"step": 202,
"train_speed(iter/s)": 0.008019
},
{
"epoch": 0.4502044493727909,
"grad_norm": 16.89154815673828,
"learning_rate": 0.00018361602190318822,
"logits/chosen": -0.7608879208564758,
"logits/rejected": -0.7771663665771484,
"logps/chosen": -10.431235313415527,
"logps/rejected": -37.032108306884766,
"loss": 0.9102643728256226,
"memory(GiB)": 46.1,
"nll_loss": 0.635382354259491,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.2574206590652466,
"rewards/margins": 2.4064812660217285,
"rewards/rejected": -2.1490604877471924,
"step": 203,
"train_speed(iter/s)": 0.008019
},
{
"epoch": 0.4524222052810313,
"grad_norm": 6.729372978210449,
"learning_rate": 0.000183413923719877,
"logits/chosen": -0.7215007543563843,
"logits/rejected": -0.758901059627533,
"logps/chosen": -8.58769416809082,
"logps/rejected": -39.22972869873047,
"loss": 0.8954074382781982,
"memory(GiB)": 46.1,
"nll_loss": 0.6078510284423828,
"rewards/accuracies": 0.90625,
"rewards/chosen": 0.25617051124572754,
"rewards/margins": 2.248603343963623,
"rewards/rejected": -1.992432713508606,
"step": 204,
"train_speed(iter/s)": 0.008018
},
{
"epoch": 0.4546399611892716,
"grad_norm": 3.6512980461120605,
"learning_rate": 0.00018321069936235503,
"logits/chosen": -0.6804372668266296,
"logits/rejected": -0.718124508857727,
"logps/chosen": -8.9603853225708,
"logps/rejected": -47.75540542602539,
"loss": 0.6032508611679077,
"memory(GiB)": 46.1,
"nll_loss": 0.41573473811149597,
"rewards/accuracies": 0.96875,
"rewards/chosen": 0.4219416379928589,
"rewards/margins": 3.0125231742858887,
"rewards/rejected": -2.5905814170837402,
"step": 205,
"train_speed(iter/s)": 0.008018
},
{
"epoch": 0.45685771709751194,
"grad_norm": 7.076963424682617,
"learning_rate": 0.00018300635157436125,
"logits/chosen": -0.7391089797019958,
"logits/rejected": -0.745570182800293,
"logps/chosen": -4.518499851226807,
"logps/rejected": -34.36119079589844,
"loss": 0.6407385468482971,
"memory(GiB)": 46.1,
"nll_loss": 0.3392406404018402,
"rewards/accuracies": 0.84375,
"rewards/chosen": 0.31493237614631653,
"rewards/margins": 2.2406697273254395,
"rewards/rejected": -1.9257375001907349,
"step": 206,
"train_speed(iter/s)": 0.008018
},
{
"epoch": 0.4590754730057523,
"grad_norm": 2.3934824466705322,
"learning_rate": 0.00018280088311480201,
"logits/chosen": -0.7122136354446411,
"logits/rejected": -0.7361628413200378,
"logps/chosen": -6.559683322906494,
"logps/rejected": -39.97085189819336,
"loss": 0.6831241846084595,
"memory(GiB)": 46.1,
"nll_loss": 0.3898596167564392,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.3751702308654785,
"rewards/margins": 2.362565279006958,
"rewards/rejected": -1.987395167350769,
"step": 207,
"train_speed(iter/s)": 0.00802
},
{
"epoch": 0.46129322891399266,
"grad_norm": 2.4925472736358643,
"learning_rate": 0.00018259429675771403,
"logits/chosen": -0.6431427001953125,
"logits/rejected": -0.6792439818382263,
"logps/chosen": -6.0603485107421875,
"logps/rejected": -43.98711395263672,
"loss": 0.6350247859954834,
"memory(GiB)": 46.1,
"nll_loss": 0.40350115299224854,
"rewards/accuracies": 0.90625,
"rewards/chosen": 0.4135381281375885,
"rewards/margins": 2.4943490028381348,
"rewards/rejected": -2.0808112621307373,
"step": 208,
"train_speed(iter/s)": 0.00802
},
{
"epoch": 0.463510984822233,
"grad_norm": 2.020061492919922,
"learning_rate": 0.0001823865952922267,
"logits/chosen": -0.7055493593215942,
"logits/rejected": -0.7343183755874634,
"logps/chosen": -6.9183878898620605,
"logps/rejected": -37.08061599731445,
"loss": 0.5601203441619873,
"memory(GiB)": 46.1,
"nll_loss": 0.3676638901233673,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.38555678725242615,
"rewards/margins": 2.058412790298462,
"rewards/rejected": -1.6728558540344238,
"step": 209,
"train_speed(iter/s)": 0.008019
},
{
"epoch": 0.4657287407304734,
"grad_norm": 2.5581166744232178,
"learning_rate": 0.0001821777815225245,
"logits/chosen": -0.6911201477050781,
"logits/rejected": -0.7565470337867737,
"logps/chosen": -7.890411376953125,
"logps/rejected": -48.7196159362793,
"loss": 0.6602129340171814,
"memory(GiB)": 46.1,
"nll_loss": 0.4272047281265259,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.27426618337631226,
"rewards/margins": 2.3485374450683594,
"rewards/rejected": -2.0742714405059814,
"step": 210,
"train_speed(iter/s)": 0.00802
},
{
"epoch": 0.4679464966387137,
"grad_norm": 3.0122952461242676,
"learning_rate": 0.00018196785826780928,
"logits/chosen": -0.6988839507102966,
"logits/rejected": -0.7252997159957886,
"logps/chosen": -11.326674461364746,
"logps/rejected": -38.2576904296875,
"loss": 0.7591457962989807,
"memory(GiB)": 46.1,
"nll_loss": 0.48633021116256714,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.3746309280395508,
"rewards/margins": 2.2771949768066406,
"rewards/rejected": -1.9025641679763794,
"step": 211,
"train_speed(iter/s)": 0.00802
},
{
"epoch": 0.47016425254695404,
"grad_norm": 2.265782356262207,
"learning_rate": 0.000181756828362262,
"logits/chosen": -0.7268755435943604,
"logits/rejected": -0.7466446161270142,
"logps/chosen": -7.725147724151611,
"logps/rejected": -51.996009826660156,
"loss": 0.4454570412635803,
"memory(GiB)": 46.1,
"nll_loss": 0.2833636403083801,
"rewards/accuracies": 0.96875,
"rewards/chosen": 0.36816588044166565,
"rewards/margins": 3.318744659423828,
"rewards/rejected": -2.9505786895751953,
"step": 212,
"train_speed(iter/s)": 0.008021
},
{
"epoch": 0.4723820084551944,
"grad_norm": 2.547436237335205,
"learning_rate": 0.00018154469465500448,
"logits/chosen": -0.7705230712890625,
"logits/rejected": -0.7850083112716675,
"logps/chosen": -9.060789108276367,
"logps/rejected": -43.8983154296875,
"loss": 0.6688026189804077,
"memory(GiB)": 46.1,
"nll_loss": 0.44372719526290894,
"rewards/accuracies": 0.90625,
"rewards/chosen": 0.3685440421104431,
"rewards/margins": 2.777890920639038,
"rewards/rejected": -2.40934681892395,
"step": 213,
"train_speed(iter/s)": 0.008022
},
{
"epoch": 0.47459976436343476,
"grad_norm": 5.478801250457764,
"learning_rate": 0.00018133146001006117,
"logits/chosen": -0.7916015982627869,
"logits/rejected": -0.8327130675315857,
"logps/chosen": -12.882250785827637,
"logps/rejected": -54.540977478027344,
"loss": 0.7713211178779602,
"memory(GiB)": 46.1,
"nll_loss": 0.6156861782073975,
"rewards/accuracies": 0.96875,
"rewards/chosen": 0.4459156095981598,
"rewards/margins": 3.8908560276031494,
"rewards/rejected": -3.4449405670166016,
"step": 214,
"train_speed(iter/s)": 0.008023
},
{
"epoch": 0.4768175202716751,
"grad_norm": 9.98646354675293,
"learning_rate": 0.00018111712730632022,
"logits/chosen": -0.8455632328987122,
"logits/rejected": -0.8789849877357483,
"logps/chosen": -6.6688761711120605,
"logps/rejected": -67.25550079345703,
"loss": 0.4042738378047943,
"memory(GiB)": 46.1,
"nll_loss": 0.27104586362838745,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.2038407027721405,
"rewards/margins": 4.787556171417236,
"rewards/rejected": -4.583715438842773,
"step": 215,
"train_speed(iter/s)": 0.008023
},
{
"epoch": 0.4790352761799154,
"grad_norm": 8.007806777954102,
"learning_rate": 0.00018090169943749476,
"logits/chosen": -0.8711842894554138,
"logits/rejected": -0.8995304703712463,
"logps/chosen": -9.905319213867188,
"logps/rejected": -61.446109771728516,
"loss": 0.7026961445808411,
"memory(GiB)": 46.1,
"nll_loss": 0.5331434011459351,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.16945196688175201,
"rewards/margins": 4.315336227416992,
"rewards/rejected": -4.1458845138549805,
"step": 216,
"train_speed(iter/s)": 0.008023
},
{
"epoch": 0.4812530320881558,
"grad_norm": 2.730963706970215,
"learning_rate": 0.0001806851793120837,
"logits/chosen": -0.8149902820587158,
"logits/rejected": -0.8820565342903137,
"logps/chosen": -9.960224151611328,
"logps/rejected": -72.3023681640625,
"loss": 0.5872762799263,
"memory(GiB)": 46.1,
"nll_loss": 0.44592928886413574,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.16795015335083008,
"rewards/margins": 5.117605686187744,
"rewards/rejected": -4.949655055999756,
"step": 217,
"train_speed(iter/s)": 0.008024
},
{
"epoch": 0.48347078799639615,
"grad_norm": 16.840694427490234,
"learning_rate": 0.00018046756985333256,
"logits/chosen": -0.8040902018547058,
"logits/rejected": -0.8409407138824463,
"logps/chosen": -9.597344398498535,
"logps/rejected": -60.84199523925781,
"loss": 0.6265321373939514,
"memory(GiB)": 46.1,
"nll_loss": 0.39480292797088623,
"rewards/accuracies": 0.84375,
"rewards/chosen": 0.07195545732975006,
"rewards/margins": 4.253119468688965,
"rewards/rejected": -4.181163787841797,
"step": 218,
"train_speed(iter/s)": 0.008023
},
{
"epoch": 0.4856885439046365,
"grad_norm": 11.527325630187988,
"learning_rate": 0.0001802488739991941,
"logits/chosen": -0.8545507192611694,
"logits/rejected": -0.8696693181991577,
"logps/chosen": -8.045662879943848,
"logps/rejected": -52.85993194580078,
"loss": 1.0190614461898804,
"memory(GiB)": 46.1,
"nll_loss": 0.6636497974395752,
"rewards/accuracies": 0.8125,
"rewards/chosen": 0.0182030089199543,
"rewards/margins": 3.632762908935547,
"rewards/rejected": -3.614560127258301,
"step": 219,
"train_speed(iter/s)": 0.008022
},
{
"epoch": 0.48790629981287686,
"grad_norm": 2.8976073265075684,
"learning_rate": 0.00018002909470228842,
"logits/chosen": -0.8644663691520691,
"logits/rejected": -0.873846709728241,
"logps/chosen": -9.438857078552246,
"logps/rejected": -60.52991485595703,
"loss": 0.5179789066314697,
"memory(GiB)": 46.1,
"nll_loss": 0.365613728761673,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.08784684538841248,
"rewards/margins": 4.254735469818115,
"rewards/rejected": -4.16688871383667,
"step": 220,
"train_speed(iter/s)": 0.008021
},
{
"epoch": 0.49012405572111717,
"grad_norm": 3.299361228942871,
"learning_rate": 0.00017980823492986324,
"logits/chosen": -0.8386255502700806,
"logits/rejected": -0.8992589712142944,
"logps/chosen": -8.689769744873047,
"logps/rejected": -60.96467590332031,
"loss": 0.618039608001709,
"memory(GiB)": 46.1,
"nll_loss": 0.5055224299430847,
"rewards/accuracies": 0.96875,
"rewards/chosen": 0.2881576120853424,
"rewards/margins": 4.106770992279053,
"rewards/rejected": -3.8186135292053223,
"step": 221,
"train_speed(iter/s)": 0.008022
},
{
"epoch": 0.49234181162935753,
"grad_norm": 4.465257167816162,
"learning_rate": 0.00017958629766375386,
"logits/chosen": -0.8478450179100037,
"logits/rejected": -0.9085181355476379,
"logps/chosen": -6.204191207885742,
"logps/rejected": -56.054569244384766,
"loss": 0.47616931796073914,
"memory(GiB)": 46.1,
"nll_loss": 0.31598034501075745,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.258948415517807,
"rewards/margins": 3.6201562881469727,
"rewards/rejected": -3.3612074851989746,
"step": 222,
"train_speed(iter/s)": 0.00802
},
{
"epoch": 0.4945595675375979,
"grad_norm": 2.8880817890167236,
"learning_rate": 0.0001793632859003428,
"logits/chosen": -0.8514662384986877,
"logits/rejected": -0.8807088732719421,
"logps/chosen": -10.981437683105469,
"logps/rejected": -55.400272369384766,
"loss": 0.6770332455635071,
"memory(GiB)": 46.1,
"nll_loss": 0.5153285264968872,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.30325403809547424,
"rewards/margins": 3.651240110397339,
"rewards/rejected": -3.3479862213134766,
"step": 223,
"train_speed(iter/s)": 0.008022
},
{
"epoch": 0.49677732344583825,
"grad_norm": 3.5312280654907227,
"learning_rate": 0.00017913920265051947,
"logits/chosen": -0.8069252371788025,
"logits/rejected": -0.8705534934997559,
"logps/chosen": -8.313520431518555,
"logps/rejected": -58.24019241333008,
"loss": 0.6806789636611938,
"memory(GiB)": 46.1,
"nll_loss": 0.4746111035346985,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.10646762698888779,
"rewards/margins": 3.66450834274292,
"rewards/rejected": -3.5580403804779053,
"step": 224,
"train_speed(iter/s)": 0.008024
},
{
"epoch": 0.4989950793540786,
"grad_norm": 3.3835299015045166,
"learning_rate": 0.00017891405093963938,
"logits/chosen": -0.830254077911377,
"logits/rejected": -0.861682653427124,
"logps/chosen": -10.002070426940918,
"logps/rejected": -47.45036315917969,
"loss": 0.6337284445762634,
"memory(GiB)": 46.1,
"nll_loss": 0.4381062090396881,
"rewards/accuracies": 0.90625,
"rewards/chosen": 0.26333028078079224,
"rewards/margins": 3.0331172943115234,
"rewards/rejected": -2.769787073135376,
"step": 225,
"train_speed(iter/s)": 0.008026
},
{
"epoch": 0.501212835262319,
"grad_norm": 3.5198752880096436,
"learning_rate": 0.00017868783380748342,
"logits/chosen": -0.8473120331764221,
"logits/rejected": -0.8709195852279663,
"logps/chosen": -13.000303268432617,
"logps/rejected": -42.49477767944336,
"loss": 0.6278812885284424,
"memory(GiB)": 46.1,
"nll_loss": 0.4056437909603119,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.39378899335861206,
"rewards/margins": 2.7199783325195312,
"rewards/rejected": -2.3261890411376953,
"step": 226,
"train_speed(iter/s)": 0.008027
},
{
"epoch": 0.5034305911705593,
"grad_norm": 3.3003716468811035,
"learning_rate": 0.00017846055430821678,
"logits/chosen": -0.8059426546096802,
"logits/rejected": -0.8080525398254395,
"logps/chosen": -9.30306339263916,
"logps/rejected": -40.58232116699219,
"loss": 0.6896506547927856,
"memory(GiB)": 46.1,
"nll_loss": 0.37519916892051697,
"rewards/accuracies": 0.84375,
"rewards/chosen": 0.3133179843425751,
"rewards/margins": 2.731419324874878,
"rewards/rejected": -2.4181013107299805,
"step": 227,
"train_speed(iter/s)": 0.008027
},
{
"epoch": 0.5056483470787997,
"grad_norm": 1.7876431941986084,
"learning_rate": 0.00017823221551034764,
"logits/chosen": -0.8154786229133606,
"logits/rejected": -0.8503978848457336,
"logps/chosen": -5.010475158691406,
"logps/rejected": -48.111228942871094,
"loss": 0.4449242055416107,
"memory(GiB)": 46.1,
"nll_loss": 0.2939717471599579,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.3824361264705658,
"rewards/margins": 3.612694501876831,
"rewards/rejected": -3.2302584648132324,
"step": 228,
"train_speed(iter/s)": 0.008029
},
{
"epoch": 0.5078661029870399,
"grad_norm": 2.703659772872925,
"learning_rate": 0.00017800282049668594,
"logits/chosen": -0.8498862981796265,
"logits/rejected": -0.917186975479126,
"logps/chosen": -7.1461615562438965,
"logps/rejected": -59.192298889160156,
"loss": 0.4826613962650299,
"memory(GiB)": 46.1,
"nll_loss": 0.3588803708553314,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.3578621447086334,
"rewards/margins": 3.88301944732666,
"rewards/rejected": -3.5251574516296387,
"step": 229,
"train_speed(iter/s)": 0.008028
},
{
"epoch": 0.5100838588952803,
"grad_norm": 5.917115688323975,
"learning_rate": 0.0001777723723643014,
"logits/chosen": -0.8150835037231445,
"logits/rejected": -0.8721492290496826,
"logps/chosen": -15.683819770812988,
"logps/rejected": -61.561241149902344,
"loss": 0.9741629958152771,
"memory(GiB)": 46.1,
"nll_loss": 0.7258660197257996,
"rewards/accuracies": 0.90625,
"rewards/chosen": 0.29861539602279663,
"rewards/margins": 3.3912651538848877,
"rewards/rejected": -3.0926499366760254,
"step": 230,
"train_speed(iter/s)": 0.008029
},
{
"epoch": 0.5123016148035207,
"grad_norm": 2.1567375659942627,
"learning_rate": 0.00017754087422448215,
"logits/chosen": -0.8800138235092163,
"logits/rejected": -0.9136852622032166,
"logps/chosen": -9.487836837768555,
"logps/rejected": -61.10226821899414,
"loss": 0.5113418102264404,
"memory(GiB)": 46.1,
"nll_loss": 0.34745144844055176,
"rewards/accuracies": 0.96875,
"rewards/chosen": 0.20129577815532684,
"rewards/margins": 4.3714752197265625,
"rewards/rejected": -4.170179843902588,
"step": 231,
"train_speed(iter/s)": 0.00803
},
{
"epoch": 0.514519370711761,
"grad_norm": 4.626194000244141,
"learning_rate": 0.0001773083292026924,
"logits/chosen": -0.9154278039932251,
"logits/rejected": -0.9261500239372253,
"logps/chosen": -7.649507522583008,
"logps/rejected": -66.75289154052734,
"loss": 0.5653941631317139,
"memory(GiB)": 46.1,
"nll_loss": 0.36132049560546875,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.16542571783065796,
"rewards/margins": 5.1535139083862305,
"rewards/rejected": -4.988088130950928,
"step": 232,
"train_speed(iter/s)": 0.00803
},
{
"epoch": 0.5167371266200014,
"grad_norm": 2.771819591522217,
"learning_rate": 0.00017707474043853041,
"logits/chosen": -0.8962085247039795,
"logits/rejected": -0.9393426179885864,
"logps/chosen": -4.859526634216309,
"logps/rejected": -70.9289779663086,
"loss": 0.528771698474884,
"memory(GiB)": 46.1,
"nll_loss": 0.32141542434692383,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.14139828085899353,
"rewards/margins": 5.118078708648682,
"rewards/rejected": -4.976680278778076,
"step": 233,
"train_speed(iter/s)": 0.008032
},
{
"epoch": 0.5189548825282417,
"grad_norm": 2.016167402267456,
"learning_rate": 0.00017684011108568592,
"logits/chosen": -0.89229416847229,
"logits/rejected": -0.9399268627166748,
"logps/chosen": -9.858261108398438,
"logps/rejected": -73.9881591796875,
"loss": 0.46442869305610657,
"memory(GiB)": 46.1,
"nll_loss": 0.3368317484855652,
"rewards/accuracies": 0.96875,
"rewards/chosen": 0.33955106139183044,
"rewards/margins": 5.430692672729492,
"rewards/rejected": -5.091141223907471,
"step": 234,
"train_speed(iter/s)": 0.008034
},
{
"epoch": 0.5211726384364821,
"grad_norm": 2.207803726196289,
"learning_rate": 0.0001766044443118978,
"logits/chosen": -0.8679851293563843,
"logits/rejected": -0.9161220192909241,
"logps/chosen": -8.69020938873291,
"logps/rejected": -57.00996780395508,
"loss": 0.5931269526481628,
"memory(GiB)": 46.1,
"nll_loss": 0.4199146032333374,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.28541409969329834,
"rewards/margins": 3.884521245956421,
"rewards/rejected": -3.599107503890991,
"step": 235,
"train_speed(iter/s)": 0.008033
},
{
"epoch": 0.5233903943447225,
"grad_norm": 3.842848062515259,
"learning_rate": 0.00017636774329891122,
"logits/chosen": -0.8388394713401794,
"logits/rejected": -0.9103097915649414,
"logps/chosen": -9.551056861877441,
"logps/rejected": -68.45164489746094,
"loss": 0.617426872253418,
"memory(GiB)": 46.1,
"nll_loss": 0.4130822420120239,
"rewards/accuracies": 0.90625,
"rewards/chosen": 0.2819046080112457,
"rewards/margins": 4.378241062164307,
"rewards/rejected": -4.096336841583252,
"step": 236,
"train_speed(iter/s)": 0.008034
},
{
"epoch": 0.5256081502529628,
"grad_norm": 2.8949806690216064,
"learning_rate": 0.00017613001124243446,
"logits/chosen": -0.8529986143112183,
"logits/rejected": -0.9170435667037964,
"logps/chosen": -8.742960929870605,
"logps/rejected": -70.04315948486328,
"loss": 0.5013477802276611,
"memory(GiB)": 46.1,
"nll_loss": 0.3726488947868347,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.19001907110214233,
"rewards/margins": 4.866143226623535,
"rewards/rejected": -4.676124572753906,
"step": 237,
"train_speed(iter/s)": 0.008034
},
{
"epoch": 0.5278259061612032,
"grad_norm": 2.255075454711914,
"learning_rate": 0.00017589125135209616,
"logits/chosen": -0.8355762958526611,
"logits/rejected": -0.9108222126960754,
"logps/chosen": -7.4976043701171875,
"logps/rejected": -79.64945983886719,
"loss": 0.5185106992721558,
"memory(GiB)": 46.1,
"nll_loss": 0.4060248136520386,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.4182281494140625,
"rewards/margins": 5.220707416534424,
"rewards/rejected": -4.802480220794678,
"step": 238,
"train_speed(iter/s)": 0.008034
},
{
"epoch": 0.5300436620694435,
"grad_norm": 5.300905704498291,
"learning_rate": 0.00017565146685140167,
"logits/chosen": -0.9112374782562256,
"logits/rejected": -0.9718393683433533,
"logps/chosen": -5.972594261169434,
"logps/rejected": -67.36833190917969,
"loss": 0.4636631906032562,
"memory(GiB)": 46.1,
"nll_loss": 0.3712203800678253,
"rewards/accuracies": 0.96875,
"rewards/chosen": 0.3854513168334961,
"rewards/margins": 4.805893421173096,
"rewards/rejected": -4.420441627502441,
"step": 239,
"train_speed(iter/s)": 0.008034
},
{
"epoch": 0.5322614179776838,
"grad_norm": 3.5167770385742188,
"learning_rate": 0.00017541066097768963,
"logits/chosen": -0.9272933006286621,
"logits/rejected": -0.9693167209625244,
"logps/chosen": -8.705961227416992,
"logps/rejected": -68.90886688232422,
"loss": 0.5253361463546753,
"memory(GiB)": 46.1,
"nll_loss": 0.3944278061389923,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.2587865889072418,
"rewards/margins": 5.000888824462891,
"rewards/rejected": -4.742102146148682,
"step": 240,
"train_speed(iter/s)": 0.008033
},
{
"epoch": 0.5344791738859241,
"grad_norm": 2.322474241256714,
"learning_rate": 0.00017516883698208836,
"logits/chosen": -0.9203046560287476,
"logits/rejected": -0.9854355454444885,
"logps/chosen": -6.003438949584961,
"logps/rejected": -89.39216613769531,
"loss": 0.35788312554359436,
"memory(GiB)": 46.1,
"nll_loss": 0.26435545086860657,
"rewards/accuracies": 0.96875,
"rewards/chosen": 0.31243598461151123,
"rewards/margins": 6.715966701507568,
"rewards/rejected": -6.403530597686768,
"step": 241,
"train_speed(iter/s)": 0.008033
},
{
"epoch": 0.5366969297941645,
"grad_norm": 2.527200937271118,
"learning_rate": 0.00017492599812947174,
"logits/chosen": -0.9331361651420593,
"logits/rejected": -0.9946306347846985,
"logps/chosen": -8.94567584991455,
"logps/rejected": -69.54719543457031,
"loss": 0.5303357839584351,
"memory(GiB)": 46.1,
"nll_loss": 0.3786414563655853,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.3045698404312134,
"rewards/margins": 4.875159740447998,
"rewards/rejected": -4.570590496063232,
"step": 242,
"train_speed(iter/s)": 0.008033
},
{
"epoch": 0.5389146857024049,
"grad_norm": 3.39489483833313,
"learning_rate": 0.0001746821476984154,
"logits/chosen": -1.0111048221588135,
"logits/rejected": -1.0517295598983765,
"logps/chosen": -7.177391052246094,
"logps/rejected": -78.28370666503906,
"loss": 0.4529821276664734,
"memory(GiB)": 46.1,
"nll_loss": 0.26994505524635315,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.38182204961776733,
"rewards/margins": 5.7827043533325195,
"rewards/rejected": -5.400881767272949,
"step": 243,
"train_speed(iter/s)": 0.008034
},
{
"epoch": 0.5411324416106452,
"grad_norm": 2.4717650413513184,
"learning_rate": 0.00017443728898115226,
"logits/chosen": -0.880812406539917,
"logits/rejected": -0.9722001552581787,
"logps/chosen": -6.132741451263428,
"logps/rejected": -88.99906158447266,
"loss": 0.475276380777359,
"memory(GiB)": 46.1,
"nll_loss": 0.3436709940433502,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.3613809645175934,
"rewards/margins": 6.569655895233154,
"rewards/rejected": -6.2082743644714355,
"step": 244,
"train_speed(iter/s)": 0.008036
},
{
"epoch": 0.5433501975188856,
"grad_norm": 4.479578495025635,
"learning_rate": 0.00017419142528352817,
"logits/chosen": -0.960247278213501,
"logits/rejected": -1.024147868156433,
"logps/chosen": -10.586898803710938,
"logps/rejected": -76.42874145507812,
"loss": 0.6297825574874878,
"memory(GiB)": 46.1,
"nll_loss": 0.4393399953842163,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.31354814767837524,
"rewards/margins": 5.518167018890381,
"rewards/rejected": -5.204617977142334,
"step": 245,
"train_speed(iter/s)": 0.008038
},
{
"epoch": 0.5455679534271259,
"grad_norm": 7.8160719871521,
"learning_rate": 0.00017394455992495722,
"logits/chosen": -0.9498053789138794,
"logits/rejected": -0.9790096879005432,
"logps/chosen": -15.403467178344727,
"logps/rejected": -63.19144058227539,
"loss": 0.8869673013687134,
"memory(GiB)": 46.1,
"nll_loss": 0.684601366519928,
"rewards/accuracies": 0.90625,
"rewards/chosen": 0.4287480115890503,
"rewards/margins": 4.687766075134277,
"rewards/rejected": -4.2590179443359375,
"step": 246,
"train_speed(iter/s)": 0.008038
},
{
"epoch": 0.5477857093353663,
"grad_norm": 4.335257530212402,
"learning_rate": 0.00017369669623837702,
"logits/chosen": -0.9585328102111816,
"logits/rejected": -0.969738781452179,
"logps/chosen": -7.035947322845459,
"logps/rejected": -55.91766357421875,
"loss": 0.5887908935546875,
"memory(GiB)": 46.1,
"nll_loss": 0.467349648475647,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.3129452168941498,
"rewards/margins": 4.274552345275879,
"rewards/rejected": -3.961606979370117,
"step": 247,
"train_speed(iter/s)": 0.008039
},
{
"epoch": 0.5500034652436067,
"grad_norm": 4.468607425689697,
"learning_rate": 0.00017344783757020356,
"logits/chosen": -0.9219909906387329,
"logits/rejected": -0.9567832350730896,
"logps/chosen": -6.767885208129883,
"logps/rejected": -64.09295654296875,
"loss": 0.570389986038208,
"memory(GiB)": 46.1,
"nll_loss": 0.3981003165245056,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.21861377358436584,
"rewards/margins": 4.632497310638428,
"rewards/rejected": -4.413884162902832,
"step": 248,
"train_speed(iter/s)": 0.00804
},
{
"epoch": 0.552221221151847,
"grad_norm": 3.9139609336853027,
"learning_rate": 0.00017319798728028619,
"logits/chosen": -0.8682211637496948,
"logits/rejected": -0.9467407464981079,
"logps/chosen": -7.962907791137695,
"logps/rejected": -57.789955139160156,
"loss": 0.6136176586151123,
"memory(GiB)": 46.1,
"nll_loss": 0.36956262588500977,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.25562986731529236,
"rewards/margins": 3.6893582344055176,
"rewards/rejected": -3.4337282180786133,
"step": 249,
"train_speed(iter/s)": 0.008041
},
{
"epoch": 0.5544389770600874,
"grad_norm": 3.867413282394409,
"learning_rate": 0.0001729471487418621,
"logits/chosen": -0.9048889875411987,
"logits/rejected": -0.9317964315414429,
"logps/chosen": -8.489683151245117,
"logps/rejected": -35.35362243652344,
"loss": 0.6919417977333069,
"memory(GiB)": 46.1,
"nll_loss": 0.38164252042770386,
"rewards/accuracies": 0.90625,
"rewards/chosen": 0.31191277503967285,
"rewards/margins": 2.2607834339141846,
"rewards/rejected": -1.9488706588745117,
"step": 250,
"train_speed(iter/s)": 0.00804
},
{
"epoch": 0.5566567329683276,
"grad_norm": 2.298877239227295,
"learning_rate": 0.00017269532534151092,
"logits/chosen": -0.7615423202514648,
"logits/rejected": -0.8214331865310669,
"logps/chosen": -4.562041282653809,
"logps/rejected": -50.8994140625,
"loss": 0.4953613579273224,
"memory(GiB)": 46.1,
"nll_loss": 0.3353947401046753,
"rewards/accuracies": 0.96875,
"rewards/chosen": 0.3833675682544708,
"rewards/margins": 3.5597290992736816,
"rewards/rejected": -3.176361560821533,
"step": 251,
"train_speed(iter/s)": 0.008036
},
{
"epoch": 0.558874488876568,
"grad_norm": 2.6716578006744385,
"learning_rate": 0.00017244252047910892,
"logits/chosen": -0.7982797622680664,
"logits/rejected": -0.8429900407791138,
"logps/chosen": -7.085336685180664,
"logps/rejected": -56.750762939453125,
"loss": 0.6702145934104919,
"memory(GiB)": 46.1,
"nll_loss": 0.39718589186668396,
"rewards/accuracies": 0.90625,
"rewards/chosen": 0.08545264601707458,
"rewards/margins": 3.4916038513183594,
"rewards/rejected": -3.406151056289673,
"step": 252,
"train_speed(iter/s)": 0.008037
},
{
"epoch": 0.5610922447848083,
"grad_norm": 25.809972763061523,
"learning_rate": 0.0001721887375677831,
"logits/chosen": -0.8431349396705627,
"logits/rejected": -0.8907182216644287,
"logps/chosen": -9.1442289352417,
"logps/rejected": -49.07356643676758,
"loss": 0.6953955888748169,
"memory(GiB)": 46.1,
"nll_loss": 0.4963495135307312,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.40793710947036743,
"rewards/margins": 3.5371923446655273,
"rewards/rejected": -3.129255533218384,
"step": 253,
"train_speed(iter/s)": 0.008039
},
{
"epoch": 0.5633100006930487,
"grad_norm": 3.9957404136657715,
"learning_rate": 0.0001719339800338651,
"logits/chosen": -0.8641637563705444,
"logits/rejected": -0.9326637983322144,
"logps/chosen": -6.770094394683838,
"logps/rejected": -52.5345458984375,
"loss": 0.5996891260147095,
"memory(GiB)": 46.1,
"nll_loss": 0.39112862944602966,
"rewards/accuracies": 0.90625,
"rewards/chosen": 0.35435986518859863,
"rewards/margins": 3.2783637046813965,
"rewards/rejected": -2.9240036010742188,
"step": 254,
"train_speed(iter/s)": 0.008038
},
{
"epoch": 0.5655277566012891,
"grad_norm": 2.1859161853790283,
"learning_rate": 0.00017167825131684513,
"logits/chosen": -0.8427779674530029,
"logits/rejected": -0.8935760855674744,
"logps/chosen": -6.190837383270264,
"logps/rejected": -64.83207702636719,
"loss": 0.41889873147010803,
"memory(GiB)": 46.1,
"nll_loss": 0.34747910499572754,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.39933833479881287,
"rewards/margins": 4.655778408050537,
"rewards/rejected": -4.256440162658691,
"step": 255,
"train_speed(iter/s)": 0.008039
},
{
"epoch": 0.5677455125095294,
"grad_norm": 6.577281951904297,
"learning_rate": 0.00017142155486932518,
"logits/chosen": -0.9050501585006714,
"logits/rejected": -0.9711922407150269,
"logps/chosen": -5.258976936340332,
"logps/rejected": -66.69300842285156,
"loss": 0.5538998246192932,
"memory(GiB)": 46.1,
"nll_loss": 0.36948734521865845,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.23015204071998596,
"rewards/margins": 4.450538158416748,
"rewards/rejected": -4.220386505126953,
"step": 256,
"train_speed(iter/s)": 0.008038
},
{
"epoch": 0.5699632684177698,
"grad_norm": 7.422839641571045,
"learning_rate": 0.00017116389415697272,
"logits/chosen": -0.8993850946426392,
"logits/rejected": -0.9391924738883972,
"logps/chosen": -7.405189514160156,
"logps/rejected": -80.06634521484375,
"loss": 0.45386412739753723,
"memory(GiB)": 46.1,
"nll_loss": 0.3150070011615753,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.22320273518562317,
"rewards/margins": 6.410494804382324,
"rewards/rejected": -6.187292098999023,
"step": 257,
"train_speed(iter/s)": 0.008039
},
{
"epoch": 0.5721810243260101,
"grad_norm": 2.2811427116394043,
"learning_rate": 0.00017090527265847374,
"logits/chosen": -0.9498234987258911,
"logits/rejected": -1.023263692855835,
"logps/chosen": -7.831456184387207,
"logps/rejected": -94.71128845214844,
"loss": 0.4886764883995056,
"memory(GiB)": 46.1,
"nll_loss": 0.37856870889663696,
"rewards/accuracies": 0.90625,
"rewards/chosen": 0.3619069457054138,
"rewards/margins": 7.0146894454956055,
"rewards/rejected": -6.652782440185547,
"step": 258,
"train_speed(iter/s)": 0.008038
},
{
"epoch": 0.5743987802342505,
"grad_norm": 13.671805381774902,
"learning_rate": 0.00017064569386548585,
"logits/chosen": -0.9374775290489197,
"logits/rejected": -0.9560403227806091,
"logps/chosen": -15.280105590820312,
"logps/rejected": -59.25236129760742,
"loss": 1.0413533449172974,
"memory(GiB)": 46.1,
"nll_loss": 0.7767413854598999,
"rewards/accuracies": 0.9375,
"rewards/chosen": -0.21862581372261047,
"rewards/margins": 4.168983459472656,
"rewards/rejected": -4.387609958648682,
"step": 259,
"train_speed(iter/s)": 0.008039
},
{
"epoch": 0.5766165361424909,
"grad_norm": 20.491348266601562,
"learning_rate": 0.00017038516128259115,
"logits/chosen": -0.9478408098220825,
"logits/rejected": -0.9793086051940918,
"logps/chosen": -5.960484504699707,
"logps/rejected": -58.90625762939453,
"loss": 0.8467053174972534,
"memory(GiB)": 46.1,
"nll_loss": 0.6261860728263855,
"rewards/accuracies": 0.90625,
"rewards/chosen": 0.22471851110458374,
"rewards/margins": 4.334632873535156,
"rewards/rejected": -4.109914302825928,
"step": 260,
"train_speed(iter/s)": 0.008036
},
{
"epoch": 0.5788342920507311,
"grad_norm": 4.862920761108398,
"learning_rate": 0.00017012367842724887,
"logits/chosen": -0.8967673778533936,
"logits/rejected": -0.922260582447052,
"logps/chosen": -8.773322105407715,
"logps/rejected": -41.337547302246094,
"loss": 0.5787839293479919,
"memory(GiB)": 46.1,
"nll_loss": 0.39914894104003906,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.3420258164405823,
"rewards/margins": 2.8629865646362305,
"rewards/rejected": -2.520960807800293,
"step": 261,
"train_speed(iter/s)": 0.008035
},
{
"epoch": 0.5810520479589715,
"grad_norm": 6.606571674346924,
"learning_rate": 0.0001698612488297479,
"logits/chosen": -0.8431069254875183,
"logits/rejected": -0.8718072772026062,
"logps/chosen": -4.862249374389648,
"logps/rejected": -69.5229721069336,
"loss": 0.48749804496765137,
"memory(GiB)": 46.1,
"nll_loss": 0.298774778842926,
"rewards/accuracies": 0.90625,
"rewards/chosen": 0.2969810962677002,
"rewards/margins": 5.211779594421387,
"rewards/rejected": -4.914798736572266,
"step": 262,
"train_speed(iter/s)": 0.008036
},
{
"epoch": 0.5832698038672118,
"grad_norm": 8.771227836608887,
"learning_rate": 0.0001695978760331591,
"logits/chosen": -0.844187319278717,
"logits/rejected": -0.8691195249557495,
"logps/chosen": -10.602951049804688,
"logps/rejected": -55.179969787597656,
"loss": 0.7893258929252625,
"memory(GiB)": 46.1,
"nll_loss": 0.5229781866073608,
"rewards/accuracies": 0.84375,
"rewards/chosen": 0.20470717549324036,
"rewards/margins": 3.2157349586486816,
"rewards/rejected": -3.0110273361206055,
"step": 263,
"train_speed(iter/s)": 0.008036
},
{
"epoch": 0.5854875597754522,
"grad_norm": 4.490575313568115,
"learning_rate": 0.00016933356359328757,
"logits/chosen": -0.8540911674499512,
"logits/rejected": -0.8924884796142578,
"logps/chosen": -11.638439178466797,
"logps/rejected": -56.00303649902344,
"loss": 0.802644670009613,
"memory(GiB)": 46.1,
"nll_loss": 0.46404212713241577,
"rewards/accuracies": 0.84375,
"rewards/chosen": 0.22095105051994324,
"rewards/margins": 3.449429512023926,
"rewards/rejected": -3.228478193283081,
"step": 264,
"train_speed(iter/s)": 0.008037
},
{
"epoch": 0.5877053156836926,
"grad_norm": 2.0575592517852783,
"learning_rate": 0.00016906831507862443,
"logits/chosen": -0.879247784614563,
"logits/rejected": -0.9168909788131714,
"logps/chosen": -8.618342399597168,
"logps/rejected": -58.41561508178711,
"loss": 0.5658751726150513,
"memory(GiB)": 46.1,
"nll_loss": 0.424156129360199,
"rewards/accuracies": 0.96875,
"rewards/chosen": 0.47101202607154846,
"rewards/margins": 4.365726470947266,
"rewards/rejected": -3.89471435546875,
"step": 265,
"train_speed(iter/s)": 0.008036
},
{
"epoch": 0.5899230715919329,
"grad_norm": 5.172542095184326,
"learning_rate": 0.00016880213407029899,
"logits/chosen": -0.8254646062850952,
"logits/rejected": -0.8460347652435303,
"logps/chosen": -13.859678268432617,
"logps/rejected": -62.08647537231445,
"loss": 0.5818012952804565,
"memory(GiB)": 46.1,
"nll_loss": 0.42503443360328674,
"rewards/accuracies": 0.96875,
"rewards/chosen": 0.44672632217407227,
"rewards/margins": 4.058588981628418,
"rewards/rejected": -3.6118626594543457,
"step": 266,
"train_speed(iter/s)": 0.008037
},
{
"epoch": 0.5921408275001733,
"grad_norm": 6.763800144195557,
"learning_rate": 0.00016853502416203,
"logits/chosen": -0.8868339657783508,
"logits/rejected": -0.9178940653800964,
"logps/chosen": -10.896245002746582,
"logps/rejected": -62.17267608642578,
"loss": 0.8170678019523621,
"memory(GiB)": 46.1,
"nll_loss": 0.5326193571090698,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.13541792333126068,
"rewards/margins": 4.492279529571533,
"rewards/rejected": -4.356861591339111,
"step": 267,
"train_speed(iter/s)": 0.008037
},
{
"epoch": 0.5943585834084136,
"grad_norm": 1.9904747009277344,
"learning_rate": 0.00016826698896007733,
"logits/chosen": -0.9039366841316223,
"logits/rejected": -0.9352925419807434,
"logps/chosen": -11.314581871032715,
"logps/rejected": -61.60304260253906,
"loss": 0.42121097445487976,
"memory(GiB)": 46.1,
"nll_loss": 0.3151026964187622,
"rewards/accuracies": 0.96875,
"rewards/chosen": 0.3598387837409973,
"rewards/margins": 4.653321266174316,
"rewards/rejected": -4.293482780456543,
"step": 268,
"train_speed(iter/s)": 0.008038
},
{
"epoch": 0.596576339316654,
"grad_norm": 5.165607452392578,
"learning_rate": 0.0001679980320831934,
"logits/chosen": -0.8385277986526489,
"logits/rejected": -0.8792409300804138,
"logps/chosen": -8.309085845947266,
"logps/rejected": -64.71354675292969,
"loss": 0.5031875371932983,
"memory(GiB)": 46.1,
"nll_loss": 0.3636503219604492,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.24522201716899872,
"rewards/margins": 4.567659854888916,
"rewards/rejected": -4.322437763214111,
"step": 269,
"train_speed(iter/s)": 0.008037
},
{
"epoch": 0.5987940952248944,
"grad_norm": 4.2751874923706055,
"learning_rate": 0.00016772815716257412,
"logits/chosen": -0.9187635779380798,
"logits/rejected": -0.9605762958526611,
"logps/chosen": -8.409623146057129,
"logps/rejected": -52.862247467041016,
"loss": 0.6836012005805969,
"memory(GiB)": 46.1,
"nll_loss": 0.44153153896331787,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.39110705256462097,
"rewards/margins": 3.830803871154785,
"rewards/rejected": -3.439696788787842,
"step": 270,
"train_speed(iter/s)": 0.008037
},
{
"epoch": 0.6010118511331347,
"grad_norm": 4.208390712738037,
"learning_rate": 0.0001674573678418099,
"logits/chosen": -0.8860863447189331,
"logits/rejected": -0.9442291855812073,
"logps/chosen": -4.314522743225098,
"logps/rejected": -57.75453567504883,
"loss": 0.5371519923210144,
"memory(GiB)": 46.1,
"nll_loss": 0.33125901222229004,
"rewards/accuracies": 0.90625,
"rewards/chosen": 0.22049468755722046,
"rewards/margins": 4.082085132598877,
"rewards/rejected": -3.8615903854370117,
"step": 271,
"train_speed(iter/s)": 0.008039
},
{
"epoch": 0.603229607041375,
"grad_norm": 4.579020977020264,
"learning_rate": 0.00016718566777683655,
"logits/chosen": -0.8948354721069336,
"logits/rejected": -0.9177219271659851,
"logps/chosen": -14.298483848571777,
"logps/rejected": -62.74816131591797,
"loss": 0.6376166939735413,
"memory(GiB)": 46.1,
"nll_loss": 0.5089208483695984,
"rewards/accuracies": 0.96875,
"rewards/chosen": 0.32330945134162903,
"rewards/margins": 4.685830593109131,
"rewards/rejected": -4.362521171569824,
"step": 272,
"train_speed(iter/s)": 0.008039
},
{
"epoch": 0.6054473629496153,
"grad_norm": 1.6271522045135498,
"learning_rate": 0.00016691306063588583,
"logits/chosen": -0.8025689125061035,
"logits/rejected": -0.8775883316993713,
"logps/chosen": -6.190898418426514,
"logps/rejected": -67.3564453125,
"loss": 0.512791633605957,
"memory(GiB)": 46.1,
"nll_loss": 0.33794161677360535,
"rewards/accuracies": 0.96875,
"rewards/chosen": 0.36618149280548096,
"rewards/margins": 4.5750837326049805,
"rewards/rejected": -4.208902359008789,
"step": 273,
"train_speed(iter/s)": 0.008041
},
{
"epoch": 0.6076651188578557,
"grad_norm": 1.6816551685333252,
"learning_rate": 0.00016663955009943603,
"logits/chosen": -0.8147826790809631,
"logits/rejected": -0.8742930889129639,
"logps/chosen": -3.890578508377075,
"logps/rejected": -65.23680114746094,
"loss": 0.3021196126937866,
"memory(GiB)": 46.1,
"nll_loss": 0.15443052351474762,
"rewards/accuracies": 0.90625,
"rewards/chosen": 0.26169687509536743,
"rewards/margins": 4.66456413269043,
"rewards/rejected": -4.402867317199707,
"step": 274,
"train_speed(iter/s)": 0.008041
},
{
"epoch": 0.609882874766096,
"grad_norm": 5.99432373046875,
"learning_rate": 0.00016636513986016213,
"logits/chosen": -0.7995700836181641,
"logits/rejected": -0.8312158584594727,
"logps/chosen": -8.787904739379883,
"logps/rejected": -66.17198181152344,
"loss": 0.6568697690963745,
"memory(GiB)": 46.1,
"nll_loss": 0.4868704080581665,
"rewards/accuracies": 0.90625,
"rewards/chosen": 0.334846168756485,
"rewards/margins": 4.610203742980957,
"rewards/rejected": -4.275357246398926,
"step": 275,
"train_speed(iter/s)": 0.008041
},
{
"epoch": 0.6121006306743364,
"grad_norm": 1.89693021774292,
"learning_rate": 0.00016608983362288612,
"logits/chosen": -0.7742518782615662,
"logits/rejected": -0.8116195797920227,
"logps/chosen": -8.038908958435059,
"logps/rejected": -50.42762756347656,
"loss": 0.6119199991226196,
"memory(GiB)": 46.1,
"nll_loss": 0.41143566370010376,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.38594791293144226,
"rewards/margins": 3.199566125869751,
"rewards/rejected": -2.8136179447174072,
"step": 276,
"train_speed(iter/s)": 0.00804
},
{
"epoch": 0.6143183865825768,
"grad_norm": 7.4511284828186035,
"learning_rate": 0.00016581363510452684,
"logits/chosen": -0.7676944136619568,
"logits/rejected": -0.7938407063484192,
"logps/chosen": -9.055317878723145,
"logps/rejected": -58.31163787841797,
"loss": 0.6325221061706543,
"memory(GiB)": 46.1,
"nll_loss": 0.42814794182777405,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.3626343905925751,
"rewards/margins": 4.097815036773682,
"rewards/rejected": -3.735180377960205,
"step": 277,
"train_speed(iter/s)": 0.008039
},
{
"epoch": 0.6165361424908171,
"grad_norm": 8.191842079162598,
"learning_rate": 0.00016553654803404974,
"logits/chosen": -0.8072691559791565,
"logits/rejected": -0.8492940068244934,
"logps/chosen": -9.613892555236816,
"logps/rejected": -63.351585388183594,
"loss": 0.7843741178512573,
"memory(GiB)": 46.1,
"nll_loss": 0.44085100293159485,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.12112342566251755,
"rewards/margins": 4.584871292114258,
"rewards/rejected": -4.463747978210449,
"step": 278,
"train_speed(iter/s)": 0.008039
},
{
"epoch": 0.6187538983990575,
"grad_norm": 1.822716236114502,
"learning_rate": 0.00016525857615241687,
"logits/chosen": -0.7915133237838745,
"logits/rejected": -0.834713876247406,
"logps/chosen": -8.906228065490723,
"logps/rejected": -65.07171630859375,
"loss": 0.4892042279243469,
"memory(GiB)": 46.1,
"nll_loss": 0.34095320105552673,
"rewards/accuracies": 0.90625,
"rewards/chosen": 0.35025283694267273,
"rewards/margins": 4.735526084899902,
"rewards/rejected": -4.385272979736328,
"step": 279,
"train_speed(iter/s)": 0.008038
},
{
"epoch": 0.6209716543072978,
"grad_norm": 2.0796329975128174,
"learning_rate": 0.000164979723212536,
"logits/chosen": -0.820456326007843,
"logits/rejected": -0.8396943807601929,
"logps/chosen": -8.370631217956543,
"logps/rejected": -63.127323150634766,
"loss": 0.6209460496902466,
"memory(GiB)": 46.1,
"nll_loss": 0.45356690883636475,
"rewards/accuracies": 0.96875,
"rewards/chosen": 0.28135380148887634,
"rewards/margins": 4.626897811889648,
"rewards/rejected": -4.34554386138916,
"step": 280,
"train_speed(iter/s)": 0.008039
},
{
"epoch": 0.6231894102155382,
"grad_norm": 5.120301246643066,
"learning_rate": 0.00016469999297921004,
"logits/chosen": -0.8289170265197754,
"logits/rejected": -0.857169508934021,
"logps/chosen": -8.919156074523926,
"logps/rejected": -68.47624206542969,
"loss": 0.6525104641914368,
"memory(GiB)": 46.1,
"nll_loss": 0.544549822807312,
"rewards/accuracies": 0.96875,
"rewards/chosen": 0.32334885001182556,
"rewards/margins": 5.191709995269775,
"rewards/rejected": -4.868360996246338,
"step": 281,
"train_speed(iter/s)": 0.008039
},
{
"epoch": 0.6254071661237784,
"grad_norm": 3.569572687149048,
"learning_rate": 0.00016441938922908645,
"logits/chosen": -0.8497668504714966,
"logits/rejected": -0.8852089047431946,
"logps/chosen": -8.614233016967773,
"logps/rejected": -86.08775329589844,
"loss": 0.39198628067970276,
"memory(GiB)": 46.1,
"nll_loss": 0.29619306325912476,
"rewards/accuracies": 0.96875,
"rewards/chosen": 0.2805593013763428,
"rewards/margins": 6.5137038230896,
"rewards/rejected": -6.2331438064575195,
"step": 282,
"train_speed(iter/s)": 0.008038
},
{
"epoch": 0.6276249220320188,
"grad_norm": 3.6795778274536133,
"learning_rate": 0.0001641379157506059,
"logits/chosen": -0.8261008262634277,
"logits/rejected": -0.8573625087738037,
"logps/chosen": -8.30790901184082,
"logps/rejected": -68.17735290527344,
"loss": 0.4799172878265381,
"memory(GiB)": 46.1,
"nll_loss": 0.3408132791519165,
"rewards/accuracies": 0.96875,
"rewards/chosen": 0.45212632417678833,
"rewards/margins": 5.448065757751465,
"rewards/rejected": -4.995939254760742,
"step": 283,
"train_speed(iter/s)": 0.008037
},
{
"epoch": 0.6298426779402592,
"grad_norm": 4.690124034881592,
"learning_rate": 0.00016385557634395137,
"logits/chosen": -0.7986090183258057,
"logits/rejected": -0.8487676978111267,
"logps/chosen": -11.636720657348633,
"logps/rejected": -72.38658142089844,
"loss": 0.6701381206512451,
"memory(GiB)": 46.1,
"nll_loss": 0.3881206512451172,
"rewards/accuracies": 0.90625,
"rewards/chosen": 0.22570770978927612,
"rewards/margins": 4.7588019371032715,
"rewards/rejected": -4.5330939292907715,
"step": 284,
"train_speed(iter/s)": 0.008039
},
{
"epoch": 0.6320604338484995,
"grad_norm": 7.493976593017578,
"learning_rate": 0.00016357237482099684,
"logits/chosen": -0.8304284811019897,
"logits/rejected": -0.8699071407318115,
"logps/chosen": -5.870106220245361,
"logps/rejected": -76.31659698486328,
"loss": 0.5334377884864807,
"memory(GiB)": 46.1,
"nll_loss": 0.39371258020401,
"rewards/accuracies": 0.90625,
"rewards/chosen": 0.32191622257232666,
"rewards/margins": 5.466432094573975,
"rewards/rejected": -5.1445159912109375,
"step": 285,
"train_speed(iter/s)": 0.008039
},
{
"epoch": 0.6342781897567399,
"grad_norm": 3.969316005706787,
"learning_rate": 0.00016328831500525554,
"logits/chosen": -0.8328202366828918,
"logits/rejected": -0.8629224896430969,
"logps/chosen": -6.880237102508545,
"logps/rejected": -74.27322387695312,
"loss": 0.5944677591323853,
"memory(GiB)": 46.1,
"nll_loss": 0.3375623822212219,
"rewards/accuracies": 0.8125,
"rewards/chosen": 0.2438332587480545,
"rewards/margins": 5.4755988121032715,
"rewards/rejected": -5.231765270233154,
"step": 286,
"train_speed(iter/s)": 0.008038
},
{
"epoch": 0.6364959456649802,
"grad_norm": 7.615932464599609,
"learning_rate": 0.00016300340073182877,
"logits/chosen": -0.8713105916976929,
"logits/rejected": -0.9103774428367615,
"logps/chosen": -8.833354949951172,
"logps/rejected": -71.67160034179688,
"loss": 0.5350167751312256,
"memory(GiB)": 46.1,
"nll_loss": 0.3725404441356659,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.16415414214134216,
"rewards/margins": 5.522144317626953,
"rewards/rejected": -5.35798978805542,
"step": 287,
"train_speed(iter/s)": 0.008038
},
{
"epoch": 0.6387137015732206,
"grad_norm": 1.877372145652771,
"learning_rate": 0.0001627176358473537,
"logits/chosen": -0.7970234751701355,
"logits/rejected": -0.8734095692634583,
"logps/chosen": -6.636631011962891,
"logps/rejected": -77.04444122314453,
"loss": 0.4367782473564148,
"memory(GiB)": 46.1,
"nll_loss": 0.3150050640106201,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.2868354022502899,
"rewards/margins": 5.483615875244141,
"rewards/rejected": -5.196780204772949,
"step": 288,
"train_speed(iter/s)": 0.008037
},
{
"epoch": 0.640931457481461,
"grad_norm": 1.9805866479873657,
"learning_rate": 0.00016243102420995182,
"logits/chosen": -0.9195335507392883,
"logits/rejected": -0.9563324451446533,
"logps/chosen": -9.391670227050781,
"logps/rejected": -74.65196228027344,
"loss": 0.4557032883167267,
"memory(GiB)": 46.1,
"nll_loss": 0.3854813575744629,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.2575431764125824,
"rewards/margins": 5.831593990325928,
"rewards/rejected": -5.5740509033203125,
"step": 289,
"train_speed(iter/s)": 0.008037
},
{
"epoch": 0.6431492133897013,
"grad_norm": 1.8995643854141235,
"learning_rate": 0.00016214356968917648,
"logits/chosen": -0.8684622645378113,
"logits/rejected": -0.9041600823402405,
"logps/chosen": -6.005845069885254,
"logps/rejected": -63.756404876708984,
"loss": 0.5114766359329224,
"memory(GiB)": 46.1,
"nll_loss": 0.34650737047195435,
"rewards/accuracies": 0.90625,
"rewards/chosen": 0.3093988299369812,
"rewards/margins": 3.883380174636841,
"rewards/rejected": -3.573981285095215,
"step": 290,
"train_speed(iter/s)": 0.008036
},
{
"epoch": 0.6453669692979417,
"grad_norm": 2.626262903213501,
"learning_rate": 0.00016185527616596095,
"logits/chosen": -0.8445376753807068,
"logits/rejected": -0.9054903388023376,
"logps/chosen": -8.279337882995605,
"logps/rejected": -67.75119018554688,
"loss": 0.5382622480392456,
"memory(GiB)": 46.1,
"nll_loss": 0.37347856163978577,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.31158941984176636,
"rewards/margins": 5.205071926116943,
"rewards/rejected": -4.893482208251953,
"step": 291,
"train_speed(iter/s)": 0.008037
},
{
"epoch": 0.647584725206182,
"grad_norm": 1.6392858028411865,
"learning_rate": 0.0001615661475325658,
"logits/chosen": -0.9225890636444092,
"logits/rejected": -0.961870551109314,
"logps/chosen": -8.307012557983398,
"logps/rejected": -68.97980499267578,
"loss": 0.4374139606952667,
"memory(GiB)": 46.1,
"nll_loss": 0.30878713726997375,
"rewards/accuracies": 0.96875,
"rewards/chosen": 0.4022150933742523,
"rewards/margins": 4.990863800048828,
"rewards/rejected": -4.588648319244385,
"step": 292,
"train_speed(iter/s)": 0.008037
},
{
"epoch": 0.6498024811144223,
"grad_norm": 2.5469810962677,
"learning_rate": 0.0001612761876925266,
"logits/chosen": -0.8949599266052246,
"logits/rejected": -0.9571384191513062,
"logps/chosen": -9.247197151184082,
"logps/rejected": -69.23826599121094,
"loss": 0.569223165512085,
"memory(GiB)": 46.1,
"nll_loss": 0.38202205300331116,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.41862952709198,
"rewards/margins": 4.359453201293945,
"rewards/rejected": -3.940823554992676,
"step": 293,
"train_speed(iter/s)": 0.008036
},
{
"epoch": 0.6520202370226627,
"grad_norm": 1.9419584274291992,
"learning_rate": 0.00016098540056060093,
"logits/chosen": -0.9679895043373108,
"logits/rejected": -1.007946491241455,
"logps/chosen": -9.110626220703125,
"logps/rejected": -64.00426483154297,
"loss": 0.6166866421699524,
"memory(GiB)": 46.1,
"nll_loss": 0.4243084490299225,
"rewards/accuracies": 0.90625,
"rewards/chosen": 0.3954381048679352,
"rewards/margins": 3.941873073577881,
"rewards/rejected": -3.5464346408843994,
"step": 294,
"train_speed(iter/s)": 0.008037
},
{
"epoch": 0.654237992930903,
"grad_norm": 2.5056684017181396,
"learning_rate": 0.00016069379006271566,
"logits/chosen": -0.9131721258163452,
"logits/rejected": -0.9555903673171997,
"logps/chosen": -7.171519756317139,
"logps/rejected": -65.33702087402344,
"loss": 0.5050148963928223,
"memory(GiB)": 46.1,
"nll_loss": 0.35454410314559937,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.3253967761993408,
"rewards/margins": 4.702347278594971,
"rewards/rejected": -4.376949787139893,
"step": 295,
"train_speed(iter/s)": 0.008035
},
{
"epoch": 0.6564557488391434,
"grad_norm": 1.6568937301635742,
"learning_rate": 0.0001604013601359141,
"logits/chosen": -0.9838509559631348,
"logits/rejected": -1.0402789115905762,
"logps/chosen": -3.7990381717681885,
"logps/rejected": -71.07801055908203,
"loss": 0.3659912049770355,
"memory(GiB)": 46.1,
"nll_loss": 0.25355616211891174,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.24511104822158813,
"rewards/margins": 5.158456325531006,
"rewards/rejected": -4.9133453369140625,
"step": 296,
"train_speed(iter/s)": 0.008035
},
{
"epoch": 0.6586735047473837,
"grad_norm": 3.638634443283081,
"learning_rate": 0.00016010811472830252,
"logits/chosen": -1.039500117301941,
"logits/rejected": -1.0798026323318481,
"logps/chosen": -6.155025482177734,
"logps/rejected": -55.543113708496094,
"loss": 0.533197283744812,
"memory(GiB)": 46.1,
"nll_loss": 0.36974427103996277,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.4299376308917999,
"rewards/margins": 4.183603763580322,
"rewards/rejected": -3.7536661624908447,
"step": 297,
"train_speed(iter/s)": 0.008035
},
{
"epoch": 0.6608912606556241,
"grad_norm": 1.9530096054077148,
"learning_rate": 0.00015981405779899715,
"logits/chosen": -1.0155575275421143,
"logits/rejected": -1.0633889436721802,
"logps/chosen": -9.130773544311523,
"logps/rejected": -62.94365692138672,
"loss": 0.47470739483833313,
"memory(GiB)": 46.1,
"nll_loss": 0.3274574279785156,
"rewards/accuracies": 0.96875,
"rewards/chosen": 0.2257828563451767,
"rewards/margins": 4.259277820587158,
"rewards/rejected": -4.03349494934082,
"step": 298,
"train_speed(iter/s)": 0.008035
},
{
"epoch": 0.6631090165638645,
"grad_norm": 2.4985907077789307,
"learning_rate": 0.0001595191933180705,
"logits/chosen": -1.0449122190475464,
"logits/rejected": -1.0995962619781494,
"logps/chosen": -5.003297805786133,
"logps/rejected": -76.33629608154297,
"loss": 0.4325657784938812,
"memory(GiB)": 46.1,
"nll_loss": 0.2864378094673157,
"rewards/accuracies": 0.90625,
"rewards/chosen": 0.1750936508178711,
"rewards/margins": 5.564494609832764,
"rewards/rejected": -5.389400482177734,
"step": 299,
"train_speed(iter/s)": 0.008035
},
{
"epoch": 0.6653267724721048,
"grad_norm": 4.527393817901611,
"learning_rate": 0.00015922352526649803,
"logits/chosen": -1.013086199760437,
"logits/rejected": -1.0818321704864502,
"logps/chosen": -7.39998197555542,
"logps/rejected": -79.36940002441406,
"loss": 0.5117042660713196,
"memory(GiB)": 46.1,
"nll_loss": 0.35834765434265137,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.22214177250862122,
"rewards/margins": 5.567633152008057,
"rewards/rejected": -5.345491409301758,
"step": 300,
"train_speed(iter/s)": 0.008034
},
{
"epoch": 0.6653267724721048,
"eval_logits/chosen": -1.051897406578064,
"eval_logits/rejected": -1.1186614036560059,
"eval_logps/chosen": -5.492368698120117,
"eval_logps/rejected": -83.7062759399414,
"eval_loss": 0.41139093041419983,
"eval_nll_loss": 0.3018193244934082,
"eval_rewards/accuracies": 0.9655172228813171,
"eval_rewards/chosen": 0.31715357303619385,
"eval_rewards/margins": 6.428208351135254,
"eval_rewards/rejected": -6.111053466796875,
"eval_runtime": 221.1454,
"eval_samples_per_second": 0.656,
"eval_steps_per_second": 0.656,
"step": 300
},
{
"epoch": 0.6675445283803452,
"grad_norm": 2.912181854248047,
"learning_rate": 0.00015892705763610398,
"logits/chosen": -1.0837887525558472,
"logits/rejected": -1.1028895378112793,
"logps/chosen": -11.03648853302002,
"logps/rejected": -74.05093383789062,
"loss": 0.5985814929008484,
"memory(GiB)": 46.1,
"nll_loss": 0.39898425340652466,
"rewards/accuracies": 0.90625,
"rewards/chosen": 0.3419343829154968,
"rewards/margins": 5.46358060836792,
"rewards/rejected": -5.121645927429199,
"step": 301,
"train_speed(iter/s)": 0.007984
},
{
"epoch": 0.6697622842885855,
"grad_norm": 6.333323001861572,
"learning_rate": 0.000158629794429508,
"logits/chosen": -1.1112759113311768,
"logits/rejected": -1.1460927724838257,
"logps/chosen": -7.317679405212402,
"logps/rejected": -69.5050048828125,
"loss": 0.65586918592453,
"memory(GiB)": 46.1,
"nll_loss": 0.37288913130760193,
"rewards/accuracies": 0.8125,
"rewards/chosen": 0.0826641321182251,
"rewards/margins": 5.427277088165283,
"rewards/rejected": -5.344613075256348,
"step": 302,
"train_speed(iter/s)": 0.007984
},
{
"epoch": 0.6719800401968259,
"grad_norm": 15.77000904083252,
"learning_rate": 0.00015833173966007066,
"logits/chosen": -1.1002230644226074,
"logits/rejected": -1.1550010442733765,
"logps/chosen": -6.355401992797852,
"logps/rejected": -96.39167022705078,
"loss": 0.5191652774810791,
"memory(GiB)": 46.1,
"nll_loss": 0.359164834022522,
"rewards/accuracies": 0.96875,
"rewards/chosen": 0.48963892459869385,
"rewards/margins": 8.402400970458984,
"rewards/rejected": -7.912761688232422,
"step": 303,
"train_speed(iter/s)": 0.007984
},
{
"epoch": 0.6741977961050661,
"grad_norm": 2.923369884490967,
"learning_rate": 0.00015803289735183952,
"logits/chosen": -1.0692856311798096,
"logits/rejected": -1.1164627075195312,
"logps/chosen": -11.489358901977539,
"logps/rejected": -65.28047943115234,
"loss": 0.6315346360206604,
"memory(GiB)": 46.1,
"nll_loss": 0.5478549599647522,
"rewards/accuracies": 0.96875,
"rewards/chosen": 0.20820873975753784,
"rewards/margins": 5.051858425140381,
"rewards/rejected": -4.843649864196777,
"step": 304,
"train_speed(iter/s)": 0.007985
},
{
"epoch": 0.6764155520133065,
"grad_norm": 4.412753105163574,
"learning_rate": 0.00015773327153949465,
"logits/chosen": -1.123039960861206,
"logits/rejected": -1.1700791120529175,
"logps/chosen": -6.8377275466918945,
"logps/rejected": -71.43708801269531,
"loss": 0.6268560886383057,
"memory(GiB)": 46.1,
"nll_loss": 0.4594406187534332,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.25862306356430054,
"rewards/margins": 5.758920192718506,
"rewards/rejected": -5.500297546386719,
"step": 305,
"train_speed(iter/s)": 0.007985
},
{
"epoch": 0.6786333079215469,
"grad_norm": 4.7620530128479,
"learning_rate": 0.00015743286626829437,
"logits/chosen": -1.0160408020019531,
"logits/rejected": -1.062739610671997,
"logps/chosen": -9.769542694091797,
"logps/rejected": -62.2449836730957,
"loss": 0.9608262777328491,
"memory(GiB)": 46.1,
"nll_loss": 0.7778749465942383,
"rewards/accuracies": 0.90625,
"rewards/chosen": 0.25323987007141113,
"rewards/margins": 4.6640191078186035,
"rewards/rejected": -4.410778999328613,
"step": 306,
"train_speed(iter/s)": 0.007985
},
{
"epoch": 0.6808510638297872,
"grad_norm": 5.518799304962158,
"learning_rate": 0.0001571316855940204,
"logits/chosen": -1.0274622440338135,
"logits/rejected": -1.0647941827774048,
"logps/chosen": -12.439924240112305,
"logps/rejected": -77.76188659667969,
"loss": 0.5631053447723389,
"memory(GiB)": 46.1,
"nll_loss": 0.26418688893318176,
"rewards/accuracies": 0.8125,
"rewards/chosen": 0.08976743370294571,
"rewards/margins": 5.368993282318115,
"rewards/rejected": -5.279226303100586,
"step": 307,
"train_speed(iter/s)": 0.007986
},
{
"epoch": 0.6830688197380276,
"grad_norm": 3.4025986194610596,
"learning_rate": 0.00015682973358292323,
"logits/chosen": -0.9364197850227356,
"logits/rejected": -0.9693114757537842,
"logps/chosen": -6.508739471435547,
"logps/rejected": -64.5718994140625,
"loss": 0.4292842745780945,
"memory(GiB)": 46.1,
"nll_loss": 0.30177903175354004,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.355379581451416,
"rewards/margins": 4.948610305786133,
"rewards/rejected": -4.593230724334717,
"step": 308,
"train_speed(iter/s)": 0.007985
},
{
"epoch": 0.6852865756462679,
"grad_norm": 5.073081016540527,
"learning_rate": 0.0001565270143116672,
"logits/chosen": -0.9697186350822449,
"logits/rejected": -1.0311468839645386,
"logps/chosen": -10.48011302947998,
"logps/rejected": -68.85475158691406,
"loss": 0.63325434923172,
"memory(GiB)": 46.1,
"nll_loss": 0.4581890106201172,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.10327774286270142,
"rewards/margins": 4.557413101196289,
"rewards/rejected": -4.454134941101074,
"step": 309,
"train_speed(iter/s)": 0.007984
},
{
"epoch": 0.6875043315545083,
"grad_norm": 3.0755183696746826,
"learning_rate": 0.00015622353186727544,
"logits/chosen": -0.8866985440254211,
"logits/rejected": -0.9442430138587952,
"logps/chosen": -11.030970573425293,
"logps/rejected": -63.98460388183594,
"loss": 0.650689423084259,
"memory(GiB)": 46.1,
"nll_loss": 0.45447224378585815,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.23037654161453247,
"rewards/margins": 4.3462677001953125,
"rewards/rejected": -4.115890979766846,
"step": 310,
"train_speed(iter/s)": 0.007985
},
{
"epoch": 0.6897220874627487,
"grad_norm": 1.9100881814956665,
"learning_rate": 0.0001559192903470747,
"logits/chosen": -0.8884042501449585,
"logits/rejected": -0.9456340074539185,
"logps/chosen": -4.9610724449157715,
"logps/rejected": -53.072811126708984,
"loss": 0.4617457985877991,
"memory(GiB)": 46.1,
"nll_loss": 0.28007352352142334,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.36447668075561523,
"rewards/margins": 3.690591335296631,
"rewards/rejected": -3.3261144161224365,
"step": 311,
"train_speed(iter/s)": 0.007985
},
{
"epoch": 0.691939843370989,
"grad_norm": 2.4238641262054443,
"learning_rate": 0.00015561429385864005,
"logits/chosen": -0.908905565738678,
"logits/rejected": -0.9534474611282349,
"logps/chosen": -8.066839218139648,
"logps/rejected": -45.6877326965332,
"loss": 0.7352919578552246,
"memory(GiB)": 46.1,
"nll_loss": 0.5458393692970276,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.3332860767841339,
"rewards/margins": 3.4314332008361816,
"rewards/rejected": -3.098147392272949,
"step": 312,
"train_speed(iter/s)": 0.007985
},
{
"epoch": 0.6941575992792294,
"grad_norm": 2.4582879543304443,
"learning_rate": 0.00015530854651973948,
"logits/chosen": -0.9047088623046875,
"logits/rejected": -0.9368931651115417,
"logps/chosen": -11.2597017288208,
"logps/rejected": -52.92218017578125,
"loss": 0.674723207950592,
"memory(GiB)": 46.1,
"nll_loss": 0.49418923258781433,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.41948604583740234,
"rewards/margins": 3.426848888397217,
"rewards/rejected": -3.0073628425598145,
"step": 313,
"train_speed(iter/s)": 0.007986
},
{
"epoch": 0.6963753551874696,
"grad_norm": 2.3463730812072754,
"learning_rate": 0.00015500205245827812,
"logits/chosen": -0.9688816666603088,
"logits/rejected": -1.001115322113037,
"logps/chosen": -7.497335433959961,
"logps/rejected": -52.40256118774414,
"loss": 0.5067635774612427,
"memory(GiB)": 46.1,
"nll_loss": 0.3210291862487793,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.2679075002670288,
"rewards/margins": 3.5391669273376465,
"rewards/rejected": -3.2712595462799072,
"step": 314,
"train_speed(iter/s)": 0.007985
},
{
"epoch": 0.69859311109571,
"grad_norm": 1.4639019966125488,
"learning_rate": 0.00015469481581224272,
"logits/chosen": -0.9862826466560364,
"logits/rejected": -1.0402218103408813,
"logps/chosen": -11.151278495788574,
"logps/rejected": -63.666648864746094,
"loss": 0.542059063911438,
"memory(GiB)": 46.1,
"nll_loss": 0.42706289887428284,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.5953376293182373,
"rewards/margins": 4.478287696838379,
"rewards/rejected": -3.8829500675201416,
"step": 315,
"train_speed(iter/s)": 0.007986
},
{
"epoch": 0.7008108670039503,
"grad_norm": 1.0964159965515137,
"learning_rate": 0.00015438684072964555,
"logits/chosen": -0.9509701728820801,
"logits/rejected": -1.0120131969451904,
"logps/chosen": -3.282318115234375,
"logps/rejected": -72.4108657836914,
"loss": 0.23854827880859375,
"memory(GiB)": 46.1,
"nll_loss": 0.15861773490905762,
"rewards/accuracies": 0.96875,
"rewards/chosen": 0.3274027109146118,
"rewards/margins": 5.171144008636475,
"rewards/rejected": -4.8437418937683105,
"step": 316,
"train_speed(iter/s)": 0.007987
},
{
"epoch": 0.7030286229121907,
"grad_norm": 3.6565847396850586,
"learning_rate": 0.00015407813136846877,
"logits/chosen": -1.0520319938659668,
"logits/rejected": -1.0684181451797485,
"logps/chosen": -6.481374740600586,
"logps/rejected": -50.84836959838867,
"loss": 0.6093093752861023,
"memory(GiB)": 46.1,
"nll_loss": 0.4111699163913727,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.2717169523239136,
"rewards/margins": 3.6485066413879395,
"rewards/rejected": -3.3767895698547363,
"step": 317,
"train_speed(iter/s)": 0.007987
},
{
"epoch": 0.7052463788204311,
"grad_norm": 1.8486236333847046,
"learning_rate": 0.00015376869189660783,
"logits/chosen": -0.9767893552780151,
"logits/rejected": -1.0699020624160767,
"logps/chosen": -5.003157138824463,
"logps/rejected": -61.613548278808594,
"loss": 0.38953274488449097,
"memory(GiB)": 46.1,
"nll_loss": 0.2612164616584778,
"rewards/accuracies": 0.96875,
"rewards/chosen": 0.32774925231933594,
"rewards/margins": 4.157557010650635,
"rewards/rejected": -3.829807758331299,
"step": 318,
"train_speed(iter/s)": 0.007988
},
{
"epoch": 0.7074641347286714,
"grad_norm": 2.2850542068481445,
"learning_rate": 0.00015345852649181556,
"logits/chosen": -1.0067814588546753,
"logits/rejected": -1.055223822593689,
"logps/chosen": -9.41201114654541,
"logps/rejected": -69.31196594238281,
"loss": 0.47490939497947693,
"memory(GiB)": 46.1,
"nll_loss": 0.344195693731308,
"rewards/accuracies": 0.90625,
"rewards/chosen": 0.29239606857299805,
"rewards/margins": 5.051109790802002,
"rewards/rejected": -4.7587127685546875,
"step": 319,
"train_speed(iter/s)": 0.007989
},
{
"epoch": 0.7096818906369118,
"grad_norm": 2.4990978240966797,
"learning_rate": 0.0001531476393416456,
"logits/chosen": -1.0527924299240112,
"logits/rejected": -1.0691872835159302,
"logps/chosen": -8.629197120666504,
"logps/rejected": -52.35713195800781,
"loss": 0.5260642766952515,
"memory(GiB)": 46.1,
"nll_loss": 0.3726637661457062,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.46037670969963074,
"rewards/margins": 3.889458656311035,
"rewards/rejected": -3.429081916809082,
"step": 320,
"train_speed(iter/s)": 0.00799
},
{
"epoch": 0.7118996465451521,
"grad_norm": 2.756251096725464,
"learning_rate": 0.0001528360346433959,
"logits/chosen": -1.0590455532073975,
"logits/rejected": -1.1003897190093994,
"logps/chosen": -9.220525741577148,
"logps/rejected": -66.90814971923828,
"loss": 0.5508866906166077,
"memory(GiB)": 46.1,
"nll_loss": 0.43441012501716614,
"rewards/accuracies": 0.90625,
"rewards/chosen": 0.4031120538711548,
"rewards/margins": 5.307968616485596,
"rewards/rejected": -4.904856204986572,
"step": 321,
"train_speed(iter/s)": 0.007989
},
{
"epoch": 0.7141174024533925,
"grad_norm": 8.120321273803711,
"learning_rate": 0.00015252371660405203,
"logits/chosen": -1.045861005783081,
"logits/rejected": -1.072197437286377,
"logps/chosen": -8.183548927307129,
"logps/rejected": -55.87236404418945,
"loss": 0.5517191290855408,
"memory(GiB)": 46.1,
"nll_loss": 0.4383443593978882,
"rewards/accuracies": 0.96875,
"rewards/chosen": 0.5038261413574219,
"rewards/margins": 4.238821983337402,
"rewards/rejected": -3.7349960803985596,
"step": 322,
"train_speed(iter/s)": 0.00799
},
{
"epoch": 0.7163351583616329,
"grad_norm": 5.439812660217285,
"learning_rate": 0.00015221068944023047,
"logits/chosen": -0.9942280650138855,
"logits/rejected": -1.0908329486846924,
"logps/chosen": -4.599414348602295,
"logps/rejected": -86.45954895019531,
"loss": 0.5564896464347839,
"memory(GiB)": 46.1,
"nll_loss": 0.3748651444911957,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.21072176098823547,
"rewards/margins": 6.380655288696289,
"rewards/rejected": -6.169933319091797,
"step": 323,
"train_speed(iter/s)": 0.00799
},
{
"epoch": 0.7185529142698732,
"grad_norm": 2.908318519592285,
"learning_rate": 0.00015189695737812152,
"logits/chosen": -1.0733102560043335,
"logits/rejected": -1.11064875125885,
"logps/chosen": -7.096078872680664,
"logps/rejected": -77.15171813964844,
"loss": 0.41845327615737915,
"memory(GiB)": 46.1,
"nll_loss": 0.3608825206756592,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.2574445605278015,
"rewards/margins": 5.614250659942627,
"rewards/rejected": -5.356806755065918,
"step": 324,
"train_speed(iter/s)": 0.00799
},
{
"epoch": 0.7207706701781135,
"grad_norm": 2.001560688018799,
"learning_rate": 0.00015158252465343242,
"logits/chosen": -1.0531553030014038,
"logits/rejected": -1.0946694612503052,
"logps/chosen": -8.788086891174316,
"logps/rejected": -50.299198150634766,
"loss": 0.5263574123382568,
"memory(GiB)": 46.1,
"nll_loss": 0.35159769654273987,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.39179500937461853,
"rewards/margins": 3.5899038314819336,
"rewards/rejected": -3.198108673095703,
"step": 325,
"train_speed(iter/s)": 0.007989
},
{
"epoch": 0.7229884260863538,
"grad_norm": 2.0563783645629883,
"learning_rate": 0.00015126739551132997,
"logits/chosen": -0.9845147132873535,
"logits/rejected": -1.024277687072754,
"logps/chosen": -6.742694854736328,
"logps/rejected": -66.78865051269531,
"loss": 0.5805354714393616,
"memory(GiB)": 46.1,
"nll_loss": 0.4498131275177002,
"rewards/accuracies": 0.96875,
"rewards/chosen": 0.45866793394088745,
"rewards/margins": 4.89275598526001,
"rewards/rejected": -4.434087753295898,
"step": 326,
"train_speed(iter/s)": 0.007988
},
{
"epoch": 0.7252061819945942,
"grad_norm": 2.4432246685028076,
"learning_rate": 0.00015095157420638348,
"logits/chosen": -0.982561469078064,
"logits/rejected": -1.0583231449127197,
"logps/chosen": -3.3377718925476074,
"logps/rejected": -73.46272277832031,
"loss": 0.3824958801269531,
"memory(GiB)": 46.1,
"nll_loss": 0.25690242648124695,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.2936461567878723,
"rewards/margins": 5.495882511138916,
"rewards/rejected": -5.202236652374268,
"step": 327,
"train_speed(iter/s)": 0.007988
},
{
"epoch": 0.7274239379028345,
"grad_norm": 3.9595139026641846,
"learning_rate": 0.00015063506500250708,
"logits/chosen": -1.0502831935882568,
"logits/rejected": -1.1004114151000977,
"logps/chosen": -8.691965103149414,
"logps/rejected": -71.41580200195312,
"loss": 0.44681987166404724,
"memory(GiB)": 46.1,
"nll_loss": 0.31214770674705505,
"rewards/accuracies": 0.96875,
"rewards/chosen": 0.22634059190750122,
"rewards/margins": 5.629345893859863,
"rewards/rejected": -5.403005599975586,
"step": 328,
"train_speed(iter/s)": 0.007988
},
{
"epoch": 0.7296416938110749,
"grad_norm": 3.618638038635254,
"learning_rate": 0.0001503178721729022,
"logits/chosen": -1.021295428276062,
"logits/rejected": -1.098530888557434,
"logps/chosen": -8.527656555175781,
"logps/rejected": -69.10211944580078,
"loss": 0.6168586015701294,
"memory(GiB)": 46.1,
"nll_loss": 0.5225605964660645,
"rewards/accuracies": 0.96875,
"rewards/chosen": 0.42750608921051025,
"rewards/margins": 5.383771896362305,
"rewards/rejected": -4.956265449523926,
"step": 329,
"train_speed(iter/s)": 0.007987
},
{
"epoch": 0.7318594497193153,
"grad_norm": 17.75547218322754,
"learning_rate": 0.00015000000000000001,
"logits/chosen": -1.089531660079956,
"logits/rejected": -1.162044644355774,
"logps/chosen": -7.145535469055176,
"logps/rejected": -97.1467514038086,
"loss": 0.8052725195884705,
"memory(GiB)": 46.1,
"nll_loss": 0.6069628596305847,
"rewards/accuracies": 0.96875,
"rewards/chosen": 0.16202522814273834,
"rewards/margins": 7.54561185836792,
"rewards/rejected": -7.383586883544922,
"step": 330,
"train_speed(iter/s)": 0.007988
},
{
"epoch": 0.7340772056275556,
"grad_norm": 7.715478420257568,
"learning_rate": 0.0001496814527754035,
"logits/chosen": -1.021614670753479,
"logits/rejected": -1.1059943437576294,
"logps/chosen": -4.589797496795654,
"logps/rejected": -98.64924621582031,
"loss": 0.4247751235961914,
"memory(GiB)": 46.1,
"nll_loss": 0.2338293045759201,
"rewards/accuracies": 0.96875,
"rewards/chosen": 0.14829346537590027,
"rewards/margins": 7.475074768066406,
"rewards/rejected": -7.326781272888184,
"step": 331,
"train_speed(iter/s)": 0.007987
},
{
"epoch": 0.736294961535796,
"grad_norm": 5.703808784484863,
"learning_rate": 0.00014936223479982953,
"logits/chosen": -1.0938533544540405,
"logits/rejected": -1.1311089992523193,
"logps/chosen": -10.840590476989746,
"logps/rejected": -83.04175567626953,
"loss": 1.1042178869247437,
"memory(GiB)": 46.1,
"nll_loss": 0.72503662109375,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.027026668190956116,
"rewards/margins": 6.462612628936768,
"rewards/rejected": -6.435585975646973,
"step": 332,
"train_speed(iter/s)": 0.007988
},
{
"epoch": 0.7385127174440363,
"grad_norm": 3.51871657371521,
"learning_rate": 0.00014904235038305083,
"logits/chosen": -1.0023188591003418,
"logits/rejected": -1.0812650918960571,
"logps/chosen": -9.990187644958496,
"logps/rejected": -82.44390869140625,
"loss": 0.4421953558921814,
"memory(GiB)": 46.1,
"nll_loss": 0.3568181097507477,
"rewards/accuracies": 0.96875,
"rewards/chosen": 0.3243933320045471,
"rewards/margins": 6.271053791046143,
"rewards/rejected": -5.94666051864624,
"step": 333,
"train_speed(iter/s)": 0.007988
},
{
"epoch": 0.7407304733522767,
"grad_norm": 2.359330654144287,
"learning_rate": 0.00014872180384383773,
"logits/chosen": -1.0005170106887817,
"logits/rejected": -1.0614187717437744,
"logps/chosen": -4.916748046875,
"logps/rejected": -84.43028259277344,
"loss": 0.5017070770263672,
"memory(GiB)": 46.1,
"nll_loss": 0.25003811717033386,
"rewards/accuracies": 0.90625,
"rewards/chosen": 0.17200681567192078,
"rewards/margins": 5.694801330566406,
"rewards/rejected": -5.522794246673584,
"step": 334,
"train_speed(iter/s)": 0.007987
},
{
"epoch": 0.7429482292605171,
"grad_norm": 2.417720317840576,
"learning_rate": 0.0001484005995098999,
"logits/chosen": -0.9173535108566284,
"logits/rejected": -0.9738480448722839,
"logps/chosen": -7.978065490722656,
"logps/rejected": -52.23478317260742,
"loss": 0.5884492993354797,
"memory(GiB)": 46.1,
"nll_loss": 0.3843919336795807,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.414502888917923,
"rewards/margins": 3.7098348140716553,
"rewards/rejected": -3.2953319549560547,
"step": 335,
"train_speed(iter/s)": 0.007989
},
{
"epoch": 0.7451659851687573,
"grad_norm": 5.175177097320557,
"learning_rate": 0.00014807874171782795,
"logits/chosen": -0.9095063209533691,
"logits/rejected": -0.9394166469573975,
"logps/chosen": -5.037604808807373,
"logps/rejected": -48.952796936035156,
"loss": 0.7686702013015747,
"memory(GiB)": 46.1,
"nll_loss": 0.5135473608970642,
"rewards/accuracies": 0.84375,
"rewards/chosen": 0.2529716193675995,
"rewards/margins": 3.3015551567077637,
"rewards/rejected": -3.0485832691192627,
"step": 336,
"train_speed(iter/s)": 0.00799
},
{
"epoch": 0.7473837410769977,
"grad_norm": 1.4395772218704224,
"learning_rate": 0.00014775623481303487,
"logits/chosen": -0.8478690981864929,
"logits/rejected": -0.9579203128814697,
"logps/chosen": -3.3176069259643555,
"logps/rejected": -75.16621398925781,
"loss": 0.25232070684432983,
"memory(GiB)": 46.1,
"nll_loss": 0.18015892803668976,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.33292415738105774,
"rewards/margins": 5.303890705108643,
"rewards/rejected": -4.970966339111328,
"step": 337,
"train_speed(iter/s)": 0.007991
},
{
"epoch": 0.749601496985238,
"grad_norm": 4.6426920890808105,
"learning_rate": 0.0001474330831496973,
"logits/chosen": -0.8614159822463989,
"logits/rejected": -0.8955745697021484,
"logps/chosen": -7.800498962402344,
"logps/rejected": -50.34724807739258,
"loss": 0.5634305477142334,
"memory(GiB)": 46.1,
"nll_loss": 0.3574722111225128,
"rewards/accuracies": 0.84375,
"rewards/chosen": 0.1773032397031784,
"rewards/margins": 3.574413776397705,
"rewards/rejected": -3.3971107006073,
"step": 338,
"train_speed(iter/s)": 0.007992
},
{
"epoch": 0.7518192528934784,
"grad_norm": 2.0889782905578613,
"learning_rate": 0.00014710929109069674,
"logits/chosen": -0.8648290038108826,
"logits/rejected": -0.9016939997673035,
"logps/chosen": -9.325538635253906,
"logps/rejected": -54.02799987792969,
"loss": 0.5422332882881165,
"memory(GiB)": 46.1,
"nll_loss": 0.38347160816192627,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.4468119144439697,
"rewards/margins": 3.857147693634033,
"rewards/rejected": -3.4103355407714844,
"step": 339,
"train_speed(iter/s)": 0.007993
},
{
"epoch": 0.7540370088017188,
"grad_norm": 1.8795205354690552,
"learning_rate": 0.0001467848630075608,
"logits/chosen": -0.8260731101036072,
"logits/rejected": -0.8987483382225037,
"logps/chosen": -8.172541618347168,
"logps/rejected": -68.80128479003906,
"loss": 0.42829784750938416,
"memory(GiB)": 46.1,
"nll_loss": 0.33098679780960083,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.463642418384552,
"rewards/margins": 4.9933061599731445,
"rewards/rejected": -4.5296630859375,
"step": 340,
"train_speed(iter/s)": 0.007992
},
{
"epoch": 0.7562547647099591,
"grad_norm": 1.8088308572769165,
"learning_rate": 0.00014645980328040401,
"logits/chosen": -0.83375483751297,
"logits/rejected": -0.9051945805549622,
"logps/chosen": -8.962587356567383,
"logps/rejected": -55.46277618408203,
"loss": 0.5223706364631653,
"memory(GiB)": 46.1,
"nll_loss": 0.3683018684387207,
"rewards/accuracies": 0.96875,
"rewards/chosen": 0.4433327615261078,
"rewards/margins": 4.030201435089111,
"rewards/rejected": -3.5868687629699707,
"step": 341,
"train_speed(iter/s)": 0.007994
},
{
"epoch": 0.7584725206181995,
"grad_norm": 1.6160343885421753,
"learning_rate": 0.0001461341162978688,
"logits/chosen": -0.8449936509132385,
"logits/rejected": -0.921272873878479,
"logps/chosen": -7.773403167724609,
"logps/rejected": -82.05076599121094,
"loss": 0.3855322301387787,
"memory(GiB)": 46.1,
"nll_loss": 0.3014349937438965,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.3078088164329529,
"rewards/margins": 5.843523025512695,
"rewards/rejected": -5.535714626312256,
"step": 342,
"train_speed(iter/s)": 0.007995
},
{
"epoch": 0.7606902765264398,
"grad_norm": 2.3332436084747314,
"learning_rate": 0.0001458078064570661,
"logits/chosen": -0.865425705909729,
"logits/rejected": -0.9039071202278137,
"logps/chosen": -6.671085834503174,
"logps/rejected": -74.30247497558594,
"loss": 0.4341945946216583,
"memory(GiB)": 46.1,
"nll_loss": 0.3516058623790741,
"rewards/accuracies": 0.96875,
"rewards/chosen": 0.6183019876480103,
"rewards/margins": 5.456951141357422,
"rewards/rejected": -4.838649749755859,
"step": 343,
"train_speed(iter/s)": 0.007995
},
{
"epoch": 0.7629080324346802,
"grad_norm": 2.2075419425964355,
"learning_rate": 0.00014548087816351616,
"logits/chosen": -0.8886226415634155,
"logits/rejected": -0.9319683313369751,
"logps/chosen": -7.503270626068115,
"logps/rejected": -69.36604309082031,
"loss": 0.5470494627952576,
"memory(GiB)": 46.1,
"nll_loss": 0.40474218130111694,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.2907697558403015,
"rewards/margins": 5.133359909057617,
"rewards/rejected": -4.84259033203125,
"step": 344,
"train_speed(iter/s)": 0.007995
},
{
"epoch": 0.7651257883429206,
"grad_norm": 5.5458197593688965,
"learning_rate": 0.00014515333583108896,
"logits/chosen": -0.8889970779418945,
"logits/rejected": -0.9374210834503174,
"logps/chosen": -6.389466285705566,
"logps/rejected": -64.43991088867188,
"loss": 0.5072943568229675,
"memory(GiB)": 46.1,
"nll_loss": 0.3807336986064911,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.6497054100036621,
"rewards/margins": 5.243303298950195,
"rewards/rejected": -4.593598365783691,
"step": 345,
"train_speed(iter/s)": 0.007995
},
{
"epoch": 0.7673435442511608,
"grad_norm": 3.809356212615967,
"learning_rate": 0.00014482518388194457,
"logits/chosen": -0.850013792514801,
"logits/rejected": -0.8974230289459229,
"logps/chosen": -5.620848655700684,
"logps/rejected": -72.27090454101562,
"loss": 0.6183085441589355,
"memory(GiB)": 46.1,
"nll_loss": 0.444873571395874,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.4231736660003662,
"rewards/margins": 5.374911308288574,
"rewards/rejected": -4.951737403869629,
"step": 346,
"train_speed(iter/s)": 0.007995
},
{
"epoch": 0.7695613001594012,
"grad_norm": 5.957520961761475,
"learning_rate": 0.00014449642674647367,
"logits/chosen": -0.903602659702301,
"logits/rejected": -0.9699824452400208,
"logps/chosen": -6.9516706466674805,
"logps/rejected": -66.93140411376953,
"loss": 0.4030936360359192,
"memory(GiB)": 46.1,
"nll_loss": 0.27591440081596375,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.5947475433349609,
"rewards/margins": 4.9736480712890625,
"rewards/rejected": -4.378900527954102,
"step": 347,
"train_speed(iter/s)": 0.007996
},
{
"epoch": 0.7717790560676415,
"grad_norm": 7.984817981719971,
"learning_rate": 0.0001441670688632374,
"logits/chosen": -0.9703332185745239,
"logits/rejected": -0.9999107718467712,
"logps/chosen": -13.621354103088379,
"logps/rejected": -54.89396667480469,
"loss": 0.8680185079574585,
"memory(GiB)": 46.1,
"nll_loss": 0.472337007522583,
"rewards/accuracies": 0.8125,
"rewards/chosen": 0.08581960201263428,
"rewards/margins": 3.7399158477783203,
"rewards/rejected": -3.6540961265563965,
"step": 348,
"train_speed(iter/s)": 0.007996
},
{
"epoch": 0.7739968119758819,
"grad_norm": 3.5452890396118164,
"learning_rate": 0.00014383711467890774,
"logits/chosen": -0.9808631539344788,
"logits/rejected": -1.0241118669509888,
"logps/chosen": -6.2970123291015625,
"logps/rejected": -57.30949783325195,
"loss": 0.5067135691642761,
"memory(GiB)": 46.1,
"nll_loss": 0.34234529733657837,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.4528099000453949,
"rewards/margins": 4.415470123291016,
"rewards/rejected": -3.962660789489746,
"step": 349,
"train_speed(iter/s)": 0.007995
},
{
"epoch": 0.7762145678841222,
"grad_norm": 2.270117998123169,
"learning_rate": 0.00014350656864820733,
"logits/chosen": -0.8902170062065125,
"logits/rejected": -0.9376388192176819,
"logps/chosen": -6.128102779388428,
"logps/rejected": -84.18601989746094,
"loss": 0.3887496292591095,
"memory(GiB)": 46.1,
"nll_loss": 0.29120758175849915,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.410897433757782,
"rewards/margins": 6.373892784118652,
"rewards/rejected": -5.9629950523376465,
"step": 350,
"train_speed(iter/s)": 0.007995
},
{
"epoch": 0.7784323237923626,
"grad_norm": 1.537272334098816,
"learning_rate": 0.00014317543523384928,
"logits/chosen": -0.8935893177986145,
"logits/rejected": -0.9689089059829712,
"logps/chosen": -9.015190124511719,
"logps/rejected": -72.697265625,
"loss": 0.3616684079170227,
"memory(GiB)": 46.1,
"nll_loss": 0.26947712898254395,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.5364948511123657,
"rewards/margins": 5.098753929138184,
"rewards/rejected": -4.562259197235107,
"step": 351,
"train_speed(iter/s)": 0.007992
},
{
"epoch": 0.780650079700603,
"grad_norm": 8.092968940734863,
"learning_rate": 0.00014284371890647713,
"logits/chosen": -0.9558290243148804,
"logits/rejected": -0.9736660718917847,
"logps/chosen": -9.879434585571289,
"logps/rejected": -67.37289428710938,
"loss": 0.5441817045211792,
"memory(GiB)": 46.1,
"nll_loss": 0.4073256552219391,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.2747573256492615,
"rewards/margins": 4.777169227600098,
"rewards/rejected": -4.502411842346191,
"step": 352,
"train_speed(iter/s)": 0.007992
},
{
"epoch": 0.7828678356088433,
"grad_norm": 2.3354103565216064,
"learning_rate": 0.00014251142414460415,
"logits/chosen": -0.9495961666107178,
"logits/rejected": -1.0119011402130127,
"logps/chosen": -7.465116500854492,
"logps/rejected": -69.65184020996094,
"loss": 0.40892308950424194,
"memory(GiB)": 46.1,
"nll_loss": 0.31010234355926514,
"rewards/accuracies": 0.96875,
"rewards/chosen": 0.29755479097366333,
"rewards/margins": 5.3398756980896,
"rewards/rejected": -5.042320728302002,
"step": 353,
"train_speed(iter/s)": 0.007993
},
{
"epoch": 0.7850855915170837,
"grad_norm": 3.8496086597442627,
"learning_rate": 0.00014217855543455322,
"logits/chosen": -0.9601128101348877,
"logits/rejected": -0.9981716275215149,
"logps/chosen": -6.954006195068359,
"logps/rejected": -58.822914123535156,
"loss": 0.6071369051933289,
"memory(GiB)": 46.1,
"nll_loss": 0.4900137186050415,
"rewards/accuracies": 0.96875,
"rewards/chosen": 0.032600052654743195,
"rewards/margins": 4.149467945098877,
"rewards/rejected": -4.116868019104004,
"step": 354,
"train_speed(iter/s)": 0.007992
},
{
"epoch": 0.787303347425324,
"grad_norm": 1.835015058517456,
"learning_rate": 0.00014184511727039612,
"logits/chosen": -1.031874656677246,
"logits/rejected": -1.0789393186569214,
"logps/chosen": -4.562386989593506,
"logps/rejected": -66.75709533691406,
"loss": 0.35645246505737305,
"memory(GiB)": 46.1,
"nll_loss": 0.2355533242225647,
"rewards/accuracies": 0.96875,
"rewards/chosen": 0.36652734875679016,
"rewards/margins": 4.739514350891113,
"rewards/rejected": -4.372987747192383,
"step": 355,
"train_speed(iter/s)": 0.007991
},
{
"epoch": 0.7895211033335644,
"grad_norm": 9.796154022216797,
"learning_rate": 0.00014151111415389273,
"logits/chosen": -0.9901955127716064,
"logits/rejected": -1.027661919593811,
"logps/chosen": -5.177408218383789,
"logps/rejected": -83.82344055175781,
"loss": 0.6649367809295654,
"memory(GiB)": 46.1,
"nll_loss": 0.5719815492630005,
"rewards/accuracies": 0.96875,
"rewards/chosen": 0.32677945494651794,
"rewards/margins": 6.3124799728393555,
"rewards/rejected": -5.985701084136963,
"step": 356,
"train_speed(iter/s)": 0.00799
},
{
"epoch": 0.7917388592418046,
"grad_norm": 4.476024150848389,
"learning_rate": 0.0001411765505944305,
"logits/chosen": -0.9815511703491211,
"logits/rejected": -1.0286136865615845,
"logps/chosen": -9.594337463378906,
"logps/rejected": -65.8331069946289,
"loss": 0.6891093850135803,
"memory(GiB)": 46.1,
"nll_loss": 0.4483054280281067,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.20106908679008484,
"rewards/margins": 4.649129867553711,
"rewards/rejected": -4.448061466217041,
"step": 357,
"train_speed(iter/s)": 0.007991
},
{
"epoch": 0.793956615150045,
"grad_norm": 6.72329568862915,
"learning_rate": 0.00014084143110896336,
"logits/chosen": -0.9816399216651917,
"logits/rejected": -1.0880467891693115,
"logps/chosen": -10.076456069946289,
"logps/rejected": -96.55436706542969,
"loss": 0.5759286284446716,
"memory(GiB)": 46.1,
"nll_loss": 0.42951053380966187,
"rewards/accuracies": 0.90625,
"rewards/chosen": 0.3208717703819275,
"rewards/margins": 6.648129463195801,
"rewards/rejected": -6.3272576332092285,
"step": 358,
"train_speed(iter/s)": 0.00799
},
{
"epoch": 0.7961743710582854,
"grad_norm": 1.4733343124389648,
"learning_rate": 0.00014050576022195084,
"logits/chosen": -0.9938861131668091,
"logits/rejected": -1.1024624109268188,
"logps/chosen": -5.6730475425720215,
"logps/rejected": -96.65937805175781,
"loss": 0.3570317029953003,
"memory(GiB)": 46.1,
"nll_loss": 0.3157106339931488,
"rewards/accuracies": 0.96875,
"rewards/chosen": 0.35878437757492065,
"rewards/margins": 7.850948333740234,
"rewards/rejected": -7.49216365814209,
"step": 359,
"train_speed(iter/s)": 0.007993
},
{
"epoch": 0.7983921269665257,
"grad_norm": 6.765986919403076,
"learning_rate": 0.00014016954246529696,
"logits/chosen": -0.9971696138381958,
"logits/rejected": -1.03761887550354,
"logps/chosen": -7.510034561157227,
"logps/rejected": -73.65198516845703,
"loss": 0.46261534094810486,
"memory(GiB)": 46.1,
"nll_loss": 0.3362881541252136,
"rewards/accuracies": 0.96875,
"rewards/chosen": 0.27089494466781616,
"rewards/margins": 5.386101245880127,
"rewards/rejected": -5.115205764770508,
"step": 360,
"train_speed(iter/s)": 0.007993
},
{
"epoch": 0.8006098828747661,
"grad_norm": 7.017738342285156,
"learning_rate": 0.00013983278237828905,
"logits/chosen": -0.9837071299552917,
"logits/rejected": -1.0181175470352173,
"logps/chosen": -8.63487434387207,
"logps/rejected": -83.47882843017578,
"loss": 0.44132688641548157,
"memory(GiB)": 46.1,
"nll_loss": 0.3716186285018921,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.41110920906066895,
"rewards/margins": 6.7674946784973145,
"rewards/rejected": -6.356384754180908,
"step": 361,
"train_speed(iter/s)": 0.007992
},
{
"epoch": 0.8028276387830064,
"grad_norm": 8.974201202392578,
"learning_rate": 0.00013949548450753645,
"logits/chosen": -0.9519540071487427,
"logits/rejected": -1.0129084587097168,
"logps/chosen": -5.2814507484436035,
"logps/rejected": -72.11774444580078,
"loss": 0.5307304859161377,
"memory(GiB)": 46.1,
"nll_loss": 0.4160841703414917,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.4031183123588562,
"rewards/margins": 5.740135669708252,
"rewards/rejected": -5.337017059326172,
"step": 362,
"train_speed(iter/s)": 0.007993
},
{
"epoch": 0.8050453946912468,
"grad_norm": 1.2695608139038086,
"learning_rate": 0.00013915765340690917,
"logits/chosen": -1.0254669189453125,
"logits/rejected": -1.0584160089492798,
"logps/chosen": -4.022584915161133,
"logps/rejected": -76.5419692993164,
"loss": 0.25830894708633423,
"memory(GiB)": 46.1,
"nll_loss": 0.15799354016780853,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.4456513822078705,
"rewards/margins": 6.39218807220459,
"rewards/rejected": -5.946537494659424,
"step": 363,
"train_speed(iter/s)": 0.007992
},
{
"epoch": 0.8072631505994872,
"grad_norm": 3.4139556884765625,
"learning_rate": 0.00013881929363747627,
"logits/chosen": -0.9054716229438782,
"logits/rejected": -0.9829826951026917,
"logps/chosen": -6.469770908355713,
"logps/rejected": -81.60964965820312,
"loss": 0.3816515803337097,
"memory(GiB)": 46.1,
"nll_loss": 0.2315388023853302,
"rewards/accuracies": 0.96875,
"rewards/chosen": 0.23071371018886566,
"rewards/margins": 5.678869724273682,
"rewards/rejected": -5.448155403137207,
"step": 364,
"train_speed(iter/s)": 0.007992
},
{
"epoch": 0.8094809065077275,
"grad_norm": 2.8562862873077393,
"learning_rate": 0.00013848040976744457,
"logits/chosen": -0.9915538430213928,
"logits/rejected": -1.0249900817871094,
"logps/chosen": -11.345012664794922,
"logps/rejected": -60.174583435058594,
"loss": 0.6162142753601074,
"memory(GiB)": 46.1,
"nll_loss": 0.5174874663352966,
"rewards/accuracies": 0.96875,
"rewards/chosen": 0.4874635338783264,
"rewards/margins": 4.736081600189209,
"rewards/rejected": -4.248618125915527,
"step": 365,
"train_speed(iter/s)": 0.007993
},
{
"epoch": 0.8116986624159679,
"grad_norm": 11.424062728881836,
"learning_rate": 0.0001381410063720966,
"logits/chosen": -0.885972261428833,
"logits/rejected": -0.9483691453933716,
"logps/chosen": -6.95948600769043,
"logps/rejected": -67.90422821044922,
"loss": 0.48116442561149597,
"memory(GiB)": 46.1,
"nll_loss": 0.3793320059776306,
"rewards/accuracies": 0.96875,
"rewards/chosen": 0.4664710462093353,
"rewards/margins": 5.4724249839782715,
"rewards/rejected": -5.005953788757324,
"step": 366,
"train_speed(iter/s)": 0.007993
},
{
"epoch": 0.8139164183242082,
"grad_norm": 2.13146710395813,
"learning_rate": 0.00013780108803372916,
"logits/chosen": -0.9675875902175903,
"logits/rejected": -1.0174977779388428,
"logps/chosen": -2.7178149223327637,
"logps/rejected": -57.41184616088867,
"loss": 0.2717885971069336,
"memory(GiB)": 46.1,
"nll_loss": 0.17145709693431854,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.41647231578826904,
"rewards/margins": 4.505980968475342,
"rewards/rejected": -4.089508533477783,
"step": 367,
"train_speed(iter/s)": 0.007993
},
{
"epoch": 0.8161341742324485,
"grad_norm": 2.014505386352539,
"learning_rate": 0.00013746065934159123,
"logits/chosen": -0.8749208450317383,
"logits/rejected": -0.9097785949707031,
"logps/chosen": -11.590734481811523,
"logps/rejected": -61.093849182128906,
"loss": 0.4811657667160034,
"memory(GiB)": 46.1,
"nll_loss": 0.4215659201145172,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.5911797285079956,
"rewards/margins": 4.6354546546936035,
"rewards/rejected": -4.044274806976318,
"step": 368,
"train_speed(iter/s)": 0.007995
},
{
"epoch": 0.8183519301406889,
"grad_norm": 6.679834365844727,
"learning_rate": 0.00013711972489182208,
"logits/chosen": -0.9587826728820801,
"logits/rejected": -0.9994091391563416,
"logps/chosen": -4.139106273651123,
"logps/rejected": -51.25725555419922,
"loss": 0.5976202487945557,
"memory(GiB)": 46.1,
"nll_loss": 0.45815497636795044,
"rewards/accuracies": 0.96875,
"rewards/chosen": 0.4207558035850525,
"rewards/margins": 4.1789679527282715,
"rewards/rejected": -3.7582123279571533,
"step": 369,
"train_speed(iter/s)": 0.007995
},
{
"epoch": 0.8205696860489292,
"grad_norm": 4.250732421875,
"learning_rate": 0.00013677828928738934,
"logits/chosen": -0.8436453938484192,
"logits/rejected": -0.9403105974197388,
"logps/chosen": -8.053564071655273,
"logps/rejected": -84.89209747314453,
"loss": 0.6519731283187866,
"memory(GiB)": 46.1,
"nll_loss": 0.5838944911956787,
"rewards/accuracies": 0.96875,
"rewards/chosen": 0.6696658134460449,
"rewards/margins": 7.059585094451904,
"rewards/rejected": -6.389919757843018,
"step": 370,
"train_speed(iter/s)": 0.007996
},
{
"epoch": 0.8227874419571696,
"grad_norm": 3.9205992221832275,
"learning_rate": 0.0001364363571380266,
"logits/chosen": -0.955507755279541,
"logits/rejected": -1.0599405765533447,
"logps/chosen": -7.400586128234863,
"logps/rejected": -74.92298889160156,
"loss": 0.5989251732826233,
"memory(GiB)": 46.1,
"nll_loss": 0.5146618485450745,
"rewards/accuracies": 0.96875,
"rewards/chosen": 0.4105219542980194,
"rewards/margins": 5.604883670806885,
"rewards/rejected": -5.194361686706543,
"step": 371,
"train_speed(iter/s)": 0.007997
},
{
"epoch": 0.8250051978654099,
"grad_norm": 4.548377990722656,
"learning_rate": 0.0001360939330601715,
"logits/chosen": -0.9952760934829712,
"logits/rejected": -1.0298787355422974,
"logps/chosen": -6.161623477935791,
"logps/rejected": -78.73953247070312,
"loss": 0.5819877982139587,
"memory(GiB)": 46.1,
"nll_loss": 0.4920639097690582,
"rewards/accuracies": 0.96875,
"rewards/chosen": 0.07609675824642181,
"rewards/margins": 5.800478935241699,
"rewards/rejected": -5.724382400512695,
"step": 372,
"train_speed(iter/s)": 0.007996
},
{
"epoch": 0.8272229537736503,
"grad_norm": 1.8827123641967773,
"learning_rate": 0.000135751021676903,
"logits/chosen": -0.8674598336219788,
"logits/rejected": -0.9275334477424622,
"logps/chosen": -5.713299751281738,
"logps/rejected": -87.57781219482422,
"loss": 0.379931777715683,
"memory(GiB)": 46.1,
"nll_loss": 0.3211643397808075,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.21036267280578613,
"rewards/margins": 6.820375442504883,
"rewards/rejected": -6.610012531280518,
"step": 373,
"train_speed(iter/s)": 0.007996
},
{
"epoch": 0.8294407096818907,
"grad_norm": 3.5420541763305664,
"learning_rate": 0.00013540762761787937,
"logits/chosen": -1.0363105535507202,
"logits/rejected": -1.0776422023773193,
"logps/chosen": -13.957275390625,
"logps/rejected": -76.94481658935547,
"loss": 0.5567349195480347,
"memory(GiB)": 46.1,
"nll_loss": 0.45086780190467834,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.28840070962905884,
"rewards/margins": 5.7179765701293945,
"rewards/rejected": -5.4295759201049805,
"step": 374,
"train_speed(iter/s)": 0.007996
},
{
"epoch": 0.831658465590131,
"grad_norm": 1.7102012634277344,
"learning_rate": 0.00013506375551927547,
"logits/chosen": -0.9630483388900757,
"logits/rejected": -1.0484064817428589,
"logps/chosen": -8.863858222961426,
"logps/rejected": -87.95539093017578,
"loss": 0.48169463872909546,
"memory(GiB)": 46.1,
"nll_loss": 0.3565702438354492,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.33859264850616455,
"rewards/margins": 6.4991984367370605,
"rewards/rejected": -6.160606384277344,
"step": 375,
"train_speed(iter/s)": 0.007997
},
{
"epoch": 0.8338762214983714,
"grad_norm": 5.707740306854248,
"learning_rate": 0.00013471941002372005,
"logits/chosen": -0.9741328954696655,
"logits/rejected": -1.0323518514633179,
"logps/chosen": -6.637020111083984,
"logps/rejected": -93.5245132446289,
"loss": 0.38472601771354675,
"memory(GiB)": 46.1,
"nll_loss": 0.310046911239624,
"rewards/accuracies": 0.96875,
"rewards/chosen": 0.3390035629272461,
"rewards/margins": 7.584478855133057,
"rewards/rejected": -7.245475769042969,
"step": 376,
"train_speed(iter/s)": 0.007997
},
{
"epoch": 0.8360939774066117,
"grad_norm": 18.117982864379883,
"learning_rate": 0.00013437459578023343,
"logits/chosen": -0.9638034105300903,
"logits/rejected": -1.0537152290344238,
"logps/chosen": -9.010321617126465,
"logps/rejected": -106.76775360107422,
"loss": 0.5627694725990295,
"memory(GiB)": 46.1,
"nll_loss": 0.5133727788925171,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.2734406590461731,
"rewards/margins": 8.917407989501953,
"rewards/rejected": -8.643967628479004,
"step": 377,
"train_speed(iter/s)": 0.007997
},
{
"epoch": 0.838311733314852,
"grad_norm": 10.60085678100586,
"learning_rate": 0.00013402931744416433,
"logits/chosen": -0.9089164137840271,
"logits/rejected": -0.9688107967376709,
"logps/chosen": -10.777193069458008,
"logps/rejected": -84.58053588867188,
"loss": 0.6482276916503906,
"memory(GiB)": 46.1,
"nll_loss": 0.5216525793075562,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.347297728061676,
"rewards/margins": 6.164276123046875,
"rewards/rejected": -5.816978454589844,
"step": 378,
"train_speed(iter/s)": 0.007998
},
{
"epoch": 0.8405294892230923,
"grad_norm": 6.294896602630615,
"learning_rate": 0.00013368357967712726,
"logits/chosen": -0.962710976600647,
"logits/rejected": -1.038513422012329,
"logps/chosen": -10.020147323608398,
"logps/rejected": -88.00511169433594,
"loss": 0.6880609393119812,
"memory(GiB)": 46.1,
"nll_loss": 0.5630819797515869,
"rewards/accuracies": 0.90625,
"rewards/chosen": 0.3197646141052246,
"rewards/margins": 6.758570671081543,
"rewards/rejected": -6.438806533813477,
"step": 379,
"train_speed(iter/s)": 0.007998
},
{
"epoch": 0.8427472451313327,
"grad_norm": 4.594664096832275,
"learning_rate": 0.00013333738714693956,
"logits/chosen": -0.9401661157608032,
"logits/rejected": -0.9714579582214355,
"logps/chosen": -9.314223289489746,
"logps/rejected": -65.65319061279297,
"loss": 0.5762234330177307,
"memory(GiB)": 46.1,
"nll_loss": 0.49913567304611206,
"rewards/accuracies": 0.96875,
"rewards/chosen": 0.4756416380405426,
"rewards/margins": 5.191895961761475,
"rewards/rejected": -4.716253757476807,
"step": 380,
"train_speed(iter/s)": 0.007997
},
{
"epoch": 0.8449650010395731,
"grad_norm": 9.826415061950684,
"learning_rate": 0.0001329907445275583,
"logits/chosen": -0.8897924423217773,
"logits/rejected": -0.9633165597915649,
"logps/chosen": -12.073375701904297,
"logps/rejected": -73.02918243408203,
"loss": 0.912665069103241,
"memory(GiB)": 46.1,
"nll_loss": 0.656974196434021,
"rewards/accuracies": 0.96875,
"rewards/chosen": 0.3072448968887329,
"rewards/margins": 4.9169487953186035,
"rewards/rejected": -4.609704494476318,
"step": 381,
"train_speed(iter/s)": 0.007996
},
{
"epoch": 0.8471827569478134,
"grad_norm": 2.968611001968384,
"learning_rate": 0.00013264365649901723,
"logits/chosen": -0.9875434637069702,
"logits/rejected": -1.0535120964050293,
"logps/chosen": -6.4254536628723145,
"logps/rejected": -93.53910064697266,
"loss": 0.4106255769729614,
"memory(GiB)": 46.1,
"nll_loss": 0.30968165397644043,
"rewards/accuracies": 0.96875,
"rewards/chosen": 0.5462108850479126,
"rewards/margins": 7.555147647857666,
"rewards/rejected": -7.008937358856201,
"step": 382,
"train_speed(iter/s)": 0.007996
},
{
"epoch": 0.8494005128560538,
"grad_norm": 2.7569844722747803,
"learning_rate": 0.00013229612774736359,
"logits/chosen": -0.9040098786354065,
"logits/rejected": -0.911220908164978,
"logps/chosen": -11.235910415649414,
"logps/rejected": -46.86307144165039,
"loss": 0.6170834898948669,
"memory(GiB)": 46.1,
"nll_loss": 0.40689852833747864,
"rewards/accuracies": 0.90625,
"rewards/chosen": 0.34967976808547974,
"rewards/margins": 3.505056858062744,
"rewards/rejected": -3.155377149581909,
"step": 383,
"train_speed(iter/s)": 0.007997
},
{
"epoch": 0.8516182687642941,
"grad_norm": 1.343916654586792,
"learning_rate": 0.0001319481629645948,
"logits/chosen": -0.8736822009086609,
"logits/rejected": -0.9404423832893372,
"logps/chosen": -1.9940882921218872,
"logps/rejected": -73.57098388671875,
"loss": 0.19009298086166382,
"memory(GiB)": 46.1,
"nll_loss": 0.15470954775810242,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.34637439250946045,
"rewards/margins": 5.987215518951416,
"rewards/rejected": -5.640841007232666,
"step": 384,
"train_speed(iter/s)": 0.007996
},
{
"epoch": 0.8538360246725345,
"grad_norm": 3.7166006565093994,
"learning_rate": 0.00013159976684859527,
"logits/chosen": -0.9331986308097839,
"logits/rejected": -0.9687966108322144,
"logps/chosen": -4.263778209686279,
"logps/rejected": -58.46650314331055,
"loss": 0.6141018867492676,
"memory(GiB)": 46.1,
"nll_loss": 0.3756692707538605,
"rewards/accuracies": 0.90625,
"rewards/chosen": 0.18798117339611053,
"rewards/margins": 4.480571746826172,
"rewards/rejected": -4.292590141296387,
"step": 385,
"train_speed(iter/s)": 0.007996
},
{
"epoch": 0.8560537805807749,
"grad_norm": 2.7633893489837646,
"learning_rate": 0.00013125094410307265,
"logits/chosen": -0.8766888976097107,
"logits/rejected": -0.9078878164291382,
"logps/chosen": -11.883410453796387,
"logps/rejected": -59.319793701171875,
"loss": 0.6583555340766907,
"memory(GiB)": 46.1,
"nll_loss": 0.4740571677684784,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.31328243017196655,
"rewards/margins": 4.362224578857422,
"rewards/rejected": -4.0489420890808105,
"step": 386,
"train_speed(iter/s)": 0.007997
},
{
"epoch": 0.8582715364890152,
"grad_norm": 1.7285346984863281,
"learning_rate": 0.00013090169943749476,
"logits/chosen": -0.9330658912658691,
"logits/rejected": -0.9578065872192383,
"logps/chosen": -8.566822052001953,
"logps/rejected": -59.75345993041992,
"loss": 0.4198892116546631,
"memory(GiB)": 46.1,
"nll_loss": 0.2942117750644684,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.5056283473968506,
"rewards/margins": 4.707999229431152,
"rewards/rejected": -4.202371120452881,
"step": 387,
"train_speed(iter/s)": 0.007997
},
{
"epoch": 0.8604892923972556,
"grad_norm": 3.06683349609375,
"learning_rate": 0.0001305520375670256,
"logits/chosen": -0.8998062014579773,
"logits/rejected": -0.9751926064491272,
"logps/chosen": -6.561751365661621,
"logps/rejected": -78.16478729248047,
"loss": 0.4542686939239502,
"memory(GiB)": 46.1,
"nll_loss": 0.3592434525489807,
"rewards/accuracies": 0.96875,
"rewards/chosen": 0.416767954826355,
"rewards/margins": 6.343855381011963,
"rewards/rejected": -5.927087783813477,
"step": 388,
"train_speed(iter/s)": 0.007998
},
{
"epoch": 0.8627070483054958,
"grad_norm": 2.2208168506622314,
"learning_rate": 0.0001302019632124619,
"logits/chosen": -0.9485350847244263,
"logits/rejected": -1.0033212900161743,
"logps/chosen": -4.072909355163574,
"logps/rejected": -65.76300048828125,
"loss": 0.42102301120758057,
"memory(GiB)": 46.1,
"nll_loss": 0.26937127113342285,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.5535694360733032,
"rewards/margins": 5.2655839920043945,
"rewards/rejected": -4.712014198303223,
"step": 389,
"train_speed(iter/s)": 0.007998
},
{
"epoch": 0.8649248042137362,
"grad_norm": 1.9687930345535278,
"learning_rate": 0.00012985148110016947,
"logits/chosen": -1.0221461057662964,
"logits/rejected": -1.0833958387374878,
"logps/chosen": -5.025339603424072,
"logps/rejected": -82.09105682373047,
"loss": 0.46604421734809875,
"memory(GiB)": 46.1,
"nll_loss": 0.3294580578804016,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.3730618953704834,
"rewards/margins": 6.059564590454102,
"rewards/rejected": -5.6865034103393555,
"step": 390,
"train_speed(iter/s)": 0.007999
},
{
"epoch": 0.8671425601219765,
"grad_norm": 3.648024559020996,
"learning_rate": 0.0001295005959620191,
"logits/chosen": -1.051031231880188,
"logits/rejected": -1.0930334329605103,
"logps/chosen": -8.805713653564453,
"logps/rejected": -72.9891357421875,
"loss": 0.5263576507568359,
"memory(GiB)": 46.1,
"nll_loss": 0.35741278529167175,
"rewards/accuracies": 0.90625,
"rewards/chosen": 0.3289564549922943,
"rewards/margins": 5.768798351287842,
"rewards/rejected": -5.439842224121094,
"step": 391,
"train_speed(iter/s)": 0.007999
},
{
"epoch": 0.8693603160302169,
"grad_norm": 3.0183286666870117,
"learning_rate": 0.00012914931253532304,
"logits/chosen": -1.0728670358657837,
"logits/rejected": -1.1561932563781738,
"logps/chosen": -7.894364833831787,
"logps/rejected": -91.58610534667969,
"loss": 0.5266696214675903,
"memory(GiB)": 46.1,
"nll_loss": 0.4139808118343353,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.32448941469192505,
"rewards/margins": 6.884645462036133,
"rewards/rejected": -6.560155868530273,
"step": 392,
"train_speed(iter/s)": 0.008
},
{
"epoch": 0.8715780719384573,
"grad_norm": 6.086115837097168,
"learning_rate": 0.00012879763556277062,
"logits/chosen": -1.1569675207138062,
"logits/rejected": -1.1982351541519165,
"logps/chosen": -8.720643997192383,
"logps/rejected": -99.62559509277344,
"loss": 0.45403456687927246,
"memory(GiB)": 46.1,
"nll_loss": 0.40008455514907837,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.6170443296432495,
"rewards/margins": 8.753840446472168,
"rewards/rejected": -8.136796951293945,
"step": 393,
"train_speed(iter/s)": 0.007999
},
{
"epoch": 0.8737958278466976,
"grad_norm": 1.8687723875045776,
"learning_rate": 0.0001284455697923646,
"logits/chosen": -1.1504981517791748,
"logits/rejected": -1.225466012954712,
"logps/chosen": -6.932313442230225,
"logps/rejected": -97.39447784423828,
"loss": 0.40548500418663025,
"memory(GiB)": 46.1,
"nll_loss": 0.30781060457229614,
"rewards/accuracies": 0.96875,
"rewards/chosen": 0.5330286622047424,
"rewards/margins": 7.959634780883789,
"rewards/rejected": -7.426605701446533,
"step": 394,
"train_speed(iter/s)": 0.007999
},
{
"epoch": 0.876013583754938,
"grad_norm": 1.7781997919082642,
"learning_rate": 0.00012809311997735696,
"logits/chosen": -1.1534217596054077,
"logits/rejected": -1.2358542680740356,
"logps/chosen": -8.768854141235352,
"logps/rejected": -91.94288635253906,
"loss": 0.4044226408004761,
"memory(GiB)": 46.1,
"nll_loss": 0.3020440340042114,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.46018874645233154,
"rewards/margins": 7.929361343383789,
"rewards/rejected": -7.469172477722168,
"step": 395,
"train_speed(iter/s)": 0.007999
},
{
"epoch": 0.8782313396631783,
"grad_norm": 12.74526309967041,
"learning_rate": 0.00012774029087618446,
"logits/chosen": -1.2151590585708618,
"logits/rejected": -1.251021385192871,
"logps/chosen": -10.305855751037598,
"logps/rejected": -91.78905487060547,
"loss": 0.6720870137214661,
"memory(GiB)": 46.1,
"nll_loss": 0.4713570773601532,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.16427800059318542,
"rewards/margins": 7.4839887619018555,
"rewards/rejected": -7.319710731506348,
"step": 396,
"train_speed(iter/s)": 0.007999
},
{
"epoch": 0.8804490955714187,
"grad_norm": 2.1509110927581787,
"learning_rate": 0.00012738708725240484,
"logits/chosen": -1.2225698232650757,
"logits/rejected": -1.2627900838851929,
"logps/chosen": -11.55994987487793,
"logps/rejected": -98.7964096069336,
"loss": 0.5669252276420593,
"memory(GiB)": 46.1,
"nll_loss": 0.3946492075920105,
"rewards/accuracies": 0.90625,
"rewards/chosen": 0.3987804055213928,
"rewards/margins": 8.50069522857666,
"rewards/rejected": -8.10191535949707,
"step": 397,
"train_speed(iter/s)": 0.007999
},
{
"epoch": 0.8826668514796591,
"grad_norm": 2.0327556133270264,
"learning_rate": 0.0001270335138746322,
"logits/chosen": -1.1845993995666504,
"logits/rejected": -1.2103253602981567,
"logps/chosen": -6.5673980712890625,
"logps/rejected": -69.4446792602539,
"loss": 0.5495756268501282,
"memory(GiB)": 46.1,
"nll_loss": 0.3730127215385437,
"rewards/accuracies": 0.96875,
"rewards/chosen": 0.29667022824287415,
"rewards/margins": 5.815788745880127,
"rewards/rejected": -5.519117832183838,
"step": 398,
"train_speed(iter/s)": 0.007999
},
{
"epoch": 0.8848846073878994,
"grad_norm": 5.390183925628662,
"learning_rate": 0.00012667957551647262,
"logits/chosen": -1.2288250923156738,
"logits/rejected": -1.2931530475616455,
"logps/chosen": -5.809046268463135,
"logps/rejected": -112.88240051269531,
"loss": 0.3403761684894562,
"memory(GiB)": 46.1,
"nll_loss": 0.21371078491210938,
"rewards/accuracies": 0.90625,
"rewards/chosen": 0.43278729915618896,
"rewards/margins": 9.281527519226074,
"rewards/rejected": -8.848739624023438,
"step": 399,
"train_speed(iter/s)": 0.008
},
{
"epoch": 0.8871023632961397,
"grad_norm": 3.3119659423828125,
"learning_rate": 0.00012632527695645993,
"logits/chosen": -1.2474465370178223,
"logits/rejected": -1.3153529167175293,
"logps/chosen": -5.87565803527832,
"logps/rejected": -95.62116241455078,
"loss": 0.43962395191192627,
"memory(GiB)": 46.1,
"nll_loss": 0.3828383982181549,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.4066924750804901,
"rewards/margins": 7.693698883056641,
"rewards/rejected": -7.287006378173828,
"step": 400,
"train_speed(iter/s)": 0.008
}
],
"logging_steps": 1,
"max_steps": 900,
"num_input_tokens_seen": 0,
"num_train_epochs": 2,
"save_steps": 50,
"stateful_callbacks": {
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": true,
"should_training_stop": false
},
"attributes": {}
}
},
"total_flos": 1.1370776801606369e+18,
"train_batch_size": 1,
"trial_name": null,
"trial_params": null
}