PEFT
Safetensors
dpo50 / trainer_state.json
chen
Upload folder using huggingface_hub
5aa75ee verified
Raw
History Blame Contribute Delete
32.7 kB
{
"best_global_step": null,
"best_metric": null,
"best_model_checkpoint": null,
"epoch": 0.12373366328976877,
"eval_steps": 300,
"global_step": 50,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"epoch": 0.0024746732657953754,
"grad_norm": 11.35000991821289,
"learning_rate": 3.278688524590164e-06,
"logits/chosen": -0.6587307453155518,
"logits/rejected": -0.6631469130516052,
"logps/chosen": -13.55949878692627,
"logps/rejected": -27.670433044433594,
"loss": 1.6191432476043701,
"memory(GiB)": 45.42,
"nll_loss": 0.9259958863258362,
"rewards/accuracies": 0.0,
"rewards/chosen": 0.0,
"rewards/margins": 0.0,
"rewards/rejected": 0.0,
"step": 1,
"train_speed(iter/s)": 0.005221
},
{
"epoch": 0.004949346531590751,
"grad_norm": 9.617626190185547,
"learning_rate": 6.557377049180328e-06,
"logits/chosen": -0.6030034422874451,
"logits/rejected": -0.6114212274551392,
"logps/chosen": -14.923763275146484,
"logps/rejected": -29.194869995117188,
"loss": 1.6753138303756714,
"memory(GiB)": 45.42,
"nll_loss": 0.9821667671203613,
"rewards/accuracies": 0.0,
"rewards/chosen": 0.0,
"rewards/margins": 0.0,
"rewards/rejected": 0.0,
"step": 2,
"train_speed(iter/s)": 0.005275
},
{
"epoch": 0.007424019797386126,
"grad_norm": 8.504729270935059,
"learning_rate": 9.836065573770493e-06,
"logits/chosen": -0.5661746859550476,
"logits/rejected": -0.5726399421691895,
"logps/chosen": -13.571891784667969,
"logps/rejected": -26.323240280151367,
"loss": 1.6620099544525146,
"memory(GiB)": 46.09,
"nll_loss": 0.9678325057029724,
"rewards/accuracies": 0.53125,
"rewards/chosen": -0.003509162925183773,
"rewards/margins": -0.001862737350165844,
"rewards/rejected": -0.0016464253421872854,
"step": 3,
"train_speed(iter/s)": 0.005301
},
{
"epoch": 0.009898693063181502,
"grad_norm": 11.376845359802246,
"learning_rate": 1.3114754098360657e-05,
"logits/chosen": -0.6604664921760559,
"logits/rejected": -0.6652082800865173,
"logps/chosen": -12.837306022644043,
"logps/rejected": -23.095237731933594,
"loss": 1.663628339767456,
"memory(GiB)": 46.09,
"nll_loss": 0.975486695766449,
"rewards/accuracies": 0.6875,
"rewards/chosen": 0.00841558538377285,
"rewards/margins": 0.010128158144652843,
"rewards/rejected": -0.0017125748563557863,
"step": 4,
"train_speed(iter/s)": 0.005365
},
{
"epoch": 0.012373366328976877,
"grad_norm": 5.700821399688721,
"learning_rate": 1.6393442622950818e-05,
"logits/chosen": -0.6459366083145142,
"logits/rejected": -0.6513304710388184,
"logps/chosen": -18.565486907958984,
"logps/rejected": -23.259275436401367,
"loss": 1.594820261001587,
"memory(GiB)": 46.09,
"nll_loss": 0.8972694277763367,
"rewards/accuracies": 0.375,
"rewards/chosen": 0.00964329019188881,
"rewards/margins": -0.008526789955794811,
"rewards/rejected": 0.018170079216361046,
"step": 5,
"train_speed(iter/s)": 0.005387
},
{
"epoch": 0.014848039594772253,
"grad_norm": 8.467960357666016,
"learning_rate": 1.9672131147540985e-05,
"logits/chosen": -0.6038874387741089,
"logits/rejected": -0.6043834090232849,
"logps/chosen": -13.40754508972168,
"logps/rejected": -18.13410758972168,
"loss": 1.6557857990264893,
"memory(GiB)": 46.09,
"nll_loss": 0.960586428642273,
"rewards/accuracies": 0.46875,
"rewards/chosen": 0.030818985775113106,
"rewards/margins": -0.003026916179805994,
"rewards/rejected": 0.03384590521454811,
"step": 6,
"train_speed(iter/s)": 0.005393
},
{
"epoch": 0.017322712860567628,
"grad_norm": 10.094538688659668,
"learning_rate": 2.295081967213115e-05,
"logits/chosen": -0.5412906408309937,
"logits/rejected": -0.5506806969642639,
"logps/chosen": -12.647178649902344,
"logps/rejected": -27.220874786376953,
"loss": 1.5276265144348145,
"memory(GiB)": 46.09,
"nll_loss": 0.8624258637428284,
"rewards/accuracies": 0.71875,
"rewards/chosen": 0.08376072347164154,
"rewards/margins": 0.06035517156124115,
"rewards/rejected": 0.023405561223626137,
"step": 7,
"train_speed(iter/s)": 0.005386
},
{
"epoch": 0.019797386126363004,
"grad_norm": 8.840508460998535,
"learning_rate": 2.6229508196721314e-05,
"logits/chosen": -0.6647145748138428,
"logits/rejected": -0.6669148206710815,
"logps/chosen": -14.856410026550293,
"logps/rejected": -21.21141815185547,
"loss": 1.492944598197937,
"memory(GiB)": 46.09,
"nll_loss": 0.844528317451477,
"rewards/accuracies": 0.71875,
"rewards/chosen": 0.11737693846225739,
"rewards/margins": 0.09855899959802628,
"rewards/rejected": 0.01881793886423111,
"step": 8,
"train_speed(iter/s)": 0.005383
},
{
"epoch": 0.02227205939215838,
"grad_norm": 6.475947380065918,
"learning_rate": 2.9508196721311478e-05,
"logits/chosen": -0.6404256224632263,
"logits/rejected": -0.6432085037231445,
"logps/chosen": -12.697021484375,
"logps/rejected": -22.463302612304688,
"loss": 1.3507211208343506,
"memory(GiB)": 46.09,
"nll_loss": 0.6943754553794861,
"rewards/accuracies": 0.59375,
"rewards/chosen": 0.18904930353164673,
"rewards/margins": 0.11120466142892838,
"rewards/rejected": 0.07784464210271835,
"step": 9,
"train_speed(iter/s)": 0.005379
},
{
"epoch": 0.024746732657953754,
"grad_norm": 3.908445119857788,
"learning_rate": 3.2786885245901635e-05,
"logits/chosen": -0.6233164668083191,
"logits/rejected": -0.6281710863113403,
"logps/chosen": -12.109004974365234,
"logps/rejected": -25.513099670410156,
"loss": 1.1971133947372437,
"memory(GiB)": 46.09,
"nll_loss": 0.523026704788208,
"rewards/accuracies": 0.5625,
"rewards/chosen": 0.1465698629617691,
"rewards/margins": 0.09749479591846466,
"rewards/rejected": 0.04907506704330444,
"step": 10,
"train_speed(iter/s)": 0.005374
},
{
"epoch": 0.02722140592374913,
"grad_norm": 10.216607093811035,
"learning_rate": 3.6065573770491806e-05,
"logits/chosen": -0.6259695291519165,
"logits/rejected": -0.6286618709564209,
"logps/chosen": -14.0396146774292,
"logps/rejected": -21.92095947265625,
"loss": 1.4379217624664307,
"memory(GiB)": 46.09,
"nll_loss": 0.7931011915206909,
"rewards/accuracies": 0.65625,
"rewards/chosen": 0.10121297836303711,
"rewards/margins": 0.2612895369529724,
"rewards/rejected": -0.1600765436887741,
"step": 11,
"train_speed(iter/s)": 0.005372
},
{
"epoch": 0.029696079189544505,
"grad_norm": 6.620578765869141,
"learning_rate": 3.934426229508197e-05,
"logits/chosen": -0.6335112452507019,
"logits/rejected": -0.638087809085846,
"logps/chosen": -9.480979919433594,
"logps/rejected": -24.5159912109375,
"loss": 1.1956348419189453,
"memory(GiB)": 46.09,
"nll_loss": 0.5891170501708984,
"rewards/accuracies": 0.78125,
"rewards/chosen": 0.07576582580804825,
"rewards/margins": 0.3991776704788208,
"rewards/rejected": -0.32341182231903076,
"step": 12,
"train_speed(iter/s)": 0.005391
},
{
"epoch": 0.03217075245533988,
"grad_norm": 6.803226947784424,
"learning_rate": 4.262295081967213e-05,
"logits/chosen": -0.6281187534332275,
"logits/rejected": -0.6315115690231323,
"logps/chosen": -18.412860870361328,
"logps/rejected": -27.436920166015625,
"loss": 1.5400699377059937,
"memory(GiB)": 46.09,
"nll_loss": 0.88338702917099,
"rewards/accuracies": 0.625,
"rewards/chosen": -0.10771963745355606,
"rewards/margins": 0.27280330657958984,
"rewards/rejected": -0.3805229365825653,
"step": 13,
"train_speed(iter/s)": 0.005388
},
{
"epoch": 0.034645425721135256,
"grad_norm": 9.147095680236816,
"learning_rate": 4.59016393442623e-05,
"logits/chosen": -0.6376056671142578,
"logits/rejected": -0.6407235264778137,
"logps/chosen": -17.056198120117188,
"logps/rejected": -25.44281768798828,
"loss": 1.7076380252838135,
"memory(GiB)": 46.09,
"nll_loss": 0.973918616771698,
"rewards/accuracies": 0.59375,
"rewards/chosen": -0.14579348266124725,
"rewards/margins": 0.050162509083747864,
"rewards/rejected": -0.19595597684383392,
"step": 14,
"train_speed(iter/s)": 0.005397
},
{
"epoch": 0.03712009898693063,
"grad_norm": 4.252878189086914,
"learning_rate": 4.918032786885246e-05,
"logits/chosen": -0.5979167222976685,
"logits/rejected": -0.6013778448104858,
"logps/chosen": -12.705180168151855,
"logps/rejected": -26.116336822509766,
"loss": 1.3297263383865356,
"memory(GiB)": 46.09,
"nll_loss": 0.7305101156234741,
"rewards/accuracies": 0.6875,
"rewards/chosen": -0.06688955426216125,
"rewards/margins": 0.28163066506385803,
"rewards/rejected": -0.3485202193260193,
"step": 15,
"train_speed(iter/s)": 0.005401
},
{
"epoch": 0.03959477225272601,
"grad_norm": 3.8650903701782227,
"learning_rate": 5.245901639344263e-05,
"logits/chosen": -0.5886881351470947,
"logits/rejected": -0.5908396244049072,
"logps/chosen": -22.1767578125,
"logps/rejected": -32.695167541503906,
"loss": 1.450103521347046,
"memory(GiB)": 46.09,
"nll_loss": 0.7899419069290161,
"rewards/accuracies": 0.65625,
"rewards/chosen": -0.05856169015169144,
"rewards/margins": 0.17948633432388306,
"rewards/rejected": -0.2380480319261551,
"step": 16,
"train_speed(iter/s)": 0.005395
},
{
"epoch": 0.04206944551852138,
"grad_norm": 3.568068742752075,
"learning_rate": 5.5737704918032785e-05,
"logits/chosen": -0.557040810585022,
"logits/rejected": -0.5580084919929504,
"logps/chosen": -17.01874542236328,
"logps/rejected": -27.190898895263672,
"loss": 1.4369667768478394,
"memory(GiB)": 46.09,
"nll_loss": 0.7801130414009094,
"rewards/accuracies": 0.6875,
"rewards/chosen": 0.07399038225412369,
"rewards/margins": 0.22467321157455444,
"rewards/rejected": -0.15068282186985016,
"step": 17,
"train_speed(iter/s)": 0.005403
},
{
"epoch": 0.04454411878431676,
"grad_norm": 4.3334150314331055,
"learning_rate": 5.9016393442622956e-05,
"logits/chosen": -0.5880481600761414,
"logits/rejected": -0.5887515544891357,
"logps/chosen": -21.928936004638672,
"logps/rejected": -22.768033981323242,
"loss": 1.6926015615463257,
"memory(GiB)": 46.09,
"nll_loss": 0.9716537594795227,
"rewards/accuracies": 0.5,
"rewards/chosen": 0.0877460390329361,
"rewards/margins": 0.0405881404876709,
"rewards/rejected": 0.047157879918813705,
"step": 18,
"train_speed(iter/s)": 0.005402
},
{
"epoch": 0.04701879205011213,
"grad_norm": 2.5271899700164795,
"learning_rate": 6.229508196721313e-05,
"logits/chosen": -0.598438560962677,
"logits/rejected": -0.604390025138855,
"logps/chosen": -17.247812271118164,
"logps/rejected": -31.589086532592773,
"loss": 1.248651385307312,
"memory(GiB)": 46.09,
"nll_loss": 0.6379994750022888,
"rewards/accuracies": 0.5625,
"rewards/chosen": 0.2769991457462311,
"rewards/margins": 0.2692391276359558,
"rewards/rejected": 0.0077600013464689255,
"step": 19,
"train_speed(iter/s)": 0.005406
},
{
"epoch": 0.04949346531590751,
"grad_norm": 3.571847915649414,
"learning_rate": 6.557377049180327e-05,
"logits/chosen": -0.5842810273170471,
"logits/rejected": -0.5847360491752625,
"logps/chosen": -15.484521865844727,
"logps/rejected": -20.548080444335938,
"loss": 1.5169799327850342,
"memory(GiB)": 46.09,
"nll_loss": 0.7671993374824524,
"rewards/accuracies": 0.40625,
"rewards/chosen": 0.08881673216819763,
"rewards/margins": -0.04343637824058533,
"rewards/rejected": 0.13225311040878296,
"step": 20,
"train_speed(iter/s)": 0.00541
},
{
"epoch": 0.051968138581702884,
"grad_norm": 2.258408546447754,
"learning_rate": 6.885245901639344e-05,
"logits/chosen": -0.548245906829834,
"logits/rejected": -0.551019549369812,
"logps/chosen": -12.056645393371582,
"logps/rejected": -22.498403549194336,
"loss": 1.2092863321304321,
"memory(GiB)": 46.09,
"nll_loss": 0.5635381937026978,
"rewards/accuracies": 0.59375,
"rewards/chosen": 0.24224215745925903,
"rewards/margins": 0.19714026153087616,
"rewards/rejected": 0.045101895928382874,
"step": 21,
"train_speed(iter/s)": 0.005423
},
{
"epoch": 0.05444281184749826,
"grad_norm": 4.153398036956787,
"learning_rate": 7.213114754098361e-05,
"logits/chosen": -0.5542203783988953,
"logits/rejected": -0.5555762052536011,
"logps/chosen": -10.120831489562988,
"logps/rejected": -21.4542236328125,
"loss": 1.2580621242523193,
"memory(GiB)": 46.09,
"nll_loss": 0.6088542342185974,
"rewards/accuracies": 0.625,
"rewards/chosen": 0.2806166112422943,
"rewards/margins": 0.14948059618473053,
"rewards/rejected": 0.1311360001564026,
"step": 22,
"train_speed(iter/s)": 0.005422
},
{
"epoch": 0.056917485113293635,
"grad_norm": 2.784181833267212,
"learning_rate": 7.540983606557377e-05,
"logits/chosen": -0.6017516255378723,
"logits/rejected": -0.6026712656021118,
"logps/chosen": -14.456979751586914,
"logps/rejected": -21.297657012939453,
"loss": 1.2428232431411743,
"memory(GiB)": 46.09,
"nll_loss": 0.5972878932952881,
"rewards/accuracies": 0.53125,
"rewards/chosen": 0.27611616253852844,
"rewards/margins": 0.14373204112052917,
"rewards/rejected": 0.13238413631916046,
"step": 23,
"train_speed(iter/s)": 0.005422
},
{
"epoch": 0.05939215837908901,
"grad_norm": 2.2945520877838135,
"learning_rate": 7.868852459016394e-05,
"logits/chosen": -0.5793949961662292,
"logits/rejected": -0.5800157785415649,
"logps/chosen": -9.155426979064941,
"logps/rejected": -22.067913055419922,
"loss": 1.1942368745803833,
"memory(GiB)": 46.09,
"nll_loss": 0.5604769587516785,
"rewards/accuracies": 0.6875,
"rewards/chosen": 0.29127371311187744,
"rewards/margins": 0.17932376265525818,
"rewards/rejected": 0.11194998770952225,
"step": 24,
"train_speed(iter/s)": 0.005419
},
{
"epoch": 0.061866831644884386,
"grad_norm": 2.7884368896484375,
"learning_rate": 8.19672131147541e-05,
"logits/chosen": -0.5844717621803284,
"logits/rejected": -0.5868740677833557,
"logps/chosen": -13.537481307983398,
"logps/rejected": -17.04685401916504,
"loss": 1.218743920326233,
"memory(GiB)": 46.09,
"nll_loss": 0.6010019779205322,
"rewards/accuracies": 0.65625,
"rewards/chosen": 0.38273870944976807,
"rewards/margins": 0.2067541480064392,
"rewards/rejected": 0.17598456144332886,
"step": 25,
"train_speed(iter/s)": 0.005422
},
{
"epoch": 0.06434150491067976,
"grad_norm": 2.3340394496917725,
"learning_rate": 8.524590163934426e-05,
"logits/chosen": -0.6258128881454468,
"logits/rejected": -0.6279971599578857,
"logps/chosen": -9.657672882080078,
"logps/rejected": -22.88201904296875,
"loss": 1.114503264427185,
"memory(GiB)": 46.09,
"nll_loss": 0.5605608820915222,
"rewards/accuracies": 0.8125,
"rewards/chosen": 0.3312107026576996,
"rewards/margins": 0.372702419757843,
"rewards/rejected": -0.04149174690246582,
"step": 26,
"train_speed(iter/s)": 0.005423
},
{
"epoch": 0.06681617817647514,
"grad_norm": 3.664553165435791,
"learning_rate": 8.852459016393443e-05,
"logits/chosen": -0.5701621770858765,
"logits/rejected": -0.5702242851257324,
"logps/chosen": -15.183746337890625,
"logps/rejected": -17.559988021850586,
"loss": 1.4017894268035889,
"memory(GiB)": 46.09,
"nll_loss": 0.7635535597801208,
"rewards/accuracies": 0.65625,
"rewards/chosen": 0.21464091539382935,
"rewards/margins": 0.1838790327310562,
"rewards/rejected": 0.03076188825070858,
"step": 27,
"train_speed(iter/s)": 0.005417
},
{
"epoch": 0.06929085144227051,
"grad_norm": 2.2080814838409424,
"learning_rate": 9.18032786885246e-05,
"logits/chosen": -0.5039485096931458,
"logits/rejected": -0.5086482763290405,
"logps/chosen": -8.541333198547363,
"logps/rejected": -27.416786193847656,
"loss": 1.032238483428955,
"memory(GiB)": 46.09,
"nll_loss": 0.42585042119026184,
"rewards/accuracies": 0.6875,
"rewards/chosen": 0.29641830921173096,
"rewards/margins": 0.3008955717086792,
"rewards/rejected": -0.004477284848690033,
"step": 28,
"train_speed(iter/s)": 0.005423
},
{
"epoch": 0.0717655247080659,
"grad_norm": 2.4612784385681152,
"learning_rate": 9.508196721311476e-05,
"logits/chosen": -0.5983453989028931,
"logits/rejected": -0.6011134386062622,
"logps/chosen": -9.658693313598633,
"logps/rejected": -25.247703552246094,
"loss": 1.0381165742874146,
"memory(GiB)": 46.09,
"nll_loss": 0.46968621015548706,
"rewards/accuracies": 0.6875,
"rewards/chosen": 0.30931776762008667,
"rewards/margins": 0.36611291766166687,
"rewards/rejected": -0.05679512768983841,
"step": 29,
"train_speed(iter/s)": 0.005423
},
{
"epoch": 0.07424019797386126,
"grad_norm": 3.299984931945801,
"learning_rate": 9.836065573770493e-05,
"logits/chosen": -0.5566404461860657,
"logits/rejected": -0.5608186721801758,
"logps/chosen": -11.162762641906738,
"logps/rejected": -25.61810874938965,
"loss": 1.2033004760742188,
"memory(GiB)": 46.09,
"nll_loss": 0.6197662949562073,
"rewards/accuracies": 0.78125,
"rewards/chosen": 0.3209737241268158,
"rewards/margins": 0.38564494252204895,
"rewards/rejected": -0.06467118114233017,
"step": 30,
"train_speed(iter/s)": 0.005432
},
{
"epoch": 0.07671487123965665,
"grad_norm": 3.927424430847168,
"learning_rate": 0.00010163934426229508,
"logits/chosen": -0.5413897037506104,
"logits/rejected": -0.5447396636009216,
"logps/chosen": -7.564568042755127,
"logps/rejected": -23.63496208190918,
"loss": 1.1393965482711792,
"memory(GiB)": 46.09,
"nll_loss": 0.5696667432785034,
"rewards/accuracies": 0.71875,
"rewards/chosen": 0.27428141236305237,
"rewards/margins": 0.5005658864974976,
"rewards/rejected": -0.2262844443321228,
"step": 31,
"train_speed(iter/s)": 0.005428
},
{
"epoch": 0.07918954450545201,
"grad_norm": 3.8795111179351807,
"learning_rate": 0.00010491803278688525,
"logits/chosen": -0.6150721311569214,
"logits/rejected": -0.6170963048934937,
"logps/chosen": -15.14966869354248,
"logps/rejected": -21.37498664855957,
"loss": 1.2894086837768555,
"memory(GiB)": 46.09,
"nll_loss": 0.6919065713882446,
"rewards/accuracies": 0.65625,
"rewards/chosen": 0.2811221778392792,
"rewards/margins": 0.3919064402580261,
"rewards/rejected": -0.11078427731990814,
"step": 32,
"train_speed(iter/s)": 0.005435
},
{
"epoch": 0.0816642177712474,
"grad_norm": 3.8578360080718994,
"learning_rate": 0.00010819672131147543,
"logits/chosen": -0.6152044534683228,
"logits/rejected": -0.615663468837738,
"logps/chosen": -11.967881202697754,
"logps/rejected": -20.445411682128906,
"loss": 1.1714155673980713,
"memory(GiB)": 46.09,
"nll_loss": 0.5518181324005127,
"rewards/accuracies": 0.65625,
"rewards/chosen": 0.21441030502319336,
"rewards/margins": 0.2466525286436081,
"rewards/rejected": -0.03224220499396324,
"step": 33,
"train_speed(iter/s)": 0.005433
},
{
"epoch": 0.08413889103704277,
"grad_norm": 3.3592934608459473,
"learning_rate": 0.00011147540983606557,
"logits/chosen": -0.6198133826255798,
"logits/rejected": -0.6197149753570557,
"logps/chosen": -11.38640308380127,
"logps/rejected": -22.015522003173828,
"loss": 1.1110243797302246,
"memory(GiB)": 46.09,
"nll_loss": 0.5177969932556152,
"rewards/accuracies": 0.71875,
"rewards/chosen": 0.23841583728790283,
"rewards/margins": 0.32188504934310913,
"rewards/rejected": -0.0834691971540451,
"step": 34,
"train_speed(iter/s)": 0.00543
},
{
"epoch": 0.08661356430283815,
"grad_norm": 2.9654669761657715,
"learning_rate": 0.00011475409836065574,
"logits/chosen": -0.6268936991691589,
"logits/rejected": -0.6304693818092346,
"logps/chosen": -8.792684555053711,
"logps/rejected": -27.867855072021484,
"loss": 0.9397363662719727,
"memory(GiB)": 46.09,
"nll_loss": 0.44072026014328003,
"rewards/accuracies": 0.75,
"rewards/chosen": 0.2782461643218994,
"rewards/margins": 0.6700869202613831,
"rewards/rejected": -0.39184072613716125,
"step": 35,
"train_speed(iter/s)": 0.00543
},
{
"epoch": 0.08908823756863352,
"grad_norm": 4.219470977783203,
"learning_rate": 0.00011803278688524591,
"logits/chosen": -0.5896088480949402,
"logits/rejected": -0.5908181667327881,
"logps/chosen": -9.439773559570312,
"logps/rejected": -21.788042068481445,
"loss": 1.1120812892913818,
"memory(GiB)": 46.09,
"nll_loss": 0.5399542450904846,
"rewards/accuracies": 0.625,
"rewards/chosen": 0.19946175813674927,
"rewards/margins": 0.4053455591201782,
"rewards/rejected": -0.20588380098342896,
"step": 36,
"train_speed(iter/s)": 0.005431
},
{
"epoch": 0.0915629108344289,
"grad_norm": 4.5739665031433105,
"learning_rate": 0.00012131147540983607,
"logits/chosen": -0.6280671954154968,
"logits/rejected": -0.6325269937515259,
"logps/chosen": -8.791489601135254,
"logps/rejected": -30.336650848388672,
"loss": 1.1410616636276245,
"memory(GiB)": 46.09,
"nll_loss": 0.6490904688835144,
"rewards/accuracies": 0.78125,
"rewards/chosen": 0.2655602991580963,
"rewards/margins": 0.6452851891517639,
"rewards/rejected": -0.3797248899936676,
"step": 37,
"train_speed(iter/s)": 0.005434
},
{
"epoch": 0.09403758410022427,
"grad_norm": 3.020256280899048,
"learning_rate": 0.00012459016393442625,
"logits/chosen": -0.6382966637611389,
"logits/rejected": -0.6446542143821716,
"logps/chosen": -12.288652420043945,
"logps/rejected": -31.03972625732422,
"loss": 0.9547407031059265,
"memory(GiB)": 46.09,
"nll_loss": 0.574475109577179,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.3463619351387024,
"rewards/margins": 1.0072863101959229,
"rewards/rejected": -0.6609243154525757,
"step": 38,
"train_speed(iter/s)": 0.005438
},
{
"epoch": 0.09651225736601965,
"grad_norm": 3.258894205093384,
"learning_rate": 0.0001278688524590164,
"logits/chosen": -0.6787834763526917,
"logits/rejected": -0.6786651015281677,
"logps/chosen": -12.136661529541016,
"logps/rejected": -20.544681549072266,
"loss": 1.0752589702606201,
"memory(GiB)": 46.09,
"nll_loss": 0.6294119358062744,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.34082022309303284,
"rewards/margins": 0.8202961683273315,
"rewards/rejected": -0.4794759452342987,
"step": 39,
"train_speed(iter/s)": 0.005436
},
{
"epoch": 0.09898693063181502,
"grad_norm": 3.8263096809387207,
"learning_rate": 0.00013114754098360654,
"logits/chosen": -0.6569682359695435,
"logits/rejected": -0.6592159271240234,
"logps/chosen": -21.227203369140625,
"logps/rejected": -24.57542610168457,
"loss": 1.3819258213043213,
"memory(GiB)": 46.09,
"nll_loss": 0.8235953450202942,
"rewards/accuracies": 0.75,
"rewards/chosen": 0.12423999607563019,
"rewards/margins": 0.5565845966339111,
"rewards/rejected": -0.43234458565711975,
"step": 40,
"train_speed(iter/s)": 0.005435
},
{
"epoch": 0.1014616038976104,
"grad_norm": 3.6862781047821045,
"learning_rate": 0.00013442622950819673,
"logits/chosen": -0.6126083135604858,
"logits/rejected": -0.618023157119751,
"logps/chosen": -18.38534927368164,
"logps/rejected": -31.6680850982666,
"loss": 1.0961635112762451,
"memory(GiB)": 46.09,
"nll_loss": 0.6294427514076233,
"rewards/accuracies": 0.90625,
"rewards/chosen": 0.16896528005599976,
"rewards/margins": 0.7662918567657471,
"rewards/rejected": -0.5973266363143921,
"step": 41,
"train_speed(iter/s)": 0.005439
},
{
"epoch": 0.10393627716340577,
"grad_norm": 2.924959897994995,
"learning_rate": 0.00013770491803278688,
"logits/chosen": -0.6756088137626648,
"logits/rejected": -0.6791292428970337,
"logps/chosen": -12.787935256958008,
"logps/rejected": -35.33570861816406,
"loss": 0.9558172821998596,
"memory(GiB)": 46.09,
"nll_loss": 0.45665955543518066,
"rewards/accuracies": 0.71875,
"rewards/chosen": 0.14984729886054993,
"rewards/margins": 0.7973157167434692,
"rewards/rejected": -0.6474683880805969,
"step": 42,
"train_speed(iter/s)": 0.005438
},
{
"epoch": 0.10641095042920115,
"grad_norm": 5.650424480438232,
"learning_rate": 0.00014098360655737707,
"logits/chosen": -0.6601684093475342,
"logits/rejected": -0.667102038860321,
"logps/chosen": -12.86988639831543,
"logps/rejected": -33.79030227661133,
"loss": 0.97264564037323,
"memory(GiB)": 46.09,
"nll_loss": 0.5231238603591919,
"rewards/accuracies": 0.78125,
"rewards/chosen": 0.10155264288187027,
"rewards/margins": 0.8151469230651855,
"rewards/rejected": -0.7135943174362183,
"step": 43,
"train_speed(iter/s)": 0.005438
},
{
"epoch": 0.10888562369499652,
"grad_norm": 4.125715732574463,
"learning_rate": 0.00014426229508196722,
"logits/chosen": -0.615486741065979,
"logits/rejected": -0.6166262030601501,
"logps/chosen": -22.158443450927734,
"logps/rejected": -30.26171112060547,
"loss": 1.174919843673706,
"memory(GiB)": 46.09,
"nll_loss": 0.67107754945755,
"rewards/accuracies": 0.75,
"rewards/chosen": 0.12467168271541595,
"rewards/margins": 1.025106430053711,
"rewards/rejected": -0.9004346132278442,
"step": 44,
"train_speed(iter/s)": 0.005437
},
{
"epoch": 0.1113602969607919,
"grad_norm": 4.247290134429932,
"learning_rate": 0.00014754098360655738,
"logits/chosen": -0.6652258634567261,
"logits/rejected": -0.672545313835144,
"logps/chosen": -9.705460548400879,
"logps/rejected": -31.59243392944336,
"loss": 0.9555923342704773,
"memory(GiB)": 46.09,
"nll_loss": 0.5207614302635193,
"rewards/accuracies": 0.75,
"rewards/chosen": 0.2395530790090561,
"rewards/margins": 1.0814993381500244,
"rewards/rejected": -0.8419461846351624,
"step": 45,
"train_speed(iter/s)": 0.005438
},
{
"epoch": 0.11383497022658727,
"grad_norm": 3.2860352993011475,
"learning_rate": 0.00015081967213114754,
"logits/chosen": -0.614319920539856,
"logits/rejected": -0.619287371635437,
"logps/chosen": -13.63390064239502,
"logps/rejected": -35.74215316772461,
"loss": 0.9872268438339233,
"memory(GiB)": 46.09,
"nll_loss": 0.6003797650337219,
"rewards/accuracies": 0.8125,
"rewards/chosen": 0.28653809428215027,
"rewards/margins": 1.200305461883545,
"rewards/rejected": -0.9137674570083618,
"step": 46,
"train_speed(iter/s)": 0.005439
},
{
"epoch": 0.11630964349238265,
"grad_norm": 5.599460601806641,
"learning_rate": 0.0001540983606557377,
"logits/chosen": -0.6212424039840698,
"logits/rejected": -0.6217514276504517,
"logps/chosen": -17.058250427246094,
"logps/rejected": -29.002065658569336,
"loss": 1.1983596086502075,
"memory(GiB)": 46.09,
"nll_loss": 0.7794193029403687,
"rewards/accuracies": 0.8125,
"rewards/chosen": 0.22204741835594177,
"rewards/margins": 0.9237122535705566,
"rewards/rejected": -0.7016648054122925,
"step": 47,
"train_speed(iter/s)": 0.005439
},
{
"epoch": 0.11878431675817802,
"grad_norm": 4.221462726593018,
"learning_rate": 0.00015737704918032788,
"logits/chosen": -0.6427355408668518,
"logits/rejected": -0.6452814936637878,
"logps/chosen": -13.284379005432129,
"logps/rejected": -28.47121238708496,
"loss": 0.9505041241645813,
"memory(GiB)": 46.09,
"nll_loss": 0.5451131463050842,
"rewards/accuracies": 0.90625,
"rewards/chosen": 0.22931885719299316,
"rewards/margins": 0.9360889792442322,
"rewards/rejected": -0.706770122051239,
"step": 48,
"train_speed(iter/s)": 0.005439
},
{
"epoch": 0.1212589900239734,
"grad_norm": 4.555298328399658,
"learning_rate": 0.00016065573770491804,
"logits/chosen": -0.6409769058227539,
"logits/rejected": -0.6388667225837708,
"logps/chosen": -12.98600959777832,
"logps/rejected": -19.881681442260742,
"loss": 1.2290067672729492,
"memory(GiB)": 46.09,
"nll_loss": 0.5956090688705444,
"rewards/accuracies": 0.59375,
"rewards/chosen": 0.07330272346735,
"rewards/margins": 0.5512866973876953,
"rewards/rejected": -0.47798389196395874,
"step": 49,
"train_speed(iter/s)": 0.00544
},
{
"epoch": 0.12373366328976877,
"grad_norm": 3.2366769313812256,
"learning_rate": 0.0001639344262295082,
"logits/chosen": -0.6371148228645325,
"logits/rejected": -0.6468245983123779,
"logps/chosen": -20.83090591430664,
"logps/rejected": -45.217796325683594,
"loss": 0.996230959892273,
"memory(GiB)": 46.09,
"nll_loss": 0.6383583545684814,
"rewards/accuracies": 0.75,
"rewards/chosen": 0.13887403905391693,
"rewards/margins": 1.3918437957763672,
"rewards/rejected": -1.252969741821289,
"step": 50,
"train_speed(iter/s)": 0.005439
}
],
"logging_steps": 1,
"max_steps": 1212,
"num_input_tokens_seen": 0,
"num_train_epochs": 3,
"save_steps": 50,
"stateful_callbacks": {
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": true,
"should_training_stop": false
},
"attributes": {}
}
},
"total_flos": 3.492565635857121e+17,
"train_batch_size": 1,
"trial_name": null,
"trial_params": null
}