PEFT
Safetensors
3gt6-50 / trainer_state.json
windgrin's picture
Upload folder using huggingface_hub
8dd6fe0 verified
Raw
History Blame Contribute Delete
32.7 kB
{
"best_global_step": null,
"best_metric": null,
"best_model_checkpoint": null,
"epoch": 0.12982797792924375,
"eval_steps": 300,
"global_step": 50,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"epoch": 0.002596559558584875,
"grad_norm": 4.769598007202148,
"learning_rate": 5.128205128205128e-06,
"logits/chosen": -0.5944205522537231,
"logits/rejected": -0.5917393565177917,
"logps/chosen": -11.821638107299805,
"logps/rejected": -10.731678009033203,
"loss": 1.193467140197754,
"memory(GiB)": 46.82,
"nll_loss": 0.50031977891922,
"rewards/accuracies": 0.0,
"rewards/chosen": 0.0,
"rewards/margins": 0.0,
"rewards/rejected": 0.0,
"step": 1,
"train_speed(iter/s)": 0.004987
},
{
"epoch": 0.00519311911716975,
"grad_norm": 7.638933181762695,
"learning_rate": 1.0256410256410256e-05,
"logits/chosen": -0.6539207696914673,
"logits/rejected": -0.6607442498207092,
"logps/chosen": -9.628549575805664,
"logps/rejected": -15.572840690612793,
"loss": 1.1913397312164307,
"memory(GiB)": 46.82,
"nll_loss": 0.4981924891471863,
"rewards/accuracies": 0.0,
"rewards/chosen": 0.0,
"rewards/margins": 0.0,
"rewards/rejected": 0.0,
"step": 2,
"train_speed(iter/s)": 0.005274
},
{
"epoch": 0.007789678675754625,
"grad_norm": 8.172294616699219,
"learning_rate": 1.5384615384615387e-05,
"logits/chosen": -0.6215255260467529,
"logits/rejected": -0.6243188381195068,
"logps/chosen": -10.225044250488281,
"logps/rejected": -12.433060646057129,
"loss": 1.3010810613632202,
"memory(GiB)": 46.82,
"nll_loss": 0.6032217741012573,
"rewards/accuracies": 0.40625,
"rewards/chosen": -0.002520320238545537,
"rewards/margins": -0.00917358510196209,
"rewards/rejected": 0.006653264630585909,
"step": 3,
"train_speed(iter/s)": 0.005242
},
{
"epoch": 0.0103862382343395,
"grad_norm": 7.314579010009766,
"learning_rate": 2.0512820512820512e-05,
"logits/chosen": -0.6062605381011963,
"logits/rejected": -0.6072395443916321,
"logps/chosen": -9.956047058105469,
"logps/rejected": -11.640246391296387,
"loss": 1.2542610168457031,
"memory(GiB)": 46.82,
"nll_loss": 0.5589770674705505,
"rewards/accuracies": 0.46875,
"rewards/chosen": 0.007420660927891731,
"rewards/margins": -0.004003261215984821,
"rewards/rejected": 0.011423922143876553,
"step": 4,
"train_speed(iter/s)": 0.005268
},
{
"epoch": 0.012982797792924375,
"grad_norm": 3.7953975200653076,
"learning_rate": 2.564102564102564e-05,
"logits/chosen": -0.5976298451423645,
"logits/rejected": -0.5966740846633911,
"logps/chosen": -13.070164680480957,
"logps/rejected": -9.661067008972168,
"loss": 1.215171456336975,
"memory(GiB)": 46.82,
"nll_loss": 0.5106430649757385,
"rewards/accuracies": 0.375,
"rewards/chosen": 0.00016488437540829182,
"rewards/margins": -0.020555444061756134,
"rewards/rejected": 0.02072032354772091,
"step": 5,
"train_speed(iter/s)": 0.00529
},
{
"epoch": 0.01557935735150925,
"grad_norm": 7.202587604522705,
"learning_rate": 3.0769230769230774e-05,
"logits/chosen": -0.6029255390167236,
"logits/rejected": -0.6082680225372314,
"logps/chosen": -6.68419075012207,
"logps/rejected": -14.836040496826172,
"loss": 1.1022435426712036,
"memory(GiB)": 46.82,
"nll_loss": 0.4213921129703522,
"rewards/accuracies": 0.59375,
"rewards/chosen": 0.05949082225561142,
"rewards/margins": 0.03669985011219978,
"rewards/rejected": 0.02279096469283104,
"step": 6,
"train_speed(iter/s)": 0.00532
},
{
"epoch": 0.018175916910094125,
"grad_norm": 4.17504358291626,
"learning_rate": 3.58974358974359e-05,
"logits/chosen": -0.5737150311470032,
"logits/rejected": -0.5751169919967651,
"logps/chosen": -10.05550479888916,
"logps/rejected": -10.229061126708984,
"loss": 1.1968086957931519,
"memory(GiB)": 46.82,
"nll_loss": 0.451814740896225,
"rewards/accuracies": 0.40625,
"rewards/chosen": 0.018731240183115005,
"rewards/margins": -0.06073049083352089,
"rewards/rejected": 0.0794617310166359,
"step": 7,
"train_speed(iter/s)": 0.005319
},
{
"epoch": 0.020772476468679,
"grad_norm": 4.966729164123535,
"learning_rate": 4.1025641025641023e-05,
"logits/chosen": -0.6149957180023193,
"logits/rejected": -0.619285523891449,
"logps/chosen": -10.129886627197266,
"logps/rejected": -14.14559268951416,
"loss": 1.1496262550354004,
"memory(GiB)": 46.82,
"nll_loss": 0.45597678422927856,
"rewards/accuracies": 0.5,
"rewards/chosen": -0.048677604645490646,
"rewards/margins": 0.07307372987270355,
"rewards/rejected": -0.1217513307929039,
"step": 8,
"train_speed(iter/s)": 0.005322
},
{
"epoch": 0.023369036027263874,
"grad_norm": 4.258759021759033,
"learning_rate": 4.615384615384616e-05,
"logits/chosen": -0.6464206576347351,
"logits/rejected": -0.649814248085022,
"logps/chosen": -6.2765960693359375,
"logps/rejected": -14.259992599487305,
"loss": 0.9683928489685059,
"memory(GiB)": 46.82,
"nll_loss": 0.27603328227996826,
"rewards/accuracies": 0.59375,
"rewards/chosen": -0.028385277837514877,
"rewards/margins": 0.1275366246700287,
"rewards/rejected": -0.15592190623283386,
"step": 9,
"train_speed(iter/s)": 0.005346
},
{
"epoch": 0.02596559558584875,
"grad_norm": 3.5765655040740967,
"learning_rate": 5.128205128205128e-05,
"logits/chosen": -0.5905835628509521,
"logits/rejected": -0.5969584584236145,
"logps/chosen": -14.795049667358398,
"logps/rejected": -15.656811714172363,
"loss": 1.238275408744812,
"memory(GiB)": 46.82,
"nll_loss": 0.5923190116882324,
"rewards/accuracies": 0.5625,
"rewards/chosen": -0.012541369535028934,
"rewards/margins": 0.1883796602487564,
"rewards/rejected": -0.20092105865478516,
"step": 10,
"train_speed(iter/s)": 0.005347
},
{
"epoch": 0.028562155144433627,
"grad_norm": 5.3241682052612305,
"learning_rate": 5.6410256410256414e-05,
"logits/chosen": -0.5469571948051453,
"logits/rejected": -0.5478999614715576,
"logps/chosen": -11.43381118774414,
"logps/rejected": -13.521588325500488,
"loss": 1.2181414365768433,
"memory(GiB)": 46.82,
"nll_loss": 0.4799095690250397,
"rewards/accuracies": 0.5,
"rewards/chosen": -0.11080781370401382,
"rewards/margins": -0.000970199704170227,
"rewards/rejected": -0.109837606549263,
"step": 11,
"train_speed(iter/s)": 0.005357
},
{
"epoch": 0.0311587147030185,
"grad_norm": 3.739349126815796,
"learning_rate": 6.153846153846155e-05,
"logits/chosen": -0.5663439631462097,
"logits/rejected": -0.5685043931007385,
"logps/chosen": -9.113786697387695,
"logps/rejected": -12.898387908935547,
"loss": 1.1865863800048828,
"memory(GiB)": 46.82,
"nll_loss": 0.5080631971359253,
"rewards/accuracies": 0.59375,
"rewards/chosen": 0.07351399958133698,
"rewards/margins": 0.09553620219230652,
"rewards/rejected": -0.022022202610969543,
"step": 12,
"train_speed(iter/s)": 0.00536
},
{
"epoch": 0.03375527426160337,
"grad_norm": 2.732536792755127,
"learning_rate": 6.666666666666667e-05,
"logits/chosen": -0.6258959770202637,
"logits/rejected": -0.628243088722229,
"logps/chosen": -11.908061027526855,
"logps/rejected": -14.742002487182617,
"loss": 1.0720946788787842,
"memory(GiB)": 46.82,
"nll_loss": 0.44474831223487854,
"rewards/accuracies": 0.65625,
"rewards/chosen": 0.0872192531824112,
"rewards/margins": 0.16859112679958344,
"rewards/rejected": -0.08137187361717224,
"step": 13,
"train_speed(iter/s)": 0.005365
},
{
"epoch": 0.03635183382018825,
"grad_norm": 2.286402702331543,
"learning_rate": 7.17948717948718e-05,
"logits/chosen": -0.5518996119499207,
"logits/rejected": -0.5536460280418396,
"logps/chosen": -7.985256195068359,
"logps/rejected": -9.997514724731445,
"loss": 1.0465917587280273,
"memory(GiB)": 46.82,
"nll_loss": 0.37517642974853516,
"rewards/accuracies": 0.5625,
"rewards/chosen": 0.09782104939222336,
"rewards/margins": 0.08964069932699203,
"rewards/rejected": 0.008180351927876472,
"step": 14,
"train_speed(iter/s)": 0.005362
},
{
"epoch": 0.03894839337877313,
"grad_norm": 2.8793153762817383,
"learning_rate": 7.692307692307693e-05,
"logits/chosen": -0.5976672172546387,
"logits/rejected": -0.5990516543388367,
"logps/chosen": -11.681562423706055,
"logps/rejected": -15.269111633300781,
"loss": 1.0413833856582642,
"memory(GiB)": 46.82,
"nll_loss": 0.44159939885139465,
"rewards/accuracies": 0.6875,
"rewards/chosen": 0.18112002313137054,
"rewards/margins": 0.246211975812912,
"rewards/rejected": -0.06509192287921906,
"step": 15,
"train_speed(iter/s)": 0.005369
},
{
"epoch": 0.041544952937358,
"grad_norm": 3.362415313720703,
"learning_rate": 8.205128205128205e-05,
"logits/chosen": -0.6091838479042053,
"logits/rejected": -0.6097983717918396,
"logps/chosen": -6.9782915115356445,
"logps/rejected": -9.985608100891113,
"loss": 1.0336495637893677,
"memory(GiB)": 46.82,
"nll_loss": 0.3420756161212921,
"rewards/accuracies": 0.5,
"rewards/chosen": 0.05590391904115677,
"rewards/margins": 0.03598181903362274,
"rewards/rejected": 0.019922103732824326,
"step": 16,
"train_speed(iter/s)": 0.005368
},
{
"epoch": 0.04414151249594288,
"grad_norm": 2.314833641052246,
"learning_rate": 8.717948717948718e-05,
"logits/chosen": -0.6001038551330566,
"logits/rejected": -0.6009984612464905,
"logps/chosen": -8.711943626403809,
"logps/rejected": -8.347241401672363,
"loss": 1.0018643140792847,
"memory(GiB)": 46.82,
"nll_loss": 0.3586280345916748,
"rewards/accuracies": 0.53125,
"rewards/chosen": 0.17141370475292206,
"rewards/margins": 0.15122823417186737,
"rewards/rejected": 0.020185478031635284,
"step": 17,
"train_speed(iter/s)": 0.005365
},
{
"epoch": 0.04673807205452775,
"grad_norm": 2.6080470085144043,
"learning_rate": 9.230769230769232e-05,
"logits/chosen": -0.6079075932502747,
"logits/rejected": -0.6091002225875854,
"logps/chosen": -9.866250991821289,
"logps/rejected": -9.885502815246582,
"loss": 1.0599387884140015,
"memory(GiB)": 46.82,
"nll_loss": 0.3953135013580322,
"rewards/accuracies": 0.625,
"rewards/chosen": 0.1653863787651062,
"rewards/margins": 0.13114988803863525,
"rewards/rejected": 0.03423647955060005,
"step": 18,
"train_speed(iter/s)": 0.005363
},
{
"epoch": 0.04933463161311263,
"grad_norm": 2.5750620365142822,
"learning_rate": 9.743589743589744e-05,
"logits/chosen": -0.5754107236862183,
"logits/rejected": -0.5755229592323303,
"logps/chosen": -9.663117408752441,
"logps/rejected": -14.233282089233398,
"loss": 0.9537867307662964,
"memory(GiB)": 46.82,
"nll_loss": 0.35284289717674255,
"rewards/accuracies": 0.6875,
"rewards/chosen": 0.12623246014118195,
"rewards/margins": 0.24378177523612976,
"rewards/rejected": -0.11754930019378662,
"step": 19,
"train_speed(iter/s)": 0.00537
},
{
"epoch": 0.0519311911716975,
"grad_norm": 4.289522171020508,
"learning_rate": 0.00010256410256410256,
"logits/chosen": -0.5981144905090332,
"logits/rejected": -0.6002673506736755,
"logps/chosen": -8.273541450500488,
"logps/rejected": -12.811166763305664,
"loss": 1.422603964805603,
"memory(GiB)": 46.82,
"nll_loss": 0.8183298707008362,
"rewards/accuracies": 0.65625,
"rewards/chosen": 0.21172407269477844,
"rewards/margins": 0.2575765550136566,
"rewards/rejected": -0.04585248976945877,
"step": 20,
"train_speed(iter/s)": 0.005365
},
{
"epoch": 0.054527750730282376,
"grad_norm": 2.396873712539673,
"learning_rate": 0.0001076923076923077,
"logits/chosen": -0.5655781030654907,
"logits/rejected": -0.5672769546508789,
"logps/chosen": -7.642134189605713,
"logps/rejected": -16.37198257446289,
"loss": 0.8944156765937805,
"memory(GiB)": 46.82,
"nll_loss": 0.28976452350616455,
"rewards/accuracies": 0.6875,
"rewards/chosen": 0.2191261202096939,
"rewards/margins": 0.2641218602657318,
"rewards/rejected": -0.04499572888016701,
"step": 21,
"train_speed(iter/s)": 0.005364
},
{
"epoch": 0.057124310288867254,
"grad_norm": 3.0281121730804443,
"learning_rate": 0.00011282051282051283,
"logits/chosen": -0.5596702694892883,
"logits/rejected": -0.5609368681907654,
"logps/chosen": -7.446313381195068,
"logps/rejected": -12.651912689208984,
"loss": 0.9526722431182861,
"memory(GiB)": 46.82,
"nll_loss": 0.33721715211868286,
"rewards/accuracies": 0.75,
"rewards/chosen": 0.15709233283996582,
"rewards/margins": 0.2245473712682724,
"rewards/rejected": -0.06745504587888718,
"step": 22,
"train_speed(iter/s)": 0.005362
},
{
"epoch": 0.059720869847452125,
"grad_norm": 2.6955020427703857,
"learning_rate": 0.00011794871794871796,
"logits/chosen": -0.5400959849357605,
"logits/rejected": -0.5422949194908142,
"logps/chosen": -6.002541542053223,
"logps/rejected": -12.28770637512207,
"loss": 0.9044801592826843,
"memory(GiB)": 46.82,
"nll_loss": 0.2814594805240631,
"rewards/accuracies": 0.6875,
"rewards/chosen": 0.11246027797460556,
"rewards/margins": 0.21622154116630554,
"rewards/rejected": -0.10376127809286118,
"step": 23,
"train_speed(iter/s)": 0.005363
},
{
"epoch": 0.062317429406037,
"grad_norm": 3.1954290866851807,
"learning_rate": 0.0001230769230769231,
"logits/chosen": -0.5763551592826843,
"logits/rejected": -0.5829795598983765,
"logps/chosen": -8.22636890411377,
"logps/rejected": -12.94092845916748,
"loss": 0.9596253037452698,
"memory(GiB)": 46.82,
"nll_loss": 0.3679075837135315,
"rewards/accuracies": 0.75,
"rewards/chosen": 0.17844173312187195,
"rewards/margins": 0.2646990418434143,
"rewards/rejected": -0.08625732362270355,
"step": 24,
"train_speed(iter/s)": 0.005367
},
{
"epoch": 0.06491398896462187,
"grad_norm": 3.440917730331421,
"learning_rate": 0.00012820512820512823,
"logits/chosen": -0.5423401594161987,
"logits/rejected": -0.5454680919647217,
"logps/chosen": -6.751742362976074,
"logps/rejected": -14.677633285522461,
"loss": 0.8222842216491699,
"memory(GiB)": 46.82,
"nll_loss": 0.2530384063720703,
"rewards/accuracies": 0.6875,
"rewards/chosen": 0.20278047025203705,
"rewards/margins": 0.37300848960876465,
"rewards/rejected": -0.1702280342578888,
"step": 25,
"train_speed(iter/s)": 0.005363
},
{
"epoch": 0.06751054852320675,
"grad_norm": 7.046718120574951,
"learning_rate": 0.00013333333333333334,
"logits/chosen": -0.531994640827179,
"logits/rejected": -0.5324733257293701,
"logps/chosen": -7.691443920135498,
"logps/rejected": -12.912195205688477,
"loss": 0.8851491212844849,
"memory(GiB)": 46.82,
"nll_loss": 0.2668984532356262,
"rewards/accuracies": 0.65625,
"rewards/chosen": 0.03996456041932106,
"rewards/margins": 0.30043962597846985,
"rewards/rejected": -0.2604750692844391,
"step": 26,
"train_speed(iter/s)": 0.005354
},
{
"epoch": 0.07010710808179163,
"grad_norm": 3.7837774753570557,
"learning_rate": 0.00013846153846153847,
"logits/chosen": -0.5356835722923279,
"logits/rejected": -0.535167932510376,
"logps/chosen": -7.836236476898193,
"logps/rejected": -12.5257568359375,
"loss": 0.9785585999488831,
"memory(GiB)": 46.82,
"nll_loss": 0.39958691596984863,
"rewards/accuracies": 0.625,
"rewards/chosen": 0.11726226657629013,
"rewards/margins": 0.30467987060546875,
"rewards/rejected": -0.18741759657859802,
"step": 27,
"train_speed(iter/s)": 0.005353
},
{
"epoch": 0.0727036676403765,
"grad_norm": 2.986128568649292,
"learning_rate": 0.0001435897435897436,
"logits/chosen": -0.5374022126197815,
"logits/rejected": -0.5330510139465332,
"logps/chosen": -10.774028778076172,
"logps/rejected": -10.21718692779541,
"loss": 1.0210673809051514,
"memory(GiB)": 46.82,
"nll_loss": 0.44256913661956787,
"rewards/accuracies": 0.78125,
"rewards/chosen": 0.08123424649238586,
"rewards/margins": 0.32150229811668396,
"rewards/rejected": -0.2402680516242981,
"step": 28,
"train_speed(iter/s)": 0.00536
},
{
"epoch": 0.07530022719896137,
"grad_norm": 8.227151870727539,
"learning_rate": 0.00014871794871794872,
"logits/chosen": -0.555951714515686,
"logits/rejected": -0.5587239265441895,
"logps/chosen": -7.656264781951904,
"logps/rejected": -16.2135066986084,
"loss": 1.024498701095581,
"memory(GiB)": 46.82,
"nll_loss": 0.467337429523468,
"rewards/accuracies": 0.71875,
"rewards/chosen": 0.1679726243019104,
"rewards/margins": 0.43920189142227173,
"rewards/rejected": -0.2712292969226837,
"step": 29,
"train_speed(iter/s)": 0.005367
},
{
"epoch": 0.07789678675754626,
"grad_norm": 3.866678476333618,
"learning_rate": 0.00015384615384615385,
"logits/chosen": -0.5329037308692932,
"logits/rejected": -0.5308660864830017,
"logps/chosen": -13.327455520629883,
"logps/rejected": -12.309192657470703,
"loss": 1.1753352880477905,
"memory(GiB)": 46.82,
"nll_loss": 0.5743139386177063,
"rewards/accuracies": 0.65625,
"rewards/chosen": 0.10232796519994736,
"rewards/margins": 0.27346518635749817,
"rewards/rejected": -0.1711372286081314,
"step": 30,
"train_speed(iter/s)": 0.00537
},
{
"epoch": 0.08049334631613113,
"grad_norm": 2.7835240364074707,
"learning_rate": 0.00015897435897435896,
"logits/chosen": -0.5286478996276855,
"logits/rejected": -0.5297562479972839,
"logps/chosen": -8.105016708374023,
"logps/rejected": -18.577655792236328,
"loss": 0.8083048462867737,
"memory(GiB)": 46.82,
"nll_loss": 0.3598409593105316,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.3429361879825592,
"rewards/margins": 0.6762320399284363,
"rewards/rejected": -0.3332958221435547,
"step": 31,
"train_speed(iter/s)": 0.005368
},
{
"epoch": 0.083089905874716,
"grad_norm": 2.621320962905884,
"learning_rate": 0.0001641025641025641,
"logits/chosen": -0.5535257458686829,
"logits/rejected": -0.5577558279037476,
"logps/chosen": -7.381773948669434,
"logps/rejected": -20.8293514251709,
"loss": 0.7857053279876709,
"memory(GiB)": 46.82,
"nll_loss": 0.3121376037597656,
"rewards/accuracies": 0.84375,
"rewards/chosen": 0.11771110445261002,
"rewards/margins": 0.6395547389984131,
"rewards/rejected": -0.5218436121940613,
"step": 32,
"train_speed(iter/s)": 0.005373
},
{
"epoch": 0.08568646543330087,
"grad_norm": 5.273679256439209,
"learning_rate": 0.00016923076923076923,
"logits/chosen": -0.5348193645477295,
"logits/rejected": -0.5335426330566406,
"logps/chosen": -16.012008666992188,
"logps/rejected": -16.090946197509766,
"loss": 1.150058388710022,
"memory(GiB)": 46.82,
"nll_loss": 0.5311561822891235,
"rewards/accuracies": 0.6875,
"rewards/chosen": -0.09080329537391663,
"rewards/margins": 0.3698381185531616,
"rewards/rejected": -0.46064135432243347,
"step": 33,
"train_speed(iter/s)": 0.005375
},
{
"epoch": 0.08828302499188576,
"grad_norm": 3.7380588054656982,
"learning_rate": 0.00017435897435897436,
"logits/chosen": -0.526316225528717,
"logits/rejected": -0.5241590738296509,
"logps/chosen": -13.188718795776367,
"logps/rejected": -18.877933502197266,
"loss": 0.8901183009147644,
"memory(GiB)": 46.82,
"nll_loss": 0.4010193347930908,
"rewards/accuracies": 0.78125,
"rewards/chosen": 0.13551224768161774,
"rewards/margins": 0.7849555015563965,
"rewards/rejected": -0.6494433283805847,
"step": 34,
"train_speed(iter/s)": 0.005376
},
{
"epoch": 0.09087958455047063,
"grad_norm": 3.2903590202331543,
"learning_rate": 0.0001794871794871795,
"logits/chosen": -0.5694751739501953,
"logits/rejected": -0.5714199542999268,
"logps/chosen": -13.836735725402832,
"logps/rejected": -17.397571563720703,
"loss": 0.9489783644676208,
"memory(GiB)": 46.82,
"nll_loss": 0.4817684292793274,
"rewards/accuracies": 0.84375,
"rewards/chosen": 0.17933052778244019,
"rewards/margins": 0.7199034690856934,
"rewards/rejected": -0.5405729413032532,
"step": 35,
"train_speed(iter/s)": 0.005374
},
{
"epoch": 0.0934761441090555,
"grad_norm": 7.443658351898193,
"learning_rate": 0.00018461538461538463,
"logits/chosen": -0.5579850077629089,
"logits/rejected": -0.5598161220550537,
"logps/chosen": -9.724953651428223,
"logps/rejected": -19.001192092895508,
"loss": 1.025741696357727,
"memory(GiB)": 46.82,
"nll_loss": 0.4933169484138489,
"rewards/accuracies": 0.8125,
"rewards/chosen": 0.09439410269260406,
"rewards/margins": 0.531223714351654,
"rewards/rejected": -0.4368295967578888,
"step": 36,
"train_speed(iter/s)": 0.005367
},
{
"epoch": 0.09607270366764038,
"grad_norm": 4.221776962280273,
"learning_rate": 0.00018974358974358974,
"logits/chosen": -0.5673465728759766,
"logits/rejected": -0.568681001663208,
"logps/chosen": -7.996758937835693,
"logps/rejected": -16.828737258911133,
"loss": 0.768932044506073,
"memory(GiB)": 46.82,
"nll_loss": 0.3632465600967407,
"rewards/accuracies": 0.90625,
"rewards/chosen": 0.20153376460075378,
"rewards/margins": 0.8081123232841492,
"rewards/rejected": -0.6065785884857178,
"step": 37,
"train_speed(iter/s)": 0.00536
},
{
"epoch": 0.09866926322622525,
"grad_norm": 4.438755989074707,
"learning_rate": 0.00019487179487179487,
"logits/chosen": -0.5432108640670776,
"logits/rejected": -0.5440645217895508,
"logps/chosen": -11.19113826751709,
"logps/rejected": -16.801233291625977,
"loss": 0.9643179178237915,
"memory(GiB)": 46.82,
"nll_loss": 0.5330875515937805,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.212477445602417,
"rewards/margins": 0.7622401714324951,
"rewards/rejected": -0.5497627258300781,
"step": 38,
"train_speed(iter/s)": 0.005362
},
{
"epoch": 0.10126582278481013,
"grad_norm": 3.844766855239868,
"learning_rate": 0.0002,
"logits/chosen": -0.5104550719261169,
"logits/rejected": -0.5119606852531433,
"logps/chosen": -11.040297508239746,
"logps/rejected": -18.91219711303711,
"loss": 0.9704711437225342,
"memory(GiB)": 46.82,
"nll_loss": 0.5230136513710022,
"rewards/accuracies": 0.84375,
"rewards/chosen": 0.14157143235206604,
"rewards/margins": 0.7000695466995239,
"rewards/rejected": -0.5584981441497803,
"step": 39,
"train_speed(iter/s)": 0.005358
},
{
"epoch": 0.103862382343395,
"grad_norm": 5.2911272048950195,
"learning_rate": 0.00019999907650547008,
"logits/chosen": -0.563255250453949,
"logits/rejected": -0.5627263784408569,
"logps/chosen": -8.962218284606934,
"logps/rejected": -20.214658737182617,
"loss": 0.9730861783027649,
"memory(GiB)": 46.82,
"nll_loss": 0.4494069516658783,
"rewards/accuracies": 0.71875,
"rewards/chosen": 0.03735905885696411,
"rewards/margins": 0.7039426565170288,
"rewards/rejected": -0.6665836572647095,
"step": 40,
"train_speed(iter/s)": 0.00536
},
{
"epoch": 0.10645894190197988,
"grad_norm": 3.2932822704315186,
"learning_rate": 0.0001999963060389371,
"logits/chosen": -0.49407708644866943,
"logits/rejected": -0.4951040744781494,
"logps/chosen": -4.336781978607178,
"logps/rejected": -23.352622985839844,
"loss": 0.5769761800765991,
"memory(GiB)": 46.82,
"nll_loss": 0.21373578906059265,
"rewards/accuracies": 0.84375,
"rewards/chosen": 0.2602457106113434,
"rewards/margins": 1.0540037155151367,
"rewards/rejected": -0.7937580347061157,
"step": 41,
"train_speed(iter/s)": 0.005359
},
{
"epoch": 0.10905550146056475,
"grad_norm": 3.550082206726074,
"learning_rate": 0.00019999168865157137,
"logits/chosen": -0.5316025018692017,
"logits/rejected": -0.5340486764907837,
"logps/chosen": -8.441543579101562,
"logps/rejected": -18.124588012695312,
"loss": 0.9663518071174622,
"memory(GiB)": 46.82,
"nll_loss": 0.47912853956222534,
"rewards/accuracies": 0.78125,
"rewards/chosen": 0.14834752678871155,
"rewards/margins": 0.7632903456687927,
"rewards/rejected": -0.6149427890777588,
"step": 42,
"train_speed(iter/s)": 0.005356
},
{
"epoch": 0.11165206101914962,
"grad_norm": 3.8798763751983643,
"learning_rate": 0.0001999852244286554,
"logits/chosen": -0.5125827193260193,
"logits/rejected": -0.5118388533592224,
"logps/chosen": -8.259347915649414,
"logps/rejected": -18.246912002563477,
"loss": 0.8706857562065125,
"memory(GiB)": 46.82,
"nll_loss": 0.3688449263572693,
"rewards/accuracies": 0.78125,
"rewards/chosen": 0.1189112439751625,
"rewards/margins": 0.5402826070785522,
"rewards/rejected": -0.4213714003562927,
"step": 43,
"train_speed(iter/s)": 0.005355
},
{
"epoch": 0.11424862057773451,
"grad_norm": 5.702610015869141,
"learning_rate": 0.0001999769134895828,
"logits/chosen": -0.5676945447921753,
"logits/rejected": -0.5712423324584961,
"logps/chosen": -7.507511138916016,
"logps/rejected": -17.306344985961914,
"loss": 0.9447178840637207,
"memory(GiB)": 46.82,
"nll_loss": 0.5068771839141846,
"rewards/accuracies": 0.84375,
"rewards/chosen": 0.1572760045528412,
"rewards/margins": 0.8183934688568115,
"rewards/rejected": -0.6611174941062927,
"step": 44,
"train_speed(iter/s)": 0.005357
},
{
"epoch": 0.11684518013631938,
"grad_norm": 5.846091270446777,
"learning_rate": 0.0001999667559878556,
"logits/chosen": -0.5530126094818115,
"logits/rejected": -0.5544271469116211,
"logps/chosen": -9.34422779083252,
"logps/rejected": -21.99274444580078,
"loss": 1.0033745765686035,
"memory(GiB)": 46.82,
"nll_loss": 0.5510709285736084,
"rewards/accuracies": 0.75,
"rewards/chosen": 0.06781984120607376,
"rewards/margins": 0.8660807609558105,
"rewards/rejected": -0.7982609868049622,
"step": 45,
"train_speed(iter/s)": 0.005358
},
{
"epoch": 0.11944173969490425,
"grad_norm": 3.4377248287200928,
"learning_rate": 0.00019995475211108185,
"logits/chosen": -0.5516988039016724,
"logits/rejected": -0.5513719916343689,
"logps/chosen": -9.321004867553711,
"logps/rejected": -18.94799041748047,
"loss": 0.838591992855072,
"memory(GiB)": 46.82,
"nll_loss": 0.44976377487182617,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.15304125845432281,
"rewards/margins": 0.9354310631752014,
"rewards/rejected": -0.782389760017395,
"step": 46,
"train_speed(iter/s)": 0.00536
},
{
"epoch": 0.12203829925348912,
"grad_norm": 3.021584987640381,
"learning_rate": 0.00019994090208097176,
"logits/chosen": -0.5453197956085205,
"logits/rejected": -0.5457130670547485,
"logps/chosen": -7.513545036315918,
"logps/rejected": -19.929990768432617,
"loss": 0.7878033518791199,
"memory(GiB)": 46.82,
"nll_loss": 0.2906043827533722,
"rewards/accuracies": 0.71875,
"rewards/chosen": 0.04635176807641983,
"rewards/margins": 0.8055768609046936,
"rewards/rejected": -0.759225070476532,
"step": 47,
"train_speed(iter/s)": 0.005359
},
{
"epoch": 0.124634858812074,
"grad_norm": 2.4632484912872314,
"learning_rate": 0.00019992520615333393,
"logits/chosen": -0.5288453102111816,
"logits/rejected": -0.5294773578643799,
"logps/chosen": -4.316083908081055,
"logps/rejected": -16.75088119506836,
"loss": 0.6369743347167969,
"memory(GiB)": 46.82,
"nll_loss": 0.19174346327781677,
"rewards/accuracies": 0.8125,
"rewards/chosen": 0.1844159960746765,
"rewards/margins": 0.7728991508483887,
"rewards/rejected": -0.5884830951690674,
"step": 48,
"train_speed(iter/s)": 0.005357
},
{
"epoch": 0.12723141837065888,
"grad_norm": 2.225041627883911,
"learning_rate": 0.00019990766461807039,
"logits/chosen": -0.5786827802658081,
"logits/rejected": -0.5775803923606873,
"logps/chosen": -7.1691179275512695,
"logps/rejected": -19.747949600219727,
"loss": 0.611931562423706,
"memory(GiB)": 46.82,
"nll_loss": 0.26027703285217285,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.32533061504364014,
"rewards/margins": 1.0796949863433838,
"rewards/rejected": -0.7543643712997437,
"step": 49,
"train_speed(iter/s)": 0.005358
},
{
"epoch": 0.12982797792924375,
"grad_norm": 3.631110429763794,
"learning_rate": 0.00019988827779917137,
"logits/chosen": -0.5347975492477417,
"logits/rejected": -0.5404946804046631,
"logps/chosen": -8.115504264831543,
"logps/rejected": -22.913742065429688,
"loss": 0.8714032769203186,
"memory(GiB)": 46.82,
"nll_loss": 0.4530017375946045,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.22861376404762268,
"rewards/margins": 0.9870915412902832,
"rewards/rejected": -0.7584777474403381,
"step": 50,
"train_speed(iter/s)": 0.00536
}
],
"logging_steps": 1,
"max_steps": 770,
"num_input_tokens_seen": 0,
"num_train_epochs": 2,
"save_steps": 50,
"stateful_callbacks": {
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": true,
"should_training_stop": false
},
"attributes": {}
}
},
"total_flos": 3.5719756566337946e+17,
"train_batch_size": 1,
"trial_name": null,
"trial_params": null
}