PEFT
Safetensors
2gt6-150 / trainer_state.json
windgrin's picture
Upload folder using huggingface_hub
7401fe7 verified
Raw
History Blame Contribute Delete
96.5 kB
{
"best_global_step": null,
"best_metric": null,
"best_model_checkpoint": null,
"epoch": 0.4287628405538187,
"eval_steps": 300,
"global_step": 150,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"epoch": 0.002858418937025458,
"grad_norm": 10.349462509155273,
"learning_rate": 3.7735849056603773e-06,
"logits/chosen": -0.6422490477561951,
"logits/rejected": -0.6447486877441406,
"logps/chosen": -6.999429225921631,
"logps/rejected": -13.433603286743164,
"loss": 1.3778549432754517,
"memory(GiB)": 46.73,
"nll_loss": 0.6847077012062073,
"rewards/accuracies": 0.0,
"rewards/chosen": 0.0,
"rewards/margins": 0.0,
"rewards/rejected": 0.0,
"step": 1,
"train_speed(iter/s)": 0.005273
},
{
"epoch": 0.005716837874050916,
"grad_norm": 11.263213157653809,
"learning_rate": 7.547169811320755e-06,
"logits/chosen": -0.6429960131645203,
"logits/rejected": -0.6454926133155823,
"logps/chosen": -9.604641914367676,
"logps/rejected": -13.53369140625,
"loss": 1.4975696802139282,
"memory(GiB)": 46.73,
"nll_loss": 0.8044224381446838,
"rewards/accuracies": 0.0,
"rewards/chosen": 0.0,
"rewards/margins": 0.0,
"rewards/rejected": 0.0,
"step": 2,
"train_speed(iter/s)": 0.005366
},
{
"epoch": 0.008575256811076373,
"grad_norm": 9.09404182434082,
"learning_rate": 1.1320754716981132e-05,
"logits/chosen": -0.6486532092094421,
"logits/rejected": -0.6493248343467712,
"logps/chosen": -7.69912576675415,
"logps/rejected": -17.816326141357422,
"loss": 1.2593896389007568,
"memory(GiB)": 46.73,
"nll_loss": 0.5679630637168884,
"rewards/accuracies": 0.625,
"rewards/chosen": 0.0031128099653869867,
"rewards/margins": 0.0035441224463284016,
"rewards/rejected": -0.00043131227721460164,
"step": 3,
"train_speed(iter/s)": 0.005419
},
{
"epoch": 0.011433675748101831,
"grad_norm": 13.314420700073242,
"learning_rate": 1.509433962264151e-05,
"logits/chosen": -0.6668453812599182,
"logits/rejected": -0.6718658804893494,
"logps/chosen": -6.061755180358887,
"logps/rejected": -13.643918991088867,
"loss": 1.4406771659851074,
"memory(GiB)": 46.73,
"nll_loss": 0.7477570176124573,
"rewards/accuracies": 0.53125,
"rewards/chosen": 0.008774133399128914,
"rewards/margins": 0.0006008772179484367,
"rewards/rejected": 0.008173256181180477,
"step": 4,
"train_speed(iter/s)": 0.005446
},
{
"epoch": 0.014292094685127288,
"grad_norm": 12.340804100036621,
"learning_rate": 1.8867924528301888e-05,
"logits/chosen": -0.6321276426315308,
"logits/rejected": -0.6321861743927002,
"logps/chosen": -11.234216690063477,
"logps/rejected": -11.82645034790039,
"loss": 1.3690662384033203,
"memory(GiB)": 46.73,
"nll_loss": 0.6870464086532593,
"rewards/accuracies": 0.6875,
"rewards/chosen": 0.032103873789310455,
"rewards/margins": 0.022960105910897255,
"rewards/rejected": 0.0091437678784132,
"step": 5,
"train_speed(iter/s)": 0.005444
},
{
"epoch": 0.017150513622152745,
"grad_norm": 13.995262145996094,
"learning_rate": 2.2641509433962265e-05,
"logits/chosen": -0.6530164480209351,
"logits/rejected": -0.6550691723823547,
"logps/chosen": -8.742744445800781,
"logps/rejected": -12.622247695922852,
"loss": 1.3672001361846924,
"memory(GiB)": 46.73,
"nll_loss": 0.702350378036499,
"rewards/accuracies": 0.65625,
"rewards/chosen": 0.0800265222787857,
"rewards/margins": 0.06047351285815239,
"rewards/rejected": 0.019553007557988167,
"step": 6,
"train_speed(iter/s)": 0.005427
},
{
"epoch": 0.020008932559178204,
"grad_norm": 10.019857406616211,
"learning_rate": 2.641509433962264e-05,
"logits/chosen": -0.6211694478988647,
"logits/rejected": -0.6214967370033264,
"logps/chosen": -6.935382843017578,
"logps/rejected": -13.613279342651367,
"loss": 1.2412631511688232,
"memory(GiB)": 46.73,
"nll_loss": 0.5651571154594421,
"rewards/accuracies": 0.59375,
"rewards/chosen": 0.13799861073493958,
"rewards/margins": 0.053141627460718155,
"rewards/rejected": 0.08485697209835052,
"step": 7,
"train_speed(iter/s)": 0.005441
},
{
"epoch": 0.022867351496203663,
"grad_norm": 6.375326633453369,
"learning_rate": 3.018867924528302e-05,
"logits/chosen": -0.6666778326034546,
"logits/rejected": -0.6678147315979004,
"logps/chosen": -8.114872932434082,
"logps/rejected": -13.392560958862305,
"loss": 1.1162137985229492,
"memory(GiB)": 46.73,
"nll_loss": 0.4446101784706116,
"rewards/accuracies": 0.59375,
"rewards/chosen": 0.20063960552215576,
"rewards/margins": 0.09723334014415741,
"rewards/rejected": 0.10340625792741776,
"step": 8,
"train_speed(iter/s)": 0.005426
},
{
"epoch": 0.02572577043322912,
"grad_norm": 4.046472549438477,
"learning_rate": 3.39622641509434e-05,
"logits/chosen": -0.5842044949531555,
"logits/rejected": -0.5892153382301331,
"logps/chosen": -13.877073287963867,
"logps/rejected": -14.116576194763184,
"loss": 1.259205937385559,
"memory(GiB)": 46.73,
"nll_loss": 0.5605449676513672,
"rewards/accuracies": 0.53125,
"rewards/chosen": 0.1392103135585785,
"rewards/margins": 0.09627523273229599,
"rewards/rejected": 0.0429350808262825,
"step": 9,
"train_speed(iter/s)": 0.005422
},
{
"epoch": 0.028584189370254576,
"grad_norm": 7.625533103942871,
"learning_rate": 3.7735849056603776e-05,
"logits/chosen": -0.6210353374481201,
"logits/rejected": -0.6224341988563538,
"logps/chosen": -8.32575798034668,
"logps/rejected": -11.715011596679688,
"loss": 1.2772942781448364,
"memory(GiB)": 46.73,
"nll_loss": 0.48597079515457153,
"rewards/accuracies": 0.4375,
"rewards/chosen": -0.043191827833652496,
"rewards/margins": 0.029505327343940735,
"rewards/rejected": -0.07269717007875443,
"step": 10,
"train_speed(iter/s)": 0.005438
},
{
"epoch": 0.03144260830728004,
"grad_norm": 11.961934089660645,
"learning_rate": 4.150943396226415e-05,
"logits/chosen": -0.6265634298324585,
"logits/rejected": -0.6289808750152588,
"logps/chosen": -7.129470348358154,
"logps/rejected": -11.932583808898926,
"loss": 1.447466254234314,
"memory(GiB)": 46.73,
"nll_loss": 0.6552329659461975,
"rewards/accuracies": 0.46875,
"rewards/chosen": -0.00290237320587039,
"rewards/margins": 0.06162097677588463,
"rewards/rejected": -0.0645233541727066,
"step": 11,
"train_speed(iter/s)": 0.005473
},
{
"epoch": 0.03430102724430549,
"grad_norm": 10.154479026794434,
"learning_rate": 4.528301886792453e-05,
"logits/chosen": -0.6388624906539917,
"logits/rejected": -0.639370858669281,
"logps/chosen": -9.490407943725586,
"logps/rejected": -12.88676643371582,
"loss": 1.4875458478927612,
"memory(GiB)": 46.73,
"nll_loss": 0.6468713283538818,
"rewards/accuracies": 0.4375,
"rewards/chosen": -0.10463112592697144,
"rewards/margins": -0.059477299451828,
"rewards/rejected": -0.04515381157398224,
"step": 12,
"train_speed(iter/s)": 0.005465
},
{
"epoch": 0.03715944618133095,
"grad_norm": 4.091860771179199,
"learning_rate": 4.9056603773584906e-05,
"logits/chosen": -0.6680133938789368,
"logits/rejected": -0.6711105108261108,
"logps/chosen": -5.56148099899292,
"logps/rejected": -13.865943908691406,
"loss": 1.0154482126235962,
"memory(GiB)": 46.73,
"nll_loss": 0.35444653034210205,
"rewards/accuracies": 0.65625,
"rewards/chosen": 0.12190410494804382,
"rewards/margins": 0.3293726444244385,
"rewards/rejected": -0.20746850967407227,
"step": 13,
"train_speed(iter/s)": 0.00546
},
{
"epoch": 0.04001786511835641,
"grad_norm": 3.039910316467285,
"learning_rate": 5.283018867924528e-05,
"logits/chosen": -0.6245446801185608,
"logits/rejected": -0.6280595660209656,
"logps/chosen": -7.042474269866943,
"logps/rejected": -14.88280963897705,
"loss": 0.9986085295677185,
"memory(GiB)": 46.73,
"nll_loss": 0.32772910594940186,
"rewards/accuracies": 0.59375,
"rewards/chosen": 0.08946945518255234,
"rewards/margins": 0.2548743188381195,
"rewards/rejected": -0.16540484130382538,
"step": 14,
"train_speed(iter/s)": 0.005463
},
{
"epoch": 0.042876284055381866,
"grad_norm": 2.8388617038726807,
"learning_rate": 5.660377358490566e-05,
"logits/chosen": -0.613956868648529,
"logits/rejected": -0.6150951385498047,
"logps/chosen": -5.398593902587891,
"logps/rejected": -10.984697341918945,
"loss": 0.9217166900634766,
"memory(GiB)": 46.73,
"nll_loss": 0.21436992287635803,
"rewards/accuracies": 0.65625,
"rewards/chosen": 0.2490297257900238,
"rewards/margins": 0.12685683369636536,
"rewards/rejected": 0.12217291444540024,
"step": 15,
"train_speed(iter/s)": 0.005464
},
{
"epoch": 0.045734702992407325,
"grad_norm": 3.623399257659912,
"learning_rate": 6.037735849056604e-05,
"logits/chosen": -0.5890456438064575,
"logits/rejected": -0.5907201766967773,
"logps/chosen": -7.65773868560791,
"logps/rejected": -15.24480152130127,
"loss": 1.130638837814331,
"memory(GiB)": 46.73,
"nll_loss": 0.33376482129096985,
"rewards/accuracies": 0.46875,
"rewards/chosen": 0.14319562911987305,
"rewards/margins": 0.01443251222372055,
"rewards/rejected": 0.1287631392478943,
"step": 16,
"train_speed(iter/s)": 0.00546
},
{
"epoch": 0.048593121929432784,
"grad_norm": 2.9850075244903564,
"learning_rate": 6.415094339622641e-05,
"logits/chosen": -0.5228931903839111,
"logits/rejected": -0.524716854095459,
"logps/chosen": -10.135262489318848,
"logps/rejected": -14.072588920593262,
"loss": 1.2770482301712036,
"memory(GiB)": 46.73,
"nll_loss": 0.48515522480010986,
"rewards/accuracies": 0.40625,
"rewards/chosen": 0.13618236780166626,
"rewards/margins": -0.09462341666221619,
"rewards/rejected": 0.23080575466156006,
"step": 17,
"train_speed(iter/s)": 0.005473
},
{
"epoch": 0.05145154086645824,
"grad_norm": 2.2746193408966064,
"learning_rate": 6.79245283018868e-05,
"logits/chosen": -0.5764032006263733,
"logits/rejected": -0.5762047171592712,
"logps/chosen": -11.675098419189453,
"logps/rejected": -10.994297981262207,
"loss": 1.2022521495819092,
"memory(GiB)": 46.73,
"nll_loss": 0.4671342372894287,
"rewards/accuracies": 0.46875,
"rewards/chosen": 0.1593710482120514,
"rewards/margins": -0.00844080001115799,
"rewards/rejected": 0.1678118258714676,
"step": 18,
"train_speed(iter/s)": 0.005468
},
{
"epoch": 0.0543099598034837,
"grad_norm": 2.324984312057495,
"learning_rate": 7.169811320754717e-05,
"logits/chosen": -0.567690908908844,
"logits/rejected": -0.569066047668457,
"logps/chosen": -9.0728120803833,
"logps/rejected": -12.268661499023438,
"loss": 1.1060843467712402,
"memory(GiB)": 46.73,
"nll_loss": 0.41300466656684875,
"rewards/accuracies": 0.53125,
"rewards/chosen": 0.23081830143928528,
"rewards/margins": 0.0710553377866745,
"rewards/rejected": 0.15976294875144958,
"step": 19,
"train_speed(iter/s)": 0.005463
},
{
"epoch": 0.05716837874050915,
"grad_norm": 2.0991458892822266,
"learning_rate": 7.547169811320755e-05,
"logits/chosen": -0.6091416478157043,
"logits/rejected": -0.6100034117698669,
"logps/chosen": -4.26762056350708,
"logps/rejected": -11.32187557220459,
"loss": 1.0021699666976929,
"memory(GiB)": 46.73,
"nll_loss": 0.2933175265789032,
"rewards/accuracies": 0.4375,
"rewards/chosen": 0.15655732154846191,
"rewards/margins": 0.008277412503957748,
"rewards/rejected": 0.14827993512153625,
"step": 20,
"train_speed(iter/s)": 0.005467
},
{
"epoch": 0.06002679767753461,
"grad_norm": 3.4958455562591553,
"learning_rate": 7.924528301886794e-05,
"logits/chosen": -0.571921706199646,
"logits/rejected": -0.572878360748291,
"logps/chosen": -9.612298965454102,
"logps/rejected": -12.484085083007812,
"loss": 1.1795949935913086,
"memory(GiB)": 46.73,
"nll_loss": 0.46760252118110657,
"rewards/accuracies": 0.53125,
"rewards/chosen": 0.14643912017345428,
"rewards/margins": 0.0200117826461792,
"rewards/rejected": 0.12642733752727509,
"step": 21,
"train_speed(iter/s)": 0.005467
},
{
"epoch": 0.06288521661456008,
"grad_norm": 3.175546169281006,
"learning_rate": 8.30188679245283e-05,
"logits/chosen": -0.6108006834983826,
"logits/rejected": -0.6111243367195129,
"logps/chosen": -6.207424163818359,
"logps/rejected": -7.818144798278809,
"loss": 1.1549935340881348,
"memory(GiB)": 46.73,
"nll_loss": 0.4683927893638611,
"rewards/accuracies": 0.5625,
"rewards/chosen": 0.23285990953445435,
"rewards/margins": 0.06634702533483505,
"rewards/rejected": 0.16651292145252228,
"step": 22,
"train_speed(iter/s)": 0.00547
},
{
"epoch": 0.06574363555158554,
"grad_norm": 2.4531869888305664,
"learning_rate": 8.679245283018869e-05,
"logits/chosen": -0.6012008190155029,
"logits/rejected": -0.6021928191184998,
"logps/chosen": -5.598664283752441,
"logps/rejected": -13.262667655944824,
"loss": 0.9260164499282837,
"memory(GiB)": 46.73,
"nll_loss": 0.33532270789146423,
"rewards/accuracies": 0.625,
"rewards/chosen": 0.3285560607910156,
"rewards/margins": 0.3157665431499481,
"rewards/rejected": 0.012789532542228699,
"step": 23,
"train_speed(iter/s)": 0.005467
},
{
"epoch": 0.06860205448861098,
"grad_norm": 2.328031301498413,
"learning_rate": 9.056603773584906e-05,
"logits/chosen": -0.567432165145874,
"logits/rejected": -0.5704118609428406,
"logps/chosen": -4.026985168457031,
"logps/rejected": -14.904813766479492,
"loss": 0.8984246253967285,
"memory(GiB)": 46.73,
"nll_loss": 0.26223480701446533,
"rewards/accuracies": 0.59375,
"rewards/chosen": 0.26638248562812805,
"rewards/margins": 0.22430934011936188,
"rewards/rejected": 0.042073119431734085,
"step": 24,
"train_speed(iter/s)": 0.005466
},
{
"epoch": 0.07146047342563644,
"grad_norm": 3.5119378566741943,
"learning_rate": 9.433962264150944e-05,
"logits/chosen": -0.5709348320960999,
"logits/rejected": -0.5688645243644714,
"logps/chosen": -7.716845989227295,
"logps/rejected": -7.868927955627441,
"loss": 1.113297462463379,
"memory(GiB)": 46.73,
"nll_loss": 0.3660878837108612,
"rewards/accuracies": 0.5,
"rewards/chosen": 0.2273256480693817,
"rewards/margins": -0.0022776294499635696,
"rewards/rejected": 0.22960326075553894,
"step": 25,
"train_speed(iter/s)": 0.005475
},
{
"epoch": 0.0743188923626619,
"grad_norm": 3.2336673736572266,
"learning_rate": 9.811320754716981e-05,
"logits/chosen": -0.589956521987915,
"logits/rejected": -0.587726354598999,
"logps/chosen": -10.072855949401855,
"logps/rejected": -12.857810974121094,
"loss": 1.0991942882537842,
"memory(GiB)": 46.73,
"nll_loss": 0.40110355615615845,
"rewards/accuracies": 0.5,
"rewards/chosen": 0.17576897144317627,
"rewards/margins": 0.11343260109424591,
"rewards/rejected": 0.062336355447769165,
"step": 26,
"train_speed(iter/s)": 0.005466
},
{
"epoch": 0.07717731129968736,
"grad_norm": 2.6813321113586426,
"learning_rate": 0.0001018867924528302,
"logits/chosen": -0.5832359194755554,
"logits/rejected": -0.5860565304756165,
"logps/chosen": -8.197118759155273,
"logps/rejected": -17.45244598388672,
"loss": 0.8366767764091492,
"memory(GiB)": 46.73,
"nll_loss": 0.2886262536048889,
"rewards/accuracies": 0.71875,
"rewards/chosen": 0.3297504186630249,
"rewards/margins": 0.48295390605926514,
"rewards/rejected": -0.15320347249507904,
"step": 27,
"train_speed(iter/s)": 0.00547
},
{
"epoch": 0.08003573023671282,
"grad_norm": 3.3800203800201416,
"learning_rate": 0.00010566037735849057,
"logits/chosen": -0.6005962491035461,
"logits/rejected": -0.6035608053207397,
"logps/chosen": -9.117904663085938,
"logps/rejected": -18.400161743164062,
"loss": 1.0143071413040161,
"memory(GiB)": 46.73,
"nll_loss": 0.4276316463947296,
"rewards/accuracies": 0.65625,
"rewards/chosen": 0.271901398897171,
"rewards/margins": 0.4319708049297333,
"rewards/rejected": -0.16006940603256226,
"step": 28,
"train_speed(iter/s)": 0.005468
},
{
"epoch": 0.08289414917373827,
"grad_norm": 5.461134433746338,
"learning_rate": 0.00010943396226415095,
"logits/chosen": -0.5596082210540771,
"logits/rejected": -0.5635167360305786,
"logps/chosen": -7.607837200164795,
"logps/rejected": -23.174358367919922,
"loss": 0.803045928478241,
"memory(GiB)": 46.73,
"nll_loss": 0.32165294885635376,
"rewards/accuracies": 0.78125,
"rewards/chosen": 0.3834715783596039,
"rewards/margins": 0.7214637994766235,
"rewards/rejected": -0.33799219131469727,
"step": 29,
"train_speed(iter/s)": 0.005464
},
{
"epoch": 0.08575256811076373,
"grad_norm": 3.3377506732940674,
"learning_rate": 0.00011320754716981132,
"logits/chosen": -0.6003558039665222,
"logits/rejected": -0.6016712188720703,
"logps/chosen": -7.941157817840576,
"logps/rejected": -10.564404487609863,
"loss": 1.0737202167510986,
"memory(GiB)": 46.73,
"nll_loss": 0.3314566910266876,
"rewards/accuracies": 0.59375,
"rewards/chosen": 0.1379927098751068,
"rewards/margins": 0.08670535683631897,
"rewards/rejected": 0.05128733813762665,
"step": 30,
"train_speed(iter/s)": 0.005461
},
{
"epoch": 0.08861098704778919,
"grad_norm": 3.4214563369750977,
"learning_rate": 0.0001169811320754717,
"logits/chosen": -0.5186684727668762,
"logits/rejected": -0.5189406275749207,
"logps/chosen": -6.143683910369873,
"logps/rejected": -25.88001251220703,
"loss": 0.7792238593101501,
"memory(GiB)": 46.73,
"nll_loss": 0.2514691948890686,
"rewards/accuracies": 0.71875,
"rewards/chosen": 0.2757991552352905,
"rewards/margins": 0.5156725645065308,
"rewards/rejected": -0.23987337946891785,
"step": 31,
"train_speed(iter/s)": 0.005459
},
{
"epoch": 0.09146940598481465,
"grad_norm": 4.645272731781006,
"learning_rate": 0.00012075471698113207,
"logits/chosen": -0.5988867282867432,
"logits/rejected": -0.6016397476196289,
"logps/chosen": -5.776233673095703,
"logps/rejected": -22.404544830322266,
"loss": 0.8892383575439453,
"memory(GiB)": 46.73,
"nll_loss": 0.4011368155479431,
"rewards/accuracies": 0.75,
"rewards/chosen": 0.22715790569782257,
"rewards/margins": 0.7724226713180542,
"rewards/rejected": -0.545264720916748,
"step": 32,
"train_speed(iter/s)": 0.005454
},
{
"epoch": 0.09432782492184011,
"grad_norm": 4.586422443389893,
"learning_rate": 0.00012452830188679244,
"logits/chosen": -0.5782912969589233,
"logits/rejected": -0.5768243670463562,
"logps/chosen": -10.939208984375,
"logps/rejected": -13.486640930175781,
"loss": 1.1607584953308105,
"memory(GiB)": 46.73,
"nll_loss": 0.5877886414527893,
"rewards/accuracies": 0.65625,
"rewards/chosen": 0.21317529678344727,
"rewards/margins": 0.4141784906387329,
"rewards/rejected": -0.20100319385528564,
"step": 33,
"train_speed(iter/s)": 0.005457
},
{
"epoch": 0.09718624385886557,
"grad_norm": 4.306042671203613,
"learning_rate": 0.00012830188679245283,
"logits/chosen": -0.6019578576087952,
"logits/rejected": -0.6082974076271057,
"logps/chosen": -7.5170578956604,
"logps/rejected": -24.889406204223633,
"loss": 0.9509016275405884,
"memory(GiB)": 46.73,
"nll_loss": 0.4247076213359833,
"rewards/accuracies": 0.75,
"rewards/chosen": 0.10510760545730591,
"rewards/margins": 0.8037927150726318,
"rewards/rejected": -0.6986850500106812,
"step": 34,
"train_speed(iter/s)": 0.005456
},
{
"epoch": 0.10004466279589103,
"grad_norm": 3.002274751663208,
"learning_rate": 0.0001320754716981132,
"logits/chosen": -0.6133092641830444,
"logits/rejected": -0.6127456426620483,
"logps/chosen": -8.859593391418457,
"logps/rejected": -17.02096939086914,
"loss": 0.8848217129707336,
"memory(GiB)": 46.73,
"nll_loss": 0.3480006456375122,
"rewards/accuracies": 0.71875,
"rewards/chosen": 0.25863486528396606,
"rewards/margins": 0.5611037015914917,
"rewards/rejected": -0.302468866109848,
"step": 35,
"train_speed(iter/s)": 0.005457
},
{
"epoch": 0.10290308173291648,
"grad_norm": 4.299287796020508,
"learning_rate": 0.0001358490566037736,
"logits/chosen": -0.5725032091140747,
"logits/rejected": -0.5725142359733582,
"logps/chosen": -8.371686935424805,
"logps/rejected": -17.657852172851562,
"loss": 0.8825864791870117,
"memory(GiB)": 46.73,
"nll_loss": 0.3603641390800476,
"rewards/accuracies": 0.78125,
"rewards/chosen": 0.23154468834400177,
"rewards/margins": 0.6240193843841553,
"rewards/rejected": -0.3924746811389923,
"step": 36,
"train_speed(iter/s)": 0.005457
},
{
"epoch": 0.10576150066994194,
"grad_norm": 4.354315757751465,
"learning_rate": 0.00013962264150943395,
"logits/chosen": -0.5943324565887451,
"logits/rejected": -0.5940991044044495,
"logps/chosen": -7.657552719116211,
"logps/rejected": -16.183917999267578,
"loss": 0.8160735964775085,
"memory(GiB)": 46.73,
"nll_loss": 0.3588046133518219,
"rewards/accuracies": 0.84375,
"rewards/chosen": 0.27544379234313965,
"rewards/margins": 0.7471473217010498,
"rewards/rejected": -0.4717034101486206,
"step": 37,
"train_speed(iter/s)": 0.005452
},
{
"epoch": 0.1086199196069674,
"grad_norm": 7.916697978973389,
"learning_rate": 0.00014339622641509434,
"logits/chosen": -0.5676888227462769,
"logits/rejected": -0.5714080929756165,
"logps/chosen": -6.698662757873535,
"logps/rejected": -17.954235076904297,
"loss": 1.052018642425537,
"memory(GiB)": 46.73,
"nll_loss": 0.49374452233314514,
"rewards/accuracies": 0.78125,
"rewards/chosen": 0.16338011622428894,
"rewards/margins": 0.42942774295806885,
"rewards/rejected": -0.2660475969314575,
"step": 38,
"train_speed(iter/s)": 0.005452
},
{
"epoch": 0.11147833854399285,
"grad_norm": 3.7271363735198975,
"learning_rate": 0.00014716981132075472,
"logits/chosen": -0.6097766160964966,
"logits/rejected": -0.6135396957397461,
"logps/chosen": -7.30006217956543,
"logps/rejected": -22.168495178222656,
"loss": 0.7729511857032776,
"memory(GiB)": 46.73,
"nll_loss": 0.3125499188899994,
"rewards/accuracies": 0.78125,
"rewards/chosen": 0.28066012263298035,
"rewards/margins": 0.8108583092689514,
"rewards/rejected": -0.5301981568336487,
"step": 39,
"train_speed(iter/s)": 0.00545
},
{
"epoch": 0.1143367574810183,
"grad_norm": 2.960145950317383,
"learning_rate": 0.0001509433962264151,
"logits/chosen": -0.6132208108901978,
"logits/rejected": -0.6163071990013123,
"logps/chosen": -7.024638652801514,
"logps/rejected": -21.298852920532227,
"loss": 0.8106734752655029,
"memory(GiB)": 46.73,
"nll_loss": 0.37238579988479614,
"rewards/accuracies": 0.78125,
"rewards/chosen": 0.39458420872688293,
"rewards/margins": 0.8476477265357971,
"rewards/rejected": -0.45306357741355896,
"step": 40,
"train_speed(iter/s)": 0.005445
},
{
"epoch": 0.11719517641804376,
"grad_norm": 4.3203630447387695,
"learning_rate": 0.0001547169811320755,
"logits/chosen": -0.5976248979568481,
"logits/rejected": -0.6002449989318848,
"logps/chosen": -5.656615257263184,
"logps/rejected": -16.032827377319336,
"loss": 0.9440045952796936,
"memory(GiB)": 46.73,
"nll_loss": 0.33253738284111023,
"rewards/accuracies": 0.59375,
"rewards/chosen": 0.14414586126804352,
"rewards/margins": 0.5006409287452698,
"rewards/rejected": -0.35649505257606506,
"step": 41,
"train_speed(iter/s)": 0.005445
},
{
"epoch": 0.12005359535506922,
"grad_norm": 4.646491527557373,
"learning_rate": 0.00015849056603773587,
"logits/chosen": -0.5956608653068542,
"logits/rejected": -0.5956603288650513,
"logps/chosen": -11.719463348388672,
"logps/rejected": -27.070579528808594,
"loss": 1.0076483488082886,
"memory(GiB)": 46.73,
"nll_loss": 0.5070124268531799,
"rewards/accuracies": 0.71875,
"rewards/chosen": 0.15291725099086761,
"rewards/margins": 0.7710469961166382,
"rewards/rejected": -0.6181297898292542,
"step": 42,
"train_speed(iter/s)": 0.005446
},
{
"epoch": 0.12291201429209468,
"grad_norm": 4.248917102813721,
"learning_rate": 0.00016226415094339625,
"logits/chosen": -0.6100150942802429,
"logits/rejected": -0.6142972111701965,
"logps/chosen": -6.201865196228027,
"logps/rejected": -19.82131004333496,
"loss": 0.7969534993171692,
"memory(GiB)": 46.73,
"nll_loss": 0.31225427985191345,
"rewards/accuracies": 0.6875,
"rewards/chosen": 0.20218679308891296,
"rewards/margins": 0.705444872379303,
"rewards/rejected": -0.5032580494880676,
"step": 43,
"train_speed(iter/s)": 0.005448
},
{
"epoch": 0.12577043322912015,
"grad_norm": 3.1864066123962402,
"learning_rate": 0.0001660377358490566,
"logits/chosen": -0.6078452467918396,
"logits/rejected": -0.6100336909294128,
"logps/chosen": -8.217609405517578,
"logps/rejected": -18.432086944580078,
"loss": 0.945781409740448,
"memory(GiB)": 46.73,
"nll_loss": 0.4447736442089081,
"rewards/accuracies": 0.8125,
"rewards/chosen": 0.16747131943702698,
"rewards/margins": 0.6352076530456543,
"rewards/rejected": -0.46773630380630493,
"step": 44,
"train_speed(iter/s)": 0.005451
},
{
"epoch": 0.1286288521661456,
"grad_norm": 2.8247904777526855,
"learning_rate": 0.000169811320754717,
"logits/chosen": -0.6424505710601807,
"logits/rejected": -0.6455634236335754,
"logps/chosen": -4.626930236816406,
"logps/rejected": -18.966289520263672,
"loss": 0.6525614261627197,
"memory(GiB)": 46.73,
"nll_loss": 0.20949943363666534,
"rewards/accuracies": 0.90625,
"rewards/chosen": 0.1935967355966568,
"rewards/margins": 0.7181073427200317,
"rewards/rejected": -0.5245105624198914,
"step": 45,
"train_speed(iter/s)": 0.005449
},
{
"epoch": 0.13148727110317107,
"grad_norm": 5.167090892791748,
"learning_rate": 0.00017358490566037738,
"logits/chosen": -0.6390554308891296,
"logits/rejected": -0.6455981731414795,
"logps/chosen": -7.457905292510986,
"logps/rejected": -22.238759994506836,
"loss": 0.7052859663963318,
"memory(GiB)": 46.73,
"nll_loss": 0.3145278990268707,
"rewards/accuracies": 0.90625,
"rewards/chosen": 0.3406547009944916,
"rewards/margins": 0.9184964895248413,
"rewards/rejected": -0.5778417587280273,
"step": 46,
"train_speed(iter/s)": 0.005446
},
{
"epoch": 0.1343456900401965,
"grad_norm": 3.110797166824341,
"learning_rate": 0.00017735849056603776,
"logits/chosen": -0.6957284212112427,
"logits/rejected": -0.6984925866127014,
"logps/chosen": -6.335500717163086,
"logps/rejected": -26.946069717407227,
"loss": 0.6684616804122925,
"memory(GiB)": 46.73,
"nll_loss": 0.27696001529693604,
"rewards/accuracies": 0.78125,
"rewards/chosen": 0.36519789695739746,
"rewards/margins": 1.261197805404663,
"rewards/rejected": -0.8960000276565552,
"step": 47,
"train_speed(iter/s)": 0.005445
},
{
"epoch": 0.13720410897722196,
"grad_norm": 5.592209815979004,
"learning_rate": 0.00018113207547169812,
"logits/chosen": -0.6557337641716003,
"logits/rejected": -0.6595371961593628,
"logps/chosen": -6.262232780456543,
"logps/rejected": -22.550495147705078,
"loss": 0.844598650932312,
"memory(GiB)": 46.73,
"nll_loss": 0.32042089104652405,
"rewards/accuracies": 0.71875,
"rewards/chosen": 0.098446786403656,
"rewards/margins": 1.1042643785476685,
"rewards/rejected": -1.0058175325393677,
"step": 48,
"train_speed(iter/s)": 0.005444
},
{
"epoch": 0.14006252791424742,
"grad_norm": 5.518631458282471,
"learning_rate": 0.0001849056603773585,
"logits/chosen": -0.7261903285980225,
"logits/rejected": -0.7333111763000488,
"logps/chosen": -6.155282020568848,
"logps/rejected": -28.635177612304688,
"loss": 0.7839219570159912,
"memory(GiB)": 46.73,
"nll_loss": 0.3167538046836853,
"rewards/accuracies": 0.75,
"rewards/chosen": 0.18123595416545868,
"rewards/margins": 1.343546986579895,
"rewards/rejected": -1.1623109579086304,
"step": 49,
"train_speed(iter/s)": 0.00544
},
{
"epoch": 0.14292094685127288,
"grad_norm": 5.368433475494385,
"learning_rate": 0.00018867924528301889,
"logits/chosen": -0.7460846304893494,
"logits/rejected": -0.7433331608772278,
"logps/chosen": -8.476225852966309,
"logps/rejected": -20.479339599609375,
"loss": 1.041689395904541,
"memory(GiB)": 46.73,
"nll_loss": 0.5162184834480286,
"rewards/accuracies": 0.6875,
"rewards/chosen": 0.07575411349534988,
"rewards/margins": 0.8544278144836426,
"rewards/rejected": -0.7786736488342285,
"step": 50,
"train_speed(iter/s)": 0.005439
},
{
"epoch": 0.14577936578829834,
"grad_norm": 12.666760444641113,
"learning_rate": 0.00019245283018867927,
"logits/chosen": -0.7423916459083557,
"logits/rejected": -0.7536158561706543,
"logps/chosen": -4.518327713012695,
"logps/rejected": -25.71565818786621,
"loss": 0.8285016417503357,
"memory(GiB)": 46.73,
"nll_loss": 0.38353338837623596,
"rewards/accuracies": 0.6875,
"rewards/chosen": 0.25002920627593994,
"rewards/margins": 1.0534642934799194,
"rewards/rejected": -0.8034350872039795,
"step": 51,
"train_speed(iter/s)": 0.005432
},
{
"epoch": 0.1486377847253238,
"grad_norm": 5.63993501663208,
"learning_rate": 0.00019622641509433963,
"logits/chosen": -0.7661195993423462,
"logits/rejected": -0.7684649229049683,
"logps/chosen": -5.303972244262695,
"logps/rejected": -20.424297332763672,
"loss": 0.7760183811187744,
"memory(GiB)": 46.73,
"nll_loss": 0.30550119280815125,
"rewards/accuracies": 0.84375,
"rewards/chosen": 0.17865437269210815,
"rewards/margins": 0.9522275328636169,
"rewards/rejected": -0.7735730409622192,
"step": 52,
"train_speed(iter/s)": 0.005436
},
{
"epoch": 0.15149620366234925,
"grad_norm": 3.208770275115967,
"learning_rate": 0.0002,
"logits/chosen": -0.7615375518798828,
"logits/rejected": -0.7639837861061096,
"logps/chosen": -7.793338775634766,
"logps/rejected": -22.267044067382812,
"loss": 0.6889612078666687,
"memory(GiB)": 46.73,
"nll_loss": 0.2784683108329773,
"rewards/accuracies": 0.78125,
"rewards/chosen": 0.21318240463733673,
"rewards/margins": 1.1274638175964355,
"rewards/rejected": -0.9142814874649048,
"step": 53,
"train_speed(iter/s)": 0.005436
},
{
"epoch": 0.1543546225993747,
"grad_norm": 4.603616714477539,
"learning_rate": 0.00019999950054470762,
"logits/chosen": -0.7416525483131409,
"logits/rejected": -0.7468435168266296,
"logps/chosen": -11.753125190734863,
"logps/rejected": -23.24603271484375,
"loss": 0.9534075856208801,
"memory(GiB)": 46.73,
"nll_loss": 0.42802760004997253,
"rewards/accuracies": 0.65625,
"rewards/chosen": 0.2138495296239853,
"rewards/margins": 0.8852367997169495,
"rewards/rejected": -0.6713871955871582,
"step": 54,
"train_speed(iter/s)": 0.005437
},
{
"epoch": 0.15721304153640017,
"grad_norm": 3.226914405822754,
"learning_rate": 0.00019999800218381956,
"logits/chosen": -0.782919704914093,
"logits/rejected": -0.7837254405021667,
"logps/chosen": -10.437933921813965,
"logps/rejected": -21.950359344482422,
"loss": 0.7319959998130798,
"memory(GiB)": 46.73,
"nll_loss": 0.28649967908859253,
"rewards/accuracies": 0.78125,
"rewards/chosen": 0.17146320641040802,
"rewards/margins": 0.9873074889183044,
"rewards/rejected": -0.8158442974090576,
"step": 55,
"train_speed(iter/s)": 0.005435
},
{
"epoch": 0.16007146047342563,
"grad_norm": 5.957598686218262,
"learning_rate": 0.00019999550493230315,
"logits/chosen": -0.7622566819190979,
"logits/rejected": -0.7720569968223572,
"logps/chosen": -9.299139022827148,
"logps/rejected": -25.902114868164062,
"loss": 1.0733510255813599,
"memory(GiB)": 46.73,
"nll_loss": 0.5738880634307861,
"rewards/accuracies": 0.75,
"rewards/chosen": 0.1327313929796219,
"rewards/margins": 1.0297049283981323,
"rewards/rejected": -0.8969735503196716,
"step": 56,
"train_speed(iter/s)": 0.005434
},
{
"epoch": 0.1629298794104511,
"grad_norm": 4.4198760986328125,
"learning_rate": 0.00019999200881510367,
"logits/chosen": -0.7777268886566162,
"logits/rejected": -0.7817560434341431,
"logps/chosen": -8.051362037658691,
"logps/rejected": -16.21352767944336,
"loss": 0.9994087815284729,
"memory(GiB)": 46.73,
"nll_loss": 0.5157659649848938,
"rewards/accuracies": 0.71875,
"rewards/chosen": 0.3178602159023285,
"rewards/margins": 0.7738386392593384,
"rewards/rejected": -0.4559784233570099,
"step": 57,
"train_speed(iter/s)": 0.005437
},
{
"epoch": 0.16578829834747655,
"grad_norm": 10.918800354003906,
"learning_rate": 0.00019998751386714417,
"logits/chosen": -0.7735524773597717,
"logits/rejected": -0.7762777209281921,
"logps/chosen": -6.026726245880127,
"logps/rejected": -20.445030212402344,
"loss": 0.8424608707427979,
"memory(GiB)": 46.73,
"nll_loss": 0.4571954309940338,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.3362487852573395,
"rewards/margins": 1.0223908424377441,
"rewards/rejected": -0.6861420273780823,
"step": 58,
"train_speed(iter/s)": 0.005438
},
{
"epoch": 0.168646717284502,
"grad_norm": 6.003457546234131,
"learning_rate": 0.00019998202013332526,
"logits/chosen": -0.7671990394592285,
"logits/rejected": -0.7679510712623596,
"logps/chosen": -7.208020210266113,
"logps/rejected": -16.45644187927246,
"loss": 0.8400717377662659,
"memory(GiB)": 46.73,
"nll_loss": 0.3789638876914978,
"rewards/accuracies": 0.8125,
"rewards/chosen": 0.19236475229263306,
"rewards/margins": 0.8348343372344971,
"rewards/rejected": -0.6424695253372192,
"step": 59,
"train_speed(iter/s)": 0.005439
},
{
"epoch": 0.17150513622152747,
"grad_norm": 2.5898213386535645,
"learning_rate": 0.00019997552766852432,
"logits/chosen": -0.800130307674408,
"logits/rejected": -0.8043981790542603,
"logps/chosen": -6.655481815338135,
"logps/rejected": -24.4234619140625,
"loss": 0.6945982575416565,
"memory(GiB)": 46.73,
"nll_loss": 0.3340861201286316,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.3088517487049103,
"rewards/margins": 1.2354176044464111,
"rewards/rejected": -0.9265658855438232,
"step": 60,
"train_speed(iter/s)": 0.005436
},
{
"epoch": 0.17436355515855292,
"grad_norm": 3.626788377761841,
"learning_rate": 0.00019996803653759532,
"logits/chosen": -0.7841392159461975,
"logits/rejected": -0.7904000282287598,
"logps/chosen": -4.378767013549805,
"logps/rejected": -26.130855560302734,
"loss": 0.5890128016471863,
"memory(GiB)": 46.73,
"nll_loss": 0.2802823781967163,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.2776252329349518,
"rewards/margins": 1.491828203201294,
"rewards/rejected": -1.2142030000686646,
"step": 61,
"train_speed(iter/s)": 0.005438
},
{
"epoch": 0.17722197409557838,
"grad_norm": 6.747097492218018,
"learning_rate": 0.00019995954681536798,
"logits/chosen": -0.7469812035560608,
"logits/rejected": -0.7426640391349792,
"logps/chosen": -11.407801628112793,
"logps/rejected": -19.764530181884766,
"loss": 1.1509681940078735,
"memory(GiB)": 46.73,
"nll_loss": 0.4816472828388214,
"rewards/accuracies": 0.71875,
"rewards/chosen": -0.023781299591064453,
"rewards/margins": 0.7125381231307983,
"rewards/rejected": -0.7363194227218628,
"step": 62,
"train_speed(iter/s)": 0.005439
},
{
"epoch": 0.18008039303260384,
"grad_norm": 6.9256978034973145,
"learning_rate": 0.00019995005858664696,
"logits/chosen": -0.819698691368103,
"logits/rejected": -0.8221041560173035,
"logps/chosen": -7.0722761154174805,
"logps/rejected": -30.66091537475586,
"loss": 0.9850404262542725,
"memory(GiB)": 46.73,
"nll_loss": 0.42992380261421204,
"rewards/accuracies": 0.75,
"rewards/chosen": 0.07954245805740356,
"rewards/margins": 1.697967767715454,
"rewards/rejected": -1.6184254884719849,
"step": 63,
"train_speed(iter/s)": 0.005439
},
{
"epoch": 0.1829388119696293,
"grad_norm": 5.373042106628418,
"learning_rate": 0.00019993957194621128,
"logits/chosen": -0.8020437955856323,
"logits/rejected": -0.8022991418838501,
"logps/chosen": -12.086634635925293,
"logps/rejected": -21.337501525878906,
"loss": 0.9992907643318176,
"memory(GiB)": 46.73,
"nll_loss": 0.46714556217193604,
"rewards/accuracies": 0.78125,
"rewards/chosen": 0.11581222712993622,
"rewards/margins": 1.0597875118255615,
"rewards/rejected": -0.9439753293991089,
"step": 64,
"train_speed(iter/s)": 0.005441
},
{
"epoch": 0.18579723090665476,
"grad_norm": 3.77294921875,
"learning_rate": 0.00019992808699881303,
"logits/chosen": -0.7432379722595215,
"logits/rejected": -0.7440240979194641,
"logps/chosen": -6.54131555557251,
"logps/rejected": -25.4437255859375,
"loss": 0.8025262951850891,
"memory(GiB)": 46.73,
"nll_loss": 0.4345034658908844,
"rewards/accuracies": 0.90625,
"rewards/chosen": 0.1653081476688385,
"rewards/margins": 1.261300802230835,
"rewards/rejected": -1.0959926843643188,
"step": 65,
"train_speed(iter/s)": 0.005442
},
{
"epoch": 0.18865564984368022,
"grad_norm": 3.9820404052734375,
"learning_rate": 0.0001999156038591766,
"logits/chosen": -0.754156231880188,
"logits/rejected": -0.7619881629943848,
"logps/chosen": -6.165823459625244,
"logps/rejected": -23.689210891723633,
"loss": 0.7558284997940063,
"memory(GiB)": 46.73,
"nll_loss": 0.35462892055511475,
"rewards/accuracies": 0.84375,
"rewards/chosen": 0.18967051804065704,
"rewards/margins": 0.9685844779014587,
"rewards/rejected": -0.7789139151573181,
"step": 66,
"train_speed(iter/s)": 0.005441
},
{
"epoch": 0.19151406878070568,
"grad_norm": 4.361135482788086,
"learning_rate": 0.00019990212265199738,
"logits/chosen": -0.7575560212135315,
"logits/rejected": -0.7635327577590942,
"logps/chosen": -4.563057899475098,
"logps/rejected": -24.856014251708984,
"loss": 0.7012404203414917,
"memory(GiB)": 46.73,
"nll_loss": 0.3292723000049591,
"rewards/accuracies": 0.84375,
"rewards/chosen": 0.360738068819046,
"rewards/margins": 1.0550967454910278,
"rewards/rejected": -0.6943586468696594,
"step": 67,
"train_speed(iter/s)": 0.005441
},
{
"epoch": 0.19437248771773113,
"grad_norm": 8.01318359375,
"learning_rate": 0.00019988764351194056,
"logits/chosen": -0.7201259136199951,
"logits/rejected": -0.7213173508644104,
"logps/chosen": -14.019023895263672,
"logps/rejected": -23.463457107543945,
"loss": 1.155617594718933,
"memory(GiB)": 46.73,
"nll_loss": 0.6643218994140625,
"rewards/accuracies": 0.78125,
"rewards/chosen": 0.16900399327278137,
"rewards/margins": 0.8244603276252747,
"rewards/rejected": -0.6554563641548157,
"step": 68,
"train_speed(iter/s)": 0.005442
},
{
"epoch": 0.1972309066547566,
"grad_norm": 4.880486488342285,
"learning_rate": 0.00019987216658363984,
"logits/chosen": -0.7603176832199097,
"logits/rejected": -0.7611086368560791,
"logps/chosen": -7.871481418609619,
"logps/rejected": -18.355331420898438,
"loss": 0.9050899744033813,
"memory(GiB)": 46.73,
"nll_loss": 0.4671905040740967,
"rewards/accuracies": 0.90625,
"rewards/chosen": 0.14834776520729065,
"rewards/margins": 0.9282243251800537,
"rewards/rejected": -0.7798765897750854,
"step": 69,
"train_speed(iter/s)": 0.005441
},
{
"epoch": 0.20008932559178205,
"grad_norm": 36.09653854370117,
"learning_rate": 0.00019985569202169584,
"logits/chosen": -0.826109766960144,
"logits/rejected": -0.8319188952445984,
"logps/chosen": -7.292363166809082,
"logps/rejected": -19.279315948486328,
"loss": 0.906982421875,
"memory(GiB)": 46.73,
"nll_loss": 0.4692971408367157,
"rewards/accuracies": 0.8125,
"rewards/chosen": 0.17047010362148285,
"rewards/margins": 0.9899492859840393,
"rewards/rejected": -0.8194791674613953,
"step": 70,
"train_speed(iter/s)": 0.005443
},
{
"epoch": 0.2029477445288075,
"grad_norm": 5.051456451416016,
"learning_rate": 0.00019983821999067475,
"logits/chosen": -0.7659405469894409,
"logits/rejected": -0.773281991481781,
"logps/chosen": -7.996345520019531,
"logps/rejected": -16.987951278686523,
"loss": 0.9166132211685181,
"memory(GiB)": 46.73,
"nll_loss": 0.43807780742645264,
"rewards/accuracies": 0.71875,
"rewards/chosen": 0.2428373396396637,
"rewards/margins": 0.7172515988349915,
"rewards/rejected": -0.47441428899765015,
"step": 71,
"train_speed(iter/s)": 0.005444
},
{
"epoch": 0.20580616346583297,
"grad_norm": 3.3546969890594482,
"learning_rate": 0.00019981975066510655,
"logits/chosen": -0.7702159285545349,
"logits/rejected": -0.7756153345108032,
"logps/chosen": -3.096975088119507,
"logps/rejected": -24.7138671875,
"loss": 0.6350318193435669,
"memory(GiB)": 46.73,
"nll_loss": 0.20447328686714172,
"rewards/accuracies": 0.8125,
"rewards/chosen": 0.23610374331474304,
"rewards/margins": 1.1568939685821533,
"rewards/rejected": -0.9207903146743774,
"step": 72,
"train_speed(iter/s)": 0.005441
},
{
"epoch": 0.20866458240285843,
"grad_norm": 3.3056812286376953,
"learning_rate": 0.00019980028422948322,
"logits/chosen": -0.7785294651985168,
"logits/rejected": -0.7796329259872437,
"logps/chosen": -6.459807395935059,
"logps/rejected": -18.2646541595459,
"loss": 0.7826670408248901,
"memory(GiB)": 46.73,
"nll_loss": 0.299204021692276,
"rewards/accuracies": 0.71875,
"rewards/chosen": 0.17048794031143188,
"rewards/margins": 0.8538780212402344,
"rewards/rejected": -0.6833901405334473,
"step": 73,
"train_speed(iter/s)": 0.005441
},
{
"epoch": 0.2115230013398839,
"grad_norm": 2.804248094558716,
"learning_rate": 0.00019977982087825713,
"logits/chosen": -0.7178574204444885,
"logits/rejected": -0.7222320437431335,
"logps/chosen": -5.382746696472168,
"logps/rejected": -21.648345947265625,
"loss": 0.6176108717918396,
"memory(GiB)": 46.73,
"nll_loss": 0.2642488479614258,
"rewards/accuracies": 0.90625,
"rewards/chosen": 0.3241485357284546,
"rewards/margins": 1.1783626079559326,
"rewards/rejected": -0.854214072227478,
"step": 74,
"train_speed(iter/s)": 0.005441
},
{
"epoch": 0.21438142027690935,
"grad_norm": 2.3271028995513916,
"learning_rate": 0.0001997583608158388,
"logits/chosen": -0.7665284872055054,
"logits/rejected": -0.7763013243675232,
"logps/chosen": -3.597620725631714,
"logps/rejected": -28.286640167236328,
"loss": 0.4727986454963684,
"memory(GiB)": 46.73,
"nll_loss": 0.1368505358695984,
"rewards/accuracies": 0.90625,
"rewards/chosen": 0.36978626251220703,
"rewards/margins": 1.460551142692566,
"rewards/rejected": -1.0907649993896484,
"step": 75,
"train_speed(iter/s)": 0.005442
},
{
"epoch": 0.2172398392139348,
"grad_norm": 5.8310160636901855,
"learning_rate": 0.00019973590425659507,
"logits/chosen": -0.7936246991157532,
"logits/rejected": -0.7950795888900757,
"logps/chosen": -8.558622360229492,
"logps/rejected": -22.39399528503418,
"loss": 0.7566131949424744,
"memory(GiB)": 46.73,
"nll_loss": 0.4084041714668274,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.26708710193634033,
"rewards/margins": 1.3221920728683472,
"rewards/rejected": -1.0551048517227173,
"step": 76,
"train_speed(iter/s)": 0.00544
},
{
"epoch": 0.22009825815096026,
"grad_norm": 4.89293909072876,
"learning_rate": 0.0001997124514248469,
"logits/chosen": -0.8093288540840149,
"logits/rejected": -0.8106516003608704,
"logps/chosen": -12.884543418884277,
"logps/rejected": -22.5157413482666,
"loss": 1.130676507949829,
"memory(GiB)": 46.73,
"nll_loss": 0.7112829685211182,
"rewards/accuracies": 0.8125,
"rewards/chosen": 0.10567857325077057,
"rewards/margins": 1.2312006950378418,
"rewards/rejected": -1.1255221366882324,
"step": 77,
"train_speed(iter/s)": 0.005441
},
{
"epoch": 0.2229566770879857,
"grad_norm": 7.881620407104492,
"learning_rate": 0.00019968800255486713,
"logits/chosen": -0.8169571161270142,
"logits/rejected": -0.8179275393486023,
"logps/chosen": -6.7093825340271,
"logps/rejected": -29.32290267944336,
"loss": 0.8154858350753784,
"memory(GiB)": 46.73,
"nll_loss": 0.3944161534309387,
"rewards/accuracies": 0.8125,
"rewards/chosen": 0.16114036738872528,
"rewards/margins": 1.4641916751861572,
"rewards/rejected": -1.3030513525009155,
"step": 78,
"train_speed(iter/s)": 0.005441
},
{
"epoch": 0.22581509602501115,
"grad_norm": 2.513998031616211,
"learning_rate": 0.00019966255789087808,
"logits/chosen": -0.8547464609146118,
"logits/rejected": -0.8608615398406982,
"logps/chosen": -7.297125339508057,
"logps/rejected": -27.81803321838379,
"loss": 0.6003709435462952,
"memory(GiB)": 46.73,
"nll_loss": 0.29905110597610474,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.13682395219802856,
"rewards/margins": 1.487520456314087,
"rewards/rejected": -1.3506965637207031,
"step": 79,
"train_speed(iter/s)": 0.005437
},
{
"epoch": 0.2286735149620366,
"grad_norm": 22.424015045166016,
"learning_rate": 0.0001996361176870492,
"logits/chosen": -0.8499366044998169,
"logits/rejected": -0.863770604133606,
"logps/chosen": -8.103764533996582,
"logps/rejected": -35.18703842163086,
"loss": 0.7495014071464539,
"memory(GiB)": 46.73,
"nll_loss": 0.5106410980224609,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.2272297590970993,
"rewards/margins": 1.9457027912139893,
"rewards/rejected": -1.7184730768203735,
"step": 80,
"train_speed(iter/s)": 0.005436
},
{
"epoch": 0.23153193389906207,
"grad_norm": 4.0974273681640625,
"learning_rate": 0.00019960868220749448,
"logits/chosen": -0.8633654117584229,
"logits/rejected": -0.8727495670318604,
"logps/chosen": -5.683876991271973,
"logps/rejected": -34.967037200927734,
"loss": 0.6187952756881714,
"memory(GiB)": 46.73,
"nll_loss": 0.32927608489990234,
"rewards/accuracies": 0.90625,
"rewards/chosen": 0.2094997614622116,
"rewards/margins": 2.0794010162353516,
"rewards/rejected": -1.8699012994766235,
"step": 81,
"train_speed(iter/s)": 0.005436
},
{
"epoch": 0.23439035283608753,
"grad_norm": 3.275705575942993,
"learning_rate": 0.00019958025172626986,
"logits/chosen": -0.8937872648239136,
"logits/rejected": -0.9034286737442017,
"logps/chosen": -11.346511840820312,
"logps/rejected": -35.471927642822266,
"loss": 0.7466462850570679,
"memory(GiB)": 46.73,
"nll_loss": 0.4821043014526367,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.2012697458267212,
"rewards/margins": 1.9956668615341187,
"rewards/rejected": -1.7943971157073975,
"step": 82,
"train_speed(iter/s)": 0.005436
},
{
"epoch": 0.237248771773113,
"grad_norm": 8.550602912902832,
"learning_rate": 0.0001995508265273704,
"logits/chosen": -0.9247998595237732,
"logits/rejected": -0.934203028678894,
"logps/chosen": -7.0234270095825195,
"logps/rejected": -40.43362808227539,
"loss": 0.6714224219322205,
"memory(GiB)": 46.73,
"nll_loss": 0.36930039525032043,
"rewards/accuracies": 0.84375,
"rewards/chosen": -0.015845157206058502,
"rewards/margins": 2.3306310176849365,
"rewards/rejected": -2.3464760780334473,
"step": 83,
"train_speed(iter/s)": 0.005436
},
{
"epoch": 0.24010719071013845,
"grad_norm": 10.380730628967285,
"learning_rate": 0.00019952040690472748,
"logits/chosen": -0.89071124792099,
"logits/rejected": -0.896521806716919,
"logps/chosen": -9.274986267089844,
"logps/rejected": -31.167112350463867,
"loss": 0.9556330442428589,
"memory(GiB)": 46.73,
"nll_loss": 0.4726044833660126,
"rewards/accuracies": 0.78125,
"rewards/chosen": 0.055123914033174515,
"rewards/margins": 1.99386465549469,
"rewards/rejected": -1.9387409687042236,
"step": 84,
"train_speed(iter/s)": 0.005435
},
{
"epoch": 0.2429656096471639,
"grad_norm": 59.343536376953125,
"learning_rate": 0.00019948899316220604,
"logits/chosen": -0.86629319190979,
"logits/rejected": -0.8767050504684448,
"logps/chosen": -6.04016637802124,
"logps/rejected": -28.20957374572754,
"loss": 0.725101888179779,
"memory(GiB)": 46.73,
"nll_loss": 0.40447694063186646,
"rewards/accuracies": 0.8125,
"rewards/chosen": 0.29112857580184937,
"rewards/margins": 1.845672369003296,
"rewards/rejected": -1.5545437335968018,
"step": 85,
"train_speed(iter/s)": 0.005436
},
{
"epoch": 0.24582402858418936,
"grad_norm": 6.300822734832764,
"learning_rate": 0.0001994565856136012,
"logits/chosen": -0.8398523330688477,
"logits/rejected": -0.8439276814460754,
"logps/chosen": -7.2902045249938965,
"logps/rejected": -32.82334899902344,
"loss": 0.5805257558822632,
"memory(GiB)": 46.73,
"nll_loss": 0.4190253019332886,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.3955605626106262,
"rewards/margins": 2.423994302749634,
"rewards/rejected": -2.0284337997436523,
"step": 86,
"train_speed(iter/s)": 0.005436
},
{
"epoch": 0.24868244752121482,
"grad_norm": 43.768619537353516,
"learning_rate": 0.0001994231845826354,
"logits/chosen": -0.8710224628448486,
"logits/rejected": -0.8721168637275696,
"logps/chosen": -7.397428035736084,
"logps/rejected": -29.24224853515625,
"loss": 1.1686397790908813,
"memory(GiB)": 46.73,
"nll_loss": 0.7285480499267578,
"rewards/accuracies": 0.8125,
"rewards/chosen": -0.11831004917621613,
"rewards/margins": 1.2224053144454956,
"rewards/rejected": -1.3407154083251953,
"step": 87,
"train_speed(iter/s)": 0.005436
},
{
"epoch": 0.2515408664582403,
"grad_norm": 39.749202728271484,
"learning_rate": 0.00019938879040295508,
"logits/chosen": -0.8551483750343323,
"logits/rejected": -0.8542779684066772,
"logps/chosen": -10.534215927124023,
"logps/rejected": -26.982810974121094,
"loss": 1.2515333890914917,
"memory(GiB)": 46.73,
"nll_loss": 0.7181237936019897,
"rewards/accuracies": 0.71875,
"rewards/chosen": -0.03403427451848984,
"rewards/margins": 1.2902536392211914,
"rewards/rejected": -1.32428777217865,
"step": 88,
"train_speed(iter/s)": 0.005437
},
{
"epoch": 0.25439928539526574,
"grad_norm": 10.098331451416016,
"learning_rate": 0.00019935340341812737,
"logits/chosen": -0.8135808706283569,
"logits/rejected": -0.8137494325637817,
"logps/chosen": -9.00113582611084,
"logps/rejected": -22.338396072387695,
"loss": 0.9040060639381409,
"memory(GiB)": 46.73,
"nll_loss": 0.5397258400917053,
"rewards/accuracies": 0.84375,
"rewards/chosen": 0.04357346147298813,
"rewards/margins": 1.2031430006027222,
"rewards/rejected": -1.159569501876831,
"step": 89,
"train_speed(iter/s)": 0.005435
},
{
"epoch": 0.2572577043322912,
"grad_norm": 8.489130973815918,
"learning_rate": 0.00019931702398163657,
"logits/chosen": -0.8590521216392517,
"logits/rejected": -0.8651595711708069,
"logps/chosen": -8.849437713623047,
"logps/rejected": -27.54432487487793,
"loss": 0.8707167506217957,
"memory(GiB)": 46.73,
"nll_loss": 0.48353832960128784,
"rewards/accuracies": 0.8125,
"rewards/chosen": 0.06561100482940674,
"rewards/margins": 1.1353689432144165,
"rewards/rejected": -1.0697578191757202,
"step": 90,
"train_speed(iter/s)": 0.005437
},
{
"epoch": 0.26011612326931666,
"grad_norm": 5.018461227416992,
"learning_rate": 0.00019927965245688072,
"logits/chosen": -0.8591816425323486,
"logits/rejected": -0.8660668730735779,
"logps/chosen": -11.013117790222168,
"logps/rejected": -27.660642623901367,
"loss": 0.9352516531944275,
"memory(GiB)": 46.73,
"nll_loss": 0.541546106338501,
"rewards/accuracies": 0.78125,
"rewards/chosen": 0.2031691074371338,
"rewards/margins": 1.437905192375183,
"rewards/rejected": -1.2347362041473389,
"step": 91,
"train_speed(iter/s)": 0.005437
},
{
"epoch": 0.26297454220634214,
"grad_norm": 6.94728946685791,
"learning_rate": 0.00019924128921716797,
"logits/chosen": -0.8400283455848694,
"logits/rejected": -0.8450547456741333,
"logps/chosen": -9.49151611328125,
"logps/rejected": -28.902881622314453,
"loss": 0.806583821773529,
"memory(GiB)": 46.73,
"nll_loss": 0.3471754193305969,
"rewards/accuracies": 0.78125,
"rewards/chosen": 0.21784308552742004,
"rewards/margins": 1.679865837097168,
"rewards/rejected": -1.4620226621627808,
"step": 92,
"train_speed(iter/s)": 0.005436
},
{
"epoch": 0.2658329611433676,
"grad_norm": 2.8959178924560547,
"learning_rate": 0.00019920193464571275,
"logits/chosen": -0.839047372341156,
"logits/rejected": -0.8450105786323547,
"logps/chosen": -10.59231948852539,
"logps/rejected": -29.6372013092041,
"loss": 0.7759805917739868,
"memory(GiB)": 46.73,
"nll_loss": 0.5248351097106934,
"rewards/accuracies": 0.90625,
"rewards/chosen": 0.3599660098552704,
"rewards/margins": 1.950143575668335,
"rewards/rejected": -1.5901774168014526,
"step": 93,
"train_speed(iter/s)": 0.005437
},
{
"epoch": 0.268691380080393,
"grad_norm": 5.318148612976074,
"learning_rate": 0.00019916158913563207,
"logits/chosen": -0.8162392377853394,
"logits/rejected": -0.8246886730194092,
"logps/chosen": -5.6260833740234375,
"logps/rejected": -29.538055419921875,
"loss": 0.6956499218940735,
"memory(GiB)": 46.73,
"nll_loss": 0.38102442026138306,
"rewards/accuracies": 0.84375,
"rewards/chosen": 0.2292197048664093,
"rewards/margins": 1.7469617128372192,
"rewards/rejected": -1.5177420377731323,
"step": 94,
"train_speed(iter/s)": 0.005437
},
{
"epoch": 0.2715497990174185,
"grad_norm": 4.5264787673950195,
"learning_rate": 0.00019912025308994148,
"logits/chosen": -0.8437933325767517,
"logits/rejected": -0.8463299870491028,
"logps/chosen": -8.831324577331543,
"logps/rejected": -26.610977172851562,
"loss": 0.7661141157150269,
"memory(GiB)": 46.73,
"nll_loss": 0.4225902557373047,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.12178793549537659,
"rewards/margins": 1.467708945274353,
"rewards/rejected": -1.3459210395812988,
"step": 95,
"train_speed(iter/s)": 0.005436
},
{
"epoch": 0.2744082179544439,
"grad_norm": 5.978212356567383,
"learning_rate": 0.00019907792692155113,
"logits/chosen": -0.7815445065498352,
"logits/rejected": -0.78977370262146,
"logps/chosen": -6.673672199249268,
"logps/rejected": -33.78847122192383,
"loss": 0.7695144414901733,
"memory(GiB)": 46.73,
"nll_loss": 0.5254613757133484,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.2026345133781433,
"rewards/margins": 1.8294543027877808,
"rewards/rejected": -1.6268197298049927,
"step": 96,
"train_speed(iter/s)": 0.005435
},
{
"epoch": 0.2772666368914694,
"grad_norm": 9.170755386352539,
"learning_rate": 0.00019903461105326154,
"logits/chosen": -0.8260455131530762,
"logits/rejected": -0.830398678779602,
"logps/chosen": -6.689513206481934,
"logps/rejected": -22.671979904174805,
"loss": 0.7065067291259766,
"memory(GiB)": 46.73,
"nll_loss": 0.32698267698287964,
"rewards/accuracies": 0.8125,
"rewards/chosen": 0.2753945589065552,
"rewards/margins": 1.3633196353912354,
"rewards/rejected": -1.0879249572753906,
"step": 97,
"train_speed(iter/s)": 0.005435
},
{
"epoch": 0.28012505582849484,
"grad_norm": 3.521716594696045,
"learning_rate": 0.00019899030591775957,
"logits/chosen": -0.7963160872459412,
"logits/rejected": -0.8014420866966248,
"logps/chosen": -7.337916851043701,
"logps/rejected": -28.08383560180664,
"loss": 0.61917644739151,
"memory(GiB)": 46.73,
"nll_loss": 0.3110499680042267,
"rewards/accuracies": 0.84375,
"rewards/chosen": 0.23168900609016418,
"rewards/margins": 1.7576744556427002,
"rewards/rejected": -1.525985598564148,
"step": 98,
"train_speed(iter/s)": 0.005436
},
{
"epoch": 0.2829834747655203,
"grad_norm": 5.793614864349365,
"learning_rate": 0.00019894501195761392,
"logits/chosen": -0.8137191534042358,
"logits/rejected": -0.8227260708808899,
"logps/chosen": -6.954023838043213,
"logps/rejected": -35.75700378417969,
"loss": 0.6259573698043823,
"memory(GiB)": 46.73,
"nll_loss": 0.33839166164398193,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.26017990708351135,
"rewards/margins": 2.326916217803955,
"rewards/rejected": -2.0667362213134766,
"step": 99,
"train_speed(iter/s)": 0.005437
},
{
"epoch": 0.28584189370254576,
"grad_norm": 5.138144493103027,
"learning_rate": 0.00019889872962527072,
"logits/chosen": -0.8491114377975464,
"logits/rejected": -0.8503983020782471,
"logps/chosen": -5.965326309204102,
"logps/rejected": -24.436853408813477,
"loss": 0.9054074287414551,
"memory(GiB)": 46.73,
"nll_loss": 0.3898293972015381,
"rewards/accuracies": 0.65625,
"rewards/chosen": 0.10434619337320328,
"rewards/margins": 1.369442105293274,
"rewards/rejected": -1.265095829963684,
"step": 100,
"train_speed(iter/s)": 0.005437
},
{
"epoch": 0.28870031263957124,
"grad_norm": 3.6206700801849365,
"learning_rate": 0.00019885145938304907,
"logits/chosen": -0.8245471119880676,
"logits/rejected": -0.8329594135284424,
"logps/chosen": -12.563156127929688,
"logps/rejected": -31.796875,
"loss": 0.6779420971870422,
"memory(GiB)": 46.73,
"nll_loss": 0.36515456438064575,
"rewards/accuracies": 0.84375,
"rewards/chosen": 0.2728801667690277,
"rewards/margins": 2.0701961517333984,
"rewards/rejected": -1.797316074371338,
"step": 101,
"train_speed(iter/s)": 0.005432
},
{
"epoch": 0.2915587315765967,
"grad_norm": 4.129011154174805,
"learning_rate": 0.0001988032017031364,
"logits/chosen": -0.7823147773742676,
"logits/rejected": -0.7900741696357727,
"logps/chosen": -5.765602111816406,
"logps/rejected": -31.836132049560547,
"loss": 0.533344030380249,
"memory(GiB)": 46.73,
"nll_loss": 0.3198188543319702,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.3069157004356384,
"rewards/margins": 2.2244224548339844,
"rewards/rejected": -1.9175068140029907,
"step": 102,
"train_speed(iter/s)": 0.005432
},
{
"epoch": 0.29441715051362216,
"grad_norm": 7.285937786102295,
"learning_rate": 0.00019875395706758388,
"logits/chosen": -0.8199520707130432,
"logits/rejected": -0.8266770839691162,
"logps/chosen": -6.686117172241211,
"logps/rejected": -35.52680969238281,
"loss": 0.6140994429588318,
"memory(GiB)": 46.73,
"nll_loss": 0.33540287613868713,
"rewards/accuracies": 0.90625,
"rewards/chosen": 0.3744865357875824,
"rewards/margins": 2.1863038539886475,
"rewards/rejected": -1.8118171691894531,
"step": 103,
"train_speed(iter/s)": 0.005432
},
{
"epoch": 0.2972755694506476,
"grad_norm": 4.08017110824585,
"learning_rate": 0.0001987037259683013,
"logits/chosen": -0.7858948707580566,
"logits/rejected": -0.7929791808128357,
"logps/chosen": -6.60341215133667,
"logps/rejected": -32.91640853881836,
"loss": 0.49151238799095154,
"memory(GiB)": 46.73,
"nll_loss": 0.26134875416755676,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.3017127513885498,
"rewards/margins": 2.313183546066284,
"rewards/rejected": -2.0114707946777344,
"step": 104,
"train_speed(iter/s)": 0.005432
},
{
"epoch": 0.3001339883876731,
"grad_norm": 6.110865116119385,
"learning_rate": 0.00019865250890705247,
"logits/chosen": -0.8439383506774902,
"logits/rejected": -0.8605507612228394,
"logps/chosen": -5.249790668487549,
"logps/rejected": -45.18266677856445,
"loss": 0.665439248085022,
"memory(GiB)": 46.73,
"nll_loss": 0.4175432622432709,
"rewards/accuracies": 0.90625,
"rewards/chosen": 0.19819766283035278,
"rewards/margins": 2.974789619445801,
"rewards/rejected": -2.776592254638672,
"step": 105,
"train_speed(iter/s)": 0.005432
},
{
"epoch": 0.3029924073246985,
"grad_norm": 8.704270362854004,
"learning_rate": 0.00019860030639545003,
"logits/chosen": -0.8581717610359192,
"logits/rejected": -0.8701122403144836,
"logps/chosen": -8.200727462768555,
"logps/rejected": -39.06196975708008,
"loss": 0.9722508788108826,
"memory(GiB)": 46.73,
"nll_loss": 0.6783410310745239,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.09280453622341156,
"rewards/margins": 2.520831823348999,
"rewards/rejected": -2.4280271530151367,
"step": 106,
"train_speed(iter/s)": 0.005432
},
{
"epoch": 0.305850826261724,
"grad_norm": 6.919908046722412,
"learning_rate": 0.00019854711895495036,
"logits/chosen": -0.8861989974975586,
"logits/rejected": -0.8968295454978943,
"logps/chosen": -4.962037563323975,
"logps/rejected": -40.77632522583008,
"loss": 0.5569091439247131,
"memory(GiB)": 46.73,
"nll_loss": 0.37660181522369385,
"rewards/accuracies": 0.96875,
"rewards/chosen": 0.30795052647590637,
"rewards/margins": 3.064462184906006,
"rewards/rejected": -2.756511688232422,
"step": 107,
"train_speed(iter/s)": 0.005431
},
{
"epoch": 0.3087092451987494,
"grad_norm": 4.996776580810547,
"learning_rate": 0.00019849294711684845,
"logits/chosen": -0.9625644683837891,
"logits/rejected": -0.972130298614502,
"logps/chosen": -8.820281028747559,
"logps/rejected": -50.21597671508789,
"loss": 0.7489598989486694,
"memory(GiB)": 46.73,
"nll_loss": 0.5024483799934387,
"rewards/accuracies": 0.90625,
"rewards/chosen": 0.26294729113578796,
"rewards/margins": 3.5292611122131348,
"rewards/rejected": -3.2663135528564453,
"step": 108,
"train_speed(iter/s)": 0.005431
},
{
"epoch": 0.3115676641357749,
"grad_norm": 6.157798767089844,
"learning_rate": 0.00019843779142227256,
"logits/chosen": -0.8762018084526062,
"logits/rejected": -0.882946789264679,
"logps/chosen": -7.924221992492676,
"logps/rejected": -43.705806732177734,
"loss": 0.6497112512588501,
"memory(GiB)": 46.73,
"nll_loss": 0.3160628080368042,
"rewards/accuracies": 0.75,
"rewards/chosen": 0.10452399402856827,
"rewards/margins": 3.319636106491089,
"rewards/rejected": -3.2151122093200684,
"step": 109,
"train_speed(iter/s)": 0.005433
},
{
"epoch": 0.31442608307280034,
"grad_norm": 15.488557815551758,
"learning_rate": 0.00019838165242217875,
"logits/chosen": -0.863703727722168,
"logits/rejected": -0.8713690042495728,
"logps/chosen": -6.335309028625488,
"logps/rejected": -46.15715026855469,
"loss": 0.871519923210144,
"memory(GiB)": 46.73,
"nll_loss": 0.5997005701065063,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.15678179264068604,
"rewards/margins": 3.3330183029174805,
"rewards/rejected": -3.176236629486084,
"step": 110,
"train_speed(iter/s)": 0.005432
},
{
"epoch": 0.31728450200982583,
"grad_norm": 4.969946384429932,
"learning_rate": 0.0001983245306773454,
"logits/chosen": -0.8029311895370483,
"logits/rejected": -0.8069216012954712,
"logps/chosen": -5.91574764251709,
"logps/rejected": -26.575307846069336,
"loss": 0.6512956619262695,
"memory(GiB)": 46.73,
"nll_loss": 0.2922568917274475,
"rewards/accuracies": 0.90625,
"rewards/chosen": 0.20303387939929962,
"rewards/margins": 1.892715573310852,
"rewards/rejected": -1.6896816492080688,
"step": 111,
"train_speed(iter/s)": 0.005433
},
{
"epoch": 0.32014292094685126,
"grad_norm": 6.895030498504639,
"learning_rate": 0.0001982664267583677,
"logits/chosen": -0.8168566226959229,
"logits/rejected": -0.8292732238769531,
"logps/chosen": -5.602714538574219,
"logps/rejected": -31.50632667541504,
"loss": 0.8574928641319275,
"memory(GiB)": 46.73,
"nll_loss": 0.5075439810752869,
"rewards/accuracies": 0.8125,
"rewards/chosen": 0.010208956897258759,
"rewards/margins": 1.8891350030899048,
"rewards/rejected": -1.8789262771606445,
"step": 112,
"train_speed(iter/s)": 0.005432
},
{
"epoch": 0.32300133988387675,
"grad_norm": 4.541954040527344,
"learning_rate": 0.00019820734124565182,
"logits/chosen": -0.7733545899391174,
"logits/rejected": -0.7771452069282532,
"logps/chosen": -6.299251079559326,
"logps/rejected": -27.075977325439453,
"loss": 0.7081068754196167,
"memory(GiB)": 46.73,
"nll_loss": 0.3878493905067444,
"rewards/accuracies": 0.84375,
"rewards/chosen": 0.13715356588363647,
"rewards/margins": 1.6064281463623047,
"rewards/rejected": -1.4692747592926025,
"step": 113,
"train_speed(iter/s)": 0.005431
},
{
"epoch": 0.3258597588209022,
"grad_norm": 3.1780240535736084,
"learning_rate": 0.00019814727472940917,
"logits/chosen": -0.7537604570388794,
"logits/rejected": -0.7559649348258972,
"logps/chosen": -11.733123779296875,
"logps/rejected": -27.673603057861328,
"loss": 0.71772301197052,
"memory(GiB)": 46.73,
"nll_loss": 0.42100292444229126,
"rewards/accuracies": 0.96875,
"rewards/chosen": 0.21125301718711853,
"rewards/margins": 1.6915286779403687,
"rewards/rejected": -1.4802757501602173,
"step": 114,
"train_speed(iter/s)": 0.005429
},
{
"epoch": 0.32871817775792767,
"grad_norm": 3.8751778602600098,
"learning_rate": 0.00019808622780965066,
"logits/chosen": -0.7520322799682617,
"logits/rejected": -0.7543449401855469,
"logps/chosen": -7.260441303253174,
"logps/rejected": -29.127504348754883,
"loss": 0.6945881843566895,
"memory(GiB)": 46.73,
"nll_loss": 0.3524607717990875,
"rewards/accuracies": 0.84375,
"rewards/chosen": 0.26789340376853943,
"rewards/margins": 1.691644549369812,
"rewards/rejected": -1.4237512350082397,
"step": 115,
"train_speed(iter/s)": 0.005429
},
{
"epoch": 0.3315765966949531,
"grad_norm": 3.0139174461364746,
"learning_rate": 0.0001980242010961803,
"logits/chosen": -0.7901269793510437,
"logits/rejected": -0.7972939014434814,
"logps/chosen": -7.289261341094971,
"logps/rejected": -47.759063720703125,
"loss": 0.5331582427024841,
"memory(GiB)": 46.73,
"nll_loss": 0.38446128368377686,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.3029555678367615,
"rewards/margins": 2.9576172828674316,
"rewards/rejected": -2.6546616554260254,
"step": 116,
"train_speed(iter/s)": 0.005429
},
{
"epoch": 0.3344350156319786,
"grad_norm": 3.233109712600708,
"learning_rate": 0.00019796119520858955,
"logits/chosen": -0.7568274140357971,
"logits/rejected": -0.7630717158317566,
"logps/chosen": -10.064506530761719,
"logps/rejected": -32.50635528564453,
"loss": 0.789489209651947,
"memory(GiB)": 46.73,
"nll_loss": 0.4839721918106079,
"rewards/accuracies": 0.84375,
"rewards/chosen": 0.3997339606285095,
"rewards/margins": 2.3508408069610596,
"rewards/rejected": -1.9511069059371948,
"step": 117,
"train_speed(iter/s)": 0.005429
},
{
"epoch": 0.337293434569004,
"grad_norm": 6.901320934295654,
"learning_rate": 0.0001978972107762509,
"logits/chosen": -0.7462923526763916,
"logits/rejected": -0.7441357970237732,
"logps/chosen": -10.976001739501953,
"logps/rejected": -31.10492706298828,
"loss": 0.7512857913970947,
"memory(GiB)": 46.73,
"nll_loss": 0.43077993392944336,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.1536616086959839,
"rewards/margins": 2.106844186782837,
"rewards/rejected": -1.953182578086853,
"step": 118,
"train_speed(iter/s)": 0.00543
},
{
"epoch": 0.3401518535060295,
"grad_norm": 2.286742925643921,
"learning_rate": 0.00019783224843831162,
"logits/chosen": -0.7183930277824402,
"logits/rejected": -0.7182736396789551,
"logps/chosen": -8.731864929199219,
"logps/rejected": -33.98211669921875,
"loss": 0.6520930528640747,
"memory(GiB)": 46.73,
"nll_loss": 0.3684110939502716,
"rewards/accuracies": 0.84375,
"rewards/chosen": 0.2964346706867218,
"rewards/margins": 2.4515674114227295,
"rewards/rejected": -2.15513277053833,
"step": 119,
"train_speed(iter/s)": 0.005432
},
{
"epoch": 0.34301027244305493,
"grad_norm": 4.936792850494385,
"learning_rate": 0.00019776630884368738,
"logits/chosen": -0.7660694122314453,
"logits/rejected": -0.776424765586853,
"logps/chosen": -4.871070861816406,
"logps/rejected": -47.67111587524414,
"loss": 0.4515693187713623,
"memory(GiB)": 46.73,
"nll_loss": 0.30822524428367615,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.38517045974731445,
"rewards/margins": 3.7489230632781982,
"rewards/rejected": -3.363752841949463,
"step": 120,
"train_speed(iter/s)": 0.005431
},
{
"epoch": 0.3458686913800804,
"grad_norm": 9.613821983337402,
"learning_rate": 0.00019769939265105573,
"logits/chosen": -0.7732415795326233,
"logits/rejected": -0.7863773703575134,
"logps/chosen": -4.910383701324463,
"logps/rejected": -44.046382904052734,
"loss": 0.6085942983627319,
"memory(GiB)": 46.73,
"nll_loss": 0.3416149616241455,
"rewards/accuracies": 0.84375,
"rewards/chosen": 0.3152579069137573,
"rewards/margins": 3.380157470703125,
"rewards/rejected": -3.0648996829986572,
"step": 121,
"train_speed(iter/s)": 0.005432
},
{
"epoch": 0.34872711031710585,
"grad_norm": 5.3062744140625,
"learning_rate": 0.00019763150052884966,
"logits/chosen": -0.7940014004707336,
"logits/rejected": -0.8029736280441284,
"logps/chosen": -3.551081895828247,
"logps/rejected": -38.06512451171875,
"loss": 0.42784249782562256,
"memory(GiB)": 46.73,
"nll_loss": 0.25387704372406006,
"rewards/accuracies": 0.96875,
"rewards/chosen": 0.37009117007255554,
"rewards/margins": 2.841196298599243,
"rewards/rejected": -2.471104860305786,
"step": 122,
"train_speed(iter/s)": 0.005431
},
{
"epoch": 0.35158552925413133,
"grad_norm": 1.533804178237915,
"learning_rate": 0.0001975626331552507,
"logits/chosen": -0.8097442984580994,
"logits/rejected": -0.8176737427711487,
"logps/chosen": -3.7899668216705322,
"logps/rejected": -51.7594108581543,
"loss": 0.3041819632053375,
"memory(GiB)": 46.73,
"nll_loss": 0.2387474924325943,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.35475367307662964,
"rewards/margins": 4.306023597717285,
"rewards/rejected": -3.9512698650360107,
"step": 123,
"train_speed(iter/s)": 0.00543
},
{
"epoch": 0.35444394819115677,
"grad_norm": 4.373802661895752,
"learning_rate": 0.00019749279121818235,
"logits/chosen": -0.7605909705162048,
"logits/rejected": -0.770943284034729,
"logps/chosen": -8.83084774017334,
"logps/rejected": -59.24419021606445,
"loss": 0.5374789834022522,
"memory(GiB)": 46.73,
"nll_loss": 0.39307644963264465,
"rewards/accuracies": 0.96875,
"rewards/chosen": 0.14716514945030212,
"rewards/margins": 4.3210930824279785,
"rewards/rejected": -4.173928260803223,
"step": 124,
"train_speed(iter/s)": 0.00543
},
{
"epoch": 0.3573023671281822,
"grad_norm": 6.3563103675842285,
"learning_rate": 0.0001974219754153032,
"logits/chosen": -0.8258897066116333,
"logits/rejected": -0.8272631168365479,
"logps/chosen": -7.77381706237793,
"logps/rejected": -41.343414306640625,
"loss": 0.6204044818878174,
"memory(GiB)": 46.73,
"nll_loss": 0.33825787901878357,
"rewards/accuracies": 0.84375,
"rewards/chosen": 0.12217142432928085,
"rewards/margins": 3.0349438190460205,
"rewards/rejected": -2.9127724170684814,
"step": 125,
"train_speed(iter/s)": 0.005431
},
{
"epoch": 0.3601607860652077,
"grad_norm": 9.85932731628418,
"learning_rate": 0.00019735018645399967,
"logits/chosen": -0.8187968730926514,
"logits/rejected": -0.8283690214157104,
"logps/chosen": -4.5190534591674805,
"logps/rejected": -45.119789123535156,
"loss": 0.5073397755622864,
"memory(GiB)": 46.73,
"nll_loss": 0.33468902111053467,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.34614282846450806,
"rewards/margins": 3.5951905250549316,
"rewards/rejected": -3.2490477561950684,
"step": 126,
"train_speed(iter/s)": 0.005432
},
{
"epoch": 0.3630192050022331,
"grad_norm": 3.943042039871216,
"learning_rate": 0.00019727742505137936,
"logits/chosen": -0.7813420295715332,
"logits/rejected": -0.7975005507469177,
"logps/chosen": -7.530571937561035,
"logps/rejected": -53.51607894897461,
"loss": 0.46567243337631226,
"memory(GiB)": 46.73,
"nll_loss": 0.2742045819759369,
"rewards/accuracies": 0.90625,
"rewards/chosen": 0.23301076889038086,
"rewards/margins": 3.9482827186584473,
"rewards/rejected": -3.7152719497680664,
"step": 127,
"train_speed(iter/s)": 0.005432
},
{
"epoch": 0.3658776239392586,
"grad_norm": 1.9621978998184204,
"learning_rate": 0.00019720369193426365,
"logits/chosen": -0.7805514335632324,
"logits/rejected": -0.7947923541069031,
"logps/chosen": -4.593271255493164,
"logps/rejected": -51.02714157104492,
"loss": 0.3543168008327484,
"memory(GiB)": 46.73,
"nll_loss": 0.2695479393005371,
"rewards/accuracies": 0.96875,
"rewards/chosen": 0.3205646574497223,
"rewards/margins": 3.938343048095703,
"rewards/rejected": -3.6177780628204346,
"step": 128,
"train_speed(iter/s)": 0.005433
},
{
"epoch": 0.36873604287628403,
"grad_norm": 6.375858783721924,
"learning_rate": 0.00019712898783918038,
"logits/chosen": -0.7720431089401245,
"logits/rejected": -0.7774226069450378,
"logps/chosen": -3.9679479598999023,
"logps/rejected": -39.059242248535156,
"loss": 0.42859622836112976,
"memory(GiB)": 46.73,
"nll_loss": 0.2718777060508728,
"rewards/accuracies": 0.96875,
"rewards/chosen": 0.335873007774353,
"rewards/margins": 3.0524649620056152,
"rewards/rejected": -2.7165920734405518,
"step": 129,
"train_speed(iter/s)": 0.005434
},
{
"epoch": 0.3715944618133095,
"grad_norm": 20.90467643737793,
"learning_rate": 0.00019705331351235674,
"logits/chosen": -0.7668591737747192,
"logits/rejected": -0.7685776948928833,
"logps/chosen": -9.782769203186035,
"logps/rejected": -33.2745361328125,
"loss": 1.310682773590088,
"memory(GiB)": 46.73,
"nll_loss": 0.8834658861160278,
"rewards/accuracies": 0.78125,
"rewards/chosen": -0.039194077253341675,
"rewards/margins": 2.1344308853149414,
"rewards/rejected": -2.1736247539520264,
"step": 130,
"train_speed(iter/s)": 0.005434
},
{
"epoch": 0.37445288075033495,
"grad_norm": 2.3716464042663574,
"learning_rate": 0.00019697666970971153,
"logits/chosen": -0.7852880954742432,
"logits/rejected": -0.7899134755134583,
"logps/chosen": -6.234109878540039,
"logps/rejected": -42.3105354309082,
"loss": 0.4260920286178589,
"memory(GiB)": 46.73,
"nll_loss": 0.25257518887519836,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.3239039182662964,
"rewards/margins": 3.0808892250061035,
"rewards/rejected": -2.7569851875305176,
"step": 131,
"train_speed(iter/s)": 0.005433
},
{
"epoch": 0.37731129968736044,
"grad_norm": 17.186786651611328,
"learning_rate": 0.00019689905719684782,
"logits/chosen": -0.7246553301811218,
"logits/rejected": -0.739700198173523,
"logps/chosen": -4.994725227355957,
"logps/rejected": -37.61749267578125,
"loss": 0.7901899814605713,
"memory(GiB)": 46.73,
"nll_loss": 0.529437243938446,
"rewards/accuracies": 0.96875,
"rewards/chosen": 0.3914901614189148,
"rewards/margins": 2.7029402256011963,
"rewards/rejected": -2.311450242996216,
"step": 132,
"train_speed(iter/s)": 0.005432
},
{
"epoch": 0.38016971862438587,
"grad_norm": 19.44753646850586,
"learning_rate": 0.00019682047674904525,
"logits/chosen": -0.7204717993736267,
"logits/rejected": -0.7237159013748169,
"logps/chosen": -10.331472396850586,
"logps/rejected": -44.90771484375,
"loss": 0.9498412609100342,
"memory(GiB)": 46.73,
"nll_loss": 0.6981635093688965,
"rewards/accuracies": 0.90625,
"rewards/chosen": 0.13750669360160828,
"rewards/margins": 3.0414295196533203,
"rewards/rejected": -2.9039225578308105,
"step": 133,
"train_speed(iter/s)": 0.005433
},
{
"epoch": 0.38302813756141135,
"grad_norm": 2.630051612854004,
"learning_rate": 0.00019674092915125218,
"logits/chosen": -0.7359256148338318,
"logits/rejected": -0.7523387670516968,
"logps/chosen": -5.2792582511901855,
"logps/rejected": -53.244354248046875,
"loss": 0.37174469232559204,
"memory(GiB)": 46.73,
"nll_loss": 0.19531044363975525,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.35951948165893555,
"rewards/margins": 3.9146037101745605,
"rewards/rejected": -3.555084228515625,
"step": 134,
"train_speed(iter/s)": 0.005432
},
{
"epoch": 0.3858865564984368,
"grad_norm": 8.38878059387207,
"learning_rate": 0.00019666041519807802,
"logits/chosen": -0.7512345910072327,
"logits/rejected": -0.7590532302856445,
"logps/chosen": -7.108774662017822,
"logps/rejected": -49.24845886230469,
"loss": 0.515214741230011,
"memory(GiB)": 46.73,
"nll_loss": 0.35548365116119385,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.11580058932304382,
"rewards/margins": 3.6866679191589355,
"rewards/rejected": -3.5708670616149902,
"step": 135,
"train_speed(iter/s)": 0.005431
},
{
"epoch": 0.38874497543546227,
"grad_norm": 7.971051216125488,
"learning_rate": 0.0001965789356937852,
"logits/chosen": -0.7898239493370056,
"logits/rejected": -0.7973160743713379,
"logps/chosen": -9.885854721069336,
"logps/rejected": -55.670047760009766,
"loss": 0.7229015827178955,
"memory(GiB)": 46.73,
"nll_loss": 0.43035101890563965,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.13693107664585114,
"rewards/margins": 3.9661924839019775,
"rewards/rejected": -3.829261541366577,
"step": 136,
"train_speed(iter/s)": 0.00543
},
{
"epoch": 0.3916033943724877,
"grad_norm": 6.154712677001953,
"learning_rate": 0.00019649649145228102,
"logits/chosen": -0.7895013689994812,
"logits/rejected": -0.7943228483200073,
"logps/chosen": -5.192661285400391,
"logps/rejected": -39.91571044921875,
"loss": 0.5592948794364929,
"memory(GiB)": 46.73,
"nll_loss": 0.22298313677310944,
"rewards/accuracies": 0.8125,
"rewards/chosen": 0.19678261876106262,
"rewards/margins": 2.95813250541687,
"rewards/rejected": -2.761349678039551,
"step": 137,
"train_speed(iter/s)": 0.005431
},
{
"epoch": 0.3944618133095132,
"grad_norm": 2.1893486976623535,
"learning_rate": 0.0001964130832971098,
"logits/chosen": -0.7978731393814087,
"logits/rejected": -0.808353066444397,
"logps/chosen": -7.741363048553467,
"logps/rejected": -49.584014892578125,
"loss": 0.4424561560153961,
"memory(GiB)": 46.73,
"nll_loss": 0.3187883198261261,
"rewards/accuracies": 0.96875,
"rewards/chosen": 0.3768758773803711,
"rewards/margins": 3.4152517318725586,
"rewards/rejected": -3.0383756160736084,
"step": 138,
"train_speed(iter/s)": 0.005431
},
{
"epoch": 0.3973202322465386,
"grad_norm": 3.585315465927124,
"learning_rate": 0.0001963287120614444,
"logits/chosen": -0.8294897079467773,
"logits/rejected": -0.8371224403381348,
"logps/chosen": -4.645942211151123,
"logps/rejected": -41.52901840209961,
"loss": 0.5509465336799622,
"memory(GiB)": 46.73,
"nll_loss": 0.3694899380207062,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.15256014466285706,
"rewards/margins": 3.042027473449707,
"rewards/rejected": -2.8894670009613037,
"step": 139,
"train_speed(iter/s)": 0.005432
},
{
"epoch": 0.4001786511835641,
"grad_norm": 3.1583364009857178,
"learning_rate": 0.00019624337858807807,
"logits/chosen": -0.8058665990829468,
"logits/rejected": -0.802970290184021,
"logps/chosen": -12.615983009338379,
"logps/rejected": -42.576560974121094,
"loss": 0.47237128019332886,
"memory(GiB)": 46.73,
"nll_loss": 0.28210973739624023,
"rewards/accuracies": 0.875,
"rewards/chosen": -0.08335088193416595,
"rewards/margins": 2.9341583251953125,
"rewards/rejected": -3.0175094604492188,
"step": 140,
"train_speed(iter/s)": 0.005432
},
{
"epoch": 0.40303707012058954,
"grad_norm": 1.9583823680877686,
"learning_rate": 0.00019615708372941587,
"logits/chosen": -0.7773740887641907,
"logits/rejected": -0.7813900113105774,
"logps/chosen": -7.43025016784668,
"logps/rejected": -48.81037521362305,
"loss": 0.45620426535606384,
"memory(GiB)": 46.73,
"nll_loss": 0.2858808636665344,
"rewards/accuracies": 0.90625,
"rewards/chosen": 0.14979784190654755,
"rewards/margins": 3.327134847640991,
"rewards/rejected": -3.177337169647217,
"step": 141,
"train_speed(iter/s)": 0.005434
},
{
"epoch": 0.405895489057615,
"grad_norm": 17.376474380493164,
"learning_rate": 0.00019606982834746627,
"logits/chosen": -0.8055461645126343,
"logits/rejected": -0.8150217533111572,
"logps/chosen": -9.388490676879883,
"logps/rejected": -43.86671447753906,
"loss": 1.0983664989471436,
"memory(GiB)": 46.73,
"nll_loss": 0.7692541480064392,
"rewards/accuracies": 0.90625,
"rewards/chosen": 0.1326138973236084,
"rewards/margins": 2.8655741214752197,
"rewards/rejected": -2.7329602241516113,
"step": 142,
"train_speed(iter/s)": 0.005433
},
{
"epoch": 0.40875390799464045,
"grad_norm": 35.17894744873047,
"learning_rate": 0.00019598161331383257,
"logits/chosen": -0.8625121116638184,
"logits/rejected": -0.871791422367096,
"logps/chosen": -9.16450023651123,
"logps/rejected": -47.45623016357422,
"loss": 0.7930290102958679,
"memory(GiB)": 46.73,
"nll_loss": 0.543784499168396,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.08059316873550415,
"rewards/margins": 3.273069381713867,
"rewards/rejected": -3.192476272583008,
"step": 143,
"train_speed(iter/s)": 0.005433
},
{
"epoch": 0.41161232693166594,
"grad_norm": 4.112196445465088,
"learning_rate": 0.00019589243950970402,
"logits/chosen": -0.8877297043800354,
"logits/rejected": -0.8911035060882568,
"logps/chosen": -6.215106964111328,
"logps/rejected": -41.89563751220703,
"loss": 0.3530213236808777,
"memory(GiB)": 46.73,
"nll_loss": 0.20008514821529388,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.3117275834083557,
"rewards/margins": 3.073056221008301,
"rewards/rejected": -2.76132869720459,
"step": 144,
"train_speed(iter/s)": 0.005434
},
{
"epoch": 0.41447074586869137,
"grad_norm": 12.758796691894531,
"learning_rate": 0.00019580230782584722,
"logits/chosen": -0.8928901553153992,
"logits/rejected": -0.8998609781265259,
"logps/chosen": -5.406792640686035,
"logps/rejected": -40.006412506103516,
"loss": 0.5003563165664673,
"memory(GiB)": 46.73,
"nll_loss": 0.30671095848083496,
"rewards/accuracies": 0.90625,
"rewards/chosen": 0.23732616007328033,
"rewards/margins": 2.932386636734009,
"rewards/rejected": -2.6950607299804688,
"step": 145,
"train_speed(iter/s)": 0.005434
},
{
"epoch": 0.41732916480571686,
"grad_norm": 4.014595985412598,
"learning_rate": 0.00019571121916259706,
"logits/chosen": -0.887598991394043,
"logits/rejected": -0.8942646384239197,
"logps/chosen": -4.3415961265563965,
"logps/rejected": -46.59621810913086,
"loss": 0.36891594529151917,
"memory(GiB)": 46.73,
"nll_loss": 0.2651711106300354,
"rewards/accuracies": 0.96875,
"rewards/chosen": 0.36169373989105225,
"rewards/margins": 3.6561460494995117,
"rewards/rejected": -3.294452428817749,
"step": 146,
"train_speed(iter/s)": 0.005434
},
{
"epoch": 0.4201875837427423,
"grad_norm": 10.37033462524414,
"learning_rate": 0.00019561917442984788,
"logits/chosen": -0.8872988224029541,
"logits/rejected": -0.8909754753112793,
"logps/chosen": -7.036233901977539,
"logps/rejected": -44.856361389160156,
"loss": 0.5071041584014893,
"memory(GiB)": 46.73,
"nll_loss": 0.4129847586154938,
"rewards/accuracies": 0.96875,
"rewards/chosen": 0.29683101177215576,
"rewards/margins": 3.6587531566619873,
"rewards/rejected": -3.361922025680542,
"step": 147,
"train_speed(iter/s)": 0.005434
},
{
"epoch": 0.4230460026797678,
"grad_norm": 12.54053783416748,
"learning_rate": 0.00019552617454704428,
"logits/chosen": -0.909309983253479,
"logits/rejected": -0.9173017144203186,
"logps/chosen": -5.930859088897705,
"logps/rejected": -46.784332275390625,
"loss": 0.6537680625915527,
"memory(GiB)": 46.73,
"nll_loss": 0.521246075630188,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.25368478894233704,
"rewards/margins": 3.396470308303833,
"rewards/rejected": -3.1427857875823975,
"step": 148,
"train_speed(iter/s)": 0.005433
},
{
"epoch": 0.4259044216167932,
"grad_norm": 2.5870954990386963,
"learning_rate": 0.00019543222044317188,
"logits/chosen": -0.8764325976371765,
"logits/rejected": -0.881737232208252,
"logps/chosen": -5.638083457946777,
"logps/rejected": -47.27805709838867,
"loss": 0.3462856113910675,
"memory(GiB)": 46.73,
"nll_loss": 0.22526228427886963,
"rewards/accuracies": 0.96875,
"rewards/chosen": 0.3174706697463989,
"rewards/margins": 3.5086669921875,
"rewards/rejected": -3.1911962032318115,
"step": 149,
"train_speed(iter/s)": 0.005433
},
{
"epoch": 0.4287628405538187,
"grad_norm": 9.161517143249512,
"learning_rate": 0.00019533731305674818,
"logits/chosen": -0.8732975721359253,
"logits/rejected": -0.8769663572311401,
"logps/chosen": -9.518259048461914,
"logps/rejected": -42.666114807128906,
"loss": 0.9442892670631409,
"memory(GiB)": 46.73,
"nll_loss": 0.6460040211677551,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.07534892857074738,
"rewards/margins": 3.1069083213806152,
"rewards/rejected": -3.0315592288970947,
"step": 150,
"train_speed(iter/s)": 0.005433
}
],
"logging_steps": 1,
"max_steps": 1047,
"num_input_tokens_seen": 0,
"num_train_epochs": 3,
"save_steps": 50,
"stateful_callbacks": {
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": true,
"should_training_stop": false
},
"attributes": {}
}
},
"total_flos": 1.0479874209029816e+18,
"train_batch_size": 1,
"trial_name": null,
"trial_params": null
}