PEFT
Safetensors
2gt6-50 / trainer_state.json
windgrin's picture
Upload folder using huggingface_hub
b39a6ee verified
Raw
History Blame Contribute Delete
32.7 kB
{
"best_global_step": null,
"best_metric": null,
"best_model_checkpoint": null,
"epoch": 0.14292094685127288,
"eval_steps": 300,
"global_step": 50,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"epoch": 0.002858418937025458,
"grad_norm": 10.349462509155273,
"learning_rate": 3.7735849056603773e-06,
"logits/chosen": -0.6422490477561951,
"logits/rejected": -0.6447486877441406,
"logps/chosen": -6.999429225921631,
"logps/rejected": -13.433603286743164,
"loss": 1.3778549432754517,
"memory(GiB)": 46.73,
"nll_loss": 0.6847077012062073,
"rewards/accuracies": 0.0,
"rewards/chosen": 0.0,
"rewards/margins": 0.0,
"rewards/rejected": 0.0,
"step": 1,
"train_speed(iter/s)": 0.005273
},
{
"epoch": 0.005716837874050916,
"grad_norm": 11.263213157653809,
"learning_rate": 7.547169811320755e-06,
"logits/chosen": -0.6429960131645203,
"logits/rejected": -0.6454926133155823,
"logps/chosen": -9.604641914367676,
"logps/rejected": -13.53369140625,
"loss": 1.4975696802139282,
"memory(GiB)": 46.73,
"nll_loss": 0.8044224381446838,
"rewards/accuracies": 0.0,
"rewards/chosen": 0.0,
"rewards/margins": 0.0,
"rewards/rejected": 0.0,
"step": 2,
"train_speed(iter/s)": 0.005366
},
{
"epoch": 0.008575256811076373,
"grad_norm": 9.09404182434082,
"learning_rate": 1.1320754716981132e-05,
"logits/chosen": -0.6486532092094421,
"logits/rejected": -0.6493248343467712,
"logps/chosen": -7.69912576675415,
"logps/rejected": -17.816326141357422,
"loss": 1.2593896389007568,
"memory(GiB)": 46.73,
"nll_loss": 0.5679630637168884,
"rewards/accuracies": 0.625,
"rewards/chosen": 0.0031128099653869867,
"rewards/margins": 0.0035441224463284016,
"rewards/rejected": -0.00043131227721460164,
"step": 3,
"train_speed(iter/s)": 0.005419
},
{
"epoch": 0.011433675748101831,
"grad_norm": 13.314420700073242,
"learning_rate": 1.509433962264151e-05,
"logits/chosen": -0.6668453812599182,
"logits/rejected": -0.6718658804893494,
"logps/chosen": -6.061755180358887,
"logps/rejected": -13.643918991088867,
"loss": 1.4406771659851074,
"memory(GiB)": 46.73,
"nll_loss": 0.7477570176124573,
"rewards/accuracies": 0.53125,
"rewards/chosen": 0.008774133399128914,
"rewards/margins": 0.0006008772179484367,
"rewards/rejected": 0.008173256181180477,
"step": 4,
"train_speed(iter/s)": 0.005446
},
{
"epoch": 0.014292094685127288,
"grad_norm": 12.340804100036621,
"learning_rate": 1.8867924528301888e-05,
"logits/chosen": -0.6321276426315308,
"logits/rejected": -0.6321861743927002,
"logps/chosen": -11.234216690063477,
"logps/rejected": -11.82645034790039,
"loss": 1.3690662384033203,
"memory(GiB)": 46.73,
"nll_loss": 0.6870464086532593,
"rewards/accuracies": 0.6875,
"rewards/chosen": 0.032103873789310455,
"rewards/margins": 0.022960105910897255,
"rewards/rejected": 0.0091437678784132,
"step": 5,
"train_speed(iter/s)": 0.005444
},
{
"epoch": 0.017150513622152745,
"grad_norm": 13.995262145996094,
"learning_rate": 2.2641509433962265e-05,
"logits/chosen": -0.6530164480209351,
"logits/rejected": -0.6550691723823547,
"logps/chosen": -8.742744445800781,
"logps/rejected": -12.622247695922852,
"loss": 1.3672001361846924,
"memory(GiB)": 46.73,
"nll_loss": 0.702350378036499,
"rewards/accuracies": 0.65625,
"rewards/chosen": 0.0800265222787857,
"rewards/margins": 0.06047351285815239,
"rewards/rejected": 0.019553007557988167,
"step": 6,
"train_speed(iter/s)": 0.005427
},
{
"epoch": 0.020008932559178204,
"grad_norm": 10.019857406616211,
"learning_rate": 2.641509433962264e-05,
"logits/chosen": -0.6211694478988647,
"logits/rejected": -0.6214967370033264,
"logps/chosen": -6.935382843017578,
"logps/rejected": -13.613279342651367,
"loss": 1.2412631511688232,
"memory(GiB)": 46.73,
"nll_loss": 0.5651571154594421,
"rewards/accuracies": 0.59375,
"rewards/chosen": 0.13799861073493958,
"rewards/margins": 0.053141627460718155,
"rewards/rejected": 0.08485697209835052,
"step": 7,
"train_speed(iter/s)": 0.005441
},
{
"epoch": 0.022867351496203663,
"grad_norm": 6.375326633453369,
"learning_rate": 3.018867924528302e-05,
"logits/chosen": -0.6666778326034546,
"logits/rejected": -0.6678147315979004,
"logps/chosen": -8.114872932434082,
"logps/rejected": -13.392560958862305,
"loss": 1.1162137985229492,
"memory(GiB)": 46.73,
"nll_loss": 0.4446101784706116,
"rewards/accuracies": 0.59375,
"rewards/chosen": 0.20063960552215576,
"rewards/margins": 0.09723334014415741,
"rewards/rejected": 0.10340625792741776,
"step": 8,
"train_speed(iter/s)": 0.005426
},
{
"epoch": 0.02572577043322912,
"grad_norm": 4.046472549438477,
"learning_rate": 3.39622641509434e-05,
"logits/chosen": -0.5842044949531555,
"logits/rejected": -0.5892153382301331,
"logps/chosen": -13.877073287963867,
"logps/rejected": -14.116576194763184,
"loss": 1.259205937385559,
"memory(GiB)": 46.73,
"nll_loss": 0.5605449676513672,
"rewards/accuracies": 0.53125,
"rewards/chosen": 0.1392103135585785,
"rewards/margins": 0.09627523273229599,
"rewards/rejected": 0.0429350808262825,
"step": 9,
"train_speed(iter/s)": 0.005422
},
{
"epoch": 0.028584189370254576,
"grad_norm": 7.625533103942871,
"learning_rate": 3.7735849056603776e-05,
"logits/chosen": -0.6210353374481201,
"logits/rejected": -0.6224341988563538,
"logps/chosen": -8.32575798034668,
"logps/rejected": -11.715011596679688,
"loss": 1.2772942781448364,
"memory(GiB)": 46.73,
"nll_loss": 0.48597079515457153,
"rewards/accuracies": 0.4375,
"rewards/chosen": -0.043191827833652496,
"rewards/margins": 0.029505327343940735,
"rewards/rejected": -0.07269717007875443,
"step": 10,
"train_speed(iter/s)": 0.005438
},
{
"epoch": 0.03144260830728004,
"grad_norm": 11.961934089660645,
"learning_rate": 4.150943396226415e-05,
"logits/chosen": -0.6265634298324585,
"logits/rejected": -0.6289808750152588,
"logps/chosen": -7.129470348358154,
"logps/rejected": -11.932583808898926,
"loss": 1.447466254234314,
"memory(GiB)": 46.73,
"nll_loss": 0.6552329659461975,
"rewards/accuracies": 0.46875,
"rewards/chosen": -0.00290237320587039,
"rewards/margins": 0.06162097677588463,
"rewards/rejected": -0.0645233541727066,
"step": 11,
"train_speed(iter/s)": 0.005473
},
{
"epoch": 0.03430102724430549,
"grad_norm": 10.154479026794434,
"learning_rate": 4.528301886792453e-05,
"logits/chosen": -0.6388624906539917,
"logits/rejected": -0.639370858669281,
"logps/chosen": -9.490407943725586,
"logps/rejected": -12.88676643371582,
"loss": 1.4875458478927612,
"memory(GiB)": 46.73,
"nll_loss": 0.6468713283538818,
"rewards/accuracies": 0.4375,
"rewards/chosen": -0.10463112592697144,
"rewards/margins": -0.059477299451828,
"rewards/rejected": -0.04515381157398224,
"step": 12,
"train_speed(iter/s)": 0.005465
},
{
"epoch": 0.03715944618133095,
"grad_norm": 4.091860771179199,
"learning_rate": 4.9056603773584906e-05,
"logits/chosen": -0.6680133938789368,
"logits/rejected": -0.6711105108261108,
"logps/chosen": -5.56148099899292,
"logps/rejected": -13.865943908691406,
"loss": 1.0154482126235962,
"memory(GiB)": 46.73,
"nll_loss": 0.35444653034210205,
"rewards/accuracies": 0.65625,
"rewards/chosen": 0.12190410494804382,
"rewards/margins": 0.3293726444244385,
"rewards/rejected": -0.20746850967407227,
"step": 13,
"train_speed(iter/s)": 0.00546
},
{
"epoch": 0.04001786511835641,
"grad_norm": 3.039910316467285,
"learning_rate": 5.283018867924528e-05,
"logits/chosen": -0.6245446801185608,
"logits/rejected": -0.6280595660209656,
"logps/chosen": -7.042474269866943,
"logps/rejected": -14.88280963897705,
"loss": 0.9986085295677185,
"memory(GiB)": 46.73,
"nll_loss": 0.32772910594940186,
"rewards/accuracies": 0.59375,
"rewards/chosen": 0.08946945518255234,
"rewards/margins": 0.2548743188381195,
"rewards/rejected": -0.16540484130382538,
"step": 14,
"train_speed(iter/s)": 0.005463
},
{
"epoch": 0.042876284055381866,
"grad_norm": 2.8388617038726807,
"learning_rate": 5.660377358490566e-05,
"logits/chosen": -0.613956868648529,
"logits/rejected": -0.6150951385498047,
"logps/chosen": -5.398593902587891,
"logps/rejected": -10.984697341918945,
"loss": 0.9217166900634766,
"memory(GiB)": 46.73,
"nll_loss": 0.21436992287635803,
"rewards/accuracies": 0.65625,
"rewards/chosen": 0.2490297257900238,
"rewards/margins": 0.12685683369636536,
"rewards/rejected": 0.12217291444540024,
"step": 15,
"train_speed(iter/s)": 0.005464
},
{
"epoch": 0.045734702992407325,
"grad_norm": 3.623399257659912,
"learning_rate": 6.037735849056604e-05,
"logits/chosen": -0.5890456438064575,
"logits/rejected": -0.5907201766967773,
"logps/chosen": -7.65773868560791,
"logps/rejected": -15.24480152130127,
"loss": 1.130638837814331,
"memory(GiB)": 46.73,
"nll_loss": 0.33376482129096985,
"rewards/accuracies": 0.46875,
"rewards/chosen": 0.14319562911987305,
"rewards/margins": 0.01443251222372055,
"rewards/rejected": 0.1287631392478943,
"step": 16,
"train_speed(iter/s)": 0.00546
},
{
"epoch": 0.048593121929432784,
"grad_norm": 2.9850075244903564,
"learning_rate": 6.415094339622641e-05,
"logits/chosen": -0.5228931903839111,
"logits/rejected": -0.524716854095459,
"logps/chosen": -10.135262489318848,
"logps/rejected": -14.072588920593262,
"loss": 1.2770482301712036,
"memory(GiB)": 46.73,
"nll_loss": 0.48515522480010986,
"rewards/accuracies": 0.40625,
"rewards/chosen": 0.13618236780166626,
"rewards/margins": -0.09462341666221619,
"rewards/rejected": 0.23080575466156006,
"step": 17,
"train_speed(iter/s)": 0.005473
},
{
"epoch": 0.05145154086645824,
"grad_norm": 2.2746193408966064,
"learning_rate": 6.79245283018868e-05,
"logits/chosen": -0.5764032006263733,
"logits/rejected": -0.5762047171592712,
"logps/chosen": -11.675098419189453,
"logps/rejected": -10.994297981262207,
"loss": 1.2022521495819092,
"memory(GiB)": 46.73,
"nll_loss": 0.4671342372894287,
"rewards/accuracies": 0.46875,
"rewards/chosen": 0.1593710482120514,
"rewards/margins": -0.00844080001115799,
"rewards/rejected": 0.1678118258714676,
"step": 18,
"train_speed(iter/s)": 0.005468
},
{
"epoch": 0.0543099598034837,
"grad_norm": 2.324984312057495,
"learning_rate": 7.169811320754717e-05,
"logits/chosen": -0.567690908908844,
"logits/rejected": -0.569066047668457,
"logps/chosen": -9.0728120803833,
"logps/rejected": -12.268661499023438,
"loss": 1.1060843467712402,
"memory(GiB)": 46.73,
"nll_loss": 0.41300466656684875,
"rewards/accuracies": 0.53125,
"rewards/chosen": 0.23081830143928528,
"rewards/margins": 0.0710553377866745,
"rewards/rejected": 0.15976294875144958,
"step": 19,
"train_speed(iter/s)": 0.005463
},
{
"epoch": 0.05716837874050915,
"grad_norm": 2.0991458892822266,
"learning_rate": 7.547169811320755e-05,
"logits/chosen": -0.6091416478157043,
"logits/rejected": -0.6100034117698669,
"logps/chosen": -4.26762056350708,
"logps/rejected": -11.32187557220459,
"loss": 1.0021699666976929,
"memory(GiB)": 46.73,
"nll_loss": 0.2933175265789032,
"rewards/accuracies": 0.4375,
"rewards/chosen": 0.15655732154846191,
"rewards/margins": 0.008277412503957748,
"rewards/rejected": 0.14827993512153625,
"step": 20,
"train_speed(iter/s)": 0.005467
},
{
"epoch": 0.06002679767753461,
"grad_norm": 3.4958455562591553,
"learning_rate": 7.924528301886794e-05,
"logits/chosen": -0.571921706199646,
"logits/rejected": -0.572878360748291,
"logps/chosen": -9.612298965454102,
"logps/rejected": -12.484085083007812,
"loss": 1.1795949935913086,
"memory(GiB)": 46.73,
"nll_loss": 0.46760252118110657,
"rewards/accuracies": 0.53125,
"rewards/chosen": 0.14643912017345428,
"rewards/margins": 0.0200117826461792,
"rewards/rejected": 0.12642733752727509,
"step": 21,
"train_speed(iter/s)": 0.005467
},
{
"epoch": 0.06288521661456008,
"grad_norm": 3.175546169281006,
"learning_rate": 8.30188679245283e-05,
"logits/chosen": -0.6108006834983826,
"logits/rejected": -0.6111243367195129,
"logps/chosen": -6.207424163818359,
"logps/rejected": -7.818144798278809,
"loss": 1.1549935340881348,
"memory(GiB)": 46.73,
"nll_loss": 0.4683927893638611,
"rewards/accuracies": 0.5625,
"rewards/chosen": 0.23285990953445435,
"rewards/margins": 0.06634702533483505,
"rewards/rejected": 0.16651292145252228,
"step": 22,
"train_speed(iter/s)": 0.00547
},
{
"epoch": 0.06574363555158554,
"grad_norm": 2.4531869888305664,
"learning_rate": 8.679245283018869e-05,
"logits/chosen": -0.6012008190155029,
"logits/rejected": -0.6021928191184998,
"logps/chosen": -5.598664283752441,
"logps/rejected": -13.262667655944824,
"loss": 0.9260164499282837,
"memory(GiB)": 46.73,
"nll_loss": 0.33532270789146423,
"rewards/accuracies": 0.625,
"rewards/chosen": 0.3285560607910156,
"rewards/margins": 0.3157665431499481,
"rewards/rejected": 0.012789532542228699,
"step": 23,
"train_speed(iter/s)": 0.005467
},
{
"epoch": 0.06860205448861098,
"grad_norm": 2.328031301498413,
"learning_rate": 9.056603773584906e-05,
"logits/chosen": -0.567432165145874,
"logits/rejected": -0.5704118609428406,
"logps/chosen": -4.026985168457031,
"logps/rejected": -14.904813766479492,
"loss": 0.8984246253967285,
"memory(GiB)": 46.73,
"nll_loss": 0.26223480701446533,
"rewards/accuracies": 0.59375,
"rewards/chosen": 0.26638248562812805,
"rewards/margins": 0.22430934011936188,
"rewards/rejected": 0.042073119431734085,
"step": 24,
"train_speed(iter/s)": 0.005466
},
{
"epoch": 0.07146047342563644,
"grad_norm": 3.5119378566741943,
"learning_rate": 9.433962264150944e-05,
"logits/chosen": -0.5709348320960999,
"logits/rejected": -0.5688645243644714,
"logps/chosen": -7.716845989227295,
"logps/rejected": -7.868927955627441,
"loss": 1.113297462463379,
"memory(GiB)": 46.73,
"nll_loss": 0.3660878837108612,
"rewards/accuracies": 0.5,
"rewards/chosen": 0.2273256480693817,
"rewards/margins": -0.0022776294499635696,
"rewards/rejected": 0.22960326075553894,
"step": 25,
"train_speed(iter/s)": 0.005475
},
{
"epoch": 0.0743188923626619,
"grad_norm": 3.2336673736572266,
"learning_rate": 9.811320754716981e-05,
"logits/chosen": -0.589956521987915,
"logits/rejected": -0.587726354598999,
"logps/chosen": -10.072855949401855,
"logps/rejected": -12.857810974121094,
"loss": 1.0991942882537842,
"memory(GiB)": 46.73,
"nll_loss": 0.40110355615615845,
"rewards/accuracies": 0.5,
"rewards/chosen": 0.17576897144317627,
"rewards/margins": 0.11343260109424591,
"rewards/rejected": 0.062336355447769165,
"step": 26,
"train_speed(iter/s)": 0.005466
},
{
"epoch": 0.07717731129968736,
"grad_norm": 2.6813321113586426,
"learning_rate": 0.0001018867924528302,
"logits/chosen": -0.5832359194755554,
"logits/rejected": -0.5860565304756165,
"logps/chosen": -8.197118759155273,
"logps/rejected": -17.45244598388672,
"loss": 0.8366767764091492,
"memory(GiB)": 46.73,
"nll_loss": 0.2886262536048889,
"rewards/accuracies": 0.71875,
"rewards/chosen": 0.3297504186630249,
"rewards/margins": 0.48295390605926514,
"rewards/rejected": -0.15320347249507904,
"step": 27,
"train_speed(iter/s)": 0.00547
},
{
"epoch": 0.08003573023671282,
"grad_norm": 3.3800203800201416,
"learning_rate": 0.00010566037735849057,
"logits/chosen": -0.6005962491035461,
"logits/rejected": -0.6035608053207397,
"logps/chosen": -9.117904663085938,
"logps/rejected": -18.400161743164062,
"loss": 1.0143071413040161,
"memory(GiB)": 46.73,
"nll_loss": 0.4276316463947296,
"rewards/accuracies": 0.65625,
"rewards/chosen": 0.271901398897171,
"rewards/margins": 0.4319708049297333,
"rewards/rejected": -0.16006940603256226,
"step": 28,
"train_speed(iter/s)": 0.005468
},
{
"epoch": 0.08289414917373827,
"grad_norm": 5.461134433746338,
"learning_rate": 0.00010943396226415095,
"logits/chosen": -0.5596082210540771,
"logits/rejected": -0.5635167360305786,
"logps/chosen": -7.607837200164795,
"logps/rejected": -23.174358367919922,
"loss": 0.803045928478241,
"memory(GiB)": 46.73,
"nll_loss": 0.32165294885635376,
"rewards/accuracies": 0.78125,
"rewards/chosen": 0.3834715783596039,
"rewards/margins": 0.7214637994766235,
"rewards/rejected": -0.33799219131469727,
"step": 29,
"train_speed(iter/s)": 0.005464
},
{
"epoch": 0.08575256811076373,
"grad_norm": 3.3377506732940674,
"learning_rate": 0.00011320754716981132,
"logits/chosen": -0.6003558039665222,
"logits/rejected": -0.6016712188720703,
"logps/chosen": -7.941157817840576,
"logps/rejected": -10.564404487609863,
"loss": 1.0737202167510986,
"memory(GiB)": 46.73,
"nll_loss": 0.3314566910266876,
"rewards/accuracies": 0.59375,
"rewards/chosen": 0.1379927098751068,
"rewards/margins": 0.08670535683631897,
"rewards/rejected": 0.05128733813762665,
"step": 30,
"train_speed(iter/s)": 0.005461
},
{
"epoch": 0.08861098704778919,
"grad_norm": 3.4214563369750977,
"learning_rate": 0.0001169811320754717,
"logits/chosen": -0.5186684727668762,
"logits/rejected": -0.5189406275749207,
"logps/chosen": -6.143683910369873,
"logps/rejected": -25.88001251220703,
"loss": 0.7792238593101501,
"memory(GiB)": 46.73,
"nll_loss": 0.2514691948890686,
"rewards/accuracies": 0.71875,
"rewards/chosen": 0.2757991552352905,
"rewards/margins": 0.5156725645065308,
"rewards/rejected": -0.23987337946891785,
"step": 31,
"train_speed(iter/s)": 0.005459
},
{
"epoch": 0.09146940598481465,
"grad_norm": 4.645272731781006,
"learning_rate": 0.00012075471698113207,
"logits/chosen": -0.5988867282867432,
"logits/rejected": -0.6016397476196289,
"logps/chosen": -5.776233673095703,
"logps/rejected": -22.404544830322266,
"loss": 0.8892383575439453,
"memory(GiB)": 46.73,
"nll_loss": 0.4011368155479431,
"rewards/accuracies": 0.75,
"rewards/chosen": 0.22715790569782257,
"rewards/margins": 0.7724226713180542,
"rewards/rejected": -0.545264720916748,
"step": 32,
"train_speed(iter/s)": 0.005454
},
{
"epoch": 0.09432782492184011,
"grad_norm": 4.586422443389893,
"learning_rate": 0.00012452830188679244,
"logits/chosen": -0.5782912969589233,
"logits/rejected": -0.5768243670463562,
"logps/chosen": -10.939208984375,
"logps/rejected": -13.486640930175781,
"loss": 1.1607584953308105,
"memory(GiB)": 46.73,
"nll_loss": 0.5877886414527893,
"rewards/accuracies": 0.65625,
"rewards/chosen": 0.21317529678344727,
"rewards/margins": 0.4141784906387329,
"rewards/rejected": -0.20100319385528564,
"step": 33,
"train_speed(iter/s)": 0.005457
},
{
"epoch": 0.09718624385886557,
"grad_norm": 4.306042671203613,
"learning_rate": 0.00012830188679245283,
"logits/chosen": -0.6019578576087952,
"logits/rejected": -0.6082974076271057,
"logps/chosen": -7.5170578956604,
"logps/rejected": -24.889406204223633,
"loss": 0.9509016275405884,
"memory(GiB)": 46.73,
"nll_loss": 0.4247076213359833,
"rewards/accuracies": 0.75,
"rewards/chosen": 0.10510760545730591,
"rewards/margins": 0.8037927150726318,
"rewards/rejected": -0.6986850500106812,
"step": 34,
"train_speed(iter/s)": 0.005456
},
{
"epoch": 0.10004466279589103,
"grad_norm": 3.002274751663208,
"learning_rate": 0.0001320754716981132,
"logits/chosen": -0.6133092641830444,
"logits/rejected": -0.6127456426620483,
"logps/chosen": -8.859593391418457,
"logps/rejected": -17.02096939086914,
"loss": 0.8848217129707336,
"memory(GiB)": 46.73,
"nll_loss": 0.3480006456375122,
"rewards/accuracies": 0.71875,
"rewards/chosen": 0.25863486528396606,
"rewards/margins": 0.5611037015914917,
"rewards/rejected": -0.302468866109848,
"step": 35,
"train_speed(iter/s)": 0.005457
},
{
"epoch": 0.10290308173291648,
"grad_norm": 4.299287796020508,
"learning_rate": 0.0001358490566037736,
"logits/chosen": -0.5725032091140747,
"logits/rejected": -0.5725142359733582,
"logps/chosen": -8.371686935424805,
"logps/rejected": -17.657852172851562,
"loss": 0.8825864791870117,
"memory(GiB)": 46.73,
"nll_loss": 0.3603641390800476,
"rewards/accuracies": 0.78125,
"rewards/chosen": 0.23154468834400177,
"rewards/margins": 0.6240193843841553,
"rewards/rejected": -0.3924746811389923,
"step": 36,
"train_speed(iter/s)": 0.005457
},
{
"epoch": 0.10576150066994194,
"grad_norm": 4.354315757751465,
"learning_rate": 0.00013962264150943395,
"logits/chosen": -0.5943324565887451,
"logits/rejected": -0.5940991044044495,
"logps/chosen": -7.657552719116211,
"logps/rejected": -16.183917999267578,
"loss": 0.8160735964775085,
"memory(GiB)": 46.73,
"nll_loss": 0.3588046133518219,
"rewards/accuracies": 0.84375,
"rewards/chosen": 0.27544379234313965,
"rewards/margins": 0.7471473217010498,
"rewards/rejected": -0.4717034101486206,
"step": 37,
"train_speed(iter/s)": 0.005452
},
{
"epoch": 0.1086199196069674,
"grad_norm": 7.916697978973389,
"learning_rate": 0.00014339622641509434,
"logits/chosen": -0.5676888227462769,
"logits/rejected": -0.5714080929756165,
"logps/chosen": -6.698662757873535,
"logps/rejected": -17.954235076904297,
"loss": 1.052018642425537,
"memory(GiB)": 46.73,
"nll_loss": 0.49374452233314514,
"rewards/accuracies": 0.78125,
"rewards/chosen": 0.16338011622428894,
"rewards/margins": 0.42942774295806885,
"rewards/rejected": -0.2660475969314575,
"step": 38,
"train_speed(iter/s)": 0.005452
},
{
"epoch": 0.11147833854399285,
"grad_norm": 3.7271363735198975,
"learning_rate": 0.00014716981132075472,
"logits/chosen": -0.6097766160964966,
"logits/rejected": -0.6135396957397461,
"logps/chosen": -7.30006217956543,
"logps/rejected": -22.168495178222656,
"loss": 0.7729511857032776,
"memory(GiB)": 46.73,
"nll_loss": 0.3125499188899994,
"rewards/accuracies": 0.78125,
"rewards/chosen": 0.28066012263298035,
"rewards/margins": 0.8108583092689514,
"rewards/rejected": -0.5301981568336487,
"step": 39,
"train_speed(iter/s)": 0.00545
},
{
"epoch": 0.1143367574810183,
"grad_norm": 2.960145950317383,
"learning_rate": 0.0001509433962264151,
"logits/chosen": -0.6132208108901978,
"logits/rejected": -0.6163071990013123,
"logps/chosen": -7.024638652801514,
"logps/rejected": -21.298852920532227,
"loss": 0.8106734752655029,
"memory(GiB)": 46.73,
"nll_loss": 0.37238579988479614,
"rewards/accuracies": 0.78125,
"rewards/chosen": 0.39458420872688293,
"rewards/margins": 0.8476477265357971,
"rewards/rejected": -0.45306357741355896,
"step": 40,
"train_speed(iter/s)": 0.005445
},
{
"epoch": 0.11719517641804376,
"grad_norm": 4.3203630447387695,
"learning_rate": 0.0001547169811320755,
"logits/chosen": -0.5976248979568481,
"logits/rejected": -0.6002449989318848,
"logps/chosen": -5.656615257263184,
"logps/rejected": -16.032827377319336,
"loss": 0.9440045952796936,
"memory(GiB)": 46.73,
"nll_loss": 0.33253738284111023,
"rewards/accuracies": 0.59375,
"rewards/chosen": 0.14414586126804352,
"rewards/margins": 0.5006409287452698,
"rewards/rejected": -0.35649505257606506,
"step": 41,
"train_speed(iter/s)": 0.005445
},
{
"epoch": 0.12005359535506922,
"grad_norm": 4.646491527557373,
"learning_rate": 0.00015849056603773587,
"logits/chosen": -0.5956608653068542,
"logits/rejected": -0.5956603288650513,
"logps/chosen": -11.719463348388672,
"logps/rejected": -27.070579528808594,
"loss": 1.0076483488082886,
"memory(GiB)": 46.73,
"nll_loss": 0.5070124268531799,
"rewards/accuracies": 0.71875,
"rewards/chosen": 0.15291725099086761,
"rewards/margins": 0.7710469961166382,
"rewards/rejected": -0.6181297898292542,
"step": 42,
"train_speed(iter/s)": 0.005446
},
{
"epoch": 0.12291201429209468,
"grad_norm": 4.248917102813721,
"learning_rate": 0.00016226415094339625,
"logits/chosen": -0.6100150942802429,
"logits/rejected": -0.6142972111701965,
"logps/chosen": -6.201865196228027,
"logps/rejected": -19.82131004333496,
"loss": 0.7969534993171692,
"memory(GiB)": 46.73,
"nll_loss": 0.31225427985191345,
"rewards/accuracies": 0.6875,
"rewards/chosen": 0.20218679308891296,
"rewards/margins": 0.705444872379303,
"rewards/rejected": -0.5032580494880676,
"step": 43,
"train_speed(iter/s)": 0.005448
},
{
"epoch": 0.12577043322912015,
"grad_norm": 3.1864066123962402,
"learning_rate": 0.0001660377358490566,
"logits/chosen": -0.6078452467918396,
"logits/rejected": -0.6100336909294128,
"logps/chosen": -8.217609405517578,
"logps/rejected": -18.432086944580078,
"loss": 0.945781409740448,
"memory(GiB)": 46.73,
"nll_loss": 0.4447736442089081,
"rewards/accuracies": 0.8125,
"rewards/chosen": 0.16747131943702698,
"rewards/margins": 0.6352076530456543,
"rewards/rejected": -0.46773630380630493,
"step": 44,
"train_speed(iter/s)": 0.005451
},
{
"epoch": 0.1286288521661456,
"grad_norm": 2.8247904777526855,
"learning_rate": 0.000169811320754717,
"logits/chosen": -0.6424505710601807,
"logits/rejected": -0.6455634236335754,
"logps/chosen": -4.626930236816406,
"logps/rejected": -18.966289520263672,
"loss": 0.6525614261627197,
"memory(GiB)": 46.73,
"nll_loss": 0.20949943363666534,
"rewards/accuracies": 0.90625,
"rewards/chosen": 0.1935967355966568,
"rewards/margins": 0.7181073427200317,
"rewards/rejected": -0.5245105624198914,
"step": 45,
"train_speed(iter/s)": 0.005449
},
{
"epoch": 0.13148727110317107,
"grad_norm": 5.167090892791748,
"learning_rate": 0.00017358490566037738,
"logits/chosen": -0.6390554308891296,
"logits/rejected": -0.6455981731414795,
"logps/chosen": -7.457905292510986,
"logps/rejected": -22.238759994506836,
"loss": 0.7052859663963318,
"memory(GiB)": 46.73,
"nll_loss": 0.3145278990268707,
"rewards/accuracies": 0.90625,
"rewards/chosen": 0.3406547009944916,
"rewards/margins": 0.9184964895248413,
"rewards/rejected": -0.5778417587280273,
"step": 46,
"train_speed(iter/s)": 0.005446
},
{
"epoch": 0.1343456900401965,
"grad_norm": 3.110797166824341,
"learning_rate": 0.00017735849056603776,
"logits/chosen": -0.6957284212112427,
"logits/rejected": -0.6984925866127014,
"logps/chosen": -6.335500717163086,
"logps/rejected": -26.946069717407227,
"loss": 0.6684616804122925,
"memory(GiB)": 46.73,
"nll_loss": 0.27696001529693604,
"rewards/accuracies": 0.78125,
"rewards/chosen": 0.36519789695739746,
"rewards/margins": 1.261197805404663,
"rewards/rejected": -0.8960000276565552,
"step": 47,
"train_speed(iter/s)": 0.005445
},
{
"epoch": 0.13720410897722196,
"grad_norm": 5.592209815979004,
"learning_rate": 0.00018113207547169812,
"logits/chosen": -0.6557337641716003,
"logits/rejected": -0.6595371961593628,
"logps/chosen": -6.262232780456543,
"logps/rejected": -22.550495147705078,
"loss": 0.844598650932312,
"memory(GiB)": 46.73,
"nll_loss": 0.32042089104652405,
"rewards/accuracies": 0.71875,
"rewards/chosen": 0.098446786403656,
"rewards/margins": 1.1042643785476685,
"rewards/rejected": -1.0058175325393677,
"step": 48,
"train_speed(iter/s)": 0.005444
},
{
"epoch": 0.14006252791424742,
"grad_norm": 5.518631458282471,
"learning_rate": 0.0001849056603773585,
"logits/chosen": -0.7261903285980225,
"logits/rejected": -0.7333111763000488,
"logps/chosen": -6.155282020568848,
"logps/rejected": -28.635177612304688,
"loss": 0.7839219570159912,
"memory(GiB)": 46.73,
"nll_loss": 0.3167538046836853,
"rewards/accuracies": 0.75,
"rewards/chosen": 0.18123595416545868,
"rewards/margins": 1.343546986579895,
"rewards/rejected": -1.1623109579086304,
"step": 49,
"train_speed(iter/s)": 0.00544
},
{
"epoch": 0.14292094685127288,
"grad_norm": 5.368433475494385,
"learning_rate": 0.00018867924528301889,
"logits/chosen": -0.7460846304893494,
"logits/rejected": -0.7433331608772278,
"logps/chosen": -8.476225852966309,
"logps/rejected": -20.479339599609375,
"loss": 1.041689395904541,
"memory(GiB)": 46.73,
"nll_loss": 0.5162184834480286,
"rewards/accuracies": 0.6875,
"rewards/chosen": 0.07575411349534988,
"rewards/margins": 0.8544278144836426,
"rewards/rejected": -0.7786736488342285,
"step": 50,
"train_speed(iter/s)": 0.005439
}
],
"logging_steps": 1,
"max_steps": 1047,
"num_input_tokens_seen": 0,
"num_train_epochs": 3,
"save_steps": 50,
"stateful_callbacks": {
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": true,
"should_training_stop": false
},
"attributes": {}
}
},
"total_flos": 3.488196344152064e+17,
"train_batch_size": 1,
"trial_name": null,
"trial_params": null
}