PEFT
Safetensors
3add2gt6-100 / trainer_state.json
windgrin's picture
Upload folder using huggingface_hub
6da6858 verified
Raw
History Blame Contribute Delete
64.7 kB
{
"best_global_step": null,
"best_metric": null,
"best_model_checkpoint": null,
"epoch": 0.1708580276576432,
"eval_steps": 300,
"global_step": 100,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"epoch": 0.0017085802765764322,
"grad_norm": 9.203307151794434,
"learning_rate": 3.3898305084745763e-06,
"logits/chosen": -0.6409764885902405,
"logits/rejected": -0.6413162350654602,
"logps/chosen": -8.591513633728027,
"logps/rejected": -9.922354698181152,
"loss": 1.2514135837554932,
"memory(GiB)": 45.3,
"nll_loss": 0.5582665801048279,
"rewards/accuracies": 0.0,
"rewards/chosen": 0.0,
"rewards/margins": 0.0,
"rewards/rejected": 0.0,
"step": 1,
"train_speed(iter/s)": 0.005423
},
{
"epoch": 0.0034171605531528645,
"grad_norm": 4.572653293609619,
"learning_rate": 6.779661016949153e-06,
"logits/chosen": -0.6253237724304199,
"logits/rejected": -0.6232100129127502,
"logps/chosen": -9.215431213378906,
"logps/rejected": -6.302733898162842,
"loss": 1.1804862022399902,
"memory(GiB)": 45.3,
"nll_loss": 0.4873391091823578,
"rewards/accuracies": 0.0,
"rewards/chosen": 0.0,
"rewards/margins": 0.0,
"rewards/rejected": 0.0,
"step": 2,
"train_speed(iter/s)": 0.005426
},
{
"epoch": 0.005125740829729297,
"grad_norm": 10.135663986206055,
"learning_rate": 1.016949152542373e-05,
"logits/chosen": -0.5830379724502563,
"logits/rejected": -0.5847949981689453,
"logps/chosen": -6.387916088104248,
"logps/rejected": -12.526434898376465,
"loss": 1.1388403177261353,
"memory(GiB)": 46.08,
"nll_loss": 0.44991743564605713,
"rewards/accuracies": 0.71875,
"rewards/chosen": 0.0018886500038206577,
"rewards/margins": 0.008566470816731453,
"rewards/rejected": -0.006677820347249508,
"step": 3,
"train_speed(iter/s)": 0.005372
},
{
"epoch": 0.006834321106305729,
"grad_norm": 8.09815788269043,
"learning_rate": 1.3559322033898305e-05,
"logits/chosen": -0.5831664800643921,
"logits/rejected": -0.5881690382957458,
"logps/chosen": -9.77461051940918,
"logps/rejected": -15.103912353515625,
"loss": 1.2644962072372437,
"memory(GiB)": 46.08,
"nll_loss": 0.5699671506881714,
"rewards/accuracies": 0.4375,
"rewards/chosen": -0.0013185496209189296,
"rewards/margins": -0.0025646828580647707,
"rewards/rejected": 0.0012461334699764848,
"step": 4,
"train_speed(iter/s)": 0.005433
},
{
"epoch": 0.008542901382882162,
"grad_norm": 10.546202659606934,
"learning_rate": 1.694915254237288e-05,
"logits/chosen": -0.6210501194000244,
"logits/rejected": -0.6261105537414551,
"logps/chosen": -9.743502616882324,
"logps/rejected": -13.954730987548828,
"loss": 1.2041635513305664,
"memory(GiB)": 46.08,
"nll_loss": 0.5165743231773376,
"rewards/accuracies": 0.53125,
"rewards/chosen": 0.014782106503844261,
"rewards/margins": 0.011779396794736385,
"rewards/rejected": 0.0030027113389223814,
"step": 5,
"train_speed(iter/s)": 0.005434
},
{
"epoch": 0.010251481659458593,
"grad_norm": 5.953731060028076,
"learning_rate": 2.033898305084746e-05,
"logits/chosen": -0.6194843649864197,
"logits/rejected": -0.6225060224533081,
"logps/chosen": -8.993276596069336,
"logps/rejected": -11.800742149353027,
"loss": 1.2383989095687866,
"memory(GiB)": 46.08,
"nll_loss": 0.5413038730621338,
"rewards/accuracies": 0.46875,
"rewards/chosen": 0.02151685394346714,
"rewards/margins": -0.004275719169527292,
"rewards/rejected": 0.025792576372623444,
"step": 6,
"train_speed(iter/s)": 0.005421
},
{
"epoch": 0.011960061936035027,
"grad_norm": 3.4447383880615234,
"learning_rate": 2.3728813559322036e-05,
"logits/chosen": -0.5979399681091309,
"logits/rejected": -0.597865104675293,
"logps/chosen": -11.88587760925293,
"logps/rejected": -12.513296127319336,
"loss": 1.1787316799163818,
"memory(GiB)": 46.08,
"nll_loss": 0.4771195948123932,
"rewards/accuracies": 0.46875,
"rewards/chosen": 0.001614744309335947,
"rewards/margins": -0.006370083428919315,
"rewards/rejected": 0.007984823547303677,
"step": 7,
"train_speed(iter/s)": 0.005421
},
{
"epoch": 0.013668642212611458,
"grad_norm": 4.3422627449035645,
"learning_rate": 2.711864406779661e-05,
"logits/chosen": -0.5695681571960449,
"logits/rejected": -0.5736703276634216,
"logps/chosen": -8.691235542297363,
"logps/rejected": -17.510940551757812,
"loss": 1.085353970527649,
"memory(GiB)": 46.08,
"nll_loss": 0.4569101631641388,
"rewards/accuracies": 0.65625,
"rewards/chosen": 0.061018284410238266,
"rewards/margins": 0.16366331279277802,
"rewards/rejected": -0.10264502465724945,
"step": 8,
"train_speed(iter/s)": 0.005421
},
{
"epoch": 0.015377222489187891,
"grad_norm": 6.347766399383545,
"learning_rate": 3.050847457627119e-05,
"logits/chosen": -0.6150330305099487,
"logits/rejected": -0.6163787841796875,
"logps/chosen": -14.26973819732666,
"logps/rejected": -12.656587600708008,
"loss": 1.3125040531158447,
"memory(GiB)": 46.08,
"nll_loss": 0.6051884293556213,
"rewards/accuracies": 0.59375,
"rewards/chosen": -0.06490564346313477,
"rewards/margins": 0.03234899416565895,
"rewards/rejected": -0.09725463390350342,
"step": 9,
"train_speed(iter/s)": 0.005427
},
{
"epoch": 0.017085802765764324,
"grad_norm": 3.609342575073242,
"learning_rate": 3.389830508474576e-05,
"logits/chosen": -0.5823943018913269,
"logits/rejected": -0.5893073678016663,
"logps/chosen": -12.539135932922363,
"logps/rejected": -19.231651306152344,
"loss": 1.154615044593811,
"memory(GiB)": 46.08,
"nll_loss": 0.5292682647705078,
"rewards/accuracies": 0.71875,
"rewards/chosen": -0.0102485166862607,
"rewards/margins": 0.24539220333099365,
"rewards/rejected": -0.2556407153606415,
"step": 10,
"train_speed(iter/s)": 0.00544
},
{
"epoch": 0.018794383042340754,
"grad_norm": 4.803543567657471,
"learning_rate": 3.728813559322034e-05,
"logits/chosen": -0.6298958659172058,
"logits/rejected": -0.6301961541175842,
"logps/chosen": -10.286799430847168,
"logps/rejected": -11.364641189575195,
"loss": 1.143830418586731,
"memory(GiB)": 46.08,
"nll_loss": 0.43475160002708435,
"rewards/accuracies": 0.46875,
"rewards/chosen": -0.06166127696633339,
"rewards/margins": 0.1280723363161087,
"rewards/rejected": -0.189733624458313,
"step": 11,
"train_speed(iter/s)": 0.005459
},
{
"epoch": 0.020502963318917187,
"grad_norm": 6.843598365783691,
"learning_rate": 4.067796610169492e-05,
"logits/chosen": -0.6147834062576294,
"logits/rejected": -0.6201154589653015,
"logps/chosen": -11.104015350341797,
"logps/rejected": -14.71792221069336,
"loss": 1.2689580917358398,
"memory(GiB)": 46.08,
"nll_loss": 0.4583723843097687,
"rewards/accuracies": 0.375,
"rewards/chosen": -0.1446399688720703,
"rewards/margins": -0.06440749764442444,
"rewards/rejected": -0.08023246377706528,
"step": 12,
"train_speed(iter/s)": 0.005454
},
{
"epoch": 0.02221154359549362,
"grad_norm": 4.361201286315918,
"learning_rate": 4.4067796610169495e-05,
"logits/chosen": -0.6593450307846069,
"logits/rejected": -0.6623726487159729,
"logps/chosen": -8.788830757141113,
"logps/rejected": -12.09660530090332,
"loss": 1.091460108757019,
"memory(GiB)": 46.08,
"nll_loss": 0.38157719373703003,
"rewards/accuracies": 0.5625,
"rewards/chosen": -0.03397805988788605,
"rewards/margins": 0.08494514226913452,
"rewards/rejected": -0.11892320215702057,
"step": 13,
"train_speed(iter/s)": 0.005465
},
{
"epoch": 0.023920123872070053,
"grad_norm": 4.36707067489624,
"learning_rate": 4.745762711864407e-05,
"logits/chosen": -0.6003404259681702,
"logits/rejected": -0.6018444895744324,
"logps/chosen": -9.472915649414062,
"logps/rejected": -12.008777618408203,
"loss": 1.2156641483306885,
"memory(GiB)": 46.08,
"nll_loss": 0.42055219411849976,
"rewards/accuracies": 0.40625,
"rewards/chosen": -0.07689498364925385,
"rewards/margins": -0.1264859437942505,
"rewards/rejected": 0.049590952694416046,
"step": 14,
"train_speed(iter/s)": 0.00548
},
{
"epoch": 0.025628704148646483,
"grad_norm": 3.2864296436309814,
"learning_rate": 5.0847457627118643e-05,
"logits/chosen": -0.6285042762756348,
"logits/rejected": -0.6272621154785156,
"logps/chosen": -14.201019287109375,
"logps/rejected": -10.998590469360352,
"loss": 1.2311502695083618,
"memory(GiB)": 46.08,
"nll_loss": 0.5152750015258789,
"rewards/accuracies": 0.5625,
"rewards/chosen": 0.06618006527423859,
"rewards/margins": 0.029741406440734863,
"rewards/rejected": 0.036438651382923126,
"step": 15,
"train_speed(iter/s)": 0.005474
},
{
"epoch": 0.027337284425222916,
"grad_norm": 2.4144492149353027,
"learning_rate": 5.423728813559322e-05,
"logits/chosen": -0.6098039746284485,
"logits/rejected": -0.6130300760269165,
"logps/chosen": -3.4820291996002197,
"logps/rejected": -16.196063995361328,
"loss": 0.8393359780311584,
"memory(GiB)": 46.08,
"nll_loss": 0.214947909116745,
"rewards/accuracies": 0.6875,
"rewards/chosen": 0.0826798751950264,
"rewards/margins": 0.17492221295833588,
"rewards/rejected": -0.09224233776330948,
"step": 16,
"train_speed(iter/s)": 0.005477
},
{
"epoch": 0.02904586470179935,
"grad_norm": 2.3232851028442383,
"learning_rate": 5.76271186440678e-05,
"logits/chosen": -0.5909145474433899,
"logits/rejected": -0.593756377696991,
"logps/chosen": -7.929438591003418,
"logps/rejected": -14.363272666931152,
"loss": 0.9911059737205505,
"memory(GiB)": 46.08,
"nll_loss": 0.34508591890335083,
"rewards/accuracies": 0.65625,
"rewards/chosen": 0.10390710830688477,
"rewards/margins": 0.13225752115249634,
"rewards/rejected": -0.028350409120321274,
"step": 17,
"train_speed(iter/s)": 0.005482
},
{
"epoch": 0.030754444978375782,
"grad_norm": 2.344477891921997,
"learning_rate": 6.101694915254238e-05,
"logits/chosen": -0.5697246789932251,
"logits/rejected": -0.5692474246025085,
"logps/chosen": -6.287097930908203,
"logps/rejected": -10.676097869873047,
"loss": 0.9974570274353027,
"memory(GiB)": 46.08,
"nll_loss": 0.3142527639865875,
"rewards/accuracies": 0.5625,
"rewards/chosen": 0.09520465135574341,
"rewards/margins": 0.04853628948330879,
"rewards/rejected": 0.046668365597724915,
"step": 18,
"train_speed(iter/s)": 0.005489
},
{
"epoch": 0.03246302525495221,
"grad_norm": 2.361417531967163,
"learning_rate": 6.440677966101695e-05,
"logits/chosen": -0.5909584164619446,
"logits/rejected": -0.596694827079773,
"logps/chosen": -4.706894874572754,
"logps/rejected": -12.18591022491455,
"loss": 0.8993738889694214,
"memory(GiB)": 46.08,
"nll_loss": 0.2403678447008133,
"rewards/accuracies": 0.65625,
"rewards/chosen": 0.1180216372013092,
"rewards/margins": 0.09891890734434128,
"rewards/rejected": 0.01910274103283882,
"step": 19,
"train_speed(iter/s)": 0.005497
},
{
"epoch": 0.03417160553152865,
"grad_norm": 2.1051840782165527,
"learning_rate": 6.779661016949152e-05,
"logits/chosen": -0.5925375819206238,
"logits/rejected": -0.5939764380455017,
"logps/chosen": -7.690135478973389,
"logps/rejected": -11.360199928283691,
"loss": 0.9811086058616638,
"memory(GiB)": 46.08,
"nll_loss": 0.27671271562576294,
"rewards/accuracies": 0.53125,
"rewards/chosen": 0.15354080498218536,
"rewards/margins": 0.02018781006336212,
"rewards/rejected": 0.13335299491882324,
"step": 20,
"train_speed(iter/s)": 0.005507
},
{
"epoch": 0.03588018580810508,
"grad_norm": 2.453577995300293,
"learning_rate": 7.11864406779661e-05,
"logits/chosen": -0.589929461479187,
"logits/rejected": -0.5913950800895691,
"logps/chosen": -6.006174564361572,
"logps/rejected": -12.356660842895508,
"loss": 0.8762722015380859,
"memory(GiB)": 46.08,
"nll_loss": 0.26102662086486816,
"rewards/accuracies": 0.6875,
"rewards/chosen": 0.15477147698402405,
"rewards/margins": 0.20186343789100647,
"rewards/rejected": -0.047091953456401825,
"step": 21,
"train_speed(iter/s)": 0.005501
},
{
"epoch": 0.03758876608468151,
"grad_norm": 2.334592819213867,
"learning_rate": 7.457627118644068e-05,
"logits/chosen": -0.6286447048187256,
"logits/rejected": -0.6310911178588867,
"logps/chosen": -9.828102111816406,
"logps/rejected": -16.171802520751953,
"loss": 0.9827708601951599,
"memory(GiB)": 46.08,
"nll_loss": 0.40016523003578186,
"rewards/accuracies": 0.78125,
"rewards/chosen": 0.22255462408065796,
"rewards/margins": 0.2890108525753021,
"rewards/rejected": -0.06645623594522476,
"step": 22,
"train_speed(iter/s)": 0.005501
},
{
"epoch": 0.039297346361257944,
"grad_norm": 2.763946533203125,
"learning_rate": 7.796610169491526e-05,
"logits/chosen": -0.6423724889755249,
"logits/rejected": -0.6475900411605835,
"logps/chosen": -7.048077583312988,
"logps/rejected": -17.518115997314453,
"loss": 1.029776692390442,
"memory(GiB)": 46.08,
"nll_loss": 0.4258265495300293,
"rewards/accuracies": 0.78125,
"rewards/chosen": 0.13568007946014404,
"rewards/margins": 0.24192118644714355,
"rewards/rejected": -0.10624107718467712,
"step": 23,
"train_speed(iter/s)": 0.005498
},
{
"epoch": 0.041005926637834374,
"grad_norm": 5.438773155212402,
"learning_rate": 8.135593220338983e-05,
"logits/chosen": -0.611075758934021,
"logits/rejected": -0.6109172701835632,
"logps/chosen": -8.579011917114258,
"logps/rejected": -12.74751091003418,
"loss": 1.2176915407180786,
"memory(GiB)": 46.08,
"nll_loss": 0.5213994979858398,
"rewards/accuracies": 0.59375,
"rewards/chosen": -0.010570855811238289,
"rewards/margins": 0.06740333139896393,
"rewards/rejected": -0.07797417044639587,
"step": 24,
"train_speed(iter/s)": 0.005493
},
{
"epoch": 0.0427145069144108,
"grad_norm": 3.8305866718292236,
"learning_rate": 8.474576271186441e-05,
"logits/chosen": -0.6644467711448669,
"logits/rejected": -0.6674079298973083,
"logps/chosen": -6.975298881530762,
"logps/rejected": -15.503819465637207,
"loss": 0.922063410282135,
"memory(GiB)": 46.08,
"nll_loss": 0.3326256275177002,
"rewards/accuracies": 0.71875,
"rewards/chosen": 0.06792093813419342,
"rewards/margins": 0.324211061000824,
"rewards/rejected": -0.25629013776779175,
"step": 25,
"train_speed(iter/s)": 0.00549
},
{
"epoch": 0.04442308719098724,
"grad_norm": 4.446774959564209,
"learning_rate": 8.813559322033899e-05,
"logits/chosen": -0.6409133076667786,
"logits/rejected": -0.6452510356903076,
"logps/chosen": -5.22960090637207,
"logps/rejected": -16.918365478515625,
"loss": 0.7774365544319153,
"memory(GiB)": 46.08,
"nll_loss": 0.2448062300682068,
"rewards/accuracies": 0.84375,
"rewards/chosen": 0.2400483787059784,
"rewards/margins": 0.39764925837516785,
"rewards/rejected": -0.15760089457035065,
"step": 26,
"train_speed(iter/s)": 0.005489
},
{
"epoch": 0.04613166746756367,
"grad_norm": 2.5869643688201904,
"learning_rate": 9.152542372881357e-05,
"logits/chosen": -0.6091906428337097,
"logits/rejected": -0.6120930910110474,
"logps/chosen": -7.03964376449585,
"logps/rejected": -18.091930389404297,
"loss": 0.8498358726501465,
"memory(GiB)": 46.08,
"nll_loss": 0.3106813132762909,
"rewards/accuracies": 0.78125,
"rewards/chosen": 0.1571023166179657,
"rewards/margins": 0.4190843403339386,
"rewards/rejected": -0.2619820237159729,
"step": 27,
"train_speed(iter/s)": 0.005489
},
{
"epoch": 0.047840247744140106,
"grad_norm": 3.0630600452423096,
"learning_rate": 9.491525423728815e-05,
"logits/chosen": -0.6014366745948792,
"logits/rejected": -0.6016579270362854,
"logps/chosen": -9.281977653503418,
"logps/rejected": -13.255182266235352,
"loss": 0.9999822974205017,
"memory(GiB)": 46.08,
"nll_loss": 0.3916056454181671,
"rewards/accuracies": 0.71875,
"rewards/chosen": 0.0838853195309639,
"rewards/margins": 0.22357328236103058,
"rewards/rejected": -0.13968798518180847,
"step": 28,
"train_speed(iter/s)": 0.005488
},
{
"epoch": 0.049548828020716536,
"grad_norm": 4.956308364868164,
"learning_rate": 9.830508474576272e-05,
"logits/chosen": -0.6361557841300964,
"logits/rejected": -0.6375819444656372,
"logps/chosen": -5.407459735870361,
"logps/rejected": -12.960749626159668,
"loss": 0.9380594491958618,
"memory(GiB)": 46.08,
"nll_loss": 0.39800193905830383,
"rewards/accuracies": 0.75,
"rewards/chosen": 0.14713114500045776,
"rewards/margins": 0.4169777035713196,
"rewards/rejected": -0.2698465585708618,
"step": 29,
"train_speed(iter/s)": 0.005494
},
{
"epoch": 0.051257408297292965,
"grad_norm": 6.679542541503906,
"learning_rate": 0.00010169491525423729,
"logits/chosen": -0.6229231357574463,
"logits/rejected": -0.6250395178794861,
"logps/chosen": -11.77493667602539,
"logps/rejected": -18.192317962646484,
"loss": 0.7899165749549866,
"memory(GiB)": 46.08,
"nll_loss": 0.2795858085155487,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.09651458263397217,
"rewards/margins": 0.49087047576904297,
"rewards/rejected": -0.3943559229373932,
"step": 30,
"train_speed(iter/s)": 0.005497
},
{
"epoch": 0.0529659885738694,
"grad_norm": 4.011873245239258,
"learning_rate": 0.00010508474576271188,
"logits/chosen": -0.6524882912635803,
"logits/rejected": -0.6541539430618286,
"logps/chosen": -7.8713202476501465,
"logps/rejected": -11.641451835632324,
"loss": 0.9657379984855652,
"memory(GiB)": 46.08,
"nll_loss": 0.40233710408210754,
"rewards/accuracies": 0.71875,
"rewards/chosen": 0.11578395962715149,
"rewards/margins": 0.36746829748153687,
"rewards/rejected": -0.25168436765670776,
"step": 31,
"train_speed(iter/s)": 0.005488
},
{
"epoch": 0.05467456885044583,
"grad_norm": 4.144499778747559,
"learning_rate": 0.00010847457627118644,
"logits/chosen": -0.6458109617233276,
"logits/rejected": -0.6519441604614258,
"logps/chosen": -8.17459487915039,
"logps/rejected": -19.17450714111328,
"loss": 0.9243566989898682,
"memory(GiB)": 46.08,
"nll_loss": 0.3649522066116333,
"rewards/accuracies": 0.71875,
"rewards/chosen": 0.17762523889541626,
"rewards/margins": 0.41990581154823303,
"rewards/rejected": -0.24228057265281677,
"step": 32,
"train_speed(iter/s)": 0.005494
},
{
"epoch": 0.05638314912702227,
"grad_norm": 2.5846283435821533,
"learning_rate": 0.00011186440677966102,
"logits/chosen": -0.6422857046127319,
"logits/rejected": -0.64764004945755,
"logps/chosen": -7.8391828536987305,
"logps/rejected": -16.905941009521484,
"loss": 0.8121039867401123,
"memory(GiB)": 46.08,
"nll_loss": 0.3524104952812195,
"rewards/accuracies": 0.84375,
"rewards/chosen": 0.21112650632858276,
"rewards/margins": 0.6391255259513855,
"rewards/rejected": -0.42799898982048035,
"step": 33,
"train_speed(iter/s)": 0.005495
},
{
"epoch": 0.0580917294035987,
"grad_norm": 2.831099271774292,
"learning_rate": 0.0001152542372881356,
"logits/chosen": -0.6351624727249146,
"logits/rejected": -0.6340872645378113,
"logps/chosen": -8.873239517211914,
"logps/rejected": -14.13478946685791,
"loss": 0.9939954280853271,
"memory(GiB)": 46.08,
"nll_loss": 0.5031149983406067,
"rewards/accuracies": 0.8125,
"rewards/chosen": 0.15203362703323364,
"rewards/margins": 0.5661364793777466,
"rewards/rejected": -0.41410285234451294,
"step": 34,
"train_speed(iter/s)": 0.005494
},
{
"epoch": 0.05980030968017513,
"grad_norm": 6.754673004150391,
"learning_rate": 0.00011864406779661017,
"logits/chosen": -0.6350009441375732,
"logits/rejected": -0.6345161199569702,
"logps/chosen": -9.049372673034668,
"logps/rejected": -13.872842788696289,
"loss": 0.9677298069000244,
"memory(GiB)": 46.08,
"nll_loss": 0.4823642373085022,
"rewards/accuracies": 0.8125,
"rewards/chosen": 0.18822304904460907,
"rewards/margins": 0.5690968632698059,
"rewards/rejected": -0.38087382912635803,
"step": 35,
"train_speed(iter/s)": 0.005494
},
{
"epoch": 0.061508889956751564,
"grad_norm": 5.09066915512085,
"learning_rate": 0.00012203389830508477,
"logits/chosen": -0.5940477252006531,
"logits/rejected": -0.5995637774467468,
"logps/chosen": -6.552436351776123,
"logps/rejected": -22.02668571472168,
"loss": 1.0198695659637451,
"memory(GiB)": 46.08,
"nll_loss": 0.5385282635688782,
"rewards/accuracies": 0.78125,
"rewards/chosen": 0.09731997549533844,
"rewards/margins": 0.7183221578598022,
"rewards/rejected": -0.621002197265625,
"step": 36,
"train_speed(iter/s)": 0.005496
},
{
"epoch": 0.063217470233328,
"grad_norm": 6.366957664489746,
"learning_rate": 0.00012542372881355933,
"logits/chosen": -0.5671308040618896,
"logits/rejected": -0.5699396133422852,
"logps/chosen": -8.690061569213867,
"logps/rejected": -18.227741241455078,
"loss": 0.9119342565536499,
"memory(GiB)": 46.08,
"nll_loss": 0.4206831753253937,
"rewards/accuracies": 0.84375,
"rewards/chosen": 0.008592324331402779,
"rewards/margins": 0.7837947010993958,
"rewards/rejected": -0.7752023935317993,
"step": 37,
"train_speed(iter/s)": 0.005499
},
{
"epoch": 0.06492605050990442,
"grad_norm": 8.224360466003418,
"learning_rate": 0.0001288135593220339,
"logits/chosen": -0.6006415486335754,
"logits/rejected": -0.6039485931396484,
"logps/chosen": -7.98246955871582,
"logps/rejected": -19.214567184448242,
"loss": 1.020494818687439,
"memory(GiB)": 46.08,
"nll_loss": 0.47989213466644287,
"rewards/accuracies": 0.65625,
"rewards/chosen": -0.017101695761084557,
"rewards/margins": 0.7686665654182434,
"rewards/rejected": -0.7857682704925537,
"step": 38,
"train_speed(iter/s)": 0.005499
},
{
"epoch": 0.06663463078648085,
"grad_norm": 5.284773349761963,
"learning_rate": 0.00013220338983050849,
"logits/chosen": -0.5746678709983826,
"logits/rejected": -0.5742544531822205,
"logps/chosen": -10.300456047058105,
"logps/rejected": -14.731122970581055,
"loss": 1.1951102018356323,
"memory(GiB)": 46.08,
"nll_loss": 0.6024460196495056,
"rewards/accuracies": 0.6875,
"rewards/chosen": -0.005457160994410515,
"rewards/margins": 0.43640822172164917,
"rewards/rejected": -0.44186532497406006,
"step": 39,
"train_speed(iter/s)": 0.005499
},
{
"epoch": 0.0683432110630573,
"grad_norm": 4.581506252288818,
"learning_rate": 0.00013559322033898305,
"logits/chosen": -0.5436846613883972,
"logits/rejected": -0.5412294268608093,
"logps/chosen": -11.306229591369629,
"logps/rejected": -15.808780670166016,
"loss": 0.9979494214057922,
"memory(GiB)": 46.08,
"nll_loss": 0.4069577753543854,
"rewards/accuracies": 0.6875,
"rewards/chosen": -0.10538371652364731,
"rewards/margins": 0.4707936942577362,
"rewards/rejected": -0.5761774778366089,
"step": 40,
"train_speed(iter/s)": 0.005496
},
{
"epoch": 0.07005179133963373,
"grad_norm": 4.280210018157959,
"learning_rate": 0.00013898305084745764,
"logits/chosen": -0.5919702649116516,
"logits/rejected": -0.5944460034370422,
"logps/chosen": -4.601211071014404,
"logps/rejected": -18.39055061340332,
"loss": 0.7289348244667053,
"memory(GiB)": 46.08,
"nll_loss": 0.2620496451854706,
"rewards/accuracies": 0.8125,
"rewards/chosen": 0.1577654778957367,
"rewards/margins": 0.7140093445777893,
"rewards/rejected": -0.5562438368797302,
"step": 41,
"train_speed(iter/s)": 0.005492
},
{
"epoch": 0.07176037161621016,
"grad_norm": 2.8965229988098145,
"learning_rate": 0.0001423728813559322,
"logits/chosen": -0.5226963758468628,
"logits/rejected": -0.5210604667663574,
"logps/chosen": -8.042407035827637,
"logps/rejected": -13.117356300354004,
"loss": 0.8382841944694519,
"memory(GiB)": 46.08,
"nll_loss": 0.3229953646659851,
"rewards/accuracies": 0.78125,
"rewards/chosen": 0.15337654948234558,
"rewards/margins": 0.5258168578147888,
"rewards/rejected": -0.3724403381347656,
"step": 42,
"train_speed(iter/s)": 0.005494
},
{
"epoch": 0.07346895189278659,
"grad_norm": 4.7869791984558105,
"learning_rate": 0.00014576271186440677,
"logits/chosen": -0.5595600605010986,
"logits/rejected": -0.5619646310806274,
"logps/chosen": -5.741379261016846,
"logps/rejected": -14.867729187011719,
"loss": 0.9325981140136719,
"memory(GiB)": 46.08,
"nll_loss": 0.34299078583717346,
"rewards/accuracies": 0.75,
"rewards/chosen": 0.06792251765727997,
"rewards/margins": 0.3079211115837097,
"rewards/rejected": -0.23999860882759094,
"step": 43,
"train_speed(iter/s)": 0.005494
},
{
"epoch": 0.07517753216936301,
"grad_norm": 3.8402724266052246,
"learning_rate": 0.00014915254237288136,
"logits/chosen": -0.5551996231079102,
"logits/rejected": -0.5583171248435974,
"logps/chosen": -7.729850769042969,
"logps/rejected": -14.535001754760742,
"loss": 0.985005795955658,
"memory(GiB)": 46.08,
"nll_loss": 0.37224525213241577,
"rewards/accuracies": 0.6875,
"rewards/chosen": 0.0475621297955513,
"rewards/margins": 0.2842516601085663,
"rewards/rejected": -0.23668958246707916,
"step": 44,
"train_speed(iter/s)": 0.005495
},
{
"epoch": 0.07688611244593946,
"grad_norm": 3.136073112487793,
"learning_rate": 0.00015254237288135592,
"logits/chosen": -0.5538796186447144,
"logits/rejected": -0.5563740730285645,
"logps/chosen": -8.61514663696289,
"logps/rejected": -20.434301376342773,
"loss": 0.8447250723838806,
"memory(GiB)": 46.08,
"nll_loss": 0.3852572441101074,
"rewards/accuracies": 0.90625,
"rewards/chosen": 0.17051486670970917,
"rewards/margins": 0.695674479007721,
"rewards/rejected": -0.5251596570014954,
"step": 45,
"train_speed(iter/s)": 0.005495
},
{
"epoch": 0.07859469272251589,
"grad_norm": 2.950076103210449,
"learning_rate": 0.00015593220338983051,
"logits/chosen": -0.588573694229126,
"logits/rejected": -0.5898380875587463,
"logps/chosen": -8.49618911743164,
"logps/rejected": -16.47633171081543,
"loss": 0.8776077032089233,
"memory(GiB)": 46.08,
"nll_loss": 0.3434315621852875,
"rewards/accuracies": 0.78125,
"rewards/chosen": 0.1189945787191391,
"rewards/margins": 0.5393712520599365,
"rewards/rejected": -0.42037665843963623,
"step": 46,
"train_speed(iter/s)": 0.005498
},
{
"epoch": 0.08030327299909232,
"grad_norm": 2.918926954269409,
"learning_rate": 0.00015932203389830508,
"logits/chosen": -0.5735058188438416,
"logits/rejected": -0.5742441415786743,
"logps/chosen": -10.007829666137695,
"logps/rejected": -15.225828170776367,
"loss": 0.9683640003204346,
"memory(GiB)": 46.08,
"nll_loss": 0.4518345892429352,
"rewards/accuracies": 0.8125,
"rewards/chosen": 0.29521822929382324,
"rewards/margins": 0.5080306529998779,
"rewards/rejected": -0.2128123939037323,
"step": 47,
"train_speed(iter/s)": 0.005501
},
{
"epoch": 0.08201185327566875,
"grad_norm": 2.885613441467285,
"learning_rate": 0.00016271186440677967,
"logits/chosen": -0.5690568089485168,
"logits/rejected": -0.570725679397583,
"logps/chosen": -6.9214887619018555,
"logps/rejected": -17.073692321777344,
"loss": 0.8013411164283752,
"memory(GiB)": 46.08,
"nll_loss": 0.2747730612754822,
"rewards/accuracies": 0.78125,
"rewards/chosen": 0.1803244799375534,
"rewards/margins": 0.5454539060592651,
"rewards/rejected": -0.36512941122055054,
"step": 48,
"train_speed(iter/s)": 0.005502
},
{
"epoch": 0.08372043355224518,
"grad_norm": 2.8386495113372803,
"learning_rate": 0.00016610169491525423,
"logits/chosen": -0.5691187381744385,
"logits/rejected": -0.5723721981048584,
"logps/chosen": -6.647555828094482,
"logps/rejected": -18.68927764892578,
"loss": 0.731940746307373,
"memory(GiB)": 46.08,
"nll_loss": 0.31857162714004517,
"rewards/accuracies": 0.90625,
"rewards/chosen": 0.15964265167713165,
"rewards/margins": 0.8172457218170166,
"rewards/rejected": -0.6576029062271118,
"step": 49,
"train_speed(iter/s)": 0.005503
},
{
"epoch": 0.0854290138288216,
"grad_norm": 6.678228855133057,
"learning_rate": 0.00016949152542372882,
"logits/chosen": -0.569486141204834,
"logits/rejected": -0.5724078416824341,
"logps/chosen": -7.978659629821777,
"logps/rejected": -18.0915584564209,
"loss": 0.8816509246826172,
"memory(GiB)": 46.08,
"nll_loss": 0.41086509823799133,
"rewards/accuracies": 0.84375,
"rewards/chosen": 0.16925573348999023,
"rewards/margins": 0.6901466846466064,
"rewards/rejected": -0.520891010761261,
"step": 50,
"train_speed(iter/s)": 0.0055
},
{
"epoch": 0.08713759410539805,
"grad_norm": 3.4269354343414307,
"learning_rate": 0.00017288135593220342,
"logits/chosen": -0.6229482889175415,
"logits/rejected": -0.624045193195343,
"logps/chosen": -8.981767654418945,
"logps/rejected": -18.87827491760254,
"loss": 0.902818500995636,
"memory(GiB)": 46.08,
"nll_loss": 0.4753139615058899,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.12949834764003754,
"rewards/margins": 0.91382896900177,
"rewards/rejected": -0.7843306064605713,
"step": 51,
"train_speed(iter/s)": 0.005488
},
{
"epoch": 0.08884617438197448,
"grad_norm": 3.730417013168335,
"learning_rate": 0.00017627118644067798,
"logits/chosen": -0.5907954573631287,
"logits/rejected": -0.5928065776824951,
"logps/chosen": -8.826777458190918,
"logps/rejected": -25.743032455444336,
"loss": 0.8241711854934692,
"memory(GiB)": 46.08,
"nll_loss": 0.4183700382709503,
"rewards/accuracies": 0.84375,
"rewards/chosen": 0.15070247650146484,
"rewards/margins": 1.0849279165267944,
"rewards/rejected": -0.9342254400253296,
"step": 52,
"train_speed(iter/s)": 0.00549
},
{
"epoch": 0.09055475465855091,
"grad_norm": 6.543994426727295,
"learning_rate": 0.00017966101694915257,
"logits/chosen": -0.5657305717468262,
"logits/rejected": -0.5669429898262024,
"logps/chosen": -11.976017951965332,
"logps/rejected": -18.324581146240234,
"loss": 1.1098811626434326,
"memory(GiB)": 46.08,
"nll_loss": 0.5012481808662415,
"rewards/accuracies": 0.625,
"rewards/chosen": -0.04995343089103699,
"rewards/margins": 0.5761421918869019,
"rewards/rejected": -0.6260955929756165,
"step": 53,
"train_speed(iter/s)": 0.005492
},
{
"epoch": 0.09226333493512734,
"grad_norm": 7.451931476593018,
"learning_rate": 0.00018305084745762714,
"logits/chosen": -0.5736872553825378,
"logits/rejected": -0.5727863907814026,
"logps/chosen": -9.956096649169922,
"logps/rejected": -17.354209899902344,
"loss": 1.0036059617996216,
"memory(GiB)": 46.38,
"nll_loss": 0.35273733735084534,
"rewards/accuracies": 0.65625,
"rewards/chosen": -0.07980930060148239,
"rewards/margins": 0.5828754901885986,
"rewards/rejected": -0.6626847982406616,
"step": 54,
"train_speed(iter/s)": 0.005492
},
{
"epoch": 0.09397191521170377,
"grad_norm": 4.901066303253174,
"learning_rate": 0.0001864406779661017,
"logits/chosen": -0.5865222811698914,
"logits/rejected": -0.5857770442962646,
"logps/chosen": -6.749457359313965,
"logps/rejected": -19.966379165649414,
"loss": 0.836351215839386,
"memory(GiB)": 46.38,
"nll_loss": 0.30449604988098145,
"rewards/accuracies": 0.6875,
"rewards/chosen": 0.11927387118339539,
"rewards/margins": 0.7463572025299072,
"rewards/rejected": -0.6270833611488342,
"step": 55,
"train_speed(iter/s)": 0.005491
},
{
"epoch": 0.09568049548828021,
"grad_norm": 3.0312962532043457,
"learning_rate": 0.0001898305084745763,
"logits/chosen": -0.5644817352294922,
"logits/rejected": -0.5671055912971497,
"logps/chosen": -6.525354862213135,
"logps/rejected": -18.556304931640625,
"loss": 0.7299084663391113,
"memory(GiB)": 46.38,
"nll_loss": 0.2566152811050415,
"rewards/accuracies": 0.8125,
"rewards/chosen": 0.051953963935375214,
"rewards/margins": 0.8131421804428101,
"rewards/rejected": -0.7611882090568542,
"step": 56,
"train_speed(iter/s)": 0.005492
},
{
"epoch": 0.09738907576485664,
"grad_norm": 6.161406517028809,
"learning_rate": 0.00019322033898305085,
"logits/chosen": -0.5638913512229919,
"logits/rejected": -0.5684786438941956,
"logps/chosen": -8.483434677124023,
"logps/rejected": -20.397701263427734,
"loss": 0.988010585308075,
"memory(GiB)": 46.38,
"nll_loss": 0.4928280711174011,
"rewards/accuracies": 0.71875,
"rewards/chosen": 0.17585664987564087,
"rewards/margins": 0.6749651432037354,
"rewards/rejected": -0.4991084933280945,
"step": 57,
"train_speed(iter/s)": 0.00549
},
{
"epoch": 0.09909765604143307,
"grad_norm": 4.03005313873291,
"learning_rate": 0.00019661016949152545,
"logits/chosen": -0.5518775582313538,
"logits/rejected": -0.552839994430542,
"logps/chosen": -6.419961929321289,
"logps/rejected": -20.10483169555664,
"loss": 0.7270359396934509,
"memory(GiB)": 46.38,
"nll_loss": 0.2987552881240845,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.23015271127223969,
"rewards/margins": 0.8427435159683228,
"rewards/rejected": -0.6125907897949219,
"step": 58,
"train_speed(iter/s)": 0.00549
},
{
"epoch": 0.1008062363180095,
"grad_norm": 2.9903881549835205,
"learning_rate": 0.0002,
"logits/chosen": -0.558972954750061,
"logits/rejected": -0.559365451335907,
"logps/chosen": -7.266337871551514,
"logps/rejected": -19.700899124145508,
"loss": 0.8035504221916199,
"memory(GiB)": 46.38,
"nll_loss": 0.35604721307754517,
"rewards/accuracies": 0.90625,
"rewards/chosen": 0.23076069355010986,
"rewards/margins": 0.6581640243530273,
"rewards/rejected": -0.4274032711982727,
"step": 59,
"train_speed(iter/s)": 0.005494
},
{
"epoch": 0.10251481659458593,
"grad_norm": 2.308953046798706,
"learning_rate": 0.00019999960020133237,
"logits/chosen": -0.5721818804740906,
"logits/rejected": -0.5736841559410095,
"logps/chosen": -5.192386150360107,
"logps/rejected": -16.873666763305664,
"loss": 0.6971458196640015,
"memory(GiB)": 46.38,
"nll_loss": 0.25499823689460754,
"rewards/accuracies": 0.84375,
"rewards/chosen": 0.14774081110954285,
"rewards/margins": 0.7478816509246826,
"rewards/rejected": -0.6001408696174622,
"step": 60,
"train_speed(iter/s)": 0.005494
},
{
"epoch": 0.10422339687116237,
"grad_norm": 6.15336275100708,
"learning_rate": 0.00019999840080852627,
"logits/chosen": -0.6088159680366516,
"logits/rejected": -0.6091991662979126,
"logps/chosen": -10.085458755493164,
"logps/rejected": -16.714794158935547,
"loss": 1.2082210779190063,
"memory(GiB)": 46.38,
"nll_loss": 0.6319302320480347,
"rewards/accuracies": 0.6875,
"rewards/chosen": -0.015833575278520584,
"rewards/margins": 0.46795743703842163,
"rewards/rejected": -0.4837909936904907,
"step": 61,
"train_speed(iter/s)": 0.005494
},
{
"epoch": 0.1059319771477388,
"grad_norm": 4.543377876281738,
"learning_rate": 0.00019999640183117196,
"logits/chosen": -0.6160375475883484,
"logits/rejected": -0.6183785796165466,
"logps/chosen": -7.354756832122803,
"logps/rejected": -17.332752227783203,
"loss": 0.9280235767364502,
"memory(GiB)": 46.38,
"nll_loss": 0.39269304275512695,
"rewards/accuracies": 0.65625,
"rewards/chosen": 0.00012398138642311096,
"rewards/margins": 0.7065204381942749,
"rewards/rejected": -0.7063965797424316,
"step": 62,
"train_speed(iter/s)": 0.005497
},
{
"epoch": 0.10764055742431523,
"grad_norm": 3.700834035873413,
"learning_rate": 0.00019999360328525325,
"logits/chosen": -0.5955262780189514,
"logits/rejected": -0.5960131287574768,
"logps/chosen": -7.038027763366699,
"logps/rejected": -19.62297248840332,
"loss": 0.8426406383514404,
"memory(GiB)": 46.38,
"nll_loss": 0.304790735244751,
"rewards/accuracies": 0.78125,
"rewards/chosen": 0.04702156037092209,
"rewards/margins": 0.6756925582885742,
"rewards/rejected": -0.6286709904670715,
"step": 63,
"train_speed(iter/s)": 0.005495
},
{
"epoch": 0.10934913770089166,
"grad_norm": 3.616783857345581,
"learning_rate": 0.00019999000519314722,
"logits/chosen": -0.5933761596679688,
"logits/rejected": -0.5956672430038452,
"logps/chosen": -10.029403686523438,
"logps/rejected": -19.743268966674805,
"loss": 0.8910276889801025,
"memory(GiB)": 46.38,
"nll_loss": 0.4178580045700073,
"rewards/accuracies": 0.8125,
"rewards/chosen": 0.059932250529527664,
"rewards/margins": 0.7701122164726257,
"rewards/rejected": -0.7101800441741943,
"step": 64,
"train_speed(iter/s)": 0.005494
},
{
"epoch": 0.11105771797746809,
"grad_norm": 2.8669040203094482,
"learning_rate": 0.00019998560758362416,
"logits/chosen": -0.6144078373908997,
"logits/rejected": -0.6167560815811157,
"logps/chosen": -10.685945510864258,
"logps/rejected": -23.724315643310547,
"loss": 0.7696695923805237,
"memory(GiB)": 46.38,
"nll_loss": 0.3780427873134613,
"rewards/accuracies": 0.90625,
"rewards/chosen": 0.1446903944015503,
"rewards/margins": 1.0186232328414917,
"rewards/rejected": -0.873932957649231,
"step": 65,
"train_speed(iter/s)": 0.005493
},
{
"epoch": 0.11276629825404454,
"grad_norm": 4.312869548797607,
"learning_rate": 0.00019998041049184719,
"logits/chosen": -0.620762050151825,
"logits/rejected": -0.6244264245033264,
"logps/chosen": -11.728214263916016,
"logps/rejected": -26.204395294189453,
"loss": 0.7992648482322693,
"memory(GiB)": 46.38,
"nll_loss": 0.4216463565826416,
"rewards/accuracies": 0.8125,
"rewards/chosen": 0.14800474047660828,
"rewards/margins": 1.0791853666305542,
"rewards/rejected": -0.9311806559562683,
"step": 66,
"train_speed(iter/s)": 0.005493
},
{
"epoch": 0.11447487853062097,
"grad_norm": 7.865874290466309,
"learning_rate": 0.00019997441395937213,
"logits/chosen": -0.6298569440841675,
"logits/rejected": -0.6332789659500122,
"logps/chosen": -7.128231525421143,
"logps/rejected": -22.970563888549805,
"loss": 0.7514320015907288,
"memory(GiB)": 46.38,
"nll_loss": 0.33478716015815735,
"rewards/accuracies": 0.84375,
"rewards/chosen": 0.05204010754823685,
"rewards/margins": 0.9836788773536682,
"rewards/rejected": -0.931638777256012,
"step": 67,
"train_speed(iter/s)": 0.005494
},
{
"epoch": 0.1161834588071974,
"grad_norm": 6.099157810211182,
"learning_rate": 0.0001999676180341471,
"logits/chosen": -0.6536255478858948,
"logits/rejected": -0.6564731597900391,
"logps/chosen": -10.524028778076172,
"logps/rejected": -19.91427993774414,
"loss": 1.1307811737060547,
"memory(GiB)": 46.38,
"nll_loss": 0.7356545925140381,
"rewards/accuracies": 0.84375,
"rewards/chosen": 0.028077581897377968,
"rewards/margins": 0.9777989387512207,
"rewards/rejected": -0.9497213363647461,
"step": 68,
"train_speed(iter/s)": 0.005495
},
{
"epoch": 0.11789203908377383,
"grad_norm": 5.27453088760376,
"learning_rate": 0.00019996002277051218,
"logits/chosen": -0.6637449264526367,
"logits/rejected": -0.6651371717453003,
"logps/chosen": -9.458850860595703,
"logps/rejected": -16.127042770385742,
"loss": 1.4500970840454102,
"memory(GiB)": 46.38,
"nll_loss": 0.8368474841117859,
"rewards/accuracies": 0.71875,
"rewards/chosen": -0.15293718874454498,
"rewards/margins": 0.500515878200531,
"rewards/rejected": -0.6534531116485596,
"step": 69,
"train_speed(iter/s)": 0.005497
},
{
"epoch": 0.11960061936035025,
"grad_norm": 4.469899654388428,
"learning_rate": 0.00019995162822919883,
"logits/chosen": -0.6642380356788635,
"logits/rejected": -0.664824366569519,
"logps/chosen": -8.725358963012695,
"logps/rejected": -16.164390563964844,
"loss": 0.8428195714950562,
"memory(GiB)": 46.38,
"nll_loss": 0.3803461194038391,
"rewards/accuracies": 0.8125,
"rewards/chosen": 0.08946336805820465,
"rewards/margins": 0.7338303327560425,
"rewards/rejected": -0.644366979598999,
"step": 70,
"train_speed(iter/s)": 0.005495
},
{
"epoch": 0.12130919963692668,
"grad_norm": 4.995606422424316,
"learning_rate": 0.00019994243447732957,
"logits/chosen": -0.6431492567062378,
"logits/rejected": -0.6473235487937927,
"logps/chosen": -8.270989418029785,
"logps/rejected": -24.483354568481445,
"loss": 0.8698587417602539,
"memory(GiB)": 46.38,
"nll_loss": 0.4563717544078827,
"rewards/accuracies": 0.84375,
"rewards/chosen": 0.07262411713600159,
"rewards/margins": 1.0772123336791992,
"rewards/rejected": -1.0045881271362305,
"step": 71,
"train_speed(iter/s)": 0.005495
},
{
"epoch": 0.12301777991350313,
"grad_norm": 3.5250916481018066,
"learning_rate": 0.00019993244158841747,
"logits/chosen": -0.6772405505180359,
"logits/rejected": -0.6789288520812988,
"logps/chosen": -9.19353199005127,
"logps/rejected": -27.746652603149414,
"loss": 0.8238008618354797,
"memory(GiB)": 46.38,
"nll_loss": 0.39661213755607605,
"rewards/accuracies": 0.6875,
"rewards/chosen": 0.09302112460136414,
"rewards/margins": 1.367937684059143,
"rewards/rejected": -1.274916410446167,
"step": 72,
"train_speed(iter/s)": 0.005495
},
{
"epoch": 0.12472636019007956,
"grad_norm": 3.276311159133911,
"learning_rate": 0.00019992164964236533,
"logits/chosen": -0.6857064962387085,
"logits/rejected": -0.685559868812561,
"logps/chosen": -11.672329902648926,
"logps/rejected": -21.510480880737305,
"loss": 0.9018468856811523,
"memory(GiB)": 46.38,
"nll_loss": 0.41466090083122253,
"rewards/accuracies": 0.75,
"rewards/chosen": 0.07735104858875275,
"rewards/margins": 0.9590628147125244,
"rewards/rejected": -0.8817118406295776,
"step": 73,
"train_speed(iter/s)": 0.005495
},
{
"epoch": 0.126434940466656,
"grad_norm": 3.369281768798828,
"learning_rate": 0.00019991005872546527,
"logits/chosen": -0.6608355641365051,
"logits/rejected": -0.6626392602920532,
"logps/chosen": -7.696371078491211,
"logps/rejected": -16.016326904296875,
"loss": 0.8347861766815186,
"memory(GiB)": 46.38,
"nll_loss": 0.3552168607711792,
"rewards/accuracies": 0.90625,
"rewards/chosen": 0.13171803951263428,
"rewards/margins": 0.7066640853881836,
"rewards/rejected": -0.5749460458755493,
"step": 74,
"train_speed(iter/s)": 0.005494
},
{
"epoch": 0.12814352074323243,
"grad_norm": 2.894788980484009,
"learning_rate": 0.00019989766893039804,
"logits/chosen": -0.6222079992294312,
"logits/rejected": -0.6232355833053589,
"logps/chosen": -5.741198539733887,
"logps/rejected": -21.31194305419922,
"loss": 0.7077224850654602,
"memory(GiB)": 46.38,
"nll_loss": 0.2760768234729767,
"rewards/accuracies": 0.84375,
"rewards/chosen": 0.08473706245422363,
"rewards/margins": 0.9282934665679932,
"rewards/rejected": -0.8435564041137695,
"step": 75,
"train_speed(iter/s)": 0.005493
},
{
"epoch": 0.12985210101980885,
"grad_norm": 2.1586077213287354,
"learning_rate": 0.00019988448035623203,
"logits/chosen": -0.6409361958503723,
"logits/rejected": -0.6418861150741577,
"logps/chosen": -7.263876438140869,
"logps/rejected": -17.95524024963379,
"loss": 0.8056262731552124,
"memory(GiB)": 46.38,
"nll_loss": 0.2723458409309387,
"rewards/accuracies": 0.71875,
"rewards/chosen": 0.10251796990633011,
"rewards/margins": 0.5812361240386963,
"rewards/rejected": -0.4787181317806244,
"step": 76,
"train_speed(iter/s)": 0.005491
},
{
"epoch": 0.1315606812963853,
"grad_norm": 3.0591204166412354,
"learning_rate": 0.00019987049310842272,
"logits/chosen": -0.6324824690818787,
"logits/rejected": -0.6336201429367065,
"logps/chosen": -10.325702667236328,
"logps/rejected": -15.849100112915039,
"loss": 0.8897943496704102,
"memory(GiB)": 46.38,
"nll_loss": 0.3855420649051666,
"rewards/accuracies": 0.84375,
"rewards/chosen": 0.16009055078029633,
"rewards/margins": 0.6010256409645081,
"rewards/rejected": -0.4409351050853729,
"step": 77,
"train_speed(iter/s)": 0.005491
},
{
"epoch": 0.1332692615729617,
"grad_norm": 2.668419122695923,
"learning_rate": 0.00019985570729881184,
"logits/chosen": -0.6462000012397766,
"logits/rejected": -0.6490585207939148,
"logps/chosen": -5.475035667419434,
"logps/rejected": -20.422216415405273,
"loss": 0.7187508344650269,
"memory(GiB)": 46.38,
"nll_loss": 0.26306530833244324,
"rewards/accuracies": 0.84375,
"rewards/chosen": 0.13646253943443298,
"rewards/margins": 0.6754783391952515,
"rewards/rejected": -0.5390157699584961,
"step": 78,
"train_speed(iter/s)": 0.005491
},
{
"epoch": 0.13497784184953815,
"grad_norm": 4.360518932342529,
"learning_rate": 0.00019984012304562622,
"logits/chosen": -0.6780133247375488,
"logits/rejected": -0.6758167147636414,
"logps/chosen": -11.310664176940918,
"logps/rejected": -15.12096881866455,
"loss": 0.9152082800865173,
"memory(GiB)": 46.38,
"nll_loss": 0.45073550939559937,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.15347006916999817,
"rewards/margins": 0.7282993197441101,
"rewards/rejected": -0.5748292207717896,
"step": 79,
"train_speed(iter/s)": 0.00549
},
{
"epoch": 0.1366864221261146,
"grad_norm": 2.7597768306732178,
"learning_rate": 0.00019982374047347723,
"logits/chosen": -0.6909894943237305,
"logits/rejected": -0.694047212600708,
"logps/chosen": -6.004232406616211,
"logps/rejected": -23.221824645996094,
"loss": 0.6792643666267395,
"memory(GiB)": 46.38,
"nll_loss": 0.31354260444641113,
"rewards/accuracies": 0.96875,
"rewards/chosen": 0.21520498394966125,
"rewards/margins": 1.1965129375457764,
"rewards/rejected": -0.9813080430030823,
"step": 80,
"train_speed(iter/s)": 0.00549
},
{
"epoch": 0.138395002402691,
"grad_norm": 4.00593900680542,
"learning_rate": 0.00019980655971335945,
"logits/chosen": -0.666761577129364,
"logits/rejected": -0.6698122620582581,
"logps/chosen": -11.200495719909668,
"logps/rejected": -20.89803123474121,
"loss": 1.0373343229293823,
"memory(GiB)": 46.38,
"nll_loss": 0.5717941522598267,
"rewards/accuracies": 0.8125,
"rewards/chosen": -0.03891691192984581,
"rewards/margins": 0.8691489696502686,
"rewards/rejected": -0.9080657958984375,
"step": 81,
"train_speed(iter/s)": 0.00549
},
{
"epoch": 0.14010358267926745,
"grad_norm": 3.7606523036956787,
"learning_rate": 0.00019978858090264975,
"logits/chosen": -0.6808147430419922,
"logits/rejected": -0.683088481426239,
"logps/chosen": -8.414874076843262,
"logps/rejected": -28.505592346191406,
"loss": 0.7084274888038635,
"memory(GiB)": 46.38,
"nll_loss": 0.3828541338443756,
"rewards/accuracies": 0.90625,
"rewards/chosen": 0.1215677559375763,
"rewards/margins": 1.7334877252578735,
"rewards/rejected": -1.6119199991226196,
"step": 82,
"train_speed(iter/s)": 0.005491
},
{
"epoch": 0.14181216295584387,
"grad_norm": 4.108179569244385,
"learning_rate": 0.0001997698041851063,
"logits/chosen": -0.6897909045219421,
"logits/rejected": -0.6913143396377563,
"logps/chosen": -4.813051223754883,
"logps/rejected": -26.06230926513672,
"loss": 0.572483241558075,
"memory(GiB)": 46.38,
"nll_loss": 0.24444976449012756,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.15832601487636566,
"rewards/margins": 1.6045297384262085,
"rewards/rejected": -1.4462038278579712,
"step": 83,
"train_speed(iter/s)": 0.005491
},
{
"epoch": 0.1435207432324203,
"grad_norm": 5.49106502532959,
"learning_rate": 0.00019975022971086714,
"logits/chosen": -0.6466387510299683,
"logits/rejected": -0.6520243883132935,
"logps/chosen": -7.595500946044922,
"logps/rejected": -33.218482971191406,
"loss": 0.9090702533721924,
"memory(GiB)": 46.38,
"nll_loss": 0.5250993371009827,
"rewards/accuracies": 0.75,
"rewards/chosen": 0.13341139256954193,
"rewards/margins": 1.5776695013046265,
"rewards/rejected": -1.444258213043213,
"step": 84,
"train_speed(iter/s)": 0.005492
},
{
"epoch": 0.14522932350899675,
"grad_norm": 4.539761543273926,
"learning_rate": 0.00019972985763644932,
"logits/chosen": -0.6421160101890564,
"logits/rejected": -0.6411360502243042,
"logps/chosen": -7.4049482345581055,
"logps/rejected": -21.37047576904297,
"loss": 0.8407540917396545,
"memory(GiB)": 46.38,
"nll_loss": 0.4470757246017456,
"rewards/accuracies": 0.8125,
"rewards/chosen": 0.1697394847869873,
"rewards/margins": 1.345821738243103,
"rewards/rejected": -1.1760823726654053,
"step": 85,
"train_speed(iter/s)": 0.005493
},
{
"epoch": 0.14693790378557317,
"grad_norm": 4.877723217010498,
"learning_rate": 0.00019970868812474736,
"logits/chosen": -0.6163697242736816,
"logits/rejected": -0.6189360022544861,
"logps/chosen": -12.07491683959961,
"logps/rejected": -29.372955322265625,
"loss": 0.848598301410675,
"memory(GiB)": 46.38,
"nll_loss": 0.49112260341644287,
"rewards/accuracies": 0.8125,
"rewards/chosen": 0.1017676591873169,
"rewards/margins": 1.7578887939453125,
"rewards/rejected": -1.6561211347579956,
"step": 86,
"train_speed(iter/s)": 0.005493
},
{
"epoch": 0.14864648406214961,
"grad_norm": 5.431716442108154,
"learning_rate": 0.00019968672134503213,
"logits/chosen": -0.6225081086158752,
"logits/rejected": -0.6252766251564026,
"logps/chosen": -7.893375873565674,
"logps/rejected": -24.980260848999023,
"loss": 0.7993619441986084,
"memory(GiB)": 46.38,
"nll_loss": 0.3846016228199005,
"rewards/accuracies": 0.8125,
"rewards/chosen": 0.16642117500305176,
"rewards/margins": 1.3823862075805664,
"rewards/rejected": -1.215964913368225,
"step": 87,
"train_speed(iter/s)": 0.005493
},
{
"epoch": 0.15035506433872603,
"grad_norm": 3.7740750312805176,
"learning_rate": 0.00019966395747294938,
"logits/chosen": -0.5984699130058289,
"logits/rejected": -0.6030604839324951,
"logps/chosen": -5.385066032409668,
"logps/rejected": -25.168312072753906,
"loss": 0.6654453873634338,
"memory(GiB)": 46.38,
"nll_loss": 0.3348524868488312,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.16900494694709778,
"rewards/margins": 1.3018345832824707,
"rewards/rejected": -1.1328295469284058,
"step": 88,
"train_speed(iter/s)": 0.005492
},
{
"epoch": 0.15206364461530247,
"grad_norm": 3.6669890880584717,
"learning_rate": 0.0001996403966905185,
"logits/chosen": -0.6115779280662537,
"logits/rejected": -0.615218997001648,
"logps/chosen": -8.385238647460938,
"logps/rejected": -20.905569076538086,
"loss": 0.8084090948104858,
"memory(GiB)": 46.38,
"nll_loss": 0.39410629868507385,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.07257324457168579,
"rewards/margins": 1.0608566999435425,
"rewards/rejected": -0.9882834553718567,
"step": 89,
"train_speed(iter/s)": 0.00549
},
{
"epoch": 0.15377222489187892,
"grad_norm": 8.954024314880371,
"learning_rate": 0.00019961603918613077,
"logits/chosen": -0.6033557653427124,
"logits/rejected": -0.6063033938407898,
"logps/chosen": -7.85408878326416,
"logps/rejected": -24.28641700744629,
"loss": 0.8988556861877441,
"memory(GiB)": 46.38,
"nll_loss": 0.4972013235092163,
"rewards/accuracies": 0.78125,
"rewards/chosen": 0.1499406397342682,
"rewards/margins": 1.2390244007110596,
"rewards/rejected": -1.0890836715698242,
"step": 90,
"train_speed(iter/s)": 0.005489
},
{
"epoch": 0.15548080516845533,
"grad_norm": 2.68121075630188,
"learning_rate": 0.00019959088515454827,
"logits/chosen": -0.6473177075386047,
"logits/rejected": -0.6510601043701172,
"logps/chosen": -6.986569404602051,
"logps/rejected": -28.0955810546875,
"loss": 0.6454746723175049,
"memory(GiB)": 46.38,
"nll_loss": 0.3593181073665619,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.310781866312027,
"rewards/margins": 1.7279632091522217,
"rewards/rejected": -1.417181372642517,
"step": 91,
"train_speed(iter/s)": 0.005489
},
{
"epoch": 0.15718938544503178,
"grad_norm": 7.000541687011719,
"learning_rate": 0.0001995649347969019,
"logits/chosen": -0.7174542546272278,
"logits/rejected": -0.7201290726661682,
"logps/chosen": -11.954474449157715,
"logps/rejected": -24.34893226623535,
"loss": 1.0948961973190308,
"memory(GiB)": 46.38,
"nll_loss": 0.6069883704185486,
"rewards/accuracies": 0.75,
"rewards/chosen": -0.005067221820354462,
"rewards/margins": 1.2273277044296265,
"rewards/rejected": -1.232394814491272,
"step": 92,
"train_speed(iter/s)": 0.005491
},
{
"epoch": 0.1588979657216082,
"grad_norm": 4.3811211585998535,
"learning_rate": 0.00019953818832069,
"logits/chosen": -0.6739280223846436,
"logits/rejected": -0.6795160174369812,
"logps/chosen": -6.881966590881348,
"logps/rejected": -37.4478645324707,
"loss": 0.6469016075134277,
"memory(GiB)": 46.38,
"nll_loss": 0.40633073449134827,
"rewards/accuracies": 0.84375,
"rewards/chosen": 0.20596878230571747,
"rewards/margins": 2.5138516426086426,
"rewards/rejected": -2.3078830242156982,
"step": 93,
"train_speed(iter/s)": 0.005491
},
{
"epoch": 0.16060654599818464,
"grad_norm": 12.26343822479248,
"learning_rate": 0.00019951064593977668,
"logits/chosen": -0.6859129667282104,
"logits/rejected": -0.6899083852767944,
"logps/chosen": -13.38476848602295,
"logps/rejected": -30.595182418823242,
"loss": 1.2918721437454224,
"memory(GiB)": 46.38,
"nll_loss": 0.6223256587982178,
"rewards/accuracies": 0.71875,
"rewards/chosen": -0.30435577034950256,
"rewards/margins": 1.605468988418579,
"rewards/rejected": -1.9098248481750488,
"step": 94,
"train_speed(iter/s)": 0.005491
},
{
"epoch": 0.16231512627476108,
"grad_norm": 6.570938587188721,
"learning_rate": 0.00019948230787439017,
"logits/chosen": -0.7028453946113586,
"logits/rejected": -0.7050482034683228,
"logps/chosen": -6.761815071105957,
"logps/rejected": -27.314367294311523,
"loss": 0.9538392424583435,
"memory(GiB)": 46.38,
"nll_loss": 0.39429235458374023,
"rewards/accuracies": 0.6875,
"rewards/chosen": 0.012213893234729767,
"rewards/margins": 1.6957728862762451,
"rewards/rejected": -1.6835590600967407,
"step": 95,
"train_speed(iter/s)": 0.005493
},
{
"epoch": 0.1640237065513375,
"grad_norm": 2.8915793895721436,
"learning_rate": 0.0001994531743511208,
"logits/chosen": -0.6953604817390442,
"logits/rejected": -0.6982015371322632,
"logps/chosen": -7.192444801330566,
"logps/rejected": -26.632644653320312,
"loss": 0.6771315336227417,
"memory(GiB)": 46.38,
"nll_loss": 0.3128400444984436,
"rewards/accuracies": 0.84375,
"rewards/chosen": 0.21012118458747864,
"rewards/margins": 1.6979337930679321,
"rewards/rejected": -1.4878127574920654,
"step": 96,
"train_speed(iter/s)": 0.005494
},
{
"epoch": 0.16573228682791394,
"grad_norm": 2.7815051078796387,
"learning_rate": 0.00019942324560291952,
"logits/chosen": -0.6696122884750366,
"logits/rejected": -0.6713677644729614,
"logps/chosen": -4.250362396240234,
"logps/rejected": -22.2177791595459,
"loss": 0.6821787357330322,
"memory(GiB)": 46.38,
"nll_loss": 0.26163250207901,
"rewards/accuracies": 0.75,
"rewards/chosen": 0.09910638630390167,
"rewards/margins": 1.2715519666671753,
"rewards/rejected": -1.1724457740783691,
"step": 97,
"train_speed(iter/s)": 0.005495
},
{
"epoch": 0.16744086710449035,
"grad_norm": 2.4311976432800293,
"learning_rate": 0.00019939252186909574,
"logits/chosen": -0.6763203740119934,
"logits/rejected": -0.6752580404281616,
"logps/chosen": -6.972185134887695,
"logps/rejected": -21.0667667388916,
"loss": 0.5966892838478088,
"memory(GiB)": 46.38,
"nll_loss": 0.2420358657836914,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.14732374250888824,
"rewards/margins": 1.0790168046951294,
"rewards/rejected": -0.9316931366920471,
"step": 98,
"train_speed(iter/s)": 0.005495
},
{
"epoch": 0.1691494473810668,
"grad_norm": 5.822193622589111,
"learning_rate": 0.00019936100339531564,
"logits/chosen": -0.6894733905792236,
"logits/rejected": -0.6909453272819519,
"logps/chosen": -6.009974479675293,
"logps/rejected": -21.0426025390625,
"loss": 0.7569796442985535,
"memory(GiB)": 46.38,
"nll_loss": 0.4093407690525055,
"rewards/accuracies": 0.84375,
"rewards/chosen": 0.26579749584198,
"rewards/margins": 1.3290454149246216,
"rewards/rejected": -1.0632479190826416,
"step": 99,
"train_speed(iter/s)": 0.005495
},
{
"epoch": 0.1708580276576432,
"grad_norm": 3.2212934494018555,
"learning_rate": 0.0001993286904336001,
"logits/chosen": -0.7202757000923157,
"logits/rejected": -0.7197086215019226,
"logps/chosen": -6.131860733032227,
"logps/rejected": -21.27735137939453,
"loss": 0.622944712638855,
"memory(GiB)": 46.38,
"nll_loss": 0.28273510932922363,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.26464149355888367,
"rewards/margins": 1.1921066045761108,
"rewards/rejected": -0.9274651408195496,
"step": 100,
"train_speed(iter/s)": 0.005496
}
],
"logging_steps": 1,
"max_steps": 1170,
"num_input_tokens_seen": 0,
"num_train_epochs": 2,
"save_steps": 50,
"stateful_callbacks": {
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": true,
"should_training_stop": false
},
"attributes": {}
}
},
"total_flos": 7.266692861809132e+17,
"train_batch_size": 1,
"trial_name": null,
"trial_params": null
}