PEFT
Safetensors
3add2gt6-350 / trainer_state.json
windgrin's picture
Upload folder using huggingface_hub
768aa47 verified
Raw
History Blame Contribute Delete
225 kB
{
"best_global_step": 300,
"best_metric": 0.77076083,
"best_model_checkpoint": "/data2/kdd/crag/cjz/output/task3_dpo_gt6_task2_gt60.5+task3gt5/v1-20250609-010021/checkpoint-300",
"epoch": 0.5980030968017513,
"eval_steps": 300,
"global_step": 350,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"epoch": 0.0017085802765764322,
"grad_norm": 9.203307151794434,
"learning_rate": 3.3898305084745763e-06,
"logits/chosen": -0.6409764885902405,
"logits/rejected": -0.6413162350654602,
"logps/chosen": -8.591513633728027,
"logps/rejected": -9.922354698181152,
"loss": 1.2514135837554932,
"memory(GiB)": 45.3,
"nll_loss": 0.5582665801048279,
"rewards/accuracies": 0.0,
"rewards/chosen": 0.0,
"rewards/margins": 0.0,
"rewards/rejected": 0.0,
"step": 1,
"train_speed(iter/s)": 0.005423
},
{
"epoch": 0.0034171605531528645,
"grad_norm": 4.572653293609619,
"learning_rate": 6.779661016949153e-06,
"logits/chosen": -0.6253237724304199,
"logits/rejected": -0.6232100129127502,
"logps/chosen": -9.215431213378906,
"logps/rejected": -6.302733898162842,
"loss": 1.1804862022399902,
"memory(GiB)": 45.3,
"nll_loss": 0.4873391091823578,
"rewards/accuracies": 0.0,
"rewards/chosen": 0.0,
"rewards/margins": 0.0,
"rewards/rejected": 0.0,
"step": 2,
"train_speed(iter/s)": 0.005426
},
{
"epoch": 0.005125740829729297,
"grad_norm": 10.135663986206055,
"learning_rate": 1.016949152542373e-05,
"logits/chosen": -0.5830379724502563,
"logits/rejected": -0.5847949981689453,
"logps/chosen": -6.387916088104248,
"logps/rejected": -12.526434898376465,
"loss": 1.1388403177261353,
"memory(GiB)": 46.08,
"nll_loss": 0.44991743564605713,
"rewards/accuracies": 0.71875,
"rewards/chosen": 0.0018886500038206577,
"rewards/margins": 0.008566470816731453,
"rewards/rejected": -0.006677820347249508,
"step": 3,
"train_speed(iter/s)": 0.005372
},
{
"epoch": 0.006834321106305729,
"grad_norm": 8.09815788269043,
"learning_rate": 1.3559322033898305e-05,
"logits/chosen": -0.5831664800643921,
"logits/rejected": -0.5881690382957458,
"logps/chosen": -9.77461051940918,
"logps/rejected": -15.103912353515625,
"loss": 1.2644962072372437,
"memory(GiB)": 46.08,
"nll_loss": 0.5699671506881714,
"rewards/accuracies": 0.4375,
"rewards/chosen": -0.0013185496209189296,
"rewards/margins": -0.0025646828580647707,
"rewards/rejected": 0.0012461334699764848,
"step": 4,
"train_speed(iter/s)": 0.005433
},
{
"epoch": 0.008542901382882162,
"grad_norm": 10.546202659606934,
"learning_rate": 1.694915254237288e-05,
"logits/chosen": -0.6210501194000244,
"logits/rejected": -0.6261105537414551,
"logps/chosen": -9.743502616882324,
"logps/rejected": -13.954730987548828,
"loss": 1.2041635513305664,
"memory(GiB)": 46.08,
"nll_loss": 0.5165743231773376,
"rewards/accuracies": 0.53125,
"rewards/chosen": 0.014782106503844261,
"rewards/margins": 0.011779396794736385,
"rewards/rejected": 0.0030027113389223814,
"step": 5,
"train_speed(iter/s)": 0.005434
},
{
"epoch": 0.010251481659458593,
"grad_norm": 5.953731060028076,
"learning_rate": 2.033898305084746e-05,
"logits/chosen": -0.6194843649864197,
"logits/rejected": -0.6225060224533081,
"logps/chosen": -8.993276596069336,
"logps/rejected": -11.800742149353027,
"loss": 1.2383989095687866,
"memory(GiB)": 46.08,
"nll_loss": 0.5413038730621338,
"rewards/accuracies": 0.46875,
"rewards/chosen": 0.02151685394346714,
"rewards/margins": -0.004275719169527292,
"rewards/rejected": 0.025792576372623444,
"step": 6,
"train_speed(iter/s)": 0.005421
},
{
"epoch": 0.011960061936035027,
"grad_norm": 3.4447383880615234,
"learning_rate": 2.3728813559322036e-05,
"logits/chosen": -0.5979399681091309,
"logits/rejected": -0.597865104675293,
"logps/chosen": -11.88587760925293,
"logps/rejected": -12.513296127319336,
"loss": 1.1787316799163818,
"memory(GiB)": 46.08,
"nll_loss": 0.4771195948123932,
"rewards/accuracies": 0.46875,
"rewards/chosen": 0.001614744309335947,
"rewards/margins": -0.006370083428919315,
"rewards/rejected": 0.007984823547303677,
"step": 7,
"train_speed(iter/s)": 0.005421
},
{
"epoch": 0.013668642212611458,
"grad_norm": 4.3422627449035645,
"learning_rate": 2.711864406779661e-05,
"logits/chosen": -0.5695681571960449,
"logits/rejected": -0.5736703276634216,
"logps/chosen": -8.691235542297363,
"logps/rejected": -17.510940551757812,
"loss": 1.085353970527649,
"memory(GiB)": 46.08,
"nll_loss": 0.4569101631641388,
"rewards/accuracies": 0.65625,
"rewards/chosen": 0.061018284410238266,
"rewards/margins": 0.16366331279277802,
"rewards/rejected": -0.10264502465724945,
"step": 8,
"train_speed(iter/s)": 0.005421
},
{
"epoch": 0.015377222489187891,
"grad_norm": 6.347766399383545,
"learning_rate": 3.050847457627119e-05,
"logits/chosen": -0.6150330305099487,
"logits/rejected": -0.6163787841796875,
"logps/chosen": -14.26973819732666,
"logps/rejected": -12.656587600708008,
"loss": 1.3125040531158447,
"memory(GiB)": 46.08,
"nll_loss": 0.6051884293556213,
"rewards/accuracies": 0.59375,
"rewards/chosen": -0.06490564346313477,
"rewards/margins": 0.03234899416565895,
"rewards/rejected": -0.09725463390350342,
"step": 9,
"train_speed(iter/s)": 0.005427
},
{
"epoch": 0.017085802765764324,
"grad_norm": 3.609342575073242,
"learning_rate": 3.389830508474576e-05,
"logits/chosen": -0.5823943018913269,
"logits/rejected": -0.5893073678016663,
"logps/chosen": -12.539135932922363,
"logps/rejected": -19.231651306152344,
"loss": 1.154615044593811,
"memory(GiB)": 46.08,
"nll_loss": 0.5292682647705078,
"rewards/accuracies": 0.71875,
"rewards/chosen": -0.0102485166862607,
"rewards/margins": 0.24539220333099365,
"rewards/rejected": -0.2556407153606415,
"step": 10,
"train_speed(iter/s)": 0.00544
},
{
"epoch": 0.018794383042340754,
"grad_norm": 4.803543567657471,
"learning_rate": 3.728813559322034e-05,
"logits/chosen": -0.6298958659172058,
"logits/rejected": -0.6301961541175842,
"logps/chosen": -10.286799430847168,
"logps/rejected": -11.364641189575195,
"loss": 1.143830418586731,
"memory(GiB)": 46.08,
"nll_loss": 0.43475160002708435,
"rewards/accuracies": 0.46875,
"rewards/chosen": -0.06166127696633339,
"rewards/margins": 0.1280723363161087,
"rewards/rejected": -0.189733624458313,
"step": 11,
"train_speed(iter/s)": 0.005459
},
{
"epoch": 0.020502963318917187,
"grad_norm": 6.843598365783691,
"learning_rate": 4.067796610169492e-05,
"logits/chosen": -0.6147834062576294,
"logits/rejected": -0.6201154589653015,
"logps/chosen": -11.104015350341797,
"logps/rejected": -14.71792221069336,
"loss": 1.2689580917358398,
"memory(GiB)": 46.08,
"nll_loss": 0.4583723843097687,
"rewards/accuracies": 0.375,
"rewards/chosen": -0.1446399688720703,
"rewards/margins": -0.06440749764442444,
"rewards/rejected": -0.08023246377706528,
"step": 12,
"train_speed(iter/s)": 0.005454
},
{
"epoch": 0.02221154359549362,
"grad_norm": 4.361201286315918,
"learning_rate": 4.4067796610169495e-05,
"logits/chosen": -0.6593450307846069,
"logits/rejected": -0.6623726487159729,
"logps/chosen": -8.788830757141113,
"logps/rejected": -12.09660530090332,
"loss": 1.091460108757019,
"memory(GiB)": 46.08,
"nll_loss": 0.38157719373703003,
"rewards/accuracies": 0.5625,
"rewards/chosen": -0.03397805988788605,
"rewards/margins": 0.08494514226913452,
"rewards/rejected": -0.11892320215702057,
"step": 13,
"train_speed(iter/s)": 0.005465
},
{
"epoch": 0.023920123872070053,
"grad_norm": 4.36707067489624,
"learning_rate": 4.745762711864407e-05,
"logits/chosen": -0.6003404259681702,
"logits/rejected": -0.6018444895744324,
"logps/chosen": -9.472915649414062,
"logps/rejected": -12.008777618408203,
"loss": 1.2156641483306885,
"memory(GiB)": 46.08,
"nll_loss": 0.42055219411849976,
"rewards/accuracies": 0.40625,
"rewards/chosen": -0.07689498364925385,
"rewards/margins": -0.1264859437942505,
"rewards/rejected": 0.049590952694416046,
"step": 14,
"train_speed(iter/s)": 0.00548
},
{
"epoch": 0.025628704148646483,
"grad_norm": 3.2864296436309814,
"learning_rate": 5.0847457627118643e-05,
"logits/chosen": -0.6285042762756348,
"logits/rejected": -0.6272621154785156,
"logps/chosen": -14.201019287109375,
"logps/rejected": -10.998590469360352,
"loss": 1.2311502695083618,
"memory(GiB)": 46.08,
"nll_loss": 0.5152750015258789,
"rewards/accuracies": 0.5625,
"rewards/chosen": 0.06618006527423859,
"rewards/margins": 0.029741406440734863,
"rewards/rejected": 0.036438651382923126,
"step": 15,
"train_speed(iter/s)": 0.005474
},
{
"epoch": 0.027337284425222916,
"grad_norm": 2.4144492149353027,
"learning_rate": 5.423728813559322e-05,
"logits/chosen": -0.6098039746284485,
"logits/rejected": -0.6130300760269165,
"logps/chosen": -3.4820291996002197,
"logps/rejected": -16.196063995361328,
"loss": 0.8393359780311584,
"memory(GiB)": 46.08,
"nll_loss": 0.214947909116745,
"rewards/accuracies": 0.6875,
"rewards/chosen": 0.0826798751950264,
"rewards/margins": 0.17492221295833588,
"rewards/rejected": -0.09224233776330948,
"step": 16,
"train_speed(iter/s)": 0.005477
},
{
"epoch": 0.02904586470179935,
"grad_norm": 2.3232851028442383,
"learning_rate": 5.76271186440678e-05,
"logits/chosen": -0.5909145474433899,
"logits/rejected": -0.593756377696991,
"logps/chosen": -7.929438591003418,
"logps/rejected": -14.363272666931152,
"loss": 0.9911059737205505,
"memory(GiB)": 46.08,
"nll_loss": 0.34508591890335083,
"rewards/accuracies": 0.65625,
"rewards/chosen": 0.10390710830688477,
"rewards/margins": 0.13225752115249634,
"rewards/rejected": -0.028350409120321274,
"step": 17,
"train_speed(iter/s)": 0.005482
},
{
"epoch": 0.030754444978375782,
"grad_norm": 2.344477891921997,
"learning_rate": 6.101694915254238e-05,
"logits/chosen": -0.5697246789932251,
"logits/rejected": -0.5692474246025085,
"logps/chosen": -6.287097930908203,
"logps/rejected": -10.676097869873047,
"loss": 0.9974570274353027,
"memory(GiB)": 46.08,
"nll_loss": 0.3142527639865875,
"rewards/accuracies": 0.5625,
"rewards/chosen": 0.09520465135574341,
"rewards/margins": 0.04853628948330879,
"rewards/rejected": 0.046668365597724915,
"step": 18,
"train_speed(iter/s)": 0.005489
},
{
"epoch": 0.03246302525495221,
"grad_norm": 2.361417531967163,
"learning_rate": 6.440677966101695e-05,
"logits/chosen": -0.5909584164619446,
"logits/rejected": -0.596694827079773,
"logps/chosen": -4.706894874572754,
"logps/rejected": -12.18591022491455,
"loss": 0.8993738889694214,
"memory(GiB)": 46.08,
"nll_loss": 0.2403678447008133,
"rewards/accuracies": 0.65625,
"rewards/chosen": 0.1180216372013092,
"rewards/margins": 0.09891890734434128,
"rewards/rejected": 0.01910274103283882,
"step": 19,
"train_speed(iter/s)": 0.005497
},
{
"epoch": 0.03417160553152865,
"grad_norm": 2.1051840782165527,
"learning_rate": 6.779661016949152e-05,
"logits/chosen": -0.5925375819206238,
"logits/rejected": -0.5939764380455017,
"logps/chosen": -7.690135478973389,
"logps/rejected": -11.360199928283691,
"loss": 0.9811086058616638,
"memory(GiB)": 46.08,
"nll_loss": 0.27671271562576294,
"rewards/accuracies": 0.53125,
"rewards/chosen": 0.15354080498218536,
"rewards/margins": 0.02018781006336212,
"rewards/rejected": 0.13335299491882324,
"step": 20,
"train_speed(iter/s)": 0.005507
},
{
"epoch": 0.03588018580810508,
"grad_norm": 2.453577995300293,
"learning_rate": 7.11864406779661e-05,
"logits/chosen": -0.589929461479187,
"logits/rejected": -0.5913950800895691,
"logps/chosen": -6.006174564361572,
"logps/rejected": -12.356660842895508,
"loss": 0.8762722015380859,
"memory(GiB)": 46.08,
"nll_loss": 0.26102662086486816,
"rewards/accuracies": 0.6875,
"rewards/chosen": 0.15477147698402405,
"rewards/margins": 0.20186343789100647,
"rewards/rejected": -0.047091953456401825,
"step": 21,
"train_speed(iter/s)": 0.005501
},
{
"epoch": 0.03758876608468151,
"grad_norm": 2.334592819213867,
"learning_rate": 7.457627118644068e-05,
"logits/chosen": -0.6286447048187256,
"logits/rejected": -0.6310911178588867,
"logps/chosen": -9.828102111816406,
"logps/rejected": -16.171802520751953,
"loss": 0.9827708601951599,
"memory(GiB)": 46.08,
"nll_loss": 0.40016523003578186,
"rewards/accuracies": 0.78125,
"rewards/chosen": 0.22255462408065796,
"rewards/margins": 0.2890108525753021,
"rewards/rejected": -0.06645623594522476,
"step": 22,
"train_speed(iter/s)": 0.005501
},
{
"epoch": 0.039297346361257944,
"grad_norm": 2.763946533203125,
"learning_rate": 7.796610169491526e-05,
"logits/chosen": -0.6423724889755249,
"logits/rejected": -0.6475900411605835,
"logps/chosen": -7.048077583312988,
"logps/rejected": -17.518115997314453,
"loss": 1.029776692390442,
"memory(GiB)": 46.08,
"nll_loss": 0.4258265495300293,
"rewards/accuracies": 0.78125,
"rewards/chosen": 0.13568007946014404,
"rewards/margins": 0.24192118644714355,
"rewards/rejected": -0.10624107718467712,
"step": 23,
"train_speed(iter/s)": 0.005498
},
{
"epoch": 0.041005926637834374,
"grad_norm": 5.438773155212402,
"learning_rate": 8.135593220338983e-05,
"logits/chosen": -0.611075758934021,
"logits/rejected": -0.6109172701835632,
"logps/chosen": -8.579011917114258,
"logps/rejected": -12.74751091003418,
"loss": 1.2176915407180786,
"memory(GiB)": 46.08,
"nll_loss": 0.5213994979858398,
"rewards/accuracies": 0.59375,
"rewards/chosen": -0.010570855811238289,
"rewards/margins": 0.06740333139896393,
"rewards/rejected": -0.07797417044639587,
"step": 24,
"train_speed(iter/s)": 0.005493
},
{
"epoch": 0.0427145069144108,
"grad_norm": 3.8305866718292236,
"learning_rate": 8.474576271186441e-05,
"logits/chosen": -0.6644467711448669,
"logits/rejected": -0.6674079298973083,
"logps/chosen": -6.975298881530762,
"logps/rejected": -15.503819465637207,
"loss": 0.922063410282135,
"memory(GiB)": 46.08,
"nll_loss": 0.3326256275177002,
"rewards/accuracies": 0.71875,
"rewards/chosen": 0.06792093813419342,
"rewards/margins": 0.324211061000824,
"rewards/rejected": -0.25629013776779175,
"step": 25,
"train_speed(iter/s)": 0.00549
},
{
"epoch": 0.04442308719098724,
"grad_norm": 4.446774959564209,
"learning_rate": 8.813559322033899e-05,
"logits/chosen": -0.6409133076667786,
"logits/rejected": -0.6452510356903076,
"logps/chosen": -5.22960090637207,
"logps/rejected": -16.918365478515625,
"loss": 0.7774365544319153,
"memory(GiB)": 46.08,
"nll_loss": 0.2448062300682068,
"rewards/accuracies": 0.84375,
"rewards/chosen": 0.2400483787059784,
"rewards/margins": 0.39764925837516785,
"rewards/rejected": -0.15760089457035065,
"step": 26,
"train_speed(iter/s)": 0.005489
},
{
"epoch": 0.04613166746756367,
"grad_norm": 2.5869643688201904,
"learning_rate": 9.152542372881357e-05,
"logits/chosen": -0.6091906428337097,
"logits/rejected": -0.6120930910110474,
"logps/chosen": -7.03964376449585,
"logps/rejected": -18.091930389404297,
"loss": 0.8498358726501465,
"memory(GiB)": 46.08,
"nll_loss": 0.3106813132762909,
"rewards/accuracies": 0.78125,
"rewards/chosen": 0.1571023166179657,
"rewards/margins": 0.4190843403339386,
"rewards/rejected": -0.2619820237159729,
"step": 27,
"train_speed(iter/s)": 0.005489
},
{
"epoch": 0.047840247744140106,
"grad_norm": 3.0630600452423096,
"learning_rate": 9.491525423728815e-05,
"logits/chosen": -0.6014366745948792,
"logits/rejected": -0.6016579270362854,
"logps/chosen": -9.281977653503418,
"logps/rejected": -13.255182266235352,
"loss": 0.9999822974205017,
"memory(GiB)": 46.08,
"nll_loss": 0.3916056454181671,
"rewards/accuracies": 0.71875,
"rewards/chosen": 0.0838853195309639,
"rewards/margins": 0.22357328236103058,
"rewards/rejected": -0.13968798518180847,
"step": 28,
"train_speed(iter/s)": 0.005488
},
{
"epoch": 0.049548828020716536,
"grad_norm": 4.956308364868164,
"learning_rate": 9.830508474576272e-05,
"logits/chosen": -0.6361557841300964,
"logits/rejected": -0.6375819444656372,
"logps/chosen": -5.407459735870361,
"logps/rejected": -12.960749626159668,
"loss": 0.9380594491958618,
"memory(GiB)": 46.08,
"nll_loss": 0.39800193905830383,
"rewards/accuracies": 0.75,
"rewards/chosen": 0.14713114500045776,
"rewards/margins": 0.4169777035713196,
"rewards/rejected": -0.2698465585708618,
"step": 29,
"train_speed(iter/s)": 0.005494
},
{
"epoch": 0.051257408297292965,
"grad_norm": 6.679542541503906,
"learning_rate": 0.00010169491525423729,
"logits/chosen": -0.6229231357574463,
"logits/rejected": -0.6250395178794861,
"logps/chosen": -11.77493667602539,
"logps/rejected": -18.192317962646484,
"loss": 0.7899165749549866,
"memory(GiB)": 46.08,
"nll_loss": 0.2795858085155487,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.09651458263397217,
"rewards/margins": 0.49087047576904297,
"rewards/rejected": -0.3943559229373932,
"step": 30,
"train_speed(iter/s)": 0.005497
},
{
"epoch": 0.0529659885738694,
"grad_norm": 4.011873245239258,
"learning_rate": 0.00010508474576271188,
"logits/chosen": -0.6524882912635803,
"logits/rejected": -0.6541539430618286,
"logps/chosen": -7.8713202476501465,
"logps/rejected": -11.641451835632324,
"loss": 0.9657379984855652,
"memory(GiB)": 46.08,
"nll_loss": 0.40233710408210754,
"rewards/accuracies": 0.71875,
"rewards/chosen": 0.11578395962715149,
"rewards/margins": 0.36746829748153687,
"rewards/rejected": -0.25168436765670776,
"step": 31,
"train_speed(iter/s)": 0.005488
},
{
"epoch": 0.05467456885044583,
"grad_norm": 4.144499778747559,
"learning_rate": 0.00010847457627118644,
"logits/chosen": -0.6458109617233276,
"logits/rejected": -0.6519441604614258,
"logps/chosen": -8.17459487915039,
"logps/rejected": -19.17450714111328,
"loss": 0.9243566989898682,
"memory(GiB)": 46.08,
"nll_loss": 0.3649522066116333,
"rewards/accuracies": 0.71875,
"rewards/chosen": 0.17762523889541626,
"rewards/margins": 0.41990581154823303,
"rewards/rejected": -0.24228057265281677,
"step": 32,
"train_speed(iter/s)": 0.005494
},
{
"epoch": 0.05638314912702227,
"grad_norm": 2.5846283435821533,
"learning_rate": 0.00011186440677966102,
"logits/chosen": -0.6422857046127319,
"logits/rejected": -0.64764004945755,
"logps/chosen": -7.8391828536987305,
"logps/rejected": -16.905941009521484,
"loss": 0.8121039867401123,
"memory(GiB)": 46.08,
"nll_loss": 0.3524104952812195,
"rewards/accuracies": 0.84375,
"rewards/chosen": 0.21112650632858276,
"rewards/margins": 0.6391255259513855,
"rewards/rejected": -0.42799898982048035,
"step": 33,
"train_speed(iter/s)": 0.005495
},
{
"epoch": 0.0580917294035987,
"grad_norm": 2.831099271774292,
"learning_rate": 0.0001152542372881356,
"logits/chosen": -0.6351624727249146,
"logits/rejected": -0.6340872645378113,
"logps/chosen": -8.873239517211914,
"logps/rejected": -14.13478946685791,
"loss": 0.9939954280853271,
"memory(GiB)": 46.08,
"nll_loss": 0.5031149983406067,
"rewards/accuracies": 0.8125,
"rewards/chosen": 0.15203362703323364,
"rewards/margins": 0.5661364793777466,
"rewards/rejected": -0.41410285234451294,
"step": 34,
"train_speed(iter/s)": 0.005494
},
{
"epoch": 0.05980030968017513,
"grad_norm": 6.754673004150391,
"learning_rate": 0.00011864406779661017,
"logits/chosen": -0.6350009441375732,
"logits/rejected": -0.6345161199569702,
"logps/chosen": -9.049372673034668,
"logps/rejected": -13.872842788696289,
"loss": 0.9677298069000244,
"memory(GiB)": 46.08,
"nll_loss": 0.4823642373085022,
"rewards/accuracies": 0.8125,
"rewards/chosen": 0.18822304904460907,
"rewards/margins": 0.5690968632698059,
"rewards/rejected": -0.38087382912635803,
"step": 35,
"train_speed(iter/s)": 0.005494
},
{
"epoch": 0.061508889956751564,
"grad_norm": 5.09066915512085,
"learning_rate": 0.00012203389830508477,
"logits/chosen": -0.5940477252006531,
"logits/rejected": -0.5995637774467468,
"logps/chosen": -6.552436351776123,
"logps/rejected": -22.02668571472168,
"loss": 1.0198695659637451,
"memory(GiB)": 46.08,
"nll_loss": 0.5385282635688782,
"rewards/accuracies": 0.78125,
"rewards/chosen": 0.09731997549533844,
"rewards/margins": 0.7183221578598022,
"rewards/rejected": -0.621002197265625,
"step": 36,
"train_speed(iter/s)": 0.005496
},
{
"epoch": 0.063217470233328,
"grad_norm": 6.366957664489746,
"learning_rate": 0.00012542372881355933,
"logits/chosen": -0.5671308040618896,
"logits/rejected": -0.5699396133422852,
"logps/chosen": -8.690061569213867,
"logps/rejected": -18.227741241455078,
"loss": 0.9119342565536499,
"memory(GiB)": 46.08,
"nll_loss": 0.4206831753253937,
"rewards/accuracies": 0.84375,
"rewards/chosen": 0.008592324331402779,
"rewards/margins": 0.7837947010993958,
"rewards/rejected": -0.7752023935317993,
"step": 37,
"train_speed(iter/s)": 0.005499
},
{
"epoch": 0.06492605050990442,
"grad_norm": 8.224360466003418,
"learning_rate": 0.0001288135593220339,
"logits/chosen": -0.6006415486335754,
"logits/rejected": -0.6039485931396484,
"logps/chosen": -7.98246955871582,
"logps/rejected": -19.214567184448242,
"loss": 1.020494818687439,
"memory(GiB)": 46.08,
"nll_loss": 0.47989213466644287,
"rewards/accuracies": 0.65625,
"rewards/chosen": -0.017101695761084557,
"rewards/margins": 0.7686665654182434,
"rewards/rejected": -0.7857682704925537,
"step": 38,
"train_speed(iter/s)": 0.005499
},
{
"epoch": 0.06663463078648085,
"grad_norm": 5.284773349761963,
"learning_rate": 0.00013220338983050849,
"logits/chosen": -0.5746678709983826,
"logits/rejected": -0.5742544531822205,
"logps/chosen": -10.300456047058105,
"logps/rejected": -14.731122970581055,
"loss": 1.1951102018356323,
"memory(GiB)": 46.08,
"nll_loss": 0.6024460196495056,
"rewards/accuracies": 0.6875,
"rewards/chosen": -0.005457160994410515,
"rewards/margins": 0.43640822172164917,
"rewards/rejected": -0.44186532497406006,
"step": 39,
"train_speed(iter/s)": 0.005499
},
{
"epoch": 0.0683432110630573,
"grad_norm": 4.581506252288818,
"learning_rate": 0.00013559322033898305,
"logits/chosen": -0.5436846613883972,
"logits/rejected": -0.5412294268608093,
"logps/chosen": -11.306229591369629,
"logps/rejected": -15.808780670166016,
"loss": 0.9979494214057922,
"memory(GiB)": 46.08,
"nll_loss": 0.4069577753543854,
"rewards/accuracies": 0.6875,
"rewards/chosen": -0.10538371652364731,
"rewards/margins": 0.4707936942577362,
"rewards/rejected": -0.5761774778366089,
"step": 40,
"train_speed(iter/s)": 0.005496
},
{
"epoch": 0.07005179133963373,
"grad_norm": 4.280210018157959,
"learning_rate": 0.00013898305084745764,
"logits/chosen": -0.5919702649116516,
"logits/rejected": -0.5944460034370422,
"logps/chosen": -4.601211071014404,
"logps/rejected": -18.39055061340332,
"loss": 0.7289348244667053,
"memory(GiB)": 46.08,
"nll_loss": 0.2620496451854706,
"rewards/accuracies": 0.8125,
"rewards/chosen": 0.1577654778957367,
"rewards/margins": 0.7140093445777893,
"rewards/rejected": -0.5562438368797302,
"step": 41,
"train_speed(iter/s)": 0.005492
},
{
"epoch": 0.07176037161621016,
"grad_norm": 2.8965229988098145,
"learning_rate": 0.0001423728813559322,
"logits/chosen": -0.5226963758468628,
"logits/rejected": -0.5210604667663574,
"logps/chosen": -8.042407035827637,
"logps/rejected": -13.117356300354004,
"loss": 0.8382841944694519,
"memory(GiB)": 46.08,
"nll_loss": 0.3229953646659851,
"rewards/accuracies": 0.78125,
"rewards/chosen": 0.15337654948234558,
"rewards/margins": 0.5258168578147888,
"rewards/rejected": -0.3724403381347656,
"step": 42,
"train_speed(iter/s)": 0.005494
},
{
"epoch": 0.07346895189278659,
"grad_norm": 4.7869791984558105,
"learning_rate": 0.00014576271186440677,
"logits/chosen": -0.5595600605010986,
"logits/rejected": -0.5619646310806274,
"logps/chosen": -5.741379261016846,
"logps/rejected": -14.867729187011719,
"loss": 0.9325981140136719,
"memory(GiB)": 46.08,
"nll_loss": 0.34299078583717346,
"rewards/accuracies": 0.75,
"rewards/chosen": 0.06792251765727997,
"rewards/margins": 0.3079211115837097,
"rewards/rejected": -0.23999860882759094,
"step": 43,
"train_speed(iter/s)": 0.005494
},
{
"epoch": 0.07517753216936301,
"grad_norm": 3.8402724266052246,
"learning_rate": 0.00014915254237288136,
"logits/chosen": -0.5551996231079102,
"logits/rejected": -0.5583171248435974,
"logps/chosen": -7.729850769042969,
"logps/rejected": -14.535001754760742,
"loss": 0.985005795955658,
"memory(GiB)": 46.08,
"nll_loss": 0.37224525213241577,
"rewards/accuracies": 0.6875,
"rewards/chosen": 0.0475621297955513,
"rewards/margins": 0.2842516601085663,
"rewards/rejected": -0.23668958246707916,
"step": 44,
"train_speed(iter/s)": 0.005495
},
{
"epoch": 0.07688611244593946,
"grad_norm": 3.136073112487793,
"learning_rate": 0.00015254237288135592,
"logits/chosen": -0.5538796186447144,
"logits/rejected": -0.5563740730285645,
"logps/chosen": -8.61514663696289,
"logps/rejected": -20.434301376342773,
"loss": 0.8447250723838806,
"memory(GiB)": 46.08,
"nll_loss": 0.3852572441101074,
"rewards/accuracies": 0.90625,
"rewards/chosen": 0.17051486670970917,
"rewards/margins": 0.695674479007721,
"rewards/rejected": -0.5251596570014954,
"step": 45,
"train_speed(iter/s)": 0.005495
},
{
"epoch": 0.07859469272251589,
"grad_norm": 2.950076103210449,
"learning_rate": 0.00015593220338983051,
"logits/chosen": -0.588573694229126,
"logits/rejected": -0.5898380875587463,
"logps/chosen": -8.49618911743164,
"logps/rejected": -16.47633171081543,
"loss": 0.8776077032089233,
"memory(GiB)": 46.08,
"nll_loss": 0.3434315621852875,
"rewards/accuracies": 0.78125,
"rewards/chosen": 0.1189945787191391,
"rewards/margins": 0.5393712520599365,
"rewards/rejected": -0.42037665843963623,
"step": 46,
"train_speed(iter/s)": 0.005498
},
{
"epoch": 0.08030327299909232,
"grad_norm": 2.918926954269409,
"learning_rate": 0.00015932203389830508,
"logits/chosen": -0.5735058188438416,
"logits/rejected": -0.5742441415786743,
"logps/chosen": -10.007829666137695,
"logps/rejected": -15.225828170776367,
"loss": 0.9683640003204346,
"memory(GiB)": 46.08,
"nll_loss": 0.4518345892429352,
"rewards/accuracies": 0.8125,
"rewards/chosen": 0.29521822929382324,
"rewards/margins": 0.5080306529998779,
"rewards/rejected": -0.2128123939037323,
"step": 47,
"train_speed(iter/s)": 0.005501
},
{
"epoch": 0.08201185327566875,
"grad_norm": 2.885613441467285,
"learning_rate": 0.00016271186440677967,
"logits/chosen": -0.5690568089485168,
"logits/rejected": -0.570725679397583,
"logps/chosen": -6.9214887619018555,
"logps/rejected": -17.073692321777344,
"loss": 0.8013411164283752,
"memory(GiB)": 46.08,
"nll_loss": 0.2747730612754822,
"rewards/accuracies": 0.78125,
"rewards/chosen": 0.1803244799375534,
"rewards/margins": 0.5454539060592651,
"rewards/rejected": -0.36512941122055054,
"step": 48,
"train_speed(iter/s)": 0.005502
},
{
"epoch": 0.08372043355224518,
"grad_norm": 2.8386495113372803,
"learning_rate": 0.00016610169491525423,
"logits/chosen": -0.5691187381744385,
"logits/rejected": -0.5723721981048584,
"logps/chosen": -6.647555828094482,
"logps/rejected": -18.68927764892578,
"loss": 0.731940746307373,
"memory(GiB)": 46.08,
"nll_loss": 0.31857162714004517,
"rewards/accuracies": 0.90625,
"rewards/chosen": 0.15964265167713165,
"rewards/margins": 0.8172457218170166,
"rewards/rejected": -0.6576029062271118,
"step": 49,
"train_speed(iter/s)": 0.005503
},
{
"epoch": 0.0854290138288216,
"grad_norm": 6.678228855133057,
"learning_rate": 0.00016949152542372882,
"logits/chosen": -0.569486141204834,
"logits/rejected": -0.5724078416824341,
"logps/chosen": -7.978659629821777,
"logps/rejected": -18.0915584564209,
"loss": 0.8816509246826172,
"memory(GiB)": 46.08,
"nll_loss": 0.41086509823799133,
"rewards/accuracies": 0.84375,
"rewards/chosen": 0.16925573348999023,
"rewards/margins": 0.6901466846466064,
"rewards/rejected": -0.520891010761261,
"step": 50,
"train_speed(iter/s)": 0.0055
},
{
"epoch": 0.08713759410539805,
"grad_norm": 3.4269354343414307,
"learning_rate": 0.00017288135593220342,
"logits/chosen": -0.6229482889175415,
"logits/rejected": -0.624045193195343,
"logps/chosen": -8.981767654418945,
"logps/rejected": -18.87827491760254,
"loss": 0.902818500995636,
"memory(GiB)": 46.08,
"nll_loss": 0.4753139615058899,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.12949834764003754,
"rewards/margins": 0.91382896900177,
"rewards/rejected": -0.7843306064605713,
"step": 51,
"train_speed(iter/s)": 0.005488
},
{
"epoch": 0.08884617438197448,
"grad_norm": 3.730417013168335,
"learning_rate": 0.00017627118644067798,
"logits/chosen": -0.5907954573631287,
"logits/rejected": -0.5928065776824951,
"logps/chosen": -8.826777458190918,
"logps/rejected": -25.743032455444336,
"loss": 0.8241711854934692,
"memory(GiB)": 46.08,
"nll_loss": 0.4183700382709503,
"rewards/accuracies": 0.84375,
"rewards/chosen": 0.15070247650146484,
"rewards/margins": 1.0849279165267944,
"rewards/rejected": -0.9342254400253296,
"step": 52,
"train_speed(iter/s)": 0.00549
},
{
"epoch": 0.09055475465855091,
"grad_norm": 6.543994426727295,
"learning_rate": 0.00017966101694915257,
"logits/chosen": -0.5657305717468262,
"logits/rejected": -0.5669429898262024,
"logps/chosen": -11.976017951965332,
"logps/rejected": -18.324581146240234,
"loss": 1.1098811626434326,
"memory(GiB)": 46.08,
"nll_loss": 0.5012481808662415,
"rewards/accuracies": 0.625,
"rewards/chosen": -0.04995343089103699,
"rewards/margins": 0.5761421918869019,
"rewards/rejected": -0.6260955929756165,
"step": 53,
"train_speed(iter/s)": 0.005492
},
{
"epoch": 0.09226333493512734,
"grad_norm": 7.451931476593018,
"learning_rate": 0.00018305084745762714,
"logits/chosen": -0.5736872553825378,
"logits/rejected": -0.5727863907814026,
"logps/chosen": -9.956096649169922,
"logps/rejected": -17.354209899902344,
"loss": 1.0036059617996216,
"memory(GiB)": 46.38,
"nll_loss": 0.35273733735084534,
"rewards/accuracies": 0.65625,
"rewards/chosen": -0.07980930060148239,
"rewards/margins": 0.5828754901885986,
"rewards/rejected": -0.6626847982406616,
"step": 54,
"train_speed(iter/s)": 0.005492
},
{
"epoch": 0.09397191521170377,
"grad_norm": 4.901066303253174,
"learning_rate": 0.0001864406779661017,
"logits/chosen": -0.5865222811698914,
"logits/rejected": -0.5857770442962646,
"logps/chosen": -6.749457359313965,
"logps/rejected": -19.966379165649414,
"loss": 0.836351215839386,
"memory(GiB)": 46.38,
"nll_loss": 0.30449604988098145,
"rewards/accuracies": 0.6875,
"rewards/chosen": 0.11927387118339539,
"rewards/margins": 0.7463572025299072,
"rewards/rejected": -0.6270833611488342,
"step": 55,
"train_speed(iter/s)": 0.005491
},
{
"epoch": 0.09568049548828021,
"grad_norm": 3.0312962532043457,
"learning_rate": 0.0001898305084745763,
"logits/chosen": -0.5644817352294922,
"logits/rejected": -0.5671055912971497,
"logps/chosen": -6.525354862213135,
"logps/rejected": -18.556304931640625,
"loss": 0.7299084663391113,
"memory(GiB)": 46.38,
"nll_loss": 0.2566152811050415,
"rewards/accuracies": 0.8125,
"rewards/chosen": 0.051953963935375214,
"rewards/margins": 0.8131421804428101,
"rewards/rejected": -0.7611882090568542,
"step": 56,
"train_speed(iter/s)": 0.005492
},
{
"epoch": 0.09738907576485664,
"grad_norm": 6.161406517028809,
"learning_rate": 0.00019322033898305085,
"logits/chosen": -0.5638913512229919,
"logits/rejected": -0.5684786438941956,
"logps/chosen": -8.483434677124023,
"logps/rejected": -20.397701263427734,
"loss": 0.988010585308075,
"memory(GiB)": 46.38,
"nll_loss": 0.4928280711174011,
"rewards/accuracies": 0.71875,
"rewards/chosen": 0.17585664987564087,
"rewards/margins": 0.6749651432037354,
"rewards/rejected": -0.4991084933280945,
"step": 57,
"train_speed(iter/s)": 0.00549
},
{
"epoch": 0.09909765604143307,
"grad_norm": 4.03005313873291,
"learning_rate": 0.00019661016949152545,
"logits/chosen": -0.5518775582313538,
"logits/rejected": -0.552839994430542,
"logps/chosen": -6.419961929321289,
"logps/rejected": -20.10483169555664,
"loss": 0.7270359396934509,
"memory(GiB)": 46.38,
"nll_loss": 0.2987552881240845,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.23015271127223969,
"rewards/margins": 0.8427435159683228,
"rewards/rejected": -0.6125907897949219,
"step": 58,
"train_speed(iter/s)": 0.00549
},
{
"epoch": 0.1008062363180095,
"grad_norm": 2.9903881549835205,
"learning_rate": 0.0002,
"logits/chosen": -0.558972954750061,
"logits/rejected": -0.559365451335907,
"logps/chosen": -7.266337871551514,
"logps/rejected": -19.700899124145508,
"loss": 0.8035504221916199,
"memory(GiB)": 46.38,
"nll_loss": 0.35604721307754517,
"rewards/accuracies": 0.90625,
"rewards/chosen": 0.23076069355010986,
"rewards/margins": 0.6581640243530273,
"rewards/rejected": -0.4274032711982727,
"step": 59,
"train_speed(iter/s)": 0.005494
},
{
"epoch": 0.10251481659458593,
"grad_norm": 2.308953046798706,
"learning_rate": 0.00019999960020133237,
"logits/chosen": -0.5721818804740906,
"logits/rejected": -0.5736841559410095,
"logps/chosen": -5.192386150360107,
"logps/rejected": -16.873666763305664,
"loss": 0.6971458196640015,
"memory(GiB)": 46.38,
"nll_loss": 0.25499823689460754,
"rewards/accuracies": 0.84375,
"rewards/chosen": 0.14774081110954285,
"rewards/margins": 0.7478816509246826,
"rewards/rejected": -0.6001408696174622,
"step": 60,
"train_speed(iter/s)": 0.005494
},
{
"epoch": 0.10422339687116237,
"grad_norm": 6.15336275100708,
"learning_rate": 0.00019999840080852627,
"logits/chosen": -0.6088159680366516,
"logits/rejected": -0.6091991662979126,
"logps/chosen": -10.085458755493164,
"logps/rejected": -16.714794158935547,
"loss": 1.2082210779190063,
"memory(GiB)": 46.38,
"nll_loss": 0.6319302320480347,
"rewards/accuracies": 0.6875,
"rewards/chosen": -0.015833575278520584,
"rewards/margins": 0.46795743703842163,
"rewards/rejected": -0.4837909936904907,
"step": 61,
"train_speed(iter/s)": 0.005494
},
{
"epoch": 0.1059319771477388,
"grad_norm": 4.543377876281738,
"learning_rate": 0.00019999640183117196,
"logits/chosen": -0.6160375475883484,
"logits/rejected": -0.6183785796165466,
"logps/chosen": -7.354756832122803,
"logps/rejected": -17.332752227783203,
"loss": 0.9280235767364502,
"memory(GiB)": 46.38,
"nll_loss": 0.39269304275512695,
"rewards/accuracies": 0.65625,
"rewards/chosen": 0.00012398138642311096,
"rewards/margins": 0.7065204381942749,
"rewards/rejected": -0.7063965797424316,
"step": 62,
"train_speed(iter/s)": 0.005497
},
{
"epoch": 0.10764055742431523,
"grad_norm": 3.700834035873413,
"learning_rate": 0.00019999360328525325,
"logits/chosen": -0.5955262780189514,
"logits/rejected": -0.5960131287574768,
"logps/chosen": -7.038027763366699,
"logps/rejected": -19.62297248840332,
"loss": 0.8426406383514404,
"memory(GiB)": 46.38,
"nll_loss": 0.304790735244751,
"rewards/accuracies": 0.78125,
"rewards/chosen": 0.04702156037092209,
"rewards/margins": 0.6756925582885742,
"rewards/rejected": -0.6286709904670715,
"step": 63,
"train_speed(iter/s)": 0.005495
},
{
"epoch": 0.10934913770089166,
"grad_norm": 3.616783857345581,
"learning_rate": 0.00019999000519314722,
"logits/chosen": -0.5933761596679688,
"logits/rejected": -0.5956672430038452,
"logps/chosen": -10.029403686523438,
"logps/rejected": -19.743268966674805,
"loss": 0.8910276889801025,
"memory(GiB)": 46.38,
"nll_loss": 0.4178580045700073,
"rewards/accuracies": 0.8125,
"rewards/chosen": 0.059932250529527664,
"rewards/margins": 0.7701122164726257,
"rewards/rejected": -0.7101800441741943,
"step": 64,
"train_speed(iter/s)": 0.005494
},
{
"epoch": 0.11105771797746809,
"grad_norm": 2.8669040203094482,
"learning_rate": 0.00019998560758362416,
"logits/chosen": -0.6144078373908997,
"logits/rejected": -0.6167560815811157,
"logps/chosen": -10.685945510864258,
"logps/rejected": -23.724315643310547,
"loss": 0.7696695923805237,
"memory(GiB)": 46.38,
"nll_loss": 0.3780427873134613,
"rewards/accuracies": 0.90625,
"rewards/chosen": 0.1446903944015503,
"rewards/margins": 1.0186232328414917,
"rewards/rejected": -0.873932957649231,
"step": 65,
"train_speed(iter/s)": 0.005493
},
{
"epoch": 0.11276629825404454,
"grad_norm": 4.312869548797607,
"learning_rate": 0.00019998041049184719,
"logits/chosen": -0.620762050151825,
"logits/rejected": -0.6244264245033264,
"logps/chosen": -11.728214263916016,
"logps/rejected": -26.204395294189453,
"loss": 0.7992648482322693,
"memory(GiB)": 46.38,
"nll_loss": 0.4216463565826416,
"rewards/accuracies": 0.8125,
"rewards/chosen": 0.14800474047660828,
"rewards/margins": 1.0791853666305542,
"rewards/rejected": -0.9311806559562683,
"step": 66,
"train_speed(iter/s)": 0.005493
},
{
"epoch": 0.11447487853062097,
"grad_norm": 7.865874290466309,
"learning_rate": 0.00019997441395937213,
"logits/chosen": -0.6298569440841675,
"logits/rejected": -0.6332789659500122,
"logps/chosen": -7.128231525421143,
"logps/rejected": -22.970563888549805,
"loss": 0.7514320015907288,
"memory(GiB)": 46.38,
"nll_loss": 0.33478716015815735,
"rewards/accuracies": 0.84375,
"rewards/chosen": 0.05204010754823685,
"rewards/margins": 0.9836788773536682,
"rewards/rejected": -0.931638777256012,
"step": 67,
"train_speed(iter/s)": 0.005494
},
{
"epoch": 0.1161834588071974,
"grad_norm": 6.099157810211182,
"learning_rate": 0.0001999676180341471,
"logits/chosen": -0.6536255478858948,
"logits/rejected": -0.6564731597900391,
"logps/chosen": -10.524028778076172,
"logps/rejected": -19.91427993774414,
"loss": 1.1307811737060547,
"memory(GiB)": 46.38,
"nll_loss": 0.7356545925140381,
"rewards/accuracies": 0.84375,
"rewards/chosen": 0.028077581897377968,
"rewards/margins": 0.9777989387512207,
"rewards/rejected": -0.9497213363647461,
"step": 68,
"train_speed(iter/s)": 0.005495
},
{
"epoch": 0.11789203908377383,
"grad_norm": 5.27453088760376,
"learning_rate": 0.00019996002277051218,
"logits/chosen": -0.6637449264526367,
"logits/rejected": -0.6651371717453003,
"logps/chosen": -9.458850860595703,
"logps/rejected": -16.127042770385742,
"loss": 1.4500970840454102,
"memory(GiB)": 46.38,
"nll_loss": 0.8368474841117859,
"rewards/accuracies": 0.71875,
"rewards/chosen": -0.15293718874454498,
"rewards/margins": 0.500515878200531,
"rewards/rejected": -0.6534531116485596,
"step": 69,
"train_speed(iter/s)": 0.005497
},
{
"epoch": 0.11960061936035025,
"grad_norm": 4.469899654388428,
"learning_rate": 0.00019995162822919883,
"logits/chosen": -0.6642380356788635,
"logits/rejected": -0.664824366569519,
"logps/chosen": -8.725358963012695,
"logps/rejected": -16.164390563964844,
"loss": 0.8428195714950562,
"memory(GiB)": 46.38,
"nll_loss": 0.3803461194038391,
"rewards/accuracies": 0.8125,
"rewards/chosen": 0.08946336805820465,
"rewards/margins": 0.7338303327560425,
"rewards/rejected": -0.644366979598999,
"step": 70,
"train_speed(iter/s)": 0.005495
},
{
"epoch": 0.12130919963692668,
"grad_norm": 4.995606422424316,
"learning_rate": 0.00019994243447732957,
"logits/chosen": -0.6431492567062378,
"logits/rejected": -0.6473235487937927,
"logps/chosen": -8.270989418029785,
"logps/rejected": -24.483354568481445,
"loss": 0.8698587417602539,
"memory(GiB)": 46.38,
"nll_loss": 0.4563717544078827,
"rewards/accuracies": 0.84375,
"rewards/chosen": 0.07262411713600159,
"rewards/margins": 1.0772123336791992,
"rewards/rejected": -1.0045881271362305,
"step": 71,
"train_speed(iter/s)": 0.005495
},
{
"epoch": 0.12301777991350313,
"grad_norm": 3.5250916481018066,
"learning_rate": 0.00019993244158841747,
"logits/chosen": -0.6772405505180359,
"logits/rejected": -0.6789288520812988,
"logps/chosen": -9.19353199005127,
"logps/rejected": -27.746652603149414,
"loss": 0.8238008618354797,
"memory(GiB)": 46.38,
"nll_loss": 0.39661213755607605,
"rewards/accuracies": 0.6875,
"rewards/chosen": 0.09302112460136414,
"rewards/margins": 1.367937684059143,
"rewards/rejected": -1.274916410446167,
"step": 72,
"train_speed(iter/s)": 0.005495
},
{
"epoch": 0.12472636019007956,
"grad_norm": 3.276311159133911,
"learning_rate": 0.00019992164964236533,
"logits/chosen": -0.6857064962387085,
"logits/rejected": -0.685559868812561,
"logps/chosen": -11.672329902648926,
"logps/rejected": -21.510480880737305,
"loss": 0.9018468856811523,
"memory(GiB)": 46.38,
"nll_loss": 0.41466090083122253,
"rewards/accuracies": 0.75,
"rewards/chosen": 0.07735104858875275,
"rewards/margins": 0.9590628147125244,
"rewards/rejected": -0.8817118406295776,
"step": 73,
"train_speed(iter/s)": 0.005495
},
{
"epoch": 0.126434940466656,
"grad_norm": 3.369281768798828,
"learning_rate": 0.00019991005872546527,
"logits/chosen": -0.6608355641365051,
"logits/rejected": -0.6626392602920532,
"logps/chosen": -7.696371078491211,
"logps/rejected": -16.016326904296875,
"loss": 0.8347861766815186,
"memory(GiB)": 46.38,
"nll_loss": 0.3552168607711792,
"rewards/accuracies": 0.90625,
"rewards/chosen": 0.13171803951263428,
"rewards/margins": 0.7066640853881836,
"rewards/rejected": -0.5749460458755493,
"step": 74,
"train_speed(iter/s)": 0.005494
},
{
"epoch": 0.12814352074323243,
"grad_norm": 2.894788980484009,
"learning_rate": 0.00019989766893039804,
"logits/chosen": -0.6222079992294312,
"logits/rejected": -0.6232355833053589,
"logps/chosen": -5.741198539733887,
"logps/rejected": -21.31194305419922,
"loss": 0.7077224850654602,
"memory(GiB)": 46.38,
"nll_loss": 0.2760768234729767,
"rewards/accuracies": 0.84375,
"rewards/chosen": 0.08473706245422363,
"rewards/margins": 0.9282934665679932,
"rewards/rejected": -0.8435564041137695,
"step": 75,
"train_speed(iter/s)": 0.005493
},
{
"epoch": 0.12985210101980885,
"grad_norm": 2.1586077213287354,
"learning_rate": 0.00019988448035623203,
"logits/chosen": -0.6409361958503723,
"logits/rejected": -0.6418861150741577,
"logps/chosen": -7.263876438140869,
"logps/rejected": -17.95524024963379,
"loss": 0.8056262731552124,
"memory(GiB)": 46.38,
"nll_loss": 0.2723458409309387,
"rewards/accuracies": 0.71875,
"rewards/chosen": 0.10251796990633011,
"rewards/margins": 0.5812361240386963,
"rewards/rejected": -0.4787181317806244,
"step": 76,
"train_speed(iter/s)": 0.005491
},
{
"epoch": 0.1315606812963853,
"grad_norm": 3.0591204166412354,
"learning_rate": 0.00019987049310842272,
"logits/chosen": -0.6324824690818787,
"logits/rejected": -0.6336201429367065,
"logps/chosen": -10.325702667236328,
"logps/rejected": -15.849100112915039,
"loss": 0.8897943496704102,
"memory(GiB)": 46.38,
"nll_loss": 0.3855420649051666,
"rewards/accuracies": 0.84375,
"rewards/chosen": 0.16009055078029633,
"rewards/margins": 0.6010256409645081,
"rewards/rejected": -0.4409351050853729,
"step": 77,
"train_speed(iter/s)": 0.005491
},
{
"epoch": 0.1332692615729617,
"grad_norm": 2.668419122695923,
"learning_rate": 0.00019985570729881184,
"logits/chosen": -0.6462000012397766,
"logits/rejected": -0.6490585207939148,
"logps/chosen": -5.475035667419434,
"logps/rejected": -20.422216415405273,
"loss": 0.7187508344650269,
"memory(GiB)": 46.38,
"nll_loss": 0.26306530833244324,
"rewards/accuracies": 0.84375,
"rewards/chosen": 0.13646253943443298,
"rewards/margins": 0.6754783391952515,
"rewards/rejected": -0.5390157699584961,
"step": 78,
"train_speed(iter/s)": 0.005491
},
{
"epoch": 0.13497784184953815,
"grad_norm": 4.360518932342529,
"learning_rate": 0.00019984012304562622,
"logits/chosen": -0.6780133247375488,
"logits/rejected": -0.6758167147636414,
"logps/chosen": -11.310664176940918,
"logps/rejected": -15.12096881866455,
"loss": 0.9152082800865173,
"memory(GiB)": 46.38,
"nll_loss": 0.45073550939559937,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.15347006916999817,
"rewards/margins": 0.7282993197441101,
"rewards/rejected": -0.5748292207717896,
"step": 79,
"train_speed(iter/s)": 0.00549
},
{
"epoch": 0.1366864221261146,
"grad_norm": 2.7597768306732178,
"learning_rate": 0.00019982374047347723,
"logits/chosen": -0.6909894943237305,
"logits/rejected": -0.694047212600708,
"logps/chosen": -6.004232406616211,
"logps/rejected": -23.221824645996094,
"loss": 0.6792643666267395,
"memory(GiB)": 46.38,
"nll_loss": 0.31354260444641113,
"rewards/accuracies": 0.96875,
"rewards/chosen": 0.21520498394966125,
"rewards/margins": 1.1965129375457764,
"rewards/rejected": -0.9813080430030823,
"step": 80,
"train_speed(iter/s)": 0.00549
},
{
"epoch": 0.138395002402691,
"grad_norm": 4.00593900680542,
"learning_rate": 0.00019980655971335945,
"logits/chosen": -0.666761577129364,
"logits/rejected": -0.6698122620582581,
"logps/chosen": -11.200495719909668,
"logps/rejected": -20.89803123474121,
"loss": 1.0373343229293823,
"memory(GiB)": 46.38,
"nll_loss": 0.5717941522598267,
"rewards/accuracies": 0.8125,
"rewards/chosen": -0.03891691192984581,
"rewards/margins": 0.8691489696502686,
"rewards/rejected": -0.9080657958984375,
"step": 81,
"train_speed(iter/s)": 0.00549
},
{
"epoch": 0.14010358267926745,
"grad_norm": 3.7606523036956787,
"learning_rate": 0.00019978858090264975,
"logits/chosen": -0.6808147430419922,
"logits/rejected": -0.683088481426239,
"logps/chosen": -8.414874076843262,
"logps/rejected": -28.505592346191406,
"loss": 0.7084274888038635,
"memory(GiB)": 46.38,
"nll_loss": 0.3828541338443756,
"rewards/accuracies": 0.90625,
"rewards/chosen": 0.1215677559375763,
"rewards/margins": 1.7334877252578735,
"rewards/rejected": -1.6119199991226196,
"step": 82,
"train_speed(iter/s)": 0.005491
},
{
"epoch": 0.14181216295584387,
"grad_norm": 4.108179569244385,
"learning_rate": 0.0001997698041851063,
"logits/chosen": -0.6897909045219421,
"logits/rejected": -0.6913143396377563,
"logps/chosen": -4.813051223754883,
"logps/rejected": -26.06230926513672,
"loss": 0.572483241558075,
"memory(GiB)": 46.38,
"nll_loss": 0.24444976449012756,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.15832601487636566,
"rewards/margins": 1.6045297384262085,
"rewards/rejected": -1.4462038278579712,
"step": 83,
"train_speed(iter/s)": 0.005491
},
{
"epoch": 0.1435207432324203,
"grad_norm": 5.49106502532959,
"learning_rate": 0.00019975022971086714,
"logits/chosen": -0.6466387510299683,
"logits/rejected": -0.6520243883132935,
"logps/chosen": -7.595500946044922,
"logps/rejected": -33.218482971191406,
"loss": 0.9090702533721924,
"memory(GiB)": 46.38,
"nll_loss": 0.5250993371009827,
"rewards/accuracies": 0.75,
"rewards/chosen": 0.13341139256954193,
"rewards/margins": 1.5776695013046265,
"rewards/rejected": -1.444258213043213,
"step": 84,
"train_speed(iter/s)": 0.005492
},
{
"epoch": 0.14522932350899675,
"grad_norm": 4.539761543273926,
"learning_rate": 0.00019972985763644932,
"logits/chosen": -0.6421160101890564,
"logits/rejected": -0.6411360502243042,
"logps/chosen": -7.4049482345581055,
"logps/rejected": -21.37047576904297,
"loss": 0.8407540917396545,
"memory(GiB)": 46.38,
"nll_loss": 0.4470757246017456,
"rewards/accuracies": 0.8125,
"rewards/chosen": 0.1697394847869873,
"rewards/margins": 1.345821738243103,
"rewards/rejected": -1.1760823726654053,
"step": 85,
"train_speed(iter/s)": 0.005493
},
{
"epoch": 0.14693790378557317,
"grad_norm": 4.877723217010498,
"learning_rate": 0.00019970868812474736,
"logits/chosen": -0.6163697242736816,
"logits/rejected": -0.6189360022544861,
"logps/chosen": -12.07491683959961,
"logps/rejected": -29.372955322265625,
"loss": 0.848598301410675,
"memory(GiB)": 46.38,
"nll_loss": 0.49112260341644287,
"rewards/accuracies": 0.8125,
"rewards/chosen": 0.1017676591873169,
"rewards/margins": 1.7578887939453125,
"rewards/rejected": -1.6561211347579956,
"step": 86,
"train_speed(iter/s)": 0.005493
},
{
"epoch": 0.14864648406214961,
"grad_norm": 5.431716442108154,
"learning_rate": 0.00019968672134503213,
"logits/chosen": -0.6225081086158752,
"logits/rejected": -0.6252766251564026,
"logps/chosen": -7.893375873565674,
"logps/rejected": -24.980260848999023,
"loss": 0.7993619441986084,
"memory(GiB)": 46.38,
"nll_loss": 0.3846016228199005,
"rewards/accuracies": 0.8125,
"rewards/chosen": 0.16642117500305176,
"rewards/margins": 1.3823862075805664,
"rewards/rejected": -1.215964913368225,
"step": 87,
"train_speed(iter/s)": 0.005493
},
{
"epoch": 0.15035506433872603,
"grad_norm": 3.7740750312805176,
"learning_rate": 0.00019966395747294938,
"logits/chosen": -0.5984699130058289,
"logits/rejected": -0.6030604839324951,
"logps/chosen": -5.385066032409668,
"logps/rejected": -25.168312072753906,
"loss": 0.6654453873634338,
"memory(GiB)": 46.38,
"nll_loss": 0.3348524868488312,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.16900494694709778,
"rewards/margins": 1.3018345832824707,
"rewards/rejected": -1.1328295469284058,
"step": 88,
"train_speed(iter/s)": 0.005492
},
{
"epoch": 0.15206364461530247,
"grad_norm": 3.6669890880584717,
"learning_rate": 0.0001996403966905185,
"logits/chosen": -0.6115779280662537,
"logits/rejected": -0.615218997001648,
"logps/chosen": -8.385238647460938,
"logps/rejected": -20.905569076538086,
"loss": 0.8084090948104858,
"memory(GiB)": 46.38,
"nll_loss": 0.39410629868507385,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.07257324457168579,
"rewards/margins": 1.0608566999435425,
"rewards/rejected": -0.9882834553718567,
"step": 89,
"train_speed(iter/s)": 0.00549
},
{
"epoch": 0.15377222489187892,
"grad_norm": 8.954024314880371,
"learning_rate": 0.00019961603918613077,
"logits/chosen": -0.6033557653427124,
"logits/rejected": -0.6063033938407898,
"logps/chosen": -7.85408878326416,
"logps/rejected": -24.28641700744629,
"loss": 0.8988556861877441,
"memory(GiB)": 46.38,
"nll_loss": 0.4972013235092163,
"rewards/accuracies": 0.78125,
"rewards/chosen": 0.1499406397342682,
"rewards/margins": 1.2390244007110596,
"rewards/rejected": -1.0890836715698242,
"step": 90,
"train_speed(iter/s)": 0.005489
},
{
"epoch": 0.15548080516845533,
"grad_norm": 2.68121075630188,
"learning_rate": 0.00019959088515454827,
"logits/chosen": -0.6473177075386047,
"logits/rejected": -0.6510601043701172,
"logps/chosen": -6.986569404602051,
"logps/rejected": -28.0955810546875,
"loss": 0.6454746723175049,
"memory(GiB)": 46.38,
"nll_loss": 0.3593181073665619,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.310781866312027,
"rewards/margins": 1.7279632091522217,
"rewards/rejected": -1.417181372642517,
"step": 91,
"train_speed(iter/s)": 0.005489
},
{
"epoch": 0.15718938544503178,
"grad_norm": 7.000541687011719,
"learning_rate": 0.0001995649347969019,
"logits/chosen": -0.7174542546272278,
"logits/rejected": -0.7201290726661682,
"logps/chosen": -11.954474449157715,
"logps/rejected": -24.34893226623535,
"loss": 1.0948961973190308,
"memory(GiB)": 46.38,
"nll_loss": 0.6069883704185486,
"rewards/accuracies": 0.75,
"rewards/chosen": -0.005067221820354462,
"rewards/margins": 1.2273277044296265,
"rewards/rejected": -1.232394814491272,
"step": 92,
"train_speed(iter/s)": 0.005491
},
{
"epoch": 0.1588979657216082,
"grad_norm": 4.3811211585998535,
"learning_rate": 0.00019953818832069,
"logits/chosen": -0.6739280223846436,
"logits/rejected": -0.6795160174369812,
"logps/chosen": -6.881966590881348,
"logps/rejected": -37.4478645324707,
"loss": 0.6469016075134277,
"memory(GiB)": 46.38,
"nll_loss": 0.40633073449134827,
"rewards/accuracies": 0.84375,
"rewards/chosen": 0.20596878230571747,
"rewards/margins": 2.5138516426086426,
"rewards/rejected": -2.3078830242156982,
"step": 93,
"train_speed(iter/s)": 0.005491
},
{
"epoch": 0.16060654599818464,
"grad_norm": 12.26343822479248,
"learning_rate": 0.00019951064593977668,
"logits/chosen": -0.6859129667282104,
"logits/rejected": -0.6899083852767944,
"logps/chosen": -13.38476848602295,
"logps/rejected": -30.595182418823242,
"loss": 1.2918721437454224,
"memory(GiB)": 46.38,
"nll_loss": 0.6223256587982178,
"rewards/accuracies": 0.71875,
"rewards/chosen": -0.30435577034950256,
"rewards/margins": 1.605468988418579,
"rewards/rejected": -1.9098248481750488,
"step": 94,
"train_speed(iter/s)": 0.005491
},
{
"epoch": 0.16231512627476108,
"grad_norm": 6.570938587188721,
"learning_rate": 0.00019948230787439017,
"logits/chosen": -0.7028453946113586,
"logits/rejected": -0.7050482034683228,
"logps/chosen": -6.761815071105957,
"logps/rejected": -27.314367294311523,
"loss": 0.9538392424583435,
"memory(GiB)": 46.38,
"nll_loss": 0.39429235458374023,
"rewards/accuracies": 0.6875,
"rewards/chosen": 0.012213893234729767,
"rewards/margins": 1.6957728862762451,
"rewards/rejected": -1.6835590600967407,
"step": 95,
"train_speed(iter/s)": 0.005493
},
{
"epoch": 0.1640237065513375,
"grad_norm": 2.8915793895721436,
"learning_rate": 0.0001994531743511208,
"logits/chosen": -0.6953604817390442,
"logits/rejected": -0.6982015371322632,
"logps/chosen": -7.192444801330566,
"logps/rejected": -26.632644653320312,
"loss": 0.6771315336227417,
"memory(GiB)": 46.38,
"nll_loss": 0.3128400444984436,
"rewards/accuracies": 0.84375,
"rewards/chosen": 0.21012118458747864,
"rewards/margins": 1.6979337930679321,
"rewards/rejected": -1.4878127574920654,
"step": 96,
"train_speed(iter/s)": 0.005494
},
{
"epoch": 0.16573228682791394,
"grad_norm": 2.7815051078796387,
"learning_rate": 0.00019942324560291952,
"logits/chosen": -0.6696122884750366,
"logits/rejected": -0.6713677644729614,
"logps/chosen": -4.250362396240234,
"logps/rejected": -22.2177791595459,
"loss": 0.6821787357330322,
"memory(GiB)": 46.38,
"nll_loss": 0.26163250207901,
"rewards/accuracies": 0.75,
"rewards/chosen": 0.09910638630390167,
"rewards/margins": 1.2715519666671753,
"rewards/rejected": -1.1724457740783691,
"step": 97,
"train_speed(iter/s)": 0.005495
},
{
"epoch": 0.16744086710449035,
"grad_norm": 2.4311976432800293,
"learning_rate": 0.00019939252186909574,
"logits/chosen": -0.6763203740119934,
"logits/rejected": -0.6752580404281616,
"logps/chosen": -6.972185134887695,
"logps/rejected": -21.0667667388916,
"loss": 0.5966892838478088,
"memory(GiB)": 46.38,
"nll_loss": 0.2420358657836914,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.14732374250888824,
"rewards/margins": 1.0790168046951294,
"rewards/rejected": -0.9316931366920471,
"step": 98,
"train_speed(iter/s)": 0.005495
},
{
"epoch": 0.1691494473810668,
"grad_norm": 5.822193622589111,
"learning_rate": 0.00019936100339531564,
"logits/chosen": -0.6894733905792236,
"logits/rejected": -0.6909453272819519,
"logps/chosen": -6.009974479675293,
"logps/rejected": -21.0426025390625,
"loss": 0.7569796442985535,
"memory(GiB)": 46.38,
"nll_loss": 0.4093407690525055,
"rewards/accuracies": 0.84375,
"rewards/chosen": 0.26579749584198,
"rewards/margins": 1.3290454149246216,
"rewards/rejected": -1.0632479190826416,
"step": 99,
"train_speed(iter/s)": 0.005495
},
{
"epoch": 0.1708580276576432,
"grad_norm": 3.2212934494018555,
"learning_rate": 0.0001993286904336001,
"logits/chosen": -0.7202757000923157,
"logits/rejected": -0.7197086215019226,
"logps/chosen": -6.131860733032227,
"logps/rejected": -21.27735137939453,
"loss": 0.622944712638855,
"memory(GiB)": 46.38,
"nll_loss": 0.28273510932922363,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.26464149355888367,
"rewards/margins": 1.1921066045761108,
"rewards/rejected": -0.9274651408195496,
"step": 100,
"train_speed(iter/s)": 0.005496
},
{
"epoch": 0.17256660793421966,
"grad_norm": 5.42195463180542,
"learning_rate": 0.00019929558324232268,
"logits/chosen": -0.7189818620681763,
"logits/rejected": -0.720359742641449,
"logps/chosen": -8.62668228149414,
"logps/rejected": -19.183561325073242,
"loss": 0.9257504940032959,
"memory(GiB)": 46.38,
"nll_loss": 0.5092519521713257,
"rewards/accuracies": 0.8125,
"rewards/chosen": 0.09434813261032104,
"rewards/margins": 0.8864970803260803,
"rewards/rejected": -0.7921488881111145,
"step": 101,
"train_speed(iter/s)": 0.005491
},
{
"epoch": 0.1742751882107961,
"grad_norm": 6.533127307891846,
"learning_rate": 0.0001992616820862076,
"logits/chosen": -0.6889673471450806,
"logits/rejected": -0.6902090907096863,
"logps/chosen": -9.093452453613281,
"logps/rejected": -19.451143264770508,
"loss": 0.9490825533866882,
"memory(GiB)": 46.38,
"nll_loss": 0.45314493775367737,
"rewards/accuracies": 0.78125,
"rewards/chosen": 0.03901132568717003,
"rewards/margins": 0.7304368019104004,
"rewards/rejected": -0.6914253830909729,
"step": 102,
"train_speed(iter/s)": 0.005492
},
{
"epoch": 0.17598376848737252,
"grad_norm": 3.991544485092163,
"learning_rate": 0.00019922698723632767,
"logits/chosen": -0.7347920536994934,
"logits/rejected": -0.7329245209693909,
"logps/chosen": -10.086681365966797,
"logps/rejected": -24.030868530273438,
"loss": 0.8895858526229858,
"memory(GiB)": 46.38,
"nll_loss": 0.5397864580154419,
"rewards/accuracies": 0.84375,
"rewards/chosen": 0.12226971983909607,
"rewards/margins": 1.3651487827301025,
"rewards/rejected": -1.2428791522979736,
"step": 103,
"train_speed(iter/s)": 0.005492
},
{
"epoch": 0.17769234876394896,
"grad_norm": 4.0011162757873535,
"learning_rate": 0.0001991914989701019,
"logits/chosen": -0.7434298992156982,
"logits/rejected": -0.7457666993141174,
"logps/chosen": -8.058287620544434,
"logps/rejected": -20.040809631347656,
"loss": 0.7681674957275391,
"memory(GiB)": 46.38,
"nll_loss": 0.3557548522949219,
"rewards/accuracies": 0.78125,
"rewards/chosen": 0.12300814688205719,
"rewards/margins": 1.063488483428955,
"rewards/rejected": -0.9404802918434143,
"step": 104,
"train_speed(iter/s)": 0.005493
},
{
"epoch": 0.17940092904052538,
"grad_norm": 3.329845905303955,
"learning_rate": 0.00019915521757129354,
"logits/chosen": -0.7461959719657898,
"logits/rejected": -0.7488771677017212,
"logps/chosen": -7.418200969696045,
"logps/rejected": -25.79469108581543,
"loss": 0.6970200538635254,
"memory(GiB)": 46.38,
"nll_loss": 0.36587315797805786,
"rewards/accuracies": 0.8125,
"rewards/chosen": 0.12871423363685608,
"rewards/margins": 1.5802878141403198,
"rewards/rejected": -1.4515737295150757,
"step": 105,
"train_speed(iter/s)": 0.005494
},
{
"epoch": 0.18110950931710182,
"grad_norm": 4.27202033996582,
"learning_rate": 0.00019911814333000772,
"logits/chosen": -0.7183383703231812,
"logits/rejected": -0.7201208472251892,
"logps/chosen": -9.424932479858398,
"logps/rejected": -25.1419677734375,
"loss": 0.8681972622871399,
"memory(GiB)": 46.38,
"nll_loss": 0.4449956715106964,
"rewards/accuracies": 0.90625,
"rewards/chosen": 0.04691670835018158,
"rewards/margins": 1.2326714992523193,
"rewards/rejected": -1.1857548952102661,
"step": 106,
"train_speed(iter/s)": 0.005495
},
{
"epoch": 0.18281808959367826,
"grad_norm": 4.578512191772461,
"learning_rate": 0.00019908027654268903,
"logits/chosen": -0.7675899267196655,
"logits/rejected": -0.7682605385780334,
"logps/chosen": -8.889389038085938,
"logps/rejected": -24.62353515625,
"loss": 0.8598517179489136,
"memory(GiB)": 46.38,
"nll_loss": 0.40520450472831726,
"rewards/accuracies": 0.78125,
"rewards/chosen": 0.13606908917427063,
"rewards/margins": 1.3364840745925903,
"rewards/rejected": -1.200415015220642,
"step": 107,
"train_speed(iter/s)": 0.005496
},
{
"epoch": 0.18452666987025468,
"grad_norm": 3.067852020263672,
"learning_rate": 0.00019904161751211938,
"logits/chosen": -0.7350285649299622,
"logits/rejected": -0.7360118627548218,
"logps/chosen": -12.491768836975098,
"logps/rejected": -23.78077507019043,
"loss": 0.8337110280990601,
"memory(GiB)": 46.38,
"nll_loss": 0.4792723059654236,
"rewards/accuracies": 0.84375,
"rewards/chosen": 0.0716579332947731,
"rewards/margins": 1.2602936029434204,
"rewards/rejected": -1.1886355876922607,
"step": 108,
"train_speed(iter/s)": 0.005496
},
{
"epoch": 0.18623525014683112,
"grad_norm": 3.2055752277374268,
"learning_rate": 0.00019900216654741528,
"logits/chosen": -0.7312414646148682,
"logits/rejected": -0.7316892147064209,
"logps/chosen": -8.460771560668945,
"logps/rejected": -21.30421257019043,
"loss": 0.7292563319206238,
"memory(GiB)": 46.38,
"nll_loss": 0.3923528492450714,
"rewards/accuracies": 0.84375,
"rewards/chosen": 0.2296271026134491,
"rewards/margins": 1.3531551361083984,
"rewards/rejected": -1.1235278844833374,
"step": 109,
"train_speed(iter/s)": 0.005494
},
{
"epoch": 0.18794383042340754,
"grad_norm": 4.93084716796875,
"learning_rate": 0.0001989619239640256,
"logits/chosen": -0.7337685823440552,
"logits/rejected": -0.7344739437103271,
"logps/chosen": -11.766962051391602,
"logps/rejected": -22.844139099121094,
"loss": 0.8851971626281738,
"memory(GiB)": 46.38,
"nll_loss": 0.4795154333114624,
"rewards/accuracies": 0.8125,
"rewards/chosen": 0.06328105181455612,
"rewards/margins": 1.133680820465088,
"rewards/rejected": -1.0703996419906616,
"step": 110,
"train_speed(iter/s)": 0.005496
},
{
"epoch": 0.18965241069998398,
"grad_norm": 10.518948554992676,
"learning_rate": 0.00019892089008372897,
"logits/chosen": -0.709618330001831,
"logits/rejected": -0.7111095190048218,
"logps/chosen": -8.326457977294922,
"logps/rejected": -27.638351440429688,
"loss": 0.9548771977424622,
"memory(GiB)": 46.38,
"nll_loss": 0.5345268249511719,
"rewards/accuracies": 0.78125,
"rewards/chosen": 0.045853935182094574,
"rewards/margins": 1.551784634590149,
"rewards/rejected": -1.5059306621551514,
"step": 111,
"train_speed(iter/s)": 0.005497
},
{
"epoch": 0.19136099097656042,
"grad_norm": 7.465288162231445,
"learning_rate": 0.0001988790652346312,
"logits/chosen": -0.7286843657493591,
"logits/rejected": -0.729621946811676,
"logps/chosen": -8.483978271484375,
"logps/rejected": -28.15561294555664,
"loss": 0.922063410282135,
"memory(GiB)": 46.38,
"nll_loss": 0.5344014167785645,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.13854525983333588,
"rewards/margins": 1.4421772956848145,
"rewards/rejected": -1.3036320209503174,
"step": 112,
"train_speed(iter/s)": 0.005498
},
{
"epoch": 0.19306957125313684,
"grad_norm": 8.20088005065918,
"learning_rate": 0.0001988364497511627,
"logits/chosen": -0.740546703338623,
"logits/rejected": -0.7427754402160645,
"logps/chosen": -8.096268653869629,
"logps/rejected": -22.899229049682617,
"loss": 0.9872632622718811,
"memory(GiB)": 46.38,
"nll_loss": 0.5750774145126343,
"rewards/accuracies": 0.8125,
"rewards/chosen": 0.18856163322925568,
"rewards/margins": 1.2329988479614258,
"rewards/rejected": -1.0444371700286865,
"step": 113,
"train_speed(iter/s)": 0.005497
},
{
"epoch": 0.19477815152971328,
"grad_norm": 3.4554946422576904,
"learning_rate": 0.0001987930439740757,
"logits/chosen": -0.699242115020752,
"logits/rejected": -0.7016286849975586,
"logps/chosen": -11.758835792541504,
"logps/rejected": -22.287220001220703,
"loss": 0.7449758052825928,
"memory(GiB)": 46.38,
"nll_loss": 0.4075641632080078,
"rewards/accuracies": 0.90625,
"rewards/chosen": 0.1979522556066513,
"rewards/margins": 1.2950595617294312,
"rewards/rejected": -1.097107172012329,
"step": 114,
"train_speed(iter/s)": 0.005496
},
{
"epoch": 0.1964867318062897,
"grad_norm": 2.8801109790802,
"learning_rate": 0.00019874884825044165,
"logits/chosen": -0.673065185546875,
"logits/rejected": -0.6760713458061218,
"logps/chosen": -6.409548759460449,
"logps/rejected": -16.89990234375,
"loss": 0.7451252937316895,
"memory(GiB)": 46.38,
"nll_loss": 0.31410443782806396,
"rewards/accuracies": 0.84375,
"rewards/chosen": 0.19196031987667084,
"rewards/margins": 0.9307445287704468,
"rewards/rejected": -0.7387841939926147,
"step": 115,
"train_speed(iter/s)": 0.005495
},
{
"epoch": 0.19819531208286614,
"grad_norm": 2.597715377807617,
"learning_rate": 0.00019870386293364836,
"logits/chosen": -0.642209529876709,
"logits/rejected": -0.6442127227783203,
"logps/chosen": -6.406985282897949,
"logps/rejected": -19.21172523498535,
"loss": 0.7881473898887634,
"memory(GiB)": 46.38,
"nll_loss": 0.3131154477596283,
"rewards/accuracies": 0.75,
"rewards/chosen": 0.14077159762382507,
"rewards/margins": 0.9926955699920654,
"rewards/rejected": -0.851923942565918,
"step": 116,
"train_speed(iter/s)": 0.005496
},
{
"epoch": 0.1999038923594426,
"grad_norm": 2.9220879077911377,
"learning_rate": 0.00019865808838339727,
"logits/chosen": -0.6920750141143799,
"logits/rejected": -0.6941624283790588,
"logps/chosen": -7.081650733947754,
"logps/rejected": -24.63327407836914,
"loss": 0.6955921649932861,
"memory(GiB)": 46.38,
"nll_loss": 0.29941731691360474,
"rewards/accuracies": 0.90625,
"rewards/chosen": 0.014344778843224049,
"rewards/margins": 1.21220862865448,
"rewards/rejected": -1.1978638172149658,
"step": 117,
"train_speed(iter/s)": 0.005499
},
{
"epoch": 0.201612472636019,
"grad_norm": 2.535001277923584,
"learning_rate": 0.00019861152496570043,
"logits/chosen": -0.6474766135215759,
"logits/rejected": -0.6474269032478333,
"logps/chosen": -4.845932483673096,
"logps/rejected": -30.43771743774414,
"loss": 0.549997866153717,
"memory(GiB)": 46.38,
"nll_loss": 0.2411210685968399,
"rewards/accuracies": 0.90625,
"rewards/chosen": 0.22833456099033356,
"rewards/margins": 1.7972755432128906,
"rewards/rejected": -1.5689408779144287,
"step": 118,
"train_speed(iter/s)": 0.005498
},
{
"epoch": 0.20332105291259545,
"grad_norm": 2.592416286468506,
"learning_rate": 0.00019856417305287772,
"logits/chosen": -0.6813372373580933,
"logits/rejected": -0.684921383857727,
"logps/chosen": -8.64324951171875,
"logps/rejected": -25.918020248413086,
"loss": 0.6950156092643738,
"memory(GiB)": 46.38,
"nll_loss": 0.34918904304504395,
"rewards/accuracies": 0.84375,
"rewards/chosen": 0.27043017745018005,
"rewards/margins": 1.5927720069885254,
"rewards/rejected": -1.322341799736023,
"step": 119,
"train_speed(iter/s)": 0.005498
},
{
"epoch": 0.20502963318917186,
"grad_norm": 3.0879509449005127,
"learning_rate": 0.00019851603302355373,
"logits/chosen": -0.7103255987167358,
"logits/rejected": -0.7141609191894531,
"logps/chosen": -7.374659061431885,
"logps/rejected": -27.09424591064453,
"loss": 0.7110822200775146,
"memory(GiB)": 46.38,
"nll_loss": 0.3552224040031433,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.15158146619796753,
"rewards/margins": 1.6895453929901123,
"rewards/rejected": -1.5379639863967896,
"step": 120,
"train_speed(iter/s)": 0.005499
},
{
"epoch": 0.2067382134657483,
"grad_norm": 3.703174591064453,
"learning_rate": 0.00019846710526265487,
"logits/chosen": -0.7088285088539124,
"logits/rejected": -0.7127594947814941,
"logps/chosen": -6.05606746673584,
"logps/rejected": -27.269733428955078,
"loss": 0.619713306427002,
"memory(GiB)": 46.38,
"nll_loss": 0.333889901638031,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.2516608238220215,
"rewards/margins": 1.8369193077087402,
"rewards/rejected": -1.5852584838867188,
"step": 121,
"train_speed(iter/s)": 0.0055
},
{
"epoch": 0.20844679374232475,
"grad_norm": 4.171956539154053,
"learning_rate": 0.00019841739016140624,
"logits/chosen": -0.7836604118347168,
"logits/rejected": -0.7841136455535889,
"logps/chosen": -7.950913429260254,
"logps/rejected": -26.353294372558594,
"loss": 0.7199419736862183,
"memory(GiB)": 46.38,
"nll_loss": 0.3016027510166168,
"rewards/accuracies": 0.78125,
"rewards/chosen": 0.03286279737949371,
"rewards/margins": 1.4103941917419434,
"rewards/rejected": -1.3775315284729004,
"step": 122,
"train_speed(iter/s)": 0.0055
},
{
"epoch": 0.21015537401890116,
"grad_norm": 5.59217643737793,
"learning_rate": 0.0001983668881173284,
"logits/chosen": -0.7123353481292725,
"logits/rejected": -0.7176805734634399,
"logps/chosen": -6.9763007164001465,
"logps/rejected": -40.705894470214844,
"loss": 0.5055665969848633,
"memory(GiB)": 46.38,
"nll_loss": 0.2759905159473419,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.13582277297973633,
"rewards/margins": 2.353527069091797,
"rewards/rejected": -2.2177045345306396,
"step": 123,
"train_speed(iter/s)": 0.0055
},
{
"epoch": 0.2118639542954776,
"grad_norm": 7.052844524383545,
"learning_rate": 0.00019831559953423442,
"logits/chosen": -0.7205808758735657,
"logits/rejected": -0.7224647402763367,
"logps/chosen": -8.208627700805664,
"logps/rejected": -23.56304359436035,
"loss": 0.8278493285179138,
"memory(GiB)": 46.38,
"nll_loss": 0.3575640022754669,
"rewards/accuracies": 0.84375,
"rewards/chosen": 0.0022782105952501297,
"rewards/margins": 1.129638910293579,
"rewards/rejected": -1.1273607015609741,
"step": 124,
"train_speed(iter/s)": 0.0055
},
{
"epoch": 0.21357253457205402,
"grad_norm": 2.853487491607666,
"learning_rate": 0.00019826352482222638,
"logits/chosen": -0.7876097559928894,
"logits/rejected": -0.7900496125221252,
"logps/chosen": -6.370059013366699,
"logps/rejected": -29.205093383789062,
"loss": 0.553210437297821,
"memory(GiB)": 46.38,
"nll_loss": 0.24043366312980652,
"rewards/accuracies": 0.84375,
"rewards/chosen": 0.03330150991678238,
"rewards/margins": 1.9821114540100098,
"rewards/rejected": -1.9488096237182617,
"step": 125,
"train_speed(iter/s)": 0.005501
},
{
"epoch": 0.21528111484863047,
"grad_norm": 3.3915181159973145,
"learning_rate": 0.00019821066439769234,
"logits/chosen": -0.7244046926498413,
"logits/rejected": -0.7288062572479248,
"logps/chosen": -7.876413822174072,
"logps/rejected": -35.36836242675781,
"loss": 0.5778641104698181,
"memory(GiB)": 46.38,
"nll_loss": 0.34048542380332947,
"rewards/accuracies": 0.90625,
"rewards/chosen": -0.027921676635742188,
"rewards/margins": 2.1973161697387695,
"rewards/rejected": -2.225238084793091,
"step": 126,
"train_speed(iter/s)": 0.0055
},
{
"epoch": 0.2169896951252069,
"grad_norm": 2.667902946472168,
"learning_rate": 0.00019815701868330284,
"logits/chosen": -0.7135522365570068,
"logits/rejected": -0.7176554799079895,
"logps/chosen": -11.242607116699219,
"logps/rejected": -33.319515228271484,
"loss": 0.7801873087882996,
"memory(GiB)": 46.38,
"nll_loss": 0.49927234649658203,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.23649244010448456,
"rewards/margins": 2.445638656616211,
"rewards/rejected": -2.209146022796631,
"step": 127,
"train_speed(iter/s)": 0.005501
},
{
"epoch": 0.21869827540178333,
"grad_norm": 9.078632354736328,
"learning_rate": 0.00019810258810800752,
"logits/chosen": -0.7386202812194824,
"logits/rejected": -0.7396747469902039,
"logps/chosen": -9.633708000183105,
"logps/rejected": -30.443008422851562,
"loss": 0.7859803438186646,
"memory(GiB)": 46.38,
"nll_loss": 0.49833089113235474,
"rewards/accuracies": 0.84375,
"rewards/chosen": 0.04507865756750107,
"rewards/margins": 1.9784715175628662,
"rewards/rejected": -1.933392882347107,
"step": 128,
"train_speed(iter/s)": 0.005503
},
{
"epoch": 0.22040685567835977,
"grad_norm": 13.282059669494629,
"learning_rate": 0.0001980473731070319,
"logits/chosen": -0.7503476142883301,
"logits/rejected": -0.755096971988678,
"logps/chosen": -7.456392765045166,
"logps/rejected": -29.754714965820312,
"loss": 0.8027007579803467,
"memory(GiB)": 46.38,
"nll_loss": 0.4415196180343628,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.14411740005016327,
"rewards/margins": 2.093838691711426,
"rewards/rejected": -1.949721336364746,
"step": 129,
"train_speed(iter/s)": 0.005503
},
{
"epoch": 0.22211543595493619,
"grad_norm": 5.136019706726074,
"learning_rate": 0.0001979913741218736,
"logits/chosen": -0.7441588640213013,
"logits/rejected": -0.7470377683639526,
"logps/chosen": -11.379145622253418,
"logps/rejected": -36.20026397705078,
"loss": 0.9255682229995728,
"memory(GiB)": 46.38,
"nll_loss": 0.5846636891365051,
"rewards/accuracies": 0.8125,
"rewards/chosen": 0.014721579849720001,
"rewards/margins": 2.245670795440674,
"rewards/rejected": -2.2309491634368896,
"step": 130,
"train_speed(iter/s)": 0.005502
},
{
"epoch": 0.22382401623151263,
"grad_norm": 5.494217395782471,
"learning_rate": 0.00019793459160029903,
"logits/chosen": -0.7520757913589478,
"logits/rejected": -0.7574396133422852,
"logps/chosen": -6.406137466430664,
"logps/rejected": -42.744041442871094,
"loss": 0.6142405867576599,
"memory(GiB)": 46.38,
"nll_loss": 0.3836834132671356,
"rewards/accuracies": 0.90625,
"rewards/chosen": 0.19515469670295715,
"rewards/margins": 3.062283992767334,
"rewards/rejected": -2.867129325866699,
"step": 131,
"train_speed(iter/s)": 0.005503
},
{
"epoch": 0.22553259650808907,
"grad_norm": 4.463568687438965,
"learning_rate": 0.00019787702599633971,
"logits/chosen": -0.7327495217323303,
"logits/rejected": -0.738735556602478,
"logps/chosen": -6.503672122955322,
"logps/rejected": -39.14170837402344,
"loss": 0.7878039479255676,
"memory(GiB)": 46.38,
"nll_loss": 0.37348490953445435,
"rewards/accuracies": 0.78125,
"rewards/chosen": -0.034972380846738815,
"rewards/margins": 2.3170716762542725,
"rewards/rejected": -2.352044105529785,
"step": 132,
"train_speed(iter/s)": 0.005501
},
{
"epoch": 0.2272411767846655,
"grad_norm": 7.909404754638672,
"learning_rate": 0.0001978186777702887,
"logits/chosen": -0.6934617757797241,
"logits/rejected": -0.6948121786117554,
"logps/chosen": -7.257785797119141,
"logps/rejected": -27.908708572387695,
"loss": 0.7475972175598145,
"memory(GiB)": 46.38,
"nll_loss": 0.3585331439971924,
"rewards/accuracies": 0.8125,
"rewards/chosen": 0.036370277404785156,
"rewards/margins": 1.666322946548462,
"rewards/rejected": -1.6299527883529663,
"step": 133,
"train_speed(iter/s)": 0.005501
},
{
"epoch": 0.22894975706124193,
"grad_norm": 14.575544357299805,
"learning_rate": 0.00019775954738869683,
"logits/chosen": -0.6997110843658447,
"logits/rejected": -0.7026513814926147,
"logps/chosen": -7.946556091308594,
"logps/rejected": -20.762996673583984,
"loss": 1.056870460510254,
"memory(GiB)": 46.38,
"nll_loss": 0.6803016066551208,
"rewards/accuracies": 0.84375,
"rewards/chosen": 0.16680209338665009,
"rewards/margins": 1.3951897621154785,
"rewards/rejected": -1.2283875942230225,
"step": 134,
"train_speed(iter/s)": 0.005501
},
{
"epoch": 0.23065833733781835,
"grad_norm": 6.814887046813965,
"learning_rate": 0.00019769963532436911,
"logits/chosen": -0.661209762096405,
"logits/rejected": -0.6659980416297913,
"logps/chosen": -8.108284950256348,
"logps/rejected": -26.44216537475586,
"loss": 1.0938985347747803,
"memory(GiB)": 46.38,
"nll_loss": 0.7105523347854614,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.010204421356320381,
"rewards/margins": 1.3176696300506592,
"rewards/rejected": -1.3074650764465332,
"step": 135,
"train_speed(iter/s)": 0.005501
},
{
"epoch": 0.2323669176143948,
"grad_norm": 5.490352153778076,
"learning_rate": 0.00019763894205636072,
"logits/chosen": -0.671430230140686,
"logits/rejected": -0.673378586769104,
"logps/chosen": -9.945783615112305,
"logps/rejected": -22.1285343170166,
"loss": 0.976132333278656,
"memory(GiB)": 46.38,
"nll_loss": 0.543598473072052,
"rewards/accuracies": 0.84375,
"rewards/chosen": 0.1351984441280365,
"rewards/margins": 1.1337149143218994,
"rewards/rejected": -0.9985164403915405,
"step": 136,
"train_speed(iter/s)": 0.005501
},
{
"epoch": 0.23407549789097123,
"grad_norm": 5.260707378387451,
"learning_rate": 0.00019757746806997348,
"logits/chosen": -0.6116827130317688,
"logits/rejected": -0.6123840808868408,
"logps/chosen": -8.495226860046387,
"logps/rejected": -17.80582046508789,
"loss": 0.9422957897186279,
"memory(GiB)": 46.38,
"nll_loss": 0.3756696879863739,
"rewards/accuracies": 0.625,
"rewards/chosen": -0.009481308050453663,
"rewards/margins": 0.6523244380950928,
"rewards/rejected": -0.6618058085441589,
"step": 137,
"train_speed(iter/s)": 0.005502
},
{
"epoch": 0.23578407816754765,
"grad_norm": 2.1559102535247803,
"learning_rate": 0.00019751521385675172,
"logits/chosen": -0.6613444089889526,
"logits/rejected": -0.6647210121154785,
"logps/chosen": -4.250008583068848,
"logps/rejected": -25.66912078857422,
"loss": 0.5518596172332764,
"memory(GiB)": 46.38,
"nll_loss": 0.1721974015235901,
"rewards/accuracies": 0.75,
"rewards/chosen": 0.17000286281108856,
"rewards/margins": 1.491791009902954,
"rewards/rejected": -1.3217883110046387,
"step": 138,
"train_speed(iter/s)": 0.005502
},
{
"epoch": 0.2374926584441241,
"grad_norm": 2.9551846981048584,
"learning_rate": 0.00019745217991447848,
"logits/chosen": -0.6719025373458862,
"logits/rejected": -0.6741494536399841,
"logps/chosen": -8.146540641784668,
"logps/rejected": -28.308319091796875,
"loss": 0.7604531049728394,
"memory(GiB)": 46.38,
"nll_loss": 0.34055855870246887,
"rewards/accuracies": 0.71875,
"rewards/chosen": 0.1295825093984604,
"rewards/margins": 1.5078970193862915,
"rewards/rejected": -1.37831449508667,
"step": 139,
"train_speed(iter/s)": 0.005501
},
{
"epoch": 0.2392012387207005,
"grad_norm": 5.525161266326904,
"learning_rate": 0.0001973883667471715,
"logits/chosen": -0.6694546937942505,
"logits/rejected": -0.6737231612205505,
"logps/chosen": -10.553884506225586,
"logps/rejected": -32.512393951416016,
"loss": 0.822769284248352,
"memory(GiB)": 46.38,
"nll_loss": 0.3502211570739746,
"rewards/accuracies": 0.6875,
"rewards/chosen": 0.01343974657356739,
"rewards/margins": 1.7657444477081299,
"rewards/rejected": -1.7523046731948853,
"step": 140,
"train_speed(iter/s)": 0.005502
},
{
"epoch": 0.24090981899727695,
"grad_norm": 2.4956538677215576,
"learning_rate": 0.00019732377486507915,
"logits/chosen": -0.6616899371147156,
"logits/rejected": -0.6654747724533081,
"logps/chosen": -6.116077423095703,
"logps/rejected": -22.98920440673828,
"loss": 0.7530378103256226,
"memory(GiB)": 46.38,
"nll_loss": 0.33646857738494873,
"rewards/accuracies": 0.8125,
"rewards/chosen": 0.09931784868240356,
"rewards/margins": 1.2228065729141235,
"rewards/rejected": -1.1234887838363647,
"step": 141,
"train_speed(iter/s)": 0.005502
},
{
"epoch": 0.24261839927385337,
"grad_norm": 3.0544512271881104,
"learning_rate": 0.00019725840478467636,
"logits/chosen": -0.6879534125328064,
"logits/rejected": -0.6862825155258179,
"logps/chosen": -8.299098014831543,
"logps/rejected": -18.718904495239258,
"loss": 0.7917457818984985,
"memory(GiB)": 46.38,
"nll_loss": 0.31696975231170654,
"rewards/accuracies": 0.84375,
"rewards/chosen": 0.11313430219888687,
"rewards/margins": 0.9731096029281616,
"rewards/rejected": -0.859975278377533,
"step": 142,
"train_speed(iter/s)": 0.005502
},
{
"epoch": 0.2443269795504298,
"grad_norm": 2.7635226249694824,
"learning_rate": 0.00019719225702866062,
"logits/chosen": -0.7383114099502563,
"logits/rejected": -0.736755907535553,
"logps/chosen": -5.972444534301758,
"logps/rejected": -27.483884811401367,
"loss": 0.6677893400192261,
"memory(GiB)": 46.38,
"nll_loss": 0.3221934735774994,
"rewards/accuracies": 0.84375,
"rewards/chosen": 0.15736974775791168,
"rewards/margins": 1.7971253395080566,
"rewards/rejected": -1.639755368232727,
"step": 143,
"train_speed(iter/s)": 0.005503
},
{
"epoch": 0.24603555982700626,
"grad_norm": 5.206491470336914,
"learning_rate": 0.0001971253321259476,
"logits/chosen": -0.7135074138641357,
"logits/rejected": -0.7155020833015442,
"logps/chosen": -9.462960243225098,
"logps/rejected": -22.44765853881836,
"loss": 0.8617446422576904,
"memory(GiB)": 46.38,
"nll_loss": 0.4634811282157898,
"rewards/accuracies": 0.84375,
"rewards/chosen": 0.1327909231185913,
"rewards/margins": 1.3640327453613281,
"rewards/rejected": -1.2312417030334473,
"step": 144,
"train_speed(iter/s)": 0.005502
},
{
"epoch": 0.24774414010358267,
"grad_norm": 2.5136232376098633,
"learning_rate": 0.00019705763061166696,
"logits/chosen": -0.7309613227844238,
"logits/rejected": -0.7339869141578674,
"logps/chosen": -8.707137107849121,
"logps/rejected": -30.160343170166016,
"loss": 0.6045644879341125,
"memory(GiB)": 46.38,
"nll_loss": 0.31675195693969727,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.1917949914932251,
"rewards/margins": 2.2541422843933105,
"rewards/rejected": -2.062347412109375,
"step": 145,
"train_speed(iter/s)": 0.005503
},
{
"epoch": 0.24945272038015912,
"grad_norm": 3.6773223876953125,
"learning_rate": 0.00019698915302715836,
"logits/chosen": -0.7318214774131775,
"logits/rejected": -0.7343602180480957,
"logps/chosen": -6.429262161254883,
"logps/rejected": -31.925209045410156,
"loss": 0.6257779598236084,
"memory(GiB)": 46.38,
"nll_loss": 0.31483885645866394,
"rewards/accuracies": 0.90625,
"rewards/chosen": 0.1830574870109558,
"rewards/margins": 1.988149642944336,
"rewards/rejected": -1.8050918579101562,
"step": 146,
"train_speed(iter/s)": 0.005505
},
{
"epoch": 0.25116130065673553,
"grad_norm": 9.478280067443848,
"learning_rate": 0.00019691989991996663,
"logits/chosen": -0.7461144924163818,
"logits/rejected": -0.7457807660102844,
"logps/chosen": -10.189486503601074,
"logps/rejected": -34.494956970214844,
"loss": 0.7869279980659485,
"memory(GiB)": 46.38,
"nll_loss": 0.47246837615966797,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.1757950335741043,
"rewards/margins": 2.238186836242676,
"rewards/rejected": -2.062391996383667,
"step": 147,
"train_speed(iter/s)": 0.005504
},
{
"epoch": 0.252869880933312,
"grad_norm": 7.141703128814697,
"learning_rate": 0.00019684987184383776,
"logits/chosen": -0.7700251340866089,
"logits/rejected": -0.7725012302398682,
"logps/chosen": -6.46027946472168,
"logps/rejected": -34.821231842041016,
"loss": 0.692828357219696,
"memory(GiB)": 46.38,
"nll_loss": 0.3844330608844757,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.12604108452796936,
"rewards/margins": 2.6629996299743652,
"rewards/rejected": -2.5369582176208496,
"step": 148,
"train_speed(iter/s)": 0.005505
},
{
"epoch": 0.2545784612098884,
"grad_norm": 14.823970794677734,
"learning_rate": 0.00019677906935871447,
"logits/chosen": -0.7374511361122131,
"logits/rejected": -0.7389614582061768,
"logps/chosen": -10.582510948181152,
"logps/rejected": -26.03261375427246,
"loss": 1.33296537399292,
"memory(GiB)": 46.38,
"nll_loss": 0.6253257989883423,
"rewards/accuracies": 0.75,
"rewards/chosen": -0.18944962322711945,
"rewards/margins": 1.5741108655929565,
"rewards/rejected": -1.7635605335235596,
"step": 149,
"train_speed(iter/s)": 0.005504
},
{
"epoch": 0.25628704148646486,
"grad_norm": 13.657255172729492,
"learning_rate": 0.00019670749303073146,
"logits/chosen": -0.7172877192497253,
"logits/rejected": -0.7211941480636597,
"logps/chosen": -6.75715970993042,
"logps/rejected": -41.68476867675781,
"loss": 0.7531163692474365,
"memory(GiB)": 46.38,
"nll_loss": 0.4120977818965912,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.10011129081249237,
"rewards/margins": 3.0644404888153076,
"rewards/rejected": -2.964329481124878,
"step": 150,
"train_speed(iter/s)": 0.005503
},
{
"epoch": 0.25799562176304125,
"grad_norm": 4.298210144042969,
"learning_rate": 0.00019663514343221117,
"logits/chosen": -0.6899698972702026,
"logits/rejected": -0.6891142725944519,
"logps/chosen": -9.789582252502441,
"logps/rejected": -32.59271240234375,
"loss": 0.6402732729911804,
"memory(GiB)": 46.38,
"nll_loss": 0.335668683052063,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.15986008942127228,
"rewards/margins": 2.269547939300537,
"rewards/rejected": -2.1096878051757812,
"step": 151,
"train_speed(iter/s)": 0.005498
},
{
"epoch": 0.2597042020396177,
"grad_norm": 4.9224324226379395,
"learning_rate": 0.00019656202114165904,
"logits/chosen": -0.717603862285614,
"logits/rejected": -0.7218050956726074,
"logps/chosen": -8.468698501586914,
"logps/rejected": -42.157318115234375,
"loss": 0.6935219168663025,
"memory(GiB)": 46.38,
"nll_loss": 0.4874541759490967,
"rewards/accuracies": 0.9375,
"rewards/chosen": -0.11759095638990402,
"rewards/margins": 2.7493767738342285,
"rewards/rejected": -2.8669681549072266,
"step": 152,
"train_speed(iter/s)": 0.005497
},
{
"epoch": 0.26141278231619414,
"grad_norm": 5.180264472961426,
"learning_rate": 0.00019648812674375902,
"logits/chosen": -0.6897304058074951,
"logits/rejected": -0.6921338438987732,
"logps/chosen": -6.188149929046631,
"logps/rejected": -35.15382385253906,
"loss": 0.6033867597579956,
"memory(GiB)": 46.38,
"nll_loss": 0.2803235948085785,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.18143904209136963,
"rewards/margins": 2.3970108032226562,
"rewards/rejected": -2.215571641921997,
"step": 153,
"train_speed(iter/s)": 0.005497
},
{
"epoch": 0.2631213625927706,
"grad_norm": 4.898785591125488,
"learning_rate": 0.00019641346082936872,
"logits/chosen": -0.6851431131362915,
"logits/rejected": -0.6863937973976135,
"logps/chosen": -14.464362144470215,
"logps/rejected": -23.472118377685547,
"loss": 0.783013105392456,
"memory(GiB)": 46.38,
"nll_loss": 0.4414927363395691,
"rewards/accuracies": 0.8125,
"rewards/chosen": 0.01941562071442604,
"rewards/margins": 1.5958939790725708,
"rewards/rejected": -1.576478362083435,
"step": 154,
"train_speed(iter/s)": 0.005496
},
{
"epoch": 0.264829942869347,
"grad_norm": 5.930595874786377,
"learning_rate": 0.00019633802399551473,
"logits/chosen": -0.7089685797691345,
"logits/rejected": -0.7100527882575989,
"logps/chosen": -9.57446575164795,
"logps/rejected": -26.301237106323242,
"loss": 0.8949770927429199,
"memory(GiB)": 46.38,
"nll_loss": 0.4963584840297699,
"rewards/accuracies": 0.90625,
"rewards/chosen": -0.03665952757000923,
"rewards/margins": 1.5139617919921875,
"rewards/rejected": -1.5506211519241333,
"step": 155,
"train_speed(iter/s)": 0.005495
},
{
"epoch": 0.2665385231459234,
"grad_norm": 4.985401630401611,
"learning_rate": 0.00019626181684538808,
"logits/chosen": -0.6955317854881287,
"logits/rejected": -0.7012707591056824,
"logps/chosen": -6.044739723205566,
"logps/rejected": -24.839508056640625,
"loss": 0.9819079637527466,
"memory(GiB)": 46.38,
"nll_loss": 0.47508248686790466,
"rewards/accuracies": 0.78125,
"rewards/chosen": 0.06785830110311508,
"rewards/margins": 0.7281482219696045,
"rewards/rejected": -0.660290002822876,
"step": 156,
"train_speed(iter/s)": 0.005495
},
{
"epoch": 0.26824710342249986,
"grad_norm": 6.6396403312683105,
"learning_rate": 0.000196184839988339,
"logits/chosen": -0.6605405211448669,
"logits/rejected": -0.6651955842971802,
"logps/chosen": -5.8500542640686035,
"logps/rejected": -27.22307586669922,
"loss": 0.7894259095191956,
"memory(GiB)": 46.38,
"nll_loss": 0.44944238662719727,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.20848321914672852,
"rewards/margins": 1.5052435398101807,
"rewards/rejected": -1.2967603206634521,
"step": 157,
"train_speed(iter/s)": 0.005494
},
{
"epoch": 0.2699556836990763,
"grad_norm": 6.331238269805908,
"learning_rate": 0.00019610709403987246,
"logits/chosen": -0.6915969848632812,
"logits/rejected": -0.6922619938850403,
"logps/chosen": -6.449377059936523,
"logps/rejected": -22.124189376831055,
"loss": 0.7714009881019592,
"memory(GiB)": 46.38,
"nll_loss": 0.4102553725242615,
"rewards/accuracies": 0.90625,
"rewards/chosen": 0.15198560059070587,
"rewards/margins": 1.139552116394043,
"rewards/rejected": -0.9875664710998535,
"step": 158,
"train_speed(iter/s)": 0.005494
},
{
"epoch": 0.27166426397565274,
"grad_norm": 4.062625408172607,
"learning_rate": 0.00019602857962164297,
"logits/chosen": -0.7070209383964539,
"logits/rejected": -0.7094908952713013,
"logps/chosen": -8.760738372802734,
"logps/rejected": -21.83628273010254,
"loss": 0.6808652877807617,
"memory(GiB)": 46.38,
"nll_loss": 0.30313965678215027,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.16821521520614624,
"rewards/margins": 1.2700836658477783,
"rewards/rejected": -1.1018683910369873,
"step": 159,
"train_speed(iter/s)": 0.005495
},
{
"epoch": 0.2733728442522292,
"grad_norm": 3.5334150791168213,
"learning_rate": 0.00019594929736144976,
"logits/chosen": -0.6827138066291809,
"logits/rejected": -0.6853998303413391,
"logps/chosen": -8.673670768737793,
"logps/rejected": -22.576623916625977,
"loss": 0.8358533978462219,
"memory(GiB)": 46.38,
"nll_loss": 0.4210669696331024,
"rewards/accuracies": 0.75,
"rewards/chosen": 0.1305871605873108,
"rewards/margins": 1.2085453271865845,
"rewards/rejected": -1.077958106994629,
"step": 160,
"train_speed(iter/s)": 0.005494
},
{
"epoch": 0.2750814245288056,
"grad_norm": 4.968493938446045,
"learning_rate": 0.0001958692478932316,
"logits/chosen": -0.6895708441734314,
"logits/rejected": -0.6913452744483948,
"logps/chosen": -8.595847129821777,
"logps/rejected": -15.964265823364258,
"loss": 0.9963687658309937,
"memory(GiB)": 46.38,
"nll_loss": 0.4303150177001953,
"rewards/accuracies": 0.59375,
"rewards/chosen": 0.039102740585803986,
"rewards/margins": 0.7386963367462158,
"rewards/rejected": -0.6995935440063477,
"step": 161,
"train_speed(iter/s)": 0.005494
},
{
"epoch": 0.276790004805382,
"grad_norm": 3.1100776195526123,
"learning_rate": 0.00019578843185706198,
"logits/chosen": -0.6581685543060303,
"logits/rejected": -0.6606261730194092,
"logps/chosen": -8.823217391967773,
"logps/rejected": -20.12518310546875,
"loss": 0.7960190773010254,
"memory(GiB)": 46.38,
"nll_loss": 0.3306158185005188,
"rewards/accuracies": 0.75,
"rewards/chosen": 0.1894218921661377,
"rewards/margins": 0.9922627210617065,
"rewards/rejected": -0.8028407096862793,
"step": 162,
"train_speed(iter/s)": 0.005495
},
{
"epoch": 0.27849858508195846,
"grad_norm": 2.9061076641082764,
"learning_rate": 0.00019570684989914368,
"logits/chosen": -0.7005666494369507,
"logits/rejected": -0.7033515572547913,
"logps/chosen": -6.614690780639648,
"logps/rejected": -23.320758819580078,
"loss": 0.7204984426498413,
"memory(GiB)": 46.38,
"nll_loss": 0.3370620608329773,
"rewards/accuracies": 0.84375,
"rewards/chosen": 0.20666998624801636,
"rewards/margins": 1.309868335723877,
"rewards/rejected": -1.1031984090805054,
"step": 163,
"train_speed(iter/s)": 0.005495
},
{
"epoch": 0.2802071653585349,
"grad_norm": 2.7546348571777344,
"learning_rate": 0.00019562450267180396,
"logits/chosen": -0.713110089302063,
"logits/rejected": -0.7162569165229797,
"logps/chosen": -11.556283950805664,
"logps/rejected": -24.4801025390625,
"loss": 0.600546658039093,
"memory(GiB)": 46.38,
"nll_loss": 0.29867106676101685,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.32357320189476013,
"rewards/margins": 1.2928061485290527,
"rewards/rejected": -0.969232976436615,
"step": 164,
"train_speed(iter/s)": 0.005494
},
{
"epoch": 0.28191574563511135,
"grad_norm": 4.433908462524414,
"learning_rate": 0.000195541390833489,
"logits/chosen": -0.7190208435058594,
"logits/rejected": -0.7217738628387451,
"logps/chosen": -8.067594528198242,
"logps/rejected": -28.02341651916504,
"loss": 0.6388089656829834,
"memory(GiB)": 46.38,
"nll_loss": 0.3460094630718231,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.26204991340637207,
"rewards/margins": 1.4149954319000244,
"rewards/rejected": -1.152945637702942,
"step": 165,
"train_speed(iter/s)": 0.005492
},
{
"epoch": 0.28362432591168774,
"grad_norm": 2.649824380874634,
"learning_rate": 0.0001954575150487589,
"logits/chosen": -0.749485969543457,
"logits/rejected": -0.7498363852500916,
"logps/chosen": -8.293320655822754,
"logps/rejected": -18.8927001953125,
"loss": 0.6769586205482483,
"memory(GiB)": 46.38,
"nll_loss": 0.2774519920349121,
"rewards/accuracies": 0.8125,
"rewards/chosen": 0.14119945466518402,
"rewards/margins": 1.063216209411621,
"rewards/rejected": -0.9220167398452759,
"step": 166,
"train_speed(iter/s)": 0.005494
},
{
"epoch": 0.2853329061882642,
"grad_norm": 5.596877574920654,
"learning_rate": 0.0001953728759882821,
"logits/chosen": -0.7324296832084656,
"logits/rejected": -0.7348483204841614,
"logps/chosen": -10.596734046936035,
"logps/rejected": -26.180767059326172,
"loss": 0.6137089729309082,
"memory(GiB)": 46.38,
"nll_loss": 0.338160902261734,
"rewards/accuracies": 0.90625,
"rewards/chosen": 0.13076083362102509,
"rewards/margins": 1.6062695980072021,
"rewards/rejected": -1.4755089282989502,
"step": 167,
"train_speed(iter/s)": 0.005493
},
{
"epoch": 0.2870414864648406,
"grad_norm": 3.771359443664551,
"learning_rate": 0.00019528747432883035,
"logits/chosen": -0.790438711643219,
"logits/rejected": -0.794373631477356,
"logps/chosen": -10.444026947021484,
"logps/rejected": -26.96920394897461,
"loss": 0.9520989060401917,
"memory(GiB)": 46.38,
"nll_loss": 0.5127608776092529,
"rewards/accuracies": 0.8125,
"rewards/chosen": 0.06649212539196014,
"rewards/margins": 1.7065045833587646,
"rewards/rejected": -1.6400126218795776,
"step": 168,
"train_speed(iter/s)": 0.005493
},
{
"epoch": 0.28875006674141707,
"grad_norm": 5.279207706451416,
"learning_rate": 0.00019520131075327298,
"logits/chosen": -0.811764657497406,
"logits/rejected": -0.8173067569732666,
"logps/chosen": -5.237765312194824,
"logps/rejected": -34.11195755004883,
"loss": 0.5845170617103577,
"memory(GiB)": 46.38,
"nll_loss": 0.320607453584671,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.16728658974170685,
"rewards/margins": 2.271721363067627,
"rewards/rejected": -2.1044344902038574,
"step": 169,
"train_speed(iter/s)": 0.005492
},
{
"epoch": 0.2904586470179935,
"grad_norm": 3.968066453933716,
"learning_rate": 0.00019511438595057174,
"logits/chosen": -0.8485198020935059,
"logits/rejected": -0.8553695678710938,
"logps/chosen": -2.880854606628418,
"logps/rejected": -36.118629455566406,
"loss": 0.4797823131084442,
"memory(GiB)": 46.38,
"nll_loss": 0.23597285151481628,
"rewards/accuracies": 0.90625,
"rewards/chosen": 0.19838106632232666,
"rewards/margins": 2.7422218322753906,
"rewards/rejected": -2.5438406467437744,
"step": 170,
"train_speed(iter/s)": 0.005494
},
{
"epoch": 0.2921672272945699,
"grad_norm": 5.908665180206299,
"learning_rate": 0.00019502670061577498,
"logits/chosen": -0.8754770159721375,
"logits/rejected": -0.8793540000915527,
"logps/chosen": -6.855566501617432,
"logps/rejected": -41.512691497802734,
"loss": 0.5422110557556152,
"memory(GiB)": 46.38,
"nll_loss": 0.29031190276145935,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.1825065314769745,
"rewards/margins": 3.2673420906066895,
"rewards/rejected": -3.0848352909088135,
"step": 171,
"train_speed(iter/s)": 0.005494
},
{
"epoch": 0.29387580757114634,
"grad_norm": 9.865046501159668,
"learning_rate": 0.00019493825545001227,
"logits/chosen": -0.8389215469360352,
"logits/rejected": -0.8400964736938477,
"logps/chosen": -5.75340461730957,
"logps/rejected": -28.154647827148438,
"loss": 0.5484858751296997,
"memory(GiB)": 46.38,
"nll_loss": 0.24028873443603516,
"rewards/accuracies": 0.90625,
"rewards/chosen": 0.0924752876162529,
"rewards/margins": 2.016855001449585,
"rewards/rejected": -1.9243797063827515,
"step": 172,
"train_speed(iter/s)": 0.005494
},
{
"epoch": 0.2955843878477228,
"grad_norm": 5.110999584197998,
"learning_rate": 0.00019484905116048883,
"logits/chosen": -0.8424903750419617,
"logits/rejected": -0.8479667901992798,
"logps/chosen": -10.439705848693848,
"logps/rejected": -34.95732116699219,
"loss": 0.9751264452934265,
"memory(GiB)": 46.38,
"nll_loss": 0.6046102046966553,
"rewards/accuracies": 0.78125,
"rewards/chosen": 0.047889530658721924,
"rewards/margins": 2.1707029342651367,
"rewards/rejected": -2.1228134632110596,
"step": 173,
"train_speed(iter/s)": 0.005494
},
{
"epoch": 0.29729296812429923,
"grad_norm": 5.233139514923096,
"learning_rate": 0.00019475908846047982,
"logits/chosen": -0.8389162421226501,
"logits/rejected": -0.8423767685890198,
"logps/chosen": -6.015560626983643,
"logps/rejected": -33.967063903808594,
"loss": 0.5880640745162964,
"memory(GiB)": 46.38,
"nll_loss": 0.36994248628616333,
"rewards/accuracies": 0.96875,
"rewards/chosen": 0.29298272728919983,
"rewards/margins": 2.3524224758148193,
"rewards/rejected": -2.0594396591186523,
"step": 174,
"train_speed(iter/s)": 0.005495
},
{
"epoch": 0.29900154840087567,
"grad_norm": 3.566279649734497,
"learning_rate": 0.00019466836806932453,
"logits/chosen": -0.8825660943984985,
"logits/rejected": -0.8887041807174683,
"logps/chosen": -6.019082546234131,
"logps/rejected": -35.091529846191406,
"loss": 0.6474583148956299,
"memory(GiB)": 46.38,
"nll_loss": 0.41612136363983154,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.2304912507534027,
"rewards/margins": 2.494393825531006,
"rewards/rejected": -2.2639026641845703,
"step": 175,
"train_speed(iter/s)": 0.005495
},
{
"epoch": 0.30071012867745206,
"grad_norm": 6.7856950759887695,
"learning_rate": 0.00019457689071242085,
"logits/chosen": -0.8579093813896179,
"logits/rejected": -0.8634753227233887,
"logps/chosen": -9.888270378112793,
"logps/rejected": -41.228416442871094,
"loss": 0.6879767179489136,
"memory(GiB)": 46.38,
"nll_loss": 0.423296183347702,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.31314119696617126,
"rewards/margins": 2.737194538116455,
"rewards/rejected": -2.424053192138672,
"step": 176,
"train_speed(iter/s)": 0.005495
},
{
"epoch": 0.3024187089540285,
"grad_norm": 4.894569396972656,
"learning_rate": 0.0001944846571212192,
"logits/chosen": -0.8246264457702637,
"logits/rejected": -0.8278872966766357,
"logps/chosen": -9.956787109375,
"logps/rejected": -38.914066314697266,
"loss": 0.7229227423667908,
"memory(GiB)": 46.38,
"nll_loss": 0.3963947594165802,
"rewards/accuracies": 0.90625,
"rewards/chosen": 0.03048780933022499,
"rewards/margins": 2.575648307800293,
"rewards/rejected": -2.5451607704162598,
"step": 177,
"train_speed(iter/s)": 0.005494
},
{
"epoch": 0.30412728923060495,
"grad_norm": 5.153270721435547,
"learning_rate": 0.000194391668033217,
"logits/chosen": -0.8741589784622192,
"logits/rejected": -0.879849374294281,
"logps/chosen": -5.598626613616943,
"logps/rejected": -33.6767463684082,
"loss": 0.6376072764396667,
"memory(GiB)": 46.38,
"nll_loss": 0.31503573060035706,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.20653334259986877,
"rewards/margins": 2.248800754547119,
"rewards/rejected": -2.0422675609588623,
"step": 178,
"train_speed(iter/s)": 0.005494
},
{
"epoch": 0.3058358695071814,
"grad_norm": 6.50536584854126,
"learning_rate": 0.00019429792419195247,
"logits/chosen": -0.83283931016922,
"logits/rejected": -0.8357385993003845,
"logps/chosen": -5.801810264587402,
"logps/rejected": -26.60141372680664,
"loss": 0.7859883308410645,
"memory(GiB)": 46.38,
"nll_loss": 0.40051573514938354,
"rewards/accuracies": 0.84375,
"rewards/chosen": 0.022562842816114426,
"rewards/margins": 1.451593041419983,
"rewards/rejected": -1.429030179977417,
"step": 179,
"train_speed(iter/s)": 0.005494
},
{
"epoch": 0.30754444978375783,
"grad_norm": 2.6014249324798584,
"learning_rate": 0.0001942034263469989,
"logits/chosen": -0.8176060914993286,
"logits/rejected": -0.8231288194656372,
"logps/chosen": -8.629841804504395,
"logps/rejected": -33.58430480957031,
"loss": 0.6443658471107483,
"memory(GiB)": 46.38,
"nll_loss": 0.34101858735084534,
"rewards/accuracies": 0.84375,
"rewards/chosen": 0.10939686745405197,
"rewards/margins": 2.1205523014068604,
"rewards/rejected": -2.011155605316162,
"step": 180,
"train_speed(iter/s)": 0.005494
},
{
"epoch": 0.3092530300603342,
"grad_norm": 1.8803960084915161,
"learning_rate": 0.00019410817525395855,
"logits/chosen": -0.8076679706573486,
"logits/rejected": -0.8171229958534241,
"logps/chosen": -3.606616735458374,
"logps/rejected": -41.894737243652344,
"loss": 0.37792402505874634,
"memory(GiB)": 46.38,
"nll_loss": 0.1496608406305313,
"rewards/accuracies": 0.90625,
"rewards/chosen": 0.18168124556541443,
"rewards/margins": 2.5405263900756836,
"rewards/rejected": -2.3588449954986572,
"step": 181,
"train_speed(iter/s)": 0.005494
},
{
"epoch": 0.31096161033691067,
"grad_norm": 1.7322460412979126,
"learning_rate": 0.0001940121716744566,
"logits/chosen": -0.8273515701293945,
"logits/rejected": -0.8358028531074524,
"logps/chosen": -4.195955753326416,
"logps/rejected": -42.863243103027344,
"loss": 0.40653136372566223,
"memory(GiB)": 46.38,
"nll_loss": 0.1898367702960968,
"rewards/accuracies": 0.90625,
"rewards/chosen": 0.2309657633304596,
"rewards/margins": 2.9126315116882324,
"rewards/rejected": -2.6816658973693848,
"step": 182,
"train_speed(iter/s)": 0.005493
},
{
"epoch": 0.3126701906134871,
"grad_norm": 7.253870010375977,
"learning_rate": 0.00019391541637613508,
"logits/chosen": -0.818758487701416,
"logits/rejected": -0.8240275979042053,
"logps/chosen": -6.234726428985596,
"logps/rejected": -38.455230712890625,
"loss": 0.6432409882545471,
"memory(GiB)": 46.38,
"nll_loss": 0.3129611313343048,
"rewards/accuracies": 0.75,
"rewards/chosen": 0.03605951368808746,
"rewards/margins": 2.6540074348449707,
"rewards/rejected": -2.617948055267334,
"step": 183,
"train_speed(iter/s)": 0.005495
},
{
"epoch": 0.31437877089006355,
"grad_norm": 3.745917320251465,
"learning_rate": 0.0001938179101326468,
"logits/chosen": -0.8772048354148865,
"logits/rejected": -0.8792482614517212,
"logps/chosen": -10.402073860168457,
"logps/rejected": -31.16716766357422,
"loss": 0.7786051630973816,
"memory(GiB)": 46.38,
"nll_loss": 0.4461228549480438,
"rewards/accuracies": 0.8125,
"rewards/chosen": 0.22984227538108826,
"rewards/margins": 2.267395496368408,
"rewards/rejected": -2.037553310394287,
"step": 184,
"train_speed(iter/s)": 0.005495
},
{
"epoch": 0.31608735116664,
"grad_norm": 3.6105992794036865,
"learning_rate": 0.00019371965372364915,
"logits/chosen": -0.8841488361358643,
"logits/rejected": -0.8877873420715332,
"logps/chosen": -7.848278045654297,
"logps/rejected": -28.794742584228516,
"loss": 0.7686839699745178,
"memory(GiB)": 46.38,
"nll_loss": 0.4148586094379425,
"rewards/accuracies": 0.8125,
"rewards/chosen": 0.2514728009700775,
"rewards/margins": 2.0990750789642334,
"rewards/rejected": -1.8476024866104126,
"step": 185,
"train_speed(iter/s)": 0.005494
},
{
"epoch": 0.3177959314432164,
"grad_norm": 4.601129531860352,
"learning_rate": 0.00019362064793479767,
"logits/chosen": -0.890434980392456,
"logits/rejected": -0.8937606811523438,
"logps/chosen": -6.078680515289307,
"logps/rejected": -33.81269454956055,
"loss": 0.6938453316688538,
"memory(GiB)": 46.38,
"nll_loss": 0.35300731658935547,
"rewards/accuracies": 0.8125,
"rewards/chosen": 0.06243661791086197,
"rewards/margins": 2.5140228271484375,
"rewards/rejected": -2.4515862464904785,
"step": 186,
"train_speed(iter/s)": 0.005494
},
{
"epoch": 0.3195045117197928,
"grad_norm": 3.495896339416504,
"learning_rate": 0.00019352089355774004,
"logits/chosen": -0.8553616404533386,
"logits/rejected": -0.8608652949333191,
"logps/chosen": -5.048914432525635,
"logps/rejected": -32.950260162353516,
"loss": 0.5130528211593628,
"memory(GiB)": 46.38,
"nll_loss": 0.27008938789367676,
"rewards/accuracies": 0.96875,
"rewards/chosen": 0.2167266607284546,
"rewards/margins": 2.171088457107544,
"rewards/rejected": -1.9543616771697998,
"step": 187,
"train_speed(iter/s)": 0.005495
},
{
"epoch": 0.32121309199636927,
"grad_norm": 2.0062403678894043,
"learning_rate": 0.0001934203913901096,
"logits/chosen": -0.8811948299407959,
"logits/rejected": -0.8872733116149902,
"logps/chosen": -6.987203598022461,
"logps/rejected": -31.409507751464844,
"loss": 0.6117798686027527,
"memory(GiB)": 46.38,
"nll_loss": 0.3332153260707855,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.2551400661468506,
"rewards/margins": 2.197721004486084,
"rewards/rejected": -1.942581057548523,
"step": 188,
"train_speed(iter/s)": 0.005495
},
{
"epoch": 0.3229216722729457,
"grad_norm": 2.5417840480804443,
"learning_rate": 0.000193319142235519,
"logits/chosen": -0.8587099313735962,
"logits/rejected": -0.860413670539856,
"logps/chosen": -10.022211074829102,
"logps/rejected": -29.925012588500977,
"loss": 0.6710554361343384,
"memory(GiB)": 46.38,
"nll_loss": 0.4114764630794525,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.2854654788970947,
"rewards/margins": 2.179234743118286,
"rewards/rejected": -1.893769383430481,
"step": 189,
"train_speed(iter/s)": 0.005495
},
{
"epoch": 0.32463025254952216,
"grad_norm": 2.4238228797912598,
"learning_rate": 0.0001932171469035538,
"logits/chosen": -0.8661004900932312,
"logits/rejected": -0.8710408806800842,
"logps/chosen": -5.72200870513916,
"logps/rejected": -31.211780548095703,
"loss": 0.4626935124397278,
"memory(GiB)": 46.38,
"nll_loss": 0.24239738285541534,
"rewards/accuracies": 0.90625,
"rewards/chosen": 0.23706884682178497,
"rewards/margins": 2.2727468013763428,
"rewards/rejected": -2.0356781482696533,
"step": 190,
"train_speed(iter/s)": 0.005494
},
{
"epoch": 0.32633883282609855,
"grad_norm": 4.148837089538574,
"learning_rate": 0.00019311440620976597,
"logits/chosen": -0.9142186045646667,
"logits/rejected": -0.9197511076927185,
"logps/chosen": -6.843296051025391,
"logps/rejected": -34.4539680480957,
"loss": 0.5014334321022034,
"memory(GiB)": 46.38,
"nll_loss": 0.3269428014755249,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.398705393075943,
"rewards/margins": 2.5132031440734863,
"rewards/rejected": -2.1144979000091553,
"step": 191,
"train_speed(iter/s)": 0.005495
},
{
"epoch": 0.328047413102675,
"grad_norm": 6.930333614349365,
"learning_rate": 0.0001930109209756673,
"logits/chosen": -0.9393826723098755,
"logits/rejected": -0.9431489109992981,
"logps/chosen": -12.365182876586914,
"logps/rejected": -36.20299530029297,
"loss": 0.9010649919509888,
"memory(GiB)": 46.38,
"nll_loss": 0.5080785155296326,
"rewards/accuracies": 0.78125,
"rewards/chosen": -0.09569638967514038,
"rewards/margins": 2.128075361251831,
"rewards/rejected": -2.223771810531616,
"step": 192,
"train_speed(iter/s)": 0.005495
},
{
"epoch": 0.32975599337925143,
"grad_norm": 1.8063973188400269,
"learning_rate": 0.00019290669202872302,
"logits/chosen": -0.9646225571632385,
"logits/rejected": -0.9725656509399414,
"logps/chosen": -4.754866123199463,
"logps/rejected": -49.72484588623047,
"loss": 0.3587495982646942,
"memory(GiB)": 46.38,
"nll_loss": 0.2268112450838089,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.3622514307498932,
"rewards/margins": 4.094050884246826,
"rewards/rejected": -3.731799602508545,
"step": 193,
"train_speed(iter/s)": 0.005494
},
{
"epoch": 0.3314645736558279,
"grad_norm": 9.937451362609863,
"learning_rate": 0.00019280172020234496,
"logits/chosen": -1.0251308679580688,
"logits/rejected": -1.030665636062622,
"logps/chosen": -10.551065444946289,
"logps/rejected": -53.82728576660156,
"loss": 1.1305742263793945,
"memory(GiB)": 46.38,
"nll_loss": 0.5491915345191956,
"rewards/accuracies": 0.90625,
"rewards/chosen": -0.27872776985168457,
"rewards/margins": 3.9652843475341797,
"rewards/rejected": -4.244011878967285,
"step": 194,
"train_speed(iter/s)": 0.005495
},
{
"epoch": 0.3331731539324043,
"grad_norm": 7.0363922119140625,
"learning_rate": 0.00019269600633588514,
"logits/chosen": -0.98694908618927,
"logits/rejected": -0.9900444746017456,
"logps/chosen": -11.45719051361084,
"logps/rejected": -51.027496337890625,
"loss": 0.6249094009399414,
"memory(GiB)": 46.38,
"nll_loss": 0.3946501910686493,
"rewards/accuracies": 0.90625,
"rewards/chosen": -0.056097134947776794,
"rewards/margins": 3.8215420246124268,
"rewards/rejected": -3.8776392936706543,
"step": 195,
"train_speed(iter/s)": 0.005495
},
{
"epoch": 0.3348817342089807,
"grad_norm": 7.936800003051758,
"learning_rate": 0.0001925895512746287,
"logits/chosen": -0.9765729904174805,
"logits/rejected": -0.9803340435028076,
"logps/chosen": -7.451618194580078,
"logps/rejected": -42.50349426269531,
"loss": 0.8021814227104187,
"memory(GiB)": 46.38,
"nll_loss": 0.49508342146873474,
"rewards/accuracies": 0.90625,
"rewards/chosen": -0.0933699905872345,
"rewards/margins": 3.030968189239502,
"rewards/rejected": -3.124338150024414,
"step": 196,
"train_speed(iter/s)": 0.005495
},
{
"epoch": 0.33659031448555715,
"grad_norm": 7.247754096984863,
"learning_rate": 0.00019248235586978755,
"logits/chosen": -0.9704450964927673,
"logits/rejected": -0.9796913862228394,
"logps/chosen": -5.781133651733398,
"logps/rejected": -43.08665084838867,
"loss": 0.5009433627128601,
"memory(GiB)": 46.38,
"nll_loss": 0.3090832829475403,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.17386135458946228,
"rewards/margins": 3.0037147998809814,
"rewards/rejected": -2.8298535346984863,
"step": 197,
"train_speed(iter/s)": 0.005495
},
{
"epoch": 0.3382988947621336,
"grad_norm": 4.252370357513428,
"learning_rate": 0.0001923744209784933,
"logits/chosen": -0.9834634065628052,
"logits/rejected": -0.9903834462165833,
"logps/chosen": -10.431640625,
"logps/rejected": -41.34126663208008,
"loss": 0.892498791217804,
"memory(GiB)": 46.38,
"nll_loss": 0.5820133686065674,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.0897313803434372,
"rewards/margins": 2.829003095626831,
"rewards/rejected": -2.739271640777588,
"step": 198,
"train_speed(iter/s)": 0.005496
},
{
"epoch": 0.34000747503871004,
"grad_norm": 7.74161958694458,
"learning_rate": 0.00019226574746379038,
"logits/chosen": -0.9264886975288391,
"logits/rejected": -0.9303056597709656,
"logps/chosen": -18.308433532714844,
"logps/rejected": -34.25849914550781,
"loss": 1.4104645252227783,
"memory(GiB)": 46.38,
"nll_loss": 1.1379212141036987,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.23661470413208008,
"rewards/margins": 2.288109540939331,
"rewards/rejected": -2.051494598388672,
"step": 199,
"train_speed(iter/s)": 0.005496
},
{
"epoch": 0.3417160553152864,
"grad_norm": 19.06857681274414,
"learning_rate": 0.00019215633619462942,
"logits/chosen": -0.9472784399986267,
"logits/rejected": -0.9554142951965332,
"logps/chosen": -9.5065336227417,
"logps/rejected": -40.612945556640625,
"loss": 1.1060166358947754,
"memory(GiB)": 46.38,
"nll_loss": 0.7597510814666748,
"rewards/accuracies": 0.84375,
"rewards/chosen": 0.030025824904441833,
"rewards/margins": 2.3827638626098633,
"rewards/rejected": -2.35273814201355,
"step": 200,
"train_speed(iter/s)": 0.005496
},
{
"epoch": 0.34342463559186287,
"grad_norm": 3.042719841003418,
"learning_rate": 0.00019204618804585994,
"logits/chosen": -0.8972377181053162,
"logits/rejected": -0.9024269580841064,
"logps/chosen": -6.98057222366333,
"logps/rejected": -34.55181884765625,
"loss": 0.5098893642425537,
"memory(GiB)": 46.38,
"nll_loss": 0.2953639328479767,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.31456321477890015,
"rewards/margins": 2.592310905456543,
"rewards/rejected": -2.277747392654419,
"step": 201,
"train_speed(iter/s)": 0.005494
},
{
"epoch": 0.3451332158684393,
"grad_norm": 3.191251516342163,
"learning_rate": 0.00019193530389822363,
"logits/chosen": -0.9289453625679016,
"logits/rejected": -0.9359845519065857,
"logps/chosen": -9.659342765808105,
"logps/rejected": -37.61637878417969,
"loss": 1.0019766092300415,
"memory(GiB)": 46.38,
"nll_loss": 0.6679946780204773,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.1197037547826767,
"rewards/margins": 2.4200377464294434,
"rewards/rejected": -2.3003342151641846,
"step": 202,
"train_speed(iter/s)": 0.005494
},
{
"epoch": 0.34684179614501576,
"grad_norm": 4.930737018585205,
"learning_rate": 0.00019182368463834722,
"logits/chosen": -0.8630688190460205,
"logits/rejected": -0.8667917847633362,
"logps/chosen": -9.344999313354492,
"logps/rejected": -36.20460510253906,
"loss": 0.5554157495498657,
"memory(GiB)": 46.38,
"nll_loss": 0.36027616262435913,
"rewards/accuracies": 0.90625,
"rewards/chosen": 0.1459665298461914,
"rewards/margins": 2.5479657649993896,
"rewards/rejected": -2.4019992351531982,
"step": 203,
"train_speed(iter/s)": 0.005495
},
{
"epoch": 0.3485503764215922,
"grad_norm": 2.625263214111328,
"learning_rate": 0.00019171133115873526,
"logits/chosen": -0.8702833652496338,
"logits/rejected": -0.8725969195365906,
"logps/chosen": -7.262643814086914,
"logps/rejected": -34.7918701171875,
"loss": 0.4979276657104492,
"memory(GiB)": 46.38,
"nll_loss": 0.3470659554004669,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.23693254590034485,
"rewards/margins": 2.7716078758239746,
"rewards/rejected": -2.534675359725952,
"step": 204,
"train_speed(iter/s)": 0.005495
},
{
"epoch": 0.3502589566981686,
"grad_norm": 4.522634029388428,
"learning_rate": 0.0001915982443577632,
"logits/chosen": -0.8535888195037842,
"logits/rejected": -0.859410285949707,
"logps/chosen": -6.171905517578125,
"logps/rejected": -37.568458557128906,
"loss": 0.5628905296325684,
"memory(GiB)": 46.38,
"nll_loss": 0.3058054447174072,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.09114877134561539,
"rewards/margins": 2.7372331619262695,
"rewards/rejected": -2.6460840702056885,
"step": 205,
"train_speed(iter/s)": 0.005495
},
{
"epoch": 0.35196753697474503,
"grad_norm": 3.1796517372131348,
"learning_rate": 0.00019148442513967014,
"logits/chosen": -0.8468549251556396,
"logits/rejected": -0.8539971709251404,
"logps/chosen": -9.5682954788208,
"logps/rejected": -36.71331024169922,
"loss": 0.6788620948791504,
"memory(GiB)": 46.38,
"nll_loss": 0.4944525957107544,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.10999859869480133,
"rewards/margins": 2.5533294677734375,
"rewards/rejected": -2.443330764770508,
"step": 206,
"train_speed(iter/s)": 0.005494
},
{
"epoch": 0.3536761172513215,
"grad_norm": 3.1952710151672363,
"learning_rate": 0.00019136987441455144,
"logits/chosen": -0.8667152523994446,
"logits/rejected": -0.8705443143844604,
"logps/chosen": -9.689000129699707,
"logps/rejected": -30.918254852294922,
"loss": 0.6780470013618469,
"memory(GiB)": 46.38,
"nll_loss": 0.41608238220214844,
"rewards/accuracies": 0.84375,
"rewards/chosen": 0.2547697126865387,
"rewards/margins": 2.3299858570098877,
"rewards/rejected": -2.075216293334961,
"step": 207,
"train_speed(iter/s)": 0.005494
},
{
"epoch": 0.3553846975278979,
"grad_norm": 2.4894015789031982,
"learning_rate": 0.00019125459309835173,
"logits/chosen": -0.8714242577552795,
"logits/rejected": -0.8752931356430054,
"logps/chosen": -7.453229904174805,
"logps/rejected": -31.325904846191406,
"loss": 0.6907439827919006,
"memory(GiB)": 46.38,
"nll_loss": 0.4350113868713379,
"rewards/accuracies": 0.84375,
"rewards/chosen": 0.17801815271377563,
"rewards/margins": 2.264295816421509,
"rewards/rejected": -2.086277484893799,
"step": 208,
"train_speed(iter/s)": 0.005495
},
{
"epoch": 0.35709327780447436,
"grad_norm": 3.2602062225341797,
"learning_rate": 0.00019113858211285725,
"logits/chosen": -0.872046709060669,
"logits/rejected": -0.8767064213752747,
"logps/chosen": -4.748498439788818,
"logps/rejected": -36.4671745300293,
"loss": 0.47542524337768555,
"memory(GiB)": 46.38,
"nll_loss": 0.24451857805252075,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.20409636199474335,
"rewards/margins": 2.852433443069458,
"rewards/rejected": -2.6483371257781982,
"step": 209,
"train_speed(iter/s)": 0.005495
},
{
"epoch": 0.35880185808105075,
"grad_norm": 2.723602533340454,
"learning_rate": 0.00019102184238568878,
"logits/chosen": -0.872526228427887,
"logits/rejected": -0.8720419406890869,
"logps/chosen": -9.495769500732422,
"logps/rejected": -35.4581184387207,
"loss": 0.6998460292816162,
"memory(GiB)": 46.38,
"nll_loss": 0.4141753911972046,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.08976475894451141,
"rewards/margins": 2.3428900241851807,
"rewards/rejected": -2.2531251907348633,
"step": 210,
"train_speed(iter/s)": 0.005495
},
{
"epoch": 0.3605104383576272,
"grad_norm": 7.090069770812988,
"learning_rate": 0.00019090437485029413,
"logits/chosen": -0.8751546740531921,
"logits/rejected": -0.8804129362106323,
"logps/chosen": -5.539629936218262,
"logps/rejected": -41.93748092651367,
"loss": 0.414511114358902,
"memory(GiB)": 46.38,
"nll_loss": 0.24404364824295044,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.2657608985900879,
"rewards/margins": 3.283001184463501,
"rewards/rejected": -3.017240524291992,
"step": 211,
"train_speed(iter/s)": 0.005495
},
{
"epoch": 0.36221901863420364,
"grad_norm": 3.3576340675354004,
"learning_rate": 0.00019078618044594052,
"logits/chosen": -0.9006087779998779,
"logits/rejected": -0.9030022621154785,
"logps/chosen": -7.570390224456787,
"logps/rejected": -34.19873046875,
"loss": 0.4811999499797821,
"memory(GiB)": 46.38,
"nll_loss": 0.29778629541397095,
"rewards/accuracies": 0.96875,
"rewards/chosen": 0.24354203045368195,
"rewards/margins": 2.750795364379883,
"rewards/rejected": -2.5072531700134277,
"step": 212,
"train_speed(iter/s)": 0.005495
},
{
"epoch": 0.3639275989107801,
"grad_norm": 4.36439323425293,
"learning_rate": 0.00019066726011770726,
"logits/chosen": -0.8826490640640259,
"logits/rejected": -0.8854631185531616,
"logps/chosen": -7.964271068572998,
"logps/rejected": -36.53171920776367,
"loss": 0.7800939679145813,
"memory(GiB)": 46.38,
"nll_loss": 0.4539424479007721,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.1163502037525177,
"rewards/margins": 2.651106357574463,
"rewards/rejected": -2.5347559452056885,
"step": 213,
"train_speed(iter/s)": 0.005496
},
{
"epoch": 0.3656361791873565,
"grad_norm": 3.075863838195801,
"learning_rate": 0.00019054761481647817,
"logits/chosen": -0.9236173033714294,
"logits/rejected": -0.9311164021492004,
"logps/chosen": -5.548548698425293,
"logps/rejected": -39.62729263305664,
"loss": 0.5424690842628479,
"memory(GiB)": 46.38,
"nll_loss": 0.37887126207351685,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.2379705011844635,
"rewards/margins": 2.8928284645080566,
"rewards/rejected": -2.654857873916626,
"step": 214,
"train_speed(iter/s)": 0.005494
},
{
"epoch": 0.3673447594639329,
"grad_norm": 4.081761360168457,
"learning_rate": 0.0001904272454989338,
"logits/chosen": -0.9173122644424438,
"logits/rejected": -0.9237719774246216,
"logps/chosen": -7.586677551269531,
"logps/rejected": -39.44381332397461,
"loss": 0.7125780582427979,
"memory(GiB)": 46.38,
"nll_loss": 0.4088558554649353,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.10065207630395889,
"rewards/margins": 2.89681077003479,
"rewards/rejected": -2.796158790588379,
"step": 215,
"train_speed(iter/s)": 0.005494
},
{
"epoch": 0.36905333974050936,
"grad_norm": 6.38205099105835,
"learning_rate": 0.00019030615312754412,
"logits/chosen": -0.8755264282226562,
"logits/rejected": -0.8772911429405212,
"logps/chosen": -10.058317184448242,
"logps/rejected": -29.399351119995117,
"loss": 0.6085036993026733,
"memory(GiB)": 46.38,
"nll_loss": 0.37356507778167725,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.257190465927124,
"rewards/margins": 2.3912007808685303,
"rewards/rejected": -2.1340105533599854,
"step": 216,
"train_speed(iter/s)": 0.005495
},
{
"epoch": 0.3707619200170858,
"grad_norm": 3.965923547744751,
"learning_rate": 0.00019018433867056043,
"logits/chosen": -0.8582707047462463,
"logits/rejected": -0.8643903136253357,
"logps/chosen": -7.274492263793945,
"logps/rejected": -38.09757995605469,
"loss": 0.7568970918655396,
"memory(GiB)": 46.38,
"nll_loss": 0.5492669343948364,
"rewards/accuracies": 0.96875,
"rewards/chosen": 0.09097186475992203,
"rewards/margins": 2.650477170944214,
"rewards/rejected": -2.5595054626464844,
"step": 217,
"train_speed(iter/s)": 0.005495
},
{
"epoch": 0.37247050029366224,
"grad_norm": 6.908701419830322,
"learning_rate": 0.00019006180310200788,
"logits/chosen": -0.8987607955932617,
"logits/rejected": -0.9025367498397827,
"logps/chosen": -9.353863716125488,
"logps/rejected": -41.96833801269531,
"loss": 0.5579907298088074,
"memory(GiB)": 46.38,
"nll_loss": 0.32021838426589966,
"rewards/accuracies": 0.90625,
"rewards/chosen": 0.06166917830705643,
"rewards/margins": 3.1308600902557373,
"rewards/rejected": -3.069190740585327,
"step": 218,
"train_speed(iter/s)": 0.005495
},
{
"epoch": 0.3741790805702387,
"grad_norm": 11.417703628540039,
"learning_rate": 0.00018993854740167768,
"logits/chosen": -0.8815793991088867,
"logits/rejected": -0.8841702342033386,
"logps/chosen": -8.630674362182617,
"logps/rejected": -32.739219665527344,
"loss": 0.7540084719657898,
"memory(GiB)": 46.38,
"nll_loss": 0.42135101556777954,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.017735840752720833,
"rewards/margins": 2.403879165649414,
"rewards/rejected": -2.386143445968628,
"step": 219,
"train_speed(iter/s)": 0.005496
},
{
"epoch": 0.3758876608468151,
"grad_norm": 7.359007358551025,
"learning_rate": 0.00018981457255511902,
"logits/chosen": -0.8066080212593079,
"logits/rejected": -0.8113219141960144,
"logps/chosen": -10.087733268737793,
"logps/rejected": -34.230953216552734,
"loss": 0.7611066102981567,
"memory(GiB)": 46.38,
"nll_loss": 0.38534992933273315,
"rewards/accuracies": 0.8125,
"rewards/chosen": 0.18794448673725128,
"rewards/margins": 2.276632785797119,
"rewards/rejected": -2.088688373565674,
"step": 220,
"train_speed(iter/s)": 0.005496
},
{
"epoch": 0.3775962411233915,
"grad_norm": 2.5772690773010254,
"learning_rate": 0.00018968987955363153,
"logits/chosen": -0.7865528464317322,
"logits/rejected": -0.7891740202903748,
"logps/chosen": -13.03406810760498,
"logps/rejected": -25.763931274414062,
"loss": 0.8478187918663025,
"memory(GiB)": 46.38,
"nll_loss": 0.5038392543792725,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.3180733621120453,
"rewards/margins": 1.6984466314315796,
"rewards/rejected": -1.3803733587265015,
"step": 221,
"train_speed(iter/s)": 0.005495
},
{
"epoch": 0.37930482139996796,
"grad_norm": 3.7778072357177734,
"learning_rate": 0.00018956446939425716,
"logits/chosen": -0.826096773147583,
"logits/rejected": -0.8322123885154724,
"logps/chosen": -9.263298988342285,
"logps/rejected": -25.442668914794922,
"loss": 0.6595274209976196,
"memory(GiB)": 46.38,
"nll_loss": 0.3389233946800232,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.24548465013504028,
"rewards/margins": 1.5120353698730469,
"rewards/rejected": -1.2665507793426514,
"step": 222,
"train_speed(iter/s)": 0.005496
},
{
"epoch": 0.3810134016765444,
"grad_norm": 4.857659339904785,
"learning_rate": 0.00018943834307977216,
"logits/chosen": -0.8075899481773376,
"logits/rejected": -0.8120123744010925,
"logps/chosen": -4.7845778465271,
"logps/rejected": -21.904151916503906,
"loss": 0.6341399550437927,
"memory(GiB)": 46.38,
"nll_loss": 0.2501222789287567,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.19457918405532837,
"rewards/margins": 1.1304917335510254,
"rewards/rejected": -0.9359126091003418,
"step": 223,
"train_speed(iter/s)": 0.005495
},
{
"epoch": 0.38272198195312085,
"grad_norm": 2.3448665142059326,
"learning_rate": 0.00018931150161867916,
"logits/chosen": -0.882806658744812,
"logits/rejected": -0.8879884481430054,
"logps/chosen": -9.03802490234375,
"logps/rejected": -24.53693199157715,
"loss": 0.7897974848747253,
"memory(GiB)": 46.38,
"nll_loss": 0.38777855038642883,
"rewards/accuracies": 0.78125,
"rewards/chosen": 0.1946476548910141,
"rewards/margins": 1.5893993377685547,
"rewards/rejected": -1.3947515487670898,
"step": 224,
"train_speed(iter/s)": 0.005496
},
{
"epoch": 0.38443056222969724,
"grad_norm": 11.419641494750977,
"learning_rate": 0.00018918394602519914,
"logits/chosen": -0.8994475603103638,
"logits/rejected": -0.9015949964523315,
"logps/chosen": -7.98261022567749,
"logps/rejected": -27.965211868286133,
"loss": 0.7503970265388489,
"memory(GiB)": 46.38,
"nll_loss": 0.4178537130355835,
"rewards/accuracies": 0.84375,
"rewards/chosen": 0.22919557988643646,
"rewards/margins": 1.8219597339630127,
"rewards/rejected": -1.592764139175415,
"step": 225,
"train_speed(iter/s)": 0.005496
},
{
"epoch": 0.3861391425062737,
"grad_norm": 5.716240406036377,
"learning_rate": 0.00018905567731926324,
"logits/chosen": -0.8648837208747864,
"logits/rejected": -0.8741611838340759,
"logps/chosen": -6.251923084259033,
"logps/rejected": -36.683223724365234,
"loss": 0.5255903601646423,
"memory(GiB)": 46.38,
"nll_loss": 0.3399491310119629,
"rewards/accuracies": 0.96875,
"rewards/chosen": 0.2363051176071167,
"rewards/margins": 2.3525753021240234,
"rewards/rejected": -2.1162703037261963,
"step": 226,
"train_speed(iter/s)": 0.005497
},
{
"epoch": 0.3878477227828501,
"grad_norm": 2.4492273330688477,
"learning_rate": 0.00018892669652650456,
"logits/chosen": -0.8707509636878967,
"logits/rejected": -0.8740925192832947,
"logps/chosen": -8.421378135681152,
"logps/rejected": -34.801605224609375,
"loss": 0.6341971158981323,
"memory(GiB)": 46.38,
"nll_loss": 0.4148554801940918,
"rewards/accuracies": 0.96875,
"rewards/chosen": 0.3119761645793915,
"rewards/margins": 2.5685765743255615,
"rewards/rejected": -2.2566003799438477,
"step": 227,
"train_speed(iter/s)": 0.005496
},
{
"epoch": 0.38955630305942657,
"grad_norm": 7.605607986450195,
"learning_rate": 0.00018879700467825013,
"logits/chosen": -0.8900420069694519,
"logits/rejected": -0.8933430910110474,
"logps/chosen": -5.360377311706543,
"logps/rejected": -33.13306427001953,
"loss": 0.4900038540363312,
"memory(GiB)": 46.38,
"nll_loss": 0.28295254707336426,
"rewards/accuracies": 0.96875,
"rewards/chosen": 0.3359947204589844,
"rewards/margins": 2.5908119678497314,
"rewards/rejected": -2.254817008972168,
"step": 228,
"train_speed(iter/s)": 0.005495
},
{
"epoch": 0.391264883336003,
"grad_norm": 8.061660766601562,
"learning_rate": 0.00018866660281151247,
"logits/chosen": -0.9369041919708252,
"logits/rejected": -0.9415433406829834,
"logps/chosen": -4.601605415344238,
"logps/rejected": -35.486732482910156,
"loss": 0.5184635519981384,
"memory(GiB)": 46.38,
"nll_loss": 0.2989267408847809,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.22662585973739624,
"rewards/margins": 2.7763917446136475,
"rewards/rejected": -2.5497660636901855,
"step": 229,
"train_speed(iter/s)": 0.005495
},
{
"epoch": 0.3929734636125794,
"grad_norm": 3.7317209243774414,
"learning_rate": 0.0001885354919689815,
"logits/chosen": -0.9507468342781067,
"logits/rejected": -0.9519726634025574,
"logps/chosen": -6.97619104385376,
"logps/rejected": -38.649261474609375,
"loss": 0.4864623546600342,
"memory(GiB)": 46.38,
"nll_loss": 0.2420811951160431,
"rewards/accuracies": 0.90625,
"rewards/chosen": 0.16122400760650635,
"rewards/margins": 2.8739140033721924,
"rewards/rejected": -2.7126896381378174,
"step": 230,
"train_speed(iter/s)": 0.005494
},
{
"epoch": 0.39468204388915584,
"grad_norm": 2.446930408477783,
"learning_rate": 0.00018840367319901592,
"logits/chosen": -0.9463286399841309,
"logits/rejected": -0.9530838131904602,
"logps/chosen": -4.321158409118652,
"logps/rejected": -45.260074615478516,
"loss": 0.2898697853088379,
"memory(GiB)": 46.38,
"nll_loss": 0.19011972844600677,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.2383752316236496,
"rewards/margins": 3.6623451709747314,
"rewards/rejected": -3.4239697456359863,
"step": 231,
"train_speed(iter/s)": 0.005494
},
{
"epoch": 0.3963906241657323,
"grad_norm": 10.94664478302002,
"learning_rate": 0.0001882711475556352,
"logits/chosen": -0.9894860982894897,
"logits/rejected": -0.9986059665679932,
"logps/chosen": -7.955844879150391,
"logps/rejected": -57.02360534667969,
"loss": 1.0545183420181274,
"memory(GiB)": 46.38,
"nll_loss": 0.7007216215133667,
"rewards/accuracies": 0.84375,
"rewards/chosen": -0.0017464309930801392,
"rewards/margins": 4.065786361694336,
"rewards/rejected": -4.067533016204834,
"step": 232,
"train_speed(iter/s)": 0.005493
},
{
"epoch": 0.39809920444230873,
"grad_norm": 5.375171661376953,
"learning_rate": 0.0001881379160985108,
"logits/chosen": -1.0208549499511719,
"logits/rejected": -1.0248205661773682,
"logps/chosen": -7.056022644042969,
"logps/rejected": -52.94482421875,
"loss": 0.6524523496627808,
"memory(GiB)": 46.38,
"nll_loss": 0.44853687286376953,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.08947555720806122,
"rewards/margins": 4.471720218658447,
"rewards/rejected": -4.382244110107422,
"step": 233,
"train_speed(iter/s)": 0.005493
},
{
"epoch": 0.3998077847188852,
"grad_norm": 12.273642539978027,
"learning_rate": 0.00018800397989295794,
"logits/chosen": -0.9972729682922363,
"logits/rejected": -1.0022565126419067,
"logps/chosen": -10.15302848815918,
"logps/rejected": -46.114967346191406,
"loss": 0.7069646716117859,
"memory(GiB)": 46.38,
"nll_loss": 0.4566623270511627,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.1436801254749298,
"rewards/margins": 3.605038642883301,
"rewards/rejected": -3.4613585472106934,
"step": 234,
"train_speed(iter/s)": 0.005493
},
{
"epoch": 0.40151636499546156,
"grad_norm": 8.246232986450195,
"learning_rate": 0.00018786934000992688,
"logits/chosen": -1.0225094556808472,
"logits/rejected": -1.019821286201477,
"logps/chosen": -11.058813095092773,
"logps/rejected": -53.49971008300781,
"loss": 0.811690092086792,
"memory(GiB)": 46.38,
"nll_loss": 0.42450016736984253,
"rewards/accuracies": 0.875,
"rewards/chosen": -0.12926799058914185,
"rewards/margins": 4.236933708190918,
"rewards/rejected": -4.366201877593994,
"step": 235,
"train_speed(iter/s)": 0.005493
},
{
"epoch": 0.403224945272038,
"grad_norm": 13.076598167419434,
"learning_rate": 0.00018773399752599463,
"logits/chosen": -1.001189112663269,
"logits/rejected": -1.0065340995788574,
"logps/chosen": -8.285541534423828,
"logps/rejected": -48.76884460449219,
"loss": 0.6642578840255737,
"memory(GiB)": 46.38,
"nll_loss": 0.3762781023979187,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.013312354683876038,
"rewards/margins": 3.655507802963257,
"rewards/rejected": -3.642195701599121,
"step": 236,
"train_speed(iter/s)": 0.005493
},
{
"epoch": 0.40493352554861445,
"grad_norm": 3.6171457767486572,
"learning_rate": 0.000187597953523356,
"logits/chosen": -0.9681710600852966,
"logits/rejected": -0.9759187698364258,
"logps/chosen": -8.311320304870605,
"logps/rejected": -54.762943267822266,
"loss": 0.5605093240737915,
"memory(GiB)": 46.38,
"nll_loss": 0.39821937680244446,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.021861745044589043,
"rewards/margins": 4.216716289520264,
"rewards/rejected": -4.194854736328125,
"step": 237,
"train_speed(iter/s)": 0.005493
},
{
"epoch": 0.4066421058251909,
"grad_norm": 15.052586555480957,
"learning_rate": 0.00018746120908981527,
"logits/chosen": -0.9332698583602905,
"logits/rejected": -0.9356809258460999,
"logps/chosen": -6.916642189025879,
"logps/rejected": -39.75300979614258,
"loss": 0.5308848023414612,
"memory(GiB)": 46.38,
"nll_loss": 0.33774426579475403,
"rewards/accuracies": 0.90625,
"rewards/chosen": 0.11101798713207245,
"rewards/margins": 3.2900469303131104,
"rewards/rejected": -3.1790287494659424,
"step": 238,
"train_speed(iter/s)": 0.005493
},
{
"epoch": 0.40835068610176734,
"grad_norm": 1.4588333368301392,
"learning_rate": 0.00018732376531877725,
"logits/chosen": -0.8663907647132874,
"logits/rejected": -0.8769683241844177,
"logps/chosen": -7.994008541107178,
"logps/rejected": -53.477638244628906,
"loss": 0.3602023124694824,
"memory(GiB)": 46.38,
"nll_loss": 0.27253228425979614,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.39557039737701416,
"rewards/margins": 4.195072174072266,
"rewards/rejected": -3.799501895904541,
"step": 239,
"train_speed(iter/s)": 0.005494
},
{
"epoch": 0.4100592663783437,
"grad_norm": 2.3394670486450195,
"learning_rate": 0.0001871856233092387,
"logits/chosen": -0.8316817283630371,
"logits/rejected": -0.8333123326301575,
"logps/chosen": -9.785093307495117,
"logps/rejected": -40.74665069580078,
"loss": 0.4092681407928467,
"memory(GiB)": 46.38,
"nll_loss": 0.260936975479126,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.18386238813400269,
"rewards/margins": 2.943046808242798,
"rewards/rejected": -2.7591843605041504,
"step": 240,
"train_speed(iter/s)": 0.005492
},
{
"epoch": 0.41176784665492017,
"grad_norm": 15.97940731048584,
"learning_rate": 0.00018704678416577941,
"logits/chosen": -0.8120774030685425,
"logits/rejected": -0.8134472370147705,
"logps/chosen": -11.521053314208984,
"logps/rejected": -35.660865783691406,
"loss": 0.8933948874473572,
"memory(GiB)": 46.38,
"nll_loss": 0.5571330785751343,
"rewards/accuracies": 0.78125,
"rewards/chosen": -0.0759764090180397,
"rewards/margins": 2.2313168048858643,
"rewards/rejected": -2.30729341506958,
"step": 241,
"train_speed(iter/s)": 0.005492
},
{
"epoch": 0.4134764269314966,
"grad_norm": 4.722672462463379,
"learning_rate": 0.00018690724899855348,
"logits/chosen": -0.7959482669830322,
"logits/rejected": -0.7984044551849365,
"logps/chosen": -5.855531692504883,
"logps/rejected": -40.35407257080078,
"loss": 0.49105608463287354,
"memory(GiB)": 46.38,
"nll_loss": 0.2971791923046112,
"rewards/accuracies": 0.90625,
"rewards/chosen": 0.221318781375885,
"rewards/margins": 3.0078468322753906,
"rewards/rejected": -2.7865281105041504,
"step": 242,
"train_speed(iter/s)": 0.005493
},
{
"epoch": 0.41518500720807305,
"grad_norm": 6.576427936553955,
"learning_rate": 0.00018676701892328046,
"logits/chosen": -0.7806111574172974,
"logits/rejected": -0.783092200756073,
"logps/chosen": -4.328828811645508,
"logps/rejected": -40.24433517456055,
"loss": 0.45146334171295166,
"memory(GiB)": 46.38,
"nll_loss": 0.30311349034309387,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.22997835278511047,
"rewards/margins": 3.151667833328247,
"rewards/rejected": -2.921689510345459,
"step": 243,
"train_speed(iter/s)": 0.005493
},
{
"epoch": 0.4168935874846495,
"grad_norm": 3.0237584114074707,
"learning_rate": 0.0001866260950612362,
"logits/chosen": -0.768136203289032,
"logits/rejected": -0.7717478275299072,
"logps/chosen": -4.951301097869873,
"logps/rejected": -33.46363830566406,
"loss": 0.4757350981235504,
"memory(GiB)": 46.38,
"nll_loss": 0.20984753966331482,
"rewards/accuracies": 0.96875,
"rewards/chosen": 0.28256160020828247,
"rewards/margins": 2.4234559535980225,
"rewards/rejected": -2.140894651412964,
"step": 244,
"train_speed(iter/s)": 0.005493
},
{
"epoch": 0.4186021677612259,
"grad_norm": 6.6580657958984375,
"learning_rate": 0.0001864844785392442,
"logits/chosen": -0.745742917060852,
"logits/rejected": -0.7464924454689026,
"logps/chosen": -10.95466136932373,
"logps/rejected": -44.5806999206543,
"loss": 0.5750457048416138,
"memory(GiB)": 46.38,
"nll_loss": 0.3861500322818756,
"rewards/accuracies": 0.90625,
"rewards/chosen": 0.1691206991672516,
"rewards/margins": 3.562136650085449,
"rewards/rejected": -3.3930160999298096,
"step": 245,
"train_speed(iter/s)": 0.005493
},
{
"epoch": 0.42031074803780233,
"grad_norm": 6.422461032867432,
"learning_rate": 0.00018634217048966637,
"logits/chosen": -0.7587261199951172,
"logits/rejected": -0.7620642185211182,
"logps/chosen": -6.3410139083862305,
"logps/rejected": -33.94182586669922,
"loss": 0.6545197367668152,
"memory(GiB)": 46.38,
"nll_loss": 0.30830273032188416,
"rewards/accuracies": 0.78125,
"rewards/chosen": -0.06438297033309937,
"rewards/margins": 2.2670321464538574,
"rewards/rejected": -2.3314151763916016,
"step": 246,
"train_speed(iter/s)": 0.005493
},
{
"epoch": 0.42201932831437877,
"grad_norm": 4.497966289520264,
"learning_rate": 0.00018619917205039407,
"logits/chosen": -0.7642217874526978,
"logits/rejected": -0.7698625326156616,
"logps/chosen": -6.284250259399414,
"logps/rejected": -46.83761215209961,
"loss": 0.4105835258960724,
"memory(GiB)": 46.38,
"nll_loss": 0.2564704418182373,
"rewards/accuracies": 0.96875,
"rewards/chosen": 0.22518175840377808,
"rewards/margins": 3.5758605003356934,
"rewards/rejected": -3.3506786823272705,
"step": 247,
"train_speed(iter/s)": 0.005493
},
{
"epoch": 0.4237279085909552,
"grad_norm": 3.6431024074554443,
"learning_rate": 0.00018605548436483906,
"logits/chosen": -0.7721464037895203,
"logits/rejected": -0.7743059396743774,
"logps/chosen": -8.004281044006348,
"logps/rejected": -34.3867073059082,
"loss": 0.6020833849906921,
"memory(GiB)": 46.38,
"nll_loss": 0.3395420014858246,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.2702520787715912,
"rewards/margins": 2.563030242919922,
"rewards/rejected": -2.292778491973877,
"step": 248,
"train_speed(iter/s)": 0.005492
},
{
"epoch": 0.42543648886753166,
"grad_norm": 2.3539841175079346,
"learning_rate": 0.0001859111085819242,
"logits/chosen": -0.7793521285057068,
"logits/rejected": -0.7824581265449524,
"logps/chosen": -12.44356918334961,
"logps/rejected": -37.551902770996094,
"loss": 0.569586455821991,
"memory(GiB)": 46.38,
"nll_loss": 0.4044492542743683,
"rewards/accuracies": 0.96875,
"rewards/chosen": 0.30807700753211975,
"rewards/margins": 2.927927017211914,
"rewards/rejected": -2.6198501586914062,
"step": 249,
"train_speed(iter/s)": 0.005492
},
{
"epoch": 0.42714506914410805,
"grad_norm": 3.378519058227539,
"learning_rate": 0.00018576604585607441,
"logits/chosen": -0.7945507168769836,
"logits/rejected": -0.7992746233940125,
"logps/chosen": -7.014500141143799,
"logps/rejected": -46.093238830566406,
"loss": 0.47747644782066345,
"memory(GiB)": 46.38,
"nll_loss": 0.2733898162841797,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.10495103895664215,
"rewards/margins": 3.2655720710754395,
"rewards/rejected": -3.160621166229248,
"step": 250,
"train_speed(iter/s)": 0.005491
},
{
"epoch": 0.4288536494206845,
"grad_norm": 4.231056213378906,
"learning_rate": 0.00018562029734720743,
"logits/chosen": -0.8051905632019043,
"logits/rejected": -0.8092507123947144,
"logps/chosen": -6.725405693054199,
"logps/rejected": -37.768829345703125,
"loss": 0.5110489726066589,
"memory(GiB)": 46.38,
"nll_loss": 0.31649249792099,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.19485878944396973,
"rewards/margins": 2.8023769855499268,
"rewards/rejected": -2.607518196105957,
"step": 251,
"train_speed(iter/s)": 0.005489
},
{
"epoch": 0.43056222969726093,
"grad_norm": 11.981834411621094,
"learning_rate": 0.00018547386422072438,
"logits/chosen": -0.7716567516326904,
"logits/rejected": -0.773201584815979,
"logps/chosen": -9.067695617675781,
"logps/rejected": -36.645240783691406,
"loss": 0.8504749536514282,
"memory(GiB)": 46.38,
"nll_loss": 0.514085054397583,
"rewards/accuracies": 0.84375,
"rewards/chosen": -0.07366381585597992,
"rewards/margins": 2.7288200855255127,
"rewards/rejected": -2.8024840354919434,
"step": 252,
"train_speed(iter/s)": 0.005488
},
{
"epoch": 0.4322708099738374,
"grad_norm": 8.43531608581543,
"learning_rate": 0.0001853267476475007,
"logits/chosen": -0.8169345855712891,
"logits/rejected": -0.8159929513931274,
"logps/chosen": -11.076251029968262,
"logps/rejected": -42.98237991333008,
"loss": 0.7847392559051514,
"memory(GiB)": 46.38,
"nll_loss": 0.5229505300521851,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.1810646504163742,
"rewards/margins": 3.4308125972747803,
"rewards/rejected": -3.2497482299804688,
"step": 253,
"train_speed(iter/s)": 0.005488
},
{
"epoch": 0.4339793902504138,
"grad_norm": 6.133362770080566,
"learning_rate": 0.0001851789488038765,
"logits/chosen": -0.7999134063720703,
"logits/rejected": -0.8003981709480286,
"logps/chosen": -6.108333587646484,
"logps/rejected": -41.47050857543945,
"loss": 0.6103618741035461,
"memory(GiB)": 46.38,
"nll_loss": 0.3681967258453369,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.1454550325870514,
"rewards/margins": 3.3938965797424316,
"rewards/rejected": -3.248441457748413,
"step": 254,
"train_speed(iter/s)": 0.005488
},
{
"epoch": 0.4356879705269902,
"grad_norm": 27.34607696533203,
"learning_rate": 0.0001850304688716475,
"logits/chosen": -0.7655246257781982,
"logits/rejected": -0.7673658132553101,
"logps/chosen": -9.124423027038574,
"logps/rejected": -40.40342330932617,
"loss": 0.9848135709762573,
"memory(GiB)": 46.38,
"nll_loss": 0.6617517471313477,
"rewards/accuracies": 0.84375,
"rewards/chosen": 0.10712965577840805,
"rewards/margins": 2.936744213104248,
"rewards/rejected": -2.8296148777008057,
"step": 255,
"train_speed(iter/s)": 0.005488
},
{
"epoch": 0.43739655080356665,
"grad_norm": 3.467927932739258,
"learning_rate": 0.00018488130903805523,
"logits/chosen": -0.7815067768096924,
"logits/rejected": -0.7830615639686584,
"logps/chosen": -6.11367654800415,
"logps/rejected": -43.792381286621094,
"loss": 0.3926101326942444,
"memory(GiB)": 46.38,
"nll_loss": 0.2346831113100052,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.3161233365535736,
"rewards/margins": 3.5978031158447266,
"rewards/rejected": -3.281679630279541,
"step": 256,
"train_speed(iter/s)": 0.005488
},
{
"epoch": 0.4391051310801431,
"grad_norm": 3.6716325283050537,
"learning_rate": 0.00018473147049577774,
"logits/chosen": -0.8119379878044128,
"logits/rejected": -0.8167931437492371,
"logps/chosen": -5.306201934814453,
"logps/rejected": -48.548152923583984,
"loss": 0.3491962254047394,
"memory(GiB)": 46.38,
"nll_loss": 0.214007169008255,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.19937750697135925,
"rewards/margins": 3.6415648460388184,
"rewards/rejected": -3.442187547683716,
"step": 257,
"train_speed(iter/s)": 0.005488
},
{
"epoch": 0.44081371135671954,
"grad_norm": 25.686939239501953,
"learning_rate": 0.00018458095444292004,
"logits/chosen": -0.825552761554718,
"logits/rejected": -0.8325546383857727,
"logps/chosen": -5.261894702911377,
"logps/rejected": -62.226497650146484,
"loss": 0.434018075466156,
"memory(GiB)": 46.38,
"nll_loss": 0.287321001291275,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.32799047231674194,
"rewards/margins": 4.790035247802734,
"rewards/rejected": -4.462045192718506,
"step": 258,
"train_speed(iter/s)": 0.005487
},
{
"epoch": 0.442522291633296,
"grad_norm": 6.754378318786621,
"learning_rate": 0.00018442976208300448,
"logits/chosen": -0.8270843029022217,
"logits/rejected": -0.8281224966049194,
"logps/chosen": -8.492132186889648,
"logps/rejected": -36.23853302001953,
"loss": 0.6711763739585876,
"memory(GiB)": 46.38,
"nll_loss": 0.3068382143974304,
"rewards/accuracies": 0.90625,
"rewards/chosen": 0.05488736927509308,
"rewards/margins": 2.777843952178955,
"rewards/rejected": -2.722956418991089,
"step": 259,
"train_speed(iter/s)": 0.005489
},
{
"epoch": 0.44423087190987237,
"grad_norm": 4.042886257171631,
"learning_rate": 0.00018427789462496113,
"logits/chosen": -0.8525445461273193,
"logits/rejected": -0.8591835498809814,
"logps/chosen": -8.231825828552246,
"logps/rejected": -47.20307540893555,
"loss": 0.8233700394630432,
"memory(GiB)": 46.38,
"nll_loss": 0.5154776573181152,
"rewards/accuracies": 0.8125,
"rewards/chosen": -0.00042735040187835693,
"rewards/margins": 3.4719269275665283,
"rewards/rejected": -3.4723546504974365,
"step": 260,
"train_speed(iter/s)": 0.005489
},
{
"epoch": 0.4459394521864488,
"grad_norm": 12.385782241821289,
"learning_rate": 0.00018412535328311814,
"logits/chosen": -0.822756290435791,
"logits/rejected": -0.8276916742324829,
"logps/chosen": -7.529094219207764,
"logps/rejected": -39.26826477050781,
"loss": 0.7842540740966797,
"memory(GiB)": 46.38,
"nll_loss": 0.41948723793029785,
"rewards/accuracies": 0.84375,
"rewards/chosen": -0.09604156017303467,
"rewards/margins": 2.7830724716186523,
"rewards/rejected": -2.8791141510009766,
"step": 261,
"train_speed(iter/s)": 0.005489
},
{
"epoch": 0.44764803246302526,
"grad_norm": 2.720581531524658,
"learning_rate": 0.00018397213927719199,
"logits/chosen": -0.7854418158531189,
"logits/rejected": -0.7872219085693359,
"logps/chosen": -7.754611968994141,
"logps/rejected": -47.40762710571289,
"loss": 0.36977341771125793,
"memory(GiB)": 46.38,
"nll_loss": 0.23527176678180695,
"rewards/accuracies": 0.96875,
"rewards/chosen": 0.1266416311264038,
"rewards/margins": 3.6666605472564697,
"rewards/rejected": -3.5400190353393555,
"step": 262,
"train_speed(iter/s)": 0.005489
},
{
"epoch": 0.4493566127396017,
"grad_norm": 3.862173557281494,
"learning_rate": 0.00018381825383227782,
"logits/chosen": -0.8271799087524414,
"logits/rejected": -0.831858217716217,
"logps/chosen": -6.855618476867676,
"logps/rejected": -46.51610565185547,
"loss": 0.4688463509082794,
"memory(GiB)": 46.38,
"nll_loss": 0.3772401511669159,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.2653267979621887,
"rewards/margins": 3.657702922821045,
"rewards/rejected": -3.392376184463501,
"step": 263,
"train_speed(iter/s)": 0.00549
},
{
"epoch": 0.45106519301617815,
"grad_norm": 2.1108744144439697,
"learning_rate": 0.00018366369817883954,
"logits/chosen": -0.8001513481140137,
"logits/rejected": -0.8060557842254639,
"logps/chosen": -5.957093715667725,
"logps/rejected": -49.00318908691406,
"loss": 0.42761629819869995,
"memory(GiB)": 46.38,
"nll_loss": 0.2863171100616455,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.46388381719589233,
"rewards/margins": 3.825634002685547,
"rewards/rejected": -3.3617501258850098,
"step": 264,
"train_speed(iter/s)": 0.005489
},
{
"epoch": 0.45277377329275453,
"grad_norm": 4.1208696365356445,
"learning_rate": 0.00018350847355270004,
"logits/chosen": -0.7904451489448547,
"logits/rejected": -0.7935886979103088,
"logps/chosen": -12.136712074279785,
"logps/rejected": -48.772483825683594,
"loss": 0.6188664436340332,
"memory(GiB)": 46.38,
"nll_loss": 0.4114742577075958,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.2880480885505676,
"rewards/margins": 3.680865526199341,
"rewards/rejected": -3.392817258834839,
"step": 265,
"train_speed(iter/s)": 0.005489
},
{
"epoch": 0.454482353569331,
"grad_norm": 5.501693248748779,
"learning_rate": 0.00018335258119503127,
"logits/chosen": -0.8123242259025574,
"logits/rejected": -0.8159137964248657,
"logps/chosen": -6.165188789367676,
"logps/rejected": -47.05010986328125,
"loss": 0.45226797461509705,
"memory(GiB)": 46.38,
"nll_loss": 0.35374370217323303,
"rewards/accuracies": 0.96875,
"rewards/chosen": 0.20915599167346954,
"rewards/margins": 3.658740997314453,
"rewards/rejected": -3.4495849609375,
"step": 266,
"train_speed(iter/s)": 0.005489
},
{
"epoch": 0.4561909338459074,
"grad_norm": 11.674309730529785,
"learning_rate": 0.00018319602235234442,
"logits/chosen": -0.7954471111297607,
"logits/rejected": -0.7979443073272705,
"logps/chosen": -9.799958229064941,
"logps/rejected": -51.7642822265625,
"loss": 0.7218329310417175,
"memory(GiB)": 46.38,
"nll_loss": 0.44642627239227295,
"rewards/accuracies": 0.90625,
"rewards/chosen": -0.12691040337085724,
"rewards/margins": 3.8264598846435547,
"rewards/rejected": -3.9533700942993164,
"step": 267,
"train_speed(iter/s)": 0.005489
},
{
"epoch": 0.45789951412248386,
"grad_norm": 21.236757278442383,
"learning_rate": 0.00018303879827647975,
"logits/chosen": -0.7900252938270569,
"logits/rejected": -0.7937359809875488,
"logps/chosen": -9.592187881469727,
"logps/rejected": -43.07557678222656,
"loss": 0.6332522034645081,
"memory(GiB)": 46.38,
"nll_loss": 0.5019268989562988,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.1493360996246338,
"rewards/margins": 3.395822763442993,
"rewards/rejected": -3.2464866638183594,
"step": 268,
"train_speed(iter/s)": 0.005489
},
{
"epoch": 0.4596080943990603,
"grad_norm": 13.447307586669922,
"learning_rate": 0.00018288091022459685,
"logits/chosen": -0.7903649210929871,
"logits/rejected": -0.792717695236206,
"logps/chosen": -8.880897521972656,
"logps/rejected": -48.42265701293945,
"loss": 1.129546046257019,
"memory(GiB)": 46.38,
"nll_loss": 0.9457821249961853,
"rewards/accuracies": 0.96875,
"rewards/chosen": -0.0744566023349762,
"rewards/margins": 3.6476986408233643,
"rewards/rejected": -3.7221555709838867,
"step": 269,
"train_speed(iter/s)": 0.005489
},
{
"epoch": 0.4613166746756367,
"grad_norm": 15.565564155578613,
"learning_rate": 0.00018272235945916436,
"logits/chosen": -0.7472554445266724,
"logits/rejected": -0.7549644708633423,
"logps/chosen": -13.44924259185791,
"logps/rejected": -50.098731994628906,
"loss": 1.1531708240509033,
"memory(GiB)": 46.38,
"nll_loss": 0.8039681911468506,
"rewards/accuracies": 0.875,
"rewards/chosen": -0.14791038632392883,
"rewards/margins": 3.323791980743408,
"rewards/rejected": -3.4717020988464355,
"step": 270,
"train_speed(iter/s)": 0.005489
},
{
"epoch": 0.46302525495221314,
"grad_norm": 12.007596015930176,
"learning_rate": 0.00018256314724794992,
"logits/chosen": -0.8131598234176636,
"logits/rejected": -0.8223381638526917,
"logps/chosen": -5.585975646972656,
"logps/rejected": -48.965389251708984,
"loss": 0.4150363802909851,
"memory(GiB)": 46.38,
"nll_loss": 0.2882520854473114,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.21873319149017334,
"rewards/margins": 3.403482675552368,
"rewards/rejected": -3.1847496032714844,
"step": 271,
"train_speed(iter/s)": 0.005488
},
{
"epoch": 0.4647338352287896,
"grad_norm": 16.59933853149414,
"learning_rate": 0.00018240327486401022,
"logits/chosen": -0.8030964136123657,
"logits/rejected": -0.8079983592033386,
"logps/chosen": -8.950094223022461,
"logps/rejected": -47.7308349609375,
"loss": 0.9466665387153625,
"memory(GiB)": 46.38,
"nll_loss": 0.6910676956176758,
"rewards/accuracies": 0.90625,
"rewards/chosen": -0.06938548386096954,
"rewards/margins": 3.2243666648864746,
"rewards/rejected": -3.293752431869507,
"step": 272,
"train_speed(iter/s)": 0.005487
},
{
"epoch": 0.466442415505366,
"grad_norm": 4.702775955200195,
"learning_rate": 0.00018224274358568052,
"logits/chosen": -0.8188191652297974,
"logits/rejected": -0.8212082982063293,
"logps/chosen": -7.591650485992432,
"logps/rejected": -37.239356994628906,
"loss": 0.5474280714988708,
"memory(GiB)": 46.38,
"nll_loss": 0.3606598973274231,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.29892435669898987,
"rewards/margins": 3.0769505500793457,
"rewards/rejected": -2.7780261039733887,
"step": 273,
"train_speed(iter/s)": 0.005487
},
{
"epoch": 0.46815099578194247,
"grad_norm": 27.876619338989258,
"learning_rate": 0.00018208155469656462,
"logits/chosen": -0.8266133666038513,
"logits/rejected": -0.8309741020202637,
"logps/chosen": -6.996228218078613,
"logps/rejected": -38.674766540527344,
"loss": 0.8267521858215332,
"memory(GiB)": 46.38,
"nll_loss": 0.5320640206336975,
"rewards/accuracies": 0.84375,
"rewards/chosen": 0.10675782710313797,
"rewards/margins": 2.87463116645813,
"rewards/rejected": -2.7678730487823486,
"step": 274,
"train_speed(iter/s)": 0.005488
},
{
"epoch": 0.46985957605851886,
"grad_norm": 7.991383075714111,
"learning_rate": 0.00018191970948552464,
"logits/chosen": -0.8153300285339355,
"logits/rejected": -0.8158446550369263,
"logps/chosen": -8.539220809936523,
"logps/rejected": -34.5740966796875,
"loss": 0.5116520524024963,
"memory(GiB)": 46.38,
"nll_loss": 0.2977459728717804,
"rewards/accuracies": 0.90625,
"rewards/chosen": 0.13776344060897827,
"rewards/margins": 2.662919282913208,
"rewards/rejected": -2.525156021118164,
"step": 275,
"train_speed(iter/s)": 0.005488
},
{
"epoch": 0.4715681563350953,
"grad_norm": 4.298219203948975,
"learning_rate": 0.00018175720924667056,
"logits/chosen": -0.853663444519043,
"logits/rejected": -0.8555605411529541,
"logps/chosen": -7.882385730743408,
"logps/rejected": -27.5541934967041,
"loss": 0.5915999412536621,
"memory(GiB)": 46.38,
"nll_loss": 0.284732460975647,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.12615913152694702,
"rewards/margins": 1.954941749572754,
"rewards/rejected": -1.8287824392318726,
"step": 276,
"train_speed(iter/s)": 0.005488
},
{
"epoch": 0.47327673661167174,
"grad_norm": 3.9946365356445312,
"learning_rate": 0.00018159405527934996,
"logits/chosen": -0.8487964868545532,
"logits/rejected": -0.8562285304069519,
"logps/chosen": -7.136427879333496,
"logps/rejected": -37.46531677246094,
"loss": 0.5510011315345764,
"memory(GiB)": 46.38,
"nll_loss": 0.2794538140296936,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.141952246427536,
"rewards/margins": 2.4826676845550537,
"rewards/rejected": -2.3407156467437744,
"step": 277,
"train_speed(iter/s)": 0.005488
},
{
"epoch": 0.4749853168882482,
"grad_norm": 1.9724056720733643,
"learning_rate": 0.0001814302488881376,
"logits/chosen": -0.8201677799224854,
"logits/rejected": -0.8276962041854858,
"logps/chosen": -4.926413536071777,
"logps/rejected": -38.361087799072266,
"loss": 0.45584461092948914,
"memory(GiB)": 46.38,
"nll_loss": 0.2575777769088745,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.190385103225708,
"rewards/margins": 2.507413387298584,
"rewards/rejected": -2.317028522491455,
"step": 278,
"train_speed(iter/s)": 0.005488
},
{
"epoch": 0.4766938971648246,
"grad_norm": 8.133130073547363,
"learning_rate": 0.00018126579138282503,
"logits/chosen": -0.8125935792922974,
"logits/rejected": -0.8118517398834229,
"logps/chosen": -9.689276695251465,
"logps/rejected": -29.489994049072266,
"loss": 0.7013036608695984,
"memory(GiB)": 46.38,
"nll_loss": 0.3926777243614197,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.06979987025260925,
"rewards/margins": 2.248946189880371,
"rewards/rejected": -2.1791462898254395,
"step": 279,
"train_speed(iter/s)": 0.005488
},
{
"epoch": 0.478402477441401,
"grad_norm": 5.878256797790527,
"learning_rate": 0.00018110068407841009,
"logits/chosen": -0.8344768285751343,
"logits/rejected": -0.8355271816253662,
"logps/chosen": -7.216890335083008,
"logps/rejected": -31.038660049438477,
"loss": 0.6482636332511902,
"memory(GiB)": 46.38,
"nll_loss": 0.3379790782928467,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.15157388150691986,
"rewards/margins": 2.1786890029907227,
"rewards/rejected": -2.0271151065826416,
"step": 280,
"train_speed(iter/s)": 0.005489
},
{
"epoch": 0.48011105771797746,
"grad_norm": 3.594700336456299,
"learning_rate": 0.00018093492829508636,
"logits/chosen": -0.809922456741333,
"logits/rejected": -0.8155569434165955,
"logps/chosen": -8.301997184753418,
"logps/rejected": -35.9427604675293,
"loss": 0.7471737265586853,
"memory(GiB)": 46.38,
"nll_loss": 0.412964791059494,
"rewards/accuracies": 0.84375,
"rewards/chosen": 0.21606266498565674,
"rewards/margins": 2.184842824935913,
"rewards/rejected": -1.9687800407409668,
"step": 281,
"train_speed(iter/s)": 0.005489
},
{
"epoch": 0.4818196379945539,
"grad_norm": 4.715336799621582,
"learning_rate": 0.00018076852535823268,
"logits/chosen": -0.8024042844772339,
"logits/rejected": -0.8047822713851929,
"logps/chosen": -9.50023365020752,
"logps/rejected": -26.15119743347168,
"loss": 0.887703001499176,
"memory(GiB)": 46.38,
"nll_loss": 0.4939606785774231,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.09452123939990997,
"rewards/margins": 1.60733962059021,
"rewards/rejected": -1.512818455696106,
"step": 282,
"train_speed(iter/s)": 0.005489
},
{
"epoch": 0.48352821827113035,
"grad_norm": 2.6357319355010986,
"learning_rate": 0.0001806014765984025,
"logits/chosen": -0.7931514978408813,
"logits/rejected": -0.7975669503211975,
"logps/chosen": -4.370926856994629,
"logps/rejected": -35.80842590332031,
"loss": 0.4094904065132141,
"memory(GiB)": 46.38,
"nll_loss": 0.17323070764541626,
"rewards/accuracies": 0.90625,
"rewards/chosen": 0.25759178400039673,
"rewards/margins": 2.2846627235412598,
"rewards/rejected": -2.027071237564087,
"step": 283,
"train_speed(iter/s)": 0.005489
},
{
"epoch": 0.48523679854770674,
"grad_norm": 4.521765232086182,
"learning_rate": 0.00018043378335131326,
"logits/chosen": -0.8225452899932861,
"logits/rejected": -0.8211522698402405,
"logps/chosen": -7.510035037994385,
"logps/rejected": -36.8507194519043,
"loss": 0.5709434747695923,
"memory(GiB)": 46.38,
"nll_loss": 0.35384440422058105,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.24606043100357056,
"rewards/margins": 2.5631608963012695,
"rewards/rejected": -2.3171002864837646,
"step": 284,
"train_speed(iter/s)": 0.005488
},
{
"epoch": 0.4869453788242832,
"grad_norm": 2.36458683013916,
"learning_rate": 0.00018026544695783566,
"logits/chosen": -0.8055735230445862,
"logits/rejected": -0.8072599768638611,
"logps/chosen": -8.788959503173828,
"logps/rejected": -40.345008850097656,
"loss": 0.5267823338508606,
"memory(GiB)": 46.38,
"nll_loss": 0.34875571727752686,
"rewards/accuracies": 0.96875,
"rewards/chosen": 0.25422000885009766,
"rewards/margins": 2.772775650024414,
"rewards/rejected": -2.5185558795928955,
"step": 285,
"train_speed(iter/s)": 0.005488
},
{
"epoch": 0.4886539591008596,
"grad_norm": 10.764819145202637,
"learning_rate": 0.00018009646876398307,
"logits/chosen": -0.8059338331222534,
"logits/rejected": -0.8106356263160706,
"logps/chosen": -4.930308818817139,
"logps/rejected": -31.040836334228516,
"loss": 0.5658331513404846,
"memory(GiB)": 46.38,
"nll_loss": 0.28465500473976135,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.1854298710823059,
"rewards/margins": 1.930139422416687,
"rewards/rejected": -1.7447094917297363,
"step": 286,
"train_speed(iter/s)": 0.005487
},
{
"epoch": 0.49036253937743607,
"grad_norm": 3.613628387451172,
"learning_rate": 0.0001799268501209006,
"logits/chosen": -0.7612501382827759,
"logits/rejected": -0.7627686858177185,
"logps/chosen": -10.456869125366211,
"logps/rejected": -28.227718353271484,
"loss": 0.8326478004455566,
"memory(GiB)": 46.38,
"nll_loss": 0.4999573230743408,
"rewards/accuracies": 0.90625,
"rewards/chosen": 0.05842627212405205,
"rewards/margins": 1.9171324968338013,
"rewards/rejected": -1.8587062358856201,
"step": 287,
"train_speed(iter/s)": 0.005487
},
{
"epoch": 0.4920711196540125,
"grad_norm": 4.662235736846924,
"learning_rate": 0.0001797565923848544,
"logits/chosen": -0.8021095991134644,
"logits/rejected": -0.8046351671218872,
"logps/chosen": -6.780048370361328,
"logps/rejected": -31.340526580810547,
"loss": 0.5166000723838806,
"memory(GiB)": 46.38,
"nll_loss": 0.29529324173927307,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.24387100338935852,
"rewards/margins": 2.386127233505249,
"rewards/rejected": -2.142256259918213,
"step": 288,
"train_speed(iter/s)": 0.005487
},
{
"epoch": 0.4937796999305889,
"grad_norm": 3.747556447982788,
"learning_rate": 0.00017958569691722077,
"logits/chosen": -0.7904728055000305,
"logits/rejected": -0.7943806052207947,
"logps/chosen": -4.052952766418457,
"logps/rejected": -39.81676483154297,
"loss": 0.444693922996521,
"memory(GiB)": 46.38,
"nll_loss": 0.26461470127105713,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.24267469346523285,
"rewards/margins": 3.1456563472747803,
"rewards/rejected": -2.9029815196990967,
"step": 289,
"train_speed(iter/s)": 0.005487
},
{
"epoch": 0.49548828020716534,
"grad_norm": 3.8240482807159424,
"learning_rate": 0.00017941416508447536,
"logits/chosen": -0.8258907794952393,
"logits/rejected": -0.8271006345748901,
"logps/chosen": -12.335704803466797,
"logps/rejected": -35.24673843383789,
"loss": 0.8288266062736511,
"memory(GiB)": 46.38,
"nll_loss": 0.5496087670326233,
"rewards/accuracies": 0.90625,
"rewards/chosen": 0.26559069752693176,
"rewards/margins": 2.4179635047912598,
"rewards/rejected": -2.1523728370666504,
"step": 290,
"train_speed(iter/s)": 0.005487
},
{
"epoch": 0.4971968604837418,
"grad_norm": 5.618929386138916,
"learning_rate": 0.0001792419982581821,
"logits/chosen": -0.8527386784553528,
"logits/rejected": -0.8554395437240601,
"logps/chosen": -4.423219203948975,
"logps/rejected": -37.118656158447266,
"loss": 0.4001955986022949,
"memory(GiB)": 46.38,
"nll_loss": 0.2208787500858307,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.2664373517036438,
"rewards/margins": 2.81235933303833,
"rewards/rejected": -2.545922040939331,
"step": 291,
"train_speed(iter/s)": 0.005487
},
{
"epoch": 0.49890544076031823,
"grad_norm": 4.9184112548828125,
"learning_rate": 0.00017906919781498235,
"logits/chosen": -0.8180443048477173,
"logits/rejected": -0.8243182897567749,
"logps/chosen": -7.195798873901367,
"logps/rejected": -46.805763244628906,
"loss": 0.50282222032547,
"memory(GiB)": 46.38,
"nll_loss": 0.24749858677387238,
"rewards/accuracies": 0.90625,
"rewards/chosen": 0.17263692617416382,
"rewards/margins": 3.1018624305725098,
"rewards/rejected": -2.929225444793701,
"step": 292,
"train_speed(iter/s)": 0.005487
},
{
"epoch": 0.5006140210368947,
"grad_norm": 6.550334930419922,
"learning_rate": 0.00017889576513658385,
"logits/chosen": -0.8828959465026855,
"logits/rejected": -0.8903377652168274,
"logps/chosen": -5.666334629058838,
"logps/rejected": -41.20561218261719,
"loss": 0.5666110515594482,
"memory(GiB)": 46.38,
"nll_loss": 0.27025288343429565,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.14388155937194824,
"rewards/margins": 2.9238851070404053,
"rewards/rejected": -2.780003547668457,
"step": 293,
"train_speed(iter/s)": 0.005487
},
{
"epoch": 0.5023226013134711,
"grad_norm": 5.214411735534668,
"learning_rate": 0.0001787217016097497,
"logits/chosen": -0.8843887448310852,
"logits/rejected": -0.8880648612976074,
"logps/chosen": -8.593646049499512,
"logps/rejected": -31.845436096191406,
"loss": 0.7616337537765503,
"memory(GiB)": 46.38,
"nll_loss": 0.4269709587097168,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.03095342591404915,
"rewards/margins": 2.152078628540039,
"rewards/rejected": -2.1211252212524414,
"step": 294,
"train_speed(iter/s)": 0.005488
},
{
"epoch": 0.5040311815900476,
"grad_norm": 3.419295310974121,
"learning_rate": 0.00017854700862628717,
"logits/chosen": -0.8697606325149536,
"logits/rejected": -0.8711093068122864,
"logps/chosen": -12.32712459564209,
"logps/rejected": -35.99604415893555,
"loss": 0.7168628573417664,
"memory(GiB)": 46.38,
"nll_loss": 0.4990694522857666,
"rewards/accuracies": 0.96875,
"rewards/chosen": -0.00020820647478103638,
"rewards/margins": 2.4814581871032715,
"rewards/rejected": -2.481666088104248,
"step": 295,
"train_speed(iter/s)": 0.005488
},
{
"epoch": 0.505739761866624,
"grad_norm": 5.47044038772583,
"learning_rate": 0.00017837168758303673,
"logits/chosen": -0.9019865989685059,
"logits/rejected": -0.9105886220932007,
"logps/chosen": -6.227141380310059,
"logps/rejected": -53.5411376953125,
"loss": 0.4358929395675659,
"memory(GiB)": 46.38,
"nll_loss": 0.2536502182483673,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.18560552597045898,
"rewards/margins": 4.006980895996094,
"rewards/rejected": -3.8213753700256348,
"step": 296,
"train_speed(iter/s)": 0.005488
},
{
"epoch": 0.5074483421432003,
"grad_norm": 2.2059149742126465,
"learning_rate": 0.00017819573988186077,
"logits/chosen": -0.8752774000167847,
"logits/rejected": -0.8806784749031067,
"logps/chosen": -6.102680206298828,
"logps/rejected": -40.7698860168457,
"loss": 0.5294958353042603,
"memory(GiB)": 46.38,
"nll_loss": 0.32509148120880127,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.20541568100452423,
"rewards/margins": 2.9198334217071533,
"rewards/rejected": -2.7144179344177246,
"step": 297,
"train_speed(iter/s)": 0.005488
},
{
"epoch": 0.5091569224197768,
"grad_norm": 1.8315078020095825,
"learning_rate": 0.00017801916692963246,
"logits/chosen": -0.888721764087677,
"logits/rejected": -0.8927589654922485,
"logps/chosen": -5.959261417388916,
"logps/rejected": -39.12718963623047,
"loss": 0.41302210092544556,
"memory(GiB)": 46.38,
"nll_loss": 0.25391918420791626,
"rewards/accuracies": 0.96875,
"rewards/chosen": 0.36076462268829346,
"rewards/margins": 2.8598427772521973,
"rewards/rejected": -2.4990782737731934,
"step": 298,
"train_speed(iter/s)": 0.005489
},
{
"epoch": 0.5108655026963532,
"grad_norm": 2.749384641647339,
"learning_rate": 0.00017784197013822435,
"logits/chosen": -0.8662399053573608,
"logits/rejected": -0.8707250356674194,
"logps/chosen": -9.147662162780762,
"logps/rejected": -45.20575714111328,
"loss": 0.6315680146217346,
"memory(GiB)": 46.38,
"nll_loss": 0.45470985770225525,
"rewards/accuracies": 0.96875,
"rewards/chosen": 0.07495459169149399,
"rewards/margins": 3.035630226135254,
"rewards/rejected": -2.9606757164001465,
"step": 299,
"train_speed(iter/s)": 0.005489
},
{
"epoch": 0.5125740829729297,
"grad_norm": 8.072540283203125,
"learning_rate": 0.0001776641509244973,
"logits/chosen": -0.8409525156021118,
"logits/rejected": -0.8496344685554504,
"logps/chosen": -6.282418251037598,
"logps/rejected": -41.63984680175781,
"loss": 0.871893584728241,
"memory(GiB)": 46.38,
"nll_loss": 0.603092610836029,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.04116540029644966,
"rewards/margins": 2.8330185413360596,
"rewards/rejected": -2.7918529510498047,
"step": 300,
"train_speed(iter/s)": 0.005488
},
{
"epoch": 0.5125740829729297,
"eval_logits/chosen": -0.8405543565750122,
"eval_logits/rejected": -0.8445731401443481,
"eval_logps/chosen": -8.006686210632324,
"eval_logps/rejected": -40.67301559448242,
"eval_loss": 0.7707608342170715,
"eval_nll_loss": 0.5364512801170349,
"eval_rewards/accuracies": 0.8994709253311157,
"eval_rewards/chosen": 0.06882528215646744,
"eval_rewards/margins": 2.7935357093811035,
"eval_rewards/rejected": -2.724710702896118,
"eval_runtime": 442.8747,
"eval_samples_per_second": 0.427,
"eval_steps_per_second": 0.427,
"step": 300
},
{
"epoch": 0.5142826632495061,
"grad_norm": 11.069442749023438,
"learning_rate": 0.000177485710710289,
"logits/chosen": -0.8602814674377441,
"logits/rejected": -0.8637278079986572,
"logps/chosen": -7.823677062988281,
"logps/rejected": -39.174312591552734,
"loss": 0.45352113246917725,
"memory(GiB)": 46.38,
"nll_loss": 0.32754451036453247,
"rewards/accuracies": 0.96875,
"rewards/chosen": 0.15461236238479614,
"rewards/margins": 3.001373291015625,
"rewards/rejected": -2.8467607498168945,
"step": 301,
"train_speed(iter/s)": 0.005443
},
{
"epoch": 0.5159912435260825,
"grad_norm": 4.37824821472168,
"learning_rate": 0.0001773066509224026,
"logits/chosen": -0.7942736744880676,
"logits/rejected": -0.7966884970664978,
"logps/chosen": -7.395168304443359,
"logps/rejected": -37.037654876708984,
"loss": 0.6269878149032593,
"memory(GiB)": 46.38,
"nll_loss": 0.4148014783859253,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.27507781982421875,
"rewards/margins": 2.9940710067749023,
"rewards/rejected": -2.7189929485321045,
"step": 302,
"train_speed(iter/s)": 0.005443
},
{
"epoch": 0.517699823802659,
"grad_norm": 1.2747763395309448,
"learning_rate": 0.0001771269729925955,
"logits/chosen": -0.8845440745353699,
"logits/rejected": -0.8931821584701538,
"logps/chosen": -4.624814510345459,
"logps/rejected": -54.01844787597656,
"loss": 0.3171394467353821,
"memory(GiB)": 46.38,
"nll_loss": 0.2531016170978546,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.3055804371833801,
"rewards/margins": 4.609305381774902,
"rewards/rejected": -4.303724765777588,
"step": 303,
"train_speed(iter/s)": 0.005444
},
{
"epoch": 0.5194084040792354,
"grad_norm": 19.4792423248291,
"learning_rate": 0.00017694667835756758,
"logits/chosen": -0.8769544363021851,
"logits/rejected": -0.8785020112991333,
"logps/chosen": -13.249614715576172,
"logps/rejected": -43.8223991394043,
"loss": 1.2327057123184204,
"memory(GiB)": 46.38,
"nll_loss": 0.8601534962654114,
"rewards/accuracies": 0.875,
"rewards/chosen": -0.30870580673217773,
"rewards/margins": 2.7113828659057617,
"rewards/rejected": -3.0200884342193604,
"step": 304,
"train_speed(iter/s)": 0.005444
},
{
"epoch": 0.5211169843558119,
"grad_norm": 9.179790496826172,
"learning_rate": 0.0001767657684589499,
"logits/chosen": -0.8855112195014954,
"logits/rejected": -0.8912838101387024,
"logps/chosen": -7.211820602416992,
"logps/rejected": -50.378562927246094,
"loss": 0.7304961085319519,
"memory(GiB)": 46.38,
"nll_loss": 0.42998042702674866,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.09179924428462982,
"rewards/margins": 4.0141072273254395,
"rewards/rejected": -3.9223079681396484,
"step": 305,
"train_speed(iter/s)": 0.005444
},
{
"epoch": 0.5228255646323883,
"grad_norm": 1.2901352643966675,
"learning_rate": 0.00017658424474329326,
"logits/chosen": -0.8675682544708252,
"logits/rejected": -0.8787212371826172,
"logps/chosen": -6.3633317947387695,
"logps/rejected": -68.60183715820312,
"loss": 0.31616559624671936,
"memory(GiB)": 46.38,
"nll_loss": 0.265287309885025,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.21000903844833374,
"rewards/margins": 5.580310344696045,
"rewards/rejected": -5.370301723480225,
"step": 306,
"train_speed(iter/s)": 0.005444
},
{
"epoch": 0.5245341449089647,
"grad_norm": 4.6658782958984375,
"learning_rate": 0.00017640210866205639,
"logits/chosen": -0.906684935092926,
"logits/rejected": -0.9144970774650574,
"logps/chosen": -9.675024032592773,
"logps/rejected": -51.09449768066406,
"loss": 0.6057628989219666,
"memory(GiB)": 46.38,
"nll_loss": 0.4204673767089844,
"rewards/accuracies": 0.9375,
"rewards/chosen": -0.10616739839315414,
"rewards/margins": 3.975714921951294,
"rewards/rejected": -4.081882476806641,
"step": 307,
"train_speed(iter/s)": 0.005445
},
{
"epoch": 0.5262427251855412,
"grad_norm": 5.465089321136475,
"learning_rate": 0.00017621936167159458,
"logits/chosen": -0.9267672300338745,
"logits/rejected": -0.9362570643424988,
"logps/chosen": -7.424238681793213,
"logps/rejected": -65.96898651123047,
"loss": 0.47528597712516785,
"memory(GiB)": 46.38,
"nll_loss": 0.3133973479270935,
"rewards/accuracies": 0.90625,
"rewards/chosen": -0.09580647945404053,
"rewards/margins": 5.268470287322998,
"rewards/rejected": -5.364277362823486,
"step": 308,
"train_speed(iter/s)": 0.005445
},
{
"epoch": 0.5279513054621175,
"grad_norm": 5.624989986419678,
"learning_rate": 0.00017603600523314787,
"logits/chosen": -0.898685097694397,
"logits/rejected": -0.8996263146400452,
"logps/chosen": -12.03923225402832,
"logps/rejected": -41.64332962036133,
"loss": 0.7952063083648682,
"memory(GiB)": 46.38,
"nll_loss": 0.4172392785549164,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.023442525416612625,
"rewards/margins": 3.3135008811950684,
"rewards/rejected": -3.2900586128234863,
"step": 309,
"train_speed(iter/s)": 0.005446
},
{
"epoch": 0.529659885738694,
"grad_norm": 3.880650043487549,
"learning_rate": 0.0001758520408128295,
"logits/chosen": -0.8696607947349548,
"logits/rejected": -0.8726595640182495,
"logps/chosen": -7.42938232421875,
"logps/rejected": -56.99799346923828,
"loss": 0.5451213717460632,
"memory(GiB)": 46.38,
"nll_loss": 0.3175729513168335,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.16648581624031067,
"rewards/margins": 4.477063179016113,
"rewards/rejected": -4.310576915740967,
"step": 310,
"train_speed(iter/s)": 0.005445
},
{
"epoch": 0.5313684660152704,
"grad_norm": 2.883660316467285,
"learning_rate": 0.00017566746988161402,
"logits/chosen": -0.8406087756156921,
"logits/rejected": -0.8471619486808777,
"logps/chosen": -9.634123802185059,
"logps/rejected": -38.94046401977539,
"loss": 0.6529473662376404,
"memory(GiB)": 46.38,
"nll_loss": 0.38416606187820435,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.13221141695976257,
"rewards/margins": 3.1708903312683105,
"rewards/rejected": -3.0386788845062256,
"step": 311,
"train_speed(iter/s)": 0.005446
},
{
"epoch": 0.5330770462918468,
"grad_norm": 11.171285629272461,
"learning_rate": 0.00017548229391532572,
"logits/chosen": -0.8072686791419983,
"logits/rejected": -0.8102389574050903,
"logps/chosen": -6.779449462890625,
"logps/rejected": -49.09239959716797,
"loss": 0.5393321514129639,
"memory(GiB)": 46.38,
"nll_loss": 0.3658963441848755,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.2095126211643219,
"rewards/margins": 3.693910598754883,
"rewards/rejected": -3.4843978881835938,
"step": 312,
"train_speed(iter/s)": 0.005446
},
{
"epoch": 0.5347856265684233,
"grad_norm": 1.954391360282898,
"learning_rate": 0.00017529651439462664,
"logits/chosen": -0.7809416055679321,
"logits/rejected": -0.7857435345649719,
"logps/chosen": -6.740390777587891,
"logps/rejected": -48.86231994628906,
"loss": 0.36391139030456543,
"memory(GiB)": 46.38,
"nll_loss": 0.2839314639568329,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.31254059076309204,
"rewards/margins": 3.944000482559204,
"rewards/rejected": -3.6314597129821777,
"step": 313,
"train_speed(iter/s)": 0.005446
},
{
"epoch": 0.5364942068449997,
"grad_norm": 6.087454319000244,
"learning_rate": 0.00017511013280500494,
"logits/chosen": -0.7839592695236206,
"logits/rejected": -0.7883790731430054,
"logps/chosen": -5.397429943084717,
"logps/rejected": -38.226078033447266,
"loss": 0.47547078132629395,
"memory(GiB)": 46.38,
"nll_loss": 0.2724950909614563,
"rewards/accuracies": 0.90625,
"rewards/chosen": 0.16703476011753082,
"rewards/margins": 2.7412147521972656,
"rewards/rejected": -2.5741801261901855,
"step": 314,
"train_speed(iter/s)": 0.005445
},
{
"epoch": 0.5382027871215762,
"grad_norm": 7.710384845733643,
"learning_rate": 0.0001749231506367628,
"logits/chosen": -0.7206589579582214,
"logits/rejected": -0.7282582521438599,
"logps/chosen": -8.630600929260254,
"logps/rejected": -40.66322708129883,
"loss": 0.7258225679397583,
"memory(GiB)": 46.38,
"nll_loss": 0.4553995132446289,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.14358378946781158,
"rewards/margins": 2.626176595687866,
"rewards/rejected": -2.482593059539795,
"step": 315,
"train_speed(iter/s)": 0.005446
},
{
"epoch": 0.5399113673981526,
"grad_norm": 1.8784159421920776,
"learning_rate": 0.0001747355693850047,
"logits/chosen": -0.7431631684303284,
"logits/rejected": -0.748499870300293,
"logps/chosen": -11.859859466552734,
"logps/rejected": -43.0447883605957,
"loss": 0.6120511293411255,
"memory(GiB)": 46.38,
"nll_loss": 0.4628870189189911,
"rewards/accuracies": 0.96875,
"rewards/chosen": 0.1693616509437561,
"rewards/margins": 2.6937308311462402,
"rewards/rejected": -2.524369239807129,
"step": 316,
"train_speed(iter/s)": 0.005445
},
{
"epoch": 0.541619947674729,
"grad_norm": 2.4822375774383545,
"learning_rate": 0.00017454739054962527,
"logits/chosen": -0.7296395301818848,
"logits/rejected": -0.7350925207138062,
"logps/chosen": -7.4225616455078125,
"logps/rejected": -44.191368103027344,
"loss": 0.5170390605926514,
"memory(GiB)": 46.38,
"nll_loss": 0.3234650194644928,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.14995595812797546,
"rewards/margins": 3.103259563446045,
"rewards/rejected": -2.953303813934326,
"step": 317,
"train_speed(iter/s)": 0.005445
},
{
"epoch": 0.5433285279513055,
"grad_norm": 1.8158119916915894,
"learning_rate": 0.00017435861563529746,
"logits/chosen": -0.7801295518875122,
"logits/rejected": -0.7813860177993774,
"logps/chosen": -5.427134990692139,
"logps/rejected": -36.239803314208984,
"loss": 0.36503538489341736,
"memory(GiB)": 46.38,
"nll_loss": 0.19436712563037872,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.22437262535095215,
"rewards/margins": 2.704486131668091,
"rewards/rejected": -2.4801137447357178,
"step": 318,
"train_speed(iter/s)": 0.005446
},
{
"epoch": 0.5450371082278819,
"grad_norm": 1.2651731967926025,
"learning_rate": 0.00017416924615146055,
"logits/chosen": -0.7636649012565613,
"logits/rejected": -0.7674313187599182,
"logps/chosen": -4.830596923828125,
"logps/rejected": -49.42289733886719,
"loss": 0.2704404294490814,
"memory(GiB)": 46.38,
"nll_loss": 0.17981436848640442,
"rewards/accuracies": 0.96875,
"rewards/chosen": 0.2880362272262573,
"rewards/margins": 3.9220433235168457,
"rewards/rejected": -3.634007215499878,
"step": 319,
"train_speed(iter/s)": 0.005446
},
{
"epoch": 0.5467456885044584,
"grad_norm": 2.813702344894409,
"learning_rate": 0.0001739792836123078,
"logits/chosen": -0.763135552406311,
"logits/rejected": -0.7641803622245789,
"logps/chosen": -8.197504043579102,
"logps/rejected": -46.546730041503906,
"loss": 0.43457722663879395,
"memory(GiB)": 46.38,
"nll_loss": 0.3029811978340149,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.21454845368862152,
"rewards/margins": 3.952043056488037,
"rewards/rejected": -3.737494707107544,
"step": 320,
"train_speed(iter/s)": 0.005446
},
{
"epoch": 0.5484542687810348,
"grad_norm": 10.072509765625,
"learning_rate": 0.00017378872953677463,
"logits/chosen": -0.7955141663551331,
"logits/rejected": -0.8014116883277893,
"logps/chosen": -6.334041595458984,
"logps/rejected": -47.14308166503906,
"loss": 0.4273318648338318,
"memory(GiB)": 46.38,
"nll_loss": 0.26563501358032227,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.30760833621025085,
"rewards/margins": 3.725619316101074,
"rewards/rejected": -3.418011426925659,
"step": 321,
"train_speed(iter/s)": 0.005446
},
{
"epoch": 0.5501628490576111,
"grad_norm": 11.081689834594727,
"learning_rate": 0.00017359758544852635,
"logits/chosen": -0.8159039616584778,
"logits/rejected": -0.8194667100906372,
"logps/chosen": -9.277294158935547,
"logps/rejected": -51.40448760986328,
"loss": 0.8425000309944153,
"memory(GiB)": 46.38,
"nll_loss": 0.717254102230072,
"rewards/accuracies": 0.96875,
"rewards/chosen": 0.03732386231422424,
"rewards/margins": 4.070914268493652,
"rewards/rejected": -4.033590316772461,
"step": 322,
"train_speed(iter/s)": 0.005447
},
{
"epoch": 0.5518714293341876,
"grad_norm": 2.0417747497558594,
"learning_rate": 0.00017340585287594604,
"logits/chosen": -0.8340936899185181,
"logits/rejected": -0.8355550169944763,
"logps/chosen": -8.740560531616211,
"logps/rejected": -48.48387908935547,
"loss": 0.5082376599311829,
"memory(GiB)": 46.38,
"nll_loss": 0.3596939742565155,
"rewards/accuracies": 0.96875,
"rewards/chosen": 0.3152270019054413,
"rewards/margins": 3.8847768306732178,
"rewards/rejected": -3.569550037384033,
"step": 323,
"train_speed(iter/s)": 0.005447
},
{
"epoch": 0.553580009610764,
"grad_norm": 11.896222114562988,
"learning_rate": 0.00017321353335212215,
"logits/chosen": -0.8562039732933044,
"logits/rejected": -0.8574480414390564,
"logps/chosen": -9.903059005737305,
"logps/rejected": -48.68834686279297,
"loss": 0.5927642583847046,
"memory(GiB)": 46.38,
"nll_loss": 0.3851415812969208,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.1212349608540535,
"rewards/margins": 3.81803560256958,
"rewards/rejected": -3.696800708770752,
"step": 324,
"train_speed(iter/s)": 0.005447
},
{
"epoch": 0.5552885898873405,
"grad_norm": 3.4423718452453613,
"learning_rate": 0.00017302062841483655,
"logits/chosen": -0.8601418733596802,
"logits/rejected": -0.8596406579017639,
"logps/chosen": -9.926023483276367,
"logps/rejected": -53.83884811401367,
"loss": 0.45005056262016296,
"memory(GiB)": 46.38,
"nll_loss": 0.34139543771743774,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.20918819308280945,
"rewards/margins": 4.317967891693115,
"rewards/rejected": -4.108779430389404,
"step": 325,
"train_speed(iter/s)": 0.005447
},
{
"epoch": 0.5569971701639169,
"grad_norm": 1.2915583848953247,
"learning_rate": 0.00017282713960655195,
"logits/chosen": -0.9310311079025269,
"logits/rejected": -0.9432608485221863,
"logps/chosen": -3.527310848236084,
"logps/rejected": -56.88557434082031,
"loss": 0.257373183965683,
"memory(GiB)": 46.38,
"nll_loss": 0.18794924020767212,
"rewards/accuracies": 0.96875,
"rewards/chosen": 0.31664133071899414,
"rewards/margins": 4.63478422164917,
"rewards/rejected": -4.318142890930176,
"step": 326,
"train_speed(iter/s)": 0.005447
},
{
"epoch": 0.5587057504404933,
"grad_norm": 12.496362686157227,
"learning_rate": 0.00017263306847439968,
"logits/chosen": -0.8998693227767944,
"logits/rejected": -0.9072844386100769,
"logps/chosen": -7.473057270050049,
"logps/rejected": -62.43585968017578,
"loss": 0.4956499934196472,
"memory(GiB)": 46.38,
"nll_loss": 0.36785978078842163,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.2565673589706421,
"rewards/margins": 4.963648796081543,
"rewards/rejected": -4.707081317901611,
"step": 327,
"train_speed(iter/s)": 0.005447
},
{
"epoch": 0.5604143307170698,
"grad_norm": 4.157985210418701,
"learning_rate": 0.0001724384165701674,
"logits/chosen": -0.9274346828460693,
"logits/rejected": -0.9325964450836182,
"logps/chosen": -7.024556636810303,
"logps/rejected": -62.318359375,
"loss": 0.35737261176109314,
"memory(GiB)": 46.38,
"nll_loss": 0.25133123993873596,
"rewards/accuracies": 0.96875,
"rewards/chosen": 0.11644118279218674,
"rewards/margins": 4.924075126647949,
"rewards/rejected": -4.807634353637695,
"step": 328,
"train_speed(iter/s)": 0.005447
},
{
"epoch": 0.5621229109936462,
"grad_norm": 4.035698413848877,
"learning_rate": 0.00017224318545028649,
"logits/chosen": -0.9244407415390015,
"logits/rejected": -0.9326272010803223,
"logps/chosen": -6.016265392303467,
"logps/rejected": -56.14576721191406,
"loss": 0.3880583643913269,
"memory(GiB)": 46.38,
"nll_loss": 0.3103344738483429,
"rewards/accuracies": 0.96875,
"rewards/chosen": 0.07886901497840881,
"rewards/margins": 4.746619701385498,
"rewards/rejected": -4.667750358581543,
"step": 329,
"train_speed(iter/s)": 0.005448
},
{
"epoch": 0.5638314912702227,
"grad_norm": 9.743223190307617,
"learning_rate": 0.0001720473766758198,
"logits/chosen": -0.926537275314331,
"logits/rejected": -0.9304601550102234,
"logps/chosen": -13.121172904968262,
"logps/rejected": -58.38237380981445,
"loss": 0.7646811008453369,
"memory(GiB)": 46.38,
"nll_loss": 0.5820285677909851,
"rewards/accuracies": 0.9375,
"rewards/chosen": -0.09494726359844208,
"rewards/margins": 4.842239856719971,
"rewards/rejected": -4.9371867179870605,
"step": 330,
"train_speed(iter/s)": 0.005448
},
{
"epoch": 0.5655400715467991,
"grad_norm": 18.880859375,
"learning_rate": 0.00017185099181244907,
"logits/chosen": -0.9021615386009216,
"logits/rejected": -0.9024704694747925,
"logps/chosen": -9.637939453125,
"logps/rejected": -58.98625183105469,
"loss": 0.739081859588623,
"memory(GiB)": 46.38,
"nll_loss": 0.6550078392028809,
"rewards/accuracies": 0.96875,
"rewards/chosen": -0.00911126658320427,
"rewards/margins": 5.053913116455078,
"rewards/rejected": -5.063024997711182,
"step": 331,
"train_speed(iter/s)": 0.005448
},
{
"epoch": 0.5672486518233755,
"grad_norm": 2.728888750076294,
"learning_rate": 0.00017165403243046248,
"logits/chosen": -0.9438092112541199,
"logits/rejected": -0.9487511515617371,
"logps/chosen": -10.97130012512207,
"logps/rejected": -60.31357955932617,
"loss": 0.48772644996643066,
"memory(GiB)": 46.38,
"nll_loss": 0.4556671679019928,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.31157898902893066,
"rewards/margins": 5.334751129150391,
"rewards/rejected": -5.023171901702881,
"step": 332,
"train_speed(iter/s)": 0.005448
},
{
"epoch": 0.568957232099952,
"grad_norm": 17.81595802307129,
"learning_rate": 0.00017145650010474194,
"logits/chosen": -0.9099326133728027,
"logits/rejected": -0.913872241973877,
"logps/chosen": -7.330003261566162,
"logps/rejected": -56.975791931152344,
"loss": 0.44156697392463684,
"memory(GiB)": 46.38,
"nll_loss": 0.3481760025024414,
"rewards/accuracies": 0.96875,
"rewards/chosen": 0.13420407474040985,
"rewards/margins": 4.564350128173828,
"rewards/rejected": -4.430145740509033,
"step": 333,
"train_speed(iter/s)": 0.005449
},
{
"epoch": 0.5706658123765284,
"grad_norm": 4.562387466430664,
"learning_rate": 0.00017125839641475072,
"logits/chosen": -0.93560391664505,
"logits/rejected": -0.9402634501457214,
"logps/chosen": -8.35469913482666,
"logps/rejected": -48.29425048828125,
"loss": 0.8423429727554321,
"memory(GiB)": 46.38,
"nll_loss": 0.5765202045440674,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.20604895055294037,
"rewards/margins": 4.131405353546143,
"rewards/rejected": -3.925356149673462,
"step": 334,
"train_speed(iter/s)": 0.005448
},
{
"epoch": 0.5723743926531049,
"grad_norm": 6.9514899253845215,
"learning_rate": 0.00017105972294452056,
"logits/chosen": -0.9457940459251404,
"logits/rejected": -0.9509940147399902,
"logps/chosen": -8.684478759765625,
"logps/rejected": -42.20777893066406,
"loss": 0.6009758114814758,
"memory(GiB)": 46.38,
"nll_loss": 0.2808820307254791,
"rewards/accuracies": 0.90625,
"rewards/chosen": 0.007849723100662231,
"rewards/margins": 3.273137092590332,
"rewards/rejected": -3.265286922454834,
"step": 335,
"train_speed(iter/s)": 0.005449
},
{
"epoch": 0.5740829729296812,
"grad_norm": 41.98228454589844,
"learning_rate": 0.0001708604812826393,
"logits/chosen": -0.9295578598976135,
"logits/rejected": -0.935192346572876,
"logps/chosen": -9.62477970123291,
"logps/rejected": -54.46697235107422,
"loss": 0.598048746585846,
"memory(GiB)": 46.38,
"nll_loss": 0.43297702074050903,
"rewards/accuracies": 0.90625,
"rewards/chosen": 0.07474887371063232,
"rewards/margins": 4.1404008865356445,
"rewards/rejected": -4.065651893615723,
"step": 336,
"train_speed(iter/s)": 0.005449
},
{
"epoch": 0.5757915532062576,
"grad_norm": 2.598214626312256,
"learning_rate": 0.00017066067302223798,
"logits/chosen": -0.8595199584960938,
"logits/rejected": -0.8645521402359009,
"logps/chosen": -5.353518962860107,
"logps/rejected": -45.4082145690918,
"loss": 0.3949076235294342,
"memory(GiB)": 46.38,
"nll_loss": 0.3393931984901428,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.17312097549438477,
"rewards/margins": 3.7592127323150635,
"rewards/rejected": -3.5860915184020996,
"step": 337,
"train_speed(iter/s)": 0.005448
},
{
"epoch": 0.5775001334828341,
"grad_norm": 6.433867454528809,
"learning_rate": 0.00017046029976097805,
"logits/chosen": -0.8666653633117676,
"logits/rejected": -0.8727781176567078,
"logps/chosen": -7.716047286987305,
"logps/rejected": -44.40462112426758,
"loss": 0.7068074345588684,
"memory(GiB)": 46.38,
"nll_loss": 0.4196939468383789,
"rewards/accuracies": 0.90625,
"rewards/chosen": 0.018908580765128136,
"rewards/margins": 3.310499429702759,
"rewards/rejected": -3.291590929031372,
"step": 338,
"train_speed(iter/s)": 0.005448
},
{
"epoch": 0.5792087137594105,
"grad_norm": 4.851775169372559,
"learning_rate": 0.00017025936310103882,
"logits/chosen": -0.8393141627311707,
"logits/rejected": -0.8419257402420044,
"logps/chosen": -10.38674259185791,
"logps/rejected": -41.55541229248047,
"loss": 0.5500025749206543,
"memory(GiB)": 46.38,
"nll_loss": 0.35587984323501587,
"rewards/accuracies": 0.90625,
"rewards/chosen": 0.21891042590141296,
"rewards/margins": 3.442535400390625,
"rewards/rejected": -3.2236249446868896,
"step": 339,
"train_speed(iter/s)": 0.005448
},
{
"epoch": 0.580917294035987,
"grad_norm": 5.706538200378418,
"learning_rate": 0.0001700578646491045,
"logits/chosen": -0.849159300327301,
"logits/rejected": -0.8539773225784302,
"logps/chosen": -5.776857852935791,
"logps/rejected": -41.82091522216797,
"loss": 0.4652997851371765,
"memory(GiB)": 46.38,
"nll_loss": 0.1927475780248642,
"rewards/accuracies": 0.96875,
"rewards/chosen": 0.1367129385471344,
"rewards/margins": 2.951298952102661,
"rewards/rejected": -2.8145859241485596,
"step": 340,
"train_speed(iter/s)": 0.005448
},
{
"epoch": 0.5826258743125634,
"grad_norm": 15.33443832397461,
"learning_rate": 0.00016985580601635124,
"logits/chosen": -0.8022753000259399,
"logits/rejected": -0.809974193572998,
"logps/chosen": -10.902517318725586,
"logps/rejected": -38.2662467956543,
"loss": 0.7963184118270874,
"memory(GiB)": 46.38,
"nll_loss": 0.5153663158416748,
"rewards/accuracies": 0.84375,
"rewards/chosen": 0.12418508529663086,
"rewards/margins": 2.705582618713379,
"rewards/rejected": -2.58139705657959,
"step": 341,
"train_speed(iter/s)": 0.005449
},
{
"epoch": 0.5843344545891398,
"grad_norm": 2.2032649517059326,
"learning_rate": 0.00016965318881843457,
"logits/chosen": -0.7673312425613403,
"logits/rejected": -0.7743449211120605,
"logps/chosen": -8.663345336914062,
"logps/rejected": -45.02417755126953,
"loss": 0.5525592565536499,
"memory(GiB)": 46.38,
"nll_loss": 0.42993825674057007,
"rewards/accuracies": 0.96875,
"rewards/chosen": 0.231624573469162,
"rewards/margins": 3.4039034843444824,
"rewards/rejected": -3.172279119491577,
"step": 342,
"train_speed(iter/s)": 0.00545
},
{
"epoch": 0.5860430348657163,
"grad_norm": 2.8073010444641113,
"learning_rate": 0.0001694500146754762,
"logits/chosen": -0.8122238516807556,
"logits/rejected": -0.8119744658470154,
"logps/chosen": -8.633512496948242,
"logps/rejected": -35.36651611328125,
"loss": 0.5415773391723633,
"memory(GiB)": 46.38,
"nll_loss": 0.31399714946746826,
"rewards/accuracies": 0.90625,
"rewards/chosen": 0.15843312442302704,
"rewards/margins": 2.734858989715576,
"rewards/rejected": -2.576425790786743,
"step": 343,
"train_speed(iter/s)": 0.005449
},
{
"epoch": 0.5877516151422927,
"grad_norm": 2.3773810863494873,
"learning_rate": 0.0001692462852120511,
"logits/chosen": -0.7741044759750366,
"logits/rejected": -0.7800744771957397,
"logps/chosen": -9.291975021362305,
"logps/rejected": -40.77639389038086,
"loss": 0.5208418965339661,
"memory(GiB)": 46.38,
"nll_loss": 0.3624192774295807,
"rewards/accuracies": 0.96875,
"rewards/chosen": 0.2715660035610199,
"rewards/margins": 2.76344633102417,
"rewards/rejected": -2.491880416870117,
"step": 344,
"train_speed(iter/s)": 0.005449
},
{
"epoch": 0.5894601954188692,
"grad_norm": 5.773314952850342,
"learning_rate": 0.0001690420020571747,
"logits/chosen": -0.7945303916931152,
"logits/rejected": -0.8053185343742371,
"logps/chosen": -7.3475542068481445,
"logps/rejected": -50.37881851196289,
"loss": 0.42357194423675537,
"memory(GiB)": 46.38,
"nll_loss": 0.32000547647476196,
"rewards/accuracies": 0.96875,
"rewards/chosen": 0.3487846553325653,
"rewards/margins": 3.4395201206207275,
"rewards/rejected": -3.090735673904419,
"step": 345,
"train_speed(iter/s)": 0.005449
},
{
"epoch": 0.5911687756954456,
"grad_norm": 6.197271347045898,
"learning_rate": 0.0001688371668442896,
"logits/chosen": -0.805290937423706,
"logits/rejected": -0.8079847097396851,
"logps/chosen": -7.421670436859131,
"logps/rejected": -37.118797302246094,
"loss": 0.5294437408447266,
"memory(GiB)": 46.38,
"nll_loss": 0.3508721590042114,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.17643693089485168,
"rewards/margins": 2.624368667602539,
"rewards/rejected": -2.4479315280914307,
"step": 346,
"train_speed(iter/s)": 0.00545
},
{
"epoch": 0.592877355972022,
"grad_norm": 3.835904836654663,
"learning_rate": 0.00016863178121125276,
"logits/chosen": -0.8487049341201782,
"logits/rejected": -0.8516339063644409,
"logps/chosen": -8.74366283416748,
"logps/rejected": -34.4682502746582,
"loss": 0.5114731788635254,
"memory(GiB)": 46.38,
"nll_loss": 0.3230685293674469,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.0005252091214060783,
"rewards/margins": 2.4223427772521973,
"rewards/rejected": -2.4218177795410156,
"step": 347,
"train_speed(iter/s)": 0.00545
},
{
"epoch": 0.5945859362485985,
"grad_norm": 14.421294212341309,
"learning_rate": 0.00016842584680032223,
"logits/chosen": -0.8961611986160278,
"logits/rejected": -0.9048024415969849,
"logps/chosen": -5.175715923309326,
"logps/rejected": -48.69798278808594,
"loss": 0.7653312683105469,
"memory(GiB)": 46.38,
"nll_loss": 0.5099776387214661,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.08455780148506165,
"rewards/margins": 3.585397720336914,
"rewards/rejected": -3.5008397102355957,
"step": 348,
"train_speed(iter/s)": 0.005449
},
{
"epoch": 0.5962945165251748,
"grad_norm": 3.0503435134887695,
"learning_rate": 0.000168219365258144,
"logits/chosen": -0.9129156470298767,
"logits/rejected": -0.9179389476776123,
"logps/chosen": -10.671258926391602,
"logps/rejected": -43.36078643798828,
"loss": 0.37005069851875305,
"memory(GiB)": 46.38,
"nll_loss": 0.25679123401641846,
"rewards/accuracies": 0.96875,
"rewards/chosen": 0.24289637804031372,
"rewards/margins": 3.3170793056488037,
"rewards/rejected": -3.0741827487945557,
"step": 349,
"train_speed(iter/s)": 0.005449
},
{
"epoch": 0.5980030968017513,
"grad_norm": 21.91331672668457,
"learning_rate": 0.00016801233823573908,
"logits/chosen": -0.8929505944252014,
"logits/rejected": -0.8917251229286194,
"logps/chosen": -14.047558784484863,
"logps/rejected": -31.77324676513672,
"loss": 0.976524829864502,
"memory(GiB)": 46.38,
"nll_loss": 0.6302264928817749,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.11739279329776764,
"rewards/margins": 2.250826120376587,
"rewards/rejected": -2.1334333419799805,
"step": 350,
"train_speed(iter/s)": 0.005449
}
],
"logging_steps": 1,
"max_steps": 1170,
"num_input_tokens_seen": 0,
"num_train_epochs": 2,
"save_steps": 50,
"stateful_callbacks": {
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": true,
"should_training_stop": false
},
"attributes": {}
}
},
"total_flos": 2.5475296526336e+18,
"train_batch_size": 1,
"trial_name": null,
"trial_params": null
}