PEFT
Safetensors
2gt4-150 / trainer_state.json
windgrin's picture
Upload folder using huggingface_hub
9dfdb7d verified
Raw
History Blame Contribute Delete
96.6 kB
{
"best_global_step": null,
"best_metric": null,
"best_model_checkpoint": null,
"epoch": 0.35882484862076697,
"eval_steps": 300,
"global_step": 150,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"epoch": 0.00239216565747178,
"grad_norm": 13.569995880126953,
"learning_rate": 3.1746031746031746e-06,
"logits/chosen": -0.6432992815971375,
"logits/rejected": -0.6486618518829346,
"logps/chosen": -10.907301902770996,
"logps/rejected": -27.245113372802734,
"loss": 1.6750074625015259,
"memory(GiB)": 45.5,
"nll_loss": 0.9818602204322815,
"rewards/accuracies": 0.0,
"rewards/chosen": 0.0,
"rewards/margins": 0.0,
"rewards/rejected": 0.0,
"step": 1,
"train_speed(iter/s)": 0.005543
},
{
"epoch": 0.00478433131494356,
"grad_norm": 6.833891868591309,
"learning_rate": 6.349206349206349e-06,
"logits/chosen": -0.6526631116867065,
"logits/rejected": -0.6589193344116211,
"logps/chosen": -13.911490440368652,
"logps/rejected": -26.267818450927734,
"loss": 1.5071839094161987,
"memory(GiB)": 45.7,
"nll_loss": 0.8140366077423096,
"rewards/accuracies": 0.0,
"rewards/chosen": 0.0,
"rewards/margins": 0.0,
"rewards/rejected": 0.0,
"step": 2,
"train_speed(iter/s)": 0.0056
},
{
"epoch": 0.00717649697241534,
"grad_norm": 4.8643999099731445,
"learning_rate": 9.523809523809523e-06,
"logits/chosen": -0.6420565247535706,
"logits/rejected": -0.6463347673416138,
"logps/chosen": -10.297296524047852,
"logps/rejected": -21.898191452026367,
"loss": 1.3684215545654297,
"memory(GiB)": 45.7,
"nll_loss": 0.6745598316192627,
"rewards/accuracies": 0.40625,
"rewards/chosen": 0.000917938828933984,
"rewards/margins": -0.0013222515117377043,
"rewards/rejected": 0.0022401907481253147,
"step": 3,
"train_speed(iter/s)": 0.005679
},
{
"epoch": 0.00956866262988712,
"grad_norm": 13.630061149597168,
"learning_rate": 1.2698412698412699e-05,
"logits/chosen": -0.6085749864578247,
"logits/rejected": -0.6145466566085815,
"logps/chosen": -9.835967063903809,
"logps/rejected": -20.03702163696289,
"loss": 1.6158230304718018,
"memory(GiB)": 45.7,
"nll_loss": 0.9227687120437622,
"rewards/accuracies": 0.5625,
"rewards/chosen": 0.002711558947339654,
"rewards/margins": 0.0003595724410843104,
"rewards/rejected": 0.0023519867099821568,
"step": 4,
"train_speed(iter/s)": 0.005709
},
{
"epoch": 0.0119608282873589,
"grad_norm": 9.080723762512207,
"learning_rate": 1.5873015873015872e-05,
"logits/chosen": -0.6302319765090942,
"logits/rejected": -0.6327166557312012,
"logps/chosen": -12.458501815795898,
"logps/rejected": -20.92184066772461,
"loss": 1.7525994777679443,
"memory(GiB)": 45.7,
"nll_loss": 1.0644183158874512,
"rewards/accuracies": 0.71875,
"rewards/chosen": 0.015323596075177193,
"rewards/margins": 0.010122949257493019,
"rewards/rejected": 0.005200647283345461,
"step": 5,
"train_speed(iter/s)": 0.005683
},
{
"epoch": 0.01435299394483068,
"grad_norm": 10.974760055541992,
"learning_rate": 1.9047619047619046e-05,
"logits/chosen": -0.6460072994232178,
"logits/rejected": -0.6503366231918335,
"logps/chosen": -8.966805458068848,
"logps/rejected": -29.11065101623535,
"loss": 1.2482141256332397,
"memory(GiB)": 45.7,
"nll_loss": 0.5670613050460815,
"rewards/accuracies": 0.59375,
"rewards/chosen": 0.03081551007926464,
"rewards/margins": 0.024802545085549355,
"rewards/rejected": 0.006012964062392712,
"step": 6,
"train_speed(iter/s)": 0.005657
},
{
"epoch": 0.01674515960230246,
"grad_norm": 9.0870943069458,
"learning_rate": 2.2222222222222223e-05,
"logits/chosen": -0.5985114574432373,
"logits/rejected": -0.6029279232025146,
"logps/chosen": -12.831599235534668,
"logps/rejected": -22.661216735839844,
"loss": 1.4283000230789185,
"memory(GiB)": 45.7,
"nll_loss": 0.7556005120277405,
"rewards/accuracies": 0.625,
"rewards/chosen": 0.05840035900473595,
"rewards/margins": 0.044253990054130554,
"rewards/rejected": 0.01414636429399252,
"step": 7,
"train_speed(iter/s)": 0.005641
},
{
"epoch": 0.01913732525977424,
"grad_norm": 7.071105003356934,
"learning_rate": 2.5396825396825397e-05,
"logits/chosen": -0.6822581887245178,
"logits/rejected": -0.6836903095245361,
"logps/chosen": -14.09546184539795,
"logps/rejected": -17.29296112060547,
"loss": 1.3682955503463745,
"memory(GiB)": 45.7,
"nll_loss": 0.6906765699386597,
"rewards/accuracies": 0.625,
"rewards/chosen": 0.11469551920890808,
"rewards/margins": 0.042920827865600586,
"rewards/rejected": 0.07177469879388809,
"step": 8,
"train_speed(iter/s)": 0.00562
},
{
"epoch": 0.02152949091724602,
"grad_norm": 6.927362442016602,
"learning_rate": 2.857142857142857e-05,
"logits/chosen": -0.6293038725852966,
"logits/rejected": -0.632675051689148,
"logps/chosen": -13.061110496520996,
"logps/rejected": -22.598844528198242,
"loss": 1.382551670074463,
"memory(GiB)": 45.7,
"nll_loss": 0.7284406423568726,
"rewards/accuracies": 0.65625,
"rewards/chosen": 0.11742030084133148,
"rewards/margins": 0.10634221881628036,
"rewards/rejected": 0.011078080162405968,
"step": 9,
"train_speed(iter/s)": 0.005614
},
{
"epoch": 0.0239216565747178,
"grad_norm": 3.728199005126953,
"learning_rate": 3.1746031746031745e-05,
"logits/chosen": -0.6618058681488037,
"logits/rejected": -0.6639875173568726,
"logps/chosen": -13.987442970275879,
"logps/rejected": -25.95743179321289,
"loss": 1.0269697904586792,
"memory(GiB)": 45.7,
"nll_loss": 0.4300592243671417,
"rewards/accuracies": 0.5625,
"rewards/chosen": 0.24149325489997864,
"rewards/margins": 0.27823469042778015,
"rewards/rejected": -0.03674142807722092,
"step": 10,
"train_speed(iter/s)": 0.005615
},
{
"epoch": 0.02631382223218958,
"grad_norm": 7.327150344848633,
"learning_rate": 3.492063492063492e-05,
"logits/chosen": -0.6170505285263062,
"logits/rejected": -0.6200059056282043,
"logps/chosen": -12.316822052001953,
"logps/rejected": -22.407135009765625,
"loss": 1.2084441184997559,
"memory(GiB)": 45.7,
"nll_loss": 0.525244951248169,
"rewards/accuracies": 0.59375,
"rewards/chosen": 0.011396417394280434,
"rewards/margins": 0.15045319497585297,
"rewards/rejected": -0.13905677199363708,
"step": 11,
"train_speed(iter/s)": 0.00562
},
{
"epoch": 0.02870598788966136,
"grad_norm": 5.15468168258667,
"learning_rate": 3.809523809523809e-05,
"logits/chosen": -0.6354009509086609,
"logits/rejected": -0.6367737054824829,
"logps/chosen": -16.074636459350586,
"logps/rejected": -23.24802017211914,
"loss": 1.352920413017273,
"memory(GiB)": 45.7,
"nll_loss": 0.6531318426132202,
"rewards/accuracies": 0.53125,
"rewards/chosen": -0.10709743946790695,
"rewards/margins": 0.1539226770401001,
"rewards/rejected": -0.26102012395858765,
"step": 12,
"train_speed(iter/s)": 0.005618
},
{
"epoch": 0.031098153547133137,
"grad_norm": 9.377359390258789,
"learning_rate": 4.126984126984127e-05,
"logits/chosen": -0.5982232093811035,
"logits/rejected": -0.5973206758499146,
"logps/chosen": -17.6663761138916,
"logps/rejected": -19.997753143310547,
"loss": 1.681210994720459,
"memory(GiB)": 45.7,
"nll_loss": 0.8636733889579773,
"rewards/accuracies": 0.40625,
"rewards/chosen": -0.24621205031871796,
"rewards/margins": -0.07156651467084885,
"rewards/rejected": -0.17464551329612732,
"step": 13,
"train_speed(iter/s)": 0.005624
},
{
"epoch": 0.03349031920460492,
"grad_norm": 3.9681458473205566,
"learning_rate": 4.4444444444444447e-05,
"logits/chosen": -0.6217225193977356,
"logits/rejected": -0.6225230097770691,
"logps/chosen": -12.139883995056152,
"logps/rejected": -25.268104553222656,
"loss": 1.2384405136108398,
"memory(GiB)": 46.29,
"nll_loss": 0.5618223547935486,
"rewards/accuracies": 0.625,
"rewards/chosen": -0.0858367532491684,
"rewards/margins": 0.20134860277175903,
"rewards/rejected": -0.28718534111976624,
"step": 14,
"train_speed(iter/s)": 0.005621
},
{
"epoch": 0.0358824848620767,
"grad_norm": 3.7261455059051514,
"learning_rate": 4.761904761904762e-05,
"logits/chosen": -0.5990071892738342,
"logits/rejected": -0.603517472743988,
"logps/chosen": -9.707769393920898,
"logps/rejected": -30.03302574157715,
"loss": 1.114662766456604,
"memory(GiB)": 46.29,
"nll_loss": 0.5713129639625549,
"rewards/accuracies": 0.75,
"rewards/chosen": 0.08963251113891602,
"rewards/margins": 0.5134348273277283,
"rewards/rejected": -0.42380231618881226,
"step": 15,
"train_speed(iter/s)": 0.005614
},
{
"epoch": 0.03827465051954848,
"grad_norm": 4.653024673461914,
"learning_rate": 5.0793650793650794e-05,
"logits/chosen": -0.6132736206054688,
"logits/rejected": -0.6161543726921082,
"logps/chosen": -15.514596939086914,
"logps/rejected": -26.068016052246094,
"loss": 1.281750202178955,
"memory(GiB)": 46.29,
"nll_loss": 0.5498376488685608,
"rewards/accuracies": 0.4375,
"rewards/chosen": -0.09057736396789551,
"rewards/margins": 0.08230985701084137,
"rewards/rejected": -0.17288722097873688,
"step": 16,
"train_speed(iter/s)": 0.005619
},
{
"epoch": 0.04066681617702026,
"grad_norm": 3.9547042846679688,
"learning_rate": 5.396825396825397e-05,
"logits/chosen": -0.5502676367759705,
"logits/rejected": -0.5536152124404907,
"logps/chosen": -13.769225120544434,
"logps/rejected": -27.007709503173828,
"loss": 1.413275122642517,
"memory(GiB)": 46.29,
"nll_loss": 0.7366797924041748,
"rewards/accuracies": 0.59375,
"rewards/chosen": -0.05718833580613136,
"rewards/margins": 0.1863359659910202,
"rewards/rejected": -0.24352429807186127,
"step": 17,
"train_speed(iter/s)": 0.005631
},
{
"epoch": 0.04305898183449204,
"grad_norm": 3.8449220657348633,
"learning_rate": 5.714285714285714e-05,
"logits/chosen": -0.5983889102935791,
"logits/rejected": -0.601371705532074,
"logps/chosen": -11.734331130981445,
"logps/rejected": -22.929622650146484,
"loss": 1.3582308292388916,
"memory(GiB)": 46.29,
"nll_loss": 0.639457106590271,
"rewards/accuracies": 0.4375,
"rewards/chosen": 0.03578497841954231,
"rewards/margins": 0.019625335931777954,
"rewards/rejected": 0.016159646213054657,
"step": 18,
"train_speed(iter/s)": 0.005646
},
{
"epoch": 0.04545114749196382,
"grad_norm": 3.037893295288086,
"learning_rate": 6.0317460317460316e-05,
"logits/chosen": -0.6029090881347656,
"logits/rejected": -0.6060330867767334,
"logps/chosen": -13.030549049377441,
"logps/rejected": -24.52211570739746,
"loss": 1.2112592458724976,
"memory(GiB)": 46.29,
"nll_loss": 0.526079535484314,
"rewards/accuracies": 0.5625,
"rewards/chosen": 0.08603789657354355,
"rewards/margins": 0.11102047562599182,
"rewards/rejected": -0.024982573464512825,
"step": 19,
"train_speed(iter/s)": 0.005649
},
{
"epoch": 0.0478433131494356,
"grad_norm": 3.4577159881591797,
"learning_rate": 6.349206349206349e-05,
"logits/chosen": -0.6348394155502319,
"logits/rejected": -0.6350866556167603,
"logps/chosen": -10.457337379455566,
"logps/rejected": -21.804182052612305,
"loss": 1.271092414855957,
"memory(GiB)": 46.29,
"nll_loss": 0.5564278364181519,
"rewards/accuracies": 0.5,
"rewards/chosen": 0.13572227954864502,
"rewards/margins": 0.03713224455714226,
"rewards/rejected": 0.09859003126621246,
"step": 20,
"train_speed(iter/s)": 0.00565
},
{
"epoch": 0.05023547880690738,
"grad_norm": 2.758153200149536,
"learning_rate": 6.666666666666667e-05,
"logits/chosen": -0.5788831114768982,
"logits/rejected": -0.5802679061889648,
"logps/chosen": -12.416455268859863,
"logps/rejected": -15.200132369995117,
"loss": 1.3435254096984863,
"memory(GiB)": 46.29,
"nll_loss": 0.5808812379837036,
"rewards/accuracies": 0.3125,
"rewards/chosen": 0.11838358640670776,
"rewards/margins": -0.03334012255072594,
"rewards/rejected": 0.1517237275838852,
"step": 21,
"train_speed(iter/s)": 0.005654
},
{
"epoch": 0.05262764446437916,
"grad_norm": 3.07053542137146,
"learning_rate": 6.984126984126984e-05,
"logits/chosen": -0.5787701606750488,
"logits/rejected": -0.582938551902771,
"logps/chosen": -6.899454116821289,
"logps/rejected": -21.719806671142578,
"loss": 1.0226894617080688,
"memory(GiB)": 46.29,
"nll_loss": 0.45206937193870544,
"rewards/accuracies": 0.78125,
"rewards/chosen": 0.30141958594322205,
"rewards/margins": 0.32421889901161194,
"rewards/rejected": -0.022799327969551086,
"step": 22,
"train_speed(iter/s)": 0.005649
},
{
"epoch": 0.05501981012185094,
"grad_norm": 3.616273880004883,
"learning_rate": 7.301587301587302e-05,
"logits/chosen": -0.5814599990844727,
"logits/rejected": -0.5829823017120361,
"logps/chosen": -10.043213844299316,
"logps/rejected": -16.569318771362305,
"loss": 1.5021785497665405,
"memory(GiB)": 46.29,
"nll_loss": 0.8470967411994934,
"rewards/accuracies": 0.65625,
"rewards/chosen": 0.15741629898548126,
"rewards/margins": 0.13470463454723358,
"rewards/rejected": 0.022711653262376785,
"step": 23,
"train_speed(iter/s)": 0.005652
},
{
"epoch": 0.05741197577932272,
"grad_norm": 2.9444239139556885,
"learning_rate": 7.619047619047618e-05,
"logits/chosen": -0.5737470388412476,
"logits/rejected": -0.5753998756408691,
"logps/chosen": -9.754992485046387,
"logps/rejected": -23.393245697021484,
"loss": 1.1848090887069702,
"memory(GiB)": 46.29,
"nll_loss": 0.5859429240226746,
"rewards/accuracies": 0.71875,
"rewards/chosen": 0.26539331674575806,
"rewards/margins": 0.25131887197494507,
"rewards/rejected": 0.01407446339726448,
"step": 24,
"train_speed(iter/s)": 0.005651
},
{
"epoch": 0.059804141436794495,
"grad_norm": 2.368903875350952,
"learning_rate": 7.936507936507937e-05,
"logits/chosen": -0.5797973871231079,
"logits/rejected": -0.5811963081359863,
"logps/chosen": -7.4247236251831055,
"logps/rejected": -17.2625789642334,
"loss": 1.1369986534118652,
"memory(GiB)": 46.29,
"nll_loss": 0.5304021835327148,
"rewards/accuracies": 0.6875,
"rewards/chosen": 0.18115447461605072,
"rewards/margins": 0.21577578783035278,
"rewards/rejected": -0.034621305763721466,
"step": 25,
"train_speed(iter/s)": 0.005651
},
{
"epoch": 0.062196307094266275,
"grad_norm": 2.0124542713165283,
"learning_rate": 8.253968253968255e-05,
"logits/chosen": -0.5834470987319946,
"logits/rejected": -0.5854894518852234,
"logps/chosen": -10.883503913879395,
"logps/rejected": -17.59324836730957,
"loss": 1.050497055053711,
"memory(GiB)": 46.29,
"nll_loss": 0.4383053183555603,
"rewards/accuracies": 0.59375,
"rewards/chosen": 0.22693531215190887,
"rewards/margins": 0.23587419092655182,
"rewards/rejected": -0.008938884362578392,
"step": 26,
"train_speed(iter/s)": 0.005654
},
{
"epoch": 0.06458847275173805,
"grad_norm": 2.3302695751190186,
"learning_rate": 8.571428571428571e-05,
"logits/chosen": -0.5692424774169922,
"logits/rejected": -0.5711921453475952,
"logps/chosen": -12.02816104888916,
"logps/rejected": -23.778608322143555,
"loss": 1.1506422758102417,
"memory(GiB)": 46.29,
"nll_loss": 0.5187042951583862,
"rewards/accuracies": 0.5625,
"rewards/chosen": 0.11056558787822723,
"rewards/margins": 0.18688789010047913,
"rewards/rejected": -0.0763222873210907,
"step": 27,
"train_speed(iter/s)": 0.005653
},
{
"epoch": 0.06698063840920984,
"grad_norm": 2.4422554969787598,
"learning_rate": 8.888888888888889e-05,
"logits/chosen": -0.5987146496772766,
"logits/rejected": -0.5993437767028809,
"logps/chosen": -9.00568675994873,
"logps/rejected": -17.24131965637207,
"loss": 1.0437039136886597,
"memory(GiB)": 46.29,
"nll_loss": 0.4295322299003601,
"rewards/accuracies": 0.59375,
"rewards/chosen": 0.19704687595367432,
"rewards/margins": 0.21514004468917847,
"rewards/rejected": -0.018093157559633255,
"step": 28,
"train_speed(iter/s)": 0.00565
},
{
"epoch": 0.06937280406668161,
"grad_norm": 3.3448095321655273,
"learning_rate": 9.206349206349206e-05,
"logits/chosen": -0.5584565997123718,
"logits/rejected": -0.5605788826942444,
"logps/chosen": -7.835123538970947,
"logps/rejected": -19.747636795043945,
"loss": 1.172892451286316,
"memory(GiB)": 46.29,
"nll_loss": 0.55903559923172,
"rewards/accuracies": 0.71875,
"rewards/chosen": 0.15631772577762604,
"rewards/margins": 0.2727695107460022,
"rewards/rejected": -0.11645177006721497,
"step": 29,
"train_speed(iter/s)": 0.005649
},
{
"epoch": 0.0717649697241534,
"grad_norm": 2.956876516342163,
"learning_rate": 9.523809523809524e-05,
"logits/chosen": -0.5594294667243958,
"logits/rejected": -0.5630677342414856,
"logps/chosen": -8.298831939697266,
"logps/rejected": -26.14436149597168,
"loss": 1.0785880088806152,
"memory(GiB)": 46.78,
"nll_loss": 0.5043998956680298,
"rewards/accuracies": 0.75,
"rewards/chosen": 0.15360432863235474,
"rewards/margins": 0.37323492765426636,
"rewards/rejected": -0.21963059902191162,
"step": 30,
"train_speed(iter/s)": 0.005646
},
{
"epoch": 0.07415713538162517,
"grad_norm": 2.969925880432129,
"learning_rate": 9.841269841269841e-05,
"logits/chosen": -0.563766360282898,
"logits/rejected": -0.564283549785614,
"logps/chosen": -9.237369537353516,
"logps/rejected": -23.180709838867188,
"loss": 1.0209345817565918,
"memory(GiB)": 46.78,
"nll_loss": 0.42502841353416443,
"rewards/accuracies": 0.84375,
"rewards/chosen": 0.18122270703315735,
"rewards/margins": 0.2958879768848419,
"rewards/rejected": -0.11466525495052338,
"step": 31,
"train_speed(iter/s)": 0.005646
},
{
"epoch": 0.07654930103909696,
"grad_norm": 3.5162458419799805,
"learning_rate": 0.00010158730158730159,
"logits/chosen": -0.5594556927680969,
"logits/rejected": -0.5654793977737427,
"logps/chosen": -5.732161045074463,
"logps/rejected": -32.01944351196289,
"loss": 0.9676632881164551,
"memory(GiB)": 46.78,
"nll_loss": 0.4746396541595459,
"rewards/accuracies": 0.84375,
"rewards/chosen": 0.2609599530696869,
"rewards/margins": 0.6239939332008362,
"rewards/rejected": -0.3630340099334717,
"step": 32,
"train_speed(iter/s)": 0.005645
},
{
"epoch": 0.07894146669656874,
"grad_norm": 3.3218283653259277,
"learning_rate": 0.00010476190476190477,
"logits/chosen": -0.5853260159492493,
"logits/rejected": -0.5895906686782837,
"logps/chosen": -10.368348121643066,
"logps/rejected": -20.515506744384766,
"loss": 1.1254382133483887,
"memory(GiB)": 46.78,
"nll_loss": 0.5297057032585144,
"rewards/accuracies": 0.8125,
"rewards/chosen": 0.15998664498329163,
"rewards/margins": 0.346771240234375,
"rewards/rejected": -0.18678458034992218,
"step": 33,
"train_speed(iter/s)": 0.005644
},
{
"epoch": 0.08133363235404052,
"grad_norm": 4.339278697967529,
"learning_rate": 0.00010793650793650794,
"logits/chosen": -0.6093581318855286,
"logits/rejected": -0.6088329553604126,
"logps/chosen": -13.336594581604004,
"logps/rejected": -24.60618782043457,
"loss": 1.1337980031967163,
"memory(GiB)": 46.78,
"nll_loss": 0.5539220571517944,
"rewards/accuracies": 0.71875,
"rewards/chosen": 0.1875077337026596,
"rewards/margins": 0.4340534806251526,
"rewards/rejected": -0.24654576182365417,
"step": 34,
"train_speed(iter/s)": 0.005642
},
{
"epoch": 0.0837257980115123,
"grad_norm": 3.8656299114227295,
"learning_rate": 0.00011111111111111112,
"logits/chosen": -0.6122190952301025,
"logits/rejected": -0.616493284702301,
"logps/chosen": -13.914678573608398,
"logps/rejected": -32.916744232177734,
"loss": 1.1174585819244385,
"memory(GiB)": 46.78,
"nll_loss": 0.5647247433662415,
"rewards/accuracies": 0.71875,
"rewards/chosen": 0.015515260398387909,
"rewards/margins": 0.6349303722381592,
"rewards/rejected": -0.6194151639938354,
"step": 35,
"train_speed(iter/s)": 0.005638
},
{
"epoch": 0.08611796366898408,
"grad_norm": 3.665461540222168,
"learning_rate": 0.00011428571428571428,
"logits/chosen": -0.6845042705535889,
"logits/rejected": -0.6848981380462646,
"logps/chosen": -12.846878051757812,
"logps/rejected": -25.240447998046875,
"loss": 1.1161198616027832,
"memory(GiB)": 46.78,
"nll_loss": 0.5125420689582825,
"rewards/accuracies": 0.65625,
"rewards/chosen": 0.049385204911231995,
"rewards/margins": 0.33047205209732056,
"rewards/rejected": -0.28108683228492737,
"step": 36,
"train_speed(iter/s)": 0.005643
},
{
"epoch": 0.08851012932645586,
"grad_norm": 3.6945273876190186,
"learning_rate": 0.00011746031746031746,
"logits/chosen": -0.6884023547172546,
"logits/rejected": -0.69326251745224,
"logps/chosen": -7.306849956512451,
"logps/rejected": -24.99851417541504,
"loss": 0.9112467765808105,
"memory(GiB)": 46.78,
"nll_loss": 0.4103700518608093,
"rewards/accuracies": 0.84375,
"rewards/chosen": 0.24825294315814972,
"rewards/margins": 0.5438191294670105,
"rewards/rejected": -0.295566201210022,
"step": 37,
"train_speed(iter/s)": 0.005646
},
{
"epoch": 0.09090229498392764,
"grad_norm": 2.759567975997925,
"learning_rate": 0.00012063492063492063,
"logits/chosen": -0.6944407224655151,
"logits/rejected": -0.6986436247825623,
"logps/chosen": -8.414443969726562,
"logps/rejected": -29.627033233642578,
"loss": 0.9807862043380737,
"memory(GiB)": 46.78,
"nll_loss": 0.464620977640152,
"rewards/accuracies": 0.78125,
"rewards/chosen": 0.205428808927536,
"rewards/margins": 0.6206997036933899,
"rewards/rejected": -0.41527092456817627,
"step": 38,
"train_speed(iter/s)": 0.005647
},
{
"epoch": 0.09329446064139942,
"grad_norm": 3.707176685333252,
"learning_rate": 0.0001238095238095238,
"logits/chosen": -0.6549853086471558,
"logits/rejected": -0.6607218384742737,
"logps/chosen": -13.402036666870117,
"logps/rejected": -29.2238826751709,
"loss": 1.1863672733306885,
"memory(GiB)": 46.78,
"nll_loss": 0.5955373048782349,
"rewards/accuracies": 0.75,
"rewards/chosen": 0.0599823072552681,
"rewards/margins": 0.4598371684551239,
"rewards/rejected": -0.3998548984527588,
"step": 39,
"train_speed(iter/s)": 0.005645
},
{
"epoch": 0.0956866262988712,
"grad_norm": 5.015953540802002,
"learning_rate": 0.00012698412698412698,
"logits/chosen": -0.6966100931167603,
"logits/rejected": -0.7002891302108765,
"logps/chosen": -7.736152172088623,
"logps/rejected": -27.045543670654297,
"loss": 0.977799654006958,
"memory(GiB)": 46.78,
"nll_loss": 0.5642723441123962,
"rewards/accuracies": 0.84375,
"rewards/chosen": 0.3473990261554718,
"rewards/margins": 1.0138760805130005,
"rewards/rejected": -0.6664770245552063,
"step": 40,
"train_speed(iter/s)": 0.005645
},
{
"epoch": 0.09807879195634298,
"grad_norm": 4.407506465911865,
"learning_rate": 0.00013015873015873017,
"logits/chosen": -0.692713737487793,
"logits/rejected": -0.6956310272216797,
"logps/chosen": -9.848102569580078,
"logps/rejected": -24.158405303955078,
"loss": 1.0173840522766113,
"memory(GiB)": 46.78,
"nll_loss": 0.5190764665603638,
"rewards/accuracies": 0.84375,
"rewards/chosen": 0.1344590187072754,
"rewards/margins": 0.6329586505889893,
"rewards/rejected": -0.49849969148635864,
"step": 41,
"train_speed(iter/s)": 0.005645
},
{
"epoch": 0.10047095761381476,
"grad_norm": 3.482964515686035,
"learning_rate": 0.00013333333333333334,
"logits/chosen": -0.6898783445358276,
"logits/rejected": -0.694994330406189,
"logps/chosen": -10.68550968170166,
"logps/rejected": -28.72760772705078,
"loss": 1.0436055660247803,
"memory(GiB)": 46.78,
"nll_loss": 0.5537880659103394,
"rewards/accuracies": 0.71875,
"rewards/chosen": 0.1501934826374054,
"rewards/margins": 0.8055344820022583,
"rewards/rejected": -0.6553410291671753,
"step": 42,
"train_speed(iter/s)": 0.005645
},
{
"epoch": 0.10286312327128654,
"grad_norm": 3.4329941272735596,
"learning_rate": 0.0001365079365079365,
"logits/chosen": -0.7011124491691589,
"logits/rejected": -0.7064176797866821,
"logps/chosen": -15.171253204345703,
"logps/rejected": -29.2159481048584,
"loss": 1.0602749586105347,
"memory(GiB)": 46.78,
"nll_loss": 0.5264595746994019,
"rewards/accuracies": 0.6875,
"rewards/chosen": 0.06841089576482773,
"rewards/margins": 0.6964786052703857,
"rewards/rejected": -0.6280677318572998,
"step": 43,
"train_speed(iter/s)": 0.005644
},
{
"epoch": 0.10525528892875832,
"grad_norm": 2.459496259689331,
"learning_rate": 0.00013968253968253967,
"logits/chosen": -0.7666099667549133,
"logits/rejected": -0.771510899066925,
"logps/chosen": -5.71858549118042,
"logps/rejected": -27.757709503173828,
"loss": 0.8418532609939575,
"memory(GiB)": 46.78,
"nll_loss": 0.43147915601730347,
"rewards/accuracies": 0.84375,
"rewards/chosen": 0.2912772297859192,
"rewards/margins": 0.8343029022216797,
"rewards/rejected": -0.5430256724357605,
"step": 44,
"train_speed(iter/s)": 0.005645
},
{
"epoch": 0.1076474545862301,
"grad_norm": 2.439218759536743,
"learning_rate": 0.00014285714285714287,
"logits/chosen": -0.7568098902702332,
"logits/rejected": -0.7595718502998352,
"logps/chosen": -10.82071304321289,
"logps/rejected": -26.015369415283203,
"loss": 0.9067925214767456,
"memory(GiB)": 46.78,
"nll_loss": 0.4222971796989441,
"rewards/accuracies": 0.71875,
"rewards/chosen": 0.23031610250473022,
"rewards/margins": 0.6913963556289673,
"rewards/rejected": -0.46108025312423706,
"step": 45,
"train_speed(iter/s)": 0.005643
},
{
"epoch": 0.11003962024370188,
"grad_norm": 2.0914173126220703,
"learning_rate": 0.00014603174603174603,
"logits/chosen": -0.8171934485435486,
"logits/rejected": -0.8208147287368774,
"logps/chosen": -7.6959333419799805,
"logps/rejected": -26.958995819091797,
"loss": 0.8884089589118958,
"memory(GiB)": 46.78,
"nll_loss": 0.4511643052101135,
"rewards/accuracies": 0.78125,
"rewards/chosen": 0.29817235469818115,
"rewards/margins": 0.9990655183792114,
"rewards/rejected": -0.700893223285675,
"step": 46,
"train_speed(iter/s)": 0.005641
},
{
"epoch": 0.11243178590117366,
"grad_norm": 2.7921295166015625,
"learning_rate": 0.00014920634920634923,
"logits/chosen": -0.8353937864303589,
"logits/rejected": -0.8423863649368286,
"logps/chosen": -11.051738739013672,
"logps/rejected": -29.439268112182617,
"loss": 0.9526035189628601,
"memory(GiB)": 46.78,
"nll_loss": 0.5338684916496277,
"rewards/accuracies": 0.84375,
"rewards/chosen": 0.15457165241241455,
"rewards/margins": 0.8811558485031128,
"rewards/rejected": -0.7265841960906982,
"step": 47,
"train_speed(iter/s)": 0.00564
},
{
"epoch": 0.11482395155864544,
"grad_norm": 3.267803907394409,
"learning_rate": 0.00015238095238095237,
"logits/chosen": -0.8806051015853882,
"logits/rejected": -0.8819608688354492,
"logps/chosen": -15.4578275680542,
"logps/rejected": -28.783483505249023,
"loss": 1.037742018699646,
"memory(GiB)": 46.78,
"nll_loss": 0.5505475997924805,
"rewards/accuracies": 0.78125,
"rewards/chosen": 0.205413818359375,
"rewards/margins": 0.9907757043838501,
"rewards/rejected": -0.7853618264198303,
"step": 48,
"train_speed(iter/s)": 0.005641
},
{
"epoch": 0.11721611721611722,
"grad_norm": 5.174523830413818,
"learning_rate": 0.00015555555555555556,
"logits/chosen": -0.9132509827613831,
"logits/rejected": -0.9135016202926636,
"logps/chosen": -16.307157516479492,
"logps/rejected": -32.103309631347656,
"loss": 1.1124699115753174,
"memory(GiB)": 46.78,
"nll_loss": 0.6212166547775269,
"rewards/accuracies": 0.78125,
"rewards/chosen": 0.16737183928489685,
"rewards/margins": 0.9279904365539551,
"rewards/rejected": -0.7606185078620911,
"step": 49,
"train_speed(iter/s)": 0.005639
},
{
"epoch": 0.11960828287358899,
"grad_norm": 3.378316879272461,
"learning_rate": 0.00015873015873015873,
"logits/chosen": -0.9473586678504944,
"logits/rejected": -0.958495020866394,
"logps/chosen": -7.192904472351074,
"logps/rejected": -38.12461853027344,
"loss": 0.8130012154579163,
"memory(GiB)": 46.78,
"nll_loss": 0.4022335410118103,
"rewards/accuracies": 0.78125,
"rewards/chosen": 0.14782631397247314,
"rewards/margins": 1.2623234987258911,
"rewards/rejected": -1.114497184753418,
"step": 50,
"train_speed(iter/s)": 0.005639
},
{
"epoch": 0.12200044853106078,
"grad_norm": 3.7333006858825684,
"learning_rate": 0.00016190476190476192,
"logits/chosen": -0.9992814064025879,
"logits/rejected": -1.0156452655792236,
"logps/chosen": -10.031129837036133,
"logps/rejected": -41.15076446533203,
"loss": 0.8442965745925903,
"memory(GiB)": 46.78,
"nll_loss": 0.538231611251831,
"rewards/accuracies": 0.96875,
"rewards/chosen": 0.17759491503238678,
"rewards/margins": 1.8191030025482178,
"rewards/rejected": -1.6415079832077026,
"step": 51,
"train_speed(iter/s)": 0.005631
},
{
"epoch": 0.12439261418853255,
"grad_norm": 5.16239070892334,
"learning_rate": 0.0001650793650793651,
"logits/chosen": -1.0308305025100708,
"logits/rejected": -1.0365955829620361,
"logps/chosen": -12.618029594421387,
"logps/rejected": -30.713321685791016,
"loss": 1.0460460186004639,
"memory(GiB)": 46.78,
"nll_loss": 0.6516051292419434,
"rewards/accuracies": 0.8125,
"rewards/chosen": 0.07658500969409943,
"rewards/margins": 1.1642749309539795,
"rewards/rejected": -1.0876898765563965,
"step": 52,
"train_speed(iter/s)": 0.005632
},
{
"epoch": 0.12678477984600434,
"grad_norm": 8.370670318603516,
"learning_rate": 0.00016825396825396826,
"logits/chosen": -0.9728441834449768,
"logits/rejected": -0.9805364012718201,
"logps/chosen": -15.092721939086914,
"logps/rejected": -43.16249465942383,
"loss": 1.3046923875808716,
"memory(GiB)": 46.78,
"nll_loss": 0.8397946953773499,
"rewards/accuracies": 0.71875,
"rewards/chosen": -0.006958425045013428,
"rewards/margins": 1.5226078033447266,
"rewards/rejected": -1.5295664072036743,
"step": 53,
"train_speed(iter/s)": 0.005632
},
{
"epoch": 0.1291769455034761,
"grad_norm": 4.0541462898254395,
"learning_rate": 0.00017142857142857143,
"logits/chosen": -1.0004466772079468,
"logits/rejected": -1.0036160945892334,
"logps/chosen": -10.588321685791016,
"logps/rejected": -31.380657196044922,
"loss": 0.784751296043396,
"memory(GiB)": 46.78,
"nll_loss": 0.43249669671058655,
"rewards/accuracies": 0.84375,
"rewards/chosen": 0.19054383039474487,
"rewards/margins": 1.5502821207046509,
"rewards/rejected": -1.3597382307052612,
"step": 54,
"train_speed(iter/s)": 0.005632
},
{
"epoch": 0.13156911116094788,
"grad_norm": 5.073096752166748,
"learning_rate": 0.00017460317460317462,
"logits/chosen": -1.0498322248458862,
"logits/rejected": -1.0584659576416016,
"logps/chosen": -15.89664363861084,
"logps/rejected": -31.34156608581543,
"loss": 1.277337908744812,
"memory(GiB)": 46.78,
"nll_loss": 0.8222866654396057,
"rewards/accuracies": 0.78125,
"rewards/chosen": -0.005467001348733902,
"rewards/margins": 1.1543742418289185,
"rewards/rejected": -1.1598412990570068,
"step": 55,
"train_speed(iter/s)": 0.005634
},
{
"epoch": 0.13396127681841968,
"grad_norm": 9.963640213012695,
"learning_rate": 0.00017777777777777779,
"logits/chosen": -0.9661000370979309,
"logits/rejected": -0.9783132672309875,
"logps/chosen": -10.20169448852539,
"logps/rejected": -36.709903717041016,
"loss": 1.0616700649261475,
"memory(GiB)": 46.78,
"nll_loss": 0.6122196912765503,
"rewards/accuracies": 0.78125,
"rewards/chosen": 0.12718632817268372,
"rewards/margins": 1.107292890548706,
"rewards/rejected": -0.9801065921783447,
"step": 56,
"train_speed(iter/s)": 0.005633
},
{
"epoch": 0.13635344247589146,
"grad_norm": 4.3275227546691895,
"learning_rate": 0.00018095238095238095,
"logits/chosen": -1.0224848985671997,
"logits/rejected": -1.0346163511276245,
"logps/chosen": -12.20643424987793,
"logps/rejected": -46.608978271484375,
"loss": 0.8705050349235535,
"memory(GiB)": 46.78,
"nll_loss": 0.501814067363739,
"rewards/accuracies": 0.75,
"rewards/chosen": 0.06085830181837082,
"rewards/margins": 1.5555297136306763,
"rewards/rejected": -1.49467134475708,
"step": 57,
"train_speed(iter/s)": 0.005632
},
{
"epoch": 0.13874560813336323,
"grad_norm": 7.873358726501465,
"learning_rate": 0.00018412698412698412,
"logits/chosen": -0.9996501207351685,
"logits/rejected": -1.008366346359253,
"logps/chosen": -8.571969985961914,
"logps/rejected": -36.11326599121094,
"loss": 0.8140489459037781,
"memory(GiB)": 46.78,
"nll_loss": 0.4696846008300781,
"rewards/accuracies": 0.8125,
"rewards/chosen": 0.10605719685554504,
"rewards/margins": 1.5816770792007446,
"rewards/rejected": -1.475619912147522,
"step": 58,
"train_speed(iter/s)": 0.005632
},
{
"epoch": 0.141137773790835,
"grad_norm": 4.191744804382324,
"learning_rate": 0.00018730158730158731,
"logits/chosen": -0.9680933952331543,
"logits/rejected": -0.9731469750404358,
"logps/chosen": -11.40235710144043,
"logps/rejected": -45.129981994628906,
"loss": 0.8071048259735107,
"memory(GiB)": 46.78,
"nll_loss": 0.45748206973075867,
"rewards/accuracies": 0.875,
"rewards/chosen": -0.023274360224604607,
"rewards/margins": 2.327709913253784,
"rewards/rejected": -2.3509843349456787,
"step": 59,
"train_speed(iter/s)": 0.005631
},
{
"epoch": 0.1435299394483068,
"grad_norm": 3.393984317779541,
"learning_rate": 0.00019047619047619048,
"logits/chosen": -0.9939959645271301,
"logits/rejected": -0.9985793232917786,
"logps/chosen": -10.470319747924805,
"logps/rejected": -34.314205169677734,
"loss": 0.8613054156303406,
"memory(GiB)": 46.78,
"nll_loss": 0.5560427904129028,
"rewards/accuracies": 0.84375,
"rewards/chosen": 0.24216137826442719,
"rewards/margins": 1.7053587436676025,
"rewards/rejected": -1.4631972312927246,
"step": 60,
"train_speed(iter/s)": 0.005629
},
{
"epoch": 0.14592210510577858,
"grad_norm": 2.9272122383117676,
"learning_rate": 0.00019365079365079365,
"logits/chosen": -0.9692378044128418,
"logits/rejected": -0.9806127548217773,
"logps/chosen": -9.072213172912598,
"logps/rejected": -40.46186828613281,
"loss": 0.7413874864578247,
"memory(GiB)": 46.78,
"nll_loss": 0.42558133602142334,
"rewards/accuracies": 0.84375,
"rewards/chosen": 0.12333947420120239,
"rewards/margins": 1.8263578414916992,
"rewards/rejected": -1.703018307685852,
"step": 61,
"train_speed(iter/s)": 0.005632
},
{
"epoch": 0.14831427076325035,
"grad_norm": 6.832886219024658,
"learning_rate": 0.00019682539682539682,
"logits/chosen": -0.9575268030166626,
"logits/rejected": -0.9714451432228088,
"logps/chosen": -12.573237419128418,
"logps/rejected": -46.78509521484375,
"loss": 1.1069118976593018,
"memory(GiB)": 46.78,
"nll_loss": 0.7730302214622498,
"rewards/accuracies": 0.84375,
"rewards/chosen": -0.055254869163036346,
"rewards/margins": 1.9246735572814941,
"rewards/rejected": -1.9799282550811768,
"step": 62,
"train_speed(iter/s)": 0.00563
},
{
"epoch": 0.15070643642072212,
"grad_norm": 3.042998790740967,
"learning_rate": 0.0002,
"logits/chosen": -0.982741117477417,
"logits/rejected": -0.9914990663528442,
"logps/chosen": -7.9191131591796875,
"logps/rejected": -37.919273376464844,
"loss": 0.7625957131385803,
"memory(GiB)": 46.78,
"nll_loss": 0.39874428510665894,
"rewards/accuracies": 0.78125,
"rewards/chosen": 0.21871888637542725,
"rewards/margins": 1.7384941577911377,
"rewards/rejected": -1.5197750329971313,
"step": 63,
"train_speed(iter/s)": 0.005632
},
{
"epoch": 0.15309860207819392,
"grad_norm": 4.333725452423096,
"learning_rate": 0.00019999965210677203,
"logits/chosen": -0.923725962638855,
"logits/rejected": -0.9260438084602356,
"logps/chosen": -10.865621566772461,
"logps/rejected": -28.435291290283203,
"loss": 1.0750609636306763,
"memory(GiB)": 46.78,
"nll_loss": 0.5927442908287048,
"rewards/accuracies": 0.6875,
"rewards/chosen": 0.0741436630487442,
"rewards/margins": 0.9901498556137085,
"rewards/rejected": -0.9160062074661255,
"step": 64,
"train_speed(iter/s)": 0.005632
},
{
"epoch": 0.1554907677356657,
"grad_norm": 3.861036539077759,
"learning_rate": 0.00019999860842950868,
"logits/chosen": -0.9479286670684814,
"logits/rejected": -0.9511004686355591,
"logps/chosen": -14.088654518127441,
"logps/rejected": -34.085487365722656,
"loss": 0.8642847537994385,
"memory(GiB)": 46.78,
"nll_loss": 0.4594627618789673,
"rewards/accuracies": 0.8125,
"rewards/chosen": -0.02415481209754944,
"rewards/margins": 1.243844747543335,
"rewards/rejected": -1.2679994106292725,
"step": 65,
"train_speed(iter/s)": 0.005631
},
{
"epoch": 0.15788293339313747,
"grad_norm": 2.964956283569336,
"learning_rate": 0.00019999686897547169,
"logits/chosen": -0.8965855240821838,
"logits/rejected": -0.9040545225143433,
"logps/chosen": -11.898802757263184,
"logps/rejected": -30.001935958862305,
"loss": 0.9386196136474609,
"memory(GiB)": 46.78,
"nll_loss": 0.5237320065498352,
"rewards/accuracies": 0.78125,
"rewards/chosen": 0.20598752796649933,
"rewards/margins": 1.1080772876739502,
"rewards/rejected": -0.9020897150039673,
"step": 66,
"train_speed(iter/s)": 0.005632
},
{
"epoch": 0.16027509905060924,
"grad_norm": 2.645886182785034,
"learning_rate": 0.000199994433756764,
"logits/chosen": -0.9297692775726318,
"logits/rejected": -0.9331662058830261,
"logps/chosen": -9.838333129882812,
"logps/rejected": -31.623937606811523,
"loss": 0.9248643517494202,
"memory(GiB)": 46.78,
"nll_loss": 0.5388163328170776,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.30869799852371216,
"rewards/margins": 1.5470086336135864,
"rewards/rejected": -1.2383108139038086,
"step": 67,
"train_speed(iter/s)": 0.005633
},
{
"epoch": 0.16266726470808104,
"grad_norm": 4.206631660461426,
"learning_rate": 0.00019999130279032952,
"logits/chosen": -0.8769949674606323,
"logits/rejected": -0.8823909759521484,
"logps/chosen": -18.815860748291016,
"logps/rejected": -40.8411865234375,
"loss": 1.2017946243286133,
"memory(GiB)": 46.78,
"nll_loss": 0.7082366347312927,
"rewards/accuracies": 0.75,
"rewards/chosen": -0.15441593527793884,
"rewards/margins": 1.270005702972412,
"rewards/rejected": -1.4244215488433838,
"step": 68,
"train_speed(iter/s)": 0.005631
},
{
"epoch": 0.16505943036555282,
"grad_norm": 2.9063844680786133,
"learning_rate": 0.00019998747609795308,
"logits/chosen": -0.9327405691146851,
"logits/rejected": -0.9352924823760986,
"logps/chosen": -8.574593544006348,
"logps/rejected": -26.808048248291016,
"loss": 0.9598045349121094,
"memory(GiB)": 46.78,
"nll_loss": 0.48059219121932983,
"rewards/accuracies": 0.6875,
"rewards/chosen": 0.14917421340942383,
"rewards/margins": 1.1800099611282349,
"rewards/rejected": -1.0308358669281006,
"step": 69,
"train_speed(iter/s)": 0.005633
},
{
"epoch": 0.1674515960230246,
"grad_norm": 3.173595428466797,
"learning_rate": 0.00019998295370626026,
"logits/chosen": -0.9241899847984314,
"logits/rejected": -0.9277300834655762,
"logps/chosen": -8.667724609375,
"logps/rejected": -33.7216911315918,
"loss": 0.7956899404525757,
"memory(GiB)": 46.78,
"nll_loss": 0.46254533529281616,
"rewards/accuracies": 0.84375,
"rewards/chosen": 0.3548792004585266,
"rewards/margins": 1.690018653869629,
"rewards/rejected": -1.3351393938064575,
"step": 70,
"train_speed(iter/s)": 0.005632
},
{
"epoch": 0.16984376168049636,
"grad_norm": 2.7610597610473633,
"learning_rate": 0.00019997773564671732,
"logits/chosen": -0.9446437358856201,
"logits/rejected": -0.948798656463623,
"logps/chosen": -7.366062164306641,
"logps/rejected": -33.738685607910156,
"loss": 0.7108196020126343,
"memory(GiB)": 46.78,
"nll_loss": 0.34850752353668213,
"rewards/accuracies": 0.78125,
"rewards/chosen": 0.19515307247638702,
"rewards/margins": 1.521824836730957,
"rewards/rejected": -1.3266719579696655,
"step": 71,
"train_speed(iter/s)": 0.00563
},
{
"epoch": 0.17223592733796816,
"grad_norm": 2.687474250793457,
"learning_rate": 0.00019997182195563072,
"logits/chosen": -0.9068199396133423,
"logits/rejected": -0.9117379188537598,
"logps/chosen": -11.47612476348877,
"logps/rejected": -36.21818161010742,
"loss": 0.7809538245201111,
"memory(GiB)": 46.78,
"nll_loss": 0.4381601810455322,
"rewards/accuracies": 0.90625,
"rewards/chosen": 0.23770935833454132,
"rewards/margins": 1.4757200479507446,
"rewards/rejected": -1.2380106449127197,
"step": 72,
"train_speed(iter/s)": 0.005633
},
{
"epoch": 0.17462809299543994,
"grad_norm": 4.630646228790283,
"learning_rate": 0.00019996521267414717,
"logits/chosen": -0.9765245914459229,
"logits/rejected": -0.9796733856201172,
"logps/chosen": -18.482873916625977,
"logps/rejected": -29.491580963134766,
"loss": 1.1687482595443726,
"memory(GiB)": 46.78,
"nll_loss": 0.703139066696167,
"rewards/accuracies": 0.71875,
"rewards/chosen": 0.22344376146793365,
"rewards/margins": 1.3359349966049194,
"rewards/rejected": -1.1124913692474365,
"step": 73,
"train_speed(iter/s)": 0.005635
},
{
"epoch": 0.1770202586529117,
"grad_norm": 2.8936681747436523,
"learning_rate": 0.00019995790784825318,
"logits/chosen": -0.9390259385108948,
"logits/rejected": -0.9489994049072266,
"logps/chosen": -7.563755035400391,
"logps/rejected": -45.333255767822266,
"loss": 0.6042292714118958,
"memory(GiB)": 46.78,
"nll_loss": 0.29600095748901367,
"rewards/accuracies": 0.84375,
"rewards/chosen": 0.2876776158809662,
"rewards/margins": 2.2362325191497803,
"rewards/rejected": -1.9485547542572021,
"step": 74,
"train_speed(iter/s)": 0.005634
},
{
"epoch": 0.17941242431038348,
"grad_norm": 7.294376850128174,
"learning_rate": 0.00019994990752877472,
"logits/chosen": -0.9351106882095337,
"logits/rejected": -0.9450594186782837,
"logps/chosen": -8.70926570892334,
"logps/rejected": -40.92999267578125,
"loss": 0.8546091914176941,
"memory(GiB)": 46.78,
"nll_loss": 0.4996742010116577,
"rewards/accuracies": 0.78125,
"rewards/chosen": 0.15468531847000122,
"rewards/margins": 1.8762543201446533,
"rewards/rejected": -1.7215690612792969,
"step": 75,
"train_speed(iter/s)": 0.005635
},
{
"epoch": 0.18180458996785528,
"grad_norm": 3.972262382507324,
"learning_rate": 0.0001999412117713769,
"logits/chosen": -1.0458097457885742,
"logits/rejected": -1.0525654554367065,
"logps/chosen": -14.451887130737305,
"logps/rejected": -50.781612396240234,
"loss": 1.1873810291290283,
"memory(GiB)": 46.78,
"nll_loss": 0.7520004510879517,
"rewards/accuracies": 0.78125,
"rewards/chosen": -0.15246914327144623,
"rewards/margins": 1.8416060209274292,
"rewards/rejected": -1.9940751791000366,
"step": 76,
"train_speed(iter/s)": 0.005634
},
{
"epoch": 0.18419675562532706,
"grad_norm": 4.1366729736328125,
"learning_rate": 0.00019993182063656365,
"logits/chosen": -0.9752227663993835,
"logits/rejected": -0.9808940887451172,
"logps/chosen": -13.090173721313477,
"logps/rejected": -46.20813751220703,
"loss": 0.9597315788269043,
"memory(GiB)": 46.78,
"nll_loss": 0.564085841178894,
"rewards/accuracies": 0.75,
"rewards/chosen": 0.06369027495384216,
"rewards/margins": 2.183162212371826,
"rewards/rejected": -2.119471788406372,
"step": 77,
"train_speed(iter/s)": 0.005635
},
{
"epoch": 0.18658892128279883,
"grad_norm": 7.812252044677734,
"learning_rate": 0.00019992173418967722,
"logits/chosen": -1.0128633975982666,
"logits/rejected": -1.0182214975357056,
"logps/chosen": -8.333160400390625,
"logps/rejected": -49.87608337402344,
"loss": 0.7557947635650635,
"memory(GiB)": 46.78,
"nll_loss": 0.5276219248771667,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.05898723006248474,
"rewards/margins": 3.0209884643554688,
"rewards/rejected": -2.962001323699951,
"step": 78,
"train_speed(iter/s)": 0.005637
},
{
"epoch": 0.1889810869402706,
"grad_norm": 5.186205863952637,
"learning_rate": 0.0001999109525008977,
"logits/chosen": -1.006530523300171,
"logits/rejected": -1.0176763534545898,
"logps/chosen": -16.32330894470215,
"logps/rejected": -42.1322135925293,
"loss": 1.0281399488449097,
"memory(GiB)": 46.78,
"nll_loss": 0.6972037553787231,
"rewards/accuracies": 0.84375,
"rewards/chosen": 0.12587852776050568,
"rewards/margins": 2.273554801940918,
"rewards/rejected": -2.1476762294769287,
"step": 79,
"train_speed(iter/s)": 0.005635
},
{
"epoch": 0.1913732525977424,
"grad_norm": 3.2977113723754883,
"learning_rate": 0.00019989947564524267,
"logits/chosen": -0.9115131497383118,
"logits/rejected": -0.9150525331497192,
"logps/chosen": -14.462236404418945,
"logps/rejected": -37.0766487121582,
"loss": 0.9416806697845459,
"memory(GiB)": 46.78,
"nll_loss": 0.618413507938385,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.1239091008901596,
"rewards/margins": 1.5363889932632446,
"rewards/rejected": -1.4124797582626343,
"step": 80,
"train_speed(iter/s)": 0.005635
},
{
"epoch": 0.19376541825521418,
"grad_norm": 2.5254037380218506,
"learning_rate": 0.00019988730370256653,
"logits/chosen": -0.923732340335846,
"logits/rejected": -0.9374791383743286,
"logps/chosen": -7.155979156494141,
"logps/rejected": -48.05502700805664,
"loss": 0.7125514149665833,
"memory(GiB)": 46.78,
"nll_loss": 0.3992992639541626,
"rewards/accuracies": 0.84375,
"rewards/chosen": 0.3067445456981659,
"rewards/margins": 2.08925461769104,
"rewards/rejected": -1.7825100421905518,
"step": 81,
"train_speed(iter/s)": 0.005636
},
{
"epoch": 0.19615758391268595,
"grad_norm": 9.468795776367188,
"learning_rate": 0.00019987443675756,
"logits/chosen": -0.9325875043869019,
"logits/rejected": -0.9395610094070435,
"logps/chosen": -10.340322494506836,
"logps/rejected": -39.463584899902344,
"loss": 0.9755638241767883,
"memory(GiB)": 46.78,
"nll_loss": 0.6087434887886047,
"rewards/accuracies": 0.90625,
"rewards/chosen": 0.17063137888908386,
"rewards/margins": 1.9463139772415161,
"rewards/rejected": -1.775682806968689,
"step": 82,
"train_speed(iter/s)": 0.005637
},
{
"epoch": 0.19854974957015772,
"grad_norm": 3.6070539951324463,
"learning_rate": 0.00019986087489974952,
"logits/chosen": -0.953080952167511,
"logits/rejected": -0.9536972045898438,
"logps/chosen": -12.9752197265625,
"logps/rejected": -32.04649353027344,
"loss": 1.0608779191970825,
"memory(GiB)": 46.78,
"nll_loss": 0.6077963709831238,
"rewards/accuracies": 0.75,
"rewards/chosen": 0.20461547374725342,
"rewards/margins": 1.1314504146575928,
"rewards/rejected": -0.9268349409103394,
"step": 83,
"train_speed(iter/s)": 0.005636
},
{
"epoch": 0.20094191522762953,
"grad_norm": 3.0724594593048096,
"learning_rate": 0.00019984661822349667,
"logits/chosen": -0.9149019718170166,
"logits/rejected": -0.9223135113716125,
"logps/chosen": -11.019997596740723,
"logps/rejected": -34.67535400390625,
"loss": 0.959977924823761,
"memory(GiB)": 46.78,
"nll_loss": 0.5666155815124512,
"rewards/accuracies": 0.8125,
"rewards/chosen": 0.07833094894886017,
"rewards/margins": 1.359312891960144,
"rewards/rejected": -1.2809820175170898,
"step": 84,
"train_speed(iter/s)": 0.005636
},
{
"epoch": 0.2033340808851013,
"grad_norm": 4.832602024078369,
"learning_rate": 0.0001998316668279975,
"logits/chosen": -0.9071481823921204,
"logits/rejected": -0.9128391742706299,
"logps/chosen": -10.688645362854004,
"logps/rejected": -35.94822311401367,
"loss": 0.8470439314842224,
"memory(GiB)": 46.78,
"nll_loss": 0.4921894371509552,
"rewards/accuracies": 0.78125,
"rewards/chosen": 0.15914583206176758,
"rewards/margins": 1.6146492958068848,
"rewards/rejected": -1.4555033445358276,
"step": 85,
"train_speed(iter/s)": 0.005637
},
{
"epoch": 0.20572624654257307,
"grad_norm": 2.5131633281707764,
"learning_rate": 0.00019981602081728178,
"logits/chosen": -0.9089372754096985,
"logits/rejected": -0.9133983850479126,
"logps/chosen": -9.597051620483398,
"logps/rejected": -31.3452205657959,
"loss": 0.8543159365653992,
"memory(GiB)": 46.78,
"nll_loss": 0.49588966369628906,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.37841910123825073,
"rewards/margins": 1.7511966228485107,
"rewards/rejected": -1.3727774620056152,
"step": 86,
"train_speed(iter/s)": 0.005636
},
{
"epoch": 0.20811841220004484,
"grad_norm": 2.388970136642456,
"learning_rate": 0.0001997996803002123,
"logits/chosen": -0.9073879718780518,
"logits/rejected": -0.9152944684028625,
"logps/chosen": -9.81510066986084,
"logps/rejected": -44.42865753173828,
"loss": 0.7038865685462952,
"memory(GiB)": 46.78,
"nll_loss": 0.4832083582878113,
"rewards/accuracies": 0.90625,
"rewards/chosen": 0.40937453508377075,
"rewards/margins": 2.5496997833251953,
"rewards/rejected": -2.1403250694274902,
"step": 87,
"train_speed(iter/s)": 0.005637
},
{
"epoch": 0.21051057785751665,
"grad_norm": 4.166887283325195,
"learning_rate": 0.0001997826453904842,
"logits/chosen": -0.9330130815505981,
"logits/rejected": -0.9432638883590698,
"logps/chosen": -8.299344062805176,
"logps/rejected": -45.63969421386719,
"loss": 0.8084508180618286,
"memory(GiB)": 46.78,
"nll_loss": 0.5791301727294922,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.28511884808540344,
"rewards/margins": 2.360887050628662,
"rewards/rejected": -2.07576847076416,
"step": 88,
"train_speed(iter/s)": 0.005636
},
{
"epoch": 0.21290274351498842,
"grad_norm": 2.945251703262329,
"learning_rate": 0.00019976491620662406,
"logits/chosen": -0.9447211623191833,
"logits/rejected": -0.9499524235725403,
"logps/chosen": -11.17585277557373,
"logps/rejected": -39.13389205932617,
"loss": 0.8930118680000305,
"memory(GiB)": 46.78,
"nll_loss": 0.5336206555366516,
"rewards/accuracies": 0.84375,
"rewards/chosen": 0.2357935607433319,
"rewards/margins": 1.8502506017684937,
"rewards/rejected": -1.6144568920135498,
"step": 89,
"train_speed(iter/s)": 0.005651
},
{
"epoch": 0.2152949091724602,
"grad_norm": 2.779130697250366,
"learning_rate": 0.00019974649287198917,
"logits/chosen": -0.9709842205047607,
"logits/rejected": -0.9703356623649597,
"logps/chosen": -14.912643432617188,
"logps/rejected": -38.99196243286133,
"loss": 0.8809282779693604,
"memory(GiB)": 46.78,
"nll_loss": 0.5660299062728882,
"rewards/accuracies": 0.84375,
"rewards/chosen": 0.05061885714530945,
"rewards/margins": 2.167189598083496,
"rewards/rejected": -2.116570472717285,
"step": 90,
"train_speed(iter/s)": 0.00565
},
{
"epoch": 0.21768707482993196,
"grad_norm": 18.56264305114746,
"learning_rate": 0.00019972737551476657,
"logits/chosen": -0.9611991047859192,
"logits/rejected": -0.9779796600341797,
"logps/chosen": -12.885236740112305,
"logps/rejected": -61.122474670410156,
"loss": 1.059419870376587,
"memory(GiB)": 46.78,
"nll_loss": 0.7570096254348755,
"rewards/accuracies": 0.8125,
"rewards/chosen": -0.2121628373861313,
"rewards/margins": 3.2702770233154297,
"rewards/rejected": -3.4824395179748535,
"step": 91,
"train_speed(iter/s)": 0.005648
},
{
"epoch": 0.22007924048740377,
"grad_norm": 12.53586196899414,
"learning_rate": 0.00019970756426797222,
"logits/chosen": -0.9786768555641174,
"logits/rejected": -0.9855670928955078,
"logps/chosen": -11.347864151000977,
"logps/rejected": -53.41314697265625,
"loss": 1.0533485412597656,
"memory(GiB)": 46.78,
"nll_loss": 0.7857727408409119,
"rewards/accuracies": 0.90625,
"rewards/chosen": -0.0066121164709329605,
"rewards/margins": 3.5626165866851807,
"rewards/rejected": -3.5692288875579834,
"step": 92,
"train_speed(iter/s)": 0.005648
},
{
"epoch": 0.22247140614487554,
"grad_norm": 5.693381309509277,
"learning_rate": 0.00019968705926945015,
"logits/chosen": -0.9693127870559692,
"logits/rejected": -0.9756276607513428,
"logps/chosen": -12.194255828857422,
"logps/rejected": -57.608524322509766,
"loss": 0.8848276138305664,
"memory(GiB)": 46.78,
"nll_loss": 0.5927705764770508,
"rewards/accuracies": 0.84375,
"rewards/chosen": -0.047529980540275574,
"rewards/margins": 3.575960397720337,
"rewards/rejected": -3.623490333557129,
"step": 93,
"train_speed(iter/s)": 0.005648
},
{
"epoch": 0.2248635718023473,
"grad_norm": 6.475986957550049,
"learning_rate": 0.00019966586066187133,
"logits/chosen": -0.9738945960998535,
"logits/rejected": -0.9793066382408142,
"logps/chosen": -13.28403377532959,
"logps/rejected": -44.68003845214844,
"loss": 1.1366519927978516,
"memory(GiB)": 46.78,
"nll_loss": 0.6431254148483276,
"rewards/accuracies": 0.75,
"rewards/chosen": -0.027368444949388504,
"rewards/margins": 2.1656975746154785,
"rewards/rejected": -2.193066120147705,
"step": 94,
"train_speed(iter/s)": 0.005648
},
{
"epoch": 0.22725573745981908,
"grad_norm": 3.099266529083252,
"learning_rate": 0.00019964396859273277,
"logits/chosen": -0.911146879196167,
"logits/rejected": -0.918366551399231,
"logps/chosen": -11.675085067749023,
"logps/rejected": -43.39706802368164,
"loss": 1.0351701974868774,
"memory(GiB)": 46.78,
"nll_loss": 0.6883416175842285,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.11412099003791809,
"rewards/margins": 2.480591297149658,
"rewards/rejected": -2.3664703369140625,
"step": 95,
"train_speed(iter/s)": 0.005648
},
{
"epoch": 0.22964790311729089,
"grad_norm": 2.586851119995117,
"learning_rate": 0.00019962138321435657,
"logits/chosen": -0.8519182205200195,
"logits/rejected": -0.8646640181541443,
"logps/chosen": -9.719616889953613,
"logps/rejected": -47.84657669067383,
"loss": 0.7686633467674255,
"memory(GiB)": 46.78,
"nll_loss": 0.5021700859069824,
"rewards/accuracies": 0.90625,
"rewards/chosen": 0.3157491087913513,
"rewards/margins": 2.579385280609131,
"rewards/rejected": -2.2636361122131348,
"step": 96,
"train_speed(iter/s)": 0.005649
},
{
"epoch": 0.23204006877476266,
"grad_norm": 2.8380484580993652,
"learning_rate": 0.0001995981046838887,
"logits/chosen": -0.8343847990036011,
"logits/rejected": -0.8459703326225281,
"logps/chosen": -18.732688903808594,
"logps/rejected": -45.6234016418457,
"loss": 0.8623945116996765,
"memory(GiB)": 46.78,
"nll_loss": 0.5681560635566711,
"rewards/accuracies": 0.78125,
"rewards/chosen": 0.1901763379573822,
"rewards/margins": 2.299340009689331,
"rewards/rejected": -2.109163522720337,
"step": 97,
"train_speed(iter/s)": 0.005648
},
{
"epoch": 0.23443223443223443,
"grad_norm": 4.969798564910889,
"learning_rate": 0.00019957413316329807,
"logits/chosen": -0.747201681137085,
"logits/rejected": -0.7517687082290649,
"logps/chosen": -17.974029541015625,
"logps/rejected": -45.19165802001953,
"loss": 1.0327142477035522,
"memory(GiB)": 46.78,
"nll_loss": 0.5473703145980835,
"rewards/accuracies": 0.75,
"rewards/chosen": -0.12275683879852295,
"rewards/margins": 2.03201961517334,
"rewards/rejected": -2.1547763347625732,
"step": 98,
"train_speed(iter/s)": 0.005647
},
{
"epoch": 0.2368244000897062,
"grad_norm": 4.590868949890137,
"learning_rate": 0.00019954946881937523,
"logits/chosen": -0.7821736335754395,
"logits/rejected": -0.7837796807289124,
"logps/chosen": -10.349934577941895,
"logps/rejected": -31.049577713012695,
"loss": 0.8570771217346191,
"memory(GiB)": 46.78,
"nll_loss": 0.5170512199401855,
"rewards/accuracies": 0.84375,
"rewards/chosen": 0.12493617832660675,
"rewards/margins": 1.5637221336364746,
"rewards/rejected": -1.4387857913970947,
"step": 99,
"train_speed(iter/s)": 0.005648
},
{
"epoch": 0.23921656574717798,
"grad_norm": 3.0355851650238037,
"learning_rate": 0.00019952411182373137,
"logits/chosen": -0.7416669726371765,
"logits/rejected": -0.7514837980270386,
"logps/chosen": -12.758575439453125,
"logps/rejected": -52.49340057373047,
"loss": 0.7629787921905518,
"memory(GiB)": 46.78,
"nll_loss": 0.4688795804977417,
"rewards/accuracies": 0.90625,
"rewards/chosen": 0.32235589623451233,
"rewards/margins": 2.829197406768799,
"rewards/rejected": -2.5068414211273193,
"step": 100,
"train_speed(iter/s)": 0.005647
},
{
"epoch": 0.24160873140464978,
"grad_norm": 4.2240214347839355,
"learning_rate": 0.000199498062352797,
"logits/chosen": -0.7358923554420471,
"logits/rejected": -0.7415207624435425,
"logps/chosen": -12.469839096069336,
"logps/rejected": -39.323734283447266,
"loss": 0.8776499629020691,
"memory(GiB)": 46.78,
"nll_loss": 0.5749576091766357,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.2892524003982544,
"rewards/margins": 1.7897101640701294,
"rewards/rejected": -1.5004578828811646,
"step": 101,
"train_speed(iter/s)": 0.00564
},
{
"epoch": 0.24400089706212155,
"grad_norm": 4.133398532867432,
"learning_rate": 0.00019947132058782083,
"logits/chosen": -0.7967073321342468,
"logits/rejected": -0.7993899583816528,
"logps/chosen": -9.669886589050293,
"logps/rejected": -25.658836364746094,
"loss": 0.9530386924743652,
"memory(GiB)": 46.78,
"nll_loss": 0.5376937985420227,
"rewards/accuracies": 0.78125,
"rewards/chosen": 0.09255746752023697,
"rewards/margins": 1.1425445079803467,
"rewards/rejected": -1.0499870777130127,
"step": 102,
"train_speed(iter/s)": 0.00564
},
{
"epoch": 0.24639306271959333,
"grad_norm": 4.5498857498168945,
"learning_rate": 0.00019944388671486844,
"logits/chosen": -0.7290014028549194,
"logits/rejected": -0.7364125847816467,
"logps/chosen": -10.035048484802246,
"logps/rejected": -38.11687088012695,
"loss": 0.8911282420158386,
"memory(GiB)": 46.78,
"nll_loss": 0.4538458585739136,
"rewards/accuracies": 0.78125,
"rewards/chosen": 0.18342246115207672,
"rewards/margins": 1.3529313802719116,
"rewards/rejected": -1.169508934020996,
"step": 103,
"train_speed(iter/s)": 0.00564
},
{
"epoch": 0.2487852283770651,
"grad_norm": 2.2867326736450195,
"learning_rate": 0.00019941576092482102,
"logits/chosen": -0.7742420434951782,
"logits/rejected": -0.7834679484367371,
"logps/chosen": -16.7891788482666,
"logps/rejected": -41.97465133666992,
"loss": 0.8852651119232178,
"memory(GiB)": 46.78,
"nll_loss": 0.5684996843338013,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.13892318308353424,
"rewards/margins": 1.5296766757965088,
"rewards/rejected": -1.3907533884048462,
"step": 104,
"train_speed(iter/s)": 0.005638
},
{
"epoch": 0.25117739403453687,
"grad_norm": 2.7168843746185303,
"learning_rate": 0.00019938694341337397,
"logits/chosen": -0.761275053024292,
"logits/rejected": -0.7697631120681763,
"logps/chosen": -7.466435432434082,
"logps/rejected": -35.15258026123047,
"loss": 1.0209513902664185,
"memory(GiB)": 46.78,
"nll_loss": 0.636327862739563,
"rewards/accuracies": 0.84375,
"rewards/chosen": 0.23773828148841858,
"rewards/margins": 1.3149192333221436,
"rewards/rejected": -1.0771809816360474,
"step": 105,
"train_speed(iter/s)": 0.005638
},
{
"epoch": 0.2535695596920087,
"grad_norm": 3.2692759037017822,
"learning_rate": 0.00019935743438103564,
"logits/chosen": -0.7422237992286682,
"logits/rejected": -0.7514990568161011,
"logps/chosen": -10.624504089355469,
"logps/rejected": -45.264095306396484,
"loss": 0.860304057598114,
"memory(GiB)": 46.78,
"nll_loss": 0.5044058561325073,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.3707730770111084,
"rewards/margins": 1.6010938882827759,
"rewards/rejected": -1.230320930480957,
"step": 106,
"train_speed(iter/s)": 0.005637
},
{
"epoch": 0.2559617253494805,
"grad_norm": 2.6627414226531982,
"learning_rate": 0.0001993272340331259,
"logits/chosen": -0.75310879945755,
"logits/rejected": -0.7589280605316162,
"logps/chosen": -11.713288307189941,
"logps/rejected": -42.20861053466797,
"loss": 0.7711183428764343,
"memory(GiB)": 46.78,
"nll_loss": 0.43505772948265076,
"rewards/accuracies": 0.8125,
"rewards/chosen": 0.3599666357040405,
"rewards/margins": 1.9370594024658203,
"rewards/rejected": -1.5770928859710693,
"step": 107,
"train_speed(iter/s)": 0.005638
},
{
"epoch": 0.2583538910069522,
"grad_norm": 10.524235725402832,
"learning_rate": 0.00019929634257977467,
"logits/chosen": -0.7487523555755615,
"logits/rejected": -0.7474150657653809,
"logps/chosen": -13.211384773254395,
"logps/rejected": -29.434967041015625,
"loss": 1.4064631462097168,
"memory(GiB)": 46.78,
"nll_loss": 0.9639731049537659,
"rewards/accuracies": 0.75,
"rewards/chosen": 0.05272696912288666,
"rewards/margins": 1.349626064300537,
"rewards/rejected": -1.2968993186950684,
"step": 108,
"train_speed(iter/s)": 0.005638
},
{
"epoch": 0.260746056664424,
"grad_norm": 3.4797213077545166,
"learning_rate": 0.00019926476023592052,
"logits/chosen": -0.7358635067939758,
"logits/rejected": -0.7399594783782959,
"logps/chosen": -10.68916130065918,
"logps/rejected": -39.55656814575195,
"loss": 0.8483824133872986,
"memory(GiB)": 46.78,
"nll_loss": 0.512445867061615,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.26777422428131104,
"rewards/margins": 1.7832790613174438,
"rewards/rejected": -1.5155047178268433,
"step": 109,
"train_speed(iter/s)": 0.00564
},
{
"epoch": 0.26313822232189576,
"grad_norm": 5.318943023681641,
"learning_rate": 0.00019923248722130907,
"logits/chosen": -0.8071874976158142,
"logits/rejected": -0.8125062584877014,
"logps/chosen": -13.162405967712402,
"logps/rejected": -41.4532356262207,
"loss": 0.6827958822250366,
"memory(GiB)": 46.78,
"nll_loss": 0.39053356647491455,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.33915120363235474,
"rewards/margins": 1.944946050643921,
"rewards/rejected": -1.605794906616211,
"step": 110,
"train_speed(iter/s)": 0.00564
},
{
"epoch": 0.26553038797936757,
"grad_norm": 6.246517658233643,
"learning_rate": 0.0001991995237604916,
"logits/chosen": -0.7993965148925781,
"logits/rejected": -0.8035753965377808,
"logps/chosen": -7.477054595947266,
"logps/rejected": -43.46379089355469,
"loss": 0.6327071785926819,
"memory(GiB)": 46.78,
"nll_loss": 0.3665684461593628,
"rewards/accuracies": 0.8125,
"rewards/chosen": 0.18014857172966003,
"rewards/margins": 2.2636728286743164,
"rewards/rejected": -2.083524227142334,
"step": 111,
"train_speed(iter/s)": 0.005641
},
{
"epoch": 0.26792255363683937,
"grad_norm": 2.495997905731201,
"learning_rate": 0.00019916587008282345,
"logits/chosen": -0.8536009192466736,
"logits/rejected": -0.8555616736412048,
"logps/chosen": -12.577634811401367,
"logps/rejected": -40.71754837036133,
"loss": 0.7153143286705017,
"memory(GiB)": 46.78,
"nll_loss": 0.4246208667755127,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.16410964727401733,
"rewards/margins": 2.231029748916626,
"rewards/rejected": -2.066920042037964,
"step": 112,
"train_speed(iter/s)": 0.005641
},
{
"epoch": 0.2703147192943111,
"grad_norm": 2.619420289993286,
"learning_rate": 0.00019913152642246233,
"logits/chosen": -0.8602064847946167,
"logits/rejected": -0.870837926864624,
"logps/chosen": -10.31131362915039,
"logps/rejected": -69.16264343261719,
"loss": 0.6141177415847778,
"memory(GiB)": 46.78,
"nll_loss": 0.4619813561439514,
"rewards/accuracies": 0.96875,
"rewards/chosen": 0.4243915379047394,
"rewards/margins": 3.666055202484131,
"rewards/rejected": -3.241663694381714,
"step": 113,
"train_speed(iter/s)": 0.00564
},
{
"epoch": 0.2727068849517829,
"grad_norm": 3.2425930500030518,
"learning_rate": 0.00019909649301836675,
"logits/chosen": -0.8935564756393433,
"logits/rejected": -0.8967443108558655,
"logps/chosen": -11.790775299072266,
"logps/rejected": -54.12834930419922,
"loss": 0.6750085353851318,
"memory(GiB)": 46.78,
"nll_loss": 0.44180190563201904,
"rewards/accuracies": 0.90625,
"rewards/chosen": 0.022756237536668777,
"rewards/margins": 2.9651176929473877,
"rewards/rejected": -2.942361354827881,
"step": 114,
"train_speed(iter/s)": 0.005639
},
{
"epoch": 0.2750990506092547,
"grad_norm": 24.632802963256836,
"learning_rate": 0.0001990607701142944,
"logits/chosen": -0.8810749650001526,
"logits/rejected": -0.8888768553733826,
"logps/chosen": -23.208826065063477,
"logps/rejected": -53.65020751953125,
"loss": 1.851314902305603,
"memory(GiB)": 46.78,
"nll_loss": 1.315173625946045,
"rewards/accuracies": 0.78125,
"rewards/chosen": -0.5939430594444275,
"rewards/margins": 2.5491535663604736,
"rewards/rejected": -3.143096685409546,
"step": 115,
"train_speed(iter/s)": 0.005639
},
{
"epoch": 0.27749121626672646,
"grad_norm": 17.350990295410156,
"learning_rate": 0.00019902435795880044,
"logits/chosen": -0.9093245267868042,
"logits/rejected": -0.9126628637313843,
"logps/chosen": -16.813339233398438,
"logps/rejected": -48.75463104248047,
"loss": 1.4077650308609009,
"memory(GiB)": 46.78,
"nll_loss": 1.050284743309021,
"rewards/accuracies": 0.8125,
"rewards/chosen": -0.2693726122379303,
"rewards/margins": 2.530968427658081,
"rewards/rejected": -2.8003406524658203,
"step": 116,
"train_speed(iter/s)": 0.005638
},
{
"epoch": 0.27988338192419826,
"grad_norm": 4.22681188583374,
"learning_rate": 0.00019898725680523568,
"logits/chosen": -0.8980717062950134,
"logits/rejected": -0.9024423956871033,
"logps/chosen": -17.1817626953125,
"logps/rejected": -39.5125732421875,
"loss": 1.0394302606582642,
"memory(GiB)": 46.78,
"nll_loss": 0.6766522526741028,
"rewards/accuracies": 0.78125,
"rewards/chosen": 0.015612306073307991,
"rewards/margins": 2.2480926513671875,
"rewards/rejected": -2.23248028755188,
"step": 117,
"train_speed(iter/s)": 0.005637
},
{
"epoch": 0.28227554758167,
"grad_norm": 4.9705047607421875,
"learning_rate": 0.00019894946691174494,
"logits/chosen": -0.9122129082679749,
"logits/rejected": -0.9150456190109253,
"logps/chosen": -14.797954559326172,
"logps/rejected": -38.31578826904297,
"loss": 1.0148959159851074,
"memory(GiB)": 46.78,
"nll_loss": 0.6429183483123779,
"rewards/accuracies": 0.78125,
"rewards/chosen": -0.06372372806072235,
"rewards/margins": 2.232508659362793,
"rewards/rejected": -2.296232223510742,
"step": 118,
"train_speed(iter/s)": 0.005637
},
{
"epoch": 0.2846677132391418,
"grad_norm": 5.455178737640381,
"learning_rate": 0.00019891098854126518,
"logits/chosen": -0.8895492553710938,
"logits/rejected": -0.8904259204864502,
"logps/chosen": -15.091131210327148,
"logps/rejected": -40.248023986816406,
"loss": 1.0479692220687866,
"memory(GiB)": 46.78,
"nll_loss": 0.5974382758140564,
"rewards/accuracies": 0.78125,
"rewards/chosen": -0.1267915964126587,
"rewards/margins": 1.8017388582229614,
"rewards/rejected": -1.9285303354263306,
"step": 119,
"train_speed(iter/s)": 0.005634
},
{
"epoch": 0.2870598788966136,
"grad_norm": 3.6146156787872314,
"learning_rate": 0.00019887182196152368,
"logits/chosen": -0.8824920654296875,
"logits/rejected": -0.8917353749275208,
"logps/chosen": -7.259885311126709,
"logps/rejected": -55.807106018066406,
"loss": 0.6745078563690186,
"memory(GiB)": 46.78,
"nll_loss": 0.3909413814544678,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.12902025878429413,
"rewards/margins": 2.945380210876465,
"rewards/rejected": -2.8163604736328125,
"step": 120,
"train_speed(iter/s)": 0.005634
},
{
"epoch": 0.28945204455408535,
"grad_norm": 2.7159321308135986,
"learning_rate": 0.0001988319674450362,
"logits/chosen": -0.8625448942184448,
"logits/rejected": -0.8625946640968323,
"logps/chosen": -14.481998443603516,
"logps/rejected": -32.343990325927734,
"loss": 0.8893653750419617,
"memory(GiB)": 46.78,
"nll_loss": 0.5466328859329224,
"rewards/accuracies": 0.8125,
"rewards/chosen": 0.1943284571170807,
"rewards/margins": 1.5906785726547241,
"rewards/rejected": -1.3963501453399658,
"step": 121,
"train_speed(iter/s)": 0.005634
},
{
"epoch": 0.29184421021155715,
"grad_norm": 3.480830430984497,
"learning_rate": 0.0001987914252691051,
"logits/chosen": -0.854420006275177,
"logits/rejected": -0.8605158925056458,
"logps/chosen": -11.787839889526367,
"logps/rejected": -43.2979850769043,
"loss": 0.7196720838546753,
"memory(GiB)": 46.78,
"nll_loss": 0.5012603402137756,
"rewards/accuracies": 0.96875,
"rewards/chosen": 0.2540440559387207,
"rewards/margins": 2.362658977508545,
"rewards/rejected": -2.1086151599884033,
"step": 122,
"train_speed(iter/s)": 0.005633
},
{
"epoch": 0.29423637586902895,
"grad_norm": 3.526841163635254,
"learning_rate": 0.00019875019571581728,
"logits/chosen": -0.8358349204063416,
"logits/rejected": -0.8408463597297668,
"logps/chosen": -10.75222110748291,
"logps/rejected": -39.87123489379883,
"loss": 0.8948889970779419,
"memory(GiB)": 46.78,
"nll_loss": 0.5788209438323975,
"rewards/accuracies": 0.84375,
"rewards/chosen": 0.15971140563488007,
"rewards/margins": 2.309971809387207,
"rewards/rejected": -2.1502604484558105,
"step": 123,
"train_speed(iter/s)": 0.005633
},
{
"epoch": 0.2966285415265007,
"grad_norm": 2.6714415550231934,
"learning_rate": 0.00019870827907204243,
"logits/chosen": -0.8233751654624939,
"logits/rejected": -0.8268409967422485,
"logps/chosen": -7.600090503692627,
"logps/rejected": -23.002704620361328,
"loss": 0.8616309762001038,
"memory(GiB)": 46.78,
"nll_loss": 0.43116894364356995,
"rewards/accuracies": 0.78125,
"rewards/chosen": 0.28889453411102295,
"rewards/margins": 1.081323504447937,
"rewards/rejected": -0.7924288511276245,
"step": 124,
"train_speed(iter/s)": 0.005633
},
{
"epoch": 0.2990207071839725,
"grad_norm": 2.5394530296325684,
"learning_rate": 0.0001986656756294309,
"logits/chosen": -0.8398711085319519,
"logits/rejected": -0.8451254963874817,
"logps/chosen": -9.005830764770508,
"logps/rejected": -33.04253387451172,
"loss": 0.8945890665054321,
"memory(GiB)": 46.78,
"nll_loss": 0.4701317250728607,
"rewards/accuracies": 0.75,
"rewards/chosen": 0.3293447494506836,
"rewards/margins": 1.3195619583129883,
"rewards/rejected": -0.9902173280715942,
"step": 125,
"train_speed(iter/s)": 0.005633
},
{
"epoch": 0.30141287284144425,
"grad_norm": 2.8723111152648926,
"learning_rate": 0.00019862238568441165,
"logits/chosen": -0.815192699432373,
"logits/rejected": -0.8217712044715881,
"logps/chosen": -9.070804595947266,
"logps/rejected": -33.22805404663086,
"loss": 0.7637823820114136,
"memory(GiB)": 46.78,
"nll_loss": 0.38797256350517273,
"rewards/accuracies": 0.84375,
"rewards/chosen": 0.17756348848342896,
"rewards/margins": 1.2646557092666626,
"rewards/rejected": -1.0870922803878784,
"step": 126,
"train_speed(iter/s)": 0.005633
},
{
"epoch": 0.30380503849891605,
"grad_norm": 2.79227614402771,
"learning_rate": 0.00019857840953819026,
"logits/chosen": -0.8166335821151733,
"logits/rejected": -0.8273878693580627,
"logps/chosen": -9.302844047546387,
"logps/rejected": -32.995567321777344,
"loss": 0.7958816289901733,
"memory(GiB)": 46.78,
"nll_loss": 0.4939688444137573,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.3217732310295105,
"rewards/margins": 1.6436134576797485,
"rewards/rejected": -1.3218401670455933,
"step": 127,
"train_speed(iter/s)": 0.005633
},
{
"epoch": 0.30619720415638785,
"grad_norm": 2.4456770420074463,
"learning_rate": 0.00019853374749674677,
"logits/chosen": -0.8173456192016602,
"logits/rejected": -0.8242702484130859,
"logps/chosen": -10.526348114013672,
"logps/rejected": -49.73170471191406,
"loss": 0.6932899951934814,
"memory(GiB)": 46.78,
"nll_loss": 0.410495400428772,
"rewards/accuracies": 0.84375,
"rewards/chosen": 0.2942225933074951,
"rewards/margins": 2.532844305038452,
"rewards/rejected": -2.238621711730957,
"step": 128,
"train_speed(iter/s)": 0.005634
},
{
"epoch": 0.3085893698138596,
"grad_norm": 9.124894142150879,
"learning_rate": 0.00019848839987083366,
"logits/chosen": -0.8869707584381104,
"logits/rejected": -0.8904052376747131,
"logps/chosen": -15.062342643737793,
"logps/rejected": -45.34114456176758,
"loss": 1.0228577852249146,
"memory(GiB)": 46.78,
"nll_loss": 0.5322936773300171,
"rewards/accuracies": 0.84375,
"rewards/chosen": -0.14518728852272034,
"rewards/margins": 2.259458541870117,
"rewards/rejected": -2.4046459197998047,
"step": 129,
"train_speed(iter/s)": 0.005633
},
{
"epoch": 0.3109815354713314,
"grad_norm": 3.8776865005493164,
"learning_rate": 0.00019844236697597354,
"logits/chosen": -0.8990283012390137,
"logits/rejected": -0.912631630897522,
"logps/chosen": -9.924826622009277,
"logps/rejected": -59.806114196777344,
"loss": 0.6793578863143921,
"memory(GiB)": 46.78,
"nll_loss": 0.4696520268917084,
"rewards/accuracies": 0.90625,
"rewards/chosen": 0.21068614721298218,
"rewards/margins": 3.6280405521392822,
"rewards/rejected": -3.4173545837402344,
"step": 130,
"train_speed(iter/s)": 0.005633
},
{
"epoch": 0.3133737011288032,
"grad_norm": 5.517581462860107,
"learning_rate": 0.0001983956491324571,
"logits/chosen": -0.890454888343811,
"logits/rejected": -0.8954933881759644,
"logps/chosen": -11.391611099243164,
"logps/rejected": -50.16078567504883,
"loss": 0.9601025581359863,
"memory(GiB)": 46.78,
"nll_loss": 0.588812530040741,
"rewards/accuracies": 0.78125,
"rewards/chosen": 0.01075834035873413,
"rewards/margins": 3.3035926818847656,
"rewards/rejected": -3.292834758758545,
"step": 131,
"train_speed(iter/s)": 0.005634
},
{
"epoch": 0.31576586678627494,
"grad_norm": 2.991635322570801,
"learning_rate": 0.0001983482466653407,
"logits/chosen": -0.8738813400268555,
"logits/rejected": -0.870830774307251,
"logps/chosen": -8.894745826721191,
"logps/rejected": -39.2451171875,
"loss": 0.6562129855155945,
"memory(GiB)": 46.78,
"nll_loss": 0.34973058104515076,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.2841479778289795,
"rewards/margins": 2.604597330093384,
"rewards/rejected": -2.3204493522644043,
"step": 132,
"train_speed(iter/s)": 0.005635
},
{
"epoch": 0.31815803244374674,
"grad_norm": 8.708478927612305,
"learning_rate": 0.00019830015990444434,
"logits/chosen": -0.8821411728858948,
"logits/rejected": -0.891589879989624,
"logps/chosen": -18.36916732788086,
"logps/rejected": -58.93795394897461,
"loss": 0.8125941753387451,
"memory(GiB)": 46.78,
"nll_loss": 0.6013258695602417,
"rewards/accuracies": 0.9375,
"rewards/chosen": -0.01710733026266098,
"rewards/margins": 2.8880860805511475,
"rewards/rejected": -2.905193567276001,
"step": 133,
"train_speed(iter/s)": 0.005635
},
{
"epoch": 0.3205501981012185,
"grad_norm": 5.8355326652526855,
"learning_rate": 0.00019825138918434915,
"logits/chosen": -0.8907016515731812,
"logits/rejected": -0.9023689031600952,
"logps/chosen": -7.357381343841553,
"logps/rejected": -43.13167190551758,
"loss": 0.8315655589103699,
"memory(GiB)": 46.78,
"nll_loss": 0.5653954148292542,
"rewards/accuracies": 0.90625,
"rewards/chosen": 0.18780827522277832,
"rewards/margins": 2.5148556232452393,
"rewards/rejected": -2.327047348022461,
"step": 134,
"train_speed(iter/s)": 0.005634
},
{
"epoch": 0.3229423637586903,
"grad_norm": 5.084504127502441,
"learning_rate": 0.0001982019348443952,
"logits/chosen": -0.8744340538978577,
"logits/rejected": -0.8839950561523438,
"logps/chosen": -11.753833770751953,
"logps/rejected": -50.23076248168945,
"loss": 0.900967001914978,
"memory(GiB)": 46.78,
"nll_loss": 0.6376667618751526,
"rewards/accuracies": 0.90625,
"rewards/chosen": 0.2352873831987381,
"rewards/margins": 2.9518003463745117,
"rewards/rejected": -2.71651291847229,
"step": 135,
"train_speed(iter/s)": 0.005634
},
{
"epoch": 0.3253345294161621,
"grad_norm": 7.443116664886475,
"learning_rate": 0.00019815179722867913,
"logits/chosen": -0.8482657670974731,
"logits/rejected": -0.8486264944076538,
"logps/chosen": -13.961491584777832,
"logps/rejected": -33.860713958740234,
"loss": 1.0923020839691162,
"memory(GiB)": 46.78,
"nll_loss": 0.626233696937561,
"rewards/accuracies": 0.75,
"rewards/chosen": 0.035439833998680115,
"rewards/margins": 1.6097826957702637,
"rewards/rejected": -1.574342966079712,
"step": 136,
"train_speed(iter/s)": 0.005634
},
{
"epoch": 0.32772669507363383,
"grad_norm": 6.069121360778809,
"learning_rate": 0.0001981009766860517,
"logits/chosen": -0.8712698817253113,
"logits/rejected": -0.8716377019882202,
"logps/chosen": -12.955726623535156,
"logps/rejected": -39.7027587890625,
"loss": 1.063010811805725,
"memory(GiB)": 46.78,
"nll_loss": 0.7573559284210205,
"rewards/accuracies": 0.84375,
"rewards/chosen": -0.1307298243045807,
"rewards/margins": 2.164278507232666,
"rewards/rejected": -2.295008420944214,
"step": 137,
"train_speed(iter/s)": 0.005634
},
{
"epoch": 0.33011886073110563,
"grad_norm": 4.233928203582764,
"learning_rate": 0.00019804947357011522,
"logits/chosen": -0.8236069679260254,
"logits/rejected": -0.834182858467102,
"logps/chosen": -11.049253463745117,
"logps/rejected": -44.08565902709961,
"loss": 0.8465083241462708,
"memory(GiB)": 46.78,
"nll_loss": 0.5441975593566895,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.11046641319990158,
"rewards/margins": 2.231780767440796,
"rewards/rejected": -2.121314525604248,
"step": 138,
"train_speed(iter/s)": 0.005633
},
{
"epoch": 0.33251102638857744,
"grad_norm": 4.2061309814453125,
"learning_rate": 0.00019799728823922155,
"logits/chosen": -0.8435903191566467,
"logits/rejected": -0.8470354080200195,
"logps/chosen": -8.918343544006348,
"logps/rejected": -36.74750900268555,
"loss": 0.7144109010696411,
"memory(GiB)": 46.78,
"nll_loss": 0.40702298283576965,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.38820797204971313,
"rewards/margins": 1.9121365547180176,
"rewards/rejected": -1.5239286422729492,
"step": 139,
"train_speed(iter/s)": 0.005634
},
{
"epoch": 0.3349031920460492,
"grad_norm": 4.416022300720215,
"learning_rate": 0.0001979444210564691,
"logits/chosen": -0.7840769290924072,
"logits/rejected": -0.7934098839759827,
"logps/chosen": -8.80458927154541,
"logps/rejected": -47.96394348144531,
"loss": 0.6305175423622131,
"memory(GiB)": 46.78,
"nll_loss": 0.46931201219558716,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.1097404956817627,
"rewards/margins": 2.367628335952759,
"rewards/rejected": -2.257887840270996,
"step": 140,
"train_speed(iter/s)": 0.005636
},
{
"epoch": 0.337295357703521,
"grad_norm": 4.785271644592285,
"learning_rate": 0.00019789087238970054,
"logits/chosen": -0.8002479076385498,
"logits/rejected": -0.8085525035858154,
"logps/chosen": -13.70367431640625,
"logps/rejected": -50.61127853393555,
"loss": 0.9849874377250671,
"memory(GiB)": 46.78,
"nll_loss": 0.6505732536315918,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.002065986394882202,
"rewards/margins": 2.2779290676116943,
"rewards/rejected": -2.2758634090423584,
"step": 141,
"train_speed(iter/s)": 0.005636
},
{
"epoch": 0.3396875233609927,
"grad_norm": 4.302982330322266,
"learning_rate": 0.0001978366426115003,
"logits/chosen": -0.7700361013412476,
"logits/rejected": -0.7705273628234863,
"logps/chosen": -7.580388069152832,
"logps/rejected": -34.4312744140625,
"loss": 0.5671791434288025,
"memory(GiB)": 46.78,
"nll_loss": 0.33011525869369507,
"rewards/accuracies": 0.90625,
"rewards/chosen": 0.3449672758579254,
"rewards/margins": 2.0864133834838867,
"rewards/rejected": -1.7414460182189941,
"step": 142,
"train_speed(iter/s)": 0.005637
},
{
"epoch": 0.34207968901846453,
"grad_norm": 4.768328666687012,
"learning_rate": 0.00019778173209919174,
"logits/chosen": -0.7594372034072876,
"logits/rejected": -0.7637089490890503,
"logps/chosen": -14.413496971130371,
"logps/rejected": -35.399288177490234,
"loss": 0.8721976280212402,
"memory(GiB)": 46.78,
"nll_loss": 0.6180708408355713,
"rewards/accuracies": 0.90625,
"rewards/chosen": 0.4894520044326782,
"rewards/margins": 1.8526508808135986,
"rewards/rejected": -1.3631988763809204,
"step": 143,
"train_speed(iter/s)": 0.005636
},
{
"epoch": 0.34447185467593633,
"grad_norm": 2.74961519241333,
"learning_rate": 0.00019772614123483487,
"logits/chosen": -0.778110146522522,
"logits/rejected": -0.7844111919403076,
"logps/chosen": -15.620856285095215,
"logps/rejected": -41.484710693359375,
"loss": 0.7825542092323303,
"memory(GiB)": 46.78,
"nll_loss": 0.49021872878074646,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.1902773678302765,
"rewards/margins": 1.998608112335205,
"rewards/rejected": -1.808330774307251,
"step": 144,
"train_speed(iter/s)": 0.005634
},
{
"epoch": 0.3468640203334081,
"grad_norm": 4.053314208984375,
"learning_rate": 0.00019766987040522333,
"logits/chosen": -0.8054400682449341,
"logits/rejected": -0.8061996698379517,
"logps/chosen": -11.948256492614746,
"logps/rejected": -25.110414505004883,
"loss": 1.033211350440979,
"memory(GiB)": 46.78,
"nll_loss": 0.6106947064399719,
"rewards/accuracies": 0.78125,
"rewards/chosen": 0.13057959079742432,
"rewards/margins": 1.2587168216705322,
"rewards/rejected": -1.128137230873108,
"step": 145,
"train_speed(iter/s)": 0.005634
},
{
"epoch": 0.3492561859908799,
"grad_norm": 2.9867749214172363,
"learning_rate": 0.00019761292000188197,
"logits/chosen": -0.8127353191375732,
"logits/rejected": -0.8201886415481567,
"logps/chosen": -16.549510955810547,
"logps/rejected": -38.11656188964844,
"loss": 0.9068831205368042,
"memory(GiB)": 46.78,
"nll_loss": 0.5614981055259705,
"rewards/accuracies": 0.84375,
"rewards/chosen": 0.20250406861305237,
"rewards/margins": 1.7395099401474,
"rewards/rejected": -1.5370057821273804,
"step": 146,
"train_speed(iter/s)": 0.005634
},
{
"epoch": 0.3516483516483517,
"grad_norm": 2.311192750930786,
"learning_rate": 0.00019755529042106394,
"logits/chosen": -0.7973526120185852,
"logits/rejected": -0.800200343132019,
"logps/chosen": -7.481082916259766,
"logps/rejected": -31.512645721435547,
"loss": 0.7267748713493347,
"memory(GiB)": 46.78,
"nll_loss": 0.36258465051651,
"rewards/accuracies": 0.84375,
"rewards/chosen": 0.21067243814468384,
"rewards/margins": 1.607694149017334,
"rewards/rejected": -1.3970215320587158,
"step": 147,
"train_speed(iter/s)": 0.005632
},
{
"epoch": 0.3540405173058234,
"grad_norm": 2.8598074913024902,
"learning_rate": 0.00019749698206374808,
"logits/chosen": -0.849799633026123,
"logits/rejected": -0.8563861846923828,
"logps/chosen": -9.258435249328613,
"logps/rejected": -43.992244720458984,
"loss": 0.6600675582885742,
"memory(GiB)": 46.78,
"nll_loss": 0.4354017972946167,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.33977681398391724,
"rewards/margins": 2.25696063041687,
"rewards/rejected": -1.9171836376190186,
"step": 148,
"train_speed(iter/s)": 0.005633
},
{
"epoch": 0.3564326829632952,
"grad_norm": 2.3342740535736084,
"learning_rate": 0.00019743799533563603,
"logits/chosen": -0.8605116605758667,
"logits/rejected": -0.8653464913368225,
"logps/chosen": -7.782684326171875,
"logps/rejected": -37.683738708496094,
"loss": 0.6275639533996582,
"memory(GiB)": 46.78,
"nll_loss": 0.4273594915866852,
"rewards/accuracies": 0.96875,
"rewards/chosen": 0.4285268187522888,
"rewards/margins": 2.251387357711792,
"rewards/rejected": -1.8228604793548584,
"step": 149,
"train_speed(iter/s)": 0.005632
},
{
"epoch": 0.35882484862076697,
"grad_norm": 4.0247483253479,
"learning_rate": 0.0001973783306471495,
"logits/chosen": -0.8887797594070435,
"logits/rejected": -0.898193895816803,
"logps/chosen": -8.930159568786621,
"logps/rejected": -43.03559112548828,
"loss": 0.7508974671363831,
"memory(GiB)": 46.78,
"nll_loss": 0.518282413482666,
"rewards/accuracies": 0.96875,
"rewards/chosen": 0.28456175327301025,
"rewards/margins": 2.084869146347046,
"rewards/rejected": -1.8003073930740356,
"step": 150,
"train_speed(iter/s)": 0.005634
}
],
"logging_steps": 1,
"max_steps": 1254,
"num_input_tokens_seen": 0,
"num_train_epochs": 3,
"save_steps": 50,
"stateful_callbacks": {
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": true,
"should_training_stop": false
},
"attributes": {}
}
},
"total_flos": 1.0456400650462822e+18,
"train_batch_size": 1,
"trial_name": null,
"trial_params": null
}