PEFT
Safetensors
task3f2-550 / trainer_state.json
windgrin's picture
Upload folder using huggingface_hub
95c161f verified
Raw
History Blame Contribute Delete
353 kB
{
"best_global_step": 300,
"best_metric": 0.73294115,
"best_model_checkpoint": "/data2/kdd/crag/cjz/output/task3_dpo_gt6_task2_gt30.3+task3gt5_0.1vp_idk0614.json/v0-20250614-165413/checkpoint-300",
"epoch": 0.44376087340208265,
"eval_steps": 300,
"global_step": 550,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"epoch": 0.0008068379516401503,
"grad_norm": 9.261910438537598,
"learning_rate": 3.225806451612903e-06,
"logits/chosen": -0.6039718985557556,
"logits/rejected": -0.6058337688446045,
"logps/chosen": -7.412725925445557,
"logps/rejected": -11.413676261901855,
"loss": 1.2381761074066162,
"memory(GiB)": 46.32,
"nll_loss": 0.5450288653373718,
"rewards/accuracies": 0.0,
"rewards/chosen": 0.0,
"rewards/margins": 0.0,
"rewards/rejected": 0.0,
"step": 1,
"train_speed(iter/s)": 0.005524
},
{
"epoch": 0.0016136759032803006,
"grad_norm": 5.391567230224609,
"learning_rate": 6.451612903225806e-06,
"logits/chosen": -0.6199994087219238,
"logits/rejected": -0.6217825412750244,
"logps/chosen": -7.599736213684082,
"logps/rejected": -15.575040817260742,
"loss": 1.1066936254501343,
"memory(GiB)": 46.83,
"nll_loss": 0.41354650259017944,
"rewards/accuracies": 0.0,
"rewards/chosen": 0.0,
"rewards/margins": 0.0,
"rewards/rejected": 0.0,
"step": 2,
"train_speed(iter/s)": 0.005546
},
{
"epoch": 0.002420513854920451,
"grad_norm": 6.5534772872924805,
"learning_rate": 9.67741935483871e-06,
"logits/chosen": -0.6068329811096191,
"logits/rejected": -0.6103144288063049,
"logps/chosen": -11.938759803771973,
"logps/rejected": -14.32825756072998,
"loss": 1.267569661140442,
"memory(GiB)": 46.83,
"nll_loss": 0.5742746591567993,
"rewards/accuracies": 0.5,
"rewards/chosen": 0.0005358309717848897,
"rewards/margins": -0.00011114418157376349,
"rewards/rejected": 0.0006469750078395009,
"step": 3,
"train_speed(iter/s)": 0.005487
},
{
"epoch": 0.003227351806560601,
"grad_norm": 3.4633655548095703,
"learning_rate": 1.2903225806451613e-05,
"logits/chosen": -0.6417700052261353,
"logits/rejected": -0.638687789440155,
"logps/chosen": -10.244372367858887,
"logps/rejected": -8.448144912719727,
"loss": 1.1101956367492676,
"memory(GiB)": 46.83,
"nll_loss": 0.4145403802394867,
"rewards/accuracies": 0.40625,
"rewards/chosen": -0.002526381518691778,
"rewards/margins": -0.004837517160922289,
"rewards/rejected": 0.0023111351765692234,
"step": 4,
"train_speed(iter/s)": 0.005482
},
{
"epoch": 0.004034189758200751,
"grad_norm": 9.884061813354492,
"learning_rate": 1.6129032258064517e-05,
"logits/chosen": -0.6263395547866821,
"logits/rejected": -0.6316207647323608,
"logps/chosen": -8.768255233764648,
"logps/rejected": -12.074126243591309,
"loss": 1.2384487390518188,
"memory(GiB)": 46.83,
"nll_loss": 0.5502734780311584,
"rewards/accuracies": 0.53125,
"rewards/chosen": 0.011151458136737347,
"rewards/margins": 0.010235130786895752,
"rewards/rejected": 0.0009163276990875602,
"step": 5,
"train_speed(iter/s)": 0.005496
},
{
"epoch": 0.004841027709840902,
"grad_norm": 9.879764556884766,
"learning_rate": 1.935483870967742e-05,
"logits/chosen": -0.6110924482345581,
"logits/rejected": -0.6128084063529968,
"logps/chosen": -11.146334648132324,
"logps/rejected": -12.724503517150879,
"loss": 1.246738314628601,
"memory(GiB)": 46.83,
"nll_loss": 0.5631918907165527,
"rewards/accuracies": 0.65625,
"rewards/chosen": 0.02471097745001316,
"rewards/margins": 0.02056196704506874,
"rewards/rejected": 0.004149014595896006,
"step": 6,
"train_speed(iter/s)": 0.005505
},
{
"epoch": 0.0056478656614810515,
"grad_norm": 3.7321648597717285,
"learning_rate": 2.258064516129032e-05,
"logits/chosen": -0.6434396505355835,
"logits/rejected": -0.6456248164176941,
"logps/chosen": -12.346940994262695,
"logps/rejected": -13.585854530334473,
"loss": 1.25950026512146,
"memory(GiB)": 46.83,
"nll_loss": 0.5602214932441711,
"rewards/accuracies": 0.46875,
"rewards/chosen": 0.01709746941924095,
"rewards/margins": -0.004833616316318512,
"rewards/rejected": 0.021931089460849762,
"step": 7,
"train_speed(iter/s)": 0.005511
},
{
"epoch": 0.006454703613121202,
"grad_norm": 6.577890872955322,
"learning_rate": 2.5806451612903226e-05,
"logits/chosen": -0.6166916489601135,
"logits/rejected": -0.6146227717399597,
"logps/chosen": -16.807830810546875,
"logps/rejected": -11.38271427154541,
"loss": 1.2828420400619507,
"memory(GiB)": 46.83,
"nll_loss": 0.5101535320281982,
"rewards/accuracies": 0.25,
"rewards/chosen": -0.04314221069216728,
"rewards/margins": -0.13309986889362335,
"rewards/rejected": 0.08995765447616577,
"step": 8,
"train_speed(iter/s)": 0.005502
},
{
"epoch": 0.007261541564761352,
"grad_norm": 3.5513713359832764,
"learning_rate": 2.9032258064516133e-05,
"logits/chosen": -0.5994153022766113,
"logits/rejected": -0.6015004515647888,
"logps/chosen": -11.679065704345703,
"logps/rejected": -12.411300659179688,
"loss": 1.171980857849121,
"memory(GiB)": 46.83,
"nll_loss": 0.4982386827468872,
"rewards/accuracies": 0.5625,
"rewards/chosen": 0.035934723913669586,
"rewards/margins": 0.08020534366369247,
"rewards/rejected": -0.04427062347531319,
"step": 9,
"train_speed(iter/s)": 0.005483
},
{
"epoch": 0.008068379516401502,
"grad_norm": 7.633578777313232,
"learning_rate": 3.2258064516129034e-05,
"logits/chosen": -0.6122820377349854,
"logits/rejected": -0.6125556826591492,
"logps/chosen": -12.382171630859375,
"logps/rejected": -10.675874710083008,
"loss": 1.3903008699417114,
"memory(GiB)": 46.83,
"nll_loss": 0.6006877422332764,
"rewards/accuracies": 0.375,
"rewards/chosen": -0.08313174545764923,
"rewards/margins": -0.13078533113002777,
"rewards/rejected": 0.04765357822179794,
"step": 10,
"train_speed(iter/s)": 0.005494
},
{
"epoch": 0.008875217468041654,
"grad_norm": 4.818623065948486,
"learning_rate": 3.548387096774194e-05,
"logits/chosen": -0.6364253759384155,
"logits/rejected": -0.6395613551139832,
"logps/chosen": -7.883171558380127,
"logps/rejected": -15.457681655883789,
"loss": 1.1344804763793945,
"memory(GiB)": 46.83,
"nll_loss": 0.46768438816070557,
"rewards/accuracies": 0.53125,
"rewards/chosen": 0.008294675499200821,
"rewards/margins": 0.10872506350278854,
"rewards/rejected": -0.10043041408061981,
"step": 11,
"train_speed(iter/s)": 0.00549
},
{
"epoch": 0.009682055419681803,
"grad_norm": 3.8297243118286133,
"learning_rate": 3.870967741935484e-05,
"logits/chosen": -0.6082768440246582,
"logits/rejected": -0.6128782629966736,
"logps/chosen": -10.993257522583008,
"logps/rejected": -14.49487018585205,
"loss": 1.1111013889312744,
"memory(GiB)": 46.83,
"nll_loss": 0.42791634798049927,
"rewards/accuracies": 0.46875,
"rewards/chosen": -0.013819348067045212,
"rewards/margins": 0.08211039006710052,
"rewards/rejected": -0.09592973440885544,
"step": 12,
"train_speed(iter/s)": 0.005476
},
{
"epoch": 0.010488893371321953,
"grad_norm": 3.1733834743499756,
"learning_rate": 4.1935483870967746e-05,
"logits/chosen": -0.597683846950531,
"logits/rejected": -0.6003975868225098,
"logps/chosen": -7.611721038818359,
"logps/rejected": -13.589990615844727,
"loss": 0.9966970682144165,
"memory(GiB)": 46.83,
"nll_loss": 0.3590569496154785,
"rewards/accuracies": 0.65625,
"rewards/chosen": 0.09378139674663544,
"rewards/margins": 0.16571055352687836,
"rewards/rejected": -0.07192917168140411,
"step": 13,
"train_speed(iter/s)": 0.005488
},
{
"epoch": 0.011295731322962103,
"grad_norm": 5.364157676696777,
"learning_rate": 4.516129032258064e-05,
"logits/chosen": -0.5847792029380798,
"logits/rejected": -0.5856592655181885,
"logps/chosen": -11.617069244384766,
"logps/rejected": -11.611367225646973,
"loss": 1.2788419723510742,
"memory(GiB)": 46.83,
"nll_loss": 0.5410674214363098,
"rewards/accuracies": 0.46875,
"rewards/chosen": 0.037577953189611435,
"rewards/margins": -0.04553454369306564,
"rewards/rejected": 0.08311249315738678,
"step": 14,
"train_speed(iter/s)": 0.005494
},
{
"epoch": 0.012102569274602255,
"grad_norm": 3.436879873275757,
"learning_rate": 4.8387096774193554e-05,
"logits/chosen": -0.5832479596138,
"logits/rejected": -0.5832363367080688,
"logps/chosen": -9.650967597961426,
"logps/rejected": -11.376352310180664,
"loss": 1.0634793043136597,
"memory(GiB)": 46.83,
"nll_loss": 0.34024038910865784,
"rewards/accuracies": 0.53125,
"rewards/chosen": 0.05362201854586601,
"rewards/margins": -0.029222950339317322,
"rewards/rejected": 0.08284495770931244,
"step": 15,
"train_speed(iter/s)": 0.005497
},
{
"epoch": 0.012909407226242404,
"grad_norm": 3.2199597358703613,
"learning_rate": 5.161290322580645e-05,
"logits/chosen": -0.6036816239356995,
"logits/rejected": -0.606670618057251,
"logps/chosen": -10.059551239013672,
"logps/rejected": -16.143247604370117,
"loss": 1.0622740983963013,
"memory(GiB)": 46.83,
"nll_loss": 0.3808459937572479,
"rewards/accuracies": 0.625,
"rewards/chosen": 0.11249684542417526,
"rewards/margins": 0.040876831859350204,
"rewards/rejected": 0.07162001729011536,
"step": 16,
"train_speed(iter/s)": 0.00549
},
{
"epoch": 0.013716245177882554,
"grad_norm": 3.376516819000244,
"learning_rate": 5.4838709677419355e-05,
"logits/chosen": -0.5811513662338257,
"logits/rejected": -0.5822936296463013,
"logps/chosen": -10.964933395385742,
"logps/rejected": -13.541594505310059,
"loss": 1.1284891366958618,
"memory(GiB)": 46.83,
"nll_loss": 0.43761852383613586,
"rewards/accuracies": 0.5,
"rewards/chosen": 0.11780606210231781,
"rewards/margins": 0.02046366035938263,
"rewards/rejected": 0.09734240174293518,
"step": 17,
"train_speed(iter/s)": 0.005493
},
{
"epoch": 0.014523083129522704,
"grad_norm": 3.292140245437622,
"learning_rate": 5.8064516129032266e-05,
"logits/chosen": -0.5822582840919495,
"logits/rejected": -0.5867500305175781,
"logps/chosen": -8.11985969543457,
"logps/rejected": -14.659163475036621,
"loss": 1.0471278429031372,
"memory(GiB)": 46.83,
"nll_loss": 0.40266352891921997,
"rewards/accuracies": 0.65625,
"rewards/chosen": 0.14493001997470856,
"rewards/margins": 0.1153046265244484,
"rewards/rejected": 0.029625393450260162,
"step": 18,
"train_speed(iter/s)": 0.005497
},
{
"epoch": 0.015329921081162856,
"grad_norm": 3.320802688598633,
"learning_rate": 6.129032258064517e-05,
"logits/chosen": -0.5760956406593323,
"logits/rejected": -0.5776647925376892,
"logps/chosen": -9.478979110717773,
"logps/rejected": -11.301219940185547,
"loss": 1.1243548393249512,
"memory(GiB)": 46.83,
"nll_loss": 0.48838871717453003,
"rewards/accuracies": 0.6875,
"rewards/chosen": 0.20540697872638702,
"rewards/margins": 0.14464649558067322,
"rewards/rejected": 0.06076047942042351,
"step": 19,
"train_speed(iter/s)": 0.005493
},
{
"epoch": 0.016136759032803004,
"grad_norm": 2.7910656929016113,
"learning_rate": 6.451612903225807e-05,
"logits/chosen": -0.5840404033660889,
"logits/rejected": -0.582589864730835,
"logps/chosen": -13.635812759399414,
"logps/rejected": -10.431557655334473,
"loss": 1.2548669576644897,
"memory(GiB)": 46.83,
"nll_loss": 0.55869460105896,
"rewards/accuracies": 0.4375,
"rewards/chosen": 0.13213564455509186,
"rewards/margins": 0.044300854206085205,
"rewards/rejected": 0.08783479034900665,
"step": 20,
"train_speed(iter/s)": 0.005497
},
{
"epoch": 0.016943596984443157,
"grad_norm": 2.2573604583740234,
"learning_rate": 6.774193548387096e-05,
"logits/chosen": -0.5839393734931946,
"logits/rejected": -0.5850896835327148,
"logps/chosen": -7.3839006423950195,
"logps/rejected": -9.574810028076172,
"loss": 0.9415242075920105,
"memory(GiB)": 46.83,
"nll_loss": 0.372197687625885,
"rewards/accuracies": 0.75,
"rewards/chosen": 0.2435840666294098,
"rewards/margins": 0.30735281109809875,
"rewards/rejected": -0.06376874446868896,
"step": 21,
"train_speed(iter/s)": 0.005504
},
{
"epoch": 0.017750434936083307,
"grad_norm": 2.90157413482666,
"learning_rate": 7.096774193548388e-05,
"logits/chosen": -0.6114062070846558,
"logits/rejected": -0.6119735240936279,
"logps/chosen": -8.486170768737793,
"logps/rejected": -12.086725234985352,
"loss": 1.0081067085266113,
"memory(GiB)": 46.83,
"nll_loss": 0.34981024265289307,
"rewards/accuracies": 0.5625,
"rewards/chosen": 0.10258002579212189,
"rewards/margins": 0.12462681531906128,
"rewards/rejected": -0.02204679138958454,
"step": 22,
"train_speed(iter/s)": 0.005501
},
{
"epoch": 0.018557272887723457,
"grad_norm": 2.4457335472106934,
"learning_rate": 7.419354838709677e-05,
"logits/chosen": -0.5648061037063599,
"logits/rejected": -0.5674125552177429,
"logps/chosen": -12.962445259094238,
"logps/rejected": -15.476969718933105,
"loss": 1.0199884176254272,
"memory(GiB)": 46.83,
"nll_loss": 0.4421077072620392,
"rewards/accuracies": 0.6875,
"rewards/chosen": 0.13948869705200195,
"rewards/margins": 0.31703731417655945,
"rewards/rejected": -0.17754864692687988,
"step": 23,
"train_speed(iter/s)": 0.005504
},
{
"epoch": 0.019364110839363607,
"grad_norm": 2.250957489013672,
"learning_rate": 7.741935483870968e-05,
"logits/chosen": -0.5476934313774109,
"logits/rejected": -0.5497113466262817,
"logps/chosen": -6.839375972747803,
"logps/rejected": -12.336576461791992,
"loss": 0.9127413630485535,
"memory(GiB)": 46.83,
"nll_loss": 0.3841688632965088,
"rewards/accuracies": 0.78125,
"rewards/chosen": 0.2666690945625305,
"rewards/margins": 0.42246347665786743,
"rewards/rejected": -0.1557943969964981,
"step": 24,
"train_speed(iter/s)": 0.005505
},
{
"epoch": 0.020170948791003757,
"grad_norm": 3.6742801666259766,
"learning_rate": 8.064516129032258e-05,
"logits/chosen": -0.5886849164962769,
"logits/rejected": -0.5897050499916077,
"logps/chosen": -8.534127235412598,
"logps/rejected": -11.815479278564453,
"loss": 1.0272297859191895,
"memory(GiB)": 46.83,
"nll_loss": 0.41876962780952454,
"rewards/accuracies": 0.625,
"rewards/chosen": 0.13335689902305603,
"rewards/margins": 0.27482476830482483,
"rewards/rejected": -0.1414678543806076,
"step": 25,
"train_speed(iter/s)": 0.005513
},
{
"epoch": 0.020977786742643906,
"grad_norm": 2.5902981758117676,
"learning_rate": 8.387096774193549e-05,
"logits/chosen": -0.5303969979286194,
"logits/rejected": -0.5350589752197266,
"logps/chosen": -9.592369079589844,
"logps/rejected": -17.837379455566406,
"loss": 0.9073010087013245,
"memory(GiB)": 46.83,
"nll_loss": 0.3275393545627594,
"rewards/accuracies": 0.75,
"rewards/chosen": 0.1778128743171692,
"rewards/margins": 0.31808584928512573,
"rewards/rejected": -0.14027300477027893,
"step": 26,
"train_speed(iter/s)": 0.005509
},
{
"epoch": 0.021784624694284056,
"grad_norm": 3.656003952026367,
"learning_rate": 8.709677419354839e-05,
"logits/chosen": -0.5741274356842041,
"logits/rejected": -0.5759863257408142,
"logps/chosen": -7.401767253875732,
"logps/rejected": -9.595519065856934,
"loss": 0.9837043881416321,
"memory(GiB)": 46.83,
"nll_loss": 0.34733644127845764,
"rewards/accuracies": 0.6875,
"rewards/chosen": 0.16637372970581055,
"rewards/margins": 0.22424587607383728,
"rewards/rejected": -0.05787213519215584,
"step": 27,
"train_speed(iter/s)": 0.00551
},
{
"epoch": 0.022591462645924206,
"grad_norm": 3.6425983905792236,
"learning_rate": 9.032258064516129e-05,
"logits/chosen": -0.5271302461624146,
"logits/rejected": -0.5281438231468201,
"logps/chosen": -10.050779342651367,
"logps/rejected": -13.247575759887695,
"loss": 1.0190500020980835,
"memory(GiB)": 46.83,
"nll_loss": 0.4030058681964874,
"rewards/accuracies": 0.625,
"rewards/chosen": 0.022431861609220505,
"rewards/margins": 0.22834232449531555,
"rewards/rejected": -0.20591047406196594,
"step": 28,
"train_speed(iter/s)": 0.005522
},
{
"epoch": 0.02339830059756436,
"grad_norm": 4.539236545562744,
"learning_rate": 9.35483870967742e-05,
"logits/chosen": -0.574794352054596,
"logits/rejected": -0.5771020650863647,
"logps/chosen": -7.9426727294921875,
"logps/rejected": -11.816813468933105,
"loss": 1.0435985326766968,
"memory(GiB)": 46.83,
"nll_loss": 0.4821586310863495,
"rewards/accuracies": 0.6875,
"rewards/chosen": 0.17023718357086182,
"rewards/margins": 0.36495453119277954,
"rewards/rejected": -0.19471733272075653,
"step": 29,
"train_speed(iter/s)": 0.005525
},
{
"epoch": 0.02420513854920451,
"grad_norm": 3.463172674179077,
"learning_rate": 9.677419354838711e-05,
"logits/chosen": -0.5663347244262695,
"logits/rejected": -0.5671164393424988,
"logps/chosen": -8.761878967285156,
"logps/rejected": -16.922607421875,
"loss": 0.8841907978057861,
"memory(GiB)": 46.83,
"nll_loss": 0.37557756900787354,
"rewards/accuracies": 0.8125,
"rewards/chosen": 0.23288068175315857,
"rewards/margins": 0.47043219208717346,
"rewards/rejected": -0.2375514954328537,
"step": 30,
"train_speed(iter/s)": 0.005522
},
{
"epoch": 0.02501197650084466,
"grad_norm": 7.054537296295166,
"learning_rate": 0.0001,
"logits/chosen": -0.5485356450080872,
"logits/rejected": -0.5510388612747192,
"logps/chosen": -8.1714506149292,
"logps/rejected": -15.964082717895508,
"loss": 1.0905145406723022,
"memory(GiB)": 46.83,
"nll_loss": 0.48109474778175354,
"rewards/accuracies": 0.65625,
"rewards/chosen": 0.14875195920467377,
"rewards/margins": 0.23288127779960632,
"rewards/rejected": -0.08412933349609375,
"step": 31,
"train_speed(iter/s)": 0.005519
},
{
"epoch": 0.02581881445248481,
"grad_norm": 2.8915627002716064,
"learning_rate": 0.0001032258064516129,
"logits/chosen": -0.5415224432945251,
"logits/rejected": -0.5406837463378906,
"logps/chosen": -12.312981605529785,
"logps/rejected": -14.444657325744629,
"loss": 0.9778124094009399,
"memory(GiB)": 46.83,
"nll_loss": 0.4027611017227173,
"rewards/accuracies": 0.71875,
"rewards/chosen": 0.11852823942899704,
"rewards/margins": 0.3213120102882385,
"rewards/rejected": -0.2027837634086609,
"step": 32,
"train_speed(iter/s)": 0.005515
},
{
"epoch": 0.02662565240412496,
"grad_norm": 4.721103191375732,
"learning_rate": 0.0001064516129032258,
"logits/chosen": -0.5442328453063965,
"logits/rejected": -0.5437616109848022,
"logps/chosen": -9.491182327270508,
"logps/rejected": -18.31528663635254,
"loss": 1.1582751274108887,
"memory(GiB)": 46.83,
"nll_loss": 0.5736849904060364,
"rewards/accuracies": 0.75,
"rewards/chosen": 0.03584306687116623,
"rewards/margins": 0.35881760716438293,
"rewards/rejected": -0.3229745626449585,
"step": 33,
"train_speed(iter/s)": 0.005515
},
{
"epoch": 0.02743249035576511,
"grad_norm": 4.470694065093994,
"learning_rate": 0.00010967741935483871,
"logits/chosen": -0.49901843070983887,
"logits/rejected": -0.5027262568473816,
"logps/chosen": -6.029642105102539,
"logps/rejected": -17.065149307250977,
"loss": 0.7831717133522034,
"memory(GiB)": 46.83,
"nll_loss": 0.2735077142715454,
"rewards/accuracies": 0.6875,
"rewards/chosen": 0.172469824552536,
"rewards/margins": 0.6490951180458069,
"rewards/rejected": -0.4766252934932709,
"step": 34,
"train_speed(iter/s)": 0.005511
},
{
"epoch": 0.02823932830740526,
"grad_norm": 4.086674690246582,
"learning_rate": 0.00011290322580645163,
"logits/chosen": -0.5251173377037048,
"logits/rejected": -0.5295683145523071,
"logps/chosen": -10.127384185791016,
"logps/rejected": -19.261646270751953,
"loss": 0.90782630443573,
"memory(GiB)": 46.83,
"nll_loss": 0.37643295526504517,
"rewards/accuracies": 0.71875,
"rewards/chosen": 0.059490665793418884,
"rewards/margins": 0.5788955688476562,
"rewards/rejected": -0.5194048881530762,
"step": 35,
"train_speed(iter/s)": 0.005516
},
{
"epoch": 0.02904616625904541,
"grad_norm": 3.153599977493286,
"learning_rate": 0.00011612903225806453,
"logits/chosen": -0.5580551624298096,
"logits/rejected": -0.561299741268158,
"logps/chosen": -7.748661518096924,
"logps/rejected": -18.775835037231445,
"loss": 0.8323644995689392,
"memory(GiB)": 46.83,
"nll_loss": 0.30874526500701904,
"rewards/accuracies": 0.75,
"rewards/chosen": 0.17774799466133118,
"rewards/margins": 0.58444744348526,
"rewards/rejected": -0.4066994786262512,
"step": 36,
"train_speed(iter/s)": 0.005518
},
{
"epoch": 0.02985300421068556,
"grad_norm": 5.963130950927734,
"learning_rate": 0.00011935483870967743,
"logits/chosen": -0.5691896080970764,
"logits/rejected": -0.5704917907714844,
"logps/chosen": -5.695924282073975,
"logps/rejected": -15.709531784057617,
"loss": 0.8581907153129578,
"memory(GiB)": 46.83,
"nll_loss": 0.32061102986335754,
"rewards/accuracies": 0.75,
"rewards/chosen": 0.13813850283622742,
"rewards/margins": 0.42923206090927124,
"rewards/rejected": -0.2910935878753662,
"step": 37,
"train_speed(iter/s)": 0.005516
},
{
"epoch": 0.03065984216232571,
"grad_norm": 3.532068967819214,
"learning_rate": 0.00012258064516129034,
"logits/chosen": -0.5251184105873108,
"logits/rejected": -0.5261702537536621,
"logps/chosen": -8.303949356079102,
"logps/rejected": -13.649654388427734,
"loss": 0.9825394153594971,
"memory(GiB)": 46.83,
"nll_loss": 0.39365747570991516,
"rewards/accuracies": 0.65625,
"rewards/chosen": 0.07552488148212433,
"rewards/margins": 0.2995148003101349,
"rewards/rejected": -0.22398996353149414,
"step": 38,
"train_speed(iter/s)": 0.005515
},
{
"epoch": 0.03146668011396586,
"grad_norm": 2.9115569591522217,
"learning_rate": 0.00012580645161290322,
"logits/chosen": -0.5716837048530579,
"logits/rejected": -0.5749698281288147,
"logps/chosen": -7.206816673278809,
"logps/rejected": -15.77934741973877,
"loss": 0.7430101633071899,
"memory(GiB)": 46.83,
"nll_loss": 0.27266308665275574,
"rewards/accuracies": 0.90625,
"rewards/chosen": 0.20229285955429077,
"rewards/margins": 0.6254266500473022,
"rewards/rejected": -0.42313385009765625,
"step": 39,
"train_speed(iter/s)": 0.005515
},
{
"epoch": 0.03227351806560601,
"grad_norm": 4.647506237030029,
"learning_rate": 0.00012903225806451613,
"logits/chosen": -0.5296156406402588,
"logits/rejected": -0.5295798778533936,
"logps/chosen": -10.529404640197754,
"logps/rejected": -16.44548988342285,
"loss": 0.900071918964386,
"memory(GiB)": 46.83,
"nll_loss": 0.3727172613143921,
"rewards/accuracies": 0.71875,
"rewards/chosen": 0.08702702820301056,
"rewards/margins": 0.4926542341709137,
"rewards/rejected": -0.40562722086906433,
"step": 40,
"train_speed(iter/s)": 0.005514
},
{
"epoch": 0.03308035601724616,
"grad_norm": 3.4815561771392822,
"learning_rate": 0.00013225806451612905,
"logits/chosen": -0.5586342811584473,
"logits/rejected": -0.5603877305984497,
"logps/chosen": -7.803877830505371,
"logps/rejected": -18.412734985351562,
"loss": 0.8854644298553467,
"memory(GiB)": 46.83,
"nll_loss": 0.37826117873191833,
"rewards/accuracies": 0.78125,
"rewards/chosen": 0.08443664014339447,
"rewards/margins": 0.6363339424133301,
"rewards/rejected": -0.5518972873687744,
"step": 41,
"train_speed(iter/s)": 0.005514
},
{
"epoch": 0.033887193968886314,
"grad_norm": 3.6079483032226562,
"learning_rate": 0.00013548387096774193,
"logits/chosen": -0.5233692526817322,
"logits/rejected": -0.5257354378700256,
"logps/chosen": -11.989986419677734,
"logps/rejected": -17.48329734802246,
"loss": 0.9667509198188782,
"memory(GiB)": 46.83,
"nll_loss": 0.4528670608997345,
"rewards/accuracies": 0.8125,
"rewards/chosen": 0.14738641679286957,
"rewards/margins": 0.5997685194015503,
"rewards/rejected": -0.4523821473121643,
"step": 42,
"train_speed(iter/s)": 0.005512
},
{
"epoch": 0.03469403192052646,
"grad_norm": 5.491096019744873,
"learning_rate": 0.00013870967741935487,
"logits/chosen": -0.5798231363296509,
"logits/rejected": -0.5843824148178101,
"logps/chosen": -8.180625915527344,
"logps/rejected": -19.614505767822266,
"loss": 1.0811830759048462,
"memory(GiB)": 46.83,
"nll_loss": 0.5651165246963501,
"rewards/accuracies": 0.75,
"rewards/chosen": 0.018763888627290726,
"rewards/margins": 0.5782932043075562,
"rewards/rejected": -0.5595293641090393,
"step": 43,
"train_speed(iter/s)": 0.005507
},
{
"epoch": 0.035500869872166614,
"grad_norm": 5.715328216552734,
"learning_rate": 0.00014193548387096775,
"logits/chosen": -0.5562050342559814,
"logits/rejected": -0.5585284233093262,
"logps/chosen": -9.799619674682617,
"logps/rejected": -13.962825775146484,
"loss": 1.046175479888916,
"memory(GiB)": 46.83,
"nll_loss": 0.5247361660003662,
"rewards/accuracies": 0.6875,
"rewards/chosen": 0.0660993829369545,
"rewards/margins": 0.557608425617218,
"rewards/rejected": -0.4915090799331665,
"step": 44,
"train_speed(iter/s)": 0.005509
},
{
"epoch": 0.03630770782380676,
"grad_norm": 4.065413951873779,
"learning_rate": 0.00014516129032258066,
"logits/chosen": -0.5717958807945251,
"logits/rejected": -0.5754877924919128,
"logps/chosen": -10.432125091552734,
"logps/rejected": -17.75714111328125,
"loss": 0.9775079488754272,
"memory(GiB)": 46.83,
"nll_loss": 0.4804929792881012,
"rewards/accuracies": 0.71875,
"rewards/chosen": 0.16446207463741302,
"rewards/margins": 0.5844215154647827,
"rewards/rejected": -0.4199594557285309,
"step": 45,
"train_speed(iter/s)": 0.005513
},
{
"epoch": 0.037114545775446914,
"grad_norm": 4.507160663604736,
"learning_rate": 0.00014838709677419355,
"logits/chosen": -0.5544827580451965,
"logits/rejected": -0.5517963171005249,
"logps/chosen": -10.039278030395508,
"logps/rejected": -16.44822120666504,
"loss": 0.9198786020278931,
"memory(GiB)": 46.83,
"nll_loss": 0.3649781346321106,
"rewards/accuracies": 0.6875,
"rewards/chosen": 0.11493994295597076,
"rewards/margins": 0.5548471808433533,
"rewards/rejected": -0.4399072825908661,
"step": 46,
"train_speed(iter/s)": 0.005512
},
{
"epoch": 0.03792138372708706,
"grad_norm": 4.040234565734863,
"learning_rate": 0.00015161290322580646,
"logits/chosen": -0.5704259276390076,
"logits/rejected": -0.5716680884361267,
"logps/chosen": -7.400537967681885,
"logps/rejected": -17.6054744720459,
"loss": 0.9134971499443054,
"memory(GiB)": 46.83,
"nll_loss": 0.3412809669971466,
"rewards/accuracies": 0.78125,
"rewards/chosen": 0.03388240188360214,
"rewards/margins": 0.4440326392650604,
"rewards/rejected": -0.4101502001285553,
"step": 47,
"train_speed(iter/s)": 0.005512
},
{
"epoch": 0.038728221678727213,
"grad_norm": 2.9642419815063477,
"learning_rate": 0.00015483870967741937,
"logits/chosen": -0.5867742300033569,
"logits/rejected": -0.5912387371063232,
"logps/chosen": -9.146940231323242,
"logps/rejected": -16.374706268310547,
"loss": 0.9059248566627502,
"memory(GiB)": 46.83,
"nll_loss": 0.3897300958633423,
"rewards/accuracies": 0.78125,
"rewards/chosen": 0.1047089472413063,
"rewards/margins": 0.5065208673477173,
"rewards/rejected": -0.4018118679523468,
"step": 48,
"train_speed(iter/s)": 0.005514
},
{
"epoch": 0.03953505963036737,
"grad_norm": 3.087217330932617,
"learning_rate": 0.00015806451612903225,
"logits/chosen": -0.5874481201171875,
"logits/rejected": -0.5872229337692261,
"logps/chosen": -6.086337566375732,
"logps/rejected": -10.504037857055664,
"loss": 0.8798851370811462,
"memory(GiB)": 46.83,
"nll_loss": 0.33263421058654785,
"rewards/accuracies": 0.6875,
"rewards/chosen": 0.20601165294647217,
"rewards/margins": 0.4658709466457367,
"rewards/rejected": -0.2598593533039093,
"step": 49,
"train_speed(iter/s)": 0.005513
},
{
"epoch": 0.04034189758200751,
"grad_norm": 3.16754150390625,
"learning_rate": 0.00016129032258064516,
"logits/chosen": -0.5708128809928894,
"logits/rejected": -0.5798742175102234,
"logps/chosen": -6.393083572387695,
"logps/rejected": -19.668724060058594,
"loss": 0.8404853343963623,
"memory(GiB)": 46.83,
"nll_loss": 0.34996694326400757,
"rewards/accuracies": 0.84375,
"rewards/chosen": 0.21206828951835632,
"rewards/margins": 0.5756057500839233,
"rewards/rejected": -0.363537460565567,
"step": 50,
"train_speed(iter/s)": 0.005516
},
{
"epoch": 0.041148735533647667,
"grad_norm": 2.4009766578674316,
"learning_rate": 0.00016451612903225807,
"logits/chosen": -0.5599406361579895,
"logits/rejected": -0.5625043511390686,
"logps/chosen": -7.262391090393066,
"logps/rejected": -15.73720932006836,
"loss": 0.8113247752189636,
"memory(GiB)": 46.83,
"nll_loss": 0.28076890110969543,
"rewards/accuracies": 0.8125,
"rewards/chosen": 0.14269490540027618,
"rewards/margins": 0.47564250230789185,
"rewards/rejected": -0.33294758200645447,
"step": 51,
"train_speed(iter/s)": 0.005506
},
{
"epoch": 0.04195557348528781,
"grad_norm": 3.129634380340576,
"learning_rate": 0.00016774193548387098,
"logits/chosen": -0.5937235355377197,
"logits/rejected": -0.5938248038291931,
"logps/chosen": -5.393199920654297,
"logps/rejected": -15.786672592163086,
"loss": 0.7831435799598694,
"memory(GiB)": 46.83,
"nll_loss": 0.2872075140476227,
"rewards/accuracies": 0.8125,
"rewards/chosen": 0.19873687624931335,
"rewards/margins": 0.5569283366203308,
"rewards/rejected": -0.35819149017333984,
"step": 52,
"train_speed(iter/s)": 0.005507
},
{
"epoch": 0.042762411436927966,
"grad_norm": 3.2887256145477295,
"learning_rate": 0.0001709677419354839,
"logits/chosen": -0.5820189118385315,
"logits/rejected": -0.5850119590759277,
"logps/chosen": -7.764882564544678,
"logps/rejected": -16.894685745239258,
"loss": 0.8994213342666626,
"memory(GiB)": 46.83,
"nll_loss": 0.3770924210548401,
"rewards/accuracies": 0.6875,
"rewards/chosen": 0.20706558227539062,
"rewards/margins": 0.5472366213798523,
"rewards/rejected": -0.34017103910446167,
"step": 53,
"train_speed(iter/s)": 0.005506
},
{
"epoch": 0.04356924938856811,
"grad_norm": 3.7313735485076904,
"learning_rate": 0.00017419354838709678,
"logits/chosen": -0.5833962559700012,
"logits/rejected": -0.5876143574714661,
"logps/chosen": -8.130949020385742,
"logps/rejected": -20.79953384399414,
"loss": 0.9545141458511353,
"memory(GiB)": 46.83,
"nll_loss": 0.4539381265640259,
"rewards/accuracies": 0.75,
"rewards/chosen": 0.10515612363815308,
"rewards/margins": 0.612572968006134,
"rewards/rejected": -0.5074167847633362,
"step": 54,
"train_speed(iter/s)": 0.005507
},
{
"epoch": 0.044376087340208266,
"grad_norm": 5.652868747711182,
"learning_rate": 0.0001774193548387097,
"logits/chosen": -0.5960416793823242,
"logits/rejected": -0.5957224369049072,
"logps/chosen": -12.674562454223633,
"logps/rejected": -15.591826438903809,
"loss": 1.1736092567443848,
"memory(GiB)": 46.83,
"nll_loss": 0.5310375690460205,
"rewards/accuracies": 0.625,
"rewards/chosen": -0.11839848756790161,
"rewards/margins": 0.40016603469848633,
"rewards/rejected": -0.5185645222663879,
"step": 55,
"train_speed(iter/s)": 0.005509
},
{
"epoch": 0.04518292529184841,
"grad_norm": 4.002370834350586,
"learning_rate": 0.00018064516129032257,
"logits/chosen": -0.5776931643486023,
"logits/rejected": -0.5789185166358948,
"logps/chosen": -12.67449951171875,
"logps/rejected": -16.919376373291016,
"loss": 1.087173342704773,
"memory(GiB)": 46.83,
"nll_loss": 0.4873568117618561,
"rewards/accuracies": 0.65625,
"rewards/chosen": -0.15739397704601288,
"rewards/margins": 0.39120250940322876,
"rewards/rejected": -0.5485965013504028,
"step": 56,
"train_speed(iter/s)": 0.005507
},
{
"epoch": 0.045989763243488566,
"grad_norm": 3.5529890060424805,
"learning_rate": 0.00018387096774193548,
"logits/chosen": -0.5732367634773254,
"logits/rejected": -0.5760124921798706,
"logps/chosen": -4.22891902923584,
"logps/rejected": -18.773733139038086,
"loss": 0.6395769119262695,
"memory(GiB)": 46.83,
"nll_loss": 0.23632453382015228,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.12576641142368317,
"rewards/margins": 0.908116340637207,
"rewards/rejected": -0.7823498845100403,
"step": 57,
"train_speed(iter/s)": 0.005505
},
{
"epoch": 0.04679660119512872,
"grad_norm": 2.638253927230835,
"learning_rate": 0.0001870967741935484,
"logits/chosen": -0.5618959069252014,
"logits/rejected": -0.5671476721763611,
"logps/chosen": -8.717156410217285,
"logps/rejected": -22.3723087310791,
"loss": 0.8119103312492371,
"memory(GiB)": 46.83,
"nll_loss": 0.4192086458206177,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.18826748430728912,
"rewards/margins": 0.8515651226043701,
"rewards/rejected": -0.6632976531982422,
"step": 58,
"train_speed(iter/s)": 0.005503
},
{
"epoch": 0.047603439146768865,
"grad_norm": 4.416356086730957,
"learning_rate": 0.0001903225806451613,
"logits/chosen": -0.5946109294891357,
"logits/rejected": -0.5949057340621948,
"logps/chosen": -10.825102806091309,
"logps/rejected": -15.580466270446777,
"loss": 0.9124961495399475,
"memory(GiB)": 46.83,
"nll_loss": 0.43738603591918945,
"rewards/accuracies": 0.78125,
"rewards/chosen": 0.1081230640411377,
"rewards/margins": 0.6975550651550293,
"rewards/rejected": -0.5894321203231812,
"step": 59,
"train_speed(iter/s)": 0.005503
},
{
"epoch": 0.04841027709840902,
"grad_norm": 3.548480272293091,
"learning_rate": 0.00019354838709677422,
"logits/chosen": -0.576353907585144,
"logits/rejected": -0.5807583928108215,
"logps/chosen": -10.603282928466797,
"logps/rejected": -20.904390335083008,
"loss": 1.033903956413269,
"memory(GiB)": 46.83,
"nll_loss": 0.5458623170852661,
"rewards/accuracies": 0.71875,
"rewards/chosen": 0.10141083598136902,
"rewards/margins": 0.9133819341659546,
"rewards/rejected": -0.8119711875915527,
"step": 60,
"train_speed(iter/s)": 0.005505
},
{
"epoch": 0.049217115050049165,
"grad_norm": 4.239978790283203,
"learning_rate": 0.0001967741935483871,
"logits/chosen": -0.6159774661064148,
"logits/rejected": -0.6157845258712769,
"logps/chosen": -13.034204483032227,
"logps/rejected": -21.466520309448242,
"loss": 0.9954748153686523,
"memory(GiB)": 46.83,
"nll_loss": 0.5168237090110779,
"rewards/accuracies": 0.8125,
"rewards/chosen": -0.15371613204479218,
"rewards/margins": 0.9087806940078735,
"rewards/rejected": -1.0624967813491821,
"step": 61,
"train_speed(iter/s)": 0.005508
},
{
"epoch": 0.05002395300168932,
"grad_norm": 4.418153285980225,
"learning_rate": 0.0002,
"logits/chosen": -0.586484968662262,
"logits/rejected": -0.5885915756225586,
"logps/chosen": -6.359810829162598,
"logps/rejected": -18.686431884765625,
"loss": 0.7993831634521484,
"memory(GiB)": 46.83,
"nll_loss": 0.3223803639411926,
"rewards/accuracies": 0.84375,
"rewards/chosen": 0.1565569043159485,
"rewards/margins": 0.8297788500785828,
"rewards/rejected": -0.6732219457626343,
"step": 62,
"train_speed(iter/s)": 0.005508
},
{
"epoch": 0.050830790953329465,
"grad_norm": 3.898704767227173,
"learning_rate": 0.00019999964378142156,
"logits/chosen": -0.5732013583183289,
"logits/rejected": -0.5774887800216675,
"logps/chosen": -12.98630142211914,
"logps/rejected": -19.34124755859375,
"loss": 0.9075384140014648,
"memory(GiB)": 46.83,
"nll_loss": 0.39192017912864685,
"rewards/accuracies": 0.75,
"rewards/chosen": 0.19289077818393707,
"rewards/margins": 0.6732712388038635,
"rewards/rejected": -0.48038047552108765,
"step": 63,
"train_speed(iter/s)": 0.005507
},
{
"epoch": 0.05163762890496962,
"grad_norm": 6.278528213500977,
"learning_rate": 0.00019999857512822402,
"logits/chosen": -0.6075332760810852,
"logits/rejected": -0.6084203124046326,
"logps/chosen": -14.246075630187988,
"logps/rejected": -20.948959350585938,
"loss": 1.0685752630233765,
"memory(GiB)": 46.83,
"nll_loss": 0.5815572142601013,
"rewards/accuracies": 0.71875,
"rewards/chosen": -0.03303433582186699,
"rewards/margins": 0.8266364336013794,
"rewards/rejected": -0.8596707582473755,
"step": 64,
"train_speed(iter/s)": 0.005508
},
{
"epoch": 0.052444466856609764,
"grad_norm": 4.589393615722656,
"learning_rate": 0.00019999679404802089,
"logits/chosen": -0.596097469329834,
"logits/rejected": -0.5986034870147705,
"logps/chosen": -8.450502395629883,
"logps/rejected": -21.070066452026367,
"loss": 0.7867013812065125,
"memory(GiB)": 46.83,
"nll_loss": 0.31530463695526123,
"rewards/accuracies": 0.84375,
"rewards/chosen": 0.13920006155967712,
"rewards/margins": 0.9423296451568604,
"rewards/rejected": -0.8031294941902161,
"step": 65,
"train_speed(iter/s)": 0.005508
},
{
"epoch": 0.05325130480824992,
"grad_norm": 4.376217365264893,
"learning_rate": 0.00019999430055350122,
"logits/chosen": -0.5758836269378662,
"logits/rejected": -0.5734565854072571,
"logps/chosen": -10.774827003479004,
"logps/rejected": -19.021907806396484,
"loss": 0.7909982800483704,
"memory(GiB)": 46.83,
"nll_loss": 0.3997192680835724,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.23606787621974945,
"rewards/margins": 1.0521141290664673,
"rewards/rejected": -0.8160461783409119,
"step": 66,
"train_speed(iter/s)": 0.005507
},
{
"epoch": 0.05405814275989007,
"grad_norm": 6.438971042633057,
"learning_rate": 0.00019999109466242962,
"logits/chosen": -0.5718088150024414,
"logits/rejected": -0.5745964050292969,
"logps/chosen": -6.671931266784668,
"logps/rejected": -20.429231643676758,
"loss": 0.8954067230224609,
"memory(GiB)": 46.83,
"nll_loss": 0.45071539282798767,
"rewards/accuracies": 0.8125,
"rewards/chosen": 0.10935470461845398,
"rewards/margins": 0.8583554029464722,
"rewards/rejected": -0.7490006685256958,
"step": 67,
"train_speed(iter/s)": 0.005509
},
{
"epoch": 0.05486498071153022,
"grad_norm": 11.16286849975586,
"learning_rate": 0.00019998717639764602,
"logits/chosen": -0.5820534229278564,
"logits/rejected": -0.5849663019180298,
"logps/chosen": -9.799468040466309,
"logps/rejected": -18.977890014648438,
"loss": 1.29269278049469,
"memory(GiB)": 46.83,
"nll_loss": 0.7049438953399658,
"rewards/accuracies": 0.6875,
"rewards/chosen": -0.04825415089726448,
"rewards/margins": 0.5465254783630371,
"rewards/rejected": -0.5947796702384949,
"step": 68,
"train_speed(iter/s)": 0.005506
},
{
"epoch": 0.05567181866317037,
"grad_norm": 9.413622856140137,
"learning_rate": 0.00019998254578706563,
"logits/chosen": -0.5850585699081421,
"logits/rejected": -0.5874402523040771,
"logps/chosen": -8.903966903686523,
"logps/rejected": -14.843938827514648,
"loss": 1.3027069568634033,
"memory(GiB)": 46.83,
"nll_loss": 0.744307279586792,
"rewards/accuracies": 0.78125,
"rewards/chosen": -0.0512365885078907,
"rewards/margins": 0.5854336619377136,
"rewards/rejected": -0.6366702318191528,
"step": 69,
"train_speed(iter/s)": 0.005505
},
{
"epoch": 0.05647865661481052,
"grad_norm": 7.333382606506348,
"learning_rate": 0.00019997720286367863,
"logits/chosen": -0.545200765132904,
"logits/rejected": -0.5484716296195984,
"logps/chosen": -7.334113121032715,
"logps/rejected": -22.56316375732422,
"loss": 1.0189334154129028,
"memory(GiB)": 46.83,
"nll_loss": 0.5383400321006775,
"rewards/accuracies": 0.84375,
"rewards/chosen": 0.061847541481256485,
"rewards/margins": 0.6559779644012451,
"rewards/rejected": -0.5941305160522461,
"step": 70,
"train_speed(iter/s)": 0.005506
},
{
"epoch": 0.05728549456645067,
"grad_norm": 2.8849799633026123,
"learning_rate": 0.00019997114766554997,
"logits/chosen": -0.5629354119300842,
"logits/rejected": -0.5669021606445312,
"logps/chosen": -8.698752403259277,
"logps/rejected": -21.85867691040039,
"loss": 0.8375651836395264,
"memory(GiB)": 46.83,
"nll_loss": 0.3549819886684418,
"rewards/accuracies": 0.78125,
"rewards/chosen": 0.09854352474212646,
"rewards/margins": 0.7027413845062256,
"rewards/rejected": -0.6041979193687439,
"step": 71,
"train_speed(iter/s)": 0.005507
},
{
"epoch": 0.05809233251809082,
"grad_norm": 2.6733391284942627,
"learning_rate": 0.00019996438023581913,
"logits/chosen": -0.5319232940673828,
"logits/rejected": -0.5331096649169922,
"logps/chosen": -10.13166332244873,
"logps/rejected": -13.18635368347168,
"loss": 1.014970302581787,
"memory(GiB)": 46.83,
"nll_loss": 0.4217461347579956,
"rewards/accuracies": 0.71875,
"rewards/chosen": 0.14793364703655243,
"rewards/margins": 0.3788456618785858,
"rewards/rejected": -0.2309119999408722,
"step": 72,
"train_speed(iter/s)": 0.005505
},
{
"epoch": 0.05889917046973097,
"grad_norm": 2.497257947921753,
"learning_rate": 0.00019995690062269984,
"logits/chosen": -0.5789859294891357,
"logits/rejected": -0.5805359482765198,
"logps/chosen": -8.139568328857422,
"logps/rejected": -10.85029411315918,
"loss": 0.9546566605567932,
"memory(GiB)": 46.83,
"nll_loss": 0.4216194450855255,
"rewards/accuracies": 0.65625,
"rewards/chosen": 0.24104151129722595,
"rewards/margins": 0.5254760980606079,
"rewards/rejected": -0.28443461656570435,
"step": 73,
"train_speed(iter/s)": 0.005506
},
{
"epoch": 0.05970600842137112,
"grad_norm": 2.8535268306732178,
"learning_rate": 0.00019994870887947962,
"logits/chosen": -0.5778383612632751,
"logits/rejected": -0.5768096446990967,
"logps/chosen": -8.49053955078125,
"logps/rejected": -12.854878425598145,
"loss": 1.0000758171081543,
"memory(GiB)": 46.83,
"nll_loss": 0.37848562002182007,
"rewards/accuracies": 0.625,
"rewards/chosen": 0.1054978221654892,
"rewards/margins": 0.3462926149368286,
"rewards/rejected": -0.24079479277133942,
"step": 74,
"train_speed(iter/s)": 0.005506
},
{
"epoch": 0.06051284637301127,
"grad_norm": 2.198607921600342,
"learning_rate": 0.00019993980506451947,
"logits/chosen": -0.530400276184082,
"logits/rejected": -0.530858039855957,
"logps/chosen": -9.152666091918945,
"logps/rejected": -11.464343070983887,
"loss": 0.9745745658874512,
"memory(GiB)": 46.83,
"nll_loss": 0.38881367444992065,
"rewards/accuracies": 0.75,
"rewards/chosen": 0.1783803254365921,
"rewards/margins": 0.3315035402774811,
"rewards/rejected": -0.1531231850385666,
"step": 75,
"train_speed(iter/s)": 0.005504
},
{
"epoch": 0.06131968432465142,
"grad_norm": 2.461601972579956,
"learning_rate": 0.0001999301892412535,
"logits/chosen": -0.5405219197273254,
"logits/rejected": -0.5390282869338989,
"logps/chosen": -10.537997245788574,
"logps/rejected": -15.066913604736328,
"loss": 0.966386079788208,
"memory(GiB)": 46.83,
"nll_loss": 0.38977545499801636,
"rewards/accuracies": 0.71875,
"rewards/chosen": 0.09291838109493256,
"rewards/margins": 0.3533533811569214,
"rewards/rejected": -0.26043495535850525,
"step": 76,
"train_speed(iter/s)": 0.005503
},
{
"epoch": 0.06212652227629157,
"grad_norm": 2.0999796390533447,
"learning_rate": 0.00019991986147818838,
"logits/chosen": -0.5443933010101318,
"logits/rejected": -0.5435047149658203,
"logps/chosen": -12.143755912780762,
"logps/rejected": -15.766691207885742,
"loss": 0.8939065337181091,
"memory(GiB)": 46.83,
"nll_loss": 0.415660560131073,
"rewards/accuracies": 0.90625,
"rewards/chosen": 0.23248028755187988,
"rewards/margins": 0.5352811217308044,
"rewards/rejected": -0.30280083417892456,
"step": 77,
"train_speed(iter/s)": 0.005502
},
{
"epoch": 0.06293336022793172,
"grad_norm": 2.9244306087493896,
"learning_rate": 0.00019990882184890295,
"logits/chosen": -0.5794655680656433,
"logits/rejected": -0.5853484869003296,
"logps/chosen": -7.884565353393555,
"logps/rejected": -20.136926651000977,
"loss": 0.8564450740814209,
"memory(GiB)": 46.83,
"nll_loss": 0.34705159068107605,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.14532405138015747,
"rewards/margins": 0.5069437623023987,
"rewards/rejected": -0.3616198003292084,
"step": 78,
"train_speed(iter/s)": 0.005502
},
{
"epoch": 0.06374019817957187,
"grad_norm": 3.461670160293579,
"learning_rate": 0.00019989707043204763,
"logits/chosen": -0.5491142868995667,
"logits/rejected": -0.553898811340332,
"logps/chosen": -7.547114372253418,
"logps/rejected": -18.740121841430664,
"loss": 0.9405392408370972,
"memory(GiB)": 46.83,
"nll_loss": 0.48508715629577637,
"rewards/accuracies": 0.84375,
"rewards/chosen": 0.128400981426239,
"rewards/margins": 0.6999501585960388,
"rewards/rejected": -0.5715491771697998,
"step": 79,
"train_speed(iter/s)": 0.005502
},
{
"epoch": 0.06454703613121202,
"grad_norm": 4.165892601013184,
"learning_rate": 0.0001998846073113439,
"logits/chosen": -0.6084208488464355,
"logits/rejected": -0.6092680096626282,
"logps/chosen": -12.750446319580078,
"logps/rejected": -19.53608512878418,
"loss": 1.0978946685791016,
"memory(GiB)": 46.83,
"nll_loss": 0.5877176523208618,
"rewards/accuracies": 0.75,
"rewards/chosen": 0.1369042694568634,
"rewards/margins": 0.6248282194137573,
"rewards/rejected": -0.48792392015457153,
"step": 80,
"train_speed(iter/s)": 0.005503
},
{
"epoch": 0.06535387408285218,
"grad_norm": 2.287846565246582,
"learning_rate": 0.00019987143257558365,
"logits/chosen": -0.59499192237854,
"logits/rejected": -0.5972949862480164,
"logps/chosen": -4.519835948944092,
"logps/rejected": -19.02901840209961,
"loss": 0.58124840259552,
"memory(GiB)": 46.83,
"nll_loss": 0.15051494538784027,
"rewards/accuracies": 0.84375,
"rewards/chosen": 0.19695766270160675,
"rewards/margins": 0.9730147123336792,
"rewards/rejected": -0.7760570049285889,
"step": 81,
"train_speed(iter/s)": 0.005506
},
{
"epoch": 0.06616071203449232,
"grad_norm": 7.103982448577881,
"learning_rate": 0.00019985754631862855,
"logits/chosen": -0.5857492089271545,
"logits/rejected": -0.5895102024078369,
"logps/chosen": -8.903070449829102,
"logps/rejected": -26.571044921875,
"loss": 0.7599916458129883,
"memory(GiB)": 46.83,
"nll_loss": 0.3342111110687256,
"rewards/accuracies": 0.84375,
"rewards/chosen": 0.14196240901947021,
"rewards/margins": 0.8281382322311401,
"rewards/rejected": -0.6861758232116699,
"step": 82,
"train_speed(iter/s)": 0.005504
},
{
"epoch": 0.06696754998613247,
"grad_norm": 3.764488697052002,
"learning_rate": 0.00019984294863940955,
"logits/chosen": -0.6067830324172974,
"logits/rejected": -0.6086009740829468,
"logps/chosen": -9.9881591796875,
"logps/rejected": -19.09541893005371,
"loss": 0.9752427339553833,
"memory(GiB)": 46.83,
"nll_loss": 0.5045859217643738,
"rewards/accuracies": 0.71875,
"rewards/chosen": 0.14939813315868378,
"rewards/margins": 0.8939868211746216,
"rewards/rejected": -0.7445887327194214,
"step": 83,
"train_speed(iter/s)": 0.005503
},
{
"epoch": 0.06777438793777263,
"grad_norm": 3.3293344974517822,
"learning_rate": 0.00019982763964192585,
"logits/chosen": -0.6330868601799011,
"logits/rejected": -0.6393448710441589,
"logps/chosen": -4.902453899383545,
"logps/rejected": -24.94113540649414,
"loss": 0.7244248390197754,
"memory(GiB)": 46.83,
"nll_loss": 0.3735058009624481,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.17604736983776093,
"rewards/margins": 1.2982165813446045,
"rewards/rejected": -1.1221693754196167,
"step": 84,
"train_speed(iter/s)": 0.005503
},
{
"epoch": 0.06858122588941278,
"grad_norm": 5.892284393310547,
"learning_rate": 0.00019981161943524443,
"logits/chosen": -0.6240598559379578,
"logits/rejected": -0.620481550693512,
"logps/chosen": -14.60393238067627,
"logps/rejected": -13.365829467773438,
"loss": 1.1541650295257568,
"memory(GiB)": 46.83,
"nll_loss": 0.48222166299819946,
"rewards/accuracies": 0.59375,
"rewards/chosen": -0.09302416443824768,
"rewards/margins": 0.41544342041015625,
"rewards/rejected": -0.5084675550460815,
"step": 85,
"train_speed(iter/s)": 0.0055
},
{
"epoch": 0.06938806384105292,
"grad_norm": 4.056751251220703,
"learning_rate": 0.00019979488813349933,
"logits/chosen": -0.6613398194313049,
"logits/rejected": -0.6640070080757141,
"logps/chosen": -9.50975227355957,
"logps/rejected": -21.119707107543945,
"loss": 0.8987840414047241,
"memory(GiB)": 46.83,
"nll_loss": 0.52927565574646,
"rewards/accuracies": 0.84375,
"rewards/chosen": 0.1999521553516388,
"rewards/margins": 1.1560636758804321,
"rewards/rejected": -0.956111490726471,
"step": 86,
"train_speed(iter/s)": 0.005499
},
{
"epoch": 0.07019490179269307,
"grad_norm": 4.351650238037109,
"learning_rate": 0.0001997774458558904,
"logits/chosen": -0.6547818779945374,
"logits/rejected": -0.6571143269538879,
"logps/chosen": -8.668737411499023,
"logps/rejected": -20.79534149169922,
"loss": 0.9775034785270691,
"memory(GiB)": 46.83,
"nll_loss": 0.4770965874195099,
"rewards/accuracies": 0.75,
"rewards/chosen": 0.02099284902215004,
"rewards/margins": 0.8633284568786621,
"rewards/rejected": -0.84233558177948,
"step": 87,
"train_speed(iter/s)": 0.005498
},
{
"epoch": 0.07100173974433323,
"grad_norm": 2.8774800300598145,
"learning_rate": 0.00019975929272668296,
"logits/chosen": -0.6759516000747681,
"logits/rejected": -0.6824960708618164,
"logps/chosen": -4.7266716957092285,
"logps/rejected": -26.10918426513672,
"loss": 0.5549903512001038,
"memory(GiB)": 46.83,
"nll_loss": 0.271104097366333,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.25939324498176575,
"rewards/margins": 1.6003111600875854,
"rewards/rejected": -1.340917944908142,
"step": 88,
"train_speed(iter/s)": 0.005501
},
{
"epoch": 0.07180857769597337,
"grad_norm": 2.8334577083587646,
"learning_rate": 0.00019974042887520668,
"logits/chosen": -0.6535760164260864,
"logits/rejected": -0.6572569608688354,
"logps/chosen": -13.957544326782227,
"logps/rejected": -18.16533851623535,
"loss": 0.9486314654350281,
"memory(GiB)": 46.83,
"nll_loss": 0.5478147268295288,
"rewards/accuracies": 0.90625,
"rewards/chosen": 0.2579638957977295,
"rewards/margins": 0.9477146863937378,
"rewards/rejected": -0.6897507905960083,
"step": 89,
"train_speed(iter/s)": 0.005501
},
{
"epoch": 0.07261541564761352,
"grad_norm": 5.422155380249023,
"learning_rate": 0.00019972085443585463,
"logits/chosen": -0.6767461895942688,
"logits/rejected": -0.6799700260162354,
"logps/chosen": -7.507997512817383,
"logps/rejected": -20.19240951538086,
"loss": 0.8118898868560791,
"memory(GiB)": 46.83,
"nll_loss": 0.4057508111000061,
"rewards/accuracies": 0.84375,
"rewards/chosen": 0.11586537212133408,
"rewards/margins": 1.0757473707199097,
"rewards/rejected": -0.9598820805549622,
"step": 90,
"train_speed(iter/s)": 0.005503
},
{
"epoch": 0.07342225359925368,
"grad_norm": 5.541498184204102,
"learning_rate": 0.0001997005695480824,
"logits/chosen": -0.6398351788520813,
"logits/rejected": -0.642162024974823,
"logps/chosen": -10.117485046386719,
"logps/rejected": -21.747928619384766,
"loss": 0.8823437094688416,
"memory(GiB)": 46.83,
"nll_loss": 0.47223997116088867,
"rewards/accuracies": 0.75,
"rewards/chosen": -0.04489222913980484,
"rewards/margins": 1.1613836288452148,
"rewards/rejected": -1.2062758207321167,
"step": 91,
"train_speed(iter/s)": 0.005504
},
{
"epoch": 0.07422909155089383,
"grad_norm": 2.0107967853546143,
"learning_rate": 0.000199679574356407,
"logits/chosen": -0.6938130855560303,
"logits/rejected": -0.7009856104850769,
"logps/chosen": -6.915675163269043,
"logps/rejected": -28.84608268737793,
"loss": 0.5776476860046387,
"memory(GiB)": 46.83,
"nll_loss": 0.3677330017089844,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.3187498152256012,
"rewards/margins": 1.8727707862854004,
"rewards/rejected": -1.554020881652832,
"step": 92,
"train_speed(iter/s)": 0.005502
},
{
"epoch": 0.07503592950253397,
"grad_norm": 3.5870676040649414,
"learning_rate": 0.0001996578690104061,
"logits/chosen": -0.673453688621521,
"logits/rejected": -0.676167905330658,
"logps/chosen": -10.7222318649292,
"logps/rejected": -28.77056884765625,
"loss": 0.950826108455658,
"memory(GiB)": 46.83,
"nll_loss": 0.5682229399681091,
"rewards/accuracies": 0.8125,
"rewards/chosen": 0.09744307398796082,
"rewards/margins": 1.4789444208145142,
"rewards/rejected": -1.381501317024231,
"step": 93,
"train_speed(iter/s)": 0.005502
},
{
"epoch": 0.07584276745417412,
"grad_norm": 4.2534661293029785,
"learning_rate": 0.00019963545366471653,
"logits/chosen": -0.6709739565849304,
"logits/rejected": -0.6747978925704956,
"logps/chosen": -8.219854354858398,
"logps/rejected": -29.13772201538086,
"loss": 0.6954976320266724,
"memory(GiB)": 46.83,
"nll_loss": 0.35414204001426697,
"rewards/accuracies": 0.8125,
"rewards/chosen": 0.10512235760688782,
"rewards/margins": 1.6458101272583008,
"rewards/rejected": -1.5406877994537354,
"step": 94,
"train_speed(iter/s)": 0.005503
},
{
"epoch": 0.07664960540581428,
"grad_norm": 7.663514614105225,
"learning_rate": 0.0001996123284790336,
"logits/chosen": -0.6834441423416138,
"logits/rejected": -0.6848198771476746,
"logps/chosen": -17.666513442993164,
"logps/rejected": -19.222387313842773,
"loss": 1.197723388671875,
"memory(GiB)": 46.83,
"nll_loss": 0.6848238110542297,
"rewards/accuracies": 0.84375,
"rewards/chosen": -0.06468406319618225,
"rewards/margins": 0.8658308982849121,
"rewards/rejected": -0.9305148720741272,
"step": 95,
"train_speed(iter/s)": 0.005502
},
{
"epoch": 0.07745644335745443,
"grad_norm": 16.187767028808594,
"learning_rate": 0.0001995884936181097,
"logits/chosen": -0.7171504497528076,
"logits/rejected": -0.7210450172424316,
"logps/chosen": -4.8772172927856445,
"logps/rejected": -27.164329528808594,
"loss": 0.7958053946495056,
"memory(GiB)": 46.83,
"nll_loss": 0.437197208404541,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.04156189411878586,
"rewards/margins": 1.4321556091308594,
"rewards/rejected": -1.3905936479568481,
"step": 96,
"train_speed(iter/s)": 0.005502
},
{
"epoch": 0.07826328130909457,
"grad_norm": 4.373692989349365,
"learning_rate": 0.00019956394925175328,
"logits/chosen": -0.720712423324585,
"logits/rejected": -0.7263769507408142,
"logps/chosen": -8.969646453857422,
"logps/rejected": -27.35487174987793,
"loss": 0.8684384822845459,
"memory(GiB)": 46.83,
"nll_loss": 0.4593147337436676,
"rewards/accuracies": 0.78125,
"rewards/chosen": 0.039580605924129486,
"rewards/margins": 1.404889702796936,
"rewards/rejected": -1.3653091192245483,
"step": 97,
"train_speed(iter/s)": 0.005502
},
{
"epoch": 0.07907011926073473,
"grad_norm": 3.1712353229522705,
"learning_rate": 0.00019953869555482752,
"logits/chosen": -0.6926038265228271,
"logits/rejected": -0.6906510591506958,
"logps/chosen": -10.361411094665527,
"logps/rejected": -19.763336181640625,
"loss": 1.0741034746170044,
"memory(GiB)": 46.83,
"nll_loss": 0.5404018759727478,
"rewards/accuracies": 0.75,
"rewards/chosen": 0.0025314167141914368,
"rewards/margins": 0.9160726070404053,
"rewards/rejected": -0.9135411381721497,
"step": 98,
"train_speed(iter/s)": 0.005502
},
{
"epoch": 0.07987695721237488,
"grad_norm": 5.8308796882629395,
"learning_rate": 0.00019951273270724906,
"logits/chosen": -0.6417246460914612,
"logits/rejected": -0.6460192203521729,
"logps/chosen": -10.923144340515137,
"logps/rejected": -23.332698822021484,
"loss": 1.129643201828003,
"memory(GiB)": 46.83,
"nll_loss": 0.5929185748100281,
"rewards/accuracies": 0.78125,
"rewards/chosen": -0.004452264867722988,
"rewards/margins": 0.6838414669036865,
"rewards/rejected": -0.6882937550544739,
"step": 99,
"train_speed(iter/s)": 0.005503
},
{
"epoch": 0.08068379516401503,
"grad_norm": 4.135215759277344,
"learning_rate": 0.00019948606089398698,
"logits/chosen": -0.6685535907745361,
"logits/rejected": -0.6693455576896667,
"logps/chosen": -11.88547134399414,
"logps/rejected": -19.97165298461914,
"loss": 0.9190454483032227,
"memory(GiB)": 46.83,
"nll_loss": 0.39345046877861023,
"rewards/accuracies": 0.59375,
"rewards/chosen": 0.05392542481422424,
"rewards/margins": 0.8620406985282898,
"rewards/rejected": -0.8081153035163879,
"step": 100,
"train_speed(iter/s)": 0.005503
},
{
"epoch": 0.08149063311565517,
"grad_norm": 3.957230806350708,
"learning_rate": 0.0001994586803050611,
"logits/chosen": -0.6953858137130737,
"logits/rejected": -0.6939084529876709,
"logps/chosen": -11.101150512695312,
"logps/rejected": -19.7403621673584,
"loss": 1.0100737810134888,
"memory(GiB)": 46.83,
"nll_loss": 0.45983725786209106,
"rewards/accuracies": 0.65625,
"rewards/chosen": 0.061330053955316544,
"rewards/margins": 0.847295880317688,
"rewards/rejected": -0.7859657406806946,
"step": 101,
"train_speed(iter/s)": 0.005498
},
{
"epoch": 0.08229747106729533,
"grad_norm": 2.8322761058807373,
"learning_rate": 0.00019943059113554097,
"logits/chosen": -0.6899937987327576,
"logits/rejected": -0.6942430734634399,
"logps/chosen": -8.74088191986084,
"logps/rejected": -20.522974014282227,
"loss": 0.8782400488853455,
"memory(GiB)": 46.83,
"nll_loss": 0.3525587320327759,
"rewards/accuracies": 0.8125,
"rewards/chosen": 0.05973733961582184,
"rewards/margins": 0.882931113243103,
"rewards/rejected": -0.8231937289237976,
"step": 102,
"train_speed(iter/s)": 0.005498
},
{
"epoch": 0.08310430901893548,
"grad_norm": 2.8728346824645996,
"learning_rate": 0.00019940179358554424,
"logits/chosen": -0.6615633964538574,
"logits/rejected": -0.6650048494338989,
"logps/chosen": -8.035341262817383,
"logps/rejected": -13.233177185058594,
"loss": 0.95281982421875,
"memory(GiB)": 46.83,
"nll_loss": 0.39267757534980774,
"rewards/accuracies": 0.71875,
"rewards/chosen": 0.12954209744930267,
"rewards/margins": 0.4833866357803345,
"rewards/rejected": -0.3538445234298706,
"step": 103,
"train_speed(iter/s)": 0.005496
},
{
"epoch": 0.08391114697057563,
"grad_norm": 2.8015527725219727,
"learning_rate": 0.00019937228786023542,
"logits/chosen": -0.6321871280670166,
"logits/rejected": -0.6367396116256714,
"logps/chosen": -9.781261444091797,
"logps/rejected": -18.408084869384766,
"loss": 0.9027690887451172,
"memory(GiB)": 46.83,
"nll_loss": 0.4244646430015564,
"rewards/accuracies": 0.84375,
"rewards/chosen": 0.18980520963668823,
"rewards/margins": 0.7434633374214172,
"rewards/rejected": -0.5536580681800842,
"step": 104,
"train_speed(iter/s)": 0.005498
},
{
"epoch": 0.08471798492221577,
"grad_norm": 3.581929922103882,
"learning_rate": 0.00019934207416982415,
"logits/chosen": -0.6718648076057434,
"logits/rejected": -0.6737468242645264,
"logps/chosen": -10.535398483276367,
"logps/rejected": -15.517889022827148,
"loss": 0.9467408657073975,
"memory(GiB)": 46.83,
"nll_loss": 0.4431319832801819,
"rewards/accuracies": 0.84375,
"rewards/chosen": 0.24101108312606812,
"rewards/margins": 0.5848699808120728,
"rewards/rejected": -0.34385889768600464,
"step": 105,
"train_speed(iter/s)": 0.005496
},
{
"epoch": 0.08552482287385593,
"grad_norm": 2.7180511951446533,
"learning_rate": 0.00019931115272956405,
"logits/chosen": -0.6360980272293091,
"logits/rejected": -0.6395881175994873,
"logps/chosen": -5.562260627746582,
"logps/rejected": -16.978702545166016,
"loss": 0.9048807621002197,
"memory(GiB)": 46.83,
"nll_loss": 0.3790769577026367,
"rewards/accuracies": 0.71875,
"rewards/chosen": 0.1927444040775299,
"rewards/margins": 0.6174324750900269,
"rewards/rejected": -0.42468804121017456,
"step": 106,
"train_speed(iter/s)": 0.005495
},
{
"epoch": 0.08633166082549608,
"grad_norm": 2.7166309356689453,
"learning_rate": 0.00019927952375975094,
"logits/chosen": -0.6151095628738403,
"logits/rejected": -0.6214062571525574,
"logps/chosen": -8.704106330871582,
"logps/rejected": -15.980009078979492,
"loss": 0.9614640474319458,
"memory(GiB)": 46.83,
"nll_loss": 0.41800737380981445,
"rewards/accuracies": 0.71875,
"rewards/chosen": 0.22499363124370575,
"rewards/margins": 0.5540027618408203,
"rewards/rejected": -0.32900911569595337,
"step": 107,
"train_speed(iter/s)": 0.005495
},
{
"epoch": 0.08713849877713623,
"grad_norm": 3.3143904209136963,
"learning_rate": 0.00019924718748572136,
"logits/chosen": -0.6602830290794373,
"logits/rejected": -0.6590928435325623,
"logps/chosen": -14.48482608795166,
"logps/rejected": -13.489812850952148,
"loss": 1.1007349491119385,
"memory(GiB)": 46.83,
"nll_loss": 0.38938888907432556,
"rewards/accuracies": 0.5625,
"rewards/chosen": -0.005462644621729851,
"rewards/margins": 0.18356555700302124,
"rewards/rejected": -0.18902820348739624,
"step": 108,
"train_speed(iter/s)": 0.005493
},
{
"epoch": 0.08794533672877639,
"grad_norm": 3.3967649936676025,
"learning_rate": 0.00019921414413785095,
"logits/chosen": -0.6139819025993347,
"logits/rejected": -0.6160064935684204,
"logps/chosen": -10.462146759033203,
"logps/rejected": -13.9368896484375,
"loss": 1.1163440942764282,
"memory(GiB)": 46.83,
"nll_loss": 0.5643093585968018,
"rewards/accuracies": 0.625,
"rewards/chosen": 0.13518843054771423,
"rewards/margins": 0.5490553379058838,
"rewards/rejected": -0.41386690735816956,
"step": 109,
"train_speed(iter/s)": 0.005493
},
{
"epoch": 0.08875217468041653,
"grad_norm": 2.125051498413086,
"learning_rate": 0.00019918039395155278,
"logits/chosen": -0.5581845641136169,
"logits/rejected": -0.5609419345855713,
"logps/chosen": -8.664159774780273,
"logps/rejected": -16.96472930908203,
"loss": 0.8410020470619202,
"memory(GiB)": 46.83,
"nll_loss": 0.3336779773235321,
"rewards/accuracies": 0.75,
"rewards/chosen": 0.24867044389247894,
"rewards/margins": 0.6479009985923767,
"rewards/rejected": -0.3992305099964142,
"step": 110,
"train_speed(iter/s)": 0.005494
},
{
"epoch": 0.08955901263205668,
"grad_norm": 2.7272698879241943,
"learning_rate": 0.00019914593716727574,
"logits/chosen": -0.640306830406189,
"logits/rejected": -0.6392278075218201,
"logps/chosen": -10.320524215698242,
"logps/rejected": -15.357645034790039,
"loss": 0.9050614237785339,
"memory(GiB)": 46.83,
"nll_loss": 0.3744095265865326,
"rewards/accuracies": 0.78125,
"rewards/chosen": 0.228946715593338,
"rewards/margins": 0.46916335821151733,
"rewards/rejected": -0.24021662771701813,
"step": 111,
"train_speed(iter/s)": 0.005492
},
{
"epoch": 0.09036585058369682,
"grad_norm": 2.552009344100952,
"learning_rate": 0.0001991107740305027,
"logits/chosen": -0.6064003109931946,
"logits/rejected": -0.607029914855957,
"logps/chosen": -10.730403900146484,
"logps/rejected": -20.569438934326172,
"loss": 0.9093858003616333,
"memory(GiB)": 46.83,
"nll_loss": 0.4844813346862793,
"rewards/accuracies": 0.84375,
"rewards/chosen": 0.320293128490448,
"rewards/margins": 0.8029977083206177,
"rewards/rejected": -0.48270460963249207,
"step": 112,
"train_speed(iter/s)": 0.005492
},
{
"epoch": 0.09117268853533698,
"grad_norm": 2.875828742980957,
"learning_rate": 0.00019907490479174902,
"logits/chosen": -0.6465886831283569,
"logits/rejected": -0.6483381986618042,
"logps/chosen": -6.758854389190674,
"logps/rejected": -20.76754379272461,
"loss": 0.7010505199432373,
"memory(GiB)": 46.83,
"nll_loss": 0.29428812861442566,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.3071742653846741,
"rewards/margins": 1.1479661464691162,
"rewards/rejected": -0.8407919406890869,
"step": 113,
"train_speed(iter/s)": 0.005491
},
{
"epoch": 0.09197952648697713,
"grad_norm": 2.3188178539276123,
"learning_rate": 0.00019903832970656038,
"logits/chosen": -0.6288142800331116,
"logits/rejected": -0.6315409541130066,
"logps/chosen": -8.855584144592285,
"logps/rejected": -20.421592712402344,
"loss": 0.841801106929779,
"memory(GiB)": 46.83,
"nll_loss": 0.38135236501693726,
"rewards/accuracies": 0.8125,
"rewards/chosen": 0.19283419847488403,
"rewards/margins": 0.8724038004875183,
"rewards/rejected": -0.6795696020126343,
"step": 114,
"train_speed(iter/s)": 0.005492
},
{
"epoch": 0.09278636443861728,
"grad_norm": 3.3676164150238037,
"learning_rate": 0.00019900104903551133,
"logits/chosen": -0.6541582345962524,
"logits/rejected": -0.6580868363380432,
"logps/chosen": -8.595276832580566,
"logps/rejected": -24.14297866821289,
"loss": 0.7960852980613708,
"memory(GiB)": 46.83,
"nll_loss": 0.4363185465335846,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.10038560628890991,
"rewards/margins": 1.4183127880096436,
"rewards/rejected": -1.3179271221160889,
"step": 115,
"train_speed(iter/s)": 0.005493
},
{
"epoch": 0.09359320239025744,
"grad_norm": 3.721660614013672,
"learning_rate": 0.00019896306304420324,
"logits/chosen": -0.6533216834068298,
"logits/rejected": -0.6518760919570923,
"logps/chosen": -9.710081100463867,
"logps/rejected": -20.333324432373047,
"loss": 0.842086911201477,
"memory(GiB)": 46.83,
"nll_loss": 0.38858363032341003,
"rewards/accuracies": 0.75,
"rewards/chosen": 0.1398862600326538,
"rewards/margins": 1.0419015884399414,
"rewards/rejected": -0.9020152688026428,
"step": 116,
"train_speed(iter/s)": 0.005494
},
{
"epoch": 0.09440004034189758,
"grad_norm": 4.8206281661987305,
"learning_rate": 0.0001989243720032624,
"logits/chosen": -0.7102867364883423,
"logits/rejected": -0.712573230266571,
"logps/chosen": -14.843620300292969,
"logps/rejected": -23.658788681030273,
"loss": 1.1279860734939575,
"memory(GiB)": 46.83,
"nll_loss": 0.5651426315307617,
"rewards/accuracies": 0.78125,
"rewards/chosen": -0.09467095881700516,
"rewards/margins": 0.9923723340034485,
"rewards/rejected": -1.087043285369873,
"step": 117,
"train_speed(iter/s)": 0.005494
},
{
"epoch": 0.09520687829353773,
"grad_norm": 3.194643020629883,
"learning_rate": 0.00019888497618833815,
"logits/chosen": -0.6824992895126343,
"logits/rejected": -0.6856632232666016,
"logps/chosen": -7.8865065574646,
"logps/rejected": -22.186447143554688,
"loss": 0.8166104555130005,
"memory(GiB)": 46.83,
"nll_loss": 0.3872619867324829,
"rewards/accuracies": 0.8125,
"rewards/chosen": 0.1935729682445526,
"rewards/margins": 1.2844107151031494,
"rewards/rejected": -1.090837836265564,
"step": 118,
"train_speed(iter/s)": 0.005494
},
{
"epoch": 0.09601371624517788,
"grad_norm": 5.332725524902344,
"learning_rate": 0.00019884487588010092,
"logits/chosen": -0.6963211894035339,
"logits/rejected": -0.695375382900238,
"logps/chosen": -12.522785186767578,
"logps/rejected": -21.899364471435547,
"loss": 1.200064778327942,
"memory(GiB)": 46.83,
"nll_loss": 0.5619924068450928,
"rewards/accuracies": 0.625,
"rewards/chosen": -0.2353927493095398,
"rewards/margins": 0.7032212018966675,
"rewards/rejected": -0.9386140704154968,
"step": 119,
"train_speed(iter/s)": 0.005493
},
{
"epoch": 0.09682055419681804,
"grad_norm": 3.189750909805298,
"learning_rate": 0.0001988040713642402,
"logits/chosen": -0.7008529305458069,
"logits/rejected": -0.7020596265792847,
"logps/chosen": -7.352071285247803,
"logps/rejected": -26.472599029541016,
"loss": 0.6796355843544006,
"memory(GiB)": 46.83,
"nll_loss": 0.30471816658973694,
"rewards/accuracies": 0.84375,
"rewards/chosen": 0.0883897989988327,
"rewards/margins": 1.43672513961792,
"rewards/rejected": -1.3483351469039917,
"step": 120,
"train_speed(iter/s)": 0.005494
},
{
"epoch": 0.09762739214845818,
"grad_norm": 3.5756847858428955,
"learning_rate": 0.00019876256293146257,
"logits/chosen": -0.6855241060256958,
"logits/rejected": -0.6870216131210327,
"logps/chosen": -9.13197135925293,
"logps/rejected": -25.256893157958984,
"loss": 0.9965449571609497,
"memory(GiB)": 46.83,
"nll_loss": 0.5001046061515808,
"rewards/accuracies": 0.78125,
"rewards/chosen": 0.036015622317790985,
"rewards/margins": 1.1710847616195679,
"rewards/rejected": -1.1350692510604858,
"step": 121,
"train_speed(iter/s)": 0.005494
},
{
"epoch": 0.09843423010009833,
"grad_norm": 2.60425066947937,
"learning_rate": 0.0001987203508774895,
"logits/chosen": -0.7040928602218628,
"logits/rejected": -0.7042312026023865,
"logps/chosen": -8.471722602844238,
"logps/rejected": -26.018938064575195,
"loss": 0.8459987640380859,
"memory(GiB)": 46.83,
"nll_loss": 0.4736276865005493,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.24268555641174316,
"rewards/margins": 1.318163514137268,
"rewards/rejected": -1.075477957725525,
"step": 122,
"train_speed(iter/s)": 0.005493
},
{
"epoch": 0.09924106805173849,
"grad_norm": 4.30864143371582,
"learning_rate": 0.0001986774355030553,
"logits/chosen": -0.6747640371322632,
"logits/rejected": -0.677899956703186,
"logps/chosen": -14.706789016723633,
"logps/rejected": -16.56774139404297,
"loss": 1.2364513874053955,
"memory(GiB)": 46.83,
"nll_loss": 0.6511675119400024,
"rewards/accuracies": 0.71875,
"rewards/chosen": 0.08759675920009613,
"rewards/margins": 0.6008309721946716,
"rewards/rejected": -0.5132341384887695,
"step": 123,
"train_speed(iter/s)": 0.005492
},
{
"epoch": 0.10004790600337864,
"grad_norm": 6.867242813110352,
"learning_rate": 0.00019863381711390508,
"logits/chosen": -0.6869674324989319,
"logits/rejected": -0.6902846693992615,
"logps/chosen": -7.829675197601318,
"logps/rejected": -20.095809936523438,
"loss": 1.043180227279663,
"memory(GiB)": 46.83,
"nll_loss": 0.530769944190979,
"rewards/accuracies": 0.71875,
"rewards/chosen": 0.11925126612186432,
"rewards/margins": 0.697571337223053,
"rewards/rejected": -0.5783200860023499,
"step": 124,
"train_speed(iter/s)": 0.005491
},
{
"epoch": 0.10085474395501878,
"grad_norm": 3.041438579559326,
"learning_rate": 0.0001985894960207925,
"logits/chosen": -0.6505750417709351,
"logits/rejected": -0.6511614918708801,
"logps/chosen": -9.314833641052246,
"logps/rejected": -27.15659523010254,
"loss": 0.7252060174942017,
"memory(GiB)": 46.83,
"nll_loss": 0.39295029640197754,
"rewards/accuracies": 0.96875,
"rewards/chosen": 0.24510648846626282,
"rewards/margins": 1.2805438041687012,
"rewards/rejected": -1.0354374647140503,
"step": 125,
"train_speed(iter/s)": 0.005491
},
{
"epoch": 0.10166158190665893,
"grad_norm": 2.509321689605713,
"learning_rate": 0.00019854447253947743,
"logits/chosen": -0.6497823596000671,
"logits/rejected": -0.6492441892623901,
"logps/chosen": -8.02572250366211,
"logps/rejected": -20.3783016204834,
"loss": 0.7982934713363647,
"memory(GiB)": 46.83,
"nll_loss": 0.33212146162986755,
"rewards/accuracies": 0.78125,
"rewards/chosen": 0.17764505743980408,
"rewards/margins": 0.8625535368919373,
"rewards/rejected": -0.6849085092544556,
"step": 126,
"train_speed(iter/s)": 0.005489
},
{
"epoch": 0.10246841985829909,
"grad_norm": 3.6529700756073,
"learning_rate": 0.0001984987469907239,
"logits/chosen": -0.6466098427772522,
"logits/rejected": -0.6480077505111694,
"logps/chosen": -9.548334121704102,
"logps/rejected": -16.65062141418457,
"loss": 0.914322555065155,
"memory(GiB)": 46.83,
"nll_loss": 0.4001502990722656,
"rewards/accuracies": 0.75,
"rewards/chosen": 0.1684979647397995,
"rewards/margins": 0.6629449129104614,
"rewards/rejected": -0.49444690346717834,
"step": 127,
"train_speed(iter/s)": 0.005491
},
{
"epoch": 0.10327525780993924,
"grad_norm": 3.3696913719177246,
"learning_rate": 0.00019845231970029773,
"logits/chosen": -0.679688572883606,
"logits/rejected": -0.6820145845413208,
"logps/chosen": -10.874924659729004,
"logps/rejected": -24.826372146606445,
"loss": 0.9800686240196228,
"memory(GiB)": 46.83,
"nll_loss": 0.4543137848377228,
"rewards/accuracies": 0.8125,
"rewards/chosen": -0.048351842910051346,
"rewards/margins": 0.8677961230278015,
"rewards/rejected": -0.9161479473114014,
"step": 128,
"train_speed(iter/s)": 0.00549
},
{
"epoch": 0.10408209576157938,
"grad_norm": 2.5419607162475586,
"learning_rate": 0.00019840519099896414,
"logits/chosen": -0.6618849039077759,
"logits/rejected": -0.6671789288520813,
"logps/chosen": -8.426337242126465,
"logps/rejected": -25.797517776489258,
"loss": 0.6974806189537048,
"memory(GiB)": 46.83,
"nll_loss": 0.2836017608642578,
"rewards/accuracies": 0.84375,
"rewards/chosen": 0.18303632736206055,
"rewards/margins": 1.1003562211990356,
"rewards/rejected": -0.9173198938369751,
"step": 129,
"train_speed(iter/s)": 0.005491
},
{
"epoch": 0.10488893371321953,
"grad_norm": 3.4203388690948486,
"learning_rate": 0.00019835736122248557,
"logits/chosen": -0.6606203317642212,
"logits/rejected": -0.6571654677391052,
"logps/chosen": -14.509614944458008,
"logps/rejected": -15.079629898071289,
"loss": 1.101165771484375,
"memory(GiB)": 46.83,
"nll_loss": 0.5219094157218933,
"rewards/accuracies": 0.75,
"rewards/chosen": 0.07395613193511963,
"rewards/margins": 0.5427431464195251,
"rewards/rejected": -0.46878698468208313,
"step": 130,
"train_speed(iter/s)": 0.005492
},
{
"epoch": 0.10569577166485969,
"grad_norm": 2.7750000953674316,
"learning_rate": 0.00019830883071161908,
"logits/chosen": -0.7152451276779175,
"logits/rejected": -0.7131951451301575,
"logps/chosen": -9.166630744934082,
"logps/rejected": -19.46819305419922,
"loss": 0.7933439016342163,
"memory(GiB)": 46.83,
"nll_loss": 0.3753884732723236,
"rewards/accuracies": 0.78125,
"rewards/chosen": 0.26774072647094727,
"rewards/margins": 1.0882644653320312,
"rewards/rejected": -0.8205236196517944,
"step": 131,
"train_speed(iter/s)": 0.005492
},
{
"epoch": 0.10650260961649984,
"grad_norm": 3.1810927391052246,
"learning_rate": 0.00019825959981211407,
"logits/chosen": -0.714146614074707,
"logits/rejected": -0.7095440626144409,
"logps/chosen": -11.571531295776367,
"logps/rejected": -14.685908317565918,
"loss": 0.8970522880554199,
"memory(GiB)": 46.83,
"nll_loss": 0.38512641191482544,
"rewards/accuracies": 0.75,
"rewards/chosen": 0.09674864262342453,
"rewards/margins": 0.5926439762115479,
"rewards/rejected": -0.4958953261375427,
"step": 132,
"train_speed(iter/s)": 0.005491
},
{
"epoch": 0.10730944756813998,
"grad_norm": 2.839996099472046,
"learning_rate": 0.00019820966887470974,
"logits/chosen": -0.7237828373908997,
"logits/rejected": -0.7276051640510559,
"logps/chosen": -7.241865158081055,
"logps/rejected": -21.9840145111084,
"loss": 0.7037227153778076,
"memory(GiB)": 46.83,
"nll_loss": 0.29994940757751465,
"rewards/accuracies": 0.84375,
"rewards/chosen": 0.18205267190933228,
"rewards/margins": 1.1148442029953003,
"rewards/rejected": -0.9327914714813232,
"step": 133,
"train_speed(iter/s)": 0.005492
},
{
"epoch": 0.10811628551978014,
"grad_norm": 2.8896915912628174,
"learning_rate": 0.0001981590382551327,
"logits/chosen": -0.796456515789032,
"logits/rejected": -0.7955406308174133,
"logps/chosen": -11.131935119628906,
"logps/rejected": -19.525293350219727,
"loss": 0.8993673920631409,
"memory(GiB)": 46.83,
"nll_loss": 0.4546453356742859,
"rewards/accuracies": 0.8125,
"rewards/chosen": 0.21719151735305786,
"rewards/margins": 1.081808090209961,
"rewards/rejected": -0.8646165728569031,
"step": 134,
"train_speed(iter/s)": 0.00549
},
{
"epoch": 0.10892312347142029,
"grad_norm": 3.5537540912628174,
"learning_rate": 0.00019810770831409425,
"logits/chosen": -0.7755017876625061,
"logits/rejected": -0.7809926271438599,
"logps/chosen": -7.181600093841553,
"logps/rejected": -19.379724502563477,
"loss": 0.7135071754455566,
"memory(GiB)": 46.83,
"nll_loss": 0.32976531982421875,
"rewards/accuracies": 0.78125,
"rewards/chosen": 0.26019349694252014,
"rewards/margins": 1.110938310623169,
"rewards/rejected": -0.850744903087616,
"step": 135,
"train_speed(iter/s)": 0.005491
},
{
"epoch": 0.10972996142306043,
"grad_norm": 3.5955300331115723,
"learning_rate": 0.00019805567941728796,
"logits/chosen": -0.799392819404602,
"logits/rejected": -0.8029282689094543,
"logps/chosen": -9.87437629699707,
"logps/rejected": -23.02663230895996,
"loss": 0.9438092708587646,
"memory(GiB)": 46.83,
"nll_loss": 0.5196709036827087,
"rewards/accuracies": 0.78125,
"rewards/chosen": 0.07922995835542679,
"rewards/margins": 1.070724606513977,
"rewards/rejected": -0.9914946556091309,
"step": 136,
"train_speed(iter/s)": 0.005492
},
{
"epoch": 0.11053679937470058,
"grad_norm": 3.7304859161376953,
"learning_rate": 0.00019800295193538704,
"logits/chosen": -0.8160181641578674,
"logits/rejected": -0.8219972848892212,
"logps/chosen": -7.596125602722168,
"logps/rejected": -20.225994110107422,
"loss": 0.8485299348831177,
"memory(GiB)": 46.83,
"nll_loss": 0.43994730710983276,
"rewards/accuracies": 0.90625,
"rewards/chosen": 0.26360729336738586,
"rewards/margins": 0.9658780694007874,
"rewards/rejected": -0.7022708058357239,
"step": 137,
"train_speed(iter/s)": 0.005491
},
{
"epoch": 0.11134363732634074,
"grad_norm": 4.919328689575195,
"learning_rate": 0.00019794952624404167,
"logits/chosen": -0.7996560335159302,
"logits/rejected": -0.801249623298645,
"logps/chosen": -9.867749214172363,
"logps/rejected": -22.316190719604492,
"loss": 0.8283427357673645,
"memory(GiB)": 46.83,
"nll_loss": 0.4471050798892975,
"rewards/accuracies": 0.84375,
"rewards/chosen": 0.13889475166797638,
"rewards/margins": 1.224007248878479,
"rewards/rejected": -1.085112452507019,
"step": 138,
"train_speed(iter/s)": 0.005491
},
{
"epoch": 0.11215047527798089,
"grad_norm": 2.821730136871338,
"learning_rate": 0.0001978954027238763,
"logits/chosen": -0.818955659866333,
"logits/rejected": -0.8183013796806335,
"logps/chosen": -6.504258632659912,
"logps/rejected": -14.602479934692383,
"loss": 0.7571634650230408,
"memory(GiB)": 46.83,
"nll_loss": 0.29162290692329407,
"rewards/accuracies": 0.71875,
"rewards/chosen": 0.1784059852361679,
"rewards/margins": 0.8354285955429077,
"rewards/rejected": -0.6570225954055786,
"step": 139,
"train_speed(iter/s)": 0.005491
},
{
"epoch": 0.11295731322962103,
"grad_norm": 2.481306552886963,
"learning_rate": 0.000197840581760487,
"logits/chosen": -0.8251004219055176,
"logits/rejected": -0.8243045210838318,
"logps/chosen": -13.736132621765137,
"logps/rejected": -17.749977111816406,
"loss": 0.8052379488945007,
"memory(GiB)": 46.83,
"nll_loss": 0.4064967930316925,
"rewards/accuracies": 0.8125,
"rewards/chosen": 0.3237007260322571,
"rewards/margins": 1.295701026916504,
"rewards/rejected": -0.9720003008842468,
"step": 140,
"train_speed(iter/s)": 0.005492
},
{
"epoch": 0.1137641511812612,
"grad_norm": 2.695176601409912,
"learning_rate": 0.00019778506374443873,
"logits/chosen": -0.7545077800750732,
"logits/rejected": -0.7596877813339233,
"logps/chosen": -5.598147869110107,
"logps/rejected": -26.760784149169922,
"loss": 0.6858201026916504,
"memory(GiB)": 46.83,
"nll_loss": 0.3311798572540283,
"rewards/accuracies": 0.84375,
"rewards/chosen": 0.19224056601524353,
"rewards/margins": 1.6802706718444824,
"rewards/rejected": -1.488029956817627,
"step": 141,
"train_speed(iter/s)": 0.005493
},
{
"epoch": 0.11457098913290134,
"grad_norm": 2.5371341705322266,
"learning_rate": 0.0001977288490712624,
"logits/chosen": -0.8187113404273987,
"logits/rejected": -0.8256463408470154,
"logps/chosen": -9.480502128601074,
"logps/rejected": -26.96666717529297,
"loss": 0.6809464693069458,
"memory(GiB)": 46.83,
"nll_loss": 0.3261586129665375,
"rewards/accuracies": 0.90625,
"rewards/chosen": 0.2214924842119217,
"rewards/margins": 1.2070807218551636,
"rewards/rejected": -0.9855883121490479,
"step": 142,
"train_speed(iter/s)": 0.005493
},
{
"epoch": 0.11537782708454149,
"grad_norm": 3.33156681060791,
"learning_rate": 0.00019767193814145226,
"logits/chosen": -0.8148999214172363,
"logits/rejected": -0.8154037594795227,
"logps/chosen": -16.6685848236084,
"logps/rejected": -16.219863891601562,
"loss": 1.1351004838943481,
"memory(GiB)": 46.83,
"nll_loss": 0.6261444091796875,
"rewards/accuracies": 0.78125,
"rewards/chosen": 0.06986582279205322,
"rewards/margins": 0.7546349763870239,
"rewards/rejected": -0.6847692728042603,
"step": 143,
"train_speed(iter/s)": 0.005493
},
{
"epoch": 0.11618466503618163,
"grad_norm": 2.587169647216797,
"learning_rate": 0.00019761433136046295,
"logits/chosen": -0.7679372429847717,
"logits/rejected": -0.7711334824562073,
"logps/chosen": -6.84797477722168,
"logps/rejected": -25.882503509521484,
"loss": 0.6460772752761841,
"memory(GiB)": 46.83,
"nll_loss": 0.2581600844860077,
"rewards/accuracies": 0.78125,
"rewards/chosen": 0.25230705738067627,
"rewards/margins": 1.5044541358947754,
"rewards/rejected": -1.2521469593048096,
"step": 144,
"train_speed(iter/s)": 0.005494
},
{
"epoch": 0.1169915029878218,
"grad_norm": 3.816577911376953,
"learning_rate": 0.00019755602913870655,
"logits/chosen": -0.7486031651496887,
"logits/rejected": -0.7545804977416992,
"logps/chosen": -11.378320693969727,
"logps/rejected": -23.90165901184082,
"loss": 1.0280418395996094,
"memory(GiB)": 46.83,
"nll_loss": 0.5588870644569397,
"rewards/accuracies": 0.84375,
"rewards/chosen": 0.10084515064954758,
"rewards/margins": 1.0778629779815674,
"rewards/rejected": -0.9770178198814392,
"step": 145,
"train_speed(iter/s)": 0.005494
},
{
"epoch": 0.11779834093946194,
"grad_norm": 3.1183438301086426,
"learning_rate": 0.00019749703189154971,
"logits/chosen": -0.7663331031799316,
"logits/rejected": -0.7778096199035645,
"logps/chosen": -7.461820602416992,
"logps/rejected": -26.446916580200195,
"loss": 0.6639739274978638,
"memory(GiB)": 46.83,
"nll_loss": 0.28250494599342346,
"rewards/accuracies": 0.78125,
"rewards/chosen": 0.04964678734540939,
"rewards/margins": 1.1681914329528809,
"rewards/rejected": -1.1185446977615356,
"step": 146,
"train_speed(iter/s)": 0.005493
},
{
"epoch": 0.11860517889110209,
"grad_norm": 2.613725423812866,
"learning_rate": 0.00019743734003931082,
"logits/chosen": -0.808351993560791,
"logits/rejected": -0.8136962652206421,
"logps/chosen": -7.89247989654541,
"logps/rejected": -23.955371856689453,
"loss": 0.8511161804199219,
"memory(GiB)": 46.83,
"nll_loss": 0.39823463559150696,
"rewards/accuracies": 0.78125,
"rewards/chosen": 0.12871581315994263,
"rewards/margins": 1.055700659751892,
"rewards/rejected": -0.9269847869873047,
"step": 147,
"train_speed(iter/s)": 0.005493
},
{
"epoch": 0.11941201684274225,
"grad_norm": 3.0128729343414307,
"learning_rate": 0.00019737695400725677,
"logits/chosen": -0.7927097678184509,
"logits/rejected": -0.7919667959213257,
"logps/chosen": -9.877785682678223,
"logps/rejected": -23.477703094482422,
"loss": 0.7262363433837891,
"memory(GiB)": 46.83,
"nll_loss": 0.3177878260612488,
"rewards/accuracies": 0.78125,
"rewards/chosen": 0.12437373399734497,
"rewards/margins": 1.1551289558410645,
"rewards/rejected": -1.0307551622390747,
"step": 148,
"train_speed(iter/s)": 0.005495
},
{
"epoch": 0.1202188547943824,
"grad_norm": 2.5007247924804688,
"learning_rate": 0.0001973158742256001,
"logits/chosen": -0.815912663936615,
"logits/rejected": -0.8240575194358826,
"logps/chosen": -7.251335620880127,
"logps/rejected": -23.904563903808594,
"loss": 0.7742622494697571,
"memory(GiB)": 46.83,
"nll_loss": 0.3948196470737457,
"rewards/accuracies": 0.8125,
"rewards/chosen": 0.16877779364585876,
"rewards/margins": 1.3302054405212402,
"rewards/rejected": -1.1614277362823486,
"step": 149,
"train_speed(iter/s)": 0.005495
},
{
"epoch": 0.12102569274602254,
"grad_norm": 2.996128559112549,
"learning_rate": 0.0001972541011294959,
"logits/chosen": -0.8276554346084595,
"logits/rejected": -0.832274317741394,
"logps/chosen": -9.810141563415527,
"logps/rejected": -24.295639038085938,
"loss": 0.733322262763977,
"memory(GiB)": 46.83,
"nll_loss": 0.34396567940711975,
"rewards/accuracies": 0.90625,
"rewards/chosen": 0.03486320376396179,
"rewards/margins": 1.2224383354187012,
"rewards/rejected": -1.1875752210617065,
"step": 150,
"train_speed(iter/s)": 0.005495
},
{
"epoch": 0.12183253069766269,
"grad_norm": 3.6684677600860596,
"learning_rate": 0.0001971916351590386,
"logits/chosen": -0.8309310674667358,
"logits/rejected": -0.8319404721260071,
"logps/chosen": -13.512450218200684,
"logps/rejected": -28.13376808166504,
"loss": 0.8970531821250916,
"memory(GiB)": 46.83,
"nll_loss": 0.5336953997612,
"rewards/accuracies": 0.84375,
"rewards/chosen": -0.07107365131378174,
"rewards/margins": 1.3276447057724,
"rewards/rejected": -1.3987183570861816,
"step": 151,
"train_speed(iter/s)": 0.005492
},
{
"epoch": 0.12263936864930285,
"grad_norm": 3.4376490116119385,
"learning_rate": 0.00019712847675925903,
"logits/chosen": -0.8819084763526917,
"logits/rejected": -0.8899849653244019,
"logps/chosen": -9.134736061096191,
"logps/rejected": -25.074691772460938,
"loss": 0.7725754976272583,
"memory(GiB)": 46.83,
"nll_loss": 0.44169238209724426,
"rewards/accuracies": 0.84375,
"rewards/chosen": 0.20537638664245605,
"rewards/margins": 1.4855870008468628,
"rewards/rejected": -1.2802107334136963,
"step": 152,
"train_speed(iter/s)": 0.005492
},
{
"epoch": 0.12344620660094299,
"grad_norm": 5.506346225738525,
"learning_rate": 0.00019706462638012105,
"logits/chosen": -0.9026679992675781,
"logits/rejected": -0.908703088760376,
"logps/chosen": -13.740835189819336,
"logps/rejected": -25.73556900024414,
"loss": 1.2033629417419434,
"memory(GiB)": 46.83,
"nll_loss": 0.6762228608131409,
"rewards/accuracies": 0.6875,
"rewards/chosen": -0.11278621852397919,
"rewards/margins": 1.2870286703109741,
"rewards/rejected": -1.3998148441314697,
"step": 153,
"train_speed(iter/s)": 0.005492
},
{
"epoch": 0.12425304455258314,
"grad_norm": 4.886820316314697,
"learning_rate": 0.00019700008447651854,
"logits/chosen": -0.8641173839569092,
"logits/rejected": -0.859977662563324,
"logps/chosen": -13.57033634185791,
"logps/rejected": -26.01408576965332,
"loss": 1.2000961303710938,
"memory(GiB)": 46.83,
"nll_loss": 0.5635690093040466,
"rewards/accuracies": 0.625,
"rewards/chosen": -0.19201046228408813,
"rewards/margins": 1.3229352235794067,
"rewards/rejected": -1.51494562625885,
"step": 154,
"train_speed(iter/s)": 0.005493
},
{
"epoch": 0.12505988250422329,
"grad_norm": 3.3179073333740234,
"learning_rate": 0.00019693485150827197,
"logits/chosen": -0.8760464191436768,
"logits/rejected": -0.8815669417381287,
"logps/chosen": -9.239191055297852,
"logps/rejected": -28.241233825683594,
"loss": 0.6995830535888672,
"memory(GiB)": 46.83,
"nll_loss": 0.3207743167877197,
"rewards/accuracies": 0.78125,
"rewards/chosen": 0.1987459361553192,
"rewards/margins": 1.7694886922836304,
"rewards/rejected": -1.5707426071166992,
"step": 155,
"train_speed(iter/s)": 0.005494
},
{
"epoch": 0.12586672045586345,
"grad_norm": 5.6134161949157715,
"learning_rate": 0.0001968689279401253,
"logits/chosen": -0.8809852600097656,
"logits/rejected": -0.8887759447097778,
"logps/chosen": -7.534684181213379,
"logps/rejected": -30.649181365966797,
"loss": 1.0883609056472778,
"memory(GiB)": 46.83,
"nll_loss": 0.7660683393478394,
"rewards/accuracies": 0.8125,
"rewards/chosen": 0.2163163125514984,
"rewards/margins": 1.8669637441635132,
"rewards/rejected": -1.6506474018096924,
"step": 156,
"train_speed(iter/s)": 0.005494
},
{
"epoch": 0.1266735584075036,
"grad_norm": 2.5959808826446533,
"learning_rate": 0.0001968023142417424,
"logits/chosen": -0.8142418265342712,
"logits/rejected": -0.8186179995536804,
"logps/chosen": -9.635229110717773,
"logps/rejected": -32.11575698852539,
"loss": 0.6578619480133057,
"memory(GiB)": 46.83,
"nll_loss": 0.3367811441421509,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.21614979207515717,
"rewards/margins": 2.128612518310547,
"rewards/rejected": -1.912462592124939,
"step": 157,
"train_speed(iter/s)": 0.005495
},
{
"epoch": 0.12748039635914374,
"grad_norm": 3.154606342315674,
"learning_rate": 0.00019673501088770414,
"logits/chosen": -0.8146523237228394,
"logits/rejected": -0.8199130892753601,
"logps/chosen": -12.74015998840332,
"logps/rejected": -16.670421600341797,
"loss": 0.9762111306190491,
"memory(GiB)": 46.83,
"nll_loss": 0.5080199837684631,
"rewards/accuracies": 0.8125,
"rewards/chosen": 0.18415355682373047,
"rewards/margins": 0.8309141397476196,
"rewards/rejected": -0.6467605233192444,
"step": 158,
"train_speed(iter/s)": 0.005496
},
{
"epoch": 0.1282872343107839,
"grad_norm": 6.67454719543457,
"learning_rate": 0.00019666701835750457,
"logits/chosen": -0.8286721110343933,
"logits/rejected": -0.8334258794784546,
"logps/chosen": -8.225419044494629,
"logps/rejected": -17.38351821899414,
"loss": 0.9775789380073547,
"memory(GiB)": 46.83,
"nll_loss": 0.5453903079032898,
"rewards/accuracies": 0.78125,
"rewards/chosen": 0.15067297220230103,
"rewards/margins": 0.9060754776000977,
"rewards/rejected": -0.7554025650024414,
"step": 159,
"train_speed(iter/s)": 0.005495
},
{
"epoch": 0.12909407226242403,
"grad_norm": 3.848874092102051,
"learning_rate": 0.00019659833713554773,
"logits/chosen": -0.7873284816741943,
"logits/rejected": -0.7915123105049133,
"logps/chosen": -10.267017364501953,
"logps/rejected": -25.254423141479492,
"loss": 0.8222072124481201,
"memory(GiB)": 46.83,
"nll_loss": 0.43752118945121765,
"rewards/accuracies": 0.84375,
"rewards/chosen": 0.18684861063957214,
"rewards/margins": 1.191467523574829,
"rewards/rejected": -1.0046190023422241,
"step": 160,
"train_speed(iter/s)": 0.005495
},
{
"epoch": 0.1299009102140642,
"grad_norm": 8.467432975769043,
"learning_rate": 0.00019652896771114414,
"logits/chosen": -0.7907496094703674,
"logits/rejected": -0.7956827878952026,
"logps/chosen": -12.749449729919434,
"logps/rejected": -20.143428802490234,
"loss": 1.2200610637664795,
"memory(GiB)": 46.83,
"nll_loss": 0.7363396883010864,
"rewards/accuracies": 0.71875,
"rewards/chosen": 0.01990276202559471,
"rewards/margins": 0.667390763759613,
"rewards/rejected": -0.647487998008728,
"step": 161,
"train_speed(iter/s)": 0.005495
},
{
"epoch": 0.13070774816570435,
"grad_norm": 3.0088865756988525,
"learning_rate": 0.00019645891057850742,
"logits/chosen": -0.7298374176025391,
"logits/rejected": -0.732286274433136,
"logps/chosen": -15.880043029785156,
"logps/rejected": -24.578083038330078,
"loss": 0.8190960884094238,
"memory(GiB)": 46.83,
"nll_loss": 0.4379112124443054,
"rewards/accuracies": 0.84375,
"rewards/chosen": 0.2654583156108856,
"rewards/margins": 1.3646464347839355,
"rewards/rejected": -1.099188208580017,
"step": 162,
"train_speed(iter/s)": 0.005495
},
{
"epoch": 0.13151458611734448,
"grad_norm": 5.012711524963379,
"learning_rate": 0.00019638816623675058,
"logits/chosen": -0.7988470196723938,
"logits/rejected": -0.8017285466194153,
"logps/chosen": -9.470846176147461,
"logps/rejected": -25.236000061035156,
"loss": 0.798559844493866,
"memory(GiB)": 46.83,
"nll_loss": 0.32053616642951965,
"rewards/accuracies": 0.78125,
"rewards/chosen": 0.05605325102806091,
"rewards/margins": 1.3247337341308594,
"rewards/rejected": -1.268680453300476,
"step": 163,
"train_speed(iter/s)": 0.005494
},
{
"epoch": 0.13232142406898464,
"grad_norm": 5.894308567047119,
"learning_rate": 0.00019631673518988261,
"logits/chosen": -0.7558510303497314,
"logits/rejected": -0.7591589689254761,
"logps/chosen": -8.896431922912598,
"logps/rejected": -26.477436065673828,
"loss": 0.7629649043083191,
"memory(GiB)": 46.83,
"nll_loss": 0.35155194997787476,
"rewards/accuracies": 0.84375,
"rewards/chosen": 0.04630519449710846,
"rewards/margins": 1.3866008520126343,
"rewards/rejected": -1.340295672416687,
"step": 164,
"train_speed(iter/s)": 0.005493
},
{
"epoch": 0.1331282620206248,
"grad_norm": 4.07641077041626,
"learning_rate": 0.0001962446179468048,
"logits/chosen": -0.7340226173400879,
"logits/rejected": -0.7390322089195251,
"logps/chosen": -7.206872463226318,
"logps/rejected": -30.465621948242188,
"loss": 0.7621070742607117,
"memory(GiB)": 46.83,
"nll_loss": 0.3923991620540619,
"rewards/accuracies": 0.84375,
"rewards/chosen": 0.12836496531963348,
"rewards/margins": 1.729160189628601,
"rewards/rejected": -1.6007951498031616,
"step": 165,
"train_speed(iter/s)": 0.005493
},
{
"epoch": 0.13393509997226494,
"grad_norm": 4.966350078582764,
"learning_rate": 0.00019617181502130723,
"logits/chosen": -0.7315192222595215,
"logits/rejected": -0.7316710352897644,
"logps/chosen": -9.406560897827148,
"logps/rejected": -20.61480712890625,
"loss": 0.9099687337875366,
"memory(GiB)": 46.83,
"nll_loss": 0.3969041705131531,
"rewards/accuracies": 0.71875,
"rewards/chosen": 0.084879070520401,
"rewards/margins": 0.9290111064910889,
"rewards/rejected": -0.844132125377655,
"step": 166,
"train_speed(iter/s)": 0.005493
},
{
"epoch": 0.1347419379239051,
"grad_norm": 2.8620102405548096,
"learning_rate": 0.00019609832693206494,
"logits/chosen": -0.6981790065765381,
"logits/rejected": -0.6956609487533569,
"logps/chosen": -11.53895092010498,
"logps/rejected": -17.151912689208984,
"loss": 0.7675348520278931,
"memory(GiB)": 46.83,
"nll_loss": 0.364923357963562,
"rewards/accuracies": 0.90625,
"rewards/chosen": 0.22551363706588745,
"rewards/margins": 0.959013044834137,
"rewards/rejected": -0.73349928855896,
"step": 167,
"train_speed(iter/s)": 0.005493
},
{
"epoch": 0.13554877587554526,
"grad_norm": 3.910537004470825,
"learning_rate": 0.00019602415420263443,
"logits/chosen": -0.7344207763671875,
"logits/rejected": -0.7377809286117554,
"logps/chosen": -9.725975036621094,
"logps/rejected": -26.63901138305664,
"loss": 0.9027658104896545,
"memory(GiB)": 46.83,
"nll_loss": 0.4818994700908661,
"rewards/accuracies": 0.78125,
"rewards/chosen": 0.0954769030213356,
"rewards/margins": 1.3119255304336548,
"rewards/rejected": -1.2164486646652222,
"step": 168,
"train_speed(iter/s)": 0.005494
},
{
"epoch": 0.1363556138271854,
"grad_norm": 2.7541050910949707,
"learning_rate": 0.00019594929736144976,
"logits/chosen": -0.7230939865112305,
"logits/rejected": -0.7268710732460022,
"logps/chosen": -6.102090835571289,
"logps/rejected": -22.030675888061523,
"loss": 0.8178823590278625,
"memory(GiB)": 46.83,
"nll_loss": 0.4109593629837036,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.2232162207365036,
"rewards/margins": 1.0571808815002441,
"rewards/rejected": -0.8339645862579346,
"step": 169,
"train_speed(iter/s)": 0.005494
},
{
"epoch": 0.13716245177882555,
"grad_norm": 2.1247079372406006,
"learning_rate": 0.00019587375694181888,
"logits/chosen": -0.7419747114181519,
"logits/rejected": -0.7435666918754578,
"logps/chosen": -10.772944450378418,
"logps/rejected": -17.87366485595703,
"loss": 0.7673830389976501,
"memory(GiB)": 46.83,
"nll_loss": 0.3707871735095978,
"rewards/accuracies": 0.84375,
"rewards/chosen": 0.2476326823234558,
"rewards/margins": 0.9303527474403381,
"rewards/rejected": -0.6827200055122375,
"step": 170,
"train_speed(iter/s)": 0.005494
},
{
"epoch": 0.1379692897304657,
"grad_norm": 3.058112382888794,
"learning_rate": 0.00019579753348191982,
"logits/chosen": -0.7581822276115417,
"logits/rejected": -0.7616063356399536,
"logps/chosen": -10.94616413116455,
"logps/rejected": -22.71567153930664,
"loss": 0.9573794603347778,
"memory(GiB)": 46.83,
"nll_loss": 0.4561714828014374,
"rewards/accuracies": 0.78125,
"rewards/chosen": 0.10372941941022873,
"rewards/margins": 0.9039929509162903,
"rewards/rejected": -0.8002634644508362,
"step": 171,
"train_speed(iter/s)": 0.005495
},
{
"epoch": 0.13877612768210584,
"grad_norm": 5.104068756103516,
"learning_rate": 0.00019572062752479683,
"logits/chosen": -0.7440593242645264,
"logits/rejected": -0.7444762587547302,
"logps/chosen": -13.373594284057617,
"logps/rejected": -21.11050033569336,
"loss": 0.9622430801391602,
"memory(GiB)": 46.83,
"nll_loss": 0.6134111881256104,
"rewards/accuracies": 0.90625,
"rewards/chosen": 0.17188113927841187,
"rewards/margins": 1.2960879802703857,
"rewards/rejected": -1.1242069005966187,
"step": 172,
"train_speed(iter/s)": 0.005495
},
{
"epoch": 0.139582965633746,
"grad_norm": 3.6643261909484863,
"learning_rate": 0.00019564303961835654,
"logits/chosen": -0.7351651787757874,
"logits/rejected": -0.7340760827064514,
"logps/chosen": -13.493339538574219,
"logps/rejected": -29.00867462158203,
"loss": 0.8059775233268738,
"memory(GiB)": 46.83,
"nll_loss": 0.4561418890953064,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.07504750788211823,
"rewards/margins": 1.5861859321594238,
"rewards/rejected": -1.5111385583877563,
"step": 173,
"train_speed(iter/s)": 0.005494
},
{
"epoch": 0.14038980358538614,
"grad_norm": 3.840665102005005,
"learning_rate": 0.00019556477031536397,
"logits/chosen": -0.7632665634155273,
"logits/rejected": -0.7688808441162109,
"logps/chosen": -7.488624572753906,
"logps/rejected": -27.777238845825195,
"loss": 0.7469439506530762,
"memory(GiB)": 46.83,
"nll_loss": 0.378052294254303,
"rewards/accuracies": 0.84375,
"rewards/chosen": 0.07338213175535202,
"rewards/margins": 1.5290367603302002,
"rewards/rejected": -1.4556546211242676,
"step": 174,
"train_speed(iter/s)": 0.005494
},
{
"epoch": 0.1411966415370263,
"grad_norm": 2.548142671585083,
"learning_rate": 0.00019548582017343878,
"logits/chosen": -0.7821887731552124,
"logits/rejected": -0.7840255498886108,
"logps/chosen": -9.051867485046387,
"logps/rejected": -26.980369567871094,
"loss": 0.6677172183990479,
"memory(GiB)": 46.83,
"nll_loss": 0.3486889600753784,
"rewards/accuracies": 0.90625,
"rewards/chosen": 0.10505867004394531,
"rewards/margins": 1.3984501361846924,
"rewards/rejected": -1.2933913469314575,
"step": 175,
"train_speed(iter/s)": 0.005494
},
{
"epoch": 0.14200347948866646,
"grad_norm": 3.0442428588867188,
"learning_rate": 0.00019540618975505107,
"logits/chosen": -0.7756679058074951,
"logits/rejected": -0.7768942713737488,
"logps/chosen": -9.436080932617188,
"logps/rejected": -24.625957489013672,
"loss": 0.7269696593284607,
"memory(GiB)": 46.83,
"nll_loss": 0.3957803249359131,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.18510255217552185,
"rewards/margins": 1.5727849006652832,
"rewards/rejected": -1.3876824378967285,
"step": 176,
"train_speed(iter/s)": 0.005494
},
{
"epoch": 0.1428103174403066,
"grad_norm": 4.40380859375,
"learning_rate": 0.00019532587962751757,
"logits/chosen": -0.7868165969848633,
"logits/rejected": -0.7917428016662598,
"logps/chosen": -12.063282012939453,
"logps/rejected": -26.304283142089844,
"loss": 0.8930169343948364,
"memory(GiB)": 46.83,
"nll_loss": 0.5761467814445496,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.2778218984603882,
"rewards/margins": 1.7966634035110474,
"rewards/rejected": -1.5188415050506592,
"step": 177,
"train_speed(iter/s)": 0.005495
},
{
"epoch": 0.14361715539194675,
"grad_norm": 6.159250259399414,
"learning_rate": 0.0001952448903629974,
"logits/chosen": -0.8135851621627808,
"logits/rejected": -0.8196555972099304,
"logps/chosen": -16.506568908691406,
"logps/rejected": -26.224693298339844,
"loss": 1.118604302406311,
"memory(GiB)": 46.83,
"nll_loss": 0.5594882965087891,
"rewards/accuracies": 0.65625,
"rewards/chosen": -0.20946675539016724,
"rewards/margins": 1.0000211000442505,
"rewards/rejected": -1.209487795829773,
"step": 178,
"train_speed(iter/s)": 0.005494
},
{
"epoch": 0.1444239933435869,
"grad_norm": 3.561173439025879,
"learning_rate": 0.00019516322253848828,
"logits/chosen": -0.8224231600761414,
"logits/rejected": -0.8233227729797363,
"logps/chosen": -8.352205276489258,
"logps/rejected": -23.940982818603516,
"loss": 0.7962292432785034,
"memory(GiB)": 46.83,
"nll_loss": 0.4265138804912567,
"rewards/accuracies": 0.84375,
"rewards/chosen": 0.2205028533935547,
"rewards/margins": 1.6108112335205078,
"rewards/rejected": -1.3903082609176636,
"step": 179,
"train_speed(iter/s)": 0.005496
},
{
"epoch": 0.14523083129522704,
"grad_norm": 3.16656756401062,
"learning_rate": 0.00019508087673582205,
"logits/chosen": -0.8061304688453674,
"logits/rejected": -0.8118202090263367,
"logps/chosen": -8.317770004272461,
"logps/rejected": -26.48977279663086,
"loss": 0.7722903490066528,
"memory(GiB)": 46.83,
"nll_loss": 0.37005698680877686,
"rewards/accuracies": 0.75,
"rewards/chosen": 0.028686638921499252,
"rewards/margins": 1.5126442909240723,
"rewards/rejected": -1.4839575290679932,
"step": 180,
"train_speed(iter/s)": 0.005496
},
{
"epoch": 0.1460376692468672,
"grad_norm": 3.15301513671875,
"learning_rate": 0.00019499785354166083,
"logits/chosen": -0.7916308641433716,
"logits/rejected": -0.7952077984809875,
"logps/chosen": -7.383344650268555,
"logps/rejected": -32.59227752685547,
"loss": 0.7744749784469604,
"memory(GiB)": 46.83,
"nll_loss": 0.4444514214992523,
"rewards/accuracies": 0.84375,
"rewards/chosen": 0.0771065428853035,
"rewards/margins": 2.1048974990844727,
"rewards/rejected": -2.0277910232543945,
"step": 181,
"train_speed(iter/s)": 0.005497
},
{
"epoch": 0.14684450719850736,
"grad_norm": 2.6223182678222656,
"learning_rate": 0.00019491415354749272,
"logits/chosen": -0.7739111185073853,
"logits/rejected": -0.7772398591041565,
"logps/chosen": -6.630223274230957,
"logps/rejected": -26.15964126586914,
"loss": 0.693659245967865,
"memory(GiB)": 46.83,
"nll_loss": 0.3340071141719818,
"rewards/accuracies": 0.8125,
"rewards/chosen": 0.1530786156654358,
"rewards/margins": 1.5430837869644165,
"rewards/rejected": -1.3900052309036255,
"step": 182,
"train_speed(iter/s)": 0.005497
},
{
"epoch": 0.1476513451501475,
"grad_norm": 2.088421106338501,
"learning_rate": 0.00019482977734962753,
"logits/chosen": -0.7808999419212341,
"logits/rejected": -0.7902572154998779,
"logps/chosen": -8.449446678161621,
"logps/rejected": -31.33694076538086,
"loss": 0.5712997913360596,
"memory(GiB)": 46.83,
"nll_loss": 0.31176620721817017,
"rewards/accuracies": 0.90625,
"rewards/chosen": 0.27892935276031494,
"rewards/margins": 2.0656492710113525,
"rewards/rejected": -1.7867200374603271,
"step": 183,
"train_speed(iter/s)": 0.005497
},
{
"epoch": 0.14845818310178766,
"grad_norm": 4.234419345855713,
"learning_rate": 0.00019474472554919272,
"logits/chosen": -0.8170475959777832,
"logits/rejected": -0.825502872467041,
"logps/chosen": -9.795135498046875,
"logps/rejected": -31.384075164794922,
"loss": 0.7613832354545593,
"memory(GiB)": 46.83,
"nll_loss": 0.3808598518371582,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.14184550940990448,
"rewards/margins": 1.434211254119873,
"rewards/rejected": -1.2923656702041626,
"step": 184,
"train_speed(iter/s)": 0.005497
},
{
"epoch": 0.1492650210534278,
"grad_norm": 2.047487735748291,
"learning_rate": 0.00019465899875212888,
"logits/chosen": -0.794952929019928,
"logits/rejected": -0.8015525937080383,
"logps/chosen": -6.017518043518066,
"logps/rejected": -19.722206115722656,
"loss": 0.6337971091270447,
"memory(GiB)": 46.83,
"nll_loss": 0.28807568550109863,
"rewards/accuracies": 0.90625,
"rewards/chosen": 0.24735234677791595,
"rewards/margins": 1.255548119544983,
"rewards/rejected": -1.0081957578659058,
"step": 185,
"train_speed(iter/s)": 0.005497
},
{
"epoch": 0.15007185900506795,
"grad_norm": 3.8246495723724365,
"learning_rate": 0.00019457259756918552,
"logits/chosen": -0.8133244514465332,
"logits/rejected": -0.8167756199836731,
"logps/chosen": -10.089277267456055,
"logps/rejected": -26.579971313476562,
"loss": 0.7682158946990967,
"memory(GiB)": 46.83,
"nll_loss": 0.3842141926288605,
"rewards/accuracies": 0.8125,
"rewards/chosen": 0.10676907747983932,
"rewards/margins": 1.6904234886169434,
"rewards/rejected": -1.5836546421051025,
"step": 186,
"train_speed(iter/s)": 0.005497
},
{
"epoch": 0.1508786969567081,
"grad_norm": 4.293128490447998,
"learning_rate": 0.00019448552261591687,
"logits/chosen": -0.81524658203125,
"logits/rejected": -0.8198854327201843,
"logps/chosen": -12.067436218261719,
"logps/rejected": -23.448137283325195,
"loss": 0.9188786149024963,
"memory(GiB)": 46.83,
"nll_loss": 0.5105058550834656,
"rewards/accuracies": 0.84375,
"rewards/chosen": 0.23126842081546783,
"rewards/margins": 1.3146940469741821,
"rewards/rejected": -1.083425760269165,
"step": 187,
"train_speed(iter/s)": 0.005497
},
{
"epoch": 0.15168553490834824,
"grad_norm": 5.430900573730469,
"learning_rate": 0.00019439777451267718,
"logits/chosen": -0.8615626096725464,
"logits/rejected": -0.8717396855354309,
"logps/chosen": -12.81668472290039,
"logps/rejected": -33.20039367675781,
"loss": 0.8604999780654907,
"memory(GiB)": 46.83,
"nll_loss": 0.5934706926345825,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.07574808597564697,
"rewards/margins": 2.146501064300537,
"rewards/rejected": -2.0707528591156006,
"step": 188,
"train_speed(iter/s)": 0.005498
},
{
"epoch": 0.1524923728599884,
"grad_norm": 5.0244140625,
"learning_rate": 0.00019430935388461656,
"logits/chosen": -0.8756387233734131,
"logits/rejected": -0.8824178576469421,
"logps/chosen": -9.554489135742188,
"logps/rejected": -33.99430847167969,
"loss": 0.7015911936759949,
"memory(GiB)": 46.83,
"nll_loss": 0.4163678288459778,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.21942490339279175,
"rewards/margins": 2.339784622192383,
"rewards/rejected": -2.1203596591949463,
"step": 189,
"train_speed(iter/s)": 0.005498
},
{
"epoch": 0.15329921081162856,
"grad_norm": 5.72052526473999,
"learning_rate": 0.0001942202613616764,
"logits/chosen": -0.8696508407592773,
"logits/rejected": -0.8797045350074768,
"logps/chosen": -8.161410331726074,
"logps/rejected": -31.448095321655273,
"loss": 0.6777075529098511,
"memory(GiB)": 46.83,
"nll_loss": 0.36822211742401123,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.29191264510154724,
"rewards/margins": 1.8597280979156494,
"rewards/rejected": -1.5678153038024902,
"step": 190,
"train_speed(iter/s)": 0.005498
},
{
"epoch": 0.1541060487632687,
"grad_norm": 9.510895729064941,
"learning_rate": 0.00019413049757858496,
"logits/chosen": -0.8756559491157532,
"logits/rejected": -0.8811758756637573,
"logps/chosen": -9.792702674865723,
"logps/rejected": -34.0648078918457,
"loss": 0.8311678767204285,
"memory(GiB)": 46.83,
"nll_loss": 0.47524788975715637,
"rewards/accuracies": 0.84375,
"rewards/chosen": 0.09086283296346664,
"rewards/margins": 2.250915050506592,
"rewards/rejected": -2.1600520610809326,
"step": 191,
"train_speed(iter/s)": 0.005498
},
{
"epoch": 0.15491288671490885,
"grad_norm": 2.9663641452789307,
"learning_rate": 0.0001940400631748528,
"logits/chosen": -0.8579489588737488,
"logits/rejected": -0.8665011525154114,
"logps/chosen": -8.948463439941406,
"logps/rejected": -39.376953125,
"loss": 0.6801427602767944,
"memory(GiB)": 46.83,
"nll_loss": 0.4235433042049408,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.021937131881713867,
"rewards/margins": 2.60715913772583,
"rewards/rejected": -2.585222005844116,
"step": 192,
"train_speed(iter/s)": 0.005499
},
{
"epoch": 0.15571972466654901,
"grad_norm": 4.202517509460449,
"learning_rate": 0.0001939489587947682,
"logits/chosen": -0.8559134006500244,
"logits/rejected": -0.8664484620094299,
"logps/chosen": -6.8310418128967285,
"logps/rejected": -31.699092864990234,
"loss": 0.6303547024726868,
"memory(GiB)": 46.83,
"nll_loss": 0.32207247614860535,
"rewards/accuracies": 0.90625,
"rewards/chosen": 0.2676079273223877,
"rewards/margins": 2.117737293243408,
"rewards/rejected": -1.8501293659210205,
"step": 193,
"train_speed(iter/s)": 0.005499
},
{
"epoch": 0.15652656261818915,
"grad_norm": 2.568023681640625,
"learning_rate": 0.00019385718508739262,
"logits/chosen": -0.8656299710273743,
"logits/rejected": -0.8692151308059692,
"logps/chosen": -8.725165367126465,
"logps/rejected": -33.851287841796875,
"loss": 0.7019908428192139,
"memory(GiB)": 46.83,
"nll_loss": 0.41890949010849,
"rewards/accuracies": 0.90625,
"rewards/chosen": 0.18432064354419708,
"rewards/margins": 2.251908302307129,
"rewards/rejected": -2.0675878524780273,
"step": 194,
"train_speed(iter/s)": 0.005499
},
{
"epoch": 0.1573334005698293,
"grad_norm": 8.88502025604248,
"learning_rate": 0.000193764742706556,
"logits/chosen": -0.8621362447738647,
"logits/rejected": -0.8639461994171143,
"logps/chosen": -11.037799835205078,
"logps/rejected": -21.885807037353516,
"loss": 1.035823941230774,
"memory(GiB)": 46.83,
"nll_loss": 0.5726286768913269,
"rewards/accuracies": 0.8125,
"rewards/chosen": 0.020187322050333023,
"rewards/margins": 1.3119888305664062,
"rewards/rejected": -1.2918013334274292,
"step": 195,
"train_speed(iter/s)": 0.005499
},
{
"epoch": 0.15814023852146947,
"grad_norm": 5.145761489868164,
"learning_rate": 0.00019367163231085227,
"logits/chosen": -0.8333749771118164,
"logits/rejected": -0.8401883840560913,
"logps/chosen": -12.062631607055664,
"logps/rejected": -28.78449249267578,
"loss": 0.7770197987556458,
"memory(GiB)": 46.83,
"nll_loss": 0.41585007309913635,
"rewards/accuracies": 0.84375,
"rewards/chosen": 0.08489862084388733,
"rewards/margins": 1.6114108562469482,
"rewards/rejected": -1.5265123844146729,
"step": 196,
"train_speed(iter/s)": 0.005499
},
{
"epoch": 0.1589470764731096,
"grad_norm": 9.907797813415527,
"learning_rate": 0.00019357785456363452,
"logits/chosen": -0.8024821281433105,
"logits/rejected": -0.809442937374115,
"logps/chosen": -10.157941818237305,
"logps/rejected": -25.024654388427734,
"loss": 1.1124495267868042,
"memory(GiB)": 46.83,
"nll_loss": 0.5751543045043945,
"rewards/accuracies": 0.84375,
"rewards/chosen": -0.056628137826919556,
"rewards/margins": 1.3617597818374634,
"rewards/rejected": -1.4183878898620605,
"step": 197,
"train_speed(iter/s)": 0.005499
},
{
"epoch": 0.15975391442474976,
"grad_norm": 5.390470027923584,
"learning_rate": 0.00019348341013301014,
"logits/chosen": -0.8071514368057251,
"logits/rejected": -0.8174934387207031,
"logps/chosen": -8.75635814666748,
"logps/rejected": -33.552799224853516,
"loss": 0.6396787166595459,
"memory(GiB)": 46.83,
"nll_loss": 0.39103907346725464,
"rewards/accuracies": 0.96875,
"rewards/chosen": 0.2289201021194458,
"rewards/margins": 1.8501532077789307,
"rewards/rejected": -1.6212331056594849,
"step": 198,
"train_speed(iter/s)": 0.005499
},
{
"epoch": 0.1605607523763899,
"grad_norm": 2.6979644298553467,
"learning_rate": 0.00019338829969183644,
"logits/chosen": -0.810739278793335,
"logits/rejected": -0.8188509941101074,
"logps/chosen": -7.122466087341309,
"logps/rejected": -26.984783172607422,
"loss": 0.7288452386856079,
"memory(GiB)": 46.83,
"nll_loss": 0.3455110192298889,
"rewards/accuracies": 0.8125,
"rewards/chosen": 0.12697723507881165,
"rewards/margins": 1.6645798683166504,
"rewards/rejected": -1.5376026630401611,
"step": 199,
"train_speed(iter/s)": 0.005499
},
{
"epoch": 0.16136759032803005,
"grad_norm": 3.698697805404663,
"learning_rate": 0.00019329252391771555,
"logits/chosen": -0.7774844765663147,
"logits/rejected": -0.7780304551124573,
"logps/chosen": -12.480424880981445,
"logps/rejected": -22.409971237182617,
"loss": 0.9710755944252014,
"memory(GiB)": 46.83,
"nll_loss": 0.5477850437164307,
"rewards/accuracies": 0.84375,
"rewards/chosen": 0.16317154467105865,
"rewards/margins": 1.5441625118255615,
"rewards/rejected": -1.380990982055664,
"step": 200,
"train_speed(iter/s)": 0.005498
},
{
"epoch": 0.1621744282796702,
"grad_norm": 2.8351235389709473,
"learning_rate": 0.00019319608349298962,
"logits/chosen": -0.8196174502372742,
"logits/rejected": -0.8330628275871277,
"logps/chosen": -7.196435928344727,
"logps/rejected": -30.938335418701172,
"loss": 0.6695919632911682,
"memory(GiB)": 46.83,
"nll_loss": 0.31925174593925476,
"rewards/accuracies": 0.84375,
"rewards/chosen": 0.21494938433170319,
"rewards/margins": 1.952761173248291,
"rewards/rejected": -1.737811803817749,
"step": 201,
"train_speed(iter/s)": 0.005496
},
{
"epoch": 0.16298126623131035,
"grad_norm": 5.542436599731445,
"learning_rate": 0.0001930989791047361,
"logits/chosen": -0.7954035997390747,
"logits/rejected": -0.7969664335250854,
"logps/chosen": -10.17538070678711,
"logps/rejected": -20.19991683959961,
"loss": 0.8598300218582153,
"memory(GiB)": 46.83,
"nll_loss": 0.46379411220550537,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.1660608947277069,
"rewards/margins": 1.2763766050338745,
"rewards/rejected": -1.1103156805038452,
"step": 202,
"train_speed(iter/s)": 0.005495
},
{
"epoch": 0.1637881041829505,
"grad_norm": 5.940423011779785,
"learning_rate": 0.00019300121144476276,
"logits/chosen": -0.8003661632537842,
"logits/rejected": -0.8022105097770691,
"logps/chosen": -7.63640022277832,
"logps/rejected": -24.617435455322266,
"loss": 0.8151254057884216,
"memory(GiB)": 46.83,
"nll_loss": 0.3810645043849945,
"rewards/accuracies": 0.78125,
"rewards/chosen": 0.07057296484708786,
"rewards/margins": 1.2225996255874634,
"rewards/rejected": -1.1520267724990845,
"step": 203,
"train_speed(iter/s)": 0.005496
},
{
"epoch": 0.16459494213459067,
"grad_norm": 2.6105964183807373,
"learning_rate": 0.00019290278120960265,
"logits/chosen": -0.7997848391532898,
"logits/rejected": -0.805422306060791,
"logps/chosen": -14.606799125671387,
"logps/rejected": -31.826797485351562,
"loss": 0.77715665102005,
"memory(GiB)": 46.83,
"nll_loss": 0.43484237790107727,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.14822271466255188,
"rewards/margins": 1.6973564624786377,
"rewards/rejected": -1.5491337776184082,
"step": 204,
"train_speed(iter/s)": 0.005496
},
{
"epoch": 0.1654017800862308,
"grad_norm": 2.472439765930176,
"learning_rate": 0.00019280368910050942,
"logits/chosen": -0.8194397687911987,
"logits/rejected": -0.8225022554397583,
"logps/chosen": -11.139198303222656,
"logps/rejected": -29.919803619384766,
"loss": 0.6480454206466675,
"memory(GiB)": 46.83,
"nll_loss": 0.3610724210739136,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.27185019850730896,
"rewards/margins": 1.6965210437774658,
"rewards/rejected": -1.4246705770492554,
"step": 205,
"train_speed(iter/s)": 0.005496
},
{
"epoch": 0.16620861803787096,
"grad_norm": 2.494168758392334,
"learning_rate": 0.00019270393582345206,
"logits/chosen": -0.7520598769187927,
"logits/rejected": -0.7561833262443542,
"logps/chosen": -6.9641194343566895,
"logps/rejected": -28.728130340576172,
"loss": 0.5702533721923828,
"memory(GiB)": 46.83,
"nll_loss": 0.29727238416671753,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.28327614068984985,
"rewards/margins": 1.785872220993042,
"rewards/rejected": -1.5025960206985474,
"step": 206,
"train_speed(iter/s)": 0.005497
},
{
"epoch": 0.16701545598951112,
"grad_norm": 4.714883327484131,
"learning_rate": 0.00019260352208910997,
"logits/chosen": -0.8163325786590576,
"logits/rejected": -0.8220417499542236,
"logps/chosen": -9.346306800842285,
"logps/rejected": -24.412797927856445,
"loss": 0.8744742274284363,
"memory(GiB)": 46.83,
"nll_loss": 0.45610249042510986,
"rewards/accuracies": 0.90625,
"rewards/chosen": 0.13759079575538635,
"rewards/margins": 1.5552394390106201,
"rewards/rejected": -1.4176486730575562,
"step": 207,
"train_speed(iter/s)": 0.005496
},
{
"epoch": 0.16782229394115125,
"grad_norm": 4.433586597442627,
"learning_rate": 0.0001925024486128679,
"logits/chosen": -0.7977516055107117,
"logits/rejected": -0.7999525666236877,
"logps/chosen": -6.685362339019775,
"logps/rejected": -30.688045501708984,
"loss": 0.7153071165084839,
"memory(GiB)": 46.83,
"nll_loss": 0.4366532862186432,
"rewards/accuracies": 0.90625,
"rewards/chosen": 0.29755526781082153,
"rewards/margins": 2.2702927589416504,
"rewards/rejected": -1.972737431526184,
"step": 208,
"train_speed(iter/s)": 0.005496
},
{
"epoch": 0.1686291318927914,
"grad_norm": 4.401594161987305,
"learning_rate": 0.00019240071611481086,
"logits/chosen": -0.8025681376457214,
"logits/rejected": -0.8077267408370972,
"logps/chosen": -13.663830757141113,
"logps/rejected": -24.164400100708008,
"loss": 1.104232668876648,
"memory(GiB)": 46.83,
"nll_loss": 0.6018862724304199,
"rewards/accuracies": 0.78125,
"rewards/chosen": 0.03685776889324188,
"rewards/margins": 1.151037573814392,
"rewards/rejected": -1.1141799688339233,
"step": 209,
"train_speed(iter/s)": 0.005497
},
{
"epoch": 0.16943596984443154,
"grad_norm": 4.337040424346924,
"learning_rate": 0.00019229832531971895,
"logits/chosen": -0.7619237899780273,
"logits/rejected": -0.7677690982818604,
"logps/chosen": -9.870525360107422,
"logps/rejected": -29.796783447265625,
"loss": 0.7632872462272644,
"memory(GiB)": 46.83,
"nll_loss": 0.44924822449684143,
"rewards/accuracies": 0.84375,
"rewards/chosen": 0.225393608212471,
"rewards/margins": 1.9376754760742188,
"rewards/rejected": -1.7122818231582642,
"step": 210,
"train_speed(iter/s)": 0.005496
},
{
"epoch": 0.1702428077960717,
"grad_norm": 3.420403480529785,
"learning_rate": 0.00019219527695706225,
"logits/chosen": -0.8083672523498535,
"logits/rejected": -0.8105168342590332,
"logps/chosen": -11.423739433288574,
"logps/rejected": -28.65767478942871,
"loss": 0.821802020072937,
"memory(GiB)": 46.83,
"nll_loss": 0.4434516131877899,
"rewards/accuracies": 0.84375,
"rewards/chosen": -0.02067011035978794,
"rewards/margins": 1.7222641706466675,
"rewards/rejected": -1.742934226989746,
"step": 211,
"train_speed(iter/s)": 0.005496
},
{
"epoch": 0.17104964574771186,
"grad_norm": 3.6967742443084717,
"learning_rate": 0.0001920915717609956,
"logits/chosen": -0.7133735418319702,
"logits/rejected": -0.7154325246810913,
"logps/chosen": -10.63201904296875,
"logps/rejected": -32.25654220581055,
"loss": 0.787774384021759,
"memory(GiB)": 46.83,
"nll_loss": 0.4298105239868164,
"rewards/accuracies": 0.8125,
"rewards/chosen": 0.11374176293611526,
"rewards/margins": 1.7497272491455078,
"rewards/rejected": -1.6359853744506836,
"step": 212,
"train_speed(iter/s)": 0.005496
},
{
"epoch": 0.171856483699352,
"grad_norm": 2.264280319213867,
"learning_rate": 0.00019198721047035332,
"logits/chosen": -0.7573313117027283,
"logits/rejected": -0.7648686766624451,
"logps/chosen": -6.39276123046875,
"logps/rejected": -36.62308883666992,
"loss": 0.5318189859390259,
"memory(GiB)": 46.83,
"nll_loss": 0.290658563375473,
"rewards/accuracies": 0.90625,
"rewards/chosen": 0.29253923892974854,
"rewards/margins": 2.4327423572540283,
"rewards/rejected": -2.1402029991149902,
"step": 213,
"train_speed(iter/s)": 0.005496
},
{
"epoch": 0.17266332165099216,
"grad_norm": 5.493023872375488,
"learning_rate": 0.00019188219382864404,
"logits/chosen": -0.7108193039894104,
"logits/rejected": -0.7183860540390015,
"logps/chosen": -9.189270973205566,
"logps/rejected": -31.597461700439453,
"loss": 0.7931143045425415,
"memory(GiB)": 46.83,
"nll_loss": 0.416747510433197,
"rewards/accuracies": 0.90625,
"rewards/chosen": 0.12628071010112762,
"rewards/margins": 2.070514440536499,
"rewards/rejected": -1.944233775138855,
"step": 214,
"train_speed(iter/s)": 0.005496
},
{
"epoch": 0.17347015960263232,
"grad_norm": 4.492797374725342,
"learning_rate": 0.00019177652258404537,
"logits/chosen": -0.6989372968673706,
"logits/rejected": -0.7087696194648743,
"logps/chosen": -8.885594367980957,
"logps/rejected": -34.03559112548828,
"loss": 0.6859308481216431,
"memory(GiB)": 46.83,
"nll_loss": 0.3817839026451111,
"rewards/accuracies": 0.90625,
"rewards/chosen": 0.28730612993240356,
"rewards/margins": 2.0253334045410156,
"rewards/rejected": -1.7380273342132568,
"step": 215,
"train_speed(iter/s)": 0.005495
},
{
"epoch": 0.17427699755427245,
"grad_norm": 3.6368393898010254,
"learning_rate": 0.00019167019748939846,
"logits/chosen": -0.6883965134620667,
"logits/rejected": -0.6965335607528687,
"logps/chosen": -10.925715446472168,
"logps/rejected": -27.23555564880371,
"loss": 0.8080936074256897,
"memory(GiB)": 46.83,
"nll_loss": 0.4929322898387909,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.2524645924568176,
"rewards/margins": 1.5861448049545288,
"rewards/rejected": -1.333680272102356,
"step": 216,
"train_speed(iter/s)": 0.005495
},
{
"epoch": 0.1750838355059126,
"grad_norm": 5.671794414520264,
"learning_rate": 0.00019156321930220282,
"logits/chosen": -0.691314160823822,
"logits/rejected": -0.6934138536453247,
"logps/chosen": -9.144570350646973,
"logps/rejected": -25.588308334350586,
"loss": 0.662991464138031,
"memory(GiB)": 46.83,
"nll_loss": 0.3658694326877594,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.18018078804016113,
"rewards/margins": 1.5743441581726074,
"rewards/rejected": -1.3941633701324463,
"step": 217,
"train_speed(iter/s)": 0.005495
},
{
"epoch": 0.17589067345755277,
"grad_norm": 2.1973373889923096,
"learning_rate": 0.00019145558878461082,
"logits/chosen": -0.6576846241950989,
"logits/rejected": -0.6600756049156189,
"logps/chosen": -6.376984596252441,
"logps/rejected": -29.26129150390625,
"loss": 0.6061776280403137,
"memory(GiB)": 46.83,
"nll_loss": 0.2504776120185852,
"rewards/accuracies": 0.75,
"rewards/chosen": 0.19691388309001923,
"rewards/margins": 1.7360740900039673,
"rewards/rejected": -1.5391600131988525,
"step": 218,
"train_speed(iter/s)": 0.005494
},
{
"epoch": 0.1766975114091929,
"grad_norm": 2.812636137008667,
"learning_rate": 0.0001913473067034222,
"logits/chosen": -0.6517618298530579,
"logits/rejected": -0.6520282626152039,
"logps/chosen": -8.633819580078125,
"logps/rejected": -33.03736877441406,
"loss": 0.6993431448936462,
"memory(GiB)": 46.83,
"nll_loss": 0.29945075511932373,
"rewards/accuracies": 0.75,
"rewards/chosen": 0.11881062388420105,
"rewards/margins": 2.108510971069336,
"rewards/rejected": -1.9897003173828125,
"step": 219,
"train_speed(iter/s)": 0.005495
},
{
"epoch": 0.17750434936083306,
"grad_norm": 7.618241786956787,
"learning_rate": 0.00019123837383007883,
"logits/chosen": -0.644814133644104,
"logits/rejected": -0.6507334113121033,
"logps/chosen": -13.946501731872559,
"logps/rejected": -32.865543365478516,
"loss": 1.0418133735656738,
"memory(GiB)": 46.83,
"nll_loss": 0.7301790714263916,
"rewards/accuracies": 0.84375,
"rewards/chosen": 0.10093473643064499,
"rewards/margins": 2.085968017578125,
"rewards/rejected": -1.9850331544876099,
"step": 220,
"train_speed(iter/s)": 0.005495
},
{
"epoch": 0.17831118731247322,
"grad_norm": 4.556211948394775,
"learning_rate": 0.0001911287909406589,
"logits/chosen": -0.6804370880126953,
"logits/rejected": -0.6847546696662903,
"logps/chosen": -12.122690200805664,
"logps/rejected": -36.90291976928711,
"loss": 0.6899932622909546,
"memory(GiB)": 46.83,
"nll_loss": 0.3899839520454407,
"rewards/accuracies": 0.96875,
"rewards/chosen": 0.09739936888217926,
"rewards/margins": 2.288754940032959,
"rewards/rejected": -2.1913557052612305,
"step": 221,
"train_speed(iter/s)": 0.005495
},
{
"epoch": 0.17911802526411336,
"grad_norm": 6.417980194091797,
"learning_rate": 0.00019101855881587166,
"logits/chosen": -0.7121025919914246,
"logits/rejected": -0.7198390364646912,
"logps/chosen": -10.071988105773926,
"logps/rejected": -30.89111328125,
"loss": 1.0868934392929077,
"memory(GiB)": 46.83,
"nll_loss": 0.7049968242645264,
"rewards/accuracies": 0.84375,
"rewards/chosen": 0.059290315955877304,
"rewards/margins": 2.18007755279541,
"rewards/rejected": -2.1207873821258545,
"step": 222,
"train_speed(iter/s)": 0.005495
},
{
"epoch": 0.17992486321575352,
"grad_norm": 3.5655276775360107,
"learning_rate": 0.00019090767824105173,
"logits/chosen": -0.7064835429191589,
"logits/rejected": -0.7118909358978271,
"logps/chosen": -9.299367904663086,
"logps/rejected": -33.5615234375,
"loss": 0.5532280802726746,
"memory(GiB)": 46.83,
"nll_loss": 0.3098145127296448,
"rewards/accuracies": 0.90625,
"rewards/chosen": 0.1762467920780182,
"rewards/margins": 2.1976656913757324,
"rewards/rejected": -2.0214192867279053,
"step": 223,
"train_speed(iter/s)": 0.005495
},
{
"epoch": 0.18073170116739365,
"grad_norm": 3.168497085571289,
"learning_rate": 0.00019079615000615352,
"logits/chosen": -0.7555636763572693,
"logits/rejected": -0.7638076543807983,
"logps/chosen": -6.343996524810791,
"logps/rejected": -35.11958694458008,
"loss": 0.544819712638855,
"memory(GiB)": 46.83,
"nll_loss": 0.2573380768299103,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.08291390538215637,
"rewards/margins": 2.359328269958496,
"rewards/rejected": -2.276414394378662,
"step": 224,
"train_speed(iter/s)": 0.005495
},
{
"epoch": 0.1815385391190338,
"grad_norm": 3.8726441860198975,
"learning_rate": 0.00019068397490574563,
"logits/chosen": -0.7438031435012817,
"logits/rejected": -0.7529388070106506,
"logps/chosen": -7.913335800170898,
"logps/rejected": -42.34702682495117,
"loss": 0.6369010210037231,
"memory(GiB)": 46.83,
"nll_loss": 0.40800100564956665,
"rewards/accuracies": 0.90625,
"rewards/chosen": 0.10036337375640869,
"rewards/margins": 2.888615131378174,
"rewards/rejected": -2.7882518768310547,
"step": 225,
"train_speed(iter/s)": 0.005496
},
{
"epoch": 0.18234537707067397,
"grad_norm": 3.78493595123291,
"learning_rate": 0.00019057115373900514,
"logits/chosen": -0.6967946290969849,
"logits/rejected": -0.7004595994949341,
"logps/chosen": -10.167012214660645,
"logps/rejected": -32.77048873901367,
"loss": 0.6220114231109619,
"memory(GiB)": 46.83,
"nll_loss": 0.351274311542511,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.23287636041641235,
"rewards/margins": 2.1248767375946045,
"rewards/rejected": -1.8920003175735474,
"step": 226,
"train_speed(iter/s)": 0.005495
},
{
"epoch": 0.1831522150223141,
"grad_norm": 4.551224231719971,
"learning_rate": 0.00019045768730971196,
"logits/chosen": -0.7525245547294617,
"logits/rejected": -0.7602270841598511,
"logps/chosen": -7.277904987335205,
"logps/rejected": -39.11262130737305,
"loss": 0.49062812328338623,
"memory(GiB)": 46.83,
"nll_loss": 0.24764156341552734,
"rewards/accuracies": 0.90625,
"rewards/chosen": 0.2196008712053299,
"rewards/margins": 2.6062889099121094,
"rewards/rejected": -2.386688232421875,
"step": 227,
"train_speed(iter/s)": 0.005495
},
{
"epoch": 0.18395905297395426,
"grad_norm": 3.352492094039917,
"learning_rate": 0.00019034357642624313,
"logits/chosen": -0.7168059349060059,
"logits/rejected": -0.7239040732383728,
"logps/chosen": -14.352468490600586,
"logps/rejected": -43.02729415893555,
"loss": 0.9112517833709717,
"memory(GiB)": 46.83,
"nll_loss": 0.6249459981918335,
"rewards/accuracies": 0.875,
"rewards/chosen": -0.11119358241558075,
"rewards/margins": 2.6521291732788086,
"rewards/rejected": -2.7633233070373535,
"step": 228,
"train_speed(iter/s)": 0.005495
},
{
"epoch": 0.18476589092559442,
"grad_norm": 9.10729694366455,
"learning_rate": 0.00019022882190156693,
"logits/chosen": -0.7800168991088867,
"logits/rejected": -0.7834780216217041,
"logps/chosen": -6.645830154418945,
"logps/rejected": -37.247894287109375,
"loss": 0.6339117288589478,
"memory(GiB)": 46.83,
"nll_loss": 0.3112393617630005,
"rewards/accuracies": 0.84375,
"rewards/chosen": 0.1333404928445816,
"rewards/margins": 2.6678478717803955,
"rewards/rejected": -2.5345070362091064,
"step": 229,
"train_speed(iter/s)": 0.005495
},
{
"epoch": 0.18557272887723456,
"grad_norm": 8.036460876464844,
"learning_rate": 0.0001901134245532372,
"logits/chosen": -0.7188634276390076,
"logits/rejected": -0.7256328463554382,
"logps/chosen": -8.977944374084473,
"logps/rejected": -39.439598083496094,
"loss": 0.7736544609069824,
"memory(GiB)": 46.83,
"nll_loss": 0.40554046630859375,
"rewards/accuracies": 0.78125,
"rewards/chosen": 0.07693760097026825,
"rewards/margins": 2.647231101989746,
"rewards/rejected": -2.570293426513672,
"step": 230,
"train_speed(iter/s)": 0.005495
},
{
"epoch": 0.18637956682887472,
"grad_norm": 14.515076637268066,
"learning_rate": 0.00018999738520338765,
"logits/chosen": -0.7673274874687195,
"logits/rejected": -0.7723326086997986,
"logps/chosen": -11.787941932678223,
"logps/rejected": -31.827787399291992,
"loss": 1.2146649360656738,
"memory(GiB)": 46.83,
"nll_loss": 0.7273156642913818,
"rewards/accuracies": 0.71875,
"rewards/chosen": -0.19174721837043762,
"rewards/margins": 1.6821880340576172,
"rewards/rejected": -1.8739351034164429,
"step": 231,
"train_speed(iter/s)": 0.005495
},
{
"epoch": 0.18718640478051488,
"grad_norm": 5.435638904571533,
"learning_rate": 0.00018988070467872565,
"logits/chosen": -0.6913294792175293,
"logits/rejected": -0.6982335448265076,
"logps/chosen": -8.256817817687988,
"logps/rejected": -33.933128356933594,
"loss": 0.7231890559196472,
"memory(GiB)": 46.83,
"nll_loss": 0.42718639969825745,
"rewards/accuracies": 0.84375,
"rewards/chosen": 0.2676782011985779,
"rewards/margins": 2.2451353073120117,
"rewards/rejected": -1.977457046508789,
"step": 232,
"train_speed(iter/s)": 0.005495
},
{
"epoch": 0.187993242732155,
"grad_norm": 4.923380374908447,
"learning_rate": 0.00018976338381052662,
"logits/chosen": -0.6979964971542358,
"logits/rejected": -0.6987626552581787,
"logps/chosen": -9.278888702392578,
"logps/rejected": -31.988529205322266,
"loss": 0.7011741399765015,
"memory(GiB)": 46.83,
"nll_loss": 0.3678920269012451,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.17272722721099854,
"rewards/margins": 2.0346527099609375,
"rewards/rejected": -1.8619252443313599,
"step": 233,
"train_speed(iter/s)": 0.005495
},
{
"epoch": 0.18880008068379517,
"grad_norm": 5.102010250091553,
"learning_rate": 0.00018964542343462802,
"logits/chosen": -0.7147118449211121,
"logits/rejected": -0.7210678458213806,
"logps/chosen": -11.869325637817383,
"logps/rejected": -26.554332733154297,
"loss": 0.7859650254249573,
"memory(GiB)": 46.83,
"nll_loss": 0.4002649784088135,
"rewards/accuracies": 0.8125,
"rewards/chosen": 0.16828711330890656,
"rewards/margins": 1.6456825733184814,
"rewards/rejected": -1.4773954153060913,
"step": 234,
"train_speed(iter/s)": 0.005495
},
{
"epoch": 0.1896069186354353,
"grad_norm": 2.8259975910186768,
"learning_rate": 0.0001895268243914234,
"logits/chosen": -0.7181320786476135,
"logits/rejected": -0.7195937633514404,
"logps/chosen": -9.674834251403809,
"logps/rejected": -26.982505798339844,
"loss": 0.7054999470710754,
"memory(GiB)": 46.83,
"nll_loss": 0.3795202672481537,
"rewards/accuracies": 0.84375,
"rewards/chosen": 0.19310441613197327,
"rewards/margins": 1.8784090280532837,
"rewards/rejected": -1.6853046417236328,
"step": 235,
"train_speed(iter/s)": 0.005494
},
{
"epoch": 0.19041375658707546,
"grad_norm": 2.970991373062134,
"learning_rate": 0.0001894075875258564,
"logits/chosen": -0.7360837459564209,
"logits/rejected": -0.7415453195571899,
"logps/chosen": -7.354928493499756,
"logps/rejected": -26.934494018554688,
"loss": 0.7415454983711243,
"memory(GiB)": 46.83,
"nll_loss": 0.37382036447525024,
"rewards/accuracies": 0.71875,
"rewards/chosen": 0.24830269813537598,
"rewards/margins": 1.7458440065383911,
"rewards/rejected": -1.4975413084030151,
"step": 236,
"train_speed(iter/s)": 0.005494
},
{
"epoch": 0.19122059453871562,
"grad_norm": 2.9580154418945312,
"learning_rate": 0.00018928771368741475,
"logits/chosen": -0.6901527643203735,
"logits/rejected": -0.6940097808837891,
"logps/chosen": -7.6646575927734375,
"logps/rejected": -28.092966079711914,
"loss": 0.7272118330001831,
"memory(GiB)": 46.83,
"nll_loss": 0.4050924777984619,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.22855332493782043,
"rewards/margins": 1.7601354122161865,
"rewards/rejected": -1.531581997871399,
"step": 237,
"train_speed(iter/s)": 0.005494
},
{
"epoch": 0.19202743249035575,
"grad_norm": 5.010228633880615,
"learning_rate": 0.00018916720373012426,
"logits/chosen": -0.7200859785079956,
"logits/rejected": -0.7226930260658264,
"logps/chosen": -10.032082557678223,
"logps/rejected": -19.060348510742188,
"loss": 0.8445019125938416,
"memory(GiB)": 46.83,
"nll_loss": 0.42176133394241333,
"rewards/accuracies": 0.8125,
"rewards/chosen": 0.18809281289577484,
"rewards/margins": 1.2276759147644043,
"rewards/rejected": -1.0395830869674683,
"step": 238,
"train_speed(iter/s)": 0.005495
},
{
"epoch": 0.19283427044199591,
"grad_norm": 8.475236892700195,
"learning_rate": 0.0001890460585125426,
"logits/chosen": -0.7142471075057983,
"logits/rejected": -0.7235907912254333,
"logps/chosen": -6.3985443115234375,
"logps/rejected": -33.978721618652344,
"loss": 0.6591022610664368,
"memory(GiB)": 46.83,
"nll_loss": 0.43263474106788635,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.22361797094345093,
"rewards/margins": 2.1702280044555664,
"rewards/rejected": -1.9466102123260498,
"step": 239,
"train_speed(iter/s)": 0.005495
},
{
"epoch": 0.19364110839363607,
"grad_norm": 3.6248912811279297,
"learning_rate": 0.00018892427889775332,
"logits/chosen": -0.7144255638122559,
"logits/rejected": -0.7168291807174683,
"logps/chosen": -9.34170150756836,
"logps/rejected": -30.304466247558594,
"loss": 0.6725300550460815,
"memory(GiB)": 46.83,
"nll_loss": 0.39394479990005493,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.13639676570892334,
"rewards/margins": 1.9869462251663208,
"rewards/rejected": -1.850549578666687,
"step": 240,
"train_speed(iter/s)": 0.005494
},
{
"epoch": 0.1944479463452762,
"grad_norm": 6.973753452301025,
"learning_rate": 0.00018880186575335968,
"logits/chosen": -0.6703215837478638,
"logits/rejected": -0.6775541305541992,
"logps/chosen": -12.076030731201172,
"logps/rejected": -28.837940216064453,
"loss": 0.7876323461532593,
"memory(GiB)": 46.83,
"nll_loss": 0.4970223605632782,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.17666694521903992,
"rewards/margins": 1.7176096439361572,
"rewards/rejected": -1.540942668914795,
"step": 241,
"train_speed(iter/s)": 0.005495
},
{
"epoch": 0.19525478429691637,
"grad_norm": 3.2324650287628174,
"learning_rate": 0.00018867881995147836,
"logits/chosen": -0.7113248705863953,
"logits/rejected": -0.7163888216018677,
"logps/chosen": -9.168296813964844,
"logps/rejected": -34.54369354248047,
"loss": 0.6157009601593018,
"memory(GiB)": 46.83,
"nll_loss": 0.37985488772392273,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.28986138105392456,
"rewards/margins": 2.2379894256591797,
"rewards/rejected": -1.9481279850006104,
"step": 242,
"train_speed(iter/s)": 0.005495
},
{
"epoch": 0.19606162224855653,
"grad_norm": 2.7521631717681885,
"learning_rate": 0.00018855514236873337,
"logits/chosen": -0.7281562089920044,
"logits/rejected": -0.734757661819458,
"logps/chosen": -7.001053333282471,
"logps/rejected": -33.900177001953125,
"loss": 0.5766606330871582,
"memory(GiB)": 46.83,
"nll_loss": 0.3622375726699829,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.30857908725738525,
"rewards/margins": 2.3744540214538574,
"rewards/rejected": -2.0658748149871826,
"step": 243,
"train_speed(iter/s)": 0.005495
},
{
"epoch": 0.19686846020019666,
"grad_norm": 3.977639675140381,
"learning_rate": 0.0001884308338862498,
"logits/chosen": -0.6999315023422241,
"logits/rejected": -0.7055974006652832,
"logps/chosen": -8.435256004333496,
"logps/rejected": -33.67347717285156,
"loss": 0.590577244758606,
"memory(GiB)": 46.83,
"nll_loss": 0.35361507534980774,
"rewards/accuracies": 0.90625,
"rewards/chosen": 0.2805049419403076,
"rewards/margins": 2.308706283569336,
"rewards/rejected": -2.0282013416290283,
"step": 244,
"train_speed(iter/s)": 0.005495
},
{
"epoch": 0.19767529815183682,
"grad_norm": 9.163761138916016,
"learning_rate": 0.00018830589538964746,
"logits/chosen": -0.7660690546035767,
"logits/rejected": -0.7758455276489258,
"logps/chosen": -8.95065975189209,
"logps/rejected": -33.142677307128906,
"loss": 0.8324503302574158,
"memory(GiB)": 46.83,
"nll_loss": 0.42908376455307007,
"rewards/accuracies": 0.84375,
"rewards/chosen": 0.11282955855131149,
"rewards/margins": 2.1978847980499268,
"rewards/rejected": -2.085055351257324,
"step": 245,
"train_speed(iter/s)": 0.005495
},
{
"epoch": 0.19848213610347698,
"grad_norm": 4.68986701965332,
"learning_rate": 0.00018818032776903466,
"logits/chosen": -0.7814006805419922,
"logits/rejected": -0.7920705676078796,
"logps/chosen": -8.228378295898438,
"logps/rejected": -46.880313873291016,
"loss": 0.6729190349578857,
"memory(GiB)": 46.83,
"nll_loss": 0.4284536838531494,
"rewards/accuracies": 0.90625,
"rewards/chosen": 0.0902179628610611,
"rewards/margins": 3.1966192722320557,
"rewards/rejected": -3.106401205062866,
"step": 246,
"train_speed(iter/s)": 0.005495
},
{
"epoch": 0.1992889740551171,
"grad_norm": 5.915354251861572,
"learning_rate": 0.00018805413191900168,
"logits/chosen": -0.7995182871818542,
"logits/rejected": -0.805888295173645,
"logps/chosen": -12.739469528198242,
"logps/rejected": -35.06949996948242,
"loss": 0.7942692041397095,
"memory(GiB)": 46.83,
"nll_loss": 0.43145498633384705,
"rewards/accuracies": 0.8125,
"rewards/chosen": -0.08451483398675919,
"rewards/margins": 2.140747547149658,
"rewards/rejected": -2.22526216506958,
"step": 247,
"train_speed(iter/s)": 0.005495
},
{
"epoch": 0.20009581200675727,
"grad_norm": 7.71060848236084,
"learning_rate": 0.00018792730873861473,
"logits/chosen": -0.8068017363548279,
"logits/rejected": -0.8110726475715637,
"logps/chosen": -11.049007415771484,
"logps/rejected": -39.38182067871094,
"loss": 0.8510176539421082,
"memory(GiB)": 46.83,
"nll_loss": 0.4571390151977539,
"rewards/accuracies": 0.84375,
"rewards/chosen": -0.20343750715255737,
"rewards/margins": 2.1684627532958984,
"rewards/rejected": -2.3719000816345215,
"step": 248,
"train_speed(iter/s)": 0.005496
},
{
"epoch": 0.2009026499583974,
"grad_norm": 9.637003898620605,
"learning_rate": 0.00018779985913140924,
"logits/chosen": -0.7676049470901489,
"logits/rejected": -0.7769947648048401,
"logps/chosen": -8.674398422241211,
"logps/rejected": -48.47040557861328,
"loss": 0.9282071590423584,
"memory(GiB)": 46.83,
"nll_loss": 0.6683814525604248,
"rewards/accuracies": 0.9375,
"rewards/chosen": -0.20568305253982544,
"rewards/margins": 3.0397698879241943,
"rewards/rejected": -3.245452642440796,
"step": 249,
"train_speed(iter/s)": 0.005496
},
{
"epoch": 0.20170948791003757,
"grad_norm": 8.807076454162598,
"learning_rate": 0.0001876717840053836,
"logits/chosen": -0.7096577882766724,
"logits/rejected": -0.7144345641136169,
"logps/chosen": -17.149080276489258,
"logps/rejected": -33.67993927001953,
"loss": 1.056300401687622,
"memory(GiB)": 46.83,
"nll_loss": 0.6277230381965637,
"rewards/accuracies": 0.875,
"rewards/chosen": -0.030492231249809265,
"rewards/margins": 2.3309168815612793,
"rewards/rejected": -2.3614089488983154,
"step": 250,
"train_speed(iter/s)": 0.005496
},
{
"epoch": 0.20251632586167773,
"grad_norm": 4.773517608642578,
"learning_rate": 0.00018754308427299256,
"logits/chosen": -0.6819360852241516,
"logits/rejected": -0.6919792294502258,
"logps/chosen": -10.13283634185791,
"logps/rejected": -36.599456787109375,
"loss": 0.8876217007637024,
"memory(GiB)": 46.83,
"nll_loss": 0.47694316506385803,
"rewards/accuracies": 0.90625,
"rewards/chosen": -0.12443971633911133,
"rewards/margins": 2.1682839393615723,
"rewards/rejected": -2.2927236557006836,
"step": 251,
"train_speed(iter/s)": 0.005494
},
{
"epoch": 0.20332316381331786,
"grad_norm": 4.1274027824401855,
"learning_rate": 0.00018741376085114087,
"logits/chosen": -0.7192296981811523,
"logits/rejected": -0.7263290882110596,
"logps/chosen": -16.484987258911133,
"logps/rejected": -34.811126708984375,
"loss": 0.8948942422866821,
"memory(GiB)": 46.83,
"nll_loss": 0.5631111860275269,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.20992696285247803,
"rewards/margins": 2.0608201026916504,
"rewards/rejected": -1.8508930206298828,
"step": 252,
"train_speed(iter/s)": 0.005494
},
{
"epoch": 0.20413000176495802,
"grad_norm": 4.913299560546875,
"learning_rate": 0.0001872838146611766,
"logits/chosen": -0.6601164937019348,
"logits/rejected": -0.6605373620986938,
"logps/chosen": -12.14169979095459,
"logps/rejected": -26.232892990112305,
"loss": 0.8705669045448303,
"memory(GiB)": 46.83,
"nll_loss": 0.4974067509174347,
"rewards/accuracies": 0.75,
"rewards/chosen": 0.2535248100757599,
"rewards/margins": 1.8131681680679321,
"rewards/rejected": -1.5596435070037842,
"step": 253,
"train_speed(iter/s)": 0.005495
},
{
"epoch": 0.20493683971659818,
"grad_norm": 2.4414825439453125,
"learning_rate": 0.0001871532466288847,
"logits/chosen": -0.6655547618865967,
"logits/rejected": -0.6710434556007385,
"logps/chosen": -7.641450881958008,
"logps/rejected": -27.024456024169922,
"loss": 0.5410662293434143,
"memory(GiB)": 46.83,
"nll_loss": 0.2969762682914734,
"rewards/accuracies": 0.96875,
"rewards/chosen": 0.2998022437095642,
"rewards/margins": 1.8008990287780762,
"rewards/rejected": -1.5010967254638672,
"step": 254,
"train_speed(iter/s)": 0.005495
},
{
"epoch": 0.2057436776682383,
"grad_norm": 9.875016212463379,
"learning_rate": 0.0001870220576844804,
"logits/chosen": -0.6554844379425049,
"logits/rejected": -0.6586723923683167,
"logps/chosen": -10.128920555114746,
"logps/rejected": -28.380104064941406,
"loss": 1.077211856842041,
"memory(GiB)": 46.83,
"nll_loss": 0.703222930431366,
"rewards/accuracies": 0.84375,
"rewards/chosen": 0.11552818864583969,
"rewards/margins": 1.8149248361587524,
"rewards/rejected": -1.6993966102600098,
"step": 255,
"train_speed(iter/s)": 0.005495
},
{
"epoch": 0.20655051561987847,
"grad_norm": 2.7163054943084717,
"learning_rate": 0.0001868902487626024,
"logits/chosen": -0.725955605506897,
"logits/rejected": -0.7319348454475403,
"logps/chosen": -6.896210193634033,
"logps/rejected": -30.118925094604492,
"loss": 0.5430217385292053,
"memory(GiB)": 46.83,
"nll_loss": 0.2342616319656372,
"rewards/accuracies": 0.90625,
"rewards/chosen": 0.2470369040966034,
"rewards/margins": 1.7953723669052124,
"rewards/rejected": -1.548335313796997,
"step": 256,
"train_speed(iter/s)": 0.005494
},
{
"epoch": 0.20735735357151863,
"grad_norm": 3.3832037448883057,
"learning_rate": 0.00018675782080230648,
"logits/chosen": -0.6649719476699829,
"logits/rejected": -0.6653549671173096,
"logps/chosen": -6.564362049102783,
"logps/rejected": -26.97052764892578,
"loss": 0.6336417198181152,
"memory(GiB)": 46.83,
"nll_loss": 0.33324965834617615,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.07798978686332703,
"rewards/margins": 1.5198760032653809,
"rewards/rejected": -1.4418861865997314,
"step": 257,
"train_speed(iter/s)": 0.005494
},
{
"epoch": 0.20816419152315876,
"grad_norm": 4.554774761199951,
"learning_rate": 0.00018662477474705864,
"logits/chosen": -0.6891136169433594,
"logits/rejected": -0.7018118500709534,
"logps/chosen": -10.358716011047363,
"logps/rejected": -33.35871124267578,
"loss": 0.944884181022644,
"memory(GiB)": 46.83,
"nll_loss": 0.515121579170227,
"rewards/accuracies": 0.75,
"rewards/chosen": 0.15751619637012482,
"rewards/margins": 1.947699785232544,
"rewards/rejected": -1.790183663368225,
"step": 258,
"train_speed(iter/s)": 0.005494
},
{
"epoch": 0.20897102947479892,
"grad_norm": 6.9074788093566895,
"learning_rate": 0.00018649111154472842,
"logits/chosen": -0.6972513794898987,
"logits/rejected": -0.7002527117729187,
"logps/chosen": -9.99314022064209,
"logps/rejected": -20.69109344482422,
"loss": 1.1074203252792358,
"memory(GiB)": 46.83,
"nll_loss": 0.6453499794006348,
"rewards/accuracies": 0.84375,
"rewards/chosen": 0.05247223377227783,
"rewards/margins": 1.2508971691131592,
"rewards/rejected": -1.1984249353408813,
"step": 259,
"train_speed(iter/s)": 0.005494
},
{
"epoch": 0.20977786742643906,
"grad_norm": 6.223460674285889,
"learning_rate": 0.00018635683214758214,
"logits/chosen": -0.7319504022598267,
"logits/rejected": -0.7356070280075073,
"logps/chosen": -8.844853401184082,
"logps/rejected": -32.97547912597656,
"loss": 0.7976398468017578,
"memory(GiB)": 46.83,
"nll_loss": 0.425577849149704,
"rewards/accuracies": 0.84375,
"rewards/chosen": 0.04917633533477783,
"rewards/margins": 1.9350166320800781,
"rewards/rejected": -1.8858401775360107,
"step": 260,
"train_speed(iter/s)": 0.005494
},
{
"epoch": 0.21058470537807922,
"grad_norm": 6.114218711853027,
"learning_rate": 0.00018622193751227607,
"logits/chosen": -0.7542300820350647,
"logits/rejected": -0.7576084733009338,
"logps/chosen": -5.740233898162842,
"logps/rejected": -24.60858917236328,
"loss": 0.5687559247016907,
"memory(GiB)": 46.83,
"nll_loss": 0.27638113498687744,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.23254472017288208,
"rewards/margins": 1.7274789810180664,
"rewards/rejected": -1.49493408203125,
"step": 261,
"train_speed(iter/s)": 0.005495
},
{
"epoch": 0.21139154332971938,
"grad_norm": 3.313537836074829,
"learning_rate": 0.00018608642859984978,
"logits/chosen": -0.8011643886566162,
"logits/rejected": -0.803293764591217,
"logps/chosen": -9.771310806274414,
"logps/rejected": -28.634235382080078,
"loss": 0.7911385893821716,
"memory(GiB)": 46.83,
"nll_loss": 0.41166451573371887,
"rewards/accuracies": 0.84375,
"rewards/chosen": 0.265075147151947,
"rewards/margins": 2.063453197479248,
"rewards/rejected": -1.7983779907226562,
"step": 262,
"train_speed(iter/s)": 0.005494
},
{
"epoch": 0.2121983812813595,
"grad_norm": 3.156975746154785,
"learning_rate": 0.00018595030637571906,
"logits/chosen": -0.7707415223121643,
"logits/rejected": -0.7777128219604492,
"logps/chosen": -10.236924171447754,
"logps/rejected": -30.459064483642578,
"loss": 0.6563097238540649,
"memory(GiB)": 46.83,
"nll_loss": 0.3598516285419464,
"rewards/accuracies": 0.90625,
"rewards/chosen": 0.24525853991508484,
"rewards/margins": 2.071570873260498,
"rewards/rejected": -1.82631254196167,
"step": 263,
"train_speed(iter/s)": 0.005494
},
{
"epoch": 0.21300521923299967,
"grad_norm": 4.330559730529785,
"learning_rate": 0.00018581357180966925,
"logits/chosen": -0.8070797920227051,
"logits/rejected": -0.8171977400779724,
"logps/chosen": -9.34181022644043,
"logps/rejected": -32.88754653930664,
"loss": 0.8858993053436279,
"memory(GiB)": 46.83,
"nll_loss": 0.49547457695007324,
"rewards/accuracies": 0.78125,
"rewards/chosen": 0.15189547836780548,
"rewards/margins": 1.979980230331421,
"rewards/rejected": -1.828084945678711,
"step": 264,
"train_speed(iter/s)": 0.005494
},
{
"epoch": 0.21381205718463983,
"grad_norm": 5.864645957946777,
"learning_rate": 0.00018567622587584818,
"logits/chosen": -0.7768454551696777,
"logits/rejected": -0.781791090965271,
"logps/chosen": -8.989236831665039,
"logps/rejected": -33.998809814453125,
"loss": 0.748650848865509,
"memory(GiB)": 46.83,
"nll_loss": 0.46606677770614624,
"rewards/accuracies": 0.90625,
"rewards/chosen": 0.22831673920154572,
"rewards/margins": 2.1091978549957275,
"rewards/rejected": -1.8808808326721191,
"step": 265,
"train_speed(iter/s)": 0.005495
},
{
"epoch": 0.21461889513627996,
"grad_norm": 8.510169982910156,
"learning_rate": 0.00018553826955275936,
"logits/chosen": -0.8200643062591553,
"logits/rejected": -0.8230538368225098,
"logps/chosen": -14.249617576599121,
"logps/rejected": -25.856830596923828,
"loss": 1.2568143606185913,
"memory(GiB)": 46.83,
"nll_loss": 0.629042387008667,
"rewards/accuracies": 0.78125,
"rewards/chosen": -0.19409911334514618,
"rewards/margins": 1.33782160282135,
"rewards/rejected": -1.5319206714630127,
"step": 266,
"train_speed(iter/s)": 0.005494
},
{
"epoch": 0.21542573308792012,
"grad_norm": 3.2720420360565186,
"learning_rate": 0.00018539970382325482,
"logits/chosen": -0.8381865620613098,
"logits/rejected": -0.8415036201477051,
"logps/chosen": -7.8104567527771,
"logps/rejected": -31.601917266845703,
"loss": 0.5837196111679077,
"memory(GiB)": 46.83,
"nll_loss": 0.24857257306575775,
"rewards/accuracies": 0.84375,
"rewards/chosen": 0.14021825790405273,
"rewards/margins": 2.0099189281463623,
"rewards/rejected": -1.8697006702423096,
"step": 267,
"train_speed(iter/s)": 0.005494
},
{
"epoch": 0.21623257103956028,
"grad_norm": 3.4341468811035156,
"learning_rate": 0.00018526052967452836,
"logits/chosen": -0.7830556631088257,
"logits/rejected": -0.7897158265113831,
"logps/chosen": -11.684428215026855,
"logps/rejected": -36.22364044189453,
"loss": 0.7827985882759094,
"memory(GiB)": 46.83,
"nll_loss": 0.48799192905426025,
"rewards/accuracies": 0.90625,
"rewards/chosen": 0.08203143626451492,
"rewards/margins": 1.9769901037216187,
"rewards/rejected": -1.89495849609375,
"step": 268,
"train_speed(iter/s)": 0.005494
},
{
"epoch": 0.21703940899120042,
"grad_norm": 3.692969799041748,
"learning_rate": 0.00018512074809810833,
"logits/chosen": -0.7967461347579956,
"logits/rejected": -0.7945878505706787,
"logps/chosen": -10.929898262023926,
"logps/rejected": -23.94034194946289,
"loss": 0.7881439924240112,
"memory(GiB)": 46.83,
"nll_loss": 0.3369988203048706,
"rewards/accuracies": 0.71875,
"rewards/chosen": 0.08296848833560944,
"rewards/margins": 1.621280550956726,
"rewards/rejected": -1.5383120775222778,
"step": 269,
"train_speed(iter/s)": 0.005494
},
{
"epoch": 0.21784624694284058,
"grad_norm": 6.830929756164551,
"learning_rate": 0.00018498036008985058,
"logits/chosen": -0.746848464012146,
"logits/rejected": -0.7509756684303284,
"logps/chosen": -9.608593940734863,
"logps/rejected": -38.34101867675781,
"loss": 0.7576542496681213,
"memory(GiB)": 46.83,
"nll_loss": 0.4260023534297943,
"rewards/accuracies": 0.78125,
"rewards/chosen": 0.09650997817516327,
"rewards/margins": 2.168517589569092,
"rewards/rejected": -2.072007656097412,
"step": 270,
"train_speed(iter/s)": 0.005494
},
{
"epoch": 0.21865308489448074,
"grad_norm": 4.689668655395508,
"learning_rate": 0.0001848393666499315,
"logits/chosen": -0.7876875996589661,
"logits/rejected": -0.796357274055481,
"logps/chosen": -12.614479064941406,
"logps/rejected": -27.662067413330078,
"loss": 0.9168095588684082,
"memory(GiB)": 46.83,
"nll_loss": 0.52295982837677,
"rewards/accuracies": 0.84375,
"rewards/chosen": 0.0025606881827116013,
"rewards/margins": 1.4409575462341309,
"rewards/rejected": -1.43839693069458,
"step": 271,
"train_speed(iter/s)": 0.005494
},
{
"epoch": 0.21945992284612087,
"grad_norm": 5.61292028427124,
"learning_rate": 0.00018469776878284072,
"logits/chosen": -0.7697591781616211,
"logits/rejected": -0.775164008140564,
"logps/chosen": -5.527304649353027,
"logps/rejected": -25.911758422851562,
"loss": 0.7468432188034058,
"memory(GiB)": 46.83,
"nll_loss": 0.32815924286842346,
"rewards/accuracies": 0.75,
"rewards/chosen": 0.20197589695453644,
"rewards/margins": 1.5008738040924072,
"rewards/rejected": -1.2988977432250977,
"step": 272,
"train_speed(iter/s)": 0.005495
},
{
"epoch": 0.22026676079776103,
"grad_norm": 2.823660373687744,
"learning_rate": 0.00018455556749737403,
"logits/chosen": -0.8068636059761047,
"logits/rejected": -0.8074927926063538,
"logps/chosen": -9.97484016418457,
"logps/rejected": -21.8039608001709,
"loss": 0.8325120210647583,
"memory(GiB)": 46.83,
"nll_loss": 0.4089290499687195,
"rewards/accuracies": 0.84375,
"rewards/chosen": 0.19321191310882568,
"rewards/margins": 1.4057273864746094,
"rewards/rejected": -1.2125153541564941,
"step": 273,
"train_speed(iter/s)": 0.005495
},
{
"epoch": 0.22107359874940116,
"grad_norm": 2.5285258293151855,
"learning_rate": 0.00018441276380662625,
"logits/chosen": -0.7656555771827698,
"logits/rejected": -0.7663451433181763,
"logps/chosen": -10.646867752075195,
"logps/rejected": -22.98876953125,
"loss": 0.7855734825134277,
"memory(GiB)": 46.83,
"nll_loss": 0.382598340511322,
"rewards/accuracies": 0.8125,
"rewards/chosen": 0.23073698580265045,
"rewards/margins": 1.3868789672851562,
"rewards/rejected": -1.156141996383667,
"step": 274,
"train_speed(iter/s)": 0.005494
},
{
"epoch": 0.22188043670104132,
"grad_norm": 3.1718196868896484,
"learning_rate": 0.00018426935872798393,
"logits/chosen": -0.6983739137649536,
"logits/rejected": -0.7074112892150879,
"logps/chosen": -9.201760292053223,
"logps/rejected": -32.77637481689453,
"loss": 0.8582974672317505,
"memory(GiB)": 46.83,
"nll_loss": 0.4306548535823822,
"rewards/accuracies": 0.84375,
"rewards/chosen": 0.09240508079528809,
"rewards/margins": 1.7474827766418457,
"rewards/rejected": -1.6550780534744263,
"step": 275,
"train_speed(iter/s)": 0.005494
},
{
"epoch": 0.22268727465268148,
"grad_norm": 2.530366897583008,
"learning_rate": 0.00018412535328311814,
"logits/chosen": -0.7532445192337036,
"logits/rejected": -0.7571496963500977,
"logps/chosen": -11.776863098144531,
"logps/rejected": -21.776357650756836,
"loss": 0.7927124500274658,
"memory(GiB)": 46.83,
"nll_loss": 0.3979222774505615,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.3263438642024994,
"rewards/margins": 1.1879689693450928,
"rewards/rejected": -0.8616250157356262,
"step": 276,
"train_speed(iter/s)": 0.005494
},
{
"epoch": 0.22349411260432162,
"grad_norm": 2.8776495456695557,
"learning_rate": 0.00018398074849797715,
"logits/chosen": -0.7302210927009583,
"logits/rejected": -0.7333999276161194,
"logps/chosen": -8.04594612121582,
"logps/rejected": -25.69329833984375,
"loss": 0.8354058861732483,
"memory(GiB)": 46.83,
"nll_loss": 0.4014919400215149,
"rewards/accuracies": 0.75,
"rewards/chosen": 0.08311442285776138,
"rewards/margins": 1.4473011493682861,
"rewards/rejected": -1.3641867637634277,
"step": 277,
"train_speed(iter/s)": 0.005493
},
{
"epoch": 0.22430095055596178,
"grad_norm": 3.1463992595672607,
"learning_rate": 0.00018383554540277923,
"logits/chosen": -0.7314996719360352,
"logits/rejected": -0.7379679679870605,
"logps/chosen": -12.349081039428711,
"logps/rejected": -30.154521942138672,
"loss": 0.7297593355178833,
"memory(GiB)": 46.83,
"nll_loss": 0.4262910485267639,
"rewards/accuracies": 0.90625,
"rewards/chosen": 0.09422469139099121,
"rewards/margins": 1.8524787425994873,
"rewards/rejected": -1.758254051208496,
"step": 278,
"train_speed(iter/s)": 0.005494
},
{
"epoch": 0.22510778850760194,
"grad_norm": 3.694409132003784,
"learning_rate": 0.00018368974503200515,
"logits/chosen": -0.6736661195755005,
"logits/rejected": -0.6801973581314087,
"logps/chosen": -7.8128252029418945,
"logps/rejected": -34.619964599609375,
"loss": 0.5409353971481323,
"memory(GiB)": 46.83,
"nll_loss": 0.27240046858787537,
"rewards/accuracies": 0.90625,
"rewards/chosen": 0.14602825045585632,
"rewards/margins": 2.1955599784851074,
"rewards/rejected": -2.0495314598083496,
"step": 279,
"train_speed(iter/s)": 0.005494
},
{
"epoch": 0.22591462645924207,
"grad_norm": 3.1639299392700195,
"learning_rate": 0.00018354334842439097,
"logits/chosen": -0.6950223445892334,
"logits/rejected": -0.6963911056518555,
"logps/chosen": -11.003353118896484,
"logps/rejected": -29.378337860107422,
"loss": 0.6718952059745789,
"memory(GiB)": 46.83,
"nll_loss": 0.41621553897857666,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.2978552281856537,
"rewards/margins": 2.314960479736328,
"rewards/rejected": -2.0171055793762207,
"step": 280,
"train_speed(iter/s)": 0.005494
},
{
"epoch": 0.22672146441088223,
"grad_norm": 10.265737533569336,
"learning_rate": 0.00018339635662292043,
"logits/chosen": -0.6680774688720703,
"logits/rejected": -0.6708887219429016,
"logps/chosen": -9.037369728088379,
"logps/rejected": -28.595491409301758,
"loss": 0.7751729488372803,
"memory(GiB)": 46.83,
"nll_loss": 0.45015332102775574,
"rewards/accuracies": 0.90625,
"rewards/chosen": 0.26366156339645386,
"rewards/margins": 2.183614492416382,
"rewards/rejected": -1.9199527502059937,
"step": 281,
"train_speed(iter/s)": 0.005495
},
{
"epoch": 0.2275283023625224,
"grad_norm": 2.1682872772216797,
"learning_rate": 0.00018324877067481783,
"logits/chosen": -0.6989454627037048,
"logits/rejected": -0.7062041759490967,
"logps/chosen": -6.304581642150879,
"logps/rejected": -36.81526565551758,
"loss": 0.4870501458644867,
"memory(GiB)": 46.83,
"nll_loss": 0.27354732155799866,
"rewards/accuracies": 0.90625,
"rewards/chosen": 0.25899404287338257,
"rewards/margins": 2.644915819168091,
"rewards/rejected": -2.3859219551086426,
"step": 282,
"train_speed(iter/s)": 0.005495
},
{
"epoch": 0.22833514031416252,
"grad_norm": 5.862631797790527,
"learning_rate": 0.00018310059163154026,
"logits/chosen": -0.6766980886459351,
"logits/rejected": -0.6787369847297668,
"logps/chosen": -5.963343620300293,
"logps/rejected": -32.693424224853516,
"loss": 0.6418428421020508,
"memory(GiB)": 46.83,
"nll_loss": 0.36004289984703064,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.10292582958936691,
"rewards/margins": 2.3059544563293457,
"rewards/rejected": -2.203028917312622,
"step": 283,
"train_speed(iter/s)": 0.005495
},
{
"epoch": 0.22914197826580268,
"grad_norm": 12.034624099731445,
"learning_rate": 0.00018295182054877028,
"logits/chosen": -0.6584015488624573,
"logits/rejected": -0.6568421125411987,
"logps/chosen": -9.409889221191406,
"logps/rejected": -29.433473587036133,
"loss": 0.779122531414032,
"memory(GiB)": 46.83,
"nll_loss": 0.4608069658279419,
"rewards/accuracies": 0.8125,
"rewards/chosen": 0.09724374115467072,
"rewards/margins": 2.0178637504577637,
"rewards/rejected": -1.920620083808899,
"step": 284,
"train_speed(iter/s)": 0.005495
},
{
"epoch": 0.22994881621744284,
"grad_norm": 2.7027676105499268,
"learning_rate": 0.00018280245848640837,
"logits/chosen": -0.6325287222862244,
"logits/rejected": -0.638849675655365,
"logps/chosen": -11.803849220275879,
"logps/rejected": -34.92605209350586,
"loss": 0.6200695633888245,
"memory(GiB)": 46.83,
"nll_loss": 0.3835636377334595,
"rewards/accuracies": 0.96875,
"rewards/chosen": 0.3289586305618286,
"rewards/margins": 2.4051361083984375,
"rewards/rejected": -2.0761775970458984,
"step": 285,
"train_speed(iter/s)": 0.005495
},
{
"epoch": 0.23075565416908297,
"grad_norm": 12.6409330368042,
"learning_rate": 0.0001826525065085654,
"logits/chosen": -0.6875444054603577,
"logits/rejected": -0.6914835572242737,
"logps/chosen": -6.616847038269043,
"logps/rejected": -32.69636917114258,
"loss": 0.7483028173446655,
"memory(GiB)": 46.83,
"nll_loss": 0.41258829832077026,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.1584882140159607,
"rewards/margins": 2.2999954223632812,
"rewards/rejected": -2.141507387161255,
"step": 286,
"train_speed(iter/s)": 0.005495
},
{
"epoch": 0.23156249212072313,
"grad_norm": 11.6520357131958,
"learning_rate": 0.00018250196568355488,
"logits/chosen": -0.6649547219276428,
"logits/rejected": -0.6693803071975708,
"logps/chosen": -7.23736572265625,
"logps/rejected": -35.56175994873047,
"loss": 0.8851901888847351,
"memory(GiB)": 46.83,
"nll_loss": 0.555623471736908,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.04522712156176567,
"rewards/margins": 2.2976298332214355,
"rewards/rejected": -2.2524030208587646,
"step": 287,
"train_speed(iter/s)": 0.005496
},
{
"epoch": 0.23236933007236327,
"grad_norm": 4.304396152496338,
"learning_rate": 0.0001823508370838857,
"logits/chosen": -0.6312321424484253,
"logits/rejected": -0.6436812281608582,
"logps/chosen": -5.798044204711914,
"logps/rejected": -41.38832092285156,
"loss": 0.4446811079978943,
"memory(GiB)": 46.83,
"nll_loss": 0.2366604506969452,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.19939535856246948,
"rewards/margins": 2.506988525390625,
"rewards/rejected": -2.3075931072235107,
"step": 288,
"train_speed(iter/s)": 0.005497
},
{
"epoch": 0.23317616802400343,
"grad_norm": 3.2178378105163574,
"learning_rate": 0.00018219912178625406,
"logits/chosen": -0.667951762676239,
"logits/rejected": -0.6722462773323059,
"logps/chosen": -8.273347854614258,
"logps/rejected": -38.93374252319336,
"loss": 0.5589238405227661,
"memory(GiB)": 46.83,
"nll_loss": 0.33250439167022705,
"rewards/accuracies": 0.90625,
"rewards/chosen": 0.24894192814826965,
"rewards/margins": 2.7763476371765137,
"rewards/rejected": -2.5274055004119873,
"step": 289,
"train_speed(iter/s)": 0.005496
},
{
"epoch": 0.2339830059756436,
"grad_norm": 19.13467025756836,
"learning_rate": 0.0001820468208715362,
"logits/chosen": -0.658998429775238,
"logits/rejected": -0.6624220609664917,
"logps/chosen": -10.623708724975586,
"logps/rejected": -35.898441314697266,
"loss": 0.8776594400405884,
"memory(GiB)": 46.83,
"nll_loss": 0.504928469657898,
"rewards/accuracies": 0.75,
"rewards/chosen": 0.03749624639749527,
"rewards/margins": 2.421245813369751,
"rewards/rejected": -2.3837497234344482,
"step": 290,
"train_speed(iter/s)": 0.005496
},
{
"epoch": 0.23478984392728372,
"grad_norm": 14.0836181640625,
"learning_rate": 0.00018189393542478036,
"logits/chosen": -0.6700485348701477,
"logits/rejected": -0.6811757683753967,
"logps/chosen": -13.918525695800781,
"logps/rejected": -31.985313415527344,
"loss": 0.8883711695671082,
"memory(GiB)": 46.83,
"nll_loss": 0.494065523147583,
"rewards/accuracies": 0.78125,
"rewards/chosen": 0.11007653176784515,
"rewards/margins": 1.8538110256195068,
"rewards/rejected": -1.7437344789505005,
"step": 291,
"train_speed(iter/s)": 0.005496
},
{
"epoch": 0.23559668187892388,
"grad_norm": 1.916353464126587,
"learning_rate": 0.00018174046653519929,
"logits/chosen": -0.6249253749847412,
"logits/rejected": -0.6350105404853821,
"logps/chosen": -6.613706588745117,
"logps/rejected": -31.679109573364258,
"loss": 0.5259463787078857,
"memory(GiB)": 46.83,
"nll_loss": 0.28351810574531555,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.37387514114379883,
"rewards/margins": 2.260230302810669,
"rewards/rejected": -1.8863551616668701,
"step": 292,
"train_speed(iter/s)": 0.005497
},
{
"epoch": 0.23640351983056404,
"grad_norm": 3.460676431655884,
"learning_rate": 0.0001815864152961624,
"logits/chosen": -0.7058864831924438,
"logits/rejected": -0.7104409337043762,
"logps/chosen": -9.832937240600586,
"logps/rejected": -33.203758239746094,
"loss": 0.7486201524734497,
"memory(GiB)": 46.83,
"nll_loss": 0.4414381682872772,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.05328599363565445,
"rewards/margins": 1.9007527828216553,
"rewards/rejected": -1.8474667072296143,
"step": 293,
"train_speed(iter/s)": 0.005497
},
{
"epoch": 0.23721035778220417,
"grad_norm": 4.965317249298096,
"learning_rate": 0.00018143178280518793,
"logits/chosen": -0.6664391756057739,
"logits/rejected": -0.672810971736908,
"logps/chosen": -9.997623443603516,
"logps/rejected": -40.18428039550781,
"loss": 0.6516451239585876,
"memory(GiB)": 46.83,
"nll_loss": 0.40531888604164124,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.053340502083301544,
"rewards/margins": 3.017876625061035,
"rewards/rejected": -2.964535713195801,
"step": 294,
"train_speed(iter/s)": 0.005497
},
{
"epoch": 0.23801719573384433,
"grad_norm": 11.654240608215332,
"learning_rate": 0.00018127657016393523,
"logits/chosen": -0.6823023557662964,
"logits/rejected": -0.6858367919921875,
"logps/chosen": -13.494540214538574,
"logps/rejected": -26.149335861206055,
"loss": 1.2284287214279175,
"memory(GiB)": 46.83,
"nll_loss": 0.7871044874191284,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.1301741600036621,
"rewards/margins": 1.65839684009552,
"rewards/rejected": -1.528222680091858,
"step": 295,
"train_speed(iter/s)": 0.005497
},
{
"epoch": 0.2388240336854845,
"grad_norm": 6.048635005950928,
"learning_rate": 0.00018112077847819678,
"logits/chosen": -0.6762900352478027,
"logits/rejected": -0.6797853708267212,
"logps/chosen": -9.212943077087402,
"logps/rejected": -35.503047943115234,
"loss": 0.6458551287651062,
"memory(GiB)": 46.83,
"nll_loss": 0.4156365990638733,
"rewards/accuracies": 0.90625,
"rewards/chosen": 0.07666485011577606,
"rewards/margins": 2.67659592628479,
"rewards/rejected": -2.599931240081787,
"step": 296,
"train_speed(iter/s)": 0.005497
},
{
"epoch": 0.23963087163712463,
"grad_norm": 17.950830459594727,
"learning_rate": 0.00018096440885789053,
"logits/chosen": -0.7045325040817261,
"logits/rejected": -0.7085095643997192,
"logps/chosen": -5.067245960235596,
"logps/rejected": -32.400596618652344,
"loss": 0.6414408087730408,
"memory(GiB)": 46.83,
"nll_loss": 0.35441699624061584,
"rewards/accuracies": 0.84375,
"rewards/chosen": 0.19392728805541992,
"rewards/margins": 2.3720614910125732,
"rewards/rejected": -2.1781344413757324,
"step": 297,
"train_speed(iter/s)": 0.005497
},
{
"epoch": 0.2404377095887648,
"grad_norm": 2.869894504547119,
"learning_rate": 0.00018080746241705168,
"logits/chosen": -0.679808497428894,
"logits/rejected": -0.681736409664154,
"logps/chosen": -10.83769416809082,
"logps/rejected": -28.55279541015625,
"loss": 0.7392024397850037,
"memory(GiB)": 46.83,
"nll_loss": 0.42105916142463684,
"rewards/accuracies": 0.8125,
"rewards/chosen": 0.23800711333751678,
"rewards/margins": 1.8557734489440918,
"rewards/rejected": -1.617766261100769,
"step": 298,
"train_speed(iter/s)": 0.005497
},
{
"epoch": 0.24124454754040492,
"grad_norm": 3.0865039825439453,
"learning_rate": 0.000180649940273825,
"logits/chosen": -0.7064599990844727,
"logits/rejected": -0.7154704928398132,
"logps/chosen": -6.157724380493164,
"logps/rejected": -37.746639251708984,
"loss": 0.5655427575111389,
"memory(GiB)": 46.83,
"nll_loss": 0.30769801139831543,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.08631336688995361,
"rewards/margins": 2.3150007724761963,
"rewards/rejected": -2.228687286376953,
"step": 299,
"train_speed(iter/s)": 0.005497
},
{
"epoch": 0.24205138549204508,
"grad_norm": 2.7285871505737305,
"learning_rate": 0.00018049184355045677,
"logits/chosen": -0.7136423587799072,
"logits/rejected": -0.7151377201080322,
"logps/chosen": -7.438178062438965,
"logps/rejected": -25.823518753051758,
"loss": 0.6484540104866028,
"memory(GiB)": 46.83,
"nll_loss": 0.3245176076889038,
"rewards/accuracies": 0.8125,
"rewards/chosen": 0.27408692240715027,
"rewards/margins": 1.6197888851165771,
"rewards/rejected": -1.345702052116394,
"step": 300,
"train_speed(iter/s)": 0.005497
},
{
"epoch": 0.24205138549204508,
"eval_logits/chosen": -0.7073344588279724,
"eval_logits/rejected": -0.7110338807106018,
"eval_logps/chosen": -9.127958297729492,
"eval_logps/rejected": -32.3641242980957,
"eval_loss": 0.7329411506652832,
"eval_nll_loss": 0.40398380160331726,
"eval_rewards/accuracies": 0.8450000286102295,
"eval_rewards/chosen": 0.10664533823728561,
"eval_rewards/margins": 2.0523765087127686,
"eval_rewards/rejected": -1.9457309246063232,
"eval_runtime": 935.6049,
"eval_samples_per_second": 0.428,
"eval_steps_per_second": 0.428,
"step": 300
},
{
"epoch": 0.24285822344368524,
"grad_norm": 6.436818599700928,
"learning_rate": 0.0001803331733732868,
"logits/chosen": -0.6776125431060791,
"logits/rejected": -0.6814741492271423,
"logps/chosen": -10.345755577087402,
"logps/rejected": -31.87610626220703,
"loss": 1.0051960945129395,
"memory(GiB)": 46.83,
"nll_loss": 0.5581401586532593,
"rewards/accuracies": 0.84375,
"rewards/chosen": -0.17682184278964996,
"rewards/margins": 1.9412140846252441,
"rewards/rejected": -2.1180360317230225,
"step": 301,
"train_speed(iter/s)": 0.005403
},
{
"epoch": 0.24366506139532537,
"grad_norm": 6.0017781257629395,
"learning_rate": 0.0001801739308727404,
"logits/chosen": -0.7074002027511597,
"logits/rejected": -0.713377058506012,
"logps/chosen": -12.075335502624512,
"logps/rejected": -23.198413848876953,
"loss": 0.854468822479248,
"memory(GiB)": 46.83,
"nll_loss": 0.5477906465530396,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.22885334491729736,
"rewards/margins": 1.5375834703445435,
"rewards/rejected": -1.308730125427246,
"step": 302,
"train_speed(iter/s)": 0.005403
},
{
"epoch": 0.24447189934696553,
"grad_norm": 4.944755554199219,
"learning_rate": 0.0001800141171833203,
"logits/chosen": -0.6664037108421326,
"logits/rejected": -0.6715153455734253,
"logps/chosen": -10.99780559539795,
"logps/rejected": -40.38133239746094,
"loss": 1.0467002391815186,
"memory(GiB)": 46.83,
"nll_loss": 0.7734127640724182,
"rewards/accuracies": 0.90625,
"rewards/chosen": 0.23875761032104492,
"rewards/margins": 2.768630027770996,
"rewards/rejected": -2.529872417449951,
"step": 303,
"train_speed(iter/s)": 0.005404
},
{
"epoch": 0.2452787372986057,
"grad_norm": 13.264330863952637,
"learning_rate": 0.0001798537334435986,
"logits/chosen": -0.6581575870513916,
"logits/rejected": -0.6663908362388611,
"logps/chosen": -9.642528533935547,
"logps/rejected": -34.64740753173828,
"loss": 1.2485740184783936,
"memory(GiB)": 46.83,
"nll_loss": 0.8329651355743408,
"rewards/accuracies": 0.84375,
"rewards/chosen": -0.05902397632598877,
"rewards/margins": 2.0006673336029053,
"rewards/rejected": -2.0596914291381836,
"step": 304,
"train_speed(iter/s)": 0.005404
},
{
"epoch": 0.24608557525024582,
"grad_norm": 2.709535598754883,
"learning_rate": 0.00017969278079620868,
"logits/chosen": -0.6512877941131592,
"logits/rejected": -0.6544854640960693,
"logps/chosen": -6.917822360992432,
"logps/rejected": -36.45574951171875,
"loss": 0.436959445476532,
"memory(GiB)": 46.83,
"nll_loss": 0.23888030648231506,
"rewards/accuracies": 0.96875,
"rewards/chosen": 0.07531990855932236,
"rewards/margins": 2.534837007522583,
"rewards/rejected": -2.459517240524292,
"step": 305,
"train_speed(iter/s)": 0.005404
},
{
"epoch": 0.24689241320188599,
"grad_norm": 4.297156810760498,
"learning_rate": 0.000179531260387837,
"logits/chosen": -0.6876344084739685,
"logits/rejected": -0.6926863789558411,
"logps/chosen": -10.314577102661133,
"logps/rejected": -42.0067138671875,
"loss": 0.6266589164733887,
"memory(GiB)": 46.83,
"nll_loss": 0.405265212059021,
"rewards/accuracies": 0.96875,
"rewards/chosen": 0.048373833298683167,
"rewards/margins": 2.6945550441741943,
"rewards/rejected": -2.646181344985962,
"step": 306,
"train_speed(iter/s)": 0.005405
},
{
"epoch": 0.24769925115352615,
"grad_norm": 2.3430275917053223,
"learning_rate": 0.00017936917336921492,
"logits/chosen": -0.660620927810669,
"logits/rejected": -0.6698962450027466,
"logps/chosen": -10.098029136657715,
"logps/rejected": -38.27429962158203,
"loss": 0.6127811670303345,
"memory(GiB)": 46.83,
"nll_loss": 0.42024731636047363,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.12339803576469421,
"rewards/margins": 2.775909423828125,
"rewards/rejected": -2.6525111198425293,
"step": 307,
"train_speed(iter/s)": 0.005405
},
{
"epoch": 0.24850608910516628,
"grad_norm": 7.701032638549805,
"learning_rate": 0.00017920652089511066,
"logits/chosen": -0.6981559991836548,
"logits/rejected": -0.7051110863685608,
"logps/chosen": -12.91336441040039,
"logps/rejected": -39.74778747558594,
"loss": 0.7809062600135803,
"memory(GiB)": 46.83,
"nll_loss": 0.43491145968437195,
"rewards/accuracies": 0.84375,
"rewards/chosen": -0.01711910218000412,
"rewards/margins": 2.6014857292175293,
"rewards/rejected": -2.618604898452759,
"step": 308,
"train_speed(iter/s)": 0.005406
},
{
"epoch": 0.24931292705680644,
"grad_norm": 8.226758003234863,
"learning_rate": 0.00017904330412432082,
"logits/chosen": -0.6544554829597473,
"logits/rejected": -0.6588922739028931,
"logps/chosen": -7.886651039123535,
"logps/rejected": -37.24707794189453,
"loss": 0.6507235169410706,
"memory(GiB)": 46.83,
"nll_loss": 0.36367952823638916,
"rewards/accuracies": 0.90625,
"rewards/chosen": 0.008459217846393585,
"rewards/margins": 2.5813100337982178,
"rewards/rejected": -2.5728507041931152,
"step": 309,
"train_speed(iter/s)": 0.005406
},
{
"epoch": 0.25011976500844657,
"grad_norm": 2.985854387283325,
"learning_rate": 0.00017887952421966231,
"logits/chosen": -0.6596094369888306,
"logits/rejected": -0.6650587916374207,
"logps/chosen": -9.925427436828613,
"logps/rejected": -37.92117691040039,
"loss": 0.589540958404541,
"memory(GiB)": 46.83,
"nll_loss": 0.3470298945903778,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.2002800703048706,
"rewards/margins": 2.7566845417022705,
"rewards/rejected": -2.5564048290252686,
"step": 310,
"train_speed(iter/s)": 0.005406
},
{
"epoch": 0.25092660296008673,
"grad_norm": 8.586225509643555,
"learning_rate": 0.00017871518234796412,
"logits/chosen": -0.7069643139839172,
"logits/rejected": -0.7040101885795593,
"logps/chosen": -10.918496131896973,
"logps/rejected": -22.552764892578125,
"loss": 0.869647204875946,
"memory(GiB)": 46.83,
"nll_loss": 0.39224955439567566,
"rewards/accuracies": 0.78125,
"rewards/chosen": 0.07749204337596893,
"rewards/margins": 1.6755130290985107,
"rewards/rejected": -1.598021149635315,
"step": 311,
"train_speed(iter/s)": 0.005407
},
{
"epoch": 0.2517334409117269,
"grad_norm": 3.319561243057251,
"learning_rate": 0.00017855027968005874,
"logits/chosen": -0.643227756023407,
"logits/rejected": -0.6550837755203247,
"logps/chosen": -6.8077073097229,
"logps/rejected": -39.095035552978516,
"loss": 0.6082978844642639,
"memory(GiB)": 46.83,
"nll_loss": 0.3355411887168884,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.21203100681304932,
"rewards/margins": 2.4175777435302734,
"rewards/rejected": -2.2055468559265137,
"step": 312,
"train_speed(iter/s)": 0.005407
},
{
"epoch": 0.25254027886336705,
"grad_norm": 3.8709287643432617,
"learning_rate": 0.00017838481739077404,
"logits/chosen": -0.6760554313659668,
"logits/rejected": -0.682180643081665,
"logps/chosen": -7.9441633224487305,
"logps/rejected": -27.414325714111328,
"loss": 0.7799100279808044,
"memory(GiB)": 46.83,
"nll_loss": 0.4338618814945221,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.2233610451221466,
"rewards/margins": 1.7509660720825195,
"rewards/rejected": -1.5276049375534058,
"step": 313,
"train_speed(iter/s)": 0.005407
},
{
"epoch": 0.2533471168150072,
"grad_norm": 5.0154218673706055,
"learning_rate": 0.00017821879665892487,
"logits/chosen": -0.6456589698791504,
"logits/rejected": -0.649111270904541,
"logps/chosen": -9.17154312133789,
"logps/rejected": -32.664093017578125,
"loss": 0.6070997714996338,
"memory(GiB)": 46.83,
"nll_loss": 0.31872257590293884,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.005728209391236305,
"rewards/margins": 1.877259612083435,
"rewards/rejected": -1.8715312480926514,
"step": 314,
"train_speed(iter/s)": 0.005407
},
{
"epoch": 0.2541539547666473,
"grad_norm": 2.769273042678833,
"learning_rate": 0.00017805221866730458,
"logits/chosen": -0.6285029649734497,
"logits/rejected": -0.6361050605773926,
"logps/chosen": -10.298542976379395,
"logps/rejected": -27.911968231201172,
"loss": 0.6473672986030579,
"memory(GiB)": 46.83,
"nll_loss": 0.37400925159454346,
"rewards/accuracies": 0.90625,
"rewards/chosen": 0.33300700783729553,
"rewards/margins": 1.5457414388656616,
"rewards/rejected": -1.2127344608306885,
"step": 315,
"train_speed(iter/s)": 0.005407
},
{
"epoch": 0.2549607927182875,
"grad_norm": 2.675525426864624,
"learning_rate": 0.00017788508460267677,
"logits/chosen": -0.633998692035675,
"logits/rejected": -0.6368559002876282,
"logps/chosen": -8.035248756408691,
"logps/rejected": -33.8181266784668,
"loss": 0.5450462698936462,
"memory(GiB)": 46.83,
"nll_loss": 0.2956991195678711,
"rewards/accuracies": 0.84375,
"rewards/chosen": 0.12976329028606415,
"rewards/margins": 2.3313686847686768,
"rewards/rejected": -2.2016055583953857,
"step": 316,
"train_speed(iter/s)": 0.005407
},
{
"epoch": 0.25576763066992764,
"grad_norm": 2.2619502544403076,
"learning_rate": 0.0001777173956557665,
"logits/chosen": -0.6891807317733765,
"logits/rejected": -0.6903274059295654,
"logps/chosen": -10.693523406982422,
"logps/rejected": -31.01398468017578,
"loss": 0.6650394797325134,
"memory(GiB)": 46.83,
"nll_loss": 0.38576623797416687,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.2987612187862396,
"rewards/margins": 1.9871487617492676,
"rewards/rejected": -1.6883876323699951,
"step": 317,
"train_speed(iter/s)": 0.005407
},
{
"epoch": 0.2565744686215678,
"grad_norm": 7.991454124450684,
"learning_rate": 0.0001775491530212522,
"logits/chosen": -0.6753562688827515,
"logits/rejected": -0.6762648820877075,
"logps/chosen": -11.517782211303711,
"logps/rejected": -26.93805503845215,
"loss": 1.165069580078125,
"memory(GiB)": 46.83,
"nll_loss": 0.6551721096038818,
"rewards/accuracies": 0.78125,
"rewards/chosen": 0.02389012649655342,
"rewards/margins": 1.3221609592437744,
"rewards/rejected": -1.2982707023620605,
"step": 318,
"train_speed(iter/s)": 0.005408
},
{
"epoch": 0.25738130657320796,
"grad_norm": 9.860249519348145,
"learning_rate": 0.00017738035789775696,
"logits/chosen": -0.7479084730148315,
"logits/rejected": -0.7518092393875122,
"logps/chosen": -5.844160079956055,
"logps/rejected": -35.683162689208984,
"loss": 0.5556322932243347,
"memory(GiB)": 46.83,
"nll_loss": 0.3325543999671936,
"rewards/accuracies": 0.90625,
"rewards/chosen": 0.10462158918380737,
"rewards/margins": 2.546602487564087,
"rewards/rejected": -2.4419808387756348,
"step": 319,
"train_speed(iter/s)": 0.005409
},
{
"epoch": 0.25818814452484806,
"grad_norm": 3.9844655990600586,
"learning_rate": 0.00017721101148783985,
"logits/chosen": -0.7617798447608948,
"logits/rejected": -0.7641586661338806,
"logps/chosen": -8.093914031982422,
"logps/rejected": -35.221988677978516,
"loss": 0.6888319849967957,
"memory(GiB)": 46.83,
"nll_loss": 0.4659794867038727,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.08299870789051056,
"rewards/margins": 2.34136700630188,
"rewards/rejected": -2.258368492126465,
"step": 320,
"train_speed(iter/s)": 0.005409
},
{
"epoch": 0.2589949824764882,
"grad_norm": 7.946180820465088,
"learning_rate": 0.00017704111499798768,
"logits/chosen": -0.7791930437088013,
"logits/rejected": -0.7833006381988525,
"logps/chosen": -6.748149871826172,
"logps/rejected": -36.56504440307617,
"loss": 0.8274538516998291,
"memory(GiB)": 46.83,
"nll_loss": 0.5019730925559998,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.09792216122150421,
"rewards/margins": 2.4872283935546875,
"rewards/rejected": -2.3893063068389893,
"step": 321,
"train_speed(iter/s)": 0.005409
},
{
"epoch": 0.2598018204281284,
"grad_norm": 7.7827467918396,
"learning_rate": 0.00017687066963860615,
"logits/chosen": -0.7987972497940063,
"logits/rejected": -0.8094179034233093,
"logps/chosen": -3.5310564041137695,
"logps/rejected": -32.73319625854492,
"loss": 0.4403470754623413,
"memory(GiB)": 46.83,
"nll_loss": 0.1688545197248459,
"rewards/accuracies": 0.84375,
"rewards/chosen": 0.2623920440673828,
"rewards/margins": 2.187939405441284,
"rewards/rejected": -1.925547480583191,
"step": 322,
"train_speed(iter/s)": 0.00541
},
{
"epoch": 0.26060865837976854,
"grad_norm": 3.664057493209839,
"learning_rate": 0.0001766996766240114,
"logits/chosen": -0.8535178899765015,
"logits/rejected": -0.8564468622207642,
"logps/chosen": -12.827454566955566,
"logps/rejected": -35.108741760253906,
"loss": 0.7213603258132935,
"memory(GiB)": 46.83,
"nll_loss": 0.47191280126571655,
"rewards/accuracies": 0.90625,
"rewards/chosen": 0.34138235449790955,
"rewards/margins": 2.7680537700653076,
"rewards/rejected": -2.426671266555786,
"step": 323,
"train_speed(iter/s)": 0.00541
},
{
"epoch": 0.2614154963314087,
"grad_norm": 3.6671972274780273,
"learning_rate": 0.0001765281371724211,
"logits/chosen": -0.8640937209129333,
"logits/rejected": -0.8603441119194031,
"logps/chosen": -9.051156997680664,
"logps/rejected": -32.042171478271484,
"loss": 0.5764932036399841,
"memory(GiB)": 46.83,
"nll_loss": 0.3475058972835541,
"rewards/accuracies": 0.90625,
"rewards/chosen": 0.24964334070682526,
"rewards/margins": 2.6217854022979736,
"rewards/rejected": -2.3721418380737305,
"step": 324,
"train_speed(iter/s)": 0.00541
},
{
"epoch": 0.26222233428304886,
"grad_norm": 4.343052864074707,
"learning_rate": 0.00017635605250594606,
"logits/chosen": -0.9237393140792847,
"logits/rejected": -0.9191243648529053,
"logps/chosen": -9.570093154907227,
"logps/rejected": -26.344640731811523,
"loss": 0.6133550405502319,
"memory(GiB)": 46.83,
"nll_loss": 0.3041512668132782,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.2187902331352234,
"rewards/margins": 1.9347566366195679,
"rewards/rejected": -1.7159663438796997,
"step": 325,
"train_speed(iter/s)": 0.00541
},
{
"epoch": 0.26302917223468897,
"grad_norm": 13.972990989685059,
"learning_rate": 0.00017618342385058145,
"logits/chosen": -0.9064996242523193,
"logits/rejected": -0.9114649295806885,
"logps/chosen": -10.548544883728027,
"logps/rejected": -39.158992767333984,
"loss": 0.9647412300109863,
"memory(GiB)": 46.83,
"nll_loss": 0.6664921045303345,
"rewards/accuracies": 0.84375,
"rewards/chosen": 0.14826549589633942,
"rewards/margins": 2.8863561153411865,
"rewards/rejected": -2.738090753555298,
"step": 326,
"train_speed(iter/s)": 0.00541
},
{
"epoch": 0.26383601018632913,
"grad_norm": 4.962406635284424,
"learning_rate": 0.0001760102524361979,
"logits/chosen": -0.9307440519332886,
"logits/rejected": -0.9374938607215881,
"logps/chosen": -11.971577644348145,
"logps/rejected": -43.166099548339844,
"loss": 0.7845494747161865,
"memory(GiB)": 46.83,
"nll_loss": 0.4260358214378357,
"rewards/accuracies": 0.84375,
"rewards/chosen": -0.014196585863828659,
"rewards/margins": 2.70448637008667,
"rewards/rejected": -2.7186827659606934,
"step": 327,
"train_speed(iter/s)": 0.00541
},
{
"epoch": 0.2646428481379693,
"grad_norm": 6.3026509284973145,
"learning_rate": 0.00017583653949653297,
"logits/chosen": -0.9104486703872681,
"logits/rejected": -0.9133187532424927,
"logps/chosen": -7.545221328735352,
"logps/rejected": -42.58152770996094,
"loss": 0.6194388270378113,
"memory(GiB)": 46.83,
"nll_loss": 0.38448214530944824,
"rewards/accuracies": 0.84375,
"rewards/chosen": 0.12115807086229324,
"rewards/margins": 3.0233232975006104,
"rewards/rejected": -2.902165412902832,
"step": 328,
"train_speed(iter/s)": 0.005411
},
{
"epoch": 0.26544968608960945,
"grad_norm": 4.22109317779541,
"learning_rate": 0.00017566228626918212,
"logits/chosen": -0.8536132574081421,
"logits/rejected": -0.863903284072876,
"logps/chosen": -9.604391098022461,
"logps/rejected": -38.25326919555664,
"loss": 0.7549124956130981,
"memory(GiB)": 46.83,
"nll_loss": 0.43309736251831055,
"rewards/accuracies": 0.78125,
"rewards/chosen": 0.11497168242931366,
"rewards/margins": 2.4954819679260254,
"rewards/rejected": -2.380510091781616,
"step": 329,
"train_speed(iter/s)": 0.005411
},
{
"epoch": 0.2662565240412496,
"grad_norm": 3.372162103652954,
"learning_rate": 0.0001754874939955901,
"logits/chosen": -0.8504335880279541,
"logits/rejected": -0.8582204580307007,
"logps/chosen": -13.342264175415039,
"logps/rejected": -36.4522590637207,
"loss": 0.9137426614761353,
"memory(GiB)": 46.83,
"nll_loss": 0.6495134830474854,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.36808696389198303,
"rewards/margins": 2.6845757961273193,
"rewards/rejected": -2.316488742828369,
"step": 330,
"train_speed(iter/s)": 0.005412
},
{
"epoch": 0.2670633619928897,
"grad_norm": 2.032322883605957,
"learning_rate": 0.00017531216392104203,
"logits/chosen": -0.8323754072189331,
"logits/rejected": -0.8362606763839722,
"logps/chosen": -9.349749565124512,
"logps/rejected": -38.68825149536133,
"loss": 0.6108371019363403,
"memory(GiB)": 46.83,
"nll_loss": 0.4490174949169159,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.4555152654647827,
"rewards/margins": 3.0110297203063965,
"rewards/rejected": -2.555514335632324,
"step": 331,
"train_speed(iter/s)": 0.005413
},
{
"epoch": 0.2678701999445299,
"grad_norm": 2.1273860931396484,
"learning_rate": 0.00017513629729465455,
"logits/chosen": -0.8378605842590332,
"logits/rejected": -0.8425085544586182,
"logps/chosen": -7.634585380554199,
"logps/rejected": -34.26400375366211,
"loss": 0.5199471712112427,
"memory(GiB)": 46.83,
"nll_loss": 0.3184734284877777,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.24010597169399261,
"rewards/margins": 2.4833943843841553,
"rewards/rejected": -2.243288516998291,
"step": 332,
"train_speed(iter/s)": 0.005414
},
{
"epoch": 0.26867703789617003,
"grad_norm": 13.832210540771484,
"learning_rate": 0.0001749598953693668,
"logits/chosen": -0.8178601264953613,
"logits/rejected": -0.8171352744102478,
"logps/chosen": -7.816558361053467,
"logps/rejected": -27.310321807861328,
"loss": 0.8487988710403442,
"memory(GiB)": 46.83,
"nll_loss": 0.5664465427398682,
"rewards/accuracies": 0.90625,
"rewards/chosen": 0.13675397634506226,
"rewards/margins": 2.1682660579681396,
"rewards/rejected": -2.0315120220184326,
"step": 333,
"train_speed(iter/s)": 0.005414
},
{
"epoch": 0.2694838758478102,
"grad_norm": 4.107896327972412,
"learning_rate": 0.00017478295940193163,
"logits/chosen": -0.8216401934623718,
"logits/rejected": -0.8330098986625671,
"logps/chosen": -8.207337379455566,
"logps/rejected": -38.14511489868164,
"loss": 0.8124181032180786,
"memory(GiB)": 46.83,
"nll_loss": 0.4575313925743103,
"rewards/accuracies": 0.84375,
"rewards/chosen": 0.033875416964292526,
"rewards/margins": 2.214970350265503,
"rewards/rejected": -2.1810948848724365,
"step": 334,
"train_speed(iter/s)": 0.005415
},
{
"epoch": 0.27029071379945036,
"grad_norm": 2.043121814727783,
"learning_rate": 0.00017460549065290666,
"logits/chosen": -0.7847851514816284,
"logits/rejected": -0.7903647422790527,
"logps/chosen": -11.188026428222656,
"logps/rejected": -31.82864761352539,
"loss": 0.5849981904029846,
"memory(GiB)": 46.83,
"nll_loss": 0.3552479147911072,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.3021475374698639,
"rewards/margins": 2.2114672660827637,
"rewards/rejected": -1.909319519996643,
"step": 335,
"train_speed(iter/s)": 0.005415
},
{
"epoch": 0.2710975517510905,
"grad_norm": 2.116966962814331,
"learning_rate": 0.0001744274903866452,
"logits/chosen": -0.770881712436676,
"logits/rejected": -0.7834229469299316,
"logps/chosen": -3.7972168922424316,
"logps/rejected": -37.75122833251953,
"loss": 0.3996497392654419,
"memory(GiB)": 46.83,
"nll_loss": 0.2140352874994278,
"rewards/accuracies": 0.96875,
"rewards/chosen": 0.27353012561798096,
"rewards/margins": 2.583765983581543,
"rewards/rejected": -2.3102359771728516,
"step": 336,
"train_speed(iter/s)": 0.005415
},
{
"epoch": 0.2719043897027306,
"grad_norm": 4.1290411949157715,
"learning_rate": 0.00017424895987128722,
"logits/chosen": -0.786916971206665,
"logits/rejected": -0.7911162376403809,
"logps/chosen": -9.502747535705566,
"logps/rejected": -32.8641357421875,
"loss": 0.7896320819854736,
"memory(GiB)": 46.83,
"nll_loss": 0.4624251425266266,
"rewards/accuracies": 0.8125,
"rewards/chosen": 0.12185362726449966,
"rewards/margins": 2.144758701324463,
"rewards/rejected": -2.022905111312866,
"step": 337,
"train_speed(iter/s)": 0.005415
},
{
"epoch": 0.2727112276543708,
"grad_norm": 1.9379422664642334,
"learning_rate": 0.0001740699003787505,
"logits/chosen": -0.8224512338638306,
"logits/rejected": -0.8290694355964661,
"logps/chosen": -5.654224872589111,
"logps/rejected": -40.40040588378906,
"loss": 0.32085683941841125,
"memory(GiB)": 46.83,
"nll_loss": 0.17423731088638306,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.2838688790798187,
"rewards/margins": 2.9954781532287598,
"rewards/rejected": -2.711609363555908,
"step": 338,
"train_speed(iter/s)": 0.005415
},
{
"epoch": 0.27351806560601094,
"grad_norm": 2.5411887168884277,
"learning_rate": 0.00017389031318472143,
"logits/chosen": -0.8840833306312561,
"logits/rejected": -0.8846546411514282,
"logps/chosen": -14.506649017333984,
"logps/rejected": -35.60776901245117,
"loss": 0.6948885917663574,
"memory(GiB)": 46.83,
"nll_loss": 0.4158177375793457,
"rewards/accuracies": 0.84375,
"rewards/chosen": 0.05735927075147629,
"rewards/margins": 2.4177799224853516,
"rewards/rejected": -2.3604207038879395,
"step": 339,
"train_speed(iter/s)": 0.005415
},
{
"epoch": 0.2743249035576511,
"grad_norm": 4.5371856689453125,
"learning_rate": 0.00017371019956864583,
"logits/chosen": -0.8519307374954224,
"logits/rejected": -0.8563728928565979,
"logps/chosen": -18.773422241210938,
"logps/rejected": -25.609325408935547,
"loss": 1.2189257144927979,
"memory(GiB)": 46.83,
"nll_loss": 0.7953273057937622,
"rewards/accuracies": 0.78125,
"rewards/chosen": 0.14804774522781372,
"rewards/margins": 1.684711217880249,
"rewards/rejected": -1.5366634130477905,
"step": 340,
"train_speed(iter/s)": 0.005416
},
{
"epoch": 0.27513174150929126,
"grad_norm": 5.0346455574035645,
"learning_rate": 0.00017352956081372007,
"logits/chosen": -0.901013970375061,
"logits/rejected": -0.9049715995788574,
"logps/chosen": -8.963022232055664,
"logps/rejected": -34.29716110229492,
"loss": 0.8155198097229004,
"memory(GiB)": 46.83,
"nll_loss": 0.40066373348236084,
"rewards/accuracies": 0.84375,
"rewards/chosen": -0.041613977402448654,
"rewards/margins": 2.3150718212127686,
"rewards/rejected": -2.3566856384277344,
"step": 341,
"train_speed(iter/s)": 0.005416
},
{
"epoch": 0.2759385794609314,
"grad_norm": 4.706645488739014,
"learning_rate": 0.00017334839820688176,
"logits/chosen": -0.8764183521270752,
"logits/rejected": -0.8793443441390991,
"logps/chosen": -11.185328483581543,
"logps/rejected": -27.840126037597656,
"loss": 0.8221145868301392,
"memory(GiB)": 46.83,
"nll_loss": 0.36857330799102783,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.029647603631019592,
"rewards/margins": 1.7318322658538818,
"rewards/rejected": -1.7021846771240234,
"step": 342,
"train_speed(iter/s)": 0.005416
},
{
"epoch": 0.2767454174125715,
"grad_norm": 3.4059722423553467,
"learning_rate": 0.00017316671303880065,
"logits/chosen": -0.8800357580184937,
"logits/rejected": -0.8856234550476074,
"logps/chosen": -10.418521881103516,
"logps/rejected": -44.70547866821289,
"loss": 0.621554970741272,
"memory(GiB)": 46.83,
"nll_loss": 0.41401058435440063,
"rewards/accuracies": 0.90625,
"rewards/chosen": 0.08430502563714981,
"rewards/margins": 3.2389299869537354,
"rewards/rejected": -3.1546249389648438,
"step": 343,
"train_speed(iter/s)": 0.005417
},
{
"epoch": 0.2775522553642117,
"grad_norm": 8.598644256591797,
"learning_rate": 0.00017298450660386934,
"logits/chosen": -0.8565375208854675,
"logits/rejected": -0.8581067323684692,
"logps/chosen": -11.926506042480469,
"logps/rejected": -36.14910888671875,
"loss": 0.7724243998527527,
"memory(GiB)": 46.83,
"nll_loss": 0.41390153765678406,
"rewards/accuracies": 0.875,
"rewards/chosen": -0.05219612270593643,
"rewards/margins": 2.1874096393585205,
"rewards/rejected": -2.239605665206909,
"step": 344,
"train_speed(iter/s)": 0.005417
},
{
"epoch": 0.27835909331585185,
"grad_norm": 5.491206645965576,
"learning_rate": 0.00017280178020019418,
"logits/chosen": -0.8360708951950073,
"logits/rejected": -0.8349617123603821,
"logps/chosen": -9.427896499633789,
"logps/rejected": -29.778169631958008,
"loss": 0.7176328301429749,
"memory(GiB)": 46.83,
"nll_loss": 0.46471166610717773,
"rewards/accuracies": 0.90625,
"rewards/chosen": 0.3919517695903778,
"rewards/margins": 2.2337028980255127,
"rewards/rejected": -1.841751217842102,
"step": 345,
"train_speed(iter/s)": 0.005417
},
{
"epoch": 0.279165931267492,
"grad_norm": 2.732307195663452,
"learning_rate": 0.000172618535129586,
"logits/chosen": -0.8330416083335876,
"logits/rejected": -0.8343455195426941,
"logps/chosen": -13.94620418548584,
"logps/rejected": -34.905059814453125,
"loss": 0.6391770243644714,
"memory(GiB)": 46.83,
"nll_loss": 0.40491989254951477,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.024340404197573662,
"rewards/margins": 2.191556453704834,
"rewards/rejected": -2.1672160625457764,
"step": 346,
"train_speed(iter/s)": 0.005417
},
{
"epoch": 0.27997276921913217,
"grad_norm": 2.748098373413086,
"learning_rate": 0.00017243477269755073,
"logits/chosen": -0.8207265138626099,
"logits/rejected": -0.8255487680435181,
"logps/chosen": -8.841146469116211,
"logps/rejected": -40.18748092651367,
"loss": 0.5847609043121338,
"memory(GiB)": 46.83,
"nll_loss": 0.4391492009162903,
"rewards/accuracies": 0.96875,
"rewards/chosen": 0.18971768021583557,
"rewards/margins": 3.0055530071258545,
"rewards/rejected": -2.815835475921631,
"step": 347,
"train_speed(iter/s)": 0.005417
},
{
"epoch": 0.28077960717077227,
"grad_norm": 8.588139533996582,
"learning_rate": 0.00017225049421328023,
"logits/chosen": -0.8355762362480164,
"logits/rejected": -0.8387144804000854,
"logps/chosen": -8.67043399810791,
"logps/rejected": -34.789730072021484,
"loss": 0.5931243896484375,
"memory(GiB)": 46.83,
"nll_loss": 0.30945685505867004,
"rewards/accuracies": 0.84375,
"rewards/chosen": 0.06438732147216797,
"rewards/margins": 2.153982639312744,
"rewards/rejected": -2.089595317840576,
"step": 348,
"train_speed(iter/s)": 0.005418
},
{
"epoch": 0.28158644512241243,
"grad_norm": 2.7876644134521484,
"learning_rate": 0.00017206570098964293,
"logits/chosen": -0.8504444360733032,
"logits/rejected": -0.8515408635139465,
"logps/chosen": -10.413717269897461,
"logps/rejected": -31.34994888305664,
"loss": 0.5911897420883179,
"memory(GiB)": 46.83,
"nll_loss": 0.3716551661491394,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.2757214307785034,
"rewards/margins": 2.5438179969787598,
"rewards/rejected": -2.268096446990967,
"step": 349,
"train_speed(iter/s)": 0.005418
},
{
"epoch": 0.2823932830740526,
"grad_norm": 2.771085262298584,
"learning_rate": 0.00017188039434317437,
"logits/chosen": -0.7710286974906921,
"logits/rejected": -0.7747238874435425,
"logps/chosen": -11.302440643310547,
"logps/rejected": -31.574066162109375,
"loss": 0.7104746103286743,
"memory(GiB)": 46.83,
"nll_loss": 0.44341009855270386,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.2658320367336273,
"rewards/margins": 2.1740376949310303,
"rewards/rejected": -1.908205509185791,
"step": 350,
"train_speed(iter/s)": 0.005418
},
{
"epoch": 0.28320012102569275,
"grad_norm": 8.733509063720703,
"learning_rate": 0.00017169457559406795,
"logits/chosen": -0.7990887761116028,
"logits/rejected": -0.8017781376838684,
"logps/chosen": -10.448628425598145,
"logps/rejected": -32.143943786621094,
"loss": 1.2729414701461792,
"memory(GiB)": 46.83,
"nll_loss": 0.8385729789733887,
"rewards/accuracies": 0.90625,
"rewards/chosen": -0.18963520228862762,
"rewards/margins": 1.997046947479248,
"rewards/rejected": -2.1866822242736816,
"step": 351,
"train_speed(iter/s)": 0.005417
},
{
"epoch": 0.2840069589773329,
"grad_norm": 3.8308520317077637,
"learning_rate": 0.00017150824606616553,
"logits/chosen": -0.7534295320510864,
"logits/rejected": -0.7567183971405029,
"logps/chosen": -7.442231178283691,
"logps/rejected": -32.14317321777344,
"loss": 0.5511249899864197,
"memory(GiB)": 46.83,
"nll_loss": 0.34539952874183655,
"rewards/accuracies": 0.96875,
"rewards/chosen": 0.26004305481910706,
"rewards/margins": 2.451585531234741,
"rewards/rejected": -2.191542387008667,
"step": 352,
"train_speed(iter/s)": 0.005417
},
{
"epoch": 0.2848137969289731,
"grad_norm": 3.919644832611084,
"learning_rate": 0.00017132140708694786,
"logits/chosen": -0.7558514475822449,
"logits/rejected": -0.7550539970397949,
"logps/chosen": -8.997418403625488,
"logps/rejected": -29.441905975341797,
"loss": 0.6320300698280334,
"memory(GiB)": 46.83,
"nll_loss": 0.3772739768028259,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.2652067542076111,
"rewards/margins": 2.186215877532959,
"rewards/rejected": -1.9210093021392822,
"step": 353,
"train_speed(iter/s)": 0.005418
},
{
"epoch": 0.2856206348806132,
"grad_norm": 20.330293655395508,
"learning_rate": 0.0001711340599875253,
"logits/chosen": -0.7443191409111023,
"logits/rejected": -0.7491686344146729,
"logps/chosen": -11.211926460266113,
"logps/rejected": -37.2029914855957,
"loss": 1.2416906356811523,
"memory(GiB)": 46.83,
"nll_loss": 0.7969366908073425,
"rewards/accuracies": 0.8125,
"rewards/chosen": -0.1411081850528717,
"rewards/margins": 2.08335542678833,
"rewards/rejected": -2.22446346282959,
"step": 354,
"train_speed(iter/s)": 0.005418
},
{
"epoch": 0.28642747283225334,
"grad_norm": 13.989158630371094,
"learning_rate": 0.00017094620610262815,
"logits/chosen": -0.7479000091552734,
"logits/rejected": -0.750941812992096,
"logps/chosen": -11.775254249572754,
"logps/rejected": -35.6055908203125,
"loss": 1.2802770137786865,
"memory(GiB)": 46.83,
"nll_loss": 0.7870579957962036,
"rewards/accuracies": 0.8125,
"rewards/chosen": -0.2751302123069763,
"rewards/margins": 1.906927227973938,
"rewards/rejected": -2.1820573806762695,
"step": 355,
"train_speed(iter/s)": 0.005418
},
{
"epoch": 0.2872343107838935,
"grad_norm": 7.8280930519104,
"learning_rate": 0.0001707578467705973,
"logits/chosen": -0.7759760022163391,
"logits/rejected": -0.7844580411911011,
"logps/chosen": -7.402548789978027,
"logps/rejected": -38.92572784423828,
"loss": 0.7681185603141785,
"memory(GiB)": 46.83,
"nll_loss": 0.5315437912940979,
"rewards/accuracies": 0.90625,
"rewards/chosen": 0.005034878849983215,
"rewards/margins": 2.443704128265381,
"rewards/rejected": -2.438669443130493,
"step": 356,
"train_speed(iter/s)": 0.005418
},
{
"epoch": 0.28804114873553366,
"grad_norm": 24.46771812438965,
"learning_rate": 0.00017056898333337462,
"logits/chosen": -0.7455392479896545,
"logits/rejected": -0.7464004755020142,
"logps/chosen": -15.696362495422363,
"logps/rejected": -36.21916198730469,
"loss": 0.699033796787262,
"memory(GiB)": 46.83,
"nll_loss": 0.42450839281082153,
"rewards/accuracies": 0.84375,
"rewards/chosen": 0.19790178537368774,
"rewards/margins": 2.3564441204071045,
"rewards/rejected": -2.1585421562194824,
"step": 357,
"train_speed(iter/s)": 0.005419
},
{
"epoch": 0.2888479866871738,
"grad_norm": 3.165498971939087,
"learning_rate": 0.0001703796171364934,
"logits/chosen": -0.7834245562553406,
"logits/rejected": -0.7828773260116577,
"logps/chosen": -8.231873512268066,
"logps/rejected": -30.543338775634766,
"loss": 0.7491443753242493,
"memory(GiB)": 46.83,
"nll_loss": 0.4628988206386566,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.24111242592334747,
"rewards/margins": 2.3805058002471924,
"rewards/rejected": -2.1393933296203613,
"step": 358,
"train_speed(iter/s)": 0.005419
},
{
"epoch": 0.2896548246388139,
"grad_norm": 2.6455235481262207,
"learning_rate": 0.00017018974952906884,
"logits/chosen": -0.8238362073898315,
"logits/rejected": -0.8289802670478821,
"logps/chosen": -6.384030818939209,
"logps/rejected": -37.180633544921875,
"loss": 0.5261876583099365,
"memory(GiB)": 46.83,
"nll_loss": 0.28632083535194397,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.18914461135864258,
"rewards/margins": 2.69685959815979,
"rewards/rejected": -2.5077149868011475,
"step": 359,
"train_speed(iter/s)": 0.005419
},
{
"epoch": 0.2904616625904541,
"grad_norm": 2.369776964187622,
"learning_rate": 0.00016999938186378825,
"logits/chosen": -0.7982887625694275,
"logits/rejected": -0.8035246729850769,
"logps/chosen": -6.851421356201172,
"logps/rejected": -45.864418029785156,
"loss": 0.5188026428222656,
"memory(GiB)": 46.83,
"nll_loss": 0.3399565815925598,
"rewards/accuracies": 0.90625,
"rewards/chosen": 0.3176203966140747,
"rewards/margins": 3.4621381759643555,
"rewards/rejected": -3.144517660140991,
"step": 360,
"train_speed(iter/s)": 0.00542
},
{
"epoch": 0.29126850054209424,
"grad_norm": 3.786916971206665,
"learning_rate": 0.0001698085154969017,
"logits/chosen": -0.8295035362243652,
"logits/rejected": -0.8320608139038086,
"logps/chosen": -10.462471961975098,
"logps/rejected": -44.3033561706543,
"loss": 0.6038550138473511,
"memory(GiB)": 46.83,
"nll_loss": 0.44244384765625,
"rewards/accuracies": 0.96875,
"rewards/chosen": 0.005623971112072468,
"rewards/margins": 2.9000349044799805,
"rewards/rejected": -2.8944108486175537,
"step": 361,
"train_speed(iter/s)": 0.00542
},
{
"epoch": 0.2920753384937344,
"grad_norm": 2.3236849308013916,
"learning_rate": 0.000169617151788212,
"logits/chosen": -0.8378246426582336,
"logits/rejected": -0.8476194739341736,
"logps/chosen": -7.4671311378479,
"logps/rejected": -45.69831466674805,
"loss": 0.549799919128418,
"memory(GiB)": 46.83,
"nll_loss": 0.3557121455669403,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.2878333032131195,
"rewards/margins": 3.4509360790252686,
"rewards/rejected": -3.163102865219116,
"step": 362,
"train_speed(iter/s)": 0.005419
},
{
"epoch": 0.29288217644537456,
"grad_norm": 4.218591213226318,
"learning_rate": 0.0001694252921010654,
"logits/chosen": -0.8441336154937744,
"logits/rejected": -0.854229211807251,
"logps/chosen": -7.4483184814453125,
"logps/rejected": -46.634490966796875,
"loss": 0.5104203224182129,
"memory(GiB)": 46.83,
"nll_loss": 0.2786526679992676,
"rewards/accuracies": 0.90625,
"rewards/chosen": 0.10106715559959412,
"rewards/margins": 3.364898681640625,
"rewards/rejected": -3.263831377029419,
"step": 363,
"train_speed(iter/s)": 0.00542
},
{
"epoch": 0.2936890143970147,
"grad_norm": 6.0027055740356445,
"learning_rate": 0.0001692329378023416,
"logits/chosen": -0.8181811571121216,
"logits/rejected": -0.8173055648803711,
"logps/chosen": -11.75820541381836,
"logps/rejected": -28.230079650878906,
"loss": 0.8542529344558716,
"memory(GiB)": 46.83,
"nll_loss": 0.41755104064941406,
"rewards/accuracies": 0.78125,
"rewards/chosen": 0.016829999163746834,
"rewards/margins": 1.9391112327575684,
"rewards/rejected": -1.9222811460494995,
"step": 364,
"train_speed(iter/s)": 0.00542
},
{
"epoch": 0.29449585234865483,
"grad_norm": 2.452047109603882,
"learning_rate": 0.00016904009026244405,
"logits/chosen": -0.8576743006706238,
"logits/rejected": -0.8569716215133667,
"logps/chosen": -8.94229507446289,
"logps/rejected": -36.84193420410156,
"loss": 0.5307234525680542,
"memory(GiB)": 46.83,
"nll_loss": 0.27585676312446594,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.1474345177412033,
"rewards/margins": 2.3831472396850586,
"rewards/rejected": -2.235712766647339,
"step": 365,
"train_speed(iter/s)": 0.00542
},
{
"epoch": 0.295302690300295,
"grad_norm": 4.770409107208252,
"learning_rate": 0.00016884675085529033,
"logits/chosen": -0.8674459457397461,
"logits/rejected": -0.8703688383102417,
"logps/chosen": -10.529121398925781,
"logps/rejected": -38.25895309448242,
"loss": 0.6165487766265869,
"memory(GiB)": 46.83,
"nll_loss": 0.3394632339477539,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.13632023334503174,
"rewards/margins": 2.6175537109375,
"rewards/rejected": -2.4812331199645996,
"step": 366,
"train_speed(iter/s)": 0.005421
},
{
"epoch": 0.29610952825193515,
"grad_norm": 2.726836681365967,
"learning_rate": 0.00016865292095830214,
"logits/chosen": -0.8154149055480957,
"logits/rejected": -0.8210477232933044,
"logps/chosen": -8.451236724853516,
"logps/rejected": -30.605690002441406,
"loss": 0.5677744150161743,
"memory(GiB)": 46.83,
"nll_loss": 0.30434367060661316,
"rewards/accuracies": 0.90625,
"rewards/chosen": 0.3030344247817993,
"rewards/margins": 2.1608378887176514,
"rewards/rejected": -1.8578035831451416,
"step": 367,
"train_speed(iter/s)": 0.005421
},
{
"epoch": 0.2969163662035753,
"grad_norm": 4.918789386749268,
"learning_rate": 0.00016845860195239574,
"logits/chosen": -0.8281161189079285,
"logits/rejected": -0.8330156207084656,
"logps/chosen": -11.424484252929688,
"logps/rejected": -32.49198913574219,
"loss": 0.7686675786972046,
"memory(GiB)": 46.83,
"nll_loss": 0.5117014050483704,
"rewards/accuracies": 0.90625,
"rewards/chosen": 0.3326207995414734,
"rewards/margins": 2.3775177001953125,
"rewards/rejected": -2.0448966026306152,
"step": 368,
"train_speed(iter/s)": 0.005421
},
{
"epoch": 0.29772320415521547,
"grad_norm": 7.9901652336120605,
"learning_rate": 0.00016826379522197197,
"logits/chosen": -0.7991360425949097,
"logits/rejected": -0.8027262091636658,
"logps/chosen": -8.358216285705566,
"logps/rejected": -31.194568634033203,
"loss": 0.7576655745506287,
"memory(GiB)": 46.83,
"nll_loss": 0.49762627482414246,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.10716473311185837,
"rewards/margins": 2.159275531768799,
"rewards/rejected": -2.0521109104156494,
"step": 369,
"train_speed(iter/s)": 0.005422
},
{
"epoch": 0.2985300421068556,
"grad_norm": 7.625348091125488,
"learning_rate": 0.0001680685021549063,
"logits/chosen": -0.7968946099281311,
"logits/rejected": -0.8060710430145264,
"logps/chosen": -7.866345405578613,
"logps/rejected": -40.948158264160156,
"loss": 0.9940714240074158,
"memory(GiB)": 46.83,
"nll_loss": 0.7132853269577026,
"rewards/accuracies": 0.9375,
"rewards/chosen": -0.16774287819862366,
"rewards/margins": 2.4824962615966797,
"rewards/rejected": -2.6502389907836914,
"step": 370,
"train_speed(iter/s)": 0.005423
},
{
"epoch": 0.29933688005849574,
"grad_norm": 4.839093208312988,
"learning_rate": 0.0001678727241425391,
"logits/chosen": -0.792543888092041,
"logits/rejected": -0.7907209992408752,
"logps/chosen": -10.626989364624023,
"logps/rejected": -25.664470672607422,
"loss": 0.91594398021698,
"memory(GiB)": 46.83,
"nll_loss": 0.5407547950744629,
"rewards/accuracies": 0.90625,
"rewards/chosen": 0.0037185251712799072,
"rewards/margins": 1.719236969947815,
"rewards/rejected": -1.7155182361602783,
"step": 371,
"train_speed(iter/s)": 0.005423
},
{
"epoch": 0.3001437180101359,
"grad_norm": 11.523240089416504,
"learning_rate": 0.00016767646257966572,
"logits/chosen": -0.8143973350524902,
"logits/rejected": -0.8215935230255127,
"logps/chosen": -6.086573123931885,
"logps/rejected": -34.30033493041992,
"loss": 0.6105502247810364,
"memory(GiB)": 46.83,
"nll_loss": 0.36522942781448364,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.2981349527835846,
"rewards/margins": 2.788585662841797,
"rewards/rejected": -2.490450859069824,
"step": 372,
"train_speed(iter/s)": 0.005423
},
{
"epoch": 0.30095055596177606,
"grad_norm": 5.205559253692627,
"learning_rate": 0.00016747971886452642,
"logits/chosen": -0.7993229031562805,
"logits/rejected": -0.8019697666168213,
"logps/chosen": -14.90966796875,
"logps/rejected": -40.805274963378906,
"loss": 1.5332070589065552,
"memory(GiB)": 46.83,
"nll_loss": 1.2682892084121704,
"rewards/accuracies": 0.84375,
"rewards/chosen": 0.025209464132785797,
"rewards/margins": 2.6658260822296143,
"rewards/rejected": -2.6406168937683105,
"step": 373,
"train_speed(iter/s)": 0.005423
},
{
"epoch": 0.3017573939134162,
"grad_norm": 2.872535228729248,
"learning_rate": 0.00016728249439879655,
"logits/chosen": -0.7731214165687561,
"logits/rejected": -0.7786182165145874,
"logps/chosen": -5.839204788208008,
"logps/rejected": -37.67174530029297,
"loss": 0.507649838924408,
"memory(GiB)": 46.83,
"nll_loss": 0.2965702712535858,
"rewards/accuracies": 0.90625,
"rewards/chosen": 0.22565633058547974,
"rewards/margins": 2.726480007171631,
"rewards/rejected": -2.500823497772217,
"step": 374,
"train_speed(iter/s)": 0.005424
},
{
"epoch": 0.3025642318650564,
"grad_norm": 9.740580558776855,
"learning_rate": 0.00016708479058757649,
"logits/chosen": -0.8201895952224731,
"logits/rejected": -0.8329208493232727,
"logps/chosen": -10.150799751281738,
"logps/rejected": -40.12678527832031,
"loss": 0.5580483078956604,
"memory(GiB)": 46.83,
"nll_loss": 0.32952913641929626,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.20641882717609406,
"rewards/margins": 2.5419578552246094,
"rewards/rejected": -2.335538625717163,
"step": 375,
"train_speed(iter/s)": 0.005424
},
{
"epoch": 0.3033710698166965,
"grad_norm": 4.967090606689453,
"learning_rate": 0.00016688660883938165,
"logits/chosen": -0.7816774845123291,
"logits/rejected": -0.7863184213638306,
"logps/chosen": -11.115227699279785,
"logps/rejected": -41.1477165222168,
"loss": 0.7776178121566772,
"memory(GiB)": 46.83,
"nll_loss": 0.5047651529312134,
"rewards/accuracies": 0.90625,
"rewards/chosen": -0.12607808411121368,
"rewards/margins": 2.677337884902954,
"rewards/rejected": -2.8034157752990723,
"step": 376,
"train_speed(iter/s)": 0.005424
},
{
"epoch": 0.30417790776833664,
"grad_norm": 5.764723777770996,
"learning_rate": 0.00016668795056613242,
"logits/chosen": -0.8348323106765747,
"logits/rejected": -0.836425244808197,
"logps/chosen": -11.849743843078613,
"logps/rejected": -35.644893646240234,
"loss": 0.860490083694458,
"memory(GiB)": 46.83,
"nll_loss": 0.44726479053497314,
"rewards/accuracies": 0.78125,
"rewards/chosen": 0.01643115095794201,
"rewards/margins": 2.4391143321990967,
"rewards/rejected": -2.4226832389831543,
"step": 377,
"train_speed(iter/s)": 0.005424
},
{
"epoch": 0.3049847457199768,
"grad_norm": 6.4779510498046875,
"learning_rate": 0.0001664888171831442,
"logits/chosen": -0.8333585262298584,
"logits/rejected": -0.8423128128051758,
"logps/chosen": -8.405279159545898,
"logps/rejected": -37.56438446044922,
"loss": 0.6916205883026123,
"memory(GiB)": 46.83,
"nll_loss": 0.43494561314582825,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.054853081703186035,
"rewards/margins": 2.354010581970215,
"rewards/rejected": -2.2991573810577393,
"step": 378,
"train_speed(iter/s)": 0.005424
},
{
"epoch": 0.30579158367161696,
"grad_norm": 2.1519875526428223,
"learning_rate": 0.00016628921010911714,
"logits/chosen": -0.8162001371383667,
"logits/rejected": -0.8233896493911743,
"logps/chosen": -6.277496814727783,
"logps/rejected": -37.37247848510742,
"loss": 0.3955227732658386,
"memory(GiB)": 46.83,
"nll_loss": 0.22343112528324127,
"rewards/accuracies": 0.96875,
"rewards/chosen": 0.15012571215629578,
"rewards/margins": 2.704033851623535,
"rewards/rejected": -2.553908109664917,
"step": 379,
"train_speed(iter/s)": 0.005425
},
{
"epoch": 0.3065984216232571,
"grad_norm": 5.495427131652832,
"learning_rate": 0.00016608913076612627,
"logits/chosen": -0.7601447105407715,
"logits/rejected": -0.7649034261703491,
"logps/chosen": -11.018935203552246,
"logps/rejected": -31.04195785522461,
"loss": 0.7440771460533142,
"memory(GiB)": 46.83,
"nll_loss": 0.3949829936027527,
"rewards/accuracies": 0.84375,
"rewards/chosen": 0.16132403910160065,
"rewards/margins": 2.152961015701294,
"rewards/rejected": -1.9916372299194336,
"step": 380,
"train_speed(iter/s)": 0.005425
},
{
"epoch": 0.3074052595748972,
"grad_norm": 12.617781639099121,
"learning_rate": 0.00016588858057961113,
"logits/chosen": -0.823615550994873,
"logits/rejected": -0.8296138048171997,
"logps/chosen": -11.327326774597168,
"logps/rejected": -38.99674606323242,
"loss": 0.916981041431427,
"memory(GiB)": 46.83,
"nll_loss": 0.6145994067192078,
"rewards/accuracies": 0.875,
"rewards/chosen": -0.005291827023029327,
"rewards/margins": 2.653188705444336,
"rewards/rejected": -2.658480644226074,
"step": 381,
"train_speed(iter/s)": 0.005425
},
{
"epoch": 0.3082120975265374,
"grad_norm": 10.325765609741211,
"learning_rate": 0.00016568756097836576,
"logits/chosen": -0.7539953589439392,
"logits/rejected": -0.7629266381263733,
"logps/chosen": -12.126445770263672,
"logps/rejected": -36.76786804199219,
"loss": 0.9146925210952759,
"memory(GiB)": 46.83,
"nll_loss": 0.5855523347854614,
"rewards/accuracies": 0.90625,
"rewards/chosen": 0.018190251663327217,
"rewards/margins": 2.345966339111328,
"rewards/rejected": -2.3277759552001953,
"step": 382,
"train_speed(iter/s)": 0.005425
},
{
"epoch": 0.30901893547817755,
"grad_norm": 4.079949378967285,
"learning_rate": 0.00016548607339452853,
"logits/chosen": -0.7926503419876099,
"logits/rejected": -0.8010275363922119,
"logps/chosen": -10.392716407775879,
"logps/rejected": -33.4859733581543,
"loss": 0.6544159054756165,
"memory(GiB)": 46.83,
"nll_loss": 0.31039926409721375,
"rewards/accuracies": 0.8125,
"rewards/chosen": 0.19881543517112732,
"rewards/margins": 2.027736186981201,
"rewards/rejected": -1.828920841217041,
"step": 383,
"train_speed(iter/s)": 0.005425
},
{
"epoch": 0.3098257734298177,
"grad_norm": 2.981825828552246,
"learning_rate": 0.0001652841192635718,
"logits/chosen": -0.7877278923988342,
"logits/rejected": -0.7911107540130615,
"logps/chosen": -10.606431007385254,
"logps/rejected": -31.438617706298828,
"loss": 0.7501833438873291,
"memory(GiB)": 46.83,
"nll_loss": 0.4839434027671814,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.36393457651138306,
"rewards/margins": 2.2303647994995117,
"rewards/rejected": -1.8664300441741943,
"step": 384,
"train_speed(iter/s)": 0.005426
},
{
"epoch": 0.31063261138145787,
"grad_norm": 5.048736572265625,
"learning_rate": 0.0001650817000242919,
"logits/chosen": -0.741836428642273,
"logits/rejected": -0.7429819703102112,
"logps/chosen": -8.188630104064941,
"logps/rejected": -21.78225326538086,
"loss": 0.7458047866821289,
"memory(GiB)": 46.83,
"nll_loss": 0.3462568521499634,
"rewards/accuracies": 0.8125,
"rewards/chosen": 0.1975884884595871,
"rewards/margins": 1.2948282957077026,
"rewards/rejected": -1.0972397327423096,
"step": 385,
"train_speed(iter/s)": 0.005426
},
{
"epoch": 0.31143944933309803,
"grad_norm": 3.7488629817962646,
"learning_rate": 0.00016487881711879868,
"logits/chosen": -0.7345485687255859,
"logits/rejected": -0.7461491227149963,
"logps/chosen": -8.506485939025879,
"logps/rejected": -31.39336395263672,
"loss": 0.6992615461349487,
"memory(GiB)": 46.83,
"nll_loss": 0.38303038477897644,
"rewards/accuracies": 0.84375,
"rewards/chosen": 0.12145505100488663,
"rewards/margins": 1.6618486642837524,
"rewards/rejected": -1.5403934717178345,
"step": 386,
"train_speed(iter/s)": 0.005426
},
{
"epoch": 0.31224628728473813,
"grad_norm": 4.740914344787598,
"learning_rate": 0.0001646754719925053,
"logits/chosen": -0.7271203398704529,
"logits/rejected": -0.7348542213439941,
"logps/chosen": -8.581640243530273,
"logps/rejected": -30.84325408935547,
"loss": 0.5986461639404297,
"memory(GiB)": 46.83,
"nll_loss": 0.30818265676498413,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.2583742141723633,
"rewards/margins": 1.7723979949951172,
"rewards/rejected": -1.514023780822754,
"step": 387,
"train_speed(iter/s)": 0.005427
},
{
"epoch": 0.3130531252363783,
"grad_norm": 2.877361536026001,
"learning_rate": 0.00016447166609411809,
"logits/chosen": -0.737002432346344,
"logits/rejected": -0.7362369894981384,
"logps/chosen": -9.167498588562012,
"logps/rejected": -21.97631072998047,
"loss": 0.7882663607597351,
"memory(GiB)": 46.83,
"nll_loss": 0.3854939937591553,
"rewards/accuracies": 0.84375,
"rewards/chosen": 0.27406081557273865,
"rewards/margins": 1.2815303802490234,
"rewards/rejected": -1.007469654083252,
"step": 388,
"train_speed(iter/s)": 0.005427
},
{
"epoch": 0.31385996318801845,
"grad_norm": 2.516064405441284,
"learning_rate": 0.00016426740087562588,
"logits/chosen": -0.7427570223808289,
"logits/rejected": -0.7460445761680603,
"logps/chosen": -7.309655666351318,
"logps/rejected": -30.33109474182129,
"loss": 0.5361584424972534,
"memory(GiB)": 46.83,
"nll_loss": 0.29300200939178467,
"rewards/accuracies": 0.96875,
"rewards/chosen": 0.18929171562194824,
"rewards/margins": 1.8147234916687012,
"rewards/rejected": -1.625431776046753,
"step": 389,
"train_speed(iter/s)": 0.005427
},
{
"epoch": 0.3146668011396586,
"grad_norm": 5.825074195861816,
"learning_rate": 0.0001640626777922901,
"logits/chosen": -0.7519196271896362,
"logits/rejected": -0.7524212598800659,
"logps/chosen": -7.206381320953369,
"logps/rejected": -24.535839080810547,
"loss": 0.6842062473297119,
"memory(GiB)": 46.83,
"nll_loss": 0.3918344974517822,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.23575374484062195,
"rewards/margins": 1.7519906759262085,
"rewards/rejected": -1.5162369012832642,
"step": 390,
"train_speed(iter/s)": 0.005427
},
{
"epoch": 0.3154736390912988,
"grad_norm": 3.599740505218506,
"learning_rate": 0.000163857498302634,
"logits/chosen": -0.7379420399665833,
"logits/rejected": -0.7385002970695496,
"logps/chosen": -8.897488594055176,
"logps/rejected": -21.334794998168945,
"loss": 0.7518292665481567,
"memory(GiB)": 46.83,
"nll_loss": 0.35948920249938965,
"rewards/accuracies": 0.71875,
"rewards/chosen": 0.0675305724143982,
"rewards/margins": 1.2294992208480835,
"rewards/rejected": -1.161968469619751,
"step": 391,
"train_speed(iter/s)": 0.005427
},
{
"epoch": 0.31628047704293893,
"grad_norm": 3.701690673828125,
"learning_rate": 0.0001636518638684325,
"logits/chosen": -0.7553545832633972,
"logits/rejected": -0.7599779367446899,
"logps/chosen": -11.763086318969727,
"logps/rejected": -29.765409469604492,
"loss": 0.6486645936965942,
"memory(GiB)": 46.83,
"nll_loss": 0.3567640483379364,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.10855480283498764,
"rewards/margins": 1.6032474040985107,
"rewards/rejected": -1.4946926832199097,
"step": 392,
"train_speed(iter/s)": 0.005427
},
{
"epoch": 0.31708731499457904,
"grad_norm": 2.8278613090515137,
"learning_rate": 0.00016344577595470174,
"logits/chosen": -0.7699616551399231,
"logits/rejected": -0.7747686505317688,
"logps/chosen": -8.457822799682617,
"logps/rejected": -25.99679183959961,
"loss": 0.7349235415458679,
"memory(GiB)": 46.83,
"nll_loss": 0.37837332487106323,
"rewards/accuracies": 0.84375,
"rewards/chosen": 0.10739874094724655,
"rewards/margins": 1.572762131690979,
"rewards/rejected": -1.4653635025024414,
"step": 393,
"train_speed(iter/s)": 0.005427
},
{
"epoch": 0.3178941529462192,
"grad_norm": 3.7045748233795166,
"learning_rate": 0.0001632392360296886,
"logits/chosen": -0.690305233001709,
"logits/rejected": -0.6888067722320557,
"logps/chosen": -9.403566360473633,
"logps/rejected": -22.69052505493164,
"loss": 0.6981708407402039,
"memory(GiB)": 46.83,
"nll_loss": 0.42633530497550964,
"rewards/accuracies": 0.84375,
"rewards/chosen": 0.4319700002670288,
"rewards/margins": 1.8832911252975464,
"rewards/rejected": -1.4513212442398071,
"step": 394,
"train_speed(iter/s)": 0.005428
},
{
"epoch": 0.31870099089785936,
"grad_norm": 3.8347578048706055,
"learning_rate": 0.00016303224556486021,
"logits/chosen": -0.7941313982009888,
"logits/rejected": -0.7985343933105469,
"logps/chosen": -8.82894515991211,
"logps/rejected": -35.2305793762207,
"loss": 0.6906291842460632,
"memory(GiB)": 46.83,
"nll_loss": 0.4142599105834961,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.22435417771339417,
"rewards/margins": 2.410836696624756,
"rewards/rejected": -2.1864821910858154,
"step": 395,
"train_speed(iter/s)": 0.005428
},
{
"epoch": 0.3195078288494995,
"grad_norm": 2.570457935333252,
"learning_rate": 0.00016282480603489359,
"logits/chosen": -0.7678409218788147,
"logits/rejected": -0.7748376727104187,
"logps/chosen": -7.719938278198242,
"logps/rejected": -37.97621536254883,
"loss": 0.5270894765853882,
"memory(GiB)": 46.83,
"nll_loss": 0.29066720604896545,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.2296931892633438,
"rewards/margins": 2.5373897552490234,
"rewards/rejected": -2.307696580886841,
"step": 396,
"train_speed(iter/s)": 0.005428
},
{
"epoch": 0.3203146668011397,
"grad_norm": 3.276946544647217,
"learning_rate": 0.000162616918917665,
"logits/chosen": -0.8192197680473328,
"logits/rejected": -0.8224659562110901,
"logps/chosen": -12.474966049194336,
"logps/rejected": -34.623626708984375,
"loss": 0.6273024678230286,
"memory(GiB)": 46.83,
"nll_loss": 0.4210663139820099,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.15507780015468597,
"rewards/margins": 2.483549118041992,
"rewards/rejected": -2.3284709453582764,
"step": 397,
"train_speed(iter/s)": 0.005428
},
{
"epoch": 0.3211215047527798,
"grad_norm": 4.271194934844971,
"learning_rate": 0.00016240858569423956,
"logits/chosen": -0.8221184611320496,
"logits/rejected": -0.8321431875228882,
"logps/chosen": -9.941547393798828,
"logps/rejected": -42.07545471191406,
"loss": 0.8007271885871887,
"memory(GiB)": 46.83,
"nll_loss": 0.4452548623085022,
"rewards/accuracies": 0.90625,
"rewards/chosen": -0.05637914687395096,
"rewards/margins": 2.7785463333129883,
"rewards/rejected": -2.834925651550293,
"step": 398,
"train_speed(iter/s)": 0.005428
},
{
"epoch": 0.32192834270441995,
"grad_norm": 11.448945999145508,
"learning_rate": 0.0001621998078488605,
"logits/chosen": -0.8299403190612793,
"logits/rejected": -0.8370727896690369,
"logps/chosen": -14.581025123596191,
"logps/rejected": -46.871543884277344,
"loss": 1.0272753238677979,
"memory(GiB)": 46.83,
"nll_loss": 0.7910286784172058,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.08015693724155426,
"rewards/margins": 3.2413315773010254,
"rewards/rejected": -3.161174774169922,
"step": 399,
"train_speed(iter/s)": 0.005429
},
{
"epoch": 0.3227351806560601,
"grad_norm": 10.813321113586426,
"learning_rate": 0.00016199058686893882,
"logits/chosen": -0.85502690076828,
"logits/rejected": -0.8559147715568542,
"logps/chosen": -10.797840118408203,
"logps/rejected": -27.456714630126953,
"loss": 1.2833585739135742,
"memory(GiB)": 46.83,
"nll_loss": 0.8083551526069641,
"rewards/accuracies": 0.78125,
"rewards/chosen": -0.05027822405099869,
"rewards/margins": 1.7881048917770386,
"rewards/rejected": -1.8383830785751343,
"step": 400,
"train_speed(iter/s)": 0.005429
},
{
"epoch": 0.32354201860770027,
"grad_norm": 7.667049884796143,
"learning_rate": 0.00016178092424504246,
"logits/chosen": -0.8004090785980225,
"logits/rejected": -0.8061416149139404,
"logps/chosen": -9.709630966186523,
"logps/rejected": -47.190277099609375,
"loss": 0.6974176168441772,
"memory(GiB)": 46.83,
"nll_loss": 0.5138447284698486,
"rewards/accuracies": 0.9375,
"rewards/chosen": -0.048886872828006744,
"rewards/margins": 3.236457109451294,
"rewards/rejected": -3.285344123840332,
"step": 401,
"train_speed(iter/s)": 0.005427
},
{
"epoch": 0.3243488565593404,
"grad_norm": 5.483085632324219,
"learning_rate": 0.00016157082147088593,
"logits/chosen": -0.8190602660179138,
"logits/rejected": -0.824268639087677,
"logps/chosen": -14.70582103729248,
"logps/rejected": -41.711917877197266,
"loss": 1.1310678720474243,
"memory(GiB)": 46.83,
"nll_loss": 0.6881631016731262,
"rewards/accuracies": 0.8125,
"rewards/chosen": 0.03247120603919029,
"rewards/margins": 2.756627321243286,
"rewards/rejected": -2.724156141281128,
"step": 402,
"train_speed(iter/s)": 0.005427
},
{
"epoch": 0.3251556945109806,
"grad_norm": 4.824715614318848,
"learning_rate": 0.0001613602800433194,
"logits/chosen": -0.8436318039894104,
"logits/rejected": -0.8526687026023865,
"logps/chosen": -8.126108169555664,
"logps/rejected": -42.07024383544922,
"loss": 0.6571808457374573,
"memory(GiB)": 46.83,
"nll_loss": 0.4890969395637512,
"rewards/accuracies": 0.96875,
"rewards/chosen": 0.10289221256971359,
"rewards/margins": 2.9235923290252686,
"rewards/rejected": -2.8207004070281982,
"step": 403,
"train_speed(iter/s)": 0.005428
},
{
"epoch": 0.3259625324626207,
"grad_norm": 6.610788345336914,
"learning_rate": 0.00016114930146231827,
"logits/chosen": -0.8161177635192871,
"logits/rejected": -0.8242086172103882,
"logps/chosen": -12.218559265136719,
"logps/rejected": -44.647254943847656,
"loss": 0.6997122168540955,
"memory(GiB)": 46.83,
"nll_loss": 0.4584552049636841,
"rewards/accuracies": 0.875,
"rewards/chosen": -0.26513317227363586,
"rewards/margins": 2.8937909603118896,
"rewards/rejected": -3.158923864364624,
"step": 404,
"train_speed(iter/s)": 0.005428
},
{
"epoch": 0.32676937041426085,
"grad_norm": 2.9718236923217773,
"learning_rate": 0.0001609378872309723,
"logits/chosen": -0.766316831111908,
"logits/rejected": -0.7643468379974365,
"logps/chosen": -6.773965835571289,
"logps/rejected": -29.697847366333008,
"loss": 0.46833112835884094,
"memory(GiB)": 46.83,
"nll_loss": 0.2168104350566864,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.19758227467536926,
"rewards/margins": 2.3953795433044434,
"rewards/rejected": -2.1977975368499756,
"step": 405,
"train_speed(iter/s)": 0.005428
},
{
"epoch": 0.327576208365901,
"grad_norm": 5.874072551727295,
"learning_rate": 0.00016072603885547508,
"logits/chosen": -0.78830885887146,
"logits/rejected": -0.7853043079376221,
"logps/chosen": -11.376614570617676,
"logps/rejected": -30.687149047851562,
"loss": 0.7618173956871033,
"memory(GiB)": 46.83,
"nll_loss": 0.3364633023738861,
"rewards/accuracies": 0.78125,
"rewards/chosen": -0.12673895061016083,
"rewards/margins": 1.8598191738128662,
"rewards/rejected": -1.986557960510254,
"step": 406,
"train_speed(iter/s)": 0.005428
},
{
"epoch": 0.32838304631754117,
"grad_norm": 3.214999198913574,
"learning_rate": 0.00016051375784511312,
"logits/chosen": -0.7452774047851562,
"logits/rejected": -0.7576760649681091,
"logps/chosen": -6.296991348266602,
"logps/rejected": -37.21446228027344,
"loss": 0.5500832796096802,
"memory(GiB)": 46.83,
"nll_loss": 0.2983091473579407,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.16730837523937225,
"rewards/margins": 2.706336259841919,
"rewards/rejected": -2.539027690887451,
"step": 407,
"train_speed(iter/s)": 0.005428
},
{
"epoch": 0.32918988426918133,
"grad_norm": 3.2364044189453125,
"learning_rate": 0.00016030104571225522,
"logits/chosen": -0.8141746520996094,
"logits/rejected": -0.8147263526916504,
"logps/chosen": -8.27431583404541,
"logps/rejected": -27.03731918334961,
"loss": 0.6542465686798096,
"memory(GiB)": 46.83,
"nll_loss": 0.32871556282043457,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.20524322986602783,
"rewards/margins": 1.7059212923049927,
"rewards/rejected": -1.5006780624389648,
"step": 408,
"train_speed(iter/s)": 0.005428
},
{
"epoch": 0.32999672222082144,
"grad_norm": 4.386970043182373,
"learning_rate": 0.0001600879039723417,
"logits/chosen": -0.7278757095336914,
"logits/rejected": -0.7296465635299683,
"logps/chosen": -10.145583152770996,
"logps/rejected": -34.609405517578125,
"loss": 0.6105880737304688,
"memory(GiB)": 46.83,
"nll_loss": 0.36851969361305237,
"rewards/accuracies": 0.96875,
"rewards/chosen": 0.062060222029685974,
"rewards/margins": 2.2632784843444824,
"rewards/rejected": -2.2012181282043457,
"step": 409,
"train_speed(iter/s)": 0.005428
},
{
"epoch": 0.3308035601724616,
"grad_norm": 3.3711960315704346,
"learning_rate": 0.0001598743341438734,
"logits/chosen": -0.69020015001297,
"logits/rejected": -0.6957679986953735,
"logps/chosen": -10.575393676757812,
"logps/rejected": -32.856101989746094,
"loss": 0.6940324306488037,
"memory(GiB)": 46.83,
"nll_loss": 0.43308204412460327,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.3041924238204956,
"rewards/margins": 2.375181198120117,
"rewards/rejected": -2.070988893508911,
"step": 410,
"train_speed(iter/s)": 0.005429
},
{
"epoch": 0.33161039812410176,
"grad_norm": 3.1790573596954346,
"learning_rate": 0.00015966033774840127,
"logits/chosen": -0.7445316314697266,
"logits/rejected": -0.748544454574585,
"logps/chosen": -7.364559650421143,
"logps/rejected": -30.644813537597656,
"loss": 0.5010148882865906,
"memory(GiB)": 46.83,
"nll_loss": 0.2939934730529785,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.2668747305870056,
"rewards/margins": 2.051632881164551,
"rewards/rejected": -1.7847580909729004,
"step": 411,
"train_speed(iter/s)": 0.005429
},
{
"epoch": 0.3324172360757419,
"grad_norm": 5.062440395355225,
"learning_rate": 0.00015944591631051504,
"logits/chosen": -0.6655209064483643,
"logits/rejected": -0.6722307801246643,
"logps/chosen": -8.464452743530273,
"logps/rejected": -28.55743408203125,
"loss": 0.7590057849884033,
"memory(GiB)": 46.83,
"nll_loss": 0.41250795125961304,
"rewards/accuracies": 0.84375,
"rewards/chosen": 0.13860762119293213,
"rewards/margins": 1.7520344257354736,
"rewards/rejected": -1.613426923751831,
"step": 412,
"train_speed(iter/s)": 0.00543
},
{
"epoch": 0.3332240740273821,
"grad_norm": 2.3003089427948,
"learning_rate": 0.00015923107135783275,
"logits/chosen": -0.735182523727417,
"logits/rejected": -0.741850733757019,
"logps/chosen": -4.926098346710205,
"logps/rejected": -27.20798110961914,
"loss": 0.5019189715385437,
"memory(GiB)": 46.83,
"nll_loss": 0.22264572978019714,
"rewards/accuracies": 0.90625,
"rewards/chosen": 0.19852803647518158,
"rewards/margins": 1.7793362140655518,
"rewards/rejected": -1.580808162689209,
"step": 413,
"train_speed(iter/s)": 0.00543
},
{
"epoch": 0.33403091197902224,
"grad_norm": 2.761085271835327,
"learning_rate": 0.00015901580442098968,
"logits/chosen": -0.6879050135612488,
"logits/rejected": -0.6989721059799194,
"logps/chosen": -8.289688110351562,
"logps/rejected": -36.11437225341797,
"loss": 0.5515791773796082,
"memory(GiB)": 46.83,
"nll_loss": 0.359782874584198,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.35169073939323425,
"rewards/margins": 2.3315212726593018,
"rewards/rejected": -1.9798306226730347,
"step": 414,
"train_speed(iter/s)": 0.00543
},
{
"epoch": 0.33483774993066234,
"grad_norm": 2.9564995765686035,
"learning_rate": 0.00015880011703362748,
"logits/chosen": -0.7736977338790894,
"logits/rejected": -0.7791394591331482,
"logps/chosen": -11.907139778137207,
"logps/rejected": -30.767383575439453,
"loss": 0.5806700587272644,
"memory(GiB)": 46.83,
"nll_loss": 0.38372740149497986,
"rewards/accuracies": 0.96875,
"rewards/chosen": 0.4125119745731354,
"rewards/margins": 2.088625192642212,
"rewards/rejected": -1.6761131286621094,
"step": 415,
"train_speed(iter/s)": 0.00543
},
{
"epoch": 0.3356445878823025,
"grad_norm": 2.9187235832214355,
"learning_rate": 0.0001585840107323832,
"logits/chosen": -0.7161890864372253,
"logits/rejected": -0.7156458497047424,
"logps/chosen": -8.870182037353516,
"logps/rejected": -30.228370666503906,
"loss": 0.7012996077537537,
"memory(GiB)": 46.83,
"nll_loss": 0.3564344346523285,
"rewards/accuracies": 0.90625,
"rewards/chosen": 0.10954218357801437,
"rewards/margins": 2.018000364303589,
"rewards/rejected": -1.9084582328796387,
"step": 416,
"train_speed(iter/s)": 0.00543
},
{
"epoch": 0.33645142583394266,
"grad_norm": 5.864604473114014,
"learning_rate": 0.00015836748705687841,
"logits/chosen": -0.7383227348327637,
"logits/rejected": -0.7456459999084473,
"logps/chosen": -7.744223594665527,
"logps/rejected": -38.64203643798828,
"loss": 0.5262930393218994,
"memory(GiB)": 46.83,
"nll_loss": 0.3058444857597351,
"rewards/accuracies": 0.96875,
"rewards/chosen": 0.17473873496055603,
"rewards/margins": 2.6876578330993652,
"rewards/rejected": -2.5129189491271973,
"step": 417,
"train_speed(iter/s)": 0.005431
},
{
"epoch": 0.3372582637855828,
"grad_norm": 9.024547576904297,
"learning_rate": 0.00015815054754970831,
"logits/chosen": -0.7634251117706299,
"logits/rejected": -0.7683747410774231,
"logps/chosen": -10.462536811828613,
"logps/rejected": -31.69692039489746,
"loss": 0.9514245986938477,
"memory(GiB)": 46.83,
"nll_loss": 0.6364089250564575,
"rewards/accuracies": 0.90625,
"rewards/chosen": 0.21211130917072296,
"rewards/margins": 2.214094877243042,
"rewards/rejected": -2.001983642578125,
"step": 418,
"train_speed(iter/s)": 0.005431
},
{
"epoch": 0.338065101737223,
"grad_norm": 8.62049388885498,
"learning_rate": 0.00015793319375643052,
"logits/chosen": -0.7581362724304199,
"logits/rejected": -0.7588805556297302,
"logps/chosen": -7.701593399047852,
"logps/rejected": -35.039794921875,
"loss": 0.46434247493743896,
"memory(GiB)": 46.83,
"nll_loss": 0.32877326011657715,
"rewards/accuracies": 0.96875,
"rewards/chosen": 0.22201837599277496,
"rewards/margins": 2.5157957077026367,
"rewards/rejected": -2.2937769889831543,
"step": 419,
"train_speed(iter/s)": 0.005431
},
{
"epoch": 0.3388719396888631,
"grad_norm": 6.575305938720703,
"learning_rate": 0.00015771542722555423,
"logits/chosen": -0.7857352495193481,
"logits/rejected": -0.7996398210525513,
"logps/chosen": -10.29336166381836,
"logps/rejected": -46.0968017578125,
"loss": 0.738344669342041,
"memory(GiB)": 46.83,
"nll_loss": 0.45971018075942993,
"rewards/accuracies": 0.90625,
"rewards/chosen": 0.021582117304205894,
"rewards/margins": 2.711317777633667,
"rewards/rejected": -2.6897356510162354,
"step": 420,
"train_speed(iter/s)": 0.005431
},
{
"epoch": 0.33967877764050325,
"grad_norm": 1.8250871896743774,
"learning_rate": 0.00015749724950852909,
"logits/chosen": -0.8029757738113403,
"logits/rejected": -0.803418755531311,
"logps/chosen": -8.469568252563477,
"logps/rejected": -41.49656295776367,
"loss": 0.4241314232349396,
"memory(GiB)": 46.83,
"nll_loss": 0.2885726988315582,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.14934808015823364,
"rewards/margins": 3.204773187637329,
"rewards/rejected": -3.0554254055023193,
"step": 421,
"train_speed(iter/s)": 0.005431
},
{
"epoch": 0.3404856155921434,
"grad_norm": 7.909032821655273,
"learning_rate": 0.00015727866215973425,
"logits/chosen": -0.8152115941047668,
"logits/rejected": -0.8257274627685547,
"logps/chosen": -8.088623046875,
"logps/rejected": -48.481143951416016,
"loss": 0.6303491592407227,
"memory(GiB)": 46.83,
"nll_loss": 0.3295513391494751,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.07966871559619904,
"rewards/margins": 3.391120672225952,
"rewards/rejected": -3.3114516735076904,
"step": 422,
"train_speed(iter/s)": 0.005431
},
{
"epoch": 0.34129245354378357,
"grad_norm": 5.323256015777588,
"learning_rate": 0.00015705966673646723,
"logits/chosen": -0.8351114392280579,
"logits/rejected": -0.8382234573364258,
"logps/chosen": -8.482909202575684,
"logps/rejected": -37.57075881958008,
"loss": 0.6785515546798706,
"memory(GiB)": 46.83,
"nll_loss": 0.363737553358078,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.1108720526099205,
"rewards/margins": 2.615013837814331,
"rewards/rejected": -2.5041418075561523,
"step": 423,
"train_speed(iter/s)": 0.005431
},
{
"epoch": 0.34209929149542373,
"grad_norm": 27.7071475982666,
"learning_rate": 0.00015684026479893272,
"logits/chosen": -0.8173145651817322,
"logits/rejected": -0.8212793469429016,
"logps/chosen": -15.243718147277832,
"logps/rejected": -35.84337615966797,
"loss": 0.9820355176925659,
"memory(GiB)": 46.83,
"nll_loss": 0.5321431756019592,
"rewards/accuracies": 0.78125,
"rewards/chosen": -0.15343250334262848,
"rewards/margins": 2.1440441608428955,
"rewards/rejected": -2.2974765300750732,
"step": 424,
"train_speed(iter/s)": 0.005431
},
{
"epoch": 0.3429061294470639,
"grad_norm": 2.558488368988037,
"learning_rate": 0.00015662045791023173,
"logits/chosen": -0.7981111407279968,
"logits/rejected": -0.804236888885498,
"logps/chosen": -12.458770751953125,
"logps/rejected": -38.74690246582031,
"loss": 0.5468552708625793,
"memory(GiB)": 46.83,
"nll_loss": 0.40575528144836426,
"rewards/accuracies": 0.96875,
"rewards/chosen": 0.3049697279930115,
"rewards/margins": 2.893904685974121,
"rewards/rejected": -2.588935375213623,
"step": 425,
"train_speed(iter/s)": 0.005432
},
{
"epoch": 0.343712967398704,
"grad_norm": 11.186711311340332,
"learning_rate": 0.00015640024763635015,
"logits/chosen": -0.8168637156486511,
"logits/rejected": -0.8147194385528564,
"logps/chosen": -18.96175193786621,
"logps/rejected": -30.127038955688477,
"loss": 1.35488760471344,
"memory(GiB)": 46.83,
"nll_loss": 0.6938337683677673,
"rewards/accuracies": 0.75,
"rewards/chosen": -0.32947003841400146,
"rewards/margins": 1.8565242290496826,
"rewards/rejected": -2.1859941482543945,
"step": 426,
"train_speed(iter/s)": 0.005432
},
{
"epoch": 0.34451980535034415,
"grad_norm": 2.7602322101593018,
"learning_rate": 0.00015617963554614782,
"logits/chosen": -0.7925236225128174,
"logits/rejected": -0.8042585253715515,
"logps/chosen": -7.885419845581055,
"logps/rejected": -41.48836135864258,
"loss": 0.5029093027114868,
"memory(GiB)": 46.83,
"nll_loss": 0.3265308141708374,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.19351695477962494,
"rewards/margins": 3.003077507019043,
"rewards/rejected": -2.809560537338257,
"step": 427,
"train_speed(iter/s)": 0.005433
},
{
"epoch": 0.3453266433019843,
"grad_norm": 2.7690954208374023,
"learning_rate": 0.00015595862321134723,
"logits/chosen": -0.801167368888855,
"logits/rejected": -0.8079819083213806,
"logps/chosen": -11.006603240966797,
"logps/rejected": -47.515464782714844,
"loss": 0.5393511652946472,
"memory(GiB)": 46.83,
"nll_loss": 0.357557088136673,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.09760009497404099,
"rewards/margins": 3.3984105587005615,
"rewards/rejected": -3.3008105754852295,
"step": 428,
"train_speed(iter/s)": 0.005433
},
{
"epoch": 0.3461334812536245,
"grad_norm": 3.378408432006836,
"learning_rate": 0.00015573721220652243,
"logits/chosen": -0.7705251574516296,
"logits/rejected": -0.7756682634353638,
"logps/chosen": -7.106504440307617,
"logps/rejected": -38.38644790649414,
"loss": 0.45007073879241943,
"memory(GiB)": 46.83,
"nll_loss": 0.2939262390136719,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.2970801591873169,
"rewards/margins": 2.9060657024383545,
"rewards/rejected": -2.608985424041748,
"step": 429,
"train_speed(iter/s)": 0.005433
},
{
"epoch": 0.34694031920526464,
"grad_norm": 11.245018005371094,
"learning_rate": 0.0001555154041090876,
"logits/chosen": -0.7640025019645691,
"logits/rejected": -0.7694700360298157,
"logps/chosen": -7.503448486328125,
"logps/rejected": -29.179779052734375,
"loss": 0.6581162214279175,
"memory(GiB)": 46.83,
"nll_loss": 0.3762749135494232,
"rewards/accuracies": 0.90625,
"rewards/chosen": 0.18421027064323425,
"rewards/margins": 2.1600494384765625,
"rewards/rejected": -1.9758392572402954,
"step": 430,
"train_speed(iter/s)": 0.005433
},
{
"epoch": 0.34774715715690474,
"grad_norm": 4.24967098236084,
"learning_rate": 0.0001552932004992861,
"logits/chosen": -0.7261820435523987,
"logits/rejected": -0.7354370355606079,
"logps/chosen": -8.89859676361084,
"logps/rejected": -43.472408294677734,
"loss": 0.5466022491455078,
"memory(GiB)": 46.83,
"nll_loss": 0.2866482138633728,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.21286547183990479,
"rewards/margins": 3.0320310592651367,
"rewards/rejected": -2.8191657066345215,
"step": 431,
"train_speed(iter/s)": 0.005433
},
{
"epoch": 0.3485539951085449,
"grad_norm": 17.65904998779297,
"learning_rate": 0.00015507060296017896,
"logits/chosen": -0.7059640884399414,
"logits/rejected": -0.7113645076751709,
"logps/chosen": -15.478120803833008,
"logps/rejected": -38.02043914794922,
"loss": 0.9082990288734436,
"memory(GiB)": 46.83,
"nll_loss": 0.5757866501808167,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.15995851159095764,
"rewards/margins": 2.8075268268585205,
"rewards/rejected": -2.6475682258605957,
"step": 432,
"train_speed(iter/s)": 0.005432
},
{
"epoch": 0.34936083306018506,
"grad_norm": 13.476463317871094,
"learning_rate": 0.00015484761307763383,
"logits/chosen": -0.700376033782959,
"logits/rejected": -0.7011431455612183,
"logps/chosen": -9.81491470336914,
"logps/rejected": -33.46759796142578,
"loss": 0.7563650608062744,
"memory(GiB)": 46.83,
"nll_loss": 0.5197194814682007,
"rewards/accuracies": 0.96875,
"rewards/chosen": 0.14740222692489624,
"rewards/margins": 2.482841730117798,
"rewards/rejected": -2.335439682006836,
"step": 433,
"train_speed(iter/s)": 0.005432
},
{
"epoch": 0.3501676710118252,
"grad_norm": 2.2564306259155273,
"learning_rate": 0.00015462423244031346,
"logits/chosen": -0.7145711183547974,
"logits/rejected": -0.7142253518104553,
"logps/chosen": -6.049681663513184,
"logps/rejected": -40.261722564697266,
"loss": 0.39624738693237305,
"memory(GiB)": 46.83,
"nll_loss": 0.2778511047363281,
"rewards/accuracies": 0.96875,
"rewards/chosen": 0.3084055185317993,
"rewards/margins": 3.100196361541748,
"rewards/rejected": -2.79179048538208,
"step": 434,
"train_speed(iter/s)": 0.005433
},
{
"epoch": 0.3509745089634654,
"grad_norm": 3.1633989810943604,
"learning_rate": 0.00015440046263966446,
"logits/chosen": -0.734190046787262,
"logits/rejected": -0.7362701296806335,
"logps/chosen": -7.924525737762451,
"logps/rejected": -30.7021484375,
"loss": 0.6030353307723999,
"memory(GiB)": 46.83,
"nll_loss": 0.3201526999473572,
"rewards/accuracies": 0.84375,
"rewards/chosen": 0.07075662910938263,
"rewards/margins": 1.9832499027252197,
"rewards/rejected": -1.9124932289123535,
"step": 435,
"train_speed(iter/s)": 0.005432
},
{
"epoch": 0.35178134691510554,
"grad_norm": 9.708440780639648,
"learning_rate": 0.00015417630526990615,
"logits/chosen": -0.7230247855186462,
"logits/rejected": -0.7281976342201233,
"logps/chosen": -7.0415544509887695,
"logps/rejected": -37.40678787231445,
"loss": 0.9090821743011475,
"memory(GiB)": 46.83,
"nll_loss": 0.6137229204177856,
"rewards/accuracies": 0.875,
"rewards/chosen": -0.017065048217773438,
"rewards/margins": 2.4000210762023926,
"rewards/rejected": -2.417086124420166,
"step": 436,
"train_speed(iter/s)": 0.005432
},
{
"epoch": 0.35258818486674565,
"grad_norm": 2.7294411659240723,
"learning_rate": 0.00015395176192801882,
"logits/chosen": -0.66111159324646,
"logits/rejected": -0.6679624319076538,
"logps/chosen": -10.94334602355957,
"logps/rejected": -39.744171142578125,
"loss": 0.558108925819397,
"memory(GiB)": 46.83,
"nll_loss": 0.3573530912399292,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.07710271328687668,
"rewards/margins": 2.2725815773010254,
"rewards/rejected": -2.195478916168213,
"step": 437,
"train_speed(iter/s)": 0.005433
},
{
"epoch": 0.3533950228183858,
"grad_norm": 2.2957513332366943,
"learning_rate": 0.00015372683421373268,
"logits/chosen": -0.7276008129119873,
"logits/rejected": -0.733298659324646,
"logps/chosen": -9.018013954162598,
"logps/rejected": -39.43022155761719,
"loss": 0.5581925511360168,
"memory(GiB)": 46.83,
"nll_loss": 0.35958534479141235,
"rewards/accuracies": 0.96875,
"rewards/chosen": 0.3142196834087372,
"rewards/margins": 2.4971206188201904,
"rewards/rejected": -2.182900905609131,
"step": 438,
"train_speed(iter/s)": 0.005433
},
{
"epoch": 0.35420186077002597,
"grad_norm": 2.652552604675293,
"learning_rate": 0.0001535015237295164,
"logits/chosen": -0.7248872518539429,
"logits/rejected": -0.728070080280304,
"logps/chosen": -9.407607078552246,
"logps/rejected": -35.77960205078125,
"loss": 0.7365480065345764,
"memory(GiB)": 46.83,
"nll_loss": 0.5000982880592346,
"rewards/accuracies": 0.90625,
"rewards/chosen": 0.21720585227012634,
"rewards/margins": 2.5895490646362305,
"rewards/rejected": -2.372343063354492,
"step": 439,
"train_speed(iter/s)": 0.005433
},
{
"epoch": 0.3550086987216661,
"grad_norm": 16.293540954589844,
"learning_rate": 0.00015327583208056553,
"logits/chosen": -0.7425347566604614,
"logits/rejected": -0.7465611100196838,
"logps/chosen": -6.231223106384277,
"logps/rejected": -33.581016540527344,
"loss": 0.5848970413208008,
"memory(GiB)": 46.83,
"nll_loss": 0.3383205533027649,
"rewards/accuracies": 0.90625,
"rewards/chosen": 0.22708339989185333,
"rewards/margins": 2.6124606132507324,
"rewards/rejected": -2.3853771686553955,
"step": 440,
"train_speed(iter/s)": 0.005433
},
{
"epoch": 0.3558155366733063,
"grad_norm": 7.516906261444092,
"learning_rate": 0.00015304976087479128,
"logits/chosen": -0.7300995588302612,
"logits/rejected": -0.731682538986206,
"logps/chosen": -7.094137191772461,
"logps/rejected": -24.851308822631836,
"loss": 0.6824460625648499,
"memory(GiB)": 46.83,
"nll_loss": 0.28373995423316956,
"rewards/accuracies": 0.84375,
"rewards/chosen": 0.08390329778194427,
"rewards/margins": 1.636284351348877,
"rewards/rejected": -1.5523810386657715,
"step": 441,
"train_speed(iter/s)": 0.005433
},
{
"epoch": 0.35662237462494645,
"grad_norm": 5.410120487213135,
"learning_rate": 0.00015282331172280887,
"logits/chosen": -0.7709946036338806,
"logits/rejected": -0.778519868850708,
"logps/chosen": -14.137146949768066,
"logps/rejected": -39.00368881225586,
"loss": 1.1119240522384644,
"memory(GiB)": 46.83,
"nll_loss": 0.5970031023025513,
"rewards/accuracies": 0.6875,
"rewards/chosen": -0.0509246289730072,
"rewards/margins": 2.253941297531128,
"rewards/rejected": -2.304866075515747,
"step": 442,
"train_speed(iter/s)": 0.005432
},
{
"epoch": 0.35742921257658655,
"grad_norm": 2.6960244178771973,
"learning_rate": 0.0001525964862379263,
"logits/chosen": -0.7315975427627563,
"logits/rejected": -0.7369835376739502,
"logps/chosen": -5.271239280700684,
"logps/rejected": -27.497392654418945,
"loss": 0.5291019082069397,
"memory(GiB)": 46.83,
"nll_loss": 0.2573389708995819,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.2271825522184372,
"rewards/margins": 2.134850263595581,
"rewards/rejected": -1.907667636871338,
"step": 443,
"train_speed(iter/s)": 0.005433
},
{
"epoch": 0.3582360505282267,
"grad_norm": 3.0122978687286377,
"learning_rate": 0.0001523692860361325,
"logits/chosen": -0.7649153470993042,
"logits/rejected": -0.7727422118186951,
"logps/chosen": -12.25500774383545,
"logps/rejected": -40.75428771972656,
"loss": 0.712749183177948,
"memory(GiB)": 46.83,
"nll_loss": 0.5094113349914551,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.25550708174705505,
"rewards/margins": 2.767303466796875,
"rewards/rejected": -2.511796474456787,
"step": 444,
"train_speed(iter/s)": 0.005433
},
{
"epoch": 0.3590428884798669,
"grad_norm": 3.1875035762786865,
"learning_rate": 0.00015214171273608614,
"logits/chosen": -0.7680434584617615,
"logits/rejected": -0.773673951625824,
"logps/chosen": -10.56375503540039,
"logps/rejected": -46.056488037109375,
"loss": 0.5614004731178284,
"memory(GiB)": 46.83,
"nll_loss": 0.3534352779388428,
"rewards/accuracies": 0.90625,
"rewards/chosen": 0.05404359847307205,
"rewards/margins": 3.072054386138916,
"rewards/rejected": -3.0180106163024902,
"step": 445,
"train_speed(iter/s)": 0.005433
},
{
"epoch": 0.35984972643150703,
"grad_norm": 2.6271064281463623,
"learning_rate": 0.00015191376795910404,
"logits/chosen": -0.7706547975540161,
"logits/rejected": -0.7753493189811707,
"logps/chosen": -10.181999206542969,
"logps/rejected": -36.871089935302734,
"loss": 0.7368884682655334,
"memory(GiB)": 46.83,
"nll_loss": 0.5453473925590515,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.20240941643714905,
"rewards/margins": 2.66059947013855,
"rewards/rejected": -2.4581899642944336,
"step": 446,
"train_speed(iter/s)": 0.005433
},
{
"epoch": 0.3606565643831472,
"grad_norm": 2.9951157569885254,
"learning_rate": 0.0001516854533291494,
"logits/chosen": -0.7616828083992004,
"logits/rejected": -0.7694711685180664,
"logps/chosen": -7.686607837677002,
"logps/rejected": -41.72177505493164,
"loss": 0.5836425423622131,
"memory(GiB)": 46.83,
"nll_loss": 0.33194291591644287,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.03806695714592934,
"rewards/margins": 2.7966089248657227,
"rewards/rejected": -2.75854229927063,
"step": 447,
"train_speed(iter/s)": 0.005433
},
{
"epoch": 0.3614634023347873,
"grad_norm": 6.78880500793457,
"learning_rate": 0.00015145677047282056,
"logits/chosen": -0.768774151802063,
"logits/rejected": -0.7738460302352905,
"logps/chosen": -7.29971170425415,
"logps/rejected": -23.89675521850586,
"loss": 0.7116811871528625,
"memory(GiB)": 46.83,
"nll_loss": 0.363356351852417,
"rewards/accuracies": 0.8125,
"rewards/chosen": 0.2802785038948059,
"rewards/margins": 1.6327687501907349,
"rewards/rejected": -1.3524901866912842,
"step": 448,
"train_speed(iter/s)": 0.005433
},
{
"epoch": 0.36227024028642746,
"grad_norm": 2.428403854370117,
"learning_rate": 0.00015122772101933913,
"logits/chosen": -0.713983416557312,
"logits/rejected": -0.719916582107544,
"logps/chosen": -9.733499526977539,
"logps/rejected": -38.1261100769043,
"loss": 0.5839467644691467,
"memory(GiB)": 46.83,
"nll_loss": 0.3204602897167206,
"rewards/accuracies": 0.96875,
"rewards/chosen": 0.18539123237133026,
"rewards/margins": 2.5533952713012695,
"rewards/rejected": -2.368004083633423,
"step": 449,
"train_speed(iter/s)": 0.005433
},
{
"epoch": 0.3630770782380676,
"grad_norm": 2.1015625,
"learning_rate": 0.00015099830660053848,
"logits/chosen": -0.6917126774787903,
"logits/rejected": -0.704102098941803,
"logps/chosen": -6.558714866638184,
"logps/rejected": -44.186180114746094,
"loss": 0.42745494842529297,
"memory(GiB)": 46.83,
"nll_loss": 0.25199466943740845,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.26587462425231934,
"rewards/margins": 3.109530210494995,
"rewards/rejected": -2.8436553478240967,
"step": 450,
"train_speed(iter/s)": 0.005434
},
{
"epoch": 0.3638839161897078,
"grad_norm": 7.269819736480713,
"learning_rate": 0.00015076852885085223,
"logits/chosen": -0.685967206954956,
"logits/rejected": -0.6903418898582458,
"logps/chosen": -8.861746788024902,
"logps/rejected": -31.555381774902344,
"loss": 0.6940796375274658,
"memory(GiB)": 46.83,
"nll_loss": 0.4090823233127594,
"rewards/accuracies": 0.90625,
"rewards/chosen": 0.1664535403251648,
"rewards/margins": 2.2505595684051514,
"rewards/rejected": -2.0841057300567627,
"step": 451,
"train_speed(iter/s)": 0.005433
},
{
"epoch": 0.36469075414134794,
"grad_norm": 7.895684719085693,
"learning_rate": 0.00015053838940730244,
"logits/chosen": -0.7125756740570068,
"logits/rejected": -0.7196484804153442,
"logps/chosen": -7.934318542480469,
"logps/rejected": -32.33711624145508,
"loss": 0.9927008152008057,
"memory(GiB)": 46.83,
"nll_loss": 0.5683808326721191,
"rewards/accuracies": 0.8125,
"rewards/chosen": 0.047097161412239075,
"rewards/margins": 1.7799056768417358,
"rewards/rejected": -1.7328083515167236,
"step": 452,
"train_speed(iter/s)": 0.005433
},
{
"epoch": 0.3654975920929881,
"grad_norm": 2.145096778869629,
"learning_rate": 0.00015030788990948797,
"logits/chosen": -0.7455975413322449,
"logits/rejected": -0.748679518699646,
"logps/chosen": -8.74243450164795,
"logps/rejected": -32.179813385009766,
"loss": 0.5566769242286682,
"memory(GiB)": 46.83,
"nll_loss": 0.35227102041244507,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.20155397057533264,
"rewards/margins": 2.3393735885620117,
"rewards/rejected": -2.137819766998291,
"step": 453,
"train_speed(iter/s)": 0.005433
},
{
"epoch": 0.3663044300446282,
"grad_norm": 12.220844268798828,
"learning_rate": 0.00015007703199957297,
"logits/chosen": -0.6872383952140808,
"logits/rejected": -0.6934896111488342,
"logps/chosen": -12.1061429977417,
"logps/rejected": -36.80299377441406,
"loss": 0.761122465133667,
"memory(GiB)": 46.83,
"nll_loss": 0.4497636556625366,
"rewards/accuracies": 0.84375,
"rewards/chosen": 0.06379126012325287,
"rewards/margins": 2.3671936988830566,
"rewards/rejected": -2.3034024238586426,
"step": 454,
"train_speed(iter/s)": 0.005433
},
{
"epoch": 0.36711126799626836,
"grad_norm": 1.585224986076355,
"learning_rate": 0.00014984581732227492,
"logits/chosen": -0.7161681652069092,
"logits/rejected": -0.7274316549301147,
"logps/chosen": -8.679915428161621,
"logps/rejected": -39.74371337890625,
"loss": 0.45609888434410095,
"memory(GiB)": 46.83,
"nll_loss": 0.3443814516067505,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.48159369826316833,
"rewards/margins": 3.0060887336730957,
"rewards/rejected": -2.5244951248168945,
"step": 455,
"train_speed(iter/s)": 0.005433
},
{
"epoch": 0.3679181059479085,
"grad_norm": 5.118838310241699,
"learning_rate": 0.00014961424752485308,
"logits/chosen": -0.7437467575073242,
"logits/rejected": -0.754626989364624,
"logps/chosen": -11.635477066040039,
"logps/rejected": -46.820133209228516,
"loss": 0.9505035281181335,
"memory(GiB)": 46.83,
"nll_loss": 0.6606087684631348,
"rewards/accuracies": 0.875,
"rewards/chosen": -0.12925539910793304,
"rewards/margins": 2.922895908355713,
"rewards/rejected": -3.0521514415740967,
"step": 456,
"train_speed(iter/s)": 0.005433
},
{
"epoch": 0.3687249438995487,
"grad_norm": 6.369676113128662,
"learning_rate": 0.00014938232425709672,
"logits/chosen": -0.7123354077339172,
"logits/rejected": -0.7202441692352295,
"logps/chosen": -7.666382312774658,
"logps/rejected": -39.06452178955078,
"loss": 0.5345906019210815,
"memory(GiB)": 46.83,
"nll_loss": 0.288968950510025,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.09636388719081879,
"rewards/margins": 2.4988255500793457,
"rewards/rejected": -2.4024617671966553,
"step": 457,
"train_speed(iter/s)": 0.005434
},
{
"epoch": 0.36953178185118885,
"grad_norm": 4.273453712463379,
"learning_rate": 0.00014915004917131344,
"logits/chosen": -0.7618826627731323,
"logits/rejected": -0.758380115032196,
"logps/chosen": -9.670495986938477,
"logps/rejected": -27.89179039001465,
"loss": 0.6546672582626343,
"memory(GiB)": 46.83,
"nll_loss": 0.41434964537620544,
"rewards/accuracies": 0.90625,
"rewards/chosen": 0.03314019367098808,
"rewards/margins": 2.1142916679382324,
"rewards/rejected": -2.081151247024536,
"step": 458,
"train_speed(iter/s)": 0.005434
},
{
"epoch": 0.37033861980282895,
"grad_norm": 1.8925552368164062,
"learning_rate": 0.0001489174239223172,
"logits/chosen": -0.7534856200218201,
"logits/rejected": -0.7552649974822998,
"logps/chosen": -7.762975215911865,
"logps/rejected": -33.306766510009766,
"loss": 0.44340604543685913,
"memory(GiB)": 46.83,
"nll_loss": 0.23383133113384247,
"rewards/accuracies": 0.90625,
"rewards/chosen": 0.27828943729400635,
"rewards/margins": 2.5259461402893066,
"rewards/rejected": -2.247657060623169,
"step": 459,
"train_speed(iter/s)": 0.005434
},
{
"epoch": 0.3711454577544691,
"grad_norm": 3.5424697399139404,
"learning_rate": 0.00014868445016741677,
"logits/chosen": -0.7251965403556824,
"logits/rejected": -0.7256088852882385,
"logps/chosen": -13.685113906860352,
"logps/rejected": -30.76580238342285,
"loss": 0.8778742551803589,
"memory(GiB)": 46.83,
"nll_loss": 0.578425407409668,
"rewards/accuracies": 0.90625,
"rewards/chosen": 0.04395178705453873,
"rewards/margins": 2.217789649963379,
"rewards/rejected": -2.173837900161743,
"step": 460,
"train_speed(iter/s)": 0.005434
},
{
"epoch": 0.37195229570610927,
"grad_norm": 4.210732460021973,
"learning_rate": 0.00014845112956640369,
"logits/chosen": -0.7375807166099548,
"logits/rejected": -0.7479276657104492,
"logps/chosen": -10.048831939697266,
"logps/rejected": -41.19210433959961,
"loss": 0.5977764129638672,
"memory(GiB)": 46.83,
"nll_loss": 0.3318694531917572,
"rewards/accuracies": 0.84375,
"rewards/chosen": 0.19474266469478607,
"rewards/margins": 3.0025835037231445,
"rewards/rejected": -2.8078413009643555,
"step": 461,
"train_speed(iter/s)": 0.005434
},
{
"epoch": 0.37275913365774943,
"grad_norm": 4.395127296447754,
"learning_rate": 0.00014821746378154062,
"logits/chosen": -0.6776711940765381,
"logits/rejected": -0.6841428279876709,
"logps/chosen": -6.95946741104126,
"logps/rejected": -36.13311767578125,
"loss": 0.4928424060344696,
"memory(GiB)": 46.83,
"nll_loss": 0.30789151787757874,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.32969141006469727,
"rewards/margins": 2.7516045570373535,
"rewards/rejected": -2.4219131469726562,
"step": 462,
"train_speed(iter/s)": 0.005434
},
{
"epoch": 0.3735659716093896,
"grad_norm": 3.365333318710327,
"learning_rate": 0.00014798345447754948,
"logits/chosen": -0.7575942277908325,
"logits/rejected": -0.7648032903671265,
"logps/chosen": -8.037223815917969,
"logps/rejected": -43.406375885009766,
"loss": 0.5700507164001465,
"memory(GiB)": 46.83,
"nll_loss": 0.37956228852272034,
"rewards/accuracies": 0.96875,
"rewards/chosen": 0.2864043116569519,
"rewards/margins": 3.18467116355896,
"rewards/rejected": -2.8982667922973633,
"step": 463,
"train_speed(iter/s)": 0.005434
},
{
"epoch": 0.37437280956102975,
"grad_norm": 7.311818599700928,
"learning_rate": 0.0001477491033215994,
"logits/chosen": -0.6993564963340759,
"logits/rejected": -0.7100475430488586,
"logps/chosen": -11.119054794311523,
"logps/rejected": -40.00886917114258,
"loss": 1.3310893774032593,
"memory(GiB)": 46.83,
"nll_loss": 0.6867990493774414,
"rewards/accuracies": 0.84375,
"rewards/chosen": -0.33331215381622314,
"rewards/margins": 2.3917033672332764,
"rewards/rejected": -2.725015640258789,
"step": 464,
"train_speed(iter/s)": 0.005434
},
{
"epoch": 0.37517964751266986,
"grad_norm": 10.936890602111816,
"learning_rate": 0.00014751441198329523,
"logits/chosen": -0.6920858025550842,
"logits/rejected": -0.6920123100280762,
"logps/chosen": -14.5137939453125,
"logps/rejected": -37.997467041015625,
"loss": 0.9086753726005554,
"memory(GiB)": 46.83,
"nll_loss": 0.5238281488418579,
"rewards/accuracies": 0.875,
"rewards/chosen": -0.10487417131662369,
"rewards/margins": 2.618326187133789,
"rewards/rejected": -2.7232000827789307,
"step": 465,
"train_speed(iter/s)": 0.005434
},
{
"epoch": 0.37598648546431,
"grad_norm": 15.677000045776367,
"learning_rate": 0.0001472793821346652,
"logits/chosen": -0.6896384954452515,
"logits/rejected": -0.6940050721168518,
"logps/chosen": -10.987081527709961,
"logps/rejected": -40.3748779296875,
"loss": 0.6646585464477539,
"memory(GiB)": 46.83,
"nll_loss": 0.45032551884651184,
"rewards/accuracies": 0.90625,
"rewards/chosen": 0.16333404183387756,
"rewards/margins": 2.996572494506836,
"rewards/rejected": -2.8332386016845703,
"step": 466,
"train_speed(iter/s)": 0.005434
},
{
"epoch": 0.3767933234159502,
"grad_norm": 4.351585865020752,
"learning_rate": 0.00014704401545014925,
"logits/chosen": -0.7135500311851501,
"logits/rejected": -0.7152791023254395,
"logps/chosen": -9.104679107666016,
"logps/rejected": -35.246437072753906,
"loss": 0.7736812829971313,
"memory(GiB)": 46.83,
"nll_loss": 0.42992913722991943,
"rewards/accuracies": 0.90625,
"rewards/chosen": 0.11151327192783356,
"rewards/margins": 2.5536930561065674,
"rewards/rejected": -2.4421796798706055,
"step": 467,
"train_speed(iter/s)": 0.005434
},
{
"epoch": 0.37760016136759034,
"grad_norm": 5.113152980804443,
"learning_rate": 0.00014680831360658713,
"logits/chosen": -0.631149172782898,
"logits/rejected": -0.6411234140396118,
"logps/chosen": -9.986248016357422,
"logps/rejected": -47.841514587402344,
"loss": 0.6793885231018066,
"memory(GiB)": 46.83,
"nll_loss": 0.4218906760215759,
"rewards/accuracies": 0.84375,
"rewards/chosen": 0.06469957530498505,
"rewards/margins": 3.1944708824157715,
"rewards/rejected": -3.1297712326049805,
"step": 468,
"train_speed(iter/s)": 0.005434
},
{
"epoch": 0.3784069993192305,
"grad_norm": 5.426872730255127,
"learning_rate": 0.00014657227828320635,
"logits/chosen": -0.6784893274307251,
"logits/rejected": -0.6818794012069702,
"logps/chosen": -11.335710525512695,
"logps/rejected": -35.59712219238281,
"loss": 0.751977264881134,
"memory(GiB)": 46.83,
"nll_loss": 0.4554847776889801,
"rewards/accuracies": 0.84375,
"rewards/chosen": 0.10514962673187256,
"rewards/margins": 2.4257240295410156,
"rewards/rejected": -2.3205745220184326,
"step": 469,
"train_speed(iter/s)": 0.005435
},
{
"epoch": 0.3792138372708706,
"grad_norm": 3.7496237754821777,
"learning_rate": 0.0001463359111616103,
"logits/chosen": -0.659194827079773,
"logits/rejected": -0.6669769883155823,
"logps/chosen": -14.53132438659668,
"logps/rejected": -37.95043182373047,
"loss": 0.8416832089424133,
"memory(GiB)": 46.83,
"nll_loss": 0.547598659992218,
"rewards/accuracies": 0.84375,
"rewards/chosen": 0.08502380549907684,
"rewards/margins": 2.0641098022460938,
"rewards/rejected": -1.9790860414505005,
"step": 470,
"train_speed(iter/s)": 0.005435
},
{
"epoch": 0.38002067522251076,
"grad_norm": 2.0352225303649902,
"learning_rate": 0.0001460992139257661,
"logits/chosen": -0.6402337551116943,
"logits/rejected": -0.6429924964904785,
"logps/chosen": -5.608386039733887,
"logps/rejected": -33.254302978515625,
"loss": 0.3905201256275177,
"memory(GiB)": 46.83,
"nll_loss": 0.2183467447757721,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.20369279384613037,
"rewards/margins": 2.4486987590789795,
"rewards/rejected": -2.2450060844421387,
"step": 471,
"train_speed(iter/s)": 0.005435
},
{
"epoch": 0.3808275131741509,
"grad_norm": 5.74570894241333,
"learning_rate": 0.00014586218826199285,
"logits/chosen": -0.643539547920227,
"logits/rejected": -0.6555419564247131,
"logps/chosen": -10.091498374938965,
"logps/rejected": -36.76713562011719,
"loss": 0.6122481226921082,
"memory(GiB)": 46.83,
"nll_loss": 0.4549962282180786,
"rewards/accuracies": 0.96875,
"rewards/chosen": 0.24730682373046875,
"rewards/margins": 2.464998722076416,
"rewards/rejected": -2.2176918983459473,
"step": 472,
"train_speed(iter/s)": 0.005435
},
{
"epoch": 0.3816343511257911,
"grad_norm": 2.2472074031829834,
"learning_rate": 0.00014562483585894945,
"logits/chosen": -0.6934607028961182,
"logits/rejected": -0.6990819573402405,
"logps/chosen": -8.899802207946777,
"logps/rejected": -36.28021240234375,
"loss": 0.5312250852584839,
"memory(GiB)": 46.83,
"nll_loss": 0.31914129853248596,
"rewards/accuracies": 0.90625,
"rewards/chosen": 0.30887866020202637,
"rewards/margins": 2.640252113342285,
"rewards/rejected": -2.3313732147216797,
"step": 473,
"train_speed(iter/s)": 0.005435
},
{
"epoch": 0.38244118907743124,
"grad_norm": 10.326676368713379,
"learning_rate": 0.0001453871584076226,
"logits/chosen": -0.6442930102348328,
"logits/rejected": -0.6484919786453247,
"logps/chosen": -9.037781715393066,
"logps/rejected": -27.98940658569336,
"loss": 0.7469712495803833,
"memory(GiB)": 46.83,
"nll_loss": 0.4642283320426941,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.17530076205730438,
"rewards/margins": 1.7467072010040283,
"rewards/rejected": -1.571406364440918,
"step": 474,
"train_speed(iter/s)": 0.005435
},
{
"epoch": 0.3832480270290714,
"grad_norm": 9.987951278686523,
"learning_rate": 0.00014514915760131483,
"logits/chosen": -0.7020606994628906,
"logits/rejected": -0.702151894569397,
"logps/chosen": -9.714710235595703,
"logps/rejected": -23.569639205932617,
"loss": 0.7522432208061218,
"memory(GiB)": 46.83,
"nll_loss": 0.40092915296554565,
"rewards/accuracies": 0.8125,
"rewards/chosen": 0.1317347288131714,
"rewards/margins": 1.5514979362487793,
"rewards/rejected": -1.4197630882263184,
"step": 475,
"train_speed(iter/s)": 0.005435
},
{
"epoch": 0.3840548649807115,
"grad_norm": 2.1257741451263428,
"learning_rate": 0.00014491083513563222,
"logits/chosen": -0.6923786401748657,
"logits/rejected": -0.6987132430076599,
"logps/chosen": -7.563580513000488,
"logps/rejected": -29.709890365600586,
"loss": 0.5339487195014954,
"memory(GiB)": 46.83,
"nll_loss": 0.31400057673454285,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.370953232049942,
"rewards/margins": 2.0969557762145996,
"rewards/rejected": -1.7260024547576904,
"step": 476,
"train_speed(iter/s)": 0.005435
},
{
"epoch": 0.38486170293235167,
"grad_norm": 3.4022998809814453,
"learning_rate": 0.00014467219270847265,
"logits/chosen": -0.6793309450149536,
"logits/rejected": -0.6822490692138672,
"logps/chosen": -8.713945388793945,
"logps/rejected": -35.1626091003418,
"loss": 0.5065045356750488,
"memory(GiB)": 46.83,
"nll_loss": 0.2830030620098114,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.1324760913848877,
"rewards/margins": 2.0448875427246094,
"rewards/rejected": -1.9124114513397217,
"step": 477,
"train_speed(iter/s)": 0.005435
},
{
"epoch": 0.38566854088399183,
"grad_norm": 3.169051170349121,
"learning_rate": 0.0001444332320200134,
"logits/chosen": -0.7434568405151367,
"logits/rejected": -0.7467195391654968,
"logps/chosen": -8.970917701721191,
"logps/rejected": -25.424684524536133,
"loss": 0.7533260583877563,
"memory(GiB)": 46.83,
"nll_loss": 0.3945104777812958,
"rewards/accuracies": 0.84375,
"rewards/chosen": 0.08574176579713821,
"rewards/margins": 1.5797266960144043,
"rewards/rejected": -1.4939846992492676,
"step": 478,
"train_speed(iter/s)": 0.005435
},
{
"epoch": 0.386475378835632,
"grad_norm": 3.456509828567505,
"learning_rate": 0.00014419395477269922,
"logits/chosen": -0.7100328207015991,
"logits/rejected": -0.7100369334220886,
"logps/chosen": -8.946069717407227,
"logps/rejected": -26.77371597290039,
"loss": 0.703390896320343,
"memory(GiB)": 46.83,
"nll_loss": 0.3992156982421875,
"rewards/accuracies": 0.90625,
"rewards/chosen": 0.23448720574378967,
"rewards/margins": 1.9379780292510986,
"rewards/rejected": -1.7034906148910522,
"step": 479,
"train_speed(iter/s)": 0.005436
},
{
"epoch": 0.38728221678727215,
"grad_norm": 2.8148579597473145,
"learning_rate": 0.00014395436267123016,
"logits/chosen": -0.7651592493057251,
"logits/rejected": -0.7705404758453369,
"logps/chosen": -9.789369583129883,
"logps/rejected": -32.379886627197266,
"loss": 0.6621928811073303,
"memory(GiB)": 46.83,
"nll_loss": 0.42258700728416443,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.3690515160560608,
"rewards/margins": 2.27026629447937,
"rewards/rejected": -1.9012147188186646,
"step": 480,
"train_speed(iter/s)": 0.005436
},
{
"epoch": 0.3880890547389123,
"grad_norm": 2.1083407402038574,
"learning_rate": 0.00014371445742254933,
"logits/chosen": -0.7674591541290283,
"logits/rejected": -0.7766936421394348,
"logps/chosen": -7.339907646179199,
"logps/rejected": -41.22381591796875,
"loss": 0.46437036991119385,
"memory(GiB)": 46.83,
"nll_loss": 0.32933878898620605,
"rewards/accuracies": 0.96875,
"rewards/chosen": 0.4231037497520447,
"rewards/margins": 2.872163772583008,
"rewards/rejected": -2.4490599632263184,
"step": 481,
"train_speed(iter/s)": 0.005436
},
{
"epoch": 0.3888958926905524,
"grad_norm": 9.479911804199219,
"learning_rate": 0.00014347424073583086,
"logits/chosen": -0.7989487648010254,
"logits/rejected": -0.8022449016571045,
"logps/chosen": -6.2405619621276855,
"logps/rejected": -35.935890197753906,
"loss": 0.4960899353027344,
"memory(GiB)": 46.83,
"nll_loss": 0.32181254029273987,
"rewards/accuracies": 0.90625,
"rewards/chosen": 0.3059425950050354,
"rewards/margins": 2.816394805908203,
"rewards/rejected": -2.5104520320892334,
"step": 482,
"train_speed(iter/s)": 0.005436
},
{
"epoch": 0.3897027306421926,
"grad_norm": 30.05691909790039,
"learning_rate": 0.00014323371432246773,
"logits/chosen": -0.7825378775596619,
"logits/rejected": -0.7933679819107056,
"logps/chosen": -7.802068710327148,
"logps/rejected": -29.27901840209961,
"loss": 0.8247991800308228,
"memory(GiB)": 46.83,
"nll_loss": 0.445316344499588,
"rewards/accuracies": 0.8125,
"rewards/chosen": 0.19992296397686005,
"rewards/margins": 1.4237523078918457,
"rewards/rejected": -1.2238292694091797,
"step": 483,
"train_speed(iter/s)": 0.005436
},
{
"epoch": 0.39050956859383273,
"grad_norm": 3.872990131378174,
"learning_rate": 0.00014299287989605943,
"logits/chosen": -0.7813780903816223,
"logits/rejected": -0.7811882495880127,
"logps/chosen": -9.697345733642578,
"logps/rejected": -30.960369110107422,
"loss": 0.5493797063827515,
"memory(GiB)": 46.83,
"nll_loss": 0.3628386855125427,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.29603177309036255,
"rewards/margins": 2.3790576457977295,
"rewards/rejected": -2.0830256938934326,
"step": 484,
"train_speed(iter/s)": 0.005436
},
{
"epoch": 0.3913164065454729,
"grad_norm": 12.008702278137207,
"learning_rate": 0.00014275173917239993,
"logits/chosen": -0.7886897325515747,
"logits/rejected": -0.7941228747367859,
"logps/chosen": -7.900599002838135,
"logps/rejected": -31.16321563720703,
"loss": 0.7939125895500183,
"memory(GiB)": 46.83,
"nll_loss": 0.45570316910743713,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.10572385787963867,
"rewards/margins": 1.8910467624664307,
"rewards/rejected": -1.785322904586792,
"step": 485,
"train_speed(iter/s)": 0.005437
},
{
"epoch": 0.39212324449711305,
"grad_norm": 5.970835208892822,
"learning_rate": 0.00014251029386946532,
"logits/chosen": -0.8634493350982666,
"logits/rejected": -0.8646601438522339,
"logps/chosen": -6.923543453216553,
"logps/rejected": -28.410593032836914,
"loss": 0.5631651282310486,
"memory(GiB)": 46.83,
"nll_loss": 0.31717023253440857,
"rewards/accuracies": 0.90625,
"rewards/chosen": 0.24359825253486633,
"rewards/margins": 2.0541610717773438,
"rewards/rejected": -1.8105626106262207,
"step": 486,
"train_speed(iter/s)": 0.005437
},
{
"epoch": 0.39293008244875316,
"grad_norm": 2.754620313644409,
"learning_rate": 0.00014226854570740168,
"logits/chosen": -0.8398474454879761,
"logits/rejected": -0.8498659133911133,
"logps/chosen": -7.03415584564209,
"logps/rejected": -40.334163665771484,
"loss": 0.4721854329109192,
"memory(GiB)": 46.83,
"nll_loss": 0.34017014503479004,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.16663886606693268,
"rewards/margins": 2.977405309677124,
"rewards/rejected": -2.8107664585113525,
"step": 487,
"train_speed(iter/s)": 0.005437
},
{
"epoch": 0.3937369204003933,
"grad_norm": 2.9349205493927,
"learning_rate": 0.00014202649640851275,
"logits/chosen": -0.8891080617904663,
"logits/rejected": -0.8925038576126099,
"logps/chosen": -5.047273635864258,
"logps/rejected": -34.245174407958984,
"loss": 0.3938831090927124,
"memory(GiB)": 46.83,
"nll_loss": 0.21636192500591278,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.2093987911939621,
"rewards/margins": 2.6690750122070312,
"rewards/rejected": -2.4596762657165527,
"step": 488,
"train_speed(iter/s)": 0.005437
},
{
"epoch": 0.3945437583520335,
"grad_norm": 6.7003173828125,
"learning_rate": 0.00014178414769724766,
"logits/chosen": -0.8764248490333557,
"logits/rejected": -0.876374363899231,
"logps/chosen": -8.440370559692383,
"logps/rejected": -35.263214111328125,
"loss": 0.5095587968826294,
"memory(GiB)": 46.83,
"nll_loss": 0.34542787075042725,
"rewards/accuracies": 0.96875,
"rewards/chosen": 0.19051702320575714,
"rewards/margins": 2.7904720306396484,
"rewards/rejected": -2.5999550819396973,
"step": 489,
"train_speed(iter/s)": 0.005438
},
{
"epoch": 0.39535059630367364,
"grad_norm": 3.259153366088867,
"learning_rate": 0.00014154150130018866,
"logits/chosen": -0.9377500414848328,
"logits/rejected": -0.9458149671554565,
"logps/chosen": -11.506027221679688,
"logps/rejected": -35.232669830322266,
"loss": 0.6641853451728821,
"memory(GiB)": 46.83,
"nll_loss": 0.46648576855659485,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.3142199218273163,
"rewards/margins": 2.9259414672851562,
"rewards/rejected": -2.6117210388183594,
"step": 490,
"train_speed(iter/s)": 0.005438
},
{
"epoch": 0.3961574342553138,
"grad_norm": 2.46926212310791,
"learning_rate": 0.00014129855894603886,
"logits/chosen": -0.9563973546028137,
"logits/rejected": -0.9663281440734863,
"logps/chosen": -8.163786888122559,
"logps/rejected": -45.545860290527344,
"loss": 0.462195485830307,
"memory(GiB)": 46.83,
"nll_loss": 0.34487971663475037,
"rewards/accuracies": 0.96875,
"rewards/chosen": 0.1903153955936432,
"rewards/margins": 3.344923257827759,
"rewards/rejected": -3.1546080112457275,
"step": 491,
"train_speed(iter/s)": 0.005438
},
{
"epoch": 0.39696427220695396,
"grad_norm": 11.747800827026367,
"learning_rate": 0.00014105532236560983,
"logits/chosen": -0.9172489047050476,
"logits/rejected": -0.9255672693252563,
"logps/chosen": -8.56010627746582,
"logps/rejected": -44.462188720703125,
"loss": 0.5068323612213135,
"memory(GiB)": 46.83,
"nll_loss": 0.3179493546485901,
"rewards/accuracies": 0.90625,
"rewards/chosen": 0.13865207135677338,
"rewards/margins": 2.8126437664031982,
"rewards/rejected": -2.6739919185638428,
"step": 492,
"train_speed(iter/s)": 0.005438
},
{
"epoch": 0.39777111015859407,
"grad_norm": 5.142593860626221,
"learning_rate": 0.00014081179329180943,
"logits/chosen": -0.9059480428695679,
"logits/rejected": -0.9175886511802673,
"logps/chosen": -5.26338529586792,
"logps/rejected": -45.20058822631836,
"loss": 0.40461504459381104,
"memory(GiB)": 46.83,
"nll_loss": 0.20817551016807556,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.24090781807899475,
"rewards/margins": 3.5246479511260986,
"rewards/rejected": -3.283740282058716,
"step": 493,
"train_speed(iter/s)": 0.005438
},
{
"epoch": 0.3985779481102342,
"grad_norm": 13.850090980529785,
"learning_rate": 0.00014056797345962915,
"logits/chosen": -0.97746741771698,
"logits/rejected": -0.9824937582015991,
"logps/chosen": -8.306085586547852,
"logps/rejected": -45.58984375,
"loss": 0.7906121015548706,
"memory(GiB)": 46.83,
"nll_loss": 0.5601307153701782,
"rewards/accuracies": 0.90625,
"rewards/chosen": 0.0417952798306942,
"rewards/margins": 3.4094972610473633,
"rewards/rejected": -3.3677022457122803,
"step": 494,
"train_speed(iter/s)": 0.005439
},
{
"epoch": 0.3993847860618744,
"grad_norm": 2.4637293815612793,
"learning_rate": 0.0001403238646061322,
"logits/chosen": -0.9754372835159302,
"logits/rejected": -0.9848412275314331,
"logps/chosen": -7.990797996520996,
"logps/rejected": -48.4688720703125,
"loss": 0.4341033101081848,
"memory(GiB)": 46.83,
"nll_loss": 0.308696985244751,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.27976250648498535,
"rewards/margins": 3.742406129837036,
"rewards/rejected": -3.462643623352051,
"step": 495,
"train_speed(iter/s)": 0.005438
},
{
"epoch": 0.40019162401351455,
"grad_norm": 3.6680634021759033,
"learning_rate": 0.00014007946847044065,
"logits/chosen": -0.951252818107605,
"logits/rejected": -0.9680181741714478,
"logps/chosen": -4.847614765167236,
"logps/rejected": -46.7112922668457,
"loss": 0.383756160736084,
"memory(GiB)": 46.83,
"nll_loss": 0.24948665499687195,
"rewards/accuracies": 0.96875,
"rewards/chosen": 0.17591829597949982,
"rewards/margins": 3.246157646179199,
"rewards/rejected": -3.070239305496216,
"step": 496,
"train_speed(iter/s)": 0.005438
},
{
"epoch": 0.4009984619651547,
"grad_norm": 3.807244062423706,
"learning_rate": 0.00013983478679372344,
"logits/chosen": -0.9732386469841003,
"logits/rejected": -0.9831098318099976,
"logps/chosen": -7.762671947479248,
"logps/rejected": -52.341617584228516,
"loss": 0.43133464455604553,
"memory(GiB)": 46.83,
"nll_loss": 0.2912958860397339,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.1585668921470642,
"rewards/margins": 3.8791747093200684,
"rewards/rejected": -3.7206082344055176,
"step": 497,
"train_speed(iter/s)": 0.005438
},
{
"epoch": 0.4018052999167948,
"grad_norm": 14.390305519104004,
"learning_rate": 0.00013958982131918372,
"logits/chosen": -0.9233254194259644,
"logits/rejected": -0.926517128944397,
"logps/chosen": -11.224777221679688,
"logps/rejected": -33.05560302734375,
"loss": 0.8548044562339783,
"memory(GiB)": 46.83,
"nll_loss": 0.4569489359855652,
"rewards/accuracies": 0.78125,
"rewards/chosen": 0.0009491965174674988,
"rewards/margins": 2.3791630268096924,
"rewards/rejected": -2.378213882446289,
"step": 498,
"train_speed(iter/s)": 0.005439
},
{
"epoch": 0.40261213786843497,
"grad_norm": 7.265214443206787,
"learning_rate": 0.00013934457379204658,
"logits/chosen": -0.9037230014801025,
"logits/rejected": -0.9072719216346741,
"logps/chosen": -13.305590629577637,
"logps/rejected": -42.6323127746582,
"loss": 0.5567822456359863,
"memory(GiB)": 46.83,
"nll_loss": 0.4082874059677124,
"rewards/accuracies": 0.96875,
"rewards/chosen": 0.3724799156188965,
"rewards/margins": 3.5428996086120605,
"rewards/rejected": -3.1704201698303223,
"step": 499,
"train_speed(iter/s)": 0.005439
},
{
"epoch": 0.40341897582007513,
"grad_norm": 2.8691728115081787,
"learning_rate": 0.0001390990459595465,
"logits/chosen": -0.9267888069152832,
"logits/rejected": -0.936477780342102,
"logps/chosen": -9.545984268188477,
"logps/rejected": -42.449127197265625,
"loss": 0.7537754774093628,
"memory(GiB)": 46.83,
"nll_loss": 0.5160152912139893,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.12287023663520813,
"rewards/margins": 3.151482105255127,
"rewards/rejected": -3.0286121368408203,
"step": 500,
"train_speed(iter/s)": 0.005439
},
{
"epoch": 0.4042258137717153,
"grad_norm": 17.34552764892578,
"learning_rate": 0.00013885323957091503,
"logits/chosen": -0.8896504640579224,
"logits/rejected": -0.8915640115737915,
"logps/chosen": -9.813822746276855,
"logps/rejected": -36.02322769165039,
"loss": 1.0269454717636108,
"memory(GiB)": 46.83,
"nll_loss": 0.6156859397888184,
"rewards/accuracies": 0.84375,
"rewards/chosen": -0.17760202288627625,
"rewards/margins": 2.4105653762817383,
"rewards/rejected": -2.588167667388916,
"step": 501,
"train_speed(iter/s)": 0.005438
},
{
"epoch": 0.40503265172335545,
"grad_norm": 2.611849069595337,
"learning_rate": 0.00013860715637736818,
"logits/chosen": -0.8846621513366699,
"logits/rejected": -0.8913875222206116,
"logps/chosen": -7.3572540283203125,
"logps/rejected": -43.120914459228516,
"loss": 0.5870882868766785,
"memory(GiB)": 46.83,
"nll_loss": 0.45941975712776184,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.24965612590312958,
"rewards/margins": 3.1028006076812744,
"rewards/rejected": -2.8531441688537598,
"step": 502,
"train_speed(iter/s)": 0.005438
},
{
"epoch": 0.4058394896749956,
"grad_norm": 9.19338607788086,
"learning_rate": 0.00013836079813209405,
"logits/chosen": -0.8596163988113403,
"logits/rejected": -0.8734834790229797,
"logps/chosen": -6.4730024337768555,
"logps/rejected": -48.3375358581543,
"loss": 0.5926974415779114,
"memory(GiB)": 46.83,
"nll_loss": 0.40696945786476135,
"rewards/accuracies": 0.96875,
"rewards/chosen": 0.13774055242538452,
"rewards/margins": 3.3298587799072266,
"rewards/rejected": -3.1921184062957764,
"step": 503,
"train_speed(iter/s)": 0.005438
},
{
"epoch": 0.4066463276266357,
"grad_norm": 2.5772955417633057,
"learning_rate": 0.00013811416659024035,
"logits/chosen": -0.8637710809707642,
"logits/rejected": -0.869887113571167,
"logps/chosen": -8.725384712219238,
"logps/rejected": -44.57448959350586,
"loss": 0.5925300717353821,
"memory(GiB)": 46.83,
"nll_loss": 0.48120686411857605,
"rewards/accuracies": 0.96875,
"rewards/chosen": 0.12150951474905014,
"rewards/margins": 3.436396598815918,
"rewards/rejected": -3.314887046813965,
"step": 504,
"train_speed(iter/s)": 0.005438
},
{
"epoch": 0.4074531655782759,
"grad_norm": 4.892908096313477,
"learning_rate": 0.00013786726350890183,
"logits/chosen": -0.874576210975647,
"logits/rejected": -0.8784814476966858,
"logps/chosen": -9.178255081176758,
"logps/rejected": -38.52834701538086,
"loss": 0.6706528067588806,
"memory(GiB)": 46.83,
"nll_loss": 0.49778318405151367,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.21889682114124298,
"rewards/margins": 3.011408805847168,
"rewards/rejected": -2.7925119400024414,
"step": 505,
"train_speed(iter/s)": 0.005439
},
{
"epoch": 0.40826000352991604,
"grad_norm": 2.44610333442688,
"learning_rate": 0.00013762009064710774,
"logits/chosen": -0.8441749811172485,
"logits/rejected": -0.8464869260787964,
"logps/chosen": -7.5994648933410645,
"logps/rejected": -34.768951416015625,
"loss": 0.5083529353141785,
"memory(GiB)": 46.83,
"nll_loss": 0.3053922653198242,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.30249646306037903,
"rewards/margins": 2.588782787322998,
"rewards/rejected": -2.2862861156463623,
"step": 506,
"train_speed(iter/s)": 0.005439
},
{
"epoch": 0.4090668414815562,
"grad_norm": 6.779381275177002,
"learning_rate": 0.00013737264976580943,
"logits/chosen": -0.8816607594490051,
"logits/rejected": -0.8868498206138611,
"logps/chosen": -11.123010635375977,
"logps/rejected": -37.859195709228516,
"loss": 0.8256106376647949,
"memory(GiB)": 46.83,
"nll_loss": 0.40417546033859253,
"rewards/accuracies": 0.8125,
"rewards/chosen": -0.1513340175151825,
"rewards/margins": 2.473325252532959,
"rewards/rejected": -2.624659299850464,
"step": 507,
"train_speed(iter/s)": 0.005439
},
{
"epoch": 0.40987367943319636,
"grad_norm": 3.7313573360443115,
"learning_rate": 0.00013712494262786766,
"logits/chosen": -0.8750671148300171,
"logits/rejected": -0.8821631669998169,
"logps/chosen": -10.883421897888184,
"logps/rejected": -42.575679779052734,
"loss": 0.748051643371582,
"memory(GiB)": 46.83,
"nll_loss": 0.5597954988479614,
"rewards/accuracies": 0.90625,
"rewards/chosen": 0.19764858484268188,
"rewards/margins": 3.004587173461914,
"rewards/rejected": -2.806938409805298,
"step": 508,
"train_speed(iter/s)": 0.005438
},
{
"epoch": 0.41068051738483646,
"grad_norm": 2.834299087524414,
"learning_rate": 0.0001368769709980401,
"logits/chosen": -0.862756073474884,
"logits/rejected": -0.8707681894302368,
"logps/chosen": -8.581947326660156,
"logps/rejected": -42.503753662109375,
"loss": 0.3937508761882782,
"memory(GiB)": 46.83,
"nll_loss": 0.23043422400951385,
"rewards/accuracies": 0.96875,
"rewards/chosen": 0.2632564604282379,
"rewards/margins": 2.976945400238037,
"rewards/rejected": -2.713688850402832,
"step": 509,
"train_speed(iter/s)": 0.005439
},
{
"epoch": 0.4114873553364766,
"grad_norm": 2.886272668838501,
"learning_rate": 0.00013662873664296884,
"logits/chosen": -0.819119930267334,
"logits/rejected": -0.826356053352356,
"logps/chosen": -8.14879035949707,
"logps/rejected": -42.62828826904297,
"loss": 0.5604068636894226,
"memory(GiB)": 46.83,
"nll_loss": 0.31821465492248535,
"rewards/accuracies": 0.90625,
"rewards/chosen": 0.3842453360557556,
"rewards/margins": 3.0441181659698486,
"rewards/rejected": -2.6598730087280273,
"step": 510,
"train_speed(iter/s)": 0.005439
},
{
"epoch": 0.4122941932881168,
"grad_norm": 3.3949501514434814,
"learning_rate": 0.00013638024133116763,
"logits/chosen": -0.802520215511322,
"logits/rejected": -0.8098280429840088,
"logps/chosen": -12.40538215637207,
"logps/rejected": -38.84916305541992,
"loss": 0.8826647400856018,
"memory(GiB)": 46.83,
"nll_loss": 0.5703054666519165,
"rewards/accuracies": 0.90625,
"rewards/chosen": 0.012079771608114243,
"rewards/margins": 2.588003396987915,
"rewards/rejected": -2.575923442840576,
"step": 511,
"train_speed(iter/s)": 0.005439
},
{
"epoch": 0.41310103123975694,
"grad_norm": 6.568037509918213,
"learning_rate": 0.00013613148683300937,
"logits/chosen": -0.8070806860923767,
"logits/rejected": -0.813240647315979,
"logps/chosen": -9.467267990112305,
"logps/rejected": -39.797325134277344,
"loss": 0.5164275765419006,
"memory(GiB)": 46.83,
"nll_loss": 0.39448225498199463,
"rewards/accuracies": 0.96875,
"rewards/chosen": 0.28209254145622253,
"rewards/margins": 2.9220352172851562,
"rewards/rejected": -2.6399426460266113,
"step": 512,
"train_speed(iter/s)": 0.00544
},
{
"epoch": 0.4139078691913971,
"grad_norm": 10.136809349060059,
"learning_rate": 0.0001358824749207136,
"logits/chosen": -0.8575885891914368,
"logits/rejected": -0.8593306541442871,
"logps/chosen": -10.6421480178833,
"logps/rejected": -39.468055725097656,
"loss": 0.7010791301727295,
"memory(GiB)": 46.83,
"nll_loss": 0.5033397674560547,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.156565859913826,
"rewards/margins": 2.7266011238098145,
"rewards/rejected": -2.570035219192505,
"step": 513,
"train_speed(iter/s)": 0.00544
},
{
"epoch": 0.41471470714303726,
"grad_norm": 3.576723098754883,
"learning_rate": 0.00013563320736833365,
"logits/chosen": -0.8105019330978394,
"logits/rejected": -0.8146560788154602,
"logps/chosen": -10.574302673339844,
"logps/rejected": -36.661590576171875,
"loss": 0.665181040763855,
"memory(GiB)": 46.83,
"nll_loss": 0.4042365849018097,
"rewards/accuracies": 0.90625,
"rewards/chosen": 0.13927578926086426,
"rewards/margins": 2.6975083351135254,
"rewards/rejected": -2.558232545852661,
"step": 514,
"train_speed(iter/s)": 0.00544
},
{
"epoch": 0.41552154509467737,
"grad_norm": 2.363494396209717,
"learning_rate": 0.00013538368595174423,
"logits/chosen": -0.8046780228614807,
"logits/rejected": -0.8101540803909302,
"logps/chosen": -12.763677597045898,
"logps/rejected": -39.75190353393555,
"loss": 0.5567308664321899,
"memory(GiB)": 46.83,
"nll_loss": 0.4450889527797699,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.285984069108963,
"rewards/margins": 3.129922389984131,
"rewards/rejected": -2.843937873840332,
"step": 515,
"train_speed(iter/s)": 0.00544
},
{
"epoch": 0.41632838304631753,
"grad_norm": 2.798708438873291,
"learning_rate": 0.0001351339124486286,
"logits/chosen": -0.823294460773468,
"logits/rejected": -0.8240728974342346,
"logps/chosen": -8.804251670837402,
"logps/rejected": -36.77720260620117,
"loss": 0.5373676419258118,
"memory(GiB)": 46.83,
"nll_loss": 0.35823625326156616,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.25987887382507324,
"rewards/margins": 2.7686750888824463,
"rewards/rejected": -2.508796453475952,
"step": 516,
"train_speed(iter/s)": 0.005439
},
{
"epoch": 0.4171352209979577,
"grad_norm": 3.738819122314453,
"learning_rate": 0.00013488388863846598,
"logits/chosen": -0.8327402472496033,
"logits/rejected": -0.8359934091567993,
"logps/chosen": -12.034650802612305,
"logps/rejected": -33.55274200439453,
"loss": 0.7193576097488403,
"memory(GiB)": 46.83,
"nll_loss": 0.506946325302124,
"rewards/accuracies": 0.90625,
"rewards/chosen": 0.16285476088523865,
"rewards/margins": 2.3808743953704834,
"rewards/rejected": -2.218019485473633,
"step": 517,
"train_speed(iter/s)": 0.005439
},
{
"epoch": 0.41794205894959785,
"grad_norm": 2.734147071838379,
"learning_rate": 0.00013463361630251897,
"logits/chosen": -0.8137484788894653,
"logits/rejected": -0.8196120858192444,
"logps/chosen": -16.61955451965332,
"logps/rejected": -33.3659553527832,
"loss": 0.8027633428573608,
"memory(GiB)": 46.83,
"nll_loss": 0.5399143099784851,
"rewards/accuracies": 0.84375,
"rewards/chosen": 0.31846553087234497,
"rewards/margins": 2.49395751953125,
"rewards/rejected": -2.1754918098449707,
"step": 518,
"train_speed(iter/s)": 0.00544
},
{
"epoch": 0.418748896901238,
"grad_norm": 1.6672159433364868,
"learning_rate": 0.00013438309722382056,
"logits/chosen": -0.8162409663200378,
"logits/rejected": -0.8220106959342957,
"logps/chosen": -8.6817045211792,
"logps/rejected": -37.332298278808594,
"loss": 0.4413672685623169,
"memory(GiB)": 46.83,
"nll_loss": 0.2940937876701355,
"rewards/accuracies": 0.96875,
"rewards/chosen": 0.28105995059013367,
"rewards/margins": 2.7084476947784424,
"rewards/rejected": -2.4273879528045654,
"step": 519,
"train_speed(iter/s)": 0.005439
},
{
"epoch": 0.4195557348528781,
"grad_norm": 2.7764697074890137,
"learning_rate": 0.00013413233318716188,
"logits/chosen": -0.8464371562004089,
"logits/rejected": -0.8485240936279297,
"logps/chosen": -10.62841796875,
"logps/rejected": -36.70519256591797,
"loss": 0.7128565907478333,
"memory(GiB)": 46.83,
"nll_loss": 0.46534037590026855,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.22482553124427795,
"rewards/margins": 2.6670079231262207,
"rewards/rejected": -2.4421825408935547,
"step": 520,
"train_speed(iter/s)": 0.005439
},
{
"epoch": 0.4203625728045183,
"grad_norm": 4.593116760253906,
"learning_rate": 0.00013388132597907904,
"logits/chosen": -0.8110215663909912,
"logits/rejected": -0.8151426315307617,
"logps/chosen": -10.328957557678223,
"logps/rejected": -38.320430755615234,
"loss": 0.6786235570907593,
"memory(GiB)": 46.83,
"nll_loss": 0.339311420917511,
"rewards/accuracies": 0.78125,
"rewards/chosen": 0.1592826545238495,
"rewards/margins": 2.4331724643707275,
"rewards/rejected": -2.2738895416259766,
"step": 521,
"train_speed(iter/s)": 0.005439
},
{
"epoch": 0.42116941075615844,
"grad_norm": 4.485230445861816,
"learning_rate": 0.0001336300773878407,
"logits/chosen": -0.8129779696464539,
"logits/rejected": -0.8200620412826538,
"logps/chosen": -7.188672065734863,
"logps/rejected": -38.45001220703125,
"loss": 0.6729139089584351,
"memory(GiB)": 46.83,
"nll_loss": 0.4256826639175415,
"rewards/accuracies": 0.90625,
"rewards/chosen": 0.16748948395252228,
"rewards/margins": 2.9809718132019043,
"rewards/rejected": -2.8134822845458984,
"step": 522,
"train_speed(iter/s)": 0.005439
},
{
"epoch": 0.4219762487077986,
"grad_norm": 3.1994502544403076,
"learning_rate": 0.00013337858920343512,
"logits/chosen": -0.8458603024482727,
"logits/rejected": -0.852841854095459,
"logps/chosen": -8.571792602539062,
"logps/rejected": -42.51072692871094,
"loss": 0.4996880292892456,
"memory(GiB)": 46.83,
"nll_loss": 0.2992246150970459,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.23098604381084442,
"rewards/margins": 3.1265108585357666,
"rewards/rejected": -2.895524740219116,
"step": 523,
"train_speed(iter/s)": 0.005439
},
{
"epoch": 0.42278308665943876,
"grad_norm": 3.704655170440674,
"learning_rate": 0.00013312686321755761,
"logits/chosen": -0.8289926648139954,
"logits/rejected": -0.8301224708557129,
"logps/chosen": -7.220808029174805,
"logps/rejected": -33.644962310791016,
"loss": 0.4415580928325653,
"memory(GiB)": 46.83,
"nll_loss": 0.2433617264032364,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.19586443901062012,
"rewards/margins": 2.462473154067993,
"rewards/rejected": -2.266608238220215,
"step": 524,
"train_speed(iter/s)": 0.005439
},
{
"epoch": 0.4235899246110789,
"grad_norm": 14.6280517578125,
"learning_rate": 0.0001328749012235976,
"logits/chosen": -0.8482613563537598,
"logits/rejected": -0.858103334903717,
"logps/chosen": -6.205442905426025,
"logps/rejected": -37.40229797363281,
"loss": 0.7436372637748718,
"memory(GiB)": 46.83,
"nll_loss": 0.4056238830089569,
"rewards/accuracies": 0.84375,
"rewards/chosen": -0.02807258814573288,
"rewards/margins": 2.8922817707061768,
"rewards/rejected": -2.9203548431396484,
"step": 525,
"train_speed(iter/s)": 0.005439
},
{
"epoch": 0.424396762562719,
"grad_norm": 10.639749526977539,
"learning_rate": 0.000132622705016626,
"logits/chosen": -0.8543103337287903,
"logits/rejected": -0.8550821542739868,
"logps/chosen": -8.963075637817383,
"logps/rejected": -44.753875732421875,
"loss": 0.5276005864143372,
"memory(GiB)": 46.83,
"nll_loss": 0.3191993534564972,
"rewards/accuracies": 0.9375,
"rewards/chosen": -0.08133304864168167,
"rewards/margins": 2.828303098678589,
"rewards/rejected": -2.9096360206604004,
"step": 526,
"train_speed(iter/s)": 0.005439
},
{
"epoch": 0.4252036005143592,
"grad_norm": 5.606629848480225,
"learning_rate": 0.00013237027639338223,
"logits/chosen": -0.7930728197097778,
"logits/rejected": -0.8049328327178955,
"logps/chosen": -11.980341911315918,
"logps/rejected": -42.134681701660156,
"loss": 0.8973350524902344,
"memory(GiB)": 46.83,
"nll_loss": 0.6916304230690002,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.2415471076965332,
"rewards/margins": 2.853031635284424,
"rewards/rejected": -2.6114845275878906,
"step": 527,
"train_speed(iter/s)": 0.005439
},
{
"epoch": 0.42601043846599934,
"grad_norm": 3.3900585174560547,
"learning_rate": 0.0001321176171522617,
"logits/chosen": -0.8453109264373779,
"logits/rejected": -0.8487651348114014,
"logps/chosen": -10.572664260864258,
"logps/rejected": -33.60906982421875,
"loss": 0.5498627424240112,
"memory(GiB)": 46.83,
"nll_loss": 0.4081331193447113,
"rewards/accuracies": 0.96875,
"rewards/chosen": 0.28006234765052795,
"rewards/margins": 2.9145495891571045,
"rewards/rejected": -2.6344871520996094,
"step": 528,
"train_speed(iter/s)": 0.005439
},
{
"epoch": 0.4268172764176395,
"grad_norm": 5.930169582366943,
"learning_rate": 0.00013186472909330264,
"logits/chosen": -0.8630443215370178,
"logits/rejected": -0.8701946139335632,
"logps/chosen": -7.021512985229492,
"logps/rejected": -36.796783447265625,
"loss": 0.7053890824317932,
"memory(GiB)": 46.83,
"nll_loss": 0.4606189727783203,
"rewards/accuracies": 0.90625,
"rewards/chosen": 0.2262631058692932,
"rewards/margins": 2.8637092113494873,
"rewards/rejected": -2.637446403503418,
"step": 529,
"train_speed(iter/s)": 0.00544
},
{
"epoch": 0.42762411436927966,
"grad_norm": 6.3762688636779785,
"learning_rate": 0.00013161161401817353,
"logits/chosen": -0.8374471068382263,
"logits/rejected": -0.8438255786895752,
"logps/chosen": -9.851973533630371,
"logps/rejected": -39.308502197265625,
"loss": 0.5261674523353577,
"memory(GiB)": 46.83,
"nll_loss": 0.33455437421798706,
"rewards/accuracies": 0.90625,
"rewards/chosen": 0.15020446479320526,
"rewards/margins": 2.7218151092529297,
"rewards/rejected": -2.571610689163208,
"step": 530,
"train_speed(iter/s)": 0.00544
},
{
"epoch": 0.4284309523209198,
"grad_norm": 6.240972995758057,
"learning_rate": 0.00013135827373016027,
"logits/chosen": -0.8955954313278198,
"logits/rejected": -0.9030234813690186,
"logps/chosen": -11.273481369018555,
"logps/rejected": -34.91842269897461,
"loss": 0.7530210614204407,
"memory(GiB)": 46.83,
"nll_loss": 0.5049380660057068,
"rewards/accuracies": 0.90625,
"rewards/chosen": 0.19476205110549927,
"rewards/margins": 2.6257526874542236,
"rewards/rejected": -2.430990695953369,
"step": 531,
"train_speed(iter/s)": 0.00544
},
{
"epoch": 0.4292377902725599,
"grad_norm": 3.5795764923095703,
"learning_rate": 0.00013110471003415321,
"logits/chosen": -0.8652918338775635,
"logits/rejected": -0.8691776990890503,
"logps/chosen": -8.708220481872559,
"logps/rejected": -40.791812896728516,
"loss": 0.5590424537658691,
"memory(GiB)": 46.83,
"nll_loss": 0.29747384786605835,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.06008954346179962,
"rewards/margins": 2.697359085083008,
"rewards/rejected": -2.6372694969177246,
"step": 532,
"train_speed(iter/s)": 0.00544
},
{
"epoch": 0.4300446282242001,
"grad_norm": 3.8843157291412354,
"learning_rate": 0.0001308509247366343,
"logits/chosen": -0.7854755520820618,
"logits/rejected": -0.792789101600647,
"logps/chosen": -7.507791519165039,
"logps/rejected": -49.7330322265625,
"loss": 0.4467013478279114,
"memory(GiB)": 46.83,
"nll_loss": 0.27506744861602783,
"rewards/accuracies": 0.90625,
"rewards/chosen": 0.24458295106887817,
"rewards/margins": 3.935803174972534,
"rewards/rejected": -3.691220283508301,
"step": 533,
"train_speed(iter/s)": 0.00544
},
{
"epoch": 0.43085146617584025,
"grad_norm": 3.57249116897583,
"learning_rate": 0.00013059691964566433,
"logits/chosen": -0.8396457433700562,
"logits/rejected": -0.8505795001983643,
"logps/chosen": -8.021794319152832,
"logps/rejected": -43.013790130615234,
"loss": 0.6681239604949951,
"memory(GiB)": 46.83,
"nll_loss": 0.40499186515808105,
"rewards/accuracies": 0.96875,
"rewards/chosen": 0.14213377237319946,
"rewards/margins": 3.0652308464050293,
"rewards/rejected": -2.9230968952178955,
"step": 534,
"train_speed(iter/s)": 0.00544
},
{
"epoch": 0.4316583041274804,
"grad_norm": 5.327953338623047,
"learning_rate": 0.00013034269657086992,
"logits/chosen": -0.8565971255302429,
"logits/rejected": -0.8621482253074646,
"logps/chosen": -7.855462551116943,
"logps/rejected": -44.381805419921875,
"loss": 0.4837571680545807,
"memory(GiB)": 46.83,
"nll_loss": 0.32484912872314453,
"rewards/accuracies": 0.90625,
"rewards/chosen": 0.4074184000492096,
"rewards/margins": 3.6497139930725098,
"rewards/rejected": -3.242295265197754,
"step": 535,
"train_speed(iter/s)": 0.00544
},
{
"epoch": 0.43246514207912057,
"grad_norm": 4.380790710449219,
"learning_rate": 0.00013008825732343073,
"logits/chosen": -0.8305094838142395,
"logits/rejected": -0.8384683132171631,
"logps/chosen": -5.753545761108398,
"logps/rejected": -40.71387481689453,
"loss": 0.48914748430252075,
"memory(GiB)": 46.83,
"nll_loss": 0.27660253643989563,
"rewards/accuracies": 0.90625,
"rewards/chosen": 0.2127423733472824,
"rewards/margins": 2.9575328826904297,
"rewards/rejected": -2.744790554046631,
"step": 536,
"train_speed(iter/s)": 0.00544
},
{
"epoch": 0.4332719800307607,
"grad_norm": 2.478238344192505,
"learning_rate": 0.0001298336037160665,
"logits/chosen": -0.8390322327613831,
"logits/rejected": -0.8421530723571777,
"logps/chosen": -9.2628173828125,
"logps/rejected": -33.14223861694336,
"loss": 0.6333991289138794,
"memory(GiB)": 46.83,
"nll_loss": 0.385562539100647,
"rewards/accuracies": 0.84375,
"rewards/chosen": 0.2185012400150299,
"rewards/margins": 2.4338998794555664,
"rewards/rejected": -2.2153985500335693,
"step": 537,
"train_speed(iter/s)": 0.00544
},
{
"epoch": 0.43407881798240083,
"grad_norm": 4.371514320373535,
"learning_rate": 0.00012957873756302415,
"logits/chosen": -0.7974674701690674,
"logits/rejected": -0.7956443428993225,
"logps/chosen": -11.487338066101074,
"logps/rejected": -37.02048110961914,
"loss": 0.6238091588020325,
"memory(GiB)": 46.83,
"nll_loss": 0.4722408056259155,
"rewards/accuracies": 0.96875,
"rewards/chosen": 0.2411145120859146,
"rewards/margins": 2.765226125717163,
"rewards/rejected": -2.52411150932312,
"step": 538,
"train_speed(iter/s)": 0.00544
},
{
"epoch": 0.434885655934041,
"grad_norm": 2.3261210918426514,
"learning_rate": 0.00012932366068006486,
"logits/chosen": -0.8332119584083557,
"logits/rejected": -0.8431892395019531,
"logps/chosen": -5.291442394256592,
"logps/rejected": -40.494781494140625,
"loss": 0.35455459356307983,
"memory(GiB)": 46.83,
"nll_loss": 0.2400093972682953,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.3891444504261017,
"rewards/margins": 3.3702661991119385,
"rewards/rejected": -2.981121778488159,
"step": 539,
"train_speed(iter/s)": 0.005441
},
{
"epoch": 0.43569249388568115,
"grad_norm": 3.177072763442993,
"learning_rate": 0.00012906837488445115,
"logits/chosen": -0.8743947744369507,
"logits/rejected": -0.8769956827163696,
"logps/chosen": -9.416547775268555,
"logps/rejected": -38.16511917114258,
"loss": 0.5091468095779419,
"memory(GiB)": 46.83,
"nll_loss": 0.34846216440200806,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.2577158510684967,
"rewards/margins": 2.8782832622528076,
"rewards/rejected": -2.620567560195923,
"step": 540,
"train_speed(iter/s)": 0.005441
},
{
"epoch": 0.4364993318373213,
"grad_norm": 2.1750667095184326,
"learning_rate": 0.00012881288199493378,
"logits/chosen": -0.8983636498451233,
"logits/rejected": -0.9017794132232666,
"logps/chosen": -5.9792609214782715,
"logps/rejected": -39.93588638305664,
"loss": 0.42438769340515137,
"memory(GiB)": 46.83,
"nll_loss": 0.2854105830192566,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.38626906275749207,
"rewards/margins": 3.287107467651367,
"rewards/rejected": -2.9008383750915527,
"step": 541,
"train_speed(iter/s)": 0.005441
},
{
"epoch": 0.4373061697889615,
"grad_norm": 4.120799541473389,
"learning_rate": 0.00012855718383173915,
"logits/chosen": -0.8792024254798889,
"logits/rejected": -0.8899410367012024,
"logps/chosen": -8.377023696899414,
"logps/rejected": -31.686115264892578,
"loss": 0.6103077530860901,
"memory(GiB)": 46.83,
"nll_loss": 0.3152506947517395,
"rewards/accuracies": 0.90625,
"rewards/chosen": 0.3780965507030487,
"rewards/margins": 2.42580246925354,
"rewards/rejected": -2.047706127166748,
"step": 542,
"train_speed(iter/s)": 0.005442
},
{
"epoch": 0.4381130077406016,
"grad_norm": 2.2526559829711914,
"learning_rate": 0.0001283012822165559,
"logits/chosen": -0.9368709921836853,
"logits/rejected": -0.9483405947685242,
"logps/chosen": -6.628868103027344,
"logps/rejected": -39.02850341796875,
"loss": 0.38257747888565063,
"memory(GiB)": 46.83,
"nll_loss": 0.24682456254959106,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.35517507791519165,
"rewards/margins": 2.6254923343658447,
"rewards/rejected": -2.270317554473877,
"step": 543,
"train_speed(iter/s)": 0.005442
},
{
"epoch": 0.43891984569224174,
"grad_norm": 2.8567118644714355,
"learning_rate": 0.00012804517897252227,
"logits/chosen": -0.9481716156005859,
"logits/rejected": -0.9497692584991455,
"logps/chosen": -7.450263977050781,
"logps/rejected": -31.115060806274414,
"loss": 0.47185516357421875,
"memory(GiB)": 46.83,
"nll_loss": 0.3170330822467804,
"rewards/accuracies": 0.96875,
"rewards/chosen": 0.31209883093833923,
"rewards/margins": 2.585287570953369,
"rewards/rejected": -2.273188591003418,
"step": 544,
"train_speed(iter/s)": 0.005442
},
{
"epoch": 0.4397266836438819,
"grad_norm": 3.762911319732666,
"learning_rate": 0.00012778887592421293,
"logits/chosen": -0.9280496835708618,
"logits/rejected": -0.9334405660629272,
"logps/chosen": -8.896903991699219,
"logps/rejected": -45.50485610961914,
"loss": 0.4354952573776245,
"memory(GiB)": 46.83,
"nll_loss": 0.2929496467113495,
"rewards/accuracies": 0.96875,
"rewards/chosen": 0.3440062999725342,
"rewards/margins": 3.7558441162109375,
"rewards/rejected": -3.4118378162384033,
"step": 545,
"train_speed(iter/s)": 0.005442
},
{
"epoch": 0.44053352159552206,
"grad_norm": 5.700692176818848,
"learning_rate": 0.000127532374897626,
"logits/chosen": -1.0263915061950684,
"logits/rejected": -1.0273609161376953,
"logps/chosen": -8.307823181152344,
"logps/rejected": -36.91926574707031,
"loss": 0.7563344836235046,
"memory(GiB)": 46.83,
"nll_loss": 0.43058276176452637,
"rewards/accuracies": 0.84375,
"rewards/chosen": -0.014373952522873878,
"rewards/margins": 2.57063889503479,
"rewards/rejected": -2.585012912750244,
"step": 546,
"train_speed(iter/s)": 0.005442
},
{
"epoch": 0.4413403595471622,
"grad_norm": 3.6434919834136963,
"learning_rate": 0.0001272756777201701,
"logits/chosen": -0.9778340458869934,
"logits/rejected": -0.9919235110282898,
"logps/chosen": -6.4957427978515625,
"logps/rejected": -48.30223083496094,
"loss": 0.48351603746414185,
"memory(GiB)": 46.83,
"nll_loss": 0.31254929304122925,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.2537922263145447,
"rewards/margins": 3.731672525405884,
"rewards/rejected": -3.4778804779052734,
"step": 547,
"train_speed(iter/s)": 0.005442
},
{
"epoch": 0.4421471974988023,
"grad_norm": 15.765288352966309,
"learning_rate": 0.00012701878622065136,
"logits/chosen": -1.0241070985794067,
"logits/rejected": -1.036070466041565,
"logps/chosen": -8.980073928833008,
"logps/rejected": -42.19818878173828,
"loss": 0.648382842540741,
"memory(GiB)": 46.83,
"nll_loss": 0.4570547342300415,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.3133217394351959,
"rewards/margins": 2.865694999694824,
"rewards/rejected": -2.5523734092712402,
"step": 548,
"train_speed(iter/s)": 0.005442
},
{
"epoch": 0.4429540354504425,
"grad_norm": 7.8712992668151855,
"learning_rate": 0.00012676170222926023,
"logits/chosen": -1.0750609636306763,
"logits/rejected": -1.08124840259552,
"logps/chosen": -8.864872932434082,
"logps/rejected": -44.60932540893555,
"loss": 1.103929042816162,
"memory(GiB)": 46.83,
"nll_loss": 0.7646006345748901,
"rewards/accuracies": 0.84375,
"rewards/chosen": 0.1929735392332077,
"rewards/margins": 3.46407413482666,
"rewards/rejected": -3.2711007595062256,
"step": 549,
"train_speed(iter/s)": 0.005442
},
{
"epoch": 0.44376087340208265,
"grad_norm": 10.148578643798828,
"learning_rate": 0.00012650442757755859,
"logits/chosen": -1.0684211254119873,
"logits/rejected": -1.0741227865219116,
"logps/chosen": -9.018268585205078,
"logps/rejected": -51.82669448852539,
"loss": 0.7279898524284363,
"memory(GiB)": 46.83,
"nll_loss": 0.6217176914215088,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.23028400540351868,
"rewards/margins": 4.1028971672058105,
"rewards/rejected": -3.8726134300231934,
"step": 550,
"train_speed(iter/s)": 0.005442
}
],
"logging_steps": 1,
"max_steps": 1239,
"num_input_tokens_seen": 0,
"num_train_epochs": 1,
"save_steps": 50,
"stateful_callbacks": {
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": true,
"should_training_stop": false
},
"attributes": {}
}
},
"total_flos": 4.0254248959313183e+18,
"train_batch_size": 1,
"trial_name": null,
"trial_params": null
}