PEFT
Safetensors
task3f2-150 / trainer_state.json
windgrin's picture
Upload folder using huggingface_hub
cfb4474 verified
Raw
History Blame Contribute Delete
96.8 kB
{
"best_global_step": null,
"best_metric": null,
"best_model_checkpoint": null,
"epoch": 0.12102569274602254,
"eval_steps": 300,
"global_step": 150,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"epoch": 0.0008068379516401503,
"grad_norm": 9.261910438537598,
"learning_rate": 3.225806451612903e-06,
"logits/chosen": -0.6039718985557556,
"logits/rejected": -0.6058337688446045,
"logps/chosen": -7.412725925445557,
"logps/rejected": -11.413676261901855,
"loss": 1.2381761074066162,
"memory(GiB)": 46.32,
"nll_loss": 0.5450288653373718,
"rewards/accuracies": 0.0,
"rewards/chosen": 0.0,
"rewards/margins": 0.0,
"rewards/rejected": 0.0,
"step": 1,
"train_speed(iter/s)": 0.005524
},
{
"epoch": 0.0016136759032803006,
"grad_norm": 5.391567230224609,
"learning_rate": 6.451612903225806e-06,
"logits/chosen": -0.6199994087219238,
"logits/rejected": -0.6217825412750244,
"logps/chosen": -7.599736213684082,
"logps/rejected": -15.575040817260742,
"loss": 1.1066936254501343,
"memory(GiB)": 46.83,
"nll_loss": 0.41354650259017944,
"rewards/accuracies": 0.0,
"rewards/chosen": 0.0,
"rewards/margins": 0.0,
"rewards/rejected": 0.0,
"step": 2,
"train_speed(iter/s)": 0.005546
},
{
"epoch": 0.002420513854920451,
"grad_norm": 6.5534772872924805,
"learning_rate": 9.67741935483871e-06,
"logits/chosen": -0.6068329811096191,
"logits/rejected": -0.6103144288063049,
"logps/chosen": -11.938759803771973,
"logps/rejected": -14.32825756072998,
"loss": 1.267569661140442,
"memory(GiB)": 46.83,
"nll_loss": 0.5742746591567993,
"rewards/accuracies": 0.5,
"rewards/chosen": 0.0005358309717848897,
"rewards/margins": -0.00011114418157376349,
"rewards/rejected": 0.0006469750078395009,
"step": 3,
"train_speed(iter/s)": 0.005487
},
{
"epoch": 0.003227351806560601,
"grad_norm": 3.4633655548095703,
"learning_rate": 1.2903225806451613e-05,
"logits/chosen": -0.6417700052261353,
"logits/rejected": -0.638687789440155,
"logps/chosen": -10.244372367858887,
"logps/rejected": -8.448144912719727,
"loss": 1.1101956367492676,
"memory(GiB)": 46.83,
"nll_loss": 0.4145403802394867,
"rewards/accuracies": 0.40625,
"rewards/chosen": -0.002526381518691778,
"rewards/margins": -0.004837517160922289,
"rewards/rejected": 0.0023111351765692234,
"step": 4,
"train_speed(iter/s)": 0.005482
},
{
"epoch": 0.004034189758200751,
"grad_norm": 9.884061813354492,
"learning_rate": 1.6129032258064517e-05,
"logits/chosen": -0.6263395547866821,
"logits/rejected": -0.6316207647323608,
"logps/chosen": -8.768255233764648,
"logps/rejected": -12.074126243591309,
"loss": 1.2384487390518188,
"memory(GiB)": 46.83,
"nll_loss": 0.5502734780311584,
"rewards/accuracies": 0.53125,
"rewards/chosen": 0.011151458136737347,
"rewards/margins": 0.010235130786895752,
"rewards/rejected": 0.0009163276990875602,
"step": 5,
"train_speed(iter/s)": 0.005496
},
{
"epoch": 0.004841027709840902,
"grad_norm": 9.879764556884766,
"learning_rate": 1.935483870967742e-05,
"logits/chosen": -0.6110924482345581,
"logits/rejected": -0.6128084063529968,
"logps/chosen": -11.146334648132324,
"logps/rejected": -12.724503517150879,
"loss": 1.246738314628601,
"memory(GiB)": 46.83,
"nll_loss": 0.5631918907165527,
"rewards/accuracies": 0.65625,
"rewards/chosen": 0.02471097745001316,
"rewards/margins": 0.02056196704506874,
"rewards/rejected": 0.004149014595896006,
"step": 6,
"train_speed(iter/s)": 0.005505
},
{
"epoch": 0.0056478656614810515,
"grad_norm": 3.7321648597717285,
"learning_rate": 2.258064516129032e-05,
"logits/chosen": -0.6434396505355835,
"logits/rejected": -0.6456248164176941,
"logps/chosen": -12.346940994262695,
"logps/rejected": -13.585854530334473,
"loss": 1.25950026512146,
"memory(GiB)": 46.83,
"nll_loss": 0.5602214932441711,
"rewards/accuracies": 0.46875,
"rewards/chosen": 0.01709746941924095,
"rewards/margins": -0.004833616316318512,
"rewards/rejected": 0.021931089460849762,
"step": 7,
"train_speed(iter/s)": 0.005511
},
{
"epoch": 0.006454703613121202,
"grad_norm": 6.577890872955322,
"learning_rate": 2.5806451612903226e-05,
"logits/chosen": -0.6166916489601135,
"logits/rejected": -0.6146227717399597,
"logps/chosen": -16.807830810546875,
"logps/rejected": -11.38271427154541,
"loss": 1.2828420400619507,
"memory(GiB)": 46.83,
"nll_loss": 0.5101535320281982,
"rewards/accuracies": 0.25,
"rewards/chosen": -0.04314221069216728,
"rewards/margins": -0.13309986889362335,
"rewards/rejected": 0.08995765447616577,
"step": 8,
"train_speed(iter/s)": 0.005502
},
{
"epoch": 0.007261541564761352,
"grad_norm": 3.5513713359832764,
"learning_rate": 2.9032258064516133e-05,
"logits/chosen": -0.5994153022766113,
"logits/rejected": -0.6015004515647888,
"logps/chosen": -11.679065704345703,
"logps/rejected": -12.411300659179688,
"loss": 1.171980857849121,
"memory(GiB)": 46.83,
"nll_loss": 0.4982386827468872,
"rewards/accuracies": 0.5625,
"rewards/chosen": 0.035934723913669586,
"rewards/margins": 0.08020534366369247,
"rewards/rejected": -0.04427062347531319,
"step": 9,
"train_speed(iter/s)": 0.005483
},
{
"epoch": 0.008068379516401502,
"grad_norm": 7.633578777313232,
"learning_rate": 3.2258064516129034e-05,
"logits/chosen": -0.6122820377349854,
"logits/rejected": -0.6125556826591492,
"logps/chosen": -12.382171630859375,
"logps/rejected": -10.675874710083008,
"loss": 1.3903008699417114,
"memory(GiB)": 46.83,
"nll_loss": 0.6006877422332764,
"rewards/accuracies": 0.375,
"rewards/chosen": -0.08313174545764923,
"rewards/margins": -0.13078533113002777,
"rewards/rejected": 0.04765357822179794,
"step": 10,
"train_speed(iter/s)": 0.005494
},
{
"epoch": 0.008875217468041654,
"grad_norm": 4.818623065948486,
"learning_rate": 3.548387096774194e-05,
"logits/chosen": -0.6364253759384155,
"logits/rejected": -0.6395613551139832,
"logps/chosen": -7.883171558380127,
"logps/rejected": -15.457681655883789,
"loss": 1.1344804763793945,
"memory(GiB)": 46.83,
"nll_loss": 0.46768438816070557,
"rewards/accuracies": 0.53125,
"rewards/chosen": 0.008294675499200821,
"rewards/margins": 0.10872506350278854,
"rewards/rejected": -0.10043041408061981,
"step": 11,
"train_speed(iter/s)": 0.00549
},
{
"epoch": 0.009682055419681803,
"grad_norm": 3.8297243118286133,
"learning_rate": 3.870967741935484e-05,
"logits/chosen": -0.6082768440246582,
"logits/rejected": -0.6128782629966736,
"logps/chosen": -10.993257522583008,
"logps/rejected": -14.49487018585205,
"loss": 1.1111013889312744,
"memory(GiB)": 46.83,
"nll_loss": 0.42791634798049927,
"rewards/accuracies": 0.46875,
"rewards/chosen": -0.013819348067045212,
"rewards/margins": 0.08211039006710052,
"rewards/rejected": -0.09592973440885544,
"step": 12,
"train_speed(iter/s)": 0.005476
},
{
"epoch": 0.010488893371321953,
"grad_norm": 3.1733834743499756,
"learning_rate": 4.1935483870967746e-05,
"logits/chosen": -0.597683846950531,
"logits/rejected": -0.6003975868225098,
"logps/chosen": -7.611721038818359,
"logps/rejected": -13.589990615844727,
"loss": 0.9966970682144165,
"memory(GiB)": 46.83,
"nll_loss": 0.3590569496154785,
"rewards/accuracies": 0.65625,
"rewards/chosen": 0.09378139674663544,
"rewards/margins": 0.16571055352687836,
"rewards/rejected": -0.07192917168140411,
"step": 13,
"train_speed(iter/s)": 0.005488
},
{
"epoch": 0.011295731322962103,
"grad_norm": 5.364157676696777,
"learning_rate": 4.516129032258064e-05,
"logits/chosen": -0.5847792029380798,
"logits/rejected": -0.5856592655181885,
"logps/chosen": -11.617069244384766,
"logps/rejected": -11.611367225646973,
"loss": 1.2788419723510742,
"memory(GiB)": 46.83,
"nll_loss": 0.5410674214363098,
"rewards/accuracies": 0.46875,
"rewards/chosen": 0.037577953189611435,
"rewards/margins": -0.04553454369306564,
"rewards/rejected": 0.08311249315738678,
"step": 14,
"train_speed(iter/s)": 0.005494
},
{
"epoch": 0.012102569274602255,
"grad_norm": 3.436879873275757,
"learning_rate": 4.8387096774193554e-05,
"logits/chosen": -0.5832479596138,
"logits/rejected": -0.5832363367080688,
"logps/chosen": -9.650967597961426,
"logps/rejected": -11.376352310180664,
"loss": 1.0634793043136597,
"memory(GiB)": 46.83,
"nll_loss": 0.34024038910865784,
"rewards/accuracies": 0.53125,
"rewards/chosen": 0.05362201854586601,
"rewards/margins": -0.029222950339317322,
"rewards/rejected": 0.08284495770931244,
"step": 15,
"train_speed(iter/s)": 0.005497
},
{
"epoch": 0.012909407226242404,
"grad_norm": 3.2199597358703613,
"learning_rate": 5.161290322580645e-05,
"logits/chosen": -0.6036816239356995,
"logits/rejected": -0.606670618057251,
"logps/chosen": -10.059551239013672,
"logps/rejected": -16.143247604370117,
"loss": 1.0622740983963013,
"memory(GiB)": 46.83,
"nll_loss": 0.3808459937572479,
"rewards/accuracies": 0.625,
"rewards/chosen": 0.11249684542417526,
"rewards/margins": 0.040876831859350204,
"rewards/rejected": 0.07162001729011536,
"step": 16,
"train_speed(iter/s)": 0.00549
},
{
"epoch": 0.013716245177882554,
"grad_norm": 3.376516819000244,
"learning_rate": 5.4838709677419355e-05,
"logits/chosen": -0.5811513662338257,
"logits/rejected": -0.5822936296463013,
"logps/chosen": -10.964933395385742,
"logps/rejected": -13.541594505310059,
"loss": 1.1284891366958618,
"memory(GiB)": 46.83,
"nll_loss": 0.43761852383613586,
"rewards/accuracies": 0.5,
"rewards/chosen": 0.11780606210231781,
"rewards/margins": 0.02046366035938263,
"rewards/rejected": 0.09734240174293518,
"step": 17,
"train_speed(iter/s)": 0.005493
},
{
"epoch": 0.014523083129522704,
"grad_norm": 3.292140245437622,
"learning_rate": 5.8064516129032266e-05,
"logits/chosen": -0.5822582840919495,
"logits/rejected": -0.5867500305175781,
"logps/chosen": -8.11985969543457,
"logps/rejected": -14.659163475036621,
"loss": 1.0471278429031372,
"memory(GiB)": 46.83,
"nll_loss": 0.40266352891921997,
"rewards/accuracies": 0.65625,
"rewards/chosen": 0.14493001997470856,
"rewards/margins": 0.1153046265244484,
"rewards/rejected": 0.029625393450260162,
"step": 18,
"train_speed(iter/s)": 0.005497
},
{
"epoch": 0.015329921081162856,
"grad_norm": 3.320802688598633,
"learning_rate": 6.129032258064517e-05,
"logits/chosen": -0.5760956406593323,
"logits/rejected": -0.5776647925376892,
"logps/chosen": -9.478979110717773,
"logps/rejected": -11.301219940185547,
"loss": 1.1243548393249512,
"memory(GiB)": 46.83,
"nll_loss": 0.48838871717453003,
"rewards/accuracies": 0.6875,
"rewards/chosen": 0.20540697872638702,
"rewards/margins": 0.14464649558067322,
"rewards/rejected": 0.06076047942042351,
"step": 19,
"train_speed(iter/s)": 0.005493
},
{
"epoch": 0.016136759032803004,
"grad_norm": 2.7910656929016113,
"learning_rate": 6.451612903225807e-05,
"logits/chosen": -0.5840404033660889,
"logits/rejected": -0.582589864730835,
"logps/chosen": -13.635812759399414,
"logps/rejected": -10.431557655334473,
"loss": 1.2548669576644897,
"memory(GiB)": 46.83,
"nll_loss": 0.55869460105896,
"rewards/accuracies": 0.4375,
"rewards/chosen": 0.13213564455509186,
"rewards/margins": 0.044300854206085205,
"rewards/rejected": 0.08783479034900665,
"step": 20,
"train_speed(iter/s)": 0.005497
},
{
"epoch": 0.016943596984443157,
"grad_norm": 2.2573604583740234,
"learning_rate": 6.774193548387096e-05,
"logits/chosen": -0.5839393734931946,
"logits/rejected": -0.5850896835327148,
"logps/chosen": -7.3839006423950195,
"logps/rejected": -9.574810028076172,
"loss": 0.9415242075920105,
"memory(GiB)": 46.83,
"nll_loss": 0.372197687625885,
"rewards/accuracies": 0.75,
"rewards/chosen": 0.2435840666294098,
"rewards/margins": 0.30735281109809875,
"rewards/rejected": -0.06376874446868896,
"step": 21,
"train_speed(iter/s)": 0.005504
},
{
"epoch": 0.017750434936083307,
"grad_norm": 2.90157413482666,
"learning_rate": 7.096774193548388e-05,
"logits/chosen": -0.6114062070846558,
"logits/rejected": -0.6119735240936279,
"logps/chosen": -8.486170768737793,
"logps/rejected": -12.086725234985352,
"loss": 1.0081067085266113,
"memory(GiB)": 46.83,
"nll_loss": 0.34981024265289307,
"rewards/accuracies": 0.5625,
"rewards/chosen": 0.10258002579212189,
"rewards/margins": 0.12462681531906128,
"rewards/rejected": -0.02204679138958454,
"step": 22,
"train_speed(iter/s)": 0.005501
},
{
"epoch": 0.018557272887723457,
"grad_norm": 2.4457335472106934,
"learning_rate": 7.419354838709677e-05,
"logits/chosen": -0.5648061037063599,
"logits/rejected": -0.5674125552177429,
"logps/chosen": -12.962445259094238,
"logps/rejected": -15.476969718933105,
"loss": 1.0199884176254272,
"memory(GiB)": 46.83,
"nll_loss": 0.4421077072620392,
"rewards/accuracies": 0.6875,
"rewards/chosen": 0.13948869705200195,
"rewards/margins": 0.31703731417655945,
"rewards/rejected": -0.17754864692687988,
"step": 23,
"train_speed(iter/s)": 0.005504
},
{
"epoch": 0.019364110839363607,
"grad_norm": 2.250957489013672,
"learning_rate": 7.741935483870968e-05,
"logits/chosen": -0.5476934313774109,
"logits/rejected": -0.5497113466262817,
"logps/chosen": -6.839375972747803,
"logps/rejected": -12.336576461791992,
"loss": 0.9127413630485535,
"memory(GiB)": 46.83,
"nll_loss": 0.3841688632965088,
"rewards/accuracies": 0.78125,
"rewards/chosen": 0.2666690945625305,
"rewards/margins": 0.42246347665786743,
"rewards/rejected": -0.1557943969964981,
"step": 24,
"train_speed(iter/s)": 0.005505
},
{
"epoch": 0.020170948791003757,
"grad_norm": 3.6742801666259766,
"learning_rate": 8.064516129032258e-05,
"logits/chosen": -0.5886849164962769,
"logits/rejected": -0.5897050499916077,
"logps/chosen": -8.534127235412598,
"logps/rejected": -11.815479278564453,
"loss": 1.0272297859191895,
"memory(GiB)": 46.83,
"nll_loss": 0.41876962780952454,
"rewards/accuracies": 0.625,
"rewards/chosen": 0.13335689902305603,
"rewards/margins": 0.27482476830482483,
"rewards/rejected": -0.1414678543806076,
"step": 25,
"train_speed(iter/s)": 0.005513
},
{
"epoch": 0.020977786742643906,
"grad_norm": 2.5902981758117676,
"learning_rate": 8.387096774193549e-05,
"logits/chosen": -0.5303969979286194,
"logits/rejected": -0.5350589752197266,
"logps/chosen": -9.592369079589844,
"logps/rejected": -17.837379455566406,
"loss": 0.9073010087013245,
"memory(GiB)": 46.83,
"nll_loss": 0.3275393545627594,
"rewards/accuracies": 0.75,
"rewards/chosen": 0.1778128743171692,
"rewards/margins": 0.31808584928512573,
"rewards/rejected": -0.14027300477027893,
"step": 26,
"train_speed(iter/s)": 0.005509
},
{
"epoch": 0.021784624694284056,
"grad_norm": 3.656003952026367,
"learning_rate": 8.709677419354839e-05,
"logits/chosen": -0.5741274356842041,
"logits/rejected": -0.5759863257408142,
"logps/chosen": -7.401767253875732,
"logps/rejected": -9.595519065856934,
"loss": 0.9837043881416321,
"memory(GiB)": 46.83,
"nll_loss": 0.34733644127845764,
"rewards/accuracies": 0.6875,
"rewards/chosen": 0.16637372970581055,
"rewards/margins": 0.22424587607383728,
"rewards/rejected": -0.05787213519215584,
"step": 27,
"train_speed(iter/s)": 0.00551
},
{
"epoch": 0.022591462645924206,
"grad_norm": 3.6425983905792236,
"learning_rate": 9.032258064516129e-05,
"logits/chosen": -0.5271302461624146,
"logits/rejected": -0.5281438231468201,
"logps/chosen": -10.050779342651367,
"logps/rejected": -13.247575759887695,
"loss": 1.0190500020980835,
"memory(GiB)": 46.83,
"nll_loss": 0.4030058681964874,
"rewards/accuracies": 0.625,
"rewards/chosen": 0.022431861609220505,
"rewards/margins": 0.22834232449531555,
"rewards/rejected": -0.20591047406196594,
"step": 28,
"train_speed(iter/s)": 0.005522
},
{
"epoch": 0.02339830059756436,
"grad_norm": 4.539236545562744,
"learning_rate": 9.35483870967742e-05,
"logits/chosen": -0.574794352054596,
"logits/rejected": -0.5771020650863647,
"logps/chosen": -7.9426727294921875,
"logps/rejected": -11.816813468933105,
"loss": 1.0435985326766968,
"memory(GiB)": 46.83,
"nll_loss": 0.4821586310863495,
"rewards/accuracies": 0.6875,
"rewards/chosen": 0.17023718357086182,
"rewards/margins": 0.36495453119277954,
"rewards/rejected": -0.19471733272075653,
"step": 29,
"train_speed(iter/s)": 0.005525
},
{
"epoch": 0.02420513854920451,
"grad_norm": 3.463172674179077,
"learning_rate": 9.677419354838711e-05,
"logits/chosen": -0.5663347244262695,
"logits/rejected": -0.5671164393424988,
"logps/chosen": -8.761878967285156,
"logps/rejected": -16.922607421875,
"loss": 0.8841907978057861,
"memory(GiB)": 46.83,
"nll_loss": 0.37557756900787354,
"rewards/accuracies": 0.8125,
"rewards/chosen": 0.23288068175315857,
"rewards/margins": 0.47043219208717346,
"rewards/rejected": -0.2375514954328537,
"step": 30,
"train_speed(iter/s)": 0.005522
},
{
"epoch": 0.02501197650084466,
"grad_norm": 7.054537296295166,
"learning_rate": 0.0001,
"logits/chosen": -0.5485356450080872,
"logits/rejected": -0.5510388612747192,
"logps/chosen": -8.1714506149292,
"logps/rejected": -15.964082717895508,
"loss": 1.0905145406723022,
"memory(GiB)": 46.83,
"nll_loss": 0.48109474778175354,
"rewards/accuracies": 0.65625,
"rewards/chosen": 0.14875195920467377,
"rewards/margins": 0.23288127779960632,
"rewards/rejected": -0.08412933349609375,
"step": 31,
"train_speed(iter/s)": 0.005519
},
{
"epoch": 0.02581881445248481,
"grad_norm": 2.8915627002716064,
"learning_rate": 0.0001032258064516129,
"logits/chosen": -0.5415224432945251,
"logits/rejected": -0.5406837463378906,
"logps/chosen": -12.312981605529785,
"logps/rejected": -14.444657325744629,
"loss": 0.9778124094009399,
"memory(GiB)": 46.83,
"nll_loss": 0.4027611017227173,
"rewards/accuracies": 0.71875,
"rewards/chosen": 0.11852823942899704,
"rewards/margins": 0.3213120102882385,
"rewards/rejected": -0.2027837634086609,
"step": 32,
"train_speed(iter/s)": 0.005515
},
{
"epoch": 0.02662565240412496,
"grad_norm": 4.721103191375732,
"learning_rate": 0.0001064516129032258,
"logits/chosen": -0.5442328453063965,
"logits/rejected": -0.5437616109848022,
"logps/chosen": -9.491182327270508,
"logps/rejected": -18.31528663635254,
"loss": 1.1582751274108887,
"memory(GiB)": 46.83,
"nll_loss": 0.5736849904060364,
"rewards/accuracies": 0.75,
"rewards/chosen": 0.03584306687116623,
"rewards/margins": 0.35881760716438293,
"rewards/rejected": -0.3229745626449585,
"step": 33,
"train_speed(iter/s)": 0.005515
},
{
"epoch": 0.02743249035576511,
"grad_norm": 4.470694065093994,
"learning_rate": 0.00010967741935483871,
"logits/chosen": -0.49901843070983887,
"logits/rejected": -0.5027262568473816,
"logps/chosen": -6.029642105102539,
"logps/rejected": -17.065149307250977,
"loss": 0.7831717133522034,
"memory(GiB)": 46.83,
"nll_loss": 0.2735077142715454,
"rewards/accuracies": 0.6875,
"rewards/chosen": 0.172469824552536,
"rewards/margins": 0.6490951180458069,
"rewards/rejected": -0.4766252934932709,
"step": 34,
"train_speed(iter/s)": 0.005511
},
{
"epoch": 0.02823932830740526,
"grad_norm": 4.086674690246582,
"learning_rate": 0.00011290322580645163,
"logits/chosen": -0.5251173377037048,
"logits/rejected": -0.5295683145523071,
"logps/chosen": -10.127384185791016,
"logps/rejected": -19.261646270751953,
"loss": 0.90782630443573,
"memory(GiB)": 46.83,
"nll_loss": 0.37643295526504517,
"rewards/accuracies": 0.71875,
"rewards/chosen": 0.059490665793418884,
"rewards/margins": 0.5788955688476562,
"rewards/rejected": -0.5194048881530762,
"step": 35,
"train_speed(iter/s)": 0.005516
},
{
"epoch": 0.02904616625904541,
"grad_norm": 3.153599977493286,
"learning_rate": 0.00011612903225806453,
"logits/chosen": -0.5580551624298096,
"logits/rejected": -0.561299741268158,
"logps/chosen": -7.748661518096924,
"logps/rejected": -18.775835037231445,
"loss": 0.8323644995689392,
"memory(GiB)": 46.83,
"nll_loss": 0.30874526500701904,
"rewards/accuracies": 0.75,
"rewards/chosen": 0.17774799466133118,
"rewards/margins": 0.58444744348526,
"rewards/rejected": -0.4066994786262512,
"step": 36,
"train_speed(iter/s)": 0.005518
},
{
"epoch": 0.02985300421068556,
"grad_norm": 5.963130950927734,
"learning_rate": 0.00011935483870967743,
"logits/chosen": -0.5691896080970764,
"logits/rejected": -0.5704917907714844,
"logps/chosen": -5.695924282073975,
"logps/rejected": -15.709531784057617,
"loss": 0.8581907153129578,
"memory(GiB)": 46.83,
"nll_loss": 0.32061102986335754,
"rewards/accuracies": 0.75,
"rewards/chosen": 0.13813850283622742,
"rewards/margins": 0.42923206090927124,
"rewards/rejected": -0.2910935878753662,
"step": 37,
"train_speed(iter/s)": 0.005516
},
{
"epoch": 0.03065984216232571,
"grad_norm": 3.532068967819214,
"learning_rate": 0.00012258064516129034,
"logits/chosen": -0.5251184105873108,
"logits/rejected": -0.5261702537536621,
"logps/chosen": -8.303949356079102,
"logps/rejected": -13.649654388427734,
"loss": 0.9825394153594971,
"memory(GiB)": 46.83,
"nll_loss": 0.39365747570991516,
"rewards/accuracies": 0.65625,
"rewards/chosen": 0.07552488148212433,
"rewards/margins": 0.2995148003101349,
"rewards/rejected": -0.22398996353149414,
"step": 38,
"train_speed(iter/s)": 0.005515
},
{
"epoch": 0.03146668011396586,
"grad_norm": 2.9115569591522217,
"learning_rate": 0.00012580645161290322,
"logits/chosen": -0.5716837048530579,
"logits/rejected": -0.5749698281288147,
"logps/chosen": -7.206816673278809,
"logps/rejected": -15.77934741973877,
"loss": 0.7430101633071899,
"memory(GiB)": 46.83,
"nll_loss": 0.27266308665275574,
"rewards/accuracies": 0.90625,
"rewards/chosen": 0.20229285955429077,
"rewards/margins": 0.6254266500473022,
"rewards/rejected": -0.42313385009765625,
"step": 39,
"train_speed(iter/s)": 0.005515
},
{
"epoch": 0.03227351806560601,
"grad_norm": 4.647506237030029,
"learning_rate": 0.00012903225806451613,
"logits/chosen": -0.5296156406402588,
"logits/rejected": -0.5295798778533936,
"logps/chosen": -10.529404640197754,
"logps/rejected": -16.44548988342285,
"loss": 0.900071918964386,
"memory(GiB)": 46.83,
"nll_loss": 0.3727172613143921,
"rewards/accuracies": 0.71875,
"rewards/chosen": 0.08702702820301056,
"rewards/margins": 0.4926542341709137,
"rewards/rejected": -0.40562722086906433,
"step": 40,
"train_speed(iter/s)": 0.005514
},
{
"epoch": 0.03308035601724616,
"grad_norm": 3.4815561771392822,
"learning_rate": 0.00013225806451612905,
"logits/chosen": -0.5586342811584473,
"logits/rejected": -0.5603877305984497,
"logps/chosen": -7.803877830505371,
"logps/rejected": -18.412734985351562,
"loss": 0.8854644298553467,
"memory(GiB)": 46.83,
"nll_loss": 0.37826117873191833,
"rewards/accuracies": 0.78125,
"rewards/chosen": 0.08443664014339447,
"rewards/margins": 0.6363339424133301,
"rewards/rejected": -0.5518972873687744,
"step": 41,
"train_speed(iter/s)": 0.005514
},
{
"epoch": 0.033887193968886314,
"grad_norm": 3.6079483032226562,
"learning_rate": 0.00013548387096774193,
"logits/chosen": -0.5233692526817322,
"logits/rejected": -0.5257354378700256,
"logps/chosen": -11.989986419677734,
"logps/rejected": -17.48329734802246,
"loss": 0.9667509198188782,
"memory(GiB)": 46.83,
"nll_loss": 0.4528670608997345,
"rewards/accuracies": 0.8125,
"rewards/chosen": 0.14738641679286957,
"rewards/margins": 0.5997685194015503,
"rewards/rejected": -0.4523821473121643,
"step": 42,
"train_speed(iter/s)": 0.005512
},
{
"epoch": 0.03469403192052646,
"grad_norm": 5.491096019744873,
"learning_rate": 0.00013870967741935487,
"logits/chosen": -0.5798231363296509,
"logits/rejected": -0.5843824148178101,
"logps/chosen": -8.180625915527344,
"logps/rejected": -19.614505767822266,
"loss": 1.0811830759048462,
"memory(GiB)": 46.83,
"nll_loss": 0.5651165246963501,
"rewards/accuracies": 0.75,
"rewards/chosen": 0.018763888627290726,
"rewards/margins": 0.5782932043075562,
"rewards/rejected": -0.5595293641090393,
"step": 43,
"train_speed(iter/s)": 0.005507
},
{
"epoch": 0.035500869872166614,
"grad_norm": 5.715328216552734,
"learning_rate": 0.00014193548387096775,
"logits/chosen": -0.5562050342559814,
"logits/rejected": -0.5585284233093262,
"logps/chosen": -9.799619674682617,
"logps/rejected": -13.962825775146484,
"loss": 1.046175479888916,
"memory(GiB)": 46.83,
"nll_loss": 0.5247361660003662,
"rewards/accuracies": 0.6875,
"rewards/chosen": 0.0660993829369545,
"rewards/margins": 0.557608425617218,
"rewards/rejected": -0.4915090799331665,
"step": 44,
"train_speed(iter/s)": 0.005509
},
{
"epoch": 0.03630770782380676,
"grad_norm": 4.065413951873779,
"learning_rate": 0.00014516129032258066,
"logits/chosen": -0.5717958807945251,
"logits/rejected": -0.5754877924919128,
"logps/chosen": -10.432125091552734,
"logps/rejected": -17.75714111328125,
"loss": 0.9775079488754272,
"memory(GiB)": 46.83,
"nll_loss": 0.4804929792881012,
"rewards/accuracies": 0.71875,
"rewards/chosen": 0.16446207463741302,
"rewards/margins": 0.5844215154647827,
"rewards/rejected": -0.4199594557285309,
"step": 45,
"train_speed(iter/s)": 0.005513
},
{
"epoch": 0.037114545775446914,
"grad_norm": 4.507160663604736,
"learning_rate": 0.00014838709677419355,
"logits/chosen": -0.5544827580451965,
"logits/rejected": -0.5517963171005249,
"logps/chosen": -10.039278030395508,
"logps/rejected": -16.44822120666504,
"loss": 0.9198786020278931,
"memory(GiB)": 46.83,
"nll_loss": 0.3649781346321106,
"rewards/accuracies": 0.6875,
"rewards/chosen": 0.11493994295597076,
"rewards/margins": 0.5548471808433533,
"rewards/rejected": -0.4399072825908661,
"step": 46,
"train_speed(iter/s)": 0.005512
},
{
"epoch": 0.03792138372708706,
"grad_norm": 4.040234565734863,
"learning_rate": 0.00015161290322580646,
"logits/chosen": -0.5704259276390076,
"logits/rejected": -0.5716680884361267,
"logps/chosen": -7.400537967681885,
"logps/rejected": -17.6054744720459,
"loss": 0.9134971499443054,
"memory(GiB)": 46.83,
"nll_loss": 0.3412809669971466,
"rewards/accuracies": 0.78125,
"rewards/chosen": 0.03388240188360214,
"rewards/margins": 0.4440326392650604,
"rewards/rejected": -0.4101502001285553,
"step": 47,
"train_speed(iter/s)": 0.005512
},
{
"epoch": 0.038728221678727213,
"grad_norm": 2.9642419815063477,
"learning_rate": 0.00015483870967741937,
"logits/chosen": -0.5867742300033569,
"logits/rejected": -0.5912387371063232,
"logps/chosen": -9.146940231323242,
"logps/rejected": -16.374706268310547,
"loss": 0.9059248566627502,
"memory(GiB)": 46.83,
"nll_loss": 0.3897300958633423,
"rewards/accuracies": 0.78125,
"rewards/chosen": 0.1047089472413063,
"rewards/margins": 0.5065208673477173,
"rewards/rejected": -0.4018118679523468,
"step": 48,
"train_speed(iter/s)": 0.005514
},
{
"epoch": 0.03953505963036737,
"grad_norm": 3.087217330932617,
"learning_rate": 0.00015806451612903225,
"logits/chosen": -0.5874481201171875,
"logits/rejected": -0.5872229337692261,
"logps/chosen": -6.086337566375732,
"logps/rejected": -10.504037857055664,
"loss": 0.8798851370811462,
"memory(GiB)": 46.83,
"nll_loss": 0.33263421058654785,
"rewards/accuracies": 0.6875,
"rewards/chosen": 0.20601165294647217,
"rewards/margins": 0.4658709466457367,
"rewards/rejected": -0.2598593533039093,
"step": 49,
"train_speed(iter/s)": 0.005513
},
{
"epoch": 0.04034189758200751,
"grad_norm": 3.16754150390625,
"learning_rate": 0.00016129032258064516,
"logits/chosen": -0.5708128809928894,
"logits/rejected": -0.5798742175102234,
"logps/chosen": -6.393083572387695,
"logps/rejected": -19.668724060058594,
"loss": 0.8404853343963623,
"memory(GiB)": 46.83,
"nll_loss": 0.34996694326400757,
"rewards/accuracies": 0.84375,
"rewards/chosen": 0.21206828951835632,
"rewards/margins": 0.5756057500839233,
"rewards/rejected": -0.363537460565567,
"step": 50,
"train_speed(iter/s)": 0.005516
},
{
"epoch": 0.041148735533647667,
"grad_norm": 2.4009766578674316,
"learning_rate": 0.00016451612903225807,
"logits/chosen": -0.5599406361579895,
"logits/rejected": -0.5625043511390686,
"logps/chosen": -7.262391090393066,
"logps/rejected": -15.73720932006836,
"loss": 0.8113247752189636,
"memory(GiB)": 46.83,
"nll_loss": 0.28076890110969543,
"rewards/accuracies": 0.8125,
"rewards/chosen": 0.14269490540027618,
"rewards/margins": 0.47564250230789185,
"rewards/rejected": -0.33294758200645447,
"step": 51,
"train_speed(iter/s)": 0.005506
},
{
"epoch": 0.04195557348528781,
"grad_norm": 3.129634380340576,
"learning_rate": 0.00016774193548387098,
"logits/chosen": -0.5937235355377197,
"logits/rejected": -0.5938248038291931,
"logps/chosen": -5.393199920654297,
"logps/rejected": -15.786672592163086,
"loss": 0.7831435799598694,
"memory(GiB)": 46.83,
"nll_loss": 0.2872075140476227,
"rewards/accuracies": 0.8125,
"rewards/chosen": 0.19873687624931335,
"rewards/margins": 0.5569283366203308,
"rewards/rejected": -0.35819149017333984,
"step": 52,
"train_speed(iter/s)": 0.005507
},
{
"epoch": 0.042762411436927966,
"grad_norm": 3.2887256145477295,
"learning_rate": 0.0001709677419354839,
"logits/chosen": -0.5820189118385315,
"logits/rejected": -0.5850119590759277,
"logps/chosen": -7.764882564544678,
"logps/rejected": -16.894685745239258,
"loss": 0.8994213342666626,
"memory(GiB)": 46.83,
"nll_loss": 0.3770924210548401,
"rewards/accuracies": 0.6875,
"rewards/chosen": 0.20706558227539062,
"rewards/margins": 0.5472366213798523,
"rewards/rejected": -0.34017103910446167,
"step": 53,
"train_speed(iter/s)": 0.005506
},
{
"epoch": 0.04356924938856811,
"grad_norm": 3.7313735485076904,
"learning_rate": 0.00017419354838709678,
"logits/chosen": -0.5833962559700012,
"logits/rejected": -0.5876143574714661,
"logps/chosen": -8.130949020385742,
"logps/rejected": -20.79953384399414,
"loss": 0.9545141458511353,
"memory(GiB)": 46.83,
"nll_loss": 0.4539381265640259,
"rewards/accuracies": 0.75,
"rewards/chosen": 0.10515612363815308,
"rewards/margins": 0.612572968006134,
"rewards/rejected": -0.5074167847633362,
"step": 54,
"train_speed(iter/s)": 0.005507
},
{
"epoch": 0.044376087340208266,
"grad_norm": 5.652868747711182,
"learning_rate": 0.0001774193548387097,
"logits/chosen": -0.5960416793823242,
"logits/rejected": -0.5957224369049072,
"logps/chosen": -12.674562454223633,
"logps/rejected": -15.591826438903809,
"loss": 1.1736092567443848,
"memory(GiB)": 46.83,
"nll_loss": 0.5310375690460205,
"rewards/accuracies": 0.625,
"rewards/chosen": -0.11839848756790161,
"rewards/margins": 0.40016603469848633,
"rewards/rejected": -0.5185645222663879,
"step": 55,
"train_speed(iter/s)": 0.005509
},
{
"epoch": 0.04518292529184841,
"grad_norm": 4.002370834350586,
"learning_rate": 0.00018064516129032257,
"logits/chosen": -0.5776931643486023,
"logits/rejected": -0.5789185166358948,
"logps/chosen": -12.67449951171875,
"logps/rejected": -16.919376373291016,
"loss": 1.087173342704773,
"memory(GiB)": 46.83,
"nll_loss": 0.4873568117618561,
"rewards/accuracies": 0.65625,
"rewards/chosen": -0.15739397704601288,
"rewards/margins": 0.39120250940322876,
"rewards/rejected": -0.5485965013504028,
"step": 56,
"train_speed(iter/s)": 0.005507
},
{
"epoch": 0.045989763243488566,
"grad_norm": 3.5529890060424805,
"learning_rate": 0.00018387096774193548,
"logits/chosen": -0.5732367634773254,
"logits/rejected": -0.5760124921798706,
"logps/chosen": -4.22891902923584,
"logps/rejected": -18.773733139038086,
"loss": 0.6395769119262695,
"memory(GiB)": 46.83,
"nll_loss": 0.23632453382015228,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.12576641142368317,
"rewards/margins": 0.908116340637207,
"rewards/rejected": -0.7823498845100403,
"step": 57,
"train_speed(iter/s)": 0.005505
},
{
"epoch": 0.04679660119512872,
"grad_norm": 2.638253927230835,
"learning_rate": 0.0001870967741935484,
"logits/chosen": -0.5618959069252014,
"logits/rejected": -0.5671476721763611,
"logps/chosen": -8.717156410217285,
"logps/rejected": -22.3723087310791,
"loss": 0.8119103312492371,
"memory(GiB)": 46.83,
"nll_loss": 0.4192086458206177,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.18826748430728912,
"rewards/margins": 0.8515651226043701,
"rewards/rejected": -0.6632976531982422,
"step": 58,
"train_speed(iter/s)": 0.005503
},
{
"epoch": 0.047603439146768865,
"grad_norm": 4.416356086730957,
"learning_rate": 0.0001903225806451613,
"logits/chosen": -0.5946109294891357,
"logits/rejected": -0.5949057340621948,
"logps/chosen": -10.825102806091309,
"logps/rejected": -15.580466270446777,
"loss": 0.9124961495399475,
"memory(GiB)": 46.83,
"nll_loss": 0.43738603591918945,
"rewards/accuracies": 0.78125,
"rewards/chosen": 0.1081230640411377,
"rewards/margins": 0.6975550651550293,
"rewards/rejected": -0.5894321203231812,
"step": 59,
"train_speed(iter/s)": 0.005503
},
{
"epoch": 0.04841027709840902,
"grad_norm": 3.548480272293091,
"learning_rate": 0.00019354838709677422,
"logits/chosen": -0.576353907585144,
"logits/rejected": -0.5807583928108215,
"logps/chosen": -10.603282928466797,
"logps/rejected": -20.904390335083008,
"loss": 1.033903956413269,
"memory(GiB)": 46.83,
"nll_loss": 0.5458623170852661,
"rewards/accuracies": 0.71875,
"rewards/chosen": 0.10141083598136902,
"rewards/margins": 0.9133819341659546,
"rewards/rejected": -0.8119711875915527,
"step": 60,
"train_speed(iter/s)": 0.005505
},
{
"epoch": 0.049217115050049165,
"grad_norm": 4.239978790283203,
"learning_rate": 0.0001967741935483871,
"logits/chosen": -0.6159774661064148,
"logits/rejected": -0.6157845258712769,
"logps/chosen": -13.034204483032227,
"logps/rejected": -21.466520309448242,
"loss": 0.9954748153686523,
"memory(GiB)": 46.83,
"nll_loss": 0.5168237090110779,
"rewards/accuracies": 0.8125,
"rewards/chosen": -0.15371613204479218,
"rewards/margins": 0.9087806940078735,
"rewards/rejected": -1.0624967813491821,
"step": 61,
"train_speed(iter/s)": 0.005508
},
{
"epoch": 0.05002395300168932,
"grad_norm": 4.418153285980225,
"learning_rate": 0.0002,
"logits/chosen": -0.586484968662262,
"logits/rejected": -0.5885915756225586,
"logps/chosen": -6.359810829162598,
"logps/rejected": -18.686431884765625,
"loss": 0.7993831634521484,
"memory(GiB)": 46.83,
"nll_loss": 0.3223803639411926,
"rewards/accuracies": 0.84375,
"rewards/chosen": 0.1565569043159485,
"rewards/margins": 0.8297788500785828,
"rewards/rejected": -0.6732219457626343,
"step": 62,
"train_speed(iter/s)": 0.005508
},
{
"epoch": 0.050830790953329465,
"grad_norm": 3.898704767227173,
"learning_rate": 0.00019999964378142156,
"logits/chosen": -0.5732013583183289,
"logits/rejected": -0.5774887800216675,
"logps/chosen": -12.98630142211914,
"logps/rejected": -19.34124755859375,
"loss": 0.9075384140014648,
"memory(GiB)": 46.83,
"nll_loss": 0.39192017912864685,
"rewards/accuracies": 0.75,
"rewards/chosen": 0.19289077818393707,
"rewards/margins": 0.6732712388038635,
"rewards/rejected": -0.48038047552108765,
"step": 63,
"train_speed(iter/s)": 0.005507
},
{
"epoch": 0.05163762890496962,
"grad_norm": 6.278528213500977,
"learning_rate": 0.00019999857512822402,
"logits/chosen": -0.6075332760810852,
"logits/rejected": -0.6084203124046326,
"logps/chosen": -14.246075630187988,
"logps/rejected": -20.948959350585938,
"loss": 1.0685752630233765,
"memory(GiB)": 46.83,
"nll_loss": 0.5815572142601013,
"rewards/accuracies": 0.71875,
"rewards/chosen": -0.03303433582186699,
"rewards/margins": 0.8266364336013794,
"rewards/rejected": -0.8596707582473755,
"step": 64,
"train_speed(iter/s)": 0.005508
},
{
"epoch": 0.052444466856609764,
"grad_norm": 4.589393615722656,
"learning_rate": 0.00019999679404802089,
"logits/chosen": -0.596097469329834,
"logits/rejected": -0.5986034870147705,
"logps/chosen": -8.450502395629883,
"logps/rejected": -21.070066452026367,
"loss": 0.7867013812065125,
"memory(GiB)": 46.83,
"nll_loss": 0.31530463695526123,
"rewards/accuracies": 0.84375,
"rewards/chosen": 0.13920006155967712,
"rewards/margins": 0.9423296451568604,
"rewards/rejected": -0.8031294941902161,
"step": 65,
"train_speed(iter/s)": 0.005508
},
{
"epoch": 0.05325130480824992,
"grad_norm": 4.376217365264893,
"learning_rate": 0.00019999430055350122,
"logits/chosen": -0.5758836269378662,
"logits/rejected": -0.5734565854072571,
"logps/chosen": -10.774827003479004,
"logps/rejected": -19.021907806396484,
"loss": 0.7909982800483704,
"memory(GiB)": 46.83,
"nll_loss": 0.3997192680835724,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.23606787621974945,
"rewards/margins": 1.0521141290664673,
"rewards/rejected": -0.8160461783409119,
"step": 66,
"train_speed(iter/s)": 0.005507
},
{
"epoch": 0.05405814275989007,
"grad_norm": 6.438971042633057,
"learning_rate": 0.00019999109466242962,
"logits/chosen": -0.5718088150024414,
"logits/rejected": -0.5745964050292969,
"logps/chosen": -6.671931266784668,
"logps/rejected": -20.429231643676758,
"loss": 0.8954067230224609,
"memory(GiB)": 46.83,
"nll_loss": 0.45071539282798767,
"rewards/accuracies": 0.8125,
"rewards/chosen": 0.10935470461845398,
"rewards/margins": 0.8583554029464722,
"rewards/rejected": -0.7490006685256958,
"step": 67,
"train_speed(iter/s)": 0.005509
},
{
"epoch": 0.05486498071153022,
"grad_norm": 11.16286849975586,
"learning_rate": 0.00019998717639764602,
"logits/chosen": -0.5820534229278564,
"logits/rejected": -0.5849663019180298,
"logps/chosen": -9.799468040466309,
"logps/rejected": -18.977890014648438,
"loss": 1.29269278049469,
"memory(GiB)": 46.83,
"nll_loss": 0.7049438953399658,
"rewards/accuracies": 0.6875,
"rewards/chosen": -0.04825415089726448,
"rewards/margins": 0.5465254783630371,
"rewards/rejected": -0.5947796702384949,
"step": 68,
"train_speed(iter/s)": 0.005506
},
{
"epoch": 0.05567181866317037,
"grad_norm": 9.413622856140137,
"learning_rate": 0.00019998254578706563,
"logits/chosen": -0.5850585699081421,
"logits/rejected": -0.5874402523040771,
"logps/chosen": -8.903966903686523,
"logps/rejected": -14.843938827514648,
"loss": 1.3027069568634033,
"memory(GiB)": 46.83,
"nll_loss": 0.744307279586792,
"rewards/accuracies": 0.78125,
"rewards/chosen": -0.0512365885078907,
"rewards/margins": 0.5854336619377136,
"rewards/rejected": -0.6366702318191528,
"step": 69,
"train_speed(iter/s)": 0.005505
},
{
"epoch": 0.05647865661481052,
"grad_norm": 7.333382606506348,
"learning_rate": 0.00019997720286367863,
"logits/chosen": -0.545200765132904,
"logits/rejected": -0.5484716296195984,
"logps/chosen": -7.334113121032715,
"logps/rejected": -22.56316375732422,
"loss": 1.0189334154129028,
"memory(GiB)": 46.83,
"nll_loss": 0.5383400321006775,
"rewards/accuracies": 0.84375,
"rewards/chosen": 0.061847541481256485,
"rewards/margins": 0.6559779644012451,
"rewards/rejected": -0.5941305160522461,
"step": 70,
"train_speed(iter/s)": 0.005506
},
{
"epoch": 0.05728549456645067,
"grad_norm": 2.8849799633026123,
"learning_rate": 0.00019997114766554997,
"logits/chosen": -0.5629354119300842,
"logits/rejected": -0.5669021606445312,
"logps/chosen": -8.698752403259277,
"logps/rejected": -21.85867691040039,
"loss": 0.8375651836395264,
"memory(GiB)": 46.83,
"nll_loss": 0.3549819886684418,
"rewards/accuracies": 0.78125,
"rewards/chosen": 0.09854352474212646,
"rewards/margins": 0.7027413845062256,
"rewards/rejected": -0.6041979193687439,
"step": 71,
"train_speed(iter/s)": 0.005507
},
{
"epoch": 0.05809233251809082,
"grad_norm": 2.6733391284942627,
"learning_rate": 0.00019996438023581913,
"logits/chosen": -0.5319232940673828,
"logits/rejected": -0.5331096649169922,
"logps/chosen": -10.13166332244873,
"logps/rejected": -13.18635368347168,
"loss": 1.014970302581787,
"memory(GiB)": 46.83,
"nll_loss": 0.4217461347579956,
"rewards/accuracies": 0.71875,
"rewards/chosen": 0.14793364703655243,
"rewards/margins": 0.3788456618785858,
"rewards/rejected": -0.2309119999408722,
"step": 72,
"train_speed(iter/s)": 0.005505
},
{
"epoch": 0.05889917046973097,
"grad_norm": 2.497257947921753,
"learning_rate": 0.00019995690062269984,
"logits/chosen": -0.5789859294891357,
"logits/rejected": -0.5805359482765198,
"logps/chosen": -8.139568328857422,
"logps/rejected": -10.85029411315918,
"loss": 0.9546566605567932,
"memory(GiB)": 46.83,
"nll_loss": 0.4216194450855255,
"rewards/accuracies": 0.65625,
"rewards/chosen": 0.24104151129722595,
"rewards/margins": 0.5254760980606079,
"rewards/rejected": -0.28443461656570435,
"step": 73,
"train_speed(iter/s)": 0.005506
},
{
"epoch": 0.05970600842137112,
"grad_norm": 2.8535268306732178,
"learning_rate": 0.00019994870887947962,
"logits/chosen": -0.5778383612632751,
"logits/rejected": -0.5768096446990967,
"logps/chosen": -8.49053955078125,
"logps/rejected": -12.854878425598145,
"loss": 1.0000758171081543,
"memory(GiB)": 46.83,
"nll_loss": 0.37848562002182007,
"rewards/accuracies": 0.625,
"rewards/chosen": 0.1054978221654892,
"rewards/margins": 0.3462926149368286,
"rewards/rejected": -0.24079479277133942,
"step": 74,
"train_speed(iter/s)": 0.005506
},
{
"epoch": 0.06051284637301127,
"grad_norm": 2.198607921600342,
"learning_rate": 0.00019993980506451947,
"logits/chosen": -0.530400276184082,
"logits/rejected": -0.530858039855957,
"logps/chosen": -9.152666091918945,
"logps/rejected": -11.464343070983887,
"loss": 0.9745745658874512,
"memory(GiB)": 46.83,
"nll_loss": 0.38881367444992065,
"rewards/accuracies": 0.75,
"rewards/chosen": 0.1783803254365921,
"rewards/margins": 0.3315035402774811,
"rewards/rejected": -0.1531231850385666,
"step": 75,
"train_speed(iter/s)": 0.005504
},
{
"epoch": 0.06131968432465142,
"grad_norm": 2.461601972579956,
"learning_rate": 0.0001999301892412535,
"logits/chosen": -0.5405219197273254,
"logits/rejected": -0.5390282869338989,
"logps/chosen": -10.537997245788574,
"logps/rejected": -15.066913604736328,
"loss": 0.966386079788208,
"memory(GiB)": 46.83,
"nll_loss": 0.38977545499801636,
"rewards/accuracies": 0.71875,
"rewards/chosen": 0.09291838109493256,
"rewards/margins": 0.3533533811569214,
"rewards/rejected": -0.26043495535850525,
"step": 76,
"train_speed(iter/s)": 0.005503
},
{
"epoch": 0.06212652227629157,
"grad_norm": 2.0999796390533447,
"learning_rate": 0.00019991986147818838,
"logits/chosen": -0.5443933010101318,
"logits/rejected": -0.5435047149658203,
"logps/chosen": -12.143755912780762,
"logps/rejected": -15.766691207885742,
"loss": 0.8939065337181091,
"memory(GiB)": 46.83,
"nll_loss": 0.415660560131073,
"rewards/accuracies": 0.90625,
"rewards/chosen": 0.23248028755187988,
"rewards/margins": 0.5352811217308044,
"rewards/rejected": -0.30280083417892456,
"step": 77,
"train_speed(iter/s)": 0.005502
},
{
"epoch": 0.06293336022793172,
"grad_norm": 2.9244306087493896,
"learning_rate": 0.00019990882184890295,
"logits/chosen": -0.5794655680656433,
"logits/rejected": -0.5853484869003296,
"logps/chosen": -7.884565353393555,
"logps/rejected": -20.136926651000977,
"loss": 0.8564450740814209,
"memory(GiB)": 46.83,
"nll_loss": 0.34705159068107605,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.14532405138015747,
"rewards/margins": 0.5069437623023987,
"rewards/rejected": -0.3616198003292084,
"step": 78,
"train_speed(iter/s)": 0.005502
},
{
"epoch": 0.06374019817957187,
"grad_norm": 3.461670160293579,
"learning_rate": 0.00019989707043204763,
"logits/chosen": -0.5491142868995667,
"logits/rejected": -0.553898811340332,
"logps/chosen": -7.547114372253418,
"logps/rejected": -18.740121841430664,
"loss": 0.9405392408370972,
"memory(GiB)": 46.83,
"nll_loss": 0.48508715629577637,
"rewards/accuracies": 0.84375,
"rewards/chosen": 0.128400981426239,
"rewards/margins": 0.6999501585960388,
"rewards/rejected": -0.5715491771697998,
"step": 79,
"train_speed(iter/s)": 0.005502
},
{
"epoch": 0.06454703613121202,
"grad_norm": 4.165892601013184,
"learning_rate": 0.0001998846073113439,
"logits/chosen": -0.6084208488464355,
"logits/rejected": -0.6092680096626282,
"logps/chosen": -12.750446319580078,
"logps/rejected": -19.53608512878418,
"loss": 1.0978946685791016,
"memory(GiB)": 46.83,
"nll_loss": 0.5877176523208618,
"rewards/accuracies": 0.75,
"rewards/chosen": 0.1369042694568634,
"rewards/margins": 0.6248282194137573,
"rewards/rejected": -0.48792392015457153,
"step": 80,
"train_speed(iter/s)": 0.005503
},
{
"epoch": 0.06535387408285218,
"grad_norm": 2.287846565246582,
"learning_rate": 0.00019987143257558365,
"logits/chosen": -0.59499192237854,
"logits/rejected": -0.5972949862480164,
"logps/chosen": -4.519835948944092,
"logps/rejected": -19.02901840209961,
"loss": 0.58124840259552,
"memory(GiB)": 46.83,
"nll_loss": 0.15051494538784027,
"rewards/accuracies": 0.84375,
"rewards/chosen": 0.19695766270160675,
"rewards/margins": 0.9730147123336792,
"rewards/rejected": -0.7760570049285889,
"step": 81,
"train_speed(iter/s)": 0.005506
},
{
"epoch": 0.06616071203449232,
"grad_norm": 7.103982448577881,
"learning_rate": 0.00019985754631862855,
"logits/chosen": -0.5857492089271545,
"logits/rejected": -0.5895102024078369,
"logps/chosen": -8.903070449829102,
"logps/rejected": -26.571044921875,
"loss": 0.7599916458129883,
"memory(GiB)": 46.83,
"nll_loss": 0.3342111110687256,
"rewards/accuracies": 0.84375,
"rewards/chosen": 0.14196240901947021,
"rewards/margins": 0.8281382322311401,
"rewards/rejected": -0.6861758232116699,
"step": 82,
"train_speed(iter/s)": 0.005504
},
{
"epoch": 0.06696754998613247,
"grad_norm": 3.764488697052002,
"learning_rate": 0.00019984294863940955,
"logits/chosen": -0.6067830324172974,
"logits/rejected": -0.6086009740829468,
"logps/chosen": -9.9881591796875,
"logps/rejected": -19.09541893005371,
"loss": 0.9752427339553833,
"memory(GiB)": 46.83,
"nll_loss": 0.5045859217643738,
"rewards/accuracies": 0.71875,
"rewards/chosen": 0.14939813315868378,
"rewards/margins": 0.8939868211746216,
"rewards/rejected": -0.7445887327194214,
"step": 83,
"train_speed(iter/s)": 0.005503
},
{
"epoch": 0.06777438793777263,
"grad_norm": 3.3293344974517822,
"learning_rate": 0.00019982763964192585,
"logits/chosen": -0.6330868601799011,
"logits/rejected": -0.6393448710441589,
"logps/chosen": -4.902453899383545,
"logps/rejected": -24.94113540649414,
"loss": 0.7244248390197754,
"memory(GiB)": 46.83,
"nll_loss": 0.3735058009624481,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.17604736983776093,
"rewards/margins": 1.2982165813446045,
"rewards/rejected": -1.1221693754196167,
"step": 84,
"train_speed(iter/s)": 0.005503
},
{
"epoch": 0.06858122588941278,
"grad_norm": 5.892284393310547,
"learning_rate": 0.00019981161943524443,
"logits/chosen": -0.6240598559379578,
"logits/rejected": -0.620481550693512,
"logps/chosen": -14.60393238067627,
"logps/rejected": -13.365829467773438,
"loss": 1.1541650295257568,
"memory(GiB)": 46.83,
"nll_loss": 0.48222166299819946,
"rewards/accuracies": 0.59375,
"rewards/chosen": -0.09302416443824768,
"rewards/margins": 0.41544342041015625,
"rewards/rejected": -0.5084675550460815,
"step": 85,
"train_speed(iter/s)": 0.0055
},
{
"epoch": 0.06938806384105292,
"grad_norm": 4.056751251220703,
"learning_rate": 0.00019979488813349933,
"logits/chosen": -0.6613398194313049,
"logits/rejected": -0.6640070080757141,
"logps/chosen": -9.50975227355957,
"logps/rejected": -21.119707107543945,
"loss": 0.8987840414047241,
"memory(GiB)": 46.83,
"nll_loss": 0.52927565574646,
"rewards/accuracies": 0.84375,
"rewards/chosen": 0.1999521553516388,
"rewards/margins": 1.1560636758804321,
"rewards/rejected": -0.956111490726471,
"step": 86,
"train_speed(iter/s)": 0.005499
},
{
"epoch": 0.07019490179269307,
"grad_norm": 4.351650238037109,
"learning_rate": 0.0001997774458558904,
"logits/chosen": -0.6547818779945374,
"logits/rejected": -0.6571143269538879,
"logps/chosen": -8.668737411499023,
"logps/rejected": -20.79534149169922,
"loss": 0.9775034785270691,
"memory(GiB)": 46.83,
"nll_loss": 0.4770965874195099,
"rewards/accuracies": 0.75,
"rewards/chosen": 0.02099284902215004,
"rewards/margins": 0.8633284568786621,
"rewards/rejected": -0.84233558177948,
"step": 87,
"train_speed(iter/s)": 0.005498
},
{
"epoch": 0.07100173974433323,
"grad_norm": 2.8774800300598145,
"learning_rate": 0.00019975929272668296,
"logits/chosen": -0.6759516000747681,
"logits/rejected": -0.6824960708618164,
"logps/chosen": -4.7266716957092285,
"logps/rejected": -26.10918426513672,
"loss": 0.5549903512001038,
"memory(GiB)": 46.83,
"nll_loss": 0.271104097366333,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.25939324498176575,
"rewards/margins": 1.6003111600875854,
"rewards/rejected": -1.340917944908142,
"step": 88,
"train_speed(iter/s)": 0.005501
},
{
"epoch": 0.07180857769597337,
"grad_norm": 2.8334577083587646,
"learning_rate": 0.00019974042887520668,
"logits/chosen": -0.6535760164260864,
"logits/rejected": -0.6572569608688354,
"logps/chosen": -13.957544326782227,
"logps/rejected": -18.16533851623535,
"loss": 0.9486314654350281,
"memory(GiB)": 46.83,
"nll_loss": 0.5478147268295288,
"rewards/accuracies": 0.90625,
"rewards/chosen": 0.2579638957977295,
"rewards/margins": 0.9477146863937378,
"rewards/rejected": -0.6897507905960083,
"step": 89,
"train_speed(iter/s)": 0.005501
},
{
"epoch": 0.07261541564761352,
"grad_norm": 5.422155380249023,
"learning_rate": 0.00019972085443585463,
"logits/chosen": -0.6767461895942688,
"logits/rejected": -0.6799700260162354,
"logps/chosen": -7.507997512817383,
"logps/rejected": -20.19240951538086,
"loss": 0.8118898868560791,
"memory(GiB)": 46.83,
"nll_loss": 0.4057508111000061,
"rewards/accuracies": 0.84375,
"rewards/chosen": 0.11586537212133408,
"rewards/margins": 1.0757473707199097,
"rewards/rejected": -0.9598820805549622,
"step": 90,
"train_speed(iter/s)": 0.005503
},
{
"epoch": 0.07342225359925368,
"grad_norm": 5.541498184204102,
"learning_rate": 0.0001997005695480824,
"logits/chosen": -0.6398351788520813,
"logits/rejected": -0.642162024974823,
"logps/chosen": -10.117485046386719,
"logps/rejected": -21.747928619384766,
"loss": 0.8823437094688416,
"memory(GiB)": 46.83,
"nll_loss": 0.47223997116088867,
"rewards/accuracies": 0.75,
"rewards/chosen": -0.04489222913980484,
"rewards/margins": 1.1613836288452148,
"rewards/rejected": -1.2062758207321167,
"step": 91,
"train_speed(iter/s)": 0.005504
},
{
"epoch": 0.07422909155089383,
"grad_norm": 2.0107967853546143,
"learning_rate": 0.000199679574356407,
"logits/chosen": -0.6938130855560303,
"logits/rejected": -0.7009856104850769,
"logps/chosen": -6.915675163269043,
"logps/rejected": -28.84608268737793,
"loss": 0.5776476860046387,
"memory(GiB)": 46.83,
"nll_loss": 0.3677330017089844,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.3187498152256012,
"rewards/margins": 1.8727707862854004,
"rewards/rejected": -1.554020881652832,
"step": 92,
"train_speed(iter/s)": 0.005502
},
{
"epoch": 0.07503592950253397,
"grad_norm": 3.5870676040649414,
"learning_rate": 0.0001996578690104061,
"logits/chosen": -0.673453688621521,
"logits/rejected": -0.676167905330658,
"logps/chosen": -10.7222318649292,
"logps/rejected": -28.77056884765625,
"loss": 0.950826108455658,
"memory(GiB)": 46.83,
"nll_loss": 0.5682229399681091,
"rewards/accuracies": 0.8125,
"rewards/chosen": 0.09744307398796082,
"rewards/margins": 1.4789444208145142,
"rewards/rejected": -1.381501317024231,
"step": 93,
"train_speed(iter/s)": 0.005502
},
{
"epoch": 0.07584276745417412,
"grad_norm": 4.2534661293029785,
"learning_rate": 0.00019963545366471653,
"logits/chosen": -0.6709739565849304,
"logits/rejected": -0.6747978925704956,
"logps/chosen": -8.219854354858398,
"logps/rejected": -29.13772201538086,
"loss": 0.6954976320266724,
"memory(GiB)": 46.83,
"nll_loss": 0.35414204001426697,
"rewards/accuracies": 0.8125,
"rewards/chosen": 0.10512235760688782,
"rewards/margins": 1.6458101272583008,
"rewards/rejected": -1.5406877994537354,
"step": 94,
"train_speed(iter/s)": 0.005503
},
{
"epoch": 0.07664960540581428,
"grad_norm": 7.663514614105225,
"learning_rate": 0.0001996123284790336,
"logits/chosen": -0.6834441423416138,
"logits/rejected": -0.6848198771476746,
"logps/chosen": -17.666513442993164,
"logps/rejected": -19.222387313842773,
"loss": 1.197723388671875,
"memory(GiB)": 46.83,
"nll_loss": 0.6848238110542297,
"rewards/accuracies": 0.84375,
"rewards/chosen": -0.06468406319618225,
"rewards/margins": 0.8658308982849121,
"rewards/rejected": -0.9305148720741272,
"step": 95,
"train_speed(iter/s)": 0.005502
},
{
"epoch": 0.07745644335745443,
"grad_norm": 16.187767028808594,
"learning_rate": 0.0001995884936181097,
"logits/chosen": -0.7171504497528076,
"logits/rejected": -0.7210450172424316,
"logps/chosen": -4.8772172927856445,
"logps/rejected": -27.164329528808594,
"loss": 0.7958053946495056,
"memory(GiB)": 46.83,
"nll_loss": 0.437197208404541,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.04156189411878586,
"rewards/margins": 1.4321556091308594,
"rewards/rejected": -1.3905936479568481,
"step": 96,
"train_speed(iter/s)": 0.005502
},
{
"epoch": 0.07826328130909457,
"grad_norm": 4.373692989349365,
"learning_rate": 0.00019956394925175328,
"logits/chosen": -0.720712423324585,
"logits/rejected": -0.7263769507408142,
"logps/chosen": -8.969646453857422,
"logps/rejected": -27.35487174987793,
"loss": 0.8684384822845459,
"memory(GiB)": 46.83,
"nll_loss": 0.4593147337436676,
"rewards/accuracies": 0.78125,
"rewards/chosen": 0.039580605924129486,
"rewards/margins": 1.404889702796936,
"rewards/rejected": -1.3653091192245483,
"step": 97,
"train_speed(iter/s)": 0.005502
},
{
"epoch": 0.07907011926073473,
"grad_norm": 3.1712353229522705,
"learning_rate": 0.00019953869555482752,
"logits/chosen": -0.6926038265228271,
"logits/rejected": -0.6906510591506958,
"logps/chosen": -10.361411094665527,
"logps/rejected": -19.763336181640625,
"loss": 1.0741034746170044,
"memory(GiB)": 46.83,
"nll_loss": 0.5404018759727478,
"rewards/accuracies": 0.75,
"rewards/chosen": 0.0025314167141914368,
"rewards/margins": 0.9160726070404053,
"rewards/rejected": -0.9135411381721497,
"step": 98,
"train_speed(iter/s)": 0.005502
},
{
"epoch": 0.07987695721237488,
"grad_norm": 5.8308796882629395,
"learning_rate": 0.00019951273270724906,
"logits/chosen": -0.6417246460914612,
"logits/rejected": -0.6460192203521729,
"logps/chosen": -10.923144340515137,
"logps/rejected": -23.332698822021484,
"loss": 1.129643201828003,
"memory(GiB)": 46.83,
"nll_loss": 0.5929185748100281,
"rewards/accuracies": 0.78125,
"rewards/chosen": -0.004452264867722988,
"rewards/margins": 0.6838414669036865,
"rewards/rejected": -0.6882937550544739,
"step": 99,
"train_speed(iter/s)": 0.005503
},
{
"epoch": 0.08068379516401503,
"grad_norm": 4.135215759277344,
"learning_rate": 0.00019948606089398698,
"logits/chosen": -0.6685535907745361,
"logits/rejected": -0.6693455576896667,
"logps/chosen": -11.88547134399414,
"logps/rejected": -19.97165298461914,
"loss": 0.9190454483032227,
"memory(GiB)": 46.83,
"nll_loss": 0.39345046877861023,
"rewards/accuracies": 0.59375,
"rewards/chosen": 0.05392542481422424,
"rewards/margins": 0.8620406985282898,
"rewards/rejected": -0.8081153035163879,
"step": 100,
"train_speed(iter/s)": 0.005503
},
{
"epoch": 0.08149063311565517,
"grad_norm": 3.957230806350708,
"learning_rate": 0.0001994586803050611,
"logits/chosen": -0.6953858137130737,
"logits/rejected": -0.6939084529876709,
"logps/chosen": -11.101150512695312,
"logps/rejected": -19.7403621673584,
"loss": 1.0100737810134888,
"memory(GiB)": 46.83,
"nll_loss": 0.45983725786209106,
"rewards/accuracies": 0.65625,
"rewards/chosen": 0.061330053955316544,
"rewards/margins": 0.847295880317688,
"rewards/rejected": -0.7859657406806946,
"step": 101,
"train_speed(iter/s)": 0.005498
},
{
"epoch": 0.08229747106729533,
"grad_norm": 2.8322761058807373,
"learning_rate": 0.00019943059113554097,
"logits/chosen": -0.6899937987327576,
"logits/rejected": -0.6942430734634399,
"logps/chosen": -8.74088191986084,
"logps/rejected": -20.522974014282227,
"loss": 0.8782400488853455,
"memory(GiB)": 46.83,
"nll_loss": 0.3525587320327759,
"rewards/accuracies": 0.8125,
"rewards/chosen": 0.05973733961582184,
"rewards/margins": 0.882931113243103,
"rewards/rejected": -0.8231937289237976,
"step": 102,
"train_speed(iter/s)": 0.005498
},
{
"epoch": 0.08310430901893548,
"grad_norm": 2.8728346824645996,
"learning_rate": 0.00019940179358554424,
"logits/chosen": -0.6615633964538574,
"logits/rejected": -0.6650048494338989,
"logps/chosen": -8.035341262817383,
"logps/rejected": -13.233177185058594,
"loss": 0.95281982421875,
"memory(GiB)": 46.83,
"nll_loss": 0.39267757534980774,
"rewards/accuracies": 0.71875,
"rewards/chosen": 0.12954209744930267,
"rewards/margins": 0.4833866357803345,
"rewards/rejected": -0.3538445234298706,
"step": 103,
"train_speed(iter/s)": 0.005496
},
{
"epoch": 0.08391114697057563,
"grad_norm": 2.8015527725219727,
"learning_rate": 0.00019937228786023542,
"logits/chosen": -0.6321871280670166,
"logits/rejected": -0.6367396116256714,
"logps/chosen": -9.781261444091797,
"logps/rejected": -18.408084869384766,
"loss": 0.9027690887451172,
"memory(GiB)": 46.83,
"nll_loss": 0.4244646430015564,
"rewards/accuracies": 0.84375,
"rewards/chosen": 0.18980520963668823,
"rewards/margins": 0.7434633374214172,
"rewards/rejected": -0.5536580681800842,
"step": 104,
"train_speed(iter/s)": 0.005498
},
{
"epoch": 0.08471798492221577,
"grad_norm": 3.581929922103882,
"learning_rate": 0.00019934207416982415,
"logits/chosen": -0.6718648076057434,
"logits/rejected": -0.6737468242645264,
"logps/chosen": -10.535398483276367,
"logps/rejected": -15.517889022827148,
"loss": 0.9467408657073975,
"memory(GiB)": 46.83,
"nll_loss": 0.4431319832801819,
"rewards/accuracies": 0.84375,
"rewards/chosen": 0.24101108312606812,
"rewards/margins": 0.5848699808120728,
"rewards/rejected": -0.34385889768600464,
"step": 105,
"train_speed(iter/s)": 0.005496
},
{
"epoch": 0.08552482287385593,
"grad_norm": 2.7180511951446533,
"learning_rate": 0.00019931115272956405,
"logits/chosen": -0.6360980272293091,
"logits/rejected": -0.6395881175994873,
"logps/chosen": -5.562260627746582,
"logps/rejected": -16.978702545166016,
"loss": 0.9048807621002197,
"memory(GiB)": 46.83,
"nll_loss": 0.3790769577026367,
"rewards/accuracies": 0.71875,
"rewards/chosen": 0.1927444040775299,
"rewards/margins": 0.6174324750900269,
"rewards/rejected": -0.42468804121017456,
"step": 106,
"train_speed(iter/s)": 0.005495
},
{
"epoch": 0.08633166082549608,
"grad_norm": 2.7166309356689453,
"learning_rate": 0.00019927952375975094,
"logits/chosen": -0.6151095628738403,
"logits/rejected": -0.6214062571525574,
"logps/chosen": -8.704106330871582,
"logps/rejected": -15.980009078979492,
"loss": 0.9614640474319458,
"memory(GiB)": 46.83,
"nll_loss": 0.41800737380981445,
"rewards/accuracies": 0.71875,
"rewards/chosen": 0.22499363124370575,
"rewards/margins": 0.5540027618408203,
"rewards/rejected": -0.32900911569595337,
"step": 107,
"train_speed(iter/s)": 0.005495
},
{
"epoch": 0.08713849877713623,
"grad_norm": 3.3143904209136963,
"learning_rate": 0.00019924718748572136,
"logits/chosen": -0.6602830290794373,
"logits/rejected": -0.6590928435325623,
"logps/chosen": -14.48482608795166,
"logps/rejected": -13.489812850952148,
"loss": 1.1007349491119385,
"memory(GiB)": 46.83,
"nll_loss": 0.38938888907432556,
"rewards/accuracies": 0.5625,
"rewards/chosen": -0.005462644621729851,
"rewards/margins": 0.18356555700302124,
"rewards/rejected": -0.18902820348739624,
"step": 108,
"train_speed(iter/s)": 0.005493
},
{
"epoch": 0.08794533672877639,
"grad_norm": 3.3967649936676025,
"learning_rate": 0.00019921414413785095,
"logits/chosen": -0.6139819025993347,
"logits/rejected": -0.6160064935684204,
"logps/chosen": -10.462146759033203,
"logps/rejected": -13.9368896484375,
"loss": 1.1163440942764282,
"memory(GiB)": 46.83,
"nll_loss": 0.5643093585968018,
"rewards/accuracies": 0.625,
"rewards/chosen": 0.13518843054771423,
"rewards/margins": 0.5490553379058838,
"rewards/rejected": -0.41386690735816956,
"step": 109,
"train_speed(iter/s)": 0.005493
},
{
"epoch": 0.08875217468041653,
"grad_norm": 2.125051498413086,
"learning_rate": 0.00019918039395155278,
"logits/chosen": -0.5581845641136169,
"logits/rejected": -0.5609419345855713,
"logps/chosen": -8.664159774780273,
"logps/rejected": -16.96472930908203,
"loss": 0.8410020470619202,
"memory(GiB)": 46.83,
"nll_loss": 0.3336779773235321,
"rewards/accuracies": 0.75,
"rewards/chosen": 0.24867044389247894,
"rewards/margins": 0.6479009985923767,
"rewards/rejected": -0.3992305099964142,
"step": 110,
"train_speed(iter/s)": 0.005494
},
{
"epoch": 0.08955901263205668,
"grad_norm": 2.7272698879241943,
"learning_rate": 0.00019914593716727574,
"logits/chosen": -0.640306830406189,
"logits/rejected": -0.6392278075218201,
"logps/chosen": -10.320524215698242,
"logps/rejected": -15.357645034790039,
"loss": 0.9050614237785339,
"memory(GiB)": 46.83,
"nll_loss": 0.3744095265865326,
"rewards/accuracies": 0.78125,
"rewards/chosen": 0.228946715593338,
"rewards/margins": 0.46916335821151733,
"rewards/rejected": -0.24021662771701813,
"step": 111,
"train_speed(iter/s)": 0.005492
},
{
"epoch": 0.09036585058369682,
"grad_norm": 2.552009344100952,
"learning_rate": 0.0001991107740305027,
"logits/chosen": -0.6064003109931946,
"logits/rejected": -0.607029914855957,
"logps/chosen": -10.730403900146484,
"logps/rejected": -20.569438934326172,
"loss": 0.9093858003616333,
"memory(GiB)": 46.83,
"nll_loss": 0.4844813346862793,
"rewards/accuracies": 0.84375,
"rewards/chosen": 0.320293128490448,
"rewards/margins": 0.8029977083206177,
"rewards/rejected": -0.48270460963249207,
"step": 112,
"train_speed(iter/s)": 0.005492
},
{
"epoch": 0.09117268853533698,
"grad_norm": 2.875828742980957,
"learning_rate": 0.00019907490479174902,
"logits/chosen": -0.6465886831283569,
"logits/rejected": -0.6483381986618042,
"logps/chosen": -6.758854389190674,
"logps/rejected": -20.76754379272461,
"loss": 0.7010505199432373,
"memory(GiB)": 46.83,
"nll_loss": 0.29428812861442566,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.3071742653846741,
"rewards/margins": 1.1479661464691162,
"rewards/rejected": -0.8407919406890869,
"step": 113,
"train_speed(iter/s)": 0.005491
},
{
"epoch": 0.09197952648697713,
"grad_norm": 2.3188178539276123,
"learning_rate": 0.00019903832970656038,
"logits/chosen": -0.6288142800331116,
"logits/rejected": -0.6315409541130066,
"logps/chosen": -8.855584144592285,
"logps/rejected": -20.421592712402344,
"loss": 0.841801106929779,
"memory(GiB)": 46.83,
"nll_loss": 0.38135236501693726,
"rewards/accuracies": 0.8125,
"rewards/chosen": 0.19283419847488403,
"rewards/margins": 0.8724038004875183,
"rewards/rejected": -0.6795696020126343,
"step": 114,
"train_speed(iter/s)": 0.005492
},
{
"epoch": 0.09278636443861728,
"grad_norm": 3.3676164150238037,
"learning_rate": 0.00019900104903551133,
"logits/chosen": -0.6541582345962524,
"logits/rejected": -0.6580868363380432,
"logps/chosen": -8.595276832580566,
"logps/rejected": -24.14297866821289,
"loss": 0.7960852980613708,
"memory(GiB)": 46.83,
"nll_loss": 0.4363185465335846,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.10038560628890991,
"rewards/margins": 1.4183127880096436,
"rewards/rejected": -1.3179271221160889,
"step": 115,
"train_speed(iter/s)": 0.005493
},
{
"epoch": 0.09359320239025744,
"grad_norm": 3.721660614013672,
"learning_rate": 0.00019896306304420324,
"logits/chosen": -0.6533216834068298,
"logits/rejected": -0.6518760919570923,
"logps/chosen": -9.710081100463867,
"logps/rejected": -20.333324432373047,
"loss": 0.842086911201477,
"memory(GiB)": 46.83,
"nll_loss": 0.38858363032341003,
"rewards/accuracies": 0.75,
"rewards/chosen": 0.1398862600326538,
"rewards/margins": 1.0419015884399414,
"rewards/rejected": -0.9020152688026428,
"step": 116,
"train_speed(iter/s)": 0.005494
},
{
"epoch": 0.09440004034189758,
"grad_norm": 4.8206281661987305,
"learning_rate": 0.0001989243720032624,
"logits/chosen": -0.7102867364883423,
"logits/rejected": -0.712573230266571,
"logps/chosen": -14.843620300292969,
"logps/rejected": -23.658788681030273,
"loss": 1.1279860734939575,
"memory(GiB)": 46.83,
"nll_loss": 0.5651426315307617,
"rewards/accuracies": 0.78125,
"rewards/chosen": -0.09467095881700516,
"rewards/margins": 0.9923723340034485,
"rewards/rejected": -1.087043285369873,
"step": 117,
"train_speed(iter/s)": 0.005494
},
{
"epoch": 0.09520687829353773,
"grad_norm": 3.194643020629883,
"learning_rate": 0.00019888497618833815,
"logits/chosen": -0.6824992895126343,
"logits/rejected": -0.6856632232666016,
"logps/chosen": -7.8865065574646,
"logps/rejected": -22.186447143554688,
"loss": 0.8166104555130005,
"memory(GiB)": 46.83,
"nll_loss": 0.3872619867324829,
"rewards/accuracies": 0.8125,
"rewards/chosen": 0.1935729682445526,
"rewards/margins": 1.2844107151031494,
"rewards/rejected": -1.090837836265564,
"step": 118,
"train_speed(iter/s)": 0.005494
},
{
"epoch": 0.09601371624517788,
"grad_norm": 5.332725524902344,
"learning_rate": 0.00019884487588010092,
"logits/chosen": -0.6963211894035339,
"logits/rejected": -0.695375382900238,
"logps/chosen": -12.522785186767578,
"logps/rejected": -21.899364471435547,
"loss": 1.200064778327942,
"memory(GiB)": 46.83,
"nll_loss": 0.5619924068450928,
"rewards/accuracies": 0.625,
"rewards/chosen": -0.2353927493095398,
"rewards/margins": 0.7032212018966675,
"rewards/rejected": -0.9386140704154968,
"step": 119,
"train_speed(iter/s)": 0.005493
},
{
"epoch": 0.09682055419681804,
"grad_norm": 3.189750909805298,
"learning_rate": 0.0001988040713642402,
"logits/chosen": -0.7008529305458069,
"logits/rejected": -0.7020596265792847,
"logps/chosen": -7.352071285247803,
"logps/rejected": -26.472599029541016,
"loss": 0.6796355843544006,
"memory(GiB)": 46.83,
"nll_loss": 0.30471816658973694,
"rewards/accuracies": 0.84375,
"rewards/chosen": 0.0883897989988327,
"rewards/margins": 1.43672513961792,
"rewards/rejected": -1.3483351469039917,
"step": 120,
"train_speed(iter/s)": 0.005494
},
{
"epoch": 0.09762739214845818,
"grad_norm": 3.5756847858428955,
"learning_rate": 0.00019876256293146257,
"logits/chosen": -0.6855241060256958,
"logits/rejected": -0.6870216131210327,
"logps/chosen": -9.13197135925293,
"logps/rejected": -25.256893157958984,
"loss": 0.9965449571609497,
"memory(GiB)": 46.83,
"nll_loss": 0.5001046061515808,
"rewards/accuracies": 0.78125,
"rewards/chosen": 0.036015622317790985,
"rewards/margins": 1.1710847616195679,
"rewards/rejected": -1.1350692510604858,
"step": 121,
"train_speed(iter/s)": 0.005494
},
{
"epoch": 0.09843423010009833,
"grad_norm": 2.60425066947937,
"learning_rate": 0.0001987203508774895,
"logits/chosen": -0.7040928602218628,
"logits/rejected": -0.7042312026023865,
"logps/chosen": -8.471722602844238,
"logps/rejected": -26.018938064575195,
"loss": 0.8459987640380859,
"memory(GiB)": 46.83,
"nll_loss": 0.4736276865005493,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.24268555641174316,
"rewards/margins": 1.318163514137268,
"rewards/rejected": -1.075477957725525,
"step": 122,
"train_speed(iter/s)": 0.005493
},
{
"epoch": 0.09924106805173849,
"grad_norm": 4.30864143371582,
"learning_rate": 0.0001986774355030553,
"logits/chosen": -0.6747640371322632,
"logits/rejected": -0.677899956703186,
"logps/chosen": -14.706789016723633,
"logps/rejected": -16.56774139404297,
"loss": 1.2364513874053955,
"memory(GiB)": 46.83,
"nll_loss": 0.6511675119400024,
"rewards/accuracies": 0.71875,
"rewards/chosen": 0.08759675920009613,
"rewards/margins": 0.6008309721946716,
"rewards/rejected": -0.5132341384887695,
"step": 123,
"train_speed(iter/s)": 0.005492
},
{
"epoch": 0.10004790600337864,
"grad_norm": 6.867242813110352,
"learning_rate": 0.00019863381711390508,
"logits/chosen": -0.6869674324989319,
"logits/rejected": -0.6902846693992615,
"logps/chosen": -7.829675197601318,
"logps/rejected": -20.095809936523438,
"loss": 1.043180227279663,
"memory(GiB)": 46.83,
"nll_loss": 0.530769944190979,
"rewards/accuracies": 0.71875,
"rewards/chosen": 0.11925126612186432,
"rewards/margins": 0.697571337223053,
"rewards/rejected": -0.5783200860023499,
"step": 124,
"train_speed(iter/s)": 0.005491
},
{
"epoch": 0.10085474395501878,
"grad_norm": 3.041438579559326,
"learning_rate": 0.0001985894960207925,
"logits/chosen": -0.6505750417709351,
"logits/rejected": -0.6511614918708801,
"logps/chosen": -9.314833641052246,
"logps/rejected": -27.15659523010254,
"loss": 0.7252060174942017,
"memory(GiB)": 46.83,
"nll_loss": 0.39295029640197754,
"rewards/accuracies": 0.96875,
"rewards/chosen": 0.24510648846626282,
"rewards/margins": 1.2805438041687012,
"rewards/rejected": -1.0354374647140503,
"step": 125,
"train_speed(iter/s)": 0.005491
},
{
"epoch": 0.10166158190665893,
"grad_norm": 2.509321689605713,
"learning_rate": 0.00019854447253947743,
"logits/chosen": -0.6497823596000671,
"logits/rejected": -0.6492441892623901,
"logps/chosen": -8.02572250366211,
"logps/rejected": -20.3783016204834,
"loss": 0.7982934713363647,
"memory(GiB)": 46.83,
"nll_loss": 0.33212146162986755,
"rewards/accuracies": 0.78125,
"rewards/chosen": 0.17764505743980408,
"rewards/margins": 0.8625535368919373,
"rewards/rejected": -0.6849085092544556,
"step": 126,
"train_speed(iter/s)": 0.005489
},
{
"epoch": 0.10246841985829909,
"grad_norm": 3.6529700756073,
"learning_rate": 0.0001984987469907239,
"logits/chosen": -0.6466098427772522,
"logits/rejected": -0.6480077505111694,
"logps/chosen": -9.548334121704102,
"logps/rejected": -16.65062141418457,
"loss": 0.914322555065155,
"memory(GiB)": 46.83,
"nll_loss": 0.4001502990722656,
"rewards/accuracies": 0.75,
"rewards/chosen": 0.1684979647397995,
"rewards/margins": 0.6629449129104614,
"rewards/rejected": -0.49444690346717834,
"step": 127,
"train_speed(iter/s)": 0.005491
},
{
"epoch": 0.10327525780993924,
"grad_norm": 3.3696913719177246,
"learning_rate": 0.00019845231970029773,
"logits/chosen": -0.679688572883606,
"logits/rejected": -0.6820145845413208,
"logps/chosen": -10.874924659729004,
"logps/rejected": -24.826372146606445,
"loss": 0.9800686240196228,
"memory(GiB)": 46.83,
"nll_loss": 0.4543137848377228,
"rewards/accuracies": 0.8125,
"rewards/chosen": -0.048351842910051346,
"rewards/margins": 0.8677961230278015,
"rewards/rejected": -0.9161479473114014,
"step": 128,
"train_speed(iter/s)": 0.00549
},
{
"epoch": 0.10408209576157938,
"grad_norm": 2.5419607162475586,
"learning_rate": 0.00019840519099896414,
"logits/chosen": -0.6618849039077759,
"logits/rejected": -0.6671789288520813,
"logps/chosen": -8.426337242126465,
"logps/rejected": -25.797517776489258,
"loss": 0.6974806189537048,
"memory(GiB)": 46.83,
"nll_loss": 0.2836017608642578,
"rewards/accuracies": 0.84375,
"rewards/chosen": 0.18303632736206055,
"rewards/margins": 1.1003562211990356,
"rewards/rejected": -0.9173198938369751,
"step": 129,
"train_speed(iter/s)": 0.005491
},
{
"epoch": 0.10488893371321953,
"grad_norm": 3.4203388690948486,
"learning_rate": 0.00019835736122248557,
"logits/chosen": -0.6606203317642212,
"logits/rejected": -0.6571654677391052,
"logps/chosen": -14.509614944458008,
"logps/rejected": -15.079629898071289,
"loss": 1.101165771484375,
"memory(GiB)": 46.83,
"nll_loss": 0.5219094157218933,
"rewards/accuracies": 0.75,
"rewards/chosen": 0.07395613193511963,
"rewards/margins": 0.5427431464195251,
"rewards/rejected": -0.46878698468208313,
"step": 130,
"train_speed(iter/s)": 0.005492
},
{
"epoch": 0.10569577166485969,
"grad_norm": 2.7750000953674316,
"learning_rate": 0.00019830883071161908,
"logits/chosen": -0.7152451276779175,
"logits/rejected": -0.7131951451301575,
"logps/chosen": -9.166630744934082,
"logps/rejected": -19.46819305419922,
"loss": 0.7933439016342163,
"memory(GiB)": 46.83,
"nll_loss": 0.3753884732723236,
"rewards/accuracies": 0.78125,
"rewards/chosen": 0.26774072647094727,
"rewards/margins": 1.0882644653320312,
"rewards/rejected": -0.8205236196517944,
"step": 131,
"train_speed(iter/s)": 0.005492
},
{
"epoch": 0.10650260961649984,
"grad_norm": 3.1810927391052246,
"learning_rate": 0.00019825959981211407,
"logits/chosen": -0.714146614074707,
"logits/rejected": -0.7095440626144409,
"logps/chosen": -11.571531295776367,
"logps/rejected": -14.685908317565918,
"loss": 0.8970522880554199,
"memory(GiB)": 46.83,
"nll_loss": 0.38512641191482544,
"rewards/accuracies": 0.75,
"rewards/chosen": 0.09674864262342453,
"rewards/margins": 0.5926439762115479,
"rewards/rejected": -0.4958953261375427,
"step": 132,
"train_speed(iter/s)": 0.005491
},
{
"epoch": 0.10730944756813998,
"grad_norm": 2.839996099472046,
"learning_rate": 0.00019820966887470974,
"logits/chosen": -0.7237828373908997,
"logits/rejected": -0.7276051640510559,
"logps/chosen": -7.241865158081055,
"logps/rejected": -21.9840145111084,
"loss": 0.7037227153778076,
"memory(GiB)": 46.83,
"nll_loss": 0.29994940757751465,
"rewards/accuracies": 0.84375,
"rewards/chosen": 0.18205267190933228,
"rewards/margins": 1.1148442029953003,
"rewards/rejected": -0.9327914714813232,
"step": 133,
"train_speed(iter/s)": 0.005492
},
{
"epoch": 0.10811628551978014,
"grad_norm": 2.8896915912628174,
"learning_rate": 0.0001981590382551327,
"logits/chosen": -0.796456515789032,
"logits/rejected": -0.7955406308174133,
"logps/chosen": -11.131935119628906,
"logps/rejected": -19.525293350219727,
"loss": 0.8993673920631409,
"memory(GiB)": 46.83,
"nll_loss": 0.4546453356742859,
"rewards/accuracies": 0.8125,
"rewards/chosen": 0.21719151735305786,
"rewards/margins": 1.081808090209961,
"rewards/rejected": -0.8646165728569031,
"step": 134,
"train_speed(iter/s)": 0.00549
},
{
"epoch": 0.10892312347142029,
"grad_norm": 3.5537540912628174,
"learning_rate": 0.00019810770831409425,
"logits/chosen": -0.7755017876625061,
"logits/rejected": -0.7809926271438599,
"logps/chosen": -7.181600093841553,
"logps/rejected": -19.379724502563477,
"loss": 0.7135071754455566,
"memory(GiB)": 46.83,
"nll_loss": 0.32976531982421875,
"rewards/accuracies": 0.78125,
"rewards/chosen": 0.26019349694252014,
"rewards/margins": 1.110938310623169,
"rewards/rejected": -0.850744903087616,
"step": 135,
"train_speed(iter/s)": 0.005491
},
{
"epoch": 0.10972996142306043,
"grad_norm": 3.5955300331115723,
"learning_rate": 0.00019805567941728796,
"logits/chosen": -0.799392819404602,
"logits/rejected": -0.8029282689094543,
"logps/chosen": -9.87437629699707,
"logps/rejected": -23.02663230895996,
"loss": 0.9438092708587646,
"memory(GiB)": 46.83,
"nll_loss": 0.5196709036827087,
"rewards/accuracies": 0.78125,
"rewards/chosen": 0.07922995835542679,
"rewards/margins": 1.070724606513977,
"rewards/rejected": -0.9914946556091309,
"step": 136,
"train_speed(iter/s)": 0.005492
},
{
"epoch": 0.11053679937470058,
"grad_norm": 3.7304859161376953,
"learning_rate": 0.00019800295193538704,
"logits/chosen": -0.8160181641578674,
"logits/rejected": -0.8219972848892212,
"logps/chosen": -7.596125602722168,
"logps/rejected": -20.225994110107422,
"loss": 0.8485299348831177,
"memory(GiB)": 46.83,
"nll_loss": 0.43994730710983276,
"rewards/accuracies": 0.90625,
"rewards/chosen": 0.26360729336738586,
"rewards/margins": 0.9658780694007874,
"rewards/rejected": -0.7022708058357239,
"step": 137,
"train_speed(iter/s)": 0.005491
},
{
"epoch": 0.11134363732634074,
"grad_norm": 4.919328689575195,
"learning_rate": 0.00019794952624404167,
"logits/chosen": -0.7996560335159302,
"logits/rejected": -0.801249623298645,
"logps/chosen": -9.867749214172363,
"logps/rejected": -22.316190719604492,
"loss": 0.8283427357673645,
"memory(GiB)": 46.83,
"nll_loss": 0.4471050798892975,
"rewards/accuracies": 0.84375,
"rewards/chosen": 0.13889475166797638,
"rewards/margins": 1.224007248878479,
"rewards/rejected": -1.085112452507019,
"step": 138,
"train_speed(iter/s)": 0.005491
},
{
"epoch": 0.11215047527798089,
"grad_norm": 2.821730136871338,
"learning_rate": 0.0001978954027238763,
"logits/chosen": -0.818955659866333,
"logits/rejected": -0.8183013796806335,
"logps/chosen": -6.504258632659912,
"logps/rejected": -14.602479934692383,
"loss": 0.7571634650230408,
"memory(GiB)": 46.83,
"nll_loss": 0.29162290692329407,
"rewards/accuracies": 0.71875,
"rewards/chosen": 0.1784059852361679,
"rewards/margins": 0.8354285955429077,
"rewards/rejected": -0.6570225954055786,
"step": 139,
"train_speed(iter/s)": 0.005491
},
{
"epoch": 0.11295731322962103,
"grad_norm": 2.481306552886963,
"learning_rate": 0.000197840581760487,
"logits/chosen": -0.8251004219055176,
"logits/rejected": -0.8243045210838318,
"logps/chosen": -13.736132621765137,
"logps/rejected": -17.749977111816406,
"loss": 0.8052379488945007,
"memory(GiB)": 46.83,
"nll_loss": 0.4064967930316925,
"rewards/accuracies": 0.8125,
"rewards/chosen": 0.3237007260322571,
"rewards/margins": 1.295701026916504,
"rewards/rejected": -0.9720003008842468,
"step": 140,
"train_speed(iter/s)": 0.005492
},
{
"epoch": 0.1137641511812612,
"grad_norm": 2.695176601409912,
"learning_rate": 0.00019778506374443873,
"logits/chosen": -0.7545077800750732,
"logits/rejected": -0.7596877813339233,
"logps/chosen": -5.598147869110107,
"logps/rejected": -26.760784149169922,
"loss": 0.6858201026916504,
"memory(GiB)": 46.83,
"nll_loss": 0.3311798572540283,
"rewards/accuracies": 0.84375,
"rewards/chosen": 0.19224056601524353,
"rewards/margins": 1.6802706718444824,
"rewards/rejected": -1.488029956817627,
"step": 141,
"train_speed(iter/s)": 0.005493
},
{
"epoch": 0.11457098913290134,
"grad_norm": 2.5371341705322266,
"learning_rate": 0.0001977288490712624,
"logits/chosen": -0.8187113404273987,
"logits/rejected": -0.8256463408470154,
"logps/chosen": -9.480502128601074,
"logps/rejected": -26.96666717529297,
"loss": 0.6809464693069458,
"memory(GiB)": 46.83,
"nll_loss": 0.3261586129665375,
"rewards/accuracies": 0.90625,
"rewards/chosen": 0.2214924842119217,
"rewards/margins": 1.2070807218551636,
"rewards/rejected": -0.9855883121490479,
"step": 142,
"train_speed(iter/s)": 0.005493
},
{
"epoch": 0.11537782708454149,
"grad_norm": 3.33156681060791,
"learning_rate": 0.00019767193814145226,
"logits/chosen": -0.8148999214172363,
"logits/rejected": -0.8154037594795227,
"logps/chosen": -16.6685848236084,
"logps/rejected": -16.219863891601562,
"loss": 1.1351004838943481,
"memory(GiB)": 46.83,
"nll_loss": 0.6261444091796875,
"rewards/accuracies": 0.78125,
"rewards/chosen": 0.06986582279205322,
"rewards/margins": 0.7546349763870239,
"rewards/rejected": -0.6847692728042603,
"step": 143,
"train_speed(iter/s)": 0.005493
},
{
"epoch": 0.11618466503618163,
"grad_norm": 2.587169647216797,
"learning_rate": 0.00019761433136046295,
"logits/chosen": -0.7679372429847717,
"logits/rejected": -0.7711334824562073,
"logps/chosen": -6.84797477722168,
"logps/rejected": -25.882503509521484,
"loss": 0.6460772752761841,
"memory(GiB)": 46.83,
"nll_loss": 0.2581600844860077,
"rewards/accuracies": 0.78125,
"rewards/chosen": 0.25230705738067627,
"rewards/margins": 1.5044541358947754,
"rewards/rejected": -1.2521469593048096,
"step": 144,
"train_speed(iter/s)": 0.005494
},
{
"epoch": 0.1169915029878218,
"grad_norm": 3.816577911376953,
"learning_rate": 0.00019755602913870655,
"logits/chosen": -0.7486031651496887,
"logits/rejected": -0.7545804977416992,
"logps/chosen": -11.378320693969727,
"logps/rejected": -23.90165901184082,
"loss": 1.0280418395996094,
"memory(GiB)": 46.83,
"nll_loss": 0.5588870644569397,
"rewards/accuracies": 0.84375,
"rewards/chosen": 0.10084515064954758,
"rewards/margins": 1.0778629779815674,
"rewards/rejected": -0.9770178198814392,
"step": 145,
"train_speed(iter/s)": 0.005494
},
{
"epoch": 0.11779834093946194,
"grad_norm": 3.1183438301086426,
"learning_rate": 0.00019749703189154971,
"logits/chosen": -0.7663331031799316,
"logits/rejected": -0.7778096199035645,
"logps/chosen": -7.461820602416992,
"logps/rejected": -26.446916580200195,
"loss": 0.6639739274978638,
"memory(GiB)": 46.83,
"nll_loss": 0.28250494599342346,
"rewards/accuracies": 0.78125,
"rewards/chosen": 0.04964678734540939,
"rewards/margins": 1.1681914329528809,
"rewards/rejected": -1.1185446977615356,
"step": 146,
"train_speed(iter/s)": 0.005493
},
{
"epoch": 0.11860517889110209,
"grad_norm": 2.613725423812866,
"learning_rate": 0.00019743734003931082,
"logits/chosen": -0.808351993560791,
"logits/rejected": -0.8136962652206421,
"logps/chosen": -7.89247989654541,
"logps/rejected": -23.955371856689453,
"loss": 0.8511161804199219,
"memory(GiB)": 46.83,
"nll_loss": 0.39823463559150696,
"rewards/accuracies": 0.78125,
"rewards/chosen": 0.12871581315994263,
"rewards/margins": 1.055700659751892,
"rewards/rejected": -0.9269847869873047,
"step": 147,
"train_speed(iter/s)": 0.005493
},
{
"epoch": 0.11941201684274225,
"grad_norm": 3.0128729343414307,
"learning_rate": 0.00019737695400725677,
"logits/chosen": -0.7927097678184509,
"logits/rejected": -0.7919667959213257,
"logps/chosen": -9.877785682678223,
"logps/rejected": -23.477703094482422,
"loss": 0.7262363433837891,
"memory(GiB)": 46.83,
"nll_loss": 0.3177878260612488,
"rewards/accuracies": 0.78125,
"rewards/chosen": 0.12437373399734497,
"rewards/margins": 1.1551289558410645,
"rewards/rejected": -1.0307551622390747,
"step": 148,
"train_speed(iter/s)": 0.005495
},
{
"epoch": 0.1202188547943824,
"grad_norm": 2.5007247924804688,
"learning_rate": 0.0001973158742256001,
"logits/chosen": -0.815912663936615,
"logits/rejected": -0.8240575194358826,
"logps/chosen": -7.251335620880127,
"logps/rejected": -23.904563903808594,
"loss": 0.7742622494697571,
"memory(GiB)": 46.83,
"nll_loss": 0.3948196470737457,
"rewards/accuracies": 0.8125,
"rewards/chosen": 0.16877779364585876,
"rewards/margins": 1.3302054405212402,
"rewards/rejected": -1.1614277362823486,
"step": 149,
"train_speed(iter/s)": 0.005495
},
{
"epoch": 0.12102569274602254,
"grad_norm": 2.996128559112549,
"learning_rate": 0.0001972541011294959,
"logits/chosen": -0.8276554346084595,
"logits/rejected": -0.832274317741394,
"logps/chosen": -9.810141563415527,
"logps/rejected": -24.295639038085938,
"loss": 0.733322262763977,
"memory(GiB)": 46.83,
"nll_loss": 0.34396567940711975,
"rewards/accuracies": 0.90625,
"rewards/chosen": 0.03486320376396179,
"rewards/margins": 1.2224383354187012,
"rewards/rejected": -1.1875752210617065,
"step": 150,
"train_speed(iter/s)": 0.005495
}
],
"logging_steps": 1,
"max_steps": 1239,
"num_input_tokens_seen": 0,
"num_train_epochs": 1,
"save_steps": 50,
"stateful_callbacks": {
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": true,
"should_training_stop": false
},
"attributes": {}
}
},
"total_flos": 1.0977195623354204e+18,
"train_batch_size": 1,
"trial_name": null,
"trial_params": null
}