{ "best_global_step": null, "best_metric": null, "best_model_checkpoint": null, "epoch": 0.12102569274602254, "eval_steps": 300, "global_step": 150, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "epoch": 0.0008068379516401503, "grad_norm": 9.261910438537598, "learning_rate": 3.225806451612903e-06, "logits/chosen": -0.6039718985557556, "logits/rejected": -0.6058337688446045, "logps/chosen": -7.412725925445557, "logps/rejected": -11.413676261901855, "loss": 1.2381761074066162, "memory(GiB)": 46.32, "nll_loss": 0.5450288653373718, "rewards/accuracies": 0.0, "rewards/chosen": 0.0, "rewards/margins": 0.0, "rewards/rejected": 0.0, "step": 1, "train_speed(iter/s)": 0.005524 }, { "epoch": 0.0016136759032803006, "grad_norm": 5.391567230224609, "learning_rate": 6.451612903225806e-06, "logits/chosen": -0.6199994087219238, "logits/rejected": -0.6217825412750244, "logps/chosen": -7.599736213684082, "logps/rejected": -15.575040817260742, "loss": 1.1066936254501343, "memory(GiB)": 46.83, "nll_loss": 0.41354650259017944, "rewards/accuracies": 0.0, "rewards/chosen": 0.0, "rewards/margins": 0.0, "rewards/rejected": 0.0, "step": 2, "train_speed(iter/s)": 0.005546 }, { "epoch": 0.002420513854920451, "grad_norm": 6.5534772872924805, "learning_rate": 9.67741935483871e-06, "logits/chosen": -0.6068329811096191, "logits/rejected": -0.6103144288063049, "logps/chosen": -11.938759803771973, "logps/rejected": -14.32825756072998, "loss": 1.267569661140442, "memory(GiB)": 46.83, "nll_loss": 0.5742746591567993, "rewards/accuracies": 0.5, "rewards/chosen": 0.0005358309717848897, "rewards/margins": -0.00011114418157376349, "rewards/rejected": 0.0006469750078395009, "step": 3, "train_speed(iter/s)": 0.005487 }, { "epoch": 0.003227351806560601, "grad_norm": 3.4633655548095703, "learning_rate": 1.2903225806451613e-05, "logits/chosen": -0.6417700052261353, "logits/rejected": -0.638687789440155, "logps/chosen": -10.244372367858887, "logps/rejected": -8.448144912719727, "loss": 1.1101956367492676, "memory(GiB)": 46.83, "nll_loss": 0.4145403802394867, "rewards/accuracies": 0.40625, "rewards/chosen": -0.002526381518691778, "rewards/margins": -0.004837517160922289, "rewards/rejected": 0.0023111351765692234, "step": 4, "train_speed(iter/s)": 0.005482 }, { "epoch": 0.004034189758200751, "grad_norm": 9.884061813354492, "learning_rate": 1.6129032258064517e-05, "logits/chosen": -0.6263395547866821, "logits/rejected": -0.6316207647323608, "logps/chosen": -8.768255233764648, "logps/rejected": -12.074126243591309, "loss": 1.2384487390518188, "memory(GiB)": 46.83, "nll_loss": 0.5502734780311584, "rewards/accuracies": 0.53125, "rewards/chosen": 0.011151458136737347, "rewards/margins": 0.010235130786895752, "rewards/rejected": 0.0009163276990875602, "step": 5, "train_speed(iter/s)": 0.005496 }, { "epoch": 0.004841027709840902, "grad_norm": 9.879764556884766, "learning_rate": 1.935483870967742e-05, "logits/chosen": -0.6110924482345581, "logits/rejected": -0.6128084063529968, "logps/chosen": -11.146334648132324, "logps/rejected": -12.724503517150879, "loss": 1.246738314628601, "memory(GiB)": 46.83, "nll_loss": 0.5631918907165527, "rewards/accuracies": 0.65625, "rewards/chosen": 0.02471097745001316, "rewards/margins": 0.02056196704506874, "rewards/rejected": 0.004149014595896006, "step": 6, "train_speed(iter/s)": 0.005505 }, { "epoch": 0.0056478656614810515, "grad_norm": 3.7321648597717285, "learning_rate": 2.258064516129032e-05, "logits/chosen": -0.6434396505355835, "logits/rejected": -0.6456248164176941, "logps/chosen": -12.346940994262695, "logps/rejected": -13.585854530334473, "loss": 1.25950026512146, "memory(GiB)": 46.83, "nll_loss": 0.5602214932441711, "rewards/accuracies": 0.46875, "rewards/chosen": 0.01709746941924095, "rewards/margins": -0.004833616316318512, "rewards/rejected": 0.021931089460849762, "step": 7, "train_speed(iter/s)": 0.005511 }, { "epoch": 0.006454703613121202, "grad_norm": 6.577890872955322, "learning_rate": 2.5806451612903226e-05, "logits/chosen": -0.6166916489601135, "logits/rejected": -0.6146227717399597, "logps/chosen": -16.807830810546875, "logps/rejected": -11.38271427154541, "loss": 1.2828420400619507, "memory(GiB)": 46.83, "nll_loss": 0.5101535320281982, "rewards/accuracies": 0.25, "rewards/chosen": -0.04314221069216728, "rewards/margins": -0.13309986889362335, "rewards/rejected": 0.08995765447616577, "step": 8, "train_speed(iter/s)": 0.005502 }, { "epoch": 0.007261541564761352, "grad_norm": 3.5513713359832764, "learning_rate": 2.9032258064516133e-05, "logits/chosen": -0.5994153022766113, "logits/rejected": -0.6015004515647888, "logps/chosen": -11.679065704345703, "logps/rejected": -12.411300659179688, "loss": 1.171980857849121, "memory(GiB)": 46.83, "nll_loss": 0.4982386827468872, "rewards/accuracies": 0.5625, "rewards/chosen": 0.035934723913669586, "rewards/margins": 0.08020534366369247, "rewards/rejected": -0.04427062347531319, "step": 9, "train_speed(iter/s)": 0.005483 }, { "epoch": 0.008068379516401502, "grad_norm": 7.633578777313232, "learning_rate": 3.2258064516129034e-05, "logits/chosen": -0.6122820377349854, "logits/rejected": -0.6125556826591492, "logps/chosen": -12.382171630859375, "logps/rejected": -10.675874710083008, "loss": 1.3903008699417114, "memory(GiB)": 46.83, "nll_loss": 0.6006877422332764, "rewards/accuracies": 0.375, "rewards/chosen": -0.08313174545764923, "rewards/margins": -0.13078533113002777, "rewards/rejected": 0.04765357822179794, "step": 10, "train_speed(iter/s)": 0.005494 }, { "epoch": 0.008875217468041654, "grad_norm": 4.818623065948486, "learning_rate": 3.548387096774194e-05, "logits/chosen": -0.6364253759384155, "logits/rejected": -0.6395613551139832, "logps/chosen": -7.883171558380127, "logps/rejected": -15.457681655883789, "loss": 1.1344804763793945, "memory(GiB)": 46.83, "nll_loss": 0.46768438816070557, "rewards/accuracies": 0.53125, "rewards/chosen": 0.008294675499200821, "rewards/margins": 0.10872506350278854, "rewards/rejected": -0.10043041408061981, "step": 11, "train_speed(iter/s)": 0.00549 }, { "epoch": 0.009682055419681803, "grad_norm": 3.8297243118286133, "learning_rate": 3.870967741935484e-05, "logits/chosen": -0.6082768440246582, "logits/rejected": -0.6128782629966736, "logps/chosen": -10.993257522583008, "logps/rejected": -14.49487018585205, "loss": 1.1111013889312744, "memory(GiB)": 46.83, "nll_loss": 0.42791634798049927, "rewards/accuracies": 0.46875, "rewards/chosen": -0.013819348067045212, "rewards/margins": 0.08211039006710052, "rewards/rejected": -0.09592973440885544, "step": 12, "train_speed(iter/s)": 0.005476 }, { "epoch": 0.010488893371321953, "grad_norm": 3.1733834743499756, "learning_rate": 4.1935483870967746e-05, "logits/chosen": -0.597683846950531, "logits/rejected": -0.6003975868225098, "logps/chosen": -7.611721038818359, "logps/rejected": -13.589990615844727, "loss": 0.9966970682144165, "memory(GiB)": 46.83, "nll_loss": 0.3590569496154785, "rewards/accuracies": 0.65625, "rewards/chosen": 0.09378139674663544, "rewards/margins": 0.16571055352687836, "rewards/rejected": -0.07192917168140411, "step": 13, "train_speed(iter/s)": 0.005488 }, { "epoch": 0.011295731322962103, "grad_norm": 5.364157676696777, "learning_rate": 4.516129032258064e-05, "logits/chosen": -0.5847792029380798, "logits/rejected": -0.5856592655181885, "logps/chosen": -11.617069244384766, "logps/rejected": -11.611367225646973, "loss": 1.2788419723510742, "memory(GiB)": 46.83, "nll_loss": 0.5410674214363098, "rewards/accuracies": 0.46875, "rewards/chosen": 0.037577953189611435, "rewards/margins": -0.04553454369306564, "rewards/rejected": 0.08311249315738678, "step": 14, "train_speed(iter/s)": 0.005494 }, { "epoch": 0.012102569274602255, "grad_norm": 3.436879873275757, "learning_rate": 4.8387096774193554e-05, "logits/chosen": -0.5832479596138, "logits/rejected": -0.5832363367080688, "logps/chosen": -9.650967597961426, "logps/rejected": -11.376352310180664, "loss": 1.0634793043136597, "memory(GiB)": 46.83, "nll_loss": 0.34024038910865784, "rewards/accuracies": 0.53125, "rewards/chosen": 0.05362201854586601, "rewards/margins": -0.029222950339317322, "rewards/rejected": 0.08284495770931244, "step": 15, "train_speed(iter/s)": 0.005497 }, { "epoch": 0.012909407226242404, "grad_norm": 3.2199597358703613, "learning_rate": 5.161290322580645e-05, "logits/chosen": -0.6036816239356995, "logits/rejected": -0.606670618057251, "logps/chosen": -10.059551239013672, "logps/rejected": -16.143247604370117, "loss": 1.0622740983963013, "memory(GiB)": 46.83, "nll_loss": 0.3808459937572479, "rewards/accuracies": 0.625, "rewards/chosen": 0.11249684542417526, "rewards/margins": 0.040876831859350204, "rewards/rejected": 0.07162001729011536, "step": 16, "train_speed(iter/s)": 0.00549 }, { "epoch": 0.013716245177882554, "grad_norm": 3.376516819000244, "learning_rate": 5.4838709677419355e-05, "logits/chosen": -0.5811513662338257, "logits/rejected": -0.5822936296463013, "logps/chosen": -10.964933395385742, "logps/rejected": -13.541594505310059, "loss": 1.1284891366958618, "memory(GiB)": 46.83, "nll_loss": 0.43761852383613586, "rewards/accuracies": 0.5, "rewards/chosen": 0.11780606210231781, "rewards/margins": 0.02046366035938263, "rewards/rejected": 0.09734240174293518, "step": 17, "train_speed(iter/s)": 0.005493 }, { "epoch": 0.014523083129522704, "grad_norm": 3.292140245437622, "learning_rate": 5.8064516129032266e-05, "logits/chosen": -0.5822582840919495, "logits/rejected": -0.5867500305175781, "logps/chosen": -8.11985969543457, "logps/rejected": -14.659163475036621, "loss": 1.0471278429031372, "memory(GiB)": 46.83, "nll_loss": 0.40266352891921997, "rewards/accuracies": 0.65625, "rewards/chosen": 0.14493001997470856, "rewards/margins": 0.1153046265244484, "rewards/rejected": 0.029625393450260162, "step": 18, "train_speed(iter/s)": 0.005497 }, { "epoch": 0.015329921081162856, "grad_norm": 3.320802688598633, "learning_rate": 6.129032258064517e-05, "logits/chosen": -0.5760956406593323, "logits/rejected": -0.5776647925376892, "logps/chosen": -9.478979110717773, "logps/rejected": -11.301219940185547, "loss": 1.1243548393249512, "memory(GiB)": 46.83, "nll_loss": 0.48838871717453003, "rewards/accuracies": 0.6875, "rewards/chosen": 0.20540697872638702, "rewards/margins": 0.14464649558067322, "rewards/rejected": 0.06076047942042351, "step": 19, "train_speed(iter/s)": 0.005493 }, { "epoch": 0.016136759032803004, "grad_norm": 2.7910656929016113, "learning_rate": 6.451612903225807e-05, "logits/chosen": -0.5840404033660889, "logits/rejected": -0.582589864730835, "logps/chosen": -13.635812759399414, "logps/rejected": -10.431557655334473, "loss": 1.2548669576644897, "memory(GiB)": 46.83, "nll_loss": 0.55869460105896, "rewards/accuracies": 0.4375, "rewards/chosen": 0.13213564455509186, "rewards/margins": 0.044300854206085205, "rewards/rejected": 0.08783479034900665, "step": 20, "train_speed(iter/s)": 0.005497 }, { "epoch": 0.016943596984443157, "grad_norm": 2.2573604583740234, "learning_rate": 6.774193548387096e-05, "logits/chosen": -0.5839393734931946, "logits/rejected": -0.5850896835327148, "logps/chosen": -7.3839006423950195, "logps/rejected": -9.574810028076172, "loss": 0.9415242075920105, "memory(GiB)": 46.83, "nll_loss": 0.372197687625885, "rewards/accuracies": 0.75, "rewards/chosen": 0.2435840666294098, "rewards/margins": 0.30735281109809875, "rewards/rejected": -0.06376874446868896, "step": 21, "train_speed(iter/s)": 0.005504 }, { "epoch": 0.017750434936083307, "grad_norm": 2.90157413482666, "learning_rate": 7.096774193548388e-05, "logits/chosen": -0.6114062070846558, "logits/rejected": -0.6119735240936279, "logps/chosen": -8.486170768737793, "logps/rejected": -12.086725234985352, "loss": 1.0081067085266113, "memory(GiB)": 46.83, "nll_loss": 0.34981024265289307, "rewards/accuracies": 0.5625, "rewards/chosen": 0.10258002579212189, "rewards/margins": 0.12462681531906128, "rewards/rejected": -0.02204679138958454, "step": 22, "train_speed(iter/s)": 0.005501 }, { "epoch": 0.018557272887723457, "grad_norm": 2.4457335472106934, "learning_rate": 7.419354838709677e-05, "logits/chosen": -0.5648061037063599, "logits/rejected": -0.5674125552177429, "logps/chosen": -12.962445259094238, "logps/rejected": -15.476969718933105, "loss": 1.0199884176254272, "memory(GiB)": 46.83, "nll_loss": 0.4421077072620392, "rewards/accuracies": 0.6875, "rewards/chosen": 0.13948869705200195, "rewards/margins": 0.31703731417655945, "rewards/rejected": -0.17754864692687988, "step": 23, "train_speed(iter/s)": 0.005504 }, { "epoch": 0.019364110839363607, "grad_norm": 2.250957489013672, "learning_rate": 7.741935483870968e-05, "logits/chosen": -0.5476934313774109, "logits/rejected": -0.5497113466262817, "logps/chosen": -6.839375972747803, "logps/rejected": -12.336576461791992, "loss": 0.9127413630485535, "memory(GiB)": 46.83, "nll_loss": 0.3841688632965088, "rewards/accuracies": 0.78125, "rewards/chosen": 0.2666690945625305, "rewards/margins": 0.42246347665786743, "rewards/rejected": -0.1557943969964981, "step": 24, "train_speed(iter/s)": 0.005505 }, { "epoch": 0.020170948791003757, "grad_norm": 3.6742801666259766, "learning_rate": 8.064516129032258e-05, "logits/chosen": -0.5886849164962769, "logits/rejected": -0.5897050499916077, "logps/chosen": -8.534127235412598, "logps/rejected": -11.815479278564453, "loss": 1.0272297859191895, "memory(GiB)": 46.83, "nll_loss": 0.41876962780952454, "rewards/accuracies": 0.625, "rewards/chosen": 0.13335689902305603, "rewards/margins": 0.27482476830482483, "rewards/rejected": -0.1414678543806076, "step": 25, "train_speed(iter/s)": 0.005513 }, { "epoch": 0.020977786742643906, "grad_norm": 2.5902981758117676, "learning_rate": 8.387096774193549e-05, "logits/chosen": -0.5303969979286194, "logits/rejected": -0.5350589752197266, "logps/chosen": -9.592369079589844, "logps/rejected": -17.837379455566406, "loss": 0.9073010087013245, "memory(GiB)": 46.83, "nll_loss": 0.3275393545627594, "rewards/accuracies": 0.75, "rewards/chosen": 0.1778128743171692, "rewards/margins": 0.31808584928512573, "rewards/rejected": -0.14027300477027893, "step": 26, "train_speed(iter/s)": 0.005509 }, { "epoch": 0.021784624694284056, "grad_norm": 3.656003952026367, "learning_rate": 8.709677419354839e-05, "logits/chosen": -0.5741274356842041, "logits/rejected": -0.5759863257408142, "logps/chosen": -7.401767253875732, "logps/rejected": -9.595519065856934, "loss": 0.9837043881416321, "memory(GiB)": 46.83, "nll_loss": 0.34733644127845764, "rewards/accuracies": 0.6875, "rewards/chosen": 0.16637372970581055, "rewards/margins": 0.22424587607383728, "rewards/rejected": -0.05787213519215584, "step": 27, "train_speed(iter/s)": 0.00551 }, { "epoch": 0.022591462645924206, "grad_norm": 3.6425983905792236, "learning_rate": 9.032258064516129e-05, "logits/chosen": -0.5271302461624146, "logits/rejected": -0.5281438231468201, "logps/chosen": -10.050779342651367, "logps/rejected": -13.247575759887695, "loss": 1.0190500020980835, "memory(GiB)": 46.83, "nll_loss": 0.4030058681964874, "rewards/accuracies": 0.625, "rewards/chosen": 0.022431861609220505, "rewards/margins": 0.22834232449531555, "rewards/rejected": -0.20591047406196594, "step": 28, "train_speed(iter/s)": 0.005522 }, { "epoch": 0.02339830059756436, "grad_norm": 4.539236545562744, "learning_rate": 9.35483870967742e-05, "logits/chosen": -0.574794352054596, "logits/rejected": -0.5771020650863647, "logps/chosen": -7.9426727294921875, "logps/rejected": -11.816813468933105, "loss": 1.0435985326766968, "memory(GiB)": 46.83, "nll_loss": 0.4821586310863495, "rewards/accuracies": 0.6875, "rewards/chosen": 0.17023718357086182, "rewards/margins": 0.36495453119277954, "rewards/rejected": -0.19471733272075653, "step": 29, "train_speed(iter/s)": 0.005525 }, { "epoch": 0.02420513854920451, "grad_norm": 3.463172674179077, "learning_rate": 9.677419354838711e-05, "logits/chosen": -0.5663347244262695, "logits/rejected": -0.5671164393424988, "logps/chosen": -8.761878967285156, "logps/rejected": -16.922607421875, "loss": 0.8841907978057861, "memory(GiB)": 46.83, "nll_loss": 0.37557756900787354, "rewards/accuracies": 0.8125, "rewards/chosen": 0.23288068175315857, "rewards/margins": 0.47043219208717346, "rewards/rejected": -0.2375514954328537, "step": 30, "train_speed(iter/s)": 0.005522 }, { "epoch": 0.02501197650084466, "grad_norm": 7.054537296295166, "learning_rate": 0.0001, "logits/chosen": -0.5485356450080872, "logits/rejected": -0.5510388612747192, "logps/chosen": -8.1714506149292, "logps/rejected": -15.964082717895508, "loss": 1.0905145406723022, "memory(GiB)": 46.83, "nll_loss": 0.48109474778175354, "rewards/accuracies": 0.65625, "rewards/chosen": 0.14875195920467377, "rewards/margins": 0.23288127779960632, "rewards/rejected": -0.08412933349609375, "step": 31, "train_speed(iter/s)": 0.005519 }, { "epoch": 0.02581881445248481, "grad_norm": 2.8915627002716064, "learning_rate": 0.0001032258064516129, "logits/chosen": -0.5415224432945251, "logits/rejected": -0.5406837463378906, "logps/chosen": -12.312981605529785, "logps/rejected": -14.444657325744629, "loss": 0.9778124094009399, "memory(GiB)": 46.83, "nll_loss": 0.4027611017227173, "rewards/accuracies": 0.71875, "rewards/chosen": 0.11852823942899704, "rewards/margins": 0.3213120102882385, "rewards/rejected": -0.2027837634086609, "step": 32, "train_speed(iter/s)": 0.005515 }, { "epoch": 0.02662565240412496, "grad_norm": 4.721103191375732, "learning_rate": 0.0001064516129032258, "logits/chosen": -0.5442328453063965, "logits/rejected": -0.5437616109848022, "logps/chosen": -9.491182327270508, "logps/rejected": -18.31528663635254, "loss": 1.1582751274108887, "memory(GiB)": 46.83, "nll_loss": 0.5736849904060364, "rewards/accuracies": 0.75, "rewards/chosen": 0.03584306687116623, "rewards/margins": 0.35881760716438293, "rewards/rejected": -0.3229745626449585, "step": 33, "train_speed(iter/s)": 0.005515 }, { "epoch": 0.02743249035576511, "grad_norm": 4.470694065093994, "learning_rate": 0.00010967741935483871, "logits/chosen": -0.49901843070983887, "logits/rejected": -0.5027262568473816, "logps/chosen": -6.029642105102539, "logps/rejected": -17.065149307250977, "loss": 0.7831717133522034, "memory(GiB)": 46.83, "nll_loss": 0.2735077142715454, "rewards/accuracies": 0.6875, "rewards/chosen": 0.172469824552536, "rewards/margins": 0.6490951180458069, "rewards/rejected": -0.4766252934932709, "step": 34, "train_speed(iter/s)": 0.005511 }, { "epoch": 0.02823932830740526, "grad_norm": 4.086674690246582, "learning_rate": 0.00011290322580645163, "logits/chosen": -0.5251173377037048, "logits/rejected": -0.5295683145523071, "logps/chosen": -10.127384185791016, "logps/rejected": -19.261646270751953, "loss": 0.90782630443573, "memory(GiB)": 46.83, "nll_loss": 0.37643295526504517, "rewards/accuracies": 0.71875, "rewards/chosen": 0.059490665793418884, "rewards/margins": 0.5788955688476562, "rewards/rejected": -0.5194048881530762, "step": 35, "train_speed(iter/s)": 0.005516 }, { "epoch": 0.02904616625904541, "grad_norm": 3.153599977493286, "learning_rate": 0.00011612903225806453, "logits/chosen": -0.5580551624298096, "logits/rejected": -0.561299741268158, "logps/chosen": -7.748661518096924, "logps/rejected": -18.775835037231445, "loss": 0.8323644995689392, "memory(GiB)": 46.83, "nll_loss": 0.30874526500701904, "rewards/accuracies": 0.75, "rewards/chosen": 0.17774799466133118, "rewards/margins": 0.58444744348526, "rewards/rejected": -0.4066994786262512, "step": 36, "train_speed(iter/s)": 0.005518 }, { "epoch": 0.02985300421068556, "grad_norm": 5.963130950927734, "learning_rate": 0.00011935483870967743, "logits/chosen": -0.5691896080970764, "logits/rejected": -0.5704917907714844, "logps/chosen": -5.695924282073975, "logps/rejected": -15.709531784057617, "loss": 0.8581907153129578, "memory(GiB)": 46.83, "nll_loss": 0.32061102986335754, "rewards/accuracies": 0.75, "rewards/chosen": 0.13813850283622742, "rewards/margins": 0.42923206090927124, "rewards/rejected": -0.2910935878753662, "step": 37, "train_speed(iter/s)": 0.005516 }, { "epoch": 0.03065984216232571, "grad_norm": 3.532068967819214, "learning_rate": 0.00012258064516129034, "logits/chosen": -0.5251184105873108, "logits/rejected": -0.5261702537536621, "logps/chosen": -8.303949356079102, "logps/rejected": -13.649654388427734, "loss": 0.9825394153594971, "memory(GiB)": 46.83, "nll_loss": 0.39365747570991516, "rewards/accuracies": 0.65625, "rewards/chosen": 0.07552488148212433, "rewards/margins": 0.2995148003101349, "rewards/rejected": -0.22398996353149414, "step": 38, "train_speed(iter/s)": 0.005515 }, { "epoch": 0.03146668011396586, "grad_norm": 2.9115569591522217, "learning_rate": 0.00012580645161290322, "logits/chosen": -0.5716837048530579, "logits/rejected": -0.5749698281288147, "logps/chosen": -7.206816673278809, "logps/rejected": -15.77934741973877, "loss": 0.7430101633071899, "memory(GiB)": 46.83, "nll_loss": 0.27266308665275574, "rewards/accuracies": 0.90625, "rewards/chosen": 0.20229285955429077, "rewards/margins": 0.6254266500473022, "rewards/rejected": -0.42313385009765625, "step": 39, "train_speed(iter/s)": 0.005515 }, { "epoch": 0.03227351806560601, "grad_norm": 4.647506237030029, "learning_rate": 0.00012903225806451613, "logits/chosen": -0.5296156406402588, "logits/rejected": -0.5295798778533936, "logps/chosen": -10.529404640197754, "logps/rejected": -16.44548988342285, "loss": 0.900071918964386, "memory(GiB)": 46.83, "nll_loss": 0.3727172613143921, "rewards/accuracies": 0.71875, "rewards/chosen": 0.08702702820301056, "rewards/margins": 0.4926542341709137, "rewards/rejected": -0.40562722086906433, "step": 40, "train_speed(iter/s)": 0.005514 }, { "epoch": 0.03308035601724616, "grad_norm": 3.4815561771392822, "learning_rate": 0.00013225806451612905, "logits/chosen": -0.5586342811584473, "logits/rejected": -0.5603877305984497, "logps/chosen": -7.803877830505371, "logps/rejected": -18.412734985351562, "loss": 0.8854644298553467, "memory(GiB)": 46.83, "nll_loss": 0.37826117873191833, "rewards/accuracies": 0.78125, "rewards/chosen": 0.08443664014339447, "rewards/margins": 0.6363339424133301, "rewards/rejected": -0.5518972873687744, "step": 41, "train_speed(iter/s)": 0.005514 }, { "epoch": 0.033887193968886314, "grad_norm": 3.6079483032226562, "learning_rate": 0.00013548387096774193, "logits/chosen": -0.5233692526817322, "logits/rejected": -0.5257354378700256, "logps/chosen": -11.989986419677734, "logps/rejected": -17.48329734802246, "loss": 0.9667509198188782, "memory(GiB)": 46.83, "nll_loss": 0.4528670608997345, "rewards/accuracies": 0.8125, "rewards/chosen": 0.14738641679286957, "rewards/margins": 0.5997685194015503, "rewards/rejected": -0.4523821473121643, "step": 42, "train_speed(iter/s)": 0.005512 }, { "epoch": 0.03469403192052646, "grad_norm": 5.491096019744873, "learning_rate": 0.00013870967741935487, "logits/chosen": -0.5798231363296509, "logits/rejected": -0.5843824148178101, "logps/chosen": -8.180625915527344, "logps/rejected": -19.614505767822266, "loss": 1.0811830759048462, "memory(GiB)": 46.83, "nll_loss": 0.5651165246963501, "rewards/accuracies": 0.75, "rewards/chosen": 0.018763888627290726, "rewards/margins": 0.5782932043075562, "rewards/rejected": -0.5595293641090393, "step": 43, "train_speed(iter/s)": 0.005507 }, { "epoch": 0.035500869872166614, "grad_norm": 5.715328216552734, "learning_rate": 0.00014193548387096775, "logits/chosen": -0.5562050342559814, "logits/rejected": -0.5585284233093262, "logps/chosen": -9.799619674682617, "logps/rejected": -13.962825775146484, "loss": 1.046175479888916, "memory(GiB)": 46.83, "nll_loss": 0.5247361660003662, "rewards/accuracies": 0.6875, "rewards/chosen": 0.0660993829369545, "rewards/margins": 0.557608425617218, "rewards/rejected": -0.4915090799331665, "step": 44, "train_speed(iter/s)": 0.005509 }, { "epoch": 0.03630770782380676, "grad_norm": 4.065413951873779, "learning_rate": 0.00014516129032258066, "logits/chosen": -0.5717958807945251, "logits/rejected": -0.5754877924919128, "logps/chosen": -10.432125091552734, "logps/rejected": -17.75714111328125, "loss": 0.9775079488754272, "memory(GiB)": 46.83, "nll_loss": 0.4804929792881012, "rewards/accuracies": 0.71875, "rewards/chosen": 0.16446207463741302, "rewards/margins": 0.5844215154647827, "rewards/rejected": -0.4199594557285309, "step": 45, "train_speed(iter/s)": 0.005513 }, { "epoch": 0.037114545775446914, "grad_norm": 4.507160663604736, "learning_rate": 0.00014838709677419355, "logits/chosen": -0.5544827580451965, "logits/rejected": -0.5517963171005249, "logps/chosen": -10.039278030395508, "logps/rejected": -16.44822120666504, "loss": 0.9198786020278931, "memory(GiB)": 46.83, "nll_loss": 0.3649781346321106, "rewards/accuracies": 0.6875, "rewards/chosen": 0.11493994295597076, "rewards/margins": 0.5548471808433533, "rewards/rejected": -0.4399072825908661, "step": 46, "train_speed(iter/s)": 0.005512 }, { "epoch": 0.03792138372708706, "grad_norm": 4.040234565734863, "learning_rate": 0.00015161290322580646, "logits/chosen": -0.5704259276390076, "logits/rejected": -0.5716680884361267, "logps/chosen": -7.400537967681885, "logps/rejected": -17.6054744720459, "loss": 0.9134971499443054, "memory(GiB)": 46.83, "nll_loss": 0.3412809669971466, "rewards/accuracies": 0.78125, "rewards/chosen": 0.03388240188360214, "rewards/margins": 0.4440326392650604, "rewards/rejected": -0.4101502001285553, "step": 47, "train_speed(iter/s)": 0.005512 }, { "epoch": 0.038728221678727213, "grad_norm": 2.9642419815063477, "learning_rate": 0.00015483870967741937, "logits/chosen": -0.5867742300033569, "logits/rejected": -0.5912387371063232, "logps/chosen": -9.146940231323242, "logps/rejected": -16.374706268310547, "loss": 0.9059248566627502, "memory(GiB)": 46.83, "nll_loss": 0.3897300958633423, "rewards/accuracies": 0.78125, "rewards/chosen": 0.1047089472413063, "rewards/margins": 0.5065208673477173, "rewards/rejected": -0.4018118679523468, "step": 48, "train_speed(iter/s)": 0.005514 }, { "epoch": 0.03953505963036737, "grad_norm": 3.087217330932617, "learning_rate": 0.00015806451612903225, "logits/chosen": -0.5874481201171875, "logits/rejected": -0.5872229337692261, "logps/chosen": -6.086337566375732, "logps/rejected": -10.504037857055664, "loss": 0.8798851370811462, "memory(GiB)": 46.83, "nll_loss": 0.33263421058654785, "rewards/accuracies": 0.6875, "rewards/chosen": 0.20601165294647217, "rewards/margins": 0.4658709466457367, "rewards/rejected": -0.2598593533039093, "step": 49, "train_speed(iter/s)": 0.005513 }, { "epoch": 0.04034189758200751, "grad_norm": 3.16754150390625, "learning_rate": 0.00016129032258064516, "logits/chosen": -0.5708128809928894, "logits/rejected": -0.5798742175102234, "logps/chosen": -6.393083572387695, "logps/rejected": -19.668724060058594, "loss": 0.8404853343963623, "memory(GiB)": 46.83, "nll_loss": 0.34996694326400757, "rewards/accuracies": 0.84375, "rewards/chosen": 0.21206828951835632, "rewards/margins": 0.5756057500839233, "rewards/rejected": -0.363537460565567, "step": 50, "train_speed(iter/s)": 0.005516 }, { "epoch": 0.041148735533647667, "grad_norm": 2.4009766578674316, "learning_rate": 0.00016451612903225807, "logits/chosen": -0.5599406361579895, "logits/rejected": -0.5625043511390686, "logps/chosen": -7.262391090393066, "logps/rejected": -15.73720932006836, "loss": 0.8113247752189636, "memory(GiB)": 46.83, "nll_loss": 0.28076890110969543, "rewards/accuracies": 0.8125, "rewards/chosen": 0.14269490540027618, "rewards/margins": 0.47564250230789185, "rewards/rejected": -0.33294758200645447, "step": 51, "train_speed(iter/s)": 0.005506 }, { "epoch": 0.04195557348528781, "grad_norm": 3.129634380340576, "learning_rate": 0.00016774193548387098, "logits/chosen": -0.5937235355377197, "logits/rejected": -0.5938248038291931, "logps/chosen": -5.393199920654297, "logps/rejected": -15.786672592163086, "loss": 0.7831435799598694, "memory(GiB)": 46.83, "nll_loss": 0.2872075140476227, "rewards/accuracies": 0.8125, "rewards/chosen": 0.19873687624931335, "rewards/margins": 0.5569283366203308, "rewards/rejected": -0.35819149017333984, "step": 52, "train_speed(iter/s)": 0.005507 }, { "epoch": 0.042762411436927966, "grad_norm": 3.2887256145477295, "learning_rate": 0.0001709677419354839, "logits/chosen": -0.5820189118385315, "logits/rejected": -0.5850119590759277, "logps/chosen": -7.764882564544678, "logps/rejected": -16.894685745239258, "loss": 0.8994213342666626, "memory(GiB)": 46.83, "nll_loss": 0.3770924210548401, "rewards/accuracies": 0.6875, "rewards/chosen": 0.20706558227539062, "rewards/margins": 0.5472366213798523, "rewards/rejected": -0.34017103910446167, "step": 53, "train_speed(iter/s)": 0.005506 }, { "epoch": 0.04356924938856811, "grad_norm": 3.7313735485076904, "learning_rate": 0.00017419354838709678, "logits/chosen": -0.5833962559700012, "logits/rejected": -0.5876143574714661, "logps/chosen": -8.130949020385742, "logps/rejected": -20.79953384399414, "loss": 0.9545141458511353, "memory(GiB)": 46.83, "nll_loss": 0.4539381265640259, "rewards/accuracies": 0.75, "rewards/chosen": 0.10515612363815308, "rewards/margins": 0.612572968006134, "rewards/rejected": -0.5074167847633362, "step": 54, "train_speed(iter/s)": 0.005507 }, { "epoch": 0.044376087340208266, "grad_norm": 5.652868747711182, "learning_rate": 0.0001774193548387097, "logits/chosen": -0.5960416793823242, "logits/rejected": -0.5957224369049072, "logps/chosen": -12.674562454223633, "logps/rejected": -15.591826438903809, "loss": 1.1736092567443848, "memory(GiB)": 46.83, "nll_loss": 0.5310375690460205, "rewards/accuracies": 0.625, "rewards/chosen": -0.11839848756790161, "rewards/margins": 0.40016603469848633, "rewards/rejected": -0.5185645222663879, "step": 55, "train_speed(iter/s)": 0.005509 }, { "epoch": 0.04518292529184841, "grad_norm": 4.002370834350586, "learning_rate": 0.00018064516129032257, "logits/chosen": -0.5776931643486023, "logits/rejected": -0.5789185166358948, "logps/chosen": -12.67449951171875, "logps/rejected": -16.919376373291016, "loss": 1.087173342704773, "memory(GiB)": 46.83, "nll_loss": 0.4873568117618561, "rewards/accuracies": 0.65625, "rewards/chosen": -0.15739397704601288, "rewards/margins": 0.39120250940322876, "rewards/rejected": -0.5485965013504028, "step": 56, "train_speed(iter/s)": 0.005507 }, { "epoch": 0.045989763243488566, "grad_norm": 3.5529890060424805, "learning_rate": 0.00018387096774193548, "logits/chosen": -0.5732367634773254, "logits/rejected": -0.5760124921798706, "logps/chosen": -4.22891902923584, "logps/rejected": -18.773733139038086, "loss": 0.6395769119262695, "memory(GiB)": 46.83, "nll_loss": 0.23632453382015228, "rewards/accuracies": 0.9375, "rewards/chosen": 0.12576641142368317, "rewards/margins": 0.908116340637207, "rewards/rejected": -0.7823498845100403, "step": 57, "train_speed(iter/s)": 0.005505 }, { "epoch": 0.04679660119512872, "grad_norm": 2.638253927230835, "learning_rate": 0.0001870967741935484, "logits/chosen": -0.5618959069252014, "logits/rejected": -0.5671476721763611, "logps/chosen": -8.717156410217285, "logps/rejected": -22.3723087310791, "loss": 0.8119103312492371, "memory(GiB)": 46.83, "nll_loss": 0.4192086458206177, "rewards/accuracies": 0.9375, "rewards/chosen": 0.18826748430728912, "rewards/margins": 0.8515651226043701, "rewards/rejected": -0.6632976531982422, "step": 58, "train_speed(iter/s)": 0.005503 }, { "epoch": 0.047603439146768865, "grad_norm": 4.416356086730957, "learning_rate": 0.0001903225806451613, "logits/chosen": -0.5946109294891357, "logits/rejected": -0.5949057340621948, "logps/chosen": -10.825102806091309, "logps/rejected": -15.580466270446777, "loss": 0.9124961495399475, "memory(GiB)": 46.83, "nll_loss": 0.43738603591918945, "rewards/accuracies": 0.78125, "rewards/chosen": 0.1081230640411377, "rewards/margins": 0.6975550651550293, "rewards/rejected": -0.5894321203231812, "step": 59, "train_speed(iter/s)": 0.005503 }, { "epoch": 0.04841027709840902, "grad_norm": 3.548480272293091, "learning_rate": 0.00019354838709677422, "logits/chosen": -0.576353907585144, "logits/rejected": -0.5807583928108215, "logps/chosen": -10.603282928466797, "logps/rejected": -20.904390335083008, "loss": 1.033903956413269, "memory(GiB)": 46.83, "nll_loss": 0.5458623170852661, "rewards/accuracies": 0.71875, "rewards/chosen": 0.10141083598136902, "rewards/margins": 0.9133819341659546, "rewards/rejected": -0.8119711875915527, "step": 60, "train_speed(iter/s)": 0.005505 }, { "epoch": 0.049217115050049165, "grad_norm": 4.239978790283203, "learning_rate": 0.0001967741935483871, "logits/chosen": -0.6159774661064148, "logits/rejected": -0.6157845258712769, "logps/chosen": -13.034204483032227, "logps/rejected": -21.466520309448242, "loss": 0.9954748153686523, "memory(GiB)": 46.83, "nll_loss": 0.5168237090110779, "rewards/accuracies": 0.8125, "rewards/chosen": -0.15371613204479218, "rewards/margins": 0.9087806940078735, "rewards/rejected": -1.0624967813491821, "step": 61, "train_speed(iter/s)": 0.005508 }, { "epoch": 0.05002395300168932, "grad_norm": 4.418153285980225, "learning_rate": 0.0002, "logits/chosen": -0.586484968662262, "logits/rejected": -0.5885915756225586, "logps/chosen": -6.359810829162598, "logps/rejected": -18.686431884765625, "loss": 0.7993831634521484, "memory(GiB)": 46.83, "nll_loss": 0.3223803639411926, "rewards/accuracies": 0.84375, "rewards/chosen": 0.1565569043159485, "rewards/margins": 0.8297788500785828, "rewards/rejected": -0.6732219457626343, "step": 62, "train_speed(iter/s)": 0.005508 }, { "epoch": 0.050830790953329465, "grad_norm": 3.898704767227173, "learning_rate": 0.00019999964378142156, "logits/chosen": -0.5732013583183289, "logits/rejected": -0.5774887800216675, "logps/chosen": -12.98630142211914, "logps/rejected": -19.34124755859375, "loss": 0.9075384140014648, "memory(GiB)": 46.83, "nll_loss": 0.39192017912864685, "rewards/accuracies": 0.75, "rewards/chosen": 0.19289077818393707, "rewards/margins": 0.6732712388038635, "rewards/rejected": -0.48038047552108765, "step": 63, "train_speed(iter/s)": 0.005507 }, { "epoch": 0.05163762890496962, "grad_norm": 6.278528213500977, "learning_rate": 0.00019999857512822402, "logits/chosen": -0.6075332760810852, "logits/rejected": -0.6084203124046326, "logps/chosen": -14.246075630187988, "logps/rejected": -20.948959350585938, "loss": 1.0685752630233765, "memory(GiB)": 46.83, "nll_loss": 0.5815572142601013, "rewards/accuracies": 0.71875, "rewards/chosen": -0.03303433582186699, "rewards/margins": 0.8266364336013794, "rewards/rejected": -0.8596707582473755, "step": 64, "train_speed(iter/s)": 0.005508 }, { "epoch": 0.052444466856609764, "grad_norm": 4.589393615722656, "learning_rate": 0.00019999679404802089, "logits/chosen": -0.596097469329834, "logits/rejected": -0.5986034870147705, "logps/chosen": -8.450502395629883, "logps/rejected": -21.070066452026367, "loss": 0.7867013812065125, "memory(GiB)": 46.83, "nll_loss": 0.31530463695526123, "rewards/accuracies": 0.84375, "rewards/chosen": 0.13920006155967712, "rewards/margins": 0.9423296451568604, "rewards/rejected": -0.8031294941902161, "step": 65, "train_speed(iter/s)": 0.005508 }, { "epoch": 0.05325130480824992, "grad_norm": 4.376217365264893, "learning_rate": 0.00019999430055350122, "logits/chosen": -0.5758836269378662, "logits/rejected": -0.5734565854072571, "logps/chosen": -10.774827003479004, "logps/rejected": -19.021907806396484, "loss": 0.7909982800483704, "memory(GiB)": 46.83, "nll_loss": 0.3997192680835724, "rewards/accuracies": 0.9375, "rewards/chosen": 0.23606787621974945, "rewards/margins": 1.0521141290664673, "rewards/rejected": -0.8160461783409119, "step": 66, "train_speed(iter/s)": 0.005507 }, { "epoch": 0.05405814275989007, "grad_norm": 6.438971042633057, "learning_rate": 0.00019999109466242962, "logits/chosen": -0.5718088150024414, "logits/rejected": -0.5745964050292969, "logps/chosen": -6.671931266784668, "logps/rejected": -20.429231643676758, "loss": 0.8954067230224609, "memory(GiB)": 46.83, "nll_loss": 0.45071539282798767, "rewards/accuracies": 0.8125, "rewards/chosen": 0.10935470461845398, "rewards/margins": 0.8583554029464722, "rewards/rejected": -0.7490006685256958, "step": 67, "train_speed(iter/s)": 0.005509 }, { "epoch": 0.05486498071153022, "grad_norm": 11.16286849975586, "learning_rate": 0.00019998717639764602, "logits/chosen": -0.5820534229278564, "logits/rejected": -0.5849663019180298, "logps/chosen": -9.799468040466309, "logps/rejected": -18.977890014648438, "loss": 1.29269278049469, "memory(GiB)": 46.83, "nll_loss": 0.7049438953399658, "rewards/accuracies": 0.6875, "rewards/chosen": -0.04825415089726448, "rewards/margins": 0.5465254783630371, "rewards/rejected": -0.5947796702384949, "step": 68, "train_speed(iter/s)": 0.005506 }, { "epoch": 0.05567181866317037, "grad_norm": 9.413622856140137, "learning_rate": 0.00019998254578706563, "logits/chosen": -0.5850585699081421, "logits/rejected": -0.5874402523040771, "logps/chosen": -8.903966903686523, "logps/rejected": -14.843938827514648, "loss": 1.3027069568634033, "memory(GiB)": 46.83, "nll_loss": 0.744307279586792, "rewards/accuracies": 0.78125, "rewards/chosen": -0.0512365885078907, "rewards/margins": 0.5854336619377136, "rewards/rejected": -0.6366702318191528, "step": 69, "train_speed(iter/s)": 0.005505 }, { "epoch": 0.05647865661481052, "grad_norm": 7.333382606506348, "learning_rate": 0.00019997720286367863, "logits/chosen": -0.545200765132904, "logits/rejected": -0.5484716296195984, "logps/chosen": -7.334113121032715, "logps/rejected": -22.56316375732422, "loss": 1.0189334154129028, "memory(GiB)": 46.83, "nll_loss": 0.5383400321006775, "rewards/accuracies": 0.84375, "rewards/chosen": 0.061847541481256485, "rewards/margins": 0.6559779644012451, "rewards/rejected": -0.5941305160522461, "step": 70, "train_speed(iter/s)": 0.005506 }, { "epoch": 0.05728549456645067, "grad_norm": 2.8849799633026123, "learning_rate": 0.00019997114766554997, "logits/chosen": -0.5629354119300842, "logits/rejected": -0.5669021606445312, "logps/chosen": -8.698752403259277, "logps/rejected": -21.85867691040039, "loss": 0.8375651836395264, "memory(GiB)": 46.83, "nll_loss": 0.3549819886684418, "rewards/accuracies": 0.78125, "rewards/chosen": 0.09854352474212646, "rewards/margins": 0.7027413845062256, "rewards/rejected": -0.6041979193687439, "step": 71, "train_speed(iter/s)": 0.005507 }, { "epoch": 0.05809233251809082, "grad_norm": 2.6733391284942627, "learning_rate": 0.00019996438023581913, "logits/chosen": -0.5319232940673828, "logits/rejected": -0.5331096649169922, "logps/chosen": -10.13166332244873, "logps/rejected": -13.18635368347168, "loss": 1.014970302581787, "memory(GiB)": 46.83, "nll_loss": 0.4217461347579956, "rewards/accuracies": 0.71875, "rewards/chosen": 0.14793364703655243, "rewards/margins": 0.3788456618785858, "rewards/rejected": -0.2309119999408722, "step": 72, "train_speed(iter/s)": 0.005505 }, { "epoch": 0.05889917046973097, "grad_norm": 2.497257947921753, "learning_rate": 0.00019995690062269984, "logits/chosen": -0.5789859294891357, "logits/rejected": -0.5805359482765198, "logps/chosen": -8.139568328857422, "logps/rejected": -10.85029411315918, "loss": 0.9546566605567932, "memory(GiB)": 46.83, "nll_loss": 0.4216194450855255, "rewards/accuracies": 0.65625, "rewards/chosen": 0.24104151129722595, "rewards/margins": 0.5254760980606079, "rewards/rejected": -0.28443461656570435, "step": 73, "train_speed(iter/s)": 0.005506 }, { "epoch": 0.05970600842137112, "grad_norm": 2.8535268306732178, "learning_rate": 0.00019994870887947962, "logits/chosen": -0.5778383612632751, "logits/rejected": -0.5768096446990967, "logps/chosen": -8.49053955078125, "logps/rejected": -12.854878425598145, "loss": 1.0000758171081543, "memory(GiB)": 46.83, "nll_loss": 0.37848562002182007, "rewards/accuracies": 0.625, "rewards/chosen": 0.1054978221654892, "rewards/margins": 0.3462926149368286, "rewards/rejected": -0.24079479277133942, "step": 74, "train_speed(iter/s)": 0.005506 }, { "epoch": 0.06051284637301127, "grad_norm": 2.198607921600342, "learning_rate": 0.00019993980506451947, "logits/chosen": -0.530400276184082, "logits/rejected": -0.530858039855957, "logps/chosen": -9.152666091918945, "logps/rejected": -11.464343070983887, "loss": 0.9745745658874512, "memory(GiB)": 46.83, "nll_loss": 0.38881367444992065, "rewards/accuracies": 0.75, "rewards/chosen": 0.1783803254365921, "rewards/margins": 0.3315035402774811, "rewards/rejected": -0.1531231850385666, "step": 75, "train_speed(iter/s)": 0.005504 }, { "epoch": 0.06131968432465142, "grad_norm": 2.461601972579956, "learning_rate": 0.0001999301892412535, "logits/chosen": -0.5405219197273254, "logits/rejected": -0.5390282869338989, "logps/chosen": -10.537997245788574, "logps/rejected": -15.066913604736328, "loss": 0.966386079788208, "memory(GiB)": 46.83, "nll_loss": 0.38977545499801636, "rewards/accuracies": 0.71875, "rewards/chosen": 0.09291838109493256, "rewards/margins": 0.3533533811569214, "rewards/rejected": -0.26043495535850525, "step": 76, "train_speed(iter/s)": 0.005503 }, { "epoch": 0.06212652227629157, "grad_norm": 2.0999796390533447, "learning_rate": 0.00019991986147818838, "logits/chosen": -0.5443933010101318, "logits/rejected": -0.5435047149658203, "logps/chosen": -12.143755912780762, "logps/rejected": -15.766691207885742, "loss": 0.8939065337181091, "memory(GiB)": 46.83, "nll_loss": 0.415660560131073, "rewards/accuracies": 0.90625, "rewards/chosen": 0.23248028755187988, "rewards/margins": 0.5352811217308044, "rewards/rejected": -0.30280083417892456, "step": 77, "train_speed(iter/s)": 0.005502 }, { "epoch": 0.06293336022793172, "grad_norm": 2.9244306087493896, "learning_rate": 0.00019990882184890295, "logits/chosen": -0.5794655680656433, "logits/rejected": -0.5853484869003296, "logps/chosen": -7.884565353393555, "logps/rejected": -20.136926651000977, "loss": 0.8564450740814209, "memory(GiB)": 46.83, "nll_loss": 0.34705159068107605, "rewards/accuracies": 0.875, "rewards/chosen": 0.14532405138015747, "rewards/margins": 0.5069437623023987, "rewards/rejected": -0.3616198003292084, "step": 78, "train_speed(iter/s)": 0.005502 }, { "epoch": 0.06374019817957187, "grad_norm": 3.461670160293579, "learning_rate": 0.00019989707043204763, "logits/chosen": -0.5491142868995667, "logits/rejected": -0.553898811340332, "logps/chosen": -7.547114372253418, "logps/rejected": -18.740121841430664, "loss": 0.9405392408370972, "memory(GiB)": 46.83, "nll_loss": 0.48508715629577637, "rewards/accuracies": 0.84375, "rewards/chosen": 0.128400981426239, "rewards/margins": 0.6999501585960388, "rewards/rejected": -0.5715491771697998, "step": 79, "train_speed(iter/s)": 0.005502 }, { "epoch": 0.06454703613121202, "grad_norm": 4.165892601013184, "learning_rate": 0.0001998846073113439, "logits/chosen": -0.6084208488464355, "logits/rejected": -0.6092680096626282, "logps/chosen": -12.750446319580078, "logps/rejected": -19.53608512878418, "loss": 1.0978946685791016, "memory(GiB)": 46.83, "nll_loss": 0.5877176523208618, "rewards/accuracies": 0.75, "rewards/chosen": 0.1369042694568634, "rewards/margins": 0.6248282194137573, "rewards/rejected": -0.48792392015457153, "step": 80, "train_speed(iter/s)": 0.005503 }, { "epoch": 0.06535387408285218, "grad_norm": 2.287846565246582, "learning_rate": 0.00019987143257558365, "logits/chosen": -0.59499192237854, "logits/rejected": -0.5972949862480164, "logps/chosen": -4.519835948944092, "logps/rejected": -19.02901840209961, "loss": 0.58124840259552, "memory(GiB)": 46.83, "nll_loss": 0.15051494538784027, "rewards/accuracies": 0.84375, "rewards/chosen": 0.19695766270160675, "rewards/margins": 0.9730147123336792, "rewards/rejected": -0.7760570049285889, "step": 81, "train_speed(iter/s)": 0.005506 }, { "epoch": 0.06616071203449232, "grad_norm": 7.103982448577881, "learning_rate": 0.00019985754631862855, "logits/chosen": -0.5857492089271545, "logits/rejected": -0.5895102024078369, "logps/chosen": -8.903070449829102, "logps/rejected": -26.571044921875, "loss": 0.7599916458129883, "memory(GiB)": 46.83, "nll_loss": 0.3342111110687256, "rewards/accuracies": 0.84375, "rewards/chosen": 0.14196240901947021, "rewards/margins": 0.8281382322311401, "rewards/rejected": -0.6861758232116699, "step": 82, "train_speed(iter/s)": 0.005504 }, { "epoch": 0.06696754998613247, "grad_norm": 3.764488697052002, "learning_rate": 0.00019984294863940955, "logits/chosen": -0.6067830324172974, "logits/rejected": -0.6086009740829468, "logps/chosen": -9.9881591796875, "logps/rejected": -19.09541893005371, "loss": 0.9752427339553833, "memory(GiB)": 46.83, "nll_loss": 0.5045859217643738, "rewards/accuracies": 0.71875, "rewards/chosen": 0.14939813315868378, "rewards/margins": 0.8939868211746216, "rewards/rejected": -0.7445887327194214, "step": 83, "train_speed(iter/s)": 0.005503 }, { "epoch": 0.06777438793777263, "grad_norm": 3.3293344974517822, "learning_rate": 0.00019982763964192585, "logits/chosen": -0.6330868601799011, "logits/rejected": -0.6393448710441589, "logps/chosen": -4.902453899383545, "logps/rejected": -24.94113540649414, "loss": 0.7244248390197754, "memory(GiB)": 46.83, "nll_loss": 0.3735058009624481, "rewards/accuracies": 0.9375, "rewards/chosen": 0.17604736983776093, "rewards/margins": 1.2982165813446045, "rewards/rejected": -1.1221693754196167, "step": 84, "train_speed(iter/s)": 0.005503 }, { "epoch": 0.06858122588941278, "grad_norm": 5.892284393310547, "learning_rate": 0.00019981161943524443, "logits/chosen": -0.6240598559379578, "logits/rejected": -0.620481550693512, "logps/chosen": -14.60393238067627, "logps/rejected": -13.365829467773438, "loss": 1.1541650295257568, "memory(GiB)": 46.83, "nll_loss": 0.48222166299819946, "rewards/accuracies": 0.59375, "rewards/chosen": -0.09302416443824768, "rewards/margins": 0.41544342041015625, "rewards/rejected": -0.5084675550460815, "step": 85, "train_speed(iter/s)": 0.0055 }, { "epoch": 0.06938806384105292, "grad_norm": 4.056751251220703, "learning_rate": 0.00019979488813349933, "logits/chosen": -0.6613398194313049, "logits/rejected": -0.6640070080757141, "logps/chosen": -9.50975227355957, "logps/rejected": -21.119707107543945, "loss": 0.8987840414047241, "memory(GiB)": 46.83, "nll_loss": 0.52927565574646, "rewards/accuracies": 0.84375, "rewards/chosen": 0.1999521553516388, "rewards/margins": 1.1560636758804321, "rewards/rejected": -0.956111490726471, "step": 86, "train_speed(iter/s)": 0.005499 }, { "epoch": 0.07019490179269307, "grad_norm": 4.351650238037109, "learning_rate": 0.0001997774458558904, "logits/chosen": -0.6547818779945374, "logits/rejected": -0.6571143269538879, "logps/chosen": -8.668737411499023, "logps/rejected": -20.79534149169922, "loss": 0.9775034785270691, "memory(GiB)": 46.83, "nll_loss": 0.4770965874195099, "rewards/accuracies": 0.75, "rewards/chosen": 0.02099284902215004, "rewards/margins": 0.8633284568786621, "rewards/rejected": -0.84233558177948, "step": 87, "train_speed(iter/s)": 0.005498 }, { "epoch": 0.07100173974433323, "grad_norm": 2.8774800300598145, "learning_rate": 0.00019975929272668296, "logits/chosen": -0.6759516000747681, "logits/rejected": -0.6824960708618164, "logps/chosen": -4.7266716957092285, "logps/rejected": -26.10918426513672, "loss": 0.5549903512001038, "memory(GiB)": 46.83, "nll_loss": 0.271104097366333, "rewards/accuracies": 0.9375, "rewards/chosen": 0.25939324498176575, "rewards/margins": 1.6003111600875854, "rewards/rejected": -1.340917944908142, "step": 88, "train_speed(iter/s)": 0.005501 }, { "epoch": 0.07180857769597337, "grad_norm": 2.8334577083587646, "learning_rate": 0.00019974042887520668, "logits/chosen": -0.6535760164260864, "logits/rejected": -0.6572569608688354, "logps/chosen": -13.957544326782227, "logps/rejected": -18.16533851623535, "loss": 0.9486314654350281, "memory(GiB)": 46.83, "nll_loss": 0.5478147268295288, "rewards/accuracies": 0.90625, "rewards/chosen": 0.2579638957977295, "rewards/margins": 0.9477146863937378, "rewards/rejected": -0.6897507905960083, "step": 89, "train_speed(iter/s)": 0.005501 }, { "epoch": 0.07261541564761352, "grad_norm": 5.422155380249023, "learning_rate": 0.00019972085443585463, "logits/chosen": -0.6767461895942688, "logits/rejected": -0.6799700260162354, "logps/chosen": -7.507997512817383, "logps/rejected": -20.19240951538086, "loss": 0.8118898868560791, "memory(GiB)": 46.83, "nll_loss": 0.4057508111000061, "rewards/accuracies": 0.84375, "rewards/chosen": 0.11586537212133408, "rewards/margins": 1.0757473707199097, "rewards/rejected": -0.9598820805549622, "step": 90, "train_speed(iter/s)": 0.005503 }, { "epoch": 0.07342225359925368, "grad_norm": 5.541498184204102, "learning_rate": 0.0001997005695480824, "logits/chosen": -0.6398351788520813, "logits/rejected": -0.642162024974823, "logps/chosen": -10.117485046386719, "logps/rejected": -21.747928619384766, "loss": 0.8823437094688416, "memory(GiB)": 46.83, "nll_loss": 0.47223997116088867, "rewards/accuracies": 0.75, "rewards/chosen": -0.04489222913980484, "rewards/margins": 1.1613836288452148, "rewards/rejected": -1.2062758207321167, "step": 91, "train_speed(iter/s)": 0.005504 }, { "epoch": 0.07422909155089383, "grad_norm": 2.0107967853546143, "learning_rate": 0.000199679574356407, "logits/chosen": -0.6938130855560303, "logits/rejected": -0.7009856104850769, "logps/chosen": -6.915675163269043, "logps/rejected": -28.84608268737793, "loss": 0.5776476860046387, "memory(GiB)": 46.83, "nll_loss": 0.3677330017089844, "rewards/accuracies": 1.0, "rewards/chosen": 0.3187498152256012, "rewards/margins": 1.8727707862854004, "rewards/rejected": -1.554020881652832, "step": 92, "train_speed(iter/s)": 0.005502 }, { "epoch": 0.07503592950253397, "grad_norm": 3.5870676040649414, "learning_rate": 0.0001996578690104061, "logits/chosen": -0.673453688621521, "logits/rejected": -0.676167905330658, "logps/chosen": -10.7222318649292, "logps/rejected": -28.77056884765625, "loss": 0.950826108455658, "memory(GiB)": 46.83, "nll_loss": 0.5682229399681091, "rewards/accuracies": 0.8125, "rewards/chosen": 0.09744307398796082, "rewards/margins": 1.4789444208145142, "rewards/rejected": -1.381501317024231, "step": 93, "train_speed(iter/s)": 0.005502 }, { "epoch": 0.07584276745417412, "grad_norm": 4.2534661293029785, "learning_rate": 0.00019963545366471653, "logits/chosen": -0.6709739565849304, "logits/rejected": -0.6747978925704956, "logps/chosen": -8.219854354858398, "logps/rejected": -29.13772201538086, "loss": 0.6954976320266724, "memory(GiB)": 46.83, "nll_loss": 0.35414204001426697, "rewards/accuracies": 0.8125, "rewards/chosen": 0.10512235760688782, "rewards/margins": 1.6458101272583008, "rewards/rejected": -1.5406877994537354, "step": 94, "train_speed(iter/s)": 0.005503 }, { "epoch": 0.07664960540581428, "grad_norm": 7.663514614105225, "learning_rate": 0.0001996123284790336, "logits/chosen": -0.6834441423416138, "logits/rejected": -0.6848198771476746, "logps/chosen": -17.666513442993164, "logps/rejected": -19.222387313842773, "loss": 1.197723388671875, "memory(GiB)": 46.83, "nll_loss": 0.6848238110542297, "rewards/accuracies": 0.84375, "rewards/chosen": -0.06468406319618225, "rewards/margins": 0.8658308982849121, "rewards/rejected": -0.9305148720741272, "step": 95, "train_speed(iter/s)": 0.005502 }, { "epoch": 0.07745644335745443, "grad_norm": 16.187767028808594, "learning_rate": 0.0001995884936181097, "logits/chosen": -0.7171504497528076, "logits/rejected": -0.7210450172424316, "logps/chosen": -4.8772172927856445, "logps/rejected": -27.164329528808594, "loss": 0.7958053946495056, "memory(GiB)": 46.83, "nll_loss": 0.437197208404541, "rewards/accuracies": 0.875, "rewards/chosen": 0.04156189411878586, "rewards/margins": 1.4321556091308594, "rewards/rejected": -1.3905936479568481, "step": 96, "train_speed(iter/s)": 0.005502 }, { "epoch": 0.07826328130909457, "grad_norm": 4.373692989349365, "learning_rate": 0.00019956394925175328, "logits/chosen": -0.720712423324585, "logits/rejected": -0.7263769507408142, "logps/chosen": -8.969646453857422, "logps/rejected": -27.35487174987793, "loss": 0.8684384822845459, "memory(GiB)": 46.83, "nll_loss": 0.4593147337436676, "rewards/accuracies": 0.78125, "rewards/chosen": 0.039580605924129486, "rewards/margins": 1.404889702796936, "rewards/rejected": -1.3653091192245483, "step": 97, "train_speed(iter/s)": 0.005502 }, { "epoch": 0.07907011926073473, "grad_norm": 3.1712353229522705, "learning_rate": 0.00019953869555482752, "logits/chosen": -0.6926038265228271, "logits/rejected": -0.6906510591506958, "logps/chosen": -10.361411094665527, "logps/rejected": -19.763336181640625, "loss": 1.0741034746170044, "memory(GiB)": 46.83, "nll_loss": 0.5404018759727478, "rewards/accuracies": 0.75, "rewards/chosen": 0.0025314167141914368, "rewards/margins": 0.9160726070404053, "rewards/rejected": -0.9135411381721497, "step": 98, "train_speed(iter/s)": 0.005502 }, { "epoch": 0.07987695721237488, "grad_norm": 5.8308796882629395, "learning_rate": 0.00019951273270724906, "logits/chosen": -0.6417246460914612, "logits/rejected": -0.6460192203521729, "logps/chosen": -10.923144340515137, "logps/rejected": -23.332698822021484, "loss": 1.129643201828003, "memory(GiB)": 46.83, "nll_loss": 0.5929185748100281, "rewards/accuracies": 0.78125, "rewards/chosen": -0.004452264867722988, "rewards/margins": 0.6838414669036865, "rewards/rejected": -0.6882937550544739, "step": 99, "train_speed(iter/s)": 0.005503 }, { "epoch": 0.08068379516401503, "grad_norm": 4.135215759277344, "learning_rate": 0.00019948606089398698, "logits/chosen": -0.6685535907745361, "logits/rejected": -0.6693455576896667, "logps/chosen": -11.88547134399414, "logps/rejected": -19.97165298461914, "loss": 0.9190454483032227, "memory(GiB)": 46.83, "nll_loss": 0.39345046877861023, "rewards/accuracies": 0.59375, "rewards/chosen": 0.05392542481422424, "rewards/margins": 0.8620406985282898, "rewards/rejected": -0.8081153035163879, "step": 100, "train_speed(iter/s)": 0.005503 }, { "epoch": 0.08149063311565517, "grad_norm": 3.957230806350708, "learning_rate": 0.0001994586803050611, "logits/chosen": -0.6953858137130737, "logits/rejected": -0.6939084529876709, "logps/chosen": -11.101150512695312, "logps/rejected": -19.7403621673584, "loss": 1.0100737810134888, "memory(GiB)": 46.83, "nll_loss": 0.45983725786209106, "rewards/accuracies": 0.65625, "rewards/chosen": 0.061330053955316544, "rewards/margins": 0.847295880317688, "rewards/rejected": -0.7859657406806946, "step": 101, "train_speed(iter/s)": 0.005498 }, { "epoch": 0.08229747106729533, "grad_norm": 2.8322761058807373, "learning_rate": 0.00019943059113554097, "logits/chosen": -0.6899937987327576, "logits/rejected": -0.6942430734634399, "logps/chosen": -8.74088191986084, "logps/rejected": -20.522974014282227, "loss": 0.8782400488853455, "memory(GiB)": 46.83, "nll_loss": 0.3525587320327759, "rewards/accuracies": 0.8125, "rewards/chosen": 0.05973733961582184, "rewards/margins": 0.882931113243103, "rewards/rejected": -0.8231937289237976, "step": 102, "train_speed(iter/s)": 0.005498 }, { "epoch": 0.08310430901893548, "grad_norm": 2.8728346824645996, "learning_rate": 0.00019940179358554424, "logits/chosen": -0.6615633964538574, "logits/rejected": -0.6650048494338989, "logps/chosen": -8.035341262817383, "logps/rejected": -13.233177185058594, "loss": 0.95281982421875, "memory(GiB)": 46.83, "nll_loss": 0.39267757534980774, "rewards/accuracies": 0.71875, "rewards/chosen": 0.12954209744930267, "rewards/margins": 0.4833866357803345, "rewards/rejected": -0.3538445234298706, "step": 103, "train_speed(iter/s)": 0.005496 }, { "epoch": 0.08391114697057563, "grad_norm": 2.8015527725219727, "learning_rate": 0.00019937228786023542, "logits/chosen": -0.6321871280670166, "logits/rejected": -0.6367396116256714, "logps/chosen": -9.781261444091797, "logps/rejected": -18.408084869384766, "loss": 0.9027690887451172, "memory(GiB)": 46.83, "nll_loss": 0.4244646430015564, "rewards/accuracies": 0.84375, "rewards/chosen": 0.18980520963668823, "rewards/margins": 0.7434633374214172, "rewards/rejected": -0.5536580681800842, "step": 104, "train_speed(iter/s)": 0.005498 }, { "epoch": 0.08471798492221577, "grad_norm": 3.581929922103882, "learning_rate": 0.00019934207416982415, "logits/chosen": -0.6718648076057434, "logits/rejected": -0.6737468242645264, "logps/chosen": -10.535398483276367, "logps/rejected": -15.517889022827148, "loss": 0.9467408657073975, "memory(GiB)": 46.83, "nll_loss": 0.4431319832801819, "rewards/accuracies": 0.84375, "rewards/chosen": 0.24101108312606812, "rewards/margins": 0.5848699808120728, "rewards/rejected": -0.34385889768600464, "step": 105, "train_speed(iter/s)": 0.005496 }, { "epoch": 0.08552482287385593, "grad_norm": 2.7180511951446533, "learning_rate": 0.00019931115272956405, "logits/chosen": -0.6360980272293091, "logits/rejected": -0.6395881175994873, "logps/chosen": -5.562260627746582, "logps/rejected": -16.978702545166016, "loss": 0.9048807621002197, "memory(GiB)": 46.83, "nll_loss": 0.3790769577026367, "rewards/accuracies": 0.71875, "rewards/chosen": 0.1927444040775299, "rewards/margins": 0.6174324750900269, "rewards/rejected": -0.42468804121017456, "step": 106, "train_speed(iter/s)": 0.005495 }, { "epoch": 0.08633166082549608, "grad_norm": 2.7166309356689453, "learning_rate": 0.00019927952375975094, "logits/chosen": -0.6151095628738403, "logits/rejected": -0.6214062571525574, "logps/chosen": -8.704106330871582, "logps/rejected": -15.980009078979492, "loss": 0.9614640474319458, "memory(GiB)": 46.83, "nll_loss": 0.41800737380981445, "rewards/accuracies": 0.71875, "rewards/chosen": 0.22499363124370575, "rewards/margins": 0.5540027618408203, "rewards/rejected": -0.32900911569595337, "step": 107, "train_speed(iter/s)": 0.005495 }, { "epoch": 0.08713849877713623, "grad_norm": 3.3143904209136963, "learning_rate": 0.00019924718748572136, "logits/chosen": -0.6602830290794373, "logits/rejected": -0.6590928435325623, "logps/chosen": -14.48482608795166, "logps/rejected": -13.489812850952148, "loss": 1.1007349491119385, "memory(GiB)": 46.83, "nll_loss": 0.38938888907432556, "rewards/accuracies": 0.5625, "rewards/chosen": -0.005462644621729851, "rewards/margins": 0.18356555700302124, "rewards/rejected": -0.18902820348739624, "step": 108, "train_speed(iter/s)": 0.005493 }, { "epoch": 0.08794533672877639, "grad_norm": 3.3967649936676025, "learning_rate": 0.00019921414413785095, "logits/chosen": -0.6139819025993347, "logits/rejected": -0.6160064935684204, "logps/chosen": -10.462146759033203, "logps/rejected": -13.9368896484375, "loss": 1.1163440942764282, "memory(GiB)": 46.83, "nll_loss": 0.5643093585968018, "rewards/accuracies": 0.625, "rewards/chosen": 0.13518843054771423, "rewards/margins": 0.5490553379058838, "rewards/rejected": -0.41386690735816956, "step": 109, "train_speed(iter/s)": 0.005493 }, { "epoch": 0.08875217468041653, "grad_norm": 2.125051498413086, "learning_rate": 0.00019918039395155278, "logits/chosen": -0.5581845641136169, "logits/rejected": -0.5609419345855713, "logps/chosen": -8.664159774780273, "logps/rejected": -16.96472930908203, "loss": 0.8410020470619202, "memory(GiB)": 46.83, "nll_loss": 0.3336779773235321, "rewards/accuracies": 0.75, "rewards/chosen": 0.24867044389247894, "rewards/margins": 0.6479009985923767, "rewards/rejected": -0.3992305099964142, "step": 110, "train_speed(iter/s)": 0.005494 }, { "epoch": 0.08955901263205668, "grad_norm": 2.7272698879241943, "learning_rate": 0.00019914593716727574, "logits/chosen": -0.640306830406189, "logits/rejected": -0.6392278075218201, "logps/chosen": -10.320524215698242, "logps/rejected": -15.357645034790039, "loss": 0.9050614237785339, "memory(GiB)": 46.83, "nll_loss": 0.3744095265865326, "rewards/accuracies": 0.78125, "rewards/chosen": 0.228946715593338, "rewards/margins": 0.46916335821151733, "rewards/rejected": -0.24021662771701813, "step": 111, "train_speed(iter/s)": 0.005492 }, { "epoch": 0.09036585058369682, "grad_norm": 2.552009344100952, "learning_rate": 0.0001991107740305027, "logits/chosen": -0.6064003109931946, "logits/rejected": -0.607029914855957, "logps/chosen": -10.730403900146484, "logps/rejected": -20.569438934326172, "loss": 0.9093858003616333, "memory(GiB)": 46.83, "nll_loss": 0.4844813346862793, "rewards/accuracies": 0.84375, "rewards/chosen": 0.320293128490448, "rewards/margins": 0.8029977083206177, "rewards/rejected": -0.48270460963249207, "step": 112, "train_speed(iter/s)": 0.005492 }, { "epoch": 0.09117268853533698, "grad_norm": 2.875828742980957, "learning_rate": 0.00019907490479174902, "logits/chosen": -0.6465886831283569, "logits/rejected": -0.6483381986618042, "logps/chosen": -6.758854389190674, "logps/rejected": -20.76754379272461, "loss": 0.7010505199432373, "memory(GiB)": 46.83, "nll_loss": 0.29428812861442566, "rewards/accuracies": 0.875, "rewards/chosen": 0.3071742653846741, "rewards/margins": 1.1479661464691162, "rewards/rejected": -0.8407919406890869, "step": 113, "train_speed(iter/s)": 0.005491 }, { "epoch": 0.09197952648697713, "grad_norm": 2.3188178539276123, "learning_rate": 0.00019903832970656038, "logits/chosen": -0.6288142800331116, "logits/rejected": -0.6315409541130066, "logps/chosen": -8.855584144592285, "logps/rejected": -20.421592712402344, "loss": 0.841801106929779, "memory(GiB)": 46.83, "nll_loss": 0.38135236501693726, "rewards/accuracies": 0.8125, "rewards/chosen": 0.19283419847488403, "rewards/margins": 0.8724038004875183, "rewards/rejected": -0.6795696020126343, "step": 114, "train_speed(iter/s)": 0.005492 }, { "epoch": 0.09278636443861728, "grad_norm": 3.3676164150238037, "learning_rate": 0.00019900104903551133, "logits/chosen": -0.6541582345962524, "logits/rejected": -0.6580868363380432, "logps/chosen": -8.595276832580566, "logps/rejected": -24.14297866821289, "loss": 0.7960852980613708, "memory(GiB)": 46.83, "nll_loss": 0.4363185465335846, "rewards/accuracies": 0.875, "rewards/chosen": 0.10038560628890991, "rewards/margins": 1.4183127880096436, "rewards/rejected": -1.3179271221160889, "step": 115, "train_speed(iter/s)": 0.005493 }, { "epoch": 0.09359320239025744, "grad_norm": 3.721660614013672, "learning_rate": 0.00019896306304420324, "logits/chosen": -0.6533216834068298, "logits/rejected": -0.6518760919570923, "logps/chosen": -9.710081100463867, "logps/rejected": -20.333324432373047, "loss": 0.842086911201477, "memory(GiB)": 46.83, "nll_loss": 0.38858363032341003, "rewards/accuracies": 0.75, "rewards/chosen": 0.1398862600326538, "rewards/margins": 1.0419015884399414, "rewards/rejected": -0.9020152688026428, "step": 116, "train_speed(iter/s)": 0.005494 }, { "epoch": 0.09440004034189758, "grad_norm": 4.8206281661987305, "learning_rate": 0.0001989243720032624, "logits/chosen": -0.7102867364883423, "logits/rejected": -0.712573230266571, "logps/chosen": -14.843620300292969, "logps/rejected": -23.658788681030273, "loss": 1.1279860734939575, "memory(GiB)": 46.83, "nll_loss": 0.5651426315307617, "rewards/accuracies": 0.78125, "rewards/chosen": -0.09467095881700516, "rewards/margins": 0.9923723340034485, "rewards/rejected": -1.087043285369873, "step": 117, "train_speed(iter/s)": 0.005494 }, { "epoch": 0.09520687829353773, "grad_norm": 3.194643020629883, "learning_rate": 0.00019888497618833815, "logits/chosen": -0.6824992895126343, "logits/rejected": -0.6856632232666016, "logps/chosen": -7.8865065574646, "logps/rejected": -22.186447143554688, "loss": 0.8166104555130005, "memory(GiB)": 46.83, "nll_loss": 0.3872619867324829, "rewards/accuracies": 0.8125, "rewards/chosen": 0.1935729682445526, "rewards/margins": 1.2844107151031494, "rewards/rejected": -1.090837836265564, "step": 118, "train_speed(iter/s)": 0.005494 }, { "epoch": 0.09601371624517788, "grad_norm": 5.332725524902344, "learning_rate": 0.00019884487588010092, "logits/chosen": -0.6963211894035339, "logits/rejected": -0.695375382900238, "logps/chosen": -12.522785186767578, "logps/rejected": -21.899364471435547, "loss": 1.200064778327942, "memory(GiB)": 46.83, "nll_loss": 0.5619924068450928, "rewards/accuracies": 0.625, "rewards/chosen": -0.2353927493095398, "rewards/margins": 0.7032212018966675, "rewards/rejected": -0.9386140704154968, "step": 119, "train_speed(iter/s)": 0.005493 }, { "epoch": 0.09682055419681804, "grad_norm": 3.189750909805298, "learning_rate": 0.0001988040713642402, "logits/chosen": -0.7008529305458069, "logits/rejected": -0.7020596265792847, "logps/chosen": -7.352071285247803, "logps/rejected": -26.472599029541016, "loss": 0.6796355843544006, "memory(GiB)": 46.83, "nll_loss": 0.30471816658973694, "rewards/accuracies": 0.84375, "rewards/chosen": 0.0883897989988327, "rewards/margins": 1.43672513961792, "rewards/rejected": -1.3483351469039917, "step": 120, "train_speed(iter/s)": 0.005494 }, { "epoch": 0.09762739214845818, "grad_norm": 3.5756847858428955, "learning_rate": 0.00019876256293146257, "logits/chosen": -0.6855241060256958, "logits/rejected": -0.6870216131210327, "logps/chosen": -9.13197135925293, "logps/rejected": -25.256893157958984, "loss": 0.9965449571609497, "memory(GiB)": 46.83, "nll_loss": 0.5001046061515808, "rewards/accuracies": 0.78125, "rewards/chosen": 0.036015622317790985, "rewards/margins": 1.1710847616195679, "rewards/rejected": -1.1350692510604858, "step": 121, "train_speed(iter/s)": 0.005494 }, { "epoch": 0.09843423010009833, "grad_norm": 2.60425066947937, "learning_rate": 0.0001987203508774895, "logits/chosen": -0.7040928602218628, "logits/rejected": -0.7042312026023865, "logps/chosen": -8.471722602844238, "logps/rejected": -26.018938064575195, "loss": 0.8459987640380859, "memory(GiB)": 46.83, "nll_loss": 0.4736276865005493, "rewards/accuracies": 0.875, "rewards/chosen": 0.24268555641174316, "rewards/margins": 1.318163514137268, "rewards/rejected": -1.075477957725525, "step": 122, "train_speed(iter/s)": 0.005493 }, { "epoch": 0.09924106805173849, "grad_norm": 4.30864143371582, "learning_rate": 0.0001986774355030553, "logits/chosen": -0.6747640371322632, "logits/rejected": -0.677899956703186, "logps/chosen": -14.706789016723633, "logps/rejected": -16.56774139404297, "loss": 1.2364513874053955, "memory(GiB)": 46.83, "nll_loss": 0.6511675119400024, "rewards/accuracies": 0.71875, "rewards/chosen": 0.08759675920009613, "rewards/margins": 0.6008309721946716, "rewards/rejected": -0.5132341384887695, "step": 123, "train_speed(iter/s)": 0.005492 }, { "epoch": 0.10004790600337864, "grad_norm": 6.867242813110352, "learning_rate": 0.00019863381711390508, "logits/chosen": -0.6869674324989319, "logits/rejected": -0.6902846693992615, "logps/chosen": -7.829675197601318, "logps/rejected": -20.095809936523438, "loss": 1.043180227279663, "memory(GiB)": 46.83, "nll_loss": 0.530769944190979, "rewards/accuracies": 0.71875, "rewards/chosen": 0.11925126612186432, "rewards/margins": 0.697571337223053, "rewards/rejected": -0.5783200860023499, "step": 124, "train_speed(iter/s)": 0.005491 }, { "epoch": 0.10085474395501878, "grad_norm": 3.041438579559326, "learning_rate": 0.0001985894960207925, "logits/chosen": -0.6505750417709351, "logits/rejected": -0.6511614918708801, "logps/chosen": -9.314833641052246, "logps/rejected": -27.15659523010254, "loss": 0.7252060174942017, "memory(GiB)": 46.83, "nll_loss": 0.39295029640197754, "rewards/accuracies": 0.96875, "rewards/chosen": 0.24510648846626282, "rewards/margins": 1.2805438041687012, "rewards/rejected": -1.0354374647140503, "step": 125, "train_speed(iter/s)": 0.005491 }, { "epoch": 0.10166158190665893, "grad_norm": 2.509321689605713, "learning_rate": 0.00019854447253947743, "logits/chosen": -0.6497823596000671, "logits/rejected": -0.6492441892623901, "logps/chosen": -8.02572250366211, "logps/rejected": -20.3783016204834, "loss": 0.7982934713363647, "memory(GiB)": 46.83, "nll_loss": 0.33212146162986755, "rewards/accuracies": 0.78125, "rewards/chosen": 0.17764505743980408, "rewards/margins": 0.8625535368919373, "rewards/rejected": -0.6849085092544556, "step": 126, "train_speed(iter/s)": 0.005489 }, { "epoch": 0.10246841985829909, "grad_norm": 3.6529700756073, "learning_rate": 0.0001984987469907239, "logits/chosen": -0.6466098427772522, "logits/rejected": -0.6480077505111694, "logps/chosen": -9.548334121704102, "logps/rejected": -16.65062141418457, "loss": 0.914322555065155, "memory(GiB)": 46.83, "nll_loss": 0.4001502990722656, "rewards/accuracies": 0.75, "rewards/chosen": 0.1684979647397995, "rewards/margins": 0.6629449129104614, "rewards/rejected": -0.49444690346717834, "step": 127, "train_speed(iter/s)": 0.005491 }, { "epoch": 0.10327525780993924, "grad_norm": 3.3696913719177246, "learning_rate": 0.00019845231970029773, "logits/chosen": -0.679688572883606, "logits/rejected": -0.6820145845413208, "logps/chosen": -10.874924659729004, "logps/rejected": -24.826372146606445, "loss": 0.9800686240196228, "memory(GiB)": 46.83, "nll_loss": 0.4543137848377228, "rewards/accuracies": 0.8125, "rewards/chosen": -0.048351842910051346, "rewards/margins": 0.8677961230278015, "rewards/rejected": -0.9161479473114014, "step": 128, "train_speed(iter/s)": 0.00549 }, { "epoch": 0.10408209576157938, "grad_norm": 2.5419607162475586, "learning_rate": 0.00019840519099896414, "logits/chosen": -0.6618849039077759, "logits/rejected": -0.6671789288520813, "logps/chosen": -8.426337242126465, "logps/rejected": -25.797517776489258, "loss": 0.6974806189537048, "memory(GiB)": 46.83, "nll_loss": 0.2836017608642578, "rewards/accuracies": 0.84375, "rewards/chosen": 0.18303632736206055, "rewards/margins": 1.1003562211990356, "rewards/rejected": -0.9173198938369751, "step": 129, "train_speed(iter/s)": 0.005491 }, { "epoch": 0.10488893371321953, "grad_norm": 3.4203388690948486, "learning_rate": 0.00019835736122248557, "logits/chosen": -0.6606203317642212, "logits/rejected": -0.6571654677391052, "logps/chosen": -14.509614944458008, "logps/rejected": -15.079629898071289, "loss": 1.101165771484375, "memory(GiB)": 46.83, "nll_loss": 0.5219094157218933, "rewards/accuracies": 0.75, "rewards/chosen": 0.07395613193511963, "rewards/margins": 0.5427431464195251, "rewards/rejected": -0.46878698468208313, "step": 130, "train_speed(iter/s)": 0.005492 }, { "epoch": 0.10569577166485969, "grad_norm": 2.7750000953674316, "learning_rate": 0.00019830883071161908, "logits/chosen": -0.7152451276779175, "logits/rejected": -0.7131951451301575, "logps/chosen": -9.166630744934082, "logps/rejected": -19.46819305419922, "loss": 0.7933439016342163, "memory(GiB)": 46.83, "nll_loss": 0.3753884732723236, "rewards/accuracies": 0.78125, "rewards/chosen": 0.26774072647094727, "rewards/margins": 1.0882644653320312, "rewards/rejected": -0.8205236196517944, "step": 131, "train_speed(iter/s)": 0.005492 }, { "epoch": 0.10650260961649984, "grad_norm": 3.1810927391052246, "learning_rate": 0.00019825959981211407, "logits/chosen": -0.714146614074707, "logits/rejected": -0.7095440626144409, "logps/chosen": -11.571531295776367, "logps/rejected": -14.685908317565918, "loss": 0.8970522880554199, "memory(GiB)": 46.83, "nll_loss": 0.38512641191482544, "rewards/accuracies": 0.75, "rewards/chosen": 0.09674864262342453, "rewards/margins": 0.5926439762115479, "rewards/rejected": -0.4958953261375427, "step": 132, "train_speed(iter/s)": 0.005491 }, { "epoch": 0.10730944756813998, "grad_norm": 2.839996099472046, "learning_rate": 0.00019820966887470974, "logits/chosen": -0.7237828373908997, "logits/rejected": -0.7276051640510559, "logps/chosen": -7.241865158081055, "logps/rejected": -21.9840145111084, "loss": 0.7037227153778076, "memory(GiB)": 46.83, "nll_loss": 0.29994940757751465, "rewards/accuracies": 0.84375, "rewards/chosen": 0.18205267190933228, "rewards/margins": 1.1148442029953003, "rewards/rejected": -0.9327914714813232, "step": 133, "train_speed(iter/s)": 0.005492 }, { "epoch": 0.10811628551978014, "grad_norm": 2.8896915912628174, "learning_rate": 0.0001981590382551327, "logits/chosen": -0.796456515789032, "logits/rejected": -0.7955406308174133, "logps/chosen": -11.131935119628906, "logps/rejected": -19.525293350219727, "loss": 0.8993673920631409, "memory(GiB)": 46.83, "nll_loss": 0.4546453356742859, "rewards/accuracies": 0.8125, "rewards/chosen": 0.21719151735305786, "rewards/margins": 1.081808090209961, "rewards/rejected": -0.8646165728569031, "step": 134, "train_speed(iter/s)": 0.00549 }, { "epoch": 0.10892312347142029, "grad_norm": 3.5537540912628174, "learning_rate": 0.00019810770831409425, "logits/chosen": -0.7755017876625061, "logits/rejected": -0.7809926271438599, "logps/chosen": -7.181600093841553, "logps/rejected": -19.379724502563477, "loss": 0.7135071754455566, "memory(GiB)": 46.83, "nll_loss": 0.32976531982421875, "rewards/accuracies": 0.78125, "rewards/chosen": 0.26019349694252014, "rewards/margins": 1.110938310623169, "rewards/rejected": -0.850744903087616, "step": 135, "train_speed(iter/s)": 0.005491 }, { "epoch": 0.10972996142306043, "grad_norm": 3.5955300331115723, "learning_rate": 0.00019805567941728796, "logits/chosen": -0.799392819404602, "logits/rejected": -0.8029282689094543, "logps/chosen": -9.87437629699707, "logps/rejected": -23.02663230895996, "loss": 0.9438092708587646, "memory(GiB)": 46.83, "nll_loss": 0.5196709036827087, "rewards/accuracies": 0.78125, "rewards/chosen": 0.07922995835542679, "rewards/margins": 1.070724606513977, "rewards/rejected": -0.9914946556091309, "step": 136, "train_speed(iter/s)": 0.005492 }, { "epoch": 0.11053679937470058, "grad_norm": 3.7304859161376953, "learning_rate": 0.00019800295193538704, "logits/chosen": -0.8160181641578674, "logits/rejected": -0.8219972848892212, "logps/chosen": -7.596125602722168, "logps/rejected": -20.225994110107422, "loss": 0.8485299348831177, "memory(GiB)": 46.83, "nll_loss": 0.43994730710983276, "rewards/accuracies": 0.90625, "rewards/chosen": 0.26360729336738586, "rewards/margins": 0.9658780694007874, "rewards/rejected": -0.7022708058357239, "step": 137, "train_speed(iter/s)": 0.005491 }, { "epoch": 0.11134363732634074, "grad_norm": 4.919328689575195, "learning_rate": 0.00019794952624404167, "logits/chosen": -0.7996560335159302, "logits/rejected": -0.801249623298645, "logps/chosen": -9.867749214172363, "logps/rejected": -22.316190719604492, "loss": 0.8283427357673645, "memory(GiB)": 46.83, "nll_loss": 0.4471050798892975, "rewards/accuracies": 0.84375, "rewards/chosen": 0.13889475166797638, "rewards/margins": 1.224007248878479, "rewards/rejected": -1.085112452507019, "step": 138, "train_speed(iter/s)": 0.005491 }, { "epoch": 0.11215047527798089, "grad_norm": 2.821730136871338, "learning_rate": 0.0001978954027238763, "logits/chosen": -0.818955659866333, "logits/rejected": -0.8183013796806335, "logps/chosen": -6.504258632659912, "logps/rejected": -14.602479934692383, "loss": 0.7571634650230408, "memory(GiB)": 46.83, "nll_loss": 0.29162290692329407, "rewards/accuracies": 0.71875, "rewards/chosen": 0.1784059852361679, "rewards/margins": 0.8354285955429077, "rewards/rejected": -0.6570225954055786, "step": 139, "train_speed(iter/s)": 0.005491 }, { "epoch": 0.11295731322962103, "grad_norm": 2.481306552886963, "learning_rate": 0.000197840581760487, "logits/chosen": -0.8251004219055176, "logits/rejected": -0.8243045210838318, "logps/chosen": -13.736132621765137, "logps/rejected": -17.749977111816406, "loss": 0.8052379488945007, "memory(GiB)": 46.83, "nll_loss": 0.4064967930316925, "rewards/accuracies": 0.8125, "rewards/chosen": 0.3237007260322571, "rewards/margins": 1.295701026916504, "rewards/rejected": -0.9720003008842468, "step": 140, "train_speed(iter/s)": 0.005492 }, { "epoch": 0.1137641511812612, "grad_norm": 2.695176601409912, "learning_rate": 0.00019778506374443873, "logits/chosen": -0.7545077800750732, "logits/rejected": -0.7596877813339233, "logps/chosen": -5.598147869110107, "logps/rejected": -26.760784149169922, "loss": 0.6858201026916504, "memory(GiB)": 46.83, "nll_loss": 0.3311798572540283, "rewards/accuracies": 0.84375, "rewards/chosen": 0.19224056601524353, "rewards/margins": 1.6802706718444824, "rewards/rejected": -1.488029956817627, "step": 141, "train_speed(iter/s)": 0.005493 }, { "epoch": 0.11457098913290134, "grad_norm": 2.5371341705322266, "learning_rate": 0.0001977288490712624, "logits/chosen": -0.8187113404273987, "logits/rejected": -0.8256463408470154, "logps/chosen": -9.480502128601074, "logps/rejected": -26.96666717529297, "loss": 0.6809464693069458, "memory(GiB)": 46.83, "nll_loss": 0.3261586129665375, "rewards/accuracies": 0.90625, "rewards/chosen": 0.2214924842119217, "rewards/margins": 1.2070807218551636, "rewards/rejected": -0.9855883121490479, "step": 142, "train_speed(iter/s)": 0.005493 }, { "epoch": 0.11537782708454149, "grad_norm": 3.33156681060791, "learning_rate": 0.00019767193814145226, "logits/chosen": -0.8148999214172363, "logits/rejected": -0.8154037594795227, "logps/chosen": -16.6685848236084, "logps/rejected": -16.219863891601562, "loss": 1.1351004838943481, "memory(GiB)": 46.83, "nll_loss": 0.6261444091796875, "rewards/accuracies": 0.78125, "rewards/chosen": 0.06986582279205322, "rewards/margins": 0.7546349763870239, "rewards/rejected": -0.6847692728042603, "step": 143, "train_speed(iter/s)": 0.005493 }, { "epoch": 0.11618466503618163, "grad_norm": 2.587169647216797, "learning_rate": 0.00019761433136046295, "logits/chosen": -0.7679372429847717, "logits/rejected": -0.7711334824562073, "logps/chosen": -6.84797477722168, "logps/rejected": -25.882503509521484, "loss": 0.6460772752761841, "memory(GiB)": 46.83, "nll_loss": 0.2581600844860077, "rewards/accuracies": 0.78125, "rewards/chosen": 0.25230705738067627, "rewards/margins": 1.5044541358947754, "rewards/rejected": -1.2521469593048096, "step": 144, "train_speed(iter/s)": 0.005494 }, { "epoch": 0.1169915029878218, "grad_norm": 3.816577911376953, "learning_rate": 0.00019755602913870655, "logits/chosen": -0.7486031651496887, "logits/rejected": -0.7545804977416992, "logps/chosen": -11.378320693969727, "logps/rejected": -23.90165901184082, "loss": 1.0280418395996094, "memory(GiB)": 46.83, "nll_loss": 0.5588870644569397, "rewards/accuracies": 0.84375, "rewards/chosen": 0.10084515064954758, "rewards/margins": 1.0778629779815674, "rewards/rejected": -0.9770178198814392, "step": 145, "train_speed(iter/s)": 0.005494 }, { "epoch": 0.11779834093946194, "grad_norm": 3.1183438301086426, "learning_rate": 0.00019749703189154971, "logits/chosen": -0.7663331031799316, "logits/rejected": -0.7778096199035645, "logps/chosen": -7.461820602416992, "logps/rejected": -26.446916580200195, "loss": 0.6639739274978638, "memory(GiB)": 46.83, "nll_loss": 0.28250494599342346, "rewards/accuracies": 0.78125, "rewards/chosen": 0.04964678734540939, "rewards/margins": 1.1681914329528809, "rewards/rejected": -1.1185446977615356, "step": 146, "train_speed(iter/s)": 0.005493 }, { "epoch": 0.11860517889110209, "grad_norm": 2.613725423812866, "learning_rate": 0.00019743734003931082, "logits/chosen": -0.808351993560791, "logits/rejected": -0.8136962652206421, "logps/chosen": -7.89247989654541, "logps/rejected": -23.955371856689453, "loss": 0.8511161804199219, "memory(GiB)": 46.83, "nll_loss": 0.39823463559150696, "rewards/accuracies": 0.78125, "rewards/chosen": 0.12871581315994263, "rewards/margins": 1.055700659751892, "rewards/rejected": -0.9269847869873047, "step": 147, "train_speed(iter/s)": 0.005493 }, { "epoch": 0.11941201684274225, "grad_norm": 3.0128729343414307, "learning_rate": 0.00019737695400725677, "logits/chosen": -0.7927097678184509, "logits/rejected": -0.7919667959213257, "logps/chosen": -9.877785682678223, "logps/rejected": -23.477703094482422, "loss": 0.7262363433837891, "memory(GiB)": 46.83, "nll_loss": 0.3177878260612488, "rewards/accuracies": 0.78125, "rewards/chosen": 0.12437373399734497, "rewards/margins": 1.1551289558410645, "rewards/rejected": -1.0307551622390747, "step": 148, "train_speed(iter/s)": 0.005495 }, { "epoch": 0.1202188547943824, "grad_norm": 2.5007247924804688, "learning_rate": 0.0001973158742256001, "logits/chosen": -0.815912663936615, "logits/rejected": -0.8240575194358826, "logps/chosen": -7.251335620880127, "logps/rejected": -23.904563903808594, "loss": 0.7742622494697571, "memory(GiB)": 46.83, "nll_loss": 0.3948196470737457, "rewards/accuracies": 0.8125, "rewards/chosen": 0.16877779364585876, "rewards/margins": 1.3302054405212402, "rewards/rejected": -1.1614277362823486, "step": 149, "train_speed(iter/s)": 0.005495 }, { "epoch": 0.12102569274602254, "grad_norm": 2.996128559112549, "learning_rate": 0.0001972541011294959, "logits/chosen": -0.8276554346084595, "logits/rejected": -0.832274317741394, "logps/chosen": -9.810141563415527, "logps/rejected": -24.295639038085938, "loss": 0.733322262763977, "memory(GiB)": 46.83, "nll_loss": 0.34396567940711975, "rewards/accuracies": 0.90625, "rewards/chosen": 0.03486320376396179, "rewards/margins": 1.2224383354187012, "rewards/rejected": -1.1875752210617065, "step": 150, "train_speed(iter/s)": 0.005495 } ], "logging_steps": 1, "max_steps": 1239, "num_input_tokens_seen": 0, "num_train_epochs": 1, "save_steps": 50, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": false }, "attributes": {} } }, "total_flos": 1.0977195623354204e+18, "train_batch_size": 1, "trial_name": null, "trial_params": null }