{ "best_global_step": 300, "best_metric": 0.73294115, "best_model_checkpoint": "/data2/kdd/crag/cjz/output/task3_dpo_gt6_task2_gt30.3+task3gt5_0.1vp_idk0614.json/v0-20250614-165413/checkpoint-300", "epoch": 0.44376087340208265, "eval_steps": 300, "global_step": 550, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "epoch": 0.0008068379516401503, "grad_norm": 9.261910438537598, "learning_rate": 3.225806451612903e-06, "logits/chosen": -0.6039718985557556, "logits/rejected": -0.6058337688446045, "logps/chosen": -7.412725925445557, "logps/rejected": -11.413676261901855, "loss": 1.2381761074066162, "memory(GiB)": 46.32, "nll_loss": 0.5450288653373718, "rewards/accuracies": 0.0, "rewards/chosen": 0.0, "rewards/margins": 0.0, "rewards/rejected": 0.0, "step": 1, "train_speed(iter/s)": 0.005524 }, { "epoch": 0.0016136759032803006, "grad_norm": 5.391567230224609, "learning_rate": 6.451612903225806e-06, "logits/chosen": -0.6199994087219238, "logits/rejected": -0.6217825412750244, "logps/chosen": -7.599736213684082, "logps/rejected": -15.575040817260742, "loss": 1.1066936254501343, "memory(GiB)": 46.83, "nll_loss": 0.41354650259017944, "rewards/accuracies": 0.0, "rewards/chosen": 0.0, "rewards/margins": 0.0, "rewards/rejected": 0.0, "step": 2, "train_speed(iter/s)": 0.005546 }, { "epoch": 0.002420513854920451, "grad_norm": 6.5534772872924805, "learning_rate": 9.67741935483871e-06, "logits/chosen": -0.6068329811096191, "logits/rejected": -0.6103144288063049, "logps/chosen": -11.938759803771973, "logps/rejected": -14.32825756072998, "loss": 1.267569661140442, "memory(GiB)": 46.83, "nll_loss": 0.5742746591567993, "rewards/accuracies": 0.5, "rewards/chosen": 0.0005358309717848897, "rewards/margins": -0.00011114418157376349, "rewards/rejected": 0.0006469750078395009, "step": 3, "train_speed(iter/s)": 0.005487 }, { "epoch": 0.003227351806560601, "grad_norm": 3.4633655548095703, "learning_rate": 1.2903225806451613e-05, "logits/chosen": -0.6417700052261353, "logits/rejected": -0.638687789440155, "logps/chosen": -10.244372367858887, "logps/rejected": -8.448144912719727, "loss": 1.1101956367492676, "memory(GiB)": 46.83, "nll_loss": 0.4145403802394867, "rewards/accuracies": 0.40625, "rewards/chosen": -0.002526381518691778, "rewards/margins": -0.004837517160922289, "rewards/rejected": 0.0023111351765692234, "step": 4, "train_speed(iter/s)": 0.005482 }, { "epoch": 0.004034189758200751, "grad_norm": 9.884061813354492, "learning_rate": 1.6129032258064517e-05, "logits/chosen": -0.6263395547866821, "logits/rejected": -0.6316207647323608, "logps/chosen": -8.768255233764648, "logps/rejected": -12.074126243591309, "loss": 1.2384487390518188, "memory(GiB)": 46.83, "nll_loss": 0.5502734780311584, "rewards/accuracies": 0.53125, "rewards/chosen": 0.011151458136737347, "rewards/margins": 0.010235130786895752, "rewards/rejected": 0.0009163276990875602, "step": 5, "train_speed(iter/s)": 0.005496 }, { "epoch": 0.004841027709840902, "grad_norm": 9.879764556884766, "learning_rate": 1.935483870967742e-05, "logits/chosen": -0.6110924482345581, "logits/rejected": -0.6128084063529968, "logps/chosen": -11.146334648132324, "logps/rejected": -12.724503517150879, "loss": 1.246738314628601, "memory(GiB)": 46.83, "nll_loss": 0.5631918907165527, "rewards/accuracies": 0.65625, "rewards/chosen": 0.02471097745001316, "rewards/margins": 0.02056196704506874, "rewards/rejected": 0.004149014595896006, "step": 6, "train_speed(iter/s)": 0.005505 }, { "epoch": 0.0056478656614810515, "grad_norm": 3.7321648597717285, "learning_rate": 2.258064516129032e-05, "logits/chosen": -0.6434396505355835, "logits/rejected": -0.6456248164176941, "logps/chosen": -12.346940994262695, "logps/rejected": -13.585854530334473, "loss": 1.25950026512146, "memory(GiB)": 46.83, "nll_loss": 0.5602214932441711, "rewards/accuracies": 0.46875, "rewards/chosen": 0.01709746941924095, "rewards/margins": -0.004833616316318512, "rewards/rejected": 0.021931089460849762, "step": 7, "train_speed(iter/s)": 0.005511 }, { "epoch": 0.006454703613121202, "grad_norm": 6.577890872955322, "learning_rate": 2.5806451612903226e-05, "logits/chosen": -0.6166916489601135, "logits/rejected": -0.6146227717399597, "logps/chosen": -16.807830810546875, "logps/rejected": -11.38271427154541, "loss": 1.2828420400619507, "memory(GiB)": 46.83, "nll_loss": 0.5101535320281982, "rewards/accuracies": 0.25, "rewards/chosen": -0.04314221069216728, "rewards/margins": -0.13309986889362335, "rewards/rejected": 0.08995765447616577, "step": 8, "train_speed(iter/s)": 0.005502 }, { "epoch": 0.007261541564761352, "grad_norm": 3.5513713359832764, "learning_rate": 2.9032258064516133e-05, "logits/chosen": -0.5994153022766113, "logits/rejected": -0.6015004515647888, "logps/chosen": -11.679065704345703, "logps/rejected": -12.411300659179688, "loss": 1.171980857849121, "memory(GiB)": 46.83, "nll_loss": 0.4982386827468872, "rewards/accuracies": 0.5625, "rewards/chosen": 0.035934723913669586, "rewards/margins": 0.08020534366369247, "rewards/rejected": -0.04427062347531319, "step": 9, "train_speed(iter/s)": 0.005483 }, { "epoch": 0.008068379516401502, "grad_norm": 7.633578777313232, "learning_rate": 3.2258064516129034e-05, "logits/chosen": -0.6122820377349854, "logits/rejected": -0.6125556826591492, "logps/chosen": -12.382171630859375, "logps/rejected": -10.675874710083008, "loss": 1.3903008699417114, "memory(GiB)": 46.83, "nll_loss": 0.6006877422332764, "rewards/accuracies": 0.375, "rewards/chosen": -0.08313174545764923, "rewards/margins": -0.13078533113002777, "rewards/rejected": 0.04765357822179794, "step": 10, "train_speed(iter/s)": 0.005494 }, { "epoch": 0.008875217468041654, "grad_norm": 4.818623065948486, "learning_rate": 3.548387096774194e-05, "logits/chosen": -0.6364253759384155, "logits/rejected": -0.6395613551139832, "logps/chosen": -7.883171558380127, "logps/rejected": -15.457681655883789, "loss": 1.1344804763793945, "memory(GiB)": 46.83, "nll_loss": 0.46768438816070557, "rewards/accuracies": 0.53125, "rewards/chosen": 0.008294675499200821, "rewards/margins": 0.10872506350278854, "rewards/rejected": -0.10043041408061981, "step": 11, "train_speed(iter/s)": 0.00549 }, { "epoch": 0.009682055419681803, "grad_norm": 3.8297243118286133, "learning_rate": 3.870967741935484e-05, "logits/chosen": -0.6082768440246582, "logits/rejected": -0.6128782629966736, "logps/chosen": -10.993257522583008, "logps/rejected": -14.49487018585205, "loss": 1.1111013889312744, "memory(GiB)": 46.83, "nll_loss": 0.42791634798049927, "rewards/accuracies": 0.46875, "rewards/chosen": -0.013819348067045212, "rewards/margins": 0.08211039006710052, "rewards/rejected": -0.09592973440885544, "step": 12, "train_speed(iter/s)": 0.005476 }, { "epoch": 0.010488893371321953, "grad_norm": 3.1733834743499756, "learning_rate": 4.1935483870967746e-05, "logits/chosen": -0.597683846950531, "logits/rejected": -0.6003975868225098, "logps/chosen": -7.611721038818359, "logps/rejected": -13.589990615844727, "loss": 0.9966970682144165, "memory(GiB)": 46.83, "nll_loss": 0.3590569496154785, "rewards/accuracies": 0.65625, "rewards/chosen": 0.09378139674663544, "rewards/margins": 0.16571055352687836, "rewards/rejected": -0.07192917168140411, "step": 13, "train_speed(iter/s)": 0.005488 }, { "epoch": 0.011295731322962103, "grad_norm": 5.364157676696777, "learning_rate": 4.516129032258064e-05, "logits/chosen": -0.5847792029380798, "logits/rejected": -0.5856592655181885, "logps/chosen": -11.617069244384766, "logps/rejected": -11.611367225646973, "loss": 1.2788419723510742, "memory(GiB)": 46.83, "nll_loss": 0.5410674214363098, "rewards/accuracies": 0.46875, "rewards/chosen": 0.037577953189611435, "rewards/margins": -0.04553454369306564, "rewards/rejected": 0.08311249315738678, "step": 14, "train_speed(iter/s)": 0.005494 }, { "epoch": 0.012102569274602255, "grad_norm": 3.436879873275757, "learning_rate": 4.8387096774193554e-05, "logits/chosen": -0.5832479596138, "logits/rejected": -0.5832363367080688, "logps/chosen": -9.650967597961426, "logps/rejected": -11.376352310180664, "loss": 1.0634793043136597, "memory(GiB)": 46.83, "nll_loss": 0.34024038910865784, "rewards/accuracies": 0.53125, "rewards/chosen": 0.05362201854586601, "rewards/margins": -0.029222950339317322, "rewards/rejected": 0.08284495770931244, "step": 15, "train_speed(iter/s)": 0.005497 }, { "epoch": 0.012909407226242404, "grad_norm": 3.2199597358703613, "learning_rate": 5.161290322580645e-05, "logits/chosen": -0.6036816239356995, "logits/rejected": -0.606670618057251, "logps/chosen": -10.059551239013672, "logps/rejected": -16.143247604370117, "loss": 1.0622740983963013, "memory(GiB)": 46.83, "nll_loss": 0.3808459937572479, "rewards/accuracies": 0.625, "rewards/chosen": 0.11249684542417526, "rewards/margins": 0.040876831859350204, "rewards/rejected": 0.07162001729011536, "step": 16, "train_speed(iter/s)": 0.00549 }, { "epoch": 0.013716245177882554, "grad_norm": 3.376516819000244, "learning_rate": 5.4838709677419355e-05, "logits/chosen": -0.5811513662338257, "logits/rejected": -0.5822936296463013, "logps/chosen": -10.964933395385742, "logps/rejected": -13.541594505310059, "loss": 1.1284891366958618, "memory(GiB)": 46.83, "nll_loss": 0.43761852383613586, "rewards/accuracies": 0.5, "rewards/chosen": 0.11780606210231781, "rewards/margins": 0.02046366035938263, "rewards/rejected": 0.09734240174293518, "step": 17, "train_speed(iter/s)": 0.005493 }, { "epoch": 0.014523083129522704, "grad_norm": 3.292140245437622, "learning_rate": 5.8064516129032266e-05, "logits/chosen": -0.5822582840919495, "logits/rejected": -0.5867500305175781, "logps/chosen": -8.11985969543457, "logps/rejected": -14.659163475036621, "loss": 1.0471278429031372, "memory(GiB)": 46.83, "nll_loss": 0.40266352891921997, "rewards/accuracies": 0.65625, "rewards/chosen": 0.14493001997470856, "rewards/margins": 0.1153046265244484, "rewards/rejected": 0.029625393450260162, "step": 18, "train_speed(iter/s)": 0.005497 }, { "epoch": 0.015329921081162856, "grad_norm": 3.320802688598633, "learning_rate": 6.129032258064517e-05, "logits/chosen": -0.5760956406593323, "logits/rejected": -0.5776647925376892, "logps/chosen": -9.478979110717773, "logps/rejected": -11.301219940185547, "loss": 1.1243548393249512, "memory(GiB)": 46.83, "nll_loss": 0.48838871717453003, "rewards/accuracies": 0.6875, "rewards/chosen": 0.20540697872638702, "rewards/margins": 0.14464649558067322, "rewards/rejected": 0.06076047942042351, "step": 19, "train_speed(iter/s)": 0.005493 }, { "epoch": 0.016136759032803004, "grad_norm": 2.7910656929016113, "learning_rate": 6.451612903225807e-05, "logits/chosen": -0.5840404033660889, "logits/rejected": -0.582589864730835, "logps/chosen": -13.635812759399414, "logps/rejected": -10.431557655334473, "loss": 1.2548669576644897, "memory(GiB)": 46.83, "nll_loss": 0.55869460105896, "rewards/accuracies": 0.4375, "rewards/chosen": 0.13213564455509186, "rewards/margins": 0.044300854206085205, "rewards/rejected": 0.08783479034900665, "step": 20, "train_speed(iter/s)": 0.005497 }, { "epoch": 0.016943596984443157, "grad_norm": 2.2573604583740234, "learning_rate": 6.774193548387096e-05, "logits/chosen": -0.5839393734931946, "logits/rejected": -0.5850896835327148, "logps/chosen": -7.3839006423950195, "logps/rejected": -9.574810028076172, "loss": 0.9415242075920105, "memory(GiB)": 46.83, "nll_loss": 0.372197687625885, "rewards/accuracies": 0.75, "rewards/chosen": 0.2435840666294098, "rewards/margins": 0.30735281109809875, "rewards/rejected": -0.06376874446868896, "step": 21, "train_speed(iter/s)": 0.005504 }, { "epoch": 0.017750434936083307, "grad_norm": 2.90157413482666, "learning_rate": 7.096774193548388e-05, "logits/chosen": -0.6114062070846558, "logits/rejected": -0.6119735240936279, "logps/chosen": -8.486170768737793, "logps/rejected": -12.086725234985352, "loss": 1.0081067085266113, "memory(GiB)": 46.83, "nll_loss": 0.34981024265289307, "rewards/accuracies": 0.5625, "rewards/chosen": 0.10258002579212189, "rewards/margins": 0.12462681531906128, "rewards/rejected": -0.02204679138958454, "step": 22, "train_speed(iter/s)": 0.005501 }, { "epoch": 0.018557272887723457, "grad_norm": 2.4457335472106934, "learning_rate": 7.419354838709677e-05, "logits/chosen": -0.5648061037063599, "logits/rejected": -0.5674125552177429, "logps/chosen": -12.962445259094238, "logps/rejected": -15.476969718933105, "loss": 1.0199884176254272, "memory(GiB)": 46.83, "nll_loss": 0.4421077072620392, "rewards/accuracies": 0.6875, "rewards/chosen": 0.13948869705200195, "rewards/margins": 0.31703731417655945, "rewards/rejected": -0.17754864692687988, "step": 23, "train_speed(iter/s)": 0.005504 }, { "epoch": 0.019364110839363607, "grad_norm": 2.250957489013672, "learning_rate": 7.741935483870968e-05, "logits/chosen": -0.5476934313774109, "logits/rejected": -0.5497113466262817, "logps/chosen": -6.839375972747803, "logps/rejected": -12.336576461791992, "loss": 0.9127413630485535, "memory(GiB)": 46.83, "nll_loss": 0.3841688632965088, "rewards/accuracies": 0.78125, "rewards/chosen": 0.2666690945625305, "rewards/margins": 0.42246347665786743, "rewards/rejected": -0.1557943969964981, "step": 24, "train_speed(iter/s)": 0.005505 }, { "epoch": 0.020170948791003757, "grad_norm": 3.6742801666259766, "learning_rate": 8.064516129032258e-05, "logits/chosen": -0.5886849164962769, "logits/rejected": -0.5897050499916077, "logps/chosen": -8.534127235412598, "logps/rejected": -11.815479278564453, "loss": 1.0272297859191895, "memory(GiB)": 46.83, "nll_loss": 0.41876962780952454, "rewards/accuracies": 0.625, "rewards/chosen": 0.13335689902305603, "rewards/margins": 0.27482476830482483, "rewards/rejected": -0.1414678543806076, "step": 25, "train_speed(iter/s)": 0.005513 }, { "epoch": 0.020977786742643906, "grad_norm": 2.5902981758117676, "learning_rate": 8.387096774193549e-05, "logits/chosen": -0.5303969979286194, "logits/rejected": -0.5350589752197266, "logps/chosen": -9.592369079589844, "logps/rejected": -17.837379455566406, "loss": 0.9073010087013245, "memory(GiB)": 46.83, "nll_loss": 0.3275393545627594, "rewards/accuracies": 0.75, "rewards/chosen": 0.1778128743171692, "rewards/margins": 0.31808584928512573, "rewards/rejected": -0.14027300477027893, "step": 26, "train_speed(iter/s)": 0.005509 }, { "epoch": 0.021784624694284056, "grad_norm": 3.656003952026367, "learning_rate": 8.709677419354839e-05, "logits/chosen": -0.5741274356842041, "logits/rejected": -0.5759863257408142, "logps/chosen": -7.401767253875732, "logps/rejected": -9.595519065856934, "loss": 0.9837043881416321, "memory(GiB)": 46.83, "nll_loss": 0.34733644127845764, "rewards/accuracies": 0.6875, "rewards/chosen": 0.16637372970581055, "rewards/margins": 0.22424587607383728, "rewards/rejected": -0.05787213519215584, "step": 27, "train_speed(iter/s)": 0.00551 }, { "epoch": 0.022591462645924206, "grad_norm": 3.6425983905792236, "learning_rate": 9.032258064516129e-05, "logits/chosen": -0.5271302461624146, "logits/rejected": -0.5281438231468201, "logps/chosen": -10.050779342651367, "logps/rejected": -13.247575759887695, "loss": 1.0190500020980835, "memory(GiB)": 46.83, "nll_loss": 0.4030058681964874, "rewards/accuracies": 0.625, "rewards/chosen": 0.022431861609220505, "rewards/margins": 0.22834232449531555, "rewards/rejected": -0.20591047406196594, "step": 28, "train_speed(iter/s)": 0.005522 }, { "epoch": 0.02339830059756436, "grad_norm": 4.539236545562744, "learning_rate": 9.35483870967742e-05, "logits/chosen": -0.574794352054596, "logits/rejected": -0.5771020650863647, "logps/chosen": -7.9426727294921875, "logps/rejected": -11.816813468933105, "loss": 1.0435985326766968, "memory(GiB)": 46.83, "nll_loss": 0.4821586310863495, "rewards/accuracies": 0.6875, "rewards/chosen": 0.17023718357086182, "rewards/margins": 0.36495453119277954, "rewards/rejected": -0.19471733272075653, "step": 29, "train_speed(iter/s)": 0.005525 }, { "epoch": 0.02420513854920451, "grad_norm": 3.463172674179077, "learning_rate": 9.677419354838711e-05, "logits/chosen": -0.5663347244262695, "logits/rejected": -0.5671164393424988, "logps/chosen": -8.761878967285156, "logps/rejected": -16.922607421875, "loss": 0.8841907978057861, "memory(GiB)": 46.83, "nll_loss": 0.37557756900787354, "rewards/accuracies": 0.8125, "rewards/chosen": 0.23288068175315857, "rewards/margins": 0.47043219208717346, "rewards/rejected": -0.2375514954328537, "step": 30, "train_speed(iter/s)": 0.005522 }, { "epoch": 0.02501197650084466, "grad_norm": 7.054537296295166, "learning_rate": 0.0001, "logits/chosen": -0.5485356450080872, "logits/rejected": -0.5510388612747192, "logps/chosen": -8.1714506149292, "logps/rejected": -15.964082717895508, "loss": 1.0905145406723022, "memory(GiB)": 46.83, "nll_loss": 0.48109474778175354, "rewards/accuracies": 0.65625, "rewards/chosen": 0.14875195920467377, "rewards/margins": 0.23288127779960632, "rewards/rejected": -0.08412933349609375, "step": 31, "train_speed(iter/s)": 0.005519 }, { "epoch": 0.02581881445248481, "grad_norm": 2.8915627002716064, "learning_rate": 0.0001032258064516129, "logits/chosen": -0.5415224432945251, "logits/rejected": -0.5406837463378906, "logps/chosen": -12.312981605529785, "logps/rejected": -14.444657325744629, "loss": 0.9778124094009399, "memory(GiB)": 46.83, "nll_loss": 0.4027611017227173, "rewards/accuracies": 0.71875, "rewards/chosen": 0.11852823942899704, "rewards/margins": 0.3213120102882385, "rewards/rejected": -0.2027837634086609, "step": 32, "train_speed(iter/s)": 0.005515 }, { "epoch": 0.02662565240412496, "grad_norm": 4.721103191375732, "learning_rate": 0.0001064516129032258, "logits/chosen": -0.5442328453063965, "logits/rejected": -0.5437616109848022, "logps/chosen": -9.491182327270508, "logps/rejected": -18.31528663635254, "loss": 1.1582751274108887, "memory(GiB)": 46.83, "nll_loss": 0.5736849904060364, "rewards/accuracies": 0.75, "rewards/chosen": 0.03584306687116623, "rewards/margins": 0.35881760716438293, "rewards/rejected": -0.3229745626449585, "step": 33, "train_speed(iter/s)": 0.005515 }, { "epoch": 0.02743249035576511, "grad_norm": 4.470694065093994, "learning_rate": 0.00010967741935483871, "logits/chosen": -0.49901843070983887, "logits/rejected": -0.5027262568473816, "logps/chosen": -6.029642105102539, "logps/rejected": -17.065149307250977, "loss": 0.7831717133522034, "memory(GiB)": 46.83, "nll_loss": 0.2735077142715454, "rewards/accuracies": 0.6875, "rewards/chosen": 0.172469824552536, "rewards/margins": 0.6490951180458069, "rewards/rejected": -0.4766252934932709, "step": 34, "train_speed(iter/s)": 0.005511 }, { "epoch": 0.02823932830740526, "grad_norm": 4.086674690246582, "learning_rate": 0.00011290322580645163, "logits/chosen": -0.5251173377037048, "logits/rejected": -0.5295683145523071, "logps/chosen": -10.127384185791016, "logps/rejected": -19.261646270751953, "loss": 0.90782630443573, "memory(GiB)": 46.83, "nll_loss": 0.37643295526504517, "rewards/accuracies": 0.71875, "rewards/chosen": 0.059490665793418884, "rewards/margins": 0.5788955688476562, "rewards/rejected": -0.5194048881530762, "step": 35, "train_speed(iter/s)": 0.005516 }, { "epoch": 0.02904616625904541, "grad_norm": 3.153599977493286, "learning_rate": 0.00011612903225806453, "logits/chosen": -0.5580551624298096, "logits/rejected": -0.561299741268158, "logps/chosen": -7.748661518096924, "logps/rejected": -18.775835037231445, "loss": 0.8323644995689392, "memory(GiB)": 46.83, "nll_loss": 0.30874526500701904, "rewards/accuracies": 0.75, "rewards/chosen": 0.17774799466133118, "rewards/margins": 0.58444744348526, "rewards/rejected": -0.4066994786262512, "step": 36, "train_speed(iter/s)": 0.005518 }, { "epoch": 0.02985300421068556, "grad_norm": 5.963130950927734, "learning_rate": 0.00011935483870967743, "logits/chosen": -0.5691896080970764, "logits/rejected": -0.5704917907714844, "logps/chosen": -5.695924282073975, "logps/rejected": -15.709531784057617, "loss": 0.8581907153129578, "memory(GiB)": 46.83, "nll_loss": 0.32061102986335754, "rewards/accuracies": 0.75, "rewards/chosen": 0.13813850283622742, "rewards/margins": 0.42923206090927124, "rewards/rejected": -0.2910935878753662, "step": 37, "train_speed(iter/s)": 0.005516 }, { "epoch": 0.03065984216232571, "grad_norm": 3.532068967819214, "learning_rate": 0.00012258064516129034, "logits/chosen": -0.5251184105873108, "logits/rejected": -0.5261702537536621, "logps/chosen": -8.303949356079102, "logps/rejected": -13.649654388427734, "loss": 0.9825394153594971, "memory(GiB)": 46.83, "nll_loss": 0.39365747570991516, "rewards/accuracies": 0.65625, "rewards/chosen": 0.07552488148212433, "rewards/margins": 0.2995148003101349, "rewards/rejected": -0.22398996353149414, "step": 38, "train_speed(iter/s)": 0.005515 }, { "epoch": 0.03146668011396586, "grad_norm": 2.9115569591522217, "learning_rate": 0.00012580645161290322, "logits/chosen": -0.5716837048530579, "logits/rejected": -0.5749698281288147, "logps/chosen": -7.206816673278809, "logps/rejected": -15.77934741973877, "loss": 0.7430101633071899, "memory(GiB)": 46.83, "nll_loss": 0.27266308665275574, "rewards/accuracies": 0.90625, "rewards/chosen": 0.20229285955429077, "rewards/margins": 0.6254266500473022, "rewards/rejected": -0.42313385009765625, "step": 39, "train_speed(iter/s)": 0.005515 }, { "epoch": 0.03227351806560601, "grad_norm": 4.647506237030029, "learning_rate": 0.00012903225806451613, "logits/chosen": -0.5296156406402588, "logits/rejected": -0.5295798778533936, "logps/chosen": -10.529404640197754, "logps/rejected": -16.44548988342285, "loss": 0.900071918964386, "memory(GiB)": 46.83, "nll_loss": 0.3727172613143921, "rewards/accuracies": 0.71875, "rewards/chosen": 0.08702702820301056, "rewards/margins": 0.4926542341709137, "rewards/rejected": -0.40562722086906433, "step": 40, "train_speed(iter/s)": 0.005514 }, { "epoch": 0.03308035601724616, "grad_norm": 3.4815561771392822, "learning_rate": 0.00013225806451612905, "logits/chosen": -0.5586342811584473, "logits/rejected": -0.5603877305984497, "logps/chosen": -7.803877830505371, "logps/rejected": -18.412734985351562, "loss": 0.8854644298553467, "memory(GiB)": 46.83, "nll_loss": 0.37826117873191833, "rewards/accuracies": 0.78125, "rewards/chosen": 0.08443664014339447, "rewards/margins": 0.6363339424133301, "rewards/rejected": -0.5518972873687744, "step": 41, "train_speed(iter/s)": 0.005514 }, { "epoch": 0.033887193968886314, "grad_norm": 3.6079483032226562, "learning_rate": 0.00013548387096774193, "logits/chosen": -0.5233692526817322, "logits/rejected": -0.5257354378700256, "logps/chosen": -11.989986419677734, "logps/rejected": -17.48329734802246, "loss": 0.9667509198188782, "memory(GiB)": 46.83, "nll_loss": 0.4528670608997345, "rewards/accuracies": 0.8125, "rewards/chosen": 0.14738641679286957, "rewards/margins": 0.5997685194015503, "rewards/rejected": -0.4523821473121643, "step": 42, "train_speed(iter/s)": 0.005512 }, { "epoch": 0.03469403192052646, "grad_norm": 5.491096019744873, "learning_rate": 0.00013870967741935487, "logits/chosen": -0.5798231363296509, "logits/rejected": -0.5843824148178101, "logps/chosen": -8.180625915527344, "logps/rejected": -19.614505767822266, "loss": 1.0811830759048462, "memory(GiB)": 46.83, "nll_loss": 0.5651165246963501, "rewards/accuracies": 0.75, "rewards/chosen": 0.018763888627290726, "rewards/margins": 0.5782932043075562, "rewards/rejected": -0.5595293641090393, "step": 43, "train_speed(iter/s)": 0.005507 }, { "epoch": 0.035500869872166614, "grad_norm": 5.715328216552734, "learning_rate": 0.00014193548387096775, "logits/chosen": -0.5562050342559814, "logits/rejected": -0.5585284233093262, "logps/chosen": -9.799619674682617, "logps/rejected": -13.962825775146484, "loss": 1.046175479888916, "memory(GiB)": 46.83, "nll_loss": 0.5247361660003662, "rewards/accuracies": 0.6875, "rewards/chosen": 0.0660993829369545, "rewards/margins": 0.557608425617218, "rewards/rejected": -0.4915090799331665, "step": 44, "train_speed(iter/s)": 0.005509 }, { "epoch": 0.03630770782380676, "grad_norm": 4.065413951873779, "learning_rate": 0.00014516129032258066, "logits/chosen": -0.5717958807945251, "logits/rejected": -0.5754877924919128, "logps/chosen": -10.432125091552734, "logps/rejected": -17.75714111328125, "loss": 0.9775079488754272, "memory(GiB)": 46.83, "nll_loss": 0.4804929792881012, "rewards/accuracies": 0.71875, "rewards/chosen": 0.16446207463741302, "rewards/margins": 0.5844215154647827, "rewards/rejected": -0.4199594557285309, "step": 45, "train_speed(iter/s)": 0.005513 }, { "epoch": 0.037114545775446914, "grad_norm": 4.507160663604736, "learning_rate": 0.00014838709677419355, "logits/chosen": -0.5544827580451965, "logits/rejected": -0.5517963171005249, "logps/chosen": -10.039278030395508, "logps/rejected": -16.44822120666504, "loss": 0.9198786020278931, "memory(GiB)": 46.83, "nll_loss": 0.3649781346321106, "rewards/accuracies": 0.6875, "rewards/chosen": 0.11493994295597076, "rewards/margins": 0.5548471808433533, "rewards/rejected": -0.4399072825908661, "step": 46, "train_speed(iter/s)": 0.005512 }, { "epoch": 0.03792138372708706, "grad_norm": 4.040234565734863, "learning_rate": 0.00015161290322580646, "logits/chosen": -0.5704259276390076, "logits/rejected": -0.5716680884361267, "logps/chosen": -7.400537967681885, "logps/rejected": -17.6054744720459, "loss": 0.9134971499443054, "memory(GiB)": 46.83, "nll_loss": 0.3412809669971466, "rewards/accuracies": 0.78125, "rewards/chosen": 0.03388240188360214, "rewards/margins": 0.4440326392650604, "rewards/rejected": -0.4101502001285553, "step": 47, "train_speed(iter/s)": 0.005512 }, { "epoch": 0.038728221678727213, "grad_norm": 2.9642419815063477, "learning_rate": 0.00015483870967741937, "logits/chosen": -0.5867742300033569, "logits/rejected": -0.5912387371063232, "logps/chosen": -9.146940231323242, "logps/rejected": -16.374706268310547, "loss": 0.9059248566627502, "memory(GiB)": 46.83, "nll_loss": 0.3897300958633423, "rewards/accuracies": 0.78125, "rewards/chosen": 0.1047089472413063, "rewards/margins": 0.5065208673477173, "rewards/rejected": -0.4018118679523468, "step": 48, "train_speed(iter/s)": 0.005514 }, { "epoch": 0.03953505963036737, "grad_norm": 3.087217330932617, "learning_rate": 0.00015806451612903225, "logits/chosen": -0.5874481201171875, "logits/rejected": -0.5872229337692261, "logps/chosen": -6.086337566375732, "logps/rejected": -10.504037857055664, "loss": 0.8798851370811462, "memory(GiB)": 46.83, "nll_loss": 0.33263421058654785, "rewards/accuracies": 0.6875, "rewards/chosen": 0.20601165294647217, "rewards/margins": 0.4658709466457367, "rewards/rejected": -0.2598593533039093, "step": 49, "train_speed(iter/s)": 0.005513 }, { "epoch": 0.04034189758200751, "grad_norm": 3.16754150390625, "learning_rate": 0.00016129032258064516, "logits/chosen": -0.5708128809928894, "logits/rejected": -0.5798742175102234, "logps/chosen": -6.393083572387695, "logps/rejected": -19.668724060058594, "loss": 0.8404853343963623, "memory(GiB)": 46.83, "nll_loss": 0.34996694326400757, "rewards/accuracies": 0.84375, "rewards/chosen": 0.21206828951835632, "rewards/margins": 0.5756057500839233, "rewards/rejected": -0.363537460565567, "step": 50, "train_speed(iter/s)": 0.005516 }, { "epoch": 0.041148735533647667, "grad_norm": 2.4009766578674316, "learning_rate": 0.00016451612903225807, "logits/chosen": -0.5599406361579895, "logits/rejected": -0.5625043511390686, "logps/chosen": -7.262391090393066, "logps/rejected": -15.73720932006836, "loss": 0.8113247752189636, "memory(GiB)": 46.83, "nll_loss": 0.28076890110969543, "rewards/accuracies": 0.8125, "rewards/chosen": 0.14269490540027618, "rewards/margins": 0.47564250230789185, "rewards/rejected": -0.33294758200645447, "step": 51, "train_speed(iter/s)": 0.005506 }, { "epoch": 0.04195557348528781, "grad_norm": 3.129634380340576, "learning_rate": 0.00016774193548387098, "logits/chosen": -0.5937235355377197, "logits/rejected": -0.5938248038291931, "logps/chosen": -5.393199920654297, "logps/rejected": -15.786672592163086, "loss": 0.7831435799598694, "memory(GiB)": 46.83, "nll_loss": 0.2872075140476227, "rewards/accuracies": 0.8125, "rewards/chosen": 0.19873687624931335, "rewards/margins": 0.5569283366203308, "rewards/rejected": -0.35819149017333984, "step": 52, "train_speed(iter/s)": 0.005507 }, { "epoch": 0.042762411436927966, "grad_norm": 3.2887256145477295, "learning_rate": 0.0001709677419354839, "logits/chosen": -0.5820189118385315, "logits/rejected": -0.5850119590759277, "logps/chosen": -7.764882564544678, "logps/rejected": -16.894685745239258, "loss": 0.8994213342666626, "memory(GiB)": 46.83, "nll_loss": 0.3770924210548401, "rewards/accuracies": 0.6875, "rewards/chosen": 0.20706558227539062, "rewards/margins": 0.5472366213798523, "rewards/rejected": -0.34017103910446167, "step": 53, "train_speed(iter/s)": 0.005506 }, { "epoch": 0.04356924938856811, "grad_norm": 3.7313735485076904, "learning_rate": 0.00017419354838709678, "logits/chosen": -0.5833962559700012, "logits/rejected": -0.5876143574714661, "logps/chosen": -8.130949020385742, "logps/rejected": -20.79953384399414, "loss": 0.9545141458511353, "memory(GiB)": 46.83, "nll_loss": 0.4539381265640259, "rewards/accuracies": 0.75, "rewards/chosen": 0.10515612363815308, "rewards/margins": 0.612572968006134, "rewards/rejected": -0.5074167847633362, "step": 54, "train_speed(iter/s)": 0.005507 }, { "epoch": 0.044376087340208266, "grad_norm": 5.652868747711182, "learning_rate": 0.0001774193548387097, "logits/chosen": -0.5960416793823242, "logits/rejected": -0.5957224369049072, "logps/chosen": -12.674562454223633, "logps/rejected": -15.591826438903809, "loss": 1.1736092567443848, "memory(GiB)": 46.83, "nll_loss": 0.5310375690460205, "rewards/accuracies": 0.625, "rewards/chosen": -0.11839848756790161, "rewards/margins": 0.40016603469848633, "rewards/rejected": -0.5185645222663879, "step": 55, "train_speed(iter/s)": 0.005509 }, { "epoch": 0.04518292529184841, "grad_norm": 4.002370834350586, "learning_rate": 0.00018064516129032257, "logits/chosen": -0.5776931643486023, "logits/rejected": -0.5789185166358948, "logps/chosen": -12.67449951171875, "logps/rejected": -16.919376373291016, "loss": 1.087173342704773, "memory(GiB)": 46.83, "nll_loss": 0.4873568117618561, "rewards/accuracies": 0.65625, "rewards/chosen": -0.15739397704601288, "rewards/margins": 0.39120250940322876, "rewards/rejected": -0.5485965013504028, "step": 56, "train_speed(iter/s)": 0.005507 }, { "epoch": 0.045989763243488566, "grad_norm": 3.5529890060424805, "learning_rate": 0.00018387096774193548, "logits/chosen": -0.5732367634773254, "logits/rejected": -0.5760124921798706, "logps/chosen": -4.22891902923584, "logps/rejected": -18.773733139038086, "loss": 0.6395769119262695, "memory(GiB)": 46.83, "nll_loss": 0.23632453382015228, "rewards/accuracies": 0.9375, "rewards/chosen": 0.12576641142368317, "rewards/margins": 0.908116340637207, "rewards/rejected": -0.7823498845100403, "step": 57, "train_speed(iter/s)": 0.005505 }, { "epoch": 0.04679660119512872, "grad_norm": 2.638253927230835, "learning_rate": 0.0001870967741935484, "logits/chosen": -0.5618959069252014, "logits/rejected": -0.5671476721763611, "logps/chosen": -8.717156410217285, "logps/rejected": -22.3723087310791, "loss": 0.8119103312492371, "memory(GiB)": 46.83, "nll_loss": 0.4192086458206177, "rewards/accuracies": 0.9375, "rewards/chosen": 0.18826748430728912, "rewards/margins": 0.8515651226043701, "rewards/rejected": -0.6632976531982422, "step": 58, "train_speed(iter/s)": 0.005503 }, { "epoch": 0.047603439146768865, "grad_norm": 4.416356086730957, "learning_rate": 0.0001903225806451613, "logits/chosen": -0.5946109294891357, "logits/rejected": -0.5949057340621948, "logps/chosen": -10.825102806091309, "logps/rejected": -15.580466270446777, "loss": 0.9124961495399475, "memory(GiB)": 46.83, "nll_loss": 0.43738603591918945, "rewards/accuracies": 0.78125, "rewards/chosen": 0.1081230640411377, "rewards/margins": 0.6975550651550293, "rewards/rejected": -0.5894321203231812, "step": 59, "train_speed(iter/s)": 0.005503 }, { "epoch": 0.04841027709840902, "grad_norm": 3.548480272293091, "learning_rate": 0.00019354838709677422, "logits/chosen": -0.576353907585144, "logits/rejected": -0.5807583928108215, "logps/chosen": -10.603282928466797, "logps/rejected": -20.904390335083008, "loss": 1.033903956413269, "memory(GiB)": 46.83, "nll_loss": 0.5458623170852661, "rewards/accuracies": 0.71875, "rewards/chosen": 0.10141083598136902, "rewards/margins": 0.9133819341659546, "rewards/rejected": -0.8119711875915527, "step": 60, "train_speed(iter/s)": 0.005505 }, { "epoch": 0.049217115050049165, "grad_norm": 4.239978790283203, "learning_rate": 0.0001967741935483871, "logits/chosen": -0.6159774661064148, "logits/rejected": -0.6157845258712769, "logps/chosen": -13.034204483032227, "logps/rejected": -21.466520309448242, "loss": 0.9954748153686523, "memory(GiB)": 46.83, "nll_loss": 0.5168237090110779, "rewards/accuracies": 0.8125, "rewards/chosen": -0.15371613204479218, "rewards/margins": 0.9087806940078735, "rewards/rejected": -1.0624967813491821, "step": 61, "train_speed(iter/s)": 0.005508 }, { "epoch": 0.05002395300168932, "grad_norm": 4.418153285980225, "learning_rate": 0.0002, "logits/chosen": -0.586484968662262, "logits/rejected": -0.5885915756225586, "logps/chosen": -6.359810829162598, "logps/rejected": -18.686431884765625, "loss": 0.7993831634521484, "memory(GiB)": 46.83, "nll_loss": 0.3223803639411926, "rewards/accuracies": 0.84375, "rewards/chosen": 0.1565569043159485, "rewards/margins": 0.8297788500785828, "rewards/rejected": -0.6732219457626343, "step": 62, "train_speed(iter/s)": 0.005508 }, { "epoch": 0.050830790953329465, "grad_norm": 3.898704767227173, "learning_rate": 0.00019999964378142156, "logits/chosen": -0.5732013583183289, "logits/rejected": -0.5774887800216675, "logps/chosen": -12.98630142211914, "logps/rejected": -19.34124755859375, "loss": 0.9075384140014648, "memory(GiB)": 46.83, "nll_loss": 0.39192017912864685, "rewards/accuracies": 0.75, "rewards/chosen": 0.19289077818393707, "rewards/margins": 0.6732712388038635, "rewards/rejected": -0.48038047552108765, "step": 63, "train_speed(iter/s)": 0.005507 }, { "epoch": 0.05163762890496962, "grad_norm": 6.278528213500977, "learning_rate": 0.00019999857512822402, "logits/chosen": -0.6075332760810852, "logits/rejected": -0.6084203124046326, "logps/chosen": -14.246075630187988, "logps/rejected": -20.948959350585938, "loss": 1.0685752630233765, "memory(GiB)": 46.83, "nll_loss": 0.5815572142601013, "rewards/accuracies": 0.71875, "rewards/chosen": -0.03303433582186699, "rewards/margins": 0.8266364336013794, "rewards/rejected": -0.8596707582473755, "step": 64, "train_speed(iter/s)": 0.005508 }, { "epoch": 0.052444466856609764, "grad_norm": 4.589393615722656, "learning_rate": 0.00019999679404802089, "logits/chosen": -0.596097469329834, "logits/rejected": -0.5986034870147705, "logps/chosen": -8.450502395629883, "logps/rejected": -21.070066452026367, "loss": 0.7867013812065125, "memory(GiB)": 46.83, "nll_loss": 0.31530463695526123, "rewards/accuracies": 0.84375, "rewards/chosen": 0.13920006155967712, "rewards/margins": 0.9423296451568604, "rewards/rejected": -0.8031294941902161, "step": 65, "train_speed(iter/s)": 0.005508 }, { "epoch": 0.05325130480824992, "grad_norm": 4.376217365264893, "learning_rate": 0.00019999430055350122, "logits/chosen": -0.5758836269378662, "logits/rejected": -0.5734565854072571, "logps/chosen": -10.774827003479004, "logps/rejected": -19.021907806396484, "loss": 0.7909982800483704, "memory(GiB)": 46.83, "nll_loss": 0.3997192680835724, "rewards/accuracies": 0.9375, "rewards/chosen": 0.23606787621974945, "rewards/margins": 1.0521141290664673, "rewards/rejected": -0.8160461783409119, "step": 66, "train_speed(iter/s)": 0.005507 }, { "epoch": 0.05405814275989007, "grad_norm": 6.438971042633057, "learning_rate": 0.00019999109466242962, "logits/chosen": -0.5718088150024414, "logits/rejected": -0.5745964050292969, "logps/chosen": -6.671931266784668, "logps/rejected": -20.429231643676758, "loss": 0.8954067230224609, "memory(GiB)": 46.83, "nll_loss": 0.45071539282798767, "rewards/accuracies": 0.8125, "rewards/chosen": 0.10935470461845398, "rewards/margins": 0.8583554029464722, "rewards/rejected": -0.7490006685256958, "step": 67, "train_speed(iter/s)": 0.005509 }, { "epoch": 0.05486498071153022, "grad_norm": 11.16286849975586, "learning_rate": 0.00019998717639764602, "logits/chosen": -0.5820534229278564, "logits/rejected": -0.5849663019180298, "logps/chosen": -9.799468040466309, "logps/rejected": -18.977890014648438, "loss": 1.29269278049469, "memory(GiB)": 46.83, "nll_loss": 0.7049438953399658, "rewards/accuracies": 0.6875, "rewards/chosen": -0.04825415089726448, "rewards/margins": 0.5465254783630371, "rewards/rejected": -0.5947796702384949, "step": 68, "train_speed(iter/s)": 0.005506 }, { "epoch": 0.05567181866317037, "grad_norm": 9.413622856140137, "learning_rate": 0.00019998254578706563, "logits/chosen": -0.5850585699081421, "logits/rejected": -0.5874402523040771, "logps/chosen": -8.903966903686523, "logps/rejected": -14.843938827514648, "loss": 1.3027069568634033, "memory(GiB)": 46.83, "nll_loss": 0.744307279586792, "rewards/accuracies": 0.78125, "rewards/chosen": -0.0512365885078907, "rewards/margins": 0.5854336619377136, "rewards/rejected": -0.6366702318191528, "step": 69, "train_speed(iter/s)": 0.005505 }, { "epoch": 0.05647865661481052, "grad_norm": 7.333382606506348, "learning_rate": 0.00019997720286367863, "logits/chosen": -0.545200765132904, "logits/rejected": -0.5484716296195984, "logps/chosen": -7.334113121032715, "logps/rejected": -22.56316375732422, "loss": 1.0189334154129028, "memory(GiB)": 46.83, "nll_loss": 0.5383400321006775, "rewards/accuracies": 0.84375, "rewards/chosen": 0.061847541481256485, "rewards/margins": 0.6559779644012451, "rewards/rejected": -0.5941305160522461, "step": 70, "train_speed(iter/s)": 0.005506 }, { "epoch": 0.05728549456645067, "grad_norm": 2.8849799633026123, "learning_rate": 0.00019997114766554997, "logits/chosen": -0.5629354119300842, "logits/rejected": -0.5669021606445312, "logps/chosen": -8.698752403259277, "logps/rejected": -21.85867691040039, "loss": 0.8375651836395264, "memory(GiB)": 46.83, "nll_loss": 0.3549819886684418, "rewards/accuracies": 0.78125, "rewards/chosen": 0.09854352474212646, "rewards/margins": 0.7027413845062256, "rewards/rejected": -0.6041979193687439, "step": 71, "train_speed(iter/s)": 0.005507 }, { "epoch": 0.05809233251809082, "grad_norm": 2.6733391284942627, "learning_rate": 0.00019996438023581913, "logits/chosen": -0.5319232940673828, "logits/rejected": -0.5331096649169922, "logps/chosen": -10.13166332244873, "logps/rejected": -13.18635368347168, "loss": 1.014970302581787, "memory(GiB)": 46.83, "nll_loss": 0.4217461347579956, "rewards/accuracies": 0.71875, "rewards/chosen": 0.14793364703655243, "rewards/margins": 0.3788456618785858, "rewards/rejected": -0.2309119999408722, "step": 72, "train_speed(iter/s)": 0.005505 }, { "epoch": 0.05889917046973097, "grad_norm": 2.497257947921753, "learning_rate": 0.00019995690062269984, "logits/chosen": -0.5789859294891357, "logits/rejected": -0.5805359482765198, "logps/chosen": -8.139568328857422, "logps/rejected": -10.85029411315918, "loss": 0.9546566605567932, "memory(GiB)": 46.83, "nll_loss": 0.4216194450855255, "rewards/accuracies": 0.65625, "rewards/chosen": 0.24104151129722595, "rewards/margins": 0.5254760980606079, "rewards/rejected": -0.28443461656570435, "step": 73, "train_speed(iter/s)": 0.005506 }, { "epoch": 0.05970600842137112, "grad_norm": 2.8535268306732178, "learning_rate": 0.00019994870887947962, "logits/chosen": -0.5778383612632751, "logits/rejected": -0.5768096446990967, "logps/chosen": -8.49053955078125, "logps/rejected": -12.854878425598145, "loss": 1.0000758171081543, "memory(GiB)": 46.83, "nll_loss": 0.37848562002182007, "rewards/accuracies": 0.625, "rewards/chosen": 0.1054978221654892, "rewards/margins": 0.3462926149368286, "rewards/rejected": -0.24079479277133942, "step": 74, "train_speed(iter/s)": 0.005506 }, { "epoch": 0.06051284637301127, "grad_norm": 2.198607921600342, "learning_rate": 0.00019993980506451947, "logits/chosen": -0.530400276184082, "logits/rejected": -0.530858039855957, "logps/chosen": -9.152666091918945, "logps/rejected": -11.464343070983887, "loss": 0.9745745658874512, "memory(GiB)": 46.83, "nll_loss": 0.38881367444992065, "rewards/accuracies": 0.75, "rewards/chosen": 0.1783803254365921, "rewards/margins": 0.3315035402774811, "rewards/rejected": -0.1531231850385666, "step": 75, "train_speed(iter/s)": 0.005504 }, { "epoch": 0.06131968432465142, "grad_norm": 2.461601972579956, "learning_rate": 0.0001999301892412535, "logits/chosen": -0.5405219197273254, "logits/rejected": -0.5390282869338989, "logps/chosen": -10.537997245788574, "logps/rejected": -15.066913604736328, "loss": 0.966386079788208, "memory(GiB)": 46.83, "nll_loss": 0.38977545499801636, "rewards/accuracies": 0.71875, "rewards/chosen": 0.09291838109493256, "rewards/margins": 0.3533533811569214, "rewards/rejected": -0.26043495535850525, "step": 76, "train_speed(iter/s)": 0.005503 }, { "epoch": 0.06212652227629157, "grad_norm": 2.0999796390533447, "learning_rate": 0.00019991986147818838, "logits/chosen": -0.5443933010101318, "logits/rejected": -0.5435047149658203, "logps/chosen": -12.143755912780762, "logps/rejected": -15.766691207885742, "loss": 0.8939065337181091, "memory(GiB)": 46.83, "nll_loss": 0.415660560131073, "rewards/accuracies": 0.90625, "rewards/chosen": 0.23248028755187988, "rewards/margins": 0.5352811217308044, "rewards/rejected": -0.30280083417892456, "step": 77, "train_speed(iter/s)": 0.005502 }, { "epoch": 0.06293336022793172, "grad_norm": 2.9244306087493896, "learning_rate": 0.00019990882184890295, "logits/chosen": -0.5794655680656433, "logits/rejected": -0.5853484869003296, "logps/chosen": -7.884565353393555, "logps/rejected": -20.136926651000977, "loss": 0.8564450740814209, "memory(GiB)": 46.83, "nll_loss": 0.34705159068107605, "rewards/accuracies": 0.875, "rewards/chosen": 0.14532405138015747, "rewards/margins": 0.5069437623023987, "rewards/rejected": -0.3616198003292084, "step": 78, "train_speed(iter/s)": 0.005502 }, { "epoch": 0.06374019817957187, "grad_norm": 3.461670160293579, "learning_rate": 0.00019989707043204763, "logits/chosen": -0.5491142868995667, "logits/rejected": -0.553898811340332, "logps/chosen": -7.547114372253418, "logps/rejected": -18.740121841430664, "loss": 0.9405392408370972, "memory(GiB)": 46.83, "nll_loss": 0.48508715629577637, "rewards/accuracies": 0.84375, "rewards/chosen": 0.128400981426239, "rewards/margins": 0.6999501585960388, "rewards/rejected": -0.5715491771697998, "step": 79, "train_speed(iter/s)": 0.005502 }, { "epoch": 0.06454703613121202, "grad_norm": 4.165892601013184, "learning_rate": 0.0001998846073113439, "logits/chosen": -0.6084208488464355, "logits/rejected": -0.6092680096626282, "logps/chosen": -12.750446319580078, "logps/rejected": -19.53608512878418, "loss": 1.0978946685791016, "memory(GiB)": 46.83, "nll_loss": 0.5877176523208618, "rewards/accuracies": 0.75, "rewards/chosen": 0.1369042694568634, "rewards/margins": 0.6248282194137573, "rewards/rejected": -0.48792392015457153, "step": 80, "train_speed(iter/s)": 0.005503 }, { "epoch": 0.06535387408285218, "grad_norm": 2.287846565246582, "learning_rate": 0.00019987143257558365, "logits/chosen": -0.59499192237854, "logits/rejected": -0.5972949862480164, "logps/chosen": -4.519835948944092, "logps/rejected": -19.02901840209961, "loss": 0.58124840259552, "memory(GiB)": 46.83, "nll_loss": 0.15051494538784027, "rewards/accuracies": 0.84375, "rewards/chosen": 0.19695766270160675, "rewards/margins": 0.9730147123336792, "rewards/rejected": -0.7760570049285889, "step": 81, "train_speed(iter/s)": 0.005506 }, { "epoch": 0.06616071203449232, "grad_norm": 7.103982448577881, "learning_rate": 0.00019985754631862855, "logits/chosen": -0.5857492089271545, "logits/rejected": -0.5895102024078369, "logps/chosen": -8.903070449829102, "logps/rejected": -26.571044921875, "loss": 0.7599916458129883, "memory(GiB)": 46.83, "nll_loss": 0.3342111110687256, "rewards/accuracies": 0.84375, "rewards/chosen": 0.14196240901947021, "rewards/margins": 0.8281382322311401, "rewards/rejected": -0.6861758232116699, "step": 82, "train_speed(iter/s)": 0.005504 }, { "epoch": 0.06696754998613247, "grad_norm": 3.764488697052002, "learning_rate": 0.00019984294863940955, "logits/chosen": -0.6067830324172974, "logits/rejected": -0.6086009740829468, "logps/chosen": -9.9881591796875, "logps/rejected": -19.09541893005371, "loss": 0.9752427339553833, "memory(GiB)": 46.83, "nll_loss": 0.5045859217643738, "rewards/accuracies": 0.71875, "rewards/chosen": 0.14939813315868378, "rewards/margins": 0.8939868211746216, "rewards/rejected": -0.7445887327194214, "step": 83, "train_speed(iter/s)": 0.005503 }, { "epoch": 0.06777438793777263, "grad_norm": 3.3293344974517822, "learning_rate": 0.00019982763964192585, "logits/chosen": -0.6330868601799011, "logits/rejected": -0.6393448710441589, "logps/chosen": -4.902453899383545, "logps/rejected": -24.94113540649414, "loss": 0.7244248390197754, "memory(GiB)": 46.83, "nll_loss": 0.3735058009624481, "rewards/accuracies": 0.9375, "rewards/chosen": 0.17604736983776093, "rewards/margins": 1.2982165813446045, "rewards/rejected": -1.1221693754196167, "step": 84, "train_speed(iter/s)": 0.005503 }, { "epoch": 0.06858122588941278, "grad_norm": 5.892284393310547, "learning_rate": 0.00019981161943524443, "logits/chosen": -0.6240598559379578, "logits/rejected": -0.620481550693512, "logps/chosen": -14.60393238067627, "logps/rejected": -13.365829467773438, "loss": 1.1541650295257568, "memory(GiB)": 46.83, "nll_loss": 0.48222166299819946, "rewards/accuracies": 0.59375, "rewards/chosen": -0.09302416443824768, "rewards/margins": 0.41544342041015625, "rewards/rejected": -0.5084675550460815, "step": 85, "train_speed(iter/s)": 0.0055 }, { "epoch": 0.06938806384105292, "grad_norm": 4.056751251220703, "learning_rate": 0.00019979488813349933, "logits/chosen": -0.6613398194313049, "logits/rejected": -0.6640070080757141, "logps/chosen": -9.50975227355957, "logps/rejected": -21.119707107543945, "loss": 0.8987840414047241, "memory(GiB)": 46.83, "nll_loss": 0.52927565574646, "rewards/accuracies": 0.84375, "rewards/chosen": 0.1999521553516388, "rewards/margins": 1.1560636758804321, "rewards/rejected": -0.956111490726471, "step": 86, "train_speed(iter/s)": 0.005499 }, { "epoch": 0.07019490179269307, "grad_norm": 4.351650238037109, "learning_rate": 0.0001997774458558904, "logits/chosen": -0.6547818779945374, "logits/rejected": -0.6571143269538879, "logps/chosen": -8.668737411499023, "logps/rejected": -20.79534149169922, "loss": 0.9775034785270691, "memory(GiB)": 46.83, "nll_loss": 0.4770965874195099, "rewards/accuracies": 0.75, "rewards/chosen": 0.02099284902215004, "rewards/margins": 0.8633284568786621, "rewards/rejected": -0.84233558177948, "step": 87, "train_speed(iter/s)": 0.005498 }, { "epoch": 0.07100173974433323, "grad_norm": 2.8774800300598145, "learning_rate": 0.00019975929272668296, "logits/chosen": -0.6759516000747681, "logits/rejected": -0.6824960708618164, "logps/chosen": -4.7266716957092285, "logps/rejected": -26.10918426513672, "loss": 0.5549903512001038, "memory(GiB)": 46.83, "nll_loss": 0.271104097366333, "rewards/accuracies": 0.9375, "rewards/chosen": 0.25939324498176575, "rewards/margins": 1.6003111600875854, "rewards/rejected": -1.340917944908142, "step": 88, "train_speed(iter/s)": 0.005501 }, { "epoch": 0.07180857769597337, "grad_norm": 2.8334577083587646, "learning_rate": 0.00019974042887520668, "logits/chosen": -0.6535760164260864, "logits/rejected": -0.6572569608688354, "logps/chosen": -13.957544326782227, "logps/rejected": -18.16533851623535, "loss": 0.9486314654350281, "memory(GiB)": 46.83, "nll_loss": 0.5478147268295288, "rewards/accuracies": 0.90625, "rewards/chosen": 0.2579638957977295, "rewards/margins": 0.9477146863937378, "rewards/rejected": -0.6897507905960083, "step": 89, "train_speed(iter/s)": 0.005501 }, { "epoch": 0.07261541564761352, "grad_norm": 5.422155380249023, "learning_rate": 0.00019972085443585463, "logits/chosen": -0.6767461895942688, "logits/rejected": -0.6799700260162354, "logps/chosen": -7.507997512817383, "logps/rejected": -20.19240951538086, "loss": 0.8118898868560791, "memory(GiB)": 46.83, "nll_loss": 0.4057508111000061, "rewards/accuracies": 0.84375, "rewards/chosen": 0.11586537212133408, "rewards/margins": 1.0757473707199097, "rewards/rejected": -0.9598820805549622, "step": 90, "train_speed(iter/s)": 0.005503 }, { "epoch": 0.07342225359925368, "grad_norm": 5.541498184204102, "learning_rate": 0.0001997005695480824, "logits/chosen": -0.6398351788520813, "logits/rejected": -0.642162024974823, "logps/chosen": -10.117485046386719, "logps/rejected": -21.747928619384766, "loss": 0.8823437094688416, "memory(GiB)": 46.83, "nll_loss": 0.47223997116088867, "rewards/accuracies": 0.75, "rewards/chosen": -0.04489222913980484, "rewards/margins": 1.1613836288452148, "rewards/rejected": -1.2062758207321167, "step": 91, "train_speed(iter/s)": 0.005504 }, { "epoch": 0.07422909155089383, "grad_norm": 2.0107967853546143, "learning_rate": 0.000199679574356407, "logits/chosen": -0.6938130855560303, "logits/rejected": -0.7009856104850769, "logps/chosen": -6.915675163269043, "logps/rejected": -28.84608268737793, "loss": 0.5776476860046387, "memory(GiB)": 46.83, "nll_loss": 0.3677330017089844, "rewards/accuracies": 1.0, "rewards/chosen": 0.3187498152256012, "rewards/margins": 1.8727707862854004, "rewards/rejected": -1.554020881652832, "step": 92, "train_speed(iter/s)": 0.005502 }, { "epoch": 0.07503592950253397, "grad_norm": 3.5870676040649414, "learning_rate": 0.0001996578690104061, "logits/chosen": -0.673453688621521, "logits/rejected": -0.676167905330658, "logps/chosen": -10.7222318649292, "logps/rejected": -28.77056884765625, "loss": 0.950826108455658, "memory(GiB)": 46.83, "nll_loss": 0.5682229399681091, "rewards/accuracies": 0.8125, "rewards/chosen": 0.09744307398796082, "rewards/margins": 1.4789444208145142, "rewards/rejected": -1.381501317024231, "step": 93, "train_speed(iter/s)": 0.005502 }, { "epoch": 0.07584276745417412, "grad_norm": 4.2534661293029785, "learning_rate": 0.00019963545366471653, "logits/chosen": -0.6709739565849304, "logits/rejected": -0.6747978925704956, "logps/chosen": -8.219854354858398, "logps/rejected": -29.13772201538086, "loss": 0.6954976320266724, "memory(GiB)": 46.83, "nll_loss": 0.35414204001426697, "rewards/accuracies": 0.8125, "rewards/chosen": 0.10512235760688782, "rewards/margins": 1.6458101272583008, "rewards/rejected": -1.5406877994537354, "step": 94, "train_speed(iter/s)": 0.005503 }, { "epoch": 0.07664960540581428, "grad_norm": 7.663514614105225, "learning_rate": 0.0001996123284790336, "logits/chosen": -0.6834441423416138, "logits/rejected": -0.6848198771476746, "logps/chosen": -17.666513442993164, "logps/rejected": -19.222387313842773, "loss": 1.197723388671875, "memory(GiB)": 46.83, "nll_loss": 0.6848238110542297, "rewards/accuracies": 0.84375, "rewards/chosen": -0.06468406319618225, "rewards/margins": 0.8658308982849121, "rewards/rejected": -0.9305148720741272, "step": 95, "train_speed(iter/s)": 0.005502 }, { "epoch": 0.07745644335745443, "grad_norm": 16.187767028808594, "learning_rate": 0.0001995884936181097, "logits/chosen": -0.7171504497528076, "logits/rejected": -0.7210450172424316, "logps/chosen": -4.8772172927856445, "logps/rejected": -27.164329528808594, "loss": 0.7958053946495056, "memory(GiB)": 46.83, "nll_loss": 0.437197208404541, "rewards/accuracies": 0.875, "rewards/chosen": 0.04156189411878586, "rewards/margins": 1.4321556091308594, "rewards/rejected": -1.3905936479568481, "step": 96, "train_speed(iter/s)": 0.005502 }, { "epoch": 0.07826328130909457, "grad_norm": 4.373692989349365, "learning_rate": 0.00019956394925175328, "logits/chosen": -0.720712423324585, "logits/rejected": -0.7263769507408142, "logps/chosen": -8.969646453857422, "logps/rejected": -27.35487174987793, "loss": 0.8684384822845459, "memory(GiB)": 46.83, "nll_loss": 0.4593147337436676, "rewards/accuracies": 0.78125, "rewards/chosen": 0.039580605924129486, "rewards/margins": 1.404889702796936, "rewards/rejected": -1.3653091192245483, "step": 97, "train_speed(iter/s)": 0.005502 }, { "epoch": 0.07907011926073473, "grad_norm": 3.1712353229522705, "learning_rate": 0.00019953869555482752, "logits/chosen": -0.6926038265228271, "logits/rejected": -0.6906510591506958, "logps/chosen": -10.361411094665527, "logps/rejected": -19.763336181640625, "loss": 1.0741034746170044, "memory(GiB)": 46.83, "nll_loss": 0.5404018759727478, "rewards/accuracies": 0.75, "rewards/chosen": 0.0025314167141914368, "rewards/margins": 0.9160726070404053, "rewards/rejected": -0.9135411381721497, "step": 98, "train_speed(iter/s)": 0.005502 }, { "epoch": 0.07987695721237488, "grad_norm": 5.8308796882629395, "learning_rate": 0.00019951273270724906, "logits/chosen": -0.6417246460914612, "logits/rejected": -0.6460192203521729, "logps/chosen": -10.923144340515137, "logps/rejected": -23.332698822021484, "loss": 1.129643201828003, "memory(GiB)": 46.83, "nll_loss": 0.5929185748100281, "rewards/accuracies": 0.78125, "rewards/chosen": -0.004452264867722988, "rewards/margins": 0.6838414669036865, "rewards/rejected": -0.6882937550544739, "step": 99, "train_speed(iter/s)": 0.005503 }, { "epoch": 0.08068379516401503, "grad_norm": 4.135215759277344, "learning_rate": 0.00019948606089398698, "logits/chosen": -0.6685535907745361, "logits/rejected": -0.6693455576896667, "logps/chosen": -11.88547134399414, "logps/rejected": -19.97165298461914, "loss": 0.9190454483032227, "memory(GiB)": 46.83, "nll_loss": 0.39345046877861023, "rewards/accuracies": 0.59375, "rewards/chosen": 0.05392542481422424, "rewards/margins": 0.8620406985282898, "rewards/rejected": -0.8081153035163879, "step": 100, "train_speed(iter/s)": 0.005503 }, { "epoch": 0.08149063311565517, "grad_norm": 3.957230806350708, "learning_rate": 0.0001994586803050611, "logits/chosen": -0.6953858137130737, "logits/rejected": -0.6939084529876709, "logps/chosen": -11.101150512695312, "logps/rejected": -19.7403621673584, "loss": 1.0100737810134888, "memory(GiB)": 46.83, "nll_loss": 0.45983725786209106, "rewards/accuracies": 0.65625, "rewards/chosen": 0.061330053955316544, "rewards/margins": 0.847295880317688, "rewards/rejected": -0.7859657406806946, "step": 101, "train_speed(iter/s)": 0.005498 }, { "epoch": 0.08229747106729533, "grad_norm": 2.8322761058807373, "learning_rate": 0.00019943059113554097, "logits/chosen": -0.6899937987327576, "logits/rejected": -0.6942430734634399, "logps/chosen": -8.74088191986084, "logps/rejected": -20.522974014282227, "loss": 0.8782400488853455, "memory(GiB)": 46.83, "nll_loss": 0.3525587320327759, "rewards/accuracies": 0.8125, "rewards/chosen": 0.05973733961582184, "rewards/margins": 0.882931113243103, "rewards/rejected": -0.8231937289237976, "step": 102, "train_speed(iter/s)": 0.005498 }, { "epoch": 0.08310430901893548, "grad_norm": 2.8728346824645996, "learning_rate": 0.00019940179358554424, "logits/chosen": -0.6615633964538574, "logits/rejected": -0.6650048494338989, "logps/chosen": -8.035341262817383, "logps/rejected": -13.233177185058594, "loss": 0.95281982421875, "memory(GiB)": 46.83, "nll_loss": 0.39267757534980774, "rewards/accuracies": 0.71875, "rewards/chosen": 0.12954209744930267, "rewards/margins": 0.4833866357803345, "rewards/rejected": -0.3538445234298706, "step": 103, "train_speed(iter/s)": 0.005496 }, { "epoch": 0.08391114697057563, "grad_norm": 2.8015527725219727, "learning_rate": 0.00019937228786023542, "logits/chosen": -0.6321871280670166, "logits/rejected": -0.6367396116256714, "logps/chosen": -9.781261444091797, "logps/rejected": -18.408084869384766, "loss": 0.9027690887451172, "memory(GiB)": 46.83, "nll_loss": 0.4244646430015564, "rewards/accuracies": 0.84375, "rewards/chosen": 0.18980520963668823, "rewards/margins": 0.7434633374214172, "rewards/rejected": -0.5536580681800842, "step": 104, "train_speed(iter/s)": 0.005498 }, { "epoch": 0.08471798492221577, "grad_norm": 3.581929922103882, "learning_rate": 0.00019934207416982415, "logits/chosen": -0.6718648076057434, "logits/rejected": -0.6737468242645264, "logps/chosen": -10.535398483276367, "logps/rejected": -15.517889022827148, "loss": 0.9467408657073975, "memory(GiB)": 46.83, "nll_loss": 0.4431319832801819, "rewards/accuracies": 0.84375, "rewards/chosen": 0.24101108312606812, "rewards/margins": 0.5848699808120728, "rewards/rejected": -0.34385889768600464, "step": 105, "train_speed(iter/s)": 0.005496 }, { "epoch": 0.08552482287385593, "grad_norm": 2.7180511951446533, "learning_rate": 0.00019931115272956405, "logits/chosen": -0.6360980272293091, "logits/rejected": -0.6395881175994873, "logps/chosen": -5.562260627746582, "logps/rejected": -16.978702545166016, "loss": 0.9048807621002197, "memory(GiB)": 46.83, "nll_loss": 0.3790769577026367, "rewards/accuracies": 0.71875, "rewards/chosen": 0.1927444040775299, "rewards/margins": 0.6174324750900269, "rewards/rejected": -0.42468804121017456, "step": 106, "train_speed(iter/s)": 0.005495 }, { "epoch": 0.08633166082549608, "grad_norm": 2.7166309356689453, "learning_rate": 0.00019927952375975094, "logits/chosen": -0.6151095628738403, "logits/rejected": -0.6214062571525574, "logps/chosen": -8.704106330871582, "logps/rejected": -15.980009078979492, "loss": 0.9614640474319458, "memory(GiB)": 46.83, "nll_loss": 0.41800737380981445, "rewards/accuracies": 0.71875, "rewards/chosen": 0.22499363124370575, "rewards/margins": 0.5540027618408203, "rewards/rejected": -0.32900911569595337, "step": 107, "train_speed(iter/s)": 0.005495 }, { "epoch": 0.08713849877713623, "grad_norm": 3.3143904209136963, "learning_rate": 0.00019924718748572136, "logits/chosen": -0.6602830290794373, "logits/rejected": -0.6590928435325623, "logps/chosen": -14.48482608795166, "logps/rejected": -13.489812850952148, "loss": 1.1007349491119385, "memory(GiB)": 46.83, "nll_loss": 0.38938888907432556, "rewards/accuracies": 0.5625, "rewards/chosen": -0.005462644621729851, "rewards/margins": 0.18356555700302124, "rewards/rejected": -0.18902820348739624, "step": 108, "train_speed(iter/s)": 0.005493 }, { "epoch": 0.08794533672877639, "grad_norm": 3.3967649936676025, "learning_rate": 0.00019921414413785095, "logits/chosen": -0.6139819025993347, "logits/rejected": -0.6160064935684204, "logps/chosen": -10.462146759033203, "logps/rejected": -13.9368896484375, "loss": 1.1163440942764282, "memory(GiB)": 46.83, "nll_loss": 0.5643093585968018, "rewards/accuracies": 0.625, "rewards/chosen": 0.13518843054771423, "rewards/margins": 0.5490553379058838, "rewards/rejected": -0.41386690735816956, "step": 109, "train_speed(iter/s)": 0.005493 }, { "epoch": 0.08875217468041653, "grad_norm": 2.125051498413086, "learning_rate": 0.00019918039395155278, "logits/chosen": -0.5581845641136169, "logits/rejected": -0.5609419345855713, "logps/chosen": -8.664159774780273, "logps/rejected": -16.96472930908203, "loss": 0.8410020470619202, "memory(GiB)": 46.83, "nll_loss": 0.3336779773235321, "rewards/accuracies": 0.75, "rewards/chosen": 0.24867044389247894, "rewards/margins": 0.6479009985923767, "rewards/rejected": -0.3992305099964142, "step": 110, "train_speed(iter/s)": 0.005494 }, { "epoch": 0.08955901263205668, "grad_norm": 2.7272698879241943, "learning_rate": 0.00019914593716727574, "logits/chosen": -0.640306830406189, "logits/rejected": -0.6392278075218201, "logps/chosen": -10.320524215698242, "logps/rejected": -15.357645034790039, "loss": 0.9050614237785339, "memory(GiB)": 46.83, "nll_loss": 0.3744095265865326, "rewards/accuracies": 0.78125, "rewards/chosen": 0.228946715593338, "rewards/margins": 0.46916335821151733, "rewards/rejected": -0.24021662771701813, "step": 111, "train_speed(iter/s)": 0.005492 }, { "epoch": 0.09036585058369682, "grad_norm": 2.552009344100952, "learning_rate": 0.0001991107740305027, "logits/chosen": -0.6064003109931946, "logits/rejected": -0.607029914855957, "logps/chosen": -10.730403900146484, "logps/rejected": -20.569438934326172, "loss": 0.9093858003616333, "memory(GiB)": 46.83, "nll_loss": 0.4844813346862793, "rewards/accuracies": 0.84375, "rewards/chosen": 0.320293128490448, "rewards/margins": 0.8029977083206177, "rewards/rejected": -0.48270460963249207, "step": 112, "train_speed(iter/s)": 0.005492 }, { "epoch": 0.09117268853533698, "grad_norm": 2.875828742980957, "learning_rate": 0.00019907490479174902, "logits/chosen": -0.6465886831283569, "logits/rejected": -0.6483381986618042, "logps/chosen": -6.758854389190674, "logps/rejected": -20.76754379272461, "loss": 0.7010505199432373, "memory(GiB)": 46.83, "nll_loss": 0.29428812861442566, "rewards/accuracies": 0.875, "rewards/chosen": 0.3071742653846741, "rewards/margins": 1.1479661464691162, "rewards/rejected": -0.8407919406890869, "step": 113, "train_speed(iter/s)": 0.005491 }, { "epoch": 0.09197952648697713, "grad_norm": 2.3188178539276123, "learning_rate": 0.00019903832970656038, "logits/chosen": -0.6288142800331116, "logits/rejected": -0.6315409541130066, "logps/chosen": -8.855584144592285, "logps/rejected": -20.421592712402344, "loss": 0.841801106929779, "memory(GiB)": 46.83, "nll_loss": 0.38135236501693726, "rewards/accuracies": 0.8125, "rewards/chosen": 0.19283419847488403, "rewards/margins": 0.8724038004875183, "rewards/rejected": -0.6795696020126343, "step": 114, "train_speed(iter/s)": 0.005492 }, { "epoch": 0.09278636443861728, "grad_norm": 3.3676164150238037, "learning_rate": 0.00019900104903551133, "logits/chosen": -0.6541582345962524, "logits/rejected": -0.6580868363380432, "logps/chosen": -8.595276832580566, "logps/rejected": -24.14297866821289, "loss": 0.7960852980613708, "memory(GiB)": 46.83, "nll_loss": 0.4363185465335846, "rewards/accuracies": 0.875, "rewards/chosen": 0.10038560628890991, "rewards/margins": 1.4183127880096436, "rewards/rejected": -1.3179271221160889, "step": 115, "train_speed(iter/s)": 0.005493 }, { "epoch": 0.09359320239025744, "grad_norm": 3.721660614013672, "learning_rate": 0.00019896306304420324, "logits/chosen": -0.6533216834068298, "logits/rejected": -0.6518760919570923, "logps/chosen": -9.710081100463867, "logps/rejected": -20.333324432373047, "loss": 0.842086911201477, "memory(GiB)": 46.83, "nll_loss": 0.38858363032341003, "rewards/accuracies": 0.75, "rewards/chosen": 0.1398862600326538, "rewards/margins": 1.0419015884399414, "rewards/rejected": -0.9020152688026428, "step": 116, "train_speed(iter/s)": 0.005494 }, { "epoch": 0.09440004034189758, "grad_norm": 4.8206281661987305, "learning_rate": 0.0001989243720032624, "logits/chosen": -0.7102867364883423, "logits/rejected": -0.712573230266571, "logps/chosen": -14.843620300292969, "logps/rejected": -23.658788681030273, "loss": 1.1279860734939575, "memory(GiB)": 46.83, "nll_loss": 0.5651426315307617, "rewards/accuracies": 0.78125, "rewards/chosen": -0.09467095881700516, "rewards/margins": 0.9923723340034485, "rewards/rejected": -1.087043285369873, "step": 117, "train_speed(iter/s)": 0.005494 }, { "epoch": 0.09520687829353773, "grad_norm": 3.194643020629883, "learning_rate": 0.00019888497618833815, "logits/chosen": -0.6824992895126343, "logits/rejected": -0.6856632232666016, "logps/chosen": -7.8865065574646, "logps/rejected": -22.186447143554688, "loss": 0.8166104555130005, "memory(GiB)": 46.83, "nll_loss": 0.3872619867324829, "rewards/accuracies": 0.8125, "rewards/chosen": 0.1935729682445526, "rewards/margins": 1.2844107151031494, "rewards/rejected": -1.090837836265564, "step": 118, "train_speed(iter/s)": 0.005494 }, { "epoch": 0.09601371624517788, "grad_norm": 5.332725524902344, "learning_rate": 0.00019884487588010092, "logits/chosen": -0.6963211894035339, "logits/rejected": -0.695375382900238, "logps/chosen": -12.522785186767578, "logps/rejected": -21.899364471435547, "loss": 1.200064778327942, "memory(GiB)": 46.83, "nll_loss": 0.5619924068450928, "rewards/accuracies": 0.625, "rewards/chosen": -0.2353927493095398, "rewards/margins": 0.7032212018966675, "rewards/rejected": -0.9386140704154968, "step": 119, "train_speed(iter/s)": 0.005493 }, { "epoch": 0.09682055419681804, "grad_norm": 3.189750909805298, "learning_rate": 0.0001988040713642402, "logits/chosen": -0.7008529305458069, "logits/rejected": -0.7020596265792847, "logps/chosen": -7.352071285247803, "logps/rejected": -26.472599029541016, "loss": 0.6796355843544006, "memory(GiB)": 46.83, "nll_loss": 0.30471816658973694, "rewards/accuracies": 0.84375, "rewards/chosen": 0.0883897989988327, "rewards/margins": 1.43672513961792, "rewards/rejected": -1.3483351469039917, "step": 120, "train_speed(iter/s)": 0.005494 }, { "epoch": 0.09762739214845818, "grad_norm": 3.5756847858428955, "learning_rate": 0.00019876256293146257, "logits/chosen": -0.6855241060256958, "logits/rejected": -0.6870216131210327, "logps/chosen": -9.13197135925293, "logps/rejected": -25.256893157958984, "loss": 0.9965449571609497, "memory(GiB)": 46.83, "nll_loss": 0.5001046061515808, "rewards/accuracies": 0.78125, "rewards/chosen": 0.036015622317790985, "rewards/margins": 1.1710847616195679, "rewards/rejected": -1.1350692510604858, "step": 121, "train_speed(iter/s)": 0.005494 }, { "epoch": 0.09843423010009833, "grad_norm": 2.60425066947937, "learning_rate": 0.0001987203508774895, "logits/chosen": -0.7040928602218628, "logits/rejected": -0.7042312026023865, "logps/chosen": -8.471722602844238, "logps/rejected": -26.018938064575195, "loss": 0.8459987640380859, "memory(GiB)": 46.83, "nll_loss": 0.4736276865005493, "rewards/accuracies": 0.875, "rewards/chosen": 0.24268555641174316, "rewards/margins": 1.318163514137268, "rewards/rejected": -1.075477957725525, "step": 122, "train_speed(iter/s)": 0.005493 }, { "epoch": 0.09924106805173849, "grad_norm": 4.30864143371582, "learning_rate": 0.0001986774355030553, "logits/chosen": -0.6747640371322632, "logits/rejected": -0.677899956703186, "logps/chosen": -14.706789016723633, "logps/rejected": -16.56774139404297, "loss": 1.2364513874053955, "memory(GiB)": 46.83, "nll_loss": 0.6511675119400024, "rewards/accuracies": 0.71875, "rewards/chosen": 0.08759675920009613, "rewards/margins": 0.6008309721946716, "rewards/rejected": -0.5132341384887695, "step": 123, "train_speed(iter/s)": 0.005492 }, { "epoch": 0.10004790600337864, "grad_norm": 6.867242813110352, "learning_rate": 0.00019863381711390508, "logits/chosen": -0.6869674324989319, "logits/rejected": -0.6902846693992615, "logps/chosen": -7.829675197601318, "logps/rejected": -20.095809936523438, "loss": 1.043180227279663, "memory(GiB)": 46.83, "nll_loss": 0.530769944190979, "rewards/accuracies": 0.71875, "rewards/chosen": 0.11925126612186432, "rewards/margins": 0.697571337223053, "rewards/rejected": -0.5783200860023499, "step": 124, "train_speed(iter/s)": 0.005491 }, { "epoch": 0.10085474395501878, "grad_norm": 3.041438579559326, "learning_rate": 0.0001985894960207925, "logits/chosen": -0.6505750417709351, "logits/rejected": -0.6511614918708801, "logps/chosen": -9.314833641052246, "logps/rejected": -27.15659523010254, "loss": 0.7252060174942017, "memory(GiB)": 46.83, "nll_loss": 0.39295029640197754, "rewards/accuracies": 0.96875, "rewards/chosen": 0.24510648846626282, "rewards/margins": 1.2805438041687012, "rewards/rejected": -1.0354374647140503, "step": 125, "train_speed(iter/s)": 0.005491 }, { "epoch": 0.10166158190665893, "grad_norm": 2.509321689605713, "learning_rate": 0.00019854447253947743, "logits/chosen": -0.6497823596000671, "logits/rejected": -0.6492441892623901, "logps/chosen": -8.02572250366211, "logps/rejected": -20.3783016204834, "loss": 0.7982934713363647, "memory(GiB)": 46.83, "nll_loss": 0.33212146162986755, "rewards/accuracies": 0.78125, "rewards/chosen": 0.17764505743980408, "rewards/margins": 0.8625535368919373, "rewards/rejected": -0.6849085092544556, "step": 126, "train_speed(iter/s)": 0.005489 }, { "epoch": 0.10246841985829909, "grad_norm": 3.6529700756073, "learning_rate": 0.0001984987469907239, "logits/chosen": -0.6466098427772522, "logits/rejected": -0.6480077505111694, "logps/chosen": -9.548334121704102, "logps/rejected": -16.65062141418457, "loss": 0.914322555065155, "memory(GiB)": 46.83, "nll_loss": 0.4001502990722656, "rewards/accuracies": 0.75, "rewards/chosen": 0.1684979647397995, "rewards/margins": 0.6629449129104614, "rewards/rejected": -0.49444690346717834, "step": 127, "train_speed(iter/s)": 0.005491 }, { "epoch": 0.10327525780993924, "grad_norm": 3.3696913719177246, "learning_rate": 0.00019845231970029773, "logits/chosen": -0.679688572883606, "logits/rejected": -0.6820145845413208, "logps/chosen": -10.874924659729004, "logps/rejected": -24.826372146606445, "loss": 0.9800686240196228, "memory(GiB)": 46.83, "nll_loss": 0.4543137848377228, "rewards/accuracies": 0.8125, "rewards/chosen": -0.048351842910051346, "rewards/margins": 0.8677961230278015, "rewards/rejected": -0.9161479473114014, "step": 128, "train_speed(iter/s)": 0.00549 }, { "epoch": 0.10408209576157938, "grad_norm": 2.5419607162475586, "learning_rate": 0.00019840519099896414, "logits/chosen": -0.6618849039077759, "logits/rejected": -0.6671789288520813, "logps/chosen": -8.426337242126465, "logps/rejected": -25.797517776489258, "loss": 0.6974806189537048, "memory(GiB)": 46.83, "nll_loss": 0.2836017608642578, "rewards/accuracies": 0.84375, "rewards/chosen": 0.18303632736206055, "rewards/margins": 1.1003562211990356, "rewards/rejected": -0.9173198938369751, "step": 129, "train_speed(iter/s)": 0.005491 }, { "epoch": 0.10488893371321953, "grad_norm": 3.4203388690948486, "learning_rate": 0.00019835736122248557, "logits/chosen": -0.6606203317642212, "logits/rejected": -0.6571654677391052, "logps/chosen": -14.509614944458008, "logps/rejected": -15.079629898071289, "loss": 1.101165771484375, "memory(GiB)": 46.83, "nll_loss": 0.5219094157218933, "rewards/accuracies": 0.75, "rewards/chosen": 0.07395613193511963, "rewards/margins": 0.5427431464195251, "rewards/rejected": -0.46878698468208313, "step": 130, "train_speed(iter/s)": 0.005492 }, { "epoch": 0.10569577166485969, "grad_norm": 2.7750000953674316, "learning_rate": 0.00019830883071161908, "logits/chosen": -0.7152451276779175, "logits/rejected": -0.7131951451301575, "logps/chosen": -9.166630744934082, "logps/rejected": -19.46819305419922, "loss": 0.7933439016342163, "memory(GiB)": 46.83, "nll_loss": 0.3753884732723236, "rewards/accuracies": 0.78125, "rewards/chosen": 0.26774072647094727, "rewards/margins": 1.0882644653320312, "rewards/rejected": -0.8205236196517944, "step": 131, "train_speed(iter/s)": 0.005492 }, { "epoch": 0.10650260961649984, "grad_norm": 3.1810927391052246, "learning_rate": 0.00019825959981211407, "logits/chosen": -0.714146614074707, "logits/rejected": -0.7095440626144409, "logps/chosen": -11.571531295776367, "logps/rejected": -14.685908317565918, "loss": 0.8970522880554199, "memory(GiB)": 46.83, "nll_loss": 0.38512641191482544, "rewards/accuracies": 0.75, "rewards/chosen": 0.09674864262342453, "rewards/margins": 0.5926439762115479, "rewards/rejected": -0.4958953261375427, "step": 132, "train_speed(iter/s)": 0.005491 }, { "epoch": 0.10730944756813998, "grad_norm": 2.839996099472046, "learning_rate": 0.00019820966887470974, "logits/chosen": -0.7237828373908997, "logits/rejected": -0.7276051640510559, "logps/chosen": -7.241865158081055, "logps/rejected": -21.9840145111084, "loss": 0.7037227153778076, "memory(GiB)": 46.83, "nll_loss": 0.29994940757751465, "rewards/accuracies": 0.84375, "rewards/chosen": 0.18205267190933228, "rewards/margins": 1.1148442029953003, "rewards/rejected": -0.9327914714813232, "step": 133, "train_speed(iter/s)": 0.005492 }, { "epoch": 0.10811628551978014, "grad_norm": 2.8896915912628174, "learning_rate": 0.0001981590382551327, "logits/chosen": -0.796456515789032, "logits/rejected": -0.7955406308174133, "logps/chosen": -11.131935119628906, "logps/rejected": -19.525293350219727, "loss": 0.8993673920631409, "memory(GiB)": 46.83, "nll_loss": 0.4546453356742859, "rewards/accuracies": 0.8125, "rewards/chosen": 0.21719151735305786, "rewards/margins": 1.081808090209961, "rewards/rejected": -0.8646165728569031, "step": 134, "train_speed(iter/s)": 0.00549 }, { "epoch": 0.10892312347142029, "grad_norm": 3.5537540912628174, "learning_rate": 0.00019810770831409425, "logits/chosen": -0.7755017876625061, "logits/rejected": -0.7809926271438599, "logps/chosen": -7.181600093841553, "logps/rejected": -19.379724502563477, "loss": 0.7135071754455566, "memory(GiB)": 46.83, "nll_loss": 0.32976531982421875, "rewards/accuracies": 0.78125, "rewards/chosen": 0.26019349694252014, "rewards/margins": 1.110938310623169, "rewards/rejected": -0.850744903087616, "step": 135, "train_speed(iter/s)": 0.005491 }, { "epoch": 0.10972996142306043, "grad_norm": 3.5955300331115723, "learning_rate": 0.00019805567941728796, "logits/chosen": -0.799392819404602, "logits/rejected": -0.8029282689094543, "logps/chosen": -9.87437629699707, "logps/rejected": -23.02663230895996, "loss": 0.9438092708587646, "memory(GiB)": 46.83, "nll_loss": 0.5196709036827087, "rewards/accuracies": 0.78125, "rewards/chosen": 0.07922995835542679, "rewards/margins": 1.070724606513977, "rewards/rejected": -0.9914946556091309, "step": 136, "train_speed(iter/s)": 0.005492 }, { "epoch": 0.11053679937470058, "grad_norm": 3.7304859161376953, "learning_rate": 0.00019800295193538704, "logits/chosen": -0.8160181641578674, "logits/rejected": -0.8219972848892212, "logps/chosen": -7.596125602722168, "logps/rejected": -20.225994110107422, "loss": 0.8485299348831177, "memory(GiB)": 46.83, "nll_loss": 0.43994730710983276, "rewards/accuracies": 0.90625, "rewards/chosen": 0.26360729336738586, "rewards/margins": 0.9658780694007874, "rewards/rejected": -0.7022708058357239, "step": 137, "train_speed(iter/s)": 0.005491 }, { "epoch": 0.11134363732634074, "grad_norm": 4.919328689575195, "learning_rate": 0.00019794952624404167, "logits/chosen": -0.7996560335159302, "logits/rejected": -0.801249623298645, "logps/chosen": -9.867749214172363, "logps/rejected": -22.316190719604492, "loss": 0.8283427357673645, "memory(GiB)": 46.83, "nll_loss": 0.4471050798892975, "rewards/accuracies": 0.84375, "rewards/chosen": 0.13889475166797638, "rewards/margins": 1.224007248878479, "rewards/rejected": -1.085112452507019, "step": 138, "train_speed(iter/s)": 0.005491 }, { "epoch": 0.11215047527798089, "grad_norm": 2.821730136871338, "learning_rate": 0.0001978954027238763, "logits/chosen": -0.818955659866333, "logits/rejected": -0.8183013796806335, "logps/chosen": -6.504258632659912, "logps/rejected": -14.602479934692383, "loss": 0.7571634650230408, "memory(GiB)": 46.83, "nll_loss": 0.29162290692329407, "rewards/accuracies": 0.71875, "rewards/chosen": 0.1784059852361679, "rewards/margins": 0.8354285955429077, "rewards/rejected": -0.6570225954055786, "step": 139, "train_speed(iter/s)": 0.005491 }, { "epoch": 0.11295731322962103, "grad_norm": 2.481306552886963, "learning_rate": 0.000197840581760487, "logits/chosen": -0.8251004219055176, "logits/rejected": -0.8243045210838318, "logps/chosen": -13.736132621765137, "logps/rejected": -17.749977111816406, "loss": 0.8052379488945007, "memory(GiB)": 46.83, "nll_loss": 0.4064967930316925, "rewards/accuracies": 0.8125, "rewards/chosen": 0.3237007260322571, "rewards/margins": 1.295701026916504, "rewards/rejected": -0.9720003008842468, "step": 140, "train_speed(iter/s)": 0.005492 }, { "epoch": 0.1137641511812612, "grad_norm": 2.695176601409912, "learning_rate": 0.00019778506374443873, "logits/chosen": -0.7545077800750732, "logits/rejected": -0.7596877813339233, "logps/chosen": -5.598147869110107, "logps/rejected": -26.760784149169922, "loss": 0.6858201026916504, "memory(GiB)": 46.83, "nll_loss": 0.3311798572540283, "rewards/accuracies": 0.84375, "rewards/chosen": 0.19224056601524353, "rewards/margins": 1.6802706718444824, "rewards/rejected": -1.488029956817627, "step": 141, "train_speed(iter/s)": 0.005493 }, { "epoch": 0.11457098913290134, "grad_norm": 2.5371341705322266, "learning_rate": 0.0001977288490712624, "logits/chosen": -0.8187113404273987, "logits/rejected": -0.8256463408470154, "logps/chosen": -9.480502128601074, "logps/rejected": -26.96666717529297, "loss": 0.6809464693069458, "memory(GiB)": 46.83, "nll_loss": 0.3261586129665375, "rewards/accuracies": 0.90625, "rewards/chosen": 0.2214924842119217, "rewards/margins": 1.2070807218551636, "rewards/rejected": -0.9855883121490479, "step": 142, "train_speed(iter/s)": 0.005493 }, { "epoch": 0.11537782708454149, "grad_norm": 3.33156681060791, "learning_rate": 0.00019767193814145226, "logits/chosen": -0.8148999214172363, "logits/rejected": -0.8154037594795227, "logps/chosen": -16.6685848236084, "logps/rejected": -16.219863891601562, "loss": 1.1351004838943481, "memory(GiB)": 46.83, "nll_loss": 0.6261444091796875, "rewards/accuracies": 0.78125, "rewards/chosen": 0.06986582279205322, "rewards/margins": 0.7546349763870239, "rewards/rejected": -0.6847692728042603, "step": 143, "train_speed(iter/s)": 0.005493 }, { "epoch": 0.11618466503618163, "grad_norm": 2.587169647216797, "learning_rate": 0.00019761433136046295, "logits/chosen": -0.7679372429847717, "logits/rejected": -0.7711334824562073, "logps/chosen": -6.84797477722168, "logps/rejected": -25.882503509521484, "loss": 0.6460772752761841, "memory(GiB)": 46.83, "nll_loss": 0.2581600844860077, "rewards/accuracies": 0.78125, "rewards/chosen": 0.25230705738067627, "rewards/margins": 1.5044541358947754, "rewards/rejected": -1.2521469593048096, "step": 144, "train_speed(iter/s)": 0.005494 }, { "epoch": 0.1169915029878218, "grad_norm": 3.816577911376953, "learning_rate": 0.00019755602913870655, "logits/chosen": -0.7486031651496887, "logits/rejected": -0.7545804977416992, "logps/chosen": -11.378320693969727, "logps/rejected": -23.90165901184082, "loss": 1.0280418395996094, "memory(GiB)": 46.83, "nll_loss": 0.5588870644569397, "rewards/accuracies": 0.84375, "rewards/chosen": 0.10084515064954758, "rewards/margins": 1.0778629779815674, "rewards/rejected": -0.9770178198814392, "step": 145, "train_speed(iter/s)": 0.005494 }, { "epoch": 0.11779834093946194, "grad_norm": 3.1183438301086426, "learning_rate": 0.00019749703189154971, "logits/chosen": -0.7663331031799316, "logits/rejected": -0.7778096199035645, "logps/chosen": -7.461820602416992, "logps/rejected": -26.446916580200195, "loss": 0.6639739274978638, "memory(GiB)": 46.83, "nll_loss": 0.28250494599342346, "rewards/accuracies": 0.78125, "rewards/chosen": 0.04964678734540939, "rewards/margins": 1.1681914329528809, "rewards/rejected": -1.1185446977615356, "step": 146, "train_speed(iter/s)": 0.005493 }, { "epoch": 0.11860517889110209, "grad_norm": 2.613725423812866, "learning_rate": 0.00019743734003931082, "logits/chosen": -0.808351993560791, "logits/rejected": -0.8136962652206421, "logps/chosen": -7.89247989654541, "logps/rejected": -23.955371856689453, "loss": 0.8511161804199219, "memory(GiB)": 46.83, "nll_loss": 0.39823463559150696, "rewards/accuracies": 0.78125, "rewards/chosen": 0.12871581315994263, "rewards/margins": 1.055700659751892, "rewards/rejected": -0.9269847869873047, "step": 147, "train_speed(iter/s)": 0.005493 }, { "epoch": 0.11941201684274225, "grad_norm": 3.0128729343414307, "learning_rate": 0.00019737695400725677, "logits/chosen": -0.7927097678184509, "logits/rejected": -0.7919667959213257, "logps/chosen": -9.877785682678223, "logps/rejected": -23.477703094482422, "loss": 0.7262363433837891, "memory(GiB)": 46.83, "nll_loss": 0.3177878260612488, "rewards/accuracies": 0.78125, "rewards/chosen": 0.12437373399734497, "rewards/margins": 1.1551289558410645, "rewards/rejected": -1.0307551622390747, "step": 148, "train_speed(iter/s)": 0.005495 }, { "epoch": 0.1202188547943824, "grad_norm": 2.5007247924804688, "learning_rate": 0.0001973158742256001, "logits/chosen": -0.815912663936615, "logits/rejected": -0.8240575194358826, "logps/chosen": -7.251335620880127, "logps/rejected": -23.904563903808594, "loss": 0.7742622494697571, "memory(GiB)": 46.83, "nll_loss": 0.3948196470737457, "rewards/accuracies": 0.8125, "rewards/chosen": 0.16877779364585876, "rewards/margins": 1.3302054405212402, "rewards/rejected": -1.1614277362823486, "step": 149, "train_speed(iter/s)": 0.005495 }, { "epoch": 0.12102569274602254, "grad_norm": 2.996128559112549, "learning_rate": 0.0001972541011294959, "logits/chosen": -0.8276554346084595, "logits/rejected": -0.832274317741394, "logps/chosen": -9.810141563415527, "logps/rejected": -24.295639038085938, "loss": 0.733322262763977, "memory(GiB)": 46.83, "nll_loss": 0.34396567940711975, "rewards/accuracies": 0.90625, "rewards/chosen": 0.03486320376396179, "rewards/margins": 1.2224383354187012, "rewards/rejected": -1.1875752210617065, "step": 150, "train_speed(iter/s)": 0.005495 }, { "epoch": 0.12183253069766269, "grad_norm": 3.6684677600860596, "learning_rate": 0.0001971916351590386, "logits/chosen": -0.8309310674667358, "logits/rejected": -0.8319404721260071, "logps/chosen": -13.512450218200684, "logps/rejected": -28.13376808166504, "loss": 0.8970531821250916, "memory(GiB)": 46.83, "nll_loss": 0.5336953997612, "rewards/accuracies": 0.84375, "rewards/chosen": -0.07107365131378174, "rewards/margins": 1.3276447057724, "rewards/rejected": -1.3987183570861816, "step": 151, "train_speed(iter/s)": 0.005492 }, { "epoch": 0.12263936864930285, "grad_norm": 3.4376490116119385, "learning_rate": 0.00019712847675925903, "logits/chosen": -0.8819084763526917, "logits/rejected": -0.8899849653244019, "logps/chosen": -9.134736061096191, "logps/rejected": -25.074691772460938, "loss": 0.7725754976272583, "memory(GiB)": 46.83, "nll_loss": 0.44169238209724426, "rewards/accuracies": 0.84375, "rewards/chosen": 0.20537638664245605, "rewards/margins": 1.4855870008468628, "rewards/rejected": -1.2802107334136963, "step": 152, "train_speed(iter/s)": 0.005492 }, { "epoch": 0.12344620660094299, "grad_norm": 5.506346225738525, "learning_rate": 0.00019706462638012105, "logits/chosen": -0.9026679992675781, "logits/rejected": -0.908703088760376, "logps/chosen": -13.740835189819336, "logps/rejected": -25.73556900024414, "loss": 1.2033629417419434, "memory(GiB)": 46.83, "nll_loss": 0.6762228608131409, "rewards/accuracies": 0.6875, "rewards/chosen": -0.11278621852397919, "rewards/margins": 1.2870286703109741, "rewards/rejected": -1.3998148441314697, "step": 153, "train_speed(iter/s)": 0.005492 }, { "epoch": 0.12425304455258314, "grad_norm": 4.886820316314697, "learning_rate": 0.00019700008447651854, "logits/chosen": -0.8641173839569092, "logits/rejected": -0.859977662563324, "logps/chosen": -13.57033634185791, "logps/rejected": -26.01408576965332, "loss": 1.2000961303710938, "memory(GiB)": 46.83, "nll_loss": 0.5635690093040466, "rewards/accuracies": 0.625, "rewards/chosen": -0.19201046228408813, "rewards/margins": 1.3229352235794067, "rewards/rejected": -1.51494562625885, "step": 154, "train_speed(iter/s)": 0.005493 }, { "epoch": 0.12505988250422329, "grad_norm": 3.3179073333740234, "learning_rate": 0.00019693485150827197, "logits/chosen": -0.8760464191436768, "logits/rejected": -0.8815669417381287, "logps/chosen": -9.239191055297852, "logps/rejected": -28.241233825683594, "loss": 0.6995830535888672, "memory(GiB)": 46.83, "nll_loss": 0.3207743167877197, "rewards/accuracies": 0.78125, "rewards/chosen": 0.1987459361553192, "rewards/margins": 1.7694886922836304, "rewards/rejected": -1.5707426071166992, "step": 155, "train_speed(iter/s)": 0.005494 }, { "epoch": 0.12586672045586345, "grad_norm": 5.6134161949157715, "learning_rate": 0.0001968689279401253, "logits/chosen": -0.8809852600097656, "logits/rejected": -0.8887759447097778, "logps/chosen": -7.534684181213379, "logps/rejected": -30.649181365966797, "loss": 1.0883609056472778, "memory(GiB)": 46.83, "nll_loss": 0.7660683393478394, "rewards/accuracies": 0.8125, "rewards/chosen": 0.2163163125514984, "rewards/margins": 1.8669637441635132, "rewards/rejected": -1.6506474018096924, "step": 156, "train_speed(iter/s)": 0.005494 }, { "epoch": 0.1266735584075036, "grad_norm": 2.5959808826446533, "learning_rate": 0.0001968023142417424, "logits/chosen": -0.8142418265342712, "logits/rejected": -0.8186179995536804, "logps/chosen": -9.635229110717773, "logps/rejected": -32.11575698852539, "loss": 0.6578619480133057, "memory(GiB)": 46.83, "nll_loss": 0.3367811441421509, "rewards/accuracies": 0.875, "rewards/chosen": 0.21614979207515717, "rewards/margins": 2.128612518310547, "rewards/rejected": -1.912462592124939, "step": 157, "train_speed(iter/s)": 0.005495 }, { "epoch": 0.12748039635914374, "grad_norm": 3.154606342315674, "learning_rate": 0.00019673501088770414, "logits/chosen": -0.8146523237228394, "logits/rejected": -0.8199130892753601, "logps/chosen": -12.74015998840332, "logps/rejected": -16.670421600341797, "loss": 0.9762111306190491, "memory(GiB)": 46.83, "nll_loss": 0.5080199837684631, "rewards/accuracies": 0.8125, "rewards/chosen": 0.18415355682373047, "rewards/margins": 0.8309141397476196, "rewards/rejected": -0.6467605233192444, "step": 158, "train_speed(iter/s)": 0.005496 }, { "epoch": 0.1282872343107839, "grad_norm": 6.67454719543457, "learning_rate": 0.00019666701835750457, "logits/chosen": -0.8286721110343933, "logits/rejected": -0.8334258794784546, "logps/chosen": -8.225419044494629, "logps/rejected": -17.38351821899414, "loss": 0.9775789380073547, "memory(GiB)": 46.83, "nll_loss": 0.5453903079032898, "rewards/accuracies": 0.78125, "rewards/chosen": 0.15067297220230103, "rewards/margins": 0.9060754776000977, "rewards/rejected": -0.7554025650024414, "step": 159, "train_speed(iter/s)": 0.005495 }, { "epoch": 0.12909407226242403, "grad_norm": 3.848874092102051, "learning_rate": 0.00019659833713554773, "logits/chosen": -0.7873284816741943, "logits/rejected": -0.7915123105049133, "logps/chosen": -10.267017364501953, "logps/rejected": -25.254423141479492, "loss": 0.8222072124481201, "memory(GiB)": 46.83, "nll_loss": 0.43752118945121765, "rewards/accuracies": 0.84375, "rewards/chosen": 0.18684861063957214, "rewards/margins": 1.191467523574829, "rewards/rejected": -1.0046190023422241, "step": 160, "train_speed(iter/s)": 0.005495 }, { "epoch": 0.1299009102140642, "grad_norm": 8.467432975769043, "learning_rate": 0.00019652896771114414, "logits/chosen": -0.7907496094703674, "logits/rejected": -0.7956827878952026, "logps/chosen": -12.749449729919434, "logps/rejected": -20.143428802490234, "loss": 1.2200610637664795, "memory(GiB)": 46.83, "nll_loss": 0.7363396883010864, "rewards/accuracies": 0.71875, "rewards/chosen": 0.01990276202559471, "rewards/margins": 0.667390763759613, "rewards/rejected": -0.647487998008728, "step": 161, "train_speed(iter/s)": 0.005495 }, { "epoch": 0.13070774816570435, "grad_norm": 3.0088865756988525, "learning_rate": 0.00019645891057850742, "logits/chosen": -0.7298374176025391, "logits/rejected": -0.732286274433136, "logps/chosen": -15.880043029785156, "logps/rejected": -24.578083038330078, "loss": 0.8190960884094238, "memory(GiB)": 46.83, "nll_loss": 0.4379112124443054, "rewards/accuracies": 0.84375, "rewards/chosen": 0.2654583156108856, "rewards/margins": 1.3646464347839355, "rewards/rejected": -1.099188208580017, "step": 162, "train_speed(iter/s)": 0.005495 }, { "epoch": 0.13151458611734448, "grad_norm": 5.012711524963379, "learning_rate": 0.00019638816623675058, "logits/chosen": -0.7988470196723938, "logits/rejected": -0.8017285466194153, "logps/chosen": -9.470846176147461, "logps/rejected": -25.236000061035156, "loss": 0.798559844493866, "memory(GiB)": 46.83, "nll_loss": 0.32053616642951965, "rewards/accuracies": 0.78125, "rewards/chosen": 0.05605325102806091, "rewards/margins": 1.3247337341308594, "rewards/rejected": -1.268680453300476, "step": 163, "train_speed(iter/s)": 0.005494 }, { "epoch": 0.13232142406898464, "grad_norm": 5.894308567047119, "learning_rate": 0.00019631673518988261, "logits/chosen": -0.7558510303497314, "logits/rejected": -0.7591589689254761, "logps/chosen": -8.896431922912598, "logps/rejected": -26.477436065673828, "loss": 0.7629649043083191, "memory(GiB)": 46.83, "nll_loss": 0.35155194997787476, "rewards/accuracies": 0.84375, "rewards/chosen": 0.04630519449710846, "rewards/margins": 1.3866008520126343, "rewards/rejected": -1.340295672416687, "step": 164, "train_speed(iter/s)": 0.005493 }, { "epoch": 0.1331282620206248, "grad_norm": 4.07641077041626, "learning_rate": 0.0001962446179468048, "logits/chosen": -0.7340226173400879, "logits/rejected": -0.7390322089195251, "logps/chosen": -7.206872463226318, "logps/rejected": -30.465621948242188, "loss": 0.7621070742607117, "memory(GiB)": 46.83, "nll_loss": 0.3923991620540619, "rewards/accuracies": 0.84375, "rewards/chosen": 0.12836496531963348, "rewards/margins": 1.729160189628601, "rewards/rejected": -1.6007951498031616, "step": 165, "train_speed(iter/s)": 0.005493 }, { "epoch": 0.13393509997226494, "grad_norm": 4.966350078582764, "learning_rate": 0.00019617181502130723, "logits/chosen": -0.7315192222595215, "logits/rejected": -0.7316710352897644, "logps/chosen": -9.406560897827148, "logps/rejected": -20.61480712890625, "loss": 0.9099687337875366, "memory(GiB)": 46.83, "nll_loss": 0.3969041705131531, "rewards/accuracies": 0.71875, "rewards/chosen": 0.084879070520401, "rewards/margins": 0.9290111064910889, "rewards/rejected": -0.844132125377655, "step": 166, "train_speed(iter/s)": 0.005493 }, { "epoch": 0.1347419379239051, "grad_norm": 2.8620102405548096, "learning_rate": 0.00019609832693206494, "logits/chosen": -0.6981790065765381, "logits/rejected": -0.6956609487533569, "logps/chosen": -11.53895092010498, "logps/rejected": -17.151912689208984, "loss": 0.7675348520278931, "memory(GiB)": 46.83, "nll_loss": 0.364923357963562, "rewards/accuracies": 0.90625, "rewards/chosen": 0.22551363706588745, "rewards/margins": 0.959013044834137, "rewards/rejected": -0.73349928855896, "step": 167, "train_speed(iter/s)": 0.005493 }, { "epoch": 0.13554877587554526, "grad_norm": 3.910537004470825, "learning_rate": 0.00019602415420263443, "logits/chosen": -0.7344207763671875, "logits/rejected": -0.7377809286117554, "logps/chosen": -9.725975036621094, "logps/rejected": -26.63901138305664, "loss": 0.9027658104896545, "memory(GiB)": 46.83, "nll_loss": 0.4818994700908661, "rewards/accuracies": 0.78125, "rewards/chosen": 0.0954769030213356, "rewards/margins": 1.3119255304336548, "rewards/rejected": -1.2164486646652222, "step": 168, "train_speed(iter/s)": 0.005494 }, { "epoch": 0.1363556138271854, "grad_norm": 2.7541050910949707, "learning_rate": 0.00019594929736144976, "logits/chosen": -0.7230939865112305, "logits/rejected": -0.7268710732460022, "logps/chosen": -6.102090835571289, "logps/rejected": -22.030675888061523, "loss": 0.8178823590278625, "memory(GiB)": 46.83, "nll_loss": 0.4109593629837036, "rewards/accuracies": 0.875, "rewards/chosen": 0.2232162207365036, "rewards/margins": 1.0571808815002441, "rewards/rejected": -0.8339645862579346, "step": 169, "train_speed(iter/s)": 0.005494 }, { "epoch": 0.13716245177882555, "grad_norm": 2.1247079372406006, "learning_rate": 0.00019587375694181888, "logits/chosen": -0.7419747114181519, "logits/rejected": -0.7435666918754578, "logps/chosen": -10.772944450378418, "logps/rejected": -17.87366485595703, "loss": 0.7673830389976501, "memory(GiB)": 46.83, "nll_loss": 0.3707871735095978, "rewards/accuracies": 0.84375, "rewards/chosen": 0.2476326823234558, "rewards/margins": 0.9303527474403381, "rewards/rejected": -0.6827200055122375, "step": 170, "train_speed(iter/s)": 0.005494 }, { "epoch": 0.1379692897304657, "grad_norm": 3.058112382888794, "learning_rate": 0.00019579753348191982, "logits/chosen": -0.7581822276115417, "logits/rejected": -0.7616063356399536, "logps/chosen": -10.94616413116455, "logps/rejected": -22.71567153930664, "loss": 0.9573794603347778, "memory(GiB)": 46.83, "nll_loss": 0.4561714828014374, "rewards/accuracies": 0.78125, "rewards/chosen": 0.10372941941022873, "rewards/margins": 0.9039929509162903, "rewards/rejected": -0.8002634644508362, "step": 171, "train_speed(iter/s)": 0.005495 }, { "epoch": 0.13877612768210584, "grad_norm": 5.104068756103516, "learning_rate": 0.00019572062752479683, "logits/chosen": -0.7440593242645264, "logits/rejected": -0.7444762587547302, "logps/chosen": -13.373594284057617, "logps/rejected": -21.11050033569336, "loss": 0.9622430801391602, "memory(GiB)": 46.83, "nll_loss": 0.6134111881256104, "rewards/accuracies": 0.90625, "rewards/chosen": 0.17188113927841187, "rewards/margins": 1.2960879802703857, "rewards/rejected": -1.1242069005966187, "step": 172, "train_speed(iter/s)": 0.005495 }, { "epoch": 0.139582965633746, "grad_norm": 3.6643261909484863, "learning_rate": 0.00019564303961835654, "logits/chosen": -0.7351651787757874, "logits/rejected": -0.7340760827064514, "logps/chosen": -13.493339538574219, "logps/rejected": -29.00867462158203, "loss": 0.8059775233268738, "memory(GiB)": 46.83, "nll_loss": 0.4561418890953064, "rewards/accuracies": 0.875, "rewards/chosen": 0.07504750788211823, "rewards/margins": 1.5861859321594238, "rewards/rejected": -1.5111385583877563, "step": 173, "train_speed(iter/s)": 0.005494 }, { "epoch": 0.14038980358538614, "grad_norm": 3.840665102005005, "learning_rate": 0.00019556477031536397, "logits/chosen": -0.7632665634155273, "logits/rejected": -0.7688808441162109, "logps/chosen": -7.488624572753906, "logps/rejected": -27.777238845825195, "loss": 0.7469439506530762, "memory(GiB)": 46.83, "nll_loss": 0.378052294254303, "rewards/accuracies": 0.84375, "rewards/chosen": 0.07338213175535202, "rewards/margins": 1.5290367603302002, "rewards/rejected": -1.4556546211242676, "step": 174, "train_speed(iter/s)": 0.005494 }, { "epoch": 0.1411966415370263, "grad_norm": 2.548142671585083, "learning_rate": 0.00019548582017343878, "logits/chosen": -0.7821887731552124, "logits/rejected": -0.7840255498886108, "logps/chosen": -9.051867485046387, "logps/rejected": -26.980369567871094, "loss": 0.6677172183990479, "memory(GiB)": 46.83, "nll_loss": 0.3486889600753784, "rewards/accuracies": 0.90625, "rewards/chosen": 0.10505867004394531, "rewards/margins": 1.3984501361846924, "rewards/rejected": -1.2933913469314575, "step": 175, "train_speed(iter/s)": 0.005494 }, { "epoch": 0.14200347948866646, "grad_norm": 3.0442428588867188, "learning_rate": 0.00019540618975505107, "logits/chosen": -0.7756679058074951, "logits/rejected": -0.7768942713737488, "logps/chosen": -9.436080932617188, "logps/rejected": -24.625957489013672, "loss": 0.7269696593284607, "memory(GiB)": 46.83, "nll_loss": 0.3957803249359131, "rewards/accuracies": 0.875, "rewards/chosen": 0.18510255217552185, "rewards/margins": 1.5727849006652832, "rewards/rejected": -1.3876824378967285, "step": 176, "train_speed(iter/s)": 0.005494 }, { "epoch": 0.1428103174403066, "grad_norm": 4.40380859375, "learning_rate": 0.00019532587962751757, "logits/chosen": -0.7868165969848633, "logits/rejected": -0.7917428016662598, "logps/chosen": -12.063282012939453, "logps/rejected": -26.304283142089844, "loss": 0.8930169343948364, "memory(GiB)": 46.83, "nll_loss": 0.5761467814445496, "rewards/accuracies": 0.875, "rewards/chosen": 0.2778218984603882, "rewards/margins": 1.7966634035110474, "rewards/rejected": -1.5188415050506592, "step": 177, "train_speed(iter/s)": 0.005495 }, { "epoch": 0.14361715539194675, "grad_norm": 6.159250259399414, "learning_rate": 0.0001952448903629974, "logits/chosen": -0.8135851621627808, "logits/rejected": -0.8196555972099304, "logps/chosen": -16.506568908691406, "logps/rejected": -26.224693298339844, "loss": 1.118604302406311, "memory(GiB)": 46.83, "nll_loss": 0.5594882965087891, "rewards/accuracies": 0.65625, "rewards/chosen": -0.20946675539016724, "rewards/margins": 1.0000211000442505, "rewards/rejected": -1.209487795829773, "step": 178, "train_speed(iter/s)": 0.005494 }, { "epoch": 0.1444239933435869, "grad_norm": 3.561173439025879, "learning_rate": 0.00019516322253848828, "logits/chosen": -0.8224231600761414, "logits/rejected": -0.8233227729797363, "logps/chosen": -8.352205276489258, "logps/rejected": -23.940982818603516, "loss": 0.7962292432785034, "memory(GiB)": 46.83, "nll_loss": 0.4265138804912567, "rewards/accuracies": 0.84375, "rewards/chosen": 0.2205028533935547, "rewards/margins": 1.6108112335205078, "rewards/rejected": -1.3903082609176636, "step": 179, "train_speed(iter/s)": 0.005496 }, { "epoch": 0.14523083129522704, "grad_norm": 3.16656756401062, "learning_rate": 0.00019508087673582205, "logits/chosen": -0.8061304688453674, "logits/rejected": -0.8118202090263367, "logps/chosen": -8.317770004272461, "logps/rejected": -26.48977279663086, "loss": 0.7722903490066528, "memory(GiB)": 46.83, "nll_loss": 0.37005698680877686, "rewards/accuracies": 0.75, "rewards/chosen": 0.028686638921499252, "rewards/margins": 1.5126442909240723, "rewards/rejected": -1.4839575290679932, "step": 180, "train_speed(iter/s)": 0.005496 }, { "epoch": 0.1460376692468672, "grad_norm": 3.15301513671875, "learning_rate": 0.00019499785354166083, "logits/chosen": -0.7916308641433716, "logits/rejected": -0.7952077984809875, "logps/chosen": -7.383344650268555, "logps/rejected": -32.59227752685547, "loss": 0.7744749784469604, "memory(GiB)": 46.83, "nll_loss": 0.4444514214992523, "rewards/accuracies": 0.84375, "rewards/chosen": 0.0771065428853035, "rewards/margins": 2.1048974990844727, "rewards/rejected": -2.0277910232543945, "step": 181, "train_speed(iter/s)": 0.005497 }, { "epoch": 0.14684450719850736, "grad_norm": 2.6223182678222656, "learning_rate": 0.00019491415354749272, "logits/chosen": -0.7739111185073853, "logits/rejected": -0.7772398591041565, "logps/chosen": -6.630223274230957, "logps/rejected": -26.15964126586914, "loss": 0.693659245967865, "memory(GiB)": 46.83, "nll_loss": 0.3340071141719818, "rewards/accuracies": 0.8125, "rewards/chosen": 0.1530786156654358, "rewards/margins": 1.5430837869644165, "rewards/rejected": -1.3900052309036255, "step": 182, "train_speed(iter/s)": 0.005497 }, { "epoch": 0.1476513451501475, "grad_norm": 2.088421106338501, "learning_rate": 0.00019482977734962753, "logits/chosen": -0.7808999419212341, "logits/rejected": -0.7902572154998779, "logps/chosen": -8.449446678161621, "logps/rejected": -31.33694076538086, "loss": 0.5712997913360596, "memory(GiB)": 46.83, "nll_loss": 0.31176620721817017, "rewards/accuracies": 0.90625, "rewards/chosen": 0.27892935276031494, "rewards/margins": 2.0656492710113525, "rewards/rejected": -1.7867200374603271, "step": 183, "train_speed(iter/s)": 0.005497 }, { "epoch": 0.14845818310178766, "grad_norm": 4.234419345855713, "learning_rate": 0.00019474472554919272, "logits/chosen": -0.8170475959777832, "logits/rejected": -0.825502872467041, "logps/chosen": -9.795135498046875, "logps/rejected": -31.384075164794922, "loss": 0.7613832354545593, "memory(GiB)": 46.83, "nll_loss": 0.3808598518371582, "rewards/accuracies": 0.875, "rewards/chosen": 0.14184550940990448, "rewards/margins": 1.434211254119873, "rewards/rejected": -1.2923656702041626, "step": 184, "train_speed(iter/s)": 0.005497 }, { "epoch": 0.1492650210534278, "grad_norm": 2.047487735748291, "learning_rate": 0.00019465899875212888, "logits/chosen": -0.794952929019928, "logits/rejected": -0.8015525937080383, "logps/chosen": -6.017518043518066, "logps/rejected": -19.722206115722656, "loss": 0.6337971091270447, "memory(GiB)": 46.83, "nll_loss": 0.28807568550109863, "rewards/accuracies": 0.90625, "rewards/chosen": 0.24735234677791595, "rewards/margins": 1.255548119544983, "rewards/rejected": -1.0081957578659058, "step": 185, "train_speed(iter/s)": 0.005497 }, { "epoch": 0.15007185900506795, "grad_norm": 3.8246495723724365, "learning_rate": 0.00019457259756918552, "logits/chosen": -0.8133244514465332, "logits/rejected": -0.8167756199836731, "logps/chosen": -10.089277267456055, "logps/rejected": -26.579971313476562, "loss": 0.7682158946990967, "memory(GiB)": 46.83, "nll_loss": 0.3842141926288605, "rewards/accuracies": 0.8125, "rewards/chosen": 0.10676907747983932, "rewards/margins": 1.6904234886169434, "rewards/rejected": -1.5836546421051025, "step": 186, "train_speed(iter/s)": 0.005497 }, { "epoch": 0.1508786969567081, "grad_norm": 4.293128490447998, "learning_rate": 0.00019448552261591687, "logits/chosen": -0.81524658203125, "logits/rejected": -0.8198854327201843, "logps/chosen": -12.067436218261719, "logps/rejected": -23.448137283325195, "loss": 0.9188786149024963, "memory(GiB)": 46.83, "nll_loss": 0.5105058550834656, "rewards/accuracies": 0.84375, "rewards/chosen": 0.23126842081546783, "rewards/margins": 1.3146940469741821, "rewards/rejected": -1.083425760269165, "step": 187, "train_speed(iter/s)": 0.005497 }, { "epoch": 0.15168553490834824, "grad_norm": 5.430900573730469, "learning_rate": 0.00019439777451267718, "logits/chosen": -0.8615626096725464, "logits/rejected": -0.8717396855354309, "logps/chosen": -12.81668472290039, "logps/rejected": -33.20039367675781, "loss": 0.8604999780654907, "memory(GiB)": 46.83, "nll_loss": 0.5934706926345825, "rewards/accuracies": 0.875, "rewards/chosen": 0.07574808597564697, "rewards/margins": 2.146501064300537, "rewards/rejected": -2.0707528591156006, "step": 188, "train_speed(iter/s)": 0.005498 }, { "epoch": 0.1524923728599884, "grad_norm": 5.0244140625, "learning_rate": 0.00019430935388461656, "logits/chosen": -0.8756387233734131, "logits/rejected": -0.8824178576469421, "logps/chosen": -9.554489135742188, "logps/rejected": -33.99430847167969, "loss": 0.7015911936759949, "memory(GiB)": 46.83, "nll_loss": 0.4163678288459778, "rewards/accuracies": 0.9375, "rewards/chosen": 0.21942490339279175, "rewards/margins": 2.339784622192383, "rewards/rejected": -2.1203596591949463, "step": 189, "train_speed(iter/s)": 0.005498 }, { "epoch": 0.15329921081162856, "grad_norm": 5.72052526473999, "learning_rate": 0.0001942202613616764, "logits/chosen": -0.8696508407592773, "logits/rejected": -0.8797045350074768, "logps/chosen": -8.161410331726074, "logps/rejected": -31.448095321655273, "loss": 0.6777075529098511, "memory(GiB)": 46.83, "nll_loss": 0.36822211742401123, "rewards/accuracies": 0.875, "rewards/chosen": 0.29191264510154724, "rewards/margins": 1.8597280979156494, "rewards/rejected": -1.5678153038024902, "step": 190, "train_speed(iter/s)": 0.005498 }, { "epoch": 0.1541060487632687, "grad_norm": 9.510895729064941, "learning_rate": 0.00019413049757858496, "logits/chosen": -0.8756559491157532, "logits/rejected": -0.8811758756637573, "logps/chosen": -9.792702674865723, "logps/rejected": -34.0648078918457, "loss": 0.8311678767204285, "memory(GiB)": 46.83, "nll_loss": 0.47524788975715637, "rewards/accuracies": 0.84375, "rewards/chosen": 0.09086283296346664, "rewards/margins": 2.250915050506592, "rewards/rejected": -2.1600520610809326, "step": 191, "train_speed(iter/s)": 0.005498 }, { "epoch": 0.15491288671490885, "grad_norm": 2.9663641452789307, "learning_rate": 0.0001940400631748528, "logits/chosen": -0.8579489588737488, "logits/rejected": -0.8665011525154114, "logps/chosen": -8.948463439941406, "logps/rejected": -39.376953125, "loss": 0.6801427602767944, "memory(GiB)": 46.83, "nll_loss": 0.4235433042049408, "rewards/accuracies": 0.875, "rewards/chosen": 0.021937131881713867, "rewards/margins": 2.60715913772583, "rewards/rejected": -2.585222005844116, "step": 192, "train_speed(iter/s)": 0.005499 }, { "epoch": 0.15571972466654901, "grad_norm": 4.202517509460449, "learning_rate": 0.0001939489587947682, "logits/chosen": -0.8559134006500244, "logits/rejected": -0.8664484620094299, "logps/chosen": -6.8310418128967285, "logps/rejected": -31.699092864990234, "loss": 0.6303547024726868, "memory(GiB)": 46.83, "nll_loss": 0.32207247614860535, "rewards/accuracies": 0.90625, "rewards/chosen": 0.2676079273223877, "rewards/margins": 2.117737293243408, "rewards/rejected": -1.8501293659210205, "step": 193, "train_speed(iter/s)": 0.005499 }, { "epoch": 0.15652656261818915, "grad_norm": 2.568023681640625, "learning_rate": 0.00019385718508739262, "logits/chosen": -0.8656299710273743, "logits/rejected": -0.8692151308059692, "logps/chosen": -8.725165367126465, "logps/rejected": -33.851287841796875, "loss": 0.7019908428192139, "memory(GiB)": 46.83, "nll_loss": 0.41890949010849, "rewards/accuracies": 0.90625, "rewards/chosen": 0.18432064354419708, "rewards/margins": 2.251908302307129, "rewards/rejected": -2.0675878524780273, "step": 194, "train_speed(iter/s)": 0.005499 }, { "epoch": 0.1573334005698293, "grad_norm": 8.88502025604248, "learning_rate": 0.000193764742706556, "logits/chosen": -0.8621362447738647, "logits/rejected": -0.8639461994171143, "logps/chosen": -11.037799835205078, "logps/rejected": -21.885807037353516, "loss": 1.035823941230774, "memory(GiB)": 46.83, "nll_loss": 0.5726286768913269, "rewards/accuracies": 0.8125, "rewards/chosen": 0.020187322050333023, "rewards/margins": 1.3119888305664062, "rewards/rejected": -1.2918013334274292, "step": 195, "train_speed(iter/s)": 0.005499 }, { "epoch": 0.15814023852146947, "grad_norm": 5.145761489868164, "learning_rate": 0.00019367163231085227, "logits/chosen": -0.8333749771118164, "logits/rejected": -0.8401883840560913, "logps/chosen": -12.062631607055664, "logps/rejected": -28.78449249267578, "loss": 0.7770197987556458, "memory(GiB)": 46.83, "nll_loss": 0.41585007309913635, "rewards/accuracies": 0.84375, "rewards/chosen": 0.08489862084388733, "rewards/margins": 1.6114108562469482, "rewards/rejected": -1.5265123844146729, "step": 196, "train_speed(iter/s)": 0.005499 }, { "epoch": 0.1589470764731096, "grad_norm": 9.907797813415527, "learning_rate": 0.00019357785456363452, "logits/chosen": -0.8024821281433105, "logits/rejected": -0.809442937374115, "logps/chosen": -10.157941818237305, "logps/rejected": -25.024654388427734, "loss": 1.1124495267868042, "memory(GiB)": 46.83, "nll_loss": 0.5751543045043945, "rewards/accuracies": 0.84375, "rewards/chosen": -0.056628137826919556, "rewards/margins": 1.3617597818374634, "rewards/rejected": -1.4183878898620605, "step": 197, "train_speed(iter/s)": 0.005499 }, { "epoch": 0.15975391442474976, "grad_norm": 5.390470027923584, "learning_rate": 0.00019348341013301014, "logits/chosen": -0.8071514368057251, "logits/rejected": -0.8174934387207031, "logps/chosen": -8.75635814666748, "logps/rejected": -33.552799224853516, "loss": 0.6396787166595459, "memory(GiB)": 46.83, "nll_loss": 0.39103907346725464, "rewards/accuracies": 0.96875, "rewards/chosen": 0.2289201021194458, "rewards/margins": 1.8501532077789307, "rewards/rejected": -1.6212331056594849, "step": 198, "train_speed(iter/s)": 0.005499 }, { "epoch": 0.1605607523763899, "grad_norm": 2.6979644298553467, "learning_rate": 0.00019338829969183644, "logits/chosen": -0.810739278793335, "logits/rejected": -0.8188509941101074, "logps/chosen": -7.122466087341309, "logps/rejected": -26.984783172607422, "loss": 0.7288452386856079, "memory(GiB)": 46.83, "nll_loss": 0.3455110192298889, "rewards/accuracies": 0.8125, "rewards/chosen": 0.12697723507881165, "rewards/margins": 1.6645798683166504, "rewards/rejected": -1.5376026630401611, "step": 199, "train_speed(iter/s)": 0.005499 }, { "epoch": 0.16136759032803005, "grad_norm": 3.698697805404663, "learning_rate": 0.00019329252391771555, "logits/chosen": -0.7774844765663147, "logits/rejected": -0.7780304551124573, "logps/chosen": -12.480424880981445, "logps/rejected": -22.409971237182617, "loss": 0.9710755944252014, "memory(GiB)": 46.83, "nll_loss": 0.5477850437164307, "rewards/accuracies": 0.84375, "rewards/chosen": 0.16317154467105865, "rewards/margins": 1.5441625118255615, "rewards/rejected": -1.380990982055664, "step": 200, "train_speed(iter/s)": 0.005498 }, { "epoch": 0.1621744282796702, "grad_norm": 2.8351235389709473, "learning_rate": 0.00019319608349298962, "logits/chosen": -0.8196174502372742, "logits/rejected": -0.8330628275871277, "logps/chosen": -7.196435928344727, "logps/rejected": -30.938335418701172, "loss": 0.6695919632911682, "memory(GiB)": 46.83, "nll_loss": 0.31925174593925476, "rewards/accuracies": 0.84375, "rewards/chosen": 0.21494938433170319, "rewards/margins": 1.952761173248291, "rewards/rejected": -1.737811803817749, "step": 201, "train_speed(iter/s)": 0.005496 }, { "epoch": 0.16298126623131035, "grad_norm": 5.542436599731445, "learning_rate": 0.0001930989791047361, "logits/chosen": -0.7954035997390747, "logits/rejected": -0.7969664335250854, "logps/chosen": -10.17538070678711, "logps/rejected": -20.19991683959961, "loss": 0.8598300218582153, "memory(GiB)": 46.83, "nll_loss": 0.46379411220550537, "rewards/accuracies": 0.9375, "rewards/chosen": 0.1660608947277069, "rewards/margins": 1.2763766050338745, "rewards/rejected": -1.1103156805038452, "step": 202, "train_speed(iter/s)": 0.005495 }, { "epoch": 0.1637881041829505, "grad_norm": 5.940423011779785, "learning_rate": 0.00019300121144476276, "logits/chosen": -0.8003661632537842, "logits/rejected": -0.8022105097770691, "logps/chosen": -7.63640022277832, "logps/rejected": -24.617435455322266, "loss": 0.8151254057884216, "memory(GiB)": 46.83, "nll_loss": 0.3810645043849945, "rewards/accuracies": 0.78125, "rewards/chosen": 0.07057296484708786, "rewards/margins": 1.2225996255874634, "rewards/rejected": -1.1520267724990845, "step": 203, "train_speed(iter/s)": 0.005496 }, { "epoch": 0.16459494213459067, "grad_norm": 2.6105964183807373, "learning_rate": 0.00019290278120960265, "logits/chosen": -0.7997848391532898, "logits/rejected": -0.805422306060791, "logps/chosen": -14.606799125671387, "logps/rejected": -31.826797485351562, "loss": 0.77715665102005, "memory(GiB)": 46.83, "nll_loss": 0.43484237790107727, "rewards/accuracies": 0.875, "rewards/chosen": 0.14822271466255188, "rewards/margins": 1.6973564624786377, "rewards/rejected": -1.5491337776184082, "step": 204, "train_speed(iter/s)": 0.005496 }, { "epoch": 0.1654017800862308, "grad_norm": 2.472439765930176, "learning_rate": 0.00019280368910050942, "logits/chosen": -0.8194397687911987, "logits/rejected": -0.8225022554397583, "logps/chosen": -11.139198303222656, "logps/rejected": -29.919803619384766, "loss": 0.6480454206466675, "memory(GiB)": 46.83, "nll_loss": 0.3610724210739136, "rewards/accuracies": 0.875, "rewards/chosen": 0.27185019850730896, "rewards/margins": 1.6965210437774658, "rewards/rejected": -1.4246705770492554, "step": 205, "train_speed(iter/s)": 0.005496 }, { "epoch": 0.16620861803787096, "grad_norm": 2.494168758392334, "learning_rate": 0.00019270393582345206, "logits/chosen": -0.7520598769187927, "logits/rejected": -0.7561833262443542, "logps/chosen": -6.9641194343566895, "logps/rejected": -28.728130340576172, "loss": 0.5702533721923828, "memory(GiB)": 46.83, "nll_loss": 0.29727238416671753, "rewards/accuracies": 0.875, "rewards/chosen": 0.28327614068984985, "rewards/margins": 1.785872220993042, "rewards/rejected": -1.5025960206985474, "step": 206, "train_speed(iter/s)": 0.005497 }, { "epoch": 0.16701545598951112, "grad_norm": 4.714883327484131, "learning_rate": 0.00019260352208910997, "logits/chosen": -0.8163325786590576, "logits/rejected": -0.8220417499542236, "logps/chosen": -9.346306800842285, "logps/rejected": -24.412797927856445, "loss": 0.8744742274284363, "memory(GiB)": 46.83, "nll_loss": 0.45610249042510986, "rewards/accuracies": 0.90625, "rewards/chosen": 0.13759079575538635, "rewards/margins": 1.5552394390106201, "rewards/rejected": -1.4176486730575562, "step": 207, "train_speed(iter/s)": 0.005496 }, { "epoch": 0.16782229394115125, "grad_norm": 4.433586597442627, "learning_rate": 0.0001925024486128679, "logits/chosen": -0.7977516055107117, "logits/rejected": -0.7999525666236877, "logps/chosen": -6.685362339019775, "logps/rejected": -30.688045501708984, "loss": 0.7153071165084839, "memory(GiB)": 46.83, "nll_loss": 0.4366532862186432, "rewards/accuracies": 0.90625, "rewards/chosen": 0.29755526781082153, "rewards/margins": 2.2702927589416504, "rewards/rejected": -1.972737431526184, "step": 208, "train_speed(iter/s)": 0.005496 }, { "epoch": 0.1686291318927914, "grad_norm": 4.401594161987305, "learning_rate": 0.00019240071611481086, "logits/chosen": -0.8025681376457214, "logits/rejected": -0.8077267408370972, "logps/chosen": -13.663830757141113, "logps/rejected": -24.164400100708008, "loss": 1.104232668876648, "memory(GiB)": 46.83, "nll_loss": 0.6018862724304199, "rewards/accuracies": 0.78125, "rewards/chosen": 0.03685776889324188, "rewards/margins": 1.151037573814392, "rewards/rejected": -1.1141799688339233, "step": 209, "train_speed(iter/s)": 0.005497 }, { "epoch": 0.16943596984443154, "grad_norm": 4.337040424346924, "learning_rate": 0.00019229832531971895, "logits/chosen": -0.7619237899780273, "logits/rejected": -0.7677690982818604, "logps/chosen": -9.870525360107422, "logps/rejected": -29.796783447265625, "loss": 0.7632872462272644, "memory(GiB)": 46.83, "nll_loss": 0.44924822449684143, "rewards/accuracies": 0.84375, "rewards/chosen": 0.225393608212471, "rewards/margins": 1.9376754760742188, "rewards/rejected": -1.7122818231582642, "step": 210, "train_speed(iter/s)": 0.005496 }, { "epoch": 0.1702428077960717, "grad_norm": 3.420403480529785, "learning_rate": 0.00019219527695706225, "logits/chosen": -0.8083672523498535, "logits/rejected": -0.8105168342590332, "logps/chosen": -11.423739433288574, "logps/rejected": -28.65767478942871, "loss": 0.821802020072937, "memory(GiB)": 46.83, "nll_loss": 0.4434516131877899, "rewards/accuracies": 0.84375, "rewards/chosen": -0.02067011035978794, "rewards/margins": 1.7222641706466675, "rewards/rejected": -1.742934226989746, "step": 211, "train_speed(iter/s)": 0.005496 }, { "epoch": 0.17104964574771186, "grad_norm": 3.6967742443084717, "learning_rate": 0.0001920915717609956, "logits/chosen": -0.7133735418319702, "logits/rejected": -0.7154325246810913, "logps/chosen": -10.63201904296875, "logps/rejected": -32.25654220581055, "loss": 0.787774384021759, "memory(GiB)": 46.83, "nll_loss": 0.4298105239868164, "rewards/accuracies": 0.8125, "rewards/chosen": 0.11374176293611526, "rewards/margins": 1.7497272491455078, "rewards/rejected": -1.6359853744506836, "step": 212, "train_speed(iter/s)": 0.005496 }, { "epoch": 0.171856483699352, "grad_norm": 2.264280319213867, "learning_rate": 0.00019198721047035332, "logits/chosen": -0.7573313117027283, "logits/rejected": -0.7648686766624451, "logps/chosen": -6.39276123046875, "logps/rejected": -36.62308883666992, "loss": 0.5318189859390259, "memory(GiB)": 46.83, "nll_loss": 0.290658563375473, "rewards/accuracies": 0.90625, "rewards/chosen": 0.29253923892974854, "rewards/margins": 2.4327423572540283, "rewards/rejected": -2.1402029991149902, "step": 213, "train_speed(iter/s)": 0.005496 }, { "epoch": 0.17266332165099216, "grad_norm": 5.493023872375488, "learning_rate": 0.00019188219382864404, "logits/chosen": -0.7108193039894104, "logits/rejected": -0.7183860540390015, "logps/chosen": -9.189270973205566, "logps/rejected": -31.597461700439453, "loss": 0.7931143045425415, "memory(GiB)": 46.83, "nll_loss": 0.416747510433197, "rewards/accuracies": 0.90625, "rewards/chosen": 0.12628071010112762, "rewards/margins": 2.070514440536499, "rewards/rejected": -1.944233775138855, "step": 214, "train_speed(iter/s)": 0.005496 }, { "epoch": 0.17347015960263232, "grad_norm": 4.492797374725342, "learning_rate": 0.00019177652258404537, "logits/chosen": -0.6989372968673706, "logits/rejected": -0.7087696194648743, "logps/chosen": -8.885594367980957, "logps/rejected": -34.03559112548828, "loss": 0.6859308481216431, "memory(GiB)": 46.83, "nll_loss": 0.3817839026451111, "rewards/accuracies": 0.90625, "rewards/chosen": 0.28730612993240356, "rewards/margins": 2.0253334045410156, "rewards/rejected": -1.7380273342132568, "step": 215, "train_speed(iter/s)": 0.005495 }, { "epoch": 0.17427699755427245, "grad_norm": 3.6368393898010254, "learning_rate": 0.00019167019748939846, "logits/chosen": -0.6883965134620667, "logits/rejected": -0.6965335607528687, "logps/chosen": -10.925715446472168, "logps/rejected": -27.23555564880371, "loss": 0.8080936074256897, "memory(GiB)": 46.83, "nll_loss": 0.4929322898387909, "rewards/accuracies": 0.875, "rewards/chosen": 0.2524645924568176, "rewards/margins": 1.5861448049545288, "rewards/rejected": -1.333680272102356, "step": 216, "train_speed(iter/s)": 0.005495 }, { "epoch": 0.1750838355059126, "grad_norm": 5.671794414520264, "learning_rate": 0.00019156321930220282, "logits/chosen": -0.691314160823822, "logits/rejected": -0.6934138536453247, "logps/chosen": -9.144570350646973, "logps/rejected": -25.588308334350586, "loss": 0.662991464138031, "memory(GiB)": 46.83, "nll_loss": 0.3658694326877594, "rewards/accuracies": 0.9375, "rewards/chosen": 0.18018078804016113, "rewards/margins": 1.5743441581726074, "rewards/rejected": -1.3941633701324463, "step": 217, "train_speed(iter/s)": 0.005495 }, { "epoch": 0.17589067345755277, "grad_norm": 2.1973373889923096, "learning_rate": 0.00019145558878461082, "logits/chosen": -0.6576846241950989, "logits/rejected": -0.6600756049156189, "logps/chosen": -6.376984596252441, "logps/rejected": -29.26129150390625, "loss": 0.6061776280403137, "memory(GiB)": 46.83, "nll_loss": 0.2504776120185852, "rewards/accuracies": 0.75, "rewards/chosen": 0.19691388309001923, "rewards/margins": 1.7360740900039673, "rewards/rejected": -1.5391600131988525, "step": 218, "train_speed(iter/s)": 0.005494 }, { "epoch": 0.1766975114091929, "grad_norm": 2.812636137008667, "learning_rate": 0.0001913473067034222, "logits/chosen": -0.6517618298530579, "logits/rejected": -0.6520282626152039, "logps/chosen": -8.633819580078125, "logps/rejected": -33.03736877441406, "loss": 0.6993431448936462, "memory(GiB)": 46.83, "nll_loss": 0.29945075511932373, "rewards/accuracies": 0.75, "rewards/chosen": 0.11881062388420105, "rewards/margins": 2.108510971069336, "rewards/rejected": -1.9897003173828125, "step": 219, "train_speed(iter/s)": 0.005495 }, { "epoch": 0.17750434936083306, "grad_norm": 7.618241786956787, "learning_rate": 0.00019123837383007883, "logits/chosen": -0.644814133644104, "logits/rejected": -0.6507334113121033, "logps/chosen": -13.946501731872559, "logps/rejected": -32.865543365478516, "loss": 1.0418133735656738, "memory(GiB)": 46.83, "nll_loss": 0.7301790714263916, "rewards/accuracies": 0.84375, "rewards/chosen": 0.10093473643064499, "rewards/margins": 2.085968017578125, "rewards/rejected": -1.9850331544876099, "step": 220, "train_speed(iter/s)": 0.005495 }, { "epoch": 0.17831118731247322, "grad_norm": 4.556211948394775, "learning_rate": 0.0001911287909406589, "logits/chosen": -0.6804370880126953, "logits/rejected": -0.6847546696662903, "logps/chosen": -12.122690200805664, "logps/rejected": -36.90291976928711, "loss": 0.6899932622909546, "memory(GiB)": 46.83, "nll_loss": 0.3899839520454407, "rewards/accuracies": 0.96875, "rewards/chosen": 0.09739936888217926, "rewards/margins": 2.288754940032959, "rewards/rejected": -2.1913557052612305, "step": 221, "train_speed(iter/s)": 0.005495 }, { "epoch": 0.17911802526411336, "grad_norm": 6.417980194091797, "learning_rate": 0.00019101855881587166, "logits/chosen": -0.7121025919914246, "logits/rejected": -0.7198390364646912, "logps/chosen": -10.071988105773926, "logps/rejected": -30.89111328125, "loss": 1.0868934392929077, "memory(GiB)": 46.83, "nll_loss": 0.7049968242645264, "rewards/accuracies": 0.84375, "rewards/chosen": 0.059290315955877304, "rewards/margins": 2.18007755279541, "rewards/rejected": -2.1207873821258545, "step": 222, "train_speed(iter/s)": 0.005495 }, { "epoch": 0.17992486321575352, "grad_norm": 3.5655276775360107, "learning_rate": 0.00019090767824105173, "logits/chosen": -0.7064835429191589, "logits/rejected": -0.7118909358978271, "logps/chosen": -9.299367904663086, "logps/rejected": -33.5615234375, "loss": 0.5532280802726746, "memory(GiB)": 46.83, "nll_loss": 0.3098145127296448, "rewards/accuracies": 0.90625, "rewards/chosen": 0.1762467920780182, "rewards/margins": 2.1976656913757324, "rewards/rejected": -2.0214192867279053, "step": 223, "train_speed(iter/s)": 0.005495 }, { "epoch": 0.18073170116739365, "grad_norm": 3.168497085571289, "learning_rate": 0.00019079615000615352, "logits/chosen": -0.7555636763572693, "logits/rejected": -0.7638076543807983, "logps/chosen": -6.343996524810791, "logps/rejected": -35.11958694458008, "loss": 0.544819712638855, "memory(GiB)": 46.83, "nll_loss": 0.2573380768299103, "rewards/accuracies": 0.9375, "rewards/chosen": 0.08291390538215637, "rewards/margins": 2.359328269958496, "rewards/rejected": -2.276414394378662, "step": 224, "train_speed(iter/s)": 0.005495 }, { "epoch": 0.1815385391190338, "grad_norm": 3.8726441860198975, "learning_rate": 0.00019068397490574563, "logits/chosen": -0.7438031435012817, "logits/rejected": -0.7529388070106506, "logps/chosen": -7.913335800170898, "logps/rejected": -42.34702682495117, "loss": 0.6369010210037231, "memory(GiB)": 46.83, "nll_loss": 0.40800100564956665, "rewards/accuracies": 0.90625, "rewards/chosen": 0.10036337375640869, "rewards/margins": 2.888615131378174, "rewards/rejected": -2.7882518768310547, "step": 225, "train_speed(iter/s)": 0.005496 }, { "epoch": 0.18234537707067397, "grad_norm": 3.78493595123291, "learning_rate": 0.00019057115373900514, "logits/chosen": -0.6967946290969849, "logits/rejected": -0.7004595994949341, "logps/chosen": -10.167012214660645, "logps/rejected": -32.77048873901367, "loss": 0.6220114231109619, "memory(GiB)": 46.83, "nll_loss": 0.351274311542511, "rewards/accuracies": 0.9375, "rewards/chosen": 0.23287636041641235, "rewards/margins": 2.1248767375946045, "rewards/rejected": -1.8920003175735474, "step": 226, "train_speed(iter/s)": 0.005495 }, { "epoch": 0.1831522150223141, "grad_norm": 4.551224231719971, "learning_rate": 0.00019045768730971196, "logits/chosen": -0.7525245547294617, "logits/rejected": -0.7602270841598511, "logps/chosen": -7.277904987335205, "logps/rejected": -39.11262130737305, "loss": 0.49062812328338623, "memory(GiB)": 46.83, "nll_loss": 0.24764156341552734, "rewards/accuracies": 0.90625, "rewards/chosen": 0.2196008712053299, "rewards/margins": 2.6062889099121094, "rewards/rejected": -2.386688232421875, "step": 227, "train_speed(iter/s)": 0.005495 }, { "epoch": 0.18395905297395426, "grad_norm": 3.352492094039917, "learning_rate": 0.00019034357642624313, "logits/chosen": -0.7168059349060059, "logits/rejected": -0.7239040732383728, "logps/chosen": -14.352468490600586, "logps/rejected": -43.02729415893555, "loss": 0.9112517833709717, "memory(GiB)": 46.83, "nll_loss": 0.6249459981918335, "rewards/accuracies": 0.875, "rewards/chosen": -0.11119358241558075, "rewards/margins": 2.6521291732788086, "rewards/rejected": -2.7633233070373535, "step": 228, "train_speed(iter/s)": 0.005495 }, { "epoch": 0.18476589092559442, "grad_norm": 9.10729694366455, "learning_rate": 0.00019022882190156693, "logits/chosen": -0.7800168991088867, "logits/rejected": -0.7834780216217041, "logps/chosen": -6.645830154418945, "logps/rejected": -37.247894287109375, "loss": 0.6339117288589478, "memory(GiB)": 46.83, "nll_loss": 0.3112393617630005, "rewards/accuracies": 0.84375, "rewards/chosen": 0.1333404928445816, "rewards/margins": 2.6678478717803955, "rewards/rejected": -2.5345070362091064, "step": 229, "train_speed(iter/s)": 0.005495 }, { "epoch": 0.18557272887723456, "grad_norm": 8.036460876464844, "learning_rate": 0.0001901134245532372, "logits/chosen": -0.7188634276390076, "logits/rejected": -0.7256328463554382, "logps/chosen": -8.977944374084473, "logps/rejected": -39.439598083496094, "loss": 0.7736544609069824, "memory(GiB)": 46.83, "nll_loss": 0.40554046630859375, "rewards/accuracies": 0.78125, "rewards/chosen": 0.07693760097026825, "rewards/margins": 2.647231101989746, "rewards/rejected": -2.570293426513672, "step": 230, "train_speed(iter/s)": 0.005495 }, { "epoch": 0.18637956682887472, "grad_norm": 14.515076637268066, "learning_rate": 0.00018999738520338765, "logits/chosen": -0.7673274874687195, "logits/rejected": -0.7723326086997986, "logps/chosen": -11.787941932678223, "logps/rejected": -31.827787399291992, "loss": 1.2146649360656738, "memory(GiB)": 46.83, "nll_loss": 0.7273156642913818, "rewards/accuracies": 0.71875, "rewards/chosen": -0.19174721837043762, "rewards/margins": 1.6821880340576172, "rewards/rejected": -1.8739351034164429, "step": 231, "train_speed(iter/s)": 0.005495 }, { "epoch": 0.18718640478051488, "grad_norm": 5.435638904571533, "learning_rate": 0.00018988070467872565, "logits/chosen": -0.6913294792175293, "logits/rejected": -0.6982335448265076, "logps/chosen": -8.256817817687988, "logps/rejected": -33.933128356933594, "loss": 0.7231890559196472, "memory(GiB)": 46.83, "nll_loss": 0.42718639969825745, "rewards/accuracies": 0.84375, "rewards/chosen": 0.2676782011985779, "rewards/margins": 2.2451353073120117, "rewards/rejected": -1.977457046508789, "step": 232, "train_speed(iter/s)": 0.005495 }, { "epoch": 0.187993242732155, "grad_norm": 4.923380374908447, "learning_rate": 0.00018976338381052662, "logits/chosen": -0.6979964971542358, "logits/rejected": -0.6987626552581787, "logps/chosen": -9.278888702392578, "logps/rejected": -31.988529205322266, "loss": 0.7011741399765015, "memory(GiB)": 46.83, "nll_loss": 0.3678920269012451, "rewards/accuracies": 0.875, "rewards/chosen": 0.17272722721099854, "rewards/margins": 2.0346527099609375, "rewards/rejected": -1.8619252443313599, "step": 233, "train_speed(iter/s)": 0.005495 }, { "epoch": 0.18880008068379517, "grad_norm": 5.102010250091553, "learning_rate": 0.00018964542343462802, "logits/chosen": -0.7147118449211121, "logits/rejected": -0.7210678458213806, "logps/chosen": -11.869325637817383, "logps/rejected": -26.554332733154297, "loss": 0.7859650254249573, "memory(GiB)": 46.83, "nll_loss": 0.4002649784088135, "rewards/accuracies": 0.8125, "rewards/chosen": 0.16828711330890656, "rewards/margins": 1.6456825733184814, "rewards/rejected": -1.4773954153060913, "step": 234, "train_speed(iter/s)": 0.005495 }, { "epoch": 0.1896069186354353, "grad_norm": 2.8259975910186768, "learning_rate": 0.0001895268243914234, "logits/chosen": -0.7181320786476135, "logits/rejected": -0.7195937633514404, "logps/chosen": -9.674834251403809, "logps/rejected": -26.982505798339844, "loss": 0.7054999470710754, "memory(GiB)": 46.83, "nll_loss": 0.3795202672481537, "rewards/accuracies": 0.84375, "rewards/chosen": 0.19310441613197327, "rewards/margins": 1.8784090280532837, "rewards/rejected": -1.6853046417236328, "step": 235, "train_speed(iter/s)": 0.005494 }, { "epoch": 0.19041375658707546, "grad_norm": 2.970991373062134, "learning_rate": 0.0001894075875258564, "logits/chosen": -0.7360837459564209, "logits/rejected": -0.7415453195571899, "logps/chosen": -7.354928493499756, "logps/rejected": -26.934494018554688, "loss": 0.7415454983711243, "memory(GiB)": 46.83, "nll_loss": 0.37382036447525024, "rewards/accuracies": 0.71875, "rewards/chosen": 0.24830269813537598, "rewards/margins": 1.7458440065383911, "rewards/rejected": -1.4975413084030151, "step": 236, "train_speed(iter/s)": 0.005494 }, { "epoch": 0.19122059453871562, "grad_norm": 2.9580154418945312, "learning_rate": 0.00018928771368741475, "logits/chosen": -0.6901527643203735, "logits/rejected": -0.6940097808837891, "logps/chosen": -7.6646575927734375, "logps/rejected": -28.092966079711914, "loss": 0.7272118330001831, "memory(GiB)": 46.83, "nll_loss": 0.4050924777984619, "rewards/accuracies": 0.875, "rewards/chosen": 0.22855332493782043, "rewards/margins": 1.7601354122161865, "rewards/rejected": -1.531581997871399, "step": 237, "train_speed(iter/s)": 0.005494 }, { "epoch": 0.19202743249035575, "grad_norm": 5.010228633880615, "learning_rate": 0.00018916720373012426, "logits/chosen": -0.7200859785079956, "logits/rejected": -0.7226930260658264, "logps/chosen": -10.032082557678223, "logps/rejected": -19.060348510742188, "loss": 0.8445019125938416, "memory(GiB)": 46.83, "nll_loss": 0.42176133394241333, "rewards/accuracies": 0.8125, "rewards/chosen": 0.18809281289577484, "rewards/margins": 1.2276759147644043, "rewards/rejected": -1.0395830869674683, "step": 238, "train_speed(iter/s)": 0.005495 }, { "epoch": 0.19283427044199591, "grad_norm": 8.475236892700195, "learning_rate": 0.0001890460585125426, "logits/chosen": -0.7142471075057983, "logits/rejected": -0.7235907912254333, "logps/chosen": -6.3985443115234375, "logps/rejected": -33.978721618652344, "loss": 0.6591022610664368, "memory(GiB)": 46.83, "nll_loss": 0.43263474106788635, "rewards/accuracies": 0.9375, "rewards/chosen": 0.22361797094345093, "rewards/margins": 2.1702280044555664, "rewards/rejected": -1.9466102123260498, "step": 239, "train_speed(iter/s)": 0.005495 }, { "epoch": 0.19364110839363607, "grad_norm": 3.6248912811279297, "learning_rate": 0.00018892427889775332, "logits/chosen": -0.7144255638122559, "logits/rejected": -0.7168291807174683, "logps/chosen": -9.34170150756836, "logps/rejected": -30.304466247558594, "loss": 0.6725300550460815, "memory(GiB)": 46.83, "nll_loss": 0.39394479990005493, "rewards/accuracies": 0.875, "rewards/chosen": 0.13639676570892334, "rewards/margins": 1.9869462251663208, "rewards/rejected": -1.850549578666687, "step": 240, "train_speed(iter/s)": 0.005494 }, { "epoch": 0.1944479463452762, "grad_norm": 6.973753452301025, "learning_rate": 0.00018880186575335968, "logits/chosen": -0.6703215837478638, "logits/rejected": -0.6775541305541992, "logps/chosen": -12.076030731201172, "logps/rejected": -28.837940216064453, "loss": 0.7876323461532593, "memory(GiB)": 46.83, "nll_loss": 0.4970223605632782, "rewards/accuracies": 0.875, "rewards/chosen": 0.17666694521903992, "rewards/margins": 1.7176096439361572, "rewards/rejected": -1.540942668914795, "step": 241, "train_speed(iter/s)": 0.005495 }, { "epoch": 0.19525478429691637, "grad_norm": 3.2324650287628174, "learning_rate": 0.00018867881995147836, "logits/chosen": -0.7113248705863953, "logits/rejected": -0.7163888216018677, "logps/chosen": -9.168296813964844, "logps/rejected": -34.54369354248047, "loss": 0.6157009601593018, "memory(GiB)": 46.83, "nll_loss": 0.37985488772392273, "rewards/accuracies": 0.9375, "rewards/chosen": 0.28986138105392456, "rewards/margins": 2.2379894256591797, "rewards/rejected": -1.9481279850006104, "step": 242, "train_speed(iter/s)": 0.005495 }, { "epoch": 0.19606162224855653, "grad_norm": 2.7521631717681885, "learning_rate": 0.00018855514236873337, "logits/chosen": -0.7281562089920044, "logits/rejected": -0.734757661819458, "logps/chosen": -7.001053333282471, "logps/rejected": -33.900177001953125, "loss": 0.5766606330871582, "memory(GiB)": 46.83, "nll_loss": 0.3622375726699829, "rewards/accuracies": 0.9375, "rewards/chosen": 0.30857908725738525, "rewards/margins": 2.3744540214538574, "rewards/rejected": -2.0658748149871826, "step": 243, "train_speed(iter/s)": 0.005495 }, { "epoch": 0.19686846020019666, "grad_norm": 3.977639675140381, "learning_rate": 0.0001884308338862498, "logits/chosen": -0.6999315023422241, "logits/rejected": -0.7055974006652832, "logps/chosen": -8.435256004333496, "logps/rejected": -33.67347717285156, "loss": 0.590577244758606, "memory(GiB)": 46.83, "nll_loss": 0.35361507534980774, "rewards/accuracies": 0.90625, "rewards/chosen": 0.2805049419403076, "rewards/margins": 2.308706283569336, "rewards/rejected": -2.0282013416290283, "step": 244, "train_speed(iter/s)": 0.005495 }, { "epoch": 0.19767529815183682, "grad_norm": 9.163761138916016, "learning_rate": 0.00018830589538964746, "logits/chosen": -0.7660690546035767, "logits/rejected": -0.7758455276489258, "logps/chosen": -8.95065975189209, "logps/rejected": -33.142677307128906, "loss": 0.8324503302574158, "memory(GiB)": 46.83, "nll_loss": 0.42908376455307007, "rewards/accuracies": 0.84375, "rewards/chosen": 0.11282955855131149, "rewards/margins": 2.1978847980499268, "rewards/rejected": -2.085055351257324, "step": 245, "train_speed(iter/s)": 0.005495 }, { "epoch": 0.19848213610347698, "grad_norm": 4.68986701965332, "learning_rate": 0.00018818032776903466, "logits/chosen": -0.7814006805419922, "logits/rejected": -0.7920705676078796, "logps/chosen": -8.228378295898438, "logps/rejected": -46.880313873291016, "loss": 0.6729190349578857, "memory(GiB)": 46.83, "nll_loss": 0.4284536838531494, "rewards/accuracies": 0.90625, "rewards/chosen": 0.0902179628610611, "rewards/margins": 3.1966192722320557, "rewards/rejected": -3.106401205062866, "step": 246, "train_speed(iter/s)": 0.005495 }, { "epoch": 0.1992889740551171, "grad_norm": 5.915354251861572, "learning_rate": 0.00018805413191900168, "logits/chosen": -0.7995182871818542, "logits/rejected": -0.805888295173645, "logps/chosen": -12.739469528198242, "logps/rejected": -35.06949996948242, "loss": 0.7942692041397095, "memory(GiB)": 46.83, "nll_loss": 0.43145498633384705, "rewards/accuracies": 0.8125, "rewards/chosen": -0.08451483398675919, "rewards/margins": 2.140747547149658, "rewards/rejected": -2.22526216506958, "step": 247, "train_speed(iter/s)": 0.005495 }, { "epoch": 0.20009581200675727, "grad_norm": 7.71060848236084, "learning_rate": 0.00018792730873861473, "logits/chosen": -0.8068017363548279, "logits/rejected": -0.8110726475715637, "logps/chosen": -11.049007415771484, "logps/rejected": -39.38182067871094, "loss": 0.8510176539421082, "memory(GiB)": 46.83, "nll_loss": 0.4571390151977539, "rewards/accuracies": 0.84375, "rewards/chosen": -0.20343750715255737, "rewards/margins": 2.1684627532958984, "rewards/rejected": -2.3719000816345215, "step": 248, "train_speed(iter/s)": 0.005496 }, { "epoch": 0.2009026499583974, "grad_norm": 9.637003898620605, "learning_rate": 0.00018779985913140924, "logits/chosen": -0.7676049470901489, "logits/rejected": -0.7769947648048401, "logps/chosen": -8.674398422241211, "logps/rejected": -48.47040557861328, "loss": 0.9282071590423584, "memory(GiB)": 46.83, "nll_loss": 0.6683814525604248, "rewards/accuracies": 0.9375, "rewards/chosen": -0.20568305253982544, "rewards/margins": 3.0397698879241943, "rewards/rejected": -3.245452642440796, "step": 249, "train_speed(iter/s)": 0.005496 }, { "epoch": 0.20170948791003757, "grad_norm": 8.807076454162598, "learning_rate": 0.0001876717840053836, "logits/chosen": -0.7096577882766724, "logits/rejected": -0.7144345641136169, "logps/chosen": -17.149080276489258, "logps/rejected": -33.67993927001953, "loss": 1.056300401687622, "memory(GiB)": 46.83, "nll_loss": 0.6277230381965637, "rewards/accuracies": 0.875, "rewards/chosen": -0.030492231249809265, "rewards/margins": 2.3309168815612793, "rewards/rejected": -2.3614089488983154, "step": 250, "train_speed(iter/s)": 0.005496 }, { "epoch": 0.20251632586167773, "grad_norm": 4.773517608642578, "learning_rate": 0.00018754308427299256, "logits/chosen": -0.6819360852241516, "logits/rejected": -0.6919792294502258, "logps/chosen": -10.13283634185791, "logps/rejected": -36.599456787109375, "loss": 0.8876217007637024, "memory(GiB)": 46.83, "nll_loss": 0.47694316506385803, "rewards/accuracies": 0.90625, "rewards/chosen": -0.12443971633911133, "rewards/margins": 2.1682839393615723, "rewards/rejected": -2.2927236557006836, "step": 251, "train_speed(iter/s)": 0.005494 }, { "epoch": 0.20332316381331786, "grad_norm": 4.1274027824401855, "learning_rate": 0.00018741376085114087, "logits/chosen": -0.7192296981811523, "logits/rejected": -0.7263290882110596, "logps/chosen": -16.484987258911133, "logps/rejected": -34.811126708984375, "loss": 0.8948942422866821, "memory(GiB)": 46.83, "nll_loss": 0.5631111860275269, "rewards/accuracies": 0.875, "rewards/chosen": 0.20992696285247803, "rewards/margins": 2.0608201026916504, "rewards/rejected": -1.8508930206298828, "step": 252, "train_speed(iter/s)": 0.005494 }, { "epoch": 0.20413000176495802, "grad_norm": 4.913299560546875, "learning_rate": 0.0001872838146611766, "logits/chosen": -0.6601164937019348, "logits/rejected": -0.6605373620986938, "logps/chosen": -12.14169979095459, "logps/rejected": -26.232892990112305, "loss": 0.8705669045448303, "memory(GiB)": 46.83, "nll_loss": 0.4974067509174347, "rewards/accuracies": 0.75, "rewards/chosen": 0.2535248100757599, "rewards/margins": 1.8131681680679321, "rewards/rejected": -1.5596435070037842, "step": 253, "train_speed(iter/s)": 0.005495 }, { "epoch": 0.20493683971659818, "grad_norm": 2.4414825439453125, "learning_rate": 0.0001871532466288847, "logits/chosen": -0.6655547618865967, "logits/rejected": -0.6710434556007385, "logps/chosen": -7.641450881958008, "logps/rejected": -27.024456024169922, "loss": 0.5410662293434143, "memory(GiB)": 46.83, "nll_loss": 0.2969762682914734, "rewards/accuracies": 0.96875, "rewards/chosen": 0.2998022437095642, "rewards/margins": 1.8008990287780762, "rewards/rejected": -1.5010967254638672, "step": 254, "train_speed(iter/s)": 0.005495 }, { "epoch": 0.2057436776682383, "grad_norm": 9.875016212463379, "learning_rate": 0.0001870220576844804, "logits/chosen": -0.6554844379425049, "logits/rejected": -0.6586723923683167, "logps/chosen": -10.128920555114746, "logps/rejected": -28.380104064941406, "loss": 1.077211856842041, "memory(GiB)": 46.83, "nll_loss": 0.703222930431366, "rewards/accuracies": 0.84375, "rewards/chosen": 0.11552818864583969, "rewards/margins": 1.8149248361587524, "rewards/rejected": -1.6993966102600098, "step": 255, "train_speed(iter/s)": 0.005495 }, { "epoch": 0.20655051561987847, "grad_norm": 2.7163054943084717, "learning_rate": 0.0001868902487626024, "logits/chosen": -0.725955605506897, "logits/rejected": -0.7319348454475403, "logps/chosen": -6.896210193634033, "logps/rejected": -30.118925094604492, "loss": 0.5430217385292053, "memory(GiB)": 46.83, "nll_loss": 0.2342616319656372, "rewards/accuracies": 0.90625, "rewards/chosen": 0.2470369040966034, "rewards/margins": 1.7953723669052124, "rewards/rejected": -1.548335313796997, "step": 256, "train_speed(iter/s)": 0.005494 }, { "epoch": 0.20735735357151863, "grad_norm": 3.3832037448883057, "learning_rate": 0.00018675782080230648, "logits/chosen": -0.6649719476699829, "logits/rejected": -0.6653549671173096, "logps/chosen": -6.564362049102783, "logps/rejected": -26.97052764892578, "loss": 0.6336417198181152, "memory(GiB)": 46.83, "nll_loss": 0.33324965834617615, "rewards/accuracies": 0.9375, "rewards/chosen": 0.07798978686332703, "rewards/margins": 1.5198760032653809, "rewards/rejected": -1.4418861865997314, "step": 257, "train_speed(iter/s)": 0.005494 }, { "epoch": 0.20816419152315876, "grad_norm": 4.554774761199951, "learning_rate": 0.00018662477474705864, "logits/chosen": -0.6891136169433594, "logits/rejected": -0.7018118500709534, "logps/chosen": -10.358716011047363, "logps/rejected": -33.35871124267578, "loss": 0.944884181022644, "memory(GiB)": 46.83, "nll_loss": 0.515121579170227, "rewards/accuracies": 0.75, "rewards/chosen": 0.15751619637012482, "rewards/margins": 1.947699785232544, "rewards/rejected": -1.790183663368225, "step": 258, "train_speed(iter/s)": 0.005494 }, { "epoch": 0.20897102947479892, "grad_norm": 6.9074788093566895, "learning_rate": 0.00018649111154472842, "logits/chosen": -0.6972513794898987, "logits/rejected": -0.7002527117729187, "logps/chosen": -9.99314022064209, "logps/rejected": -20.69109344482422, "loss": 1.1074203252792358, "memory(GiB)": 46.83, "nll_loss": 0.6453499794006348, "rewards/accuracies": 0.84375, "rewards/chosen": 0.05247223377227783, "rewards/margins": 1.2508971691131592, "rewards/rejected": -1.1984249353408813, "step": 259, "train_speed(iter/s)": 0.005494 }, { "epoch": 0.20977786742643906, "grad_norm": 6.223460674285889, "learning_rate": 0.00018635683214758214, "logits/chosen": -0.7319504022598267, "logits/rejected": -0.7356070280075073, "logps/chosen": -8.844853401184082, "logps/rejected": -32.97547912597656, "loss": 0.7976398468017578, "memory(GiB)": 46.83, "nll_loss": 0.425577849149704, "rewards/accuracies": 0.84375, "rewards/chosen": 0.04917633533477783, "rewards/margins": 1.9350166320800781, "rewards/rejected": -1.8858401775360107, "step": 260, "train_speed(iter/s)": 0.005494 }, { "epoch": 0.21058470537807922, "grad_norm": 6.114218711853027, "learning_rate": 0.00018622193751227607, "logits/chosen": -0.7542300820350647, "logits/rejected": -0.7576084733009338, "logps/chosen": -5.740233898162842, "logps/rejected": -24.60858917236328, "loss": 0.5687559247016907, "memory(GiB)": 46.83, "nll_loss": 0.27638113498687744, "rewards/accuracies": 0.875, "rewards/chosen": 0.23254472017288208, "rewards/margins": 1.7274789810180664, "rewards/rejected": -1.49493408203125, "step": 261, "train_speed(iter/s)": 0.005495 }, { "epoch": 0.21139154332971938, "grad_norm": 3.313537836074829, "learning_rate": 0.00018608642859984978, "logits/chosen": -0.8011643886566162, "logits/rejected": -0.803293764591217, "logps/chosen": -9.771310806274414, "logps/rejected": -28.634235382080078, "loss": 0.7911385893821716, "memory(GiB)": 46.83, "nll_loss": 0.41166451573371887, "rewards/accuracies": 0.84375, "rewards/chosen": 0.265075147151947, "rewards/margins": 2.063453197479248, "rewards/rejected": -1.7983779907226562, "step": 262, "train_speed(iter/s)": 0.005494 }, { "epoch": 0.2121983812813595, "grad_norm": 3.156975746154785, "learning_rate": 0.00018595030637571906, "logits/chosen": -0.7707415223121643, "logits/rejected": -0.7777128219604492, "logps/chosen": -10.236924171447754, "logps/rejected": -30.459064483642578, "loss": 0.6563097238540649, "memory(GiB)": 46.83, "nll_loss": 0.3598516285419464, "rewards/accuracies": 0.90625, "rewards/chosen": 0.24525853991508484, "rewards/margins": 2.071570873260498, "rewards/rejected": -1.82631254196167, "step": 263, "train_speed(iter/s)": 0.005494 }, { "epoch": 0.21300521923299967, "grad_norm": 4.330559730529785, "learning_rate": 0.00018581357180966925, "logits/chosen": -0.8070797920227051, "logits/rejected": -0.8171977400779724, "logps/chosen": -9.34181022644043, "logps/rejected": -32.88754653930664, "loss": 0.8858993053436279, "memory(GiB)": 46.83, "nll_loss": 0.49547457695007324, "rewards/accuracies": 0.78125, "rewards/chosen": 0.15189547836780548, "rewards/margins": 1.979980230331421, "rewards/rejected": -1.828084945678711, "step": 264, "train_speed(iter/s)": 0.005494 }, { "epoch": 0.21381205718463983, "grad_norm": 5.864645957946777, "learning_rate": 0.00018567622587584818, "logits/chosen": -0.7768454551696777, "logits/rejected": -0.781791090965271, "logps/chosen": -8.989236831665039, "logps/rejected": -33.998809814453125, "loss": 0.748650848865509, "memory(GiB)": 46.83, "nll_loss": 0.46606677770614624, "rewards/accuracies": 0.90625, "rewards/chosen": 0.22831673920154572, "rewards/margins": 2.1091978549957275, "rewards/rejected": -1.8808808326721191, "step": 265, "train_speed(iter/s)": 0.005495 }, { "epoch": 0.21461889513627996, "grad_norm": 8.510169982910156, "learning_rate": 0.00018553826955275936, "logits/chosen": -0.8200643062591553, "logits/rejected": -0.8230538368225098, "logps/chosen": -14.249617576599121, "logps/rejected": -25.856830596923828, "loss": 1.2568143606185913, "memory(GiB)": 46.83, "nll_loss": 0.629042387008667, "rewards/accuracies": 0.78125, "rewards/chosen": -0.19409911334514618, "rewards/margins": 1.33782160282135, "rewards/rejected": -1.5319206714630127, "step": 266, "train_speed(iter/s)": 0.005494 }, { "epoch": 0.21542573308792012, "grad_norm": 3.2720420360565186, "learning_rate": 0.00018539970382325482, "logits/chosen": -0.8381865620613098, "logits/rejected": -0.8415036201477051, "logps/chosen": -7.8104567527771, "logps/rejected": -31.601917266845703, "loss": 0.5837196111679077, "memory(GiB)": 46.83, "nll_loss": 0.24857257306575775, "rewards/accuracies": 0.84375, "rewards/chosen": 0.14021825790405273, "rewards/margins": 2.0099189281463623, "rewards/rejected": -1.8697006702423096, "step": 267, "train_speed(iter/s)": 0.005494 }, { "epoch": 0.21623257103956028, "grad_norm": 3.4341468811035156, "learning_rate": 0.00018526052967452836, "logits/chosen": -0.7830556631088257, "logits/rejected": -0.7897158265113831, "logps/chosen": -11.684428215026855, "logps/rejected": -36.22364044189453, "loss": 0.7827985882759094, "memory(GiB)": 46.83, "nll_loss": 0.48799192905426025, "rewards/accuracies": 0.90625, "rewards/chosen": 0.08203143626451492, "rewards/margins": 1.9769901037216187, "rewards/rejected": -1.89495849609375, "step": 268, "train_speed(iter/s)": 0.005494 }, { "epoch": 0.21703940899120042, "grad_norm": 3.692969799041748, "learning_rate": 0.00018512074809810833, "logits/chosen": -0.7967461347579956, "logits/rejected": -0.7945878505706787, "logps/chosen": -10.929898262023926, "logps/rejected": -23.94034194946289, "loss": 0.7881439924240112, "memory(GiB)": 46.83, "nll_loss": 0.3369988203048706, "rewards/accuracies": 0.71875, "rewards/chosen": 0.08296848833560944, "rewards/margins": 1.621280550956726, "rewards/rejected": -1.5383120775222778, "step": 269, "train_speed(iter/s)": 0.005494 }, { "epoch": 0.21784624694284058, "grad_norm": 6.830929756164551, "learning_rate": 0.00018498036008985058, "logits/chosen": -0.746848464012146, "logits/rejected": -0.7509756684303284, "logps/chosen": -9.608593940734863, "logps/rejected": -38.34101867675781, "loss": 0.7576542496681213, "memory(GiB)": 46.83, "nll_loss": 0.4260023534297943, "rewards/accuracies": 0.78125, "rewards/chosen": 0.09650997817516327, "rewards/margins": 2.168517589569092, "rewards/rejected": -2.072007656097412, "step": 270, "train_speed(iter/s)": 0.005494 }, { "epoch": 0.21865308489448074, "grad_norm": 4.689668655395508, "learning_rate": 0.0001848393666499315, "logits/chosen": -0.7876875996589661, "logits/rejected": -0.796357274055481, "logps/chosen": -12.614479064941406, "logps/rejected": -27.662067413330078, "loss": 0.9168095588684082, "memory(GiB)": 46.83, "nll_loss": 0.52295982837677, "rewards/accuracies": 0.84375, "rewards/chosen": 0.0025606881827116013, "rewards/margins": 1.4409575462341309, "rewards/rejected": -1.43839693069458, "step": 271, "train_speed(iter/s)": 0.005494 }, { "epoch": 0.21945992284612087, "grad_norm": 5.61292028427124, "learning_rate": 0.00018469776878284072, "logits/chosen": -0.7697591781616211, "logits/rejected": -0.775164008140564, "logps/chosen": -5.527304649353027, "logps/rejected": -25.911758422851562, "loss": 0.7468432188034058, "memory(GiB)": 46.83, "nll_loss": 0.32815924286842346, "rewards/accuracies": 0.75, "rewards/chosen": 0.20197589695453644, "rewards/margins": 1.5008738040924072, "rewards/rejected": -1.2988977432250977, "step": 272, "train_speed(iter/s)": 0.005495 }, { "epoch": 0.22026676079776103, "grad_norm": 2.823660373687744, "learning_rate": 0.00018455556749737403, "logits/chosen": -0.8068636059761047, "logits/rejected": -0.8074927926063538, "logps/chosen": -9.97484016418457, "logps/rejected": -21.8039608001709, "loss": 0.8325120210647583, "memory(GiB)": 46.83, "nll_loss": 0.4089290499687195, "rewards/accuracies": 0.84375, "rewards/chosen": 0.19321191310882568, "rewards/margins": 1.4057273864746094, "rewards/rejected": -1.2125153541564941, "step": 273, "train_speed(iter/s)": 0.005495 }, { "epoch": 0.22107359874940116, "grad_norm": 2.5285258293151855, "learning_rate": 0.00018441276380662625, "logits/chosen": -0.7656555771827698, "logits/rejected": -0.7663451433181763, "logps/chosen": -10.646867752075195, "logps/rejected": -22.98876953125, "loss": 0.7855734825134277, "memory(GiB)": 46.83, "nll_loss": 0.382598340511322, "rewards/accuracies": 0.8125, "rewards/chosen": 0.23073698580265045, "rewards/margins": 1.3868789672851562, "rewards/rejected": -1.156141996383667, "step": 274, "train_speed(iter/s)": 0.005494 }, { "epoch": 0.22188043670104132, "grad_norm": 3.1718196868896484, "learning_rate": 0.00018426935872798393, "logits/chosen": -0.6983739137649536, "logits/rejected": -0.7074112892150879, "logps/chosen": -9.201760292053223, "logps/rejected": -32.77637481689453, "loss": 0.8582974672317505, "memory(GiB)": 46.83, "nll_loss": 0.4306548535823822, "rewards/accuracies": 0.84375, "rewards/chosen": 0.09240508079528809, "rewards/margins": 1.7474827766418457, "rewards/rejected": -1.6550780534744263, "step": 275, "train_speed(iter/s)": 0.005494 }, { "epoch": 0.22268727465268148, "grad_norm": 2.530366897583008, "learning_rate": 0.00018412535328311814, "logits/chosen": -0.7532445192337036, "logits/rejected": -0.7571496963500977, "logps/chosen": -11.776863098144531, "logps/rejected": -21.776357650756836, "loss": 0.7927124500274658, "memory(GiB)": 46.83, "nll_loss": 0.3979222774505615, "rewards/accuracies": 0.875, "rewards/chosen": 0.3263438642024994, "rewards/margins": 1.1879689693450928, "rewards/rejected": -0.8616250157356262, "step": 276, "train_speed(iter/s)": 0.005494 }, { "epoch": 0.22349411260432162, "grad_norm": 2.8776495456695557, "learning_rate": 0.00018398074849797715, "logits/chosen": -0.7302210927009583, "logits/rejected": -0.7333999276161194, "logps/chosen": -8.04594612121582, "logps/rejected": -25.69329833984375, "loss": 0.8354058861732483, "memory(GiB)": 46.83, "nll_loss": 0.4014919400215149, "rewards/accuracies": 0.75, "rewards/chosen": 0.08311442285776138, "rewards/margins": 1.4473011493682861, "rewards/rejected": -1.3641867637634277, "step": 277, "train_speed(iter/s)": 0.005493 }, { "epoch": 0.22430095055596178, "grad_norm": 3.1463992595672607, "learning_rate": 0.00018383554540277923, "logits/chosen": -0.7314996719360352, "logits/rejected": -0.7379679679870605, "logps/chosen": -12.349081039428711, "logps/rejected": -30.154521942138672, "loss": 0.7297593355178833, "memory(GiB)": 46.83, "nll_loss": 0.4262910485267639, "rewards/accuracies": 0.90625, "rewards/chosen": 0.09422469139099121, "rewards/margins": 1.8524787425994873, "rewards/rejected": -1.758254051208496, "step": 278, "train_speed(iter/s)": 0.005494 }, { "epoch": 0.22510778850760194, "grad_norm": 3.694409132003784, "learning_rate": 0.00018368974503200515, "logits/chosen": -0.6736661195755005, "logits/rejected": -0.6801973581314087, "logps/chosen": -7.8128252029418945, "logps/rejected": -34.619964599609375, "loss": 0.5409353971481323, "memory(GiB)": 46.83, "nll_loss": 0.27240046858787537, "rewards/accuracies": 0.90625, "rewards/chosen": 0.14602825045585632, "rewards/margins": 2.1955599784851074, "rewards/rejected": -2.0495314598083496, "step": 279, "train_speed(iter/s)": 0.005494 }, { "epoch": 0.22591462645924207, "grad_norm": 3.1639299392700195, "learning_rate": 0.00018354334842439097, "logits/chosen": -0.6950223445892334, "logits/rejected": -0.6963911056518555, "logps/chosen": -11.003353118896484, "logps/rejected": -29.378337860107422, "loss": 0.6718952059745789, "memory(GiB)": 46.83, "nll_loss": 0.41621553897857666, "rewards/accuracies": 0.9375, "rewards/chosen": 0.2978552281856537, "rewards/margins": 2.314960479736328, "rewards/rejected": -2.0171055793762207, "step": 280, "train_speed(iter/s)": 0.005494 }, { "epoch": 0.22672146441088223, "grad_norm": 10.265737533569336, "learning_rate": 0.00018339635662292043, "logits/chosen": -0.6680774688720703, "logits/rejected": -0.6708887219429016, "logps/chosen": -9.037369728088379, "logps/rejected": -28.595491409301758, "loss": 0.7751729488372803, "memory(GiB)": 46.83, "nll_loss": 0.45015332102775574, "rewards/accuracies": 0.90625, "rewards/chosen": 0.26366156339645386, "rewards/margins": 2.183614492416382, "rewards/rejected": -1.9199527502059937, "step": 281, "train_speed(iter/s)": 0.005495 }, { "epoch": 0.2275283023625224, "grad_norm": 2.1682872772216797, "learning_rate": 0.00018324877067481783, "logits/chosen": -0.6989454627037048, "logits/rejected": -0.7062041759490967, "logps/chosen": -6.304581642150879, "logps/rejected": -36.81526565551758, "loss": 0.4870501458644867, "memory(GiB)": 46.83, "nll_loss": 0.27354732155799866, "rewards/accuracies": 0.90625, "rewards/chosen": 0.25899404287338257, "rewards/margins": 2.644915819168091, "rewards/rejected": -2.3859219551086426, "step": 282, "train_speed(iter/s)": 0.005495 }, { "epoch": 0.22833514031416252, "grad_norm": 5.862631797790527, "learning_rate": 0.00018310059163154026, "logits/chosen": -0.6766980886459351, "logits/rejected": -0.6787369847297668, "logps/chosen": -5.963343620300293, "logps/rejected": -32.693424224853516, "loss": 0.6418428421020508, "memory(GiB)": 46.83, "nll_loss": 0.36004289984703064, "rewards/accuracies": 0.875, "rewards/chosen": 0.10292582958936691, "rewards/margins": 2.3059544563293457, "rewards/rejected": -2.203028917312622, "step": 283, "train_speed(iter/s)": 0.005495 }, { "epoch": 0.22914197826580268, "grad_norm": 12.034624099731445, "learning_rate": 0.00018295182054877028, "logits/chosen": -0.6584015488624573, "logits/rejected": -0.6568421125411987, "logps/chosen": -9.409889221191406, "logps/rejected": -29.433473587036133, "loss": 0.779122531414032, "memory(GiB)": 46.83, "nll_loss": 0.4608069658279419, "rewards/accuracies": 0.8125, "rewards/chosen": 0.09724374115467072, "rewards/margins": 2.0178637504577637, "rewards/rejected": -1.920620083808899, "step": 284, "train_speed(iter/s)": 0.005495 }, { "epoch": 0.22994881621744284, "grad_norm": 2.7027676105499268, "learning_rate": 0.00018280245848640837, "logits/chosen": -0.6325287222862244, "logits/rejected": -0.638849675655365, "logps/chosen": -11.803849220275879, "logps/rejected": -34.92605209350586, "loss": 0.6200695633888245, "memory(GiB)": 46.83, "nll_loss": 0.3835636377334595, "rewards/accuracies": 0.96875, "rewards/chosen": 0.3289586305618286, "rewards/margins": 2.4051361083984375, "rewards/rejected": -2.0761775970458984, "step": 285, "train_speed(iter/s)": 0.005495 }, { "epoch": 0.23075565416908297, "grad_norm": 12.6409330368042, "learning_rate": 0.0001826525065085654, "logits/chosen": -0.6875444054603577, "logits/rejected": -0.6914835572242737, "logps/chosen": -6.616847038269043, "logps/rejected": -32.69636917114258, "loss": 0.7483028173446655, "memory(GiB)": 46.83, "nll_loss": 0.41258829832077026, "rewards/accuracies": 0.875, "rewards/chosen": 0.1584882140159607, "rewards/margins": 2.2999954223632812, "rewards/rejected": -2.141507387161255, "step": 286, "train_speed(iter/s)": 0.005495 }, { "epoch": 0.23156249212072313, "grad_norm": 11.6520357131958, "learning_rate": 0.00018250196568355488, "logits/chosen": -0.6649547219276428, "logits/rejected": -0.6693803071975708, "logps/chosen": -7.23736572265625, "logps/rejected": -35.56175994873047, "loss": 0.8851901888847351, "memory(GiB)": 46.83, "nll_loss": 0.555623471736908, "rewards/accuracies": 0.875, "rewards/chosen": 0.04522712156176567, "rewards/margins": 2.2976298332214355, "rewards/rejected": -2.2524030208587646, "step": 287, "train_speed(iter/s)": 0.005496 }, { "epoch": 0.23236933007236327, "grad_norm": 4.304396152496338, "learning_rate": 0.0001823508370838857, "logits/chosen": -0.6312321424484253, "logits/rejected": -0.6436812281608582, "logps/chosen": -5.798044204711914, "logps/rejected": -41.38832092285156, "loss": 0.4446811079978943, "memory(GiB)": 46.83, "nll_loss": 0.2366604506969452, "rewards/accuracies": 0.9375, "rewards/chosen": 0.19939535856246948, "rewards/margins": 2.506988525390625, "rewards/rejected": -2.3075931072235107, "step": 288, "train_speed(iter/s)": 0.005497 }, { "epoch": 0.23317616802400343, "grad_norm": 3.2178378105163574, "learning_rate": 0.00018219912178625406, "logits/chosen": -0.667951762676239, "logits/rejected": -0.6722462773323059, "logps/chosen": -8.273347854614258, "logps/rejected": -38.93374252319336, "loss": 0.5589238405227661, "memory(GiB)": 46.83, "nll_loss": 0.33250439167022705, "rewards/accuracies": 0.90625, "rewards/chosen": 0.24894192814826965, "rewards/margins": 2.7763476371765137, "rewards/rejected": -2.5274055004119873, "step": 289, "train_speed(iter/s)": 0.005496 }, { "epoch": 0.2339830059756436, "grad_norm": 19.13467025756836, "learning_rate": 0.0001820468208715362, "logits/chosen": -0.658998429775238, "logits/rejected": -0.6624220609664917, "logps/chosen": -10.623708724975586, "logps/rejected": -35.898441314697266, "loss": 0.8776594400405884, "memory(GiB)": 46.83, "nll_loss": 0.504928469657898, "rewards/accuracies": 0.75, "rewards/chosen": 0.03749624639749527, "rewards/margins": 2.421245813369751, "rewards/rejected": -2.3837497234344482, "step": 290, "train_speed(iter/s)": 0.005496 }, { "epoch": 0.23478984392728372, "grad_norm": 14.0836181640625, "learning_rate": 0.00018189393542478036, "logits/chosen": -0.6700485348701477, "logits/rejected": -0.6811757683753967, "logps/chosen": -13.918525695800781, "logps/rejected": -31.985313415527344, "loss": 0.8883711695671082, "memory(GiB)": 46.83, "nll_loss": 0.494065523147583, "rewards/accuracies": 0.78125, "rewards/chosen": 0.11007653176784515, "rewards/margins": 1.8538110256195068, "rewards/rejected": -1.7437344789505005, "step": 291, "train_speed(iter/s)": 0.005496 }, { "epoch": 0.23559668187892388, "grad_norm": 1.916353464126587, "learning_rate": 0.00018174046653519929, "logits/chosen": -0.6249253749847412, "logits/rejected": -0.6350105404853821, "logps/chosen": -6.613706588745117, "logps/rejected": -31.679109573364258, "loss": 0.5259463787078857, "memory(GiB)": 46.83, "nll_loss": 0.28351810574531555, "rewards/accuracies": 0.9375, "rewards/chosen": 0.37387514114379883, "rewards/margins": 2.260230302810669, "rewards/rejected": -1.8863551616668701, "step": 292, "train_speed(iter/s)": 0.005497 }, { "epoch": 0.23640351983056404, "grad_norm": 3.460676431655884, "learning_rate": 0.0001815864152961624, "logits/chosen": -0.7058864831924438, "logits/rejected": -0.7104409337043762, "logps/chosen": -9.832937240600586, "logps/rejected": -33.203758239746094, "loss": 0.7486201524734497, "memory(GiB)": 46.83, "nll_loss": 0.4414381682872772, "rewards/accuracies": 0.875, "rewards/chosen": 0.05328599363565445, "rewards/margins": 1.9007527828216553, "rewards/rejected": -1.8474667072296143, "step": 293, "train_speed(iter/s)": 0.005497 }, { "epoch": 0.23721035778220417, "grad_norm": 4.965317249298096, "learning_rate": 0.00018143178280518793, "logits/chosen": -0.6664391756057739, "logits/rejected": -0.672810971736908, "logps/chosen": -9.997623443603516, "logps/rejected": -40.18428039550781, "loss": 0.6516451239585876, "memory(GiB)": 46.83, "nll_loss": 0.40531888604164124, "rewards/accuracies": 0.875, "rewards/chosen": 0.053340502083301544, "rewards/margins": 3.017876625061035, "rewards/rejected": -2.964535713195801, "step": 294, "train_speed(iter/s)": 0.005497 }, { "epoch": 0.23801719573384433, "grad_norm": 11.654240608215332, "learning_rate": 0.00018127657016393523, "logits/chosen": -0.6823023557662964, "logits/rejected": -0.6858367919921875, "logps/chosen": -13.494540214538574, "logps/rejected": -26.149335861206055, "loss": 1.2284287214279175, "memory(GiB)": 46.83, "nll_loss": 0.7871044874191284, "rewards/accuracies": 0.875, "rewards/chosen": 0.1301741600036621, "rewards/margins": 1.65839684009552, "rewards/rejected": -1.528222680091858, "step": 295, "train_speed(iter/s)": 0.005497 }, { "epoch": 0.2388240336854845, "grad_norm": 6.048635005950928, "learning_rate": 0.00018112077847819678, "logits/chosen": -0.6762900352478027, "logits/rejected": -0.6797853708267212, "logps/chosen": -9.212943077087402, "logps/rejected": -35.503047943115234, "loss": 0.6458551287651062, "memory(GiB)": 46.83, "nll_loss": 0.4156365990638733, "rewards/accuracies": 0.90625, "rewards/chosen": 0.07666485011577606, "rewards/margins": 2.67659592628479, "rewards/rejected": -2.599931240081787, "step": 296, "train_speed(iter/s)": 0.005497 }, { "epoch": 0.23963087163712463, "grad_norm": 17.950830459594727, "learning_rate": 0.00018096440885789053, "logits/chosen": -0.7045325040817261, "logits/rejected": -0.7085095643997192, "logps/chosen": -5.067245960235596, "logps/rejected": -32.400596618652344, "loss": 0.6414408087730408, "memory(GiB)": 46.83, "nll_loss": 0.35441699624061584, "rewards/accuracies": 0.84375, "rewards/chosen": 0.19392728805541992, "rewards/margins": 2.3720614910125732, "rewards/rejected": -2.1781344413757324, "step": 297, "train_speed(iter/s)": 0.005497 }, { "epoch": 0.2404377095887648, "grad_norm": 2.869894504547119, "learning_rate": 0.00018080746241705168, "logits/chosen": -0.679808497428894, "logits/rejected": -0.681736409664154, "logps/chosen": -10.83769416809082, "logps/rejected": -28.55279541015625, "loss": 0.7392024397850037, "memory(GiB)": 46.83, "nll_loss": 0.42105916142463684, "rewards/accuracies": 0.8125, "rewards/chosen": 0.23800711333751678, "rewards/margins": 1.8557734489440918, "rewards/rejected": -1.617766261100769, "step": 298, "train_speed(iter/s)": 0.005497 }, { "epoch": 0.24124454754040492, "grad_norm": 3.0865039825439453, "learning_rate": 0.000180649940273825, "logits/chosen": -0.7064599990844727, "logits/rejected": -0.7154704928398132, "logps/chosen": -6.157724380493164, "logps/rejected": -37.746639251708984, "loss": 0.5655427575111389, "memory(GiB)": 46.83, "nll_loss": 0.30769801139831543, "rewards/accuracies": 0.875, "rewards/chosen": 0.08631336688995361, "rewards/margins": 2.3150007724761963, "rewards/rejected": -2.228687286376953, "step": 299, "train_speed(iter/s)": 0.005497 }, { "epoch": 0.24205138549204508, "grad_norm": 2.7285871505737305, "learning_rate": 0.00018049184355045677, "logits/chosen": -0.7136423587799072, "logits/rejected": -0.7151377201080322, "logps/chosen": -7.438178062438965, "logps/rejected": -25.823518753051758, "loss": 0.6484540104866028, "memory(GiB)": 46.83, "nll_loss": 0.3245176076889038, "rewards/accuracies": 0.8125, "rewards/chosen": 0.27408692240715027, "rewards/margins": 1.6197888851165771, "rewards/rejected": -1.345702052116394, "step": 300, "train_speed(iter/s)": 0.005497 }, { "epoch": 0.24205138549204508, "eval_logits/chosen": -0.7073344588279724, "eval_logits/rejected": -0.7110338807106018, "eval_logps/chosen": -9.127958297729492, "eval_logps/rejected": -32.3641242980957, "eval_loss": 0.7329411506652832, "eval_nll_loss": 0.40398380160331726, "eval_rewards/accuracies": 0.8450000286102295, "eval_rewards/chosen": 0.10664533823728561, "eval_rewards/margins": 2.0523765087127686, "eval_rewards/rejected": -1.9457309246063232, "eval_runtime": 935.6049, "eval_samples_per_second": 0.428, "eval_steps_per_second": 0.428, "step": 300 }, { "epoch": 0.24285822344368524, "grad_norm": 6.436818599700928, "learning_rate": 0.0001803331733732868, "logits/chosen": -0.6776125431060791, "logits/rejected": -0.6814741492271423, "logps/chosen": -10.345755577087402, "logps/rejected": -31.87610626220703, "loss": 1.0051960945129395, "memory(GiB)": 46.83, "nll_loss": 0.5581401586532593, "rewards/accuracies": 0.84375, "rewards/chosen": -0.17682184278964996, "rewards/margins": 1.9412140846252441, "rewards/rejected": -2.1180360317230225, "step": 301, "train_speed(iter/s)": 0.005403 }, { "epoch": 0.24366506139532537, "grad_norm": 6.0017781257629395, "learning_rate": 0.0001801739308727404, "logits/chosen": -0.7074002027511597, "logits/rejected": -0.713377058506012, "logps/chosen": -12.075335502624512, "logps/rejected": -23.198413848876953, "loss": 0.854468822479248, "memory(GiB)": 46.83, "nll_loss": 0.5477906465530396, "rewards/accuracies": 0.9375, "rewards/chosen": 0.22885334491729736, "rewards/margins": 1.5375834703445435, "rewards/rejected": -1.308730125427246, "step": 302, "train_speed(iter/s)": 0.005403 }, { "epoch": 0.24447189934696553, "grad_norm": 4.944755554199219, "learning_rate": 0.0001800141171833203, "logits/chosen": -0.6664037108421326, "logits/rejected": -0.6715153455734253, "logps/chosen": -10.99780559539795, "logps/rejected": -40.38133239746094, "loss": 1.0467002391815186, "memory(GiB)": 46.83, "nll_loss": 0.7734127640724182, "rewards/accuracies": 0.90625, "rewards/chosen": 0.23875761032104492, "rewards/margins": 2.768630027770996, "rewards/rejected": -2.529872417449951, "step": 303, "train_speed(iter/s)": 0.005404 }, { "epoch": 0.2452787372986057, "grad_norm": 13.264330863952637, "learning_rate": 0.0001798537334435986, "logits/chosen": -0.6581575870513916, "logits/rejected": -0.6663908362388611, "logps/chosen": -9.642528533935547, "logps/rejected": -34.64740753173828, "loss": 1.2485740184783936, "memory(GiB)": 46.83, "nll_loss": 0.8329651355743408, "rewards/accuracies": 0.84375, "rewards/chosen": -0.05902397632598877, "rewards/margins": 2.0006673336029053, "rewards/rejected": -2.0596914291381836, "step": 304, "train_speed(iter/s)": 0.005404 }, { "epoch": 0.24608557525024582, "grad_norm": 2.709535598754883, "learning_rate": 0.00017969278079620868, "logits/chosen": -0.6512877941131592, "logits/rejected": -0.6544854640960693, "logps/chosen": -6.917822360992432, "logps/rejected": -36.45574951171875, "loss": 0.436959445476532, "memory(GiB)": 46.83, "nll_loss": 0.23888030648231506, "rewards/accuracies": 0.96875, "rewards/chosen": 0.07531990855932236, "rewards/margins": 2.534837007522583, "rewards/rejected": -2.459517240524292, "step": 305, "train_speed(iter/s)": 0.005404 }, { "epoch": 0.24689241320188599, "grad_norm": 4.297156810760498, "learning_rate": 0.000179531260387837, "logits/chosen": -0.6876344084739685, "logits/rejected": -0.6926863789558411, "logps/chosen": -10.314577102661133, "logps/rejected": -42.0067138671875, "loss": 0.6266589164733887, "memory(GiB)": 46.83, "nll_loss": 0.405265212059021, "rewards/accuracies": 0.96875, "rewards/chosen": 0.048373833298683167, "rewards/margins": 2.6945550441741943, "rewards/rejected": -2.646181344985962, "step": 306, "train_speed(iter/s)": 0.005405 }, { "epoch": 0.24769925115352615, "grad_norm": 2.3430275917053223, "learning_rate": 0.00017936917336921492, "logits/chosen": -0.660620927810669, "logits/rejected": -0.6698962450027466, "logps/chosen": -10.098029136657715, "logps/rejected": -38.27429962158203, "loss": 0.6127811670303345, "memory(GiB)": 46.83, "nll_loss": 0.42024731636047363, "rewards/accuracies": 0.9375, "rewards/chosen": 0.12339803576469421, "rewards/margins": 2.775909423828125, "rewards/rejected": -2.6525111198425293, "step": 307, "train_speed(iter/s)": 0.005405 }, { "epoch": 0.24850608910516628, "grad_norm": 7.701032638549805, "learning_rate": 0.00017920652089511066, "logits/chosen": -0.6981559991836548, "logits/rejected": -0.7051110863685608, "logps/chosen": -12.91336441040039, "logps/rejected": -39.74778747558594, "loss": 0.7809062600135803, "memory(GiB)": 46.83, "nll_loss": 0.43491145968437195, "rewards/accuracies": 0.84375, "rewards/chosen": -0.01711910218000412, "rewards/margins": 2.6014857292175293, "rewards/rejected": -2.618604898452759, "step": 308, "train_speed(iter/s)": 0.005406 }, { "epoch": 0.24931292705680644, "grad_norm": 8.226758003234863, "learning_rate": 0.00017904330412432082, "logits/chosen": -0.6544554829597473, "logits/rejected": -0.6588922739028931, "logps/chosen": -7.886651039123535, "logps/rejected": -37.24707794189453, "loss": 0.6507235169410706, "memory(GiB)": 46.83, "nll_loss": 0.36367952823638916, "rewards/accuracies": 0.90625, "rewards/chosen": 0.008459217846393585, "rewards/margins": 2.5813100337982178, "rewards/rejected": -2.5728507041931152, "step": 309, "train_speed(iter/s)": 0.005406 }, { "epoch": 0.25011976500844657, "grad_norm": 2.985854387283325, "learning_rate": 0.00017887952421966231, "logits/chosen": -0.6596094369888306, "logits/rejected": -0.6650587916374207, "logps/chosen": -9.925427436828613, "logps/rejected": -37.92117691040039, "loss": 0.589540958404541, "memory(GiB)": 46.83, "nll_loss": 0.3470298945903778, "rewards/accuracies": 0.9375, "rewards/chosen": 0.2002800703048706, "rewards/margins": 2.7566845417022705, "rewards/rejected": -2.5564048290252686, "step": 310, "train_speed(iter/s)": 0.005406 }, { "epoch": 0.25092660296008673, "grad_norm": 8.586225509643555, "learning_rate": 0.00017871518234796412, "logits/chosen": -0.7069643139839172, "logits/rejected": -0.7040101885795593, "logps/chosen": -10.918496131896973, "logps/rejected": -22.552764892578125, "loss": 0.869647204875946, "memory(GiB)": 46.83, "nll_loss": 0.39224955439567566, "rewards/accuracies": 0.78125, "rewards/chosen": 0.07749204337596893, "rewards/margins": 1.6755130290985107, "rewards/rejected": -1.598021149635315, "step": 311, "train_speed(iter/s)": 0.005407 }, { "epoch": 0.2517334409117269, "grad_norm": 3.319561243057251, "learning_rate": 0.00017855027968005874, "logits/chosen": -0.643227756023407, "logits/rejected": -0.6550837755203247, "logps/chosen": -6.8077073097229, "logps/rejected": -39.095035552978516, "loss": 0.6082978844642639, "memory(GiB)": 46.83, "nll_loss": 0.3355411887168884, "rewards/accuracies": 0.875, "rewards/chosen": 0.21203100681304932, "rewards/margins": 2.4175777435302734, "rewards/rejected": -2.2055468559265137, "step": 312, "train_speed(iter/s)": 0.005407 }, { "epoch": 0.25254027886336705, "grad_norm": 3.8709287643432617, "learning_rate": 0.00017838481739077404, "logits/chosen": -0.6760554313659668, "logits/rejected": -0.682180643081665, "logps/chosen": -7.9441633224487305, "logps/rejected": -27.414325714111328, "loss": 0.7799100279808044, "memory(GiB)": 46.83, "nll_loss": 0.4338618814945221, "rewards/accuracies": 0.875, "rewards/chosen": 0.2233610451221466, "rewards/margins": 1.7509660720825195, "rewards/rejected": -1.5276049375534058, "step": 313, "train_speed(iter/s)": 0.005407 }, { "epoch": 0.2533471168150072, "grad_norm": 5.0154218673706055, "learning_rate": 0.00017821879665892487, "logits/chosen": -0.6456589698791504, "logits/rejected": -0.649111270904541, "logps/chosen": -9.17154312133789, "logps/rejected": -32.664093017578125, "loss": 0.6070997714996338, "memory(GiB)": 46.83, "nll_loss": 0.31872257590293884, "rewards/accuracies": 0.875, "rewards/chosen": 0.005728209391236305, "rewards/margins": 1.877259612083435, "rewards/rejected": -1.8715312480926514, "step": 314, "train_speed(iter/s)": 0.005407 }, { "epoch": 0.2541539547666473, "grad_norm": 2.769273042678833, "learning_rate": 0.00017805221866730458, "logits/chosen": -0.6285029649734497, "logits/rejected": -0.6361050605773926, "logps/chosen": -10.298542976379395, "logps/rejected": -27.911968231201172, "loss": 0.6473672986030579, "memory(GiB)": 46.83, "nll_loss": 0.37400925159454346, "rewards/accuracies": 0.90625, "rewards/chosen": 0.33300700783729553, "rewards/margins": 1.5457414388656616, "rewards/rejected": -1.2127344608306885, "step": 315, "train_speed(iter/s)": 0.005407 }, { "epoch": 0.2549607927182875, "grad_norm": 2.675525426864624, "learning_rate": 0.00017788508460267677, "logits/chosen": -0.633998692035675, "logits/rejected": -0.6368559002876282, "logps/chosen": -8.035248756408691, "logps/rejected": -33.8181266784668, "loss": 0.5450462698936462, "memory(GiB)": 46.83, "nll_loss": 0.2956991195678711, "rewards/accuracies": 0.84375, "rewards/chosen": 0.12976329028606415, "rewards/margins": 2.3313686847686768, "rewards/rejected": -2.2016055583953857, "step": 316, "train_speed(iter/s)": 0.005407 }, { "epoch": 0.25576763066992764, "grad_norm": 2.2619502544403076, "learning_rate": 0.0001777173956557665, "logits/chosen": -0.6891807317733765, "logits/rejected": -0.6903274059295654, "logps/chosen": -10.693523406982422, "logps/rejected": -31.01398468017578, "loss": 0.6650394797325134, "memory(GiB)": 46.83, "nll_loss": 0.38576623797416687, "rewards/accuracies": 0.875, "rewards/chosen": 0.2987612187862396, "rewards/margins": 1.9871487617492676, "rewards/rejected": -1.6883876323699951, "step": 317, "train_speed(iter/s)": 0.005407 }, { "epoch": 0.2565744686215678, "grad_norm": 7.991454124450684, "learning_rate": 0.0001775491530212522, "logits/chosen": -0.6753562688827515, "logits/rejected": -0.6762648820877075, "logps/chosen": -11.517782211303711, "logps/rejected": -26.93805503845215, "loss": 1.165069580078125, "memory(GiB)": 46.83, "nll_loss": 0.6551721096038818, "rewards/accuracies": 0.78125, "rewards/chosen": 0.02389012649655342, "rewards/margins": 1.3221609592437744, "rewards/rejected": -1.2982707023620605, "step": 318, "train_speed(iter/s)": 0.005408 }, { "epoch": 0.25738130657320796, "grad_norm": 9.860249519348145, "learning_rate": 0.00017738035789775696, "logits/chosen": -0.7479084730148315, "logits/rejected": -0.7518092393875122, "logps/chosen": -5.844160079956055, "logps/rejected": -35.683162689208984, "loss": 0.5556322932243347, "memory(GiB)": 46.83, "nll_loss": 0.3325543999671936, "rewards/accuracies": 0.90625, "rewards/chosen": 0.10462158918380737, "rewards/margins": 2.546602487564087, "rewards/rejected": -2.4419808387756348, "step": 319, "train_speed(iter/s)": 0.005409 }, { "epoch": 0.25818814452484806, "grad_norm": 3.9844655990600586, "learning_rate": 0.00017721101148783985, "logits/chosen": -0.7617798447608948, "logits/rejected": -0.7641586661338806, "logps/chosen": -8.093914031982422, "logps/rejected": -35.221988677978516, "loss": 0.6888319849967957, "memory(GiB)": 46.83, "nll_loss": 0.4659794867038727, "rewards/accuracies": 0.9375, "rewards/chosen": 0.08299870789051056, "rewards/margins": 2.34136700630188, "rewards/rejected": -2.258368492126465, "step": 320, "train_speed(iter/s)": 0.005409 }, { "epoch": 0.2589949824764882, "grad_norm": 7.946180820465088, "learning_rate": 0.00017704111499798768, "logits/chosen": -0.7791930437088013, "logits/rejected": -0.7833006381988525, "logps/chosen": -6.748149871826172, "logps/rejected": -36.56504440307617, "loss": 0.8274538516998291, "memory(GiB)": 46.83, "nll_loss": 0.5019730925559998, "rewards/accuracies": 0.875, "rewards/chosen": 0.09792216122150421, "rewards/margins": 2.4872283935546875, "rewards/rejected": -2.3893063068389893, "step": 321, "train_speed(iter/s)": 0.005409 }, { "epoch": 0.2598018204281284, "grad_norm": 7.7827467918396, "learning_rate": 0.00017687066963860615, "logits/chosen": -0.7987972497940063, "logits/rejected": -0.8094179034233093, "logps/chosen": -3.5310564041137695, "logps/rejected": -32.73319625854492, "loss": 0.4403470754623413, "memory(GiB)": 46.83, "nll_loss": 0.1688545197248459, "rewards/accuracies": 0.84375, "rewards/chosen": 0.2623920440673828, "rewards/margins": 2.187939405441284, "rewards/rejected": -1.925547480583191, "step": 322, "train_speed(iter/s)": 0.00541 }, { "epoch": 0.26060865837976854, "grad_norm": 3.664057493209839, "learning_rate": 0.0001766996766240114, "logits/chosen": -0.8535178899765015, "logits/rejected": -0.8564468622207642, "logps/chosen": -12.827454566955566, "logps/rejected": -35.108741760253906, "loss": 0.7213603258132935, "memory(GiB)": 46.83, "nll_loss": 0.47191280126571655, "rewards/accuracies": 0.90625, "rewards/chosen": 0.34138235449790955, "rewards/margins": 2.7680537700653076, "rewards/rejected": -2.426671266555786, "step": 323, "train_speed(iter/s)": 0.00541 }, { "epoch": 0.2614154963314087, "grad_norm": 3.6671972274780273, "learning_rate": 0.0001765281371724211, "logits/chosen": -0.8640937209129333, "logits/rejected": -0.8603441119194031, "logps/chosen": -9.051156997680664, "logps/rejected": -32.042171478271484, "loss": 0.5764932036399841, "memory(GiB)": 46.83, "nll_loss": 0.3475058972835541, "rewards/accuracies": 0.90625, "rewards/chosen": 0.24964334070682526, "rewards/margins": 2.6217854022979736, "rewards/rejected": -2.3721418380737305, "step": 324, "train_speed(iter/s)": 0.00541 }, { "epoch": 0.26222233428304886, "grad_norm": 4.343052864074707, "learning_rate": 0.00017635605250594606, "logits/chosen": -0.9237393140792847, "logits/rejected": -0.9191243648529053, "logps/chosen": -9.570093154907227, "logps/rejected": -26.344640731811523, "loss": 0.6133550405502319, "memory(GiB)": 46.83, "nll_loss": 0.3041512668132782, "rewards/accuracies": 0.875, "rewards/chosen": 0.2187902331352234, "rewards/margins": 1.9347566366195679, "rewards/rejected": -1.7159663438796997, "step": 325, "train_speed(iter/s)": 0.00541 }, { "epoch": 0.26302917223468897, "grad_norm": 13.972990989685059, "learning_rate": 0.00017618342385058145, "logits/chosen": -0.9064996242523193, "logits/rejected": -0.9114649295806885, "logps/chosen": -10.548544883728027, "logps/rejected": -39.158992767333984, "loss": 0.9647412300109863, "memory(GiB)": 46.83, "nll_loss": 0.6664921045303345, "rewards/accuracies": 0.84375, "rewards/chosen": 0.14826549589633942, "rewards/margins": 2.8863561153411865, "rewards/rejected": -2.738090753555298, "step": 326, "train_speed(iter/s)": 0.00541 }, { "epoch": 0.26383601018632913, "grad_norm": 4.962406635284424, "learning_rate": 0.0001760102524361979, "logits/chosen": -0.9307440519332886, "logits/rejected": -0.9374938607215881, "logps/chosen": -11.971577644348145, "logps/rejected": -43.166099548339844, "loss": 0.7845494747161865, "memory(GiB)": 46.83, "nll_loss": 0.4260358214378357, "rewards/accuracies": 0.84375, "rewards/chosen": -0.014196585863828659, "rewards/margins": 2.70448637008667, "rewards/rejected": -2.7186827659606934, "step": 327, "train_speed(iter/s)": 0.00541 }, { "epoch": 0.2646428481379693, "grad_norm": 6.3026509284973145, "learning_rate": 0.00017583653949653297, "logits/chosen": -0.9104486703872681, "logits/rejected": -0.9133187532424927, "logps/chosen": -7.545221328735352, "logps/rejected": -42.58152770996094, "loss": 0.6194388270378113, "memory(GiB)": 46.83, "nll_loss": 0.38448214530944824, "rewards/accuracies": 0.84375, "rewards/chosen": 0.12115807086229324, "rewards/margins": 3.0233232975006104, "rewards/rejected": -2.902165412902832, "step": 328, "train_speed(iter/s)": 0.005411 }, { "epoch": 0.26544968608960945, "grad_norm": 4.22109317779541, "learning_rate": 0.00017566228626918212, "logits/chosen": -0.8536132574081421, "logits/rejected": -0.863903284072876, "logps/chosen": -9.604391098022461, "logps/rejected": -38.25326919555664, "loss": 0.7549124956130981, "memory(GiB)": 46.83, "nll_loss": 0.43309736251831055, "rewards/accuracies": 0.78125, "rewards/chosen": 0.11497168242931366, "rewards/margins": 2.4954819679260254, "rewards/rejected": -2.380510091781616, "step": 329, "train_speed(iter/s)": 0.005411 }, { "epoch": 0.2662565240412496, "grad_norm": 3.372162103652954, "learning_rate": 0.0001754874939955901, "logits/chosen": -0.8504335880279541, "logits/rejected": -0.8582204580307007, "logps/chosen": -13.342264175415039, "logps/rejected": -36.4522590637207, "loss": 0.9137426614761353, "memory(GiB)": 46.83, "nll_loss": 0.6495134830474854, "rewards/accuracies": 0.9375, "rewards/chosen": 0.36808696389198303, "rewards/margins": 2.6845757961273193, "rewards/rejected": -2.316488742828369, "step": 330, "train_speed(iter/s)": 0.005412 }, { "epoch": 0.2670633619928897, "grad_norm": 2.032322883605957, "learning_rate": 0.00017531216392104203, "logits/chosen": -0.8323754072189331, "logits/rejected": -0.8362606763839722, "logps/chosen": -9.349749565124512, "logps/rejected": -38.68825149536133, "loss": 0.6108371019363403, "memory(GiB)": 46.83, "nll_loss": 0.4490174949169159, "rewards/accuracies": 0.9375, "rewards/chosen": 0.4555152654647827, "rewards/margins": 3.0110297203063965, "rewards/rejected": -2.555514335632324, "step": 331, "train_speed(iter/s)": 0.005413 }, { "epoch": 0.2678701999445299, "grad_norm": 2.1273860931396484, "learning_rate": 0.00017513629729465455, "logits/chosen": -0.8378605842590332, "logits/rejected": -0.8425085544586182, "logps/chosen": -7.634585380554199, "logps/rejected": -34.26400375366211, "loss": 0.5199471712112427, "memory(GiB)": 46.83, "nll_loss": 0.3184734284877777, "rewards/accuracies": 0.9375, "rewards/chosen": 0.24010597169399261, "rewards/margins": 2.4833943843841553, "rewards/rejected": -2.243288516998291, "step": 332, "train_speed(iter/s)": 0.005414 }, { "epoch": 0.26867703789617003, "grad_norm": 13.832210540771484, "learning_rate": 0.0001749598953693668, "logits/chosen": -0.8178601264953613, "logits/rejected": -0.8171352744102478, "logps/chosen": -7.816558361053467, "logps/rejected": -27.310321807861328, "loss": 0.8487988710403442, "memory(GiB)": 46.83, "nll_loss": 0.5664465427398682, "rewards/accuracies": 0.90625, "rewards/chosen": 0.13675397634506226, "rewards/margins": 2.1682660579681396, "rewards/rejected": -2.0315120220184326, "step": 333, "train_speed(iter/s)": 0.005414 }, { "epoch": 0.2694838758478102, "grad_norm": 4.107896327972412, "learning_rate": 0.00017478295940193163, "logits/chosen": -0.8216401934623718, "logits/rejected": -0.8330098986625671, "logps/chosen": -8.207337379455566, "logps/rejected": -38.14511489868164, "loss": 0.8124181032180786, "memory(GiB)": 46.83, "nll_loss": 0.4575313925743103, "rewards/accuracies": 0.84375, "rewards/chosen": 0.033875416964292526, "rewards/margins": 2.214970350265503, "rewards/rejected": -2.1810948848724365, "step": 334, "train_speed(iter/s)": 0.005415 }, { "epoch": 0.27029071379945036, "grad_norm": 2.043121814727783, "learning_rate": 0.00017460549065290666, "logits/chosen": -0.7847851514816284, "logits/rejected": -0.7903647422790527, "logps/chosen": -11.188026428222656, "logps/rejected": -31.82864761352539, "loss": 0.5849981904029846, "memory(GiB)": 46.83, "nll_loss": 0.3552479147911072, "rewards/accuracies": 0.9375, "rewards/chosen": 0.3021475374698639, "rewards/margins": 2.2114672660827637, "rewards/rejected": -1.909319519996643, "step": 335, "train_speed(iter/s)": 0.005415 }, { "epoch": 0.2710975517510905, "grad_norm": 2.116966962814331, "learning_rate": 0.0001744274903866452, "logits/chosen": -0.770881712436676, "logits/rejected": -0.7834229469299316, "logps/chosen": -3.7972168922424316, "logps/rejected": -37.75122833251953, "loss": 0.3996497392654419, "memory(GiB)": 46.83, "nll_loss": 0.2140352874994278, "rewards/accuracies": 0.96875, "rewards/chosen": 0.27353012561798096, "rewards/margins": 2.583765983581543, "rewards/rejected": -2.3102359771728516, "step": 336, "train_speed(iter/s)": 0.005415 }, { "epoch": 0.2719043897027306, "grad_norm": 4.1290411949157715, "learning_rate": 0.00017424895987128722, "logits/chosen": -0.786916971206665, "logits/rejected": -0.7911162376403809, "logps/chosen": -9.502747535705566, "logps/rejected": -32.8641357421875, "loss": 0.7896320819854736, "memory(GiB)": 46.83, "nll_loss": 0.4624251425266266, "rewards/accuracies": 0.8125, "rewards/chosen": 0.12185362726449966, "rewards/margins": 2.144758701324463, "rewards/rejected": -2.022905111312866, "step": 337, "train_speed(iter/s)": 0.005415 }, { "epoch": 0.2727112276543708, "grad_norm": 1.9379422664642334, "learning_rate": 0.0001740699003787505, "logits/chosen": -0.8224512338638306, "logits/rejected": -0.8290694355964661, "logps/chosen": -5.654224872589111, "logps/rejected": -40.40040588378906, "loss": 0.32085683941841125, "memory(GiB)": 46.83, "nll_loss": 0.17423731088638306, "rewards/accuracies": 0.9375, "rewards/chosen": 0.2838688790798187, "rewards/margins": 2.9954781532287598, "rewards/rejected": -2.711609363555908, "step": 338, "train_speed(iter/s)": 0.005415 }, { "epoch": 0.27351806560601094, "grad_norm": 2.5411887168884277, "learning_rate": 0.00017389031318472143, "logits/chosen": -0.8840833306312561, "logits/rejected": -0.8846546411514282, "logps/chosen": -14.506649017333984, "logps/rejected": -35.60776901245117, "loss": 0.6948885917663574, "memory(GiB)": 46.83, "nll_loss": 0.4158177375793457, "rewards/accuracies": 0.84375, "rewards/chosen": 0.05735927075147629, "rewards/margins": 2.4177799224853516, "rewards/rejected": -2.3604207038879395, "step": 339, "train_speed(iter/s)": 0.005415 }, { "epoch": 0.2743249035576511, "grad_norm": 4.5371856689453125, "learning_rate": 0.00017371019956864583, "logits/chosen": -0.8519307374954224, "logits/rejected": -0.8563728928565979, "logps/chosen": -18.773422241210938, "logps/rejected": -25.609325408935547, "loss": 1.2189257144927979, "memory(GiB)": 46.83, "nll_loss": 0.7953273057937622, "rewards/accuracies": 0.78125, "rewards/chosen": 0.14804774522781372, "rewards/margins": 1.684711217880249, "rewards/rejected": -1.5366634130477905, "step": 340, "train_speed(iter/s)": 0.005416 }, { "epoch": 0.27513174150929126, "grad_norm": 5.0346455574035645, "learning_rate": 0.00017352956081372007, "logits/chosen": -0.901013970375061, "logits/rejected": -0.9049715995788574, "logps/chosen": -8.963022232055664, "logps/rejected": -34.29716110229492, "loss": 0.8155198097229004, "memory(GiB)": 46.83, "nll_loss": 0.40066373348236084, "rewards/accuracies": 0.84375, "rewards/chosen": -0.041613977402448654, "rewards/margins": 2.3150718212127686, "rewards/rejected": -2.3566856384277344, "step": 341, "train_speed(iter/s)": 0.005416 }, { "epoch": 0.2759385794609314, "grad_norm": 4.706645488739014, "learning_rate": 0.00017334839820688176, "logits/chosen": -0.8764183521270752, "logits/rejected": -0.8793443441390991, "logps/chosen": -11.185328483581543, "logps/rejected": -27.840126037597656, "loss": 0.8221145868301392, "memory(GiB)": 46.83, "nll_loss": 0.36857330799102783, "rewards/accuracies": 0.875, "rewards/chosen": 0.029647603631019592, "rewards/margins": 1.7318322658538818, "rewards/rejected": -1.7021846771240234, "step": 342, "train_speed(iter/s)": 0.005416 }, { "epoch": 0.2767454174125715, "grad_norm": 3.4059722423553467, "learning_rate": 0.00017316671303880065, "logits/chosen": -0.8800357580184937, "logits/rejected": -0.8856234550476074, "logps/chosen": -10.418521881103516, "logps/rejected": -44.70547866821289, "loss": 0.621554970741272, "memory(GiB)": 46.83, "nll_loss": 0.41401058435440063, "rewards/accuracies": 0.90625, "rewards/chosen": 0.08430502563714981, "rewards/margins": 3.2389299869537354, "rewards/rejected": -3.1546249389648438, "step": 343, "train_speed(iter/s)": 0.005417 }, { "epoch": 0.2775522553642117, "grad_norm": 8.598644256591797, "learning_rate": 0.00017298450660386934, "logits/chosen": -0.8565375208854675, "logits/rejected": -0.8581067323684692, "logps/chosen": -11.926506042480469, "logps/rejected": -36.14910888671875, "loss": 0.7724243998527527, "memory(GiB)": 46.83, "nll_loss": 0.41390153765678406, "rewards/accuracies": 0.875, "rewards/chosen": -0.05219612270593643, "rewards/margins": 2.1874096393585205, "rewards/rejected": -2.239605665206909, "step": 344, "train_speed(iter/s)": 0.005417 }, { "epoch": 0.27835909331585185, "grad_norm": 5.491206645965576, "learning_rate": 0.00017280178020019418, "logits/chosen": -0.8360708951950073, "logits/rejected": -0.8349617123603821, "logps/chosen": -9.427896499633789, "logps/rejected": -29.778169631958008, "loss": 0.7176328301429749, "memory(GiB)": 46.83, "nll_loss": 0.46471166610717773, "rewards/accuracies": 0.90625, "rewards/chosen": 0.3919517695903778, "rewards/margins": 2.2337028980255127, "rewards/rejected": -1.841751217842102, "step": 345, "train_speed(iter/s)": 0.005417 }, { "epoch": 0.279165931267492, "grad_norm": 2.732307195663452, "learning_rate": 0.000172618535129586, "logits/chosen": -0.8330416083335876, "logits/rejected": -0.8343455195426941, "logps/chosen": -13.94620418548584, "logps/rejected": -34.905059814453125, "loss": 0.6391770243644714, "memory(GiB)": 46.83, "nll_loss": 0.40491989254951477, "rewards/accuracies": 0.9375, "rewards/chosen": 0.024340404197573662, "rewards/margins": 2.191556453704834, "rewards/rejected": -2.1672160625457764, "step": 346, "train_speed(iter/s)": 0.005417 }, { "epoch": 0.27997276921913217, "grad_norm": 2.748098373413086, "learning_rate": 0.00017243477269755073, "logits/chosen": -0.8207265138626099, "logits/rejected": -0.8255487680435181, "logps/chosen": -8.841146469116211, "logps/rejected": -40.18748092651367, "loss": 0.5847609043121338, "memory(GiB)": 46.83, "nll_loss": 0.4391492009162903, "rewards/accuracies": 0.96875, "rewards/chosen": 0.18971768021583557, "rewards/margins": 3.0055530071258545, "rewards/rejected": -2.815835475921631, "step": 347, "train_speed(iter/s)": 0.005417 }, { "epoch": 0.28077960717077227, "grad_norm": 8.588139533996582, "learning_rate": 0.00017225049421328023, "logits/chosen": -0.8355762362480164, "logits/rejected": -0.8387144804000854, "logps/chosen": -8.67043399810791, "logps/rejected": -34.789730072021484, "loss": 0.5931243896484375, "memory(GiB)": 46.83, "nll_loss": 0.30945685505867004, "rewards/accuracies": 0.84375, "rewards/chosen": 0.06438732147216797, "rewards/margins": 2.153982639312744, "rewards/rejected": -2.089595317840576, "step": 348, "train_speed(iter/s)": 0.005418 }, { "epoch": 0.28158644512241243, "grad_norm": 2.7876644134521484, "learning_rate": 0.00017206570098964293, "logits/chosen": -0.8504444360733032, "logits/rejected": -0.8515408635139465, "logps/chosen": -10.413717269897461, "logps/rejected": -31.34994888305664, "loss": 0.5911897420883179, "memory(GiB)": 46.83, "nll_loss": 0.3716551661491394, "rewards/accuracies": 0.875, "rewards/chosen": 0.2757214307785034, "rewards/margins": 2.5438179969787598, "rewards/rejected": -2.268096446990967, "step": 349, "train_speed(iter/s)": 0.005418 }, { "epoch": 0.2823932830740526, "grad_norm": 2.771085262298584, "learning_rate": 0.00017188039434317437, "logits/chosen": -0.7710286974906921, "logits/rejected": -0.7747238874435425, "logps/chosen": -11.302440643310547, "logps/rejected": -31.574066162109375, "loss": 0.7104746103286743, "memory(GiB)": 46.83, "nll_loss": 0.44341009855270386, "rewards/accuracies": 0.9375, "rewards/chosen": 0.2658320367336273, "rewards/margins": 2.1740376949310303, "rewards/rejected": -1.908205509185791, "step": 350, "train_speed(iter/s)": 0.005418 }, { "epoch": 0.28320012102569275, "grad_norm": 8.733509063720703, "learning_rate": 0.00017169457559406795, "logits/chosen": -0.7990887761116028, "logits/rejected": -0.8017781376838684, "logps/chosen": -10.448628425598145, "logps/rejected": -32.143943786621094, "loss": 1.2729414701461792, "memory(GiB)": 46.83, "nll_loss": 0.8385729789733887, "rewards/accuracies": 0.90625, "rewards/chosen": -0.18963520228862762, "rewards/margins": 1.997046947479248, "rewards/rejected": -2.1866822242736816, "step": 351, "train_speed(iter/s)": 0.005417 }, { "epoch": 0.2840069589773329, "grad_norm": 3.8308520317077637, "learning_rate": 0.00017150824606616553, "logits/chosen": -0.7534295320510864, "logits/rejected": -0.7567183971405029, "logps/chosen": -7.442231178283691, "logps/rejected": -32.14317321777344, "loss": 0.5511249899864197, "memory(GiB)": 46.83, "nll_loss": 0.34539952874183655, "rewards/accuracies": 0.96875, "rewards/chosen": 0.26004305481910706, "rewards/margins": 2.451585531234741, "rewards/rejected": -2.191542387008667, "step": 352, "train_speed(iter/s)": 0.005417 }, { "epoch": 0.2848137969289731, "grad_norm": 3.919644832611084, "learning_rate": 0.00017132140708694786, "logits/chosen": -0.7558514475822449, "logits/rejected": -0.7550539970397949, "logps/chosen": -8.997418403625488, "logps/rejected": -29.441905975341797, "loss": 0.6320300698280334, "memory(GiB)": 46.83, "nll_loss": 0.3772739768028259, "rewards/accuracies": 0.9375, "rewards/chosen": 0.2652067542076111, "rewards/margins": 2.186215877532959, "rewards/rejected": -1.9210093021392822, "step": 353, "train_speed(iter/s)": 0.005418 }, { "epoch": 0.2856206348806132, "grad_norm": 20.330293655395508, "learning_rate": 0.0001711340599875253, "logits/chosen": -0.7443191409111023, "logits/rejected": -0.7491686344146729, "logps/chosen": -11.211926460266113, "logps/rejected": -37.2029914855957, "loss": 1.2416906356811523, "memory(GiB)": 46.83, "nll_loss": 0.7969366908073425, "rewards/accuracies": 0.8125, "rewards/chosen": -0.1411081850528717, "rewards/margins": 2.08335542678833, "rewards/rejected": -2.22446346282959, "step": 354, "train_speed(iter/s)": 0.005418 }, { "epoch": 0.28642747283225334, "grad_norm": 13.989158630371094, "learning_rate": 0.00017094620610262815, "logits/chosen": -0.7479000091552734, "logits/rejected": -0.750941812992096, "logps/chosen": -11.775254249572754, "logps/rejected": -35.6055908203125, "loss": 1.2802770137786865, "memory(GiB)": 46.83, "nll_loss": 0.7870579957962036, "rewards/accuracies": 0.8125, "rewards/chosen": -0.2751302123069763, "rewards/margins": 1.906927227973938, "rewards/rejected": -2.1820573806762695, "step": 355, "train_speed(iter/s)": 0.005418 }, { "epoch": 0.2872343107838935, "grad_norm": 7.8280930519104, "learning_rate": 0.0001707578467705973, "logits/chosen": -0.7759760022163391, "logits/rejected": -0.7844580411911011, "logps/chosen": -7.402548789978027, "logps/rejected": -38.92572784423828, "loss": 0.7681185603141785, "memory(GiB)": 46.83, "nll_loss": 0.5315437912940979, "rewards/accuracies": 0.90625, "rewards/chosen": 0.005034878849983215, "rewards/margins": 2.443704128265381, "rewards/rejected": -2.438669443130493, "step": 356, "train_speed(iter/s)": 0.005418 }, { "epoch": 0.28804114873553366, "grad_norm": 24.46771812438965, "learning_rate": 0.00017056898333337462, "logits/chosen": -0.7455392479896545, "logits/rejected": -0.7464004755020142, "logps/chosen": -15.696362495422363, "logps/rejected": -36.21916198730469, "loss": 0.699033796787262, "memory(GiB)": 46.83, "nll_loss": 0.42450839281082153, "rewards/accuracies": 0.84375, "rewards/chosen": 0.19790178537368774, "rewards/margins": 2.3564441204071045, "rewards/rejected": -2.1585421562194824, "step": 357, "train_speed(iter/s)": 0.005419 }, { "epoch": 0.2888479866871738, "grad_norm": 3.165498971939087, "learning_rate": 0.0001703796171364934, "logits/chosen": -0.7834245562553406, "logits/rejected": -0.7828773260116577, "logps/chosen": -8.231873512268066, "logps/rejected": -30.543338775634766, "loss": 0.7491443753242493, "memory(GiB)": 46.83, "nll_loss": 0.4628988206386566, "rewards/accuracies": 0.875, "rewards/chosen": 0.24111242592334747, "rewards/margins": 2.3805058002471924, "rewards/rejected": -2.1393933296203613, "step": 358, "train_speed(iter/s)": 0.005419 }, { "epoch": 0.2896548246388139, "grad_norm": 2.6455235481262207, "learning_rate": 0.00017018974952906884, "logits/chosen": -0.8238362073898315, "logits/rejected": -0.8289802670478821, "logps/chosen": -6.384030818939209, "logps/rejected": -37.180633544921875, "loss": 0.5261876583099365, "memory(GiB)": 46.83, "nll_loss": 0.28632083535194397, "rewards/accuracies": 0.875, "rewards/chosen": 0.18914461135864258, "rewards/margins": 2.69685959815979, "rewards/rejected": -2.5077149868011475, "step": 359, "train_speed(iter/s)": 0.005419 }, { "epoch": 0.2904616625904541, "grad_norm": 2.369776964187622, "learning_rate": 0.00016999938186378825, "logits/chosen": -0.7982887625694275, "logits/rejected": -0.8035246729850769, "logps/chosen": -6.851421356201172, "logps/rejected": -45.864418029785156, "loss": 0.5188026428222656, "memory(GiB)": 46.83, "nll_loss": 0.3399565815925598, "rewards/accuracies": 0.90625, "rewards/chosen": 0.3176203966140747, "rewards/margins": 3.4621381759643555, "rewards/rejected": -3.144517660140991, "step": 360, "train_speed(iter/s)": 0.00542 }, { "epoch": 0.29126850054209424, "grad_norm": 3.786916971206665, "learning_rate": 0.0001698085154969017, "logits/chosen": -0.8295035362243652, "logits/rejected": -0.8320608139038086, "logps/chosen": -10.462471961975098, "logps/rejected": -44.3033561706543, "loss": 0.6038550138473511, "memory(GiB)": 46.83, "nll_loss": 0.44244384765625, "rewards/accuracies": 0.96875, "rewards/chosen": 0.005623971112072468, "rewards/margins": 2.9000349044799805, "rewards/rejected": -2.8944108486175537, "step": 361, "train_speed(iter/s)": 0.00542 }, { "epoch": 0.2920753384937344, "grad_norm": 2.3236849308013916, "learning_rate": 0.000169617151788212, "logits/chosen": -0.8378246426582336, "logits/rejected": -0.8476194739341736, "logps/chosen": -7.4671311378479, "logps/rejected": -45.69831466674805, "loss": 0.549799919128418, "memory(GiB)": 46.83, "nll_loss": 0.3557121455669403, "rewards/accuracies": 0.9375, "rewards/chosen": 0.2878333032131195, "rewards/margins": 3.4509360790252686, "rewards/rejected": -3.163102865219116, "step": 362, "train_speed(iter/s)": 0.005419 }, { "epoch": 0.29288217644537456, "grad_norm": 4.218591213226318, "learning_rate": 0.0001694252921010654, "logits/chosen": -0.8441336154937744, "logits/rejected": -0.854229211807251, "logps/chosen": -7.4483184814453125, "logps/rejected": -46.634490966796875, "loss": 0.5104203224182129, "memory(GiB)": 46.83, "nll_loss": 0.2786526679992676, "rewards/accuracies": 0.90625, "rewards/chosen": 0.10106715559959412, "rewards/margins": 3.364898681640625, "rewards/rejected": -3.263831377029419, "step": 363, "train_speed(iter/s)": 0.00542 }, { "epoch": 0.2936890143970147, "grad_norm": 6.0027055740356445, "learning_rate": 0.0001692329378023416, "logits/chosen": -0.8181811571121216, "logits/rejected": -0.8173055648803711, "logps/chosen": -11.75820541381836, "logps/rejected": -28.230079650878906, "loss": 0.8542529344558716, "memory(GiB)": 46.83, "nll_loss": 0.41755104064941406, "rewards/accuracies": 0.78125, "rewards/chosen": 0.016829999163746834, "rewards/margins": 1.9391112327575684, "rewards/rejected": -1.9222811460494995, "step": 364, "train_speed(iter/s)": 0.00542 }, { "epoch": 0.29449585234865483, "grad_norm": 2.452047109603882, "learning_rate": 0.00016904009026244405, "logits/chosen": -0.8576743006706238, "logits/rejected": -0.8569716215133667, "logps/chosen": -8.94229507446289, "logps/rejected": -36.84193420410156, "loss": 0.5307234525680542, "memory(GiB)": 46.83, "nll_loss": 0.27585676312446594, "rewards/accuracies": 0.875, "rewards/chosen": 0.1474345177412033, "rewards/margins": 2.3831472396850586, "rewards/rejected": -2.235712766647339, "step": 365, "train_speed(iter/s)": 0.00542 }, { "epoch": 0.295302690300295, "grad_norm": 4.770409107208252, "learning_rate": 0.00016884675085529033, "logits/chosen": -0.8674459457397461, "logits/rejected": -0.8703688383102417, "logps/chosen": -10.529121398925781, "logps/rejected": -38.25895309448242, "loss": 0.6165487766265869, "memory(GiB)": 46.83, "nll_loss": 0.3394632339477539, "rewards/accuracies": 0.875, "rewards/chosen": 0.13632023334503174, "rewards/margins": 2.6175537109375, "rewards/rejected": -2.4812331199645996, "step": 366, "train_speed(iter/s)": 0.005421 }, { "epoch": 0.29610952825193515, "grad_norm": 2.726836681365967, "learning_rate": 0.00016865292095830214, "logits/chosen": -0.8154149055480957, "logits/rejected": -0.8210477232933044, "logps/chosen": -8.451236724853516, "logps/rejected": -30.605690002441406, "loss": 0.5677744150161743, "memory(GiB)": 46.83, "nll_loss": 0.30434367060661316, "rewards/accuracies": 0.90625, "rewards/chosen": 0.3030344247817993, "rewards/margins": 2.1608378887176514, "rewards/rejected": -1.8578035831451416, "step": 367, "train_speed(iter/s)": 0.005421 }, { "epoch": 0.2969163662035753, "grad_norm": 4.918789386749268, "learning_rate": 0.00016845860195239574, "logits/chosen": -0.8281161189079285, "logits/rejected": -0.8330156207084656, "logps/chosen": -11.424484252929688, "logps/rejected": -32.49198913574219, "loss": 0.7686675786972046, "memory(GiB)": 46.83, "nll_loss": 0.5117014050483704, "rewards/accuracies": 0.90625, "rewards/chosen": 0.3326207995414734, "rewards/margins": 2.3775177001953125, "rewards/rejected": -2.0448966026306152, "step": 368, "train_speed(iter/s)": 0.005421 }, { "epoch": 0.29772320415521547, "grad_norm": 7.9901652336120605, "learning_rate": 0.00016826379522197197, "logits/chosen": -0.7991360425949097, "logits/rejected": -0.8027262091636658, "logps/chosen": -8.358216285705566, "logps/rejected": -31.194568634033203, "loss": 0.7576655745506287, "memory(GiB)": 46.83, "nll_loss": 0.49762627482414246, "rewards/accuracies": 0.875, "rewards/chosen": 0.10716473311185837, "rewards/margins": 2.159275531768799, "rewards/rejected": -2.0521109104156494, "step": 369, "train_speed(iter/s)": 0.005422 }, { "epoch": 0.2985300421068556, "grad_norm": 7.625348091125488, "learning_rate": 0.0001680685021549063, "logits/chosen": -0.7968946099281311, "logits/rejected": -0.8060710430145264, "logps/chosen": -7.866345405578613, "logps/rejected": -40.948158264160156, "loss": 0.9940714240074158, "memory(GiB)": 46.83, "nll_loss": 0.7132853269577026, "rewards/accuracies": 0.9375, "rewards/chosen": -0.16774287819862366, "rewards/margins": 2.4824962615966797, "rewards/rejected": -2.6502389907836914, "step": 370, "train_speed(iter/s)": 0.005423 }, { "epoch": 0.29933688005849574, "grad_norm": 4.839093208312988, "learning_rate": 0.0001678727241425391, "logits/chosen": -0.792543888092041, "logits/rejected": -0.7907209992408752, "logps/chosen": -10.626989364624023, "logps/rejected": -25.664470672607422, "loss": 0.91594398021698, "memory(GiB)": 46.83, "nll_loss": 0.5407547950744629, "rewards/accuracies": 0.90625, "rewards/chosen": 0.0037185251712799072, "rewards/margins": 1.719236969947815, "rewards/rejected": -1.7155182361602783, "step": 371, "train_speed(iter/s)": 0.005423 }, { "epoch": 0.3001437180101359, "grad_norm": 11.523240089416504, "learning_rate": 0.00016767646257966572, "logits/chosen": -0.8143973350524902, "logits/rejected": -0.8215935230255127, "logps/chosen": -6.086573123931885, "logps/rejected": -34.30033493041992, "loss": 0.6105502247810364, "memory(GiB)": 46.83, "nll_loss": 0.36522942781448364, "rewards/accuracies": 0.875, "rewards/chosen": 0.2981349527835846, "rewards/margins": 2.788585662841797, "rewards/rejected": -2.490450859069824, "step": 372, "train_speed(iter/s)": 0.005423 }, { "epoch": 0.30095055596177606, "grad_norm": 5.205559253692627, "learning_rate": 0.00016747971886452642, "logits/chosen": -0.7993229031562805, "logits/rejected": -0.8019697666168213, "logps/chosen": -14.90966796875, "logps/rejected": -40.805274963378906, "loss": 1.5332070589065552, "memory(GiB)": 46.83, "nll_loss": 1.2682892084121704, "rewards/accuracies": 0.84375, "rewards/chosen": 0.025209464132785797, "rewards/margins": 2.6658260822296143, "rewards/rejected": -2.6406168937683105, "step": 373, "train_speed(iter/s)": 0.005423 }, { "epoch": 0.3017573939134162, "grad_norm": 2.872535228729248, "learning_rate": 0.00016728249439879655, "logits/chosen": -0.7731214165687561, "logits/rejected": -0.7786182165145874, "logps/chosen": -5.839204788208008, "logps/rejected": -37.67174530029297, "loss": 0.507649838924408, "memory(GiB)": 46.83, "nll_loss": 0.2965702712535858, "rewards/accuracies": 0.90625, "rewards/chosen": 0.22565633058547974, "rewards/margins": 2.726480007171631, "rewards/rejected": -2.500823497772217, "step": 374, "train_speed(iter/s)": 0.005424 }, { "epoch": 0.3025642318650564, "grad_norm": 9.740580558776855, "learning_rate": 0.00016708479058757649, "logits/chosen": -0.8201895952224731, "logits/rejected": -0.8329208493232727, "logps/chosen": -10.150799751281738, "logps/rejected": -40.12678527832031, "loss": 0.5580483078956604, "memory(GiB)": 46.83, "nll_loss": 0.32952913641929626, "rewards/accuracies": 0.875, "rewards/chosen": 0.20641882717609406, "rewards/margins": 2.5419578552246094, "rewards/rejected": -2.335538625717163, "step": 375, "train_speed(iter/s)": 0.005424 }, { "epoch": 0.3033710698166965, "grad_norm": 4.967090606689453, "learning_rate": 0.00016688660883938165, "logits/chosen": -0.7816774845123291, "logits/rejected": -0.7863184213638306, "logps/chosen": -11.115227699279785, "logps/rejected": -41.1477165222168, "loss": 0.7776178121566772, "memory(GiB)": 46.83, "nll_loss": 0.5047651529312134, "rewards/accuracies": 0.90625, "rewards/chosen": -0.12607808411121368, "rewards/margins": 2.677337884902954, "rewards/rejected": -2.8034157752990723, "step": 376, "train_speed(iter/s)": 0.005424 }, { "epoch": 0.30417790776833664, "grad_norm": 5.764723777770996, "learning_rate": 0.00016668795056613242, "logits/chosen": -0.8348323106765747, "logits/rejected": -0.836425244808197, "logps/chosen": -11.849743843078613, "logps/rejected": -35.644893646240234, "loss": 0.860490083694458, "memory(GiB)": 46.83, "nll_loss": 0.44726479053497314, "rewards/accuracies": 0.78125, "rewards/chosen": 0.01643115095794201, "rewards/margins": 2.4391143321990967, "rewards/rejected": -2.4226832389831543, "step": 377, "train_speed(iter/s)": 0.005424 }, { "epoch": 0.3049847457199768, "grad_norm": 6.4779510498046875, "learning_rate": 0.0001664888171831442, "logits/chosen": -0.8333585262298584, "logits/rejected": -0.8423128128051758, "logps/chosen": -8.405279159545898, "logps/rejected": -37.56438446044922, "loss": 0.6916205883026123, "memory(GiB)": 46.83, "nll_loss": 0.43494561314582825, "rewards/accuracies": 0.9375, "rewards/chosen": 0.054853081703186035, "rewards/margins": 2.354010581970215, "rewards/rejected": -2.2991573810577393, "step": 378, "train_speed(iter/s)": 0.005424 }, { "epoch": 0.30579158367161696, "grad_norm": 2.1519875526428223, "learning_rate": 0.00016628921010911714, "logits/chosen": -0.8162001371383667, "logits/rejected": -0.8233896493911743, "logps/chosen": -6.277496814727783, "logps/rejected": -37.37247848510742, "loss": 0.3955227732658386, "memory(GiB)": 46.83, "nll_loss": 0.22343112528324127, "rewards/accuracies": 0.96875, "rewards/chosen": 0.15012571215629578, "rewards/margins": 2.704033851623535, "rewards/rejected": -2.553908109664917, "step": 379, "train_speed(iter/s)": 0.005425 }, { "epoch": 0.3065984216232571, "grad_norm": 5.495427131652832, "learning_rate": 0.00016608913076612627, "logits/chosen": -0.7601447105407715, "logits/rejected": -0.7649034261703491, "logps/chosen": -11.018935203552246, "logps/rejected": -31.04195785522461, "loss": 0.7440771460533142, "memory(GiB)": 46.83, "nll_loss": 0.3949829936027527, "rewards/accuracies": 0.84375, "rewards/chosen": 0.16132403910160065, "rewards/margins": 2.152961015701294, "rewards/rejected": -1.9916372299194336, "step": 380, "train_speed(iter/s)": 0.005425 }, { "epoch": 0.3074052595748972, "grad_norm": 12.617781639099121, "learning_rate": 0.00016588858057961113, "logits/chosen": -0.823615550994873, "logits/rejected": -0.8296138048171997, "logps/chosen": -11.327326774597168, "logps/rejected": -38.99674606323242, "loss": 0.916981041431427, "memory(GiB)": 46.83, "nll_loss": 0.6145994067192078, "rewards/accuracies": 0.875, "rewards/chosen": -0.005291827023029327, "rewards/margins": 2.653188705444336, "rewards/rejected": -2.658480644226074, "step": 381, "train_speed(iter/s)": 0.005425 }, { "epoch": 0.3082120975265374, "grad_norm": 10.325765609741211, "learning_rate": 0.00016568756097836576, "logits/chosen": -0.7539953589439392, "logits/rejected": -0.7629266381263733, "logps/chosen": -12.126445770263672, "logps/rejected": -36.76786804199219, "loss": 0.9146925210952759, "memory(GiB)": 46.83, "nll_loss": 0.5855523347854614, "rewards/accuracies": 0.90625, "rewards/chosen": 0.018190251663327217, "rewards/margins": 2.345966339111328, "rewards/rejected": -2.3277759552001953, "step": 382, "train_speed(iter/s)": 0.005425 }, { "epoch": 0.30901893547817755, "grad_norm": 4.079949378967285, "learning_rate": 0.00016548607339452853, "logits/chosen": -0.7926503419876099, "logits/rejected": -0.8010275363922119, "logps/chosen": -10.392716407775879, "logps/rejected": -33.4859733581543, "loss": 0.6544159054756165, "memory(GiB)": 46.83, "nll_loss": 0.31039926409721375, "rewards/accuracies": 0.8125, "rewards/chosen": 0.19881543517112732, "rewards/margins": 2.027736186981201, "rewards/rejected": -1.828920841217041, "step": 383, "train_speed(iter/s)": 0.005425 }, { "epoch": 0.3098257734298177, "grad_norm": 2.981825828552246, "learning_rate": 0.0001652841192635718, "logits/chosen": -0.7877278923988342, "logits/rejected": -0.7911107540130615, "logps/chosen": -10.606431007385254, "logps/rejected": -31.438617706298828, "loss": 0.7501833438873291, "memory(GiB)": 46.83, "nll_loss": 0.4839434027671814, "rewards/accuracies": 0.875, "rewards/chosen": 0.36393457651138306, "rewards/margins": 2.2303647994995117, "rewards/rejected": -1.8664300441741943, "step": 384, "train_speed(iter/s)": 0.005426 }, { "epoch": 0.31063261138145787, "grad_norm": 5.048736572265625, "learning_rate": 0.0001650817000242919, "logits/chosen": -0.741836428642273, "logits/rejected": -0.7429819703102112, "logps/chosen": -8.188630104064941, "logps/rejected": -21.78225326538086, "loss": 0.7458047866821289, "memory(GiB)": 46.83, "nll_loss": 0.3462568521499634, "rewards/accuracies": 0.8125, "rewards/chosen": 0.1975884884595871, "rewards/margins": 1.2948282957077026, "rewards/rejected": -1.0972397327423096, "step": 385, "train_speed(iter/s)": 0.005426 }, { "epoch": 0.31143944933309803, "grad_norm": 3.7488629817962646, "learning_rate": 0.00016487881711879868, "logits/chosen": -0.7345485687255859, "logits/rejected": -0.7461491227149963, "logps/chosen": -8.506485939025879, "logps/rejected": -31.39336395263672, "loss": 0.6992615461349487, "memory(GiB)": 46.83, "nll_loss": 0.38303038477897644, "rewards/accuracies": 0.84375, "rewards/chosen": 0.12145505100488663, "rewards/margins": 1.6618486642837524, "rewards/rejected": -1.5403934717178345, "step": 386, "train_speed(iter/s)": 0.005426 }, { "epoch": 0.31224628728473813, "grad_norm": 4.740914344787598, "learning_rate": 0.0001646754719925053, "logits/chosen": -0.7271203398704529, "logits/rejected": -0.7348542213439941, "logps/chosen": -8.581640243530273, "logps/rejected": -30.84325408935547, "loss": 0.5986461639404297, "memory(GiB)": 46.83, "nll_loss": 0.30818265676498413, "rewards/accuracies": 0.875, "rewards/chosen": 0.2583742141723633, "rewards/margins": 1.7723979949951172, "rewards/rejected": -1.514023780822754, "step": 387, "train_speed(iter/s)": 0.005427 }, { "epoch": 0.3130531252363783, "grad_norm": 2.877361536026001, "learning_rate": 0.00016447166609411809, "logits/chosen": -0.737002432346344, "logits/rejected": -0.7362369894981384, "logps/chosen": -9.167498588562012, "logps/rejected": -21.97631072998047, "loss": 0.7882663607597351, "memory(GiB)": 46.83, "nll_loss": 0.3854939937591553, "rewards/accuracies": 0.84375, "rewards/chosen": 0.27406081557273865, "rewards/margins": 1.2815303802490234, "rewards/rejected": -1.007469654083252, "step": 388, "train_speed(iter/s)": 0.005427 }, { "epoch": 0.31385996318801845, "grad_norm": 2.516064405441284, "learning_rate": 0.00016426740087562588, "logits/chosen": -0.7427570223808289, "logits/rejected": -0.7460445761680603, "logps/chosen": -7.309655666351318, "logps/rejected": -30.33109474182129, "loss": 0.5361584424972534, "memory(GiB)": 46.83, "nll_loss": 0.29300200939178467, "rewards/accuracies": 0.96875, "rewards/chosen": 0.18929171562194824, "rewards/margins": 1.8147234916687012, "rewards/rejected": -1.625431776046753, "step": 389, "train_speed(iter/s)": 0.005427 }, { "epoch": 0.3146668011396586, "grad_norm": 5.825074195861816, "learning_rate": 0.0001640626777922901, "logits/chosen": -0.7519196271896362, "logits/rejected": -0.7524212598800659, "logps/chosen": -7.206381320953369, "logps/rejected": -24.535839080810547, "loss": 0.6842062473297119, "memory(GiB)": 46.83, "nll_loss": 0.3918344974517822, "rewards/accuracies": 0.875, "rewards/chosen": 0.23575374484062195, "rewards/margins": 1.7519906759262085, "rewards/rejected": -1.5162369012832642, "step": 390, "train_speed(iter/s)": 0.005427 }, { "epoch": 0.3154736390912988, "grad_norm": 3.599740505218506, "learning_rate": 0.000163857498302634, "logits/chosen": -0.7379420399665833, "logits/rejected": -0.7385002970695496, "logps/chosen": -8.897488594055176, "logps/rejected": -21.334794998168945, "loss": 0.7518292665481567, "memory(GiB)": 46.83, "nll_loss": 0.35948920249938965, "rewards/accuracies": 0.71875, "rewards/chosen": 0.0675305724143982, "rewards/margins": 1.2294992208480835, "rewards/rejected": -1.161968469619751, "step": 391, "train_speed(iter/s)": 0.005427 }, { "epoch": 0.31628047704293893, "grad_norm": 3.701690673828125, "learning_rate": 0.0001636518638684325, "logits/chosen": -0.7553545832633972, "logits/rejected": -0.7599779367446899, "logps/chosen": -11.763086318969727, "logps/rejected": -29.765409469604492, "loss": 0.6486645936965942, "memory(GiB)": 46.83, "nll_loss": 0.3567640483379364, "rewards/accuracies": 0.9375, "rewards/chosen": 0.10855480283498764, "rewards/margins": 1.6032474040985107, "rewards/rejected": -1.4946926832199097, "step": 392, "train_speed(iter/s)": 0.005427 }, { "epoch": 0.31708731499457904, "grad_norm": 2.8278613090515137, "learning_rate": 0.00016344577595470174, "logits/chosen": -0.7699616551399231, "logits/rejected": -0.7747686505317688, "logps/chosen": -8.457822799682617, "logps/rejected": -25.99679183959961, "loss": 0.7349235415458679, "memory(GiB)": 46.83, "nll_loss": 0.37837332487106323, "rewards/accuracies": 0.84375, "rewards/chosen": 0.10739874094724655, "rewards/margins": 1.572762131690979, "rewards/rejected": -1.4653635025024414, "step": 393, "train_speed(iter/s)": 0.005427 }, { "epoch": 0.3178941529462192, "grad_norm": 3.7045748233795166, "learning_rate": 0.0001632392360296886, "logits/chosen": -0.690305233001709, "logits/rejected": -0.6888067722320557, "logps/chosen": -9.403566360473633, "logps/rejected": -22.69052505493164, "loss": 0.6981708407402039, "memory(GiB)": 46.83, "nll_loss": 0.42633530497550964, "rewards/accuracies": 0.84375, "rewards/chosen": 0.4319700002670288, "rewards/margins": 1.8832911252975464, "rewards/rejected": -1.4513212442398071, "step": 394, "train_speed(iter/s)": 0.005428 }, { "epoch": 0.31870099089785936, "grad_norm": 3.8347578048706055, "learning_rate": 0.00016303224556486021, "logits/chosen": -0.7941313982009888, "logits/rejected": -0.7985343933105469, "logps/chosen": -8.82894515991211, "logps/rejected": -35.2305793762207, "loss": 0.6906291842460632, "memory(GiB)": 46.83, "nll_loss": 0.4142599105834961, "rewards/accuracies": 0.875, "rewards/chosen": 0.22435417771339417, "rewards/margins": 2.410836696624756, "rewards/rejected": -2.1864821910858154, "step": 395, "train_speed(iter/s)": 0.005428 }, { "epoch": 0.3195078288494995, "grad_norm": 2.570457935333252, "learning_rate": 0.00016282480603489359, "logits/chosen": -0.7678409218788147, "logits/rejected": -0.7748376727104187, "logps/chosen": -7.719938278198242, "logps/rejected": -37.97621536254883, "loss": 0.5270894765853882, "memory(GiB)": 46.83, "nll_loss": 0.29066720604896545, "rewards/accuracies": 0.875, "rewards/chosen": 0.2296931892633438, "rewards/margins": 2.5373897552490234, "rewards/rejected": -2.307696580886841, "step": 396, "train_speed(iter/s)": 0.005428 }, { "epoch": 0.3203146668011397, "grad_norm": 3.276946544647217, "learning_rate": 0.000162616918917665, "logits/chosen": -0.8192197680473328, "logits/rejected": -0.8224659562110901, "logps/chosen": -12.474966049194336, "logps/rejected": -34.623626708984375, "loss": 0.6273024678230286, "memory(GiB)": 46.83, "nll_loss": 0.4210663139820099, "rewards/accuracies": 0.9375, "rewards/chosen": 0.15507780015468597, "rewards/margins": 2.483549118041992, "rewards/rejected": -2.3284709453582764, "step": 397, "train_speed(iter/s)": 0.005428 }, { "epoch": 0.3211215047527798, "grad_norm": 4.271194934844971, "learning_rate": 0.00016240858569423956, "logits/chosen": -0.8221184611320496, "logits/rejected": -0.8321431875228882, "logps/chosen": -9.941547393798828, "logps/rejected": -42.07545471191406, "loss": 0.8007271885871887, "memory(GiB)": 46.83, "nll_loss": 0.4452548623085022, "rewards/accuracies": 0.90625, "rewards/chosen": -0.05637914687395096, "rewards/margins": 2.7785463333129883, "rewards/rejected": -2.834925651550293, "step": 398, "train_speed(iter/s)": 0.005428 }, { "epoch": 0.32192834270441995, "grad_norm": 11.448945999145508, "learning_rate": 0.0001621998078488605, "logits/chosen": -0.8299403190612793, "logits/rejected": -0.8370727896690369, "logps/chosen": -14.581025123596191, "logps/rejected": -46.871543884277344, "loss": 1.0272753238677979, "memory(GiB)": 46.83, "nll_loss": 0.7910286784172058, "rewards/accuracies": 0.9375, "rewards/chosen": 0.08015693724155426, "rewards/margins": 3.2413315773010254, "rewards/rejected": -3.161174774169922, "step": 399, "train_speed(iter/s)": 0.005429 }, { "epoch": 0.3227351806560601, "grad_norm": 10.813321113586426, "learning_rate": 0.00016199058686893882, "logits/chosen": -0.85502690076828, "logits/rejected": -0.8559147715568542, "logps/chosen": -10.797840118408203, "logps/rejected": -27.456714630126953, "loss": 1.2833585739135742, "memory(GiB)": 46.83, "nll_loss": 0.8083551526069641, "rewards/accuracies": 0.78125, "rewards/chosen": -0.05027822405099869, "rewards/margins": 1.7881048917770386, "rewards/rejected": -1.8383830785751343, "step": 400, "train_speed(iter/s)": 0.005429 }, { "epoch": 0.32354201860770027, "grad_norm": 7.667049884796143, "learning_rate": 0.00016178092424504246, "logits/chosen": -0.8004090785980225, "logits/rejected": -0.8061416149139404, "logps/chosen": -9.709630966186523, "logps/rejected": -47.190277099609375, "loss": 0.6974176168441772, "memory(GiB)": 46.83, "nll_loss": 0.5138447284698486, "rewards/accuracies": 0.9375, "rewards/chosen": -0.048886872828006744, "rewards/margins": 3.236457109451294, "rewards/rejected": -3.285344123840332, "step": 401, "train_speed(iter/s)": 0.005427 }, { "epoch": 0.3243488565593404, "grad_norm": 5.483085632324219, "learning_rate": 0.00016157082147088593, "logits/chosen": -0.8190602660179138, "logits/rejected": -0.824268639087677, "logps/chosen": -14.70582103729248, "logps/rejected": -41.711917877197266, "loss": 1.1310678720474243, "memory(GiB)": 46.83, "nll_loss": 0.6881631016731262, "rewards/accuracies": 0.8125, "rewards/chosen": 0.03247120603919029, "rewards/margins": 2.756627321243286, "rewards/rejected": -2.724156141281128, "step": 402, "train_speed(iter/s)": 0.005427 }, { "epoch": 0.3251556945109806, "grad_norm": 4.824715614318848, "learning_rate": 0.0001613602800433194, "logits/chosen": -0.8436318039894104, "logits/rejected": -0.8526687026023865, "logps/chosen": -8.126108169555664, "logps/rejected": -42.07024383544922, "loss": 0.6571808457374573, "memory(GiB)": 46.83, "nll_loss": 0.4890969395637512, "rewards/accuracies": 0.96875, "rewards/chosen": 0.10289221256971359, "rewards/margins": 2.9235923290252686, "rewards/rejected": -2.8207004070281982, "step": 403, "train_speed(iter/s)": 0.005428 }, { "epoch": 0.3259625324626207, "grad_norm": 6.610788345336914, "learning_rate": 0.00016114930146231827, "logits/chosen": -0.8161177635192871, "logits/rejected": -0.8242086172103882, "logps/chosen": -12.218559265136719, "logps/rejected": -44.647254943847656, "loss": 0.6997122168540955, "memory(GiB)": 46.83, "nll_loss": 0.4584552049636841, "rewards/accuracies": 0.875, "rewards/chosen": -0.26513317227363586, "rewards/margins": 2.8937909603118896, "rewards/rejected": -3.158923864364624, "step": 404, "train_speed(iter/s)": 0.005428 }, { "epoch": 0.32676937041426085, "grad_norm": 2.9718236923217773, "learning_rate": 0.0001609378872309723, "logits/chosen": -0.766316831111908, "logits/rejected": -0.7643468379974365, "logps/chosen": -6.773965835571289, "logps/rejected": -29.697847366333008, "loss": 0.46833112835884094, "memory(GiB)": 46.83, "nll_loss": 0.2168104350566864, "rewards/accuracies": 0.9375, "rewards/chosen": 0.19758227467536926, "rewards/margins": 2.3953795433044434, "rewards/rejected": -2.1977975368499756, "step": 405, "train_speed(iter/s)": 0.005428 }, { "epoch": 0.327576208365901, "grad_norm": 5.874072551727295, "learning_rate": 0.00016072603885547508, "logits/chosen": -0.78830885887146, "logits/rejected": -0.7853043079376221, "logps/chosen": -11.376614570617676, "logps/rejected": -30.687149047851562, "loss": 0.7618173956871033, "memory(GiB)": 46.83, "nll_loss": 0.3364633023738861, "rewards/accuracies": 0.78125, "rewards/chosen": -0.12673895061016083, "rewards/margins": 1.8598191738128662, "rewards/rejected": -1.986557960510254, "step": 406, "train_speed(iter/s)": 0.005428 }, { "epoch": 0.32838304631754117, "grad_norm": 3.214999198913574, "learning_rate": 0.00016051375784511312, "logits/chosen": -0.7452774047851562, "logits/rejected": -0.7576760649681091, "logps/chosen": -6.296991348266602, "logps/rejected": -37.21446228027344, "loss": 0.5500832796096802, "memory(GiB)": 46.83, "nll_loss": 0.2983091473579407, "rewards/accuracies": 0.875, "rewards/chosen": 0.16730837523937225, "rewards/margins": 2.706336259841919, "rewards/rejected": -2.539027690887451, "step": 407, "train_speed(iter/s)": 0.005428 }, { "epoch": 0.32918988426918133, "grad_norm": 3.2364044189453125, "learning_rate": 0.00016030104571225522, "logits/chosen": -0.8141746520996094, "logits/rejected": -0.8147263526916504, "logps/chosen": -8.27431583404541, "logps/rejected": -27.03731918334961, "loss": 0.6542465686798096, "memory(GiB)": 46.83, "nll_loss": 0.32871556282043457, "rewards/accuracies": 0.875, "rewards/chosen": 0.20524322986602783, "rewards/margins": 1.7059212923049927, "rewards/rejected": -1.5006780624389648, "step": 408, "train_speed(iter/s)": 0.005428 }, { "epoch": 0.32999672222082144, "grad_norm": 4.386970043182373, "learning_rate": 0.0001600879039723417, "logits/chosen": -0.7278757095336914, "logits/rejected": -0.7296465635299683, "logps/chosen": -10.145583152770996, "logps/rejected": -34.609405517578125, "loss": 0.6105880737304688, "memory(GiB)": 46.83, "nll_loss": 0.36851969361305237, "rewards/accuracies": 0.96875, "rewards/chosen": 0.062060222029685974, "rewards/margins": 2.2632784843444824, "rewards/rejected": -2.2012181282043457, "step": 409, "train_speed(iter/s)": 0.005428 }, { "epoch": 0.3308035601724616, "grad_norm": 3.3711960315704346, "learning_rate": 0.0001598743341438734, "logits/chosen": -0.69020015001297, "logits/rejected": -0.6957679986953735, "logps/chosen": -10.575393676757812, "logps/rejected": -32.856101989746094, "loss": 0.6940324306488037, "memory(GiB)": 46.83, "nll_loss": 0.43308204412460327, "rewards/accuracies": 0.9375, "rewards/chosen": 0.3041924238204956, "rewards/margins": 2.375181198120117, "rewards/rejected": -2.070988893508911, "step": 410, "train_speed(iter/s)": 0.005429 }, { "epoch": 0.33161039812410176, "grad_norm": 3.1790573596954346, "learning_rate": 0.00015966033774840127, "logits/chosen": -0.7445316314697266, "logits/rejected": -0.748544454574585, "logps/chosen": -7.364559650421143, "logps/rejected": -30.644813537597656, "loss": 0.5010148882865906, "memory(GiB)": 46.83, "nll_loss": 0.2939934730529785, "rewards/accuracies": 1.0, "rewards/chosen": 0.2668747305870056, "rewards/margins": 2.051632881164551, "rewards/rejected": -1.7847580909729004, "step": 411, "train_speed(iter/s)": 0.005429 }, { "epoch": 0.3324172360757419, "grad_norm": 5.062440395355225, "learning_rate": 0.00015944591631051504, "logits/chosen": -0.6655209064483643, "logits/rejected": -0.6722307801246643, "logps/chosen": -8.464452743530273, "logps/rejected": -28.55743408203125, "loss": 0.7590057849884033, "memory(GiB)": 46.83, "nll_loss": 0.41250795125961304, "rewards/accuracies": 0.84375, "rewards/chosen": 0.13860762119293213, "rewards/margins": 1.7520344257354736, "rewards/rejected": -1.613426923751831, "step": 412, "train_speed(iter/s)": 0.00543 }, { "epoch": 0.3332240740273821, "grad_norm": 2.3003089427948, "learning_rate": 0.00015923107135783275, "logits/chosen": -0.735182523727417, "logits/rejected": -0.741850733757019, "logps/chosen": -4.926098346710205, "logps/rejected": -27.20798110961914, "loss": 0.5019189715385437, "memory(GiB)": 46.83, "nll_loss": 0.22264572978019714, "rewards/accuracies": 0.90625, "rewards/chosen": 0.19852803647518158, "rewards/margins": 1.7793362140655518, "rewards/rejected": -1.580808162689209, "step": 413, "train_speed(iter/s)": 0.00543 }, { "epoch": 0.33403091197902224, "grad_norm": 2.761085271835327, "learning_rate": 0.00015901580442098968, "logits/chosen": -0.6879050135612488, "logits/rejected": -0.6989721059799194, "logps/chosen": -8.289688110351562, "logps/rejected": -36.11437225341797, "loss": 0.5515791773796082, "memory(GiB)": 46.83, "nll_loss": 0.359782874584198, "rewards/accuracies": 0.9375, "rewards/chosen": 0.35169073939323425, "rewards/margins": 2.3315212726593018, "rewards/rejected": -1.9798306226730347, "step": 414, "train_speed(iter/s)": 0.00543 }, { "epoch": 0.33483774993066234, "grad_norm": 2.9564995765686035, "learning_rate": 0.00015880011703362748, "logits/chosen": -0.7736977338790894, "logits/rejected": -0.7791394591331482, "logps/chosen": -11.907139778137207, "logps/rejected": -30.767383575439453, "loss": 0.5806700587272644, "memory(GiB)": 46.83, "nll_loss": 0.38372740149497986, "rewards/accuracies": 0.96875, "rewards/chosen": 0.4125119745731354, "rewards/margins": 2.088625192642212, "rewards/rejected": -1.6761131286621094, "step": 415, "train_speed(iter/s)": 0.00543 }, { "epoch": 0.3356445878823025, "grad_norm": 2.9187235832214355, "learning_rate": 0.0001585840107323832, "logits/chosen": -0.7161890864372253, "logits/rejected": -0.7156458497047424, "logps/chosen": -8.870182037353516, "logps/rejected": -30.228370666503906, "loss": 0.7012996077537537, "memory(GiB)": 46.83, "nll_loss": 0.3564344346523285, "rewards/accuracies": 0.90625, "rewards/chosen": 0.10954218357801437, "rewards/margins": 2.018000364303589, "rewards/rejected": -1.9084582328796387, "step": 416, "train_speed(iter/s)": 0.00543 }, { "epoch": 0.33645142583394266, "grad_norm": 5.864604473114014, "learning_rate": 0.00015836748705687841, "logits/chosen": -0.7383227348327637, "logits/rejected": -0.7456459999084473, "logps/chosen": -7.744223594665527, "logps/rejected": -38.64203643798828, "loss": 0.5262930393218994, "memory(GiB)": 46.83, "nll_loss": 0.3058444857597351, "rewards/accuracies": 0.96875, "rewards/chosen": 0.17473873496055603, "rewards/margins": 2.6876578330993652, "rewards/rejected": -2.5129189491271973, "step": 417, "train_speed(iter/s)": 0.005431 }, { "epoch": 0.3372582637855828, "grad_norm": 9.024547576904297, "learning_rate": 0.00015815054754970831, "logits/chosen": -0.7634251117706299, "logits/rejected": -0.7683747410774231, "logps/chosen": -10.462536811828613, "logps/rejected": -31.69692039489746, "loss": 0.9514245986938477, "memory(GiB)": 46.83, "nll_loss": 0.6364089250564575, "rewards/accuracies": 0.90625, "rewards/chosen": 0.21211130917072296, "rewards/margins": 2.214094877243042, "rewards/rejected": -2.001983642578125, "step": 418, "train_speed(iter/s)": 0.005431 }, { "epoch": 0.338065101737223, "grad_norm": 8.62049388885498, "learning_rate": 0.00015793319375643052, "logits/chosen": -0.7581362724304199, "logits/rejected": -0.7588805556297302, "logps/chosen": -7.701593399047852, "logps/rejected": -35.039794921875, "loss": 0.46434247493743896, "memory(GiB)": 46.83, "nll_loss": 0.32877326011657715, "rewards/accuracies": 0.96875, "rewards/chosen": 0.22201837599277496, "rewards/margins": 2.5157957077026367, "rewards/rejected": -2.2937769889831543, "step": 419, "train_speed(iter/s)": 0.005431 }, { "epoch": 0.3388719396888631, "grad_norm": 6.575305938720703, "learning_rate": 0.00015771542722555423, "logits/chosen": -0.7857352495193481, "logits/rejected": -0.7996398210525513, "logps/chosen": -10.29336166381836, "logps/rejected": -46.0968017578125, "loss": 0.738344669342041, "memory(GiB)": 46.83, "nll_loss": 0.45971018075942993, "rewards/accuracies": 0.90625, "rewards/chosen": 0.021582117304205894, "rewards/margins": 2.711317777633667, "rewards/rejected": -2.6897356510162354, "step": 420, "train_speed(iter/s)": 0.005431 }, { "epoch": 0.33967877764050325, "grad_norm": 1.8250871896743774, "learning_rate": 0.00015749724950852909, "logits/chosen": -0.8029757738113403, "logits/rejected": -0.803418755531311, "logps/chosen": -8.469568252563477, "logps/rejected": -41.49656295776367, "loss": 0.4241314232349396, "memory(GiB)": 46.83, "nll_loss": 0.2885726988315582, "rewards/accuracies": 1.0, "rewards/chosen": 0.14934808015823364, "rewards/margins": 3.204773187637329, "rewards/rejected": -3.0554254055023193, "step": 421, "train_speed(iter/s)": 0.005431 }, { "epoch": 0.3404856155921434, "grad_norm": 7.909032821655273, "learning_rate": 0.00015727866215973425, "logits/chosen": -0.8152115941047668, "logits/rejected": -0.8257274627685547, "logps/chosen": -8.088623046875, "logps/rejected": -48.481143951416016, "loss": 0.6303491592407227, "memory(GiB)": 46.83, "nll_loss": 0.3295513391494751, "rewards/accuracies": 0.9375, "rewards/chosen": 0.07966871559619904, "rewards/margins": 3.391120672225952, "rewards/rejected": -3.3114516735076904, "step": 422, "train_speed(iter/s)": 0.005431 }, { "epoch": 0.34129245354378357, "grad_norm": 5.323256015777588, "learning_rate": 0.00015705966673646723, "logits/chosen": -0.8351114392280579, "logits/rejected": -0.8382234573364258, "logps/chosen": -8.482909202575684, "logps/rejected": -37.57075881958008, "loss": 0.6785515546798706, "memory(GiB)": 46.83, "nll_loss": 0.363737553358078, "rewards/accuracies": 0.875, "rewards/chosen": 0.1108720526099205, "rewards/margins": 2.615013837814331, "rewards/rejected": -2.5041418075561523, "step": 423, "train_speed(iter/s)": 0.005431 }, { "epoch": 0.34209929149542373, "grad_norm": 27.7071475982666, "learning_rate": 0.00015684026479893272, "logits/chosen": -0.8173145651817322, "logits/rejected": -0.8212793469429016, "logps/chosen": -15.243718147277832, "logps/rejected": -35.84337615966797, "loss": 0.9820355176925659, "memory(GiB)": 46.83, "nll_loss": 0.5321431756019592, "rewards/accuracies": 0.78125, "rewards/chosen": -0.15343250334262848, "rewards/margins": 2.1440441608428955, "rewards/rejected": -2.2974765300750732, "step": 424, "train_speed(iter/s)": 0.005431 }, { "epoch": 0.3429061294470639, "grad_norm": 2.558488368988037, "learning_rate": 0.00015662045791023173, "logits/chosen": -0.7981111407279968, "logits/rejected": -0.804236888885498, "logps/chosen": -12.458770751953125, "logps/rejected": -38.74690246582031, "loss": 0.5468552708625793, "memory(GiB)": 46.83, "nll_loss": 0.40575528144836426, "rewards/accuracies": 0.96875, "rewards/chosen": 0.3049697279930115, "rewards/margins": 2.893904685974121, "rewards/rejected": -2.588935375213623, "step": 425, "train_speed(iter/s)": 0.005432 }, { "epoch": 0.343712967398704, "grad_norm": 11.186711311340332, "learning_rate": 0.00015640024763635015, "logits/chosen": -0.8168637156486511, "logits/rejected": -0.8147194385528564, "logps/chosen": -18.96175193786621, "logps/rejected": -30.127038955688477, "loss": 1.35488760471344, "memory(GiB)": 46.83, "nll_loss": 0.6938337683677673, "rewards/accuracies": 0.75, "rewards/chosen": -0.32947003841400146, "rewards/margins": 1.8565242290496826, "rewards/rejected": -2.1859941482543945, "step": 426, "train_speed(iter/s)": 0.005432 }, { "epoch": 0.34451980535034415, "grad_norm": 2.7602322101593018, "learning_rate": 0.00015617963554614782, "logits/chosen": -0.7925236225128174, "logits/rejected": -0.8042585253715515, "logps/chosen": -7.885419845581055, "logps/rejected": -41.48836135864258, "loss": 0.5029093027114868, "memory(GiB)": 46.83, "nll_loss": 0.3265308141708374, "rewards/accuracies": 0.9375, "rewards/chosen": 0.19351695477962494, "rewards/margins": 3.003077507019043, "rewards/rejected": -2.809560537338257, "step": 427, "train_speed(iter/s)": 0.005433 }, { "epoch": 0.3453266433019843, "grad_norm": 2.7690954208374023, "learning_rate": 0.00015595862321134723, "logits/chosen": -0.801167368888855, "logits/rejected": -0.8079819083213806, "logps/chosen": -11.006603240966797, "logps/rejected": -47.515464782714844, "loss": 0.5393511652946472, "memory(GiB)": 46.83, "nll_loss": 0.357557088136673, "rewards/accuracies": 0.9375, "rewards/chosen": 0.09760009497404099, "rewards/margins": 3.3984105587005615, "rewards/rejected": -3.3008105754852295, "step": 428, "train_speed(iter/s)": 0.005433 }, { "epoch": 0.3461334812536245, "grad_norm": 3.378408432006836, "learning_rate": 0.00015573721220652243, "logits/chosen": -0.7705251574516296, "logits/rejected": -0.7756682634353638, "logps/chosen": -7.106504440307617, "logps/rejected": -38.38644790649414, "loss": 0.45007073879241943, "memory(GiB)": 46.83, "nll_loss": 0.2939262390136719, "rewards/accuracies": 1.0, "rewards/chosen": 0.2970801591873169, "rewards/margins": 2.9060657024383545, "rewards/rejected": -2.608985424041748, "step": 429, "train_speed(iter/s)": 0.005433 }, { "epoch": 0.34694031920526464, "grad_norm": 11.245018005371094, "learning_rate": 0.0001555154041090876, "logits/chosen": -0.7640025019645691, "logits/rejected": -0.7694700360298157, "logps/chosen": -7.503448486328125, "logps/rejected": -29.179779052734375, "loss": 0.6581162214279175, "memory(GiB)": 46.83, "nll_loss": 0.3762749135494232, "rewards/accuracies": 0.90625, "rewards/chosen": 0.18421027064323425, "rewards/margins": 2.1600494384765625, "rewards/rejected": -1.9758392572402954, "step": 430, "train_speed(iter/s)": 0.005433 }, { "epoch": 0.34774715715690474, "grad_norm": 4.24967098236084, "learning_rate": 0.0001552932004992861, "logits/chosen": -0.7261820435523987, "logits/rejected": -0.7354370355606079, "logps/chosen": -8.89859676361084, "logps/rejected": -43.472408294677734, "loss": 0.5466022491455078, "memory(GiB)": 46.83, "nll_loss": 0.2866482138633728, "rewards/accuracies": 0.9375, "rewards/chosen": 0.21286547183990479, "rewards/margins": 3.0320310592651367, "rewards/rejected": -2.8191657066345215, "step": 431, "train_speed(iter/s)": 0.005433 }, { "epoch": 0.3485539951085449, "grad_norm": 17.65904998779297, "learning_rate": 0.00015507060296017896, "logits/chosen": -0.7059640884399414, "logits/rejected": -0.7113645076751709, "logps/chosen": -15.478120803833008, "logps/rejected": -38.02043914794922, "loss": 0.9082990288734436, "memory(GiB)": 46.83, "nll_loss": 0.5757866501808167, "rewards/accuracies": 0.875, "rewards/chosen": 0.15995851159095764, "rewards/margins": 2.8075268268585205, "rewards/rejected": -2.6475682258605957, "step": 432, "train_speed(iter/s)": 0.005432 }, { "epoch": 0.34936083306018506, "grad_norm": 13.476463317871094, "learning_rate": 0.00015484761307763383, "logits/chosen": -0.700376033782959, "logits/rejected": -0.7011431455612183, "logps/chosen": -9.81491470336914, "logps/rejected": -33.46759796142578, "loss": 0.7563650608062744, "memory(GiB)": 46.83, "nll_loss": 0.5197194814682007, "rewards/accuracies": 0.96875, "rewards/chosen": 0.14740222692489624, "rewards/margins": 2.482841730117798, "rewards/rejected": -2.335439682006836, "step": 433, "train_speed(iter/s)": 0.005432 }, { "epoch": 0.3501676710118252, "grad_norm": 2.2564306259155273, "learning_rate": 0.00015462423244031346, "logits/chosen": -0.7145711183547974, "logits/rejected": -0.7142253518104553, "logps/chosen": -6.049681663513184, "logps/rejected": -40.261722564697266, "loss": 0.39624738693237305, "memory(GiB)": 46.83, "nll_loss": 0.2778511047363281, "rewards/accuracies": 0.96875, "rewards/chosen": 0.3084055185317993, "rewards/margins": 3.100196361541748, "rewards/rejected": -2.79179048538208, "step": 434, "train_speed(iter/s)": 0.005433 }, { "epoch": 0.3509745089634654, "grad_norm": 3.1633989810943604, "learning_rate": 0.00015440046263966446, "logits/chosen": -0.734190046787262, "logits/rejected": -0.7362701296806335, "logps/chosen": -7.924525737762451, "logps/rejected": -30.7021484375, "loss": 0.6030353307723999, "memory(GiB)": 46.83, "nll_loss": 0.3201526999473572, "rewards/accuracies": 0.84375, "rewards/chosen": 0.07075662910938263, "rewards/margins": 1.9832499027252197, "rewards/rejected": -1.9124932289123535, "step": 435, "train_speed(iter/s)": 0.005432 }, { "epoch": 0.35178134691510554, "grad_norm": 9.708440780639648, "learning_rate": 0.00015417630526990615, "logits/chosen": -0.7230247855186462, "logits/rejected": -0.7281976342201233, "logps/chosen": -7.0415544509887695, "logps/rejected": -37.40678787231445, "loss": 0.9090821743011475, "memory(GiB)": 46.83, "nll_loss": 0.6137229204177856, "rewards/accuracies": 0.875, "rewards/chosen": -0.017065048217773438, "rewards/margins": 2.4000210762023926, "rewards/rejected": -2.417086124420166, "step": 436, "train_speed(iter/s)": 0.005432 }, { "epoch": 0.35258818486674565, "grad_norm": 2.7294411659240723, "learning_rate": 0.00015395176192801882, "logits/chosen": -0.66111159324646, "logits/rejected": -0.6679624319076538, "logps/chosen": -10.94334602355957, "logps/rejected": -39.744171142578125, "loss": 0.558108925819397, "memory(GiB)": 46.83, "nll_loss": 0.3573530912399292, "rewards/accuracies": 0.9375, "rewards/chosen": 0.07710271328687668, "rewards/margins": 2.2725815773010254, "rewards/rejected": -2.195478916168213, "step": 437, "train_speed(iter/s)": 0.005433 }, { "epoch": 0.3533950228183858, "grad_norm": 2.2957513332366943, "learning_rate": 0.00015372683421373268, "logits/chosen": -0.7276008129119873, "logits/rejected": -0.733298659324646, "logps/chosen": -9.018013954162598, "logps/rejected": -39.43022155761719, "loss": 0.5581925511360168, "memory(GiB)": 46.83, "nll_loss": 0.35958534479141235, "rewards/accuracies": 0.96875, "rewards/chosen": 0.3142196834087372, "rewards/margins": 2.4971206188201904, "rewards/rejected": -2.182900905609131, "step": 438, "train_speed(iter/s)": 0.005433 }, { "epoch": 0.35420186077002597, "grad_norm": 2.652552604675293, "learning_rate": 0.0001535015237295164, "logits/chosen": -0.7248872518539429, "logits/rejected": -0.728070080280304, "logps/chosen": -9.407607078552246, "logps/rejected": -35.77960205078125, "loss": 0.7365480065345764, "memory(GiB)": 46.83, "nll_loss": 0.5000982880592346, "rewards/accuracies": 0.90625, "rewards/chosen": 0.21720585227012634, "rewards/margins": 2.5895490646362305, "rewards/rejected": -2.372343063354492, "step": 439, "train_speed(iter/s)": 0.005433 }, { "epoch": 0.3550086987216661, "grad_norm": 16.293540954589844, "learning_rate": 0.00015327583208056553, "logits/chosen": -0.7425347566604614, "logits/rejected": -0.7465611100196838, "logps/chosen": -6.231223106384277, "logps/rejected": -33.581016540527344, "loss": 0.5848970413208008, "memory(GiB)": 46.83, "nll_loss": 0.3383205533027649, "rewards/accuracies": 0.90625, "rewards/chosen": 0.22708339989185333, "rewards/margins": 2.6124606132507324, "rewards/rejected": -2.3853771686553955, "step": 440, "train_speed(iter/s)": 0.005433 }, { "epoch": 0.3558155366733063, "grad_norm": 7.516906261444092, "learning_rate": 0.00015304976087479128, "logits/chosen": -0.7300995588302612, "logits/rejected": -0.731682538986206, "logps/chosen": -7.094137191772461, "logps/rejected": -24.851308822631836, "loss": 0.6824460625648499, "memory(GiB)": 46.83, "nll_loss": 0.28373995423316956, "rewards/accuracies": 0.84375, "rewards/chosen": 0.08390329778194427, "rewards/margins": 1.636284351348877, "rewards/rejected": -1.5523810386657715, "step": 441, "train_speed(iter/s)": 0.005433 }, { "epoch": 0.35662237462494645, "grad_norm": 5.410120487213135, "learning_rate": 0.00015282331172280887, "logits/chosen": -0.7709946036338806, "logits/rejected": -0.778519868850708, "logps/chosen": -14.137146949768066, "logps/rejected": -39.00368881225586, "loss": 1.1119240522384644, "memory(GiB)": 46.83, "nll_loss": 0.5970031023025513, "rewards/accuracies": 0.6875, "rewards/chosen": -0.0509246289730072, "rewards/margins": 2.253941297531128, "rewards/rejected": -2.304866075515747, "step": 442, "train_speed(iter/s)": 0.005432 }, { "epoch": 0.35742921257658655, "grad_norm": 2.6960244178771973, "learning_rate": 0.0001525964862379263, "logits/chosen": -0.7315975427627563, "logits/rejected": -0.7369835376739502, "logps/chosen": -5.271239280700684, "logps/rejected": -27.497392654418945, "loss": 0.5291019082069397, "memory(GiB)": 46.83, "nll_loss": 0.2573389708995819, "rewards/accuracies": 0.875, "rewards/chosen": 0.2271825522184372, "rewards/margins": 2.134850263595581, "rewards/rejected": -1.907667636871338, "step": 443, "train_speed(iter/s)": 0.005433 }, { "epoch": 0.3582360505282267, "grad_norm": 3.0122978687286377, "learning_rate": 0.0001523692860361325, "logits/chosen": -0.7649153470993042, "logits/rejected": -0.7727422118186951, "logps/chosen": -12.25500774383545, "logps/rejected": -40.75428771972656, "loss": 0.712749183177948, "memory(GiB)": 46.83, "nll_loss": 0.5094113349914551, "rewards/accuracies": 0.9375, "rewards/chosen": 0.25550708174705505, "rewards/margins": 2.767303466796875, "rewards/rejected": -2.511796474456787, "step": 444, "train_speed(iter/s)": 0.005433 }, { "epoch": 0.3590428884798669, "grad_norm": 3.1875035762786865, "learning_rate": 0.00015214171273608614, "logits/chosen": -0.7680434584617615, "logits/rejected": -0.773673951625824, "logps/chosen": -10.56375503540039, "logps/rejected": -46.056488037109375, "loss": 0.5614004731178284, "memory(GiB)": 46.83, "nll_loss": 0.3534352779388428, "rewards/accuracies": 0.90625, "rewards/chosen": 0.05404359847307205, "rewards/margins": 3.072054386138916, "rewards/rejected": -3.0180106163024902, "step": 445, "train_speed(iter/s)": 0.005433 }, { "epoch": 0.35984972643150703, "grad_norm": 2.6271064281463623, "learning_rate": 0.00015191376795910404, "logits/chosen": -0.7706547975540161, "logits/rejected": -0.7753493189811707, "logps/chosen": -10.181999206542969, "logps/rejected": -36.871089935302734, "loss": 0.7368884682655334, "memory(GiB)": 46.83, "nll_loss": 0.5453473925590515, "rewards/accuracies": 0.9375, "rewards/chosen": 0.20240941643714905, "rewards/margins": 2.66059947013855, "rewards/rejected": -2.4581899642944336, "step": 446, "train_speed(iter/s)": 0.005433 }, { "epoch": 0.3606565643831472, "grad_norm": 2.9951157569885254, "learning_rate": 0.0001516854533291494, "logits/chosen": -0.7616828083992004, "logits/rejected": -0.7694711685180664, "logps/chosen": -7.686607837677002, "logps/rejected": -41.72177505493164, "loss": 0.5836425423622131, "memory(GiB)": 46.83, "nll_loss": 0.33194291591644287, "rewards/accuracies": 0.875, "rewards/chosen": 0.03806695714592934, "rewards/margins": 2.7966089248657227, "rewards/rejected": -2.75854229927063, "step": 447, "train_speed(iter/s)": 0.005433 }, { "epoch": 0.3614634023347873, "grad_norm": 6.78880500793457, "learning_rate": 0.00015145677047282056, "logits/chosen": -0.768774151802063, "logits/rejected": -0.7738460302352905, "logps/chosen": -7.29971170425415, "logps/rejected": -23.89675521850586, "loss": 0.7116811871528625, "memory(GiB)": 46.83, "nll_loss": 0.363356351852417, "rewards/accuracies": 0.8125, "rewards/chosen": 0.2802785038948059, "rewards/margins": 1.6327687501907349, "rewards/rejected": -1.3524901866912842, "step": 448, "train_speed(iter/s)": 0.005433 }, { "epoch": 0.36227024028642746, "grad_norm": 2.428403854370117, "learning_rate": 0.00015122772101933913, "logits/chosen": -0.713983416557312, "logits/rejected": -0.719916582107544, "logps/chosen": -9.733499526977539, "logps/rejected": -38.1261100769043, "loss": 0.5839467644691467, "memory(GiB)": 46.83, "nll_loss": 0.3204602897167206, "rewards/accuracies": 0.96875, "rewards/chosen": 0.18539123237133026, "rewards/margins": 2.5533952713012695, "rewards/rejected": -2.368004083633423, "step": 449, "train_speed(iter/s)": 0.005433 }, { "epoch": 0.3630770782380676, "grad_norm": 2.1015625, "learning_rate": 0.00015099830660053848, "logits/chosen": -0.6917126774787903, "logits/rejected": -0.704102098941803, "logps/chosen": -6.558714866638184, "logps/rejected": -44.186180114746094, "loss": 0.42745494842529297, "memory(GiB)": 46.83, "nll_loss": 0.25199466943740845, "rewards/accuracies": 0.9375, "rewards/chosen": 0.26587462425231934, "rewards/margins": 3.109530210494995, "rewards/rejected": -2.8436553478240967, "step": 450, "train_speed(iter/s)": 0.005434 }, { "epoch": 0.3638839161897078, "grad_norm": 7.269819736480713, "learning_rate": 0.00015076852885085223, "logits/chosen": -0.685967206954956, "logits/rejected": -0.6903418898582458, "logps/chosen": -8.861746788024902, "logps/rejected": -31.555381774902344, "loss": 0.6940796375274658, "memory(GiB)": 46.83, "nll_loss": 0.4090823233127594, "rewards/accuracies": 0.90625, "rewards/chosen": 0.1664535403251648, "rewards/margins": 2.2505595684051514, "rewards/rejected": -2.0841057300567627, "step": 451, "train_speed(iter/s)": 0.005433 }, { "epoch": 0.36469075414134794, "grad_norm": 7.895684719085693, "learning_rate": 0.00015053838940730244, "logits/chosen": -0.7125756740570068, "logits/rejected": -0.7196484804153442, "logps/chosen": -7.934318542480469, "logps/rejected": -32.33711624145508, "loss": 0.9927008152008057, "memory(GiB)": 46.83, "nll_loss": 0.5683808326721191, "rewards/accuracies": 0.8125, "rewards/chosen": 0.047097161412239075, "rewards/margins": 1.7799056768417358, "rewards/rejected": -1.7328083515167236, "step": 452, "train_speed(iter/s)": 0.005433 }, { "epoch": 0.3654975920929881, "grad_norm": 2.145096778869629, "learning_rate": 0.00015030788990948797, "logits/chosen": -0.7455975413322449, "logits/rejected": -0.748679518699646, "logps/chosen": -8.74243450164795, "logps/rejected": -32.179813385009766, "loss": 0.5566769242286682, "memory(GiB)": 46.83, "nll_loss": 0.35227102041244507, "rewards/accuracies": 1.0, "rewards/chosen": 0.20155397057533264, "rewards/margins": 2.3393735885620117, "rewards/rejected": -2.137819766998291, "step": 453, "train_speed(iter/s)": 0.005433 }, { "epoch": 0.3663044300446282, "grad_norm": 12.220844268798828, "learning_rate": 0.00015007703199957297, "logits/chosen": -0.6872383952140808, "logits/rejected": -0.6934896111488342, "logps/chosen": -12.1061429977417, "logps/rejected": -36.80299377441406, "loss": 0.761122465133667, "memory(GiB)": 46.83, "nll_loss": 0.4497636556625366, "rewards/accuracies": 0.84375, "rewards/chosen": 0.06379126012325287, "rewards/margins": 2.3671936988830566, "rewards/rejected": -2.3034024238586426, "step": 454, "train_speed(iter/s)": 0.005433 }, { "epoch": 0.36711126799626836, "grad_norm": 1.585224986076355, "learning_rate": 0.00014984581732227492, "logits/chosen": -0.7161681652069092, "logits/rejected": -0.7274316549301147, "logps/chosen": -8.679915428161621, "logps/rejected": -39.74371337890625, "loss": 0.45609888434410095, "memory(GiB)": 46.83, "nll_loss": 0.3443814516067505, "rewards/accuracies": 1.0, "rewards/chosen": 0.48159369826316833, "rewards/margins": 3.0060887336730957, "rewards/rejected": -2.5244951248168945, "step": 455, "train_speed(iter/s)": 0.005433 }, { "epoch": 0.3679181059479085, "grad_norm": 5.118838310241699, "learning_rate": 0.00014961424752485308, "logits/chosen": -0.7437467575073242, "logits/rejected": -0.754626989364624, "logps/chosen": -11.635477066040039, "logps/rejected": -46.820133209228516, "loss": 0.9505035281181335, "memory(GiB)": 46.83, "nll_loss": 0.6606087684631348, "rewards/accuracies": 0.875, "rewards/chosen": -0.12925539910793304, "rewards/margins": 2.922895908355713, "rewards/rejected": -3.0521514415740967, "step": 456, "train_speed(iter/s)": 0.005433 }, { "epoch": 0.3687249438995487, "grad_norm": 6.369676113128662, "learning_rate": 0.00014938232425709672, "logits/chosen": -0.7123354077339172, "logits/rejected": -0.7202441692352295, "logps/chosen": -7.666382312774658, "logps/rejected": -39.06452178955078, "loss": 0.5345906019210815, "memory(GiB)": 46.83, "nll_loss": 0.288968950510025, "rewards/accuracies": 0.9375, "rewards/chosen": 0.09636388719081879, "rewards/margins": 2.4988255500793457, "rewards/rejected": -2.4024617671966553, "step": 457, "train_speed(iter/s)": 0.005434 }, { "epoch": 0.36953178185118885, "grad_norm": 4.273453712463379, "learning_rate": 0.00014915004917131344, "logits/chosen": -0.7618826627731323, "logits/rejected": -0.758380115032196, "logps/chosen": -9.670495986938477, "logps/rejected": -27.89179039001465, "loss": 0.6546672582626343, "memory(GiB)": 46.83, "nll_loss": 0.41434964537620544, "rewards/accuracies": 0.90625, "rewards/chosen": 0.03314019367098808, "rewards/margins": 2.1142916679382324, "rewards/rejected": -2.081151247024536, "step": 458, "train_speed(iter/s)": 0.005434 }, { "epoch": 0.37033861980282895, "grad_norm": 1.8925552368164062, "learning_rate": 0.0001489174239223172, "logits/chosen": -0.7534856200218201, "logits/rejected": -0.7552649974822998, "logps/chosen": -7.762975215911865, "logps/rejected": -33.306766510009766, "loss": 0.44340604543685913, "memory(GiB)": 46.83, "nll_loss": 0.23383133113384247, "rewards/accuracies": 0.90625, "rewards/chosen": 0.27828943729400635, "rewards/margins": 2.5259461402893066, "rewards/rejected": -2.247657060623169, "step": 459, "train_speed(iter/s)": 0.005434 }, { "epoch": 0.3711454577544691, "grad_norm": 3.5424697399139404, "learning_rate": 0.00014868445016741677, "logits/chosen": -0.7251965403556824, "logits/rejected": -0.7256088852882385, "logps/chosen": -13.685113906860352, "logps/rejected": -30.76580238342285, "loss": 0.8778742551803589, "memory(GiB)": 46.83, "nll_loss": 0.578425407409668, "rewards/accuracies": 0.90625, "rewards/chosen": 0.04395178705453873, "rewards/margins": 2.217789649963379, "rewards/rejected": -2.173837900161743, "step": 460, "train_speed(iter/s)": 0.005434 }, { "epoch": 0.37195229570610927, "grad_norm": 4.210732460021973, "learning_rate": 0.00014845112956640369, "logits/chosen": -0.7375807166099548, "logits/rejected": -0.7479276657104492, "logps/chosen": -10.048831939697266, "logps/rejected": -41.19210433959961, "loss": 0.5977764129638672, "memory(GiB)": 46.83, "nll_loss": 0.3318694531917572, "rewards/accuracies": 0.84375, "rewards/chosen": 0.19474266469478607, "rewards/margins": 3.0025835037231445, "rewards/rejected": -2.8078413009643555, "step": 461, "train_speed(iter/s)": 0.005434 }, { "epoch": 0.37275913365774943, "grad_norm": 4.395127296447754, "learning_rate": 0.00014821746378154062, "logits/chosen": -0.6776711940765381, "logits/rejected": -0.6841428279876709, "logps/chosen": -6.95946741104126, "logps/rejected": -36.13311767578125, "loss": 0.4928424060344696, "memory(GiB)": 46.83, "nll_loss": 0.30789151787757874, "rewards/accuracies": 0.9375, "rewards/chosen": 0.32969141006469727, "rewards/margins": 2.7516045570373535, "rewards/rejected": -2.4219131469726562, "step": 462, "train_speed(iter/s)": 0.005434 }, { "epoch": 0.3735659716093896, "grad_norm": 3.365333318710327, "learning_rate": 0.00014798345447754948, "logits/chosen": -0.7575942277908325, "logits/rejected": -0.7648032903671265, "logps/chosen": -8.037223815917969, "logps/rejected": -43.406375885009766, "loss": 0.5700507164001465, "memory(GiB)": 46.83, "nll_loss": 0.37956228852272034, "rewards/accuracies": 0.96875, "rewards/chosen": 0.2864043116569519, "rewards/margins": 3.18467116355896, "rewards/rejected": -2.8982667922973633, "step": 463, "train_speed(iter/s)": 0.005434 }, { "epoch": 0.37437280956102975, "grad_norm": 7.311818599700928, "learning_rate": 0.0001477491033215994, "logits/chosen": -0.6993564963340759, "logits/rejected": -0.7100475430488586, "logps/chosen": -11.119054794311523, "logps/rejected": -40.00886917114258, "loss": 1.3310893774032593, "memory(GiB)": 46.83, "nll_loss": 0.6867990493774414, "rewards/accuracies": 0.84375, "rewards/chosen": -0.33331215381622314, "rewards/margins": 2.3917033672332764, "rewards/rejected": -2.725015640258789, "step": 464, "train_speed(iter/s)": 0.005434 }, { "epoch": 0.37517964751266986, "grad_norm": 10.936890602111816, "learning_rate": 0.00014751441198329523, "logits/chosen": -0.6920858025550842, "logits/rejected": -0.6920123100280762, "logps/chosen": -14.5137939453125, "logps/rejected": -37.997467041015625, "loss": 0.9086753726005554, "memory(GiB)": 46.83, "nll_loss": 0.5238281488418579, "rewards/accuracies": 0.875, "rewards/chosen": -0.10487417131662369, "rewards/margins": 2.618326187133789, "rewards/rejected": -2.7232000827789307, "step": 465, "train_speed(iter/s)": 0.005434 }, { "epoch": 0.37598648546431, "grad_norm": 15.677000045776367, "learning_rate": 0.0001472793821346652, "logits/chosen": -0.6896384954452515, "logits/rejected": -0.6940050721168518, "logps/chosen": -10.987081527709961, "logps/rejected": -40.3748779296875, "loss": 0.6646585464477539, "memory(GiB)": 46.83, "nll_loss": 0.45032551884651184, "rewards/accuracies": 0.90625, "rewards/chosen": 0.16333404183387756, "rewards/margins": 2.996572494506836, "rewards/rejected": -2.8332386016845703, "step": 466, "train_speed(iter/s)": 0.005434 }, { "epoch": 0.3767933234159502, "grad_norm": 4.351585865020752, "learning_rate": 0.00014704401545014925, "logits/chosen": -0.7135500311851501, "logits/rejected": -0.7152791023254395, "logps/chosen": -9.104679107666016, "logps/rejected": -35.246437072753906, "loss": 0.7736812829971313, "memory(GiB)": 46.83, "nll_loss": 0.42992913722991943, "rewards/accuracies": 0.90625, "rewards/chosen": 0.11151327192783356, "rewards/margins": 2.5536930561065674, "rewards/rejected": -2.4421796798706055, "step": 467, "train_speed(iter/s)": 0.005434 }, { "epoch": 0.37760016136759034, "grad_norm": 5.113152980804443, "learning_rate": 0.00014680831360658713, "logits/chosen": -0.631149172782898, "logits/rejected": -0.6411234140396118, "logps/chosen": -9.986248016357422, "logps/rejected": -47.841514587402344, "loss": 0.6793885231018066, "memory(GiB)": 46.83, "nll_loss": 0.4218906760215759, "rewards/accuracies": 0.84375, "rewards/chosen": 0.06469957530498505, "rewards/margins": 3.1944708824157715, "rewards/rejected": -3.1297712326049805, "step": 468, "train_speed(iter/s)": 0.005434 }, { "epoch": 0.3784069993192305, "grad_norm": 5.426872730255127, "learning_rate": 0.00014657227828320635, "logits/chosen": -0.6784893274307251, "logits/rejected": -0.6818794012069702, "logps/chosen": -11.335710525512695, "logps/rejected": -35.59712219238281, "loss": 0.751977264881134, "memory(GiB)": 46.83, "nll_loss": 0.4554847776889801, "rewards/accuracies": 0.84375, "rewards/chosen": 0.10514962673187256, "rewards/margins": 2.4257240295410156, "rewards/rejected": -2.3205745220184326, "step": 469, "train_speed(iter/s)": 0.005435 }, { "epoch": 0.3792138372708706, "grad_norm": 3.7496237754821777, "learning_rate": 0.0001463359111616103, "logits/chosen": -0.659194827079773, "logits/rejected": -0.6669769883155823, "logps/chosen": -14.53132438659668, "logps/rejected": -37.95043182373047, "loss": 0.8416832089424133, "memory(GiB)": 46.83, "nll_loss": 0.547598659992218, "rewards/accuracies": 0.84375, "rewards/chosen": 0.08502380549907684, "rewards/margins": 2.0641098022460938, "rewards/rejected": -1.9790860414505005, "step": 470, "train_speed(iter/s)": 0.005435 }, { "epoch": 0.38002067522251076, "grad_norm": 2.0352225303649902, "learning_rate": 0.0001460992139257661, "logits/chosen": -0.6402337551116943, "logits/rejected": -0.6429924964904785, "logps/chosen": -5.608386039733887, "logps/rejected": -33.254302978515625, "loss": 0.3905201256275177, "memory(GiB)": 46.83, "nll_loss": 0.2183467447757721, "rewards/accuracies": 0.9375, "rewards/chosen": 0.20369279384613037, "rewards/margins": 2.4486987590789795, "rewards/rejected": -2.2450060844421387, "step": 471, "train_speed(iter/s)": 0.005435 }, { "epoch": 0.3808275131741509, "grad_norm": 5.74570894241333, "learning_rate": 0.00014586218826199285, "logits/chosen": -0.643539547920227, "logits/rejected": -0.6555419564247131, "logps/chosen": -10.091498374938965, "logps/rejected": -36.76713562011719, "loss": 0.6122481226921082, "memory(GiB)": 46.83, "nll_loss": 0.4549962282180786, "rewards/accuracies": 0.96875, "rewards/chosen": 0.24730682373046875, "rewards/margins": 2.464998722076416, "rewards/rejected": -2.2176918983459473, "step": 472, "train_speed(iter/s)": 0.005435 }, { "epoch": 0.3816343511257911, "grad_norm": 2.2472074031829834, "learning_rate": 0.00014562483585894945, "logits/chosen": -0.6934607028961182, "logits/rejected": -0.6990819573402405, "logps/chosen": -8.899802207946777, "logps/rejected": -36.28021240234375, "loss": 0.5312250852584839, "memory(GiB)": 46.83, "nll_loss": 0.31914129853248596, "rewards/accuracies": 0.90625, "rewards/chosen": 0.30887866020202637, "rewards/margins": 2.640252113342285, "rewards/rejected": -2.3313732147216797, "step": 473, "train_speed(iter/s)": 0.005435 }, { "epoch": 0.38244118907743124, "grad_norm": 10.326676368713379, "learning_rate": 0.0001453871584076226, "logits/chosen": -0.6442930102348328, "logits/rejected": -0.6484919786453247, "logps/chosen": -9.037781715393066, "logps/rejected": -27.98940658569336, "loss": 0.7469712495803833, "memory(GiB)": 46.83, "nll_loss": 0.4642283320426941, "rewards/accuracies": 0.9375, "rewards/chosen": 0.17530076205730438, "rewards/margins": 1.7467072010040283, "rewards/rejected": -1.571406364440918, "step": 474, "train_speed(iter/s)": 0.005435 }, { "epoch": 0.3832480270290714, "grad_norm": 9.987951278686523, "learning_rate": 0.00014514915760131483, "logits/chosen": -0.7020606994628906, "logits/rejected": -0.702151894569397, "logps/chosen": -9.714710235595703, "logps/rejected": -23.569639205932617, "loss": 0.7522432208061218, "memory(GiB)": 46.83, "nll_loss": 0.40092915296554565, "rewards/accuracies": 0.8125, "rewards/chosen": 0.1317347288131714, "rewards/margins": 1.5514979362487793, "rewards/rejected": -1.4197630882263184, "step": 475, "train_speed(iter/s)": 0.005435 }, { "epoch": 0.3840548649807115, "grad_norm": 2.1257741451263428, "learning_rate": 0.00014491083513563222, "logits/chosen": -0.6923786401748657, "logits/rejected": -0.6987132430076599, "logps/chosen": -7.563580513000488, "logps/rejected": -29.709890365600586, "loss": 0.5339487195014954, "memory(GiB)": 46.83, "nll_loss": 0.31400057673454285, "rewards/accuracies": 0.9375, "rewards/chosen": 0.370953232049942, "rewards/margins": 2.0969557762145996, "rewards/rejected": -1.7260024547576904, "step": 476, "train_speed(iter/s)": 0.005435 }, { "epoch": 0.38486170293235167, "grad_norm": 3.4022998809814453, "learning_rate": 0.00014467219270847265, "logits/chosen": -0.6793309450149536, "logits/rejected": -0.6822490692138672, "logps/chosen": -8.713945388793945, "logps/rejected": -35.1626091003418, "loss": 0.5065045356750488, "memory(GiB)": 46.83, "nll_loss": 0.2830030620098114, "rewards/accuracies": 0.9375, "rewards/chosen": 0.1324760913848877, "rewards/margins": 2.0448875427246094, "rewards/rejected": -1.9124114513397217, "step": 477, "train_speed(iter/s)": 0.005435 }, { "epoch": 0.38566854088399183, "grad_norm": 3.169051170349121, "learning_rate": 0.0001444332320200134, "logits/chosen": -0.7434568405151367, "logits/rejected": -0.7467195391654968, "logps/chosen": -8.970917701721191, "logps/rejected": -25.424684524536133, "loss": 0.7533260583877563, "memory(GiB)": 46.83, "nll_loss": 0.3945104777812958, "rewards/accuracies": 0.84375, "rewards/chosen": 0.08574176579713821, "rewards/margins": 1.5797266960144043, "rewards/rejected": -1.4939846992492676, "step": 478, "train_speed(iter/s)": 0.005435 }, { "epoch": 0.386475378835632, "grad_norm": 3.456509828567505, "learning_rate": 0.00014419395477269922, "logits/chosen": -0.7100328207015991, "logits/rejected": -0.7100369334220886, "logps/chosen": -8.946069717407227, "logps/rejected": -26.77371597290039, "loss": 0.703390896320343, "memory(GiB)": 46.83, "nll_loss": 0.3992156982421875, "rewards/accuracies": 0.90625, "rewards/chosen": 0.23448720574378967, "rewards/margins": 1.9379780292510986, "rewards/rejected": -1.7034906148910522, "step": 479, "train_speed(iter/s)": 0.005436 }, { "epoch": 0.38728221678727215, "grad_norm": 2.8148579597473145, "learning_rate": 0.00014395436267123016, "logits/chosen": -0.7651592493057251, "logits/rejected": -0.7705404758453369, "logps/chosen": -9.789369583129883, "logps/rejected": -32.379886627197266, "loss": 0.6621928811073303, "memory(GiB)": 46.83, "nll_loss": 0.42258700728416443, "rewards/accuracies": 0.875, "rewards/chosen": 0.3690515160560608, "rewards/margins": 2.27026629447937, "rewards/rejected": -1.9012147188186646, "step": 480, "train_speed(iter/s)": 0.005436 }, { "epoch": 0.3880890547389123, "grad_norm": 2.1083407402038574, "learning_rate": 0.00014371445742254933, "logits/chosen": -0.7674591541290283, "logits/rejected": -0.7766936421394348, "logps/chosen": -7.339907646179199, "logps/rejected": -41.22381591796875, "loss": 0.46437036991119385, "memory(GiB)": 46.83, "nll_loss": 0.32933878898620605, "rewards/accuracies": 0.96875, "rewards/chosen": 0.4231037497520447, "rewards/margins": 2.872163772583008, "rewards/rejected": -2.4490599632263184, "step": 481, "train_speed(iter/s)": 0.005436 }, { "epoch": 0.3888958926905524, "grad_norm": 9.479911804199219, "learning_rate": 0.00014347424073583086, "logits/chosen": -0.7989487648010254, "logits/rejected": -0.8022449016571045, "logps/chosen": -6.2405619621276855, "logps/rejected": -35.935890197753906, "loss": 0.4960899353027344, "memory(GiB)": 46.83, "nll_loss": 0.32181254029273987, "rewards/accuracies": 0.90625, "rewards/chosen": 0.3059425950050354, "rewards/margins": 2.816394805908203, "rewards/rejected": -2.5104520320892334, "step": 482, "train_speed(iter/s)": 0.005436 }, { "epoch": 0.3897027306421926, "grad_norm": 30.05691909790039, "learning_rate": 0.00014323371432246773, "logits/chosen": -0.7825378775596619, "logits/rejected": -0.7933679819107056, "logps/chosen": -7.802068710327148, "logps/rejected": -29.27901840209961, "loss": 0.8247991800308228, "memory(GiB)": 46.83, "nll_loss": 0.445316344499588, "rewards/accuracies": 0.8125, "rewards/chosen": 0.19992296397686005, "rewards/margins": 1.4237523078918457, "rewards/rejected": -1.2238292694091797, "step": 483, "train_speed(iter/s)": 0.005436 }, { "epoch": 0.39050956859383273, "grad_norm": 3.872990131378174, "learning_rate": 0.00014299287989605943, "logits/chosen": -0.7813780903816223, "logits/rejected": -0.7811882495880127, "logps/chosen": -9.697345733642578, "logps/rejected": -30.960369110107422, "loss": 0.5493797063827515, "memory(GiB)": 46.83, "nll_loss": 0.3628386855125427, "rewards/accuracies": 0.9375, "rewards/chosen": 0.29603177309036255, "rewards/margins": 2.3790576457977295, "rewards/rejected": -2.0830256938934326, "step": 484, "train_speed(iter/s)": 0.005436 }, { "epoch": 0.3913164065454729, "grad_norm": 12.008702278137207, "learning_rate": 0.00014275173917239993, "logits/chosen": -0.7886897325515747, "logits/rejected": -0.7941228747367859, "logps/chosen": -7.900599002838135, "logps/rejected": -31.16321563720703, "loss": 0.7939125895500183, "memory(GiB)": 46.83, "nll_loss": 0.45570316910743713, "rewards/accuracies": 0.875, "rewards/chosen": 0.10572385787963867, "rewards/margins": 1.8910467624664307, "rewards/rejected": -1.785322904586792, "step": 485, "train_speed(iter/s)": 0.005437 }, { "epoch": 0.39212324449711305, "grad_norm": 5.970835208892822, "learning_rate": 0.00014251029386946532, "logits/chosen": -0.8634493350982666, "logits/rejected": -0.8646601438522339, "logps/chosen": -6.923543453216553, "logps/rejected": -28.410593032836914, "loss": 0.5631651282310486, "memory(GiB)": 46.83, "nll_loss": 0.31717023253440857, "rewards/accuracies": 0.90625, "rewards/chosen": 0.24359825253486633, "rewards/margins": 2.0541610717773438, "rewards/rejected": -1.8105626106262207, "step": 486, "train_speed(iter/s)": 0.005437 }, { "epoch": 0.39293008244875316, "grad_norm": 2.754620313644409, "learning_rate": 0.00014226854570740168, "logits/chosen": -0.8398474454879761, "logits/rejected": -0.8498659133911133, "logps/chosen": -7.03415584564209, "logps/rejected": -40.334163665771484, "loss": 0.4721854329109192, "memory(GiB)": 46.83, "nll_loss": 0.34017014503479004, "rewards/accuracies": 1.0, "rewards/chosen": 0.16663886606693268, "rewards/margins": 2.977405309677124, "rewards/rejected": -2.8107664585113525, "step": 487, "train_speed(iter/s)": 0.005437 }, { "epoch": 0.3937369204003933, "grad_norm": 2.9349205493927, "learning_rate": 0.00014202649640851275, "logits/chosen": -0.8891080617904663, "logits/rejected": -0.8925038576126099, "logps/chosen": -5.047273635864258, "logps/rejected": -34.245174407958984, "loss": 0.3938831090927124, "memory(GiB)": 46.83, "nll_loss": 0.21636192500591278, "rewards/accuracies": 1.0, "rewards/chosen": 0.2093987911939621, "rewards/margins": 2.6690750122070312, "rewards/rejected": -2.4596762657165527, "step": 488, "train_speed(iter/s)": 0.005437 }, { "epoch": 0.3945437583520335, "grad_norm": 6.7003173828125, "learning_rate": 0.00014178414769724766, "logits/chosen": -0.8764248490333557, "logits/rejected": -0.876374363899231, "logps/chosen": -8.440370559692383, "logps/rejected": -35.263214111328125, "loss": 0.5095587968826294, "memory(GiB)": 46.83, "nll_loss": 0.34542787075042725, "rewards/accuracies": 0.96875, "rewards/chosen": 0.19051702320575714, "rewards/margins": 2.7904720306396484, "rewards/rejected": -2.5999550819396973, "step": 489, "train_speed(iter/s)": 0.005438 }, { "epoch": 0.39535059630367364, "grad_norm": 3.259153366088867, "learning_rate": 0.00014154150130018866, "logits/chosen": -0.9377500414848328, "logits/rejected": -0.9458149671554565, "logps/chosen": -11.506027221679688, "logps/rejected": -35.232669830322266, "loss": 0.6641853451728821, "memory(GiB)": 46.83, "nll_loss": 0.46648576855659485, "rewards/accuracies": 0.875, "rewards/chosen": 0.3142199218273163, "rewards/margins": 2.9259414672851562, "rewards/rejected": -2.6117210388183594, "step": 490, "train_speed(iter/s)": 0.005438 }, { "epoch": 0.3961574342553138, "grad_norm": 2.46926212310791, "learning_rate": 0.00014129855894603886, "logits/chosen": -0.9563973546028137, "logits/rejected": -0.9663281440734863, "logps/chosen": -8.163786888122559, "logps/rejected": -45.545860290527344, "loss": 0.462195485830307, "memory(GiB)": 46.83, "nll_loss": 0.34487971663475037, "rewards/accuracies": 0.96875, "rewards/chosen": 0.1903153955936432, "rewards/margins": 3.344923257827759, "rewards/rejected": -3.1546080112457275, "step": 491, "train_speed(iter/s)": 0.005438 }, { "epoch": 0.39696427220695396, "grad_norm": 11.747800827026367, "learning_rate": 0.00014105532236560983, "logits/chosen": -0.9172489047050476, "logits/rejected": -0.9255672693252563, "logps/chosen": -8.56010627746582, "logps/rejected": -44.462188720703125, "loss": 0.5068323612213135, "memory(GiB)": 46.83, "nll_loss": 0.3179493546485901, "rewards/accuracies": 0.90625, "rewards/chosen": 0.13865207135677338, "rewards/margins": 2.8126437664031982, "rewards/rejected": -2.6739919185638428, "step": 492, "train_speed(iter/s)": 0.005438 }, { "epoch": 0.39777111015859407, "grad_norm": 5.142593860626221, "learning_rate": 0.00014081179329180943, "logits/chosen": -0.9059480428695679, "logits/rejected": -0.9175886511802673, "logps/chosen": -5.26338529586792, "logps/rejected": -45.20058822631836, "loss": 0.40461504459381104, "memory(GiB)": 46.83, "nll_loss": 0.20817551016807556, "rewards/accuracies": 0.9375, "rewards/chosen": 0.24090781807899475, "rewards/margins": 3.5246479511260986, "rewards/rejected": -3.283740282058716, "step": 493, "train_speed(iter/s)": 0.005438 }, { "epoch": 0.3985779481102342, "grad_norm": 13.850090980529785, "learning_rate": 0.00014056797345962915, "logits/chosen": -0.97746741771698, "logits/rejected": -0.9824937582015991, "logps/chosen": -8.306085586547852, "logps/rejected": -45.58984375, "loss": 0.7906121015548706, "memory(GiB)": 46.83, "nll_loss": 0.5601307153701782, "rewards/accuracies": 0.90625, "rewards/chosen": 0.0417952798306942, "rewards/margins": 3.4094972610473633, "rewards/rejected": -3.3677022457122803, "step": 494, "train_speed(iter/s)": 0.005439 }, { "epoch": 0.3993847860618744, "grad_norm": 2.4637293815612793, "learning_rate": 0.0001403238646061322, "logits/chosen": -0.9754372835159302, "logits/rejected": -0.9848412275314331, "logps/chosen": -7.990797996520996, "logps/rejected": -48.4688720703125, "loss": 0.4341033101081848, "memory(GiB)": 46.83, "nll_loss": 0.308696985244751, "rewards/accuracies": 0.9375, "rewards/chosen": 0.27976250648498535, "rewards/margins": 3.742406129837036, "rewards/rejected": -3.462643623352051, "step": 495, "train_speed(iter/s)": 0.005438 }, { "epoch": 0.40019162401351455, "grad_norm": 3.6680634021759033, "learning_rate": 0.00014007946847044065, "logits/chosen": -0.951252818107605, "logits/rejected": -0.9680181741714478, "logps/chosen": -4.847614765167236, "logps/rejected": -46.7112922668457, "loss": 0.383756160736084, "memory(GiB)": 46.83, "nll_loss": 0.24948665499687195, "rewards/accuracies": 0.96875, "rewards/chosen": 0.17591829597949982, "rewards/margins": 3.246157646179199, "rewards/rejected": -3.070239305496216, "step": 496, "train_speed(iter/s)": 0.005438 }, { "epoch": 0.4009984619651547, "grad_norm": 3.807244062423706, "learning_rate": 0.00013983478679372344, "logits/chosen": -0.9732386469841003, "logits/rejected": -0.9831098318099976, "logps/chosen": -7.762671947479248, "logps/rejected": -52.341617584228516, "loss": 0.43133464455604553, "memory(GiB)": 46.83, "nll_loss": 0.2912958860397339, "rewards/accuracies": 0.9375, "rewards/chosen": 0.1585668921470642, "rewards/margins": 3.8791747093200684, "rewards/rejected": -3.7206082344055176, "step": 497, "train_speed(iter/s)": 0.005438 }, { "epoch": 0.4018052999167948, "grad_norm": 14.390305519104004, "learning_rate": 0.00013958982131918372, "logits/chosen": -0.9233254194259644, "logits/rejected": -0.926517128944397, "logps/chosen": -11.224777221679688, "logps/rejected": -33.05560302734375, "loss": 0.8548044562339783, "memory(GiB)": 46.83, "nll_loss": 0.4569489359855652, "rewards/accuracies": 0.78125, "rewards/chosen": 0.0009491965174674988, "rewards/margins": 2.3791630268096924, "rewards/rejected": -2.378213882446289, "step": 498, "train_speed(iter/s)": 0.005439 }, { "epoch": 0.40261213786843497, "grad_norm": 7.265214443206787, "learning_rate": 0.00013934457379204658, "logits/chosen": -0.9037230014801025, "logits/rejected": -0.9072719216346741, "logps/chosen": -13.305590629577637, "logps/rejected": -42.6323127746582, "loss": 0.5567822456359863, "memory(GiB)": 46.83, "nll_loss": 0.4082874059677124, "rewards/accuracies": 0.96875, "rewards/chosen": 0.3724799156188965, "rewards/margins": 3.5428996086120605, "rewards/rejected": -3.1704201698303223, "step": 499, "train_speed(iter/s)": 0.005439 }, { "epoch": 0.40341897582007513, "grad_norm": 2.8691728115081787, "learning_rate": 0.0001390990459595465, "logits/chosen": -0.9267888069152832, "logits/rejected": -0.936477780342102, "logps/chosen": -9.545984268188477, "logps/rejected": -42.449127197265625, "loss": 0.7537754774093628, "memory(GiB)": 46.83, "nll_loss": 0.5160152912139893, "rewards/accuracies": 0.9375, "rewards/chosen": 0.12287023663520813, "rewards/margins": 3.151482105255127, "rewards/rejected": -3.0286121368408203, "step": 500, "train_speed(iter/s)": 0.005439 }, { "epoch": 0.4042258137717153, "grad_norm": 17.34552764892578, "learning_rate": 0.00013885323957091503, "logits/chosen": -0.8896504640579224, "logits/rejected": -0.8915640115737915, "logps/chosen": -9.813822746276855, "logps/rejected": -36.02322769165039, "loss": 1.0269454717636108, "memory(GiB)": 46.83, "nll_loss": 0.6156859397888184, "rewards/accuracies": 0.84375, "rewards/chosen": -0.17760202288627625, "rewards/margins": 2.4105653762817383, "rewards/rejected": -2.588167667388916, "step": 501, "train_speed(iter/s)": 0.005438 }, { "epoch": 0.40503265172335545, "grad_norm": 2.611849069595337, "learning_rate": 0.00013860715637736818, "logits/chosen": -0.8846621513366699, "logits/rejected": -0.8913875222206116, "logps/chosen": -7.3572540283203125, "logps/rejected": -43.120914459228516, "loss": 0.5870882868766785, "memory(GiB)": 46.83, "nll_loss": 0.45941975712776184, "rewards/accuracies": 1.0, "rewards/chosen": 0.24965612590312958, "rewards/margins": 3.1028006076812744, "rewards/rejected": -2.8531441688537598, "step": 502, "train_speed(iter/s)": 0.005438 }, { "epoch": 0.4058394896749956, "grad_norm": 9.19338607788086, "learning_rate": 0.00013836079813209405, "logits/chosen": -0.8596163988113403, "logits/rejected": -0.8734834790229797, "logps/chosen": -6.4730024337768555, "logps/rejected": -48.3375358581543, "loss": 0.5926974415779114, "memory(GiB)": 46.83, "nll_loss": 0.40696945786476135, "rewards/accuracies": 0.96875, "rewards/chosen": 0.13774055242538452, "rewards/margins": 3.3298587799072266, "rewards/rejected": -3.1921184062957764, "step": 503, "train_speed(iter/s)": 0.005438 }, { "epoch": 0.4066463276266357, "grad_norm": 2.5772955417633057, "learning_rate": 0.00013811416659024035, "logits/chosen": -0.8637710809707642, "logits/rejected": -0.869887113571167, "logps/chosen": -8.725384712219238, "logps/rejected": -44.57448959350586, "loss": 0.5925300717353821, "memory(GiB)": 46.83, "nll_loss": 0.48120686411857605, "rewards/accuracies": 0.96875, "rewards/chosen": 0.12150951474905014, "rewards/margins": 3.436396598815918, "rewards/rejected": -3.314887046813965, "step": 504, "train_speed(iter/s)": 0.005438 }, { "epoch": 0.4074531655782759, "grad_norm": 4.892908096313477, "learning_rate": 0.00013786726350890183, "logits/chosen": -0.874576210975647, "logits/rejected": -0.8784814476966858, "logps/chosen": -9.178255081176758, "logps/rejected": -38.52834701538086, "loss": 0.6706528067588806, "memory(GiB)": 46.83, "nll_loss": 0.49778318405151367, "rewards/accuracies": 0.9375, "rewards/chosen": 0.21889682114124298, "rewards/margins": 3.011408805847168, "rewards/rejected": -2.7925119400024414, "step": 505, "train_speed(iter/s)": 0.005439 }, { "epoch": 0.40826000352991604, "grad_norm": 2.44610333442688, "learning_rate": 0.00013762009064710774, "logits/chosen": -0.8441749811172485, "logits/rejected": -0.8464869260787964, "logps/chosen": -7.5994648933410645, "logps/rejected": -34.768951416015625, "loss": 0.5083529353141785, "memory(GiB)": 46.83, "nll_loss": 0.3053922653198242, "rewards/accuracies": 0.9375, "rewards/chosen": 0.30249646306037903, "rewards/margins": 2.588782787322998, "rewards/rejected": -2.2862861156463623, "step": 506, "train_speed(iter/s)": 0.005439 }, { "epoch": 0.4090668414815562, "grad_norm": 6.779381275177002, "learning_rate": 0.00013737264976580943, "logits/chosen": -0.8816607594490051, "logits/rejected": -0.8868498206138611, "logps/chosen": -11.123010635375977, "logps/rejected": -37.859195709228516, "loss": 0.8256106376647949, "memory(GiB)": 46.83, "nll_loss": 0.40417546033859253, "rewards/accuracies": 0.8125, "rewards/chosen": -0.1513340175151825, "rewards/margins": 2.473325252532959, "rewards/rejected": -2.624659299850464, "step": 507, "train_speed(iter/s)": 0.005439 }, { "epoch": 0.40987367943319636, "grad_norm": 3.7313573360443115, "learning_rate": 0.00013712494262786766, "logits/chosen": -0.8750671148300171, "logits/rejected": -0.8821631669998169, "logps/chosen": -10.883421897888184, "logps/rejected": -42.575679779052734, "loss": 0.748051643371582, "memory(GiB)": 46.83, "nll_loss": 0.5597954988479614, "rewards/accuracies": 0.90625, "rewards/chosen": 0.19764858484268188, "rewards/margins": 3.004587173461914, "rewards/rejected": -2.806938409805298, "step": 508, "train_speed(iter/s)": 0.005438 }, { "epoch": 0.41068051738483646, "grad_norm": 2.834299087524414, "learning_rate": 0.0001368769709980401, "logits/chosen": -0.862756073474884, "logits/rejected": -0.8707681894302368, "logps/chosen": -8.581947326660156, "logps/rejected": -42.503753662109375, "loss": 0.3937508761882782, "memory(GiB)": 46.83, "nll_loss": 0.23043422400951385, "rewards/accuracies": 0.96875, "rewards/chosen": 0.2632564604282379, "rewards/margins": 2.976945400238037, "rewards/rejected": -2.713688850402832, "step": 509, "train_speed(iter/s)": 0.005439 }, { "epoch": 0.4114873553364766, "grad_norm": 2.886272668838501, "learning_rate": 0.00013662873664296884, "logits/chosen": -0.819119930267334, "logits/rejected": -0.826356053352356, "logps/chosen": -8.14879035949707, "logps/rejected": -42.62828826904297, "loss": 0.5604068636894226, "memory(GiB)": 46.83, "nll_loss": 0.31821465492248535, "rewards/accuracies": 0.90625, "rewards/chosen": 0.3842453360557556, "rewards/margins": 3.0441181659698486, "rewards/rejected": -2.6598730087280273, "step": 510, "train_speed(iter/s)": 0.005439 }, { "epoch": 0.4122941932881168, "grad_norm": 3.3949501514434814, "learning_rate": 0.00013638024133116763, "logits/chosen": -0.802520215511322, "logits/rejected": -0.8098280429840088, "logps/chosen": -12.40538215637207, "logps/rejected": -38.84916305541992, "loss": 0.8826647400856018, "memory(GiB)": 46.83, "nll_loss": 0.5703054666519165, "rewards/accuracies": 0.90625, "rewards/chosen": 0.012079771608114243, "rewards/margins": 2.588003396987915, "rewards/rejected": -2.575923442840576, "step": 511, "train_speed(iter/s)": 0.005439 }, { "epoch": 0.41310103123975694, "grad_norm": 6.568037509918213, "learning_rate": 0.00013613148683300937, "logits/chosen": -0.8070806860923767, "logits/rejected": -0.813240647315979, "logps/chosen": -9.467267990112305, "logps/rejected": -39.797325134277344, "loss": 0.5164275765419006, "memory(GiB)": 46.83, "nll_loss": 0.39448225498199463, "rewards/accuracies": 0.96875, "rewards/chosen": 0.28209254145622253, "rewards/margins": 2.9220352172851562, "rewards/rejected": -2.6399426460266113, "step": 512, "train_speed(iter/s)": 0.00544 }, { "epoch": 0.4139078691913971, "grad_norm": 10.136809349060059, "learning_rate": 0.0001358824749207136, "logits/chosen": -0.8575885891914368, "logits/rejected": -0.8593306541442871, "logps/chosen": -10.6421480178833, "logps/rejected": -39.468055725097656, "loss": 0.7010791301727295, "memory(GiB)": 46.83, "nll_loss": 0.5033397674560547, "rewards/accuracies": 0.9375, "rewards/chosen": 0.156565859913826, "rewards/margins": 2.7266011238098145, "rewards/rejected": -2.570035219192505, "step": 513, "train_speed(iter/s)": 0.00544 }, { "epoch": 0.41471470714303726, "grad_norm": 3.576723098754883, "learning_rate": 0.00013563320736833365, "logits/chosen": -0.8105019330978394, "logits/rejected": -0.8146560788154602, "logps/chosen": -10.574302673339844, "logps/rejected": -36.661590576171875, "loss": 0.665181040763855, "memory(GiB)": 46.83, "nll_loss": 0.4042365849018097, "rewards/accuracies": 0.90625, "rewards/chosen": 0.13927578926086426, "rewards/margins": 2.6975083351135254, "rewards/rejected": -2.558232545852661, "step": 514, "train_speed(iter/s)": 0.00544 }, { "epoch": 0.41552154509467737, "grad_norm": 2.363494396209717, "learning_rate": 0.00013538368595174423, "logits/chosen": -0.8046780228614807, "logits/rejected": -0.8101540803909302, "logps/chosen": -12.763677597045898, "logps/rejected": -39.75190353393555, "loss": 0.5567308664321899, "memory(GiB)": 46.83, "nll_loss": 0.4450889527797699, "rewards/accuracies": 1.0, "rewards/chosen": 0.285984069108963, "rewards/margins": 3.129922389984131, "rewards/rejected": -2.843937873840332, "step": 515, "train_speed(iter/s)": 0.00544 }, { "epoch": 0.41632838304631753, "grad_norm": 2.798708438873291, "learning_rate": 0.0001351339124486286, "logits/chosen": -0.823294460773468, "logits/rejected": -0.8240728974342346, "logps/chosen": -8.804251670837402, "logps/rejected": -36.77720260620117, "loss": 0.5373676419258118, "memory(GiB)": 46.83, "nll_loss": 0.35823625326156616, "rewards/accuracies": 0.9375, "rewards/chosen": 0.25987887382507324, "rewards/margins": 2.7686750888824463, "rewards/rejected": -2.508796453475952, "step": 516, "train_speed(iter/s)": 0.005439 }, { "epoch": 0.4171352209979577, "grad_norm": 3.738819122314453, "learning_rate": 0.00013488388863846598, "logits/chosen": -0.8327402472496033, "logits/rejected": -0.8359934091567993, "logps/chosen": -12.034650802612305, "logps/rejected": -33.55274200439453, "loss": 0.7193576097488403, "memory(GiB)": 46.83, "nll_loss": 0.506946325302124, "rewards/accuracies": 0.90625, "rewards/chosen": 0.16285476088523865, "rewards/margins": 2.3808743953704834, "rewards/rejected": -2.218019485473633, "step": 517, "train_speed(iter/s)": 0.005439 }, { "epoch": 0.41794205894959785, "grad_norm": 2.734147071838379, "learning_rate": 0.00013463361630251897, "logits/chosen": -0.8137484788894653, "logits/rejected": -0.8196120858192444, "logps/chosen": -16.61955451965332, "logps/rejected": -33.3659553527832, "loss": 0.8027633428573608, "memory(GiB)": 46.83, "nll_loss": 0.5399143099784851, "rewards/accuracies": 0.84375, "rewards/chosen": 0.31846553087234497, "rewards/margins": 2.49395751953125, "rewards/rejected": -2.1754918098449707, "step": 518, "train_speed(iter/s)": 0.00544 }, { "epoch": 0.418748896901238, "grad_norm": 1.6672159433364868, "learning_rate": 0.00013438309722382056, "logits/chosen": -0.8162409663200378, "logits/rejected": -0.8220106959342957, "logps/chosen": -8.6817045211792, "logps/rejected": -37.332298278808594, "loss": 0.4413672685623169, "memory(GiB)": 46.83, "nll_loss": 0.2940937876701355, "rewards/accuracies": 0.96875, "rewards/chosen": 0.28105995059013367, "rewards/margins": 2.7084476947784424, "rewards/rejected": -2.4273879528045654, "step": 519, "train_speed(iter/s)": 0.005439 }, { "epoch": 0.4195557348528781, "grad_norm": 2.7764697074890137, "learning_rate": 0.00013413233318716188, "logits/chosen": -0.8464371562004089, "logits/rejected": -0.8485240936279297, "logps/chosen": -10.62841796875, "logps/rejected": -36.70519256591797, "loss": 0.7128565907478333, "memory(GiB)": 46.83, "nll_loss": 0.46534037590026855, "rewards/accuracies": 0.875, "rewards/chosen": 0.22482553124427795, "rewards/margins": 2.6670079231262207, "rewards/rejected": -2.4421825408935547, "step": 520, "train_speed(iter/s)": 0.005439 }, { "epoch": 0.4203625728045183, "grad_norm": 4.593116760253906, "learning_rate": 0.00013388132597907904, "logits/chosen": -0.8110215663909912, "logits/rejected": -0.8151426315307617, "logps/chosen": -10.328957557678223, "logps/rejected": -38.320430755615234, "loss": 0.6786235570907593, "memory(GiB)": 46.83, "nll_loss": 0.339311420917511, "rewards/accuracies": 0.78125, "rewards/chosen": 0.1592826545238495, "rewards/margins": 2.4331724643707275, "rewards/rejected": -2.2738895416259766, "step": 521, "train_speed(iter/s)": 0.005439 }, { "epoch": 0.42116941075615844, "grad_norm": 4.485230445861816, "learning_rate": 0.0001336300773878407, "logits/chosen": -0.8129779696464539, "logits/rejected": -0.8200620412826538, "logps/chosen": -7.188672065734863, "logps/rejected": -38.45001220703125, "loss": 0.6729139089584351, "memory(GiB)": 46.83, "nll_loss": 0.4256826639175415, "rewards/accuracies": 0.90625, "rewards/chosen": 0.16748948395252228, "rewards/margins": 2.9809718132019043, "rewards/rejected": -2.8134822845458984, "step": 522, "train_speed(iter/s)": 0.005439 }, { "epoch": 0.4219762487077986, "grad_norm": 3.1994502544403076, "learning_rate": 0.00013337858920343512, "logits/chosen": -0.8458603024482727, "logits/rejected": -0.852841854095459, "logps/chosen": -8.571792602539062, "logps/rejected": -42.51072692871094, "loss": 0.4996880292892456, "memory(GiB)": 46.83, "nll_loss": 0.2992246150970459, "rewards/accuracies": 0.9375, "rewards/chosen": 0.23098604381084442, "rewards/margins": 3.1265108585357666, "rewards/rejected": -2.895524740219116, "step": 523, "train_speed(iter/s)": 0.005439 }, { "epoch": 0.42278308665943876, "grad_norm": 3.704655170440674, "learning_rate": 0.00013312686321755761, "logits/chosen": -0.8289926648139954, "logits/rejected": -0.8301224708557129, "logps/chosen": -7.220808029174805, "logps/rejected": -33.644962310791016, "loss": 0.4415580928325653, "memory(GiB)": 46.83, "nll_loss": 0.2433617264032364, "rewards/accuracies": 0.9375, "rewards/chosen": 0.19586443901062012, "rewards/margins": 2.462473154067993, "rewards/rejected": -2.266608238220215, "step": 524, "train_speed(iter/s)": 0.005439 }, { "epoch": 0.4235899246110789, "grad_norm": 14.6280517578125, "learning_rate": 0.0001328749012235976, "logits/chosen": -0.8482613563537598, "logits/rejected": -0.858103334903717, "logps/chosen": -6.205442905426025, "logps/rejected": -37.40229797363281, "loss": 0.7436372637748718, "memory(GiB)": 46.83, "nll_loss": 0.4056238830089569, "rewards/accuracies": 0.84375, "rewards/chosen": -0.02807258814573288, "rewards/margins": 2.8922817707061768, "rewards/rejected": -2.9203548431396484, "step": 525, "train_speed(iter/s)": 0.005439 }, { "epoch": 0.424396762562719, "grad_norm": 10.639749526977539, "learning_rate": 0.000132622705016626, "logits/chosen": -0.8543103337287903, "logits/rejected": -0.8550821542739868, "logps/chosen": -8.963075637817383, "logps/rejected": -44.753875732421875, "loss": 0.5276005864143372, "memory(GiB)": 46.83, "nll_loss": 0.3191993534564972, "rewards/accuracies": 0.9375, "rewards/chosen": -0.08133304864168167, "rewards/margins": 2.828303098678589, "rewards/rejected": -2.9096360206604004, "step": 526, "train_speed(iter/s)": 0.005439 }, { "epoch": 0.4252036005143592, "grad_norm": 5.606629848480225, "learning_rate": 0.00013237027639338223, "logits/chosen": -0.7930728197097778, "logits/rejected": -0.8049328327178955, "logps/chosen": -11.980341911315918, "logps/rejected": -42.134681701660156, "loss": 0.8973350524902344, "memory(GiB)": 46.83, "nll_loss": 0.6916304230690002, "rewards/accuracies": 0.875, "rewards/chosen": 0.2415471076965332, "rewards/margins": 2.853031635284424, "rewards/rejected": -2.6114845275878906, "step": 527, "train_speed(iter/s)": 0.005439 }, { "epoch": 0.42601043846599934, "grad_norm": 3.3900585174560547, "learning_rate": 0.0001321176171522617, "logits/chosen": -0.8453109264373779, "logits/rejected": -0.8487651348114014, "logps/chosen": -10.572664260864258, "logps/rejected": -33.60906982421875, "loss": 0.5498627424240112, "memory(GiB)": 46.83, "nll_loss": 0.4081331193447113, "rewards/accuracies": 0.96875, "rewards/chosen": 0.28006234765052795, "rewards/margins": 2.9145495891571045, "rewards/rejected": -2.6344871520996094, "step": 528, "train_speed(iter/s)": 0.005439 }, { "epoch": 0.4268172764176395, "grad_norm": 5.930169582366943, "learning_rate": 0.00013186472909330264, "logits/chosen": -0.8630443215370178, "logits/rejected": -0.8701946139335632, "logps/chosen": -7.021512985229492, "logps/rejected": -36.796783447265625, "loss": 0.7053890824317932, "memory(GiB)": 46.83, "nll_loss": 0.4606189727783203, "rewards/accuracies": 0.90625, "rewards/chosen": 0.2262631058692932, "rewards/margins": 2.8637092113494873, "rewards/rejected": -2.637446403503418, "step": 529, "train_speed(iter/s)": 0.00544 }, { "epoch": 0.42762411436927966, "grad_norm": 6.3762688636779785, "learning_rate": 0.00013161161401817353, "logits/chosen": -0.8374471068382263, "logits/rejected": -0.8438255786895752, "logps/chosen": -9.851973533630371, "logps/rejected": -39.308502197265625, "loss": 0.5261674523353577, "memory(GiB)": 46.83, "nll_loss": 0.33455437421798706, "rewards/accuracies": 0.90625, "rewards/chosen": 0.15020446479320526, "rewards/margins": 2.7218151092529297, "rewards/rejected": -2.571610689163208, "step": 530, "train_speed(iter/s)": 0.00544 }, { "epoch": 0.4284309523209198, "grad_norm": 6.240972995758057, "learning_rate": 0.00013135827373016027, "logits/chosen": -0.8955954313278198, "logits/rejected": -0.9030234813690186, "logps/chosen": -11.273481369018555, "logps/rejected": -34.91842269897461, "loss": 0.7530210614204407, "memory(GiB)": 46.83, "nll_loss": 0.5049380660057068, "rewards/accuracies": 0.90625, "rewards/chosen": 0.19476205110549927, "rewards/margins": 2.6257526874542236, "rewards/rejected": -2.430990695953369, "step": 531, "train_speed(iter/s)": 0.00544 }, { "epoch": 0.4292377902725599, "grad_norm": 3.5795764923095703, "learning_rate": 0.00013110471003415321, "logits/chosen": -0.8652918338775635, "logits/rejected": -0.8691776990890503, "logps/chosen": -8.708220481872559, "logps/rejected": -40.791812896728516, "loss": 0.5590424537658691, "memory(GiB)": 46.83, "nll_loss": 0.29747384786605835, "rewards/accuracies": 0.875, "rewards/chosen": 0.06008954346179962, "rewards/margins": 2.697359085083008, "rewards/rejected": -2.6372694969177246, "step": 532, "train_speed(iter/s)": 0.00544 }, { "epoch": 0.4300446282242001, "grad_norm": 3.8843157291412354, "learning_rate": 0.0001308509247366343, "logits/chosen": -0.7854755520820618, "logits/rejected": -0.792789101600647, "logps/chosen": -7.507791519165039, "logps/rejected": -49.7330322265625, "loss": 0.4467013478279114, "memory(GiB)": 46.83, "nll_loss": 0.27506744861602783, "rewards/accuracies": 0.90625, "rewards/chosen": 0.24458295106887817, "rewards/margins": 3.935803174972534, "rewards/rejected": -3.691220283508301, "step": 533, "train_speed(iter/s)": 0.00544 }, { "epoch": 0.43085146617584025, "grad_norm": 3.57249116897583, "learning_rate": 0.00013059691964566433, "logits/chosen": -0.8396457433700562, "logits/rejected": -0.8505795001983643, "logps/chosen": -8.021794319152832, "logps/rejected": -43.013790130615234, "loss": 0.6681239604949951, "memory(GiB)": 46.83, "nll_loss": 0.40499186515808105, "rewards/accuracies": 0.96875, "rewards/chosen": 0.14213377237319946, "rewards/margins": 3.0652308464050293, "rewards/rejected": -2.9230968952178955, "step": 534, "train_speed(iter/s)": 0.00544 }, { "epoch": 0.4316583041274804, "grad_norm": 5.327953338623047, "learning_rate": 0.00013034269657086992, "logits/chosen": -0.8565971255302429, "logits/rejected": -0.8621482253074646, "logps/chosen": -7.855462551116943, "logps/rejected": -44.381805419921875, "loss": 0.4837571680545807, "memory(GiB)": 46.83, "nll_loss": 0.32484912872314453, "rewards/accuracies": 0.90625, "rewards/chosen": 0.4074184000492096, "rewards/margins": 3.6497139930725098, "rewards/rejected": -3.242295265197754, "step": 535, "train_speed(iter/s)": 0.00544 }, { "epoch": 0.43246514207912057, "grad_norm": 4.380790710449219, "learning_rate": 0.00013008825732343073, "logits/chosen": -0.8305094838142395, "logits/rejected": -0.8384683132171631, "logps/chosen": -5.753545761108398, "logps/rejected": -40.71387481689453, "loss": 0.48914748430252075, "memory(GiB)": 46.83, "nll_loss": 0.27660253643989563, "rewards/accuracies": 0.90625, "rewards/chosen": 0.2127423733472824, "rewards/margins": 2.9575328826904297, "rewards/rejected": -2.744790554046631, "step": 536, "train_speed(iter/s)": 0.00544 }, { "epoch": 0.4332719800307607, "grad_norm": 2.478238344192505, "learning_rate": 0.0001298336037160665, "logits/chosen": -0.8390322327613831, "logits/rejected": -0.8421530723571777, "logps/chosen": -9.2628173828125, "logps/rejected": -33.14223861694336, "loss": 0.6333991289138794, "memory(GiB)": 46.83, "nll_loss": 0.385562539100647, "rewards/accuracies": 0.84375, "rewards/chosen": 0.2185012400150299, "rewards/margins": 2.4338998794555664, "rewards/rejected": -2.2153985500335693, "step": 537, "train_speed(iter/s)": 0.00544 }, { "epoch": 0.43407881798240083, "grad_norm": 4.371514320373535, "learning_rate": 0.00012957873756302415, "logits/chosen": -0.7974674701690674, "logits/rejected": -0.7956443428993225, "logps/chosen": -11.487338066101074, "logps/rejected": -37.02048110961914, "loss": 0.6238091588020325, "memory(GiB)": 46.83, "nll_loss": 0.4722408056259155, "rewards/accuracies": 0.96875, "rewards/chosen": 0.2411145120859146, "rewards/margins": 2.765226125717163, "rewards/rejected": -2.52411150932312, "step": 538, "train_speed(iter/s)": 0.00544 }, { "epoch": 0.434885655934041, "grad_norm": 2.3261210918426514, "learning_rate": 0.00012932366068006486, "logits/chosen": -0.8332119584083557, "logits/rejected": -0.8431892395019531, "logps/chosen": -5.291442394256592, "logps/rejected": -40.494781494140625, "loss": 0.35455459356307983, "memory(GiB)": 46.83, "nll_loss": 0.2400093972682953, "rewards/accuracies": 1.0, "rewards/chosen": 0.3891444504261017, "rewards/margins": 3.3702661991119385, "rewards/rejected": -2.981121778488159, "step": 539, "train_speed(iter/s)": 0.005441 }, { "epoch": 0.43569249388568115, "grad_norm": 3.177072763442993, "learning_rate": 0.00012906837488445115, "logits/chosen": -0.8743947744369507, "logits/rejected": -0.8769956827163696, "logps/chosen": -9.416547775268555, "logps/rejected": -38.16511917114258, "loss": 0.5091468095779419, "memory(GiB)": 46.83, "nll_loss": 0.34846216440200806, "rewards/accuracies": 1.0, "rewards/chosen": 0.2577158510684967, "rewards/margins": 2.8782832622528076, "rewards/rejected": -2.620567560195923, "step": 540, "train_speed(iter/s)": 0.005441 }, { "epoch": 0.4364993318373213, "grad_norm": 2.1750667095184326, "learning_rate": 0.00012881288199493378, "logits/chosen": -0.8983636498451233, "logits/rejected": -0.9017794132232666, "logps/chosen": -5.9792609214782715, "logps/rejected": -39.93588638305664, "loss": 0.42438769340515137, "memory(GiB)": 46.83, "nll_loss": 0.2854105830192566, "rewards/accuracies": 0.9375, "rewards/chosen": 0.38626906275749207, "rewards/margins": 3.287107467651367, "rewards/rejected": -2.9008383750915527, "step": 541, "train_speed(iter/s)": 0.005441 }, { "epoch": 0.4373061697889615, "grad_norm": 4.120799541473389, "learning_rate": 0.00012855718383173915, "logits/chosen": -0.8792024254798889, "logits/rejected": -0.8899410367012024, "logps/chosen": -8.377023696899414, "logps/rejected": -31.686115264892578, "loss": 0.6103077530860901, "memory(GiB)": 46.83, "nll_loss": 0.3152506947517395, "rewards/accuracies": 0.90625, "rewards/chosen": 0.3780965507030487, "rewards/margins": 2.42580246925354, "rewards/rejected": -2.047706127166748, "step": 542, "train_speed(iter/s)": 0.005442 }, { "epoch": 0.4381130077406016, "grad_norm": 2.2526559829711914, "learning_rate": 0.0001283012822165559, "logits/chosen": -0.9368709921836853, "logits/rejected": -0.9483405947685242, "logps/chosen": -6.628868103027344, "logps/rejected": -39.02850341796875, "loss": 0.38257747888565063, "memory(GiB)": 46.83, "nll_loss": 0.24682456254959106, "rewards/accuracies": 1.0, "rewards/chosen": 0.35517507791519165, "rewards/margins": 2.6254923343658447, "rewards/rejected": -2.270317554473877, "step": 543, "train_speed(iter/s)": 0.005442 }, { "epoch": 0.43891984569224174, "grad_norm": 2.8567118644714355, "learning_rate": 0.00012804517897252227, "logits/chosen": -0.9481716156005859, "logits/rejected": -0.9497692584991455, "logps/chosen": -7.450263977050781, "logps/rejected": -31.115060806274414, "loss": 0.47185516357421875, "memory(GiB)": 46.83, "nll_loss": 0.3170330822467804, "rewards/accuracies": 0.96875, "rewards/chosen": 0.31209883093833923, "rewards/margins": 2.585287570953369, "rewards/rejected": -2.273188591003418, "step": 544, "train_speed(iter/s)": 0.005442 }, { "epoch": 0.4397266836438819, "grad_norm": 3.762911319732666, "learning_rate": 0.00012778887592421293, "logits/chosen": -0.9280496835708618, "logits/rejected": -0.9334405660629272, "logps/chosen": -8.896903991699219, "logps/rejected": -45.50485610961914, "loss": 0.4354952573776245, "memory(GiB)": 46.83, "nll_loss": 0.2929496467113495, "rewards/accuracies": 0.96875, "rewards/chosen": 0.3440062999725342, "rewards/margins": 3.7558441162109375, "rewards/rejected": -3.4118378162384033, "step": 545, "train_speed(iter/s)": 0.005442 }, { "epoch": 0.44053352159552206, "grad_norm": 5.700692176818848, "learning_rate": 0.000127532374897626, "logits/chosen": -1.0263915061950684, "logits/rejected": -1.0273609161376953, "logps/chosen": -8.307823181152344, "logps/rejected": -36.91926574707031, "loss": 0.7563344836235046, "memory(GiB)": 46.83, "nll_loss": 0.43058276176452637, "rewards/accuracies": 0.84375, "rewards/chosen": -0.014373952522873878, "rewards/margins": 2.57063889503479, "rewards/rejected": -2.585012912750244, "step": 546, "train_speed(iter/s)": 0.005442 }, { "epoch": 0.4413403595471622, "grad_norm": 3.6434919834136963, "learning_rate": 0.0001272756777201701, "logits/chosen": -0.9778340458869934, "logits/rejected": -0.9919235110282898, "logps/chosen": -6.4957427978515625, "logps/rejected": -48.30223083496094, "loss": 0.48351603746414185, "memory(GiB)": 46.83, "nll_loss": 0.31254929304122925, "rewards/accuracies": 0.875, "rewards/chosen": 0.2537922263145447, "rewards/margins": 3.731672525405884, "rewards/rejected": -3.4778804779052734, "step": 547, "train_speed(iter/s)": 0.005442 }, { "epoch": 0.4421471974988023, "grad_norm": 15.765288352966309, "learning_rate": 0.00012701878622065136, "logits/chosen": -1.0241070985794067, "logits/rejected": -1.036070466041565, "logps/chosen": -8.980073928833008, "logps/rejected": -42.19818878173828, "loss": 0.648382842540741, "memory(GiB)": 46.83, "nll_loss": 0.4570547342300415, "rewards/accuracies": 0.9375, "rewards/chosen": 0.3133217394351959, "rewards/margins": 2.865694999694824, "rewards/rejected": -2.5523734092712402, "step": 548, "train_speed(iter/s)": 0.005442 }, { "epoch": 0.4429540354504425, "grad_norm": 7.8712992668151855, "learning_rate": 0.00012676170222926023, "logits/chosen": -1.0750609636306763, "logits/rejected": -1.08124840259552, "logps/chosen": -8.864872932434082, "logps/rejected": -44.60932540893555, "loss": 1.103929042816162, "memory(GiB)": 46.83, "nll_loss": 0.7646006345748901, "rewards/accuracies": 0.84375, "rewards/chosen": 0.1929735392332077, "rewards/margins": 3.46407413482666, "rewards/rejected": -3.2711007595062256, "step": 549, "train_speed(iter/s)": 0.005442 }, { "epoch": 0.44376087340208265, "grad_norm": 10.148578643798828, "learning_rate": 0.00012650442757755859, "logits/chosen": -1.0684211254119873, "logits/rejected": -1.0741227865219116, "logps/chosen": -9.018268585205078, "logps/rejected": -51.82669448852539, "loss": 0.7279898524284363, "memory(GiB)": 46.83, "nll_loss": 0.6217176914215088, "rewards/accuracies": 0.9375, "rewards/chosen": 0.23028400540351868, "rewards/margins": 4.1028971672058105, "rewards/rejected": -3.8726134300231934, "step": 550, "train_speed(iter/s)": 0.005442 } ], "logging_steps": 1, "max_steps": 1239, "num_input_tokens_seen": 0, "num_train_epochs": 1, "save_steps": 50, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": false }, "attributes": {} } }, "total_flos": 4.0254248959313183e+18, "train_batch_size": 1, "trial_name": null, "trial_params": null }