{ "best_global_step": null, "best_metric": null, "best_model_checkpoint": null, "epoch": 0.11157601115760112, "eval_steps": 300, "global_step": 50, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "epoch": 0.0022315202231520223, "grad_norm": 11.248553276062012, "learning_rate": 4.444444444444445e-06, "logits/chosen": -0.48349103331565857, "logits/rejected": -0.652603030204773, "logps/chosen": -8.859519004821777, "logps/rejected": -16.016435623168945, "loss": 1.3468515872955322, "memory(GiB)": 33.34, "nll_loss": 0.6537042856216431, "rewards/accuracies": 0.0, "rewards/chosen": 0.0, "rewards/margins": 0.0, "rewards/rejected": 0.0, "step": 1, "train_speed(iter/s)": 0.010678 }, { "epoch": 0.004463040446304045, "grad_norm": 8.97808837890625, "learning_rate": 8.88888888888889e-06, "logits/chosen": -0.5174899101257324, "logits/rejected": -0.6262180805206299, "logps/chosen": -9.287378311157227, "logps/rejected": -13.981985092163086, "loss": 1.290852665901184, "memory(GiB)": 36.2, "nll_loss": 0.5977055430412292, "rewards/accuracies": 0.0, "rewards/chosen": 0.0, "rewards/margins": 0.0, "rewards/rejected": 0.0, "step": 2, "train_speed(iter/s)": 0.010974 }, { "epoch": 0.0066945606694560665, "grad_norm": 7.36937141418457, "learning_rate": 1.3333333333333333e-05, "logits/chosen": -0.42612141370773315, "logits/rejected": -0.6118584871292114, "logps/chosen": -6.56147575378418, "logps/rejected": -16.162681579589844, "loss": 1.1864153146743774, "memory(GiB)": 36.2, "nll_loss": 0.492550790309906, "rewards/accuracies": 0.53125, "rewards/chosen": -0.0009138870518654585, "rewards/margins": -0.0012306026183068752, "rewards/rejected": 0.00031671510078012943, "step": 3, "train_speed(iter/s)": 0.011052 }, { "epoch": 0.00892608089260809, "grad_norm": 7.918132305145264, "learning_rate": 1.777777777777778e-05, "logits/chosen": -0.5244420170783997, "logits/rejected": -0.6519989371299744, "logps/chosen": -7.461406707763672, "logps/rejected": -17.006786346435547, "loss": 1.3234074115753174, "memory(GiB)": 39.28, "nll_loss": 0.6342031359672546, "rewards/accuracies": 0.625, "rewards/chosen": 0.0032776433508843184, "rewards/margins": 0.008089437149465084, "rewards/rejected": -0.004811794031411409, "step": 4, "train_speed(iter/s)": 0.011094 }, { "epoch": 0.011157601115760111, "grad_norm": 9.900442123413086, "learning_rate": 2.2222222222222223e-05, "logits/chosen": -0.5073186159133911, "logits/rejected": -0.6049282550811768, "logps/chosen": -7.057607650756836, "logps/rejected": -15.16832447052002, "loss": 1.071779489517212, "memory(GiB)": 39.28, "nll_loss": 0.40041351318359375, "rewards/accuracies": 0.75, "rewards/chosen": 0.022623565047979355, "rewards/margins": 0.04467733949422836, "rewards/rejected": -0.02205377072095871, "step": 5, "train_speed(iter/s)": 0.011121 }, { "epoch": 0.013389121338912133, "grad_norm": 5.12174129486084, "learning_rate": 2.6666666666666667e-05, "logits/chosen": -0.48164039850234985, "logits/rejected": -0.5844419002532959, "logps/chosen": -6.2985005378723145, "logps/rejected": -16.83810043334961, "loss": 1.2731884717941284, "memory(GiB)": 39.28, "nll_loss": 0.600845992565155, "rewards/accuracies": 0.65625, "rewards/chosen": 0.010373853147029877, "rewards/margins": 0.046181634068489075, "rewards/rejected": -0.0358077809214592, "step": 6, "train_speed(iter/s)": 0.011143 }, { "epoch": 0.015620641562064157, "grad_norm": 4.1249213218688965, "learning_rate": 3.111111111111111e-05, "logits/chosen": -0.5566272735595703, "logits/rejected": -0.6051127910614014, "logps/chosen": -5.424515724182129, "logps/rejected": -11.893548011779785, "loss": 1.1159045696258545, "memory(GiB)": 39.28, "nll_loss": 0.46413302421569824, "rewards/accuracies": 0.65625, "rewards/chosen": 0.009653191082179546, "rewards/margins": 0.11444520205259323, "rewards/rejected": -0.10479200631380081, "step": 7, "train_speed(iter/s)": 0.011163 }, { "epoch": 0.01785216178521618, "grad_norm": 3.8928415775299072, "learning_rate": 3.555555555555556e-05, "logits/chosen": -0.5597310662269592, "logits/rejected": -0.6341894268989563, "logps/chosen": -6.350505352020264, "logps/rejected": -20.239299774169922, "loss": 0.8606890439987183, "memory(GiB)": 39.28, "nll_loss": 0.3352409899234772, "rewards/accuracies": 0.8125, "rewards/chosen": -0.018700765445828438, "rewards/margins": 0.419380784034729, "rewards/rejected": -0.4380815923213959, "step": 8, "train_speed(iter/s)": 0.011179 }, { "epoch": 0.0200836820083682, "grad_norm": 7.264344692230225, "learning_rate": 4e-05, "logits/chosen": -0.500182569026947, "logits/rejected": -0.595187246799469, "logps/chosen": -16.194358825683594, "logps/rejected": -20.5479793548584, "loss": 1.6191558837890625, "memory(GiB)": 39.28, "nll_loss": 1.0435733795166016, "rewards/accuracies": 0.71875, "rewards/chosen": -0.21446219086647034, "rewards/margins": 0.40107572078704834, "rewards/rejected": -0.6155378818511963, "step": 9, "train_speed(iter/s)": 0.011188 }, { "epoch": 0.022315202231520222, "grad_norm": 7.542423725128174, "learning_rate": 4.4444444444444447e-05, "logits/chosen": -0.41380318999290466, "logits/rejected": -0.5418319702148438, "logps/chosen": -10.30124568939209, "logps/rejected": -26.6314697265625, "loss": 1.2661710977554321, "memory(GiB)": 39.28, "nll_loss": 0.6692220568656921, "rewards/accuracies": 0.65625, "rewards/chosen": -0.29620301723480225, "rewards/margins": 0.5043031573295593, "rewards/rejected": -0.8005062341690063, "step": 10, "train_speed(iter/s)": 0.01119 }, { "epoch": 0.024546722454672244, "grad_norm": 12.055508613586426, "learning_rate": 4.888888888888889e-05, "logits/chosen": -0.45050907135009766, "logits/rejected": -0.5843921899795532, "logps/chosen": -15.530860900878906, "logps/rejected": -27.80389976501465, "loss": 1.6187087297439575, "memory(GiB)": 39.28, "nll_loss": 1.0532186031341553, "rewards/accuracies": 0.71875, "rewards/chosen": -0.47808465361595154, "rewards/margins": 0.41364309191703796, "rewards/rejected": -0.8917278051376343, "step": 11, "train_speed(iter/s)": 0.011193 }, { "epoch": 0.026778242677824266, "grad_norm": 6.556560516357422, "learning_rate": 5.333333333333333e-05, "logits/chosen": -0.4449861943721771, "logits/rejected": -0.5602853894233704, "logps/chosen": -10.715709686279297, "logps/rejected": -27.810680389404297, "loss": 1.2998032569885254, "memory(GiB)": 42.68, "nll_loss": 0.6746751070022583, "rewards/accuracies": 0.5625, "rewards/chosen": -0.33532828092575073, "rewards/margins": 0.39097556471824646, "rewards/rejected": -0.7263038754463196, "step": 12, "train_speed(iter/s)": 0.011193 }, { "epoch": 0.02900976290097629, "grad_norm": 6.815319061279297, "learning_rate": 5.7777777777777776e-05, "logits/chosen": -0.45461201667785645, "logits/rejected": -0.5696772933006287, "logps/chosen": -8.947586059570312, "logps/rejected": -23.452707290649414, "loss": 1.347914218902588, "memory(GiB)": 42.68, "nll_loss": 0.7918389439582825, "rewards/accuracies": 0.75, "rewards/chosen": -0.14807622134685516, "rewards/margins": 0.4436675012111664, "rewards/rejected": -0.5917437076568604, "step": 13, "train_speed(iter/s)": 0.011196 }, { "epoch": 0.031241283124128313, "grad_norm": 4.015015125274658, "learning_rate": 6.222222222222222e-05, "logits/chosen": -0.4277312457561493, "logits/rejected": -0.5162039995193481, "logps/chosen": -7.859683513641357, "logps/rejected": -25.14496612548828, "loss": 1.1709389686584473, "memory(GiB)": 46.13, "nll_loss": 0.5424311757087708, "rewards/accuracies": 0.6875, "rewards/chosen": -0.09304673224687576, "rewards/margins": 0.27104437351226807, "rewards/rejected": -0.36409106850624084, "step": 14, "train_speed(iter/s)": 0.011191 }, { "epoch": 0.03347280334728033, "grad_norm": 2.5992424488067627, "learning_rate": 6.666666666666667e-05, "logits/chosen": -0.4692430794239044, "logits/rejected": -0.5111399292945862, "logps/chosen": -8.574230194091797, "logps/rejected": -16.565174102783203, "loss": 1.1323829889297485, "memory(GiB)": 46.13, "nll_loss": 0.5113993287086487, "rewards/accuracies": 0.6875, "rewards/chosen": -0.08413823693990707, "rewards/margins": 0.19407325983047485, "rewards/rejected": -0.27821147441864014, "step": 15, "train_speed(iter/s)": 0.011195 }, { "epoch": 0.03570432357043236, "grad_norm": 2.479030132293701, "learning_rate": 7.111111111111112e-05, "logits/chosen": -0.38820019364356995, "logits/rejected": -0.5241715908050537, "logps/chosen": -4.694685935974121, "logps/rejected": -19.62047576904297, "loss": 1.052955985069275, "memory(GiB)": 46.13, "nll_loss": 0.47422000765800476, "rewards/accuracies": 0.8125, "rewards/chosen": 0.06994247436523438, "rewards/margins": 0.2729727327823639, "rewards/rejected": -0.2030302733182907, "step": 16, "train_speed(iter/s)": 0.011196 }, { "epoch": 0.03793584379358438, "grad_norm": 2.1875240802764893, "learning_rate": 7.555555555555556e-05, "logits/chosen": -0.4483625292778015, "logits/rejected": -0.5458305478096008, "logps/chosen": -9.014262199401855, "logps/rejected": -18.748149871826172, "loss": 1.2149709463119507, "memory(GiB)": 46.13, "nll_loss": 0.6185500621795654, "rewards/accuracies": 0.75, "rewards/chosen": 0.1215842068195343, "rewards/margins": 0.24843284487724304, "rewards/rejected": -0.12684863805770874, "step": 17, "train_speed(iter/s)": 0.011197 }, { "epoch": 0.0401673640167364, "grad_norm": 2.639186382293701, "learning_rate": 8e-05, "logits/chosen": -0.4394489824771881, "logits/rejected": -0.48552829027175903, "logps/chosen": -9.954276084899902, "logps/rejected": -14.681390762329102, "loss": 1.1648714542388916, "memory(GiB)": 46.13, "nll_loss": 0.46223676204681396, "rewards/accuracies": 0.5625, "rewards/chosen": 0.011617322452366352, "rewards/margins": 0.034979358315467834, "rewards/rejected": -0.02336202934384346, "step": 18, "train_speed(iter/s)": 0.011199 }, { "epoch": 0.042398884239888426, "grad_norm": 2.351567029953003, "learning_rate": 8.444444444444444e-05, "logits/chosen": -0.4882590174674988, "logits/rejected": -0.5300821661949158, "logps/chosen": -7.595667362213135, "logps/rejected": -17.29962921142578, "loss": 1.1524200439453125, "memory(GiB)": 46.13, "nll_loss": 0.5075826644897461, "rewards/accuracies": 0.59375, "rewards/chosen": 0.06894361972808838, "rewards/margins": 0.13017994165420532, "rewards/rejected": -0.061236318200826645, "step": 19, "train_speed(iter/s)": 0.011201 }, { "epoch": 0.044630404463040445, "grad_norm": 2.8206121921539307, "learning_rate": 8.888888888888889e-05, "logits/chosen": -0.4782502055168152, "logits/rejected": -0.5565172433853149, "logps/chosen": -6.507530212402344, "logps/rejected": -13.604747772216797, "loss": 1.089160442352295, "memory(GiB)": 46.13, "nll_loss": 0.45874831080436707, "rewards/accuracies": 0.53125, "rewards/chosen": 0.06730557233095169, "rewards/margins": 0.18410882353782654, "rewards/rejected": -0.11680323630571365, "step": 20, "train_speed(iter/s)": 0.011206 }, { "epoch": 0.04686192468619247, "grad_norm": 2.452335834503174, "learning_rate": 9.333333333333334e-05, "logits/chosen": -0.4106925129890442, "logits/rejected": -0.48896345496177673, "logps/chosen": -7.722554683685303, "logps/rejected": -22.094852447509766, "loss": 1.153997540473938, "memory(GiB)": 46.71, "nll_loss": 0.5091268420219421, "rewards/accuracies": 0.71875, "rewards/chosen": 0.060057930648326874, "rewards/margins": 0.16068722307682037, "rewards/rejected": -0.1006293073296547, "step": 21, "train_speed(iter/s)": 0.011203 }, { "epoch": 0.04909344490934449, "grad_norm": 2.3324975967407227, "learning_rate": 9.777777777777778e-05, "logits/chosen": -0.4366399943828583, "logits/rejected": -0.4600733816623688, "logps/chosen": -9.774506568908691, "logps/rejected": -14.850456237792969, "loss": 1.185971975326538, "memory(GiB)": 46.71, "nll_loss": 0.5413804650306702, "rewards/accuracies": 0.5, "rewards/chosen": 0.08716820925474167, "rewards/margins": 0.17242644727230072, "rewards/rejected": -0.08525823801755905, "step": 22, "train_speed(iter/s)": 0.011203 }, { "epoch": 0.051324965132496514, "grad_norm": 2.7291500568389893, "learning_rate": 0.00010222222222222222, "logits/chosen": -0.4168204665184021, "logits/rejected": -0.5373830795288086, "logps/chosen": -7.675040245056152, "logps/rejected": -20.635356903076172, "loss": 1.1511971950531006, "memory(GiB)": 46.71, "nll_loss": 0.4784548282623291, "rewards/accuracies": 0.46875, "rewards/chosen": 0.05419651046395302, "rewards/margins": 0.0959930419921875, "rewards/rejected": -0.04179652780294418, "step": 23, "train_speed(iter/s)": 0.011204 }, { "epoch": 0.05355648535564853, "grad_norm": 2.6357204914093018, "learning_rate": 0.00010666666666666667, "logits/chosen": -0.39612719416618347, "logits/rejected": -0.4547193944454193, "logps/chosen": -9.427398681640625, "logps/rejected": -20.611848831176758, "loss": 1.0459527969360352, "memory(GiB)": 46.71, "nll_loss": 0.42900872230529785, "rewards/accuracies": 0.59375, "rewards/chosen": 0.0577767938375473, "rewards/margins": 0.24017955362796783, "rewards/rejected": -0.18240275979042053, "step": 24, "train_speed(iter/s)": 0.011203 }, { "epoch": 0.05578800557880056, "grad_norm": 2.7458126544952393, "learning_rate": 0.00011111111111111112, "logits/chosen": -0.3978196978569031, "logits/rejected": -0.4898090958595276, "logps/chosen": -9.801487922668457, "logps/rejected": -21.7921199798584, "loss": 1.1577973365783691, "memory(GiB)": 46.71, "nll_loss": 0.5382578372955322, "rewards/accuracies": 0.71875, "rewards/chosen": 0.03896612673997879, "rewards/margins": 0.24017201364040375, "rewards/rejected": -0.20120586454868317, "step": 25, "train_speed(iter/s)": 0.011205 }, { "epoch": 0.05801952580195258, "grad_norm": 4.185514450073242, "learning_rate": 0.00011555555555555555, "logits/chosen": -0.43978849053382874, "logits/rejected": -0.5358645915985107, "logps/chosen": -4.664649963378906, "logps/rejected": -18.568632125854492, "loss": 0.9911558032035828, "memory(GiB)": 46.71, "nll_loss": 0.39514851570129395, "rewards/accuracies": 0.6875, "rewards/chosen": -0.01693350076675415, "rewards/margins": 0.28997230529785156, "rewards/rejected": -0.3069058060646057, "step": 26, "train_speed(iter/s)": 0.011208 }, { "epoch": 0.0602510460251046, "grad_norm": 2.983151912689209, "learning_rate": 0.00012, "logits/chosen": -0.46957868337631226, "logits/rejected": -0.5086190700531006, "logps/chosen": -14.16710376739502, "logps/rejected": -15.19424819946289, "loss": 1.3119632005691528, "memory(GiB)": 46.71, "nll_loss": 0.732680082321167, "rewards/accuracies": 0.8125, "rewards/chosen": 0.1205766424536705, "rewards/margins": 0.2763415277004242, "rewards/rejected": -0.1557648628950119, "step": 27, "train_speed(iter/s)": 0.01121 }, { "epoch": 0.06248256624825663, "grad_norm": 3.7991929054260254, "learning_rate": 0.00012444444444444444, "logits/chosen": -0.3287929892539978, "logits/rejected": -0.46299535036087036, "logps/chosen": -6.527912616729736, "logps/rejected": -23.983104705810547, "loss": 1.0033739805221558, "memory(GiB)": 46.71, "nll_loss": 0.44460976123809814, "rewards/accuracies": 0.78125, "rewards/chosen": 0.07841134071350098, "rewards/margins": 0.3698306679725647, "rewards/rejected": -0.29141926765441895, "step": 28, "train_speed(iter/s)": 0.011207 }, { "epoch": 0.06471408647140865, "grad_norm": 3.0063183307647705, "learning_rate": 0.00012888888888888892, "logits/chosen": -0.3735123574733734, "logits/rejected": -0.458845853805542, "logps/chosen": -7.325934886932373, "logps/rejected": -21.65030288696289, "loss": 1.0098869800567627, "memory(GiB)": 46.71, "nll_loss": 0.477042555809021, "rewards/accuracies": 0.875, "rewards/chosen": 0.025919266045093536, "rewards/margins": 0.47939103841781616, "rewards/rejected": -0.4534717798233032, "step": 29, "train_speed(iter/s)": 0.011208 }, { "epoch": 0.06694560669456066, "grad_norm": 2.6957406997680664, "learning_rate": 0.00013333333333333334, "logits/chosen": -0.3790513873100281, "logits/rejected": -0.4815320372581482, "logps/chosen": -6.8280110359191895, "logps/rejected": -22.987621307373047, "loss": 1.0349267721176147, "memory(GiB)": 46.71, "nll_loss": 0.5045362114906311, "rewards/accuracies": 0.8125, "rewards/chosen": 0.09961891919374466, "rewards/margins": 0.4102502763271332, "rewards/rejected": -0.3106313645839691, "step": 30, "train_speed(iter/s)": 0.011209 }, { "epoch": 0.06917712691771269, "grad_norm": 2.7142391204833984, "learning_rate": 0.0001377777777777778, "logits/chosen": -0.36308056116104126, "logits/rejected": -0.44216084480285645, "logps/chosen": -5.850837230682373, "logps/rejected": -21.365463256835938, "loss": 0.9850523471832275, "memory(GiB)": 46.71, "nll_loss": 0.43448853492736816, "rewards/accuracies": 0.71875, "rewards/chosen": 0.0431375615298748, "rewards/margins": 0.3983423113822937, "rewards/rejected": -0.3552047610282898, "step": 31, "train_speed(iter/s)": 0.011211 }, { "epoch": 0.07140864714086471, "grad_norm": 3.897137403488159, "learning_rate": 0.00014222222222222224, "logits/chosen": -0.3979527950286865, "logits/rejected": -0.43778184056282043, "logps/chosen": -10.285924911499023, "logps/rejected": -18.7073974609375, "loss": 1.1233854293823242, "memory(GiB)": 46.71, "nll_loss": 0.5153944492340088, "rewards/accuracies": 0.625, "rewards/chosen": 0.026699109002947807, "rewards/margins": 0.23945647478103638, "rewards/rejected": -0.21275737881660461, "step": 32, "train_speed(iter/s)": 0.011213 }, { "epoch": 0.07364016736401674, "grad_norm": 3.93380069732666, "learning_rate": 0.00014666666666666666, "logits/chosen": -0.2758394777774811, "logits/rejected": -0.37545740604400635, "logps/chosen": -12.159762382507324, "logps/rejected": -24.926610946655273, "loss": 1.2487003803253174, "memory(GiB)": 46.71, "nll_loss": 0.6138952970504761, "rewards/accuracies": 0.6875, "rewards/chosen": -0.09166956692934036, "rewards/margins": 0.2808037996292114, "rewards/rejected": -0.3724733591079712, "step": 33, "train_speed(iter/s)": 0.011211 }, { "epoch": 0.07587168758716877, "grad_norm": 3.21878981590271, "learning_rate": 0.0001511111111111111, "logits/chosen": -0.24420826137065887, "logits/rejected": -0.38765522837638855, "logps/chosen": -6.041399955749512, "logps/rejected": -22.503984451293945, "loss": 0.9895752668380737, "memory(GiB)": 46.71, "nll_loss": 0.44009482860565186, "rewards/accuracies": 0.6875, "rewards/chosen": 0.010253368876874447, "rewards/margins": 0.5208209753036499, "rewards/rejected": -0.5105676054954529, "step": 34, "train_speed(iter/s)": 0.01121 }, { "epoch": 0.07810320781032078, "grad_norm": 5.1504316329956055, "learning_rate": 0.00015555555555555556, "logits/chosen": -0.2664889693260193, "logits/rejected": -0.40212178230285645, "logps/chosen": -5.9132609367370605, "logps/rejected": -24.527639389038086, "loss": 0.8355879187583923, "memory(GiB)": 46.71, "nll_loss": 0.4006969928741455, "rewards/accuracies": 0.84375, "rewards/chosen": -0.03980417177081108, "rewards/margins": 0.8774286508560181, "rewards/rejected": -0.9172328114509583, "step": 35, "train_speed(iter/s)": 0.011211 }, { "epoch": 0.0803347280334728, "grad_norm": 3.388197660446167, "learning_rate": 0.00016, "logits/chosen": -0.25354304909706116, "logits/rejected": -0.33330878615379333, "logps/chosen": -9.807186126708984, "logps/rejected": -22.963045120239258, "loss": 1.1024540662765503, "memory(GiB)": 46.71, "nll_loss": 0.6454060673713684, "rewards/accuracies": 0.84375, "rewards/chosen": -0.001722879707813263, "rewards/margins": 0.8297844529151917, "rewards/rejected": -0.8315073847770691, "step": 36, "train_speed(iter/s)": 0.011211 }, { "epoch": 0.08256624825662483, "grad_norm": 2.596273899078369, "learning_rate": 0.00016444444444444444, "logits/chosen": -0.21093566715717316, "logits/rejected": -0.3617200553417206, "logps/chosen": -2.8380072116851807, "logps/rejected": -30.42251968383789, "loss": 0.6882003545761108, "memory(GiB)": 46.71, "nll_loss": 0.2877930700778961, "rewards/accuracies": 0.84375, "rewards/chosen": 0.06296033412218094, "rewards/margins": 1.0582321882247925, "rewards/rejected": -0.9952719211578369, "step": 37, "train_speed(iter/s)": 0.01121 }, { "epoch": 0.08479776847977685, "grad_norm": 2.358452796936035, "learning_rate": 0.00016888888888888889, "logits/chosen": -0.2989475429058075, "logits/rejected": -0.37469911575317383, "logps/chosen": -6.1970534324646, "logps/rejected": -19.100358963012695, "loss": 0.8981406092643738, "memory(GiB)": 46.71, "nll_loss": 0.3934318423271179, "rewards/accuracies": 0.84375, "rewards/chosen": 0.002394435927271843, "rewards/margins": 0.6755657196044922, "rewards/rejected": -0.6731712818145752, "step": 38, "train_speed(iter/s)": 0.011211 }, { "epoch": 0.08702928870292886, "grad_norm": 2.9299051761627197, "learning_rate": 0.00017333333333333334, "logits/chosen": -0.2796667516231537, "logits/rejected": -0.34129300713539124, "logps/chosen": -8.498173713684082, "logps/rejected": -26.264965057373047, "loss": 1.012364387512207, "memory(GiB)": 46.71, "nll_loss": 0.586083173751831, "rewards/accuracies": 0.875, "rewards/chosen": 0.07207094132900238, "rewards/margins": 1.1341111660003662, "rewards/rejected": -1.0620403289794922, "step": 39, "train_speed(iter/s)": 0.011212 }, { "epoch": 0.08926080892608089, "grad_norm": 3.547189474105835, "learning_rate": 0.00017777777777777779, "logits/chosen": -0.28194305300712585, "logits/rejected": -0.33060967922210693, "logps/chosen": -7.982609748840332, "logps/rejected": -20.187652587890625, "loss": 0.9403265118598938, "memory(GiB)": 46.71, "nll_loss": 0.42783123254776, "rewards/accuracies": 0.6875, "rewards/chosen": 0.002833280712366104, "rewards/margins": 0.7690448760986328, "rewards/rejected": -0.7662116289138794, "step": 40, "train_speed(iter/s)": 0.011213 }, { "epoch": 0.09149232914923291, "grad_norm": 3.4967706203460693, "learning_rate": 0.00018222222222222224, "logits/chosen": -0.21270643174648285, "logits/rejected": -0.3004887104034424, "logps/chosen": -5.226779937744141, "logps/rejected": -22.208778381347656, "loss": 0.8620257377624512, "memory(GiB)": 46.71, "nll_loss": 0.3914262056350708, "rewards/accuracies": 0.71875, "rewards/chosen": 0.018529795110225677, "rewards/margins": 0.9286664128303528, "rewards/rejected": -0.9101365804672241, "step": 41, "train_speed(iter/s)": 0.011213 }, { "epoch": 0.09372384937238494, "grad_norm": 6.100057601928711, "learning_rate": 0.0001866666666666667, "logits/chosen": -0.29974937438964844, "logits/rejected": -0.36353808641433716, "logps/chosen": -10.446137428283691, "logps/rejected": -22.973119735717773, "loss": 1.2477580308914185, "memory(GiB)": 46.71, "nll_loss": 0.6882976293563843, "rewards/accuracies": 0.65625, "rewards/chosen": -0.2526606023311615, "rewards/margins": 0.5461662411689758, "rewards/rejected": -0.7988268136978149, "step": 42, "train_speed(iter/s)": 0.011214 }, { "epoch": 0.09595536959553697, "grad_norm": 4.625721454620361, "learning_rate": 0.00019111111111111114, "logits/chosen": -0.21875600516796112, "logits/rejected": -0.3691503405570984, "logps/chosen": -8.029109001159668, "logps/rejected": -33.986671447753906, "loss": 0.9927695989608765, "memory(GiB)": 46.71, "nll_loss": 0.6190873384475708, "rewards/accuracies": 0.78125, "rewards/chosen": -0.10942590236663818, "rewards/margins": 1.7278107404708862, "rewards/rejected": -1.837236762046814, "step": 43, "train_speed(iter/s)": 0.011215 }, { "epoch": 0.09818688981868898, "grad_norm": 4.994227886199951, "learning_rate": 0.00019555555555555556, "logits/chosen": -0.25192195177078247, "logits/rejected": -0.32522761821746826, "logps/chosen": -9.805305480957031, "logps/rejected": -34.161895751953125, "loss": 0.9997942447662354, "memory(GiB)": 46.71, "nll_loss": 0.6020480990409851, "rewards/accuracies": 0.75, "rewards/chosen": -0.30676746368408203, "rewards/margins": 1.7450387477874756, "rewards/rejected": -2.0518062114715576, "step": 44, "train_speed(iter/s)": 0.011214 }, { "epoch": 0.100418410041841, "grad_norm": 4.717008590698242, "learning_rate": 0.0002, "logits/chosen": -0.33617067337036133, "logits/rejected": -0.35846105217933655, "logps/chosen": -9.175792694091797, "logps/rejected": -21.536231994628906, "loss": 1.014683485031128, "memory(GiB)": 46.71, "nll_loss": 0.5040097236633301, "rewards/accuracies": 0.625, "rewards/chosen": 0.014129618182778358, "rewards/margins": 0.7111825942993164, "rewards/rejected": -0.6970530152320862, "step": 45, "train_speed(iter/s)": 0.011215 }, { "epoch": 0.10264993026499303, "grad_norm": 3.089895248413086, "learning_rate": 0.0001999993185874369, "logits/chosen": -0.3643554747104645, "logits/rejected": -0.3828020393848419, "logps/chosen": -11.385210990905762, "logps/rejected": -27.30405044555664, "loss": 0.9333115220069885, "memory(GiB)": 46.71, "nll_loss": 0.5031883120536804, "rewards/accuracies": 0.6875, "rewards/chosen": -0.08416246622800827, "rewards/margins": 1.1319228410720825, "rewards/rejected": -1.216085433959961, "step": 46, "train_speed(iter/s)": 0.011215 }, { "epoch": 0.10488145048814505, "grad_norm": 4.295483589172363, "learning_rate": 0.00019999727435903407, "logits/chosen": -0.3375833332538605, "logits/rejected": -0.44685542583465576, "logps/chosen": -4.36940336227417, "logps/rejected": -21.149555206298828, "loss": 0.959221601486206, "memory(GiB)": 46.71, "nll_loss": 0.42982059717178345, "rewards/accuracies": 0.8125, "rewards/chosen": 0.15477100014686584, "rewards/margins": 0.5941969752311707, "rewards/rejected": -0.4394259452819824, "step": 47, "train_speed(iter/s)": 0.011216 }, { "epoch": 0.10711297071129706, "grad_norm": 2.4132261276245117, "learning_rate": 0.0001999938673426507, "logits/chosen": -0.3103625178337097, "logits/rejected": -0.4320617616176605, "logps/chosen": -5.777155876159668, "logps/rejected": -20.897228240966797, "loss": 0.9094122648239136, "memory(GiB)": 46.71, "nll_loss": 0.41829684376716614, "rewards/accuracies": 0.8125, "rewards/chosen": 0.18217116594314575, "rewards/margins": 0.714988112449646, "rewards/rejected": -0.5328169465065002, "step": 48, "train_speed(iter/s)": 0.011216 }, { "epoch": 0.10934449093444909, "grad_norm": 2.716282367706299, "learning_rate": 0.00019998909758471852, "logits/chosen": -0.3802068829536438, "logits/rejected": -0.4424472749233246, "logps/chosen": -7.844504356384277, "logps/rejected": -21.755281448364258, "loss": 1.0127230882644653, "memory(GiB)": 46.71, "nll_loss": 0.5032894611358643, "rewards/accuracies": 0.6875, "rewards/chosen": 0.07639233767986298, "rewards/margins": 0.79319167137146, "rewards/rejected": -0.7167993187904358, "step": 49, "train_speed(iter/s)": 0.011217 }, { "epoch": 0.11157601115760112, "grad_norm": 3.5755205154418945, "learning_rate": 0.000199982965150241, "logits/chosen": -0.32785969972610474, "logits/rejected": -0.384295791387558, "logps/chosen": -12.152947425842285, "logps/rejected": -21.354625701904297, "loss": 1.1883673667907715, "memory(GiB)": 46.71, "nll_loss": 0.6465156674385071, "rewards/accuracies": 0.6875, "rewards/chosen": -0.11994989961385727, "rewards/margins": 0.5093130469322205, "rewards/rejected": -0.6292628645896912, "step": 50, "train_speed(iter/s)": 0.011217 } ], "logging_steps": 1, "max_steps": 896, "num_input_tokens_seen": 0, "num_train_epochs": 2, "save_steps": 50, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": false }, "attributes": {} } }, "total_flos": 2.728739939863757e+16, "train_batch_size": 2, "trial_name": null, "trial_params": null }