PEFT
Safetensors
taskgt705-50 / trainer_state.json
windgrin's picture
Upload folder using huggingface_hub
d4f56a3 verified
Raw
History Blame Contribute Delete
32.7 kB
{
"best_global_step": null,
"best_metric": null,
"best_model_checkpoint": null,
"epoch": 0.11157601115760112,
"eval_steps": 300,
"global_step": 50,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"epoch": 0.0022315202231520223,
"grad_norm": 11.248553276062012,
"learning_rate": 4.444444444444445e-06,
"logits/chosen": -0.48349103331565857,
"logits/rejected": -0.652603030204773,
"logps/chosen": -8.859519004821777,
"logps/rejected": -16.016435623168945,
"loss": 1.3468515872955322,
"memory(GiB)": 33.34,
"nll_loss": 0.6537042856216431,
"rewards/accuracies": 0.0,
"rewards/chosen": 0.0,
"rewards/margins": 0.0,
"rewards/rejected": 0.0,
"step": 1,
"train_speed(iter/s)": 0.010678
},
{
"epoch": 0.004463040446304045,
"grad_norm": 8.97808837890625,
"learning_rate": 8.88888888888889e-06,
"logits/chosen": -0.5174899101257324,
"logits/rejected": -0.6262180805206299,
"logps/chosen": -9.287378311157227,
"logps/rejected": -13.981985092163086,
"loss": 1.290852665901184,
"memory(GiB)": 36.2,
"nll_loss": 0.5977055430412292,
"rewards/accuracies": 0.0,
"rewards/chosen": 0.0,
"rewards/margins": 0.0,
"rewards/rejected": 0.0,
"step": 2,
"train_speed(iter/s)": 0.010974
},
{
"epoch": 0.0066945606694560665,
"grad_norm": 7.36937141418457,
"learning_rate": 1.3333333333333333e-05,
"logits/chosen": -0.42612141370773315,
"logits/rejected": -0.6118584871292114,
"logps/chosen": -6.56147575378418,
"logps/rejected": -16.162681579589844,
"loss": 1.1864153146743774,
"memory(GiB)": 36.2,
"nll_loss": 0.492550790309906,
"rewards/accuracies": 0.53125,
"rewards/chosen": -0.0009138870518654585,
"rewards/margins": -0.0012306026183068752,
"rewards/rejected": 0.00031671510078012943,
"step": 3,
"train_speed(iter/s)": 0.011052
},
{
"epoch": 0.00892608089260809,
"grad_norm": 7.918132305145264,
"learning_rate": 1.777777777777778e-05,
"logits/chosen": -0.5244420170783997,
"logits/rejected": -0.6519989371299744,
"logps/chosen": -7.461406707763672,
"logps/rejected": -17.006786346435547,
"loss": 1.3234074115753174,
"memory(GiB)": 39.28,
"nll_loss": 0.6342031359672546,
"rewards/accuracies": 0.625,
"rewards/chosen": 0.0032776433508843184,
"rewards/margins": 0.008089437149465084,
"rewards/rejected": -0.004811794031411409,
"step": 4,
"train_speed(iter/s)": 0.011094
},
{
"epoch": 0.011157601115760111,
"grad_norm": 9.900442123413086,
"learning_rate": 2.2222222222222223e-05,
"logits/chosen": -0.5073186159133911,
"logits/rejected": -0.6049282550811768,
"logps/chosen": -7.057607650756836,
"logps/rejected": -15.16832447052002,
"loss": 1.071779489517212,
"memory(GiB)": 39.28,
"nll_loss": 0.40041351318359375,
"rewards/accuracies": 0.75,
"rewards/chosen": 0.022623565047979355,
"rewards/margins": 0.04467733949422836,
"rewards/rejected": -0.02205377072095871,
"step": 5,
"train_speed(iter/s)": 0.011121
},
{
"epoch": 0.013389121338912133,
"grad_norm": 5.12174129486084,
"learning_rate": 2.6666666666666667e-05,
"logits/chosen": -0.48164039850234985,
"logits/rejected": -0.5844419002532959,
"logps/chosen": -6.2985005378723145,
"logps/rejected": -16.83810043334961,
"loss": 1.2731884717941284,
"memory(GiB)": 39.28,
"nll_loss": 0.600845992565155,
"rewards/accuracies": 0.65625,
"rewards/chosen": 0.010373853147029877,
"rewards/margins": 0.046181634068489075,
"rewards/rejected": -0.0358077809214592,
"step": 6,
"train_speed(iter/s)": 0.011143
},
{
"epoch": 0.015620641562064157,
"grad_norm": 4.1249213218688965,
"learning_rate": 3.111111111111111e-05,
"logits/chosen": -0.5566272735595703,
"logits/rejected": -0.6051127910614014,
"logps/chosen": -5.424515724182129,
"logps/rejected": -11.893548011779785,
"loss": 1.1159045696258545,
"memory(GiB)": 39.28,
"nll_loss": 0.46413302421569824,
"rewards/accuracies": 0.65625,
"rewards/chosen": 0.009653191082179546,
"rewards/margins": 0.11444520205259323,
"rewards/rejected": -0.10479200631380081,
"step": 7,
"train_speed(iter/s)": 0.011163
},
{
"epoch": 0.01785216178521618,
"grad_norm": 3.8928415775299072,
"learning_rate": 3.555555555555556e-05,
"logits/chosen": -0.5597310662269592,
"logits/rejected": -0.6341894268989563,
"logps/chosen": -6.350505352020264,
"logps/rejected": -20.239299774169922,
"loss": 0.8606890439987183,
"memory(GiB)": 39.28,
"nll_loss": 0.3352409899234772,
"rewards/accuracies": 0.8125,
"rewards/chosen": -0.018700765445828438,
"rewards/margins": 0.419380784034729,
"rewards/rejected": -0.4380815923213959,
"step": 8,
"train_speed(iter/s)": 0.011179
},
{
"epoch": 0.0200836820083682,
"grad_norm": 7.264344692230225,
"learning_rate": 4e-05,
"logits/chosen": -0.500182569026947,
"logits/rejected": -0.595187246799469,
"logps/chosen": -16.194358825683594,
"logps/rejected": -20.5479793548584,
"loss": 1.6191558837890625,
"memory(GiB)": 39.28,
"nll_loss": 1.0435733795166016,
"rewards/accuracies": 0.71875,
"rewards/chosen": -0.21446219086647034,
"rewards/margins": 0.40107572078704834,
"rewards/rejected": -0.6155378818511963,
"step": 9,
"train_speed(iter/s)": 0.011188
},
{
"epoch": 0.022315202231520222,
"grad_norm": 7.542423725128174,
"learning_rate": 4.4444444444444447e-05,
"logits/chosen": -0.41380318999290466,
"logits/rejected": -0.5418319702148438,
"logps/chosen": -10.30124568939209,
"logps/rejected": -26.6314697265625,
"loss": 1.2661710977554321,
"memory(GiB)": 39.28,
"nll_loss": 0.6692220568656921,
"rewards/accuracies": 0.65625,
"rewards/chosen": -0.29620301723480225,
"rewards/margins": 0.5043031573295593,
"rewards/rejected": -0.8005062341690063,
"step": 10,
"train_speed(iter/s)": 0.01119
},
{
"epoch": 0.024546722454672244,
"grad_norm": 12.055508613586426,
"learning_rate": 4.888888888888889e-05,
"logits/chosen": -0.45050907135009766,
"logits/rejected": -0.5843921899795532,
"logps/chosen": -15.530860900878906,
"logps/rejected": -27.80389976501465,
"loss": 1.6187087297439575,
"memory(GiB)": 39.28,
"nll_loss": 1.0532186031341553,
"rewards/accuracies": 0.71875,
"rewards/chosen": -0.47808465361595154,
"rewards/margins": 0.41364309191703796,
"rewards/rejected": -0.8917278051376343,
"step": 11,
"train_speed(iter/s)": 0.011193
},
{
"epoch": 0.026778242677824266,
"grad_norm": 6.556560516357422,
"learning_rate": 5.333333333333333e-05,
"logits/chosen": -0.4449861943721771,
"logits/rejected": -0.5602853894233704,
"logps/chosen": -10.715709686279297,
"logps/rejected": -27.810680389404297,
"loss": 1.2998032569885254,
"memory(GiB)": 42.68,
"nll_loss": 0.6746751070022583,
"rewards/accuracies": 0.5625,
"rewards/chosen": -0.33532828092575073,
"rewards/margins": 0.39097556471824646,
"rewards/rejected": -0.7263038754463196,
"step": 12,
"train_speed(iter/s)": 0.011193
},
{
"epoch": 0.02900976290097629,
"grad_norm": 6.815319061279297,
"learning_rate": 5.7777777777777776e-05,
"logits/chosen": -0.45461201667785645,
"logits/rejected": -0.5696772933006287,
"logps/chosen": -8.947586059570312,
"logps/rejected": -23.452707290649414,
"loss": 1.347914218902588,
"memory(GiB)": 42.68,
"nll_loss": 0.7918389439582825,
"rewards/accuracies": 0.75,
"rewards/chosen": -0.14807622134685516,
"rewards/margins": 0.4436675012111664,
"rewards/rejected": -0.5917437076568604,
"step": 13,
"train_speed(iter/s)": 0.011196
},
{
"epoch": 0.031241283124128313,
"grad_norm": 4.015015125274658,
"learning_rate": 6.222222222222222e-05,
"logits/chosen": -0.4277312457561493,
"logits/rejected": -0.5162039995193481,
"logps/chosen": -7.859683513641357,
"logps/rejected": -25.14496612548828,
"loss": 1.1709389686584473,
"memory(GiB)": 46.13,
"nll_loss": 0.5424311757087708,
"rewards/accuracies": 0.6875,
"rewards/chosen": -0.09304673224687576,
"rewards/margins": 0.27104437351226807,
"rewards/rejected": -0.36409106850624084,
"step": 14,
"train_speed(iter/s)": 0.011191
},
{
"epoch": 0.03347280334728033,
"grad_norm": 2.5992424488067627,
"learning_rate": 6.666666666666667e-05,
"logits/chosen": -0.4692430794239044,
"logits/rejected": -0.5111399292945862,
"logps/chosen": -8.574230194091797,
"logps/rejected": -16.565174102783203,
"loss": 1.1323829889297485,
"memory(GiB)": 46.13,
"nll_loss": 0.5113993287086487,
"rewards/accuracies": 0.6875,
"rewards/chosen": -0.08413823693990707,
"rewards/margins": 0.19407325983047485,
"rewards/rejected": -0.27821147441864014,
"step": 15,
"train_speed(iter/s)": 0.011195
},
{
"epoch": 0.03570432357043236,
"grad_norm": 2.479030132293701,
"learning_rate": 7.111111111111112e-05,
"logits/chosen": -0.38820019364356995,
"logits/rejected": -0.5241715908050537,
"logps/chosen": -4.694685935974121,
"logps/rejected": -19.62047576904297,
"loss": 1.052955985069275,
"memory(GiB)": 46.13,
"nll_loss": 0.47422000765800476,
"rewards/accuracies": 0.8125,
"rewards/chosen": 0.06994247436523438,
"rewards/margins": 0.2729727327823639,
"rewards/rejected": -0.2030302733182907,
"step": 16,
"train_speed(iter/s)": 0.011196
},
{
"epoch": 0.03793584379358438,
"grad_norm": 2.1875240802764893,
"learning_rate": 7.555555555555556e-05,
"logits/chosen": -0.4483625292778015,
"logits/rejected": -0.5458305478096008,
"logps/chosen": -9.014262199401855,
"logps/rejected": -18.748149871826172,
"loss": 1.2149709463119507,
"memory(GiB)": 46.13,
"nll_loss": 0.6185500621795654,
"rewards/accuracies": 0.75,
"rewards/chosen": 0.1215842068195343,
"rewards/margins": 0.24843284487724304,
"rewards/rejected": -0.12684863805770874,
"step": 17,
"train_speed(iter/s)": 0.011197
},
{
"epoch": 0.0401673640167364,
"grad_norm": 2.639186382293701,
"learning_rate": 8e-05,
"logits/chosen": -0.4394489824771881,
"logits/rejected": -0.48552829027175903,
"logps/chosen": -9.954276084899902,
"logps/rejected": -14.681390762329102,
"loss": 1.1648714542388916,
"memory(GiB)": 46.13,
"nll_loss": 0.46223676204681396,
"rewards/accuracies": 0.5625,
"rewards/chosen": 0.011617322452366352,
"rewards/margins": 0.034979358315467834,
"rewards/rejected": -0.02336202934384346,
"step": 18,
"train_speed(iter/s)": 0.011199
},
{
"epoch": 0.042398884239888426,
"grad_norm": 2.351567029953003,
"learning_rate": 8.444444444444444e-05,
"logits/chosen": -0.4882590174674988,
"logits/rejected": -0.5300821661949158,
"logps/chosen": -7.595667362213135,
"logps/rejected": -17.29962921142578,
"loss": 1.1524200439453125,
"memory(GiB)": 46.13,
"nll_loss": 0.5075826644897461,
"rewards/accuracies": 0.59375,
"rewards/chosen": 0.06894361972808838,
"rewards/margins": 0.13017994165420532,
"rewards/rejected": -0.061236318200826645,
"step": 19,
"train_speed(iter/s)": 0.011201
},
{
"epoch": 0.044630404463040445,
"grad_norm": 2.8206121921539307,
"learning_rate": 8.888888888888889e-05,
"logits/chosen": -0.4782502055168152,
"logits/rejected": -0.5565172433853149,
"logps/chosen": -6.507530212402344,
"logps/rejected": -13.604747772216797,
"loss": 1.089160442352295,
"memory(GiB)": 46.13,
"nll_loss": 0.45874831080436707,
"rewards/accuracies": 0.53125,
"rewards/chosen": 0.06730557233095169,
"rewards/margins": 0.18410882353782654,
"rewards/rejected": -0.11680323630571365,
"step": 20,
"train_speed(iter/s)": 0.011206
},
{
"epoch": 0.04686192468619247,
"grad_norm": 2.452335834503174,
"learning_rate": 9.333333333333334e-05,
"logits/chosen": -0.4106925129890442,
"logits/rejected": -0.48896345496177673,
"logps/chosen": -7.722554683685303,
"logps/rejected": -22.094852447509766,
"loss": 1.153997540473938,
"memory(GiB)": 46.71,
"nll_loss": 0.5091268420219421,
"rewards/accuracies": 0.71875,
"rewards/chosen": 0.060057930648326874,
"rewards/margins": 0.16068722307682037,
"rewards/rejected": -0.1006293073296547,
"step": 21,
"train_speed(iter/s)": 0.011203
},
{
"epoch": 0.04909344490934449,
"grad_norm": 2.3324975967407227,
"learning_rate": 9.777777777777778e-05,
"logits/chosen": -0.4366399943828583,
"logits/rejected": -0.4600733816623688,
"logps/chosen": -9.774506568908691,
"logps/rejected": -14.850456237792969,
"loss": 1.185971975326538,
"memory(GiB)": 46.71,
"nll_loss": 0.5413804650306702,
"rewards/accuracies": 0.5,
"rewards/chosen": 0.08716820925474167,
"rewards/margins": 0.17242644727230072,
"rewards/rejected": -0.08525823801755905,
"step": 22,
"train_speed(iter/s)": 0.011203
},
{
"epoch": 0.051324965132496514,
"grad_norm": 2.7291500568389893,
"learning_rate": 0.00010222222222222222,
"logits/chosen": -0.4168204665184021,
"logits/rejected": -0.5373830795288086,
"logps/chosen": -7.675040245056152,
"logps/rejected": -20.635356903076172,
"loss": 1.1511971950531006,
"memory(GiB)": 46.71,
"nll_loss": 0.4784548282623291,
"rewards/accuracies": 0.46875,
"rewards/chosen": 0.05419651046395302,
"rewards/margins": 0.0959930419921875,
"rewards/rejected": -0.04179652780294418,
"step": 23,
"train_speed(iter/s)": 0.011204
},
{
"epoch": 0.05355648535564853,
"grad_norm": 2.6357204914093018,
"learning_rate": 0.00010666666666666667,
"logits/chosen": -0.39612719416618347,
"logits/rejected": -0.4547193944454193,
"logps/chosen": -9.427398681640625,
"logps/rejected": -20.611848831176758,
"loss": 1.0459527969360352,
"memory(GiB)": 46.71,
"nll_loss": 0.42900872230529785,
"rewards/accuracies": 0.59375,
"rewards/chosen": 0.0577767938375473,
"rewards/margins": 0.24017955362796783,
"rewards/rejected": -0.18240275979042053,
"step": 24,
"train_speed(iter/s)": 0.011203
},
{
"epoch": 0.05578800557880056,
"grad_norm": 2.7458126544952393,
"learning_rate": 0.00011111111111111112,
"logits/chosen": -0.3978196978569031,
"logits/rejected": -0.4898090958595276,
"logps/chosen": -9.801487922668457,
"logps/rejected": -21.7921199798584,
"loss": 1.1577973365783691,
"memory(GiB)": 46.71,
"nll_loss": 0.5382578372955322,
"rewards/accuracies": 0.71875,
"rewards/chosen": 0.03896612673997879,
"rewards/margins": 0.24017201364040375,
"rewards/rejected": -0.20120586454868317,
"step": 25,
"train_speed(iter/s)": 0.011205
},
{
"epoch": 0.05801952580195258,
"grad_norm": 4.185514450073242,
"learning_rate": 0.00011555555555555555,
"logits/chosen": -0.43978849053382874,
"logits/rejected": -0.5358645915985107,
"logps/chosen": -4.664649963378906,
"logps/rejected": -18.568632125854492,
"loss": 0.9911558032035828,
"memory(GiB)": 46.71,
"nll_loss": 0.39514851570129395,
"rewards/accuracies": 0.6875,
"rewards/chosen": -0.01693350076675415,
"rewards/margins": 0.28997230529785156,
"rewards/rejected": -0.3069058060646057,
"step": 26,
"train_speed(iter/s)": 0.011208
},
{
"epoch": 0.0602510460251046,
"grad_norm": 2.983151912689209,
"learning_rate": 0.00012,
"logits/chosen": -0.46957868337631226,
"logits/rejected": -0.5086190700531006,
"logps/chosen": -14.16710376739502,
"logps/rejected": -15.19424819946289,
"loss": 1.3119632005691528,
"memory(GiB)": 46.71,
"nll_loss": 0.732680082321167,
"rewards/accuracies": 0.8125,
"rewards/chosen": 0.1205766424536705,
"rewards/margins": 0.2763415277004242,
"rewards/rejected": -0.1557648628950119,
"step": 27,
"train_speed(iter/s)": 0.01121
},
{
"epoch": 0.06248256624825663,
"grad_norm": 3.7991929054260254,
"learning_rate": 0.00012444444444444444,
"logits/chosen": -0.3287929892539978,
"logits/rejected": -0.46299535036087036,
"logps/chosen": -6.527912616729736,
"logps/rejected": -23.983104705810547,
"loss": 1.0033739805221558,
"memory(GiB)": 46.71,
"nll_loss": 0.44460976123809814,
"rewards/accuracies": 0.78125,
"rewards/chosen": 0.07841134071350098,
"rewards/margins": 0.3698306679725647,
"rewards/rejected": -0.29141926765441895,
"step": 28,
"train_speed(iter/s)": 0.011207
},
{
"epoch": 0.06471408647140865,
"grad_norm": 3.0063183307647705,
"learning_rate": 0.00012888888888888892,
"logits/chosen": -0.3735123574733734,
"logits/rejected": -0.458845853805542,
"logps/chosen": -7.325934886932373,
"logps/rejected": -21.65030288696289,
"loss": 1.0098869800567627,
"memory(GiB)": 46.71,
"nll_loss": 0.477042555809021,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.025919266045093536,
"rewards/margins": 0.47939103841781616,
"rewards/rejected": -0.4534717798233032,
"step": 29,
"train_speed(iter/s)": 0.011208
},
{
"epoch": 0.06694560669456066,
"grad_norm": 2.6957406997680664,
"learning_rate": 0.00013333333333333334,
"logits/chosen": -0.3790513873100281,
"logits/rejected": -0.4815320372581482,
"logps/chosen": -6.8280110359191895,
"logps/rejected": -22.987621307373047,
"loss": 1.0349267721176147,
"memory(GiB)": 46.71,
"nll_loss": 0.5045362114906311,
"rewards/accuracies": 0.8125,
"rewards/chosen": 0.09961891919374466,
"rewards/margins": 0.4102502763271332,
"rewards/rejected": -0.3106313645839691,
"step": 30,
"train_speed(iter/s)": 0.011209
},
{
"epoch": 0.06917712691771269,
"grad_norm": 2.7142391204833984,
"learning_rate": 0.0001377777777777778,
"logits/chosen": -0.36308056116104126,
"logits/rejected": -0.44216084480285645,
"logps/chosen": -5.850837230682373,
"logps/rejected": -21.365463256835938,
"loss": 0.9850523471832275,
"memory(GiB)": 46.71,
"nll_loss": 0.43448853492736816,
"rewards/accuracies": 0.71875,
"rewards/chosen": 0.0431375615298748,
"rewards/margins": 0.3983423113822937,
"rewards/rejected": -0.3552047610282898,
"step": 31,
"train_speed(iter/s)": 0.011211
},
{
"epoch": 0.07140864714086471,
"grad_norm": 3.897137403488159,
"learning_rate": 0.00014222222222222224,
"logits/chosen": -0.3979527950286865,
"logits/rejected": -0.43778184056282043,
"logps/chosen": -10.285924911499023,
"logps/rejected": -18.7073974609375,
"loss": 1.1233854293823242,
"memory(GiB)": 46.71,
"nll_loss": 0.5153944492340088,
"rewards/accuracies": 0.625,
"rewards/chosen": 0.026699109002947807,
"rewards/margins": 0.23945647478103638,
"rewards/rejected": -0.21275737881660461,
"step": 32,
"train_speed(iter/s)": 0.011213
},
{
"epoch": 0.07364016736401674,
"grad_norm": 3.93380069732666,
"learning_rate": 0.00014666666666666666,
"logits/chosen": -0.2758394777774811,
"logits/rejected": -0.37545740604400635,
"logps/chosen": -12.159762382507324,
"logps/rejected": -24.926610946655273,
"loss": 1.2487003803253174,
"memory(GiB)": 46.71,
"nll_loss": 0.6138952970504761,
"rewards/accuracies": 0.6875,
"rewards/chosen": -0.09166956692934036,
"rewards/margins": 0.2808037996292114,
"rewards/rejected": -0.3724733591079712,
"step": 33,
"train_speed(iter/s)": 0.011211
},
{
"epoch": 0.07587168758716877,
"grad_norm": 3.21878981590271,
"learning_rate": 0.0001511111111111111,
"logits/chosen": -0.24420826137065887,
"logits/rejected": -0.38765522837638855,
"logps/chosen": -6.041399955749512,
"logps/rejected": -22.503984451293945,
"loss": 0.9895752668380737,
"memory(GiB)": 46.71,
"nll_loss": 0.44009482860565186,
"rewards/accuracies": 0.6875,
"rewards/chosen": 0.010253368876874447,
"rewards/margins": 0.5208209753036499,
"rewards/rejected": -0.5105676054954529,
"step": 34,
"train_speed(iter/s)": 0.01121
},
{
"epoch": 0.07810320781032078,
"grad_norm": 5.1504316329956055,
"learning_rate": 0.00015555555555555556,
"logits/chosen": -0.2664889693260193,
"logits/rejected": -0.40212178230285645,
"logps/chosen": -5.9132609367370605,
"logps/rejected": -24.527639389038086,
"loss": 0.8355879187583923,
"memory(GiB)": 46.71,
"nll_loss": 0.4006969928741455,
"rewards/accuracies": 0.84375,
"rewards/chosen": -0.03980417177081108,
"rewards/margins": 0.8774286508560181,
"rewards/rejected": -0.9172328114509583,
"step": 35,
"train_speed(iter/s)": 0.011211
},
{
"epoch": 0.0803347280334728,
"grad_norm": 3.388197660446167,
"learning_rate": 0.00016,
"logits/chosen": -0.25354304909706116,
"logits/rejected": -0.33330878615379333,
"logps/chosen": -9.807186126708984,
"logps/rejected": -22.963045120239258,
"loss": 1.1024540662765503,
"memory(GiB)": 46.71,
"nll_loss": 0.6454060673713684,
"rewards/accuracies": 0.84375,
"rewards/chosen": -0.001722879707813263,
"rewards/margins": 0.8297844529151917,
"rewards/rejected": -0.8315073847770691,
"step": 36,
"train_speed(iter/s)": 0.011211
},
{
"epoch": 0.08256624825662483,
"grad_norm": 2.596273899078369,
"learning_rate": 0.00016444444444444444,
"logits/chosen": -0.21093566715717316,
"logits/rejected": -0.3617200553417206,
"logps/chosen": -2.8380072116851807,
"logps/rejected": -30.42251968383789,
"loss": 0.6882003545761108,
"memory(GiB)": 46.71,
"nll_loss": 0.2877930700778961,
"rewards/accuracies": 0.84375,
"rewards/chosen": 0.06296033412218094,
"rewards/margins": 1.0582321882247925,
"rewards/rejected": -0.9952719211578369,
"step": 37,
"train_speed(iter/s)": 0.01121
},
{
"epoch": 0.08479776847977685,
"grad_norm": 2.358452796936035,
"learning_rate": 0.00016888888888888889,
"logits/chosen": -0.2989475429058075,
"logits/rejected": -0.37469911575317383,
"logps/chosen": -6.1970534324646,
"logps/rejected": -19.100358963012695,
"loss": 0.8981406092643738,
"memory(GiB)": 46.71,
"nll_loss": 0.3934318423271179,
"rewards/accuracies": 0.84375,
"rewards/chosen": 0.002394435927271843,
"rewards/margins": 0.6755657196044922,
"rewards/rejected": -0.6731712818145752,
"step": 38,
"train_speed(iter/s)": 0.011211
},
{
"epoch": 0.08702928870292886,
"grad_norm": 2.9299051761627197,
"learning_rate": 0.00017333333333333334,
"logits/chosen": -0.2796667516231537,
"logits/rejected": -0.34129300713539124,
"logps/chosen": -8.498173713684082,
"logps/rejected": -26.264965057373047,
"loss": 1.012364387512207,
"memory(GiB)": 46.71,
"nll_loss": 0.586083173751831,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.07207094132900238,
"rewards/margins": 1.1341111660003662,
"rewards/rejected": -1.0620403289794922,
"step": 39,
"train_speed(iter/s)": 0.011212
},
{
"epoch": 0.08926080892608089,
"grad_norm": 3.547189474105835,
"learning_rate": 0.00017777777777777779,
"logits/chosen": -0.28194305300712585,
"logits/rejected": -0.33060967922210693,
"logps/chosen": -7.982609748840332,
"logps/rejected": -20.187652587890625,
"loss": 0.9403265118598938,
"memory(GiB)": 46.71,
"nll_loss": 0.42783123254776,
"rewards/accuracies": 0.6875,
"rewards/chosen": 0.002833280712366104,
"rewards/margins": 0.7690448760986328,
"rewards/rejected": -0.7662116289138794,
"step": 40,
"train_speed(iter/s)": 0.011213
},
{
"epoch": 0.09149232914923291,
"grad_norm": 3.4967706203460693,
"learning_rate": 0.00018222222222222224,
"logits/chosen": -0.21270643174648285,
"logits/rejected": -0.3004887104034424,
"logps/chosen": -5.226779937744141,
"logps/rejected": -22.208778381347656,
"loss": 0.8620257377624512,
"memory(GiB)": 46.71,
"nll_loss": 0.3914262056350708,
"rewards/accuracies": 0.71875,
"rewards/chosen": 0.018529795110225677,
"rewards/margins": 0.9286664128303528,
"rewards/rejected": -0.9101365804672241,
"step": 41,
"train_speed(iter/s)": 0.011213
},
{
"epoch": 0.09372384937238494,
"grad_norm": 6.100057601928711,
"learning_rate": 0.0001866666666666667,
"logits/chosen": -0.29974937438964844,
"logits/rejected": -0.36353808641433716,
"logps/chosen": -10.446137428283691,
"logps/rejected": -22.973119735717773,
"loss": 1.2477580308914185,
"memory(GiB)": 46.71,
"nll_loss": 0.6882976293563843,
"rewards/accuracies": 0.65625,
"rewards/chosen": -0.2526606023311615,
"rewards/margins": 0.5461662411689758,
"rewards/rejected": -0.7988268136978149,
"step": 42,
"train_speed(iter/s)": 0.011214
},
{
"epoch": 0.09595536959553697,
"grad_norm": 4.625721454620361,
"learning_rate": 0.00019111111111111114,
"logits/chosen": -0.21875600516796112,
"logits/rejected": -0.3691503405570984,
"logps/chosen": -8.029109001159668,
"logps/rejected": -33.986671447753906,
"loss": 0.9927695989608765,
"memory(GiB)": 46.71,
"nll_loss": 0.6190873384475708,
"rewards/accuracies": 0.78125,
"rewards/chosen": -0.10942590236663818,
"rewards/margins": 1.7278107404708862,
"rewards/rejected": -1.837236762046814,
"step": 43,
"train_speed(iter/s)": 0.011215
},
{
"epoch": 0.09818688981868898,
"grad_norm": 4.994227886199951,
"learning_rate": 0.00019555555555555556,
"logits/chosen": -0.25192195177078247,
"logits/rejected": -0.32522761821746826,
"logps/chosen": -9.805305480957031,
"logps/rejected": -34.161895751953125,
"loss": 0.9997942447662354,
"memory(GiB)": 46.71,
"nll_loss": 0.6020480990409851,
"rewards/accuracies": 0.75,
"rewards/chosen": -0.30676746368408203,
"rewards/margins": 1.7450387477874756,
"rewards/rejected": -2.0518062114715576,
"step": 44,
"train_speed(iter/s)": 0.011214
},
{
"epoch": 0.100418410041841,
"grad_norm": 4.717008590698242,
"learning_rate": 0.0002,
"logits/chosen": -0.33617067337036133,
"logits/rejected": -0.35846105217933655,
"logps/chosen": -9.175792694091797,
"logps/rejected": -21.536231994628906,
"loss": 1.014683485031128,
"memory(GiB)": 46.71,
"nll_loss": 0.5040097236633301,
"rewards/accuracies": 0.625,
"rewards/chosen": 0.014129618182778358,
"rewards/margins": 0.7111825942993164,
"rewards/rejected": -0.6970530152320862,
"step": 45,
"train_speed(iter/s)": 0.011215
},
{
"epoch": 0.10264993026499303,
"grad_norm": 3.089895248413086,
"learning_rate": 0.0001999993185874369,
"logits/chosen": -0.3643554747104645,
"logits/rejected": -0.3828020393848419,
"logps/chosen": -11.385210990905762,
"logps/rejected": -27.30405044555664,
"loss": 0.9333115220069885,
"memory(GiB)": 46.71,
"nll_loss": 0.5031883120536804,
"rewards/accuracies": 0.6875,
"rewards/chosen": -0.08416246622800827,
"rewards/margins": 1.1319228410720825,
"rewards/rejected": -1.216085433959961,
"step": 46,
"train_speed(iter/s)": 0.011215
},
{
"epoch": 0.10488145048814505,
"grad_norm": 4.295483589172363,
"learning_rate": 0.00019999727435903407,
"logits/chosen": -0.3375833332538605,
"logits/rejected": -0.44685542583465576,
"logps/chosen": -4.36940336227417,
"logps/rejected": -21.149555206298828,
"loss": 0.959221601486206,
"memory(GiB)": 46.71,
"nll_loss": 0.42982059717178345,
"rewards/accuracies": 0.8125,
"rewards/chosen": 0.15477100014686584,
"rewards/margins": 0.5941969752311707,
"rewards/rejected": -0.4394259452819824,
"step": 47,
"train_speed(iter/s)": 0.011216
},
{
"epoch": 0.10711297071129706,
"grad_norm": 2.4132261276245117,
"learning_rate": 0.0001999938673426507,
"logits/chosen": -0.3103625178337097,
"logits/rejected": -0.4320617616176605,
"logps/chosen": -5.777155876159668,
"logps/rejected": -20.897228240966797,
"loss": 0.9094122648239136,
"memory(GiB)": 46.71,
"nll_loss": 0.41829684376716614,
"rewards/accuracies": 0.8125,
"rewards/chosen": 0.18217116594314575,
"rewards/margins": 0.714988112449646,
"rewards/rejected": -0.5328169465065002,
"step": 48,
"train_speed(iter/s)": 0.011216
},
{
"epoch": 0.10934449093444909,
"grad_norm": 2.716282367706299,
"learning_rate": 0.00019998909758471852,
"logits/chosen": -0.3802068829536438,
"logits/rejected": -0.4424472749233246,
"logps/chosen": -7.844504356384277,
"logps/rejected": -21.755281448364258,
"loss": 1.0127230882644653,
"memory(GiB)": 46.71,
"nll_loss": 0.5032894611358643,
"rewards/accuracies": 0.6875,
"rewards/chosen": 0.07639233767986298,
"rewards/margins": 0.79319167137146,
"rewards/rejected": -0.7167993187904358,
"step": 49,
"train_speed(iter/s)": 0.011217
},
{
"epoch": 0.11157601115760112,
"grad_norm": 3.5755205154418945,
"learning_rate": 0.000199982965150241,
"logits/chosen": -0.32785969972610474,
"logits/rejected": -0.384295791387558,
"logps/chosen": -12.152947425842285,
"logps/rejected": -21.354625701904297,
"loss": 1.1883673667907715,
"memory(GiB)": 46.71,
"nll_loss": 0.6465156674385071,
"rewards/accuracies": 0.6875,
"rewards/chosen": -0.11994989961385727,
"rewards/margins": 0.5093130469322205,
"rewards/rejected": -0.6292628645896912,
"step": 50,
"train_speed(iter/s)": 0.011217
}
],
"logging_steps": 1,
"max_steps": 896,
"num_input_tokens_seen": 0,
"num_train_epochs": 2,
"save_steps": 50,
"stateful_callbacks": {
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": true,
"should_training_stop": false
},
"attributes": {}
}
},
"total_flos": 2.728739939863757e+16,
"train_batch_size": 2,
"trial_name": null,
"trial_params": null
}