PEFT
Safetensors
pair05r16-50 / trainer_state.json
windgrin's picture
Upload folder using huggingface_hub
bd05757 verified
Raw
History Blame Contribute Delete
32.5 kB
{
"best_global_step": null,
"best_metric": null,
"best_model_checkpoint": null,
"epoch": 0.12574662055957248,
"eval_steps": 300,
"global_step": 50,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"epoch": 0.002514932411191449,
"grad_norm": 5.559185028076172,
"learning_rate": 3.3333333333333333e-06,
"logits/chosen": -0.5158984065055847,
"logits/rejected": -0.6433685421943665,
"logps/chosen": -8.879493713378906,
"logps/rejected": -18.298219680786133,
"loss": 1.2430726289749146,
"memory(GiB)": 30.69,
"nll_loss": 0.5499253869056702,
"rewards/accuracies": 0.0,
"rewards/chosen": 0.0,
"rewards/margins": 0.0,
"rewards/rejected": 0.0,
"step": 1,
"train_speed(iter/s)": 0.010477
},
{
"epoch": 0.005029864822382898,
"grad_norm": 5.400235176086426,
"learning_rate": 6.666666666666667e-06,
"logits/chosen": -0.5219721794128418,
"logits/rejected": -0.6263731718063354,
"logps/chosen": -4.77984094619751,
"logps/rejected": -15.150838851928711,
"loss": 1.0675525665283203,
"memory(GiB)": 33.9,
"nll_loss": 0.3744054436683655,
"rewards/accuracies": 0.0,
"rewards/chosen": 0.0,
"rewards/margins": 0.0,
"rewards/rejected": 0.0,
"step": 2,
"train_speed(iter/s)": 0.010866
},
{
"epoch": 0.007544797233574348,
"grad_norm": 7.852550983428955,
"learning_rate": 1e-05,
"logits/chosen": -0.48881009221076965,
"logits/rejected": -0.6540625691413879,
"logps/chosen": -4.714770793914795,
"logps/rejected": -17.99374008178711,
"loss": 1.0851404666900635,
"memory(GiB)": 33.9,
"nll_loss": 0.3894187808036804,
"rewards/accuracies": 0.375,
"rewards/chosen": -0.002094469266012311,
"rewards/margins": -0.004971538204699755,
"rewards/rejected": 0.0028770684730261564,
"step": 3,
"train_speed(iter/s)": 0.011002
},
{
"epoch": 0.010059729644765796,
"grad_norm": 10.150762557983398,
"learning_rate": 1.3333333333333333e-05,
"logits/chosen": -0.4506370425224304,
"logits/rejected": -0.6422093510627747,
"logps/chosen": -3.6849846839904785,
"logps/rejected": -21.201997756958008,
"loss": 1.092491865158081,
"memory(GiB)": 37.36,
"nll_loss": 0.4020901322364807,
"rewards/accuracies": 0.5,
"rewards/chosen": 0.007022961974143982,
"rewards/margins": 0.0057290042750537395,
"rewards/rejected": 0.001293957349844277,
"step": 4,
"train_speed(iter/s)": 0.011051
},
{
"epoch": 0.012574662055957246,
"grad_norm": 6.588510036468506,
"learning_rate": 1.6666666666666667e-05,
"logits/chosen": -0.4159216284751892,
"logits/rejected": -0.5884239673614502,
"logps/chosen": -8.611150741577148,
"logps/rejected": -19.931533813476562,
"loss": 1.1986628770828247,
"memory(GiB)": 37.36,
"nll_loss": 0.5155895948410034,
"rewards/accuracies": 0.71875,
"rewards/chosen": 0.005048489198088646,
"rewards/margins": 0.020845137536525726,
"rewards/rejected": -0.01579664833843708,
"step": 5,
"train_speed(iter/s)": 0.011086
},
{
"epoch": 0.015089594467148696,
"grad_norm": 3.965754508972168,
"learning_rate": 2e-05,
"logits/chosen": -0.47118157148361206,
"logits/rejected": -0.5790206789970398,
"logps/chosen": -9.572708129882812,
"logps/rejected": -19.066829681396484,
"loss": 1.1965497732162476,
"memory(GiB)": 37.36,
"nll_loss": 0.5279884338378906,
"rewards/accuracies": 0.71875,
"rewards/chosen": 0.006116065196692944,
"rewards/margins": 0.05174415558576584,
"rewards/rejected": -0.04562808945775032,
"step": 6,
"train_speed(iter/s)": 0.01111
},
{
"epoch": 0.017604526878340146,
"grad_norm": 2.719625234603882,
"learning_rate": 2.3333333333333336e-05,
"logits/chosen": -0.40740644931793213,
"logits/rejected": -0.5419386029243469,
"logps/chosen": -9.413152694702148,
"logps/rejected": -24.703401565551758,
"loss": 1.1549676656723022,
"memory(GiB)": 40.85,
"nll_loss": 0.5149396061897278,
"rewards/accuracies": 0.71875,
"rewards/chosen": -0.02250390499830246,
"rewards/margins": 0.12123934924602509,
"rewards/rejected": -0.14374326169490814,
"step": 7,
"train_speed(iter/s)": 0.011114
},
{
"epoch": 0.020119459289531592,
"grad_norm": 3.325852394104004,
"learning_rate": 2.6666666666666667e-05,
"logits/chosen": -0.4091758728027344,
"logits/rejected": -0.5692812204360962,
"logps/chosen": -5.904629230499268,
"logps/rejected": -20.752662658691406,
"loss": 1.0213468074798584,
"memory(GiB)": 40.85,
"nll_loss": 0.3945533037185669,
"rewards/accuracies": 0.6875,
"rewards/chosen": -0.041384391486644745,
"rewards/margins": 0.17802417278289795,
"rewards/rejected": -0.2194085717201233,
"step": 8,
"train_speed(iter/s)": 0.011127
},
{
"epoch": 0.022634391700723042,
"grad_norm": 3.5531411170959473,
"learning_rate": 3e-05,
"logits/chosen": -0.3281947374343872,
"logits/rejected": -0.5156837701797485,
"logps/chosen": -5.975313186645508,
"logps/rejected": -27.066158294677734,
"loss": 0.8695712089538574,
"memory(GiB)": 40.85,
"nll_loss": 0.3611774742603302,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.0457351878285408,
"rewards/margins": 0.4895857870578766,
"rewards/rejected": -0.443850576877594,
"step": 9,
"train_speed(iter/s)": 0.011136
},
{
"epoch": 0.025149324111914492,
"grad_norm": 4.356088161468506,
"learning_rate": 3.3333333333333335e-05,
"logits/chosen": -0.43971675634384155,
"logits/rejected": -0.5702978372573853,
"logps/chosen": -6.376318454742432,
"logps/rejected": -19.42030143737793,
"loss": 1.0046417713165283,
"memory(GiB)": 40.85,
"nll_loss": 0.42133060097694397,
"rewards/accuracies": 0.6875,
"rewards/chosen": -0.17984721064567566,
"rewards/margins": 0.43266722559928894,
"rewards/rejected": -0.6125144362449646,
"step": 10,
"train_speed(iter/s)": 0.01115
},
{
"epoch": 0.027664256523105942,
"grad_norm": 3.9732213020324707,
"learning_rate": 3.6666666666666666e-05,
"logits/chosen": -0.4561832845211029,
"logits/rejected": -0.6065505146980286,
"logps/chosen": -6.498957633972168,
"logps/rejected": -27.428552627563477,
"loss": 0.9565106630325317,
"memory(GiB)": 40.85,
"nll_loss": 0.40273764729499817,
"rewards/accuracies": 0.75,
"rewards/chosen": -0.12391924858093262,
"rewards/margins": 0.5706068277359009,
"rewards/rejected": -0.6945260763168335,
"step": 11,
"train_speed(iter/s)": 0.011161
},
{
"epoch": 0.030179188934297392,
"grad_norm": 2.2540578842163086,
"learning_rate": 4e-05,
"logits/chosen": -0.42088037729263306,
"logits/rejected": -0.6009025573730469,
"logps/chosen": -4.243446350097656,
"logps/rejected": -26.567686080932617,
"loss": 0.7599425911903381,
"memory(GiB)": 40.85,
"nll_loss": 0.28007903695106506,
"rewards/accuracies": 0.8125,
"rewards/chosen": -0.14110325276851654,
"rewards/margins": 0.6590132713317871,
"rewards/rejected": -0.8001165390014648,
"step": 12,
"train_speed(iter/s)": 0.011171
},
{
"epoch": 0.03269412134548884,
"grad_norm": 6.460833549499512,
"learning_rate": 4.3333333333333334e-05,
"logits/chosen": -0.4136754274368286,
"logits/rejected": -0.5452494621276855,
"logps/chosen": -7.585506439208984,
"logps/rejected": -21.19340705871582,
"loss": 1.223608136177063,
"memory(GiB)": 40.85,
"nll_loss": 0.6720148921012878,
"rewards/accuracies": 0.71875,
"rewards/chosen": -0.25483113527297974,
"rewards/margins": 0.49035438895225525,
"rewards/rejected": -0.7451854944229126,
"step": 13,
"train_speed(iter/s)": 0.011181
},
{
"epoch": 0.03520905375668029,
"grad_norm": 4.092947006225586,
"learning_rate": 4.666666666666667e-05,
"logits/chosen": -0.527854323387146,
"logits/rejected": -0.5994939804077148,
"logps/chosen": -8.185604095458984,
"logps/rejected": -17.946279525756836,
"loss": 1.2557107210159302,
"memory(GiB)": 40.85,
"nll_loss": 0.66472989320755,
"rewards/accuracies": 0.65625,
"rewards/chosen": -0.145107239484787,
"rewards/margins": 0.41058170795440674,
"rewards/rejected": -0.5556889772415161,
"step": 14,
"train_speed(iter/s)": 0.011194
},
{
"epoch": 0.03772398616787174,
"grad_norm": 3.926342248916626,
"learning_rate": 5e-05,
"logits/chosen": -0.407508909702301,
"logits/rejected": -0.5949459075927734,
"logps/chosen": -3.4148104190826416,
"logps/rejected": -22.69104766845703,
"loss": 0.8548452258110046,
"memory(GiB)": 40.85,
"nll_loss": 0.40506720542907715,
"rewards/accuracies": 0.8125,
"rewards/chosen": -0.025914989411830902,
"rewards/margins": 0.6952927708625793,
"rewards/rejected": -0.7212077379226685,
"step": 15,
"train_speed(iter/s)": 0.0112
},
{
"epoch": 0.040238918579063185,
"grad_norm": 2.4273853302001953,
"learning_rate": 5.333333333333333e-05,
"logits/chosen": -0.3462049961090088,
"logits/rejected": -0.58342045545578,
"logps/chosen": -3.8651039600372314,
"logps/rejected": -28.470134735107422,
"loss": 0.821665346622467,
"memory(GiB)": 40.85,
"nll_loss": 0.3309793472290039,
"rewards/accuracies": 0.84375,
"rewards/chosen": 0.04178892821073532,
"rewards/margins": 0.5164157152175903,
"rewards/rejected": -0.4746267795562744,
"step": 16,
"train_speed(iter/s)": 0.011202
},
{
"epoch": 0.04275385099025464,
"grad_norm": 1.8921568393707275,
"learning_rate": 5.666666666666667e-05,
"logits/chosen": -0.5054872632026672,
"logits/rejected": -0.6153637170791626,
"logps/chosen": -1.8910857439041138,
"logps/rejected": -16.781475067138672,
"loss": 0.7665270566940308,
"memory(GiB)": 40.85,
"nll_loss": 0.2412014603614807,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.04062865674495697,
"rewards/margins": 0.41468262672424316,
"rewards/rejected": -0.3740540146827698,
"step": 17,
"train_speed(iter/s)": 0.011212
},
{
"epoch": 0.045268783401446085,
"grad_norm": 3.2724339962005615,
"learning_rate": 6e-05,
"logits/chosen": -0.45994284749031067,
"logits/rejected": -0.5327339768409729,
"logps/chosen": -8.705971717834473,
"logps/rejected": -17.33376121520996,
"loss": 1.2050995826721191,
"memory(GiB)": 40.85,
"nll_loss": 0.5643416047096252,
"rewards/accuracies": 0.625,
"rewards/chosen": -0.048418305814266205,
"rewards/margins": 0.16582812368869781,
"rewards/rejected": -0.21424642205238342,
"step": 18,
"train_speed(iter/s)": 0.011215
},
{
"epoch": 0.04778371581263754,
"grad_norm": 2.6650567054748535,
"learning_rate": 6.333333333333333e-05,
"logits/chosen": -0.48406994342803955,
"logits/rejected": -0.5535129308700562,
"logps/chosen": -10.087296485900879,
"logps/rejected": -17.584102630615234,
"loss": 1.1602699756622314,
"memory(GiB)": 40.85,
"nll_loss": 0.5509804487228394,
"rewards/accuracies": 0.6875,
"rewards/chosen": -0.005405411124229431,
"rewards/margins": 0.23162491619586945,
"rewards/rejected": -0.23703034222126007,
"step": 19,
"train_speed(iter/s)": 0.01122
},
{
"epoch": 0.050298648223828984,
"grad_norm": 2.393120527267456,
"learning_rate": 6.666666666666667e-05,
"logits/chosen": -0.4699333906173706,
"logits/rejected": -0.5745525360107422,
"logps/chosen": -5.482749938964844,
"logps/rejected": -15.294036865234375,
"loss": 1.0463979244232178,
"memory(GiB)": 40.85,
"nll_loss": 0.40886539220809937,
"rewards/accuracies": 0.71875,
"rewards/chosen": 0.030414806678891182,
"rewards/margins": 0.18470264971256256,
"rewards/rejected": -0.15428784489631653,
"step": 20,
"train_speed(iter/s)": 0.011224
},
{
"epoch": 0.05281358063502043,
"grad_norm": 1.7328065633773804,
"learning_rate": 7e-05,
"logits/chosen": -0.5130109190940857,
"logits/rejected": -0.6171243190765381,
"logps/chosen": -8.619268417358398,
"logps/rejected": -18.43971824645996,
"loss": 1.1801689863204956,
"memory(GiB)": 40.85,
"nll_loss": 0.6120539903640747,
"rewards/accuracies": 0.78125,
"rewards/chosen": 0.07324957102537155,
"rewards/margins": 0.3033149242401123,
"rewards/rejected": -0.23006536066532135,
"step": 21,
"train_speed(iter/s)": 0.011228
},
{
"epoch": 0.055328513046211884,
"grad_norm": 2.848578691482544,
"learning_rate": 7.333333333333333e-05,
"logits/chosen": -0.46683233976364136,
"logits/rejected": -0.5329924821853638,
"logps/chosen": -4.357663154602051,
"logps/rejected": -15.35399055480957,
"loss": 0.9406945705413818,
"memory(GiB)": 40.85,
"nll_loss": 0.3216635584831238,
"rewards/accuracies": 0.65625,
"rewards/chosen": -0.010179778560996056,
"rewards/margins": 0.2008945494890213,
"rewards/rejected": -0.21107429265975952,
"step": 22,
"train_speed(iter/s)": 0.011229
},
{
"epoch": 0.05784344545740333,
"grad_norm": 1.7426271438598633,
"learning_rate": 7.666666666666667e-05,
"logits/chosen": -0.5002316236495972,
"logits/rejected": -0.5488481521606445,
"logps/chosen": -5.690494537353516,
"logps/rejected": -15.590461730957031,
"loss": 0.9775924682617188,
"memory(GiB)": 40.85,
"nll_loss": 0.355554461479187,
"rewards/accuracies": 0.75,
"rewards/chosen": 0.009325886145234108,
"rewards/margins": 0.18430516123771667,
"rewards/rejected": -0.1749793142080307,
"step": 23,
"train_speed(iter/s)": 0.011234
},
{
"epoch": 0.060358377868594784,
"grad_norm": 1.8518409729003906,
"learning_rate": 8e-05,
"logits/chosen": -0.5258264541625977,
"logits/rejected": -0.5805689096450806,
"logps/chosen": -9.133979797363281,
"logps/rejected": -17.886051177978516,
"loss": 1.1810051202774048,
"memory(GiB)": 40.85,
"nll_loss": 0.6029603481292725,
"rewards/accuracies": 0.71875,
"rewards/chosen": 0.04269062727689743,
"rewards/margins": 0.2787190079689026,
"rewards/rejected": -0.23602835834026337,
"step": 24,
"train_speed(iter/s)": 0.011237
},
{
"epoch": 0.06287331027978624,
"grad_norm": 2.4842066764831543,
"learning_rate": 8.333333333333334e-05,
"logits/chosen": -0.44220152497291565,
"logits/rejected": -0.5788168907165527,
"logps/chosen": -4.989194869995117,
"logps/rejected": -18.047056198120117,
"loss": 1.0011777877807617,
"memory(GiB)": 40.85,
"nll_loss": 0.4066605269908905,
"rewards/accuracies": 0.71875,
"rewards/chosen": 0.021916719153523445,
"rewards/margins": 0.2587287425994873,
"rewards/rejected": -0.236812025308609,
"step": 25,
"train_speed(iter/s)": 0.011239
},
{
"epoch": 0.06538824269097768,
"grad_norm": 1.766322135925293,
"learning_rate": 8.666666666666667e-05,
"logits/chosen": -0.3389984369277954,
"logits/rejected": -0.543292224407196,
"logps/chosen": -11.735610961914062,
"logps/rejected": -26.25033950805664,
"loss": 1.0063844919204712,
"memory(GiB)": 40.85,
"nll_loss": 0.5172990560531616,
"rewards/accuracies": 0.84375,
"rewards/chosen": 0.07315510511398315,
"rewards/margins": 0.5734083652496338,
"rewards/rejected": -0.5002533197402954,
"step": 26,
"train_speed(iter/s)": 0.011238
},
{
"epoch": 0.06790317510216913,
"grad_norm": 3.3314130306243896,
"learning_rate": 9e-05,
"logits/chosen": -0.37741950154304504,
"logits/rejected": -0.5884826183319092,
"logps/chosen": -5.442512035369873,
"logps/rejected": -27.738323211669922,
"loss": 0.8821365237236023,
"memory(GiB)": 40.85,
"nll_loss": 0.4055330753326416,
"rewards/accuracies": 0.875,
"rewards/chosen": -0.03083166666328907,
"rewards/margins": 0.6056570410728455,
"rewards/rejected": -0.6364887952804565,
"step": 27,
"train_speed(iter/s)": 0.011238
},
{
"epoch": 0.07041810751336058,
"grad_norm": 2.849647283554077,
"learning_rate": 9.333333333333334e-05,
"logits/chosen": -0.4310716688632965,
"logits/rejected": -0.5529810190200806,
"logps/chosen": -8.224971771240234,
"logps/rejected": -26.79846954345703,
"loss": 0.8747767806053162,
"memory(GiB)": 40.85,
"nll_loss": 0.45313140749931335,
"rewards/accuracies": 0.875,
"rewards/chosen": -0.07478700578212738,
"rewards/margins": 0.8052245378494263,
"rewards/rejected": -0.8800115585327148,
"step": 28,
"train_speed(iter/s)": 0.011238
},
{
"epoch": 0.07293303992455202,
"grad_norm": 2.247368097305298,
"learning_rate": 9.666666666666667e-05,
"logits/chosen": -0.37296879291534424,
"logits/rejected": -0.5259015560150146,
"logps/chosen": -6.546780109405518,
"logps/rejected": -25.603477478027344,
"loss": 0.9804578423500061,
"memory(GiB)": 40.85,
"nll_loss": 0.4873877465724945,
"rewards/accuracies": 0.75,
"rewards/chosen": -0.046319298446178436,
"rewards/margins": 0.5485984086990356,
"rewards/rejected": -0.5949177145957947,
"step": 29,
"train_speed(iter/s)": 0.011239
},
{
"epoch": 0.07544797233574348,
"grad_norm": 1.7451585531234741,
"learning_rate": 0.0001,
"logits/chosen": -0.36992424726486206,
"logits/rejected": -0.45540890097618103,
"logps/chosen": -6.483048439025879,
"logps/rejected": -18.744525909423828,
"loss": 0.9453181624412537,
"memory(GiB)": 40.85,
"nll_loss": 0.37866073846817017,
"rewards/accuracies": 0.75,
"rewards/chosen": 0.0520947091281414,
"rewards/margins": 0.33587026596069336,
"rewards/rejected": -0.28377556800842285,
"step": 30,
"train_speed(iter/s)": 0.01124
},
{
"epoch": 0.07796290474693493,
"grad_norm": 2.8843863010406494,
"learning_rate": 0.00010333333333333334,
"logits/chosen": -0.3973531723022461,
"logits/rejected": -0.4880366325378418,
"logps/chosen": -6.5046491622924805,
"logps/rejected": -18.793209075927734,
"loss": 1.0352380275726318,
"memory(GiB)": 40.85,
"nll_loss": 0.514582097530365,
"rewards/accuracies": 0.8125,
"rewards/chosen": 0.06333249807357788,
"rewards/margins": 0.5268359780311584,
"rewards/rejected": -0.4635034203529358,
"step": 31,
"train_speed(iter/s)": 0.011242
},
{
"epoch": 0.08047783715812637,
"grad_norm": 1.9934616088867188,
"learning_rate": 0.00010666666666666667,
"logits/chosen": -0.38435813784599304,
"logits/rejected": -0.4866703450679779,
"logps/chosen": -5.984093189239502,
"logps/rejected": -28.37721061706543,
"loss": 0.9228850603103638,
"memory(GiB)": 40.85,
"nll_loss": 0.3919341564178467,
"rewards/accuracies": 0.75,
"rewards/chosen": 0.08762034773826599,
"rewards/margins": 0.4990919232368469,
"rewards/rejected": -0.41147157549858093,
"step": 32,
"train_speed(iter/s)": 0.011242
},
{
"epoch": 0.08299276956931782,
"grad_norm": 2.605156421661377,
"learning_rate": 0.00011000000000000002,
"logits/chosen": -0.3683161437511444,
"logits/rejected": -0.4800977110862732,
"logps/chosen": -6.79887056350708,
"logps/rejected": -18.521530151367188,
"loss": 0.9287618398666382,
"memory(GiB)": 40.85,
"nll_loss": 0.4155515730381012,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.062238909304142,
"rewards/margins": 0.4814634323120117,
"rewards/rejected": -0.41922450065612793,
"step": 33,
"train_speed(iter/s)": 0.011243
},
{
"epoch": 0.08550770198050928,
"grad_norm": 2.1593198776245117,
"learning_rate": 0.00011333333333333334,
"logits/chosen": -0.3462904989719391,
"logits/rejected": -0.4482634663581848,
"logps/chosen": -4.484028339385986,
"logps/rejected": -22.155223846435547,
"loss": 0.8287199139595032,
"memory(GiB)": 40.85,
"nll_loss": 0.3564324378967285,
"rewards/accuracies": 0.8125,
"rewards/chosen": -0.011370105668902397,
"rewards/margins": 0.8015316724777222,
"rewards/rejected": -0.8129018545150757,
"step": 34,
"train_speed(iter/s)": 0.011244
},
{
"epoch": 0.08802263439170073,
"grad_norm": 2.1223862171173096,
"learning_rate": 0.00011666666666666668,
"logits/chosen": -0.23746490478515625,
"logits/rejected": -0.4123544991016388,
"logps/chosen": -4.062009334564209,
"logps/rejected": -30.214771270751953,
"loss": 0.8381334543228149,
"memory(GiB)": 40.85,
"nll_loss": 0.45768678188323975,
"rewards/accuracies": 0.84375,
"rewards/chosen": 0.06588438153266907,
"rewards/margins": 1.1650195121765137,
"rewards/rejected": -1.0991352796554565,
"step": 35,
"train_speed(iter/s)": 0.011244
},
{
"epoch": 0.09053756680289217,
"grad_norm": 1.7519793510437012,
"learning_rate": 0.00012,
"logits/chosen": -0.274143248796463,
"logits/rejected": -0.4072067439556122,
"logps/chosen": -7.12678861618042,
"logps/rejected": -29.586929321289062,
"loss": 0.7818687558174133,
"memory(GiB)": 40.85,
"nll_loss": 0.38336753845214844,
"rewards/accuracies": 0.84375,
"rewards/chosen": 0.030900314450263977,
"rewards/margins": 1.0601840019226074,
"rewards/rejected": -1.0292836427688599,
"step": 36,
"train_speed(iter/s)": 0.011244
},
{
"epoch": 0.09305249921408362,
"grad_norm": 2.2621781826019287,
"learning_rate": 0.00012333333333333334,
"logits/chosen": -0.30612003803253174,
"logits/rejected": -0.44930776953697205,
"logps/chosen": -5.637537956237793,
"logps/rejected": -30.86564064025879,
"loss": 0.7518173456192017,
"memory(GiB)": 40.85,
"nll_loss": 0.4073091149330139,
"rewards/accuracies": 0.875,
"rewards/chosen": -0.1094760149717331,
"rewards/margins": 1.2509604692459106,
"rewards/rejected": -1.3604364395141602,
"step": 37,
"train_speed(iter/s)": 0.011245
},
{
"epoch": 0.09556743162527508,
"grad_norm": 2.6005046367645264,
"learning_rate": 0.00012666666666666666,
"logits/chosen": -0.36841830611228943,
"logits/rejected": -0.44501256942749023,
"logps/chosen": -8.786764144897461,
"logps/rejected": -21.693777084350586,
"loss": 0.967311441898346,
"memory(GiB)": 40.85,
"nll_loss": 0.5350124835968018,
"rewards/accuracies": 0.84375,
"rewards/chosen": -0.05166015028953552,
"rewards/margins": 0.9184513092041016,
"rewards/rejected": -0.9701113700866699,
"step": 38,
"train_speed(iter/s)": 0.011247
},
{
"epoch": 0.09808236403646652,
"grad_norm": 7.679723262786865,
"learning_rate": 0.00013000000000000002,
"logits/chosen": -0.3933795094490051,
"logits/rejected": -0.4303474426269531,
"logps/chosen": -9.630545616149902,
"logps/rejected": -25.0108642578125,
"loss": 1.1940371990203857,
"memory(GiB)": 40.85,
"nll_loss": 0.6422770023345947,
"rewards/accuracies": 0.65625,
"rewards/chosen": -0.19723013043403625,
"rewards/margins": 0.8150386214256287,
"rewards/rejected": -1.0122687816619873,
"step": 39,
"train_speed(iter/s)": 0.011247
},
{
"epoch": 0.10059729644765797,
"grad_norm": 2.497746229171753,
"learning_rate": 0.00013333333333333334,
"logits/chosen": -0.3561173677444458,
"logits/rejected": -0.4964173436164856,
"logps/chosen": -6.288295269012451,
"logps/rejected": -28.722339630126953,
"loss": 0.7734813690185547,
"memory(GiB)": 40.85,
"nll_loss": 0.35979557037353516,
"rewards/accuracies": 0.84375,
"rewards/chosen": 0.020053118467330933,
"rewards/margins": 1.0713183879852295,
"rewards/rejected": -1.0512654781341553,
"step": 40,
"train_speed(iter/s)": 0.011248
},
{
"epoch": 0.10311222885884942,
"grad_norm": 3.900786876678467,
"learning_rate": 0.00013666666666666666,
"logits/chosen": -0.30438148975372314,
"logits/rejected": -0.4660162031650543,
"logps/chosen": -9.80126953125,
"logps/rejected": -22.89883804321289,
"loss": 1.0617499351501465,
"memory(GiB)": 40.85,
"nll_loss": 0.5348615646362305,
"rewards/accuracies": 0.71875,
"rewards/chosen": 0.037312038242816925,
"rewards/margins": 0.48836010694503784,
"rewards/rejected": -0.4510480761528015,
"step": 41,
"train_speed(iter/s)": 0.011248
},
{
"epoch": 0.10562716127004086,
"grad_norm": 4.212996006011963,
"learning_rate": 0.00014,
"logits/chosen": -0.37392380833625793,
"logits/rejected": -0.4811669588088989,
"logps/chosen": -8.54138469696045,
"logps/rejected": -24.88803482055664,
"loss": 0.9449828267097473,
"memory(GiB)": 40.85,
"nll_loss": 0.40984830260276794,
"rewards/accuracies": 0.71875,
"rewards/chosen": -0.078499935567379,
"rewards/margins": 0.6149317026138306,
"rewards/rejected": -0.6934316754341125,
"step": 42,
"train_speed(iter/s)": 0.011249
},
{
"epoch": 0.10814209368123232,
"grad_norm": 2.7297940254211426,
"learning_rate": 0.00014333333333333334,
"logits/chosen": -0.22235050797462463,
"logits/rejected": -0.44656193256378174,
"logps/chosen": -3.8628368377685547,
"logps/rejected": -29.070890426635742,
"loss": 0.6864454746246338,
"memory(GiB)": 40.85,
"nll_loss": 0.3404179513454437,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.10101112723350525,
"rewards/margins": 1.1784940958023071,
"rewards/rejected": -1.0774829387664795,
"step": 43,
"train_speed(iter/s)": 0.011247
},
{
"epoch": 0.11065702609242377,
"grad_norm": 4.357929229736328,
"learning_rate": 0.00014666666666666666,
"logits/chosen": -0.3152369558811188,
"logits/rejected": -0.4675106406211853,
"logps/chosen": -8.47473430633545,
"logps/rejected": -35.49666976928711,
"loss": 0.8841890096664429,
"memory(GiB)": 40.85,
"nll_loss": 0.543793261051178,
"rewards/accuracies": 0.8125,
"rewards/chosen": -0.2599925100803375,
"rewards/margins": 1.5472975969314575,
"rewards/rejected": -1.8072898387908936,
"step": 44,
"train_speed(iter/s)": 0.011248
},
{
"epoch": 0.11317195850361522,
"grad_norm": 4.053813934326172,
"learning_rate": 0.00015000000000000001,
"logits/chosen": -0.47932106256484985,
"logits/rejected": -0.5357992053031921,
"logps/chosen": -10.139131546020508,
"logps/rejected": -29.30261993408203,
"loss": 1.0090879201889038,
"memory(GiB)": 40.85,
"nll_loss": 0.6002873182296753,
"rewards/accuracies": 0.75,
"rewards/chosen": -0.2646394371986389,
"rewards/margins": 1.3857942819595337,
"rewards/rejected": -1.6504336595535278,
"step": 45,
"train_speed(iter/s)": 0.01125
},
{
"epoch": 0.11568689091480666,
"grad_norm": 3.4071342945098877,
"learning_rate": 0.00015333333333333334,
"logits/chosen": -0.35965389013290405,
"logits/rejected": -0.4886631965637207,
"logps/chosen": -6.492125988006592,
"logps/rejected": -33.90357971191406,
"loss": 0.9477238655090332,
"memory(GiB)": 40.85,
"nll_loss": 0.5519906878471375,
"rewards/accuracies": 0.8125,
"rewards/chosen": -0.13393068313598633,
"rewards/margins": 1.3498430252075195,
"rewards/rejected": -1.4837737083435059,
"step": 46,
"train_speed(iter/s)": 0.011251
},
{
"epoch": 0.11820182332599811,
"grad_norm": 1.5676898956298828,
"learning_rate": 0.00015666666666666666,
"logits/chosen": -0.3339039087295532,
"logits/rejected": -0.5405474305152893,
"logps/chosen": -5.18754768371582,
"logps/rejected": -34.61940383911133,
"loss": 0.5877978205680847,
"memory(GiB)": 40.85,
"nll_loss": 0.26233971118927,
"rewards/accuracies": 0.84375,
"rewards/chosen": 0.04858784377574921,
"rewards/margins": 1.4838428497314453,
"rewards/rejected": -1.4352549314498901,
"step": 47,
"train_speed(iter/s)": 0.011252
},
{
"epoch": 0.12071675573718957,
"grad_norm": 1.7600055932998657,
"learning_rate": 0.00016,
"logits/chosen": -0.38554954528808594,
"logits/rejected": -0.5349220633506775,
"logps/chosen": -5.35024356842041,
"logps/rejected": -30.936561584472656,
"loss": 0.7445188760757446,
"memory(GiB)": 40.85,
"nll_loss": 0.3484676480293274,
"rewards/accuracies": 0.84375,
"rewards/chosen": -0.04428477957844734,
"rewards/margins": 1.158116340637207,
"rewards/rejected": -1.2024011611938477,
"step": 48,
"train_speed(iter/s)": 0.011253
},
{
"epoch": 0.12323168814838101,
"grad_norm": 1.8286348581314087,
"learning_rate": 0.00016333333333333334,
"logits/chosen": -0.3060781955718994,
"logits/rejected": -0.5333737134933472,
"logps/chosen": -4.790343761444092,
"logps/rejected": -32.540409088134766,
"loss": 0.6686277985572815,
"memory(GiB)": 40.85,
"nll_loss": 0.3360018730163574,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.0967080146074295,
"rewards/margins": 1.285821795463562,
"rewards/rejected": -1.1891138553619385,
"step": 49,
"train_speed(iter/s)": 0.011254
},
{
"epoch": 0.12574662055957248,
"grad_norm": 1.8983184099197388,
"learning_rate": 0.0001666666666666667,
"logits/chosen": -0.22582519054412842,
"logits/rejected": -0.47035256028175354,
"logps/chosen": -6.48522424697876,
"logps/rejected": -32.73487091064453,
"loss": 0.8076327443122864,
"memory(GiB)": 40.85,
"nll_loss": 0.3926582336425781,
"rewards/accuracies": 0.78125,
"rewards/chosen": 0.01478707417845726,
"rewards/margins": 1.167083501815796,
"rewards/rejected": -1.1522964239120483,
"step": 50,
"train_speed(iter/s)": 0.011253
}
],
"logging_steps": 1,
"max_steps": 1191,
"num_input_tokens_seen": 0,
"num_train_epochs": 3,
"save_steps": 50,
"stateful_callbacks": {
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": true,
"should_training_stop": false
},
"attributes": {}
}
},
"total_flos": 2.7419712375750656e+16,
"train_batch_size": 2,
"trial_name": null,
"trial_params": null
}