PEFT
Safetensors
pair1-200 / trainer_state.json
chen
Upload folder using huggingface_hub
7738ed1 verified
Raw
History Blame Contribute Delete
129 kB
{
"best_global_step": null,
"best_metric": null,
"best_model_checkpoint": null,
"epoch": 0.9705793145283591,
"eval_steps": 500,
"global_step": 200,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"epoch": 0.004852896572641796,
"grad_norm": 3.7387311458587646,
"learning_rate": 6.451612903225806e-06,
"logits/chosen": -0.5510790944099426,
"logits/rejected": -0.5881398916244507,
"logps/chosen": -12.010782241821289,
"logps/rejected": -14.501535415649414,
"loss": 1.3914958238601685,
"memory(GiB)": 30.65,
"nll_loss": 0.6983487010002136,
"rewards/accuracies": 0.0,
"rewards/chosen": 0.0,
"rewards/margins": 0.0,
"rewards/rejected": 0.0,
"step": 1,
"train_speed(iter/s)": 0.010451
},
{
"epoch": 0.009705793145283591,
"grad_norm": 5.074642658233643,
"learning_rate": 1.2903225806451613e-05,
"logits/chosen": -0.523028552532196,
"logits/rejected": -0.48799216747283936,
"logps/chosen": -15.598363876342773,
"logps/rejected": -12.491965293884277,
"loss": 1.3891178369522095,
"memory(GiB)": 33.32,
"nll_loss": 0.6959705948829651,
"rewards/accuracies": 0.0,
"rewards/chosen": 0.0,
"rewards/margins": 0.0,
"rewards/rejected": 0.0,
"step": 2,
"train_speed(iter/s)": 0.010818
},
{
"epoch": 0.014558689717925387,
"grad_norm": 4.8900933265686035,
"learning_rate": 1.935483870967742e-05,
"logits/chosen": -0.6194146871566772,
"logits/rejected": -0.6501045227050781,
"logps/chosen": -4.106720924377441,
"logps/rejected": -9.803337097167969,
"loss": 1.0989456176757812,
"memory(GiB)": 33.32,
"nll_loss": 0.4074462950229645,
"rewards/accuracies": 0.5625,
"rewards/chosen": 0.0007492969743907452,
"rewards/margins": 0.003412690246477723,
"rewards/rejected": -0.0026633935049176216,
"step": 3,
"train_speed(iter/s)": 0.010979
},
{
"epoch": 0.019411586290567183,
"grad_norm": 4.551450729370117,
"learning_rate": 2.5806451612903226e-05,
"logits/chosen": -0.4892222285270691,
"logits/rejected": -0.6288261413574219,
"logps/chosen": -11.312190055847168,
"logps/rejected": -19.471235275268555,
"loss": 1.4801559448242188,
"memory(GiB)": 36.76,
"nll_loss": 0.788896381855011,
"rewards/accuracies": 0.59375,
"rewards/chosen": 0.009614704176783562,
"rewards/margins": 0.003918787930160761,
"rewards/rejected": 0.00569591810926795,
"step": 4,
"train_speed(iter/s)": 0.011017
},
{
"epoch": 0.024264482863208977,
"grad_norm": 5.593626499176025,
"learning_rate": 3.2258064516129034e-05,
"logits/chosen": -0.5494186282157898,
"logits/rejected": -0.6138424277305603,
"logps/chosen": -9.588997840881348,
"logps/rejected": -13.734201431274414,
"loss": 1.360138177871704,
"memory(GiB)": 36.76,
"nll_loss": 0.6719292998313904,
"rewards/accuracies": 0.65625,
"rewards/chosen": 0.006837800145149231,
"rewards/margins": 0.01003339048475027,
"rewards/rejected": -0.003195591736584902,
"step": 5,
"train_speed(iter/s)": 0.011063
},
{
"epoch": 0.029117379435850774,
"grad_norm": 4.7115631103515625,
"learning_rate": 3.870967741935484e-05,
"logits/chosen": -0.5902564525604248,
"logits/rejected": -0.6040255427360535,
"logps/chosen": -10.28292465209961,
"logps/rejected": -10.143241882324219,
"loss": 1.4910708665847778,
"memory(GiB)": 36.76,
"nll_loss": 0.7961816787719727,
"rewards/accuracies": 0.5,
"rewards/chosen": 0.010182744823396206,
"rewards/margins": -0.0029990212060511112,
"rewards/rejected": 0.013181766495108604,
"step": 6,
"train_speed(iter/s)": 0.011101
},
{
"epoch": 0.03397027600849257,
"grad_norm": 3.242079257965088,
"learning_rate": 4.516129032258064e-05,
"logits/chosen": -0.5178452730178833,
"logits/rejected": -0.5171934366226196,
"logps/chosen": -11.35531997680664,
"logps/rejected": -13.940824508666992,
"loss": 1.256138563156128,
"memory(GiB)": 36.76,
"nll_loss": 0.5596349239349365,
"rewards/accuracies": 0.4375,
"rewards/chosen": 0.027008483186364174,
"rewards/margins": -0.005357709713280201,
"rewards/rejected": 0.03236619383096695,
"step": 7,
"train_speed(iter/s)": 0.01111
},
{
"epoch": 0.038823172581134366,
"grad_norm": 4.068852424621582,
"learning_rate": 5.161290322580645e-05,
"logits/chosen": -0.5522034168243408,
"logits/rejected": -0.5255574584007263,
"logps/chosen": -12.265619277954102,
"logps/rejected": -11.32555866241455,
"loss": 1.3358875513076782,
"memory(GiB)": 36.76,
"nll_loss": 0.6352814435958862,
"rewards/accuracies": 0.40625,
"rewards/chosen": 0.021265771239995956,
"rewards/margins": -0.011079448275268078,
"rewards/rejected": 0.03234522044658661,
"step": 8,
"train_speed(iter/s)": 0.011128
},
{
"epoch": 0.04367606915377616,
"grad_norm": 3.7364556789398193,
"learning_rate": 5.8064516129032266e-05,
"logits/chosen": -0.5157386064529419,
"logits/rejected": -0.5693979263305664,
"logps/chosen": -8.727921485900879,
"logps/rejected": -15.667279243469238,
"loss": 1.2342674732208252,
"memory(GiB)": 36.76,
"nll_loss": 0.565812349319458,
"rewards/accuracies": 0.59375,
"rewards/chosen": 0.06674117594957352,
"rewards/margins": 0.05803339183330536,
"rewards/rejected": 0.008707791566848755,
"step": 9,
"train_speed(iter/s)": 0.01114
},
{
"epoch": 0.048528965726417954,
"grad_norm": 5.376058578491211,
"learning_rate": 6.451612903225807e-05,
"logits/chosen": -0.5336275696754456,
"logits/rejected": -0.5664803385734558,
"logps/chosen": -10.200874328613281,
"logps/rejected": -14.752674102783203,
"loss": 1.3360637426376343,
"memory(GiB)": 36.76,
"nll_loss": 0.6595087647438049,
"rewards/accuracies": 0.625,
"rewards/chosen": 0.05797234922647476,
"rewards/margins": 0.05362413078546524,
"rewards/rejected": 0.00434822216629982,
"step": 10,
"train_speed(iter/s)": 0.011149
},
{
"epoch": 0.05338186229905975,
"grad_norm": 3.41105318069458,
"learning_rate": 7.096774193548388e-05,
"logits/chosen": -0.5836127996444702,
"logits/rejected": -0.5781168341636658,
"logps/chosen": -16.744802474975586,
"logps/rejected": -10.854264259338379,
"loss": 1.4587984085083008,
"memory(GiB)": 36.76,
"nll_loss": 0.8293395042419434,
"rewards/accuracies": 0.78125,
"rewards/chosen": 0.10905362665653229,
"rewards/margins": 0.15107941627502441,
"rewards/rejected": -0.04202580079436302,
"step": 11,
"train_speed(iter/s)": 0.011156
},
{
"epoch": 0.05823475887170155,
"grad_norm": 3.8034191131591797,
"learning_rate": 7.741935483870968e-05,
"logits/chosen": -0.5040208101272583,
"logits/rejected": -0.5330135822296143,
"logps/chosen": -9.613079071044922,
"logps/rejected": -11.064685821533203,
"loss": 1.267149806022644,
"memory(GiB)": 36.76,
"nll_loss": 0.6177489161491394,
"rewards/accuracies": 0.65625,
"rewards/chosen": 0.02217767760157585,
"rewards/margins": 0.10778125375509262,
"rewards/rejected": -0.08560357987880707,
"step": 12,
"train_speed(iter/s)": 0.011164
},
{
"epoch": 0.06308765544434335,
"grad_norm": 3.453901767730713,
"learning_rate": 8.387096774193549e-05,
"logits/chosen": -0.5467038154602051,
"logits/rejected": -0.577677845954895,
"logps/chosen": -8.353002548217773,
"logps/rejected": -13.458589553833008,
"loss": 1.233524203300476,
"memory(GiB)": 36.76,
"nll_loss": 0.5735047459602356,
"rewards/accuracies": 0.625,
"rewards/chosen": 0.0792345255613327,
"rewards/margins": 0.10825661569833755,
"rewards/rejected": -0.02902209758758545,
"step": 13,
"train_speed(iter/s)": 0.011171
},
{
"epoch": 0.06794055201698514,
"grad_norm": 3.1424827575683594,
"learning_rate": 9.032258064516129e-05,
"logits/chosen": -0.5190276503562927,
"logits/rejected": -0.5021806359291077,
"logps/chosen": -11.147318840026855,
"logps/rejected": -11.436860084533691,
"loss": 1.254595398902893,
"memory(GiB)": 40.31,
"nll_loss": 0.5940842628479004,
"rewards/accuracies": 0.46875,
"rewards/chosen": 0.12143825739622116,
"rewards/margins": 0.11505899578332901,
"rewards/rejected": 0.006379259284585714,
"step": 14,
"train_speed(iter/s)": 0.011173
},
{
"epoch": 0.07279344858962693,
"grad_norm": 3.430884599685669,
"learning_rate": 9.677419354838711e-05,
"logits/chosen": -0.4556944668292999,
"logits/rejected": -0.4863564968109131,
"logps/chosen": -13.696606636047363,
"logps/rejected": -16.93030548095703,
"loss": 1.4541280269622803,
"memory(GiB)": 40.31,
"nll_loss": 0.7789333462715149,
"rewards/accuracies": 0.5625,
"rewards/chosen": 0.06093275174498558,
"rewards/margins": 0.06727998703718185,
"rewards/rejected": -0.006347230635583401,
"step": 15,
"train_speed(iter/s)": 0.011173
},
{
"epoch": 0.07764634516226873,
"grad_norm": 5.697832107543945,
"learning_rate": 0.0001032258064516129,
"logits/chosen": -0.5404947400093079,
"logits/rejected": -0.5623520016670227,
"logps/chosen": -8.202204704284668,
"logps/rejected": -12.407597541809082,
"loss": 1.244711995124817,
"memory(GiB)": 40.31,
"nll_loss": 0.601537823677063,
"rewards/accuracies": 0.5625,
"rewards/chosen": 0.14254164695739746,
"rewards/margins": 0.16008448600769043,
"rewards/rejected": -0.017542842775583267,
"step": 16,
"train_speed(iter/s)": 0.011181
},
{
"epoch": 0.08249924173491052,
"grad_norm": 3.0015194416046143,
"learning_rate": 0.00010967741935483871,
"logits/chosen": -0.5660006999969482,
"logits/rejected": -0.5559377074241638,
"logps/chosen": -10.180459022521973,
"logps/rejected": -10.599821090698242,
"loss": 1.2977104187011719,
"memory(GiB)": 40.31,
"nll_loss": 0.6220536231994629,
"rewards/accuracies": 0.5625,
"rewards/chosen": 0.12847113609313965,
"rewards/margins": 0.0701126754283905,
"rewards/rejected": 0.058358460664749146,
"step": 17,
"train_speed(iter/s)": 0.011186
},
{
"epoch": 0.08735213830755233,
"grad_norm": 5.351679801940918,
"learning_rate": 0.00011612903225806453,
"logits/chosen": -0.4931953251361847,
"logits/rejected": -0.5151236653327942,
"logps/chosen": -9.91970157623291,
"logps/rejected": -17.587669372558594,
"loss": 1.2324532270431519,
"memory(GiB)": 40.31,
"nll_loss": 0.6188042163848877,
"rewards/accuracies": 0.6875,
"rewards/chosen": 0.10037277638912201,
"rewards/margins": 0.1970798224210739,
"rewards/rejected": -0.0967070460319519,
"step": 18,
"train_speed(iter/s)": 0.011184
},
{
"epoch": 0.09220503488019412,
"grad_norm": 2.8047103881835938,
"learning_rate": 0.00012258064516129034,
"logits/chosen": -0.5366685390472412,
"logits/rejected": -0.5188369154930115,
"logps/chosen": -11.985616683959961,
"logps/rejected": -9.721867561340332,
"loss": 1.243293285369873,
"memory(GiB)": 40.31,
"nll_loss": 0.5873799920082092,
"rewards/accuracies": 0.5625,
"rewards/chosen": 0.1405532956123352,
"rewards/margins": 0.13308030366897583,
"rewards/rejected": 0.007473001256585121,
"step": 19,
"train_speed(iter/s)": 0.011187
},
{
"epoch": 0.09705793145283591,
"grad_norm": 3.8547439575195312,
"learning_rate": 0.00012903225806451613,
"logits/chosen": -0.4702628254890442,
"logits/rejected": -0.45280686020851135,
"logps/chosen": -11.422282218933105,
"logps/rejected": -13.049072265625,
"loss": 1.1890830993652344,
"memory(GiB)": 40.31,
"nll_loss": 0.49578943848609924,
"rewards/accuracies": 0.5,
"rewards/chosen": 0.15254227817058563,
"rewards/margins": 0.06372587382793427,
"rewards/rejected": 0.08881638944149017,
"step": 20,
"train_speed(iter/s)": 0.011186
},
{
"epoch": 0.10191082802547771,
"grad_norm": 3.9698216915130615,
"learning_rate": 0.00013548387096774193,
"logits/chosen": -0.46789583563804626,
"logits/rejected": -0.511239230632782,
"logps/chosen": -6.999385833740234,
"logps/rejected": -15.381391525268555,
"loss": 1.1891487836837769,
"memory(GiB)": 40.31,
"nll_loss": 0.4858560860157013,
"rewards/accuracies": 0.53125,
"rewards/chosen": 0.0561373308300972,
"rewards/margins": 0.021670352667570114,
"rewards/rejected": 0.034466978162527084,
"step": 21,
"train_speed(iter/s)": 0.01119
},
{
"epoch": 0.1067637245981195,
"grad_norm": 2.810508966445923,
"learning_rate": 0.00014193548387096775,
"logits/chosen": -0.43238648772239685,
"logits/rejected": -0.5333250164985657,
"logps/chosen": -10.029150009155273,
"logps/rejected": -19.058868408203125,
"loss": 1.1820727586746216,
"memory(GiB)": 40.31,
"nll_loss": 0.5326224565505981,
"rewards/accuracies": 0.65625,
"rewards/chosen": 0.09418301284313202,
"rewards/margins": 0.12642550468444824,
"rewards/rejected": -0.03224247321486473,
"step": 22,
"train_speed(iter/s)": 0.011191
},
{
"epoch": 0.1116166211707613,
"grad_norm": 5.709966659545898,
"learning_rate": 0.00014838709677419355,
"logits/chosen": -0.42264610528945923,
"logits/rejected": -0.45910894870758057,
"logps/chosen": -16.804805755615234,
"logps/rejected": -18.372587203979492,
"loss": 1.3850518465042114,
"memory(GiB)": 40.31,
"nll_loss": 0.8230935335159302,
"rewards/accuracies": 0.8125,
"rewards/chosen": 0.05581340938806534,
"rewards/margins": 0.3414239287376404,
"rewards/rejected": -0.285610556602478,
"step": 23,
"train_speed(iter/s)": 0.01119
},
{
"epoch": 0.1164695177434031,
"grad_norm": 8.213228225708008,
"learning_rate": 0.00015483870967741937,
"logits/chosen": -0.43471360206604004,
"logits/rejected": -0.4376092553138733,
"logps/chosen": -10.293994903564453,
"logps/rejected": -12.654733657836914,
"loss": 1.2845356464385986,
"memory(GiB)": 40.31,
"nll_loss": 0.6288778781890869,
"rewards/accuracies": 0.59375,
"rewards/chosen": 0.019672194495797157,
"rewards/margins": 0.11052073538303375,
"rewards/rejected": -0.09084855020046234,
"step": 24,
"train_speed(iter/s)": 0.011191
},
{
"epoch": 0.12132241431604489,
"grad_norm": 2.5066726207733154,
"learning_rate": 0.00016129032258064516,
"logits/chosen": -0.45425349473953247,
"logits/rejected": -0.46823209524154663,
"logps/chosen": -5.9361162185668945,
"logps/rejected": -12.616898536682129,
"loss": 0.9625968933105469,
"memory(GiB)": 40.31,
"nll_loss": 0.3818866014480591,
"rewards/accuracies": 0.71875,
"rewards/chosen": 0.14780059456825256,
"rewards/margins": 0.3101717531681061,
"rewards/rejected": -0.16237111389636993,
"step": 25,
"train_speed(iter/s)": 0.011195
},
{
"epoch": 0.1261753108886867,
"grad_norm": 3.1320712566375732,
"learning_rate": 0.00016774193548387098,
"logits/chosen": -0.47818127274513245,
"logits/rejected": -0.43204230070114136,
"logps/chosen": -13.965362548828125,
"logps/rejected": -15.635419845581055,
"loss": 1.1598286628723145,
"memory(GiB)": 40.31,
"nll_loss": 0.6072496175765991,
"rewards/accuracies": 0.625,
"rewards/chosen": 0.06804848462343216,
"rewards/margins": 0.44113460183143616,
"rewards/rejected": -0.3730861246585846,
"step": 26,
"train_speed(iter/s)": 0.011195
},
{
"epoch": 0.13102820746132848,
"grad_norm": 3.8042213916778564,
"learning_rate": 0.00017419354838709678,
"logits/chosen": -0.449899286031723,
"logits/rejected": -0.4721740484237671,
"logps/chosen": -9.528651237487793,
"logps/rejected": -12.257569313049316,
"loss": 1.2201637029647827,
"memory(GiB)": 40.31,
"nll_loss": 0.6225947737693787,
"rewards/accuracies": 0.6875,
"rewards/chosen": 0.07078885287046432,
"rewards/margins": 0.28294628858566284,
"rewards/rejected": -0.21215742826461792,
"step": 27,
"train_speed(iter/s)": 0.011198
},
{
"epoch": 0.13588110403397027,
"grad_norm": 2.5645625591278076,
"learning_rate": 0.00018064516129032257,
"logits/chosen": -0.3968259394168854,
"logits/rejected": -0.41532400250434875,
"logps/chosen": -7.651938438415527,
"logps/rejected": -15.575130462646484,
"loss": 0.9698889851570129,
"memory(GiB)": 40.31,
"nll_loss": 0.4171852469444275,
"rewards/accuracies": 0.6875,
"rewards/chosen": 0.1875855028629303,
"rewards/margins": 0.46900543570518494,
"rewards/rejected": -0.28141990303993225,
"step": 28,
"train_speed(iter/s)": 0.011199
},
{
"epoch": 0.14073400060661206,
"grad_norm": 3.2087931632995605,
"learning_rate": 0.0001870967741935484,
"logits/chosen": -0.38016778230667114,
"logits/rejected": -0.45883065462112427,
"logps/chosen": -9.820419311523438,
"logps/rejected": -17.21317481994629,
"loss": 1.156844973564148,
"memory(GiB)": 40.31,
"nll_loss": 0.5829570293426514,
"rewards/accuracies": 0.71875,
"rewards/chosen": 0.21587063372135162,
"rewards/margins": 0.3926744759082794,
"rewards/rejected": -0.1768038272857666,
"step": 29,
"train_speed(iter/s)": 0.0112
},
{
"epoch": 0.14558689717925385,
"grad_norm": 3.5056474208831787,
"learning_rate": 0.00019354838709677422,
"logits/chosen": -0.43780362606048584,
"logits/rejected": -0.46428602933883667,
"logps/chosen": -12.7692289352417,
"logps/rejected": -16.947650909423828,
"loss": 1.2092680931091309,
"memory(GiB)": 40.31,
"nll_loss": 0.7365323305130005,
"rewards/accuracies": 0.75,
"rewards/chosen": 0.19128330051898956,
"rewards/margins": 0.7160227298736572,
"rewards/rejected": -0.5247394442558289,
"step": 30,
"train_speed(iter/s)": 0.011202
},
{
"epoch": 0.15043979375189567,
"grad_norm": 7.983421802520752,
"learning_rate": 0.0002,
"logits/chosen": -0.3911149799823761,
"logits/rejected": -0.4533422887325287,
"logps/chosen": -11.242105484008789,
"logps/rejected": -16.97354507446289,
"loss": 1.3208513259887695,
"memory(GiB)": 40.31,
"nll_loss": 0.7320083975791931,
"rewards/accuracies": 0.75,
"rewards/chosen": -0.08527207374572754,
"rewards/margins": 0.4059477746486664,
"rewards/rejected": -0.4912198483943939,
"step": 31,
"train_speed(iter/s)": 0.011204
},
{
"epoch": 0.15529269032453746,
"grad_norm": 7.263556957244873,
"learning_rate": 0.0001999985678367986,
"logits/chosen": -0.4142841398715973,
"logits/rejected": -0.49599555134773254,
"logps/chosen": -8.028633117675781,
"logps/rejected": -19.247087478637695,
"loss": 1.1268211603164673,
"memory(GiB)": 40.31,
"nll_loss": 0.5463874936103821,
"rewards/accuracies": 0.6875,
"rewards/chosen": -0.16298356652259827,
"rewards/margins": 0.4510626792907715,
"rewards/rejected": -0.6140461564064026,
"step": 32,
"train_speed(iter/s)": 0.011206
},
{
"epoch": 0.16014558689717925,
"grad_norm": 7.569846153259277,
"learning_rate": 0.0001999942713882162,
"logits/chosen": -0.4265003502368927,
"logits/rejected": -0.42608755826950073,
"logps/chosen": -9.83013916015625,
"logps/rejected": -17.054443359375,
"loss": 1.2255939245224,
"memory(GiB)": 40.31,
"nll_loss": 0.6033804416656494,
"rewards/accuracies": 0.59375,
"rewards/chosen": -0.24369043111801147,
"rewards/margins": 0.24309512972831726,
"rewards/rejected": -0.48678556084632874,
"step": 33,
"train_speed(iter/s)": 0.011209
},
{
"epoch": 0.16499848346982104,
"grad_norm": 3.240605592727661,
"learning_rate": 0.00019998711077731716,
"logits/chosen": -0.4495273232460022,
"logits/rejected": -0.3768068850040436,
"logps/chosen": -12.2802095413208,
"logps/rejected": -12.816421508789062,
"loss": 1.085668683052063,
"memory(GiB)": 40.31,
"nll_loss": 0.5540680289268494,
"rewards/accuracies": 0.75,
"rewards/chosen": 0.0720956027507782,
"rewards/margins": 0.47421759366989136,
"rewards/rejected": -0.40212199091911316,
"step": 34,
"train_speed(iter/s)": 0.01121
},
{
"epoch": 0.16985138004246284,
"grad_norm": 2.972562551498413,
"learning_rate": 0.00019997708620920465,
"logits/chosen": -0.4633820354938507,
"logits/rejected": -0.5037291646003723,
"logps/chosen": -8.281206130981445,
"logps/rejected": -17.908266067504883,
"loss": 1.0561590194702148,
"memory(GiB)": 40.31,
"nll_loss": 0.6168872714042664,
"rewards/accuracies": 0.78125,
"rewards/chosen": 0.13331066071987152,
"rewards/margins": 0.9570158123970032,
"rewards/rejected": -0.8237051963806152,
"step": 35,
"train_speed(iter/s)": 0.011212
},
{
"epoch": 0.17470427661510465,
"grad_norm": 5.980532646179199,
"learning_rate": 0.00019996419797101514,
"logits/chosen": -0.39558717608451843,
"logits/rejected": -0.431841105222702,
"logps/chosen": -10.584002494812012,
"logps/rejected": -19.50037956237793,
"loss": 1.2352135181427002,
"memory(GiB)": 40.31,
"nll_loss": 0.6387596130371094,
"rewards/accuracies": 0.71875,
"rewards/chosen": 0.029237767681479454,
"rewards/margins": 0.46423807740211487,
"rewards/rejected": -0.43500036001205444,
"step": 36,
"train_speed(iter/s)": 0.011211
},
{
"epoch": 0.17955717318774644,
"grad_norm": 5.786473751068115,
"learning_rate": 0.00019994844643190975,
"logits/chosen": -0.3947299122810364,
"logits/rejected": -0.5335777997970581,
"logps/chosen": -10.800368309020996,
"logps/rejected": -19.217914581298828,
"loss": 1.4149001836776733,
"memory(GiB)": 40.31,
"nll_loss": 0.8904857635498047,
"rewards/accuracies": 0.84375,
"rewards/chosen": -0.04618726670742035,
"rewards/margins": 0.49434420466423035,
"rewards/rejected": -0.5405314564704895,
"step": 37,
"train_speed(iter/s)": 0.011212
},
{
"epoch": 0.18441006976038823,
"grad_norm": 2.6556568145751953,
"learning_rate": 0.00019992983204306403,
"logits/chosen": -0.39078089594841003,
"logits/rejected": -0.39872410893440247,
"logps/chosen": -12.065397262573242,
"logps/rejected": -19.61814308166504,
"loss": 1.1651582717895508,
"memory(GiB)": 40.31,
"nll_loss": 0.5659552812576294,
"rewards/accuracies": 0.59375,
"rewards/chosen": 0.06024760380387306,
"rewards/margins": 0.4251976013183594,
"rewards/rejected": -0.36494994163513184,
"step": 38,
"train_speed(iter/s)": 0.011211
},
{
"epoch": 0.18926296633303002,
"grad_norm": 4.3966779708862305,
"learning_rate": 0.0001999083553376548,
"logits/chosen": -0.4178510308265686,
"logits/rejected": -0.42042505741119385,
"logps/chosen": -10.572690963745117,
"logps/rejected": -17.888080596923828,
"loss": 1.1389288902282715,
"memory(GiB)": 40.31,
"nll_loss": 0.6220788955688477,
"rewards/accuracies": 0.8125,
"rewards/chosen": 0.14774595201015472,
"rewards/margins": 0.5430118441581726,
"rewards/rejected": -0.3952659070491791,
"step": 39,
"train_speed(iter/s)": 0.01121
},
{
"epoch": 0.19411586290567182,
"grad_norm": 2.347978115081787,
"learning_rate": 0.00019988401693084502,
"logits/chosen": -0.4415282905101776,
"logits/rejected": -0.4420144259929657,
"logps/chosen": -10.284622192382812,
"logps/rejected": -15.651193618774414,
"loss": 1.131446123123169,
"memory(GiB)": 40.31,
"nll_loss": 0.5388365387916565,
"rewards/accuracies": 0.6875,
"rewards/chosen": 0.08026871085166931,
"rewards/margins": 0.271782785654068,
"rewards/rejected": -0.19151407480239868,
"step": 40,
"train_speed(iter/s)": 0.01121
},
{
"epoch": 0.1989687594783136,
"grad_norm": 3.0811686515808105,
"learning_rate": 0.0001998568175197661,
"logits/chosen": -0.48944562673568726,
"logits/rejected": -0.48836228251457214,
"logps/chosen": -10.908992767333984,
"logps/rejected": -16.806554794311523,
"loss": 1.1378778219223022,
"memory(GiB)": 40.31,
"nll_loss": 0.5336601734161377,
"rewards/accuracies": 0.65625,
"rewards/chosen": -0.026157543063163757,
"rewards/margins": 0.3137216567993164,
"rewards/rejected": -0.33987918496131897,
"step": 41,
"train_speed(iter/s)": 0.01121
},
{
"epoch": 0.20382165605095542,
"grad_norm": 3.496178150177002,
"learning_rate": 0.00019982675788349794,
"logits/chosen": -0.4175988435745239,
"logits/rejected": -0.49307048320770264,
"logps/chosen": -8.874513626098633,
"logps/rejected": -16.90668296813965,
"loss": 1.237853765487671,
"memory(GiB)": 40.31,
"nll_loss": 0.6065552830696106,
"rewards/accuracies": 0.71875,
"rewards/chosen": 0.028882348909974098,
"rewards/margins": 0.22182509303092957,
"rewards/rejected": -0.19294273853302002,
"step": 42,
"train_speed(iter/s)": 0.01121
},
{
"epoch": 0.20867455262359721,
"grad_norm": 2.585383892059326,
"learning_rate": 0.00019979383888304666,
"logits/chosen": -0.40949565172195435,
"logits/rejected": -0.3888520896434784,
"logps/chosen": -12.942455291748047,
"logps/rejected": -16.93043327331543,
"loss": 1.1456714868545532,
"memory(GiB)": 40.31,
"nll_loss": 0.5834133625030518,
"rewards/accuracies": 0.6875,
"rewards/chosen": 0.029632963240146637,
"rewards/margins": 0.47202715277671814,
"rewards/rejected": -0.4423941969871521,
"step": 43,
"train_speed(iter/s)": 0.01121
},
{
"epoch": 0.213527449196239,
"grad_norm": 2.6477532386779785,
"learning_rate": 0.0001997580614613199,
"logits/chosen": -0.4283292591571808,
"logits/rejected": -0.417165070772171,
"logps/chosen": -11.886260986328125,
"logps/rejected": -22.782238006591797,
"loss": 1.126604676246643,
"memory(GiB)": 40.31,
"nll_loss": 0.6129148602485657,
"rewards/accuracies": 0.625,
"rewards/chosen": -0.020920906215906143,
"rewards/margins": 0.8850383162498474,
"rewards/rejected": -0.9059593677520752,
"step": 44,
"train_speed(iter/s)": 0.01121
},
{
"epoch": 0.2183803457688808,
"grad_norm": 2.563398599624634,
"learning_rate": 0.00019971942664309968,
"logits/chosen": -0.4108792245388031,
"logits/rejected": -0.4292621612548828,
"logps/chosen": -10.143468856811523,
"logps/rejected": -21.13189125061035,
"loss": 0.957160472869873,
"memory(GiB)": 40.31,
"nll_loss": 0.4789010286331177,
"rewards/accuracies": 0.6875,
"rewards/chosen": 0.04898708686232567,
"rewards/margins": 0.9526273012161255,
"rewards/rejected": -0.9036401510238647,
"step": 45,
"train_speed(iter/s)": 0.011211
},
{
"epoch": 0.2232332423415226,
"grad_norm": 5.1497344970703125,
"learning_rate": 0.00019967793553501346,
"logits/chosen": -0.3103107213973999,
"logits/rejected": -0.3952590227127075,
"logps/chosen": -12.430742263793945,
"logps/rejected": -20.878339767456055,
"loss": 1.2279822826385498,
"memory(GiB)": 40.31,
"nll_loss": 0.6726821660995483,
"rewards/accuracies": 0.65625,
"rewards/chosen": 0.020153822377324104,
"rewards/margins": 0.7637170553207397,
"rewards/rejected": -0.7435632348060608,
"step": 46,
"train_speed(iter/s)": 0.011209
},
{
"epoch": 0.2280861389141644,
"grad_norm": 3.151014566421509,
"learning_rate": 0.00019963358932550192,
"logits/chosen": -0.3890960216522217,
"logits/rejected": -0.4021611511707306,
"logps/chosen": -10.522011756896973,
"logps/rejected": -18.351852416992188,
"loss": 1.1763105392456055,
"memory(GiB)": 40.31,
"nll_loss": 0.5507612228393555,
"rewards/accuracies": 0.65625,
"rewards/chosen": -0.15107618272304535,
"rewards/margins": 0.30810290575027466,
"rewards/rejected": -0.4591791033744812,
"step": 47,
"train_speed(iter/s)": 0.011208
},
{
"epoch": 0.2329390354868062,
"grad_norm": 4.961374759674072,
"learning_rate": 0.00019958638928478523,
"logits/chosen": -0.31074726581573486,
"logits/rejected": -0.3801327645778656,
"logps/chosen": -9.19954776763916,
"logps/rejected": -21.655811309814453,
"loss": 0.9774930477142334,
"memory(GiB)": 40.31,
"nll_loss": 0.5149185657501221,
"rewards/accuracies": 0.71875,
"rewards/chosen": 0.030308127403259277,
"rewards/margins": 0.8868625164031982,
"rewards/rejected": -0.8565543293952942,
"step": 48,
"train_speed(iter/s)": 0.011208
},
{
"epoch": 0.23779193205944799,
"grad_norm": 4.1918511390686035,
"learning_rate": 0.00019953633676482669,
"logits/chosen": -0.3845188617706299,
"logits/rejected": -0.4037459194660187,
"logps/chosen": -14.745367050170898,
"logps/rejected": -18.788145065307617,
"loss": 1.2587707042694092,
"memory(GiB)": 40.31,
"nll_loss": 0.7012693285942078,
"rewards/accuracies": 0.78125,
"rewards/chosen": 0.11992412805557251,
"rewards/margins": 0.648144543170929,
"rewards/rejected": -0.5282202959060669,
"step": 49,
"train_speed(iter/s)": 0.011207
},
{
"epoch": 0.24264482863208978,
"grad_norm": 3.7718863487243652,
"learning_rate": 0.00019948343319929374,
"logits/chosen": -0.3694141209125519,
"logits/rejected": -0.474610835313797,
"logps/chosen": -10.025066375732422,
"logps/rejected": -20.226930618286133,
"loss": 1.0972646474838257,
"memory(GiB)": 40.31,
"nll_loss": 0.5580352544784546,
"rewards/accuracies": 0.75,
"rewards/chosen": -0.015783965587615967,
"rewards/margins": 0.48214325308799744,
"rewards/rejected": -0.4979272484779358,
"step": 50,
"train_speed(iter/s)": 0.011207
},
{
"epoch": 0.24749772520473157,
"grad_norm": 3.204578161239624,
"learning_rate": 0.00019942768010351727,
"logits/chosen": -0.5031870007514954,
"logits/rejected": -0.46329694986343384,
"logps/chosen": -13.154851913452148,
"logps/rejected": -16.299560546875,
"loss": 1.1670925617218018,
"memory(GiB)": 40.31,
"nll_loss": 0.648939311504364,
"rewards/accuracies": 0.8125,
"rewards/chosen": -0.07203729450702667,
"rewards/margins": 0.5248441696166992,
"rewards/rejected": -0.5968814492225647,
"step": 51,
"train_speed(iter/s)": 0.011208
},
{
"epoch": 0.2523506217773734,
"grad_norm": 3.282288074493408,
"learning_rate": 0.00019936907907444788,
"logits/chosen": -0.40597957372665405,
"logits/rejected": -0.4711161255836487,
"logps/chosen": -10.530755996704102,
"logps/rejected": -18.246557235717773,
"loss": 1.1418707370758057,
"memory(GiB)": 40.31,
"nll_loss": 0.6192983984947205,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.012871884740889072,
"rewards/margins": 0.4392779469490051,
"rewards/rejected": -0.4264060854911804,
"step": 52,
"train_speed(iter/s)": 0.011209
},
{
"epoch": 0.25720351835001515,
"grad_norm": 3.151282787322998,
"learning_rate": 0.00019930763179061036,
"logits/chosen": -0.4330732226371765,
"logits/rejected": -0.456554651260376,
"logps/chosen": -8.236556053161621,
"logps/rejected": -15.27733039855957,
"loss": 1.168614149093628,
"memory(GiB)": 40.31,
"nll_loss": 0.6144590973854065,
"rewards/accuracies": 0.78125,
"rewards/chosen": 0.12388759851455688,
"rewards/margins": 0.6339080333709717,
"rewards/rejected": -0.5100203156471252,
"step": 53,
"train_speed(iter/s)": 0.011209
},
{
"epoch": 0.26205641492265697,
"grad_norm": 3.4259731769561768,
"learning_rate": 0.00019924334001205542,
"logits/chosen": -0.4073447287082672,
"logits/rejected": -0.42736995220184326,
"logps/chosen": -11.766214370727539,
"logps/rejected": -20.65784454345703,
"loss": 1.234757423400879,
"memory(GiB)": 40.31,
"nll_loss": 0.6889488697052002,
"rewards/accuracies": 0.84375,
"rewards/chosen": 0.08055731654167175,
"rewards/margins": 0.7608071565628052,
"rewards/rejected": -0.680249810218811,
"step": 54,
"train_speed(iter/s)": 0.01121
},
{
"epoch": 0.26690931149529873,
"grad_norm": 2.5751075744628906,
"learning_rate": 0.00019917620558030947,
"logits/chosen": -0.45161640644073486,
"logits/rejected": -0.40232208371162415,
"logps/chosen": -10.377983093261719,
"logps/rejected": -15.469682693481445,
"loss": 1.1288338899612427,
"memory(GiB)": 40.31,
"nll_loss": 0.6078510284423828,
"rewards/accuracies": 0.625,
"rewards/chosen": 0.13011425733566284,
"rewards/margins": 0.7133916020393372,
"rewards/rejected": -0.5832774043083191,
"step": 55,
"train_speed(iter/s)": 0.01121
},
{
"epoch": 0.27176220806794055,
"grad_norm": 1.9270464181900024,
"learning_rate": 0.0001991062304183218,
"logits/chosen": -0.3679361641407013,
"logits/rejected": -0.4820949137210846,
"logps/chosen": -6.5226335525512695,
"logps/rejected": -21.38983917236328,
"loss": 0.9311513900756836,
"memory(GiB)": 40.31,
"nll_loss": 0.48036620020866394,
"rewards/accuracies": 0.8125,
"rewards/chosen": 0.1770131140947342,
"rewards/margins": 0.9639515280723572,
"rewards/rejected": -0.7869384288787842,
"step": 56,
"train_speed(iter/s)": 0.011211
},
{
"epoch": 0.27661510464058237,
"grad_norm": 2.343013048171997,
"learning_rate": 0.0001990334165304094,
"logits/chosen": -0.3758355975151062,
"logits/rejected": -0.446993350982666,
"logps/chosen": -10.01812744140625,
"logps/rejected": -22.936779022216797,
"loss": 1.017271637916565,
"memory(GiB)": 40.31,
"nll_loss": 0.5227488875389099,
"rewards/accuracies": 0.78125,
"rewards/chosen": 0.20892874896526337,
"rewards/margins": 0.9375370144844055,
"rewards/rejected": -0.728608250617981,
"step": 57,
"train_speed(iter/s)": 0.01121
},
{
"epoch": 0.28146800121322413,
"grad_norm": 3.4284698963165283,
"learning_rate": 0.00019895776600219973,
"logits/chosen": -0.3820294141769409,
"logits/rejected": -0.4261220097541809,
"logps/chosen": -12.147420883178711,
"logps/rejected": -21.496156692504883,
"loss": 1.173353910446167,
"memory(GiB)": 40.31,
"nll_loss": 0.579372763633728,
"rewards/accuracies": 0.6875,
"rewards/chosen": -0.036380209028720856,
"rewards/margins": 0.430204302072525,
"rewards/rejected": -0.46658453345298767,
"step": 58,
"train_speed(iter/s)": 0.011209
},
{
"epoch": 0.28632089778586595,
"grad_norm": 3.7487685680389404,
"learning_rate": 0.0001988792810005708,
"logits/chosen": -0.3050299882888794,
"logits/rejected": -0.40809452533721924,
"logps/chosen": -10.987959861755371,
"logps/rejected": -24.92184066772461,
"loss": 1.2469043731689453,
"memory(GiB)": 40.31,
"nll_loss": 0.6960954070091248,
"rewards/accuracies": 0.71875,
"rewards/chosen": 0.009784307330846786,
"rewards/margins": 0.4835450351238251,
"rewards/rejected": -0.473760724067688,
"step": 59,
"train_speed(iter/s)": 0.011208
},
{
"epoch": 0.2911737943585077,
"grad_norm": 3.093308448791504,
"learning_rate": 0.00019879796377358927,
"logits/chosen": -0.37827837467193604,
"logits/rejected": -0.4184655547142029,
"logps/chosen": -7.49070930480957,
"logps/rejected": -17.80307388305664,
"loss": 1.0403252840042114,
"memory(GiB)": 40.31,
"nll_loss": 0.49073174595832825,
"rewards/accuracies": 0.78125,
"rewards/chosen": -0.00874985009431839,
"rewards/margins": 0.46609920263290405,
"rewards/rejected": -0.47484904527664185,
"step": 60,
"train_speed(iter/s)": 0.011209
},
{
"epoch": 0.2960266909311495,
"grad_norm": 3.3970422744750977,
"learning_rate": 0.00019871381665044594,
"logits/chosen": -0.3776484727859497,
"logits/rejected": -0.3863822817802429,
"logps/chosen": -9.921972274780273,
"logps/rejected": -15.067032814025879,
"loss": 1.250232219696045,
"memory(GiB)": 40.31,
"nll_loss": 0.7360854744911194,
"rewards/accuracies": 0.75,
"rewards/chosen": 0.09412748366594315,
"rewards/margins": 0.5320085287094116,
"rewards/rejected": -0.4378809928894043,
"step": 61,
"train_speed(iter/s)": 0.01121
},
{
"epoch": 0.30087958750379135,
"grad_norm": 2.651646137237549,
"learning_rate": 0.00019862684204138907,
"logits/chosen": -0.3813178539276123,
"logits/rejected": -0.3218821585178375,
"logps/chosen": -12.840286254882812,
"logps/rejected": -17.035186767578125,
"loss": 1.1197326183319092,
"memory(GiB)": 40.31,
"nll_loss": 0.6345531940460205,
"rewards/accuracies": 0.8125,
"rewards/chosen": 0.10404972732067108,
"rewards/margins": 0.6996921896934509,
"rewards/rejected": -0.5956425070762634,
"step": 62,
"train_speed(iter/s)": 0.011211
},
{
"epoch": 0.3057324840764331,
"grad_norm": 2.7409791946411133,
"learning_rate": 0.00019853704243765532,
"logits/chosen": -0.21578770875930786,
"logits/rejected": -0.40845662355422974,
"logps/chosen": -9.395906448364258,
"logps/rejected": -28.66230583190918,
"loss": 1.0102654695510864,
"memory(GiB)": 40.31,
"nll_loss": 0.6361392736434937,
"rewards/accuracies": 0.90625,
"rewards/chosen": 0.23129011690616608,
"rewards/margins": 1.06308913230896,
"rewards/rejected": -0.8317990303039551,
"step": 63,
"train_speed(iter/s)": 0.011211
},
{
"epoch": 0.3105853806490749,
"grad_norm": 2.692429304122925,
"learning_rate": 0.00019844442041139847,
"logits/chosen": -0.35631364583969116,
"logits/rejected": -0.3108435571193695,
"logps/chosen": -11.395570755004883,
"logps/rejected": -16.973485946655273,
"loss": 0.9985603094100952,
"memory(GiB)": 40.31,
"nll_loss": 0.5419827699661255,
"rewards/accuracies": 0.78125,
"rewards/chosen": 0.07737573981285095,
"rewards/margins": 0.7498005628585815,
"rewards/rejected": -0.672424852848053,
"step": 64,
"train_speed(iter/s)": 0.011211
},
{
"epoch": 0.3154382772217167,
"grad_norm": 5.938281536102295,
"learning_rate": 0.00019834897861561573,
"logits/chosen": -0.3479470908641815,
"logits/rejected": -0.3646903932094574,
"logps/chosen": -8.458881378173828,
"logps/rejected": -18.25616455078125,
"loss": 1.0791547298431396,
"memory(GiB)": 40.31,
"nll_loss": 0.5545474290847778,
"rewards/accuracies": 0.875,
"rewards/chosen": -0.05356256291270256,
"rewards/margins": 0.5557125210762024,
"rewards/rejected": -0.6092751026153564,
"step": 65,
"train_speed(iter/s)": 0.011212
},
{
"epoch": 0.3202911737943585,
"grad_norm": 2.738814353942871,
"learning_rate": 0.00019825071978407156,
"logits/chosen": -0.29352137446403503,
"logits/rejected": -0.2870010733604431,
"logps/chosen": -12.466264724731445,
"logps/rejected": -22.961450576782227,
"loss": 0.9836492538452148,
"memory(GiB)": 40.31,
"nll_loss": 0.5442343354225159,
"rewards/accuracies": 0.75,
"rewards/chosen": 0.123663991689682,
"rewards/margins": 0.9405882954597473,
"rewards/rejected": -0.8169243335723877,
"step": 66,
"train_speed(iter/s)": 0.011212
},
{
"epoch": 0.3251440703670003,
"grad_norm": 3.51104998588562,
"learning_rate": 0.00019814964673121966,
"logits/chosen": -0.3337523937225342,
"logits/rejected": -0.3147628903388977,
"logps/chosen": -11.947603225708008,
"logps/rejected": -17.78832244873047,
"loss": 1.2882845401763916,
"memory(GiB)": 40.31,
"nll_loss": 0.8149017095565796,
"rewards/accuracies": 0.78125,
"rewards/chosen": -0.04635877162218094,
"rewards/margins": 0.7259438037872314,
"rewards/rejected": -0.7723026275634766,
"step": 67,
"train_speed(iter/s)": 0.011213
},
{
"epoch": 0.3299969669396421,
"grad_norm": 3.068816661834717,
"learning_rate": 0.00019804576235212218,
"logits/chosen": -0.2215232253074646,
"logits/rejected": -0.2657161355018616,
"logps/chosen": -11.033540725708008,
"logps/rejected": -25.50714874267578,
"loss": 0.8847059607505798,
"memory(GiB)": 40.31,
"nll_loss": 0.5216297507286072,
"rewards/accuracies": 0.84375,
"rewards/chosen": 0.09357042610645294,
"rewards/margins": 1.1900687217712402,
"rewards/rejected": -1.0964982509613037,
"step": 68,
"train_speed(iter/s)": 0.011212
},
{
"epoch": 0.3348498635122839,
"grad_norm": 2.5830941200256348,
"learning_rate": 0.00019793906962236682,
"logits/chosen": -0.24091127514839172,
"logits/rejected": -0.29128578305244446,
"logps/chosen": -10.63074016571045,
"logps/rejected": -26.628215789794922,
"loss": 1.0002039670944214,
"memory(GiB)": 40.31,
"nll_loss": 0.5858277082443237,
"rewards/accuracies": 0.84375,
"rewards/chosen": 0.06674355268478394,
"rewards/margins": 1.1017783880233765,
"rewards/rejected": -1.0350347757339478,
"step": 69,
"train_speed(iter/s)": 0.011211
},
{
"epoch": 0.33970276008492567,
"grad_norm": 2.7311224937438965,
"learning_rate": 0.00019782957159798157,
"logits/chosen": -0.30429190397262573,
"logits/rejected": -0.2560291290283203,
"logps/chosen": -12.162567138671875,
"logps/rejected": -17.434350967407227,
"loss": 1.063048005104065,
"memory(GiB)": 40.31,
"nll_loss": 0.6400512456893921,
"rewards/accuracies": 0.78125,
"rewards/chosen": 0.18220071494579315,
"rewards/margins": 1.0044963359832764,
"rewards/rejected": -0.8222954869270325,
"step": 70,
"train_speed(iter/s)": 0.011212
},
{
"epoch": 0.3445556566575675,
"grad_norm": 3.414921760559082,
"learning_rate": 0.0001977172714153473,
"logits/chosen": -0.28515180945396423,
"logits/rejected": -0.3108617961406708,
"logps/chosen": -10.81340503692627,
"logps/rejected": -26.520463943481445,
"loss": 1.1172614097595215,
"memory(GiB)": 40.31,
"nll_loss": 0.685325026512146,
"rewards/accuracies": 0.8125,
"rewards/chosen": 0.1235567182302475,
"rewards/margins": 1.0347576141357422,
"rewards/rejected": -0.9112008810043335,
"step": 71,
"train_speed(iter/s)": 0.011212
},
{
"epoch": 0.3494085532302093,
"grad_norm": 4.576763153076172,
"learning_rate": 0.00019760217229110777,
"logits/chosen": -0.36723142862319946,
"logits/rejected": -0.3557523488998413,
"logps/chosen": -12.69983196258545,
"logps/rejected": -20.64535140991211,
"loss": 1.1201751232147217,
"memory(GiB)": 40.31,
"nll_loss": 0.692030668258667,
"rewards/accuracies": 0.84375,
"rewards/chosen": 0.049573928117752075,
"rewards/margins": 1.0138797760009766,
"rewards/rejected": -0.9643057584762573,
"step": 72,
"train_speed(iter/s)": 0.011212
},
{
"epoch": 0.35426144980285107,
"grad_norm": 4.538747310638428,
"learning_rate": 0.00019748427752207755,
"logits/chosen": -0.34310680627822876,
"logits/rejected": -0.366294801235199,
"logps/chosen": -12.221488952636719,
"logps/rejected": -21.165037155151367,
"loss": 1.2563344240188599,
"memory(GiB)": 40.31,
"nll_loss": 0.7162244915962219,
"rewards/accuracies": 0.75,
"rewards/chosen": -0.12930546700954437,
"rewards/margins": 0.6588571667671204,
"rewards/rejected": -0.7881627082824707,
"step": 73,
"train_speed(iter/s)": 0.011213
},
{
"epoch": 0.3591143463754929,
"grad_norm": 2.0262386798858643,
"learning_rate": 0.00019736359048514766,
"logits/chosen": -0.334412157535553,
"logits/rejected": -0.37951967120170593,
"logps/chosen": -14.834428787231445,
"logps/rejected": -21.54924964904785,
"loss": 1.0132083892822266,
"memory(GiB)": 40.31,
"nll_loss": 0.6331067085266113,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.1725282073020935,
"rewards/margins": 1.028924822807312,
"rewards/rejected": -0.8563966751098633,
"step": 74,
"train_speed(iter/s)": 0.011212
},
{
"epoch": 0.36396724294813465,
"grad_norm": 3.2811484336853027,
"learning_rate": 0.00019724011463718885,
"logits/chosen": -0.360372394323349,
"logits/rejected": -0.35564228892326355,
"logps/chosen": -11.420612335205078,
"logps/rejected": -19.772428512573242,
"loss": 1.2705371379852295,
"memory(GiB)": 40.31,
"nll_loss": 0.6594747304916382,
"rewards/accuracies": 0.78125,
"rewards/chosen": -0.09604446589946747,
"rewards/margins": 0.5641387701034546,
"rewards/rejected": -0.660183310508728,
"step": 75,
"train_speed(iter/s)": 0.011212
},
{
"epoch": 0.36882013952077647,
"grad_norm": 3.251281976699829,
"learning_rate": 0.0001971138535149523,
"logits/chosen": -0.3563613295555115,
"logits/rejected": -0.38878530263900757,
"logps/chosen": -12.576432228088379,
"logps/rejected": -21.920602798461914,
"loss": 0.9680290222167969,
"memory(GiB)": 40.31,
"nll_loss": 0.5066214799880981,
"rewards/accuracies": 0.78125,
"rewards/chosen": -0.009179912507534027,
"rewards/margins": 0.7688724994659424,
"rewards/rejected": -0.7780523896217346,
"step": 76,
"train_speed(iter/s)": 0.011212
},
{
"epoch": 0.37367303609341823,
"grad_norm": 2.962810516357422,
"learning_rate": 0.00019698481073496878,
"logits/chosen": -0.3119925856590271,
"logits/rejected": -0.4056414067745209,
"logps/chosen": -9.659420013427734,
"logps/rejected": -23.653026580810547,
"loss": 0.9925091862678528,
"memory(GiB)": 40.31,
"nll_loss": 0.5779968500137329,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.030417252331972122,
"rewards/margins": 0.987002968788147,
"rewards/rejected": -0.956585705280304,
"step": 77,
"train_speed(iter/s)": 0.011212
},
{
"epoch": 0.37852593266606005,
"grad_norm": 10.599248886108398,
"learning_rate": 0.00019685298999344458,
"logits/chosen": -0.35163983702659607,
"logits/rejected": -0.3840740919113159,
"logps/chosen": -8.082690238952637,
"logps/rejected": -25.49774169921875,
"loss": 1.0417295694351196,
"memory(GiB)": 40.31,
"nll_loss": 0.7148680686950684,
"rewards/accuracies": 0.90625,
"rewards/chosen": -0.03415816277265549,
"rewards/margins": 1.2999666929244995,
"rewards/rejected": -1.3341249227523804,
"step": 78,
"train_speed(iter/s)": 0.011212
},
{
"epoch": 0.38337882923870187,
"grad_norm": 3.775139331817627,
"learning_rate": 0.00019671839506615614,
"logits/chosen": -0.3263033926486969,
"logits/rejected": -0.336015522480011,
"logps/chosen": -12.873096466064453,
"logps/rejected": -25.73821258544922,
"loss": 1.011587142944336,
"memory(GiB)": 40.31,
"nll_loss": 0.5964220762252808,
"rewards/accuracies": 0.84375,
"rewards/chosen": 0.15943416953086853,
"rewards/margins": 1.001997947692871,
"rewards/rejected": -0.8425638675689697,
"step": 79,
"train_speed(iter/s)": 0.011212
},
{
"epoch": 0.38823172581134363,
"grad_norm": 2.6962356567382812,
"learning_rate": 0.00019658102980834146,
"logits/chosen": -0.42636168003082275,
"logits/rejected": -0.40870201587677,
"logps/chosen": -9.675471305847168,
"logps/rejected": -17.18560791015625,
"loss": 1.0823123455047607,
"memory(GiB)": 40.31,
"nll_loss": 0.6633837819099426,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.09595775604248047,
"rewards/margins": 0.8637285232543945,
"rewards/rejected": -0.7677708268165588,
"step": 80,
"train_speed(iter/s)": 0.011213
},
{
"epoch": 0.39308462238398545,
"grad_norm": 3.252925395965576,
"learning_rate": 0.0001964408981545898,
"logits/chosen": -0.3987385034561157,
"logits/rejected": -0.3940485715866089,
"logps/chosen": -11.167372703552246,
"logps/rejected": -19.442848205566406,
"loss": 1.2748379707336426,
"memory(GiB)": 40.31,
"nll_loss": 0.8224515914916992,
"rewards/accuracies": 0.84375,
"rewards/chosen": -0.004448680207133293,
"rewards/margins": 0.9587394595146179,
"rewards/rejected": -0.9631881713867188,
"step": 81,
"train_speed(iter/s)": 0.011213
},
{
"epoch": 0.3979375189566272,
"grad_norm": 2.8878297805786133,
"learning_rate": 0.00019629800411872928,
"logits/chosen": -0.35343819856643677,
"logits/rejected": -0.4096568822860718,
"logps/chosen": -8.287420272827148,
"logps/rejected": -20.879899978637695,
"loss": 0.9840810894966125,
"memory(GiB)": 40.31,
"nll_loss": 0.5656735897064209,
"rewards/accuracies": 0.84375,
"rewards/chosen": 0.13655401766300201,
"rewards/margins": 0.9052618145942688,
"rewards/rejected": -0.768707811832428,
"step": 82,
"train_speed(iter/s)": 0.011214
},
{
"epoch": 0.40279041552926903,
"grad_norm": 2.34645676612854,
"learning_rate": 0.00019615235179371135,
"logits/chosen": -0.31612086296081543,
"logits/rejected": -0.39879709482192993,
"logps/chosen": -9.401403427124023,
"logps/rejected": -27.325342178344727,
"loss": 0.888444721698761,
"memory(GiB)": 40.31,
"nll_loss": 0.569918692111969,
"rewards/accuracies": 0.96875,
"rewards/chosen": 0.23369260132312775,
"rewards/margins": 1.3009941577911377,
"rewards/rejected": -1.0673015117645264,
"step": 83,
"train_speed(iter/s)": 0.011214
},
{
"epoch": 0.40764331210191085,
"grad_norm": 2.7571706771850586,
"learning_rate": 0.00019600394535149404,
"logits/chosen": -0.34237152338027954,
"logits/rejected": -0.38029745221138,
"logps/chosen": -9.792423248291016,
"logps/rejected": -21.61672592163086,
"loss": 1.0087002515792847,
"memory(GiB)": 40.31,
"nll_loss": 0.5312238335609436,
"rewards/accuracies": 0.75,
"rewards/chosen": 0.07024291902780533,
"rewards/margins": 0.8068092465400696,
"rewards/rejected": -0.7365662455558777,
"step": 84,
"train_speed(iter/s)": 0.011214
},
{
"epoch": 0.4124962086745526,
"grad_norm": 2.0822556018829346,
"learning_rate": 0.0001958527890429223,
"logits/chosen": -0.3475739657878876,
"logits/rejected": -0.31929460167884827,
"logps/chosen": -13.526400566101074,
"logps/rejected": -25.060049057006836,
"loss": 0.8273504376411438,
"memory(GiB)": 40.31,
"nll_loss": 0.5433682203292847,
"rewards/accuracies": 0.90625,
"rewards/chosen": 0.2506234347820282,
"rewards/margins": 1.4649745225906372,
"rewards/rejected": -1.2143512964248657,
"step": 85,
"train_speed(iter/s)": 0.011214
},
{
"epoch": 0.41734910524719443,
"grad_norm": 2.4087798595428467,
"learning_rate": 0.0001956988871976062,
"logits/chosen": -0.27175548672676086,
"logits/rejected": -0.3286592662334442,
"logps/chosen": -7.984870910644531,
"logps/rejected": -24.256772994995117,
"loss": 0.7937061786651611,
"memory(GiB)": 40.31,
"nll_loss": 0.42936819791793823,
"rewards/accuracies": 0.90625,
"rewards/chosen": 0.059691205620765686,
"rewards/margins": 1.0793851613998413,
"rewards/rejected": -1.0196938514709473,
"step": 86,
"train_speed(iter/s)": 0.011214
},
{
"epoch": 0.4222020018198362,
"grad_norm": 2.174376964569092,
"learning_rate": 0.00019554224422379686,
"logits/chosen": -0.23324547708034515,
"logits/rejected": -0.30267754197120667,
"logps/chosen": -11.11595344543457,
"logps/rejected": -27.55086326599121,
"loss": 0.799884021282196,
"memory(GiB)": 40.31,
"nll_loss": 0.4499448537826538,
"rewards/accuracies": 0.90625,
"rewards/chosen": 0.12257401645183563,
"rewards/margins": 1.2369678020477295,
"rewards/rejected": -1.114393711090088,
"step": 87,
"train_speed(iter/s)": 0.011214
},
{
"epoch": 0.427054898392478,
"grad_norm": 4.111970901489258,
"learning_rate": 0.00019538286460826041,
"logits/chosen": -0.2658248543739319,
"logits/rejected": -0.2973652482032776,
"logps/chosen": -8.75698471069336,
"logps/rejected": -22.72409439086914,
"loss": 0.8912484645843506,
"memory(GiB)": 40.31,
"nll_loss": 0.48959213495254517,
"rewards/accuracies": 0.84375,
"rewards/chosen": 0.09087920188903809,
"rewards/margins": 1.290701150894165,
"rewards/rejected": -1.199821949005127,
"step": 88,
"train_speed(iter/s)": 0.011214
},
{
"epoch": 0.43190779496511983,
"grad_norm": 3.519275665283203,
"learning_rate": 0.0001952207529161492,
"logits/chosen": -0.3236900866031647,
"logits/rejected": -0.29652339220046997,
"logps/chosen": -15.083149909973145,
"logps/rejected": -29.6583251953125,
"loss": 1.028883695602417,
"memory(GiB)": 40.31,
"nll_loss": 0.7164204120635986,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.056427597999572754,
"rewards/margins": 1.5590038299560547,
"rewards/rejected": -1.5025763511657715,
"step": 89,
"train_speed(iter/s)": 0.011214
},
{
"epoch": 0.4367606915377616,
"grad_norm": 5.104607105255127,
"learning_rate": 0.00019505591379087128,
"logits/chosen": -0.30673032999038696,
"logits/rejected": -0.284626841545105,
"logps/chosen": -18.149417877197266,
"logps/rejected": -27.66114616394043,
"loss": 1.1724226474761963,
"memory(GiB)": 40.31,
"nll_loss": 0.8443087935447693,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.12549515068531036,
"rewards/margins": 1.6692070960998535,
"rewards/rejected": -1.5437119007110596,
"step": 90,
"train_speed(iter/s)": 0.011214
},
{
"epoch": 0.4416135881104034,
"grad_norm": 5.404626846313477,
"learning_rate": 0.00019488835195395718,
"logits/chosen": -0.25754019618034363,
"logits/rejected": -0.25054478645324707,
"logps/chosen": -11.13974380493164,
"logps/rejected": -29.229190826416016,
"loss": 0.9712298512458801,
"memory(GiB)": 40.31,
"nll_loss": 0.614799976348877,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.06202991306781769,
"rewards/margins": 1.4658480882644653,
"rewards/rejected": -1.4038183689117432,
"step": 91,
"train_speed(iter/s)": 0.011214
},
{
"epoch": 0.4464664846830452,
"grad_norm": 4.149505138397217,
"learning_rate": 0.00019471807220492487,
"logits/chosen": -0.3054165542125702,
"logits/rejected": -0.3217582106590271,
"logps/chosen": -7.596218585968018,
"logps/rejected": -24.510986328125,
"loss": 0.8925672173500061,
"memory(GiB)": 40.31,
"nll_loss": 0.5096707344055176,
"rewards/accuracies": 0.78125,
"rewards/chosen": 0.05373791605234146,
"rewards/margins": 1.6141862869262695,
"rewards/rejected": -1.560448408126831,
"step": 92,
"train_speed(iter/s)": 0.011214
},
{
"epoch": 0.451319381255687,
"grad_norm": 2.699763536453247,
"learning_rate": 0.00019454507942114218,
"logits/chosen": -0.4031309485435486,
"logits/rejected": -0.3797576129436493,
"logps/chosen": -11.298748970031738,
"logps/rejected": -21.17618751525879,
"loss": 0.9288226366043091,
"memory(GiB)": 40.31,
"nll_loss": 0.5129250884056091,
"rewards/accuracies": 0.78125,
"rewards/chosen": 0.09262087196111679,
"rewards/margins": 1.186156988143921,
"rewards/rejected": -1.0935360193252563,
"step": 93,
"train_speed(iter/s)": 0.011215
},
{
"epoch": 0.4561722778283288,
"grad_norm": 2.987886905670166,
"learning_rate": 0.00019436937855768705,
"logits/chosen": -0.3467521667480469,
"logits/rejected": -0.38047531247138977,
"logps/chosen": -8.127204895019531,
"logps/rejected": -27.24859619140625,
"loss": 0.9090497493743896,
"memory(GiB)": 40.31,
"nll_loss": 0.5626466274261475,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.01449224166572094,
"rewards/margins": 1.3198893070220947,
"rewards/rejected": -1.3053967952728271,
"step": 94,
"train_speed(iter/s)": 0.011216
},
{
"epoch": 0.46102517440097057,
"grad_norm": 6.682155609130859,
"learning_rate": 0.0001941909746472057,
"logits/chosen": -0.36795341968536377,
"logits/rejected": -0.33038249611854553,
"logps/chosen": -14.30661392211914,
"logps/rejected": -27.33529281616211,
"loss": 1.2022923231124878,
"memory(GiB)": 40.31,
"nll_loss": 0.6685870289802551,
"rewards/accuracies": 0.625,
"rewards/chosen": -0.14697454869747162,
"rewards/margins": 0.7069932818412781,
"rewards/rejected": -0.8539677858352661,
"step": 95,
"train_speed(iter/s)": 0.011215
},
{
"epoch": 0.4658780709736124,
"grad_norm": 6.086058616638184,
"learning_rate": 0.00019400987279976847,
"logits/chosen": -0.4552175998687744,
"logits/rejected": -0.3753393590450287,
"logps/chosen": -12.3525390625,
"logps/rejected": -24.96709632873535,
"loss": 1.1781623363494873,
"memory(GiB)": 40.31,
"nll_loss": 0.8305119276046753,
"rewards/accuracies": 0.875,
"rewards/chosen": -0.04669938236474991,
"rewards/margins": 1.6278446912765503,
"rewards/rejected": -1.674544095993042,
"step": 96,
"train_speed(iter/s)": 0.011216
},
{
"epoch": 0.47073096754625415,
"grad_norm": 2.856499671936035,
"learning_rate": 0.00019382607820272343,
"logits/chosen": -0.34398210048675537,
"logits/rejected": -0.3632335662841797,
"logps/chosen": -13.498963356018066,
"logps/rejected": -23.799148559570312,
"loss": 0.9125381708145142,
"memory(GiB)": 40.31,
"nll_loss": 0.6083617806434631,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.16915112733840942,
"rewards/margins": 1.5896618366241455,
"rewards/rejected": -1.4205105304718018,
"step": 97,
"train_speed(iter/s)": 0.011216
},
{
"epoch": 0.47558386411889597,
"grad_norm": 2.2536661624908447,
"learning_rate": 0.00019363959612054768,
"logits/chosen": -0.3522893190383911,
"logits/rejected": -0.3821050822734833,
"logps/chosen": -7.958831310272217,
"logps/rejected": -22.634958267211914,
"loss": 0.9238535165786743,
"memory(GiB)": 40.31,
"nll_loss": 0.5074257254600525,
"rewards/accuracies": 0.75,
"rewards/chosen": 0.05879054591059685,
"rewards/margins": 1.1695164442062378,
"rewards/rejected": -1.1107258796691895,
"step": 98,
"train_speed(iter/s)": 0.011217
},
{
"epoch": 0.48043676069153773,
"grad_norm": 4.499397277832031,
"learning_rate": 0.00019345043189469675,
"logits/chosen": -0.3616553843021393,
"logits/rejected": -0.3694867789745331,
"logps/chosen": -9.15666389465332,
"logps/rejected": -22.706497192382812,
"loss": 0.8626678586006165,
"memory(GiB)": 40.31,
"nll_loss": 0.4881688058376312,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.22088897228240967,
"rewards/margins": 1.2141640186309814,
"rewards/rejected": -0.993274986743927,
"step": 99,
"train_speed(iter/s)": 0.011217
},
{
"epoch": 0.48528965726417955,
"grad_norm": 2.5381503105163574,
"learning_rate": 0.00019325859094345148,
"logits/chosen": -0.3770003914833069,
"logits/rejected": -0.4174918234348297,
"logps/chosen": -10.83204460144043,
"logps/rejected": -20.01091194152832,
"loss": 1.1128623485565186,
"memory(GiB)": 40.31,
"nll_loss": 0.6556410193443298,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.08420430123806,
"rewards/margins": 0.7714729905128479,
"rewards/rejected": -0.6872686743736267,
"step": 100,
"train_speed(iter/s)": 0.011217
},
{
"epoch": 0.49014255383682137,
"grad_norm": 3.571274995803833,
"learning_rate": 0.000193064078761763,
"logits/chosen": -0.3813248872756958,
"logits/rejected": -0.4329451024532318,
"logps/chosen": -11.104312896728516,
"logps/rejected": -24.20327377319336,
"loss": 1.1288418769836426,
"memory(GiB)": 40.31,
"nll_loss": 0.7659333944320679,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.13299986720085144,
"rewards/margins": 1.1876386404037476,
"rewards/rejected": -1.0546387434005737,
"step": 101,
"train_speed(iter/s)": 0.011197
},
{
"epoch": 0.49499545040946313,
"grad_norm": 3.4420199394226074,
"learning_rate": 0.00019286690092109495,
"logits/chosen": -0.3884170353412628,
"logits/rejected": -0.4291474521160126,
"logps/chosen": -8.859447479248047,
"logps/rejected": -19.800003051757812,
"loss": 1.0438815355300903,
"memory(GiB)": 40.31,
"nll_loss": 0.6051428318023682,
"rewards/accuracies": 0.8125,
"rewards/chosen": 0.10340974479913712,
"rewards/margins": 0.9933844804763794,
"rewards/rejected": -0.8899747729301453,
"step": 102,
"train_speed(iter/s)": 0.011197
},
{
"epoch": 0.49984834698210495,
"grad_norm": 3.0272207260131836,
"learning_rate": 0.00019266706306926437,
"logits/chosen": -0.28712770342826843,
"logits/rejected": -0.482435941696167,
"logps/chosen": -8.935839653015137,
"logps/rejected": -26.6412353515625,
"loss": 1.1441514492034912,
"memory(GiB)": 40.31,
"nll_loss": 0.6857534646987915,
"rewards/accuracies": 0.8125,
"rewards/chosen": 0.1457400619983673,
"rewards/margins": 1.0326664447784424,
"rewards/rejected": -0.8869264125823975,
"step": 103,
"train_speed(iter/s)": 0.011197
},
{
"epoch": 0.5047012435547468,
"grad_norm": 2.2835068702697754,
"learning_rate": 0.00019246457093027955,
"logits/chosen": -0.3885180354118347,
"logits/rejected": -0.4434734582901001,
"logps/chosen": -7.748335838317871,
"logps/rejected": -27.667823791503906,
"loss": 0.7652894258499146,
"memory(GiB)": 40.31,
"nll_loss": 0.3754329979419708,
"rewards/accuracies": 0.8125,
"rewards/chosen": 0.06499351561069489,
"rewards/margins": 1.0574610233306885,
"rewards/rejected": -0.9924674034118652,
"step": 104,
"train_speed(iter/s)": 0.011197
},
{
"epoch": 0.5095541401273885,
"grad_norm": 3.3575081825256348,
"learning_rate": 0.0001922594303041764,
"logits/chosen": -0.314767062664032,
"logits/rejected": -0.418552041053772,
"logps/chosen": -9.141714096069336,
"logps/rejected": -26.07691192626953,
"loss": 0.8440835475921631,
"memory(GiB)": 40.31,
"nll_loss": 0.53468257188797,
"rewards/accuracies": 0.96875,
"rewards/chosen": 0.18071942031383514,
"rewards/margins": 1.4176182746887207,
"rewards/rejected": -1.2368988990783691,
"step": 105,
"train_speed(iter/s)": 0.011197
},
{
"epoch": 0.5144070367000303,
"grad_norm": 3.938190460205078,
"learning_rate": 0.0001920516470668519,
"logits/chosen": -0.38045060634613037,
"logits/rejected": -0.46996402740478516,
"logps/chosen": -9.252923965454102,
"logps/rejected": -25.073986053466797,
"loss": 0.8858380913734436,
"memory(GiB)": 40.31,
"nll_loss": 0.5138120651245117,
"rewards/accuracies": 0.78125,
"rewards/chosen": 0.24657589197158813,
"rewards/margins": 1.3090505599975586,
"rewards/rejected": -1.0624747276306152,
"step": 106,
"train_speed(iter/s)": 0.011198
},
{
"epoch": 0.5192599332726722,
"grad_norm": 3.807465076446533,
"learning_rate": 0.00019184122716989625,
"logits/chosen": -0.38855308294296265,
"logits/rejected": -0.384641170501709,
"logps/chosen": -10.419635772705078,
"logps/rejected": -23.18486213684082,
"loss": 1.1566160917282104,
"memory(GiB)": 40.31,
"nll_loss": 0.6819642782211304,
"rewards/accuracies": 0.78125,
"rewards/chosen": -0.015541527420282364,
"rewards/margins": 1.0274978876113892,
"rewards/rejected": -1.0430394411087036,
"step": 107,
"train_speed(iter/s)": 0.011198
},
{
"epoch": 0.5241128298453139,
"grad_norm": 3.046457529067993,
"learning_rate": 0.0001916281766404221,
"logits/chosen": -0.41123640537261963,
"logits/rejected": -0.4135390818119049,
"logps/chosen": -10.575555801391602,
"logps/rejected": -25.36039924621582,
"loss": 0.9802708625793457,
"memory(GiB)": 40.31,
"nll_loss": 0.5873898863792419,
"rewards/accuracies": 0.875,
"rewards/chosen": -0.016565335914492607,
"rewards/margins": 1.2314006090164185,
"rewards/rejected": -1.2479660511016846,
"step": 108,
"train_speed(iter/s)": 0.011199
},
{
"epoch": 0.5289657264179557,
"grad_norm": 5.713778495788574,
"learning_rate": 0.00019141250158089202,
"logits/chosen": -0.36335325241088867,
"logits/rejected": -0.42550188302993774,
"logps/chosen": -11.970105171203613,
"logps/rejected": -30.854656219482422,
"loss": 1.0406579971313477,
"memory(GiB)": 40.31,
"nll_loss": 0.7013589143753052,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.020902972668409348,
"rewards/margins": 1.5762500762939453,
"rewards/rejected": -1.5553470849990845,
"step": 109,
"train_speed(iter/s)": 0.011199
},
{
"epoch": 0.5338186229905975,
"grad_norm": 3.487213373184204,
"learning_rate": 0.0001911942081689437,
"logits/chosen": -0.33955633640289307,
"logits/rejected": -0.4554653465747833,
"logps/chosen": -13.618782997131348,
"logps/rejected": -27.65629005432129,
"loss": 1.2663241624832153,
"memory(GiB)": 40.31,
"nll_loss": 0.8004875183105469,
"rewards/accuracies": 0.84375,
"rewards/chosen": 0.034927308559417725,
"rewards/margins": 1.3416428565979004,
"rewards/rejected": -1.306715488433838,
"step": 110,
"train_speed(iter/s)": 0.011199
},
{
"epoch": 0.5386715195632393,
"grad_norm": 5.0910491943359375,
"learning_rate": 0.00019097330265721295,
"logits/chosen": -0.2648548185825348,
"logits/rejected": -0.3673378527164459,
"logps/chosen": -12.02265453338623,
"logps/rejected": -30.836153030395508,
"loss": 1.0310111045837402,
"memory(GiB)": 40.31,
"nll_loss": 0.5808767676353455,
"rewards/accuracies": 0.84375,
"rewards/chosen": -0.09649889171123505,
"rewards/margins": 1.15187406539917,
"rewards/rejected": -1.248373031616211,
"step": 111,
"train_speed(iter/s)": 0.011199
},
{
"epoch": 0.5435244161358811,
"grad_norm": 2.8877944946289062,
"learning_rate": 0.00019074979137315468,
"logits/chosen": -0.4370982348918915,
"logits/rejected": -0.41886797547340393,
"logps/chosen": -8.66671371459961,
"logps/rejected": -21.121248245239258,
"loss": 0.915783703327179,
"memory(GiB)": 40.31,
"nll_loss": 0.5682031512260437,
"rewards/accuracies": 0.84375,
"rewards/chosen": -0.0029869861900806427,
"rewards/margins": 1.161545753479004,
"rewards/rejected": -1.1645326614379883,
"step": 112,
"train_speed(iter/s)": 0.0112
},
{
"epoch": 0.5483773127085229,
"grad_norm": 6.939223289489746,
"learning_rate": 0.0001905236807188616,
"logits/chosen": -0.32761722803115845,
"logits/rejected": -0.3690508306026459,
"logps/chosen": -9.920032501220703,
"logps/rejected": -33.124969482421875,
"loss": 0.9988139867782593,
"memory(GiB)": 40.31,
"nll_loss": 0.6303930282592773,
"rewards/accuracies": 0.84375,
"rewards/chosen": -0.05219712853431702,
"rewards/margins": 1.4993199110031128,
"rewards/rejected": -1.5515170097351074,
"step": 113,
"train_speed(iter/s)": 0.0112
},
{
"epoch": 0.5532302092811647,
"grad_norm": 3.1117734909057617,
"learning_rate": 0.00019029497717088086,
"logits/chosen": -0.3898760974407196,
"logits/rejected": -0.42370229959487915,
"logps/chosen": -8.5205078125,
"logps/rejected": -28.223445892333984,
"loss": 0.9178063869476318,
"memory(GiB)": 40.31,
"nll_loss": 0.5913013219833374,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.11722102761268616,
"rewards/margins": 1.5129557847976685,
"rewards/rejected": -1.3957347869873047,
"step": 114,
"train_speed(iter/s)": 0.0112
},
{
"epoch": 0.5580831058538065,
"grad_norm": 9.934938430786133,
"learning_rate": 0.00019006368728002862,
"logits/chosen": -0.3294893503189087,
"logits/rejected": -0.4310123026371002,
"logps/chosen": -7.87459135055542,
"logps/rejected": -26.407917022705078,
"loss": 1.0052833557128906,
"memory(GiB)": 40.31,
"nll_loss": 0.6052643656730652,
"rewards/accuracies": 0.78125,
"rewards/chosen": 0.08163556456565857,
"rewards/margins": 1.377348780632019,
"rewards/rejected": -1.295713186264038,
"step": 115,
"train_speed(iter/s)": 0.011201
},
{
"epoch": 0.5629360024264483,
"grad_norm": 2.110900640487671,
"learning_rate": 0.00018982981767120231,
"logits/chosen": -0.2874082624912262,
"logits/rejected": -0.27834200859069824,
"logps/chosen": -11.620476722717285,
"logps/rejected": -28.311389923095703,
"loss": 0.8064985871315002,
"memory(GiB)": 40.31,
"nll_loss": 0.4605460464954376,
"rewards/accuracies": 0.84375,
"rewards/chosen": 0.03009045496582985,
"rewards/margins": 1.43373441696167,
"rewards/rejected": -1.4036438465118408,
"step": 116,
"train_speed(iter/s)": 0.0112
},
{
"epoch": 0.5677888989990901,
"grad_norm": 4.351490497589111,
"learning_rate": 0.0001895933750431908,
"logits/chosen": -0.31533291935920715,
"logits/rejected": -0.33318501710891724,
"logps/chosen": -9.928375244140625,
"logps/rejected": -26.295669555664062,
"loss": 1.0582681894302368,
"memory(GiB)": 40.31,
"nll_loss": 0.6660478711128235,
"rewards/accuracies": 0.8125,
"rewards/chosen": -0.0869743824005127,
"rewards/margins": 1.2630525827407837,
"rewards/rejected": -1.3500269651412964,
"step": 117,
"train_speed(iter/s)": 0.011201
},
{
"epoch": 0.5726417955717319,
"grad_norm": 2.8951752185821533,
"learning_rate": 0.0001893543661684828,
"logits/chosen": -0.33839067816734314,
"logits/rejected": -0.3445620536804199,
"logps/chosen": -8.102829933166504,
"logps/rejected": -22.460590362548828,
"loss": 0.7739503979682922,
"memory(GiB)": 40.31,
"nll_loss": 0.43036913871765137,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.1979444921016693,
"rewards/margins": 1.243354082107544,
"rewards/rejected": -1.0454095602035522,
"step": 118,
"train_speed(iter/s)": 0.011201
},
{
"epoch": 0.5774946921443737,
"grad_norm": 7.867568492889404,
"learning_rate": 0.00018911279789307254,
"logits/chosen": -0.2516986131668091,
"logits/rejected": -0.30931952595710754,
"logps/chosen": -8.088445663452148,
"logps/rejected": -28.628847122192383,
"loss": 0.8760090470314026,
"memory(GiB)": 40.31,
"nll_loss": 0.6033605933189392,
"rewards/accuracies": 0.96875,
"rewards/chosen": 0.18770426511764526,
"rewards/margins": 1.7780780792236328,
"rewards/rejected": -1.5903738737106323,
"step": 119,
"train_speed(iter/s)": 0.011201
},
{
"epoch": 0.5823475887170154,
"grad_norm": 9.06499195098877,
"learning_rate": 0.00018886867713626394,
"logits/chosen": -0.31181472539901733,
"logits/rejected": -0.35031330585479736,
"logps/chosen": -6.005623817443848,
"logps/rejected": -24.879501342773438,
"loss": 0.7998319864273071,
"memory(GiB)": 40.31,
"nll_loss": 0.5190199613571167,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.15923379361629486,
"rewards/margins": 1.547129511833191,
"rewards/rejected": -1.3878957033157349,
"step": 120,
"train_speed(iter/s)": 0.011202
},
{
"epoch": 0.5872004852896573,
"grad_norm": 2.1969258785247803,
"learning_rate": 0.00018862201089047228,
"logits/chosen": -0.36267367005348206,
"logits/rejected": -0.35898861289024353,
"logps/chosen": -9.9768648147583,
"logps/rejected": -31.001258850097656,
"loss": 0.8342351913452148,
"memory(GiB)": 40.31,
"nll_loss": 0.6177542805671692,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.3305099904537201,
"rewards/margins": 2.1078670024871826,
"rewards/rejected": -1.7773568630218506,
"step": 121,
"train_speed(iter/s)": 0.011202
},
{
"epoch": 0.592053381862299,
"grad_norm": 4.638126850128174,
"learning_rate": 0.000188372806221024,
"logits/chosen": -0.2871503531932831,
"logits/rejected": -0.3778407573699951,
"logps/chosen": -11.12118911743164,
"logps/rejected": -28.530237197875977,
"loss": 1.1293538808822632,
"memory(GiB)": 40.31,
"nll_loss": 0.7672280669212341,
"rewards/accuracies": 0.875,
"rewards/chosen": -0.024127217009663582,
"rewards/margins": 1.5403187274932861,
"rewards/rejected": -1.5644460916519165,
"step": 122,
"train_speed(iter/s)": 0.011203
},
{
"epoch": 0.5969062784349408,
"grad_norm": 2.8399314880371094,
"learning_rate": 0.0001881210702659542,
"logits/chosen": -0.2696555554866791,
"logits/rejected": -0.2814023196697235,
"logps/chosen": -12.141545295715332,
"logps/rejected": -28.03343391418457,
"loss": 0.8627264499664307,
"memory(GiB)": 40.31,
"nll_loss": 0.5336970090866089,
"rewards/accuracies": 0.84375,
"rewards/chosen": 0.07849591970443726,
"rewards/margins": 1.3175827264785767,
"rewards/rejected": -1.2390867471694946,
"step": 123,
"train_speed(iter/s)": 0.011203
},
{
"epoch": 0.6017591750075827,
"grad_norm": 2.7301621437072754,
"learning_rate": 0.00018786681023580235,
"logits/chosen": -0.26133084297180176,
"logits/rejected": -0.2869059145450592,
"logps/chosen": -12.609733581542969,
"logps/rejected": -32.32643508911133,
"loss": 0.7636784315109253,
"memory(GiB)": 40.31,
"nll_loss": 0.4288833439350128,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.08298669010400772,
"rewards/margins": 1.697174072265625,
"rewards/rejected": -1.6141873598098755,
"step": 124,
"train_speed(iter/s)": 0.011202
},
{
"epoch": 0.6066120715802245,
"grad_norm": 4.0161309242248535,
"learning_rate": 0.0001876100334134056,
"logits/chosen": -0.28447672724723816,
"logits/rejected": -0.3584819436073303,
"logps/chosen": -17.320146560668945,
"logps/rejected": -27.78953742980957,
"loss": 1.2440454959869385,
"memory(GiB)": 40.31,
"nll_loss": 0.867017924785614,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.12772110104560852,
"rewards/margins": 1.4953205585479736,
"rewards/rejected": -1.3675994873046875,
"step": 125,
"train_speed(iter/s)": 0.011202
},
{
"epoch": 0.6114649681528662,
"grad_norm": 4.7182159423828125,
"learning_rate": 0.00018735074715369026,
"logits/chosen": -0.3351546823978424,
"logits/rejected": -0.34775683283805847,
"logps/chosen": -12.783681869506836,
"logps/rejected": -28.113178253173828,
"loss": 1.1283553838729858,
"memory(GiB)": 40.31,
"nll_loss": 0.7738282084465027,
"rewards/accuracies": 0.78125,
"rewards/chosen": 0.028632041066884995,
"rewards/margins": 1.5667368173599243,
"rewards/rejected": -1.5381048917770386,
"step": 126,
"train_speed(iter/s)": 0.011203
},
{
"epoch": 0.6163178647255081,
"grad_norm": 3.1524689197540283,
"learning_rate": 0.00018708895888346118,
"logits/chosen": -0.33259081840515137,
"logits/rejected": -0.38818880915641785,
"logps/chosen": -8.918370246887207,
"logps/rejected": -27.71927261352539,
"loss": 0.9142798185348511,
"memory(GiB)": 40.31,
"nll_loss": 0.6048630475997925,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.16594702005386353,
"rewards/margins": 1.7087321281433105,
"rewards/rejected": -1.5427850484848022,
"step": 127,
"train_speed(iter/s)": 0.011203
},
{
"epoch": 0.6211707612981499,
"grad_norm": 2.636528491973877,
"learning_rate": 0.00018682467610118883,
"logits/chosen": -0.2616899013519287,
"logits/rejected": -0.31121164560317993,
"logps/chosen": -7.396364212036133,
"logps/rejected": -26.648653030395508,
"loss": 0.685588538646698,
"memory(GiB)": 40.31,
"nll_loss": 0.40424948930740356,
"rewards/accuracies": 0.90625,
"rewards/chosen": 0.18888305127620697,
"rewards/margins": 1.6681468486785889,
"rewards/rejected": -1.4792636632919312,
"step": 128,
"train_speed(iter/s)": 0.011203
},
{
"epoch": 0.6260236578707916,
"grad_norm": 5.758305072784424,
"learning_rate": 0.00018655790637679478,
"logits/chosen": -0.3434281349182129,
"logits/rejected": -0.36044564843177795,
"logps/chosen": -8.97478199005127,
"logps/rejected": -31.279216766357422,
"loss": 0.9071744680404663,
"memory(GiB)": 40.31,
"nll_loss": 0.5397835373878479,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.0950365662574768,
"rewards/margins": 1.9973032474517822,
"rewards/rejected": -1.9022667407989502,
"step": 129,
"train_speed(iter/s)": 0.011203
},
{
"epoch": 0.6308765544434334,
"grad_norm": 5.446237087249756,
"learning_rate": 0.00018628865735143463,
"logits/chosen": -0.40321969985961914,
"logits/rejected": -0.44060012698173523,
"logps/chosen": -7.757773399353027,
"logps/rejected": -26.798311233520508,
"loss": 0.9266724586486816,
"memory(GiB)": 40.31,
"nll_loss": 0.5693855881690979,
"rewards/accuracies": 0.90625,
"rewards/chosen": -0.0821087509393692,
"rewards/margins": 1.3789818286895752,
"rewards/rejected": -1.4610905647277832,
"step": 130,
"train_speed(iter/s)": 0.011204
},
{
"epoch": 0.6357294510160753,
"grad_norm": 3.8205740451812744,
"learning_rate": 0.00018601693673727933,
"logits/chosen": -0.40578073263168335,
"logits/rejected": -0.45195069909095764,
"logps/chosen": -12.803248405456543,
"logps/rejected": -31.195695877075195,
"loss": 0.9055405855178833,
"memory(GiB)": 40.31,
"nll_loss": 0.6313671469688416,
"rewards/accuracies": 0.90625,
"rewards/chosen": 0.27764347195625305,
"rewards/margins": 1.7698627710342407,
"rewards/rejected": -1.492219090461731,
"step": 131,
"train_speed(iter/s)": 0.011204
},
{
"epoch": 0.640582347588717,
"grad_norm": 4.257453918457031,
"learning_rate": 0.00018574275231729418,
"logits/chosen": -0.3832516670227051,
"logits/rejected": -0.40236127376556396,
"logps/chosen": -10.488710403442383,
"logps/rejected": -29.920001983642578,
"loss": 0.9821866154670715,
"memory(GiB)": 40.31,
"nll_loss": 0.6411001682281494,
"rewards/accuracies": 0.84375,
"rewards/chosen": -0.07582154870033264,
"rewards/margins": 1.663382649421692,
"rewards/rejected": -1.7392042875289917,
"step": 132,
"train_speed(iter/s)": 0.011204
},
{
"epoch": 0.6454352441613588,
"grad_norm": 5.575984954833984,
"learning_rate": 0.00018546611194501594,
"logits/chosen": -0.3834778666496277,
"logits/rejected": -0.4196530878543854,
"logps/chosen": -8.930424690246582,
"logps/rejected": -34.139522552490234,
"loss": 0.9412792921066284,
"memory(GiB)": 40.31,
"nll_loss": 0.5637305974960327,
"rewards/accuracies": 0.875,
"rewards/chosen": -0.2074286788702011,
"rewards/margins": 1.6988741159439087,
"rewards/rejected": -1.9063026905059814,
"step": 133,
"train_speed(iter/s)": 0.011204
},
{
"epoch": 0.6502881407340007,
"grad_norm": 2.6553735733032227,
"learning_rate": 0.00018518702354432774,
"logits/chosen": -0.302835613489151,
"logits/rejected": -0.4271845519542694,
"logps/chosen": -6.828452110290527,
"logps/rejected": -32.71015167236328,
"loss": 0.8524077534675598,
"memory(GiB)": 40.31,
"nll_loss": 0.5101207494735718,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.007050292566418648,
"rewards/margins": 1.6347914934158325,
"rewards/rejected": -1.6277412176132202,
"step": 134,
"train_speed(iter/s)": 0.011204
},
{
"epoch": 0.6551410373066424,
"grad_norm": 2.3347177505493164,
"learning_rate": 0.0001849054951092324,
"logits/chosen": -0.4007658362388611,
"logits/rejected": -0.4008050560951233,
"logps/chosen": -10.33335018157959,
"logps/rejected": -23.038896560668945,
"loss": 0.8887284398078918,
"memory(GiB)": 40.31,
"nll_loss": 0.5501910448074341,
"rewards/accuracies": 0.90625,
"rewards/chosen": 0.2812037765979767,
"rewards/margins": 1.3908374309539795,
"rewards/rejected": -1.1096336841583252,
"step": 135,
"train_speed(iter/s)": 0.011205
},
{
"epoch": 0.6599939338792842,
"grad_norm": 2.9783730506896973,
"learning_rate": 0.00018462153470362322,
"logits/chosen": -0.3893599808216095,
"logits/rejected": -0.44760093092918396,
"logps/chosen": -7.99445915222168,
"logps/rejected": -26.292232513427734,
"loss": 0.9434449672698975,
"memory(GiB)": 40.31,
"nll_loss": 0.5910047292709351,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.11856328696012497,
"rewards/margins": 1.402287244796753,
"rewards/rejected": -1.2837239503860474,
"step": 136,
"train_speed(iter/s)": 0.011205
},
{
"epoch": 0.6648468304519259,
"grad_norm": 2.7139804363250732,
"learning_rate": 0.00018433515046105306,
"logits/chosen": -0.4038199782371521,
"logits/rejected": -0.3786419630050659,
"logps/chosen": -11.153128623962402,
"logps/rejected": -27.12870216369629,
"loss": 0.8474470376968384,
"memory(GiB)": 40.31,
"nll_loss": 0.5868622660636902,
"rewards/accuracies": 0.96875,
"rewards/chosen": 0.18890687823295593,
"rewards/margins": 1.7894312143325806,
"rewards/rejected": -1.6005244255065918,
"step": 137,
"train_speed(iter/s)": 0.011205
},
{
"epoch": 0.6696997270245678,
"grad_norm": 2.877267599105835,
"learning_rate": 0.0001840463505845014,
"logits/chosen": -0.30394551157951355,
"logits/rejected": -0.42835158109664917,
"logps/chosen": -7.929500102996826,
"logps/rejected": -30.011865615844727,
"loss": 0.806150496006012,
"memory(GiB)": 40.31,
"nll_loss": 0.49172037839889526,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.15592113137245178,
"rewards/margins": 1.6279278993606567,
"rewards/rejected": -1.4720066785812378,
"step": 138,
"train_speed(iter/s)": 0.011205
},
{
"epoch": 0.6745526235972096,
"grad_norm": 2.5812747478485107,
"learning_rate": 0.0001837551433461393,
"logits/chosen": -0.3570711016654968,
"logits/rejected": -0.40324440598487854,
"logps/chosen": -9.332073211669922,
"logps/rejected": -23.627119064331055,
"loss": 0.7940301299095154,
"memory(GiB)": 40.31,
"nll_loss": 0.480025053024292,
"rewards/accuracies": 0.90625,
"rewards/chosen": 0.24301281571388245,
"rewards/margins": 1.4770238399505615,
"rewards/rejected": -1.234011173248291,
"step": 139,
"train_speed(iter/s)": 0.011206
},
{
"epoch": 0.6794055201698513,
"grad_norm": 9.010900497436523,
"learning_rate": 0.00018346153708709268,
"logits/chosen": -0.36091697216033936,
"logits/rejected": -0.36146706342697144,
"logps/chosen": -11.872391700744629,
"logps/rejected": -22.261938095092773,
"loss": 1.231181263923645,
"memory(GiB)": 40.31,
"nll_loss": 0.7421593070030212,
"rewards/accuracies": 0.75,
"rewards/chosen": 0.055155493319034576,
"rewards/margins": 0.9281628131866455,
"rewards/rejected": -0.8730072975158691,
"step": 140,
"train_speed(iter/s)": 0.011205
},
{
"epoch": 0.6842584167424932,
"grad_norm": 2.032696485519409,
"learning_rate": 0.00018316554021720306,
"logits/chosen": -0.32833001017570496,
"logits/rejected": -0.44503307342529297,
"logps/chosen": -7.086223602294922,
"logps/rejected": -27.835424423217773,
"loss": 0.8454415202140808,
"memory(GiB)": 40.31,
"nll_loss": 0.49735450744628906,
"rewards/accuracies": 0.8125,
"rewards/chosen": 0.16136682033538818,
"rewards/margins": 1.4422115087509155,
"rewards/rejected": -1.2808446884155273,
"step": 141,
"train_speed(iter/s)": 0.011206
},
{
"epoch": 0.689111313315135,
"grad_norm": 8.792712211608887,
"learning_rate": 0.00018286716121478693,
"logits/chosen": -0.32804882526397705,
"logits/rejected": -0.4235531687736511,
"logps/chosen": -7.5324883460998535,
"logps/rejected": -31.770389556884766,
"loss": 0.6662007570266724,
"memory(GiB)": 40.31,
"nll_loss": 0.43374398350715637,
"rewards/accuracies": 0.90625,
"rewards/chosen": 0.18283605575561523,
"rewards/margins": 2.050058364868164,
"rewards/rejected": -1.8672223091125488,
"step": 142,
"train_speed(iter/s)": 0.011206
},
{
"epoch": 0.6939642098877767,
"grad_norm": 3.7807235717773438,
"learning_rate": 0.00018256640862639287,
"logits/chosen": -0.31429523229599,
"logits/rejected": -0.42787081003189087,
"logps/chosen": -7.7822160720825195,
"logps/rejected": -30.884796142578125,
"loss": 0.823533296585083,
"memory(GiB)": 40.31,
"nll_loss": 0.556084394454956,
"rewards/accuracies": 0.96875,
"rewards/chosen": 0.06609532237052917,
"rewards/margins": 1.6945431232452393,
"rewards/rejected": -1.6284478902816772,
"step": 143,
"train_speed(iter/s)": 0.011206
},
{
"epoch": 0.6988171064604186,
"grad_norm": 2.3116719722747803,
"learning_rate": 0.00018226329106655668,
"logits/chosen": -0.4266669750213623,
"logits/rejected": -0.4430805444717407,
"logps/chosen": -9.213752746582031,
"logps/rejected": -29.852783203125,
"loss": 0.671653687953949,
"memory(GiB)": 40.31,
"nll_loss": 0.434116929769516,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.08867526799440384,
"rewards/margins": 1.9470399618148804,
"rewards/rejected": -1.8583647012710571,
"step": 144,
"train_speed(iter/s)": 0.011206
},
{
"epoch": 0.7036700030330604,
"grad_norm": 3.421821355819702,
"learning_rate": 0.00018195781721755465,
"logits/chosen": -0.44033709168434143,
"logits/rejected": -0.4357948899269104,
"logps/chosen": -9.914063453674316,
"logps/rejected": -33.468997955322266,
"loss": 0.911195695400238,
"memory(GiB)": 40.31,
"nll_loss": 0.5890682935714722,
"rewards/accuracies": 0.90625,
"rewards/chosen": 0.049831733107566833,
"rewards/margins": 2.241945505142212,
"rewards/rejected": -2.1921138763427734,
"step": 145,
"train_speed(iter/s)": 0.011207
},
{
"epoch": 0.7085228996057021,
"grad_norm": 2.5243051052093506,
"learning_rate": 0.00018164999582915488,
"logits/chosen": -0.3629850447177887,
"logits/rejected": -0.4418475925922394,
"logps/chosen": -12.760583877563477,
"logps/rejected": -46.22138595581055,
"loss": 0.8992067575454712,
"memory(GiB)": 40.31,
"nll_loss": 0.685957133769989,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.3213002681732178,
"rewards/margins": 3.270735502243042,
"rewards/rejected": -2.9494354724884033,
"step": 146,
"train_speed(iter/s)": 0.011206
},
{
"epoch": 0.7133757961783439,
"grad_norm": 4.871396064758301,
"learning_rate": 0.00018133983571836667,
"logits/chosen": -0.33027127385139465,
"logits/rejected": -0.4520616829395294,
"logps/chosen": -10.541389465332031,
"logps/rejected": -41.49027633666992,
"loss": 1.0133702754974365,
"memory(GiB)": 40.31,
"nll_loss": 0.6680970788002014,
"rewards/accuracies": 0.8125,
"rewards/chosen": 0.13710376620292664,
"rewards/margins": 2.4736220836639404,
"rewards/rejected": -2.3365182876586914,
"step": 147,
"train_speed(iter/s)": 0.011206
},
{
"epoch": 0.7182286927509858,
"grad_norm": 3.6936795711517334,
"learning_rate": 0.000181027345769188,
"logits/chosen": -0.41163426637649536,
"logits/rejected": -0.40933167934417725,
"logps/chosen": -9.165144920349121,
"logps/rejected": -30.310758590698242,
"loss": 0.7363777160644531,
"memory(GiB)": 40.31,
"nll_loss": 0.42432036995887756,
"rewards/accuracies": 0.90625,
"rewards/chosen": -0.02400527521967888,
"rewards/margins": 1.7538728713989258,
"rewards/rejected": -1.7778780460357666,
"step": 148,
"train_speed(iter/s)": 0.011206
},
{
"epoch": 0.7230815893236275,
"grad_norm": 6.49341344833374,
"learning_rate": 0.00018071253493235094,
"logits/chosen": -0.4786967933177948,
"logits/rejected": -0.4735773801803589,
"logps/chosen": -12.567697525024414,
"logps/rejected": -31.06718635559082,
"loss": 1.0480177402496338,
"memory(GiB)": 40.31,
"nll_loss": 0.7017223834991455,
"rewards/accuracies": 0.9375,
"rewards/chosen": -0.04890735074877739,
"rewards/margins": 1.8125377893447876,
"rewards/rejected": -1.8614450693130493,
"step": 149,
"train_speed(iter/s)": 0.011206
},
{
"epoch": 0.7279344858962693,
"grad_norm": 11.014755249023438,
"learning_rate": 0.0001803954122250654,
"logits/chosen": -0.493363618850708,
"logits/rejected": -0.560202419757843,
"logps/chosen": -11.512059211730957,
"logps/rejected": -37.07139587402344,
"loss": 1.237532138824463,
"memory(GiB)": 40.31,
"nll_loss": 0.7943273782730103,
"rewards/accuracies": 0.84375,
"rewards/chosen": -0.1521718055009842,
"rewards/margins": 2.0435235500335693,
"rewards/rejected": -2.195695161819458,
"step": 150,
"train_speed(iter/s)": 0.011207
},
{
"epoch": 0.7327873824689112,
"grad_norm": 4.69052791595459,
"learning_rate": 0.00018007598673076093,
"logits/chosen": -0.4235774278640747,
"logits/rejected": -0.4463633596897125,
"logps/chosen": -11.031900405883789,
"logps/rejected": -27.883403778076172,
"loss": 1.107750415802002,
"memory(GiB)": 40.31,
"nll_loss": 0.7605136632919312,
"rewards/accuracies": 0.90625,
"rewards/chosen": -0.05042722821235657,
"rewards/margins": 1.6558500528335571,
"rewards/rejected": -1.7062770128250122,
"step": 151,
"train_speed(iter/s)": 0.011207
},
{
"epoch": 0.7376402790415529,
"grad_norm": 2.4655253887176514,
"learning_rate": 0.00017975426759882614,
"logits/chosen": -0.44894903898239136,
"logits/rejected": -0.4738643765449524,
"logps/chosen": -9.968032836914062,
"logps/rejected": -29.113271713256836,
"loss": 0.7568652629852295,
"memory(GiB)": 40.31,
"nll_loss": 0.5070943236351013,
"rewards/accuracies": 0.96875,
"rewards/chosen": 0.34214267134666443,
"rewards/margins": 1.9045073986053467,
"rewards/rejected": -1.5623646974563599,
"step": 152,
"train_speed(iter/s)": 0.011208
},
{
"epoch": 0.7424931756141947,
"grad_norm": 3.0639827251434326,
"learning_rate": 0.00017943026404434719,
"logits/chosen": -0.45172956585884094,
"logits/rejected": -0.5009413957595825,
"logps/chosen": -9.160325050354004,
"logps/rejected": -31.873594284057617,
"loss": 0.9305005669593811,
"memory(GiB)": 40.31,
"nll_loss": 0.6987206935882568,
"rewards/accuracies": 0.96875,
"rewards/chosen": 0.11259810626506805,
"rewards/margins": 1.9045584201812744,
"rewards/rejected": -1.7919602394104004,
"step": 153,
"train_speed(iter/s)": 0.011208
},
{
"epoch": 0.7473460721868365,
"grad_norm": 3.0101685523986816,
"learning_rate": 0.00017910398534784337,
"logits/chosen": -0.3823431730270386,
"logits/rejected": -0.47442248463630676,
"logps/chosen": -10.423698425292969,
"logps/rejected": -23.59076690673828,
"loss": 1.046834945678711,
"memory(GiB)": 40.31,
"nll_loss": 0.5919281244277954,
"rewards/accuracies": 0.8125,
"rewards/chosen": 0.2845015525817871,
"rewards/margins": 1.1300426721572876,
"rewards/rejected": -0.8455410599708557,
"step": 154,
"train_speed(iter/s)": 0.011208
},
{
"epoch": 0.7521989687594783,
"grad_norm": 6.684966087341309,
"learning_rate": 0.00017877544085500156,
"logits/chosen": -0.32389581203460693,
"logits/rejected": -0.4660918116569519,
"logps/chosen": -5.926966190338135,
"logps/rejected": -32.869140625,
"loss": 0.8766897916793823,
"memory(GiB)": 43.93,
"nll_loss": 0.5428420305252075,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.006232857704162598,
"rewards/margins": 1.7234890460968018,
"rewards/rejected": -1.7172563076019287,
"step": 155,
"train_speed(iter/s)": 0.011208
},
{
"epoch": 0.7570518653321201,
"grad_norm": 3.565051317214966,
"learning_rate": 0.00017844463997640842,
"logits/chosen": -0.40359729528427124,
"logits/rejected": -0.44952863454818726,
"logps/chosen": -11.961484909057617,
"logps/rejected": -28.9517879486084,
"loss": 1.0656830072402954,
"memory(GiB)": 43.93,
"nll_loss": 0.6759463548660278,
"rewards/accuracies": 0.84375,
"rewards/chosen": 0.06430176645517349,
"rewards/margins": 1.5096461772918701,
"rewards/rejected": -1.44534432888031,
"step": 156,
"train_speed(iter/s)": 0.011208
},
{
"epoch": 0.7619047619047619,
"grad_norm": 2.5383567810058594,
"learning_rate": 0.00017811159218728082,
"logits/chosen": -0.39084097743034363,
"logits/rejected": -0.4242747128009796,
"logps/chosen": -8.804425239562988,
"logps/rejected": -22.249990463256836,
"loss": 0.9147839546203613,
"memory(GiB)": 43.93,
"nll_loss": 0.590728759765625,
"rewards/accuracies": 0.90625,
"rewards/chosen": 0.2870722711086273,
"rewards/margins": 1.4324426651000977,
"rewards/rejected": -1.1453704833984375,
"step": 157,
"train_speed(iter/s)": 0.011208
},
{
"epoch": 0.7667576584774037,
"grad_norm": 2.662156343460083,
"learning_rate": 0.00017777630702719453,
"logits/chosen": -0.32536131143569946,
"logits/rejected": -0.397830992937088,
"logps/chosen": -9.738006591796875,
"logps/rejected": -30.069774627685547,
"loss": 0.8968651294708252,
"memory(GiB)": 43.93,
"nll_loss": 0.527851402759552,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.08923595398664474,
"rewards/margins": 1.6620792150497437,
"rewards/rejected": -1.5728431940078735,
"step": 158,
"train_speed(iter/s)": 0.011208
},
{
"epoch": 0.7716105550500455,
"grad_norm": 3.2361485958099365,
"learning_rate": 0.00017743879409981095,
"logits/chosen": -0.3466249704360962,
"logits/rejected": -0.41640138626098633,
"logps/chosen": -11.293127059936523,
"logps/rejected": -30.880006790161133,
"loss": 0.9047757387161255,
"memory(GiB)": 43.93,
"nll_loss": 0.5920196175575256,
"rewards/accuracies": 0.90625,
"rewards/chosen": 0.030911901965737343,
"rewards/margins": 1.6093332767486572,
"rewards/rejected": -1.5784213542938232,
"step": 159,
"train_speed(iter/s)": 0.011208
},
{
"epoch": 0.7764634516226873,
"grad_norm": 2.2754669189453125,
"learning_rate": 0.00017709906307260194,
"logits/chosen": -0.3480105400085449,
"logits/rejected": -0.4323396682739258,
"logps/chosen": -5.929109573364258,
"logps/rejected": -34.05678939819336,
"loss": 0.7185795903205872,
"memory(GiB)": 43.93,
"nll_loss": 0.4936397075653076,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.06835521012544632,
"rewards/margins": 2.1114068031311035,
"rewards/rejected": -2.0430517196655273,
"step": 160,
"train_speed(iter/s)": 0.011209
},
{
"epoch": 0.7813163481953291,
"grad_norm": 2.226016044616699,
"learning_rate": 0.000176757123676573,
"logits/chosen": -0.39186131954193115,
"logits/rejected": -0.3231448531150818,
"logps/chosen": -12.739521026611328,
"logps/rejected": -28.13015365600586,
"loss": 0.8966748714447021,
"memory(GiB)": 43.93,
"nll_loss": 0.5328811407089233,
"rewards/accuracies": 0.90625,
"rewards/chosen": 0.17805510759353638,
"rewards/margins": 1.8448935747146606,
"rewards/rejected": -1.6668384075164795,
"step": 161,
"train_speed(iter/s)": 0.011208
},
{
"epoch": 0.7861692447679709,
"grad_norm": 2.2700612545013428,
"learning_rate": 0.00017641298570598459,
"logits/chosen": -0.36923766136169434,
"logits/rejected": -0.41111743450164795,
"logps/chosen": -6.442410469055176,
"logps/rejected": -29.95729637145996,
"loss": 0.7110913991928101,
"memory(GiB)": 43.93,
"nll_loss": 0.4247634708881378,
"rewards/accuracies": 0.90625,
"rewards/chosen": 0.08174540847539902,
"rewards/margins": 1.7869547605514526,
"rewards/rejected": -1.7052093744277954,
"step": 162,
"train_speed(iter/s)": 0.011208
},
{
"epoch": 0.7910221413406127,
"grad_norm": 5.662917613983154,
"learning_rate": 0.0001760666590180714,
"logits/chosen": -0.2990395426750183,
"logits/rejected": -0.4443129301071167,
"logps/chosen": -11.827997207641602,
"logps/rejected": -39.40394592285156,
"loss": 0.9818216562271118,
"memory(GiB)": 43.93,
"nll_loss": 0.6332793831825256,
"rewards/accuracies": 0.875,
"rewards/chosen": -0.07979752123355865,
"rewards/margins": 2.349473237991333,
"rewards/rejected": -2.4292705059051514,
"step": 163,
"train_speed(iter/s)": 0.011208
},
{
"epoch": 0.7958750379132544,
"grad_norm": 2.659315586090088,
"learning_rate": 0.0001757181535327602,
"logits/chosen": -0.41728484630584717,
"logits/rejected": -0.44338852167129517,
"logps/chosen": -7.938527584075928,
"logps/rejected": -30.74227523803711,
"loss": 0.8022794723510742,
"memory(GiB)": 43.93,
"nll_loss": 0.4814991056919098,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.056870464235544205,
"rewards/margins": 1.9418084621429443,
"rewards/rejected": -1.8849378824234009,
"step": 164,
"train_speed(iter/s)": 0.011208
},
{
"epoch": 0.8007279344858963,
"grad_norm": 2.9071202278137207,
"learning_rate": 0.00017536747923238566,
"logits/chosen": -0.3409942090511322,
"logits/rejected": -0.457685649394989,
"logps/chosen": -7.500731468200684,
"logps/rejected": -44.705909729003906,
"loss": 0.6390520930290222,
"memory(GiB)": 43.93,
"nll_loss": 0.38755032420158386,
"rewards/accuracies": 0.8125,
"rewards/chosen": 0.19773569703102112,
"rewards/margins": 3.0309081077575684,
"rewards/rejected": -2.83317232131958,
"step": 165,
"train_speed(iter/s)": 0.011208
},
{
"epoch": 0.8055808310585381,
"grad_norm": 3.0054497718811035,
"learning_rate": 0.00017501464616140436,
"logits/chosen": -0.41681885719299316,
"logits/rejected": -0.45619145035743713,
"logps/chosen": -8.748014450073242,
"logps/rejected": -35.70191955566406,
"loss": 0.7890005111694336,
"memory(GiB)": 43.93,
"nll_loss": 0.5446341633796692,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.16440145671367645,
"rewards/margins": 2.74184250831604,
"rewards/rejected": -2.5774412155151367,
"step": 166,
"train_speed(iter/s)": 0.011209
},
{
"epoch": 0.8104337276311798,
"grad_norm": 3.300097942352295,
"learning_rate": 0.000174659664426107,
"logits/chosen": -0.4365924298763275,
"logits/rejected": -0.45622488856315613,
"logps/chosen": -11.21609115600586,
"logps/rejected": -34.401222229003906,
"loss": 0.9579750299453735,
"memory(GiB)": 43.93,
"nll_loss": 0.7187469601631165,
"rewards/accuracies": 0.90625,
"rewards/chosen": 0.14886964857578278,
"rewards/margins": 2.472686529159546,
"rewards/rejected": -2.323817253112793,
"step": 167,
"train_speed(iter/s)": 0.011209
},
{
"epoch": 0.8152866242038217,
"grad_norm": 2.5296413898468018,
"learning_rate": 0.00017430254419432931,
"logits/chosen": -0.41913431882858276,
"logits/rejected": -0.41736355423927307,
"logps/chosen": -13.593805313110352,
"logps/rejected": -33.63285827636719,
"loss": 0.6976242065429688,
"memory(GiB)": 43.93,
"nll_loss": 0.46450674533843994,
"rewards/accuracies": 0.90625,
"rewards/chosen": 0.2216261476278305,
"rewards/margins": 2.4022936820983887,
"rewards/rejected": -2.1806676387786865,
"step": 168,
"train_speed(iter/s)": 0.011209
},
{
"epoch": 0.8201395207764635,
"grad_norm": 21.119770050048828,
"learning_rate": 0.00017394329569516028,
"logits/chosen": -0.3196732997894287,
"logits/rejected": -0.47898930311203003,
"logps/chosen": -11.645589828491211,
"logps/rejected": -45.33073425292969,
"loss": 1.067216157913208,
"memory(GiB)": 43.93,
"nll_loss": 0.8613059520721436,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.024522848427295685,
"rewards/margins": 2.9725117683410645,
"rewards/rejected": -2.947988748550415,
"step": 169,
"train_speed(iter/s)": 0.011209
},
{
"epoch": 0.8249924173491052,
"grad_norm": 2.541898012161255,
"learning_rate": 0.00017358192921864953,
"logits/chosen": -0.40079769492149353,
"logits/rejected": -0.4508993923664093,
"logps/chosen": -10.424609184265137,
"logps/rejected": -34.24469757080078,
"loss": 0.7411442399024963,
"memory(GiB)": 43.93,
"nll_loss": 0.4615729749202728,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.05271195247769356,
"rewards/margins": 2.12577223777771,
"rewards/rejected": -2.0730605125427246,
"step": 170,
"train_speed(iter/s)": 0.011209
},
{
"epoch": 0.8298453139217471,
"grad_norm": 4.101256370544434,
"learning_rate": 0.00017321845511551244,
"logits/chosen": -0.38883864879608154,
"logits/rejected": -0.46420595049858093,
"logps/chosen": -9.728652954101562,
"logps/rejected": -49.25832748413086,
"loss": 0.7956501245498657,
"memory(GiB)": 43.93,
"nll_loss": 0.6269941926002502,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.07354284077882767,
"rewards/margins": 3.7279632091522217,
"rewards/rejected": -3.6544198989868164,
"step": 171,
"train_speed(iter/s)": 0.011209
},
{
"epoch": 0.8346982104943889,
"grad_norm": 6.031051158905029,
"learning_rate": 0.00017285288379683376,
"logits/chosen": -0.4501774311065674,
"logits/rejected": -0.49218156933784485,
"logps/chosen": -12.754474639892578,
"logps/rejected": -35.773963928222656,
"loss": 0.9267921447753906,
"memory(GiB)": 43.93,
"nll_loss": 0.6455193758010864,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.23461803793907166,
"rewards/margins": 2.5618717670440674,
"rewards/rejected": -2.327253580093384,
"step": 172,
"train_speed(iter/s)": 0.011209
},
{
"epoch": 0.8395511070670306,
"grad_norm": 2.7078492641448975,
"learning_rate": 0.00017248522573376932,
"logits/chosen": -0.5002922415733337,
"logits/rejected": -0.4927571713924408,
"logps/chosen": -12.274182319641113,
"logps/rejected": -38.476226806640625,
"loss": 0.8795382976531982,
"memory(GiB)": 43.93,
"nll_loss": 0.679415225982666,
"rewards/accuracies": 0.90625,
"rewards/chosen": 0.20902375876903534,
"rewards/margins": 2.886625289916992,
"rewards/rejected": -2.6776018142700195,
"step": 173,
"train_speed(iter/s)": 0.011209
},
{
"epoch": 0.8444040036396724,
"grad_norm": 3.0864455699920654,
"learning_rate": 0.00017211549145724602,
"logits/chosen": -0.44441068172454834,
"logits/rejected": -0.5031411647796631,
"logps/chosen": -6.964417934417725,
"logps/rejected": -47.59633255004883,
"loss": 0.5743454694747925,
"memory(GiB)": 43.93,
"nll_loss": 0.39823874831199646,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.1409493237733841,
"rewards/margins": 3.664174795150757,
"rewards/rejected": -3.5232253074645996,
"step": 174,
"train_speed(iter/s)": 0.011209
},
{
"epoch": 0.8492569002123143,
"grad_norm": 13.482826232910156,
"learning_rate": 0.00017174369155766037,
"logits/chosen": -0.44830185174942017,
"logits/rejected": -0.4931170344352722,
"logps/chosen": -11.00506591796875,
"logps/rejected": -38.13721466064453,
"loss": 1.102919578552246,
"memory(GiB)": 43.93,
"nll_loss": 0.8681702017784119,
"rewards/accuracies": 0.90625,
"rewards/chosen": 0.020436841994524002,
"rewards/margins": 2.716992139816284,
"rewards/rejected": -2.6965548992156982,
"step": 175,
"train_speed(iter/s)": 0.01121
},
{
"epoch": 0.854109796784956,
"grad_norm": 2.788137435913086,
"learning_rate": 0.0001713698366845751,
"logits/chosen": -0.41955456137657166,
"logits/rejected": -0.4849671423435211,
"logps/chosen": -10.713014602661133,
"logps/rejected": -38.87740707397461,
"loss": 0.8198617696762085,
"memory(GiB)": 43.93,
"nll_loss": 0.5618011951446533,
"rewards/accuracies": 0.90625,
"rewards/chosen": 0.052750274538993835,
"rewards/margins": 2.4263105392456055,
"rewards/rejected": -2.3735604286193848,
"step": 176,
"train_speed(iter/s)": 0.01121
},
{
"epoch": 0.8589626933575978,
"grad_norm": 2.8578059673309326,
"learning_rate": 0.00017099393754641402,
"logits/chosen": -0.4903329014778137,
"logits/rejected": -0.44835591316223145,
"logps/chosen": -12.698493957519531,
"logps/rejected": -31.339452743530273,
"loss": 0.8736453056335449,
"memory(GiB)": 43.93,
"nll_loss": 0.5660265684127808,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.12503781914710999,
"rewards/margins": 2.115137815475464,
"rewards/rejected": -1.9901000261306763,
"step": 177,
"train_speed(iter/s)": 0.01121
},
{
"epoch": 0.8638155899302397,
"grad_norm": 14.433143615722656,
"learning_rate": 0.0001706160049101554,
"logits/chosen": -0.39836981892585754,
"logits/rejected": -0.4502709209918976,
"logps/chosen": -12.003418922424316,
"logps/rejected": -33.39105224609375,
"loss": 0.9455697536468506,
"memory(GiB)": 43.93,
"nll_loss": 0.6791843771934509,
"rewards/accuracies": 0.96875,
"rewards/chosen": 0.2257295846939087,
"rewards/margins": 2.307054042816162,
"rewards/rejected": -2.081324577331543,
"step": 178,
"train_speed(iter/s)": 0.01121
},
{
"epoch": 0.8686684865028814,
"grad_norm": 4.972922325134277,
"learning_rate": 0.00017023604960102355,
"logits/chosen": -0.48707541823387146,
"logits/rejected": -0.43483617901802063,
"logps/chosen": -15.320083618164062,
"logps/rejected": -26.741153717041016,
"loss": 1.0946437120437622,
"memory(GiB)": 43.93,
"nll_loss": 0.7049025893211365,
"rewards/accuracies": 0.8125,
"rewards/chosen": 0.14932136237621307,
"rewards/margins": 1.6685651540756226,
"rewards/rejected": -1.519243836402893,
"step": 179,
"train_speed(iter/s)": 0.01121
},
{
"epoch": 0.8735213830755232,
"grad_norm": 7.616319179534912,
"learning_rate": 0.00016985408250217864,
"logits/chosen": -0.48446008563041687,
"logits/rejected": -0.5007644891738892,
"logps/chosen": -9.878619194030762,
"logps/rejected": -33.84723663330078,
"loss": 0.91806560754776,
"memory(GiB)": 43.93,
"nll_loss": 0.588477373123169,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.13273106515407562,
"rewards/margins": 2.1440441608428955,
"rewards/rejected": -2.0113131999969482,
"step": 180,
"train_speed(iter/s)": 0.01121
},
{
"epoch": 0.878374279648165,
"grad_norm": 5.360206604003906,
"learning_rate": 0.00016947011455440523,
"logits/chosen": -0.45152074098587036,
"logits/rejected": -0.4405006766319275,
"logps/chosen": -12.04659652709961,
"logps/rejected": -29.337995529174805,
"loss": 0.9476042985916138,
"memory(GiB)": 43.93,
"nll_loss": 0.5956300497055054,
"rewards/accuracies": 0.84375,
"rewards/chosen": 0.007146604359149933,
"rewards/margins": 1.6998629570007324,
"rewards/rejected": -1.6927162408828735,
"step": 181,
"train_speed(iter/s)": 0.01121
},
{
"epoch": 0.8832271762208068,
"grad_norm": 2.752962589263916,
"learning_rate": 0.00016908415675579854,
"logits/chosen": -0.400238573551178,
"logits/rejected": -0.5106572508811951,
"logps/chosen": -5.792488098144531,
"logps/rejected": -31.905841827392578,
"loss": 0.7257025241851807,
"memory(GiB)": 43.93,
"nll_loss": 0.4335445463657379,
"rewards/accuracies": 0.90625,
"rewards/chosen": 0.0758802518248558,
"rewards/margins": 1.8862504959106445,
"rewards/rejected": -1.8103703260421753,
"step": 182,
"train_speed(iter/s)": 0.011211
},
{
"epoch": 0.8880800727934486,
"grad_norm": 2.3120791912078857,
"learning_rate": 0.00016869622016144973,
"logits/chosen": -0.5098201632499695,
"logits/rejected": -0.4519084095954895,
"logps/chosen": -8.241873741149902,
"logps/rejected": -25.190824508666992,
"loss": 0.7128751277923584,
"memory(GiB)": 43.93,
"nll_loss": 0.44536417722702026,
"rewards/accuracies": 0.96875,
"rewards/chosen": 0.2868940234184265,
"rewards/margins": 1.7276583909988403,
"rewards/rejected": -1.4407645463943481,
"step": 183,
"train_speed(iter/s)": 0.011211
},
{
"epoch": 0.8929329693660903,
"grad_norm": 2.231217861175537,
"learning_rate": 0.0001683063158831291,
"logits/chosen": -0.4472496509552002,
"logits/rejected": -0.4929869771003723,
"logps/chosen": -7.548064231872559,
"logps/rejected": -31.63290023803711,
"loss": 0.7525639533996582,
"memory(GiB)": 43.93,
"nll_loss": 0.4533500671386719,
"rewards/accuracies": 0.90625,
"rewards/chosen": 0.2907182276248932,
"rewards/margins": 2.194798231124878,
"rewards/rejected": -1.9040801525115967,
"step": 184,
"train_speed(iter/s)": 0.011211
},
{
"epoch": 0.8977858659387322,
"grad_norm": 2.4883766174316406,
"learning_rate": 0.00016791445508896783,
"logits/chosen": -0.36559921503067017,
"logits/rejected": -0.42163488268852234,
"logps/chosen": -11.388641357421875,
"logps/rejected": -32.0931510925293,
"loss": 0.7775099873542786,
"memory(GiB)": 43.93,
"nll_loss": 0.5461112856864929,
"rewards/accuracies": 0.96875,
"rewards/chosen": 0.22250865399837494,
"rewards/margins": 1.9723868370056152,
"rewards/rejected": -1.749878168106079,
"step": 185,
"train_speed(iter/s)": 0.011211
},
{
"epoch": 0.902638762511374,
"grad_norm": 3.259838819503784,
"learning_rate": 0.00016752064900313815,
"logits/chosen": -0.5012748837471008,
"logits/rejected": -0.4815691113471985,
"logps/chosen": -8.668580055236816,
"logps/rejected": -27.685821533203125,
"loss": 0.7447406649589539,
"memory(GiB)": 43.93,
"nll_loss": 0.46015244722366333,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.07047421485185623,
"rewards/margins": 1.7800168991088867,
"rewards/rejected": -1.7095428705215454,
"step": 186,
"train_speed(iter/s)": 0.011211
},
{
"epoch": 0.9074916590840157,
"grad_norm": 4.5533576011657715,
"learning_rate": 0.0001671249089055317,
"logits/chosen": -0.5065349340438843,
"logits/rejected": -0.4818389117717743,
"logps/chosen": -9.181870460510254,
"logps/rejected": -33.568580627441406,
"loss": 0.7996796369552612,
"memory(GiB)": 43.93,
"nll_loss": 0.5168719291687012,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.10808134078979492,
"rewards/margins": 2.115391731262207,
"rewards/rejected": -2.007310628890991,
"step": 187,
"train_speed(iter/s)": 0.011211
},
{
"epoch": 0.9123445556566576,
"grad_norm": 4.431750297546387,
"learning_rate": 0.0001667272461314366,
"logits/chosen": -0.48659980297088623,
"logits/rejected": -0.487091988325119,
"logps/chosen": -10.220385551452637,
"logps/rejected": -35.60252380371094,
"loss": 0.9328407049179077,
"memory(GiB)": 43.93,
"nll_loss": 0.6412612199783325,
"rewards/accuracies": 0.84375,
"rewards/chosen": 0.01909228041768074,
"rewards/margins": 2.4949698448181152,
"rewards/rejected": -2.475877285003662,
"step": 188,
"train_speed(iter/s)": 0.011212
},
{
"epoch": 0.9171974522292994,
"grad_norm": 8.757882118225098,
"learning_rate": 0.00016632767207121267,
"logits/chosen": -0.33902058005332947,
"logits/rejected": -0.4704265594482422,
"logps/chosen": -10.807303428649902,
"logps/rejected": -48.82100296020508,
"loss": 1.2881890535354614,
"memory(GiB)": 43.93,
"nll_loss": 0.8564696907997131,
"rewards/accuracies": 0.8125,
"rewards/chosen": -0.06860647350549698,
"rewards/margins": 2.6622214317321777,
"rewards/rejected": -2.7308273315429688,
"step": 189,
"train_speed(iter/s)": 0.011211
},
{
"epoch": 0.9220503488019411,
"grad_norm": 9.251166343688965,
"learning_rate": 0.00016592619816996527,
"logits/chosen": -0.47989535331726074,
"logits/rejected": -0.5115556716918945,
"logps/chosen": -15.828009605407715,
"logps/rejected": -35.08710861206055,
"loss": 0.9385941624641418,
"memory(GiB)": 43.93,
"nll_loss": 0.632335901260376,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.0631108283996582,
"rewards/margins": 1.8624895811080933,
"rewards/rejected": -1.799378752708435,
"step": 190,
"train_speed(iter/s)": 0.011211
},
{
"epoch": 0.9269032453745829,
"grad_norm": 4.995007038116455,
"learning_rate": 0.0001655228359272173,
"logits/chosen": -0.45928898453712463,
"logits/rejected": -0.42803335189819336,
"logps/chosen": -11.98594856262207,
"logps/rejected": -27.537172317504883,
"loss": 1.0162464380264282,
"memory(GiB)": 43.93,
"nll_loss": 0.6742801070213318,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.0864061713218689,
"rewards/margins": 1.6110825538635254,
"rewards/rejected": -1.5246765613555908,
"step": 191,
"train_speed(iter/s)": 0.011211
},
{
"epoch": 0.9317561419472248,
"grad_norm": 8.054399490356445,
"learning_rate": 0.00016511759689657999,
"logits/chosen": -0.3773999512195587,
"logits/rejected": -0.42789533734321594,
"logps/chosen": -12.406736373901367,
"logps/rejected": -39.963958740234375,
"loss": 0.7866171598434448,
"memory(GiB)": 43.93,
"nll_loss": 0.5565248131752014,
"rewards/accuracies": 0.875,
"rewards/chosen": -0.005689222365617752,
"rewards/margins": 2.343252658843994,
"rewards/rejected": -2.3489420413970947,
"step": 192,
"train_speed(iter/s)": 0.011211
},
{
"epoch": 0.9366090385198665,
"grad_norm": 3.3172736167907715,
"learning_rate": 0.00016471049268542188,
"logits/chosen": -0.46051445603370667,
"logits/rejected": -0.41965189576148987,
"logps/chosen": -10.034582138061523,
"logps/rejected": -36.16367721557617,
"loss": 0.7486264109611511,
"memory(GiB)": 43.93,
"nll_loss": 0.4820393919944763,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.0357435941696167,
"rewards/margins": 2.641000747680664,
"rewards/rejected": -2.605257034301758,
"step": 193,
"train_speed(iter/s)": 0.011211
},
{
"epoch": 0.9414619350925083,
"grad_norm": 2.3992457389831543,
"learning_rate": 0.00016430153495453642,
"logits/chosen": -0.5328064560890198,
"logits/rejected": -0.47638142108917236,
"logps/chosen": -11.91832160949707,
"logps/rejected": -36.306785583496094,
"loss": 0.8761617541313171,
"memory(GiB)": 43.93,
"nll_loss": 0.6264892220497131,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.1922227442264557,
"rewards/margins": 2.7257025241851807,
"rewards/rejected": -2.533479690551758,
"step": 194,
"train_speed(iter/s)": 0.011211
},
{
"epoch": 0.9463148316651502,
"grad_norm": 4.527428150177002,
"learning_rate": 0.00016389073541780782,
"logits/chosen": -0.46726107597351074,
"logits/rejected": -0.47500157356262207,
"logps/chosen": -8.38770580291748,
"logps/rejected": -29.87854766845703,
"loss": 0.7214972376823425,
"memory(GiB)": 43.93,
"nll_loss": 0.4556006193161011,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.08811609447002411,
"rewards/margins": 1.9756295680999756,
"rewards/rejected": -1.8875133991241455,
"step": 195,
"train_speed(iter/s)": 0.011211
},
{
"epoch": 0.9511677282377919,
"grad_norm": 3.743474006652832,
"learning_rate": 0.00016347810584187568,
"logits/chosen": -0.5369599461555481,
"logits/rejected": -0.5066350102424622,
"logps/chosen": -8.895236015319824,
"logps/rejected": -26.281404495239258,
"loss": 0.8112626075744629,
"memory(GiB)": 43.93,
"nll_loss": 0.5115976333618164,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.04646964743733406,
"rewards/margins": 1.599694848060608,
"rewards/rejected": -1.5532252788543701,
"step": 196,
"train_speed(iter/s)": 0.011212
},
{
"epoch": 0.9560206248104337,
"grad_norm": 2.772148370742798,
"learning_rate": 0.00016306365804579794,
"logits/chosen": -0.36604201793670654,
"logits/rejected": -0.4730686545372009,
"logps/chosen": -9.536896705627441,
"logps/rejected": -40.390995025634766,
"loss": 0.6381856799125671,
"memory(GiB)": 43.93,
"nll_loss": 0.4115173816680908,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.2083117514848709,
"rewards/margins": 2.512366771697998,
"rewards/rejected": -2.3040552139282227,
"step": 197,
"train_speed(iter/s)": 0.011211
},
{
"epoch": 0.9608735213830755,
"grad_norm": 3.5839767456054688,
"learning_rate": 0.0001626474039007122,
"logits/chosen": -0.4816967844963074,
"logits/rejected": -0.47818446159362793,
"logps/chosen": -7.637480735778809,
"logps/rejected": -29.050764083862305,
"loss": 0.6914876103401184,
"memory(GiB)": 43.93,
"nll_loss": 0.3912826478481293,
"rewards/accuracies": 0.84375,
"rewards/chosen": 0.2960473895072937,
"rewards/margins": 2.151468515396118,
"rewards/rejected": -1.8554210662841797,
"step": 198,
"train_speed(iter/s)": 0.011212
},
{
"epoch": 0.9657264179557173,
"grad_norm": 2.633289098739624,
"learning_rate": 0.00016222935532949587,
"logits/chosen": -0.4851294755935669,
"logits/rejected": -0.4861046373844147,
"logps/chosen": -10.165040969848633,
"logps/rejected": -34.33792495727539,
"loss": 0.7900617718696594,
"memory(GiB)": 43.93,
"nll_loss": 0.5045729279518127,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.33929818868637085,
"rewards/margins": 2.4269657135009766,
"rewards/rejected": -2.08766770362854,
"step": 199,
"train_speed(iter/s)": 0.011212
},
{
"epoch": 0.9705793145283591,
"grad_norm": 4.324284553527832,
"learning_rate": 0.0001618095243064245,
"logits/chosen": -0.486560583114624,
"logits/rejected": -0.46493133902549744,
"logps/chosen": -7.55566930770874,
"logps/rejected": -32.536399841308594,
"loss": 0.7669270038604736,
"memory(GiB)": 43.93,
"nll_loss": 0.45861828327178955,
"rewards/accuracies": 0.84375,
"rewards/chosen": 0.0628332868218422,
"rewards/margins": 2.340352773666382,
"rewards/rejected": -2.277519464492798,
"step": 200,
"train_speed(iter/s)": 0.011212
}
],
"logging_steps": 1,
"max_steps": 618,
"num_input_tokens_seen": 0,
"num_train_epochs": 3,
"save_steps": 100,
"stateful_callbacks": {
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": true,
"should_training_stop": false
},
"attributes": {}
}
},
"total_flos": 1.080336546969682e+17,
"train_batch_size": 2,
"trial_name": null,
"trial_params": null
}