coder1969's picture
Upload folder using huggingface_hub
296af4b verified
Raw
History Blame Contribute Delete
66.1 kB
Invalid JSON:Unexpected token 'I', ..."ad_norm": Infinity, "... is not valid JSON
{
"best_global_step": null,
"best_metric": null,
"best_model_checkpoint": null,
"epoch": 1.0,
"eval_steps": 500,
"global_step": 101,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"entropy": 2.566085159778595,
"epoch": 0.009950248756218905,
"grad_norm": 1.008041501045227,
"learning_rate": 0.0005,
"logits/chosen": -3.4524951520300227,
"logits/rejected": -3.4626118857625254,
"logps/chosen": -147.66649627685547,
"logps/rejected": -153.5500717163086,
"loss": 0.6931471824645996,
"mean_token_accuracy": 0.40839148312807083,
"num_tokens": 3138.0,
"rewards/accuracies": 0.0,
"rewards/chosen": 0.0,
"rewards/margins": 0.0,
"rewards/rejected": 0.0,
"step": 1
},
{
"entropy": 1.959685891866684,
"epoch": 0.01990049751243781,
"grad_norm": 1.1677398681640625,
"learning_rate": 0.0004950495049504951,
"logits/chosen": -3.5499522275821747,
"logits/rejected": -3.580069779457358,
"logps/chosen": -139.49810218811035,
"logps/rejected": -189.3823013305664,
"loss": 0.46622467041015625,
"mean_token_accuracy": 0.4368501454591751,
"num_tokens": 6422.0,
"rewards/accuracies": 0.5,
"rewards/chosen": 0.06323989480733871,
"rewards/margins": 0.9142910540103912,
"rewards/rejected": -0.8510511815547943,
"step": 2
},
{
"entropy": 1.5055575668811798,
"epoch": 0.029850746268656716,
"grad_norm": 3.6899547576904297,
"learning_rate": 0.0004900990099009901,
"logits/chosen": -3.5475161144530585,
"logits/rejected": -3.5951742990321627,
"logps/chosen": -96.94854736328125,
"logps/rejected": -122.58767223358154,
"loss": 0.6513766050338745,
"mean_token_accuracy": 0.45520826429128647,
"num_tokens": 8997.0,
"rewards/accuracies": 0.375,
"rewards/chosen": -0.8459513187408447,
"rewards/margins": 1.247560515999794,
"rewards/rejected": -2.0935118198394775,
"step": 3
},
{
"entropy": 1.557283103466034,
"epoch": 0.03980099502487562,
"grad_norm": 0.0978235974907875,
"learning_rate": 0.00048514851485148515,
"logits/chosen": -3.4936563969802714,
"logits/rejected": -3.5099735853856826,
"logps/chosen": -159.4117660522461,
"logps/rejected": -184.10985946655273,
"loss": 0.5663926005363464,
"mean_token_accuracy": 0.4151092618703842,
"num_tokens": 12160.0,
"rewards/accuracies": 0.1875,
"rewards/chosen": -1.603164166212082,
"rewards/margins": 0.9312166273593903,
"rewards/rejected": -2.534380793571472,
"step": 4
},
{
"entropy": 1.5153527557849884,
"epoch": 0.04975124378109453,
"grad_norm": 0.7491629719734192,
"learning_rate": 0.0004801980198019802,
"logits/chosen": -3.6313017387350977,
"logits/rejected": -3.6386909825311573,
"logps/chosen": -136.62432289123535,
"logps/rejected": -162.2756748199463,
"loss": 0.5463283061981201,
"mean_token_accuracy": 0.4367467537522316,
"num_tokens": 15284.0,
"rewards/accuracies": 0.25,
"rewards/chosen": -0.5465116687119007,
"rewards/margins": 1.0278603285551071,
"rewards/rejected": -1.5743719935417175,
"step": 5
},
{
"entropy": 1.4582557380199432,
"epoch": 0.05970149253731343,
"grad_norm": 0.7366572022438049,
"learning_rate": 0.00047524752475247524,
"logits/chosen": -3.5624190347055085,
"logits/rejected": -3.5716472006137434,
"logps/chosen": -151.5631103515625,
"logps/rejected": -242.12555694580078,
"loss": 0.4732470214366913,
"mean_token_accuracy": 0.46974872797727585,
"num_tokens": 18935.0,
"rewards/accuracies": 0.375,
"rewards/chosen": -1.0975639000535011,
"rewards/margins": 1.8435385078191757,
"rewards/rejected": -2.9411023259162903,
"step": 6
},
{
"entropy": 1.382529228925705,
"epoch": 0.06965174129353234,
"grad_norm": 2.1164298057556152,
"learning_rate": 0.0004702970297029703,
"logits/chosen": -3.5944972735203464,
"logits/rejected": -3.5765365597770478,
"logps/chosen": -151.23340702056885,
"logps/rejected": -164.38666248321533,
"loss": 0.5946930646896362,
"mean_token_accuracy": 0.44173406809568405,
"num_tokens": 21990.0,
"rewards/accuracies": 0.3125,
"rewards/chosen": -1.0693217813968658,
"rewards/margins": 0.6622129492461681,
"rewards/rejected": -1.7315346747636795,
"step": 7
},
{
"entropy": 1.5175149738788605,
"epoch": 0.07960199004975124,
"grad_norm": 1.9517371654510498,
"learning_rate": 0.0004653465346534654,
"logits/chosen": -3.5927788076349674,
"logits/rejected": -3.584108080993631,
"logps/chosen": -212.95052337646484,
"logps/rejected": -229.85908699035645,
"loss": 0.7136555910110474,
"mean_token_accuracy": 0.471999429166317,
"num_tokens": 26289.0,
"rewards/accuracies": 0.125,
"rewards/chosen": -1.3788724839687347,
"rewards/margins": 0.41184403374791145,
"rewards/rejected": -1.7907164692878723,
"step": 8
},
{
"entropy": 1.6294221878051758,
"epoch": 0.08955223880597014,
"grad_norm": 5.569645881652832,
"learning_rate": 0.0004603960396039604,
"logits/chosen": -3.5307916447552246,
"logits/rejected": -3.5973216295285475,
"logps/chosen": -155.5925750732422,
"logps/rejected": -159.6125602722168,
"loss": 0.7543402910232544,
"mean_token_accuracy": 0.4240734949707985,
"num_tokens": 29297.0,
"rewards/accuracies": 0.3125,
"rewards/chosen": -1.32593235373497,
"rewards/margins": 0.4513932764530182,
"rewards/rejected": -1.7773255854845047,
"step": 9
},
{
"entropy": 1.6049813628196716,
"epoch": 0.09950248756218906,
"grad_norm": 2.697402000427246,
"learning_rate": 0.00045544554455445547,
"logits/chosen": -3.537555654849764,
"logits/rejected": -3.55802165123894,
"logps/chosen": -134.05085563659668,
"logps/rejected": -144.08281135559082,
"loss": 0.6336124539375305,
"mean_token_accuracy": 0.41080383211374283,
"num_tokens": 32149.0,
"rewards/accuracies": 0.3125,
"rewards/chosen": -0.8984666168689728,
"rewards/margins": 0.2784314379096031,
"rewards/rejected": -1.1768980920314789,
"step": 10
},
{
"entropy": 1.6381469070911407,
"epoch": 0.10945273631840796,
"grad_norm": Infinity,
"learning_rate": 0.0004504950495049505,
"logits/chosen": -3.5665754825972718,
"logits/rejected": -3.4803866010674835,
"logps/chosen": -151.97227668762207,
"logps/rejected": -165.6332607269287,
"loss": 0.7078717947006226,
"mean_token_accuracy": 0.4435800090432167,
"num_tokens": 35261.0,
"rewards/accuracies": 0.1875,
"rewards/chosen": -0.9129189550876617,
"rewards/margins": 0.44023333117365837,
"rewards/rejected": -1.3531522750854492,
"step": 11
},
{
"entropy": 1.5729329586029053,
"epoch": 0.11940298507462686,
"grad_norm": 1.798696756362915,
"learning_rate": 0.00044554455445544556,
"logits/chosen": -3.5680972100252037,
"logits/rejected": -3.5636713320968143,
"logps/chosen": -106.49790382385254,
"logps/rejected": -130.71097564697266,
"loss": 0.5336892604827881,
"mean_token_accuracy": 0.433380089700222,
"num_tokens": 37813.0,
"rewards/accuracies": 0.3125,
"rewards/chosen": -0.2621241584420204,
"rewards/margins": 0.8355743233114481,
"rewards/rejected": -1.0976984649896622,
"step": 12
},
{
"entropy": 1.5840542912483215,
"epoch": 0.12935323383084577,
"grad_norm": 3.1827797889709473,
"learning_rate": 0.0004405940594059406,
"logits/chosen": -3.5452509024889998,
"logits/rejected": -3.530621630940143,
"logps/chosen": -131.4068202972412,
"logps/rejected": -145.15791511535645,
"loss": 0.6936072111129761,
"mean_token_accuracy": 0.4328671544790268,
"num_tokens": 40883.0,
"rewards/accuracies": 0.3125,
"rewards/chosen": -0.9353857561945915,
"rewards/margins": 0.30992990732192993,
"rewards/rejected": -1.245315708220005,
"step": 13
},
{
"entropy": 1.6584091484546661,
"epoch": 0.13930348258706468,
"grad_norm": 2.5575995445251465,
"learning_rate": 0.00043564356435643565,
"logits/chosen": -3.571977708398152,
"logits/rejected": -3.5559217437615476,
"logps/chosen": -156.84790420532227,
"logps/rejected": -214.96884536743164,
"loss": 0.4404676556587219,
"mean_token_accuracy": 0.43554289638996124,
"num_tokens": 44189.0,
"rewards/accuracies": 0.5,
"rewards/chosen": -1.3778061270713806,
"rewards/margins": 1.154350906610489,
"rewards/rejected": -2.5321571230888367,
"step": 14
},
{
"entropy": 1.5668798983097076,
"epoch": 0.14925373134328357,
"grad_norm": 1.0555850267410278,
"learning_rate": 0.0004306930693069307,
"logits/chosen": -3.5467018552189504,
"logits/rejected": -3.5639543923338195,
"logps/chosen": -137.75764083862305,
"logps/rejected": -212.9980926513672,
"loss": 0.6105657815933228,
"mean_token_accuracy": 0.3983445391058922,
"num_tokens": 47240.0,
"rewards/accuracies": 0.125,
"rewards/chosen": -2.1039093732833862,
"rewards/margins": 0.9429394379258156,
"rewards/rejected": -3.046848803758621,
"step": 15
},
{
"entropy": 1.525937557220459,
"epoch": 0.15920398009950248,
"grad_norm": 0.5652996897697449,
"learning_rate": 0.00042574257425742574,
"logits/chosen": -3.592827924032985,
"logits/rejected": -3.56554933953146,
"logps/chosen": -148.5086841583252,
"logps/rejected": -158.31574058532715,
"loss": 0.5453071594238281,
"mean_token_accuracy": 0.41627876460552216,
"num_tokens": 50021.0,
"rewards/accuracies": 0.25,
"rewards/chosen": -2.3691547214984894,
"rewards/margins": 0.7764396816492081,
"rewards/rejected": -3.1455944180488586,
"step": 16
},
{
"entropy": 1.5125811696052551,
"epoch": 0.1691542288557214,
"grad_norm": 4.395788669586182,
"learning_rate": 0.0004207920792079208,
"logits/chosen": -3.6114905508093926,
"logits/rejected": -3.6018918848109203,
"logps/chosen": -211.8555679321289,
"logps/rejected": -233.0864772796631,
"loss": 0.6787844896316528,
"mean_token_accuracy": 0.4354413077235222,
"num_tokens": 53786.0,
"rewards/accuracies": 0.375,
"rewards/chosen": -3.3658860325813293,
"rewards/margins": 1.0309943780303001,
"rewards/rejected": -4.3968804478645325,
"step": 17
},
{
"entropy": 1.493565171957016,
"epoch": 0.1791044776119403,
"grad_norm": Infinity,
"learning_rate": 0.00041584158415841583,
"logits/chosen": -3.5052047762225076,
"logits/rejected": -3.5252457174716327,
"logps/chosen": -211.47866821289062,
"logps/rejected": -226.36801528930664,
"loss": 0.612738847732544,
"mean_token_accuracy": 0.4072455167770386,
"num_tokens": 57371.0,
"rewards/accuracies": 0.1875,
"rewards/chosen": -4.439986944198608,
"rewards/margins": 0.8419481515884399,
"rewards/rejected": -5.281934976577759,
"step": 18
},
{
"entropy": 1.4729647934436798,
"epoch": 0.1890547263681592,
"grad_norm": 2.456820487976074,
"learning_rate": 0.0004108910891089109,
"logits/chosen": -3.5512168301622737,
"logits/rejected": -3.538663341941865,
"logps/chosen": -148.29982948303223,
"logps/rejected": -166.7068576812744,
"loss": 0.6629408001899719,
"mean_token_accuracy": 0.35727057605981827,
"num_tokens": 60022.0,
"rewards/accuracies": 0.1875,
"rewards/chosen": -3.792637586593628,
"rewards/margins": 0.5820458717644215,
"rewards/rejected": -4.374683439731598,
"step": 19
},
{
"entropy": 1.5030970871448517,
"epoch": 0.19900497512437812,
"grad_norm": 4.276188373565674,
"learning_rate": 0.000405940594059406,
"logits/chosen": -3.5231190638874805,
"logits/rejected": -3.5430015732000153,
"logps/chosen": -197.88331604003906,
"logps/rejected": -207.0079689025879,
"loss": 0.5883949995040894,
"mean_token_accuracy": 0.4058200493454933,
"num_tokens": 63234.0,
"rewards/accuracies": 0.25,
"rewards/chosen": -4.501765310764313,
"rewards/margins": 0.6971243321895599,
"rewards/rejected": -5.19888961315155,
"step": 20
},
{
"entropy": 1.485507309436798,
"epoch": 0.208955223880597,
"grad_norm": 2.7109107971191406,
"learning_rate": 0.000400990099009901,
"logits/chosen": -3.5226335405352645,
"logits/rejected": -3.531911987571154,
"logps/chosen": -250.09426879882812,
"logps/rejected": -251.03947830200195,
"loss": 0.588646650314331,
"mean_token_accuracy": 0.38159702718257904,
"num_tokens": 66663.0,
"rewards/accuracies": 0.25,
"rewards/chosen": -7.025094747543335,
"rewards/margins": 0.5600872486829758,
"rewards/rejected": -7.585182189941406,
"step": 21
},
{
"entropy": 1.4331533908843994,
"epoch": 0.21890547263681592,
"grad_norm": 0.2803345322608948,
"learning_rate": 0.00039603960396039607,
"logits/chosen": -3.422363599396214,
"logits/rejected": -3.436769247049262,
"logps/chosen": -186.57451629638672,
"logps/rejected": -203.19062423706055,
"loss": 0.6102136373519897,
"mean_token_accuracy": 0.41628195345401764,
"num_tokens": 69753.0,
"rewards/accuracies": 0.125,
"rewards/chosen": -4.635616421699524,
"rewards/margins": 0.5115245580673218,
"rewards/rejected": -5.147140979766846,
"step": 22
},
{
"entropy": 1.7424571514129639,
"epoch": 0.22885572139303484,
"grad_norm": 0.896638035774231,
"learning_rate": 0.0003910891089108911,
"logits/chosen": -3.5223754972126913,
"logits/rejected": -3.5675395646362458,
"logps/chosen": -193.18716049194336,
"logps/rejected": -212.6921501159668,
"loss": 0.5874005556106567,
"mean_token_accuracy": 0.3610313981771469,
"num_tokens": 72943.0,
"rewards/accuracies": 0.1875,
"rewards/chosen": -5.1880112290382385,
"rewards/margins": 0.5615221261978149,
"rewards/rejected": -5.749533414840698,
"step": 23
},
{
"entropy": 1.5620428621768951,
"epoch": 0.23880597014925373,
"grad_norm": 0.8171165585517883,
"learning_rate": 0.00038613861386138616,
"logits/chosen": -3.444536389293048,
"logits/rejected": -3.469452442213975,
"logps/chosen": -227.75585174560547,
"logps/rejected": -244.11057662963867,
"loss": 0.5816839933395386,
"mean_token_accuracy": 0.39418596029281616,
"num_tokens": 76389.0,
"rewards/accuracies": 0.1875,
"rewards/chosen": -6.575283408164978,
"rewards/margins": 0.8996190428733826,
"rewards/rejected": -7.474902510643005,
"step": 24
},
{
"entropy": 1.682222694158554,
"epoch": 0.24875621890547264,
"grad_norm": 3.5681254863739014,
"learning_rate": 0.0003811881188118812,
"logits/chosen": -3.470989559019067,
"logits/rejected": -3.4263661433950654,
"logps/chosen": -215.18242645263672,
"logps/rejected": -212.655517578125,
"loss": 0.7612518072128296,
"mean_token_accuracy": 0.33192718774080276,
"num_tokens": 79652.0,
"rewards/accuracies": 0.0625,
"rewards/chosen": -6.581342101097107,
"rewards/margins": -0.09777332842350006,
"rewards/rejected": -6.483568787574768,
"step": 25
},
{
"entropy": 1.7008473575115204,
"epoch": 0.25870646766169153,
"grad_norm": 0.08288310468196869,
"learning_rate": 0.00037623762376237625,
"logits/chosen": -3.427816639852287,
"logits/rejected": -3.4542770548219104,
"logps/chosen": -218.20597076416016,
"logps/rejected": -248.2343292236328,
"loss": 0.6077355742454529,
"mean_token_accuracy": 0.35978567600250244,
"num_tokens": 82832.0,
"rewards/accuracies": 0.125,
"rewards/chosen": -7.347757697105408,
"rewards/margins": 0.7340568602085114,
"rewards/rejected": -8.081814527511597,
"step": 26
},
{
"entropy": 1.811392456293106,
"epoch": 0.26865671641791045,
"grad_norm": 0.4933086335659027,
"learning_rate": 0.0003712871287128713,
"logits/chosen": -3.530475011062849,
"logits/rejected": -3.513883089770881,
"logps/chosen": -324.6820068359375,
"logps/rejected": -361.88365936279297,
"loss": 0.5700176954269409,
"mean_token_accuracy": 0.3622868210077286,
"num_tokens": 87715.0,
"rewards/accuracies": 0.1875,
"rewards/chosen": -8.779233574867249,
"rewards/margins": 0.7017057538032532,
"rewards/rejected": -9.480939149856567,
"step": 27
},
{
"entropy": 1.9288294613361359,
"epoch": 0.27860696517412936,
"grad_norm": 2.3309881687164307,
"learning_rate": 0.00036633663366336634,
"logits/chosen": -3.5844996946988785,
"logits/rejected": -3.5284301241131,
"logps/chosen": -184.63220977783203,
"logps/rejected": -240.8532257080078,
"loss": 0.47455936670303345,
"mean_token_accuracy": 0.3226698935031891,
"num_tokens": 90862.0,
"rewards/accuracies": 0.375,
"rewards/chosen": -5.509602308273315,
"rewards/margins": 1.977087453007698,
"rewards/rejected": -7.486689925193787,
"step": 28
},
{
"entropy": 1.827368676662445,
"epoch": 0.2885572139303483,
"grad_norm": 0.7671760320663452,
"learning_rate": 0.0003613861386138614,
"logits/chosen": -3.5442204947172145,
"logits/rejected": -3.5596477134863482,
"logps/chosen": -158.0522174835205,
"logps/rejected": -175.73583793640137,
"loss": 0.583824098110199,
"mean_token_accuracy": 0.3381008803844452,
"num_tokens": 93730.0,
"rewards/accuracies": 0.1875,
"rewards/chosen": -4.713171184062958,
"rewards/margins": 0.6338318586349487,
"rewards/rejected": -5.347002983093262,
"step": 29
},
{
"entropy": 2.166943669319153,
"epoch": 0.29850746268656714,
"grad_norm": Infinity,
"learning_rate": 0.0003564356435643564,
"logits/chosen": -3.5212162470658805,
"logits/rejected": -3.521852987485434,
"logps/chosen": -309.9493179321289,
"logps/rejected": -350.4508514404297,
"loss": 0.5989641547203064,
"mean_token_accuracy": 0.30863772332668304,
"num_tokens": 97866.0,
"rewards/accuracies": 0.1875,
"rewards/chosen": -9.270570039749146,
"rewards/margins": 1.3084884360432625,
"rewards/rejected": -10.579058527946472,
"step": 30
},
{
"entropy": 1.8375334739685059,
"epoch": 0.30845771144278605,
"grad_norm": 9.901069641113281,
"learning_rate": 0.00035148514851485147,
"logits/chosen": -3.456909141037305,
"logits/rejected": -3.4208388982393494,
"logps/chosen": -210.7388458251953,
"logps/rejected": -186.36470794677734,
"loss": 1.2342932224273682,
"mean_token_accuracy": 0.31642504036426544,
"num_tokens": 100664.0,
"rewards/accuracies": 0.0,
"rewards/chosen": -7.150167465209961,
"rewards/margins": -0.6264755576848984,
"rewards/rejected": -6.523691773414612,
"step": 31
},
{
"entropy": 1.99248006939888,
"epoch": 0.31840796019900497,
"grad_norm": 4.666665077209473,
"learning_rate": 0.0003465346534653465,
"logits/chosen": -3.613257063639754,
"logits/rejected": -3.629373806723718,
"logps/chosen": -213.52509307861328,
"logps/rejected": -228.46065139770508,
"loss": 0.7087903022766113,
"mean_token_accuracy": 0.35015513002872467,
"num_tokens": 103912.0,
"rewards/accuracies": 0.1875,
"rewards/chosen": -6.4269896149635315,
"rewards/margins": 0.1060914397239685,
"rewards/rejected": -6.533081233501434,
"step": 32
},
{
"entropy": 2.011792302131653,
"epoch": 0.3283582089552239,
"grad_norm": 0.9864645600318909,
"learning_rate": 0.0003415841584158416,
"logits/chosen": -3.6115896043063813,
"logits/rejected": -3.624950827978018,
"logps/chosen": -237.15367889404297,
"logps/rejected": -255.65070724487305,
"loss": 0.574335515499115,
"mean_token_accuracy": 0.34920939058065414,
"num_tokens": 107516.0,
"rewards/accuracies": 0.1875,
"rewards/chosen": -6.345386028289795,
"rewards/margins": 0.8882534243166447,
"rewards/rejected": -7.233639478683472,
"step": 33
},
{
"entropy": 1.9972886443138123,
"epoch": 0.3383084577114428,
"grad_norm": 1.5521798133850098,
"learning_rate": 0.00033663366336633666,
"logits/chosen": -3.6060157953194127,
"logits/rejected": -3.5974054100688786,
"logps/chosen": -170.52621269226074,
"logps/rejected": -218.68214797973633,
"loss": 0.5241377353668213,
"mean_token_accuracy": 0.36179573833942413,
"num_tokens": 110501.0,
"rewards/accuracies": 0.3125,
"rewards/chosen": -4.737287938594818,
"rewards/margins": 2.1275550723075867,
"rewards/rejected": -6.864843249320984,
"step": 34
},
{
"entropy": 2.147545635700226,
"epoch": 0.3482587064676617,
"grad_norm": 3.7898976802825928,
"learning_rate": 0.0003316831683168317,
"logits/chosen": -3.662060887563785,
"logits/rejected": -3.643096818576444,
"logps/chosen": -220.84019088745117,
"logps/rejected": -218.89766311645508,
"loss": 0.6805493831634521,
"mean_token_accuracy": 0.34033310413360596,
"num_tokens": 113765.0,
"rewards/accuracies": 0.0625,
"rewards/chosen": -6.760529637336731,
"rewards/margins": 0.028392881155014038,
"rewards/rejected": -6.788922429084778,
"step": 35
},
{
"entropy": 2.204443633556366,
"epoch": 0.3582089552238806,
"grad_norm": 3.009458541870117,
"learning_rate": 0.00032673267326732675,
"logits/chosen": -3.6537463903752347,
"logits/rejected": -3.639793618003779,
"logps/chosen": -257.6618881225586,
"logps/rejected": -279.3141975402832,
"loss": 0.5332838892936707,
"mean_token_accuracy": 0.3123948536813259,
"num_tokens": 117530.0,
"rewards/accuracies": 0.3125,
"rewards/chosen": -7.534723997116089,
"rewards/margins": 0.9232382774353027,
"rewards/rejected": -8.457962155342102,
"step": 36
},
{
"entropy": 2.0133582651615143,
"epoch": 0.3681592039800995,
"grad_norm": 6.925239086151123,
"learning_rate": 0.0003217821782178218,
"logits/chosen": -3.4493966091905524,
"logits/rejected": -3.4655641391055774,
"logps/chosen": -189.9989013671875,
"logps/rejected": -197.52683639526367,
"loss": 0.6808904409408569,
"mean_token_accuracy": 0.3597341701388359,
"num_tokens": 120290.0,
"rewards/accuracies": 0.125,
"rewards/chosen": -6.549296140670776,
"rewards/margins": 0.3740836828947067,
"rewards/rejected": -6.9233797788619995,
"step": 37
},
{
"entropy": 1.799951583147049,
"epoch": 0.3781094527363184,
"grad_norm": Infinity,
"learning_rate": 0.00031683168316831684,
"logits/chosen": -3.2567474854555534,
"logits/rejected": -3.2621365465303196,
"logps/chosen": -305.88188552856445,
"logps/rejected": -318.30445098876953,
"loss": 1.0073232650756836,
"mean_token_accuracy": 0.30564460158348083,
"num_tokens": 123971.0,
"rewards/accuracies": 0.25,
"rewards/chosen": -13.314107418060303,
"rewards/margins": 0.5497575104236603,
"rewards/rejected": -13.863865375518799,
"step": 38
},
{
"entropy": 1.9222525358200073,
"epoch": 0.3880597014925373,
"grad_norm": 8.6959867477417,
"learning_rate": 0.0003118811881188119,
"logits/chosen": -3.2874606994512017,
"logits/rejected": -3.2915129031186225,
"logps/chosen": -294.8932342529297,
"logps/rejected": -334.9911651611328,
"loss": 0.7118847370147705,
"mean_token_accuracy": 0.31055251508951187,
"num_tokens": 127590.0,
"rewards/accuracies": 0.1875,
"rewards/chosen": -12.726699829101562,
"rewards/margins": 1.7574191242456436,
"rewards/rejected": -14.484118700027466,
"step": 39
},
{
"entropy": 1.763464778661728,
"epoch": 0.39800995024875624,
"grad_norm": 5.233345985412598,
"learning_rate": 0.00030693069306930693,
"logits/chosen": -3.0751955432610805,
"logits/rejected": -3.1166185180383543,
"logps/chosen": -236.8795928955078,
"logps/rejected": -275.63719177246094,
"loss": 0.4635728895664215,
"mean_token_accuracy": 0.2654060050845146,
"num_tokens": 130444.0,
"rewards/accuracies": 0.375,
"rewards/chosen": -11.302006244659424,
"rewards/margins": 1.8581123352050781,
"rewards/rejected": -13.160118579864502,
"step": 40
},
{
"entropy": 2.066802978515625,
"epoch": 0.4079601990049751,
"grad_norm": 17.57449722290039,
"learning_rate": 0.000301980198019802,
"logits/chosen": -2.980425116300123,
"logits/rejected": -2.970705539767077,
"logps/chosen": -260.0305938720703,
"logps/rejected": -314.4711227416992,
"loss": 0.9843884706497192,
"mean_token_accuracy": 0.2243056520819664,
"num_tokens": 133312.0,
"rewards/accuracies": 0.25,
"rewards/chosen": -14.370165824890137,
"rewards/margins": 2.6685269474983215,
"rewards/rejected": -17.03869318962097,
"step": 41
},
{
"entropy": 2.221681296825409,
"epoch": 0.417910447761194,
"grad_norm": 14.223358154296875,
"learning_rate": 0.000297029702970297,
"logits/chosen": -3.159763682014305,
"logits/rejected": -3.1037028438918695,
"logps/chosen": -295.029541015625,
"logps/rejected": -307.0481491088867,
"loss": 1.0131914615631104,
"mean_token_accuracy": 0.21281880140304565,
"num_tokens": 136429.0,
"rewards/accuracies": 0.0625,
"rewards/chosen": -13.900337934494019,
"rewards/margins": 1.0990875959396362,
"rewards/rejected": -14.999425649642944,
"step": 42
},
{
"entropy": 1.8978886902332306,
"epoch": 0.42786069651741293,
"grad_norm": 40.302528381347656,
"learning_rate": 0.00029207920792079207,
"logits/chosen": -3.1809646094391315,
"logits/rejected": -3.196636022508817,
"logps/chosen": -303.73348236083984,
"logps/rejected": -304.0575942993164,
"loss": 1.2173784971237183,
"mean_token_accuracy": 0.24012192711234093,
"num_tokens": 139652.0,
"rewards/accuracies": 0.1875,
"rewards/chosen": -14.823058605194092,
"rewards/margins": -0.07431718707084656,
"rewards/rejected": -14.748740911483765,
"step": 43
},
{
"entropy": 2.3116554617881775,
"epoch": 0.43781094527363185,
"grad_norm": 72.7015609741211,
"learning_rate": 0.0002871287128712871,
"logits/chosen": -3.1047942161569058,
"logits/rejected": -3.089049966469761,
"logps/chosen": -260.9189682006836,
"logps/rejected": -283.27161026000977,
"loss": 1.208611249923706,
"mean_token_accuracy": 0.22318781167268753,
"num_tokens": 142532.0,
"rewards/accuracies": 0.3125,
"rewards/chosen": -14.062894105911255,
"rewards/margins": 1.0884355306625366,
"rewards/rejected": -15.151329278945923,
"step": 44
},
{
"entropy": 2.28976833820343,
"epoch": 0.44776119402985076,
"grad_norm": Infinity,
"learning_rate": 0.00028217821782178216,
"logits/chosen": -3.254444216008772,
"logits/rejected": -3.2204778741231186,
"logps/chosen": -429.227294921875,
"logps/rejected": -428.4982452392578,
"loss": 1.3327971696853638,
"mean_token_accuracy": 0.2500062696635723,
"num_tokens": 146559.0,
"rewards/accuracies": 0.0625,
"rewards/chosen": -21.970479130744934,
"rewards/margins": -0.4409611225128174,
"rewards/rejected": -21.529518008232117,
"step": 45
},
{
"entropy": 2.065894603729248,
"epoch": 0.4577114427860697,
"grad_norm": 24.154191970825195,
"learning_rate": 0.00027722772277227726,
"logits/chosen": -3.1520684797411356,
"logits/rejected": -3.1568709494368896,
"logps/chosen": -262.4333801269531,
"logps/rejected": -261.6428565979004,
"loss": 1.616957187652588,
"mean_token_accuracy": 0.2732032462954521,
"num_tokens": 149674.0,
"rewards/accuracies": 0.125,
"rewards/chosen": -13.10332190990448,
"rewards/margins": -0.2920948714017868,
"rewards/rejected": -12.811226963996887,
"step": 46
},
{
"entropy": 1.9271219968795776,
"epoch": 0.46766169154228854,
"grad_norm": 62.61008834838867,
"learning_rate": 0.0002722772277227723,
"logits/chosen": -3.222555282865147,
"logits/rejected": -3.2629351656574213,
"logps/chosen": -255.8454475402832,
"logps/rejected": -277.0890884399414,
"loss": 1.713848352432251,
"mean_token_accuracy": 0.28745026886463165,
"num_tokens": 152868.0,
"rewards/accuracies": 0.125,
"rewards/chosen": -11.964468240737915,
"rewards/margins": -0.021911442279815674,
"rewards/rejected": -11.942557096481323,
"step": 47
},
{
"entropy": 1.9222969710826874,
"epoch": 0.47761194029850745,
"grad_norm": 24.73862648010254,
"learning_rate": 0.00026732673267326735,
"logits/chosen": -3.2014811024082013,
"logits/rejected": -3.235856109758436,
"logps/chosen": -253.8110809326172,
"logps/rejected": -279.10169982910156,
"loss": 1.1895209550857544,
"mean_token_accuracy": 0.289677482098341,
"num_tokens": 156141.0,
"rewards/accuracies": 0.1875,
"rewards/chosen": -11.022257328033447,
"rewards/margins": 0.13694772124290466,
"rewards/rejected": -11.159205198287964,
"step": 48
},
{
"entropy": 1.8481970429420471,
"epoch": 0.48756218905472637,
"grad_norm": 14.322184562683105,
"learning_rate": 0.0002623762376237624,
"logits/chosen": -3.3439408915743605,
"logits/rejected": -3.303895267821285,
"logps/chosen": -220.04124069213867,
"logps/rejected": -226.87024688720703,
"loss": 0.8866377472877502,
"mean_token_accuracy": 0.33033835887908936,
"num_tokens": 159135.0,
"rewards/accuracies": 0.125,
"rewards/chosen": -8.551008820533752,
"rewards/margins": -0.14264798164367676,
"rewards/rejected": -8.408360838890076,
"step": 49
},
{
"entropy": 1.9352594017982483,
"epoch": 0.4975124378109453,
"grad_norm": 0.009451066143810749,
"learning_rate": 0.00025742574257425744,
"logits/chosen": -3.385222989788937,
"logits/rejected": -3.3840081123920838,
"logps/chosen": -216.81492614746094,
"logps/rejected": -257.5557556152344,
"loss": 0.6498254537582397,
"mean_token_accuracy": 0.3011988401412964,
"num_tokens": 162285.0,
"rewards/accuracies": 0.0625,
"rewards/chosen": -7.384112596511841,
"rewards/margins": 1.437139630317688,
"rewards/rejected": -8.821252346038818,
"step": 50
},
{
"entropy": 1.9567635655403137,
"epoch": 0.5074626865671642,
"grad_norm": 11.31760025024414,
"learning_rate": 0.0002524752475247525,
"logits/chosen": -3.428618842247525,
"logits/rejected": -3.476428795573361,
"logps/chosen": -246.91674423217773,
"logps/rejected": -261.93321990966797,
"loss": 0.9736576676368713,
"mean_token_accuracy": 0.29628537595272064,
"num_tokens": 165657.0,
"rewards/accuracies": 0.125,
"rewards/chosen": -8.399488687515259,
"rewards/margins": 0.008383013308048248,
"rewards/rejected": -8.407871842384338,
"step": 51
},
{
"entropy": 2.0954816043376923,
"epoch": 0.5174129353233831,
"grad_norm": 7.176389217376709,
"learning_rate": 0.00024752475247524753,
"logits/chosen": -3.571719104940522,
"logits/rejected": -3.5774720027492,
"logps/chosen": -164.6639518737793,
"logps/rejected": -174.26453971862793,
"loss": 1.0176879167556763,
"mean_token_accuracy": 0.33037129044532776,
"num_tokens": 168527.0,
"rewards/accuracies": 0.125,
"rewards/chosen": -4.919166803359985,
"rewards/margins": -0.36104128509759903,
"rewards/rejected": -4.558125615119934,
"step": 52
},
{
"entropy": 2.1325119733810425,
"epoch": 0.527363184079602,
"grad_norm": 7.1155500411987305,
"learning_rate": 0.00024257425742574257,
"logits/chosen": -3.611224298480606,
"logits/rejected": -3.606798095712098,
"logps/chosen": -228.4919891357422,
"logps/rejected": -211.7003345489502,
"loss": 1.0112618207931519,
"mean_token_accuracy": 0.34222544729709625,
"num_tokens": 171891.0,
"rewards/accuracies": 0.0625,
"rewards/chosen": -4.663272202014923,
"rewards/margins": -0.35346102714538574,
"rewards/rejected": -4.309811294078827,
"step": 53
},
{
"entropy": 2.099044680595398,
"epoch": 0.5373134328358209,
"grad_norm": 4.623640537261963,
"learning_rate": 0.00023762376237623762,
"logits/chosen": -3.6421679058682925,
"logits/rejected": -3.629708488565886,
"logps/chosen": -150.8334503173828,
"logps/rejected": -156.62395095825195,
"loss": 0.8465480804443359,
"mean_token_accuracy": 0.3315627798438072,
"num_tokens": 174498.0,
"rewards/accuracies": 0.125,
"rewards/chosen": -3.7043431997299194,
"rewards/margins": 0.09302212297916412,
"rewards/rejected": -3.7973653078079224,
"step": 54
},
{
"entropy": 2.0214365124702454,
"epoch": 0.5472636815920398,
"grad_norm": 4.609769344329834,
"learning_rate": 0.0002326732673267327,
"logits/chosen": -3.6433888397539675,
"logits/rejected": -3.6304691103005715,
"logps/chosen": -198.38171768188477,
"logps/rejected": -235.6202049255371,
"loss": 0.8365243673324585,
"mean_token_accuracy": 0.39510079473257065,
"num_tokens": 178185.0,
"rewards/accuracies": 0.125,
"rewards/chosen": -3.9414217472076416,
"rewards/margins": 0.17493990063667297,
"rewards/rejected": -4.116361618041992,
"step": 55
},
{
"entropy": 2.2303199768066406,
"epoch": 0.5572139303482587,
"grad_norm": 2.9026308059692383,
"learning_rate": 0.00022772277227722774,
"logits/chosen": -3.6601714084022925,
"logits/rejected": -3.6551866016141643,
"logps/chosen": -138.404541015625,
"logps/rejected": -181.2952823638916,
"loss": 0.6974964141845703,
"mean_token_accuracy": 0.308276005089283,
"num_tokens": 181000.0,
"rewards/accuracies": 0.1875,
"rewards/chosen": -2.957142174243927,
"rewards/margins": 0.10662916302680969,
"rewards/rejected": -3.063771367073059,
"step": 56
},
{
"entropy": 2.0440548956394196,
"epoch": 0.5671641791044776,
"grad_norm": 3.176905393600464,
"learning_rate": 0.00022277227722772278,
"logits/chosen": -3.5878639508662946,
"logits/rejected": -3.5972853573972476,
"logps/chosen": -181.04140853881836,
"logps/rejected": -196.8503646850586,
"loss": 0.7555087804794312,
"mean_token_accuracy": 0.36560703814029694,
"num_tokens": 184440.0,
"rewards/accuracies": 0.125,
"rewards/chosen": -3.725131630897522,
"rewards/margins": 0.2023322656750679,
"rewards/rejected": -3.927464008331299,
"step": 57
},
{
"entropy": 2.1503366231918335,
"epoch": 0.5771144278606966,
"grad_norm": 2.925879716873169,
"learning_rate": 0.00021782178217821783,
"logits/chosen": -3.635705258630424,
"logits/rejected": -3.626571030941132,
"logps/chosen": -153.08165740966797,
"logps/rejected": -151.79789352416992,
"loss": 0.8062557578086853,
"mean_token_accuracy": 0.3421657532453537,
"num_tokens": 187161.0,
"rewards/accuracies": 0.125,
"rewards/chosen": -3.27903288602829,
"rewards/margins": -0.01948907971382141,
"rewards/rejected": -3.259543776512146,
"step": 58
},
{
"entropy": 2.067517399787903,
"epoch": 0.5870646766169154,
"grad_norm": 5.860987186431885,
"learning_rate": 0.00021287128712871287,
"logits/chosen": -3.6160732060464547,
"logits/rejected": -3.603459410032726,
"logps/chosen": -237.19454193115234,
"logps/rejected": -241.7457733154297,
"loss": 0.7830701470375061,
"mean_token_accuracy": 0.3710586279630661,
"num_tokens": 190961.0,
"rewards/accuracies": 0.125,
"rewards/chosen": -4.790164351463318,
"rewards/margins": 0.013833608478307724,
"rewards/rejected": -4.803997993469238,
"step": 59
},
{
"entropy": 2.0456930100917816,
"epoch": 0.5970149253731343,
"grad_norm": 2.530921220779419,
"learning_rate": 0.00020792079207920792,
"logits/chosen": -3.634478617453735,
"logits/rejected": -3.617604305001727,
"logps/chosen": -164.7590560913086,
"logps/rejected": -183.34884643554688,
"loss": 0.6686393022537231,
"mean_token_accuracy": 0.3322089686989784,
"num_tokens": 193853.0,
"rewards/accuracies": 0.25,
"rewards/chosen": -3.466741681098938,
"rewards/margins": 0.10381258279085159,
"rewards/rejected": -3.570554256439209,
"step": 60
},
{
"entropy": 2.0229939222335815,
"epoch": 0.6069651741293532,
"grad_norm": 1.2661631107330322,
"learning_rate": 0.000202970297029703,
"logits/chosen": -3.5366310534711625,
"logits/rejected": -3.5608453098695625,
"logps/chosen": -173.31506729125977,
"logps/rejected": -224.96598434448242,
"loss": 0.6006392240524292,
"mean_token_accuracy": 0.36497529596090317,
"num_tokens": 197089.0,
"rewards/accuracies": 0.1875,
"rewards/chosen": -3.186018943786621,
"rewards/margins": 0.6044751890003681,
"rewards/rejected": -3.790493965148926,
"step": 61
},
{
"entropy": 1.9178842902183533,
"epoch": 0.6169154228855721,
"grad_norm": 1.8906898498535156,
"learning_rate": 0.00019801980198019803,
"logits/chosen": -3.608905749310737,
"logits/rejected": -3.524314705366162,
"logps/chosen": -144.59884452819824,
"logps/rejected": -172.51303100585938,
"loss": 0.5483641028404236,
"mean_token_accuracy": 0.3645987957715988,
"num_tokens": 200171.0,
"rewards/accuracies": 0.3125,
"rewards/chosen": -2.4504005908966064,
"rewards/margins": 0.7510848864912987,
"rewards/rejected": -3.2014856338500977,
"step": 62
},
{
"entropy": 1.9568755626678467,
"epoch": 0.6268656716417911,
"grad_norm": 3.163543224334717,
"learning_rate": 0.00019306930693069308,
"logits/chosen": -3.514222002398174,
"logits/rejected": -3.5172996107979926,
"logps/chosen": -204.0835952758789,
"logps/rejected": -196.35980606079102,
"loss": 1.0338683128356934,
"mean_token_accuracy": 0.3876264691352844,
"num_tokens": 203615.0,
"rewards/accuracies": 0.0625,
"rewards/chosen": -3.8272334337234497,
"rewards/margins": -0.41473425552248955,
"rewards/rejected": -3.4124991297721863,
"step": 63
},
{
"entropy": 1.7704353034496307,
"epoch": 0.6368159203980099,
"grad_norm": 3.762464761734009,
"learning_rate": 0.00018811881188118812,
"logits/chosen": -3.58424572632331,
"logits/rejected": -3.59264863110509,
"logps/chosen": -140.27431678771973,
"logps/rejected": -139.8353385925293,
"loss": 0.8362555503845215,
"mean_token_accuracy": 0.3757285177707672,
"num_tokens": 206327.0,
"rewards/accuracies": 0.0625,
"rewards/chosen": -2.7881844639778137,
"rewards/margins": -0.17374923825263977,
"rewards/rejected": -2.6144352555274963,
"step": 64
},
{
"entropy": 1.8312126398086548,
"epoch": 0.6467661691542289,
"grad_norm": 1.7864776849746704,
"learning_rate": 0.00018316831683168317,
"logits/chosen": -3.5429987235441445,
"logits/rejected": -3.564540953208156,
"logps/chosen": -172.8157958984375,
"logps/rejected": -174.86798095703125,
"loss": 0.6336662769317627,
"mean_token_accuracy": 0.38997988402843475,
"num_tokens": 209337.0,
"rewards/accuracies": 0.1875,
"rewards/chosen": -3.506571590900421,
"rewards/margins": 0.20759320259094238,
"rewards/rejected": -3.7141648530960083,
"step": 65
},
{
"entropy": 1.7894618809223175,
"epoch": 0.6567164179104478,
"grad_norm": 18.43994140625,
"learning_rate": 0.0001782178217821782,
"logits/chosen": -3.5626331625353282,
"logits/rejected": -3.558179466696584,
"logps/chosen": -216.60082626342773,
"logps/rejected": -254.75148391723633,
"loss": 0.7142460942268372,
"mean_token_accuracy": 0.3956107571721077,
"num_tokens": 212880.0,
"rewards/accuracies": 0.3125,
"rewards/chosen": -4.492651045322418,
"rewards/margins": 0.7144668847322464,
"rewards/rejected": -5.207117915153503,
"step": 66
},
{
"entropy": 1.8538159728050232,
"epoch": 0.6666666666666666,
"grad_norm": 14.287700653076172,
"learning_rate": 0.00017326732673267326,
"logits/chosen": -3.6201702161488374,
"logits/rejected": -3.635657981136088,
"logps/chosen": -208.26702499389648,
"logps/rejected": -188.26987075805664,
"loss": 1.3694218397140503,
"mean_token_accuracy": 0.37898362427949905,
"num_tokens": 216222.0,
"rewards/accuracies": 0.1875,
"rewards/chosen": -4.368560254573822,
"rewards/margins": -0.7072555869817734,
"rewards/rejected": -3.6613046526908875,
"step": 67
},
{
"entropy": 1.788241446018219,
"epoch": 0.6766169154228856,
"grad_norm": 7.528784275054932,
"learning_rate": 0.00016831683168316833,
"logits/chosen": -3.5787578586561186,
"logits/rejected": -3.5687125724199507,
"logps/chosen": -166.56489372253418,
"logps/rejected": -154.00261116027832,
"loss": 1.1346752643585205,
"mean_token_accuracy": 0.3375133126974106,
"num_tokens": 219010.0,
"rewards/accuracies": 0.0625,
"rewards/chosen": -3.564320147037506,
"rewards/margins": -0.4889891818165779,
"rewards/rejected": -3.0753310918807983,
"step": 68
},
{
"entropy": 1.8404236435890198,
"epoch": 0.6865671641791045,
"grad_norm": 4.7393646240234375,
"learning_rate": 0.00016336633663366338,
"logits/chosen": -3.5680984551891988,
"logits/rejected": -3.578736825609027,
"logps/chosen": -151.18361282348633,
"logps/rejected": -150.8898162841797,
"loss": 0.9233277440071106,
"mean_token_accuracy": 0.40693292766809464,
"num_tokens": 221766.0,
"rewards/accuracies": 0.25,
"rewards/chosen": -3.6996166706085205,
"rewards/margins": -0.023674920201301575,
"rewards/rejected": -3.67594176530838,
"step": 69
},
{
"entropy": 1.8105555176734924,
"epoch": 0.6965174129353234,
"grad_norm": 2.983847141265869,
"learning_rate": 0.00015841584158415842,
"logits/chosen": -3.593700880438685,
"logits/rejected": -3.608964660947262,
"logps/chosen": -146.78189277648926,
"logps/rejected": -164.89960098266602,
"loss": 0.6955384612083435,
"mean_token_accuracy": 0.37945864349603653,
"num_tokens": 224529.0,
"rewards/accuracies": 0.1875,
"rewards/chosen": -3.2332761883735657,
"rewards/margins": 0.1823255941271782,
"rewards/rejected": -3.415601670742035,
"step": 70
},
{
"entropy": 1.7670131027698517,
"epoch": 0.7064676616915423,
"grad_norm": 2.6227941513061523,
"learning_rate": 0.00015346534653465347,
"logits/chosen": -3.6208933497371607,
"logits/rejected": -3.627287218750385,
"logps/chosen": -171.93946075439453,
"logps/rejected": -174.2279167175293,
"loss": 0.6700834035873413,
"mean_token_accuracy": 0.388210229575634,
"num_tokens": 227740.0,
"rewards/accuracies": 0.1875,
"rewards/chosen": -3.4097407460212708,
"rewards/margins": 0.34128284454345703,
"rewards/rejected": -3.751023590564728,
"step": 71
},
{
"entropy": 1.8676961362361908,
"epoch": 0.7164179104477612,
"grad_norm": 2.375143527984619,
"learning_rate": 0.0001485148514851485,
"logits/chosen": -3.6235203552351987,
"logits/rejected": -3.63041797805766,
"logps/chosen": -182.70703506469727,
"logps/rejected": -204.6234588623047,
"loss": 0.6822044849395752,
"mean_token_accuracy": 0.37428663671016693,
"num_tokens": 231122.0,
"rewards/accuracies": 0.25,
"rewards/chosen": -3.4435550570487976,
"rewards/margins": 0.35684891045093536,
"rewards/rejected": -3.8004040122032166,
"step": 72
},
{
"entropy": 1.827594518661499,
"epoch": 0.7263681592039801,
"grad_norm": 0.6919447779655457,
"learning_rate": 0.00014356435643564356,
"logits/chosen": -3.6002415933798546,
"logits/rejected": -3.5960349776366445,
"logps/chosen": -144.23443603515625,
"logps/rejected": -201.61253356933594,
"loss": 0.5005671977996826,
"mean_token_accuracy": 0.339895598590374,
"num_tokens": 234134.0,
"rewards/accuracies": 0.3125,
"rewards/chosen": -3.2676995396614075,
"rewards/margins": 1.224392369389534,
"rewards/rejected": -4.4920918345451355,
"step": 73
},
{
"entropy": 1.748055875301361,
"epoch": 0.736318407960199,
"grad_norm": 2.5934488773345947,
"learning_rate": 0.00013861386138613863,
"logits/chosen": -3.6360650808702615,
"logits/rejected": -3.5972090839376483,
"logps/chosen": -157.06155395507812,
"logps/rejected": -154.848783493042,
"loss": 0.7558881044387817,
"mean_token_accuracy": 0.38590408116579056,
"num_tokens": 237300.0,
"rewards/accuracies": 0.25,
"rewards/chosen": -3.0302443504333496,
"rewards/margins": 0.035845797508955,
"rewards/rejected": -3.066090077161789,
"step": 74
},
{
"entropy": 1.684916764497757,
"epoch": 0.746268656716418,
"grad_norm": 2.008575677871704,
"learning_rate": 0.00013366336633663367,
"logits/chosen": -3.561989163656944,
"logits/rejected": -3.56625081249695,
"logps/chosen": -185.2477912902832,
"logps/rejected": -220.90989685058594,
"loss": 0.6018548607826233,
"mean_token_accuracy": 0.41026031970977783,
"num_tokens": 240884.0,
"rewards/accuracies": 0.25,
"rewards/chosen": -3.9729064106941223,
"rewards/margins": 0.33660563081502914,
"rewards/rejected": -4.30951201915741,
"step": 75
},
{
"entropy": 1.702199250459671,
"epoch": 0.7562189054726368,
"grad_norm": 4.6139235496521,
"learning_rate": 0.00012871287128712872,
"logits/chosen": -3.5974828000994803,
"logits/rejected": -3.604220855457153,
"logps/chosen": -207.3554458618164,
"logps/rejected": -214.70018196105957,
"loss": 0.9295954704284668,
"mean_token_accuracy": 0.4100513458251953,
"num_tokens": 244380.0,
"rewards/accuracies": 0.125,
"rewards/chosen": -4.185361862182617,
"rewards/margins": -0.16199729591608047,
"rewards/rejected": -4.023364543914795,
"step": 76
},
{
"entropy": 1.8483723402023315,
"epoch": 0.7661691542288557,
"grad_norm": 4.52067756652832,
"learning_rate": 0.00012376237623762376,
"logits/chosen": -3.615742114915774,
"logits/rejected": -3.630499670149322,
"logps/chosen": -183.99293518066406,
"logps/rejected": -172.64349746704102,
"loss": 0.9373040199279785,
"mean_token_accuracy": 0.34607332944869995,
"num_tokens": 247230.0,
"rewards/accuracies": 0.125,
"rewards/chosen": -3.952219247817993,
"rewards/margins": -0.03562957048416138,
"rewards/rejected": -3.9165897369384766,
"step": 77
},
{
"entropy": 1.6928546726703644,
"epoch": 0.7761194029850746,
"grad_norm": 3.354624032974243,
"learning_rate": 0.00011881188118811881,
"logits/chosen": -3.6518346370167287,
"logits/rejected": -3.6789896636578354,
"logps/chosen": -170.9540023803711,
"logps/rejected": -189.51920700073242,
"loss": 0.6489702463150024,
"mean_token_accuracy": 0.41937771439552307,
"num_tokens": 250533.0,
"rewards/accuracies": 0.3125,
"rewards/chosen": -3.277673453092575,
"rewards/margins": 0.238661028444767,
"rewards/rejected": -3.5163345336914062,
"step": 78
},
{
"entropy": 1.7784149944782257,
"epoch": 0.7860696517412935,
"grad_norm": 2.8312323093414307,
"learning_rate": 0.00011386138613861387,
"logits/chosen": -3.678140706310251,
"logits/rejected": -3.6888157082532564,
"logps/chosen": -171.8286895751953,
"logps/rejected": -217.10009002685547,
"loss": 0.6263619065284729,
"mean_token_accuracy": 0.36294757574796677,
"num_tokens": 253574.0,
"rewards/accuracies": 0.1875,
"rewards/chosen": -4.541302859783173,
"rewards/margins": 0.7501096352934837,
"rewards/rejected": -5.291412353515625,
"step": 79
},
{
"entropy": 1.6919234693050385,
"epoch": 0.7960199004975125,
"grad_norm": 0.7620548605918884,
"learning_rate": 0.00010891089108910891,
"logits/chosen": -3.7173505595829215,
"logits/rejected": -3.7161475484288866,
"logps/chosen": -222.93682098388672,
"logps/rejected": -222.69513702392578,
"loss": 0.6783262491226196,
"mean_token_accuracy": 0.385500892996788,
"num_tokens": 257005.0,
"rewards/accuracies": 0.0625,
"rewards/chosen": -4.736607253551483,
"rewards/margins": 0.03428628295660019,
"rewards/rejected": -4.770893633365631,
"step": 80
},
{
"entropy": 1.6837327778339386,
"epoch": 0.8059701492537313,
"grad_norm": 3.8109116554260254,
"learning_rate": 0.00010396039603960396,
"logits/chosen": -3.744877125633101,
"logits/rejected": -3.7239091993002296,
"logps/chosen": -233.0377197265625,
"logps/rejected": -260.4305229187012,
"loss": 0.6774035692214966,
"mean_token_accuracy": 0.37072674185037613,
"num_tokens": 261021.0,
"rewards/accuracies": 0.3125,
"rewards/chosen": -4.784064710140228,
"rewards/margins": 0.45506689697504044,
"rewards/rejected": -5.239131569862366,
"step": 81
},
{
"entropy": 1.6132145822048187,
"epoch": 0.8159203980099502,
"grad_norm": 4.082960605621338,
"learning_rate": 9.900990099009902e-05,
"logits/chosen": -3.6440604838830586,
"logits/rejected": -3.6654163244894704,
"logps/chosen": -196.36359786987305,
"logps/rejected": -189.5399055480957,
"loss": 0.8034707307815552,
"mean_token_accuracy": 0.4102801978588104,
"num_tokens": 264256.0,
"rewards/accuracies": 0.0,
"rewards/chosen": -4.631353974342346,
"rewards/margins": -0.18269547820091248,
"rewards/rejected": -4.448658347129822,
"step": 82
},
{
"entropy": 1.642210841178894,
"epoch": 0.8258706467661692,
"grad_norm": 3.894784688949585,
"learning_rate": 9.405940594059406e-05,
"logits/chosen": -3.703474447193526,
"logits/rejected": -3.711402166511322,
"logps/chosen": -250.06790161132812,
"logps/rejected": -248.12013244628906,
"loss": 0.8837608098983765,
"mean_token_accuracy": 0.38086505979299545,
"num_tokens": 268126.0,
"rewards/accuracies": 0.0,
"rewards/chosen": -5.739135384559631,
"rewards/margins": -0.24859696626663208,
"rewards/rejected": -5.490538477897644,
"step": 83
},
{
"entropy": 1.6012614071369171,
"epoch": 0.835820895522388,
"grad_norm": 3.3155040740966797,
"learning_rate": 8.91089108910891e-05,
"logits/chosen": -3.64063474797791,
"logits/rejected": -3.6373772644695217,
"logps/chosen": -133.76382446289062,
"logps/rejected": -143.0687713623047,
"loss": 0.8610319495201111,
"mean_token_accuracy": 0.3686061054468155,
"num_tokens": 270528.0,
"rewards/accuracies": 0.125,
"rewards/chosen": -3.8289989233016968,
"rewards/margins": -0.20909389853477478,
"rewards/rejected": -3.6199050545692444,
"step": 84
},
{
"entropy": 1.6356386542320251,
"epoch": 0.845771144278607,
"grad_norm": 6.067594051361084,
"learning_rate": 8.415841584158417e-05,
"logits/chosen": -3.6797450831804857,
"logits/rejected": -3.69026861592658,
"logps/chosen": -190.2202491760254,
"logps/rejected": -178.37620735168457,
"loss": 0.8410797715187073,
"mean_token_accuracy": 0.3780713751912117,
"num_tokens": 273971.0,
"rewards/accuracies": 0.25,
"rewards/chosen": -4.713983058929443,
"rewards/margins": -0.10549770295619965,
"rewards/rejected": -4.608485221862793,
"step": 85
},
{
"entropy": 1.6179614663124084,
"epoch": 0.8557213930348259,
"grad_norm": 2.606879949569702,
"learning_rate": 7.920792079207921e-05,
"logits/chosen": -3.714054792664533,
"logits/rejected": -3.7162360998405983,
"logps/chosen": -187.36741065979004,
"logps/rejected": -188.57626342773438,
"loss": 0.6618068814277649,
"mean_token_accuracy": 0.40294698625802994,
"num_tokens": 277206.0,
"rewards/accuracies": 0.25,
"rewards/chosen": -4.31531286239624,
"rewards/margins": 0.24175719916820526,
"rewards/rejected": -4.557070016860962,
"step": 86
},
{
"entropy": 1.6011567115783691,
"epoch": 0.8656716417910447,
"grad_norm": 2.2501895427703857,
"learning_rate": 7.425742574257426e-05,
"logits/chosen": -3.674183280463941,
"logits/rejected": -3.6626142261745214,
"logps/chosen": -153.10731315612793,
"logps/rejected": -150.5159568786621,
"loss": 0.6958032250404358,
"mean_token_accuracy": 0.36470960080623627,
"num_tokens": 279780.0,
"rewards/accuracies": 0.1875,
"rewards/chosen": -4.18908166885376,
"rewards/margins": 0.0875798761844635,
"rewards/rejected": -4.276661396026611,
"step": 87
},
{
"entropy": 1.6125659942626953,
"epoch": 0.8756218905472637,
"grad_norm": 5.258417129516602,
"learning_rate": 6.930693069306931e-05,
"logits/chosen": -3.7041569457218415,
"logits/rejected": -3.7053109725079976,
"logps/chosen": -231.12665176391602,
"logps/rejected": -218.75960540771484,
"loss": 0.7343534827232361,
"mean_token_accuracy": 0.3844173774123192,
"num_tokens": 283242.0,
"rewards/accuracies": 0.0625,
"rewards/chosen": -5.803511381149292,
"rewards/margins": -0.03953322768211365,
"rewards/rejected": -5.7639782428741455,
"step": 88
},
{
"entropy": 1.655126303434372,
"epoch": 0.8855721393034826,
"grad_norm": 3.7742555141448975,
"learning_rate": 6.435643564356436e-05,
"logits/chosen": -3.698541244359123,
"logits/rejected": -3.7294442870484055,
"logps/chosen": -184.96338653564453,
"logps/rejected": -195.39525604248047,
"loss": 0.7234901785850525,
"mean_token_accuracy": 0.3443598970770836,
"num_tokens": 286250.0,
"rewards/accuracies": 0.0625,
"rewards/chosen": -4.933422684669495,
"rewards/margins": 0.19522131979465485,
"rewards/rejected": -5.128643989562988,
"step": 89
},
{
"entropy": 1.564221054315567,
"epoch": 0.8955223880597015,
"grad_norm": 2.220445394515991,
"learning_rate": 5.9405940594059404e-05,
"logits/chosen": -3.7234489777398343,
"logits/rejected": -3.695775704686508,
"logps/chosen": -200.81872940063477,
"logps/rejected": -230.38358306884766,
"loss": 0.6132370233535767,
"mean_token_accuracy": 0.37841925024986267,
"num_tokens": 290217.0,
"rewards/accuracies": 0.1875,
"rewards/chosen": -4.426435708999634,
"rewards/margins": 0.2670505791902542,
"rewards/rejected": -4.693486332893372,
"step": 90
},
{
"entropy": 1.563878208398819,
"epoch": 0.9054726368159204,
"grad_norm": 1.4845564365386963,
"learning_rate": 5.4455445544554456e-05,
"logits/chosen": -3.675358395963568,
"logits/rejected": -3.666738373474767,
"logps/chosen": -255.80266189575195,
"logps/rejected": -266.2362861633301,
"loss": 0.658227801322937,
"mean_token_accuracy": 0.3786882683634758,
"num_tokens": 294045.0,
"rewards/accuracies": 0.0625,
"rewards/chosen": -5.8976744413375854,
"rewards/margins": 0.33874283730983734,
"rewards/rejected": -6.2364174127578735,
"step": 91
},
{
"entropy": 1.6665741205215454,
"epoch": 0.9154228855721394,
"grad_norm": 6.198132038116455,
"learning_rate": 4.950495049504951e-05,
"logits/chosen": -3.6663319924446323,
"logits/rejected": -3.7296222855776184,
"logps/chosen": -158.00820922851562,
"logps/rejected": -178.97606658935547,
"loss": 1.0925066471099854,
"mean_token_accuracy": 0.3629995733499527,
"num_tokens": 296857.0,
"rewards/accuracies": 0.3125,
"rewards/chosen": -3.999560624361038,
"rewards/margins": 0.033911485224962234,
"rewards/rejected": -4.033472061157227,
"step": 92
},
{
"entropy": 1.644345223903656,
"epoch": 0.9253731343283582,
"grad_norm": 2.0987441539764404,
"learning_rate": 4.455445544554455e-05,
"logits/chosen": -3.6583529962844343,
"logits/rejected": -3.6667724616445185,
"logps/chosen": -195.10536193847656,
"logps/rejected": -285.5465202331543,
"loss": 0.5438169240951538,
"mean_token_accuracy": 0.42512599378824234,
"num_tokens": 300856.0,
"rewards/accuracies": 0.3125,
"rewards/chosen": -4.106789469718933,
"rewards/margins": 0.9598179310560226,
"rewards/rejected": -5.066607356071472,
"step": 93
},
{
"entropy": 1.5577265322208405,
"epoch": 0.9353233830845771,
"grad_norm": 4.220263957977295,
"learning_rate": 3.9603960396039605e-05,
"logits/chosen": -3.6748759341594157,
"logits/rejected": -3.729366666919669,
"logps/chosen": -210.3987045288086,
"logps/rejected": -252.40514373779297,
"loss": 0.839250385761261,
"mean_token_accuracy": 0.40358515083789825,
"num_tokens": 304623.0,
"rewards/accuracies": 0.1875,
"rewards/chosen": -4.8432682156562805,
"rewards/margins": 0.40834885090589523,
"rewards/rejected": -5.251616835594177,
"step": 94
},
{
"entropy": 1.729375958442688,
"epoch": 0.945273631840796,
"grad_norm": 2.3955490589141846,
"learning_rate": 3.465346534653466e-05,
"logits/chosen": -3.658530322956607,
"logits/rejected": -3.6282934600825714,
"logps/chosen": -268.2776565551758,
"logps/rejected": -297.23538970947266,
"loss": 0.6312628984451294,
"mean_token_accuracy": 0.36635589599609375,
"num_tokens": 308746.0,
"rewards/accuracies": 0.1875,
"rewards/chosen": -5.5482582449913025,
"rewards/margins": 0.396299347281456,
"rewards/rejected": -5.944557547569275,
"step": 95
},
{
"entropy": 1.6423245668411255,
"epoch": 0.9552238805970149,
"grad_norm": 2.077113151550293,
"learning_rate": 2.9702970297029702e-05,
"logits/chosen": -3.592531715367838,
"logits/rejected": -3.6782985785875457,
"logps/chosen": -203.75262069702148,
"logps/rejected": -228.7814712524414,
"loss": 0.5487721562385559,
"mean_token_accuracy": 0.4399268254637718,
"num_tokens": 312417.0,
"rewards/accuracies": 0.375,
"rewards/chosen": -3.5327599346637726,
"rewards/margins": 0.6648375540971756,
"rewards/rejected": -4.197597444057465,
"step": 96
},
{
"entropy": 1.763981431722641,
"epoch": 0.9651741293532339,
"grad_norm": 2.8148458003997803,
"learning_rate": 2.4752475247524754e-05,
"logits/chosen": -3.667448573612207,
"logits/rejected": -3.6800848210863935,
"logps/chosen": -160.70482063293457,
"logps/rejected": -204.31268310546875,
"loss": 0.6979650259017944,
"mean_token_accuracy": 0.37325895577669144,
"num_tokens": 315621.0,
"rewards/accuracies": 0.25,
"rewards/chosen": -3.5530824065208435,
"rewards/margins": 0.3659425973892212,
"rewards/rejected": -3.91902494430542,
"step": 97
},
{
"entropy": 1.8011619448661804,
"epoch": 0.9751243781094527,
"grad_norm": 2.6068601608276367,
"learning_rate": 1.9801980198019803e-05,
"logits/chosen": -3.7408815612054003,
"logits/rejected": -3.7402128550609928,
"logps/chosen": -191.71960067749023,
"logps/rejected": -189.78856658935547,
"loss": 0.6842182278633118,
"mean_token_accuracy": 0.36129410564899445,
"num_tokens": 318586.0,
"rewards/accuracies": 0.25,
"rewards/chosen": -4.195027410984039,
"rewards/margins": 0.11620645970106125,
"rewards/rejected": -4.311233758926392,
"step": 98
},
{
"entropy": 1.663473755121231,
"epoch": 0.9850746268656716,
"grad_norm": 2.518073797225952,
"learning_rate": 1.4851485148514851e-05,
"logits/chosen": -3.670500626902857,
"logits/rejected": -3.652272407139832,
"logps/chosen": -211.21680641174316,
"logps/rejected": -222.02769088745117,
"loss": 0.7135859727859497,
"mean_token_accuracy": 0.3450269028544426,
"num_tokens": 321874.0,
"rewards/accuracies": 0.0625,
"rewards/chosen": -5.294373691082001,
"rewards/margins": -0.0056114718317985535,
"rewards/rejected": -5.288762152194977,
"step": 99
},
{
"entropy": 1.6547743380069733,
"epoch": 0.9950248756218906,
"grad_norm": 1.6882256269454956,
"learning_rate": 9.900990099009901e-06,
"logits/chosen": -3.680744065646073,
"logits/rejected": -3.708333845446694,
"logps/chosen": -186.25439071655273,
"logps/rejected": -214.3514518737793,
"loss": 0.638218879699707,
"mean_token_accuracy": 0.34647873789072037,
"num_tokens": 325099.0,
"rewards/accuracies": 0.1875,
"rewards/chosen": -4.351440787315369,
"rewards/margins": 0.6065050661563873,
"rewards/rejected": -4.957945823669434,
"step": 100
},
{
"entropy": 1.6515916585922241,
"epoch": 1.0,
"grad_norm": 0.471053808927536,
"learning_rate": 4.950495049504951e-06,
"logits/chosen": -3.6315787960064374,
"logits/rejected": -3.648785787208058,
"logps/chosen": -136.69910430908203,
"logps/rejected": -147.1917724609375,
"loss": 0.5413510799407959,
"mean_token_accuracy": 0.3588639050722122,
"num_tokens": 326333.0,
"rewards/accuracies": 0.25,
"rewards/chosen": -3.114208221435547,
"rewards/margins": 0.6123562753200531,
"rewards/rejected": -3.726564407348633,
"step": 101
}
],
"logging_steps": 1,
"max_steps": 101,
"num_input_tokens_seen": 0,
"num_train_epochs": 1,
"save_steps": 500,
"stateful_callbacks": {
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": true,
"should_training_stop": true
},
"attributes": {}
}
},
"total_flos": 3309706881761280.0,
"train_batch_size": 4,
"trial_name": null,
"trial_params": null
}