Lumma-0.6B-Instruct / trainer_state.json
vishesh-t27's picture
Upload folder using huggingface_hub
56ef8fb verified
Raw
History Blame Contribute Delete
130 kB
{
"best_global_step": null,
"best_metric": null,
"best_model_checkpoint": null,
"epoch": 0.1254115065057219,
"eval_steps": 500,
"global_step": 200,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"entropy": 1.171857863664627,
"epoch": 0.0006270575325286095,
"grad_norm": 36.12955856323242,
"learning_rate": 0.0,
"logits/chosen": -16.618545689498976,
"logits/rejected": -19.895854701940685,
"logps/chosen": -618.4926280975342,
"logps/rejected": -544.1511726379395,
"loss": 1.0,
"mean_token_accuracy": 0.7207779660820961,
"num_tokens": 44742.0,
"rewards/accuracies": 0.0,
"rewards/chosen": 0.0,
"rewards/margins": 0.0,
"rewards/rejected": 0.0,
"step": 1
},
{
"entropy": 1.3859521597623825,
"epoch": 0.001254115065057219,
"grad_norm": 35.26237487792969,
"learning_rate": 1e-08,
"logits/chosen": -16.148485680429634,
"logits/rejected": -15.444903538915032,
"logps/chosen": -789.9899635314941,
"logps/rejected": -629.6869964599609,
"loss": 1.0,
"mean_token_accuracy": 0.6869945079088211,
"num_tokens": 96877.0,
"rewards/accuracies": 0.0,
"rewards/chosen": 0.0,
"rewards/margins": 0.0,
"rewards/rejected": 0.0,
"step": 2
},
{
"entropy": 1.1979895681142807,
"epoch": 0.0018811725975858284,
"grad_norm": 41.65127944946289,
"learning_rate": 2e-08,
"logits/chosen": -18.29156918013904,
"logits/rejected": -19.65692519211939,
"logps/chosen": -1245.2266998291016,
"logps/rejected": -570.8414497375488,
"loss": 1.0063536167144775,
"mean_token_accuracy": 0.6914148852229118,
"num_tokens": 168920.0,
"rewards/accuracies": 0.46875,
"rewards/chosen": -0.017706198908854276,
"rewards/margins": -0.025545110227540135,
"rewards/rejected": 0.007838911202270538,
"step": 3
},
{
"entropy": 1.1795232072472572,
"epoch": 0.002508230130114438,
"grad_norm": 44.819602966308594,
"learning_rate": 3e-08,
"logits/chosen": -20.724100083229605,
"logits/rejected": -19.704480662994772,
"logps/chosen": -1142.84916305542,
"logps/rejected": -649.1872062683105,
"loss": 1.0045382976531982,
"mean_token_accuracy": 0.7210699692368507,
"num_tokens": 243342.0,
"rewards/accuracies": 0.46875,
"rewards/chosen": 0.00683369068428874,
"rewards/margins": -0.01820890378439799,
"rewards/rejected": 0.025042592780664563,
"step": 4
},
{
"entropy": 1.2270928248763084,
"epoch": 0.0031352876626430477,
"grad_norm": 32.66579055786133,
"learning_rate": 4e-08,
"logits/chosen": -16.499294980475682,
"logits/rejected": -17.05921506779658,
"logps/chosen": -709.8800754547119,
"logps/rejected": -586.3846015930176,
"loss": 1.0000782012939453,
"mean_token_accuracy": 0.7035035043954849,
"num_tokens": 295956.0,
"rewards/accuracies": 0.53125,
"rewards/chosen": -0.004917382728308439,
"rewards/margins": -0.00028197653591632843,
"rewards/rejected": -0.004635405610315502,
"step": 5
},
{
"entropy": 0.8437139950692654,
"epoch": 0.003762345195171657,
"grad_norm": 35.4331169128418,
"learning_rate": 5e-08,
"logits/chosen": -21.37335490682356,
"logits/rejected": -21.437480680261856,
"logps/chosen": -284.04754638671875,
"logps/rejected": -445.4689540863037,
"loss": 0.9983432292938232,
"mean_token_accuracy": 0.8082250654697418,
"num_tokens": 342091.0,
"rewards/accuracies": 0.53125,
"rewards/chosen": 0.01554340252187103,
"rewards/margins": 0.0067013868829235435,
"rewards/rejected": 0.008842015580739826,
"step": 6
},
{
"entropy": 1.0479743406176567,
"epoch": 0.004389402727700266,
"grad_norm": 37.445518493652344,
"learning_rate": 6e-08,
"logits/chosen": -18.649493652023672,
"logits/rejected": -18.4066487416478,
"logps/chosen": -805.4484777450562,
"logps/rejected": -680.746976852417,
"loss": 0.9999387264251709,
"mean_token_accuracy": 0.7536595985293388,
"num_tokens": 402856.0,
"rewards/accuracies": 0.625,
"rewards/chosen": 0.002710643340833485,
"rewards/margins": 0.00014570658095180988,
"rewards/rejected": 0.0025649368471931666,
"step": 7
},
{
"entropy": 0.9191301837563515,
"epoch": 0.005016460260228876,
"grad_norm": 38.56687927246094,
"learning_rate": 7e-08,
"logits/chosen": -23.125927299845493,
"logits/rejected": -18.183520901420447,
"logps/chosen": -924.5588388442993,
"logps/rejected": -373.86534118652344,
"loss": 0.9900327324867249,
"mean_token_accuracy": 0.7644752189517021,
"num_tokens": 466828.0,
"rewards/accuracies": 0.59375,
"rewards/chosen": 0.01720759950694628,
"rewards/margins": 0.04020594718167558,
"rewards/rejected": -0.02299834630684927,
"step": 8
},
{
"entropy": 0.9575163498520851,
"epoch": 0.005643517792757485,
"grad_norm": 40.65217590332031,
"learning_rate": 8e-08,
"logits/chosen": -21.412901522784708,
"logits/rejected": -21.05138834665733,
"logps/chosen": -816.7314529418945,
"logps/rejected": -663.6353340148926,
"loss": 1.0026217699050903,
"mean_token_accuracy": 0.771336242556572,
"num_tokens": 527777.0,
"rewards/accuracies": 0.4375,
"rewards/chosen": -0.005182235909160227,
"rewards/margins": -0.010497396113350987,
"rewards/rejected": 0.005315160844475031,
"step": 9
},
{
"entropy": 1.193418636918068,
"epoch": 0.006270575325286095,
"grad_norm": 42.18134689331055,
"learning_rate": 9e-08,
"logits/chosen": -20.675864147312936,
"logits/rejected": -20.81446933923923,
"logps/chosen": -905.0363216400146,
"logps/rejected": -529.3571662902832,
"loss": 1.0143247842788696,
"mean_token_accuracy": 0.7211106270551682,
"num_tokens": 582379.0,
"rewards/accuracies": 0.34375,
"rewards/chosen": -0.04024720628513023,
"rewards/margins": -0.05793563392944634,
"rewards/rejected": 0.01768842909950763,
"step": 10
},
{
"entropy": 1.0013729706406593,
"epoch": 0.006897632857814705,
"grad_norm": 26.49334144592285,
"learning_rate": 1e-07,
"logits/chosen": -18.441954576827186,
"logits/rejected": -20.784630543895993,
"logps/chosen": -532.7153358459473,
"logps/rejected": -424.26265144348145,
"loss": 0.9981816411018372,
"mean_token_accuracy": 0.7596741318702698,
"num_tokens": 629715.0,
"rewards/accuracies": 0.53125,
"rewards/chosen": 0.00034768966725096107,
"rewards/margins": 0.007268631597980857,
"rewards/rejected": -0.006920939544215798,
"step": 11
},
{
"entropy": 1.0685330666601658,
"epoch": 0.007524690390343314,
"grad_norm": 34.10297393798828,
"learning_rate": 1.0999999999999999e-07,
"logits/chosen": -20.029515190554566,
"logits/rejected": -21.2224080516646,
"logps/chosen": -728.1428518295288,
"logps/rejected": -420.13951873779297,
"loss": 0.9948853850364685,
"mean_token_accuracy": 0.7521882280707359,
"num_tokens": 675406.0,
"rewards/accuracies": 0.59375,
"rewards/chosen": -0.010362100991187617,
"rewards/margins": 0.020601681084372103,
"rewards/rejected": -0.030963782221078873,
"step": 12
},
{
"entropy": 1.0431296452879906,
"epoch": 0.008151747922871924,
"grad_norm": 26.776187896728516,
"learning_rate": 1.2e-07,
"logits/chosen": -19.538335123973816,
"logits/rejected": -20.38955248873754,
"logps/chosen": -445.5426654815674,
"logps/rejected": -416.24525260925293,
"loss": 0.997660756111145,
"mean_token_accuracy": 0.7694718763232231,
"num_tokens": 722623.0,
"rewards/accuracies": 0.5625,
"rewards/chosen": 0.010003616625908762,
"rewards/margins": 0.009433707047719508,
"rewards/rejected": 0.0005699098983313888,
"step": 13
},
{
"entropy": 1.328450158238411,
"epoch": 0.008778805455400532,
"grad_norm": 40.44959259033203,
"learning_rate": 1.3e-07,
"logits/chosen": -16.50173976340228,
"logits/rejected": -18.966777530094504,
"logps/chosen": -1086.8657112121582,
"logps/rejected": -677.222972869873,
"loss": 0.9905858039855957,
"mean_token_accuracy": 0.6911511719226837,
"num_tokens": 786297.0,
"rewards/accuracies": 0.6875,
"rewards/chosen": 0.018621409428305924,
"rewards/margins": 0.03770919982343912,
"rewards/rejected": -0.01908779090445023,
"step": 14
},
{
"entropy": 1.0233074873685837,
"epoch": 0.009405862987929142,
"grad_norm": 28.252763748168945,
"learning_rate": 1.4e-07,
"logits/chosen": -17.86138401016042,
"logits/rejected": -19.831209346381634,
"logps/chosen": -449.9010829925537,
"logps/rejected": -492.7903289794922,
"loss": 1.0015244483947754,
"mean_token_accuracy": 0.7536996155977249,
"num_tokens": 837006.0,
"rewards/accuracies": 0.53125,
"rewards/chosen": 0.0008059862302616239,
"rewards/margins": -0.006120585021562874,
"rewards/rejected": 0.006926572299562395,
"step": 15
},
{
"entropy": 1.1438564285635948,
"epoch": 0.010032920520457752,
"grad_norm": 39.57615280151367,
"learning_rate": 1.5e-07,
"logits/chosen": -17.861874499690074,
"logits/rejected": -19.590980097470435,
"logps/chosen": -791.6395130157471,
"logps/rejected": -567.6202964782715,
"loss": 0.9942368268966675,
"mean_token_accuracy": 0.7436006516218185,
"num_tokens": 896266.0,
"rewards/accuracies": 0.46875,
"rewards/chosen": 0.008153757720720023,
"rewards/margins": 0.023181513650342822,
"rewards/rejected": -0.015027755754999816,
"step": 16
},
{
"entropy": 1.1797396391630173,
"epoch": 0.010659978052986362,
"grad_norm": 31.603225708007812,
"learning_rate": 1.6e-07,
"logits/chosen": -16.27227861739119,
"logits/rejected": -20.263959422316383,
"logps/chosen": -687.8001708984375,
"logps/rejected": -614.8188095092773,
"loss": 1.00355064868927,
"mean_token_accuracy": 0.7303128838539124,
"num_tokens": 962374.0,
"rewards/accuracies": 0.53125,
"rewards/chosen": -0.0015672160079702735,
"rewards/margins": -0.014266991434851661,
"rewards/rejected": 0.012699775630608201,
"step": 17
},
{
"entropy": 0.9821090400218964,
"epoch": 0.01128703558551497,
"grad_norm": 30.358339309692383,
"learning_rate": 1.7000000000000001e-07,
"logits/chosen": -19.800772516773982,
"logits/rejected": -17.959288041851217,
"logps/chosen": -607.3202495574951,
"logps/rejected": -534.6925010681152,
"loss": 1.002077579498291,
"mean_token_accuracy": 0.7688523679971695,
"num_tokens": 1016007.0,
"rewards/accuracies": 0.5625,
"rewards/chosen": -0.0275348040740937,
"rewards/margins": -0.008413461735472083,
"rewards/rejected": -0.019121342920698225,
"step": 18
},
{
"entropy": 1.2196400687098503,
"epoch": 0.01191409311804358,
"grad_norm": 37.30662536621094,
"learning_rate": 1.8e-07,
"logits/chosen": -17.72504789763709,
"logits/rejected": -16.12664834863506,
"logps/chosen": -813.8953742980957,
"logps/rejected": -505.71807956695557,
"loss": 1.004115343093872,
"mean_token_accuracy": 0.7162602841854095,
"num_tokens": 1080373.0,
"rewards/accuracies": 0.53125,
"rewards/chosen": -0.006188086466863751,
"rewards/margins": -0.016581419855356216,
"rewards/rejected": 0.010393334203399718,
"step": 19
},
{
"entropy": 1.1595325469970703,
"epoch": 0.01254115065057219,
"grad_norm": 44.13706970214844,
"learning_rate": 1.8999999999999998e-07,
"logits/chosen": -19.441370010137216,
"logits/rejected": -19.42652252828183,
"logps/chosen": -1272.5718240737915,
"logps/rejected": -622.7399673461914,
"loss": 1.0018830299377441,
"mean_token_accuracy": 0.7498048022389412,
"num_tokens": 1154517.0,
"rewards/accuracies": 0.53125,
"rewards/chosen": -0.02443491853773594,
"rewards/margins": -0.007660747622139752,
"rewards/rejected": -0.016774169402197003,
"step": 20
},
{
"entropy": 1.1010279133915901,
"epoch": 0.013168208183100799,
"grad_norm": 41.25276184082031,
"learning_rate": 2e-07,
"logits/chosen": -21.419456943034934,
"logits/rejected": -18.181673739978688,
"logps/chosen": -728.3854866027832,
"logps/rejected": -525.0471820831299,
"loss": 0.9977896213531494,
"mean_token_accuracy": 0.7623501494526863,
"num_tokens": 1212935.0,
"rewards/accuracies": 0.46875,
"rewards/chosen": 0.010096669750055298,
"rewards/margins": 0.008904347196221352,
"rewards/rejected": 0.0011923184501938522,
"step": 21
},
{
"entropy": 1.028150089085102,
"epoch": 0.01379526571562941,
"grad_norm": 36.785099029541016,
"learning_rate": 2.0999999999999997e-07,
"logits/chosen": -21.92485367743462,
"logits/rejected": -18.499413813157435,
"logps/chosen": -951.3307018280029,
"logps/rejected": -426.83284759521484,
"loss": 0.9958165884017944,
"mean_token_accuracy": 0.7534473612904549,
"num_tokens": 1281702.0,
"rewards/accuracies": 0.5625,
"rewards/chosen": -0.011519648949615657,
"rewards/margins": 0.01635956938844174,
"rewards/rejected": -0.027879221714101732,
"step": 22
},
{
"entropy": 0.9120204672217369,
"epoch": 0.01442232324815802,
"grad_norm": 36.060447692871094,
"learning_rate": 2.1999999999999998e-07,
"logits/chosen": -20.064261738727723,
"logits/rejected": -21.198644490481797,
"logps/chosen": -380.3253688812256,
"logps/rejected": -429.5263252258301,
"loss": 0.9947471022605896,
"mean_token_accuracy": 0.7963218614459038,
"num_tokens": 1327486.0,
"rewards/accuracies": 0.65625,
"rewards/chosen": 0.007161529851146042,
"rewards/margins": 0.02124298777198419,
"rewards/rejected": -0.014081457338761538,
"step": 23
},
{
"entropy": 1.282885067164898,
"epoch": 0.015049380780686628,
"grad_norm": 29.555295944213867,
"learning_rate": 2.3e-07,
"logits/chosen": -14.928810725754646,
"logits/rejected": -15.783012175933775,
"logps/chosen": -594.7181587219238,
"logps/rejected": -425.2836685180664,
"loss": 1.0085357427597046,
"mean_token_accuracy": 0.7083301916718483,
"num_tokens": 1377436.0,
"rewards/accuracies": 0.28125,
"rewards/chosen": -0.018809219647664577,
"rewards/margins": -0.03420144016854465,
"rewards/rejected": 0.015392220113426447,
"step": 24
},
{
"entropy": 1.170431300997734,
"epoch": 0.015676438313215236,
"grad_norm": 30.94621467590332,
"learning_rate": 2.4e-07,
"logits/chosen": -15.975754306334057,
"logits/rejected": -18.080566240707103,
"logps/chosen": -616.5587253570557,
"logps/rejected": -574.7409896850586,
"loss": 0.995916485786438,
"mean_token_accuracy": 0.7270784974098206,
"num_tokens": 1424961.0,
"rewards/accuracies": 0.5,
"rewards/chosen": 0.010408571077277884,
"rewards/margins": 0.01637996477074921,
"rewards/rejected": -0.00597139319870621,
"step": 25
},
{
"entropy": 0.8303776457905769,
"epoch": 0.016303495845743848,
"grad_norm": 33.599998474121094,
"learning_rate": 2.5e-07,
"logits/chosen": -25.26339476179235,
"logits/rejected": -21.119193724011815,
"logps/chosen": -830.6931796073914,
"logps/rejected": -321.0673656463623,
"loss": 1.0016303062438965,
"mean_token_accuracy": 0.7916704788804054,
"num_tokens": 1479087.0,
"rewards/accuracies": 0.53125,
"rewards/chosen": -0.01703651063144207,
"rewards/margins": -0.007413207786157727,
"rewards/rejected": -0.009623300982639194,
"step": 26
},
{
"entropy": 0.991417720913887,
"epoch": 0.016930553378272456,
"grad_norm": 36.997718811035156,
"learning_rate": 2.6e-07,
"logits/chosen": -21.212152458499872,
"logits/rejected": -18.952785907097258,
"logps/chosen": -704.5350914001465,
"logps/rejected": -370.6160888671875,
"loss": 0.9924548864364624,
"mean_token_accuracy": 0.7522578835487366,
"num_tokens": 1545047.0,
"rewards/accuracies": 0.53125,
"rewards/chosen": 0.017328572226688266,
"rewards/margins": 0.03090921661350876,
"rewards/rejected": -0.013580642873421311,
"step": 27
},
{
"entropy": 0.9894383996725082,
"epoch": 0.017557610910801064,
"grad_norm": 32.38890838623047,
"learning_rate": 2.7e-07,
"logits/chosen": -15.813927428167577,
"logits/rejected": -17.403900338000618,
"logps/chosen": -491.92512130737305,
"logps/rejected": -495.05503511428833,
"loss": 0.9995163083076477,
"mean_token_accuracy": 0.7497244253754616,
"num_tokens": 1594476.0,
"rewards/accuracies": 0.5,
"rewards/chosen": -0.008761245291680098,
"rewards/margins": 0.001895940862596035,
"rewards/rejected": -0.010657186910975724,
"step": 28
},
{
"entropy": 0.9598497748374939,
"epoch": 0.018184668443329676,
"grad_norm": 37.41246795654297,
"learning_rate": 2.8e-07,
"logits/chosen": -19.56551149166531,
"logits/rejected": -19.280089414645445,
"logps/chosen": -857.0342273712158,
"logps/rejected": -602.1430015563965,
"loss": 0.9875982403755188,
"mean_token_accuracy": 0.7813946753740311,
"num_tokens": 1660065.0,
"rewards/accuracies": 0.65625,
"rewards/chosen": 0.013675417518243194,
"rewards/margins": 0.05004646920133382,
"rewards/rejected": -0.03637105316738598,
"step": 29
},
{
"entropy": 1.324970230460167,
"epoch": 0.018811725975858284,
"grad_norm": 36.4524040222168,
"learning_rate": 2.9e-07,
"logits/chosen": -21.331314482840543,
"logits/rejected": -18.526820149021674,
"logps/chosen": -1117.674301147461,
"logps/rejected": -583.0690956115723,
"loss": 1.0027996301651,
"mean_token_accuracy": 0.687925897538662,
"num_tokens": 1720616.0,
"rewards/accuracies": 0.5625,
"rewards/chosen": -0.020995987113565207,
"rewards/margins": -0.01269948878325522,
"rewards/rejected": -0.008296501007862389,
"step": 30
},
{
"entropy": 1.0734140500426292,
"epoch": 0.019438783508386896,
"grad_norm": 46.66982650756836,
"learning_rate": 3e-07,
"logits/chosen": -16.946001394868276,
"logits/rejected": -16.085758178871664,
"logps/chosen": -1352.3280754089355,
"logps/rejected": -446.2639093399048,
"loss": 0.9967788457870483,
"mean_token_accuracy": 0.7191508114337921,
"num_tokens": 1811101.0,
"rewards/accuracies": 0.625,
"rewards/chosen": 0.0069078231463208795,
"rewards/margins": 0.012905016890726984,
"rewards/rejected": -0.005997193278744817,
"step": 31
},
{
"entropy": 1.323067456483841,
"epoch": 0.020065841040915505,
"grad_norm": 43.25249099731445,
"learning_rate": 3.1e-07,
"logits/chosen": -17.15731645945775,
"logits/rejected": -16.6517620046484,
"logps/chosen": -1334.5013446807861,
"logps/rejected": -645.0475730895996,
"loss": 0.9926663637161255,
"mean_token_accuracy": 0.7025224380195141,
"num_tokens": 1874585.0,
"rewards/accuracies": 0.8125,
"rewards/chosen": -0.0028306127060204744,
"rewards/margins": 0.0292252313811332,
"rewards/rejected": -0.032055844203568995,
"step": 32
},
{
"entropy": 1.0061679631471634,
"epoch": 0.020692898573444113,
"grad_norm": 31.95186996459961,
"learning_rate": 3.2e-07,
"logits/chosen": -19.57589939389031,
"logits/rejected": -19.90894640965601,
"logps/chosen": -616.9296951293945,
"logps/rejected": -426.7467842102051,
"loss": 1.0076781511306763,
"mean_token_accuracy": 0.7674555331468582,
"num_tokens": 1923915.0,
"rewards/accuracies": 0.46875,
"rewards/chosen": -0.03830282250419259,
"rewards/margins": -0.031945616006851196,
"rewards/rejected": -0.006357205333188176,
"step": 33
},
{
"entropy": 0.9171701222658157,
"epoch": 0.021319956105972725,
"grad_norm": 40.395572662353516,
"learning_rate": 3.3e-07,
"logits/chosen": -23.769768694096186,
"logits/rejected": -21.32001457302996,
"logps/chosen": -1274.3026218414307,
"logps/rejected": -430.8449001312256,
"loss": 0.991915225982666,
"mean_token_accuracy": 0.7600029706954956,
"num_tokens": 1992060.0,
"rewards/accuracies": 0.625,
"rewards/chosen": 0.0150325192080345,
"rewards/margins": 0.03390131541527808,
"rewards/rejected": -0.01886879827361554,
"step": 34
},
{
"entropy": 1.1749595329165459,
"epoch": 0.021947013638501333,
"grad_norm": 44.95557403564453,
"learning_rate": 3.4000000000000003e-07,
"logits/chosen": -20.226573322321272,
"logits/rejected": -19.058830108404514,
"logps/chosen": -1253.8970890045166,
"logps/rejected": -554.8555345535278,
"loss": 1.0085124969482422,
"mean_token_accuracy": 0.7034121379256248,
"num_tokens": 2055149.0,
"rewards/accuracies": 0.53125,
"rewards/chosen": -0.031581409042701125,
"rewards/margins": -0.03442110400646925,
"rewards/rejected": 0.002839697408489883,
"step": 35
},
{
"entropy": 1.1094688102602959,
"epoch": 0.02257407117102994,
"grad_norm": 40.33211135864258,
"learning_rate": 3.5e-07,
"logits/chosen": -20.24939867823679,
"logits/rejected": -20.34034861023941,
"logps/chosen": -832.8481521606445,
"logps/rejected": -694.2218322753906,
"loss": 0.9992198944091797,
"mean_token_accuracy": 0.7405928075313568,
"num_tokens": 2115443.0,
"rewards/accuracies": 0.53125,
"rewards/chosen": -0.009844484797213227,
"rewards/margins": 0.0029849251732230186,
"rewards/rejected": -0.01282941095996648,
"step": 36
},
{
"entropy": 0.9377781078219414,
"epoch": 0.023201128703558553,
"grad_norm": 34.241668701171875,
"learning_rate": 3.6e-07,
"logits/chosen": -23.224412647259843,
"logits/rejected": -21.117019989134523,
"logps/chosen": -721.9840965270996,
"logps/rejected": -388.344877243042,
"loss": 0.99440598487854,
"mean_token_accuracy": 0.7658621892333031,
"num_tokens": 2172629.0,
"rewards/accuracies": 0.46875,
"rewards/chosen": 0.016015969216823578,
"rewards/margins": 0.022238188714254647,
"rewards/rejected": -0.0062222188571467996,
"step": 37
},
{
"entropy": 1.0614213570952415,
"epoch": 0.02382818623608716,
"grad_norm": 34.88137435913086,
"learning_rate": 3.7e-07,
"logits/chosen": -21.41548795553992,
"logits/rejected": -18.69351990419123,
"logps/chosen": -1103.8941230773926,
"logps/rejected": -619.8993282318115,
"loss": 1.011991024017334,
"mean_token_accuracy": 0.7375566810369492,
"num_tokens": 2243025.0,
"rewards/accuracies": 0.25,
"rewards/chosen": -0.0650398419238627,
"rewards/margins": -0.04807211959268898,
"rewards/rejected": -0.016967719770036638,
"step": 38
},
{
"entropy": 1.2264064773917198,
"epoch": 0.02445524376861577,
"grad_norm": 32.48948669433594,
"learning_rate": 3.7999999999999996e-07,
"logits/chosen": -18.42769778338538,
"logits/rejected": -16.890675790644988,
"logps/chosen": -775.1542854309082,
"logps/rejected": -521.0977792739868,
"loss": 1.0028043985366821,
"mean_token_accuracy": 0.7075130566954613,
"num_tokens": 2294828.0,
"rewards/accuracies": 0.53125,
"rewards/chosen": -0.009019852615892887,
"rewards/margins": -0.011407412588596344,
"rewards/rejected": 0.002387559274211526,
"step": 39
},
{
"entropy": 1.2194309085607529,
"epoch": 0.02508230130114438,
"grad_norm": 35.85207748413086,
"learning_rate": 3.8999999999999997e-07,
"logits/chosen": -18.869462390156798,
"logits/rejected": -17.76926630663928,
"logps/chosen": -866.6771221160889,
"logps/rejected": -515.5025405883789,
"loss": 1.0078489780426025,
"mean_token_accuracy": 0.7282191216945648,
"num_tokens": 2359584.0,
"rewards/accuracies": 0.375,
"rewards/chosen": -0.019920013728551567,
"rewards/margins": -0.03206599899567664,
"rewards/rejected": 0.012145984219387174,
"step": 40
},
{
"entropy": 0.9393897280097008,
"epoch": 0.02570935883367299,
"grad_norm": 29.508663177490234,
"learning_rate": 4e-07,
"logits/chosen": -19.542580737616923,
"logits/rejected": -17.785255602711995,
"logps/chosen": -440.89880752563477,
"logps/rejected": -531.4820680618286,
"loss": 0.9985625147819519,
"mean_token_accuracy": 0.7809053212404251,
"num_tokens": 2407189.0,
"rewards/accuracies": 0.5625,
"rewards/chosen": 0.0036070493515580893,
"rewards/margins": 0.005761435255408287,
"rewards/rejected": -0.002154385729227215,
"step": 41
},
{
"entropy": 1.1858881711959839,
"epoch": 0.026336416366201598,
"grad_norm": 34.17562484741211,
"learning_rate": 4.0999999999999994e-07,
"logits/chosen": -20.121897634772164,
"logits/rejected": -19.622514667746742,
"logps/chosen": -804.0400094985962,
"logps/rejected": -586.3046684265137,
"loss": 0.9875714778900146,
"mean_token_accuracy": 0.7288667857646942,
"num_tokens": 2459432.0,
"rewards/accuracies": 0.59375,
"rewards/chosen": 0.0406644003232941,
"rewards/margins": 0.05225609429180622,
"rewards/rejected": -0.011591696529649198,
"step": 42
},
{
"entropy": 0.8192418366670609,
"epoch": 0.02696347389873021,
"grad_norm": 43.9438591003418,
"learning_rate": 4.1999999999999995e-07,
"logits/chosen": -24.092886788439017,
"logits/rejected": -23.664276651461066,
"logps/chosen": -584.1518545150757,
"logps/rejected": -503.76978302001953,
"loss": 0.9815411567687988,
"mean_token_accuracy": 0.8075317144393921,
"num_tokens": 2512702.0,
"rewards/accuracies": 0.75,
"rewards/chosen": 0.04232085426338017,
"rewards/margins": 0.07526338030584157,
"rewards/rejected": -0.032942528603598475,
"step": 43
},
{
"entropy": 0.9453827887773514,
"epoch": 0.02759053143125882,
"grad_norm": 35.92549514770508,
"learning_rate": 4.2999999999999996e-07,
"logits/chosen": -18.338003960845416,
"logits/rejected": -19.673824728737838,
"logps/chosen": -925.3223133087158,
"logps/rejected": -475.0994644165039,
"loss": 0.9924615025520325,
"mean_token_accuracy": 0.769691713154316,
"num_tokens": 2575249.0,
"rewards/accuracies": 0.625,
"rewards/chosen": 0.02094321296317503,
"rewards/margins": 0.03026525373570621,
"rewards/rejected": -0.009322041762061417,
"step": 44
},
{
"entropy": 0.8736219257116318,
"epoch": 0.028217588963787427,
"grad_norm": 33.97110366821289,
"learning_rate": 4.3999999999999997e-07,
"logits/chosen": -22.332301111125155,
"logits/rejected": -20.832310241019115,
"logps/chosen": -462.5166606903076,
"logps/rejected": -383.00551986694336,
"loss": 1.0048575401306152,
"mean_token_accuracy": 0.7859590947628021,
"num_tokens": 2621631.0,
"rewards/accuracies": 0.4375,
"rewards/chosen": -0.009766561212018132,
"rewards/margins": -0.019437916460447013,
"rewards/rejected": 0.009671354899182916,
"step": 45
},
{
"entropy": 1.02370435744524,
"epoch": 0.02884464649631604,
"grad_norm": 31.75177764892578,
"learning_rate": 4.5e-07,
"logits/chosen": -18.283618627987572,
"logits/rejected": -18.815319615630727,
"logps/chosen": -466.81629753112793,
"logps/rejected": -454.2089099884033,
"loss": 0.9951180219650269,
"mean_token_accuracy": 0.7507254704833031,
"num_tokens": 2674748.0,
"rewards/accuracies": 0.59375,
"rewards/chosen": 0.001771716313669458,
"rewards/margins": 0.019629769725725055,
"rewards/rejected": -0.01785805242252536,
"step": 46
},
{
"entropy": 0.9373743236064911,
"epoch": 0.029471704028844647,
"grad_norm": 42.6140251159668,
"learning_rate": 4.6e-07,
"logits/chosen": -25.528625869209804,
"logits/rejected": -21.64687665278925,
"logps/chosen": -1166.7054986953735,
"logps/rejected": -438.6943473815918,
"loss": 0.9925483465194702,
"mean_token_accuracy": 0.759131945669651,
"num_tokens": 2744660.0,
"rewards/accuracies": 0.5625,
"rewards/chosen": 0.005512146046385169,
"rewards/margins": 0.03011180693283677,
"rewards/rejected": -0.024599659722298384,
"step": 47
},
{
"entropy": 0.9783306047320366,
"epoch": 0.030098761561373255,
"grad_norm": 35.963809967041016,
"learning_rate": 4.6999999999999995e-07,
"logits/chosen": -19.222043644762906,
"logits/rejected": -18.896907946229895,
"logps/chosen": -515.0348672866821,
"logps/rejected": -419.7729835510254,
"loss": 0.9998578429222107,
"mean_token_accuracy": 0.792612262070179,
"num_tokens": 2790068.0,
"rewards/accuracies": 0.53125,
"rewards/chosen": -0.02343193959677592,
"rewards/margins": 0.0005922880955040455,
"rewards/rejected": -0.024024227866902947,
"step": 48
},
{
"entropy": 1.10813407599926,
"epoch": 0.030725819093901867,
"grad_norm": 35.080543518066406,
"learning_rate": 4.8e-07,
"logits/chosen": -22.976597678281987,
"logits/rejected": -20.831361335827353,
"logps/chosen": -826.8215522766113,
"logps/rejected": -406.26672554016113,
"loss": 1.008866310119629,
"mean_token_accuracy": 0.7337941229343414,
"num_tokens": 2845743.0,
"rewards/accuracies": 0.5625,
"rewards/chosen": -0.02741124981548637,
"rewards/margins": -0.03900438791606575,
"rewards/rejected": 0.011593140079639852,
"step": 49
},
{
"entropy": 1.3011442199349403,
"epoch": 0.03135287662643047,
"grad_norm": 32.856292724609375,
"learning_rate": 4.9e-07,
"logits/chosen": -14.496447176077387,
"logits/rejected": -17.84699543352937,
"logps/chosen": -565.9537868499756,
"logps/rejected": -459.75712490081787,
"loss": 0.9952901005744934,
"mean_token_accuracy": 0.7119247242808342,
"num_tokens": 2899233.0,
"rewards/accuracies": 0.625,
"rewards/chosen": 0.004313211014959961,
"rewards/margins": 0.018873692606575787,
"rewards/rejected": -0.014560480834916234,
"step": 50
},
{
"entropy": 1.2501383051276207,
"epoch": 0.031979934158959084,
"grad_norm": 36.4530143737793,
"learning_rate": 5e-07,
"logits/chosen": -21.17299309242602,
"logits/rejected": -22.865218106484676,
"logps/chosen": -866.4957427978516,
"logps/rejected": -508.9821949005127,
"loss": 1.0008279085159302,
"mean_token_accuracy": 0.7066351845860481,
"num_tokens": 2952150.0,
"rewards/accuracies": 0.5625,
"rewards/chosen": -0.0076497383415699005,
"rewards/margins": -0.003307956736534834,
"rewards/rejected": -0.004341780979302712,
"step": 51
},
{
"entropy": 1.1913169473409653,
"epoch": 0.032606991691487695,
"grad_norm": 40.79720687866211,
"learning_rate": 5.1e-07,
"logits/chosen": -17.331403938671592,
"logits/rejected": -16.946636435404315,
"logps/chosen": -760.1813850402832,
"logps/rejected": -703.0359497070312,
"loss": 1.0072510242462158,
"mean_token_accuracy": 0.7222515121102333,
"num_tokens": 3005503.0,
"rewards/accuracies": 0.4375,
"rewards/chosen": -0.013277458609081805,
"rewards/margins": -0.029311579186469316,
"rewards/rejected": 0.01603412051917985,
"step": 52
},
{
"entropy": 1.3226243034005165,
"epoch": 0.0332340492240163,
"grad_norm": 37.33218002319336,
"learning_rate": 5.2e-07,
"logits/chosen": -19.339108194716523,
"logits/rejected": -17.709144071414954,
"logps/chosen": -1036.9900550842285,
"logps/rejected": -671.3515205383301,
"loss": 1.0005102157592773,
"mean_token_accuracy": 0.699407085776329,
"num_tokens": 3062231.0,
"rewards/accuracies": 0.59375,
"rewards/chosen": -0.01915261917747557,
"rewards/margins": -0.002298903651535511,
"rewards/rejected": -0.016853714711032808,
"step": 53
},
{
"entropy": 1.2621377930045128,
"epoch": 0.03386110675654491,
"grad_norm": 36.86682891845703,
"learning_rate": 5.3e-07,
"logits/chosen": -23.098386869669465,
"logits/rejected": -18.559492736951306,
"logps/chosen": -879.0279788970947,
"logps/rejected": -472.2311248779297,
"loss": 0.9976851940155029,
"mean_token_accuracy": 0.687630370259285,
"num_tokens": 3118527.0,
"rewards/accuracies": 0.53125,
"rewards/chosen": -0.01943317288532853,
"rewards/margins": 0.009305761312134564,
"rewards/rejected": -0.028738934081047773,
"step": 54
},
{
"entropy": 1.0990462750196457,
"epoch": 0.034488164289073524,
"grad_norm": 29.28276824951172,
"learning_rate": 5.4e-07,
"logits/chosen": -17.590637043087355,
"logits/rejected": -16.153945977490892,
"logps/chosen": -548.3314371109009,
"logps/rejected": -324.43446254730225,
"loss": 0.9927998781204224,
"mean_token_accuracy": 0.7380417436361313,
"num_tokens": 3164828.0,
"rewards/accuracies": 0.59375,
"rewards/chosen": 0.007261359598487616,
"rewards/margins": 0.02887870534323156,
"rewards/rejected": -0.0216173455119133,
"step": 55
},
{
"entropy": 1.2540519461035728,
"epoch": 0.03511522182160213,
"grad_norm": 36.696895599365234,
"learning_rate": 5.5e-07,
"logits/chosen": -15.279084980657903,
"logits/rejected": -15.824559065606763,
"logps/chosen": -903.7292518615723,
"logps/rejected": -541.010986328125,
"loss": 0.9985660314559937,
"mean_token_accuracy": 0.6998207569122314,
"num_tokens": 3233270.0,
"rewards/accuracies": 0.5625,
"rewards/chosen": -0.016322331794071943,
"rewards/margins": 0.0056688676122576,
"rewards/rejected": -0.021991199755575508,
"step": 56
},
{
"entropy": 1.0729844830930233,
"epoch": 0.03574227935413074,
"grad_norm": 26.47355842590332,
"learning_rate": 5.6e-07,
"logits/chosen": -19.623318897458958,
"logits/rejected": -20.258368385656922,
"logps/chosen": -469.5618600845337,
"logps/rejected": -361.1621437072754,
"loss": 1.0013068914413452,
"mean_token_accuracy": 0.7484212070703506,
"num_tokens": 3268958.0,
"rewards/accuracies": 0.4375,
"rewards/chosen": 0.004558162530884147,
"rewards/margins": -0.005245101172477007,
"rewards/rejected": 0.009803264052607119,
"step": 57
},
{
"entropy": 0.9888226762413979,
"epoch": 0.03636933688665935,
"grad_norm": 28.04119873046875,
"learning_rate": 5.699999999999999e-07,
"logits/chosen": -18.97722177970246,
"logits/rejected": -17.818980544574217,
"logps/chosen": -490.36932277679443,
"logps/rejected": -353.6288299560547,
"loss": 0.9960744976997375,
"mean_token_accuracy": 0.763416476547718,
"num_tokens": 3318736.0,
"rewards/accuracies": 0.65625,
"rewards/chosen": -0.0007263210136443377,
"rewards/margins": 0.015722022857517004,
"rewards/rejected": -0.016448343638330698,
"step": 58
},
{
"entropy": 1.2886198982596397,
"epoch": 0.03699639441918796,
"grad_norm": 43.716182708740234,
"learning_rate": 5.8e-07,
"logits/chosen": -20.97464568747773,
"logits/rejected": -18.98481146897743,
"logps/chosen": -1585.0814723968506,
"logps/rejected": -528.0391731262207,
"loss": 0.9945598840713501,
"mean_token_accuracy": 0.7001667320728302,
"num_tokens": 3386147.0,
"rewards/accuracies": 0.46875,
"rewards/chosen": 0.019920118735171854,
"rewards/margins": 0.021774652879685163,
"rewards/rejected": -0.0018545325146988034,
"step": 59
},
{
"entropy": 1.039273351430893,
"epoch": 0.03762345195171657,
"grad_norm": 27.81415367126465,
"learning_rate": 5.9e-07,
"logits/chosen": -18.662482620406607,
"logits/rejected": -20.1330546037938,
"logps/chosen": -365.54387283325195,
"logps/rejected": -373.88531494140625,
"loss": 0.996242105960846,
"mean_token_accuracy": 0.7572688236832619,
"num_tokens": 3424538.0,
"rewards/accuracies": 0.65625,
"rewards/chosen": -0.006609153002500534,
"rewards/margins": 0.015012014424428344,
"rewards/rejected": -0.02162116818362847,
"step": 60
},
{
"entropy": 1.2042050436139107,
"epoch": 0.03825050948424518,
"grad_norm": 36.16862869262695,
"learning_rate": 6e-07,
"logits/chosen": -20.75980830973855,
"logits/rejected": -20.60451823594014,
"logps/chosen": -1099.3400793075562,
"logps/rejected": -421.7832374572754,
"loss": 1.0015130043029785,
"mean_token_accuracy": 0.7048044949769974,
"num_tokens": 3491026.0,
"rewards/accuracies": 0.46875,
"rewards/chosen": 0.00036664726212620735,
"rewards/margins": -0.005983836483210325,
"rewards/rejected": 0.00635048293042928,
"step": 61
},
{
"entropy": 1.0666373148560524,
"epoch": 0.03887756701677379,
"grad_norm": 43.32762908935547,
"learning_rate": 6.1e-07,
"logits/chosen": -23.173134701752,
"logits/rejected": -20.672318471013675,
"logps/chosen": -1242.8998069763184,
"logps/rejected": -464.8951187133789,
"loss": 0.9945209622383118,
"mean_token_accuracy": 0.7305290177464485,
"num_tokens": 3555810.0,
"rewards/accuracies": 0.5625,
"rewards/chosen": 0.005398005829192698,
"rewards/margins": 0.022236518329009414,
"rewards/rejected": -0.016838514362461865,
"step": 62
},
{
"entropy": 0.7979357466101646,
"epoch": 0.0395046245493024,
"grad_norm": 30.137588500976562,
"learning_rate": 6.2e-07,
"logits/chosen": -22.89783292156173,
"logits/rejected": -22.199726863036197,
"logps/chosen": -536.3147115707397,
"logps/rejected": -364.88674545288086,
"loss": 0.9864821434020996,
"mean_token_accuracy": 0.8112821727991104,
"num_tokens": 3604824.0,
"rewards/accuracies": 0.71875,
"rewards/chosen": 0.03518715803511441,
"rewards/margins": 0.056509705260396004,
"rewards/rejected": -0.02132254181196913,
"step": 63
},
{
"entropy": 1.1044994071125984,
"epoch": 0.04013168208183101,
"grad_norm": 29.391481399536133,
"learning_rate": 6.3e-07,
"logits/chosen": -24.507481146010182,
"logits/rejected": -22.21625134174552,
"logps/chosen": -702.180121421814,
"logps/rejected": -308.05684661865234,
"loss": 0.9998461604118347,
"mean_token_accuracy": 0.7285795137286186,
"num_tokens": 3651250.0,
"rewards/accuracies": 0.59375,
"rewards/chosen": -0.004402894992381334,
"rewards/margins": -0.0003644675016403198,
"rewards/rejected": -0.004038428800413385,
"step": 64
},
{
"entropy": 0.8255317062139511,
"epoch": 0.04075873961435962,
"grad_norm": 36.75194549560547,
"learning_rate": 6.4e-07,
"logits/chosen": -23.442134502527015,
"logits/rejected": -21.24577292120065,
"logps/chosen": -481.1418218612671,
"logps/rejected": -390.04198455810547,
"loss": 0.9808884859085083,
"mean_token_accuracy": 0.8040206730365753,
"num_tokens": 3700811.0,
"rewards/accuracies": 0.625,
"rewards/chosen": 0.03725379565730691,
"rewards/margins": 0.0775255209300667,
"rewards/rejected": -0.040271724574267864,
"step": 65
},
{
"entropy": 0.9590631648898125,
"epoch": 0.041385797146888226,
"grad_norm": 31.754987716674805,
"learning_rate": 6.5e-07,
"logits/chosen": -23.604474652863118,
"logits/rejected": -21.18440918134874,
"logps/chosen": -892.4836721420288,
"logps/rejected": -423.81532859802246,
"loss": 0.9878406524658203,
"mean_token_accuracy": 0.7679838165640831,
"num_tokens": 3752809.0,
"rewards/accuracies": 0.59375,
"rewards/chosen": 0.035222190992499236,
"rewards/margins": 0.05575526849133894,
"rewards/rejected": -0.020533079630695283,
"step": 66
},
{
"entropy": 0.9526357278227806,
"epoch": 0.04201285467941684,
"grad_norm": 38.09070587158203,
"learning_rate": 6.6e-07,
"logits/chosen": -19.300392282829993,
"logits/rejected": -20.892184024152968,
"logps/chosen": -767.138952255249,
"logps/rejected": -475.6669750213623,
"loss": 0.9936155080795288,
"mean_token_accuracy": 0.7684061825275421,
"num_tokens": 3817303.0,
"rewards/accuracies": 0.625,
"rewards/chosen": 0.02726819575764239,
"rewards/margins": 0.025456703966483474,
"rewards/rejected": 0.0018114912672899663,
"step": 67
},
{
"entropy": 0.7557753957808018,
"epoch": 0.04263991221194545,
"grad_norm": 31.207439422607422,
"learning_rate": 6.7e-07,
"logits/chosen": -22.31144983616734,
"logits/rejected": -22.303479200481075,
"logps/chosen": -516.0994625091553,
"logps/rejected": -432.821720123291,
"loss": 0.993211030960083,
"mean_token_accuracy": 0.8136529326438904,
"num_tokens": 3869975.0,
"rewards/accuracies": 0.625,
"rewards/chosen": 0.008595484774559736,
"rewards/margins": 0.027202091412618756,
"rewards/rejected": -0.018606607103720307,
"step": 68
},
{
"entropy": 1.078584998846054,
"epoch": 0.043266969744474054,
"grad_norm": 35.849456787109375,
"learning_rate": 6.800000000000001e-07,
"logits/chosen": -20.188257880122976,
"logits/rejected": -19.395488505188574,
"logps/chosen": -778.6550903320312,
"logps/rejected": -460.7582092285156,
"loss": 0.9967914819717407,
"mean_token_accuracy": 0.739520289003849,
"num_tokens": 3917591.0,
"rewards/accuracies": 0.625,
"rewards/chosen": -0.0018483520834706724,
"rewards/margins": 0.013088171719573438,
"rewards/rejected": -0.014936523628421128,
"step": 69
},
{
"entropy": 1.0627146326005459,
"epoch": 0.043894027277002666,
"grad_norm": 33.957401275634766,
"learning_rate": 6.9e-07,
"logits/chosen": -19.09365423111348,
"logits/rejected": -19.238957994462496,
"logps/chosen": -625.0276880264282,
"logps/rejected": -460.5406036376953,
"loss": 0.9846621155738831,
"mean_token_accuracy": 0.7464545965194702,
"num_tokens": 3963982.0,
"rewards/accuracies": 0.8125,
"rewards/chosen": 0.005297277413774282,
"rewards/margins": 0.06182992341928184,
"rewards/rejected": -0.056532644899562,
"step": 70
},
{
"entropy": 1.0039971619844437,
"epoch": 0.04452108480953128,
"grad_norm": 36.00166702270508,
"learning_rate": 7e-07,
"logits/chosen": -21.96269636469623,
"logits/rejected": -21.29580632185736,
"logps/chosen": -772.8854808807373,
"logps/rejected": -615.0897903442383,
"loss": 0.9930751323699951,
"mean_token_accuracy": 0.7512786686420441,
"num_tokens": 4028293.0,
"rewards/accuracies": 0.5625,
"rewards/chosen": 0.0168970461236313,
"rewards/margins": 0.02881601534318179,
"rewards/rejected": -0.011918970150873065,
"step": 71
},
{
"entropy": 1.302395537495613,
"epoch": 0.04514814234205988,
"grad_norm": 39.504661560058594,
"learning_rate": 7.1e-07,
"logits/chosen": -19.878782312586424,
"logits/rejected": -18.000410834982972,
"logps/chosen": -1210.3033666610718,
"logps/rejected": -607.6138458251953,
"loss": 0.9891315698623657,
"mean_token_accuracy": 0.703778937458992,
"num_tokens": 4089535.0,
"rewards/accuracies": 0.71875,
"rewards/chosen": 0.0096849100664258,
"rewards/margins": 0.043962169205769897,
"rewards/rejected": -0.034277260303497314,
"step": 72
},
{
"entropy": 0.9964236989617348,
"epoch": 0.045775199874588494,
"grad_norm": 33.938472747802734,
"learning_rate": 7.2e-07,
"logits/chosen": -20.415109094760414,
"logits/rejected": -17.26682495783373,
"logps/chosen": -721.8188791275024,
"logps/rejected": -408.42410469055176,
"loss": 0.995058536529541,
"mean_token_accuracy": 0.7626092284917831,
"num_tokens": 4140075.0,
"rewards/accuracies": 0.59375,
"rewards/chosen": -0.015723853604868054,
"rewards/margins": 0.019197183661162853,
"rewards/rejected": -0.03492103505413979,
"step": 73
},
{
"entropy": 1.017537921667099,
"epoch": 0.046402257407117106,
"grad_norm": 26.6578311920166,
"learning_rate": 7.3e-07,
"logits/chosen": -15.80474927414226,
"logits/rejected": -16.128822298593438,
"logps/chosen": -515.7086997032166,
"logps/rejected": -239.00895309448242,
"loss": 0.9995874762535095,
"mean_token_accuracy": 0.7658038064837456,
"num_tokens": 4194003.0,
"rewards/accuracies": 0.59375,
"rewards/chosen": -0.008220234914915636,
"rewards/margins": 0.0016142040840350091,
"rewards/rejected": -0.009834438504185528,
"step": 74
},
{
"entropy": 0.9735286235809326,
"epoch": 0.04702931493964571,
"grad_norm": 33.58881759643555,
"learning_rate": 7.4e-07,
"logits/chosen": -20.946241053605,
"logits/rejected": -19.067083934619777,
"logps/chosen": -674.0198707580566,
"logps/rejected": -419.6971263885498,
"loss": 0.991060733795166,
"mean_token_accuracy": 0.7505866810679436,
"num_tokens": 4244222.0,
"rewards/accuracies": 0.78125,
"rewards/chosen": 0.015050875255838037,
"rewards/margins": 0.03578460752032697,
"rewards/rejected": -0.020733732322696596,
"step": 75
},
{
"entropy": 1.137626238167286,
"epoch": 0.04765637247217432,
"grad_norm": 38.98091125488281,
"learning_rate": 7.5e-07,
"logits/chosen": -22.829858763000864,
"logits/rejected": -19.879969265793594,
"logps/chosen": -1177.3832550048828,
"logps/rejected": -511.0323143005371,
"loss": 0.9940009713172913,
"mean_token_accuracy": 0.7326341941952705,
"num_tokens": 4313717.0,
"rewards/accuracies": 0.625,
"rewards/chosen": -0.021500761155039072,
"rewards/margins": 0.023731452063657343,
"rewards/rejected": -0.0452322136843577,
"step": 76
},
{
"entropy": 1.2288251742720604,
"epoch": 0.048283430004702935,
"grad_norm": 28.220809936523438,
"learning_rate": 7.599999999999999e-07,
"logits/chosen": -17.088404479801554,
"logits/rejected": -18.424581121455233,
"logps/chosen": -600.109245300293,
"logps/rejected": -335.4466133117676,
"loss": 1.0012062788009644,
"mean_token_accuracy": 0.7148683369159698,
"num_tokens": 4358615.0,
"rewards/accuracies": 0.375,
"rewards/chosen": -0.014499580138362944,
"rewards/margins": -0.004860305110923946,
"rewards/rejected": -0.00963927514385432,
"step": 77
},
{
"entropy": 1.0265920907258987,
"epoch": 0.04891048753723154,
"grad_norm": 34.03989791870117,
"learning_rate": 7.699999999999999e-07,
"logits/chosen": -22.126280957342644,
"logits/rejected": -21.625379783333514,
"logps/chosen": -804.5845255851746,
"logps/rejected": -453.7879638671875,
"loss": 0.9970452785491943,
"mean_token_accuracy": 0.7403309643268585,
"num_tokens": 4415873.0,
"rewards/accuracies": 0.625,
"rewards/chosen": -0.008073777018580586,
"rewards/margins": 0.011700771981850266,
"rewards/rejected": -0.019774550921283662,
"step": 78
},
{
"entropy": 1.262473076581955,
"epoch": 0.04953754506976015,
"grad_norm": 36.033348083496094,
"learning_rate": 7.799999999999999e-07,
"logits/chosen": -18.124917388062837,
"logits/rejected": -19.211221946008383,
"logps/chosen": -795.0781173706055,
"logps/rejected": -577.8308029174805,
"loss": 0.9934069514274597,
"mean_token_accuracy": 0.7068465352058411,
"num_tokens": 4477334.0,
"rewards/accuracies": 0.59375,
"rewards/chosen": -0.004607248993124813,
"rewards/margins": 0.026270719012245536,
"rewards/rejected": -0.030877968529239297,
"step": 79
},
{
"entropy": 0.9185331761837006,
"epoch": 0.05016460260228876,
"grad_norm": 36.832279205322266,
"learning_rate": 7.9e-07,
"logits/chosen": -20.603378074573,
"logits/rejected": -17.056396975980135,
"logps/chosen": -758.8550605773926,
"logps/rejected": -412.65998458862305,
"loss": 0.9883898496627808,
"mean_token_accuracy": 0.7726860344409943,
"num_tokens": 4533455.0,
"rewards/accuracies": 0.59375,
"rewards/chosen": -0.0016075177991297096,
"rewards/margins": 0.04657475184649229,
"rewards/rejected": -0.04818226984934881,
"step": 80
},
{
"entropy": 1.121558502316475,
"epoch": 0.05079166013481737,
"grad_norm": 36.56794738769531,
"learning_rate": 8e-07,
"logits/chosen": -20.37862110155874,
"logits/rejected": -18.992690204889037,
"logps/chosen": -1184.8006420135498,
"logps/rejected": -610.0655975341797,
"loss": 0.9853536486625671,
"mean_token_accuracy": 0.7357284799218178,
"num_tokens": 4596652.0,
"rewards/accuracies": 0.6875,
"rewards/chosen": 0.02295642625540495,
"rewards/margins": 0.059380507678724825,
"rewards/rejected": -0.03642408235464245,
"step": 81
},
{
"entropy": 1.0517073720693588,
"epoch": 0.05141871766734598,
"grad_norm": 39.78794860839844,
"learning_rate": 8.1e-07,
"logits/chosen": -23.220199460872006,
"logits/rejected": -21.76251201594231,
"logps/chosen": -901.9024753570557,
"logps/rejected": -581.7087097167969,
"loss": 0.9863370656967163,
"mean_token_accuracy": 0.7483935281634331,
"num_tokens": 4660574.0,
"rewards/accuracies": 0.65625,
"rewards/chosen": 0.005605014972388744,
"rewards/margins": 0.05513616371899843,
"rewards/rejected": -0.04953114781528711,
"step": 82
},
{
"entropy": 1.031716726720333,
"epoch": 0.05204577519987459,
"grad_norm": 34.147884368896484,
"learning_rate": 8.199999999999999e-07,
"logits/chosen": -17.43597000771303,
"logits/rejected": -17.040958005172556,
"logps/chosen": -611.6086521148682,
"logps/rejected": -463.6491508483887,
"loss": 0.9925582408905029,
"mean_token_accuracy": 0.7591038644313812,
"num_tokens": 4726456.0,
"rewards/accuracies": 0.5625,
"rewards/chosen": -0.009094578330405056,
"rewards/margins": 0.029864652664400637,
"rewards/rejected": -0.03895922936499119,
"step": 83
},
{
"entropy": 1.1349261552095413,
"epoch": 0.052672832732403196,
"grad_norm": 32.638126373291016,
"learning_rate": 8.299999999999999e-07,
"logits/chosen": -17.404521363601013,
"logits/rejected": -19.98172508139376,
"logps/chosen": -767.6361827850342,
"logps/rejected": -448.48921966552734,
"loss": 0.9871995449066162,
"mean_token_accuracy": 0.7235324308276176,
"num_tokens": 4792314.0,
"rewards/accuracies": 0.65625,
"rewards/chosen": 0.017612980911508203,
"rewards/margins": 0.05156451647053473,
"rewards/rejected": -0.033951534889638424,
"step": 84
},
{
"entropy": 1.1050493195652962,
"epoch": 0.05329989026493181,
"grad_norm": 36.08334732055664,
"learning_rate": 8.399999999999999e-07,
"logits/chosen": -16.500999504676678,
"logits/rejected": -18.25587297431137,
"logps/chosen": -675.2915000915527,
"logps/rejected": -561.0027389526367,
"loss": 0.9919638633728027,
"mean_token_accuracy": 0.741675615310669,
"num_tokens": 4849066.0,
"rewards/accuracies": 0.65625,
"rewards/chosen": 0.0004984733532182872,
"rewards/margins": 0.03216184466145933,
"rewards/rejected": -0.03166337008588016,
"step": 85
},
{
"entropy": 1.220378190279007,
"epoch": 0.05392694779746042,
"grad_norm": 40.76183319091797,
"learning_rate": 8.499999999999999e-07,
"logits/chosen": -23.90722501767462,
"logits/rejected": -22.38695916119651,
"logps/chosen": -1048.8524017333984,
"logps/rejected": -473.95777893066406,
"loss": 0.9880315661430359,
"mean_token_accuracy": 0.7109057381749153,
"num_tokens": 4923190.0,
"rewards/accuracies": 0.71875,
"rewards/chosen": -0.0222030496224761,
"rewards/margins": 0.04874912742525339,
"rewards/rejected": -0.07095217774622142,
"step": 86
},
{
"entropy": 1.2091117054224014,
"epoch": 0.054554005329989025,
"grad_norm": 35.72580337524414,
"learning_rate": 8.599999999999999e-07,
"logits/chosen": -20.30170921476879,
"logits/rejected": -21.20954152859497,
"logps/chosen": -951.2183666229248,
"logps/rejected": -513.4668788909912,
"loss": 0.9863914251327515,
"mean_token_accuracy": 0.7123682126402855,
"num_tokens": 4974868.0,
"rewards/accuracies": 0.6875,
"rewards/chosen": 0.026849399670027196,
"rewards/margins": 0.05532143288291991,
"rewards/rejected": -0.028472037287428975,
"step": 87
},
{
"entropy": 1.073004886507988,
"epoch": 0.05518106286251764,
"grad_norm": 36.27262496948242,
"learning_rate": 8.699999999999999e-07,
"logits/chosen": -19.685747925382,
"logits/rejected": -17.267068163974074,
"logps/chosen": -578.3146362304688,
"logps/rejected": -475.0130271911621,
"loss": 0.9875953197479248,
"mean_token_accuracy": 0.7410635352134705,
"num_tokens": 5037188.0,
"rewards/accuracies": 0.71875,
"rewards/chosen": 0.014228225103579462,
"rewards/margins": 0.04966498585417867,
"rewards/rejected": -0.03543675900436938,
"step": 88
},
{
"entropy": 1.056903399527073,
"epoch": 0.05580812039504625,
"grad_norm": 35.787532806396484,
"learning_rate": 8.799999999999999e-07,
"logits/chosen": -20.64660484271999,
"logits/rejected": -19.71323913593022,
"logps/chosen": -527.9435653686523,
"logps/rejected": -577.5134410858154,
"loss": 0.9897867441177368,
"mean_token_accuracy": 0.7574738562107086,
"num_tokens": 5086966.0,
"rewards/accuracies": 0.78125,
"rewards/chosen": 0.00012873177183791995,
"rewards/margins": 0.04125080001540482,
"rewards/rejected": -0.04112206675927155,
"step": 89
},
{
"entropy": 0.9986204952001572,
"epoch": 0.05643517792757485,
"grad_norm": 33.426368713378906,
"learning_rate": 8.9e-07,
"logits/chosen": -18.57544006926955,
"logits/rejected": -19.12848221709334,
"logps/chosen": -766.3484830856323,
"logps/rejected": -476.17732429504395,
"loss": 0.9895883798599243,
"mean_token_accuracy": 0.7547919675707817,
"num_tokens": 5144107.0,
"rewards/accuracies": 0.6875,
"rewards/chosen": 0.013297693920321763,
"rewards/margins": 0.04271816968685016,
"rewards/rejected": -0.029420473758364096,
"step": 90
},
{
"entropy": 1.1071998253464699,
"epoch": 0.057062235460103465,
"grad_norm": 46.52241516113281,
"learning_rate": 9e-07,
"logits/chosen": -20.750110720341095,
"logits/rejected": -20.73160492144149,
"logps/chosen": -1105.2754192352295,
"logps/rejected": -582.0479850769043,
"loss": 0.9801906943321228,
"mean_token_accuracy": 0.7243269085884094,
"num_tokens": 5211621.0,
"rewards/accuracies": 0.8125,
"rewards/chosen": 0.019272988894954324,
"rewards/margins": 0.0801434232853353,
"rewards/rejected": -0.06087043380830437,
"step": 91
},
{
"entropy": 1.1382925510406494,
"epoch": 0.05768929299263208,
"grad_norm": 37.77758026123047,
"learning_rate": 9.1e-07,
"logits/chosen": -20.904564962987713,
"logits/rejected": -21.018963758425333,
"logps/chosen": -640.5741844177246,
"logps/rejected": -708.7987327575684,
"loss": 0.9877656102180481,
"mean_token_accuracy": 0.7462773993611336,
"num_tokens": 5263236.0,
"rewards/accuracies": 0.78125,
"rewards/chosen": -0.032095869741169736,
"rewards/margins": 0.04855327168479562,
"rewards/rejected": -0.08064913935959339,
"step": 92
},
{
"entropy": 1.1960504204034805,
"epoch": 0.05831635052516068,
"grad_norm": 27.9012508392334,
"learning_rate": 9.2e-07,
"logits/chosen": -17.198728228506177,
"logits/rejected": -19.989566953539725,
"logps/chosen": -581.2822170257568,
"logps/rejected": -365.0048427581787,
"loss": 0.9875739812850952,
"mean_token_accuracy": 0.7414722666144371,
"num_tokens": 5301490.0,
"rewards/accuracies": 0.6875,
"rewards/chosen": 0.0007973910542204976,
"rewards/margins": 0.04991468833759427,
"rewards/rejected": -0.04911729716695845,
"step": 93
},
{
"entropy": 0.9865989461541176,
"epoch": 0.058943408057689294,
"grad_norm": 31.25222396850586,
"learning_rate": 9.3e-07,
"logits/chosen": -18.790141123207366,
"logits/rejected": -16.14887539333265,
"logps/chosen": -577.1131019592285,
"logps/rejected": -340.10778999328613,
"loss": 0.9858304262161255,
"mean_token_accuracy": 0.7623919099569321,
"num_tokens": 5361142.0,
"rewards/accuracies": 0.6875,
"rewards/chosen": 0.0011998027912341058,
"rewards/margins": 0.057147986139170825,
"rewards/rejected": -0.05594818387180567,
"step": 94
},
{
"entropy": 1.044435366988182,
"epoch": 0.059570465590217905,
"grad_norm": 26.22032928466797,
"learning_rate": 9.399999999999999e-07,
"logits/chosen": -17.09738355288199,
"logits/rejected": -17.458014048093904,
"logps/chosen": -388.39873027801514,
"logps/rejected": -326.0696334838867,
"loss": 0.9898619055747986,
"mean_token_accuracy": 0.7581661641597748,
"num_tokens": 5408748.0,
"rewards/accuracies": 0.6875,
"rewards/chosen": -0.0021333397598937154,
"rewards/margins": 0.04059030464850366,
"rewards/rejected": -0.04272364475764334,
"step": 95
},
{
"entropy": 0.8697420880198479,
"epoch": 0.06019752312274651,
"grad_norm": 42.353424072265625,
"learning_rate": 9.499999999999999e-07,
"logits/chosen": -23.41937699390698,
"logits/rejected": -21.70754765415036,
"logps/chosen": -1428.7145009040833,
"logps/rejected": -443.71881103515625,
"loss": 0.9914920926094055,
"mean_token_accuracy": 0.7912928014993668,
"num_tokens": 5483101.0,
"rewards/accuracies": 0.625,
"rewards/chosen": 0.011147335055284202,
"rewards/margins": 0.045076546957716346,
"rewards/rejected": -0.03392921155318618,
"step": 96
},
{
"entropy": 1.1013405546545982,
"epoch": 0.06082458065527512,
"grad_norm": 36.10636520385742,
"learning_rate": 9.6e-07,
"logits/chosen": -19.821280825841903,
"logits/rejected": -19.578973804909,
"logps/chosen": -985.1940336227417,
"logps/rejected": -473.689453125,
"loss": 0.983747124671936,
"mean_token_accuracy": 0.7495378330349922,
"num_tokens": 5534649.0,
"rewards/accuracies": 0.71875,
"rewards/chosen": -0.0021885630558244884,
"rewards/margins": 0.06537919119000435,
"rewards/rejected": -0.06756775546818972,
"step": 97
},
{
"entropy": 1.2237722724676132,
"epoch": 0.061451638187803734,
"grad_norm": 41.582496643066406,
"learning_rate": 9.7e-07,
"logits/chosen": -20.153029153130383,
"logits/rejected": -17.664550339329576,
"logps/chosen": -1082.3712921142578,
"logps/rejected": -649.8507308959961,
"loss": 0.9809252023696899,
"mean_token_accuracy": 0.718035951256752,
"num_tokens": 5612387.0,
"rewards/accuracies": 0.8125,
"rewards/chosen": 0.02365162328351289,
"rewards/margins": 0.07657872815616429,
"rewards/rejected": -0.052927102777175605,
"step": 98
},
{
"entropy": 1.0099660605192184,
"epoch": 0.06207869572033234,
"grad_norm": 30.545495986938477,
"learning_rate": 9.8e-07,
"logits/chosen": -19.286327351085962,
"logits/rejected": -19.547563799363445,
"logps/chosen": -635.9861097335815,
"logps/rejected": -379.7309799194336,
"loss": 0.9843310117721558,
"mean_token_accuracy": 0.7559159845113754,
"num_tokens": 5664396.0,
"rewards/accuracies": 0.6875,
"rewards/chosen": -0.005910164851229638,
"rewards/margins": 0.06448549684137106,
"rewards/rejected": -0.07039566081948578,
"step": 99
},
{
"entropy": 1.1891107335686684,
"epoch": 0.06270575325286094,
"grad_norm": 30.441099166870117,
"learning_rate": 9.9e-07,
"logits/chosen": -16.462167828377467,
"logits/rejected": -17.668335453566645,
"logps/chosen": -774.8042068481445,
"logps/rejected": -352.1152057647705,
"loss": 0.9829254150390625,
"mean_token_accuracy": 0.723647378385067,
"num_tokens": 5712927.0,
"rewards/accuracies": 0.6875,
"rewards/chosen": -0.0013654606882482767,
"rewards/margins": 0.0686984455678612,
"rewards/rejected": -0.07006390765309334,
"step": 100
},
{
"entropy": 1.0059744790196419,
"epoch": 0.06333281078538956,
"grad_norm": 34.044551849365234,
"learning_rate": 1e-06,
"logits/chosen": -22.569647432957222,
"logits/rejected": -20.571769885244017,
"logps/chosen": -737.9557514190674,
"logps/rejected": -456.0193290710449,
"loss": 0.9836858510971069,
"mean_token_accuracy": 0.7708024978637695,
"num_tokens": 5762779.0,
"rewards/accuracies": 0.71875,
"rewards/chosen": 0.02014523115940392,
"rewards/margins": 0.0654695084085688,
"rewards/rejected": -0.045324277016334236,
"step": 101
},
{
"entropy": 1.1221561804413795,
"epoch": 0.06395986831791817,
"grad_norm": 35.60519790649414,
"learning_rate": 9.999988960301596e-07,
"logits/chosen": -17.63612561400455,
"logits/rejected": -21.225849866079535,
"logps/chosen": -851.1271896362305,
"logps/rejected": -731.4087066650391,
"loss": 0.9757521152496338,
"mean_token_accuracy": 0.7322330251336098,
"num_tokens": 5820523.0,
"rewards/accuracies": 0.6875,
"rewards/chosen": 0.011595683405175805,
"rewards/margins": 0.09945710864849389,
"rewards/rejected": -0.08786143315955997,
"step": 102
},
{
"entropy": 1.033433958888054,
"epoch": 0.06458692585044677,
"grad_norm": 33.74344253540039,
"learning_rate": 9.999955841255138e-07,
"logits/chosen": -21.6586000014676,
"logits/rejected": -20.241547622800056,
"logps/chosen": -748.6037483215332,
"logps/rejected": -495.99595642089844,
"loss": 0.9870611429214478,
"mean_token_accuracy": 0.7368155121803284,
"num_tokens": 5870733.0,
"rewards/accuracies": 0.6875,
"rewards/chosen": -0.03833825106266886,
"rewards/margins": 0.050038286950439215,
"rewards/rejected": -0.08837653254158795,
"step": 103
},
{
"entropy": 1.118708185851574,
"epoch": 0.06521398338297539,
"grad_norm": 43.72235107421875,
"learning_rate": 9.999900643006873e-07,
"logits/chosen": -22.952759755082543,
"logits/rejected": -18.112035021982514,
"logps/chosen": -1293.3799285888672,
"logps/rejected": -614.5923004150391,
"loss": 0.9773090481758118,
"mean_token_accuracy": 0.7410418093204498,
"num_tokens": 5941283.0,
"rewards/accuracies": 0.65625,
"rewards/chosen": 0.02265817968873307,
"rewards/margins": 0.09182942099869251,
"rewards/rejected": -0.06917124305618927,
"step": 104
},
{
"entropy": 1.3742387741804123,
"epoch": 0.065841040915504,
"grad_norm": 39.11056137084961,
"learning_rate": 9.99982336580055e-07,
"logits/chosen": -16.713279247073885,
"logits/rejected": -16.98860342760087,
"logps/chosen": -950.8361873626709,
"logps/rejected": -464.50708770751953,
"loss": 0.9773339629173279,
"mean_token_accuracy": 0.6922967359423637,
"num_tokens": 6000343.0,
"rewards/accuracies": 0.8125,
"rewards/chosen": 0.006588876945897937,
"rewards/margins": 0.09067038784269243,
"rewards/rejected": -0.08408151054754853,
"step": 105
},
{
"entropy": 1.1545687764883041,
"epoch": 0.0664680984480326,
"grad_norm": 34.153663635253906,
"learning_rate": 9.99972400997742e-07,
"logits/chosen": -20.552279910445396,
"logits/rejected": -18.52949584159018,
"logps/chosen": -710.0431318283081,
"logps/rejected": -350.6925792694092,
"loss": 0.982926070690155,
"mean_token_accuracy": 0.7238080576062202,
"num_tokens": 6047719.0,
"rewards/accuracies": 0.75,
"rewards/chosen": 0.01743771624751389,
"rewards/margins": 0.06860713846981525,
"rewards/rejected": -0.05116942140739411,
"step": 106
},
{
"entropy": 0.8841631710529327,
"epoch": 0.06709515598056122,
"grad_norm": 30.25786018371582,
"learning_rate": 9.999602575976219e-07,
"logits/chosen": -16.81424879838689,
"logits/rejected": -16.14855911409956,
"logps/chosen": -426.7861785888672,
"logps/rejected": -396.69312858581543,
"loss": 0.979150652885437,
"mean_token_accuracy": 0.8006457611918449,
"num_tokens": 6096830.0,
"rewards/accuracies": 0.8125,
"rewards/chosen": 0.007483278808649629,
"rewards/margins": 0.0836036205291748,
"rewards/rejected": -0.07612034154590219,
"step": 107
},
{
"entropy": 1.0404388830065727,
"epoch": 0.06772221351308982,
"grad_norm": 33.5556640625,
"learning_rate": 9.999459064333188e-07,
"logits/chosen": -15.91254721701439,
"logits/rejected": -16.29134417675286,
"logps/chosen": -601.9646797180176,
"logps/rejected": -457.3084487915039,
"loss": 0.9777726531028748,
"mean_token_accuracy": 0.7538063228130341,
"num_tokens": 6145266.0,
"rewards/accuracies": 0.8125,
"rewards/chosen": 0.019957647193223238,
"rewards/margins": 0.08928463887423277,
"rewards/rejected": -0.0693269899347797,
"step": 108
},
{
"entropy": 1.2834724336862564,
"epoch": 0.06834927104561843,
"grad_norm": 34.99026870727539,
"learning_rate": 9.999293475682062e-07,
"logits/chosen": -17.259286736211884,
"logits/rejected": -17.444496267757785,
"logps/chosen": -667.7793045043945,
"logps/rejected": -577.6125526428223,
"loss": 0.9799240231513977,
"mean_token_accuracy": 0.6992196813225746,
"num_tokens": 6196039.0,
"rewards/accuracies": 0.78125,
"rewards/chosen": -0.005005566752515733,
"rewards/margins": 0.08093663223553449,
"rewards/rejected": -0.08594219759106636,
"step": 109
},
{
"entropy": 1.055838204920292,
"epoch": 0.06897632857814705,
"grad_norm": 33.32623291015625,
"learning_rate": 9.999105810754053e-07,
"logits/chosen": -18.407450521012187,
"logits/rejected": -18.873402077141666,
"logps/chosen": -799.7204494476318,
"logps/rejected": -477.783242225647,
"loss": 0.9677953720092773,
"mean_token_accuracy": 0.7510818913578987,
"num_tokens": 6263445.0,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.052083960617892444,
"rewards/margins": 0.1307980790734291,
"rewards/rejected": -0.07871411880478263,
"step": 110
},
{
"entropy": 0.9602865129709244,
"epoch": 0.06960338611067565,
"grad_norm": 28.93109130859375,
"learning_rate": 9.99889607037787e-07,
"logits/chosen": -16.415104591720436,
"logits/rejected": -18.58728532903226,
"logps/chosen": -381.7690181732178,
"logps/rejected": -416.77470779418945,
"loss": 0.9900650382041931,
"mean_token_accuracy": 0.7899875342845917,
"num_tokens": 6311526.0,
"rewards/accuracies": 0.59375,
"rewards/chosen": -0.004977155942469835,
"rewards/margins": 0.039845253340899944,
"rewards/rejected": -0.044822409050539136,
"step": 111
},
{
"entropy": 0.8192609176039696,
"epoch": 0.07023044364320426,
"grad_norm": 39.31092071533203,
"learning_rate": 9.998664255479704e-07,
"logits/chosen": -25.072994460556252,
"logits/rejected": -22.42456335487019,
"logps/chosen": -1064.658107995987,
"logps/rejected": -414.81433868408203,
"loss": 0.9966785311698914,
"mean_token_accuracy": 0.8144989609718323,
"num_tokens": 6373673.0,
"rewards/accuracies": 0.625,
"rewards/chosen": -0.06160880299285054,
"rewards/margins": 0.012114129436668009,
"rewards/rejected": -0.0737229329533875,
"step": 112
},
{
"entropy": 0.9448361806571484,
"epoch": 0.07085750117573288,
"grad_norm": 39.90821075439453,
"learning_rate": 9.99841036708322e-07,
"logits/chosen": -23.766030290287702,
"logits/rejected": -25.34154914444923,
"logps/chosen": -1000.321138381958,
"logps/rejected": -514.6866340637207,
"loss": 0.9712129831314087,
"mean_token_accuracy": 0.7757420614361763,
"num_tokens": 6428282.0,
"rewards/accuracies": 0.84375,
"rewards/chosen": 0.034964483114890754,
"rewards/margins": 0.11884536314755678,
"rewards/rejected": -0.08388087863568217,
"step": 113
},
{
"entropy": 0.8173889517784119,
"epoch": 0.07148455870826148,
"grad_norm": 30.850637435913086,
"learning_rate": 9.998134406309553e-07,
"logits/chosen": -25.008434498378293,
"logits/rejected": -22.165182027384386,
"logps/chosen": -702.1321802139282,
"logps/rejected": -378.8375816345215,
"loss": 0.9969829320907593,
"mean_token_accuracy": 0.8100090399384499,
"num_tokens": 6478216.0,
"rewards/accuracies": 0.65625,
"rewards/chosen": -0.0617737959837541,
"rewards/margins": 0.0021084430627524853,
"rewards/rejected": -0.06388223776593804,
"step": 114
},
{
"entropy": 1.0738236010074615,
"epoch": 0.07211161624079009,
"grad_norm": 37.23641586303711,
"learning_rate": 9.997836374377318e-07,
"logits/chosen": -21.598642905098632,
"logits/rejected": -23.624653024193194,
"logps/chosen": -677.4854145050049,
"logps/rejected": -513.8848571777344,
"loss": 0.9803842306137085,
"mean_token_accuracy": 0.7514287456870079,
"num_tokens": 6522645.0,
"rewards/accuracies": 0.75,
"rewards/chosen": 0.0021543916955124587,
"rewards/margins": 0.0788510333513841,
"rewards/rejected": -0.07669664057902992,
"step": 115
},
{
"entropy": 1.0687246397137642,
"epoch": 0.0727386737733187,
"grad_norm": 28.08934783935547,
"learning_rate": 9.997516272602588e-07,
"logits/chosen": -18.0843256562564,
"logits/rejected": -17.27698922154224,
"logps/chosen": -591.8647804260254,
"logps/rejected": -329.94952392578125,
"loss": 0.9886791706085205,
"mean_token_accuracy": 0.7329046651721001,
"num_tokens": 6565380.0,
"rewards/accuracies": 0.65625,
"rewards/chosen": -0.014423841843381524,
"rewards/margins": 0.045475234859623015,
"rewards/rejected": -0.05989907821640372,
"step": 116
},
{
"entropy": 1.2525769509375095,
"epoch": 0.07336573130584731,
"grad_norm": 32.46056365966797,
"learning_rate": 9.997174102398892e-07,
"logits/chosen": -19.069984483617883,
"logits/rejected": -18.31701463203426,
"logps/chosen": -857.891770362854,
"logps/rejected": -576.6237850189209,
"loss": 0.9878202676773071,
"mean_token_accuracy": 0.7090706676244736,
"num_tokens": 6621385.0,
"rewards/accuracies": 0.75,
"rewards/chosen": -0.012965936097316444,
"rewards/margins": 0.04882583348080516,
"rewards/rejected": -0.06179177016019821,
"step": 117
},
{
"entropy": 1.0708193145692348,
"epoch": 0.07399278883837591,
"grad_norm": 33.78789138793945,
"learning_rate": 9.996809865277214e-07,
"logits/chosen": -17.575822411940983,
"logits/rejected": -15.71341222924891,
"logps/chosen": -628.3108444213867,
"logps/rejected": -381.9364585876465,
"loss": 0.984896183013916,
"mean_token_accuracy": 0.7500499114394188,
"num_tokens": 6671308.0,
"rewards/accuracies": 0.75,
"rewards/chosen": -0.02526119421236217,
"rewards/margins": 0.060638573253527284,
"rewards/rejected": -0.0858997656032443,
"step": 118
},
{
"entropy": 1.1464358419179916,
"epoch": 0.07461984637090453,
"grad_norm": 29.262676239013672,
"learning_rate": 9.996423562845978e-07,
"logits/chosen": -18.950197207830822,
"logits/rejected": -17.89534831083926,
"logps/chosen": -499.1498966217041,
"logps/rejected": -397.74127197265625,
"loss": 0.9772639274597168,
"mean_token_accuracy": 0.7390127554535866,
"num_tokens": 6707362.0,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.014790326356887817,
"rewards/margins": 0.09125107247382402,
"rewards/rejected": -0.07646074634976685,
"step": 119
},
{
"entropy": 1.1956902518868446,
"epoch": 0.07524690390343314,
"grad_norm": 31.247859954833984,
"learning_rate": 9.996015196811054e-07,
"logits/chosen": -16.430566598689513,
"logits/rejected": -16.301428702284802,
"logps/chosen": -712.8943672180176,
"logps/rejected": -467.7664604187012,
"loss": 0.9875868558883667,
"mean_token_accuracy": 0.7251445576548576,
"num_tokens": 6761518.0,
"rewards/accuracies": 0.625,
"rewards/chosen": 0.00015118438750505447,
"rewards/margins": 0.05001709656789899,
"rewards/rejected": -0.04986591334454715,
"step": 120
},
{
"entropy": 1.04892847687006,
"epoch": 0.07587396143596174,
"grad_norm": 36.938690185546875,
"learning_rate": 9.995584768975734e-07,
"logits/chosen": -20.353520038495564,
"logits/rejected": -18.411114375084413,
"logps/chosen": -787.6422328948975,
"logps/rejected": -501.9888114929199,
"loss": 0.9638845920562744,
"mean_token_accuracy": 0.7510411590337753,
"num_tokens": 6814204.0,
"rewards/accuracies": 0.84375,
"rewards/chosen": 0.037587814789731055,
"rewards/margins": 0.1457526022568345,
"rewards/rejected": -0.10816478868946433,
"step": 121
},
{
"entropy": 0.911387711763382,
"epoch": 0.07650101896849036,
"grad_norm": 30.251392364501953,
"learning_rate": 9.995132281240734e-07,
"logits/chosen": -19.869032639332318,
"logits/rejected": -18.91703122960338,
"logps/chosen": -582.7686996459961,
"logps/rejected": -366.2984085083008,
"loss": 0.9788750410079956,
"mean_token_accuracy": 0.7888387069106102,
"num_tokens": 6861531.0,
"rewards/accuracies": 0.84375,
"rewards/chosen": 0.003442022774834186,
"rewards/margins": 0.0853227588813752,
"rewards/rejected": -0.08188073709607124,
"step": 122
},
{
"entropy": 1.0427976697683334,
"epoch": 0.07712807650101897,
"grad_norm": 36.89279556274414,
"learning_rate": 9.994657735604188e-07,
"logits/chosen": -24.044872176023844,
"logits/rejected": -22.597699453222447,
"logps/chosen": -966.8881568908691,
"logps/rejected": -505.8887948989868,
"loss": 0.9708135724067688,
"mean_token_accuracy": 0.7332872226834297,
"num_tokens": 6921458.0,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.012047640164382756,
"rewards/margins": 0.11771579552441835,
"rewards/rejected": -0.10566815291531384,
"step": 123
},
{
"entropy": 1.0259113758802414,
"epoch": 0.07775513403354758,
"grad_norm": 37.096275329589844,
"learning_rate": 9.994161134161632e-07,
"logits/chosen": -19.591871441281974,
"logits/rejected": -20.936406703396575,
"logps/chosen": -818.1269016265869,
"logps/rejected": -639.8456077575684,
"loss": 0.9665595293045044,
"mean_token_accuracy": 0.7770890146493912,
"num_tokens": 6982937.0,
"rewards/accuracies": 0.84375,
"rewards/chosen": 0.020557800424285233,
"rewards/margins": 0.13559715449810028,
"rewards/rejected": -0.11503935337532312,
"step": 124
},
{
"entropy": 1.1710731238126755,
"epoch": 0.07838219156607619,
"grad_norm": 42.78230667114258,
"learning_rate": 9.993642479105997e-07,
"logits/chosen": -24.393052790442358,
"logits/rejected": -18.192713037735032,
"logps/chosen": -1177.7320861816406,
"logps/rejected": -522.7479839324951,
"loss": 0.9867607355117798,
"mean_token_accuracy": 0.712364636361599,
"num_tokens": 7046947.0,
"rewards/accuracies": 0.71875,
"rewards/chosen": -0.02724925708025694,
"rewards/margins": 0.052655004314146936,
"rewards/rejected": -0.07990426244214177,
"step": 125
},
{
"entropy": 1.1666254326701164,
"epoch": 0.0790092490986048,
"grad_norm": 32.3548469543457,
"learning_rate": 9.993101772727601e-07,
"logits/chosen": -17.63798263385176,
"logits/rejected": -17.47313740458377,
"logps/chosen": -606.1291179656982,
"logps/rejected": -430.56521797180176,
"loss": 0.9682327508926392,
"mean_token_accuracy": 0.7458649724721909,
"num_tokens": 7102060.0,
"rewards/accuracies": 0.8125,
"rewards/chosen": 0.0330769574502483,
"rewards/margins": 0.13182413554750383,
"rewards/rejected": -0.09874717495404184,
"step": 126
},
{
"entropy": 1.1291334107518196,
"epoch": 0.07963630663113341,
"grad_norm": 31.756563186645508,
"learning_rate": 9.99253901741414e-07,
"logits/chosen": -21.307392332824012,
"logits/rejected": -20.84085959531398,
"logps/chosen": -732.371265411377,
"logps/rejected": -503.3115940093994,
"loss": 0.9792959690093994,
"mean_token_accuracy": 0.7251338735222816,
"num_tokens": 7157801.0,
"rewards/accuracies": 0.75,
"rewards/chosen": 0.018919202295364812,
"rewards/margins": 0.08486578240990639,
"rewards/rejected": -0.06594657967798412,
"step": 127
},
{
"entropy": 1.1786841079592705,
"epoch": 0.08026336416366202,
"grad_norm": 40.29298782348633,
"learning_rate": 9.99195421565067e-07,
"logits/chosen": -17.529350354706732,
"logits/rejected": -20.833092058953017,
"logps/chosen": -1033.621503829956,
"logps/rejected": -691.7955369949341,
"loss": 0.9725984334945679,
"mean_token_accuracy": 0.7169393450021744,
"num_tokens": 7224323.0,
"rewards/accuracies": 0.8125,
"rewards/chosen": -0.006326087401248515,
"rewards/margins": 0.11025936878286302,
"rewards/rejected": -0.11658545769751072,
"step": 128
},
{
"entropy": 1.1065169423818588,
"epoch": 0.08089042169619062,
"grad_norm": 30.228065490722656,
"learning_rate": 9.991347370019609e-07,
"logits/chosen": -18.675428265484687,
"logits/rejected": -18.02665901699452,
"logps/chosen": -738.0616884231567,
"logps/rejected": -413.77689933776855,
"loss": 0.9663163423538208,
"mean_token_accuracy": 0.7391728013753891,
"num_tokens": 7273940.0,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.04217634559608996,
"rewards/margins": 0.1416997853666544,
"rewards/rejected": -0.09952343860641122,
"step": 129
},
{
"entropy": 1.0223164483904839,
"epoch": 0.08151747922871924,
"grad_norm": 36.71884536743164,
"learning_rate": 9.990718483200711e-07,
"logits/chosen": -24.017658505382084,
"logits/rejected": -19.894383210249206,
"logps/chosen": -853.0483455657959,
"logps/rejected": -410.2704782485962,
"loss": 0.9696524739265442,
"mean_token_accuracy": 0.7612569332122803,
"num_tokens": 7330670.0,
"rewards/accuracies": 0.75,
"rewards/chosen": 0.022751914570108056,
"rewards/margins": 0.12564924580510706,
"rewards/rejected": -0.10289733344689012,
"step": 130
},
{
"entropy": 1.188691645860672,
"epoch": 0.08214453676124785,
"grad_norm": 45.50562286376953,
"learning_rate": 9.990067557971066e-07,
"logits/chosen": -20.96738395725814,
"logits/rejected": -18.577314710392834,
"logps/chosen": -1276.1438827514648,
"logps/rejected": -671.3540458679199,
"loss": 0.9635441303253174,
"mean_token_accuracy": 0.7195305675268173,
"num_tokens": 7400528.0,
"rewards/accuracies": 0.84375,
"rewards/chosen": 0.027424347819760442,
"rewards/margins": 0.14744434040039778,
"rewards/rejected": -0.1200199886225164,
"step": 131
},
{
"entropy": 0.9636916220188141,
"epoch": 0.08277159429377645,
"grad_norm": 28.21497344970703,
"learning_rate": 9.989394597205082e-07,
"logits/chosen": -17.83059240747361,
"logits/rejected": -17.95696408960033,
"logps/chosen": -485.29137802124023,
"logps/rejected": -400.46766471862793,
"loss": 0.976447343826294,
"mean_token_accuracy": 0.7697746828198433,
"num_tokens": 7462922.0,
"rewards/accuracies": 0.78125,
"rewards/chosen": 0.010323267662897706,
"rewards/margins": 0.09466969268396497,
"rewards/rejected": -0.08434642176143825,
"step": 132
},
{
"entropy": 0.9702051728963852,
"epoch": 0.08339865182630507,
"grad_norm": 35.21070861816406,
"learning_rate": 9.98869960387447e-07,
"logits/chosen": -24.15228929902058,
"logits/rejected": -17.62097141810482,
"logps/chosen": -707.7485370635986,
"logps/rejected": -328.29246520996094,
"loss": 0.9750052690505981,
"mean_token_accuracy": 0.7517875507473946,
"num_tokens": 7516053.0,
"rewards/accuracies": 0.84375,
"rewards/chosen": 0.020313383429311216,
"rewards/margins": 0.10041370801627636,
"rewards/rejected": -0.08010032417951152,
"step": 133
},
{
"entropy": 1.080765277147293,
"epoch": 0.08402570935883368,
"grad_norm": 33.306419372558594,
"learning_rate": 9.98798258104824e-07,
"logits/chosen": -16.50647893746725,
"logits/rejected": -18.638188273587172,
"logps/chosen": -394.3768768310547,
"logps/rejected": -530.8435726165771,
"loss": 0.9684998393058777,
"mean_token_accuracy": 0.7539431154727936,
"num_tokens": 7560146.0,
"rewards/accuracies": 0.875,
"rewards/chosen": -0.008416369266342372,
"rewards/margins": 0.12770695355720818,
"rewards/rejected": -0.13612332614138722,
"step": 134
},
{
"entropy": 1.0699984654784203,
"epoch": 0.08465276689136228,
"grad_norm": 29.02651596069336,
"learning_rate": 9.987243531892676e-07,
"logits/chosen": -17.323968607265364,
"logits/rejected": -17.327844017915886,
"logps/chosen": -423.5040798187256,
"logps/rejected": -401.37097549438477,
"loss": 0.9706511497497559,
"mean_token_accuracy": 0.7508202418684959,
"num_tokens": 7604430.0,
"rewards/accuracies": 0.84375,
"rewards/chosen": 0.010786252591060475,
"rewards/margins": 0.11822709790430963,
"rewards/rejected": -0.10744084196630865,
"step": 135
},
{
"entropy": 1.1741472780704498,
"epoch": 0.0852798244238909,
"grad_norm": 29.518667221069336,
"learning_rate": 9.98648245967133e-07,
"logits/chosen": -17.057511505199,
"logits/rejected": -15.816799192033697,
"logps/chosen": -578.4385671615601,
"logps/rejected": -470.2986297607422,
"loss": 0.9768874645233154,
"mean_token_accuracy": 0.7322021424770355,
"num_tokens": 7661280.0,
"rewards/accuracies": 0.75,
"rewards/chosen": 0.018278606235980988,
"rewards/margins": 0.09282787260599434,
"rewards/rejected": -0.07454926625359803,
"step": 136
},
{
"entropy": 1.1715349406003952,
"epoch": 0.0859068819564195,
"grad_norm": 35.8231086730957,
"learning_rate": 9.985699367745007e-07,
"logits/chosen": -20.207632968359622,
"logits/rejected": -18.918033251926897,
"logps/chosen": -1063.0584182739258,
"logps/rejected": -546.3697662353516,
"loss": 0.9809889793395996,
"mean_token_accuracy": 0.7140867561101913,
"num_tokens": 7723139.0,
"rewards/accuracies": 0.75,
"rewards/chosen": -0.016168745700269938,
"rewards/margins": 0.07651804899796844,
"rewards/rejected": -0.09268679865635931,
"step": 137
},
{
"entropy": 1.0441111102700233,
"epoch": 0.08653393948894811,
"grad_norm": 32.78045654296875,
"learning_rate": 9.984894259571743e-07,
"logits/chosen": -19.221359907309978,
"logits/rejected": -18.10666979652929,
"logps/chosen": -489.88498306274414,
"logps/rejected": -398.86695098876953,
"loss": 0.9633641242980957,
"mean_token_accuracy": 0.7486372217535973,
"num_tokens": 7766818.0,
"rewards/accuracies": 0.96875,
"rewards/chosen": 0.011141044669784606,
"rewards/margins": 0.14769388129934669,
"rewards/rejected": -0.1365528372116387,
"step": 138
},
{
"entropy": 1.1274549514055252,
"epoch": 0.08716099702147673,
"grad_norm": 28.61403465270996,
"learning_rate": 9.984067138706801e-07,
"logits/chosen": -20.09536989108541,
"logits/rejected": -19.089721130331522,
"logps/chosen": -668.453311920166,
"logps/rejected": -400.32433700561523,
"loss": 0.9768990278244019,
"mean_token_accuracy": 0.7357787117362022,
"num_tokens": 7805514.0,
"rewards/accuracies": 0.65625,
"rewards/chosen": 0.008357231738045812,
"rewards/margins": 0.09283104329369962,
"rewards/rejected": -0.08447381528094411,
"step": 139
},
{
"entropy": 1.072766751050949,
"epoch": 0.08778805455400533,
"grad_norm": 36.328330993652344,
"learning_rate": 9.983218008802647e-07,
"logits/chosen": -16.597205351543526,
"logits/rejected": -17.38877890508226,
"logps/chosen": -845.426420211792,
"logps/rejected": -446.5038776397705,
"loss": 0.969933271408081,
"mean_token_accuracy": 0.7438737154006958,
"num_tokens": 7867552.0,
"rewards/accuracies": 0.8125,
"rewards/chosen": -0.004711989313364029,
"rewards/margins": 0.12162661645561457,
"rewards/rejected": -0.12633860250934958,
"step": 140
},
{
"entropy": 1.1710950955748558,
"epoch": 0.08841511208653394,
"grad_norm": 35.29788589477539,
"learning_rate": 9.982346873608936e-07,
"logits/chosen": -17.457327570012882,
"logits/rejected": -17.907635026265908,
"logps/chosen": -594.5470962524414,
"logps/rejected": -608.6735458374023,
"loss": 0.9617944359779358,
"mean_token_accuracy": 0.7367723286151886,
"num_tokens": 7913056.0,
"rewards/accuracies": 0.90625,
"rewards/chosen": 0.0014770900015719235,
"rewards/margins": 0.15395231172442436,
"rewards/rejected": -0.15247522108256817,
"step": 141
},
{
"entropy": 1.0754098296165466,
"epoch": 0.08904216961906256,
"grad_norm": 35.45695877075195,
"learning_rate": 9.981453736972495e-07,
"logits/chosen": -19.118562752807563,
"logits/rejected": -16.91145482295967,
"logps/chosen": -698.3301868438721,
"logps/rejected": -497.7921562194824,
"loss": 0.9720945954322815,
"mean_token_accuracy": 0.7595574334263802,
"num_tokens": 7980591.0,
"rewards/accuracies": 0.71875,
"rewards/chosen": 0.01288341250619851,
"rewards/margins": 0.11340800416655838,
"rewards/rejected": -0.10052459384314716,
"step": 142
},
{
"entropy": 0.9044511765241623,
"epoch": 0.08966922715159116,
"grad_norm": 30.17085075378418,
"learning_rate": 9.98053860283731e-07,
"logits/chosen": -21.207617728808614,
"logits/rejected": -20.905731823651053,
"logps/chosen": -628.0943202972412,
"logps/rejected": -420.4750385284424,
"loss": 0.9711873531341553,
"mean_token_accuracy": 0.7811061069369316,
"num_tokens": 8034884.0,
"rewards/accuracies": 0.78125,
"rewards/chosen": 0.023002621717751026,
"rewards/margins": 0.1186411960516125,
"rewards/rejected": -0.09563857619650662,
"step": 143
},
{
"entropy": 1.1677963212132454,
"epoch": 0.09029628468411977,
"grad_norm": 31.993118286132812,
"learning_rate": 9.9796014752445e-07,
"logits/chosen": -18.57265198556839,
"logits/rejected": -17.995440262698004,
"logps/chosen": -658.4226865768433,
"logps/rejected": -438.4370231628418,
"loss": 0.9786888360977173,
"mean_token_accuracy": 0.7285968512296677,
"num_tokens": 8082039.0,
"rewards/accuracies": 0.78125,
"rewards/chosen": -0.02490088331978768,
"rewards/margins": 0.08490909356623888,
"rewards/rejected": -0.10980997630394995,
"step": 144
},
{
"entropy": 1.0427600964903831,
"epoch": 0.09092334221664838,
"grad_norm": 31.311111450195312,
"learning_rate": 9.978642358332307e-07,
"logits/chosen": -19.139753277032113,
"logits/rejected": -17.59120642360813,
"logps/chosen": -567.9225654602051,
"logps/rejected": -465.25221252441406,
"loss": 0.9686312675476074,
"mean_token_accuracy": 0.7571733519434929,
"num_tokens": 8123718.0,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.008705203887075186,
"rewards/margins": 0.12602692190557718,
"rewards/rejected": -0.117321718018502,
"step": 145
},
{
"entropy": 0.8850021287798882,
"epoch": 0.09155039974917699,
"grad_norm": 37.63220977783203,
"learning_rate": 9.97766125633608e-07,
"logits/chosen": -19.910044793415654,
"logits/rejected": -22.54540787489115,
"logps/chosen": -699.3141222000122,
"logps/rejected": -466.68331146240234,
"loss": 0.9604589939117432,
"mean_token_accuracy": 0.7936916127800941,
"num_tokens": 8187632.0,
"rewards/accuracies": 0.8125,
"rewards/chosen": -0.003929961123503745,
"rewards/margins": 0.168057446135208,
"rewards/rejected": -0.17198741296306252,
"step": 146
},
{
"entropy": 1.0326995179057121,
"epoch": 0.0921774572817056,
"grad_norm": 37.081241607666016,
"learning_rate": 9.976658173588243e-07,
"logits/chosen": -21.190682950448576,
"logits/rejected": -17.69587061048208,
"logps/chosen": -751.942907333374,
"logps/rejected": -442.78441619873047,
"loss": 0.9758281707763672,
"mean_token_accuracy": 0.7523355558514595,
"num_tokens": 8243290.0,
"rewards/accuracies": 0.8125,
"rewards/chosen": -0.02370329963741824,
"rewards/margins": 0.09733096603304148,
"rewards/rejected": -0.12103426642715931,
"step": 147
},
{
"entropy": 0.9734203144907951,
"epoch": 0.09280451481423421,
"grad_norm": 36.707550048828125,
"learning_rate": 9.97563311451829e-07,
"logits/chosen": -23.493140481868807,
"logits/rejected": -19.432473725597365,
"logps/chosen": -1202.7809944152832,
"logps/rejected": -374.36139488220215,
"loss": 0.9666430950164795,
"mean_token_accuracy": 0.7533522471785545,
"num_tokens": 8312496.0,
"rewards/accuracies": 0.71875,
"rewards/chosen": 0.040649566042702645,
"rewards/margins": 0.13564491388387978,
"rewards/rejected": -0.0949953489471227,
"step": 148
},
{
"entropy": 1.3850471526384354,
"epoch": 0.09343157234676282,
"grad_norm": 31.51274871826172,
"learning_rate": 9.974586083652757e-07,
"logits/chosen": -18.153076228160014,
"logits/rejected": -16.684204876050245,
"logps/chosen": -845.3816833496094,
"logps/rejected": -408.8254728317261,
"loss": 0.9770760536193848,
"mean_token_accuracy": 0.6601794064044952,
"num_tokens": 8362689.0,
"rewards/accuracies": 0.9375,
"rewards/chosen": -0.018910931539721787,
"rewards/margins": 0.09186943899840117,
"rewards/rejected": -0.11078036949038506,
"step": 149
},
{
"entropy": 1.0344312191009521,
"epoch": 0.09405862987929142,
"grad_norm": 37.89040756225586,
"learning_rate": 9.97351708561521e-07,
"logits/chosen": -23.15418936171772,
"logits/rejected": -19.21865452626319,
"logps/chosen": -769.2827854156494,
"logps/rejected": -666.4356002807617,
"loss": 0.9749352335929871,
"mean_token_accuracy": 0.7564720064401627,
"num_tokens": 8420985.0,
"rewards/accuracies": 0.8125,
"rewards/chosen": -0.009593813680112362,
"rewards/margins": 0.10142657672986388,
"rewards/rejected": -0.1110203885473311,
"step": 150
},
{
"entropy": 1.175799421966076,
"epoch": 0.09468568741182004,
"grad_norm": 40.132625579833984,
"learning_rate": 9.972426125126207e-07,
"logits/chosen": -21.38852635915963,
"logits/rejected": -18.672145327724344,
"logps/chosen": -1471.715404510498,
"logps/rejected": -486.47255516052246,
"loss": 0.980172336101532,
"mean_token_accuracy": 0.721579059958458,
"num_tokens": 8489644.0,
"rewards/accuracies": 0.75,
"rewards/chosen": -0.03523680008947849,
"rewards/margins": 0.0802477840334177,
"rewards/rejected": -0.11548458551988006,
"step": 151
},
{
"entropy": 1.4164262264966965,
"epoch": 0.09531274494434865,
"grad_norm": 27.696420669555664,
"learning_rate": 9.971313207003307e-07,
"logits/chosen": -13.93982345493672,
"logits/rejected": -14.11517608202279,
"logps/chosen": -740.9725232124329,
"logps/rejected": -564.2864780426025,
"loss": 0.9797288179397583,
"mean_token_accuracy": 0.6809670105576515,
"num_tokens": 8537512.0,
"rewards/accuracies": 0.65625,
"rewards/chosen": -0.0021716501796618104,
"rewards/margins": 0.08156625635456294,
"rewards/rejected": -0.08373790187761188,
"step": 152
},
{
"entropy": 1.263432890176773,
"epoch": 0.09593980247687725,
"grad_norm": 31.5176944732666,
"learning_rate": 9.970178336161016e-07,
"logits/chosen": -16.973323202222108,
"logits/rejected": -19.614638086614725,
"logps/chosen": -711.4418649673462,
"logps/rejected": -372.44454193115234,
"loss": 0.9762611389160156,
"mean_token_accuracy": 0.7092464938759804,
"num_tokens": 8591662.0,
"rewards/accuracies": 0.84375,
"rewards/chosen": -0.0145274052338209,
"rewards/margins": 0.09459308302029967,
"rewards/rejected": -0.10912049002945423,
"step": 153
},
{
"entropy": 1.1620648950338364,
"epoch": 0.09656686000940587,
"grad_norm": 30.509321212768555,
"learning_rate": 9.969021517610792e-07,
"logits/chosen": -13.79756665559363,
"logits/rejected": -15.715619490328542,
"logps/chosen": -604.1418495178223,
"logps/rejected": -382.564510345459,
"loss": 0.9641399383544922,
"mean_token_accuracy": 0.726889930665493,
"num_tokens": 8636893.0,
"rewards/accuracies": 0.75,
"rewards/chosen": -0.0023322205524891615,
"rewards/margins": 0.14497205498628318,
"rewards/rejected": -0.1473042806610465,
"step": 154
},
{
"entropy": 1.1641441136598587,
"epoch": 0.09719391754193447,
"grad_norm": 41.579978942871094,
"learning_rate": 9.967842756461002e-07,
"logits/chosen": -20.334094398749123,
"logits/rejected": -22.011842279254914,
"logps/chosen": -1403.928207397461,
"logps/rejected": -554.649658203125,
"loss": 0.9708878397941589,
"mean_token_accuracy": 0.72523083537817,
"num_tokens": 8717868.0,
"rewards/accuracies": 0.71875,
"rewards/chosen": 0.00970022683031857,
"rewards/margins": 0.11776156397536397,
"rewards/rejected": -0.10806133644655347,
"step": 155
},
{
"entropy": 1.2410652860999107,
"epoch": 0.09782097507446308,
"grad_norm": 125.10015106201172,
"learning_rate": 9.966642057916914e-07,
"logits/chosen": -18.70830338783564,
"logits/rejected": -19.97097714965005,
"logps/chosen": -1191.791633605957,
"logps/rejected": -752.3146705627441,
"loss": 0.9524157643318176,
"mean_token_accuracy": 0.7021138742566109,
"num_tokens": 8807483.0,
"rewards/accuracies": 0.8125,
"rewards/chosen": -0.0013844413042534143,
"rewards/margins": 0.19747850112617016,
"rewards/rejected": -0.19886294193565845,
"step": 156
},
{
"entropy": 1.029944323003292,
"epoch": 0.0984480326069917,
"grad_norm": 35.78042221069336,
"learning_rate": 9.965419427280668e-07,
"logits/chosen": -23.38625175610134,
"logits/rejected": -20.01934285422626,
"logps/chosen": -1151.3675441741943,
"logps/rejected": -498.4595642089844,
"loss": 0.9675576090812683,
"mean_token_accuracy": 0.7536375895142555,
"num_tokens": 8887962.0,
"rewards/accuracies": 0.75,
"rewards/chosen": 0.03968535171588883,
"rewards/margins": 0.13185083586722612,
"rewards/rejected": -0.09216548292897642,
"step": 157
},
{
"entropy": 1.1238584071397781,
"epoch": 0.0990750901395203,
"grad_norm": 35.993568420410156,
"learning_rate": 9.964174869951254e-07,
"logits/chosen": -13.67164112165123,
"logits/rejected": -19.3182056629662,
"logps/chosen": -457.62388134002686,
"logps/rejected": -487.38970375061035,
"loss": 0.9535990953445435,
"mean_token_accuracy": 0.7514778524637222,
"num_tokens": 8930150.0,
"rewards/accuracies": 0.84375,
"rewards/chosen": -0.004519644775427878,
"rewards/margins": 0.18916182266548276,
"rewards/rejected": -0.19368146173655987,
"step": 158
},
{
"entropy": 0.9919542148709297,
"epoch": 0.09970214767204891,
"grad_norm": 35.438880920410156,
"learning_rate": 9.962908391424487e-07,
"logits/chosen": -24.406944580639333,
"logits/rejected": -21.38588868915605,
"logps/chosen": -899.7554340362549,
"logps/rejected": -343.76156425476074,
"loss": 0.9654215574264526,
"mean_token_accuracy": 0.7644909620285034,
"num_tokens": 8991665.0,
"rewards/accuracies": 0.84375,
"rewards/chosen": 0.006943491520360112,
"rewards/margins": 0.14082542480900884,
"rewards/rejected": -0.1338819395750761,
"step": 159
},
{
"entropy": 1.0232055224478245,
"epoch": 0.10032920520457753,
"grad_norm": 31.05710220336914,
"learning_rate": 9.961619997292983e-07,
"logits/chosen": -17.982335887836616,
"logits/rejected": -20.611772617446324,
"logps/chosen": -540.6755952835083,
"logps/rejected": -586.5883369445801,
"loss": 0.9546467065811157,
"mean_token_accuracy": 0.7635128647089005,
"num_tokens": 9042126.0,
"rewards/accuracies": 0.90625,
"rewards/chosen": -0.0020738002785947174,
"rewards/margins": 0.19118777592666447,
"rewards/rejected": -0.19326158007606864,
"step": 160
},
{
"entropy": 1.0774603635072708,
"epoch": 0.10095626273710613,
"grad_norm": 30.445066452026367,
"learning_rate": 9.960309693246134e-07,
"logits/chosen": -16.290460512960674,
"logits/rejected": -18.012763543697705,
"logps/chosen": -576.4469928741455,
"logps/rejected": -511.25352478027344,
"loss": 0.9666774868965149,
"mean_token_accuracy": 0.7399578765034676,
"num_tokens": 9088125.0,
"rewards/accuracies": 0.90625,
"rewards/chosen": -0.01442447875160724,
"rewards/margins": 0.1348671750165522,
"rewards/rejected": -0.14929165970534086,
"step": 161
},
{
"entropy": 1.0612441897392273,
"epoch": 0.10158332026963474,
"grad_norm": 37.424896240234375,
"learning_rate": 9.958977485070087e-07,
"logits/chosen": -19.54973934978431,
"logits/rejected": -21.830906008805396,
"logps/chosen": -839.8476104736328,
"logps/rejected": -619.4777336120605,
"loss": 0.9631219506263733,
"mean_token_accuracy": 0.7454415857791901,
"num_tokens": 9147591.0,
"rewards/accuracies": 0.8125,
"rewards/chosen": -0.027470878849271685,
"rewards/margins": 0.14951888378709555,
"rewards/rejected": -0.17698976676911116,
"step": 162
},
{
"entropy": 0.8433318734169006,
"epoch": 0.10221037780216335,
"grad_norm": 36.499000549316406,
"learning_rate": 9.957623378647708e-07,
"logits/chosen": -22.97117871622693,
"logits/rejected": -23.077180808340206,
"logps/chosen": -762.8622913360596,
"logps/rejected": -496.52293968200684,
"loss": 0.9598798155784607,
"mean_token_accuracy": 0.7907682359218597,
"num_tokens": 9204397.0,
"rewards/accuracies": 0.75,
"rewards/chosen": 0.008882903959602118,
"rewards/margins": 0.16420582123100758,
"rewards/rejected": -0.15532291657291353,
"step": 163
},
{
"entropy": 1.1806890442967415,
"epoch": 0.10283743533469196,
"grad_norm": 45.862754821777344,
"learning_rate": 9.956247379958574e-07,
"logits/chosen": -19.059974763772217,
"logits/rejected": -18.85946041293872,
"logps/chosen": -1369.5862731933594,
"logps/rejected": -567.7572498321533,
"loss": 0.9552696943283081,
"mean_token_accuracy": 0.7177683860063553,
"num_tokens": 9271429.0,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.03492974303662777,
"rewards/margins": 0.18170535750687122,
"rewards/rejected": -0.14677561353892088,
"step": 164
},
{
"entropy": 1.0775589682161808,
"epoch": 0.10346449286722056,
"grad_norm": 29.601449966430664,
"learning_rate": 9.954849495078926e-07,
"logits/chosen": -19.275060518402277,
"logits/rejected": -19.166819179421008,
"logps/chosen": -660.1427116394043,
"logps/rejected": -383.6678161621094,
"loss": 0.958690881729126,
"mean_token_accuracy": 0.7361882030963898,
"num_tokens": 9312257.0,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.03519108361797407,
"rewards/margins": 0.1664116713218391,
"rewards/rejected": -0.13122059125453234,
"step": 165
},
{
"entropy": 1.1816764548420906,
"epoch": 0.10409155039974918,
"grad_norm": 30.252086639404297,
"learning_rate": 9.953429730181652e-07,
"logits/chosen": -16.37164589704853,
"logits/rejected": -15.937881459823364,
"logps/chosen": -442.10915756225586,
"logps/rejected": -464.68394470214844,
"loss": 0.9728706479072571,
"mean_token_accuracy": 0.7251901105046272,
"num_tokens": 9350579.0,
"rewards/accuracies": 0.875,
"rewards/chosen": -0.025675334269180894,
"rewards/margins": 0.10957675683312118,
"rewards/rejected": -0.13525208923965693,
"step": 166
},
{
"entropy": 1.0316157564520836,
"epoch": 0.10471860793227779,
"grad_norm": 39.15115737915039,
"learning_rate": 9.95198809153627e-07,
"logits/chosen": -17.97388225518009,
"logits/rejected": -17.878072330124738,
"logps/chosen": -963.8222351074219,
"logps/rejected": -576.2222747802734,
"loss": 0.9726594686508179,
"mean_token_accuracy": 0.7661974504590034,
"num_tokens": 9420912.0,
"rewards/accuracies": 0.78125,
"rewards/chosen": -0.039964041672647,
"rewards/margins": 0.10996103240177035,
"rewards/rejected": -0.14992507733404636,
"step": 167
},
{
"entropy": 0.9888377711176872,
"epoch": 0.10534566546480639,
"grad_norm": 33.86361312866211,
"learning_rate": 9.950524585508875e-07,
"logits/chosen": -21.71417541647197,
"logits/rejected": -21.1007052103952,
"logps/chosen": -570.1340103149414,
"logps/rejected": -569.658317565918,
"loss": 0.965457558631897,
"mean_token_accuracy": 0.7609636634588242,
"num_tokens": 9472501.0,
"rewards/accuracies": 0.90625,
"rewards/chosen": 0.004693154362030327,
"rewards/margins": 0.13876159954816103,
"rewards/rejected": -0.13406844343990088,
"step": 168
},
{
"entropy": 1.1498691216111183,
"epoch": 0.10597272299733501,
"grad_norm": 35.466957092285156,
"learning_rate": 9.949039218562137e-07,
"logits/chosen": -23.389534862650184,
"logits/rejected": -20.17964972359958,
"logps/chosen": -982.7829933166504,
"logps/rejected": -726.9613132476807,
"loss": 0.9566149711608887,
"mean_token_accuracy": 0.7251748219132423,
"num_tokens": 9543720.0,
"rewards/accuracies": 0.9375,
"rewards/chosen": -0.003413940197788179,
"rewards/margins": 0.1751425163820386,
"rewards/rejected": -0.17855645716190338,
"step": 169
},
{
"entropy": 0.8980679214000702,
"epoch": 0.10659978052986362,
"grad_norm": 40.1265754699707,
"learning_rate": 9.947531997255256e-07,
"logits/chosen": -24.576026786001893,
"logits/rejected": -21.24743446770542,
"logps/chosen": -646.5030174255371,
"logps/rejected": -609.3380126953125,
"loss": 0.946999728679657,
"mean_token_accuracy": 0.8074663206934929,
"num_tokens": 9599025.0,
"rewards/accuracies": 0.90625,
"rewards/chosen": 0.024876392912119627,
"rewards/margins": 0.21698989067226648,
"rewards/rejected": -0.19211349356919527,
"step": 170
},
{
"entropy": 1.041010521352291,
"epoch": 0.10722683806239222,
"grad_norm": 27.908248901367188,
"learning_rate": 9.946002928243938e-07,
"logits/chosen": -17.12985163970272,
"logits/rejected": -18.323306945407023,
"logps/chosen": -343.0621109008789,
"logps/rejected": -436.75281524658203,
"loss": 0.9608134031295776,
"mean_token_accuracy": 0.7628256380558014,
"num_tokens": 9635752.0,
"rewards/accuracies": 0.9375,
"rewards/chosen": -0.014670340926386416,
"rewards/margins": 0.15794761665165424,
"rewards/rejected": -0.1726179551333189,
"step": 171
},
{
"entropy": 0.9685352593660355,
"epoch": 0.10785389559492084,
"grad_norm": 44.593017578125,
"learning_rate": 9.94445201828037e-07,
"logits/chosen": -25.693284187291074,
"logits/rejected": -20.638393007437365,
"logps/chosen": -1019.63330078125,
"logps/rejected": -641.4812908172607,
"loss": 0.9540131092071533,
"mean_token_accuracy": 0.7625846937298775,
"num_tokens": 9707928.0,
"rewards/accuracies": 0.875,
"rewards/chosen": -0.051992423948831856,
"rewards/margins": 0.18558591045439243,
"rewards/rejected": -0.23757833428680897,
"step": 172
},
{
"entropy": 1.035721518099308,
"epoch": 0.10848095312744944,
"grad_norm": 36.23087692260742,
"learning_rate": 9.942879274213183e-07,
"logits/chosen": -25.004740833477207,
"logits/rejected": -21.763571870178154,
"logps/chosen": -1005.9208698272705,
"logps/rejected": -417.8051815032959,
"loss": 0.9568801522254944,
"mean_token_accuracy": 0.7389874830842018,
"num_tokens": 9762747.0,
"rewards/accuracies": 0.84375,
"rewards/chosen": 0.041769477422349155,
"rewards/margins": 0.17441253177821636,
"rewards/rejected": -0.13264305610209703,
"step": 173
},
{
"entropy": 1.2502099946141243,
"epoch": 0.10910801065997805,
"grad_norm": 26.709156036376953,
"learning_rate": 9.941284702987425e-07,
"logits/chosen": -15.603563936993165,
"logits/rejected": -17.525335746655358,
"logps/chosen": -483.58291244506836,
"logps/rejected": -384.8349323272705,
"loss": 0.9618538618087769,
"mean_token_accuracy": 0.706192672252655,
"num_tokens": 9801642.0,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.01173106487840414,
"rewards/margins": 0.15353717282414436,
"rewards/rejected": -0.1418061126023531,
"step": 174
},
{
"entropy": 1.0089079961180687,
"epoch": 0.10973506819250667,
"grad_norm": 34.94546890258789,
"learning_rate": 9.939668311644527e-07,
"logits/chosen": -21.48884231436644,
"logits/rejected": -20.73044133310641,
"logps/chosen": -809.1402287483215,
"logps/rejected": -620.0923671722412,
"loss": 0.9594979286193848,
"mean_token_accuracy": 0.764327310025692,
"num_tokens": 9861136.0,
"rewards/accuracies": 0.8125,
"rewards/chosen": 0.0033170885872095823,
"rewards/margins": 0.1640703366138041,
"rewards/rejected": -0.1607532473281026,
"step": 175
},
{
"entropy": 1.134946659207344,
"epoch": 0.11036212572503527,
"grad_norm": 40.56920623779297,
"learning_rate": 9.938030107322283e-07,
"logits/chosen": -20.60884003968547,
"logits/rejected": -21.315807587757533,
"logps/chosen": -1011.4535865783691,
"logps/rejected": -677.3356189727783,
"loss": 0.9518853425979614,
"mean_token_accuracy": 0.7143147438764572,
"num_tokens": 9940296.0,
"rewards/accuracies": 0.875,
"rewards/chosen": -0.020753700169734657,
"rewards/margins": 0.2017311709932983,
"rewards/rejected": -0.2224848661571741,
"step": 176
},
{
"entropy": 1.1413284689188004,
"epoch": 0.11098918325756388,
"grad_norm": 34.17391586303711,
"learning_rate": 9.936370097254803e-07,
"logits/chosen": -18.22259319683248,
"logits/rejected": -16.596884329014106,
"logps/chosen": -748.4427871704102,
"logps/rejected": -550.8146286010742,
"loss": 0.9616140127182007,
"mean_token_accuracy": 0.7435401454567909,
"num_tokens": 9992025.0,
"rewards/accuracies": 0.78125,
"rewards/chosen": 0.020526117412373424,
"rewards/margins": 0.15512995416065678,
"rewards/rejected": -0.1346038356423378,
"step": 177
},
{
"entropy": 1.1366123706102371,
"epoch": 0.1116162407900925,
"grad_norm": 42.503440856933594,
"learning_rate": 9.93468828877249e-07,
"logits/chosen": -22.75767775859101,
"logits/rejected": -21.918987652590392,
"logps/chosen": -1206.1099195480347,
"logps/rejected": -610.3419342041016,
"loss": 0.9570979475975037,
"mean_token_accuracy": 0.7211766019463539,
"num_tokens": 10059360.0,
"rewards/accuracies": 0.875,
"rewards/chosen": -0.0131734365131706,
"rewards/margins": 0.18104426749050617,
"rewards/rejected": -0.1942176972515881,
"step": 178
},
{
"entropy": 1.107018142938614,
"epoch": 0.1122432983226211,
"grad_norm": 39.66263198852539,
"learning_rate": 9.93298468930201e-07,
"logits/chosen": -23.260314784767324,
"logits/rejected": -21.11647381786282,
"logps/chosen": -1436.7120723724365,
"logps/rejected": -508.69267654418945,
"loss": 0.9501864910125732,
"mean_token_accuracy": 0.7304199710488319,
"num_tokens": 10132130.0,
"rewards/accuracies": 0.84375,
"rewards/chosen": 0.028971436579013243,
"rewards/margins": 0.20222028624266386,
"rewards/rejected": -0.17324885539710522,
"step": 179
},
{
"entropy": 1.021133229136467,
"epoch": 0.1128703558551497,
"grad_norm": 29.389991760253906,
"learning_rate": 9.93125930636625e-07,
"logits/chosen": -18.06104104884531,
"logits/rejected": -19.473802853816192,
"logps/chosen": -539.9062232971191,
"logps/rejected": -461.96774101257324,
"loss": 0.9612171053886414,
"mean_token_accuracy": 0.7571789473295212,
"num_tokens": 10182254.0,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.02405679877847433,
"rewards/margins": 0.1570815034210682,
"rewards/rejected": -0.1330247106961906,
"step": 180
},
{
"entropy": 1.1228575333952904,
"epoch": 0.11349741338767833,
"grad_norm": 31.7424373626709,
"learning_rate": 9.929512147584296e-07,
"logits/chosen": -19.25161771955138,
"logits/rejected": -19.300870767626026,
"logps/chosen": -471.5840435028076,
"logps/rejected": -377.43126487731934,
"loss": 0.9580326080322266,
"mean_token_accuracy": 0.7341411262750626,
"num_tokens": 10231221.0,
"rewards/accuracies": 0.90625,
"rewards/chosen": 0.00470810174010694,
"rewards/margins": 0.1703320173546672,
"rewards/rejected": -0.16562391445040703,
"step": 181
},
{
"entropy": 1.2480486258864403,
"epoch": 0.11412447092020693,
"grad_norm": 33.407691955566406,
"learning_rate": 9.927743220671389e-07,
"logits/chosen": -15.707493700178858,
"logits/rejected": -18.14101813743978,
"logps/chosen": -644.9055366516113,
"logps/rejected": -403.51587295532227,
"loss": 0.9577570557594299,
"mean_token_accuracy": 0.695245198905468,
"num_tokens": 10278764.0,
"rewards/accuracies": 0.875,
"rewards/chosen": -0.00990894460119307,
"rewards/margins": 0.1714292955584824,
"rewards/rejected": -0.18133824318647385,
"step": 182
},
{
"entropy": 0.9243633225560188,
"epoch": 0.11475152845273554,
"grad_norm": 34.56248474121094,
"learning_rate": 9.925952533438897e-07,
"logits/chosen": -17.46200834389154,
"logits/rejected": -16.492948873374484,
"logps/chosen": -617.6435585021973,
"logps/rejected": -372.62390518188477,
"loss": 0.948718786239624,
"mean_token_accuracy": 0.7732345685362816,
"num_tokens": 10341069.0,
"rewards/accuracies": 0.9375,
"rewards/chosen": -0.010069805663079023,
"rewards/margins": 0.2102643116377294,
"rewards/rejected": -0.22033411543816328,
"step": 183
},
{
"entropy": 0.9938921704888344,
"epoch": 0.11537858598526415,
"grad_norm": 30.834369659423828,
"learning_rate": 9.924140093794277e-07,
"logits/chosen": -19.204634086255844,
"logits/rejected": -19.86160843964533,
"logps/chosen": -502.1897392272949,
"logps/rejected": -514.1468658447266,
"loss": 0.9647988080978394,
"mean_token_accuracy": 0.7703093513846397,
"num_tokens": 10385519.0,
"rewards/accuracies": 0.84375,
"rewards/chosen": 0.006156077841296792,
"rewards/margins": 0.14176303520798683,
"rewards/rejected": -0.13560695759952068,
"step": 184
},
{
"entropy": 0.9982673227787018,
"epoch": 0.11600564351779276,
"grad_norm": 33.376678466796875,
"learning_rate": 9.922305909741046e-07,
"logits/chosen": -20.081957609627672,
"logits/rejected": -20.08288046634073,
"logps/chosen": -563.1763916015625,
"logps/rejected": -455.9494934082031,
"loss": 0.940411388874054,
"mean_token_accuracy": 0.7691720277070999,
"num_tokens": 10451619.0,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.03211024316260591,
"rewards/margins": 0.24388167914003134,
"rewards/rejected": -0.21177144069224596,
"step": 185
},
{
"entropy": 1.2043246403336525,
"epoch": 0.11663270105032136,
"grad_norm": 35.30168151855469,
"learning_rate": 9.92044998937874e-07,
"logits/chosen": -15.935400744656912,
"logits/rejected": -17.80423133241425,
"logps/chosen": -507.5350112915039,
"logps/rejected": -506.1169013977051,
"loss": 0.9446260929107666,
"mean_token_accuracy": 0.7261253371834755,
"num_tokens": 10504967.0,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.011272144154645503,
"rewards/margins": 0.2257434045895934,
"rewards/rejected": -0.21447127033025026,
"step": 186
},
{
"entropy": 0.8656372576951981,
"epoch": 0.11725975858284998,
"grad_norm": 36.30891799926758,
"learning_rate": 9.918572340902878e-07,
"logits/chosen": -20.357606409612657,
"logits/rejected": -20.43430765009451,
"logps/chosen": -806.364107131958,
"logps/rejected": -409.4738140106201,
"loss": 0.9610611796379089,
"mean_token_accuracy": 0.7912320047616959,
"num_tokens": 10559810.0,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.01855588040780276,
"rewards/margins": 0.16032809671014547,
"rewards/rejected": -0.14177220640704036,
"step": 187
},
{
"entropy": 1.2360781207680702,
"epoch": 0.11788681611537859,
"grad_norm": 36.44474411010742,
"learning_rate": 9.916672972604927e-07,
"logits/chosen": -21.232208354402246,
"logits/rejected": -20.78721834595899,
"logps/chosen": -872.3558025360107,
"logps/rejected": -562.6851234436035,
"loss": 0.956852912902832,
"mean_token_accuracy": 0.720037579536438,
"num_tokens": 10620148.0,
"rewards/accuracies": 0.90625,
"rewards/chosen": 0.012437668745405972,
"rewards/margins": 0.17596057945047505,
"rewards/rejected": -0.16352291277144104,
"step": 188
},
{
"entropy": 1.016458660364151,
"epoch": 0.11851387364790719,
"grad_norm": 29.050859451293945,
"learning_rate": 9.914751892872274e-07,
"logits/chosen": -19.08313772226747,
"logits/rejected": -18.82169734271658,
"logps/chosen": -434.9751796722412,
"logps/rejected": -346.7390670776367,
"loss": 0.9528908133506775,
"mean_token_accuracy": 0.7646205425262451,
"num_tokens": 10670772.0,
"rewards/accuracies": 0.84375,
"rewards/chosen": -0.008685210370458663,
"rewards/margins": 0.19308780319988728,
"rewards/rejected": -0.20177301485091448,
"step": 189
},
{
"entropy": 1.1021007224917412,
"epoch": 0.11914093118043581,
"grad_norm": 44.599769592285156,
"learning_rate": 9.91280911018817e-07,
"logits/chosen": -21.5532820720735,
"logits/rejected": -20.40933043838709,
"logps/chosen": -1575.5354919433594,
"logps/rejected": -422.48606395721436,
"loss": 0.941632866859436,
"mean_token_accuracy": 0.7219045013189316,
"num_tokens": 10758488.0,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.06574870133772492,
"rewards/margins": 0.2363713993690908,
"rewards/rejected": -0.1706227008253336,
"step": 190
},
{
"entropy": 1.1249773353338242,
"epoch": 0.11976798871296442,
"grad_norm": 37.6546745300293,
"learning_rate": 9.910844633131712e-07,
"logits/chosen": -17.602501168387953,
"logits/rejected": -18.726467814742886,
"logps/chosen": -641.0849552154541,
"logps/rejected": -560.3315982818604,
"loss": 0.935768723487854,
"mean_token_accuracy": 0.7447556182742119,
"num_tokens": 10819612.0,
"rewards/accuracies": 0.90625,
"rewards/chosen": -0.0099241798161529,
"rewards/margins": 0.26406861934810877,
"rewards/rejected": -0.27399280294775963,
"step": 191
},
{
"entropy": 1.0111653581261635,
"epoch": 0.12039504624549302,
"grad_norm": 33.29735565185547,
"learning_rate": 9.908858470377793e-07,
"logits/chosen": -17.99586764005896,
"logits/rejected": -16.641471216812302,
"logps/chosen": -754.2721481323242,
"logps/rejected": -414.00395679473877,
"loss": 0.9521582126617432,
"mean_token_accuracy": 0.7499677836894989,
"num_tokens": 10882013.0,
"rewards/accuracies": 0.96875,
"rewards/chosen": 0.00994637084659189,
"rewards/margins": 0.19447646429762244,
"rewards/rejected": -0.1845300872810185,
"step": 192
},
{
"entropy": 1.0526621490716934,
"epoch": 0.12102210377802164,
"grad_norm": 35.13934326171875,
"learning_rate": 9.906850630697066e-07,
"logits/chosen": -17.88888213857138,
"logits/rejected": -17.117701311736873,
"logps/chosen": -626.3125686645508,
"logps/rejected": -390.99532318115234,
"loss": 0.9473018646240234,
"mean_token_accuracy": 0.7478787750005722,
"num_tokens": 10932194.0,
"rewards/accuracies": 0.875,
"rewards/chosen": -0.013837772188708186,
"rewards/margins": 0.21603740751743317,
"rewards/rejected": -0.22987518273293972,
"step": 193
},
{
"entropy": 1.2843475490808487,
"epoch": 0.12164916131055024,
"grad_norm": 33.156471252441406,
"learning_rate": 9.904821122955914e-07,
"logits/chosen": -16.072002517290578,
"logits/rejected": -17.32703283993392,
"logps/chosen": -858.3284645080566,
"logps/rejected": -468.63574600219727,
"loss": 0.957085132598877,
"mean_token_accuracy": 0.6953159794211388,
"num_tokens": 10989560.0,
"rewards/accuracies": 0.84375,
"rewards/chosen": -0.0002469784813001752,
"rewards/margins": 0.174753800034523,
"rewards/rejected": -0.1750007774680853,
"step": 194
},
{
"entropy": 0.9444542303681374,
"epoch": 0.12227621884307885,
"grad_norm": 33.4073371887207,
"learning_rate": 9.90276995611639e-07,
"logits/chosen": -19.142496042660422,
"logits/rejected": -21.297342713346943,
"logps/chosen": -639.1740913391113,
"logps/rejected": -354.38869857788086,
"loss": 0.9653919339179993,
"mean_token_accuracy": 0.7545767053961754,
"num_tokens": 11034532.0,
"rewards/accuracies": 0.875,
"rewards/chosen": 0.0012790057808160782,
"rewards/margins": 0.1389640721026808,
"rewards/rejected": -0.13768507237546146,
"step": 195
},
{
"entropy": 1.106497973203659,
"epoch": 0.12290327637560747,
"grad_norm": 30.54036521911621,
"learning_rate": 9.900697139236208e-07,
"logits/chosen": -17.157277160405563,
"logits/rejected": -18.095409943495174,
"logps/chosen": -551.8531856536865,
"logps/rejected": -366.1446056365967,
"loss": 0.9476866722106934,
"mean_token_accuracy": 0.7291347607970238,
"num_tokens": 11079071.0,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.026466174283996224,
"rewards/margins": 0.21335551515221596,
"rewards/rejected": -0.18688933923840523,
"step": 196
},
{
"entropy": 1.0959510654211044,
"epoch": 0.12353033390813607,
"grad_norm": 36.96934127807617,
"learning_rate": 9.898602681468674e-07,
"logits/chosen": -19.027734293968553,
"logits/rejected": -19.864234419673636,
"logps/chosen": -954.4189186096191,
"logps/rejected": -566.7688503265381,
"loss": 0.9575784206390381,
"mean_token_accuracy": 0.7271228209137917,
"num_tokens": 11136634.0,
"rewards/accuracies": 0.8125,
"rewards/chosen": -0.016784888110123575,
"rewards/margins": 0.17304366454482079,
"rewards/rejected": -0.18982854578644037,
"step": 197
},
{
"entropy": 0.8774717822670937,
"epoch": 0.12415739144066468,
"grad_norm": 36.82571792602539,
"learning_rate": 9.896486592062659e-07,
"logits/chosen": -28.647222960438814,
"logits/rejected": -22.060415168768344,
"logps/chosen": -836.5278701782227,
"logps/rejected": -480.254337310791,
"loss": 0.9511983394622803,
"mean_token_accuracy": 0.7737741991877556,
"num_tokens": 11197525.0,
"rewards/accuracies": 0.875,
"rewards/chosen": -0.008797007380053401,
"rewards/margins": 0.20592515252064914,
"rewards/rejected": -0.21472215885296464,
"step": 198
},
{
"entropy": 1.1285011321306229,
"epoch": 0.1247844489731933,
"grad_norm": 42.2977409362793,
"learning_rate": 9.89434888036256e-07,
"logits/chosen": -18.49698845016767,
"logits/rejected": -17.254445681297014,
"logps/chosen": -1127.2061748504639,
"logps/rejected": -956.0397682189941,
"loss": 0.9597939848899841,
"mean_token_accuracy": 0.731256939470768,
"num_tokens": 11292505.0,
"rewards/accuracies": 0.875,
"rewards/chosen": -0.003246246255002916,
"rewards/margins": 0.16256380267441273,
"rewards/rejected": -0.1658100476488471,
"step": 199
},
{
"entropy": 0.9618688002228737,
"epoch": 0.1254115065057219,
"grad_norm": 35.041629791259766,
"learning_rate": 9.892189555808251e-07,
"logits/chosen": -23.16837855908106,
"logits/rejected": -22.01573163400953,
"logps/chosen": -595.0505418777466,
"logps/rejected": -505.8145923614502,
"loss": 0.9585968852043152,
"mean_token_accuracy": 0.7569021657109261,
"num_tokens": 11345306.0,
"rewards/accuracies": 0.875,
"rewards/chosen": -0.027557444758713245,
"rewards/margins": 0.16784314159303904,
"rewards/rejected": -0.19540058448910713,
"step": 200
}
],
"logging_steps": 1,
"max_steps": 1595,
"num_input_tokens_seen": 0,
"num_train_epochs": 1,
"save_steps": 100,
"stateful_callbacks": {
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": true,
"should_training_stop": false
},
"attributes": {}
}
},
"total_flos": 5.084673057646182e+16,
"train_batch_size": 1,
"trial_name": null,
"trial_params": null
}