Kakeya-OProver-Stage3-DPO / training /trainer_state.json
cryptobiosis's picture
Add files using upload-large-folder tool
3103783 verified
Raw
History Blame Contribute Delete
48.6 kB
{
"max_steps": 88,
"save_steps": 22,
"is_world_process_zero": true,
"train_batch_size": 1,
"stateful_callbacks": {
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": true,
"should_training_stop": true
},
"attributes": {}
}
},
"is_hyper_param_search": false,
"num_input_tokens_seen": 0,
"log_history": [
{
"epoch": 0.011428571428571429,
"grad_norm": 5.672101974487305,
"learning_rate": 0.0,
"logits/chosen": -0.003827691078186035,
"logits/rejected": 1.6622543334960938,
"logps/chosen": -53.823280334472656,
"logps/rejected": -83.19792175292969,
"loss": 0.6931,
"rewards/accuracies": 0.0,
"rewards/chosen": 0.0,
"rewards/margins": 0.0,
"rewards/rejected": 0.0,
"step": 1
},
{
"epoch": 0.022857142857142857,
"grad_norm": 5.676645755767822,
"learning_rate": 1.0000000000000002e-06,
"logits/chosen": -0.23317879438400269,
"logits/rejected": 1.487736701965332,
"logps/chosen": -105.3038101196289,
"logps/rejected": -72.62786102294922,
"loss": 0.6931,
"rewards/accuracies": 0.0,
"rewards/chosen": 0.0,
"rewards/margins": 0.0,
"rewards/rejected": 0.0,
"step": 2
},
{
"epoch": 0.03428571428571429,
"grad_norm": 5.494569778442383,
"learning_rate": 2.0000000000000003e-06,
"logits/chosen": -0.34497007727622986,
"logits/rejected": 1.3572413921356201,
"logps/chosen": -78.18315124511719,
"logps/rejected": -92.42572021484375,
"loss": 0.6925,
"rewards/accuracies": 0.5,
"rewards/chosen": -0.010104288347065449,
"rewards/margins": 0.001475572120398283,
"rewards/rejected": -0.011579860001802444,
"step": 3
},
{
"epoch": 0.045714285714285714,
"grad_norm": 5.875666618347168,
"learning_rate": 3e-06,
"logits/chosen": 0.0768582671880722,
"logits/rejected": 1.793702244758606,
"logps/chosen": -49.45244598388672,
"logps/rejected": -70.34400939941406,
"loss": 0.6824,
"rewards/accuracies": 0.75,
"rewards/chosen": -0.006157493684440851,
"rewards/margins": 0.02201489359140396,
"rewards/rejected": -0.028172386810183525,
"step": 4
},
{
"epoch": 0.05714285714285714,
"grad_norm": 4.4969987869262695,
"learning_rate": 4.000000000000001e-06,
"logits/chosen": 0.29756978154182434,
"logits/rejected": 1.5599043369293213,
"logps/chosen": -38.330902099609375,
"logps/rejected": -58.7880859375,
"loss": 0.6602,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.0054547907784581184,
"rewards/margins": 0.06765428930521011,
"rewards/rejected": -0.06219949945807457,
"step": 5
},
{
"epoch": 0.06857142857142857,
"grad_norm": 5.193802356719971,
"learning_rate": 5e-06,
"logits/chosen": -0.097133569419384,
"logits/rejected": 1.5903254747390747,
"logps/chosen": -71.06304168701172,
"logps/rejected": -69.80386352539062,
"loss": 0.6118,
"rewards/accuracies": 0.9375,
"rewards/chosen": 0.02022118680179119,
"rewards/margins": 0.1755855232477188,
"rewards/rejected": -0.15536434948444366,
"step": 6
},
{
"epoch": 0.08,
"grad_norm": 4.568131446838379,
"learning_rate": 4.998209387040829e-06,
"logits/chosen": 0.22878801822662354,
"logits/rejected": 1.2406954765319824,
"logps/chosen": -65.77464294433594,
"logps/rejected": -70.03345489501953,
"loss": 0.5809,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.008165514096617699,
"rewards/margins": 0.2519247233867645,
"rewards/rejected": -0.2437591850757599,
"step": 7
},
{
"epoch": 0.09142857142857143,
"grad_norm": 3.668226480484009,
"learning_rate": 4.992840113199131e-06,
"logits/chosen": -0.06199551001191139,
"logits/rejected": 1.0075984001159668,
"logps/chosen": -31.54962158203125,
"logps/rejected": -48.84445571899414,
"loss": 0.5925,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.006166815757751465,
"rewards/margins": 0.21949976682662964,
"rewards/rejected": -0.21333293616771698,
"step": 8
},
{
"epoch": 0.10285714285714286,
"grad_norm": 4.007819652557373,
"learning_rate": 4.983899869907963e-06,
"logits/chosen": 0.04794704169034958,
"logits/rejected": 1.0474152565002441,
"logps/chosen": -74.90632629394531,
"logps/rejected": -68.87115478515625,
"loss": 0.5221,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.017194844782352448,
"rewards/margins": 0.40241336822509766,
"rewards/rejected": -0.3852185010910034,
"step": 9
},
{
"epoch": 0.11428571428571428,
"grad_norm": 4.3215508460998535,
"learning_rate": 4.971401463979722e-06,
"logits/chosen": 0.11494935303926468,
"logits/rejected": 1.1323603391647339,
"logps/chosen": -57.83014678955078,
"logps/rejected": -69.66509246826172,
"loss": 0.4632,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.035677470266819,
"rewards/margins": 0.5738754868507385,
"rewards/rejected": -0.5381979942321777,
"step": 10
},
{
"epoch": 0.12571428571428572,
"grad_norm": 3.5642457008361816,
"learning_rate": 4.955362799260507e-06,
"logits/chosen": -0.14375551044940948,
"logits/rejected": 0.6537873148918152,
"logps/chosen": -53.47944259643555,
"logps/rejected": -81.25194549560547,
"loss": 0.4828,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.019211266189813614,
"rewards/margins": 0.5275158882141113,
"rewards/rejected": -0.5083046555519104,
"step": 11
},
{
"epoch": 0.13714285714285715,
"grad_norm": 3.5064291954040527,
"learning_rate": 4.935806850983034e-06,
"logits/chosen": -0.02809108793735504,
"logits/rejected": 1.3847907781600952,
"logps/chosen": -54.27452850341797,
"logps/rejected": -84.8036117553711,
"loss": 0.3669,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.038996659219264984,
"rewards/margins": 0.9113224744796753,
"rewards/rejected": -0.8723257184028625,
"step": 12
},
{
"epoch": 0.14857142857142858,
"grad_norm": 4.0220561027526855,
"learning_rate": 4.912761632854834e-06,
"logits/chosen": -0.40826213359832764,
"logits/rejected": 1.0781131982803345,
"logps/chosen": -80.10173797607422,
"logps/rejected": -64.88600158691406,
"loss": 0.4242,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.028980137780308723,
"rewards/margins": 0.7560938000679016,
"rewards/rejected": -0.727113664150238,
"step": 13
},
{
"epoch": 0.16,
"grad_norm": 3.641127347946167,
"learning_rate": 4.8862601569288885e-06,
"logits/chosen": -0.3284621238708496,
"logits/rejected": 0.6769169569015503,
"logps/chosen": -126.9131088256836,
"logps/rejected": -108.0735855102539,
"loss": 0.378,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.10002796351909637,
"rewards/margins": 0.9067593812942505,
"rewards/rejected": -0.8067314028739929,
"step": 14
},
{
"epoch": 0.17142857142857143,
"grad_norm": 3.1787471771240234,
"learning_rate": 4.8563403863141825e-06,
"logits/chosen": -0.23578333854675293,
"logits/rejected": 0.8872382044792175,
"logps/chosen": -77.02982330322266,
"logps/rejected": -91.4344482421875,
"loss": 0.3247,
"rewards/accuracies": 1.0,
"rewards/chosen": -0.0036322600208222866,
"rewards/margins": 1.1259247064590454,
"rewards/rejected": -1.1295570135116577,
"step": 15
},
{
"epoch": 0.18285714285714286,
"grad_norm": 3.3664069175720215,
"learning_rate": 4.823045180793914e-06,
"logits/chosen": -0.33357855677604675,
"logits/rejected": 0.9027751088142395,
"logps/chosen": -57.791385650634766,
"logps/rejected": -71.88220977783203,
"loss": 0.3925,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.03762559965252876,
"rewards/margins": 0.8615567684173584,
"rewards/rejected": -0.823931097984314,
"step": 16
},
{
"epoch": 0.19428571428571428,
"grad_norm": 2.321681261062622,
"learning_rate": 4.786422235429269e-06,
"logits/chosen": -0.2371266484260559,
"logits/rejected": 0.4381519556045532,
"logps/chosen": -45.621620178222656,
"logps/rejected": -89.46638488769531,
"loss": 0.3503,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.028645562008023262,
"rewards/margins": 1.0791183710098267,
"rewards/rejected": -1.0504727363586426,
"step": 17
},
{
"epoch": 0.2057142857142857,
"grad_norm": 2.6169960498809814,
"learning_rate": 4.746524012236706e-06,
"logits/chosen": -0.1888342797756195,
"logits/rejected": 0.44934579730033875,
"logps/chosen": -69.54957580566406,
"logps/rejected": -59.541568756103516,
"loss": 0.4125,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.0358089953660965,
"rewards/margins": 0.8032007813453674,
"rewards/rejected": -0.7673917412757874,
"step": 18
},
{
"epoch": 0.21714285714285714,
"grad_norm": 2.923261880874634,
"learning_rate": 4.703407665036622e-06,
"logits/chosen": -0.20129157602787018,
"logits/rejected": 0.6290000677108765,
"logps/chosen": -56.686153411865234,
"logps/rejected": -87.55162048339844,
"loss": 0.264,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.054906971752643585,
"rewards/margins": 1.5454007387161255,
"rewards/rejected": -1.4904940128326416,
"step": 19
},
{
"epoch": 0.22857142857142856,
"grad_norm": 2.864265203475952,
"learning_rate": 4.657134957581057e-06,
"logits/chosen": -0.3821311295032501,
"logits/rejected": 0.48754024505615234,
"logps/chosen": -62.24723815917969,
"logps/rejected": -60.93783950805664,
"loss": 0.3685,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.06970775872468948,
"rewards/margins": 1.0107057094573975,
"rewards/rejected": -0.9409979581832886,
"step": 20
},
{
"epoch": 0.24,
"grad_norm": 1.9049395322799683,
"learning_rate": 4.607772175077712e-06,
"logits/chosen": -0.5025634765625,
"logits/rejected": 0.4401867389678955,
"logps/chosen": -57.89384460449219,
"logps/rejected": -79.51171112060547,
"loss": 0.3142,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.049478232860565186,
"rewards/margins": 1.3050354719161987,
"rewards/rejected": -1.2555571794509888,
"step": 21
},
{
"epoch": 0.25142857142857145,
"grad_norm": 2.7351036071777344,
"learning_rate": 4.555390029237026e-06,
"logits/chosen": -0.36178550124168396,
"logits/rejected": 0.8178424835205078,
"logps/chosen": -65.52536010742188,
"logps/rejected": -100.3760986328125,
"loss": 0.2818,
"rewards/accuracies": 0.9375,
"rewards/chosen": -0.06696957349777222,
"rewards/margins": 1.5236375331878662,
"rewards/rejected": -1.5906071662902832,
"step": 22
},
{
"epoch": 0.25142857142857145,
"eval_logits/chosen": -0.36531969904899597,
"eval_logits/rejected": 0.3482947051525116,
"eval_logps/chosen": -87.77478790283203,
"eval_logps/rejected": -92.11418914794922,
"eval_loss": 0.30896151065826416,
"eval_rewards/accuracies": 0.9800000190734863,
"eval_rewards/chosen": -0.20244216918945312,
"eval_rewards/margins": 1.3565798997879028,
"eval_rewards/rejected": -1.559022068977356,
"eval_runtime": 209.0014,
"eval_samples_per_second": 0.957,
"eval_steps_per_second": 0.957,
"step": 22
},
{
"epoch": 0.26285714285714284,
"grad_norm": 2.936436653137207,
"learning_rate": 4.5000635569783365e-06,
"logits/chosen": -0.278434157371521,
"logits/rejected": 0.1438252478837967,
"logps/chosen": -70.02806091308594,
"logps/rejected": -57.32536697387695,
"loss": 0.3441,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.005648649297654629,
"rewards/margins": 1.069925308227539,
"rewards/rejected": -1.0642765760421753,
"step": 23
},
{
"epoch": 0.2742857142857143,
"grad_norm": 1.480675458908081,
"learning_rate": 4.4418720129402145e-06,
"logits/chosen": -0.6613065004348755,
"logits/rejected": 0.20875723659992218,
"logps/chosen": -43.0631217956543,
"logps/rejected": -113.96063995361328,
"loss": 0.2264,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.007623173296451569,
"rewards/margins": 1.854811191558838,
"rewards/rejected": -1.8471879959106445,
"step": 24
},
{
"epoch": 0.2857142857142857,
"grad_norm": 2.0406107902526855,
"learning_rate": 4.3808987559489536e-06,
"logits/chosen": -0.4824203848838806,
"logits/rejected": 0.370841383934021,
"logps/chosen": -39.89043426513672,
"logps/rejected": -89.99382781982422,
"loss": 0.2224,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.0602618083357811,
"rewards/margins": 1.6918809413909912,
"rewards/rejected": -1.6316192150115967,
"step": 25
},
{
"epoch": 0.29714285714285715,
"grad_norm": 2.2385094165802,
"learning_rate": 4.317231129607859e-06,
"logits/chosen": -0.5961613655090332,
"logits/rejected": 0.14968276023864746,
"logps/chosen": -76.45050048828125,
"logps/rejected": -99.48614501953125,
"loss": 0.2123,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.07128332555294037,
"rewards/margins": 1.763782024383545,
"rewards/rejected": -1.6924986839294434,
"step": 26
},
{
"epoch": 0.30857142857142855,
"grad_norm": 1.6301268339157104,
"learning_rate": 4.2509603371783776e-06,
"logits/chosen": -0.3383774161338806,
"logits/rejected": 0.15638643503189087,
"logps/chosen": -58.246971130371094,
"logps/rejected": -79.45714569091797,
"loss": 0.2009,
"rewards/accuracies": 1.0,
"rewards/chosen": -0.04440131038427353,
"rewards/margins": 1.9561799764633179,
"rewards/rejected": -2.0005815029144287,
"step": 27
},
{
"epoch": 0.32,
"grad_norm": 2.236377716064453,
"learning_rate": 4.1821813109322975e-06,
"logits/chosen": -0.647399365901947,
"logits/rejected": 0.22453227639198303,
"logps/chosen": -88.88107299804688,
"logps/rejected": -96.83210754394531,
"loss": 0.2263,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.040186457335948944,
"rewards/margins": 1.824659824371338,
"rewards/rejected": -1.7844732999801636,
"step": 28
},
{
"epoch": 0.3314285714285714,
"grad_norm": 2.0542852878570557,
"learning_rate": 4.110992576162193e-06,
"logits/chosen": -0.5227777361869812,
"logits/rejected": -0.2961636781692505,
"logps/chosen": -78.49622344970703,
"logps/rejected": -78.24589538574219,
"loss": 0.2121,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.10791393369436264,
"rewards/margins": 1.7918672561645508,
"rewards/rejected": -1.6839532852172852,
"step": 29
},
{
"epoch": 0.34285714285714286,
"grad_norm": 1.9906846284866333,
"learning_rate": 4.037496110044885e-06,
"logits/chosen": -0.44146519899368286,
"logits/rejected": 0.24826864898204803,
"logps/chosen": -89.6866683959961,
"logps/rejected": -122.11793518066406,
"loss": 0.1621,
"rewards/accuracies": 1.0,
"rewards/chosen": -0.04959860444068909,
"rewards/margins": 2.5837507247924805,
"rewards/rejected": -2.6333494186401367,
"step": 30
},
{
"epoch": 0.35428571428571426,
"grad_norm": 2.3201839923858643,
"learning_rate": 3.961797195560118e-06,
"logits/chosen": -0.37571054697036743,
"logits/rejected": -0.12684349715709686,
"logps/chosen": -62.36381530761719,
"logps/rejected": -68.8594741821289,
"loss": 0.2406,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.013891173526644707,
"rewards/margins": 1.7061822414398193,
"rewards/rejected": -1.6922911405563354,
"step": 31
},
{
"epoch": 0.3657142857142857,
"grad_norm": 1.7459288835525513,
"learning_rate": 3.884004270673711e-06,
"logits/chosen": -0.4904371500015259,
"logits/rejected": -0.09516231715679169,
"logps/chosen": -51.67000198364258,
"logps/rejected": -87.77179718017578,
"loss": 0.1739,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.05766277387738228,
"rewards/margins": 2.167266845703125,
"rewards/rejected": -2.1096038818359375,
"step": 32
},
{
"epoch": 0.37714285714285717,
"grad_norm": 1.9478814601898193,
"learning_rate": 3.8042287730012117e-06,
"logits/chosen": -0.7833026051521301,
"logits/rejected": -0.14795458316802979,
"logps/chosen": -49.5107307434082,
"logps/rejected": -77.62210845947266,
"loss": 0.1861,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.02107466384768486,
"rewards/margins": 1.9514578580856323,
"rewards/rejected": -1.9303834438323975,
"step": 33
},
{
"epoch": 0.38857142857142857,
"grad_norm": 2.1133761405944824,
"learning_rate": 3.7225849801745835e-06,
"logits/chosen": -0.8189583420753479,
"logits/rejected": -0.24318619072437286,
"logps/chosen": -75.10845947265625,
"logps/rejected": -111.31871032714844,
"loss": 0.1489,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.029190005734562874,
"rewards/margins": 2.6350479125976562,
"rewards/rejected": -2.6058578491210938,
"step": 34
},
{
"epoch": 0.4,
"grad_norm": 2.116342306137085,
"learning_rate": 3.6391898461406045e-06,
"logits/chosen": -0.4198293685913086,
"logits/rejected": -0.3276508152484894,
"logps/chosen": -63.513519287109375,
"logps/rejected": -93.56440734863281,
"loss": 0.2266,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.09839610755443573,
"rewards/margins": 1.798091173171997,
"rewards/rejected": -1.6996949911117554,
"step": 35
},
{
"epoch": 0.4114285714285714,
"grad_norm": 1.6935662031173706,
"learning_rate": 3.55416283362546e-06,
"logits/chosen": -0.8055887222290039,
"logits/rejected": 0.15487802028656006,
"logps/chosen": -46.510643005371094,
"logps/rejected": -105.87352752685547,
"loss": 0.1607,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.033490121364593506,
"rewards/margins": 2.649106025695801,
"rewards/rejected": -2.6156160831451416,
"step": 36
},
{
"epoch": 0.4228571428571429,
"grad_norm": 2.2720091342926025,
"learning_rate": 3.4676257430055438e-06,
"logits/chosen": -0.8104305267333984,
"logits/rejected": 0.04826318100094795,
"logps/chosen": -77.22013854980469,
"logps/rejected": -98.19013977050781,
"loss": 0.1415,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.03917883336544037,
"rewards/margins": 2.6867618560791016,
"rewards/rejected": -2.6475830078125,
"step": 37
},
{
"epoch": 0.4342857142857143,
"grad_norm": 1.546297550201416,
"learning_rate": 3.3797025378295826e-06,
"logits/chosen": -0.8403704166412354,
"logits/rejected": 0.052355289459228516,
"logps/chosen": -56.61090087890625,
"logps/rejected": -119.7930679321289,
"loss": 0.1658,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.022541070356965065,
"rewards/margins": 2.8231887817382812,
"rewards/rejected": -2.800647735595703,
"step": 38
},
{
"epoch": 0.44571428571428573,
"grad_norm": 2.0681819915771484,
"learning_rate": 3.29051916724206e-06,
"logits/chosen": -0.6301568746566772,
"logits/rejected": -0.32246649265289307,
"logps/chosen": -66.40396118164062,
"logps/rejected": -81.09312438964844,
"loss": 0.1799,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.009487343952059746,
"rewards/margins": 2.2801120281219482,
"rewards/rejected": -2.2706246376037598,
"step": 39
},
{
"epoch": 0.45714285714285713,
"grad_norm": 1.4052331447601318,
"learning_rate": 3.2002033855622683e-06,
"logits/chosen": -0.8533369302749634,
"logits/rejected": -0.4283853769302368,
"logps/chosen": -47.345802307128906,
"logps/rejected": -93.77117919921875,
"loss": 0.1517,
"rewards/accuracies": 1.0,
"rewards/chosen": -0.026743369176983833,
"rewards/margins": 2.6302499771118164,
"rewards/rejected": -2.6569931507110596,
"step": 40
},
{
"epoch": 0.4685714285714286,
"grad_norm": 2.0809950828552246,
"learning_rate": 3.1088845692774798e-06,
"logits/chosen": -0.6270914077758789,
"logits/rejected": -0.6155582070350647,
"logps/chosen": -88.60835266113281,
"logps/rejected": -67.6736831665039,
"loss": 0.1825,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.04146631807088852,
"rewards/margins": 2.0336129665374756,
"rewards/rejected": -1.9921468496322632,
"step": 41
},
{
"epoch": 0.48,
"grad_norm": 1.1893919706344604,
"learning_rate": 3.0166935317123824e-06,
"logits/chosen": -1.0347564220428467,
"logits/rejected": -0.4240405261516571,
"logps/chosen": -56.76289367675781,
"logps/rejected": -103.66142272949219,
"loss": 0.1124,
"rewards/accuracies": 1.0,
"rewards/chosen": -0.057413943111896515,
"rewards/margins": 3.0061051845550537,
"rewards/rejected": -3.06351900100708,
"step": 42
},
{
"epoch": 0.49142857142857144,
"grad_norm": 1.1706154346466064,
"learning_rate": 2.9237623356402423e-06,
"logits/chosen": -1.0618159770965576,
"logits/rejected": -0.327092707157135,
"logps/chosen": -32.207794189453125,
"logps/rejected": -111.8665771484375,
"loss": 0.0903,
"rewards/accuracies": 1.0,
"rewards/chosen": -0.027263116091489792,
"rewards/margins": 3.3231871128082275,
"rewards/rejected": -3.350450277328491,
"step": 43
},
{
"epoch": 0.5028571428571429,
"grad_norm": 1.079911470413208,
"learning_rate": 2.8302241041042564e-06,
"logits/chosen": -1.1862759590148926,
"logits/rejected": -0.7669480443000793,
"logps/chosen": -89.4259262084961,
"logps/rejected": -127.56314086914062,
"loss": 0.0967,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.14472071826457977,
"rewards/margins": 3.0603933334350586,
"rewards/rejected": -2.915672540664673,
"step": 44
},
{
"epoch": 0.5028571428571429,
"eval_logits/chosen": -0.8571964502334595,
"eval_logits/rejected": -0.6531373858451843,
"eval_logps/chosen": -90.10453033447266,
"eval_logps/rejected": -104.75491333007812,
"eval_loss": 0.17935897409915924,
"eval_rewards/accuracies": 0.9700000286102295,
"eval_rewards/chosen": -0.4354174733161926,
"eval_rewards/margins": 2.387676954269409,
"eval_rewards/rejected": -2.8230948448181152,
"eval_runtime": 208.3973,
"eval_samples_per_second": 0.96,
"eval_steps_per_second": 0.96,
"step": 44
},
{
"epoch": 0.5142857142857142,
"grad_norm": 1.5324379205703735,
"learning_rate": 2.7362128297200784e-06,
"logits/chosen": -0.7203244566917419,
"logits/rejected": -0.5576686859130859,
"logps/chosen": -65.52645874023438,
"logps/rejected": -95.54450988769531,
"loss": 0.1323,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.1149684339761734,
"rewards/margins": 2.6911990642547607,
"rewards/rejected": -2.576230525970459,
"step": 45
},
{
"epoch": 0.5257142857142857,
"grad_norm": 1.2247161865234375,
"learning_rate": 2.6418631827326857e-06,
"logits/chosen": -0.9313367009162903,
"logits/rejected": -0.8070792555809021,
"logps/chosen": -55.876502990722656,
"logps/rejected": -119.91787719726562,
"loss": 0.1285,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.06400280445814133,
"rewards/margins": 2.901925802230835,
"rewards/rejected": -2.837923288345337,
"step": 46
},
{
"epoch": 0.5371428571428571,
"grad_norm": 1.3425116539001465,
"learning_rate": 2.547310318102548e-06,
"logits/chosen": -0.9409236907958984,
"logits/rejected": -0.7352248430252075,
"logps/chosen": -50.5601806640625,
"logps/rejected": -86.23294830322266,
"loss": 0.1466,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.09888257831335068,
"rewards/margins": 2.470425844192505,
"rewards/rejected": -2.3715431690216064,
"step": 47
},
{
"epoch": 0.5485714285714286,
"grad_norm": 1.4391740560531616,
"learning_rate": 2.4526896818974534e-06,
"logits/chosen": -0.8374643921852112,
"logits/rejected": -0.47213953733444214,
"logps/chosen": -50.190616607666016,
"logps/rejected": -91.12651824951172,
"loss": 0.1023,
"rewards/accuracies": 1.0,
"rewards/chosen": -0.009993518702685833,
"rewards/margins": 2.796506881713867,
"rewards/rejected": -2.8065006732940674,
"step": 48
},
{
"epoch": 0.56,
"grad_norm": 1.5294134616851807,
"learning_rate": 2.358136817267315e-06,
"logits/chosen": -0.8648539185523987,
"logits/rejected": -0.736384391784668,
"logps/chosen": -72.85952758789062,
"logps/rejected": -83.08409881591797,
"loss": 0.1516,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.09306713193655014,
"rewards/margins": 2.5247979164123535,
"rewards/rejected": -2.4317305088043213,
"step": 49
},
{
"epoch": 0.5714285714285714,
"grad_norm": 1.6909253597259521,
"learning_rate": 2.263787170279922e-06,
"logits/chosen": -1.3599584102630615,
"logits/rejected": -1.2676033973693848,
"logps/chosen": -78.65673065185547,
"logps/rejected": -69.09491729736328,
"loss": 0.1557,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.00439932756125927,
"rewards/margins": 2.1822092533111572,
"rewards/rejected": -2.177809953689575,
"step": 50
},
{
"epoch": 0.5828571428571429,
"grad_norm": 1.3136837482452393,
"learning_rate": 2.169775895895745e-06,
"logits/chosen": -0.7750363349914551,
"logits/rejected": -0.7582042217254639,
"logps/chosen": -48.27521514892578,
"logps/rejected": -105.779541015625,
"loss": 0.0944,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.060845933854579926,
"rewards/margins": 3.2103078365325928,
"rewards/rejected": -3.1494617462158203,
"step": 51
},
{
"epoch": 0.5942857142857143,
"grad_norm": 1.304816722869873,
"learning_rate": 2.0762376643597586e-06,
"logits/chosen": -0.7206559777259827,
"logits/rejected": -0.7368943691253662,
"logps/chosen": -49.27516174316406,
"logps/rejected": -99.28387451171875,
"loss": 0.1227,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.08159955590963364,
"rewards/margins": 2.943441390991211,
"rewards/rejected": -2.861841917037964,
"step": 52
},
{
"epoch": 0.6057142857142858,
"grad_norm": 1.1686677932739258,
"learning_rate": 1.9833064682876175e-06,
"logits/chosen": -0.7927972674369812,
"logits/rejected": -0.8789339065551758,
"logps/chosen": -62.97304916381836,
"logps/rejected": -93.07855224609375,
"loss": 0.097,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.10683320462703705,
"rewards/margins": 2.952019453048706,
"rewards/rejected": -2.8451859951019287,
"step": 53
},
{
"epoch": 0.6171428571428571,
"grad_norm": 0.7459912300109863,
"learning_rate": 1.8911154307225204e-06,
"logits/chosen": -0.7670217752456665,
"logits/rejected": -0.7017982006072998,
"logps/chosen": -31.30267333984375,
"logps/rejected": -110.78553771972656,
"loss": 0.0593,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.003862532787024975,
"rewards/margins": 3.5174167156219482,
"rewards/rejected": -3.513554096221924,
"step": 54
},
{
"epoch": 0.6285714285714286,
"grad_norm": 1.5418952703475952,
"learning_rate": 1.7997966144377328e-06,
"logits/chosen": -0.986474871635437,
"logits/rejected": -1.1061036586761475,
"logps/chosen": -47.49861526489258,
"logps/rejected": -67.53656005859375,
"loss": 0.1543,
"rewards/accuracies": 1.0,
"rewards/chosen": -0.04688534885644913,
"rewards/margins": 2.227695941925049,
"rewards/rejected": -2.27458119392395,
"step": 55
},
{
"epoch": 0.64,
"grad_norm": 1.0748093128204346,
"learning_rate": 1.7094808327579401e-06,
"logits/chosen": -1.324556589126587,
"logits/rejected": -0.8223966360092163,
"logps/chosen": -36.40914535522461,
"logps/rejected": -105.08839416503906,
"loss": 0.084,
"rewards/accuracies": 1.0,
"rewards/chosen": -0.07963553071022034,
"rewards/margins": 3.377859354019165,
"rewards/rejected": -3.4574952125549316,
"step": 56
},
{
"epoch": 0.6514285714285715,
"grad_norm": 0.9280484318733215,
"learning_rate": 1.6202974621704176e-06,
"logits/chosen": -1.450647234916687,
"logits/rejected": -0.8040248155593872,
"logps/chosen": -68.76046752929688,
"logps/rejected": -125.3299331665039,
"loss": 0.0635,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.06499414145946503,
"rewards/margins": 3.9410018920898438,
"rewards/rejected": -3.876007318496704,
"step": 57
},
{
"epoch": 0.6628571428571428,
"grad_norm": 0.8896822333335876,
"learning_rate": 1.5323742569944573e-06,
"logits/chosen": -1.0071394443511963,
"logits/rejected": -1.0022106170654297,
"logps/chosen": -45.09584426879883,
"logps/rejected": -109.64781951904297,
"loss": 0.0802,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.034890901297330856,
"rewards/margins": 3.5162737369537354,
"rewards/rejected": -3.4813833236694336,
"step": 58
},
{
"epoch": 0.6742857142857143,
"grad_norm": 0.7682043313980103,
"learning_rate": 1.44583716637454e-06,
"logits/chosen": -1.0028694868087769,
"logits/rejected": -0.813642144203186,
"logps/chosen": -66.2764663696289,
"logps/rejected": -112.77369689941406,
"loss": 0.0576,
"rewards/accuracies": 1.0,
"rewards/chosen": -0.0501595139503479,
"rewards/margins": 3.7721147537231445,
"rewards/rejected": -3.822274684906006,
"step": 59
},
{
"epoch": 0.6857142857142857,
"grad_norm": 1.0216327905654907,
"learning_rate": 1.3608101538593965e-06,
"logits/chosen": -1.1250649690628052,
"logits/rejected": -0.9627130627632141,
"logps/chosen": -42.440757751464844,
"logps/rejected": -100.12843322753906,
"loss": 0.0804,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.11411059647798538,
"rewards/margins": 3.393651247024536,
"rewards/rejected": -3.2795403003692627,
"step": 60
},
{
"epoch": 0.6971428571428572,
"grad_norm": 0.7271348834037781,
"learning_rate": 1.277415019825417e-06,
"logits/chosen": -0.7807080745697021,
"logits/rejected": -0.7796292304992676,
"logps/chosen": -33.5434455871582,
"logps/rejected": -112.23175048828125,
"loss": 0.0711,
"rewards/accuracies": 1.0,
"rewards/chosen": -0.06058162823319435,
"rewards/margins": 3.8745694160461426,
"rewards/rejected": -3.9351511001586914,
"step": 61
},
{
"epoch": 0.7085714285714285,
"grad_norm": 1.7274105548858643,
"learning_rate": 1.195771226998789e-06,
"logits/chosen": -0.9823087453842163,
"logits/rejected": -1.2148367166519165,
"logps/chosen": -72.55377960205078,
"logps/rejected": -75.32920837402344,
"loss": 0.1183,
"rewards/accuracies": 1.0,
"rewards/chosen": -0.12965497374534607,
"rewards/margins": 2.7459590435028076,
"rewards/rejected": -2.8756141662597656,
"step": 62
},
{
"epoch": 0.72,
"grad_norm": 0.9623571038246155,
"learning_rate": 1.1159957293262888e-06,
"logits/chosen": -1.0808844566345215,
"logits/rejected": -0.8635554909706116,
"logps/chosen": -49.637996673583984,
"logps/rejected": -116.99398803710938,
"loss": 0.09,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.02851293236017227,
"rewards/margins": 3.4344334602355957,
"rewards/rejected": -3.4059205055236816,
"step": 63
},
{
"epoch": 0.7314285714285714,
"grad_norm": 1.0066514015197754,
"learning_rate": 1.0382028044398823e-06,
"logits/chosen": -1.197101354598999,
"logits/rejected": -1.1306017637252808,
"logps/chosen": -50.98615264892578,
"logps/rejected": -120.8044662475586,
"loss": 0.0899,
"rewards/accuracies": 1.0,
"rewards/chosen": -0.035914015024900436,
"rewards/margins": 3.1908507347106934,
"rewards/rejected": -3.2267649173736572,
"step": 64
},
{
"epoch": 0.7428571428571429,
"grad_norm": 1.1005553007125854,
"learning_rate": 9.625038899551162e-07,
"logits/chosen": -1.22350013256073,
"logits/rejected": -1.1208860874176025,
"logps/chosen": -66.32962036132812,
"logps/rejected": -103.34649658203125,
"loss": 0.0709,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.18690410256385803,
"rewards/margins": 3.4826159477233887,
"rewards/rejected": -3.2957119941711426,
"step": 65
},
{
"epoch": 0.7542857142857143,
"grad_norm": 0.954483687877655,
"learning_rate": 8.890074238378074e-07,
"logits/chosen": -0.9665268659591675,
"logits/rejected": -0.8029574751853943,
"logps/chosen": -43.259857177734375,
"logps/rejected": -104.5782241821289,
"loss": 0.0993,
"rewards/accuracies": 1.0,
"rewards/chosen": -0.044777870178222656,
"rewards/margins": 3.1982903480529785,
"rewards/rejected": -3.243067979812622,
"step": 66
},
{
"epoch": 0.7542857142857143,
"eval_logits/chosen": -1.1089446544647217,
"eval_logits/rejected": -1.1692878007888794,
"eval_logps/chosen": -91.48172760009766,
"eval_logps/rejected": -110.86624145507812,
"eval_loss": 0.14132851362228394,
"eval_rewards/accuracies": 0.9700000286102295,
"eval_rewards/chosen": -0.573137104511261,
"eval_rewards/margins": 2.8610901832580566,
"eval_rewards/rejected": -3.4342269897460938,
"eval_runtime": 208.8549,
"eval_samples_per_second": 0.958,
"eval_steps_per_second": 0.958,
"step": 66
},
{
"epoch": 0.7657142857142857,
"grad_norm": 0.9773061871528625,
"learning_rate": 8.178186890677029e-07,
"logits/chosen": -1.02699875831604,
"logits/rejected": -1.1385068893432617,
"logps/chosen": -80.82888793945312,
"logps/rejected": -100.25572967529297,
"loss": 0.072,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.0796530619263649,
"rewards/margins": 3.1960816383361816,
"rewards/rejected": -3.116428852081299,
"step": 67
},
{
"epoch": 0.7771428571428571,
"grad_norm": 1.2940922975540161,
"learning_rate": 7.490396628216237e-07,
"logits/chosen": -1.2090729475021362,
"logits/rejected": -1.2437564134597778,
"logps/chosen": -87.85923767089844,
"logps/rejected": -120.87287902832031,
"loss": 0.1183,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.018895722925662994,
"rewards/margins": 2.969498634338379,
"rewards/rejected": -2.9506030082702637,
"step": 68
},
{
"epoch": 0.7885714285714286,
"grad_norm": 0.7793561220169067,
"learning_rate": 6.827688703921407e-07,
"logits/chosen": -1.1516605615615845,
"logits/rejected": -1.295521855354309,
"logps/chosen": -52.94973373413086,
"logps/rejected": -84.64179229736328,
"loss": 0.067,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.18537920713424683,
"rewards/margins": 3.4953463077545166,
"rewards/rejected": -3.309967041015625,
"step": 69
},
{
"epoch": 0.8,
"grad_norm": 1.4742248058319092,
"learning_rate": 6.191012440510469e-07,
"logits/chosen": -1.3784356117248535,
"logits/rejected": -1.3366318941116333,
"logps/chosen": -57.7204475402832,
"logps/rejected": -90.2862548828125,
"loss": 0.1197,
"rewards/accuracies": 1.0,
"rewards/chosen": -0.044269490987062454,
"rewards/margins": 2.759215831756592,
"rewards/rejected": -2.80348539352417,
"step": 70
},
{
"epoch": 0.8114285714285714,
"grad_norm": 0.7249897718429565,
"learning_rate": 5.581279870597866e-07,
"logits/chosen": -1.1907292604446411,
"logits/rejected": -0.6756631731987,
"logps/chosen": -32.33828353881836,
"logps/rejected": -125.02144622802734,
"loss": 0.0525,
"rewards/accuracies": 1.0,
"rewards/chosen": -0.06472505629062653,
"rewards/margins": 4.0654168128967285,
"rewards/rejected": -4.130141258239746,
"step": 71
},
{
"epoch": 0.8228571428571428,
"grad_norm": 1.0847841501235962,
"learning_rate": 4.999364430216639e-07,
"logits/chosen": -1.237339735031128,
"logits/rejected": -1.5806419849395752,
"logps/chosen": -52.456146240234375,
"logps/rejected": -94.31544494628906,
"loss": 0.0992,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.10363951325416565,
"rewards/margins": 2.9890761375427246,
"rewards/rejected": -2.885436534881592,
"step": 72
},
{
"epoch": 0.8342857142857143,
"grad_norm": 1.278956651687622,
"learning_rate": 4.4460997076297504e-07,
"logits/chosen": -1.0774935483932495,
"logits/rejected": -1.4760003089904785,
"logps/chosen": -43.07012939453125,
"logps/rejected": -74.25629425048828,
"loss": 0.1131,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.06534770131111145,
"rewards/margins": 2.8206787109375,
"rewards/rejected": -2.75533127784729,
"step": 73
},
{
"epoch": 0.8457142857142858,
"grad_norm": 0.7833404541015625,
"learning_rate": 3.922278249222894e-07,
"logits/chosen": -1.1311602592468262,
"logits/rejected": -1.0242271423339844,
"logps/chosen": -53.541568756103516,
"logps/rejected": -105.48152923583984,
"loss": 0.0774,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.04792798310518265,
"rewards/margins": 3.678433418273926,
"rewards/rejected": -3.6305058002471924,
"step": 74
},
{
"epoch": 0.8571428571428571,
"grad_norm": 1.03605318069458,
"learning_rate": 3.4286504241894283e-07,
"logits/chosen": -0.9688073992729187,
"logits/rejected": -1.2700920104980469,
"logps/chosen": -38.00965118408203,
"logps/rejected": -92.08466339111328,
"loss": 0.1049,
"rewards/accuracies": 1.0,
"rewards/chosen": -0.01876715011894703,
"rewards/margins": 3.16585636138916,
"rewards/rejected": -3.1846237182617188,
"step": 75
},
{
"epoch": 0.8685714285714285,
"grad_norm": 1.319770336151123,
"learning_rate": 2.965923349633779e-07,
"logits/chosen": -1.3658266067504883,
"logits/rejected": -1.3608825206756592,
"logps/chosen": -49.00103759765625,
"logps/rejected": -117.49503326416016,
"loss": 0.0818,
"rewards/accuracies": 1.0,
"rewards/chosen": -0.09428122639656067,
"rewards/margins": 3.61112642288208,
"rewards/rejected": -3.7054080963134766,
"step": 76
},
{
"epoch": 0.88,
"grad_norm": 0.9297468662261963,
"learning_rate": 2.53475987763295e-07,
"logits/chosen": -1.0338634252548218,
"logits/rejected": -1.1930313110351562,
"logps/chosen": -67.0118179321289,
"logps/rejected": -106.61903381347656,
"loss": 0.0727,
"rewards/accuracies": 1.0,
"rewards/chosen": -0.13288229703903198,
"rewards/margins": 3.487334728240967,
"rewards/rejected": -3.6202168464660645,
"step": 77
},
{
"epoch": 0.8914285714285715,
"grad_norm": 1.1066629886627197,
"learning_rate": 2.135777645707318e-07,
"logits/chosen": -1.384450078010559,
"logits/rejected": -1.3552913665771484,
"logps/chosen": -52.43301010131836,
"logps/rejected": -101.87602996826172,
"loss": 0.0989,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.009377628564834595,
"rewards/margins": 3.135222911834717,
"rewards/rejected": -3.125845432281494,
"step": 78
},
{
"epoch": 0.9028571428571428,
"grad_norm": 1.0631781816482544,
"learning_rate": 1.7695481920608716e-07,
"logits/chosen": -1.1844675540924072,
"logits/rejected": -1.0223643779754639,
"logps/chosen": -45.87510299682617,
"logps/rejected": -102.84295654296875,
"loss": 0.0862,
"rewards/accuracies": 1.0,
"rewards/chosen": -0.05180816724896431,
"rewards/margins": 3.2761740684509277,
"rewards/rejected": -3.3279824256896973,
"step": 79
},
{
"epoch": 0.9142857142857143,
"grad_norm": 1.2742042541503906,
"learning_rate": 1.4365961368581844e-07,
"logits/chosen": -1.2797547578811646,
"logits/rejected": -1.6902124881744385,
"logps/chosen": -79.47929382324219,
"logps/rejected": -78.93382263183594,
"loss": 0.1025,
"rewards/accuracies": 1.0,
"rewards/chosen": -0.0567280538380146,
"rewards/margins": 2.9206228256225586,
"rewards/rejected": -2.977350950241089,
"step": 80
},
{
"epoch": 0.9257142857142857,
"grad_norm": 0.8278792500495911,
"learning_rate": 1.137398430711123e-07,
"logits/chosen": -1.119363784790039,
"logits/rejected": -0.9186141490936279,
"logps/chosen": -29.899991989135742,
"logps/rejected": -105.7519302368164,
"loss": 0.0648,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.031892240047454834,
"rewards/margins": 3.5144004821777344,
"rewards/rejected": -3.4825081825256348,
"step": 81
},
{
"epoch": 0.9371428571428572,
"grad_norm": 1.0955795049667358,
"learning_rate": 8.723836714516681e-08,
"logits/chosen": -1.2281020879745483,
"logits/rejected": -1.3817219734191895,
"logps/chosen": -73.53196716308594,
"logps/rejected": -103.11698913574219,
"loss": 0.0811,
"rewards/accuracies": 1.0,
"rewards/chosen": -0.06516408920288086,
"rewards/margins": 3.2024097442626953,
"rewards/rejected": -3.267573833465576,
"step": 82
},
{
"epoch": 0.9485714285714286,
"grad_norm": 0.6436601877212524,
"learning_rate": 6.419314901696671e-08,
"logits/chosen": -1.2053653001785278,
"logits/rejected": -1.208804965019226,
"logps/chosen": -28.06381607055664,
"logps/rejected": -100.99942016601562,
"loss": 0.0586,
"rewards/accuracies": 1.0,
"rewards/chosen": -0.027196241542696953,
"rewards/margins": 3.633328437805176,
"rewards/rejected": -3.660524845123291,
"step": 83
},
{
"epoch": 0.96,
"grad_norm": 0.9888738393783569,
"learning_rate": 4.4637200739493514e-08,
"logits/chosen": -1.231987714767456,
"logits/rejected": -1.143172025680542,
"logps/chosen": -57.63927459716797,
"logps/rejected": -96.07897186279297,
"loss": 0.1077,
"rewards/accuracies": 1.0,
"rewards/chosen": -0.05573497712612152,
"rewards/margins": 3.1897521018981934,
"rewards/rejected": -3.2454872131347656,
"step": 84
},
{
"epoch": 0.9714285714285714,
"grad_norm": 1.0415937900543213,
"learning_rate": 2.8598536020278678e-08,
"logits/chosen": -1.221508264541626,
"logits/rejected": -1.4119690656661987,
"logps/chosen": -48.45242691040039,
"logps/rejected": -84.4826431274414,
"loss": 0.0827,
"rewards/accuracies": 1.0,
"rewards/chosen": 0.04423363134264946,
"rewards/margins": 3.218625545501709,
"rewards/rejected": -3.174391984939575,
"step": 85
},
{
"epoch": 0.9828571428571429,
"grad_norm": 1.0360701084136963,
"learning_rate": 1.6100130092037704e-08,
"logits/chosen": -1.3318215608596802,
"logits/rejected": -1.6143568754196167,
"logps/chosen": -45.959354400634766,
"logps/rejected": -79.45930480957031,
"loss": 0.0892,
"rewards/accuracies": 1.0,
"rewards/chosen": -0.08850360661745071,
"rewards/margins": 2.9804043769836426,
"rewards/rejected": -3.068908214569092,
"step": 86
},
{
"epoch": 0.9942857142857143,
"grad_norm": 0.7161802053451538,
"learning_rate": 7.159886800869875e-09,
"logits/chosen": -1.1106700897216797,
"logits/rejected": -0.9769763946533203,
"logps/chosen": -85.0906982421875,
"logps/rejected": -132.0802459716797,
"loss": 0.0524,
"rewards/accuracies": 1.0,
"rewards/chosen": -0.0784958153963089,
"rewards/margins": 4.037193298339844,
"rewards/rejected": -4.115689277648926,
"step": 87
},
{
"epoch": 1.0,
"grad_norm": 2.9429450035095215,
"learning_rate": 1.7906129591713228e-09,
"logits/chosen": -1.2418022155761719,
"logits/rejected": -0.8798779249191284,
"logps/chosen": -90.4301986694336,
"logps/rejected": -115.04806518554688,
"loss": 0.0987,
"rewards/accuracies": 1.0,
"rewards/chosen": -0.08904826641082764,
"rewards/margins": 3.531545639038086,
"rewards/rejected": -3.620594024658203,
"step": 88
},
{
"epoch": 1.0,
"eval_logits/chosen": -1.1477130651474,
"eval_logits/rejected": -1.244410514831543,
"eval_logps/chosen": -91.70614624023438,
"eval_logps/rejected": -111.82247161865234,
"eval_loss": 0.1359921395778656,
"eval_rewards/accuracies": 0.9700000286102295,
"eval_rewards/chosen": -0.5955771207809448,
"eval_rewards/margins": 2.9342737197875977,
"eval_rewards/rejected": -3.529850959777832,
"eval_runtime": 209.3361,
"eval_samples_per_second": 0.955,
"eval_steps_per_second": 0.955,
"step": 88
},
{
"epoch": 1.0,
"step": 88,
"total_flos": 0.0,
"train_loss": 0.2132695221172815,
"train_runtime": 4416.7921,
"train_samples_per_second": 0.317,
"train_steps_per_second": 0.02
}
],
"trial_params": null,
"global_step": 88,
"is_local_process_zero": true,
"total_flos": 0.0,
"num_train_epochs": 1,
"epoch": 1.0,
"best_metric": null,
"trial_name": null
}