{ "best_global_step": null, "best_metric": null, "best_model_checkpoint": null, "epoch": 1.9979429914781075, "eval_steps": 200, "global_step": 5100, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "epoch": 0.019590557351356647, "grad_norm": 140.09786987304688, "learning_rate": 3.2666666666666663e-07, "logits/chosen": -0.9822076559066772, "logits/rejected": -0.6774621605873108, "logps/chosen": -352.589111328125, "logps/rejected": -284.4425354003906, "loss": 0.6901, "rewards/accuracies": 0.47999998927116394, "rewards/chosen": 0.0031729438342154026, "rewards/margins": 0.008149052038788795, "rewards/rejected": -0.004976108204573393, "step": 50 }, { "epoch": 0.03918111470271329, "grad_norm": 128.5372314453125, "learning_rate": 6.6e-07, "logits/chosen": -0.9334858059883118, "logits/rejected": -0.6409775018692017, "logps/chosen": -366.2322692871094, "logps/rejected": -287.4626770019531, "loss": 0.6758, "rewards/accuracies": 0.6150000095367432, "rewards/chosen": 0.02407059632241726, "rewards/margins": 0.04141266271471977, "rewards/rejected": -0.017342066392302513, "step": 100 }, { "epoch": 0.05877167205406994, "grad_norm": 103.95256805419922, "learning_rate": 9.933333333333333e-07, "logits/chosen": -0.8153188228607178, "logits/rejected": -0.5176287293434143, "logps/chosen": -373.8503112792969, "logps/rejected": -307.275634765625, "loss": 0.6225, "rewards/accuracies": 0.6775000095367432, "rewards/chosen": 0.07690317183732986, "rewards/margins": 0.18566985428333282, "rewards/rejected": -0.10876669734716415, "step": 150 }, { "epoch": 0.07836222940542659, "grad_norm": 130.03802490234375, "learning_rate": 9.99894936347371e-07, "logits/chosen": -0.8271468877792358, "logits/rejected": -0.5104550719261169, "logps/chosen": -350.3367614746094, "logps/rejected": -296.0983581542969, "loss": 0.6152, "rewards/accuracies": 0.6775000095367432, "rewards/chosen": -0.0007632786291651428, "rewards/margins": 0.25347909331321716, "rewards/rejected": -0.2542423605918884, "step": 200 }, { "epoch": 0.07836222940542659, "eval_logits/chosen": -0.8247441053390503, "eval_logits/rejected": -0.5691510438919067, "eval_logps/chosen": -352.2530212402344, "eval_logps/rejected": -288.40521240234375, "eval_loss": 0.6011638641357422, "eval_rewards/accuracies": 0.684013307094574, "eval_rewards/chosen": 0.006044471170753241, "eval_rewards/margins": 0.30330440402030945, "eval_rewards/rejected": -0.2972599267959595, "eval_runtime": 180.5524, "eval_samples_per_second": 13.304, "eval_steps_per_second": 6.652, "step": 200 }, { "epoch": 0.09795278675678323, "grad_norm": 127.07317352294922, "learning_rate": 9.995711712979657e-07, "logits/chosen": -0.7803874015808105, "logits/rejected": -0.5503089427947998, "logps/chosen": -354.3157043457031, "logps/rejected": -271.8356018066406, "loss": 0.5935, "rewards/accuracies": 0.6825000047683716, "rewards/chosen": -0.0023533145431429148, "rewards/margins": 0.3317827880382538, "rewards/rejected": -0.33413612842559814, "step": 250 }, { "epoch": 0.11754334410813988, "grad_norm": 107.00403594970703, "learning_rate": 9.990288027658056e-07, "logits/chosen": -0.8059212565422058, "logits/rejected": -0.5893051028251648, "logps/chosen": -349.48760986328125, "logps/rejected": -285.4340515136719, "loss": 0.5528, "rewards/accuracies": 0.7599999904632568, "rewards/chosen": 0.04797028377652168, "rewards/margins": 0.4950464367866516, "rewards/rejected": -0.44707614183425903, "step": 300 }, { "epoch": 0.13713390145949653, "grad_norm": 118.62214660644531, "learning_rate": 9.982680680817391e-07, "logits/chosen": -0.9657462239265442, "logits/rejected": -0.647233784198761, "logps/chosen": -355.55096435546875, "logps/rejected": -308.36053466796875, "loss": 0.56, "rewards/accuracies": 0.7074999809265137, "rewards/chosen": -0.11357284337282181, "rewards/margins": 0.5093904137611389, "rewards/rejected": -0.6229632496833801, "step": 350 }, { "epoch": 0.15672445881085317, "grad_norm": 80.19744110107422, "learning_rate": 9.972893001297698e-07, "logits/chosen": -1.0753679275512695, "logits/rejected": -0.731191873550415, "logps/chosen": -374.8988952636719, "logps/rejected": -319.61199951171875, "loss": 0.5683, "rewards/accuracies": 0.7049999833106995, "rewards/chosen": -0.20595918595790863, "rewards/margins": 0.5294285416603088, "rewards/rejected": -0.7353877425193787, "step": 400 }, { "epoch": 0.15672445881085317, "eval_logits/chosen": -1.0395917892456055, "eval_logits/rejected": -0.7957448363304138, "eval_logps/chosen": -354.0768127441406, "eval_logps/rejected": -293.1625061035156, "eval_loss": 0.5456792116165161, "eval_rewards/accuracies": 0.7264779210090637, "eval_rewards/chosen": -0.17633533477783203, "eval_rewards/margins": 0.5966517329216003, "eval_rewards/rejected": -0.7729870080947876, "eval_runtime": 180.5278, "eval_samples_per_second": 13.305, "eval_steps_per_second": 6.653, "step": 400 }, { "epoch": 0.17631501616220982, "grad_norm": 97.5062026977539, "learning_rate": 9.96092927201391e-07, "logits/chosen": -1.0175271034240723, "logits/rejected": -0.752033531665802, "logps/chosen": -355.3705749511719, "logps/rejected": -302.32373046875, "loss": 0.5547, "rewards/accuracies": 0.7024999856948853, "rewards/chosen": -0.2221955806016922, "rewards/margins": 0.6058707237243652, "rewards/rejected": -0.828066349029541, "step": 450 }, { "epoch": 0.19590557351356647, "grad_norm": 109.52022552490234, "learning_rate": 9.946794728081737e-07, "logits/chosen": -1.2173391580581665, "logits/rejected": -0.8966682553291321, "logps/chosen": -345.02984619140625, "logps/rejected": -300.69268798828125, "loss": 0.5145, "rewards/accuracies": 0.7250000238418579, "rewards/chosen": -0.26011258363723755, "rewards/margins": 0.7154355049133301, "rewards/rejected": -0.9755480885505676, "step": 500 }, { "epoch": 0.2154961308649231, "grad_norm": 65.85977172851562, "learning_rate": 9.930495554526878e-07, "logits/chosen": -1.1911191940307617, "logits/rejected": -0.9048889875411987, "logps/chosen": -360.3658142089844, "logps/rejected": -297.0860900878906, "loss": 0.5025, "rewards/accuracies": 0.7275000214576721, "rewards/chosen": -0.28734278678894043, "rewards/margins": 0.8380499482154846, "rewards/rejected": -1.1253927946090698, "step": 550 }, { "epoch": 0.23508668821627976, "grad_norm": 63.237606048583984, "learning_rate": 9.912038883578552e-07, "logits/chosen": -1.0660635232925415, "logits/rejected": -0.7923431992530823, "logps/chosen": -363.8102722167969, "logps/rejected": -295.3084716796875, "loss": 0.5179, "rewards/accuracies": 0.7300000190734863, "rewards/chosen": -0.4248141050338745, "rewards/margins": 0.8246171474456787, "rewards/rejected": -1.2494312524795532, "step": 600 }, { "epoch": 0.23508668821627976, "eval_logits/chosen": -1.0540363788604736, "eval_logits/rejected": -0.8268531560897827, "eval_logps/chosen": -355.8159484863281, "eval_logps/rejected": -297.4617919921875, "eval_loss": 0.5122258067131042, "eval_rewards/accuracies": 0.7373022437095642, "eval_rewards/chosen": -0.35024747252464294, "eval_rewards/margins": 0.8526709675788879, "eval_rewards/rejected": -1.2029184103012085, "eval_runtime": 181.1919, "eval_samples_per_second": 13.257, "eval_steps_per_second": 6.628, "step": 600 }, { "epoch": 0.2546772455676364, "grad_norm": 194.335693359375, "learning_rate": 9.891432791548562e-07, "logits/chosen": -1.0396273136138916, "logits/rejected": -0.8581287860870361, "logps/chosen": -375.4624938964844, "logps/rejected": -302.572998046875, "loss": 0.4782, "rewards/accuracies": 0.7799999713897705, "rewards/chosen": -0.3973628580570221, "rewards/margins": 0.9747829437255859, "rewards/rejected": -1.3721458911895752, "step": 650 }, { "epoch": 0.27426780291899305, "grad_norm": 65.69367980957031, "learning_rate": 9.868686295297258e-07, "logits/chosen": -1.070594072341919, "logits/rejected": -0.848624050617218, "logps/chosen": -358.2480773925781, "logps/rejected": -311.5008850097656, "loss": 0.5109, "rewards/accuracies": 0.7475000023841858, "rewards/chosen": -0.465026319026947, "rewards/margins": 0.9383654594421387, "rewards/rejected": -1.4033918380737305, "step": 700 }, { "epoch": 0.29385836027034967, "grad_norm": 116.7066650390625, "learning_rate": 9.8438093482879e-07, "logits/chosen": -1.0724475383758545, "logits/rejected": -0.8224292993545532, "logps/chosen": -373.66754150390625, "logps/rejected": -297.4761047363281, "loss": 0.483, "rewards/accuracies": 0.7699999809265137, "rewards/chosen": -0.39762890338897705, "rewards/margins": 1.163187026977539, "rewards/rejected": -1.5608159303665161, "step": 750 }, { "epoch": 0.31344891762170635, "grad_norm": 124.66069793701172, "learning_rate": 9.81681283623121e-07, "logits/chosen": -1.0539674758911133, "logits/rejected": -0.779601514339447, "logps/chosen": -347.1493225097656, "logps/rejected": -300.728515625, "loss": 0.5427, "rewards/accuracies": 0.7250000238418579, "rewards/chosen": -0.48545289039611816, "rewards/margins": 0.8515650033950806, "rewards/rejected": -1.3370177745819092, "step": 800 }, { "epoch": 0.31344891762170635, "eval_logits/chosen": -0.9799102544784546, "eval_logits/rejected": -0.7651399970054626, "eval_logps/chosen": -356.1210021972656, "eval_logps/rejected": -299.1585388183594, "eval_loss": 0.4938255250453949, "eval_rewards/accuracies": 0.7493755221366882, "eval_rewards/chosen": -0.38075584173202515, "eval_rewards/margins": 0.9918379783630371, "eval_rewards/rejected": -1.372593641281128, "eval_runtime": 181.2826, "eval_samples_per_second": 13.25, "eval_steps_per_second": 6.625, "step": 800 }, { "epoch": 0.33303947497306297, "grad_norm": 120.1912612915039, "learning_rate": 9.787708572321983e-07, "logits/chosen": -1.034041404724121, "logits/rejected": -0.810564398765564, "logps/chosen": -367.707763671875, "logps/rejected": -309.762939453125, "loss": 0.4326, "rewards/accuracies": 0.8125, "rewards/chosen": -0.3861949145793915, "rewards/margins": 1.226701021194458, "rewards/rejected": -1.6128960847854614, "step": 850 }, { "epoch": 0.35263003232441964, "grad_norm": 79.74503326416016, "learning_rate": 9.756509292069825e-07, "logits/chosen": -1.125342845916748, "logits/rejected": -0.875031590461731, "logps/chosen": -357.8549499511719, "logps/rejected": -289.9258117675781, "loss": 0.4864, "rewards/accuracies": 0.762499988079071, "rewards/chosen": -0.5919533967971802, "rewards/margins": 1.2158567905426025, "rewards/rejected": -1.8078101873397827, "step": 900 }, { "epoch": 0.37222058967577626, "grad_norm": 136.9542236328125, "learning_rate": 9.72322864772634e-07, "logits/chosen": -1.1560072898864746, "logits/rejected": -0.886911928653717, "logps/chosen": -364.5694274902344, "logps/rejected": -293.49981689453125, "loss": 0.51, "rewards/accuracies": 0.7400000095367432, "rewards/chosen": -0.5705673098564148, "rewards/margins": 1.0413060188293457, "rewards/rejected": -1.6118732690811157, "step": 950 }, { "epoch": 0.39181114702713293, "grad_norm": 116.3714370727539, "learning_rate": 9.687881202311132e-07, "logits/chosen": -1.0079857110977173, "logits/rejected": -0.7752091884613037, "logps/chosen": -349.3457946777344, "logps/rejected": -286.99993896484375, "loss": 0.4722, "rewards/accuracies": 0.7749999761581421, "rewards/chosen": -0.4944779872894287, "rewards/margins": 1.1931304931640625, "rewards/rejected": -1.6876084804534912, "step": 1000 }, { "epoch": 0.39181114702713293, "eval_logits/chosen": -1.0761741399765015, "eval_logits/rejected": -0.8803514838218689, "eval_logps/chosen": -357.8018798828125, "eval_logps/rejected": -302.2410888671875, "eval_loss": 0.4866333603858948, "eval_rewards/accuracies": 0.7510408163070679, "eval_rewards/chosen": -0.5488451719284058, "eval_rewards/margins": 1.1320006847381592, "eval_rewards/rejected": -1.680845856666565, "eval_runtime": 181.5986, "eval_samples_per_second": 13.227, "eval_steps_per_second": 6.613, "step": 1000 }, { "epoch": 0.41140170437848955, "grad_norm": 169.1030731201172, "learning_rate": 9.65048242323929e-07, "logits/chosen": -1.0233768224716187, "logits/rejected": -0.740478515625, "logps/chosen": -380.3099365234375, "logps/rejected": -323.1108703613281, "loss": 0.4805, "rewards/accuracies": 0.7774999737739563, "rewards/chosen": -0.6764897704124451, "rewards/margins": 1.2643505334854126, "rewards/rejected": -1.940840482711792, "step": 1050 }, { "epoch": 0.4309922617298462, "grad_norm": 107.12033081054688, "learning_rate": 9.611048675553127e-07, "logits/chosen": -1.0799275636672974, "logits/rejected": -0.8886963129043579, "logps/chosen": -387.2933349609375, "logps/rejected": -321.2319030761719, "loss": 0.4268, "rewards/accuracies": 0.7774999737739563, "rewards/chosen": -0.5030026435852051, "rewards/margins": 1.4225863218307495, "rewards/rejected": -1.925588846206665, "step": 1100 }, { "epoch": 0.45058281908120285, "grad_norm": 124.23180389404297, "learning_rate": 9.569597214761124e-07, "logits/chosen": -1.0482264757156372, "logits/rejected": -0.8745830059051514, "logps/chosen": -352.1131591796875, "logps/rejected": -303.13592529296875, "loss": 0.4846, "rewards/accuracies": 0.7674999833106995, "rewards/chosen": -0.689760684967041, "rewards/margins": 1.3204187154769897, "rewards/rejected": -2.0101795196533203, "step": 1150 }, { "epoch": 0.4701733764325595, "grad_norm": 68.6223373413086, "learning_rate": 9.526146179287222e-07, "logits/chosen": -1.097909927368164, "logits/rejected": -0.8678469657897949, "logps/chosen": -358.7846984863281, "logps/rejected": -314.0942077636719, "loss": 0.4829, "rewards/accuracies": 0.7649999856948853, "rewards/chosen": -0.6658291816711426, "rewards/margins": 1.3254380226135254, "rewards/rejected": -1.991267204284668, "step": 1200 }, { "epoch": 0.4701733764325595, "eval_logits/chosen": -1.1058708429336548, "eval_logits/rejected": -0.9207807183265686, "eval_logps/chosen": -358.45928955078125, "eval_logps/rejected": -304.12744140625, "eval_loss": 0.4782937467098236, "eval_rewards/accuracies": 0.7585345506668091, "eval_rewards/chosen": -0.6145861148834229, "eval_rewards/margins": 1.2548983097076416, "eval_rewards/rejected": -1.8694841861724854, "eval_runtime": 181.5576, "eval_samples_per_second": 13.23, "eval_steps_per_second": 6.615, "step": 1200 }, { "epoch": 0.48976393378391614, "grad_norm": 182.0519561767578, "learning_rate": 9.480714582533773e-07, "logits/chosen": -1.0906615257263184, "logits/rejected": -0.8988884091377258, "logps/chosen": -363.1963195800781, "logps/rejected": -310.1281433105469, "loss": 0.5144, "rewards/accuracies": 0.7200000286102295, "rewards/chosen": -0.7843419909477234, "rewards/margins": 1.230003833770752, "rewards/rejected": -2.014345645904541, "step": 1250 }, { "epoch": 0.5093544911352728, "grad_norm": 124.72360229492188, "learning_rate": 9.433322304561614e-07, "logits/chosen": -1.069496750831604, "logits/rejected": -0.8835853338241577, "logps/chosen": -361.09356689453125, "logps/rejected": -313.1136779785156, "loss": 0.463, "rewards/accuracies": 0.7825000286102295, "rewards/chosen": -0.662202000617981, "rewards/margins": 1.3414545059204102, "rewards/rejected": -2.0036566257476807, "step": 1300 }, { "epoch": 0.5289450484866295, "grad_norm": 124.38642120361328, "learning_rate": 9.383990083390903e-07, "logits/chosen": -1.080662488937378, "logits/rejected": -0.8675041794776917, "logps/chosen": -355.84405517578125, "logps/rejected": -322.5790710449219, "loss": 0.4625, "rewards/accuracies": 0.7674999833106995, "rewards/chosen": -0.5591977834701538, "rewards/margins": 1.3175528049468994, "rewards/rejected": -1.8767504692077637, "step": 1350 }, { "epoch": 0.5485356058379861, "grad_norm": 110.81146240234375, "learning_rate": 9.332739505926528e-07, "logits/chosen": -1.1147152185440063, "logits/rejected": -0.9014944434165955, "logps/chosen": -360.80523681640625, "logps/rejected": -295.3592834472656, "loss": 0.4819, "rewards/accuracies": 0.737500011920929, "rewards/chosen": -0.6334275603294373, "rewards/margins": 1.295997142791748, "rewards/rejected": -1.92942476272583, "step": 1400 }, { "epoch": 0.5485356058379861, "eval_logits/chosen": -1.0615795850753784, "eval_logits/rejected": -0.8742749094963074, "eval_logps/chosen": -358.2158508300781, "eval_logps/rejected": -304.3434753417969, "eval_loss": 0.4777006208896637, "eval_rewards/accuracies": 0.7635303735733032, "eval_rewards/chosen": -0.590242862701416, "eval_rewards/margins": 1.3008415699005127, "eval_rewards/rejected": -1.8910844326019287, "eval_runtime": 182.5694, "eval_samples_per_second": 13.157, "eval_steps_per_second": 6.578, "step": 1400 }, { "epoch": 0.5681261631893427, "grad_norm": 99.77544403076172, "learning_rate": 9.279592998512064e-07, "logits/chosen": -1.0060768127441406, "logits/rejected": -0.828403115272522, "logps/chosen": -386.8955078125, "logps/rejected": -324.961669921875, "loss": 0.4593, "rewards/accuracies": 0.7749999761581421, "rewards/chosen": -0.6105374693870544, "rewards/margins": 1.4274816513061523, "rewards/rejected": -2.0380191802978516, "step": 1450 }, { "epoch": 0.5877167205406993, "grad_norm": 113.63347625732422, "learning_rate": 9.224573817116396e-07, "logits/chosen": -1.1257575750350952, "logits/rejected": -0.8088225722312927, "logps/chosen": -356.369140625, "logps/rejected": -299.9069519042969, "loss": 0.4751, "rewards/accuracies": 0.7674999833106995, "rewards/chosen": -0.7516566514968872, "rewards/margins": 1.3119940757751465, "rewards/rejected": -2.063650608062744, "step": 1500 }, { "epoch": 0.6073072778920561, "grad_norm": 71.0758285522461, "learning_rate": 9.16770603715733e-07, "logits/chosen": -1.0219570398330688, "logits/rejected": -0.8258044719696045, "logps/chosen": -365.3489074707031, "logps/rejected": -317.51776123046875, "loss": 0.4755, "rewards/accuracies": 0.7724999785423279, "rewards/chosen": -0.722920298576355, "rewards/margins": 1.3333240747451782, "rewards/rejected": -2.0562446117401123, "step": 1550 }, { "epoch": 0.6268978352434127, "grad_norm": 63.271759033203125, "learning_rate": 9.109014542966609e-07, "logits/chosen": -1.0383367538452148, "logits/rejected": -0.8199602365493774, "logps/chosen": -361.697509765625, "logps/rejected": -319.4376525878906, "loss": 0.4271, "rewards/accuracies": 0.8100000023841858, "rewards/chosen": -0.8095757961273193, "rewards/margins": 1.4505212306976318, "rewards/rejected": -2.260097026824951, "step": 1600 }, { "epoch": 0.6268978352434127, "eval_logits/chosen": -1.0107686519622803, "eval_logits/rejected": -0.826732873916626, "eval_logps/chosen": -360.0285339355469, "eval_logps/rejected": -307.601318359375, "eval_loss": 0.4775010347366333, "eval_rewards/accuracies": 0.768109917640686, "eval_rewards/chosen": -0.7715086936950684, "eval_rewards/margins": 1.445361852645874, "eval_rewards/rejected": -2.2168707847595215, "eval_runtime": 181.1951, "eval_samples_per_second": 13.256, "eval_steps_per_second": 6.628, "step": 1600 }, { "epoch": 0.6464883925947693, "grad_norm": 69.98014831542969, "learning_rate": 9.04852501690097e-07, "logits/chosen": -1.0106360912322998, "logits/rejected": -0.769228458404541, "logps/chosen": -361.59783935546875, "logps/rejected": -298.4144287109375, "loss": 0.4807, "rewards/accuracies": 0.7749999761581421, "rewards/chosen": -0.6844636797904968, "rewards/margins": 1.4386271238327026, "rewards/rejected": -2.1230905055999756, "step": 1650 }, { "epoch": 0.6660789499461259, "grad_norm": 73.16764831542969, "learning_rate": 8.986263928104007e-07, "logits/chosen": -1.0747100114822388, "logits/rejected": -0.8522970676422119, "logps/chosen": -377.2361755371094, "logps/rejected": -314.54180908203125, "loss": 0.475, "rewards/accuracies": 0.7925000190734863, "rewards/chosen": -0.6853989958763123, "rewards/margins": 1.3294869661331177, "rewards/rejected": -2.014885902404785, "step": 1700 }, { "epoch": 0.6856695072974827, "grad_norm": 159.627685546875, "learning_rate": 8.922258520923739e-07, "logits/chosen": -1.1866579055786133, "logits/rejected": -0.9568431973457336, "logps/chosen": -363.7584228515625, "logps/rejected": -335.536376953125, "loss": 0.4701, "rewards/accuracies": 0.7549999952316284, "rewards/chosen": -0.6905403733253479, "rewards/margins": 1.4639062881469727, "rewards/rejected": -2.1544463634490967, "step": 1750 }, { "epoch": 0.7052600646488393, "grad_norm": 59.52585983276367, "learning_rate": 8.856536802990969e-07, "logits/chosen": -1.2136218547821045, "logits/rejected": -0.915833055973053, "logps/chosen": -368.9427795410156, "logps/rejected": -318.7424621582031, "loss": 0.4355, "rewards/accuracies": 0.7925000190734863, "rewards/chosen": -0.7404943704605103, "rewards/margins": 1.615696907043457, "rewards/rejected": -2.3561911582946777, "step": 1800 }, { "epoch": 0.7052600646488393, "eval_logits/chosen": -1.137018084526062, "eval_logits/rejected": -0.9567646384239197, "eval_logps/chosen": -360.75030517578125, "eval_logps/rejected": -307.82464599609375, "eval_loss": 0.4773857891559601, "eval_rewards/accuracies": 0.770191490650177, "eval_rewards/chosen": -0.8436892032623291, "eval_rewards/margins": 1.3955140113830566, "eval_rewards/rejected": -2.2392032146453857, "eval_runtime": 181.4174, "eval_samples_per_second": 13.24, "eval_steps_per_second": 6.62, "step": 1800 }, { "epoch": 0.7248506220001959, "grad_norm": 145.34722900390625, "learning_rate": 8.789127532963639e-07, "logits/chosen": -1.1216288805007935, "logits/rejected": -0.8633120656013489, "logps/chosen": -379.6500244140625, "logps/rejected": -340.3668212890625, "loss": 0.4937, "rewards/accuracies": 0.762499988079071, "rewards/chosen": -0.894076406955719, "rewards/margins": 1.335474967956543, "rewards/rejected": -2.2295515537261963, "step": 1850 }, { "epoch": 0.7444411793515525, "grad_norm": 85.14502716064453, "learning_rate": 8.720060207942547e-07, "logits/chosen": -1.1888411045074463, "logits/rejected": -0.8253584504127502, "logps/chosen": -358.1293029785156, "logps/rejected": -322.2793273925781, "loss": 0.453, "rewards/accuracies": 0.7774999737739563, "rewards/chosen": -0.7874532341957092, "rewards/margins": 1.4413965940475464, "rewards/rejected": -2.2288498878479004, "step": 1900 }, { "epoch": 0.7640317367029092, "grad_norm": 59.02031707763672, "learning_rate": 8.649365050563955e-07, "logits/chosen": -1.0339776277542114, "logits/rejected": -0.7359542846679688, "logps/chosen": -379.0245666503906, "logps/rejected": -335.61248779296875, "loss": 0.383, "rewards/accuracies": 0.824999988079071, "rewards/chosen": -0.9282081127166748, "rewards/margins": 1.724035382270813, "rewards/rejected": -2.6522433757781982, "step": 1950 }, { "epoch": 0.7836222940542659, "grad_norm": 100.15818786621094, "learning_rate": 8.577072995774679e-07, "logits/chosen": -1.0461410284042358, "logits/rejected": -0.7923344373703003, "logps/chosen": -358.7364196777344, "logps/rejected": -319.2044372558594, "loss": 0.5073, "rewards/accuracies": 0.7450000047683716, "rewards/chosen": -1.07187819480896, "rewards/margins": 1.472280740737915, "rewards/rejected": -2.544158697128296, "step": 2000 }, { "epoch": 0.7836222940542659, "eval_logits/chosen": -1.0298668146133423, "eval_logits/rejected": -0.857089638710022, "eval_logps/chosen": -361.0681457519531, "eval_logps/rejected": -309.28570556640625, "eval_loss": 0.4695436656475067, "eval_rewards/accuracies": 0.7756036520004272, "eval_rewards/chosen": -0.8754721283912659, "eval_rewards/margins": 1.5098369121551514, "eval_rewards/rejected": -2.3853089809417725, "eval_runtime": 181.4637, "eval_samples_per_second": 13.237, "eval_steps_per_second": 6.618, "step": 2000 }, { "epoch": 0.8032128514056225, "grad_norm": 109.68525695800781, "learning_rate": 8.503215677295522e-07, "logits/chosen": -1.1481313705444336, "logits/rejected": -0.8855399489402771, "logps/chosen": -377.3407897949219, "logps/rejected": -321.94903564453125, "loss": 0.4, "rewards/accuracies": 0.8075000047683716, "rewards/chosen": -0.8187921047210693, "rewards/margins": 1.6883336305618286, "rewards/rejected": -2.5071256160736084, "step": 2050 }, { "epoch": 0.8228034087569791, "grad_norm": 113.09908294677734, "learning_rate": 8.427825413778904e-07, "logits/chosen": -1.182418704032898, "logits/rejected": -1.0226842164993286, "logps/chosen": -370.88800048828125, "logps/rejected": -316.3885803222656, "loss": 0.4302, "rewards/accuracies": 0.7925000190734863, "rewards/chosen": -0.8482898473739624, "rewards/margins": 1.790774941444397, "rewards/rejected": -2.6390650272369385, "step": 2100 }, { "epoch": 0.8423939661083358, "grad_norm": 115.06123352050781, "learning_rate": 8.350935194666808e-07, "logits/chosen": -1.19704008102417, "logits/rejected": -0.9841734170913696, "logps/chosen": -344.68988037109375, "logps/rejected": -300.1245422363281, "loss": 0.4607, "rewards/accuracies": 0.762499988079071, "rewards/chosen": -0.8847514390945435, "rewards/margins": 1.6138572692871094, "rewards/rejected": -2.4986085891723633, "step": 2150 }, { "epoch": 0.8619845234596925, "grad_norm": 91.62993621826172, "learning_rate": 8.272578665755176e-07, "logits/chosen": -1.1561052799224854, "logits/rejected": -0.892173171043396, "logps/chosen": -357.5077819824219, "logps/rejected": -313.1963806152344, "loss": 0.4934, "rewards/accuracies": 0.7574999928474426, "rewards/chosen": -0.9803217053413391, "rewards/margins": 1.5475577116012573, "rewards/rejected": -2.527879238128662, "step": 2200 }, { "epoch": 0.8619845234596925, "eval_logits/chosen": -1.0830334424972534, "eval_logits/rejected": -0.9147012233734131, "eval_logps/chosen": -361.2430114746094, "eval_logps/rejected": -310.0792541503906, "eval_loss": 0.4646490514278412, "eval_rewards/accuracies": 0.7768526077270508, "eval_rewards/chosen": -0.8929603099822998, "eval_rewards/margins": 1.5717030763626099, "eval_rewards/rejected": -2.464663505554199, "eval_runtime": 183.2831, "eval_samples_per_second": 13.105, "eval_steps_per_second": 6.553, "step": 2200 }, { "epoch": 0.8815750808110491, "grad_norm": 72.61209869384766, "learning_rate": 8.192790114471106e-07, "logits/chosen": -1.1451025009155273, "logits/rejected": -0.9403939247131348, "logps/chosen": -370.800048828125, "logps/rejected": -303.31817626953125, "loss": 0.4352, "rewards/accuracies": 0.7875000238418579, "rewards/chosen": -0.7773234844207764, "rewards/margins": 1.5500972270965576, "rewards/rejected": -2.327420711517334, "step": 2250 }, { "epoch": 0.9011656381624057, "grad_norm": 70.87027740478516, "learning_rate": 8.111604454869285e-07, "logits/chosen": -1.17734956741333, "logits/rejected": -0.9346526861190796, "logps/chosen": -345.1195068359375, "logps/rejected": -306.4920654296875, "loss": 0.4703, "rewards/accuracies": 0.7674999833106995, "rewards/chosen": -0.9427626729011536, "rewards/margins": 1.593432903289795, "rewards/rejected": -2.536195755004883, "step": 2300 }, { "epoch": 0.9207561955137624, "grad_norm": 90.32552337646484, "learning_rate": 8.029057212354218e-07, "logits/chosen": -1.0256972312927246, "logits/rejected": -0.9072439074516296, "logps/chosen": -364.8022155761719, "logps/rejected": -313.5185241699219, "loss": 0.4846, "rewards/accuracies": 0.7699999809265137, "rewards/chosen": -1.1208609342575073, "rewards/margins": 1.5102592706680298, "rewards/rejected": -2.631119966506958, "step": 2350 }, { "epoch": 0.940346752865119, "grad_norm": 143.2118377685547, "learning_rate": 7.945184508134936e-07, "logits/chosen": -1.1666345596313477, "logits/rejected": -0.9767065644264221, "logps/chosen": -391.8117980957031, "logps/rejected": -319.5590515136719, "loss": 0.4403, "rewards/accuracies": 0.7875000238418579, "rewards/chosen": -0.9298499822616577, "rewards/margins": 1.5455856323242188, "rewards/rejected": -2.475435495376587, "step": 2400 }, { "epoch": 0.940346752865119, "eval_logits/chosen": -1.10908043384552, "eval_logits/rejected": -0.9499452710151672, "eval_logps/chosen": -362.099609375, "eval_logps/rejected": -311.1372375488281, "eval_loss": 0.46884483098983765, "eval_rewards/accuracies": 0.7722731232643127, "eval_rewards/chosen": -0.9786169528961182, "eval_rewards/margins": 1.5918443202972412, "eval_rewards/rejected": -2.5704612731933594, "eval_runtime": 181.3567, "eval_samples_per_second": 13.245, "eval_steps_per_second": 6.622, "step": 2400 }, { "epoch": 0.9599373102164757, "grad_norm": 192.61532592773438, "learning_rate": 7.860023043419004e-07, "logits/chosen": -1.1775944232940674, "logits/rejected": -0.9322341084480286, "logps/chosen": -363.9286193847656, "logps/rejected": -324.30621337890625, "loss": 0.4438, "rewards/accuracies": 0.8174999952316284, "rewards/chosen": -1.010249376296997, "rewards/margins": 1.8364521265029907, "rewards/rejected": -2.8467013835906982, "step": 2450 }, { "epoch": 0.9795278675678323, "grad_norm": 154.35006713867188, "learning_rate": 7.773610083352717e-07, "logits/chosen": -0.9925041794776917, "logits/rejected": -0.813052773475647, "logps/chosen": -363.6401062011719, "logps/rejected": -323.7989501953125, "loss": 0.5359, "rewards/accuracies": 0.7225000262260437, "rewards/chosen": -1.0799657106399536, "rewards/margins": 1.3734463453292847, "rewards/rejected": -2.453411817550659, "step": 2500 }, { "epoch": 0.9991184249191889, "grad_norm": 196.2805633544922, "learning_rate": 7.685983440714535e-07, "logits/chosen": -1.093634009361267, "logits/rejected": -0.8999694585800171, "logps/chosen": -393.096435546875, "logps/rejected": -340.03387451171875, "loss": 0.4938, "rewards/accuracies": 0.7699999809265137, "rewards/chosen": -1.0175117254257202, "rewards/margins": 1.5324511528015137, "rewards/rejected": -2.5499629974365234, "step": 2550 }, { "epoch": 1.0184151239102752, "grad_norm": 34.11044692993164, "learning_rate": 7.597181459368884e-07, "logits/chosen": -1.1935698986053467, "logits/rejected": -0.9796786308288574, "logps/chosen": -363.0191955566406, "logps/rejected": -347.12249755859375, "loss": 0.129, "rewards/accuracies": 0.9670050740242004, "rewards/chosen": -0.2811751663684845, "rewards/margins": 3.3759641647338867, "rewards/rejected": -3.657139301300049, "step": 2600 }, { "epoch": 1.0184151239102752, "eval_logits/chosen": -1.2456655502319336, "eval_logits/rejected": -1.0991578102111816, "eval_logps/chosen": -363.8660888671875, "eval_logps/rejected": -313.871826171875, "eval_loss": 0.47346433997154236, "eval_rewards/accuracies": 0.7718567848205566, "eval_rewards/chosen": -1.1552621126174927, "eval_rewards/margins": 1.68865966796875, "eval_rewards/rejected": -2.8439218997955322, "eval_runtime": 181.5327, "eval_samples_per_second": 13.232, "eval_steps_per_second": 6.616, "step": 2600 }, { "epoch": 1.0380056812616318, "grad_norm": 75.25180053710938, "learning_rate": 7.50724299748756e-07, "logits/chosen": -1.2610849142074585, "logits/rejected": -1.150437355041504, "logps/chosen": -375.75, "logps/rejected": -315.3388366699219, "loss": 0.146, "rewards/accuracies": 0.9674999713897705, "rewards/chosen": -0.38413771986961365, "rewards/margins": 3.210354804992676, "rewards/rejected": -3.5944931507110596, "step": 2650 }, { "epoch": 1.0575962386129885, "grad_norm": 19.142627716064453, "learning_rate": 7.416207410546075e-07, "logits/chosen": -1.4331450462341309, "logits/rejected": -1.1033505201339722, "logps/chosen": -341.708251953125, "logps/rejected": -322.0888977050781, "loss": 0.1627, "rewards/accuracies": 0.9449999928474426, "rewards/chosen": -0.5315707921981812, "rewards/margins": 3.344498872756958, "rewards/rejected": -3.876070022583008, "step": 2700 }, { "epoch": 1.0771867959643453, "grad_norm": 18.423038482666016, "learning_rate": 7.324114534102414e-07, "logits/chosen": -1.2948585748672485, "logits/rejected": -1.1851221323013306, "logps/chosen": -384.01495361328125, "logps/rejected": -340.6744384765625, "loss": 0.1212, "rewards/accuracies": 0.9549999833106995, "rewards/chosen": -0.458404541015625, "rewards/margins": 3.760544776916504, "rewards/rejected": -4.218949317932129, "step": 2750 }, { "epoch": 1.096777353315702, "grad_norm": 15.992474555969238, "learning_rate": 7.231004666365688e-07, "logits/chosen": -1.5737820863723755, "logits/rejected": -1.3861126899719238, "logps/chosen": -370.8525695800781, "logps/rejected": -342.98675537109375, "loss": 0.1362, "rewards/accuracies": 0.949999988079071, "rewards/chosen": -0.7288404703140259, "rewards/margins": 3.653024911880493, "rewards/rejected": -4.381865978240967, "step": 2800 }, { "epoch": 1.096777353315702, "eval_logits/chosen": -1.4936131238937378, "eval_logits/rejected": -1.3645743131637573, "eval_logps/chosen": -369.6283874511719, "eval_logps/rejected": -322.2799072265625, "eval_loss": 0.5014060735702515, "eval_rewards/accuracies": 0.7772689461708069, "eval_rewards/chosen": -1.7314954996109009, "eval_rewards/margins": 1.9532350301742554, "eval_rewards/rejected": -3.6847305297851562, "eval_runtime": 183.7133, "eval_samples_per_second": 13.075, "eval_steps_per_second": 6.537, "step": 2800 }, { "epoch": 1.1163679106670585, "grad_norm": 5.409101963043213, "learning_rate": 7.136918550562358e-07, "logits/chosen": -1.522940993309021, "logits/rejected": -1.4030097723007202, "logps/chosen": -366.8924560546875, "logps/rejected": -333.6314697265625, "loss": 0.1492, "rewards/accuracies": 0.9449999928474426, "rewards/chosen": -0.8802686929702759, "rewards/margins": 3.616269826889038, "rewards/rejected": -4.496538162231445, "step": 2850 }, { "epoch": 1.1359584680184152, "grad_norm": 54.6688232421875, "learning_rate": 7.041897357107727e-07, "logits/chosen": -1.6211928129196167, "logits/rejected": -1.4868953227996826, "logps/chosen": -359.833740234375, "logps/rejected": -310.93939208984375, "loss": 0.1698, "rewards/accuracies": 0.9424999952316284, "rewards/chosen": -0.7522315979003906, "rewards/margins": 3.544074058532715, "rewards/rejected": -4.296305179595947, "step": 2900 }, { "epoch": 1.1555490253697718, "grad_norm": 56.798030853271484, "learning_rate": 6.945982665590479e-07, "logits/chosen": -1.4974216222763062, "logits/rejected": -1.2985191345214844, "logps/chosen": -377.2979736328125, "logps/rejected": -348.5942077636719, "loss": 0.146, "rewards/accuracies": 0.9399999976158142, "rewards/chosen": -0.8809213042259216, "rewards/margins": 3.612612247467041, "rewards/rejected": -4.493533134460449, "step": 2950 }, { "epoch": 1.1751395827211284, "grad_norm": 22.727725982666016, "learning_rate": 6.849216446578215e-07, "logits/chosen": -1.590391993522644, "logits/rejected": -1.433569073677063, "logps/chosen": -387.9193115234375, "logps/rejected": -361.5350646972656, "loss": 0.1149, "rewards/accuracies": 0.9725000262260437, "rewards/chosen": -1.0071202516555786, "rewards/margins": 3.8817479610443115, "rewards/rejected": -4.88886833190918, "step": 3000 }, { "epoch": 1.1751395827211284, "eval_logits/chosen": -1.6452481746673584, "eval_logits/rejected": -1.5406179428100586, "eval_logps/chosen": -371.4642333984375, "eval_logps/rejected": -325.0046691894531, "eval_loss": 0.5132338404655457, "eval_rewards/accuracies": 0.770191490650177, "eval_rewards/chosen": -1.9150793552398682, "eval_rewards/margins": 2.042127847671509, "eval_rewards/rejected": -3.957206964492798, "eval_runtime": 182.0948, "eval_samples_per_second": 13.191, "eval_steps_per_second": 6.595, "step": 3000 }, { "epoch": 1.194730140072485, "grad_norm": 25.459936141967773, "learning_rate": 6.751641043251853e-07, "logits/chosen": -1.5482993125915527, "logits/rejected": -1.4024869203567505, "logps/chosen": -392.9327697753906, "logps/rejected": -338.0341796875, "loss": 0.1499, "rewards/accuracies": 0.949999988079071, "rewards/chosen": -0.9234389662742615, "rewards/margins": 3.838209629058838, "rewards/rejected": -4.761648178100586, "step": 3050 }, { "epoch": 1.2143206974238416, "grad_norm": 71.29440307617188, "learning_rate": 6.653299152877016e-07, "logits/chosen": -1.7307244539260864, "logits/rejected": -1.550933837890625, "logps/chosen": -357.46661376953125, "logps/rejected": -342.1903076171875, "loss": 0.1345, "rewards/accuracies": 0.9549999833106995, "rewards/chosen": -1.0262528657913208, "rewards/margins": 3.8201754093170166, "rewards/rejected": -4.846428871154785, "step": 3100 }, { "epoch": 1.2339112547751983, "grad_norm": 25.778587341308594, "learning_rate": 6.554233808120463e-07, "logits/chosen": -1.6679961681365967, "logits/rejected": -1.5830594301223755, "logps/chosen": -386.9595642089844, "logps/rejected": -344.4521789550781, "loss": 0.1438, "rewards/accuracies": 0.9649999737739563, "rewards/chosen": -1.1483721733093262, "rewards/margins": 3.911073684692383, "rewards/rejected": -5.059445858001709, "step": 3150 }, { "epoch": 1.2535018121265549, "grad_norm": 24.407367706298828, "learning_rate": 6.454488358219756e-07, "logits/chosen": -1.6095058917999268, "logits/rejected": -1.5268667936325073, "logps/chosen": -364.7217102050781, "logps/rejected": -321.9256591796875, "loss": 0.1198, "rewards/accuracies": 0.9599999785423279, "rewards/chosen": -0.9407815337181091, "rewards/margins": 3.9222023487091064, "rewards/rejected": -4.862983703613281, "step": 3200 }, { "epoch": 1.2535018121265549, "eval_logits/chosen": -1.6486918926239014, "eval_logits/rejected": -1.56648588180542, "eval_logps/chosen": -373.4631652832031, "eval_logps/rejected": -328.3328552246094, "eval_loss": 0.5195496678352356, "eval_rewards/accuracies": 0.7751873731613159, "eval_rewards/chosen": -2.114971399307251, "eval_rewards/margins": 2.175050735473633, "eval_rewards/rejected": -4.290021896362305, "eval_runtime": 182.0558, "eval_samples_per_second": 13.194, "eval_steps_per_second": 6.597, "step": 3200 }, { "epoch": 1.2730923694779117, "grad_norm": 61.75260925292969, "learning_rate": 6.354106450014404e-07, "logits/chosen": -1.6261045932769775, "logits/rejected": -1.468245267868042, "logps/chosen": -394.1415100097656, "logps/rejected": -353.34942626953125, "loss": 0.1666, "rewards/accuracies": 0.9549999833106995, "rewards/chosen": -1.1136356592178345, "rewards/margins": 4.16200065612793, "rewards/rejected": -5.275636196136475, "step": 3250 }, { "epoch": 1.2926829268292683, "grad_norm": 19.361291885375977, "learning_rate": 6.253132008846786e-07, "logits/chosen": -1.6353635787963867, "logits/rejected": -1.5276310443878174, "logps/chosen": -366.8433532714844, "logps/rejected": -341.7208251953125, "loss": 0.1418, "rewards/accuracies": 0.9549999833106995, "rewards/chosen": -0.9791030883789062, "rewards/margins": 3.893622636795044, "rewards/rejected": -4.872725963592529, "step": 3300 }, { "epoch": 1.312273484180625, "grad_norm": 11.505748748779297, "learning_rate": 6.15160921934118e-07, "logits/chosen": -1.6867657899856567, "logits/rejected": -1.5593910217285156, "logps/chosen": -365.0918884277344, "logps/rejected": -318.346923828125, "loss": 0.1254, "rewards/accuracies": 0.9549999833106995, "rewards/chosen": -0.9864305257797241, "rewards/margins": 3.980782985687256, "rewards/rejected": -4.9672136306762695, "step": 3350 }, { "epoch": 1.3318640415319816, "grad_norm": 48.97773742675781, "learning_rate": 6.049582506069384e-07, "logits/chosen": -1.657313585281372, "logits/rejected": -1.4994758367538452, "logps/chosen": -359.9202880859375, "logps/rejected": -347.42828369140625, "loss": 0.1331, "rewards/accuracies": 0.949999988079071, "rewards/chosen": -1.2405058145523071, "rewards/margins": 3.8140506744384766, "rewards/rejected": -5.054556369781494, "step": 3400 }, { "epoch": 1.3318640415319816, "eval_logits/chosen": -1.716418981552124, "eval_logits/rejected": -1.6371155977249146, "eval_logps/chosen": -372.63067626953125, "eval_logps/rejected": -327.14337158203125, "eval_loss": 0.5230005979537964, "eval_rewards/accuracies": 0.7793505191802979, "eval_rewards/chosen": -2.0317211151123047, "eval_rewards/margins": 2.1393544673919678, "eval_rewards/rejected": -4.17107629776001, "eval_runtime": 182.2547, "eval_samples_per_second": 13.179, "eval_steps_per_second": 6.59, "step": 3400 }, { "epoch": 1.3514545988833382, "grad_norm": 107.73078155517578, "learning_rate": 5.947096514111293e-07, "logits/chosen": -1.6291078329086304, "logits/rejected": -1.5198391675949097, "logps/chosen": -383.50958251953125, "logps/rejected": -363.100341796875, "loss": 0.1277, "rewards/accuracies": 0.949999988079071, "rewards/chosen": -1.0857621431350708, "rewards/margins": 4.09164571762085, "rewards/rejected": -5.177408218383789, "step": 3450 }, { "epoch": 1.3710451562346948, "grad_norm": 15.163590431213379, "learning_rate": 5.844196089519004e-07, "logits/chosen": -1.6963342428207397, "logits/rejected": -1.5234904289245605, "logps/chosen": -367.5895690917969, "logps/rejected": -334.65203857421875, "loss": 0.1338, "rewards/accuracies": 0.9524999856948853, "rewards/chosen": -1.2845149040222168, "rewards/margins": 4.080843448638916, "rewards/rejected": -5.365358829498291, "step": 3500 }, { "epoch": 1.3906357135860516, "grad_norm": 183.16290283203125, "learning_rate": 5.740926259692986e-07, "logits/chosen": -1.6925588846206665, "logits/rejected": -1.4511497020721436, "logps/chosen": -342.0213317871094, "logps/rejected": -328.423583984375, "loss": 0.1684, "rewards/accuracies": 0.9150000214576721, "rewards/chosen": -1.2314543724060059, "rewards/margins": 4.002154350280762, "rewards/rejected": -5.233608245849609, "step": 3550 }, { "epoch": 1.4102262709374083, "grad_norm": 130.83932495117188, "learning_rate": 5.637332213678889e-07, "logits/chosen": -1.747999668121338, "logits/rejected": -1.552089810371399, "logps/chosen": -357.76312255859375, "logps/rejected": -321.6129150390625, "loss": 0.1506, "rewards/accuracies": 0.9574999809265137, "rewards/chosen": -1.2750509977340698, "rewards/margins": 4.070872783660889, "rewards/rejected": -5.345923900604248, "step": 3600 }, { "epoch": 1.4102262709374083, "eval_logits/chosen": -1.6983522176742554, "eval_logits/rejected": -1.6196881532669067, "eval_logps/chosen": -374.8834228515625, "eval_logps/rejected": -329.9042053222656, "eval_loss": 0.5274552702903748, "eval_rewards/accuracies": 0.7756036520004272, "eval_rewards/chosen": -2.256995916366577, "eval_rewards/margins": 2.1901612281799316, "eval_rewards/rejected": -4.4471564292907715, "eval_runtime": 182.0012, "eval_samples_per_second": 13.198, "eval_steps_per_second": 6.599, "step": 3600 }, { "epoch": 1.4298168282887649, "grad_norm": 62.9024658203125, "learning_rate": 5.53345928239361e-07, "logits/chosen": -1.6344012022018433, "logits/rejected": -1.3985601663589478, "logps/chosen": -371.9190979003906, "logps/rejected": -362.4126892089844, "loss": 0.1324, "rewards/accuracies": 0.9549999833106995, "rewards/chosen": -1.3249839544296265, "rewards/margins": 4.2258501052856445, "rewards/rejected": -5.550833702087402, "step": 3650 }, { "epoch": 1.4494073856401215, "grad_norm": 63.766395568847656, "learning_rate": 5.429352918789295e-07, "logits/chosen": -1.6781551837921143, "logits/rejected": -1.6595940589904785, "logps/chosen": -359.553955078125, "logps/rejected": -333.27191162109375, "loss": 0.1255, "rewards/accuracies": 0.9574999809265137, "rewards/chosen": -1.3423984050750732, "rewards/margins": 4.154109477996826, "rewards/rejected": -5.496507167816162, "step": 3700 }, { "epoch": 1.4689979429914781, "grad_norm": 24.34297752380371, "learning_rate": 5.325058677963933e-07, "logits/chosen": -1.7628166675567627, "logits/rejected": -1.5162057876586914, "logps/chosen": -379.5002746582031, "logps/rejected": -361.4959411621094, "loss": 0.1278, "rewards/accuracies": 0.9424999952316284, "rewards/chosen": -1.2505874633789062, "rewards/margins": 4.234759330749512, "rewards/rejected": -5.485346794128418, "step": 3750 }, { "epoch": 1.4885885003428347, "grad_norm": 89.56745910644531, "learning_rate": 5.220622197227254e-07, "logits/chosen": -1.6744155883789062, "logits/rejected": -1.6061152219772339, "logps/chosen": -395.9300842285156, "logps/rejected": -356.6335144042969, "loss": 0.1219, "rewards/accuracies": 0.9474999904632568, "rewards/chosen": -1.2993007898330688, "rewards/margins": 4.109463214874268, "rewards/rejected": -5.408763885498047, "step": 3800 }, { "epoch": 1.4885885003428347, "eval_logits/chosen": -1.755277156829834, "eval_logits/rejected": -1.6812604665756226, "eval_logps/chosen": -375.90478515625, "eval_logps/rejected": -331.6509704589844, "eval_loss": 0.5298057794570923, "eval_rewards/accuracies": 0.7793505191802979, "eval_rewards/chosen": -2.3591370582580566, "eval_rewards/margins": 2.262698173522949, "eval_rewards/rejected": -4.621835708618164, "eval_runtime": 181.8002, "eval_samples_per_second": 13.212, "eval_steps_per_second": 6.606, "step": 3800 }, { "epoch": 1.5081790576941914, "grad_norm": 57.11545944213867, "learning_rate": 5.116089176130647e-07, "logits/chosen": -1.8247219324111938, "logits/rejected": -1.707238793373108, "logps/chosen": -365.5677795410156, "logps/rejected": -348.8277587890625, "loss": 0.1248, "rewards/accuracies": 0.9649999737739563, "rewards/chosen": -1.4670463800430298, "rewards/margins": 4.245115756988525, "rewards/rejected": -5.712162017822266, "step": 3850 }, { "epoch": 1.527769615045548, "grad_norm": 134.8478546142578, "learning_rate": 5.011505356469849e-07, "logits/chosen": -1.800379991531372, "logits/rejected": -1.6222047805786133, "logps/chosen": -396.044677734375, "logps/rejected": -343.588623046875, "loss": 0.1579, "rewards/accuracies": 0.9350000023841858, "rewards/chosen": -1.327430248260498, "rewards/margins": 4.10135555267334, "rewards/rejected": -5.428785800933838, "step": 3900 }, { "epoch": 1.5473601723969046, "grad_norm": 47.98903274536133, "learning_rate": 4.906916502269153e-07, "logits/chosen": -1.8289942741394043, "logits/rejected": -1.7046104669570923, "logps/chosen": -360.898681640625, "logps/rejected": -347.4443359375, "loss": 0.1689, "rewards/accuracies": 0.9424999952316284, "rewards/chosen": -1.565004825592041, "rewards/margins": 4.049954414367676, "rewards/rejected": -5.6149582862854, "step": 3950 }, { "epoch": 1.5669507297482612, "grad_norm": 36.070865631103516, "learning_rate": 4.802368379755871e-07, "logits/chosen": -1.901904582977295, "logits/rejected": -1.7009533643722534, "logps/chosen": -390.9181213378906, "logps/rejected": -367.340087890625, "loss": 0.1173, "rewards/accuracies": 0.9649999737739563, "rewards/chosen": -1.3107359409332275, "rewards/margins": 4.3210906982421875, "rewards/rejected": -5.631826877593994, "step": 4000 }, { "epoch": 1.5669507297482612, "eval_logits/chosen": -1.83998441696167, "eval_logits/rejected": -1.773179292678833, "eval_logps/chosen": -375.8030700683594, "eval_logps/rejected": -331.4768371582031, "eval_loss": 0.5410642027854919, "eval_rewards/accuracies": 0.779766857624054, "eval_rewards/chosen": -2.348963737487793, "eval_rewards/margins": 2.255459785461426, "eval_rewards/rejected": -4.604423522949219, "eval_runtime": 182.1217, "eval_samples_per_second": 13.189, "eval_steps_per_second": 6.594, "step": 4000 }, { "epoch": 1.5865412870996178, "grad_norm": 79.75633239746094, "learning_rate": 4.697906737333856e-07, "logits/chosen": -1.890414834022522, "logits/rejected": -1.7079460620880127, "logps/chosen": -363.3149108886719, "logps/rejected": -336.81964111328125, "loss": 0.1136, "rewards/accuracies": 0.9599999785423279, "rewards/chosen": -1.327339768409729, "rewards/margins": 4.425736904144287, "rewards/rejected": -5.753076553344727, "step": 4050 }, { "epoch": 1.6061318444509747, "grad_norm": 14.279524803161621, "learning_rate": 4.593577285564805e-07, "logits/chosen": -1.9139132499694824, "logits/rejected": -1.7257100343704224, "logps/chosen": -373.6604309082031, "logps/rejected": -360.3436279296875, "loss": 0.1217, "rewards/accuracies": 0.9524999856948853, "rewards/chosen": -1.4224177598953247, "rewards/margins": 4.337459564208984, "rewards/rejected": -5.759876728057861, "step": 4100 }, { "epoch": 1.6257224018023313, "grad_norm": 18.292810440063477, "learning_rate": 4.489425677166128e-07, "logits/chosen": -1.8857932090759277, "logits/rejected": -1.838065505027771, "logps/chosen": -374.2807922363281, "logps/rejected": -350.9076232910156, "loss": 0.1116, "rewards/accuracies": 0.9599999785423279, "rewards/chosen": -1.2832770347595215, "rewards/margins": 4.261753082275391, "rewards/rejected": -5.545030117034912, "step": 4150 }, { "epoch": 1.645312959153688, "grad_norm": 91.74571990966797, "learning_rate": 4.385497487034136e-07, "logits/chosen": -1.8253960609436035, "logits/rejected": -1.80033540725708, "logps/chosen": -360.9422607421875, "logps/rejected": -348.8204040527344, "loss": 0.1668, "rewards/accuracies": 0.9449999928474426, "rewards/chosen": -1.5318783521652222, "rewards/margins": 4.232841968536377, "rewards/rejected": -5.764720439910889, "step": 4200 }, { "epoch": 1.645312959153688, "eval_logits/chosen": -1.825873851776123, "eval_logits/rejected": -1.7672475576400757, "eval_logps/chosen": -375.93621826171875, "eval_logps/rejected": -332.0399475097656, "eval_loss": 0.5490909814834595, "eval_rewards/accuracies": 0.7781015634536743, "eval_rewards/chosen": -2.362279176712036, "eval_rewards/margins": 2.2984535694122314, "eval_rewards/rejected": -4.660732746124268, "eval_runtime": 181.3571, "eval_samples_per_second": 13.245, "eval_steps_per_second": 6.622, "step": 4200 }, { "epoch": 1.6649035165050445, "grad_norm": 182.9907989501953, "learning_rate": 4.281838192301266e-07, "logits/chosen": -1.8667634725570679, "logits/rejected": -1.7775866985321045, "logps/chosen": -350.6466064453125, "logps/rejected": -349.0397644042969, "loss": 0.133, "rewards/accuracies": 0.9424999952316284, "rewards/chosen": -1.5763401985168457, "rewards/margins": 4.427700996398926, "rewards/rejected": -6.004040718078613, "step": 4250 }, { "epoch": 1.6844940738564014, "grad_norm": 90.31336975097656, "learning_rate": 4.1784931524360996e-07, "logits/chosen": -1.8399044275283813, "logits/rejected": -1.7566088438034058, "logps/chosen": -357.8070983886719, "logps/rejected": -337.547119140625, "loss": 0.1338, "rewards/accuracies": 0.9524999856948853, "rewards/chosen": -1.5925673246383667, "rewards/margins": 4.302795886993408, "rewards/rejected": -5.895363807678223, "step": 4300 }, { "epoch": 1.704084631207758, "grad_norm": 60.01850128173828, "learning_rate": 4.075507589394862e-07, "logits/chosen": -1.8707722425460815, "logits/rejected": -1.7477329969406128, "logps/chosen": -367.755126953125, "logps/rejected": -334.7363586425781, "loss": 0.1432, "rewards/accuracies": 0.9399999976158142, "rewards/chosen": -1.4867920875549316, "rewards/margins": 4.018145561218262, "rewards/rejected": -5.504937171936035, "step": 4350 }, { "epoch": 1.7236751885591146, "grad_norm": 7.138427257537842, "learning_rate": 3.972926567833095e-07, "logits/chosen": -1.7986953258514404, "logits/rejected": -1.716946005821228, "logps/chosen": -377.9021911621094, "logps/rejected": -367.26483154296875, "loss": 0.1184, "rewards/accuracies": 0.949999988079071, "rewards/chosen": -1.5053943395614624, "rewards/margins": 4.413090705871582, "rewards/rejected": -5.918485164642334, "step": 4400 }, { "epoch": 1.7236751885591146, "eval_logits/chosen": -1.7733187675476074, "eval_logits/rejected": -1.7134273052215576, "eval_logps/chosen": -377.1297607421875, "eval_logps/rejected": -333.46954345703125, "eval_loss": 0.5378764271736145, "eval_rewards/accuracies": 0.7814321517944336, "eval_rewards/chosen": -2.4816348552703857, "eval_rewards/margins": 2.3220555782318115, "eval_rewards/rejected": -4.803690433502197, "eval_runtime": 182.8904, "eval_samples_per_second": 13.134, "eval_steps_per_second": 6.567, "step": 4400 }, { "epoch": 1.7432657459104712, "grad_norm": 18.62919807434082, "learning_rate": 3.8707949753861716e-07, "logits/chosen": -1.8632616996765137, "logits/rejected": -1.7376039028167725, "logps/chosen": -342.5689697265625, "logps/rejected": -335.2397766113281, "loss": 0.1411, "rewards/accuracies": 0.9574999809265137, "rewards/chosen": -1.3847324848175049, "rewards/margins": 4.106419563293457, "rewards/rejected": -5.491152286529541, "step": 4450 }, { "epoch": 1.7628563032618279, "grad_norm": 23.290203094482422, "learning_rate": 3.76915750302725e-07, "logits/chosen": -1.7581045627593994, "logits/rejected": -1.6029043197631836, "logps/chosen": -373.6942138671875, "logps/rejected": -338.0625, "loss": 0.1141, "rewards/accuracies": 0.9649999737739563, "rewards/chosen": -1.4231642484664917, "rewards/margins": 4.145116806030273, "rewards/rejected": -5.5682806968688965, "step": 4500 }, { "epoch": 1.7824468606131845, "grad_norm": 113.75978088378906, "learning_rate": 3.668058625511305e-07, "logits/chosen": -1.7640550136566162, "logits/rejected": -1.6161187887191772, "logps/chosen": -369.67816162109375, "logps/rejected": -363.20465087890625, "loss": 0.1117, "rewards/accuracies": 0.9599999785423279, "rewards/chosen": -1.3803114891052246, "rewards/margins": 4.385107040405273, "rewards/rejected": -5.765418529510498, "step": 4550 }, { "epoch": 1.802037417964541, "grad_norm": 7.093522548675537, "learning_rate": 3.567542581913762e-07, "logits/chosen": -1.8656272888183594, "logits/rejected": -1.8022925853729248, "logps/chosen": -395.6029968261719, "logps/rejected": -359.8951110839844, "loss": 0.1466, "rewards/accuracies": 0.9524999856948853, "rewards/chosen": -1.3073208332061768, "rewards/margins": 4.359652519226074, "rewards/rejected": -5.666974067687988, "step": 4600 }, { "epoch": 1.802037417964541, "eval_logits/chosen": -1.739977240562439, "eval_logits/rejected": -1.677179217338562, "eval_logps/chosen": -376.30279541015625, "eval_logps/rejected": -332.7083740234375, "eval_loss": 0.5302212834358215, "eval_rewards/accuracies": 0.7843464016914368, "eval_rewards/chosen": -2.3989357948303223, "eval_rewards/margins": 2.3286385536193848, "eval_rewards/rejected": -4.727574348449707, "eval_runtime": 181.7513, "eval_samples_per_second": 13.216, "eval_steps_per_second": 6.608, "step": 4600 }, { "epoch": 1.8216279753158977, "grad_norm": 168.2427978515625, "learning_rate": 3.467653356272264e-07, "logits/chosen": -1.7600982189178467, "logits/rejected": -1.75065016746521, "logps/chosen": -368.1263732910156, "logps/rejected": -329.2120056152344, "loss": 0.1393, "rewards/accuracies": 0.9549999833106995, "rewards/chosen": -1.325424313545227, "rewards/margins": 4.229908466339111, "rewards/rejected": -5.555332660675049, "step": 4650 }, { "epoch": 1.8412185326672543, "grad_norm": 56.983543395996094, "learning_rate": 3.368434658340035e-07, "logits/chosen": -1.6969270706176758, "logits/rejected": -1.5315319299697876, "logps/chosen": -393.845947265625, "logps/rejected": -366.9394836425781, "loss": 0.1201, "rewards/accuracies": 0.9524999856948853, "rewards/chosen": -1.3427032232284546, "rewards/margins": 4.412410259246826, "rewards/rejected": -5.755113124847412, "step": 4700 }, { "epoch": 1.860809090018611, "grad_norm": 46.993534088134766, "learning_rate": 3.269929904459265e-07, "logits/chosen": -1.6990869045257568, "logits/rejected": -1.6050549745559692, "logps/chosen": -379.8760070800781, "logps/rejected": -358.8374938964844, "loss": 0.1347, "rewards/accuracies": 0.9524999856948853, "rewards/chosen": -1.5243346691131592, "rewards/margins": 4.38024377822876, "rewards/rejected": -5.904578685760498, "step": 4750 }, { "epoch": 1.8803996473699676, "grad_norm": 22.50926399230957, "learning_rate": 3.1721821985628946e-07, "logits/chosen": -1.7507199048995972, "logits/rejected": -1.587468147277832, "logps/chosen": -342.8749084472656, "logps/rejected": -330.3369140625, "loss": 0.154, "rewards/accuracies": 0.9574999809265137, "rewards/chosen": -1.4566929340362549, "rewards/margins": 4.056729793548584, "rewards/rejected": -5.513422012329102, "step": 4800 }, { "epoch": 1.8803996473699676, "eval_logits/chosen": -1.8217155933380127, "eval_logits/rejected": -1.761517882347107, "eval_logps/chosen": -376.3056335449219, "eval_logps/rejected": -332.8399658203125, "eval_loss": 0.528506338596344, "eval_rewards/accuracies": 0.7843464016914368, "eval_rewards/chosen": -2.3992199897766113, "eval_rewards/margins": 2.3415098190307617, "eval_rewards/rejected": -4.740729808807373, "eval_runtime": 182.1926, "eval_samples_per_second": 13.184, "eval_steps_per_second": 6.592, "step": 4800 }, { "epoch": 1.8999902047213242, "grad_norm": 41.3251953125, "learning_rate": 3.075234313313095e-07, "logits/chosen": -1.822758674621582, "logits/rejected": -1.6095324754714966, "logps/chosen": -368.2705078125, "logps/rejected": -363.7851867675781, "loss": 0.1114, "rewards/accuracies": 0.9599999785423279, "rewards/chosen": -1.1875016689300537, "rewards/margins": 4.392082691192627, "rewards/rejected": -5.579584121704102, "step": 4850 }, { "epoch": 1.9195807620726808, "grad_norm": 33.448936462402344, "learning_rate": 2.9791286713847106e-07, "logits/chosen": -1.874271035194397, "logits/rejected": -1.7505204677581787, "logps/chosen": -380.5478820800781, "logps/rejected": -355.3659362792969, "loss": 0.1139, "rewards/accuracies": 0.9549999833106995, "rewards/chosen": -1.4798643589019775, "rewards/margins": 4.445069789886475, "rewards/rejected": -5.924932956695557, "step": 4900 }, { "epoch": 1.9391713194240376, "grad_norm": 53.873172760009766, "learning_rate": 2.883907326901849e-07, "logits/chosen": -1.9296669960021973, "logits/rejected": -1.7788227796554565, "logps/chosen": -355.0895690917969, "logps/rejected": -336.3532409667969, "loss": 0.136, "rewards/accuracies": 0.9375, "rewards/chosen": -1.5472720861434937, "rewards/margins": 4.275333881378174, "rewards/rejected": -5.822606086730957, "step": 4950 }, { "epoch": 1.9587618767753943, "grad_norm": 66.68231964111328, "learning_rate": 2.7896119470357394e-07, "logits/chosen": -1.8380649089813232, "logits/rejected": -1.626741647720337, "logps/chosen": -367.21307373046875, "logps/rejected": -350.3079833984375, "loss": 0.1328, "rewards/accuracies": 0.9574999809265137, "rewards/chosen": -1.383242130279541, "rewards/margins": 4.56887674331665, "rewards/rejected": -5.95211935043335, "step": 5000 }, { "epoch": 1.9587618767753943, "eval_logits/chosen": -1.7905840873718262, "eval_logits/rejected": -1.730137586593628, "eval_logps/chosen": -377.50054931640625, "eval_logps/rejected": -334.88006591796875, "eval_loss": 0.5351826548576355, "eval_rewards/accuracies": 0.7847626805305481, "eval_rewards/chosen": -2.5187087059020996, "eval_rewards/margins": 2.4260356426239014, "eval_rewards/rejected": -4.94474458694458, "eval_runtime": 182.3765, "eval_samples_per_second": 13.171, "eval_steps_per_second": 6.585, "step": 5000 }, { "epoch": 1.9783524341267509, "grad_norm": 9.479029655456543, "learning_rate": 2.696283793771921e-07, "logits/chosen": -1.8894351720809937, "logits/rejected": -1.6450564861297607, "logps/chosen": -372.2572326660156, "logps/rejected": -358.4980773925781, "loss": 0.1521, "rewards/accuracies": 0.9325000047683716, "rewards/chosen": -1.5351108312606812, "rewards/margins": 4.4576897621154785, "rewards/rejected": -5.992800235748291, "step": 5050 }, { "epoch": 1.9979429914781075, "grad_norm": 84.90283203125, "learning_rate": 2.603963705854731e-07, "logits/chosen": -1.905731201171875, "logits/rejected": -1.6645513772964478, "logps/chosen": -361.50701904296875, "logps/rejected": -353.17059326171875, "loss": 0.1461, "rewards/accuracies": 0.9424999952316284, "rewards/chosen": -1.4440213441848755, "rewards/margins": 4.272027492523193, "rewards/rejected": -5.716048717498779, "step": 5100 } ], "logging_steps": 50, "max_steps": 7659, "num_input_tokens_seen": 0, "num_train_epochs": 3, "save_steps": 300, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": false }, "attributes": {} } }, "total_flos": 0.0, "train_batch_size": 2, "trial_name": null, "trial_params": null }