{ "best_global_step": null, "best_metric": null, "best_model_checkpoint": null, "epoch": 0.8228034087569791, "eval_steps": 200, "global_step": 2100, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "epoch": 0.019590557351356647, "grad_norm": 140.09786987304688, "learning_rate": 3.2666666666666663e-07, "logits/chosen": -0.9822076559066772, "logits/rejected": -0.6774621605873108, "logps/chosen": -352.589111328125, "logps/rejected": -284.4425354003906, "loss": 0.6901, "rewards/accuracies": 0.47999998927116394, "rewards/chosen": 0.0031729438342154026, "rewards/margins": 0.008149052038788795, "rewards/rejected": -0.004976108204573393, "step": 50 }, { "epoch": 0.03918111470271329, "grad_norm": 128.5372314453125, "learning_rate": 6.6e-07, "logits/chosen": -0.9334858059883118, "logits/rejected": -0.6409775018692017, "logps/chosen": -366.2322692871094, "logps/rejected": -287.4626770019531, "loss": 0.6758, "rewards/accuracies": 0.6150000095367432, "rewards/chosen": 0.02407059632241726, "rewards/margins": 0.04141266271471977, "rewards/rejected": -0.017342066392302513, "step": 100 }, { "epoch": 0.05877167205406994, "grad_norm": 103.95256805419922, "learning_rate": 9.933333333333333e-07, "logits/chosen": -0.8153188228607178, "logits/rejected": -0.5176287293434143, "logps/chosen": -373.8503112792969, "logps/rejected": -307.275634765625, "loss": 0.6225, "rewards/accuracies": 0.6775000095367432, "rewards/chosen": 0.07690317183732986, "rewards/margins": 0.18566985428333282, "rewards/rejected": -0.10876669734716415, "step": 150 }, { "epoch": 0.07836222940542659, "grad_norm": 130.03802490234375, "learning_rate": 9.99894936347371e-07, "logits/chosen": -0.8271468877792358, "logits/rejected": -0.5104550719261169, "logps/chosen": -350.3367614746094, "logps/rejected": -296.0983581542969, "loss": 0.6152, "rewards/accuracies": 0.6775000095367432, "rewards/chosen": -0.0007632786291651428, "rewards/margins": 0.25347909331321716, "rewards/rejected": -0.2542423605918884, "step": 200 }, { "epoch": 0.07836222940542659, "eval_logits/chosen": -0.8247441053390503, "eval_logits/rejected": -0.5691510438919067, "eval_logps/chosen": -352.2530212402344, "eval_logps/rejected": -288.40521240234375, "eval_loss": 0.6011638641357422, "eval_rewards/accuracies": 0.684013307094574, "eval_rewards/chosen": 0.006044471170753241, "eval_rewards/margins": 0.30330440402030945, "eval_rewards/rejected": -0.2972599267959595, "eval_runtime": 180.5524, "eval_samples_per_second": 13.304, "eval_steps_per_second": 6.652, "step": 200 }, { "epoch": 0.09795278675678323, "grad_norm": 127.07317352294922, "learning_rate": 9.995711712979657e-07, "logits/chosen": -0.7803874015808105, "logits/rejected": -0.5503089427947998, "logps/chosen": -354.3157043457031, "logps/rejected": -271.8356018066406, "loss": 0.5935, "rewards/accuracies": 0.6825000047683716, "rewards/chosen": -0.0023533145431429148, "rewards/margins": 0.3317827880382538, "rewards/rejected": -0.33413612842559814, "step": 250 }, { "epoch": 0.11754334410813988, "grad_norm": 107.00403594970703, "learning_rate": 9.990288027658056e-07, "logits/chosen": -0.8059212565422058, "logits/rejected": -0.5893051028251648, "logps/chosen": -349.48760986328125, "logps/rejected": -285.4340515136719, "loss": 0.5528, "rewards/accuracies": 0.7599999904632568, "rewards/chosen": 0.04797028377652168, "rewards/margins": 0.4950464367866516, "rewards/rejected": -0.44707614183425903, "step": 300 }, { "epoch": 0.13713390145949653, "grad_norm": 118.62214660644531, "learning_rate": 9.982680680817391e-07, "logits/chosen": -0.9657462239265442, "logits/rejected": -0.647233784198761, "logps/chosen": -355.55096435546875, "logps/rejected": -308.36053466796875, "loss": 0.56, "rewards/accuracies": 0.7074999809265137, "rewards/chosen": -0.11357284337282181, "rewards/margins": 0.5093904137611389, "rewards/rejected": -0.6229632496833801, "step": 350 }, { "epoch": 0.15672445881085317, "grad_norm": 80.19744110107422, "learning_rate": 9.972893001297698e-07, "logits/chosen": -1.0753679275512695, "logits/rejected": -0.731191873550415, "logps/chosen": -374.8988952636719, "logps/rejected": -319.61199951171875, "loss": 0.5683, "rewards/accuracies": 0.7049999833106995, "rewards/chosen": -0.20595918595790863, "rewards/margins": 0.5294285416603088, "rewards/rejected": -0.7353877425193787, "step": 400 }, { "epoch": 0.15672445881085317, "eval_logits/chosen": -1.0395917892456055, "eval_logits/rejected": -0.7957448363304138, "eval_logps/chosen": -354.0768127441406, "eval_logps/rejected": -293.1625061035156, "eval_loss": 0.5456792116165161, "eval_rewards/accuracies": 0.7264779210090637, "eval_rewards/chosen": -0.17633533477783203, "eval_rewards/margins": 0.5966517329216003, "eval_rewards/rejected": -0.7729870080947876, "eval_runtime": 180.5278, "eval_samples_per_second": 13.305, "eval_steps_per_second": 6.653, "step": 400 }, { "epoch": 0.17631501616220982, "grad_norm": 97.5062026977539, "learning_rate": 9.96092927201391e-07, "logits/chosen": -1.0175271034240723, "logits/rejected": -0.752033531665802, "logps/chosen": -355.3705749511719, "logps/rejected": -302.32373046875, "loss": 0.5547, "rewards/accuracies": 0.7024999856948853, "rewards/chosen": -0.2221955806016922, "rewards/margins": 0.6058707237243652, "rewards/rejected": -0.828066349029541, "step": 450 }, { "epoch": 0.19590557351356647, "grad_norm": 109.52022552490234, "learning_rate": 9.946794728081737e-07, "logits/chosen": -1.2173391580581665, "logits/rejected": -0.8966682553291321, "logps/chosen": -345.02984619140625, "logps/rejected": -300.69268798828125, "loss": 0.5145, "rewards/accuracies": 0.7250000238418579, "rewards/chosen": -0.26011258363723755, "rewards/margins": 0.7154355049133301, "rewards/rejected": -0.9755480885505676, "step": 500 }, { "epoch": 0.2154961308649231, "grad_norm": 65.85977172851562, "learning_rate": 9.930495554526878e-07, "logits/chosen": -1.1911191940307617, "logits/rejected": -0.9048889875411987, "logps/chosen": -360.3658142089844, "logps/rejected": -297.0860900878906, "loss": 0.5025, "rewards/accuracies": 0.7275000214576721, "rewards/chosen": -0.28734278678894043, "rewards/margins": 0.8380499482154846, "rewards/rejected": -1.1253927946090698, "step": 550 }, { "epoch": 0.23508668821627976, "grad_norm": 63.237606048583984, "learning_rate": 9.912038883578552e-07, "logits/chosen": -1.0660635232925415, "logits/rejected": -0.7923431992530823, "logps/chosen": -363.8102722167969, "logps/rejected": -295.3084716796875, "loss": 0.5179, "rewards/accuracies": 0.7300000190734863, "rewards/chosen": -0.4248141050338745, "rewards/margins": 0.8246171474456787, "rewards/rejected": -1.2494312524795532, "step": 600 }, { "epoch": 0.23508668821627976, "eval_logits/chosen": -1.0540363788604736, "eval_logits/rejected": -0.8268531560897827, "eval_logps/chosen": -355.8159484863281, "eval_logps/rejected": -297.4617919921875, "eval_loss": 0.5122258067131042, "eval_rewards/accuracies": 0.7373022437095642, "eval_rewards/chosen": -0.35024747252464294, "eval_rewards/margins": 0.8526709675788879, "eval_rewards/rejected": -1.2029184103012085, "eval_runtime": 181.1919, "eval_samples_per_second": 13.257, "eval_steps_per_second": 6.628, "step": 600 }, { "epoch": 0.2546772455676364, "grad_norm": 194.335693359375, "learning_rate": 9.891432791548562e-07, "logits/chosen": -1.0396273136138916, "logits/rejected": -0.8581287860870361, "logps/chosen": -375.4624938964844, "logps/rejected": -302.572998046875, "loss": 0.4782, "rewards/accuracies": 0.7799999713897705, "rewards/chosen": -0.3973628580570221, "rewards/margins": 0.9747829437255859, "rewards/rejected": -1.3721458911895752, "step": 650 }, { "epoch": 0.27426780291899305, "grad_norm": 65.69367980957031, "learning_rate": 9.868686295297258e-07, "logits/chosen": -1.070594072341919, "logits/rejected": -0.848624050617218, "logps/chosen": -358.2480773925781, "logps/rejected": -311.5008850097656, "loss": 0.5109, "rewards/accuracies": 0.7475000023841858, "rewards/chosen": -0.465026319026947, "rewards/margins": 0.9383654594421387, "rewards/rejected": -1.4033918380737305, "step": 700 }, { "epoch": 0.29385836027034967, "grad_norm": 116.7066650390625, "learning_rate": 9.8438093482879e-07, "logits/chosen": -1.0724475383758545, "logits/rejected": -0.8224292993545532, "logps/chosen": -373.66754150390625, "logps/rejected": -297.4761047363281, "loss": 0.483, "rewards/accuracies": 0.7699999809265137, "rewards/chosen": -0.39762890338897705, "rewards/margins": 1.163187026977539, "rewards/rejected": -1.5608159303665161, "step": 750 }, { "epoch": 0.31344891762170635, "grad_norm": 124.66069793701172, "learning_rate": 9.81681283623121e-07, "logits/chosen": -1.0539674758911133, "logits/rejected": -0.779601514339447, "logps/chosen": -347.1493225097656, "logps/rejected": -300.728515625, "loss": 0.5427, "rewards/accuracies": 0.7250000238418579, "rewards/chosen": -0.48545289039611816, "rewards/margins": 0.8515650033950806, "rewards/rejected": -1.3370177745819092, "step": 800 }, { "epoch": 0.31344891762170635, "eval_logits/chosen": -0.9799102544784546, "eval_logits/rejected": -0.7651399970054626, "eval_logps/chosen": -356.1210021972656, "eval_logps/rejected": -299.1585388183594, "eval_loss": 0.4938255250453949, "eval_rewards/accuracies": 0.7493755221366882, "eval_rewards/chosen": -0.38075584173202515, "eval_rewards/margins": 0.9918379783630371, "eval_rewards/rejected": -1.372593641281128, "eval_runtime": 181.2826, "eval_samples_per_second": 13.25, "eval_steps_per_second": 6.625, "step": 800 }, { "epoch": 0.33303947497306297, "grad_norm": 120.1912612915039, "learning_rate": 9.787708572321983e-07, "logits/chosen": -1.034041404724121, "logits/rejected": -0.810564398765564, "logps/chosen": -367.707763671875, "logps/rejected": -309.762939453125, "loss": 0.4326, "rewards/accuracies": 0.8125, "rewards/chosen": -0.3861949145793915, "rewards/margins": 1.226701021194458, "rewards/rejected": -1.6128960847854614, "step": 850 }, { "epoch": 0.35263003232441964, "grad_norm": 79.74503326416016, "learning_rate": 9.756509292069825e-07, "logits/chosen": -1.125342845916748, "logits/rejected": -0.875031590461731, "logps/chosen": -357.8549499511719, "logps/rejected": -289.9258117675781, "loss": 0.4864, "rewards/accuracies": 0.762499988079071, "rewards/chosen": -0.5919533967971802, "rewards/margins": 1.2158567905426025, "rewards/rejected": -1.8078101873397827, "step": 900 }, { "epoch": 0.37222058967577626, "grad_norm": 136.9542236328125, "learning_rate": 9.72322864772634e-07, "logits/chosen": -1.1560072898864746, "logits/rejected": -0.886911928653717, "logps/chosen": -364.5694274902344, "logps/rejected": -293.49981689453125, "loss": 0.51, "rewards/accuracies": 0.7400000095367432, "rewards/chosen": -0.5705673098564148, "rewards/margins": 1.0413060188293457, "rewards/rejected": -1.6118732690811157, "step": 950 }, { "epoch": 0.39181114702713293, "grad_norm": 116.3714370727539, "learning_rate": 9.687881202311132e-07, "logits/chosen": -1.0079857110977173, "logits/rejected": -0.7752091884613037, "logps/chosen": -349.3457946777344, "logps/rejected": -286.99993896484375, "loss": 0.4722, "rewards/accuracies": 0.7749999761581421, "rewards/chosen": -0.4944779872894287, "rewards/margins": 1.1931304931640625, "rewards/rejected": -1.6876084804534912, "step": 1000 }, { "epoch": 0.39181114702713293, "eval_logits/chosen": -1.0761741399765015, "eval_logits/rejected": -0.8803514838218689, "eval_logps/chosen": -357.8018798828125, "eval_logps/rejected": -302.2410888671875, "eval_loss": 0.4866333603858948, "eval_rewards/accuracies": 0.7510408163070679, "eval_rewards/chosen": -0.5488451719284058, "eval_rewards/margins": 1.1320006847381592, "eval_rewards/rejected": -1.680845856666565, "eval_runtime": 181.5986, "eval_samples_per_second": 13.227, "eval_steps_per_second": 6.613, "step": 1000 }, { "epoch": 0.41140170437848955, "grad_norm": 169.1030731201172, "learning_rate": 9.65048242323929e-07, "logits/chosen": -1.0233768224716187, "logits/rejected": -0.740478515625, "logps/chosen": -380.3099365234375, "logps/rejected": -323.1108703613281, "loss": 0.4805, "rewards/accuracies": 0.7774999737739563, "rewards/chosen": -0.6764897704124451, "rewards/margins": 1.2643505334854126, "rewards/rejected": -1.940840482711792, "step": 1050 }, { "epoch": 0.4309922617298462, "grad_norm": 107.12033081054688, "learning_rate": 9.611048675553127e-07, "logits/chosen": -1.0799275636672974, "logits/rejected": -0.8886963129043579, "logps/chosen": -387.2933349609375, "logps/rejected": -321.2319030761719, "loss": 0.4268, "rewards/accuracies": 0.7774999737739563, "rewards/chosen": -0.5030026435852051, "rewards/margins": 1.4225863218307495, "rewards/rejected": -1.925588846206665, "step": 1100 }, { "epoch": 0.45058281908120285, "grad_norm": 124.23180389404297, "learning_rate": 9.569597214761124e-07, "logits/chosen": -1.0482264757156372, "logits/rejected": -0.8745830059051514, "logps/chosen": -352.1131591796875, "logps/rejected": -303.13592529296875, "loss": 0.4846, "rewards/accuracies": 0.7674999833106995, "rewards/chosen": -0.689760684967041, "rewards/margins": 1.3204187154769897, "rewards/rejected": -2.0101795196533203, "step": 1150 }, { "epoch": 0.4701733764325595, "grad_norm": 68.6223373413086, "learning_rate": 9.526146179287222e-07, "logits/chosen": -1.097909927368164, "logits/rejected": -0.8678469657897949, "logps/chosen": -358.7846984863281, "logps/rejected": -314.0942077636719, "loss": 0.4829, "rewards/accuracies": 0.7649999856948853, "rewards/chosen": -0.6658291816711426, "rewards/margins": 1.3254380226135254, "rewards/rejected": -1.991267204284668, "step": 1200 }, { "epoch": 0.4701733764325595, "eval_logits/chosen": -1.1058708429336548, "eval_logits/rejected": -0.9207807183265686, "eval_logps/chosen": -358.45928955078125, "eval_logps/rejected": -304.12744140625, "eval_loss": 0.4782937467098236, "eval_rewards/accuracies": 0.7585345506668091, "eval_rewards/chosen": -0.6145861148834229, "eval_rewards/margins": 1.2548983097076416, "eval_rewards/rejected": -1.8694841861724854, "eval_runtime": 181.5576, "eval_samples_per_second": 13.23, "eval_steps_per_second": 6.615, "step": 1200 }, { "epoch": 0.48976393378391614, "grad_norm": 182.0519561767578, "learning_rate": 9.480714582533773e-07, "logits/chosen": -1.0906615257263184, "logits/rejected": -0.8988884091377258, "logps/chosen": -363.1963195800781, "logps/rejected": -310.1281433105469, "loss": 0.5144, "rewards/accuracies": 0.7200000286102295, "rewards/chosen": -0.7843419909477234, "rewards/margins": 1.230003833770752, "rewards/rejected": -2.014345645904541, "step": 1250 }, { "epoch": 0.5093544911352728, "grad_norm": 124.72360229492188, "learning_rate": 9.433322304561614e-07, "logits/chosen": -1.069496750831604, "logits/rejected": -0.8835853338241577, "logps/chosen": -361.09356689453125, "logps/rejected": -313.1136779785156, "loss": 0.463, "rewards/accuracies": 0.7825000286102295, "rewards/chosen": -0.662202000617981, "rewards/margins": 1.3414545059204102, "rewards/rejected": -2.0036566257476807, "step": 1300 }, { "epoch": 0.5289450484866295, "grad_norm": 124.38642120361328, "learning_rate": 9.383990083390903e-07, "logits/chosen": -1.080662488937378, "logits/rejected": -0.8675041794776917, "logps/chosen": -355.84405517578125, "logps/rejected": -322.5790710449219, "loss": 0.4625, "rewards/accuracies": 0.7674999833106995, "rewards/chosen": -0.5591977834701538, "rewards/margins": 1.3175528049468994, "rewards/rejected": -1.8767504692077637, "step": 1350 }, { "epoch": 0.5485356058379861, "grad_norm": 110.81146240234375, "learning_rate": 9.332739505926528e-07, "logits/chosen": -1.1147152185440063, "logits/rejected": -0.9014944434165955, "logps/chosen": -360.80523681640625, "logps/rejected": -295.3592834472656, "loss": 0.4819, "rewards/accuracies": 0.737500011920929, "rewards/chosen": -0.6334275603294373, "rewards/margins": 1.295997142791748, "rewards/rejected": -1.92942476272583, "step": 1400 }, { "epoch": 0.5485356058379861, "eval_logits/chosen": -1.0615795850753784, "eval_logits/rejected": -0.8742749094963074, "eval_logps/chosen": -358.2158508300781, "eval_logps/rejected": -304.3434753417969, "eval_loss": 0.4777006208896637, "eval_rewards/accuracies": 0.7635303735733032, "eval_rewards/chosen": -0.590242862701416, "eval_rewards/margins": 1.3008415699005127, "eval_rewards/rejected": -1.8910844326019287, "eval_runtime": 182.5694, "eval_samples_per_second": 13.157, "eval_steps_per_second": 6.578, "step": 1400 }, { "epoch": 0.5681261631893427, "grad_norm": 99.77544403076172, "learning_rate": 9.279592998512064e-07, "logits/chosen": -1.0060768127441406, "logits/rejected": -0.828403115272522, "logps/chosen": -386.8955078125, "logps/rejected": -324.961669921875, "loss": 0.4593, "rewards/accuracies": 0.7749999761581421, "rewards/chosen": -0.6105374693870544, "rewards/margins": 1.4274816513061523, "rewards/rejected": -2.0380191802978516, "step": 1450 }, { "epoch": 0.5877167205406993, "grad_norm": 113.63347625732422, "learning_rate": 9.224573817116396e-07, "logits/chosen": -1.1257575750350952, "logits/rejected": -0.8088225722312927, "logps/chosen": -356.369140625, "logps/rejected": -299.9069519042969, "loss": 0.4751, "rewards/accuracies": 0.7674999833106995, "rewards/chosen": -0.7516566514968872, "rewards/margins": 1.3119940757751465, "rewards/rejected": -2.063650608062744, "step": 1500 }, { "epoch": 0.6073072778920561, "grad_norm": 71.0758285522461, "learning_rate": 9.16770603715733e-07, "logits/chosen": -1.0219570398330688, "logits/rejected": -0.8258044719696045, "logps/chosen": -365.3489074707031, "logps/rejected": -317.51776123046875, "loss": 0.4755, "rewards/accuracies": 0.7724999785423279, "rewards/chosen": -0.722920298576355, "rewards/margins": 1.3333240747451782, "rewards/rejected": -2.0562446117401123, "step": 1550 }, { "epoch": 0.6268978352434127, "grad_norm": 63.271759033203125, "learning_rate": 9.109014542966609e-07, "logits/chosen": -1.0383367538452148, "logits/rejected": -0.8199602365493774, "logps/chosen": -361.697509765625, "logps/rejected": -319.4376525878906, "loss": 0.4271, "rewards/accuracies": 0.8100000023841858, "rewards/chosen": -0.8095757961273193, "rewards/margins": 1.4505212306976318, "rewards/rejected": -2.260097026824951, "step": 1600 }, { "epoch": 0.6268978352434127, "eval_logits/chosen": -1.0107686519622803, "eval_logits/rejected": -0.826732873916626, "eval_logps/chosen": -360.0285339355469, "eval_logps/rejected": -307.601318359375, "eval_loss": 0.4775010347366333, "eval_rewards/accuracies": 0.768109917640686, "eval_rewards/chosen": -0.7715086936950684, "eval_rewards/margins": 1.445361852645874, "eval_rewards/rejected": -2.2168707847595215, "eval_runtime": 181.1951, "eval_samples_per_second": 13.256, "eval_steps_per_second": 6.628, "step": 1600 }, { "epoch": 0.6464883925947693, "grad_norm": 69.98014831542969, "learning_rate": 9.04852501690097e-07, "logits/chosen": -1.0106360912322998, "logits/rejected": -0.769228458404541, "logps/chosen": -361.59783935546875, "logps/rejected": -298.4144287109375, "loss": 0.4807, "rewards/accuracies": 0.7749999761581421, "rewards/chosen": -0.6844636797904968, "rewards/margins": 1.4386271238327026, "rewards/rejected": -2.1230905055999756, "step": 1650 }, { "epoch": 0.6660789499461259, "grad_norm": 73.16764831542969, "learning_rate": 8.986263928104007e-07, "logits/chosen": -1.0747100114822388, "logits/rejected": -0.8522970676422119, "logps/chosen": -377.2361755371094, "logps/rejected": -314.54180908203125, "loss": 0.475, "rewards/accuracies": 0.7925000190734863, "rewards/chosen": -0.6853989958763123, "rewards/margins": 1.3294869661331177, "rewards/rejected": -2.014885902404785, "step": 1700 }, { "epoch": 0.6856695072974827, "grad_norm": 159.627685546875, "learning_rate": 8.922258520923739e-07, "logits/chosen": -1.1866579055786133, "logits/rejected": -0.9568431973457336, "logps/chosen": -363.7584228515625, "logps/rejected": -335.536376953125, "loss": 0.4701, "rewards/accuracies": 0.7549999952316284, "rewards/chosen": -0.6905403733253479, "rewards/margins": 1.4639062881469727, "rewards/rejected": -2.1544463634490967, "step": 1750 }, { "epoch": 0.7052600646488393, "grad_norm": 59.52585983276367, "learning_rate": 8.856536802990969e-07, "logits/chosen": -1.2136218547821045, "logits/rejected": -0.915833055973053, "logps/chosen": -368.9427795410156, "logps/rejected": -318.7424621582031, "loss": 0.4355, "rewards/accuracies": 0.7925000190734863, "rewards/chosen": -0.7404943704605103, "rewards/margins": 1.615696907043457, "rewards/rejected": -2.3561911582946777, "step": 1800 }, { "epoch": 0.7052600646488393, "eval_logits/chosen": -1.137018084526062, "eval_logits/rejected": -0.9567646384239197, "eval_logps/chosen": -360.75030517578125, "eval_logps/rejected": -307.82464599609375, "eval_loss": 0.4773857891559601, "eval_rewards/accuracies": 0.770191490650177, "eval_rewards/chosen": -0.8436892032623291, "eval_rewards/margins": 1.3955140113830566, "eval_rewards/rejected": -2.2392032146453857, "eval_runtime": 181.4174, "eval_samples_per_second": 13.24, "eval_steps_per_second": 6.62, "step": 1800 }, { "epoch": 0.7248506220001959, "grad_norm": 145.34722900390625, "learning_rate": 8.789127532963639e-07, "logits/chosen": -1.1216288805007935, "logits/rejected": -0.8633120656013489, "logps/chosen": -379.6500244140625, "logps/rejected": -340.3668212890625, "loss": 0.4937, "rewards/accuracies": 0.762499988079071, "rewards/chosen": -0.894076406955719, "rewards/margins": 1.335474967956543, "rewards/rejected": -2.2295515537261963, "step": 1850 }, { "epoch": 0.7444411793515525, "grad_norm": 85.14502716064453, "learning_rate": 8.720060207942547e-07, "logits/chosen": -1.1888411045074463, "logits/rejected": -0.8253584504127502, "logps/chosen": -358.1293029785156, "logps/rejected": -322.2793273925781, "loss": 0.453, "rewards/accuracies": 0.7774999737739563, "rewards/chosen": -0.7874532341957092, "rewards/margins": 1.4413965940475464, "rewards/rejected": -2.2288498878479004, "step": 1900 }, { "epoch": 0.7640317367029092, "grad_norm": 59.02031707763672, "learning_rate": 8.649365050563955e-07, "logits/chosen": -1.0339776277542114, "logits/rejected": -0.7359542846679688, "logps/chosen": -379.0245666503906, "logps/rejected": -335.61248779296875, "loss": 0.383, "rewards/accuracies": 0.824999988079071, "rewards/chosen": -0.9282081127166748, "rewards/margins": 1.724035382270813, "rewards/rejected": -2.6522433757781982, "step": 1950 }, { "epoch": 0.7836222940542659, "grad_norm": 100.15818786621094, "learning_rate": 8.577072995774679e-07, "logits/chosen": -1.0461410284042358, "logits/rejected": -0.7923344373703003, "logps/chosen": -358.7364196777344, "logps/rejected": -319.2044372558594, "loss": 0.5073, "rewards/accuracies": 0.7450000047683716, "rewards/chosen": -1.07187819480896, "rewards/margins": 1.472280740737915, "rewards/rejected": -2.544158697128296, "step": 2000 }, { "epoch": 0.7836222940542659, "eval_logits/chosen": -1.0298668146133423, "eval_logits/rejected": -0.857089638710022, "eval_logps/chosen": -361.0681457519531, "eval_logps/rejected": -309.28570556640625, "eval_loss": 0.4695436656475067, "eval_rewards/accuracies": 0.7756036520004272, "eval_rewards/chosen": -0.8754721283912659, "eval_rewards/margins": 1.5098369121551514, "eval_rewards/rejected": -2.3853089809417725, "eval_runtime": 181.4637, "eval_samples_per_second": 13.237, "eval_steps_per_second": 6.618, "step": 2000 }, { "epoch": 0.8032128514056225, "grad_norm": 109.68525695800781, "learning_rate": 8.503215677295522e-07, "logits/chosen": -1.1481313705444336, "logits/rejected": -0.8855399489402771, "logps/chosen": -377.3407897949219, "logps/rejected": -321.94903564453125, "loss": 0.4, "rewards/accuracies": 0.8075000047683716, "rewards/chosen": -0.8187921047210693, "rewards/margins": 1.6883336305618286, "rewards/rejected": -2.5071256160736084, "step": 2050 }, { "epoch": 0.8228034087569791, "grad_norm": 113.09908294677734, "learning_rate": 8.427825413778904e-07, "logits/chosen": -1.182418704032898, "logits/rejected": -1.0226842164993286, "logps/chosen": -370.88800048828125, "logps/rejected": -316.3885803222656, "loss": 0.4302, "rewards/accuracies": 0.7925000190734863, "rewards/chosen": -0.8482898473739624, "rewards/margins": 1.790774941444397, "rewards/rejected": -2.6390650272369385, "step": 2100 } ], "logging_steps": 50, "max_steps": 7659, "num_input_tokens_seen": 0, "num_train_epochs": 3, "save_steps": 300, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": false }, "attributes": {} } }, "total_flos": 0.0, "train_batch_size": 2, "trial_name": null, "trial_params": null }