{ "best_metric": null, "best_model_checkpoint": null, "epoch": 3.9975605179208107, "eval_steps": 500, "global_step": 5328, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "epoch": 0.0037530493525989865, "grad_norm": 8.25, "learning_rate": 2.9971846846846846e-05, "loss": 1.5176, "mean_token_accuracy": 0.769223016500473, "step": 5, "train/kl_loss_qwen": 0.08752547902986407, "train/kl_loss_r1": 0.06338356978787943, "train/total_kl": 0.1509090474806726 }, { "epoch": 0.007506098705197973, "grad_norm": 4.28125, "learning_rate": 2.9943693693693695e-05, "loss": 1.1039, "mean_token_accuracy": 0.8164006888866424, "step": 10, "train/kl_loss_qwen": 0.047363690473139285, "train/kl_loss_r1": 0.030132385808974503, "train/total_kl": 0.0774960758164525 }, { "epoch": 0.01125914805779696, "grad_norm": 5.65625, "learning_rate": 2.991554054054054e-05, "loss": 1.2405, "mean_token_accuracy": 0.8136043608188629, "step": 15, "train/kl_loss_qwen": 0.07904849713668227, "train/kl_loss_r1": 0.061669887881726025, "train/total_kl": 0.14071838529780506 }, { "epoch": 0.015012197410395946, "grad_norm": 3.75, "learning_rate": 2.9887387387387387e-05, "loss": 1.0465, "mean_token_accuracy": 0.8160444319248199, "step": 20, "train/kl_loss_qwen": 0.050111161265522244, "train/kl_loss_r1": 0.02416137345135212, "train/total_kl": 0.07427253378555179 }, { "epoch": 0.018765246762994934, "grad_norm": 5.25, "learning_rate": 2.9859234234234236e-05, "loss": 0.9846, "mean_token_accuracy": 0.8187097162008286, "step": 25, "train/kl_loss_qwen": 0.05244297441095114, "train/kl_loss_r1": 0.026212173467501997, "train/total_kl": 0.07865514857694507 }, { "epoch": 0.02251829611559392, "grad_norm": 4.5, "learning_rate": 2.983108108108108e-05, "loss": 0.9745, "mean_token_accuracy": 0.820404228568077, "step": 30, "train/kl_loss_qwen": 0.04298435244709253, "train/kl_loss_r1": 0.019624315295368434, "train/total_kl": 0.06260866802185774 }, { "epoch": 0.026271345468192906, "grad_norm": 4.4375, "learning_rate": 2.980292792792793e-05, "loss": 0.9507, "mean_token_accuracy": 0.8279938399791718, "step": 35, "train/kl_loss_qwen": 0.05955953812226653, "train/kl_loss_r1": 0.024175814585760236, "train/total_kl": 0.08373535200953483 }, { "epoch": 0.030024394820791892, "grad_norm": 8.3125, "learning_rate": 2.9774774774774776e-05, "loss": 0.938, "mean_token_accuracy": 0.8134139478206635, "step": 40, "train/kl_loss_qwen": 0.044126112619414924, "train/kl_loss_r1": 0.025413188384845853, "train/total_kl": 0.06953930081799627 }, { "epoch": 0.03377744417339088, "grad_norm": 4.0625, "learning_rate": 2.9746621621621622e-05, "loss": 0.9463, "mean_token_accuracy": 0.8168299198150635, "step": 45, "train/kl_loss_qwen": 0.03402696019038558, "train/kl_loss_r1": 0.021722227288410067, "train/total_kl": 0.055749187525361774 }, { "epoch": 0.03753049352598987, "grad_norm": 3.75, "learning_rate": 2.971846846846847e-05, "loss": 0.9246, "mean_token_accuracy": 0.8254363358020782, "step": 50, "train/kl_loss_qwen": 0.04775930540636182, "train/kl_loss_r1": 0.022044902294874193, "train/total_kl": 0.0698042068630457 }, { "epoch": 0.041283542878588854, "grad_norm": 6.8125, "learning_rate": 2.9690315315315316e-05, "loss": 0.925, "mean_token_accuracy": 0.8240109533071518, "step": 55, "train/kl_loss_qwen": 0.043926798785105345, "train/kl_loss_r1": 0.02575247841887176, "train/total_kl": 0.06967927720397711 }, { "epoch": 0.04503659223118784, "grad_norm": 3.640625, "learning_rate": 2.9662162162162162e-05, "loss": 0.905, "mean_token_accuracy": 0.8216860949993133, "step": 60, "train/kl_loss_qwen": 0.04389990693889558, "train/kl_loss_r1": 0.018909475579857827, "train/total_kl": 0.06280938191339373 }, { "epoch": 0.048789641583786826, "grad_norm": 3.296875, "learning_rate": 2.963400900900901e-05, "loss": 0.863, "mean_token_accuracy": 0.8277184933423996, "step": 65, "train/kl_loss_qwen": 0.03611544775776565, "train/kl_loss_r1": 0.01730741309002042, "train/total_kl": 0.053422861360013486 }, { "epoch": 0.05254269093638581, "grad_norm": 4.28125, "learning_rate": 2.9605855855855857e-05, "loss": 0.9046, "mean_token_accuracy": 0.8278381377458572, "step": 70, "train/kl_loss_qwen": 0.046157079841941596, "train/kl_loss_r1": 0.022548422031104565, "train/total_kl": 0.06870550150051713 }, { "epoch": 0.0562957402889848, "grad_norm": 3.234375, "learning_rate": 2.9577702702702702e-05, "loss": 0.9027, "mean_token_accuracy": 0.8260001480579376, "step": 75, "train/kl_loss_qwen": 0.04451500792056322, "train/kl_loss_r1": 0.02041986952535808, "train/total_kl": 0.06493487702682614 }, { "epoch": 0.060048789641583784, "grad_norm": 2.921875, "learning_rate": 2.954954954954955e-05, "loss": 0.8643, "mean_token_accuracy": 0.8250504255294799, "step": 80, "train/kl_loss_qwen": 0.03131786421872675, "train/kl_loss_r1": 0.01814232598990202, "train/total_kl": 0.04946019034832716 }, { "epoch": 0.06380183899418278, "grad_norm": 3.3125, "learning_rate": 2.9521396396396397e-05, "loss": 0.8967, "mean_token_accuracy": 0.8288980603218079, "step": 85, "train/kl_loss_qwen": 0.03794705630280078, "train/kl_loss_r1": 0.01904052966274321, "train/total_kl": 0.05698758559301496 }, { "epoch": 0.06755488834678176, "grad_norm": 3.234375, "learning_rate": 2.9493243243243243e-05, "loss": 0.8967, "mean_token_accuracy": 0.8236296445131301, "step": 90, "train/kl_loss_qwen": 0.034339522430673244, "train/kl_loss_r1": 0.017526828777045013, "train/total_kl": 0.05186635032296181 }, { "epoch": 0.07130793769938075, "grad_norm": 3.0625, "learning_rate": 2.9465090090090092e-05, "loss": 0.8868, "mean_token_accuracy": 0.8290457785129547, "step": 95, "train/kl_loss_qwen": 0.04135038205422461, "train/kl_loss_r1": 0.020615293877199292, "train/total_kl": 0.06196567676961422 }, { "epoch": 0.07506098705197974, "grad_norm": 2.484375, "learning_rate": 2.9436936936936937e-05, "loss": 0.9278, "mean_token_accuracy": 0.8270440757274627, "step": 100, "train/kl_loss_qwen": 0.04315362004563213, "train/kl_loss_r1": 0.019161203969269992, "train/total_kl": 0.06231482308357954 }, { "epoch": 0.07881403640457872, "grad_norm": 2.9375, "learning_rate": 2.9408783783783786e-05, "loss": 0.9493, "mean_token_accuracy": 0.8260469496250152, "step": 105, "train/kl_loss_qwen": 0.05107316141948104, "train/kl_loss_r1": 0.02429227330721915, "train/total_kl": 0.07536543449386954 }, { "epoch": 0.08256708575717771, "grad_norm": 2.828125, "learning_rate": 2.9380630630630632e-05, "loss": 0.8664, "mean_token_accuracy": 0.8338415503501893, "step": 110, "train/kl_loss_qwen": 0.033846771158277986, "train/kl_loss_r1": 0.02006581616587937, "train/total_kl": 0.053912587370723485 }, { "epoch": 0.0863201351097767, "grad_norm": 3.640625, "learning_rate": 2.9352477477477478e-05, "loss": 0.9389, "mean_token_accuracy": 0.8269973963499069, "step": 115, "train/kl_loss_qwen": 0.0465784995816648, "train/kl_loss_r1": 0.017597663728520275, "train/total_kl": 0.06417616195976734 }, { "epoch": 0.09007318446237568, "grad_norm": 4.6875, "learning_rate": 2.9324324324324327e-05, "loss": 0.8609, "mean_token_accuracy": 0.8387646734714508, "step": 120, "train/kl_loss_qwen": 0.045968831051141024, "train/kl_loss_r1": 0.02227792115882039, "train/total_kl": 0.06824675332754851 }, { "epoch": 0.09382623381497467, "grad_norm": 3.34375, "learning_rate": 2.9296171171171172e-05, "loss": 0.8136, "mean_token_accuracy": 0.835837545990944, "step": 125, "train/kl_loss_qwen": 0.030515689635649323, "train/kl_loss_r1": 0.01657968182116747, "train/total_kl": 0.04709537066519261 }, { "epoch": 0.09757928316757365, "grad_norm": 3.59375, "learning_rate": 2.9268018018018018e-05, "loss": 0.9258, "mean_token_accuracy": 0.8317561388015747, "step": 130, "train/kl_loss_qwen": 0.050186758302152155, "train/kl_loss_r1": 0.02410706952214241, "train/total_kl": 0.07429382782429457 }, { "epoch": 0.10133233252017264, "grad_norm": 3.234375, "learning_rate": 2.9239864864864867e-05, "loss": 0.9888, "mean_token_accuracy": 0.821666619181633, "step": 135, "train/kl_loss_qwen": 0.0546362214256078, "train/kl_loss_r1": 0.030097179347649217, "train/total_kl": 0.0847334012389183 }, { "epoch": 0.10508538187277162, "grad_norm": 2.9375, "learning_rate": 2.9211711711711713e-05, "loss": 0.8415, "mean_token_accuracy": 0.8354150176048278, "step": 140, "train/kl_loss_qwen": 0.03478895598091185, "train/kl_loss_r1": 0.02067015548236668, "train/total_kl": 0.05545911192893982 }, { "epoch": 0.10883843122537061, "grad_norm": 3.734375, "learning_rate": 2.918355855855856e-05, "loss": 0.8876, "mean_token_accuracy": 0.8325099974870682, "step": 145, "train/kl_loss_qwen": 0.0391026409342885, "train/kl_loss_r1": 0.026549011236056685, "train/total_kl": 0.06565165296196937 }, { "epoch": 0.1125914805779696, "grad_norm": 2.84375, "learning_rate": 2.9155405405405407e-05, "loss": 0.9387, "mean_token_accuracy": 0.8379026591777802, "step": 150, "train/kl_loss_qwen": 0.051510713435709475, "train/kl_loss_r1": 0.03157240990549326, "train/total_kl": 0.08308312483131886 }, { "epoch": 0.11634452993056858, "grad_norm": 5.09375, "learning_rate": 2.9127252252252253e-05, "loss": 0.9259, "mean_token_accuracy": 0.826890054345131, "step": 155, "train/kl_loss_qwen": 0.04228275725618005, "train/kl_loss_r1": 0.02729719616472721, "train/total_kl": 0.06957995360717177 }, { "epoch": 0.12009757928316757, "grad_norm": 3.875, "learning_rate": 2.90990990990991e-05, "loss": 0.9461, "mean_token_accuracy": 0.8288823276758194, "step": 160, "train/kl_loss_qwen": 0.04088701442815364, "train/kl_loss_r1": 0.024661906762048602, "train/total_kl": 0.06554892128333449 }, { "epoch": 0.12385062863576655, "grad_norm": 4.21875, "learning_rate": 2.9070945945945948e-05, "loss": 0.8884, "mean_token_accuracy": 0.8316583424806595, "step": 165, "train/kl_loss_qwen": 0.04645280791446567, "train/kl_loss_r1": 0.026368586625903846, "train/total_kl": 0.07282139537855983 }, { "epoch": 0.12760367798836555, "grad_norm": 3.140625, "learning_rate": 2.9042792792792793e-05, "loss": 0.8559, "mean_token_accuracy": 0.8401839256286621, "step": 170, "train/kl_loss_qwen": 0.03588448138907552, "train/kl_loss_r1": 0.02225645985454321, "train/total_kl": 0.058140940591692926 }, { "epoch": 0.13135672734096454, "grad_norm": 3.078125, "learning_rate": 2.9014639639639642e-05, "loss": 0.9353, "mean_token_accuracy": 0.819926631450653, "step": 175, "train/kl_loss_qwen": 0.047735629277303814, "train/kl_loss_r1": 0.022419746313244105, "train/total_kl": 0.0701553763821721 }, { "epoch": 0.13510977669356353, "grad_norm": 3.109375, "learning_rate": 2.8986486486486488e-05, "loss": 0.8418, "mean_token_accuracy": 0.8275587946176529, "step": 180, "train/kl_loss_qwen": 0.030953629314899443, "train/kl_loss_r1": 0.016762713715434075, "train/total_kl": 0.04771634349599481 }, { "epoch": 0.1388628260461625, "grad_norm": 2.84375, "learning_rate": 2.8958333333333334e-05, "loss": 0.8736, "mean_token_accuracy": 0.8307415157556534, "step": 185, "train/kl_loss_qwen": 0.040645266277715565, "train/kl_loss_r1": 0.01992678502574563, "train/total_kl": 0.06057205153629184 }, { "epoch": 0.1426158753987615, "grad_norm": 3.015625, "learning_rate": 2.8930180180180183e-05, "loss": 0.8587, "mean_token_accuracy": 0.8310975462198258, "step": 190, "train/kl_loss_qwen": 0.036960875568911436, "train/kl_loss_r1": 0.019845803361386062, "train/total_kl": 0.05680667934939265 }, { "epoch": 0.14636892475136049, "grad_norm": 2.734375, "learning_rate": 2.8902027027027028e-05, "loss": 0.8772, "mean_token_accuracy": 0.8337432593107224, "step": 195, "train/kl_loss_qwen": 0.04270432349294424, "train/kl_loss_r1": 0.02069783229380846, "train/total_kl": 0.06340215532109142 }, { "epoch": 0.15012197410395947, "grad_norm": 2.59375, "learning_rate": 2.8873873873873874e-05, "loss": 0.8596, "mean_token_accuracy": 0.83087178170681, "step": 200, "train/kl_loss_qwen": 0.042936635203659534, "train/kl_loss_r1": 0.022718130564317107, "train/total_kl": 0.06565476628020406 }, { "epoch": 0.15387502345655846, "grad_norm": 3.640625, "learning_rate": 2.8845720720720723e-05, "loss": 0.8908, "mean_token_accuracy": 0.8138444811105728, "step": 205, "train/kl_loss_qwen": 0.030784124229103326, "train/kl_loss_r1": 0.016901360964402555, "train/total_kl": 0.0476854850538075 }, { "epoch": 0.15762807280915744, "grad_norm": 3.46875, "learning_rate": 2.881756756756757e-05, "loss": 0.869, "mean_token_accuracy": 0.8308258265256881, "step": 210, "train/kl_loss_qwen": 0.03687661928124726, "train/kl_loss_r1": 0.02106295870617032, "train/total_kl": 0.05793957831338048 }, { "epoch": 0.16138112216175643, "grad_norm": 3.140625, "learning_rate": 2.8789414414414414e-05, "loss": 0.8614, "mean_token_accuracy": 0.8309110760688782, "step": 215, "train/kl_loss_qwen": 0.025625232327729463, "train/kl_loss_r1": 0.017062702728435398, "train/total_kl": 0.0426879346370697 }, { "epoch": 0.16513417151435542, "grad_norm": 3.515625, "learning_rate": 2.8761261261261263e-05, "loss": 0.9389, "mean_token_accuracy": 0.8283930003643036, "step": 220, "train/kl_loss_qwen": 0.04772484353743493, "train/kl_loss_r1": 0.0242662335280329, "train/total_kl": 0.071991076041013 }, { "epoch": 0.1688872208669544, "grad_norm": 3.390625, "learning_rate": 2.873310810810811e-05, "loss": 0.8665, "mean_token_accuracy": 0.8319736927747726, "step": 225, "train/kl_loss_qwen": 0.04302333788946271, "train/kl_loss_r1": 0.020506267715245486, "train/total_kl": 0.06352960634976626 }, { "epoch": 0.1726402702195534, "grad_norm": 3.078125, "learning_rate": 2.8704954954954955e-05, "loss": 0.9634, "mean_token_accuracy": 0.8157904803752899, "step": 230, "train/kl_loss_qwen": 0.03608332681469619, "train/kl_loss_r1": 0.022636342188343407, "train/total_kl": 0.058719669748097655 }, { "epoch": 0.17639331957215237, "grad_norm": 3.3125, "learning_rate": 2.8676801801801804e-05, "loss": 0.8786, "mean_token_accuracy": 0.8320168018341064, "step": 235, "train/kl_loss_qwen": 0.03650941308587789, "train/kl_loss_r1": 0.01942919297143817, "train/total_kl": 0.05593860624358058 }, { "epoch": 0.18014636892475136, "grad_norm": 3.09375, "learning_rate": 2.864864864864865e-05, "loss": 0.8857, "mean_token_accuracy": 0.8240372210741043, "step": 240, "train/kl_loss_qwen": 0.04121889984235168, "train/kl_loss_r1": 0.023149896459653974, "train/total_kl": 0.06436879634857177 }, { "epoch": 0.18389941827735035, "grad_norm": 3.34375, "learning_rate": 2.8620495495495498e-05, "loss": 0.8879, "mean_token_accuracy": 0.8295320123434067, "step": 245, "train/kl_loss_qwen": 0.04043615320697427, "train/kl_loss_r1": 0.020326331770047546, "train/total_kl": 0.06076248474419117 }, { "epoch": 0.18765246762994933, "grad_norm": 3.34375, "learning_rate": 2.8592342342342344e-05, "loss": 0.8265, "mean_token_accuracy": 0.8326751410961151, "step": 250, "train/kl_loss_qwen": 0.026516885636374353, "train/kl_loss_r1": 0.01770362425595522, "train/total_kl": 0.044220509752631185 }, { "epoch": 0.19140551698254832, "grad_norm": 3.421875, "learning_rate": 2.856418918918919e-05, "loss": 0.9341, "mean_token_accuracy": 0.8237122267484664, "step": 255, "train/kl_loss_qwen": 0.048292512679472564, "train/kl_loss_r1": 0.022946013091132044, "train/total_kl": 0.07123852567747235 }, { "epoch": 0.1951585663351473, "grad_norm": 2.78125, "learning_rate": 2.853603603603604e-05, "loss": 0.857, "mean_token_accuracy": 0.828681230545044, "step": 260, "train/kl_loss_qwen": 0.03695045164786279, "train/kl_loss_r1": 0.0199518951587379, "train/total_kl": 0.056902346294373275 }, { "epoch": 0.1989116156877463, "grad_norm": 3.28125, "learning_rate": 2.8507882882882884e-05, "loss": 0.9094, "mean_token_accuracy": 0.8349234968423843, "step": 265, "train/kl_loss_qwen": 0.047521751886233685, "train/kl_loss_r1": 0.02572522107511759, "train/total_kl": 0.07324697300791741 }, { "epoch": 0.20266466504034528, "grad_norm": 3.265625, "learning_rate": 2.847972972972973e-05, "loss": 0.9172, "mean_token_accuracy": 0.8182721942663193, "step": 270, "train/kl_loss_qwen": 0.04026843742467463, "train/kl_loss_r1": 0.019451649440452457, "train/total_kl": 0.059720087610185144 }, { "epoch": 0.20641771439294426, "grad_norm": 2.96875, "learning_rate": 2.845157657657658e-05, "loss": 0.8914, "mean_token_accuracy": 0.8202652215957642, "step": 275, "train/kl_loss_qwen": 0.03867609850130975, "train/kl_loss_r1": 0.025283710239455102, "train/total_kl": 0.06395980911329388 }, { "epoch": 0.21017076374554325, "grad_norm": 2.796875, "learning_rate": 2.8423423423423425e-05, "loss": 0.8519, "mean_token_accuracy": 0.8259457170963287, "step": 280, "train/kl_loss_qwen": 0.030157899064943195, "train/kl_loss_r1": 0.0176977907307446, "train/total_kl": 0.047855690307915213 }, { "epoch": 0.21392381309814223, "grad_norm": 2.96875, "learning_rate": 2.839527027027027e-05, "loss": 0.8837, "mean_token_accuracy": 0.8319539725780487, "step": 285, "train/kl_loss_qwen": 0.0462970673572272, "train/kl_loss_r1": 0.023949274653568865, "train/total_kl": 0.07024634098634124 }, { "epoch": 0.21767686245074122, "grad_norm": 3.375, "learning_rate": 2.836711711711712e-05, "loss": 0.8822, "mean_token_accuracy": 0.8238964200019836, "step": 290, "train/kl_loss_qwen": 0.03392238900996745, "train/kl_loss_r1": 0.019832599721848965, "train/total_kl": 0.05375498877838254 }, { "epoch": 0.2214299118033402, "grad_norm": 3.125, "learning_rate": 2.8338963963963965e-05, "loss": 0.9019, "mean_token_accuracy": 0.8279110223054886, "step": 295, "train/kl_loss_qwen": 0.04686084697023034, "train/kl_loss_r1": 0.021674037864431738, "train/total_kl": 0.0685348848812282 }, { "epoch": 0.2251829611559392, "grad_norm": 2.75, "learning_rate": 2.831081081081081e-05, "loss": 0.829, "mean_token_accuracy": 0.8228947937488555, "step": 300, "train/kl_loss_qwen": 0.03104133568704128, "train/kl_loss_r1": 0.017868287535384296, "train/total_kl": 0.048909622617065905 }, { "epoch": 0.22893601050853818, "grad_norm": 3.609375, "learning_rate": 2.828265765765766e-05, "loss": 0.8861, "mean_token_accuracy": 0.830480980873108, "step": 305, "train/kl_loss_qwen": 0.04108666768297553, "train/kl_loss_r1": 0.022314603487029672, "train/total_kl": 0.06340127140283584 }, { "epoch": 0.23268905986113717, "grad_norm": 2.75, "learning_rate": 2.8254504504504505e-05, "loss": 0.8572, "mean_token_accuracy": 0.8241907984018326, "step": 310, "train/kl_loss_qwen": 0.03199450373649597, "train/kl_loss_r1": 0.017621683469042183, "train/total_kl": 0.04961618706583977 }, { "epoch": 0.23644210921373615, "grad_norm": 3.515625, "learning_rate": 2.8226351351351354e-05, "loss": 0.8637, "mean_token_accuracy": 0.8376813232898712, "step": 315, "train/kl_loss_qwen": 0.04330867072567344, "train/kl_loss_r1": 0.02416534055955708, "train/total_kl": 0.06747401058673859 }, { "epoch": 0.24019515856633514, "grad_norm": 4.0625, "learning_rate": 2.81981981981982e-05, "loss": 0.9112, "mean_token_accuracy": 0.8234936207532882, "step": 320, "train/kl_loss_qwen": 0.048313079914078114, "train/kl_loss_r1": 0.025073166657239198, "train/total_kl": 0.07338624661788344 }, { "epoch": 0.24394820791893412, "grad_norm": 4.78125, "learning_rate": 2.8170045045045046e-05, "loss": 0.8907, "mean_token_accuracy": 0.8210220754146575, "step": 325, "train/kl_loss_qwen": 0.03271963973529637, "train/kl_loss_r1": 0.017756852181628348, "train/total_kl": 0.05047649145126343 }, { "epoch": 0.2477012572715331, "grad_norm": 3.203125, "learning_rate": 2.8141891891891895e-05, "loss": 0.8258, "mean_token_accuracy": 0.8319089412689209, "step": 330, "train/kl_loss_qwen": 0.03287083809264004, "train/kl_loss_r1": 0.017795524606481195, "train/total_kl": 0.05066636316478253 }, { "epoch": 0.2514543066241321, "grad_norm": 3.375, "learning_rate": 2.811373873873874e-05, "loss": 0.8629, "mean_token_accuracy": 0.8283258348703384, "step": 335, "train/kl_loss_qwen": 0.032528719678521154, "train/kl_loss_r1": 0.020534052094444633, "train/total_kl": 0.05306277144700289 }, { "epoch": 0.2552073559767311, "grad_norm": 8.375, "learning_rate": 2.8085585585585586e-05, "loss": 0.9014, "mean_token_accuracy": 0.8283331096172333, "step": 340, "train/kl_loss_qwen": 0.0436781873460859, "train/kl_loss_r1": 0.021283475076779725, "train/total_kl": 0.06496166167780756 }, { "epoch": 0.25896040532933007, "grad_norm": 3.25, "learning_rate": 2.8057432432432435e-05, "loss": 0.9772, "mean_token_accuracy": 0.8316745519638061, "step": 345, "train/kl_loss_qwen": 0.06164747509174049, "train/kl_loss_r1": 0.033189503895118835, "train/total_kl": 0.0948369799181819 }, { "epoch": 0.2627134546819291, "grad_norm": 2.53125, "learning_rate": 2.802927927927928e-05, "loss": 0.9112, "mean_token_accuracy": 0.8187721729278564, "step": 350, "train/kl_loss_qwen": 0.04342941730283201, "train/kl_loss_r1": 0.021683502895757555, "train/total_kl": 0.06511292122304439 }, { "epoch": 0.26646650403452804, "grad_norm": 4.8125, "learning_rate": 2.8001126126126126e-05, "loss": 0.8597, "mean_token_accuracy": 0.823934805393219, "step": 355, "train/kl_loss_qwen": 0.03486774587072432, "train/kl_loss_r1": 0.018483150517567992, "train/total_kl": 0.0533508962020278 }, { "epoch": 0.27021955338712705, "grad_norm": 4.03125, "learning_rate": 2.7972972972972975e-05, "loss": 0.9002, "mean_token_accuracy": 0.8210596233606339, "step": 360, "train/kl_loss_qwen": 0.038451321935281155, "train/kl_loss_r1": 0.020488675870001315, "train/total_kl": 0.05893999738618731 }, { "epoch": 0.273972602739726, "grad_norm": 3.609375, "learning_rate": 2.794481981981982e-05, "loss": 0.8471, "mean_token_accuracy": 0.8312166184186935, "step": 365, "train/kl_loss_qwen": 0.029628670075908303, "train/kl_loss_r1": 0.014924272242933512, "train/total_kl": 0.04455294217914343 }, { "epoch": 0.277725652092325, "grad_norm": 2.84375, "learning_rate": 2.7916666666666666e-05, "loss": 0.8673, "mean_token_accuracy": 0.8319344162940979, "step": 370, "train/kl_loss_qwen": 0.03991308896802366, "train/kl_loss_r1": 0.0243389128241688, "train/total_kl": 0.06425200179219245 }, { "epoch": 0.281478701444924, "grad_norm": 3.40625, "learning_rate": 2.7888513513513516e-05, "loss": 0.8304, "mean_token_accuracy": 0.8395447045564651, "step": 375, "train/kl_loss_qwen": 0.03554642982780933, "train/kl_loss_r1": 0.01824573487974703, "train/total_kl": 0.053792164847254756 }, { "epoch": 0.285231750797523, "grad_norm": 2.796875, "learning_rate": 2.786036036036036e-05, "loss": 0.8545, "mean_token_accuracy": 0.8338422924280167, "step": 380, "train/kl_loss_qwen": 0.03943650596775115, "train/kl_loss_r1": 0.022580207185819746, "train/total_kl": 0.062016712967306376 }, { "epoch": 0.28898480015012196, "grad_norm": 3.53125, "learning_rate": 2.783220720720721e-05, "loss": 0.8865, "mean_token_accuracy": 0.8243386000394821, "step": 385, "train/kl_loss_qwen": 0.032612268114462495, "train/kl_loss_r1": 0.019001774908974766, "train/total_kl": 0.051614042930305006 }, { "epoch": 0.29273784950272097, "grad_norm": 2.875, "learning_rate": 2.7804054054054056e-05, "loss": 0.8481, "mean_token_accuracy": 0.831609445810318, "step": 390, "train/kl_loss_qwen": 0.03640997484326362, "train/kl_loss_r1": 0.02251947051845491, "train/total_kl": 0.05892944540828467 }, { "epoch": 0.29649089885531993, "grad_norm": 3.796875, "learning_rate": 2.77759009009009e-05, "loss": 0.831, "mean_token_accuracy": 0.8290323615074158, "step": 395, "train/kl_loss_qwen": 0.03999115023761988, "train/kl_loss_r1": 0.018835989851504566, "train/total_kl": 0.05882714046165347 }, { "epoch": 0.30024394820791894, "grad_norm": 3.5, "learning_rate": 2.774774774774775e-05, "loss": 0.8797, "mean_token_accuracy": 0.8339627146720886, "step": 400, "train/kl_loss_qwen": 0.03993063434027135, "train/kl_loss_r1": 0.021482796175405383, "train/total_kl": 0.061413430236279966 }, { "epoch": 0.3039969975605179, "grad_norm": 3.28125, "learning_rate": 2.7719594594594596e-05, "loss": 0.8767, "mean_token_accuracy": 0.8245404064655304, "step": 405, "train/kl_loss_qwen": 0.03429829515516758, "train/kl_loss_r1": 0.018518435396254064, "train/total_kl": 0.052816730458289385 }, { "epoch": 0.3077500469131169, "grad_norm": 2.890625, "learning_rate": 2.7691441441441442e-05, "loss": 0.8474, "mean_token_accuracy": 0.8327318131923676, "step": 410, "train/kl_loss_qwen": 0.03831371474079788, "train/kl_loss_r1": 0.02023513722233474, "train/total_kl": 0.05854885214939713 }, { "epoch": 0.3115030962657159, "grad_norm": 3.09375, "learning_rate": 2.766328828828829e-05, "loss": 0.968, "mean_token_accuracy": 0.8316255033016204, "step": 415, "train/kl_loss_qwen": 0.04635447044856846, "train/kl_loss_r1": 0.03803784307092428, "train/total_kl": 0.08439231272786855 }, { "epoch": 0.3152561456183149, "grad_norm": 2.78125, "learning_rate": 2.7635135135135136e-05, "loss": 0.8519, "mean_token_accuracy": 0.8353470414876938, "step": 420, "train/kl_loss_qwen": 0.039563533896580336, "train/kl_loss_r1": 0.020479060476645827, "train/total_kl": 0.06004259428009391 }, { "epoch": 0.31900919497091385, "grad_norm": 2.78125, "learning_rate": 2.7606981981981982e-05, "loss": 0.8615, "mean_token_accuracy": 0.8276613086462021, "step": 425, "train/kl_loss_qwen": 0.0393582281190902, "train/kl_loss_r1": 0.019348848797380924, "train/total_kl": 0.058707076404243705 }, { "epoch": 0.32276224432351286, "grad_norm": 3.03125, "learning_rate": 2.757882882882883e-05, "loss": 0.9294, "mean_token_accuracy": 0.8186271667480469, "step": 430, "train/kl_loss_qwen": 0.050791586516425014, "train/kl_loss_r1": 0.02292977077886462, "train/total_kl": 0.07372135808691382 }, { "epoch": 0.3265152936761118, "grad_norm": 3.078125, "learning_rate": 2.7550675675675677e-05, "loss": 0.9728, "mean_token_accuracy": 0.8224653273820877, "step": 435, "train/kl_loss_qwen": 0.04803532916121185, "train/kl_loss_r1": 0.03875158065930009, "train/total_kl": 0.08678690884262323 }, { "epoch": 0.33026834302871083, "grad_norm": 3.78125, "learning_rate": 2.7522522522522522e-05, "loss": 0.867, "mean_token_accuracy": 0.826562350988388, "step": 440, "train/kl_loss_qwen": 0.0310151603538543, "train/kl_loss_r1": 0.020512415934354065, "train/total_kl": 0.051527577079832555 }, { "epoch": 0.3340213923813098, "grad_norm": 3.421875, "learning_rate": 2.749436936936937e-05, "loss": 0.8257, "mean_token_accuracy": 0.8324155032634735, "step": 445, "train/kl_loss_qwen": 0.0258051089476794, "train/kl_loss_r1": 0.015088145853951573, "train/total_kl": 0.04089325405657292 }, { "epoch": 0.3377744417339088, "grad_norm": 2.921875, "learning_rate": 2.7466216216216217e-05, "loss": 0.8653, "mean_token_accuracy": 0.8344490349292755, "step": 450, "train/kl_loss_qwen": 0.04345053578726947, "train/kl_loss_r1": 0.024011770728975534, "train/total_kl": 0.06746230693534017 }, { "epoch": 0.34152749108650776, "grad_norm": 3.3125, "learning_rate": 2.7438063063063066e-05, "loss": 0.8571, "mean_token_accuracy": 0.8373376429080963, "step": 455, "train/kl_loss_qwen": 0.03988681212067604, "train/kl_loss_r1": 0.022834346117451786, "train/total_kl": 0.06272115856409073 }, { "epoch": 0.3452805404391068, "grad_norm": 2.5, "learning_rate": 2.7409909909909912e-05, "loss": 0.8637, "mean_token_accuracy": 0.8259221136569976, "step": 460, "train/kl_loss_qwen": 0.03982735755853355, "train/kl_loss_r1": 0.020564141124486922, "train/total_kl": 0.060391498263925314 }, { "epoch": 0.34903358979170573, "grad_norm": 2.890625, "learning_rate": 2.7381756756756757e-05, "loss": 0.8959, "mean_token_accuracy": 0.8191772252321243, "step": 465, "train/kl_loss_qwen": 0.03617819314822555, "train/kl_loss_r1": 0.020906389644369482, "train/total_kl": 0.057084583304822446 }, { "epoch": 0.35278663914430475, "grad_norm": 3.203125, "learning_rate": 2.7353603603603606e-05, "loss": 0.8568, "mean_token_accuracy": 0.8304102897644043, "step": 470, "train/kl_loss_qwen": 0.04182955021969974, "train/kl_loss_r1": 0.020317962439730764, "train/total_kl": 0.06214751219376922 }, { "epoch": 0.35653968849690376, "grad_norm": 2.828125, "learning_rate": 2.7325450450450452e-05, "loss": 0.8763, "mean_token_accuracy": 0.8301267266273499, "step": 475, "train/kl_loss_qwen": 0.03945403727702797, "train/kl_loss_r1": 0.022836983483284713, "train/total_kl": 0.06229102117940784 }, { "epoch": 0.3602927378495027, "grad_norm": 2.953125, "learning_rate": 2.7297297297297298e-05, "loss": 0.8484, "mean_token_accuracy": 0.8383503198623657, "step": 480, "train/kl_loss_qwen": 0.038632744224742055, "train/kl_loss_r1": 0.019086693413555622, "train/total_kl": 0.057719437219202516 }, { "epoch": 0.36404578720210173, "grad_norm": 2.640625, "learning_rate": 2.7269144144144147e-05, "loss": 0.8675, "mean_token_accuracy": 0.8294745326042176, "step": 485, "train/kl_loss_qwen": 0.03857216462492943, "train/kl_loss_r1": 0.020617604441940784, "train/total_kl": 0.05918976916000247 }, { "epoch": 0.3677988365547007, "grad_norm": 2.625, "learning_rate": 2.7240990990990992e-05, "loss": 0.8863, "mean_token_accuracy": 0.8222176939249038, "step": 490, "train/kl_loss_qwen": 0.034204355999827386, "train/kl_loss_r1": 0.019204271771013737, "train/total_kl": 0.05340862749144435 }, { "epoch": 0.3715518859072997, "grad_norm": 3.125, "learning_rate": 2.7212837837837838e-05, "loss": 0.8404, "mean_token_accuracy": 0.8288236528635025, "step": 495, "train/kl_loss_qwen": 0.03576806071214378, "train/kl_loss_r1": 0.02088703722693026, "train/total_kl": 0.056655097752809525 }, { "epoch": 0.37530493525989866, "grad_norm": 2.515625, "learning_rate": 2.7184684684684687e-05, "loss": 0.8603, "mean_token_accuracy": 0.8273730278015137, "step": 500, "train/kl_loss_qwen": 0.04495933828875422, "train/kl_loss_r1": 0.02340303808450699, "train/total_kl": 0.06836237693205476 }, { "epoch": 0.3790579846124977, "grad_norm": 2.90625, "learning_rate": 2.7156531531531533e-05, "loss": 0.8351, "mean_token_accuracy": 0.8235865086317062, "step": 505, "train/kl_loss_qwen": 0.026128826756030323, "train/kl_loss_r1": 0.016629086900502445, "train/total_kl": 0.04275791347026825 }, { "epoch": 0.38281103396509664, "grad_norm": 3.1875, "learning_rate": 2.7128378378378382e-05, "loss": 0.8521, "mean_token_accuracy": 0.8217630565166474, "step": 510, "train/kl_loss_qwen": 0.029674333380535246, "train/kl_loss_r1": 0.016433697286993267, "train/total_kl": 0.04610803062096238 }, { "epoch": 0.38656408331769565, "grad_norm": 2.796875, "learning_rate": 2.7100225225225227e-05, "loss": 0.88, "mean_token_accuracy": 0.829921105504036, "step": 515, "train/kl_loss_qwen": 0.02549975486472249, "train/kl_loss_r1": 0.017349076084792615, "train/total_kl": 0.042848830856382844 }, { "epoch": 0.3903171326702946, "grad_norm": 2.78125, "learning_rate": 2.7072072072072073e-05, "loss": 0.8744, "mean_token_accuracy": 0.823358204960823, "step": 520, "train/kl_loss_qwen": 0.04186864621005952, "train/kl_loss_r1": 0.022606688272207975, "train/total_kl": 0.06447533471509814 }, { "epoch": 0.3940701820228936, "grad_norm": 2.90625, "learning_rate": 2.7043918918918922e-05, "loss": 0.9341, "mean_token_accuracy": 0.8311702489852906, "step": 525, "train/kl_loss_qwen": 0.04608453796245158, "train/kl_loss_r1": 0.03976609790697694, "train/total_kl": 0.08585063479840756 }, { "epoch": 0.3978232313754926, "grad_norm": 3.59375, "learning_rate": 2.7015765765765768e-05, "loss": 0.8834, "mean_token_accuracy": 0.8259417653083801, "step": 530, "train/kl_loss_qwen": 0.03925313828513026, "train/kl_loss_r1": 0.025636327592656015, "train/total_kl": 0.06488946592435241 }, { "epoch": 0.4015762807280916, "grad_norm": 3.15625, "learning_rate": 2.6987612612612613e-05, "loss": 0.8555, "mean_token_accuracy": 0.8354889839887619, "step": 535, "train/kl_loss_qwen": 0.029237260250374673, "train/kl_loss_r1": 0.017392286285758018, "train/total_kl": 0.04662954695522785 }, { "epoch": 0.40532933008069055, "grad_norm": 3.390625, "learning_rate": 2.6959459459459462e-05, "loss": 0.8966, "mean_token_accuracy": 0.8290208607912064, "step": 540, "train/kl_loss_qwen": 0.03987643430009484, "train/kl_loss_r1": 0.02204420636408031, "train/total_kl": 0.06192064164206386 }, { "epoch": 0.40908237943328957, "grad_norm": 2.828125, "learning_rate": 2.6931306306306308e-05, "loss": 0.8607, "mean_token_accuracy": 0.8293038636446, "step": 545, "train/kl_loss_qwen": 0.043356449948623775, "train/kl_loss_r1": 0.02318003964610398, "train/total_kl": 0.06653648959472776 }, { "epoch": 0.4128354287858885, "grad_norm": 3.5, "learning_rate": 2.6903153153153154e-05, "loss": 0.8883, "mean_token_accuracy": 0.8272899180650711, "step": 550, "train/kl_loss_qwen": 0.03798080673441291, "train/kl_loss_r1": 0.02549419435672462, "train/total_kl": 0.06347499992698431 }, { "epoch": 0.41658847813848754, "grad_norm": 2.921875, "learning_rate": 2.6875000000000003e-05, "loss": 0.7814, "mean_token_accuracy": 0.8324926406145096, "step": 555, "train/kl_loss_qwen": 0.03234069491736591, "train/kl_loss_r1": 0.017109810281544922, "train/total_kl": 0.049450505338609216 }, { "epoch": 0.4203415274910865, "grad_norm": 3.125, "learning_rate": 2.684684684684685e-05, "loss": 0.8864, "mean_token_accuracy": 0.8263786643743515, "step": 560, "train/kl_loss_qwen": 0.04717784961685538, "train/kl_loss_r1": 0.022931459918618204, "train/total_kl": 0.07010931000113488 }, { "epoch": 0.4240945768436855, "grad_norm": 2.96875, "learning_rate": 2.6818693693693694e-05, "loss": 0.8604, "mean_token_accuracy": 0.8222783863544464, "step": 565, "train/kl_loss_qwen": 0.024484040634706616, "train/kl_loss_r1": 0.015275527024641633, "train/total_kl": 0.03975956765934825 }, { "epoch": 0.42784762619628447, "grad_norm": 3.015625, "learning_rate": 2.6790540540540543e-05, "loss": 0.8469, "mean_token_accuracy": 0.8336408853530883, "step": 570, "train/kl_loss_qwen": 0.033210785733535884, "train/kl_loss_r1": 0.02305849390104413, "train/total_kl": 0.056269279681146145 }, { "epoch": 0.4316006755488835, "grad_norm": 3.03125, "learning_rate": 2.676238738738739e-05, "loss": 0.8368, "mean_token_accuracy": 0.8395666360855103, "step": 575, "train/kl_loss_qwen": 0.03861711327917874, "train/kl_loss_r1": 0.021925621898844838, "train/total_kl": 0.060542735550552604 }, { "epoch": 0.43535372490148244, "grad_norm": 4.21875, "learning_rate": 2.6734234234234238e-05, "loss": 0.9169, "mean_token_accuracy": 0.8193831950426101, "step": 580, "train/kl_loss_qwen": 0.03615025961771608, "train/kl_loss_r1": 0.020520770689472556, "train/total_kl": 0.05667103016749024 }, { "epoch": 0.43910677425408146, "grad_norm": 3.390625, "learning_rate": 2.6706081081081083e-05, "loss": 0.8433, "mean_token_accuracy": 0.8257136255502701, "step": 585, "train/kl_loss_qwen": 0.034600982908159494, "train/kl_loss_r1": 0.01836161450482905, "train/total_kl": 0.052962597087025644 }, { "epoch": 0.4428598236066804, "grad_norm": 4.46875, "learning_rate": 2.667792792792793e-05, "loss": 0.831, "mean_token_accuracy": 0.8363171756267548, "step": 590, "train/kl_loss_qwen": 0.02988515649922192, "train/kl_loss_r1": 0.017817869270220398, "train/total_kl": 0.047703025955706836 }, { "epoch": 0.4466128729592794, "grad_norm": 3.125, "learning_rate": 2.6649774774774778e-05, "loss": 0.8749, "mean_token_accuracy": 0.8290423005819321, "step": 595, "train/kl_loss_qwen": 0.028889529453590513, "train/kl_loss_r1": 0.02102498891763389, "train/total_kl": 0.04991451846435666 }, { "epoch": 0.4503659223118784, "grad_norm": 3.421875, "learning_rate": 2.6621621621621624e-05, "loss": 0.8993, "mean_token_accuracy": 0.8241715729236603, "step": 600, "train/kl_loss_qwen": 0.04158163848333061, "train/kl_loss_r1": 0.021697819139808415, "train/total_kl": 0.06327945673838258 }, { "epoch": 0.4541189716644774, "grad_norm": 3.34375, "learning_rate": 2.659346846846847e-05, "loss": 0.8277, "mean_token_accuracy": 0.8300861209630966, "step": 605, "train/kl_loss_qwen": 0.026456801500171424, "train/kl_loss_r1": 0.01746466476470232, "train/total_kl": 0.0439214657060802 }, { "epoch": 0.45787202101707636, "grad_norm": 2.703125, "learning_rate": 2.656531531531532e-05, "loss": 0.8603, "mean_token_accuracy": 0.831222626566887, "step": 610, "train/kl_loss_qwen": 0.04137272802181542, "train/kl_loss_r1": 0.020235793106257914, "train/total_kl": 0.06160852164030075 }, { "epoch": 0.46162507036967537, "grad_norm": 3.359375, "learning_rate": 2.6537162162162164e-05, "loss": 0.8133, "mean_token_accuracy": 0.8376553744077683, "step": 615, "train/kl_loss_qwen": 0.033105089655146004, "train/kl_loss_r1": 0.020932874642312527, "train/total_kl": 0.05403796397149563 }, { "epoch": 0.46537811972227433, "grad_norm": 2.671875, "learning_rate": 2.650900900900901e-05, "loss": 0.827, "mean_token_accuracy": 0.8355785965919494, "step": 620, "train/kl_loss_qwen": 0.034664105530828236, "train/kl_loss_r1": 0.01959628048352897, "train/total_kl": 0.05426038540899754 }, { "epoch": 0.46913116907487334, "grad_norm": 2.90625, "learning_rate": 2.648085585585586e-05, "loss": 0.8264, "mean_token_accuracy": 0.8406971305608749, "step": 625, "train/kl_loss_qwen": 0.03744598152115941, "train/kl_loss_r1": 0.020712826820090412, "train/total_kl": 0.05815880903974176 }, { "epoch": 0.4728842184274723, "grad_norm": 3.140625, "learning_rate": 2.6452702702702704e-05, "loss": 0.8981, "mean_token_accuracy": 0.8248670309782028, "step": 630, "train/kl_loss_qwen": 0.04424663879908621, "train/kl_loss_r1": 0.02367804222740233, "train/total_kl": 0.06792468149214984 }, { "epoch": 0.4766372677800713, "grad_norm": 3.03125, "learning_rate": 2.642454954954955e-05, "loss": 0.8179, "mean_token_accuracy": 0.8314776927232742, "step": 635, "train/kl_loss_qwen": 0.028519577998667955, "train/kl_loss_r1": 0.015795104345306753, "train/total_kl": 0.04431468164548278 }, { "epoch": 0.4803903171326703, "grad_norm": 2.578125, "learning_rate": 2.63963963963964e-05, "loss": 0.8084, "mean_token_accuracy": 0.8305885761976242, "step": 640, "train/kl_loss_qwen": 0.03188405260443687, "train/kl_loss_r1": 0.019454342126846314, "train/total_kl": 0.0513383949175477 }, { "epoch": 0.4841433664852693, "grad_norm": 2.6875, "learning_rate": 2.6368243243243245e-05, "loss": 0.8135, "mean_token_accuracy": 0.8340533554553986, "step": 645, "train/kl_loss_qwen": 0.032302316091954705, "train/kl_loss_r1": 0.017988856183364987, "train/total_kl": 0.05029117204248905 }, { "epoch": 0.48789641583786825, "grad_norm": 2.84375, "learning_rate": 2.6340090090090094e-05, "loss": 0.8128, "mean_token_accuracy": 0.8344713598489761, "step": 650, "train/kl_loss_qwen": 0.03608106402680278, "train/kl_loss_r1": 0.020161894662305713, "train/total_kl": 0.056242958083748816 }, { "epoch": 0.49164946519046726, "grad_norm": 3.5, "learning_rate": 2.631193693693694e-05, "loss": 0.8303, "mean_token_accuracy": 0.8302734345197678, "step": 655, "train/kl_loss_qwen": 0.0397234917152673, "train/kl_loss_r1": 0.019664824660867452, "train/total_kl": 0.059388316422700885 }, { "epoch": 0.4954025145430662, "grad_norm": 2.375, "learning_rate": 2.6283783783783785e-05, "loss": 0.8792, "mean_token_accuracy": 0.8349238276481629, "step": 660, "train/kl_loss_qwen": 0.04533764449879527, "train/kl_loss_r1": 0.023747803224250675, "train/total_kl": 0.06908544823527336 }, { "epoch": 0.49915556389566523, "grad_norm": 2.5625, "learning_rate": 2.6255630630630634e-05, "loss": 0.8507, "mean_token_accuracy": 0.8313362389802933, "step": 665, "train/kl_loss_qwen": 0.03387423628009856, "train/kl_loss_r1": 0.01939927397761494, "train/total_kl": 0.053273510001599786 }, { "epoch": 0.5029086132482642, "grad_norm": 2.984375, "learning_rate": 2.622747747747748e-05, "loss": 0.812, "mean_token_accuracy": 0.8389832735061645, "step": 670, "train/kl_loss_qwen": 0.039962123753502964, "train/kl_loss_r1": 0.02203605165705085, "train/total_kl": 0.0619981755502522 }, { "epoch": 0.5066616626008632, "grad_norm": 2.625, "learning_rate": 2.6199324324324325e-05, "loss": 0.8327, "mean_token_accuracy": 0.828178471326828, "step": 675, "train/kl_loss_qwen": 0.030491138668730856, "train/kl_loss_r1": 0.0178588742390275, "train/total_kl": 0.048350013047456744 }, { "epoch": 0.5104147119534622, "grad_norm": 3.0625, "learning_rate": 2.6171171171171174e-05, "loss": 0.8645, "mean_token_accuracy": 0.8310636579990387, "step": 680, "train/kl_loss_qwen": 0.040654600923880936, "train/kl_loss_r1": 0.02228041235357523, "train/total_kl": 0.06293501388281583 }, { "epoch": 0.5141677613060611, "grad_norm": 2.875, "learning_rate": 2.614301801801802e-05, "loss": 0.842, "mean_token_accuracy": 0.8304677546024323, "step": 685, "train/kl_loss_qwen": 0.03915594620630145, "train/kl_loss_r1": 0.019675446720793844, "train/total_kl": 0.05883139288052917 }, { "epoch": 0.5179208106586601, "grad_norm": 2.546875, "learning_rate": 2.6114864864864866e-05, "loss": 0.8264, "mean_token_accuracy": 0.8229408442974091, "step": 690, "train/kl_loss_qwen": 0.032891119550913575, "train/kl_loss_r1": 0.01707150642760098, "train/total_kl": 0.04996262574568391 }, { "epoch": 0.5216738600112591, "grad_norm": 3.25, "learning_rate": 2.6086711711711715e-05, "loss": 0.8669, "mean_token_accuracy": 0.8281047195196152, "step": 695, "train/kl_loss_qwen": 0.03547921110875905, "train/kl_loss_r1": 0.02080541094765067, "train/total_kl": 0.05628462266176939 }, { "epoch": 0.5254269093638582, "grad_norm": 3.46875, "learning_rate": 2.605855855855856e-05, "loss": 0.8636, "mean_token_accuracy": 0.8235750675201416, "step": 700, "train/kl_loss_qwen": 0.03132840511389077, "train/kl_loss_r1": 0.01750999097712338, "train/total_kl": 0.04883839599788189 }, { "epoch": 0.5291799587164571, "grad_norm": 2.671875, "learning_rate": 2.6030405405405406e-05, "loss": 0.8581, "mean_token_accuracy": 0.8307362526655198, "step": 705, "train/kl_loss_qwen": 0.03873220053501427, "train/kl_loss_r1": 0.02116750692948699, "train/total_kl": 0.059899707604199645 }, { "epoch": 0.5329330080690561, "grad_norm": 2.875, "learning_rate": 2.6002252252252255e-05, "loss": 0.8222, "mean_token_accuracy": 0.8313774734735488, "step": 710, "train/kl_loss_qwen": 0.031245797453448177, "train/kl_loss_r1": 0.020813510101288558, "train/total_kl": 0.05205930741503835 }, { "epoch": 0.5366860574216551, "grad_norm": 3.265625, "learning_rate": 2.59740990990991e-05, "loss": 0.8942, "mean_token_accuracy": 0.8268726974725723, "step": 715, "train/kl_loss_qwen": 0.047184772603213784, "train/kl_loss_r1": 0.025426519196480514, "train/total_kl": 0.0726112917996943 }, { "epoch": 0.5404391067742541, "grad_norm": 2.84375, "learning_rate": 2.594594594594595e-05, "loss": 0.8544, "mean_token_accuracy": 0.8252176523208619, "step": 720, "train/kl_loss_qwen": 0.02930951355956495, "train/kl_loss_r1": 0.017893961817026138, "train/total_kl": 0.04720347533002496 }, { "epoch": 0.5441921561268531, "grad_norm": 3.328125, "learning_rate": 2.5917792792792795e-05, "loss": 0.8226, "mean_token_accuracy": 0.8322675555944443, "step": 725, "train/kl_loss_qwen": 0.028172259964048863, "train/kl_loss_r1": 0.016258031735196708, "train/total_kl": 0.044430291093885896 }, { "epoch": 0.547945205479452, "grad_norm": 3.515625, "learning_rate": 2.588963963963964e-05, "loss": 0.8439, "mean_token_accuracy": 0.8234845697879791, "step": 730, "train/kl_loss_qwen": 0.03387451712042093, "train/kl_loss_r1": 0.01895874026231468, "train/total_kl": 0.052833257243037224 }, { "epoch": 0.551698254832051, "grad_norm": 2.34375, "learning_rate": 2.586148648648649e-05, "loss": 0.8306, "mean_token_accuracy": 0.8320945203304291, "step": 735, "train/kl_loss_qwen": 0.038065289705991746, "train/kl_loss_r1": 0.02160985255613923, "train/total_kl": 0.059675142634660006 }, { "epoch": 0.55545130418465, "grad_norm": 2.796875, "learning_rate": 2.5833333333333336e-05, "loss": 0.818, "mean_token_accuracy": 0.8301131039857864, "step": 740, "train/kl_loss_qwen": 0.03414399088360369, "train/kl_loss_r1": 0.018777534132823348, "train/total_kl": 0.052921525482088325 }, { "epoch": 0.5592043535372491, "grad_norm": 3.078125, "learning_rate": 2.580518018018018e-05, "loss": 0.8565, "mean_token_accuracy": 0.8275852560997009, "step": 745, "train/kl_loss_qwen": 0.03220190773718059, "train/kl_loss_r1": 0.01762353884987533, "train/total_kl": 0.04982544640079141 }, { "epoch": 0.562957402889848, "grad_norm": 2.484375, "learning_rate": 2.577702702702703e-05, "loss": 0.8718, "mean_token_accuracy": 0.8311895519495011, "step": 750, "train/kl_loss_qwen": 0.03311848752200604, "train/kl_loss_r1": 0.019135183561593293, "train/total_kl": 0.0522536713629961 }, { "epoch": 0.566710452242447, "grad_norm": 2.5625, "learning_rate": 2.5748873873873876e-05, "loss": 0.8634, "mean_token_accuracy": 0.830333125591278, "step": 755, "train/kl_loss_qwen": 0.04198941690847278, "train/kl_loss_r1": 0.021147539000958206, "train/total_kl": 0.06313695563003421 }, { "epoch": 0.570463501595046, "grad_norm": 2.734375, "learning_rate": 2.572072072072072e-05, "loss": 0.84, "mean_token_accuracy": 0.834811520576477, "step": 760, "train/kl_loss_qwen": 0.02746470207348466, "train/kl_loss_r1": 0.019080733275040986, "train/total_kl": 0.04654543492943049 }, { "epoch": 0.574216550947645, "grad_norm": 2.890625, "learning_rate": 2.569256756756757e-05, "loss": 0.8367, "mean_token_accuracy": 0.8293649315834045, "step": 765, "train/kl_loss_qwen": 0.01999104334972799, "train/kl_loss_r1": 0.014198838081210852, "train/total_kl": 0.03418988138437271 }, { "epoch": 0.5779696003002439, "grad_norm": 2.8125, "learning_rate": 2.5664414414414416e-05, "loss": 0.8411, "mean_token_accuracy": 0.8336279571056366, "step": 770, "train/kl_loss_qwen": 0.039404576364904645, "train/kl_loss_r1": 0.021028988901525734, "train/total_kl": 0.06043356563895941 }, { "epoch": 0.5817226496528429, "grad_norm": 2.890625, "learning_rate": 2.5636261261261262e-05, "loss": 0.8445, "mean_token_accuracy": 0.835637891292572, "step": 775, "train/kl_loss_qwen": 0.036282278271391986, "train/kl_loss_r1": 0.02238774998113513, "train/total_kl": 0.05867002848535776 }, { "epoch": 0.5854756990054419, "grad_norm": 8.0625, "learning_rate": 2.560810810810811e-05, "loss": 0.9509, "mean_token_accuracy": 0.8231443852186203, "step": 780, "train/kl_loss_qwen": 0.04694451265968382, "train/kl_loss_r1": 0.03180371643975377, "train/total_kl": 0.07874822989106178 }, { "epoch": 0.589228748358041, "grad_norm": 3.453125, "learning_rate": 2.5579954954954957e-05, "loss": 0.8481, "mean_token_accuracy": 0.8317405015230179, "step": 785, "train/kl_loss_qwen": 0.029904183652251958, "train/kl_loss_r1": 0.019615561049431563, "train/total_kl": 0.04951974479481578 }, { "epoch": 0.5929817977106399, "grad_norm": 2.859375, "learning_rate": 2.5551801801801806e-05, "loss": 0.8042, "mean_token_accuracy": 0.8370792746543885, "step": 790, "train/kl_loss_qwen": 0.028761968202888965, "train/kl_loss_r1": 0.017533178441226482, "train/total_kl": 0.0462951467372477 }, { "epoch": 0.5967348470632389, "grad_norm": 3.78125, "learning_rate": 2.552364864864865e-05, "loss": 0.8447, "mean_token_accuracy": 0.8354480415582657, "step": 795, "train/kl_loss_qwen": 0.03184347827918828, "train/kl_loss_r1": 0.018696364481002092, "train/total_kl": 0.050539842899888755 }, { "epoch": 0.6004878964158379, "grad_norm": 2.453125, "learning_rate": 2.5495495495495497e-05, "loss": 0.8344, "mean_token_accuracy": 0.8341012299060822, "step": 800, "train/kl_loss_qwen": 0.04001581417396664, "train/kl_loss_r1": 0.02106495094485581, "train/total_kl": 0.06108076488599181 }, { "epoch": 0.6042409457684369, "grad_norm": 2.65625, "learning_rate": 2.5467342342342346e-05, "loss": 0.8045, "mean_token_accuracy": 0.8411924570798874, "step": 805, "train/kl_loss_qwen": 0.03035055147483945, "train/kl_loss_r1": 0.01776686739176512, "train/total_kl": 0.04811741886660457 }, { "epoch": 0.6079939951210358, "grad_norm": 2.796875, "learning_rate": 2.543918918918919e-05, "loss": 0.8645, "mean_token_accuracy": 0.8307548046112061, "step": 810, "train/kl_loss_qwen": 0.04272727402858436, "train/kl_loss_r1": 0.024424682604148984, "train/total_kl": 0.06715195653960108 }, { "epoch": 0.6117470444736348, "grad_norm": 2.65625, "learning_rate": 2.5411036036036037e-05, "loss": 0.8425, "mean_token_accuracy": 0.8313584119081497, "step": 815, "train/kl_loss_qwen": 0.0339477127417922, "train/kl_loss_r1": 0.020929417014122008, "train/total_kl": 0.0548771295696497 }, { "epoch": 0.6155000938262338, "grad_norm": 2.953125, "learning_rate": 2.5382882882882886e-05, "loss": 0.8112, "mean_token_accuracy": 0.8362564355134964, "step": 820, "train/kl_loss_qwen": 0.03412885209545493, "train/kl_loss_r1": 0.016538083972409367, "train/total_kl": 0.0506669357419014 }, { "epoch": 0.6192531431788328, "grad_norm": 3.109375, "learning_rate": 2.5354729729729732e-05, "loss": 0.849, "mean_token_accuracy": 0.8359062880277633, "step": 825, "train/kl_loss_qwen": 0.04249853491783142, "train/kl_loss_r1": 0.02333756978623569, "train/total_kl": 0.06583610456436872 }, { "epoch": 0.6230061925314317, "grad_norm": 3.359375, "learning_rate": 2.5326576576576578e-05, "loss": 0.8351, "mean_token_accuracy": 0.825828817486763, "step": 830, "train/kl_loss_qwen": 0.034189414512366054, "train/kl_loss_r1": 0.02052266038954258, "train/total_kl": 0.05471207490190864 }, { "epoch": 0.6267592418840308, "grad_norm": 2.984375, "learning_rate": 2.5298423423423423e-05, "loss": 0.8356, "mean_token_accuracy": 0.8265765368938446, "step": 835, "train/kl_loss_qwen": 0.03163366257213056, "train/kl_loss_r1": 0.016908307839185, "train/total_kl": 0.04854197036474943 }, { "epoch": 0.6305122912366298, "grad_norm": 3.15625, "learning_rate": 2.527027027027027e-05, "loss": 0.8725, "mean_token_accuracy": 0.8330867946147918, "step": 840, "train/kl_loss_qwen": 0.04397285329177976, "train/kl_loss_r1": 0.023652500985190273, "train/total_kl": 0.06762535478919744 }, { "epoch": 0.6342653405892288, "grad_norm": 3.046875, "learning_rate": 2.5242117117117114e-05, "loss": 0.8632, "mean_token_accuracy": 0.832156303524971, "step": 845, "train/kl_loss_qwen": 0.03385147815570235, "train/kl_loss_r1": 0.020532624423503877, "train/total_kl": 0.054384103137999774 }, { "epoch": 0.6380183899418277, "grad_norm": 2.796875, "learning_rate": 2.5213963963963963e-05, "loss": 0.7873, "mean_token_accuracy": 0.8407374769449234, "step": 850, "train/kl_loss_qwen": 0.03273296277038753, "train/kl_loss_r1": 0.020149347372353077, "train/total_kl": 0.05288231000304222 }, { "epoch": 0.6417714392944267, "grad_norm": 3.0625, "learning_rate": 2.518581081081081e-05, "loss": 0.8522, "mean_token_accuracy": 0.8305691838264465, "step": 855, "train/kl_loss_qwen": 0.03824136960320175, "train/kl_loss_r1": 0.021116166748106478, "train/total_kl": 0.05935753621160984 }, { "epoch": 0.6455244886470257, "grad_norm": 2.625, "learning_rate": 2.5157657657657658e-05, "loss": 0.8392, "mean_token_accuracy": 0.8265466034412384, "step": 860, "train/kl_loss_qwen": 0.030321336397901178, "train/kl_loss_r1": 0.01701959897764027, "train/total_kl": 0.047340935561805964 }, { "epoch": 0.6492775379996247, "grad_norm": 2.75, "learning_rate": 2.5129504504504504e-05, "loss": 0.8606, "mean_token_accuracy": 0.83104607462883, "step": 865, "train/kl_loss_qwen": 0.046971744811162355, "train/kl_loss_r1": 0.023864060686901212, "train/total_kl": 0.07083580642938614 }, { "epoch": 0.6530305873522236, "grad_norm": 2.671875, "learning_rate": 2.510135135135135e-05, "loss": 0.8566, "mean_token_accuracy": 0.8245219022035599, "step": 870, "train/kl_loss_qwen": 0.031761659309268, "train/kl_loss_r1": 0.017597190476953982, "train/total_kl": 0.04935885015875101 }, { "epoch": 0.6567836367048226, "grad_norm": 2.796875, "learning_rate": 2.50731981981982e-05, "loss": 0.8165, "mean_token_accuracy": 0.8388794183731079, "step": 875, "train/kl_loss_qwen": 0.03677996243350208, "train/kl_loss_r1": 0.02143030664883554, "train/total_kl": 0.058210269268602136 }, { "epoch": 0.6605366860574217, "grad_norm": 2.9375, "learning_rate": 2.5045045045045044e-05, "loss": 0.8612, "mean_token_accuracy": 0.8207795172929764, "step": 880, "train/kl_loss_qwen": 0.02968251397833228, "train/kl_loss_r1": 0.018946969090029596, "train/total_kl": 0.04862948274239898 }, { "epoch": 0.6642897354100207, "grad_norm": 2.46875, "learning_rate": 2.501689189189189e-05, "loss": 0.8129, "mean_token_accuracy": 0.8363301217556, "step": 885, "train/kl_loss_qwen": 0.034025853127241136, "train/kl_loss_r1": 0.020324263628572224, "train/total_kl": 0.05435011638328433 }, { "epoch": 0.6680427847626196, "grad_norm": 2.421875, "learning_rate": 2.498873873873874e-05, "loss": 0.8294, "mean_token_accuracy": 0.8286441206932068, "step": 890, "train/kl_loss_qwen": 0.0408441049978137, "train/kl_loss_r1": 0.020420510414987804, "train/total_kl": 0.06126461513340473 }, { "epoch": 0.6717958341152186, "grad_norm": 2.9375, "learning_rate": 2.4960585585585584e-05, "loss": 0.859, "mean_token_accuracy": 0.8298782587051392, "step": 895, "train/kl_loss_qwen": 0.0418569162953645, "train/kl_loss_r1": 0.022290918650105594, "train/total_kl": 0.06414783513173461 }, { "epoch": 0.6755488834678176, "grad_norm": 2.5, "learning_rate": 2.493243243243243e-05, "loss": 0.8358, "mean_token_accuracy": 0.8332624316215516, "step": 900, "train/kl_loss_qwen": 0.03841094318777323, "train/kl_loss_r1": 0.01995689212344587, "train/total_kl": 0.05836783479899168 }, { "epoch": 0.6793019328204166, "grad_norm": 2.921875, "learning_rate": 2.490427927927928e-05, "loss": 0.8765, "mean_token_accuracy": 0.8321707814931869, "step": 905, "train/kl_loss_qwen": 0.042780818743631245, "train/kl_loss_r1": 0.0235706131439656, "train/total_kl": 0.0663514317944646 }, { "epoch": 0.6830549821730155, "grad_norm": 3.265625, "learning_rate": 2.4876126126126125e-05, "loss": 0.8608, "mean_token_accuracy": 0.8260697066783905, "step": 910, "train/kl_loss_qwen": 0.035260281944647434, "train/kl_loss_r1": 0.02195748295634985, "train/total_kl": 0.057217765040695666 }, { "epoch": 0.6868080315256145, "grad_norm": 2.28125, "learning_rate": 2.4847972972972974e-05, "loss": 0.8564, "mean_token_accuracy": 0.8374003231525421, "step": 915, "train/kl_loss_qwen": 0.04203944210894406, "train/kl_loss_r1": 0.021511876583099367, "train/total_kl": 0.06355131939053535 }, { "epoch": 0.6905610808782136, "grad_norm": 2.671875, "learning_rate": 2.481981981981982e-05, "loss": 0.8458, "mean_token_accuracy": 0.8365840703248978, "step": 920, "train/kl_loss_qwen": 0.033759749541059134, "train/kl_loss_r1": 0.0183026185259223, "train/total_kl": 0.05206236876547336 }, { "epoch": 0.6943141302308126, "grad_norm": 2.921875, "learning_rate": 2.4791666666666665e-05, "loss": 0.8577, "mean_token_accuracy": 0.8311419934034348, "step": 925, "train/kl_loss_qwen": 0.03777771787717939, "train/kl_loss_r1": 0.022124431701377033, "train/total_kl": 0.05990214953199029 }, { "epoch": 0.6980671795834115, "grad_norm": 2.90625, "learning_rate": 2.4763513513513514e-05, "loss": 0.838, "mean_token_accuracy": 0.8319983184337616, "step": 930, "train/kl_loss_qwen": 0.037792898062616584, "train/kl_loss_r1": 0.019103457499295474, "train/total_kl": 0.05689635518938303 }, { "epoch": 0.7018202289360105, "grad_norm": 2.46875, "learning_rate": 2.473536036036036e-05, "loss": 0.8416, "mean_token_accuracy": 0.8315385311841965, "step": 935, "train/kl_loss_qwen": 0.03756746407598257, "train/kl_loss_r1": 0.020071876328438522, "train/total_kl": 0.05763934040442109 }, { "epoch": 0.7055732782886095, "grad_norm": 2.796875, "learning_rate": 2.4707207207207205e-05, "loss": 0.8105, "mean_token_accuracy": 0.831657874584198, "step": 940, "train/kl_loss_qwen": 0.03483249330893159, "train/kl_loss_r1": 0.019865864235907794, "train/total_kl": 0.05469835819676518 }, { "epoch": 0.7093263276412085, "grad_norm": 2.359375, "learning_rate": 2.4679054054054054e-05, "loss": 0.8679, "mean_token_accuracy": 0.8223243087530137, "step": 945, "train/kl_loss_qwen": 0.030808620806783437, "train/kl_loss_r1": 0.01705012475140393, "train/total_kl": 0.04785874532535672 }, { "epoch": 0.7130793769938075, "grad_norm": 2.890625, "learning_rate": 2.46509009009009e-05, "loss": 0.844, "mean_token_accuracy": 0.8352172911167145, "step": 950, "train/kl_loss_qwen": 0.03471320560202003, "train/kl_loss_r1": 0.020137345883995295, "train/total_kl": 0.05485055195167661 }, { "epoch": 0.7168324263464064, "grad_norm": 3.546875, "learning_rate": 2.4622747747747746e-05, "loss": 0.8499, "mean_token_accuracy": 0.8335436582565308, "step": 955, "train/kl_loss_qwen": 0.02975294659845531, "train/kl_loss_r1": 0.019273100467398763, "train/total_kl": 0.04902604753151536 }, { "epoch": 0.7205854756990054, "grad_norm": 2.46875, "learning_rate": 2.4594594594594595e-05, "loss": 0.8223, "mean_token_accuracy": 0.8394654095172882, "step": 960, "train/kl_loss_qwen": 0.03072880543768406, "train/kl_loss_r1": 0.016514184465631843, "train/total_kl": 0.047242989577353 }, { "epoch": 0.7243385250516045, "grad_norm": 3.625, "learning_rate": 2.456644144144144e-05, "loss": 0.8504, "mean_token_accuracy": 0.8266110628843307, "step": 965, "train/kl_loss_qwen": 0.03343938612379134, "train/kl_loss_r1": 0.01883910335600376, "train/total_kl": 0.05227848952636123 }, { "epoch": 0.7280915744042035, "grad_norm": 3.328125, "learning_rate": 2.4538288288288286e-05, "loss": 0.8445, "mean_token_accuracy": 0.8287754565477371, "step": 970, "train/kl_loss_qwen": 0.025892229238525032, "train/kl_loss_r1": 0.015870556328445674, "train/total_kl": 0.041762785613536836 }, { "epoch": 0.7318446237568024, "grad_norm": 2.8125, "learning_rate": 2.4510135135135135e-05, "loss": 0.8087, "mean_token_accuracy": 0.8377816379070282, "step": 975, "train/kl_loss_qwen": 0.03318580673076212, "train/kl_loss_r1": 0.01917458134703338, "train/total_kl": 0.052360388170927766 }, { "epoch": 0.7355976731094014, "grad_norm": 3.453125, "learning_rate": 2.448198198198198e-05, "loss": 0.8186, "mean_token_accuracy": 0.8333919525146485, "step": 980, "train/kl_loss_qwen": 0.029704937431961297, "train/kl_loss_r1": 0.018210208415985106, "train/total_kl": 0.04791514603421092 }, { "epoch": 0.7393507224620004, "grad_norm": 2.984375, "learning_rate": 2.445382882882883e-05, "loss": 0.8441, "mean_token_accuracy": 0.8327240943908691, "step": 985, "train/kl_loss_qwen": 0.030404440499842166, "train/kl_loss_r1": 0.01756331170909107, "train/total_kl": 0.047967752907425165 }, { "epoch": 0.7431037718145994, "grad_norm": 3.25, "learning_rate": 2.4425675675675675e-05, "loss": 0.8662, "mean_token_accuracy": 0.8255359560251236, "step": 990, "train/kl_loss_qwen": 0.03720358600839972, "train/kl_loss_r1": 0.019459961261600257, "train/total_kl": 0.056663547083735465 }, { "epoch": 0.7468568211671983, "grad_norm": 3.234375, "learning_rate": 2.439752252252252e-05, "loss": 0.8429, "mean_token_accuracy": 0.8323214411735534, "step": 995, "train/kl_loss_qwen": 0.022656460804864765, "train/kl_loss_r1": 0.01588835148140788, "train/total_kl": 0.038544812332838775 }, { "epoch": 0.7506098705197973, "grad_norm": 3.0, "learning_rate": 2.436936936936937e-05, "loss": 0.8559, "mean_token_accuracy": 0.8274749606847763, "step": 1000, "train/kl_loss_qwen": 0.03031270541250706, "train/kl_loss_r1": 0.019612214388325812, "train/total_kl": 0.04992491947486997 }, { "epoch": 0.7543629198723963, "grad_norm": 2.875, "learning_rate": 2.4341216216216216e-05, "loss": 0.8627, "mean_token_accuracy": 0.8257625371217727, "step": 1005, "train/kl_loss_qwen": 0.030585462925955653, "train/kl_loss_r1": 0.018655626522377133, "train/total_kl": 0.04924108954146504 }, { "epoch": 0.7581159692249954, "grad_norm": 3.421875, "learning_rate": 2.431306306306306e-05, "loss": 0.8738, "mean_token_accuracy": 0.8295246571302414, "step": 1010, "train/kl_loss_qwen": 0.03918474782258272, "train/kl_loss_r1": 0.02318054302595556, "train/total_kl": 0.062365290429443124 }, { "epoch": 0.7618690185775943, "grad_norm": 2.609375, "learning_rate": 2.428490990990991e-05, "loss": 0.8584, "mean_token_accuracy": 0.8317355692386628, "step": 1015, "train/kl_loss_qwen": 0.04374503931030631, "train/kl_loss_r1": 0.02465776102617383, "train/total_kl": 0.0684028010815382 }, { "epoch": 0.7656220679301933, "grad_norm": 3.09375, "learning_rate": 2.4256756756756756e-05, "loss": 0.8392, "mean_token_accuracy": 0.8248521685600281, "step": 1020, "train/kl_loss_qwen": 0.036725143622606995, "train/kl_loss_r1": 0.019347941782325507, "train/total_kl": 0.05607308465987444 }, { "epoch": 0.7693751172827923, "grad_norm": 2.859375, "learning_rate": 2.42286036036036e-05, "loss": 0.8539, "mean_token_accuracy": 0.8296713292598724, "step": 1025, "train/kl_loss_qwen": 0.04443691144697368, "train/kl_loss_r1": 0.02307268031872809, "train/total_kl": 0.06750959167256951 }, { "epoch": 0.7731281666353913, "grad_norm": 3.3125, "learning_rate": 2.420045045045045e-05, "loss": 0.871, "mean_token_accuracy": 0.8165527641773224, "step": 1030, "train/kl_loss_qwen": 0.03339883806183934, "train/kl_loss_r1": 0.019999321456998585, "train/total_kl": 0.05339815989136696 }, { "epoch": 0.7768812159879902, "grad_norm": 2.453125, "learning_rate": 2.4172297297297296e-05, "loss": 0.8847, "mean_token_accuracy": 0.8283389657735825, "step": 1035, "train/kl_loss_qwen": 0.04716655816882849, "train/kl_loss_r1": 0.029009951883926986, "train/total_kl": 0.0761765105649829 }, { "epoch": 0.7806342653405892, "grad_norm": 2.90625, "learning_rate": 2.4144144144144142e-05, "loss": 0.8694, "mean_token_accuracy": 0.8296161741018295, "step": 1040, "train/kl_loss_qwen": 0.03973756255581975, "train/kl_loss_r1": 0.024160212790593504, "train/total_kl": 0.06389777567237616 }, { "epoch": 0.7843873146931882, "grad_norm": 2.921875, "learning_rate": 2.411599099099099e-05, "loss": 0.8216, "mean_token_accuracy": 0.8333493113517761, "step": 1045, "train/kl_loss_qwen": 0.03772520553320646, "train/kl_loss_r1": 0.02065104469656944, "train/total_kl": 0.058376249857246876 }, { "epoch": 0.7881403640457872, "grad_norm": 2.453125, "learning_rate": 2.4087837837837837e-05, "loss": 0.8294, "mean_token_accuracy": 0.8262384831905365, "step": 1050, "train/kl_loss_qwen": 0.02664393503218889, "train/kl_loss_r1": 0.015917970752343535, "train/total_kl": 0.042561905831098555 }, { "epoch": 0.7918934133983861, "grad_norm": 3.296875, "learning_rate": 2.4059684684684686e-05, "loss": 0.8482, "mean_token_accuracy": 0.8259186387062073, "step": 1055, "train/kl_loss_qwen": 0.03414301257580519, "train/kl_loss_r1": 0.017920766165480016, "train/total_kl": 0.05206377934664488 }, { "epoch": 0.7956464627509852, "grad_norm": 2.671875, "learning_rate": 2.403153153153153e-05, "loss": 0.8289, "mean_token_accuracy": 0.838726419210434, "step": 1060, "train/kl_loss_qwen": 0.03791197570972145, "train/kl_loss_r1": 0.021482381178066133, "train/total_kl": 0.05939435651525855 }, { "epoch": 0.7993995121035842, "grad_norm": 3.171875, "learning_rate": 2.4003378378378377e-05, "loss": 0.8884, "mean_token_accuracy": 0.8271274447441102, "step": 1065, "train/kl_loss_qwen": 0.03056891239248216, "train/kl_loss_r1": 0.01911116614937782, "train/total_kl": 0.04968007821589708 }, { "epoch": 0.8031525614561832, "grad_norm": 2.921875, "learning_rate": 2.3975225225225226e-05, "loss": 0.8351, "mean_token_accuracy": 0.8275138199329376, "step": 1070, "train/kl_loss_qwen": 0.035620299214497206, "train/kl_loss_r1": 0.021603919705376028, "train/total_kl": 0.05722421947866678 }, { "epoch": 0.8069056108087821, "grad_norm": 3.03125, "learning_rate": 2.394707207207207e-05, "loss": 0.8298, "mean_token_accuracy": 0.8347616285085678, "step": 1075, "train/kl_loss_qwen": 0.031926875654608014, "train/kl_loss_r1": 0.016605067253112792, "train/total_kl": 0.04853194262832403 }, { "epoch": 0.8106586601613811, "grad_norm": 2.359375, "learning_rate": 2.3918918918918917e-05, "loss": 0.8397, "mean_token_accuracy": 0.8279544532299041, "step": 1080, "train/kl_loss_qwen": 0.04034261181950569, "train/kl_loss_r1": 0.02037807977758348, "train/total_kl": 0.060720691550523044 }, { "epoch": 0.8144117095139801, "grad_norm": 2.3125, "learning_rate": 2.3890765765765766e-05, "loss": 0.8468, "mean_token_accuracy": 0.8316547304391861, "step": 1085, "train/kl_loss_qwen": 0.03774885032325983, "train/kl_loss_r1": 0.02168757957406342, "train/total_kl": 0.05943643022328615 }, { "epoch": 0.8181647588665791, "grad_norm": 2.703125, "learning_rate": 2.3862612612612612e-05, "loss": 0.8521, "mean_token_accuracy": 0.8355390518903733, "step": 1090, "train/kl_loss_qwen": 0.04074263079091907, "train/kl_loss_r1": 0.026646536123007537, "train/total_kl": 0.06738916672766208 }, { "epoch": 0.821917808219178, "grad_norm": 2.515625, "learning_rate": 2.3834459459459458e-05, "loss": 0.8081, "mean_token_accuracy": 0.8374006003141403, "step": 1095, "train/kl_loss_qwen": 0.039536877814680335, "train/kl_loss_r1": 0.020507675549015402, "train/total_kl": 0.06004455294460058 }, { "epoch": 0.825670857571777, "grad_norm": 2.75, "learning_rate": 2.3806306306306307e-05, "loss": 0.8105, "mean_token_accuracy": 0.8264969110488891, "step": 1100, "train/kl_loss_qwen": 0.02953154994174838, "train/kl_loss_r1": 0.01727639720775187, "train/total_kl": 0.04680794747546315 }, { "epoch": 0.8294239069243761, "grad_norm": 2.65625, "learning_rate": 2.3778153153153152e-05, "loss": 0.8292, "mean_token_accuracy": 0.8362700045108795, "step": 1105, "train/kl_loss_qwen": 0.03479915303178131, "train/kl_loss_r1": 0.019686942035332323, "train/total_kl": 0.05448609506711364 }, { "epoch": 0.8331769562769751, "grad_norm": 2.328125, "learning_rate": 2.3749999999999998e-05, "loss": 0.837, "mean_token_accuracy": 0.8312906265258789, "step": 1110, "train/kl_loss_qwen": 0.03711622627452016, "train/kl_loss_r1": 0.018471188424155117, "train/total_kl": 0.05558741446584463 }, { "epoch": 0.836930005629574, "grad_norm": 3.078125, "learning_rate": 2.3721846846846847e-05, "loss": 0.8358, "mean_token_accuracy": 0.8428857564926148, "step": 1115, "train/kl_loss_qwen": 0.03528237966820598, "train/kl_loss_r1": 0.022303265007212757, "train/total_kl": 0.057585643604397774 }, { "epoch": 0.840683054982173, "grad_norm": 2.59375, "learning_rate": 2.3693693693693693e-05, "loss": 0.8258, "mean_token_accuracy": 0.8349006563425064, "step": 1120, "train/kl_loss_qwen": 0.029668423300608992, "train/kl_loss_r1": 0.01802798630669713, "train/total_kl": 0.04769640956073999 }, { "epoch": 0.844436104334772, "grad_norm": 2.546875, "learning_rate": 2.366554054054054e-05, "loss": 0.7961, "mean_token_accuracy": 0.8291519403457641, "step": 1125, "train/kl_loss_qwen": 0.027171618398278953, "train/kl_loss_r1": 0.015590772125869989, "train/total_kl": 0.042762390524148944 }, { "epoch": 0.848189153687371, "grad_norm": 3.0, "learning_rate": 2.3637387387387387e-05, "loss": 0.852, "mean_token_accuracy": 0.830912035703659, "step": 1130, "train/kl_loss_qwen": 0.04168254970572889, "train/kl_loss_r1": 0.0218337316531688, "train/total_kl": 0.0635162808932364 }, { "epoch": 0.8519422030399699, "grad_norm": 2.75, "learning_rate": 2.3609234234234233e-05, "loss": 0.834, "mean_token_accuracy": 0.8422968804836273, "step": 1135, "train/kl_loss_qwen": 0.042828111443668604, "train/kl_loss_r1": 0.02287350078113377, "train/total_kl": 0.06570161217823625 }, { "epoch": 0.8556952523925689, "grad_norm": 2.390625, "learning_rate": 2.3581081081081082e-05, "loss": 0.8122, "mean_token_accuracy": 0.8383320599794388, "step": 1140, "train/kl_loss_qwen": 0.03400104306638241, "train/kl_loss_r1": 0.01821983396075666, "train/total_kl": 0.052220877725631 }, { "epoch": 0.859448301745168, "grad_norm": 3.125, "learning_rate": 2.3552927927927928e-05, "loss": 0.8689, "mean_token_accuracy": 0.8325030654668808, "step": 1145, "train/kl_loss_qwen": 0.03720735446549952, "train/kl_loss_r1": 0.02309025633148849, "train/total_kl": 0.06029761079698801 }, { "epoch": 0.863201351097767, "grad_norm": 2.75, "learning_rate": 2.3524774774774773e-05, "loss": 0.8117, "mean_token_accuracy": 0.8363292634487152, "step": 1150, "train/kl_loss_qwen": 0.027145140524953603, "train/kl_loss_r1": 0.0179155798163265, "train/total_kl": 0.045060720574110744 }, { "epoch": 0.8669544004503659, "grad_norm": 2.484375, "learning_rate": 2.3496621621621622e-05, "loss": 0.8169, "mean_token_accuracy": 0.82942895591259, "step": 1155, "train/kl_loss_qwen": 0.035767897684127095, "train/kl_loss_r1": 0.018540003104135394, "train/total_kl": 0.05430790157988667 }, { "epoch": 0.8707074498029649, "grad_norm": 3.28125, "learning_rate": 2.3468468468468468e-05, "loss": 0.8544, "mean_token_accuracy": 0.8344474166631699, "step": 1160, "train/kl_loss_qwen": 0.02330155437812209, "train/kl_loss_r1": 0.01555751208215952, "train/total_kl": 0.03885906646028161 }, { "epoch": 0.8744604991555639, "grad_norm": 2.96875, "learning_rate": 2.3440315315315314e-05, "loss": 0.8497, "mean_token_accuracy": 0.8371790736913681, "step": 1165, "train/kl_loss_qwen": 0.0372356269042939, "train/kl_loss_r1": 0.021653581224381924, "train/total_kl": 0.05888920854777098 }, { "epoch": 0.8782135485081629, "grad_norm": 2.875, "learning_rate": 2.3412162162162163e-05, "loss": 0.8466, "mean_token_accuracy": 0.8342229664325714, "step": 1170, "train/kl_loss_qwen": 0.03358095684088767, "train/kl_loss_r1": 0.020644054701551794, "train/total_kl": 0.05422501126304269 }, { "epoch": 0.8819665978607618, "grad_norm": 2.828125, "learning_rate": 2.3384009009009008e-05, "loss": 0.8188, "mean_token_accuracy": 0.8325002133846283, "step": 1175, "train/kl_loss_qwen": 0.03786291694268584, "train/kl_loss_r1": 0.02114827521145344, "train/total_kl": 0.059011191688477994 }, { "epoch": 0.8857196472133608, "grad_norm": 4.125, "learning_rate": 2.3355855855855854e-05, "loss": 0.8304, "mean_token_accuracy": 0.841512930393219, "step": 1180, "train/kl_loss_qwen": 0.0327130098361522, "train/kl_loss_r1": 0.02275611348450184, "train/total_kl": 0.055469123367220166 }, { "epoch": 0.8894726965659598, "grad_norm": 2.96875, "learning_rate": 2.3327702702702703e-05, "loss": 0.8149, "mean_token_accuracy": 0.8311474174261093, "step": 1185, "train/kl_loss_qwen": 0.03829748397693038, "train/kl_loss_r1": 0.019338054629042745, "train/total_kl": 0.057635538000613454 }, { "epoch": 0.8932257459185589, "grad_norm": 2.78125, "learning_rate": 2.329954954954955e-05, "loss": 0.8207, "mean_token_accuracy": 0.8371186286211014, "step": 1190, "train/kl_loss_qwen": 0.028101760940626264, "train/kl_loss_r1": 0.018852828070521355, "train/total_kl": 0.04695458877831697 }, { "epoch": 0.8969787952711579, "grad_norm": 3.15625, "learning_rate": 2.3271396396396398e-05, "loss": 0.8371, "mean_token_accuracy": 0.8242538809776306, "step": 1195, "train/kl_loss_qwen": 0.029373879032209515, "train/kl_loss_r1": 0.01833240082487464, "train/total_kl": 0.047706279531121255 }, { "epoch": 0.9007318446237568, "grad_norm": 2.9375, "learning_rate": 2.3243243243243243e-05, "loss": 0.8312, "mean_token_accuracy": 0.8366263926029205, "step": 1200, "train/kl_loss_qwen": 0.03641695664264262, "train/kl_loss_r1": 0.02135463636368513, "train/total_kl": 0.0577715927734971 }, { "epoch": 0.9044848939763558, "grad_norm": 2.5625, "learning_rate": 2.321509009009009e-05, "loss": 0.8032, "mean_token_accuracy": 0.8358108222484588, "step": 1205, "train/kl_loss_qwen": 0.0320419798605144, "train/kl_loss_r1": 0.01758174179121852, "train/total_kl": 0.04962372137233615 }, { "epoch": 0.9082379433289548, "grad_norm": 3.59375, "learning_rate": 2.3186936936936938e-05, "loss": 0.7973, "mean_token_accuracy": 0.8385109961032867, "step": 1210, "train/kl_loss_qwen": 0.03202076843008399, "train/kl_loss_r1": 0.01798680922947824, "train/total_kl": 0.050007577519863844 }, { "epoch": 0.9119909926815538, "grad_norm": 2.578125, "learning_rate": 2.3158783783783784e-05, "loss": 0.8757, "mean_token_accuracy": 0.8319016844034195, "step": 1215, "train/kl_loss_qwen": 0.04137561381794512, "train/kl_loss_r1": 0.023255357798188925, "train/total_kl": 0.06463097166270018 }, { "epoch": 0.9157440420341527, "grad_norm": 2.828125, "learning_rate": 2.313063063063063e-05, "loss": 0.8132, "mean_token_accuracy": 0.8328036278486252, "step": 1220, "train/kl_loss_qwen": 0.031224201945587993, "train/kl_loss_r1": 0.017740114778280257, "train/total_kl": 0.048964316584169866 }, { "epoch": 0.9194970913867517, "grad_norm": 2.875, "learning_rate": 2.3102477477477478e-05, "loss": 0.8452, "mean_token_accuracy": 0.8222734242677688, "step": 1225, "train/kl_loss_qwen": 0.03589702369645238, "train/kl_loss_r1": 0.020375803485512732, "train/total_kl": 0.056272826995700596 }, { "epoch": 0.9232501407393507, "grad_norm": 2.65625, "learning_rate": 2.3074324324324324e-05, "loss": 0.7888, "mean_token_accuracy": 0.8423387587070466, "step": 1230, "train/kl_loss_qwen": 0.03705872604623437, "train/kl_loss_r1": 0.019338483829051255, "train/total_kl": 0.056397209968417884 }, { "epoch": 0.9270031900919498, "grad_norm": 3.3125, "learning_rate": 2.304617117117117e-05, "loss": 0.8411, "mean_token_accuracy": 0.8356304496526719, "step": 1235, "train/kl_loss_qwen": 0.03986716889776289, "train/kl_loss_r1": 0.02119326703250408, "train/total_kl": 0.06106043700128794 }, { "epoch": 0.9307562394445487, "grad_norm": 3.046875, "learning_rate": 2.301801801801802e-05, "loss": 0.8016, "mean_token_accuracy": 0.8259847193956376, "step": 1240, "train/kl_loss_qwen": 0.027377781691029668, "train/kl_loss_r1": 0.01647510756738484, "train/total_kl": 0.04385288907214999 }, { "epoch": 0.9345092887971477, "grad_norm": 2.8125, "learning_rate": 2.2989864864864864e-05, "loss": 0.8702, "mean_token_accuracy": 0.8325085520744324, "step": 1245, "train/kl_loss_qwen": 0.05099722160957754, "train/kl_loss_r1": 0.02356436108238995, "train/total_kl": 0.07456158371642232 }, { "epoch": 0.9382623381497467, "grad_norm": 3.25, "learning_rate": 2.296171171171171e-05, "loss": 0.8179, "mean_token_accuracy": 0.8388288825750351, "step": 1250, "train/kl_loss_qwen": 0.03349912976846099, "train/kl_loss_r1": 0.01905625034123659, "train/total_kl": 0.052555380016565324 }, { "epoch": 0.9420153875023457, "grad_norm": 3.21875, "learning_rate": 2.293355855855856e-05, "loss": 0.8161, "mean_token_accuracy": 0.8253986924886704, "step": 1255, "train/kl_loss_qwen": 0.024113674974069, "train/kl_loss_r1": 0.013607281818985939, "train/total_kl": 0.03772095674648881 }, { "epoch": 0.9457684368549446, "grad_norm": 2.703125, "learning_rate": 2.2905405405405404e-05, "loss": 0.8313, "mean_token_accuracy": 0.8335436224937439, "step": 1260, "train/kl_loss_qwen": 0.03843146739527583, "train/kl_loss_r1": 0.02215869203209877, "train/total_kl": 0.060590160079300404 }, { "epoch": 0.9495214862075436, "grad_norm": 2.828125, "learning_rate": 2.2877252252252254e-05, "loss": 0.8403, "mean_token_accuracy": 0.8326504826545715, "step": 1265, "train/kl_loss_qwen": 0.03150986786931753, "train/kl_loss_r1": 0.01924733123742044, "train/total_kl": 0.05075719943270087 }, { "epoch": 0.9532745355601426, "grad_norm": 2.921875, "learning_rate": 2.28490990990991e-05, "loss": 0.8271, "mean_token_accuracy": 0.8375171661376953, "step": 1270, "train/kl_loss_qwen": 0.030000514769926667, "train/kl_loss_r1": 0.018503088131546976, "train/total_kl": 0.048503602668642995 }, { "epoch": 0.9570275849127416, "grad_norm": 3.0625, "learning_rate": 2.2820945945945945e-05, "loss": 0.8126, "mean_token_accuracy": 0.8422433704137802, "step": 1275, "train/kl_loss_qwen": 0.03523530634120107, "train/kl_loss_r1": 0.02015956537798047, "train/total_kl": 0.0553948718123138 }, { "epoch": 0.9607806342653405, "grad_norm": 3.0, "learning_rate": 2.2792792792792794e-05, "loss": 0.8471, "mean_token_accuracy": 0.8248061776161194, "step": 1280, "train/kl_loss_qwen": 0.03546197758987546, "train/kl_loss_r1": 0.02050988646224141, "train/total_kl": 0.05597186395898461 }, { "epoch": 0.9645336836179396, "grad_norm": 2.453125, "learning_rate": 2.276463963963964e-05, "loss": 0.8506, "mean_token_accuracy": 0.830131858587265, "step": 1285, "train/kl_loss_qwen": 0.03869068971835077, "train/kl_loss_r1": 0.021196600608527662, "train/total_kl": 0.05988728990778327 }, { "epoch": 0.9682867329705386, "grad_norm": 2.796875, "learning_rate": 2.2736486486486485e-05, "loss": 0.8122, "mean_token_accuracy": 0.8425075203180313, "step": 1290, "train/kl_loss_qwen": 0.03583333105780184, "train/kl_loss_r1": 0.019750054739415646, "train/total_kl": 0.055583386402577165 }, { "epoch": 0.9720397823231376, "grad_norm": 2.40625, "learning_rate": 2.2708333333333334e-05, "loss": 0.8526, "mean_token_accuracy": 0.8319555759429932, "step": 1295, "train/kl_loss_qwen": 0.03495143475010991, "train/kl_loss_r1": 0.019579170271754265, "train/total_kl": 0.05453060502186417 }, { "epoch": 0.9757928316757365, "grad_norm": 2.5, "learning_rate": 2.268018018018018e-05, "loss": 0.83, "mean_token_accuracy": 0.8411010265350342, "step": 1300, "train/kl_loss_qwen": 0.029418424377217887, "train/kl_loss_r1": 0.017907896358519793, "train/total_kl": 0.047326320223510264 }, { "epoch": 0.9795458810283355, "grad_norm": 3.046875, "learning_rate": 2.2652027027027025e-05, "loss": 0.8317, "mean_token_accuracy": 0.8266431212425231, "step": 1305, "train/kl_loss_qwen": 0.03617473733611405, "train/kl_loss_r1": 0.0198312777094543, "train/total_kl": 0.056006014347076416 }, { "epoch": 0.9832989303809345, "grad_norm": 2.734375, "learning_rate": 2.2623873873873874e-05, "loss": 0.8109, "mean_token_accuracy": 0.8358199536800385, "step": 1310, "train/kl_loss_qwen": 0.03416325659491122, "train/kl_loss_r1": 0.018369485950097443, "train/total_kl": 0.05253274226561189 }, { "epoch": 0.9870519797335335, "grad_norm": 3.09375, "learning_rate": 2.259572072072072e-05, "loss": 0.8502, "mean_token_accuracy": 0.8319712281227112, "step": 1315, "train/kl_loss_qwen": 0.03371428037062287, "train/kl_loss_r1": 0.019540566531941295, "train/total_kl": 0.0532548469491303 }, { "epoch": 0.9908050290861324, "grad_norm": 2.953125, "learning_rate": 2.2567567567567566e-05, "loss": 0.826, "mean_token_accuracy": 0.8343572169542313, "step": 1320, "train/kl_loss_qwen": 0.034188579255715015, "train/kl_loss_r1": 0.019030718505382536, "train/total_kl": 0.05321929762139917 }, { "epoch": 0.9945580784387315, "grad_norm": 3.46875, "learning_rate": 2.2539414414414415e-05, "loss": 0.8328, "mean_token_accuracy": 0.831291139125824, "step": 1325, "train/kl_loss_qwen": 0.024976221797987818, "train/kl_loss_r1": 0.015955081582069396, "train/total_kl": 0.04093130342662334 }, { "epoch": 0.9983111277913305, "grad_norm": 2.890625, "learning_rate": 2.251126126126126e-05, "loss": 0.8427, "mean_token_accuracy": 0.8302747309207916, "step": 1330, "train/kl_loss_qwen": 0.03359804740175605, "train/kl_loss_r1": 0.02121321321465075, "train/total_kl": 0.05481126047670841 }, { "epoch": 1.0015012197410396, "grad_norm": 2.703125, "learning_rate": 2.248310810810811e-05, "loss": 0.7675, "mean_token_accuracy": 0.8538059802616343, "step": 1335, "train/kl_loss_qwen": 0.0453791821594624, "train/kl_loss_r1": 0.02448737363824073, "train/total_kl": 0.06986655568813577 }, { "epoch": 1.0052542690936386, "grad_norm": 2.71875, "learning_rate": 2.2454954954954955e-05, "loss": 0.6612, "mean_token_accuracy": 0.8875813186168671, "step": 1340, "train/kl_loss_qwen": 0.02925686431117356, "train/kl_loss_r1": 0.019410110637545587, "train/total_kl": 0.04866697527468204 }, { "epoch": 1.0090073184462376, "grad_norm": 2.375, "learning_rate": 2.24268018018018e-05, "loss": 0.6622, "mean_token_accuracy": 0.8967875897884369, "step": 1345, "train/kl_loss_qwen": 0.04325410588644445, "train/kl_loss_r1": 0.0244607200846076, "train/total_kl": 0.0677148257382214 }, { "epoch": 1.0127603677988366, "grad_norm": 2.640625, "learning_rate": 2.239864864864865e-05, "loss": 0.6685, "mean_token_accuracy": 0.8972615629434586, "step": 1350, "train/kl_loss_qwen": 0.041626747231930494, "train/kl_loss_r1": 0.025661862408742308, "train/total_kl": 0.06728860987350345 }, { "epoch": 1.0165134171514356, "grad_norm": 2.53125, "learning_rate": 2.2370495495495495e-05, "loss": 0.6689, "mean_token_accuracy": 0.8906102359294892, "step": 1355, "train/kl_loss_qwen": 0.030312799476087095, "train/kl_loss_r1": 0.020159751269966365, "train/total_kl": 0.0504725506529212 }, { "epoch": 1.0202664665040346, "grad_norm": 2.890625, "learning_rate": 2.234234234234234e-05, "loss": 0.6708, "mean_token_accuracy": 0.8942165911197663, "step": 1360, "train/kl_loss_qwen": 0.034392226580530406, "train/kl_loss_r1": 0.023348680092021824, "train/total_kl": 0.0577409066259861 }, { "epoch": 1.0240195158566334, "grad_norm": 2.703125, "learning_rate": 2.231418918918919e-05, "loss": 0.7386, "mean_token_accuracy": 0.8926682651042939, "step": 1365, "train/kl_loss_qwen": 0.0506584744900465, "train/kl_loss_r1": 0.02938733692280948, "train/total_kl": 0.08004581211134791 }, { "epoch": 1.0277725652092324, "grad_norm": 2.1875, "learning_rate": 2.2286036036036036e-05, "loss": 0.6889, "mean_token_accuracy": 0.8908026158809662, "step": 1370, "train/kl_loss_qwen": 0.03609044030308724, "train/kl_loss_r1": 0.0206457391846925, "train/total_kl": 0.056736179534345864 }, { "epoch": 1.0315256145618314, "grad_norm": 2.546875, "learning_rate": 2.225788288288288e-05, "loss": 0.6504, "mean_token_accuracy": 0.897967740893364, "step": 1375, "train/kl_loss_qwen": 0.038501370791345836, "train/kl_loss_r1": 0.022604670422151685, "train/total_kl": 0.06110604116693139 }, { "epoch": 1.0352786639144305, "grad_norm": 2.171875, "learning_rate": 2.222972972972973e-05, "loss": 0.6676, "mean_token_accuracy": 0.8930170625448227, "step": 1380, "train/kl_loss_qwen": 0.03824372082017362, "train/kl_loss_r1": 0.022439042571932077, "train/total_kl": 0.0606827630661428 }, { "epoch": 1.0390317132670295, "grad_norm": 2.625, "learning_rate": 2.2201576576576576e-05, "loss": 0.68, "mean_token_accuracy": 0.8910626381635666, "step": 1385, "train/kl_loss_qwen": 0.0364824044983834, "train/kl_loss_r1": 0.021984179178252815, "train/total_kl": 0.058466583304107186 }, { "epoch": 1.0427847626196285, "grad_norm": 2.625, "learning_rate": 2.2173423423423425e-05, "loss": 0.6406, "mean_token_accuracy": 0.9029591172933579, "step": 1390, "train/kl_loss_qwen": 0.040588710876181724, "train/kl_loss_r1": 0.02504544616676867, "train/total_kl": 0.06563415694981814 }, { "epoch": 1.0465378119722275, "grad_norm": 2.5, "learning_rate": 2.214527027027027e-05, "loss": 0.5936, "mean_token_accuracy": 0.9015870213508606, "step": 1395, "train/kl_loss_qwen": 0.03233385533094406, "train/kl_loss_r1": 0.01939639528281987, "train/total_kl": 0.0517302505671978 }, { "epoch": 1.0502908613248265, "grad_norm": 2.4375, "learning_rate": 2.2117117117117116e-05, "loss": 0.6685, "mean_token_accuracy": 0.8904843509197236, "step": 1400, "train/kl_loss_qwen": 0.03684836062602699, "train/kl_loss_r1": 0.022537825303152202, "train/total_kl": 0.059386185463517906 }, { "epoch": 1.0540439106774253, "grad_norm": 2.859375, "learning_rate": 2.2088963963963965e-05, "loss": 0.6683, "mean_token_accuracy": 0.8937689036130905, "step": 1405, "train/kl_loss_qwen": 0.03806398524902761, "train/kl_loss_r1": 0.022129832254722714, "train/total_kl": 0.06019381750375032 }, { "epoch": 1.0577969600300243, "grad_norm": 2.890625, "learning_rate": 2.206081081081081e-05, "loss": 0.6935, "mean_token_accuracy": 0.8934850037097931, "step": 1410, "train/kl_loss_qwen": 0.04057308458723128, "train/kl_loss_r1": 0.026647206209599972, "train/total_kl": 0.06722028991207481 }, { "epoch": 1.0615500093826233, "grad_norm": 3.40625, "learning_rate": 2.2032657657657657e-05, "loss": 0.7189, "mean_token_accuracy": 0.8990837901830673, "step": 1415, "train/kl_loss_qwen": 0.0509747623000294, "train/kl_loss_r1": 0.028807251481339335, "train/total_kl": 0.07978201508522034 }, { "epoch": 1.0653030587352224, "grad_norm": 3.203125, "learning_rate": 2.2004504504504506e-05, "loss": 0.6548, "mean_token_accuracy": 0.8912235021591186, "step": 1420, "train/kl_loss_qwen": 0.03229280970990658, "train/kl_loss_r1": 0.020080786664038897, "train/total_kl": 0.05237359646707773 }, { "epoch": 1.0690561080878214, "grad_norm": 2.0, "learning_rate": 2.197635135135135e-05, "loss": 0.6596, "mean_token_accuracy": 0.8960457772016526, "step": 1425, "train/kl_loss_qwen": 0.0408114202786237, "train/kl_loss_r1": 0.022259290888905527, "train/total_kl": 0.06307071102783084 }, { "epoch": 1.0728091574404204, "grad_norm": 2.734375, "learning_rate": 2.1948198198198197e-05, "loss": 0.6918, "mean_token_accuracy": 0.8915483593940735, "step": 1430, "train/kl_loss_qwen": 0.04138145474717021, "train/kl_loss_r1": 0.02470776312984526, "train/total_kl": 0.06608921755105257 }, { "epoch": 1.0765622067930194, "grad_norm": 2.546875, "learning_rate": 2.1920045045045046e-05, "loss": 0.6872, "mean_token_accuracy": 0.8949816524982452, "step": 1435, "train/kl_loss_qwen": 0.04295819364488125, "train/kl_loss_r1": 0.02569909901358187, "train/total_kl": 0.06865729233250022 }, { "epoch": 1.0803152561456184, "grad_norm": 2.84375, "learning_rate": 2.1891891891891892e-05, "loss": 0.7196, "mean_token_accuracy": 0.8875626802444458, "step": 1440, "train/kl_loss_qwen": 0.04375511151738465, "train/kl_loss_r1": 0.025596009753644466, "train/total_kl": 0.06935112103819847 }, { "epoch": 1.0840683054982172, "grad_norm": 2.484375, "learning_rate": 2.1863738738738737e-05, "loss": 0.6622, "mean_token_accuracy": 0.893270394206047, "step": 1445, "train/kl_loss_qwen": 0.03457060917280615, "train/kl_loss_r1": 0.020614350261166692, "train/total_kl": 0.055184959154576066 }, { "epoch": 1.0878213548508162, "grad_norm": 2.421875, "learning_rate": 2.1835585585585586e-05, "loss": 0.604, "mean_token_accuracy": 0.9012135595083237, "step": 1450, "train/kl_loss_qwen": 0.03251136806793511, "train/kl_loss_r1": 0.019424339337274433, "train/total_kl": 0.051935707405209544 }, { "epoch": 1.0915744042034152, "grad_norm": 2.3125, "learning_rate": 2.1807432432432432e-05, "loss": 0.7123, "mean_token_accuracy": 0.8986908882856369, "step": 1455, "train/kl_loss_qwen": 0.05085464362055063, "train/kl_loss_r1": 0.028513824706897138, "train/total_kl": 0.07936846744269133 }, { "epoch": 1.0953274535560142, "grad_norm": 2.328125, "learning_rate": 2.177927927927928e-05, "loss": 0.6291, "mean_token_accuracy": 0.8938940465450287, "step": 1460, "train/kl_loss_qwen": 0.0365486825350672, "train/kl_loss_r1": 0.020992783037945627, "train/total_kl": 0.057541465666145084 }, { "epoch": 1.0990805029086133, "grad_norm": 2.234375, "learning_rate": 2.1751126126126127e-05, "loss": 0.6376, "mean_token_accuracy": 0.8969442307949066, "step": 1465, "train/kl_loss_qwen": 0.03290966739878058, "train/kl_loss_r1": 0.020104941399767994, "train/total_kl": 0.053014608845114705 }, { "epoch": 1.1028335522612123, "grad_norm": 2.453125, "learning_rate": 2.1722972972972972e-05, "loss": 0.6432, "mean_token_accuracy": 0.894056448340416, "step": 1470, "train/kl_loss_qwen": 0.03260161904618144, "train/kl_loss_r1": 0.02036406025290489, "train/total_kl": 0.052965679205954075 }, { "epoch": 1.1065866016138113, "grad_norm": 1.9765625, "learning_rate": 2.169481981981982e-05, "loss": 0.7049, "mean_token_accuracy": 0.8975407749414444, "step": 1475, "train/kl_loss_qwen": 0.050286664813756946, "train/kl_loss_r1": 0.02728750566020608, "train/total_kl": 0.07757417084649205 }, { "epoch": 1.1103396509664103, "grad_norm": 2.71875, "learning_rate": 2.1666666666666667e-05, "loss": 0.6315, "mean_token_accuracy": 0.9003421634435653, "step": 1480, "train/kl_loss_qwen": 0.03332536895759404, "train/kl_loss_r1": 0.02332189753651619, "train/total_kl": 0.05664726672694087 }, { "epoch": 1.1140927003190093, "grad_norm": 2.09375, "learning_rate": 2.1638513513513513e-05, "loss": 0.6516, "mean_token_accuracy": 0.9011515021324158, "step": 1485, "train/kl_loss_qwen": 0.03897336809895933, "train/kl_loss_r1": 0.021944570681080224, "train/total_kl": 0.060917938873171804 }, { "epoch": 1.117845749671608, "grad_norm": 2.640625, "learning_rate": 2.1610360360360362e-05, "loss": 0.6724, "mean_token_accuracy": 0.8921928942203522, "step": 1490, "train/kl_loss_qwen": 0.0333264619577676, "train/kl_loss_r1": 0.02036203513853252, "train/total_kl": 0.053688496444374324 }, { "epoch": 1.1215987990242071, "grad_norm": 2.6875, "learning_rate": 2.1582207207207207e-05, "loss": 0.6588, "mean_token_accuracy": 0.8953865617513657, "step": 1495, "train/kl_loss_qwen": 0.03588013225235045, "train/kl_loss_r1": 0.020809399196878076, "train/total_kl": 0.0566895317286253 }, { "epoch": 1.1253518483768061, "grad_norm": 2.40625, "learning_rate": 2.1554054054054053e-05, "loss": 0.6007, "mean_token_accuracy": 0.9045622408390045, "step": 1500, "train/kl_loss_qwen": 0.03217562069185078, "train/kl_loss_r1": 0.019330057594925166, "train/total_kl": 0.05150567796081305 }, { "epoch": 1.1291048977294051, "grad_norm": 2.28125, "learning_rate": 2.1525900900900902e-05, "loss": 0.6219, "mean_token_accuracy": 0.9022328287363053, "step": 1505, "train/kl_loss_qwen": 0.03696062350645661, "train/kl_loss_r1": 0.02114432412199676, "train/total_kl": 0.05810494795441627 }, { "epoch": 1.1328579470820042, "grad_norm": 2.3125, "learning_rate": 2.1497747747747748e-05, "loss": 0.6643, "mean_token_accuracy": 0.8981336444616318, "step": 1510, "train/kl_loss_qwen": 0.04067998202517629, "train/kl_loss_r1": 0.024339890154078603, "train/total_kl": 0.06501987269148231 }, { "epoch": 1.1366109964346032, "grad_norm": 2.59375, "learning_rate": 2.1469594594594593e-05, "loss": 0.6253, "mean_token_accuracy": 0.9077253580093384, "step": 1515, "train/kl_loss_qwen": 0.03719198950566351, "train/kl_loss_r1": 0.02381544355303049, "train/total_kl": 0.0610074333846569 }, { "epoch": 1.1403640457872022, "grad_norm": 2.59375, "learning_rate": 2.1441441441441442e-05, "loss": 0.7558, "mean_token_accuracy": 0.9028765827417373, "step": 1520, "train/kl_loss_qwen": 0.055122953513637184, "train/kl_loss_r1": 0.03659365689381957, "train/total_kl": 0.09171660989522934 }, { "epoch": 1.144117095139801, "grad_norm": 2.046875, "learning_rate": 2.1413288288288288e-05, "loss": 0.6401, "mean_token_accuracy": 0.8968337863683701, "step": 1525, "train/kl_loss_qwen": 0.03610984361730516, "train/kl_loss_r1": 0.020405574096366765, "train/total_kl": 0.05651541752740741 }, { "epoch": 1.1478701444924, "grad_norm": 2.65625, "learning_rate": 2.1385135135135137e-05, "loss": 0.6556, "mean_token_accuracy": 0.8919296562671661, "step": 1530, "train/kl_loss_qwen": 0.0327754978556186, "train/kl_loss_r1": 0.021019916282966733, "train/total_kl": 0.05379541488364339 }, { "epoch": 1.151623193844999, "grad_norm": 3.140625, "learning_rate": 2.1356981981981983e-05, "loss": 0.6184, "mean_token_accuracy": 0.8987061321735382, "step": 1535, "train/kl_loss_qwen": 0.028856372553855182, "train/kl_loss_r1": 0.020303833484649658, "train/total_kl": 0.04916020501405001 }, { "epoch": 1.155376243197598, "grad_norm": 2.5, "learning_rate": 2.1328828828828828e-05, "loss": 0.6152, "mean_token_accuracy": 0.8988528192043305, "step": 1540, "train/kl_loss_qwen": 0.03804198480211198, "train/kl_loss_r1": 0.021859840862452982, "train/total_kl": 0.05990182533860207 }, { "epoch": 1.159129292550197, "grad_norm": 2.5, "learning_rate": 2.1300675675675677e-05, "loss": 0.6899, "mean_token_accuracy": 0.9004143476486206, "step": 1545, "train/kl_loss_qwen": 0.05160218593664467, "train/kl_loss_r1": 0.02747901389375329, "train/total_kl": 0.07908119913190603 }, { "epoch": 1.162882341902796, "grad_norm": 2.890625, "learning_rate": 2.1272522522522523e-05, "loss": 0.664, "mean_token_accuracy": 0.8997497946023941, "step": 1550, "train/kl_loss_qwen": 0.03771160962060094, "train/kl_loss_r1": 0.02381550595164299, "train/total_kl": 0.061527115292847157 }, { "epoch": 1.166635391255395, "grad_norm": 2.109375, "learning_rate": 2.124436936936937e-05, "loss": 0.6885, "mean_token_accuracy": 0.8912563741207122, "step": 1555, "train/kl_loss_qwen": 0.04218352562747896, "train/kl_loss_r1": 0.023105837916955353, "train/total_kl": 0.06528936326503754 }, { "epoch": 1.170388440607994, "grad_norm": 2.6875, "learning_rate": 2.1216216216216218e-05, "loss": 0.6618, "mean_token_accuracy": 0.8870168477296829, "step": 1560, "train/kl_loss_qwen": 0.03366015064530074, "train/kl_loss_r1": 0.02038904307410121, "train/total_kl": 0.054049193672835824 }, { "epoch": 1.174141489960593, "grad_norm": 1.953125, "learning_rate": 2.1188063063063063e-05, "loss": 0.6476, "mean_token_accuracy": 0.8984944999217988, "step": 1565, "train/kl_loss_qwen": 0.04087866884656251, "train/kl_loss_r1": 0.02253748197108507, "train/total_kl": 0.06341615030542017 }, { "epoch": 1.1778945393131919, "grad_norm": 2.21875, "learning_rate": 2.115990990990991e-05, "loss": 0.6509, "mean_token_accuracy": 0.8938078165054322, "step": 1570, "train/kl_loss_qwen": 0.03671765057370067, "train/kl_loss_r1": 0.02350157857872546, "train/total_kl": 0.06021922947838902 }, { "epoch": 1.181647588665791, "grad_norm": 2.3125, "learning_rate": 2.1131756756756758e-05, "loss": 0.6916, "mean_token_accuracy": 0.8965020477771759, "step": 1575, "train/kl_loss_qwen": 0.03952843742445111, "train/kl_loss_r1": 0.02464278801344335, "train/total_kl": 0.06417122464627027 }, { "epoch": 1.18540063801839, "grad_norm": 3.34375, "learning_rate": 2.1103603603603604e-05, "loss": 0.6768, "mean_token_accuracy": 0.898043891787529, "step": 1580, "train/kl_loss_qwen": 0.03657638491131365, "train/kl_loss_r1": 0.023017378337681294, "train/total_kl": 0.059593763947486875 }, { "epoch": 1.189153687370989, "grad_norm": 2.109375, "learning_rate": 2.107545045045045e-05, "loss": 0.6469, "mean_token_accuracy": 0.9002287417650223, "step": 1585, "train/kl_loss_qwen": 0.04064678167924285, "train/kl_loss_r1": 0.02297673197463155, "train/total_kl": 0.06362351393327118 }, { "epoch": 1.192906736723588, "grad_norm": 2.34375, "learning_rate": 2.1047297297297298e-05, "loss": 0.7678, "mean_token_accuracy": 0.8924204409122467, "step": 1590, "train/kl_loss_qwen": 0.05273810774087906, "train/kl_loss_r1": 0.03466474949382246, "train/total_kl": 0.08740285709500313 }, { "epoch": 1.196659786076187, "grad_norm": 2.203125, "learning_rate": 2.1019144144144144e-05, "loss": 0.6661, "mean_token_accuracy": 0.8990363031625748, "step": 1595, "train/kl_loss_qwen": 0.03281391002237797, "train/kl_loss_r1": 0.021448523411527275, "train/total_kl": 0.05426243459805846 }, { "epoch": 1.200412835428786, "grad_norm": 2.1875, "learning_rate": 2.0990990990990993e-05, "loss": 0.7208, "mean_token_accuracy": 0.8923367202281952, "step": 1600, "train/kl_loss_qwen": 0.0482438325881958, "train/kl_loss_r1": 0.026941578928381206, "train/total_kl": 0.0751854119822383 }, { "epoch": 1.2041658847813848, "grad_norm": 2.484375, "learning_rate": 2.096283783783784e-05, "loss": 0.6306, "mean_token_accuracy": 0.8927339673042297, "step": 1605, "train/kl_loss_qwen": 0.025906256400048733, "train/kl_loss_r1": 0.017682750569656493, "train/total_kl": 0.04358900701627135 }, { "epoch": 1.2079189341339838, "grad_norm": 2.515625, "learning_rate": 2.0934684684684684e-05, "loss": 0.6601, "mean_token_accuracy": 0.899314421415329, "step": 1610, "train/kl_loss_qwen": 0.03712713974528015, "train/kl_loss_r1": 0.022753736563026906, "train/total_kl": 0.05988087672740221 }, { "epoch": 1.2116719834865828, "grad_norm": 2.390625, "learning_rate": 2.0906531531531533e-05, "loss": 0.6906, "mean_token_accuracy": 0.897834625840187, "step": 1615, "train/kl_loss_qwen": 0.041691668890416624, "train/kl_loss_r1": 0.027388109499588607, "train/total_kl": 0.06907977797091007 }, { "epoch": 1.2154250328391818, "grad_norm": 3.0625, "learning_rate": 2.087837837837838e-05, "loss": 0.7775, "mean_token_accuracy": 0.8951803237199784, "step": 1620, "train/kl_loss_qwen": 0.049284798093140125, "train/kl_loss_r1": 0.039868233958259225, "train/total_kl": 0.08915303098037838 }, { "epoch": 1.2191780821917808, "grad_norm": 2.328125, "learning_rate": 2.0850225225225225e-05, "loss": 0.6344, "mean_token_accuracy": 0.9095320641994477, "step": 1625, "train/kl_loss_qwen": 0.04163948465138674, "train/kl_loss_r1": 0.022643117513507605, "train/total_kl": 0.06428260188549757 }, { "epoch": 1.2229311315443798, "grad_norm": 2.328125, "learning_rate": 2.0822072072072074e-05, "loss": 0.7098, "mean_token_accuracy": 0.8988444000482559, "step": 1630, "train/kl_loss_qwen": 0.04608845864422619, "train/kl_loss_r1": 0.027745236363261937, "train/total_kl": 0.07383369533345104 }, { "epoch": 1.2266841808969788, "grad_norm": 2.0625, "learning_rate": 2.079391891891892e-05, "loss": 0.6944, "mean_token_accuracy": 0.8962710082530976, "step": 1635, "train/kl_loss_qwen": 0.04292014427483082, "train/kl_loss_r1": 0.02413395158946514, "train/total_kl": 0.06705409660935402 }, { "epoch": 1.2304372302495779, "grad_norm": 2.578125, "learning_rate": 2.0765765765765765e-05, "loss": 0.6326, "mean_token_accuracy": 0.9000991404056549, "step": 1640, "train/kl_loss_qwen": 0.03367524016648531, "train/kl_loss_r1": 0.021229733433574437, "train/total_kl": 0.054904973786324265 }, { "epoch": 1.2341902796021769, "grad_norm": 2.078125, "learning_rate": 2.0737612612612614e-05, "loss": 0.6461, "mean_token_accuracy": 0.896466201543808, "step": 1645, "train/kl_loss_qwen": 0.03830257770605385, "train/kl_loss_r1": 0.022557589411735534, "train/total_kl": 0.06086016772314906 }, { "epoch": 1.2379433289547759, "grad_norm": 3.515625, "learning_rate": 2.070945945945946e-05, "loss": 0.6941, "mean_token_accuracy": 0.8982764691114425, "step": 1650, "train/kl_loss_qwen": 0.04389114985242486, "train/kl_loss_r1": 0.023960805917158722, "train/total_kl": 0.06785195581614971 }, { "epoch": 1.2416963783073747, "grad_norm": 2.109375, "learning_rate": 2.0681306306306305e-05, "loss": 0.6591, "mean_token_accuracy": 0.8961503982543946, "step": 1655, "train/kl_loss_qwen": 0.036785400658845904, "train/kl_loss_r1": 0.022157771140336992, "train/total_kl": 0.05894317170605064 }, { "epoch": 1.2454494276599737, "grad_norm": 2.953125, "learning_rate": 2.0653153153153154e-05, "loss": 0.6637, "mean_token_accuracy": 0.8931402564048767, "step": 1660, "train/kl_loss_qwen": 0.034067783411592244, "train/kl_loss_r1": 0.022122635459527373, "train/total_kl": 0.05619041854515672 }, { "epoch": 1.2492024770125727, "grad_norm": 2.296875, "learning_rate": 2.0625e-05, "loss": 0.7201, "mean_token_accuracy": 0.8976661562919617, "step": 1665, "train/kl_loss_qwen": 0.05538632106035948, "train/kl_loss_r1": 0.029164044838398694, "train/total_kl": 0.0845503662712872 }, { "epoch": 1.2529555263651717, "grad_norm": 2.15625, "learning_rate": 2.059684684684685e-05, "loss": 0.679, "mean_token_accuracy": 0.8980172663927078, "step": 1670, "train/kl_loss_qwen": 0.04381668856367469, "train/kl_loss_r1": 0.025967366946861147, "train/total_kl": 0.06978405602276325 }, { "epoch": 1.2567085757177707, "grad_norm": 2.0, "learning_rate": 2.0568693693693695e-05, "loss": 0.6071, "mean_token_accuracy": 0.9005229413509369, "step": 1675, "train/kl_loss_qwen": 0.03412508904002607, "train/kl_loss_r1": 0.020069641107693315, "train/total_kl": 0.05419472977519035 }, { "epoch": 1.2604616250703697, "grad_norm": 1.8515625, "learning_rate": 2.054054054054054e-05, "loss": 0.7051, "mean_token_accuracy": 0.8936825692653656, "step": 1680, "train/kl_loss_qwen": 0.04467056444846094, "train/kl_loss_r1": 0.026615058537572622, "train/total_kl": 0.07128562275320291 }, { "epoch": 1.2642146744229685, "grad_norm": 2.84375, "learning_rate": 2.051238738738739e-05, "loss": 0.6355, "mean_token_accuracy": 0.893347242474556, "step": 1685, "train/kl_loss_qwen": 0.03152433056384325, "train/kl_loss_r1": 0.020429795142263174, "train/total_kl": 0.0519541259855032 }, { "epoch": 1.2679677237755675, "grad_norm": 2.984375, "learning_rate": 2.0484234234234235e-05, "loss": 0.6984, "mean_token_accuracy": 0.8897217184305191, "step": 1690, "train/kl_loss_qwen": 0.03661228069104254, "train/kl_loss_r1": 0.02224379451945424, "train/total_kl": 0.058856075070798396 }, { "epoch": 1.2717207731281666, "grad_norm": 2.28125, "learning_rate": 2.045608108108108e-05, "loss": 0.648, "mean_token_accuracy": 0.9048317104578019, "step": 1695, "train/kl_loss_qwen": 0.045321733225136995, "train/kl_loss_r1": 0.026462600193917753, "train/total_kl": 0.071784333512187 }, { "epoch": 1.2754738224807656, "grad_norm": 2.359375, "learning_rate": 2.042792792792793e-05, "loss": 0.6268, "mean_token_accuracy": 0.8983773797750473, "step": 1700, "train/kl_loss_qwen": 0.03106446722522378, "train/kl_loss_r1": 0.01989688342437148, "train/total_kl": 0.05096135074272752 }, { "epoch": 1.2792268718333646, "grad_norm": 2.4375, "learning_rate": 2.0399774774774775e-05, "loss": 0.6587, "mean_token_accuracy": 0.8927053213119507, "step": 1705, "train/kl_loss_qwen": 0.03694589231163263, "train/kl_loss_r1": 0.02159377154894173, "train/total_kl": 0.058539663441479206 }, { "epoch": 1.2829799211859636, "grad_norm": 2.28125, "learning_rate": 2.037162162162162e-05, "loss": 0.6729, "mean_token_accuracy": 0.8997768491506577, "step": 1710, "train/kl_loss_qwen": 0.04414708665572107, "train/kl_loss_r1": 0.025749648921191692, "train/total_kl": 0.06989673571661115 }, { "epoch": 1.2867329705385626, "grad_norm": 2.453125, "learning_rate": 2.034346846846847e-05, "loss": 0.6475, "mean_token_accuracy": 0.8889215677976608, "step": 1715, "train/kl_loss_qwen": 0.03290065913461149, "train/kl_loss_r1": 0.019741447921842337, "train/total_kl": 0.052642107103019954 }, { "epoch": 1.2904860198911616, "grad_norm": 2.046875, "learning_rate": 2.0315315315315316e-05, "loss": 0.6602, "mean_token_accuracy": 0.9022534549236297, "step": 1720, "train/kl_loss_qwen": 0.04427695120684803, "train/kl_loss_r1": 0.024226430244743823, "train/total_kl": 0.06850338215008378 }, { "epoch": 1.2942390692437606, "grad_norm": 2.40625, "learning_rate": 2.028716216216216e-05, "loss": 0.6487, "mean_token_accuracy": 0.8972199141979218, "step": 1725, "train/kl_loss_qwen": 0.03695550081320107, "train/kl_loss_r1": 0.022246523899957536, "train/total_kl": 0.05920202443376184 }, { "epoch": 1.2979921185963597, "grad_norm": 2.34375, "learning_rate": 2.025900900900901e-05, "loss": 0.6529, "mean_token_accuracy": 0.896842759847641, "step": 1730, "train/kl_loss_qwen": 0.03686010828241706, "train/kl_loss_r1": 0.023121427558362485, "train/total_kl": 0.059981536213308574 }, { "epoch": 1.3017451679489584, "grad_norm": 2.6875, "learning_rate": 2.0230855855855856e-05, "loss": 0.7504, "mean_token_accuracy": 0.8848373681306839, "step": 1735, "train/kl_loss_qwen": 0.04792549349367618, "train/kl_loss_r1": 0.02982408171519637, "train/total_kl": 0.0777495744638145 }, { "epoch": 1.3054982173015575, "grad_norm": 2.46875, "learning_rate": 2.0202702702702705e-05, "loss": 0.6681, "mean_token_accuracy": 0.8902998507022858, "step": 1740, "train/kl_loss_qwen": 0.03482842277735472, "train/kl_loss_r1": 0.02168791564181447, "train/total_kl": 0.0565163386054337 }, { "epoch": 1.3092512666541565, "grad_norm": 2.625, "learning_rate": 2.017454954954955e-05, "loss": 0.6437, "mean_token_accuracy": 0.8982394754886627, "step": 1745, "train/kl_loss_qwen": 0.035474417312070725, "train/kl_loss_r1": 0.022891478892415763, "train/total_kl": 0.05836589625105262 }, { "epoch": 1.3130043160067555, "grad_norm": 2.703125, "learning_rate": 2.0146396396396396e-05, "loss": 0.6795, "mean_token_accuracy": 0.8941202372312546, "step": 1750, "train/kl_loss_qwen": 0.0397964580450207, "train/kl_loss_r1": 0.023753806576132776, "train/total_kl": 0.0635502644814551 }, { "epoch": 1.3167573653593545, "grad_norm": 3.0, "learning_rate": 2.0118243243243245e-05, "loss": 0.6468, "mean_token_accuracy": 0.8910412400960922, "step": 1755, "train/kl_loss_qwen": 0.029920431366190315, "train/kl_loss_r1": 0.01957395039498806, "train/total_kl": 0.049494380969554184 }, { "epoch": 1.3205104147119535, "grad_norm": 1.9453125, "learning_rate": 2.009009009009009e-05, "loss": 0.6327, "mean_token_accuracy": 0.8966994285583496, "step": 1760, "train/kl_loss_qwen": 0.034124097367748615, "train/kl_loss_r1": 0.020086573716253043, "train/total_kl": 0.054210671316832305 }, { "epoch": 1.3242634640645525, "grad_norm": 2.671875, "learning_rate": 2.0061936936936936e-05, "loss": 0.6549, "mean_token_accuracy": 0.8966648191213608, "step": 1765, "train/kl_loss_qwen": 0.03722571823745966, "train/kl_loss_r1": 0.023023253306746483, "train/total_kl": 0.06024897079914808 }, { "epoch": 1.3280165134171513, "grad_norm": 2.203125, "learning_rate": 2.0033783783783786e-05, "loss": 0.7187, "mean_token_accuracy": 0.893772754073143, "step": 1770, "train/kl_loss_qwen": 0.041496854228898886, "train/kl_loss_r1": 0.02984851785004139, "train/total_kl": 0.0713453721255064 }, { "epoch": 1.3317695627697503, "grad_norm": 2.953125, "learning_rate": 2.000563063063063e-05, "loss": 0.6494, "mean_token_accuracy": 0.8925831645727158, "step": 1775, "train/kl_loss_qwen": 0.03391701048240066, "train/kl_loss_r1": 0.02053148075938225, "train/total_kl": 0.05444849170744419 }, { "epoch": 1.3355226121223494, "grad_norm": 2.59375, "learning_rate": 1.9977477477477477e-05, "loss": 0.6872, "mean_token_accuracy": 0.8946872740983963, "step": 1780, "train/kl_loss_qwen": 0.04151489580981434, "train/kl_loss_r1": 0.02380800019018352, "train/total_kl": 0.0653228960931301 }, { "epoch": 1.3392756614749484, "grad_norm": 5.34375, "learning_rate": 1.9949324324324326e-05, "loss": 0.7474, "mean_token_accuracy": 0.8979882091283798, "step": 1785, "train/kl_loss_qwen": 0.056800445262342694, "train/kl_loss_r1": 0.029366112127900124, "train/total_kl": 0.08616655776277185 }, { "epoch": 1.3430287108275474, "grad_norm": 2.21875, "learning_rate": 1.992117117117117e-05, "loss": 0.7115, "mean_token_accuracy": 0.8981248527765274, "step": 1790, "train/kl_loss_qwen": 0.04085184554569423, "train/kl_loss_r1": 0.03460422777570784, "train/total_kl": 0.07545607415959239 }, { "epoch": 1.3467817601801464, "grad_norm": 2.125, "learning_rate": 1.9893018018018017e-05, "loss": 0.6341, "mean_token_accuracy": 0.9051784396171569, "step": 1795, "train/kl_loss_qwen": 0.03810063651762903, "train/kl_loss_r1": 0.023779565608128904, "train/total_kl": 0.061880202125757934 }, { "epoch": 1.3505348095327454, "grad_norm": 2.75, "learning_rate": 1.9864864864864866e-05, "loss": 0.6965, "mean_token_accuracy": 0.8958302170038224, "step": 1800, "train/kl_loss_qwen": 0.043665826646611096, "train/kl_loss_r1": 0.024920030031353235, "train/total_kl": 0.06858585700392723 }, { "epoch": 1.3542878588853444, "grad_norm": 2.265625, "learning_rate": 1.9836711711711712e-05, "loss": 0.6536, "mean_token_accuracy": 0.8965657860040664, "step": 1805, "train/kl_loss_qwen": 0.0385003843344748, "train/kl_loss_r1": 0.02256901506334543, "train/total_kl": 0.06106939930468798 }, { "epoch": 1.3580409082379434, "grad_norm": 2.78125, "learning_rate": 1.980855855855856e-05, "loss": 0.6662, "mean_token_accuracy": 0.8964945763349533, "step": 1810, "train/kl_loss_qwen": 0.03769433670677245, "train/kl_loss_r1": 0.023366046929731966, "train/total_kl": 0.061060383543372156 }, { "epoch": 1.3617939575905424, "grad_norm": 1.9765625, "learning_rate": 1.9780405405405406e-05, "loss": 0.6232, "mean_token_accuracy": 0.8984342306852341, "step": 1815, "train/kl_loss_qwen": 0.03642870718613267, "train/kl_loss_r1": 0.02151739364489913, "train/total_kl": 0.05794610073789954 }, { "epoch": 1.3655470069431412, "grad_norm": 2.6875, "learning_rate": 1.9752252252252252e-05, "loss": 0.6748, "mean_token_accuracy": 0.8911469489336014, "step": 1820, "train/kl_loss_qwen": 0.036837967671453954, "train/kl_loss_r1": 0.021274990309029816, "train/total_kl": 0.05811295798048377 }, { "epoch": 1.3693000562957403, "grad_norm": 2.421875, "learning_rate": 1.97240990990991e-05, "loss": 0.7, "mean_token_accuracy": 0.898788771033287, "step": 1825, "train/kl_loss_qwen": 0.0477908511646092, "train/kl_loss_r1": 0.027263673022389412, "train/total_kl": 0.07505452418699861 }, { "epoch": 1.3730531056483393, "grad_norm": 2.09375, "learning_rate": 1.9695945945945947e-05, "loss": 0.6515, "mean_token_accuracy": 0.8929797321557998, "step": 1830, "train/kl_loss_qwen": 0.037732946872711184, "train/kl_loss_r1": 0.023381694732233883, "train/total_kl": 0.06111464183777571 }, { "epoch": 1.3768061550009383, "grad_norm": 3.625, "learning_rate": 1.9667792792792792e-05, "loss": 0.635, "mean_token_accuracy": 0.8952462702989579, "step": 1835, "train/kl_loss_qwen": 0.033427430875599386, "train/kl_loss_r1": 0.01963294977322221, "train/total_kl": 0.053060381393879655 }, { "epoch": 1.3805592043535373, "grad_norm": 2.078125, "learning_rate": 1.963963963963964e-05, "loss": 0.6226, "mean_token_accuracy": 0.9011066049337387, "step": 1840, "train/kl_loss_qwen": 0.03780209980905056, "train/kl_loss_r1": 0.021729913400486113, "train/total_kl": 0.059532013908028605 }, { "epoch": 1.3843122537061363, "grad_norm": 2.671875, "learning_rate": 1.9611486486486487e-05, "loss": 0.6941, "mean_token_accuracy": 0.8947292596101761, "step": 1845, "train/kl_loss_qwen": 0.04456910211592913, "train/kl_loss_r1": 0.026085085608065127, "train/total_kl": 0.07065418781712651 }, { "epoch": 1.388065303058735, "grad_norm": 2.390625, "learning_rate": 1.9583333333333333e-05, "loss": 0.6699, "mean_token_accuracy": 0.892634192109108, "step": 1850, "train/kl_loss_qwen": 0.03511934005655348, "train/kl_loss_r1": 0.02197172655723989, "train/total_kl": 0.05709106680005789 }, { "epoch": 1.3918183524113341, "grad_norm": 2.34375, "learning_rate": 1.9555180180180182e-05, "loss": 0.6561, "mean_token_accuracy": 0.9011503875255584, "step": 1855, "train/kl_loss_qwen": 0.037530270777642726, "train/kl_loss_r1": 0.023832452250644565, "train/total_kl": 0.06136272391304374 }, { "epoch": 1.3955714017639331, "grad_norm": 2.484375, "learning_rate": 1.9527027027027027e-05, "loss": 0.639, "mean_token_accuracy": 0.8889249801635742, "step": 1860, "train/kl_loss_qwen": 0.03357897619716823, "train/kl_loss_r1": 0.019287104764953256, "train/total_kl": 0.05286608096212149 }, { "epoch": 1.3993244511165321, "grad_norm": 3.46875, "learning_rate": 1.9498873873873876e-05, "loss": 0.6589, "mean_token_accuracy": 0.89662606716156, "step": 1865, "train/kl_loss_qwen": 0.03979860804975033, "train/kl_loss_r1": 0.021712002949789165, "train/total_kl": 0.061510611418634654 }, { "epoch": 1.4030775004691312, "grad_norm": 2.375, "learning_rate": 1.9470720720720722e-05, "loss": 0.6544, "mean_token_accuracy": 0.8980444580316543, "step": 1870, "train/kl_loss_qwen": 0.03840322676114738, "train/kl_loss_r1": 0.022618817444890738, "train/total_kl": 0.061022044345736506 }, { "epoch": 1.4068305498217302, "grad_norm": 2.015625, "learning_rate": 1.9442567567567568e-05, "loss": 0.629, "mean_token_accuracy": 0.8985240757465363, "step": 1875, "train/kl_loss_qwen": 0.03343218662776053, "train/kl_loss_r1": 0.02114759860560298, "train/total_kl": 0.05457978509366512 }, { "epoch": 1.4105835991743292, "grad_norm": 2.453125, "learning_rate": 1.9414414414414417e-05, "loss": 0.6639, "mean_token_accuracy": 0.8933916985988617, "step": 1880, "train/kl_loss_qwen": 0.035910390829667446, "train/kl_loss_r1": 0.022948722075670957, "train/total_kl": 0.05885911285877228 }, { "epoch": 1.4143366485269282, "grad_norm": 2.140625, "learning_rate": 1.9386261261261262e-05, "loss": 0.6254, "mean_token_accuracy": 0.910058930516243, "step": 1885, "train/kl_loss_qwen": 0.04212158760055899, "train/kl_loss_r1": 0.023075549816712736, "train/total_kl": 0.06519713709130884 }, { "epoch": 1.4180896978795272, "grad_norm": 2.609375, "learning_rate": 1.9358108108108108e-05, "loss": 0.6925, "mean_token_accuracy": 0.8909910589456558, "step": 1890, "train/kl_loss_qwen": 0.03533278629183769, "train/kl_loss_r1": 0.02264896663837135, "train/total_kl": 0.057981752697378396 }, { "epoch": 1.4218427472321262, "grad_norm": 2.1875, "learning_rate": 1.9329954954954957e-05, "loss": 0.7097, "mean_token_accuracy": 0.8962362855672836, "step": 1895, "train/kl_loss_qwen": 0.045880905678495766, "train/kl_loss_r1": 0.0273836272303015, "train/total_kl": 0.07326453356072307 }, { "epoch": 1.425595796584725, "grad_norm": 2.78125, "learning_rate": 1.9301801801801803e-05, "loss": 0.6969, "mean_token_accuracy": 0.8988943964242935, "step": 1900, "train/kl_loss_qwen": 0.039936855994164945, "train/kl_loss_r1": 0.024415438855066897, "train/total_kl": 0.06435229545459151 }, { "epoch": 1.429348845937324, "grad_norm": 2.34375, "learning_rate": 1.927364864864865e-05, "loss": 0.6525, "mean_token_accuracy": 0.9052040755748749, "step": 1905, "train/kl_loss_qwen": 0.04124778304249048, "train/kl_loss_r1": 0.023393189487978815, "train/total_kl": 0.06464097276329994 }, { "epoch": 1.433101895289923, "grad_norm": 2.515625, "learning_rate": 1.9245495495495497e-05, "loss": 0.7096, "mean_token_accuracy": 0.8973052710294723, "step": 1910, "train/kl_loss_qwen": 0.04522251943126321, "train/kl_loss_r1": 0.027931411052122712, "train/total_kl": 0.07315393034368753 }, { "epoch": 1.436854944642522, "grad_norm": 2.546875, "learning_rate": 1.9217342342342343e-05, "loss": 0.6854, "mean_token_accuracy": 0.89446761906147, "step": 1915, "train/kl_loss_qwen": 0.04195737112313509, "train/kl_loss_r1": 0.024122355040162802, "train/total_kl": 0.06607972560450434 }, { "epoch": 1.440607993995121, "grad_norm": 2.078125, "learning_rate": 1.918918918918919e-05, "loss": 0.6296, "mean_token_accuracy": 0.8977221518754959, "step": 1920, "train/kl_loss_qwen": 0.03218547897413373, "train/kl_loss_r1": 0.020699582109227777, "train/total_kl": 0.05288506057113409 }, { "epoch": 1.44436104334772, "grad_norm": 2.296875, "learning_rate": 1.9161036036036038e-05, "loss": 0.6815, "mean_token_accuracy": 0.9008699923753738, "step": 1925, "train/kl_loss_qwen": 0.04258906641043723, "train/kl_loss_r1": 0.025730078108608723, "train/total_kl": 0.06831914484500885 }, { "epoch": 1.4481140927003189, "grad_norm": 2.171875, "learning_rate": 1.9132882882882883e-05, "loss": 0.6342, "mean_token_accuracy": 0.8992574870586395, "step": 1930, "train/kl_loss_qwen": 0.0382092896848917, "train/kl_loss_r1": 0.021629361854866146, "train/total_kl": 0.05983865112066269 }, { "epoch": 1.451867142052918, "grad_norm": 2.21875, "learning_rate": 1.9104729729729732e-05, "loss": 0.6639, "mean_token_accuracy": 0.9041530281305313, "step": 1935, "train/kl_loss_qwen": 0.03997725336812437, "train/kl_loss_r1": 0.023675264324992895, "train/total_kl": 0.06365251699462533 }, { "epoch": 1.455620191405517, "grad_norm": 2.171875, "learning_rate": 1.9076576576576578e-05, "loss": 0.6712, "mean_token_accuracy": 0.9018199771642685, "step": 1940, "train/kl_loss_qwen": 0.043738367455080154, "train/kl_loss_r1": 0.02533445945009589, "train/total_kl": 0.06907282685860991 }, { "epoch": 1.459373240758116, "grad_norm": 2.765625, "learning_rate": 1.9048423423423424e-05, "loss": 0.6547, "mean_token_accuracy": 0.8964920192956924, "step": 1945, "train/kl_loss_qwen": 0.036225776420906186, "train/kl_loss_r1": 0.022438023379072546, "train/total_kl": 0.05866379989311099 }, { "epoch": 1.463126290110715, "grad_norm": 3.015625, "learning_rate": 1.9020270270270273e-05, "loss": 0.6735, "mean_token_accuracy": 0.8878309816122055, "step": 1950, "train/kl_loss_qwen": 0.03589406101964414, "train/kl_loss_r1": 0.020759137952700256, "train/total_kl": 0.05665319887921214 }, { "epoch": 1.466879339463314, "grad_norm": 2.09375, "learning_rate": 1.899211711711712e-05, "loss": 0.6439, "mean_token_accuracy": 0.8993774890899658, "step": 1955, "train/kl_loss_qwen": 0.03630202002823353, "train/kl_loss_r1": 0.022347288206219673, "train/total_kl": 0.05864930879324674 }, { "epoch": 1.470632388815913, "grad_norm": 2.140625, "learning_rate": 1.8963963963963964e-05, "loss": 0.6855, "mean_token_accuracy": 0.8912985980510711, "step": 1960, "train/kl_loss_qwen": 0.03758311937563121, "train/kl_loss_r1": 0.022967340145260095, "train/total_kl": 0.060550459288060667 }, { "epoch": 1.474385438168512, "grad_norm": 2.125, "learning_rate": 1.8935810810810813e-05, "loss": 0.6547, "mean_token_accuracy": 0.8974949568510056, "step": 1965, "train/kl_loss_qwen": 0.03768882369622588, "train/kl_loss_r1": 0.022107941936701535, "train/total_kl": 0.05979676572605967 }, { "epoch": 1.478138487521111, "grad_norm": 2.328125, "learning_rate": 1.890765765765766e-05, "loss": 0.6452, "mean_token_accuracy": 0.9022711753845215, "step": 1970, "train/kl_loss_qwen": 0.039558446034789085, "train/kl_loss_r1": 0.02402328816242516, "train/total_kl": 0.06358173452317714 }, { "epoch": 1.48189153687371, "grad_norm": 3.59375, "learning_rate": 1.8879504504504504e-05, "loss": 0.6739, "mean_token_accuracy": 0.8987083554267883, "step": 1975, "train/kl_loss_qwen": 0.0458216161467135, "train/kl_loss_r1": 0.02532826513051987, "train/total_kl": 0.07114988146349788 }, { "epoch": 1.4856445862263088, "grad_norm": 2.625, "learning_rate": 1.8851351351351353e-05, "loss": 0.6292, "mean_token_accuracy": 0.8991831332445145, "step": 1980, "train/kl_loss_qwen": 0.02697877576574683, "train/kl_loss_r1": 0.018973442958667874, "train/total_kl": 0.04595221867784858 }, { "epoch": 1.4893976355789078, "grad_norm": 2.296875, "learning_rate": 1.88231981981982e-05, "loss": 0.6595, "mean_token_accuracy": 0.8934097826480866, "step": 1985, "train/kl_loss_qwen": 0.03260546647943556, "train/kl_loss_r1": 0.021064449148252607, "train/total_kl": 0.05366991562768817 }, { "epoch": 1.4931506849315068, "grad_norm": 2.375, "learning_rate": 1.8795045045045045e-05, "loss": 0.6695, "mean_token_accuracy": 0.8950473695993424, "step": 1990, "train/kl_loss_qwen": 0.04045011536218226, "train/kl_loss_r1": 0.023666227189823984, "train/total_kl": 0.0641163426451385 }, { "epoch": 1.4969037342841058, "grad_norm": 3.09375, "learning_rate": 1.8766891891891894e-05, "loss": 0.663, "mean_token_accuracy": 0.8998892098665238, "step": 1995, "train/kl_loss_qwen": 0.04123517670668662, "train/kl_loss_r1": 0.02508084485307336, "train/total_kl": 0.06631602114066482 }, { "epoch": 1.5006567836367048, "grad_norm": 2.71875, "learning_rate": 1.873873873873874e-05, "loss": 0.7075, "mean_token_accuracy": 0.8947447627782822, "step": 2000, "train/kl_loss_qwen": 0.04717821152880788, "train/kl_loss_r1": 0.02488067150115967, "train/total_kl": 0.0720588818192482 }, { "epoch": 1.5044098329893039, "grad_norm": 2.953125, "learning_rate": 1.871058558558559e-05, "loss": 0.6684, "mean_token_accuracy": 0.898020452260971, "step": 2005, "train/kl_loss_qwen": 0.043496218509972095, "train/kl_loss_r1": 0.023012824496254324, "train/total_kl": 0.0665090423077345 }, { "epoch": 1.5081628823419027, "grad_norm": 2.71875, "learning_rate": 1.8682432432432434e-05, "loss": 0.6304, "mean_token_accuracy": 0.9003192782402039, "step": 2010, "train/kl_loss_qwen": 0.029134797770529984, "train/kl_loss_r1": 0.02021429603919387, "train/total_kl": 0.04934909334406257 }, { "epoch": 1.5119159316945017, "grad_norm": 1.9140625, "learning_rate": 1.865427927927928e-05, "loss": 0.6588, "mean_token_accuracy": 0.9045243114233017, "step": 2015, "train/kl_loss_qwen": 0.03774572303518653, "train/kl_loss_r1": 0.024216174567118286, "train/total_kl": 0.0619618970900774 }, { "epoch": 1.5156689810471007, "grad_norm": 2.640625, "learning_rate": 1.862612612612613e-05, "loss": 0.6248, "mean_token_accuracy": 0.8964930444955825, "step": 2020, "train/kl_loss_qwen": 0.034802882373332976, "train/kl_loss_r1": 0.02116892714984715, "train/total_kl": 0.055971809569746254 }, { "epoch": 1.5194220303996997, "grad_norm": 3.03125, "learning_rate": 1.8597972972972974e-05, "loss": 0.6271, "mean_token_accuracy": 0.8987694203853607, "step": 2025, "train/kl_loss_qwen": 0.03145243003964424, "train/kl_loss_r1": 0.019979899702593684, "train/total_kl": 0.0514323296956718 }, { "epoch": 1.5231750797522987, "grad_norm": 2.78125, "learning_rate": 1.856981981981982e-05, "loss": 0.6637, "mean_token_accuracy": 0.8984456181526184, "step": 2030, "train/kl_loss_qwen": 0.039285799767822024, "train/kl_loss_r1": 0.024448539735749363, "train/total_kl": 0.06373433964326977 }, { "epoch": 1.5269281291048977, "grad_norm": 2.40625, "learning_rate": 1.854166666666667e-05, "loss": 0.6195, "mean_token_accuracy": 0.9050000667572021, "step": 2035, "train/kl_loss_qwen": 0.03708098256029189, "train/kl_loss_r1": 0.022825441183522345, "train/total_kl": 0.0599064233712852 }, { "epoch": 1.5306811784574967, "grad_norm": 3.15625, "learning_rate": 1.8513513513513515e-05, "loss": 0.6373, "mean_token_accuracy": 0.8917050033807754, "step": 2040, "train/kl_loss_qwen": 0.03324793949723244, "train/kl_loss_r1": 0.02039225320331752, "train/total_kl": 0.05364019190892577 }, { "epoch": 1.5344342278100958, "grad_norm": 2.6875, "learning_rate": 1.848536036036036e-05, "loss": 0.6909, "mean_token_accuracy": 0.898727822303772, "step": 2045, "train/kl_loss_qwen": 0.0451532918959856, "train/kl_loss_r1": 0.02779616378247738, "train/total_kl": 0.0729494565166533 }, { "epoch": 1.5381872771626948, "grad_norm": 2.78125, "learning_rate": 1.845720720720721e-05, "loss": 0.642, "mean_token_accuracy": 0.8923788040876388, "step": 2050, "train/kl_loss_qwen": 0.030408328166231513, "train/kl_loss_r1": 0.019276778073981406, "train/total_kl": 0.04968510568141937 }, { "epoch": 1.5419403265152938, "grad_norm": 1.9140625, "learning_rate": 1.8429054054054055e-05, "loss": 0.6805, "mean_token_accuracy": 0.9005244821310043, "step": 2055, "train/kl_loss_qwen": 0.043401677859947085, "train/kl_loss_r1": 0.024531407188624142, "train/total_kl": 0.06793308556079865 }, { "epoch": 1.5456933758678928, "grad_norm": 2.640625, "learning_rate": 1.84009009009009e-05, "loss": 0.697, "mean_token_accuracy": 0.89486822783947, "step": 2060, "train/kl_loss_qwen": 0.04360593403689563, "train/kl_loss_r1": 0.02450297260656953, "train/total_kl": 0.06810890669003129 }, { "epoch": 1.5494464252204918, "grad_norm": 2.265625, "learning_rate": 1.837274774774775e-05, "loss": 0.6749, "mean_token_accuracy": 0.8936996221542358, "step": 2065, "train/kl_loss_qwen": 0.03860712107270956, "train/kl_loss_r1": 0.02272321986965835, "train/total_kl": 0.061330341175198554 }, { "epoch": 1.5531994745730906, "grad_norm": 2.09375, "learning_rate": 1.8344594594594595e-05, "loss": 0.6602, "mean_token_accuracy": 0.9008495211601257, "step": 2070, "train/kl_loss_qwen": 0.038267128402367234, "train/kl_loss_r1": 0.024460298055782915, "train/total_kl": 0.06272742608562112 }, { "epoch": 1.5569525239256896, "grad_norm": 2.53125, "learning_rate": 1.8316441441441444e-05, "loss": 0.6784, "mean_token_accuracy": 0.8971472412347794, "step": 2075, "train/kl_loss_qwen": 0.0419050442520529, "train/kl_loss_r1": 0.024500356847420336, "train/total_kl": 0.06640540091320872 }, { "epoch": 1.5607055732782886, "grad_norm": 1.953125, "learning_rate": 1.828828828828829e-05, "loss": 0.6483, "mean_token_accuracy": 0.8951237499713898, "step": 2080, "train/kl_loss_qwen": 0.03391816089861095, "train/kl_loss_r1": 0.01974315377883613, "train/total_kl": 0.05366131514310837 }, { "epoch": 1.5644586226308876, "grad_norm": 2.375, "learning_rate": 1.8260135135135136e-05, "loss": 0.6596, "mean_token_accuracy": 0.9010801434516906, "step": 2085, "train/kl_loss_qwen": 0.04254875308834016, "train/kl_loss_r1": 0.023462942428886892, "train/total_kl": 0.06601169584318996 }, { "epoch": 1.5682116719834864, "grad_norm": 2.1875, "learning_rate": 1.8231981981981985e-05, "loss": 0.6299, "mean_token_accuracy": 0.8970382899045944, "step": 2090, "train/kl_loss_qwen": 0.03471034588292241, "train/kl_loss_r1": 0.021927068615332244, "train/total_kl": 0.0566374147310853 }, { "epoch": 1.5719647213360854, "grad_norm": 2.65625, "learning_rate": 1.820382882882883e-05, "loss": 0.6458, "mean_token_accuracy": 0.9013784170150757, "step": 2095, "train/kl_loss_qwen": 0.04169517187401652, "train/kl_loss_r1": 0.024561091884970666, "train/total_kl": 0.06625626292079687 }, { "epoch": 1.5757177706886845, "grad_norm": 2.171875, "learning_rate": 1.8175675675675676e-05, "loss": 0.6437, "mean_token_accuracy": 0.8984420299530029, "step": 2100, "train/kl_loss_qwen": 0.03708738945424557, "train/kl_loss_r1": 0.02213964704424143, "train/total_kl": 0.05922703584656119 }, { "epoch": 1.5794708200412835, "grad_norm": 2.96875, "learning_rate": 1.8147522522522525e-05, "loss": 0.636, "mean_token_accuracy": 0.8942008495330811, "step": 2105, "train/kl_loss_qwen": 0.028620942728593946, "train/kl_loss_r1": 0.018589144852012397, "train/total_kl": 0.04721008772030473 }, { "epoch": 1.5832238693938825, "grad_norm": 2.09375, "learning_rate": 1.811936936936937e-05, "loss": 0.6433, "mean_token_accuracy": 0.9032953917980194, "step": 2110, "train/kl_loss_qwen": 0.04077963996678591, "train/kl_loss_r1": 0.02312437235377729, "train/total_kl": 0.06390401273965836 }, { "epoch": 1.5869769187464815, "grad_norm": 2.234375, "learning_rate": 1.8091216216216216e-05, "loss": 0.7082, "mean_token_accuracy": 0.8941286385059357, "step": 2115, "train/kl_loss_qwen": 0.04121659249067307, "train/kl_loss_r1": 0.022846509236842394, "train/total_kl": 0.06406310107558966 }, { "epoch": 1.5907299680990805, "grad_norm": 3.28125, "learning_rate": 1.8063063063063065e-05, "loss": 0.6491, "mean_token_accuracy": 0.9042773187160492, "step": 2120, "train/kl_loss_qwen": 0.03976739956997335, "train/kl_loss_r1": 0.023621071968227624, "train/total_kl": 0.06338847130537033 }, { "epoch": 1.5944830174516795, "grad_norm": 2.5, "learning_rate": 1.803490990990991e-05, "loss": 0.6262, "mean_token_accuracy": 0.9077206790447235, "step": 2125, "train/kl_loss_qwen": 0.03935662703588605, "train/kl_loss_r1": 0.022750586131587626, "train/total_kl": 0.06210721312090754 }, { "epoch": 1.5982360668042785, "grad_norm": 2.0625, "learning_rate": 1.8006756756756757e-05, "loss": 0.6299, "mean_token_accuracy": 0.8975888967514039, "step": 2130, "train/kl_loss_qwen": 0.037865397753193974, "train/kl_loss_r1": 0.021229323279112578, "train/total_kl": 0.05909472107887268 }, { "epoch": 1.6019891161568776, "grad_norm": 2.125, "learning_rate": 1.7978603603603606e-05, "loss": 0.6828, "mean_token_accuracy": 0.8985576778650284, "step": 2135, "train/kl_loss_qwen": 0.04367698361165821, "train/kl_loss_r1": 0.02365296697244048, "train/total_kl": 0.06732995035126806 }, { "epoch": 1.6057421655094766, "grad_norm": 2.984375, "learning_rate": 1.795045045045045e-05, "loss": 0.741, "mean_token_accuracy": 0.8831792622804642, "step": 2140, "train/kl_loss_qwen": 0.04365133550018072, "train/kl_loss_r1": 0.025468871323391797, "train/total_kl": 0.06912020705640316 }, { "epoch": 1.6094952148620756, "grad_norm": 2.5625, "learning_rate": 1.79222972972973e-05, "loss": 0.6598, "mean_token_accuracy": 0.8970428496599198, "step": 2145, "train/kl_loss_qwen": 0.034180917451158165, "train/kl_loss_r1": 0.02286825072951615, "train/total_kl": 0.0570491686463356 }, { "epoch": 1.6132482642146744, "grad_norm": 2.359375, "learning_rate": 1.7894144144144146e-05, "loss": 0.6644, "mean_token_accuracy": 0.8940432757139206, "step": 2150, "train/kl_loss_qwen": 0.035260153096169235, "train/kl_loss_r1": 0.021994050638750196, "train/total_kl": 0.05725420378148556 }, { "epoch": 1.6170013135672734, "grad_norm": 2.28125, "learning_rate": 1.786599099099099e-05, "loss": 0.6376, "mean_token_accuracy": 0.8957689791917801, "step": 2155, "train/kl_loss_qwen": 0.0388267389498651, "train/kl_loss_r1": 0.021107364958152176, "train/total_kl": 0.05993410395458341 }, { "epoch": 1.6207543629198724, "grad_norm": 2.234375, "learning_rate": 1.783783783783784e-05, "loss": 0.6592, "mean_token_accuracy": 0.9020599126815796, "step": 2160, "train/kl_loss_qwen": 0.04379240069538355, "train/kl_loss_r1": 0.025263063982129096, "train/total_kl": 0.06905546449124814 }, { "epoch": 1.6245074122724714, "grad_norm": 2.0, "learning_rate": 1.7809684684684686e-05, "loss": 0.62, "mean_token_accuracy": 0.909572035074234, "step": 2165, "train/kl_loss_qwen": 0.03788591339252889, "train/kl_loss_r1": 0.022449908265843987, "train/total_kl": 0.06033582193776965 }, { "epoch": 1.6282604616250702, "grad_norm": 2.59375, "learning_rate": 1.7781531531531532e-05, "loss": 0.6307, "mean_token_accuracy": 0.9034926325082779, "step": 2170, "train/kl_loss_qwen": 0.03140334081836045, "train/kl_loss_r1": 0.01981693026609719, "train/total_kl": 0.051220270432531835 }, { "epoch": 1.6320135109776692, "grad_norm": 3.140625, "learning_rate": 1.775337837837838e-05, "loss": 0.6078, "mean_token_accuracy": 0.9023738920688629, "step": 2175, "train/kl_loss_qwen": 0.030494816461578013, "train/kl_loss_r1": 0.019982940517365932, "train/total_kl": 0.050477756466716525 }, { "epoch": 1.6357665603302682, "grad_norm": 2.09375, "learning_rate": 1.7725225225225227e-05, "loss": 0.6261, "mean_token_accuracy": 0.9061200588941574, "step": 2180, "train/kl_loss_qwen": 0.037608364084735516, "train/kl_loss_r1": 0.023159870877861977, "train/total_kl": 0.06076823528856039 }, { "epoch": 1.6395196096828673, "grad_norm": 2.5625, "learning_rate": 1.7697072072072072e-05, "loss": 0.6209, "mean_token_accuracy": 0.9042865604162216, "step": 2185, "train/kl_loss_qwen": 0.03485631812363863, "train/kl_loss_r1": 0.021672707796096802, "train/total_kl": 0.05652902610599995 }, { "epoch": 1.6432726590354663, "grad_norm": 2.515625, "learning_rate": 1.766891891891892e-05, "loss": 0.6012, "mean_token_accuracy": 0.9039783835411072, "step": 2190, "train/kl_loss_qwen": 0.03550857813097537, "train/kl_loss_r1": 0.02138693048618734, "train/total_kl": 0.05689550880342722 }, { "epoch": 1.6470257083880653, "grad_norm": 2.296875, "learning_rate": 1.7640765765765767e-05, "loss": 0.668, "mean_token_accuracy": 0.9030372470617294, "step": 2195, "train/kl_loss_qwen": 0.04753458416089416, "train/kl_loss_r1": 0.02611639932729304, "train/total_kl": 0.07365098400041462 }, { "epoch": 1.6507787577406643, "grad_norm": 2.453125, "learning_rate": 1.7612612612612613e-05, "loss": 0.6292, "mean_token_accuracy": 0.8899801164865494, "step": 2200, "train/kl_loss_qwen": 0.03742695958353579, "train/kl_loss_r1": 0.022831895435228945, "train/total_kl": 0.060258854925632474 }, { "epoch": 1.6545318070932633, "grad_norm": 2.25, "learning_rate": 1.758445945945946e-05, "loss": 0.5998, "mean_token_accuracy": 0.9015161246061325, "step": 2205, "train/kl_loss_qwen": 0.029024596931412815, "train/kl_loss_r1": 0.018637486500665545, "train/total_kl": 0.04766208389773965 }, { "epoch": 1.6582848564458623, "grad_norm": 2.21875, "learning_rate": 1.7556306306306307e-05, "loss": 0.7259, "mean_token_accuracy": 0.8821407407522202, "step": 2210, "train/kl_loss_qwen": 0.04734089416451752, "train/kl_loss_r1": 0.02618039455264807, "train/total_kl": 0.07352128904312849 }, { "epoch": 1.6620379057984613, "grad_norm": 2.765625, "learning_rate": 1.7528153153153156e-05, "loss": 0.642, "mean_token_accuracy": 0.8945120990276336, "step": 2215, "train/kl_loss_qwen": 0.0319673310033977, "train/kl_loss_r1": 0.019030406884849072, "train/total_kl": 0.05099773760885 }, { "epoch": 1.6657909551510603, "grad_norm": 2.15625, "learning_rate": 1.7500000000000002e-05, "loss": 0.645, "mean_token_accuracy": 0.8960767388343811, "step": 2220, "train/kl_loss_qwen": 0.03604310783557594, "train/kl_loss_r1": 0.020090335281565785, "train/total_kl": 0.056133443396538495 }, { "epoch": 1.6695440045036594, "grad_norm": 2.578125, "learning_rate": 1.7471846846846847e-05, "loss": 0.6465, "mean_token_accuracy": 0.8933228254318237, "step": 2225, "train/kl_loss_qwen": 0.028659786516800522, "train/kl_loss_r1": 0.01866114339791238, "train/total_kl": 0.04732093075290322 }, { "epoch": 1.6732970538562584, "grad_norm": 2.453125, "learning_rate": 1.7443693693693697e-05, "loss": 0.6182, "mean_token_accuracy": 0.9031960755586624, "step": 2230, "train/kl_loss_qwen": 0.03483367273584008, "train/kl_loss_r1": 0.020910135982558132, "train/total_kl": 0.05574380857869983 }, { "epoch": 1.6770501032088572, "grad_norm": 2.75, "learning_rate": 1.7415540540540542e-05, "loss": 0.6383, "mean_token_accuracy": 0.8974160134792328, "step": 2235, "train/kl_loss_qwen": 0.029755527339875697, "train/kl_loss_r1": 0.020382949942722918, "train/total_kl": 0.050138477329164745 }, { "epoch": 1.6808031525614562, "grad_norm": 2.03125, "learning_rate": 1.7387387387387388e-05, "loss": 0.6439, "mean_token_accuracy": 0.9057151556015015, "step": 2240, "train/kl_loss_qwen": 0.04374876599758863, "train/kl_loss_r1": 0.026726429350674152, "train/total_kl": 0.07047519516199827 }, { "epoch": 1.6845562019140552, "grad_norm": 2.484375, "learning_rate": 1.7359234234234237e-05, "loss": 0.6869, "mean_token_accuracy": 0.8932524681091308, "step": 2245, "train/kl_loss_qwen": 0.043853827146813275, "train/kl_loss_r1": 0.02495257118716836, "train/total_kl": 0.06880639912560582 }, { "epoch": 1.6883092512666542, "grad_norm": 3.765625, "learning_rate": 1.7331081081081082e-05, "loss": 0.7045, "mean_token_accuracy": 0.9062951624393463, "step": 2250, "train/kl_loss_qwen": 0.05141198909841478, "train/kl_loss_r1": 0.027050549210980535, "train/total_kl": 0.07846253886818885 }, { "epoch": 1.692062300619253, "grad_norm": 2.375, "learning_rate": 1.7302927927927928e-05, "loss": 0.646, "mean_token_accuracy": 0.8936865895986557, "step": 2255, "train/kl_loss_qwen": 0.02825439111329615, "train/kl_loss_r1": 0.01830715793184936, "train/total_kl": 0.046561548765748736 }, { "epoch": 1.695815349971852, "grad_norm": 1.875, "learning_rate": 1.7274774774774777e-05, "loss": 0.6418, "mean_token_accuracy": 0.8941173821687698, "step": 2260, "train/kl_loss_qwen": 0.024399951938539742, "train/kl_loss_r1": 0.01719582751393318, "train/total_kl": 0.04159577945247293 }, { "epoch": 1.699568399324451, "grad_norm": 2.21875, "learning_rate": 1.7246621621621623e-05, "loss": 0.6441, "mean_token_accuracy": 0.9033589363098145, "step": 2265, "train/kl_loss_qwen": 0.03845631028525531, "train/kl_loss_r1": 0.023384080873802303, "train/total_kl": 0.061840390972793105 }, { "epoch": 1.70332144867705, "grad_norm": 2.109375, "learning_rate": 1.721846846846847e-05, "loss": 0.6912, "mean_token_accuracy": 0.8872569084167481, "step": 2270, "train/kl_loss_qwen": 0.03908129506744444, "train/kl_loss_r1": 0.02350794356316328, "train/total_kl": 0.06258923830464483 }, { "epoch": 1.707074498029649, "grad_norm": 2.140625, "learning_rate": 1.7190315315315317e-05, "loss": 0.6399, "mean_token_accuracy": 0.9103470027446747, "step": 2275, "train/kl_loss_qwen": 0.0428709767293185, "train/kl_loss_r1": 0.024058361165225507, "train/total_kl": 0.06692933682352305 }, { "epoch": 1.710827547382248, "grad_norm": 2.078125, "learning_rate": 1.7162162162162163e-05, "loss": 0.6621, "mean_token_accuracy": 0.8940898805856705, "step": 2280, "train/kl_loss_qwen": 0.03766034827567637, "train/kl_loss_r1": 0.02226076889783144, "train/total_kl": 0.05992111759260297 }, { "epoch": 1.714580596734847, "grad_norm": 2.8125, "learning_rate": 1.7134009009009012e-05, "loss": 0.6359, "mean_token_accuracy": 0.9065495610237122, "step": 2285, "train/kl_loss_qwen": 0.039660067204385994, "train/kl_loss_r1": 0.024249562667682766, "train/total_kl": 0.06390962991863489 }, { "epoch": 1.718333646087446, "grad_norm": 2.1875, "learning_rate": 1.7105855855855858e-05, "loss": 0.7075, "mean_token_accuracy": 0.8981125056743622, "step": 2290, "train/kl_loss_qwen": 0.04942654981277883, "train/kl_loss_r1": 0.027548507088795304, "train/total_kl": 0.07697505690157413 }, { "epoch": 1.7220866954400451, "grad_norm": 2.53125, "learning_rate": 1.7077702702702703e-05, "loss": 0.6808, "mean_token_accuracy": 0.8974245905876159, "step": 2295, "train/kl_loss_qwen": 0.03988172416575253, "train/kl_loss_r1": 0.02420841958373785, "train/total_kl": 0.06409014472737909 }, { "epoch": 1.7258397447926441, "grad_norm": 2.015625, "learning_rate": 1.7049549549549552e-05, "loss": 0.6455, "mean_token_accuracy": 0.8952881097793579, "step": 2300, "train/kl_loss_qwen": 0.03257768559269607, "train/kl_loss_r1": 0.020853790268301965, "train/total_kl": 0.05343147618696094 }, { "epoch": 1.7295927941452431, "grad_norm": 2.3125, "learning_rate": 1.7021396396396398e-05, "loss": 0.7375, "mean_token_accuracy": 0.9050968796014786, "step": 2305, "train/kl_loss_qwen": 0.05414223480038345, "train/kl_loss_r1": 0.03398309061303735, "train/total_kl": 0.08812532611191273 }, { "epoch": 1.7333458434978422, "grad_norm": 2.0625, "learning_rate": 1.6993243243243244e-05, "loss": 0.648, "mean_token_accuracy": 0.9059912174940109, "step": 2310, "train/kl_loss_qwen": 0.04206879851408303, "train/kl_loss_r1": 0.024805049877613783, "train/total_kl": 0.06687384815886617 }, { "epoch": 1.737098892850441, "grad_norm": 2.1875, "learning_rate": 1.6965090090090093e-05, "loss": 0.6396, "mean_token_accuracy": 0.8993474274873734, "step": 2315, "train/kl_loss_qwen": 0.03376688486896455, "train/kl_loss_r1": 0.02014004997909069, "train/total_kl": 0.05390693554654717 }, { "epoch": 1.74085194220304, "grad_norm": 4.09375, "learning_rate": 1.693693693693694e-05, "loss": 0.6538, "mean_token_accuracy": 0.8981065779924393, "step": 2320, "train/kl_loss_qwen": 0.03625017390586436, "train/kl_loss_r1": 0.022838318720459938, "train/total_kl": 0.059088492393493654 }, { "epoch": 1.744604991555639, "grad_norm": 2.609375, "learning_rate": 1.6908783783783784e-05, "loss": 0.6706, "mean_token_accuracy": 0.8976942479610444, "step": 2325, "train/kl_loss_qwen": 0.04188382257707417, "train/kl_loss_r1": 0.023405383294448256, "train/total_kl": 0.06528920531272889 }, { "epoch": 1.748358040908238, "grad_norm": 3.390625, "learning_rate": 1.6880630630630633e-05, "loss": 0.65, "mean_token_accuracy": 0.8928337901830673, "step": 2330, "train/kl_loss_qwen": 0.02700037518516183, "train/kl_loss_r1": 0.018946082750335335, "train/total_kl": 0.045946458261460064 }, { "epoch": 1.7521110902608368, "grad_norm": 2.78125, "learning_rate": 1.685247747747748e-05, "loss": 0.6483, "mean_token_accuracy": 0.8990386724472046, "step": 2335, "train/kl_loss_qwen": 0.038460137275978926, "train/kl_loss_r1": 0.022701377421617507, "train/total_kl": 0.0611615146510303 }, { "epoch": 1.7558641396134358, "grad_norm": 2.171875, "learning_rate": 1.6824324324324324e-05, "loss": 0.6027, "mean_token_accuracy": 0.9036147683858872, "step": 2340, "train/kl_loss_qwen": 0.03626009058207273, "train/kl_loss_r1": 0.020470161689445376, "train/total_kl": 0.056730252131819724 }, { "epoch": 1.7596171889660348, "grad_norm": 2.4375, "learning_rate": 1.6796171171171173e-05, "loss": 0.6522, "mean_token_accuracy": 0.9036729842424392, "step": 2345, "train/kl_loss_qwen": 0.040476148249581456, "train/kl_loss_r1": 0.024120061844587325, "train/total_kl": 0.06459621032699943 }, { "epoch": 1.7633702383186338, "grad_norm": 2.421875, "learning_rate": 1.676801801801802e-05, "loss": 0.6585, "mean_token_accuracy": 0.8919114947319031, "step": 2350, "train/kl_loss_qwen": 0.03886307771317661, "train/kl_loss_r1": 0.02233870788477361, "train/total_kl": 0.061201786156743765 }, { "epoch": 1.7671232876712328, "grad_norm": 3.59375, "learning_rate": 1.6739864864864868e-05, "loss": 0.6984, "mean_token_accuracy": 0.891047352552414, "step": 2355, "train/kl_loss_qwen": 0.03393220230937004, "train/kl_loss_r1": 0.021642787707969548, "train/total_kl": 0.05557498997077346 }, { "epoch": 1.7708763370238318, "grad_norm": 2.546875, "learning_rate": 1.6711711711711714e-05, "loss": 0.63, "mean_token_accuracy": 0.8927449464797974, "step": 2360, "train/kl_loss_qwen": 0.02976813670247793, "train/kl_loss_r1": 0.01950657251290977, "train/total_kl": 0.049274709261953833 }, { "epoch": 1.7746293863764309, "grad_norm": 2.359375, "learning_rate": 1.668355855855856e-05, "loss": 0.6581, "mean_token_accuracy": 0.9035369455814362, "step": 2365, "train/kl_loss_qwen": 0.042285366402938965, "train/kl_loss_r1": 0.024320347933098674, "train/total_kl": 0.06660571470856666 }, { "epoch": 1.7783824357290299, "grad_norm": 2.296875, "learning_rate": 1.665540540540541e-05, "loss": 0.6727, "mean_token_accuracy": 0.902328222990036, "step": 2370, "train/kl_loss_qwen": 0.04390562102198601, "train/kl_loss_r1": 0.025772933289408682, "train/total_kl": 0.06967855421826244 }, { "epoch": 1.782135485081629, "grad_norm": 3.859375, "learning_rate": 1.6627252252252254e-05, "loss": 0.6492, "mean_token_accuracy": 0.8949781268835068, "step": 2375, "train/kl_loss_qwen": 0.03299745530821383, "train/kl_loss_r1": 0.020956188859418034, "train/total_kl": 0.05395364463329315 }, { "epoch": 1.785888534434228, "grad_norm": 2.171875, "learning_rate": 1.65990990990991e-05, "loss": 0.6654, "mean_token_accuracy": 0.9052214354276658, "step": 2380, "train/kl_loss_qwen": 0.04478082228451967, "train/kl_loss_r1": 0.026699409168213607, "train/total_kl": 0.0714802322909236 }, { "epoch": 1.789641583786827, "grad_norm": 2.671875, "learning_rate": 1.657094594594595e-05, "loss": 0.6821, "mean_token_accuracy": 0.8889921605587006, "step": 2385, "train/kl_loss_qwen": 0.027508549252524973, "train/kl_loss_r1": 0.018551756348460912, "train/total_kl": 0.046060305833816526 }, { "epoch": 1.793394633139426, "grad_norm": 2.546875, "learning_rate": 1.6542792792792794e-05, "loss": 0.6535, "mean_token_accuracy": 0.9026600360870362, "step": 2390, "train/kl_loss_qwen": 0.04096120540052652, "train/kl_loss_r1": 0.023385793343186377, "train/total_kl": 0.06434699958190322 }, { "epoch": 1.7971476824920247, "grad_norm": 2.84375, "learning_rate": 1.651463963963964e-05, "loss": 0.6864, "mean_token_accuracy": 0.8991068810224533, "step": 2395, "train/kl_loss_qwen": 0.04450701423920691, "train/kl_loss_r1": 0.026761355437338354, "train/total_kl": 0.07126836953684687 }, { "epoch": 1.8009007318446237, "grad_norm": 2.6875, "learning_rate": 1.648648648648649e-05, "loss": 0.6365, "mean_token_accuracy": 0.9044661819934845, "step": 2400, "train/kl_loss_qwen": 0.035820856038480994, "train/kl_loss_r1": 0.02220798176713288, "train/total_kl": 0.05802883738651872 }, { "epoch": 1.8046537811972228, "grad_norm": 2.265625, "learning_rate": 1.6458333333333335e-05, "loss": 0.6152, "mean_token_accuracy": 0.9035373657941819, "step": 2405, "train/kl_loss_qwen": 0.0363229691516608, "train/kl_loss_r1": 0.022318302607163786, "train/total_kl": 0.05864127120003104 }, { "epoch": 1.8084068305498218, "grad_norm": 2.46875, "learning_rate": 1.6430180180180184e-05, "loss": 0.6387, "mean_token_accuracy": 0.895477882027626, "step": 2410, "train/kl_loss_qwen": 0.027183825010433794, "train/kl_loss_r1": 0.01949266265146434, "train/total_kl": 0.046676487661898136 }, { "epoch": 1.8121598799024206, "grad_norm": 2.171875, "learning_rate": 1.640202702702703e-05, "loss": 0.6954, "mean_token_accuracy": 0.8863406032323837, "step": 2415, "train/kl_loss_qwen": 0.042424371792003514, "train/kl_loss_r1": 0.023042496014386415, "train/total_kl": 0.06546686785295605 }, { "epoch": 1.8159129292550196, "grad_norm": 2.296875, "learning_rate": 1.6373873873873875e-05, "loss": 0.6458, "mean_token_accuracy": 0.8962538540363312, "step": 2420, "train/kl_loss_qwen": 0.03665523463860154, "train/kl_loss_r1": 0.021400606958195567, "train/total_kl": 0.05805584192276001 }, { "epoch": 1.8196659786076186, "grad_norm": 2.25, "learning_rate": 1.6345720720720724e-05, "loss": 0.6925, "mean_token_accuracy": 0.8971156001091003, "step": 2425, "train/kl_loss_qwen": 0.045820884173735976, "train/kl_loss_r1": 0.026553369453176857, "train/total_kl": 0.07237425344064832 }, { "epoch": 1.8234190279602176, "grad_norm": 2.234375, "learning_rate": 1.631756756756757e-05, "loss": 0.6525, "mean_token_accuracy": 0.8997704178094864, "step": 2430, "train/kl_loss_qwen": 0.04271438363939524, "train/kl_loss_r1": 0.023357636108994485, "train/total_kl": 0.06607202040031553 }, { "epoch": 1.8271720773128166, "grad_norm": 2.65625, "learning_rate": 1.6289414414414415e-05, "loss": 0.6964, "mean_token_accuracy": 0.8842611312866211, "step": 2435, "train/kl_loss_qwen": 0.029302482306957246, "train/kl_loss_r1": 0.019395927991718055, "train/total_kl": 0.048698410671204326 }, { "epoch": 1.8309251266654156, "grad_norm": 2.6875, "learning_rate": 1.6261261261261264e-05, "loss": 0.6202, "mean_token_accuracy": 0.9004896342754364, "step": 2440, "train/kl_loss_qwen": 0.03328801547177136, "train/kl_loss_r1": 0.021958896471187473, "train/total_kl": 0.055246911384165286 }, { "epoch": 1.8346781760180146, "grad_norm": 2.359375, "learning_rate": 1.623310810810811e-05, "loss": 0.6904, "mean_token_accuracy": 0.8995136767625809, "step": 2445, "train/kl_loss_qwen": 0.04684069836512208, "train/kl_loss_r1": 0.026657813135534524, "train/total_kl": 0.07349851159378887 }, { "epoch": 1.8384312253706137, "grad_norm": 2.03125, "learning_rate": 1.6204954954954956e-05, "loss": 0.658, "mean_token_accuracy": 0.9060713022947311, "step": 2450, "train/kl_loss_qwen": 0.044447452668100594, "train/kl_loss_r1": 0.025366590777412056, "train/total_kl": 0.069814043212682 }, { "epoch": 1.8421842747232127, "grad_norm": 3.03125, "learning_rate": 1.6176801801801805e-05, "loss": 0.6285, "mean_token_accuracy": 0.8991561025381088, "step": 2455, "train/kl_loss_qwen": 0.029106603050604463, "train/kl_loss_r1": 0.019336808985099197, "train/total_kl": 0.04844341184943914 }, { "epoch": 1.8459373240758117, "grad_norm": 2.375, "learning_rate": 1.614864864864865e-05, "loss": 0.6394, "mean_token_accuracy": 0.8926957219839096, "step": 2460, "train/kl_loss_qwen": 0.03371071880683303, "train/kl_loss_r1": 0.022470697574317456, "train/total_kl": 0.0561814159154892 }, { "epoch": 1.8496903734284107, "grad_norm": 2.5, "learning_rate": 1.6120495495495496e-05, "loss": 0.6631, "mean_token_accuracy": 0.8949247121810913, "step": 2465, "train/kl_loss_qwen": 0.03434062139131129, "train/kl_loss_r1": 0.022925343550741672, "train/total_kl": 0.05726596564054489 }, { "epoch": 1.8534434227810097, "grad_norm": 2.25, "learning_rate": 1.6092342342342345e-05, "loss": 0.6486, "mean_token_accuracy": 0.8995777875185013, "step": 2470, "train/kl_loss_qwen": 0.03591888290829957, "train/kl_loss_r1": 0.022369566606357694, "train/total_kl": 0.05828845025971532 }, { "epoch": 1.8571964721336087, "grad_norm": 2.125, "learning_rate": 1.606418918918919e-05, "loss": 0.624, "mean_token_accuracy": 0.8977777779102325, "step": 2475, "train/kl_loss_qwen": 0.03605815744958818, "train/kl_loss_r1": 0.021802827855572103, "train/total_kl": 0.057860984653234485 }, { "epoch": 1.8609495214862075, "grad_norm": 2.53125, "learning_rate": 1.603603603603604e-05, "loss": 0.6602, "mean_token_accuracy": 0.8929906249046325, "step": 2480, "train/kl_loss_qwen": 0.03511486439965665, "train/kl_loss_r1": 0.021810925099998713, "train/total_kl": 0.056925789546221496 }, { "epoch": 1.8647025708388065, "grad_norm": 2.171875, "learning_rate": 1.6007882882882885e-05, "loss": 0.628, "mean_token_accuracy": 0.9025939643383026, "step": 2485, "train/kl_loss_qwen": 0.03195135928690433, "train/kl_loss_r1": 0.020892154052853586, "train/total_kl": 0.05284351296722889 }, { "epoch": 1.8684556201914055, "grad_norm": 5.0, "learning_rate": 1.597972972972973e-05, "loss": 0.7183, "mean_token_accuracy": 0.8897970050573349, "step": 2490, "train/kl_loss_qwen": 0.04254669458605349, "train/kl_loss_r1": 0.028625112492591143, "train/total_kl": 0.07117180703207851 }, { "epoch": 1.8722086695440046, "grad_norm": 2.234375, "learning_rate": 1.595157657657658e-05, "loss": 0.6634, "mean_token_accuracy": 0.9010548859834671, "step": 2495, "train/kl_loss_qwen": 0.043688770523294805, "train/kl_loss_r1": 0.02604842819273472, "train/total_kl": 0.0697371986694634 }, { "epoch": 1.8759617188966033, "grad_norm": 2.828125, "learning_rate": 1.5923423423423422e-05, "loss": 0.6302, "mean_token_accuracy": 0.8924409061670303, "step": 2500, "train/kl_loss_qwen": 0.03589551253244281, "train/kl_loss_r1": 0.021566737676039338, "train/total_kl": 0.057462250161916015 }, { "epoch": 1.8797147682492024, "grad_norm": 3.140625, "learning_rate": 1.5895270270270268e-05, "loss": 0.6238, "mean_token_accuracy": 0.8932481467723846, "step": 2505, "train/kl_loss_qwen": 0.03078452721238136, "train/kl_loss_r1": 0.01884332112967968, "train/total_kl": 0.04962784806266427 }, { "epoch": 1.8834678176018014, "grad_norm": 2.328125, "learning_rate": 1.5867117117117117e-05, "loss": 0.6864, "mean_token_accuracy": 0.9002302587032318, "step": 2510, "train/kl_loss_qwen": 0.040710377506911755, "train/kl_loss_r1": 0.027830192539840936, "train/total_kl": 0.06854057023301721 }, { "epoch": 1.8872208669544004, "grad_norm": 2.265625, "learning_rate": 1.5838963963963963e-05, "loss": 0.685, "mean_token_accuracy": 0.9001519799232482, "step": 2515, "train/kl_loss_qwen": 0.04527458641678095, "train/kl_loss_r1": 0.027129481686279176, "train/total_kl": 0.07240406852215528 }, { "epoch": 1.8909739163069994, "grad_norm": 4.4375, "learning_rate": 1.5810810810810808e-05, "loss": 0.734, "mean_token_accuracy": 0.8838595479726792, "step": 2520, "train/kl_loss_qwen": 0.04631765298545361, "train/kl_loss_r1": 0.02677953545935452, "train/total_kl": 0.07309718886390329 }, { "epoch": 1.8947269656595984, "grad_norm": 2.046875, "learning_rate": 1.5782657657657657e-05, "loss": 0.6364, "mean_token_accuracy": 0.897225198149681, "step": 2525, "train/kl_loss_qwen": 0.03321312516927719, "train/kl_loss_r1": 0.021134045580402015, "train/total_kl": 0.054347170796245334 }, { "epoch": 1.8984800150121974, "grad_norm": 1.984375, "learning_rate": 1.5754504504504503e-05, "loss": 0.6595, "mean_token_accuracy": 0.9082975298166275, "step": 2530, "train/kl_loss_qwen": 0.046546011511236426, "train/kl_loss_r1": 0.027138574048876762, "train/total_kl": 0.07368458630517125 }, { "epoch": 1.9022330643647964, "grad_norm": 2.5625, "learning_rate": 1.572635135135135e-05, "loss": 0.6913, "mean_token_accuracy": 0.8941433936357498, "step": 2535, "train/kl_loss_qwen": 0.042869471944868565, "train/kl_loss_r1": 0.024872014205902813, "train/total_kl": 0.06774148521944881 }, { "epoch": 1.9059861137173955, "grad_norm": 3.90625, "learning_rate": 1.5698198198198198e-05, "loss": 0.6445, "mean_token_accuracy": 0.8958324611186981, "step": 2540, "train/kl_loss_qwen": 0.026003137696534395, "train/kl_loss_r1": 0.01718523451127112, "train/total_kl": 0.04318837262690067 }, { "epoch": 1.9097391630699945, "grad_norm": 2.34375, "learning_rate": 1.5670045045045043e-05, "loss": 0.6107, "mean_token_accuracy": 0.9057632029056549, "step": 2545, "train/kl_loss_qwen": 0.028932252386584877, "train/kl_loss_r1": 0.019510349445044994, "train/total_kl": 0.04844260262325406 }, { "epoch": 1.9134922124225935, "grad_norm": 2.890625, "learning_rate": 1.5641891891891892e-05, "loss": 0.6741, "mean_token_accuracy": 0.898052641749382, "step": 2550, "train/kl_loss_qwen": 0.04487997838295996, "train/kl_loss_r1": 0.02543866541236639, "train/total_kl": 0.07031864309683442 }, { "epoch": 1.9172452617751925, "grad_norm": 2.671875, "learning_rate": 1.5613738738738738e-05, "loss": 0.6402, "mean_token_accuracy": 0.8991858065128326, "step": 2555, "train/kl_loss_qwen": 0.036262226989492774, "train/kl_loss_r1": 0.021829276252537964, "train/total_kl": 0.05809150356799364 }, { "epoch": 1.9209983111277913, "grad_norm": 2.234375, "learning_rate": 1.5585585585585584e-05, "loss": 0.6416, "mean_token_accuracy": 0.9058014422655105, "step": 2560, "train/kl_loss_qwen": 0.04190314500592649, "train/kl_loss_r1": 0.022653905022889376, "train/total_kl": 0.06455705035477877 }, { "epoch": 1.9247513604803903, "grad_norm": 1.890625, "learning_rate": 1.5557432432432433e-05, "loss": 0.6556, "mean_token_accuracy": 0.9057673960924149, "step": 2565, "train/kl_loss_qwen": 0.04168571154586971, "train/kl_loss_r1": 0.02547265887260437, "train/total_kl": 0.06715837102383375 }, { "epoch": 1.9285044098329893, "grad_norm": 2.03125, "learning_rate": 1.5529279279279278e-05, "loss": 0.6949, "mean_token_accuracy": 0.8979399770498275, "step": 2570, "train/kl_loss_qwen": 0.044487979961559176, "train/kl_loss_r1": 0.024335165927186608, "train/total_kl": 0.0688231460750103 }, { "epoch": 1.9322574591855883, "grad_norm": 2.671875, "learning_rate": 1.5501126126126124e-05, "loss": 0.6949, "mean_token_accuracy": 0.8990555852651596, "step": 2575, "train/kl_loss_qwen": 0.044843436265364287, "train/kl_loss_r1": 0.025624512927606702, "train/total_kl": 0.07046794975176454 }, { "epoch": 1.9360105085381871, "grad_norm": 2.421875, "learning_rate": 1.5472972972972973e-05, "loss": 0.6969, "mean_token_accuracy": 0.8940569669008255, "step": 2580, "train/kl_loss_qwen": 0.04509501978754997, "train/kl_loss_r1": 0.022757333144545554, "train/total_kl": 0.06785235274583101 }, { "epoch": 1.9397635578907861, "grad_norm": 2.078125, "learning_rate": 1.544481981981982e-05, "loss": 0.6293, "mean_token_accuracy": 0.8902778685092926, "step": 2585, "train/kl_loss_qwen": 0.025324915908277033, "train/kl_loss_r1": 0.0162981690838933, "train/total_kl": 0.04162308508530259 }, { "epoch": 1.9435166072433852, "grad_norm": 2.3125, "learning_rate": 1.5416666666666664e-05, "loss": 0.6761, "mean_token_accuracy": 0.8929882168769836, "step": 2590, "train/kl_loss_qwen": 0.044043076876550916, "train/kl_loss_r1": 0.02439775476232171, "train/total_kl": 0.06844083098694682 }, { "epoch": 1.9472696565959842, "grad_norm": 2.265625, "learning_rate": 1.5388513513513513e-05, "loss": 0.6411, "mean_token_accuracy": 0.8958060652017593, "step": 2595, "train/kl_loss_qwen": 0.0404059233609587, "train/kl_loss_r1": 0.022264586249366402, "train/total_kl": 0.06267051044851542 }, { "epoch": 1.9510227059485832, "grad_norm": 2.40625, "learning_rate": 1.536036036036036e-05, "loss": 0.6775, "mean_token_accuracy": 0.8902673900127411, "step": 2600, "train/kl_loss_qwen": 0.0354644276201725, "train/kl_loss_r1": 0.022069192258641124, "train/total_kl": 0.05753362011164427 }, { "epoch": 1.9547757553011822, "grad_norm": 2.375, "learning_rate": 1.5332207207207205e-05, "loss": 0.6194, "mean_token_accuracy": 0.9009991466999054, "step": 2605, "train/kl_loss_qwen": 0.03405302995815873, "train/kl_loss_r1": 0.020596451964229344, "train/total_kl": 0.054649482294917104 }, { "epoch": 1.9585288046537812, "grad_norm": 2.5625, "learning_rate": 1.5304054054054054e-05, "loss": 0.6243, "mean_token_accuracy": 0.901807826757431, "step": 2610, "train/kl_loss_qwen": 0.03377542248927057, "train/kl_loss_r1": 0.019333705538883805, "train/total_kl": 0.05310912802815437 }, { "epoch": 1.9622818540063802, "grad_norm": 2.34375, "learning_rate": 1.52759009009009e-05, "loss": 0.6525, "mean_token_accuracy": 0.8945951163768768, "step": 2615, "train/kl_loss_qwen": 0.03728666617535055, "train/kl_loss_r1": 0.023089352110400797, "train/total_kl": 0.06037601875141263 }, { "epoch": 1.9660349033589792, "grad_norm": 2.3125, "learning_rate": 1.5247747747747747e-05, "loss": 0.6656, "mean_token_accuracy": 0.8967136681079865, "step": 2620, "train/kl_loss_qwen": 0.040263551147654654, "train/kl_loss_r1": 0.02349916808307171, "train/total_kl": 0.06376271946355701 }, { "epoch": 1.9697879527115782, "grad_norm": 2.484375, "learning_rate": 1.5219594594594594e-05, "loss": 0.7433, "mean_token_accuracy": 0.8890212267637253, "step": 2625, "train/kl_loss_qwen": 0.04862540089525282, "train/kl_loss_r1": 0.02606220580637455, "train/total_kl": 0.07468760693445801 }, { "epoch": 1.9735410020641773, "grad_norm": 2.765625, "learning_rate": 1.5191441441441441e-05, "loss": 0.6326, "mean_token_accuracy": 0.905896446108818, "step": 2630, "train/kl_loss_qwen": 0.036712908372282985, "train/kl_loss_r1": 0.022241059923544526, "train/total_kl": 0.05895396815612912 }, { "epoch": 1.9772940514167763, "grad_norm": 2.328125, "learning_rate": 1.5163288288288287e-05, "loss": 0.61, "mean_token_accuracy": 0.8993132084608078, "step": 2635, "train/kl_loss_qwen": 0.030034108366817237, "train/kl_loss_r1": 0.019998513581231236, "train/total_kl": 0.050032622180879116 }, { "epoch": 1.981047100769375, "grad_norm": 1.9609375, "learning_rate": 1.5135135135135134e-05, "loss": 0.7277, "mean_token_accuracy": 0.8941838622093201, "step": 2640, "train/kl_loss_qwen": 0.045652749948203564, "train/kl_loss_r1": 0.02867605178616941, "train/total_kl": 0.07432880057021976 }, { "epoch": 1.984800150121974, "grad_norm": 2.34375, "learning_rate": 1.5106981981981982e-05, "loss": 0.6712, "mean_token_accuracy": 0.9011097520589828, "step": 2645, "train/kl_loss_qwen": 0.04273656592704356, "train/kl_loss_r1": 0.024876082316040993, "train/total_kl": 0.06761264828965068 }, { "epoch": 1.988553199474573, "grad_norm": 2.15625, "learning_rate": 1.5078828828828827e-05, "loss": 0.6631, "mean_token_accuracy": 0.9097787618637085, "step": 2650, "train/kl_loss_qwen": 0.04512282339856029, "train/kl_loss_r1": 0.02762483968399465, "train/total_kl": 0.07274766266345978 }, { "epoch": 1.992306248827172, "grad_norm": 2.421875, "learning_rate": 1.5050675675675674e-05, "loss": 0.7407, "mean_token_accuracy": 0.8982425272464752, "step": 2655, "train/kl_loss_qwen": 0.05134777058847249, "train/kl_loss_r1": 0.03388720662333071, "train/total_kl": 0.08523497739806771 }, { "epoch": 1.996059298179771, "grad_norm": 2.546875, "learning_rate": 1.5022522522522522e-05, "loss": 0.6543, "mean_token_accuracy": 0.8952676713466644, "step": 2660, "train/kl_loss_qwen": 0.034134725807234645, "train/kl_loss_r1": 0.022086436208337546, "train/total_kl": 0.05622116271406412 }, { "epoch": 1.99981234753237, "grad_norm": 2.78125, "learning_rate": 1.4994369369369371e-05, "loss": 0.6699, "mean_token_accuracy": 0.905188474059105, "step": 2665, "train/kl_loss_qwen": 0.04267058554105461, "train/kl_loss_r1": 0.025924119912087918, "train/total_kl": 0.06859470587223768 }, { "epoch": 2.003002439482079, "grad_norm": 2.671875, "learning_rate": 1.4966216216216217e-05, "loss": 0.5866, "mean_token_accuracy": 0.9284321490456077, "step": 2670, "train/kl_loss_qwen": 0.03529138786389547, "train/kl_loss_r1": 0.022011635715470594, "train/total_kl": 0.05730302390806815 }, { "epoch": 2.006755488834678, "grad_norm": 1.6328125, "learning_rate": 1.4938063063063064e-05, "loss": 0.5229, "mean_token_accuracy": 0.9346529483795166, "step": 2675, "train/kl_loss_qwen": 0.038794494094327094, "train/kl_loss_r1": 0.020536230690777302, "train/total_kl": 0.05933072408661246 }, { "epoch": 2.010508538187277, "grad_norm": 1.890625, "learning_rate": 1.4909909909909911e-05, "loss": 0.5382, "mean_token_accuracy": 0.9333297491073609, "step": 2680, "train/kl_loss_qwen": 0.039200321026146415, "train/kl_loss_r1": 0.02334402627311647, "train/total_kl": 0.06254434688016772 }, { "epoch": 2.014261587539876, "grad_norm": 1.640625, "learning_rate": 1.4881756756756757e-05, "loss": 0.5865, "mean_token_accuracy": 0.9402651727199555, "step": 2685, "train/kl_loss_qwen": 0.05096025592647493, "train/kl_loss_r1": 0.02823121869005263, "train/total_kl": 0.07919147480279207 }, { "epoch": 2.018014636892475, "grad_norm": 1.6328125, "learning_rate": 1.4853603603603604e-05, "loss": 0.5996, "mean_token_accuracy": 0.9371675610542297, "step": 2690, "train/kl_loss_qwen": 0.05012912107631564, "train/kl_loss_r1": 0.02651134324260056, "train/total_kl": 0.07664046408608556 }, { "epoch": 2.021767686245074, "grad_norm": 1.546875, "learning_rate": 1.4825450450450452e-05, "loss": 0.5284, "mean_token_accuracy": 0.9431761652231216, "step": 2695, "train/kl_loss_qwen": 0.040003891987726095, "train/kl_loss_r1": 0.023336136527359486, "train/total_kl": 0.06334002930670976 }, { "epoch": 2.025520735597673, "grad_norm": 1.7734375, "learning_rate": 1.4797297297297299e-05, "loss": 0.5389, "mean_token_accuracy": 0.9353849530220032, "step": 2700, "train/kl_loss_qwen": 0.04013286265544593, "train/kl_loss_r1": 0.023519261833280326, "train/total_kl": 0.06365212500095367 }, { "epoch": 2.029273784950272, "grad_norm": 1.59375, "learning_rate": 1.4769144144144144e-05, "loss": 0.5444, "mean_token_accuracy": 0.9298721730709076, "step": 2705, "train/kl_loss_qwen": 0.03505720882676542, "train/kl_loss_r1": 0.020959292305633426, "train/total_kl": 0.056016501411795615 }, { "epoch": 2.0330268343028712, "grad_norm": 2.390625, "learning_rate": 1.4740990990990992e-05, "loss": 0.5417, "mean_token_accuracy": 0.9301694184541702, "step": 2710, "train/kl_loss_qwen": 0.03806868428364396, "train/kl_loss_r1": 0.022985676769167185, "train/total_kl": 0.06105436040088534 }, { "epoch": 2.0367798836554702, "grad_norm": 3.109375, "learning_rate": 1.471283783783784e-05, "loss": 0.6252, "mean_token_accuracy": 0.936267939209938, "step": 2715, "train/kl_loss_qwen": 0.051870274590328336, "train/kl_loss_r1": 0.02979482486844063, "train/total_kl": 0.0816650996915996 }, { "epoch": 2.0405329330080693, "grad_norm": 1.8984375, "learning_rate": 1.4684684684684685e-05, "loss": 0.5434, "mean_token_accuracy": 0.9378133803606034, "step": 2720, "train/kl_loss_qwen": 0.04338777447119355, "train/kl_loss_r1": 0.02462744093500078, "train/total_kl": 0.0680152153596282 }, { "epoch": 2.044285982360668, "grad_norm": 2.40625, "learning_rate": 1.4656531531531532e-05, "loss": 0.5725, "mean_token_accuracy": 0.9371558010578156, "step": 2725, "train/kl_loss_qwen": 0.04540781215764582, "train/kl_loss_r1": 0.02494020722806454, "train/total_kl": 0.07034801943227649 }, { "epoch": 2.048039031713267, "grad_norm": 2.109375, "learning_rate": 1.462837837837838e-05, "loss": 0.541, "mean_token_accuracy": 0.9365566194057464, "step": 2730, "train/kl_loss_qwen": 0.03833492188714445, "train/kl_loss_r1": 0.024261068552732468, "train/total_kl": 0.06259599067270756 }, { "epoch": 2.051792081065866, "grad_norm": 2.171875, "learning_rate": 1.4600225225225227e-05, "loss": 0.5604, "mean_token_accuracy": 0.9367622673511505, "step": 2735, "train/kl_loss_qwen": 0.04242282547056675, "train/kl_loss_r1": 0.02575512886978686, "train/total_kl": 0.06817795345559716 }, { "epoch": 2.055545130418465, "grad_norm": 1.90625, "learning_rate": 1.4572072072072072e-05, "loss": 0.5316, "mean_token_accuracy": 0.9340348184108734, "step": 2740, "train/kl_loss_qwen": 0.034276322834193705, "train/kl_loss_r1": 0.021242431038990615, "train/total_kl": 0.05551875364035368 }, { "epoch": 2.059298179771064, "grad_norm": 1.9453125, "learning_rate": 1.454391891891892e-05, "loss": 0.5167, "mean_token_accuracy": 0.9383042812347412, "step": 2745, "train/kl_loss_qwen": 0.03480586018413305, "train/kl_loss_r1": 0.022361103910952806, "train/total_kl": 0.05716696446761489 }, { "epoch": 2.063051229123663, "grad_norm": 1.859375, "learning_rate": 1.4515765765765767e-05, "loss": 0.5128, "mean_token_accuracy": 0.9425839811563492, "step": 2750, "train/kl_loss_qwen": 0.037367559224367144, "train/kl_loss_r1": 0.02356030042283237, "train/total_kl": 0.0609278591349721 }, { "epoch": 2.066804278476262, "grad_norm": 1.796875, "learning_rate": 1.4487612612612613e-05, "loss": 0.5459, "mean_token_accuracy": 0.9433245003223419, "step": 2755, "train/kl_loss_qwen": 0.04606554531492293, "train/kl_loss_r1": 0.026836787583306432, "train/total_kl": 0.07290233206003904 }, { "epoch": 2.070557327828861, "grad_norm": 1.828125, "learning_rate": 1.445945945945946e-05, "loss": 0.5175, "mean_token_accuracy": 0.9421418130397796, "step": 2760, "train/kl_loss_qwen": 0.039062590803951025, "train/kl_loss_r1": 0.02469899938441813, "train/total_kl": 0.063761589769274 }, { "epoch": 2.07431037718146, "grad_norm": 2.734375, "learning_rate": 1.4431306306306307e-05, "loss": 0.5476, "mean_token_accuracy": 0.9274614602327347, "step": 2765, "train/kl_loss_qwen": 0.03057148279622197, "train/kl_loss_r1": 0.020619633514434098, "train/total_kl": 0.05119111640378833 }, { "epoch": 2.078063426534059, "grad_norm": 1.875, "learning_rate": 1.4403153153153155e-05, "loss": 0.52, "mean_token_accuracy": 0.9378704875707626, "step": 2770, "train/kl_loss_qwen": 0.03401905889622867, "train/kl_loss_r1": 0.02245729574933648, "train/total_kl": 0.056476354505866765 }, { "epoch": 2.081816475886658, "grad_norm": 1.9453125, "learning_rate": 1.4375e-05, "loss": 0.5465, "mean_token_accuracy": 0.943485426902771, "step": 2775, "train/kl_loss_qwen": 0.043185991467908025, "train/kl_loss_r1": 0.0270145779941231, "train/total_kl": 0.07020056927576661 }, { "epoch": 2.085569525239257, "grad_norm": 2.15625, "learning_rate": 1.4346846846846848e-05, "loss": 0.5808, "mean_token_accuracy": 0.9374119788408279, "step": 2780, "train/kl_loss_qwen": 0.04530818494968116, "train/kl_loss_r1": 0.026854591304436327, "train/total_kl": 0.07216277718544006 }, { "epoch": 2.089322574591856, "grad_norm": 2.109375, "learning_rate": 1.4318693693693695e-05, "loss": 0.538, "mean_token_accuracy": 0.9360768616199493, "step": 2785, "train/kl_loss_qwen": 0.04038170026615262, "train/kl_loss_r1": 0.023084452422335745, "train/total_kl": 0.06346615301445127 }, { "epoch": 2.093075623944455, "grad_norm": 1.8046875, "learning_rate": 1.429054054054054e-05, "loss": 0.557, "mean_token_accuracy": 0.9383584886789322, "step": 2790, "train/kl_loss_qwen": 0.04247748665511608, "train/kl_loss_r1": 0.024677752703428268, "train/total_kl": 0.0671552394516766 }, { "epoch": 2.096828673297054, "grad_norm": 3.46875, "learning_rate": 1.4262387387387388e-05, "loss": 0.5629, "mean_token_accuracy": 0.9350256085395813, "step": 2795, "train/kl_loss_qwen": 0.03826589668169618, "train/kl_loss_r1": 0.022944721672683955, "train/total_kl": 0.061210617609322074 }, { "epoch": 2.100581722649653, "grad_norm": 1.9453125, "learning_rate": 1.4234234234234235e-05, "loss": 0.5308, "mean_token_accuracy": 0.939920824766159, "step": 2800, "train/kl_loss_qwen": 0.038421140238642695, "train/kl_loss_r1": 0.024384385114535688, "train/total_kl": 0.06280552502721548 }, { "epoch": 2.104334772002252, "grad_norm": 1.8203125, "learning_rate": 1.4206081081081083e-05, "loss": 0.5652, "mean_token_accuracy": 0.9412952274084091, "step": 2805, "train/kl_loss_qwen": 0.04530099257826805, "train/kl_loss_r1": 0.026747741783037782, "train/total_kl": 0.07204873552545905 }, { "epoch": 2.1080878213548506, "grad_norm": 1.8984375, "learning_rate": 1.4177927927927928e-05, "loss": 0.6096, "mean_token_accuracy": 0.930394884943962, "step": 2810, "train/kl_loss_qwen": 0.04740149336867035, "train/kl_loss_r1": 0.026018257485702634, "train/total_kl": 0.07341975113376975 }, { "epoch": 2.1118408707074496, "grad_norm": 2.171875, "learning_rate": 1.4149774774774776e-05, "loss": 0.5226, "mean_token_accuracy": 0.9398204326629639, "step": 2815, "train/kl_loss_qwen": 0.03849638062529266, "train/kl_loss_r1": 0.023003754345700143, "train/total_kl": 0.061500134877860546 }, { "epoch": 2.1155939200600486, "grad_norm": 2.625, "learning_rate": 1.4121621621621623e-05, "loss": 0.5582, "mean_token_accuracy": 0.9342907398939133, "step": 2820, "train/kl_loss_qwen": 0.042439007526263596, "train/kl_loss_r1": 0.023711348557844757, "train/total_kl": 0.06615035515278578 }, { "epoch": 2.1193469694126477, "grad_norm": 2.171875, "learning_rate": 1.4093468468468469e-05, "loss": 0.563, "mean_token_accuracy": 0.9395235121250153, "step": 2825, "train/kl_loss_qwen": 0.043938075797632335, "train/kl_loss_r1": 0.025616383599117398, "train/total_kl": 0.06955445893108844 }, { "epoch": 2.1231000187652467, "grad_norm": 2.625, "learning_rate": 1.4065315315315316e-05, "loss": 0.5054, "mean_token_accuracy": 0.9369919955730438, "step": 2830, "train/kl_loss_qwen": 0.03191206702031195, "train/kl_loss_r1": 0.02116851476021111, "train/total_kl": 0.053080581780523065 }, { "epoch": 2.1268530681178457, "grad_norm": 2.046875, "learning_rate": 1.4037162162162163e-05, "loss": 0.5352, "mean_token_accuracy": 0.9313021749258041, "step": 2835, "train/kl_loss_qwen": 0.034244656283408406, "train/kl_loss_r1": 0.02085883393883705, "train/total_kl": 0.05510349003598094 }, { "epoch": 2.1306061174704447, "grad_norm": 1.9765625, "learning_rate": 1.400900900900901e-05, "loss": 0.5108, "mean_token_accuracy": 0.9344165354967118, "step": 2840, "train/kl_loss_qwen": 0.03441030657850206, "train/kl_loss_r1": 0.02208532360382378, "train/total_kl": 0.05649562999606132 }, { "epoch": 2.1343591668230437, "grad_norm": 1.8515625, "learning_rate": 1.3980855855855856e-05, "loss": 0.561, "mean_token_accuracy": 0.9328974574804306, "step": 2845, "train/kl_loss_qwen": 0.04245760082267225, "train/kl_loss_r1": 0.02515069688670337, "train/total_kl": 0.06760829733684659 }, { "epoch": 2.1381122161756427, "grad_norm": 1.828125, "learning_rate": 1.3952702702702704e-05, "loss": 0.5009, "mean_token_accuracy": 0.9370256125926971, "step": 2850, "train/kl_loss_qwen": 0.03316999180242419, "train/kl_loss_r1": 0.02016733498312533, "train/total_kl": 0.05333732720464468 }, { "epoch": 2.1418652655282417, "grad_norm": 2.125, "learning_rate": 1.3924549549549551e-05, "loss": 0.5163, "mean_token_accuracy": 0.9422374963760376, "step": 2855, "train/kl_loss_qwen": 0.039404284209012985, "train/kl_loss_r1": 0.02388715702109039, "train/total_kl": 0.0632914412766695 }, { "epoch": 2.1456183148808408, "grad_norm": 1.703125, "learning_rate": 1.3896396396396397e-05, "loss": 0.5452, "mean_token_accuracy": 0.9346591323614121, "step": 2860, "train/kl_loss_qwen": 0.03737853961065411, "train/kl_loss_r1": 0.02262025591917336, "train/total_kl": 0.059998796228319405 }, { "epoch": 2.1493713642334398, "grad_norm": 1.78125, "learning_rate": 1.3868243243243244e-05, "loss": 0.5743, "mean_token_accuracy": 0.937825882434845, "step": 2865, "train/kl_loss_qwen": 0.04654515474103391, "train/kl_loss_r1": 0.026124754128977655, "train/total_kl": 0.07266990933567286 }, { "epoch": 2.153124413586039, "grad_norm": 2.265625, "learning_rate": 1.3840090090090091e-05, "loss": 0.6123, "mean_token_accuracy": 0.922364792227745, "step": 2870, "train/kl_loss_qwen": 0.04081809539347887, "train/kl_loss_r1": 0.024002627190202474, "train/total_kl": 0.06482072221115232 }, { "epoch": 2.156877462938638, "grad_norm": 2.75, "learning_rate": 1.3811936936936939e-05, "loss": 0.6156, "mean_token_accuracy": 0.9291838884353638, "step": 2875, "train/kl_loss_qwen": 0.047036360343918206, "train/kl_loss_r1": 0.02790973465889692, "train/total_kl": 0.07494609467685223 }, { "epoch": 2.160630512291237, "grad_norm": 1.90625, "learning_rate": 1.3783783783783784e-05, "loss": 0.5744, "mean_token_accuracy": 0.9351732730865479, "step": 2880, "train/kl_loss_qwen": 0.04357582703232765, "train/kl_loss_r1": 0.026025883946567775, "train/total_kl": 0.06960171181708574 }, { "epoch": 2.1643835616438354, "grad_norm": 1.734375, "learning_rate": 1.3755630630630632e-05, "loss": 0.5392, "mean_token_accuracy": 0.9364217579364776, "step": 2885, "train/kl_loss_qwen": 0.03916121292859316, "train/kl_loss_r1": 0.022491829935461283, "train/total_kl": 0.061653042957186696 }, { "epoch": 2.1681366109964344, "grad_norm": 2.65625, "learning_rate": 1.3727477477477479e-05, "loss": 0.5454, "mean_token_accuracy": 0.9335968852043152, "step": 2890, "train/kl_loss_qwen": 0.03318686801940203, "train/kl_loss_r1": 0.021574988728389144, "train/total_kl": 0.0547618567943573 }, { "epoch": 2.1718896603490334, "grad_norm": 2.03125, "learning_rate": 1.3699324324324325e-05, "loss": 0.5635, "mean_token_accuracy": 0.9308214575052262, "step": 2895, "train/kl_loss_qwen": 0.041395931225270036, "train/kl_loss_r1": 0.02332762386649847, "train/total_kl": 0.06472355434671044 }, { "epoch": 2.1756427097016324, "grad_norm": 3.078125, "learning_rate": 1.3671171171171172e-05, "loss": 0.5212, "mean_token_accuracy": 0.9229843825101852, "step": 2900, "train/kl_loss_qwen": 0.02835620930418372, "train/kl_loss_r1": 0.017738517560064792, "train/total_kl": 0.04609472677111626 }, { "epoch": 2.1793957590542314, "grad_norm": 2.09375, "learning_rate": 1.364301801801802e-05, "loss": 0.5051, "mean_token_accuracy": 0.9343967109918594, "step": 2905, "train/kl_loss_qwen": 0.0359275649767369, "train/kl_loss_r1": 0.0219997838139534, "train/total_kl": 0.05792734948918223 }, { "epoch": 2.1831488084068305, "grad_norm": 2.125, "learning_rate": 1.3614864864864867e-05, "loss": 0.5687, "mean_token_accuracy": 0.9289180606603622, "step": 2910, "train/kl_loss_qwen": 0.043711404176428915, "train/kl_loss_r1": 0.025724610220640896, "train/total_kl": 0.06943601546809078 }, { "epoch": 2.1869018577594295, "grad_norm": 2.125, "learning_rate": 1.358671171171171e-05, "loss": 0.4979, "mean_token_accuracy": 0.9360549032688141, "step": 2915, "train/kl_loss_qwen": 0.0300402055028826, "train/kl_loss_r1": 0.0205923215020448, "train/total_kl": 0.050632527004927395 }, { "epoch": 2.1906549071120285, "grad_norm": 2.34375, "learning_rate": 1.3558558558558558e-05, "loss": 0.5875, "mean_token_accuracy": 0.9278737664222717, "step": 2920, "train/kl_loss_qwen": 0.043786196783185, "train/kl_loss_r1": 0.025323738995939492, "train/total_kl": 0.06910993559285998 }, { "epoch": 2.1944079564646275, "grad_norm": 3.390625, "learning_rate": 1.3530405405405405e-05, "loss": 0.5316, "mean_token_accuracy": 0.9379894882440567, "step": 2925, "train/kl_loss_qwen": 0.03716716575436294, "train/kl_loss_r1": 0.02201431319117546, "train/total_kl": 0.059181479085236785 }, { "epoch": 2.1981610058172265, "grad_norm": 1.8515625, "learning_rate": 1.3502252252252251e-05, "loss": 0.5126, "mean_token_accuracy": 0.9497415542602539, "step": 2930, "train/kl_loss_qwen": 0.03827819037251175, "train/kl_loss_r1": 0.023396990727633238, "train/total_kl": 0.061675180681049824 }, { "epoch": 2.2019140551698255, "grad_norm": 3.5, "learning_rate": 1.3474099099099098e-05, "loss": 0.5099, "mean_token_accuracy": 0.9369021475315094, "step": 2935, "train/kl_loss_qwen": 0.029308402584865688, "train/kl_loss_r1": 0.020524240424856545, "train/total_kl": 0.049832642823457715 }, { "epoch": 2.2056671045224245, "grad_norm": 2.0, "learning_rate": 1.3445945945945946e-05, "loss": 0.5286, "mean_token_accuracy": 0.947816863656044, "step": 2940, "train/kl_loss_qwen": 0.040448572020977736, "train/kl_loss_r1": 0.02613919833675027, "train/total_kl": 0.06658776951953768 }, { "epoch": 2.2094201538750236, "grad_norm": 1.8359375, "learning_rate": 1.3417792792792793e-05, "loss": 0.5493, "mean_token_accuracy": 0.9422875761985778, "step": 2945, "train/kl_loss_qwen": 0.04237751713953912, "train/kl_loss_r1": 0.02594070523045957, "train/total_kl": 0.0683182223699987 }, { "epoch": 2.2131732032276226, "grad_norm": 2.546875, "learning_rate": 1.3389639639639639e-05, "loss": 0.662, "mean_token_accuracy": 0.9310304433107376, "step": 2950, "train/kl_loss_qwen": 0.058689125487580894, "train/kl_loss_r1": 0.033207002701237796, "train/total_kl": 0.09189612818881869 }, { "epoch": 2.2169262525802216, "grad_norm": 2.1875, "learning_rate": 1.3361486486486486e-05, "loss": 0.5382, "mean_token_accuracy": 0.9390515863895417, "step": 2955, "train/kl_loss_qwen": 0.041446970077231526, "train/kl_loss_r1": 0.02546785566955805, "train/total_kl": 0.06691482551395893 }, { "epoch": 2.2206793019328206, "grad_norm": 1.7109375, "learning_rate": 1.3333333333333333e-05, "loss": 0.5262, "mean_token_accuracy": 0.9294974207878113, "step": 2960, "train/kl_loss_qwen": 0.03314268705435097, "train/kl_loss_r1": 0.019529332965612413, "train/total_kl": 0.05267201904207468 }, { "epoch": 2.2244323512854196, "grad_norm": 2.53125, "learning_rate": 1.330518018018018e-05, "loss": 0.5259, "mean_token_accuracy": 0.9331434935331344, "step": 2965, "train/kl_loss_qwen": 0.03575447672046721, "train/kl_loss_r1": 0.021085081296041606, "train/total_kl": 0.05683955755084753 }, { "epoch": 2.2281854006380186, "grad_norm": 2.921875, "learning_rate": 1.3277027027027026e-05, "loss": 0.5353, "mean_token_accuracy": 0.9259840369224548, "step": 2970, "train/kl_loss_qwen": 0.029720848985016347, "train/kl_loss_r1": 0.019104212429374455, "train/total_kl": 0.04882506160065532 }, { "epoch": 2.231938449990617, "grad_norm": 2.21875, "learning_rate": 1.3248873873873874e-05, "loss": 0.5463, "mean_token_accuracy": 0.9294231235980988, "step": 2975, "train/kl_loss_qwen": 0.03764592856168747, "train/kl_loss_r1": 0.022270164219662547, "train/total_kl": 0.0599160929210484 }, { "epoch": 2.235691499343216, "grad_norm": 2.046875, "learning_rate": 1.3220720720720721e-05, "loss": 0.5329, "mean_token_accuracy": 0.9333685070276261, "step": 2980, "train/kl_loss_qwen": 0.035478117410093546, "train/kl_loss_r1": 0.021247773012146354, "train/total_kl": 0.056725890096277 }, { "epoch": 2.239444548695815, "grad_norm": 1.7734375, "learning_rate": 1.3192567567567567e-05, "loss": 0.578, "mean_token_accuracy": 0.9396042585372925, "step": 2985, "train/kl_loss_qwen": 0.04996556900441647, "train/kl_loss_r1": 0.02640064749866724, "train/total_kl": 0.0763662163168192 }, { "epoch": 2.2431975980484142, "grad_norm": 1.796875, "learning_rate": 1.3164414414414414e-05, "loss": 0.5218, "mean_token_accuracy": 0.9406999468803405, "step": 2990, "train/kl_loss_qwen": 0.038010914949700235, "train/kl_loss_r1": 0.02382657811976969, "train/total_kl": 0.06183749325573444 }, { "epoch": 2.2469506474010132, "grad_norm": 2.046875, "learning_rate": 1.3136261261261261e-05, "loss": 0.563, "mean_token_accuracy": 0.9369042903184891, "step": 2995, "train/kl_loss_qwen": 0.03981273928657174, "train/kl_loss_r1": 0.024143205443397164, "train/total_kl": 0.06395594468340278 }, { "epoch": 2.2507036967536123, "grad_norm": 1.984375, "learning_rate": 1.3108108108108109e-05, "loss": 0.5846, "mean_token_accuracy": 0.9288579165935517, "step": 3000, "train/kl_loss_qwen": 0.043740917649120095, "train/kl_loss_r1": 0.025398692348971963, "train/total_kl": 0.06913960874080657 }, { "epoch": 2.2544567461062113, "grad_norm": 2.234375, "learning_rate": 1.3079954954954954e-05, "loss": 0.5529, "mean_token_accuracy": 0.9287919521331787, "step": 3005, "train/kl_loss_qwen": 0.03622842230834067, "train/kl_loss_r1": 0.02267452417872846, "train/total_kl": 0.058902946207672356 }, { "epoch": 2.2582097954588103, "grad_norm": 3.8125, "learning_rate": 1.3051801801801802e-05, "loss": 0.5708, "mean_token_accuracy": 0.9316366136074066, "step": 3010, "train/kl_loss_qwen": 0.039876210317015645, "train/kl_loss_r1": 0.025454261200502516, "train/total_kl": 0.065330471098423 }, { "epoch": 2.2619628448114093, "grad_norm": 2.34375, "learning_rate": 1.3023648648648649e-05, "loss": 0.5521, "mean_token_accuracy": 0.9287123322486878, "step": 3015, "train/kl_loss_qwen": 0.03473481684923172, "train/kl_loss_r1": 0.021131755039095878, "train/total_kl": 0.05586657216772437 }, { "epoch": 2.2657158941640083, "grad_norm": 2.984375, "learning_rate": 1.2995495495495495e-05, "loss": 0.5178, "mean_token_accuracy": 0.9337947934865951, "step": 3020, "train/kl_loss_qwen": 0.035915958741679785, "train/kl_loss_r1": 0.02014762875624001, "train/total_kl": 0.0560635874979198 }, { "epoch": 2.2694689435166073, "grad_norm": 2.21875, "learning_rate": 1.2967342342342342e-05, "loss": 0.5513, "mean_token_accuracy": 0.938558641076088, "step": 3025, "train/kl_loss_qwen": 0.0410382560454309, "train/kl_loss_r1": 0.02633958971127868, "train/total_kl": 0.06737784529104829 }, { "epoch": 2.2732219928692063, "grad_norm": 2.46875, "learning_rate": 1.293918918918919e-05, "loss": 0.5233, "mean_token_accuracy": 0.9367934465408325, "step": 3030, "train/kl_loss_qwen": 0.03334038094617427, "train/kl_loss_r1": 0.022024092823266984, "train/total_kl": 0.05536447400227189 }, { "epoch": 2.2769750422218054, "grad_norm": 2.484375, "learning_rate": 1.2911036036036037e-05, "loss": 0.5496, "mean_token_accuracy": 0.9340452969074249, "step": 3035, "train/kl_loss_qwen": 0.041443832125514744, "train/kl_loss_r1": 0.02346867136657238, "train/total_kl": 0.06491250386461615 }, { "epoch": 2.2807280915744044, "grad_norm": 1.9765625, "learning_rate": 1.2882882882882882e-05, "loss": 0.5684, "mean_token_accuracy": 0.9405649453401566, "step": 3040, "train/kl_loss_qwen": 0.04632887695915997, "train/kl_loss_r1": 0.026997680915519594, "train/total_kl": 0.07332655768841505 }, { "epoch": 2.2844811409270034, "grad_norm": 1.671875, "learning_rate": 1.285472972972973e-05, "loss": 0.5785, "mean_token_accuracy": 0.9388915836811066, "step": 3045, "train/kl_loss_qwen": 0.04664509515278041, "train/kl_loss_r1": 0.028806798858568072, "train/total_kl": 0.07545189317315817 }, { "epoch": 2.288234190279602, "grad_norm": 2.03125, "learning_rate": 1.2826576576576577e-05, "loss": 0.549, "mean_token_accuracy": 0.942802557349205, "step": 3050, "train/kl_loss_qwen": 0.043018145067617294, "train/kl_loss_r1": 0.02463572332635522, "train/total_kl": 0.0676538685336709 }, { "epoch": 2.291987239632201, "grad_norm": 2.046875, "learning_rate": 1.2798423423423423e-05, "loss": 0.5146, "mean_token_accuracy": 0.9322921663522721, "step": 3055, "train/kl_loss_qwen": 0.0297826265450567, "train/kl_loss_r1": 0.01987147410400212, "train/total_kl": 0.04965410055592656 }, { "epoch": 2.2957402889848, "grad_norm": 1.78125, "learning_rate": 1.277027027027027e-05, "loss": 0.5288, "mean_token_accuracy": 0.9336327165365219, "step": 3060, "train/kl_loss_qwen": 0.031126489629969, "train/kl_loss_r1": 0.02163971494883299, "train/total_kl": 0.052766204718500374 }, { "epoch": 2.299493338337399, "grad_norm": 2.375, "learning_rate": 1.2742117117117117e-05, "loss": 0.5195, "mean_token_accuracy": 0.9313450574874877, "step": 3065, "train/kl_loss_qwen": 0.026634555822238327, "train/kl_loss_r1": 0.01898168446496129, "train/total_kl": 0.04561624005436897 }, { "epoch": 2.303246387689998, "grad_norm": 2.234375, "learning_rate": 1.2713963963963965e-05, "loss": 0.561, "mean_token_accuracy": 0.9352007538080216, "step": 3070, "train/kl_loss_qwen": 0.04229618958197534, "train/kl_loss_r1": 0.025796488486230375, "train/total_kl": 0.0680926782079041 }, { "epoch": 2.306999437042597, "grad_norm": 1.9453125, "learning_rate": 1.268581081081081e-05, "loss": 0.5083, "mean_token_accuracy": 0.9352661728858948, "step": 3075, "train/kl_loss_qwen": 0.036430867342278364, "train/kl_loss_r1": 0.022393257077783345, "train/total_kl": 0.058824124094098804 }, { "epoch": 2.310752486395196, "grad_norm": 1.609375, "learning_rate": 1.2657657657657658e-05, "loss": 0.5943, "mean_token_accuracy": 0.9433018922805786, "step": 3080, "train/kl_loss_qwen": 0.053476129472255704, "train/kl_loss_r1": 0.030378296645358203, "train/total_kl": 0.08385442551225424 }, { "epoch": 2.314505535747795, "grad_norm": 1.5703125, "learning_rate": 1.2629504504504505e-05, "loss": 0.5341, "mean_token_accuracy": 0.9477105677127838, "step": 3085, "train/kl_loss_qwen": 0.04390522614121437, "train/kl_loss_r1": 0.025548849394544958, "train/total_kl": 0.06945407623425126 }, { "epoch": 2.318258585100394, "grad_norm": 2.109375, "learning_rate": 1.260135135135135e-05, "loss": 0.555, "mean_token_accuracy": 0.9314184099435806, "step": 3090, "train/kl_loss_qwen": 0.039841002132743594, "train/kl_loss_r1": 0.0228716810233891, "train/total_kl": 0.06271268259733916 }, { "epoch": 2.322011634452993, "grad_norm": 2.171875, "learning_rate": 1.2573198198198198e-05, "loss": 0.5642, "mean_token_accuracy": 0.937423512339592, "step": 3095, "train/kl_loss_qwen": 0.042703565768897535, "train/kl_loss_r1": 0.025010303594172, "train/total_kl": 0.06771386964246631 }, { "epoch": 2.325764683805592, "grad_norm": 1.625, "learning_rate": 1.2545045045045045e-05, "loss": 0.5267, "mean_token_accuracy": 0.9374463945627213, "step": 3100, "train/kl_loss_qwen": 0.03558561257086694, "train/kl_loss_r1": 0.021157630579546095, "train/total_kl": 0.05674324333667755 }, { "epoch": 2.329517733158191, "grad_norm": 2.125, "learning_rate": 1.2516891891891893e-05, "loss": 0.5208, "mean_token_accuracy": 0.9341548919677735, "step": 3105, "train/kl_loss_qwen": 0.03378947116434574, "train/kl_loss_r1": 0.02182693681679666, "train/total_kl": 0.05561640774831176 }, { "epoch": 2.33327078251079, "grad_norm": 2.015625, "learning_rate": 1.2488738738738738e-05, "loss": 0.6083, "mean_token_accuracy": 0.9400612443685532, "step": 3110, "train/kl_loss_qwen": 0.04884338290430605, "train/kl_loss_r1": 0.02985413228161633, "train/total_kl": 0.07869751462712885 }, { "epoch": 2.337023831863389, "grad_norm": 1.6796875, "learning_rate": 1.2460585585585586e-05, "loss": 0.5328, "mean_token_accuracy": 0.9403836339712143, "step": 3115, "train/kl_loss_qwen": 0.0388734900392592, "train/kl_loss_r1": 0.024075880460441113, "train/total_kl": 0.06294937077909708 }, { "epoch": 2.340776881215988, "grad_norm": 1.9453125, "learning_rate": 1.2432432432432433e-05, "loss": 0.5283, "mean_token_accuracy": 0.936130028963089, "step": 3120, "train/kl_loss_qwen": 0.03456240138038993, "train/kl_loss_r1": 0.022217872831970454, "train/total_kl": 0.05678027486428618 }, { "epoch": 2.344529930568587, "grad_norm": 2.609375, "learning_rate": 1.2404279279279278e-05, "loss": 0.5287, "mean_token_accuracy": 0.9316271543502808, "step": 3125, "train/kl_loss_qwen": 0.036940915137529375, "train/kl_loss_r1": 0.0215177561622113, "train/total_kl": 0.05845867097377777 }, { "epoch": 2.348282979921186, "grad_norm": 2.78125, "learning_rate": 1.2376126126126126e-05, "loss": 0.5368, "mean_token_accuracy": 0.9344398438930511, "step": 3130, "train/kl_loss_qwen": 0.033279696572571994, "train/kl_loss_r1": 0.021447874326258897, "train/total_kl": 0.05472757089883089 }, { "epoch": 2.352036029273785, "grad_norm": 2.390625, "learning_rate": 1.2347972972972973e-05, "loss": 0.5209, "mean_token_accuracy": 0.9406446427106857, "step": 3135, "train/kl_loss_qwen": 0.036877452628687024, "train/kl_loss_r1": 0.022486304910853506, "train/total_kl": 0.059363758005201814 }, { "epoch": 2.3557890786263838, "grad_norm": 2.5, "learning_rate": 1.231981981981982e-05, "loss": 0.5095, "mean_token_accuracy": 0.9296006947755814, "step": 3140, "train/kl_loss_qwen": 0.028582219453528523, "train/kl_loss_r1": 0.018844395689666272, "train/total_kl": 0.04742661491036415 }, { "epoch": 2.3595421279789828, "grad_norm": 1.9140625, "learning_rate": 1.2291666666666666e-05, "loss": 0.5638, "mean_token_accuracy": 0.9397950142621994, "step": 3145, "train/kl_loss_qwen": 0.04685241803526878, "train/kl_loss_r1": 0.026595241343602537, "train/total_kl": 0.07344765840098262 }, { "epoch": 2.363295177331582, "grad_norm": 2.046875, "learning_rate": 1.2263513513513513e-05, "loss": 0.5555, "mean_token_accuracy": 0.9374128609895707, "step": 3150, "train/kl_loss_qwen": 0.04203428840264678, "train/kl_loss_r1": 0.025428059929981827, "train/total_kl": 0.06746234856545925 }, { "epoch": 2.367048226684181, "grad_norm": 2.21875, "learning_rate": 1.223536036036036e-05, "loss": 0.5681, "mean_token_accuracy": 0.9254122227430344, "step": 3155, "train/kl_loss_qwen": 0.0387713055126369, "train/kl_loss_r1": 0.0246855141595006, "train/total_kl": 0.06345681985840201 }, { "epoch": 2.37080127603678, "grad_norm": 1.6171875, "learning_rate": 1.2207207207207206e-05, "loss": 0.551, "mean_token_accuracy": 0.9433078557252884, "step": 3160, "train/kl_loss_qwen": 0.04725635447539389, "train/kl_loss_r1": 0.025131250126287343, "train/total_kl": 0.07238760460168123 }, { "epoch": 2.374554325389379, "grad_norm": 2.78125, "learning_rate": 1.2179054054054054e-05, "loss": 0.5354, "mean_token_accuracy": 0.9246108263731003, "step": 3165, "train/kl_loss_qwen": 0.033212426397949454, "train/kl_loss_r1": 0.020326728513464332, "train/total_kl": 0.05353915439918637 }, { "epoch": 2.378307374741978, "grad_norm": 1.640625, "learning_rate": 1.2150900900900901e-05, "loss": 0.6263, "mean_token_accuracy": 0.9188352763652802, "step": 3170, "train/kl_loss_qwen": 0.044487806130200626, "train/kl_loss_r1": 0.025681670103222132, "train/total_kl": 0.07016947586089373 }, { "epoch": 2.382060424094577, "grad_norm": 1.765625, "learning_rate": 1.2122747747747748e-05, "loss": 0.5346, "mean_token_accuracy": 0.934695902466774, "step": 3175, "train/kl_loss_qwen": 0.03501300155185163, "train/kl_loss_r1": 0.02180988513864577, "train/total_kl": 0.05682288641110063 }, { "epoch": 2.385813473447176, "grad_norm": 3.671875, "learning_rate": 1.2094594594594594e-05, "loss": 0.5132, "mean_token_accuracy": 0.9327447503805161, "step": 3180, "train/kl_loss_qwen": 0.03092428036034107, "train/kl_loss_r1": 0.01931490730494261, "train/total_kl": 0.05023918692022562 }, { "epoch": 2.389566522799775, "grad_norm": 1.90625, "learning_rate": 1.2066441441441441e-05, "loss": 0.5394, "mean_token_accuracy": 0.9355822622776031, "step": 3185, "train/kl_loss_qwen": 0.03887740271165967, "train/kl_loss_r1": 0.0235895031131804, "train/total_kl": 0.0624669055454433 }, { "epoch": 2.393319572152374, "grad_norm": 2.953125, "learning_rate": 1.2038288288288289e-05, "loss": 0.5322, "mean_token_accuracy": 0.9339176148176194, "step": 3190, "train/kl_loss_qwen": 0.03618767000734806, "train/kl_loss_r1": 0.021291274437680842, "train/total_kl": 0.057478944212198256 }, { "epoch": 2.397072621504973, "grad_norm": 2.0, "learning_rate": 1.2010135135135134e-05, "loss": 0.5395, "mean_token_accuracy": 0.9384062319993973, "step": 3195, "train/kl_loss_qwen": 0.04146128077991307, "train/kl_loss_r1": 0.024588865321129562, "train/total_kl": 0.0660501460544765 }, { "epoch": 2.400825670857572, "grad_norm": 2.25, "learning_rate": 1.1981981981981982e-05, "loss": 0.5389, "mean_token_accuracy": 0.9353989124298095, "step": 3200, "train/kl_loss_qwen": 0.03608363852836192, "train/kl_loss_r1": 0.022291125869378446, "train/total_kl": 0.058374764304608105 }, { "epoch": 2.404578720210171, "grad_norm": 2.046875, "learning_rate": 1.1953828828828829e-05, "loss": 0.4878, "mean_token_accuracy": 0.9411316305398941, "step": 3205, "train/kl_loss_qwen": 0.03091870420612395, "train/kl_loss_r1": 0.020030087791383266, "train/total_kl": 0.05094879176467657 }, { "epoch": 2.4083317695627695, "grad_norm": 1.65625, "learning_rate": 1.1925675675675676e-05, "loss": 0.5701, "mean_token_accuracy": 0.9409845679998398, "step": 3210, "train/kl_loss_qwen": 0.04897573101334274, "train/kl_loss_r1": 0.02639773767441511, "train/total_kl": 0.07537346873432398 }, { "epoch": 2.4120848189153685, "grad_norm": 1.78125, "learning_rate": 1.1897522522522522e-05, "loss": 0.5977, "mean_token_accuracy": 0.9367994040250778, "step": 3215, "train/kl_loss_qwen": 0.050940166832879184, "train/kl_loss_r1": 0.02986270859837532, "train/total_kl": 0.0808028751052916 }, { "epoch": 2.4158378682679675, "grad_norm": 1.6171875, "learning_rate": 1.186936936936937e-05, "loss": 0.5429, "mean_token_accuracy": 0.9409172803163528, "step": 3220, "train/kl_loss_qwen": 0.03987803226336837, "train/kl_loss_r1": 0.0246189346536994, "train/total_kl": 0.0644969672895968 }, { "epoch": 2.4195909176205666, "grad_norm": 2.546875, "learning_rate": 1.1841216216216217e-05, "loss": 0.5611, "mean_token_accuracy": 0.9374772995710373, "step": 3225, "train/kl_loss_qwen": 0.04303165278397501, "train/kl_loss_r1": 0.02437350503169, "train/total_kl": 0.06740515744313598 }, { "epoch": 2.4233439669731656, "grad_norm": 2.4375, "learning_rate": 1.1813063063063062e-05, "loss": 0.553, "mean_token_accuracy": 0.9381204128265381, "step": 3230, "train/kl_loss_qwen": 0.0386037103831768, "train/kl_loss_r1": 0.023770157899707555, "train/total_kl": 0.06237386828288436 }, { "epoch": 2.4270970163257646, "grad_norm": 1.7890625, "learning_rate": 1.178490990990991e-05, "loss": 0.562, "mean_token_accuracy": 0.9349307507276535, "step": 3235, "train/kl_loss_qwen": 0.04115969752892852, "train/kl_loss_r1": 0.024597525550052523, "train/total_kl": 0.06575722331181169 }, { "epoch": 2.4308500656783636, "grad_norm": 1.8203125, "learning_rate": 1.1756756756756757e-05, "loss": 0.637, "mean_token_accuracy": 0.9326605528593064, "step": 3240, "train/kl_loss_qwen": 0.05272633535787463, "train/kl_loss_r1": 0.03210459062829614, "train/total_kl": 0.08483092663809658 }, { "epoch": 2.4346031150309626, "grad_norm": 1.8046875, "learning_rate": 1.1728603603603604e-05, "loss": 0.5224, "mean_token_accuracy": 0.9422306567430496, "step": 3245, "train/kl_loss_qwen": 0.03568903068080544, "train/kl_loss_r1": 0.02389035364612937, "train/total_kl": 0.05957938423380256 }, { "epoch": 2.4383561643835616, "grad_norm": 1.8828125, "learning_rate": 1.170045045045045e-05, "loss": 0.5923, "mean_token_accuracy": 0.9275829493999481, "step": 3250, "train/kl_loss_qwen": 0.04339817874133587, "train/kl_loss_r1": 0.02661740267649293, "train/total_kl": 0.07001558057963848 }, { "epoch": 2.4421092137361606, "grad_norm": 2.5, "learning_rate": 1.1672297297297297e-05, "loss": 0.5883, "mean_token_accuracy": 0.9264898538589478, "step": 3255, "train/kl_loss_qwen": 0.04256655271165073, "train/kl_loss_r1": 0.026060083322227, "train/total_kl": 0.06862663589417935 }, { "epoch": 2.4458622630887596, "grad_norm": 1.6171875, "learning_rate": 1.1644144144144145e-05, "loss": 0.5757, "mean_token_accuracy": 0.9341827034950256, "step": 3260, "train/kl_loss_qwen": 0.045864395797252655, "train/kl_loss_r1": 0.025307921459898353, "train/total_kl": 0.07117231637239456 }, { "epoch": 2.4496153124413587, "grad_norm": 1.859375, "learning_rate": 1.161599099099099e-05, "loss": 0.5532, "mean_token_accuracy": 0.9347288429737091, "step": 3265, "train/kl_loss_qwen": 0.04079986200667918, "train/kl_loss_r1": 0.02275497787632048, "train/total_kl": 0.06355484062805772 }, { "epoch": 2.4533683617939577, "grad_norm": 1.8125, "learning_rate": 1.1587837837837838e-05, "loss": 0.5195, "mean_token_accuracy": 0.9417342007160187, "step": 3270, "train/kl_loss_qwen": 0.037300968542695045, "train/kl_loss_r1": 0.023268221924081445, "train/total_kl": 0.06056919014081359 }, { "epoch": 2.4571214111465567, "grad_norm": 1.7890625, "learning_rate": 1.1559684684684685e-05, "loss": 0.5353, "mean_token_accuracy": 0.9360393404960632, "step": 3275, "train/kl_loss_qwen": 0.03689596527256071, "train/kl_loss_r1": 0.022807118855416773, "train/total_kl": 0.05970308426767588 }, { "epoch": 2.4608744604991557, "grad_norm": 1.7421875, "learning_rate": 1.1531531531531532e-05, "loss": 0.585, "mean_token_accuracy": 0.9331568986177444, "step": 3280, "train/kl_loss_qwen": 0.044853394478559495, "train/kl_loss_r1": 0.025697841960936784, "train/total_kl": 0.0705512366257608 }, { "epoch": 2.4646275098517547, "grad_norm": 1.65625, "learning_rate": 1.1503378378378378e-05, "loss": 0.5768, "mean_token_accuracy": 0.9326375395059585, "step": 3285, "train/kl_loss_qwen": 0.04333240417763591, "train/kl_loss_r1": 0.024822972994297744, "train/total_kl": 0.06815537698566913 }, { "epoch": 2.4683805592043537, "grad_norm": 6.0625, "learning_rate": 1.1475225225225225e-05, "loss": 0.7162, "mean_token_accuracy": 0.9254491657018662, "step": 3290, "train/kl_loss_qwen": 0.06576828146353364, "train/kl_loss_r1": 0.03042342527769506, "train/total_kl": 0.09619170585647226 }, { "epoch": 2.4721336085569527, "grad_norm": 4.0625, "learning_rate": 1.1447072072072073e-05, "loss": 0.5306, "mean_token_accuracy": 0.9359158217906952, "step": 3295, "train/kl_loss_qwen": 0.03547678254544735, "train/kl_loss_r1": 0.022528561856597663, "train/total_kl": 0.0580053442157805 }, { "epoch": 2.4758866579095518, "grad_norm": 2.03125, "learning_rate": 1.1418918918918918e-05, "loss": 0.589, "mean_token_accuracy": 0.9333787739276886, "step": 3300, "train/kl_loss_qwen": 0.04154859040863812, "train/kl_loss_r1": 0.025078575173392893, "train/total_kl": 0.06662716614082456 }, { "epoch": 2.4796397072621503, "grad_norm": 2.015625, "learning_rate": 1.1390765765765766e-05, "loss": 0.5448, "mean_token_accuracy": 0.9377627521753311, "step": 3305, "train/kl_loss_qwen": 0.0411828382872045, "train/kl_loss_r1": 0.02373361773788929, "train/total_kl": 0.06491645593196153 }, { "epoch": 2.4833927566147493, "grad_norm": 1.71875, "learning_rate": 1.1362612612612613e-05, "loss": 0.6567, "mean_token_accuracy": 0.9378575652837753, "step": 3310, "train/kl_loss_qwen": 0.058627383690327405, "train/kl_loss_r1": 0.0312151032499969, "train/total_kl": 0.08984248703345657 }, { "epoch": 2.4871458059673484, "grad_norm": 1.71875, "learning_rate": 1.133445945945946e-05, "loss": 0.5552, "mean_token_accuracy": 0.9339710831642151, "step": 3315, "train/kl_loss_qwen": 0.03927432321943343, "train/kl_loss_r1": 0.023889779346063733, "train/total_kl": 0.06316410256549716 }, { "epoch": 2.4908988553199474, "grad_norm": 3.296875, "learning_rate": 1.1306306306306306e-05, "loss": 0.5959, "mean_token_accuracy": 0.934712040424347, "step": 3320, "train/kl_loss_qwen": 0.04768353961408138, "train/kl_loss_r1": 0.02617289489135146, "train/total_kl": 0.07385643469169736 }, { "epoch": 2.4946519046725464, "grad_norm": 2.1875, "learning_rate": 1.1278153153153153e-05, "loss": 0.5349, "mean_token_accuracy": 0.9292694211006165, "step": 3325, "train/kl_loss_qwen": 0.032761602150276306, "train/kl_loss_r1": 0.0203021552413702, "train/total_kl": 0.05306375734508038 }, { "epoch": 2.4984049540251454, "grad_norm": 1.875, "learning_rate": 1.125e-05, "loss": 0.6419, "mean_token_accuracy": 0.9353505343198776, "step": 3330, "train/kl_loss_qwen": 0.05452116383239627, "train/kl_loss_r1": 0.031527131283655765, "train/total_kl": 0.08604829544201494 }, { "epoch": 2.5021580033777444, "grad_norm": 2.140625, "learning_rate": 1.1221846846846846e-05, "loss": 0.622, "mean_token_accuracy": 0.9341338902711869, "step": 3335, "train/kl_loss_qwen": 0.04978591026738286, "train/kl_loss_r1": 0.029290991835296154, "train/total_kl": 0.0790769032202661 }, { "epoch": 2.5059110527303434, "grad_norm": 2.578125, "learning_rate": 1.1193693693693694e-05, "loss": 0.5679, "mean_token_accuracy": 0.9300838261842728, "step": 3340, "train/kl_loss_qwen": 0.0432100894395262, "train/kl_loss_r1": 0.02546289232559502, "train/total_kl": 0.06867298241704703 }, { "epoch": 2.5096641020829424, "grad_norm": 2.296875, "learning_rate": 1.1165540540540541e-05, "loss": 0.5739, "mean_token_accuracy": 0.9369128614664077, "step": 3345, "train/kl_loss_qwen": 0.04455037331208587, "train/kl_loss_r1": 0.02718741991557181, "train/total_kl": 0.07173779308795929 }, { "epoch": 2.5134171514355415, "grad_norm": 1.859375, "learning_rate": 1.1137387387387388e-05, "loss": 0.5353, "mean_token_accuracy": 0.932581090927124, "step": 3350, "train/kl_loss_qwen": 0.0413767262827605, "train/kl_loss_r1": 0.022167172096669675, "train/total_kl": 0.06354389851912856 }, { "epoch": 2.5171702007881405, "grad_norm": 2.0, "learning_rate": 1.1109234234234234e-05, "loss": 0.5343, "mean_token_accuracy": 0.927921137213707, "step": 3355, "train/kl_loss_qwen": 0.03147038575261831, "train/kl_loss_r1": 0.01910092611797154, "train/total_kl": 0.050571311730891466 }, { "epoch": 2.5209232501407395, "grad_norm": 1.5859375, "learning_rate": 1.1081081081081081e-05, "loss": 0.4947, "mean_token_accuracy": 0.9445708662271499, "step": 3360, "train/kl_loss_qwen": 0.03797930618748069, "train/kl_loss_r1": 0.021180487936362624, "train/total_kl": 0.05915979370474815 }, { "epoch": 2.5246762994933385, "grad_norm": 1.890625, "learning_rate": 1.1052927927927929e-05, "loss": 0.5647, "mean_token_accuracy": 0.9292292296886444, "step": 3365, "train/kl_loss_qwen": 0.03970672045834363, "train/kl_loss_r1": 0.023722950136289, "train/total_kl": 0.06342967031523586 }, { "epoch": 2.528429348845937, "grad_norm": 1.9375, "learning_rate": 1.1024774774774774e-05, "loss": 0.5524, "mean_token_accuracy": 0.9366607517004013, "step": 3370, "train/kl_loss_qwen": 0.04209428019821644, "train/kl_loss_r1": 0.024846457364037632, "train/total_kl": 0.06694073788821697 }, { "epoch": 2.532182398198536, "grad_norm": 1.6796875, "learning_rate": 1.0996621621621622e-05, "loss": 0.5887, "mean_token_accuracy": 0.9346622288227081, "step": 3375, "train/kl_loss_qwen": 0.04933397052809596, "train/kl_loss_r1": 0.026567904464900493, "train/total_kl": 0.07590187508612871 }, { "epoch": 2.535935447551135, "grad_norm": 3.234375, "learning_rate": 1.0968468468468469e-05, "loss": 0.5237, "mean_token_accuracy": 0.9299458533525466, "step": 3380, "train/kl_loss_qwen": 0.02983626089990139, "train/kl_loss_r1": 0.019484353670850395, "train/total_kl": 0.04932061461731792 }, { "epoch": 2.539688496903734, "grad_norm": 1.7890625, "learning_rate": 1.0940315315315316e-05, "loss": 0.5345, "mean_token_accuracy": 0.9382866770029068, "step": 3385, "train/kl_loss_qwen": 0.04042149954475462, "train/kl_loss_r1": 0.023517983220517635, "train/total_kl": 0.06393948178738355 }, { "epoch": 2.543441546256333, "grad_norm": 1.671875, "learning_rate": 1.0912162162162162e-05, "loss": 0.521, "mean_token_accuracy": 0.9384631723165512, "step": 3390, "train/kl_loss_qwen": 0.038067093631252644, "train/kl_loss_r1": 0.02246550181880593, "train/total_kl": 0.06053259586915374 }, { "epoch": 2.547194595608932, "grad_norm": 1.9296875, "learning_rate": 1.088400900900901e-05, "loss": 0.5482, "mean_token_accuracy": 0.9318992495536804, "step": 3395, "train/kl_loss_qwen": 0.03690930460579693, "train/kl_loss_r1": 0.02255395017564297, "train/total_kl": 0.059463254641741514 }, { "epoch": 2.550947644961531, "grad_norm": 2.609375, "learning_rate": 1.0855855855855857e-05, "loss": 0.4918, "mean_token_accuracy": 0.9357536435127258, "step": 3400, "train/kl_loss_qwen": 0.030488945869728924, "train/kl_loss_r1": 0.01972590610384941, "train/total_kl": 0.050214852392673495 }, { "epoch": 2.55470069431413, "grad_norm": 1.8046875, "learning_rate": 1.0827702702702702e-05, "loss": 0.623, "mean_token_accuracy": 0.9369746416807174, "step": 3405, "train/kl_loss_qwen": 0.05603249073028564, "train/kl_loss_r1": 0.0298390360083431, "train/total_kl": 0.08587152734398842 }, { "epoch": 2.558453743666729, "grad_norm": 1.703125, "learning_rate": 1.079954954954955e-05, "loss": 0.5262, "mean_token_accuracy": 0.9425755172967911, "step": 3410, "train/kl_loss_qwen": 0.03950298763811588, "train/kl_loss_r1": 0.02380976346321404, "train/total_kl": 0.06331275068223477 }, { "epoch": 2.562206793019328, "grad_norm": 1.859375, "learning_rate": 1.0771396396396397e-05, "loss": 0.5639, "mean_token_accuracy": 0.9331496387720108, "step": 3415, "train/kl_loss_qwen": 0.04406013865955174, "train/kl_loss_r1": 0.024020101223140956, "train/total_kl": 0.06808023946359754 }, { "epoch": 2.565959842371927, "grad_norm": 2.546875, "learning_rate": 1.0743243243243244e-05, "loss": 0.5149, "mean_token_accuracy": 0.9378763616085053, "step": 3420, "train/kl_loss_qwen": 0.036142927082255485, "train/kl_loss_r1": 0.023106351029127836, "train/total_kl": 0.05924927722662687 }, { "epoch": 2.569712891724526, "grad_norm": 2.015625, "learning_rate": 1.071509009009009e-05, "loss": 0.533, "mean_token_accuracy": 0.9345060348510742, "step": 3425, "train/kl_loss_qwen": 0.035566607816144825, "train/kl_loss_r1": 0.022629395639523864, "train/total_kl": 0.058196003921329974 }, { "epoch": 2.5734659410771252, "grad_norm": 2.03125, "learning_rate": 1.0686936936936937e-05, "loss": 0.4989, "mean_token_accuracy": 0.9346575111150741, "step": 3430, "train/kl_loss_qwen": 0.03133196346461773, "train/kl_loss_r1": 0.019670154713094235, "train/total_kl": 0.05100211799144745 }, { "epoch": 2.5772189904297242, "grad_norm": 1.921875, "learning_rate": 1.0658783783783785e-05, "loss": 0.5453, "mean_token_accuracy": 0.9339419305324554, "step": 3435, "train/kl_loss_qwen": 0.03465688219293952, "train/kl_loss_r1": 0.021777683729305865, "train/total_kl": 0.05643456541001797 }, { "epoch": 2.5809720397823233, "grad_norm": 1.890625, "learning_rate": 1.063063063063063e-05, "loss": 0.5621, "mean_token_accuracy": 0.9316897690296173, "step": 3440, "train/kl_loss_qwen": 0.03479852089658379, "train/kl_loss_r1": 0.022237913217395544, "train/total_kl": 0.057036434207111596 }, { "epoch": 2.5847250891349223, "grad_norm": 1.84375, "learning_rate": 1.0602477477477478e-05, "loss": 0.512, "mean_token_accuracy": 0.9422204077243805, "step": 3445, "train/kl_loss_qwen": 0.037066091177985074, "train/kl_loss_r1": 0.023700099997222425, "train/total_kl": 0.060766191128641366 }, { "epoch": 2.5884781384875213, "grad_norm": 2.390625, "learning_rate": 1.0574324324324325e-05, "loss": 0.5067, "mean_token_accuracy": 0.9312503308057785, "step": 3450, "train/kl_loss_qwen": 0.03274406418204308, "train/kl_loss_r1": 0.020862600672990082, "train/total_kl": 0.05360666448250413 }, { "epoch": 2.5922311878401203, "grad_norm": 2.640625, "learning_rate": 1.0546171171171172e-05, "loss": 0.5086, "mean_token_accuracy": 0.9356559842824936, "step": 3455, "train/kl_loss_qwen": 0.03636283753439784, "train/kl_loss_r1": 0.02178000183776021, "train/total_kl": 0.05814283927902579 }, { "epoch": 2.5959842371927193, "grad_norm": 1.9609375, "learning_rate": 1.0518018018018018e-05, "loss": 0.5021, "mean_token_accuracy": 0.940264904499054, "step": 3460, "train/kl_loss_qwen": 0.03297446658834815, "train/kl_loss_r1": 0.021592933125793932, "train/total_kl": 0.0545673999004066 }, { "epoch": 2.5997372865453183, "grad_norm": 2.015625, "learning_rate": 1.0489864864864865e-05, "loss": 0.5454, "mean_token_accuracy": 0.9404850274324417, "step": 3465, "train/kl_loss_qwen": 0.04411001540720463, "train/kl_loss_r1": 0.025393107812851666, "train/total_kl": 0.06950312331318856 }, { "epoch": 2.603490335897917, "grad_norm": 1.78125, "learning_rate": 1.0461711711711713e-05, "loss": 0.5201, "mean_token_accuracy": 0.9440337806940079, "step": 3470, "train/kl_loss_qwen": 0.041339093120768666, "train/kl_loss_r1": 0.02469945913180709, "train/total_kl": 0.06603855239227414 }, { "epoch": 2.607243385250516, "grad_norm": 2.21875, "learning_rate": 1.043355855855856e-05, "loss": 0.5122, "mean_token_accuracy": 0.9338981837034226, "step": 3475, "train/kl_loss_qwen": 0.03163531045429409, "train/kl_loss_r1": 0.020907067647203802, "train/total_kl": 0.05254237810149789 }, { "epoch": 2.610996434603115, "grad_norm": 1.8125, "learning_rate": 1.0405405405405406e-05, "loss": 0.5841, "mean_token_accuracy": 0.9341493427753449, "step": 3480, "train/kl_loss_qwen": 0.049100861279293896, "train/kl_loss_r1": 0.026905355555936695, "train/total_kl": 0.07600621711462736 }, { "epoch": 2.614749483955714, "grad_norm": 1.5625, "learning_rate": 1.0377252252252253e-05, "loss": 0.579, "mean_token_accuracy": 0.9387732237577439, "step": 3485, "train/kl_loss_qwen": 0.04798796251416206, "train/kl_loss_r1": 0.027056048065423964, "train/total_kl": 0.07504401141777635 }, { "epoch": 2.618502533308313, "grad_norm": 2.75, "learning_rate": 1.03490990990991e-05, "loss": 0.5499, "mean_token_accuracy": 0.9330289214849472, "step": 3490, "train/kl_loss_qwen": 0.03633160563185811, "train/kl_loss_r1": 0.02329326728358865, "train/total_kl": 0.05962487207725644 }, { "epoch": 2.622255582660912, "grad_norm": 2.6875, "learning_rate": 1.0320945945945946e-05, "loss": 0.5351, "mean_token_accuracy": 0.9311683624982834, "step": 3495, "train/kl_loss_qwen": 0.03595252772793174, "train/kl_loss_r1": 0.022297431947663426, "train/total_kl": 0.05824995981529355 }, { "epoch": 2.626008632013511, "grad_norm": 2.203125, "learning_rate": 1.0292792792792793e-05, "loss": 0.5577, "mean_token_accuracy": 0.9325771689414978, "step": 3500, "train/kl_loss_qwen": 0.03546359553001821, "train/kl_loss_r1": 0.022251410642638803, "train/total_kl": 0.05771500645205378 }, { "epoch": 2.62976168136611, "grad_norm": 1.984375, "learning_rate": 1.026463963963964e-05, "loss": 0.5726, "mean_token_accuracy": 0.9327528506517411, "step": 3505, "train/kl_loss_qwen": 0.04111943980678916, "train/kl_loss_r1": 0.025728296581655742, "train/total_kl": 0.06684773582965135 }, { "epoch": 2.633514730718709, "grad_norm": 1.921875, "learning_rate": 1.0236486486486488e-05, "loss": 0.5926, "mean_token_accuracy": 0.9328369259834289, "step": 3510, "train/kl_loss_qwen": 0.046308462787419555, "train/kl_loss_r1": 0.02664640606380999, "train/total_kl": 0.07295486945658922 }, { "epoch": 2.637267780071308, "grad_norm": 1.6796875, "learning_rate": 1.0208333333333334e-05, "loss": 0.5781, "mean_token_accuracy": 0.9362814456224442, "step": 3515, "train/kl_loss_qwen": 0.04740121774375439, "train/kl_loss_r1": 0.026224265387281776, "train/total_kl": 0.0736254833638668 }, { "epoch": 2.641020829423907, "grad_norm": 2.09375, "learning_rate": 1.0180180180180181e-05, "loss": 0.6094, "mean_token_accuracy": 0.9310470670461655, "step": 3520, "train/kl_loss_qwen": 0.046079412242397665, "train/kl_loss_r1": 0.02684156009927392, "train/total_kl": 0.07292097266763449 }, { "epoch": 2.644773878776506, "grad_norm": 2.171875, "learning_rate": 1.0152027027027028e-05, "loss": 0.5425, "mean_token_accuracy": 0.9256984144449234, "step": 3525, "train/kl_loss_qwen": 0.03432284677401185, "train/kl_loss_r1": 0.02130248979665339, "train/total_kl": 0.055625336803495885 }, { "epoch": 2.648526928129105, "grad_norm": 2.390625, "learning_rate": 1.0123873873873874e-05, "loss": 0.5209, "mean_token_accuracy": 0.9320784568786621, "step": 3530, "train/kl_loss_qwen": 0.030805668141692878, "train/kl_loss_r1": 0.019909562543034554, "train/total_kl": 0.05071523003280163 }, { "epoch": 2.6522799774817036, "grad_norm": 2.734375, "learning_rate": 1.0095720720720721e-05, "loss": 0.566, "mean_token_accuracy": 0.9416737079620361, "step": 3535, "train/kl_loss_qwen": 0.04397767055779696, "train/kl_loss_r1": 0.026771708764135836, "train/total_kl": 0.07074937922880054 }, { "epoch": 2.6560330268343026, "grad_norm": 1.9609375, "learning_rate": 1.0067567567567569e-05, "loss": 0.5221, "mean_token_accuracy": 0.937117201089859, "step": 3540, "train/kl_loss_qwen": 0.03365273177623749, "train/kl_loss_r1": 0.021670471411198378, "train/total_kl": 0.05532320309430361 }, { "epoch": 2.6597860761869017, "grad_norm": 2.4375, "learning_rate": 1.0039414414414416e-05, "loss": 0.5136, "mean_token_accuracy": 0.9384093523025513, "step": 3545, "train/kl_loss_qwen": 0.03165590218268335, "train/kl_loss_r1": 0.021389018185436724, "train/total_kl": 0.053044920414686204 }, { "epoch": 2.6635391255395007, "grad_norm": 3.046875, "learning_rate": 1.0011261261261262e-05, "loss": 0.5164, "mean_token_accuracy": 0.9325183421373368, "step": 3550, "train/kl_loss_qwen": 0.02961095222271979, "train/kl_loss_r1": 0.019611746584996582, "train/total_kl": 0.049222698993980886 }, { "epoch": 2.6672921748920997, "grad_norm": 2.0, "learning_rate": 9.983108108108109e-06, "loss": 0.5269, "mean_token_accuracy": 0.9398354828357697, "step": 3555, "train/kl_loss_qwen": 0.03761188993230462, "train/kl_loss_r1": 0.023912502732127906, "train/total_kl": 0.06152439266443253 }, { "epoch": 2.6710452242446987, "grad_norm": 1.6953125, "learning_rate": 9.954954954954956e-06, "loss": 0.5265, "mean_token_accuracy": 0.9428102672100067, "step": 3560, "train/kl_loss_qwen": 0.04230879452079535, "train/kl_loss_r1": 0.026035568164661526, "train/total_kl": 0.06834436235949397 }, { "epoch": 2.6747982735972977, "grad_norm": 2.1875, "learning_rate": 9.926801801801802e-06, "loss": 0.5545, "mean_token_accuracy": 0.9395761728286743, "step": 3565, "train/kl_loss_qwen": 0.042321126256138084, "train/kl_loss_r1": 0.026880426658317448, "train/total_kl": 0.06920155417174101 }, { "epoch": 2.6785513229498967, "grad_norm": 2.484375, "learning_rate": 9.89864864864865e-06, "loss": 0.4927, "mean_token_accuracy": 0.9371385693550109, "step": 3570, "train/kl_loss_qwen": 0.028558475058525802, "train/kl_loss_r1": 0.01896639233455062, "train/total_kl": 0.047524867206811906 }, { "epoch": 2.6823043723024957, "grad_norm": 1.875, "learning_rate": 9.870495495495497e-06, "loss": 0.5824, "mean_token_accuracy": 0.9339749813079834, "step": 3575, "train/kl_loss_qwen": 0.0459581867326051, "train/kl_loss_r1": 0.02593495771288872, "train/total_kl": 0.07189314477145672 }, { "epoch": 2.6860574216550948, "grad_norm": 1.7890625, "learning_rate": 9.842342342342344e-06, "loss": 0.6433, "mean_token_accuracy": 0.9311673611402511, "step": 3580, "train/kl_loss_qwen": 0.051213488029316065, "train/kl_loss_r1": 0.030939326249063016, "train/total_kl": 0.08215281507000327 }, { "epoch": 2.6898104710076938, "grad_norm": 1.9140625, "learning_rate": 9.81418918918919e-06, "loss": 0.5293, "mean_token_accuracy": 0.9371504604816436, "step": 3585, "train/kl_loss_qwen": 0.038671653857454656, "train/kl_loss_r1": 0.02250283914618194, "train/total_kl": 0.061174492444843055 }, { "epoch": 2.693563520360293, "grad_norm": 1.6796875, "learning_rate": 9.786036036036037e-06, "loss": 0.5056, "mean_token_accuracy": 0.9385312110185623, "step": 3590, "train/kl_loss_qwen": 0.032683673035353425, "train/kl_loss_r1": 0.021441146731376648, "train/total_kl": 0.05412481976673007 }, { "epoch": 2.697316569712892, "grad_norm": 1.5703125, "learning_rate": 9.757882882882884e-06, "loss": 0.5883, "mean_token_accuracy": 0.9399591952562332, "step": 3595, "train/kl_loss_qwen": 0.04788463073782623, "train/kl_loss_r1": 0.02818334260955453, "train/total_kl": 0.07606797246262431 }, { "epoch": 2.701069619065491, "grad_norm": 1.921875, "learning_rate": 9.72972972972973e-06, "loss": 0.5531, "mean_token_accuracy": 0.9394397348165512, "step": 3600, "train/kl_loss_qwen": 0.04099080595187843, "train/kl_loss_r1": 0.026141448691487313, "train/total_kl": 0.06713225385174156 }, { "epoch": 2.70482266841809, "grad_norm": 2.203125, "learning_rate": 9.701576576576577e-06, "loss": 0.5351, "mean_token_accuracy": 0.9384431034326554, "step": 3605, "train/kl_loss_qwen": 0.03942276262678206, "train/kl_loss_r1": 0.024574512057006358, "train/total_kl": 0.06399727454409003 }, { "epoch": 2.708575717770689, "grad_norm": 3.125, "learning_rate": 9.673423423423425e-06, "loss": 0.5716, "mean_token_accuracy": 0.9273164391517639, "step": 3610, "train/kl_loss_qwen": 0.03769365311600268, "train/kl_loss_r1": 0.02313569700345397, "train/total_kl": 0.060829350538551805 }, { "epoch": 2.712328767123288, "grad_norm": 2.0, "learning_rate": 9.645270270270272e-06, "loss": 0.5567, "mean_token_accuracy": 0.9299625158309937, "step": 3615, "train/kl_loss_qwen": 0.03794219749979675, "train/kl_loss_r1": 0.02285592113621533, "train/total_kl": 0.0607981177046895 }, { "epoch": 2.716081816475887, "grad_norm": 2.71875, "learning_rate": 9.617117117117117e-06, "loss": 0.534, "mean_token_accuracy": 0.9324219495058059, "step": 3620, "train/kl_loss_qwen": 0.0340952820610255, "train/kl_loss_r1": 0.021674492675811053, "train/total_kl": 0.05576977375894785 }, { "epoch": 2.719834865828486, "grad_norm": 2.234375, "learning_rate": 9.588963963963965e-06, "loss": 0.5323, "mean_token_accuracy": 0.9365492641925812, "step": 3625, "train/kl_loss_qwen": 0.03745631170459092, "train/kl_loss_r1": 0.023027216829359532, "train/total_kl": 0.06048352811485529 }, { "epoch": 2.723587915181085, "grad_norm": 2.125, "learning_rate": 9.560810810810812e-06, "loss": 0.5372, "mean_token_accuracy": 0.9387341290712357, "step": 3630, "train/kl_loss_qwen": 0.03898381176404655, "train/kl_loss_r1": 0.02341577596962452, "train/total_kl": 0.062399587128311396 }, { "epoch": 2.7273409645336835, "grad_norm": 1.8984375, "learning_rate": 9.532657657657658e-06, "loss": 0.4913, "mean_token_accuracy": 0.9357551246881485, "step": 3635, "train/kl_loss_qwen": 0.029723901767283678, "train/kl_loss_r1": 0.01947716358117759, "train/total_kl": 0.04920106595382094 }, { "epoch": 2.7310940138862825, "grad_norm": 2.25, "learning_rate": 9.504504504504505e-06, "loss": 0.6634, "mean_token_accuracy": 0.9307036340236664, "step": 3640, "train/kl_loss_qwen": 0.057159008970484135, "train/kl_loss_r1": 0.031469490751624106, "train/total_kl": 0.0886284988373518 }, { "epoch": 2.7348470632388815, "grad_norm": 2.03125, "learning_rate": 9.476351351351352e-06, "loss": 0.6397, "mean_token_accuracy": 0.9389469265937805, "step": 3645, "train/kl_loss_qwen": 0.05761205237358809, "train/kl_loss_r1": 0.03301434912718833, "train/total_kl": 0.09062640201300383 }, { "epoch": 2.7386001125914805, "grad_norm": 1.7890625, "learning_rate": 9.4481981981982e-06, "loss": 0.6008, "mean_token_accuracy": 0.9420938581228256, "step": 3650, "train/kl_loss_qwen": 0.0493962530978024, "train/kl_loss_r1": 0.02965642362833023, "train/total_kl": 0.07905267719179392 }, { "epoch": 2.7423531619440795, "grad_norm": 2.125, "learning_rate": 9.420045045045045e-06, "loss": 0.5786, "mean_token_accuracy": 0.9452258825302124, "step": 3655, "train/kl_loss_qwen": 0.045825537852942945, "train/kl_loss_r1": 0.028989409655332567, "train/total_kl": 0.0748149486258626 }, { "epoch": 2.7461062112966785, "grad_norm": 2.40625, "learning_rate": 9.391891891891893e-06, "loss": 0.5012, "mean_token_accuracy": 0.9325804680585861, "step": 3660, "train/kl_loss_qwen": 0.03034242382273078, "train/kl_loss_r1": 0.019461313867941497, "train/total_kl": 0.04980373801663518 }, { "epoch": 2.7498592606492775, "grad_norm": 2.1875, "learning_rate": 9.36373873873874e-06, "loss": 0.5422, "mean_token_accuracy": 0.9366270989179611, "step": 3665, "train/kl_loss_qwen": 0.038491744874045254, "train/kl_loss_r1": 0.02244432335719466, "train/total_kl": 0.060936068464070556 }, { "epoch": 2.7536123100018766, "grad_norm": 1.7109375, "learning_rate": 9.335585585585586e-06, "loss": 0.53, "mean_token_accuracy": 0.9383520632982254, "step": 3670, "train/kl_loss_qwen": 0.039867379842326044, "train/kl_loss_r1": 0.023165831109508872, "train/total_kl": 0.06303321113809943 }, { "epoch": 2.7573653593544756, "grad_norm": 2.671875, "learning_rate": 9.307432432432433e-06, "loss": 0.5525, "mean_token_accuracy": 0.9366106450557709, "step": 3675, "train/kl_loss_qwen": 0.0403043738566339, "train/kl_loss_r1": 0.024402129231020808, "train/total_kl": 0.06470650397241115 }, { "epoch": 2.7611184087070746, "grad_norm": 2.0, "learning_rate": 9.27927927927928e-06, "loss": 0.5376, "mean_token_accuracy": 0.937373474240303, "step": 3680, "train/kl_loss_qwen": 0.03944247434847057, "train/kl_loss_r1": 0.023985707806423305, "train/total_kl": 0.06342818234115839 }, { "epoch": 2.7648714580596736, "grad_norm": 1.953125, "learning_rate": 9.251126126126128e-06, "loss": 0.554, "mean_token_accuracy": 0.9357343703508377, "step": 3685, "train/kl_loss_qwen": 0.042518915608525276, "train/kl_loss_r1": 0.025951301399618387, "train/total_kl": 0.06847021728754044 }, { "epoch": 2.7686245074122726, "grad_norm": 2.078125, "learning_rate": 9.222972972972973e-06, "loss": 0.5743, "mean_token_accuracy": 0.9325124055147171, "step": 3690, "train/kl_loss_qwen": 0.04556261282414198, "train/kl_loss_r1": 0.025064739352092146, "train/total_kl": 0.07062735268846154 }, { "epoch": 2.772377556764871, "grad_norm": 3.359375, "learning_rate": 9.19481981981982e-06, "loss": 0.5233, "mean_token_accuracy": 0.9305480986833572, "step": 3695, "train/kl_loss_qwen": 0.031651955423876645, "train/kl_loss_r1": 0.020345580391585828, "train/total_kl": 0.05199753614142537 }, { "epoch": 2.77613060611747, "grad_norm": 1.8828125, "learning_rate": 9.166666666666668e-06, "loss": 0.5326, "mean_token_accuracy": 0.9327965170145035, "step": 3700, "train/kl_loss_qwen": 0.03383352099917829, "train/kl_loss_r1": 0.02235841490328312, "train/total_kl": 0.056191935669630766 }, { "epoch": 2.779883655470069, "grad_norm": 2.03125, "learning_rate": 9.138513513513514e-06, "loss": 0.5492, "mean_token_accuracy": 0.9406279385089874, "step": 3705, "train/kl_loss_qwen": 0.04245820404030383, "train/kl_loss_r1": 0.02547566662542522, "train/total_kl": 0.06793387047946453 }, { "epoch": 2.7836367048226682, "grad_norm": 1.9921875, "learning_rate": 9.110360360360361e-06, "loss": 0.5834, "mean_token_accuracy": 0.9409590631723403, "step": 3710, "train/kl_loss_qwen": 0.04834628850221634, "train/kl_loss_r1": 0.028032816713675857, "train/total_kl": 0.07637910544872284 }, { "epoch": 2.7873897541752672, "grad_norm": 2.015625, "learning_rate": 9.082207207207208e-06, "loss": 0.5663, "mean_token_accuracy": 0.9342130035161972, "step": 3715, "train/kl_loss_qwen": 0.04353028647601605, "train/kl_loss_r1": 0.024533309601247312, "train/total_kl": 0.06806359644979239 }, { "epoch": 2.7911428035278663, "grad_norm": 1.9375, "learning_rate": 9.054054054054056e-06, "loss": 0.5073, "mean_token_accuracy": 0.9400626242160797, "step": 3720, "train/kl_loss_qwen": 0.03470782497897744, "train/kl_loss_r1": 0.021252785716205834, "train/total_kl": 0.0559606104157865 }, { "epoch": 2.7948958528804653, "grad_norm": 1.9140625, "learning_rate": 9.025900900900901e-06, "loss": 0.5781, "mean_token_accuracy": 0.9387185037136078, "step": 3725, "train/kl_loss_qwen": 0.045765295764431356, "train/kl_loss_r1": 0.02741283820942044, "train/total_kl": 0.07317813383415342 }, { "epoch": 2.7986489022330643, "grad_norm": 1.8984375, "learning_rate": 8.997747747747749e-06, "loss": 0.5982, "mean_token_accuracy": 0.9270498305559158, "step": 3730, "train/kl_loss_qwen": 0.04484616173431277, "train/kl_loss_r1": 0.026128320163115858, "train/total_kl": 0.0709744818508625 }, { "epoch": 2.8024019515856633, "grad_norm": 2.390625, "learning_rate": 8.969594594594596e-06, "loss": 0.5648, "mean_token_accuracy": 0.9334120750427246, "step": 3735, "train/kl_loss_qwen": 0.039087398629635575, "train/kl_loss_r1": 0.02425426966510713, "train/total_kl": 0.06334166843444108 }, { "epoch": 2.8061550009382623, "grad_norm": 1.578125, "learning_rate": 8.941441441441442e-06, "loss": 0.543, "mean_token_accuracy": 0.9337530016899109, "step": 3740, "train/kl_loss_qwen": 0.03704939093440771, "train/kl_loss_r1": 0.02395803024992347, "train/total_kl": 0.06100742164999247 }, { "epoch": 2.8099080502908613, "grad_norm": 1.9453125, "learning_rate": 8.913288288288289e-06, "loss": 0.5229, "mean_token_accuracy": 0.9368319362401962, "step": 3745, "train/kl_loss_qwen": 0.0341915549710393, "train/kl_loss_r1": 0.0229964439291507, "train/total_kl": 0.05718799838796258 }, { "epoch": 2.8136610996434603, "grad_norm": 1.828125, "learning_rate": 8.885135135135135e-06, "loss": 0.5247, "mean_token_accuracy": 0.9414711415767669, "step": 3750, "train/kl_loss_qwen": 0.0371045992244035, "train/kl_loss_r1": 0.02308794721029699, "train/total_kl": 0.06019254634156823 }, { "epoch": 2.8174141489960594, "grad_norm": 1.859375, "learning_rate": 8.856981981981982e-06, "loss": 0.5195, "mean_token_accuracy": 0.9347955495119095, "step": 3755, "train/kl_loss_qwen": 0.033538066316396, "train/kl_loss_r1": 0.02079420080408454, "train/total_kl": 0.05433226684108376 }, { "epoch": 2.8211671983486584, "grad_norm": 2.203125, "learning_rate": 8.828828828828828e-06, "loss": 0.5368, "mean_token_accuracy": 0.9394807755947113, "step": 3760, "train/kl_loss_qwen": 0.04017904317006469, "train/kl_loss_r1": 0.02556949369609356, "train/total_kl": 0.06574853714555502 }, { "epoch": 2.8249202477012574, "grad_norm": 2.25, "learning_rate": 8.800675675675675e-06, "loss": 0.5621, "mean_token_accuracy": 0.9337575942277908, "step": 3765, "train/kl_loss_qwen": 0.04164319918490946, "train/kl_loss_r1": 0.025234598480165005, "train/total_kl": 0.06687779715284706 }, { "epoch": 2.8286732970538564, "grad_norm": 1.796875, "learning_rate": 8.772522522522522e-06, "loss": 0.6141, "mean_token_accuracy": 0.9375328481197357, "step": 3770, "train/kl_loss_qwen": 0.05453315619379282, "train/kl_loss_r1": 0.029898820351809262, "train/total_kl": 0.08443197626620531 }, { "epoch": 2.8324263464064554, "grad_norm": 2.359375, "learning_rate": 8.744369369369368e-06, "loss": 0.5598, "mean_token_accuracy": 0.9362965226173401, "step": 3775, "train/kl_loss_qwen": 0.04102930808439851, "train/kl_loss_r1": 0.025926942005753517, "train/total_kl": 0.06695624999701977 }, { "epoch": 2.8361793957590544, "grad_norm": 2.015625, "learning_rate": 8.716216216216215e-06, "loss": 0.5406, "mean_token_accuracy": 0.935252970457077, "step": 3780, "train/kl_loss_qwen": 0.03538098763674498, "train/kl_loss_r1": 0.0222157409414649, "train/total_kl": 0.05759672923013568 }, { "epoch": 2.8399324451116534, "grad_norm": 1.6328125, "learning_rate": 8.688063063063063e-06, "loss": 0.5285, "mean_token_accuracy": 0.9366535782814026, "step": 3785, "train/kl_loss_qwen": 0.037326518120244144, "train/kl_loss_r1": 0.02341712433844805, "train/total_kl": 0.06074364213272929 }, { "epoch": 2.8436854944642525, "grad_norm": 2.203125, "learning_rate": 8.65990990990991e-06, "loss": 0.5401, "mean_token_accuracy": 0.9265829980373382, "step": 3790, "train/kl_loss_qwen": 0.03308621980249882, "train/kl_loss_r1": 0.02124992748722434, "train/total_kl": 0.054336147289723156 }, { "epoch": 2.8474385438168515, "grad_norm": 1.7265625, "learning_rate": 8.631756756756756e-06, "loss": 0.6078, "mean_token_accuracy": 0.9308181017637253, "step": 3795, "train/kl_loss_qwen": 0.04486876749433577, "train/kl_loss_r1": 0.027050571562722326, "train/total_kl": 0.07191933877766132 }, { "epoch": 2.85119159316945, "grad_norm": 3.25, "learning_rate": 8.603603603603603e-06, "loss": 0.5967, "mean_token_accuracy": 0.9408103972673416, "step": 3800, "train/kl_loss_qwen": 0.0475672734901309, "train/kl_loss_r1": 0.02717355964705348, "train/total_kl": 0.07474083248525858 }, { "epoch": 2.854944642522049, "grad_norm": 1.828125, "learning_rate": 8.57545045045045e-06, "loss": 0.5357, "mean_token_accuracy": 0.9340519219636917, "step": 3805, "train/kl_loss_qwen": 0.036199712427333, "train/kl_loss_r1": 0.02173711806535721, "train/total_kl": 0.057936831191182134 }, { "epoch": 2.858697691874648, "grad_norm": 1.7890625, "learning_rate": 8.547297297297296e-06, "loss": 0.5403, "mean_token_accuracy": 0.9292895257472992, "step": 3810, "train/kl_loss_qwen": 0.03628214751370251, "train/kl_loss_r1": 0.02147832843475044, "train/total_kl": 0.05776047557592392 }, { "epoch": 2.862450741227247, "grad_norm": 2.140625, "learning_rate": 8.519144144144143e-06, "loss": 0.5504, "mean_token_accuracy": 0.940996965765953, "step": 3815, "train/kl_loss_qwen": 0.043149954592809084, "train/kl_loss_r1": 0.024290137737989426, "train/total_kl": 0.06744009256362915 }, { "epoch": 2.866203790579846, "grad_norm": 2.40625, "learning_rate": 8.49099099099099e-06, "loss": 0.5459, "mean_token_accuracy": 0.9365820527076721, "step": 3820, "train/kl_loss_qwen": 0.037740124668926, "train/kl_loss_r1": 0.023466435493901372, "train/total_kl": 0.06120656076818705 }, { "epoch": 2.869956839932445, "grad_norm": 2.046875, "learning_rate": 8.462837837837838e-06, "loss": 0.5557, "mean_token_accuracy": 0.9349883943796158, "step": 3825, "train/kl_loss_qwen": 0.03992229206487537, "train/kl_loss_r1": 0.024882027273997666, "train/total_kl": 0.06480431975796819 }, { "epoch": 2.873709889285044, "grad_norm": 2.296875, "learning_rate": 8.434684684684684e-06, "loss": 0.5419, "mean_token_accuracy": 0.929443484544754, "step": 3830, "train/kl_loss_qwen": 0.029825980495661496, "train/kl_loss_r1": 0.019207194168120622, "train/total_kl": 0.04903317447751761 }, { "epoch": 2.877462938637643, "grad_norm": 1.8125, "learning_rate": 8.406531531531531e-06, "loss": 0.6054, "mean_token_accuracy": 0.9381425529718399, "step": 3835, "train/kl_loss_qwen": 0.051548151206225155, "train/kl_loss_r1": 0.029248832399025558, "train/total_kl": 0.08079698467627168 }, { "epoch": 2.881215987990242, "grad_norm": 1.84375, "learning_rate": 8.378378378378378e-06, "loss": 0.5031, "mean_token_accuracy": 0.9378216952085495, "step": 3840, "train/kl_loss_qwen": 0.029105788422748448, "train/kl_loss_r1": 0.02014454547315836, "train/total_kl": 0.049250333290547135 }, { "epoch": 2.884969037342841, "grad_norm": 1.7109375, "learning_rate": 8.350225225225224e-06, "loss": 0.557, "mean_token_accuracy": 0.9410496950149536, "step": 3845, "train/kl_loss_qwen": 0.04421229516156018, "train/kl_loss_r1": 0.027130865957587957, "train/total_kl": 0.07134316163137555 }, { "epoch": 2.88872208669544, "grad_norm": 2.375, "learning_rate": 8.322072072072071e-06, "loss": 0.5813, "mean_token_accuracy": 0.9363250583410263, "step": 3850, "train/kl_loss_qwen": 0.043784852838143706, "train/kl_loss_r1": 0.02625744407996535, "train/total_kl": 0.07004229752346873 }, { "epoch": 2.892475136048039, "grad_norm": 2.3125, "learning_rate": 8.293918918918919e-06, "loss": 0.5314, "mean_token_accuracy": 0.9301344156265259, "step": 3855, "train/kl_loss_qwen": 0.03253565886989236, "train/kl_loss_r1": 0.02052079071290791, "train/total_kl": 0.05305644990876317 }, { "epoch": 2.8962281854006378, "grad_norm": 1.6328125, "learning_rate": 8.265765765765766e-06, "loss": 0.5232, "mean_token_accuracy": 0.9402690678834915, "step": 3860, "train/kl_loss_qwen": 0.03729556603357196, "train/kl_loss_r1": 0.023621046915650368, "train/total_kl": 0.06091661211103201 }, { "epoch": 2.8999812347532368, "grad_norm": 2.125, "learning_rate": 8.237612612612612e-06, "loss": 0.5552, "mean_token_accuracy": 0.9285988807678223, "step": 3865, "train/kl_loss_qwen": 0.03528278898447752, "train/kl_loss_r1": 0.023424216313287616, "train/total_kl": 0.05870700422674417 }, { "epoch": 2.903734284105836, "grad_norm": 1.875, "learning_rate": 8.209459459459459e-06, "loss": 0.5015, "mean_token_accuracy": 0.9393262028694153, "step": 3870, "train/kl_loss_qwen": 0.03307979837991297, "train/kl_loss_r1": 0.02109087221324444, "train/total_kl": 0.05417067091912031 }, { "epoch": 2.907487333458435, "grad_norm": 2.234375, "learning_rate": 8.181306306306306e-06, "loss": 0.5546, "mean_token_accuracy": 0.9359008401632309, "step": 3875, "train/kl_loss_qwen": 0.03611066797748208, "train/kl_loss_r1": 0.021728359861299396, "train/total_kl": 0.0578390278853476 }, { "epoch": 2.911240382811034, "grad_norm": 2.390625, "learning_rate": 8.153153153153152e-06, "loss": 0.5153, "mean_token_accuracy": 0.9441088616847992, "step": 3880, "train/kl_loss_qwen": 0.0379474226385355, "train/kl_loss_r1": 0.024300627363845705, "train/total_kl": 0.062248049583286044 }, { "epoch": 2.914993432163633, "grad_norm": 1.84375, "learning_rate": 8.125e-06, "loss": 0.5666, "mean_token_accuracy": 0.9372196048498154, "step": 3885, "train/kl_loss_qwen": 0.04451721617951989, "train/kl_loss_r1": 0.025683000870049, "train/total_kl": 0.0702002163976431 }, { "epoch": 2.918746481516232, "grad_norm": 1.7734375, "learning_rate": 8.096846846846847e-06, "loss": 0.6314, "mean_token_accuracy": 0.939824691414833, "step": 3890, "train/kl_loss_qwen": 0.05579751967452466, "train/kl_loss_r1": 0.031048040231689812, "train/total_kl": 0.08684556037187577 }, { "epoch": 2.922499530868831, "grad_norm": 2.0, "learning_rate": 8.068693693693694e-06, "loss": 0.5812, "mean_token_accuracy": 0.9380946755409241, "step": 3895, "train/kl_loss_qwen": 0.048919730540364983, "train/kl_loss_r1": 0.027685640146955848, "train/total_kl": 0.07660537036135792 }, { "epoch": 2.92625258022143, "grad_norm": 1.8828125, "learning_rate": 8.04054054054054e-06, "loss": 0.6208, "mean_token_accuracy": 0.9400785356760025, "step": 3900, "train/kl_loss_qwen": 0.05649301186203957, "train/kl_loss_r1": 0.03048962224274874, "train/total_kl": 0.08698263382539154 }, { "epoch": 2.930005629574029, "grad_norm": 2.296875, "learning_rate": 8.012387387387387e-06, "loss": 0.5621, "mean_token_accuracy": 0.931654891371727, "step": 3905, "train/kl_loss_qwen": 0.03453084141947329, "train/kl_loss_r1": 0.02273784396238625, "train/total_kl": 0.057268685381859544 }, { "epoch": 2.933758678926628, "grad_norm": 1.953125, "learning_rate": 7.984234234234234e-06, "loss": 0.5216, "mean_token_accuracy": 0.93751060962677, "step": 3910, "train/kl_loss_qwen": 0.03516701152548194, "train/kl_loss_r1": 0.021255293721333147, "train/total_kl": 0.05642230454832316 }, { "epoch": 2.937511728279227, "grad_norm": 1.7890625, "learning_rate": 7.956081081081082e-06, "loss": 0.5714, "mean_token_accuracy": 0.9317866563796997, "step": 3915, "train/kl_loss_qwen": 0.04194287592545152, "train/kl_loss_r1": 0.02454805881716311, "train/total_kl": 0.06649093553423882 }, { "epoch": 2.941264777631826, "grad_norm": 1.90625, "learning_rate": 7.927927927927927e-06, "loss": 0.545, "mean_token_accuracy": 0.9375185400247574, "step": 3920, "train/kl_loss_qwen": 0.03942022132687271, "train/kl_loss_r1": 0.023067365027964117, "train/total_kl": 0.06248758668079972 }, { "epoch": 2.945017826984425, "grad_norm": 2.046875, "learning_rate": 7.899774774774775e-06, "loss": 0.5349, "mean_token_accuracy": 0.9322762429714203, "step": 3925, "train/kl_loss_qwen": 0.034470038348808886, "train/kl_loss_r1": 0.02245264039374888, "train/total_kl": 0.05692267790436745 }, { "epoch": 2.948770876337024, "grad_norm": 2.109375, "learning_rate": 7.871621621621622e-06, "loss": 0.5035, "mean_token_accuracy": 0.9372401058673858, "step": 3930, "train/kl_loss_qwen": 0.034070842619985345, "train/kl_loss_r1": 0.021460118377581237, "train/total_kl": 0.05553096104413271 }, { "epoch": 2.952523925689623, "grad_norm": 2.0, "learning_rate": 7.843468468468468e-06, "loss": 0.543, "mean_token_accuracy": 0.9385394662618637, "step": 3935, "train/kl_loss_qwen": 0.046337118837982416, "train/kl_loss_r1": 0.023731139581650497, "train/total_kl": 0.07006825897842646 }, { "epoch": 2.956276975042222, "grad_norm": 1.796875, "learning_rate": 7.815315315315315e-06, "loss": 0.4859, "mean_token_accuracy": 0.9361509501934051, "step": 3940, "train/kl_loss_qwen": 0.027159277442842723, "train/kl_loss_r1": 0.019265179615467788, "train/total_kl": 0.04642445733770728 }, { "epoch": 2.960030024394821, "grad_norm": 1.859375, "learning_rate": 7.787162162162162e-06, "loss": 0.5327, "mean_token_accuracy": 0.9324598968029022, "step": 3945, "train/kl_loss_qwen": 0.037095142807811496, "train/kl_loss_r1": 0.022269541397690773, "train/total_kl": 0.059364685136824843 }, { "epoch": 2.96378307374742, "grad_norm": 2.703125, "learning_rate": 7.75900900900901e-06, "loss": 0.5268, "mean_token_accuracy": 0.9340989470481873, "step": 3950, "train/kl_loss_qwen": 0.036777173075824975, "train/kl_loss_r1": 0.02218401376157999, "train/total_kl": 0.058961186278611424 }, { "epoch": 2.967536123100019, "grad_norm": 1.75, "learning_rate": 7.730855855855855e-06, "loss": 0.5091, "mean_token_accuracy": 0.940819251537323, "step": 3955, "train/kl_loss_qwen": 0.03606356335803866, "train/kl_loss_r1": 0.020537690771743656, "train/total_kl": 0.05660125305876136 }, { "epoch": 2.9712891724526176, "grad_norm": 2.4375, "learning_rate": 7.702702702702703e-06, "loss": 0.5723, "mean_token_accuracy": 0.9405235350131989, "step": 3960, "train/kl_loss_qwen": 0.046202197298407556, "train/kl_loss_r1": 0.02828790796920657, "train/total_kl": 0.07449010526761413 }, { "epoch": 2.9750422218052166, "grad_norm": 2.375, "learning_rate": 7.67454954954955e-06, "loss": 0.5426, "mean_token_accuracy": 0.9397156774997711, "step": 3965, "train/kl_loss_qwen": 0.03755204356275499, "train/kl_loss_r1": 0.025371223222464323, "train/total_kl": 0.06292326673865319 }, { "epoch": 2.9787952711578156, "grad_norm": 2.765625, "learning_rate": 7.646396396396396e-06, "loss": 0.4963, "mean_token_accuracy": 0.9325908690690994, "step": 3970, "train/kl_loss_qwen": 0.026620158832520245, "train/kl_loss_r1": 0.01883739125914872, "train/total_kl": 0.04545754995197058 }, { "epoch": 2.9825483205104146, "grad_norm": 2.0625, "learning_rate": 7.618243243243243e-06, "loss": 0.5926, "mean_token_accuracy": 0.9297185957431793, "step": 3975, "train/kl_loss_qwen": 0.04432291784323752, "train/kl_loss_r1": 0.025650422694161533, "train/total_kl": 0.06997334016487003 }, { "epoch": 2.9863013698630136, "grad_norm": 1.8984375, "learning_rate": 7.59009009009009e-06, "loss": 0.5557, "mean_token_accuracy": 0.9421306163072586, "step": 3980, "train/kl_loss_qwen": 0.04748995001427829, "train/kl_loss_r1": 0.025721484888345005, "train/total_kl": 0.07321143466979266 }, { "epoch": 2.9900544192156127, "grad_norm": 1.90625, "learning_rate": 7.561936936936937e-06, "loss": 0.5351, "mean_token_accuracy": 0.9442136764526368, "step": 3985, "train/kl_loss_qwen": 0.04505083854310214, "train/kl_loss_r1": 0.02471695919521153, "train/total_kl": 0.06976779699325561 }, { "epoch": 2.9938074685682117, "grad_norm": 2.5, "learning_rate": 7.533783783783783e-06, "loss": 0.5705, "mean_token_accuracy": 0.9401636183261871, "step": 3990, "train/kl_loss_qwen": 0.04586976226419211, "train/kl_loss_r1": 0.026439438899978997, "train/total_kl": 0.0723092008382082 }, { "epoch": 2.9975605179208107, "grad_norm": 2.328125, "learning_rate": 7.5056306306306306e-06, "loss": 0.5479, "mean_token_accuracy": 0.9345041036605835, "step": 3995, "train/kl_loss_qwen": 0.03837931305170059, "train/kl_loss_r1": 0.02360314899124205, "train/total_kl": 0.06198246162384748 }, { "epoch": 3.00075060987052, "grad_norm": 3.828125, "learning_rate": 7.477477477477477e-06, "loss": 0.4843, "mean_token_accuracy": 0.9349478237769183, "step": 4000, "train/kl_loss_qwen": 0.02753753647865618, "train/kl_loss_r1": 0.018358695868621853, "train/total_kl": 0.0458962315803065 }, { "epoch": 3.004503659223119, "grad_norm": 2.546875, "learning_rate": 7.449324324324324e-06, "loss": 0.5179, "mean_token_accuracy": 0.9468716859817505, "step": 4005, "train/kl_loss_qwen": 0.03820655262097716, "train/kl_loss_r1": 0.023267941363155843, "train/total_kl": 0.06147449426352978 }, { "epoch": 3.008256708575718, "grad_norm": 3.484375, "learning_rate": 7.421171171171171e-06, "loss": 0.4789, "mean_token_accuracy": 0.9452569574117661, "step": 4010, "train/kl_loss_qwen": 0.029093041876330973, "train/kl_loss_r1": 0.020022685592994093, "train/total_kl": 0.04911572737619281 }, { "epoch": 3.012009757928317, "grad_norm": 1.84375, "learning_rate": 7.393018018018018e-06, "loss": 0.5046, "mean_token_accuracy": 0.9512590229511261, "step": 4015, "train/kl_loss_qwen": 0.03662499454803765, "train/kl_loss_r1": 0.023514971556141972, "train/total_kl": 0.06013996629044414 }, { "epoch": 3.015762807280916, "grad_norm": 1.8046875, "learning_rate": 7.364864864864865e-06, "loss": 0.5237, "mean_token_accuracy": 0.9501432359218598, "step": 4020, "train/kl_loss_qwen": 0.04352525365538895, "train/kl_loss_r1": 0.025102979922667145, "train/total_kl": 0.06862823301926255 }, { "epoch": 3.0195158566335145, "grad_norm": 1.625, "learning_rate": 7.336711711711712e-06, "loss": 0.4782, "mean_token_accuracy": 0.9528643399477005, "step": 4025, "train/kl_loss_qwen": 0.03597725708968937, "train/kl_loss_r1": 0.022700622864067554, "train/total_kl": 0.05867787953466177 }, { "epoch": 3.0232689059861135, "grad_norm": 1.875, "learning_rate": 7.3085585585585585e-06, "loss": 0.4676, "mean_token_accuracy": 0.9526668071746827, "step": 4030, "train/kl_loss_qwen": 0.03230909314006567, "train/kl_loss_r1": 0.022169433534145355, "train/total_kl": 0.05447852648794651 }, { "epoch": 3.0270219553387125, "grad_norm": 1.8046875, "learning_rate": 7.280405405405405e-06, "loss": 0.5167, "mean_token_accuracy": 0.9462513476610184, "step": 4035, "train/kl_loss_qwen": 0.04153737160377204, "train/kl_loss_r1": 0.02482378501445055, "train/total_kl": 0.06636115610599518 }, { "epoch": 3.0307750046913116, "grad_norm": 2.859375, "learning_rate": 7.252252252252252e-06, "loss": 0.5115, "mean_token_accuracy": 0.9501920282840729, "step": 4040, "train/kl_loss_qwen": 0.03945711711421609, "train/kl_loss_r1": 0.02391032031737268, "train/total_kl": 0.06336743775755167 }, { "epoch": 3.0345280540439106, "grad_norm": 1.9921875, "learning_rate": 7.224099099099099e-06, "loss": 0.4889, "mean_token_accuracy": 0.9590217292308807, "step": 4045, "train/kl_loss_qwen": 0.04280410804785788, "train/kl_loss_r1": 0.024979598447680475, "train/total_kl": 0.06778370654210449 }, { "epoch": 3.0382811033965096, "grad_norm": 1.65625, "learning_rate": 7.195945945945946e-06, "loss": 0.5881, "mean_token_accuracy": 0.9521596044301986, "step": 4050, "train/kl_loss_qwen": 0.05545506034977734, "train/kl_loss_r1": 0.03175990539602935, "train/total_kl": 0.08721496500074863 }, { "epoch": 3.0420341527491086, "grad_norm": 1.921875, "learning_rate": 7.167792792792793e-06, "loss": 0.5075, "mean_token_accuracy": 0.9522938549518585, "step": 4055, "train/kl_loss_qwen": 0.03955656290054321, "train/kl_loss_r1": 0.024640692863613367, "train/total_kl": 0.06419725548475981 }, { "epoch": 3.0457872021017076, "grad_norm": 1.8828125, "learning_rate": 7.13963963963964e-06, "loss": 0.5131, "mean_token_accuracy": 0.9544217169284821, "step": 4060, "train/kl_loss_qwen": 0.04303731750696897, "train/kl_loss_r1": 0.025201013032346963, "train/total_kl": 0.06823833063244819 }, { "epoch": 3.0495402514543066, "grad_norm": 1.4765625, "learning_rate": 7.1114864864864865e-06, "loss": 0.537, "mean_token_accuracy": 0.9559321880340577, "step": 4065, "train/kl_loss_qwen": 0.04774435576982796, "train/kl_loss_r1": 0.028734903130680323, "train/total_kl": 0.07647925987839699 }, { "epoch": 3.0532933008069056, "grad_norm": 1.6953125, "learning_rate": 7.083333333333333e-06, "loss": 0.5265, "mean_token_accuracy": 0.9555478453636169, "step": 4070, "train/kl_loss_qwen": 0.047786570899188516, "train/kl_loss_r1": 0.027031732350587846, "train/total_kl": 0.0748183025047183 }, { "epoch": 3.0570463501595047, "grad_norm": 1.640625, "learning_rate": 7.05518018018018e-06, "loss": 0.4906, "mean_token_accuracy": 0.9537694811820984, "step": 4075, "train/kl_loss_qwen": 0.03627552236430347, "train/kl_loss_r1": 0.023278655018657446, "train/total_kl": 0.05955417826771736 }, { "epoch": 3.0607993995121037, "grad_norm": 1.7421875, "learning_rate": 7.027027027027027e-06, "loss": 0.5125, "mean_token_accuracy": 0.9504808455705642, "step": 4080, "train/kl_loss_qwen": 0.044115427136421206, "train/kl_loss_r1": 0.02430842686444521, "train/total_kl": 0.06842385372146964 }, { "epoch": 3.0645524488647027, "grad_norm": 2.078125, "learning_rate": 6.998873873873874e-06, "loss": 0.5355, "mean_token_accuracy": 0.9497076243162155, "step": 4085, "train/kl_loss_qwen": 0.040773709490895274, "train/kl_loss_r1": 0.025684031751006843, "train/total_kl": 0.06645774105563759 }, { "epoch": 3.0683054982173017, "grad_norm": 1.65625, "learning_rate": 6.970720720720721e-06, "loss": 0.4942, "mean_token_accuracy": 0.9535217344760895, "step": 4090, "train/kl_loss_qwen": 0.03903574231080711, "train/kl_loss_r1": 0.02369346497580409, "train/total_kl": 0.06272920705378056 }, { "epoch": 3.0720585475699007, "grad_norm": 1.6328125, "learning_rate": 6.942567567567568e-06, "loss": 0.4827, "mean_token_accuracy": 0.9569115400314331, "step": 4095, "train/kl_loss_qwen": 0.03822903037071228, "train/kl_loss_r1": 0.022737222351133825, "train/total_kl": 0.060966251976788045 }, { "epoch": 3.0758115969224997, "grad_norm": 1.7734375, "learning_rate": 6.9144144144144145e-06, "loss": 0.5387, "mean_token_accuracy": 0.9468695998191834, "step": 4100, "train/kl_loss_qwen": 0.04365008450113237, "train/kl_loss_r1": 0.026509212469682096, "train/total_kl": 0.070159297529608 }, { "epoch": 3.0795646462750987, "grad_norm": 2.265625, "learning_rate": 6.886261261261261e-06, "loss": 0.4856, "mean_token_accuracy": 0.9466418087482452, "step": 4105, "train/kl_loss_qwen": 0.034907838655635716, "train/kl_loss_r1": 0.020991062698885798, "train/total_kl": 0.0558989018201828 }, { "epoch": 3.0833176956276973, "grad_norm": 1.9375, "learning_rate": 6.858108108108108e-06, "loss": 0.5102, "mean_token_accuracy": 0.9507683873176574, "step": 4110, "train/kl_loss_qwen": 0.03961786311119795, "train/kl_loss_r1": 0.024199524614959955, "train/total_kl": 0.06381738800555467 }, { "epoch": 3.0870707449802963, "grad_norm": 2.0, "learning_rate": 6.829954954954955e-06, "loss": 0.4829, "mean_token_accuracy": 0.944465833902359, "step": 4115, "train/kl_loss_qwen": 0.031371227093040945, "train/kl_loss_r1": 0.020947957457974554, "train/total_kl": 0.05231918422505259 }, { "epoch": 3.0908237943328953, "grad_norm": 1.5078125, "learning_rate": 6.801801801801802e-06, "loss": 0.4616, "mean_token_accuracy": 0.9485589683055877, "step": 4120, "train/kl_loss_qwen": 0.031080040195956827, "train/kl_loss_r1": 0.019682012405246495, "train/total_kl": 0.05076205227524042 }, { "epoch": 3.0945768436854943, "grad_norm": 1.7578125, "learning_rate": 6.773648648648649e-06, "loss": 0.5351, "mean_token_accuracy": 0.9564525872468949, "step": 4125, "train/kl_loss_qwen": 0.04921146645210683, "train/kl_loss_r1": 0.02725354707799852, "train/total_kl": 0.07646501287817956 }, { "epoch": 3.0983298930380934, "grad_norm": 3.703125, "learning_rate": 6.745495495495496e-06, "loss": 0.5667, "mean_token_accuracy": 0.9405909597873687, "step": 4130, "train/kl_loss_qwen": 0.041168075334280727, "train/kl_loss_r1": 0.025406582234427332, "train/total_kl": 0.06657465808093548 }, { "epoch": 3.1020829423906924, "grad_norm": 1.796875, "learning_rate": 6.7173423423423425e-06, "loss": 0.4896, "mean_token_accuracy": 0.9521638125181198, "step": 4135, "train/kl_loss_qwen": 0.03744446937926114, "train/kl_loss_r1": 0.02312980592250824, "train/total_kl": 0.06057427516207099 }, { "epoch": 3.1058359917432914, "grad_norm": 1.5, "learning_rate": 6.689189189189189e-06, "loss": 0.5447, "mean_token_accuracy": 0.9512269377708436, "step": 4140, "train/kl_loss_qwen": 0.04734295061789453, "train/kl_loss_r1": 0.027056427067145707, "train/total_kl": 0.07439937759190798 }, { "epoch": 3.1095890410958904, "grad_norm": 1.6796875, "learning_rate": 6.661036036036036e-06, "loss": 0.5268, "mean_token_accuracy": 0.9557883590459824, "step": 4145, "train/kl_loss_qwen": 0.04429617114365101, "train/kl_loss_r1": 0.02629926986992359, "train/total_kl": 0.07059544026851654 }, { "epoch": 3.1133420904484894, "grad_norm": 1.71875, "learning_rate": 6.632882882882883e-06, "loss": 0.5058, "mean_token_accuracy": 0.9476411014795303, "step": 4150, "train/kl_loss_qwen": 0.037383958138525485, "train/kl_loss_r1": 0.023662435123696923, "train/total_kl": 0.061046394519507885 }, { "epoch": 3.1170951398010884, "grad_norm": 1.4921875, "learning_rate": 6.60472972972973e-06, "loss": 0.479, "mean_token_accuracy": 0.9571599304676056, "step": 4155, "train/kl_loss_qwen": 0.038876288337633014, "train/kl_loss_r1": 0.024421562859788536, "train/total_kl": 0.06329785119742155 }, { "epoch": 3.1208481891536874, "grad_norm": 2.484375, "learning_rate": 6.576576576576577e-06, "loss": 0.491, "mean_token_accuracy": 0.9498330116271972, "step": 4160, "train/kl_loss_qwen": 0.03512372067198157, "train/kl_loss_r1": 0.02344148699194193, "train/total_kl": 0.058565208595246075 }, { "epoch": 3.1246012385062865, "grad_norm": 3.359375, "learning_rate": 6.548423423423424e-06, "loss": 0.4872, "mean_token_accuracy": 0.9566541939973832, "step": 4165, "train/kl_loss_qwen": 0.03824820877052844, "train/kl_loss_r1": 0.02418025666847825, "train/total_kl": 0.06242846576496959 }, { "epoch": 3.1283542878588855, "grad_norm": 1.5703125, "learning_rate": 6.5202702702702704e-06, "loss": 0.49, "mean_token_accuracy": 0.9528867095708847, "step": 4170, "train/kl_loss_qwen": 0.04278830396942794, "train/kl_loss_r1": 0.024134243838489056, "train/total_kl": 0.06692254794761539 }, { "epoch": 3.1321073372114845, "grad_norm": 2.40625, "learning_rate": 6.492117117117117e-06, "loss": 0.5232, "mean_token_accuracy": 0.9546979814767838, "step": 4175, "train/kl_loss_qwen": 0.04611057708971202, "train/kl_loss_r1": 0.025870457151904704, "train/total_kl": 0.07198103414848447 }, { "epoch": 3.1358603865640835, "grad_norm": 1.4296875, "learning_rate": 6.463963963963964e-06, "loss": 0.5159, "mean_token_accuracy": 0.9506950169801712, "step": 4180, "train/kl_loss_qwen": 0.04252455835230649, "train/kl_loss_r1": 0.024353090580552815, "train/total_kl": 0.0668776486068964 }, { "epoch": 3.139613435916682, "grad_norm": 2.21875, "learning_rate": 6.435810810810811e-06, "loss": 0.5279, "mean_token_accuracy": 0.9519837826490403, "step": 4185, "train/kl_loss_qwen": 0.04363212245516479, "train/kl_loss_r1": 0.026513157226145268, "train/total_kl": 0.07014527972787618 }, { "epoch": 3.143366485269281, "grad_norm": 1.9296875, "learning_rate": 6.407657657657658e-06, "loss": 0.5222, "mean_token_accuracy": 0.9523192524909974, "step": 4190, "train/kl_loss_qwen": 0.04511188971810043, "train/kl_loss_r1": 0.02609873116016388, "train/total_kl": 0.07121062017977238 }, { "epoch": 3.14711953462188, "grad_norm": 2.171875, "learning_rate": 6.379504504504505e-06, "loss": 0.5307, "mean_token_accuracy": 0.9508942574262619, "step": 4195, "train/kl_loss_qwen": 0.04281947310082614, "train/kl_loss_r1": 0.02625079546123743, "train/total_kl": 0.06907026935368776 }, { "epoch": 3.150872583974479, "grad_norm": 1.78125, "learning_rate": 6.351351351351352e-06, "loss": 0.4731, "mean_token_accuracy": 0.9568151891231537, "step": 4200, "train/kl_loss_qwen": 0.036586605850607155, "train/kl_loss_r1": 0.02390783354640007, "train/total_kl": 0.060494439676404 }, { "epoch": 3.154625633327078, "grad_norm": 1.8671875, "learning_rate": 6.323198198198198e-06, "loss": 0.4717, "mean_token_accuracy": 0.954903456568718, "step": 4205, "train/kl_loss_qwen": 0.03747730739414692, "train/kl_loss_r1": 0.021962188137695193, "train/total_kl": 0.05943949557840824 }, { "epoch": 3.158378682679677, "grad_norm": 2.0625, "learning_rate": 6.295045045045045e-06, "loss": 0.5623, "mean_token_accuracy": 0.9474755525588989, "step": 4210, "train/kl_loss_qwen": 0.050565437460318205, "train/kl_loss_r1": 0.028789392672479153, "train/total_kl": 0.07935483139008284 }, { "epoch": 3.162131732032276, "grad_norm": 1.78125, "learning_rate": 6.266891891891892e-06, "loss": 0.4662, "mean_token_accuracy": 0.9511516332626343, "step": 4215, "train/kl_loss_qwen": 0.03249250883236528, "train/kl_loss_r1": 0.019301535561680794, "train/total_kl": 0.05179404448717832 }, { "epoch": 3.165884781384875, "grad_norm": 2.453125, "learning_rate": 6.238738738738739e-06, "loss": 0.5013, "mean_token_accuracy": 0.9568227618932724, "step": 4220, "train/kl_loss_qwen": 0.041591133316978814, "train/kl_loss_r1": 0.025532052014023067, "train/total_kl": 0.0671231847256422 }, { "epoch": 3.169637830737474, "grad_norm": 1.84375, "learning_rate": 6.210585585585586e-06, "loss": 0.5351, "mean_token_accuracy": 0.9437592476606369, "step": 4225, "train/kl_loss_qwen": 0.03993491227738559, "train/kl_loss_r1": 0.02458281647413969, "train/total_kl": 0.0645177292637527 }, { "epoch": 3.173390880090073, "grad_norm": 3.078125, "learning_rate": 6.1824324324324326e-06, "loss": 0.5102, "mean_token_accuracy": 0.9511289745569229, "step": 4230, "train/kl_loss_qwen": 0.03975429474376142, "train/kl_loss_r1": 0.02539440095424652, "train/total_kl": 0.06514869593083858 }, { "epoch": 3.177143929442672, "grad_norm": 1.671875, "learning_rate": 6.15427927927928e-06, "loss": 0.5408, "mean_token_accuracy": 0.9547346591949463, "step": 4235, "train/kl_loss_qwen": 0.0481301327701658, "train/kl_loss_r1": 0.0268444970715791, "train/total_kl": 0.07497463030740618 }, { "epoch": 3.1808969787952712, "grad_norm": 1.6484375, "learning_rate": 6.126126126126126e-06, "loss": 0.5618, "mean_token_accuracy": 0.9479600071907044, "step": 4240, "train/kl_loss_qwen": 0.0451738444622606, "train/kl_loss_r1": 0.026249010814353824, "train/total_kl": 0.07142285536974669 }, { "epoch": 3.1846500281478702, "grad_norm": 2.328125, "learning_rate": 6.097972972972973e-06, "loss": 0.4792, "mean_token_accuracy": 0.9450971424579621, "step": 4245, "train/kl_loss_qwen": 0.03210086454637349, "train/kl_loss_r1": 0.02111982530914247, "train/total_kl": 0.05322068994864822 }, { "epoch": 3.1884030775004693, "grad_norm": 2.0, "learning_rate": 6.06981981981982e-06, "loss": 0.5035, "mean_token_accuracy": 0.9456622421741485, "step": 4250, "train/kl_loss_qwen": 0.036170482821762565, "train/kl_loss_r1": 0.022352162282913923, "train/total_kl": 0.058522645849734545 }, { "epoch": 3.1921561268530683, "grad_norm": 4.15625, "learning_rate": 6.041666666666667e-06, "loss": 0.5449, "mean_token_accuracy": 0.9458593904972077, "step": 4255, "train/kl_loss_qwen": 0.04212156161665916, "train/kl_loss_r1": 0.025973267480731012, "train/total_kl": 0.068094830121845 }, { "epoch": 3.1959091762056673, "grad_norm": 2.078125, "learning_rate": 6.013513513513514e-06, "loss": 0.4976, "mean_token_accuracy": 0.9549412935972214, "step": 4260, "train/kl_loss_qwen": 0.041603248473256825, "train/kl_loss_r1": 0.02461081640794873, "train/total_kl": 0.06621406432241202 }, { "epoch": 3.1996622255582663, "grad_norm": 2.890625, "learning_rate": 5.9853603603603605e-06, "loss": 0.5055, "mean_token_accuracy": 0.949541175365448, "step": 4265, "train/kl_loss_qwen": 0.040113079734146594, "train/kl_loss_r1": 0.02302660490386188, "train/total_kl": 0.06313968505710363 }, { "epoch": 3.2034152749108653, "grad_norm": 1.7265625, "learning_rate": 5.957207207207208e-06, "loss": 0.5503, "mean_token_accuracy": 0.9499185711145401, "step": 4270, "train/kl_loss_qwen": 0.04532988341525197, "train/kl_loss_r1": 0.026170040108263494, "train/total_kl": 0.07149992333725094 }, { "epoch": 3.207168324263464, "grad_norm": 2.21875, "learning_rate": 5.929054054054054e-06, "loss": 0.4828, "mean_token_accuracy": 0.9559267908334732, "step": 4275, "train/kl_loss_qwen": 0.03815796659328043, "train/kl_loss_r1": 0.023687106277793645, "train/total_kl": 0.06184507291764021 }, { "epoch": 3.210921373616063, "grad_norm": 2.15625, "learning_rate": 5.900900900900902e-06, "loss": 0.4564, "mean_token_accuracy": 0.9539308249950409, "step": 4280, "train/kl_loss_qwen": 0.029147087782621383, "train/kl_loss_r1": 0.020383994840085507, "train/total_kl": 0.04953108299523592 }, { "epoch": 3.214674422968662, "grad_norm": 1.6171875, "learning_rate": 5.872747747747748e-06, "loss": 0.5077, "mean_token_accuracy": 0.9499585449695587, "step": 4285, "train/kl_loss_qwen": 0.04101836262270808, "train/kl_loss_r1": 0.023595213936641813, "train/total_kl": 0.06461357641965151 }, { "epoch": 3.218427472321261, "grad_norm": 2.359375, "learning_rate": 5.844594594594595e-06, "loss": 0.5314, "mean_token_accuracy": 0.9491012632846832, "step": 4290, "train/kl_loss_qwen": 0.04348352774977684, "train/kl_loss_r1": 0.026489183958619832, "train/total_kl": 0.06997271161526442 }, { "epoch": 3.22218052167386, "grad_norm": 2.0, "learning_rate": 5.816441441441442e-06, "loss": 0.4828, "mean_token_accuracy": 0.9515987575054169, "step": 4295, "train/kl_loss_qwen": 0.038013959862291814, "train/kl_loss_r1": 0.024154541036114096, "train/total_kl": 0.06216850131750107 }, { "epoch": 3.225933571026459, "grad_norm": 1.9453125, "learning_rate": 5.7882882882882885e-06, "loss": 0.4856, "mean_token_accuracy": 0.951391515135765, "step": 4300, "train/kl_loss_qwen": 0.03802924687042832, "train/kl_loss_r1": 0.02343762177042663, "train/total_kl": 0.06146686850115657 }, { "epoch": 3.229686620379058, "grad_norm": 1.6953125, "learning_rate": 5.760135135135136e-06, "loss": 0.4937, "mean_token_accuracy": 0.9538519591093063, "step": 4305, "train/kl_loss_qwen": 0.03933619349263608, "train/kl_loss_r1": 0.024646869115531444, "train/total_kl": 0.06398306302726268 }, { "epoch": 3.233439669731657, "grad_norm": 2.0625, "learning_rate": 5.731981981981982e-06, "loss": 0.5126, "mean_token_accuracy": 0.9565867841243744, "step": 4310, "train/kl_loss_qwen": 0.047122747730463745, "train/kl_loss_r1": 0.02656792337074876, "train/total_kl": 0.07369067054241896 }, { "epoch": 3.237192719084256, "grad_norm": 1.859375, "learning_rate": 5.70382882882883e-06, "loss": 0.5087, "mean_token_accuracy": 0.9582189708948136, "step": 4315, "train/kl_loss_qwen": 0.04418886038474738, "train/kl_loss_r1": 0.025840024650096893, "train/total_kl": 0.07002888554707169 }, { "epoch": 3.240945768436855, "grad_norm": 2.453125, "learning_rate": 5.675675675675676e-06, "loss": 0.4666, "mean_token_accuracy": 0.9552791446447373, "step": 4320, "train/kl_loss_qwen": 0.03426559055224061, "train/kl_loss_r1": 0.022823481913655998, "train/total_kl": 0.05708907237276435 }, { "epoch": 3.244698817789454, "grad_norm": 1.953125, "learning_rate": 5.647522522522523e-06, "loss": 0.517, "mean_token_accuracy": 0.9423777401447296, "step": 4325, "train/kl_loss_qwen": 0.03696016678586602, "train/kl_loss_r1": 0.023434765404090285, "train/total_kl": 0.06039493260905147 }, { "epoch": 3.248451867142053, "grad_norm": 1.828125, "learning_rate": 5.61936936936937e-06, "loss": 0.4976, "mean_token_accuracy": 0.9435189306735993, "step": 4330, "train/kl_loss_qwen": 0.03490878287702799, "train/kl_loss_r1": 0.02145023737102747, "train/total_kl": 0.05635902034118771 }, { "epoch": 3.252204916494652, "grad_norm": 2.15625, "learning_rate": 5.5912162162162165e-06, "loss": 0.6065, "mean_token_accuracy": 0.9520415842533112, "step": 4335, "train/kl_loss_qwen": 0.057009863667190075, "train/kl_loss_r1": 0.03349468014203012, "train/total_kl": 0.09050454422831536 }, { "epoch": 3.255957965847251, "grad_norm": 1.515625, "learning_rate": 5.563063063063064e-06, "loss": 0.4853, "mean_token_accuracy": 0.9562025338411331, "step": 4340, "train/kl_loss_qwen": 0.04025891097262502, "train/kl_loss_r1": 0.023304715799167753, "train/total_kl": 0.06356362700462341 }, { "epoch": 3.25971101519985, "grad_norm": 2.0, "learning_rate": 5.53490990990991e-06, "loss": 0.4639, "mean_token_accuracy": 0.955470883846283, "step": 4345, "train/kl_loss_qwen": 0.0339654213283211, "train/kl_loss_r1": 0.021475129947066306, "train/total_kl": 0.05544055104255676 }, { "epoch": 3.2634640645524486, "grad_norm": 2.65625, "learning_rate": 5.506756756756758e-06, "loss": 0.4686, "mean_token_accuracy": 0.9480804920196533, "step": 4350, "train/kl_loss_qwen": 0.031937024602666494, "train/kl_loss_r1": 0.020728342095389964, "train/total_kl": 0.05266536641865969 }, { "epoch": 3.2672171139050477, "grad_norm": 1.671875, "learning_rate": 5.478603603603604e-06, "loss": 0.5332, "mean_token_accuracy": 0.9519092202186584, "step": 4355, "train/kl_loss_qwen": 0.043146210024133325, "train/kl_loss_r1": 0.027150555653497575, "train/total_kl": 0.07029676483944058 }, { "epoch": 3.2709701632576467, "grad_norm": 1.96875, "learning_rate": 5.450450450450451e-06, "loss": 0.4917, "mean_token_accuracy": 0.9604987561702728, "step": 4360, "train/kl_loss_qwen": 0.041492973314598204, "train/kl_loss_r1": 0.02612789338454604, "train/total_kl": 0.06762086730450392 }, { "epoch": 3.2747232126102457, "grad_norm": 1.75, "learning_rate": 5.422297297297298e-06, "loss": 0.5062, "mean_token_accuracy": 0.9497289001941681, "step": 4365, "train/kl_loss_qwen": 0.038669126899912955, "train/kl_loss_r1": 0.022001048410311343, "train/total_kl": 0.06067017521709204 }, { "epoch": 3.2784762619628447, "grad_norm": 1.921875, "learning_rate": 5.3941441441441445e-06, "loss": 0.5098, "mean_token_accuracy": 0.946996933221817, "step": 4370, "train/kl_loss_qwen": 0.036139405751600864, "train/kl_loss_r1": 0.024025491438806057, "train/total_kl": 0.06016489639878273 }, { "epoch": 3.2822293113154437, "grad_norm": 2.96875, "learning_rate": 5.365990990990991e-06, "loss": 0.4791, "mean_token_accuracy": 0.9525912255048752, "step": 4375, "train/kl_loss_qwen": 0.03400084599852562, "train/kl_loss_r1": 0.02241660561412573, "train/total_kl": 0.056417451426386836 }, { "epoch": 3.2859823606680427, "grad_norm": 1.734375, "learning_rate": 5.3378378378378374e-06, "loss": 0.5387, "mean_token_accuracy": 0.9525120824575424, "step": 4380, "train/kl_loss_qwen": 0.04745977125130594, "train/kl_loss_r1": 0.02659780075773597, "train/total_kl": 0.07405757205560803 }, { "epoch": 3.2897354100206417, "grad_norm": 1.5390625, "learning_rate": 5.309684684684685e-06, "loss": 0.4835, "mean_token_accuracy": 0.9562853127717972, "step": 4385, "train/kl_loss_qwen": 0.040935520501807335, "train/kl_loss_r1": 0.023382049147039653, "train/total_kl": 0.06431756988167762 }, { "epoch": 3.2934884593732408, "grad_norm": 2.046875, "learning_rate": 5.281531531531531e-06, "loss": 0.516, "mean_token_accuracy": 0.9541277021169663, "step": 4390, "train/kl_loss_qwen": 0.04403358194977045, "train/kl_loss_r1": 0.027043864829465747, "train/total_kl": 0.0710774464532733 }, { "epoch": 3.2972415087258398, "grad_norm": 1.75, "learning_rate": 5.253378378378378e-06, "loss": 0.5169, "mean_token_accuracy": 0.9496819704771042, "step": 4395, "train/kl_loss_qwen": 0.04312458084896207, "train/kl_loss_r1": 0.025393119966611265, "train/total_kl": 0.0685177012346685 }, { "epoch": 3.300994558078439, "grad_norm": 2.359375, "learning_rate": 5.225225225225225e-06, "loss": 0.5119, "mean_token_accuracy": 0.9501294255256653, "step": 4400, "train/kl_loss_qwen": 0.03754086145199835, "train/kl_loss_r1": 0.024014173122122884, "train/total_kl": 0.06155503448098898 }, { "epoch": 3.304747607431038, "grad_norm": 1.9609375, "learning_rate": 5.197072072072072e-06, "loss": 0.5073, "mean_token_accuracy": 0.9500888794660568, "step": 4405, "train/kl_loss_qwen": 0.03989710342139006, "train/kl_loss_r1": 0.024184916401281953, "train/total_kl": 0.06408202080056072 }, { "epoch": 3.308500656783637, "grad_norm": 2.96875, "learning_rate": 5.168918918918919e-06, "loss": 0.5735, "mean_token_accuracy": 0.9382760256528855, "step": 4410, "train/kl_loss_qwen": 0.044976729340851306, "train/kl_loss_r1": 0.027697026263922453, "train/total_kl": 0.07267375560477377 }, { "epoch": 3.312253706136236, "grad_norm": 2.65625, "learning_rate": 5.140765765765765e-06, "loss": 0.5057, "mean_token_accuracy": 0.9447282940149307, "step": 4415, "train/kl_loss_qwen": 0.03504931908100843, "train/kl_loss_r1": 0.0225065934471786, "train/total_kl": 0.057555912714451554 }, { "epoch": 3.316006755488835, "grad_norm": 2.28125, "learning_rate": 5.112612612612613e-06, "loss": 0.5074, "mean_token_accuracy": 0.9480471581220626, "step": 4420, "train/kl_loss_qwen": 0.038661521812900904, "train/kl_loss_r1": 0.023841103445738553, "train/total_kl": 0.06250262567773461 }, { "epoch": 3.319759804841434, "grad_norm": 2.875, "learning_rate": 5.084459459459459e-06, "loss": 0.5006, "mean_token_accuracy": 0.9469463229179382, "step": 4425, "train/kl_loss_qwen": 0.034021322568878534, "train/kl_loss_r1": 0.02232333249412477, "train/total_kl": 0.05634465422481298 }, { "epoch": 3.323512854194033, "grad_norm": 1.8203125, "learning_rate": 5.056306306306306e-06, "loss": 0.5001, "mean_token_accuracy": 0.9527624189853668, "step": 4430, "train/kl_loss_qwen": 0.041707838978618385, "train/kl_loss_r1": 0.02471332629211247, "train/total_kl": 0.06642116559669375 }, { "epoch": 3.327265903546632, "grad_norm": 2.71875, "learning_rate": 5.028153153153153e-06, "loss": 0.4856, "mean_token_accuracy": 0.9498600274324417, "step": 4435, "train/kl_loss_qwen": 0.03649712633341551, "train/kl_loss_r1": 0.022463715448975564, "train/total_kl": 0.058960842061787845 }, { "epoch": 3.3310189528992304, "grad_norm": 1.46875, "learning_rate": 4.9999999999999996e-06, "loss": 0.5544, "mean_token_accuracy": 0.9496265351772308, "step": 4440, "train/kl_loss_qwen": 0.04972629891708493, "train/kl_loss_r1": 0.028210808150470258, "train/total_kl": 0.07793710688129067 }, { "epoch": 3.3347720022518295, "grad_norm": 1.6015625, "learning_rate": 4.971846846846847e-06, "loss": 0.4717, "mean_token_accuracy": 0.9556352138519287, "step": 4445, "train/kl_loss_qwen": 0.03368289568461478, "train/kl_loss_r1": 0.02205599411390722, "train/total_kl": 0.055738890264183286 }, { "epoch": 3.3385250516044285, "grad_norm": 2.125, "learning_rate": 4.943693693693693e-06, "loss": 0.5087, "mean_token_accuracy": 0.9517245024442673, "step": 4450, "train/kl_loss_qwen": 0.03941992614418268, "train/kl_loss_r1": 0.024540536990389227, "train/total_kl": 0.06396046299487353 }, { "epoch": 3.3422781009570275, "grad_norm": 1.6953125, "learning_rate": 4.915540540540541e-06, "loss": 0.5082, "mean_token_accuracy": 0.9545890867710114, "step": 4455, "train/kl_loss_qwen": 0.04155694702640176, "train/kl_loss_r1": 0.024792100116610528, "train/total_kl": 0.06634904704988002 }, { "epoch": 3.3460311503096265, "grad_norm": 1.875, "learning_rate": 4.887387387387387e-06, "loss": 0.5041, "mean_token_accuracy": 0.9501286745071411, "step": 4460, "train/kl_loss_qwen": 0.03695795922540128, "train/kl_loss_r1": 0.024665044527500866, "train/total_kl": 0.06162300417199731 }, { "epoch": 3.3497841996622255, "grad_norm": 1.828125, "learning_rate": 4.859234234234234e-06, "loss": 0.476, "mean_token_accuracy": 0.9575912714004516, "step": 4465, "train/kl_loss_qwen": 0.038898851396515964, "train/kl_loss_r1": 0.02317404472269118, "train/total_kl": 0.062072896771132945 }, { "epoch": 3.3535372490148245, "grad_norm": 2.515625, "learning_rate": 4.831081081081081e-06, "loss": 0.53, "mean_token_accuracy": 0.9492391794919968, "step": 4470, "train/kl_loss_qwen": 0.04130629752762616, "train/kl_loss_r1": 0.026160174002870917, "train/total_kl": 0.06746647097170352 }, { "epoch": 3.3572902983674235, "grad_norm": 1.9140625, "learning_rate": 4.8029279279279275e-06, "loss": 0.5003, "mean_token_accuracy": 0.9499774962663651, "step": 4475, "train/kl_loss_qwen": 0.042116965632885695, "train/kl_loss_r1": 0.023339213198050858, "train/total_kl": 0.06545617831870913 }, { "epoch": 3.3610433477200226, "grad_norm": 2.53125, "learning_rate": 4.774774774774775e-06, "loss": 0.4913, "mean_token_accuracy": 0.9487686693668366, "step": 4480, "train/kl_loss_qwen": 0.03564274497330189, "train/kl_loss_r1": 0.02291566417552531, "train/total_kl": 0.058558409195393325 }, { "epoch": 3.3647963970726216, "grad_norm": 2.296875, "learning_rate": 4.746621621621621e-06, "loss": 0.4881, "mean_token_accuracy": 0.9511472195386886, "step": 4485, "train/kl_loss_qwen": 0.03707243660464883, "train/kl_loss_r1": 0.02255106377415359, "train/total_kl": 0.05962350023910403 }, { "epoch": 3.3685494464252206, "grad_norm": 2.109375, "learning_rate": 4.718468468468469e-06, "loss": 0.5247, "mean_token_accuracy": 0.9543746292591095, "step": 4490, "train/kl_loss_qwen": 0.043492857413366434, "train/kl_loss_r1": 0.027063050866127016, "train/total_kl": 0.07055590879172087 }, { "epoch": 3.3723024957778196, "grad_norm": 2.921875, "learning_rate": 4.690315315315315e-06, "loss": 0.4685, "mean_token_accuracy": 0.9536369174718857, "step": 4495, "train/kl_loss_qwen": 0.0325671270955354, "train/kl_loss_r1": 0.020675616106018424, "train/total_kl": 0.05324274385347962 }, { "epoch": 3.3760555451304186, "grad_norm": 1.625, "learning_rate": 4.6621621621621625e-06, "loss": 0.5122, "mean_token_accuracy": 0.9575406193733216, "step": 4500, "train/kl_loss_qwen": 0.04434308242052794, "train/kl_loss_r1": 0.025985902547836302, "train/total_kl": 0.07032898515462875 }, { "epoch": 3.3798085944830176, "grad_norm": 1.78125, "learning_rate": 4.634009009009009e-06, "loss": 0.4894, "mean_token_accuracy": 0.9510607182979584, "step": 4505, "train/kl_loss_qwen": 0.03664002763107419, "train/kl_loss_r1": 0.02325889216735959, "train/total_kl": 0.05989891951903701 }, { "epoch": 3.383561643835616, "grad_norm": 2.140625, "learning_rate": 4.6058558558558555e-06, "loss": 0.518, "mean_token_accuracy": 0.9529828011989594, "step": 4510, "train/kl_loss_qwen": 0.039163641864433885, "train/kl_loss_r1": 0.025084894429892302, "train/total_kl": 0.06424853699281811 }, { "epoch": 3.387314693188215, "grad_norm": 1.640625, "learning_rate": 4.577702702702703e-06, "loss": 0.5106, "mean_token_accuracy": 0.9479302018880844, "step": 4515, "train/kl_loss_qwen": 0.03873064480721951, "train/kl_loss_r1": 0.023981414455920457, "train/total_kl": 0.06271205889061093 }, { "epoch": 3.3910677425408142, "grad_norm": 2.0625, "learning_rate": 4.549549549549549e-06, "loss": 0.5524, "mean_token_accuracy": 0.9479347318410873, "step": 4520, "train/kl_loss_qwen": 0.047627780586481094, "train/kl_loss_r1": 0.02741450662724674, "train/total_kl": 0.07504228772595525 }, { "epoch": 3.3948207918934132, "grad_norm": 2.640625, "learning_rate": 4.521396396396397e-06, "loss": 0.5065, "mean_token_accuracy": 0.9493608593940734, "step": 4525, "train/kl_loss_qwen": 0.0406539726536721, "train/kl_loss_r1": 0.024122460465878248, "train/total_kl": 0.06477643344551325 }, { "epoch": 3.3985738412460123, "grad_norm": 2.34375, "learning_rate": 4.493243243243243e-06, "loss": 0.4712, "mean_token_accuracy": 0.948474669456482, "step": 4530, "train/kl_loss_qwen": 0.030185632361099123, "train/kl_loss_r1": 0.020759632252156733, "train/total_kl": 0.0509452648460865 }, { "epoch": 3.4023268905986113, "grad_norm": 3.03125, "learning_rate": 4.4650900900900905e-06, "loss": 0.4943, "mean_token_accuracy": 0.9527560323476791, "step": 4535, "train/kl_loss_qwen": 0.03848574049770832, "train/kl_loss_r1": 0.021982099581509828, "train/total_kl": 0.06046783970668912 }, { "epoch": 3.4060799399512103, "grad_norm": 2.859375, "learning_rate": 4.436936936936937e-06, "loss": 0.5407, "mean_token_accuracy": 0.9428445607423782, "step": 4540, "train/kl_loss_qwen": 0.04301722776144743, "train/kl_loss_r1": 0.025781831610947846, "train/total_kl": 0.06879905974492431 }, { "epoch": 3.4098329893038093, "grad_norm": 2.90625, "learning_rate": 4.4087837837837835e-06, "loss": 0.474, "mean_token_accuracy": 0.950044310092926, "step": 4545, "train/kl_loss_qwen": 0.034028490027412775, "train/kl_loss_r1": 0.021919101616367696, "train/total_kl": 0.055947590805590156 }, { "epoch": 3.4135860386564083, "grad_norm": 1.7890625, "learning_rate": 4.380630630630631e-06, "loss": 0.4901, "mean_token_accuracy": 0.9547917276620865, "step": 4550, "train/kl_loss_qwen": 0.03873153259046376, "train/kl_loss_r1": 0.02365042078308761, "train/total_kl": 0.062381953466683626 }, { "epoch": 3.4173390880090073, "grad_norm": 1.71875, "learning_rate": 4.352477477477477e-06, "loss": 0.5486, "mean_token_accuracy": 0.9475720256567002, "step": 4555, "train/kl_loss_qwen": 0.045938981743529436, "train/kl_loss_r1": 0.02708872049115598, "train/total_kl": 0.07302770223468542 }, { "epoch": 3.4210921373616063, "grad_norm": 2.671875, "learning_rate": 4.324324324324325e-06, "loss": 0.4658, "mean_token_accuracy": 0.9467237561941146, "step": 4560, "train/kl_loss_qwen": 0.03142950688488781, "train/kl_loss_r1": 0.020448410185053945, "train/total_kl": 0.05187791669741273 }, { "epoch": 3.4248451867142053, "grad_norm": 1.6875, "learning_rate": 4.296171171171171e-06, "loss": 0.4579, "mean_token_accuracy": 0.9478941440582276, "step": 4565, "train/kl_loss_qwen": 0.028696865122765303, "train/kl_loss_r1": 0.019314822740852833, "train/total_kl": 0.04801168767735362 }, { "epoch": 3.4285982360668044, "grad_norm": 1.78125, "learning_rate": 4.2680180180180185e-06, "loss": 0.4945, "mean_token_accuracy": 0.9537198185920716, "step": 4570, "train/kl_loss_qwen": 0.03776753200218082, "train/kl_loss_r1": 0.02526979329995811, "train/total_kl": 0.0630373259074986 }, { "epoch": 3.4323512854194034, "grad_norm": 1.875, "learning_rate": 4.239864864864865e-06, "loss": 0.549, "mean_token_accuracy": 0.9553028732538223, "step": 4575, "train/kl_loss_qwen": 0.04971991777420044, "train/kl_loss_r1": 0.028436136478558183, "train/total_kl": 0.0781560542061925 }, { "epoch": 3.4361043347720024, "grad_norm": 1.625, "learning_rate": 4.2117117117117115e-06, "loss": 0.5464, "mean_token_accuracy": 0.951890167593956, "step": 4580, "train/kl_loss_qwen": 0.049332274869084355, "train/kl_loss_r1": 0.02864066422916949, "train/total_kl": 0.07797293970361352 }, { "epoch": 3.4398573841246014, "grad_norm": 2.03125, "learning_rate": 4.183558558558559e-06, "loss": 0.5501, "mean_token_accuracy": 0.9465802252292633, "step": 4585, "train/kl_loss_qwen": 0.044763072533532976, "train/kl_loss_r1": 0.02734934687614441, "train/total_kl": 0.0721124186180532 }, { "epoch": 3.4436104334772004, "grad_norm": 1.65625, "learning_rate": 4.155405405405405e-06, "loss": 0.488, "mean_token_accuracy": 0.9554612100124359, "step": 4590, "train/kl_loss_qwen": 0.04139808346517384, "train/kl_loss_r1": 0.024592308327555656, "train/total_kl": 0.06599039165303111 }, { "epoch": 3.4473634828297994, "grad_norm": 2.34375, "learning_rate": 4.127252252252253e-06, "loss": 0.5267, "mean_token_accuracy": 0.9453837454319001, "step": 4595, "train/kl_loss_qwen": 0.039892626367509364, "train/kl_loss_r1": 0.024147269502282142, "train/total_kl": 0.0640398958697915 }, { "epoch": 3.4511165321823984, "grad_norm": 1.9609375, "learning_rate": 4.099099099099099e-06, "loss": 0.4839, "mean_token_accuracy": 0.9594921231269836, "step": 4600, "train/kl_loss_qwen": 0.03939856206998229, "train/kl_loss_r1": 0.02459759754128754, "train/total_kl": 0.06399615965783596 }, { "epoch": 3.454869581534997, "grad_norm": 1.953125, "learning_rate": 4.0709459459459465e-06, "loss": 0.5362, "mean_token_accuracy": 0.9532510668039322, "step": 4605, "train/kl_loss_qwen": 0.04666020777076483, "train/kl_loss_r1": 0.026927021471783517, "train/total_kl": 0.07358722947537899 }, { "epoch": 3.458622630887596, "grad_norm": 2.28125, "learning_rate": 4.042792792792793e-06, "loss": 0.4866, "mean_token_accuracy": 0.953156578540802, "step": 4610, "train/kl_loss_qwen": 0.03761745826341212, "train/kl_loss_r1": 0.022605449566617607, "train/total_kl": 0.060222907457500696 }, { "epoch": 3.462375680240195, "grad_norm": 1.953125, "learning_rate": 4.0146396396396394e-06, "loss": 0.5006, "mean_token_accuracy": 0.953925734758377, "step": 4615, "train/kl_loss_qwen": 0.03867802955210209, "train/kl_loss_r1": 0.024804549338296056, "train/total_kl": 0.06348257856443525 }, { "epoch": 3.466128729592794, "grad_norm": 1.8984375, "learning_rate": 3.986486486486487e-06, "loss": 0.5623, "mean_token_accuracy": 0.9530359268188476, "step": 4620, "train/kl_loss_qwen": 0.050726366927847266, "train/kl_loss_r1": 0.027859060373157263, "train/total_kl": 0.0785854272544384 }, { "epoch": 3.469881778945393, "grad_norm": 1.8203125, "learning_rate": 3.958333333333333e-06, "loss": 0.4911, "mean_token_accuracy": 0.9550992786884308, "step": 4625, "train/kl_loss_qwen": 0.03829608168452978, "train/kl_loss_r1": 0.02386563769541681, "train/total_kl": 0.06216171951964498 }, { "epoch": 3.473634828297992, "grad_norm": 1.78125, "learning_rate": 3.930180180180181e-06, "loss": 0.4924, "mean_token_accuracy": 0.9495264708995819, "step": 4630, "train/kl_loss_qwen": 0.03702715411782265, "train/kl_loss_r1": 0.022891523968428373, "train/total_kl": 0.05991867855191231 }, { "epoch": 3.477387877650591, "grad_norm": 2.421875, "learning_rate": 3.902027027027027e-06, "loss": 0.5782, "mean_token_accuracy": 0.949220260977745, "step": 4635, "train/kl_loss_qwen": 0.053430474689230324, "train/kl_loss_r1": 0.03059484055265784, "train/total_kl": 0.084025314822793 }, { "epoch": 3.48114092700319, "grad_norm": 2.875, "learning_rate": 3.8738738738738744e-06, "loss": 0.5004, "mean_token_accuracy": 0.949424222111702, "step": 4640, "train/kl_loss_qwen": 0.03316820659674704, "train/kl_loss_r1": 0.02219580514356494, "train/total_kl": 0.05536401178687811 }, { "epoch": 3.484893976355789, "grad_norm": 1.7578125, "learning_rate": 3.845720720720721e-06, "loss": 0.4793, "mean_token_accuracy": 0.9511813431978225, "step": 4645, "train/kl_loss_qwen": 0.03428934076800942, "train/kl_loss_r1": 0.022562990756705405, "train/total_kl": 0.05685233175754547 }, { "epoch": 3.488647025708388, "grad_norm": 1.8515625, "learning_rate": 3.817567567567567e-06, "loss": 0.5208, "mean_token_accuracy": 0.9530722856521606, "step": 4650, "train/kl_loss_qwen": 0.04267180510796607, "train/kl_loss_r1": 0.025806902069598438, "train/total_kl": 0.06847870666533709 }, { "epoch": 3.492400075060987, "grad_norm": 2.03125, "learning_rate": 3.7894144144144148e-06, "loss": 0.5136, "mean_token_accuracy": 0.9550452619791031, "step": 4655, "train/kl_loss_qwen": 0.041353469667956236, "train/kl_loss_r1": 0.025874977000057697, "train/total_kl": 0.06722844615578652 }, { "epoch": 3.496153124413586, "grad_norm": 1.5, "learning_rate": 3.7612612612612617e-06, "loss": 0.5144, "mean_token_accuracy": 0.9574123293161392, "step": 4660, "train/kl_loss_qwen": 0.04588752212002874, "train/kl_loss_r1": 0.026548220915719865, "train/total_kl": 0.07243574410676956 }, { "epoch": 3.499906173766185, "grad_norm": 1.546875, "learning_rate": 3.7331081081081086e-06, "loss": 0.4752, "mean_token_accuracy": 0.9535851895809173, "step": 4665, "train/kl_loss_qwen": 0.03505368349142372, "train/kl_loss_r1": 0.02288009631447494, "train/total_kl": 0.05793378055095673 }, { "epoch": 3.5036592231187837, "grad_norm": 2.234375, "learning_rate": 3.704954954954955e-06, "loss": 0.517, "mean_token_accuracy": 0.953430250287056, "step": 4670, "train/kl_loss_qwen": 0.041387461498379706, "train/kl_loss_r1": 0.02559947860427201, "train/total_kl": 0.06698694005608559 }, { "epoch": 3.5074122724713828, "grad_norm": 2.046875, "learning_rate": 3.676801801801802e-06, "loss": 0.5192, "mean_token_accuracy": 0.949590927362442, "step": 4675, "train/kl_loss_qwen": 0.038729687314480545, "train/kl_loss_r1": 0.023347532469779254, "train/total_kl": 0.06207721931859851 }, { "epoch": 3.5111653218239818, "grad_norm": 1.6953125, "learning_rate": 3.648648648648649e-06, "loss": 0.5063, "mean_token_accuracy": 0.952187979221344, "step": 4680, "train/kl_loss_qwen": 0.04059083824977279, "train/kl_loss_r1": 0.025933190854266285, "train/total_kl": 0.06652402915060521 }, { "epoch": 3.514918371176581, "grad_norm": 2.484375, "learning_rate": 3.6204954954954954e-06, "loss": 0.5103, "mean_token_accuracy": 0.9529137343168259, "step": 4685, "train/kl_loss_qwen": 0.04197904523462057, "train/kl_loss_r1": 0.022938547283411027, "train/total_kl": 0.06491759326308966 }, { "epoch": 3.51867142052918, "grad_norm": 1.640625, "learning_rate": 3.5923423423423423e-06, "loss": 0.4821, "mean_token_accuracy": 0.9563487559556961, "step": 4690, "train/kl_loss_qwen": 0.03939807149581611, "train/kl_loss_r1": 0.023985384777188302, "train/total_kl": 0.0633834559470415 }, { "epoch": 3.522424469881779, "grad_norm": 1.6640625, "learning_rate": 3.5641891891891892e-06, "loss": 0.5201, "mean_token_accuracy": 0.9567440986633301, "step": 4695, "train/kl_loss_qwen": 0.046253665490075944, "train/kl_loss_r1": 0.027819053875282405, "train/total_kl": 0.07407271871343254 }, { "epoch": 3.526177519234378, "grad_norm": 2.3125, "learning_rate": 3.536036036036036e-06, "loss": 0.4794, "mean_token_accuracy": 0.9591157138347626, "step": 4700, "train/kl_loss_qwen": 0.03859961242415011, "train/kl_loss_r1": 0.024089030642062425, "train/total_kl": 0.06268864339217543 }, { "epoch": 3.529930568586977, "grad_norm": 1.390625, "learning_rate": 3.5078828828828826e-06, "loss": 0.5076, "mean_token_accuracy": 0.9511758238077164, "step": 4705, "train/kl_loss_qwen": 0.041626590909436344, "train/kl_loss_r1": 0.02450266946107149, "train/total_kl": 0.0661292603239417 }, { "epoch": 3.533683617939576, "grad_norm": 2.171875, "learning_rate": 3.4797297297297295e-06, "loss": 0.5238, "mean_token_accuracy": 0.9531386703252792, "step": 4710, "train/kl_loss_qwen": 0.04286709842272103, "train/kl_loss_r1": 0.025938824750483036, "train/total_kl": 0.06880592331290245 }, { "epoch": 3.537436667292175, "grad_norm": 1.7578125, "learning_rate": 3.4515765765765765e-06, "loss": 0.5117, "mean_token_accuracy": 0.9504441648721695, "step": 4715, "train/kl_loss_qwen": 0.04200872196815908, "train/kl_loss_r1": 0.02514236718416214, "train/total_kl": 0.06715108891949058 }, { "epoch": 3.541189716644774, "grad_norm": 2.078125, "learning_rate": 3.4234234234234234e-06, "loss": 0.4857, "mean_token_accuracy": 0.9459042757749557, "step": 4720, "train/kl_loss_qwen": 0.034541129739955066, "train/kl_loss_r1": 0.02232414875179529, "train/total_kl": 0.05686527844518423 }, { "epoch": 3.544942765997373, "grad_norm": 1.484375, "learning_rate": 3.3952702702702703e-06, "loss": 0.4954, "mean_token_accuracy": 0.9543802291154861, "step": 4725, "train/kl_loss_qwen": 0.039401004835963246, "train/kl_loss_r1": 0.023825197480618954, "train/total_kl": 0.06322620203718543 }, { "epoch": 3.548695815349972, "grad_norm": 1.8828125, "learning_rate": 3.367117117117117e-06, "loss": 0.4976, "mean_token_accuracy": 0.9500404924154282, "step": 4730, "train/kl_loss_qwen": 0.03725369730964303, "train/kl_loss_r1": 0.022954756021499635, "train/total_kl": 0.060208453238010405 }, { "epoch": 3.552448864702571, "grad_norm": 2.03125, "learning_rate": 3.338963963963964e-06, "loss": 0.5316, "mean_token_accuracy": 0.9575497686862946, "step": 4735, "train/kl_loss_qwen": 0.0468436376657337, "train/kl_loss_r1": 0.02789052496664226, "train/total_kl": 0.07473416347056627 }, { "epoch": 3.55620191405517, "grad_norm": 1.578125, "learning_rate": 3.3108108108108106e-06, "loss": 0.484, "mean_token_accuracy": 0.9488806337118149, "step": 4740, "train/kl_loss_qwen": 0.032839803909882906, "train/kl_loss_r1": 0.02122222976759076, "train/total_kl": 0.05406203325837851 }, { "epoch": 3.559954963407769, "grad_norm": 1.6796875, "learning_rate": 3.2826576576576575e-06, "loss": 0.5449, "mean_token_accuracy": 0.9525219231843949, "step": 4745, "train/kl_loss_qwen": 0.04897039164789021, "train/kl_loss_r1": 0.02860354045405984, "train/total_kl": 0.0775739318691194 }, { "epoch": 3.563708012760368, "grad_norm": 1.515625, "learning_rate": 3.2545045045045044e-06, "loss": 0.4792, "mean_token_accuracy": 0.9464257270097732, "step": 4750, "train/kl_loss_qwen": 0.03381857522763312, "train/kl_loss_r1": 0.0212648831307888, "train/total_kl": 0.05508345831185579 }, { "epoch": 3.567461062112967, "grad_norm": 1.6640625, "learning_rate": 3.2263513513513513e-06, "loss": 0.5117, "mean_token_accuracy": 0.9530625611543655, "step": 4755, "train/kl_loss_qwen": 0.045256762346252796, "train/kl_loss_r1": 0.025322494190186264, "train/total_kl": 0.07057925527915358 }, { "epoch": 3.571214111465566, "grad_norm": 1.9453125, "learning_rate": 3.1981981981981983e-06, "loss": 0.5067, "mean_token_accuracy": 0.949809405207634, "step": 4760, "train/kl_loss_qwen": 0.03583875373005867, "train/kl_loss_r1": 0.02265885784290731, "train/total_kl": 0.058497611340135335 }, { "epoch": 3.574967160818165, "grad_norm": 1.4765625, "learning_rate": 3.170045045045045e-06, "loss": 0.4803, "mean_token_accuracy": 0.9485155403614044, "step": 4765, "train/kl_loss_qwen": 0.03641654024831951, "train/kl_loss_r1": 0.02261554468423128, "train/total_kl": 0.05903208442032337 }, { "epoch": 3.5787202101707636, "grad_norm": 2.296875, "learning_rate": 3.141891891891892e-06, "loss": 0.4805, "mean_token_accuracy": 0.9531418412923813, "step": 4770, "train/kl_loss_qwen": 0.03572290446609259, "train/kl_loss_r1": 0.02349159154109657, "train/total_kl": 0.059214495960623025 }, { "epoch": 3.5824732595233626, "grad_norm": 1.9921875, "learning_rate": 3.113738738738739e-06, "loss": 0.4947, "mean_token_accuracy": 0.9497868716716766, "step": 4775, "train/kl_loss_qwen": 0.03734279680065811, "train/kl_loss_r1": 0.023538395250216126, "train/total_kl": 0.06088119251653552 }, { "epoch": 3.5862263088759616, "grad_norm": 2.0, "learning_rate": 3.0855855855855855e-06, "loss": 0.4699, "mean_token_accuracy": 0.948901292681694, "step": 4780, "train/kl_loss_qwen": 0.030417955154553054, "train/kl_loss_r1": 0.02020354806445539, "train/total_kl": 0.05062150321900845 }, { "epoch": 3.5899793582285606, "grad_norm": 1.71875, "learning_rate": 3.0574324324324324e-06, "loss": 0.4978, "mean_token_accuracy": 0.9499588519334793, "step": 4785, "train/kl_loss_qwen": 0.038579528825357555, "train/kl_loss_r1": 0.02370496103540063, "train/total_kl": 0.06228449046611786 }, { "epoch": 3.5937324075811596, "grad_norm": 1.7578125, "learning_rate": 3.0292792792792793e-06, "loss": 0.4563, "mean_token_accuracy": 0.9571527928113938, "step": 4790, "train/kl_loss_qwen": 0.0355854959692806, "train/kl_loss_r1": 0.02241732254624367, "train/total_kl": 0.05800281846895814 }, { "epoch": 3.5974854569337587, "grad_norm": 1.7734375, "learning_rate": 3.0011261261261262e-06, "loss": 0.5416, "mean_token_accuracy": 0.9569284915924072, "step": 4795, "train/kl_loss_qwen": 0.04847305933944881, "train/kl_loss_r1": 0.02857246994972229, "train/total_kl": 0.07704552887007594 }, { "epoch": 3.6012385062863577, "grad_norm": 2.453125, "learning_rate": 2.972972972972973e-06, "loss": 0.459, "mean_token_accuracy": 0.9568021237850189, "step": 4800, "train/kl_loss_qwen": 0.03281675688922405, "train/kl_loss_r1": 0.021974925044924022, "train/total_kl": 0.05479168212041259 }, { "epoch": 3.6049915556389567, "grad_norm": 1.4921875, "learning_rate": 2.94481981981982e-06, "loss": 0.5005, "mean_token_accuracy": 0.951943552494049, "step": 4805, "train/kl_loss_qwen": 0.037731643626466395, "train/kl_loss_r1": 0.023648474551737308, "train/total_kl": 0.06138011813163757 }, { "epoch": 3.6087446049915557, "grad_norm": 2.84375, "learning_rate": 2.916666666666667e-06, "loss": 0.5074, "mean_token_accuracy": 0.9509950965642929, "step": 4810, "train/kl_loss_qwen": 0.040730614122003315, "train/kl_loss_r1": 0.023938436387106778, "train/total_kl": 0.0646690510213375 }, { "epoch": 3.6124976543441547, "grad_norm": 2.28125, "learning_rate": 2.8885135135135135e-06, "loss": 0.4647, "mean_token_accuracy": 0.9506016135215759, "step": 4815, "train/kl_loss_qwen": 0.03288884097710252, "train/kl_loss_r1": 0.020954125700518487, "train/total_kl": 0.05384296691045165 }, { "epoch": 3.6162507036967537, "grad_norm": 2.1875, "learning_rate": 2.8603603603603604e-06, "loss": 0.5172, "mean_token_accuracy": 0.9470595866441727, "step": 4820, "train/kl_loss_qwen": 0.0408139303792268, "train/kl_loss_r1": 0.02478752490133047, "train/total_kl": 0.0656014553271234 }, { "epoch": 3.6200037530493527, "grad_norm": 1.8046875, "learning_rate": 2.8322072072072073e-06, "loss": 0.5135, "mean_token_accuracy": 0.9458914548158646, "step": 4825, "train/kl_loss_qwen": 0.04003286343067884, "train/kl_loss_r1": 0.025449228845536707, "train/total_kl": 0.06548209218308329 }, { "epoch": 3.6237568024019517, "grad_norm": 1.9296875, "learning_rate": 2.804054054054054e-06, "loss": 0.5003, "mean_token_accuracy": 0.9475751221179962, "step": 4830, "train/kl_loss_qwen": 0.03712998940609395, "train/kl_loss_r1": 0.02288465332239866, "train/total_kl": 0.060014642868191005 }, { "epoch": 3.6275098517545503, "grad_norm": 1.4453125, "learning_rate": 2.775900900900901e-06, "loss": 0.4804, "mean_token_accuracy": 0.9547668904066086, "step": 4835, "train/kl_loss_qwen": 0.03851720592938364, "train/kl_loss_r1": 0.02409008927643299, "train/total_kl": 0.06260729506611824 }, { "epoch": 3.6312629011071493, "grad_norm": 1.765625, "learning_rate": 2.747747747747748e-06, "loss": 0.531, "mean_token_accuracy": 0.9479747354984284, "step": 4840, "train/kl_loss_qwen": 0.04336943430826068, "train/kl_loss_r1": 0.025416742218658327, "train/total_kl": 0.06878617675974966 }, { "epoch": 3.6350159504597483, "grad_norm": 1.953125, "learning_rate": 2.719594594594595e-06, "loss": 0.5183, "mean_token_accuracy": 0.9536388278007507, "step": 4845, "train/kl_loss_qwen": 0.044287759624421594, "train/kl_loss_r1": 0.02697393586859107, "train/total_kl": 0.07126169558614492 }, { "epoch": 3.6387689998123474, "grad_norm": 1.75, "learning_rate": 2.6914414414414414e-06, "loss": 0.5166, "mean_token_accuracy": 0.9522114217281341, "step": 4850, "train/kl_loss_qwen": 0.04483889057300985, "train/kl_loss_r1": 0.02480946579016745, "train/total_kl": 0.06964835664257407 }, { "epoch": 3.6425220491649464, "grad_norm": 1.7734375, "learning_rate": 2.6632882882882884e-06, "loss": 0.459, "mean_token_accuracy": 0.946859622001648, "step": 4855, "train/kl_loss_qwen": 0.02793180327862501, "train/kl_loss_r1": 0.019528497755527497, "train/total_kl": 0.04746030112728476 }, { "epoch": 3.6462750985175454, "grad_norm": 2.546875, "learning_rate": 2.6351351351351353e-06, "loss": 0.4589, "mean_token_accuracy": 0.9491229832172394, "step": 4860, "train/kl_loss_qwen": 0.03198705329559744, "train/kl_loss_r1": 0.019053183542564512, "train/total_kl": 0.051040236745029686 }, { "epoch": 3.6500281478701444, "grad_norm": 2.84375, "learning_rate": 2.606981981981982e-06, "loss": 0.4817, "mean_token_accuracy": 0.9530567765235901, "step": 4865, "train/kl_loss_qwen": 0.039363396866247055, "train/kl_loss_r1": 0.022094597294926643, "train/total_kl": 0.061457994021475316 }, { "epoch": 3.6537811972227434, "grad_norm": 3.671875, "learning_rate": 2.578828828828829e-06, "loss": 0.5107, "mean_token_accuracy": 0.9457842141389847, "step": 4870, "train/kl_loss_qwen": 0.035457003861665726, "train/kl_loss_r1": 0.022503510117530823, "train/total_kl": 0.057960514537990095 }, { "epoch": 3.6575342465753424, "grad_norm": 1.7890625, "learning_rate": 2.550675675675676e-06, "loss": 0.5303, "mean_token_accuracy": 0.9455351591110229, "step": 4875, "train/kl_loss_qwen": 0.04614274119958282, "train/kl_loss_r1": 0.024886056268587708, "train/total_kl": 0.07102879770100116 }, { "epoch": 3.6612872959279414, "grad_norm": 2.8125, "learning_rate": 2.522522522522523e-06, "loss": 0.4676, "mean_token_accuracy": 0.9499957472085953, "step": 4880, "train/kl_loss_qwen": 0.03133310084231198, "train/kl_loss_r1": 0.020856086723506452, "train/total_kl": 0.05218918789178133 }, { "epoch": 3.6650403452805405, "grad_norm": 2.640625, "learning_rate": 2.4943693693693694e-06, "loss": 0.4903, "mean_token_accuracy": 0.9457110196352005, "step": 4885, "train/kl_loss_qwen": 0.03605662221089005, "train/kl_loss_r1": 0.02250904431566596, "train/total_kl": 0.058565666899085045 }, { "epoch": 3.6687933946331395, "grad_norm": 2.78125, "learning_rate": 2.4662162162162163e-06, "loss": 0.4846, "mean_token_accuracy": 0.9485343366861343, "step": 4890, "train/kl_loss_qwen": 0.033767188480123875, "train/kl_loss_r1": 0.022552880039438606, "train/total_kl": 0.056320068147033456 }, { "epoch": 3.6725464439857385, "grad_norm": 1.9921875, "learning_rate": 2.438063063063063e-06, "loss": 0.4727, "mean_token_accuracy": 0.94805046916008, "step": 4895, "train/kl_loss_qwen": 0.030423608887940646, "train/kl_loss_r1": 0.020363574428483844, "train/total_kl": 0.05078718457370997 }, { "epoch": 3.6762994933383375, "grad_norm": 1.84375, "learning_rate": 2.4099099099099097e-06, "loss": 0.499, "mean_token_accuracy": 0.955724710226059, "step": 4900, "train/kl_loss_qwen": 0.043830083403736356, "train/kl_loss_r1": 0.02355689317919314, "train/total_kl": 0.06738697616383434 }, { "epoch": 3.6800525426909365, "grad_norm": 1.78125, "learning_rate": 2.3817567567567567e-06, "loss": 0.5121, "mean_token_accuracy": 0.9542524129152298, "step": 4905, "train/kl_loss_qwen": 0.041697377478703855, "train/kl_loss_r1": 0.025255709374323487, "train/total_kl": 0.06695308703929186 }, { "epoch": 3.6838055920435355, "grad_norm": 1.828125, "learning_rate": 2.3536036036036036e-06, "loss": 0.5202, "mean_token_accuracy": 0.9581304490566254, "step": 4910, "train/kl_loss_qwen": 0.04810468130744994, "train/kl_loss_r1": 0.028955771028995513, "train/total_kl": 0.07706045228987932 }, { "epoch": 3.6875586413961345, "grad_norm": 2.046875, "learning_rate": 2.3254504504504505e-06, "loss": 0.5639, "mean_token_accuracy": 0.9510135352611542, "step": 4915, "train/kl_loss_qwen": 0.04566266257315874, "train/kl_loss_r1": 0.0282847763504833, "train/total_kl": 0.07394743924960494 }, { "epoch": 3.6913116907487336, "grad_norm": 1.75, "learning_rate": 2.2972972972972974e-06, "loss": 0.4899, "mean_token_accuracy": 0.9510814368724823, "step": 4920, "train/kl_loss_qwen": 0.03731400719843805, "train/kl_loss_r1": 0.022761214664205907, "train/total_kl": 0.06007522279396653 }, { "epoch": 3.6950647401013326, "grad_norm": 2.59375, "learning_rate": 2.269144144144144e-06, "loss": 0.5005, "mean_token_accuracy": 0.9558656960725784, "step": 4925, "train/kl_loss_qwen": 0.04062461815774441, "train/kl_loss_r1": 0.02468117969110608, "train/total_kl": 0.0653057973831892 }, { "epoch": 3.6988177894539316, "grad_norm": 2.0625, "learning_rate": 2.240990990990991e-06, "loss": 0.5914, "mean_token_accuracy": 0.9519262284040451, "step": 4930, "train/kl_loss_qwen": 0.05449639055877924, "train/kl_loss_r1": 0.030845365300774575, "train/total_kl": 0.08534175446256995 }, { "epoch": 3.70257083880653, "grad_norm": 2.046875, "learning_rate": 2.2128378378378377e-06, "loss": 0.5489, "mean_token_accuracy": 0.9491182923316955, "step": 4935, "train/kl_loss_qwen": 0.04436412039212882, "train/kl_loss_r1": 0.02723758388310671, "train/total_kl": 0.07160170413553715 }, { "epoch": 3.706323888159129, "grad_norm": 1.7578125, "learning_rate": 2.1846846846846846e-06, "loss": 0.5261, "mean_token_accuracy": 0.9431472331285476, "step": 4940, "train/kl_loss_qwen": 0.04030956518836319, "train/kl_loss_r1": 0.02509582005441189, "train/total_kl": 0.0654053857550025 }, { "epoch": 3.710076937511728, "grad_norm": 2.625, "learning_rate": 2.1565315315315315e-06, "loss": 0.5934, "mean_token_accuracy": 0.9567312359809875, "step": 4945, "train/kl_loss_qwen": 0.05713588017970324, "train/kl_loss_r1": 0.03261457234621048, "train/total_kl": 0.08975045187398792 }, { "epoch": 3.713829986864327, "grad_norm": 2.203125, "learning_rate": 2.1283783783783785e-06, "loss": 0.5451, "mean_token_accuracy": 0.9484814405441284, "step": 4950, "train/kl_loss_qwen": 0.048199441749602556, "train/kl_loss_r1": 0.027163840597495437, "train/total_kl": 0.07536328211426735 }, { "epoch": 3.717583036216926, "grad_norm": 2.5625, "learning_rate": 2.1002252252252254e-06, "loss": 0.5935, "mean_token_accuracy": 0.955457329750061, "step": 4955, "train/kl_loss_qwen": 0.05824917796999216, "train/kl_loss_r1": 0.034108775574713944, "train/total_kl": 0.09235795447602868 }, { "epoch": 3.721336085569525, "grad_norm": 2.40625, "learning_rate": 2.072072072072072e-06, "loss": 0.4623, "mean_token_accuracy": 0.9505770593881607, "step": 4960, "train/kl_loss_qwen": 0.0321466120891273, "train/kl_loss_r1": 0.021026749815791845, "train/total_kl": 0.05317336162552237 }, { "epoch": 3.7250891349221242, "grad_norm": 2.296875, "learning_rate": 2.0439189189189188e-06, "loss": 0.5755, "mean_token_accuracy": 0.9496716737747193, "step": 4965, "train/kl_loss_qwen": 0.04926731456071139, "train/kl_loss_r1": 0.03159582577645779, "train/total_kl": 0.08086314136162401 }, { "epoch": 3.7288421842747232, "grad_norm": 1.7890625, "learning_rate": 2.0157657657657657e-06, "loss": 0.4742, "mean_token_accuracy": 0.9528581112623214, "step": 4970, "train/kl_loss_qwen": 0.035010923305526374, "train/kl_loss_r1": 0.02297942517325282, "train/total_kl": 0.05799034852534533 }, { "epoch": 3.7325952336273223, "grad_norm": 1.546875, "learning_rate": 1.9876126126126126e-06, "loss": 0.5497, "mean_token_accuracy": 0.9514399915933609, "step": 4975, "train/kl_loss_qwen": 0.045947178127244116, "train/kl_loss_r1": 0.0276748682372272, "train/total_kl": 0.07362204669043422 }, { "epoch": 3.7363482829799213, "grad_norm": 1.4375, "learning_rate": 1.9594594594594595e-06, "loss": 0.5189, "mean_token_accuracy": 0.9563332289457321, "step": 4980, "train/kl_loss_qwen": 0.0446835320442915, "train/kl_loss_r1": 0.027359084272757173, "train/total_kl": 0.07204261664301156 }, { "epoch": 3.7401013323325203, "grad_norm": 1.5859375, "learning_rate": 1.9313063063063064e-06, "loss": 0.4732, "mean_token_accuracy": 0.9515779405832291, "step": 4985, "train/kl_loss_qwen": 0.0353350019082427, "train/kl_loss_r1": 0.021265791589394213, "train/total_kl": 0.05660079354420304 }, { "epoch": 3.7438543816851193, "grad_norm": 1.7265625, "learning_rate": 1.9031531531531531e-06, "loss": 0.5357, "mean_token_accuracy": 0.9530490398406982, "step": 4990, "train/kl_loss_qwen": 0.047580851893872025, "train/kl_loss_r1": 0.02787015661597252, "train/total_kl": 0.07545100878924131 }, { "epoch": 3.747607431037718, "grad_norm": 1.5703125, "learning_rate": 1.875e-06, "loss": 0.5061, "mean_token_accuracy": 0.9487150400876999, "step": 4995, "train/kl_loss_qwen": 0.03738487912341952, "train/kl_loss_r1": 0.02395879211835563, "train/total_kl": 0.061343671102076766 }, { "epoch": 3.751360480390317, "grad_norm": 2.921875, "learning_rate": 1.846846846846847e-06, "loss": 0.5004, "mean_token_accuracy": 0.9516070336103439, "step": 5000, "train/kl_loss_qwen": 0.039164299005642535, "train/kl_loss_r1": 0.024061837745830417, "train/total_kl": 0.06322613721713424 }, { "epoch": 3.755113529742916, "grad_norm": 1.65625, "learning_rate": 1.8186936936936937e-06, "loss": 0.5749, "mean_token_accuracy": 0.9515040576457977, "step": 5005, "train/kl_loss_qwen": 0.052400945825502275, "train/kl_loss_r1": 0.028596563590690495, "train/total_kl": 0.08099750988185406 }, { "epoch": 3.758866579095515, "grad_norm": 2.984375, "learning_rate": 1.7905405405405406e-06, "loss": 0.444, "mean_token_accuracy": 0.9563502013683319, "step": 5010, "train/kl_loss_qwen": 0.030290895281359552, "train/kl_loss_r1": 0.019006578624248503, "train/total_kl": 0.04929747423157096 }, { "epoch": 3.762619628448114, "grad_norm": 1.6796875, "learning_rate": 1.7623873873873875e-06, "loss": 0.5397, "mean_token_accuracy": 0.9545387536287308, "step": 5015, "train/kl_loss_qwen": 0.04934395225718617, "train/kl_loss_r1": 0.02698051822371781, "train/total_kl": 0.07632447089999914 }, { "epoch": 3.766372677800713, "grad_norm": 1.4921875, "learning_rate": 1.7342342342342344e-06, "loss": 0.506, "mean_token_accuracy": 0.9478281736373901, "step": 5020, "train/kl_loss_qwen": 0.036864762753248216, "train/kl_loss_r1": 0.023657037084922193, "train/total_kl": 0.060521799977868794 }, { "epoch": 3.770125727153312, "grad_norm": 1.953125, "learning_rate": 1.7060810810810811e-06, "loss": 0.4943, "mean_token_accuracy": 0.9443540513515473, "step": 5025, "train/kl_loss_qwen": 0.03439016304910183, "train/kl_loss_r1": 0.02218628195114434, "train/total_kl": 0.05657644523307681 }, { "epoch": 3.773878776505911, "grad_norm": 2.0625, "learning_rate": 1.677927927927928e-06, "loss": 0.506, "mean_token_accuracy": 0.9510277390480042, "step": 5030, "train/kl_loss_qwen": 0.04075477225705981, "train/kl_loss_r1": 0.025303835375234486, "train/total_kl": 0.06605860805138945 }, { "epoch": 3.77763182585851, "grad_norm": 1.5546875, "learning_rate": 1.649774774774775e-06, "loss": 0.5323, "mean_token_accuracy": 0.9535300970077515, "step": 5035, "train/kl_loss_qwen": 0.045921135554090144, "train/kl_loss_r1": 0.026559272641316058, "train/total_kl": 0.07248040847480297 }, { "epoch": 3.781384875211109, "grad_norm": 1.7734375, "learning_rate": 1.6216216216216219e-06, "loss": 0.5453, "mean_token_accuracy": 0.9485278338193893, "step": 5040, "train/kl_loss_qwen": 0.04068466508761048, "train/kl_loss_r1": 0.024883358972147107, "train/total_kl": 0.06556802354753018 }, { "epoch": 3.785137924563708, "grad_norm": 1.5859375, "learning_rate": 1.5934684684684686e-06, "loss": 0.4897, "mean_token_accuracy": 0.945227426290512, "step": 5045, "train/kl_loss_qwen": 0.03364719781093299, "train/kl_loss_r1": 0.02213437985628843, "train/total_kl": 0.055781577713787556 }, { "epoch": 3.788890973916307, "grad_norm": 2.125, "learning_rate": 1.5653153153153153e-06, "loss": 0.4788, "mean_token_accuracy": 0.9548559993505478, "step": 5050, "train/kl_loss_qwen": 0.03653868711553514, "train/kl_loss_r1": 0.0236417087726295, "train/total_kl": 0.06018039602786303 }, { "epoch": 3.792644023268906, "grad_norm": 2.03125, "learning_rate": 1.5371621621621622e-06, "loss": 0.5636, "mean_token_accuracy": 0.9515438884496689, "step": 5055, "train/kl_loss_qwen": 0.047804121021181346, "train/kl_loss_r1": 0.029594582365825774, "train/total_kl": 0.07739870361983776 }, { "epoch": 3.796397072621505, "grad_norm": 1.6015625, "learning_rate": 1.5090090090090089e-06, "loss": 0.4593, "mean_token_accuracy": 0.9565709322690964, "step": 5060, "train/kl_loss_qwen": 0.036150804301723835, "train/kl_loss_r1": 0.022632238129153846, "train/total_kl": 0.05878304187208414 }, { "epoch": 3.800150121974104, "grad_norm": 1.5390625, "learning_rate": 1.4808558558558558e-06, "loss": 0.4542, "mean_token_accuracy": 0.9509487301111221, "step": 5065, "train/kl_loss_qwen": 0.030484898015856743, "train/kl_loss_r1": 0.01995536368340254, "train/total_kl": 0.050440261419862506 }, { "epoch": 3.803903171326703, "grad_norm": 2.21875, "learning_rate": 1.4527027027027027e-06, "loss": 0.5608, "mean_token_accuracy": 0.9536998093128204, "step": 5070, "train/kl_loss_qwen": 0.05034955218434334, "train/kl_loss_r1": 0.02807376431301236, "train/total_kl": 0.07842331659048796 }, { "epoch": 3.807656220679302, "grad_norm": 2.0625, "learning_rate": 1.4245495495495496e-06, "loss": 0.5599, "mean_token_accuracy": 0.9517528563737869, "step": 5075, "train/kl_loss_qwen": 0.04939096746966243, "train/kl_loss_r1": 0.028638430312275885, "train/total_kl": 0.07802939787507057 }, { "epoch": 3.811409270031901, "grad_norm": 2.5625, "learning_rate": 1.3963963963963963e-06, "loss": 0.5062, "mean_token_accuracy": 0.9554317742586136, "step": 5080, "train/kl_loss_qwen": 0.04219297617673874, "train/kl_loss_r1": 0.025768689857795835, "train/total_kl": 0.06796166570857168 }, { "epoch": 3.8151623193845, "grad_norm": 2.828125, "learning_rate": 1.3682432432432432e-06, "loss": 0.4974, "mean_token_accuracy": 0.9443808525800705, "step": 5085, "train/kl_loss_qwen": 0.03445208133198321, "train/kl_loss_r1": 0.021914923517033457, "train/total_kl": 0.056367005221545696 }, { "epoch": 3.818915368737099, "grad_norm": 1.78125, "learning_rate": 1.3400900900900901e-06, "loss": 0.5546, "mean_token_accuracy": 0.9497458070516587, "step": 5090, "train/kl_loss_qwen": 0.0485810327809304, "train/kl_loss_r1": 0.027917088754475117, "train/total_kl": 0.07649812195450068 }, { "epoch": 3.822668418089698, "grad_norm": 1.5390625, "learning_rate": 1.311936936936937e-06, "loss": 0.5886, "mean_token_accuracy": 0.9538557380437851, "step": 5095, "train/kl_loss_qwen": 0.05744519936852157, "train/kl_loss_r1": 0.030710907746106388, "train/total_kl": 0.08815610771998764 }, { "epoch": 3.8264214674422967, "grad_norm": 2.34375, "learning_rate": 1.2837837837837838e-06, "loss": 0.4847, "mean_token_accuracy": 0.9532930910587311, "step": 5100, "train/kl_loss_qwen": 0.03452372634783387, "train/kl_loss_r1": 0.02196382894180715, "train/total_kl": 0.05648755459114909 }, { "epoch": 3.8301745167948957, "grad_norm": 4.21875, "learning_rate": 1.2556306306306307e-06, "loss": 0.5332, "mean_token_accuracy": 0.9430410385131835, "step": 5105, "train/kl_loss_qwen": 0.040356996841728686, "train/kl_loss_r1": 0.023822441697120667, "train/total_kl": 0.06417943863198161 }, { "epoch": 3.8339275661474947, "grad_norm": 1.609375, "learning_rate": 1.2274774774774776e-06, "loss": 0.5038, "mean_token_accuracy": 0.9531925290822982, "step": 5110, "train/kl_loss_qwen": 0.04049249268136919, "train/kl_loss_r1": 0.025288863759487867, "train/total_kl": 0.0657813566736877 }, { "epoch": 3.8376806155000938, "grad_norm": 2.921875, "learning_rate": 1.1993243243243243e-06, "loss": 0.522, "mean_token_accuracy": 0.9434494227170944, "step": 5115, "train/kl_loss_qwen": 0.037803121656179425, "train/kl_loss_r1": 0.02446298780851066, "train/total_kl": 0.06226610923185945 }, { "epoch": 3.8414336648526928, "grad_norm": 2.3125, "learning_rate": 1.1711711711711712e-06, "loss": 0.4692, "mean_token_accuracy": 0.9514028370380402, "step": 5120, "train/kl_loss_qwen": 0.03402503570541739, "train/kl_loss_r1": 0.02239496917463839, "train/total_kl": 0.05642000511288643 }, { "epoch": 3.845186714205292, "grad_norm": 2.3125, "learning_rate": 1.1430180180180181e-06, "loss": 0.5309, "mean_token_accuracy": 0.9505946636199951, "step": 5125, "train/kl_loss_qwen": 0.045850425586104394, "train/kl_loss_r1": 0.026252701180055737, "train/total_kl": 0.07210312644019723 }, { "epoch": 3.848939763557891, "grad_norm": 2.203125, "learning_rate": 1.114864864864865e-06, "loss": 0.5566, "mean_token_accuracy": 0.9513975620269776, "step": 5130, "train/kl_loss_qwen": 0.04835722097195685, "train/kl_loss_r1": 0.028962965682148935, "train/total_kl": 0.07732018698006868 }, { "epoch": 3.85269281291049, "grad_norm": 1.609375, "learning_rate": 1.0867117117117117e-06, "loss": 0.5045, "mean_token_accuracy": 0.9520065993070602, "step": 5135, "train/kl_loss_qwen": 0.03904314516112208, "train/kl_loss_r1": 0.025849370704963803, "train/total_kl": 0.0648925157263875 }, { "epoch": 3.856445862263089, "grad_norm": 3.328125, "learning_rate": 1.0585585585585587e-06, "loss": 0.498, "mean_token_accuracy": 0.9538995712995529, "step": 5140, "train/kl_loss_qwen": 0.038834956288337705, "train/kl_loss_r1": 0.023740610433742405, "train/total_kl": 0.06257556639611721 }, { "epoch": 3.860198911615688, "grad_norm": 1.9609375, "learning_rate": 1.0304054054054056e-06, "loss": 0.4727, "mean_token_accuracy": 0.94283646941185, "step": 5145, "train/kl_loss_qwen": 0.027823445247486235, "train/kl_loss_r1": 0.01955572385340929, "train/total_kl": 0.04737916942685842 }, { "epoch": 3.863951960968287, "grad_norm": 1.9296875, "learning_rate": 1.0022522522522525e-06, "loss": 0.504, "mean_token_accuracy": 0.9552516132593155, "step": 5150, "train/kl_loss_qwen": 0.04192827101796866, "train/kl_loss_r1": 0.0254449718631804, "train/total_kl": 0.06737324222922325 }, { "epoch": 3.867705010320886, "grad_norm": 1.7578125, "learning_rate": 9.74099099099099e-07, "loss": 0.473, "mean_token_accuracy": 0.9536389499902725, "step": 5155, "train/kl_loss_qwen": 0.037043438851833345, "train/kl_loss_r1": 0.0236785258166492, "train/total_kl": 0.06072196466848254 }, { "epoch": 3.8714580596734844, "grad_norm": 1.7109375, "learning_rate": 9.459459459459459e-07, "loss": 0.5516, "mean_token_accuracy": 0.9482437491416931, "step": 5160, "train/kl_loss_qwen": 0.04674530010670423, "train/kl_loss_r1": 0.027758846478536724, "train/total_kl": 0.07450414700433612 }, { "epoch": 3.8752111090260835, "grad_norm": 1.765625, "learning_rate": 9.177927927927928e-07, "loss": 0.5144, "mean_token_accuracy": 0.9507743179798126, "step": 5165, "train/kl_loss_qwen": 0.03748309840448201, "train/kl_loss_r1": 0.02437306847423315, "train/total_kl": 0.061856167297810315 }, { "epoch": 3.8789641583786825, "grad_norm": 1.8046875, "learning_rate": 8.896396396396397e-07, "loss": 0.5204, "mean_token_accuracy": 0.9507594257593155, "step": 5170, "train/kl_loss_qwen": 0.043137048045173286, "train/kl_loss_r1": 0.025168476812541484, "train/total_kl": 0.06830552481114864 }, { "epoch": 3.8827172077312815, "grad_norm": 1.796875, "learning_rate": 8.614864864864865e-07, "loss": 0.5293, "mean_token_accuracy": 0.9467691868543625, "step": 5175, "train/kl_loss_qwen": 0.040857316879555586, "train/kl_loss_r1": 0.02520199529826641, "train/total_kl": 0.06605931203812361 }, { "epoch": 3.8864702570838805, "grad_norm": 2.03125, "learning_rate": 8.333333333333333e-07, "loss": 0.512, "mean_token_accuracy": 0.954476135969162, "step": 5180, "train/kl_loss_qwen": 0.04564613183028996, "train/kl_loss_r1": 0.025337532442063094, "train/total_kl": 0.07098366366699338 }, { "epoch": 3.8902233064364795, "grad_norm": 1.8046875, "learning_rate": 8.051801801801801e-07, "loss": 0.5171, "mean_token_accuracy": 0.9508705079555512, "step": 5185, "train/kl_loss_qwen": 0.04170615980401635, "train/kl_loss_r1": 0.025099441641941667, "train/total_kl": 0.06680560121312737 }, { "epoch": 3.8939763557890785, "grad_norm": 1.6640625, "learning_rate": 7.770270270270271e-07, "loss": 0.4909, "mean_token_accuracy": 0.9476747989654541, "step": 5190, "train/kl_loss_qwen": 0.03633582382462919, "train/kl_loss_r1": 0.02298521767370403, "train/total_kl": 0.05932104177772999 }, { "epoch": 3.8977294051416775, "grad_norm": 1.8046875, "learning_rate": 7.488738738738739e-07, "loss": 0.5217, "mean_token_accuracy": 0.9495671540498734, "step": 5195, "train/kl_loss_qwen": 0.04427734538912773, "train/kl_loss_r1": 0.02526472685858607, "train/total_kl": 0.06954207243397832 }, { "epoch": 3.9014824544942766, "grad_norm": 1.5625, "learning_rate": 7.207207207207208e-07, "loss": 0.4923, "mean_token_accuracy": 0.9494727224111557, "step": 5200, "train/kl_loss_qwen": 0.03875735821202397, "train/kl_loss_r1": 0.023817204358056187, "train/total_kl": 0.06257456252351404 }, { "epoch": 3.9052355038468756, "grad_norm": 2.484375, "learning_rate": 6.925675675675676e-07, "loss": 0.4814, "mean_token_accuracy": 0.9498078048229217, "step": 5205, "train/kl_loss_qwen": 0.03472012551501393, "train/kl_loss_r1": 0.022663915436714886, "train/total_kl": 0.05738404057919979 }, { "epoch": 3.9089885531994746, "grad_norm": 2.25, "learning_rate": 6.644144144144144e-07, "loss": 0.5007, "mean_token_accuracy": 0.9551177322864532, "step": 5210, "train/kl_loss_qwen": 0.04156562443822622, "train/kl_loss_r1": 0.025957941822707654, "train/total_kl": 0.06752356672659517 }, { "epoch": 3.9127416025520736, "grad_norm": 1.671875, "learning_rate": 6.362612612612613e-07, "loss": 0.5694, "mean_token_accuracy": 0.9571527123451233, "step": 5215, "train/kl_loss_qwen": 0.052221673587337133, "train/kl_loss_r1": 0.031050076289102436, "train/total_kl": 0.08327174894511699 }, { "epoch": 3.9164946519046726, "grad_norm": 1.6796875, "learning_rate": 6.081081081081081e-07, "loss": 0.4867, "mean_token_accuracy": 0.9479338258504868, "step": 5220, "train/kl_loss_qwen": 0.037482742918655276, "train/kl_loss_r1": 0.022623464511707426, "train/total_kl": 0.060106207709759475 }, { "epoch": 3.9202477012572716, "grad_norm": 2.9375, "learning_rate": 5.79954954954955e-07, "loss": 0.5315, "mean_token_accuracy": 0.95349780023098, "step": 5225, "train/kl_loss_qwen": 0.041179875005036594, "train/kl_loss_r1": 0.024548267433419823, "train/total_kl": 0.06572814229875804 }, { "epoch": 3.9240007506098706, "grad_norm": 1.7890625, "learning_rate": 5.518018018018017e-07, "loss": 0.494, "mean_token_accuracy": 0.9552882075309753, "step": 5230, "train/kl_loss_qwen": 0.0404520948883146, "train/kl_loss_r1": 0.024678921373561025, "train/total_kl": 0.06513101598247886 }, { "epoch": 3.9277537999624696, "grad_norm": 2.296875, "learning_rate": 5.236486486486486e-07, "loss": 0.4897, "mean_token_accuracy": 0.9574841767549515, "step": 5235, "train/kl_loss_qwen": 0.04159375471062958, "train/kl_loss_r1": 0.025406858837231993, "train/total_kl": 0.06700061419978738 }, { "epoch": 3.9315068493150687, "grad_norm": 2.546875, "learning_rate": 4.954954954954955e-07, "loss": 0.5705, "mean_token_accuracy": 0.9512778520584106, "step": 5240, "train/kl_loss_qwen": 0.04816130660474301, "train/kl_loss_r1": 0.02963559590280056, "train/total_kl": 0.0777969030663371 }, { "epoch": 3.9352598986676677, "grad_norm": 1.6015625, "learning_rate": 4.673423423423423e-07, "loss": 0.4914, "mean_token_accuracy": 0.9590355962514877, "step": 5245, "train/kl_loss_qwen": 0.03864445784129202, "train/kl_loss_r1": 0.024916677735745907, "train/total_kl": 0.06356113543733954 }, { "epoch": 3.9390129480202667, "grad_norm": 1.7734375, "learning_rate": 4.391891891891892e-07, "loss": 0.5212, "mean_token_accuracy": 0.9514751166105271, "step": 5250, "train/kl_loss_qwen": 0.041747315181419255, "train/kl_loss_r1": 0.025338015891611575, "train/total_kl": 0.06708533093333244 }, { "epoch": 3.9427659973728657, "grad_norm": 2.0625, "learning_rate": 4.1103603603603604e-07, "loss": 0.4691, "mean_token_accuracy": 0.9524274647235871, "step": 5255, "train/kl_loss_qwen": 0.03220422621816397, "train/kl_loss_r1": 0.021751163946464657, "train/total_kl": 0.05395539067685604 }, { "epoch": 3.9465190467254643, "grad_norm": 2.0625, "learning_rate": 3.828828828828829e-07, "loss": 0.4931, "mean_token_accuracy": 0.9523744881153107, "step": 5260, "train/kl_loss_qwen": 0.040453130332753065, "train/kl_loss_r1": 0.022134747868403793, "train/total_kl": 0.06258787931874395 }, { "epoch": 3.9502720960780633, "grad_norm": 1.5546875, "learning_rate": 3.5472972972972976e-07, "loss": 0.5695, "mean_token_accuracy": 0.9486282020807266, "step": 5265, "train/kl_loss_qwen": 0.04893369772471488, "train/kl_loss_r1": 0.028443768760189413, "train/total_kl": 0.07737746657803654 }, { "epoch": 3.9540251454306623, "grad_norm": 2.34375, "learning_rate": 3.2657657657657657e-07, "loss": 0.506, "mean_token_accuracy": 0.9494929820299148, "step": 5270, "train/kl_loss_qwen": 0.039843138726428154, "train/kl_loss_r1": 0.02399267992004752, "train/total_kl": 0.06383581822738052 }, { "epoch": 3.9577781947832613, "grad_norm": 1.6328125, "learning_rate": 2.9842342342342343e-07, "loss": 0.4744, "mean_token_accuracy": 0.9528090953826904, "step": 5275, "train/kl_loss_qwen": 0.03620699774473905, "train/kl_loss_r1": 0.02199371703900397, "train/total_kl": 0.058200715016573666 }, { "epoch": 3.9615312441358603, "grad_norm": 1.828125, "learning_rate": 2.702702702702703e-07, "loss": 0.5002, "mean_token_accuracy": 0.9486662954092026, "step": 5280, "train/kl_loss_qwen": 0.03773316466249525, "train/kl_loss_r1": 0.02234139838255942, "train/total_kl": 0.060074562951922414 }, { "epoch": 3.9652842934884593, "grad_norm": 2.0625, "learning_rate": 2.4211711711711715e-07, "loss": 0.5184, "mean_token_accuracy": 0.9583245426416397, "step": 5285, "train/kl_loss_qwen": 0.04658535942435264, "train/kl_loss_r1": 0.02469016583636403, "train/total_kl": 0.07127552451565862 }, { "epoch": 3.9690373428410584, "grad_norm": 1.53125, "learning_rate": 2.1396396396396396e-07, "loss": 0.4914, "mean_token_accuracy": 0.9506331980228424, "step": 5290, "train/kl_loss_qwen": 0.034936840366572144, "train/kl_loss_r1": 0.021668214024975894, "train/total_kl": 0.05660505462437868 }, { "epoch": 3.9727903921936574, "grad_norm": 1.734375, "learning_rate": 1.8581081081081082e-07, "loss": 0.5043, "mean_token_accuracy": 0.9526822239160537, "step": 5295, "train/kl_loss_qwen": 0.04128625453449786, "train/kl_loss_r1": 0.02440170394256711, "train/total_kl": 0.06568795843049884 }, { "epoch": 3.9765434415462564, "grad_norm": 2.125, "learning_rate": 1.5765765765765768e-07, "loss": 0.4875, "mean_token_accuracy": 0.9513192981481552, "step": 5300, "train/kl_loss_qwen": 0.03742529796436429, "train/kl_loss_r1": 0.022662578942254187, "train/total_kl": 0.06008787713944912 }, { "epoch": 3.9802964908988554, "grad_norm": 1.7421875, "learning_rate": 1.295045045045045e-07, "loss": 0.504, "mean_token_accuracy": 0.9543662935495376, "step": 5305, "train/kl_loss_qwen": 0.043019989412277936, "train/kl_loss_r1": 0.023822894692420958, "train/total_kl": 0.06684288457036018 }, { "epoch": 3.9840495402514544, "grad_norm": 1.734375, "learning_rate": 1.0135135135135137e-07, "loss": 0.4643, "mean_token_accuracy": 0.9470363169908523, "step": 5310, "train/kl_loss_qwen": 0.03113719546236098, "train/kl_loss_r1": 0.019862218666821717, "train/total_kl": 0.05099941315129399 }, { "epoch": 3.9878025896040534, "grad_norm": 2.078125, "learning_rate": 7.31981981981982e-08, "loss": 0.5025, "mean_token_accuracy": 0.9551354616880416, "step": 5315, "train/kl_loss_qwen": 0.041465169610455634, "train/kl_loss_r1": 0.025189779000356793, "train/total_kl": 0.06665494851768017 }, { "epoch": 3.9915556389566524, "grad_norm": 2.328125, "learning_rate": 4.504504504504505e-08, "loss": 0.4905, "mean_token_accuracy": 0.9456799060106278, "step": 5320, "train/kl_loss_qwen": 0.035016221832484005, "train/kl_loss_r1": 0.022114977519959212, "train/total_kl": 0.05713119944557547 }, { "epoch": 3.995308688309251, "grad_norm": 1.859375, "learning_rate": 1.6891891891891893e-08, "loss": 0.4987, "mean_token_accuracy": 0.9567227691411972, "step": 5325, "train/kl_loss_qwen": 0.039210280030965806, "train/kl_loss_r1": 0.02504223152063787, "train/total_kl": 0.06425251075997948 } ], "logging_steps": 5, "max_steps": 5328, "num_input_tokens_seen": 0, "num_train_epochs": 4, "save_steps": 500, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": true }, "attributes": {} } }, "total_flos": 1.577455631807742e+18, "train_batch_size": 2, "trial_name": null, "trial_params": null }