| { |
| "best_metric": null, |
| "best_model_checkpoint": null, |
| "epoch": 3.9975605179208107, |
| "eval_steps": 500, |
| "global_step": 5328, |
| "is_hyper_param_search": false, |
| "is_local_process_zero": true, |
| "is_world_process_zero": true, |
| "log_history": [ |
| { |
| "epoch": 0.0037530493525989865, |
| "grad_norm": 8.25, |
| "learning_rate": 2.9971846846846846e-05, |
| "loss": 1.5176, |
| "mean_token_accuracy": 0.769223016500473, |
| "step": 5, |
| "train/kl_loss_qwen": 0.08752547902986407, |
| "train/kl_loss_r1": 0.06338356978787943, |
| "train/total_kl": 0.1509090474806726 |
| }, |
| { |
| "epoch": 0.007506098705197973, |
| "grad_norm": 4.28125, |
| "learning_rate": 2.9943693693693695e-05, |
| "loss": 1.1039, |
| "mean_token_accuracy": 0.8164006888866424, |
| "step": 10, |
| "train/kl_loss_qwen": 0.047363690473139285, |
| "train/kl_loss_r1": 0.030132385808974503, |
| "train/total_kl": 0.0774960758164525 |
| }, |
| { |
| "epoch": 0.01125914805779696, |
| "grad_norm": 5.65625, |
| "learning_rate": 2.991554054054054e-05, |
| "loss": 1.2405, |
| "mean_token_accuracy": 0.8136043608188629, |
| "step": 15, |
| "train/kl_loss_qwen": 0.07904849713668227, |
| "train/kl_loss_r1": 0.061669887881726025, |
| "train/total_kl": 0.14071838529780506 |
| }, |
| { |
| "epoch": 0.015012197410395946, |
| "grad_norm": 3.75, |
| "learning_rate": 2.9887387387387387e-05, |
| "loss": 1.0465, |
| "mean_token_accuracy": 0.8160444319248199, |
| "step": 20, |
| "train/kl_loss_qwen": 0.050111161265522244, |
| "train/kl_loss_r1": 0.02416137345135212, |
| "train/total_kl": 0.07427253378555179 |
| }, |
| { |
| "epoch": 0.018765246762994934, |
| "grad_norm": 5.25, |
| "learning_rate": 2.9859234234234236e-05, |
| "loss": 0.9846, |
| "mean_token_accuracy": 0.8187097162008286, |
| "step": 25, |
| "train/kl_loss_qwen": 0.05244297441095114, |
| "train/kl_loss_r1": 0.026212173467501997, |
| "train/total_kl": 0.07865514857694507 |
| }, |
| { |
| "epoch": 0.02251829611559392, |
| "grad_norm": 4.5, |
| "learning_rate": 2.983108108108108e-05, |
| "loss": 0.9745, |
| "mean_token_accuracy": 0.820404228568077, |
| "step": 30, |
| "train/kl_loss_qwen": 0.04298435244709253, |
| "train/kl_loss_r1": 0.019624315295368434, |
| "train/total_kl": 0.06260866802185774 |
| }, |
| { |
| "epoch": 0.026271345468192906, |
| "grad_norm": 4.4375, |
| "learning_rate": 2.980292792792793e-05, |
| "loss": 0.9507, |
| "mean_token_accuracy": 0.8279938399791718, |
| "step": 35, |
| "train/kl_loss_qwen": 0.05955953812226653, |
| "train/kl_loss_r1": 0.024175814585760236, |
| "train/total_kl": 0.08373535200953483 |
| }, |
| { |
| "epoch": 0.030024394820791892, |
| "grad_norm": 8.3125, |
| "learning_rate": 2.9774774774774776e-05, |
| "loss": 0.938, |
| "mean_token_accuracy": 0.8134139478206635, |
| "step": 40, |
| "train/kl_loss_qwen": 0.044126112619414924, |
| "train/kl_loss_r1": 0.025413188384845853, |
| "train/total_kl": 0.06953930081799627 |
| }, |
| { |
| "epoch": 0.03377744417339088, |
| "grad_norm": 4.0625, |
| "learning_rate": 2.9746621621621622e-05, |
| "loss": 0.9463, |
| "mean_token_accuracy": 0.8168299198150635, |
| "step": 45, |
| "train/kl_loss_qwen": 0.03402696019038558, |
| "train/kl_loss_r1": 0.021722227288410067, |
| "train/total_kl": 0.055749187525361774 |
| }, |
| { |
| "epoch": 0.03753049352598987, |
| "grad_norm": 3.75, |
| "learning_rate": 2.971846846846847e-05, |
| "loss": 0.9246, |
| "mean_token_accuracy": 0.8254363358020782, |
| "step": 50, |
| "train/kl_loss_qwen": 0.04775930540636182, |
| "train/kl_loss_r1": 0.022044902294874193, |
| "train/total_kl": 0.0698042068630457 |
| }, |
| { |
| "epoch": 0.041283542878588854, |
| "grad_norm": 6.8125, |
| "learning_rate": 2.9690315315315316e-05, |
| "loss": 0.925, |
| "mean_token_accuracy": 0.8240109533071518, |
| "step": 55, |
| "train/kl_loss_qwen": 0.043926798785105345, |
| "train/kl_loss_r1": 0.02575247841887176, |
| "train/total_kl": 0.06967927720397711 |
| }, |
| { |
| "epoch": 0.04503659223118784, |
| "grad_norm": 3.640625, |
| "learning_rate": 2.9662162162162162e-05, |
| "loss": 0.905, |
| "mean_token_accuracy": 0.8216860949993133, |
| "step": 60, |
| "train/kl_loss_qwen": 0.04389990693889558, |
| "train/kl_loss_r1": 0.018909475579857827, |
| "train/total_kl": 0.06280938191339373 |
| }, |
| { |
| "epoch": 0.048789641583786826, |
| "grad_norm": 3.296875, |
| "learning_rate": 2.963400900900901e-05, |
| "loss": 0.863, |
| "mean_token_accuracy": 0.8277184933423996, |
| "step": 65, |
| "train/kl_loss_qwen": 0.03611544775776565, |
| "train/kl_loss_r1": 0.01730741309002042, |
| "train/total_kl": 0.053422861360013486 |
| }, |
| { |
| "epoch": 0.05254269093638581, |
| "grad_norm": 4.28125, |
| "learning_rate": 2.9605855855855857e-05, |
| "loss": 0.9046, |
| "mean_token_accuracy": 0.8278381377458572, |
| "step": 70, |
| "train/kl_loss_qwen": 0.046157079841941596, |
| "train/kl_loss_r1": 0.022548422031104565, |
| "train/total_kl": 0.06870550150051713 |
| }, |
| { |
| "epoch": 0.0562957402889848, |
| "grad_norm": 3.234375, |
| "learning_rate": 2.9577702702702702e-05, |
| "loss": 0.9027, |
| "mean_token_accuracy": 0.8260001480579376, |
| "step": 75, |
| "train/kl_loss_qwen": 0.04451500792056322, |
| "train/kl_loss_r1": 0.02041986952535808, |
| "train/total_kl": 0.06493487702682614 |
| }, |
| { |
| "epoch": 0.060048789641583784, |
| "grad_norm": 2.921875, |
| "learning_rate": 2.954954954954955e-05, |
| "loss": 0.8643, |
| "mean_token_accuracy": 0.8250504255294799, |
| "step": 80, |
| "train/kl_loss_qwen": 0.03131786421872675, |
| "train/kl_loss_r1": 0.01814232598990202, |
| "train/total_kl": 0.04946019034832716 |
| }, |
| { |
| "epoch": 0.06380183899418278, |
| "grad_norm": 3.3125, |
| "learning_rate": 2.9521396396396397e-05, |
| "loss": 0.8967, |
| "mean_token_accuracy": 0.8288980603218079, |
| "step": 85, |
| "train/kl_loss_qwen": 0.03794705630280078, |
| "train/kl_loss_r1": 0.01904052966274321, |
| "train/total_kl": 0.05698758559301496 |
| }, |
| { |
| "epoch": 0.06755488834678176, |
| "grad_norm": 3.234375, |
| "learning_rate": 2.9493243243243243e-05, |
| "loss": 0.8967, |
| "mean_token_accuracy": 0.8236296445131301, |
| "step": 90, |
| "train/kl_loss_qwen": 0.034339522430673244, |
| "train/kl_loss_r1": 0.017526828777045013, |
| "train/total_kl": 0.05186635032296181 |
| }, |
| { |
| "epoch": 0.07130793769938075, |
| "grad_norm": 3.0625, |
| "learning_rate": 2.9465090090090092e-05, |
| "loss": 0.8868, |
| "mean_token_accuracy": 0.8290457785129547, |
| "step": 95, |
| "train/kl_loss_qwen": 0.04135038205422461, |
| "train/kl_loss_r1": 0.020615293877199292, |
| "train/total_kl": 0.06196567676961422 |
| }, |
| { |
| "epoch": 0.07506098705197974, |
| "grad_norm": 2.484375, |
| "learning_rate": 2.9436936936936937e-05, |
| "loss": 0.9278, |
| "mean_token_accuracy": 0.8270440757274627, |
| "step": 100, |
| "train/kl_loss_qwen": 0.04315362004563213, |
| "train/kl_loss_r1": 0.019161203969269992, |
| "train/total_kl": 0.06231482308357954 |
| }, |
| { |
| "epoch": 0.07881403640457872, |
| "grad_norm": 2.9375, |
| "learning_rate": 2.9408783783783786e-05, |
| "loss": 0.9493, |
| "mean_token_accuracy": 0.8260469496250152, |
| "step": 105, |
| "train/kl_loss_qwen": 0.05107316141948104, |
| "train/kl_loss_r1": 0.02429227330721915, |
| "train/total_kl": 0.07536543449386954 |
| }, |
| { |
| "epoch": 0.08256708575717771, |
| "grad_norm": 2.828125, |
| "learning_rate": 2.9380630630630632e-05, |
| "loss": 0.8664, |
| "mean_token_accuracy": 0.8338415503501893, |
| "step": 110, |
| "train/kl_loss_qwen": 0.033846771158277986, |
| "train/kl_loss_r1": 0.02006581616587937, |
| "train/total_kl": 0.053912587370723485 |
| }, |
| { |
| "epoch": 0.0863201351097767, |
| "grad_norm": 3.640625, |
| "learning_rate": 2.9352477477477478e-05, |
| "loss": 0.9389, |
| "mean_token_accuracy": 0.8269973963499069, |
| "step": 115, |
| "train/kl_loss_qwen": 0.0465784995816648, |
| "train/kl_loss_r1": 0.017597663728520275, |
| "train/total_kl": 0.06417616195976734 |
| }, |
| { |
| "epoch": 0.09007318446237568, |
| "grad_norm": 4.6875, |
| "learning_rate": 2.9324324324324327e-05, |
| "loss": 0.8609, |
| "mean_token_accuracy": 0.8387646734714508, |
| "step": 120, |
| "train/kl_loss_qwen": 0.045968831051141024, |
| "train/kl_loss_r1": 0.02227792115882039, |
| "train/total_kl": 0.06824675332754851 |
| }, |
| { |
| "epoch": 0.09382623381497467, |
| "grad_norm": 3.34375, |
| "learning_rate": 2.9296171171171172e-05, |
| "loss": 0.8136, |
| "mean_token_accuracy": 0.835837545990944, |
| "step": 125, |
| "train/kl_loss_qwen": 0.030515689635649323, |
| "train/kl_loss_r1": 0.01657968182116747, |
| "train/total_kl": 0.04709537066519261 |
| }, |
| { |
| "epoch": 0.09757928316757365, |
| "grad_norm": 3.59375, |
| "learning_rate": 2.9268018018018018e-05, |
| "loss": 0.9258, |
| "mean_token_accuracy": 0.8317561388015747, |
| "step": 130, |
| "train/kl_loss_qwen": 0.050186758302152155, |
| "train/kl_loss_r1": 0.02410706952214241, |
| "train/total_kl": 0.07429382782429457 |
| }, |
| { |
| "epoch": 0.10133233252017264, |
| "grad_norm": 3.234375, |
| "learning_rate": 2.9239864864864867e-05, |
| "loss": 0.9888, |
| "mean_token_accuracy": 0.821666619181633, |
| "step": 135, |
| "train/kl_loss_qwen": 0.0546362214256078, |
| "train/kl_loss_r1": 0.030097179347649217, |
| "train/total_kl": 0.0847334012389183 |
| }, |
| { |
| "epoch": 0.10508538187277162, |
| "grad_norm": 2.9375, |
| "learning_rate": 2.9211711711711713e-05, |
| "loss": 0.8415, |
| "mean_token_accuracy": 0.8354150176048278, |
| "step": 140, |
| "train/kl_loss_qwen": 0.03478895598091185, |
| "train/kl_loss_r1": 0.02067015548236668, |
| "train/total_kl": 0.05545911192893982 |
| }, |
| { |
| "epoch": 0.10883843122537061, |
| "grad_norm": 3.734375, |
| "learning_rate": 2.918355855855856e-05, |
| "loss": 0.8876, |
| "mean_token_accuracy": 0.8325099974870682, |
| "step": 145, |
| "train/kl_loss_qwen": 0.0391026409342885, |
| "train/kl_loss_r1": 0.026549011236056685, |
| "train/total_kl": 0.06565165296196937 |
| }, |
| { |
| "epoch": 0.1125914805779696, |
| "grad_norm": 2.84375, |
| "learning_rate": 2.9155405405405407e-05, |
| "loss": 0.9387, |
| "mean_token_accuracy": 0.8379026591777802, |
| "step": 150, |
| "train/kl_loss_qwen": 0.051510713435709475, |
| "train/kl_loss_r1": 0.03157240990549326, |
| "train/total_kl": 0.08308312483131886 |
| }, |
| { |
| "epoch": 0.11634452993056858, |
| "grad_norm": 5.09375, |
| "learning_rate": 2.9127252252252253e-05, |
| "loss": 0.9259, |
| "mean_token_accuracy": 0.826890054345131, |
| "step": 155, |
| "train/kl_loss_qwen": 0.04228275725618005, |
| "train/kl_loss_r1": 0.02729719616472721, |
| "train/total_kl": 0.06957995360717177 |
| }, |
| { |
| "epoch": 0.12009757928316757, |
| "grad_norm": 3.875, |
| "learning_rate": 2.90990990990991e-05, |
| "loss": 0.9461, |
| "mean_token_accuracy": 0.8288823276758194, |
| "step": 160, |
| "train/kl_loss_qwen": 0.04088701442815364, |
| "train/kl_loss_r1": 0.024661906762048602, |
| "train/total_kl": 0.06554892128333449 |
| }, |
| { |
| "epoch": 0.12385062863576655, |
| "grad_norm": 4.21875, |
| "learning_rate": 2.9070945945945948e-05, |
| "loss": 0.8884, |
| "mean_token_accuracy": 0.8316583424806595, |
| "step": 165, |
| "train/kl_loss_qwen": 0.04645280791446567, |
| "train/kl_loss_r1": 0.026368586625903846, |
| "train/total_kl": 0.07282139537855983 |
| }, |
| { |
| "epoch": 0.12760367798836555, |
| "grad_norm": 3.140625, |
| "learning_rate": 2.9042792792792793e-05, |
| "loss": 0.8559, |
| "mean_token_accuracy": 0.8401839256286621, |
| "step": 170, |
| "train/kl_loss_qwen": 0.03588448138907552, |
| "train/kl_loss_r1": 0.02225645985454321, |
| "train/total_kl": 0.058140940591692926 |
| }, |
| { |
| "epoch": 0.13135672734096454, |
| "grad_norm": 3.078125, |
| "learning_rate": 2.9014639639639642e-05, |
| "loss": 0.9353, |
| "mean_token_accuracy": 0.819926631450653, |
| "step": 175, |
| "train/kl_loss_qwen": 0.047735629277303814, |
| "train/kl_loss_r1": 0.022419746313244105, |
| "train/total_kl": 0.0701553763821721 |
| }, |
| { |
| "epoch": 0.13510977669356353, |
| "grad_norm": 3.109375, |
| "learning_rate": 2.8986486486486488e-05, |
| "loss": 0.8418, |
| "mean_token_accuracy": 0.8275587946176529, |
| "step": 180, |
| "train/kl_loss_qwen": 0.030953629314899443, |
| "train/kl_loss_r1": 0.016762713715434075, |
| "train/total_kl": 0.04771634349599481 |
| }, |
| { |
| "epoch": 0.1388628260461625, |
| "grad_norm": 2.84375, |
| "learning_rate": 2.8958333333333334e-05, |
| "loss": 0.8736, |
| "mean_token_accuracy": 0.8307415157556534, |
| "step": 185, |
| "train/kl_loss_qwen": 0.040645266277715565, |
| "train/kl_loss_r1": 0.01992678502574563, |
| "train/total_kl": 0.06057205153629184 |
| }, |
| { |
| "epoch": 0.1426158753987615, |
| "grad_norm": 3.015625, |
| "learning_rate": 2.8930180180180183e-05, |
| "loss": 0.8587, |
| "mean_token_accuracy": 0.8310975462198258, |
| "step": 190, |
| "train/kl_loss_qwen": 0.036960875568911436, |
| "train/kl_loss_r1": 0.019845803361386062, |
| "train/total_kl": 0.05680667934939265 |
| }, |
| { |
| "epoch": 0.14636892475136049, |
| "grad_norm": 2.734375, |
| "learning_rate": 2.8902027027027028e-05, |
| "loss": 0.8772, |
| "mean_token_accuracy": 0.8337432593107224, |
| "step": 195, |
| "train/kl_loss_qwen": 0.04270432349294424, |
| "train/kl_loss_r1": 0.02069783229380846, |
| "train/total_kl": 0.06340215532109142 |
| }, |
| { |
| "epoch": 0.15012197410395947, |
| "grad_norm": 2.59375, |
| "learning_rate": 2.8873873873873874e-05, |
| "loss": 0.8596, |
| "mean_token_accuracy": 0.83087178170681, |
| "step": 200, |
| "train/kl_loss_qwen": 0.042936635203659534, |
| "train/kl_loss_r1": 0.022718130564317107, |
| "train/total_kl": 0.06565476628020406 |
| }, |
| { |
| "epoch": 0.15387502345655846, |
| "grad_norm": 3.640625, |
| "learning_rate": 2.8845720720720723e-05, |
| "loss": 0.8908, |
| "mean_token_accuracy": 0.8138444811105728, |
| "step": 205, |
| "train/kl_loss_qwen": 0.030784124229103326, |
| "train/kl_loss_r1": 0.016901360964402555, |
| "train/total_kl": 0.0476854850538075 |
| }, |
| { |
| "epoch": 0.15762807280915744, |
| "grad_norm": 3.46875, |
| "learning_rate": 2.881756756756757e-05, |
| "loss": 0.869, |
| "mean_token_accuracy": 0.8308258265256881, |
| "step": 210, |
| "train/kl_loss_qwen": 0.03687661928124726, |
| "train/kl_loss_r1": 0.02106295870617032, |
| "train/total_kl": 0.05793957831338048 |
| }, |
| { |
| "epoch": 0.16138112216175643, |
| "grad_norm": 3.140625, |
| "learning_rate": 2.8789414414414414e-05, |
| "loss": 0.8614, |
| "mean_token_accuracy": 0.8309110760688782, |
| "step": 215, |
| "train/kl_loss_qwen": 0.025625232327729463, |
| "train/kl_loss_r1": 0.017062702728435398, |
| "train/total_kl": 0.0426879346370697 |
| }, |
| { |
| "epoch": 0.16513417151435542, |
| "grad_norm": 3.515625, |
| "learning_rate": 2.8761261261261263e-05, |
| "loss": 0.9389, |
| "mean_token_accuracy": 0.8283930003643036, |
| "step": 220, |
| "train/kl_loss_qwen": 0.04772484353743493, |
| "train/kl_loss_r1": 0.0242662335280329, |
| "train/total_kl": 0.071991076041013 |
| }, |
| { |
| "epoch": 0.1688872208669544, |
| "grad_norm": 3.390625, |
| "learning_rate": 2.873310810810811e-05, |
| "loss": 0.8665, |
| "mean_token_accuracy": 0.8319736927747726, |
| "step": 225, |
| "train/kl_loss_qwen": 0.04302333788946271, |
| "train/kl_loss_r1": 0.020506267715245486, |
| "train/total_kl": 0.06352960634976626 |
| }, |
| { |
| "epoch": 0.1726402702195534, |
| "grad_norm": 3.078125, |
| "learning_rate": 2.8704954954954955e-05, |
| "loss": 0.9634, |
| "mean_token_accuracy": 0.8157904803752899, |
| "step": 230, |
| "train/kl_loss_qwen": 0.03608332681469619, |
| "train/kl_loss_r1": 0.022636342188343407, |
| "train/total_kl": 0.058719669748097655 |
| }, |
| { |
| "epoch": 0.17639331957215237, |
| "grad_norm": 3.3125, |
| "learning_rate": 2.8676801801801804e-05, |
| "loss": 0.8786, |
| "mean_token_accuracy": 0.8320168018341064, |
| "step": 235, |
| "train/kl_loss_qwen": 0.03650941308587789, |
| "train/kl_loss_r1": 0.01942919297143817, |
| "train/total_kl": 0.05593860624358058 |
| }, |
| { |
| "epoch": 0.18014636892475136, |
| "grad_norm": 3.09375, |
| "learning_rate": 2.864864864864865e-05, |
| "loss": 0.8857, |
| "mean_token_accuracy": 0.8240372210741043, |
| "step": 240, |
| "train/kl_loss_qwen": 0.04121889984235168, |
| "train/kl_loss_r1": 0.023149896459653974, |
| "train/total_kl": 0.06436879634857177 |
| }, |
| { |
| "epoch": 0.18389941827735035, |
| "grad_norm": 3.34375, |
| "learning_rate": 2.8620495495495498e-05, |
| "loss": 0.8879, |
| "mean_token_accuracy": 0.8295320123434067, |
| "step": 245, |
| "train/kl_loss_qwen": 0.04043615320697427, |
| "train/kl_loss_r1": 0.020326331770047546, |
| "train/total_kl": 0.06076248474419117 |
| }, |
| { |
| "epoch": 0.18765246762994933, |
| "grad_norm": 3.34375, |
| "learning_rate": 2.8592342342342344e-05, |
| "loss": 0.8265, |
| "mean_token_accuracy": 0.8326751410961151, |
| "step": 250, |
| "train/kl_loss_qwen": 0.026516885636374353, |
| "train/kl_loss_r1": 0.01770362425595522, |
| "train/total_kl": 0.044220509752631185 |
| }, |
| { |
| "epoch": 0.19140551698254832, |
| "grad_norm": 3.421875, |
| "learning_rate": 2.856418918918919e-05, |
| "loss": 0.9341, |
| "mean_token_accuracy": 0.8237122267484664, |
| "step": 255, |
| "train/kl_loss_qwen": 0.048292512679472564, |
| "train/kl_loss_r1": 0.022946013091132044, |
| "train/total_kl": 0.07123852567747235 |
| }, |
| { |
| "epoch": 0.1951585663351473, |
| "grad_norm": 2.78125, |
| "learning_rate": 2.853603603603604e-05, |
| "loss": 0.857, |
| "mean_token_accuracy": 0.828681230545044, |
| "step": 260, |
| "train/kl_loss_qwen": 0.03695045164786279, |
| "train/kl_loss_r1": 0.0199518951587379, |
| "train/total_kl": 0.056902346294373275 |
| }, |
| { |
| "epoch": 0.1989116156877463, |
| "grad_norm": 3.28125, |
| "learning_rate": 2.8507882882882884e-05, |
| "loss": 0.9094, |
| "mean_token_accuracy": 0.8349234968423843, |
| "step": 265, |
| "train/kl_loss_qwen": 0.047521751886233685, |
| "train/kl_loss_r1": 0.02572522107511759, |
| "train/total_kl": 0.07324697300791741 |
| }, |
| { |
| "epoch": 0.20266466504034528, |
| "grad_norm": 3.265625, |
| "learning_rate": 2.847972972972973e-05, |
| "loss": 0.9172, |
| "mean_token_accuracy": 0.8182721942663193, |
| "step": 270, |
| "train/kl_loss_qwen": 0.04026843742467463, |
| "train/kl_loss_r1": 0.019451649440452457, |
| "train/total_kl": 0.059720087610185144 |
| }, |
| { |
| "epoch": 0.20641771439294426, |
| "grad_norm": 2.96875, |
| "learning_rate": 2.845157657657658e-05, |
| "loss": 0.8914, |
| "mean_token_accuracy": 0.8202652215957642, |
| "step": 275, |
| "train/kl_loss_qwen": 0.03867609850130975, |
| "train/kl_loss_r1": 0.025283710239455102, |
| "train/total_kl": 0.06395980911329388 |
| }, |
| { |
| "epoch": 0.21017076374554325, |
| "grad_norm": 2.796875, |
| "learning_rate": 2.8423423423423425e-05, |
| "loss": 0.8519, |
| "mean_token_accuracy": 0.8259457170963287, |
| "step": 280, |
| "train/kl_loss_qwen": 0.030157899064943195, |
| "train/kl_loss_r1": 0.0176977907307446, |
| "train/total_kl": 0.047855690307915213 |
| }, |
| { |
| "epoch": 0.21392381309814223, |
| "grad_norm": 2.96875, |
| "learning_rate": 2.839527027027027e-05, |
| "loss": 0.8837, |
| "mean_token_accuracy": 0.8319539725780487, |
| "step": 285, |
| "train/kl_loss_qwen": 0.0462970673572272, |
| "train/kl_loss_r1": 0.023949274653568865, |
| "train/total_kl": 0.07024634098634124 |
| }, |
| { |
| "epoch": 0.21767686245074122, |
| "grad_norm": 3.375, |
| "learning_rate": 2.836711711711712e-05, |
| "loss": 0.8822, |
| "mean_token_accuracy": 0.8238964200019836, |
| "step": 290, |
| "train/kl_loss_qwen": 0.03392238900996745, |
| "train/kl_loss_r1": 0.019832599721848965, |
| "train/total_kl": 0.05375498877838254 |
| }, |
| { |
| "epoch": 0.2214299118033402, |
| "grad_norm": 3.125, |
| "learning_rate": 2.8338963963963965e-05, |
| "loss": 0.9019, |
| "mean_token_accuracy": 0.8279110223054886, |
| "step": 295, |
| "train/kl_loss_qwen": 0.04686084697023034, |
| "train/kl_loss_r1": 0.021674037864431738, |
| "train/total_kl": 0.0685348848812282 |
| }, |
| { |
| "epoch": 0.2251829611559392, |
| "grad_norm": 2.75, |
| "learning_rate": 2.831081081081081e-05, |
| "loss": 0.829, |
| "mean_token_accuracy": 0.8228947937488555, |
| "step": 300, |
| "train/kl_loss_qwen": 0.03104133568704128, |
| "train/kl_loss_r1": 0.017868287535384296, |
| "train/total_kl": 0.048909622617065905 |
| }, |
| { |
| "epoch": 0.22893601050853818, |
| "grad_norm": 3.609375, |
| "learning_rate": 2.828265765765766e-05, |
| "loss": 0.8861, |
| "mean_token_accuracy": 0.830480980873108, |
| "step": 305, |
| "train/kl_loss_qwen": 0.04108666768297553, |
| "train/kl_loss_r1": 0.022314603487029672, |
| "train/total_kl": 0.06340127140283584 |
| }, |
| { |
| "epoch": 0.23268905986113717, |
| "grad_norm": 2.75, |
| "learning_rate": 2.8254504504504505e-05, |
| "loss": 0.8572, |
| "mean_token_accuracy": 0.8241907984018326, |
| "step": 310, |
| "train/kl_loss_qwen": 0.03199450373649597, |
| "train/kl_loss_r1": 0.017621683469042183, |
| "train/total_kl": 0.04961618706583977 |
| }, |
| { |
| "epoch": 0.23644210921373615, |
| "grad_norm": 3.515625, |
| "learning_rate": 2.8226351351351354e-05, |
| "loss": 0.8637, |
| "mean_token_accuracy": 0.8376813232898712, |
| "step": 315, |
| "train/kl_loss_qwen": 0.04330867072567344, |
| "train/kl_loss_r1": 0.02416534055955708, |
| "train/total_kl": 0.06747401058673859 |
| }, |
| { |
| "epoch": 0.24019515856633514, |
| "grad_norm": 4.0625, |
| "learning_rate": 2.81981981981982e-05, |
| "loss": 0.9112, |
| "mean_token_accuracy": 0.8234936207532882, |
| "step": 320, |
| "train/kl_loss_qwen": 0.048313079914078114, |
| "train/kl_loss_r1": 0.025073166657239198, |
| "train/total_kl": 0.07338624661788344 |
| }, |
| { |
| "epoch": 0.24394820791893412, |
| "grad_norm": 4.78125, |
| "learning_rate": 2.8170045045045046e-05, |
| "loss": 0.8907, |
| "mean_token_accuracy": 0.8210220754146575, |
| "step": 325, |
| "train/kl_loss_qwen": 0.03271963973529637, |
| "train/kl_loss_r1": 0.017756852181628348, |
| "train/total_kl": 0.05047649145126343 |
| }, |
| { |
| "epoch": 0.2477012572715331, |
| "grad_norm": 3.203125, |
| "learning_rate": 2.8141891891891895e-05, |
| "loss": 0.8258, |
| "mean_token_accuracy": 0.8319089412689209, |
| "step": 330, |
| "train/kl_loss_qwen": 0.03287083809264004, |
| "train/kl_loss_r1": 0.017795524606481195, |
| "train/total_kl": 0.05066636316478253 |
| }, |
| { |
| "epoch": 0.2514543066241321, |
| "grad_norm": 3.375, |
| "learning_rate": 2.811373873873874e-05, |
| "loss": 0.8629, |
| "mean_token_accuracy": 0.8283258348703384, |
| "step": 335, |
| "train/kl_loss_qwen": 0.032528719678521154, |
| "train/kl_loss_r1": 0.020534052094444633, |
| "train/total_kl": 0.05306277144700289 |
| }, |
| { |
| "epoch": 0.2552073559767311, |
| "grad_norm": 8.375, |
| "learning_rate": 2.8085585585585586e-05, |
| "loss": 0.9014, |
| "mean_token_accuracy": 0.8283331096172333, |
| "step": 340, |
| "train/kl_loss_qwen": 0.0436781873460859, |
| "train/kl_loss_r1": 0.021283475076779725, |
| "train/total_kl": 0.06496166167780756 |
| }, |
| { |
| "epoch": 0.25896040532933007, |
| "grad_norm": 3.25, |
| "learning_rate": 2.8057432432432435e-05, |
| "loss": 0.9772, |
| "mean_token_accuracy": 0.8316745519638061, |
| "step": 345, |
| "train/kl_loss_qwen": 0.06164747509174049, |
| "train/kl_loss_r1": 0.033189503895118835, |
| "train/total_kl": 0.0948369799181819 |
| }, |
| { |
| "epoch": 0.2627134546819291, |
| "grad_norm": 2.53125, |
| "learning_rate": 2.802927927927928e-05, |
| "loss": 0.9112, |
| "mean_token_accuracy": 0.8187721729278564, |
| "step": 350, |
| "train/kl_loss_qwen": 0.04342941730283201, |
| "train/kl_loss_r1": 0.021683502895757555, |
| "train/total_kl": 0.06511292122304439 |
| }, |
| { |
| "epoch": 0.26646650403452804, |
| "grad_norm": 4.8125, |
| "learning_rate": 2.8001126126126126e-05, |
| "loss": 0.8597, |
| "mean_token_accuracy": 0.823934805393219, |
| "step": 355, |
| "train/kl_loss_qwen": 0.03486774587072432, |
| "train/kl_loss_r1": 0.018483150517567992, |
| "train/total_kl": 0.0533508962020278 |
| }, |
| { |
| "epoch": 0.27021955338712705, |
| "grad_norm": 4.03125, |
| "learning_rate": 2.7972972972972975e-05, |
| "loss": 0.9002, |
| "mean_token_accuracy": 0.8210596233606339, |
| "step": 360, |
| "train/kl_loss_qwen": 0.038451321935281155, |
| "train/kl_loss_r1": 0.020488675870001315, |
| "train/total_kl": 0.05893999738618731 |
| }, |
| { |
| "epoch": 0.273972602739726, |
| "grad_norm": 3.609375, |
| "learning_rate": 2.794481981981982e-05, |
| "loss": 0.8471, |
| "mean_token_accuracy": 0.8312166184186935, |
| "step": 365, |
| "train/kl_loss_qwen": 0.029628670075908303, |
| "train/kl_loss_r1": 0.014924272242933512, |
| "train/total_kl": 0.04455294217914343 |
| }, |
| { |
| "epoch": 0.277725652092325, |
| "grad_norm": 2.84375, |
| "learning_rate": 2.7916666666666666e-05, |
| "loss": 0.8673, |
| "mean_token_accuracy": 0.8319344162940979, |
| "step": 370, |
| "train/kl_loss_qwen": 0.03991308896802366, |
| "train/kl_loss_r1": 0.0243389128241688, |
| "train/total_kl": 0.06425200179219245 |
| }, |
| { |
| "epoch": 0.281478701444924, |
| "grad_norm": 3.40625, |
| "learning_rate": 2.7888513513513516e-05, |
| "loss": 0.8304, |
| "mean_token_accuracy": 0.8395447045564651, |
| "step": 375, |
| "train/kl_loss_qwen": 0.03554642982780933, |
| "train/kl_loss_r1": 0.01824573487974703, |
| "train/total_kl": 0.053792164847254756 |
| }, |
| { |
| "epoch": 0.285231750797523, |
| "grad_norm": 2.796875, |
| "learning_rate": 2.786036036036036e-05, |
| "loss": 0.8545, |
| "mean_token_accuracy": 0.8338422924280167, |
| "step": 380, |
| "train/kl_loss_qwen": 0.03943650596775115, |
| "train/kl_loss_r1": 0.022580207185819746, |
| "train/total_kl": 0.062016712967306376 |
| }, |
| { |
| "epoch": 0.28898480015012196, |
| "grad_norm": 3.53125, |
| "learning_rate": 2.783220720720721e-05, |
| "loss": 0.8865, |
| "mean_token_accuracy": 0.8243386000394821, |
| "step": 385, |
| "train/kl_loss_qwen": 0.032612268114462495, |
| "train/kl_loss_r1": 0.019001774908974766, |
| "train/total_kl": 0.051614042930305006 |
| }, |
| { |
| "epoch": 0.29273784950272097, |
| "grad_norm": 2.875, |
| "learning_rate": 2.7804054054054056e-05, |
| "loss": 0.8481, |
| "mean_token_accuracy": 0.831609445810318, |
| "step": 390, |
| "train/kl_loss_qwen": 0.03640997484326362, |
| "train/kl_loss_r1": 0.02251947051845491, |
| "train/total_kl": 0.05892944540828467 |
| }, |
| { |
| "epoch": 0.29649089885531993, |
| "grad_norm": 3.796875, |
| "learning_rate": 2.77759009009009e-05, |
| "loss": 0.831, |
| "mean_token_accuracy": 0.8290323615074158, |
| "step": 395, |
| "train/kl_loss_qwen": 0.03999115023761988, |
| "train/kl_loss_r1": 0.018835989851504566, |
| "train/total_kl": 0.05882714046165347 |
| }, |
| { |
| "epoch": 0.30024394820791894, |
| "grad_norm": 3.5, |
| "learning_rate": 2.774774774774775e-05, |
| "loss": 0.8797, |
| "mean_token_accuracy": 0.8339627146720886, |
| "step": 400, |
| "train/kl_loss_qwen": 0.03993063434027135, |
| "train/kl_loss_r1": 0.021482796175405383, |
| "train/total_kl": 0.061413430236279966 |
| }, |
| { |
| "epoch": 0.3039969975605179, |
| "grad_norm": 3.28125, |
| "learning_rate": 2.7719594594594596e-05, |
| "loss": 0.8767, |
| "mean_token_accuracy": 0.8245404064655304, |
| "step": 405, |
| "train/kl_loss_qwen": 0.03429829515516758, |
| "train/kl_loss_r1": 0.018518435396254064, |
| "train/total_kl": 0.052816730458289385 |
| }, |
| { |
| "epoch": 0.3077500469131169, |
| "grad_norm": 2.890625, |
| "learning_rate": 2.7691441441441442e-05, |
| "loss": 0.8474, |
| "mean_token_accuracy": 0.8327318131923676, |
| "step": 410, |
| "train/kl_loss_qwen": 0.03831371474079788, |
| "train/kl_loss_r1": 0.02023513722233474, |
| "train/total_kl": 0.05854885214939713 |
| }, |
| { |
| "epoch": 0.3115030962657159, |
| "grad_norm": 3.09375, |
| "learning_rate": 2.766328828828829e-05, |
| "loss": 0.968, |
| "mean_token_accuracy": 0.8316255033016204, |
| "step": 415, |
| "train/kl_loss_qwen": 0.04635447044856846, |
| "train/kl_loss_r1": 0.03803784307092428, |
| "train/total_kl": 0.08439231272786855 |
| }, |
| { |
| "epoch": 0.3152561456183149, |
| "grad_norm": 2.78125, |
| "learning_rate": 2.7635135135135136e-05, |
| "loss": 0.8519, |
| "mean_token_accuracy": 0.8353470414876938, |
| "step": 420, |
| "train/kl_loss_qwen": 0.039563533896580336, |
| "train/kl_loss_r1": 0.020479060476645827, |
| "train/total_kl": 0.06004259428009391 |
| }, |
| { |
| "epoch": 0.31900919497091385, |
| "grad_norm": 2.78125, |
| "learning_rate": 2.7606981981981982e-05, |
| "loss": 0.8615, |
| "mean_token_accuracy": 0.8276613086462021, |
| "step": 425, |
| "train/kl_loss_qwen": 0.0393582281190902, |
| "train/kl_loss_r1": 0.019348848797380924, |
| "train/total_kl": 0.058707076404243705 |
| }, |
| { |
| "epoch": 0.32276224432351286, |
| "grad_norm": 3.03125, |
| "learning_rate": 2.757882882882883e-05, |
| "loss": 0.9294, |
| "mean_token_accuracy": 0.8186271667480469, |
| "step": 430, |
| "train/kl_loss_qwen": 0.050791586516425014, |
| "train/kl_loss_r1": 0.02292977077886462, |
| "train/total_kl": 0.07372135808691382 |
| }, |
| { |
| "epoch": 0.3265152936761118, |
| "grad_norm": 3.078125, |
| "learning_rate": 2.7550675675675677e-05, |
| "loss": 0.9728, |
| "mean_token_accuracy": 0.8224653273820877, |
| "step": 435, |
| "train/kl_loss_qwen": 0.04803532916121185, |
| "train/kl_loss_r1": 0.03875158065930009, |
| "train/total_kl": 0.08678690884262323 |
| }, |
| { |
| "epoch": 0.33026834302871083, |
| "grad_norm": 3.78125, |
| "learning_rate": 2.7522522522522522e-05, |
| "loss": 0.867, |
| "mean_token_accuracy": 0.826562350988388, |
| "step": 440, |
| "train/kl_loss_qwen": 0.0310151603538543, |
| "train/kl_loss_r1": 0.020512415934354065, |
| "train/total_kl": 0.051527577079832555 |
| }, |
| { |
| "epoch": 0.3340213923813098, |
| "grad_norm": 3.421875, |
| "learning_rate": 2.749436936936937e-05, |
| "loss": 0.8257, |
| "mean_token_accuracy": 0.8324155032634735, |
| "step": 445, |
| "train/kl_loss_qwen": 0.0258051089476794, |
| "train/kl_loss_r1": 0.015088145853951573, |
| "train/total_kl": 0.04089325405657292 |
| }, |
| { |
| "epoch": 0.3377744417339088, |
| "grad_norm": 2.921875, |
| "learning_rate": 2.7466216216216217e-05, |
| "loss": 0.8653, |
| "mean_token_accuracy": 0.8344490349292755, |
| "step": 450, |
| "train/kl_loss_qwen": 0.04345053578726947, |
| "train/kl_loss_r1": 0.024011770728975534, |
| "train/total_kl": 0.06746230693534017 |
| }, |
| { |
| "epoch": 0.34152749108650776, |
| "grad_norm": 3.3125, |
| "learning_rate": 2.7438063063063066e-05, |
| "loss": 0.8571, |
| "mean_token_accuracy": 0.8373376429080963, |
| "step": 455, |
| "train/kl_loss_qwen": 0.03988681212067604, |
| "train/kl_loss_r1": 0.022834346117451786, |
| "train/total_kl": 0.06272115856409073 |
| }, |
| { |
| "epoch": 0.3452805404391068, |
| "grad_norm": 2.5, |
| "learning_rate": 2.7409909909909912e-05, |
| "loss": 0.8637, |
| "mean_token_accuracy": 0.8259221136569976, |
| "step": 460, |
| "train/kl_loss_qwen": 0.03982735755853355, |
| "train/kl_loss_r1": 0.020564141124486922, |
| "train/total_kl": 0.060391498263925314 |
| }, |
| { |
| "epoch": 0.34903358979170573, |
| "grad_norm": 2.890625, |
| "learning_rate": 2.7381756756756757e-05, |
| "loss": 0.8959, |
| "mean_token_accuracy": 0.8191772252321243, |
| "step": 465, |
| "train/kl_loss_qwen": 0.03617819314822555, |
| "train/kl_loss_r1": 0.020906389644369482, |
| "train/total_kl": 0.057084583304822446 |
| }, |
| { |
| "epoch": 0.35278663914430475, |
| "grad_norm": 3.203125, |
| "learning_rate": 2.7353603603603606e-05, |
| "loss": 0.8568, |
| "mean_token_accuracy": 0.8304102897644043, |
| "step": 470, |
| "train/kl_loss_qwen": 0.04182955021969974, |
| "train/kl_loss_r1": 0.020317962439730764, |
| "train/total_kl": 0.06214751219376922 |
| }, |
| { |
| "epoch": 0.35653968849690376, |
| "grad_norm": 2.828125, |
| "learning_rate": 2.7325450450450452e-05, |
| "loss": 0.8763, |
| "mean_token_accuracy": 0.8301267266273499, |
| "step": 475, |
| "train/kl_loss_qwen": 0.03945403727702797, |
| "train/kl_loss_r1": 0.022836983483284713, |
| "train/total_kl": 0.06229102117940784 |
| }, |
| { |
| "epoch": 0.3602927378495027, |
| "grad_norm": 2.953125, |
| "learning_rate": 2.7297297297297298e-05, |
| "loss": 0.8484, |
| "mean_token_accuracy": 0.8383503198623657, |
| "step": 480, |
| "train/kl_loss_qwen": 0.038632744224742055, |
| "train/kl_loss_r1": 0.019086693413555622, |
| "train/total_kl": 0.057719437219202516 |
| }, |
| { |
| "epoch": 0.36404578720210173, |
| "grad_norm": 2.640625, |
| "learning_rate": 2.7269144144144147e-05, |
| "loss": 0.8675, |
| "mean_token_accuracy": 0.8294745326042176, |
| "step": 485, |
| "train/kl_loss_qwen": 0.03857216462492943, |
| "train/kl_loss_r1": 0.020617604441940784, |
| "train/total_kl": 0.05918976916000247 |
| }, |
| { |
| "epoch": 0.3677988365547007, |
| "grad_norm": 2.625, |
| "learning_rate": 2.7240990990990992e-05, |
| "loss": 0.8863, |
| "mean_token_accuracy": 0.8222176939249038, |
| "step": 490, |
| "train/kl_loss_qwen": 0.034204355999827386, |
| "train/kl_loss_r1": 0.019204271771013737, |
| "train/total_kl": 0.05340862749144435 |
| }, |
| { |
| "epoch": 0.3715518859072997, |
| "grad_norm": 3.125, |
| "learning_rate": 2.7212837837837838e-05, |
| "loss": 0.8404, |
| "mean_token_accuracy": 0.8288236528635025, |
| "step": 495, |
| "train/kl_loss_qwen": 0.03576806071214378, |
| "train/kl_loss_r1": 0.02088703722693026, |
| "train/total_kl": 0.056655097752809525 |
| }, |
| { |
| "epoch": 0.37530493525989866, |
| "grad_norm": 2.515625, |
| "learning_rate": 2.7184684684684687e-05, |
| "loss": 0.8603, |
| "mean_token_accuracy": 0.8273730278015137, |
| "step": 500, |
| "train/kl_loss_qwen": 0.04495933828875422, |
| "train/kl_loss_r1": 0.02340303808450699, |
| "train/total_kl": 0.06836237693205476 |
| }, |
| { |
| "epoch": 0.3790579846124977, |
| "grad_norm": 2.90625, |
| "learning_rate": 2.7156531531531533e-05, |
| "loss": 0.8351, |
| "mean_token_accuracy": 0.8235865086317062, |
| "step": 505, |
| "train/kl_loss_qwen": 0.026128826756030323, |
| "train/kl_loss_r1": 0.016629086900502445, |
| "train/total_kl": 0.04275791347026825 |
| }, |
| { |
| "epoch": 0.38281103396509664, |
| "grad_norm": 3.1875, |
| "learning_rate": 2.7128378378378382e-05, |
| "loss": 0.8521, |
| "mean_token_accuracy": 0.8217630565166474, |
| "step": 510, |
| "train/kl_loss_qwen": 0.029674333380535246, |
| "train/kl_loss_r1": 0.016433697286993267, |
| "train/total_kl": 0.04610803062096238 |
| }, |
| { |
| "epoch": 0.38656408331769565, |
| "grad_norm": 2.796875, |
| "learning_rate": 2.7100225225225227e-05, |
| "loss": 0.88, |
| "mean_token_accuracy": 0.829921105504036, |
| "step": 515, |
| "train/kl_loss_qwen": 0.02549975486472249, |
| "train/kl_loss_r1": 0.017349076084792615, |
| "train/total_kl": 0.042848830856382844 |
| }, |
| { |
| "epoch": 0.3903171326702946, |
| "grad_norm": 2.78125, |
| "learning_rate": 2.7072072072072073e-05, |
| "loss": 0.8744, |
| "mean_token_accuracy": 0.823358204960823, |
| "step": 520, |
| "train/kl_loss_qwen": 0.04186864621005952, |
| "train/kl_loss_r1": 0.022606688272207975, |
| "train/total_kl": 0.06447533471509814 |
| }, |
| { |
| "epoch": 0.3940701820228936, |
| "grad_norm": 2.90625, |
| "learning_rate": 2.7043918918918922e-05, |
| "loss": 0.9341, |
| "mean_token_accuracy": 0.8311702489852906, |
| "step": 525, |
| "train/kl_loss_qwen": 0.04608453796245158, |
| "train/kl_loss_r1": 0.03976609790697694, |
| "train/total_kl": 0.08585063479840756 |
| }, |
| { |
| "epoch": 0.3978232313754926, |
| "grad_norm": 3.59375, |
| "learning_rate": 2.7015765765765768e-05, |
| "loss": 0.8834, |
| "mean_token_accuracy": 0.8259417653083801, |
| "step": 530, |
| "train/kl_loss_qwen": 0.03925313828513026, |
| "train/kl_loss_r1": 0.025636327592656015, |
| "train/total_kl": 0.06488946592435241 |
| }, |
| { |
| "epoch": 0.4015762807280916, |
| "grad_norm": 3.15625, |
| "learning_rate": 2.6987612612612613e-05, |
| "loss": 0.8555, |
| "mean_token_accuracy": 0.8354889839887619, |
| "step": 535, |
| "train/kl_loss_qwen": 0.029237260250374673, |
| "train/kl_loss_r1": 0.017392286285758018, |
| "train/total_kl": 0.04662954695522785 |
| }, |
| { |
| "epoch": 0.40532933008069055, |
| "grad_norm": 3.390625, |
| "learning_rate": 2.6959459459459462e-05, |
| "loss": 0.8966, |
| "mean_token_accuracy": 0.8290208607912064, |
| "step": 540, |
| "train/kl_loss_qwen": 0.03987643430009484, |
| "train/kl_loss_r1": 0.02204420636408031, |
| "train/total_kl": 0.06192064164206386 |
| }, |
| { |
| "epoch": 0.40908237943328957, |
| "grad_norm": 2.828125, |
| "learning_rate": 2.6931306306306308e-05, |
| "loss": 0.8607, |
| "mean_token_accuracy": 0.8293038636446, |
| "step": 545, |
| "train/kl_loss_qwen": 0.043356449948623775, |
| "train/kl_loss_r1": 0.02318003964610398, |
| "train/total_kl": 0.06653648959472776 |
| }, |
| { |
| "epoch": 0.4128354287858885, |
| "grad_norm": 3.5, |
| "learning_rate": 2.6903153153153154e-05, |
| "loss": 0.8883, |
| "mean_token_accuracy": 0.8272899180650711, |
| "step": 550, |
| "train/kl_loss_qwen": 0.03798080673441291, |
| "train/kl_loss_r1": 0.02549419435672462, |
| "train/total_kl": 0.06347499992698431 |
| }, |
| { |
| "epoch": 0.41658847813848754, |
| "grad_norm": 2.921875, |
| "learning_rate": 2.6875000000000003e-05, |
| "loss": 0.7814, |
| "mean_token_accuracy": 0.8324926406145096, |
| "step": 555, |
| "train/kl_loss_qwen": 0.03234069491736591, |
| "train/kl_loss_r1": 0.017109810281544922, |
| "train/total_kl": 0.049450505338609216 |
| }, |
| { |
| "epoch": 0.4203415274910865, |
| "grad_norm": 3.125, |
| "learning_rate": 2.684684684684685e-05, |
| "loss": 0.8864, |
| "mean_token_accuracy": 0.8263786643743515, |
| "step": 560, |
| "train/kl_loss_qwen": 0.04717784961685538, |
| "train/kl_loss_r1": 0.022931459918618204, |
| "train/total_kl": 0.07010931000113488 |
| }, |
| { |
| "epoch": 0.4240945768436855, |
| "grad_norm": 2.96875, |
| "learning_rate": 2.6818693693693694e-05, |
| "loss": 0.8604, |
| "mean_token_accuracy": 0.8222783863544464, |
| "step": 565, |
| "train/kl_loss_qwen": 0.024484040634706616, |
| "train/kl_loss_r1": 0.015275527024641633, |
| "train/total_kl": 0.03975956765934825 |
| }, |
| { |
| "epoch": 0.42784762619628447, |
| "grad_norm": 3.015625, |
| "learning_rate": 2.6790540540540543e-05, |
| "loss": 0.8469, |
| "mean_token_accuracy": 0.8336408853530883, |
| "step": 570, |
| "train/kl_loss_qwen": 0.033210785733535884, |
| "train/kl_loss_r1": 0.02305849390104413, |
| "train/total_kl": 0.056269279681146145 |
| }, |
| { |
| "epoch": 0.4316006755488835, |
| "grad_norm": 3.03125, |
| "learning_rate": 2.676238738738739e-05, |
| "loss": 0.8368, |
| "mean_token_accuracy": 0.8395666360855103, |
| "step": 575, |
| "train/kl_loss_qwen": 0.03861711327917874, |
| "train/kl_loss_r1": 0.021925621898844838, |
| "train/total_kl": 0.060542735550552604 |
| }, |
| { |
| "epoch": 0.43535372490148244, |
| "grad_norm": 4.21875, |
| "learning_rate": 2.6734234234234238e-05, |
| "loss": 0.9169, |
| "mean_token_accuracy": 0.8193831950426101, |
| "step": 580, |
| "train/kl_loss_qwen": 0.03615025961771608, |
| "train/kl_loss_r1": 0.020520770689472556, |
| "train/total_kl": 0.05667103016749024 |
| }, |
| { |
| "epoch": 0.43910677425408146, |
| "grad_norm": 3.390625, |
| "learning_rate": 2.6706081081081083e-05, |
| "loss": 0.8433, |
| "mean_token_accuracy": 0.8257136255502701, |
| "step": 585, |
| "train/kl_loss_qwen": 0.034600982908159494, |
| "train/kl_loss_r1": 0.01836161450482905, |
| "train/total_kl": 0.052962597087025644 |
| }, |
| { |
| "epoch": 0.4428598236066804, |
| "grad_norm": 4.46875, |
| "learning_rate": 2.667792792792793e-05, |
| "loss": 0.831, |
| "mean_token_accuracy": 0.8363171756267548, |
| "step": 590, |
| "train/kl_loss_qwen": 0.02988515649922192, |
| "train/kl_loss_r1": 0.017817869270220398, |
| "train/total_kl": 0.047703025955706836 |
| }, |
| { |
| "epoch": 0.4466128729592794, |
| "grad_norm": 3.125, |
| "learning_rate": 2.6649774774774778e-05, |
| "loss": 0.8749, |
| "mean_token_accuracy": 0.8290423005819321, |
| "step": 595, |
| "train/kl_loss_qwen": 0.028889529453590513, |
| "train/kl_loss_r1": 0.02102498891763389, |
| "train/total_kl": 0.04991451846435666 |
| }, |
| { |
| "epoch": 0.4503659223118784, |
| "grad_norm": 3.421875, |
| "learning_rate": 2.6621621621621624e-05, |
| "loss": 0.8993, |
| "mean_token_accuracy": 0.8241715729236603, |
| "step": 600, |
| "train/kl_loss_qwen": 0.04158163848333061, |
| "train/kl_loss_r1": 0.021697819139808415, |
| "train/total_kl": 0.06327945673838258 |
| }, |
| { |
| "epoch": 0.4541189716644774, |
| "grad_norm": 3.34375, |
| "learning_rate": 2.659346846846847e-05, |
| "loss": 0.8277, |
| "mean_token_accuracy": 0.8300861209630966, |
| "step": 605, |
| "train/kl_loss_qwen": 0.026456801500171424, |
| "train/kl_loss_r1": 0.01746466476470232, |
| "train/total_kl": 0.0439214657060802 |
| }, |
| { |
| "epoch": 0.45787202101707636, |
| "grad_norm": 2.703125, |
| "learning_rate": 2.656531531531532e-05, |
| "loss": 0.8603, |
| "mean_token_accuracy": 0.831222626566887, |
| "step": 610, |
| "train/kl_loss_qwen": 0.04137272802181542, |
| "train/kl_loss_r1": 0.020235793106257914, |
| "train/total_kl": 0.06160852164030075 |
| }, |
| { |
| "epoch": 0.46162507036967537, |
| "grad_norm": 3.359375, |
| "learning_rate": 2.6537162162162164e-05, |
| "loss": 0.8133, |
| "mean_token_accuracy": 0.8376553744077683, |
| "step": 615, |
| "train/kl_loss_qwen": 0.033105089655146004, |
| "train/kl_loss_r1": 0.020932874642312527, |
| "train/total_kl": 0.05403796397149563 |
| }, |
| { |
| "epoch": 0.46537811972227433, |
| "grad_norm": 2.671875, |
| "learning_rate": 2.650900900900901e-05, |
| "loss": 0.827, |
| "mean_token_accuracy": 0.8355785965919494, |
| "step": 620, |
| "train/kl_loss_qwen": 0.034664105530828236, |
| "train/kl_loss_r1": 0.01959628048352897, |
| "train/total_kl": 0.05426038540899754 |
| }, |
| { |
| "epoch": 0.46913116907487334, |
| "grad_norm": 2.90625, |
| "learning_rate": 2.648085585585586e-05, |
| "loss": 0.8264, |
| "mean_token_accuracy": 0.8406971305608749, |
| "step": 625, |
| "train/kl_loss_qwen": 0.03744598152115941, |
| "train/kl_loss_r1": 0.020712826820090412, |
| "train/total_kl": 0.05815880903974176 |
| }, |
| { |
| "epoch": 0.4728842184274723, |
| "grad_norm": 3.140625, |
| "learning_rate": 2.6452702702702704e-05, |
| "loss": 0.8981, |
| "mean_token_accuracy": 0.8248670309782028, |
| "step": 630, |
| "train/kl_loss_qwen": 0.04424663879908621, |
| "train/kl_loss_r1": 0.02367804222740233, |
| "train/total_kl": 0.06792468149214984 |
| }, |
| { |
| "epoch": 0.4766372677800713, |
| "grad_norm": 3.03125, |
| "learning_rate": 2.642454954954955e-05, |
| "loss": 0.8179, |
| "mean_token_accuracy": 0.8314776927232742, |
| "step": 635, |
| "train/kl_loss_qwen": 0.028519577998667955, |
| "train/kl_loss_r1": 0.015795104345306753, |
| "train/total_kl": 0.04431468164548278 |
| }, |
| { |
| "epoch": 0.4803903171326703, |
| "grad_norm": 2.578125, |
| "learning_rate": 2.63963963963964e-05, |
| "loss": 0.8084, |
| "mean_token_accuracy": 0.8305885761976242, |
| "step": 640, |
| "train/kl_loss_qwen": 0.03188405260443687, |
| "train/kl_loss_r1": 0.019454342126846314, |
| "train/total_kl": 0.0513383949175477 |
| }, |
| { |
| "epoch": 0.4841433664852693, |
| "grad_norm": 2.6875, |
| "learning_rate": 2.6368243243243245e-05, |
| "loss": 0.8135, |
| "mean_token_accuracy": 0.8340533554553986, |
| "step": 645, |
| "train/kl_loss_qwen": 0.032302316091954705, |
| "train/kl_loss_r1": 0.017988856183364987, |
| "train/total_kl": 0.05029117204248905 |
| }, |
| { |
| "epoch": 0.48789641583786825, |
| "grad_norm": 2.84375, |
| "learning_rate": 2.6340090090090094e-05, |
| "loss": 0.8128, |
| "mean_token_accuracy": 0.8344713598489761, |
| "step": 650, |
| "train/kl_loss_qwen": 0.03608106402680278, |
| "train/kl_loss_r1": 0.020161894662305713, |
| "train/total_kl": 0.056242958083748816 |
| }, |
| { |
| "epoch": 0.49164946519046726, |
| "grad_norm": 3.5, |
| "learning_rate": 2.631193693693694e-05, |
| "loss": 0.8303, |
| "mean_token_accuracy": 0.8302734345197678, |
| "step": 655, |
| "train/kl_loss_qwen": 0.0397234917152673, |
| "train/kl_loss_r1": 0.019664824660867452, |
| "train/total_kl": 0.059388316422700885 |
| }, |
| { |
| "epoch": 0.4954025145430662, |
| "grad_norm": 2.375, |
| "learning_rate": 2.6283783783783785e-05, |
| "loss": 0.8792, |
| "mean_token_accuracy": 0.8349238276481629, |
| "step": 660, |
| "train/kl_loss_qwen": 0.04533764449879527, |
| "train/kl_loss_r1": 0.023747803224250675, |
| "train/total_kl": 0.06908544823527336 |
| }, |
| { |
| "epoch": 0.49915556389566523, |
| "grad_norm": 2.5625, |
| "learning_rate": 2.6255630630630634e-05, |
| "loss": 0.8507, |
| "mean_token_accuracy": 0.8313362389802933, |
| "step": 665, |
| "train/kl_loss_qwen": 0.03387423628009856, |
| "train/kl_loss_r1": 0.01939927397761494, |
| "train/total_kl": 0.053273510001599786 |
| }, |
| { |
| "epoch": 0.5029086132482642, |
| "grad_norm": 2.984375, |
| "learning_rate": 2.622747747747748e-05, |
| "loss": 0.812, |
| "mean_token_accuracy": 0.8389832735061645, |
| "step": 670, |
| "train/kl_loss_qwen": 0.039962123753502964, |
| "train/kl_loss_r1": 0.02203605165705085, |
| "train/total_kl": 0.0619981755502522 |
| }, |
| { |
| "epoch": 0.5066616626008632, |
| "grad_norm": 2.625, |
| "learning_rate": 2.6199324324324325e-05, |
| "loss": 0.8327, |
| "mean_token_accuracy": 0.828178471326828, |
| "step": 675, |
| "train/kl_loss_qwen": 0.030491138668730856, |
| "train/kl_loss_r1": 0.0178588742390275, |
| "train/total_kl": 0.048350013047456744 |
| }, |
| { |
| "epoch": 0.5104147119534622, |
| "grad_norm": 3.0625, |
| "learning_rate": 2.6171171171171174e-05, |
| "loss": 0.8645, |
| "mean_token_accuracy": 0.8310636579990387, |
| "step": 680, |
| "train/kl_loss_qwen": 0.040654600923880936, |
| "train/kl_loss_r1": 0.02228041235357523, |
| "train/total_kl": 0.06293501388281583 |
| }, |
| { |
| "epoch": 0.5141677613060611, |
| "grad_norm": 2.875, |
| "learning_rate": 2.614301801801802e-05, |
| "loss": 0.842, |
| "mean_token_accuracy": 0.8304677546024323, |
| "step": 685, |
| "train/kl_loss_qwen": 0.03915594620630145, |
| "train/kl_loss_r1": 0.019675446720793844, |
| "train/total_kl": 0.05883139288052917 |
| }, |
| { |
| "epoch": 0.5179208106586601, |
| "grad_norm": 2.546875, |
| "learning_rate": 2.6114864864864866e-05, |
| "loss": 0.8264, |
| "mean_token_accuracy": 0.8229408442974091, |
| "step": 690, |
| "train/kl_loss_qwen": 0.032891119550913575, |
| "train/kl_loss_r1": 0.01707150642760098, |
| "train/total_kl": 0.04996262574568391 |
| }, |
| { |
| "epoch": 0.5216738600112591, |
| "grad_norm": 3.25, |
| "learning_rate": 2.6086711711711715e-05, |
| "loss": 0.8669, |
| "mean_token_accuracy": 0.8281047195196152, |
| "step": 695, |
| "train/kl_loss_qwen": 0.03547921110875905, |
| "train/kl_loss_r1": 0.02080541094765067, |
| "train/total_kl": 0.05628462266176939 |
| }, |
| { |
| "epoch": 0.5254269093638582, |
| "grad_norm": 3.46875, |
| "learning_rate": 2.605855855855856e-05, |
| "loss": 0.8636, |
| "mean_token_accuracy": 0.8235750675201416, |
| "step": 700, |
| "train/kl_loss_qwen": 0.03132840511389077, |
| "train/kl_loss_r1": 0.01750999097712338, |
| "train/total_kl": 0.04883839599788189 |
| }, |
| { |
| "epoch": 0.5291799587164571, |
| "grad_norm": 2.671875, |
| "learning_rate": 2.6030405405405406e-05, |
| "loss": 0.8581, |
| "mean_token_accuracy": 0.8307362526655198, |
| "step": 705, |
| "train/kl_loss_qwen": 0.03873220053501427, |
| "train/kl_loss_r1": 0.02116750692948699, |
| "train/total_kl": 0.059899707604199645 |
| }, |
| { |
| "epoch": 0.5329330080690561, |
| "grad_norm": 2.875, |
| "learning_rate": 2.6002252252252255e-05, |
| "loss": 0.8222, |
| "mean_token_accuracy": 0.8313774734735488, |
| "step": 710, |
| "train/kl_loss_qwen": 0.031245797453448177, |
| "train/kl_loss_r1": 0.020813510101288558, |
| "train/total_kl": 0.05205930741503835 |
| }, |
| { |
| "epoch": 0.5366860574216551, |
| "grad_norm": 3.265625, |
| "learning_rate": 2.59740990990991e-05, |
| "loss": 0.8942, |
| "mean_token_accuracy": 0.8268726974725723, |
| "step": 715, |
| "train/kl_loss_qwen": 0.047184772603213784, |
| "train/kl_loss_r1": 0.025426519196480514, |
| "train/total_kl": 0.0726112917996943 |
| }, |
| { |
| "epoch": 0.5404391067742541, |
| "grad_norm": 2.84375, |
| "learning_rate": 2.594594594594595e-05, |
| "loss": 0.8544, |
| "mean_token_accuracy": 0.8252176523208619, |
| "step": 720, |
| "train/kl_loss_qwen": 0.02930951355956495, |
| "train/kl_loss_r1": 0.017893961817026138, |
| "train/total_kl": 0.04720347533002496 |
| }, |
| { |
| "epoch": 0.5441921561268531, |
| "grad_norm": 3.328125, |
| "learning_rate": 2.5917792792792795e-05, |
| "loss": 0.8226, |
| "mean_token_accuracy": 0.8322675555944443, |
| "step": 725, |
| "train/kl_loss_qwen": 0.028172259964048863, |
| "train/kl_loss_r1": 0.016258031735196708, |
| "train/total_kl": 0.044430291093885896 |
| }, |
| { |
| "epoch": 0.547945205479452, |
| "grad_norm": 3.515625, |
| "learning_rate": 2.588963963963964e-05, |
| "loss": 0.8439, |
| "mean_token_accuracy": 0.8234845697879791, |
| "step": 730, |
| "train/kl_loss_qwen": 0.03387451712042093, |
| "train/kl_loss_r1": 0.01895874026231468, |
| "train/total_kl": 0.052833257243037224 |
| }, |
| { |
| "epoch": 0.551698254832051, |
| "grad_norm": 2.34375, |
| "learning_rate": 2.586148648648649e-05, |
| "loss": 0.8306, |
| "mean_token_accuracy": 0.8320945203304291, |
| "step": 735, |
| "train/kl_loss_qwen": 0.038065289705991746, |
| "train/kl_loss_r1": 0.02160985255613923, |
| "train/total_kl": 0.059675142634660006 |
| }, |
| { |
| "epoch": 0.55545130418465, |
| "grad_norm": 2.796875, |
| "learning_rate": 2.5833333333333336e-05, |
| "loss": 0.818, |
| "mean_token_accuracy": 0.8301131039857864, |
| "step": 740, |
| "train/kl_loss_qwen": 0.03414399088360369, |
| "train/kl_loss_r1": 0.018777534132823348, |
| "train/total_kl": 0.052921525482088325 |
| }, |
| { |
| "epoch": 0.5592043535372491, |
| "grad_norm": 3.078125, |
| "learning_rate": 2.580518018018018e-05, |
| "loss": 0.8565, |
| "mean_token_accuracy": 0.8275852560997009, |
| "step": 745, |
| "train/kl_loss_qwen": 0.03220190773718059, |
| "train/kl_loss_r1": 0.01762353884987533, |
| "train/total_kl": 0.04982544640079141 |
| }, |
| { |
| "epoch": 0.562957402889848, |
| "grad_norm": 2.484375, |
| "learning_rate": 2.577702702702703e-05, |
| "loss": 0.8718, |
| "mean_token_accuracy": 0.8311895519495011, |
| "step": 750, |
| "train/kl_loss_qwen": 0.03311848752200604, |
| "train/kl_loss_r1": 0.019135183561593293, |
| "train/total_kl": 0.0522536713629961 |
| }, |
| { |
| "epoch": 0.566710452242447, |
| "grad_norm": 2.5625, |
| "learning_rate": 2.5748873873873876e-05, |
| "loss": 0.8634, |
| "mean_token_accuracy": 0.830333125591278, |
| "step": 755, |
| "train/kl_loss_qwen": 0.04198941690847278, |
| "train/kl_loss_r1": 0.021147539000958206, |
| "train/total_kl": 0.06313695563003421 |
| }, |
| { |
| "epoch": 0.570463501595046, |
| "grad_norm": 2.734375, |
| "learning_rate": 2.572072072072072e-05, |
| "loss": 0.84, |
| "mean_token_accuracy": 0.834811520576477, |
| "step": 760, |
| "train/kl_loss_qwen": 0.02746470207348466, |
| "train/kl_loss_r1": 0.019080733275040986, |
| "train/total_kl": 0.04654543492943049 |
| }, |
| { |
| "epoch": 0.574216550947645, |
| "grad_norm": 2.890625, |
| "learning_rate": 2.569256756756757e-05, |
| "loss": 0.8367, |
| "mean_token_accuracy": 0.8293649315834045, |
| "step": 765, |
| "train/kl_loss_qwen": 0.01999104334972799, |
| "train/kl_loss_r1": 0.014198838081210852, |
| "train/total_kl": 0.03418988138437271 |
| }, |
| { |
| "epoch": 0.5779696003002439, |
| "grad_norm": 2.8125, |
| "learning_rate": 2.5664414414414416e-05, |
| "loss": 0.8411, |
| "mean_token_accuracy": 0.8336279571056366, |
| "step": 770, |
| "train/kl_loss_qwen": 0.039404576364904645, |
| "train/kl_loss_r1": 0.021028988901525734, |
| "train/total_kl": 0.06043356563895941 |
| }, |
| { |
| "epoch": 0.5817226496528429, |
| "grad_norm": 2.890625, |
| "learning_rate": 2.5636261261261262e-05, |
| "loss": 0.8445, |
| "mean_token_accuracy": 0.835637891292572, |
| "step": 775, |
| "train/kl_loss_qwen": 0.036282278271391986, |
| "train/kl_loss_r1": 0.02238774998113513, |
| "train/total_kl": 0.05867002848535776 |
| }, |
| { |
| "epoch": 0.5854756990054419, |
| "grad_norm": 8.0625, |
| "learning_rate": 2.560810810810811e-05, |
| "loss": 0.9509, |
| "mean_token_accuracy": 0.8231443852186203, |
| "step": 780, |
| "train/kl_loss_qwen": 0.04694451265968382, |
| "train/kl_loss_r1": 0.03180371643975377, |
| "train/total_kl": 0.07874822989106178 |
| }, |
| { |
| "epoch": 0.589228748358041, |
| "grad_norm": 3.453125, |
| "learning_rate": 2.5579954954954957e-05, |
| "loss": 0.8481, |
| "mean_token_accuracy": 0.8317405015230179, |
| "step": 785, |
| "train/kl_loss_qwen": 0.029904183652251958, |
| "train/kl_loss_r1": 0.019615561049431563, |
| "train/total_kl": 0.04951974479481578 |
| }, |
| { |
| "epoch": 0.5929817977106399, |
| "grad_norm": 2.859375, |
| "learning_rate": 2.5551801801801806e-05, |
| "loss": 0.8042, |
| "mean_token_accuracy": 0.8370792746543885, |
| "step": 790, |
| "train/kl_loss_qwen": 0.028761968202888965, |
| "train/kl_loss_r1": 0.017533178441226482, |
| "train/total_kl": 0.0462951467372477 |
| }, |
| { |
| "epoch": 0.5967348470632389, |
| "grad_norm": 3.78125, |
| "learning_rate": 2.552364864864865e-05, |
| "loss": 0.8447, |
| "mean_token_accuracy": 0.8354480415582657, |
| "step": 795, |
| "train/kl_loss_qwen": 0.03184347827918828, |
| "train/kl_loss_r1": 0.018696364481002092, |
| "train/total_kl": 0.050539842899888755 |
| }, |
| { |
| "epoch": 0.6004878964158379, |
| "grad_norm": 2.453125, |
| "learning_rate": 2.5495495495495497e-05, |
| "loss": 0.8344, |
| "mean_token_accuracy": 0.8341012299060822, |
| "step": 800, |
| "train/kl_loss_qwen": 0.04001581417396664, |
| "train/kl_loss_r1": 0.02106495094485581, |
| "train/total_kl": 0.06108076488599181 |
| }, |
| { |
| "epoch": 0.6042409457684369, |
| "grad_norm": 2.65625, |
| "learning_rate": 2.5467342342342346e-05, |
| "loss": 0.8045, |
| "mean_token_accuracy": 0.8411924570798874, |
| "step": 805, |
| "train/kl_loss_qwen": 0.03035055147483945, |
| "train/kl_loss_r1": 0.01776686739176512, |
| "train/total_kl": 0.04811741886660457 |
| }, |
| { |
| "epoch": 0.6079939951210358, |
| "grad_norm": 2.796875, |
| "learning_rate": 2.543918918918919e-05, |
| "loss": 0.8645, |
| "mean_token_accuracy": 0.8307548046112061, |
| "step": 810, |
| "train/kl_loss_qwen": 0.04272727402858436, |
| "train/kl_loss_r1": 0.024424682604148984, |
| "train/total_kl": 0.06715195653960108 |
| }, |
| { |
| "epoch": 0.6117470444736348, |
| "grad_norm": 2.65625, |
| "learning_rate": 2.5411036036036037e-05, |
| "loss": 0.8425, |
| "mean_token_accuracy": 0.8313584119081497, |
| "step": 815, |
| "train/kl_loss_qwen": 0.0339477127417922, |
| "train/kl_loss_r1": 0.020929417014122008, |
| "train/total_kl": 0.0548771295696497 |
| }, |
| { |
| "epoch": 0.6155000938262338, |
| "grad_norm": 2.953125, |
| "learning_rate": 2.5382882882882886e-05, |
| "loss": 0.8112, |
| "mean_token_accuracy": 0.8362564355134964, |
| "step": 820, |
| "train/kl_loss_qwen": 0.03412885209545493, |
| "train/kl_loss_r1": 0.016538083972409367, |
| "train/total_kl": 0.0506669357419014 |
| }, |
| { |
| "epoch": 0.6192531431788328, |
| "grad_norm": 3.109375, |
| "learning_rate": 2.5354729729729732e-05, |
| "loss": 0.849, |
| "mean_token_accuracy": 0.8359062880277633, |
| "step": 825, |
| "train/kl_loss_qwen": 0.04249853491783142, |
| "train/kl_loss_r1": 0.02333756978623569, |
| "train/total_kl": 0.06583610456436872 |
| }, |
| { |
| "epoch": 0.6230061925314317, |
| "grad_norm": 3.359375, |
| "learning_rate": 2.5326576576576578e-05, |
| "loss": 0.8351, |
| "mean_token_accuracy": 0.825828817486763, |
| "step": 830, |
| "train/kl_loss_qwen": 0.034189414512366054, |
| "train/kl_loss_r1": 0.02052266038954258, |
| "train/total_kl": 0.05471207490190864 |
| }, |
| { |
| "epoch": 0.6267592418840308, |
| "grad_norm": 2.984375, |
| "learning_rate": 2.5298423423423423e-05, |
| "loss": 0.8356, |
| "mean_token_accuracy": 0.8265765368938446, |
| "step": 835, |
| "train/kl_loss_qwen": 0.03163366257213056, |
| "train/kl_loss_r1": 0.016908307839185, |
| "train/total_kl": 0.04854197036474943 |
| }, |
| { |
| "epoch": 0.6305122912366298, |
| "grad_norm": 3.15625, |
| "learning_rate": 2.527027027027027e-05, |
| "loss": 0.8725, |
| "mean_token_accuracy": 0.8330867946147918, |
| "step": 840, |
| "train/kl_loss_qwen": 0.04397285329177976, |
| "train/kl_loss_r1": 0.023652500985190273, |
| "train/total_kl": 0.06762535478919744 |
| }, |
| { |
| "epoch": 0.6342653405892288, |
| "grad_norm": 3.046875, |
| "learning_rate": 2.5242117117117114e-05, |
| "loss": 0.8632, |
| "mean_token_accuracy": 0.832156303524971, |
| "step": 845, |
| "train/kl_loss_qwen": 0.03385147815570235, |
| "train/kl_loss_r1": 0.020532624423503877, |
| "train/total_kl": 0.054384103137999774 |
| }, |
| { |
| "epoch": 0.6380183899418277, |
| "grad_norm": 2.796875, |
| "learning_rate": 2.5213963963963963e-05, |
| "loss": 0.7873, |
| "mean_token_accuracy": 0.8407374769449234, |
| "step": 850, |
| "train/kl_loss_qwen": 0.03273296277038753, |
| "train/kl_loss_r1": 0.020149347372353077, |
| "train/total_kl": 0.05288231000304222 |
| }, |
| { |
| "epoch": 0.6417714392944267, |
| "grad_norm": 3.0625, |
| "learning_rate": 2.518581081081081e-05, |
| "loss": 0.8522, |
| "mean_token_accuracy": 0.8305691838264465, |
| "step": 855, |
| "train/kl_loss_qwen": 0.03824136960320175, |
| "train/kl_loss_r1": 0.021116166748106478, |
| "train/total_kl": 0.05935753621160984 |
| }, |
| { |
| "epoch": 0.6455244886470257, |
| "grad_norm": 2.625, |
| "learning_rate": 2.5157657657657658e-05, |
| "loss": 0.8392, |
| "mean_token_accuracy": 0.8265466034412384, |
| "step": 860, |
| "train/kl_loss_qwen": 0.030321336397901178, |
| "train/kl_loss_r1": 0.01701959897764027, |
| "train/total_kl": 0.047340935561805964 |
| }, |
| { |
| "epoch": 0.6492775379996247, |
| "grad_norm": 2.75, |
| "learning_rate": 2.5129504504504504e-05, |
| "loss": 0.8606, |
| "mean_token_accuracy": 0.83104607462883, |
| "step": 865, |
| "train/kl_loss_qwen": 0.046971744811162355, |
| "train/kl_loss_r1": 0.023864060686901212, |
| "train/total_kl": 0.07083580642938614 |
| }, |
| { |
| "epoch": 0.6530305873522236, |
| "grad_norm": 2.671875, |
| "learning_rate": 2.510135135135135e-05, |
| "loss": 0.8566, |
| "mean_token_accuracy": 0.8245219022035599, |
| "step": 870, |
| "train/kl_loss_qwen": 0.031761659309268, |
| "train/kl_loss_r1": 0.017597190476953982, |
| "train/total_kl": 0.04935885015875101 |
| }, |
| { |
| "epoch": 0.6567836367048226, |
| "grad_norm": 2.796875, |
| "learning_rate": 2.50731981981982e-05, |
| "loss": 0.8165, |
| "mean_token_accuracy": 0.8388794183731079, |
| "step": 875, |
| "train/kl_loss_qwen": 0.03677996243350208, |
| "train/kl_loss_r1": 0.02143030664883554, |
| "train/total_kl": 0.058210269268602136 |
| }, |
| { |
| "epoch": 0.6605366860574217, |
| "grad_norm": 2.9375, |
| "learning_rate": 2.5045045045045044e-05, |
| "loss": 0.8612, |
| "mean_token_accuracy": 0.8207795172929764, |
| "step": 880, |
| "train/kl_loss_qwen": 0.02968251397833228, |
| "train/kl_loss_r1": 0.018946969090029596, |
| "train/total_kl": 0.04862948274239898 |
| }, |
| { |
| "epoch": 0.6642897354100207, |
| "grad_norm": 2.46875, |
| "learning_rate": 2.501689189189189e-05, |
| "loss": 0.8129, |
| "mean_token_accuracy": 0.8363301217556, |
| "step": 885, |
| "train/kl_loss_qwen": 0.034025853127241136, |
| "train/kl_loss_r1": 0.020324263628572224, |
| "train/total_kl": 0.05435011638328433 |
| }, |
| { |
| "epoch": 0.6680427847626196, |
| "grad_norm": 2.421875, |
| "learning_rate": 2.498873873873874e-05, |
| "loss": 0.8294, |
| "mean_token_accuracy": 0.8286441206932068, |
| "step": 890, |
| "train/kl_loss_qwen": 0.0408441049978137, |
| "train/kl_loss_r1": 0.020420510414987804, |
| "train/total_kl": 0.06126461513340473 |
| }, |
| { |
| "epoch": 0.6717958341152186, |
| "grad_norm": 2.9375, |
| "learning_rate": 2.4960585585585584e-05, |
| "loss": 0.859, |
| "mean_token_accuracy": 0.8298782587051392, |
| "step": 895, |
| "train/kl_loss_qwen": 0.0418569162953645, |
| "train/kl_loss_r1": 0.022290918650105594, |
| "train/total_kl": 0.06414783513173461 |
| }, |
| { |
| "epoch": 0.6755488834678176, |
| "grad_norm": 2.5, |
| "learning_rate": 2.493243243243243e-05, |
| "loss": 0.8358, |
| "mean_token_accuracy": 0.8332624316215516, |
| "step": 900, |
| "train/kl_loss_qwen": 0.03841094318777323, |
| "train/kl_loss_r1": 0.01995689212344587, |
| "train/total_kl": 0.05836783479899168 |
| }, |
| { |
| "epoch": 0.6793019328204166, |
| "grad_norm": 2.921875, |
| "learning_rate": 2.490427927927928e-05, |
| "loss": 0.8765, |
| "mean_token_accuracy": 0.8321707814931869, |
| "step": 905, |
| "train/kl_loss_qwen": 0.042780818743631245, |
| "train/kl_loss_r1": 0.0235706131439656, |
| "train/total_kl": 0.0663514317944646 |
| }, |
| { |
| "epoch": 0.6830549821730155, |
| "grad_norm": 3.265625, |
| "learning_rate": 2.4876126126126125e-05, |
| "loss": 0.8608, |
| "mean_token_accuracy": 0.8260697066783905, |
| "step": 910, |
| "train/kl_loss_qwen": 0.035260281944647434, |
| "train/kl_loss_r1": 0.02195748295634985, |
| "train/total_kl": 0.057217765040695666 |
| }, |
| { |
| "epoch": 0.6868080315256145, |
| "grad_norm": 2.28125, |
| "learning_rate": 2.4847972972972974e-05, |
| "loss": 0.8564, |
| "mean_token_accuracy": 0.8374003231525421, |
| "step": 915, |
| "train/kl_loss_qwen": 0.04203944210894406, |
| "train/kl_loss_r1": 0.021511876583099367, |
| "train/total_kl": 0.06355131939053535 |
| }, |
| { |
| "epoch": 0.6905610808782136, |
| "grad_norm": 2.671875, |
| "learning_rate": 2.481981981981982e-05, |
| "loss": 0.8458, |
| "mean_token_accuracy": 0.8365840703248978, |
| "step": 920, |
| "train/kl_loss_qwen": 0.033759749541059134, |
| "train/kl_loss_r1": 0.0183026185259223, |
| "train/total_kl": 0.05206236876547336 |
| }, |
| { |
| "epoch": 0.6943141302308126, |
| "grad_norm": 2.921875, |
| "learning_rate": 2.4791666666666665e-05, |
| "loss": 0.8577, |
| "mean_token_accuracy": 0.8311419934034348, |
| "step": 925, |
| "train/kl_loss_qwen": 0.03777771787717939, |
| "train/kl_loss_r1": 0.022124431701377033, |
| "train/total_kl": 0.05990214953199029 |
| }, |
| { |
| "epoch": 0.6980671795834115, |
| "grad_norm": 2.90625, |
| "learning_rate": 2.4763513513513514e-05, |
| "loss": 0.838, |
| "mean_token_accuracy": 0.8319983184337616, |
| "step": 930, |
| "train/kl_loss_qwen": 0.037792898062616584, |
| "train/kl_loss_r1": 0.019103457499295474, |
| "train/total_kl": 0.05689635518938303 |
| }, |
| { |
| "epoch": 0.7018202289360105, |
| "grad_norm": 2.46875, |
| "learning_rate": 2.473536036036036e-05, |
| "loss": 0.8416, |
| "mean_token_accuracy": 0.8315385311841965, |
| "step": 935, |
| "train/kl_loss_qwen": 0.03756746407598257, |
| "train/kl_loss_r1": 0.020071876328438522, |
| "train/total_kl": 0.05763934040442109 |
| }, |
| { |
| "epoch": 0.7055732782886095, |
| "grad_norm": 2.796875, |
| "learning_rate": 2.4707207207207205e-05, |
| "loss": 0.8105, |
| "mean_token_accuracy": 0.831657874584198, |
| "step": 940, |
| "train/kl_loss_qwen": 0.03483249330893159, |
| "train/kl_loss_r1": 0.019865864235907794, |
| "train/total_kl": 0.05469835819676518 |
| }, |
| { |
| "epoch": 0.7093263276412085, |
| "grad_norm": 2.359375, |
| "learning_rate": 2.4679054054054054e-05, |
| "loss": 0.8679, |
| "mean_token_accuracy": 0.8223243087530137, |
| "step": 945, |
| "train/kl_loss_qwen": 0.030808620806783437, |
| "train/kl_loss_r1": 0.01705012475140393, |
| "train/total_kl": 0.04785874532535672 |
| }, |
| { |
| "epoch": 0.7130793769938075, |
| "grad_norm": 2.890625, |
| "learning_rate": 2.46509009009009e-05, |
| "loss": 0.844, |
| "mean_token_accuracy": 0.8352172911167145, |
| "step": 950, |
| "train/kl_loss_qwen": 0.03471320560202003, |
| "train/kl_loss_r1": 0.020137345883995295, |
| "train/total_kl": 0.05485055195167661 |
| }, |
| { |
| "epoch": 0.7168324263464064, |
| "grad_norm": 3.546875, |
| "learning_rate": 2.4622747747747746e-05, |
| "loss": 0.8499, |
| "mean_token_accuracy": 0.8335436582565308, |
| "step": 955, |
| "train/kl_loss_qwen": 0.02975294659845531, |
| "train/kl_loss_r1": 0.019273100467398763, |
| "train/total_kl": 0.04902604753151536 |
| }, |
| { |
| "epoch": 0.7205854756990054, |
| "grad_norm": 2.46875, |
| "learning_rate": 2.4594594594594595e-05, |
| "loss": 0.8223, |
| "mean_token_accuracy": 0.8394654095172882, |
| "step": 960, |
| "train/kl_loss_qwen": 0.03072880543768406, |
| "train/kl_loss_r1": 0.016514184465631843, |
| "train/total_kl": 0.047242989577353 |
| }, |
| { |
| "epoch": 0.7243385250516045, |
| "grad_norm": 3.625, |
| "learning_rate": 2.456644144144144e-05, |
| "loss": 0.8504, |
| "mean_token_accuracy": 0.8266110628843307, |
| "step": 965, |
| "train/kl_loss_qwen": 0.03343938612379134, |
| "train/kl_loss_r1": 0.01883910335600376, |
| "train/total_kl": 0.05227848952636123 |
| }, |
| { |
| "epoch": 0.7280915744042035, |
| "grad_norm": 3.328125, |
| "learning_rate": 2.4538288288288286e-05, |
| "loss": 0.8445, |
| "mean_token_accuracy": 0.8287754565477371, |
| "step": 970, |
| "train/kl_loss_qwen": 0.025892229238525032, |
| "train/kl_loss_r1": 0.015870556328445674, |
| "train/total_kl": 0.041762785613536836 |
| }, |
| { |
| "epoch": 0.7318446237568024, |
| "grad_norm": 2.8125, |
| "learning_rate": 2.4510135135135135e-05, |
| "loss": 0.8087, |
| "mean_token_accuracy": 0.8377816379070282, |
| "step": 975, |
| "train/kl_loss_qwen": 0.03318580673076212, |
| "train/kl_loss_r1": 0.01917458134703338, |
| "train/total_kl": 0.052360388170927766 |
| }, |
| { |
| "epoch": 0.7355976731094014, |
| "grad_norm": 3.453125, |
| "learning_rate": 2.448198198198198e-05, |
| "loss": 0.8186, |
| "mean_token_accuracy": 0.8333919525146485, |
| "step": 980, |
| "train/kl_loss_qwen": 0.029704937431961297, |
| "train/kl_loss_r1": 0.018210208415985106, |
| "train/total_kl": 0.04791514603421092 |
| }, |
| { |
| "epoch": 0.7393507224620004, |
| "grad_norm": 2.984375, |
| "learning_rate": 2.445382882882883e-05, |
| "loss": 0.8441, |
| "mean_token_accuracy": 0.8327240943908691, |
| "step": 985, |
| "train/kl_loss_qwen": 0.030404440499842166, |
| "train/kl_loss_r1": 0.01756331170909107, |
| "train/total_kl": 0.047967752907425165 |
| }, |
| { |
| "epoch": 0.7431037718145994, |
| "grad_norm": 3.25, |
| "learning_rate": 2.4425675675675675e-05, |
| "loss": 0.8662, |
| "mean_token_accuracy": 0.8255359560251236, |
| "step": 990, |
| "train/kl_loss_qwen": 0.03720358600839972, |
| "train/kl_loss_r1": 0.019459961261600257, |
| "train/total_kl": 0.056663547083735465 |
| }, |
| { |
| "epoch": 0.7468568211671983, |
| "grad_norm": 3.234375, |
| "learning_rate": 2.439752252252252e-05, |
| "loss": 0.8429, |
| "mean_token_accuracy": 0.8323214411735534, |
| "step": 995, |
| "train/kl_loss_qwen": 0.022656460804864765, |
| "train/kl_loss_r1": 0.01588835148140788, |
| "train/total_kl": 0.038544812332838775 |
| }, |
| { |
| "epoch": 0.7506098705197973, |
| "grad_norm": 3.0, |
| "learning_rate": 2.436936936936937e-05, |
| "loss": 0.8559, |
| "mean_token_accuracy": 0.8274749606847763, |
| "step": 1000, |
| "train/kl_loss_qwen": 0.03031270541250706, |
| "train/kl_loss_r1": 0.019612214388325812, |
| "train/total_kl": 0.04992491947486997 |
| }, |
| { |
| "epoch": 0.7543629198723963, |
| "grad_norm": 2.875, |
| "learning_rate": 2.4341216216216216e-05, |
| "loss": 0.8627, |
| "mean_token_accuracy": 0.8257625371217727, |
| "step": 1005, |
| "train/kl_loss_qwen": 0.030585462925955653, |
| "train/kl_loss_r1": 0.018655626522377133, |
| "train/total_kl": 0.04924108954146504 |
| }, |
| { |
| "epoch": 0.7581159692249954, |
| "grad_norm": 3.421875, |
| "learning_rate": 2.431306306306306e-05, |
| "loss": 0.8738, |
| "mean_token_accuracy": 0.8295246571302414, |
| "step": 1010, |
| "train/kl_loss_qwen": 0.03918474782258272, |
| "train/kl_loss_r1": 0.02318054302595556, |
| "train/total_kl": 0.062365290429443124 |
| }, |
| { |
| "epoch": 0.7618690185775943, |
| "grad_norm": 2.609375, |
| "learning_rate": 2.428490990990991e-05, |
| "loss": 0.8584, |
| "mean_token_accuracy": 0.8317355692386628, |
| "step": 1015, |
| "train/kl_loss_qwen": 0.04374503931030631, |
| "train/kl_loss_r1": 0.02465776102617383, |
| "train/total_kl": 0.0684028010815382 |
| }, |
| { |
| "epoch": 0.7656220679301933, |
| "grad_norm": 3.09375, |
| "learning_rate": 2.4256756756756756e-05, |
| "loss": 0.8392, |
| "mean_token_accuracy": 0.8248521685600281, |
| "step": 1020, |
| "train/kl_loss_qwen": 0.036725143622606995, |
| "train/kl_loss_r1": 0.019347941782325507, |
| "train/total_kl": 0.05607308465987444 |
| }, |
| { |
| "epoch": 0.7693751172827923, |
| "grad_norm": 2.859375, |
| "learning_rate": 2.42286036036036e-05, |
| "loss": 0.8539, |
| "mean_token_accuracy": 0.8296713292598724, |
| "step": 1025, |
| "train/kl_loss_qwen": 0.04443691144697368, |
| "train/kl_loss_r1": 0.02307268031872809, |
| "train/total_kl": 0.06750959167256951 |
| }, |
| { |
| "epoch": 0.7731281666353913, |
| "grad_norm": 3.3125, |
| "learning_rate": 2.420045045045045e-05, |
| "loss": 0.871, |
| "mean_token_accuracy": 0.8165527641773224, |
| "step": 1030, |
| "train/kl_loss_qwen": 0.03339883806183934, |
| "train/kl_loss_r1": 0.019999321456998585, |
| "train/total_kl": 0.05339815989136696 |
| }, |
| { |
| "epoch": 0.7768812159879902, |
| "grad_norm": 2.453125, |
| "learning_rate": 2.4172297297297296e-05, |
| "loss": 0.8847, |
| "mean_token_accuracy": 0.8283389657735825, |
| "step": 1035, |
| "train/kl_loss_qwen": 0.04716655816882849, |
| "train/kl_loss_r1": 0.029009951883926986, |
| "train/total_kl": 0.0761765105649829 |
| }, |
| { |
| "epoch": 0.7806342653405892, |
| "grad_norm": 2.90625, |
| "learning_rate": 2.4144144144144142e-05, |
| "loss": 0.8694, |
| "mean_token_accuracy": 0.8296161741018295, |
| "step": 1040, |
| "train/kl_loss_qwen": 0.03973756255581975, |
| "train/kl_loss_r1": 0.024160212790593504, |
| "train/total_kl": 0.06389777567237616 |
| }, |
| { |
| "epoch": 0.7843873146931882, |
| "grad_norm": 2.921875, |
| "learning_rate": 2.411599099099099e-05, |
| "loss": 0.8216, |
| "mean_token_accuracy": 0.8333493113517761, |
| "step": 1045, |
| "train/kl_loss_qwen": 0.03772520553320646, |
| "train/kl_loss_r1": 0.02065104469656944, |
| "train/total_kl": 0.058376249857246876 |
| }, |
| { |
| "epoch": 0.7881403640457872, |
| "grad_norm": 2.453125, |
| "learning_rate": 2.4087837837837837e-05, |
| "loss": 0.8294, |
| "mean_token_accuracy": 0.8262384831905365, |
| "step": 1050, |
| "train/kl_loss_qwen": 0.02664393503218889, |
| "train/kl_loss_r1": 0.015917970752343535, |
| "train/total_kl": 0.042561905831098555 |
| }, |
| { |
| "epoch": 0.7918934133983861, |
| "grad_norm": 3.296875, |
| "learning_rate": 2.4059684684684686e-05, |
| "loss": 0.8482, |
| "mean_token_accuracy": 0.8259186387062073, |
| "step": 1055, |
| "train/kl_loss_qwen": 0.03414301257580519, |
| "train/kl_loss_r1": 0.017920766165480016, |
| "train/total_kl": 0.05206377934664488 |
| }, |
| { |
| "epoch": 0.7956464627509852, |
| "grad_norm": 2.671875, |
| "learning_rate": 2.403153153153153e-05, |
| "loss": 0.8289, |
| "mean_token_accuracy": 0.838726419210434, |
| "step": 1060, |
| "train/kl_loss_qwen": 0.03791197570972145, |
| "train/kl_loss_r1": 0.021482381178066133, |
| "train/total_kl": 0.05939435651525855 |
| }, |
| { |
| "epoch": 0.7993995121035842, |
| "grad_norm": 3.171875, |
| "learning_rate": 2.4003378378378377e-05, |
| "loss": 0.8884, |
| "mean_token_accuracy": 0.8271274447441102, |
| "step": 1065, |
| "train/kl_loss_qwen": 0.03056891239248216, |
| "train/kl_loss_r1": 0.01911116614937782, |
| "train/total_kl": 0.04968007821589708 |
| }, |
| { |
| "epoch": 0.8031525614561832, |
| "grad_norm": 2.921875, |
| "learning_rate": 2.3975225225225226e-05, |
| "loss": 0.8351, |
| "mean_token_accuracy": 0.8275138199329376, |
| "step": 1070, |
| "train/kl_loss_qwen": 0.035620299214497206, |
| "train/kl_loss_r1": 0.021603919705376028, |
| "train/total_kl": 0.05722421947866678 |
| }, |
| { |
| "epoch": 0.8069056108087821, |
| "grad_norm": 3.03125, |
| "learning_rate": 2.394707207207207e-05, |
| "loss": 0.8298, |
| "mean_token_accuracy": 0.8347616285085678, |
| "step": 1075, |
| "train/kl_loss_qwen": 0.031926875654608014, |
| "train/kl_loss_r1": 0.016605067253112792, |
| "train/total_kl": 0.04853194262832403 |
| }, |
| { |
| "epoch": 0.8106586601613811, |
| "grad_norm": 2.359375, |
| "learning_rate": 2.3918918918918917e-05, |
| "loss": 0.8397, |
| "mean_token_accuracy": 0.8279544532299041, |
| "step": 1080, |
| "train/kl_loss_qwen": 0.04034261181950569, |
| "train/kl_loss_r1": 0.02037807977758348, |
| "train/total_kl": 0.060720691550523044 |
| }, |
| { |
| "epoch": 0.8144117095139801, |
| "grad_norm": 2.3125, |
| "learning_rate": 2.3890765765765766e-05, |
| "loss": 0.8468, |
| "mean_token_accuracy": 0.8316547304391861, |
| "step": 1085, |
| "train/kl_loss_qwen": 0.03774885032325983, |
| "train/kl_loss_r1": 0.02168757957406342, |
| "train/total_kl": 0.05943643022328615 |
| }, |
| { |
| "epoch": 0.8181647588665791, |
| "grad_norm": 2.703125, |
| "learning_rate": 2.3862612612612612e-05, |
| "loss": 0.8521, |
| "mean_token_accuracy": 0.8355390518903733, |
| "step": 1090, |
| "train/kl_loss_qwen": 0.04074263079091907, |
| "train/kl_loss_r1": 0.026646536123007537, |
| "train/total_kl": 0.06738916672766208 |
| }, |
| { |
| "epoch": 0.821917808219178, |
| "grad_norm": 2.515625, |
| "learning_rate": 2.3834459459459458e-05, |
| "loss": 0.8081, |
| "mean_token_accuracy": 0.8374006003141403, |
| "step": 1095, |
| "train/kl_loss_qwen": 0.039536877814680335, |
| "train/kl_loss_r1": 0.020507675549015402, |
| "train/total_kl": 0.06004455294460058 |
| }, |
| { |
| "epoch": 0.825670857571777, |
| "grad_norm": 2.75, |
| "learning_rate": 2.3806306306306307e-05, |
| "loss": 0.8105, |
| "mean_token_accuracy": 0.8264969110488891, |
| "step": 1100, |
| "train/kl_loss_qwen": 0.02953154994174838, |
| "train/kl_loss_r1": 0.01727639720775187, |
| "train/total_kl": 0.04680794747546315 |
| }, |
| { |
| "epoch": 0.8294239069243761, |
| "grad_norm": 2.65625, |
| "learning_rate": 2.3778153153153152e-05, |
| "loss": 0.8292, |
| "mean_token_accuracy": 0.8362700045108795, |
| "step": 1105, |
| "train/kl_loss_qwen": 0.03479915303178131, |
| "train/kl_loss_r1": 0.019686942035332323, |
| "train/total_kl": 0.05448609506711364 |
| }, |
| { |
| "epoch": 0.8331769562769751, |
| "grad_norm": 2.328125, |
| "learning_rate": 2.3749999999999998e-05, |
| "loss": 0.837, |
| "mean_token_accuracy": 0.8312906265258789, |
| "step": 1110, |
| "train/kl_loss_qwen": 0.03711622627452016, |
| "train/kl_loss_r1": 0.018471188424155117, |
| "train/total_kl": 0.05558741446584463 |
| }, |
| { |
| "epoch": 0.836930005629574, |
| "grad_norm": 3.078125, |
| "learning_rate": 2.3721846846846847e-05, |
| "loss": 0.8358, |
| "mean_token_accuracy": 0.8428857564926148, |
| "step": 1115, |
| "train/kl_loss_qwen": 0.03528237966820598, |
| "train/kl_loss_r1": 0.022303265007212757, |
| "train/total_kl": 0.057585643604397774 |
| }, |
| { |
| "epoch": 0.840683054982173, |
| "grad_norm": 2.59375, |
| "learning_rate": 2.3693693693693693e-05, |
| "loss": 0.8258, |
| "mean_token_accuracy": 0.8349006563425064, |
| "step": 1120, |
| "train/kl_loss_qwen": 0.029668423300608992, |
| "train/kl_loss_r1": 0.01802798630669713, |
| "train/total_kl": 0.04769640956073999 |
| }, |
| { |
| "epoch": 0.844436104334772, |
| "grad_norm": 2.546875, |
| "learning_rate": 2.366554054054054e-05, |
| "loss": 0.7961, |
| "mean_token_accuracy": 0.8291519403457641, |
| "step": 1125, |
| "train/kl_loss_qwen": 0.027171618398278953, |
| "train/kl_loss_r1": 0.015590772125869989, |
| "train/total_kl": 0.042762390524148944 |
| }, |
| { |
| "epoch": 0.848189153687371, |
| "grad_norm": 3.0, |
| "learning_rate": 2.3637387387387387e-05, |
| "loss": 0.852, |
| "mean_token_accuracy": 0.830912035703659, |
| "step": 1130, |
| "train/kl_loss_qwen": 0.04168254970572889, |
| "train/kl_loss_r1": 0.0218337316531688, |
| "train/total_kl": 0.0635162808932364 |
| }, |
| { |
| "epoch": 0.8519422030399699, |
| "grad_norm": 2.75, |
| "learning_rate": 2.3609234234234233e-05, |
| "loss": 0.834, |
| "mean_token_accuracy": 0.8422968804836273, |
| "step": 1135, |
| "train/kl_loss_qwen": 0.042828111443668604, |
| "train/kl_loss_r1": 0.02287350078113377, |
| "train/total_kl": 0.06570161217823625 |
| }, |
| { |
| "epoch": 0.8556952523925689, |
| "grad_norm": 2.390625, |
| "learning_rate": 2.3581081081081082e-05, |
| "loss": 0.8122, |
| "mean_token_accuracy": 0.8383320599794388, |
| "step": 1140, |
| "train/kl_loss_qwen": 0.03400104306638241, |
| "train/kl_loss_r1": 0.01821983396075666, |
| "train/total_kl": 0.052220877725631 |
| }, |
| { |
| "epoch": 0.859448301745168, |
| "grad_norm": 3.125, |
| "learning_rate": 2.3552927927927928e-05, |
| "loss": 0.8689, |
| "mean_token_accuracy": 0.8325030654668808, |
| "step": 1145, |
| "train/kl_loss_qwen": 0.03720735446549952, |
| "train/kl_loss_r1": 0.02309025633148849, |
| "train/total_kl": 0.06029761079698801 |
| }, |
| { |
| "epoch": 0.863201351097767, |
| "grad_norm": 2.75, |
| "learning_rate": 2.3524774774774773e-05, |
| "loss": 0.8117, |
| "mean_token_accuracy": 0.8363292634487152, |
| "step": 1150, |
| "train/kl_loss_qwen": 0.027145140524953603, |
| "train/kl_loss_r1": 0.0179155798163265, |
| "train/total_kl": 0.045060720574110744 |
| }, |
| { |
| "epoch": 0.8669544004503659, |
| "grad_norm": 2.484375, |
| "learning_rate": 2.3496621621621622e-05, |
| "loss": 0.8169, |
| "mean_token_accuracy": 0.82942895591259, |
| "step": 1155, |
| "train/kl_loss_qwen": 0.035767897684127095, |
| "train/kl_loss_r1": 0.018540003104135394, |
| "train/total_kl": 0.05430790157988667 |
| }, |
| { |
| "epoch": 0.8707074498029649, |
| "grad_norm": 3.28125, |
| "learning_rate": 2.3468468468468468e-05, |
| "loss": 0.8544, |
| "mean_token_accuracy": 0.8344474166631699, |
| "step": 1160, |
| "train/kl_loss_qwen": 0.02330155437812209, |
| "train/kl_loss_r1": 0.01555751208215952, |
| "train/total_kl": 0.03885906646028161 |
| }, |
| { |
| "epoch": 0.8744604991555639, |
| "grad_norm": 2.96875, |
| "learning_rate": 2.3440315315315314e-05, |
| "loss": 0.8497, |
| "mean_token_accuracy": 0.8371790736913681, |
| "step": 1165, |
| "train/kl_loss_qwen": 0.0372356269042939, |
| "train/kl_loss_r1": 0.021653581224381924, |
| "train/total_kl": 0.05888920854777098 |
| }, |
| { |
| "epoch": 0.8782135485081629, |
| "grad_norm": 2.875, |
| "learning_rate": 2.3412162162162163e-05, |
| "loss": 0.8466, |
| "mean_token_accuracy": 0.8342229664325714, |
| "step": 1170, |
| "train/kl_loss_qwen": 0.03358095684088767, |
| "train/kl_loss_r1": 0.020644054701551794, |
| "train/total_kl": 0.05422501126304269 |
| }, |
| { |
| "epoch": 0.8819665978607618, |
| "grad_norm": 2.828125, |
| "learning_rate": 2.3384009009009008e-05, |
| "loss": 0.8188, |
| "mean_token_accuracy": 0.8325002133846283, |
| "step": 1175, |
| "train/kl_loss_qwen": 0.03786291694268584, |
| "train/kl_loss_r1": 0.02114827521145344, |
| "train/total_kl": 0.059011191688477994 |
| }, |
| { |
| "epoch": 0.8857196472133608, |
| "grad_norm": 4.125, |
| "learning_rate": 2.3355855855855854e-05, |
| "loss": 0.8304, |
| "mean_token_accuracy": 0.841512930393219, |
| "step": 1180, |
| "train/kl_loss_qwen": 0.0327130098361522, |
| "train/kl_loss_r1": 0.02275611348450184, |
| "train/total_kl": 0.055469123367220166 |
| }, |
| { |
| "epoch": 0.8894726965659598, |
| "grad_norm": 2.96875, |
| "learning_rate": 2.3327702702702703e-05, |
| "loss": 0.8149, |
| "mean_token_accuracy": 0.8311474174261093, |
| "step": 1185, |
| "train/kl_loss_qwen": 0.03829748397693038, |
| "train/kl_loss_r1": 0.019338054629042745, |
| "train/total_kl": 0.057635538000613454 |
| }, |
| { |
| "epoch": 0.8932257459185589, |
| "grad_norm": 2.78125, |
| "learning_rate": 2.329954954954955e-05, |
| "loss": 0.8207, |
| "mean_token_accuracy": 0.8371186286211014, |
| "step": 1190, |
| "train/kl_loss_qwen": 0.028101760940626264, |
| "train/kl_loss_r1": 0.018852828070521355, |
| "train/total_kl": 0.04695458877831697 |
| }, |
| { |
| "epoch": 0.8969787952711579, |
| "grad_norm": 3.15625, |
| "learning_rate": 2.3271396396396398e-05, |
| "loss": 0.8371, |
| "mean_token_accuracy": 0.8242538809776306, |
| "step": 1195, |
| "train/kl_loss_qwen": 0.029373879032209515, |
| "train/kl_loss_r1": 0.01833240082487464, |
| "train/total_kl": 0.047706279531121255 |
| }, |
| { |
| "epoch": 0.9007318446237568, |
| "grad_norm": 2.9375, |
| "learning_rate": 2.3243243243243243e-05, |
| "loss": 0.8312, |
| "mean_token_accuracy": 0.8366263926029205, |
| "step": 1200, |
| "train/kl_loss_qwen": 0.03641695664264262, |
| "train/kl_loss_r1": 0.02135463636368513, |
| "train/total_kl": 0.0577715927734971 |
| }, |
| { |
| "epoch": 0.9044848939763558, |
| "grad_norm": 2.5625, |
| "learning_rate": 2.321509009009009e-05, |
| "loss": 0.8032, |
| "mean_token_accuracy": 0.8358108222484588, |
| "step": 1205, |
| "train/kl_loss_qwen": 0.0320419798605144, |
| "train/kl_loss_r1": 0.01758174179121852, |
| "train/total_kl": 0.04962372137233615 |
| }, |
| { |
| "epoch": 0.9082379433289548, |
| "grad_norm": 3.59375, |
| "learning_rate": 2.3186936936936938e-05, |
| "loss": 0.7973, |
| "mean_token_accuracy": 0.8385109961032867, |
| "step": 1210, |
| "train/kl_loss_qwen": 0.03202076843008399, |
| "train/kl_loss_r1": 0.01798680922947824, |
| "train/total_kl": 0.050007577519863844 |
| }, |
| { |
| "epoch": 0.9119909926815538, |
| "grad_norm": 2.578125, |
| "learning_rate": 2.3158783783783784e-05, |
| "loss": 0.8757, |
| "mean_token_accuracy": 0.8319016844034195, |
| "step": 1215, |
| "train/kl_loss_qwen": 0.04137561381794512, |
| "train/kl_loss_r1": 0.023255357798188925, |
| "train/total_kl": 0.06463097166270018 |
| }, |
| { |
| "epoch": 0.9157440420341527, |
| "grad_norm": 2.828125, |
| "learning_rate": 2.313063063063063e-05, |
| "loss": 0.8132, |
| "mean_token_accuracy": 0.8328036278486252, |
| "step": 1220, |
| "train/kl_loss_qwen": 0.031224201945587993, |
| "train/kl_loss_r1": 0.017740114778280257, |
| "train/total_kl": 0.048964316584169866 |
| }, |
| { |
| "epoch": 0.9194970913867517, |
| "grad_norm": 2.875, |
| "learning_rate": 2.3102477477477478e-05, |
| "loss": 0.8452, |
| "mean_token_accuracy": 0.8222734242677688, |
| "step": 1225, |
| "train/kl_loss_qwen": 0.03589702369645238, |
| "train/kl_loss_r1": 0.020375803485512732, |
| "train/total_kl": 0.056272826995700596 |
| }, |
| { |
| "epoch": 0.9232501407393507, |
| "grad_norm": 2.65625, |
| "learning_rate": 2.3074324324324324e-05, |
| "loss": 0.7888, |
| "mean_token_accuracy": 0.8423387587070466, |
| "step": 1230, |
| "train/kl_loss_qwen": 0.03705872604623437, |
| "train/kl_loss_r1": 0.019338483829051255, |
| "train/total_kl": 0.056397209968417884 |
| }, |
| { |
| "epoch": 0.9270031900919498, |
| "grad_norm": 3.3125, |
| "learning_rate": 2.304617117117117e-05, |
| "loss": 0.8411, |
| "mean_token_accuracy": 0.8356304496526719, |
| "step": 1235, |
| "train/kl_loss_qwen": 0.03986716889776289, |
| "train/kl_loss_r1": 0.02119326703250408, |
| "train/total_kl": 0.06106043700128794 |
| }, |
| { |
| "epoch": 0.9307562394445487, |
| "grad_norm": 3.046875, |
| "learning_rate": 2.301801801801802e-05, |
| "loss": 0.8016, |
| "mean_token_accuracy": 0.8259847193956376, |
| "step": 1240, |
| "train/kl_loss_qwen": 0.027377781691029668, |
| "train/kl_loss_r1": 0.01647510756738484, |
| "train/total_kl": 0.04385288907214999 |
| }, |
| { |
| "epoch": 0.9345092887971477, |
| "grad_norm": 2.8125, |
| "learning_rate": 2.2989864864864864e-05, |
| "loss": 0.8702, |
| "mean_token_accuracy": 0.8325085520744324, |
| "step": 1245, |
| "train/kl_loss_qwen": 0.05099722160957754, |
| "train/kl_loss_r1": 0.02356436108238995, |
| "train/total_kl": 0.07456158371642232 |
| }, |
| { |
| "epoch": 0.9382623381497467, |
| "grad_norm": 3.25, |
| "learning_rate": 2.296171171171171e-05, |
| "loss": 0.8179, |
| "mean_token_accuracy": 0.8388288825750351, |
| "step": 1250, |
| "train/kl_loss_qwen": 0.03349912976846099, |
| "train/kl_loss_r1": 0.01905625034123659, |
| "train/total_kl": 0.052555380016565324 |
| }, |
| { |
| "epoch": 0.9420153875023457, |
| "grad_norm": 3.21875, |
| "learning_rate": 2.293355855855856e-05, |
| "loss": 0.8161, |
| "mean_token_accuracy": 0.8253986924886704, |
| "step": 1255, |
| "train/kl_loss_qwen": 0.024113674974069, |
| "train/kl_loss_r1": 0.013607281818985939, |
| "train/total_kl": 0.03772095674648881 |
| }, |
| { |
| "epoch": 0.9457684368549446, |
| "grad_norm": 2.703125, |
| "learning_rate": 2.2905405405405404e-05, |
| "loss": 0.8313, |
| "mean_token_accuracy": 0.8335436224937439, |
| "step": 1260, |
| "train/kl_loss_qwen": 0.03843146739527583, |
| "train/kl_loss_r1": 0.02215869203209877, |
| "train/total_kl": 0.060590160079300404 |
| }, |
| { |
| "epoch": 0.9495214862075436, |
| "grad_norm": 2.828125, |
| "learning_rate": 2.2877252252252254e-05, |
| "loss": 0.8403, |
| "mean_token_accuracy": 0.8326504826545715, |
| "step": 1265, |
| "train/kl_loss_qwen": 0.03150986786931753, |
| "train/kl_loss_r1": 0.01924733123742044, |
| "train/total_kl": 0.05075719943270087 |
| }, |
| { |
| "epoch": 0.9532745355601426, |
| "grad_norm": 2.921875, |
| "learning_rate": 2.28490990990991e-05, |
| "loss": 0.8271, |
| "mean_token_accuracy": 0.8375171661376953, |
| "step": 1270, |
| "train/kl_loss_qwen": 0.030000514769926667, |
| "train/kl_loss_r1": 0.018503088131546976, |
| "train/total_kl": 0.048503602668642995 |
| }, |
| { |
| "epoch": 0.9570275849127416, |
| "grad_norm": 3.0625, |
| "learning_rate": 2.2820945945945945e-05, |
| "loss": 0.8126, |
| "mean_token_accuracy": 0.8422433704137802, |
| "step": 1275, |
| "train/kl_loss_qwen": 0.03523530634120107, |
| "train/kl_loss_r1": 0.02015956537798047, |
| "train/total_kl": 0.0553948718123138 |
| }, |
| { |
| "epoch": 0.9607806342653405, |
| "grad_norm": 3.0, |
| "learning_rate": 2.2792792792792794e-05, |
| "loss": 0.8471, |
| "mean_token_accuracy": 0.8248061776161194, |
| "step": 1280, |
| "train/kl_loss_qwen": 0.03546197758987546, |
| "train/kl_loss_r1": 0.02050988646224141, |
| "train/total_kl": 0.05597186395898461 |
| }, |
| { |
| "epoch": 0.9645336836179396, |
| "grad_norm": 2.453125, |
| "learning_rate": 2.276463963963964e-05, |
| "loss": 0.8506, |
| "mean_token_accuracy": 0.830131858587265, |
| "step": 1285, |
| "train/kl_loss_qwen": 0.03869068971835077, |
| "train/kl_loss_r1": 0.021196600608527662, |
| "train/total_kl": 0.05988728990778327 |
| }, |
| { |
| "epoch": 0.9682867329705386, |
| "grad_norm": 2.796875, |
| "learning_rate": 2.2736486486486485e-05, |
| "loss": 0.8122, |
| "mean_token_accuracy": 0.8425075203180313, |
| "step": 1290, |
| "train/kl_loss_qwen": 0.03583333105780184, |
| "train/kl_loss_r1": 0.019750054739415646, |
| "train/total_kl": 0.055583386402577165 |
| }, |
| { |
| "epoch": 0.9720397823231376, |
| "grad_norm": 2.40625, |
| "learning_rate": 2.2708333333333334e-05, |
| "loss": 0.8526, |
| "mean_token_accuracy": 0.8319555759429932, |
| "step": 1295, |
| "train/kl_loss_qwen": 0.03495143475010991, |
| "train/kl_loss_r1": 0.019579170271754265, |
| "train/total_kl": 0.05453060502186417 |
| }, |
| { |
| "epoch": 0.9757928316757365, |
| "grad_norm": 2.5, |
| "learning_rate": 2.268018018018018e-05, |
| "loss": 0.83, |
| "mean_token_accuracy": 0.8411010265350342, |
| "step": 1300, |
| "train/kl_loss_qwen": 0.029418424377217887, |
| "train/kl_loss_r1": 0.017907896358519793, |
| "train/total_kl": 0.047326320223510264 |
| }, |
| { |
| "epoch": 0.9795458810283355, |
| "grad_norm": 3.046875, |
| "learning_rate": 2.2652027027027025e-05, |
| "loss": 0.8317, |
| "mean_token_accuracy": 0.8266431212425231, |
| "step": 1305, |
| "train/kl_loss_qwen": 0.03617473733611405, |
| "train/kl_loss_r1": 0.0198312777094543, |
| "train/total_kl": 0.056006014347076416 |
| }, |
| { |
| "epoch": 0.9832989303809345, |
| "grad_norm": 2.734375, |
| "learning_rate": 2.2623873873873874e-05, |
| "loss": 0.8109, |
| "mean_token_accuracy": 0.8358199536800385, |
| "step": 1310, |
| "train/kl_loss_qwen": 0.03416325659491122, |
| "train/kl_loss_r1": 0.018369485950097443, |
| "train/total_kl": 0.05253274226561189 |
| }, |
| { |
| "epoch": 0.9870519797335335, |
| "grad_norm": 3.09375, |
| "learning_rate": 2.259572072072072e-05, |
| "loss": 0.8502, |
| "mean_token_accuracy": 0.8319712281227112, |
| "step": 1315, |
| "train/kl_loss_qwen": 0.03371428037062287, |
| "train/kl_loss_r1": 0.019540566531941295, |
| "train/total_kl": 0.0532548469491303 |
| }, |
| { |
| "epoch": 0.9908050290861324, |
| "grad_norm": 2.953125, |
| "learning_rate": 2.2567567567567566e-05, |
| "loss": 0.826, |
| "mean_token_accuracy": 0.8343572169542313, |
| "step": 1320, |
| "train/kl_loss_qwen": 0.034188579255715015, |
| "train/kl_loss_r1": 0.019030718505382536, |
| "train/total_kl": 0.05321929762139917 |
| }, |
| { |
| "epoch": 0.9945580784387315, |
| "grad_norm": 3.46875, |
| "learning_rate": 2.2539414414414415e-05, |
| "loss": 0.8328, |
| "mean_token_accuracy": 0.831291139125824, |
| "step": 1325, |
| "train/kl_loss_qwen": 0.024976221797987818, |
| "train/kl_loss_r1": 0.015955081582069396, |
| "train/total_kl": 0.04093130342662334 |
| }, |
| { |
| "epoch": 0.9983111277913305, |
| "grad_norm": 2.890625, |
| "learning_rate": 2.251126126126126e-05, |
| "loss": 0.8427, |
| "mean_token_accuracy": 0.8302747309207916, |
| "step": 1330, |
| "train/kl_loss_qwen": 0.03359804740175605, |
| "train/kl_loss_r1": 0.02121321321465075, |
| "train/total_kl": 0.05481126047670841 |
| }, |
| { |
| "epoch": 1.0015012197410396, |
| "grad_norm": 2.703125, |
| "learning_rate": 2.248310810810811e-05, |
| "loss": 0.7675, |
| "mean_token_accuracy": 0.8538059802616343, |
| "step": 1335, |
| "train/kl_loss_qwen": 0.0453791821594624, |
| "train/kl_loss_r1": 0.02448737363824073, |
| "train/total_kl": 0.06986655568813577 |
| }, |
| { |
| "epoch": 1.0052542690936386, |
| "grad_norm": 2.71875, |
| "learning_rate": 2.2454954954954955e-05, |
| "loss": 0.6612, |
| "mean_token_accuracy": 0.8875813186168671, |
| "step": 1340, |
| "train/kl_loss_qwen": 0.02925686431117356, |
| "train/kl_loss_r1": 0.019410110637545587, |
| "train/total_kl": 0.04866697527468204 |
| }, |
| { |
| "epoch": 1.0090073184462376, |
| "grad_norm": 2.375, |
| "learning_rate": 2.24268018018018e-05, |
| "loss": 0.6622, |
| "mean_token_accuracy": 0.8967875897884369, |
| "step": 1345, |
| "train/kl_loss_qwen": 0.04325410588644445, |
| "train/kl_loss_r1": 0.0244607200846076, |
| "train/total_kl": 0.0677148257382214 |
| }, |
| { |
| "epoch": 1.0127603677988366, |
| "grad_norm": 2.640625, |
| "learning_rate": 2.239864864864865e-05, |
| "loss": 0.6685, |
| "mean_token_accuracy": 0.8972615629434586, |
| "step": 1350, |
| "train/kl_loss_qwen": 0.041626747231930494, |
| "train/kl_loss_r1": 0.025661862408742308, |
| "train/total_kl": 0.06728860987350345 |
| }, |
| { |
| "epoch": 1.0165134171514356, |
| "grad_norm": 2.53125, |
| "learning_rate": 2.2370495495495495e-05, |
| "loss": 0.6689, |
| "mean_token_accuracy": 0.8906102359294892, |
| "step": 1355, |
| "train/kl_loss_qwen": 0.030312799476087095, |
| "train/kl_loss_r1": 0.020159751269966365, |
| "train/total_kl": 0.0504725506529212 |
| }, |
| { |
| "epoch": 1.0202664665040346, |
| "grad_norm": 2.890625, |
| "learning_rate": 2.234234234234234e-05, |
| "loss": 0.6708, |
| "mean_token_accuracy": 0.8942165911197663, |
| "step": 1360, |
| "train/kl_loss_qwen": 0.034392226580530406, |
| "train/kl_loss_r1": 0.023348680092021824, |
| "train/total_kl": 0.0577409066259861 |
| }, |
| { |
| "epoch": 1.0240195158566334, |
| "grad_norm": 2.703125, |
| "learning_rate": 2.231418918918919e-05, |
| "loss": 0.7386, |
| "mean_token_accuracy": 0.8926682651042939, |
| "step": 1365, |
| "train/kl_loss_qwen": 0.0506584744900465, |
| "train/kl_loss_r1": 0.02938733692280948, |
| "train/total_kl": 0.08004581211134791 |
| }, |
| { |
| "epoch": 1.0277725652092324, |
| "grad_norm": 2.1875, |
| "learning_rate": 2.2286036036036036e-05, |
| "loss": 0.6889, |
| "mean_token_accuracy": 0.8908026158809662, |
| "step": 1370, |
| "train/kl_loss_qwen": 0.03609044030308724, |
| "train/kl_loss_r1": 0.0206457391846925, |
| "train/total_kl": 0.056736179534345864 |
| }, |
| { |
| "epoch": 1.0315256145618314, |
| "grad_norm": 2.546875, |
| "learning_rate": 2.225788288288288e-05, |
| "loss": 0.6504, |
| "mean_token_accuracy": 0.897967740893364, |
| "step": 1375, |
| "train/kl_loss_qwen": 0.038501370791345836, |
| "train/kl_loss_r1": 0.022604670422151685, |
| "train/total_kl": 0.06110604116693139 |
| }, |
| { |
| "epoch": 1.0352786639144305, |
| "grad_norm": 2.171875, |
| "learning_rate": 2.222972972972973e-05, |
| "loss": 0.6676, |
| "mean_token_accuracy": 0.8930170625448227, |
| "step": 1380, |
| "train/kl_loss_qwen": 0.03824372082017362, |
| "train/kl_loss_r1": 0.022439042571932077, |
| "train/total_kl": 0.0606827630661428 |
| }, |
| { |
| "epoch": 1.0390317132670295, |
| "grad_norm": 2.625, |
| "learning_rate": 2.2201576576576576e-05, |
| "loss": 0.68, |
| "mean_token_accuracy": 0.8910626381635666, |
| "step": 1385, |
| "train/kl_loss_qwen": 0.0364824044983834, |
| "train/kl_loss_r1": 0.021984179178252815, |
| "train/total_kl": 0.058466583304107186 |
| }, |
| { |
| "epoch": 1.0427847626196285, |
| "grad_norm": 2.625, |
| "learning_rate": 2.2173423423423425e-05, |
| "loss": 0.6406, |
| "mean_token_accuracy": 0.9029591172933579, |
| "step": 1390, |
| "train/kl_loss_qwen": 0.040588710876181724, |
| "train/kl_loss_r1": 0.02504544616676867, |
| "train/total_kl": 0.06563415694981814 |
| }, |
| { |
| "epoch": 1.0465378119722275, |
| "grad_norm": 2.5, |
| "learning_rate": 2.214527027027027e-05, |
| "loss": 0.5936, |
| "mean_token_accuracy": 0.9015870213508606, |
| "step": 1395, |
| "train/kl_loss_qwen": 0.03233385533094406, |
| "train/kl_loss_r1": 0.01939639528281987, |
| "train/total_kl": 0.0517302505671978 |
| }, |
| { |
| "epoch": 1.0502908613248265, |
| "grad_norm": 2.4375, |
| "learning_rate": 2.2117117117117116e-05, |
| "loss": 0.6685, |
| "mean_token_accuracy": 0.8904843509197236, |
| "step": 1400, |
| "train/kl_loss_qwen": 0.03684836062602699, |
| "train/kl_loss_r1": 0.022537825303152202, |
| "train/total_kl": 0.059386185463517906 |
| }, |
| { |
| "epoch": 1.0540439106774253, |
| "grad_norm": 2.859375, |
| "learning_rate": 2.2088963963963965e-05, |
| "loss": 0.6683, |
| "mean_token_accuracy": 0.8937689036130905, |
| "step": 1405, |
| "train/kl_loss_qwen": 0.03806398524902761, |
| "train/kl_loss_r1": 0.022129832254722714, |
| "train/total_kl": 0.06019381750375032 |
| }, |
| { |
| "epoch": 1.0577969600300243, |
| "grad_norm": 2.890625, |
| "learning_rate": 2.206081081081081e-05, |
| "loss": 0.6935, |
| "mean_token_accuracy": 0.8934850037097931, |
| "step": 1410, |
| "train/kl_loss_qwen": 0.04057308458723128, |
| "train/kl_loss_r1": 0.026647206209599972, |
| "train/total_kl": 0.06722028991207481 |
| }, |
| { |
| "epoch": 1.0615500093826233, |
| "grad_norm": 3.40625, |
| "learning_rate": 2.2032657657657657e-05, |
| "loss": 0.7189, |
| "mean_token_accuracy": 0.8990837901830673, |
| "step": 1415, |
| "train/kl_loss_qwen": 0.0509747623000294, |
| "train/kl_loss_r1": 0.028807251481339335, |
| "train/total_kl": 0.07978201508522034 |
| }, |
| { |
| "epoch": 1.0653030587352224, |
| "grad_norm": 3.203125, |
| "learning_rate": 2.2004504504504506e-05, |
| "loss": 0.6548, |
| "mean_token_accuracy": 0.8912235021591186, |
| "step": 1420, |
| "train/kl_loss_qwen": 0.03229280970990658, |
| "train/kl_loss_r1": 0.020080786664038897, |
| "train/total_kl": 0.05237359646707773 |
| }, |
| { |
| "epoch": 1.0690561080878214, |
| "grad_norm": 2.0, |
| "learning_rate": 2.197635135135135e-05, |
| "loss": 0.6596, |
| "mean_token_accuracy": 0.8960457772016526, |
| "step": 1425, |
| "train/kl_loss_qwen": 0.0408114202786237, |
| "train/kl_loss_r1": 0.022259290888905527, |
| "train/total_kl": 0.06307071102783084 |
| }, |
| { |
| "epoch": 1.0728091574404204, |
| "grad_norm": 2.734375, |
| "learning_rate": 2.1948198198198197e-05, |
| "loss": 0.6918, |
| "mean_token_accuracy": 0.8915483593940735, |
| "step": 1430, |
| "train/kl_loss_qwen": 0.04138145474717021, |
| "train/kl_loss_r1": 0.02470776312984526, |
| "train/total_kl": 0.06608921755105257 |
| }, |
| { |
| "epoch": 1.0765622067930194, |
| "grad_norm": 2.546875, |
| "learning_rate": 2.1920045045045046e-05, |
| "loss": 0.6872, |
| "mean_token_accuracy": 0.8949816524982452, |
| "step": 1435, |
| "train/kl_loss_qwen": 0.04295819364488125, |
| "train/kl_loss_r1": 0.02569909901358187, |
| "train/total_kl": 0.06865729233250022 |
| }, |
| { |
| "epoch": 1.0803152561456184, |
| "grad_norm": 2.84375, |
| "learning_rate": 2.1891891891891892e-05, |
| "loss": 0.7196, |
| "mean_token_accuracy": 0.8875626802444458, |
| "step": 1440, |
| "train/kl_loss_qwen": 0.04375511151738465, |
| "train/kl_loss_r1": 0.025596009753644466, |
| "train/total_kl": 0.06935112103819847 |
| }, |
| { |
| "epoch": 1.0840683054982172, |
| "grad_norm": 2.484375, |
| "learning_rate": 2.1863738738738737e-05, |
| "loss": 0.6622, |
| "mean_token_accuracy": 0.893270394206047, |
| "step": 1445, |
| "train/kl_loss_qwen": 0.03457060917280615, |
| "train/kl_loss_r1": 0.020614350261166692, |
| "train/total_kl": 0.055184959154576066 |
| }, |
| { |
| "epoch": 1.0878213548508162, |
| "grad_norm": 2.421875, |
| "learning_rate": 2.1835585585585586e-05, |
| "loss": 0.604, |
| "mean_token_accuracy": 0.9012135595083237, |
| "step": 1450, |
| "train/kl_loss_qwen": 0.03251136806793511, |
| "train/kl_loss_r1": 0.019424339337274433, |
| "train/total_kl": 0.051935707405209544 |
| }, |
| { |
| "epoch": 1.0915744042034152, |
| "grad_norm": 2.3125, |
| "learning_rate": 2.1807432432432432e-05, |
| "loss": 0.7123, |
| "mean_token_accuracy": 0.8986908882856369, |
| "step": 1455, |
| "train/kl_loss_qwen": 0.05085464362055063, |
| "train/kl_loss_r1": 0.028513824706897138, |
| "train/total_kl": 0.07936846744269133 |
| }, |
| { |
| "epoch": 1.0953274535560142, |
| "grad_norm": 2.328125, |
| "learning_rate": 2.177927927927928e-05, |
| "loss": 0.6291, |
| "mean_token_accuracy": 0.8938940465450287, |
| "step": 1460, |
| "train/kl_loss_qwen": 0.0365486825350672, |
| "train/kl_loss_r1": 0.020992783037945627, |
| "train/total_kl": 0.057541465666145084 |
| }, |
| { |
| "epoch": 1.0990805029086133, |
| "grad_norm": 2.234375, |
| "learning_rate": 2.1751126126126127e-05, |
| "loss": 0.6376, |
| "mean_token_accuracy": 0.8969442307949066, |
| "step": 1465, |
| "train/kl_loss_qwen": 0.03290966739878058, |
| "train/kl_loss_r1": 0.020104941399767994, |
| "train/total_kl": 0.053014608845114705 |
| }, |
| { |
| "epoch": 1.1028335522612123, |
| "grad_norm": 2.453125, |
| "learning_rate": 2.1722972972972972e-05, |
| "loss": 0.6432, |
| "mean_token_accuracy": 0.894056448340416, |
| "step": 1470, |
| "train/kl_loss_qwen": 0.03260161904618144, |
| "train/kl_loss_r1": 0.02036406025290489, |
| "train/total_kl": 0.052965679205954075 |
| }, |
| { |
| "epoch": 1.1065866016138113, |
| "grad_norm": 1.9765625, |
| "learning_rate": 2.169481981981982e-05, |
| "loss": 0.7049, |
| "mean_token_accuracy": 0.8975407749414444, |
| "step": 1475, |
| "train/kl_loss_qwen": 0.050286664813756946, |
| "train/kl_loss_r1": 0.02728750566020608, |
| "train/total_kl": 0.07757417084649205 |
| }, |
| { |
| "epoch": 1.1103396509664103, |
| "grad_norm": 2.71875, |
| "learning_rate": 2.1666666666666667e-05, |
| "loss": 0.6315, |
| "mean_token_accuracy": 0.9003421634435653, |
| "step": 1480, |
| "train/kl_loss_qwen": 0.03332536895759404, |
| "train/kl_loss_r1": 0.02332189753651619, |
| "train/total_kl": 0.05664726672694087 |
| }, |
| { |
| "epoch": 1.1140927003190093, |
| "grad_norm": 2.09375, |
| "learning_rate": 2.1638513513513513e-05, |
| "loss": 0.6516, |
| "mean_token_accuracy": 0.9011515021324158, |
| "step": 1485, |
| "train/kl_loss_qwen": 0.03897336809895933, |
| "train/kl_loss_r1": 0.021944570681080224, |
| "train/total_kl": 0.060917938873171804 |
| }, |
| { |
| "epoch": 1.117845749671608, |
| "grad_norm": 2.640625, |
| "learning_rate": 2.1610360360360362e-05, |
| "loss": 0.6724, |
| "mean_token_accuracy": 0.8921928942203522, |
| "step": 1490, |
| "train/kl_loss_qwen": 0.0333264619577676, |
| "train/kl_loss_r1": 0.02036203513853252, |
| "train/total_kl": 0.053688496444374324 |
| }, |
| { |
| "epoch": 1.1215987990242071, |
| "grad_norm": 2.6875, |
| "learning_rate": 2.1582207207207207e-05, |
| "loss": 0.6588, |
| "mean_token_accuracy": 0.8953865617513657, |
| "step": 1495, |
| "train/kl_loss_qwen": 0.03588013225235045, |
| "train/kl_loss_r1": 0.020809399196878076, |
| "train/total_kl": 0.0566895317286253 |
| }, |
| { |
| "epoch": 1.1253518483768061, |
| "grad_norm": 2.40625, |
| "learning_rate": 2.1554054054054053e-05, |
| "loss": 0.6007, |
| "mean_token_accuracy": 0.9045622408390045, |
| "step": 1500, |
| "train/kl_loss_qwen": 0.03217562069185078, |
| "train/kl_loss_r1": 0.019330057594925166, |
| "train/total_kl": 0.05150567796081305 |
| }, |
| { |
| "epoch": 1.1291048977294051, |
| "grad_norm": 2.28125, |
| "learning_rate": 2.1525900900900902e-05, |
| "loss": 0.6219, |
| "mean_token_accuracy": 0.9022328287363053, |
| "step": 1505, |
| "train/kl_loss_qwen": 0.03696062350645661, |
| "train/kl_loss_r1": 0.02114432412199676, |
| "train/total_kl": 0.05810494795441627 |
| }, |
| { |
| "epoch": 1.1328579470820042, |
| "grad_norm": 2.3125, |
| "learning_rate": 2.1497747747747748e-05, |
| "loss": 0.6643, |
| "mean_token_accuracy": 0.8981336444616318, |
| "step": 1510, |
| "train/kl_loss_qwen": 0.04067998202517629, |
| "train/kl_loss_r1": 0.024339890154078603, |
| "train/total_kl": 0.06501987269148231 |
| }, |
| { |
| "epoch": 1.1366109964346032, |
| "grad_norm": 2.59375, |
| "learning_rate": 2.1469594594594593e-05, |
| "loss": 0.6253, |
| "mean_token_accuracy": 0.9077253580093384, |
| "step": 1515, |
| "train/kl_loss_qwen": 0.03719198950566351, |
| "train/kl_loss_r1": 0.02381544355303049, |
| "train/total_kl": 0.0610074333846569 |
| }, |
| { |
| "epoch": 1.1403640457872022, |
| "grad_norm": 2.59375, |
| "learning_rate": 2.1441441441441442e-05, |
| "loss": 0.7558, |
| "mean_token_accuracy": 0.9028765827417373, |
| "step": 1520, |
| "train/kl_loss_qwen": 0.055122953513637184, |
| "train/kl_loss_r1": 0.03659365689381957, |
| "train/total_kl": 0.09171660989522934 |
| }, |
| { |
| "epoch": 1.144117095139801, |
| "grad_norm": 2.046875, |
| "learning_rate": 2.1413288288288288e-05, |
| "loss": 0.6401, |
| "mean_token_accuracy": 0.8968337863683701, |
| "step": 1525, |
| "train/kl_loss_qwen": 0.03610984361730516, |
| "train/kl_loss_r1": 0.020405574096366765, |
| "train/total_kl": 0.05651541752740741 |
| }, |
| { |
| "epoch": 1.1478701444924, |
| "grad_norm": 2.65625, |
| "learning_rate": 2.1385135135135137e-05, |
| "loss": 0.6556, |
| "mean_token_accuracy": 0.8919296562671661, |
| "step": 1530, |
| "train/kl_loss_qwen": 0.0327754978556186, |
| "train/kl_loss_r1": 0.021019916282966733, |
| "train/total_kl": 0.05379541488364339 |
| }, |
| { |
| "epoch": 1.151623193844999, |
| "grad_norm": 3.140625, |
| "learning_rate": 2.1356981981981983e-05, |
| "loss": 0.6184, |
| "mean_token_accuracy": 0.8987061321735382, |
| "step": 1535, |
| "train/kl_loss_qwen": 0.028856372553855182, |
| "train/kl_loss_r1": 0.020303833484649658, |
| "train/total_kl": 0.04916020501405001 |
| }, |
| { |
| "epoch": 1.155376243197598, |
| "grad_norm": 2.5, |
| "learning_rate": 2.1328828828828828e-05, |
| "loss": 0.6152, |
| "mean_token_accuracy": 0.8988528192043305, |
| "step": 1540, |
| "train/kl_loss_qwen": 0.03804198480211198, |
| "train/kl_loss_r1": 0.021859840862452982, |
| "train/total_kl": 0.05990182533860207 |
| }, |
| { |
| "epoch": 1.159129292550197, |
| "grad_norm": 2.5, |
| "learning_rate": 2.1300675675675677e-05, |
| "loss": 0.6899, |
| "mean_token_accuracy": 0.9004143476486206, |
| "step": 1545, |
| "train/kl_loss_qwen": 0.05160218593664467, |
| "train/kl_loss_r1": 0.02747901389375329, |
| "train/total_kl": 0.07908119913190603 |
| }, |
| { |
| "epoch": 1.162882341902796, |
| "grad_norm": 2.890625, |
| "learning_rate": 2.1272522522522523e-05, |
| "loss": 0.664, |
| "mean_token_accuracy": 0.8997497946023941, |
| "step": 1550, |
| "train/kl_loss_qwen": 0.03771160962060094, |
| "train/kl_loss_r1": 0.02381550595164299, |
| "train/total_kl": 0.061527115292847157 |
| }, |
| { |
| "epoch": 1.166635391255395, |
| "grad_norm": 2.109375, |
| "learning_rate": 2.124436936936937e-05, |
| "loss": 0.6885, |
| "mean_token_accuracy": 0.8912563741207122, |
| "step": 1555, |
| "train/kl_loss_qwen": 0.04218352562747896, |
| "train/kl_loss_r1": 0.023105837916955353, |
| "train/total_kl": 0.06528936326503754 |
| }, |
| { |
| "epoch": 1.170388440607994, |
| "grad_norm": 2.6875, |
| "learning_rate": 2.1216216216216218e-05, |
| "loss": 0.6618, |
| "mean_token_accuracy": 0.8870168477296829, |
| "step": 1560, |
| "train/kl_loss_qwen": 0.03366015064530074, |
| "train/kl_loss_r1": 0.02038904307410121, |
| "train/total_kl": 0.054049193672835824 |
| }, |
| { |
| "epoch": 1.174141489960593, |
| "grad_norm": 1.953125, |
| "learning_rate": 2.1188063063063063e-05, |
| "loss": 0.6476, |
| "mean_token_accuracy": 0.8984944999217988, |
| "step": 1565, |
| "train/kl_loss_qwen": 0.04087866884656251, |
| "train/kl_loss_r1": 0.02253748197108507, |
| "train/total_kl": 0.06341615030542017 |
| }, |
| { |
| "epoch": 1.1778945393131919, |
| "grad_norm": 2.21875, |
| "learning_rate": 2.115990990990991e-05, |
| "loss": 0.6509, |
| "mean_token_accuracy": 0.8938078165054322, |
| "step": 1570, |
| "train/kl_loss_qwen": 0.03671765057370067, |
| "train/kl_loss_r1": 0.02350157857872546, |
| "train/total_kl": 0.06021922947838902 |
| }, |
| { |
| "epoch": 1.181647588665791, |
| "grad_norm": 2.3125, |
| "learning_rate": 2.1131756756756758e-05, |
| "loss": 0.6916, |
| "mean_token_accuracy": 0.8965020477771759, |
| "step": 1575, |
| "train/kl_loss_qwen": 0.03952843742445111, |
| "train/kl_loss_r1": 0.02464278801344335, |
| "train/total_kl": 0.06417122464627027 |
| }, |
| { |
| "epoch": 1.18540063801839, |
| "grad_norm": 3.34375, |
| "learning_rate": 2.1103603603603604e-05, |
| "loss": 0.6768, |
| "mean_token_accuracy": 0.898043891787529, |
| "step": 1580, |
| "train/kl_loss_qwen": 0.03657638491131365, |
| "train/kl_loss_r1": 0.023017378337681294, |
| "train/total_kl": 0.059593763947486875 |
| }, |
| { |
| "epoch": 1.189153687370989, |
| "grad_norm": 2.109375, |
| "learning_rate": 2.107545045045045e-05, |
| "loss": 0.6469, |
| "mean_token_accuracy": 0.9002287417650223, |
| "step": 1585, |
| "train/kl_loss_qwen": 0.04064678167924285, |
| "train/kl_loss_r1": 0.02297673197463155, |
| "train/total_kl": 0.06362351393327118 |
| }, |
| { |
| "epoch": 1.192906736723588, |
| "grad_norm": 2.34375, |
| "learning_rate": 2.1047297297297298e-05, |
| "loss": 0.7678, |
| "mean_token_accuracy": 0.8924204409122467, |
| "step": 1590, |
| "train/kl_loss_qwen": 0.05273810774087906, |
| "train/kl_loss_r1": 0.03466474949382246, |
| "train/total_kl": 0.08740285709500313 |
| }, |
| { |
| "epoch": 1.196659786076187, |
| "grad_norm": 2.203125, |
| "learning_rate": 2.1019144144144144e-05, |
| "loss": 0.6661, |
| "mean_token_accuracy": 0.8990363031625748, |
| "step": 1595, |
| "train/kl_loss_qwen": 0.03281391002237797, |
| "train/kl_loss_r1": 0.021448523411527275, |
| "train/total_kl": 0.05426243459805846 |
| }, |
| { |
| "epoch": 1.200412835428786, |
| "grad_norm": 2.1875, |
| "learning_rate": 2.0990990990990993e-05, |
| "loss": 0.7208, |
| "mean_token_accuracy": 0.8923367202281952, |
| "step": 1600, |
| "train/kl_loss_qwen": 0.0482438325881958, |
| "train/kl_loss_r1": 0.026941578928381206, |
| "train/total_kl": 0.0751854119822383 |
| }, |
| { |
| "epoch": 1.2041658847813848, |
| "grad_norm": 2.484375, |
| "learning_rate": 2.096283783783784e-05, |
| "loss": 0.6306, |
| "mean_token_accuracy": 0.8927339673042297, |
| "step": 1605, |
| "train/kl_loss_qwen": 0.025906256400048733, |
| "train/kl_loss_r1": 0.017682750569656493, |
| "train/total_kl": 0.04358900701627135 |
| }, |
| { |
| "epoch": 1.2079189341339838, |
| "grad_norm": 2.515625, |
| "learning_rate": 2.0934684684684684e-05, |
| "loss": 0.6601, |
| "mean_token_accuracy": 0.899314421415329, |
| "step": 1610, |
| "train/kl_loss_qwen": 0.03712713974528015, |
| "train/kl_loss_r1": 0.022753736563026906, |
| "train/total_kl": 0.05988087672740221 |
| }, |
| { |
| "epoch": 1.2116719834865828, |
| "grad_norm": 2.390625, |
| "learning_rate": 2.0906531531531533e-05, |
| "loss": 0.6906, |
| "mean_token_accuracy": 0.897834625840187, |
| "step": 1615, |
| "train/kl_loss_qwen": 0.041691668890416624, |
| "train/kl_loss_r1": 0.027388109499588607, |
| "train/total_kl": 0.06907977797091007 |
| }, |
| { |
| "epoch": 1.2154250328391818, |
| "grad_norm": 3.0625, |
| "learning_rate": 2.087837837837838e-05, |
| "loss": 0.7775, |
| "mean_token_accuracy": 0.8951803237199784, |
| "step": 1620, |
| "train/kl_loss_qwen": 0.049284798093140125, |
| "train/kl_loss_r1": 0.039868233958259225, |
| "train/total_kl": 0.08915303098037838 |
| }, |
| { |
| "epoch": 1.2191780821917808, |
| "grad_norm": 2.328125, |
| "learning_rate": 2.0850225225225225e-05, |
| "loss": 0.6344, |
| "mean_token_accuracy": 0.9095320641994477, |
| "step": 1625, |
| "train/kl_loss_qwen": 0.04163948465138674, |
| "train/kl_loss_r1": 0.022643117513507605, |
| "train/total_kl": 0.06428260188549757 |
| }, |
| { |
| "epoch": 1.2229311315443798, |
| "grad_norm": 2.328125, |
| "learning_rate": 2.0822072072072074e-05, |
| "loss": 0.7098, |
| "mean_token_accuracy": 0.8988444000482559, |
| "step": 1630, |
| "train/kl_loss_qwen": 0.04608845864422619, |
| "train/kl_loss_r1": 0.027745236363261937, |
| "train/total_kl": 0.07383369533345104 |
| }, |
| { |
| "epoch": 1.2266841808969788, |
| "grad_norm": 2.0625, |
| "learning_rate": 2.079391891891892e-05, |
| "loss": 0.6944, |
| "mean_token_accuracy": 0.8962710082530976, |
| "step": 1635, |
| "train/kl_loss_qwen": 0.04292014427483082, |
| "train/kl_loss_r1": 0.02413395158946514, |
| "train/total_kl": 0.06705409660935402 |
| }, |
| { |
| "epoch": 1.2304372302495779, |
| "grad_norm": 2.578125, |
| "learning_rate": 2.0765765765765765e-05, |
| "loss": 0.6326, |
| "mean_token_accuracy": 0.9000991404056549, |
| "step": 1640, |
| "train/kl_loss_qwen": 0.03367524016648531, |
| "train/kl_loss_r1": 0.021229733433574437, |
| "train/total_kl": 0.054904973786324265 |
| }, |
| { |
| "epoch": 1.2341902796021769, |
| "grad_norm": 2.078125, |
| "learning_rate": 2.0737612612612614e-05, |
| "loss": 0.6461, |
| "mean_token_accuracy": 0.896466201543808, |
| "step": 1645, |
| "train/kl_loss_qwen": 0.03830257770605385, |
| "train/kl_loss_r1": 0.022557589411735534, |
| "train/total_kl": 0.06086016772314906 |
| }, |
| { |
| "epoch": 1.2379433289547759, |
| "grad_norm": 3.515625, |
| "learning_rate": 2.070945945945946e-05, |
| "loss": 0.6941, |
| "mean_token_accuracy": 0.8982764691114425, |
| "step": 1650, |
| "train/kl_loss_qwen": 0.04389114985242486, |
| "train/kl_loss_r1": 0.023960805917158722, |
| "train/total_kl": 0.06785195581614971 |
| }, |
| { |
| "epoch": 1.2416963783073747, |
| "grad_norm": 2.109375, |
| "learning_rate": 2.0681306306306305e-05, |
| "loss": 0.6591, |
| "mean_token_accuracy": 0.8961503982543946, |
| "step": 1655, |
| "train/kl_loss_qwen": 0.036785400658845904, |
| "train/kl_loss_r1": 0.022157771140336992, |
| "train/total_kl": 0.05894317170605064 |
| }, |
| { |
| "epoch": 1.2454494276599737, |
| "grad_norm": 2.953125, |
| "learning_rate": 2.0653153153153154e-05, |
| "loss": 0.6637, |
| "mean_token_accuracy": 0.8931402564048767, |
| "step": 1660, |
| "train/kl_loss_qwen": 0.034067783411592244, |
| "train/kl_loss_r1": 0.022122635459527373, |
| "train/total_kl": 0.05619041854515672 |
| }, |
| { |
| "epoch": 1.2492024770125727, |
| "grad_norm": 2.296875, |
| "learning_rate": 2.0625e-05, |
| "loss": 0.7201, |
| "mean_token_accuracy": 0.8976661562919617, |
| "step": 1665, |
| "train/kl_loss_qwen": 0.05538632106035948, |
| "train/kl_loss_r1": 0.029164044838398694, |
| "train/total_kl": 0.0845503662712872 |
| }, |
| { |
| "epoch": 1.2529555263651717, |
| "grad_norm": 2.15625, |
| "learning_rate": 2.059684684684685e-05, |
| "loss": 0.679, |
| "mean_token_accuracy": 0.8980172663927078, |
| "step": 1670, |
| "train/kl_loss_qwen": 0.04381668856367469, |
| "train/kl_loss_r1": 0.025967366946861147, |
| "train/total_kl": 0.06978405602276325 |
| }, |
| { |
| "epoch": 1.2567085757177707, |
| "grad_norm": 2.0, |
| "learning_rate": 2.0568693693693695e-05, |
| "loss": 0.6071, |
| "mean_token_accuracy": 0.9005229413509369, |
| "step": 1675, |
| "train/kl_loss_qwen": 0.03412508904002607, |
| "train/kl_loss_r1": 0.020069641107693315, |
| "train/total_kl": 0.05419472977519035 |
| }, |
| { |
| "epoch": 1.2604616250703697, |
| "grad_norm": 1.8515625, |
| "learning_rate": 2.054054054054054e-05, |
| "loss": 0.7051, |
| "mean_token_accuracy": 0.8936825692653656, |
| "step": 1680, |
| "train/kl_loss_qwen": 0.04467056444846094, |
| "train/kl_loss_r1": 0.026615058537572622, |
| "train/total_kl": 0.07128562275320291 |
| }, |
| { |
| "epoch": 1.2642146744229685, |
| "grad_norm": 2.84375, |
| "learning_rate": 2.051238738738739e-05, |
| "loss": 0.6355, |
| "mean_token_accuracy": 0.893347242474556, |
| "step": 1685, |
| "train/kl_loss_qwen": 0.03152433056384325, |
| "train/kl_loss_r1": 0.020429795142263174, |
| "train/total_kl": 0.0519541259855032 |
| }, |
| { |
| "epoch": 1.2679677237755675, |
| "grad_norm": 2.984375, |
| "learning_rate": 2.0484234234234235e-05, |
| "loss": 0.6984, |
| "mean_token_accuracy": 0.8897217184305191, |
| "step": 1690, |
| "train/kl_loss_qwen": 0.03661228069104254, |
| "train/kl_loss_r1": 0.02224379451945424, |
| "train/total_kl": 0.058856075070798396 |
| }, |
| { |
| "epoch": 1.2717207731281666, |
| "grad_norm": 2.28125, |
| "learning_rate": 2.045608108108108e-05, |
| "loss": 0.648, |
| "mean_token_accuracy": 0.9048317104578019, |
| "step": 1695, |
| "train/kl_loss_qwen": 0.045321733225136995, |
| "train/kl_loss_r1": 0.026462600193917753, |
| "train/total_kl": 0.071784333512187 |
| }, |
| { |
| "epoch": 1.2754738224807656, |
| "grad_norm": 2.359375, |
| "learning_rate": 2.042792792792793e-05, |
| "loss": 0.6268, |
| "mean_token_accuracy": 0.8983773797750473, |
| "step": 1700, |
| "train/kl_loss_qwen": 0.03106446722522378, |
| "train/kl_loss_r1": 0.01989688342437148, |
| "train/total_kl": 0.05096135074272752 |
| }, |
| { |
| "epoch": 1.2792268718333646, |
| "grad_norm": 2.4375, |
| "learning_rate": 2.0399774774774775e-05, |
| "loss": 0.6587, |
| "mean_token_accuracy": 0.8927053213119507, |
| "step": 1705, |
| "train/kl_loss_qwen": 0.03694589231163263, |
| "train/kl_loss_r1": 0.02159377154894173, |
| "train/total_kl": 0.058539663441479206 |
| }, |
| { |
| "epoch": 1.2829799211859636, |
| "grad_norm": 2.28125, |
| "learning_rate": 2.037162162162162e-05, |
| "loss": 0.6729, |
| "mean_token_accuracy": 0.8997768491506577, |
| "step": 1710, |
| "train/kl_loss_qwen": 0.04414708665572107, |
| "train/kl_loss_r1": 0.025749648921191692, |
| "train/total_kl": 0.06989673571661115 |
| }, |
| { |
| "epoch": 1.2867329705385626, |
| "grad_norm": 2.453125, |
| "learning_rate": 2.034346846846847e-05, |
| "loss": 0.6475, |
| "mean_token_accuracy": 0.8889215677976608, |
| "step": 1715, |
| "train/kl_loss_qwen": 0.03290065913461149, |
| "train/kl_loss_r1": 0.019741447921842337, |
| "train/total_kl": 0.052642107103019954 |
| }, |
| { |
| "epoch": 1.2904860198911616, |
| "grad_norm": 2.046875, |
| "learning_rate": 2.0315315315315316e-05, |
| "loss": 0.6602, |
| "mean_token_accuracy": 0.9022534549236297, |
| "step": 1720, |
| "train/kl_loss_qwen": 0.04427695120684803, |
| "train/kl_loss_r1": 0.024226430244743823, |
| "train/total_kl": 0.06850338215008378 |
| }, |
| { |
| "epoch": 1.2942390692437606, |
| "grad_norm": 2.40625, |
| "learning_rate": 2.028716216216216e-05, |
| "loss": 0.6487, |
| "mean_token_accuracy": 0.8972199141979218, |
| "step": 1725, |
| "train/kl_loss_qwen": 0.03695550081320107, |
| "train/kl_loss_r1": 0.022246523899957536, |
| "train/total_kl": 0.05920202443376184 |
| }, |
| { |
| "epoch": 1.2979921185963597, |
| "grad_norm": 2.34375, |
| "learning_rate": 2.025900900900901e-05, |
| "loss": 0.6529, |
| "mean_token_accuracy": 0.896842759847641, |
| "step": 1730, |
| "train/kl_loss_qwen": 0.03686010828241706, |
| "train/kl_loss_r1": 0.023121427558362485, |
| "train/total_kl": 0.059981536213308574 |
| }, |
| { |
| "epoch": 1.3017451679489584, |
| "grad_norm": 2.6875, |
| "learning_rate": 2.0230855855855856e-05, |
| "loss": 0.7504, |
| "mean_token_accuracy": 0.8848373681306839, |
| "step": 1735, |
| "train/kl_loss_qwen": 0.04792549349367618, |
| "train/kl_loss_r1": 0.02982408171519637, |
| "train/total_kl": 0.0777495744638145 |
| }, |
| { |
| "epoch": 1.3054982173015575, |
| "grad_norm": 2.46875, |
| "learning_rate": 2.0202702702702705e-05, |
| "loss": 0.6681, |
| "mean_token_accuracy": 0.8902998507022858, |
| "step": 1740, |
| "train/kl_loss_qwen": 0.03482842277735472, |
| "train/kl_loss_r1": 0.02168791564181447, |
| "train/total_kl": 0.0565163386054337 |
| }, |
| { |
| "epoch": 1.3092512666541565, |
| "grad_norm": 2.625, |
| "learning_rate": 2.017454954954955e-05, |
| "loss": 0.6437, |
| "mean_token_accuracy": 0.8982394754886627, |
| "step": 1745, |
| "train/kl_loss_qwen": 0.035474417312070725, |
| "train/kl_loss_r1": 0.022891478892415763, |
| "train/total_kl": 0.05836589625105262 |
| }, |
| { |
| "epoch": 1.3130043160067555, |
| "grad_norm": 2.703125, |
| "learning_rate": 2.0146396396396396e-05, |
| "loss": 0.6795, |
| "mean_token_accuracy": 0.8941202372312546, |
| "step": 1750, |
| "train/kl_loss_qwen": 0.0397964580450207, |
| "train/kl_loss_r1": 0.023753806576132776, |
| "train/total_kl": 0.0635502644814551 |
| }, |
| { |
| "epoch": 1.3167573653593545, |
| "grad_norm": 3.0, |
| "learning_rate": 2.0118243243243245e-05, |
| "loss": 0.6468, |
| "mean_token_accuracy": 0.8910412400960922, |
| "step": 1755, |
| "train/kl_loss_qwen": 0.029920431366190315, |
| "train/kl_loss_r1": 0.01957395039498806, |
| "train/total_kl": 0.049494380969554184 |
| }, |
| { |
| "epoch": 1.3205104147119535, |
| "grad_norm": 1.9453125, |
| "learning_rate": 2.009009009009009e-05, |
| "loss": 0.6327, |
| "mean_token_accuracy": 0.8966994285583496, |
| "step": 1760, |
| "train/kl_loss_qwen": 0.034124097367748615, |
| "train/kl_loss_r1": 0.020086573716253043, |
| "train/total_kl": 0.054210671316832305 |
| }, |
| { |
| "epoch": 1.3242634640645525, |
| "grad_norm": 2.671875, |
| "learning_rate": 2.0061936936936936e-05, |
| "loss": 0.6549, |
| "mean_token_accuracy": 0.8966648191213608, |
| "step": 1765, |
| "train/kl_loss_qwen": 0.03722571823745966, |
| "train/kl_loss_r1": 0.023023253306746483, |
| "train/total_kl": 0.06024897079914808 |
| }, |
| { |
| "epoch": 1.3280165134171513, |
| "grad_norm": 2.203125, |
| "learning_rate": 2.0033783783783786e-05, |
| "loss": 0.7187, |
| "mean_token_accuracy": 0.893772754073143, |
| "step": 1770, |
| "train/kl_loss_qwen": 0.041496854228898886, |
| "train/kl_loss_r1": 0.02984851785004139, |
| "train/total_kl": 0.0713453721255064 |
| }, |
| { |
| "epoch": 1.3317695627697503, |
| "grad_norm": 2.953125, |
| "learning_rate": 2.000563063063063e-05, |
| "loss": 0.6494, |
| "mean_token_accuracy": 0.8925831645727158, |
| "step": 1775, |
| "train/kl_loss_qwen": 0.03391701048240066, |
| "train/kl_loss_r1": 0.02053148075938225, |
| "train/total_kl": 0.05444849170744419 |
| }, |
| { |
| "epoch": 1.3355226121223494, |
| "grad_norm": 2.59375, |
| "learning_rate": 1.9977477477477477e-05, |
| "loss": 0.6872, |
| "mean_token_accuracy": 0.8946872740983963, |
| "step": 1780, |
| "train/kl_loss_qwen": 0.04151489580981434, |
| "train/kl_loss_r1": 0.02380800019018352, |
| "train/total_kl": 0.0653228960931301 |
| }, |
| { |
| "epoch": 1.3392756614749484, |
| "grad_norm": 5.34375, |
| "learning_rate": 1.9949324324324326e-05, |
| "loss": 0.7474, |
| "mean_token_accuracy": 0.8979882091283798, |
| "step": 1785, |
| "train/kl_loss_qwen": 0.056800445262342694, |
| "train/kl_loss_r1": 0.029366112127900124, |
| "train/total_kl": 0.08616655776277185 |
| }, |
| { |
| "epoch": 1.3430287108275474, |
| "grad_norm": 2.21875, |
| "learning_rate": 1.992117117117117e-05, |
| "loss": 0.7115, |
| "mean_token_accuracy": 0.8981248527765274, |
| "step": 1790, |
| "train/kl_loss_qwen": 0.04085184554569423, |
| "train/kl_loss_r1": 0.03460422777570784, |
| "train/total_kl": 0.07545607415959239 |
| }, |
| { |
| "epoch": 1.3467817601801464, |
| "grad_norm": 2.125, |
| "learning_rate": 1.9893018018018017e-05, |
| "loss": 0.6341, |
| "mean_token_accuracy": 0.9051784396171569, |
| "step": 1795, |
| "train/kl_loss_qwen": 0.03810063651762903, |
| "train/kl_loss_r1": 0.023779565608128904, |
| "train/total_kl": 0.061880202125757934 |
| }, |
| { |
| "epoch": 1.3505348095327454, |
| "grad_norm": 2.75, |
| "learning_rate": 1.9864864864864866e-05, |
| "loss": 0.6965, |
| "mean_token_accuracy": 0.8958302170038224, |
| "step": 1800, |
| "train/kl_loss_qwen": 0.043665826646611096, |
| "train/kl_loss_r1": 0.024920030031353235, |
| "train/total_kl": 0.06858585700392723 |
| }, |
| { |
| "epoch": 1.3542878588853444, |
| "grad_norm": 2.265625, |
| "learning_rate": 1.9836711711711712e-05, |
| "loss": 0.6536, |
| "mean_token_accuracy": 0.8965657860040664, |
| "step": 1805, |
| "train/kl_loss_qwen": 0.0385003843344748, |
| "train/kl_loss_r1": 0.02256901506334543, |
| "train/total_kl": 0.06106939930468798 |
| }, |
| { |
| "epoch": 1.3580409082379434, |
| "grad_norm": 2.78125, |
| "learning_rate": 1.980855855855856e-05, |
| "loss": 0.6662, |
| "mean_token_accuracy": 0.8964945763349533, |
| "step": 1810, |
| "train/kl_loss_qwen": 0.03769433670677245, |
| "train/kl_loss_r1": 0.023366046929731966, |
| "train/total_kl": 0.061060383543372156 |
| }, |
| { |
| "epoch": 1.3617939575905424, |
| "grad_norm": 1.9765625, |
| "learning_rate": 1.9780405405405406e-05, |
| "loss": 0.6232, |
| "mean_token_accuracy": 0.8984342306852341, |
| "step": 1815, |
| "train/kl_loss_qwen": 0.03642870718613267, |
| "train/kl_loss_r1": 0.02151739364489913, |
| "train/total_kl": 0.05794610073789954 |
| }, |
| { |
| "epoch": 1.3655470069431412, |
| "grad_norm": 2.6875, |
| "learning_rate": 1.9752252252252252e-05, |
| "loss": 0.6748, |
| "mean_token_accuracy": 0.8911469489336014, |
| "step": 1820, |
| "train/kl_loss_qwen": 0.036837967671453954, |
| "train/kl_loss_r1": 0.021274990309029816, |
| "train/total_kl": 0.05811295798048377 |
| }, |
| { |
| "epoch": 1.3693000562957403, |
| "grad_norm": 2.421875, |
| "learning_rate": 1.97240990990991e-05, |
| "loss": 0.7, |
| "mean_token_accuracy": 0.898788771033287, |
| "step": 1825, |
| "train/kl_loss_qwen": 0.0477908511646092, |
| "train/kl_loss_r1": 0.027263673022389412, |
| "train/total_kl": 0.07505452418699861 |
| }, |
| { |
| "epoch": 1.3730531056483393, |
| "grad_norm": 2.09375, |
| "learning_rate": 1.9695945945945947e-05, |
| "loss": 0.6515, |
| "mean_token_accuracy": 0.8929797321557998, |
| "step": 1830, |
| "train/kl_loss_qwen": 0.037732946872711184, |
| "train/kl_loss_r1": 0.023381694732233883, |
| "train/total_kl": 0.06111464183777571 |
| }, |
| { |
| "epoch": 1.3768061550009383, |
| "grad_norm": 3.625, |
| "learning_rate": 1.9667792792792792e-05, |
| "loss": 0.635, |
| "mean_token_accuracy": 0.8952462702989579, |
| "step": 1835, |
| "train/kl_loss_qwen": 0.033427430875599386, |
| "train/kl_loss_r1": 0.01963294977322221, |
| "train/total_kl": 0.053060381393879655 |
| }, |
| { |
| "epoch": 1.3805592043535373, |
| "grad_norm": 2.078125, |
| "learning_rate": 1.963963963963964e-05, |
| "loss": 0.6226, |
| "mean_token_accuracy": 0.9011066049337387, |
| "step": 1840, |
| "train/kl_loss_qwen": 0.03780209980905056, |
| "train/kl_loss_r1": 0.021729913400486113, |
| "train/total_kl": 0.059532013908028605 |
| }, |
| { |
| "epoch": 1.3843122537061363, |
| "grad_norm": 2.671875, |
| "learning_rate": 1.9611486486486487e-05, |
| "loss": 0.6941, |
| "mean_token_accuracy": 0.8947292596101761, |
| "step": 1845, |
| "train/kl_loss_qwen": 0.04456910211592913, |
| "train/kl_loss_r1": 0.026085085608065127, |
| "train/total_kl": 0.07065418781712651 |
| }, |
| { |
| "epoch": 1.388065303058735, |
| "grad_norm": 2.390625, |
| "learning_rate": 1.9583333333333333e-05, |
| "loss": 0.6699, |
| "mean_token_accuracy": 0.892634192109108, |
| "step": 1850, |
| "train/kl_loss_qwen": 0.03511934005655348, |
| "train/kl_loss_r1": 0.02197172655723989, |
| "train/total_kl": 0.05709106680005789 |
| }, |
| { |
| "epoch": 1.3918183524113341, |
| "grad_norm": 2.34375, |
| "learning_rate": 1.9555180180180182e-05, |
| "loss": 0.6561, |
| "mean_token_accuracy": 0.9011503875255584, |
| "step": 1855, |
| "train/kl_loss_qwen": 0.037530270777642726, |
| "train/kl_loss_r1": 0.023832452250644565, |
| "train/total_kl": 0.06136272391304374 |
| }, |
| { |
| "epoch": 1.3955714017639331, |
| "grad_norm": 2.484375, |
| "learning_rate": 1.9527027027027027e-05, |
| "loss": 0.639, |
| "mean_token_accuracy": 0.8889249801635742, |
| "step": 1860, |
| "train/kl_loss_qwen": 0.03357897619716823, |
| "train/kl_loss_r1": 0.019287104764953256, |
| "train/total_kl": 0.05286608096212149 |
| }, |
| { |
| "epoch": 1.3993244511165321, |
| "grad_norm": 3.46875, |
| "learning_rate": 1.9498873873873876e-05, |
| "loss": 0.6589, |
| "mean_token_accuracy": 0.89662606716156, |
| "step": 1865, |
| "train/kl_loss_qwen": 0.03979860804975033, |
| "train/kl_loss_r1": 0.021712002949789165, |
| "train/total_kl": 0.061510611418634654 |
| }, |
| { |
| "epoch": 1.4030775004691312, |
| "grad_norm": 2.375, |
| "learning_rate": 1.9470720720720722e-05, |
| "loss": 0.6544, |
| "mean_token_accuracy": 0.8980444580316543, |
| "step": 1870, |
| "train/kl_loss_qwen": 0.03840322676114738, |
| "train/kl_loss_r1": 0.022618817444890738, |
| "train/total_kl": 0.061022044345736506 |
| }, |
| { |
| "epoch": 1.4068305498217302, |
| "grad_norm": 2.015625, |
| "learning_rate": 1.9442567567567568e-05, |
| "loss": 0.629, |
| "mean_token_accuracy": 0.8985240757465363, |
| "step": 1875, |
| "train/kl_loss_qwen": 0.03343218662776053, |
| "train/kl_loss_r1": 0.02114759860560298, |
| "train/total_kl": 0.05457978509366512 |
| }, |
| { |
| "epoch": 1.4105835991743292, |
| "grad_norm": 2.453125, |
| "learning_rate": 1.9414414414414417e-05, |
| "loss": 0.6639, |
| "mean_token_accuracy": 0.8933916985988617, |
| "step": 1880, |
| "train/kl_loss_qwen": 0.035910390829667446, |
| "train/kl_loss_r1": 0.022948722075670957, |
| "train/total_kl": 0.05885911285877228 |
| }, |
| { |
| "epoch": 1.4143366485269282, |
| "grad_norm": 2.140625, |
| "learning_rate": 1.9386261261261262e-05, |
| "loss": 0.6254, |
| "mean_token_accuracy": 0.910058930516243, |
| "step": 1885, |
| "train/kl_loss_qwen": 0.04212158760055899, |
| "train/kl_loss_r1": 0.023075549816712736, |
| "train/total_kl": 0.06519713709130884 |
| }, |
| { |
| "epoch": 1.4180896978795272, |
| "grad_norm": 2.609375, |
| "learning_rate": 1.9358108108108108e-05, |
| "loss": 0.6925, |
| "mean_token_accuracy": 0.8909910589456558, |
| "step": 1890, |
| "train/kl_loss_qwen": 0.03533278629183769, |
| "train/kl_loss_r1": 0.02264896663837135, |
| "train/total_kl": 0.057981752697378396 |
| }, |
| { |
| "epoch": 1.4218427472321262, |
| "grad_norm": 2.1875, |
| "learning_rate": 1.9329954954954957e-05, |
| "loss": 0.7097, |
| "mean_token_accuracy": 0.8962362855672836, |
| "step": 1895, |
| "train/kl_loss_qwen": 0.045880905678495766, |
| "train/kl_loss_r1": 0.0273836272303015, |
| "train/total_kl": 0.07326453356072307 |
| }, |
| { |
| "epoch": 1.425595796584725, |
| "grad_norm": 2.78125, |
| "learning_rate": 1.9301801801801803e-05, |
| "loss": 0.6969, |
| "mean_token_accuracy": 0.8988943964242935, |
| "step": 1900, |
| "train/kl_loss_qwen": 0.039936855994164945, |
| "train/kl_loss_r1": 0.024415438855066897, |
| "train/total_kl": 0.06435229545459151 |
| }, |
| { |
| "epoch": 1.429348845937324, |
| "grad_norm": 2.34375, |
| "learning_rate": 1.927364864864865e-05, |
| "loss": 0.6525, |
| "mean_token_accuracy": 0.9052040755748749, |
| "step": 1905, |
| "train/kl_loss_qwen": 0.04124778304249048, |
| "train/kl_loss_r1": 0.023393189487978815, |
| "train/total_kl": 0.06464097276329994 |
| }, |
| { |
| "epoch": 1.433101895289923, |
| "grad_norm": 2.515625, |
| "learning_rate": 1.9245495495495497e-05, |
| "loss": 0.7096, |
| "mean_token_accuracy": 0.8973052710294723, |
| "step": 1910, |
| "train/kl_loss_qwen": 0.04522251943126321, |
| "train/kl_loss_r1": 0.027931411052122712, |
| "train/total_kl": 0.07315393034368753 |
| }, |
| { |
| "epoch": 1.436854944642522, |
| "grad_norm": 2.546875, |
| "learning_rate": 1.9217342342342343e-05, |
| "loss": 0.6854, |
| "mean_token_accuracy": 0.89446761906147, |
| "step": 1915, |
| "train/kl_loss_qwen": 0.04195737112313509, |
| "train/kl_loss_r1": 0.024122355040162802, |
| "train/total_kl": 0.06607972560450434 |
| }, |
| { |
| "epoch": 1.440607993995121, |
| "grad_norm": 2.078125, |
| "learning_rate": 1.918918918918919e-05, |
| "loss": 0.6296, |
| "mean_token_accuracy": 0.8977221518754959, |
| "step": 1920, |
| "train/kl_loss_qwen": 0.03218547897413373, |
| "train/kl_loss_r1": 0.020699582109227777, |
| "train/total_kl": 0.05288506057113409 |
| }, |
| { |
| "epoch": 1.44436104334772, |
| "grad_norm": 2.296875, |
| "learning_rate": 1.9161036036036038e-05, |
| "loss": 0.6815, |
| "mean_token_accuracy": 0.9008699923753738, |
| "step": 1925, |
| "train/kl_loss_qwen": 0.04258906641043723, |
| "train/kl_loss_r1": 0.025730078108608723, |
| "train/total_kl": 0.06831914484500885 |
| }, |
| { |
| "epoch": 1.4481140927003189, |
| "grad_norm": 2.171875, |
| "learning_rate": 1.9132882882882883e-05, |
| "loss": 0.6342, |
| "mean_token_accuracy": 0.8992574870586395, |
| "step": 1930, |
| "train/kl_loss_qwen": 0.0382092896848917, |
| "train/kl_loss_r1": 0.021629361854866146, |
| "train/total_kl": 0.05983865112066269 |
| }, |
| { |
| "epoch": 1.451867142052918, |
| "grad_norm": 2.21875, |
| "learning_rate": 1.9104729729729732e-05, |
| "loss": 0.6639, |
| "mean_token_accuracy": 0.9041530281305313, |
| "step": 1935, |
| "train/kl_loss_qwen": 0.03997725336812437, |
| "train/kl_loss_r1": 0.023675264324992895, |
| "train/total_kl": 0.06365251699462533 |
| }, |
| { |
| "epoch": 1.455620191405517, |
| "grad_norm": 2.171875, |
| "learning_rate": 1.9076576576576578e-05, |
| "loss": 0.6712, |
| "mean_token_accuracy": 0.9018199771642685, |
| "step": 1940, |
| "train/kl_loss_qwen": 0.043738367455080154, |
| "train/kl_loss_r1": 0.02533445945009589, |
| "train/total_kl": 0.06907282685860991 |
| }, |
| { |
| "epoch": 1.459373240758116, |
| "grad_norm": 2.765625, |
| "learning_rate": 1.9048423423423424e-05, |
| "loss": 0.6547, |
| "mean_token_accuracy": 0.8964920192956924, |
| "step": 1945, |
| "train/kl_loss_qwen": 0.036225776420906186, |
| "train/kl_loss_r1": 0.022438023379072546, |
| "train/total_kl": 0.05866379989311099 |
| }, |
| { |
| "epoch": 1.463126290110715, |
| "grad_norm": 3.015625, |
| "learning_rate": 1.9020270270270273e-05, |
| "loss": 0.6735, |
| "mean_token_accuracy": 0.8878309816122055, |
| "step": 1950, |
| "train/kl_loss_qwen": 0.03589406101964414, |
| "train/kl_loss_r1": 0.020759137952700256, |
| "train/total_kl": 0.05665319887921214 |
| }, |
| { |
| "epoch": 1.466879339463314, |
| "grad_norm": 2.09375, |
| "learning_rate": 1.899211711711712e-05, |
| "loss": 0.6439, |
| "mean_token_accuracy": 0.8993774890899658, |
| "step": 1955, |
| "train/kl_loss_qwen": 0.03630202002823353, |
| "train/kl_loss_r1": 0.022347288206219673, |
| "train/total_kl": 0.05864930879324674 |
| }, |
| { |
| "epoch": 1.470632388815913, |
| "grad_norm": 2.140625, |
| "learning_rate": 1.8963963963963964e-05, |
| "loss": 0.6855, |
| "mean_token_accuracy": 0.8912985980510711, |
| "step": 1960, |
| "train/kl_loss_qwen": 0.03758311937563121, |
| "train/kl_loss_r1": 0.022967340145260095, |
| "train/total_kl": 0.060550459288060667 |
| }, |
| { |
| "epoch": 1.474385438168512, |
| "grad_norm": 2.125, |
| "learning_rate": 1.8935810810810813e-05, |
| "loss": 0.6547, |
| "mean_token_accuracy": 0.8974949568510056, |
| "step": 1965, |
| "train/kl_loss_qwen": 0.03768882369622588, |
| "train/kl_loss_r1": 0.022107941936701535, |
| "train/total_kl": 0.05979676572605967 |
| }, |
| { |
| "epoch": 1.478138487521111, |
| "grad_norm": 2.328125, |
| "learning_rate": 1.890765765765766e-05, |
| "loss": 0.6452, |
| "mean_token_accuracy": 0.9022711753845215, |
| "step": 1970, |
| "train/kl_loss_qwen": 0.039558446034789085, |
| "train/kl_loss_r1": 0.02402328816242516, |
| "train/total_kl": 0.06358173452317714 |
| }, |
| { |
| "epoch": 1.48189153687371, |
| "grad_norm": 3.59375, |
| "learning_rate": 1.8879504504504504e-05, |
| "loss": 0.6739, |
| "mean_token_accuracy": 0.8987083554267883, |
| "step": 1975, |
| "train/kl_loss_qwen": 0.0458216161467135, |
| "train/kl_loss_r1": 0.02532826513051987, |
| "train/total_kl": 0.07114988146349788 |
| }, |
| { |
| "epoch": 1.4856445862263088, |
| "grad_norm": 2.625, |
| "learning_rate": 1.8851351351351353e-05, |
| "loss": 0.6292, |
| "mean_token_accuracy": 0.8991831332445145, |
| "step": 1980, |
| "train/kl_loss_qwen": 0.02697877576574683, |
| "train/kl_loss_r1": 0.018973442958667874, |
| "train/total_kl": 0.04595221867784858 |
| }, |
| { |
| "epoch": 1.4893976355789078, |
| "grad_norm": 2.296875, |
| "learning_rate": 1.88231981981982e-05, |
| "loss": 0.6595, |
| "mean_token_accuracy": 0.8934097826480866, |
| "step": 1985, |
| "train/kl_loss_qwen": 0.03260546647943556, |
| "train/kl_loss_r1": 0.021064449148252607, |
| "train/total_kl": 0.05366991562768817 |
| }, |
| { |
| "epoch": 1.4931506849315068, |
| "grad_norm": 2.375, |
| "learning_rate": 1.8795045045045045e-05, |
| "loss": 0.6695, |
| "mean_token_accuracy": 0.8950473695993424, |
| "step": 1990, |
| "train/kl_loss_qwen": 0.04045011536218226, |
| "train/kl_loss_r1": 0.023666227189823984, |
| "train/total_kl": 0.0641163426451385 |
| }, |
| { |
| "epoch": 1.4969037342841058, |
| "grad_norm": 3.09375, |
| "learning_rate": 1.8766891891891894e-05, |
| "loss": 0.663, |
| "mean_token_accuracy": 0.8998892098665238, |
| "step": 1995, |
| "train/kl_loss_qwen": 0.04123517670668662, |
| "train/kl_loss_r1": 0.02508084485307336, |
| "train/total_kl": 0.06631602114066482 |
| }, |
| { |
| "epoch": 1.5006567836367048, |
| "grad_norm": 2.71875, |
| "learning_rate": 1.873873873873874e-05, |
| "loss": 0.7075, |
| "mean_token_accuracy": 0.8947447627782822, |
| "step": 2000, |
| "train/kl_loss_qwen": 0.04717821152880788, |
| "train/kl_loss_r1": 0.02488067150115967, |
| "train/total_kl": 0.0720588818192482 |
| }, |
| { |
| "epoch": 1.5044098329893039, |
| "grad_norm": 2.953125, |
| "learning_rate": 1.871058558558559e-05, |
| "loss": 0.6684, |
| "mean_token_accuracy": 0.898020452260971, |
| "step": 2005, |
| "train/kl_loss_qwen": 0.043496218509972095, |
| "train/kl_loss_r1": 0.023012824496254324, |
| "train/total_kl": 0.0665090423077345 |
| }, |
| { |
| "epoch": 1.5081628823419027, |
| "grad_norm": 2.71875, |
| "learning_rate": 1.8682432432432434e-05, |
| "loss": 0.6304, |
| "mean_token_accuracy": 0.9003192782402039, |
| "step": 2010, |
| "train/kl_loss_qwen": 0.029134797770529984, |
| "train/kl_loss_r1": 0.02021429603919387, |
| "train/total_kl": 0.04934909334406257 |
| }, |
| { |
| "epoch": 1.5119159316945017, |
| "grad_norm": 1.9140625, |
| "learning_rate": 1.865427927927928e-05, |
| "loss": 0.6588, |
| "mean_token_accuracy": 0.9045243114233017, |
| "step": 2015, |
| "train/kl_loss_qwen": 0.03774572303518653, |
| "train/kl_loss_r1": 0.024216174567118286, |
| "train/total_kl": 0.0619618970900774 |
| }, |
| { |
| "epoch": 1.5156689810471007, |
| "grad_norm": 2.640625, |
| "learning_rate": 1.862612612612613e-05, |
| "loss": 0.6248, |
| "mean_token_accuracy": 0.8964930444955825, |
| "step": 2020, |
| "train/kl_loss_qwen": 0.034802882373332976, |
| "train/kl_loss_r1": 0.02116892714984715, |
| "train/total_kl": 0.055971809569746254 |
| }, |
| { |
| "epoch": 1.5194220303996997, |
| "grad_norm": 3.03125, |
| "learning_rate": 1.8597972972972974e-05, |
| "loss": 0.6271, |
| "mean_token_accuracy": 0.8987694203853607, |
| "step": 2025, |
| "train/kl_loss_qwen": 0.03145243003964424, |
| "train/kl_loss_r1": 0.019979899702593684, |
| "train/total_kl": 0.0514323296956718 |
| }, |
| { |
| "epoch": 1.5231750797522987, |
| "grad_norm": 2.78125, |
| "learning_rate": 1.856981981981982e-05, |
| "loss": 0.6637, |
| "mean_token_accuracy": 0.8984456181526184, |
| "step": 2030, |
| "train/kl_loss_qwen": 0.039285799767822024, |
| "train/kl_loss_r1": 0.024448539735749363, |
| "train/total_kl": 0.06373433964326977 |
| }, |
| { |
| "epoch": 1.5269281291048977, |
| "grad_norm": 2.40625, |
| "learning_rate": 1.854166666666667e-05, |
| "loss": 0.6195, |
| "mean_token_accuracy": 0.9050000667572021, |
| "step": 2035, |
| "train/kl_loss_qwen": 0.03708098256029189, |
| "train/kl_loss_r1": 0.022825441183522345, |
| "train/total_kl": 0.0599064233712852 |
| }, |
| { |
| "epoch": 1.5306811784574967, |
| "grad_norm": 3.15625, |
| "learning_rate": 1.8513513513513515e-05, |
| "loss": 0.6373, |
| "mean_token_accuracy": 0.8917050033807754, |
| "step": 2040, |
| "train/kl_loss_qwen": 0.03324793949723244, |
| "train/kl_loss_r1": 0.02039225320331752, |
| "train/total_kl": 0.05364019190892577 |
| }, |
| { |
| "epoch": 1.5344342278100958, |
| "grad_norm": 2.6875, |
| "learning_rate": 1.848536036036036e-05, |
| "loss": 0.6909, |
| "mean_token_accuracy": 0.898727822303772, |
| "step": 2045, |
| "train/kl_loss_qwen": 0.0451532918959856, |
| "train/kl_loss_r1": 0.02779616378247738, |
| "train/total_kl": 0.0729494565166533 |
| }, |
| { |
| "epoch": 1.5381872771626948, |
| "grad_norm": 2.78125, |
| "learning_rate": 1.845720720720721e-05, |
| "loss": 0.642, |
| "mean_token_accuracy": 0.8923788040876388, |
| "step": 2050, |
| "train/kl_loss_qwen": 0.030408328166231513, |
| "train/kl_loss_r1": 0.019276778073981406, |
| "train/total_kl": 0.04968510568141937 |
| }, |
| { |
| "epoch": 1.5419403265152938, |
| "grad_norm": 1.9140625, |
| "learning_rate": 1.8429054054054055e-05, |
| "loss": 0.6805, |
| "mean_token_accuracy": 0.9005244821310043, |
| "step": 2055, |
| "train/kl_loss_qwen": 0.043401677859947085, |
| "train/kl_loss_r1": 0.024531407188624142, |
| "train/total_kl": 0.06793308556079865 |
| }, |
| { |
| "epoch": 1.5456933758678928, |
| "grad_norm": 2.640625, |
| "learning_rate": 1.84009009009009e-05, |
| "loss": 0.697, |
| "mean_token_accuracy": 0.89486822783947, |
| "step": 2060, |
| "train/kl_loss_qwen": 0.04360593403689563, |
| "train/kl_loss_r1": 0.02450297260656953, |
| "train/total_kl": 0.06810890669003129 |
| }, |
| { |
| "epoch": 1.5494464252204918, |
| "grad_norm": 2.265625, |
| "learning_rate": 1.837274774774775e-05, |
| "loss": 0.6749, |
| "mean_token_accuracy": 0.8936996221542358, |
| "step": 2065, |
| "train/kl_loss_qwen": 0.03860712107270956, |
| "train/kl_loss_r1": 0.02272321986965835, |
| "train/total_kl": 0.061330341175198554 |
| }, |
| { |
| "epoch": 1.5531994745730906, |
| "grad_norm": 2.09375, |
| "learning_rate": 1.8344594594594595e-05, |
| "loss": 0.6602, |
| "mean_token_accuracy": 0.9008495211601257, |
| "step": 2070, |
| "train/kl_loss_qwen": 0.038267128402367234, |
| "train/kl_loss_r1": 0.024460298055782915, |
| "train/total_kl": 0.06272742608562112 |
| }, |
| { |
| "epoch": 1.5569525239256896, |
| "grad_norm": 2.53125, |
| "learning_rate": 1.8316441441441444e-05, |
| "loss": 0.6784, |
| "mean_token_accuracy": 0.8971472412347794, |
| "step": 2075, |
| "train/kl_loss_qwen": 0.0419050442520529, |
| "train/kl_loss_r1": 0.024500356847420336, |
| "train/total_kl": 0.06640540091320872 |
| }, |
| { |
| "epoch": 1.5607055732782886, |
| "grad_norm": 1.953125, |
| "learning_rate": 1.828828828828829e-05, |
| "loss": 0.6483, |
| "mean_token_accuracy": 0.8951237499713898, |
| "step": 2080, |
| "train/kl_loss_qwen": 0.03391816089861095, |
| "train/kl_loss_r1": 0.01974315377883613, |
| "train/total_kl": 0.05366131514310837 |
| }, |
| { |
| "epoch": 1.5644586226308876, |
| "grad_norm": 2.375, |
| "learning_rate": 1.8260135135135136e-05, |
| "loss": 0.6596, |
| "mean_token_accuracy": 0.9010801434516906, |
| "step": 2085, |
| "train/kl_loss_qwen": 0.04254875308834016, |
| "train/kl_loss_r1": 0.023462942428886892, |
| "train/total_kl": 0.06601169584318996 |
| }, |
| { |
| "epoch": 1.5682116719834864, |
| "grad_norm": 2.1875, |
| "learning_rate": 1.8231981981981985e-05, |
| "loss": 0.6299, |
| "mean_token_accuracy": 0.8970382899045944, |
| "step": 2090, |
| "train/kl_loss_qwen": 0.03471034588292241, |
| "train/kl_loss_r1": 0.021927068615332244, |
| "train/total_kl": 0.0566374147310853 |
| }, |
| { |
| "epoch": 1.5719647213360854, |
| "grad_norm": 2.65625, |
| "learning_rate": 1.820382882882883e-05, |
| "loss": 0.6458, |
| "mean_token_accuracy": 0.9013784170150757, |
| "step": 2095, |
| "train/kl_loss_qwen": 0.04169517187401652, |
| "train/kl_loss_r1": 0.024561091884970666, |
| "train/total_kl": 0.06625626292079687 |
| }, |
| { |
| "epoch": 1.5757177706886845, |
| "grad_norm": 2.171875, |
| "learning_rate": 1.8175675675675676e-05, |
| "loss": 0.6437, |
| "mean_token_accuracy": 0.8984420299530029, |
| "step": 2100, |
| "train/kl_loss_qwen": 0.03708738945424557, |
| "train/kl_loss_r1": 0.02213964704424143, |
| "train/total_kl": 0.05922703584656119 |
| }, |
| { |
| "epoch": 1.5794708200412835, |
| "grad_norm": 2.96875, |
| "learning_rate": 1.8147522522522525e-05, |
| "loss": 0.636, |
| "mean_token_accuracy": 0.8942008495330811, |
| "step": 2105, |
| "train/kl_loss_qwen": 0.028620942728593946, |
| "train/kl_loss_r1": 0.018589144852012397, |
| "train/total_kl": 0.04721008772030473 |
| }, |
| { |
| "epoch": 1.5832238693938825, |
| "grad_norm": 2.09375, |
| "learning_rate": 1.811936936936937e-05, |
| "loss": 0.6433, |
| "mean_token_accuracy": 0.9032953917980194, |
| "step": 2110, |
| "train/kl_loss_qwen": 0.04077963996678591, |
| "train/kl_loss_r1": 0.02312437235377729, |
| "train/total_kl": 0.06390401273965836 |
| }, |
| { |
| "epoch": 1.5869769187464815, |
| "grad_norm": 2.234375, |
| "learning_rate": 1.8091216216216216e-05, |
| "loss": 0.7082, |
| "mean_token_accuracy": 0.8941286385059357, |
| "step": 2115, |
| "train/kl_loss_qwen": 0.04121659249067307, |
| "train/kl_loss_r1": 0.022846509236842394, |
| "train/total_kl": 0.06406310107558966 |
| }, |
| { |
| "epoch": 1.5907299680990805, |
| "grad_norm": 3.28125, |
| "learning_rate": 1.8063063063063065e-05, |
| "loss": 0.6491, |
| "mean_token_accuracy": 0.9042773187160492, |
| "step": 2120, |
| "train/kl_loss_qwen": 0.03976739956997335, |
| "train/kl_loss_r1": 0.023621071968227624, |
| "train/total_kl": 0.06338847130537033 |
| }, |
| { |
| "epoch": 1.5944830174516795, |
| "grad_norm": 2.5, |
| "learning_rate": 1.803490990990991e-05, |
| "loss": 0.6262, |
| "mean_token_accuracy": 0.9077206790447235, |
| "step": 2125, |
| "train/kl_loss_qwen": 0.03935662703588605, |
| "train/kl_loss_r1": 0.022750586131587626, |
| "train/total_kl": 0.06210721312090754 |
| }, |
| { |
| "epoch": 1.5982360668042785, |
| "grad_norm": 2.0625, |
| "learning_rate": 1.8006756756756757e-05, |
| "loss": 0.6299, |
| "mean_token_accuracy": 0.8975888967514039, |
| "step": 2130, |
| "train/kl_loss_qwen": 0.037865397753193974, |
| "train/kl_loss_r1": 0.021229323279112578, |
| "train/total_kl": 0.05909472107887268 |
| }, |
| { |
| "epoch": 1.6019891161568776, |
| "grad_norm": 2.125, |
| "learning_rate": 1.7978603603603606e-05, |
| "loss": 0.6828, |
| "mean_token_accuracy": 0.8985576778650284, |
| "step": 2135, |
| "train/kl_loss_qwen": 0.04367698361165821, |
| "train/kl_loss_r1": 0.02365296697244048, |
| "train/total_kl": 0.06732995035126806 |
| }, |
| { |
| "epoch": 1.6057421655094766, |
| "grad_norm": 2.984375, |
| "learning_rate": 1.795045045045045e-05, |
| "loss": 0.741, |
| "mean_token_accuracy": 0.8831792622804642, |
| "step": 2140, |
| "train/kl_loss_qwen": 0.04365133550018072, |
| "train/kl_loss_r1": 0.025468871323391797, |
| "train/total_kl": 0.06912020705640316 |
| }, |
| { |
| "epoch": 1.6094952148620756, |
| "grad_norm": 2.5625, |
| "learning_rate": 1.79222972972973e-05, |
| "loss": 0.6598, |
| "mean_token_accuracy": 0.8970428496599198, |
| "step": 2145, |
| "train/kl_loss_qwen": 0.034180917451158165, |
| "train/kl_loss_r1": 0.02286825072951615, |
| "train/total_kl": 0.0570491686463356 |
| }, |
| { |
| "epoch": 1.6132482642146744, |
| "grad_norm": 2.359375, |
| "learning_rate": 1.7894144144144146e-05, |
| "loss": 0.6644, |
| "mean_token_accuracy": 0.8940432757139206, |
| "step": 2150, |
| "train/kl_loss_qwen": 0.035260153096169235, |
| "train/kl_loss_r1": 0.021994050638750196, |
| "train/total_kl": 0.05725420378148556 |
| }, |
| { |
| "epoch": 1.6170013135672734, |
| "grad_norm": 2.28125, |
| "learning_rate": 1.786599099099099e-05, |
| "loss": 0.6376, |
| "mean_token_accuracy": 0.8957689791917801, |
| "step": 2155, |
| "train/kl_loss_qwen": 0.0388267389498651, |
| "train/kl_loss_r1": 0.021107364958152176, |
| "train/total_kl": 0.05993410395458341 |
| }, |
| { |
| "epoch": 1.6207543629198724, |
| "grad_norm": 2.234375, |
| "learning_rate": 1.783783783783784e-05, |
| "loss": 0.6592, |
| "mean_token_accuracy": 0.9020599126815796, |
| "step": 2160, |
| "train/kl_loss_qwen": 0.04379240069538355, |
| "train/kl_loss_r1": 0.025263063982129096, |
| "train/total_kl": 0.06905546449124814 |
| }, |
| { |
| "epoch": 1.6245074122724714, |
| "grad_norm": 2.0, |
| "learning_rate": 1.7809684684684686e-05, |
| "loss": 0.62, |
| "mean_token_accuracy": 0.909572035074234, |
| "step": 2165, |
| "train/kl_loss_qwen": 0.03788591339252889, |
| "train/kl_loss_r1": 0.022449908265843987, |
| "train/total_kl": 0.06033582193776965 |
| }, |
| { |
| "epoch": 1.6282604616250702, |
| "grad_norm": 2.59375, |
| "learning_rate": 1.7781531531531532e-05, |
| "loss": 0.6307, |
| "mean_token_accuracy": 0.9034926325082779, |
| "step": 2170, |
| "train/kl_loss_qwen": 0.03140334081836045, |
| "train/kl_loss_r1": 0.01981693026609719, |
| "train/total_kl": 0.051220270432531835 |
| }, |
| { |
| "epoch": 1.6320135109776692, |
| "grad_norm": 3.140625, |
| "learning_rate": 1.775337837837838e-05, |
| "loss": 0.6078, |
| "mean_token_accuracy": 0.9023738920688629, |
| "step": 2175, |
| "train/kl_loss_qwen": 0.030494816461578013, |
| "train/kl_loss_r1": 0.019982940517365932, |
| "train/total_kl": 0.050477756466716525 |
| }, |
| { |
| "epoch": 1.6357665603302682, |
| "grad_norm": 2.09375, |
| "learning_rate": 1.7725225225225227e-05, |
| "loss": 0.6261, |
| "mean_token_accuracy": 0.9061200588941574, |
| "step": 2180, |
| "train/kl_loss_qwen": 0.037608364084735516, |
| "train/kl_loss_r1": 0.023159870877861977, |
| "train/total_kl": 0.06076823528856039 |
| }, |
| { |
| "epoch": 1.6395196096828673, |
| "grad_norm": 2.5625, |
| "learning_rate": 1.7697072072072072e-05, |
| "loss": 0.6209, |
| "mean_token_accuracy": 0.9042865604162216, |
| "step": 2185, |
| "train/kl_loss_qwen": 0.03485631812363863, |
| "train/kl_loss_r1": 0.021672707796096802, |
| "train/total_kl": 0.05652902610599995 |
| }, |
| { |
| "epoch": 1.6432726590354663, |
| "grad_norm": 2.515625, |
| "learning_rate": 1.766891891891892e-05, |
| "loss": 0.6012, |
| "mean_token_accuracy": 0.9039783835411072, |
| "step": 2190, |
| "train/kl_loss_qwen": 0.03550857813097537, |
| "train/kl_loss_r1": 0.02138693048618734, |
| "train/total_kl": 0.05689550880342722 |
| }, |
| { |
| "epoch": 1.6470257083880653, |
| "grad_norm": 2.296875, |
| "learning_rate": 1.7640765765765767e-05, |
| "loss": 0.668, |
| "mean_token_accuracy": 0.9030372470617294, |
| "step": 2195, |
| "train/kl_loss_qwen": 0.04753458416089416, |
| "train/kl_loss_r1": 0.02611639932729304, |
| "train/total_kl": 0.07365098400041462 |
| }, |
| { |
| "epoch": 1.6507787577406643, |
| "grad_norm": 2.453125, |
| "learning_rate": 1.7612612612612613e-05, |
| "loss": 0.6292, |
| "mean_token_accuracy": 0.8899801164865494, |
| "step": 2200, |
| "train/kl_loss_qwen": 0.03742695958353579, |
| "train/kl_loss_r1": 0.022831895435228945, |
| "train/total_kl": 0.060258854925632474 |
| }, |
| { |
| "epoch": 1.6545318070932633, |
| "grad_norm": 2.25, |
| "learning_rate": 1.758445945945946e-05, |
| "loss": 0.5998, |
| "mean_token_accuracy": 0.9015161246061325, |
| "step": 2205, |
| "train/kl_loss_qwen": 0.029024596931412815, |
| "train/kl_loss_r1": 0.018637486500665545, |
| "train/total_kl": 0.04766208389773965 |
| }, |
| { |
| "epoch": 1.6582848564458623, |
| "grad_norm": 2.21875, |
| "learning_rate": 1.7556306306306307e-05, |
| "loss": 0.7259, |
| "mean_token_accuracy": 0.8821407407522202, |
| "step": 2210, |
| "train/kl_loss_qwen": 0.04734089416451752, |
| "train/kl_loss_r1": 0.02618039455264807, |
| "train/total_kl": 0.07352128904312849 |
| }, |
| { |
| "epoch": 1.6620379057984613, |
| "grad_norm": 2.765625, |
| "learning_rate": 1.7528153153153156e-05, |
| "loss": 0.642, |
| "mean_token_accuracy": 0.8945120990276336, |
| "step": 2215, |
| "train/kl_loss_qwen": 0.0319673310033977, |
| "train/kl_loss_r1": 0.019030406884849072, |
| "train/total_kl": 0.05099773760885 |
| }, |
| { |
| "epoch": 1.6657909551510603, |
| "grad_norm": 2.15625, |
| "learning_rate": 1.7500000000000002e-05, |
| "loss": 0.645, |
| "mean_token_accuracy": 0.8960767388343811, |
| "step": 2220, |
| "train/kl_loss_qwen": 0.03604310783557594, |
| "train/kl_loss_r1": 0.020090335281565785, |
| "train/total_kl": 0.056133443396538495 |
| }, |
| { |
| "epoch": 1.6695440045036594, |
| "grad_norm": 2.578125, |
| "learning_rate": 1.7471846846846847e-05, |
| "loss": 0.6465, |
| "mean_token_accuracy": 0.8933228254318237, |
| "step": 2225, |
| "train/kl_loss_qwen": 0.028659786516800522, |
| "train/kl_loss_r1": 0.01866114339791238, |
| "train/total_kl": 0.04732093075290322 |
| }, |
| { |
| "epoch": 1.6732970538562584, |
| "grad_norm": 2.453125, |
| "learning_rate": 1.7443693693693697e-05, |
| "loss": 0.6182, |
| "mean_token_accuracy": 0.9031960755586624, |
| "step": 2230, |
| "train/kl_loss_qwen": 0.03483367273584008, |
| "train/kl_loss_r1": 0.020910135982558132, |
| "train/total_kl": 0.05574380857869983 |
| }, |
| { |
| "epoch": 1.6770501032088572, |
| "grad_norm": 2.75, |
| "learning_rate": 1.7415540540540542e-05, |
| "loss": 0.6383, |
| "mean_token_accuracy": 0.8974160134792328, |
| "step": 2235, |
| "train/kl_loss_qwen": 0.029755527339875697, |
| "train/kl_loss_r1": 0.020382949942722918, |
| "train/total_kl": 0.050138477329164745 |
| }, |
| { |
| "epoch": 1.6808031525614562, |
| "grad_norm": 2.03125, |
| "learning_rate": 1.7387387387387388e-05, |
| "loss": 0.6439, |
| "mean_token_accuracy": 0.9057151556015015, |
| "step": 2240, |
| "train/kl_loss_qwen": 0.04374876599758863, |
| "train/kl_loss_r1": 0.026726429350674152, |
| "train/total_kl": 0.07047519516199827 |
| }, |
| { |
| "epoch": 1.6845562019140552, |
| "grad_norm": 2.484375, |
| "learning_rate": 1.7359234234234237e-05, |
| "loss": 0.6869, |
| "mean_token_accuracy": 0.8932524681091308, |
| "step": 2245, |
| "train/kl_loss_qwen": 0.043853827146813275, |
| "train/kl_loss_r1": 0.02495257118716836, |
| "train/total_kl": 0.06880639912560582 |
| }, |
| { |
| "epoch": 1.6883092512666542, |
| "grad_norm": 3.765625, |
| "learning_rate": 1.7331081081081082e-05, |
| "loss": 0.7045, |
| "mean_token_accuracy": 0.9062951624393463, |
| "step": 2250, |
| "train/kl_loss_qwen": 0.05141198909841478, |
| "train/kl_loss_r1": 0.027050549210980535, |
| "train/total_kl": 0.07846253886818885 |
| }, |
| { |
| "epoch": 1.692062300619253, |
| "grad_norm": 2.375, |
| "learning_rate": 1.7302927927927928e-05, |
| "loss": 0.646, |
| "mean_token_accuracy": 0.8936865895986557, |
| "step": 2255, |
| "train/kl_loss_qwen": 0.02825439111329615, |
| "train/kl_loss_r1": 0.01830715793184936, |
| "train/total_kl": 0.046561548765748736 |
| }, |
| { |
| "epoch": 1.695815349971852, |
| "grad_norm": 1.875, |
| "learning_rate": 1.7274774774774777e-05, |
| "loss": 0.6418, |
| "mean_token_accuracy": 0.8941173821687698, |
| "step": 2260, |
| "train/kl_loss_qwen": 0.024399951938539742, |
| "train/kl_loss_r1": 0.01719582751393318, |
| "train/total_kl": 0.04159577945247293 |
| }, |
| { |
| "epoch": 1.699568399324451, |
| "grad_norm": 2.21875, |
| "learning_rate": 1.7246621621621623e-05, |
| "loss": 0.6441, |
| "mean_token_accuracy": 0.9033589363098145, |
| "step": 2265, |
| "train/kl_loss_qwen": 0.03845631028525531, |
| "train/kl_loss_r1": 0.023384080873802303, |
| "train/total_kl": 0.061840390972793105 |
| }, |
| { |
| "epoch": 1.70332144867705, |
| "grad_norm": 2.109375, |
| "learning_rate": 1.721846846846847e-05, |
| "loss": 0.6912, |
| "mean_token_accuracy": 0.8872569084167481, |
| "step": 2270, |
| "train/kl_loss_qwen": 0.03908129506744444, |
| "train/kl_loss_r1": 0.02350794356316328, |
| "train/total_kl": 0.06258923830464483 |
| }, |
| { |
| "epoch": 1.707074498029649, |
| "grad_norm": 2.140625, |
| "learning_rate": 1.7190315315315317e-05, |
| "loss": 0.6399, |
| "mean_token_accuracy": 0.9103470027446747, |
| "step": 2275, |
| "train/kl_loss_qwen": 0.0428709767293185, |
| "train/kl_loss_r1": 0.024058361165225507, |
| "train/total_kl": 0.06692933682352305 |
| }, |
| { |
| "epoch": 1.710827547382248, |
| "grad_norm": 2.078125, |
| "learning_rate": 1.7162162162162163e-05, |
| "loss": 0.6621, |
| "mean_token_accuracy": 0.8940898805856705, |
| "step": 2280, |
| "train/kl_loss_qwen": 0.03766034827567637, |
| "train/kl_loss_r1": 0.02226076889783144, |
| "train/total_kl": 0.05992111759260297 |
| }, |
| { |
| "epoch": 1.714580596734847, |
| "grad_norm": 2.8125, |
| "learning_rate": 1.7134009009009012e-05, |
| "loss": 0.6359, |
| "mean_token_accuracy": 0.9065495610237122, |
| "step": 2285, |
| "train/kl_loss_qwen": 0.039660067204385994, |
| "train/kl_loss_r1": 0.024249562667682766, |
| "train/total_kl": 0.06390962991863489 |
| }, |
| { |
| "epoch": 1.718333646087446, |
| "grad_norm": 2.1875, |
| "learning_rate": 1.7105855855855858e-05, |
| "loss": 0.7075, |
| "mean_token_accuracy": 0.8981125056743622, |
| "step": 2290, |
| "train/kl_loss_qwen": 0.04942654981277883, |
| "train/kl_loss_r1": 0.027548507088795304, |
| "train/total_kl": 0.07697505690157413 |
| }, |
| { |
| "epoch": 1.7220866954400451, |
| "grad_norm": 2.53125, |
| "learning_rate": 1.7077702702702703e-05, |
| "loss": 0.6808, |
| "mean_token_accuracy": 0.8974245905876159, |
| "step": 2295, |
| "train/kl_loss_qwen": 0.03988172416575253, |
| "train/kl_loss_r1": 0.02420841958373785, |
| "train/total_kl": 0.06409014472737909 |
| }, |
| { |
| "epoch": 1.7258397447926441, |
| "grad_norm": 2.015625, |
| "learning_rate": 1.7049549549549552e-05, |
| "loss": 0.6455, |
| "mean_token_accuracy": 0.8952881097793579, |
| "step": 2300, |
| "train/kl_loss_qwen": 0.03257768559269607, |
| "train/kl_loss_r1": 0.020853790268301965, |
| "train/total_kl": 0.05343147618696094 |
| }, |
| { |
| "epoch": 1.7295927941452431, |
| "grad_norm": 2.3125, |
| "learning_rate": 1.7021396396396398e-05, |
| "loss": 0.7375, |
| "mean_token_accuracy": 0.9050968796014786, |
| "step": 2305, |
| "train/kl_loss_qwen": 0.05414223480038345, |
| "train/kl_loss_r1": 0.03398309061303735, |
| "train/total_kl": 0.08812532611191273 |
| }, |
| { |
| "epoch": 1.7333458434978422, |
| "grad_norm": 2.0625, |
| "learning_rate": 1.6993243243243244e-05, |
| "loss": 0.648, |
| "mean_token_accuracy": 0.9059912174940109, |
| "step": 2310, |
| "train/kl_loss_qwen": 0.04206879851408303, |
| "train/kl_loss_r1": 0.024805049877613783, |
| "train/total_kl": 0.06687384815886617 |
| }, |
| { |
| "epoch": 1.737098892850441, |
| "grad_norm": 2.1875, |
| "learning_rate": 1.6965090090090093e-05, |
| "loss": 0.6396, |
| "mean_token_accuracy": 0.8993474274873734, |
| "step": 2315, |
| "train/kl_loss_qwen": 0.03376688486896455, |
| "train/kl_loss_r1": 0.02014004997909069, |
| "train/total_kl": 0.05390693554654717 |
| }, |
| { |
| "epoch": 1.74085194220304, |
| "grad_norm": 4.09375, |
| "learning_rate": 1.693693693693694e-05, |
| "loss": 0.6538, |
| "mean_token_accuracy": 0.8981065779924393, |
| "step": 2320, |
| "train/kl_loss_qwen": 0.03625017390586436, |
| "train/kl_loss_r1": 0.022838318720459938, |
| "train/total_kl": 0.059088492393493654 |
| }, |
| { |
| "epoch": 1.744604991555639, |
| "grad_norm": 2.609375, |
| "learning_rate": 1.6908783783783784e-05, |
| "loss": 0.6706, |
| "mean_token_accuracy": 0.8976942479610444, |
| "step": 2325, |
| "train/kl_loss_qwen": 0.04188382257707417, |
| "train/kl_loss_r1": 0.023405383294448256, |
| "train/total_kl": 0.06528920531272889 |
| }, |
| { |
| "epoch": 1.748358040908238, |
| "grad_norm": 3.390625, |
| "learning_rate": 1.6880630630630633e-05, |
| "loss": 0.65, |
| "mean_token_accuracy": 0.8928337901830673, |
| "step": 2330, |
| "train/kl_loss_qwen": 0.02700037518516183, |
| "train/kl_loss_r1": 0.018946082750335335, |
| "train/total_kl": 0.045946458261460064 |
| }, |
| { |
| "epoch": 1.7521110902608368, |
| "grad_norm": 2.78125, |
| "learning_rate": 1.685247747747748e-05, |
| "loss": 0.6483, |
| "mean_token_accuracy": 0.8990386724472046, |
| "step": 2335, |
| "train/kl_loss_qwen": 0.038460137275978926, |
| "train/kl_loss_r1": 0.022701377421617507, |
| "train/total_kl": 0.0611615146510303 |
| }, |
| { |
| "epoch": 1.7558641396134358, |
| "grad_norm": 2.171875, |
| "learning_rate": 1.6824324324324324e-05, |
| "loss": 0.6027, |
| "mean_token_accuracy": 0.9036147683858872, |
| "step": 2340, |
| "train/kl_loss_qwen": 0.03626009058207273, |
| "train/kl_loss_r1": 0.020470161689445376, |
| "train/total_kl": 0.056730252131819724 |
| }, |
| { |
| "epoch": 1.7596171889660348, |
| "grad_norm": 2.4375, |
| "learning_rate": 1.6796171171171173e-05, |
| "loss": 0.6522, |
| "mean_token_accuracy": 0.9036729842424392, |
| "step": 2345, |
| "train/kl_loss_qwen": 0.040476148249581456, |
| "train/kl_loss_r1": 0.024120061844587325, |
| "train/total_kl": 0.06459621032699943 |
| }, |
| { |
| "epoch": 1.7633702383186338, |
| "grad_norm": 2.421875, |
| "learning_rate": 1.676801801801802e-05, |
| "loss": 0.6585, |
| "mean_token_accuracy": 0.8919114947319031, |
| "step": 2350, |
| "train/kl_loss_qwen": 0.03886307771317661, |
| "train/kl_loss_r1": 0.02233870788477361, |
| "train/total_kl": 0.061201786156743765 |
| }, |
| { |
| "epoch": 1.7671232876712328, |
| "grad_norm": 3.59375, |
| "learning_rate": 1.6739864864864868e-05, |
| "loss": 0.6984, |
| "mean_token_accuracy": 0.891047352552414, |
| "step": 2355, |
| "train/kl_loss_qwen": 0.03393220230937004, |
| "train/kl_loss_r1": 0.021642787707969548, |
| "train/total_kl": 0.05557498997077346 |
| }, |
| { |
| "epoch": 1.7708763370238318, |
| "grad_norm": 2.546875, |
| "learning_rate": 1.6711711711711714e-05, |
| "loss": 0.63, |
| "mean_token_accuracy": 0.8927449464797974, |
| "step": 2360, |
| "train/kl_loss_qwen": 0.02976813670247793, |
| "train/kl_loss_r1": 0.01950657251290977, |
| "train/total_kl": 0.049274709261953833 |
| }, |
| { |
| "epoch": 1.7746293863764309, |
| "grad_norm": 2.359375, |
| "learning_rate": 1.668355855855856e-05, |
| "loss": 0.6581, |
| "mean_token_accuracy": 0.9035369455814362, |
| "step": 2365, |
| "train/kl_loss_qwen": 0.042285366402938965, |
| "train/kl_loss_r1": 0.024320347933098674, |
| "train/total_kl": 0.06660571470856666 |
| }, |
| { |
| "epoch": 1.7783824357290299, |
| "grad_norm": 2.296875, |
| "learning_rate": 1.665540540540541e-05, |
| "loss": 0.6727, |
| "mean_token_accuracy": 0.902328222990036, |
| "step": 2370, |
| "train/kl_loss_qwen": 0.04390562102198601, |
| "train/kl_loss_r1": 0.025772933289408682, |
| "train/total_kl": 0.06967855421826244 |
| }, |
| { |
| "epoch": 1.782135485081629, |
| "grad_norm": 3.859375, |
| "learning_rate": 1.6627252252252254e-05, |
| "loss": 0.6492, |
| "mean_token_accuracy": 0.8949781268835068, |
| "step": 2375, |
| "train/kl_loss_qwen": 0.03299745530821383, |
| "train/kl_loss_r1": 0.020956188859418034, |
| "train/total_kl": 0.05395364463329315 |
| }, |
| { |
| "epoch": 1.785888534434228, |
| "grad_norm": 2.171875, |
| "learning_rate": 1.65990990990991e-05, |
| "loss": 0.6654, |
| "mean_token_accuracy": 0.9052214354276658, |
| "step": 2380, |
| "train/kl_loss_qwen": 0.04478082228451967, |
| "train/kl_loss_r1": 0.026699409168213607, |
| "train/total_kl": 0.0714802322909236 |
| }, |
| { |
| "epoch": 1.789641583786827, |
| "grad_norm": 2.671875, |
| "learning_rate": 1.657094594594595e-05, |
| "loss": 0.6821, |
| "mean_token_accuracy": 0.8889921605587006, |
| "step": 2385, |
| "train/kl_loss_qwen": 0.027508549252524973, |
| "train/kl_loss_r1": 0.018551756348460912, |
| "train/total_kl": 0.046060305833816526 |
| }, |
| { |
| "epoch": 1.793394633139426, |
| "grad_norm": 2.546875, |
| "learning_rate": 1.6542792792792794e-05, |
| "loss": 0.6535, |
| "mean_token_accuracy": 0.9026600360870362, |
| "step": 2390, |
| "train/kl_loss_qwen": 0.04096120540052652, |
| "train/kl_loss_r1": 0.023385793343186377, |
| "train/total_kl": 0.06434699958190322 |
| }, |
| { |
| "epoch": 1.7971476824920247, |
| "grad_norm": 2.84375, |
| "learning_rate": 1.651463963963964e-05, |
| "loss": 0.6864, |
| "mean_token_accuracy": 0.8991068810224533, |
| "step": 2395, |
| "train/kl_loss_qwen": 0.04450701423920691, |
| "train/kl_loss_r1": 0.026761355437338354, |
| "train/total_kl": 0.07126836953684687 |
| }, |
| { |
| "epoch": 1.8009007318446237, |
| "grad_norm": 2.6875, |
| "learning_rate": 1.648648648648649e-05, |
| "loss": 0.6365, |
| "mean_token_accuracy": 0.9044661819934845, |
| "step": 2400, |
| "train/kl_loss_qwen": 0.035820856038480994, |
| "train/kl_loss_r1": 0.02220798176713288, |
| "train/total_kl": 0.05802883738651872 |
| }, |
| { |
| "epoch": 1.8046537811972228, |
| "grad_norm": 2.265625, |
| "learning_rate": 1.6458333333333335e-05, |
| "loss": 0.6152, |
| "mean_token_accuracy": 0.9035373657941819, |
| "step": 2405, |
| "train/kl_loss_qwen": 0.0363229691516608, |
| "train/kl_loss_r1": 0.022318302607163786, |
| "train/total_kl": 0.05864127120003104 |
| }, |
| { |
| "epoch": 1.8084068305498218, |
| "grad_norm": 2.46875, |
| "learning_rate": 1.6430180180180184e-05, |
| "loss": 0.6387, |
| "mean_token_accuracy": 0.895477882027626, |
| "step": 2410, |
| "train/kl_loss_qwen": 0.027183825010433794, |
| "train/kl_loss_r1": 0.01949266265146434, |
| "train/total_kl": 0.046676487661898136 |
| }, |
| { |
| "epoch": 1.8121598799024206, |
| "grad_norm": 2.171875, |
| "learning_rate": 1.640202702702703e-05, |
| "loss": 0.6954, |
| "mean_token_accuracy": 0.8863406032323837, |
| "step": 2415, |
| "train/kl_loss_qwen": 0.042424371792003514, |
| "train/kl_loss_r1": 0.023042496014386415, |
| "train/total_kl": 0.06546686785295605 |
| }, |
| { |
| "epoch": 1.8159129292550196, |
| "grad_norm": 2.296875, |
| "learning_rate": 1.6373873873873875e-05, |
| "loss": 0.6458, |
| "mean_token_accuracy": 0.8962538540363312, |
| "step": 2420, |
| "train/kl_loss_qwen": 0.03665523463860154, |
| "train/kl_loss_r1": 0.021400606958195567, |
| "train/total_kl": 0.05805584192276001 |
| }, |
| { |
| "epoch": 1.8196659786076186, |
| "grad_norm": 2.25, |
| "learning_rate": 1.6345720720720724e-05, |
| "loss": 0.6925, |
| "mean_token_accuracy": 0.8971156001091003, |
| "step": 2425, |
| "train/kl_loss_qwen": 0.045820884173735976, |
| "train/kl_loss_r1": 0.026553369453176857, |
| "train/total_kl": 0.07237425344064832 |
| }, |
| { |
| "epoch": 1.8234190279602176, |
| "grad_norm": 2.234375, |
| "learning_rate": 1.631756756756757e-05, |
| "loss": 0.6525, |
| "mean_token_accuracy": 0.8997704178094864, |
| "step": 2430, |
| "train/kl_loss_qwen": 0.04271438363939524, |
| "train/kl_loss_r1": 0.023357636108994485, |
| "train/total_kl": 0.06607202040031553 |
| }, |
| { |
| "epoch": 1.8271720773128166, |
| "grad_norm": 2.65625, |
| "learning_rate": 1.6289414414414415e-05, |
| "loss": 0.6964, |
| "mean_token_accuracy": 0.8842611312866211, |
| "step": 2435, |
| "train/kl_loss_qwen": 0.029302482306957246, |
| "train/kl_loss_r1": 0.019395927991718055, |
| "train/total_kl": 0.048698410671204326 |
| }, |
| { |
| "epoch": 1.8309251266654156, |
| "grad_norm": 2.6875, |
| "learning_rate": 1.6261261261261264e-05, |
| "loss": 0.6202, |
| "mean_token_accuracy": 0.9004896342754364, |
| "step": 2440, |
| "train/kl_loss_qwen": 0.03328801547177136, |
| "train/kl_loss_r1": 0.021958896471187473, |
| "train/total_kl": 0.055246911384165286 |
| }, |
| { |
| "epoch": 1.8346781760180146, |
| "grad_norm": 2.359375, |
| "learning_rate": 1.623310810810811e-05, |
| "loss": 0.6904, |
| "mean_token_accuracy": 0.8995136767625809, |
| "step": 2445, |
| "train/kl_loss_qwen": 0.04684069836512208, |
| "train/kl_loss_r1": 0.026657813135534524, |
| "train/total_kl": 0.07349851159378887 |
| }, |
| { |
| "epoch": 1.8384312253706137, |
| "grad_norm": 2.03125, |
| "learning_rate": 1.6204954954954956e-05, |
| "loss": 0.658, |
| "mean_token_accuracy": 0.9060713022947311, |
| "step": 2450, |
| "train/kl_loss_qwen": 0.044447452668100594, |
| "train/kl_loss_r1": 0.025366590777412056, |
| "train/total_kl": 0.069814043212682 |
| }, |
| { |
| "epoch": 1.8421842747232127, |
| "grad_norm": 3.03125, |
| "learning_rate": 1.6176801801801805e-05, |
| "loss": 0.6285, |
| "mean_token_accuracy": 0.8991561025381088, |
| "step": 2455, |
| "train/kl_loss_qwen": 0.029106603050604463, |
| "train/kl_loss_r1": 0.019336808985099197, |
| "train/total_kl": 0.04844341184943914 |
| }, |
| { |
| "epoch": 1.8459373240758117, |
| "grad_norm": 2.375, |
| "learning_rate": 1.614864864864865e-05, |
| "loss": 0.6394, |
| "mean_token_accuracy": 0.8926957219839096, |
| "step": 2460, |
| "train/kl_loss_qwen": 0.03371071880683303, |
| "train/kl_loss_r1": 0.022470697574317456, |
| "train/total_kl": 0.0561814159154892 |
| }, |
| { |
| "epoch": 1.8496903734284107, |
| "grad_norm": 2.5, |
| "learning_rate": 1.6120495495495496e-05, |
| "loss": 0.6631, |
| "mean_token_accuracy": 0.8949247121810913, |
| "step": 2465, |
| "train/kl_loss_qwen": 0.03434062139131129, |
| "train/kl_loss_r1": 0.022925343550741672, |
| "train/total_kl": 0.05726596564054489 |
| }, |
| { |
| "epoch": 1.8534434227810097, |
| "grad_norm": 2.25, |
| "learning_rate": 1.6092342342342345e-05, |
| "loss": 0.6486, |
| "mean_token_accuracy": 0.8995777875185013, |
| "step": 2470, |
| "train/kl_loss_qwen": 0.03591888290829957, |
| "train/kl_loss_r1": 0.022369566606357694, |
| "train/total_kl": 0.05828845025971532 |
| }, |
| { |
| "epoch": 1.8571964721336087, |
| "grad_norm": 2.125, |
| "learning_rate": 1.606418918918919e-05, |
| "loss": 0.624, |
| "mean_token_accuracy": 0.8977777779102325, |
| "step": 2475, |
| "train/kl_loss_qwen": 0.03605815744958818, |
| "train/kl_loss_r1": 0.021802827855572103, |
| "train/total_kl": 0.057860984653234485 |
| }, |
| { |
| "epoch": 1.8609495214862075, |
| "grad_norm": 2.53125, |
| "learning_rate": 1.603603603603604e-05, |
| "loss": 0.6602, |
| "mean_token_accuracy": 0.8929906249046325, |
| "step": 2480, |
| "train/kl_loss_qwen": 0.03511486439965665, |
| "train/kl_loss_r1": 0.021810925099998713, |
| "train/total_kl": 0.056925789546221496 |
| }, |
| { |
| "epoch": 1.8647025708388065, |
| "grad_norm": 2.171875, |
| "learning_rate": 1.6007882882882885e-05, |
| "loss": 0.628, |
| "mean_token_accuracy": 0.9025939643383026, |
| "step": 2485, |
| "train/kl_loss_qwen": 0.03195135928690433, |
| "train/kl_loss_r1": 0.020892154052853586, |
| "train/total_kl": 0.05284351296722889 |
| }, |
| { |
| "epoch": 1.8684556201914055, |
| "grad_norm": 5.0, |
| "learning_rate": 1.597972972972973e-05, |
| "loss": 0.7183, |
| "mean_token_accuracy": 0.8897970050573349, |
| "step": 2490, |
| "train/kl_loss_qwen": 0.04254669458605349, |
| "train/kl_loss_r1": 0.028625112492591143, |
| "train/total_kl": 0.07117180703207851 |
| }, |
| { |
| "epoch": 1.8722086695440046, |
| "grad_norm": 2.234375, |
| "learning_rate": 1.595157657657658e-05, |
| "loss": 0.6634, |
| "mean_token_accuracy": 0.9010548859834671, |
| "step": 2495, |
| "train/kl_loss_qwen": 0.043688770523294805, |
| "train/kl_loss_r1": 0.02604842819273472, |
| "train/total_kl": 0.0697371986694634 |
| }, |
| { |
| "epoch": 1.8759617188966033, |
| "grad_norm": 2.828125, |
| "learning_rate": 1.5923423423423422e-05, |
| "loss": 0.6302, |
| "mean_token_accuracy": 0.8924409061670303, |
| "step": 2500, |
| "train/kl_loss_qwen": 0.03589551253244281, |
| "train/kl_loss_r1": 0.021566737676039338, |
| "train/total_kl": 0.057462250161916015 |
| }, |
| { |
| "epoch": 1.8797147682492024, |
| "grad_norm": 3.140625, |
| "learning_rate": 1.5895270270270268e-05, |
| "loss": 0.6238, |
| "mean_token_accuracy": 0.8932481467723846, |
| "step": 2505, |
| "train/kl_loss_qwen": 0.03078452721238136, |
| "train/kl_loss_r1": 0.01884332112967968, |
| "train/total_kl": 0.04962784806266427 |
| }, |
| { |
| "epoch": 1.8834678176018014, |
| "grad_norm": 2.328125, |
| "learning_rate": 1.5867117117117117e-05, |
| "loss": 0.6864, |
| "mean_token_accuracy": 0.9002302587032318, |
| "step": 2510, |
| "train/kl_loss_qwen": 0.040710377506911755, |
| "train/kl_loss_r1": 0.027830192539840936, |
| "train/total_kl": 0.06854057023301721 |
| }, |
| { |
| "epoch": 1.8872208669544004, |
| "grad_norm": 2.265625, |
| "learning_rate": 1.5838963963963963e-05, |
| "loss": 0.685, |
| "mean_token_accuracy": 0.9001519799232482, |
| "step": 2515, |
| "train/kl_loss_qwen": 0.04527458641678095, |
| "train/kl_loss_r1": 0.027129481686279176, |
| "train/total_kl": 0.07240406852215528 |
| }, |
| { |
| "epoch": 1.8909739163069994, |
| "grad_norm": 4.4375, |
| "learning_rate": 1.5810810810810808e-05, |
| "loss": 0.734, |
| "mean_token_accuracy": 0.8838595479726792, |
| "step": 2520, |
| "train/kl_loss_qwen": 0.04631765298545361, |
| "train/kl_loss_r1": 0.02677953545935452, |
| "train/total_kl": 0.07309718886390329 |
| }, |
| { |
| "epoch": 1.8947269656595984, |
| "grad_norm": 2.046875, |
| "learning_rate": 1.5782657657657657e-05, |
| "loss": 0.6364, |
| "mean_token_accuracy": 0.897225198149681, |
| "step": 2525, |
| "train/kl_loss_qwen": 0.03321312516927719, |
| "train/kl_loss_r1": 0.021134045580402015, |
| "train/total_kl": 0.054347170796245334 |
| }, |
| { |
| "epoch": 1.8984800150121974, |
| "grad_norm": 1.984375, |
| "learning_rate": 1.5754504504504503e-05, |
| "loss": 0.6595, |
| "mean_token_accuracy": 0.9082975298166275, |
| "step": 2530, |
| "train/kl_loss_qwen": 0.046546011511236426, |
| "train/kl_loss_r1": 0.027138574048876762, |
| "train/total_kl": 0.07368458630517125 |
| }, |
| { |
| "epoch": 1.9022330643647964, |
| "grad_norm": 2.5625, |
| "learning_rate": 1.572635135135135e-05, |
| "loss": 0.6913, |
| "mean_token_accuracy": 0.8941433936357498, |
| "step": 2535, |
| "train/kl_loss_qwen": 0.042869471944868565, |
| "train/kl_loss_r1": 0.024872014205902813, |
| "train/total_kl": 0.06774148521944881 |
| }, |
| { |
| "epoch": 1.9059861137173955, |
| "grad_norm": 3.90625, |
| "learning_rate": 1.5698198198198198e-05, |
| "loss": 0.6445, |
| "mean_token_accuracy": 0.8958324611186981, |
| "step": 2540, |
| "train/kl_loss_qwen": 0.026003137696534395, |
| "train/kl_loss_r1": 0.01718523451127112, |
| "train/total_kl": 0.04318837262690067 |
| }, |
| { |
| "epoch": 1.9097391630699945, |
| "grad_norm": 2.34375, |
| "learning_rate": 1.5670045045045043e-05, |
| "loss": 0.6107, |
| "mean_token_accuracy": 0.9057632029056549, |
| "step": 2545, |
| "train/kl_loss_qwen": 0.028932252386584877, |
| "train/kl_loss_r1": 0.019510349445044994, |
| "train/total_kl": 0.04844260262325406 |
| }, |
| { |
| "epoch": 1.9134922124225935, |
| "grad_norm": 2.890625, |
| "learning_rate": 1.5641891891891892e-05, |
| "loss": 0.6741, |
| "mean_token_accuracy": 0.898052641749382, |
| "step": 2550, |
| "train/kl_loss_qwen": 0.04487997838295996, |
| "train/kl_loss_r1": 0.02543866541236639, |
| "train/total_kl": 0.07031864309683442 |
| }, |
| { |
| "epoch": 1.9172452617751925, |
| "grad_norm": 2.671875, |
| "learning_rate": 1.5613738738738738e-05, |
| "loss": 0.6402, |
| "mean_token_accuracy": 0.8991858065128326, |
| "step": 2555, |
| "train/kl_loss_qwen": 0.036262226989492774, |
| "train/kl_loss_r1": 0.021829276252537964, |
| "train/total_kl": 0.05809150356799364 |
| }, |
| { |
| "epoch": 1.9209983111277913, |
| "grad_norm": 2.234375, |
| "learning_rate": 1.5585585585585584e-05, |
| "loss": 0.6416, |
| "mean_token_accuracy": 0.9058014422655105, |
| "step": 2560, |
| "train/kl_loss_qwen": 0.04190314500592649, |
| "train/kl_loss_r1": 0.022653905022889376, |
| "train/total_kl": 0.06455705035477877 |
| }, |
| { |
| "epoch": 1.9247513604803903, |
| "grad_norm": 1.890625, |
| "learning_rate": 1.5557432432432433e-05, |
| "loss": 0.6556, |
| "mean_token_accuracy": 0.9057673960924149, |
| "step": 2565, |
| "train/kl_loss_qwen": 0.04168571154586971, |
| "train/kl_loss_r1": 0.02547265887260437, |
| "train/total_kl": 0.06715837102383375 |
| }, |
| { |
| "epoch": 1.9285044098329893, |
| "grad_norm": 2.03125, |
| "learning_rate": 1.5529279279279278e-05, |
| "loss": 0.6949, |
| "mean_token_accuracy": 0.8979399770498275, |
| "step": 2570, |
| "train/kl_loss_qwen": 0.044487979961559176, |
| "train/kl_loss_r1": 0.024335165927186608, |
| "train/total_kl": 0.0688231460750103 |
| }, |
| { |
| "epoch": 1.9322574591855883, |
| "grad_norm": 2.671875, |
| "learning_rate": 1.5501126126126124e-05, |
| "loss": 0.6949, |
| "mean_token_accuracy": 0.8990555852651596, |
| "step": 2575, |
| "train/kl_loss_qwen": 0.044843436265364287, |
| "train/kl_loss_r1": 0.025624512927606702, |
| "train/total_kl": 0.07046794975176454 |
| }, |
| { |
| "epoch": 1.9360105085381871, |
| "grad_norm": 2.421875, |
| "learning_rate": 1.5472972972972973e-05, |
| "loss": 0.6969, |
| "mean_token_accuracy": 0.8940569669008255, |
| "step": 2580, |
| "train/kl_loss_qwen": 0.04509501978754997, |
| "train/kl_loss_r1": 0.022757333144545554, |
| "train/total_kl": 0.06785235274583101 |
| }, |
| { |
| "epoch": 1.9397635578907861, |
| "grad_norm": 2.078125, |
| "learning_rate": 1.544481981981982e-05, |
| "loss": 0.6293, |
| "mean_token_accuracy": 0.8902778685092926, |
| "step": 2585, |
| "train/kl_loss_qwen": 0.025324915908277033, |
| "train/kl_loss_r1": 0.0162981690838933, |
| "train/total_kl": 0.04162308508530259 |
| }, |
| { |
| "epoch": 1.9435166072433852, |
| "grad_norm": 2.3125, |
| "learning_rate": 1.5416666666666664e-05, |
| "loss": 0.6761, |
| "mean_token_accuracy": 0.8929882168769836, |
| "step": 2590, |
| "train/kl_loss_qwen": 0.044043076876550916, |
| "train/kl_loss_r1": 0.02439775476232171, |
| "train/total_kl": 0.06844083098694682 |
| }, |
| { |
| "epoch": 1.9472696565959842, |
| "grad_norm": 2.265625, |
| "learning_rate": 1.5388513513513513e-05, |
| "loss": 0.6411, |
| "mean_token_accuracy": 0.8958060652017593, |
| "step": 2595, |
| "train/kl_loss_qwen": 0.0404059233609587, |
| "train/kl_loss_r1": 0.022264586249366402, |
| "train/total_kl": 0.06267051044851542 |
| }, |
| { |
| "epoch": 1.9510227059485832, |
| "grad_norm": 2.40625, |
| "learning_rate": 1.536036036036036e-05, |
| "loss": 0.6775, |
| "mean_token_accuracy": 0.8902673900127411, |
| "step": 2600, |
| "train/kl_loss_qwen": 0.0354644276201725, |
| "train/kl_loss_r1": 0.022069192258641124, |
| "train/total_kl": 0.05753362011164427 |
| }, |
| { |
| "epoch": 1.9547757553011822, |
| "grad_norm": 2.375, |
| "learning_rate": 1.5332207207207205e-05, |
| "loss": 0.6194, |
| "mean_token_accuracy": 0.9009991466999054, |
| "step": 2605, |
| "train/kl_loss_qwen": 0.03405302995815873, |
| "train/kl_loss_r1": 0.020596451964229344, |
| "train/total_kl": 0.054649482294917104 |
| }, |
| { |
| "epoch": 1.9585288046537812, |
| "grad_norm": 2.5625, |
| "learning_rate": 1.5304054054054054e-05, |
| "loss": 0.6243, |
| "mean_token_accuracy": 0.901807826757431, |
| "step": 2610, |
| "train/kl_loss_qwen": 0.03377542248927057, |
| "train/kl_loss_r1": 0.019333705538883805, |
| "train/total_kl": 0.05310912802815437 |
| }, |
| { |
| "epoch": 1.9622818540063802, |
| "grad_norm": 2.34375, |
| "learning_rate": 1.52759009009009e-05, |
| "loss": 0.6525, |
| "mean_token_accuracy": 0.8945951163768768, |
| "step": 2615, |
| "train/kl_loss_qwen": 0.03728666617535055, |
| "train/kl_loss_r1": 0.023089352110400797, |
| "train/total_kl": 0.06037601875141263 |
| }, |
| { |
| "epoch": 1.9660349033589792, |
| "grad_norm": 2.3125, |
| "learning_rate": 1.5247747747747747e-05, |
| "loss": 0.6656, |
| "mean_token_accuracy": 0.8967136681079865, |
| "step": 2620, |
| "train/kl_loss_qwen": 0.040263551147654654, |
| "train/kl_loss_r1": 0.02349916808307171, |
| "train/total_kl": 0.06376271946355701 |
| }, |
| { |
| "epoch": 1.9697879527115782, |
| "grad_norm": 2.484375, |
| "learning_rate": 1.5219594594594594e-05, |
| "loss": 0.7433, |
| "mean_token_accuracy": 0.8890212267637253, |
| "step": 2625, |
| "train/kl_loss_qwen": 0.04862540089525282, |
| "train/kl_loss_r1": 0.02606220580637455, |
| "train/total_kl": 0.07468760693445801 |
| }, |
| { |
| "epoch": 1.9735410020641773, |
| "grad_norm": 2.765625, |
| "learning_rate": 1.5191441441441441e-05, |
| "loss": 0.6326, |
| "mean_token_accuracy": 0.905896446108818, |
| "step": 2630, |
| "train/kl_loss_qwen": 0.036712908372282985, |
| "train/kl_loss_r1": 0.022241059923544526, |
| "train/total_kl": 0.05895396815612912 |
| }, |
| { |
| "epoch": 1.9772940514167763, |
| "grad_norm": 2.328125, |
| "learning_rate": 1.5163288288288287e-05, |
| "loss": 0.61, |
| "mean_token_accuracy": 0.8993132084608078, |
| "step": 2635, |
| "train/kl_loss_qwen": 0.030034108366817237, |
| "train/kl_loss_r1": 0.019998513581231236, |
| "train/total_kl": 0.050032622180879116 |
| }, |
| { |
| "epoch": 1.981047100769375, |
| "grad_norm": 1.9609375, |
| "learning_rate": 1.5135135135135134e-05, |
| "loss": 0.7277, |
| "mean_token_accuracy": 0.8941838622093201, |
| "step": 2640, |
| "train/kl_loss_qwen": 0.045652749948203564, |
| "train/kl_loss_r1": 0.02867605178616941, |
| "train/total_kl": 0.07432880057021976 |
| }, |
| { |
| "epoch": 1.984800150121974, |
| "grad_norm": 2.34375, |
| "learning_rate": 1.5106981981981982e-05, |
| "loss": 0.6712, |
| "mean_token_accuracy": 0.9011097520589828, |
| "step": 2645, |
| "train/kl_loss_qwen": 0.04273656592704356, |
| "train/kl_loss_r1": 0.024876082316040993, |
| "train/total_kl": 0.06761264828965068 |
| }, |
| { |
| "epoch": 1.988553199474573, |
| "grad_norm": 2.15625, |
| "learning_rate": 1.5078828828828827e-05, |
| "loss": 0.6631, |
| "mean_token_accuracy": 0.9097787618637085, |
| "step": 2650, |
| "train/kl_loss_qwen": 0.04512282339856029, |
| "train/kl_loss_r1": 0.02762483968399465, |
| "train/total_kl": 0.07274766266345978 |
| }, |
| { |
| "epoch": 1.992306248827172, |
| "grad_norm": 2.421875, |
| "learning_rate": 1.5050675675675674e-05, |
| "loss": 0.7407, |
| "mean_token_accuracy": 0.8982425272464752, |
| "step": 2655, |
| "train/kl_loss_qwen": 0.05134777058847249, |
| "train/kl_loss_r1": 0.03388720662333071, |
| "train/total_kl": 0.08523497739806771 |
| }, |
| { |
| "epoch": 1.996059298179771, |
| "grad_norm": 2.546875, |
| "learning_rate": 1.5022522522522522e-05, |
| "loss": 0.6543, |
| "mean_token_accuracy": 0.8952676713466644, |
| "step": 2660, |
| "train/kl_loss_qwen": 0.034134725807234645, |
| "train/kl_loss_r1": 0.022086436208337546, |
| "train/total_kl": 0.05622116271406412 |
| }, |
| { |
| "epoch": 1.99981234753237, |
| "grad_norm": 2.78125, |
| "learning_rate": 1.4994369369369371e-05, |
| "loss": 0.6699, |
| "mean_token_accuracy": 0.905188474059105, |
| "step": 2665, |
| "train/kl_loss_qwen": 0.04267058554105461, |
| "train/kl_loss_r1": 0.025924119912087918, |
| "train/total_kl": 0.06859470587223768 |
| }, |
| { |
| "epoch": 2.003002439482079, |
| "grad_norm": 2.671875, |
| "learning_rate": 1.4966216216216217e-05, |
| "loss": 0.5866, |
| "mean_token_accuracy": 0.9284321490456077, |
| "step": 2670, |
| "train/kl_loss_qwen": 0.03529138786389547, |
| "train/kl_loss_r1": 0.022011635715470594, |
| "train/total_kl": 0.05730302390806815 |
| }, |
| { |
| "epoch": 2.006755488834678, |
| "grad_norm": 1.6328125, |
| "learning_rate": 1.4938063063063064e-05, |
| "loss": 0.5229, |
| "mean_token_accuracy": 0.9346529483795166, |
| "step": 2675, |
| "train/kl_loss_qwen": 0.038794494094327094, |
| "train/kl_loss_r1": 0.020536230690777302, |
| "train/total_kl": 0.05933072408661246 |
| }, |
| { |
| "epoch": 2.010508538187277, |
| "grad_norm": 1.890625, |
| "learning_rate": 1.4909909909909911e-05, |
| "loss": 0.5382, |
| "mean_token_accuracy": 0.9333297491073609, |
| "step": 2680, |
| "train/kl_loss_qwen": 0.039200321026146415, |
| "train/kl_loss_r1": 0.02334402627311647, |
| "train/total_kl": 0.06254434688016772 |
| }, |
| { |
| "epoch": 2.014261587539876, |
| "grad_norm": 1.640625, |
| "learning_rate": 1.4881756756756757e-05, |
| "loss": 0.5865, |
| "mean_token_accuracy": 0.9402651727199555, |
| "step": 2685, |
| "train/kl_loss_qwen": 0.05096025592647493, |
| "train/kl_loss_r1": 0.02823121869005263, |
| "train/total_kl": 0.07919147480279207 |
| }, |
| { |
| "epoch": 2.018014636892475, |
| "grad_norm": 1.6328125, |
| "learning_rate": 1.4853603603603604e-05, |
| "loss": 0.5996, |
| "mean_token_accuracy": 0.9371675610542297, |
| "step": 2690, |
| "train/kl_loss_qwen": 0.05012912107631564, |
| "train/kl_loss_r1": 0.02651134324260056, |
| "train/total_kl": 0.07664046408608556 |
| }, |
| { |
| "epoch": 2.021767686245074, |
| "grad_norm": 1.546875, |
| "learning_rate": 1.4825450450450452e-05, |
| "loss": 0.5284, |
| "mean_token_accuracy": 0.9431761652231216, |
| "step": 2695, |
| "train/kl_loss_qwen": 0.040003891987726095, |
| "train/kl_loss_r1": 0.023336136527359486, |
| "train/total_kl": 0.06334002930670976 |
| }, |
| { |
| "epoch": 2.025520735597673, |
| "grad_norm": 1.7734375, |
| "learning_rate": 1.4797297297297299e-05, |
| "loss": 0.5389, |
| "mean_token_accuracy": 0.9353849530220032, |
| "step": 2700, |
| "train/kl_loss_qwen": 0.04013286265544593, |
| "train/kl_loss_r1": 0.023519261833280326, |
| "train/total_kl": 0.06365212500095367 |
| }, |
| { |
| "epoch": 2.029273784950272, |
| "grad_norm": 1.59375, |
| "learning_rate": 1.4769144144144144e-05, |
| "loss": 0.5444, |
| "mean_token_accuracy": 0.9298721730709076, |
| "step": 2705, |
| "train/kl_loss_qwen": 0.03505720882676542, |
| "train/kl_loss_r1": 0.020959292305633426, |
| "train/total_kl": 0.056016501411795615 |
| }, |
| { |
| "epoch": 2.0330268343028712, |
| "grad_norm": 2.390625, |
| "learning_rate": 1.4740990990990992e-05, |
| "loss": 0.5417, |
| "mean_token_accuracy": 0.9301694184541702, |
| "step": 2710, |
| "train/kl_loss_qwen": 0.03806868428364396, |
| "train/kl_loss_r1": 0.022985676769167185, |
| "train/total_kl": 0.06105436040088534 |
| }, |
| { |
| "epoch": 2.0367798836554702, |
| "grad_norm": 3.109375, |
| "learning_rate": 1.471283783783784e-05, |
| "loss": 0.6252, |
| "mean_token_accuracy": 0.936267939209938, |
| "step": 2715, |
| "train/kl_loss_qwen": 0.051870274590328336, |
| "train/kl_loss_r1": 0.02979482486844063, |
| "train/total_kl": 0.0816650996915996 |
| }, |
| { |
| "epoch": 2.0405329330080693, |
| "grad_norm": 1.8984375, |
| "learning_rate": 1.4684684684684685e-05, |
| "loss": 0.5434, |
| "mean_token_accuracy": 0.9378133803606034, |
| "step": 2720, |
| "train/kl_loss_qwen": 0.04338777447119355, |
| "train/kl_loss_r1": 0.02462744093500078, |
| "train/total_kl": 0.0680152153596282 |
| }, |
| { |
| "epoch": 2.044285982360668, |
| "grad_norm": 2.40625, |
| "learning_rate": 1.4656531531531532e-05, |
| "loss": 0.5725, |
| "mean_token_accuracy": 0.9371558010578156, |
| "step": 2725, |
| "train/kl_loss_qwen": 0.04540781215764582, |
| "train/kl_loss_r1": 0.02494020722806454, |
| "train/total_kl": 0.07034801943227649 |
| }, |
| { |
| "epoch": 2.048039031713267, |
| "grad_norm": 2.109375, |
| "learning_rate": 1.462837837837838e-05, |
| "loss": 0.541, |
| "mean_token_accuracy": 0.9365566194057464, |
| "step": 2730, |
| "train/kl_loss_qwen": 0.03833492188714445, |
| "train/kl_loss_r1": 0.024261068552732468, |
| "train/total_kl": 0.06259599067270756 |
| }, |
| { |
| "epoch": 2.051792081065866, |
| "grad_norm": 2.171875, |
| "learning_rate": 1.4600225225225227e-05, |
| "loss": 0.5604, |
| "mean_token_accuracy": 0.9367622673511505, |
| "step": 2735, |
| "train/kl_loss_qwen": 0.04242282547056675, |
| "train/kl_loss_r1": 0.02575512886978686, |
| "train/total_kl": 0.06817795345559716 |
| }, |
| { |
| "epoch": 2.055545130418465, |
| "grad_norm": 1.90625, |
| "learning_rate": 1.4572072072072072e-05, |
| "loss": 0.5316, |
| "mean_token_accuracy": 0.9340348184108734, |
| "step": 2740, |
| "train/kl_loss_qwen": 0.034276322834193705, |
| "train/kl_loss_r1": 0.021242431038990615, |
| "train/total_kl": 0.05551875364035368 |
| }, |
| { |
| "epoch": 2.059298179771064, |
| "grad_norm": 1.9453125, |
| "learning_rate": 1.454391891891892e-05, |
| "loss": 0.5167, |
| "mean_token_accuracy": 0.9383042812347412, |
| "step": 2745, |
| "train/kl_loss_qwen": 0.03480586018413305, |
| "train/kl_loss_r1": 0.022361103910952806, |
| "train/total_kl": 0.05716696446761489 |
| }, |
| { |
| "epoch": 2.063051229123663, |
| "grad_norm": 1.859375, |
| "learning_rate": 1.4515765765765767e-05, |
| "loss": 0.5128, |
| "mean_token_accuracy": 0.9425839811563492, |
| "step": 2750, |
| "train/kl_loss_qwen": 0.037367559224367144, |
| "train/kl_loss_r1": 0.02356030042283237, |
| "train/total_kl": 0.0609278591349721 |
| }, |
| { |
| "epoch": 2.066804278476262, |
| "grad_norm": 1.796875, |
| "learning_rate": 1.4487612612612613e-05, |
| "loss": 0.5459, |
| "mean_token_accuracy": 0.9433245003223419, |
| "step": 2755, |
| "train/kl_loss_qwen": 0.04606554531492293, |
| "train/kl_loss_r1": 0.026836787583306432, |
| "train/total_kl": 0.07290233206003904 |
| }, |
| { |
| "epoch": 2.070557327828861, |
| "grad_norm": 1.828125, |
| "learning_rate": 1.445945945945946e-05, |
| "loss": 0.5175, |
| "mean_token_accuracy": 0.9421418130397796, |
| "step": 2760, |
| "train/kl_loss_qwen": 0.039062590803951025, |
| "train/kl_loss_r1": 0.02469899938441813, |
| "train/total_kl": 0.063761589769274 |
| }, |
| { |
| "epoch": 2.07431037718146, |
| "grad_norm": 2.734375, |
| "learning_rate": 1.4431306306306307e-05, |
| "loss": 0.5476, |
| "mean_token_accuracy": 0.9274614602327347, |
| "step": 2765, |
| "train/kl_loss_qwen": 0.03057148279622197, |
| "train/kl_loss_r1": 0.020619633514434098, |
| "train/total_kl": 0.05119111640378833 |
| }, |
| { |
| "epoch": 2.078063426534059, |
| "grad_norm": 1.875, |
| "learning_rate": 1.4403153153153155e-05, |
| "loss": 0.52, |
| "mean_token_accuracy": 0.9378704875707626, |
| "step": 2770, |
| "train/kl_loss_qwen": 0.03401905889622867, |
| "train/kl_loss_r1": 0.02245729574933648, |
| "train/total_kl": 0.056476354505866765 |
| }, |
| { |
| "epoch": 2.081816475886658, |
| "grad_norm": 1.9453125, |
| "learning_rate": 1.4375e-05, |
| "loss": 0.5465, |
| "mean_token_accuracy": 0.943485426902771, |
| "step": 2775, |
| "train/kl_loss_qwen": 0.043185991467908025, |
| "train/kl_loss_r1": 0.0270145779941231, |
| "train/total_kl": 0.07020056927576661 |
| }, |
| { |
| "epoch": 2.085569525239257, |
| "grad_norm": 2.15625, |
| "learning_rate": 1.4346846846846848e-05, |
| "loss": 0.5808, |
| "mean_token_accuracy": 0.9374119788408279, |
| "step": 2780, |
| "train/kl_loss_qwen": 0.04530818494968116, |
| "train/kl_loss_r1": 0.026854591304436327, |
| "train/total_kl": 0.07216277718544006 |
| }, |
| { |
| "epoch": 2.089322574591856, |
| "grad_norm": 2.109375, |
| "learning_rate": 1.4318693693693695e-05, |
| "loss": 0.538, |
| "mean_token_accuracy": 0.9360768616199493, |
| "step": 2785, |
| "train/kl_loss_qwen": 0.04038170026615262, |
| "train/kl_loss_r1": 0.023084452422335745, |
| "train/total_kl": 0.06346615301445127 |
| }, |
| { |
| "epoch": 2.093075623944455, |
| "grad_norm": 1.8046875, |
| "learning_rate": 1.429054054054054e-05, |
| "loss": 0.557, |
| "mean_token_accuracy": 0.9383584886789322, |
| "step": 2790, |
| "train/kl_loss_qwen": 0.04247748665511608, |
| "train/kl_loss_r1": 0.024677752703428268, |
| "train/total_kl": 0.0671552394516766 |
| }, |
| { |
| "epoch": 2.096828673297054, |
| "grad_norm": 3.46875, |
| "learning_rate": 1.4262387387387388e-05, |
| "loss": 0.5629, |
| "mean_token_accuracy": 0.9350256085395813, |
| "step": 2795, |
| "train/kl_loss_qwen": 0.03826589668169618, |
| "train/kl_loss_r1": 0.022944721672683955, |
| "train/total_kl": 0.061210617609322074 |
| }, |
| { |
| "epoch": 2.100581722649653, |
| "grad_norm": 1.9453125, |
| "learning_rate": 1.4234234234234235e-05, |
| "loss": 0.5308, |
| "mean_token_accuracy": 0.939920824766159, |
| "step": 2800, |
| "train/kl_loss_qwen": 0.038421140238642695, |
| "train/kl_loss_r1": 0.024384385114535688, |
| "train/total_kl": 0.06280552502721548 |
| }, |
| { |
| "epoch": 2.104334772002252, |
| "grad_norm": 1.8203125, |
| "learning_rate": 1.4206081081081083e-05, |
| "loss": 0.5652, |
| "mean_token_accuracy": 0.9412952274084091, |
| "step": 2805, |
| "train/kl_loss_qwen": 0.04530099257826805, |
| "train/kl_loss_r1": 0.026747741783037782, |
| "train/total_kl": 0.07204873552545905 |
| }, |
| { |
| "epoch": 2.1080878213548506, |
| "grad_norm": 1.8984375, |
| "learning_rate": 1.4177927927927928e-05, |
| "loss": 0.6096, |
| "mean_token_accuracy": 0.930394884943962, |
| "step": 2810, |
| "train/kl_loss_qwen": 0.04740149336867035, |
| "train/kl_loss_r1": 0.026018257485702634, |
| "train/total_kl": 0.07341975113376975 |
| }, |
| { |
| "epoch": 2.1118408707074496, |
| "grad_norm": 2.171875, |
| "learning_rate": 1.4149774774774776e-05, |
| "loss": 0.5226, |
| "mean_token_accuracy": 0.9398204326629639, |
| "step": 2815, |
| "train/kl_loss_qwen": 0.03849638062529266, |
| "train/kl_loss_r1": 0.023003754345700143, |
| "train/total_kl": 0.061500134877860546 |
| }, |
| { |
| "epoch": 2.1155939200600486, |
| "grad_norm": 2.625, |
| "learning_rate": 1.4121621621621623e-05, |
| "loss": 0.5582, |
| "mean_token_accuracy": 0.9342907398939133, |
| "step": 2820, |
| "train/kl_loss_qwen": 0.042439007526263596, |
| "train/kl_loss_r1": 0.023711348557844757, |
| "train/total_kl": 0.06615035515278578 |
| }, |
| { |
| "epoch": 2.1193469694126477, |
| "grad_norm": 2.171875, |
| "learning_rate": 1.4093468468468469e-05, |
| "loss": 0.563, |
| "mean_token_accuracy": 0.9395235121250153, |
| "step": 2825, |
| "train/kl_loss_qwen": 0.043938075797632335, |
| "train/kl_loss_r1": 0.025616383599117398, |
| "train/total_kl": 0.06955445893108844 |
| }, |
| { |
| "epoch": 2.1231000187652467, |
| "grad_norm": 2.625, |
| "learning_rate": 1.4065315315315316e-05, |
| "loss": 0.5054, |
| "mean_token_accuracy": 0.9369919955730438, |
| "step": 2830, |
| "train/kl_loss_qwen": 0.03191206702031195, |
| "train/kl_loss_r1": 0.02116851476021111, |
| "train/total_kl": 0.053080581780523065 |
| }, |
| { |
| "epoch": 2.1268530681178457, |
| "grad_norm": 2.046875, |
| "learning_rate": 1.4037162162162163e-05, |
| "loss": 0.5352, |
| "mean_token_accuracy": 0.9313021749258041, |
| "step": 2835, |
| "train/kl_loss_qwen": 0.034244656283408406, |
| "train/kl_loss_r1": 0.02085883393883705, |
| "train/total_kl": 0.05510349003598094 |
| }, |
| { |
| "epoch": 2.1306061174704447, |
| "grad_norm": 1.9765625, |
| "learning_rate": 1.400900900900901e-05, |
| "loss": 0.5108, |
| "mean_token_accuracy": 0.9344165354967118, |
| "step": 2840, |
| "train/kl_loss_qwen": 0.03441030657850206, |
| "train/kl_loss_r1": 0.02208532360382378, |
| "train/total_kl": 0.05649562999606132 |
| }, |
| { |
| "epoch": 2.1343591668230437, |
| "grad_norm": 1.8515625, |
| "learning_rate": 1.3980855855855856e-05, |
| "loss": 0.561, |
| "mean_token_accuracy": 0.9328974574804306, |
| "step": 2845, |
| "train/kl_loss_qwen": 0.04245760082267225, |
| "train/kl_loss_r1": 0.02515069688670337, |
| "train/total_kl": 0.06760829733684659 |
| }, |
| { |
| "epoch": 2.1381122161756427, |
| "grad_norm": 1.828125, |
| "learning_rate": 1.3952702702702704e-05, |
| "loss": 0.5009, |
| "mean_token_accuracy": 0.9370256125926971, |
| "step": 2850, |
| "train/kl_loss_qwen": 0.03316999180242419, |
| "train/kl_loss_r1": 0.02016733498312533, |
| "train/total_kl": 0.05333732720464468 |
| }, |
| { |
| "epoch": 2.1418652655282417, |
| "grad_norm": 2.125, |
| "learning_rate": 1.3924549549549551e-05, |
| "loss": 0.5163, |
| "mean_token_accuracy": 0.9422374963760376, |
| "step": 2855, |
| "train/kl_loss_qwen": 0.039404284209012985, |
| "train/kl_loss_r1": 0.02388715702109039, |
| "train/total_kl": 0.0632914412766695 |
| }, |
| { |
| "epoch": 2.1456183148808408, |
| "grad_norm": 1.703125, |
| "learning_rate": 1.3896396396396397e-05, |
| "loss": 0.5452, |
| "mean_token_accuracy": 0.9346591323614121, |
| "step": 2860, |
| "train/kl_loss_qwen": 0.03737853961065411, |
| "train/kl_loss_r1": 0.02262025591917336, |
| "train/total_kl": 0.059998796228319405 |
| }, |
| { |
| "epoch": 2.1493713642334398, |
| "grad_norm": 1.78125, |
| "learning_rate": 1.3868243243243244e-05, |
| "loss": 0.5743, |
| "mean_token_accuracy": 0.937825882434845, |
| "step": 2865, |
| "train/kl_loss_qwen": 0.04654515474103391, |
| "train/kl_loss_r1": 0.026124754128977655, |
| "train/total_kl": 0.07266990933567286 |
| }, |
| { |
| "epoch": 2.153124413586039, |
| "grad_norm": 2.265625, |
| "learning_rate": 1.3840090090090091e-05, |
| "loss": 0.6123, |
| "mean_token_accuracy": 0.922364792227745, |
| "step": 2870, |
| "train/kl_loss_qwen": 0.04081809539347887, |
| "train/kl_loss_r1": 0.024002627190202474, |
| "train/total_kl": 0.06482072221115232 |
| }, |
| { |
| "epoch": 2.156877462938638, |
| "grad_norm": 2.75, |
| "learning_rate": 1.3811936936936939e-05, |
| "loss": 0.6156, |
| "mean_token_accuracy": 0.9291838884353638, |
| "step": 2875, |
| "train/kl_loss_qwen": 0.047036360343918206, |
| "train/kl_loss_r1": 0.02790973465889692, |
| "train/total_kl": 0.07494609467685223 |
| }, |
| { |
| "epoch": 2.160630512291237, |
| "grad_norm": 1.90625, |
| "learning_rate": 1.3783783783783784e-05, |
| "loss": 0.5744, |
| "mean_token_accuracy": 0.9351732730865479, |
| "step": 2880, |
| "train/kl_loss_qwen": 0.04357582703232765, |
| "train/kl_loss_r1": 0.026025883946567775, |
| "train/total_kl": 0.06960171181708574 |
| }, |
| { |
| "epoch": 2.1643835616438354, |
| "grad_norm": 1.734375, |
| "learning_rate": 1.3755630630630632e-05, |
| "loss": 0.5392, |
| "mean_token_accuracy": 0.9364217579364776, |
| "step": 2885, |
| "train/kl_loss_qwen": 0.03916121292859316, |
| "train/kl_loss_r1": 0.022491829935461283, |
| "train/total_kl": 0.061653042957186696 |
| }, |
| { |
| "epoch": 2.1681366109964344, |
| "grad_norm": 2.65625, |
| "learning_rate": 1.3727477477477479e-05, |
| "loss": 0.5454, |
| "mean_token_accuracy": 0.9335968852043152, |
| "step": 2890, |
| "train/kl_loss_qwen": 0.03318686801940203, |
| "train/kl_loss_r1": 0.021574988728389144, |
| "train/total_kl": 0.0547618567943573 |
| }, |
| { |
| "epoch": 2.1718896603490334, |
| "grad_norm": 2.03125, |
| "learning_rate": 1.3699324324324325e-05, |
| "loss": 0.5635, |
| "mean_token_accuracy": 0.9308214575052262, |
| "step": 2895, |
| "train/kl_loss_qwen": 0.041395931225270036, |
| "train/kl_loss_r1": 0.02332762386649847, |
| "train/total_kl": 0.06472355434671044 |
| }, |
| { |
| "epoch": 2.1756427097016324, |
| "grad_norm": 3.078125, |
| "learning_rate": 1.3671171171171172e-05, |
| "loss": 0.5212, |
| "mean_token_accuracy": 0.9229843825101852, |
| "step": 2900, |
| "train/kl_loss_qwen": 0.02835620930418372, |
| "train/kl_loss_r1": 0.017738517560064792, |
| "train/total_kl": 0.04609472677111626 |
| }, |
| { |
| "epoch": 2.1793957590542314, |
| "grad_norm": 2.09375, |
| "learning_rate": 1.364301801801802e-05, |
| "loss": 0.5051, |
| "mean_token_accuracy": 0.9343967109918594, |
| "step": 2905, |
| "train/kl_loss_qwen": 0.0359275649767369, |
| "train/kl_loss_r1": 0.0219997838139534, |
| "train/total_kl": 0.05792734948918223 |
| }, |
| { |
| "epoch": 2.1831488084068305, |
| "grad_norm": 2.125, |
| "learning_rate": 1.3614864864864867e-05, |
| "loss": 0.5687, |
| "mean_token_accuracy": 0.9289180606603622, |
| "step": 2910, |
| "train/kl_loss_qwen": 0.043711404176428915, |
| "train/kl_loss_r1": 0.025724610220640896, |
| "train/total_kl": 0.06943601546809078 |
| }, |
| { |
| "epoch": 2.1869018577594295, |
| "grad_norm": 2.125, |
| "learning_rate": 1.358671171171171e-05, |
| "loss": 0.4979, |
| "mean_token_accuracy": 0.9360549032688141, |
| "step": 2915, |
| "train/kl_loss_qwen": 0.0300402055028826, |
| "train/kl_loss_r1": 0.0205923215020448, |
| "train/total_kl": 0.050632527004927395 |
| }, |
| { |
| "epoch": 2.1906549071120285, |
| "grad_norm": 2.34375, |
| "learning_rate": 1.3558558558558558e-05, |
| "loss": 0.5875, |
| "mean_token_accuracy": 0.9278737664222717, |
| "step": 2920, |
| "train/kl_loss_qwen": 0.043786196783185, |
| "train/kl_loss_r1": 0.025323738995939492, |
| "train/total_kl": 0.06910993559285998 |
| }, |
| { |
| "epoch": 2.1944079564646275, |
| "grad_norm": 3.390625, |
| "learning_rate": 1.3530405405405405e-05, |
| "loss": 0.5316, |
| "mean_token_accuracy": 0.9379894882440567, |
| "step": 2925, |
| "train/kl_loss_qwen": 0.03716716575436294, |
| "train/kl_loss_r1": 0.02201431319117546, |
| "train/total_kl": 0.059181479085236785 |
| }, |
| { |
| "epoch": 2.1981610058172265, |
| "grad_norm": 1.8515625, |
| "learning_rate": 1.3502252252252251e-05, |
| "loss": 0.5126, |
| "mean_token_accuracy": 0.9497415542602539, |
| "step": 2930, |
| "train/kl_loss_qwen": 0.03827819037251175, |
| "train/kl_loss_r1": 0.023396990727633238, |
| "train/total_kl": 0.061675180681049824 |
| }, |
| { |
| "epoch": 2.2019140551698255, |
| "grad_norm": 3.5, |
| "learning_rate": 1.3474099099099098e-05, |
| "loss": 0.5099, |
| "mean_token_accuracy": 0.9369021475315094, |
| "step": 2935, |
| "train/kl_loss_qwen": 0.029308402584865688, |
| "train/kl_loss_r1": 0.020524240424856545, |
| "train/total_kl": 0.049832642823457715 |
| }, |
| { |
| "epoch": 2.2056671045224245, |
| "grad_norm": 2.0, |
| "learning_rate": 1.3445945945945946e-05, |
| "loss": 0.5286, |
| "mean_token_accuracy": 0.947816863656044, |
| "step": 2940, |
| "train/kl_loss_qwen": 0.040448572020977736, |
| "train/kl_loss_r1": 0.02613919833675027, |
| "train/total_kl": 0.06658776951953768 |
| }, |
| { |
| "epoch": 2.2094201538750236, |
| "grad_norm": 1.8359375, |
| "learning_rate": 1.3417792792792793e-05, |
| "loss": 0.5493, |
| "mean_token_accuracy": 0.9422875761985778, |
| "step": 2945, |
| "train/kl_loss_qwen": 0.04237751713953912, |
| "train/kl_loss_r1": 0.02594070523045957, |
| "train/total_kl": 0.0683182223699987 |
| }, |
| { |
| "epoch": 2.2131732032276226, |
| "grad_norm": 2.546875, |
| "learning_rate": 1.3389639639639639e-05, |
| "loss": 0.662, |
| "mean_token_accuracy": 0.9310304433107376, |
| "step": 2950, |
| "train/kl_loss_qwen": 0.058689125487580894, |
| "train/kl_loss_r1": 0.033207002701237796, |
| "train/total_kl": 0.09189612818881869 |
| }, |
| { |
| "epoch": 2.2169262525802216, |
| "grad_norm": 2.1875, |
| "learning_rate": 1.3361486486486486e-05, |
| "loss": 0.5382, |
| "mean_token_accuracy": 0.9390515863895417, |
| "step": 2955, |
| "train/kl_loss_qwen": 0.041446970077231526, |
| "train/kl_loss_r1": 0.02546785566955805, |
| "train/total_kl": 0.06691482551395893 |
| }, |
| { |
| "epoch": 2.2206793019328206, |
| "grad_norm": 1.7109375, |
| "learning_rate": 1.3333333333333333e-05, |
| "loss": 0.5262, |
| "mean_token_accuracy": 0.9294974207878113, |
| "step": 2960, |
| "train/kl_loss_qwen": 0.03314268705435097, |
| "train/kl_loss_r1": 0.019529332965612413, |
| "train/total_kl": 0.05267201904207468 |
| }, |
| { |
| "epoch": 2.2244323512854196, |
| "grad_norm": 2.53125, |
| "learning_rate": 1.330518018018018e-05, |
| "loss": 0.5259, |
| "mean_token_accuracy": 0.9331434935331344, |
| "step": 2965, |
| "train/kl_loss_qwen": 0.03575447672046721, |
| "train/kl_loss_r1": 0.021085081296041606, |
| "train/total_kl": 0.05683955755084753 |
| }, |
| { |
| "epoch": 2.2281854006380186, |
| "grad_norm": 2.921875, |
| "learning_rate": 1.3277027027027026e-05, |
| "loss": 0.5353, |
| "mean_token_accuracy": 0.9259840369224548, |
| "step": 2970, |
| "train/kl_loss_qwen": 0.029720848985016347, |
| "train/kl_loss_r1": 0.019104212429374455, |
| "train/total_kl": 0.04882506160065532 |
| }, |
| { |
| "epoch": 2.231938449990617, |
| "grad_norm": 2.21875, |
| "learning_rate": 1.3248873873873874e-05, |
| "loss": 0.5463, |
| "mean_token_accuracy": 0.9294231235980988, |
| "step": 2975, |
| "train/kl_loss_qwen": 0.03764592856168747, |
| "train/kl_loss_r1": 0.022270164219662547, |
| "train/total_kl": 0.0599160929210484 |
| }, |
| { |
| "epoch": 2.235691499343216, |
| "grad_norm": 2.046875, |
| "learning_rate": 1.3220720720720721e-05, |
| "loss": 0.5329, |
| "mean_token_accuracy": 0.9333685070276261, |
| "step": 2980, |
| "train/kl_loss_qwen": 0.035478117410093546, |
| "train/kl_loss_r1": 0.021247773012146354, |
| "train/total_kl": 0.056725890096277 |
| }, |
| { |
| "epoch": 2.239444548695815, |
| "grad_norm": 1.7734375, |
| "learning_rate": 1.3192567567567567e-05, |
| "loss": 0.578, |
| "mean_token_accuracy": 0.9396042585372925, |
| "step": 2985, |
| "train/kl_loss_qwen": 0.04996556900441647, |
| "train/kl_loss_r1": 0.02640064749866724, |
| "train/total_kl": 0.0763662163168192 |
| }, |
| { |
| "epoch": 2.2431975980484142, |
| "grad_norm": 1.796875, |
| "learning_rate": 1.3164414414414414e-05, |
| "loss": 0.5218, |
| "mean_token_accuracy": 0.9406999468803405, |
| "step": 2990, |
| "train/kl_loss_qwen": 0.038010914949700235, |
| "train/kl_loss_r1": 0.02382657811976969, |
| "train/total_kl": 0.06183749325573444 |
| }, |
| { |
| "epoch": 2.2469506474010132, |
| "grad_norm": 2.046875, |
| "learning_rate": 1.3136261261261261e-05, |
| "loss": 0.563, |
| "mean_token_accuracy": 0.9369042903184891, |
| "step": 2995, |
| "train/kl_loss_qwen": 0.03981273928657174, |
| "train/kl_loss_r1": 0.024143205443397164, |
| "train/total_kl": 0.06395594468340278 |
| }, |
| { |
| "epoch": 2.2507036967536123, |
| "grad_norm": 1.984375, |
| "learning_rate": 1.3108108108108109e-05, |
| "loss": 0.5846, |
| "mean_token_accuracy": 0.9288579165935517, |
| "step": 3000, |
| "train/kl_loss_qwen": 0.043740917649120095, |
| "train/kl_loss_r1": 0.025398692348971963, |
| "train/total_kl": 0.06913960874080657 |
| }, |
| { |
| "epoch": 2.2544567461062113, |
| "grad_norm": 2.234375, |
| "learning_rate": 1.3079954954954954e-05, |
| "loss": 0.5529, |
| "mean_token_accuracy": 0.9287919521331787, |
| "step": 3005, |
| "train/kl_loss_qwen": 0.03622842230834067, |
| "train/kl_loss_r1": 0.02267452417872846, |
| "train/total_kl": 0.058902946207672356 |
| }, |
| { |
| "epoch": 2.2582097954588103, |
| "grad_norm": 3.8125, |
| "learning_rate": 1.3051801801801802e-05, |
| "loss": 0.5708, |
| "mean_token_accuracy": 0.9316366136074066, |
| "step": 3010, |
| "train/kl_loss_qwen": 0.039876210317015645, |
| "train/kl_loss_r1": 0.025454261200502516, |
| "train/total_kl": 0.065330471098423 |
| }, |
| { |
| "epoch": 2.2619628448114093, |
| "grad_norm": 2.34375, |
| "learning_rate": 1.3023648648648649e-05, |
| "loss": 0.5521, |
| "mean_token_accuracy": 0.9287123322486878, |
| "step": 3015, |
| "train/kl_loss_qwen": 0.03473481684923172, |
| "train/kl_loss_r1": 0.021131755039095878, |
| "train/total_kl": 0.05586657216772437 |
| }, |
| { |
| "epoch": 2.2657158941640083, |
| "grad_norm": 2.984375, |
| "learning_rate": 1.2995495495495495e-05, |
| "loss": 0.5178, |
| "mean_token_accuracy": 0.9337947934865951, |
| "step": 3020, |
| "train/kl_loss_qwen": 0.035915958741679785, |
| "train/kl_loss_r1": 0.02014762875624001, |
| "train/total_kl": 0.0560635874979198 |
| }, |
| { |
| "epoch": 2.2694689435166073, |
| "grad_norm": 2.21875, |
| "learning_rate": 1.2967342342342342e-05, |
| "loss": 0.5513, |
| "mean_token_accuracy": 0.938558641076088, |
| "step": 3025, |
| "train/kl_loss_qwen": 0.0410382560454309, |
| "train/kl_loss_r1": 0.02633958971127868, |
| "train/total_kl": 0.06737784529104829 |
| }, |
| { |
| "epoch": 2.2732219928692063, |
| "grad_norm": 2.46875, |
| "learning_rate": 1.293918918918919e-05, |
| "loss": 0.5233, |
| "mean_token_accuracy": 0.9367934465408325, |
| "step": 3030, |
| "train/kl_loss_qwen": 0.03334038094617427, |
| "train/kl_loss_r1": 0.022024092823266984, |
| "train/total_kl": 0.05536447400227189 |
| }, |
| { |
| "epoch": 2.2769750422218054, |
| "grad_norm": 2.484375, |
| "learning_rate": 1.2911036036036037e-05, |
| "loss": 0.5496, |
| "mean_token_accuracy": 0.9340452969074249, |
| "step": 3035, |
| "train/kl_loss_qwen": 0.041443832125514744, |
| "train/kl_loss_r1": 0.02346867136657238, |
| "train/total_kl": 0.06491250386461615 |
| }, |
| { |
| "epoch": 2.2807280915744044, |
| "grad_norm": 1.9765625, |
| "learning_rate": 1.2882882882882882e-05, |
| "loss": 0.5684, |
| "mean_token_accuracy": 0.9405649453401566, |
| "step": 3040, |
| "train/kl_loss_qwen": 0.04632887695915997, |
| "train/kl_loss_r1": 0.026997680915519594, |
| "train/total_kl": 0.07332655768841505 |
| }, |
| { |
| "epoch": 2.2844811409270034, |
| "grad_norm": 1.671875, |
| "learning_rate": 1.285472972972973e-05, |
| "loss": 0.5785, |
| "mean_token_accuracy": 0.9388915836811066, |
| "step": 3045, |
| "train/kl_loss_qwen": 0.04664509515278041, |
| "train/kl_loss_r1": 0.028806798858568072, |
| "train/total_kl": 0.07545189317315817 |
| }, |
| { |
| "epoch": 2.288234190279602, |
| "grad_norm": 2.03125, |
| "learning_rate": 1.2826576576576577e-05, |
| "loss": 0.549, |
| "mean_token_accuracy": 0.942802557349205, |
| "step": 3050, |
| "train/kl_loss_qwen": 0.043018145067617294, |
| "train/kl_loss_r1": 0.02463572332635522, |
| "train/total_kl": 0.0676538685336709 |
| }, |
| { |
| "epoch": 2.291987239632201, |
| "grad_norm": 2.046875, |
| "learning_rate": 1.2798423423423423e-05, |
| "loss": 0.5146, |
| "mean_token_accuracy": 0.9322921663522721, |
| "step": 3055, |
| "train/kl_loss_qwen": 0.0297826265450567, |
| "train/kl_loss_r1": 0.01987147410400212, |
| "train/total_kl": 0.04965410055592656 |
| }, |
| { |
| "epoch": 2.2957402889848, |
| "grad_norm": 1.78125, |
| "learning_rate": 1.277027027027027e-05, |
| "loss": 0.5288, |
| "mean_token_accuracy": 0.9336327165365219, |
| "step": 3060, |
| "train/kl_loss_qwen": 0.031126489629969, |
| "train/kl_loss_r1": 0.02163971494883299, |
| "train/total_kl": 0.052766204718500374 |
| }, |
| { |
| "epoch": 2.299493338337399, |
| "grad_norm": 2.375, |
| "learning_rate": 1.2742117117117117e-05, |
| "loss": 0.5195, |
| "mean_token_accuracy": 0.9313450574874877, |
| "step": 3065, |
| "train/kl_loss_qwen": 0.026634555822238327, |
| "train/kl_loss_r1": 0.01898168446496129, |
| "train/total_kl": 0.04561624005436897 |
| }, |
| { |
| "epoch": 2.303246387689998, |
| "grad_norm": 2.234375, |
| "learning_rate": 1.2713963963963965e-05, |
| "loss": 0.561, |
| "mean_token_accuracy": 0.9352007538080216, |
| "step": 3070, |
| "train/kl_loss_qwen": 0.04229618958197534, |
| "train/kl_loss_r1": 0.025796488486230375, |
| "train/total_kl": 0.0680926782079041 |
| }, |
| { |
| "epoch": 2.306999437042597, |
| "grad_norm": 1.9453125, |
| "learning_rate": 1.268581081081081e-05, |
| "loss": 0.5083, |
| "mean_token_accuracy": 0.9352661728858948, |
| "step": 3075, |
| "train/kl_loss_qwen": 0.036430867342278364, |
| "train/kl_loss_r1": 0.022393257077783345, |
| "train/total_kl": 0.058824124094098804 |
| }, |
| { |
| "epoch": 2.310752486395196, |
| "grad_norm": 1.609375, |
| "learning_rate": 1.2657657657657658e-05, |
| "loss": 0.5943, |
| "mean_token_accuracy": 0.9433018922805786, |
| "step": 3080, |
| "train/kl_loss_qwen": 0.053476129472255704, |
| "train/kl_loss_r1": 0.030378296645358203, |
| "train/total_kl": 0.08385442551225424 |
| }, |
| { |
| "epoch": 2.314505535747795, |
| "grad_norm": 1.5703125, |
| "learning_rate": 1.2629504504504505e-05, |
| "loss": 0.5341, |
| "mean_token_accuracy": 0.9477105677127838, |
| "step": 3085, |
| "train/kl_loss_qwen": 0.04390522614121437, |
| "train/kl_loss_r1": 0.025548849394544958, |
| "train/total_kl": 0.06945407623425126 |
| }, |
| { |
| "epoch": 2.318258585100394, |
| "grad_norm": 2.109375, |
| "learning_rate": 1.260135135135135e-05, |
| "loss": 0.555, |
| "mean_token_accuracy": 0.9314184099435806, |
| "step": 3090, |
| "train/kl_loss_qwen": 0.039841002132743594, |
| "train/kl_loss_r1": 0.0228716810233891, |
| "train/total_kl": 0.06271268259733916 |
| }, |
| { |
| "epoch": 2.322011634452993, |
| "grad_norm": 2.171875, |
| "learning_rate": 1.2573198198198198e-05, |
| "loss": 0.5642, |
| "mean_token_accuracy": 0.937423512339592, |
| "step": 3095, |
| "train/kl_loss_qwen": 0.042703565768897535, |
| "train/kl_loss_r1": 0.025010303594172, |
| "train/total_kl": 0.06771386964246631 |
| }, |
| { |
| "epoch": 2.325764683805592, |
| "grad_norm": 1.625, |
| "learning_rate": 1.2545045045045045e-05, |
| "loss": 0.5267, |
| "mean_token_accuracy": 0.9374463945627213, |
| "step": 3100, |
| "train/kl_loss_qwen": 0.03558561257086694, |
| "train/kl_loss_r1": 0.021157630579546095, |
| "train/total_kl": 0.05674324333667755 |
| }, |
| { |
| "epoch": 2.329517733158191, |
| "grad_norm": 2.125, |
| "learning_rate": 1.2516891891891893e-05, |
| "loss": 0.5208, |
| "mean_token_accuracy": 0.9341548919677735, |
| "step": 3105, |
| "train/kl_loss_qwen": 0.03378947116434574, |
| "train/kl_loss_r1": 0.02182693681679666, |
| "train/total_kl": 0.05561640774831176 |
| }, |
| { |
| "epoch": 2.33327078251079, |
| "grad_norm": 2.015625, |
| "learning_rate": 1.2488738738738738e-05, |
| "loss": 0.6083, |
| "mean_token_accuracy": 0.9400612443685532, |
| "step": 3110, |
| "train/kl_loss_qwen": 0.04884338290430605, |
| "train/kl_loss_r1": 0.02985413228161633, |
| "train/total_kl": 0.07869751462712885 |
| }, |
| { |
| "epoch": 2.337023831863389, |
| "grad_norm": 1.6796875, |
| "learning_rate": 1.2460585585585586e-05, |
| "loss": 0.5328, |
| "mean_token_accuracy": 0.9403836339712143, |
| "step": 3115, |
| "train/kl_loss_qwen": 0.0388734900392592, |
| "train/kl_loss_r1": 0.024075880460441113, |
| "train/total_kl": 0.06294937077909708 |
| }, |
| { |
| "epoch": 2.340776881215988, |
| "grad_norm": 1.9453125, |
| "learning_rate": 1.2432432432432433e-05, |
| "loss": 0.5283, |
| "mean_token_accuracy": 0.936130028963089, |
| "step": 3120, |
| "train/kl_loss_qwen": 0.03456240138038993, |
| "train/kl_loss_r1": 0.022217872831970454, |
| "train/total_kl": 0.05678027486428618 |
| }, |
| { |
| "epoch": 2.344529930568587, |
| "grad_norm": 2.609375, |
| "learning_rate": 1.2404279279279278e-05, |
| "loss": 0.5287, |
| "mean_token_accuracy": 0.9316271543502808, |
| "step": 3125, |
| "train/kl_loss_qwen": 0.036940915137529375, |
| "train/kl_loss_r1": 0.0215177561622113, |
| "train/total_kl": 0.05845867097377777 |
| }, |
| { |
| "epoch": 2.348282979921186, |
| "grad_norm": 2.78125, |
| "learning_rate": 1.2376126126126126e-05, |
| "loss": 0.5368, |
| "mean_token_accuracy": 0.9344398438930511, |
| "step": 3130, |
| "train/kl_loss_qwen": 0.033279696572571994, |
| "train/kl_loss_r1": 0.021447874326258897, |
| "train/total_kl": 0.05472757089883089 |
| }, |
| { |
| "epoch": 2.352036029273785, |
| "grad_norm": 2.390625, |
| "learning_rate": 1.2347972972972973e-05, |
| "loss": 0.5209, |
| "mean_token_accuracy": 0.9406446427106857, |
| "step": 3135, |
| "train/kl_loss_qwen": 0.036877452628687024, |
| "train/kl_loss_r1": 0.022486304910853506, |
| "train/total_kl": 0.059363758005201814 |
| }, |
| { |
| "epoch": 2.3557890786263838, |
| "grad_norm": 2.5, |
| "learning_rate": 1.231981981981982e-05, |
| "loss": 0.5095, |
| "mean_token_accuracy": 0.9296006947755814, |
| "step": 3140, |
| "train/kl_loss_qwen": 0.028582219453528523, |
| "train/kl_loss_r1": 0.018844395689666272, |
| "train/total_kl": 0.04742661491036415 |
| }, |
| { |
| "epoch": 2.3595421279789828, |
| "grad_norm": 1.9140625, |
| "learning_rate": 1.2291666666666666e-05, |
| "loss": 0.5638, |
| "mean_token_accuracy": 0.9397950142621994, |
| "step": 3145, |
| "train/kl_loss_qwen": 0.04685241803526878, |
| "train/kl_loss_r1": 0.026595241343602537, |
| "train/total_kl": 0.07344765840098262 |
| }, |
| { |
| "epoch": 2.363295177331582, |
| "grad_norm": 2.046875, |
| "learning_rate": 1.2263513513513513e-05, |
| "loss": 0.5555, |
| "mean_token_accuracy": 0.9374128609895707, |
| "step": 3150, |
| "train/kl_loss_qwen": 0.04203428840264678, |
| "train/kl_loss_r1": 0.025428059929981827, |
| "train/total_kl": 0.06746234856545925 |
| }, |
| { |
| "epoch": 2.367048226684181, |
| "grad_norm": 2.21875, |
| "learning_rate": 1.223536036036036e-05, |
| "loss": 0.5681, |
| "mean_token_accuracy": 0.9254122227430344, |
| "step": 3155, |
| "train/kl_loss_qwen": 0.0387713055126369, |
| "train/kl_loss_r1": 0.0246855141595006, |
| "train/total_kl": 0.06345681985840201 |
| }, |
| { |
| "epoch": 2.37080127603678, |
| "grad_norm": 1.6171875, |
| "learning_rate": 1.2207207207207206e-05, |
| "loss": 0.551, |
| "mean_token_accuracy": 0.9433078557252884, |
| "step": 3160, |
| "train/kl_loss_qwen": 0.04725635447539389, |
| "train/kl_loss_r1": 0.025131250126287343, |
| "train/total_kl": 0.07238760460168123 |
| }, |
| { |
| "epoch": 2.374554325389379, |
| "grad_norm": 2.78125, |
| "learning_rate": 1.2179054054054054e-05, |
| "loss": 0.5354, |
| "mean_token_accuracy": 0.9246108263731003, |
| "step": 3165, |
| "train/kl_loss_qwen": 0.033212426397949454, |
| "train/kl_loss_r1": 0.020326728513464332, |
| "train/total_kl": 0.05353915439918637 |
| }, |
| { |
| "epoch": 2.378307374741978, |
| "grad_norm": 1.640625, |
| "learning_rate": 1.2150900900900901e-05, |
| "loss": 0.6263, |
| "mean_token_accuracy": 0.9188352763652802, |
| "step": 3170, |
| "train/kl_loss_qwen": 0.044487806130200626, |
| "train/kl_loss_r1": 0.025681670103222132, |
| "train/total_kl": 0.07016947586089373 |
| }, |
| { |
| "epoch": 2.382060424094577, |
| "grad_norm": 1.765625, |
| "learning_rate": 1.2122747747747748e-05, |
| "loss": 0.5346, |
| "mean_token_accuracy": 0.934695902466774, |
| "step": 3175, |
| "train/kl_loss_qwen": 0.03501300155185163, |
| "train/kl_loss_r1": 0.02180988513864577, |
| "train/total_kl": 0.05682288641110063 |
| }, |
| { |
| "epoch": 2.385813473447176, |
| "grad_norm": 3.671875, |
| "learning_rate": 1.2094594594594594e-05, |
| "loss": 0.5132, |
| "mean_token_accuracy": 0.9327447503805161, |
| "step": 3180, |
| "train/kl_loss_qwen": 0.03092428036034107, |
| "train/kl_loss_r1": 0.01931490730494261, |
| "train/total_kl": 0.05023918692022562 |
| }, |
| { |
| "epoch": 2.389566522799775, |
| "grad_norm": 1.90625, |
| "learning_rate": 1.2066441441441441e-05, |
| "loss": 0.5394, |
| "mean_token_accuracy": 0.9355822622776031, |
| "step": 3185, |
| "train/kl_loss_qwen": 0.03887740271165967, |
| "train/kl_loss_r1": 0.0235895031131804, |
| "train/total_kl": 0.0624669055454433 |
| }, |
| { |
| "epoch": 2.393319572152374, |
| "grad_norm": 2.953125, |
| "learning_rate": 1.2038288288288289e-05, |
| "loss": 0.5322, |
| "mean_token_accuracy": 0.9339176148176194, |
| "step": 3190, |
| "train/kl_loss_qwen": 0.03618767000734806, |
| "train/kl_loss_r1": 0.021291274437680842, |
| "train/total_kl": 0.057478944212198256 |
| }, |
| { |
| "epoch": 2.397072621504973, |
| "grad_norm": 2.0, |
| "learning_rate": 1.2010135135135134e-05, |
| "loss": 0.5395, |
| "mean_token_accuracy": 0.9384062319993973, |
| "step": 3195, |
| "train/kl_loss_qwen": 0.04146128077991307, |
| "train/kl_loss_r1": 0.024588865321129562, |
| "train/total_kl": 0.0660501460544765 |
| }, |
| { |
| "epoch": 2.400825670857572, |
| "grad_norm": 2.25, |
| "learning_rate": 1.1981981981981982e-05, |
| "loss": 0.5389, |
| "mean_token_accuracy": 0.9353989124298095, |
| "step": 3200, |
| "train/kl_loss_qwen": 0.03608363852836192, |
| "train/kl_loss_r1": 0.022291125869378446, |
| "train/total_kl": 0.058374764304608105 |
| }, |
| { |
| "epoch": 2.404578720210171, |
| "grad_norm": 2.046875, |
| "learning_rate": 1.1953828828828829e-05, |
| "loss": 0.4878, |
| "mean_token_accuracy": 0.9411316305398941, |
| "step": 3205, |
| "train/kl_loss_qwen": 0.03091870420612395, |
| "train/kl_loss_r1": 0.020030087791383266, |
| "train/total_kl": 0.05094879176467657 |
| }, |
| { |
| "epoch": 2.4083317695627695, |
| "grad_norm": 1.65625, |
| "learning_rate": 1.1925675675675676e-05, |
| "loss": 0.5701, |
| "mean_token_accuracy": 0.9409845679998398, |
| "step": 3210, |
| "train/kl_loss_qwen": 0.04897573101334274, |
| "train/kl_loss_r1": 0.02639773767441511, |
| "train/total_kl": 0.07537346873432398 |
| }, |
| { |
| "epoch": 2.4120848189153685, |
| "grad_norm": 1.78125, |
| "learning_rate": 1.1897522522522522e-05, |
| "loss": 0.5977, |
| "mean_token_accuracy": 0.9367994040250778, |
| "step": 3215, |
| "train/kl_loss_qwen": 0.050940166832879184, |
| "train/kl_loss_r1": 0.02986270859837532, |
| "train/total_kl": 0.0808028751052916 |
| }, |
| { |
| "epoch": 2.4158378682679675, |
| "grad_norm": 1.6171875, |
| "learning_rate": 1.186936936936937e-05, |
| "loss": 0.5429, |
| "mean_token_accuracy": 0.9409172803163528, |
| "step": 3220, |
| "train/kl_loss_qwen": 0.03987803226336837, |
| "train/kl_loss_r1": 0.0246189346536994, |
| "train/total_kl": 0.0644969672895968 |
| }, |
| { |
| "epoch": 2.4195909176205666, |
| "grad_norm": 2.546875, |
| "learning_rate": 1.1841216216216217e-05, |
| "loss": 0.5611, |
| "mean_token_accuracy": 0.9374772995710373, |
| "step": 3225, |
| "train/kl_loss_qwen": 0.04303165278397501, |
| "train/kl_loss_r1": 0.02437350503169, |
| "train/total_kl": 0.06740515744313598 |
| }, |
| { |
| "epoch": 2.4233439669731656, |
| "grad_norm": 2.4375, |
| "learning_rate": 1.1813063063063062e-05, |
| "loss": 0.553, |
| "mean_token_accuracy": 0.9381204128265381, |
| "step": 3230, |
| "train/kl_loss_qwen": 0.0386037103831768, |
| "train/kl_loss_r1": 0.023770157899707555, |
| "train/total_kl": 0.06237386828288436 |
| }, |
| { |
| "epoch": 2.4270970163257646, |
| "grad_norm": 1.7890625, |
| "learning_rate": 1.178490990990991e-05, |
| "loss": 0.562, |
| "mean_token_accuracy": 0.9349307507276535, |
| "step": 3235, |
| "train/kl_loss_qwen": 0.04115969752892852, |
| "train/kl_loss_r1": 0.024597525550052523, |
| "train/total_kl": 0.06575722331181169 |
| }, |
| { |
| "epoch": 2.4308500656783636, |
| "grad_norm": 1.8203125, |
| "learning_rate": 1.1756756756756757e-05, |
| "loss": 0.637, |
| "mean_token_accuracy": 0.9326605528593064, |
| "step": 3240, |
| "train/kl_loss_qwen": 0.05272633535787463, |
| "train/kl_loss_r1": 0.03210459062829614, |
| "train/total_kl": 0.08483092663809658 |
| }, |
| { |
| "epoch": 2.4346031150309626, |
| "grad_norm": 1.8046875, |
| "learning_rate": 1.1728603603603604e-05, |
| "loss": 0.5224, |
| "mean_token_accuracy": 0.9422306567430496, |
| "step": 3245, |
| "train/kl_loss_qwen": 0.03568903068080544, |
| "train/kl_loss_r1": 0.02389035364612937, |
| "train/total_kl": 0.05957938423380256 |
| }, |
| { |
| "epoch": 2.4383561643835616, |
| "grad_norm": 1.8828125, |
| "learning_rate": 1.170045045045045e-05, |
| "loss": 0.5923, |
| "mean_token_accuracy": 0.9275829493999481, |
| "step": 3250, |
| "train/kl_loss_qwen": 0.04339817874133587, |
| "train/kl_loss_r1": 0.02661740267649293, |
| "train/total_kl": 0.07001558057963848 |
| }, |
| { |
| "epoch": 2.4421092137361606, |
| "grad_norm": 2.5, |
| "learning_rate": 1.1672297297297297e-05, |
| "loss": 0.5883, |
| "mean_token_accuracy": 0.9264898538589478, |
| "step": 3255, |
| "train/kl_loss_qwen": 0.04256655271165073, |
| "train/kl_loss_r1": 0.026060083322227, |
| "train/total_kl": 0.06862663589417935 |
| }, |
| { |
| "epoch": 2.4458622630887596, |
| "grad_norm": 1.6171875, |
| "learning_rate": 1.1644144144144145e-05, |
| "loss": 0.5757, |
| "mean_token_accuracy": 0.9341827034950256, |
| "step": 3260, |
| "train/kl_loss_qwen": 0.045864395797252655, |
| "train/kl_loss_r1": 0.025307921459898353, |
| "train/total_kl": 0.07117231637239456 |
| }, |
| { |
| "epoch": 2.4496153124413587, |
| "grad_norm": 1.859375, |
| "learning_rate": 1.161599099099099e-05, |
| "loss": 0.5532, |
| "mean_token_accuracy": 0.9347288429737091, |
| "step": 3265, |
| "train/kl_loss_qwen": 0.04079986200667918, |
| "train/kl_loss_r1": 0.02275497787632048, |
| "train/total_kl": 0.06355484062805772 |
| }, |
| { |
| "epoch": 2.4533683617939577, |
| "grad_norm": 1.8125, |
| "learning_rate": 1.1587837837837838e-05, |
| "loss": 0.5195, |
| "mean_token_accuracy": 0.9417342007160187, |
| "step": 3270, |
| "train/kl_loss_qwen": 0.037300968542695045, |
| "train/kl_loss_r1": 0.023268221924081445, |
| "train/total_kl": 0.06056919014081359 |
| }, |
| { |
| "epoch": 2.4571214111465567, |
| "grad_norm": 1.7890625, |
| "learning_rate": 1.1559684684684685e-05, |
| "loss": 0.5353, |
| "mean_token_accuracy": 0.9360393404960632, |
| "step": 3275, |
| "train/kl_loss_qwen": 0.03689596527256071, |
| "train/kl_loss_r1": 0.022807118855416773, |
| "train/total_kl": 0.05970308426767588 |
| }, |
| { |
| "epoch": 2.4608744604991557, |
| "grad_norm": 1.7421875, |
| "learning_rate": 1.1531531531531532e-05, |
| "loss": 0.585, |
| "mean_token_accuracy": 0.9331568986177444, |
| "step": 3280, |
| "train/kl_loss_qwen": 0.044853394478559495, |
| "train/kl_loss_r1": 0.025697841960936784, |
| "train/total_kl": 0.0705512366257608 |
| }, |
| { |
| "epoch": 2.4646275098517547, |
| "grad_norm": 1.65625, |
| "learning_rate": 1.1503378378378378e-05, |
| "loss": 0.5768, |
| "mean_token_accuracy": 0.9326375395059585, |
| "step": 3285, |
| "train/kl_loss_qwen": 0.04333240417763591, |
| "train/kl_loss_r1": 0.024822972994297744, |
| "train/total_kl": 0.06815537698566913 |
| }, |
| { |
| "epoch": 2.4683805592043537, |
| "grad_norm": 6.0625, |
| "learning_rate": 1.1475225225225225e-05, |
| "loss": 0.7162, |
| "mean_token_accuracy": 0.9254491657018662, |
| "step": 3290, |
| "train/kl_loss_qwen": 0.06576828146353364, |
| "train/kl_loss_r1": 0.03042342527769506, |
| "train/total_kl": 0.09619170585647226 |
| }, |
| { |
| "epoch": 2.4721336085569527, |
| "grad_norm": 4.0625, |
| "learning_rate": 1.1447072072072073e-05, |
| "loss": 0.5306, |
| "mean_token_accuracy": 0.9359158217906952, |
| "step": 3295, |
| "train/kl_loss_qwen": 0.03547678254544735, |
| "train/kl_loss_r1": 0.022528561856597663, |
| "train/total_kl": 0.0580053442157805 |
| }, |
| { |
| "epoch": 2.4758866579095518, |
| "grad_norm": 2.03125, |
| "learning_rate": 1.1418918918918918e-05, |
| "loss": 0.589, |
| "mean_token_accuracy": 0.9333787739276886, |
| "step": 3300, |
| "train/kl_loss_qwen": 0.04154859040863812, |
| "train/kl_loss_r1": 0.025078575173392893, |
| "train/total_kl": 0.06662716614082456 |
| }, |
| { |
| "epoch": 2.4796397072621503, |
| "grad_norm": 2.015625, |
| "learning_rate": 1.1390765765765766e-05, |
| "loss": 0.5448, |
| "mean_token_accuracy": 0.9377627521753311, |
| "step": 3305, |
| "train/kl_loss_qwen": 0.0411828382872045, |
| "train/kl_loss_r1": 0.02373361773788929, |
| "train/total_kl": 0.06491645593196153 |
| }, |
| { |
| "epoch": 2.4833927566147493, |
| "grad_norm": 1.71875, |
| "learning_rate": 1.1362612612612613e-05, |
| "loss": 0.6567, |
| "mean_token_accuracy": 0.9378575652837753, |
| "step": 3310, |
| "train/kl_loss_qwen": 0.058627383690327405, |
| "train/kl_loss_r1": 0.0312151032499969, |
| "train/total_kl": 0.08984248703345657 |
| }, |
| { |
| "epoch": 2.4871458059673484, |
| "grad_norm": 1.71875, |
| "learning_rate": 1.133445945945946e-05, |
| "loss": 0.5552, |
| "mean_token_accuracy": 0.9339710831642151, |
| "step": 3315, |
| "train/kl_loss_qwen": 0.03927432321943343, |
| "train/kl_loss_r1": 0.023889779346063733, |
| "train/total_kl": 0.06316410256549716 |
| }, |
| { |
| "epoch": 2.4908988553199474, |
| "grad_norm": 3.296875, |
| "learning_rate": 1.1306306306306306e-05, |
| "loss": 0.5959, |
| "mean_token_accuracy": 0.934712040424347, |
| "step": 3320, |
| "train/kl_loss_qwen": 0.04768353961408138, |
| "train/kl_loss_r1": 0.02617289489135146, |
| "train/total_kl": 0.07385643469169736 |
| }, |
| { |
| "epoch": 2.4946519046725464, |
| "grad_norm": 2.1875, |
| "learning_rate": 1.1278153153153153e-05, |
| "loss": 0.5349, |
| "mean_token_accuracy": 0.9292694211006165, |
| "step": 3325, |
| "train/kl_loss_qwen": 0.032761602150276306, |
| "train/kl_loss_r1": 0.0203021552413702, |
| "train/total_kl": 0.05306375734508038 |
| }, |
| { |
| "epoch": 2.4984049540251454, |
| "grad_norm": 1.875, |
| "learning_rate": 1.125e-05, |
| "loss": 0.6419, |
| "mean_token_accuracy": 0.9353505343198776, |
| "step": 3330, |
| "train/kl_loss_qwen": 0.05452116383239627, |
| "train/kl_loss_r1": 0.031527131283655765, |
| "train/total_kl": 0.08604829544201494 |
| }, |
| { |
| "epoch": 2.5021580033777444, |
| "grad_norm": 2.140625, |
| "learning_rate": 1.1221846846846846e-05, |
| "loss": 0.622, |
| "mean_token_accuracy": 0.9341338902711869, |
| "step": 3335, |
| "train/kl_loss_qwen": 0.04978591026738286, |
| "train/kl_loss_r1": 0.029290991835296154, |
| "train/total_kl": 0.0790769032202661 |
| }, |
| { |
| "epoch": 2.5059110527303434, |
| "grad_norm": 2.578125, |
| "learning_rate": 1.1193693693693694e-05, |
| "loss": 0.5679, |
| "mean_token_accuracy": 0.9300838261842728, |
| "step": 3340, |
| "train/kl_loss_qwen": 0.0432100894395262, |
| "train/kl_loss_r1": 0.02546289232559502, |
| "train/total_kl": 0.06867298241704703 |
| }, |
| { |
| "epoch": 2.5096641020829424, |
| "grad_norm": 2.296875, |
| "learning_rate": 1.1165540540540541e-05, |
| "loss": 0.5739, |
| "mean_token_accuracy": 0.9369128614664077, |
| "step": 3345, |
| "train/kl_loss_qwen": 0.04455037331208587, |
| "train/kl_loss_r1": 0.02718741991557181, |
| "train/total_kl": 0.07173779308795929 |
| }, |
| { |
| "epoch": 2.5134171514355415, |
| "grad_norm": 1.859375, |
| "learning_rate": 1.1137387387387388e-05, |
| "loss": 0.5353, |
| "mean_token_accuracy": 0.932581090927124, |
| "step": 3350, |
| "train/kl_loss_qwen": 0.0413767262827605, |
| "train/kl_loss_r1": 0.022167172096669675, |
| "train/total_kl": 0.06354389851912856 |
| }, |
| { |
| "epoch": 2.5171702007881405, |
| "grad_norm": 2.0, |
| "learning_rate": 1.1109234234234234e-05, |
| "loss": 0.5343, |
| "mean_token_accuracy": 0.927921137213707, |
| "step": 3355, |
| "train/kl_loss_qwen": 0.03147038575261831, |
| "train/kl_loss_r1": 0.01910092611797154, |
| "train/total_kl": 0.050571311730891466 |
| }, |
| { |
| "epoch": 2.5209232501407395, |
| "grad_norm": 1.5859375, |
| "learning_rate": 1.1081081081081081e-05, |
| "loss": 0.4947, |
| "mean_token_accuracy": 0.9445708662271499, |
| "step": 3360, |
| "train/kl_loss_qwen": 0.03797930618748069, |
| "train/kl_loss_r1": 0.021180487936362624, |
| "train/total_kl": 0.05915979370474815 |
| }, |
| { |
| "epoch": 2.5246762994933385, |
| "grad_norm": 1.890625, |
| "learning_rate": 1.1052927927927929e-05, |
| "loss": 0.5647, |
| "mean_token_accuracy": 0.9292292296886444, |
| "step": 3365, |
| "train/kl_loss_qwen": 0.03970672045834363, |
| "train/kl_loss_r1": 0.023722950136289, |
| "train/total_kl": 0.06342967031523586 |
| }, |
| { |
| "epoch": 2.528429348845937, |
| "grad_norm": 1.9375, |
| "learning_rate": 1.1024774774774774e-05, |
| "loss": 0.5524, |
| "mean_token_accuracy": 0.9366607517004013, |
| "step": 3370, |
| "train/kl_loss_qwen": 0.04209428019821644, |
| "train/kl_loss_r1": 0.024846457364037632, |
| "train/total_kl": 0.06694073788821697 |
| }, |
| { |
| "epoch": 2.532182398198536, |
| "grad_norm": 1.6796875, |
| "learning_rate": 1.0996621621621622e-05, |
| "loss": 0.5887, |
| "mean_token_accuracy": 0.9346622288227081, |
| "step": 3375, |
| "train/kl_loss_qwen": 0.04933397052809596, |
| "train/kl_loss_r1": 0.026567904464900493, |
| "train/total_kl": 0.07590187508612871 |
| }, |
| { |
| "epoch": 2.535935447551135, |
| "grad_norm": 3.234375, |
| "learning_rate": 1.0968468468468469e-05, |
| "loss": 0.5237, |
| "mean_token_accuracy": 0.9299458533525466, |
| "step": 3380, |
| "train/kl_loss_qwen": 0.02983626089990139, |
| "train/kl_loss_r1": 0.019484353670850395, |
| "train/total_kl": 0.04932061461731792 |
| }, |
| { |
| "epoch": 2.539688496903734, |
| "grad_norm": 1.7890625, |
| "learning_rate": 1.0940315315315316e-05, |
| "loss": 0.5345, |
| "mean_token_accuracy": 0.9382866770029068, |
| "step": 3385, |
| "train/kl_loss_qwen": 0.04042149954475462, |
| "train/kl_loss_r1": 0.023517983220517635, |
| "train/total_kl": 0.06393948178738355 |
| }, |
| { |
| "epoch": 2.543441546256333, |
| "grad_norm": 1.671875, |
| "learning_rate": 1.0912162162162162e-05, |
| "loss": 0.521, |
| "mean_token_accuracy": 0.9384631723165512, |
| "step": 3390, |
| "train/kl_loss_qwen": 0.038067093631252644, |
| "train/kl_loss_r1": 0.02246550181880593, |
| "train/total_kl": 0.06053259586915374 |
| }, |
| { |
| "epoch": 2.547194595608932, |
| "grad_norm": 1.9296875, |
| "learning_rate": 1.088400900900901e-05, |
| "loss": 0.5482, |
| "mean_token_accuracy": 0.9318992495536804, |
| "step": 3395, |
| "train/kl_loss_qwen": 0.03690930460579693, |
| "train/kl_loss_r1": 0.02255395017564297, |
| "train/total_kl": 0.059463254641741514 |
| }, |
| { |
| "epoch": 2.550947644961531, |
| "grad_norm": 2.609375, |
| "learning_rate": 1.0855855855855857e-05, |
| "loss": 0.4918, |
| "mean_token_accuracy": 0.9357536435127258, |
| "step": 3400, |
| "train/kl_loss_qwen": 0.030488945869728924, |
| "train/kl_loss_r1": 0.01972590610384941, |
| "train/total_kl": 0.050214852392673495 |
| }, |
| { |
| "epoch": 2.55470069431413, |
| "grad_norm": 1.8046875, |
| "learning_rate": 1.0827702702702702e-05, |
| "loss": 0.623, |
| "mean_token_accuracy": 0.9369746416807174, |
| "step": 3405, |
| "train/kl_loss_qwen": 0.05603249073028564, |
| "train/kl_loss_r1": 0.0298390360083431, |
| "train/total_kl": 0.08587152734398842 |
| }, |
| { |
| "epoch": 2.558453743666729, |
| "grad_norm": 1.703125, |
| "learning_rate": 1.079954954954955e-05, |
| "loss": 0.5262, |
| "mean_token_accuracy": 0.9425755172967911, |
| "step": 3410, |
| "train/kl_loss_qwen": 0.03950298763811588, |
| "train/kl_loss_r1": 0.02380976346321404, |
| "train/total_kl": 0.06331275068223477 |
| }, |
| { |
| "epoch": 2.562206793019328, |
| "grad_norm": 1.859375, |
| "learning_rate": 1.0771396396396397e-05, |
| "loss": 0.5639, |
| "mean_token_accuracy": 0.9331496387720108, |
| "step": 3415, |
| "train/kl_loss_qwen": 0.04406013865955174, |
| "train/kl_loss_r1": 0.024020101223140956, |
| "train/total_kl": 0.06808023946359754 |
| }, |
| { |
| "epoch": 2.565959842371927, |
| "grad_norm": 2.546875, |
| "learning_rate": 1.0743243243243244e-05, |
| "loss": 0.5149, |
| "mean_token_accuracy": 0.9378763616085053, |
| "step": 3420, |
| "train/kl_loss_qwen": 0.036142927082255485, |
| "train/kl_loss_r1": 0.023106351029127836, |
| "train/total_kl": 0.05924927722662687 |
| }, |
| { |
| "epoch": 2.569712891724526, |
| "grad_norm": 2.015625, |
| "learning_rate": 1.071509009009009e-05, |
| "loss": 0.533, |
| "mean_token_accuracy": 0.9345060348510742, |
| "step": 3425, |
| "train/kl_loss_qwen": 0.035566607816144825, |
| "train/kl_loss_r1": 0.022629395639523864, |
| "train/total_kl": 0.058196003921329974 |
| }, |
| { |
| "epoch": 2.5734659410771252, |
| "grad_norm": 2.03125, |
| "learning_rate": 1.0686936936936937e-05, |
| "loss": 0.4989, |
| "mean_token_accuracy": 0.9346575111150741, |
| "step": 3430, |
| "train/kl_loss_qwen": 0.03133196346461773, |
| "train/kl_loss_r1": 0.019670154713094235, |
| "train/total_kl": 0.05100211799144745 |
| }, |
| { |
| "epoch": 2.5772189904297242, |
| "grad_norm": 1.921875, |
| "learning_rate": 1.0658783783783785e-05, |
| "loss": 0.5453, |
| "mean_token_accuracy": 0.9339419305324554, |
| "step": 3435, |
| "train/kl_loss_qwen": 0.03465688219293952, |
| "train/kl_loss_r1": 0.021777683729305865, |
| "train/total_kl": 0.05643456541001797 |
| }, |
| { |
| "epoch": 2.5809720397823233, |
| "grad_norm": 1.890625, |
| "learning_rate": 1.063063063063063e-05, |
| "loss": 0.5621, |
| "mean_token_accuracy": 0.9316897690296173, |
| "step": 3440, |
| "train/kl_loss_qwen": 0.03479852089658379, |
| "train/kl_loss_r1": 0.022237913217395544, |
| "train/total_kl": 0.057036434207111596 |
| }, |
| { |
| "epoch": 2.5847250891349223, |
| "grad_norm": 1.84375, |
| "learning_rate": 1.0602477477477478e-05, |
| "loss": 0.512, |
| "mean_token_accuracy": 0.9422204077243805, |
| "step": 3445, |
| "train/kl_loss_qwen": 0.037066091177985074, |
| "train/kl_loss_r1": 0.023700099997222425, |
| "train/total_kl": 0.060766191128641366 |
| }, |
| { |
| "epoch": 2.5884781384875213, |
| "grad_norm": 2.390625, |
| "learning_rate": 1.0574324324324325e-05, |
| "loss": 0.5067, |
| "mean_token_accuracy": 0.9312503308057785, |
| "step": 3450, |
| "train/kl_loss_qwen": 0.03274406418204308, |
| "train/kl_loss_r1": 0.020862600672990082, |
| "train/total_kl": 0.05360666448250413 |
| }, |
| { |
| "epoch": 2.5922311878401203, |
| "grad_norm": 2.640625, |
| "learning_rate": 1.0546171171171172e-05, |
| "loss": 0.5086, |
| "mean_token_accuracy": 0.9356559842824936, |
| "step": 3455, |
| "train/kl_loss_qwen": 0.03636283753439784, |
| "train/kl_loss_r1": 0.02178000183776021, |
| "train/total_kl": 0.05814283927902579 |
| }, |
| { |
| "epoch": 2.5959842371927193, |
| "grad_norm": 1.9609375, |
| "learning_rate": 1.0518018018018018e-05, |
| "loss": 0.5021, |
| "mean_token_accuracy": 0.940264904499054, |
| "step": 3460, |
| "train/kl_loss_qwen": 0.03297446658834815, |
| "train/kl_loss_r1": 0.021592933125793932, |
| "train/total_kl": 0.0545673999004066 |
| }, |
| { |
| "epoch": 2.5997372865453183, |
| "grad_norm": 2.015625, |
| "learning_rate": 1.0489864864864865e-05, |
| "loss": 0.5454, |
| "mean_token_accuracy": 0.9404850274324417, |
| "step": 3465, |
| "train/kl_loss_qwen": 0.04411001540720463, |
| "train/kl_loss_r1": 0.025393107812851666, |
| "train/total_kl": 0.06950312331318856 |
| }, |
| { |
| "epoch": 2.603490335897917, |
| "grad_norm": 1.78125, |
| "learning_rate": 1.0461711711711713e-05, |
| "loss": 0.5201, |
| "mean_token_accuracy": 0.9440337806940079, |
| "step": 3470, |
| "train/kl_loss_qwen": 0.041339093120768666, |
| "train/kl_loss_r1": 0.02469945913180709, |
| "train/total_kl": 0.06603855239227414 |
| }, |
| { |
| "epoch": 2.607243385250516, |
| "grad_norm": 2.21875, |
| "learning_rate": 1.043355855855856e-05, |
| "loss": 0.5122, |
| "mean_token_accuracy": 0.9338981837034226, |
| "step": 3475, |
| "train/kl_loss_qwen": 0.03163531045429409, |
| "train/kl_loss_r1": 0.020907067647203802, |
| "train/total_kl": 0.05254237810149789 |
| }, |
| { |
| "epoch": 2.610996434603115, |
| "grad_norm": 1.8125, |
| "learning_rate": 1.0405405405405406e-05, |
| "loss": 0.5841, |
| "mean_token_accuracy": 0.9341493427753449, |
| "step": 3480, |
| "train/kl_loss_qwen": 0.049100861279293896, |
| "train/kl_loss_r1": 0.026905355555936695, |
| "train/total_kl": 0.07600621711462736 |
| }, |
| { |
| "epoch": 2.614749483955714, |
| "grad_norm": 1.5625, |
| "learning_rate": 1.0377252252252253e-05, |
| "loss": 0.579, |
| "mean_token_accuracy": 0.9387732237577439, |
| "step": 3485, |
| "train/kl_loss_qwen": 0.04798796251416206, |
| "train/kl_loss_r1": 0.027056048065423964, |
| "train/total_kl": 0.07504401141777635 |
| }, |
| { |
| "epoch": 2.618502533308313, |
| "grad_norm": 2.75, |
| "learning_rate": 1.03490990990991e-05, |
| "loss": 0.5499, |
| "mean_token_accuracy": 0.9330289214849472, |
| "step": 3490, |
| "train/kl_loss_qwen": 0.03633160563185811, |
| "train/kl_loss_r1": 0.02329326728358865, |
| "train/total_kl": 0.05962487207725644 |
| }, |
| { |
| "epoch": 2.622255582660912, |
| "grad_norm": 2.6875, |
| "learning_rate": 1.0320945945945946e-05, |
| "loss": 0.5351, |
| "mean_token_accuracy": 0.9311683624982834, |
| "step": 3495, |
| "train/kl_loss_qwen": 0.03595252772793174, |
| "train/kl_loss_r1": 0.022297431947663426, |
| "train/total_kl": 0.05824995981529355 |
| }, |
| { |
| "epoch": 2.626008632013511, |
| "grad_norm": 2.203125, |
| "learning_rate": 1.0292792792792793e-05, |
| "loss": 0.5577, |
| "mean_token_accuracy": 0.9325771689414978, |
| "step": 3500, |
| "train/kl_loss_qwen": 0.03546359553001821, |
| "train/kl_loss_r1": 0.022251410642638803, |
| "train/total_kl": 0.05771500645205378 |
| }, |
| { |
| "epoch": 2.62976168136611, |
| "grad_norm": 1.984375, |
| "learning_rate": 1.026463963963964e-05, |
| "loss": 0.5726, |
| "mean_token_accuracy": 0.9327528506517411, |
| "step": 3505, |
| "train/kl_loss_qwen": 0.04111943980678916, |
| "train/kl_loss_r1": 0.025728296581655742, |
| "train/total_kl": 0.06684773582965135 |
| }, |
| { |
| "epoch": 2.633514730718709, |
| "grad_norm": 1.921875, |
| "learning_rate": 1.0236486486486488e-05, |
| "loss": 0.5926, |
| "mean_token_accuracy": 0.9328369259834289, |
| "step": 3510, |
| "train/kl_loss_qwen": 0.046308462787419555, |
| "train/kl_loss_r1": 0.02664640606380999, |
| "train/total_kl": 0.07295486945658922 |
| }, |
| { |
| "epoch": 2.637267780071308, |
| "grad_norm": 1.6796875, |
| "learning_rate": 1.0208333333333334e-05, |
| "loss": 0.5781, |
| "mean_token_accuracy": 0.9362814456224442, |
| "step": 3515, |
| "train/kl_loss_qwen": 0.04740121774375439, |
| "train/kl_loss_r1": 0.026224265387281776, |
| "train/total_kl": 0.0736254833638668 |
| }, |
| { |
| "epoch": 2.641020829423907, |
| "grad_norm": 2.09375, |
| "learning_rate": 1.0180180180180181e-05, |
| "loss": 0.6094, |
| "mean_token_accuracy": 0.9310470670461655, |
| "step": 3520, |
| "train/kl_loss_qwen": 0.046079412242397665, |
| "train/kl_loss_r1": 0.02684156009927392, |
| "train/total_kl": 0.07292097266763449 |
| }, |
| { |
| "epoch": 2.644773878776506, |
| "grad_norm": 2.171875, |
| "learning_rate": 1.0152027027027028e-05, |
| "loss": 0.5425, |
| "mean_token_accuracy": 0.9256984144449234, |
| "step": 3525, |
| "train/kl_loss_qwen": 0.03432284677401185, |
| "train/kl_loss_r1": 0.02130248979665339, |
| "train/total_kl": 0.055625336803495885 |
| }, |
| { |
| "epoch": 2.648526928129105, |
| "grad_norm": 2.390625, |
| "learning_rate": 1.0123873873873874e-05, |
| "loss": 0.5209, |
| "mean_token_accuracy": 0.9320784568786621, |
| "step": 3530, |
| "train/kl_loss_qwen": 0.030805668141692878, |
| "train/kl_loss_r1": 0.019909562543034554, |
| "train/total_kl": 0.05071523003280163 |
| }, |
| { |
| "epoch": 2.6522799774817036, |
| "grad_norm": 2.734375, |
| "learning_rate": 1.0095720720720721e-05, |
| "loss": 0.566, |
| "mean_token_accuracy": 0.9416737079620361, |
| "step": 3535, |
| "train/kl_loss_qwen": 0.04397767055779696, |
| "train/kl_loss_r1": 0.026771708764135836, |
| "train/total_kl": 0.07074937922880054 |
| }, |
| { |
| "epoch": 2.6560330268343026, |
| "grad_norm": 1.9609375, |
| "learning_rate": 1.0067567567567569e-05, |
| "loss": 0.5221, |
| "mean_token_accuracy": 0.937117201089859, |
| "step": 3540, |
| "train/kl_loss_qwen": 0.03365273177623749, |
| "train/kl_loss_r1": 0.021670471411198378, |
| "train/total_kl": 0.05532320309430361 |
| }, |
| { |
| "epoch": 2.6597860761869017, |
| "grad_norm": 2.4375, |
| "learning_rate": 1.0039414414414416e-05, |
| "loss": 0.5136, |
| "mean_token_accuracy": 0.9384093523025513, |
| "step": 3545, |
| "train/kl_loss_qwen": 0.03165590218268335, |
| "train/kl_loss_r1": 0.021389018185436724, |
| "train/total_kl": 0.053044920414686204 |
| }, |
| { |
| "epoch": 2.6635391255395007, |
| "grad_norm": 3.046875, |
| "learning_rate": 1.0011261261261262e-05, |
| "loss": 0.5164, |
| "mean_token_accuracy": 0.9325183421373368, |
| "step": 3550, |
| "train/kl_loss_qwen": 0.02961095222271979, |
| "train/kl_loss_r1": 0.019611746584996582, |
| "train/total_kl": 0.049222698993980886 |
| }, |
| { |
| "epoch": 2.6672921748920997, |
| "grad_norm": 2.0, |
| "learning_rate": 9.983108108108109e-06, |
| "loss": 0.5269, |
| "mean_token_accuracy": 0.9398354828357697, |
| "step": 3555, |
| "train/kl_loss_qwen": 0.03761188993230462, |
| "train/kl_loss_r1": 0.023912502732127906, |
| "train/total_kl": 0.06152439266443253 |
| }, |
| { |
| "epoch": 2.6710452242446987, |
| "grad_norm": 1.6953125, |
| "learning_rate": 9.954954954954956e-06, |
| "loss": 0.5265, |
| "mean_token_accuracy": 0.9428102672100067, |
| "step": 3560, |
| "train/kl_loss_qwen": 0.04230879452079535, |
| "train/kl_loss_r1": 0.026035568164661526, |
| "train/total_kl": 0.06834436235949397 |
| }, |
| { |
| "epoch": 2.6747982735972977, |
| "grad_norm": 2.1875, |
| "learning_rate": 9.926801801801802e-06, |
| "loss": 0.5545, |
| "mean_token_accuracy": 0.9395761728286743, |
| "step": 3565, |
| "train/kl_loss_qwen": 0.042321126256138084, |
| "train/kl_loss_r1": 0.026880426658317448, |
| "train/total_kl": 0.06920155417174101 |
| }, |
| { |
| "epoch": 2.6785513229498967, |
| "grad_norm": 2.484375, |
| "learning_rate": 9.89864864864865e-06, |
| "loss": 0.4927, |
| "mean_token_accuracy": 0.9371385693550109, |
| "step": 3570, |
| "train/kl_loss_qwen": 0.028558475058525802, |
| "train/kl_loss_r1": 0.01896639233455062, |
| "train/total_kl": 0.047524867206811906 |
| }, |
| { |
| "epoch": 2.6823043723024957, |
| "grad_norm": 1.875, |
| "learning_rate": 9.870495495495497e-06, |
| "loss": 0.5824, |
| "mean_token_accuracy": 0.9339749813079834, |
| "step": 3575, |
| "train/kl_loss_qwen": 0.0459581867326051, |
| "train/kl_loss_r1": 0.02593495771288872, |
| "train/total_kl": 0.07189314477145672 |
| }, |
| { |
| "epoch": 2.6860574216550948, |
| "grad_norm": 1.7890625, |
| "learning_rate": 9.842342342342344e-06, |
| "loss": 0.6433, |
| "mean_token_accuracy": 0.9311673611402511, |
| "step": 3580, |
| "train/kl_loss_qwen": 0.051213488029316065, |
| "train/kl_loss_r1": 0.030939326249063016, |
| "train/total_kl": 0.08215281507000327 |
| }, |
| { |
| "epoch": 2.6898104710076938, |
| "grad_norm": 1.9140625, |
| "learning_rate": 9.81418918918919e-06, |
| "loss": 0.5293, |
| "mean_token_accuracy": 0.9371504604816436, |
| "step": 3585, |
| "train/kl_loss_qwen": 0.038671653857454656, |
| "train/kl_loss_r1": 0.02250283914618194, |
| "train/total_kl": 0.061174492444843055 |
| }, |
| { |
| "epoch": 2.693563520360293, |
| "grad_norm": 1.6796875, |
| "learning_rate": 9.786036036036037e-06, |
| "loss": 0.5056, |
| "mean_token_accuracy": 0.9385312110185623, |
| "step": 3590, |
| "train/kl_loss_qwen": 0.032683673035353425, |
| "train/kl_loss_r1": 0.021441146731376648, |
| "train/total_kl": 0.05412481976673007 |
| }, |
| { |
| "epoch": 2.697316569712892, |
| "grad_norm": 1.5703125, |
| "learning_rate": 9.757882882882884e-06, |
| "loss": 0.5883, |
| "mean_token_accuracy": 0.9399591952562332, |
| "step": 3595, |
| "train/kl_loss_qwen": 0.04788463073782623, |
| "train/kl_loss_r1": 0.02818334260955453, |
| "train/total_kl": 0.07606797246262431 |
| }, |
| { |
| "epoch": 2.701069619065491, |
| "grad_norm": 1.921875, |
| "learning_rate": 9.72972972972973e-06, |
| "loss": 0.5531, |
| "mean_token_accuracy": 0.9394397348165512, |
| "step": 3600, |
| "train/kl_loss_qwen": 0.04099080595187843, |
| "train/kl_loss_r1": 0.026141448691487313, |
| "train/total_kl": 0.06713225385174156 |
| }, |
| { |
| "epoch": 2.70482266841809, |
| "grad_norm": 2.203125, |
| "learning_rate": 9.701576576576577e-06, |
| "loss": 0.5351, |
| "mean_token_accuracy": 0.9384431034326554, |
| "step": 3605, |
| "train/kl_loss_qwen": 0.03942276262678206, |
| "train/kl_loss_r1": 0.024574512057006358, |
| "train/total_kl": 0.06399727454409003 |
| }, |
| { |
| "epoch": 2.708575717770689, |
| "grad_norm": 3.125, |
| "learning_rate": 9.673423423423425e-06, |
| "loss": 0.5716, |
| "mean_token_accuracy": 0.9273164391517639, |
| "step": 3610, |
| "train/kl_loss_qwen": 0.03769365311600268, |
| "train/kl_loss_r1": 0.02313569700345397, |
| "train/total_kl": 0.060829350538551805 |
| }, |
| { |
| "epoch": 2.712328767123288, |
| "grad_norm": 2.0, |
| "learning_rate": 9.645270270270272e-06, |
| "loss": 0.5567, |
| "mean_token_accuracy": 0.9299625158309937, |
| "step": 3615, |
| "train/kl_loss_qwen": 0.03794219749979675, |
| "train/kl_loss_r1": 0.02285592113621533, |
| "train/total_kl": 0.0607981177046895 |
| }, |
| { |
| "epoch": 2.716081816475887, |
| "grad_norm": 2.71875, |
| "learning_rate": 9.617117117117117e-06, |
| "loss": 0.534, |
| "mean_token_accuracy": 0.9324219495058059, |
| "step": 3620, |
| "train/kl_loss_qwen": 0.0340952820610255, |
| "train/kl_loss_r1": 0.021674492675811053, |
| "train/total_kl": 0.05576977375894785 |
| }, |
| { |
| "epoch": 2.719834865828486, |
| "grad_norm": 2.234375, |
| "learning_rate": 9.588963963963965e-06, |
| "loss": 0.5323, |
| "mean_token_accuracy": 0.9365492641925812, |
| "step": 3625, |
| "train/kl_loss_qwen": 0.03745631170459092, |
| "train/kl_loss_r1": 0.023027216829359532, |
| "train/total_kl": 0.06048352811485529 |
| }, |
| { |
| "epoch": 2.723587915181085, |
| "grad_norm": 2.125, |
| "learning_rate": 9.560810810810812e-06, |
| "loss": 0.5372, |
| "mean_token_accuracy": 0.9387341290712357, |
| "step": 3630, |
| "train/kl_loss_qwen": 0.03898381176404655, |
| "train/kl_loss_r1": 0.02341577596962452, |
| "train/total_kl": 0.062399587128311396 |
| }, |
| { |
| "epoch": 2.7273409645336835, |
| "grad_norm": 1.8984375, |
| "learning_rate": 9.532657657657658e-06, |
| "loss": 0.4913, |
| "mean_token_accuracy": 0.9357551246881485, |
| "step": 3635, |
| "train/kl_loss_qwen": 0.029723901767283678, |
| "train/kl_loss_r1": 0.01947716358117759, |
| "train/total_kl": 0.04920106595382094 |
| }, |
| { |
| "epoch": 2.7310940138862825, |
| "grad_norm": 2.25, |
| "learning_rate": 9.504504504504505e-06, |
| "loss": 0.6634, |
| "mean_token_accuracy": 0.9307036340236664, |
| "step": 3640, |
| "train/kl_loss_qwen": 0.057159008970484135, |
| "train/kl_loss_r1": 0.031469490751624106, |
| "train/total_kl": 0.0886284988373518 |
| }, |
| { |
| "epoch": 2.7348470632388815, |
| "grad_norm": 2.03125, |
| "learning_rate": 9.476351351351352e-06, |
| "loss": 0.6397, |
| "mean_token_accuracy": 0.9389469265937805, |
| "step": 3645, |
| "train/kl_loss_qwen": 0.05761205237358809, |
| "train/kl_loss_r1": 0.03301434912718833, |
| "train/total_kl": 0.09062640201300383 |
| }, |
| { |
| "epoch": 2.7386001125914805, |
| "grad_norm": 1.7890625, |
| "learning_rate": 9.4481981981982e-06, |
| "loss": 0.6008, |
| "mean_token_accuracy": 0.9420938581228256, |
| "step": 3650, |
| "train/kl_loss_qwen": 0.0493962530978024, |
| "train/kl_loss_r1": 0.02965642362833023, |
| "train/total_kl": 0.07905267719179392 |
| }, |
| { |
| "epoch": 2.7423531619440795, |
| "grad_norm": 2.125, |
| "learning_rate": 9.420045045045045e-06, |
| "loss": 0.5786, |
| "mean_token_accuracy": 0.9452258825302124, |
| "step": 3655, |
| "train/kl_loss_qwen": 0.045825537852942945, |
| "train/kl_loss_r1": 0.028989409655332567, |
| "train/total_kl": 0.0748149486258626 |
| }, |
| { |
| "epoch": 2.7461062112966785, |
| "grad_norm": 2.40625, |
| "learning_rate": 9.391891891891893e-06, |
| "loss": 0.5012, |
| "mean_token_accuracy": 0.9325804680585861, |
| "step": 3660, |
| "train/kl_loss_qwen": 0.03034242382273078, |
| "train/kl_loss_r1": 0.019461313867941497, |
| "train/total_kl": 0.04980373801663518 |
| }, |
| { |
| "epoch": 2.7498592606492775, |
| "grad_norm": 2.1875, |
| "learning_rate": 9.36373873873874e-06, |
| "loss": 0.5422, |
| "mean_token_accuracy": 0.9366270989179611, |
| "step": 3665, |
| "train/kl_loss_qwen": 0.038491744874045254, |
| "train/kl_loss_r1": 0.02244432335719466, |
| "train/total_kl": 0.060936068464070556 |
| }, |
| { |
| "epoch": 2.7536123100018766, |
| "grad_norm": 1.7109375, |
| "learning_rate": 9.335585585585586e-06, |
| "loss": 0.53, |
| "mean_token_accuracy": 0.9383520632982254, |
| "step": 3670, |
| "train/kl_loss_qwen": 0.039867379842326044, |
| "train/kl_loss_r1": 0.023165831109508872, |
| "train/total_kl": 0.06303321113809943 |
| }, |
| { |
| "epoch": 2.7573653593544756, |
| "grad_norm": 2.671875, |
| "learning_rate": 9.307432432432433e-06, |
| "loss": 0.5525, |
| "mean_token_accuracy": 0.9366106450557709, |
| "step": 3675, |
| "train/kl_loss_qwen": 0.0403043738566339, |
| "train/kl_loss_r1": 0.024402129231020808, |
| "train/total_kl": 0.06470650397241115 |
| }, |
| { |
| "epoch": 2.7611184087070746, |
| "grad_norm": 2.0, |
| "learning_rate": 9.27927927927928e-06, |
| "loss": 0.5376, |
| "mean_token_accuracy": 0.937373474240303, |
| "step": 3680, |
| "train/kl_loss_qwen": 0.03944247434847057, |
| "train/kl_loss_r1": 0.023985707806423305, |
| "train/total_kl": 0.06342818234115839 |
| }, |
| { |
| "epoch": 2.7648714580596736, |
| "grad_norm": 1.953125, |
| "learning_rate": 9.251126126126128e-06, |
| "loss": 0.554, |
| "mean_token_accuracy": 0.9357343703508377, |
| "step": 3685, |
| "train/kl_loss_qwen": 0.042518915608525276, |
| "train/kl_loss_r1": 0.025951301399618387, |
| "train/total_kl": 0.06847021728754044 |
| }, |
| { |
| "epoch": 2.7686245074122726, |
| "grad_norm": 2.078125, |
| "learning_rate": 9.222972972972973e-06, |
| "loss": 0.5743, |
| "mean_token_accuracy": 0.9325124055147171, |
| "step": 3690, |
| "train/kl_loss_qwen": 0.04556261282414198, |
| "train/kl_loss_r1": 0.025064739352092146, |
| "train/total_kl": 0.07062735268846154 |
| }, |
| { |
| "epoch": 2.772377556764871, |
| "grad_norm": 3.359375, |
| "learning_rate": 9.19481981981982e-06, |
| "loss": 0.5233, |
| "mean_token_accuracy": 0.9305480986833572, |
| "step": 3695, |
| "train/kl_loss_qwen": 0.031651955423876645, |
| "train/kl_loss_r1": 0.020345580391585828, |
| "train/total_kl": 0.05199753614142537 |
| }, |
| { |
| "epoch": 2.77613060611747, |
| "grad_norm": 1.8828125, |
| "learning_rate": 9.166666666666668e-06, |
| "loss": 0.5326, |
| "mean_token_accuracy": 0.9327965170145035, |
| "step": 3700, |
| "train/kl_loss_qwen": 0.03383352099917829, |
| "train/kl_loss_r1": 0.02235841490328312, |
| "train/total_kl": 0.056191935669630766 |
| }, |
| { |
| "epoch": 2.779883655470069, |
| "grad_norm": 2.03125, |
| "learning_rate": 9.138513513513514e-06, |
| "loss": 0.5492, |
| "mean_token_accuracy": 0.9406279385089874, |
| "step": 3705, |
| "train/kl_loss_qwen": 0.04245820404030383, |
| "train/kl_loss_r1": 0.02547566662542522, |
| "train/total_kl": 0.06793387047946453 |
| }, |
| { |
| "epoch": 2.7836367048226682, |
| "grad_norm": 1.9921875, |
| "learning_rate": 9.110360360360361e-06, |
| "loss": 0.5834, |
| "mean_token_accuracy": 0.9409590631723403, |
| "step": 3710, |
| "train/kl_loss_qwen": 0.04834628850221634, |
| "train/kl_loss_r1": 0.028032816713675857, |
| "train/total_kl": 0.07637910544872284 |
| }, |
| { |
| "epoch": 2.7873897541752672, |
| "grad_norm": 2.015625, |
| "learning_rate": 9.082207207207208e-06, |
| "loss": 0.5663, |
| "mean_token_accuracy": 0.9342130035161972, |
| "step": 3715, |
| "train/kl_loss_qwen": 0.04353028647601605, |
| "train/kl_loss_r1": 0.024533309601247312, |
| "train/total_kl": 0.06806359644979239 |
| }, |
| { |
| "epoch": 2.7911428035278663, |
| "grad_norm": 1.9375, |
| "learning_rate": 9.054054054054056e-06, |
| "loss": 0.5073, |
| "mean_token_accuracy": 0.9400626242160797, |
| "step": 3720, |
| "train/kl_loss_qwen": 0.03470782497897744, |
| "train/kl_loss_r1": 0.021252785716205834, |
| "train/total_kl": 0.0559606104157865 |
| }, |
| { |
| "epoch": 2.7948958528804653, |
| "grad_norm": 1.9140625, |
| "learning_rate": 9.025900900900901e-06, |
| "loss": 0.5781, |
| "mean_token_accuracy": 0.9387185037136078, |
| "step": 3725, |
| "train/kl_loss_qwen": 0.045765295764431356, |
| "train/kl_loss_r1": 0.02741283820942044, |
| "train/total_kl": 0.07317813383415342 |
| }, |
| { |
| "epoch": 2.7986489022330643, |
| "grad_norm": 1.8984375, |
| "learning_rate": 8.997747747747749e-06, |
| "loss": 0.5982, |
| "mean_token_accuracy": 0.9270498305559158, |
| "step": 3730, |
| "train/kl_loss_qwen": 0.04484616173431277, |
| "train/kl_loss_r1": 0.026128320163115858, |
| "train/total_kl": 0.0709744818508625 |
| }, |
| { |
| "epoch": 2.8024019515856633, |
| "grad_norm": 2.390625, |
| "learning_rate": 8.969594594594596e-06, |
| "loss": 0.5648, |
| "mean_token_accuracy": 0.9334120750427246, |
| "step": 3735, |
| "train/kl_loss_qwen": 0.039087398629635575, |
| "train/kl_loss_r1": 0.02425426966510713, |
| "train/total_kl": 0.06334166843444108 |
| }, |
| { |
| "epoch": 2.8061550009382623, |
| "grad_norm": 1.578125, |
| "learning_rate": 8.941441441441442e-06, |
| "loss": 0.543, |
| "mean_token_accuracy": 0.9337530016899109, |
| "step": 3740, |
| "train/kl_loss_qwen": 0.03704939093440771, |
| "train/kl_loss_r1": 0.02395803024992347, |
| "train/total_kl": 0.06100742164999247 |
| }, |
| { |
| "epoch": 2.8099080502908613, |
| "grad_norm": 1.9453125, |
| "learning_rate": 8.913288288288289e-06, |
| "loss": 0.5229, |
| "mean_token_accuracy": 0.9368319362401962, |
| "step": 3745, |
| "train/kl_loss_qwen": 0.0341915549710393, |
| "train/kl_loss_r1": 0.0229964439291507, |
| "train/total_kl": 0.05718799838796258 |
| }, |
| { |
| "epoch": 2.8136610996434603, |
| "grad_norm": 1.828125, |
| "learning_rate": 8.885135135135135e-06, |
| "loss": 0.5247, |
| "mean_token_accuracy": 0.9414711415767669, |
| "step": 3750, |
| "train/kl_loss_qwen": 0.0371045992244035, |
| "train/kl_loss_r1": 0.02308794721029699, |
| "train/total_kl": 0.06019254634156823 |
| }, |
| { |
| "epoch": 2.8174141489960594, |
| "grad_norm": 1.859375, |
| "learning_rate": 8.856981981981982e-06, |
| "loss": 0.5195, |
| "mean_token_accuracy": 0.9347955495119095, |
| "step": 3755, |
| "train/kl_loss_qwen": 0.033538066316396, |
| "train/kl_loss_r1": 0.02079420080408454, |
| "train/total_kl": 0.05433226684108376 |
| }, |
| { |
| "epoch": 2.8211671983486584, |
| "grad_norm": 2.203125, |
| "learning_rate": 8.828828828828828e-06, |
| "loss": 0.5368, |
| "mean_token_accuracy": 0.9394807755947113, |
| "step": 3760, |
| "train/kl_loss_qwen": 0.04017904317006469, |
| "train/kl_loss_r1": 0.02556949369609356, |
| "train/total_kl": 0.06574853714555502 |
| }, |
| { |
| "epoch": 2.8249202477012574, |
| "grad_norm": 2.25, |
| "learning_rate": 8.800675675675675e-06, |
| "loss": 0.5621, |
| "mean_token_accuracy": 0.9337575942277908, |
| "step": 3765, |
| "train/kl_loss_qwen": 0.04164319918490946, |
| "train/kl_loss_r1": 0.025234598480165005, |
| "train/total_kl": 0.06687779715284706 |
| }, |
| { |
| "epoch": 2.8286732970538564, |
| "grad_norm": 1.796875, |
| "learning_rate": 8.772522522522522e-06, |
| "loss": 0.6141, |
| "mean_token_accuracy": 0.9375328481197357, |
| "step": 3770, |
| "train/kl_loss_qwen": 0.05453315619379282, |
| "train/kl_loss_r1": 0.029898820351809262, |
| "train/total_kl": 0.08443197626620531 |
| }, |
| { |
| "epoch": 2.8324263464064554, |
| "grad_norm": 2.359375, |
| "learning_rate": 8.744369369369368e-06, |
| "loss": 0.5598, |
| "mean_token_accuracy": 0.9362965226173401, |
| "step": 3775, |
| "train/kl_loss_qwen": 0.04102930808439851, |
| "train/kl_loss_r1": 0.025926942005753517, |
| "train/total_kl": 0.06695624999701977 |
| }, |
| { |
| "epoch": 2.8361793957590544, |
| "grad_norm": 2.015625, |
| "learning_rate": 8.716216216216215e-06, |
| "loss": 0.5406, |
| "mean_token_accuracy": 0.935252970457077, |
| "step": 3780, |
| "train/kl_loss_qwen": 0.03538098763674498, |
| "train/kl_loss_r1": 0.0222157409414649, |
| "train/total_kl": 0.05759672923013568 |
| }, |
| { |
| "epoch": 2.8399324451116534, |
| "grad_norm": 1.6328125, |
| "learning_rate": 8.688063063063063e-06, |
| "loss": 0.5285, |
| "mean_token_accuracy": 0.9366535782814026, |
| "step": 3785, |
| "train/kl_loss_qwen": 0.037326518120244144, |
| "train/kl_loss_r1": 0.02341712433844805, |
| "train/total_kl": 0.06074364213272929 |
| }, |
| { |
| "epoch": 2.8436854944642525, |
| "grad_norm": 2.203125, |
| "learning_rate": 8.65990990990991e-06, |
| "loss": 0.5401, |
| "mean_token_accuracy": 0.9265829980373382, |
| "step": 3790, |
| "train/kl_loss_qwen": 0.03308621980249882, |
| "train/kl_loss_r1": 0.02124992748722434, |
| "train/total_kl": 0.054336147289723156 |
| }, |
| { |
| "epoch": 2.8474385438168515, |
| "grad_norm": 1.7265625, |
| "learning_rate": 8.631756756756756e-06, |
| "loss": 0.6078, |
| "mean_token_accuracy": 0.9308181017637253, |
| "step": 3795, |
| "train/kl_loss_qwen": 0.04486876749433577, |
| "train/kl_loss_r1": 0.027050571562722326, |
| "train/total_kl": 0.07191933877766132 |
| }, |
| { |
| "epoch": 2.85119159316945, |
| "grad_norm": 3.25, |
| "learning_rate": 8.603603603603603e-06, |
| "loss": 0.5967, |
| "mean_token_accuracy": 0.9408103972673416, |
| "step": 3800, |
| "train/kl_loss_qwen": 0.0475672734901309, |
| "train/kl_loss_r1": 0.02717355964705348, |
| "train/total_kl": 0.07474083248525858 |
| }, |
| { |
| "epoch": 2.854944642522049, |
| "grad_norm": 1.828125, |
| "learning_rate": 8.57545045045045e-06, |
| "loss": 0.5357, |
| "mean_token_accuracy": 0.9340519219636917, |
| "step": 3805, |
| "train/kl_loss_qwen": 0.036199712427333, |
| "train/kl_loss_r1": 0.02173711806535721, |
| "train/total_kl": 0.057936831191182134 |
| }, |
| { |
| "epoch": 2.858697691874648, |
| "grad_norm": 1.7890625, |
| "learning_rate": 8.547297297297296e-06, |
| "loss": 0.5403, |
| "mean_token_accuracy": 0.9292895257472992, |
| "step": 3810, |
| "train/kl_loss_qwen": 0.03628214751370251, |
| "train/kl_loss_r1": 0.02147832843475044, |
| "train/total_kl": 0.05776047557592392 |
| }, |
| { |
| "epoch": 2.862450741227247, |
| "grad_norm": 2.140625, |
| "learning_rate": 8.519144144144143e-06, |
| "loss": 0.5504, |
| "mean_token_accuracy": 0.940996965765953, |
| "step": 3815, |
| "train/kl_loss_qwen": 0.043149954592809084, |
| "train/kl_loss_r1": 0.024290137737989426, |
| "train/total_kl": 0.06744009256362915 |
| }, |
| { |
| "epoch": 2.866203790579846, |
| "grad_norm": 2.40625, |
| "learning_rate": 8.49099099099099e-06, |
| "loss": 0.5459, |
| "mean_token_accuracy": 0.9365820527076721, |
| "step": 3820, |
| "train/kl_loss_qwen": 0.037740124668926, |
| "train/kl_loss_r1": 0.023466435493901372, |
| "train/total_kl": 0.06120656076818705 |
| }, |
| { |
| "epoch": 2.869956839932445, |
| "grad_norm": 2.046875, |
| "learning_rate": 8.462837837837838e-06, |
| "loss": 0.5557, |
| "mean_token_accuracy": 0.9349883943796158, |
| "step": 3825, |
| "train/kl_loss_qwen": 0.03992229206487537, |
| "train/kl_loss_r1": 0.024882027273997666, |
| "train/total_kl": 0.06480431975796819 |
| }, |
| { |
| "epoch": 2.873709889285044, |
| "grad_norm": 2.296875, |
| "learning_rate": 8.434684684684684e-06, |
| "loss": 0.5419, |
| "mean_token_accuracy": 0.929443484544754, |
| "step": 3830, |
| "train/kl_loss_qwen": 0.029825980495661496, |
| "train/kl_loss_r1": 0.019207194168120622, |
| "train/total_kl": 0.04903317447751761 |
| }, |
| { |
| "epoch": 2.877462938637643, |
| "grad_norm": 1.8125, |
| "learning_rate": 8.406531531531531e-06, |
| "loss": 0.6054, |
| "mean_token_accuracy": 0.9381425529718399, |
| "step": 3835, |
| "train/kl_loss_qwen": 0.051548151206225155, |
| "train/kl_loss_r1": 0.029248832399025558, |
| "train/total_kl": 0.08079698467627168 |
| }, |
| { |
| "epoch": 2.881215987990242, |
| "grad_norm": 1.84375, |
| "learning_rate": 8.378378378378378e-06, |
| "loss": 0.5031, |
| "mean_token_accuracy": 0.9378216952085495, |
| "step": 3840, |
| "train/kl_loss_qwen": 0.029105788422748448, |
| "train/kl_loss_r1": 0.02014454547315836, |
| "train/total_kl": 0.049250333290547135 |
| }, |
| { |
| "epoch": 2.884969037342841, |
| "grad_norm": 1.7109375, |
| "learning_rate": 8.350225225225224e-06, |
| "loss": 0.557, |
| "mean_token_accuracy": 0.9410496950149536, |
| "step": 3845, |
| "train/kl_loss_qwen": 0.04421229516156018, |
| "train/kl_loss_r1": 0.027130865957587957, |
| "train/total_kl": 0.07134316163137555 |
| }, |
| { |
| "epoch": 2.88872208669544, |
| "grad_norm": 2.375, |
| "learning_rate": 8.322072072072071e-06, |
| "loss": 0.5813, |
| "mean_token_accuracy": 0.9363250583410263, |
| "step": 3850, |
| "train/kl_loss_qwen": 0.043784852838143706, |
| "train/kl_loss_r1": 0.02625744407996535, |
| "train/total_kl": 0.07004229752346873 |
| }, |
| { |
| "epoch": 2.892475136048039, |
| "grad_norm": 2.3125, |
| "learning_rate": 8.293918918918919e-06, |
| "loss": 0.5314, |
| "mean_token_accuracy": 0.9301344156265259, |
| "step": 3855, |
| "train/kl_loss_qwen": 0.03253565886989236, |
| "train/kl_loss_r1": 0.02052079071290791, |
| "train/total_kl": 0.05305644990876317 |
| }, |
| { |
| "epoch": 2.8962281854006378, |
| "grad_norm": 1.6328125, |
| "learning_rate": 8.265765765765766e-06, |
| "loss": 0.5232, |
| "mean_token_accuracy": 0.9402690678834915, |
| "step": 3860, |
| "train/kl_loss_qwen": 0.03729556603357196, |
| "train/kl_loss_r1": 0.023621046915650368, |
| "train/total_kl": 0.06091661211103201 |
| }, |
| { |
| "epoch": 2.8999812347532368, |
| "grad_norm": 2.125, |
| "learning_rate": 8.237612612612612e-06, |
| "loss": 0.5552, |
| "mean_token_accuracy": 0.9285988807678223, |
| "step": 3865, |
| "train/kl_loss_qwen": 0.03528278898447752, |
| "train/kl_loss_r1": 0.023424216313287616, |
| "train/total_kl": 0.05870700422674417 |
| }, |
| { |
| "epoch": 2.903734284105836, |
| "grad_norm": 1.875, |
| "learning_rate": 8.209459459459459e-06, |
| "loss": 0.5015, |
| "mean_token_accuracy": 0.9393262028694153, |
| "step": 3870, |
| "train/kl_loss_qwen": 0.03307979837991297, |
| "train/kl_loss_r1": 0.02109087221324444, |
| "train/total_kl": 0.05417067091912031 |
| }, |
| { |
| "epoch": 2.907487333458435, |
| "grad_norm": 2.234375, |
| "learning_rate": 8.181306306306306e-06, |
| "loss": 0.5546, |
| "mean_token_accuracy": 0.9359008401632309, |
| "step": 3875, |
| "train/kl_loss_qwen": 0.03611066797748208, |
| "train/kl_loss_r1": 0.021728359861299396, |
| "train/total_kl": 0.0578390278853476 |
| }, |
| { |
| "epoch": 2.911240382811034, |
| "grad_norm": 2.390625, |
| "learning_rate": 8.153153153153152e-06, |
| "loss": 0.5153, |
| "mean_token_accuracy": 0.9441088616847992, |
| "step": 3880, |
| "train/kl_loss_qwen": 0.0379474226385355, |
| "train/kl_loss_r1": 0.024300627363845705, |
| "train/total_kl": 0.062248049583286044 |
| }, |
| { |
| "epoch": 2.914993432163633, |
| "grad_norm": 1.84375, |
| "learning_rate": 8.125e-06, |
| "loss": 0.5666, |
| "mean_token_accuracy": 0.9372196048498154, |
| "step": 3885, |
| "train/kl_loss_qwen": 0.04451721617951989, |
| "train/kl_loss_r1": 0.025683000870049, |
| "train/total_kl": 0.0702002163976431 |
| }, |
| { |
| "epoch": 2.918746481516232, |
| "grad_norm": 1.7734375, |
| "learning_rate": 8.096846846846847e-06, |
| "loss": 0.6314, |
| "mean_token_accuracy": 0.939824691414833, |
| "step": 3890, |
| "train/kl_loss_qwen": 0.05579751967452466, |
| "train/kl_loss_r1": 0.031048040231689812, |
| "train/total_kl": 0.08684556037187577 |
| }, |
| { |
| "epoch": 2.922499530868831, |
| "grad_norm": 2.0, |
| "learning_rate": 8.068693693693694e-06, |
| "loss": 0.5812, |
| "mean_token_accuracy": 0.9380946755409241, |
| "step": 3895, |
| "train/kl_loss_qwen": 0.048919730540364983, |
| "train/kl_loss_r1": 0.027685640146955848, |
| "train/total_kl": 0.07660537036135792 |
| }, |
| { |
| "epoch": 2.92625258022143, |
| "grad_norm": 1.8828125, |
| "learning_rate": 8.04054054054054e-06, |
| "loss": 0.6208, |
| "mean_token_accuracy": 0.9400785356760025, |
| "step": 3900, |
| "train/kl_loss_qwen": 0.05649301186203957, |
| "train/kl_loss_r1": 0.03048962224274874, |
| "train/total_kl": 0.08698263382539154 |
| }, |
| { |
| "epoch": 2.930005629574029, |
| "grad_norm": 2.296875, |
| "learning_rate": 8.012387387387387e-06, |
| "loss": 0.5621, |
| "mean_token_accuracy": 0.931654891371727, |
| "step": 3905, |
| "train/kl_loss_qwen": 0.03453084141947329, |
| "train/kl_loss_r1": 0.02273784396238625, |
| "train/total_kl": 0.057268685381859544 |
| }, |
| { |
| "epoch": 2.933758678926628, |
| "grad_norm": 1.953125, |
| "learning_rate": 7.984234234234234e-06, |
| "loss": 0.5216, |
| "mean_token_accuracy": 0.93751060962677, |
| "step": 3910, |
| "train/kl_loss_qwen": 0.03516701152548194, |
| "train/kl_loss_r1": 0.021255293721333147, |
| "train/total_kl": 0.05642230454832316 |
| }, |
| { |
| "epoch": 2.937511728279227, |
| "grad_norm": 1.7890625, |
| "learning_rate": 7.956081081081082e-06, |
| "loss": 0.5714, |
| "mean_token_accuracy": 0.9317866563796997, |
| "step": 3915, |
| "train/kl_loss_qwen": 0.04194287592545152, |
| "train/kl_loss_r1": 0.02454805881716311, |
| "train/total_kl": 0.06649093553423882 |
| }, |
| { |
| "epoch": 2.941264777631826, |
| "grad_norm": 1.90625, |
| "learning_rate": 7.927927927927927e-06, |
| "loss": 0.545, |
| "mean_token_accuracy": 0.9375185400247574, |
| "step": 3920, |
| "train/kl_loss_qwen": 0.03942022132687271, |
| "train/kl_loss_r1": 0.023067365027964117, |
| "train/total_kl": 0.06248758668079972 |
| }, |
| { |
| "epoch": 2.945017826984425, |
| "grad_norm": 2.046875, |
| "learning_rate": 7.899774774774775e-06, |
| "loss": 0.5349, |
| "mean_token_accuracy": 0.9322762429714203, |
| "step": 3925, |
| "train/kl_loss_qwen": 0.034470038348808886, |
| "train/kl_loss_r1": 0.02245264039374888, |
| "train/total_kl": 0.05692267790436745 |
| }, |
| { |
| "epoch": 2.948770876337024, |
| "grad_norm": 2.109375, |
| "learning_rate": 7.871621621621622e-06, |
| "loss": 0.5035, |
| "mean_token_accuracy": 0.9372401058673858, |
| "step": 3930, |
| "train/kl_loss_qwen": 0.034070842619985345, |
| "train/kl_loss_r1": 0.021460118377581237, |
| "train/total_kl": 0.05553096104413271 |
| }, |
| { |
| "epoch": 2.952523925689623, |
| "grad_norm": 2.0, |
| "learning_rate": 7.843468468468468e-06, |
| "loss": 0.543, |
| "mean_token_accuracy": 0.9385394662618637, |
| "step": 3935, |
| "train/kl_loss_qwen": 0.046337118837982416, |
| "train/kl_loss_r1": 0.023731139581650497, |
| "train/total_kl": 0.07006825897842646 |
| }, |
| { |
| "epoch": 2.956276975042222, |
| "grad_norm": 1.796875, |
| "learning_rate": 7.815315315315315e-06, |
| "loss": 0.4859, |
| "mean_token_accuracy": 0.9361509501934051, |
| "step": 3940, |
| "train/kl_loss_qwen": 0.027159277442842723, |
| "train/kl_loss_r1": 0.019265179615467788, |
| "train/total_kl": 0.04642445733770728 |
| }, |
| { |
| "epoch": 2.960030024394821, |
| "grad_norm": 1.859375, |
| "learning_rate": 7.787162162162162e-06, |
| "loss": 0.5327, |
| "mean_token_accuracy": 0.9324598968029022, |
| "step": 3945, |
| "train/kl_loss_qwen": 0.037095142807811496, |
| "train/kl_loss_r1": 0.022269541397690773, |
| "train/total_kl": 0.059364685136824843 |
| }, |
| { |
| "epoch": 2.96378307374742, |
| "grad_norm": 2.703125, |
| "learning_rate": 7.75900900900901e-06, |
| "loss": 0.5268, |
| "mean_token_accuracy": 0.9340989470481873, |
| "step": 3950, |
| "train/kl_loss_qwen": 0.036777173075824975, |
| "train/kl_loss_r1": 0.02218401376157999, |
| "train/total_kl": 0.058961186278611424 |
| }, |
| { |
| "epoch": 2.967536123100019, |
| "grad_norm": 1.75, |
| "learning_rate": 7.730855855855855e-06, |
| "loss": 0.5091, |
| "mean_token_accuracy": 0.940819251537323, |
| "step": 3955, |
| "train/kl_loss_qwen": 0.03606356335803866, |
| "train/kl_loss_r1": 0.020537690771743656, |
| "train/total_kl": 0.05660125305876136 |
| }, |
| { |
| "epoch": 2.9712891724526176, |
| "grad_norm": 2.4375, |
| "learning_rate": 7.702702702702703e-06, |
| "loss": 0.5723, |
| "mean_token_accuracy": 0.9405235350131989, |
| "step": 3960, |
| "train/kl_loss_qwen": 0.046202197298407556, |
| "train/kl_loss_r1": 0.02828790796920657, |
| "train/total_kl": 0.07449010526761413 |
| }, |
| { |
| "epoch": 2.9750422218052166, |
| "grad_norm": 2.375, |
| "learning_rate": 7.67454954954955e-06, |
| "loss": 0.5426, |
| "mean_token_accuracy": 0.9397156774997711, |
| "step": 3965, |
| "train/kl_loss_qwen": 0.03755204356275499, |
| "train/kl_loss_r1": 0.025371223222464323, |
| "train/total_kl": 0.06292326673865319 |
| }, |
| { |
| "epoch": 2.9787952711578156, |
| "grad_norm": 2.765625, |
| "learning_rate": 7.646396396396396e-06, |
| "loss": 0.4963, |
| "mean_token_accuracy": 0.9325908690690994, |
| "step": 3970, |
| "train/kl_loss_qwen": 0.026620158832520245, |
| "train/kl_loss_r1": 0.01883739125914872, |
| "train/total_kl": 0.04545754995197058 |
| }, |
| { |
| "epoch": 2.9825483205104146, |
| "grad_norm": 2.0625, |
| "learning_rate": 7.618243243243243e-06, |
| "loss": 0.5926, |
| "mean_token_accuracy": 0.9297185957431793, |
| "step": 3975, |
| "train/kl_loss_qwen": 0.04432291784323752, |
| "train/kl_loss_r1": 0.025650422694161533, |
| "train/total_kl": 0.06997334016487003 |
| }, |
| { |
| "epoch": 2.9863013698630136, |
| "grad_norm": 1.8984375, |
| "learning_rate": 7.59009009009009e-06, |
| "loss": 0.5557, |
| "mean_token_accuracy": 0.9421306163072586, |
| "step": 3980, |
| "train/kl_loss_qwen": 0.04748995001427829, |
| "train/kl_loss_r1": 0.025721484888345005, |
| "train/total_kl": 0.07321143466979266 |
| }, |
| { |
| "epoch": 2.9900544192156127, |
| "grad_norm": 1.90625, |
| "learning_rate": 7.561936936936937e-06, |
| "loss": 0.5351, |
| "mean_token_accuracy": 0.9442136764526368, |
| "step": 3985, |
| "train/kl_loss_qwen": 0.04505083854310214, |
| "train/kl_loss_r1": 0.02471695919521153, |
| "train/total_kl": 0.06976779699325561 |
| }, |
| { |
| "epoch": 2.9938074685682117, |
| "grad_norm": 2.5, |
| "learning_rate": 7.533783783783783e-06, |
| "loss": 0.5705, |
| "mean_token_accuracy": 0.9401636183261871, |
| "step": 3990, |
| "train/kl_loss_qwen": 0.04586976226419211, |
| "train/kl_loss_r1": 0.026439438899978997, |
| "train/total_kl": 0.0723092008382082 |
| }, |
| { |
| "epoch": 2.9975605179208107, |
| "grad_norm": 2.328125, |
| "learning_rate": 7.5056306306306306e-06, |
| "loss": 0.5479, |
| "mean_token_accuracy": 0.9345041036605835, |
| "step": 3995, |
| "train/kl_loss_qwen": 0.03837931305170059, |
| "train/kl_loss_r1": 0.02360314899124205, |
| "train/total_kl": 0.06198246162384748 |
| }, |
| { |
| "epoch": 3.00075060987052, |
| "grad_norm": 3.828125, |
| "learning_rate": 7.477477477477477e-06, |
| "loss": 0.4843, |
| "mean_token_accuracy": 0.9349478237769183, |
| "step": 4000, |
| "train/kl_loss_qwen": 0.02753753647865618, |
| "train/kl_loss_r1": 0.018358695868621853, |
| "train/total_kl": 0.0458962315803065 |
| }, |
| { |
| "epoch": 3.004503659223119, |
| "grad_norm": 2.546875, |
| "learning_rate": 7.449324324324324e-06, |
| "loss": 0.5179, |
| "mean_token_accuracy": 0.9468716859817505, |
| "step": 4005, |
| "train/kl_loss_qwen": 0.03820655262097716, |
| "train/kl_loss_r1": 0.023267941363155843, |
| "train/total_kl": 0.06147449426352978 |
| }, |
| { |
| "epoch": 3.008256708575718, |
| "grad_norm": 3.484375, |
| "learning_rate": 7.421171171171171e-06, |
| "loss": 0.4789, |
| "mean_token_accuracy": 0.9452569574117661, |
| "step": 4010, |
| "train/kl_loss_qwen": 0.029093041876330973, |
| "train/kl_loss_r1": 0.020022685592994093, |
| "train/total_kl": 0.04911572737619281 |
| }, |
| { |
| "epoch": 3.012009757928317, |
| "grad_norm": 1.84375, |
| "learning_rate": 7.393018018018018e-06, |
| "loss": 0.5046, |
| "mean_token_accuracy": 0.9512590229511261, |
| "step": 4015, |
| "train/kl_loss_qwen": 0.03662499454803765, |
| "train/kl_loss_r1": 0.023514971556141972, |
| "train/total_kl": 0.06013996629044414 |
| }, |
| { |
| "epoch": 3.015762807280916, |
| "grad_norm": 1.8046875, |
| "learning_rate": 7.364864864864865e-06, |
| "loss": 0.5237, |
| "mean_token_accuracy": 0.9501432359218598, |
| "step": 4020, |
| "train/kl_loss_qwen": 0.04352525365538895, |
| "train/kl_loss_r1": 0.025102979922667145, |
| "train/total_kl": 0.06862823301926255 |
| }, |
| { |
| "epoch": 3.0195158566335145, |
| "grad_norm": 1.625, |
| "learning_rate": 7.336711711711712e-06, |
| "loss": 0.4782, |
| "mean_token_accuracy": 0.9528643399477005, |
| "step": 4025, |
| "train/kl_loss_qwen": 0.03597725708968937, |
| "train/kl_loss_r1": 0.022700622864067554, |
| "train/total_kl": 0.05867787953466177 |
| }, |
| { |
| "epoch": 3.0232689059861135, |
| "grad_norm": 1.875, |
| "learning_rate": 7.3085585585585585e-06, |
| "loss": 0.4676, |
| "mean_token_accuracy": 0.9526668071746827, |
| "step": 4030, |
| "train/kl_loss_qwen": 0.03230909314006567, |
| "train/kl_loss_r1": 0.022169433534145355, |
| "train/total_kl": 0.05447852648794651 |
| }, |
| { |
| "epoch": 3.0270219553387125, |
| "grad_norm": 1.8046875, |
| "learning_rate": 7.280405405405405e-06, |
| "loss": 0.5167, |
| "mean_token_accuracy": 0.9462513476610184, |
| "step": 4035, |
| "train/kl_loss_qwen": 0.04153737160377204, |
| "train/kl_loss_r1": 0.02482378501445055, |
| "train/total_kl": 0.06636115610599518 |
| }, |
| { |
| "epoch": 3.0307750046913116, |
| "grad_norm": 2.859375, |
| "learning_rate": 7.252252252252252e-06, |
| "loss": 0.5115, |
| "mean_token_accuracy": 0.9501920282840729, |
| "step": 4040, |
| "train/kl_loss_qwen": 0.03945711711421609, |
| "train/kl_loss_r1": 0.02391032031737268, |
| "train/total_kl": 0.06336743775755167 |
| }, |
| { |
| "epoch": 3.0345280540439106, |
| "grad_norm": 1.9921875, |
| "learning_rate": 7.224099099099099e-06, |
| "loss": 0.4889, |
| "mean_token_accuracy": 0.9590217292308807, |
| "step": 4045, |
| "train/kl_loss_qwen": 0.04280410804785788, |
| "train/kl_loss_r1": 0.024979598447680475, |
| "train/total_kl": 0.06778370654210449 |
| }, |
| { |
| "epoch": 3.0382811033965096, |
| "grad_norm": 1.65625, |
| "learning_rate": 7.195945945945946e-06, |
| "loss": 0.5881, |
| "mean_token_accuracy": 0.9521596044301986, |
| "step": 4050, |
| "train/kl_loss_qwen": 0.05545506034977734, |
| "train/kl_loss_r1": 0.03175990539602935, |
| "train/total_kl": 0.08721496500074863 |
| }, |
| { |
| "epoch": 3.0420341527491086, |
| "grad_norm": 1.921875, |
| "learning_rate": 7.167792792792793e-06, |
| "loss": 0.5075, |
| "mean_token_accuracy": 0.9522938549518585, |
| "step": 4055, |
| "train/kl_loss_qwen": 0.03955656290054321, |
| "train/kl_loss_r1": 0.024640692863613367, |
| "train/total_kl": 0.06419725548475981 |
| }, |
| { |
| "epoch": 3.0457872021017076, |
| "grad_norm": 1.8828125, |
| "learning_rate": 7.13963963963964e-06, |
| "loss": 0.5131, |
| "mean_token_accuracy": 0.9544217169284821, |
| "step": 4060, |
| "train/kl_loss_qwen": 0.04303731750696897, |
| "train/kl_loss_r1": 0.025201013032346963, |
| "train/total_kl": 0.06823833063244819 |
| }, |
| { |
| "epoch": 3.0495402514543066, |
| "grad_norm": 1.4765625, |
| "learning_rate": 7.1114864864864865e-06, |
| "loss": 0.537, |
| "mean_token_accuracy": 0.9559321880340577, |
| "step": 4065, |
| "train/kl_loss_qwen": 0.04774435576982796, |
| "train/kl_loss_r1": 0.028734903130680323, |
| "train/total_kl": 0.07647925987839699 |
| }, |
| { |
| "epoch": 3.0532933008069056, |
| "grad_norm": 1.6953125, |
| "learning_rate": 7.083333333333333e-06, |
| "loss": 0.5265, |
| "mean_token_accuracy": 0.9555478453636169, |
| "step": 4070, |
| "train/kl_loss_qwen": 0.047786570899188516, |
| "train/kl_loss_r1": 0.027031732350587846, |
| "train/total_kl": 0.0748183025047183 |
| }, |
| { |
| "epoch": 3.0570463501595047, |
| "grad_norm": 1.640625, |
| "learning_rate": 7.05518018018018e-06, |
| "loss": 0.4906, |
| "mean_token_accuracy": 0.9537694811820984, |
| "step": 4075, |
| "train/kl_loss_qwen": 0.03627552236430347, |
| "train/kl_loss_r1": 0.023278655018657446, |
| "train/total_kl": 0.05955417826771736 |
| }, |
| { |
| "epoch": 3.0607993995121037, |
| "grad_norm": 1.7421875, |
| "learning_rate": 7.027027027027027e-06, |
| "loss": 0.5125, |
| "mean_token_accuracy": 0.9504808455705642, |
| "step": 4080, |
| "train/kl_loss_qwen": 0.044115427136421206, |
| "train/kl_loss_r1": 0.02430842686444521, |
| "train/total_kl": 0.06842385372146964 |
| }, |
| { |
| "epoch": 3.0645524488647027, |
| "grad_norm": 2.078125, |
| "learning_rate": 6.998873873873874e-06, |
| "loss": 0.5355, |
| "mean_token_accuracy": 0.9497076243162155, |
| "step": 4085, |
| "train/kl_loss_qwen": 0.040773709490895274, |
| "train/kl_loss_r1": 0.025684031751006843, |
| "train/total_kl": 0.06645774105563759 |
| }, |
| { |
| "epoch": 3.0683054982173017, |
| "grad_norm": 1.65625, |
| "learning_rate": 6.970720720720721e-06, |
| "loss": 0.4942, |
| "mean_token_accuracy": 0.9535217344760895, |
| "step": 4090, |
| "train/kl_loss_qwen": 0.03903574231080711, |
| "train/kl_loss_r1": 0.02369346497580409, |
| "train/total_kl": 0.06272920705378056 |
| }, |
| { |
| "epoch": 3.0720585475699007, |
| "grad_norm": 1.6328125, |
| "learning_rate": 6.942567567567568e-06, |
| "loss": 0.4827, |
| "mean_token_accuracy": 0.9569115400314331, |
| "step": 4095, |
| "train/kl_loss_qwen": 0.03822903037071228, |
| "train/kl_loss_r1": 0.022737222351133825, |
| "train/total_kl": 0.060966251976788045 |
| }, |
| { |
| "epoch": 3.0758115969224997, |
| "grad_norm": 1.7734375, |
| "learning_rate": 6.9144144144144145e-06, |
| "loss": 0.5387, |
| "mean_token_accuracy": 0.9468695998191834, |
| "step": 4100, |
| "train/kl_loss_qwen": 0.04365008450113237, |
| "train/kl_loss_r1": 0.026509212469682096, |
| "train/total_kl": 0.070159297529608 |
| }, |
| { |
| "epoch": 3.0795646462750987, |
| "grad_norm": 2.265625, |
| "learning_rate": 6.886261261261261e-06, |
| "loss": 0.4856, |
| "mean_token_accuracy": 0.9466418087482452, |
| "step": 4105, |
| "train/kl_loss_qwen": 0.034907838655635716, |
| "train/kl_loss_r1": 0.020991062698885798, |
| "train/total_kl": 0.0558989018201828 |
| }, |
| { |
| "epoch": 3.0833176956276973, |
| "grad_norm": 1.9375, |
| "learning_rate": 6.858108108108108e-06, |
| "loss": 0.5102, |
| "mean_token_accuracy": 0.9507683873176574, |
| "step": 4110, |
| "train/kl_loss_qwen": 0.03961786311119795, |
| "train/kl_loss_r1": 0.024199524614959955, |
| "train/total_kl": 0.06381738800555467 |
| }, |
| { |
| "epoch": 3.0870707449802963, |
| "grad_norm": 2.0, |
| "learning_rate": 6.829954954954955e-06, |
| "loss": 0.4829, |
| "mean_token_accuracy": 0.944465833902359, |
| "step": 4115, |
| "train/kl_loss_qwen": 0.031371227093040945, |
| "train/kl_loss_r1": 0.020947957457974554, |
| "train/total_kl": 0.05231918422505259 |
| }, |
| { |
| "epoch": 3.0908237943328953, |
| "grad_norm": 1.5078125, |
| "learning_rate": 6.801801801801802e-06, |
| "loss": 0.4616, |
| "mean_token_accuracy": 0.9485589683055877, |
| "step": 4120, |
| "train/kl_loss_qwen": 0.031080040195956827, |
| "train/kl_loss_r1": 0.019682012405246495, |
| "train/total_kl": 0.05076205227524042 |
| }, |
| { |
| "epoch": 3.0945768436854943, |
| "grad_norm": 1.7578125, |
| "learning_rate": 6.773648648648649e-06, |
| "loss": 0.5351, |
| "mean_token_accuracy": 0.9564525872468949, |
| "step": 4125, |
| "train/kl_loss_qwen": 0.04921146645210683, |
| "train/kl_loss_r1": 0.02725354707799852, |
| "train/total_kl": 0.07646501287817956 |
| }, |
| { |
| "epoch": 3.0983298930380934, |
| "grad_norm": 3.703125, |
| "learning_rate": 6.745495495495496e-06, |
| "loss": 0.5667, |
| "mean_token_accuracy": 0.9405909597873687, |
| "step": 4130, |
| "train/kl_loss_qwen": 0.041168075334280727, |
| "train/kl_loss_r1": 0.025406582234427332, |
| "train/total_kl": 0.06657465808093548 |
| }, |
| { |
| "epoch": 3.1020829423906924, |
| "grad_norm": 1.796875, |
| "learning_rate": 6.7173423423423425e-06, |
| "loss": 0.4896, |
| "mean_token_accuracy": 0.9521638125181198, |
| "step": 4135, |
| "train/kl_loss_qwen": 0.03744446937926114, |
| "train/kl_loss_r1": 0.02312980592250824, |
| "train/total_kl": 0.06057427516207099 |
| }, |
| { |
| "epoch": 3.1058359917432914, |
| "grad_norm": 1.5, |
| "learning_rate": 6.689189189189189e-06, |
| "loss": 0.5447, |
| "mean_token_accuracy": 0.9512269377708436, |
| "step": 4140, |
| "train/kl_loss_qwen": 0.04734295061789453, |
| "train/kl_loss_r1": 0.027056427067145707, |
| "train/total_kl": 0.07439937759190798 |
| }, |
| { |
| "epoch": 3.1095890410958904, |
| "grad_norm": 1.6796875, |
| "learning_rate": 6.661036036036036e-06, |
| "loss": 0.5268, |
| "mean_token_accuracy": 0.9557883590459824, |
| "step": 4145, |
| "train/kl_loss_qwen": 0.04429617114365101, |
| "train/kl_loss_r1": 0.02629926986992359, |
| "train/total_kl": 0.07059544026851654 |
| }, |
| { |
| "epoch": 3.1133420904484894, |
| "grad_norm": 1.71875, |
| "learning_rate": 6.632882882882883e-06, |
| "loss": 0.5058, |
| "mean_token_accuracy": 0.9476411014795303, |
| "step": 4150, |
| "train/kl_loss_qwen": 0.037383958138525485, |
| "train/kl_loss_r1": 0.023662435123696923, |
| "train/total_kl": 0.061046394519507885 |
| }, |
| { |
| "epoch": 3.1170951398010884, |
| "grad_norm": 1.4921875, |
| "learning_rate": 6.60472972972973e-06, |
| "loss": 0.479, |
| "mean_token_accuracy": 0.9571599304676056, |
| "step": 4155, |
| "train/kl_loss_qwen": 0.038876288337633014, |
| "train/kl_loss_r1": 0.024421562859788536, |
| "train/total_kl": 0.06329785119742155 |
| }, |
| { |
| "epoch": 3.1208481891536874, |
| "grad_norm": 2.484375, |
| "learning_rate": 6.576576576576577e-06, |
| "loss": 0.491, |
| "mean_token_accuracy": 0.9498330116271972, |
| "step": 4160, |
| "train/kl_loss_qwen": 0.03512372067198157, |
| "train/kl_loss_r1": 0.02344148699194193, |
| "train/total_kl": 0.058565208595246075 |
| }, |
| { |
| "epoch": 3.1246012385062865, |
| "grad_norm": 3.359375, |
| "learning_rate": 6.548423423423424e-06, |
| "loss": 0.4872, |
| "mean_token_accuracy": 0.9566541939973832, |
| "step": 4165, |
| "train/kl_loss_qwen": 0.03824820877052844, |
| "train/kl_loss_r1": 0.02418025666847825, |
| "train/total_kl": 0.06242846576496959 |
| }, |
| { |
| "epoch": 3.1283542878588855, |
| "grad_norm": 1.5703125, |
| "learning_rate": 6.5202702702702704e-06, |
| "loss": 0.49, |
| "mean_token_accuracy": 0.9528867095708847, |
| "step": 4170, |
| "train/kl_loss_qwen": 0.04278830396942794, |
| "train/kl_loss_r1": 0.024134243838489056, |
| "train/total_kl": 0.06692254794761539 |
| }, |
| { |
| "epoch": 3.1321073372114845, |
| "grad_norm": 2.40625, |
| "learning_rate": 6.492117117117117e-06, |
| "loss": 0.5232, |
| "mean_token_accuracy": 0.9546979814767838, |
| "step": 4175, |
| "train/kl_loss_qwen": 0.04611057708971202, |
| "train/kl_loss_r1": 0.025870457151904704, |
| "train/total_kl": 0.07198103414848447 |
| }, |
| { |
| "epoch": 3.1358603865640835, |
| "grad_norm": 1.4296875, |
| "learning_rate": 6.463963963963964e-06, |
| "loss": 0.5159, |
| "mean_token_accuracy": 0.9506950169801712, |
| "step": 4180, |
| "train/kl_loss_qwen": 0.04252455835230649, |
| "train/kl_loss_r1": 0.024353090580552815, |
| "train/total_kl": 0.0668776486068964 |
| }, |
| { |
| "epoch": 3.139613435916682, |
| "grad_norm": 2.21875, |
| "learning_rate": 6.435810810810811e-06, |
| "loss": 0.5279, |
| "mean_token_accuracy": 0.9519837826490403, |
| "step": 4185, |
| "train/kl_loss_qwen": 0.04363212245516479, |
| "train/kl_loss_r1": 0.026513157226145268, |
| "train/total_kl": 0.07014527972787618 |
| }, |
| { |
| "epoch": 3.143366485269281, |
| "grad_norm": 1.9296875, |
| "learning_rate": 6.407657657657658e-06, |
| "loss": 0.5222, |
| "mean_token_accuracy": 0.9523192524909974, |
| "step": 4190, |
| "train/kl_loss_qwen": 0.04511188971810043, |
| "train/kl_loss_r1": 0.02609873116016388, |
| "train/total_kl": 0.07121062017977238 |
| }, |
| { |
| "epoch": 3.14711953462188, |
| "grad_norm": 2.171875, |
| "learning_rate": 6.379504504504505e-06, |
| "loss": 0.5307, |
| "mean_token_accuracy": 0.9508942574262619, |
| "step": 4195, |
| "train/kl_loss_qwen": 0.04281947310082614, |
| "train/kl_loss_r1": 0.02625079546123743, |
| "train/total_kl": 0.06907026935368776 |
| }, |
| { |
| "epoch": 3.150872583974479, |
| "grad_norm": 1.78125, |
| "learning_rate": 6.351351351351352e-06, |
| "loss": 0.4731, |
| "mean_token_accuracy": 0.9568151891231537, |
| "step": 4200, |
| "train/kl_loss_qwen": 0.036586605850607155, |
| "train/kl_loss_r1": 0.02390783354640007, |
| "train/total_kl": 0.060494439676404 |
| }, |
| { |
| "epoch": 3.154625633327078, |
| "grad_norm": 1.8671875, |
| "learning_rate": 6.323198198198198e-06, |
| "loss": 0.4717, |
| "mean_token_accuracy": 0.954903456568718, |
| "step": 4205, |
| "train/kl_loss_qwen": 0.03747730739414692, |
| "train/kl_loss_r1": 0.021962188137695193, |
| "train/total_kl": 0.05943949557840824 |
| }, |
| { |
| "epoch": 3.158378682679677, |
| "grad_norm": 2.0625, |
| "learning_rate": 6.295045045045045e-06, |
| "loss": 0.5623, |
| "mean_token_accuracy": 0.9474755525588989, |
| "step": 4210, |
| "train/kl_loss_qwen": 0.050565437460318205, |
| "train/kl_loss_r1": 0.028789392672479153, |
| "train/total_kl": 0.07935483139008284 |
| }, |
| { |
| "epoch": 3.162131732032276, |
| "grad_norm": 1.78125, |
| "learning_rate": 6.266891891891892e-06, |
| "loss": 0.4662, |
| "mean_token_accuracy": 0.9511516332626343, |
| "step": 4215, |
| "train/kl_loss_qwen": 0.03249250883236528, |
| "train/kl_loss_r1": 0.019301535561680794, |
| "train/total_kl": 0.05179404448717832 |
| }, |
| { |
| "epoch": 3.165884781384875, |
| "grad_norm": 2.453125, |
| "learning_rate": 6.238738738738739e-06, |
| "loss": 0.5013, |
| "mean_token_accuracy": 0.9568227618932724, |
| "step": 4220, |
| "train/kl_loss_qwen": 0.041591133316978814, |
| "train/kl_loss_r1": 0.025532052014023067, |
| "train/total_kl": 0.0671231847256422 |
| }, |
| { |
| "epoch": 3.169637830737474, |
| "grad_norm": 1.84375, |
| "learning_rate": 6.210585585585586e-06, |
| "loss": 0.5351, |
| "mean_token_accuracy": 0.9437592476606369, |
| "step": 4225, |
| "train/kl_loss_qwen": 0.03993491227738559, |
| "train/kl_loss_r1": 0.02458281647413969, |
| "train/total_kl": 0.0645177292637527 |
| }, |
| { |
| "epoch": 3.173390880090073, |
| "grad_norm": 3.078125, |
| "learning_rate": 6.1824324324324326e-06, |
| "loss": 0.5102, |
| "mean_token_accuracy": 0.9511289745569229, |
| "step": 4230, |
| "train/kl_loss_qwen": 0.03975429474376142, |
| "train/kl_loss_r1": 0.02539440095424652, |
| "train/total_kl": 0.06514869593083858 |
| }, |
| { |
| "epoch": 3.177143929442672, |
| "grad_norm": 1.671875, |
| "learning_rate": 6.15427927927928e-06, |
| "loss": 0.5408, |
| "mean_token_accuracy": 0.9547346591949463, |
| "step": 4235, |
| "train/kl_loss_qwen": 0.0481301327701658, |
| "train/kl_loss_r1": 0.0268444970715791, |
| "train/total_kl": 0.07497463030740618 |
| }, |
| { |
| "epoch": 3.1808969787952712, |
| "grad_norm": 1.6484375, |
| "learning_rate": 6.126126126126126e-06, |
| "loss": 0.5618, |
| "mean_token_accuracy": 0.9479600071907044, |
| "step": 4240, |
| "train/kl_loss_qwen": 0.0451738444622606, |
| "train/kl_loss_r1": 0.026249010814353824, |
| "train/total_kl": 0.07142285536974669 |
| }, |
| { |
| "epoch": 3.1846500281478702, |
| "grad_norm": 2.328125, |
| "learning_rate": 6.097972972972973e-06, |
| "loss": 0.4792, |
| "mean_token_accuracy": 0.9450971424579621, |
| "step": 4245, |
| "train/kl_loss_qwen": 0.03210086454637349, |
| "train/kl_loss_r1": 0.02111982530914247, |
| "train/total_kl": 0.05322068994864822 |
| }, |
| { |
| "epoch": 3.1884030775004693, |
| "grad_norm": 2.0, |
| "learning_rate": 6.06981981981982e-06, |
| "loss": 0.5035, |
| "mean_token_accuracy": 0.9456622421741485, |
| "step": 4250, |
| "train/kl_loss_qwen": 0.036170482821762565, |
| "train/kl_loss_r1": 0.022352162282913923, |
| "train/total_kl": 0.058522645849734545 |
| }, |
| { |
| "epoch": 3.1921561268530683, |
| "grad_norm": 4.15625, |
| "learning_rate": 6.041666666666667e-06, |
| "loss": 0.5449, |
| "mean_token_accuracy": 0.9458593904972077, |
| "step": 4255, |
| "train/kl_loss_qwen": 0.04212156161665916, |
| "train/kl_loss_r1": 0.025973267480731012, |
| "train/total_kl": 0.068094830121845 |
| }, |
| { |
| "epoch": 3.1959091762056673, |
| "grad_norm": 2.078125, |
| "learning_rate": 6.013513513513514e-06, |
| "loss": 0.4976, |
| "mean_token_accuracy": 0.9549412935972214, |
| "step": 4260, |
| "train/kl_loss_qwen": 0.041603248473256825, |
| "train/kl_loss_r1": 0.02461081640794873, |
| "train/total_kl": 0.06621406432241202 |
| }, |
| { |
| "epoch": 3.1996622255582663, |
| "grad_norm": 2.890625, |
| "learning_rate": 5.9853603603603605e-06, |
| "loss": 0.5055, |
| "mean_token_accuracy": 0.949541175365448, |
| "step": 4265, |
| "train/kl_loss_qwen": 0.040113079734146594, |
| "train/kl_loss_r1": 0.02302660490386188, |
| "train/total_kl": 0.06313968505710363 |
| }, |
| { |
| "epoch": 3.2034152749108653, |
| "grad_norm": 1.7265625, |
| "learning_rate": 5.957207207207208e-06, |
| "loss": 0.5503, |
| "mean_token_accuracy": 0.9499185711145401, |
| "step": 4270, |
| "train/kl_loss_qwen": 0.04532988341525197, |
| "train/kl_loss_r1": 0.026170040108263494, |
| "train/total_kl": 0.07149992333725094 |
| }, |
| { |
| "epoch": 3.207168324263464, |
| "grad_norm": 2.21875, |
| "learning_rate": 5.929054054054054e-06, |
| "loss": 0.4828, |
| "mean_token_accuracy": 0.9559267908334732, |
| "step": 4275, |
| "train/kl_loss_qwen": 0.03815796659328043, |
| "train/kl_loss_r1": 0.023687106277793645, |
| "train/total_kl": 0.06184507291764021 |
| }, |
| { |
| "epoch": 3.210921373616063, |
| "grad_norm": 2.15625, |
| "learning_rate": 5.900900900900902e-06, |
| "loss": 0.4564, |
| "mean_token_accuracy": 0.9539308249950409, |
| "step": 4280, |
| "train/kl_loss_qwen": 0.029147087782621383, |
| "train/kl_loss_r1": 0.020383994840085507, |
| "train/total_kl": 0.04953108299523592 |
| }, |
| { |
| "epoch": 3.214674422968662, |
| "grad_norm": 1.6171875, |
| "learning_rate": 5.872747747747748e-06, |
| "loss": 0.5077, |
| "mean_token_accuracy": 0.9499585449695587, |
| "step": 4285, |
| "train/kl_loss_qwen": 0.04101836262270808, |
| "train/kl_loss_r1": 0.023595213936641813, |
| "train/total_kl": 0.06461357641965151 |
| }, |
| { |
| "epoch": 3.218427472321261, |
| "grad_norm": 2.359375, |
| "learning_rate": 5.844594594594595e-06, |
| "loss": 0.5314, |
| "mean_token_accuracy": 0.9491012632846832, |
| "step": 4290, |
| "train/kl_loss_qwen": 0.04348352774977684, |
| "train/kl_loss_r1": 0.026489183958619832, |
| "train/total_kl": 0.06997271161526442 |
| }, |
| { |
| "epoch": 3.22218052167386, |
| "grad_norm": 2.0, |
| "learning_rate": 5.816441441441442e-06, |
| "loss": 0.4828, |
| "mean_token_accuracy": 0.9515987575054169, |
| "step": 4295, |
| "train/kl_loss_qwen": 0.038013959862291814, |
| "train/kl_loss_r1": 0.024154541036114096, |
| "train/total_kl": 0.06216850131750107 |
| }, |
| { |
| "epoch": 3.225933571026459, |
| "grad_norm": 1.9453125, |
| "learning_rate": 5.7882882882882885e-06, |
| "loss": 0.4856, |
| "mean_token_accuracy": 0.951391515135765, |
| "step": 4300, |
| "train/kl_loss_qwen": 0.03802924687042832, |
| "train/kl_loss_r1": 0.02343762177042663, |
| "train/total_kl": 0.06146686850115657 |
| }, |
| { |
| "epoch": 3.229686620379058, |
| "grad_norm": 1.6953125, |
| "learning_rate": 5.760135135135136e-06, |
| "loss": 0.4937, |
| "mean_token_accuracy": 0.9538519591093063, |
| "step": 4305, |
| "train/kl_loss_qwen": 0.03933619349263608, |
| "train/kl_loss_r1": 0.024646869115531444, |
| "train/total_kl": 0.06398306302726268 |
| }, |
| { |
| "epoch": 3.233439669731657, |
| "grad_norm": 2.0625, |
| "learning_rate": 5.731981981981982e-06, |
| "loss": 0.5126, |
| "mean_token_accuracy": 0.9565867841243744, |
| "step": 4310, |
| "train/kl_loss_qwen": 0.047122747730463745, |
| "train/kl_loss_r1": 0.02656792337074876, |
| "train/total_kl": 0.07369067054241896 |
| }, |
| { |
| "epoch": 3.237192719084256, |
| "grad_norm": 1.859375, |
| "learning_rate": 5.70382882882883e-06, |
| "loss": 0.5087, |
| "mean_token_accuracy": 0.9582189708948136, |
| "step": 4315, |
| "train/kl_loss_qwen": 0.04418886038474738, |
| "train/kl_loss_r1": 0.025840024650096893, |
| "train/total_kl": 0.07002888554707169 |
| }, |
| { |
| "epoch": 3.240945768436855, |
| "grad_norm": 2.453125, |
| "learning_rate": 5.675675675675676e-06, |
| "loss": 0.4666, |
| "mean_token_accuracy": 0.9552791446447373, |
| "step": 4320, |
| "train/kl_loss_qwen": 0.03426559055224061, |
| "train/kl_loss_r1": 0.022823481913655998, |
| "train/total_kl": 0.05708907237276435 |
| }, |
| { |
| "epoch": 3.244698817789454, |
| "grad_norm": 1.953125, |
| "learning_rate": 5.647522522522523e-06, |
| "loss": 0.517, |
| "mean_token_accuracy": 0.9423777401447296, |
| "step": 4325, |
| "train/kl_loss_qwen": 0.03696016678586602, |
| "train/kl_loss_r1": 0.023434765404090285, |
| "train/total_kl": 0.06039493260905147 |
| }, |
| { |
| "epoch": 3.248451867142053, |
| "grad_norm": 1.828125, |
| "learning_rate": 5.61936936936937e-06, |
| "loss": 0.4976, |
| "mean_token_accuracy": 0.9435189306735993, |
| "step": 4330, |
| "train/kl_loss_qwen": 0.03490878287702799, |
| "train/kl_loss_r1": 0.02145023737102747, |
| "train/total_kl": 0.05635902034118771 |
| }, |
| { |
| "epoch": 3.252204916494652, |
| "grad_norm": 2.15625, |
| "learning_rate": 5.5912162162162165e-06, |
| "loss": 0.6065, |
| "mean_token_accuracy": 0.9520415842533112, |
| "step": 4335, |
| "train/kl_loss_qwen": 0.057009863667190075, |
| "train/kl_loss_r1": 0.03349468014203012, |
| "train/total_kl": 0.09050454422831536 |
| }, |
| { |
| "epoch": 3.255957965847251, |
| "grad_norm": 1.515625, |
| "learning_rate": 5.563063063063064e-06, |
| "loss": 0.4853, |
| "mean_token_accuracy": 0.9562025338411331, |
| "step": 4340, |
| "train/kl_loss_qwen": 0.04025891097262502, |
| "train/kl_loss_r1": 0.023304715799167753, |
| "train/total_kl": 0.06356362700462341 |
| }, |
| { |
| "epoch": 3.25971101519985, |
| "grad_norm": 2.0, |
| "learning_rate": 5.53490990990991e-06, |
| "loss": 0.4639, |
| "mean_token_accuracy": 0.955470883846283, |
| "step": 4345, |
| "train/kl_loss_qwen": 0.0339654213283211, |
| "train/kl_loss_r1": 0.021475129947066306, |
| "train/total_kl": 0.05544055104255676 |
| }, |
| { |
| "epoch": 3.2634640645524486, |
| "grad_norm": 2.65625, |
| "learning_rate": 5.506756756756758e-06, |
| "loss": 0.4686, |
| "mean_token_accuracy": 0.9480804920196533, |
| "step": 4350, |
| "train/kl_loss_qwen": 0.031937024602666494, |
| "train/kl_loss_r1": 0.020728342095389964, |
| "train/total_kl": 0.05266536641865969 |
| }, |
| { |
| "epoch": 3.2672171139050477, |
| "grad_norm": 1.671875, |
| "learning_rate": 5.478603603603604e-06, |
| "loss": 0.5332, |
| "mean_token_accuracy": 0.9519092202186584, |
| "step": 4355, |
| "train/kl_loss_qwen": 0.043146210024133325, |
| "train/kl_loss_r1": 0.027150555653497575, |
| "train/total_kl": 0.07029676483944058 |
| }, |
| { |
| "epoch": 3.2709701632576467, |
| "grad_norm": 1.96875, |
| "learning_rate": 5.450450450450451e-06, |
| "loss": 0.4917, |
| "mean_token_accuracy": 0.9604987561702728, |
| "step": 4360, |
| "train/kl_loss_qwen": 0.041492973314598204, |
| "train/kl_loss_r1": 0.02612789338454604, |
| "train/total_kl": 0.06762086730450392 |
| }, |
| { |
| "epoch": 3.2747232126102457, |
| "grad_norm": 1.75, |
| "learning_rate": 5.422297297297298e-06, |
| "loss": 0.5062, |
| "mean_token_accuracy": 0.9497289001941681, |
| "step": 4365, |
| "train/kl_loss_qwen": 0.038669126899912955, |
| "train/kl_loss_r1": 0.022001048410311343, |
| "train/total_kl": 0.06067017521709204 |
| }, |
| { |
| "epoch": 3.2784762619628447, |
| "grad_norm": 1.921875, |
| "learning_rate": 5.3941441441441445e-06, |
| "loss": 0.5098, |
| "mean_token_accuracy": 0.946996933221817, |
| "step": 4370, |
| "train/kl_loss_qwen": 0.036139405751600864, |
| "train/kl_loss_r1": 0.024025491438806057, |
| "train/total_kl": 0.06016489639878273 |
| }, |
| { |
| "epoch": 3.2822293113154437, |
| "grad_norm": 2.96875, |
| "learning_rate": 5.365990990990991e-06, |
| "loss": 0.4791, |
| "mean_token_accuracy": 0.9525912255048752, |
| "step": 4375, |
| "train/kl_loss_qwen": 0.03400084599852562, |
| "train/kl_loss_r1": 0.02241660561412573, |
| "train/total_kl": 0.056417451426386836 |
| }, |
| { |
| "epoch": 3.2859823606680427, |
| "grad_norm": 1.734375, |
| "learning_rate": 5.3378378378378374e-06, |
| "loss": 0.5387, |
| "mean_token_accuracy": 0.9525120824575424, |
| "step": 4380, |
| "train/kl_loss_qwen": 0.04745977125130594, |
| "train/kl_loss_r1": 0.02659780075773597, |
| "train/total_kl": 0.07405757205560803 |
| }, |
| { |
| "epoch": 3.2897354100206417, |
| "grad_norm": 1.5390625, |
| "learning_rate": 5.309684684684685e-06, |
| "loss": 0.4835, |
| "mean_token_accuracy": 0.9562853127717972, |
| "step": 4385, |
| "train/kl_loss_qwen": 0.040935520501807335, |
| "train/kl_loss_r1": 0.023382049147039653, |
| "train/total_kl": 0.06431756988167762 |
| }, |
| { |
| "epoch": 3.2934884593732408, |
| "grad_norm": 2.046875, |
| "learning_rate": 5.281531531531531e-06, |
| "loss": 0.516, |
| "mean_token_accuracy": 0.9541277021169663, |
| "step": 4390, |
| "train/kl_loss_qwen": 0.04403358194977045, |
| "train/kl_loss_r1": 0.027043864829465747, |
| "train/total_kl": 0.0710774464532733 |
| }, |
| { |
| "epoch": 3.2972415087258398, |
| "grad_norm": 1.75, |
| "learning_rate": 5.253378378378378e-06, |
| "loss": 0.5169, |
| "mean_token_accuracy": 0.9496819704771042, |
| "step": 4395, |
| "train/kl_loss_qwen": 0.04312458084896207, |
| "train/kl_loss_r1": 0.025393119966611265, |
| "train/total_kl": 0.0685177012346685 |
| }, |
| { |
| "epoch": 3.300994558078439, |
| "grad_norm": 2.359375, |
| "learning_rate": 5.225225225225225e-06, |
| "loss": 0.5119, |
| "mean_token_accuracy": 0.9501294255256653, |
| "step": 4400, |
| "train/kl_loss_qwen": 0.03754086145199835, |
| "train/kl_loss_r1": 0.024014173122122884, |
| "train/total_kl": 0.06155503448098898 |
| }, |
| { |
| "epoch": 3.304747607431038, |
| "grad_norm": 1.9609375, |
| "learning_rate": 5.197072072072072e-06, |
| "loss": 0.5073, |
| "mean_token_accuracy": 0.9500888794660568, |
| "step": 4405, |
| "train/kl_loss_qwen": 0.03989710342139006, |
| "train/kl_loss_r1": 0.024184916401281953, |
| "train/total_kl": 0.06408202080056072 |
| }, |
| { |
| "epoch": 3.308500656783637, |
| "grad_norm": 2.96875, |
| "learning_rate": 5.168918918918919e-06, |
| "loss": 0.5735, |
| "mean_token_accuracy": 0.9382760256528855, |
| "step": 4410, |
| "train/kl_loss_qwen": 0.044976729340851306, |
| "train/kl_loss_r1": 0.027697026263922453, |
| "train/total_kl": 0.07267375560477377 |
| }, |
| { |
| "epoch": 3.312253706136236, |
| "grad_norm": 2.65625, |
| "learning_rate": 5.140765765765765e-06, |
| "loss": 0.5057, |
| "mean_token_accuracy": 0.9447282940149307, |
| "step": 4415, |
| "train/kl_loss_qwen": 0.03504931908100843, |
| "train/kl_loss_r1": 0.0225065934471786, |
| "train/total_kl": 0.057555912714451554 |
| }, |
| { |
| "epoch": 3.316006755488835, |
| "grad_norm": 2.28125, |
| "learning_rate": 5.112612612612613e-06, |
| "loss": 0.5074, |
| "mean_token_accuracy": 0.9480471581220626, |
| "step": 4420, |
| "train/kl_loss_qwen": 0.038661521812900904, |
| "train/kl_loss_r1": 0.023841103445738553, |
| "train/total_kl": 0.06250262567773461 |
| }, |
| { |
| "epoch": 3.319759804841434, |
| "grad_norm": 2.875, |
| "learning_rate": 5.084459459459459e-06, |
| "loss": 0.5006, |
| "mean_token_accuracy": 0.9469463229179382, |
| "step": 4425, |
| "train/kl_loss_qwen": 0.034021322568878534, |
| "train/kl_loss_r1": 0.02232333249412477, |
| "train/total_kl": 0.05634465422481298 |
| }, |
| { |
| "epoch": 3.323512854194033, |
| "grad_norm": 1.8203125, |
| "learning_rate": 5.056306306306306e-06, |
| "loss": 0.5001, |
| "mean_token_accuracy": 0.9527624189853668, |
| "step": 4430, |
| "train/kl_loss_qwen": 0.041707838978618385, |
| "train/kl_loss_r1": 0.02471332629211247, |
| "train/total_kl": 0.06642116559669375 |
| }, |
| { |
| "epoch": 3.327265903546632, |
| "grad_norm": 2.71875, |
| "learning_rate": 5.028153153153153e-06, |
| "loss": 0.4856, |
| "mean_token_accuracy": 0.9498600274324417, |
| "step": 4435, |
| "train/kl_loss_qwen": 0.03649712633341551, |
| "train/kl_loss_r1": 0.022463715448975564, |
| "train/total_kl": 0.058960842061787845 |
| }, |
| { |
| "epoch": 3.3310189528992304, |
| "grad_norm": 1.46875, |
| "learning_rate": 4.9999999999999996e-06, |
| "loss": 0.5544, |
| "mean_token_accuracy": 0.9496265351772308, |
| "step": 4440, |
| "train/kl_loss_qwen": 0.04972629891708493, |
| "train/kl_loss_r1": 0.028210808150470258, |
| "train/total_kl": 0.07793710688129067 |
| }, |
| { |
| "epoch": 3.3347720022518295, |
| "grad_norm": 1.6015625, |
| "learning_rate": 4.971846846846847e-06, |
| "loss": 0.4717, |
| "mean_token_accuracy": 0.9556352138519287, |
| "step": 4445, |
| "train/kl_loss_qwen": 0.03368289568461478, |
| "train/kl_loss_r1": 0.02205599411390722, |
| "train/total_kl": 0.055738890264183286 |
| }, |
| { |
| "epoch": 3.3385250516044285, |
| "grad_norm": 2.125, |
| "learning_rate": 4.943693693693693e-06, |
| "loss": 0.5087, |
| "mean_token_accuracy": 0.9517245024442673, |
| "step": 4450, |
| "train/kl_loss_qwen": 0.03941992614418268, |
| "train/kl_loss_r1": 0.024540536990389227, |
| "train/total_kl": 0.06396046299487353 |
| }, |
| { |
| "epoch": 3.3422781009570275, |
| "grad_norm": 1.6953125, |
| "learning_rate": 4.915540540540541e-06, |
| "loss": 0.5082, |
| "mean_token_accuracy": 0.9545890867710114, |
| "step": 4455, |
| "train/kl_loss_qwen": 0.04155694702640176, |
| "train/kl_loss_r1": 0.024792100116610528, |
| "train/total_kl": 0.06634904704988002 |
| }, |
| { |
| "epoch": 3.3460311503096265, |
| "grad_norm": 1.875, |
| "learning_rate": 4.887387387387387e-06, |
| "loss": 0.5041, |
| "mean_token_accuracy": 0.9501286745071411, |
| "step": 4460, |
| "train/kl_loss_qwen": 0.03695795922540128, |
| "train/kl_loss_r1": 0.024665044527500866, |
| "train/total_kl": 0.06162300417199731 |
| }, |
| { |
| "epoch": 3.3497841996622255, |
| "grad_norm": 1.828125, |
| "learning_rate": 4.859234234234234e-06, |
| "loss": 0.476, |
| "mean_token_accuracy": 0.9575912714004516, |
| "step": 4465, |
| "train/kl_loss_qwen": 0.038898851396515964, |
| "train/kl_loss_r1": 0.02317404472269118, |
| "train/total_kl": 0.062072896771132945 |
| }, |
| { |
| "epoch": 3.3535372490148245, |
| "grad_norm": 2.515625, |
| "learning_rate": 4.831081081081081e-06, |
| "loss": 0.53, |
| "mean_token_accuracy": 0.9492391794919968, |
| "step": 4470, |
| "train/kl_loss_qwen": 0.04130629752762616, |
| "train/kl_loss_r1": 0.026160174002870917, |
| "train/total_kl": 0.06746647097170352 |
| }, |
| { |
| "epoch": 3.3572902983674235, |
| "grad_norm": 1.9140625, |
| "learning_rate": 4.8029279279279275e-06, |
| "loss": 0.5003, |
| "mean_token_accuracy": 0.9499774962663651, |
| "step": 4475, |
| "train/kl_loss_qwen": 0.042116965632885695, |
| "train/kl_loss_r1": 0.023339213198050858, |
| "train/total_kl": 0.06545617831870913 |
| }, |
| { |
| "epoch": 3.3610433477200226, |
| "grad_norm": 2.53125, |
| "learning_rate": 4.774774774774775e-06, |
| "loss": 0.4913, |
| "mean_token_accuracy": 0.9487686693668366, |
| "step": 4480, |
| "train/kl_loss_qwen": 0.03564274497330189, |
| "train/kl_loss_r1": 0.02291566417552531, |
| "train/total_kl": 0.058558409195393325 |
| }, |
| { |
| "epoch": 3.3647963970726216, |
| "grad_norm": 2.296875, |
| "learning_rate": 4.746621621621621e-06, |
| "loss": 0.4881, |
| "mean_token_accuracy": 0.9511472195386886, |
| "step": 4485, |
| "train/kl_loss_qwen": 0.03707243660464883, |
| "train/kl_loss_r1": 0.02255106377415359, |
| "train/total_kl": 0.05962350023910403 |
| }, |
| { |
| "epoch": 3.3685494464252206, |
| "grad_norm": 2.109375, |
| "learning_rate": 4.718468468468469e-06, |
| "loss": 0.5247, |
| "mean_token_accuracy": 0.9543746292591095, |
| "step": 4490, |
| "train/kl_loss_qwen": 0.043492857413366434, |
| "train/kl_loss_r1": 0.027063050866127016, |
| "train/total_kl": 0.07055590879172087 |
| }, |
| { |
| "epoch": 3.3723024957778196, |
| "grad_norm": 2.921875, |
| "learning_rate": 4.690315315315315e-06, |
| "loss": 0.4685, |
| "mean_token_accuracy": 0.9536369174718857, |
| "step": 4495, |
| "train/kl_loss_qwen": 0.0325671270955354, |
| "train/kl_loss_r1": 0.020675616106018424, |
| "train/total_kl": 0.05324274385347962 |
| }, |
| { |
| "epoch": 3.3760555451304186, |
| "grad_norm": 1.625, |
| "learning_rate": 4.6621621621621625e-06, |
| "loss": 0.5122, |
| "mean_token_accuracy": 0.9575406193733216, |
| "step": 4500, |
| "train/kl_loss_qwen": 0.04434308242052794, |
| "train/kl_loss_r1": 0.025985902547836302, |
| "train/total_kl": 0.07032898515462875 |
| }, |
| { |
| "epoch": 3.3798085944830176, |
| "grad_norm": 1.78125, |
| "learning_rate": 4.634009009009009e-06, |
| "loss": 0.4894, |
| "mean_token_accuracy": 0.9510607182979584, |
| "step": 4505, |
| "train/kl_loss_qwen": 0.03664002763107419, |
| "train/kl_loss_r1": 0.02325889216735959, |
| "train/total_kl": 0.05989891951903701 |
| }, |
| { |
| "epoch": 3.383561643835616, |
| "grad_norm": 2.140625, |
| "learning_rate": 4.6058558558558555e-06, |
| "loss": 0.518, |
| "mean_token_accuracy": 0.9529828011989594, |
| "step": 4510, |
| "train/kl_loss_qwen": 0.039163641864433885, |
| "train/kl_loss_r1": 0.025084894429892302, |
| "train/total_kl": 0.06424853699281811 |
| }, |
| { |
| "epoch": 3.387314693188215, |
| "grad_norm": 1.640625, |
| "learning_rate": 4.577702702702703e-06, |
| "loss": 0.5106, |
| "mean_token_accuracy": 0.9479302018880844, |
| "step": 4515, |
| "train/kl_loss_qwen": 0.03873064480721951, |
| "train/kl_loss_r1": 0.023981414455920457, |
| "train/total_kl": 0.06271205889061093 |
| }, |
| { |
| "epoch": 3.3910677425408142, |
| "grad_norm": 2.0625, |
| "learning_rate": 4.549549549549549e-06, |
| "loss": 0.5524, |
| "mean_token_accuracy": 0.9479347318410873, |
| "step": 4520, |
| "train/kl_loss_qwen": 0.047627780586481094, |
| "train/kl_loss_r1": 0.02741450662724674, |
| "train/total_kl": 0.07504228772595525 |
| }, |
| { |
| "epoch": 3.3948207918934132, |
| "grad_norm": 2.640625, |
| "learning_rate": 4.521396396396397e-06, |
| "loss": 0.5065, |
| "mean_token_accuracy": 0.9493608593940734, |
| "step": 4525, |
| "train/kl_loss_qwen": 0.0406539726536721, |
| "train/kl_loss_r1": 0.024122460465878248, |
| "train/total_kl": 0.06477643344551325 |
| }, |
| { |
| "epoch": 3.3985738412460123, |
| "grad_norm": 2.34375, |
| "learning_rate": 4.493243243243243e-06, |
| "loss": 0.4712, |
| "mean_token_accuracy": 0.948474669456482, |
| "step": 4530, |
| "train/kl_loss_qwen": 0.030185632361099123, |
| "train/kl_loss_r1": 0.020759632252156733, |
| "train/total_kl": 0.0509452648460865 |
| }, |
| { |
| "epoch": 3.4023268905986113, |
| "grad_norm": 3.03125, |
| "learning_rate": 4.4650900900900905e-06, |
| "loss": 0.4943, |
| "mean_token_accuracy": 0.9527560323476791, |
| "step": 4535, |
| "train/kl_loss_qwen": 0.03848574049770832, |
| "train/kl_loss_r1": 0.021982099581509828, |
| "train/total_kl": 0.06046783970668912 |
| }, |
| { |
| "epoch": 3.4060799399512103, |
| "grad_norm": 2.859375, |
| "learning_rate": 4.436936936936937e-06, |
| "loss": 0.5407, |
| "mean_token_accuracy": 0.9428445607423782, |
| "step": 4540, |
| "train/kl_loss_qwen": 0.04301722776144743, |
| "train/kl_loss_r1": 0.025781831610947846, |
| "train/total_kl": 0.06879905974492431 |
| }, |
| { |
| "epoch": 3.4098329893038093, |
| "grad_norm": 2.90625, |
| "learning_rate": 4.4087837837837835e-06, |
| "loss": 0.474, |
| "mean_token_accuracy": 0.950044310092926, |
| "step": 4545, |
| "train/kl_loss_qwen": 0.034028490027412775, |
| "train/kl_loss_r1": 0.021919101616367696, |
| "train/total_kl": 0.055947590805590156 |
| }, |
| { |
| "epoch": 3.4135860386564083, |
| "grad_norm": 1.7890625, |
| "learning_rate": 4.380630630630631e-06, |
| "loss": 0.4901, |
| "mean_token_accuracy": 0.9547917276620865, |
| "step": 4550, |
| "train/kl_loss_qwen": 0.03873153259046376, |
| "train/kl_loss_r1": 0.02365042078308761, |
| "train/total_kl": 0.062381953466683626 |
| }, |
| { |
| "epoch": 3.4173390880090073, |
| "grad_norm": 1.71875, |
| "learning_rate": 4.352477477477477e-06, |
| "loss": 0.5486, |
| "mean_token_accuracy": 0.9475720256567002, |
| "step": 4555, |
| "train/kl_loss_qwen": 0.045938981743529436, |
| "train/kl_loss_r1": 0.02708872049115598, |
| "train/total_kl": 0.07302770223468542 |
| }, |
| { |
| "epoch": 3.4210921373616063, |
| "grad_norm": 2.671875, |
| "learning_rate": 4.324324324324325e-06, |
| "loss": 0.4658, |
| "mean_token_accuracy": 0.9467237561941146, |
| "step": 4560, |
| "train/kl_loss_qwen": 0.03142950688488781, |
| "train/kl_loss_r1": 0.020448410185053945, |
| "train/total_kl": 0.05187791669741273 |
| }, |
| { |
| "epoch": 3.4248451867142053, |
| "grad_norm": 1.6875, |
| "learning_rate": 4.296171171171171e-06, |
| "loss": 0.4579, |
| "mean_token_accuracy": 0.9478941440582276, |
| "step": 4565, |
| "train/kl_loss_qwen": 0.028696865122765303, |
| "train/kl_loss_r1": 0.019314822740852833, |
| "train/total_kl": 0.04801168767735362 |
| }, |
| { |
| "epoch": 3.4285982360668044, |
| "grad_norm": 1.78125, |
| "learning_rate": 4.2680180180180185e-06, |
| "loss": 0.4945, |
| "mean_token_accuracy": 0.9537198185920716, |
| "step": 4570, |
| "train/kl_loss_qwen": 0.03776753200218082, |
| "train/kl_loss_r1": 0.02526979329995811, |
| "train/total_kl": 0.0630373259074986 |
| }, |
| { |
| "epoch": 3.4323512854194034, |
| "grad_norm": 1.875, |
| "learning_rate": 4.239864864864865e-06, |
| "loss": 0.549, |
| "mean_token_accuracy": 0.9553028732538223, |
| "step": 4575, |
| "train/kl_loss_qwen": 0.04971991777420044, |
| "train/kl_loss_r1": 0.028436136478558183, |
| "train/total_kl": 0.0781560542061925 |
| }, |
| { |
| "epoch": 3.4361043347720024, |
| "grad_norm": 1.625, |
| "learning_rate": 4.2117117117117115e-06, |
| "loss": 0.5464, |
| "mean_token_accuracy": 0.951890167593956, |
| "step": 4580, |
| "train/kl_loss_qwen": 0.049332274869084355, |
| "train/kl_loss_r1": 0.02864066422916949, |
| "train/total_kl": 0.07797293970361352 |
| }, |
| { |
| "epoch": 3.4398573841246014, |
| "grad_norm": 2.03125, |
| "learning_rate": 4.183558558558559e-06, |
| "loss": 0.5501, |
| "mean_token_accuracy": 0.9465802252292633, |
| "step": 4585, |
| "train/kl_loss_qwen": 0.044763072533532976, |
| "train/kl_loss_r1": 0.02734934687614441, |
| "train/total_kl": 0.0721124186180532 |
| }, |
| { |
| "epoch": 3.4436104334772004, |
| "grad_norm": 1.65625, |
| "learning_rate": 4.155405405405405e-06, |
| "loss": 0.488, |
| "mean_token_accuracy": 0.9554612100124359, |
| "step": 4590, |
| "train/kl_loss_qwen": 0.04139808346517384, |
| "train/kl_loss_r1": 0.024592308327555656, |
| "train/total_kl": 0.06599039165303111 |
| }, |
| { |
| "epoch": 3.4473634828297994, |
| "grad_norm": 2.34375, |
| "learning_rate": 4.127252252252253e-06, |
| "loss": 0.5267, |
| "mean_token_accuracy": 0.9453837454319001, |
| "step": 4595, |
| "train/kl_loss_qwen": 0.039892626367509364, |
| "train/kl_loss_r1": 0.024147269502282142, |
| "train/total_kl": 0.0640398958697915 |
| }, |
| { |
| "epoch": 3.4511165321823984, |
| "grad_norm": 1.9609375, |
| "learning_rate": 4.099099099099099e-06, |
| "loss": 0.4839, |
| "mean_token_accuracy": 0.9594921231269836, |
| "step": 4600, |
| "train/kl_loss_qwen": 0.03939856206998229, |
| "train/kl_loss_r1": 0.02459759754128754, |
| "train/total_kl": 0.06399615965783596 |
| }, |
| { |
| "epoch": 3.454869581534997, |
| "grad_norm": 1.953125, |
| "learning_rate": 4.0709459459459465e-06, |
| "loss": 0.5362, |
| "mean_token_accuracy": 0.9532510668039322, |
| "step": 4605, |
| "train/kl_loss_qwen": 0.04666020777076483, |
| "train/kl_loss_r1": 0.026927021471783517, |
| "train/total_kl": 0.07358722947537899 |
| }, |
| { |
| "epoch": 3.458622630887596, |
| "grad_norm": 2.28125, |
| "learning_rate": 4.042792792792793e-06, |
| "loss": 0.4866, |
| "mean_token_accuracy": 0.953156578540802, |
| "step": 4610, |
| "train/kl_loss_qwen": 0.03761745826341212, |
| "train/kl_loss_r1": 0.022605449566617607, |
| "train/total_kl": 0.060222907457500696 |
| }, |
| { |
| "epoch": 3.462375680240195, |
| "grad_norm": 1.953125, |
| "learning_rate": 4.0146396396396394e-06, |
| "loss": 0.5006, |
| "mean_token_accuracy": 0.953925734758377, |
| "step": 4615, |
| "train/kl_loss_qwen": 0.03867802955210209, |
| "train/kl_loss_r1": 0.024804549338296056, |
| "train/total_kl": 0.06348257856443525 |
| }, |
| { |
| "epoch": 3.466128729592794, |
| "grad_norm": 1.8984375, |
| "learning_rate": 3.986486486486487e-06, |
| "loss": 0.5623, |
| "mean_token_accuracy": 0.9530359268188476, |
| "step": 4620, |
| "train/kl_loss_qwen": 0.050726366927847266, |
| "train/kl_loss_r1": 0.027859060373157263, |
| "train/total_kl": 0.0785854272544384 |
| }, |
| { |
| "epoch": 3.469881778945393, |
| "grad_norm": 1.8203125, |
| "learning_rate": 3.958333333333333e-06, |
| "loss": 0.4911, |
| "mean_token_accuracy": 0.9550992786884308, |
| "step": 4625, |
| "train/kl_loss_qwen": 0.03829608168452978, |
| "train/kl_loss_r1": 0.02386563769541681, |
| "train/total_kl": 0.06216171951964498 |
| }, |
| { |
| "epoch": 3.473634828297992, |
| "grad_norm": 1.78125, |
| "learning_rate": 3.930180180180181e-06, |
| "loss": 0.4924, |
| "mean_token_accuracy": 0.9495264708995819, |
| "step": 4630, |
| "train/kl_loss_qwen": 0.03702715411782265, |
| "train/kl_loss_r1": 0.022891523968428373, |
| "train/total_kl": 0.05991867855191231 |
| }, |
| { |
| "epoch": 3.477387877650591, |
| "grad_norm": 2.421875, |
| "learning_rate": 3.902027027027027e-06, |
| "loss": 0.5782, |
| "mean_token_accuracy": 0.949220260977745, |
| "step": 4635, |
| "train/kl_loss_qwen": 0.053430474689230324, |
| "train/kl_loss_r1": 0.03059484055265784, |
| "train/total_kl": 0.084025314822793 |
| }, |
| { |
| "epoch": 3.48114092700319, |
| "grad_norm": 2.875, |
| "learning_rate": 3.8738738738738744e-06, |
| "loss": 0.5004, |
| "mean_token_accuracy": 0.949424222111702, |
| "step": 4640, |
| "train/kl_loss_qwen": 0.03316820659674704, |
| "train/kl_loss_r1": 0.02219580514356494, |
| "train/total_kl": 0.05536401178687811 |
| }, |
| { |
| "epoch": 3.484893976355789, |
| "grad_norm": 1.7578125, |
| "learning_rate": 3.845720720720721e-06, |
| "loss": 0.4793, |
| "mean_token_accuracy": 0.9511813431978225, |
| "step": 4645, |
| "train/kl_loss_qwen": 0.03428934076800942, |
| "train/kl_loss_r1": 0.022562990756705405, |
| "train/total_kl": 0.05685233175754547 |
| }, |
| { |
| "epoch": 3.488647025708388, |
| "grad_norm": 1.8515625, |
| "learning_rate": 3.817567567567567e-06, |
| "loss": 0.5208, |
| "mean_token_accuracy": 0.9530722856521606, |
| "step": 4650, |
| "train/kl_loss_qwen": 0.04267180510796607, |
| "train/kl_loss_r1": 0.025806902069598438, |
| "train/total_kl": 0.06847870666533709 |
| }, |
| { |
| "epoch": 3.492400075060987, |
| "grad_norm": 2.03125, |
| "learning_rate": 3.7894144144144148e-06, |
| "loss": 0.5136, |
| "mean_token_accuracy": 0.9550452619791031, |
| "step": 4655, |
| "train/kl_loss_qwen": 0.041353469667956236, |
| "train/kl_loss_r1": 0.025874977000057697, |
| "train/total_kl": 0.06722844615578652 |
| }, |
| { |
| "epoch": 3.496153124413586, |
| "grad_norm": 1.5, |
| "learning_rate": 3.7612612612612617e-06, |
| "loss": 0.5144, |
| "mean_token_accuracy": 0.9574123293161392, |
| "step": 4660, |
| "train/kl_loss_qwen": 0.04588752212002874, |
| "train/kl_loss_r1": 0.026548220915719865, |
| "train/total_kl": 0.07243574410676956 |
| }, |
| { |
| "epoch": 3.499906173766185, |
| "grad_norm": 1.546875, |
| "learning_rate": 3.7331081081081086e-06, |
| "loss": 0.4752, |
| "mean_token_accuracy": 0.9535851895809173, |
| "step": 4665, |
| "train/kl_loss_qwen": 0.03505368349142372, |
| "train/kl_loss_r1": 0.02288009631447494, |
| "train/total_kl": 0.05793378055095673 |
| }, |
| { |
| "epoch": 3.5036592231187837, |
| "grad_norm": 2.234375, |
| "learning_rate": 3.704954954954955e-06, |
| "loss": 0.517, |
| "mean_token_accuracy": 0.953430250287056, |
| "step": 4670, |
| "train/kl_loss_qwen": 0.041387461498379706, |
| "train/kl_loss_r1": 0.02559947860427201, |
| "train/total_kl": 0.06698694005608559 |
| }, |
| { |
| "epoch": 3.5074122724713828, |
| "grad_norm": 2.046875, |
| "learning_rate": 3.676801801801802e-06, |
| "loss": 0.5192, |
| "mean_token_accuracy": 0.949590927362442, |
| "step": 4675, |
| "train/kl_loss_qwen": 0.038729687314480545, |
| "train/kl_loss_r1": 0.023347532469779254, |
| "train/total_kl": 0.06207721931859851 |
| }, |
| { |
| "epoch": 3.5111653218239818, |
| "grad_norm": 1.6953125, |
| "learning_rate": 3.648648648648649e-06, |
| "loss": 0.5063, |
| "mean_token_accuracy": 0.952187979221344, |
| "step": 4680, |
| "train/kl_loss_qwen": 0.04059083824977279, |
| "train/kl_loss_r1": 0.025933190854266285, |
| "train/total_kl": 0.06652402915060521 |
| }, |
| { |
| "epoch": 3.514918371176581, |
| "grad_norm": 2.484375, |
| "learning_rate": 3.6204954954954954e-06, |
| "loss": 0.5103, |
| "mean_token_accuracy": 0.9529137343168259, |
| "step": 4685, |
| "train/kl_loss_qwen": 0.04197904523462057, |
| "train/kl_loss_r1": 0.022938547283411027, |
| "train/total_kl": 0.06491759326308966 |
| }, |
| { |
| "epoch": 3.51867142052918, |
| "grad_norm": 1.640625, |
| "learning_rate": 3.5923423423423423e-06, |
| "loss": 0.4821, |
| "mean_token_accuracy": 0.9563487559556961, |
| "step": 4690, |
| "train/kl_loss_qwen": 0.03939807149581611, |
| "train/kl_loss_r1": 0.023985384777188302, |
| "train/total_kl": 0.0633834559470415 |
| }, |
| { |
| "epoch": 3.522424469881779, |
| "grad_norm": 1.6640625, |
| "learning_rate": 3.5641891891891892e-06, |
| "loss": 0.5201, |
| "mean_token_accuracy": 0.9567440986633301, |
| "step": 4695, |
| "train/kl_loss_qwen": 0.046253665490075944, |
| "train/kl_loss_r1": 0.027819053875282405, |
| "train/total_kl": 0.07407271871343254 |
| }, |
| { |
| "epoch": 3.526177519234378, |
| "grad_norm": 2.3125, |
| "learning_rate": 3.536036036036036e-06, |
| "loss": 0.4794, |
| "mean_token_accuracy": 0.9591157138347626, |
| "step": 4700, |
| "train/kl_loss_qwen": 0.03859961242415011, |
| "train/kl_loss_r1": 0.024089030642062425, |
| "train/total_kl": 0.06268864339217543 |
| }, |
| { |
| "epoch": 3.529930568586977, |
| "grad_norm": 1.390625, |
| "learning_rate": 3.5078828828828826e-06, |
| "loss": 0.5076, |
| "mean_token_accuracy": 0.9511758238077164, |
| "step": 4705, |
| "train/kl_loss_qwen": 0.041626590909436344, |
| "train/kl_loss_r1": 0.02450266946107149, |
| "train/total_kl": 0.0661292603239417 |
| }, |
| { |
| "epoch": 3.533683617939576, |
| "grad_norm": 2.171875, |
| "learning_rate": 3.4797297297297295e-06, |
| "loss": 0.5238, |
| "mean_token_accuracy": 0.9531386703252792, |
| "step": 4710, |
| "train/kl_loss_qwen": 0.04286709842272103, |
| "train/kl_loss_r1": 0.025938824750483036, |
| "train/total_kl": 0.06880592331290245 |
| }, |
| { |
| "epoch": 3.537436667292175, |
| "grad_norm": 1.7578125, |
| "learning_rate": 3.4515765765765765e-06, |
| "loss": 0.5117, |
| "mean_token_accuracy": 0.9504441648721695, |
| "step": 4715, |
| "train/kl_loss_qwen": 0.04200872196815908, |
| "train/kl_loss_r1": 0.02514236718416214, |
| "train/total_kl": 0.06715108891949058 |
| }, |
| { |
| "epoch": 3.541189716644774, |
| "grad_norm": 2.078125, |
| "learning_rate": 3.4234234234234234e-06, |
| "loss": 0.4857, |
| "mean_token_accuracy": 0.9459042757749557, |
| "step": 4720, |
| "train/kl_loss_qwen": 0.034541129739955066, |
| "train/kl_loss_r1": 0.02232414875179529, |
| "train/total_kl": 0.05686527844518423 |
| }, |
| { |
| "epoch": 3.544942765997373, |
| "grad_norm": 1.484375, |
| "learning_rate": 3.3952702702702703e-06, |
| "loss": 0.4954, |
| "mean_token_accuracy": 0.9543802291154861, |
| "step": 4725, |
| "train/kl_loss_qwen": 0.039401004835963246, |
| "train/kl_loss_r1": 0.023825197480618954, |
| "train/total_kl": 0.06322620203718543 |
| }, |
| { |
| "epoch": 3.548695815349972, |
| "grad_norm": 1.8828125, |
| "learning_rate": 3.367117117117117e-06, |
| "loss": 0.4976, |
| "mean_token_accuracy": 0.9500404924154282, |
| "step": 4730, |
| "train/kl_loss_qwen": 0.03725369730964303, |
| "train/kl_loss_r1": 0.022954756021499635, |
| "train/total_kl": 0.060208453238010405 |
| }, |
| { |
| "epoch": 3.552448864702571, |
| "grad_norm": 2.03125, |
| "learning_rate": 3.338963963963964e-06, |
| "loss": 0.5316, |
| "mean_token_accuracy": 0.9575497686862946, |
| "step": 4735, |
| "train/kl_loss_qwen": 0.0468436376657337, |
| "train/kl_loss_r1": 0.02789052496664226, |
| "train/total_kl": 0.07473416347056627 |
| }, |
| { |
| "epoch": 3.55620191405517, |
| "grad_norm": 1.578125, |
| "learning_rate": 3.3108108108108106e-06, |
| "loss": 0.484, |
| "mean_token_accuracy": 0.9488806337118149, |
| "step": 4740, |
| "train/kl_loss_qwen": 0.032839803909882906, |
| "train/kl_loss_r1": 0.02122222976759076, |
| "train/total_kl": 0.05406203325837851 |
| }, |
| { |
| "epoch": 3.559954963407769, |
| "grad_norm": 1.6796875, |
| "learning_rate": 3.2826576576576575e-06, |
| "loss": 0.5449, |
| "mean_token_accuracy": 0.9525219231843949, |
| "step": 4745, |
| "train/kl_loss_qwen": 0.04897039164789021, |
| "train/kl_loss_r1": 0.02860354045405984, |
| "train/total_kl": 0.0775739318691194 |
| }, |
| { |
| "epoch": 3.563708012760368, |
| "grad_norm": 1.515625, |
| "learning_rate": 3.2545045045045044e-06, |
| "loss": 0.4792, |
| "mean_token_accuracy": 0.9464257270097732, |
| "step": 4750, |
| "train/kl_loss_qwen": 0.03381857522763312, |
| "train/kl_loss_r1": 0.0212648831307888, |
| "train/total_kl": 0.05508345831185579 |
| }, |
| { |
| "epoch": 3.567461062112967, |
| "grad_norm": 1.6640625, |
| "learning_rate": 3.2263513513513513e-06, |
| "loss": 0.5117, |
| "mean_token_accuracy": 0.9530625611543655, |
| "step": 4755, |
| "train/kl_loss_qwen": 0.045256762346252796, |
| "train/kl_loss_r1": 0.025322494190186264, |
| "train/total_kl": 0.07057925527915358 |
| }, |
| { |
| "epoch": 3.571214111465566, |
| "grad_norm": 1.9453125, |
| "learning_rate": 3.1981981981981983e-06, |
| "loss": 0.5067, |
| "mean_token_accuracy": 0.949809405207634, |
| "step": 4760, |
| "train/kl_loss_qwen": 0.03583875373005867, |
| "train/kl_loss_r1": 0.02265885784290731, |
| "train/total_kl": 0.058497611340135335 |
| }, |
| { |
| "epoch": 3.574967160818165, |
| "grad_norm": 1.4765625, |
| "learning_rate": 3.170045045045045e-06, |
| "loss": 0.4803, |
| "mean_token_accuracy": 0.9485155403614044, |
| "step": 4765, |
| "train/kl_loss_qwen": 0.03641654024831951, |
| "train/kl_loss_r1": 0.02261554468423128, |
| "train/total_kl": 0.05903208442032337 |
| }, |
| { |
| "epoch": 3.5787202101707636, |
| "grad_norm": 2.296875, |
| "learning_rate": 3.141891891891892e-06, |
| "loss": 0.4805, |
| "mean_token_accuracy": 0.9531418412923813, |
| "step": 4770, |
| "train/kl_loss_qwen": 0.03572290446609259, |
| "train/kl_loss_r1": 0.02349159154109657, |
| "train/total_kl": 0.059214495960623025 |
| }, |
| { |
| "epoch": 3.5824732595233626, |
| "grad_norm": 1.9921875, |
| "learning_rate": 3.113738738738739e-06, |
| "loss": 0.4947, |
| "mean_token_accuracy": 0.9497868716716766, |
| "step": 4775, |
| "train/kl_loss_qwen": 0.03734279680065811, |
| "train/kl_loss_r1": 0.023538395250216126, |
| "train/total_kl": 0.06088119251653552 |
| }, |
| { |
| "epoch": 3.5862263088759616, |
| "grad_norm": 2.0, |
| "learning_rate": 3.0855855855855855e-06, |
| "loss": 0.4699, |
| "mean_token_accuracy": 0.948901292681694, |
| "step": 4780, |
| "train/kl_loss_qwen": 0.030417955154553054, |
| "train/kl_loss_r1": 0.02020354806445539, |
| "train/total_kl": 0.05062150321900845 |
| }, |
| { |
| "epoch": 3.5899793582285606, |
| "grad_norm": 1.71875, |
| "learning_rate": 3.0574324324324324e-06, |
| "loss": 0.4978, |
| "mean_token_accuracy": 0.9499588519334793, |
| "step": 4785, |
| "train/kl_loss_qwen": 0.038579528825357555, |
| "train/kl_loss_r1": 0.02370496103540063, |
| "train/total_kl": 0.06228449046611786 |
| }, |
| { |
| "epoch": 3.5937324075811596, |
| "grad_norm": 1.7578125, |
| "learning_rate": 3.0292792792792793e-06, |
| "loss": 0.4563, |
| "mean_token_accuracy": 0.9571527928113938, |
| "step": 4790, |
| "train/kl_loss_qwen": 0.0355854959692806, |
| "train/kl_loss_r1": 0.02241732254624367, |
| "train/total_kl": 0.05800281846895814 |
| }, |
| { |
| "epoch": 3.5974854569337587, |
| "grad_norm": 1.7734375, |
| "learning_rate": 3.0011261261261262e-06, |
| "loss": 0.5416, |
| "mean_token_accuracy": 0.9569284915924072, |
| "step": 4795, |
| "train/kl_loss_qwen": 0.04847305933944881, |
| "train/kl_loss_r1": 0.02857246994972229, |
| "train/total_kl": 0.07704552887007594 |
| }, |
| { |
| "epoch": 3.6012385062863577, |
| "grad_norm": 2.453125, |
| "learning_rate": 2.972972972972973e-06, |
| "loss": 0.459, |
| "mean_token_accuracy": 0.9568021237850189, |
| "step": 4800, |
| "train/kl_loss_qwen": 0.03281675688922405, |
| "train/kl_loss_r1": 0.021974925044924022, |
| "train/total_kl": 0.05479168212041259 |
| }, |
| { |
| "epoch": 3.6049915556389567, |
| "grad_norm": 1.4921875, |
| "learning_rate": 2.94481981981982e-06, |
| "loss": 0.5005, |
| "mean_token_accuracy": 0.951943552494049, |
| "step": 4805, |
| "train/kl_loss_qwen": 0.037731643626466395, |
| "train/kl_loss_r1": 0.023648474551737308, |
| "train/total_kl": 0.06138011813163757 |
| }, |
| { |
| "epoch": 3.6087446049915557, |
| "grad_norm": 2.84375, |
| "learning_rate": 2.916666666666667e-06, |
| "loss": 0.5074, |
| "mean_token_accuracy": 0.9509950965642929, |
| "step": 4810, |
| "train/kl_loss_qwen": 0.040730614122003315, |
| "train/kl_loss_r1": 0.023938436387106778, |
| "train/total_kl": 0.0646690510213375 |
| }, |
| { |
| "epoch": 3.6124976543441547, |
| "grad_norm": 2.28125, |
| "learning_rate": 2.8885135135135135e-06, |
| "loss": 0.4647, |
| "mean_token_accuracy": 0.9506016135215759, |
| "step": 4815, |
| "train/kl_loss_qwen": 0.03288884097710252, |
| "train/kl_loss_r1": 0.020954125700518487, |
| "train/total_kl": 0.05384296691045165 |
| }, |
| { |
| "epoch": 3.6162507036967537, |
| "grad_norm": 2.1875, |
| "learning_rate": 2.8603603603603604e-06, |
| "loss": 0.5172, |
| "mean_token_accuracy": 0.9470595866441727, |
| "step": 4820, |
| "train/kl_loss_qwen": 0.0408139303792268, |
| "train/kl_loss_r1": 0.02478752490133047, |
| "train/total_kl": 0.0656014553271234 |
| }, |
| { |
| "epoch": 3.6200037530493527, |
| "grad_norm": 1.8046875, |
| "learning_rate": 2.8322072072072073e-06, |
| "loss": 0.5135, |
| "mean_token_accuracy": 0.9458914548158646, |
| "step": 4825, |
| "train/kl_loss_qwen": 0.04003286343067884, |
| "train/kl_loss_r1": 0.025449228845536707, |
| "train/total_kl": 0.06548209218308329 |
| }, |
| { |
| "epoch": 3.6237568024019517, |
| "grad_norm": 1.9296875, |
| "learning_rate": 2.804054054054054e-06, |
| "loss": 0.5003, |
| "mean_token_accuracy": 0.9475751221179962, |
| "step": 4830, |
| "train/kl_loss_qwen": 0.03712998940609395, |
| "train/kl_loss_r1": 0.02288465332239866, |
| "train/total_kl": 0.060014642868191005 |
| }, |
| { |
| "epoch": 3.6275098517545503, |
| "grad_norm": 1.4453125, |
| "learning_rate": 2.775900900900901e-06, |
| "loss": 0.4804, |
| "mean_token_accuracy": 0.9547668904066086, |
| "step": 4835, |
| "train/kl_loss_qwen": 0.03851720592938364, |
| "train/kl_loss_r1": 0.02409008927643299, |
| "train/total_kl": 0.06260729506611824 |
| }, |
| { |
| "epoch": 3.6312629011071493, |
| "grad_norm": 1.765625, |
| "learning_rate": 2.747747747747748e-06, |
| "loss": 0.531, |
| "mean_token_accuracy": 0.9479747354984284, |
| "step": 4840, |
| "train/kl_loss_qwen": 0.04336943430826068, |
| "train/kl_loss_r1": 0.025416742218658327, |
| "train/total_kl": 0.06878617675974966 |
| }, |
| { |
| "epoch": 3.6350159504597483, |
| "grad_norm": 1.953125, |
| "learning_rate": 2.719594594594595e-06, |
| "loss": 0.5183, |
| "mean_token_accuracy": 0.9536388278007507, |
| "step": 4845, |
| "train/kl_loss_qwen": 0.044287759624421594, |
| "train/kl_loss_r1": 0.02697393586859107, |
| "train/total_kl": 0.07126169558614492 |
| }, |
| { |
| "epoch": 3.6387689998123474, |
| "grad_norm": 1.75, |
| "learning_rate": 2.6914414414414414e-06, |
| "loss": 0.5166, |
| "mean_token_accuracy": 0.9522114217281341, |
| "step": 4850, |
| "train/kl_loss_qwen": 0.04483889057300985, |
| "train/kl_loss_r1": 0.02480946579016745, |
| "train/total_kl": 0.06964835664257407 |
| }, |
| { |
| "epoch": 3.6425220491649464, |
| "grad_norm": 1.7734375, |
| "learning_rate": 2.6632882882882884e-06, |
| "loss": 0.459, |
| "mean_token_accuracy": 0.946859622001648, |
| "step": 4855, |
| "train/kl_loss_qwen": 0.02793180327862501, |
| "train/kl_loss_r1": 0.019528497755527497, |
| "train/total_kl": 0.04746030112728476 |
| }, |
| { |
| "epoch": 3.6462750985175454, |
| "grad_norm": 2.546875, |
| "learning_rate": 2.6351351351351353e-06, |
| "loss": 0.4589, |
| "mean_token_accuracy": 0.9491229832172394, |
| "step": 4860, |
| "train/kl_loss_qwen": 0.03198705329559744, |
| "train/kl_loss_r1": 0.019053183542564512, |
| "train/total_kl": 0.051040236745029686 |
| }, |
| { |
| "epoch": 3.6500281478701444, |
| "grad_norm": 2.84375, |
| "learning_rate": 2.606981981981982e-06, |
| "loss": 0.4817, |
| "mean_token_accuracy": 0.9530567765235901, |
| "step": 4865, |
| "train/kl_loss_qwen": 0.039363396866247055, |
| "train/kl_loss_r1": 0.022094597294926643, |
| "train/total_kl": 0.061457994021475316 |
| }, |
| { |
| "epoch": 3.6537811972227434, |
| "grad_norm": 3.671875, |
| "learning_rate": 2.578828828828829e-06, |
| "loss": 0.5107, |
| "mean_token_accuracy": 0.9457842141389847, |
| "step": 4870, |
| "train/kl_loss_qwen": 0.035457003861665726, |
| "train/kl_loss_r1": 0.022503510117530823, |
| "train/total_kl": 0.057960514537990095 |
| }, |
| { |
| "epoch": 3.6575342465753424, |
| "grad_norm": 1.7890625, |
| "learning_rate": 2.550675675675676e-06, |
| "loss": 0.5303, |
| "mean_token_accuracy": 0.9455351591110229, |
| "step": 4875, |
| "train/kl_loss_qwen": 0.04614274119958282, |
| "train/kl_loss_r1": 0.024886056268587708, |
| "train/total_kl": 0.07102879770100116 |
| }, |
| { |
| "epoch": 3.6612872959279414, |
| "grad_norm": 2.8125, |
| "learning_rate": 2.522522522522523e-06, |
| "loss": 0.4676, |
| "mean_token_accuracy": 0.9499957472085953, |
| "step": 4880, |
| "train/kl_loss_qwen": 0.03133310084231198, |
| "train/kl_loss_r1": 0.020856086723506452, |
| "train/total_kl": 0.05218918789178133 |
| }, |
| { |
| "epoch": 3.6650403452805405, |
| "grad_norm": 2.640625, |
| "learning_rate": 2.4943693693693694e-06, |
| "loss": 0.4903, |
| "mean_token_accuracy": 0.9457110196352005, |
| "step": 4885, |
| "train/kl_loss_qwen": 0.03605662221089005, |
| "train/kl_loss_r1": 0.02250904431566596, |
| "train/total_kl": 0.058565666899085045 |
| }, |
| { |
| "epoch": 3.6687933946331395, |
| "grad_norm": 2.78125, |
| "learning_rate": 2.4662162162162163e-06, |
| "loss": 0.4846, |
| "mean_token_accuracy": 0.9485343366861343, |
| "step": 4890, |
| "train/kl_loss_qwen": 0.033767188480123875, |
| "train/kl_loss_r1": 0.022552880039438606, |
| "train/total_kl": 0.056320068147033456 |
| }, |
| { |
| "epoch": 3.6725464439857385, |
| "grad_norm": 1.9921875, |
| "learning_rate": 2.438063063063063e-06, |
| "loss": 0.4727, |
| "mean_token_accuracy": 0.94805046916008, |
| "step": 4895, |
| "train/kl_loss_qwen": 0.030423608887940646, |
| "train/kl_loss_r1": 0.020363574428483844, |
| "train/total_kl": 0.05078718457370997 |
| }, |
| { |
| "epoch": 3.6762994933383375, |
| "grad_norm": 1.84375, |
| "learning_rate": 2.4099099099099097e-06, |
| "loss": 0.499, |
| "mean_token_accuracy": 0.955724710226059, |
| "step": 4900, |
| "train/kl_loss_qwen": 0.043830083403736356, |
| "train/kl_loss_r1": 0.02355689317919314, |
| "train/total_kl": 0.06738697616383434 |
| }, |
| { |
| "epoch": 3.6800525426909365, |
| "grad_norm": 1.78125, |
| "learning_rate": 2.3817567567567567e-06, |
| "loss": 0.5121, |
| "mean_token_accuracy": 0.9542524129152298, |
| "step": 4905, |
| "train/kl_loss_qwen": 0.041697377478703855, |
| "train/kl_loss_r1": 0.025255709374323487, |
| "train/total_kl": 0.06695308703929186 |
| }, |
| { |
| "epoch": 3.6838055920435355, |
| "grad_norm": 1.828125, |
| "learning_rate": 2.3536036036036036e-06, |
| "loss": 0.5202, |
| "mean_token_accuracy": 0.9581304490566254, |
| "step": 4910, |
| "train/kl_loss_qwen": 0.04810468130744994, |
| "train/kl_loss_r1": 0.028955771028995513, |
| "train/total_kl": 0.07706045228987932 |
| }, |
| { |
| "epoch": 3.6875586413961345, |
| "grad_norm": 2.046875, |
| "learning_rate": 2.3254504504504505e-06, |
| "loss": 0.5639, |
| "mean_token_accuracy": 0.9510135352611542, |
| "step": 4915, |
| "train/kl_loss_qwen": 0.04566266257315874, |
| "train/kl_loss_r1": 0.0282847763504833, |
| "train/total_kl": 0.07394743924960494 |
| }, |
| { |
| "epoch": 3.6913116907487336, |
| "grad_norm": 1.75, |
| "learning_rate": 2.2972972972972974e-06, |
| "loss": 0.4899, |
| "mean_token_accuracy": 0.9510814368724823, |
| "step": 4920, |
| "train/kl_loss_qwen": 0.03731400719843805, |
| "train/kl_loss_r1": 0.022761214664205907, |
| "train/total_kl": 0.06007522279396653 |
| }, |
| { |
| "epoch": 3.6950647401013326, |
| "grad_norm": 2.59375, |
| "learning_rate": 2.269144144144144e-06, |
| "loss": 0.5005, |
| "mean_token_accuracy": 0.9558656960725784, |
| "step": 4925, |
| "train/kl_loss_qwen": 0.04062461815774441, |
| "train/kl_loss_r1": 0.02468117969110608, |
| "train/total_kl": 0.0653057973831892 |
| }, |
| { |
| "epoch": 3.6988177894539316, |
| "grad_norm": 2.0625, |
| "learning_rate": 2.240990990990991e-06, |
| "loss": 0.5914, |
| "mean_token_accuracy": 0.9519262284040451, |
| "step": 4930, |
| "train/kl_loss_qwen": 0.05449639055877924, |
| "train/kl_loss_r1": 0.030845365300774575, |
| "train/total_kl": 0.08534175446256995 |
| }, |
| { |
| "epoch": 3.70257083880653, |
| "grad_norm": 2.046875, |
| "learning_rate": 2.2128378378378377e-06, |
| "loss": 0.5489, |
| "mean_token_accuracy": 0.9491182923316955, |
| "step": 4935, |
| "train/kl_loss_qwen": 0.04436412039212882, |
| "train/kl_loss_r1": 0.02723758388310671, |
| "train/total_kl": 0.07160170413553715 |
| }, |
| { |
| "epoch": 3.706323888159129, |
| "grad_norm": 1.7578125, |
| "learning_rate": 2.1846846846846846e-06, |
| "loss": 0.5261, |
| "mean_token_accuracy": 0.9431472331285476, |
| "step": 4940, |
| "train/kl_loss_qwen": 0.04030956518836319, |
| "train/kl_loss_r1": 0.02509582005441189, |
| "train/total_kl": 0.0654053857550025 |
| }, |
| { |
| "epoch": 3.710076937511728, |
| "grad_norm": 2.625, |
| "learning_rate": 2.1565315315315315e-06, |
| "loss": 0.5934, |
| "mean_token_accuracy": 0.9567312359809875, |
| "step": 4945, |
| "train/kl_loss_qwen": 0.05713588017970324, |
| "train/kl_loss_r1": 0.03261457234621048, |
| "train/total_kl": 0.08975045187398792 |
| }, |
| { |
| "epoch": 3.713829986864327, |
| "grad_norm": 2.203125, |
| "learning_rate": 2.1283783783783785e-06, |
| "loss": 0.5451, |
| "mean_token_accuracy": 0.9484814405441284, |
| "step": 4950, |
| "train/kl_loss_qwen": 0.048199441749602556, |
| "train/kl_loss_r1": 0.027163840597495437, |
| "train/total_kl": 0.07536328211426735 |
| }, |
| { |
| "epoch": 3.717583036216926, |
| "grad_norm": 2.5625, |
| "learning_rate": 2.1002252252252254e-06, |
| "loss": 0.5935, |
| "mean_token_accuracy": 0.955457329750061, |
| "step": 4955, |
| "train/kl_loss_qwen": 0.05824917796999216, |
| "train/kl_loss_r1": 0.034108775574713944, |
| "train/total_kl": 0.09235795447602868 |
| }, |
| { |
| "epoch": 3.721336085569525, |
| "grad_norm": 2.40625, |
| "learning_rate": 2.072072072072072e-06, |
| "loss": 0.4623, |
| "mean_token_accuracy": 0.9505770593881607, |
| "step": 4960, |
| "train/kl_loss_qwen": 0.0321466120891273, |
| "train/kl_loss_r1": 0.021026749815791845, |
| "train/total_kl": 0.05317336162552237 |
| }, |
| { |
| "epoch": 3.7250891349221242, |
| "grad_norm": 2.296875, |
| "learning_rate": 2.0439189189189188e-06, |
| "loss": 0.5755, |
| "mean_token_accuracy": 0.9496716737747193, |
| "step": 4965, |
| "train/kl_loss_qwen": 0.04926731456071139, |
| "train/kl_loss_r1": 0.03159582577645779, |
| "train/total_kl": 0.08086314136162401 |
| }, |
| { |
| "epoch": 3.7288421842747232, |
| "grad_norm": 1.7890625, |
| "learning_rate": 2.0157657657657657e-06, |
| "loss": 0.4742, |
| "mean_token_accuracy": 0.9528581112623214, |
| "step": 4970, |
| "train/kl_loss_qwen": 0.035010923305526374, |
| "train/kl_loss_r1": 0.02297942517325282, |
| "train/total_kl": 0.05799034852534533 |
| }, |
| { |
| "epoch": 3.7325952336273223, |
| "grad_norm": 1.546875, |
| "learning_rate": 1.9876126126126126e-06, |
| "loss": 0.5497, |
| "mean_token_accuracy": 0.9514399915933609, |
| "step": 4975, |
| "train/kl_loss_qwen": 0.045947178127244116, |
| "train/kl_loss_r1": 0.0276748682372272, |
| "train/total_kl": 0.07362204669043422 |
| }, |
| { |
| "epoch": 3.7363482829799213, |
| "grad_norm": 1.4375, |
| "learning_rate": 1.9594594594594595e-06, |
| "loss": 0.5189, |
| "mean_token_accuracy": 0.9563332289457321, |
| "step": 4980, |
| "train/kl_loss_qwen": 0.0446835320442915, |
| "train/kl_loss_r1": 0.027359084272757173, |
| "train/total_kl": 0.07204261664301156 |
| }, |
| { |
| "epoch": 3.7401013323325203, |
| "grad_norm": 1.5859375, |
| "learning_rate": 1.9313063063063064e-06, |
| "loss": 0.4732, |
| "mean_token_accuracy": 0.9515779405832291, |
| "step": 4985, |
| "train/kl_loss_qwen": 0.0353350019082427, |
| "train/kl_loss_r1": 0.021265791589394213, |
| "train/total_kl": 0.05660079354420304 |
| }, |
| { |
| "epoch": 3.7438543816851193, |
| "grad_norm": 1.7265625, |
| "learning_rate": 1.9031531531531531e-06, |
| "loss": 0.5357, |
| "mean_token_accuracy": 0.9530490398406982, |
| "step": 4990, |
| "train/kl_loss_qwen": 0.047580851893872025, |
| "train/kl_loss_r1": 0.02787015661597252, |
| "train/total_kl": 0.07545100878924131 |
| }, |
| { |
| "epoch": 3.747607431037718, |
| "grad_norm": 1.5703125, |
| "learning_rate": 1.875e-06, |
| "loss": 0.5061, |
| "mean_token_accuracy": 0.9487150400876999, |
| "step": 4995, |
| "train/kl_loss_qwen": 0.03738487912341952, |
| "train/kl_loss_r1": 0.02395879211835563, |
| "train/total_kl": 0.061343671102076766 |
| }, |
| { |
| "epoch": 3.751360480390317, |
| "grad_norm": 2.921875, |
| "learning_rate": 1.846846846846847e-06, |
| "loss": 0.5004, |
| "mean_token_accuracy": 0.9516070336103439, |
| "step": 5000, |
| "train/kl_loss_qwen": 0.039164299005642535, |
| "train/kl_loss_r1": 0.024061837745830417, |
| "train/total_kl": 0.06322613721713424 |
| }, |
| { |
| "epoch": 3.755113529742916, |
| "grad_norm": 1.65625, |
| "learning_rate": 1.8186936936936937e-06, |
| "loss": 0.5749, |
| "mean_token_accuracy": 0.9515040576457977, |
| "step": 5005, |
| "train/kl_loss_qwen": 0.052400945825502275, |
| "train/kl_loss_r1": 0.028596563590690495, |
| "train/total_kl": 0.08099750988185406 |
| }, |
| { |
| "epoch": 3.758866579095515, |
| "grad_norm": 2.984375, |
| "learning_rate": 1.7905405405405406e-06, |
| "loss": 0.444, |
| "mean_token_accuracy": 0.9563502013683319, |
| "step": 5010, |
| "train/kl_loss_qwen": 0.030290895281359552, |
| "train/kl_loss_r1": 0.019006578624248503, |
| "train/total_kl": 0.04929747423157096 |
| }, |
| { |
| "epoch": 3.762619628448114, |
| "grad_norm": 1.6796875, |
| "learning_rate": 1.7623873873873875e-06, |
| "loss": 0.5397, |
| "mean_token_accuracy": 0.9545387536287308, |
| "step": 5015, |
| "train/kl_loss_qwen": 0.04934395225718617, |
| "train/kl_loss_r1": 0.02698051822371781, |
| "train/total_kl": 0.07632447089999914 |
| }, |
| { |
| "epoch": 3.766372677800713, |
| "grad_norm": 1.4921875, |
| "learning_rate": 1.7342342342342344e-06, |
| "loss": 0.506, |
| "mean_token_accuracy": 0.9478281736373901, |
| "step": 5020, |
| "train/kl_loss_qwen": 0.036864762753248216, |
| "train/kl_loss_r1": 0.023657037084922193, |
| "train/total_kl": 0.060521799977868794 |
| }, |
| { |
| "epoch": 3.770125727153312, |
| "grad_norm": 1.953125, |
| "learning_rate": 1.7060810810810811e-06, |
| "loss": 0.4943, |
| "mean_token_accuracy": 0.9443540513515473, |
| "step": 5025, |
| "train/kl_loss_qwen": 0.03439016304910183, |
| "train/kl_loss_r1": 0.02218628195114434, |
| "train/total_kl": 0.05657644523307681 |
| }, |
| { |
| "epoch": 3.773878776505911, |
| "grad_norm": 2.0625, |
| "learning_rate": 1.677927927927928e-06, |
| "loss": 0.506, |
| "mean_token_accuracy": 0.9510277390480042, |
| "step": 5030, |
| "train/kl_loss_qwen": 0.04075477225705981, |
| "train/kl_loss_r1": 0.025303835375234486, |
| "train/total_kl": 0.06605860805138945 |
| }, |
| { |
| "epoch": 3.77763182585851, |
| "grad_norm": 1.5546875, |
| "learning_rate": 1.649774774774775e-06, |
| "loss": 0.5323, |
| "mean_token_accuracy": 0.9535300970077515, |
| "step": 5035, |
| "train/kl_loss_qwen": 0.045921135554090144, |
| "train/kl_loss_r1": 0.026559272641316058, |
| "train/total_kl": 0.07248040847480297 |
| }, |
| { |
| "epoch": 3.781384875211109, |
| "grad_norm": 1.7734375, |
| "learning_rate": 1.6216216216216219e-06, |
| "loss": 0.5453, |
| "mean_token_accuracy": 0.9485278338193893, |
| "step": 5040, |
| "train/kl_loss_qwen": 0.04068466508761048, |
| "train/kl_loss_r1": 0.024883358972147107, |
| "train/total_kl": 0.06556802354753018 |
| }, |
| { |
| "epoch": 3.785137924563708, |
| "grad_norm": 1.5859375, |
| "learning_rate": 1.5934684684684686e-06, |
| "loss": 0.4897, |
| "mean_token_accuracy": 0.945227426290512, |
| "step": 5045, |
| "train/kl_loss_qwen": 0.03364719781093299, |
| "train/kl_loss_r1": 0.02213437985628843, |
| "train/total_kl": 0.055781577713787556 |
| }, |
| { |
| "epoch": 3.788890973916307, |
| "grad_norm": 2.125, |
| "learning_rate": 1.5653153153153153e-06, |
| "loss": 0.4788, |
| "mean_token_accuracy": 0.9548559993505478, |
| "step": 5050, |
| "train/kl_loss_qwen": 0.03653868711553514, |
| "train/kl_loss_r1": 0.0236417087726295, |
| "train/total_kl": 0.06018039602786303 |
| }, |
| { |
| "epoch": 3.792644023268906, |
| "grad_norm": 2.03125, |
| "learning_rate": 1.5371621621621622e-06, |
| "loss": 0.5636, |
| "mean_token_accuracy": 0.9515438884496689, |
| "step": 5055, |
| "train/kl_loss_qwen": 0.047804121021181346, |
| "train/kl_loss_r1": 0.029594582365825774, |
| "train/total_kl": 0.07739870361983776 |
| }, |
| { |
| "epoch": 3.796397072621505, |
| "grad_norm": 1.6015625, |
| "learning_rate": 1.5090090090090089e-06, |
| "loss": 0.4593, |
| "mean_token_accuracy": 0.9565709322690964, |
| "step": 5060, |
| "train/kl_loss_qwen": 0.036150804301723835, |
| "train/kl_loss_r1": 0.022632238129153846, |
| "train/total_kl": 0.05878304187208414 |
| }, |
| { |
| "epoch": 3.800150121974104, |
| "grad_norm": 1.5390625, |
| "learning_rate": 1.4808558558558558e-06, |
| "loss": 0.4542, |
| "mean_token_accuracy": 0.9509487301111221, |
| "step": 5065, |
| "train/kl_loss_qwen": 0.030484898015856743, |
| "train/kl_loss_r1": 0.01995536368340254, |
| "train/total_kl": 0.050440261419862506 |
| }, |
| { |
| "epoch": 3.803903171326703, |
| "grad_norm": 2.21875, |
| "learning_rate": 1.4527027027027027e-06, |
| "loss": 0.5608, |
| "mean_token_accuracy": 0.9536998093128204, |
| "step": 5070, |
| "train/kl_loss_qwen": 0.05034955218434334, |
| "train/kl_loss_r1": 0.02807376431301236, |
| "train/total_kl": 0.07842331659048796 |
| }, |
| { |
| "epoch": 3.807656220679302, |
| "grad_norm": 2.0625, |
| "learning_rate": 1.4245495495495496e-06, |
| "loss": 0.5599, |
| "mean_token_accuracy": 0.9517528563737869, |
| "step": 5075, |
| "train/kl_loss_qwen": 0.04939096746966243, |
| "train/kl_loss_r1": 0.028638430312275885, |
| "train/total_kl": 0.07802939787507057 |
| }, |
| { |
| "epoch": 3.811409270031901, |
| "grad_norm": 2.5625, |
| "learning_rate": 1.3963963963963963e-06, |
| "loss": 0.5062, |
| "mean_token_accuracy": 0.9554317742586136, |
| "step": 5080, |
| "train/kl_loss_qwen": 0.04219297617673874, |
| "train/kl_loss_r1": 0.025768689857795835, |
| "train/total_kl": 0.06796166570857168 |
| }, |
| { |
| "epoch": 3.8151623193845, |
| "grad_norm": 2.828125, |
| "learning_rate": 1.3682432432432432e-06, |
| "loss": 0.4974, |
| "mean_token_accuracy": 0.9443808525800705, |
| "step": 5085, |
| "train/kl_loss_qwen": 0.03445208133198321, |
| "train/kl_loss_r1": 0.021914923517033457, |
| "train/total_kl": 0.056367005221545696 |
| }, |
| { |
| "epoch": 3.818915368737099, |
| "grad_norm": 1.78125, |
| "learning_rate": 1.3400900900900901e-06, |
| "loss": 0.5546, |
| "mean_token_accuracy": 0.9497458070516587, |
| "step": 5090, |
| "train/kl_loss_qwen": 0.0485810327809304, |
| "train/kl_loss_r1": 0.027917088754475117, |
| "train/total_kl": 0.07649812195450068 |
| }, |
| { |
| "epoch": 3.822668418089698, |
| "grad_norm": 1.5390625, |
| "learning_rate": 1.311936936936937e-06, |
| "loss": 0.5886, |
| "mean_token_accuracy": 0.9538557380437851, |
| "step": 5095, |
| "train/kl_loss_qwen": 0.05744519936852157, |
| "train/kl_loss_r1": 0.030710907746106388, |
| "train/total_kl": 0.08815610771998764 |
| }, |
| { |
| "epoch": 3.8264214674422967, |
| "grad_norm": 2.34375, |
| "learning_rate": 1.2837837837837838e-06, |
| "loss": 0.4847, |
| "mean_token_accuracy": 0.9532930910587311, |
| "step": 5100, |
| "train/kl_loss_qwen": 0.03452372634783387, |
| "train/kl_loss_r1": 0.02196382894180715, |
| "train/total_kl": 0.05648755459114909 |
| }, |
| { |
| "epoch": 3.8301745167948957, |
| "grad_norm": 4.21875, |
| "learning_rate": 1.2556306306306307e-06, |
| "loss": 0.5332, |
| "mean_token_accuracy": 0.9430410385131835, |
| "step": 5105, |
| "train/kl_loss_qwen": 0.040356996841728686, |
| "train/kl_loss_r1": 0.023822441697120667, |
| "train/total_kl": 0.06417943863198161 |
| }, |
| { |
| "epoch": 3.8339275661474947, |
| "grad_norm": 1.609375, |
| "learning_rate": 1.2274774774774776e-06, |
| "loss": 0.5038, |
| "mean_token_accuracy": 0.9531925290822982, |
| "step": 5110, |
| "train/kl_loss_qwen": 0.04049249268136919, |
| "train/kl_loss_r1": 0.025288863759487867, |
| "train/total_kl": 0.0657813566736877 |
| }, |
| { |
| "epoch": 3.8376806155000938, |
| "grad_norm": 2.921875, |
| "learning_rate": 1.1993243243243243e-06, |
| "loss": 0.522, |
| "mean_token_accuracy": 0.9434494227170944, |
| "step": 5115, |
| "train/kl_loss_qwen": 0.037803121656179425, |
| "train/kl_loss_r1": 0.02446298780851066, |
| "train/total_kl": 0.06226610923185945 |
| }, |
| { |
| "epoch": 3.8414336648526928, |
| "grad_norm": 2.3125, |
| "learning_rate": 1.1711711711711712e-06, |
| "loss": 0.4692, |
| "mean_token_accuracy": 0.9514028370380402, |
| "step": 5120, |
| "train/kl_loss_qwen": 0.03402503570541739, |
| "train/kl_loss_r1": 0.02239496917463839, |
| "train/total_kl": 0.05642000511288643 |
| }, |
| { |
| "epoch": 3.845186714205292, |
| "grad_norm": 2.3125, |
| "learning_rate": 1.1430180180180181e-06, |
| "loss": 0.5309, |
| "mean_token_accuracy": 0.9505946636199951, |
| "step": 5125, |
| "train/kl_loss_qwen": 0.045850425586104394, |
| "train/kl_loss_r1": 0.026252701180055737, |
| "train/total_kl": 0.07210312644019723 |
| }, |
| { |
| "epoch": 3.848939763557891, |
| "grad_norm": 2.203125, |
| "learning_rate": 1.114864864864865e-06, |
| "loss": 0.5566, |
| "mean_token_accuracy": 0.9513975620269776, |
| "step": 5130, |
| "train/kl_loss_qwen": 0.04835722097195685, |
| "train/kl_loss_r1": 0.028962965682148935, |
| "train/total_kl": 0.07732018698006868 |
| }, |
| { |
| "epoch": 3.85269281291049, |
| "grad_norm": 1.609375, |
| "learning_rate": 1.0867117117117117e-06, |
| "loss": 0.5045, |
| "mean_token_accuracy": 0.9520065993070602, |
| "step": 5135, |
| "train/kl_loss_qwen": 0.03904314516112208, |
| "train/kl_loss_r1": 0.025849370704963803, |
| "train/total_kl": 0.0648925157263875 |
| }, |
| { |
| "epoch": 3.856445862263089, |
| "grad_norm": 3.328125, |
| "learning_rate": 1.0585585585585587e-06, |
| "loss": 0.498, |
| "mean_token_accuracy": 0.9538995712995529, |
| "step": 5140, |
| "train/kl_loss_qwen": 0.038834956288337705, |
| "train/kl_loss_r1": 0.023740610433742405, |
| "train/total_kl": 0.06257556639611721 |
| }, |
| { |
| "epoch": 3.860198911615688, |
| "grad_norm": 1.9609375, |
| "learning_rate": 1.0304054054054056e-06, |
| "loss": 0.4727, |
| "mean_token_accuracy": 0.94283646941185, |
| "step": 5145, |
| "train/kl_loss_qwen": 0.027823445247486235, |
| "train/kl_loss_r1": 0.01955572385340929, |
| "train/total_kl": 0.04737916942685842 |
| }, |
| { |
| "epoch": 3.863951960968287, |
| "grad_norm": 1.9296875, |
| "learning_rate": 1.0022522522522525e-06, |
| "loss": 0.504, |
| "mean_token_accuracy": 0.9552516132593155, |
| "step": 5150, |
| "train/kl_loss_qwen": 0.04192827101796866, |
| "train/kl_loss_r1": 0.0254449718631804, |
| "train/total_kl": 0.06737324222922325 |
| }, |
| { |
| "epoch": 3.867705010320886, |
| "grad_norm": 1.7578125, |
| "learning_rate": 9.74099099099099e-07, |
| "loss": 0.473, |
| "mean_token_accuracy": 0.9536389499902725, |
| "step": 5155, |
| "train/kl_loss_qwen": 0.037043438851833345, |
| "train/kl_loss_r1": 0.0236785258166492, |
| "train/total_kl": 0.06072196466848254 |
| }, |
| { |
| "epoch": 3.8714580596734844, |
| "grad_norm": 1.7109375, |
| "learning_rate": 9.459459459459459e-07, |
| "loss": 0.5516, |
| "mean_token_accuracy": 0.9482437491416931, |
| "step": 5160, |
| "train/kl_loss_qwen": 0.04674530010670423, |
| "train/kl_loss_r1": 0.027758846478536724, |
| "train/total_kl": 0.07450414700433612 |
| }, |
| { |
| "epoch": 3.8752111090260835, |
| "grad_norm": 1.765625, |
| "learning_rate": 9.177927927927928e-07, |
| "loss": 0.5144, |
| "mean_token_accuracy": 0.9507743179798126, |
| "step": 5165, |
| "train/kl_loss_qwen": 0.03748309840448201, |
| "train/kl_loss_r1": 0.02437306847423315, |
| "train/total_kl": 0.061856167297810315 |
| }, |
| { |
| "epoch": 3.8789641583786825, |
| "grad_norm": 1.8046875, |
| "learning_rate": 8.896396396396397e-07, |
| "loss": 0.5204, |
| "mean_token_accuracy": 0.9507594257593155, |
| "step": 5170, |
| "train/kl_loss_qwen": 0.043137048045173286, |
| "train/kl_loss_r1": 0.025168476812541484, |
| "train/total_kl": 0.06830552481114864 |
| }, |
| { |
| "epoch": 3.8827172077312815, |
| "grad_norm": 1.796875, |
| "learning_rate": 8.614864864864865e-07, |
| "loss": 0.5293, |
| "mean_token_accuracy": 0.9467691868543625, |
| "step": 5175, |
| "train/kl_loss_qwen": 0.040857316879555586, |
| "train/kl_loss_r1": 0.02520199529826641, |
| "train/total_kl": 0.06605931203812361 |
| }, |
| { |
| "epoch": 3.8864702570838805, |
| "grad_norm": 2.03125, |
| "learning_rate": 8.333333333333333e-07, |
| "loss": 0.512, |
| "mean_token_accuracy": 0.954476135969162, |
| "step": 5180, |
| "train/kl_loss_qwen": 0.04564613183028996, |
| "train/kl_loss_r1": 0.025337532442063094, |
| "train/total_kl": 0.07098366366699338 |
| }, |
| { |
| "epoch": 3.8902233064364795, |
| "grad_norm": 1.8046875, |
| "learning_rate": 8.051801801801801e-07, |
| "loss": 0.5171, |
| "mean_token_accuracy": 0.9508705079555512, |
| "step": 5185, |
| "train/kl_loss_qwen": 0.04170615980401635, |
| "train/kl_loss_r1": 0.025099441641941667, |
| "train/total_kl": 0.06680560121312737 |
| }, |
| { |
| "epoch": 3.8939763557890785, |
| "grad_norm": 1.6640625, |
| "learning_rate": 7.770270270270271e-07, |
| "loss": 0.4909, |
| "mean_token_accuracy": 0.9476747989654541, |
| "step": 5190, |
| "train/kl_loss_qwen": 0.03633582382462919, |
| "train/kl_loss_r1": 0.02298521767370403, |
| "train/total_kl": 0.05932104177772999 |
| }, |
| { |
| "epoch": 3.8977294051416775, |
| "grad_norm": 1.8046875, |
| "learning_rate": 7.488738738738739e-07, |
| "loss": 0.5217, |
| "mean_token_accuracy": 0.9495671540498734, |
| "step": 5195, |
| "train/kl_loss_qwen": 0.04427734538912773, |
| "train/kl_loss_r1": 0.02526472685858607, |
| "train/total_kl": 0.06954207243397832 |
| }, |
| { |
| "epoch": 3.9014824544942766, |
| "grad_norm": 1.5625, |
| "learning_rate": 7.207207207207208e-07, |
| "loss": 0.4923, |
| "mean_token_accuracy": 0.9494727224111557, |
| "step": 5200, |
| "train/kl_loss_qwen": 0.03875735821202397, |
| "train/kl_loss_r1": 0.023817204358056187, |
| "train/total_kl": 0.06257456252351404 |
| }, |
| { |
| "epoch": 3.9052355038468756, |
| "grad_norm": 2.484375, |
| "learning_rate": 6.925675675675676e-07, |
| "loss": 0.4814, |
| "mean_token_accuracy": 0.9498078048229217, |
| "step": 5205, |
| "train/kl_loss_qwen": 0.03472012551501393, |
| "train/kl_loss_r1": 0.022663915436714886, |
| "train/total_kl": 0.05738404057919979 |
| }, |
| { |
| "epoch": 3.9089885531994746, |
| "grad_norm": 2.25, |
| "learning_rate": 6.644144144144144e-07, |
| "loss": 0.5007, |
| "mean_token_accuracy": 0.9551177322864532, |
| "step": 5210, |
| "train/kl_loss_qwen": 0.04156562443822622, |
| "train/kl_loss_r1": 0.025957941822707654, |
| "train/total_kl": 0.06752356672659517 |
| }, |
| { |
| "epoch": 3.9127416025520736, |
| "grad_norm": 1.671875, |
| "learning_rate": 6.362612612612613e-07, |
| "loss": 0.5694, |
| "mean_token_accuracy": 0.9571527123451233, |
| "step": 5215, |
| "train/kl_loss_qwen": 0.052221673587337133, |
| "train/kl_loss_r1": 0.031050076289102436, |
| "train/total_kl": 0.08327174894511699 |
| }, |
| { |
| "epoch": 3.9164946519046726, |
| "grad_norm": 1.6796875, |
| "learning_rate": 6.081081081081081e-07, |
| "loss": 0.4867, |
| "mean_token_accuracy": 0.9479338258504868, |
| "step": 5220, |
| "train/kl_loss_qwen": 0.037482742918655276, |
| "train/kl_loss_r1": 0.022623464511707426, |
| "train/total_kl": 0.060106207709759475 |
| }, |
| { |
| "epoch": 3.9202477012572716, |
| "grad_norm": 2.9375, |
| "learning_rate": 5.79954954954955e-07, |
| "loss": 0.5315, |
| "mean_token_accuracy": 0.95349780023098, |
| "step": 5225, |
| "train/kl_loss_qwen": 0.041179875005036594, |
| "train/kl_loss_r1": 0.024548267433419823, |
| "train/total_kl": 0.06572814229875804 |
| }, |
| { |
| "epoch": 3.9240007506098706, |
| "grad_norm": 1.7890625, |
| "learning_rate": 5.518018018018017e-07, |
| "loss": 0.494, |
| "mean_token_accuracy": 0.9552882075309753, |
| "step": 5230, |
| "train/kl_loss_qwen": 0.0404520948883146, |
| "train/kl_loss_r1": 0.024678921373561025, |
| "train/total_kl": 0.06513101598247886 |
| }, |
| { |
| "epoch": 3.9277537999624696, |
| "grad_norm": 2.296875, |
| "learning_rate": 5.236486486486486e-07, |
| "loss": 0.4897, |
| "mean_token_accuracy": 0.9574841767549515, |
| "step": 5235, |
| "train/kl_loss_qwen": 0.04159375471062958, |
| "train/kl_loss_r1": 0.025406858837231993, |
| "train/total_kl": 0.06700061419978738 |
| }, |
| { |
| "epoch": 3.9315068493150687, |
| "grad_norm": 2.546875, |
| "learning_rate": 4.954954954954955e-07, |
| "loss": 0.5705, |
| "mean_token_accuracy": 0.9512778520584106, |
| "step": 5240, |
| "train/kl_loss_qwen": 0.04816130660474301, |
| "train/kl_loss_r1": 0.02963559590280056, |
| "train/total_kl": 0.0777969030663371 |
| }, |
| { |
| "epoch": 3.9352598986676677, |
| "grad_norm": 1.6015625, |
| "learning_rate": 4.673423423423423e-07, |
| "loss": 0.4914, |
| "mean_token_accuracy": 0.9590355962514877, |
| "step": 5245, |
| "train/kl_loss_qwen": 0.03864445784129202, |
| "train/kl_loss_r1": 0.024916677735745907, |
| "train/total_kl": 0.06356113543733954 |
| }, |
| { |
| "epoch": 3.9390129480202667, |
| "grad_norm": 1.7734375, |
| "learning_rate": 4.391891891891892e-07, |
| "loss": 0.5212, |
| "mean_token_accuracy": 0.9514751166105271, |
| "step": 5250, |
| "train/kl_loss_qwen": 0.041747315181419255, |
| "train/kl_loss_r1": 0.025338015891611575, |
| "train/total_kl": 0.06708533093333244 |
| }, |
| { |
| "epoch": 3.9427659973728657, |
| "grad_norm": 2.0625, |
| "learning_rate": 4.1103603603603604e-07, |
| "loss": 0.4691, |
| "mean_token_accuracy": 0.9524274647235871, |
| "step": 5255, |
| "train/kl_loss_qwen": 0.03220422621816397, |
| "train/kl_loss_r1": 0.021751163946464657, |
| "train/total_kl": 0.05395539067685604 |
| }, |
| { |
| "epoch": 3.9465190467254643, |
| "grad_norm": 2.0625, |
| "learning_rate": 3.828828828828829e-07, |
| "loss": 0.4931, |
| "mean_token_accuracy": 0.9523744881153107, |
| "step": 5260, |
| "train/kl_loss_qwen": 0.040453130332753065, |
| "train/kl_loss_r1": 0.022134747868403793, |
| "train/total_kl": 0.06258787931874395 |
| }, |
| { |
| "epoch": 3.9502720960780633, |
| "grad_norm": 1.5546875, |
| "learning_rate": 3.5472972972972976e-07, |
| "loss": 0.5695, |
| "mean_token_accuracy": 0.9486282020807266, |
| "step": 5265, |
| "train/kl_loss_qwen": 0.04893369772471488, |
| "train/kl_loss_r1": 0.028443768760189413, |
| "train/total_kl": 0.07737746657803654 |
| }, |
| { |
| "epoch": 3.9540251454306623, |
| "grad_norm": 2.34375, |
| "learning_rate": 3.2657657657657657e-07, |
| "loss": 0.506, |
| "mean_token_accuracy": 0.9494929820299148, |
| "step": 5270, |
| "train/kl_loss_qwen": 0.039843138726428154, |
| "train/kl_loss_r1": 0.02399267992004752, |
| "train/total_kl": 0.06383581822738052 |
| }, |
| { |
| "epoch": 3.9577781947832613, |
| "grad_norm": 1.6328125, |
| "learning_rate": 2.9842342342342343e-07, |
| "loss": 0.4744, |
| "mean_token_accuracy": 0.9528090953826904, |
| "step": 5275, |
| "train/kl_loss_qwen": 0.03620699774473905, |
| "train/kl_loss_r1": 0.02199371703900397, |
| "train/total_kl": 0.058200715016573666 |
| }, |
| { |
| "epoch": 3.9615312441358603, |
| "grad_norm": 1.828125, |
| "learning_rate": 2.702702702702703e-07, |
| "loss": 0.5002, |
| "mean_token_accuracy": 0.9486662954092026, |
| "step": 5280, |
| "train/kl_loss_qwen": 0.03773316466249525, |
| "train/kl_loss_r1": 0.02234139838255942, |
| "train/total_kl": 0.060074562951922414 |
| }, |
| { |
| "epoch": 3.9652842934884593, |
| "grad_norm": 2.0625, |
| "learning_rate": 2.4211711711711715e-07, |
| "loss": 0.5184, |
| "mean_token_accuracy": 0.9583245426416397, |
| "step": 5285, |
| "train/kl_loss_qwen": 0.04658535942435264, |
| "train/kl_loss_r1": 0.02469016583636403, |
| "train/total_kl": 0.07127552451565862 |
| }, |
| { |
| "epoch": 3.9690373428410584, |
| "grad_norm": 1.53125, |
| "learning_rate": 2.1396396396396396e-07, |
| "loss": 0.4914, |
| "mean_token_accuracy": 0.9506331980228424, |
| "step": 5290, |
| "train/kl_loss_qwen": 0.034936840366572144, |
| "train/kl_loss_r1": 0.021668214024975894, |
| "train/total_kl": 0.05660505462437868 |
| }, |
| { |
| "epoch": 3.9727903921936574, |
| "grad_norm": 1.734375, |
| "learning_rate": 1.8581081081081082e-07, |
| "loss": 0.5043, |
| "mean_token_accuracy": 0.9526822239160537, |
| "step": 5295, |
| "train/kl_loss_qwen": 0.04128625453449786, |
| "train/kl_loss_r1": 0.02440170394256711, |
| "train/total_kl": 0.06568795843049884 |
| }, |
| { |
| "epoch": 3.9765434415462564, |
| "grad_norm": 2.125, |
| "learning_rate": 1.5765765765765768e-07, |
| "loss": 0.4875, |
| "mean_token_accuracy": 0.9513192981481552, |
| "step": 5300, |
| "train/kl_loss_qwen": 0.03742529796436429, |
| "train/kl_loss_r1": 0.022662578942254187, |
| "train/total_kl": 0.06008787713944912 |
| }, |
| { |
| "epoch": 3.9802964908988554, |
| "grad_norm": 1.7421875, |
| "learning_rate": 1.295045045045045e-07, |
| "loss": 0.504, |
| "mean_token_accuracy": 0.9543662935495376, |
| "step": 5305, |
| "train/kl_loss_qwen": 0.043019989412277936, |
| "train/kl_loss_r1": 0.023822894692420958, |
| "train/total_kl": 0.06684288457036018 |
| }, |
| { |
| "epoch": 3.9840495402514544, |
| "grad_norm": 1.734375, |
| "learning_rate": 1.0135135135135137e-07, |
| "loss": 0.4643, |
| "mean_token_accuracy": 0.9470363169908523, |
| "step": 5310, |
| "train/kl_loss_qwen": 0.03113719546236098, |
| "train/kl_loss_r1": 0.019862218666821717, |
| "train/total_kl": 0.05099941315129399 |
| }, |
| { |
| "epoch": 3.9878025896040534, |
| "grad_norm": 2.078125, |
| "learning_rate": 7.31981981981982e-08, |
| "loss": 0.5025, |
| "mean_token_accuracy": 0.9551354616880416, |
| "step": 5315, |
| "train/kl_loss_qwen": 0.041465169610455634, |
| "train/kl_loss_r1": 0.025189779000356793, |
| "train/total_kl": 0.06665494851768017 |
| }, |
| { |
| "epoch": 3.9915556389566524, |
| "grad_norm": 2.328125, |
| "learning_rate": 4.504504504504505e-08, |
| "loss": 0.4905, |
| "mean_token_accuracy": 0.9456799060106278, |
| "step": 5320, |
| "train/kl_loss_qwen": 0.035016221832484005, |
| "train/kl_loss_r1": 0.022114977519959212, |
| "train/total_kl": 0.05713119944557547 |
| }, |
| { |
| "epoch": 3.995308688309251, |
| "grad_norm": 1.859375, |
| "learning_rate": 1.6891891891891893e-08, |
| "loss": 0.4987, |
| "mean_token_accuracy": 0.9567227691411972, |
| "step": 5325, |
| "train/kl_loss_qwen": 0.039210280030965806, |
| "train/kl_loss_r1": 0.02504223152063787, |
| "train/total_kl": 0.06425251075997948 |
| } |
| ], |
| "logging_steps": 5, |
| "max_steps": 5328, |
| "num_input_tokens_seen": 0, |
| "num_train_epochs": 4, |
| "save_steps": 500, |
| "stateful_callbacks": { |
| "TrainerControl": { |
| "args": { |
| "should_epoch_stop": false, |
| "should_evaluate": false, |
| "should_log": false, |
| "should_save": true, |
| "should_training_stop": true |
| }, |
| "attributes": {} |
| } |
| }, |
| "total_flos": 1.577455631807742e+18, |
| "train_batch_size": 2, |
| "trial_name": null, |
| "trial_params": null |
| } |
|
|