OThink-R1-QA-14B / trainer_state.json
Cynthia-1628's picture
Upload folder using huggingface_hub
8081f92 verified
Raw
History Blame Contribute Delete
378 kB
{
"best_metric": null,
"best_model_checkpoint": null,
"epoch": 3.9975605179208107,
"eval_steps": 500,
"global_step": 5328,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"epoch": 0.0037530493525989865,
"grad_norm": 8.25,
"learning_rate": 2.9971846846846846e-05,
"loss": 1.5176,
"mean_token_accuracy": 0.769223016500473,
"step": 5,
"train/kl_loss_qwen": 0.08752547902986407,
"train/kl_loss_r1": 0.06338356978787943,
"train/total_kl": 0.1509090474806726
},
{
"epoch": 0.007506098705197973,
"grad_norm": 4.28125,
"learning_rate": 2.9943693693693695e-05,
"loss": 1.1039,
"mean_token_accuracy": 0.8164006888866424,
"step": 10,
"train/kl_loss_qwen": 0.047363690473139285,
"train/kl_loss_r1": 0.030132385808974503,
"train/total_kl": 0.0774960758164525
},
{
"epoch": 0.01125914805779696,
"grad_norm": 5.65625,
"learning_rate": 2.991554054054054e-05,
"loss": 1.2405,
"mean_token_accuracy": 0.8136043608188629,
"step": 15,
"train/kl_loss_qwen": 0.07904849713668227,
"train/kl_loss_r1": 0.061669887881726025,
"train/total_kl": 0.14071838529780506
},
{
"epoch": 0.015012197410395946,
"grad_norm": 3.75,
"learning_rate": 2.9887387387387387e-05,
"loss": 1.0465,
"mean_token_accuracy": 0.8160444319248199,
"step": 20,
"train/kl_loss_qwen": 0.050111161265522244,
"train/kl_loss_r1": 0.02416137345135212,
"train/total_kl": 0.07427253378555179
},
{
"epoch": 0.018765246762994934,
"grad_norm": 5.25,
"learning_rate": 2.9859234234234236e-05,
"loss": 0.9846,
"mean_token_accuracy": 0.8187097162008286,
"step": 25,
"train/kl_loss_qwen": 0.05244297441095114,
"train/kl_loss_r1": 0.026212173467501997,
"train/total_kl": 0.07865514857694507
},
{
"epoch": 0.02251829611559392,
"grad_norm": 4.5,
"learning_rate": 2.983108108108108e-05,
"loss": 0.9745,
"mean_token_accuracy": 0.820404228568077,
"step": 30,
"train/kl_loss_qwen": 0.04298435244709253,
"train/kl_loss_r1": 0.019624315295368434,
"train/total_kl": 0.06260866802185774
},
{
"epoch": 0.026271345468192906,
"grad_norm": 4.4375,
"learning_rate": 2.980292792792793e-05,
"loss": 0.9507,
"mean_token_accuracy": 0.8279938399791718,
"step": 35,
"train/kl_loss_qwen": 0.05955953812226653,
"train/kl_loss_r1": 0.024175814585760236,
"train/total_kl": 0.08373535200953483
},
{
"epoch": 0.030024394820791892,
"grad_norm": 8.3125,
"learning_rate": 2.9774774774774776e-05,
"loss": 0.938,
"mean_token_accuracy": 0.8134139478206635,
"step": 40,
"train/kl_loss_qwen": 0.044126112619414924,
"train/kl_loss_r1": 0.025413188384845853,
"train/total_kl": 0.06953930081799627
},
{
"epoch": 0.03377744417339088,
"grad_norm": 4.0625,
"learning_rate": 2.9746621621621622e-05,
"loss": 0.9463,
"mean_token_accuracy": 0.8168299198150635,
"step": 45,
"train/kl_loss_qwen": 0.03402696019038558,
"train/kl_loss_r1": 0.021722227288410067,
"train/total_kl": 0.055749187525361774
},
{
"epoch": 0.03753049352598987,
"grad_norm": 3.75,
"learning_rate": 2.971846846846847e-05,
"loss": 0.9246,
"mean_token_accuracy": 0.8254363358020782,
"step": 50,
"train/kl_loss_qwen": 0.04775930540636182,
"train/kl_loss_r1": 0.022044902294874193,
"train/total_kl": 0.0698042068630457
},
{
"epoch": 0.041283542878588854,
"grad_norm": 6.8125,
"learning_rate": 2.9690315315315316e-05,
"loss": 0.925,
"mean_token_accuracy": 0.8240109533071518,
"step": 55,
"train/kl_loss_qwen": 0.043926798785105345,
"train/kl_loss_r1": 0.02575247841887176,
"train/total_kl": 0.06967927720397711
},
{
"epoch": 0.04503659223118784,
"grad_norm": 3.640625,
"learning_rate": 2.9662162162162162e-05,
"loss": 0.905,
"mean_token_accuracy": 0.8216860949993133,
"step": 60,
"train/kl_loss_qwen": 0.04389990693889558,
"train/kl_loss_r1": 0.018909475579857827,
"train/total_kl": 0.06280938191339373
},
{
"epoch": 0.048789641583786826,
"grad_norm": 3.296875,
"learning_rate": 2.963400900900901e-05,
"loss": 0.863,
"mean_token_accuracy": 0.8277184933423996,
"step": 65,
"train/kl_loss_qwen": 0.03611544775776565,
"train/kl_loss_r1": 0.01730741309002042,
"train/total_kl": 0.053422861360013486
},
{
"epoch": 0.05254269093638581,
"grad_norm": 4.28125,
"learning_rate": 2.9605855855855857e-05,
"loss": 0.9046,
"mean_token_accuracy": 0.8278381377458572,
"step": 70,
"train/kl_loss_qwen": 0.046157079841941596,
"train/kl_loss_r1": 0.022548422031104565,
"train/total_kl": 0.06870550150051713
},
{
"epoch": 0.0562957402889848,
"grad_norm": 3.234375,
"learning_rate": 2.9577702702702702e-05,
"loss": 0.9027,
"mean_token_accuracy": 0.8260001480579376,
"step": 75,
"train/kl_loss_qwen": 0.04451500792056322,
"train/kl_loss_r1": 0.02041986952535808,
"train/total_kl": 0.06493487702682614
},
{
"epoch": 0.060048789641583784,
"grad_norm": 2.921875,
"learning_rate": 2.954954954954955e-05,
"loss": 0.8643,
"mean_token_accuracy": 0.8250504255294799,
"step": 80,
"train/kl_loss_qwen": 0.03131786421872675,
"train/kl_loss_r1": 0.01814232598990202,
"train/total_kl": 0.04946019034832716
},
{
"epoch": 0.06380183899418278,
"grad_norm": 3.3125,
"learning_rate": 2.9521396396396397e-05,
"loss": 0.8967,
"mean_token_accuracy": 0.8288980603218079,
"step": 85,
"train/kl_loss_qwen": 0.03794705630280078,
"train/kl_loss_r1": 0.01904052966274321,
"train/total_kl": 0.05698758559301496
},
{
"epoch": 0.06755488834678176,
"grad_norm": 3.234375,
"learning_rate": 2.9493243243243243e-05,
"loss": 0.8967,
"mean_token_accuracy": 0.8236296445131301,
"step": 90,
"train/kl_loss_qwen": 0.034339522430673244,
"train/kl_loss_r1": 0.017526828777045013,
"train/total_kl": 0.05186635032296181
},
{
"epoch": 0.07130793769938075,
"grad_norm": 3.0625,
"learning_rate": 2.9465090090090092e-05,
"loss": 0.8868,
"mean_token_accuracy": 0.8290457785129547,
"step": 95,
"train/kl_loss_qwen": 0.04135038205422461,
"train/kl_loss_r1": 0.020615293877199292,
"train/total_kl": 0.06196567676961422
},
{
"epoch": 0.07506098705197974,
"grad_norm": 2.484375,
"learning_rate": 2.9436936936936937e-05,
"loss": 0.9278,
"mean_token_accuracy": 0.8270440757274627,
"step": 100,
"train/kl_loss_qwen": 0.04315362004563213,
"train/kl_loss_r1": 0.019161203969269992,
"train/total_kl": 0.06231482308357954
},
{
"epoch": 0.07881403640457872,
"grad_norm": 2.9375,
"learning_rate": 2.9408783783783786e-05,
"loss": 0.9493,
"mean_token_accuracy": 0.8260469496250152,
"step": 105,
"train/kl_loss_qwen": 0.05107316141948104,
"train/kl_loss_r1": 0.02429227330721915,
"train/total_kl": 0.07536543449386954
},
{
"epoch": 0.08256708575717771,
"grad_norm": 2.828125,
"learning_rate": 2.9380630630630632e-05,
"loss": 0.8664,
"mean_token_accuracy": 0.8338415503501893,
"step": 110,
"train/kl_loss_qwen": 0.033846771158277986,
"train/kl_loss_r1": 0.02006581616587937,
"train/total_kl": 0.053912587370723485
},
{
"epoch": 0.0863201351097767,
"grad_norm": 3.640625,
"learning_rate": 2.9352477477477478e-05,
"loss": 0.9389,
"mean_token_accuracy": 0.8269973963499069,
"step": 115,
"train/kl_loss_qwen": 0.0465784995816648,
"train/kl_loss_r1": 0.017597663728520275,
"train/total_kl": 0.06417616195976734
},
{
"epoch": 0.09007318446237568,
"grad_norm": 4.6875,
"learning_rate": 2.9324324324324327e-05,
"loss": 0.8609,
"mean_token_accuracy": 0.8387646734714508,
"step": 120,
"train/kl_loss_qwen": 0.045968831051141024,
"train/kl_loss_r1": 0.02227792115882039,
"train/total_kl": 0.06824675332754851
},
{
"epoch": 0.09382623381497467,
"grad_norm": 3.34375,
"learning_rate": 2.9296171171171172e-05,
"loss": 0.8136,
"mean_token_accuracy": 0.835837545990944,
"step": 125,
"train/kl_loss_qwen": 0.030515689635649323,
"train/kl_loss_r1": 0.01657968182116747,
"train/total_kl": 0.04709537066519261
},
{
"epoch": 0.09757928316757365,
"grad_norm": 3.59375,
"learning_rate": 2.9268018018018018e-05,
"loss": 0.9258,
"mean_token_accuracy": 0.8317561388015747,
"step": 130,
"train/kl_loss_qwen": 0.050186758302152155,
"train/kl_loss_r1": 0.02410706952214241,
"train/total_kl": 0.07429382782429457
},
{
"epoch": 0.10133233252017264,
"grad_norm": 3.234375,
"learning_rate": 2.9239864864864867e-05,
"loss": 0.9888,
"mean_token_accuracy": 0.821666619181633,
"step": 135,
"train/kl_loss_qwen": 0.0546362214256078,
"train/kl_loss_r1": 0.030097179347649217,
"train/total_kl": 0.0847334012389183
},
{
"epoch": 0.10508538187277162,
"grad_norm": 2.9375,
"learning_rate": 2.9211711711711713e-05,
"loss": 0.8415,
"mean_token_accuracy": 0.8354150176048278,
"step": 140,
"train/kl_loss_qwen": 0.03478895598091185,
"train/kl_loss_r1": 0.02067015548236668,
"train/total_kl": 0.05545911192893982
},
{
"epoch": 0.10883843122537061,
"grad_norm": 3.734375,
"learning_rate": 2.918355855855856e-05,
"loss": 0.8876,
"mean_token_accuracy": 0.8325099974870682,
"step": 145,
"train/kl_loss_qwen": 0.0391026409342885,
"train/kl_loss_r1": 0.026549011236056685,
"train/total_kl": 0.06565165296196937
},
{
"epoch": 0.1125914805779696,
"grad_norm": 2.84375,
"learning_rate": 2.9155405405405407e-05,
"loss": 0.9387,
"mean_token_accuracy": 0.8379026591777802,
"step": 150,
"train/kl_loss_qwen": 0.051510713435709475,
"train/kl_loss_r1": 0.03157240990549326,
"train/total_kl": 0.08308312483131886
},
{
"epoch": 0.11634452993056858,
"grad_norm": 5.09375,
"learning_rate": 2.9127252252252253e-05,
"loss": 0.9259,
"mean_token_accuracy": 0.826890054345131,
"step": 155,
"train/kl_loss_qwen": 0.04228275725618005,
"train/kl_loss_r1": 0.02729719616472721,
"train/total_kl": 0.06957995360717177
},
{
"epoch": 0.12009757928316757,
"grad_norm": 3.875,
"learning_rate": 2.90990990990991e-05,
"loss": 0.9461,
"mean_token_accuracy": 0.8288823276758194,
"step": 160,
"train/kl_loss_qwen": 0.04088701442815364,
"train/kl_loss_r1": 0.024661906762048602,
"train/total_kl": 0.06554892128333449
},
{
"epoch": 0.12385062863576655,
"grad_norm": 4.21875,
"learning_rate": 2.9070945945945948e-05,
"loss": 0.8884,
"mean_token_accuracy": 0.8316583424806595,
"step": 165,
"train/kl_loss_qwen": 0.04645280791446567,
"train/kl_loss_r1": 0.026368586625903846,
"train/total_kl": 0.07282139537855983
},
{
"epoch": 0.12760367798836555,
"grad_norm": 3.140625,
"learning_rate": 2.9042792792792793e-05,
"loss": 0.8559,
"mean_token_accuracy": 0.8401839256286621,
"step": 170,
"train/kl_loss_qwen": 0.03588448138907552,
"train/kl_loss_r1": 0.02225645985454321,
"train/total_kl": 0.058140940591692926
},
{
"epoch": 0.13135672734096454,
"grad_norm": 3.078125,
"learning_rate": 2.9014639639639642e-05,
"loss": 0.9353,
"mean_token_accuracy": 0.819926631450653,
"step": 175,
"train/kl_loss_qwen": 0.047735629277303814,
"train/kl_loss_r1": 0.022419746313244105,
"train/total_kl": 0.0701553763821721
},
{
"epoch": 0.13510977669356353,
"grad_norm": 3.109375,
"learning_rate": 2.8986486486486488e-05,
"loss": 0.8418,
"mean_token_accuracy": 0.8275587946176529,
"step": 180,
"train/kl_loss_qwen": 0.030953629314899443,
"train/kl_loss_r1": 0.016762713715434075,
"train/total_kl": 0.04771634349599481
},
{
"epoch": 0.1388628260461625,
"grad_norm": 2.84375,
"learning_rate": 2.8958333333333334e-05,
"loss": 0.8736,
"mean_token_accuracy": 0.8307415157556534,
"step": 185,
"train/kl_loss_qwen": 0.040645266277715565,
"train/kl_loss_r1": 0.01992678502574563,
"train/total_kl": 0.06057205153629184
},
{
"epoch": 0.1426158753987615,
"grad_norm": 3.015625,
"learning_rate": 2.8930180180180183e-05,
"loss": 0.8587,
"mean_token_accuracy": 0.8310975462198258,
"step": 190,
"train/kl_loss_qwen": 0.036960875568911436,
"train/kl_loss_r1": 0.019845803361386062,
"train/total_kl": 0.05680667934939265
},
{
"epoch": 0.14636892475136049,
"grad_norm": 2.734375,
"learning_rate": 2.8902027027027028e-05,
"loss": 0.8772,
"mean_token_accuracy": 0.8337432593107224,
"step": 195,
"train/kl_loss_qwen": 0.04270432349294424,
"train/kl_loss_r1": 0.02069783229380846,
"train/total_kl": 0.06340215532109142
},
{
"epoch": 0.15012197410395947,
"grad_norm": 2.59375,
"learning_rate": 2.8873873873873874e-05,
"loss": 0.8596,
"mean_token_accuracy": 0.83087178170681,
"step": 200,
"train/kl_loss_qwen": 0.042936635203659534,
"train/kl_loss_r1": 0.022718130564317107,
"train/total_kl": 0.06565476628020406
},
{
"epoch": 0.15387502345655846,
"grad_norm": 3.640625,
"learning_rate": 2.8845720720720723e-05,
"loss": 0.8908,
"mean_token_accuracy": 0.8138444811105728,
"step": 205,
"train/kl_loss_qwen": 0.030784124229103326,
"train/kl_loss_r1": 0.016901360964402555,
"train/total_kl": 0.0476854850538075
},
{
"epoch": 0.15762807280915744,
"grad_norm": 3.46875,
"learning_rate": 2.881756756756757e-05,
"loss": 0.869,
"mean_token_accuracy": 0.8308258265256881,
"step": 210,
"train/kl_loss_qwen": 0.03687661928124726,
"train/kl_loss_r1": 0.02106295870617032,
"train/total_kl": 0.05793957831338048
},
{
"epoch": 0.16138112216175643,
"grad_norm": 3.140625,
"learning_rate": 2.8789414414414414e-05,
"loss": 0.8614,
"mean_token_accuracy": 0.8309110760688782,
"step": 215,
"train/kl_loss_qwen": 0.025625232327729463,
"train/kl_loss_r1": 0.017062702728435398,
"train/total_kl": 0.0426879346370697
},
{
"epoch": 0.16513417151435542,
"grad_norm": 3.515625,
"learning_rate": 2.8761261261261263e-05,
"loss": 0.9389,
"mean_token_accuracy": 0.8283930003643036,
"step": 220,
"train/kl_loss_qwen": 0.04772484353743493,
"train/kl_loss_r1": 0.0242662335280329,
"train/total_kl": 0.071991076041013
},
{
"epoch": 0.1688872208669544,
"grad_norm": 3.390625,
"learning_rate": 2.873310810810811e-05,
"loss": 0.8665,
"mean_token_accuracy": 0.8319736927747726,
"step": 225,
"train/kl_loss_qwen": 0.04302333788946271,
"train/kl_loss_r1": 0.020506267715245486,
"train/total_kl": 0.06352960634976626
},
{
"epoch": 0.1726402702195534,
"grad_norm": 3.078125,
"learning_rate": 2.8704954954954955e-05,
"loss": 0.9634,
"mean_token_accuracy": 0.8157904803752899,
"step": 230,
"train/kl_loss_qwen": 0.03608332681469619,
"train/kl_loss_r1": 0.022636342188343407,
"train/total_kl": 0.058719669748097655
},
{
"epoch": 0.17639331957215237,
"grad_norm": 3.3125,
"learning_rate": 2.8676801801801804e-05,
"loss": 0.8786,
"mean_token_accuracy": 0.8320168018341064,
"step": 235,
"train/kl_loss_qwen": 0.03650941308587789,
"train/kl_loss_r1": 0.01942919297143817,
"train/total_kl": 0.05593860624358058
},
{
"epoch": 0.18014636892475136,
"grad_norm": 3.09375,
"learning_rate": 2.864864864864865e-05,
"loss": 0.8857,
"mean_token_accuracy": 0.8240372210741043,
"step": 240,
"train/kl_loss_qwen": 0.04121889984235168,
"train/kl_loss_r1": 0.023149896459653974,
"train/total_kl": 0.06436879634857177
},
{
"epoch": 0.18389941827735035,
"grad_norm": 3.34375,
"learning_rate": 2.8620495495495498e-05,
"loss": 0.8879,
"mean_token_accuracy": 0.8295320123434067,
"step": 245,
"train/kl_loss_qwen": 0.04043615320697427,
"train/kl_loss_r1": 0.020326331770047546,
"train/total_kl": 0.06076248474419117
},
{
"epoch": 0.18765246762994933,
"grad_norm": 3.34375,
"learning_rate": 2.8592342342342344e-05,
"loss": 0.8265,
"mean_token_accuracy": 0.8326751410961151,
"step": 250,
"train/kl_loss_qwen": 0.026516885636374353,
"train/kl_loss_r1": 0.01770362425595522,
"train/total_kl": 0.044220509752631185
},
{
"epoch": 0.19140551698254832,
"grad_norm": 3.421875,
"learning_rate": 2.856418918918919e-05,
"loss": 0.9341,
"mean_token_accuracy": 0.8237122267484664,
"step": 255,
"train/kl_loss_qwen": 0.048292512679472564,
"train/kl_loss_r1": 0.022946013091132044,
"train/total_kl": 0.07123852567747235
},
{
"epoch": 0.1951585663351473,
"grad_norm": 2.78125,
"learning_rate": 2.853603603603604e-05,
"loss": 0.857,
"mean_token_accuracy": 0.828681230545044,
"step": 260,
"train/kl_loss_qwen": 0.03695045164786279,
"train/kl_loss_r1": 0.0199518951587379,
"train/total_kl": 0.056902346294373275
},
{
"epoch": 0.1989116156877463,
"grad_norm": 3.28125,
"learning_rate": 2.8507882882882884e-05,
"loss": 0.9094,
"mean_token_accuracy": 0.8349234968423843,
"step": 265,
"train/kl_loss_qwen": 0.047521751886233685,
"train/kl_loss_r1": 0.02572522107511759,
"train/total_kl": 0.07324697300791741
},
{
"epoch": 0.20266466504034528,
"grad_norm": 3.265625,
"learning_rate": 2.847972972972973e-05,
"loss": 0.9172,
"mean_token_accuracy": 0.8182721942663193,
"step": 270,
"train/kl_loss_qwen": 0.04026843742467463,
"train/kl_loss_r1": 0.019451649440452457,
"train/total_kl": 0.059720087610185144
},
{
"epoch": 0.20641771439294426,
"grad_norm": 2.96875,
"learning_rate": 2.845157657657658e-05,
"loss": 0.8914,
"mean_token_accuracy": 0.8202652215957642,
"step": 275,
"train/kl_loss_qwen": 0.03867609850130975,
"train/kl_loss_r1": 0.025283710239455102,
"train/total_kl": 0.06395980911329388
},
{
"epoch": 0.21017076374554325,
"grad_norm": 2.796875,
"learning_rate": 2.8423423423423425e-05,
"loss": 0.8519,
"mean_token_accuracy": 0.8259457170963287,
"step": 280,
"train/kl_loss_qwen": 0.030157899064943195,
"train/kl_loss_r1": 0.0176977907307446,
"train/total_kl": 0.047855690307915213
},
{
"epoch": 0.21392381309814223,
"grad_norm": 2.96875,
"learning_rate": 2.839527027027027e-05,
"loss": 0.8837,
"mean_token_accuracy": 0.8319539725780487,
"step": 285,
"train/kl_loss_qwen": 0.0462970673572272,
"train/kl_loss_r1": 0.023949274653568865,
"train/total_kl": 0.07024634098634124
},
{
"epoch": 0.21767686245074122,
"grad_norm": 3.375,
"learning_rate": 2.836711711711712e-05,
"loss": 0.8822,
"mean_token_accuracy": 0.8238964200019836,
"step": 290,
"train/kl_loss_qwen": 0.03392238900996745,
"train/kl_loss_r1": 0.019832599721848965,
"train/total_kl": 0.05375498877838254
},
{
"epoch": 0.2214299118033402,
"grad_norm": 3.125,
"learning_rate": 2.8338963963963965e-05,
"loss": 0.9019,
"mean_token_accuracy": 0.8279110223054886,
"step": 295,
"train/kl_loss_qwen": 0.04686084697023034,
"train/kl_loss_r1": 0.021674037864431738,
"train/total_kl": 0.0685348848812282
},
{
"epoch": 0.2251829611559392,
"grad_norm": 2.75,
"learning_rate": 2.831081081081081e-05,
"loss": 0.829,
"mean_token_accuracy": 0.8228947937488555,
"step": 300,
"train/kl_loss_qwen": 0.03104133568704128,
"train/kl_loss_r1": 0.017868287535384296,
"train/total_kl": 0.048909622617065905
},
{
"epoch": 0.22893601050853818,
"grad_norm": 3.609375,
"learning_rate": 2.828265765765766e-05,
"loss": 0.8861,
"mean_token_accuracy": 0.830480980873108,
"step": 305,
"train/kl_loss_qwen": 0.04108666768297553,
"train/kl_loss_r1": 0.022314603487029672,
"train/total_kl": 0.06340127140283584
},
{
"epoch": 0.23268905986113717,
"grad_norm": 2.75,
"learning_rate": 2.8254504504504505e-05,
"loss": 0.8572,
"mean_token_accuracy": 0.8241907984018326,
"step": 310,
"train/kl_loss_qwen": 0.03199450373649597,
"train/kl_loss_r1": 0.017621683469042183,
"train/total_kl": 0.04961618706583977
},
{
"epoch": 0.23644210921373615,
"grad_norm": 3.515625,
"learning_rate": 2.8226351351351354e-05,
"loss": 0.8637,
"mean_token_accuracy": 0.8376813232898712,
"step": 315,
"train/kl_loss_qwen": 0.04330867072567344,
"train/kl_loss_r1": 0.02416534055955708,
"train/total_kl": 0.06747401058673859
},
{
"epoch": 0.24019515856633514,
"grad_norm": 4.0625,
"learning_rate": 2.81981981981982e-05,
"loss": 0.9112,
"mean_token_accuracy": 0.8234936207532882,
"step": 320,
"train/kl_loss_qwen": 0.048313079914078114,
"train/kl_loss_r1": 0.025073166657239198,
"train/total_kl": 0.07338624661788344
},
{
"epoch": 0.24394820791893412,
"grad_norm": 4.78125,
"learning_rate": 2.8170045045045046e-05,
"loss": 0.8907,
"mean_token_accuracy": 0.8210220754146575,
"step": 325,
"train/kl_loss_qwen": 0.03271963973529637,
"train/kl_loss_r1": 0.017756852181628348,
"train/total_kl": 0.05047649145126343
},
{
"epoch": 0.2477012572715331,
"grad_norm": 3.203125,
"learning_rate": 2.8141891891891895e-05,
"loss": 0.8258,
"mean_token_accuracy": 0.8319089412689209,
"step": 330,
"train/kl_loss_qwen": 0.03287083809264004,
"train/kl_loss_r1": 0.017795524606481195,
"train/total_kl": 0.05066636316478253
},
{
"epoch": 0.2514543066241321,
"grad_norm": 3.375,
"learning_rate": 2.811373873873874e-05,
"loss": 0.8629,
"mean_token_accuracy": 0.8283258348703384,
"step": 335,
"train/kl_loss_qwen": 0.032528719678521154,
"train/kl_loss_r1": 0.020534052094444633,
"train/total_kl": 0.05306277144700289
},
{
"epoch": 0.2552073559767311,
"grad_norm": 8.375,
"learning_rate": 2.8085585585585586e-05,
"loss": 0.9014,
"mean_token_accuracy": 0.8283331096172333,
"step": 340,
"train/kl_loss_qwen": 0.0436781873460859,
"train/kl_loss_r1": 0.021283475076779725,
"train/total_kl": 0.06496166167780756
},
{
"epoch": 0.25896040532933007,
"grad_norm": 3.25,
"learning_rate": 2.8057432432432435e-05,
"loss": 0.9772,
"mean_token_accuracy": 0.8316745519638061,
"step": 345,
"train/kl_loss_qwen": 0.06164747509174049,
"train/kl_loss_r1": 0.033189503895118835,
"train/total_kl": 0.0948369799181819
},
{
"epoch": 0.2627134546819291,
"grad_norm": 2.53125,
"learning_rate": 2.802927927927928e-05,
"loss": 0.9112,
"mean_token_accuracy": 0.8187721729278564,
"step": 350,
"train/kl_loss_qwen": 0.04342941730283201,
"train/kl_loss_r1": 0.021683502895757555,
"train/total_kl": 0.06511292122304439
},
{
"epoch": 0.26646650403452804,
"grad_norm": 4.8125,
"learning_rate": 2.8001126126126126e-05,
"loss": 0.8597,
"mean_token_accuracy": 0.823934805393219,
"step": 355,
"train/kl_loss_qwen": 0.03486774587072432,
"train/kl_loss_r1": 0.018483150517567992,
"train/total_kl": 0.0533508962020278
},
{
"epoch": 0.27021955338712705,
"grad_norm": 4.03125,
"learning_rate": 2.7972972972972975e-05,
"loss": 0.9002,
"mean_token_accuracy": 0.8210596233606339,
"step": 360,
"train/kl_loss_qwen": 0.038451321935281155,
"train/kl_loss_r1": 0.020488675870001315,
"train/total_kl": 0.05893999738618731
},
{
"epoch": 0.273972602739726,
"grad_norm": 3.609375,
"learning_rate": 2.794481981981982e-05,
"loss": 0.8471,
"mean_token_accuracy": 0.8312166184186935,
"step": 365,
"train/kl_loss_qwen": 0.029628670075908303,
"train/kl_loss_r1": 0.014924272242933512,
"train/total_kl": 0.04455294217914343
},
{
"epoch": 0.277725652092325,
"grad_norm": 2.84375,
"learning_rate": 2.7916666666666666e-05,
"loss": 0.8673,
"mean_token_accuracy": 0.8319344162940979,
"step": 370,
"train/kl_loss_qwen": 0.03991308896802366,
"train/kl_loss_r1": 0.0243389128241688,
"train/total_kl": 0.06425200179219245
},
{
"epoch": 0.281478701444924,
"grad_norm": 3.40625,
"learning_rate": 2.7888513513513516e-05,
"loss": 0.8304,
"mean_token_accuracy": 0.8395447045564651,
"step": 375,
"train/kl_loss_qwen": 0.03554642982780933,
"train/kl_loss_r1": 0.01824573487974703,
"train/total_kl": 0.053792164847254756
},
{
"epoch": 0.285231750797523,
"grad_norm": 2.796875,
"learning_rate": 2.786036036036036e-05,
"loss": 0.8545,
"mean_token_accuracy": 0.8338422924280167,
"step": 380,
"train/kl_loss_qwen": 0.03943650596775115,
"train/kl_loss_r1": 0.022580207185819746,
"train/total_kl": 0.062016712967306376
},
{
"epoch": 0.28898480015012196,
"grad_norm": 3.53125,
"learning_rate": 2.783220720720721e-05,
"loss": 0.8865,
"mean_token_accuracy": 0.8243386000394821,
"step": 385,
"train/kl_loss_qwen": 0.032612268114462495,
"train/kl_loss_r1": 0.019001774908974766,
"train/total_kl": 0.051614042930305006
},
{
"epoch": 0.29273784950272097,
"grad_norm": 2.875,
"learning_rate": 2.7804054054054056e-05,
"loss": 0.8481,
"mean_token_accuracy": 0.831609445810318,
"step": 390,
"train/kl_loss_qwen": 0.03640997484326362,
"train/kl_loss_r1": 0.02251947051845491,
"train/total_kl": 0.05892944540828467
},
{
"epoch": 0.29649089885531993,
"grad_norm": 3.796875,
"learning_rate": 2.77759009009009e-05,
"loss": 0.831,
"mean_token_accuracy": 0.8290323615074158,
"step": 395,
"train/kl_loss_qwen": 0.03999115023761988,
"train/kl_loss_r1": 0.018835989851504566,
"train/total_kl": 0.05882714046165347
},
{
"epoch": 0.30024394820791894,
"grad_norm": 3.5,
"learning_rate": 2.774774774774775e-05,
"loss": 0.8797,
"mean_token_accuracy": 0.8339627146720886,
"step": 400,
"train/kl_loss_qwen": 0.03993063434027135,
"train/kl_loss_r1": 0.021482796175405383,
"train/total_kl": 0.061413430236279966
},
{
"epoch": 0.3039969975605179,
"grad_norm": 3.28125,
"learning_rate": 2.7719594594594596e-05,
"loss": 0.8767,
"mean_token_accuracy": 0.8245404064655304,
"step": 405,
"train/kl_loss_qwen": 0.03429829515516758,
"train/kl_loss_r1": 0.018518435396254064,
"train/total_kl": 0.052816730458289385
},
{
"epoch": 0.3077500469131169,
"grad_norm": 2.890625,
"learning_rate": 2.7691441441441442e-05,
"loss": 0.8474,
"mean_token_accuracy": 0.8327318131923676,
"step": 410,
"train/kl_loss_qwen": 0.03831371474079788,
"train/kl_loss_r1": 0.02023513722233474,
"train/total_kl": 0.05854885214939713
},
{
"epoch": 0.3115030962657159,
"grad_norm": 3.09375,
"learning_rate": 2.766328828828829e-05,
"loss": 0.968,
"mean_token_accuracy": 0.8316255033016204,
"step": 415,
"train/kl_loss_qwen": 0.04635447044856846,
"train/kl_loss_r1": 0.03803784307092428,
"train/total_kl": 0.08439231272786855
},
{
"epoch": 0.3152561456183149,
"grad_norm": 2.78125,
"learning_rate": 2.7635135135135136e-05,
"loss": 0.8519,
"mean_token_accuracy": 0.8353470414876938,
"step": 420,
"train/kl_loss_qwen": 0.039563533896580336,
"train/kl_loss_r1": 0.020479060476645827,
"train/total_kl": 0.06004259428009391
},
{
"epoch": 0.31900919497091385,
"grad_norm": 2.78125,
"learning_rate": 2.7606981981981982e-05,
"loss": 0.8615,
"mean_token_accuracy": 0.8276613086462021,
"step": 425,
"train/kl_loss_qwen": 0.0393582281190902,
"train/kl_loss_r1": 0.019348848797380924,
"train/total_kl": 0.058707076404243705
},
{
"epoch": 0.32276224432351286,
"grad_norm": 3.03125,
"learning_rate": 2.757882882882883e-05,
"loss": 0.9294,
"mean_token_accuracy": 0.8186271667480469,
"step": 430,
"train/kl_loss_qwen": 0.050791586516425014,
"train/kl_loss_r1": 0.02292977077886462,
"train/total_kl": 0.07372135808691382
},
{
"epoch": 0.3265152936761118,
"grad_norm": 3.078125,
"learning_rate": 2.7550675675675677e-05,
"loss": 0.9728,
"mean_token_accuracy": 0.8224653273820877,
"step": 435,
"train/kl_loss_qwen": 0.04803532916121185,
"train/kl_loss_r1": 0.03875158065930009,
"train/total_kl": 0.08678690884262323
},
{
"epoch": 0.33026834302871083,
"grad_norm": 3.78125,
"learning_rate": 2.7522522522522522e-05,
"loss": 0.867,
"mean_token_accuracy": 0.826562350988388,
"step": 440,
"train/kl_loss_qwen": 0.0310151603538543,
"train/kl_loss_r1": 0.020512415934354065,
"train/total_kl": 0.051527577079832555
},
{
"epoch": 0.3340213923813098,
"grad_norm": 3.421875,
"learning_rate": 2.749436936936937e-05,
"loss": 0.8257,
"mean_token_accuracy": 0.8324155032634735,
"step": 445,
"train/kl_loss_qwen": 0.0258051089476794,
"train/kl_loss_r1": 0.015088145853951573,
"train/total_kl": 0.04089325405657292
},
{
"epoch": 0.3377744417339088,
"grad_norm": 2.921875,
"learning_rate": 2.7466216216216217e-05,
"loss": 0.8653,
"mean_token_accuracy": 0.8344490349292755,
"step": 450,
"train/kl_loss_qwen": 0.04345053578726947,
"train/kl_loss_r1": 0.024011770728975534,
"train/total_kl": 0.06746230693534017
},
{
"epoch": 0.34152749108650776,
"grad_norm": 3.3125,
"learning_rate": 2.7438063063063066e-05,
"loss": 0.8571,
"mean_token_accuracy": 0.8373376429080963,
"step": 455,
"train/kl_loss_qwen": 0.03988681212067604,
"train/kl_loss_r1": 0.022834346117451786,
"train/total_kl": 0.06272115856409073
},
{
"epoch": 0.3452805404391068,
"grad_norm": 2.5,
"learning_rate": 2.7409909909909912e-05,
"loss": 0.8637,
"mean_token_accuracy": 0.8259221136569976,
"step": 460,
"train/kl_loss_qwen": 0.03982735755853355,
"train/kl_loss_r1": 0.020564141124486922,
"train/total_kl": 0.060391498263925314
},
{
"epoch": 0.34903358979170573,
"grad_norm": 2.890625,
"learning_rate": 2.7381756756756757e-05,
"loss": 0.8959,
"mean_token_accuracy": 0.8191772252321243,
"step": 465,
"train/kl_loss_qwen": 0.03617819314822555,
"train/kl_loss_r1": 0.020906389644369482,
"train/total_kl": 0.057084583304822446
},
{
"epoch": 0.35278663914430475,
"grad_norm": 3.203125,
"learning_rate": 2.7353603603603606e-05,
"loss": 0.8568,
"mean_token_accuracy": 0.8304102897644043,
"step": 470,
"train/kl_loss_qwen": 0.04182955021969974,
"train/kl_loss_r1": 0.020317962439730764,
"train/total_kl": 0.06214751219376922
},
{
"epoch": 0.35653968849690376,
"grad_norm": 2.828125,
"learning_rate": 2.7325450450450452e-05,
"loss": 0.8763,
"mean_token_accuracy": 0.8301267266273499,
"step": 475,
"train/kl_loss_qwen": 0.03945403727702797,
"train/kl_loss_r1": 0.022836983483284713,
"train/total_kl": 0.06229102117940784
},
{
"epoch": 0.3602927378495027,
"grad_norm": 2.953125,
"learning_rate": 2.7297297297297298e-05,
"loss": 0.8484,
"mean_token_accuracy": 0.8383503198623657,
"step": 480,
"train/kl_loss_qwen": 0.038632744224742055,
"train/kl_loss_r1": 0.019086693413555622,
"train/total_kl": 0.057719437219202516
},
{
"epoch": 0.36404578720210173,
"grad_norm": 2.640625,
"learning_rate": 2.7269144144144147e-05,
"loss": 0.8675,
"mean_token_accuracy": 0.8294745326042176,
"step": 485,
"train/kl_loss_qwen": 0.03857216462492943,
"train/kl_loss_r1": 0.020617604441940784,
"train/total_kl": 0.05918976916000247
},
{
"epoch": 0.3677988365547007,
"grad_norm": 2.625,
"learning_rate": 2.7240990990990992e-05,
"loss": 0.8863,
"mean_token_accuracy": 0.8222176939249038,
"step": 490,
"train/kl_loss_qwen": 0.034204355999827386,
"train/kl_loss_r1": 0.019204271771013737,
"train/total_kl": 0.05340862749144435
},
{
"epoch": 0.3715518859072997,
"grad_norm": 3.125,
"learning_rate": 2.7212837837837838e-05,
"loss": 0.8404,
"mean_token_accuracy": 0.8288236528635025,
"step": 495,
"train/kl_loss_qwen": 0.03576806071214378,
"train/kl_loss_r1": 0.02088703722693026,
"train/total_kl": 0.056655097752809525
},
{
"epoch": 0.37530493525989866,
"grad_norm": 2.515625,
"learning_rate": 2.7184684684684687e-05,
"loss": 0.8603,
"mean_token_accuracy": 0.8273730278015137,
"step": 500,
"train/kl_loss_qwen": 0.04495933828875422,
"train/kl_loss_r1": 0.02340303808450699,
"train/total_kl": 0.06836237693205476
},
{
"epoch": 0.3790579846124977,
"grad_norm": 2.90625,
"learning_rate": 2.7156531531531533e-05,
"loss": 0.8351,
"mean_token_accuracy": 0.8235865086317062,
"step": 505,
"train/kl_loss_qwen": 0.026128826756030323,
"train/kl_loss_r1": 0.016629086900502445,
"train/total_kl": 0.04275791347026825
},
{
"epoch": 0.38281103396509664,
"grad_norm": 3.1875,
"learning_rate": 2.7128378378378382e-05,
"loss": 0.8521,
"mean_token_accuracy": 0.8217630565166474,
"step": 510,
"train/kl_loss_qwen": 0.029674333380535246,
"train/kl_loss_r1": 0.016433697286993267,
"train/total_kl": 0.04610803062096238
},
{
"epoch": 0.38656408331769565,
"grad_norm": 2.796875,
"learning_rate": 2.7100225225225227e-05,
"loss": 0.88,
"mean_token_accuracy": 0.829921105504036,
"step": 515,
"train/kl_loss_qwen": 0.02549975486472249,
"train/kl_loss_r1": 0.017349076084792615,
"train/total_kl": 0.042848830856382844
},
{
"epoch": 0.3903171326702946,
"grad_norm": 2.78125,
"learning_rate": 2.7072072072072073e-05,
"loss": 0.8744,
"mean_token_accuracy": 0.823358204960823,
"step": 520,
"train/kl_loss_qwen": 0.04186864621005952,
"train/kl_loss_r1": 0.022606688272207975,
"train/total_kl": 0.06447533471509814
},
{
"epoch": 0.3940701820228936,
"grad_norm": 2.90625,
"learning_rate": 2.7043918918918922e-05,
"loss": 0.9341,
"mean_token_accuracy": 0.8311702489852906,
"step": 525,
"train/kl_loss_qwen": 0.04608453796245158,
"train/kl_loss_r1": 0.03976609790697694,
"train/total_kl": 0.08585063479840756
},
{
"epoch": 0.3978232313754926,
"grad_norm": 3.59375,
"learning_rate": 2.7015765765765768e-05,
"loss": 0.8834,
"mean_token_accuracy": 0.8259417653083801,
"step": 530,
"train/kl_loss_qwen": 0.03925313828513026,
"train/kl_loss_r1": 0.025636327592656015,
"train/total_kl": 0.06488946592435241
},
{
"epoch": 0.4015762807280916,
"grad_norm": 3.15625,
"learning_rate": 2.6987612612612613e-05,
"loss": 0.8555,
"mean_token_accuracy": 0.8354889839887619,
"step": 535,
"train/kl_loss_qwen": 0.029237260250374673,
"train/kl_loss_r1": 0.017392286285758018,
"train/total_kl": 0.04662954695522785
},
{
"epoch": 0.40532933008069055,
"grad_norm": 3.390625,
"learning_rate": 2.6959459459459462e-05,
"loss": 0.8966,
"mean_token_accuracy": 0.8290208607912064,
"step": 540,
"train/kl_loss_qwen": 0.03987643430009484,
"train/kl_loss_r1": 0.02204420636408031,
"train/total_kl": 0.06192064164206386
},
{
"epoch": 0.40908237943328957,
"grad_norm": 2.828125,
"learning_rate": 2.6931306306306308e-05,
"loss": 0.8607,
"mean_token_accuracy": 0.8293038636446,
"step": 545,
"train/kl_loss_qwen": 0.043356449948623775,
"train/kl_loss_r1": 0.02318003964610398,
"train/total_kl": 0.06653648959472776
},
{
"epoch": 0.4128354287858885,
"grad_norm": 3.5,
"learning_rate": 2.6903153153153154e-05,
"loss": 0.8883,
"mean_token_accuracy": 0.8272899180650711,
"step": 550,
"train/kl_loss_qwen": 0.03798080673441291,
"train/kl_loss_r1": 0.02549419435672462,
"train/total_kl": 0.06347499992698431
},
{
"epoch": 0.41658847813848754,
"grad_norm": 2.921875,
"learning_rate": 2.6875000000000003e-05,
"loss": 0.7814,
"mean_token_accuracy": 0.8324926406145096,
"step": 555,
"train/kl_loss_qwen": 0.03234069491736591,
"train/kl_loss_r1": 0.017109810281544922,
"train/total_kl": 0.049450505338609216
},
{
"epoch": 0.4203415274910865,
"grad_norm": 3.125,
"learning_rate": 2.684684684684685e-05,
"loss": 0.8864,
"mean_token_accuracy": 0.8263786643743515,
"step": 560,
"train/kl_loss_qwen": 0.04717784961685538,
"train/kl_loss_r1": 0.022931459918618204,
"train/total_kl": 0.07010931000113488
},
{
"epoch": 0.4240945768436855,
"grad_norm": 2.96875,
"learning_rate": 2.6818693693693694e-05,
"loss": 0.8604,
"mean_token_accuracy": 0.8222783863544464,
"step": 565,
"train/kl_loss_qwen": 0.024484040634706616,
"train/kl_loss_r1": 0.015275527024641633,
"train/total_kl": 0.03975956765934825
},
{
"epoch": 0.42784762619628447,
"grad_norm": 3.015625,
"learning_rate": 2.6790540540540543e-05,
"loss": 0.8469,
"mean_token_accuracy": 0.8336408853530883,
"step": 570,
"train/kl_loss_qwen": 0.033210785733535884,
"train/kl_loss_r1": 0.02305849390104413,
"train/total_kl": 0.056269279681146145
},
{
"epoch": 0.4316006755488835,
"grad_norm": 3.03125,
"learning_rate": 2.676238738738739e-05,
"loss": 0.8368,
"mean_token_accuracy": 0.8395666360855103,
"step": 575,
"train/kl_loss_qwen": 0.03861711327917874,
"train/kl_loss_r1": 0.021925621898844838,
"train/total_kl": 0.060542735550552604
},
{
"epoch": 0.43535372490148244,
"grad_norm": 4.21875,
"learning_rate": 2.6734234234234238e-05,
"loss": 0.9169,
"mean_token_accuracy": 0.8193831950426101,
"step": 580,
"train/kl_loss_qwen": 0.03615025961771608,
"train/kl_loss_r1": 0.020520770689472556,
"train/total_kl": 0.05667103016749024
},
{
"epoch": 0.43910677425408146,
"grad_norm": 3.390625,
"learning_rate": 2.6706081081081083e-05,
"loss": 0.8433,
"mean_token_accuracy": 0.8257136255502701,
"step": 585,
"train/kl_loss_qwen": 0.034600982908159494,
"train/kl_loss_r1": 0.01836161450482905,
"train/total_kl": 0.052962597087025644
},
{
"epoch": 0.4428598236066804,
"grad_norm": 4.46875,
"learning_rate": 2.667792792792793e-05,
"loss": 0.831,
"mean_token_accuracy": 0.8363171756267548,
"step": 590,
"train/kl_loss_qwen": 0.02988515649922192,
"train/kl_loss_r1": 0.017817869270220398,
"train/total_kl": 0.047703025955706836
},
{
"epoch": 0.4466128729592794,
"grad_norm": 3.125,
"learning_rate": 2.6649774774774778e-05,
"loss": 0.8749,
"mean_token_accuracy": 0.8290423005819321,
"step": 595,
"train/kl_loss_qwen": 0.028889529453590513,
"train/kl_loss_r1": 0.02102498891763389,
"train/total_kl": 0.04991451846435666
},
{
"epoch": 0.4503659223118784,
"grad_norm": 3.421875,
"learning_rate": 2.6621621621621624e-05,
"loss": 0.8993,
"mean_token_accuracy": 0.8241715729236603,
"step": 600,
"train/kl_loss_qwen": 0.04158163848333061,
"train/kl_loss_r1": 0.021697819139808415,
"train/total_kl": 0.06327945673838258
},
{
"epoch": 0.4541189716644774,
"grad_norm": 3.34375,
"learning_rate": 2.659346846846847e-05,
"loss": 0.8277,
"mean_token_accuracy": 0.8300861209630966,
"step": 605,
"train/kl_loss_qwen": 0.026456801500171424,
"train/kl_loss_r1": 0.01746466476470232,
"train/total_kl": 0.0439214657060802
},
{
"epoch": 0.45787202101707636,
"grad_norm": 2.703125,
"learning_rate": 2.656531531531532e-05,
"loss": 0.8603,
"mean_token_accuracy": 0.831222626566887,
"step": 610,
"train/kl_loss_qwen": 0.04137272802181542,
"train/kl_loss_r1": 0.020235793106257914,
"train/total_kl": 0.06160852164030075
},
{
"epoch": 0.46162507036967537,
"grad_norm": 3.359375,
"learning_rate": 2.6537162162162164e-05,
"loss": 0.8133,
"mean_token_accuracy": 0.8376553744077683,
"step": 615,
"train/kl_loss_qwen": 0.033105089655146004,
"train/kl_loss_r1": 0.020932874642312527,
"train/total_kl": 0.05403796397149563
},
{
"epoch": 0.46537811972227433,
"grad_norm": 2.671875,
"learning_rate": 2.650900900900901e-05,
"loss": 0.827,
"mean_token_accuracy": 0.8355785965919494,
"step": 620,
"train/kl_loss_qwen": 0.034664105530828236,
"train/kl_loss_r1": 0.01959628048352897,
"train/total_kl": 0.05426038540899754
},
{
"epoch": 0.46913116907487334,
"grad_norm": 2.90625,
"learning_rate": 2.648085585585586e-05,
"loss": 0.8264,
"mean_token_accuracy": 0.8406971305608749,
"step": 625,
"train/kl_loss_qwen": 0.03744598152115941,
"train/kl_loss_r1": 0.020712826820090412,
"train/total_kl": 0.05815880903974176
},
{
"epoch": 0.4728842184274723,
"grad_norm": 3.140625,
"learning_rate": 2.6452702702702704e-05,
"loss": 0.8981,
"mean_token_accuracy": 0.8248670309782028,
"step": 630,
"train/kl_loss_qwen": 0.04424663879908621,
"train/kl_loss_r1": 0.02367804222740233,
"train/total_kl": 0.06792468149214984
},
{
"epoch": 0.4766372677800713,
"grad_norm": 3.03125,
"learning_rate": 2.642454954954955e-05,
"loss": 0.8179,
"mean_token_accuracy": 0.8314776927232742,
"step": 635,
"train/kl_loss_qwen": 0.028519577998667955,
"train/kl_loss_r1": 0.015795104345306753,
"train/total_kl": 0.04431468164548278
},
{
"epoch": 0.4803903171326703,
"grad_norm": 2.578125,
"learning_rate": 2.63963963963964e-05,
"loss": 0.8084,
"mean_token_accuracy": 0.8305885761976242,
"step": 640,
"train/kl_loss_qwen": 0.03188405260443687,
"train/kl_loss_r1": 0.019454342126846314,
"train/total_kl": 0.0513383949175477
},
{
"epoch": 0.4841433664852693,
"grad_norm": 2.6875,
"learning_rate": 2.6368243243243245e-05,
"loss": 0.8135,
"mean_token_accuracy": 0.8340533554553986,
"step": 645,
"train/kl_loss_qwen": 0.032302316091954705,
"train/kl_loss_r1": 0.017988856183364987,
"train/total_kl": 0.05029117204248905
},
{
"epoch": 0.48789641583786825,
"grad_norm": 2.84375,
"learning_rate": 2.6340090090090094e-05,
"loss": 0.8128,
"mean_token_accuracy": 0.8344713598489761,
"step": 650,
"train/kl_loss_qwen": 0.03608106402680278,
"train/kl_loss_r1": 0.020161894662305713,
"train/total_kl": 0.056242958083748816
},
{
"epoch": 0.49164946519046726,
"grad_norm": 3.5,
"learning_rate": 2.631193693693694e-05,
"loss": 0.8303,
"mean_token_accuracy": 0.8302734345197678,
"step": 655,
"train/kl_loss_qwen": 0.0397234917152673,
"train/kl_loss_r1": 0.019664824660867452,
"train/total_kl": 0.059388316422700885
},
{
"epoch": 0.4954025145430662,
"grad_norm": 2.375,
"learning_rate": 2.6283783783783785e-05,
"loss": 0.8792,
"mean_token_accuracy": 0.8349238276481629,
"step": 660,
"train/kl_loss_qwen": 0.04533764449879527,
"train/kl_loss_r1": 0.023747803224250675,
"train/total_kl": 0.06908544823527336
},
{
"epoch": 0.49915556389566523,
"grad_norm": 2.5625,
"learning_rate": 2.6255630630630634e-05,
"loss": 0.8507,
"mean_token_accuracy": 0.8313362389802933,
"step": 665,
"train/kl_loss_qwen": 0.03387423628009856,
"train/kl_loss_r1": 0.01939927397761494,
"train/total_kl": 0.053273510001599786
},
{
"epoch": 0.5029086132482642,
"grad_norm": 2.984375,
"learning_rate": 2.622747747747748e-05,
"loss": 0.812,
"mean_token_accuracy": 0.8389832735061645,
"step": 670,
"train/kl_loss_qwen": 0.039962123753502964,
"train/kl_loss_r1": 0.02203605165705085,
"train/total_kl": 0.0619981755502522
},
{
"epoch": 0.5066616626008632,
"grad_norm": 2.625,
"learning_rate": 2.6199324324324325e-05,
"loss": 0.8327,
"mean_token_accuracy": 0.828178471326828,
"step": 675,
"train/kl_loss_qwen": 0.030491138668730856,
"train/kl_loss_r1": 0.0178588742390275,
"train/total_kl": 0.048350013047456744
},
{
"epoch": 0.5104147119534622,
"grad_norm": 3.0625,
"learning_rate": 2.6171171171171174e-05,
"loss": 0.8645,
"mean_token_accuracy": 0.8310636579990387,
"step": 680,
"train/kl_loss_qwen": 0.040654600923880936,
"train/kl_loss_r1": 0.02228041235357523,
"train/total_kl": 0.06293501388281583
},
{
"epoch": 0.5141677613060611,
"grad_norm": 2.875,
"learning_rate": 2.614301801801802e-05,
"loss": 0.842,
"mean_token_accuracy": 0.8304677546024323,
"step": 685,
"train/kl_loss_qwen": 0.03915594620630145,
"train/kl_loss_r1": 0.019675446720793844,
"train/total_kl": 0.05883139288052917
},
{
"epoch": 0.5179208106586601,
"grad_norm": 2.546875,
"learning_rate": 2.6114864864864866e-05,
"loss": 0.8264,
"mean_token_accuracy": 0.8229408442974091,
"step": 690,
"train/kl_loss_qwen": 0.032891119550913575,
"train/kl_loss_r1": 0.01707150642760098,
"train/total_kl": 0.04996262574568391
},
{
"epoch": 0.5216738600112591,
"grad_norm": 3.25,
"learning_rate": 2.6086711711711715e-05,
"loss": 0.8669,
"mean_token_accuracy": 0.8281047195196152,
"step": 695,
"train/kl_loss_qwen": 0.03547921110875905,
"train/kl_loss_r1": 0.02080541094765067,
"train/total_kl": 0.05628462266176939
},
{
"epoch": 0.5254269093638582,
"grad_norm": 3.46875,
"learning_rate": 2.605855855855856e-05,
"loss": 0.8636,
"mean_token_accuracy": 0.8235750675201416,
"step": 700,
"train/kl_loss_qwen": 0.03132840511389077,
"train/kl_loss_r1": 0.01750999097712338,
"train/total_kl": 0.04883839599788189
},
{
"epoch": 0.5291799587164571,
"grad_norm": 2.671875,
"learning_rate": 2.6030405405405406e-05,
"loss": 0.8581,
"mean_token_accuracy": 0.8307362526655198,
"step": 705,
"train/kl_loss_qwen": 0.03873220053501427,
"train/kl_loss_r1": 0.02116750692948699,
"train/total_kl": 0.059899707604199645
},
{
"epoch": 0.5329330080690561,
"grad_norm": 2.875,
"learning_rate": 2.6002252252252255e-05,
"loss": 0.8222,
"mean_token_accuracy": 0.8313774734735488,
"step": 710,
"train/kl_loss_qwen": 0.031245797453448177,
"train/kl_loss_r1": 0.020813510101288558,
"train/total_kl": 0.05205930741503835
},
{
"epoch": 0.5366860574216551,
"grad_norm": 3.265625,
"learning_rate": 2.59740990990991e-05,
"loss": 0.8942,
"mean_token_accuracy": 0.8268726974725723,
"step": 715,
"train/kl_loss_qwen": 0.047184772603213784,
"train/kl_loss_r1": 0.025426519196480514,
"train/total_kl": 0.0726112917996943
},
{
"epoch": 0.5404391067742541,
"grad_norm": 2.84375,
"learning_rate": 2.594594594594595e-05,
"loss": 0.8544,
"mean_token_accuracy": 0.8252176523208619,
"step": 720,
"train/kl_loss_qwen": 0.02930951355956495,
"train/kl_loss_r1": 0.017893961817026138,
"train/total_kl": 0.04720347533002496
},
{
"epoch": 0.5441921561268531,
"grad_norm": 3.328125,
"learning_rate": 2.5917792792792795e-05,
"loss": 0.8226,
"mean_token_accuracy": 0.8322675555944443,
"step": 725,
"train/kl_loss_qwen": 0.028172259964048863,
"train/kl_loss_r1": 0.016258031735196708,
"train/total_kl": 0.044430291093885896
},
{
"epoch": 0.547945205479452,
"grad_norm": 3.515625,
"learning_rate": 2.588963963963964e-05,
"loss": 0.8439,
"mean_token_accuracy": 0.8234845697879791,
"step": 730,
"train/kl_loss_qwen": 0.03387451712042093,
"train/kl_loss_r1": 0.01895874026231468,
"train/total_kl": 0.052833257243037224
},
{
"epoch": 0.551698254832051,
"grad_norm": 2.34375,
"learning_rate": 2.586148648648649e-05,
"loss": 0.8306,
"mean_token_accuracy": 0.8320945203304291,
"step": 735,
"train/kl_loss_qwen": 0.038065289705991746,
"train/kl_loss_r1": 0.02160985255613923,
"train/total_kl": 0.059675142634660006
},
{
"epoch": 0.55545130418465,
"grad_norm": 2.796875,
"learning_rate": 2.5833333333333336e-05,
"loss": 0.818,
"mean_token_accuracy": 0.8301131039857864,
"step": 740,
"train/kl_loss_qwen": 0.03414399088360369,
"train/kl_loss_r1": 0.018777534132823348,
"train/total_kl": 0.052921525482088325
},
{
"epoch": 0.5592043535372491,
"grad_norm": 3.078125,
"learning_rate": 2.580518018018018e-05,
"loss": 0.8565,
"mean_token_accuracy": 0.8275852560997009,
"step": 745,
"train/kl_loss_qwen": 0.03220190773718059,
"train/kl_loss_r1": 0.01762353884987533,
"train/total_kl": 0.04982544640079141
},
{
"epoch": 0.562957402889848,
"grad_norm": 2.484375,
"learning_rate": 2.577702702702703e-05,
"loss": 0.8718,
"mean_token_accuracy": 0.8311895519495011,
"step": 750,
"train/kl_loss_qwen": 0.03311848752200604,
"train/kl_loss_r1": 0.019135183561593293,
"train/total_kl": 0.0522536713629961
},
{
"epoch": 0.566710452242447,
"grad_norm": 2.5625,
"learning_rate": 2.5748873873873876e-05,
"loss": 0.8634,
"mean_token_accuracy": 0.830333125591278,
"step": 755,
"train/kl_loss_qwen": 0.04198941690847278,
"train/kl_loss_r1": 0.021147539000958206,
"train/total_kl": 0.06313695563003421
},
{
"epoch": 0.570463501595046,
"grad_norm": 2.734375,
"learning_rate": 2.572072072072072e-05,
"loss": 0.84,
"mean_token_accuracy": 0.834811520576477,
"step": 760,
"train/kl_loss_qwen": 0.02746470207348466,
"train/kl_loss_r1": 0.019080733275040986,
"train/total_kl": 0.04654543492943049
},
{
"epoch": 0.574216550947645,
"grad_norm": 2.890625,
"learning_rate": 2.569256756756757e-05,
"loss": 0.8367,
"mean_token_accuracy": 0.8293649315834045,
"step": 765,
"train/kl_loss_qwen": 0.01999104334972799,
"train/kl_loss_r1": 0.014198838081210852,
"train/total_kl": 0.03418988138437271
},
{
"epoch": 0.5779696003002439,
"grad_norm": 2.8125,
"learning_rate": 2.5664414414414416e-05,
"loss": 0.8411,
"mean_token_accuracy": 0.8336279571056366,
"step": 770,
"train/kl_loss_qwen": 0.039404576364904645,
"train/kl_loss_r1": 0.021028988901525734,
"train/total_kl": 0.06043356563895941
},
{
"epoch": 0.5817226496528429,
"grad_norm": 2.890625,
"learning_rate": 2.5636261261261262e-05,
"loss": 0.8445,
"mean_token_accuracy": 0.835637891292572,
"step": 775,
"train/kl_loss_qwen": 0.036282278271391986,
"train/kl_loss_r1": 0.02238774998113513,
"train/total_kl": 0.05867002848535776
},
{
"epoch": 0.5854756990054419,
"grad_norm": 8.0625,
"learning_rate": 2.560810810810811e-05,
"loss": 0.9509,
"mean_token_accuracy": 0.8231443852186203,
"step": 780,
"train/kl_loss_qwen": 0.04694451265968382,
"train/kl_loss_r1": 0.03180371643975377,
"train/total_kl": 0.07874822989106178
},
{
"epoch": 0.589228748358041,
"grad_norm": 3.453125,
"learning_rate": 2.5579954954954957e-05,
"loss": 0.8481,
"mean_token_accuracy": 0.8317405015230179,
"step": 785,
"train/kl_loss_qwen": 0.029904183652251958,
"train/kl_loss_r1": 0.019615561049431563,
"train/total_kl": 0.04951974479481578
},
{
"epoch": 0.5929817977106399,
"grad_norm": 2.859375,
"learning_rate": 2.5551801801801806e-05,
"loss": 0.8042,
"mean_token_accuracy": 0.8370792746543885,
"step": 790,
"train/kl_loss_qwen": 0.028761968202888965,
"train/kl_loss_r1": 0.017533178441226482,
"train/total_kl": 0.0462951467372477
},
{
"epoch": 0.5967348470632389,
"grad_norm": 3.78125,
"learning_rate": 2.552364864864865e-05,
"loss": 0.8447,
"mean_token_accuracy": 0.8354480415582657,
"step": 795,
"train/kl_loss_qwen": 0.03184347827918828,
"train/kl_loss_r1": 0.018696364481002092,
"train/total_kl": 0.050539842899888755
},
{
"epoch": 0.6004878964158379,
"grad_norm": 2.453125,
"learning_rate": 2.5495495495495497e-05,
"loss": 0.8344,
"mean_token_accuracy": 0.8341012299060822,
"step": 800,
"train/kl_loss_qwen": 0.04001581417396664,
"train/kl_loss_r1": 0.02106495094485581,
"train/total_kl": 0.06108076488599181
},
{
"epoch": 0.6042409457684369,
"grad_norm": 2.65625,
"learning_rate": 2.5467342342342346e-05,
"loss": 0.8045,
"mean_token_accuracy": 0.8411924570798874,
"step": 805,
"train/kl_loss_qwen": 0.03035055147483945,
"train/kl_loss_r1": 0.01776686739176512,
"train/total_kl": 0.04811741886660457
},
{
"epoch": 0.6079939951210358,
"grad_norm": 2.796875,
"learning_rate": 2.543918918918919e-05,
"loss": 0.8645,
"mean_token_accuracy": 0.8307548046112061,
"step": 810,
"train/kl_loss_qwen": 0.04272727402858436,
"train/kl_loss_r1": 0.024424682604148984,
"train/total_kl": 0.06715195653960108
},
{
"epoch": 0.6117470444736348,
"grad_norm": 2.65625,
"learning_rate": 2.5411036036036037e-05,
"loss": 0.8425,
"mean_token_accuracy": 0.8313584119081497,
"step": 815,
"train/kl_loss_qwen": 0.0339477127417922,
"train/kl_loss_r1": 0.020929417014122008,
"train/total_kl": 0.0548771295696497
},
{
"epoch": 0.6155000938262338,
"grad_norm": 2.953125,
"learning_rate": 2.5382882882882886e-05,
"loss": 0.8112,
"mean_token_accuracy": 0.8362564355134964,
"step": 820,
"train/kl_loss_qwen": 0.03412885209545493,
"train/kl_loss_r1": 0.016538083972409367,
"train/total_kl": 0.0506669357419014
},
{
"epoch": 0.6192531431788328,
"grad_norm": 3.109375,
"learning_rate": 2.5354729729729732e-05,
"loss": 0.849,
"mean_token_accuracy": 0.8359062880277633,
"step": 825,
"train/kl_loss_qwen": 0.04249853491783142,
"train/kl_loss_r1": 0.02333756978623569,
"train/total_kl": 0.06583610456436872
},
{
"epoch": 0.6230061925314317,
"grad_norm": 3.359375,
"learning_rate": 2.5326576576576578e-05,
"loss": 0.8351,
"mean_token_accuracy": 0.825828817486763,
"step": 830,
"train/kl_loss_qwen": 0.034189414512366054,
"train/kl_loss_r1": 0.02052266038954258,
"train/total_kl": 0.05471207490190864
},
{
"epoch": 0.6267592418840308,
"grad_norm": 2.984375,
"learning_rate": 2.5298423423423423e-05,
"loss": 0.8356,
"mean_token_accuracy": 0.8265765368938446,
"step": 835,
"train/kl_loss_qwen": 0.03163366257213056,
"train/kl_loss_r1": 0.016908307839185,
"train/total_kl": 0.04854197036474943
},
{
"epoch": 0.6305122912366298,
"grad_norm": 3.15625,
"learning_rate": 2.527027027027027e-05,
"loss": 0.8725,
"mean_token_accuracy": 0.8330867946147918,
"step": 840,
"train/kl_loss_qwen": 0.04397285329177976,
"train/kl_loss_r1": 0.023652500985190273,
"train/total_kl": 0.06762535478919744
},
{
"epoch": 0.6342653405892288,
"grad_norm": 3.046875,
"learning_rate": 2.5242117117117114e-05,
"loss": 0.8632,
"mean_token_accuracy": 0.832156303524971,
"step": 845,
"train/kl_loss_qwen": 0.03385147815570235,
"train/kl_loss_r1": 0.020532624423503877,
"train/total_kl": 0.054384103137999774
},
{
"epoch": 0.6380183899418277,
"grad_norm": 2.796875,
"learning_rate": 2.5213963963963963e-05,
"loss": 0.7873,
"mean_token_accuracy": 0.8407374769449234,
"step": 850,
"train/kl_loss_qwen": 0.03273296277038753,
"train/kl_loss_r1": 0.020149347372353077,
"train/total_kl": 0.05288231000304222
},
{
"epoch": 0.6417714392944267,
"grad_norm": 3.0625,
"learning_rate": 2.518581081081081e-05,
"loss": 0.8522,
"mean_token_accuracy": 0.8305691838264465,
"step": 855,
"train/kl_loss_qwen": 0.03824136960320175,
"train/kl_loss_r1": 0.021116166748106478,
"train/total_kl": 0.05935753621160984
},
{
"epoch": 0.6455244886470257,
"grad_norm": 2.625,
"learning_rate": 2.5157657657657658e-05,
"loss": 0.8392,
"mean_token_accuracy": 0.8265466034412384,
"step": 860,
"train/kl_loss_qwen": 0.030321336397901178,
"train/kl_loss_r1": 0.01701959897764027,
"train/total_kl": 0.047340935561805964
},
{
"epoch": 0.6492775379996247,
"grad_norm": 2.75,
"learning_rate": 2.5129504504504504e-05,
"loss": 0.8606,
"mean_token_accuracy": 0.83104607462883,
"step": 865,
"train/kl_loss_qwen": 0.046971744811162355,
"train/kl_loss_r1": 0.023864060686901212,
"train/total_kl": 0.07083580642938614
},
{
"epoch": 0.6530305873522236,
"grad_norm": 2.671875,
"learning_rate": 2.510135135135135e-05,
"loss": 0.8566,
"mean_token_accuracy": 0.8245219022035599,
"step": 870,
"train/kl_loss_qwen": 0.031761659309268,
"train/kl_loss_r1": 0.017597190476953982,
"train/total_kl": 0.04935885015875101
},
{
"epoch": 0.6567836367048226,
"grad_norm": 2.796875,
"learning_rate": 2.50731981981982e-05,
"loss": 0.8165,
"mean_token_accuracy": 0.8388794183731079,
"step": 875,
"train/kl_loss_qwen": 0.03677996243350208,
"train/kl_loss_r1": 0.02143030664883554,
"train/total_kl": 0.058210269268602136
},
{
"epoch": 0.6605366860574217,
"grad_norm": 2.9375,
"learning_rate": 2.5045045045045044e-05,
"loss": 0.8612,
"mean_token_accuracy": 0.8207795172929764,
"step": 880,
"train/kl_loss_qwen": 0.02968251397833228,
"train/kl_loss_r1": 0.018946969090029596,
"train/total_kl": 0.04862948274239898
},
{
"epoch": 0.6642897354100207,
"grad_norm": 2.46875,
"learning_rate": 2.501689189189189e-05,
"loss": 0.8129,
"mean_token_accuracy": 0.8363301217556,
"step": 885,
"train/kl_loss_qwen": 0.034025853127241136,
"train/kl_loss_r1": 0.020324263628572224,
"train/total_kl": 0.05435011638328433
},
{
"epoch": 0.6680427847626196,
"grad_norm": 2.421875,
"learning_rate": 2.498873873873874e-05,
"loss": 0.8294,
"mean_token_accuracy": 0.8286441206932068,
"step": 890,
"train/kl_loss_qwen": 0.0408441049978137,
"train/kl_loss_r1": 0.020420510414987804,
"train/total_kl": 0.06126461513340473
},
{
"epoch": 0.6717958341152186,
"grad_norm": 2.9375,
"learning_rate": 2.4960585585585584e-05,
"loss": 0.859,
"mean_token_accuracy": 0.8298782587051392,
"step": 895,
"train/kl_loss_qwen": 0.0418569162953645,
"train/kl_loss_r1": 0.022290918650105594,
"train/total_kl": 0.06414783513173461
},
{
"epoch": 0.6755488834678176,
"grad_norm": 2.5,
"learning_rate": 2.493243243243243e-05,
"loss": 0.8358,
"mean_token_accuracy": 0.8332624316215516,
"step": 900,
"train/kl_loss_qwen": 0.03841094318777323,
"train/kl_loss_r1": 0.01995689212344587,
"train/total_kl": 0.05836783479899168
},
{
"epoch": 0.6793019328204166,
"grad_norm": 2.921875,
"learning_rate": 2.490427927927928e-05,
"loss": 0.8765,
"mean_token_accuracy": 0.8321707814931869,
"step": 905,
"train/kl_loss_qwen": 0.042780818743631245,
"train/kl_loss_r1": 0.0235706131439656,
"train/total_kl": 0.0663514317944646
},
{
"epoch": 0.6830549821730155,
"grad_norm": 3.265625,
"learning_rate": 2.4876126126126125e-05,
"loss": 0.8608,
"mean_token_accuracy": 0.8260697066783905,
"step": 910,
"train/kl_loss_qwen": 0.035260281944647434,
"train/kl_loss_r1": 0.02195748295634985,
"train/total_kl": 0.057217765040695666
},
{
"epoch": 0.6868080315256145,
"grad_norm": 2.28125,
"learning_rate": 2.4847972972972974e-05,
"loss": 0.8564,
"mean_token_accuracy": 0.8374003231525421,
"step": 915,
"train/kl_loss_qwen": 0.04203944210894406,
"train/kl_loss_r1": 0.021511876583099367,
"train/total_kl": 0.06355131939053535
},
{
"epoch": 0.6905610808782136,
"grad_norm": 2.671875,
"learning_rate": 2.481981981981982e-05,
"loss": 0.8458,
"mean_token_accuracy": 0.8365840703248978,
"step": 920,
"train/kl_loss_qwen": 0.033759749541059134,
"train/kl_loss_r1": 0.0183026185259223,
"train/total_kl": 0.05206236876547336
},
{
"epoch": 0.6943141302308126,
"grad_norm": 2.921875,
"learning_rate": 2.4791666666666665e-05,
"loss": 0.8577,
"mean_token_accuracy": 0.8311419934034348,
"step": 925,
"train/kl_loss_qwen": 0.03777771787717939,
"train/kl_loss_r1": 0.022124431701377033,
"train/total_kl": 0.05990214953199029
},
{
"epoch": 0.6980671795834115,
"grad_norm": 2.90625,
"learning_rate": 2.4763513513513514e-05,
"loss": 0.838,
"mean_token_accuracy": 0.8319983184337616,
"step": 930,
"train/kl_loss_qwen": 0.037792898062616584,
"train/kl_loss_r1": 0.019103457499295474,
"train/total_kl": 0.05689635518938303
},
{
"epoch": 0.7018202289360105,
"grad_norm": 2.46875,
"learning_rate": 2.473536036036036e-05,
"loss": 0.8416,
"mean_token_accuracy": 0.8315385311841965,
"step": 935,
"train/kl_loss_qwen": 0.03756746407598257,
"train/kl_loss_r1": 0.020071876328438522,
"train/total_kl": 0.05763934040442109
},
{
"epoch": 0.7055732782886095,
"grad_norm": 2.796875,
"learning_rate": 2.4707207207207205e-05,
"loss": 0.8105,
"mean_token_accuracy": 0.831657874584198,
"step": 940,
"train/kl_loss_qwen": 0.03483249330893159,
"train/kl_loss_r1": 0.019865864235907794,
"train/total_kl": 0.05469835819676518
},
{
"epoch": 0.7093263276412085,
"grad_norm": 2.359375,
"learning_rate": 2.4679054054054054e-05,
"loss": 0.8679,
"mean_token_accuracy": 0.8223243087530137,
"step": 945,
"train/kl_loss_qwen": 0.030808620806783437,
"train/kl_loss_r1": 0.01705012475140393,
"train/total_kl": 0.04785874532535672
},
{
"epoch": 0.7130793769938075,
"grad_norm": 2.890625,
"learning_rate": 2.46509009009009e-05,
"loss": 0.844,
"mean_token_accuracy": 0.8352172911167145,
"step": 950,
"train/kl_loss_qwen": 0.03471320560202003,
"train/kl_loss_r1": 0.020137345883995295,
"train/total_kl": 0.05485055195167661
},
{
"epoch": 0.7168324263464064,
"grad_norm": 3.546875,
"learning_rate": 2.4622747747747746e-05,
"loss": 0.8499,
"mean_token_accuracy": 0.8335436582565308,
"step": 955,
"train/kl_loss_qwen": 0.02975294659845531,
"train/kl_loss_r1": 0.019273100467398763,
"train/total_kl": 0.04902604753151536
},
{
"epoch": 0.7205854756990054,
"grad_norm": 2.46875,
"learning_rate": 2.4594594594594595e-05,
"loss": 0.8223,
"mean_token_accuracy": 0.8394654095172882,
"step": 960,
"train/kl_loss_qwen": 0.03072880543768406,
"train/kl_loss_r1": 0.016514184465631843,
"train/total_kl": 0.047242989577353
},
{
"epoch": 0.7243385250516045,
"grad_norm": 3.625,
"learning_rate": 2.456644144144144e-05,
"loss": 0.8504,
"mean_token_accuracy": 0.8266110628843307,
"step": 965,
"train/kl_loss_qwen": 0.03343938612379134,
"train/kl_loss_r1": 0.01883910335600376,
"train/total_kl": 0.05227848952636123
},
{
"epoch": 0.7280915744042035,
"grad_norm": 3.328125,
"learning_rate": 2.4538288288288286e-05,
"loss": 0.8445,
"mean_token_accuracy": 0.8287754565477371,
"step": 970,
"train/kl_loss_qwen": 0.025892229238525032,
"train/kl_loss_r1": 0.015870556328445674,
"train/total_kl": 0.041762785613536836
},
{
"epoch": 0.7318446237568024,
"grad_norm": 2.8125,
"learning_rate": 2.4510135135135135e-05,
"loss": 0.8087,
"mean_token_accuracy": 0.8377816379070282,
"step": 975,
"train/kl_loss_qwen": 0.03318580673076212,
"train/kl_loss_r1": 0.01917458134703338,
"train/total_kl": 0.052360388170927766
},
{
"epoch": 0.7355976731094014,
"grad_norm": 3.453125,
"learning_rate": 2.448198198198198e-05,
"loss": 0.8186,
"mean_token_accuracy": 0.8333919525146485,
"step": 980,
"train/kl_loss_qwen": 0.029704937431961297,
"train/kl_loss_r1": 0.018210208415985106,
"train/total_kl": 0.04791514603421092
},
{
"epoch": 0.7393507224620004,
"grad_norm": 2.984375,
"learning_rate": 2.445382882882883e-05,
"loss": 0.8441,
"mean_token_accuracy": 0.8327240943908691,
"step": 985,
"train/kl_loss_qwen": 0.030404440499842166,
"train/kl_loss_r1": 0.01756331170909107,
"train/total_kl": 0.047967752907425165
},
{
"epoch": 0.7431037718145994,
"grad_norm": 3.25,
"learning_rate": 2.4425675675675675e-05,
"loss": 0.8662,
"mean_token_accuracy": 0.8255359560251236,
"step": 990,
"train/kl_loss_qwen": 0.03720358600839972,
"train/kl_loss_r1": 0.019459961261600257,
"train/total_kl": 0.056663547083735465
},
{
"epoch": 0.7468568211671983,
"grad_norm": 3.234375,
"learning_rate": 2.439752252252252e-05,
"loss": 0.8429,
"mean_token_accuracy": 0.8323214411735534,
"step": 995,
"train/kl_loss_qwen": 0.022656460804864765,
"train/kl_loss_r1": 0.01588835148140788,
"train/total_kl": 0.038544812332838775
},
{
"epoch": 0.7506098705197973,
"grad_norm": 3.0,
"learning_rate": 2.436936936936937e-05,
"loss": 0.8559,
"mean_token_accuracy": 0.8274749606847763,
"step": 1000,
"train/kl_loss_qwen": 0.03031270541250706,
"train/kl_loss_r1": 0.019612214388325812,
"train/total_kl": 0.04992491947486997
},
{
"epoch": 0.7543629198723963,
"grad_norm": 2.875,
"learning_rate": 2.4341216216216216e-05,
"loss": 0.8627,
"mean_token_accuracy": 0.8257625371217727,
"step": 1005,
"train/kl_loss_qwen": 0.030585462925955653,
"train/kl_loss_r1": 0.018655626522377133,
"train/total_kl": 0.04924108954146504
},
{
"epoch": 0.7581159692249954,
"grad_norm": 3.421875,
"learning_rate": 2.431306306306306e-05,
"loss": 0.8738,
"mean_token_accuracy": 0.8295246571302414,
"step": 1010,
"train/kl_loss_qwen": 0.03918474782258272,
"train/kl_loss_r1": 0.02318054302595556,
"train/total_kl": 0.062365290429443124
},
{
"epoch": 0.7618690185775943,
"grad_norm": 2.609375,
"learning_rate": 2.428490990990991e-05,
"loss": 0.8584,
"mean_token_accuracy": 0.8317355692386628,
"step": 1015,
"train/kl_loss_qwen": 0.04374503931030631,
"train/kl_loss_r1": 0.02465776102617383,
"train/total_kl": 0.0684028010815382
},
{
"epoch": 0.7656220679301933,
"grad_norm": 3.09375,
"learning_rate": 2.4256756756756756e-05,
"loss": 0.8392,
"mean_token_accuracy": 0.8248521685600281,
"step": 1020,
"train/kl_loss_qwen": 0.036725143622606995,
"train/kl_loss_r1": 0.019347941782325507,
"train/total_kl": 0.05607308465987444
},
{
"epoch": 0.7693751172827923,
"grad_norm": 2.859375,
"learning_rate": 2.42286036036036e-05,
"loss": 0.8539,
"mean_token_accuracy": 0.8296713292598724,
"step": 1025,
"train/kl_loss_qwen": 0.04443691144697368,
"train/kl_loss_r1": 0.02307268031872809,
"train/total_kl": 0.06750959167256951
},
{
"epoch": 0.7731281666353913,
"grad_norm": 3.3125,
"learning_rate": 2.420045045045045e-05,
"loss": 0.871,
"mean_token_accuracy": 0.8165527641773224,
"step": 1030,
"train/kl_loss_qwen": 0.03339883806183934,
"train/kl_loss_r1": 0.019999321456998585,
"train/total_kl": 0.05339815989136696
},
{
"epoch": 0.7768812159879902,
"grad_norm": 2.453125,
"learning_rate": 2.4172297297297296e-05,
"loss": 0.8847,
"mean_token_accuracy": 0.8283389657735825,
"step": 1035,
"train/kl_loss_qwen": 0.04716655816882849,
"train/kl_loss_r1": 0.029009951883926986,
"train/total_kl": 0.0761765105649829
},
{
"epoch": 0.7806342653405892,
"grad_norm": 2.90625,
"learning_rate": 2.4144144144144142e-05,
"loss": 0.8694,
"mean_token_accuracy": 0.8296161741018295,
"step": 1040,
"train/kl_loss_qwen": 0.03973756255581975,
"train/kl_loss_r1": 0.024160212790593504,
"train/total_kl": 0.06389777567237616
},
{
"epoch": 0.7843873146931882,
"grad_norm": 2.921875,
"learning_rate": 2.411599099099099e-05,
"loss": 0.8216,
"mean_token_accuracy": 0.8333493113517761,
"step": 1045,
"train/kl_loss_qwen": 0.03772520553320646,
"train/kl_loss_r1": 0.02065104469656944,
"train/total_kl": 0.058376249857246876
},
{
"epoch": 0.7881403640457872,
"grad_norm": 2.453125,
"learning_rate": 2.4087837837837837e-05,
"loss": 0.8294,
"mean_token_accuracy": 0.8262384831905365,
"step": 1050,
"train/kl_loss_qwen": 0.02664393503218889,
"train/kl_loss_r1": 0.015917970752343535,
"train/total_kl": 0.042561905831098555
},
{
"epoch": 0.7918934133983861,
"grad_norm": 3.296875,
"learning_rate": 2.4059684684684686e-05,
"loss": 0.8482,
"mean_token_accuracy": 0.8259186387062073,
"step": 1055,
"train/kl_loss_qwen": 0.03414301257580519,
"train/kl_loss_r1": 0.017920766165480016,
"train/total_kl": 0.05206377934664488
},
{
"epoch": 0.7956464627509852,
"grad_norm": 2.671875,
"learning_rate": 2.403153153153153e-05,
"loss": 0.8289,
"mean_token_accuracy": 0.838726419210434,
"step": 1060,
"train/kl_loss_qwen": 0.03791197570972145,
"train/kl_loss_r1": 0.021482381178066133,
"train/total_kl": 0.05939435651525855
},
{
"epoch": 0.7993995121035842,
"grad_norm": 3.171875,
"learning_rate": 2.4003378378378377e-05,
"loss": 0.8884,
"mean_token_accuracy": 0.8271274447441102,
"step": 1065,
"train/kl_loss_qwen": 0.03056891239248216,
"train/kl_loss_r1": 0.01911116614937782,
"train/total_kl": 0.04968007821589708
},
{
"epoch": 0.8031525614561832,
"grad_norm": 2.921875,
"learning_rate": 2.3975225225225226e-05,
"loss": 0.8351,
"mean_token_accuracy": 0.8275138199329376,
"step": 1070,
"train/kl_loss_qwen": 0.035620299214497206,
"train/kl_loss_r1": 0.021603919705376028,
"train/total_kl": 0.05722421947866678
},
{
"epoch": 0.8069056108087821,
"grad_norm": 3.03125,
"learning_rate": 2.394707207207207e-05,
"loss": 0.8298,
"mean_token_accuracy": 0.8347616285085678,
"step": 1075,
"train/kl_loss_qwen": 0.031926875654608014,
"train/kl_loss_r1": 0.016605067253112792,
"train/total_kl": 0.04853194262832403
},
{
"epoch": 0.8106586601613811,
"grad_norm": 2.359375,
"learning_rate": 2.3918918918918917e-05,
"loss": 0.8397,
"mean_token_accuracy": 0.8279544532299041,
"step": 1080,
"train/kl_loss_qwen": 0.04034261181950569,
"train/kl_loss_r1": 0.02037807977758348,
"train/total_kl": 0.060720691550523044
},
{
"epoch": 0.8144117095139801,
"grad_norm": 2.3125,
"learning_rate": 2.3890765765765766e-05,
"loss": 0.8468,
"mean_token_accuracy": 0.8316547304391861,
"step": 1085,
"train/kl_loss_qwen": 0.03774885032325983,
"train/kl_loss_r1": 0.02168757957406342,
"train/total_kl": 0.05943643022328615
},
{
"epoch": 0.8181647588665791,
"grad_norm": 2.703125,
"learning_rate": 2.3862612612612612e-05,
"loss": 0.8521,
"mean_token_accuracy": 0.8355390518903733,
"step": 1090,
"train/kl_loss_qwen": 0.04074263079091907,
"train/kl_loss_r1": 0.026646536123007537,
"train/total_kl": 0.06738916672766208
},
{
"epoch": 0.821917808219178,
"grad_norm": 2.515625,
"learning_rate": 2.3834459459459458e-05,
"loss": 0.8081,
"mean_token_accuracy": 0.8374006003141403,
"step": 1095,
"train/kl_loss_qwen": 0.039536877814680335,
"train/kl_loss_r1": 0.020507675549015402,
"train/total_kl": 0.06004455294460058
},
{
"epoch": 0.825670857571777,
"grad_norm": 2.75,
"learning_rate": 2.3806306306306307e-05,
"loss": 0.8105,
"mean_token_accuracy": 0.8264969110488891,
"step": 1100,
"train/kl_loss_qwen": 0.02953154994174838,
"train/kl_loss_r1": 0.01727639720775187,
"train/total_kl": 0.04680794747546315
},
{
"epoch": 0.8294239069243761,
"grad_norm": 2.65625,
"learning_rate": 2.3778153153153152e-05,
"loss": 0.8292,
"mean_token_accuracy": 0.8362700045108795,
"step": 1105,
"train/kl_loss_qwen": 0.03479915303178131,
"train/kl_loss_r1": 0.019686942035332323,
"train/total_kl": 0.05448609506711364
},
{
"epoch": 0.8331769562769751,
"grad_norm": 2.328125,
"learning_rate": 2.3749999999999998e-05,
"loss": 0.837,
"mean_token_accuracy": 0.8312906265258789,
"step": 1110,
"train/kl_loss_qwen": 0.03711622627452016,
"train/kl_loss_r1": 0.018471188424155117,
"train/total_kl": 0.05558741446584463
},
{
"epoch": 0.836930005629574,
"grad_norm": 3.078125,
"learning_rate": 2.3721846846846847e-05,
"loss": 0.8358,
"mean_token_accuracy": 0.8428857564926148,
"step": 1115,
"train/kl_loss_qwen": 0.03528237966820598,
"train/kl_loss_r1": 0.022303265007212757,
"train/total_kl": 0.057585643604397774
},
{
"epoch": 0.840683054982173,
"grad_norm": 2.59375,
"learning_rate": 2.3693693693693693e-05,
"loss": 0.8258,
"mean_token_accuracy": 0.8349006563425064,
"step": 1120,
"train/kl_loss_qwen": 0.029668423300608992,
"train/kl_loss_r1": 0.01802798630669713,
"train/total_kl": 0.04769640956073999
},
{
"epoch": 0.844436104334772,
"grad_norm": 2.546875,
"learning_rate": 2.366554054054054e-05,
"loss": 0.7961,
"mean_token_accuracy": 0.8291519403457641,
"step": 1125,
"train/kl_loss_qwen": 0.027171618398278953,
"train/kl_loss_r1": 0.015590772125869989,
"train/total_kl": 0.042762390524148944
},
{
"epoch": 0.848189153687371,
"grad_norm": 3.0,
"learning_rate": 2.3637387387387387e-05,
"loss": 0.852,
"mean_token_accuracy": 0.830912035703659,
"step": 1130,
"train/kl_loss_qwen": 0.04168254970572889,
"train/kl_loss_r1": 0.0218337316531688,
"train/total_kl": 0.0635162808932364
},
{
"epoch": 0.8519422030399699,
"grad_norm": 2.75,
"learning_rate": 2.3609234234234233e-05,
"loss": 0.834,
"mean_token_accuracy": 0.8422968804836273,
"step": 1135,
"train/kl_loss_qwen": 0.042828111443668604,
"train/kl_loss_r1": 0.02287350078113377,
"train/total_kl": 0.06570161217823625
},
{
"epoch": 0.8556952523925689,
"grad_norm": 2.390625,
"learning_rate": 2.3581081081081082e-05,
"loss": 0.8122,
"mean_token_accuracy": 0.8383320599794388,
"step": 1140,
"train/kl_loss_qwen": 0.03400104306638241,
"train/kl_loss_r1": 0.01821983396075666,
"train/total_kl": 0.052220877725631
},
{
"epoch": 0.859448301745168,
"grad_norm": 3.125,
"learning_rate": 2.3552927927927928e-05,
"loss": 0.8689,
"mean_token_accuracy": 0.8325030654668808,
"step": 1145,
"train/kl_loss_qwen": 0.03720735446549952,
"train/kl_loss_r1": 0.02309025633148849,
"train/total_kl": 0.06029761079698801
},
{
"epoch": 0.863201351097767,
"grad_norm": 2.75,
"learning_rate": 2.3524774774774773e-05,
"loss": 0.8117,
"mean_token_accuracy": 0.8363292634487152,
"step": 1150,
"train/kl_loss_qwen": 0.027145140524953603,
"train/kl_loss_r1": 0.0179155798163265,
"train/total_kl": 0.045060720574110744
},
{
"epoch": 0.8669544004503659,
"grad_norm": 2.484375,
"learning_rate": 2.3496621621621622e-05,
"loss": 0.8169,
"mean_token_accuracy": 0.82942895591259,
"step": 1155,
"train/kl_loss_qwen": 0.035767897684127095,
"train/kl_loss_r1": 0.018540003104135394,
"train/total_kl": 0.05430790157988667
},
{
"epoch": 0.8707074498029649,
"grad_norm": 3.28125,
"learning_rate": 2.3468468468468468e-05,
"loss": 0.8544,
"mean_token_accuracy": 0.8344474166631699,
"step": 1160,
"train/kl_loss_qwen": 0.02330155437812209,
"train/kl_loss_r1": 0.01555751208215952,
"train/total_kl": 0.03885906646028161
},
{
"epoch": 0.8744604991555639,
"grad_norm": 2.96875,
"learning_rate": 2.3440315315315314e-05,
"loss": 0.8497,
"mean_token_accuracy": 0.8371790736913681,
"step": 1165,
"train/kl_loss_qwen": 0.0372356269042939,
"train/kl_loss_r1": 0.021653581224381924,
"train/total_kl": 0.05888920854777098
},
{
"epoch": 0.8782135485081629,
"grad_norm": 2.875,
"learning_rate": 2.3412162162162163e-05,
"loss": 0.8466,
"mean_token_accuracy": 0.8342229664325714,
"step": 1170,
"train/kl_loss_qwen": 0.03358095684088767,
"train/kl_loss_r1": 0.020644054701551794,
"train/total_kl": 0.05422501126304269
},
{
"epoch": 0.8819665978607618,
"grad_norm": 2.828125,
"learning_rate": 2.3384009009009008e-05,
"loss": 0.8188,
"mean_token_accuracy": 0.8325002133846283,
"step": 1175,
"train/kl_loss_qwen": 0.03786291694268584,
"train/kl_loss_r1": 0.02114827521145344,
"train/total_kl": 0.059011191688477994
},
{
"epoch": 0.8857196472133608,
"grad_norm": 4.125,
"learning_rate": 2.3355855855855854e-05,
"loss": 0.8304,
"mean_token_accuracy": 0.841512930393219,
"step": 1180,
"train/kl_loss_qwen": 0.0327130098361522,
"train/kl_loss_r1": 0.02275611348450184,
"train/total_kl": 0.055469123367220166
},
{
"epoch": 0.8894726965659598,
"grad_norm": 2.96875,
"learning_rate": 2.3327702702702703e-05,
"loss": 0.8149,
"mean_token_accuracy": 0.8311474174261093,
"step": 1185,
"train/kl_loss_qwen": 0.03829748397693038,
"train/kl_loss_r1": 0.019338054629042745,
"train/total_kl": 0.057635538000613454
},
{
"epoch": 0.8932257459185589,
"grad_norm": 2.78125,
"learning_rate": 2.329954954954955e-05,
"loss": 0.8207,
"mean_token_accuracy": 0.8371186286211014,
"step": 1190,
"train/kl_loss_qwen": 0.028101760940626264,
"train/kl_loss_r1": 0.018852828070521355,
"train/total_kl": 0.04695458877831697
},
{
"epoch": 0.8969787952711579,
"grad_norm": 3.15625,
"learning_rate": 2.3271396396396398e-05,
"loss": 0.8371,
"mean_token_accuracy": 0.8242538809776306,
"step": 1195,
"train/kl_loss_qwen": 0.029373879032209515,
"train/kl_loss_r1": 0.01833240082487464,
"train/total_kl": 0.047706279531121255
},
{
"epoch": 0.9007318446237568,
"grad_norm": 2.9375,
"learning_rate": 2.3243243243243243e-05,
"loss": 0.8312,
"mean_token_accuracy": 0.8366263926029205,
"step": 1200,
"train/kl_loss_qwen": 0.03641695664264262,
"train/kl_loss_r1": 0.02135463636368513,
"train/total_kl": 0.0577715927734971
},
{
"epoch": 0.9044848939763558,
"grad_norm": 2.5625,
"learning_rate": 2.321509009009009e-05,
"loss": 0.8032,
"mean_token_accuracy": 0.8358108222484588,
"step": 1205,
"train/kl_loss_qwen": 0.0320419798605144,
"train/kl_loss_r1": 0.01758174179121852,
"train/total_kl": 0.04962372137233615
},
{
"epoch": 0.9082379433289548,
"grad_norm": 3.59375,
"learning_rate": 2.3186936936936938e-05,
"loss": 0.7973,
"mean_token_accuracy": 0.8385109961032867,
"step": 1210,
"train/kl_loss_qwen": 0.03202076843008399,
"train/kl_loss_r1": 0.01798680922947824,
"train/total_kl": 0.050007577519863844
},
{
"epoch": 0.9119909926815538,
"grad_norm": 2.578125,
"learning_rate": 2.3158783783783784e-05,
"loss": 0.8757,
"mean_token_accuracy": 0.8319016844034195,
"step": 1215,
"train/kl_loss_qwen": 0.04137561381794512,
"train/kl_loss_r1": 0.023255357798188925,
"train/total_kl": 0.06463097166270018
},
{
"epoch": 0.9157440420341527,
"grad_norm": 2.828125,
"learning_rate": 2.313063063063063e-05,
"loss": 0.8132,
"mean_token_accuracy": 0.8328036278486252,
"step": 1220,
"train/kl_loss_qwen": 0.031224201945587993,
"train/kl_loss_r1": 0.017740114778280257,
"train/total_kl": 0.048964316584169866
},
{
"epoch": 0.9194970913867517,
"grad_norm": 2.875,
"learning_rate": 2.3102477477477478e-05,
"loss": 0.8452,
"mean_token_accuracy": 0.8222734242677688,
"step": 1225,
"train/kl_loss_qwen": 0.03589702369645238,
"train/kl_loss_r1": 0.020375803485512732,
"train/total_kl": 0.056272826995700596
},
{
"epoch": 0.9232501407393507,
"grad_norm": 2.65625,
"learning_rate": 2.3074324324324324e-05,
"loss": 0.7888,
"mean_token_accuracy": 0.8423387587070466,
"step": 1230,
"train/kl_loss_qwen": 0.03705872604623437,
"train/kl_loss_r1": 0.019338483829051255,
"train/total_kl": 0.056397209968417884
},
{
"epoch": 0.9270031900919498,
"grad_norm": 3.3125,
"learning_rate": 2.304617117117117e-05,
"loss": 0.8411,
"mean_token_accuracy": 0.8356304496526719,
"step": 1235,
"train/kl_loss_qwen": 0.03986716889776289,
"train/kl_loss_r1": 0.02119326703250408,
"train/total_kl": 0.06106043700128794
},
{
"epoch": 0.9307562394445487,
"grad_norm": 3.046875,
"learning_rate": 2.301801801801802e-05,
"loss": 0.8016,
"mean_token_accuracy": 0.8259847193956376,
"step": 1240,
"train/kl_loss_qwen": 0.027377781691029668,
"train/kl_loss_r1": 0.01647510756738484,
"train/total_kl": 0.04385288907214999
},
{
"epoch": 0.9345092887971477,
"grad_norm": 2.8125,
"learning_rate": 2.2989864864864864e-05,
"loss": 0.8702,
"mean_token_accuracy": 0.8325085520744324,
"step": 1245,
"train/kl_loss_qwen": 0.05099722160957754,
"train/kl_loss_r1": 0.02356436108238995,
"train/total_kl": 0.07456158371642232
},
{
"epoch": 0.9382623381497467,
"grad_norm": 3.25,
"learning_rate": 2.296171171171171e-05,
"loss": 0.8179,
"mean_token_accuracy": 0.8388288825750351,
"step": 1250,
"train/kl_loss_qwen": 0.03349912976846099,
"train/kl_loss_r1": 0.01905625034123659,
"train/total_kl": 0.052555380016565324
},
{
"epoch": 0.9420153875023457,
"grad_norm": 3.21875,
"learning_rate": 2.293355855855856e-05,
"loss": 0.8161,
"mean_token_accuracy": 0.8253986924886704,
"step": 1255,
"train/kl_loss_qwen": 0.024113674974069,
"train/kl_loss_r1": 0.013607281818985939,
"train/total_kl": 0.03772095674648881
},
{
"epoch": 0.9457684368549446,
"grad_norm": 2.703125,
"learning_rate": 2.2905405405405404e-05,
"loss": 0.8313,
"mean_token_accuracy": 0.8335436224937439,
"step": 1260,
"train/kl_loss_qwen": 0.03843146739527583,
"train/kl_loss_r1": 0.02215869203209877,
"train/total_kl": 0.060590160079300404
},
{
"epoch": 0.9495214862075436,
"grad_norm": 2.828125,
"learning_rate": 2.2877252252252254e-05,
"loss": 0.8403,
"mean_token_accuracy": 0.8326504826545715,
"step": 1265,
"train/kl_loss_qwen": 0.03150986786931753,
"train/kl_loss_r1": 0.01924733123742044,
"train/total_kl": 0.05075719943270087
},
{
"epoch": 0.9532745355601426,
"grad_norm": 2.921875,
"learning_rate": 2.28490990990991e-05,
"loss": 0.8271,
"mean_token_accuracy": 0.8375171661376953,
"step": 1270,
"train/kl_loss_qwen": 0.030000514769926667,
"train/kl_loss_r1": 0.018503088131546976,
"train/total_kl": 0.048503602668642995
},
{
"epoch": 0.9570275849127416,
"grad_norm": 3.0625,
"learning_rate": 2.2820945945945945e-05,
"loss": 0.8126,
"mean_token_accuracy": 0.8422433704137802,
"step": 1275,
"train/kl_loss_qwen": 0.03523530634120107,
"train/kl_loss_r1": 0.02015956537798047,
"train/total_kl": 0.0553948718123138
},
{
"epoch": 0.9607806342653405,
"grad_norm": 3.0,
"learning_rate": 2.2792792792792794e-05,
"loss": 0.8471,
"mean_token_accuracy": 0.8248061776161194,
"step": 1280,
"train/kl_loss_qwen": 0.03546197758987546,
"train/kl_loss_r1": 0.02050988646224141,
"train/total_kl": 0.05597186395898461
},
{
"epoch": 0.9645336836179396,
"grad_norm": 2.453125,
"learning_rate": 2.276463963963964e-05,
"loss": 0.8506,
"mean_token_accuracy": 0.830131858587265,
"step": 1285,
"train/kl_loss_qwen": 0.03869068971835077,
"train/kl_loss_r1": 0.021196600608527662,
"train/total_kl": 0.05988728990778327
},
{
"epoch": 0.9682867329705386,
"grad_norm": 2.796875,
"learning_rate": 2.2736486486486485e-05,
"loss": 0.8122,
"mean_token_accuracy": 0.8425075203180313,
"step": 1290,
"train/kl_loss_qwen": 0.03583333105780184,
"train/kl_loss_r1": 0.019750054739415646,
"train/total_kl": 0.055583386402577165
},
{
"epoch": 0.9720397823231376,
"grad_norm": 2.40625,
"learning_rate": 2.2708333333333334e-05,
"loss": 0.8526,
"mean_token_accuracy": 0.8319555759429932,
"step": 1295,
"train/kl_loss_qwen": 0.03495143475010991,
"train/kl_loss_r1": 0.019579170271754265,
"train/total_kl": 0.05453060502186417
},
{
"epoch": 0.9757928316757365,
"grad_norm": 2.5,
"learning_rate": 2.268018018018018e-05,
"loss": 0.83,
"mean_token_accuracy": 0.8411010265350342,
"step": 1300,
"train/kl_loss_qwen": 0.029418424377217887,
"train/kl_loss_r1": 0.017907896358519793,
"train/total_kl": 0.047326320223510264
},
{
"epoch": 0.9795458810283355,
"grad_norm": 3.046875,
"learning_rate": 2.2652027027027025e-05,
"loss": 0.8317,
"mean_token_accuracy": 0.8266431212425231,
"step": 1305,
"train/kl_loss_qwen": 0.03617473733611405,
"train/kl_loss_r1": 0.0198312777094543,
"train/total_kl": 0.056006014347076416
},
{
"epoch": 0.9832989303809345,
"grad_norm": 2.734375,
"learning_rate": 2.2623873873873874e-05,
"loss": 0.8109,
"mean_token_accuracy": 0.8358199536800385,
"step": 1310,
"train/kl_loss_qwen": 0.03416325659491122,
"train/kl_loss_r1": 0.018369485950097443,
"train/total_kl": 0.05253274226561189
},
{
"epoch": 0.9870519797335335,
"grad_norm": 3.09375,
"learning_rate": 2.259572072072072e-05,
"loss": 0.8502,
"mean_token_accuracy": 0.8319712281227112,
"step": 1315,
"train/kl_loss_qwen": 0.03371428037062287,
"train/kl_loss_r1": 0.019540566531941295,
"train/total_kl": 0.0532548469491303
},
{
"epoch": 0.9908050290861324,
"grad_norm": 2.953125,
"learning_rate": 2.2567567567567566e-05,
"loss": 0.826,
"mean_token_accuracy": 0.8343572169542313,
"step": 1320,
"train/kl_loss_qwen": 0.034188579255715015,
"train/kl_loss_r1": 0.019030718505382536,
"train/total_kl": 0.05321929762139917
},
{
"epoch": 0.9945580784387315,
"grad_norm": 3.46875,
"learning_rate": 2.2539414414414415e-05,
"loss": 0.8328,
"mean_token_accuracy": 0.831291139125824,
"step": 1325,
"train/kl_loss_qwen": 0.024976221797987818,
"train/kl_loss_r1": 0.015955081582069396,
"train/total_kl": 0.04093130342662334
},
{
"epoch": 0.9983111277913305,
"grad_norm": 2.890625,
"learning_rate": 2.251126126126126e-05,
"loss": 0.8427,
"mean_token_accuracy": 0.8302747309207916,
"step": 1330,
"train/kl_loss_qwen": 0.03359804740175605,
"train/kl_loss_r1": 0.02121321321465075,
"train/total_kl": 0.05481126047670841
},
{
"epoch": 1.0015012197410396,
"grad_norm": 2.703125,
"learning_rate": 2.248310810810811e-05,
"loss": 0.7675,
"mean_token_accuracy": 0.8538059802616343,
"step": 1335,
"train/kl_loss_qwen": 0.0453791821594624,
"train/kl_loss_r1": 0.02448737363824073,
"train/total_kl": 0.06986655568813577
},
{
"epoch": 1.0052542690936386,
"grad_norm": 2.71875,
"learning_rate": 2.2454954954954955e-05,
"loss": 0.6612,
"mean_token_accuracy": 0.8875813186168671,
"step": 1340,
"train/kl_loss_qwen": 0.02925686431117356,
"train/kl_loss_r1": 0.019410110637545587,
"train/total_kl": 0.04866697527468204
},
{
"epoch": 1.0090073184462376,
"grad_norm": 2.375,
"learning_rate": 2.24268018018018e-05,
"loss": 0.6622,
"mean_token_accuracy": 0.8967875897884369,
"step": 1345,
"train/kl_loss_qwen": 0.04325410588644445,
"train/kl_loss_r1": 0.0244607200846076,
"train/total_kl": 0.0677148257382214
},
{
"epoch": 1.0127603677988366,
"grad_norm": 2.640625,
"learning_rate": 2.239864864864865e-05,
"loss": 0.6685,
"mean_token_accuracy": 0.8972615629434586,
"step": 1350,
"train/kl_loss_qwen": 0.041626747231930494,
"train/kl_loss_r1": 0.025661862408742308,
"train/total_kl": 0.06728860987350345
},
{
"epoch": 1.0165134171514356,
"grad_norm": 2.53125,
"learning_rate": 2.2370495495495495e-05,
"loss": 0.6689,
"mean_token_accuracy": 0.8906102359294892,
"step": 1355,
"train/kl_loss_qwen": 0.030312799476087095,
"train/kl_loss_r1": 0.020159751269966365,
"train/total_kl": 0.0504725506529212
},
{
"epoch": 1.0202664665040346,
"grad_norm": 2.890625,
"learning_rate": 2.234234234234234e-05,
"loss": 0.6708,
"mean_token_accuracy": 0.8942165911197663,
"step": 1360,
"train/kl_loss_qwen": 0.034392226580530406,
"train/kl_loss_r1": 0.023348680092021824,
"train/total_kl": 0.0577409066259861
},
{
"epoch": 1.0240195158566334,
"grad_norm": 2.703125,
"learning_rate": 2.231418918918919e-05,
"loss": 0.7386,
"mean_token_accuracy": 0.8926682651042939,
"step": 1365,
"train/kl_loss_qwen": 0.0506584744900465,
"train/kl_loss_r1": 0.02938733692280948,
"train/total_kl": 0.08004581211134791
},
{
"epoch": 1.0277725652092324,
"grad_norm": 2.1875,
"learning_rate": 2.2286036036036036e-05,
"loss": 0.6889,
"mean_token_accuracy": 0.8908026158809662,
"step": 1370,
"train/kl_loss_qwen": 0.03609044030308724,
"train/kl_loss_r1": 0.0206457391846925,
"train/total_kl": 0.056736179534345864
},
{
"epoch": 1.0315256145618314,
"grad_norm": 2.546875,
"learning_rate": 2.225788288288288e-05,
"loss": 0.6504,
"mean_token_accuracy": 0.897967740893364,
"step": 1375,
"train/kl_loss_qwen": 0.038501370791345836,
"train/kl_loss_r1": 0.022604670422151685,
"train/total_kl": 0.06110604116693139
},
{
"epoch": 1.0352786639144305,
"grad_norm": 2.171875,
"learning_rate": 2.222972972972973e-05,
"loss": 0.6676,
"mean_token_accuracy": 0.8930170625448227,
"step": 1380,
"train/kl_loss_qwen": 0.03824372082017362,
"train/kl_loss_r1": 0.022439042571932077,
"train/total_kl": 0.0606827630661428
},
{
"epoch": 1.0390317132670295,
"grad_norm": 2.625,
"learning_rate": 2.2201576576576576e-05,
"loss": 0.68,
"mean_token_accuracy": 0.8910626381635666,
"step": 1385,
"train/kl_loss_qwen": 0.0364824044983834,
"train/kl_loss_r1": 0.021984179178252815,
"train/total_kl": 0.058466583304107186
},
{
"epoch": 1.0427847626196285,
"grad_norm": 2.625,
"learning_rate": 2.2173423423423425e-05,
"loss": 0.6406,
"mean_token_accuracy": 0.9029591172933579,
"step": 1390,
"train/kl_loss_qwen": 0.040588710876181724,
"train/kl_loss_r1": 0.02504544616676867,
"train/total_kl": 0.06563415694981814
},
{
"epoch": 1.0465378119722275,
"grad_norm": 2.5,
"learning_rate": 2.214527027027027e-05,
"loss": 0.5936,
"mean_token_accuracy": 0.9015870213508606,
"step": 1395,
"train/kl_loss_qwen": 0.03233385533094406,
"train/kl_loss_r1": 0.01939639528281987,
"train/total_kl": 0.0517302505671978
},
{
"epoch": 1.0502908613248265,
"grad_norm": 2.4375,
"learning_rate": 2.2117117117117116e-05,
"loss": 0.6685,
"mean_token_accuracy": 0.8904843509197236,
"step": 1400,
"train/kl_loss_qwen": 0.03684836062602699,
"train/kl_loss_r1": 0.022537825303152202,
"train/total_kl": 0.059386185463517906
},
{
"epoch": 1.0540439106774253,
"grad_norm": 2.859375,
"learning_rate": 2.2088963963963965e-05,
"loss": 0.6683,
"mean_token_accuracy": 0.8937689036130905,
"step": 1405,
"train/kl_loss_qwen": 0.03806398524902761,
"train/kl_loss_r1": 0.022129832254722714,
"train/total_kl": 0.06019381750375032
},
{
"epoch": 1.0577969600300243,
"grad_norm": 2.890625,
"learning_rate": 2.206081081081081e-05,
"loss": 0.6935,
"mean_token_accuracy": 0.8934850037097931,
"step": 1410,
"train/kl_loss_qwen": 0.04057308458723128,
"train/kl_loss_r1": 0.026647206209599972,
"train/total_kl": 0.06722028991207481
},
{
"epoch": 1.0615500093826233,
"grad_norm": 3.40625,
"learning_rate": 2.2032657657657657e-05,
"loss": 0.7189,
"mean_token_accuracy": 0.8990837901830673,
"step": 1415,
"train/kl_loss_qwen": 0.0509747623000294,
"train/kl_loss_r1": 0.028807251481339335,
"train/total_kl": 0.07978201508522034
},
{
"epoch": 1.0653030587352224,
"grad_norm": 3.203125,
"learning_rate": 2.2004504504504506e-05,
"loss": 0.6548,
"mean_token_accuracy": 0.8912235021591186,
"step": 1420,
"train/kl_loss_qwen": 0.03229280970990658,
"train/kl_loss_r1": 0.020080786664038897,
"train/total_kl": 0.05237359646707773
},
{
"epoch": 1.0690561080878214,
"grad_norm": 2.0,
"learning_rate": 2.197635135135135e-05,
"loss": 0.6596,
"mean_token_accuracy": 0.8960457772016526,
"step": 1425,
"train/kl_loss_qwen": 0.0408114202786237,
"train/kl_loss_r1": 0.022259290888905527,
"train/total_kl": 0.06307071102783084
},
{
"epoch": 1.0728091574404204,
"grad_norm": 2.734375,
"learning_rate": 2.1948198198198197e-05,
"loss": 0.6918,
"mean_token_accuracy": 0.8915483593940735,
"step": 1430,
"train/kl_loss_qwen": 0.04138145474717021,
"train/kl_loss_r1": 0.02470776312984526,
"train/total_kl": 0.06608921755105257
},
{
"epoch": 1.0765622067930194,
"grad_norm": 2.546875,
"learning_rate": 2.1920045045045046e-05,
"loss": 0.6872,
"mean_token_accuracy": 0.8949816524982452,
"step": 1435,
"train/kl_loss_qwen": 0.04295819364488125,
"train/kl_loss_r1": 0.02569909901358187,
"train/total_kl": 0.06865729233250022
},
{
"epoch": 1.0803152561456184,
"grad_norm": 2.84375,
"learning_rate": 2.1891891891891892e-05,
"loss": 0.7196,
"mean_token_accuracy": 0.8875626802444458,
"step": 1440,
"train/kl_loss_qwen": 0.04375511151738465,
"train/kl_loss_r1": 0.025596009753644466,
"train/total_kl": 0.06935112103819847
},
{
"epoch": 1.0840683054982172,
"grad_norm": 2.484375,
"learning_rate": 2.1863738738738737e-05,
"loss": 0.6622,
"mean_token_accuracy": 0.893270394206047,
"step": 1445,
"train/kl_loss_qwen": 0.03457060917280615,
"train/kl_loss_r1": 0.020614350261166692,
"train/total_kl": 0.055184959154576066
},
{
"epoch": 1.0878213548508162,
"grad_norm": 2.421875,
"learning_rate": 2.1835585585585586e-05,
"loss": 0.604,
"mean_token_accuracy": 0.9012135595083237,
"step": 1450,
"train/kl_loss_qwen": 0.03251136806793511,
"train/kl_loss_r1": 0.019424339337274433,
"train/total_kl": 0.051935707405209544
},
{
"epoch": 1.0915744042034152,
"grad_norm": 2.3125,
"learning_rate": 2.1807432432432432e-05,
"loss": 0.7123,
"mean_token_accuracy": 0.8986908882856369,
"step": 1455,
"train/kl_loss_qwen": 0.05085464362055063,
"train/kl_loss_r1": 0.028513824706897138,
"train/total_kl": 0.07936846744269133
},
{
"epoch": 1.0953274535560142,
"grad_norm": 2.328125,
"learning_rate": 2.177927927927928e-05,
"loss": 0.6291,
"mean_token_accuracy": 0.8938940465450287,
"step": 1460,
"train/kl_loss_qwen": 0.0365486825350672,
"train/kl_loss_r1": 0.020992783037945627,
"train/total_kl": 0.057541465666145084
},
{
"epoch": 1.0990805029086133,
"grad_norm": 2.234375,
"learning_rate": 2.1751126126126127e-05,
"loss": 0.6376,
"mean_token_accuracy": 0.8969442307949066,
"step": 1465,
"train/kl_loss_qwen": 0.03290966739878058,
"train/kl_loss_r1": 0.020104941399767994,
"train/total_kl": 0.053014608845114705
},
{
"epoch": 1.1028335522612123,
"grad_norm": 2.453125,
"learning_rate": 2.1722972972972972e-05,
"loss": 0.6432,
"mean_token_accuracy": 0.894056448340416,
"step": 1470,
"train/kl_loss_qwen": 0.03260161904618144,
"train/kl_loss_r1": 0.02036406025290489,
"train/total_kl": 0.052965679205954075
},
{
"epoch": 1.1065866016138113,
"grad_norm": 1.9765625,
"learning_rate": 2.169481981981982e-05,
"loss": 0.7049,
"mean_token_accuracy": 0.8975407749414444,
"step": 1475,
"train/kl_loss_qwen": 0.050286664813756946,
"train/kl_loss_r1": 0.02728750566020608,
"train/total_kl": 0.07757417084649205
},
{
"epoch": 1.1103396509664103,
"grad_norm": 2.71875,
"learning_rate": 2.1666666666666667e-05,
"loss": 0.6315,
"mean_token_accuracy": 0.9003421634435653,
"step": 1480,
"train/kl_loss_qwen": 0.03332536895759404,
"train/kl_loss_r1": 0.02332189753651619,
"train/total_kl": 0.05664726672694087
},
{
"epoch": 1.1140927003190093,
"grad_norm": 2.09375,
"learning_rate": 2.1638513513513513e-05,
"loss": 0.6516,
"mean_token_accuracy": 0.9011515021324158,
"step": 1485,
"train/kl_loss_qwen": 0.03897336809895933,
"train/kl_loss_r1": 0.021944570681080224,
"train/total_kl": 0.060917938873171804
},
{
"epoch": 1.117845749671608,
"grad_norm": 2.640625,
"learning_rate": 2.1610360360360362e-05,
"loss": 0.6724,
"mean_token_accuracy": 0.8921928942203522,
"step": 1490,
"train/kl_loss_qwen": 0.0333264619577676,
"train/kl_loss_r1": 0.02036203513853252,
"train/total_kl": 0.053688496444374324
},
{
"epoch": 1.1215987990242071,
"grad_norm": 2.6875,
"learning_rate": 2.1582207207207207e-05,
"loss": 0.6588,
"mean_token_accuracy": 0.8953865617513657,
"step": 1495,
"train/kl_loss_qwen": 0.03588013225235045,
"train/kl_loss_r1": 0.020809399196878076,
"train/total_kl": 0.0566895317286253
},
{
"epoch": 1.1253518483768061,
"grad_norm": 2.40625,
"learning_rate": 2.1554054054054053e-05,
"loss": 0.6007,
"mean_token_accuracy": 0.9045622408390045,
"step": 1500,
"train/kl_loss_qwen": 0.03217562069185078,
"train/kl_loss_r1": 0.019330057594925166,
"train/total_kl": 0.05150567796081305
},
{
"epoch": 1.1291048977294051,
"grad_norm": 2.28125,
"learning_rate": 2.1525900900900902e-05,
"loss": 0.6219,
"mean_token_accuracy": 0.9022328287363053,
"step": 1505,
"train/kl_loss_qwen": 0.03696062350645661,
"train/kl_loss_r1": 0.02114432412199676,
"train/total_kl": 0.05810494795441627
},
{
"epoch": 1.1328579470820042,
"grad_norm": 2.3125,
"learning_rate": 2.1497747747747748e-05,
"loss": 0.6643,
"mean_token_accuracy": 0.8981336444616318,
"step": 1510,
"train/kl_loss_qwen": 0.04067998202517629,
"train/kl_loss_r1": 0.024339890154078603,
"train/total_kl": 0.06501987269148231
},
{
"epoch": 1.1366109964346032,
"grad_norm": 2.59375,
"learning_rate": 2.1469594594594593e-05,
"loss": 0.6253,
"mean_token_accuracy": 0.9077253580093384,
"step": 1515,
"train/kl_loss_qwen": 0.03719198950566351,
"train/kl_loss_r1": 0.02381544355303049,
"train/total_kl": 0.0610074333846569
},
{
"epoch": 1.1403640457872022,
"grad_norm": 2.59375,
"learning_rate": 2.1441441441441442e-05,
"loss": 0.7558,
"mean_token_accuracy": 0.9028765827417373,
"step": 1520,
"train/kl_loss_qwen": 0.055122953513637184,
"train/kl_loss_r1": 0.03659365689381957,
"train/total_kl": 0.09171660989522934
},
{
"epoch": 1.144117095139801,
"grad_norm": 2.046875,
"learning_rate": 2.1413288288288288e-05,
"loss": 0.6401,
"mean_token_accuracy": 0.8968337863683701,
"step": 1525,
"train/kl_loss_qwen": 0.03610984361730516,
"train/kl_loss_r1": 0.020405574096366765,
"train/total_kl": 0.05651541752740741
},
{
"epoch": 1.1478701444924,
"grad_norm": 2.65625,
"learning_rate": 2.1385135135135137e-05,
"loss": 0.6556,
"mean_token_accuracy": 0.8919296562671661,
"step": 1530,
"train/kl_loss_qwen": 0.0327754978556186,
"train/kl_loss_r1": 0.021019916282966733,
"train/total_kl": 0.05379541488364339
},
{
"epoch": 1.151623193844999,
"grad_norm": 3.140625,
"learning_rate": 2.1356981981981983e-05,
"loss": 0.6184,
"mean_token_accuracy": 0.8987061321735382,
"step": 1535,
"train/kl_loss_qwen": 0.028856372553855182,
"train/kl_loss_r1": 0.020303833484649658,
"train/total_kl": 0.04916020501405001
},
{
"epoch": 1.155376243197598,
"grad_norm": 2.5,
"learning_rate": 2.1328828828828828e-05,
"loss": 0.6152,
"mean_token_accuracy": 0.8988528192043305,
"step": 1540,
"train/kl_loss_qwen": 0.03804198480211198,
"train/kl_loss_r1": 0.021859840862452982,
"train/total_kl": 0.05990182533860207
},
{
"epoch": 1.159129292550197,
"grad_norm": 2.5,
"learning_rate": 2.1300675675675677e-05,
"loss": 0.6899,
"mean_token_accuracy": 0.9004143476486206,
"step": 1545,
"train/kl_loss_qwen": 0.05160218593664467,
"train/kl_loss_r1": 0.02747901389375329,
"train/total_kl": 0.07908119913190603
},
{
"epoch": 1.162882341902796,
"grad_norm": 2.890625,
"learning_rate": 2.1272522522522523e-05,
"loss": 0.664,
"mean_token_accuracy": 0.8997497946023941,
"step": 1550,
"train/kl_loss_qwen": 0.03771160962060094,
"train/kl_loss_r1": 0.02381550595164299,
"train/total_kl": 0.061527115292847157
},
{
"epoch": 1.166635391255395,
"grad_norm": 2.109375,
"learning_rate": 2.124436936936937e-05,
"loss": 0.6885,
"mean_token_accuracy": 0.8912563741207122,
"step": 1555,
"train/kl_loss_qwen": 0.04218352562747896,
"train/kl_loss_r1": 0.023105837916955353,
"train/total_kl": 0.06528936326503754
},
{
"epoch": 1.170388440607994,
"grad_norm": 2.6875,
"learning_rate": 2.1216216216216218e-05,
"loss": 0.6618,
"mean_token_accuracy": 0.8870168477296829,
"step": 1560,
"train/kl_loss_qwen": 0.03366015064530074,
"train/kl_loss_r1": 0.02038904307410121,
"train/total_kl": 0.054049193672835824
},
{
"epoch": 1.174141489960593,
"grad_norm": 1.953125,
"learning_rate": 2.1188063063063063e-05,
"loss": 0.6476,
"mean_token_accuracy": 0.8984944999217988,
"step": 1565,
"train/kl_loss_qwen": 0.04087866884656251,
"train/kl_loss_r1": 0.02253748197108507,
"train/total_kl": 0.06341615030542017
},
{
"epoch": 1.1778945393131919,
"grad_norm": 2.21875,
"learning_rate": 2.115990990990991e-05,
"loss": 0.6509,
"mean_token_accuracy": 0.8938078165054322,
"step": 1570,
"train/kl_loss_qwen": 0.03671765057370067,
"train/kl_loss_r1": 0.02350157857872546,
"train/total_kl": 0.06021922947838902
},
{
"epoch": 1.181647588665791,
"grad_norm": 2.3125,
"learning_rate": 2.1131756756756758e-05,
"loss": 0.6916,
"mean_token_accuracy": 0.8965020477771759,
"step": 1575,
"train/kl_loss_qwen": 0.03952843742445111,
"train/kl_loss_r1": 0.02464278801344335,
"train/total_kl": 0.06417122464627027
},
{
"epoch": 1.18540063801839,
"grad_norm": 3.34375,
"learning_rate": 2.1103603603603604e-05,
"loss": 0.6768,
"mean_token_accuracy": 0.898043891787529,
"step": 1580,
"train/kl_loss_qwen": 0.03657638491131365,
"train/kl_loss_r1": 0.023017378337681294,
"train/total_kl": 0.059593763947486875
},
{
"epoch": 1.189153687370989,
"grad_norm": 2.109375,
"learning_rate": 2.107545045045045e-05,
"loss": 0.6469,
"mean_token_accuracy": 0.9002287417650223,
"step": 1585,
"train/kl_loss_qwen": 0.04064678167924285,
"train/kl_loss_r1": 0.02297673197463155,
"train/total_kl": 0.06362351393327118
},
{
"epoch": 1.192906736723588,
"grad_norm": 2.34375,
"learning_rate": 2.1047297297297298e-05,
"loss": 0.7678,
"mean_token_accuracy": 0.8924204409122467,
"step": 1590,
"train/kl_loss_qwen": 0.05273810774087906,
"train/kl_loss_r1": 0.03466474949382246,
"train/total_kl": 0.08740285709500313
},
{
"epoch": 1.196659786076187,
"grad_norm": 2.203125,
"learning_rate": 2.1019144144144144e-05,
"loss": 0.6661,
"mean_token_accuracy": 0.8990363031625748,
"step": 1595,
"train/kl_loss_qwen": 0.03281391002237797,
"train/kl_loss_r1": 0.021448523411527275,
"train/total_kl": 0.05426243459805846
},
{
"epoch": 1.200412835428786,
"grad_norm": 2.1875,
"learning_rate": 2.0990990990990993e-05,
"loss": 0.7208,
"mean_token_accuracy": 0.8923367202281952,
"step": 1600,
"train/kl_loss_qwen": 0.0482438325881958,
"train/kl_loss_r1": 0.026941578928381206,
"train/total_kl": 0.0751854119822383
},
{
"epoch": 1.2041658847813848,
"grad_norm": 2.484375,
"learning_rate": 2.096283783783784e-05,
"loss": 0.6306,
"mean_token_accuracy": 0.8927339673042297,
"step": 1605,
"train/kl_loss_qwen": 0.025906256400048733,
"train/kl_loss_r1": 0.017682750569656493,
"train/total_kl": 0.04358900701627135
},
{
"epoch": 1.2079189341339838,
"grad_norm": 2.515625,
"learning_rate": 2.0934684684684684e-05,
"loss": 0.6601,
"mean_token_accuracy": 0.899314421415329,
"step": 1610,
"train/kl_loss_qwen": 0.03712713974528015,
"train/kl_loss_r1": 0.022753736563026906,
"train/total_kl": 0.05988087672740221
},
{
"epoch": 1.2116719834865828,
"grad_norm": 2.390625,
"learning_rate": 2.0906531531531533e-05,
"loss": 0.6906,
"mean_token_accuracy": 0.897834625840187,
"step": 1615,
"train/kl_loss_qwen": 0.041691668890416624,
"train/kl_loss_r1": 0.027388109499588607,
"train/total_kl": 0.06907977797091007
},
{
"epoch": 1.2154250328391818,
"grad_norm": 3.0625,
"learning_rate": 2.087837837837838e-05,
"loss": 0.7775,
"mean_token_accuracy": 0.8951803237199784,
"step": 1620,
"train/kl_loss_qwen": 0.049284798093140125,
"train/kl_loss_r1": 0.039868233958259225,
"train/total_kl": 0.08915303098037838
},
{
"epoch": 1.2191780821917808,
"grad_norm": 2.328125,
"learning_rate": 2.0850225225225225e-05,
"loss": 0.6344,
"mean_token_accuracy": 0.9095320641994477,
"step": 1625,
"train/kl_loss_qwen": 0.04163948465138674,
"train/kl_loss_r1": 0.022643117513507605,
"train/total_kl": 0.06428260188549757
},
{
"epoch": 1.2229311315443798,
"grad_norm": 2.328125,
"learning_rate": 2.0822072072072074e-05,
"loss": 0.7098,
"mean_token_accuracy": 0.8988444000482559,
"step": 1630,
"train/kl_loss_qwen": 0.04608845864422619,
"train/kl_loss_r1": 0.027745236363261937,
"train/total_kl": 0.07383369533345104
},
{
"epoch": 1.2266841808969788,
"grad_norm": 2.0625,
"learning_rate": 2.079391891891892e-05,
"loss": 0.6944,
"mean_token_accuracy": 0.8962710082530976,
"step": 1635,
"train/kl_loss_qwen": 0.04292014427483082,
"train/kl_loss_r1": 0.02413395158946514,
"train/total_kl": 0.06705409660935402
},
{
"epoch": 1.2304372302495779,
"grad_norm": 2.578125,
"learning_rate": 2.0765765765765765e-05,
"loss": 0.6326,
"mean_token_accuracy": 0.9000991404056549,
"step": 1640,
"train/kl_loss_qwen": 0.03367524016648531,
"train/kl_loss_r1": 0.021229733433574437,
"train/total_kl": 0.054904973786324265
},
{
"epoch": 1.2341902796021769,
"grad_norm": 2.078125,
"learning_rate": 2.0737612612612614e-05,
"loss": 0.6461,
"mean_token_accuracy": 0.896466201543808,
"step": 1645,
"train/kl_loss_qwen": 0.03830257770605385,
"train/kl_loss_r1": 0.022557589411735534,
"train/total_kl": 0.06086016772314906
},
{
"epoch": 1.2379433289547759,
"grad_norm": 3.515625,
"learning_rate": 2.070945945945946e-05,
"loss": 0.6941,
"mean_token_accuracy": 0.8982764691114425,
"step": 1650,
"train/kl_loss_qwen": 0.04389114985242486,
"train/kl_loss_r1": 0.023960805917158722,
"train/total_kl": 0.06785195581614971
},
{
"epoch": 1.2416963783073747,
"grad_norm": 2.109375,
"learning_rate": 2.0681306306306305e-05,
"loss": 0.6591,
"mean_token_accuracy": 0.8961503982543946,
"step": 1655,
"train/kl_loss_qwen": 0.036785400658845904,
"train/kl_loss_r1": 0.022157771140336992,
"train/total_kl": 0.05894317170605064
},
{
"epoch": 1.2454494276599737,
"grad_norm": 2.953125,
"learning_rate": 2.0653153153153154e-05,
"loss": 0.6637,
"mean_token_accuracy": 0.8931402564048767,
"step": 1660,
"train/kl_loss_qwen": 0.034067783411592244,
"train/kl_loss_r1": 0.022122635459527373,
"train/total_kl": 0.05619041854515672
},
{
"epoch": 1.2492024770125727,
"grad_norm": 2.296875,
"learning_rate": 2.0625e-05,
"loss": 0.7201,
"mean_token_accuracy": 0.8976661562919617,
"step": 1665,
"train/kl_loss_qwen": 0.05538632106035948,
"train/kl_loss_r1": 0.029164044838398694,
"train/total_kl": 0.0845503662712872
},
{
"epoch": 1.2529555263651717,
"grad_norm": 2.15625,
"learning_rate": 2.059684684684685e-05,
"loss": 0.679,
"mean_token_accuracy": 0.8980172663927078,
"step": 1670,
"train/kl_loss_qwen": 0.04381668856367469,
"train/kl_loss_r1": 0.025967366946861147,
"train/total_kl": 0.06978405602276325
},
{
"epoch": 1.2567085757177707,
"grad_norm": 2.0,
"learning_rate": 2.0568693693693695e-05,
"loss": 0.6071,
"mean_token_accuracy": 0.9005229413509369,
"step": 1675,
"train/kl_loss_qwen": 0.03412508904002607,
"train/kl_loss_r1": 0.020069641107693315,
"train/total_kl": 0.05419472977519035
},
{
"epoch": 1.2604616250703697,
"grad_norm": 1.8515625,
"learning_rate": 2.054054054054054e-05,
"loss": 0.7051,
"mean_token_accuracy": 0.8936825692653656,
"step": 1680,
"train/kl_loss_qwen": 0.04467056444846094,
"train/kl_loss_r1": 0.026615058537572622,
"train/total_kl": 0.07128562275320291
},
{
"epoch": 1.2642146744229685,
"grad_norm": 2.84375,
"learning_rate": 2.051238738738739e-05,
"loss": 0.6355,
"mean_token_accuracy": 0.893347242474556,
"step": 1685,
"train/kl_loss_qwen": 0.03152433056384325,
"train/kl_loss_r1": 0.020429795142263174,
"train/total_kl": 0.0519541259855032
},
{
"epoch": 1.2679677237755675,
"grad_norm": 2.984375,
"learning_rate": 2.0484234234234235e-05,
"loss": 0.6984,
"mean_token_accuracy": 0.8897217184305191,
"step": 1690,
"train/kl_loss_qwen": 0.03661228069104254,
"train/kl_loss_r1": 0.02224379451945424,
"train/total_kl": 0.058856075070798396
},
{
"epoch": 1.2717207731281666,
"grad_norm": 2.28125,
"learning_rate": 2.045608108108108e-05,
"loss": 0.648,
"mean_token_accuracy": 0.9048317104578019,
"step": 1695,
"train/kl_loss_qwen": 0.045321733225136995,
"train/kl_loss_r1": 0.026462600193917753,
"train/total_kl": 0.071784333512187
},
{
"epoch": 1.2754738224807656,
"grad_norm": 2.359375,
"learning_rate": 2.042792792792793e-05,
"loss": 0.6268,
"mean_token_accuracy": 0.8983773797750473,
"step": 1700,
"train/kl_loss_qwen": 0.03106446722522378,
"train/kl_loss_r1": 0.01989688342437148,
"train/total_kl": 0.05096135074272752
},
{
"epoch": 1.2792268718333646,
"grad_norm": 2.4375,
"learning_rate": 2.0399774774774775e-05,
"loss": 0.6587,
"mean_token_accuracy": 0.8927053213119507,
"step": 1705,
"train/kl_loss_qwen": 0.03694589231163263,
"train/kl_loss_r1": 0.02159377154894173,
"train/total_kl": 0.058539663441479206
},
{
"epoch": 1.2829799211859636,
"grad_norm": 2.28125,
"learning_rate": 2.037162162162162e-05,
"loss": 0.6729,
"mean_token_accuracy": 0.8997768491506577,
"step": 1710,
"train/kl_loss_qwen": 0.04414708665572107,
"train/kl_loss_r1": 0.025749648921191692,
"train/total_kl": 0.06989673571661115
},
{
"epoch": 1.2867329705385626,
"grad_norm": 2.453125,
"learning_rate": 2.034346846846847e-05,
"loss": 0.6475,
"mean_token_accuracy": 0.8889215677976608,
"step": 1715,
"train/kl_loss_qwen": 0.03290065913461149,
"train/kl_loss_r1": 0.019741447921842337,
"train/total_kl": 0.052642107103019954
},
{
"epoch": 1.2904860198911616,
"grad_norm": 2.046875,
"learning_rate": 2.0315315315315316e-05,
"loss": 0.6602,
"mean_token_accuracy": 0.9022534549236297,
"step": 1720,
"train/kl_loss_qwen": 0.04427695120684803,
"train/kl_loss_r1": 0.024226430244743823,
"train/total_kl": 0.06850338215008378
},
{
"epoch": 1.2942390692437606,
"grad_norm": 2.40625,
"learning_rate": 2.028716216216216e-05,
"loss": 0.6487,
"mean_token_accuracy": 0.8972199141979218,
"step": 1725,
"train/kl_loss_qwen": 0.03695550081320107,
"train/kl_loss_r1": 0.022246523899957536,
"train/total_kl": 0.05920202443376184
},
{
"epoch": 1.2979921185963597,
"grad_norm": 2.34375,
"learning_rate": 2.025900900900901e-05,
"loss": 0.6529,
"mean_token_accuracy": 0.896842759847641,
"step": 1730,
"train/kl_loss_qwen": 0.03686010828241706,
"train/kl_loss_r1": 0.023121427558362485,
"train/total_kl": 0.059981536213308574
},
{
"epoch": 1.3017451679489584,
"grad_norm": 2.6875,
"learning_rate": 2.0230855855855856e-05,
"loss": 0.7504,
"mean_token_accuracy": 0.8848373681306839,
"step": 1735,
"train/kl_loss_qwen": 0.04792549349367618,
"train/kl_loss_r1": 0.02982408171519637,
"train/total_kl": 0.0777495744638145
},
{
"epoch": 1.3054982173015575,
"grad_norm": 2.46875,
"learning_rate": 2.0202702702702705e-05,
"loss": 0.6681,
"mean_token_accuracy": 0.8902998507022858,
"step": 1740,
"train/kl_loss_qwen": 0.03482842277735472,
"train/kl_loss_r1": 0.02168791564181447,
"train/total_kl": 0.0565163386054337
},
{
"epoch": 1.3092512666541565,
"grad_norm": 2.625,
"learning_rate": 2.017454954954955e-05,
"loss": 0.6437,
"mean_token_accuracy": 0.8982394754886627,
"step": 1745,
"train/kl_loss_qwen": 0.035474417312070725,
"train/kl_loss_r1": 0.022891478892415763,
"train/total_kl": 0.05836589625105262
},
{
"epoch": 1.3130043160067555,
"grad_norm": 2.703125,
"learning_rate": 2.0146396396396396e-05,
"loss": 0.6795,
"mean_token_accuracy": 0.8941202372312546,
"step": 1750,
"train/kl_loss_qwen": 0.0397964580450207,
"train/kl_loss_r1": 0.023753806576132776,
"train/total_kl": 0.0635502644814551
},
{
"epoch": 1.3167573653593545,
"grad_norm": 3.0,
"learning_rate": 2.0118243243243245e-05,
"loss": 0.6468,
"mean_token_accuracy": 0.8910412400960922,
"step": 1755,
"train/kl_loss_qwen": 0.029920431366190315,
"train/kl_loss_r1": 0.01957395039498806,
"train/total_kl": 0.049494380969554184
},
{
"epoch": 1.3205104147119535,
"grad_norm": 1.9453125,
"learning_rate": 2.009009009009009e-05,
"loss": 0.6327,
"mean_token_accuracy": 0.8966994285583496,
"step": 1760,
"train/kl_loss_qwen": 0.034124097367748615,
"train/kl_loss_r1": 0.020086573716253043,
"train/total_kl": 0.054210671316832305
},
{
"epoch": 1.3242634640645525,
"grad_norm": 2.671875,
"learning_rate": 2.0061936936936936e-05,
"loss": 0.6549,
"mean_token_accuracy": 0.8966648191213608,
"step": 1765,
"train/kl_loss_qwen": 0.03722571823745966,
"train/kl_loss_r1": 0.023023253306746483,
"train/total_kl": 0.06024897079914808
},
{
"epoch": 1.3280165134171513,
"grad_norm": 2.203125,
"learning_rate": 2.0033783783783786e-05,
"loss": 0.7187,
"mean_token_accuracy": 0.893772754073143,
"step": 1770,
"train/kl_loss_qwen": 0.041496854228898886,
"train/kl_loss_r1": 0.02984851785004139,
"train/total_kl": 0.0713453721255064
},
{
"epoch": 1.3317695627697503,
"grad_norm": 2.953125,
"learning_rate": 2.000563063063063e-05,
"loss": 0.6494,
"mean_token_accuracy": 0.8925831645727158,
"step": 1775,
"train/kl_loss_qwen": 0.03391701048240066,
"train/kl_loss_r1": 0.02053148075938225,
"train/total_kl": 0.05444849170744419
},
{
"epoch": 1.3355226121223494,
"grad_norm": 2.59375,
"learning_rate": 1.9977477477477477e-05,
"loss": 0.6872,
"mean_token_accuracy": 0.8946872740983963,
"step": 1780,
"train/kl_loss_qwen": 0.04151489580981434,
"train/kl_loss_r1": 0.02380800019018352,
"train/total_kl": 0.0653228960931301
},
{
"epoch": 1.3392756614749484,
"grad_norm": 5.34375,
"learning_rate": 1.9949324324324326e-05,
"loss": 0.7474,
"mean_token_accuracy": 0.8979882091283798,
"step": 1785,
"train/kl_loss_qwen": 0.056800445262342694,
"train/kl_loss_r1": 0.029366112127900124,
"train/total_kl": 0.08616655776277185
},
{
"epoch": 1.3430287108275474,
"grad_norm": 2.21875,
"learning_rate": 1.992117117117117e-05,
"loss": 0.7115,
"mean_token_accuracy": 0.8981248527765274,
"step": 1790,
"train/kl_loss_qwen": 0.04085184554569423,
"train/kl_loss_r1": 0.03460422777570784,
"train/total_kl": 0.07545607415959239
},
{
"epoch": 1.3467817601801464,
"grad_norm": 2.125,
"learning_rate": 1.9893018018018017e-05,
"loss": 0.6341,
"mean_token_accuracy": 0.9051784396171569,
"step": 1795,
"train/kl_loss_qwen": 0.03810063651762903,
"train/kl_loss_r1": 0.023779565608128904,
"train/total_kl": 0.061880202125757934
},
{
"epoch": 1.3505348095327454,
"grad_norm": 2.75,
"learning_rate": 1.9864864864864866e-05,
"loss": 0.6965,
"mean_token_accuracy": 0.8958302170038224,
"step": 1800,
"train/kl_loss_qwen": 0.043665826646611096,
"train/kl_loss_r1": 0.024920030031353235,
"train/total_kl": 0.06858585700392723
},
{
"epoch": 1.3542878588853444,
"grad_norm": 2.265625,
"learning_rate": 1.9836711711711712e-05,
"loss": 0.6536,
"mean_token_accuracy": 0.8965657860040664,
"step": 1805,
"train/kl_loss_qwen": 0.0385003843344748,
"train/kl_loss_r1": 0.02256901506334543,
"train/total_kl": 0.06106939930468798
},
{
"epoch": 1.3580409082379434,
"grad_norm": 2.78125,
"learning_rate": 1.980855855855856e-05,
"loss": 0.6662,
"mean_token_accuracy": 0.8964945763349533,
"step": 1810,
"train/kl_loss_qwen": 0.03769433670677245,
"train/kl_loss_r1": 0.023366046929731966,
"train/total_kl": 0.061060383543372156
},
{
"epoch": 1.3617939575905424,
"grad_norm": 1.9765625,
"learning_rate": 1.9780405405405406e-05,
"loss": 0.6232,
"mean_token_accuracy": 0.8984342306852341,
"step": 1815,
"train/kl_loss_qwen": 0.03642870718613267,
"train/kl_loss_r1": 0.02151739364489913,
"train/total_kl": 0.05794610073789954
},
{
"epoch": 1.3655470069431412,
"grad_norm": 2.6875,
"learning_rate": 1.9752252252252252e-05,
"loss": 0.6748,
"mean_token_accuracy": 0.8911469489336014,
"step": 1820,
"train/kl_loss_qwen": 0.036837967671453954,
"train/kl_loss_r1": 0.021274990309029816,
"train/total_kl": 0.05811295798048377
},
{
"epoch": 1.3693000562957403,
"grad_norm": 2.421875,
"learning_rate": 1.97240990990991e-05,
"loss": 0.7,
"mean_token_accuracy": 0.898788771033287,
"step": 1825,
"train/kl_loss_qwen": 0.0477908511646092,
"train/kl_loss_r1": 0.027263673022389412,
"train/total_kl": 0.07505452418699861
},
{
"epoch": 1.3730531056483393,
"grad_norm": 2.09375,
"learning_rate": 1.9695945945945947e-05,
"loss": 0.6515,
"mean_token_accuracy": 0.8929797321557998,
"step": 1830,
"train/kl_loss_qwen": 0.037732946872711184,
"train/kl_loss_r1": 0.023381694732233883,
"train/total_kl": 0.06111464183777571
},
{
"epoch": 1.3768061550009383,
"grad_norm": 3.625,
"learning_rate": 1.9667792792792792e-05,
"loss": 0.635,
"mean_token_accuracy": 0.8952462702989579,
"step": 1835,
"train/kl_loss_qwen": 0.033427430875599386,
"train/kl_loss_r1": 0.01963294977322221,
"train/total_kl": 0.053060381393879655
},
{
"epoch": 1.3805592043535373,
"grad_norm": 2.078125,
"learning_rate": 1.963963963963964e-05,
"loss": 0.6226,
"mean_token_accuracy": 0.9011066049337387,
"step": 1840,
"train/kl_loss_qwen": 0.03780209980905056,
"train/kl_loss_r1": 0.021729913400486113,
"train/total_kl": 0.059532013908028605
},
{
"epoch": 1.3843122537061363,
"grad_norm": 2.671875,
"learning_rate": 1.9611486486486487e-05,
"loss": 0.6941,
"mean_token_accuracy": 0.8947292596101761,
"step": 1845,
"train/kl_loss_qwen": 0.04456910211592913,
"train/kl_loss_r1": 0.026085085608065127,
"train/total_kl": 0.07065418781712651
},
{
"epoch": 1.388065303058735,
"grad_norm": 2.390625,
"learning_rate": 1.9583333333333333e-05,
"loss": 0.6699,
"mean_token_accuracy": 0.892634192109108,
"step": 1850,
"train/kl_loss_qwen": 0.03511934005655348,
"train/kl_loss_r1": 0.02197172655723989,
"train/total_kl": 0.05709106680005789
},
{
"epoch": 1.3918183524113341,
"grad_norm": 2.34375,
"learning_rate": 1.9555180180180182e-05,
"loss": 0.6561,
"mean_token_accuracy": 0.9011503875255584,
"step": 1855,
"train/kl_loss_qwen": 0.037530270777642726,
"train/kl_loss_r1": 0.023832452250644565,
"train/total_kl": 0.06136272391304374
},
{
"epoch": 1.3955714017639331,
"grad_norm": 2.484375,
"learning_rate": 1.9527027027027027e-05,
"loss": 0.639,
"mean_token_accuracy": 0.8889249801635742,
"step": 1860,
"train/kl_loss_qwen": 0.03357897619716823,
"train/kl_loss_r1": 0.019287104764953256,
"train/total_kl": 0.05286608096212149
},
{
"epoch": 1.3993244511165321,
"grad_norm": 3.46875,
"learning_rate": 1.9498873873873876e-05,
"loss": 0.6589,
"mean_token_accuracy": 0.89662606716156,
"step": 1865,
"train/kl_loss_qwen": 0.03979860804975033,
"train/kl_loss_r1": 0.021712002949789165,
"train/total_kl": 0.061510611418634654
},
{
"epoch": 1.4030775004691312,
"grad_norm": 2.375,
"learning_rate": 1.9470720720720722e-05,
"loss": 0.6544,
"mean_token_accuracy": 0.8980444580316543,
"step": 1870,
"train/kl_loss_qwen": 0.03840322676114738,
"train/kl_loss_r1": 0.022618817444890738,
"train/total_kl": 0.061022044345736506
},
{
"epoch": 1.4068305498217302,
"grad_norm": 2.015625,
"learning_rate": 1.9442567567567568e-05,
"loss": 0.629,
"mean_token_accuracy": 0.8985240757465363,
"step": 1875,
"train/kl_loss_qwen": 0.03343218662776053,
"train/kl_loss_r1": 0.02114759860560298,
"train/total_kl": 0.05457978509366512
},
{
"epoch": 1.4105835991743292,
"grad_norm": 2.453125,
"learning_rate": 1.9414414414414417e-05,
"loss": 0.6639,
"mean_token_accuracy": 0.8933916985988617,
"step": 1880,
"train/kl_loss_qwen": 0.035910390829667446,
"train/kl_loss_r1": 0.022948722075670957,
"train/total_kl": 0.05885911285877228
},
{
"epoch": 1.4143366485269282,
"grad_norm": 2.140625,
"learning_rate": 1.9386261261261262e-05,
"loss": 0.6254,
"mean_token_accuracy": 0.910058930516243,
"step": 1885,
"train/kl_loss_qwen": 0.04212158760055899,
"train/kl_loss_r1": 0.023075549816712736,
"train/total_kl": 0.06519713709130884
},
{
"epoch": 1.4180896978795272,
"grad_norm": 2.609375,
"learning_rate": 1.9358108108108108e-05,
"loss": 0.6925,
"mean_token_accuracy": 0.8909910589456558,
"step": 1890,
"train/kl_loss_qwen": 0.03533278629183769,
"train/kl_loss_r1": 0.02264896663837135,
"train/total_kl": 0.057981752697378396
},
{
"epoch": 1.4218427472321262,
"grad_norm": 2.1875,
"learning_rate": 1.9329954954954957e-05,
"loss": 0.7097,
"mean_token_accuracy": 0.8962362855672836,
"step": 1895,
"train/kl_loss_qwen": 0.045880905678495766,
"train/kl_loss_r1": 0.0273836272303015,
"train/total_kl": 0.07326453356072307
},
{
"epoch": 1.425595796584725,
"grad_norm": 2.78125,
"learning_rate": 1.9301801801801803e-05,
"loss": 0.6969,
"mean_token_accuracy": 0.8988943964242935,
"step": 1900,
"train/kl_loss_qwen": 0.039936855994164945,
"train/kl_loss_r1": 0.024415438855066897,
"train/total_kl": 0.06435229545459151
},
{
"epoch": 1.429348845937324,
"grad_norm": 2.34375,
"learning_rate": 1.927364864864865e-05,
"loss": 0.6525,
"mean_token_accuracy": 0.9052040755748749,
"step": 1905,
"train/kl_loss_qwen": 0.04124778304249048,
"train/kl_loss_r1": 0.023393189487978815,
"train/total_kl": 0.06464097276329994
},
{
"epoch": 1.433101895289923,
"grad_norm": 2.515625,
"learning_rate": 1.9245495495495497e-05,
"loss": 0.7096,
"mean_token_accuracy": 0.8973052710294723,
"step": 1910,
"train/kl_loss_qwen": 0.04522251943126321,
"train/kl_loss_r1": 0.027931411052122712,
"train/total_kl": 0.07315393034368753
},
{
"epoch": 1.436854944642522,
"grad_norm": 2.546875,
"learning_rate": 1.9217342342342343e-05,
"loss": 0.6854,
"mean_token_accuracy": 0.89446761906147,
"step": 1915,
"train/kl_loss_qwen": 0.04195737112313509,
"train/kl_loss_r1": 0.024122355040162802,
"train/total_kl": 0.06607972560450434
},
{
"epoch": 1.440607993995121,
"grad_norm": 2.078125,
"learning_rate": 1.918918918918919e-05,
"loss": 0.6296,
"mean_token_accuracy": 0.8977221518754959,
"step": 1920,
"train/kl_loss_qwen": 0.03218547897413373,
"train/kl_loss_r1": 0.020699582109227777,
"train/total_kl": 0.05288506057113409
},
{
"epoch": 1.44436104334772,
"grad_norm": 2.296875,
"learning_rate": 1.9161036036036038e-05,
"loss": 0.6815,
"mean_token_accuracy": 0.9008699923753738,
"step": 1925,
"train/kl_loss_qwen": 0.04258906641043723,
"train/kl_loss_r1": 0.025730078108608723,
"train/total_kl": 0.06831914484500885
},
{
"epoch": 1.4481140927003189,
"grad_norm": 2.171875,
"learning_rate": 1.9132882882882883e-05,
"loss": 0.6342,
"mean_token_accuracy": 0.8992574870586395,
"step": 1930,
"train/kl_loss_qwen": 0.0382092896848917,
"train/kl_loss_r1": 0.021629361854866146,
"train/total_kl": 0.05983865112066269
},
{
"epoch": 1.451867142052918,
"grad_norm": 2.21875,
"learning_rate": 1.9104729729729732e-05,
"loss": 0.6639,
"mean_token_accuracy": 0.9041530281305313,
"step": 1935,
"train/kl_loss_qwen": 0.03997725336812437,
"train/kl_loss_r1": 0.023675264324992895,
"train/total_kl": 0.06365251699462533
},
{
"epoch": 1.455620191405517,
"grad_norm": 2.171875,
"learning_rate": 1.9076576576576578e-05,
"loss": 0.6712,
"mean_token_accuracy": 0.9018199771642685,
"step": 1940,
"train/kl_loss_qwen": 0.043738367455080154,
"train/kl_loss_r1": 0.02533445945009589,
"train/total_kl": 0.06907282685860991
},
{
"epoch": 1.459373240758116,
"grad_norm": 2.765625,
"learning_rate": 1.9048423423423424e-05,
"loss": 0.6547,
"mean_token_accuracy": 0.8964920192956924,
"step": 1945,
"train/kl_loss_qwen": 0.036225776420906186,
"train/kl_loss_r1": 0.022438023379072546,
"train/total_kl": 0.05866379989311099
},
{
"epoch": 1.463126290110715,
"grad_norm": 3.015625,
"learning_rate": 1.9020270270270273e-05,
"loss": 0.6735,
"mean_token_accuracy": 0.8878309816122055,
"step": 1950,
"train/kl_loss_qwen": 0.03589406101964414,
"train/kl_loss_r1": 0.020759137952700256,
"train/total_kl": 0.05665319887921214
},
{
"epoch": 1.466879339463314,
"grad_norm": 2.09375,
"learning_rate": 1.899211711711712e-05,
"loss": 0.6439,
"mean_token_accuracy": 0.8993774890899658,
"step": 1955,
"train/kl_loss_qwen": 0.03630202002823353,
"train/kl_loss_r1": 0.022347288206219673,
"train/total_kl": 0.05864930879324674
},
{
"epoch": 1.470632388815913,
"grad_norm": 2.140625,
"learning_rate": 1.8963963963963964e-05,
"loss": 0.6855,
"mean_token_accuracy": 0.8912985980510711,
"step": 1960,
"train/kl_loss_qwen": 0.03758311937563121,
"train/kl_loss_r1": 0.022967340145260095,
"train/total_kl": 0.060550459288060667
},
{
"epoch": 1.474385438168512,
"grad_norm": 2.125,
"learning_rate": 1.8935810810810813e-05,
"loss": 0.6547,
"mean_token_accuracy": 0.8974949568510056,
"step": 1965,
"train/kl_loss_qwen": 0.03768882369622588,
"train/kl_loss_r1": 0.022107941936701535,
"train/total_kl": 0.05979676572605967
},
{
"epoch": 1.478138487521111,
"grad_norm": 2.328125,
"learning_rate": 1.890765765765766e-05,
"loss": 0.6452,
"mean_token_accuracy": 0.9022711753845215,
"step": 1970,
"train/kl_loss_qwen": 0.039558446034789085,
"train/kl_loss_r1": 0.02402328816242516,
"train/total_kl": 0.06358173452317714
},
{
"epoch": 1.48189153687371,
"grad_norm": 3.59375,
"learning_rate": 1.8879504504504504e-05,
"loss": 0.6739,
"mean_token_accuracy": 0.8987083554267883,
"step": 1975,
"train/kl_loss_qwen": 0.0458216161467135,
"train/kl_loss_r1": 0.02532826513051987,
"train/total_kl": 0.07114988146349788
},
{
"epoch": 1.4856445862263088,
"grad_norm": 2.625,
"learning_rate": 1.8851351351351353e-05,
"loss": 0.6292,
"mean_token_accuracy": 0.8991831332445145,
"step": 1980,
"train/kl_loss_qwen": 0.02697877576574683,
"train/kl_loss_r1": 0.018973442958667874,
"train/total_kl": 0.04595221867784858
},
{
"epoch": 1.4893976355789078,
"grad_norm": 2.296875,
"learning_rate": 1.88231981981982e-05,
"loss": 0.6595,
"mean_token_accuracy": 0.8934097826480866,
"step": 1985,
"train/kl_loss_qwen": 0.03260546647943556,
"train/kl_loss_r1": 0.021064449148252607,
"train/total_kl": 0.05366991562768817
},
{
"epoch": 1.4931506849315068,
"grad_norm": 2.375,
"learning_rate": 1.8795045045045045e-05,
"loss": 0.6695,
"mean_token_accuracy": 0.8950473695993424,
"step": 1990,
"train/kl_loss_qwen": 0.04045011536218226,
"train/kl_loss_r1": 0.023666227189823984,
"train/total_kl": 0.0641163426451385
},
{
"epoch": 1.4969037342841058,
"grad_norm": 3.09375,
"learning_rate": 1.8766891891891894e-05,
"loss": 0.663,
"mean_token_accuracy": 0.8998892098665238,
"step": 1995,
"train/kl_loss_qwen": 0.04123517670668662,
"train/kl_loss_r1": 0.02508084485307336,
"train/total_kl": 0.06631602114066482
},
{
"epoch": 1.5006567836367048,
"grad_norm": 2.71875,
"learning_rate": 1.873873873873874e-05,
"loss": 0.7075,
"mean_token_accuracy": 0.8947447627782822,
"step": 2000,
"train/kl_loss_qwen": 0.04717821152880788,
"train/kl_loss_r1": 0.02488067150115967,
"train/total_kl": 0.0720588818192482
},
{
"epoch": 1.5044098329893039,
"grad_norm": 2.953125,
"learning_rate": 1.871058558558559e-05,
"loss": 0.6684,
"mean_token_accuracy": 0.898020452260971,
"step": 2005,
"train/kl_loss_qwen": 0.043496218509972095,
"train/kl_loss_r1": 0.023012824496254324,
"train/total_kl": 0.0665090423077345
},
{
"epoch": 1.5081628823419027,
"grad_norm": 2.71875,
"learning_rate": 1.8682432432432434e-05,
"loss": 0.6304,
"mean_token_accuracy": 0.9003192782402039,
"step": 2010,
"train/kl_loss_qwen": 0.029134797770529984,
"train/kl_loss_r1": 0.02021429603919387,
"train/total_kl": 0.04934909334406257
},
{
"epoch": 1.5119159316945017,
"grad_norm": 1.9140625,
"learning_rate": 1.865427927927928e-05,
"loss": 0.6588,
"mean_token_accuracy": 0.9045243114233017,
"step": 2015,
"train/kl_loss_qwen": 0.03774572303518653,
"train/kl_loss_r1": 0.024216174567118286,
"train/total_kl": 0.0619618970900774
},
{
"epoch": 1.5156689810471007,
"grad_norm": 2.640625,
"learning_rate": 1.862612612612613e-05,
"loss": 0.6248,
"mean_token_accuracy": 0.8964930444955825,
"step": 2020,
"train/kl_loss_qwen": 0.034802882373332976,
"train/kl_loss_r1": 0.02116892714984715,
"train/total_kl": 0.055971809569746254
},
{
"epoch": 1.5194220303996997,
"grad_norm": 3.03125,
"learning_rate": 1.8597972972972974e-05,
"loss": 0.6271,
"mean_token_accuracy": 0.8987694203853607,
"step": 2025,
"train/kl_loss_qwen": 0.03145243003964424,
"train/kl_loss_r1": 0.019979899702593684,
"train/total_kl": 0.0514323296956718
},
{
"epoch": 1.5231750797522987,
"grad_norm": 2.78125,
"learning_rate": 1.856981981981982e-05,
"loss": 0.6637,
"mean_token_accuracy": 0.8984456181526184,
"step": 2030,
"train/kl_loss_qwen": 0.039285799767822024,
"train/kl_loss_r1": 0.024448539735749363,
"train/total_kl": 0.06373433964326977
},
{
"epoch": 1.5269281291048977,
"grad_norm": 2.40625,
"learning_rate": 1.854166666666667e-05,
"loss": 0.6195,
"mean_token_accuracy": 0.9050000667572021,
"step": 2035,
"train/kl_loss_qwen": 0.03708098256029189,
"train/kl_loss_r1": 0.022825441183522345,
"train/total_kl": 0.0599064233712852
},
{
"epoch": 1.5306811784574967,
"grad_norm": 3.15625,
"learning_rate": 1.8513513513513515e-05,
"loss": 0.6373,
"mean_token_accuracy": 0.8917050033807754,
"step": 2040,
"train/kl_loss_qwen": 0.03324793949723244,
"train/kl_loss_r1": 0.02039225320331752,
"train/total_kl": 0.05364019190892577
},
{
"epoch": 1.5344342278100958,
"grad_norm": 2.6875,
"learning_rate": 1.848536036036036e-05,
"loss": 0.6909,
"mean_token_accuracy": 0.898727822303772,
"step": 2045,
"train/kl_loss_qwen": 0.0451532918959856,
"train/kl_loss_r1": 0.02779616378247738,
"train/total_kl": 0.0729494565166533
},
{
"epoch": 1.5381872771626948,
"grad_norm": 2.78125,
"learning_rate": 1.845720720720721e-05,
"loss": 0.642,
"mean_token_accuracy": 0.8923788040876388,
"step": 2050,
"train/kl_loss_qwen": 0.030408328166231513,
"train/kl_loss_r1": 0.019276778073981406,
"train/total_kl": 0.04968510568141937
},
{
"epoch": 1.5419403265152938,
"grad_norm": 1.9140625,
"learning_rate": 1.8429054054054055e-05,
"loss": 0.6805,
"mean_token_accuracy": 0.9005244821310043,
"step": 2055,
"train/kl_loss_qwen": 0.043401677859947085,
"train/kl_loss_r1": 0.024531407188624142,
"train/total_kl": 0.06793308556079865
},
{
"epoch": 1.5456933758678928,
"grad_norm": 2.640625,
"learning_rate": 1.84009009009009e-05,
"loss": 0.697,
"mean_token_accuracy": 0.89486822783947,
"step": 2060,
"train/kl_loss_qwen": 0.04360593403689563,
"train/kl_loss_r1": 0.02450297260656953,
"train/total_kl": 0.06810890669003129
},
{
"epoch": 1.5494464252204918,
"grad_norm": 2.265625,
"learning_rate": 1.837274774774775e-05,
"loss": 0.6749,
"mean_token_accuracy": 0.8936996221542358,
"step": 2065,
"train/kl_loss_qwen": 0.03860712107270956,
"train/kl_loss_r1": 0.02272321986965835,
"train/total_kl": 0.061330341175198554
},
{
"epoch": 1.5531994745730906,
"grad_norm": 2.09375,
"learning_rate": 1.8344594594594595e-05,
"loss": 0.6602,
"mean_token_accuracy": 0.9008495211601257,
"step": 2070,
"train/kl_loss_qwen": 0.038267128402367234,
"train/kl_loss_r1": 0.024460298055782915,
"train/total_kl": 0.06272742608562112
},
{
"epoch": 1.5569525239256896,
"grad_norm": 2.53125,
"learning_rate": 1.8316441441441444e-05,
"loss": 0.6784,
"mean_token_accuracy": 0.8971472412347794,
"step": 2075,
"train/kl_loss_qwen": 0.0419050442520529,
"train/kl_loss_r1": 0.024500356847420336,
"train/total_kl": 0.06640540091320872
},
{
"epoch": 1.5607055732782886,
"grad_norm": 1.953125,
"learning_rate": 1.828828828828829e-05,
"loss": 0.6483,
"mean_token_accuracy": 0.8951237499713898,
"step": 2080,
"train/kl_loss_qwen": 0.03391816089861095,
"train/kl_loss_r1": 0.01974315377883613,
"train/total_kl": 0.05366131514310837
},
{
"epoch": 1.5644586226308876,
"grad_norm": 2.375,
"learning_rate": 1.8260135135135136e-05,
"loss": 0.6596,
"mean_token_accuracy": 0.9010801434516906,
"step": 2085,
"train/kl_loss_qwen": 0.04254875308834016,
"train/kl_loss_r1": 0.023462942428886892,
"train/total_kl": 0.06601169584318996
},
{
"epoch": 1.5682116719834864,
"grad_norm": 2.1875,
"learning_rate": 1.8231981981981985e-05,
"loss": 0.6299,
"mean_token_accuracy": 0.8970382899045944,
"step": 2090,
"train/kl_loss_qwen": 0.03471034588292241,
"train/kl_loss_r1": 0.021927068615332244,
"train/total_kl": 0.0566374147310853
},
{
"epoch": 1.5719647213360854,
"grad_norm": 2.65625,
"learning_rate": 1.820382882882883e-05,
"loss": 0.6458,
"mean_token_accuracy": 0.9013784170150757,
"step": 2095,
"train/kl_loss_qwen": 0.04169517187401652,
"train/kl_loss_r1": 0.024561091884970666,
"train/total_kl": 0.06625626292079687
},
{
"epoch": 1.5757177706886845,
"grad_norm": 2.171875,
"learning_rate": 1.8175675675675676e-05,
"loss": 0.6437,
"mean_token_accuracy": 0.8984420299530029,
"step": 2100,
"train/kl_loss_qwen": 0.03708738945424557,
"train/kl_loss_r1": 0.02213964704424143,
"train/total_kl": 0.05922703584656119
},
{
"epoch": 1.5794708200412835,
"grad_norm": 2.96875,
"learning_rate": 1.8147522522522525e-05,
"loss": 0.636,
"mean_token_accuracy": 0.8942008495330811,
"step": 2105,
"train/kl_loss_qwen": 0.028620942728593946,
"train/kl_loss_r1": 0.018589144852012397,
"train/total_kl": 0.04721008772030473
},
{
"epoch": 1.5832238693938825,
"grad_norm": 2.09375,
"learning_rate": 1.811936936936937e-05,
"loss": 0.6433,
"mean_token_accuracy": 0.9032953917980194,
"step": 2110,
"train/kl_loss_qwen": 0.04077963996678591,
"train/kl_loss_r1": 0.02312437235377729,
"train/total_kl": 0.06390401273965836
},
{
"epoch": 1.5869769187464815,
"grad_norm": 2.234375,
"learning_rate": 1.8091216216216216e-05,
"loss": 0.7082,
"mean_token_accuracy": 0.8941286385059357,
"step": 2115,
"train/kl_loss_qwen": 0.04121659249067307,
"train/kl_loss_r1": 0.022846509236842394,
"train/total_kl": 0.06406310107558966
},
{
"epoch": 1.5907299680990805,
"grad_norm": 3.28125,
"learning_rate": 1.8063063063063065e-05,
"loss": 0.6491,
"mean_token_accuracy": 0.9042773187160492,
"step": 2120,
"train/kl_loss_qwen": 0.03976739956997335,
"train/kl_loss_r1": 0.023621071968227624,
"train/total_kl": 0.06338847130537033
},
{
"epoch": 1.5944830174516795,
"grad_norm": 2.5,
"learning_rate": 1.803490990990991e-05,
"loss": 0.6262,
"mean_token_accuracy": 0.9077206790447235,
"step": 2125,
"train/kl_loss_qwen": 0.03935662703588605,
"train/kl_loss_r1": 0.022750586131587626,
"train/total_kl": 0.06210721312090754
},
{
"epoch": 1.5982360668042785,
"grad_norm": 2.0625,
"learning_rate": 1.8006756756756757e-05,
"loss": 0.6299,
"mean_token_accuracy": 0.8975888967514039,
"step": 2130,
"train/kl_loss_qwen": 0.037865397753193974,
"train/kl_loss_r1": 0.021229323279112578,
"train/total_kl": 0.05909472107887268
},
{
"epoch": 1.6019891161568776,
"grad_norm": 2.125,
"learning_rate": 1.7978603603603606e-05,
"loss": 0.6828,
"mean_token_accuracy": 0.8985576778650284,
"step": 2135,
"train/kl_loss_qwen": 0.04367698361165821,
"train/kl_loss_r1": 0.02365296697244048,
"train/total_kl": 0.06732995035126806
},
{
"epoch": 1.6057421655094766,
"grad_norm": 2.984375,
"learning_rate": 1.795045045045045e-05,
"loss": 0.741,
"mean_token_accuracy": 0.8831792622804642,
"step": 2140,
"train/kl_loss_qwen": 0.04365133550018072,
"train/kl_loss_r1": 0.025468871323391797,
"train/total_kl": 0.06912020705640316
},
{
"epoch": 1.6094952148620756,
"grad_norm": 2.5625,
"learning_rate": 1.79222972972973e-05,
"loss": 0.6598,
"mean_token_accuracy": 0.8970428496599198,
"step": 2145,
"train/kl_loss_qwen": 0.034180917451158165,
"train/kl_loss_r1": 0.02286825072951615,
"train/total_kl": 0.0570491686463356
},
{
"epoch": 1.6132482642146744,
"grad_norm": 2.359375,
"learning_rate": 1.7894144144144146e-05,
"loss": 0.6644,
"mean_token_accuracy": 0.8940432757139206,
"step": 2150,
"train/kl_loss_qwen": 0.035260153096169235,
"train/kl_loss_r1": 0.021994050638750196,
"train/total_kl": 0.05725420378148556
},
{
"epoch": 1.6170013135672734,
"grad_norm": 2.28125,
"learning_rate": 1.786599099099099e-05,
"loss": 0.6376,
"mean_token_accuracy": 0.8957689791917801,
"step": 2155,
"train/kl_loss_qwen": 0.0388267389498651,
"train/kl_loss_r1": 0.021107364958152176,
"train/total_kl": 0.05993410395458341
},
{
"epoch": 1.6207543629198724,
"grad_norm": 2.234375,
"learning_rate": 1.783783783783784e-05,
"loss": 0.6592,
"mean_token_accuracy": 0.9020599126815796,
"step": 2160,
"train/kl_loss_qwen": 0.04379240069538355,
"train/kl_loss_r1": 0.025263063982129096,
"train/total_kl": 0.06905546449124814
},
{
"epoch": 1.6245074122724714,
"grad_norm": 2.0,
"learning_rate": 1.7809684684684686e-05,
"loss": 0.62,
"mean_token_accuracy": 0.909572035074234,
"step": 2165,
"train/kl_loss_qwen": 0.03788591339252889,
"train/kl_loss_r1": 0.022449908265843987,
"train/total_kl": 0.06033582193776965
},
{
"epoch": 1.6282604616250702,
"grad_norm": 2.59375,
"learning_rate": 1.7781531531531532e-05,
"loss": 0.6307,
"mean_token_accuracy": 0.9034926325082779,
"step": 2170,
"train/kl_loss_qwen": 0.03140334081836045,
"train/kl_loss_r1": 0.01981693026609719,
"train/total_kl": 0.051220270432531835
},
{
"epoch": 1.6320135109776692,
"grad_norm": 3.140625,
"learning_rate": 1.775337837837838e-05,
"loss": 0.6078,
"mean_token_accuracy": 0.9023738920688629,
"step": 2175,
"train/kl_loss_qwen": 0.030494816461578013,
"train/kl_loss_r1": 0.019982940517365932,
"train/total_kl": 0.050477756466716525
},
{
"epoch": 1.6357665603302682,
"grad_norm": 2.09375,
"learning_rate": 1.7725225225225227e-05,
"loss": 0.6261,
"mean_token_accuracy": 0.9061200588941574,
"step": 2180,
"train/kl_loss_qwen": 0.037608364084735516,
"train/kl_loss_r1": 0.023159870877861977,
"train/total_kl": 0.06076823528856039
},
{
"epoch": 1.6395196096828673,
"grad_norm": 2.5625,
"learning_rate": 1.7697072072072072e-05,
"loss": 0.6209,
"mean_token_accuracy": 0.9042865604162216,
"step": 2185,
"train/kl_loss_qwen": 0.03485631812363863,
"train/kl_loss_r1": 0.021672707796096802,
"train/total_kl": 0.05652902610599995
},
{
"epoch": 1.6432726590354663,
"grad_norm": 2.515625,
"learning_rate": 1.766891891891892e-05,
"loss": 0.6012,
"mean_token_accuracy": 0.9039783835411072,
"step": 2190,
"train/kl_loss_qwen": 0.03550857813097537,
"train/kl_loss_r1": 0.02138693048618734,
"train/total_kl": 0.05689550880342722
},
{
"epoch": 1.6470257083880653,
"grad_norm": 2.296875,
"learning_rate": 1.7640765765765767e-05,
"loss": 0.668,
"mean_token_accuracy": 0.9030372470617294,
"step": 2195,
"train/kl_loss_qwen": 0.04753458416089416,
"train/kl_loss_r1": 0.02611639932729304,
"train/total_kl": 0.07365098400041462
},
{
"epoch": 1.6507787577406643,
"grad_norm": 2.453125,
"learning_rate": 1.7612612612612613e-05,
"loss": 0.6292,
"mean_token_accuracy": 0.8899801164865494,
"step": 2200,
"train/kl_loss_qwen": 0.03742695958353579,
"train/kl_loss_r1": 0.022831895435228945,
"train/total_kl": 0.060258854925632474
},
{
"epoch": 1.6545318070932633,
"grad_norm": 2.25,
"learning_rate": 1.758445945945946e-05,
"loss": 0.5998,
"mean_token_accuracy": 0.9015161246061325,
"step": 2205,
"train/kl_loss_qwen": 0.029024596931412815,
"train/kl_loss_r1": 0.018637486500665545,
"train/total_kl": 0.04766208389773965
},
{
"epoch": 1.6582848564458623,
"grad_norm": 2.21875,
"learning_rate": 1.7556306306306307e-05,
"loss": 0.7259,
"mean_token_accuracy": 0.8821407407522202,
"step": 2210,
"train/kl_loss_qwen": 0.04734089416451752,
"train/kl_loss_r1": 0.02618039455264807,
"train/total_kl": 0.07352128904312849
},
{
"epoch": 1.6620379057984613,
"grad_norm": 2.765625,
"learning_rate": 1.7528153153153156e-05,
"loss": 0.642,
"mean_token_accuracy": 0.8945120990276336,
"step": 2215,
"train/kl_loss_qwen": 0.0319673310033977,
"train/kl_loss_r1": 0.019030406884849072,
"train/total_kl": 0.05099773760885
},
{
"epoch": 1.6657909551510603,
"grad_norm": 2.15625,
"learning_rate": 1.7500000000000002e-05,
"loss": 0.645,
"mean_token_accuracy": 0.8960767388343811,
"step": 2220,
"train/kl_loss_qwen": 0.03604310783557594,
"train/kl_loss_r1": 0.020090335281565785,
"train/total_kl": 0.056133443396538495
},
{
"epoch": 1.6695440045036594,
"grad_norm": 2.578125,
"learning_rate": 1.7471846846846847e-05,
"loss": 0.6465,
"mean_token_accuracy": 0.8933228254318237,
"step": 2225,
"train/kl_loss_qwen": 0.028659786516800522,
"train/kl_loss_r1": 0.01866114339791238,
"train/total_kl": 0.04732093075290322
},
{
"epoch": 1.6732970538562584,
"grad_norm": 2.453125,
"learning_rate": 1.7443693693693697e-05,
"loss": 0.6182,
"mean_token_accuracy": 0.9031960755586624,
"step": 2230,
"train/kl_loss_qwen": 0.03483367273584008,
"train/kl_loss_r1": 0.020910135982558132,
"train/total_kl": 0.05574380857869983
},
{
"epoch": 1.6770501032088572,
"grad_norm": 2.75,
"learning_rate": 1.7415540540540542e-05,
"loss": 0.6383,
"mean_token_accuracy": 0.8974160134792328,
"step": 2235,
"train/kl_loss_qwen": 0.029755527339875697,
"train/kl_loss_r1": 0.020382949942722918,
"train/total_kl": 0.050138477329164745
},
{
"epoch": 1.6808031525614562,
"grad_norm": 2.03125,
"learning_rate": 1.7387387387387388e-05,
"loss": 0.6439,
"mean_token_accuracy": 0.9057151556015015,
"step": 2240,
"train/kl_loss_qwen": 0.04374876599758863,
"train/kl_loss_r1": 0.026726429350674152,
"train/total_kl": 0.07047519516199827
},
{
"epoch": 1.6845562019140552,
"grad_norm": 2.484375,
"learning_rate": 1.7359234234234237e-05,
"loss": 0.6869,
"mean_token_accuracy": 0.8932524681091308,
"step": 2245,
"train/kl_loss_qwen": 0.043853827146813275,
"train/kl_loss_r1": 0.02495257118716836,
"train/total_kl": 0.06880639912560582
},
{
"epoch": 1.6883092512666542,
"grad_norm": 3.765625,
"learning_rate": 1.7331081081081082e-05,
"loss": 0.7045,
"mean_token_accuracy": 0.9062951624393463,
"step": 2250,
"train/kl_loss_qwen": 0.05141198909841478,
"train/kl_loss_r1": 0.027050549210980535,
"train/total_kl": 0.07846253886818885
},
{
"epoch": 1.692062300619253,
"grad_norm": 2.375,
"learning_rate": 1.7302927927927928e-05,
"loss": 0.646,
"mean_token_accuracy": 0.8936865895986557,
"step": 2255,
"train/kl_loss_qwen": 0.02825439111329615,
"train/kl_loss_r1": 0.01830715793184936,
"train/total_kl": 0.046561548765748736
},
{
"epoch": 1.695815349971852,
"grad_norm": 1.875,
"learning_rate": 1.7274774774774777e-05,
"loss": 0.6418,
"mean_token_accuracy": 0.8941173821687698,
"step": 2260,
"train/kl_loss_qwen": 0.024399951938539742,
"train/kl_loss_r1": 0.01719582751393318,
"train/total_kl": 0.04159577945247293
},
{
"epoch": 1.699568399324451,
"grad_norm": 2.21875,
"learning_rate": 1.7246621621621623e-05,
"loss": 0.6441,
"mean_token_accuracy": 0.9033589363098145,
"step": 2265,
"train/kl_loss_qwen": 0.03845631028525531,
"train/kl_loss_r1": 0.023384080873802303,
"train/total_kl": 0.061840390972793105
},
{
"epoch": 1.70332144867705,
"grad_norm": 2.109375,
"learning_rate": 1.721846846846847e-05,
"loss": 0.6912,
"mean_token_accuracy": 0.8872569084167481,
"step": 2270,
"train/kl_loss_qwen": 0.03908129506744444,
"train/kl_loss_r1": 0.02350794356316328,
"train/total_kl": 0.06258923830464483
},
{
"epoch": 1.707074498029649,
"grad_norm": 2.140625,
"learning_rate": 1.7190315315315317e-05,
"loss": 0.6399,
"mean_token_accuracy": 0.9103470027446747,
"step": 2275,
"train/kl_loss_qwen": 0.0428709767293185,
"train/kl_loss_r1": 0.024058361165225507,
"train/total_kl": 0.06692933682352305
},
{
"epoch": 1.710827547382248,
"grad_norm": 2.078125,
"learning_rate": 1.7162162162162163e-05,
"loss": 0.6621,
"mean_token_accuracy": 0.8940898805856705,
"step": 2280,
"train/kl_loss_qwen": 0.03766034827567637,
"train/kl_loss_r1": 0.02226076889783144,
"train/total_kl": 0.05992111759260297
},
{
"epoch": 1.714580596734847,
"grad_norm": 2.8125,
"learning_rate": 1.7134009009009012e-05,
"loss": 0.6359,
"mean_token_accuracy": 0.9065495610237122,
"step": 2285,
"train/kl_loss_qwen": 0.039660067204385994,
"train/kl_loss_r1": 0.024249562667682766,
"train/total_kl": 0.06390962991863489
},
{
"epoch": 1.718333646087446,
"grad_norm": 2.1875,
"learning_rate": 1.7105855855855858e-05,
"loss": 0.7075,
"mean_token_accuracy": 0.8981125056743622,
"step": 2290,
"train/kl_loss_qwen": 0.04942654981277883,
"train/kl_loss_r1": 0.027548507088795304,
"train/total_kl": 0.07697505690157413
},
{
"epoch": 1.7220866954400451,
"grad_norm": 2.53125,
"learning_rate": 1.7077702702702703e-05,
"loss": 0.6808,
"mean_token_accuracy": 0.8974245905876159,
"step": 2295,
"train/kl_loss_qwen": 0.03988172416575253,
"train/kl_loss_r1": 0.02420841958373785,
"train/total_kl": 0.06409014472737909
},
{
"epoch": 1.7258397447926441,
"grad_norm": 2.015625,
"learning_rate": 1.7049549549549552e-05,
"loss": 0.6455,
"mean_token_accuracy": 0.8952881097793579,
"step": 2300,
"train/kl_loss_qwen": 0.03257768559269607,
"train/kl_loss_r1": 0.020853790268301965,
"train/total_kl": 0.05343147618696094
},
{
"epoch": 1.7295927941452431,
"grad_norm": 2.3125,
"learning_rate": 1.7021396396396398e-05,
"loss": 0.7375,
"mean_token_accuracy": 0.9050968796014786,
"step": 2305,
"train/kl_loss_qwen": 0.05414223480038345,
"train/kl_loss_r1": 0.03398309061303735,
"train/total_kl": 0.08812532611191273
},
{
"epoch": 1.7333458434978422,
"grad_norm": 2.0625,
"learning_rate": 1.6993243243243244e-05,
"loss": 0.648,
"mean_token_accuracy": 0.9059912174940109,
"step": 2310,
"train/kl_loss_qwen": 0.04206879851408303,
"train/kl_loss_r1": 0.024805049877613783,
"train/total_kl": 0.06687384815886617
},
{
"epoch": 1.737098892850441,
"grad_norm": 2.1875,
"learning_rate": 1.6965090090090093e-05,
"loss": 0.6396,
"mean_token_accuracy": 0.8993474274873734,
"step": 2315,
"train/kl_loss_qwen": 0.03376688486896455,
"train/kl_loss_r1": 0.02014004997909069,
"train/total_kl": 0.05390693554654717
},
{
"epoch": 1.74085194220304,
"grad_norm": 4.09375,
"learning_rate": 1.693693693693694e-05,
"loss": 0.6538,
"mean_token_accuracy": 0.8981065779924393,
"step": 2320,
"train/kl_loss_qwen": 0.03625017390586436,
"train/kl_loss_r1": 0.022838318720459938,
"train/total_kl": 0.059088492393493654
},
{
"epoch": 1.744604991555639,
"grad_norm": 2.609375,
"learning_rate": 1.6908783783783784e-05,
"loss": 0.6706,
"mean_token_accuracy": 0.8976942479610444,
"step": 2325,
"train/kl_loss_qwen": 0.04188382257707417,
"train/kl_loss_r1": 0.023405383294448256,
"train/total_kl": 0.06528920531272889
},
{
"epoch": 1.748358040908238,
"grad_norm": 3.390625,
"learning_rate": 1.6880630630630633e-05,
"loss": 0.65,
"mean_token_accuracy": 0.8928337901830673,
"step": 2330,
"train/kl_loss_qwen": 0.02700037518516183,
"train/kl_loss_r1": 0.018946082750335335,
"train/total_kl": 0.045946458261460064
},
{
"epoch": 1.7521110902608368,
"grad_norm": 2.78125,
"learning_rate": 1.685247747747748e-05,
"loss": 0.6483,
"mean_token_accuracy": 0.8990386724472046,
"step": 2335,
"train/kl_loss_qwen": 0.038460137275978926,
"train/kl_loss_r1": 0.022701377421617507,
"train/total_kl": 0.0611615146510303
},
{
"epoch": 1.7558641396134358,
"grad_norm": 2.171875,
"learning_rate": 1.6824324324324324e-05,
"loss": 0.6027,
"mean_token_accuracy": 0.9036147683858872,
"step": 2340,
"train/kl_loss_qwen": 0.03626009058207273,
"train/kl_loss_r1": 0.020470161689445376,
"train/total_kl": 0.056730252131819724
},
{
"epoch": 1.7596171889660348,
"grad_norm": 2.4375,
"learning_rate": 1.6796171171171173e-05,
"loss": 0.6522,
"mean_token_accuracy": 0.9036729842424392,
"step": 2345,
"train/kl_loss_qwen": 0.040476148249581456,
"train/kl_loss_r1": 0.024120061844587325,
"train/total_kl": 0.06459621032699943
},
{
"epoch": 1.7633702383186338,
"grad_norm": 2.421875,
"learning_rate": 1.676801801801802e-05,
"loss": 0.6585,
"mean_token_accuracy": 0.8919114947319031,
"step": 2350,
"train/kl_loss_qwen": 0.03886307771317661,
"train/kl_loss_r1": 0.02233870788477361,
"train/total_kl": 0.061201786156743765
},
{
"epoch": 1.7671232876712328,
"grad_norm": 3.59375,
"learning_rate": 1.6739864864864868e-05,
"loss": 0.6984,
"mean_token_accuracy": 0.891047352552414,
"step": 2355,
"train/kl_loss_qwen": 0.03393220230937004,
"train/kl_loss_r1": 0.021642787707969548,
"train/total_kl": 0.05557498997077346
},
{
"epoch": 1.7708763370238318,
"grad_norm": 2.546875,
"learning_rate": 1.6711711711711714e-05,
"loss": 0.63,
"mean_token_accuracy": 0.8927449464797974,
"step": 2360,
"train/kl_loss_qwen": 0.02976813670247793,
"train/kl_loss_r1": 0.01950657251290977,
"train/total_kl": 0.049274709261953833
},
{
"epoch": 1.7746293863764309,
"grad_norm": 2.359375,
"learning_rate": 1.668355855855856e-05,
"loss": 0.6581,
"mean_token_accuracy": 0.9035369455814362,
"step": 2365,
"train/kl_loss_qwen": 0.042285366402938965,
"train/kl_loss_r1": 0.024320347933098674,
"train/total_kl": 0.06660571470856666
},
{
"epoch": 1.7783824357290299,
"grad_norm": 2.296875,
"learning_rate": 1.665540540540541e-05,
"loss": 0.6727,
"mean_token_accuracy": 0.902328222990036,
"step": 2370,
"train/kl_loss_qwen": 0.04390562102198601,
"train/kl_loss_r1": 0.025772933289408682,
"train/total_kl": 0.06967855421826244
},
{
"epoch": 1.782135485081629,
"grad_norm": 3.859375,
"learning_rate": 1.6627252252252254e-05,
"loss": 0.6492,
"mean_token_accuracy": 0.8949781268835068,
"step": 2375,
"train/kl_loss_qwen": 0.03299745530821383,
"train/kl_loss_r1": 0.020956188859418034,
"train/total_kl": 0.05395364463329315
},
{
"epoch": 1.785888534434228,
"grad_norm": 2.171875,
"learning_rate": 1.65990990990991e-05,
"loss": 0.6654,
"mean_token_accuracy": 0.9052214354276658,
"step": 2380,
"train/kl_loss_qwen": 0.04478082228451967,
"train/kl_loss_r1": 0.026699409168213607,
"train/total_kl": 0.0714802322909236
},
{
"epoch": 1.789641583786827,
"grad_norm": 2.671875,
"learning_rate": 1.657094594594595e-05,
"loss": 0.6821,
"mean_token_accuracy": 0.8889921605587006,
"step": 2385,
"train/kl_loss_qwen": 0.027508549252524973,
"train/kl_loss_r1": 0.018551756348460912,
"train/total_kl": 0.046060305833816526
},
{
"epoch": 1.793394633139426,
"grad_norm": 2.546875,
"learning_rate": 1.6542792792792794e-05,
"loss": 0.6535,
"mean_token_accuracy": 0.9026600360870362,
"step": 2390,
"train/kl_loss_qwen": 0.04096120540052652,
"train/kl_loss_r1": 0.023385793343186377,
"train/total_kl": 0.06434699958190322
},
{
"epoch": 1.7971476824920247,
"grad_norm": 2.84375,
"learning_rate": 1.651463963963964e-05,
"loss": 0.6864,
"mean_token_accuracy": 0.8991068810224533,
"step": 2395,
"train/kl_loss_qwen": 0.04450701423920691,
"train/kl_loss_r1": 0.026761355437338354,
"train/total_kl": 0.07126836953684687
},
{
"epoch": 1.8009007318446237,
"grad_norm": 2.6875,
"learning_rate": 1.648648648648649e-05,
"loss": 0.6365,
"mean_token_accuracy": 0.9044661819934845,
"step": 2400,
"train/kl_loss_qwen": 0.035820856038480994,
"train/kl_loss_r1": 0.02220798176713288,
"train/total_kl": 0.05802883738651872
},
{
"epoch": 1.8046537811972228,
"grad_norm": 2.265625,
"learning_rate": 1.6458333333333335e-05,
"loss": 0.6152,
"mean_token_accuracy": 0.9035373657941819,
"step": 2405,
"train/kl_loss_qwen": 0.0363229691516608,
"train/kl_loss_r1": 0.022318302607163786,
"train/total_kl": 0.05864127120003104
},
{
"epoch": 1.8084068305498218,
"grad_norm": 2.46875,
"learning_rate": 1.6430180180180184e-05,
"loss": 0.6387,
"mean_token_accuracy": 0.895477882027626,
"step": 2410,
"train/kl_loss_qwen": 0.027183825010433794,
"train/kl_loss_r1": 0.01949266265146434,
"train/total_kl": 0.046676487661898136
},
{
"epoch": 1.8121598799024206,
"grad_norm": 2.171875,
"learning_rate": 1.640202702702703e-05,
"loss": 0.6954,
"mean_token_accuracy": 0.8863406032323837,
"step": 2415,
"train/kl_loss_qwen": 0.042424371792003514,
"train/kl_loss_r1": 0.023042496014386415,
"train/total_kl": 0.06546686785295605
},
{
"epoch": 1.8159129292550196,
"grad_norm": 2.296875,
"learning_rate": 1.6373873873873875e-05,
"loss": 0.6458,
"mean_token_accuracy": 0.8962538540363312,
"step": 2420,
"train/kl_loss_qwen": 0.03665523463860154,
"train/kl_loss_r1": 0.021400606958195567,
"train/total_kl": 0.05805584192276001
},
{
"epoch": 1.8196659786076186,
"grad_norm": 2.25,
"learning_rate": 1.6345720720720724e-05,
"loss": 0.6925,
"mean_token_accuracy": 0.8971156001091003,
"step": 2425,
"train/kl_loss_qwen": 0.045820884173735976,
"train/kl_loss_r1": 0.026553369453176857,
"train/total_kl": 0.07237425344064832
},
{
"epoch": 1.8234190279602176,
"grad_norm": 2.234375,
"learning_rate": 1.631756756756757e-05,
"loss": 0.6525,
"mean_token_accuracy": 0.8997704178094864,
"step": 2430,
"train/kl_loss_qwen": 0.04271438363939524,
"train/kl_loss_r1": 0.023357636108994485,
"train/total_kl": 0.06607202040031553
},
{
"epoch": 1.8271720773128166,
"grad_norm": 2.65625,
"learning_rate": 1.6289414414414415e-05,
"loss": 0.6964,
"mean_token_accuracy": 0.8842611312866211,
"step": 2435,
"train/kl_loss_qwen": 0.029302482306957246,
"train/kl_loss_r1": 0.019395927991718055,
"train/total_kl": 0.048698410671204326
},
{
"epoch": 1.8309251266654156,
"grad_norm": 2.6875,
"learning_rate": 1.6261261261261264e-05,
"loss": 0.6202,
"mean_token_accuracy": 0.9004896342754364,
"step": 2440,
"train/kl_loss_qwen": 0.03328801547177136,
"train/kl_loss_r1": 0.021958896471187473,
"train/total_kl": 0.055246911384165286
},
{
"epoch": 1.8346781760180146,
"grad_norm": 2.359375,
"learning_rate": 1.623310810810811e-05,
"loss": 0.6904,
"mean_token_accuracy": 0.8995136767625809,
"step": 2445,
"train/kl_loss_qwen": 0.04684069836512208,
"train/kl_loss_r1": 0.026657813135534524,
"train/total_kl": 0.07349851159378887
},
{
"epoch": 1.8384312253706137,
"grad_norm": 2.03125,
"learning_rate": 1.6204954954954956e-05,
"loss": 0.658,
"mean_token_accuracy": 0.9060713022947311,
"step": 2450,
"train/kl_loss_qwen": 0.044447452668100594,
"train/kl_loss_r1": 0.025366590777412056,
"train/total_kl": 0.069814043212682
},
{
"epoch": 1.8421842747232127,
"grad_norm": 3.03125,
"learning_rate": 1.6176801801801805e-05,
"loss": 0.6285,
"mean_token_accuracy": 0.8991561025381088,
"step": 2455,
"train/kl_loss_qwen": 0.029106603050604463,
"train/kl_loss_r1": 0.019336808985099197,
"train/total_kl": 0.04844341184943914
},
{
"epoch": 1.8459373240758117,
"grad_norm": 2.375,
"learning_rate": 1.614864864864865e-05,
"loss": 0.6394,
"mean_token_accuracy": 0.8926957219839096,
"step": 2460,
"train/kl_loss_qwen": 0.03371071880683303,
"train/kl_loss_r1": 0.022470697574317456,
"train/total_kl": 0.0561814159154892
},
{
"epoch": 1.8496903734284107,
"grad_norm": 2.5,
"learning_rate": 1.6120495495495496e-05,
"loss": 0.6631,
"mean_token_accuracy": 0.8949247121810913,
"step": 2465,
"train/kl_loss_qwen": 0.03434062139131129,
"train/kl_loss_r1": 0.022925343550741672,
"train/total_kl": 0.05726596564054489
},
{
"epoch": 1.8534434227810097,
"grad_norm": 2.25,
"learning_rate": 1.6092342342342345e-05,
"loss": 0.6486,
"mean_token_accuracy": 0.8995777875185013,
"step": 2470,
"train/kl_loss_qwen": 0.03591888290829957,
"train/kl_loss_r1": 0.022369566606357694,
"train/total_kl": 0.05828845025971532
},
{
"epoch": 1.8571964721336087,
"grad_norm": 2.125,
"learning_rate": 1.606418918918919e-05,
"loss": 0.624,
"mean_token_accuracy": 0.8977777779102325,
"step": 2475,
"train/kl_loss_qwen": 0.03605815744958818,
"train/kl_loss_r1": 0.021802827855572103,
"train/total_kl": 0.057860984653234485
},
{
"epoch": 1.8609495214862075,
"grad_norm": 2.53125,
"learning_rate": 1.603603603603604e-05,
"loss": 0.6602,
"mean_token_accuracy": 0.8929906249046325,
"step": 2480,
"train/kl_loss_qwen": 0.03511486439965665,
"train/kl_loss_r1": 0.021810925099998713,
"train/total_kl": 0.056925789546221496
},
{
"epoch": 1.8647025708388065,
"grad_norm": 2.171875,
"learning_rate": 1.6007882882882885e-05,
"loss": 0.628,
"mean_token_accuracy": 0.9025939643383026,
"step": 2485,
"train/kl_loss_qwen": 0.03195135928690433,
"train/kl_loss_r1": 0.020892154052853586,
"train/total_kl": 0.05284351296722889
},
{
"epoch": 1.8684556201914055,
"grad_norm": 5.0,
"learning_rate": 1.597972972972973e-05,
"loss": 0.7183,
"mean_token_accuracy": 0.8897970050573349,
"step": 2490,
"train/kl_loss_qwen": 0.04254669458605349,
"train/kl_loss_r1": 0.028625112492591143,
"train/total_kl": 0.07117180703207851
},
{
"epoch": 1.8722086695440046,
"grad_norm": 2.234375,
"learning_rate": 1.595157657657658e-05,
"loss": 0.6634,
"mean_token_accuracy": 0.9010548859834671,
"step": 2495,
"train/kl_loss_qwen": 0.043688770523294805,
"train/kl_loss_r1": 0.02604842819273472,
"train/total_kl": 0.0697371986694634
},
{
"epoch": 1.8759617188966033,
"grad_norm": 2.828125,
"learning_rate": 1.5923423423423422e-05,
"loss": 0.6302,
"mean_token_accuracy": 0.8924409061670303,
"step": 2500,
"train/kl_loss_qwen": 0.03589551253244281,
"train/kl_loss_r1": 0.021566737676039338,
"train/total_kl": 0.057462250161916015
},
{
"epoch": 1.8797147682492024,
"grad_norm": 3.140625,
"learning_rate": 1.5895270270270268e-05,
"loss": 0.6238,
"mean_token_accuracy": 0.8932481467723846,
"step": 2505,
"train/kl_loss_qwen": 0.03078452721238136,
"train/kl_loss_r1": 0.01884332112967968,
"train/total_kl": 0.04962784806266427
},
{
"epoch": 1.8834678176018014,
"grad_norm": 2.328125,
"learning_rate": 1.5867117117117117e-05,
"loss": 0.6864,
"mean_token_accuracy": 0.9002302587032318,
"step": 2510,
"train/kl_loss_qwen": 0.040710377506911755,
"train/kl_loss_r1": 0.027830192539840936,
"train/total_kl": 0.06854057023301721
},
{
"epoch": 1.8872208669544004,
"grad_norm": 2.265625,
"learning_rate": 1.5838963963963963e-05,
"loss": 0.685,
"mean_token_accuracy": 0.9001519799232482,
"step": 2515,
"train/kl_loss_qwen": 0.04527458641678095,
"train/kl_loss_r1": 0.027129481686279176,
"train/total_kl": 0.07240406852215528
},
{
"epoch": 1.8909739163069994,
"grad_norm": 4.4375,
"learning_rate": 1.5810810810810808e-05,
"loss": 0.734,
"mean_token_accuracy": 0.8838595479726792,
"step": 2520,
"train/kl_loss_qwen": 0.04631765298545361,
"train/kl_loss_r1": 0.02677953545935452,
"train/total_kl": 0.07309718886390329
},
{
"epoch": 1.8947269656595984,
"grad_norm": 2.046875,
"learning_rate": 1.5782657657657657e-05,
"loss": 0.6364,
"mean_token_accuracy": 0.897225198149681,
"step": 2525,
"train/kl_loss_qwen": 0.03321312516927719,
"train/kl_loss_r1": 0.021134045580402015,
"train/total_kl": 0.054347170796245334
},
{
"epoch": 1.8984800150121974,
"grad_norm": 1.984375,
"learning_rate": 1.5754504504504503e-05,
"loss": 0.6595,
"mean_token_accuracy": 0.9082975298166275,
"step": 2530,
"train/kl_loss_qwen": 0.046546011511236426,
"train/kl_loss_r1": 0.027138574048876762,
"train/total_kl": 0.07368458630517125
},
{
"epoch": 1.9022330643647964,
"grad_norm": 2.5625,
"learning_rate": 1.572635135135135e-05,
"loss": 0.6913,
"mean_token_accuracy": 0.8941433936357498,
"step": 2535,
"train/kl_loss_qwen": 0.042869471944868565,
"train/kl_loss_r1": 0.024872014205902813,
"train/total_kl": 0.06774148521944881
},
{
"epoch": 1.9059861137173955,
"grad_norm": 3.90625,
"learning_rate": 1.5698198198198198e-05,
"loss": 0.6445,
"mean_token_accuracy": 0.8958324611186981,
"step": 2540,
"train/kl_loss_qwen": 0.026003137696534395,
"train/kl_loss_r1": 0.01718523451127112,
"train/total_kl": 0.04318837262690067
},
{
"epoch": 1.9097391630699945,
"grad_norm": 2.34375,
"learning_rate": 1.5670045045045043e-05,
"loss": 0.6107,
"mean_token_accuracy": 0.9057632029056549,
"step": 2545,
"train/kl_loss_qwen": 0.028932252386584877,
"train/kl_loss_r1": 0.019510349445044994,
"train/total_kl": 0.04844260262325406
},
{
"epoch": 1.9134922124225935,
"grad_norm": 2.890625,
"learning_rate": 1.5641891891891892e-05,
"loss": 0.6741,
"mean_token_accuracy": 0.898052641749382,
"step": 2550,
"train/kl_loss_qwen": 0.04487997838295996,
"train/kl_loss_r1": 0.02543866541236639,
"train/total_kl": 0.07031864309683442
},
{
"epoch": 1.9172452617751925,
"grad_norm": 2.671875,
"learning_rate": 1.5613738738738738e-05,
"loss": 0.6402,
"mean_token_accuracy": 0.8991858065128326,
"step": 2555,
"train/kl_loss_qwen": 0.036262226989492774,
"train/kl_loss_r1": 0.021829276252537964,
"train/total_kl": 0.05809150356799364
},
{
"epoch": 1.9209983111277913,
"grad_norm": 2.234375,
"learning_rate": 1.5585585585585584e-05,
"loss": 0.6416,
"mean_token_accuracy": 0.9058014422655105,
"step": 2560,
"train/kl_loss_qwen": 0.04190314500592649,
"train/kl_loss_r1": 0.022653905022889376,
"train/total_kl": 0.06455705035477877
},
{
"epoch": 1.9247513604803903,
"grad_norm": 1.890625,
"learning_rate": 1.5557432432432433e-05,
"loss": 0.6556,
"mean_token_accuracy": 0.9057673960924149,
"step": 2565,
"train/kl_loss_qwen": 0.04168571154586971,
"train/kl_loss_r1": 0.02547265887260437,
"train/total_kl": 0.06715837102383375
},
{
"epoch": 1.9285044098329893,
"grad_norm": 2.03125,
"learning_rate": 1.5529279279279278e-05,
"loss": 0.6949,
"mean_token_accuracy": 0.8979399770498275,
"step": 2570,
"train/kl_loss_qwen": 0.044487979961559176,
"train/kl_loss_r1": 0.024335165927186608,
"train/total_kl": 0.0688231460750103
},
{
"epoch": 1.9322574591855883,
"grad_norm": 2.671875,
"learning_rate": 1.5501126126126124e-05,
"loss": 0.6949,
"mean_token_accuracy": 0.8990555852651596,
"step": 2575,
"train/kl_loss_qwen": 0.044843436265364287,
"train/kl_loss_r1": 0.025624512927606702,
"train/total_kl": 0.07046794975176454
},
{
"epoch": 1.9360105085381871,
"grad_norm": 2.421875,
"learning_rate": 1.5472972972972973e-05,
"loss": 0.6969,
"mean_token_accuracy": 0.8940569669008255,
"step": 2580,
"train/kl_loss_qwen": 0.04509501978754997,
"train/kl_loss_r1": 0.022757333144545554,
"train/total_kl": 0.06785235274583101
},
{
"epoch": 1.9397635578907861,
"grad_norm": 2.078125,
"learning_rate": 1.544481981981982e-05,
"loss": 0.6293,
"mean_token_accuracy": 0.8902778685092926,
"step": 2585,
"train/kl_loss_qwen": 0.025324915908277033,
"train/kl_loss_r1": 0.0162981690838933,
"train/total_kl": 0.04162308508530259
},
{
"epoch": 1.9435166072433852,
"grad_norm": 2.3125,
"learning_rate": 1.5416666666666664e-05,
"loss": 0.6761,
"mean_token_accuracy": 0.8929882168769836,
"step": 2590,
"train/kl_loss_qwen": 0.044043076876550916,
"train/kl_loss_r1": 0.02439775476232171,
"train/total_kl": 0.06844083098694682
},
{
"epoch": 1.9472696565959842,
"grad_norm": 2.265625,
"learning_rate": 1.5388513513513513e-05,
"loss": 0.6411,
"mean_token_accuracy": 0.8958060652017593,
"step": 2595,
"train/kl_loss_qwen": 0.0404059233609587,
"train/kl_loss_r1": 0.022264586249366402,
"train/total_kl": 0.06267051044851542
},
{
"epoch": 1.9510227059485832,
"grad_norm": 2.40625,
"learning_rate": 1.536036036036036e-05,
"loss": 0.6775,
"mean_token_accuracy": 0.8902673900127411,
"step": 2600,
"train/kl_loss_qwen": 0.0354644276201725,
"train/kl_loss_r1": 0.022069192258641124,
"train/total_kl": 0.05753362011164427
},
{
"epoch": 1.9547757553011822,
"grad_norm": 2.375,
"learning_rate": 1.5332207207207205e-05,
"loss": 0.6194,
"mean_token_accuracy": 0.9009991466999054,
"step": 2605,
"train/kl_loss_qwen": 0.03405302995815873,
"train/kl_loss_r1": 0.020596451964229344,
"train/total_kl": 0.054649482294917104
},
{
"epoch": 1.9585288046537812,
"grad_norm": 2.5625,
"learning_rate": 1.5304054054054054e-05,
"loss": 0.6243,
"mean_token_accuracy": 0.901807826757431,
"step": 2610,
"train/kl_loss_qwen": 0.03377542248927057,
"train/kl_loss_r1": 0.019333705538883805,
"train/total_kl": 0.05310912802815437
},
{
"epoch": 1.9622818540063802,
"grad_norm": 2.34375,
"learning_rate": 1.52759009009009e-05,
"loss": 0.6525,
"mean_token_accuracy": 0.8945951163768768,
"step": 2615,
"train/kl_loss_qwen": 0.03728666617535055,
"train/kl_loss_r1": 0.023089352110400797,
"train/total_kl": 0.06037601875141263
},
{
"epoch": 1.9660349033589792,
"grad_norm": 2.3125,
"learning_rate": 1.5247747747747747e-05,
"loss": 0.6656,
"mean_token_accuracy": 0.8967136681079865,
"step": 2620,
"train/kl_loss_qwen": 0.040263551147654654,
"train/kl_loss_r1": 0.02349916808307171,
"train/total_kl": 0.06376271946355701
},
{
"epoch": 1.9697879527115782,
"grad_norm": 2.484375,
"learning_rate": 1.5219594594594594e-05,
"loss": 0.7433,
"mean_token_accuracy": 0.8890212267637253,
"step": 2625,
"train/kl_loss_qwen": 0.04862540089525282,
"train/kl_loss_r1": 0.02606220580637455,
"train/total_kl": 0.07468760693445801
},
{
"epoch": 1.9735410020641773,
"grad_norm": 2.765625,
"learning_rate": 1.5191441441441441e-05,
"loss": 0.6326,
"mean_token_accuracy": 0.905896446108818,
"step": 2630,
"train/kl_loss_qwen": 0.036712908372282985,
"train/kl_loss_r1": 0.022241059923544526,
"train/total_kl": 0.05895396815612912
},
{
"epoch": 1.9772940514167763,
"grad_norm": 2.328125,
"learning_rate": 1.5163288288288287e-05,
"loss": 0.61,
"mean_token_accuracy": 0.8993132084608078,
"step": 2635,
"train/kl_loss_qwen": 0.030034108366817237,
"train/kl_loss_r1": 0.019998513581231236,
"train/total_kl": 0.050032622180879116
},
{
"epoch": 1.981047100769375,
"grad_norm": 1.9609375,
"learning_rate": 1.5135135135135134e-05,
"loss": 0.7277,
"mean_token_accuracy": 0.8941838622093201,
"step": 2640,
"train/kl_loss_qwen": 0.045652749948203564,
"train/kl_loss_r1": 0.02867605178616941,
"train/total_kl": 0.07432880057021976
},
{
"epoch": 1.984800150121974,
"grad_norm": 2.34375,
"learning_rate": 1.5106981981981982e-05,
"loss": 0.6712,
"mean_token_accuracy": 0.9011097520589828,
"step": 2645,
"train/kl_loss_qwen": 0.04273656592704356,
"train/kl_loss_r1": 0.024876082316040993,
"train/total_kl": 0.06761264828965068
},
{
"epoch": 1.988553199474573,
"grad_norm": 2.15625,
"learning_rate": 1.5078828828828827e-05,
"loss": 0.6631,
"mean_token_accuracy": 0.9097787618637085,
"step": 2650,
"train/kl_loss_qwen": 0.04512282339856029,
"train/kl_loss_r1": 0.02762483968399465,
"train/total_kl": 0.07274766266345978
},
{
"epoch": 1.992306248827172,
"grad_norm": 2.421875,
"learning_rate": 1.5050675675675674e-05,
"loss": 0.7407,
"mean_token_accuracy": 0.8982425272464752,
"step": 2655,
"train/kl_loss_qwen": 0.05134777058847249,
"train/kl_loss_r1": 0.03388720662333071,
"train/total_kl": 0.08523497739806771
},
{
"epoch": 1.996059298179771,
"grad_norm": 2.546875,
"learning_rate": 1.5022522522522522e-05,
"loss": 0.6543,
"mean_token_accuracy": 0.8952676713466644,
"step": 2660,
"train/kl_loss_qwen": 0.034134725807234645,
"train/kl_loss_r1": 0.022086436208337546,
"train/total_kl": 0.05622116271406412
},
{
"epoch": 1.99981234753237,
"grad_norm": 2.78125,
"learning_rate": 1.4994369369369371e-05,
"loss": 0.6699,
"mean_token_accuracy": 0.905188474059105,
"step": 2665,
"train/kl_loss_qwen": 0.04267058554105461,
"train/kl_loss_r1": 0.025924119912087918,
"train/total_kl": 0.06859470587223768
},
{
"epoch": 2.003002439482079,
"grad_norm": 2.671875,
"learning_rate": 1.4966216216216217e-05,
"loss": 0.5866,
"mean_token_accuracy": 0.9284321490456077,
"step": 2670,
"train/kl_loss_qwen": 0.03529138786389547,
"train/kl_loss_r1": 0.022011635715470594,
"train/total_kl": 0.05730302390806815
},
{
"epoch": 2.006755488834678,
"grad_norm": 1.6328125,
"learning_rate": 1.4938063063063064e-05,
"loss": 0.5229,
"mean_token_accuracy": 0.9346529483795166,
"step": 2675,
"train/kl_loss_qwen": 0.038794494094327094,
"train/kl_loss_r1": 0.020536230690777302,
"train/total_kl": 0.05933072408661246
},
{
"epoch": 2.010508538187277,
"grad_norm": 1.890625,
"learning_rate": 1.4909909909909911e-05,
"loss": 0.5382,
"mean_token_accuracy": 0.9333297491073609,
"step": 2680,
"train/kl_loss_qwen": 0.039200321026146415,
"train/kl_loss_r1": 0.02334402627311647,
"train/total_kl": 0.06254434688016772
},
{
"epoch": 2.014261587539876,
"grad_norm": 1.640625,
"learning_rate": 1.4881756756756757e-05,
"loss": 0.5865,
"mean_token_accuracy": 0.9402651727199555,
"step": 2685,
"train/kl_loss_qwen": 0.05096025592647493,
"train/kl_loss_r1": 0.02823121869005263,
"train/total_kl": 0.07919147480279207
},
{
"epoch": 2.018014636892475,
"grad_norm": 1.6328125,
"learning_rate": 1.4853603603603604e-05,
"loss": 0.5996,
"mean_token_accuracy": 0.9371675610542297,
"step": 2690,
"train/kl_loss_qwen": 0.05012912107631564,
"train/kl_loss_r1": 0.02651134324260056,
"train/total_kl": 0.07664046408608556
},
{
"epoch": 2.021767686245074,
"grad_norm": 1.546875,
"learning_rate": 1.4825450450450452e-05,
"loss": 0.5284,
"mean_token_accuracy": 0.9431761652231216,
"step": 2695,
"train/kl_loss_qwen": 0.040003891987726095,
"train/kl_loss_r1": 0.023336136527359486,
"train/total_kl": 0.06334002930670976
},
{
"epoch": 2.025520735597673,
"grad_norm": 1.7734375,
"learning_rate": 1.4797297297297299e-05,
"loss": 0.5389,
"mean_token_accuracy": 0.9353849530220032,
"step": 2700,
"train/kl_loss_qwen": 0.04013286265544593,
"train/kl_loss_r1": 0.023519261833280326,
"train/total_kl": 0.06365212500095367
},
{
"epoch": 2.029273784950272,
"grad_norm": 1.59375,
"learning_rate": 1.4769144144144144e-05,
"loss": 0.5444,
"mean_token_accuracy": 0.9298721730709076,
"step": 2705,
"train/kl_loss_qwen": 0.03505720882676542,
"train/kl_loss_r1": 0.020959292305633426,
"train/total_kl": 0.056016501411795615
},
{
"epoch": 2.0330268343028712,
"grad_norm": 2.390625,
"learning_rate": 1.4740990990990992e-05,
"loss": 0.5417,
"mean_token_accuracy": 0.9301694184541702,
"step": 2710,
"train/kl_loss_qwen": 0.03806868428364396,
"train/kl_loss_r1": 0.022985676769167185,
"train/total_kl": 0.06105436040088534
},
{
"epoch": 2.0367798836554702,
"grad_norm": 3.109375,
"learning_rate": 1.471283783783784e-05,
"loss": 0.6252,
"mean_token_accuracy": 0.936267939209938,
"step": 2715,
"train/kl_loss_qwen": 0.051870274590328336,
"train/kl_loss_r1": 0.02979482486844063,
"train/total_kl": 0.0816650996915996
},
{
"epoch": 2.0405329330080693,
"grad_norm": 1.8984375,
"learning_rate": 1.4684684684684685e-05,
"loss": 0.5434,
"mean_token_accuracy": 0.9378133803606034,
"step": 2720,
"train/kl_loss_qwen": 0.04338777447119355,
"train/kl_loss_r1": 0.02462744093500078,
"train/total_kl": 0.0680152153596282
},
{
"epoch": 2.044285982360668,
"grad_norm": 2.40625,
"learning_rate": 1.4656531531531532e-05,
"loss": 0.5725,
"mean_token_accuracy": 0.9371558010578156,
"step": 2725,
"train/kl_loss_qwen": 0.04540781215764582,
"train/kl_loss_r1": 0.02494020722806454,
"train/total_kl": 0.07034801943227649
},
{
"epoch": 2.048039031713267,
"grad_norm": 2.109375,
"learning_rate": 1.462837837837838e-05,
"loss": 0.541,
"mean_token_accuracy": 0.9365566194057464,
"step": 2730,
"train/kl_loss_qwen": 0.03833492188714445,
"train/kl_loss_r1": 0.024261068552732468,
"train/total_kl": 0.06259599067270756
},
{
"epoch": 2.051792081065866,
"grad_norm": 2.171875,
"learning_rate": 1.4600225225225227e-05,
"loss": 0.5604,
"mean_token_accuracy": 0.9367622673511505,
"step": 2735,
"train/kl_loss_qwen": 0.04242282547056675,
"train/kl_loss_r1": 0.02575512886978686,
"train/total_kl": 0.06817795345559716
},
{
"epoch": 2.055545130418465,
"grad_norm": 1.90625,
"learning_rate": 1.4572072072072072e-05,
"loss": 0.5316,
"mean_token_accuracy": 0.9340348184108734,
"step": 2740,
"train/kl_loss_qwen": 0.034276322834193705,
"train/kl_loss_r1": 0.021242431038990615,
"train/total_kl": 0.05551875364035368
},
{
"epoch": 2.059298179771064,
"grad_norm": 1.9453125,
"learning_rate": 1.454391891891892e-05,
"loss": 0.5167,
"mean_token_accuracy": 0.9383042812347412,
"step": 2745,
"train/kl_loss_qwen": 0.03480586018413305,
"train/kl_loss_r1": 0.022361103910952806,
"train/total_kl": 0.05716696446761489
},
{
"epoch": 2.063051229123663,
"grad_norm": 1.859375,
"learning_rate": 1.4515765765765767e-05,
"loss": 0.5128,
"mean_token_accuracy": 0.9425839811563492,
"step": 2750,
"train/kl_loss_qwen": 0.037367559224367144,
"train/kl_loss_r1": 0.02356030042283237,
"train/total_kl": 0.0609278591349721
},
{
"epoch": 2.066804278476262,
"grad_norm": 1.796875,
"learning_rate": 1.4487612612612613e-05,
"loss": 0.5459,
"mean_token_accuracy": 0.9433245003223419,
"step": 2755,
"train/kl_loss_qwen": 0.04606554531492293,
"train/kl_loss_r1": 0.026836787583306432,
"train/total_kl": 0.07290233206003904
},
{
"epoch": 2.070557327828861,
"grad_norm": 1.828125,
"learning_rate": 1.445945945945946e-05,
"loss": 0.5175,
"mean_token_accuracy": 0.9421418130397796,
"step": 2760,
"train/kl_loss_qwen": 0.039062590803951025,
"train/kl_loss_r1": 0.02469899938441813,
"train/total_kl": 0.063761589769274
},
{
"epoch": 2.07431037718146,
"grad_norm": 2.734375,
"learning_rate": 1.4431306306306307e-05,
"loss": 0.5476,
"mean_token_accuracy": 0.9274614602327347,
"step": 2765,
"train/kl_loss_qwen": 0.03057148279622197,
"train/kl_loss_r1": 0.020619633514434098,
"train/total_kl": 0.05119111640378833
},
{
"epoch": 2.078063426534059,
"grad_norm": 1.875,
"learning_rate": 1.4403153153153155e-05,
"loss": 0.52,
"mean_token_accuracy": 0.9378704875707626,
"step": 2770,
"train/kl_loss_qwen": 0.03401905889622867,
"train/kl_loss_r1": 0.02245729574933648,
"train/total_kl": 0.056476354505866765
},
{
"epoch": 2.081816475886658,
"grad_norm": 1.9453125,
"learning_rate": 1.4375e-05,
"loss": 0.5465,
"mean_token_accuracy": 0.943485426902771,
"step": 2775,
"train/kl_loss_qwen": 0.043185991467908025,
"train/kl_loss_r1": 0.0270145779941231,
"train/total_kl": 0.07020056927576661
},
{
"epoch": 2.085569525239257,
"grad_norm": 2.15625,
"learning_rate": 1.4346846846846848e-05,
"loss": 0.5808,
"mean_token_accuracy": 0.9374119788408279,
"step": 2780,
"train/kl_loss_qwen": 0.04530818494968116,
"train/kl_loss_r1": 0.026854591304436327,
"train/total_kl": 0.07216277718544006
},
{
"epoch": 2.089322574591856,
"grad_norm": 2.109375,
"learning_rate": 1.4318693693693695e-05,
"loss": 0.538,
"mean_token_accuracy": 0.9360768616199493,
"step": 2785,
"train/kl_loss_qwen": 0.04038170026615262,
"train/kl_loss_r1": 0.023084452422335745,
"train/total_kl": 0.06346615301445127
},
{
"epoch": 2.093075623944455,
"grad_norm": 1.8046875,
"learning_rate": 1.429054054054054e-05,
"loss": 0.557,
"mean_token_accuracy": 0.9383584886789322,
"step": 2790,
"train/kl_loss_qwen": 0.04247748665511608,
"train/kl_loss_r1": 0.024677752703428268,
"train/total_kl": 0.0671552394516766
},
{
"epoch": 2.096828673297054,
"grad_norm": 3.46875,
"learning_rate": 1.4262387387387388e-05,
"loss": 0.5629,
"mean_token_accuracy": 0.9350256085395813,
"step": 2795,
"train/kl_loss_qwen": 0.03826589668169618,
"train/kl_loss_r1": 0.022944721672683955,
"train/total_kl": 0.061210617609322074
},
{
"epoch": 2.100581722649653,
"grad_norm": 1.9453125,
"learning_rate": 1.4234234234234235e-05,
"loss": 0.5308,
"mean_token_accuracy": 0.939920824766159,
"step": 2800,
"train/kl_loss_qwen": 0.038421140238642695,
"train/kl_loss_r1": 0.024384385114535688,
"train/total_kl": 0.06280552502721548
},
{
"epoch": 2.104334772002252,
"grad_norm": 1.8203125,
"learning_rate": 1.4206081081081083e-05,
"loss": 0.5652,
"mean_token_accuracy": 0.9412952274084091,
"step": 2805,
"train/kl_loss_qwen": 0.04530099257826805,
"train/kl_loss_r1": 0.026747741783037782,
"train/total_kl": 0.07204873552545905
},
{
"epoch": 2.1080878213548506,
"grad_norm": 1.8984375,
"learning_rate": 1.4177927927927928e-05,
"loss": 0.6096,
"mean_token_accuracy": 0.930394884943962,
"step": 2810,
"train/kl_loss_qwen": 0.04740149336867035,
"train/kl_loss_r1": 0.026018257485702634,
"train/total_kl": 0.07341975113376975
},
{
"epoch": 2.1118408707074496,
"grad_norm": 2.171875,
"learning_rate": 1.4149774774774776e-05,
"loss": 0.5226,
"mean_token_accuracy": 0.9398204326629639,
"step": 2815,
"train/kl_loss_qwen": 0.03849638062529266,
"train/kl_loss_r1": 0.023003754345700143,
"train/total_kl": 0.061500134877860546
},
{
"epoch": 2.1155939200600486,
"grad_norm": 2.625,
"learning_rate": 1.4121621621621623e-05,
"loss": 0.5582,
"mean_token_accuracy": 0.9342907398939133,
"step": 2820,
"train/kl_loss_qwen": 0.042439007526263596,
"train/kl_loss_r1": 0.023711348557844757,
"train/total_kl": 0.06615035515278578
},
{
"epoch": 2.1193469694126477,
"grad_norm": 2.171875,
"learning_rate": 1.4093468468468469e-05,
"loss": 0.563,
"mean_token_accuracy": 0.9395235121250153,
"step": 2825,
"train/kl_loss_qwen": 0.043938075797632335,
"train/kl_loss_r1": 0.025616383599117398,
"train/total_kl": 0.06955445893108844
},
{
"epoch": 2.1231000187652467,
"grad_norm": 2.625,
"learning_rate": 1.4065315315315316e-05,
"loss": 0.5054,
"mean_token_accuracy": 0.9369919955730438,
"step": 2830,
"train/kl_loss_qwen": 0.03191206702031195,
"train/kl_loss_r1": 0.02116851476021111,
"train/total_kl": 0.053080581780523065
},
{
"epoch": 2.1268530681178457,
"grad_norm": 2.046875,
"learning_rate": 1.4037162162162163e-05,
"loss": 0.5352,
"mean_token_accuracy": 0.9313021749258041,
"step": 2835,
"train/kl_loss_qwen": 0.034244656283408406,
"train/kl_loss_r1": 0.02085883393883705,
"train/total_kl": 0.05510349003598094
},
{
"epoch": 2.1306061174704447,
"grad_norm": 1.9765625,
"learning_rate": 1.400900900900901e-05,
"loss": 0.5108,
"mean_token_accuracy": 0.9344165354967118,
"step": 2840,
"train/kl_loss_qwen": 0.03441030657850206,
"train/kl_loss_r1": 0.02208532360382378,
"train/total_kl": 0.05649562999606132
},
{
"epoch": 2.1343591668230437,
"grad_norm": 1.8515625,
"learning_rate": 1.3980855855855856e-05,
"loss": 0.561,
"mean_token_accuracy": 0.9328974574804306,
"step": 2845,
"train/kl_loss_qwen": 0.04245760082267225,
"train/kl_loss_r1": 0.02515069688670337,
"train/total_kl": 0.06760829733684659
},
{
"epoch": 2.1381122161756427,
"grad_norm": 1.828125,
"learning_rate": 1.3952702702702704e-05,
"loss": 0.5009,
"mean_token_accuracy": 0.9370256125926971,
"step": 2850,
"train/kl_loss_qwen": 0.03316999180242419,
"train/kl_loss_r1": 0.02016733498312533,
"train/total_kl": 0.05333732720464468
},
{
"epoch": 2.1418652655282417,
"grad_norm": 2.125,
"learning_rate": 1.3924549549549551e-05,
"loss": 0.5163,
"mean_token_accuracy": 0.9422374963760376,
"step": 2855,
"train/kl_loss_qwen": 0.039404284209012985,
"train/kl_loss_r1": 0.02388715702109039,
"train/total_kl": 0.0632914412766695
},
{
"epoch": 2.1456183148808408,
"grad_norm": 1.703125,
"learning_rate": 1.3896396396396397e-05,
"loss": 0.5452,
"mean_token_accuracy": 0.9346591323614121,
"step": 2860,
"train/kl_loss_qwen": 0.03737853961065411,
"train/kl_loss_r1": 0.02262025591917336,
"train/total_kl": 0.059998796228319405
},
{
"epoch": 2.1493713642334398,
"grad_norm": 1.78125,
"learning_rate": 1.3868243243243244e-05,
"loss": 0.5743,
"mean_token_accuracy": 0.937825882434845,
"step": 2865,
"train/kl_loss_qwen": 0.04654515474103391,
"train/kl_loss_r1": 0.026124754128977655,
"train/total_kl": 0.07266990933567286
},
{
"epoch": 2.153124413586039,
"grad_norm": 2.265625,
"learning_rate": 1.3840090090090091e-05,
"loss": 0.6123,
"mean_token_accuracy": 0.922364792227745,
"step": 2870,
"train/kl_loss_qwen": 0.04081809539347887,
"train/kl_loss_r1": 0.024002627190202474,
"train/total_kl": 0.06482072221115232
},
{
"epoch": 2.156877462938638,
"grad_norm": 2.75,
"learning_rate": 1.3811936936936939e-05,
"loss": 0.6156,
"mean_token_accuracy": 0.9291838884353638,
"step": 2875,
"train/kl_loss_qwen": 0.047036360343918206,
"train/kl_loss_r1": 0.02790973465889692,
"train/total_kl": 0.07494609467685223
},
{
"epoch": 2.160630512291237,
"grad_norm": 1.90625,
"learning_rate": 1.3783783783783784e-05,
"loss": 0.5744,
"mean_token_accuracy": 0.9351732730865479,
"step": 2880,
"train/kl_loss_qwen": 0.04357582703232765,
"train/kl_loss_r1": 0.026025883946567775,
"train/total_kl": 0.06960171181708574
},
{
"epoch": 2.1643835616438354,
"grad_norm": 1.734375,
"learning_rate": 1.3755630630630632e-05,
"loss": 0.5392,
"mean_token_accuracy": 0.9364217579364776,
"step": 2885,
"train/kl_loss_qwen": 0.03916121292859316,
"train/kl_loss_r1": 0.022491829935461283,
"train/total_kl": 0.061653042957186696
},
{
"epoch": 2.1681366109964344,
"grad_norm": 2.65625,
"learning_rate": 1.3727477477477479e-05,
"loss": 0.5454,
"mean_token_accuracy": 0.9335968852043152,
"step": 2890,
"train/kl_loss_qwen": 0.03318686801940203,
"train/kl_loss_r1": 0.021574988728389144,
"train/total_kl": 0.0547618567943573
},
{
"epoch": 2.1718896603490334,
"grad_norm": 2.03125,
"learning_rate": 1.3699324324324325e-05,
"loss": 0.5635,
"mean_token_accuracy": 0.9308214575052262,
"step": 2895,
"train/kl_loss_qwen": 0.041395931225270036,
"train/kl_loss_r1": 0.02332762386649847,
"train/total_kl": 0.06472355434671044
},
{
"epoch": 2.1756427097016324,
"grad_norm": 3.078125,
"learning_rate": 1.3671171171171172e-05,
"loss": 0.5212,
"mean_token_accuracy": 0.9229843825101852,
"step": 2900,
"train/kl_loss_qwen": 0.02835620930418372,
"train/kl_loss_r1": 0.017738517560064792,
"train/total_kl": 0.04609472677111626
},
{
"epoch": 2.1793957590542314,
"grad_norm": 2.09375,
"learning_rate": 1.364301801801802e-05,
"loss": 0.5051,
"mean_token_accuracy": 0.9343967109918594,
"step": 2905,
"train/kl_loss_qwen": 0.0359275649767369,
"train/kl_loss_r1": 0.0219997838139534,
"train/total_kl": 0.05792734948918223
},
{
"epoch": 2.1831488084068305,
"grad_norm": 2.125,
"learning_rate": 1.3614864864864867e-05,
"loss": 0.5687,
"mean_token_accuracy": 0.9289180606603622,
"step": 2910,
"train/kl_loss_qwen": 0.043711404176428915,
"train/kl_loss_r1": 0.025724610220640896,
"train/total_kl": 0.06943601546809078
},
{
"epoch": 2.1869018577594295,
"grad_norm": 2.125,
"learning_rate": 1.358671171171171e-05,
"loss": 0.4979,
"mean_token_accuracy": 0.9360549032688141,
"step": 2915,
"train/kl_loss_qwen": 0.0300402055028826,
"train/kl_loss_r1": 0.0205923215020448,
"train/total_kl": 0.050632527004927395
},
{
"epoch": 2.1906549071120285,
"grad_norm": 2.34375,
"learning_rate": 1.3558558558558558e-05,
"loss": 0.5875,
"mean_token_accuracy": 0.9278737664222717,
"step": 2920,
"train/kl_loss_qwen": 0.043786196783185,
"train/kl_loss_r1": 0.025323738995939492,
"train/total_kl": 0.06910993559285998
},
{
"epoch": 2.1944079564646275,
"grad_norm": 3.390625,
"learning_rate": 1.3530405405405405e-05,
"loss": 0.5316,
"mean_token_accuracy": 0.9379894882440567,
"step": 2925,
"train/kl_loss_qwen": 0.03716716575436294,
"train/kl_loss_r1": 0.02201431319117546,
"train/total_kl": 0.059181479085236785
},
{
"epoch": 2.1981610058172265,
"grad_norm": 1.8515625,
"learning_rate": 1.3502252252252251e-05,
"loss": 0.5126,
"mean_token_accuracy": 0.9497415542602539,
"step": 2930,
"train/kl_loss_qwen": 0.03827819037251175,
"train/kl_loss_r1": 0.023396990727633238,
"train/total_kl": 0.061675180681049824
},
{
"epoch": 2.2019140551698255,
"grad_norm": 3.5,
"learning_rate": 1.3474099099099098e-05,
"loss": 0.5099,
"mean_token_accuracy": 0.9369021475315094,
"step": 2935,
"train/kl_loss_qwen": 0.029308402584865688,
"train/kl_loss_r1": 0.020524240424856545,
"train/total_kl": 0.049832642823457715
},
{
"epoch": 2.2056671045224245,
"grad_norm": 2.0,
"learning_rate": 1.3445945945945946e-05,
"loss": 0.5286,
"mean_token_accuracy": 0.947816863656044,
"step": 2940,
"train/kl_loss_qwen": 0.040448572020977736,
"train/kl_loss_r1": 0.02613919833675027,
"train/total_kl": 0.06658776951953768
},
{
"epoch": 2.2094201538750236,
"grad_norm": 1.8359375,
"learning_rate": 1.3417792792792793e-05,
"loss": 0.5493,
"mean_token_accuracy": 0.9422875761985778,
"step": 2945,
"train/kl_loss_qwen": 0.04237751713953912,
"train/kl_loss_r1": 0.02594070523045957,
"train/total_kl": 0.0683182223699987
},
{
"epoch": 2.2131732032276226,
"grad_norm": 2.546875,
"learning_rate": 1.3389639639639639e-05,
"loss": 0.662,
"mean_token_accuracy": 0.9310304433107376,
"step": 2950,
"train/kl_loss_qwen": 0.058689125487580894,
"train/kl_loss_r1": 0.033207002701237796,
"train/total_kl": 0.09189612818881869
},
{
"epoch": 2.2169262525802216,
"grad_norm": 2.1875,
"learning_rate": 1.3361486486486486e-05,
"loss": 0.5382,
"mean_token_accuracy": 0.9390515863895417,
"step": 2955,
"train/kl_loss_qwen": 0.041446970077231526,
"train/kl_loss_r1": 0.02546785566955805,
"train/total_kl": 0.06691482551395893
},
{
"epoch": 2.2206793019328206,
"grad_norm": 1.7109375,
"learning_rate": 1.3333333333333333e-05,
"loss": 0.5262,
"mean_token_accuracy": 0.9294974207878113,
"step": 2960,
"train/kl_loss_qwen": 0.03314268705435097,
"train/kl_loss_r1": 0.019529332965612413,
"train/total_kl": 0.05267201904207468
},
{
"epoch": 2.2244323512854196,
"grad_norm": 2.53125,
"learning_rate": 1.330518018018018e-05,
"loss": 0.5259,
"mean_token_accuracy": 0.9331434935331344,
"step": 2965,
"train/kl_loss_qwen": 0.03575447672046721,
"train/kl_loss_r1": 0.021085081296041606,
"train/total_kl": 0.05683955755084753
},
{
"epoch": 2.2281854006380186,
"grad_norm": 2.921875,
"learning_rate": 1.3277027027027026e-05,
"loss": 0.5353,
"mean_token_accuracy": 0.9259840369224548,
"step": 2970,
"train/kl_loss_qwen": 0.029720848985016347,
"train/kl_loss_r1": 0.019104212429374455,
"train/total_kl": 0.04882506160065532
},
{
"epoch": 2.231938449990617,
"grad_norm": 2.21875,
"learning_rate": 1.3248873873873874e-05,
"loss": 0.5463,
"mean_token_accuracy": 0.9294231235980988,
"step": 2975,
"train/kl_loss_qwen": 0.03764592856168747,
"train/kl_loss_r1": 0.022270164219662547,
"train/total_kl": 0.0599160929210484
},
{
"epoch": 2.235691499343216,
"grad_norm": 2.046875,
"learning_rate": 1.3220720720720721e-05,
"loss": 0.5329,
"mean_token_accuracy": 0.9333685070276261,
"step": 2980,
"train/kl_loss_qwen": 0.035478117410093546,
"train/kl_loss_r1": 0.021247773012146354,
"train/total_kl": 0.056725890096277
},
{
"epoch": 2.239444548695815,
"grad_norm": 1.7734375,
"learning_rate": 1.3192567567567567e-05,
"loss": 0.578,
"mean_token_accuracy": 0.9396042585372925,
"step": 2985,
"train/kl_loss_qwen": 0.04996556900441647,
"train/kl_loss_r1": 0.02640064749866724,
"train/total_kl": 0.0763662163168192
},
{
"epoch": 2.2431975980484142,
"grad_norm": 1.796875,
"learning_rate": 1.3164414414414414e-05,
"loss": 0.5218,
"mean_token_accuracy": 0.9406999468803405,
"step": 2990,
"train/kl_loss_qwen": 0.038010914949700235,
"train/kl_loss_r1": 0.02382657811976969,
"train/total_kl": 0.06183749325573444
},
{
"epoch": 2.2469506474010132,
"grad_norm": 2.046875,
"learning_rate": 1.3136261261261261e-05,
"loss": 0.563,
"mean_token_accuracy": 0.9369042903184891,
"step": 2995,
"train/kl_loss_qwen": 0.03981273928657174,
"train/kl_loss_r1": 0.024143205443397164,
"train/total_kl": 0.06395594468340278
},
{
"epoch": 2.2507036967536123,
"grad_norm": 1.984375,
"learning_rate": 1.3108108108108109e-05,
"loss": 0.5846,
"mean_token_accuracy": 0.9288579165935517,
"step": 3000,
"train/kl_loss_qwen": 0.043740917649120095,
"train/kl_loss_r1": 0.025398692348971963,
"train/total_kl": 0.06913960874080657
},
{
"epoch": 2.2544567461062113,
"grad_norm": 2.234375,
"learning_rate": 1.3079954954954954e-05,
"loss": 0.5529,
"mean_token_accuracy": 0.9287919521331787,
"step": 3005,
"train/kl_loss_qwen": 0.03622842230834067,
"train/kl_loss_r1": 0.02267452417872846,
"train/total_kl": 0.058902946207672356
},
{
"epoch": 2.2582097954588103,
"grad_norm": 3.8125,
"learning_rate": 1.3051801801801802e-05,
"loss": 0.5708,
"mean_token_accuracy": 0.9316366136074066,
"step": 3010,
"train/kl_loss_qwen": 0.039876210317015645,
"train/kl_loss_r1": 0.025454261200502516,
"train/total_kl": 0.065330471098423
},
{
"epoch": 2.2619628448114093,
"grad_norm": 2.34375,
"learning_rate": 1.3023648648648649e-05,
"loss": 0.5521,
"mean_token_accuracy": 0.9287123322486878,
"step": 3015,
"train/kl_loss_qwen": 0.03473481684923172,
"train/kl_loss_r1": 0.021131755039095878,
"train/total_kl": 0.05586657216772437
},
{
"epoch": 2.2657158941640083,
"grad_norm": 2.984375,
"learning_rate": 1.2995495495495495e-05,
"loss": 0.5178,
"mean_token_accuracy": 0.9337947934865951,
"step": 3020,
"train/kl_loss_qwen": 0.035915958741679785,
"train/kl_loss_r1": 0.02014762875624001,
"train/total_kl": 0.0560635874979198
},
{
"epoch": 2.2694689435166073,
"grad_norm": 2.21875,
"learning_rate": 1.2967342342342342e-05,
"loss": 0.5513,
"mean_token_accuracy": 0.938558641076088,
"step": 3025,
"train/kl_loss_qwen": 0.0410382560454309,
"train/kl_loss_r1": 0.02633958971127868,
"train/total_kl": 0.06737784529104829
},
{
"epoch": 2.2732219928692063,
"grad_norm": 2.46875,
"learning_rate": 1.293918918918919e-05,
"loss": 0.5233,
"mean_token_accuracy": 0.9367934465408325,
"step": 3030,
"train/kl_loss_qwen": 0.03334038094617427,
"train/kl_loss_r1": 0.022024092823266984,
"train/total_kl": 0.05536447400227189
},
{
"epoch": 2.2769750422218054,
"grad_norm": 2.484375,
"learning_rate": 1.2911036036036037e-05,
"loss": 0.5496,
"mean_token_accuracy": 0.9340452969074249,
"step": 3035,
"train/kl_loss_qwen": 0.041443832125514744,
"train/kl_loss_r1": 0.02346867136657238,
"train/total_kl": 0.06491250386461615
},
{
"epoch": 2.2807280915744044,
"grad_norm": 1.9765625,
"learning_rate": 1.2882882882882882e-05,
"loss": 0.5684,
"mean_token_accuracy": 0.9405649453401566,
"step": 3040,
"train/kl_loss_qwen": 0.04632887695915997,
"train/kl_loss_r1": 0.026997680915519594,
"train/total_kl": 0.07332655768841505
},
{
"epoch": 2.2844811409270034,
"grad_norm": 1.671875,
"learning_rate": 1.285472972972973e-05,
"loss": 0.5785,
"mean_token_accuracy": 0.9388915836811066,
"step": 3045,
"train/kl_loss_qwen": 0.04664509515278041,
"train/kl_loss_r1": 0.028806798858568072,
"train/total_kl": 0.07545189317315817
},
{
"epoch": 2.288234190279602,
"grad_norm": 2.03125,
"learning_rate": 1.2826576576576577e-05,
"loss": 0.549,
"mean_token_accuracy": 0.942802557349205,
"step": 3050,
"train/kl_loss_qwen": 0.043018145067617294,
"train/kl_loss_r1": 0.02463572332635522,
"train/total_kl": 0.0676538685336709
},
{
"epoch": 2.291987239632201,
"grad_norm": 2.046875,
"learning_rate": 1.2798423423423423e-05,
"loss": 0.5146,
"mean_token_accuracy": 0.9322921663522721,
"step": 3055,
"train/kl_loss_qwen": 0.0297826265450567,
"train/kl_loss_r1": 0.01987147410400212,
"train/total_kl": 0.04965410055592656
},
{
"epoch": 2.2957402889848,
"grad_norm": 1.78125,
"learning_rate": 1.277027027027027e-05,
"loss": 0.5288,
"mean_token_accuracy": 0.9336327165365219,
"step": 3060,
"train/kl_loss_qwen": 0.031126489629969,
"train/kl_loss_r1": 0.02163971494883299,
"train/total_kl": 0.052766204718500374
},
{
"epoch": 2.299493338337399,
"grad_norm": 2.375,
"learning_rate": 1.2742117117117117e-05,
"loss": 0.5195,
"mean_token_accuracy": 0.9313450574874877,
"step": 3065,
"train/kl_loss_qwen": 0.026634555822238327,
"train/kl_loss_r1": 0.01898168446496129,
"train/total_kl": 0.04561624005436897
},
{
"epoch": 2.303246387689998,
"grad_norm": 2.234375,
"learning_rate": 1.2713963963963965e-05,
"loss": 0.561,
"mean_token_accuracy": 0.9352007538080216,
"step": 3070,
"train/kl_loss_qwen": 0.04229618958197534,
"train/kl_loss_r1": 0.025796488486230375,
"train/total_kl": 0.0680926782079041
},
{
"epoch": 2.306999437042597,
"grad_norm": 1.9453125,
"learning_rate": 1.268581081081081e-05,
"loss": 0.5083,
"mean_token_accuracy": 0.9352661728858948,
"step": 3075,
"train/kl_loss_qwen": 0.036430867342278364,
"train/kl_loss_r1": 0.022393257077783345,
"train/total_kl": 0.058824124094098804
},
{
"epoch": 2.310752486395196,
"grad_norm": 1.609375,
"learning_rate": 1.2657657657657658e-05,
"loss": 0.5943,
"mean_token_accuracy": 0.9433018922805786,
"step": 3080,
"train/kl_loss_qwen": 0.053476129472255704,
"train/kl_loss_r1": 0.030378296645358203,
"train/total_kl": 0.08385442551225424
},
{
"epoch": 2.314505535747795,
"grad_norm": 1.5703125,
"learning_rate": 1.2629504504504505e-05,
"loss": 0.5341,
"mean_token_accuracy": 0.9477105677127838,
"step": 3085,
"train/kl_loss_qwen": 0.04390522614121437,
"train/kl_loss_r1": 0.025548849394544958,
"train/total_kl": 0.06945407623425126
},
{
"epoch": 2.318258585100394,
"grad_norm": 2.109375,
"learning_rate": 1.260135135135135e-05,
"loss": 0.555,
"mean_token_accuracy": 0.9314184099435806,
"step": 3090,
"train/kl_loss_qwen": 0.039841002132743594,
"train/kl_loss_r1": 0.0228716810233891,
"train/total_kl": 0.06271268259733916
},
{
"epoch": 2.322011634452993,
"grad_norm": 2.171875,
"learning_rate": 1.2573198198198198e-05,
"loss": 0.5642,
"mean_token_accuracy": 0.937423512339592,
"step": 3095,
"train/kl_loss_qwen": 0.042703565768897535,
"train/kl_loss_r1": 0.025010303594172,
"train/total_kl": 0.06771386964246631
},
{
"epoch": 2.325764683805592,
"grad_norm": 1.625,
"learning_rate": 1.2545045045045045e-05,
"loss": 0.5267,
"mean_token_accuracy": 0.9374463945627213,
"step": 3100,
"train/kl_loss_qwen": 0.03558561257086694,
"train/kl_loss_r1": 0.021157630579546095,
"train/total_kl": 0.05674324333667755
},
{
"epoch": 2.329517733158191,
"grad_norm": 2.125,
"learning_rate": 1.2516891891891893e-05,
"loss": 0.5208,
"mean_token_accuracy": 0.9341548919677735,
"step": 3105,
"train/kl_loss_qwen": 0.03378947116434574,
"train/kl_loss_r1": 0.02182693681679666,
"train/total_kl": 0.05561640774831176
},
{
"epoch": 2.33327078251079,
"grad_norm": 2.015625,
"learning_rate": 1.2488738738738738e-05,
"loss": 0.6083,
"mean_token_accuracy": 0.9400612443685532,
"step": 3110,
"train/kl_loss_qwen": 0.04884338290430605,
"train/kl_loss_r1": 0.02985413228161633,
"train/total_kl": 0.07869751462712885
},
{
"epoch": 2.337023831863389,
"grad_norm": 1.6796875,
"learning_rate": 1.2460585585585586e-05,
"loss": 0.5328,
"mean_token_accuracy": 0.9403836339712143,
"step": 3115,
"train/kl_loss_qwen": 0.0388734900392592,
"train/kl_loss_r1": 0.024075880460441113,
"train/total_kl": 0.06294937077909708
},
{
"epoch": 2.340776881215988,
"grad_norm": 1.9453125,
"learning_rate": 1.2432432432432433e-05,
"loss": 0.5283,
"mean_token_accuracy": 0.936130028963089,
"step": 3120,
"train/kl_loss_qwen": 0.03456240138038993,
"train/kl_loss_r1": 0.022217872831970454,
"train/total_kl": 0.05678027486428618
},
{
"epoch": 2.344529930568587,
"grad_norm": 2.609375,
"learning_rate": 1.2404279279279278e-05,
"loss": 0.5287,
"mean_token_accuracy": 0.9316271543502808,
"step": 3125,
"train/kl_loss_qwen": 0.036940915137529375,
"train/kl_loss_r1": 0.0215177561622113,
"train/total_kl": 0.05845867097377777
},
{
"epoch": 2.348282979921186,
"grad_norm": 2.78125,
"learning_rate": 1.2376126126126126e-05,
"loss": 0.5368,
"mean_token_accuracy": 0.9344398438930511,
"step": 3130,
"train/kl_loss_qwen": 0.033279696572571994,
"train/kl_loss_r1": 0.021447874326258897,
"train/total_kl": 0.05472757089883089
},
{
"epoch": 2.352036029273785,
"grad_norm": 2.390625,
"learning_rate": 1.2347972972972973e-05,
"loss": 0.5209,
"mean_token_accuracy": 0.9406446427106857,
"step": 3135,
"train/kl_loss_qwen": 0.036877452628687024,
"train/kl_loss_r1": 0.022486304910853506,
"train/total_kl": 0.059363758005201814
},
{
"epoch": 2.3557890786263838,
"grad_norm": 2.5,
"learning_rate": 1.231981981981982e-05,
"loss": 0.5095,
"mean_token_accuracy": 0.9296006947755814,
"step": 3140,
"train/kl_loss_qwen": 0.028582219453528523,
"train/kl_loss_r1": 0.018844395689666272,
"train/total_kl": 0.04742661491036415
},
{
"epoch": 2.3595421279789828,
"grad_norm": 1.9140625,
"learning_rate": 1.2291666666666666e-05,
"loss": 0.5638,
"mean_token_accuracy": 0.9397950142621994,
"step": 3145,
"train/kl_loss_qwen": 0.04685241803526878,
"train/kl_loss_r1": 0.026595241343602537,
"train/total_kl": 0.07344765840098262
},
{
"epoch": 2.363295177331582,
"grad_norm": 2.046875,
"learning_rate": 1.2263513513513513e-05,
"loss": 0.5555,
"mean_token_accuracy": 0.9374128609895707,
"step": 3150,
"train/kl_loss_qwen": 0.04203428840264678,
"train/kl_loss_r1": 0.025428059929981827,
"train/total_kl": 0.06746234856545925
},
{
"epoch": 2.367048226684181,
"grad_norm": 2.21875,
"learning_rate": 1.223536036036036e-05,
"loss": 0.5681,
"mean_token_accuracy": 0.9254122227430344,
"step": 3155,
"train/kl_loss_qwen": 0.0387713055126369,
"train/kl_loss_r1": 0.0246855141595006,
"train/total_kl": 0.06345681985840201
},
{
"epoch": 2.37080127603678,
"grad_norm": 1.6171875,
"learning_rate": 1.2207207207207206e-05,
"loss": 0.551,
"mean_token_accuracy": 0.9433078557252884,
"step": 3160,
"train/kl_loss_qwen": 0.04725635447539389,
"train/kl_loss_r1": 0.025131250126287343,
"train/total_kl": 0.07238760460168123
},
{
"epoch": 2.374554325389379,
"grad_norm": 2.78125,
"learning_rate": 1.2179054054054054e-05,
"loss": 0.5354,
"mean_token_accuracy": 0.9246108263731003,
"step": 3165,
"train/kl_loss_qwen": 0.033212426397949454,
"train/kl_loss_r1": 0.020326728513464332,
"train/total_kl": 0.05353915439918637
},
{
"epoch": 2.378307374741978,
"grad_norm": 1.640625,
"learning_rate": 1.2150900900900901e-05,
"loss": 0.6263,
"mean_token_accuracy": 0.9188352763652802,
"step": 3170,
"train/kl_loss_qwen": 0.044487806130200626,
"train/kl_loss_r1": 0.025681670103222132,
"train/total_kl": 0.07016947586089373
},
{
"epoch": 2.382060424094577,
"grad_norm": 1.765625,
"learning_rate": 1.2122747747747748e-05,
"loss": 0.5346,
"mean_token_accuracy": 0.934695902466774,
"step": 3175,
"train/kl_loss_qwen": 0.03501300155185163,
"train/kl_loss_r1": 0.02180988513864577,
"train/total_kl": 0.05682288641110063
},
{
"epoch": 2.385813473447176,
"grad_norm": 3.671875,
"learning_rate": 1.2094594594594594e-05,
"loss": 0.5132,
"mean_token_accuracy": 0.9327447503805161,
"step": 3180,
"train/kl_loss_qwen": 0.03092428036034107,
"train/kl_loss_r1": 0.01931490730494261,
"train/total_kl": 0.05023918692022562
},
{
"epoch": 2.389566522799775,
"grad_norm": 1.90625,
"learning_rate": 1.2066441441441441e-05,
"loss": 0.5394,
"mean_token_accuracy": 0.9355822622776031,
"step": 3185,
"train/kl_loss_qwen": 0.03887740271165967,
"train/kl_loss_r1": 0.0235895031131804,
"train/total_kl": 0.0624669055454433
},
{
"epoch": 2.393319572152374,
"grad_norm": 2.953125,
"learning_rate": 1.2038288288288289e-05,
"loss": 0.5322,
"mean_token_accuracy": 0.9339176148176194,
"step": 3190,
"train/kl_loss_qwen": 0.03618767000734806,
"train/kl_loss_r1": 0.021291274437680842,
"train/total_kl": 0.057478944212198256
},
{
"epoch": 2.397072621504973,
"grad_norm": 2.0,
"learning_rate": 1.2010135135135134e-05,
"loss": 0.5395,
"mean_token_accuracy": 0.9384062319993973,
"step": 3195,
"train/kl_loss_qwen": 0.04146128077991307,
"train/kl_loss_r1": 0.024588865321129562,
"train/total_kl": 0.0660501460544765
},
{
"epoch": 2.400825670857572,
"grad_norm": 2.25,
"learning_rate": 1.1981981981981982e-05,
"loss": 0.5389,
"mean_token_accuracy": 0.9353989124298095,
"step": 3200,
"train/kl_loss_qwen": 0.03608363852836192,
"train/kl_loss_r1": 0.022291125869378446,
"train/total_kl": 0.058374764304608105
},
{
"epoch": 2.404578720210171,
"grad_norm": 2.046875,
"learning_rate": 1.1953828828828829e-05,
"loss": 0.4878,
"mean_token_accuracy": 0.9411316305398941,
"step": 3205,
"train/kl_loss_qwen": 0.03091870420612395,
"train/kl_loss_r1": 0.020030087791383266,
"train/total_kl": 0.05094879176467657
},
{
"epoch": 2.4083317695627695,
"grad_norm": 1.65625,
"learning_rate": 1.1925675675675676e-05,
"loss": 0.5701,
"mean_token_accuracy": 0.9409845679998398,
"step": 3210,
"train/kl_loss_qwen": 0.04897573101334274,
"train/kl_loss_r1": 0.02639773767441511,
"train/total_kl": 0.07537346873432398
},
{
"epoch": 2.4120848189153685,
"grad_norm": 1.78125,
"learning_rate": 1.1897522522522522e-05,
"loss": 0.5977,
"mean_token_accuracy": 0.9367994040250778,
"step": 3215,
"train/kl_loss_qwen": 0.050940166832879184,
"train/kl_loss_r1": 0.02986270859837532,
"train/total_kl": 0.0808028751052916
},
{
"epoch": 2.4158378682679675,
"grad_norm": 1.6171875,
"learning_rate": 1.186936936936937e-05,
"loss": 0.5429,
"mean_token_accuracy": 0.9409172803163528,
"step": 3220,
"train/kl_loss_qwen": 0.03987803226336837,
"train/kl_loss_r1": 0.0246189346536994,
"train/total_kl": 0.0644969672895968
},
{
"epoch": 2.4195909176205666,
"grad_norm": 2.546875,
"learning_rate": 1.1841216216216217e-05,
"loss": 0.5611,
"mean_token_accuracy": 0.9374772995710373,
"step": 3225,
"train/kl_loss_qwen": 0.04303165278397501,
"train/kl_loss_r1": 0.02437350503169,
"train/total_kl": 0.06740515744313598
},
{
"epoch": 2.4233439669731656,
"grad_norm": 2.4375,
"learning_rate": 1.1813063063063062e-05,
"loss": 0.553,
"mean_token_accuracy": 0.9381204128265381,
"step": 3230,
"train/kl_loss_qwen": 0.0386037103831768,
"train/kl_loss_r1": 0.023770157899707555,
"train/total_kl": 0.06237386828288436
},
{
"epoch": 2.4270970163257646,
"grad_norm": 1.7890625,
"learning_rate": 1.178490990990991e-05,
"loss": 0.562,
"mean_token_accuracy": 0.9349307507276535,
"step": 3235,
"train/kl_loss_qwen": 0.04115969752892852,
"train/kl_loss_r1": 0.024597525550052523,
"train/total_kl": 0.06575722331181169
},
{
"epoch": 2.4308500656783636,
"grad_norm": 1.8203125,
"learning_rate": 1.1756756756756757e-05,
"loss": 0.637,
"mean_token_accuracy": 0.9326605528593064,
"step": 3240,
"train/kl_loss_qwen": 0.05272633535787463,
"train/kl_loss_r1": 0.03210459062829614,
"train/total_kl": 0.08483092663809658
},
{
"epoch": 2.4346031150309626,
"grad_norm": 1.8046875,
"learning_rate": 1.1728603603603604e-05,
"loss": 0.5224,
"mean_token_accuracy": 0.9422306567430496,
"step": 3245,
"train/kl_loss_qwen": 0.03568903068080544,
"train/kl_loss_r1": 0.02389035364612937,
"train/total_kl": 0.05957938423380256
},
{
"epoch": 2.4383561643835616,
"grad_norm": 1.8828125,
"learning_rate": 1.170045045045045e-05,
"loss": 0.5923,
"mean_token_accuracy": 0.9275829493999481,
"step": 3250,
"train/kl_loss_qwen": 0.04339817874133587,
"train/kl_loss_r1": 0.02661740267649293,
"train/total_kl": 0.07001558057963848
},
{
"epoch": 2.4421092137361606,
"grad_norm": 2.5,
"learning_rate": 1.1672297297297297e-05,
"loss": 0.5883,
"mean_token_accuracy": 0.9264898538589478,
"step": 3255,
"train/kl_loss_qwen": 0.04256655271165073,
"train/kl_loss_r1": 0.026060083322227,
"train/total_kl": 0.06862663589417935
},
{
"epoch": 2.4458622630887596,
"grad_norm": 1.6171875,
"learning_rate": 1.1644144144144145e-05,
"loss": 0.5757,
"mean_token_accuracy": 0.9341827034950256,
"step": 3260,
"train/kl_loss_qwen": 0.045864395797252655,
"train/kl_loss_r1": 0.025307921459898353,
"train/total_kl": 0.07117231637239456
},
{
"epoch": 2.4496153124413587,
"grad_norm": 1.859375,
"learning_rate": 1.161599099099099e-05,
"loss": 0.5532,
"mean_token_accuracy": 0.9347288429737091,
"step": 3265,
"train/kl_loss_qwen": 0.04079986200667918,
"train/kl_loss_r1": 0.02275497787632048,
"train/total_kl": 0.06355484062805772
},
{
"epoch": 2.4533683617939577,
"grad_norm": 1.8125,
"learning_rate": 1.1587837837837838e-05,
"loss": 0.5195,
"mean_token_accuracy": 0.9417342007160187,
"step": 3270,
"train/kl_loss_qwen": 0.037300968542695045,
"train/kl_loss_r1": 0.023268221924081445,
"train/total_kl": 0.06056919014081359
},
{
"epoch": 2.4571214111465567,
"grad_norm": 1.7890625,
"learning_rate": 1.1559684684684685e-05,
"loss": 0.5353,
"mean_token_accuracy": 0.9360393404960632,
"step": 3275,
"train/kl_loss_qwen": 0.03689596527256071,
"train/kl_loss_r1": 0.022807118855416773,
"train/total_kl": 0.05970308426767588
},
{
"epoch": 2.4608744604991557,
"grad_norm": 1.7421875,
"learning_rate": 1.1531531531531532e-05,
"loss": 0.585,
"mean_token_accuracy": 0.9331568986177444,
"step": 3280,
"train/kl_loss_qwen": 0.044853394478559495,
"train/kl_loss_r1": 0.025697841960936784,
"train/total_kl": 0.0705512366257608
},
{
"epoch": 2.4646275098517547,
"grad_norm": 1.65625,
"learning_rate": 1.1503378378378378e-05,
"loss": 0.5768,
"mean_token_accuracy": 0.9326375395059585,
"step": 3285,
"train/kl_loss_qwen": 0.04333240417763591,
"train/kl_loss_r1": 0.024822972994297744,
"train/total_kl": 0.06815537698566913
},
{
"epoch": 2.4683805592043537,
"grad_norm": 6.0625,
"learning_rate": 1.1475225225225225e-05,
"loss": 0.7162,
"mean_token_accuracy": 0.9254491657018662,
"step": 3290,
"train/kl_loss_qwen": 0.06576828146353364,
"train/kl_loss_r1": 0.03042342527769506,
"train/total_kl": 0.09619170585647226
},
{
"epoch": 2.4721336085569527,
"grad_norm": 4.0625,
"learning_rate": 1.1447072072072073e-05,
"loss": 0.5306,
"mean_token_accuracy": 0.9359158217906952,
"step": 3295,
"train/kl_loss_qwen": 0.03547678254544735,
"train/kl_loss_r1": 0.022528561856597663,
"train/total_kl": 0.0580053442157805
},
{
"epoch": 2.4758866579095518,
"grad_norm": 2.03125,
"learning_rate": 1.1418918918918918e-05,
"loss": 0.589,
"mean_token_accuracy": 0.9333787739276886,
"step": 3300,
"train/kl_loss_qwen": 0.04154859040863812,
"train/kl_loss_r1": 0.025078575173392893,
"train/total_kl": 0.06662716614082456
},
{
"epoch": 2.4796397072621503,
"grad_norm": 2.015625,
"learning_rate": 1.1390765765765766e-05,
"loss": 0.5448,
"mean_token_accuracy": 0.9377627521753311,
"step": 3305,
"train/kl_loss_qwen": 0.0411828382872045,
"train/kl_loss_r1": 0.02373361773788929,
"train/total_kl": 0.06491645593196153
},
{
"epoch": 2.4833927566147493,
"grad_norm": 1.71875,
"learning_rate": 1.1362612612612613e-05,
"loss": 0.6567,
"mean_token_accuracy": 0.9378575652837753,
"step": 3310,
"train/kl_loss_qwen": 0.058627383690327405,
"train/kl_loss_r1": 0.0312151032499969,
"train/total_kl": 0.08984248703345657
},
{
"epoch": 2.4871458059673484,
"grad_norm": 1.71875,
"learning_rate": 1.133445945945946e-05,
"loss": 0.5552,
"mean_token_accuracy": 0.9339710831642151,
"step": 3315,
"train/kl_loss_qwen": 0.03927432321943343,
"train/kl_loss_r1": 0.023889779346063733,
"train/total_kl": 0.06316410256549716
},
{
"epoch": 2.4908988553199474,
"grad_norm": 3.296875,
"learning_rate": 1.1306306306306306e-05,
"loss": 0.5959,
"mean_token_accuracy": 0.934712040424347,
"step": 3320,
"train/kl_loss_qwen": 0.04768353961408138,
"train/kl_loss_r1": 0.02617289489135146,
"train/total_kl": 0.07385643469169736
},
{
"epoch": 2.4946519046725464,
"grad_norm": 2.1875,
"learning_rate": 1.1278153153153153e-05,
"loss": 0.5349,
"mean_token_accuracy": 0.9292694211006165,
"step": 3325,
"train/kl_loss_qwen": 0.032761602150276306,
"train/kl_loss_r1": 0.0203021552413702,
"train/total_kl": 0.05306375734508038
},
{
"epoch": 2.4984049540251454,
"grad_norm": 1.875,
"learning_rate": 1.125e-05,
"loss": 0.6419,
"mean_token_accuracy": 0.9353505343198776,
"step": 3330,
"train/kl_loss_qwen": 0.05452116383239627,
"train/kl_loss_r1": 0.031527131283655765,
"train/total_kl": 0.08604829544201494
},
{
"epoch": 2.5021580033777444,
"grad_norm": 2.140625,
"learning_rate": 1.1221846846846846e-05,
"loss": 0.622,
"mean_token_accuracy": 0.9341338902711869,
"step": 3335,
"train/kl_loss_qwen": 0.04978591026738286,
"train/kl_loss_r1": 0.029290991835296154,
"train/total_kl": 0.0790769032202661
},
{
"epoch": 2.5059110527303434,
"grad_norm": 2.578125,
"learning_rate": 1.1193693693693694e-05,
"loss": 0.5679,
"mean_token_accuracy": 0.9300838261842728,
"step": 3340,
"train/kl_loss_qwen": 0.0432100894395262,
"train/kl_loss_r1": 0.02546289232559502,
"train/total_kl": 0.06867298241704703
},
{
"epoch": 2.5096641020829424,
"grad_norm": 2.296875,
"learning_rate": 1.1165540540540541e-05,
"loss": 0.5739,
"mean_token_accuracy": 0.9369128614664077,
"step": 3345,
"train/kl_loss_qwen": 0.04455037331208587,
"train/kl_loss_r1": 0.02718741991557181,
"train/total_kl": 0.07173779308795929
},
{
"epoch": 2.5134171514355415,
"grad_norm": 1.859375,
"learning_rate": 1.1137387387387388e-05,
"loss": 0.5353,
"mean_token_accuracy": 0.932581090927124,
"step": 3350,
"train/kl_loss_qwen": 0.0413767262827605,
"train/kl_loss_r1": 0.022167172096669675,
"train/total_kl": 0.06354389851912856
},
{
"epoch": 2.5171702007881405,
"grad_norm": 2.0,
"learning_rate": 1.1109234234234234e-05,
"loss": 0.5343,
"mean_token_accuracy": 0.927921137213707,
"step": 3355,
"train/kl_loss_qwen": 0.03147038575261831,
"train/kl_loss_r1": 0.01910092611797154,
"train/total_kl": 0.050571311730891466
},
{
"epoch": 2.5209232501407395,
"grad_norm": 1.5859375,
"learning_rate": 1.1081081081081081e-05,
"loss": 0.4947,
"mean_token_accuracy": 0.9445708662271499,
"step": 3360,
"train/kl_loss_qwen": 0.03797930618748069,
"train/kl_loss_r1": 0.021180487936362624,
"train/total_kl": 0.05915979370474815
},
{
"epoch": 2.5246762994933385,
"grad_norm": 1.890625,
"learning_rate": 1.1052927927927929e-05,
"loss": 0.5647,
"mean_token_accuracy": 0.9292292296886444,
"step": 3365,
"train/kl_loss_qwen": 0.03970672045834363,
"train/kl_loss_r1": 0.023722950136289,
"train/total_kl": 0.06342967031523586
},
{
"epoch": 2.528429348845937,
"grad_norm": 1.9375,
"learning_rate": 1.1024774774774774e-05,
"loss": 0.5524,
"mean_token_accuracy": 0.9366607517004013,
"step": 3370,
"train/kl_loss_qwen": 0.04209428019821644,
"train/kl_loss_r1": 0.024846457364037632,
"train/total_kl": 0.06694073788821697
},
{
"epoch": 2.532182398198536,
"grad_norm": 1.6796875,
"learning_rate": 1.0996621621621622e-05,
"loss": 0.5887,
"mean_token_accuracy": 0.9346622288227081,
"step": 3375,
"train/kl_loss_qwen": 0.04933397052809596,
"train/kl_loss_r1": 0.026567904464900493,
"train/total_kl": 0.07590187508612871
},
{
"epoch": 2.535935447551135,
"grad_norm": 3.234375,
"learning_rate": 1.0968468468468469e-05,
"loss": 0.5237,
"mean_token_accuracy": 0.9299458533525466,
"step": 3380,
"train/kl_loss_qwen": 0.02983626089990139,
"train/kl_loss_r1": 0.019484353670850395,
"train/total_kl": 0.04932061461731792
},
{
"epoch": 2.539688496903734,
"grad_norm": 1.7890625,
"learning_rate": 1.0940315315315316e-05,
"loss": 0.5345,
"mean_token_accuracy": 0.9382866770029068,
"step": 3385,
"train/kl_loss_qwen": 0.04042149954475462,
"train/kl_loss_r1": 0.023517983220517635,
"train/total_kl": 0.06393948178738355
},
{
"epoch": 2.543441546256333,
"grad_norm": 1.671875,
"learning_rate": 1.0912162162162162e-05,
"loss": 0.521,
"mean_token_accuracy": 0.9384631723165512,
"step": 3390,
"train/kl_loss_qwen": 0.038067093631252644,
"train/kl_loss_r1": 0.02246550181880593,
"train/total_kl": 0.06053259586915374
},
{
"epoch": 2.547194595608932,
"grad_norm": 1.9296875,
"learning_rate": 1.088400900900901e-05,
"loss": 0.5482,
"mean_token_accuracy": 0.9318992495536804,
"step": 3395,
"train/kl_loss_qwen": 0.03690930460579693,
"train/kl_loss_r1": 0.02255395017564297,
"train/total_kl": 0.059463254641741514
},
{
"epoch": 2.550947644961531,
"grad_norm": 2.609375,
"learning_rate": 1.0855855855855857e-05,
"loss": 0.4918,
"mean_token_accuracy": 0.9357536435127258,
"step": 3400,
"train/kl_loss_qwen": 0.030488945869728924,
"train/kl_loss_r1": 0.01972590610384941,
"train/total_kl": 0.050214852392673495
},
{
"epoch": 2.55470069431413,
"grad_norm": 1.8046875,
"learning_rate": 1.0827702702702702e-05,
"loss": 0.623,
"mean_token_accuracy": 0.9369746416807174,
"step": 3405,
"train/kl_loss_qwen": 0.05603249073028564,
"train/kl_loss_r1": 0.0298390360083431,
"train/total_kl": 0.08587152734398842
},
{
"epoch": 2.558453743666729,
"grad_norm": 1.703125,
"learning_rate": 1.079954954954955e-05,
"loss": 0.5262,
"mean_token_accuracy": 0.9425755172967911,
"step": 3410,
"train/kl_loss_qwen": 0.03950298763811588,
"train/kl_loss_r1": 0.02380976346321404,
"train/total_kl": 0.06331275068223477
},
{
"epoch": 2.562206793019328,
"grad_norm": 1.859375,
"learning_rate": 1.0771396396396397e-05,
"loss": 0.5639,
"mean_token_accuracy": 0.9331496387720108,
"step": 3415,
"train/kl_loss_qwen": 0.04406013865955174,
"train/kl_loss_r1": 0.024020101223140956,
"train/total_kl": 0.06808023946359754
},
{
"epoch": 2.565959842371927,
"grad_norm": 2.546875,
"learning_rate": 1.0743243243243244e-05,
"loss": 0.5149,
"mean_token_accuracy": 0.9378763616085053,
"step": 3420,
"train/kl_loss_qwen": 0.036142927082255485,
"train/kl_loss_r1": 0.023106351029127836,
"train/total_kl": 0.05924927722662687
},
{
"epoch": 2.569712891724526,
"grad_norm": 2.015625,
"learning_rate": 1.071509009009009e-05,
"loss": 0.533,
"mean_token_accuracy": 0.9345060348510742,
"step": 3425,
"train/kl_loss_qwen": 0.035566607816144825,
"train/kl_loss_r1": 0.022629395639523864,
"train/total_kl": 0.058196003921329974
},
{
"epoch": 2.5734659410771252,
"grad_norm": 2.03125,
"learning_rate": 1.0686936936936937e-05,
"loss": 0.4989,
"mean_token_accuracy": 0.9346575111150741,
"step": 3430,
"train/kl_loss_qwen": 0.03133196346461773,
"train/kl_loss_r1": 0.019670154713094235,
"train/total_kl": 0.05100211799144745
},
{
"epoch": 2.5772189904297242,
"grad_norm": 1.921875,
"learning_rate": 1.0658783783783785e-05,
"loss": 0.5453,
"mean_token_accuracy": 0.9339419305324554,
"step": 3435,
"train/kl_loss_qwen": 0.03465688219293952,
"train/kl_loss_r1": 0.021777683729305865,
"train/total_kl": 0.05643456541001797
},
{
"epoch": 2.5809720397823233,
"grad_norm": 1.890625,
"learning_rate": 1.063063063063063e-05,
"loss": 0.5621,
"mean_token_accuracy": 0.9316897690296173,
"step": 3440,
"train/kl_loss_qwen": 0.03479852089658379,
"train/kl_loss_r1": 0.022237913217395544,
"train/total_kl": 0.057036434207111596
},
{
"epoch": 2.5847250891349223,
"grad_norm": 1.84375,
"learning_rate": 1.0602477477477478e-05,
"loss": 0.512,
"mean_token_accuracy": 0.9422204077243805,
"step": 3445,
"train/kl_loss_qwen": 0.037066091177985074,
"train/kl_loss_r1": 0.023700099997222425,
"train/total_kl": 0.060766191128641366
},
{
"epoch": 2.5884781384875213,
"grad_norm": 2.390625,
"learning_rate": 1.0574324324324325e-05,
"loss": 0.5067,
"mean_token_accuracy": 0.9312503308057785,
"step": 3450,
"train/kl_loss_qwen": 0.03274406418204308,
"train/kl_loss_r1": 0.020862600672990082,
"train/total_kl": 0.05360666448250413
},
{
"epoch": 2.5922311878401203,
"grad_norm": 2.640625,
"learning_rate": 1.0546171171171172e-05,
"loss": 0.5086,
"mean_token_accuracy": 0.9356559842824936,
"step": 3455,
"train/kl_loss_qwen": 0.03636283753439784,
"train/kl_loss_r1": 0.02178000183776021,
"train/total_kl": 0.05814283927902579
},
{
"epoch": 2.5959842371927193,
"grad_norm": 1.9609375,
"learning_rate": 1.0518018018018018e-05,
"loss": 0.5021,
"mean_token_accuracy": 0.940264904499054,
"step": 3460,
"train/kl_loss_qwen": 0.03297446658834815,
"train/kl_loss_r1": 0.021592933125793932,
"train/total_kl": 0.0545673999004066
},
{
"epoch": 2.5997372865453183,
"grad_norm": 2.015625,
"learning_rate": 1.0489864864864865e-05,
"loss": 0.5454,
"mean_token_accuracy": 0.9404850274324417,
"step": 3465,
"train/kl_loss_qwen": 0.04411001540720463,
"train/kl_loss_r1": 0.025393107812851666,
"train/total_kl": 0.06950312331318856
},
{
"epoch": 2.603490335897917,
"grad_norm": 1.78125,
"learning_rate": 1.0461711711711713e-05,
"loss": 0.5201,
"mean_token_accuracy": 0.9440337806940079,
"step": 3470,
"train/kl_loss_qwen": 0.041339093120768666,
"train/kl_loss_r1": 0.02469945913180709,
"train/total_kl": 0.06603855239227414
},
{
"epoch": 2.607243385250516,
"grad_norm": 2.21875,
"learning_rate": 1.043355855855856e-05,
"loss": 0.5122,
"mean_token_accuracy": 0.9338981837034226,
"step": 3475,
"train/kl_loss_qwen": 0.03163531045429409,
"train/kl_loss_r1": 0.020907067647203802,
"train/total_kl": 0.05254237810149789
},
{
"epoch": 2.610996434603115,
"grad_norm": 1.8125,
"learning_rate": 1.0405405405405406e-05,
"loss": 0.5841,
"mean_token_accuracy": 0.9341493427753449,
"step": 3480,
"train/kl_loss_qwen": 0.049100861279293896,
"train/kl_loss_r1": 0.026905355555936695,
"train/total_kl": 0.07600621711462736
},
{
"epoch": 2.614749483955714,
"grad_norm": 1.5625,
"learning_rate": 1.0377252252252253e-05,
"loss": 0.579,
"mean_token_accuracy": 0.9387732237577439,
"step": 3485,
"train/kl_loss_qwen": 0.04798796251416206,
"train/kl_loss_r1": 0.027056048065423964,
"train/total_kl": 0.07504401141777635
},
{
"epoch": 2.618502533308313,
"grad_norm": 2.75,
"learning_rate": 1.03490990990991e-05,
"loss": 0.5499,
"mean_token_accuracy": 0.9330289214849472,
"step": 3490,
"train/kl_loss_qwen": 0.03633160563185811,
"train/kl_loss_r1": 0.02329326728358865,
"train/total_kl": 0.05962487207725644
},
{
"epoch": 2.622255582660912,
"grad_norm": 2.6875,
"learning_rate": 1.0320945945945946e-05,
"loss": 0.5351,
"mean_token_accuracy": 0.9311683624982834,
"step": 3495,
"train/kl_loss_qwen": 0.03595252772793174,
"train/kl_loss_r1": 0.022297431947663426,
"train/total_kl": 0.05824995981529355
},
{
"epoch": 2.626008632013511,
"grad_norm": 2.203125,
"learning_rate": 1.0292792792792793e-05,
"loss": 0.5577,
"mean_token_accuracy": 0.9325771689414978,
"step": 3500,
"train/kl_loss_qwen": 0.03546359553001821,
"train/kl_loss_r1": 0.022251410642638803,
"train/total_kl": 0.05771500645205378
},
{
"epoch": 2.62976168136611,
"grad_norm": 1.984375,
"learning_rate": 1.026463963963964e-05,
"loss": 0.5726,
"mean_token_accuracy": 0.9327528506517411,
"step": 3505,
"train/kl_loss_qwen": 0.04111943980678916,
"train/kl_loss_r1": 0.025728296581655742,
"train/total_kl": 0.06684773582965135
},
{
"epoch": 2.633514730718709,
"grad_norm": 1.921875,
"learning_rate": 1.0236486486486488e-05,
"loss": 0.5926,
"mean_token_accuracy": 0.9328369259834289,
"step": 3510,
"train/kl_loss_qwen": 0.046308462787419555,
"train/kl_loss_r1": 0.02664640606380999,
"train/total_kl": 0.07295486945658922
},
{
"epoch": 2.637267780071308,
"grad_norm": 1.6796875,
"learning_rate": 1.0208333333333334e-05,
"loss": 0.5781,
"mean_token_accuracy": 0.9362814456224442,
"step": 3515,
"train/kl_loss_qwen": 0.04740121774375439,
"train/kl_loss_r1": 0.026224265387281776,
"train/total_kl": 0.0736254833638668
},
{
"epoch": 2.641020829423907,
"grad_norm": 2.09375,
"learning_rate": 1.0180180180180181e-05,
"loss": 0.6094,
"mean_token_accuracy": 0.9310470670461655,
"step": 3520,
"train/kl_loss_qwen": 0.046079412242397665,
"train/kl_loss_r1": 0.02684156009927392,
"train/total_kl": 0.07292097266763449
},
{
"epoch": 2.644773878776506,
"grad_norm": 2.171875,
"learning_rate": 1.0152027027027028e-05,
"loss": 0.5425,
"mean_token_accuracy": 0.9256984144449234,
"step": 3525,
"train/kl_loss_qwen": 0.03432284677401185,
"train/kl_loss_r1": 0.02130248979665339,
"train/total_kl": 0.055625336803495885
},
{
"epoch": 2.648526928129105,
"grad_norm": 2.390625,
"learning_rate": 1.0123873873873874e-05,
"loss": 0.5209,
"mean_token_accuracy": 0.9320784568786621,
"step": 3530,
"train/kl_loss_qwen": 0.030805668141692878,
"train/kl_loss_r1": 0.019909562543034554,
"train/total_kl": 0.05071523003280163
},
{
"epoch": 2.6522799774817036,
"grad_norm": 2.734375,
"learning_rate": 1.0095720720720721e-05,
"loss": 0.566,
"mean_token_accuracy": 0.9416737079620361,
"step": 3535,
"train/kl_loss_qwen": 0.04397767055779696,
"train/kl_loss_r1": 0.026771708764135836,
"train/total_kl": 0.07074937922880054
},
{
"epoch": 2.6560330268343026,
"grad_norm": 1.9609375,
"learning_rate": 1.0067567567567569e-05,
"loss": 0.5221,
"mean_token_accuracy": 0.937117201089859,
"step": 3540,
"train/kl_loss_qwen": 0.03365273177623749,
"train/kl_loss_r1": 0.021670471411198378,
"train/total_kl": 0.05532320309430361
},
{
"epoch": 2.6597860761869017,
"grad_norm": 2.4375,
"learning_rate": 1.0039414414414416e-05,
"loss": 0.5136,
"mean_token_accuracy": 0.9384093523025513,
"step": 3545,
"train/kl_loss_qwen": 0.03165590218268335,
"train/kl_loss_r1": 0.021389018185436724,
"train/total_kl": 0.053044920414686204
},
{
"epoch": 2.6635391255395007,
"grad_norm": 3.046875,
"learning_rate": 1.0011261261261262e-05,
"loss": 0.5164,
"mean_token_accuracy": 0.9325183421373368,
"step": 3550,
"train/kl_loss_qwen": 0.02961095222271979,
"train/kl_loss_r1": 0.019611746584996582,
"train/total_kl": 0.049222698993980886
},
{
"epoch": 2.6672921748920997,
"grad_norm": 2.0,
"learning_rate": 9.983108108108109e-06,
"loss": 0.5269,
"mean_token_accuracy": 0.9398354828357697,
"step": 3555,
"train/kl_loss_qwen": 0.03761188993230462,
"train/kl_loss_r1": 0.023912502732127906,
"train/total_kl": 0.06152439266443253
},
{
"epoch": 2.6710452242446987,
"grad_norm": 1.6953125,
"learning_rate": 9.954954954954956e-06,
"loss": 0.5265,
"mean_token_accuracy": 0.9428102672100067,
"step": 3560,
"train/kl_loss_qwen": 0.04230879452079535,
"train/kl_loss_r1": 0.026035568164661526,
"train/total_kl": 0.06834436235949397
},
{
"epoch": 2.6747982735972977,
"grad_norm": 2.1875,
"learning_rate": 9.926801801801802e-06,
"loss": 0.5545,
"mean_token_accuracy": 0.9395761728286743,
"step": 3565,
"train/kl_loss_qwen": 0.042321126256138084,
"train/kl_loss_r1": 0.026880426658317448,
"train/total_kl": 0.06920155417174101
},
{
"epoch": 2.6785513229498967,
"grad_norm": 2.484375,
"learning_rate": 9.89864864864865e-06,
"loss": 0.4927,
"mean_token_accuracy": 0.9371385693550109,
"step": 3570,
"train/kl_loss_qwen": 0.028558475058525802,
"train/kl_loss_r1": 0.01896639233455062,
"train/total_kl": 0.047524867206811906
},
{
"epoch": 2.6823043723024957,
"grad_norm": 1.875,
"learning_rate": 9.870495495495497e-06,
"loss": 0.5824,
"mean_token_accuracy": 0.9339749813079834,
"step": 3575,
"train/kl_loss_qwen": 0.0459581867326051,
"train/kl_loss_r1": 0.02593495771288872,
"train/total_kl": 0.07189314477145672
},
{
"epoch": 2.6860574216550948,
"grad_norm": 1.7890625,
"learning_rate": 9.842342342342344e-06,
"loss": 0.6433,
"mean_token_accuracy": 0.9311673611402511,
"step": 3580,
"train/kl_loss_qwen": 0.051213488029316065,
"train/kl_loss_r1": 0.030939326249063016,
"train/total_kl": 0.08215281507000327
},
{
"epoch": 2.6898104710076938,
"grad_norm": 1.9140625,
"learning_rate": 9.81418918918919e-06,
"loss": 0.5293,
"mean_token_accuracy": 0.9371504604816436,
"step": 3585,
"train/kl_loss_qwen": 0.038671653857454656,
"train/kl_loss_r1": 0.02250283914618194,
"train/total_kl": 0.061174492444843055
},
{
"epoch": 2.693563520360293,
"grad_norm": 1.6796875,
"learning_rate": 9.786036036036037e-06,
"loss": 0.5056,
"mean_token_accuracy": 0.9385312110185623,
"step": 3590,
"train/kl_loss_qwen": 0.032683673035353425,
"train/kl_loss_r1": 0.021441146731376648,
"train/total_kl": 0.05412481976673007
},
{
"epoch": 2.697316569712892,
"grad_norm": 1.5703125,
"learning_rate": 9.757882882882884e-06,
"loss": 0.5883,
"mean_token_accuracy": 0.9399591952562332,
"step": 3595,
"train/kl_loss_qwen": 0.04788463073782623,
"train/kl_loss_r1": 0.02818334260955453,
"train/total_kl": 0.07606797246262431
},
{
"epoch": 2.701069619065491,
"grad_norm": 1.921875,
"learning_rate": 9.72972972972973e-06,
"loss": 0.5531,
"mean_token_accuracy": 0.9394397348165512,
"step": 3600,
"train/kl_loss_qwen": 0.04099080595187843,
"train/kl_loss_r1": 0.026141448691487313,
"train/total_kl": 0.06713225385174156
},
{
"epoch": 2.70482266841809,
"grad_norm": 2.203125,
"learning_rate": 9.701576576576577e-06,
"loss": 0.5351,
"mean_token_accuracy": 0.9384431034326554,
"step": 3605,
"train/kl_loss_qwen": 0.03942276262678206,
"train/kl_loss_r1": 0.024574512057006358,
"train/total_kl": 0.06399727454409003
},
{
"epoch": 2.708575717770689,
"grad_norm": 3.125,
"learning_rate": 9.673423423423425e-06,
"loss": 0.5716,
"mean_token_accuracy": 0.9273164391517639,
"step": 3610,
"train/kl_loss_qwen": 0.03769365311600268,
"train/kl_loss_r1": 0.02313569700345397,
"train/total_kl": 0.060829350538551805
},
{
"epoch": 2.712328767123288,
"grad_norm": 2.0,
"learning_rate": 9.645270270270272e-06,
"loss": 0.5567,
"mean_token_accuracy": 0.9299625158309937,
"step": 3615,
"train/kl_loss_qwen": 0.03794219749979675,
"train/kl_loss_r1": 0.02285592113621533,
"train/total_kl": 0.0607981177046895
},
{
"epoch": 2.716081816475887,
"grad_norm": 2.71875,
"learning_rate": 9.617117117117117e-06,
"loss": 0.534,
"mean_token_accuracy": 0.9324219495058059,
"step": 3620,
"train/kl_loss_qwen": 0.0340952820610255,
"train/kl_loss_r1": 0.021674492675811053,
"train/total_kl": 0.05576977375894785
},
{
"epoch": 2.719834865828486,
"grad_norm": 2.234375,
"learning_rate": 9.588963963963965e-06,
"loss": 0.5323,
"mean_token_accuracy": 0.9365492641925812,
"step": 3625,
"train/kl_loss_qwen": 0.03745631170459092,
"train/kl_loss_r1": 0.023027216829359532,
"train/total_kl": 0.06048352811485529
},
{
"epoch": 2.723587915181085,
"grad_norm": 2.125,
"learning_rate": 9.560810810810812e-06,
"loss": 0.5372,
"mean_token_accuracy": 0.9387341290712357,
"step": 3630,
"train/kl_loss_qwen": 0.03898381176404655,
"train/kl_loss_r1": 0.02341577596962452,
"train/total_kl": 0.062399587128311396
},
{
"epoch": 2.7273409645336835,
"grad_norm": 1.8984375,
"learning_rate": 9.532657657657658e-06,
"loss": 0.4913,
"mean_token_accuracy": 0.9357551246881485,
"step": 3635,
"train/kl_loss_qwen": 0.029723901767283678,
"train/kl_loss_r1": 0.01947716358117759,
"train/total_kl": 0.04920106595382094
},
{
"epoch": 2.7310940138862825,
"grad_norm": 2.25,
"learning_rate": 9.504504504504505e-06,
"loss": 0.6634,
"mean_token_accuracy": 0.9307036340236664,
"step": 3640,
"train/kl_loss_qwen": 0.057159008970484135,
"train/kl_loss_r1": 0.031469490751624106,
"train/total_kl": 0.0886284988373518
},
{
"epoch": 2.7348470632388815,
"grad_norm": 2.03125,
"learning_rate": 9.476351351351352e-06,
"loss": 0.6397,
"mean_token_accuracy": 0.9389469265937805,
"step": 3645,
"train/kl_loss_qwen": 0.05761205237358809,
"train/kl_loss_r1": 0.03301434912718833,
"train/total_kl": 0.09062640201300383
},
{
"epoch": 2.7386001125914805,
"grad_norm": 1.7890625,
"learning_rate": 9.4481981981982e-06,
"loss": 0.6008,
"mean_token_accuracy": 0.9420938581228256,
"step": 3650,
"train/kl_loss_qwen": 0.0493962530978024,
"train/kl_loss_r1": 0.02965642362833023,
"train/total_kl": 0.07905267719179392
},
{
"epoch": 2.7423531619440795,
"grad_norm": 2.125,
"learning_rate": 9.420045045045045e-06,
"loss": 0.5786,
"mean_token_accuracy": 0.9452258825302124,
"step": 3655,
"train/kl_loss_qwen": 0.045825537852942945,
"train/kl_loss_r1": 0.028989409655332567,
"train/total_kl": 0.0748149486258626
},
{
"epoch": 2.7461062112966785,
"grad_norm": 2.40625,
"learning_rate": 9.391891891891893e-06,
"loss": 0.5012,
"mean_token_accuracy": 0.9325804680585861,
"step": 3660,
"train/kl_loss_qwen": 0.03034242382273078,
"train/kl_loss_r1": 0.019461313867941497,
"train/total_kl": 0.04980373801663518
},
{
"epoch": 2.7498592606492775,
"grad_norm": 2.1875,
"learning_rate": 9.36373873873874e-06,
"loss": 0.5422,
"mean_token_accuracy": 0.9366270989179611,
"step": 3665,
"train/kl_loss_qwen": 0.038491744874045254,
"train/kl_loss_r1": 0.02244432335719466,
"train/total_kl": 0.060936068464070556
},
{
"epoch": 2.7536123100018766,
"grad_norm": 1.7109375,
"learning_rate": 9.335585585585586e-06,
"loss": 0.53,
"mean_token_accuracy": 0.9383520632982254,
"step": 3670,
"train/kl_loss_qwen": 0.039867379842326044,
"train/kl_loss_r1": 0.023165831109508872,
"train/total_kl": 0.06303321113809943
},
{
"epoch": 2.7573653593544756,
"grad_norm": 2.671875,
"learning_rate": 9.307432432432433e-06,
"loss": 0.5525,
"mean_token_accuracy": 0.9366106450557709,
"step": 3675,
"train/kl_loss_qwen": 0.0403043738566339,
"train/kl_loss_r1": 0.024402129231020808,
"train/total_kl": 0.06470650397241115
},
{
"epoch": 2.7611184087070746,
"grad_norm": 2.0,
"learning_rate": 9.27927927927928e-06,
"loss": 0.5376,
"mean_token_accuracy": 0.937373474240303,
"step": 3680,
"train/kl_loss_qwen": 0.03944247434847057,
"train/kl_loss_r1": 0.023985707806423305,
"train/total_kl": 0.06342818234115839
},
{
"epoch": 2.7648714580596736,
"grad_norm": 1.953125,
"learning_rate": 9.251126126126128e-06,
"loss": 0.554,
"mean_token_accuracy": 0.9357343703508377,
"step": 3685,
"train/kl_loss_qwen": 0.042518915608525276,
"train/kl_loss_r1": 0.025951301399618387,
"train/total_kl": 0.06847021728754044
},
{
"epoch": 2.7686245074122726,
"grad_norm": 2.078125,
"learning_rate": 9.222972972972973e-06,
"loss": 0.5743,
"mean_token_accuracy": 0.9325124055147171,
"step": 3690,
"train/kl_loss_qwen": 0.04556261282414198,
"train/kl_loss_r1": 0.025064739352092146,
"train/total_kl": 0.07062735268846154
},
{
"epoch": 2.772377556764871,
"grad_norm": 3.359375,
"learning_rate": 9.19481981981982e-06,
"loss": 0.5233,
"mean_token_accuracy": 0.9305480986833572,
"step": 3695,
"train/kl_loss_qwen": 0.031651955423876645,
"train/kl_loss_r1": 0.020345580391585828,
"train/total_kl": 0.05199753614142537
},
{
"epoch": 2.77613060611747,
"grad_norm": 1.8828125,
"learning_rate": 9.166666666666668e-06,
"loss": 0.5326,
"mean_token_accuracy": 0.9327965170145035,
"step": 3700,
"train/kl_loss_qwen": 0.03383352099917829,
"train/kl_loss_r1": 0.02235841490328312,
"train/total_kl": 0.056191935669630766
},
{
"epoch": 2.779883655470069,
"grad_norm": 2.03125,
"learning_rate": 9.138513513513514e-06,
"loss": 0.5492,
"mean_token_accuracy": 0.9406279385089874,
"step": 3705,
"train/kl_loss_qwen": 0.04245820404030383,
"train/kl_loss_r1": 0.02547566662542522,
"train/total_kl": 0.06793387047946453
},
{
"epoch": 2.7836367048226682,
"grad_norm": 1.9921875,
"learning_rate": 9.110360360360361e-06,
"loss": 0.5834,
"mean_token_accuracy": 0.9409590631723403,
"step": 3710,
"train/kl_loss_qwen": 0.04834628850221634,
"train/kl_loss_r1": 0.028032816713675857,
"train/total_kl": 0.07637910544872284
},
{
"epoch": 2.7873897541752672,
"grad_norm": 2.015625,
"learning_rate": 9.082207207207208e-06,
"loss": 0.5663,
"mean_token_accuracy": 0.9342130035161972,
"step": 3715,
"train/kl_loss_qwen": 0.04353028647601605,
"train/kl_loss_r1": 0.024533309601247312,
"train/total_kl": 0.06806359644979239
},
{
"epoch": 2.7911428035278663,
"grad_norm": 1.9375,
"learning_rate": 9.054054054054056e-06,
"loss": 0.5073,
"mean_token_accuracy": 0.9400626242160797,
"step": 3720,
"train/kl_loss_qwen": 0.03470782497897744,
"train/kl_loss_r1": 0.021252785716205834,
"train/total_kl": 0.0559606104157865
},
{
"epoch": 2.7948958528804653,
"grad_norm": 1.9140625,
"learning_rate": 9.025900900900901e-06,
"loss": 0.5781,
"mean_token_accuracy": 0.9387185037136078,
"step": 3725,
"train/kl_loss_qwen": 0.045765295764431356,
"train/kl_loss_r1": 0.02741283820942044,
"train/total_kl": 0.07317813383415342
},
{
"epoch": 2.7986489022330643,
"grad_norm": 1.8984375,
"learning_rate": 8.997747747747749e-06,
"loss": 0.5982,
"mean_token_accuracy": 0.9270498305559158,
"step": 3730,
"train/kl_loss_qwen": 0.04484616173431277,
"train/kl_loss_r1": 0.026128320163115858,
"train/total_kl": 0.0709744818508625
},
{
"epoch": 2.8024019515856633,
"grad_norm": 2.390625,
"learning_rate": 8.969594594594596e-06,
"loss": 0.5648,
"mean_token_accuracy": 0.9334120750427246,
"step": 3735,
"train/kl_loss_qwen": 0.039087398629635575,
"train/kl_loss_r1": 0.02425426966510713,
"train/total_kl": 0.06334166843444108
},
{
"epoch": 2.8061550009382623,
"grad_norm": 1.578125,
"learning_rate": 8.941441441441442e-06,
"loss": 0.543,
"mean_token_accuracy": 0.9337530016899109,
"step": 3740,
"train/kl_loss_qwen": 0.03704939093440771,
"train/kl_loss_r1": 0.02395803024992347,
"train/total_kl": 0.06100742164999247
},
{
"epoch": 2.8099080502908613,
"grad_norm": 1.9453125,
"learning_rate": 8.913288288288289e-06,
"loss": 0.5229,
"mean_token_accuracy": 0.9368319362401962,
"step": 3745,
"train/kl_loss_qwen": 0.0341915549710393,
"train/kl_loss_r1": 0.0229964439291507,
"train/total_kl": 0.05718799838796258
},
{
"epoch": 2.8136610996434603,
"grad_norm": 1.828125,
"learning_rate": 8.885135135135135e-06,
"loss": 0.5247,
"mean_token_accuracy": 0.9414711415767669,
"step": 3750,
"train/kl_loss_qwen": 0.0371045992244035,
"train/kl_loss_r1": 0.02308794721029699,
"train/total_kl": 0.06019254634156823
},
{
"epoch": 2.8174141489960594,
"grad_norm": 1.859375,
"learning_rate": 8.856981981981982e-06,
"loss": 0.5195,
"mean_token_accuracy": 0.9347955495119095,
"step": 3755,
"train/kl_loss_qwen": 0.033538066316396,
"train/kl_loss_r1": 0.02079420080408454,
"train/total_kl": 0.05433226684108376
},
{
"epoch": 2.8211671983486584,
"grad_norm": 2.203125,
"learning_rate": 8.828828828828828e-06,
"loss": 0.5368,
"mean_token_accuracy": 0.9394807755947113,
"step": 3760,
"train/kl_loss_qwen": 0.04017904317006469,
"train/kl_loss_r1": 0.02556949369609356,
"train/total_kl": 0.06574853714555502
},
{
"epoch": 2.8249202477012574,
"grad_norm": 2.25,
"learning_rate": 8.800675675675675e-06,
"loss": 0.5621,
"mean_token_accuracy": 0.9337575942277908,
"step": 3765,
"train/kl_loss_qwen": 0.04164319918490946,
"train/kl_loss_r1": 0.025234598480165005,
"train/total_kl": 0.06687779715284706
},
{
"epoch": 2.8286732970538564,
"grad_norm": 1.796875,
"learning_rate": 8.772522522522522e-06,
"loss": 0.6141,
"mean_token_accuracy": 0.9375328481197357,
"step": 3770,
"train/kl_loss_qwen": 0.05453315619379282,
"train/kl_loss_r1": 0.029898820351809262,
"train/total_kl": 0.08443197626620531
},
{
"epoch": 2.8324263464064554,
"grad_norm": 2.359375,
"learning_rate": 8.744369369369368e-06,
"loss": 0.5598,
"mean_token_accuracy": 0.9362965226173401,
"step": 3775,
"train/kl_loss_qwen": 0.04102930808439851,
"train/kl_loss_r1": 0.025926942005753517,
"train/total_kl": 0.06695624999701977
},
{
"epoch": 2.8361793957590544,
"grad_norm": 2.015625,
"learning_rate": 8.716216216216215e-06,
"loss": 0.5406,
"mean_token_accuracy": 0.935252970457077,
"step": 3780,
"train/kl_loss_qwen": 0.03538098763674498,
"train/kl_loss_r1": 0.0222157409414649,
"train/total_kl": 0.05759672923013568
},
{
"epoch": 2.8399324451116534,
"grad_norm": 1.6328125,
"learning_rate": 8.688063063063063e-06,
"loss": 0.5285,
"mean_token_accuracy": 0.9366535782814026,
"step": 3785,
"train/kl_loss_qwen": 0.037326518120244144,
"train/kl_loss_r1": 0.02341712433844805,
"train/total_kl": 0.06074364213272929
},
{
"epoch": 2.8436854944642525,
"grad_norm": 2.203125,
"learning_rate": 8.65990990990991e-06,
"loss": 0.5401,
"mean_token_accuracy": 0.9265829980373382,
"step": 3790,
"train/kl_loss_qwen": 0.03308621980249882,
"train/kl_loss_r1": 0.02124992748722434,
"train/total_kl": 0.054336147289723156
},
{
"epoch": 2.8474385438168515,
"grad_norm": 1.7265625,
"learning_rate": 8.631756756756756e-06,
"loss": 0.6078,
"mean_token_accuracy": 0.9308181017637253,
"step": 3795,
"train/kl_loss_qwen": 0.04486876749433577,
"train/kl_loss_r1": 0.027050571562722326,
"train/total_kl": 0.07191933877766132
},
{
"epoch": 2.85119159316945,
"grad_norm": 3.25,
"learning_rate": 8.603603603603603e-06,
"loss": 0.5967,
"mean_token_accuracy": 0.9408103972673416,
"step": 3800,
"train/kl_loss_qwen": 0.0475672734901309,
"train/kl_loss_r1": 0.02717355964705348,
"train/total_kl": 0.07474083248525858
},
{
"epoch": 2.854944642522049,
"grad_norm": 1.828125,
"learning_rate": 8.57545045045045e-06,
"loss": 0.5357,
"mean_token_accuracy": 0.9340519219636917,
"step": 3805,
"train/kl_loss_qwen": 0.036199712427333,
"train/kl_loss_r1": 0.02173711806535721,
"train/total_kl": 0.057936831191182134
},
{
"epoch": 2.858697691874648,
"grad_norm": 1.7890625,
"learning_rate": 8.547297297297296e-06,
"loss": 0.5403,
"mean_token_accuracy": 0.9292895257472992,
"step": 3810,
"train/kl_loss_qwen": 0.03628214751370251,
"train/kl_loss_r1": 0.02147832843475044,
"train/total_kl": 0.05776047557592392
},
{
"epoch": 2.862450741227247,
"grad_norm": 2.140625,
"learning_rate": 8.519144144144143e-06,
"loss": 0.5504,
"mean_token_accuracy": 0.940996965765953,
"step": 3815,
"train/kl_loss_qwen": 0.043149954592809084,
"train/kl_loss_r1": 0.024290137737989426,
"train/total_kl": 0.06744009256362915
},
{
"epoch": 2.866203790579846,
"grad_norm": 2.40625,
"learning_rate": 8.49099099099099e-06,
"loss": 0.5459,
"mean_token_accuracy": 0.9365820527076721,
"step": 3820,
"train/kl_loss_qwen": 0.037740124668926,
"train/kl_loss_r1": 0.023466435493901372,
"train/total_kl": 0.06120656076818705
},
{
"epoch": 2.869956839932445,
"grad_norm": 2.046875,
"learning_rate": 8.462837837837838e-06,
"loss": 0.5557,
"mean_token_accuracy": 0.9349883943796158,
"step": 3825,
"train/kl_loss_qwen": 0.03992229206487537,
"train/kl_loss_r1": 0.024882027273997666,
"train/total_kl": 0.06480431975796819
},
{
"epoch": 2.873709889285044,
"grad_norm": 2.296875,
"learning_rate": 8.434684684684684e-06,
"loss": 0.5419,
"mean_token_accuracy": 0.929443484544754,
"step": 3830,
"train/kl_loss_qwen": 0.029825980495661496,
"train/kl_loss_r1": 0.019207194168120622,
"train/total_kl": 0.04903317447751761
},
{
"epoch": 2.877462938637643,
"grad_norm": 1.8125,
"learning_rate": 8.406531531531531e-06,
"loss": 0.6054,
"mean_token_accuracy": 0.9381425529718399,
"step": 3835,
"train/kl_loss_qwen": 0.051548151206225155,
"train/kl_loss_r1": 0.029248832399025558,
"train/total_kl": 0.08079698467627168
},
{
"epoch": 2.881215987990242,
"grad_norm": 1.84375,
"learning_rate": 8.378378378378378e-06,
"loss": 0.5031,
"mean_token_accuracy": 0.9378216952085495,
"step": 3840,
"train/kl_loss_qwen": 0.029105788422748448,
"train/kl_loss_r1": 0.02014454547315836,
"train/total_kl": 0.049250333290547135
},
{
"epoch": 2.884969037342841,
"grad_norm": 1.7109375,
"learning_rate": 8.350225225225224e-06,
"loss": 0.557,
"mean_token_accuracy": 0.9410496950149536,
"step": 3845,
"train/kl_loss_qwen": 0.04421229516156018,
"train/kl_loss_r1": 0.027130865957587957,
"train/total_kl": 0.07134316163137555
},
{
"epoch": 2.88872208669544,
"grad_norm": 2.375,
"learning_rate": 8.322072072072071e-06,
"loss": 0.5813,
"mean_token_accuracy": 0.9363250583410263,
"step": 3850,
"train/kl_loss_qwen": 0.043784852838143706,
"train/kl_loss_r1": 0.02625744407996535,
"train/total_kl": 0.07004229752346873
},
{
"epoch": 2.892475136048039,
"grad_norm": 2.3125,
"learning_rate": 8.293918918918919e-06,
"loss": 0.5314,
"mean_token_accuracy": 0.9301344156265259,
"step": 3855,
"train/kl_loss_qwen": 0.03253565886989236,
"train/kl_loss_r1": 0.02052079071290791,
"train/total_kl": 0.05305644990876317
},
{
"epoch": 2.8962281854006378,
"grad_norm": 1.6328125,
"learning_rate": 8.265765765765766e-06,
"loss": 0.5232,
"mean_token_accuracy": 0.9402690678834915,
"step": 3860,
"train/kl_loss_qwen": 0.03729556603357196,
"train/kl_loss_r1": 0.023621046915650368,
"train/total_kl": 0.06091661211103201
},
{
"epoch": 2.8999812347532368,
"grad_norm": 2.125,
"learning_rate": 8.237612612612612e-06,
"loss": 0.5552,
"mean_token_accuracy": 0.9285988807678223,
"step": 3865,
"train/kl_loss_qwen": 0.03528278898447752,
"train/kl_loss_r1": 0.023424216313287616,
"train/total_kl": 0.05870700422674417
},
{
"epoch": 2.903734284105836,
"grad_norm": 1.875,
"learning_rate": 8.209459459459459e-06,
"loss": 0.5015,
"mean_token_accuracy": 0.9393262028694153,
"step": 3870,
"train/kl_loss_qwen": 0.03307979837991297,
"train/kl_loss_r1": 0.02109087221324444,
"train/total_kl": 0.05417067091912031
},
{
"epoch": 2.907487333458435,
"grad_norm": 2.234375,
"learning_rate": 8.181306306306306e-06,
"loss": 0.5546,
"mean_token_accuracy": 0.9359008401632309,
"step": 3875,
"train/kl_loss_qwen": 0.03611066797748208,
"train/kl_loss_r1": 0.021728359861299396,
"train/total_kl": 0.0578390278853476
},
{
"epoch": 2.911240382811034,
"grad_norm": 2.390625,
"learning_rate": 8.153153153153152e-06,
"loss": 0.5153,
"mean_token_accuracy": 0.9441088616847992,
"step": 3880,
"train/kl_loss_qwen": 0.0379474226385355,
"train/kl_loss_r1": 0.024300627363845705,
"train/total_kl": 0.062248049583286044
},
{
"epoch": 2.914993432163633,
"grad_norm": 1.84375,
"learning_rate": 8.125e-06,
"loss": 0.5666,
"mean_token_accuracy": 0.9372196048498154,
"step": 3885,
"train/kl_loss_qwen": 0.04451721617951989,
"train/kl_loss_r1": 0.025683000870049,
"train/total_kl": 0.0702002163976431
},
{
"epoch": 2.918746481516232,
"grad_norm": 1.7734375,
"learning_rate": 8.096846846846847e-06,
"loss": 0.6314,
"mean_token_accuracy": 0.939824691414833,
"step": 3890,
"train/kl_loss_qwen": 0.05579751967452466,
"train/kl_loss_r1": 0.031048040231689812,
"train/total_kl": 0.08684556037187577
},
{
"epoch": 2.922499530868831,
"grad_norm": 2.0,
"learning_rate": 8.068693693693694e-06,
"loss": 0.5812,
"mean_token_accuracy": 0.9380946755409241,
"step": 3895,
"train/kl_loss_qwen": 0.048919730540364983,
"train/kl_loss_r1": 0.027685640146955848,
"train/total_kl": 0.07660537036135792
},
{
"epoch": 2.92625258022143,
"grad_norm": 1.8828125,
"learning_rate": 8.04054054054054e-06,
"loss": 0.6208,
"mean_token_accuracy": 0.9400785356760025,
"step": 3900,
"train/kl_loss_qwen": 0.05649301186203957,
"train/kl_loss_r1": 0.03048962224274874,
"train/total_kl": 0.08698263382539154
},
{
"epoch": 2.930005629574029,
"grad_norm": 2.296875,
"learning_rate": 8.012387387387387e-06,
"loss": 0.5621,
"mean_token_accuracy": 0.931654891371727,
"step": 3905,
"train/kl_loss_qwen": 0.03453084141947329,
"train/kl_loss_r1": 0.02273784396238625,
"train/total_kl": 0.057268685381859544
},
{
"epoch": 2.933758678926628,
"grad_norm": 1.953125,
"learning_rate": 7.984234234234234e-06,
"loss": 0.5216,
"mean_token_accuracy": 0.93751060962677,
"step": 3910,
"train/kl_loss_qwen": 0.03516701152548194,
"train/kl_loss_r1": 0.021255293721333147,
"train/total_kl": 0.05642230454832316
},
{
"epoch": 2.937511728279227,
"grad_norm": 1.7890625,
"learning_rate": 7.956081081081082e-06,
"loss": 0.5714,
"mean_token_accuracy": 0.9317866563796997,
"step": 3915,
"train/kl_loss_qwen": 0.04194287592545152,
"train/kl_loss_r1": 0.02454805881716311,
"train/total_kl": 0.06649093553423882
},
{
"epoch": 2.941264777631826,
"grad_norm": 1.90625,
"learning_rate": 7.927927927927927e-06,
"loss": 0.545,
"mean_token_accuracy": 0.9375185400247574,
"step": 3920,
"train/kl_loss_qwen": 0.03942022132687271,
"train/kl_loss_r1": 0.023067365027964117,
"train/total_kl": 0.06248758668079972
},
{
"epoch": 2.945017826984425,
"grad_norm": 2.046875,
"learning_rate": 7.899774774774775e-06,
"loss": 0.5349,
"mean_token_accuracy": 0.9322762429714203,
"step": 3925,
"train/kl_loss_qwen": 0.034470038348808886,
"train/kl_loss_r1": 0.02245264039374888,
"train/total_kl": 0.05692267790436745
},
{
"epoch": 2.948770876337024,
"grad_norm": 2.109375,
"learning_rate": 7.871621621621622e-06,
"loss": 0.5035,
"mean_token_accuracy": 0.9372401058673858,
"step": 3930,
"train/kl_loss_qwen": 0.034070842619985345,
"train/kl_loss_r1": 0.021460118377581237,
"train/total_kl": 0.05553096104413271
},
{
"epoch": 2.952523925689623,
"grad_norm": 2.0,
"learning_rate": 7.843468468468468e-06,
"loss": 0.543,
"mean_token_accuracy": 0.9385394662618637,
"step": 3935,
"train/kl_loss_qwen": 0.046337118837982416,
"train/kl_loss_r1": 0.023731139581650497,
"train/total_kl": 0.07006825897842646
},
{
"epoch": 2.956276975042222,
"grad_norm": 1.796875,
"learning_rate": 7.815315315315315e-06,
"loss": 0.4859,
"mean_token_accuracy": 0.9361509501934051,
"step": 3940,
"train/kl_loss_qwen": 0.027159277442842723,
"train/kl_loss_r1": 0.019265179615467788,
"train/total_kl": 0.04642445733770728
},
{
"epoch": 2.960030024394821,
"grad_norm": 1.859375,
"learning_rate": 7.787162162162162e-06,
"loss": 0.5327,
"mean_token_accuracy": 0.9324598968029022,
"step": 3945,
"train/kl_loss_qwen": 0.037095142807811496,
"train/kl_loss_r1": 0.022269541397690773,
"train/total_kl": 0.059364685136824843
},
{
"epoch": 2.96378307374742,
"grad_norm": 2.703125,
"learning_rate": 7.75900900900901e-06,
"loss": 0.5268,
"mean_token_accuracy": 0.9340989470481873,
"step": 3950,
"train/kl_loss_qwen": 0.036777173075824975,
"train/kl_loss_r1": 0.02218401376157999,
"train/total_kl": 0.058961186278611424
},
{
"epoch": 2.967536123100019,
"grad_norm": 1.75,
"learning_rate": 7.730855855855855e-06,
"loss": 0.5091,
"mean_token_accuracy": 0.940819251537323,
"step": 3955,
"train/kl_loss_qwen": 0.03606356335803866,
"train/kl_loss_r1": 0.020537690771743656,
"train/total_kl": 0.05660125305876136
},
{
"epoch": 2.9712891724526176,
"grad_norm": 2.4375,
"learning_rate": 7.702702702702703e-06,
"loss": 0.5723,
"mean_token_accuracy": 0.9405235350131989,
"step": 3960,
"train/kl_loss_qwen": 0.046202197298407556,
"train/kl_loss_r1": 0.02828790796920657,
"train/total_kl": 0.07449010526761413
},
{
"epoch": 2.9750422218052166,
"grad_norm": 2.375,
"learning_rate": 7.67454954954955e-06,
"loss": 0.5426,
"mean_token_accuracy": 0.9397156774997711,
"step": 3965,
"train/kl_loss_qwen": 0.03755204356275499,
"train/kl_loss_r1": 0.025371223222464323,
"train/total_kl": 0.06292326673865319
},
{
"epoch": 2.9787952711578156,
"grad_norm": 2.765625,
"learning_rate": 7.646396396396396e-06,
"loss": 0.4963,
"mean_token_accuracy": 0.9325908690690994,
"step": 3970,
"train/kl_loss_qwen": 0.026620158832520245,
"train/kl_loss_r1": 0.01883739125914872,
"train/total_kl": 0.04545754995197058
},
{
"epoch": 2.9825483205104146,
"grad_norm": 2.0625,
"learning_rate": 7.618243243243243e-06,
"loss": 0.5926,
"mean_token_accuracy": 0.9297185957431793,
"step": 3975,
"train/kl_loss_qwen": 0.04432291784323752,
"train/kl_loss_r1": 0.025650422694161533,
"train/total_kl": 0.06997334016487003
},
{
"epoch": 2.9863013698630136,
"grad_norm": 1.8984375,
"learning_rate": 7.59009009009009e-06,
"loss": 0.5557,
"mean_token_accuracy": 0.9421306163072586,
"step": 3980,
"train/kl_loss_qwen": 0.04748995001427829,
"train/kl_loss_r1": 0.025721484888345005,
"train/total_kl": 0.07321143466979266
},
{
"epoch": 2.9900544192156127,
"grad_norm": 1.90625,
"learning_rate": 7.561936936936937e-06,
"loss": 0.5351,
"mean_token_accuracy": 0.9442136764526368,
"step": 3985,
"train/kl_loss_qwen": 0.04505083854310214,
"train/kl_loss_r1": 0.02471695919521153,
"train/total_kl": 0.06976779699325561
},
{
"epoch": 2.9938074685682117,
"grad_norm": 2.5,
"learning_rate": 7.533783783783783e-06,
"loss": 0.5705,
"mean_token_accuracy": 0.9401636183261871,
"step": 3990,
"train/kl_loss_qwen": 0.04586976226419211,
"train/kl_loss_r1": 0.026439438899978997,
"train/total_kl": 0.0723092008382082
},
{
"epoch": 2.9975605179208107,
"grad_norm": 2.328125,
"learning_rate": 7.5056306306306306e-06,
"loss": 0.5479,
"mean_token_accuracy": 0.9345041036605835,
"step": 3995,
"train/kl_loss_qwen": 0.03837931305170059,
"train/kl_loss_r1": 0.02360314899124205,
"train/total_kl": 0.06198246162384748
},
{
"epoch": 3.00075060987052,
"grad_norm": 3.828125,
"learning_rate": 7.477477477477477e-06,
"loss": 0.4843,
"mean_token_accuracy": 0.9349478237769183,
"step": 4000,
"train/kl_loss_qwen": 0.02753753647865618,
"train/kl_loss_r1": 0.018358695868621853,
"train/total_kl": 0.0458962315803065
},
{
"epoch": 3.004503659223119,
"grad_norm": 2.546875,
"learning_rate": 7.449324324324324e-06,
"loss": 0.5179,
"mean_token_accuracy": 0.9468716859817505,
"step": 4005,
"train/kl_loss_qwen": 0.03820655262097716,
"train/kl_loss_r1": 0.023267941363155843,
"train/total_kl": 0.06147449426352978
},
{
"epoch": 3.008256708575718,
"grad_norm": 3.484375,
"learning_rate": 7.421171171171171e-06,
"loss": 0.4789,
"mean_token_accuracy": 0.9452569574117661,
"step": 4010,
"train/kl_loss_qwen": 0.029093041876330973,
"train/kl_loss_r1": 0.020022685592994093,
"train/total_kl": 0.04911572737619281
},
{
"epoch": 3.012009757928317,
"grad_norm": 1.84375,
"learning_rate": 7.393018018018018e-06,
"loss": 0.5046,
"mean_token_accuracy": 0.9512590229511261,
"step": 4015,
"train/kl_loss_qwen": 0.03662499454803765,
"train/kl_loss_r1": 0.023514971556141972,
"train/total_kl": 0.06013996629044414
},
{
"epoch": 3.015762807280916,
"grad_norm": 1.8046875,
"learning_rate": 7.364864864864865e-06,
"loss": 0.5237,
"mean_token_accuracy": 0.9501432359218598,
"step": 4020,
"train/kl_loss_qwen": 0.04352525365538895,
"train/kl_loss_r1": 0.025102979922667145,
"train/total_kl": 0.06862823301926255
},
{
"epoch": 3.0195158566335145,
"grad_norm": 1.625,
"learning_rate": 7.336711711711712e-06,
"loss": 0.4782,
"mean_token_accuracy": 0.9528643399477005,
"step": 4025,
"train/kl_loss_qwen": 0.03597725708968937,
"train/kl_loss_r1": 0.022700622864067554,
"train/total_kl": 0.05867787953466177
},
{
"epoch": 3.0232689059861135,
"grad_norm": 1.875,
"learning_rate": 7.3085585585585585e-06,
"loss": 0.4676,
"mean_token_accuracy": 0.9526668071746827,
"step": 4030,
"train/kl_loss_qwen": 0.03230909314006567,
"train/kl_loss_r1": 0.022169433534145355,
"train/total_kl": 0.05447852648794651
},
{
"epoch": 3.0270219553387125,
"grad_norm": 1.8046875,
"learning_rate": 7.280405405405405e-06,
"loss": 0.5167,
"mean_token_accuracy": 0.9462513476610184,
"step": 4035,
"train/kl_loss_qwen": 0.04153737160377204,
"train/kl_loss_r1": 0.02482378501445055,
"train/total_kl": 0.06636115610599518
},
{
"epoch": 3.0307750046913116,
"grad_norm": 2.859375,
"learning_rate": 7.252252252252252e-06,
"loss": 0.5115,
"mean_token_accuracy": 0.9501920282840729,
"step": 4040,
"train/kl_loss_qwen": 0.03945711711421609,
"train/kl_loss_r1": 0.02391032031737268,
"train/total_kl": 0.06336743775755167
},
{
"epoch": 3.0345280540439106,
"grad_norm": 1.9921875,
"learning_rate": 7.224099099099099e-06,
"loss": 0.4889,
"mean_token_accuracy": 0.9590217292308807,
"step": 4045,
"train/kl_loss_qwen": 0.04280410804785788,
"train/kl_loss_r1": 0.024979598447680475,
"train/total_kl": 0.06778370654210449
},
{
"epoch": 3.0382811033965096,
"grad_norm": 1.65625,
"learning_rate": 7.195945945945946e-06,
"loss": 0.5881,
"mean_token_accuracy": 0.9521596044301986,
"step": 4050,
"train/kl_loss_qwen": 0.05545506034977734,
"train/kl_loss_r1": 0.03175990539602935,
"train/total_kl": 0.08721496500074863
},
{
"epoch": 3.0420341527491086,
"grad_norm": 1.921875,
"learning_rate": 7.167792792792793e-06,
"loss": 0.5075,
"mean_token_accuracy": 0.9522938549518585,
"step": 4055,
"train/kl_loss_qwen": 0.03955656290054321,
"train/kl_loss_r1": 0.024640692863613367,
"train/total_kl": 0.06419725548475981
},
{
"epoch": 3.0457872021017076,
"grad_norm": 1.8828125,
"learning_rate": 7.13963963963964e-06,
"loss": 0.5131,
"mean_token_accuracy": 0.9544217169284821,
"step": 4060,
"train/kl_loss_qwen": 0.04303731750696897,
"train/kl_loss_r1": 0.025201013032346963,
"train/total_kl": 0.06823833063244819
},
{
"epoch": 3.0495402514543066,
"grad_norm": 1.4765625,
"learning_rate": 7.1114864864864865e-06,
"loss": 0.537,
"mean_token_accuracy": 0.9559321880340577,
"step": 4065,
"train/kl_loss_qwen": 0.04774435576982796,
"train/kl_loss_r1": 0.028734903130680323,
"train/total_kl": 0.07647925987839699
},
{
"epoch": 3.0532933008069056,
"grad_norm": 1.6953125,
"learning_rate": 7.083333333333333e-06,
"loss": 0.5265,
"mean_token_accuracy": 0.9555478453636169,
"step": 4070,
"train/kl_loss_qwen": 0.047786570899188516,
"train/kl_loss_r1": 0.027031732350587846,
"train/total_kl": 0.0748183025047183
},
{
"epoch": 3.0570463501595047,
"grad_norm": 1.640625,
"learning_rate": 7.05518018018018e-06,
"loss": 0.4906,
"mean_token_accuracy": 0.9537694811820984,
"step": 4075,
"train/kl_loss_qwen": 0.03627552236430347,
"train/kl_loss_r1": 0.023278655018657446,
"train/total_kl": 0.05955417826771736
},
{
"epoch": 3.0607993995121037,
"grad_norm": 1.7421875,
"learning_rate": 7.027027027027027e-06,
"loss": 0.5125,
"mean_token_accuracy": 0.9504808455705642,
"step": 4080,
"train/kl_loss_qwen": 0.044115427136421206,
"train/kl_loss_r1": 0.02430842686444521,
"train/total_kl": 0.06842385372146964
},
{
"epoch": 3.0645524488647027,
"grad_norm": 2.078125,
"learning_rate": 6.998873873873874e-06,
"loss": 0.5355,
"mean_token_accuracy": 0.9497076243162155,
"step": 4085,
"train/kl_loss_qwen": 0.040773709490895274,
"train/kl_loss_r1": 0.025684031751006843,
"train/total_kl": 0.06645774105563759
},
{
"epoch": 3.0683054982173017,
"grad_norm": 1.65625,
"learning_rate": 6.970720720720721e-06,
"loss": 0.4942,
"mean_token_accuracy": 0.9535217344760895,
"step": 4090,
"train/kl_loss_qwen": 0.03903574231080711,
"train/kl_loss_r1": 0.02369346497580409,
"train/total_kl": 0.06272920705378056
},
{
"epoch": 3.0720585475699007,
"grad_norm": 1.6328125,
"learning_rate": 6.942567567567568e-06,
"loss": 0.4827,
"mean_token_accuracy": 0.9569115400314331,
"step": 4095,
"train/kl_loss_qwen": 0.03822903037071228,
"train/kl_loss_r1": 0.022737222351133825,
"train/total_kl": 0.060966251976788045
},
{
"epoch": 3.0758115969224997,
"grad_norm": 1.7734375,
"learning_rate": 6.9144144144144145e-06,
"loss": 0.5387,
"mean_token_accuracy": 0.9468695998191834,
"step": 4100,
"train/kl_loss_qwen": 0.04365008450113237,
"train/kl_loss_r1": 0.026509212469682096,
"train/total_kl": 0.070159297529608
},
{
"epoch": 3.0795646462750987,
"grad_norm": 2.265625,
"learning_rate": 6.886261261261261e-06,
"loss": 0.4856,
"mean_token_accuracy": 0.9466418087482452,
"step": 4105,
"train/kl_loss_qwen": 0.034907838655635716,
"train/kl_loss_r1": 0.020991062698885798,
"train/total_kl": 0.0558989018201828
},
{
"epoch": 3.0833176956276973,
"grad_norm": 1.9375,
"learning_rate": 6.858108108108108e-06,
"loss": 0.5102,
"mean_token_accuracy": 0.9507683873176574,
"step": 4110,
"train/kl_loss_qwen": 0.03961786311119795,
"train/kl_loss_r1": 0.024199524614959955,
"train/total_kl": 0.06381738800555467
},
{
"epoch": 3.0870707449802963,
"grad_norm": 2.0,
"learning_rate": 6.829954954954955e-06,
"loss": 0.4829,
"mean_token_accuracy": 0.944465833902359,
"step": 4115,
"train/kl_loss_qwen": 0.031371227093040945,
"train/kl_loss_r1": 0.020947957457974554,
"train/total_kl": 0.05231918422505259
},
{
"epoch": 3.0908237943328953,
"grad_norm": 1.5078125,
"learning_rate": 6.801801801801802e-06,
"loss": 0.4616,
"mean_token_accuracy": 0.9485589683055877,
"step": 4120,
"train/kl_loss_qwen": 0.031080040195956827,
"train/kl_loss_r1": 0.019682012405246495,
"train/total_kl": 0.05076205227524042
},
{
"epoch": 3.0945768436854943,
"grad_norm": 1.7578125,
"learning_rate": 6.773648648648649e-06,
"loss": 0.5351,
"mean_token_accuracy": 0.9564525872468949,
"step": 4125,
"train/kl_loss_qwen": 0.04921146645210683,
"train/kl_loss_r1": 0.02725354707799852,
"train/total_kl": 0.07646501287817956
},
{
"epoch": 3.0983298930380934,
"grad_norm": 3.703125,
"learning_rate": 6.745495495495496e-06,
"loss": 0.5667,
"mean_token_accuracy": 0.9405909597873687,
"step": 4130,
"train/kl_loss_qwen": 0.041168075334280727,
"train/kl_loss_r1": 0.025406582234427332,
"train/total_kl": 0.06657465808093548
},
{
"epoch": 3.1020829423906924,
"grad_norm": 1.796875,
"learning_rate": 6.7173423423423425e-06,
"loss": 0.4896,
"mean_token_accuracy": 0.9521638125181198,
"step": 4135,
"train/kl_loss_qwen": 0.03744446937926114,
"train/kl_loss_r1": 0.02312980592250824,
"train/total_kl": 0.06057427516207099
},
{
"epoch": 3.1058359917432914,
"grad_norm": 1.5,
"learning_rate": 6.689189189189189e-06,
"loss": 0.5447,
"mean_token_accuracy": 0.9512269377708436,
"step": 4140,
"train/kl_loss_qwen": 0.04734295061789453,
"train/kl_loss_r1": 0.027056427067145707,
"train/total_kl": 0.07439937759190798
},
{
"epoch": 3.1095890410958904,
"grad_norm": 1.6796875,
"learning_rate": 6.661036036036036e-06,
"loss": 0.5268,
"mean_token_accuracy": 0.9557883590459824,
"step": 4145,
"train/kl_loss_qwen": 0.04429617114365101,
"train/kl_loss_r1": 0.02629926986992359,
"train/total_kl": 0.07059544026851654
},
{
"epoch": 3.1133420904484894,
"grad_norm": 1.71875,
"learning_rate": 6.632882882882883e-06,
"loss": 0.5058,
"mean_token_accuracy": 0.9476411014795303,
"step": 4150,
"train/kl_loss_qwen": 0.037383958138525485,
"train/kl_loss_r1": 0.023662435123696923,
"train/total_kl": 0.061046394519507885
},
{
"epoch": 3.1170951398010884,
"grad_norm": 1.4921875,
"learning_rate": 6.60472972972973e-06,
"loss": 0.479,
"mean_token_accuracy": 0.9571599304676056,
"step": 4155,
"train/kl_loss_qwen": 0.038876288337633014,
"train/kl_loss_r1": 0.024421562859788536,
"train/total_kl": 0.06329785119742155
},
{
"epoch": 3.1208481891536874,
"grad_norm": 2.484375,
"learning_rate": 6.576576576576577e-06,
"loss": 0.491,
"mean_token_accuracy": 0.9498330116271972,
"step": 4160,
"train/kl_loss_qwen": 0.03512372067198157,
"train/kl_loss_r1": 0.02344148699194193,
"train/total_kl": 0.058565208595246075
},
{
"epoch": 3.1246012385062865,
"grad_norm": 3.359375,
"learning_rate": 6.548423423423424e-06,
"loss": 0.4872,
"mean_token_accuracy": 0.9566541939973832,
"step": 4165,
"train/kl_loss_qwen": 0.03824820877052844,
"train/kl_loss_r1": 0.02418025666847825,
"train/total_kl": 0.06242846576496959
},
{
"epoch": 3.1283542878588855,
"grad_norm": 1.5703125,
"learning_rate": 6.5202702702702704e-06,
"loss": 0.49,
"mean_token_accuracy": 0.9528867095708847,
"step": 4170,
"train/kl_loss_qwen": 0.04278830396942794,
"train/kl_loss_r1": 0.024134243838489056,
"train/total_kl": 0.06692254794761539
},
{
"epoch": 3.1321073372114845,
"grad_norm": 2.40625,
"learning_rate": 6.492117117117117e-06,
"loss": 0.5232,
"mean_token_accuracy": 0.9546979814767838,
"step": 4175,
"train/kl_loss_qwen": 0.04611057708971202,
"train/kl_loss_r1": 0.025870457151904704,
"train/total_kl": 0.07198103414848447
},
{
"epoch": 3.1358603865640835,
"grad_norm": 1.4296875,
"learning_rate": 6.463963963963964e-06,
"loss": 0.5159,
"mean_token_accuracy": 0.9506950169801712,
"step": 4180,
"train/kl_loss_qwen": 0.04252455835230649,
"train/kl_loss_r1": 0.024353090580552815,
"train/total_kl": 0.0668776486068964
},
{
"epoch": 3.139613435916682,
"grad_norm": 2.21875,
"learning_rate": 6.435810810810811e-06,
"loss": 0.5279,
"mean_token_accuracy": 0.9519837826490403,
"step": 4185,
"train/kl_loss_qwen": 0.04363212245516479,
"train/kl_loss_r1": 0.026513157226145268,
"train/total_kl": 0.07014527972787618
},
{
"epoch": 3.143366485269281,
"grad_norm": 1.9296875,
"learning_rate": 6.407657657657658e-06,
"loss": 0.5222,
"mean_token_accuracy": 0.9523192524909974,
"step": 4190,
"train/kl_loss_qwen": 0.04511188971810043,
"train/kl_loss_r1": 0.02609873116016388,
"train/total_kl": 0.07121062017977238
},
{
"epoch": 3.14711953462188,
"grad_norm": 2.171875,
"learning_rate": 6.379504504504505e-06,
"loss": 0.5307,
"mean_token_accuracy": 0.9508942574262619,
"step": 4195,
"train/kl_loss_qwen": 0.04281947310082614,
"train/kl_loss_r1": 0.02625079546123743,
"train/total_kl": 0.06907026935368776
},
{
"epoch": 3.150872583974479,
"grad_norm": 1.78125,
"learning_rate": 6.351351351351352e-06,
"loss": 0.4731,
"mean_token_accuracy": 0.9568151891231537,
"step": 4200,
"train/kl_loss_qwen": 0.036586605850607155,
"train/kl_loss_r1": 0.02390783354640007,
"train/total_kl": 0.060494439676404
},
{
"epoch": 3.154625633327078,
"grad_norm": 1.8671875,
"learning_rate": 6.323198198198198e-06,
"loss": 0.4717,
"mean_token_accuracy": 0.954903456568718,
"step": 4205,
"train/kl_loss_qwen": 0.03747730739414692,
"train/kl_loss_r1": 0.021962188137695193,
"train/total_kl": 0.05943949557840824
},
{
"epoch": 3.158378682679677,
"grad_norm": 2.0625,
"learning_rate": 6.295045045045045e-06,
"loss": 0.5623,
"mean_token_accuracy": 0.9474755525588989,
"step": 4210,
"train/kl_loss_qwen": 0.050565437460318205,
"train/kl_loss_r1": 0.028789392672479153,
"train/total_kl": 0.07935483139008284
},
{
"epoch": 3.162131732032276,
"grad_norm": 1.78125,
"learning_rate": 6.266891891891892e-06,
"loss": 0.4662,
"mean_token_accuracy": 0.9511516332626343,
"step": 4215,
"train/kl_loss_qwen": 0.03249250883236528,
"train/kl_loss_r1": 0.019301535561680794,
"train/total_kl": 0.05179404448717832
},
{
"epoch": 3.165884781384875,
"grad_norm": 2.453125,
"learning_rate": 6.238738738738739e-06,
"loss": 0.5013,
"mean_token_accuracy": 0.9568227618932724,
"step": 4220,
"train/kl_loss_qwen": 0.041591133316978814,
"train/kl_loss_r1": 0.025532052014023067,
"train/total_kl": 0.0671231847256422
},
{
"epoch": 3.169637830737474,
"grad_norm": 1.84375,
"learning_rate": 6.210585585585586e-06,
"loss": 0.5351,
"mean_token_accuracy": 0.9437592476606369,
"step": 4225,
"train/kl_loss_qwen": 0.03993491227738559,
"train/kl_loss_r1": 0.02458281647413969,
"train/total_kl": 0.0645177292637527
},
{
"epoch": 3.173390880090073,
"grad_norm": 3.078125,
"learning_rate": 6.1824324324324326e-06,
"loss": 0.5102,
"mean_token_accuracy": 0.9511289745569229,
"step": 4230,
"train/kl_loss_qwen": 0.03975429474376142,
"train/kl_loss_r1": 0.02539440095424652,
"train/total_kl": 0.06514869593083858
},
{
"epoch": 3.177143929442672,
"grad_norm": 1.671875,
"learning_rate": 6.15427927927928e-06,
"loss": 0.5408,
"mean_token_accuracy": 0.9547346591949463,
"step": 4235,
"train/kl_loss_qwen": 0.0481301327701658,
"train/kl_loss_r1": 0.0268444970715791,
"train/total_kl": 0.07497463030740618
},
{
"epoch": 3.1808969787952712,
"grad_norm": 1.6484375,
"learning_rate": 6.126126126126126e-06,
"loss": 0.5618,
"mean_token_accuracy": 0.9479600071907044,
"step": 4240,
"train/kl_loss_qwen": 0.0451738444622606,
"train/kl_loss_r1": 0.026249010814353824,
"train/total_kl": 0.07142285536974669
},
{
"epoch": 3.1846500281478702,
"grad_norm": 2.328125,
"learning_rate": 6.097972972972973e-06,
"loss": 0.4792,
"mean_token_accuracy": 0.9450971424579621,
"step": 4245,
"train/kl_loss_qwen": 0.03210086454637349,
"train/kl_loss_r1": 0.02111982530914247,
"train/total_kl": 0.05322068994864822
},
{
"epoch": 3.1884030775004693,
"grad_norm": 2.0,
"learning_rate": 6.06981981981982e-06,
"loss": 0.5035,
"mean_token_accuracy": 0.9456622421741485,
"step": 4250,
"train/kl_loss_qwen": 0.036170482821762565,
"train/kl_loss_r1": 0.022352162282913923,
"train/total_kl": 0.058522645849734545
},
{
"epoch": 3.1921561268530683,
"grad_norm": 4.15625,
"learning_rate": 6.041666666666667e-06,
"loss": 0.5449,
"mean_token_accuracy": 0.9458593904972077,
"step": 4255,
"train/kl_loss_qwen": 0.04212156161665916,
"train/kl_loss_r1": 0.025973267480731012,
"train/total_kl": 0.068094830121845
},
{
"epoch": 3.1959091762056673,
"grad_norm": 2.078125,
"learning_rate": 6.013513513513514e-06,
"loss": 0.4976,
"mean_token_accuracy": 0.9549412935972214,
"step": 4260,
"train/kl_loss_qwen": 0.041603248473256825,
"train/kl_loss_r1": 0.02461081640794873,
"train/total_kl": 0.06621406432241202
},
{
"epoch": 3.1996622255582663,
"grad_norm": 2.890625,
"learning_rate": 5.9853603603603605e-06,
"loss": 0.5055,
"mean_token_accuracy": 0.949541175365448,
"step": 4265,
"train/kl_loss_qwen": 0.040113079734146594,
"train/kl_loss_r1": 0.02302660490386188,
"train/total_kl": 0.06313968505710363
},
{
"epoch": 3.2034152749108653,
"grad_norm": 1.7265625,
"learning_rate": 5.957207207207208e-06,
"loss": 0.5503,
"mean_token_accuracy": 0.9499185711145401,
"step": 4270,
"train/kl_loss_qwen": 0.04532988341525197,
"train/kl_loss_r1": 0.026170040108263494,
"train/total_kl": 0.07149992333725094
},
{
"epoch": 3.207168324263464,
"grad_norm": 2.21875,
"learning_rate": 5.929054054054054e-06,
"loss": 0.4828,
"mean_token_accuracy": 0.9559267908334732,
"step": 4275,
"train/kl_loss_qwen": 0.03815796659328043,
"train/kl_loss_r1": 0.023687106277793645,
"train/total_kl": 0.06184507291764021
},
{
"epoch": 3.210921373616063,
"grad_norm": 2.15625,
"learning_rate": 5.900900900900902e-06,
"loss": 0.4564,
"mean_token_accuracy": 0.9539308249950409,
"step": 4280,
"train/kl_loss_qwen": 0.029147087782621383,
"train/kl_loss_r1": 0.020383994840085507,
"train/total_kl": 0.04953108299523592
},
{
"epoch": 3.214674422968662,
"grad_norm": 1.6171875,
"learning_rate": 5.872747747747748e-06,
"loss": 0.5077,
"mean_token_accuracy": 0.9499585449695587,
"step": 4285,
"train/kl_loss_qwen": 0.04101836262270808,
"train/kl_loss_r1": 0.023595213936641813,
"train/total_kl": 0.06461357641965151
},
{
"epoch": 3.218427472321261,
"grad_norm": 2.359375,
"learning_rate": 5.844594594594595e-06,
"loss": 0.5314,
"mean_token_accuracy": 0.9491012632846832,
"step": 4290,
"train/kl_loss_qwen": 0.04348352774977684,
"train/kl_loss_r1": 0.026489183958619832,
"train/total_kl": 0.06997271161526442
},
{
"epoch": 3.22218052167386,
"grad_norm": 2.0,
"learning_rate": 5.816441441441442e-06,
"loss": 0.4828,
"mean_token_accuracy": 0.9515987575054169,
"step": 4295,
"train/kl_loss_qwen": 0.038013959862291814,
"train/kl_loss_r1": 0.024154541036114096,
"train/total_kl": 0.06216850131750107
},
{
"epoch": 3.225933571026459,
"grad_norm": 1.9453125,
"learning_rate": 5.7882882882882885e-06,
"loss": 0.4856,
"mean_token_accuracy": 0.951391515135765,
"step": 4300,
"train/kl_loss_qwen": 0.03802924687042832,
"train/kl_loss_r1": 0.02343762177042663,
"train/total_kl": 0.06146686850115657
},
{
"epoch": 3.229686620379058,
"grad_norm": 1.6953125,
"learning_rate": 5.760135135135136e-06,
"loss": 0.4937,
"mean_token_accuracy": 0.9538519591093063,
"step": 4305,
"train/kl_loss_qwen": 0.03933619349263608,
"train/kl_loss_r1": 0.024646869115531444,
"train/total_kl": 0.06398306302726268
},
{
"epoch": 3.233439669731657,
"grad_norm": 2.0625,
"learning_rate": 5.731981981981982e-06,
"loss": 0.5126,
"mean_token_accuracy": 0.9565867841243744,
"step": 4310,
"train/kl_loss_qwen": 0.047122747730463745,
"train/kl_loss_r1": 0.02656792337074876,
"train/total_kl": 0.07369067054241896
},
{
"epoch": 3.237192719084256,
"grad_norm": 1.859375,
"learning_rate": 5.70382882882883e-06,
"loss": 0.5087,
"mean_token_accuracy": 0.9582189708948136,
"step": 4315,
"train/kl_loss_qwen": 0.04418886038474738,
"train/kl_loss_r1": 0.025840024650096893,
"train/total_kl": 0.07002888554707169
},
{
"epoch": 3.240945768436855,
"grad_norm": 2.453125,
"learning_rate": 5.675675675675676e-06,
"loss": 0.4666,
"mean_token_accuracy": 0.9552791446447373,
"step": 4320,
"train/kl_loss_qwen": 0.03426559055224061,
"train/kl_loss_r1": 0.022823481913655998,
"train/total_kl": 0.05708907237276435
},
{
"epoch": 3.244698817789454,
"grad_norm": 1.953125,
"learning_rate": 5.647522522522523e-06,
"loss": 0.517,
"mean_token_accuracy": 0.9423777401447296,
"step": 4325,
"train/kl_loss_qwen": 0.03696016678586602,
"train/kl_loss_r1": 0.023434765404090285,
"train/total_kl": 0.06039493260905147
},
{
"epoch": 3.248451867142053,
"grad_norm": 1.828125,
"learning_rate": 5.61936936936937e-06,
"loss": 0.4976,
"mean_token_accuracy": 0.9435189306735993,
"step": 4330,
"train/kl_loss_qwen": 0.03490878287702799,
"train/kl_loss_r1": 0.02145023737102747,
"train/total_kl": 0.05635902034118771
},
{
"epoch": 3.252204916494652,
"grad_norm": 2.15625,
"learning_rate": 5.5912162162162165e-06,
"loss": 0.6065,
"mean_token_accuracy": 0.9520415842533112,
"step": 4335,
"train/kl_loss_qwen": 0.057009863667190075,
"train/kl_loss_r1": 0.03349468014203012,
"train/total_kl": 0.09050454422831536
},
{
"epoch": 3.255957965847251,
"grad_norm": 1.515625,
"learning_rate": 5.563063063063064e-06,
"loss": 0.4853,
"mean_token_accuracy": 0.9562025338411331,
"step": 4340,
"train/kl_loss_qwen": 0.04025891097262502,
"train/kl_loss_r1": 0.023304715799167753,
"train/total_kl": 0.06356362700462341
},
{
"epoch": 3.25971101519985,
"grad_norm": 2.0,
"learning_rate": 5.53490990990991e-06,
"loss": 0.4639,
"mean_token_accuracy": 0.955470883846283,
"step": 4345,
"train/kl_loss_qwen": 0.0339654213283211,
"train/kl_loss_r1": 0.021475129947066306,
"train/total_kl": 0.05544055104255676
},
{
"epoch": 3.2634640645524486,
"grad_norm": 2.65625,
"learning_rate": 5.506756756756758e-06,
"loss": 0.4686,
"mean_token_accuracy": 0.9480804920196533,
"step": 4350,
"train/kl_loss_qwen": 0.031937024602666494,
"train/kl_loss_r1": 0.020728342095389964,
"train/total_kl": 0.05266536641865969
},
{
"epoch": 3.2672171139050477,
"grad_norm": 1.671875,
"learning_rate": 5.478603603603604e-06,
"loss": 0.5332,
"mean_token_accuracy": 0.9519092202186584,
"step": 4355,
"train/kl_loss_qwen": 0.043146210024133325,
"train/kl_loss_r1": 0.027150555653497575,
"train/total_kl": 0.07029676483944058
},
{
"epoch": 3.2709701632576467,
"grad_norm": 1.96875,
"learning_rate": 5.450450450450451e-06,
"loss": 0.4917,
"mean_token_accuracy": 0.9604987561702728,
"step": 4360,
"train/kl_loss_qwen": 0.041492973314598204,
"train/kl_loss_r1": 0.02612789338454604,
"train/total_kl": 0.06762086730450392
},
{
"epoch": 3.2747232126102457,
"grad_norm": 1.75,
"learning_rate": 5.422297297297298e-06,
"loss": 0.5062,
"mean_token_accuracy": 0.9497289001941681,
"step": 4365,
"train/kl_loss_qwen": 0.038669126899912955,
"train/kl_loss_r1": 0.022001048410311343,
"train/total_kl": 0.06067017521709204
},
{
"epoch": 3.2784762619628447,
"grad_norm": 1.921875,
"learning_rate": 5.3941441441441445e-06,
"loss": 0.5098,
"mean_token_accuracy": 0.946996933221817,
"step": 4370,
"train/kl_loss_qwen": 0.036139405751600864,
"train/kl_loss_r1": 0.024025491438806057,
"train/total_kl": 0.06016489639878273
},
{
"epoch": 3.2822293113154437,
"grad_norm": 2.96875,
"learning_rate": 5.365990990990991e-06,
"loss": 0.4791,
"mean_token_accuracy": 0.9525912255048752,
"step": 4375,
"train/kl_loss_qwen": 0.03400084599852562,
"train/kl_loss_r1": 0.02241660561412573,
"train/total_kl": 0.056417451426386836
},
{
"epoch": 3.2859823606680427,
"grad_norm": 1.734375,
"learning_rate": 5.3378378378378374e-06,
"loss": 0.5387,
"mean_token_accuracy": 0.9525120824575424,
"step": 4380,
"train/kl_loss_qwen": 0.04745977125130594,
"train/kl_loss_r1": 0.02659780075773597,
"train/total_kl": 0.07405757205560803
},
{
"epoch": 3.2897354100206417,
"grad_norm": 1.5390625,
"learning_rate": 5.309684684684685e-06,
"loss": 0.4835,
"mean_token_accuracy": 0.9562853127717972,
"step": 4385,
"train/kl_loss_qwen": 0.040935520501807335,
"train/kl_loss_r1": 0.023382049147039653,
"train/total_kl": 0.06431756988167762
},
{
"epoch": 3.2934884593732408,
"grad_norm": 2.046875,
"learning_rate": 5.281531531531531e-06,
"loss": 0.516,
"mean_token_accuracy": 0.9541277021169663,
"step": 4390,
"train/kl_loss_qwen": 0.04403358194977045,
"train/kl_loss_r1": 0.027043864829465747,
"train/total_kl": 0.0710774464532733
},
{
"epoch": 3.2972415087258398,
"grad_norm": 1.75,
"learning_rate": 5.253378378378378e-06,
"loss": 0.5169,
"mean_token_accuracy": 0.9496819704771042,
"step": 4395,
"train/kl_loss_qwen": 0.04312458084896207,
"train/kl_loss_r1": 0.025393119966611265,
"train/total_kl": 0.0685177012346685
},
{
"epoch": 3.300994558078439,
"grad_norm": 2.359375,
"learning_rate": 5.225225225225225e-06,
"loss": 0.5119,
"mean_token_accuracy": 0.9501294255256653,
"step": 4400,
"train/kl_loss_qwen": 0.03754086145199835,
"train/kl_loss_r1": 0.024014173122122884,
"train/total_kl": 0.06155503448098898
},
{
"epoch": 3.304747607431038,
"grad_norm": 1.9609375,
"learning_rate": 5.197072072072072e-06,
"loss": 0.5073,
"mean_token_accuracy": 0.9500888794660568,
"step": 4405,
"train/kl_loss_qwen": 0.03989710342139006,
"train/kl_loss_r1": 0.024184916401281953,
"train/total_kl": 0.06408202080056072
},
{
"epoch": 3.308500656783637,
"grad_norm": 2.96875,
"learning_rate": 5.168918918918919e-06,
"loss": 0.5735,
"mean_token_accuracy": 0.9382760256528855,
"step": 4410,
"train/kl_loss_qwen": 0.044976729340851306,
"train/kl_loss_r1": 0.027697026263922453,
"train/total_kl": 0.07267375560477377
},
{
"epoch": 3.312253706136236,
"grad_norm": 2.65625,
"learning_rate": 5.140765765765765e-06,
"loss": 0.5057,
"mean_token_accuracy": 0.9447282940149307,
"step": 4415,
"train/kl_loss_qwen": 0.03504931908100843,
"train/kl_loss_r1": 0.0225065934471786,
"train/total_kl": 0.057555912714451554
},
{
"epoch": 3.316006755488835,
"grad_norm": 2.28125,
"learning_rate": 5.112612612612613e-06,
"loss": 0.5074,
"mean_token_accuracy": 0.9480471581220626,
"step": 4420,
"train/kl_loss_qwen": 0.038661521812900904,
"train/kl_loss_r1": 0.023841103445738553,
"train/total_kl": 0.06250262567773461
},
{
"epoch": 3.319759804841434,
"grad_norm": 2.875,
"learning_rate": 5.084459459459459e-06,
"loss": 0.5006,
"mean_token_accuracy": 0.9469463229179382,
"step": 4425,
"train/kl_loss_qwen": 0.034021322568878534,
"train/kl_loss_r1": 0.02232333249412477,
"train/total_kl": 0.05634465422481298
},
{
"epoch": 3.323512854194033,
"grad_norm": 1.8203125,
"learning_rate": 5.056306306306306e-06,
"loss": 0.5001,
"mean_token_accuracy": 0.9527624189853668,
"step": 4430,
"train/kl_loss_qwen": 0.041707838978618385,
"train/kl_loss_r1": 0.02471332629211247,
"train/total_kl": 0.06642116559669375
},
{
"epoch": 3.327265903546632,
"grad_norm": 2.71875,
"learning_rate": 5.028153153153153e-06,
"loss": 0.4856,
"mean_token_accuracy": 0.9498600274324417,
"step": 4435,
"train/kl_loss_qwen": 0.03649712633341551,
"train/kl_loss_r1": 0.022463715448975564,
"train/total_kl": 0.058960842061787845
},
{
"epoch": 3.3310189528992304,
"grad_norm": 1.46875,
"learning_rate": 4.9999999999999996e-06,
"loss": 0.5544,
"mean_token_accuracy": 0.9496265351772308,
"step": 4440,
"train/kl_loss_qwen": 0.04972629891708493,
"train/kl_loss_r1": 0.028210808150470258,
"train/total_kl": 0.07793710688129067
},
{
"epoch": 3.3347720022518295,
"grad_norm": 1.6015625,
"learning_rate": 4.971846846846847e-06,
"loss": 0.4717,
"mean_token_accuracy": 0.9556352138519287,
"step": 4445,
"train/kl_loss_qwen": 0.03368289568461478,
"train/kl_loss_r1": 0.02205599411390722,
"train/total_kl": 0.055738890264183286
},
{
"epoch": 3.3385250516044285,
"grad_norm": 2.125,
"learning_rate": 4.943693693693693e-06,
"loss": 0.5087,
"mean_token_accuracy": 0.9517245024442673,
"step": 4450,
"train/kl_loss_qwen": 0.03941992614418268,
"train/kl_loss_r1": 0.024540536990389227,
"train/total_kl": 0.06396046299487353
},
{
"epoch": 3.3422781009570275,
"grad_norm": 1.6953125,
"learning_rate": 4.915540540540541e-06,
"loss": 0.5082,
"mean_token_accuracy": 0.9545890867710114,
"step": 4455,
"train/kl_loss_qwen": 0.04155694702640176,
"train/kl_loss_r1": 0.024792100116610528,
"train/total_kl": 0.06634904704988002
},
{
"epoch": 3.3460311503096265,
"grad_norm": 1.875,
"learning_rate": 4.887387387387387e-06,
"loss": 0.5041,
"mean_token_accuracy": 0.9501286745071411,
"step": 4460,
"train/kl_loss_qwen": 0.03695795922540128,
"train/kl_loss_r1": 0.024665044527500866,
"train/total_kl": 0.06162300417199731
},
{
"epoch": 3.3497841996622255,
"grad_norm": 1.828125,
"learning_rate": 4.859234234234234e-06,
"loss": 0.476,
"mean_token_accuracy": 0.9575912714004516,
"step": 4465,
"train/kl_loss_qwen": 0.038898851396515964,
"train/kl_loss_r1": 0.02317404472269118,
"train/total_kl": 0.062072896771132945
},
{
"epoch": 3.3535372490148245,
"grad_norm": 2.515625,
"learning_rate": 4.831081081081081e-06,
"loss": 0.53,
"mean_token_accuracy": 0.9492391794919968,
"step": 4470,
"train/kl_loss_qwen": 0.04130629752762616,
"train/kl_loss_r1": 0.026160174002870917,
"train/total_kl": 0.06746647097170352
},
{
"epoch": 3.3572902983674235,
"grad_norm": 1.9140625,
"learning_rate": 4.8029279279279275e-06,
"loss": 0.5003,
"mean_token_accuracy": 0.9499774962663651,
"step": 4475,
"train/kl_loss_qwen": 0.042116965632885695,
"train/kl_loss_r1": 0.023339213198050858,
"train/total_kl": 0.06545617831870913
},
{
"epoch": 3.3610433477200226,
"grad_norm": 2.53125,
"learning_rate": 4.774774774774775e-06,
"loss": 0.4913,
"mean_token_accuracy": 0.9487686693668366,
"step": 4480,
"train/kl_loss_qwen": 0.03564274497330189,
"train/kl_loss_r1": 0.02291566417552531,
"train/total_kl": 0.058558409195393325
},
{
"epoch": 3.3647963970726216,
"grad_norm": 2.296875,
"learning_rate": 4.746621621621621e-06,
"loss": 0.4881,
"mean_token_accuracy": 0.9511472195386886,
"step": 4485,
"train/kl_loss_qwen": 0.03707243660464883,
"train/kl_loss_r1": 0.02255106377415359,
"train/total_kl": 0.05962350023910403
},
{
"epoch": 3.3685494464252206,
"grad_norm": 2.109375,
"learning_rate": 4.718468468468469e-06,
"loss": 0.5247,
"mean_token_accuracy": 0.9543746292591095,
"step": 4490,
"train/kl_loss_qwen": 0.043492857413366434,
"train/kl_loss_r1": 0.027063050866127016,
"train/total_kl": 0.07055590879172087
},
{
"epoch": 3.3723024957778196,
"grad_norm": 2.921875,
"learning_rate": 4.690315315315315e-06,
"loss": 0.4685,
"mean_token_accuracy": 0.9536369174718857,
"step": 4495,
"train/kl_loss_qwen": 0.0325671270955354,
"train/kl_loss_r1": 0.020675616106018424,
"train/total_kl": 0.05324274385347962
},
{
"epoch": 3.3760555451304186,
"grad_norm": 1.625,
"learning_rate": 4.6621621621621625e-06,
"loss": 0.5122,
"mean_token_accuracy": 0.9575406193733216,
"step": 4500,
"train/kl_loss_qwen": 0.04434308242052794,
"train/kl_loss_r1": 0.025985902547836302,
"train/total_kl": 0.07032898515462875
},
{
"epoch": 3.3798085944830176,
"grad_norm": 1.78125,
"learning_rate": 4.634009009009009e-06,
"loss": 0.4894,
"mean_token_accuracy": 0.9510607182979584,
"step": 4505,
"train/kl_loss_qwen": 0.03664002763107419,
"train/kl_loss_r1": 0.02325889216735959,
"train/total_kl": 0.05989891951903701
},
{
"epoch": 3.383561643835616,
"grad_norm": 2.140625,
"learning_rate": 4.6058558558558555e-06,
"loss": 0.518,
"mean_token_accuracy": 0.9529828011989594,
"step": 4510,
"train/kl_loss_qwen": 0.039163641864433885,
"train/kl_loss_r1": 0.025084894429892302,
"train/total_kl": 0.06424853699281811
},
{
"epoch": 3.387314693188215,
"grad_norm": 1.640625,
"learning_rate": 4.577702702702703e-06,
"loss": 0.5106,
"mean_token_accuracy": 0.9479302018880844,
"step": 4515,
"train/kl_loss_qwen": 0.03873064480721951,
"train/kl_loss_r1": 0.023981414455920457,
"train/total_kl": 0.06271205889061093
},
{
"epoch": 3.3910677425408142,
"grad_norm": 2.0625,
"learning_rate": 4.549549549549549e-06,
"loss": 0.5524,
"mean_token_accuracy": 0.9479347318410873,
"step": 4520,
"train/kl_loss_qwen": 0.047627780586481094,
"train/kl_loss_r1": 0.02741450662724674,
"train/total_kl": 0.07504228772595525
},
{
"epoch": 3.3948207918934132,
"grad_norm": 2.640625,
"learning_rate": 4.521396396396397e-06,
"loss": 0.5065,
"mean_token_accuracy": 0.9493608593940734,
"step": 4525,
"train/kl_loss_qwen": 0.0406539726536721,
"train/kl_loss_r1": 0.024122460465878248,
"train/total_kl": 0.06477643344551325
},
{
"epoch": 3.3985738412460123,
"grad_norm": 2.34375,
"learning_rate": 4.493243243243243e-06,
"loss": 0.4712,
"mean_token_accuracy": 0.948474669456482,
"step": 4530,
"train/kl_loss_qwen": 0.030185632361099123,
"train/kl_loss_r1": 0.020759632252156733,
"train/total_kl": 0.0509452648460865
},
{
"epoch": 3.4023268905986113,
"grad_norm": 3.03125,
"learning_rate": 4.4650900900900905e-06,
"loss": 0.4943,
"mean_token_accuracy": 0.9527560323476791,
"step": 4535,
"train/kl_loss_qwen": 0.03848574049770832,
"train/kl_loss_r1": 0.021982099581509828,
"train/total_kl": 0.06046783970668912
},
{
"epoch": 3.4060799399512103,
"grad_norm": 2.859375,
"learning_rate": 4.436936936936937e-06,
"loss": 0.5407,
"mean_token_accuracy": 0.9428445607423782,
"step": 4540,
"train/kl_loss_qwen": 0.04301722776144743,
"train/kl_loss_r1": 0.025781831610947846,
"train/total_kl": 0.06879905974492431
},
{
"epoch": 3.4098329893038093,
"grad_norm": 2.90625,
"learning_rate": 4.4087837837837835e-06,
"loss": 0.474,
"mean_token_accuracy": 0.950044310092926,
"step": 4545,
"train/kl_loss_qwen": 0.034028490027412775,
"train/kl_loss_r1": 0.021919101616367696,
"train/total_kl": 0.055947590805590156
},
{
"epoch": 3.4135860386564083,
"grad_norm": 1.7890625,
"learning_rate": 4.380630630630631e-06,
"loss": 0.4901,
"mean_token_accuracy": 0.9547917276620865,
"step": 4550,
"train/kl_loss_qwen": 0.03873153259046376,
"train/kl_loss_r1": 0.02365042078308761,
"train/total_kl": 0.062381953466683626
},
{
"epoch": 3.4173390880090073,
"grad_norm": 1.71875,
"learning_rate": 4.352477477477477e-06,
"loss": 0.5486,
"mean_token_accuracy": 0.9475720256567002,
"step": 4555,
"train/kl_loss_qwen": 0.045938981743529436,
"train/kl_loss_r1": 0.02708872049115598,
"train/total_kl": 0.07302770223468542
},
{
"epoch": 3.4210921373616063,
"grad_norm": 2.671875,
"learning_rate": 4.324324324324325e-06,
"loss": 0.4658,
"mean_token_accuracy": 0.9467237561941146,
"step": 4560,
"train/kl_loss_qwen": 0.03142950688488781,
"train/kl_loss_r1": 0.020448410185053945,
"train/total_kl": 0.05187791669741273
},
{
"epoch": 3.4248451867142053,
"grad_norm": 1.6875,
"learning_rate": 4.296171171171171e-06,
"loss": 0.4579,
"mean_token_accuracy": 0.9478941440582276,
"step": 4565,
"train/kl_loss_qwen": 0.028696865122765303,
"train/kl_loss_r1": 0.019314822740852833,
"train/total_kl": 0.04801168767735362
},
{
"epoch": 3.4285982360668044,
"grad_norm": 1.78125,
"learning_rate": 4.2680180180180185e-06,
"loss": 0.4945,
"mean_token_accuracy": 0.9537198185920716,
"step": 4570,
"train/kl_loss_qwen": 0.03776753200218082,
"train/kl_loss_r1": 0.02526979329995811,
"train/total_kl": 0.0630373259074986
},
{
"epoch": 3.4323512854194034,
"grad_norm": 1.875,
"learning_rate": 4.239864864864865e-06,
"loss": 0.549,
"mean_token_accuracy": 0.9553028732538223,
"step": 4575,
"train/kl_loss_qwen": 0.04971991777420044,
"train/kl_loss_r1": 0.028436136478558183,
"train/total_kl": 0.0781560542061925
},
{
"epoch": 3.4361043347720024,
"grad_norm": 1.625,
"learning_rate": 4.2117117117117115e-06,
"loss": 0.5464,
"mean_token_accuracy": 0.951890167593956,
"step": 4580,
"train/kl_loss_qwen": 0.049332274869084355,
"train/kl_loss_r1": 0.02864066422916949,
"train/total_kl": 0.07797293970361352
},
{
"epoch": 3.4398573841246014,
"grad_norm": 2.03125,
"learning_rate": 4.183558558558559e-06,
"loss": 0.5501,
"mean_token_accuracy": 0.9465802252292633,
"step": 4585,
"train/kl_loss_qwen": 0.044763072533532976,
"train/kl_loss_r1": 0.02734934687614441,
"train/total_kl": 0.0721124186180532
},
{
"epoch": 3.4436104334772004,
"grad_norm": 1.65625,
"learning_rate": 4.155405405405405e-06,
"loss": 0.488,
"mean_token_accuracy": 0.9554612100124359,
"step": 4590,
"train/kl_loss_qwen": 0.04139808346517384,
"train/kl_loss_r1": 0.024592308327555656,
"train/total_kl": 0.06599039165303111
},
{
"epoch": 3.4473634828297994,
"grad_norm": 2.34375,
"learning_rate": 4.127252252252253e-06,
"loss": 0.5267,
"mean_token_accuracy": 0.9453837454319001,
"step": 4595,
"train/kl_loss_qwen": 0.039892626367509364,
"train/kl_loss_r1": 0.024147269502282142,
"train/total_kl": 0.0640398958697915
},
{
"epoch": 3.4511165321823984,
"grad_norm": 1.9609375,
"learning_rate": 4.099099099099099e-06,
"loss": 0.4839,
"mean_token_accuracy": 0.9594921231269836,
"step": 4600,
"train/kl_loss_qwen": 0.03939856206998229,
"train/kl_loss_r1": 0.02459759754128754,
"train/total_kl": 0.06399615965783596
},
{
"epoch": 3.454869581534997,
"grad_norm": 1.953125,
"learning_rate": 4.0709459459459465e-06,
"loss": 0.5362,
"mean_token_accuracy": 0.9532510668039322,
"step": 4605,
"train/kl_loss_qwen": 0.04666020777076483,
"train/kl_loss_r1": 0.026927021471783517,
"train/total_kl": 0.07358722947537899
},
{
"epoch": 3.458622630887596,
"grad_norm": 2.28125,
"learning_rate": 4.042792792792793e-06,
"loss": 0.4866,
"mean_token_accuracy": 0.953156578540802,
"step": 4610,
"train/kl_loss_qwen": 0.03761745826341212,
"train/kl_loss_r1": 0.022605449566617607,
"train/total_kl": 0.060222907457500696
},
{
"epoch": 3.462375680240195,
"grad_norm": 1.953125,
"learning_rate": 4.0146396396396394e-06,
"loss": 0.5006,
"mean_token_accuracy": 0.953925734758377,
"step": 4615,
"train/kl_loss_qwen": 0.03867802955210209,
"train/kl_loss_r1": 0.024804549338296056,
"train/total_kl": 0.06348257856443525
},
{
"epoch": 3.466128729592794,
"grad_norm": 1.8984375,
"learning_rate": 3.986486486486487e-06,
"loss": 0.5623,
"mean_token_accuracy": 0.9530359268188476,
"step": 4620,
"train/kl_loss_qwen": 0.050726366927847266,
"train/kl_loss_r1": 0.027859060373157263,
"train/total_kl": 0.0785854272544384
},
{
"epoch": 3.469881778945393,
"grad_norm": 1.8203125,
"learning_rate": 3.958333333333333e-06,
"loss": 0.4911,
"mean_token_accuracy": 0.9550992786884308,
"step": 4625,
"train/kl_loss_qwen": 0.03829608168452978,
"train/kl_loss_r1": 0.02386563769541681,
"train/total_kl": 0.06216171951964498
},
{
"epoch": 3.473634828297992,
"grad_norm": 1.78125,
"learning_rate": 3.930180180180181e-06,
"loss": 0.4924,
"mean_token_accuracy": 0.9495264708995819,
"step": 4630,
"train/kl_loss_qwen": 0.03702715411782265,
"train/kl_loss_r1": 0.022891523968428373,
"train/total_kl": 0.05991867855191231
},
{
"epoch": 3.477387877650591,
"grad_norm": 2.421875,
"learning_rate": 3.902027027027027e-06,
"loss": 0.5782,
"mean_token_accuracy": 0.949220260977745,
"step": 4635,
"train/kl_loss_qwen": 0.053430474689230324,
"train/kl_loss_r1": 0.03059484055265784,
"train/total_kl": 0.084025314822793
},
{
"epoch": 3.48114092700319,
"grad_norm": 2.875,
"learning_rate": 3.8738738738738744e-06,
"loss": 0.5004,
"mean_token_accuracy": 0.949424222111702,
"step": 4640,
"train/kl_loss_qwen": 0.03316820659674704,
"train/kl_loss_r1": 0.02219580514356494,
"train/total_kl": 0.05536401178687811
},
{
"epoch": 3.484893976355789,
"grad_norm": 1.7578125,
"learning_rate": 3.845720720720721e-06,
"loss": 0.4793,
"mean_token_accuracy": 0.9511813431978225,
"step": 4645,
"train/kl_loss_qwen": 0.03428934076800942,
"train/kl_loss_r1": 0.022562990756705405,
"train/total_kl": 0.05685233175754547
},
{
"epoch": 3.488647025708388,
"grad_norm": 1.8515625,
"learning_rate": 3.817567567567567e-06,
"loss": 0.5208,
"mean_token_accuracy": 0.9530722856521606,
"step": 4650,
"train/kl_loss_qwen": 0.04267180510796607,
"train/kl_loss_r1": 0.025806902069598438,
"train/total_kl": 0.06847870666533709
},
{
"epoch": 3.492400075060987,
"grad_norm": 2.03125,
"learning_rate": 3.7894144144144148e-06,
"loss": 0.5136,
"mean_token_accuracy": 0.9550452619791031,
"step": 4655,
"train/kl_loss_qwen": 0.041353469667956236,
"train/kl_loss_r1": 0.025874977000057697,
"train/total_kl": 0.06722844615578652
},
{
"epoch": 3.496153124413586,
"grad_norm": 1.5,
"learning_rate": 3.7612612612612617e-06,
"loss": 0.5144,
"mean_token_accuracy": 0.9574123293161392,
"step": 4660,
"train/kl_loss_qwen": 0.04588752212002874,
"train/kl_loss_r1": 0.026548220915719865,
"train/total_kl": 0.07243574410676956
},
{
"epoch": 3.499906173766185,
"grad_norm": 1.546875,
"learning_rate": 3.7331081081081086e-06,
"loss": 0.4752,
"mean_token_accuracy": 0.9535851895809173,
"step": 4665,
"train/kl_loss_qwen": 0.03505368349142372,
"train/kl_loss_r1": 0.02288009631447494,
"train/total_kl": 0.05793378055095673
},
{
"epoch": 3.5036592231187837,
"grad_norm": 2.234375,
"learning_rate": 3.704954954954955e-06,
"loss": 0.517,
"mean_token_accuracy": 0.953430250287056,
"step": 4670,
"train/kl_loss_qwen": 0.041387461498379706,
"train/kl_loss_r1": 0.02559947860427201,
"train/total_kl": 0.06698694005608559
},
{
"epoch": 3.5074122724713828,
"grad_norm": 2.046875,
"learning_rate": 3.676801801801802e-06,
"loss": 0.5192,
"mean_token_accuracy": 0.949590927362442,
"step": 4675,
"train/kl_loss_qwen": 0.038729687314480545,
"train/kl_loss_r1": 0.023347532469779254,
"train/total_kl": 0.06207721931859851
},
{
"epoch": 3.5111653218239818,
"grad_norm": 1.6953125,
"learning_rate": 3.648648648648649e-06,
"loss": 0.5063,
"mean_token_accuracy": 0.952187979221344,
"step": 4680,
"train/kl_loss_qwen": 0.04059083824977279,
"train/kl_loss_r1": 0.025933190854266285,
"train/total_kl": 0.06652402915060521
},
{
"epoch": 3.514918371176581,
"grad_norm": 2.484375,
"learning_rate": 3.6204954954954954e-06,
"loss": 0.5103,
"mean_token_accuracy": 0.9529137343168259,
"step": 4685,
"train/kl_loss_qwen": 0.04197904523462057,
"train/kl_loss_r1": 0.022938547283411027,
"train/total_kl": 0.06491759326308966
},
{
"epoch": 3.51867142052918,
"grad_norm": 1.640625,
"learning_rate": 3.5923423423423423e-06,
"loss": 0.4821,
"mean_token_accuracy": 0.9563487559556961,
"step": 4690,
"train/kl_loss_qwen": 0.03939807149581611,
"train/kl_loss_r1": 0.023985384777188302,
"train/total_kl": 0.0633834559470415
},
{
"epoch": 3.522424469881779,
"grad_norm": 1.6640625,
"learning_rate": 3.5641891891891892e-06,
"loss": 0.5201,
"mean_token_accuracy": 0.9567440986633301,
"step": 4695,
"train/kl_loss_qwen": 0.046253665490075944,
"train/kl_loss_r1": 0.027819053875282405,
"train/total_kl": 0.07407271871343254
},
{
"epoch": 3.526177519234378,
"grad_norm": 2.3125,
"learning_rate": 3.536036036036036e-06,
"loss": 0.4794,
"mean_token_accuracy": 0.9591157138347626,
"step": 4700,
"train/kl_loss_qwen": 0.03859961242415011,
"train/kl_loss_r1": 0.024089030642062425,
"train/total_kl": 0.06268864339217543
},
{
"epoch": 3.529930568586977,
"grad_norm": 1.390625,
"learning_rate": 3.5078828828828826e-06,
"loss": 0.5076,
"mean_token_accuracy": 0.9511758238077164,
"step": 4705,
"train/kl_loss_qwen": 0.041626590909436344,
"train/kl_loss_r1": 0.02450266946107149,
"train/total_kl": 0.0661292603239417
},
{
"epoch": 3.533683617939576,
"grad_norm": 2.171875,
"learning_rate": 3.4797297297297295e-06,
"loss": 0.5238,
"mean_token_accuracy": 0.9531386703252792,
"step": 4710,
"train/kl_loss_qwen": 0.04286709842272103,
"train/kl_loss_r1": 0.025938824750483036,
"train/total_kl": 0.06880592331290245
},
{
"epoch": 3.537436667292175,
"grad_norm": 1.7578125,
"learning_rate": 3.4515765765765765e-06,
"loss": 0.5117,
"mean_token_accuracy": 0.9504441648721695,
"step": 4715,
"train/kl_loss_qwen": 0.04200872196815908,
"train/kl_loss_r1": 0.02514236718416214,
"train/total_kl": 0.06715108891949058
},
{
"epoch": 3.541189716644774,
"grad_norm": 2.078125,
"learning_rate": 3.4234234234234234e-06,
"loss": 0.4857,
"mean_token_accuracy": 0.9459042757749557,
"step": 4720,
"train/kl_loss_qwen": 0.034541129739955066,
"train/kl_loss_r1": 0.02232414875179529,
"train/total_kl": 0.05686527844518423
},
{
"epoch": 3.544942765997373,
"grad_norm": 1.484375,
"learning_rate": 3.3952702702702703e-06,
"loss": 0.4954,
"mean_token_accuracy": 0.9543802291154861,
"step": 4725,
"train/kl_loss_qwen": 0.039401004835963246,
"train/kl_loss_r1": 0.023825197480618954,
"train/total_kl": 0.06322620203718543
},
{
"epoch": 3.548695815349972,
"grad_norm": 1.8828125,
"learning_rate": 3.367117117117117e-06,
"loss": 0.4976,
"mean_token_accuracy": 0.9500404924154282,
"step": 4730,
"train/kl_loss_qwen": 0.03725369730964303,
"train/kl_loss_r1": 0.022954756021499635,
"train/total_kl": 0.060208453238010405
},
{
"epoch": 3.552448864702571,
"grad_norm": 2.03125,
"learning_rate": 3.338963963963964e-06,
"loss": 0.5316,
"mean_token_accuracy": 0.9575497686862946,
"step": 4735,
"train/kl_loss_qwen": 0.0468436376657337,
"train/kl_loss_r1": 0.02789052496664226,
"train/total_kl": 0.07473416347056627
},
{
"epoch": 3.55620191405517,
"grad_norm": 1.578125,
"learning_rate": 3.3108108108108106e-06,
"loss": 0.484,
"mean_token_accuracy": 0.9488806337118149,
"step": 4740,
"train/kl_loss_qwen": 0.032839803909882906,
"train/kl_loss_r1": 0.02122222976759076,
"train/total_kl": 0.05406203325837851
},
{
"epoch": 3.559954963407769,
"grad_norm": 1.6796875,
"learning_rate": 3.2826576576576575e-06,
"loss": 0.5449,
"mean_token_accuracy": 0.9525219231843949,
"step": 4745,
"train/kl_loss_qwen": 0.04897039164789021,
"train/kl_loss_r1": 0.02860354045405984,
"train/total_kl": 0.0775739318691194
},
{
"epoch": 3.563708012760368,
"grad_norm": 1.515625,
"learning_rate": 3.2545045045045044e-06,
"loss": 0.4792,
"mean_token_accuracy": 0.9464257270097732,
"step": 4750,
"train/kl_loss_qwen": 0.03381857522763312,
"train/kl_loss_r1": 0.0212648831307888,
"train/total_kl": 0.05508345831185579
},
{
"epoch": 3.567461062112967,
"grad_norm": 1.6640625,
"learning_rate": 3.2263513513513513e-06,
"loss": 0.5117,
"mean_token_accuracy": 0.9530625611543655,
"step": 4755,
"train/kl_loss_qwen": 0.045256762346252796,
"train/kl_loss_r1": 0.025322494190186264,
"train/total_kl": 0.07057925527915358
},
{
"epoch": 3.571214111465566,
"grad_norm": 1.9453125,
"learning_rate": 3.1981981981981983e-06,
"loss": 0.5067,
"mean_token_accuracy": 0.949809405207634,
"step": 4760,
"train/kl_loss_qwen": 0.03583875373005867,
"train/kl_loss_r1": 0.02265885784290731,
"train/total_kl": 0.058497611340135335
},
{
"epoch": 3.574967160818165,
"grad_norm": 1.4765625,
"learning_rate": 3.170045045045045e-06,
"loss": 0.4803,
"mean_token_accuracy": 0.9485155403614044,
"step": 4765,
"train/kl_loss_qwen": 0.03641654024831951,
"train/kl_loss_r1": 0.02261554468423128,
"train/total_kl": 0.05903208442032337
},
{
"epoch": 3.5787202101707636,
"grad_norm": 2.296875,
"learning_rate": 3.141891891891892e-06,
"loss": 0.4805,
"mean_token_accuracy": 0.9531418412923813,
"step": 4770,
"train/kl_loss_qwen": 0.03572290446609259,
"train/kl_loss_r1": 0.02349159154109657,
"train/total_kl": 0.059214495960623025
},
{
"epoch": 3.5824732595233626,
"grad_norm": 1.9921875,
"learning_rate": 3.113738738738739e-06,
"loss": 0.4947,
"mean_token_accuracy": 0.9497868716716766,
"step": 4775,
"train/kl_loss_qwen": 0.03734279680065811,
"train/kl_loss_r1": 0.023538395250216126,
"train/total_kl": 0.06088119251653552
},
{
"epoch": 3.5862263088759616,
"grad_norm": 2.0,
"learning_rate": 3.0855855855855855e-06,
"loss": 0.4699,
"mean_token_accuracy": 0.948901292681694,
"step": 4780,
"train/kl_loss_qwen": 0.030417955154553054,
"train/kl_loss_r1": 0.02020354806445539,
"train/total_kl": 0.05062150321900845
},
{
"epoch": 3.5899793582285606,
"grad_norm": 1.71875,
"learning_rate": 3.0574324324324324e-06,
"loss": 0.4978,
"mean_token_accuracy": 0.9499588519334793,
"step": 4785,
"train/kl_loss_qwen": 0.038579528825357555,
"train/kl_loss_r1": 0.02370496103540063,
"train/total_kl": 0.06228449046611786
},
{
"epoch": 3.5937324075811596,
"grad_norm": 1.7578125,
"learning_rate": 3.0292792792792793e-06,
"loss": 0.4563,
"mean_token_accuracy": 0.9571527928113938,
"step": 4790,
"train/kl_loss_qwen": 0.0355854959692806,
"train/kl_loss_r1": 0.02241732254624367,
"train/total_kl": 0.05800281846895814
},
{
"epoch": 3.5974854569337587,
"grad_norm": 1.7734375,
"learning_rate": 3.0011261261261262e-06,
"loss": 0.5416,
"mean_token_accuracy": 0.9569284915924072,
"step": 4795,
"train/kl_loss_qwen": 0.04847305933944881,
"train/kl_loss_r1": 0.02857246994972229,
"train/total_kl": 0.07704552887007594
},
{
"epoch": 3.6012385062863577,
"grad_norm": 2.453125,
"learning_rate": 2.972972972972973e-06,
"loss": 0.459,
"mean_token_accuracy": 0.9568021237850189,
"step": 4800,
"train/kl_loss_qwen": 0.03281675688922405,
"train/kl_loss_r1": 0.021974925044924022,
"train/total_kl": 0.05479168212041259
},
{
"epoch": 3.6049915556389567,
"grad_norm": 1.4921875,
"learning_rate": 2.94481981981982e-06,
"loss": 0.5005,
"mean_token_accuracy": 0.951943552494049,
"step": 4805,
"train/kl_loss_qwen": 0.037731643626466395,
"train/kl_loss_r1": 0.023648474551737308,
"train/total_kl": 0.06138011813163757
},
{
"epoch": 3.6087446049915557,
"grad_norm": 2.84375,
"learning_rate": 2.916666666666667e-06,
"loss": 0.5074,
"mean_token_accuracy": 0.9509950965642929,
"step": 4810,
"train/kl_loss_qwen": 0.040730614122003315,
"train/kl_loss_r1": 0.023938436387106778,
"train/total_kl": 0.0646690510213375
},
{
"epoch": 3.6124976543441547,
"grad_norm": 2.28125,
"learning_rate": 2.8885135135135135e-06,
"loss": 0.4647,
"mean_token_accuracy": 0.9506016135215759,
"step": 4815,
"train/kl_loss_qwen": 0.03288884097710252,
"train/kl_loss_r1": 0.020954125700518487,
"train/total_kl": 0.05384296691045165
},
{
"epoch": 3.6162507036967537,
"grad_norm": 2.1875,
"learning_rate": 2.8603603603603604e-06,
"loss": 0.5172,
"mean_token_accuracy": 0.9470595866441727,
"step": 4820,
"train/kl_loss_qwen": 0.0408139303792268,
"train/kl_loss_r1": 0.02478752490133047,
"train/total_kl": 0.0656014553271234
},
{
"epoch": 3.6200037530493527,
"grad_norm": 1.8046875,
"learning_rate": 2.8322072072072073e-06,
"loss": 0.5135,
"mean_token_accuracy": 0.9458914548158646,
"step": 4825,
"train/kl_loss_qwen": 0.04003286343067884,
"train/kl_loss_r1": 0.025449228845536707,
"train/total_kl": 0.06548209218308329
},
{
"epoch": 3.6237568024019517,
"grad_norm": 1.9296875,
"learning_rate": 2.804054054054054e-06,
"loss": 0.5003,
"mean_token_accuracy": 0.9475751221179962,
"step": 4830,
"train/kl_loss_qwen": 0.03712998940609395,
"train/kl_loss_r1": 0.02288465332239866,
"train/total_kl": 0.060014642868191005
},
{
"epoch": 3.6275098517545503,
"grad_norm": 1.4453125,
"learning_rate": 2.775900900900901e-06,
"loss": 0.4804,
"mean_token_accuracy": 0.9547668904066086,
"step": 4835,
"train/kl_loss_qwen": 0.03851720592938364,
"train/kl_loss_r1": 0.02409008927643299,
"train/total_kl": 0.06260729506611824
},
{
"epoch": 3.6312629011071493,
"grad_norm": 1.765625,
"learning_rate": 2.747747747747748e-06,
"loss": 0.531,
"mean_token_accuracy": 0.9479747354984284,
"step": 4840,
"train/kl_loss_qwen": 0.04336943430826068,
"train/kl_loss_r1": 0.025416742218658327,
"train/total_kl": 0.06878617675974966
},
{
"epoch": 3.6350159504597483,
"grad_norm": 1.953125,
"learning_rate": 2.719594594594595e-06,
"loss": 0.5183,
"mean_token_accuracy": 0.9536388278007507,
"step": 4845,
"train/kl_loss_qwen": 0.044287759624421594,
"train/kl_loss_r1": 0.02697393586859107,
"train/total_kl": 0.07126169558614492
},
{
"epoch": 3.6387689998123474,
"grad_norm": 1.75,
"learning_rate": 2.6914414414414414e-06,
"loss": 0.5166,
"mean_token_accuracy": 0.9522114217281341,
"step": 4850,
"train/kl_loss_qwen": 0.04483889057300985,
"train/kl_loss_r1": 0.02480946579016745,
"train/total_kl": 0.06964835664257407
},
{
"epoch": 3.6425220491649464,
"grad_norm": 1.7734375,
"learning_rate": 2.6632882882882884e-06,
"loss": 0.459,
"mean_token_accuracy": 0.946859622001648,
"step": 4855,
"train/kl_loss_qwen": 0.02793180327862501,
"train/kl_loss_r1": 0.019528497755527497,
"train/total_kl": 0.04746030112728476
},
{
"epoch": 3.6462750985175454,
"grad_norm": 2.546875,
"learning_rate": 2.6351351351351353e-06,
"loss": 0.4589,
"mean_token_accuracy": 0.9491229832172394,
"step": 4860,
"train/kl_loss_qwen": 0.03198705329559744,
"train/kl_loss_r1": 0.019053183542564512,
"train/total_kl": 0.051040236745029686
},
{
"epoch": 3.6500281478701444,
"grad_norm": 2.84375,
"learning_rate": 2.606981981981982e-06,
"loss": 0.4817,
"mean_token_accuracy": 0.9530567765235901,
"step": 4865,
"train/kl_loss_qwen": 0.039363396866247055,
"train/kl_loss_r1": 0.022094597294926643,
"train/total_kl": 0.061457994021475316
},
{
"epoch": 3.6537811972227434,
"grad_norm": 3.671875,
"learning_rate": 2.578828828828829e-06,
"loss": 0.5107,
"mean_token_accuracy": 0.9457842141389847,
"step": 4870,
"train/kl_loss_qwen": 0.035457003861665726,
"train/kl_loss_r1": 0.022503510117530823,
"train/total_kl": 0.057960514537990095
},
{
"epoch": 3.6575342465753424,
"grad_norm": 1.7890625,
"learning_rate": 2.550675675675676e-06,
"loss": 0.5303,
"mean_token_accuracy": 0.9455351591110229,
"step": 4875,
"train/kl_loss_qwen": 0.04614274119958282,
"train/kl_loss_r1": 0.024886056268587708,
"train/total_kl": 0.07102879770100116
},
{
"epoch": 3.6612872959279414,
"grad_norm": 2.8125,
"learning_rate": 2.522522522522523e-06,
"loss": 0.4676,
"mean_token_accuracy": 0.9499957472085953,
"step": 4880,
"train/kl_loss_qwen": 0.03133310084231198,
"train/kl_loss_r1": 0.020856086723506452,
"train/total_kl": 0.05218918789178133
},
{
"epoch": 3.6650403452805405,
"grad_norm": 2.640625,
"learning_rate": 2.4943693693693694e-06,
"loss": 0.4903,
"mean_token_accuracy": 0.9457110196352005,
"step": 4885,
"train/kl_loss_qwen": 0.03605662221089005,
"train/kl_loss_r1": 0.02250904431566596,
"train/total_kl": 0.058565666899085045
},
{
"epoch": 3.6687933946331395,
"grad_norm": 2.78125,
"learning_rate": 2.4662162162162163e-06,
"loss": 0.4846,
"mean_token_accuracy": 0.9485343366861343,
"step": 4890,
"train/kl_loss_qwen": 0.033767188480123875,
"train/kl_loss_r1": 0.022552880039438606,
"train/total_kl": 0.056320068147033456
},
{
"epoch": 3.6725464439857385,
"grad_norm": 1.9921875,
"learning_rate": 2.438063063063063e-06,
"loss": 0.4727,
"mean_token_accuracy": 0.94805046916008,
"step": 4895,
"train/kl_loss_qwen": 0.030423608887940646,
"train/kl_loss_r1": 0.020363574428483844,
"train/total_kl": 0.05078718457370997
},
{
"epoch": 3.6762994933383375,
"grad_norm": 1.84375,
"learning_rate": 2.4099099099099097e-06,
"loss": 0.499,
"mean_token_accuracy": 0.955724710226059,
"step": 4900,
"train/kl_loss_qwen": 0.043830083403736356,
"train/kl_loss_r1": 0.02355689317919314,
"train/total_kl": 0.06738697616383434
},
{
"epoch": 3.6800525426909365,
"grad_norm": 1.78125,
"learning_rate": 2.3817567567567567e-06,
"loss": 0.5121,
"mean_token_accuracy": 0.9542524129152298,
"step": 4905,
"train/kl_loss_qwen": 0.041697377478703855,
"train/kl_loss_r1": 0.025255709374323487,
"train/total_kl": 0.06695308703929186
},
{
"epoch": 3.6838055920435355,
"grad_norm": 1.828125,
"learning_rate": 2.3536036036036036e-06,
"loss": 0.5202,
"mean_token_accuracy": 0.9581304490566254,
"step": 4910,
"train/kl_loss_qwen": 0.04810468130744994,
"train/kl_loss_r1": 0.028955771028995513,
"train/total_kl": 0.07706045228987932
},
{
"epoch": 3.6875586413961345,
"grad_norm": 2.046875,
"learning_rate": 2.3254504504504505e-06,
"loss": 0.5639,
"mean_token_accuracy": 0.9510135352611542,
"step": 4915,
"train/kl_loss_qwen": 0.04566266257315874,
"train/kl_loss_r1": 0.0282847763504833,
"train/total_kl": 0.07394743924960494
},
{
"epoch": 3.6913116907487336,
"grad_norm": 1.75,
"learning_rate": 2.2972972972972974e-06,
"loss": 0.4899,
"mean_token_accuracy": 0.9510814368724823,
"step": 4920,
"train/kl_loss_qwen": 0.03731400719843805,
"train/kl_loss_r1": 0.022761214664205907,
"train/total_kl": 0.06007522279396653
},
{
"epoch": 3.6950647401013326,
"grad_norm": 2.59375,
"learning_rate": 2.269144144144144e-06,
"loss": 0.5005,
"mean_token_accuracy": 0.9558656960725784,
"step": 4925,
"train/kl_loss_qwen": 0.04062461815774441,
"train/kl_loss_r1": 0.02468117969110608,
"train/total_kl": 0.0653057973831892
},
{
"epoch": 3.6988177894539316,
"grad_norm": 2.0625,
"learning_rate": 2.240990990990991e-06,
"loss": 0.5914,
"mean_token_accuracy": 0.9519262284040451,
"step": 4930,
"train/kl_loss_qwen": 0.05449639055877924,
"train/kl_loss_r1": 0.030845365300774575,
"train/total_kl": 0.08534175446256995
},
{
"epoch": 3.70257083880653,
"grad_norm": 2.046875,
"learning_rate": 2.2128378378378377e-06,
"loss": 0.5489,
"mean_token_accuracy": 0.9491182923316955,
"step": 4935,
"train/kl_loss_qwen": 0.04436412039212882,
"train/kl_loss_r1": 0.02723758388310671,
"train/total_kl": 0.07160170413553715
},
{
"epoch": 3.706323888159129,
"grad_norm": 1.7578125,
"learning_rate": 2.1846846846846846e-06,
"loss": 0.5261,
"mean_token_accuracy": 0.9431472331285476,
"step": 4940,
"train/kl_loss_qwen": 0.04030956518836319,
"train/kl_loss_r1": 0.02509582005441189,
"train/total_kl": 0.0654053857550025
},
{
"epoch": 3.710076937511728,
"grad_norm": 2.625,
"learning_rate": 2.1565315315315315e-06,
"loss": 0.5934,
"mean_token_accuracy": 0.9567312359809875,
"step": 4945,
"train/kl_loss_qwen": 0.05713588017970324,
"train/kl_loss_r1": 0.03261457234621048,
"train/total_kl": 0.08975045187398792
},
{
"epoch": 3.713829986864327,
"grad_norm": 2.203125,
"learning_rate": 2.1283783783783785e-06,
"loss": 0.5451,
"mean_token_accuracy": 0.9484814405441284,
"step": 4950,
"train/kl_loss_qwen": 0.048199441749602556,
"train/kl_loss_r1": 0.027163840597495437,
"train/total_kl": 0.07536328211426735
},
{
"epoch": 3.717583036216926,
"grad_norm": 2.5625,
"learning_rate": 2.1002252252252254e-06,
"loss": 0.5935,
"mean_token_accuracy": 0.955457329750061,
"step": 4955,
"train/kl_loss_qwen": 0.05824917796999216,
"train/kl_loss_r1": 0.034108775574713944,
"train/total_kl": 0.09235795447602868
},
{
"epoch": 3.721336085569525,
"grad_norm": 2.40625,
"learning_rate": 2.072072072072072e-06,
"loss": 0.4623,
"mean_token_accuracy": 0.9505770593881607,
"step": 4960,
"train/kl_loss_qwen": 0.0321466120891273,
"train/kl_loss_r1": 0.021026749815791845,
"train/total_kl": 0.05317336162552237
},
{
"epoch": 3.7250891349221242,
"grad_norm": 2.296875,
"learning_rate": 2.0439189189189188e-06,
"loss": 0.5755,
"mean_token_accuracy": 0.9496716737747193,
"step": 4965,
"train/kl_loss_qwen": 0.04926731456071139,
"train/kl_loss_r1": 0.03159582577645779,
"train/total_kl": 0.08086314136162401
},
{
"epoch": 3.7288421842747232,
"grad_norm": 1.7890625,
"learning_rate": 2.0157657657657657e-06,
"loss": 0.4742,
"mean_token_accuracy": 0.9528581112623214,
"step": 4970,
"train/kl_loss_qwen": 0.035010923305526374,
"train/kl_loss_r1": 0.02297942517325282,
"train/total_kl": 0.05799034852534533
},
{
"epoch": 3.7325952336273223,
"grad_norm": 1.546875,
"learning_rate": 1.9876126126126126e-06,
"loss": 0.5497,
"mean_token_accuracy": 0.9514399915933609,
"step": 4975,
"train/kl_loss_qwen": 0.045947178127244116,
"train/kl_loss_r1": 0.0276748682372272,
"train/total_kl": 0.07362204669043422
},
{
"epoch": 3.7363482829799213,
"grad_norm": 1.4375,
"learning_rate": 1.9594594594594595e-06,
"loss": 0.5189,
"mean_token_accuracy": 0.9563332289457321,
"step": 4980,
"train/kl_loss_qwen": 0.0446835320442915,
"train/kl_loss_r1": 0.027359084272757173,
"train/total_kl": 0.07204261664301156
},
{
"epoch": 3.7401013323325203,
"grad_norm": 1.5859375,
"learning_rate": 1.9313063063063064e-06,
"loss": 0.4732,
"mean_token_accuracy": 0.9515779405832291,
"step": 4985,
"train/kl_loss_qwen": 0.0353350019082427,
"train/kl_loss_r1": 0.021265791589394213,
"train/total_kl": 0.05660079354420304
},
{
"epoch": 3.7438543816851193,
"grad_norm": 1.7265625,
"learning_rate": 1.9031531531531531e-06,
"loss": 0.5357,
"mean_token_accuracy": 0.9530490398406982,
"step": 4990,
"train/kl_loss_qwen": 0.047580851893872025,
"train/kl_loss_r1": 0.02787015661597252,
"train/total_kl": 0.07545100878924131
},
{
"epoch": 3.747607431037718,
"grad_norm": 1.5703125,
"learning_rate": 1.875e-06,
"loss": 0.5061,
"mean_token_accuracy": 0.9487150400876999,
"step": 4995,
"train/kl_loss_qwen": 0.03738487912341952,
"train/kl_loss_r1": 0.02395879211835563,
"train/total_kl": 0.061343671102076766
},
{
"epoch": 3.751360480390317,
"grad_norm": 2.921875,
"learning_rate": 1.846846846846847e-06,
"loss": 0.5004,
"mean_token_accuracy": 0.9516070336103439,
"step": 5000,
"train/kl_loss_qwen": 0.039164299005642535,
"train/kl_loss_r1": 0.024061837745830417,
"train/total_kl": 0.06322613721713424
},
{
"epoch": 3.755113529742916,
"grad_norm": 1.65625,
"learning_rate": 1.8186936936936937e-06,
"loss": 0.5749,
"mean_token_accuracy": 0.9515040576457977,
"step": 5005,
"train/kl_loss_qwen": 0.052400945825502275,
"train/kl_loss_r1": 0.028596563590690495,
"train/total_kl": 0.08099750988185406
},
{
"epoch": 3.758866579095515,
"grad_norm": 2.984375,
"learning_rate": 1.7905405405405406e-06,
"loss": 0.444,
"mean_token_accuracy": 0.9563502013683319,
"step": 5010,
"train/kl_loss_qwen": 0.030290895281359552,
"train/kl_loss_r1": 0.019006578624248503,
"train/total_kl": 0.04929747423157096
},
{
"epoch": 3.762619628448114,
"grad_norm": 1.6796875,
"learning_rate": 1.7623873873873875e-06,
"loss": 0.5397,
"mean_token_accuracy": 0.9545387536287308,
"step": 5015,
"train/kl_loss_qwen": 0.04934395225718617,
"train/kl_loss_r1": 0.02698051822371781,
"train/total_kl": 0.07632447089999914
},
{
"epoch": 3.766372677800713,
"grad_norm": 1.4921875,
"learning_rate": 1.7342342342342344e-06,
"loss": 0.506,
"mean_token_accuracy": 0.9478281736373901,
"step": 5020,
"train/kl_loss_qwen": 0.036864762753248216,
"train/kl_loss_r1": 0.023657037084922193,
"train/total_kl": 0.060521799977868794
},
{
"epoch": 3.770125727153312,
"grad_norm": 1.953125,
"learning_rate": 1.7060810810810811e-06,
"loss": 0.4943,
"mean_token_accuracy": 0.9443540513515473,
"step": 5025,
"train/kl_loss_qwen": 0.03439016304910183,
"train/kl_loss_r1": 0.02218628195114434,
"train/total_kl": 0.05657644523307681
},
{
"epoch": 3.773878776505911,
"grad_norm": 2.0625,
"learning_rate": 1.677927927927928e-06,
"loss": 0.506,
"mean_token_accuracy": 0.9510277390480042,
"step": 5030,
"train/kl_loss_qwen": 0.04075477225705981,
"train/kl_loss_r1": 0.025303835375234486,
"train/total_kl": 0.06605860805138945
},
{
"epoch": 3.77763182585851,
"grad_norm": 1.5546875,
"learning_rate": 1.649774774774775e-06,
"loss": 0.5323,
"mean_token_accuracy": 0.9535300970077515,
"step": 5035,
"train/kl_loss_qwen": 0.045921135554090144,
"train/kl_loss_r1": 0.026559272641316058,
"train/total_kl": 0.07248040847480297
},
{
"epoch": 3.781384875211109,
"grad_norm": 1.7734375,
"learning_rate": 1.6216216216216219e-06,
"loss": 0.5453,
"mean_token_accuracy": 0.9485278338193893,
"step": 5040,
"train/kl_loss_qwen": 0.04068466508761048,
"train/kl_loss_r1": 0.024883358972147107,
"train/total_kl": 0.06556802354753018
},
{
"epoch": 3.785137924563708,
"grad_norm": 1.5859375,
"learning_rate": 1.5934684684684686e-06,
"loss": 0.4897,
"mean_token_accuracy": 0.945227426290512,
"step": 5045,
"train/kl_loss_qwen": 0.03364719781093299,
"train/kl_loss_r1": 0.02213437985628843,
"train/total_kl": 0.055781577713787556
},
{
"epoch": 3.788890973916307,
"grad_norm": 2.125,
"learning_rate": 1.5653153153153153e-06,
"loss": 0.4788,
"mean_token_accuracy": 0.9548559993505478,
"step": 5050,
"train/kl_loss_qwen": 0.03653868711553514,
"train/kl_loss_r1": 0.0236417087726295,
"train/total_kl": 0.06018039602786303
},
{
"epoch": 3.792644023268906,
"grad_norm": 2.03125,
"learning_rate": 1.5371621621621622e-06,
"loss": 0.5636,
"mean_token_accuracy": 0.9515438884496689,
"step": 5055,
"train/kl_loss_qwen": 0.047804121021181346,
"train/kl_loss_r1": 0.029594582365825774,
"train/total_kl": 0.07739870361983776
},
{
"epoch": 3.796397072621505,
"grad_norm": 1.6015625,
"learning_rate": 1.5090090090090089e-06,
"loss": 0.4593,
"mean_token_accuracy": 0.9565709322690964,
"step": 5060,
"train/kl_loss_qwen": 0.036150804301723835,
"train/kl_loss_r1": 0.022632238129153846,
"train/total_kl": 0.05878304187208414
},
{
"epoch": 3.800150121974104,
"grad_norm": 1.5390625,
"learning_rate": 1.4808558558558558e-06,
"loss": 0.4542,
"mean_token_accuracy": 0.9509487301111221,
"step": 5065,
"train/kl_loss_qwen": 0.030484898015856743,
"train/kl_loss_r1": 0.01995536368340254,
"train/total_kl": 0.050440261419862506
},
{
"epoch": 3.803903171326703,
"grad_norm": 2.21875,
"learning_rate": 1.4527027027027027e-06,
"loss": 0.5608,
"mean_token_accuracy": 0.9536998093128204,
"step": 5070,
"train/kl_loss_qwen": 0.05034955218434334,
"train/kl_loss_r1": 0.02807376431301236,
"train/total_kl": 0.07842331659048796
},
{
"epoch": 3.807656220679302,
"grad_norm": 2.0625,
"learning_rate": 1.4245495495495496e-06,
"loss": 0.5599,
"mean_token_accuracy": 0.9517528563737869,
"step": 5075,
"train/kl_loss_qwen": 0.04939096746966243,
"train/kl_loss_r1": 0.028638430312275885,
"train/total_kl": 0.07802939787507057
},
{
"epoch": 3.811409270031901,
"grad_norm": 2.5625,
"learning_rate": 1.3963963963963963e-06,
"loss": 0.5062,
"mean_token_accuracy": 0.9554317742586136,
"step": 5080,
"train/kl_loss_qwen": 0.04219297617673874,
"train/kl_loss_r1": 0.025768689857795835,
"train/total_kl": 0.06796166570857168
},
{
"epoch": 3.8151623193845,
"grad_norm": 2.828125,
"learning_rate": 1.3682432432432432e-06,
"loss": 0.4974,
"mean_token_accuracy": 0.9443808525800705,
"step": 5085,
"train/kl_loss_qwen": 0.03445208133198321,
"train/kl_loss_r1": 0.021914923517033457,
"train/total_kl": 0.056367005221545696
},
{
"epoch": 3.818915368737099,
"grad_norm": 1.78125,
"learning_rate": 1.3400900900900901e-06,
"loss": 0.5546,
"mean_token_accuracy": 0.9497458070516587,
"step": 5090,
"train/kl_loss_qwen": 0.0485810327809304,
"train/kl_loss_r1": 0.027917088754475117,
"train/total_kl": 0.07649812195450068
},
{
"epoch": 3.822668418089698,
"grad_norm": 1.5390625,
"learning_rate": 1.311936936936937e-06,
"loss": 0.5886,
"mean_token_accuracy": 0.9538557380437851,
"step": 5095,
"train/kl_loss_qwen": 0.05744519936852157,
"train/kl_loss_r1": 0.030710907746106388,
"train/total_kl": 0.08815610771998764
},
{
"epoch": 3.8264214674422967,
"grad_norm": 2.34375,
"learning_rate": 1.2837837837837838e-06,
"loss": 0.4847,
"mean_token_accuracy": 0.9532930910587311,
"step": 5100,
"train/kl_loss_qwen": 0.03452372634783387,
"train/kl_loss_r1": 0.02196382894180715,
"train/total_kl": 0.05648755459114909
},
{
"epoch": 3.8301745167948957,
"grad_norm": 4.21875,
"learning_rate": 1.2556306306306307e-06,
"loss": 0.5332,
"mean_token_accuracy": 0.9430410385131835,
"step": 5105,
"train/kl_loss_qwen": 0.040356996841728686,
"train/kl_loss_r1": 0.023822441697120667,
"train/total_kl": 0.06417943863198161
},
{
"epoch": 3.8339275661474947,
"grad_norm": 1.609375,
"learning_rate": 1.2274774774774776e-06,
"loss": 0.5038,
"mean_token_accuracy": 0.9531925290822982,
"step": 5110,
"train/kl_loss_qwen": 0.04049249268136919,
"train/kl_loss_r1": 0.025288863759487867,
"train/total_kl": 0.0657813566736877
},
{
"epoch": 3.8376806155000938,
"grad_norm": 2.921875,
"learning_rate": 1.1993243243243243e-06,
"loss": 0.522,
"mean_token_accuracy": 0.9434494227170944,
"step": 5115,
"train/kl_loss_qwen": 0.037803121656179425,
"train/kl_loss_r1": 0.02446298780851066,
"train/total_kl": 0.06226610923185945
},
{
"epoch": 3.8414336648526928,
"grad_norm": 2.3125,
"learning_rate": 1.1711711711711712e-06,
"loss": 0.4692,
"mean_token_accuracy": 0.9514028370380402,
"step": 5120,
"train/kl_loss_qwen": 0.03402503570541739,
"train/kl_loss_r1": 0.02239496917463839,
"train/total_kl": 0.05642000511288643
},
{
"epoch": 3.845186714205292,
"grad_norm": 2.3125,
"learning_rate": 1.1430180180180181e-06,
"loss": 0.5309,
"mean_token_accuracy": 0.9505946636199951,
"step": 5125,
"train/kl_loss_qwen": 0.045850425586104394,
"train/kl_loss_r1": 0.026252701180055737,
"train/total_kl": 0.07210312644019723
},
{
"epoch": 3.848939763557891,
"grad_norm": 2.203125,
"learning_rate": 1.114864864864865e-06,
"loss": 0.5566,
"mean_token_accuracy": 0.9513975620269776,
"step": 5130,
"train/kl_loss_qwen": 0.04835722097195685,
"train/kl_loss_r1": 0.028962965682148935,
"train/total_kl": 0.07732018698006868
},
{
"epoch": 3.85269281291049,
"grad_norm": 1.609375,
"learning_rate": 1.0867117117117117e-06,
"loss": 0.5045,
"mean_token_accuracy": 0.9520065993070602,
"step": 5135,
"train/kl_loss_qwen": 0.03904314516112208,
"train/kl_loss_r1": 0.025849370704963803,
"train/total_kl": 0.0648925157263875
},
{
"epoch": 3.856445862263089,
"grad_norm": 3.328125,
"learning_rate": 1.0585585585585587e-06,
"loss": 0.498,
"mean_token_accuracy": 0.9538995712995529,
"step": 5140,
"train/kl_loss_qwen": 0.038834956288337705,
"train/kl_loss_r1": 0.023740610433742405,
"train/total_kl": 0.06257556639611721
},
{
"epoch": 3.860198911615688,
"grad_norm": 1.9609375,
"learning_rate": 1.0304054054054056e-06,
"loss": 0.4727,
"mean_token_accuracy": 0.94283646941185,
"step": 5145,
"train/kl_loss_qwen": 0.027823445247486235,
"train/kl_loss_r1": 0.01955572385340929,
"train/total_kl": 0.04737916942685842
},
{
"epoch": 3.863951960968287,
"grad_norm": 1.9296875,
"learning_rate": 1.0022522522522525e-06,
"loss": 0.504,
"mean_token_accuracy": 0.9552516132593155,
"step": 5150,
"train/kl_loss_qwen": 0.04192827101796866,
"train/kl_loss_r1": 0.0254449718631804,
"train/total_kl": 0.06737324222922325
},
{
"epoch": 3.867705010320886,
"grad_norm": 1.7578125,
"learning_rate": 9.74099099099099e-07,
"loss": 0.473,
"mean_token_accuracy": 0.9536389499902725,
"step": 5155,
"train/kl_loss_qwen": 0.037043438851833345,
"train/kl_loss_r1": 0.0236785258166492,
"train/total_kl": 0.06072196466848254
},
{
"epoch": 3.8714580596734844,
"grad_norm": 1.7109375,
"learning_rate": 9.459459459459459e-07,
"loss": 0.5516,
"mean_token_accuracy": 0.9482437491416931,
"step": 5160,
"train/kl_loss_qwen": 0.04674530010670423,
"train/kl_loss_r1": 0.027758846478536724,
"train/total_kl": 0.07450414700433612
},
{
"epoch": 3.8752111090260835,
"grad_norm": 1.765625,
"learning_rate": 9.177927927927928e-07,
"loss": 0.5144,
"mean_token_accuracy": 0.9507743179798126,
"step": 5165,
"train/kl_loss_qwen": 0.03748309840448201,
"train/kl_loss_r1": 0.02437306847423315,
"train/total_kl": 0.061856167297810315
},
{
"epoch": 3.8789641583786825,
"grad_norm": 1.8046875,
"learning_rate": 8.896396396396397e-07,
"loss": 0.5204,
"mean_token_accuracy": 0.9507594257593155,
"step": 5170,
"train/kl_loss_qwen": 0.043137048045173286,
"train/kl_loss_r1": 0.025168476812541484,
"train/total_kl": 0.06830552481114864
},
{
"epoch": 3.8827172077312815,
"grad_norm": 1.796875,
"learning_rate": 8.614864864864865e-07,
"loss": 0.5293,
"mean_token_accuracy": 0.9467691868543625,
"step": 5175,
"train/kl_loss_qwen": 0.040857316879555586,
"train/kl_loss_r1": 0.02520199529826641,
"train/total_kl": 0.06605931203812361
},
{
"epoch": 3.8864702570838805,
"grad_norm": 2.03125,
"learning_rate": 8.333333333333333e-07,
"loss": 0.512,
"mean_token_accuracy": 0.954476135969162,
"step": 5180,
"train/kl_loss_qwen": 0.04564613183028996,
"train/kl_loss_r1": 0.025337532442063094,
"train/total_kl": 0.07098366366699338
},
{
"epoch": 3.8902233064364795,
"grad_norm": 1.8046875,
"learning_rate": 8.051801801801801e-07,
"loss": 0.5171,
"mean_token_accuracy": 0.9508705079555512,
"step": 5185,
"train/kl_loss_qwen": 0.04170615980401635,
"train/kl_loss_r1": 0.025099441641941667,
"train/total_kl": 0.06680560121312737
},
{
"epoch": 3.8939763557890785,
"grad_norm": 1.6640625,
"learning_rate": 7.770270270270271e-07,
"loss": 0.4909,
"mean_token_accuracy": 0.9476747989654541,
"step": 5190,
"train/kl_loss_qwen": 0.03633582382462919,
"train/kl_loss_r1": 0.02298521767370403,
"train/total_kl": 0.05932104177772999
},
{
"epoch": 3.8977294051416775,
"grad_norm": 1.8046875,
"learning_rate": 7.488738738738739e-07,
"loss": 0.5217,
"mean_token_accuracy": 0.9495671540498734,
"step": 5195,
"train/kl_loss_qwen": 0.04427734538912773,
"train/kl_loss_r1": 0.02526472685858607,
"train/total_kl": 0.06954207243397832
},
{
"epoch": 3.9014824544942766,
"grad_norm": 1.5625,
"learning_rate": 7.207207207207208e-07,
"loss": 0.4923,
"mean_token_accuracy": 0.9494727224111557,
"step": 5200,
"train/kl_loss_qwen": 0.03875735821202397,
"train/kl_loss_r1": 0.023817204358056187,
"train/total_kl": 0.06257456252351404
},
{
"epoch": 3.9052355038468756,
"grad_norm": 2.484375,
"learning_rate": 6.925675675675676e-07,
"loss": 0.4814,
"mean_token_accuracy": 0.9498078048229217,
"step": 5205,
"train/kl_loss_qwen": 0.03472012551501393,
"train/kl_loss_r1": 0.022663915436714886,
"train/total_kl": 0.05738404057919979
},
{
"epoch": 3.9089885531994746,
"grad_norm": 2.25,
"learning_rate": 6.644144144144144e-07,
"loss": 0.5007,
"mean_token_accuracy": 0.9551177322864532,
"step": 5210,
"train/kl_loss_qwen": 0.04156562443822622,
"train/kl_loss_r1": 0.025957941822707654,
"train/total_kl": 0.06752356672659517
},
{
"epoch": 3.9127416025520736,
"grad_norm": 1.671875,
"learning_rate": 6.362612612612613e-07,
"loss": 0.5694,
"mean_token_accuracy": 0.9571527123451233,
"step": 5215,
"train/kl_loss_qwen": 0.052221673587337133,
"train/kl_loss_r1": 0.031050076289102436,
"train/total_kl": 0.08327174894511699
},
{
"epoch": 3.9164946519046726,
"grad_norm": 1.6796875,
"learning_rate": 6.081081081081081e-07,
"loss": 0.4867,
"mean_token_accuracy": 0.9479338258504868,
"step": 5220,
"train/kl_loss_qwen": 0.037482742918655276,
"train/kl_loss_r1": 0.022623464511707426,
"train/total_kl": 0.060106207709759475
},
{
"epoch": 3.9202477012572716,
"grad_norm": 2.9375,
"learning_rate": 5.79954954954955e-07,
"loss": 0.5315,
"mean_token_accuracy": 0.95349780023098,
"step": 5225,
"train/kl_loss_qwen": 0.041179875005036594,
"train/kl_loss_r1": 0.024548267433419823,
"train/total_kl": 0.06572814229875804
},
{
"epoch": 3.9240007506098706,
"grad_norm": 1.7890625,
"learning_rate": 5.518018018018017e-07,
"loss": 0.494,
"mean_token_accuracy": 0.9552882075309753,
"step": 5230,
"train/kl_loss_qwen": 0.0404520948883146,
"train/kl_loss_r1": 0.024678921373561025,
"train/total_kl": 0.06513101598247886
},
{
"epoch": 3.9277537999624696,
"grad_norm": 2.296875,
"learning_rate": 5.236486486486486e-07,
"loss": 0.4897,
"mean_token_accuracy": 0.9574841767549515,
"step": 5235,
"train/kl_loss_qwen": 0.04159375471062958,
"train/kl_loss_r1": 0.025406858837231993,
"train/total_kl": 0.06700061419978738
},
{
"epoch": 3.9315068493150687,
"grad_norm": 2.546875,
"learning_rate": 4.954954954954955e-07,
"loss": 0.5705,
"mean_token_accuracy": 0.9512778520584106,
"step": 5240,
"train/kl_loss_qwen": 0.04816130660474301,
"train/kl_loss_r1": 0.02963559590280056,
"train/total_kl": 0.0777969030663371
},
{
"epoch": 3.9352598986676677,
"grad_norm": 1.6015625,
"learning_rate": 4.673423423423423e-07,
"loss": 0.4914,
"mean_token_accuracy": 0.9590355962514877,
"step": 5245,
"train/kl_loss_qwen": 0.03864445784129202,
"train/kl_loss_r1": 0.024916677735745907,
"train/total_kl": 0.06356113543733954
},
{
"epoch": 3.9390129480202667,
"grad_norm": 1.7734375,
"learning_rate": 4.391891891891892e-07,
"loss": 0.5212,
"mean_token_accuracy": 0.9514751166105271,
"step": 5250,
"train/kl_loss_qwen": 0.041747315181419255,
"train/kl_loss_r1": 0.025338015891611575,
"train/total_kl": 0.06708533093333244
},
{
"epoch": 3.9427659973728657,
"grad_norm": 2.0625,
"learning_rate": 4.1103603603603604e-07,
"loss": 0.4691,
"mean_token_accuracy": 0.9524274647235871,
"step": 5255,
"train/kl_loss_qwen": 0.03220422621816397,
"train/kl_loss_r1": 0.021751163946464657,
"train/total_kl": 0.05395539067685604
},
{
"epoch": 3.9465190467254643,
"grad_norm": 2.0625,
"learning_rate": 3.828828828828829e-07,
"loss": 0.4931,
"mean_token_accuracy": 0.9523744881153107,
"step": 5260,
"train/kl_loss_qwen": 0.040453130332753065,
"train/kl_loss_r1": 0.022134747868403793,
"train/total_kl": 0.06258787931874395
},
{
"epoch": 3.9502720960780633,
"grad_norm": 1.5546875,
"learning_rate": 3.5472972972972976e-07,
"loss": 0.5695,
"mean_token_accuracy": 0.9486282020807266,
"step": 5265,
"train/kl_loss_qwen": 0.04893369772471488,
"train/kl_loss_r1": 0.028443768760189413,
"train/total_kl": 0.07737746657803654
},
{
"epoch": 3.9540251454306623,
"grad_norm": 2.34375,
"learning_rate": 3.2657657657657657e-07,
"loss": 0.506,
"mean_token_accuracy": 0.9494929820299148,
"step": 5270,
"train/kl_loss_qwen": 0.039843138726428154,
"train/kl_loss_r1": 0.02399267992004752,
"train/total_kl": 0.06383581822738052
},
{
"epoch": 3.9577781947832613,
"grad_norm": 1.6328125,
"learning_rate": 2.9842342342342343e-07,
"loss": 0.4744,
"mean_token_accuracy": 0.9528090953826904,
"step": 5275,
"train/kl_loss_qwen": 0.03620699774473905,
"train/kl_loss_r1": 0.02199371703900397,
"train/total_kl": 0.058200715016573666
},
{
"epoch": 3.9615312441358603,
"grad_norm": 1.828125,
"learning_rate": 2.702702702702703e-07,
"loss": 0.5002,
"mean_token_accuracy": 0.9486662954092026,
"step": 5280,
"train/kl_loss_qwen": 0.03773316466249525,
"train/kl_loss_r1": 0.02234139838255942,
"train/total_kl": 0.060074562951922414
},
{
"epoch": 3.9652842934884593,
"grad_norm": 2.0625,
"learning_rate": 2.4211711711711715e-07,
"loss": 0.5184,
"mean_token_accuracy": 0.9583245426416397,
"step": 5285,
"train/kl_loss_qwen": 0.04658535942435264,
"train/kl_loss_r1": 0.02469016583636403,
"train/total_kl": 0.07127552451565862
},
{
"epoch": 3.9690373428410584,
"grad_norm": 1.53125,
"learning_rate": 2.1396396396396396e-07,
"loss": 0.4914,
"mean_token_accuracy": 0.9506331980228424,
"step": 5290,
"train/kl_loss_qwen": 0.034936840366572144,
"train/kl_loss_r1": 0.021668214024975894,
"train/total_kl": 0.05660505462437868
},
{
"epoch": 3.9727903921936574,
"grad_norm": 1.734375,
"learning_rate": 1.8581081081081082e-07,
"loss": 0.5043,
"mean_token_accuracy": 0.9526822239160537,
"step": 5295,
"train/kl_loss_qwen": 0.04128625453449786,
"train/kl_loss_r1": 0.02440170394256711,
"train/total_kl": 0.06568795843049884
},
{
"epoch": 3.9765434415462564,
"grad_norm": 2.125,
"learning_rate": 1.5765765765765768e-07,
"loss": 0.4875,
"mean_token_accuracy": 0.9513192981481552,
"step": 5300,
"train/kl_loss_qwen": 0.03742529796436429,
"train/kl_loss_r1": 0.022662578942254187,
"train/total_kl": 0.06008787713944912
},
{
"epoch": 3.9802964908988554,
"grad_norm": 1.7421875,
"learning_rate": 1.295045045045045e-07,
"loss": 0.504,
"mean_token_accuracy": 0.9543662935495376,
"step": 5305,
"train/kl_loss_qwen": 0.043019989412277936,
"train/kl_loss_r1": 0.023822894692420958,
"train/total_kl": 0.06684288457036018
},
{
"epoch": 3.9840495402514544,
"grad_norm": 1.734375,
"learning_rate": 1.0135135135135137e-07,
"loss": 0.4643,
"mean_token_accuracy": 0.9470363169908523,
"step": 5310,
"train/kl_loss_qwen": 0.03113719546236098,
"train/kl_loss_r1": 0.019862218666821717,
"train/total_kl": 0.05099941315129399
},
{
"epoch": 3.9878025896040534,
"grad_norm": 2.078125,
"learning_rate": 7.31981981981982e-08,
"loss": 0.5025,
"mean_token_accuracy": 0.9551354616880416,
"step": 5315,
"train/kl_loss_qwen": 0.041465169610455634,
"train/kl_loss_r1": 0.025189779000356793,
"train/total_kl": 0.06665494851768017
},
{
"epoch": 3.9915556389566524,
"grad_norm": 2.328125,
"learning_rate": 4.504504504504505e-08,
"loss": 0.4905,
"mean_token_accuracy": 0.9456799060106278,
"step": 5320,
"train/kl_loss_qwen": 0.035016221832484005,
"train/kl_loss_r1": 0.022114977519959212,
"train/total_kl": 0.05713119944557547
},
{
"epoch": 3.995308688309251,
"grad_norm": 1.859375,
"learning_rate": 1.6891891891891893e-08,
"loss": 0.4987,
"mean_token_accuracy": 0.9567227691411972,
"step": 5325,
"train/kl_loss_qwen": 0.039210280030965806,
"train/kl_loss_r1": 0.02504223152063787,
"train/total_kl": 0.06425251075997948
}
],
"logging_steps": 5,
"max_steps": 5328,
"num_input_tokens_seen": 0,
"num_train_epochs": 4,
"save_steps": 500,
"stateful_callbacks": {
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": true,
"should_training_stop": true
},
"attributes": {}
}
},
"total_flos": 1.577455631807742e+18,
"train_batch_size": 2,
"trial_name": null,
"trial_params": null
}