OThink-R1-MATH-14B / trainer_state.json
Cynthia-1628's picture
Upload folder using huggingface_hub
85c857d verified
Raw
History Blame Contribute Delete
229 kB
{
"best_metric": null,
"best_model_checkpoint": null,
"epoch": 3.999066874027994,
"eval_steps": 500,
"global_step": 3212,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"epoch": 0.006220839813374806,
"grad_norm": 4.5,
"learning_rate": 2.9953300124533003e-05,
"loss": 0.8649,
"mean_token_accuracy": 0.885539248585701,
"step": 5,
"train/kl_loss_qwen": 0.06747693261131645,
"train/kl_loss_r1": 0.04241067896800814,
"train/total_kl": 0.10988761270418763
},
{
"epoch": 0.012441679626749611,
"grad_norm": 14.6875,
"learning_rate": 2.9906600249066002e-05,
"loss": 1.2059,
"mean_token_accuracy": 0.8885251730680466,
"step": 10,
"train/kl_loss_qwen": 0.0929522925056517,
"train/kl_loss_r1": 0.1073197754449211,
"train/total_kl": 0.20027207368984817
},
{
"epoch": 0.01866251944012442,
"grad_norm": 2.515625,
"learning_rate": 2.9859900373599004e-05,
"loss": 0.5277,
"mean_token_accuracy": 0.9018729269504547,
"step": 15,
"train/kl_loss_qwen": 0.03184658419340849,
"train/kl_loss_r1": 0.01505236077355221,
"train/total_kl": 0.04689894551411271
},
{
"epoch": 0.024883359253499222,
"grad_norm": 2.734375,
"learning_rate": 2.9813200498132003e-05,
"loss": 0.5372,
"mean_token_accuracy": 0.8993205606937409,
"step": 20,
"train/kl_loss_qwen": 0.03552339724265039,
"train/kl_loss_r1": 0.012143875833135098,
"train/total_kl": 0.04766727341338992
},
{
"epoch": 0.03110419906687403,
"grad_norm": 2.703125,
"learning_rate": 2.9766500622665006e-05,
"loss": 0.5124,
"mean_token_accuracy": 0.9028977572917938,
"step": 25,
"train/kl_loss_qwen": 0.031236130651086567,
"train/kl_loss_r1": 0.012251556990668178,
"train/total_kl": 0.04348768750205636
},
{
"epoch": 0.03732503888024884,
"grad_norm": 2.5625,
"learning_rate": 2.9719800747198008e-05,
"loss": 0.4767,
"mean_token_accuracy": 0.9011666357517243,
"step": 30,
"train/kl_loss_qwen": 0.026808999991044403,
"train/kl_loss_r1": 0.008258039911743254,
"train/total_kl": 0.03506704047322273
},
{
"epoch": 0.04354587869362364,
"grad_norm": 3.765625,
"learning_rate": 2.9673100871731007e-05,
"loss": 0.511,
"mean_token_accuracy": 0.9000001281499863,
"step": 35,
"train/kl_loss_qwen": 0.027317401487380266,
"train/kl_loss_r1": 0.013182285078801214,
"train/total_kl": 0.04049968663603067
},
{
"epoch": 0.049766718506998445,
"grad_norm": 2.609375,
"learning_rate": 2.962640099626401e-05,
"loss": 0.5154,
"mean_token_accuracy": 0.8928132474422454,
"step": 40,
"train/kl_loss_qwen": 0.027987364726141096,
"train/kl_loss_r1": 0.012156172015238553,
"train/total_kl": 0.04014353705570102
},
{
"epoch": 0.05598755832037325,
"grad_norm": 2.390625,
"learning_rate": 2.9579701120797012e-05,
"loss": 0.4937,
"mean_token_accuracy": 0.8918720930814743,
"step": 45,
"train/kl_loss_qwen": 0.024307892844080924,
"train/kl_loss_r1": 0.009873847151175142,
"train/total_kl": 0.034181739576160906
},
{
"epoch": 0.06220839813374806,
"grad_norm": 11.0625,
"learning_rate": 2.9533001245330014e-05,
"loss": 0.5548,
"mean_token_accuracy": 0.9037962466478348,
"step": 50,
"train/kl_loss_qwen": 0.0403732392936945,
"train/kl_loss_r1": 0.01709484038874507,
"train/total_kl": 0.057468080334365367
},
{
"epoch": 0.06842923794712286,
"grad_norm": 2.71875,
"learning_rate": 2.9486301369863017e-05,
"loss": 0.473,
"mean_token_accuracy": 0.902271169424057,
"step": 55,
"train/kl_loss_qwen": 0.027851210488006473,
"train/kl_loss_r1": 0.009670931240543723,
"train/total_kl": 0.03752214219421148
},
{
"epoch": 0.07465007776049767,
"grad_norm": 2.46875,
"learning_rate": 2.9439601494396016e-05,
"loss": 0.4726,
"mean_token_accuracy": 0.8976862788200378,
"step": 60,
"train/kl_loss_qwen": 0.02319532949477434,
"train/kl_loss_r1": 0.011528853024356068,
"train/total_kl": 0.034724182728677985
},
{
"epoch": 0.08087091757387248,
"grad_norm": 2.734375,
"learning_rate": 2.9392901618929018e-05,
"loss": 0.4812,
"mean_token_accuracy": 0.8980915457010269,
"step": 65,
"train/kl_loss_qwen": 0.0253461551386863,
"train/kl_loss_r1": 0.011177089205011726,
"train/total_kl": 0.036523244343698025
},
{
"epoch": 0.08709175738724728,
"grad_norm": 2.25,
"learning_rate": 2.934620174346202e-05,
"loss": 0.4546,
"mean_token_accuracy": 0.9052111625671386,
"step": 70,
"train/kl_loss_qwen": 0.024780120234936476,
"train/kl_loss_r1": 0.010003501223400236,
"train/total_kl": 0.03478362150490284
},
{
"epoch": 0.09331259720062209,
"grad_norm": 2.5,
"learning_rate": 2.929950186799502e-05,
"loss": 0.4993,
"mean_token_accuracy": 0.8921610146760941,
"step": 75,
"train/kl_loss_qwen": 0.023273218562826513,
"train/kl_loss_r1": 0.011020376090891659,
"train/total_kl": 0.03429359458386898
},
{
"epoch": 0.09953343701399689,
"grad_norm": 2.3125,
"learning_rate": 2.9252801992528022e-05,
"loss": 0.4828,
"mean_token_accuracy": 0.8996184289455413,
"step": 80,
"train/kl_loss_qwen": 0.024831860419362785,
"train/kl_loss_r1": 0.01152246268466115,
"train/total_kl": 0.03635432319715619
},
{
"epoch": 0.1057542768273717,
"grad_norm": 2.859375,
"learning_rate": 2.920610211706102e-05,
"loss": 0.4623,
"mean_token_accuracy": 0.898178032040596,
"step": 85,
"train/kl_loss_qwen": 0.022067550197243692,
"train/kl_loss_r1": 0.009043183457106353,
"train/total_kl": 0.031110733561217786
},
{
"epoch": 0.1119751166407465,
"grad_norm": 2.578125,
"learning_rate": 2.9159402241594023e-05,
"loss": 0.6165,
"mean_token_accuracy": 0.8967886596918107,
"step": 90,
"train/kl_loss_qwen": 0.04917705850675702,
"train/kl_loss_r1": 0.01726052793674171,
"train/total_kl": 0.06643758723512291
},
{
"epoch": 0.1181959564541213,
"grad_norm": 2.59375,
"learning_rate": 2.9112702366127026e-05,
"loss": 0.4688,
"mean_token_accuracy": 0.8956692755222321,
"step": 95,
"train/kl_loss_qwen": 0.022392515651881696,
"train/kl_loss_r1": 0.010053132427856326,
"train/total_kl": 0.03244564794003964
},
{
"epoch": 0.12441679626749612,
"grad_norm": 2.421875,
"learning_rate": 2.9066002490660025e-05,
"loss": 0.4666,
"mean_token_accuracy": 0.9006453633308411,
"step": 100,
"train/kl_loss_qwen": 0.02538487664423883,
"train/kl_loss_r1": 0.00974747968139127,
"train/total_kl": 0.03513235654681921
},
{
"epoch": 0.13063763608087092,
"grad_norm": 2.296875,
"learning_rate": 2.9019302615193027e-05,
"loss": 0.4403,
"mean_token_accuracy": 0.8980156928300858,
"step": 105,
"train/kl_loss_qwen": 0.019946316070854665,
"train/kl_loss_r1": 0.00894002104178071,
"train/total_kl": 0.0288863368332386
},
{
"epoch": 0.1368584758942457,
"grad_norm": 2.359375,
"learning_rate": 2.8972602739726026e-05,
"loss": 0.4374,
"mean_token_accuracy": 0.9068128049373627,
"step": 110,
"train/kl_loss_qwen": 0.02424931791611016,
"train/kl_loss_r1": 0.009157051984220742,
"train/total_kl": 0.03340637004002929
},
{
"epoch": 0.14307931570762053,
"grad_norm": 2.234375,
"learning_rate": 2.8925902864259028e-05,
"loss": 0.4392,
"mean_token_accuracy": 0.9012053400278092,
"step": 115,
"train/kl_loss_qwen": 0.020489979069679976,
"train/kl_loss_r1": 0.008880690694786609,
"train/total_kl": 0.02937066974118352
},
{
"epoch": 0.14930015552099535,
"grad_norm": 2.546875,
"learning_rate": 2.887920298879203e-05,
"loss": 0.4412,
"mean_token_accuracy": 0.899726277589798,
"step": 120,
"train/kl_loss_qwen": 0.0204013851005584,
"train/kl_loss_r1": 0.009058444690890611,
"train/total_kl": 0.029459829907864332
},
{
"epoch": 0.15552099533437014,
"grad_norm": 2.03125,
"learning_rate": 2.883250311332503e-05,
"loss": 0.4338,
"mean_token_accuracy": 0.9087229013442993,
"step": 125,
"train/kl_loss_qwen": 0.023963469313457608,
"train/kl_loss_r1": 0.010771268280223012,
"train/total_kl": 0.03473473777994514
},
{
"epoch": 0.16174183514774496,
"grad_norm": 2.359375,
"learning_rate": 2.8785803237858032e-05,
"loss": 0.4331,
"mean_token_accuracy": 0.9061719745397567,
"step": 130,
"train/kl_loss_qwen": 0.022065827203914524,
"train/kl_loss_r1": 0.011356789106503128,
"train/total_kl": 0.03342261621728539
},
{
"epoch": 0.16796267496111975,
"grad_norm": 2.234375,
"learning_rate": 2.8739103362391034e-05,
"loss": 0.4374,
"mean_token_accuracy": 0.9011161267757416,
"step": 135,
"train/kl_loss_qwen": 0.021853275410830975,
"train/kl_loss_r1": 0.010496085102204233,
"train/total_kl": 0.032349360454827544
},
{
"epoch": 0.17418351477449456,
"grad_norm": 2.328125,
"learning_rate": 2.8692403486924037e-05,
"loss": 0.4457,
"mean_token_accuracy": 0.9047422379255294,
"step": 140,
"train/kl_loss_qwen": 0.02275628219358623,
"train/kl_loss_r1": 0.010783428023569287,
"train/total_kl": 0.03353970991447568
},
{
"epoch": 0.18040435458786935,
"grad_norm": 3.21875,
"learning_rate": 2.864570361145704e-05,
"loss": 0.4538,
"mean_token_accuracy": 0.9026034384965896,
"step": 145,
"train/kl_loss_qwen": 0.02352142836898565,
"train/kl_loss_r1": 0.011291519668884576,
"train/total_kl": 0.03481294792145491
},
{
"epoch": 0.18662519440124417,
"grad_norm": 3.078125,
"learning_rate": 2.8599003735990038e-05,
"loss": 0.458,
"mean_token_accuracy": 0.9031858772039414,
"step": 150,
"train/kl_loss_qwen": 0.022739559737965466,
"train/kl_loss_r1": 0.012792359199374914,
"train/total_kl": 0.03553191879764199
},
{
"epoch": 0.19284603421461896,
"grad_norm": 2.375,
"learning_rate": 2.855230386052304e-05,
"loss": 0.5434,
"mean_token_accuracy": 0.907307168841362,
"step": 155,
"train/kl_loss_qwen": 0.04449260346591473,
"train/kl_loss_r1": 0.014073733380064369,
"train/total_kl": 0.05856633689254522
},
{
"epoch": 0.19906687402799378,
"grad_norm": 2.59375,
"learning_rate": 2.8505603985056043e-05,
"loss": 0.4605,
"mean_token_accuracy": 0.8996091216802597,
"step": 160,
"train/kl_loss_qwen": 0.025977824395522476,
"train/kl_loss_r1": 0.01165865061338991,
"train/total_kl": 0.03763647498562932
},
{
"epoch": 0.2052877138413686,
"grad_norm": 2.515625,
"learning_rate": 2.8458904109589042e-05,
"loss": 0.528,
"mean_token_accuracy": 0.900575140118599,
"step": 165,
"train/kl_loss_qwen": 0.031398235633969304,
"train/kl_loss_r1": 0.023330681957304478,
"train/total_kl": 0.05472891740500927
},
{
"epoch": 0.2115085536547434,
"grad_norm": 2.65625,
"learning_rate": 2.8412204234122044e-05,
"loss": 0.4433,
"mean_token_accuracy": 0.9035054802894592,
"step": 170,
"train/kl_loss_qwen": 0.0246684439945966,
"train/kl_loss_r1": 0.011178959859535098,
"train/total_kl": 0.03584740431979298
},
{
"epoch": 0.2177293934681182,
"grad_norm": 2.78125,
"learning_rate": 2.8365504358655043e-05,
"loss": 0.4265,
"mean_token_accuracy": 0.9048573732376098,
"step": 175,
"train/kl_loss_qwen": 0.02242542668245733,
"train/kl_loss_r1": 0.010072631668299437,
"train/total_kl": 0.032498058304190634
},
{
"epoch": 0.223950233281493,
"grad_norm": 2.53125,
"learning_rate": 2.8318804483188046e-05,
"loss": 0.469,
"mean_token_accuracy": 0.9018107861280441,
"step": 180,
"train/kl_loss_qwen": 0.02478899694979191,
"train/kl_loss_r1": 0.012270277575589716,
"train/total_kl": 0.037059274548664686
},
{
"epoch": 0.2301710730948678,
"grad_norm": 2.25,
"learning_rate": 2.8272104607721048e-05,
"loss": 0.5042,
"mean_token_accuracy": 0.9139624059200286,
"step": 185,
"train/kl_loss_qwen": 0.03831529831513762,
"train/kl_loss_r1": 0.01714326792862266,
"train/total_kl": 0.05545856654644012
},
{
"epoch": 0.2363919129082426,
"grad_norm": 2.140625,
"learning_rate": 2.8225404732254047e-05,
"loss": 0.5493,
"mean_token_accuracy": 0.9074622631072998,
"step": 190,
"train/kl_loss_qwen": 0.04459263035096228,
"train/kl_loss_r1": 0.01827790851239115,
"train/total_kl": 0.06287053730338812
},
{
"epoch": 0.24261275272161742,
"grad_norm": 2.40625,
"learning_rate": 2.817870485678705e-05,
"loss": 0.4768,
"mean_token_accuracy": 0.9010340601205826,
"step": 195,
"train/kl_loss_qwen": 0.027825326565653084,
"train/kl_loss_r1": 0.01221497980877757,
"train/total_kl": 0.04004030600190163
},
{
"epoch": 0.24883359253499224,
"grad_norm": 2.515625,
"learning_rate": 2.813200498132005e-05,
"loss": 0.464,
"mean_token_accuracy": 0.8969788819551467,
"step": 200,
"train/kl_loss_qwen": 0.02236967678181827,
"train/kl_loss_r1": 0.011131012113764882,
"train/total_kl": 0.03350068908184767
},
{
"epoch": 0.25505443234836706,
"grad_norm": 2.484375,
"learning_rate": 2.808530510585305e-05,
"loss": 0.4246,
"mean_token_accuracy": 0.9050369083881378,
"step": 205,
"train/kl_loss_qwen": 0.0205402294639498,
"train/kl_loss_r1": 0.009700670512393117,
"train/total_kl": 0.030240900162607432
},
{
"epoch": 0.26127527216174184,
"grad_norm": 2.3125,
"learning_rate": 2.8038605230386053e-05,
"loss": 0.4422,
"mean_token_accuracy": 0.90710708796978,
"step": 210,
"train/kl_loss_qwen": 0.02467436045408249,
"train/kl_loss_r1": 0.011160785856191069,
"train/total_kl": 0.03583514606580138
},
{
"epoch": 0.26749611197511663,
"grad_norm": 3.40625,
"learning_rate": 2.7991905354919052e-05,
"loss": 0.4912,
"mean_token_accuracy": 0.9063985139131546,
"step": 215,
"train/kl_loss_qwen": 0.03254157407209277,
"train/kl_loss_r1": 0.014230213570408523,
"train/total_kl": 0.04677178747951984
},
{
"epoch": 0.2737169517884914,
"grad_norm": 2.078125,
"learning_rate": 2.7945205479452054e-05,
"loss": 0.4077,
"mean_token_accuracy": 0.9085961043834686,
"step": 220,
"train/kl_loss_qwen": 0.019017737498506902,
"train/kl_loss_r1": 0.008564504305832088,
"train/total_kl": 0.027582241501659156
},
{
"epoch": 0.27993779160186627,
"grad_norm": 2.609375,
"learning_rate": 2.7898505603985057e-05,
"loss": 0.4285,
"mean_token_accuracy": 0.9006385743618012,
"step": 225,
"train/kl_loss_qwen": 0.020106442319229246,
"train/kl_loss_r1": 0.008756639622151851,
"train/total_kl": 0.028863081801682712
},
{
"epoch": 0.28615863141524106,
"grad_norm": 2.5625,
"learning_rate": 2.785180572851806e-05,
"loss": 0.4375,
"mean_token_accuracy": 0.9008216232061386,
"step": 230,
"train/kl_loss_qwen": 0.021523965429514645,
"train/kl_loss_r1": 0.008759856573306024,
"train/total_kl": 0.03028382211923599
},
{
"epoch": 0.29237947122861585,
"grad_norm": 2.578125,
"learning_rate": 2.780510585305106e-05,
"loss": 0.4448,
"mean_token_accuracy": 0.9039193242788315,
"step": 235,
"train/kl_loss_qwen": 0.02277344111353159,
"train/kl_loss_r1": 0.01099874887149781,
"train/total_kl": 0.03377219010144472
},
{
"epoch": 0.2986003110419907,
"grad_norm": 2.609375,
"learning_rate": 2.775840597758406e-05,
"loss": 0.4399,
"mean_token_accuracy": 0.8983087122440339,
"step": 240,
"train/kl_loss_qwen": 0.020881993137300013,
"train/kl_loss_r1": 0.009922460105735808,
"train/total_kl": 0.03080445323139429
},
{
"epoch": 0.3048211508553655,
"grad_norm": 2.796875,
"learning_rate": 2.7711706102117063e-05,
"loss": 0.417,
"mean_token_accuracy": 0.9045127362012864,
"step": 245,
"train/kl_loss_qwen": 0.020143334427848457,
"train/kl_loss_r1": 0.008726878045126795,
"train/total_kl": 0.02887021256610751
},
{
"epoch": 0.3110419906687403,
"grad_norm": 2.3125,
"learning_rate": 2.7665006226650062e-05,
"loss": 0.4208,
"mean_token_accuracy": 0.9110885441303254,
"step": 250,
"train/kl_loss_qwen": 0.021725011849775912,
"train/kl_loss_r1": 0.012001089472323655,
"train/total_kl": 0.03372610127553344
},
{
"epoch": 0.31726283048211507,
"grad_norm": 2.46875,
"learning_rate": 2.7618306351183064e-05,
"loss": 0.4402,
"mean_token_accuracy": 0.9017707496881485,
"step": 255,
"train/kl_loss_qwen": 0.022058865614235403,
"train/kl_loss_r1": 0.010667199129238724,
"train/total_kl": 0.032726064510643485
},
{
"epoch": 0.3234836702954899,
"grad_norm": 2.265625,
"learning_rate": 2.7571606475716067e-05,
"loss": 0.4254,
"mean_token_accuracy": 0.9135203003883362,
"step": 260,
"train/kl_loss_qwen": 0.025819759676232935,
"train/kl_loss_r1": 0.012692330474965274,
"train/total_kl": 0.0385120902210474
},
{
"epoch": 0.3297045101088647,
"grad_norm": 2.78125,
"learning_rate": 2.7524906600249066e-05,
"loss": 0.4498,
"mean_token_accuracy": 0.9065485000610352,
"step": 265,
"train/kl_loss_qwen": 0.02562568709254265,
"train/kl_loss_r1": 0.012835084449034185,
"train/total_kl": 0.03846077108755708
},
{
"epoch": 0.3359253499222395,
"grad_norm": 3.4375,
"learning_rate": 2.7478206724782068e-05,
"loss": 0.4544,
"mean_token_accuracy": 0.8968957453966141,
"step": 270,
"train/kl_loss_qwen": 0.020935205090790988,
"train/kl_loss_r1": 0.011926196550484746,
"train/total_kl": 0.03286140169948339
},
{
"epoch": 0.3421461897356143,
"grad_norm": 2.59375,
"learning_rate": 2.743150684931507e-05,
"loss": 0.4695,
"mean_token_accuracy": 0.895763835310936,
"step": 275,
"train/kl_loss_qwen": 0.024620278738439083,
"train/kl_loss_r1": 0.00964386686682701,
"train/total_kl": 0.0342641456052661
},
{
"epoch": 0.3483670295489891,
"grad_norm": 3.546875,
"learning_rate": 2.738480697384807e-05,
"loss": 0.4383,
"mean_token_accuracy": 0.9082347899675369,
"step": 280,
"train/kl_loss_qwen": 0.022315250197425484,
"train/kl_loss_r1": 0.014057450694963336,
"train/total_kl": 0.036372700985521075
},
{
"epoch": 0.3545878693623639,
"grad_norm": 2.296875,
"learning_rate": 2.7338107098381072e-05,
"loss": 0.4469,
"mean_token_accuracy": 0.9045476704835892,
"step": 285,
"train/kl_loss_qwen": 0.023055148823186756,
"train/kl_loss_r1": 0.009570301149506123,
"train/total_kl": 0.03262544954195619
},
{
"epoch": 0.3608087091757387,
"grad_norm": 2.421875,
"learning_rate": 2.729140722291407e-05,
"loss": 0.442,
"mean_token_accuracy": 0.9033053010702133,
"step": 290,
"train/kl_loss_qwen": 0.022126297745853663,
"train/kl_loss_r1": 0.012546762591227889,
"train/total_kl": 0.034673060104250905
},
{
"epoch": 0.36702954898911355,
"grad_norm": 2.390625,
"learning_rate": 2.7244707347447073e-05,
"loss": 0.4162,
"mean_token_accuracy": 0.9015816122293472,
"step": 295,
"train/kl_loss_qwen": 0.02032669628970325,
"train/kl_loss_r1": 0.007502669095993042,
"train/total_kl": 0.027829365665093066
},
{
"epoch": 0.37325038880248834,
"grad_norm": 2.390625,
"learning_rate": 2.7198007471980076e-05,
"loss": 0.4248,
"mean_token_accuracy": 0.9025011241436005,
"step": 300,
"train/kl_loss_qwen": 0.0200017383787781,
"train/kl_loss_r1": 0.009314235928468407,
"train/total_kl": 0.029315974470227955
},
{
"epoch": 0.37947122861586313,
"grad_norm": 2.265625,
"learning_rate": 2.7151307596513075e-05,
"loss": 0.4476,
"mean_token_accuracy": 0.8975890159606934,
"step": 305,
"train/kl_loss_qwen": 0.021518654003739358,
"train/kl_loss_r1": 0.010331802139990031,
"train/total_kl": 0.03185045635327697
},
{
"epoch": 0.3856920684292379,
"grad_norm": 2.984375,
"learning_rate": 2.7104607721046077e-05,
"loss": 0.473,
"mean_token_accuracy": 0.9017946988344192,
"step": 310,
"train/kl_loss_qwen": 0.028143000835552812,
"train/kl_loss_r1": 0.01120884264819324,
"train/total_kl": 0.039351843390613796
},
{
"epoch": 0.39191290824261277,
"grad_norm": 2.234375,
"learning_rate": 2.705790784557908e-05,
"loss": 0.3974,
"mean_token_accuracy": 0.9137770593166351,
"step": 315,
"train/kl_loss_qwen": 0.02027838435024023,
"train/kl_loss_r1": 0.009311219793744385,
"train/total_kl": 0.029589604306966066
},
{
"epoch": 0.39813374805598756,
"grad_norm": 2.546875,
"learning_rate": 2.701120797011208e-05,
"loss": 0.438,
"mean_token_accuracy": 0.9064665764570237,
"step": 320,
"train/kl_loss_qwen": 0.022875147871673107,
"train/kl_loss_r1": 0.010096224106382579,
"train/total_kl": 0.0329713718034327
},
{
"epoch": 0.40435458786936235,
"grad_norm": 2.578125,
"learning_rate": 2.6964508094645084e-05,
"loss": 0.4148,
"mean_token_accuracy": 0.9041642516851425,
"step": 325,
"train/kl_loss_qwen": 0.02039993805810809,
"train/kl_loss_r1": 0.009322560648433864,
"train/total_kl": 0.02972249872982502
},
{
"epoch": 0.4105754276827372,
"grad_norm": 3.15625,
"learning_rate": 2.6917808219178083e-05,
"loss": 0.4599,
"mean_token_accuracy": 0.8985224097967148,
"step": 330,
"train/kl_loss_qwen": 0.023622136563062668,
"train/kl_loss_r1": 0.010554712312296034,
"train/total_kl": 0.03417684901505709
},
{
"epoch": 0.416796267496112,
"grad_norm": 2.53125,
"learning_rate": 2.6871108343711085e-05,
"loss": 0.4479,
"mean_token_accuracy": 0.9001316875219345,
"step": 335,
"train/kl_loss_qwen": 0.023164877016097308,
"train/kl_loss_r1": 0.01062884961720556,
"train/total_kl": 0.03379372642375529
},
{
"epoch": 0.4230171073094868,
"grad_norm": 2.3125,
"learning_rate": 2.6824408468244084e-05,
"loss": 0.4349,
"mean_token_accuracy": 0.8997949302196503,
"step": 340,
"train/kl_loss_qwen": 0.020284941466525198,
"train/kl_loss_r1": 0.008697902620770036,
"train/total_kl": 0.028982843924313783
},
{
"epoch": 0.42923794712286156,
"grad_norm": 2.484375,
"learning_rate": 2.6777708592777087e-05,
"loss": 0.4183,
"mean_token_accuracy": 0.9043066084384919,
"step": 345,
"train/kl_loss_qwen": 0.020022868039086462,
"train/kl_loss_r1": 0.009400142775848507,
"train/total_kl": 0.02942301072180271
},
{
"epoch": 0.4354587869362364,
"grad_norm": 2.265625,
"learning_rate": 2.673100871731009e-05,
"loss": 0.4479,
"mean_token_accuracy": 0.9017944246530533,
"step": 350,
"train/kl_loss_qwen": 0.02255958765745163,
"train/kl_loss_r1": 0.011340912338346243,
"train/total_kl": 0.033900499902665616
},
{
"epoch": 0.4416796267496112,
"grad_norm": 2.515625,
"learning_rate": 2.6684308841843088e-05,
"loss": 0.5377,
"mean_token_accuracy": 0.9042023122310638,
"step": 355,
"train/kl_loss_qwen": 0.03636851399205625,
"train/kl_loss_r1": 0.018854469433426856,
"train/total_kl": 0.055222983751446006
},
{
"epoch": 0.447900466562986,
"grad_norm": 2.234375,
"learning_rate": 2.663760896637609e-05,
"loss": 0.4614,
"mean_token_accuracy": 0.9028053224086762,
"step": 360,
"train/kl_loss_qwen": 0.027840341813862322,
"train/kl_loss_r1": 0.012210264848545194,
"train/total_kl": 0.040050606802105905
},
{
"epoch": 0.45412130637636083,
"grad_norm": 2.21875,
"learning_rate": 2.6590909090909093e-05,
"loss": 0.4881,
"mean_token_accuracy": 0.9026069700717926,
"step": 365,
"train/kl_loss_qwen": 0.0276740618981421,
"train/kl_loss_r1": 0.014049774222075938,
"train/total_kl": 0.04172383584082127
},
{
"epoch": 0.4603421461897356,
"grad_norm": 2.59375,
"learning_rate": 2.6544209215442092e-05,
"loss": 0.5749,
"mean_token_accuracy": 0.9026127278804779,
"step": 370,
"train/kl_loss_qwen": 0.04495285819284618,
"train/kl_loss_r1": 0.020119147619698196,
"train/total_kl": 0.06507200542837381
},
{
"epoch": 0.4665629860031104,
"grad_norm": 2.484375,
"learning_rate": 2.6497509339975094e-05,
"loss": 0.4118,
"mean_token_accuracy": 0.9034813940525055,
"step": 375,
"train/kl_loss_qwen": 0.017691825143992902,
"train/kl_loss_r1": 0.008957023778930307,
"train/total_kl": 0.02664884882979095
},
{
"epoch": 0.4727838258164852,
"grad_norm": 2.515625,
"learning_rate": 2.6450809464508093e-05,
"loss": 0.4096,
"mean_token_accuracy": 0.910720819234848,
"step": 380,
"train/kl_loss_qwen": 0.02144034132361412,
"train/kl_loss_r1": 0.010176640888676047,
"train/total_kl": 0.03161698216572404
},
{
"epoch": 0.47900466562986005,
"grad_norm": 2.171875,
"learning_rate": 2.6404109589041096e-05,
"loss": 0.4332,
"mean_token_accuracy": 0.9097962707281113,
"step": 385,
"train/kl_loss_qwen": 0.026963545754551888,
"train/kl_loss_r1": 0.012227852316573262,
"train/total_kl": 0.03919139839708805
},
{
"epoch": 0.48522550544323484,
"grad_norm": 2.5625,
"learning_rate": 2.6357409713574098e-05,
"loss": 0.4293,
"mean_token_accuracy": 0.910787695646286,
"step": 390,
"train/kl_loss_qwen": 0.02452428713440895,
"train/kl_loss_r1": 0.011624911101534963,
"train/total_kl": 0.03614919856190681
},
{
"epoch": 0.49144634525660963,
"grad_norm": 2.625,
"learning_rate": 2.6310709838107097e-05,
"loss": 0.4018,
"mean_token_accuracy": 0.9127192169427871,
"step": 395,
"train/kl_loss_qwen": 0.019982953229919075,
"train/kl_loss_r1": 0.009762761346064509,
"train/total_kl": 0.029745714645832776
},
{
"epoch": 0.4976671850699845,
"grad_norm": 2.21875,
"learning_rate": 2.62640099626401e-05,
"loss": 0.4309,
"mean_token_accuracy": 0.9098518759012222,
"step": 400,
"train/kl_loss_qwen": 0.024961045105010272,
"train/kl_loss_r1": 0.011534130433574319,
"train/total_kl": 0.03649517530575395
},
{
"epoch": 0.5038880248833593,
"grad_norm": 2.125,
"learning_rate": 2.6217310087173102e-05,
"loss": 0.3924,
"mean_token_accuracy": 0.9169116854667664,
"step": 405,
"train/kl_loss_qwen": 0.021090314723551273,
"train/kl_loss_r1": 0.010099838604219258,
"train/total_kl": 0.031190153490751982
},
{
"epoch": 0.5101088646967341,
"grad_norm": 2.765625,
"learning_rate": 2.6170610211706104e-05,
"loss": 0.4122,
"mean_token_accuracy": 0.9040325850248336,
"step": 410,
"train/kl_loss_qwen": 0.01960067362524569,
"train/kl_loss_r1": 0.008205437916330993,
"train/total_kl": 0.027806111704558135
},
{
"epoch": 0.5163297045101088,
"grad_norm": 2.28125,
"learning_rate": 2.6123910336239106e-05,
"loss": 0.3899,
"mean_token_accuracy": 0.9136340916156769,
"step": 415,
"train/kl_loss_qwen": 0.019829964730888605,
"train/kl_loss_r1": 0.009041843877639621,
"train/total_kl": 0.028871809039264916
},
{
"epoch": 0.5225505443234837,
"grad_norm": 2.6875,
"learning_rate": 2.6077210460772105e-05,
"loss": 0.4553,
"mean_token_accuracy": 0.9060747653245926,
"step": 420,
"train/kl_loss_qwen": 0.02692516231909394,
"train/kl_loss_r1": 0.013944354082923383,
"train/total_kl": 0.0408695163205266
},
{
"epoch": 0.5287713841368584,
"grad_norm": 2.0625,
"learning_rate": 2.6030510585305108e-05,
"loss": 0.414,
"mean_token_accuracy": 0.9070446848869324,
"step": 425,
"train/kl_loss_qwen": 0.020327215222641824,
"train/kl_loss_r1": 0.009817754128016531,
"train/total_kl": 0.030144969280809165
},
{
"epoch": 0.5349922239502333,
"grad_norm": 2.203125,
"learning_rate": 2.5983810709838107e-05,
"loss": 0.4792,
"mean_token_accuracy": 0.9056743770837784,
"step": 430,
"train/kl_loss_qwen": 0.029629909666255116,
"train/kl_loss_r1": 0.01435271161608398,
"train/total_kl": 0.043982621002942326
},
{
"epoch": 0.5412130637636081,
"grad_norm": 2.828125,
"learning_rate": 2.593711083437111e-05,
"loss": 0.4092,
"mean_token_accuracy": 0.9107071310281754,
"step": 435,
"train/kl_loss_qwen": 0.02214355799369514,
"train/kl_loss_r1": 0.010212240810506045,
"train/total_kl": 0.03235579859465361
},
{
"epoch": 0.5474339035769828,
"grad_norm": 2.515625,
"learning_rate": 2.589041095890411e-05,
"loss": 0.4217,
"mean_token_accuracy": 0.9096204102039337,
"step": 440,
"train/kl_loss_qwen": 0.02451937450096011,
"train/kl_loss_r1": 0.010314402729272842,
"train/total_kl": 0.03483377709053457
},
{
"epoch": 0.5536547433903577,
"grad_norm": 2.234375,
"learning_rate": 2.584371108343711e-05,
"loss": 0.511,
"mean_token_accuracy": 0.9087847948074341,
"step": 445,
"train/kl_loss_qwen": 0.03897065857890993,
"train/kl_loss_r1": 0.013747443165630101,
"train/total_kl": 0.052718101628124715
},
{
"epoch": 0.5598755832037325,
"grad_norm": 2.546875,
"learning_rate": 2.5797011207970113e-05,
"loss": 0.4145,
"mean_token_accuracy": 0.9128732204437255,
"step": 450,
"train/kl_loss_qwen": 0.02431764816865325,
"train/kl_loss_r1": 0.010849157627671958,
"train/total_kl": 0.03516680607572198
},
{
"epoch": 0.5660964230171073,
"grad_norm": 2.75,
"learning_rate": 2.5750311332503115e-05,
"loss": 0.4282,
"mean_token_accuracy": 0.9059774994850158,
"step": 455,
"train/kl_loss_qwen": 0.022139727883040906,
"train/kl_loss_r1": 0.011035876907408237,
"train/total_kl": 0.03317560441792011
},
{
"epoch": 0.5723172628304821,
"grad_norm": 2.359375,
"learning_rate": 2.5703611457036114e-05,
"loss": 0.4504,
"mean_token_accuracy": 0.8980892598628998,
"step": 460,
"train/kl_loss_qwen": 0.020996935572475194,
"train/kl_loss_r1": 0.011420201789587737,
"train/total_kl": 0.032417137362062934
},
{
"epoch": 0.578538102643857,
"grad_norm": 2.421875,
"learning_rate": 2.5656911581569117e-05,
"loss": 0.4246,
"mean_token_accuracy": 0.9115836918354034,
"step": 465,
"train/kl_loss_qwen": 0.025193213764578105,
"train/kl_loss_r1": 0.012585591687820852,
"train/total_kl": 0.0377788052894175
},
{
"epoch": 0.5847589424572317,
"grad_norm": 2.53125,
"learning_rate": 2.5610211706102116e-05,
"loss": 0.4263,
"mean_token_accuracy": 0.9069680899381638,
"step": 470,
"train/kl_loss_qwen": 0.02035662648268044,
"train/kl_loss_r1": 0.010218093637377024,
"train/total_kl": 0.03057471993379295
},
{
"epoch": 0.5909797822706065,
"grad_norm": 2.40625,
"learning_rate": 2.5563511830635118e-05,
"loss": 0.414,
"mean_token_accuracy": 0.9063103586435318,
"step": 475,
"train/kl_loss_qwen": 0.020925334934145213,
"train/kl_loss_r1": 0.009019026858732104,
"train/total_kl": 0.029944361280649902
},
{
"epoch": 0.5972006220839814,
"grad_norm": 2.078125,
"learning_rate": 2.551681195516812e-05,
"loss": 0.4135,
"mean_token_accuracy": 0.9108444273471832,
"step": 480,
"train/kl_loss_qwen": 0.0211629044264555,
"train/kl_loss_r1": 0.009259478491730987,
"train/total_kl": 0.03042238261550665
},
{
"epoch": 0.6034214618973561,
"grad_norm": 2.8125,
"learning_rate": 2.547011207970112e-05,
"loss": 0.4338,
"mean_token_accuracy": 0.899581903219223,
"step": 485,
"train/kl_loss_qwen": 0.02072710790671408,
"train/kl_loss_r1": 0.010435436002444476,
"train/total_kl": 0.03116254387423396
},
{
"epoch": 0.609642301710731,
"grad_norm": 2.484375,
"learning_rate": 2.5423412204234122e-05,
"loss": 0.5159,
"mean_token_accuracy": 0.9059219062328339,
"step": 490,
"train/kl_loss_qwen": 0.03367695207707584,
"train/kl_loss_r1": 0.018230854975990952,
"train/total_kl": 0.05190780712291598
},
{
"epoch": 0.6158631415241057,
"grad_norm": 2.734375,
"learning_rate": 2.5376712328767124e-05,
"loss": 0.5261,
"mean_token_accuracy": 0.9024108290672302,
"step": 495,
"train/kl_loss_qwen": 0.03762428821064532,
"train/kl_loss_r1": 0.014978185016661882,
"train/total_kl": 0.05260247401893139
},
{
"epoch": 0.6220839813374806,
"grad_norm": 2.3125,
"learning_rate": 2.5330012453300127e-05,
"loss": 0.4235,
"mean_token_accuracy": 0.9005639761686325,
"step": 500,
"train/kl_loss_qwen": 0.01958498265594244,
"train/kl_loss_r1": 0.009812347800470888,
"train/total_kl": 0.029397330433130264
},
{
"epoch": 0.6283048211508554,
"grad_norm": 2.1875,
"learning_rate": 2.528331257783313e-05,
"loss": 0.4486,
"mean_token_accuracy": 0.9037535905838012,
"step": 505,
"train/kl_loss_qwen": 0.024349090829491615,
"train/kl_loss_r1": 0.01013639271259308,
"train/total_kl": 0.034485483448952435
},
{
"epoch": 0.6345256609642301,
"grad_norm": 2.359375,
"learning_rate": 2.5236612702366128e-05,
"loss": 0.4169,
"mean_token_accuracy": 0.909102076292038,
"step": 510,
"train/kl_loss_qwen": 0.021461383812129496,
"train/kl_loss_r1": 0.00960217888932675,
"train/total_kl": 0.03106356244534254
},
{
"epoch": 0.640746500777605,
"grad_norm": 2.078125,
"learning_rate": 2.518991282689913e-05,
"loss": 0.5199,
"mean_token_accuracy": 0.9052909880876541,
"step": 515,
"train/kl_loss_qwen": 0.04063015528954565,
"train/kl_loss_r1": 0.012601481808815151,
"train/total_kl": 0.05323163778521121
},
{
"epoch": 0.6469673405909798,
"grad_norm": 2.546875,
"learning_rate": 2.514321295143213e-05,
"loss": 0.4219,
"mean_token_accuracy": 0.9009439706802368,
"step": 520,
"train/kl_loss_qwen": 0.022013092087581752,
"train/kl_loss_r1": 0.009523639199323952,
"train/total_kl": 0.03153673121705651
},
{
"epoch": 0.6531881804043546,
"grad_norm": 2.453125,
"learning_rate": 2.509651307596513e-05,
"loss": 0.3976,
"mean_token_accuracy": 0.9118671506643296,
"step": 525,
"train/kl_loss_qwen": 0.020429779263213276,
"train/kl_loss_r1": 0.009877034788951277,
"train/total_kl": 0.030306814052164555
},
{
"epoch": 0.6594090202177294,
"grad_norm": 2.71875,
"learning_rate": 2.5049813200498134e-05,
"loss": 0.4137,
"mean_token_accuracy": 0.9093097120523452,
"step": 530,
"train/kl_loss_qwen": 0.02071451968513429,
"train/kl_loss_r1": 0.010642997454851866,
"train/total_kl": 0.03135751727968454
},
{
"epoch": 0.6656298600311042,
"grad_norm": 2.21875,
"learning_rate": 2.5003113325031133e-05,
"loss": 0.4233,
"mean_token_accuracy": 0.9019553482532501,
"step": 535,
"train/kl_loss_qwen": 0.018656383082270623,
"train/kl_loss_r1": 0.00829046352300793,
"train/total_kl": 0.026946846721693875
},
{
"epoch": 0.671850699844479,
"grad_norm": 2.671875,
"learning_rate": 2.4956413449564135e-05,
"loss": 0.4466,
"mean_token_accuracy": 0.9081733852624894,
"step": 540,
"train/kl_loss_qwen": 0.02441343287937343,
"train/kl_loss_r1": 0.014263224578462541,
"train/total_kl": 0.03867665748111904
},
{
"epoch": 0.6780715396578538,
"grad_norm": 2.75,
"learning_rate": 2.4909713574097134e-05,
"loss": 0.4312,
"mean_token_accuracy": 0.9087280422449112,
"step": 545,
"train/kl_loss_qwen": 0.024243433307856322,
"train/kl_loss_r1": 0.01274189695250243,
"train/total_kl": 0.036985330190509556
},
{
"epoch": 0.6842923794712286,
"grad_norm": 2.15625,
"learning_rate": 2.4863013698630137e-05,
"loss": 0.4367,
"mean_token_accuracy": 0.9086010038852692,
"step": 550,
"train/kl_loss_qwen": 0.02496406654827297,
"train/kl_loss_r1": 0.012116139847785234,
"train/total_kl": 0.03708020634949207
},
{
"epoch": 0.6905132192846034,
"grad_norm": 2.390625,
"learning_rate": 2.481631382316314e-05,
"loss": 0.4226,
"mean_token_accuracy": 0.90582574903965,
"step": 555,
"train/kl_loss_qwen": 0.022924260469153523,
"train/kl_loss_r1": 0.010547170951031148,
"train/total_kl": 0.033471431396901605
},
{
"epoch": 0.6967340590979783,
"grad_norm": 2.0625,
"learning_rate": 2.4769613947696138e-05,
"loss": 0.436,
"mean_token_accuracy": 0.9055513799190521,
"step": 560,
"train/kl_loss_qwen": 0.022723140241578222,
"train/kl_loss_r1": 0.010732360580004752,
"train/total_kl": 0.03345550089143216
},
{
"epoch": 0.702954898911353,
"grad_norm": 2.328125,
"learning_rate": 2.472291407222914e-05,
"loss": 0.4205,
"mean_token_accuracy": 0.9103393256664276,
"step": 565,
"train/kl_loss_qwen": 0.022250397596508265,
"train/kl_loss_r1": 0.010711905942298473,
"train/total_kl": 0.03296230314299464
},
{
"epoch": 0.7091757387247278,
"grad_norm": 2.40625,
"learning_rate": 2.4676214196762143e-05,
"loss": 0.4279,
"mean_token_accuracy": 0.9037681072950363,
"step": 570,
"train/kl_loss_qwen": 0.02226592218503356,
"train/kl_loss_r1": 0.011035812250338495,
"train/total_kl": 0.03330173455178738
},
{
"epoch": 0.7153965785381027,
"grad_norm": 2.3125,
"learning_rate": 2.4629514321295142e-05,
"loss": 0.4242,
"mean_token_accuracy": 0.9072872966527938,
"step": 575,
"train/kl_loss_qwen": 0.023182417685166,
"train/kl_loss_r1": 0.01031209627399221,
"train/total_kl": 0.03349451422691345
},
{
"epoch": 0.7216174183514774,
"grad_norm": 2.65625,
"learning_rate": 2.4582814445828148e-05,
"loss": 0.4304,
"mean_token_accuracy": 0.9093700498342514,
"step": 580,
"train/kl_loss_qwen": 0.022953651519492267,
"train/kl_loss_r1": 0.012493736506439746,
"train/total_kl": 0.03544738814234734
},
{
"epoch": 0.7278382581648523,
"grad_norm": 2.34375,
"learning_rate": 2.4536114570361147e-05,
"loss": 0.4096,
"mean_token_accuracy": 0.9129402995109558,
"step": 585,
"train/kl_loss_qwen": 0.022961481800302865,
"train/kl_loss_r1": 0.01040629018098116,
"train/total_kl": 0.03336777174845338
},
{
"epoch": 0.7340590979782271,
"grad_norm": 2.1875,
"learning_rate": 2.448941469489415e-05,
"loss": 0.3991,
"mean_token_accuracy": 0.914150008559227,
"step": 590,
"train/kl_loss_qwen": 0.022263350780121982,
"train/kl_loss_r1": 0.011094499076716603,
"train/total_kl": 0.03335785013623536
},
{
"epoch": 0.7402799377916018,
"grad_norm": 2.234375,
"learning_rate": 2.444271481942715e-05,
"loss": 0.4076,
"mean_token_accuracy": 0.9096796810626984,
"step": 595,
"train/kl_loss_qwen": 0.020499514462426306,
"train/kl_loss_r1": 0.009279927227180452,
"train/total_kl": 0.02977944165468216
},
{
"epoch": 0.7465007776049767,
"grad_norm": 2.65625,
"learning_rate": 2.439601494396015e-05,
"loss": 0.4216,
"mean_token_accuracy": 0.9014455765485764,
"step": 600,
"train/kl_loss_qwen": 0.018622068548575045,
"train/kl_loss_r1": 0.009365804423578084,
"train/total_kl": 0.027987872809171678
},
{
"epoch": 0.7527216174183515,
"grad_norm": 2.296875,
"learning_rate": 2.4349315068493153e-05,
"loss": 0.3906,
"mean_token_accuracy": 0.9145099073648453,
"step": 605,
"train/kl_loss_qwen": 0.019467818038538098,
"train/kl_loss_r1": 0.008078851248137653,
"train/total_kl": 0.02754666917026043
},
{
"epoch": 0.7589424572317263,
"grad_norm": 2.515625,
"learning_rate": 2.4302615193026152e-05,
"loss": 0.3987,
"mean_token_accuracy": 0.9153716772794723,
"step": 610,
"train/kl_loss_qwen": 0.022999429237097503,
"train/kl_loss_r1": 0.00981712534558028,
"train/total_kl": 0.03281655451282859
},
{
"epoch": 0.7651632970451011,
"grad_norm": 2.703125,
"learning_rate": 2.4255915317559154e-05,
"loss": 0.3885,
"mean_token_accuracy": 0.913951313495636,
"step": 615,
"train/kl_loss_qwen": 0.01929868240840733,
"train/kl_loss_r1": 0.009192716074176132,
"train/total_kl": 0.0284913981333375
},
{
"epoch": 0.7713841368584758,
"grad_norm": 2.515625,
"learning_rate": 2.4209215442092156e-05,
"loss": 0.438,
"mean_token_accuracy": 0.9032023847103119,
"step": 620,
"train/kl_loss_qwen": 0.02276699091307819,
"train/kl_loss_r1": 0.010404858528636396,
"train/total_kl": 0.03317184979096055
},
{
"epoch": 0.7776049766718507,
"grad_norm": 2.75,
"learning_rate": 2.4162515566625155e-05,
"loss": 0.4249,
"mean_token_accuracy": 0.901955908536911,
"step": 625,
"train/kl_loss_qwen": 0.022086183354258538,
"train/kl_loss_r1": 0.010839143022894859,
"train/total_kl": 0.03292532628402114
},
{
"epoch": 0.7838258164852255,
"grad_norm": 2.421875,
"learning_rate": 2.4115815691158158e-05,
"loss": 0.4441,
"mean_token_accuracy": 0.9012407660484314,
"step": 630,
"train/kl_loss_qwen": 0.021360087487846614,
"train/kl_loss_r1": 0.010610865615308284,
"train/total_kl": 0.0319709531031549
},
{
"epoch": 0.7900466562986003,
"grad_norm": 2.15625,
"learning_rate": 2.4069115815691157e-05,
"loss": 0.4119,
"mean_token_accuracy": 0.9116487741470337,
"step": 635,
"train/kl_loss_qwen": 0.02234299052506685,
"train/kl_loss_r1": 0.010703041870146989,
"train/total_kl": 0.033046032395213844
},
{
"epoch": 0.7962674961119751,
"grad_norm": 2.15625,
"learning_rate": 2.402241594022416e-05,
"loss": 0.3923,
"mean_token_accuracy": 0.9124638080596924,
"step": 640,
"train/kl_loss_qwen": 0.02015606495551765,
"train/kl_loss_r1": 0.008730803325306624,
"train/total_kl": 0.02888686824589968
},
{
"epoch": 0.80248833592535,
"grad_norm": 2.5625,
"learning_rate": 2.397571606475716e-05,
"loss": 0.4379,
"mean_token_accuracy": 0.9059850156307221,
"step": 645,
"train/kl_loss_qwen": 0.024274708051234484,
"train/kl_loss_r1": 0.013806939870119096,
"train/total_kl": 0.0380816476419568
},
{
"epoch": 0.8087091757387247,
"grad_norm": 2.484375,
"learning_rate": 2.392901618929016e-05,
"loss": 0.4658,
"mean_token_accuracy": 0.903114652633667,
"step": 650,
"train/kl_loss_qwen": 0.02699953648261726,
"train/kl_loss_r1": 0.01478456505574286,
"train/total_kl": 0.04178410097956657
},
{
"epoch": 0.8149300155520995,
"grad_norm": 2.25,
"learning_rate": 2.3882316313823163e-05,
"loss": 0.4109,
"mean_token_accuracy": 0.9127248078584671,
"step": 655,
"train/kl_loss_qwen": 0.022482301201671363,
"train/kl_loss_r1": 0.011614846624433994,
"train/total_kl": 0.03409714791923761
},
{
"epoch": 0.8211508553654744,
"grad_norm": 3.03125,
"learning_rate": 2.3835616438356165e-05,
"loss": 0.4755,
"mean_token_accuracy": 0.8993414014577865,
"step": 660,
"train/kl_loss_qwen": 0.02683520861901343,
"train/kl_loss_r1": 0.011668766860384493,
"train/total_kl": 0.03850397523492575
},
{
"epoch": 0.8273716951788491,
"grad_norm": 2.328125,
"learning_rate": 2.3788916562889164e-05,
"loss": 0.387,
"mean_token_accuracy": 0.9139132559299469,
"step": 665,
"train/kl_loss_qwen": 0.01782120973803103,
"train/kl_loss_r1": 0.007813481765333563,
"train/total_kl": 0.025634691584855318
},
{
"epoch": 0.833592534992224,
"grad_norm": 2.578125,
"learning_rate": 2.374221668742217e-05,
"loss": 0.4095,
"mean_token_accuracy": 0.911031749844551,
"step": 670,
"train/kl_loss_qwen": 0.02113759545609355,
"train/kl_loss_r1": 0.01039525493979454,
"train/total_kl": 0.03153285039588809
},
{
"epoch": 0.8398133748055988,
"grad_norm": 2.265625,
"learning_rate": 2.369551681195517e-05,
"loss": 0.4168,
"mean_token_accuracy": 0.9161271333694458,
"step": 675,
"train/kl_loss_qwen": 0.024909159727394582,
"train/kl_loss_r1": 0.011709271254949272,
"train/total_kl": 0.036618431005626915
},
{
"epoch": 0.8460342146189735,
"grad_norm": 2.46875,
"learning_rate": 2.364881693648817e-05,
"loss": 0.3758,
"mean_token_accuracy": 0.9198156714439392,
"step": 680,
"train/kl_loss_qwen": 0.021275783283635975,
"train/kl_loss_r1": 0.009512535692192615,
"train/total_kl": 0.03078831881284714
},
{
"epoch": 0.8522550544323484,
"grad_norm": 2.640625,
"learning_rate": 2.3602117061021174e-05,
"loss": 0.4299,
"mean_token_accuracy": 0.9063263684511185,
"step": 685,
"train/kl_loss_qwen": 0.021453795861452817,
"train/kl_loss_r1": 0.010479483660310507,
"train/total_kl": 0.03193327952176332
},
{
"epoch": 0.8584758942457231,
"grad_norm": 2.546875,
"learning_rate": 2.3555417185554173e-05,
"loss": 0.4041,
"mean_token_accuracy": 0.913576290011406,
"step": 690,
"train/kl_loss_qwen": 0.022580369981005786,
"train/kl_loss_r1": 0.010107158054597675,
"train/total_kl": 0.03268752777948976
},
{
"epoch": 0.864696734059098,
"grad_norm": 2.84375,
"learning_rate": 2.3508717310087175e-05,
"loss": 0.4291,
"mean_token_accuracy": 0.9059417158365249,
"step": 695,
"train/kl_loss_qwen": 0.022479857504367828,
"train/kl_loss_r1": 0.010261117829941213,
"train/total_kl": 0.03274097526445985
},
{
"epoch": 0.8709175738724728,
"grad_norm": 2.71875,
"learning_rate": 2.3462017434620174e-05,
"loss": 0.4494,
"mean_token_accuracy": 0.9059775233268738,
"step": 700,
"train/kl_loss_qwen": 0.027120739314705135,
"train/kl_loss_r1": 0.011393017042428255,
"train/total_kl": 0.03851375617086887
},
{
"epoch": 0.8771384136858476,
"grad_norm": 2.25,
"learning_rate": 2.3415317559153177e-05,
"loss": 0.407,
"mean_token_accuracy": 0.9145919442176819,
"step": 705,
"train/kl_loss_qwen": 0.021546046063303948,
"train/kl_loss_r1": 0.012116323586087673,
"train/total_kl": 0.03366236938163638
},
{
"epoch": 0.8833592534992224,
"grad_norm": 2.390625,
"learning_rate": 2.336861768368618e-05,
"loss": 0.4101,
"mean_token_accuracy": 0.9063404113054275,
"step": 710,
"train/kl_loss_qwen": 0.020995961781591178,
"train/kl_loss_r1": 0.008313580113463104,
"train/total_kl": 0.029309542011469604
},
{
"epoch": 0.8895800933125972,
"grad_norm": 3.0,
"learning_rate": 2.3321917808219178e-05,
"loss": 0.412,
"mean_token_accuracy": 0.9092709690332412,
"step": 715,
"train/kl_loss_qwen": 0.020147784356959166,
"train/kl_loss_r1": 0.01101614481303841,
"train/total_kl": 0.031163928750902414
},
{
"epoch": 0.895800933125972,
"grad_norm": 2.765625,
"learning_rate": 2.327521793275218e-05,
"loss": 0.4405,
"mean_token_accuracy": 0.9061545938253402,
"step": 720,
"train/kl_loss_qwen": 0.024695659801363946,
"train/kl_loss_r1": 0.011185528873465956,
"train/total_kl": 0.035881188977509734
},
{
"epoch": 0.9020217729393468,
"grad_norm": 2.15625,
"learning_rate": 2.322851805728518e-05,
"loss": 0.4035,
"mean_token_accuracy": 0.9125464528799057,
"step": 725,
"train/kl_loss_qwen": 0.02164424294605851,
"train/kl_loss_r1": 0.011241717310622335,
"train/total_kl": 0.03288596007041633
},
{
"epoch": 0.9082426127527217,
"grad_norm": 3.015625,
"learning_rate": 2.318181818181818e-05,
"loss": 0.4681,
"mean_token_accuracy": 0.9115902453660965,
"step": 730,
"train/kl_loss_qwen": 0.031023595342412592,
"train/kl_loss_r1": 0.013560534256976097,
"train/total_kl": 0.04458412951789796
},
{
"epoch": 0.9144634525660964,
"grad_norm": 2.46875,
"learning_rate": 2.3135118306351184e-05,
"loss": 0.5105,
"mean_token_accuracy": 0.9097710341215134,
"step": 735,
"train/kl_loss_qwen": 0.04099215737078339,
"train/kl_loss_r1": 0.015071367053315044,
"train/total_kl": 0.05606352426111698
},
{
"epoch": 0.9206842923794712,
"grad_norm": 2.5,
"learning_rate": 2.3088418430884183e-05,
"loss": 0.4504,
"mean_token_accuracy": 0.9054893583059311,
"step": 740,
"train/kl_loss_qwen": 0.026908464403823017,
"train/kl_loss_r1": 0.011770134512335061,
"train/total_kl": 0.038678599148988725
},
{
"epoch": 0.926905132192846,
"grad_norm": 2.234375,
"learning_rate": 2.3041718555417185e-05,
"loss": 0.41,
"mean_token_accuracy": 0.9051820576190949,
"step": 745,
"train/kl_loss_qwen": 0.018081901129335165,
"train/kl_loss_r1": 0.008661592192947865,
"train/total_kl": 0.026743493136018516
},
{
"epoch": 0.9331259720062208,
"grad_norm": 2.359375,
"learning_rate": 2.2995018679950184e-05,
"loss": 0.4378,
"mean_token_accuracy": 0.9121837258338928,
"step": 750,
"train/kl_loss_qwen": 0.027031197026371957,
"train/kl_loss_r1": 0.013320808461867274,
"train/total_kl": 0.04035200551152229
},
{
"epoch": 0.9393468118195957,
"grad_norm": 2.453125,
"learning_rate": 2.2948318804483187e-05,
"loss": 0.4181,
"mean_token_accuracy": 0.9081921458244324,
"step": 755,
"train/kl_loss_qwen": 0.021465251781046392,
"train/kl_loss_r1": 0.011396374832838774,
"train/total_kl": 0.032861626520752904
},
{
"epoch": 0.9455676516329704,
"grad_norm": 2.578125,
"learning_rate": 2.2901618929016193e-05,
"loss": 0.4726,
"mean_token_accuracy": 0.9009045392274857,
"step": 760,
"train/kl_loss_qwen": 0.02590537634678185,
"train/kl_loss_r1": 0.012987637892365456,
"train/total_kl": 0.03889301391318441
},
{
"epoch": 0.9517884914463453,
"grad_norm": 1.890625,
"learning_rate": 2.285491905354919e-05,
"loss": 0.3837,
"mean_token_accuracy": 0.9149051457643509,
"step": 765,
"train/kl_loss_qwen": 0.020421567978337406,
"train/kl_loss_r1": 0.009222430060617626,
"train/total_kl": 0.029643998201936483
},
{
"epoch": 0.9580093312597201,
"grad_norm": 2.234375,
"learning_rate": 2.2808219178082194e-05,
"loss": 0.4142,
"mean_token_accuracy": 0.910207200050354,
"step": 770,
"train/kl_loss_qwen": 0.02117032711394131,
"train/kl_loss_r1": 0.010742365522310138,
"train/total_kl": 0.031912692729383706
},
{
"epoch": 0.9642301710730948,
"grad_norm": 2.78125,
"learning_rate": 2.2761519302615196e-05,
"loss": 0.4285,
"mean_token_accuracy": 0.9055554062128067,
"step": 775,
"train/kl_loss_qwen": 0.022083445498719812,
"train/kl_loss_r1": 0.011104172887280583,
"train/total_kl": 0.03318761847913265
},
{
"epoch": 0.9704510108864697,
"grad_norm": 2.0625,
"learning_rate": 2.2714819427148195e-05,
"loss": 0.4154,
"mean_token_accuracy": 0.9221815407276154,
"step": 780,
"train/kl_loss_qwen": 0.028531118156388403,
"train/kl_loss_r1": 0.01254213583888486,
"train/total_kl": 0.041073253750801085
},
{
"epoch": 0.9766718506998445,
"grad_norm": 2.1875,
"learning_rate": 2.2668119551681198e-05,
"loss": 0.3951,
"mean_token_accuracy": 0.9119761139154434,
"step": 785,
"train/kl_loss_qwen": 0.020619897544384,
"train/kl_loss_r1": 0.009239812684245407,
"train/total_kl": 0.02985971048474312
},
{
"epoch": 0.9828926905132193,
"grad_norm": 57.75,
"learning_rate": 2.2621419676214197e-05,
"loss": 0.3857,
"mean_token_accuracy": 0.9099031835794449,
"step": 790,
"train/kl_loss_qwen": 0.018582486687228082,
"train/kl_loss_r1": 0.00894598305458203,
"train/total_kl": 0.027528469683602452
},
{
"epoch": 0.9891135303265941,
"grad_norm": 2.21875,
"learning_rate": 2.25747198007472e-05,
"loss": 0.4272,
"mean_token_accuracy": 0.9072646647691727,
"step": 795,
"train/kl_loss_qwen": 0.02253551883623004,
"train/kl_loss_r1": 0.010769509780220687,
"train/total_kl": 0.033305028639733794
},
{
"epoch": 0.995334370139969,
"grad_norm": 2.859375,
"learning_rate": 2.25280199252802e-05,
"loss": 0.5008,
"mean_token_accuracy": 0.9021875262260437,
"step": 800,
"train/kl_loss_qwen": 0.0319652761798352,
"train/kl_loss_r1": 0.012161148013547063,
"train/total_kl": 0.04412642428651452
},
{
"epoch": 1.00248833592535,
"grad_norm": 1.609375,
"learning_rate": 2.24813200498132e-05,
"loss": 0.4557,
"mean_token_accuracy": 0.9248083342205394,
"step": 805,
"train/kl_loss_qwen": 0.021597513886676592,
"train/kl_loss_r1": 0.013360376871952956,
"train/total_kl": 0.03495789039880037
},
{
"epoch": 1.0087091757387248,
"grad_norm": 1.4921875,
"learning_rate": 2.2434620174346203e-05,
"loss": 0.3201,
"mean_token_accuracy": 0.9592776656150818,
"step": 810,
"train/kl_loss_qwen": 0.026713818963617086,
"train/kl_loss_r1": 0.014814306050539017,
"train/total_kl": 0.041528125293552876
},
{
"epoch": 1.0149300155520995,
"grad_norm": 1.65625,
"learning_rate": 2.2387920298879202e-05,
"loss": 0.3216,
"mean_token_accuracy": 0.9562903255224228,
"step": 815,
"train/kl_loss_qwen": 0.0231754750944674,
"train/kl_loss_r1": 0.018418258568271995,
"train/total_kl": 0.041593733709305525
},
{
"epoch": 1.0211508553654742,
"grad_norm": 1.3046875,
"learning_rate": 2.2341220423412204e-05,
"loss": 0.2895,
"mean_token_accuracy": 0.9590234607458115,
"step": 820,
"train/kl_loss_qwen": 0.021737991878762842,
"train/kl_loss_r1": 0.013914320012554526,
"train/total_kl": 0.035652312077581884
},
{
"epoch": 1.0273716951788492,
"grad_norm": 1.890625,
"learning_rate": 2.2294520547945206e-05,
"loss": 0.3005,
"mean_token_accuracy": 0.9565304934978485,
"step": 825,
"train/kl_loss_qwen": 0.02263927822932601,
"train/kl_loss_r1": 0.012905962206423283,
"train/total_kl": 0.03554524062201381
},
{
"epoch": 1.033592534992224,
"grad_norm": 1.515625,
"learning_rate": 2.2247820672478205e-05,
"loss": 0.3013,
"mean_token_accuracy": 0.9635909259319305,
"step": 830,
"train/kl_loss_qwen": 0.024365014489740135,
"train/kl_loss_r1": 0.014652392477728426,
"train/total_kl": 0.03901740722358227
},
{
"epoch": 1.0398133748055987,
"grad_norm": 1.6796875,
"learning_rate": 2.2201120797011208e-05,
"loss": 0.316,
"mean_token_accuracy": 0.9590081989765167,
"step": 835,
"train/kl_loss_qwen": 0.023819171031937002,
"train/kl_loss_r1": 0.016059246635995804,
"train/total_kl": 0.03987841745838523
},
{
"epoch": 1.0460342146189736,
"grad_norm": 1.3828125,
"learning_rate": 2.2154420921544207e-05,
"loss": 0.3033,
"mean_token_accuracy": 0.9596952319145202,
"step": 840,
"train/kl_loss_qwen": 0.02370280809700489,
"train/kl_loss_r1": 0.014899721695110201,
"train/total_kl": 0.03860252983868122
},
{
"epoch": 1.0522550544323483,
"grad_norm": 1.234375,
"learning_rate": 2.210772104607721e-05,
"loss": 0.2822,
"mean_token_accuracy": 0.961972963809967,
"step": 845,
"train/kl_loss_qwen": 0.021481084870174527,
"train/kl_loss_r1": 0.01311062837485224,
"train/total_kl": 0.03459171336144209
},
{
"epoch": 1.058475894245723,
"grad_norm": 1.484375,
"learning_rate": 2.2061021170610215e-05,
"loss": 0.2895,
"mean_token_accuracy": 0.959705936908722,
"step": 850,
"train/kl_loss_qwen": 0.022235888708382844,
"train/kl_loss_r1": 0.013539392384700477,
"train/total_kl": 0.03577528093010187
},
{
"epoch": 1.064696734059098,
"grad_norm": 1.890625,
"learning_rate": 2.2014321295143214e-05,
"loss": 0.2909,
"mean_token_accuracy": 0.960792264342308,
"step": 855,
"train/kl_loss_qwen": 0.020066874427720906,
"train/kl_loss_r1": 0.014030058751814067,
"train/total_kl": 0.034096932876855134
},
{
"epoch": 1.0709175738724728,
"grad_norm": 1.6171875,
"learning_rate": 2.1967621419676216e-05,
"loss": 0.3042,
"mean_token_accuracy": 0.9614545047283173,
"step": 860,
"train/kl_loss_qwen": 0.023757481807842852,
"train/kl_loss_r1": 0.015206769714131952,
"train/total_kl": 0.03896425180137157
},
{
"epoch": 1.0771384136858475,
"grad_norm": 1.28125,
"learning_rate": 2.192092154420922e-05,
"loss": 0.3703,
"mean_token_accuracy": 0.955784410238266,
"step": 865,
"train/kl_loss_qwen": 0.03151101716794073,
"train/kl_loss_r1": 0.01914216240402311,
"train/total_kl": 0.050653179083019494
},
{
"epoch": 1.0833592534992225,
"grad_norm": 5.53125,
"learning_rate": 2.1874221668742218e-05,
"loss": 0.4169,
"mean_token_accuracy": 0.9540597677230835,
"step": 870,
"train/kl_loss_qwen": 0.03798724971711635,
"train/kl_loss_r1": 0.021596997044980526,
"train/total_kl": 0.05958424676209688
},
{
"epoch": 1.0895800933125972,
"grad_norm": 2.265625,
"learning_rate": 2.182752179327522e-05,
"loss": 0.3297,
"mean_token_accuracy": 0.9567724496126175,
"step": 875,
"train/kl_loss_qwen": 0.02518448540940881,
"train/kl_loss_r1": 0.015798166557215155,
"train/total_kl": 0.04098265203647315
},
{
"epoch": 1.095800933125972,
"grad_norm": 1.53125,
"learning_rate": 2.178082191780822e-05,
"loss": 0.2776,
"mean_token_accuracy": 0.96037577688694,
"step": 880,
"train/kl_loss_qwen": 0.019977604039013386,
"train/kl_loss_r1": 0.012469864799641073,
"train/total_kl": 0.032447469513863327
},
{
"epoch": 1.1020217729393469,
"grad_norm": 1.6796875,
"learning_rate": 2.173412204234122e-05,
"loss": 0.3031,
"mean_token_accuracy": 0.9599328011274337,
"step": 885,
"train/kl_loss_qwen": 0.02527875336818397,
"train/kl_loss_r1": 0.014116847841069102,
"train/total_kl": 0.0393956009298563
},
{
"epoch": 1.1082426127527216,
"grad_norm": 1.4921875,
"learning_rate": 2.1687422166874224e-05,
"loss": 0.3096,
"mean_token_accuracy": 0.9562761545181274,
"step": 890,
"train/kl_loss_qwen": 0.02247354043647647,
"train/kl_loss_r1": 0.01520557776093483,
"train/total_kl": 0.03767911838367581
},
{
"epoch": 1.1144634525660964,
"grad_norm": 1.5078125,
"learning_rate": 2.1640722291407223e-05,
"loss": 0.277,
"mean_token_accuracy": 0.9599349290132523,
"step": 895,
"train/kl_loss_qwen": 0.01961457757279277,
"train/kl_loss_r1": 0.012993672012817115,
"train/total_kl": 0.0326082497369498
},
{
"epoch": 1.1206842923794713,
"grad_norm": 1.546875,
"learning_rate": 2.1594022415940225e-05,
"loss": 0.3727,
"mean_token_accuracy": 0.9548643559217453,
"step": 900,
"train/kl_loss_qwen": 0.0343707412481308,
"train/kl_loss_r1": 0.017095418740063907,
"train/total_kl": 0.051466159708797934
},
{
"epoch": 1.126905132192846,
"grad_norm": 1.375,
"learning_rate": 2.1547322540473224e-05,
"loss": 0.3068,
"mean_token_accuracy": 0.9591044306755065,
"step": 905,
"train/kl_loss_qwen": 0.02452373835258186,
"train/kl_loss_r1": 0.01449969953391701,
"train/total_kl": 0.039023438654839995
},
{
"epoch": 1.1331259720062208,
"grad_norm": 1.3828125,
"learning_rate": 2.1500622665006227e-05,
"loss": 0.2977,
"mean_token_accuracy": 0.9605327278375626,
"step": 910,
"train/kl_loss_qwen": 0.023107501212507486,
"train/kl_loss_r1": 0.015223974105902016,
"train/total_kl": 0.038331475015729664
},
{
"epoch": 1.1393468118195957,
"grad_norm": 1.4609375,
"learning_rate": 2.145392278953923e-05,
"loss": 0.3055,
"mean_token_accuracy": 0.9603873282670975,
"step": 915,
"train/kl_loss_qwen": 0.023001648485660553,
"train/kl_loss_r1": 0.015112580894492567,
"train/total_kl": 0.0381142295897007
},
{
"epoch": 1.1455676516329705,
"grad_norm": 1.5703125,
"learning_rate": 2.1407222914072228e-05,
"loss": 0.3037,
"mean_token_accuracy": 0.9607974886894226,
"step": 920,
"train/kl_loss_qwen": 0.023130306228995322,
"train/kl_loss_r1": 0.013983825081959366,
"train/total_kl": 0.03711413135752082
},
{
"epoch": 1.1517884914463452,
"grad_norm": 1.203125,
"learning_rate": 2.136052303860523e-05,
"loss": 0.288,
"mean_token_accuracy": 0.9628516793251037,
"step": 925,
"train/kl_loss_qwen": 0.022921944176778196,
"train/kl_loss_r1": 0.01405964158475399,
"train/total_kl": 0.036981585528701545
},
{
"epoch": 1.15800933125972,
"grad_norm": 1.4375,
"learning_rate": 2.131382316313823e-05,
"loss": 0.3152,
"mean_token_accuracy": 0.9601940363645554,
"step": 930,
"train/kl_loss_qwen": 0.026545584946870805,
"train/kl_loss_r1": 0.014174379943870007,
"train/total_kl": 0.040719965007156134
},
{
"epoch": 1.164230171073095,
"grad_norm": 1.2734375,
"learning_rate": 2.126712328767123e-05,
"loss": 0.2835,
"mean_token_accuracy": 0.9574981659650803,
"step": 935,
"train/kl_loss_qwen": 0.019981388468295336,
"train/kl_loss_r1": 0.012800442287698388,
"train/total_kl": 0.032781831081956626
},
{
"epoch": 1.1704510108864696,
"grad_norm": 1.484375,
"learning_rate": 2.1220423412204237e-05,
"loss": 0.2909,
"mean_token_accuracy": 0.958210039138794,
"step": 940,
"train/kl_loss_qwen": 0.0211213490460068,
"train/kl_loss_r1": 0.012211221340112387,
"train/total_kl": 0.03333257073536515
},
{
"epoch": 1.1766718506998446,
"grad_norm": 1.7578125,
"learning_rate": 2.1173723536737236e-05,
"loss": 0.3088,
"mean_token_accuracy": 0.9566162914037705,
"step": 945,
"train/kl_loss_qwen": 0.023499226197600365,
"train/kl_loss_r1": 0.014358895621262491,
"train/total_kl": 0.037858121935278176
},
{
"epoch": 1.1828926905132193,
"grad_norm": 2.890625,
"learning_rate": 2.112702366127024e-05,
"loss": 0.3129,
"mean_token_accuracy": 0.9563288688659668,
"step": 950,
"train/kl_loss_qwen": 0.023788028536364435,
"train/kl_loss_r1": 0.015399044775404037,
"train/total_kl": 0.03918707333505154
},
{
"epoch": 1.189113530326594,
"grad_norm": 1.3515625,
"learning_rate": 2.1080323785803238e-05,
"loss": 0.2965,
"mean_token_accuracy": 0.9597578674554825,
"step": 955,
"train/kl_loss_qwen": 0.023407862475141882,
"train/kl_loss_r1": 0.013951084460131824,
"train/total_kl": 0.03735894681885839
},
{
"epoch": 1.1953343701399688,
"grad_norm": 1.546875,
"learning_rate": 2.103362391033624e-05,
"loss": 0.3034,
"mean_token_accuracy": 0.952317300438881,
"step": 960,
"train/kl_loss_qwen": 0.02142586586996913,
"train/kl_loss_r1": 0.013223635125905275,
"train/total_kl": 0.03464950108900666
},
{
"epoch": 1.2015552099533438,
"grad_norm": 1.7578125,
"learning_rate": 2.0986924034869242e-05,
"loss": 0.2921,
"mean_token_accuracy": 0.9569721490144729,
"step": 965,
"train/kl_loss_qwen": 0.020508702797815203,
"train/kl_loss_r1": 0.013173141260631382,
"train/total_kl": 0.033681843988597394
},
{
"epoch": 1.2077760497667185,
"grad_norm": 1.4921875,
"learning_rate": 2.094022415940224e-05,
"loss": 0.3207,
"mean_token_accuracy": 0.9579594194889068,
"step": 970,
"train/kl_loss_qwen": 0.026407206989824773,
"train/kl_loss_r1": 0.01604833439923823,
"train/total_kl": 0.04245554124936461
},
{
"epoch": 1.2139968895800932,
"grad_norm": 1.40625,
"learning_rate": 2.0893524283935244e-05,
"loss": 0.2691,
"mean_token_accuracy": 0.9618915826082229,
"step": 975,
"train/kl_loss_qwen": 0.020143463788554073,
"train/kl_loss_r1": 0.011573326494544744,
"train/total_kl": 0.031716789770871404
},
{
"epoch": 1.2202177293934682,
"grad_norm": 1.71875,
"learning_rate": 2.0846824408468246e-05,
"loss": 0.2878,
"mean_token_accuracy": 0.9602339863777161,
"step": 980,
"train/kl_loss_qwen": 0.021193863078951835,
"train/kl_loss_r1": 0.014284224039874971,
"train/total_kl": 0.03547808742150664
},
{
"epoch": 1.226438569206843,
"grad_norm": 1.546875,
"learning_rate": 2.0800124533001245e-05,
"loss": 0.2961,
"mean_token_accuracy": 0.9568452388048172,
"step": 985,
"train/kl_loss_qwen": 0.021635016007348896,
"train/kl_loss_r1": 0.012491077953018247,
"train/total_kl": 0.034126093704253437
},
{
"epoch": 1.2326594090202176,
"grad_norm": 1.4609375,
"learning_rate": 2.0753424657534248e-05,
"loss": 0.2762,
"mean_token_accuracy": 0.9612568289041519,
"step": 990,
"train/kl_loss_qwen": 0.020384321454912424,
"train/kl_loss_r1": 0.012731389002874493,
"train/total_kl": 0.03311571013182402
},
{
"epoch": 1.2388802488335926,
"grad_norm": 1.6484375,
"learning_rate": 2.0706724782067247e-05,
"loss": 0.298,
"mean_token_accuracy": 0.9548188507556915,
"step": 995,
"train/kl_loss_qwen": 0.02017202479764819,
"train/kl_loss_r1": 0.013068727403879165,
"train/total_kl": 0.0332407521083951
},
{
"epoch": 1.2451010886469673,
"grad_norm": 1.4140625,
"learning_rate": 2.066002490660025e-05,
"loss": 0.3913,
"mean_token_accuracy": 0.9523698449134826,
"step": 1000,
"train/kl_loss_qwen": 0.0328057702165097,
"train/kl_loss_r1": 0.017370638553984463,
"train/total_kl": 0.05017640832811594
},
{
"epoch": 1.251321928460342,
"grad_norm": 1.421875,
"learning_rate": 2.061332503113325e-05,
"loss": 0.2838,
"mean_token_accuracy": 0.9600636452436447,
"step": 1005,
"train/kl_loss_qwen": 0.02112743421457708,
"train/kl_loss_r1": 0.012237887969240547,
"train/total_kl": 0.033365322183817624
},
{
"epoch": 1.257542768273717,
"grad_norm": 1.453125,
"learning_rate": 2.056662515566625e-05,
"loss": 0.2888,
"mean_token_accuracy": 0.9591195553541183,
"step": 1010,
"train/kl_loss_qwen": 0.020449397200718523,
"train/kl_loss_r1": 0.013287889072671533,
"train/total_kl": 0.03373728627339005
},
{
"epoch": 1.2637636080870918,
"grad_norm": 1.875,
"learning_rate": 2.0519925280199253e-05,
"loss": 0.334,
"mean_token_accuracy": 0.9558851152658463,
"step": 1015,
"train/kl_loss_qwen": 0.02765529789030552,
"train/kl_loss_r1": 0.01525876906234771,
"train/total_kl": 0.04291406646370888
},
{
"epoch": 1.2699844479004665,
"grad_norm": 1.390625,
"learning_rate": 2.047322540473225e-05,
"loss": 0.2733,
"mean_token_accuracy": 0.9612768888473511,
"step": 1020,
"train/kl_loss_qwen": 0.02055009249597788,
"train/kl_loss_r1": 0.01219199935439974,
"train/total_kl": 0.03274209164083004
},
{
"epoch": 1.2762052877138412,
"grad_norm": 1.484375,
"learning_rate": 2.0426525529265254e-05,
"loss": 0.3006,
"mean_token_accuracy": 0.9604948818683624,
"step": 1025,
"train/kl_loss_qwen": 0.023509953077882527,
"train/kl_loss_r1": 0.013066381262615324,
"train/total_kl": 0.0365763345733285
},
{
"epoch": 1.2824261275272162,
"grad_norm": 1.234375,
"learning_rate": 2.037982565379826e-05,
"loss": 0.3579,
"mean_token_accuracy": 0.9586360841989517,
"step": 1030,
"train/kl_loss_qwen": 0.03005623547360301,
"train/kl_loss_r1": 0.018516876851208508,
"train/total_kl": 0.048573113046586514
},
{
"epoch": 1.288646967340591,
"grad_norm": 1.75,
"learning_rate": 2.033312577833126e-05,
"loss": 0.3284,
"mean_token_accuracy": 0.9601274847984314,
"step": 1035,
"train/kl_loss_qwen": 0.029562953114509582,
"train/kl_loss_r1": 0.014028432802297175,
"train/total_kl": 0.04359138542786241
},
{
"epoch": 1.2948678071539659,
"grad_norm": 1.4375,
"learning_rate": 2.028642590286426e-05,
"loss": 0.3047,
"mean_token_accuracy": 0.957324641942978,
"step": 1040,
"train/kl_loss_qwen": 0.02176124998368323,
"train/kl_loss_r1": 0.01420491524040699,
"train/total_kl": 0.03596616517752409
},
{
"epoch": 1.3010886469673406,
"grad_norm": 1.5390625,
"learning_rate": 2.023972602739726e-05,
"loss": 0.2959,
"mean_token_accuracy": 0.9622577458620072,
"step": 1045,
"train/kl_loss_qwen": 0.023116547102108597,
"train/kl_loss_r1": 0.014679647493176162,
"train/total_kl": 0.03779619401320815
},
{
"epoch": 1.3073094867807153,
"grad_norm": 1.3828125,
"learning_rate": 2.0193026151930263e-05,
"loss": 0.2817,
"mean_token_accuracy": 0.9572558134794236,
"step": 1050,
"train/kl_loss_qwen": 0.02008639704436064,
"train/kl_loss_r1": 0.012323370180092752,
"train/total_kl": 0.03240976668894291
},
{
"epoch": 1.31353032659409,
"grad_norm": 1.953125,
"learning_rate": 2.0146326276463265e-05,
"loss": 0.2899,
"mean_token_accuracy": 0.959894523024559,
"step": 1055,
"train/kl_loss_qwen": 0.022242504497990014,
"train/kl_loss_r1": 0.012922527687624096,
"train/total_kl": 0.03516503153368831
},
{
"epoch": 1.319751166407465,
"grad_norm": 1.5390625,
"learning_rate": 2.0099626400996264e-05,
"loss": 0.275,
"mean_token_accuracy": 0.9640595138072967,
"step": 1060,
"train/kl_loss_qwen": 0.020678923232480884,
"train/kl_loss_r1": 0.013264290383085608,
"train/total_kl": 0.033943213801831004
},
{
"epoch": 1.3259720062208398,
"grad_norm": 1.453125,
"learning_rate": 2.0052926525529266e-05,
"loss": 0.2958,
"mean_token_accuracy": 0.9585067182779312,
"step": 1065,
"train/kl_loss_qwen": 0.020578745240345597,
"train/kl_loss_r1": 0.013947037351317703,
"train/total_kl": 0.03452578242868185
},
{
"epoch": 1.3321928460342147,
"grad_norm": 1.46875,
"learning_rate": 2.000622665006227e-05,
"loss": 0.2985,
"mean_token_accuracy": 0.9577532559633255,
"step": 1070,
"train/kl_loss_qwen": 0.02328689182177186,
"train/kl_loss_r1": 0.01395503762178123,
"train/total_kl": 0.037241929210722446
},
{
"epoch": 1.3384136858475895,
"grad_norm": 1.5234375,
"learning_rate": 1.9959526774595268e-05,
"loss": 0.2788,
"mean_token_accuracy": 0.9609476655721665,
"step": 1075,
"train/kl_loss_qwen": 0.020258180052042007,
"train/kl_loss_r1": 0.013444960676133632,
"train/total_kl": 0.03370314054191113
},
{
"epoch": 1.3446345256609642,
"grad_norm": 1.328125,
"learning_rate": 1.991282689912827e-05,
"loss": 0.2978,
"mean_token_accuracy": 0.9590980023145675,
"step": 1080,
"train/kl_loss_qwen": 0.02293569967150688,
"train/kl_loss_r1": 0.014317399612627924,
"train/total_kl": 0.037253099400550126
},
{
"epoch": 1.350855365474339,
"grad_norm": 1.359375,
"learning_rate": 1.986612702366127e-05,
"loss": 0.269,
"mean_token_accuracy": 0.9612076997756958,
"step": 1085,
"train/kl_loss_qwen": 0.020363600039854646,
"train/kl_loss_r1": 0.011795403668656945,
"train/total_kl": 0.032159003615379336
},
{
"epoch": 1.3570762052877139,
"grad_norm": 1.46875,
"learning_rate": 1.981942714819427e-05,
"loss": 0.3482,
"mean_token_accuracy": 0.9550175487995147,
"step": 1090,
"train/kl_loss_qwen": 0.029534393968060613,
"train/kl_loss_r1": 0.01619353631976992,
"train/total_kl": 0.04572793049737811
},
{
"epoch": 1.3632970451010886,
"grad_norm": 1.6171875,
"learning_rate": 1.9772727272727274e-05,
"loss": 0.2874,
"mean_token_accuracy": 0.9602297455072403,
"step": 1095,
"train/kl_loss_qwen": 0.020855060778558254,
"train/kl_loss_r1": 0.01363906858023256,
"train/total_kl": 0.03449412910267711
},
{
"epoch": 1.3695178849144636,
"grad_norm": 1.578125,
"learning_rate": 1.9726027397260273e-05,
"loss": 0.3941,
"mean_token_accuracy": 0.9562926113605499,
"step": 1100,
"train/kl_loss_qwen": 0.03488424099050462,
"train/kl_loss_r1": 0.01934248344041407,
"train/total_kl": 0.05422672387212515
},
{
"epoch": 1.3757387247278383,
"grad_norm": 1.5546875,
"learning_rate": 1.9679327521793275e-05,
"loss": 0.2959,
"mean_token_accuracy": 0.956820473074913,
"step": 1105,
"train/kl_loss_qwen": 0.021371696330606937,
"train/kl_loss_r1": 0.012425292772240937,
"train/total_kl": 0.033796988613903525
},
{
"epoch": 1.381959564541213,
"grad_norm": 1.6484375,
"learning_rate": 1.9632627646326274e-05,
"loss": 0.3097,
"mean_token_accuracy": 0.9579416275024414,
"step": 1110,
"train/kl_loss_qwen": 0.023708021268248558,
"train/kl_loss_r1": 0.015187849942594766,
"train/total_kl": 0.03889587111771107
},
{
"epoch": 1.3881804043545878,
"grad_norm": 1.421875,
"learning_rate": 1.9585927770859276e-05,
"loss": 0.2784,
"mean_token_accuracy": 0.9591321825981141,
"step": 1115,
"train/kl_loss_qwen": 0.02066819160245359,
"train/kl_loss_r1": 0.011791627784259618,
"train/total_kl": 0.032459819409996274
},
{
"epoch": 1.3944012441679627,
"grad_norm": 1.4453125,
"learning_rate": 1.9539227895392282e-05,
"loss": 0.2905,
"mean_token_accuracy": 0.9603239595890045,
"step": 1120,
"train/kl_loss_qwen": 0.021381384460255504,
"train/kl_loss_r1": 0.014689616672694684,
"train/total_kl": 0.03607100090011954
},
{
"epoch": 1.4006220839813375,
"grad_norm": 3.125,
"learning_rate": 1.949252801992528e-05,
"loss": 0.39,
"mean_token_accuracy": 0.9580953747034073,
"step": 1125,
"train/kl_loss_qwen": 0.03591306242160499,
"train/kl_loss_r1": 0.018943295208737256,
"train/total_kl": 0.054856357537209986
},
{
"epoch": 1.4068429237947122,
"grad_norm": 1.5234375,
"learning_rate": 1.9445828144458284e-05,
"loss": 0.3111,
"mean_token_accuracy": 0.9572787255048751,
"step": 1130,
"train/kl_loss_qwen": 0.023058245377615093,
"train/kl_loss_r1": 0.01515980097465217,
"train/total_kl": 0.03821804653853178
},
{
"epoch": 1.4130637636080872,
"grad_norm": 1.375,
"learning_rate": 1.9399128268991283e-05,
"loss": 0.3609,
"mean_token_accuracy": 0.9568741142749786,
"step": 1135,
"train/kl_loss_qwen": 0.03462322899140417,
"train/kl_loss_r1": 0.015330694918520748,
"train/total_kl": 0.049953922908753154
},
{
"epoch": 1.419284603421462,
"grad_norm": 1.5234375,
"learning_rate": 1.9352428393524285e-05,
"loss": 0.2859,
"mean_token_accuracy": 0.9596155285835266,
"step": 1140,
"train/kl_loss_qwen": 0.019285118207335472,
"train/kl_loss_r1": 0.013246331200934946,
"train/total_kl": 0.032531449338421226
},
{
"epoch": 1.4255054432348366,
"grad_norm": 1.6328125,
"learning_rate": 1.9305728518057287e-05,
"loss": 0.3679,
"mean_token_accuracy": 0.9594572901725769,
"step": 1145,
"train/kl_loss_qwen": 0.03480704687535763,
"train/kl_loss_r1": 0.01769161957781762,
"train/total_kl": 0.0524986662901938
},
{
"epoch": 1.4317262830482116,
"grad_norm": 1.6015625,
"learning_rate": 1.9259028642590286e-05,
"loss": 0.3798,
"mean_token_accuracy": 0.9549993693828582,
"step": 1150,
"train/kl_loss_qwen": 0.033570041367784145,
"train/kl_loss_r1": 0.01750114664901048,
"train/total_kl": 0.0510711875744164
},
{
"epoch": 1.4379471228615863,
"grad_norm": 1.4453125,
"learning_rate": 1.921232876712329e-05,
"loss": 0.2985,
"mean_token_accuracy": 0.9594900667667389,
"step": 1155,
"train/kl_loss_qwen": 0.021839511627331377,
"train/kl_loss_r1": 0.014621772128157318,
"train/total_kl": 0.036461283918470144
},
{
"epoch": 1.444167962674961,
"grad_norm": 1.375,
"learning_rate": 1.9165628891656288e-05,
"loss": 0.291,
"mean_token_accuracy": 0.9573999226093293,
"step": 1160,
"train/kl_loss_qwen": 0.021014203736558556,
"train/kl_loss_r1": 0.013348353654146194,
"train/total_kl": 0.03436255753040314
},
{
"epoch": 1.450388802488336,
"grad_norm": 4.03125,
"learning_rate": 1.911892901618929e-05,
"loss": 0.4053,
"mean_token_accuracy": 0.9548583000898361,
"step": 1165,
"train/kl_loss_qwen": 0.03519875258207321,
"train/kl_loss_r1": 0.022582641919143498,
"train/total_kl": 0.0577813945710659
},
{
"epoch": 1.4566096423017107,
"grad_norm": 1.59375,
"learning_rate": 1.9072229140722292e-05,
"loss": 0.3189,
"mean_token_accuracy": 0.9598561078310013,
"step": 1170,
"train/kl_loss_qwen": 0.02605470730923116,
"train/kl_loss_r1": 0.016693935636430977,
"train/total_kl": 0.04274864299222827
},
{
"epoch": 1.4628304821150855,
"grad_norm": 1.3984375,
"learning_rate": 1.902552926525529e-05,
"loss": 0.2911,
"mean_token_accuracy": 0.9594184875488281,
"step": 1175,
"train/kl_loss_qwen": 0.022187241865321995,
"train/kl_loss_r1": 0.013874154957011341,
"train/total_kl": 0.036061396915465595
},
{
"epoch": 1.4690513219284602,
"grad_norm": 2.328125,
"learning_rate": 1.8978829389788294e-05,
"loss": 0.3264,
"mean_token_accuracy": 0.9572916924953461,
"step": 1180,
"train/kl_loss_qwen": 0.0274376577232033,
"train/kl_loss_r1": 0.01724695498123765,
"train/total_kl": 0.04468461312353611
},
{
"epoch": 1.4752721617418352,
"grad_norm": 1.65625,
"learning_rate": 1.8932129514321296e-05,
"loss": 0.399,
"mean_token_accuracy": 0.956961777806282,
"step": 1185,
"train/kl_loss_qwen": 0.037932181172072886,
"train/kl_loss_r1": 0.02000022241845727,
"train/total_kl": 0.057932402938604355
},
{
"epoch": 1.48149300155521,
"grad_norm": 1.28125,
"learning_rate": 1.8885429638854295e-05,
"loss": 0.2916,
"mean_token_accuracy": 0.961290568113327,
"step": 1190,
"train/kl_loss_qwen": 0.02299168729223311,
"train/kl_loss_r1": 0.014748373185284436,
"train/total_kl": 0.03774006050080061
},
{
"epoch": 1.4877138413685849,
"grad_norm": 1.21875,
"learning_rate": 1.8838729763387298e-05,
"loss": 0.284,
"mean_token_accuracy": 0.9619271278381347,
"step": 1195,
"train/kl_loss_qwen": 0.021989288041368127,
"train/kl_loss_r1": 0.013442329177632929,
"train/total_kl": 0.03543161693960428
},
{
"epoch": 1.4939346811819596,
"grad_norm": 1.4140625,
"learning_rate": 1.8792029887920297e-05,
"loss": 0.2754,
"mean_token_accuracy": 0.9628610700368881,
"step": 1200,
"train/kl_loss_qwen": 0.01976469177752733,
"train/kl_loss_r1": 0.013379984023049473,
"train/total_kl": 0.03314467594027519
},
{
"epoch": 1.5001555209953343,
"grad_norm": 1.8671875,
"learning_rate": 1.8745330012453302e-05,
"loss": 0.3202,
"mean_token_accuracy": 0.9567913293838501,
"step": 1205,
"train/kl_loss_qwen": 0.02559811775572598,
"train/kl_loss_r1": 0.01404339938890189,
"train/total_kl": 0.03964151693508029
},
{
"epoch": 1.506376360808709,
"grad_norm": 1.328125,
"learning_rate": 1.8698630136986305e-05,
"loss": 0.2755,
"mean_token_accuracy": 0.9610955238342285,
"step": 1210,
"train/kl_loss_qwen": 0.020736100152134895,
"train/kl_loss_r1": 0.012843929487280548,
"train/total_kl": 0.03358002956956625
},
{
"epoch": 1.512597200622084,
"grad_norm": 1.7109375,
"learning_rate": 1.8651930261519304e-05,
"loss": 0.3054,
"mean_token_accuracy": 0.9547863215208053,
"step": 1215,
"train/kl_loss_qwen": 0.022321202885359527,
"train/kl_loss_r1": 0.015055784210562705,
"train/total_kl": 0.03737698718905449
},
{
"epoch": 1.5188180404354588,
"grad_norm": 1.328125,
"learning_rate": 1.8605230386052306e-05,
"loss": 0.2832,
"mean_token_accuracy": 0.9598489284515381,
"step": 1220,
"train/kl_loss_qwen": 0.02179465526714921,
"train/kl_loss_r1": 0.013072352437302471,
"train/total_kl": 0.03486700775101781
},
{
"epoch": 1.5250388802488337,
"grad_norm": 1.171875,
"learning_rate": 1.8558530510585305e-05,
"loss": 0.2928,
"mean_token_accuracy": 0.9627665460109711,
"step": 1225,
"train/kl_loss_qwen": 0.022760304110124707,
"train/kl_loss_r1": 0.014947098214179277,
"train/total_kl": 0.037707402184605596
},
{
"epoch": 1.5312597200622085,
"grad_norm": 1.1875,
"learning_rate": 1.8511830635118307e-05,
"loss": 0.2857,
"mean_token_accuracy": 0.9622293323278427,
"step": 1230,
"train/kl_loss_qwen": 0.021702085016295315,
"train/kl_loss_r1": 0.014505600836127997,
"train/total_kl": 0.03620768608525395
},
{
"epoch": 1.5374805598755832,
"grad_norm": 1.4375,
"learning_rate": 1.846513075965131e-05,
"loss": 0.3007,
"mean_token_accuracy": 0.9588985919952393,
"step": 1235,
"train/kl_loss_qwen": 0.023196784174069764,
"train/kl_loss_r1": 0.015077767241746188,
"train/total_kl": 0.03827455164864659
},
{
"epoch": 1.543701399688958,
"grad_norm": 1.3671875,
"learning_rate": 1.841843088418431e-05,
"loss": 0.3002,
"mean_token_accuracy": 0.9607412844896317,
"step": 1240,
"train/kl_loss_qwen": 0.02430763831362128,
"train/kl_loss_r1": 0.013863891735672951,
"train/total_kl": 0.03817152995616198
},
{
"epoch": 1.5499222395023327,
"grad_norm": 1.328125,
"learning_rate": 1.837173100871731e-05,
"loss": 0.2951,
"mean_token_accuracy": 0.9558100968599319,
"step": 1245,
"train/kl_loss_qwen": 0.020561574772000313,
"train/kl_loss_r1": 0.014364191447384655,
"train/total_kl": 0.03492576666176319
},
{
"epoch": 1.5561430793157076,
"grad_norm": 1.5703125,
"learning_rate": 1.832503113325031e-05,
"loss": 0.2871,
"mean_token_accuracy": 0.9567299842834472,
"step": 1250,
"train/kl_loss_qwen": 0.02099115620367229,
"train/kl_loss_r1": 0.01232013343833387,
"train/total_kl": 0.03331128945574165
},
{
"epoch": 1.5623639191290826,
"grad_norm": 1.859375,
"learning_rate": 1.8278331257783313e-05,
"loss": 0.2965,
"mean_token_accuracy": 0.9580708712339401,
"step": 1255,
"train/kl_loss_qwen": 0.019678771495819092,
"train/kl_loss_r1": 0.013691711169667543,
"train/total_kl": 0.03337048254907131
},
{
"epoch": 1.5685847589424573,
"grad_norm": 1.625,
"learning_rate": 1.8231631382316315e-05,
"loss": 0.3153,
"mean_token_accuracy": 0.9576340615749359,
"step": 1260,
"train/kl_loss_qwen": 0.023866409715265036,
"train/kl_loss_r1": 0.014706146181561052,
"train/total_kl": 0.03857255624607205
},
{
"epoch": 1.574805598755832,
"grad_norm": 1.4765625,
"learning_rate": 1.8184931506849314e-05,
"loss": 0.2907,
"mean_token_accuracy": 0.9617926776409149,
"step": 1265,
"train/kl_loss_qwen": 0.021931132208555935,
"train/kl_loss_r1": 0.014819200243800878,
"train/total_kl": 0.036750332452356815
},
{
"epoch": 1.5810264385692068,
"grad_norm": 1.28125,
"learning_rate": 1.8138231631382316e-05,
"loss": 0.2851,
"mean_token_accuracy": 0.9603859275579453,
"step": 1270,
"train/kl_loss_qwen": 0.02175323711708188,
"train/kl_loss_r1": 0.01273711076937616,
"train/total_kl": 0.034490348072722554
},
{
"epoch": 1.5872472783825815,
"grad_norm": 1.578125,
"learning_rate": 1.809153175591532e-05,
"loss": 0.4085,
"mean_token_accuracy": 0.9475253760814667,
"step": 1275,
"train/kl_loss_qwen": 0.03326868480071425,
"train/kl_loss_r1": 0.017885031923651696,
"train/total_kl": 0.05115371756255627
},
{
"epoch": 1.5934681181959565,
"grad_norm": 1.5078125,
"learning_rate": 1.8044831880448318e-05,
"loss": 0.3215,
"mean_token_accuracy": 0.9612332046031952,
"step": 1280,
"train/kl_loss_qwen": 0.027783603593707084,
"train/kl_loss_r1": 0.01593417483381927,
"train/total_kl": 0.04371777819469571
},
{
"epoch": 1.5996889580093314,
"grad_norm": 1.921875,
"learning_rate": 1.799813200498132e-05,
"loss": 0.2871,
"mean_token_accuracy": 0.9571006387472153,
"step": 1285,
"train/kl_loss_qwen": 0.018922175094485284,
"train/kl_loss_r1": 0.011591637996025384,
"train/total_kl": 0.030513812974095344
},
{
"epoch": 1.6059097978227062,
"grad_norm": 1.3046875,
"learning_rate": 1.795143212951432e-05,
"loss": 0.3004,
"mean_token_accuracy": 0.9639281570911408,
"step": 1290,
"train/kl_loss_qwen": 0.025467291148379444,
"train/kl_loss_r1": 0.014465117454528808,
"train/total_kl": 0.039932408928871156
},
{
"epoch": 1.6121306376360809,
"grad_norm": 1.4921875,
"learning_rate": 1.7904732254047325e-05,
"loss": 0.3065,
"mean_token_accuracy": 0.957399845123291,
"step": 1295,
"train/kl_loss_qwen": 0.024825150426477195,
"train/kl_loss_r1": 0.013710612105205655,
"train/total_kl": 0.03853576248511672
},
{
"epoch": 1.6183514774494556,
"grad_norm": 1.3125,
"learning_rate": 1.7858032378580327e-05,
"loss": 0.2833,
"mean_token_accuracy": 0.9580383241176605,
"step": 1300,
"train/kl_loss_qwen": 0.020569146750494836,
"train/kl_loss_r1": 0.012861439283005894,
"train/total_kl": 0.033430585730820896
},
{
"epoch": 1.6245723172628304,
"grad_norm": 2.015625,
"learning_rate": 1.7811332503113326e-05,
"loss": 0.3294,
"mean_token_accuracy": 0.9609451532363892,
"step": 1305,
"train/kl_loss_qwen": 0.02771374033764005,
"train/kl_loss_r1": 0.01762062469497323,
"train/total_kl": 0.045334365032613275
},
{
"epoch": 1.6307931570762053,
"grad_norm": 1.3125,
"learning_rate": 1.776463262764633e-05,
"loss": 0.2977,
"mean_token_accuracy": 0.9565259754657746,
"step": 1310,
"train/kl_loss_qwen": 0.022654768778011203,
"train/kl_loss_r1": 0.01242492652963847,
"train/total_kl": 0.03507969556376338
},
{
"epoch": 1.63701399688958,
"grad_norm": 1.75,
"learning_rate": 1.7717932752179327e-05,
"loss": 0.3123,
"mean_token_accuracy": 0.9604735493659973,
"step": 1315,
"train/kl_loss_qwen": 0.024692377913743256,
"train/kl_loss_r1": 0.015999246342107653,
"train/total_kl": 0.04069162430241704
},
{
"epoch": 1.643234836702955,
"grad_norm": 1.6953125,
"learning_rate": 1.767123287671233e-05,
"loss": 0.3212,
"mean_token_accuracy": 0.9578433007001876,
"step": 1320,
"train/kl_loss_qwen": 0.025619086902588607,
"train/kl_loss_r1": 0.015220096544362604,
"train/total_kl": 0.04083918360993266
},
{
"epoch": 1.6494556765163297,
"grad_norm": 1.2734375,
"learning_rate": 1.7624533001245332e-05,
"loss": 0.2734,
"mean_token_accuracy": 0.9615452647209167,
"step": 1325,
"train/kl_loss_qwen": 0.020037101954221724,
"train/kl_loss_r1": 0.01251753638498485,
"train/total_kl": 0.032554637920111415
},
{
"epoch": 1.6556765163297045,
"grad_norm": 1.484375,
"learning_rate": 1.757783312577833e-05,
"loss": 0.3049,
"mean_token_accuracy": 0.9566170126199722,
"step": 1330,
"train/kl_loss_qwen": 0.022488067951053382,
"train/kl_loss_r1": 0.014429900841787458,
"train/total_kl": 0.03691796939820051
},
{
"epoch": 1.6618973561430792,
"grad_norm": 1.28125,
"learning_rate": 1.7531133250311334e-05,
"loss": 0.2719,
"mean_token_accuracy": 0.9647402167320251,
"step": 1335,
"train/kl_loss_qwen": 0.02126315711066127,
"train/kl_loss_r1": 0.013214132492430508,
"train/total_kl": 0.03447728957980871
},
{
"epoch": 1.6681181959564542,
"grad_norm": 1.2265625,
"learning_rate": 1.7484433374844333e-05,
"loss": 0.2843,
"mean_token_accuracy": 0.9628708630800247,
"step": 1340,
"train/kl_loss_qwen": 0.022394176525995135,
"train/kl_loss_r1": 0.012963168020360172,
"train/total_kl": 0.035357344802469014
},
{
"epoch": 1.674339035769829,
"grad_norm": 1.59375,
"learning_rate": 1.7437733499377335e-05,
"loss": 0.3063,
"mean_token_accuracy": 0.95919728577137,
"step": 1345,
"train/kl_loss_qwen": 0.024591578030958773,
"train/kl_loss_r1": 0.014588873228058219,
"train/total_kl": 0.03918045153841376
},
{
"epoch": 1.6805598755832039,
"grad_norm": 1.2890625,
"learning_rate": 1.7391033623910337e-05,
"loss": 0.2814,
"mean_token_accuracy": 0.9604864865541458,
"step": 1350,
"train/kl_loss_qwen": 0.021181778702884912,
"train/kl_loss_r1": 0.012493171030655503,
"train/total_kl": 0.03367494996637106
},
{
"epoch": 1.6867807153965786,
"grad_norm": 1.734375,
"learning_rate": 1.7344333748443336e-05,
"loss": 0.2888,
"mean_token_accuracy": 0.962582352757454,
"step": 1355,
"train/kl_loss_qwen": 0.022155422298237682,
"train/kl_loss_r1": 0.01366903679445386,
"train/total_kl": 0.03582445904612541
},
{
"epoch": 1.6930015552099533,
"grad_norm": 1.640625,
"learning_rate": 1.729763387297634e-05,
"loss": 0.3055,
"mean_token_accuracy": 0.9639359444379807,
"step": 1360,
"train/kl_loss_qwen": 0.025513780070468783,
"train/kl_loss_r1": 0.01692169248126447,
"train/total_kl": 0.04243547255173326
},
{
"epoch": 1.699222395023328,
"grad_norm": 1.6171875,
"learning_rate": 1.725093399750934e-05,
"loss": 0.2947,
"mean_token_accuracy": 0.9534312933683395,
"step": 1365,
"train/kl_loss_qwen": 0.020309114549309015,
"train/kl_loss_r1": 0.01252038376405835,
"train/total_kl": 0.03282949859276414
},
{
"epoch": 1.7054432348367028,
"grad_norm": 1.3671875,
"learning_rate": 1.720423412204234e-05,
"loss": 0.2779,
"mean_token_accuracy": 0.9649826675653458,
"step": 1370,
"train/kl_loss_qwen": 0.022552193282172082,
"train/kl_loss_r1": 0.014152583619579672,
"train/total_kl": 0.03670477671548724
},
{
"epoch": 1.7116640746500777,
"grad_norm": 1.484375,
"learning_rate": 1.7157534246575342e-05,
"loss": 0.2878,
"mean_token_accuracy": 0.9584995239973069,
"step": 1375,
"train/kl_loss_qwen": 0.022065887739881874,
"train/kl_loss_r1": 0.012487068446353078,
"train/total_kl": 0.034552955999970436
},
{
"epoch": 1.7178849144634527,
"grad_norm": 1.1328125,
"learning_rate": 1.711083437110834e-05,
"loss": 0.2609,
"mean_token_accuracy": 0.9647163540124893,
"step": 1380,
"train/kl_loss_qwen": 0.019539849366992712,
"train/kl_loss_r1": 0.011925394786521793,
"train/total_kl": 0.03146524429321289
},
{
"epoch": 1.7241057542768274,
"grad_norm": 1.7109375,
"learning_rate": 1.7064134495641347e-05,
"loss": 0.3011,
"mean_token_accuracy": 0.9581982225179673,
"step": 1385,
"train/kl_loss_qwen": 0.02257566642947495,
"train/kl_loss_r1": 0.013715238706208766,
"train/total_kl": 0.03629090515896678
},
{
"epoch": 1.7303265940902022,
"grad_norm": 1.328125,
"learning_rate": 1.701743462017435e-05,
"loss": 0.285,
"mean_token_accuracy": 0.9621599823236465,
"step": 1390,
"train/kl_loss_qwen": 0.022289714217185973,
"train/kl_loss_r1": 0.01341030071489513,
"train/total_kl": 0.035700014885514976
},
{
"epoch": 1.736547433903577,
"grad_norm": 1.40625,
"learning_rate": 1.697073474470735e-05,
"loss": 0.2936,
"mean_token_accuracy": 0.9583886325359344,
"step": 1395,
"train/kl_loss_qwen": 0.021757268300279974,
"train/kl_loss_r1": 0.013224484142847359,
"train/total_kl": 0.03498175237327814
},
{
"epoch": 1.7427682737169516,
"grad_norm": 1.4765625,
"learning_rate": 1.692403486924035e-05,
"loss": 0.3241,
"mean_token_accuracy": 0.9611039608716965,
"step": 1400,
"train/kl_loss_qwen": 0.027939339494332673,
"train/kl_loss_r1": 0.015984538733027874,
"train/total_kl": 0.043923878204077484
},
{
"epoch": 1.7489891135303266,
"grad_norm": 1.6015625,
"learning_rate": 1.687733499377335e-05,
"loss": 0.3045,
"mean_token_accuracy": 0.9567447185516358,
"step": 1405,
"train/kl_loss_qwen": 0.02204110100865364,
"train/kl_loss_r1": 0.01382591521833092,
"train/total_kl": 0.03586701643653214
},
{
"epoch": 1.7552099533437016,
"grad_norm": 1.84375,
"learning_rate": 1.6830635118306352e-05,
"loss": 0.2962,
"mean_token_accuracy": 0.9537202090024948,
"step": 1410,
"train/kl_loss_qwen": 0.021085012378171085,
"train/kl_loss_r1": 0.01382909684907645,
"train/total_kl": 0.03491410920396447
},
{
"epoch": 1.7614307931570763,
"grad_norm": 1.5078125,
"learning_rate": 1.6783935242839355e-05,
"loss": 0.2926,
"mean_token_accuracy": 0.9642517894506455,
"step": 1415,
"train/kl_loss_qwen": 0.023424046859145165,
"train/kl_loss_r1": 0.014761518430896103,
"train/total_kl": 0.03818556563928723
},
{
"epoch": 1.767651632970451,
"grad_norm": 1.484375,
"learning_rate": 1.6737235367372354e-05,
"loss": 0.3051,
"mean_token_accuracy": 0.9608754545450211,
"step": 1420,
"train/kl_loss_qwen": 0.024306372087448836,
"train/kl_loss_r1": 0.014464322733692825,
"train/total_kl": 0.03877069475129247
},
{
"epoch": 1.7738724727838258,
"grad_norm": 1.734375,
"learning_rate": 1.6690535491905356e-05,
"loss": 0.2896,
"mean_token_accuracy": 0.9598593056201935,
"step": 1425,
"train/kl_loss_qwen": 0.020282325707376002,
"train/kl_loss_r1": 0.012976178899407387,
"train/total_kl": 0.03325850497931242
},
{
"epoch": 1.7800933125972005,
"grad_norm": 1.4921875,
"learning_rate": 1.6643835616438355e-05,
"loss": 0.4165,
"mean_token_accuracy": 0.9545033365488053,
"step": 1430,
"train/kl_loss_qwen": 0.03436682634055614,
"train/kl_loss_r1": 0.0241848505102098,
"train/total_kl": 0.05855167773552239
},
{
"epoch": 1.7863141524105755,
"grad_norm": 1.8828125,
"learning_rate": 1.6597135740971357e-05,
"loss": 0.2962,
"mean_token_accuracy": 0.9586415469646454,
"step": 1435,
"train/kl_loss_qwen": 0.022492232220247387,
"train/kl_loss_r1": 0.013683093525469304,
"train/total_kl": 0.036175326071679594
},
{
"epoch": 1.7925349922239502,
"grad_norm": 1.6953125,
"learning_rate": 1.655043586550436e-05,
"loss": 0.3056,
"mean_token_accuracy": 0.9552174896001816,
"step": 1440,
"train/kl_loss_qwen": 0.021061650943011045,
"train/kl_loss_r1": 0.014696670183911919,
"train/total_kl": 0.035758321080356835
},
{
"epoch": 1.7987558320373251,
"grad_norm": 1.3125,
"learning_rate": 1.650373599003736e-05,
"loss": 0.3284,
"mean_token_accuracy": 0.9582234472036362,
"step": 1445,
"train/kl_loss_qwen": 0.026695101195946334,
"train/kl_loss_r1": 0.015962717402726413,
"train/total_kl": 0.042657819017767905
},
{
"epoch": 1.8049766718506999,
"grad_norm": 1.5234375,
"learning_rate": 1.645703611457036e-05,
"loss": 0.3002,
"mean_token_accuracy": 0.9622107416391372,
"step": 1450,
"train/kl_loss_qwen": 0.02437539123930037,
"train/kl_loss_r1": 0.014243083982728421,
"train/total_kl": 0.03861847519874573
},
{
"epoch": 1.8111975116640746,
"grad_norm": 1.2421875,
"learning_rate": 1.641033623910336e-05,
"loss": 0.2928,
"mean_token_accuracy": 0.9614711910486221,
"step": 1455,
"train/kl_loss_qwen": 0.02260896023362875,
"train/kl_loss_r1": 0.012275043106637896,
"train/total_kl": 0.03488400299102068
},
{
"epoch": 1.8174183514774493,
"grad_norm": 1.40625,
"learning_rate": 1.6363636363636363e-05,
"loss": 0.2943,
"mean_token_accuracy": 0.9561317473649978,
"step": 1460,
"train/kl_loss_qwen": 0.020934791956096887,
"train/kl_loss_r1": 0.013324381457641721,
"train/total_kl": 0.034259173553436995
},
{
"epoch": 1.8236391912908243,
"grad_norm": 1.484375,
"learning_rate": 1.6316936488169365e-05,
"loss": 0.2998,
"mean_token_accuracy": 0.9572570383548736,
"step": 1465,
"train/kl_loss_qwen": 0.019881926383823155,
"train/kl_loss_r1": 0.013012451119720936,
"train/total_kl": 0.03289437731727958
},
{
"epoch": 1.829860031104199,
"grad_norm": 1.28125,
"learning_rate": 1.6270236612702364e-05,
"loss": 0.2816,
"mean_token_accuracy": 0.9600322395563126,
"step": 1470,
"train/kl_loss_qwen": 0.020596644142642617,
"train/kl_loss_r1": 0.01168474464211613,
"train/total_kl": 0.032281389273703096
},
{
"epoch": 1.836080870917574,
"grad_norm": 6.1875,
"learning_rate": 1.622353673723537e-05,
"loss": 0.4247,
"mean_token_accuracy": 0.9523273229598999,
"step": 1475,
"train/kl_loss_qwen": 0.04184676762670279,
"train/kl_loss_r1": 0.02051756768487394,
"train/total_kl": 0.06236433489248157
},
{
"epoch": 1.8423017107309487,
"grad_norm": 1.6015625,
"learning_rate": 1.6176836861768372e-05,
"loss": 0.277,
"mean_token_accuracy": 0.9600133568048477,
"step": 1480,
"train/kl_loss_qwen": 0.020399686740711333,
"train/kl_loss_r1": 0.012775455461815,
"train/total_kl": 0.03317514192312956
},
{
"epoch": 1.8485225505443235,
"grad_norm": 1.3203125,
"learning_rate": 1.613013698630137e-05,
"loss": 0.2965,
"mean_token_accuracy": 0.9654383957386017,
"step": 1485,
"train/kl_loss_qwen": 0.02537273187190294,
"train/kl_loss_r1": 0.015087466267868877,
"train/total_kl": 0.040460198651999235
},
{
"epoch": 1.8547433903576982,
"grad_norm": 1.4296875,
"learning_rate": 1.6083437110834373e-05,
"loss": 0.2804,
"mean_token_accuracy": 0.9586332231760025,
"step": 1490,
"train/kl_loss_qwen": 0.01983982524834573,
"train/kl_loss_r1": 0.011603046138770879,
"train/total_kl": 0.031442871689796446
},
{
"epoch": 1.860964230171073,
"grad_norm": 1.625,
"learning_rate": 1.6036737235367372e-05,
"loss": 0.2797,
"mean_token_accuracy": 0.9595640987157822,
"step": 1495,
"train/kl_loss_qwen": 0.019799032853916286,
"train/kl_loss_r1": 0.012844469002448022,
"train/total_kl": 0.03264350155368447
},
{
"epoch": 1.8671850699844479,
"grad_norm": 1.2734375,
"learning_rate": 1.5990037359900375e-05,
"loss": 0.3118,
"mean_token_accuracy": 0.9638541102409363,
"step": 1500,
"train/kl_loss_qwen": 0.026107014529407023,
"train/kl_loss_r1": 0.016707474808208646,
"train/total_kl": 0.04281448973342776
},
{
"epoch": 1.8734059097978228,
"grad_norm": 1.59375,
"learning_rate": 1.5943337484433377e-05,
"loss": 0.2922,
"mean_token_accuracy": 0.9552089840173721,
"step": 1505,
"train/kl_loss_qwen": 0.0205880144611001,
"train/kl_loss_r1": 0.01196823725476861,
"train/total_kl": 0.03255625148303807
},
{
"epoch": 1.8796267496111976,
"grad_norm": 1.390625,
"learning_rate": 1.5896637608966376e-05,
"loss": 0.3049,
"mean_token_accuracy": 0.9595163345336915,
"step": 1510,
"train/kl_loss_qwen": 0.024258351232856513,
"train/kl_loss_r1": 0.01617993521504104,
"train/total_kl": 0.04043828658759594
},
{
"epoch": 1.8858475894245723,
"grad_norm": 1.5,
"learning_rate": 1.584993773349938e-05,
"loss": 0.2934,
"mean_token_accuracy": 0.9597264170646668,
"step": 1515,
"train/kl_loss_qwen": 0.023380379332229494,
"train/kl_loss_r1": 0.013724281871691345,
"train/total_kl": 0.03710466120392084
},
{
"epoch": 1.892068429237947,
"grad_norm": 1.375,
"learning_rate": 1.5803237858032377e-05,
"loss": 0.2886,
"mean_token_accuracy": 0.9607859402894974,
"step": 1520,
"train/kl_loss_qwen": 0.021867345878854395,
"train/kl_loss_r1": 0.014179157582111657,
"train/total_kl": 0.036046503484249114
},
{
"epoch": 1.8982892690513218,
"grad_norm": 1.6484375,
"learning_rate": 1.575653798256538e-05,
"loss": 0.2992,
"mean_token_accuracy": 0.9605538129806519,
"step": 1525,
"train/kl_loss_qwen": 0.023080370994284748,
"train/kl_loss_r1": 0.01472889562137425,
"train/total_kl": 0.03780926624312997
},
{
"epoch": 1.9045101088646967,
"grad_norm": 1.875,
"learning_rate": 1.5709838107098382e-05,
"loss": 0.3005,
"mean_token_accuracy": 0.9580298513174057,
"step": 1530,
"train/kl_loss_qwen": 0.02314431550912559,
"train/kl_loss_r1": 0.013429639278911054,
"train/total_kl": 0.036573955044150355
},
{
"epoch": 1.9107309486780717,
"grad_norm": 1.390625,
"learning_rate": 1.566313823163138e-05,
"loss": 0.2749,
"mean_token_accuracy": 0.9649899780750275,
"step": 1535,
"train/kl_loss_qwen": 0.02057855702005327,
"train/kl_loss_r1": 0.014282949059270323,
"train/total_kl": 0.03486150596290827
},
{
"epoch": 1.9169517884914464,
"grad_norm": 1.3203125,
"learning_rate": 1.5616438356164384e-05,
"loss": 0.2972,
"mean_token_accuracy": 0.9626806735992431,
"step": 1540,
"train/kl_loss_qwen": 0.025072267558425666,
"train/kl_loss_r1": 0.015387872420251369,
"train/total_kl": 0.04046014007180929
},
{
"epoch": 1.9231726283048212,
"grad_norm": 1.6015625,
"learning_rate": 1.5569738480697383e-05,
"loss": 0.2917,
"mean_token_accuracy": 0.9622645407915116,
"step": 1545,
"train/kl_loss_qwen": 0.022078696498647334,
"train/kl_loss_r1": 0.014551608706824481,
"train/total_kl": 0.036630304995924234
},
{
"epoch": 1.929393468118196,
"grad_norm": 1.625,
"learning_rate": 1.5523038605230385e-05,
"loss": 0.3041,
"mean_token_accuracy": 0.9566681832075119,
"step": 1550,
"train/kl_loss_qwen": 0.02196988635696471,
"train/kl_loss_r1": 0.014778985898010433,
"train/total_kl": 0.03674887223169208
},
{
"epoch": 1.9356143079315706,
"grad_norm": 1.2890625,
"learning_rate": 1.5476338729763387e-05,
"loss": 0.3967,
"mean_token_accuracy": 0.9541066825389862,
"step": 1555,
"train/kl_loss_qwen": 0.03710188092663884,
"train/kl_loss_r1": 0.018790926854126155,
"train/total_kl": 0.055892806779593227
},
{
"epoch": 1.9418351477449456,
"grad_norm": 1.4296875,
"learning_rate": 1.5429638854296386e-05,
"loss": 0.3105,
"mean_token_accuracy": 0.9602783590555191,
"step": 1560,
"train/kl_loss_qwen": 0.02596303396858275,
"train/kl_loss_r1": 0.0147313819732517,
"train/total_kl": 0.040694416221231225
},
{
"epoch": 1.9480559875583203,
"grad_norm": 2.21875,
"learning_rate": 1.5382938978829392e-05,
"loss": 0.2919,
"mean_token_accuracy": 0.95930115878582,
"step": 1565,
"train/kl_loss_qwen": 0.02266333531588316,
"train/kl_loss_r1": 0.013036081078462302,
"train/total_kl": 0.03569941623136401
},
{
"epoch": 1.9542768273716953,
"grad_norm": 1.2421875,
"learning_rate": 1.5336239103362394e-05,
"loss": 0.3061,
"mean_token_accuracy": 0.9625548154115677,
"step": 1570,
"train/kl_loss_qwen": 0.026318618888035418,
"train/kl_loss_r1": 0.015444871853105724,
"train/total_kl": 0.04176349071785808
},
{
"epoch": 1.96049766718507,
"grad_norm": 1.515625,
"learning_rate": 1.5289539227895393e-05,
"loss": 0.2886,
"mean_token_accuracy": 0.9617161154747009,
"step": 1575,
"train/kl_loss_qwen": 0.02043143748305738,
"train/kl_loss_r1": 0.014007525471970438,
"train/total_kl": 0.03443896248936653
},
{
"epoch": 1.9667185069984447,
"grad_norm": 1.4453125,
"learning_rate": 1.5242839352428394e-05,
"loss": 0.296,
"mean_token_accuracy": 0.958229985833168,
"step": 1580,
"train/kl_loss_qwen": 0.020992166455835105,
"train/kl_loss_r1": 0.013891345215961337,
"train/total_kl": 0.03488351134583354
},
{
"epoch": 1.9729393468118195,
"grad_norm": 1.7109375,
"learning_rate": 1.5196139476961396e-05,
"loss": 0.303,
"mean_token_accuracy": 0.955667045712471,
"step": 1585,
"train/kl_loss_qwen": 0.021437043463811277,
"train/kl_loss_r1": 0.013299981201998889,
"train/total_kl": 0.03473702482879162
},
{
"epoch": 1.9791601866251944,
"grad_norm": 3.46875,
"learning_rate": 1.5149439601494397e-05,
"loss": 0.3863,
"mean_token_accuracy": 0.9547875672578812,
"step": 1590,
"train/kl_loss_qwen": 0.03339828597381711,
"train/kl_loss_r1": 0.019195286463946103,
"train/total_kl": 0.05259357215836644
},
{
"epoch": 1.9853810264385692,
"grad_norm": 1.40625,
"learning_rate": 1.5102739726027398e-05,
"loss": 0.302,
"mean_token_accuracy": 0.9607174038887024,
"step": 1595,
"train/kl_loss_qwen": 0.024118094984441996,
"train/kl_loss_r1": 0.015118178050033747,
"train/total_kl": 0.039236273430287835
},
{
"epoch": 1.9916018662519441,
"grad_norm": 1.234375,
"learning_rate": 1.5056039850560399e-05,
"loss": 0.2702,
"mean_token_accuracy": 0.9614597886800766,
"step": 1600,
"train/kl_loss_qwen": 0.02008180283010006,
"train/kl_loss_r1": 0.011453768424689769,
"train/total_kl": 0.031535571161657575
},
{
"epoch": 1.9978227060653189,
"grad_norm": 1.1640625,
"learning_rate": 1.5009339975093401e-05,
"loss": 0.2883,
"mean_token_accuracy": 0.9607007771730423,
"step": 1605,
"train/kl_loss_qwen": 0.023967621568590402,
"train/kl_loss_r1": 0.01288898903876543,
"train/total_kl": 0.03685661060735583
},
{
"epoch": 2.0049766718507,
"grad_norm": 1.3515625,
"learning_rate": 1.4962640099626402e-05,
"loss": 0.2945,
"mean_token_accuracy": 0.9731682376428084,
"step": 1610,
"train/kl_loss_qwen": 0.021845903649756856,
"train/kl_loss_r1": 0.012560325928709724,
"train/total_kl": 0.034406229599633
},
{
"epoch": 2.011197511664075,
"grad_norm": 1.1015625,
"learning_rate": 1.4915940224159402e-05,
"loss": 0.2426,
"mean_token_accuracy": 0.9784580409526825,
"step": 1615,
"train/kl_loss_qwen": 0.02075221575796604,
"train/kl_loss_r1": 0.012880782317370176,
"train/total_kl": 0.03363299807533622
},
{
"epoch": 2.0174183514774495,
"grad_norm": 0.95703125,
"learning_rate": 1.4869240348692403e-05,
"loss": 0.2472,
"mean_token_accuracy": 0.9778133362531662,
"step": 1620,
"train/kl_loss_qwen": 0.02218270841985941,
"train/kl_loss_r1": 0.012616124283522368,
"train/total_kl": 0.03479883261024952
},
{
"epoch": 2.0236391912908243,
"grad_norm": 0.9296875,
"learning_rate": 1.4822540473225404e-05,
"loss": 0.2411,
"mean_token_accuracy": 0.9795323252677918,
"step": 1625,
"train/kl_loss_qwen": 0.021198717644438148,
"train/kl_loss_r1": 0.013453285675495863,
"train/total_kl": 0.034652003180235626
},
{
"epoch": 2.029860031104199,
"grad_norm": 0.9765625,
"learning_rate": 1.4775840597758408e-05,
"loss": 0.2423,
"mean_token_accuracy": 0.9800434708595276,
"step": 1630,
"train/kl_loss_qwen": 0.02066632085479796,
"train/kl_loss_r1": 0.014415074535645545,
"train/total_kl": 0.03508139550685883
},
{
"epoch": 2.0360808709175737,
"grad_norm": 1.1015625,
"learning_rate": 1.4729140722291408e-05,
"loss": 0.2389,
"mean_token_accuracy": 0.9806335180997848,
"step": 1635,
"train/kl_loss_qwen": 0.02023201258853078,
"train/kl_loss_r1": 0.01314310000743717,
"train/total_kl": 0.0333751130849123
},
{
"epoch": 2.0423017107309485,
"grad_norm": 1.0078125,
"learning_rate": 1.4682440846824409e-05,
"loss": 0.2651,
"mean_token_accuracy": 0.9811090856790543,
"step": 1640,
"train/kl_loss_qwen": 0.024384100595489143,
"train/kl_loss_r1": 0.016845971532166003,
"train/total_kl": 0.04123007152229548
},
{
"epoch": 2.0485225505443236,
"grad_norm": 0.828125,
"learning_rate": 1.463574097135741e-05,
"loss": 0.244,
"mean_token_accuracy": 0.9806887865066528,
"step": 1645,
"train/kl_loss_qwen": 0.02161189350299537,
"train/kl_loss_r1": 0.01435529210139066,
"train/total_kl": 0.035967185720801355
},
{
"epoch": 2.0547433903576984,
"grad_norm": 1.1015625,
"learning_rate": 1.4589041095890412e-05,
"loss": 0.2589,
"mean_token_accuracy": 0.9809038013219833,
"step": 1650,
"train/kl_loss_qwen": 0.023991528805345295,
"train/kl_loss_r1": 0.015264363773167134,
"train/total_kl": 0.039255892764776944
},
{
"epoch": 2.060964230171073,
"grad_norm": 0.96484375,
"learning_rate": 1.4542341220423413e-05,
"loss": 0.2429,
"mean_token_accuracy": 0.9789062738418579,
"step": 1655,
"train/kl_loss_qwen": 0.020654200948774813,
"train/kl_loss_r1": 0.013649226189590991,
"train/total_kl": 0.03430342748761177
},
{
"epoch": 2.067185069984448,
"grad_norm": 2.1875,
"learning_rate": 1.4495641344956414e-05,
"loss": 0.3744,
"mean_token_accuracy": 0.9751468390226364,
"step": 1660,
"train/kl_loss_qwen": 0.03906259112991393,
"train/kl_loss_r1": 0.020116307865828277,
"train/total_kl": 0.05917889960110188
},
{
"epoch": 2.0734059097978226,
"grad_norm": 1.1015625,
"learning_rate": 1.4448941469489414e-05,
"loss": 0.2823,
"mean_token_accuracy": 0.977814581990242,
"step": 1665,
"train/kl_loss_qwen": 0.02684653955511749,
"train/kl_loss_r1": 0.016426597093231975,
"train/total_kl": 0.04327313648536801
},
{
"epoch": 2.0796267496111973,
"grad_norm": 0.890625,
"learning_rate": 1.4402241594022415e-05,
"loss": 0.241,
"mean_token_accuracy": 0.978304636478424,
"step": 1670,
"train/kl_loss_qwen": 0.01918859565630555,
"train/kl_loss_r1": 0.012731851963326334,
"train/total_kl": 0.03192044720053673
},
{
"epoch": 2.0858475894245725,
"grad_norm": 1.0703125,
"learning_rate": 1.4355541718555419e-05,
"loss": 0.2495,
"mean_token_accuracy": 0.9780581414699554,
"step": 1675,
"train/kl_loss_qwen": 0.022329255240038037,
"train/kl_loss_r1": 0.013668485963717104,
"train/total_kl": 0.035997741110622886
},
{
"epoch": 2.0920684292379472,
"grad_norm": 2.0,
"learning_rate": 1.430884184308842e-05,
"loss": 0.3164,
"mean_token_accuracy": 0.973807492852211,
"step": 1680,
"train/kl_loss_qwen": 0.0302242751698941,
"train/kl_loss_r1": 0.01509574861265719,
"train/total_kl": 0.045320024248212576
},
{
"epoch": 2.098289269051322,
"grad_norm": 0.99609375,
"learning_rate": 1.426214196762142e-05,
"loss": 0.2657,
"mean_token_accuracy": 0.9796731650829316,
"step": 1685,
"train/kl_loss_qwen": 0.024477861635386945,
"train/kl_loss_r1": 0.016039001010358333,
"train/total_kl": 0.04051686236634851
},
{
"epoch": 2.1045101088646967,
"grad_norm": 0.96484375,
"learning_rate": 1.4215442092154421e-05,
"loss": 0.2612,
"mean_token_accuracy": 0.9790675967931748,
"step": 1690,
"train/kl_loss_qwen": 0.02389554716646671,
"train/kl_loss_r1": 0.01507699298672378,
"train/total_kl": 0.03897254019975662
},
{
"epoch": 2.1107309486780714,
"grad_norm": 1.0546875,
"learning_rate": 1.4168742216687423e-05,
"loss": 0.3605,
"mean_token_accuracy": 0.9704611152410507,
"step": 1695,
"train/kl_loss_qwen": 0.03224745257757604,
"train/kl_loss_r1": 0.017923418898135424,
"train/total_kl": 0.05017087059095502
},
{
"epoch": 2.116951788491446,
"grad_norm": 0.92578125,
"learning_rate": 1.4122042341220424e-05,
"loss": 0.2689,
"mean_token_accuracy": 0.9798552840948105,
"step": 1700,
"train/kl_loss_qwen": 0.023866656003519893,
"train/kl_loss_r1": 0.01644910844042897,
"train/total_kl": 0.040315764397382735
},
{
"epoch": 2.1231726283048213,
"grad_norm": 1.0546875,
"learning_rate": 1.4075342465753425e-05,
"loss": 0.2528,
"mean_token_accuracy": 0.9789301216602325,
"step": 1705,
"train/kl_loss_qwen": 0.022611541347578167,
"train/kl_loss_r1": 0.014065819093957543,
"train/total_kl": 0.0366773602552712
},
{
"epoch": 2.129393468118196,
"grad_norm": 0.921875,
"learning_rate": 1.4028642590286425e-05,
"loss": 0.2394,
"mean_token_accuracy": 0.9789743661880493,
"step": 1710,
"train/kl_loss_qwen": 0.020024046860635282,
"train/kl_loss_r1": 0.012307545309886337,
"train/total_kl": 0.03233159258961678
},
{
"epoch": 2.135614307931571,
"grad_norm": 1.0390625,
"learning_rate": 1.3981942714819426e-05,
"loss": 0.2393,
"mean_token_accuracy": 0.9808943539857864,
"step": 1715,
"train/kl_loss_qwen": 0.022391148284077643,
"train/kl_loss_r1": 0.013058097870089113,
"train/total_kl": 0.03544924585148692
},
{
"epoch": 2.1418351477449455,
"grad_norm": 1.734375,
"learning_rate": 1.393524283935243e-05,
"loss": 0.2753,
"mean_token_accuracy": 0.9771335572004318,
"step": 1720,
"train/kl_loss_qwen": 0.024992619268596174,
"train/kl_loss_r1": 0.01562864559236914,
"train/total_kl": 0.04062126437202096
},
{
"epoch": 2.1480559875583203,
"grad_norm": 1.34375,
"learning_rate": 1.388854296388543e-05,
"loss": 0.242,
"mean_token_accuracy": 0.9794571280479432,
"step": 1725,
"train/kl_loss_qwen": 0.02109189019538462,
"train/kl_loss_r1": 0.013026425126008689,
"train/total_kl": 0.03411831529811025
},
{
"epoch": 2.154276827371695,
"grad_norm": 1.1171875,
"learning_rate": 1.3841843088418432e-05,
"loss": 0.2591,
"mean_token_accuracy": 0.9810844957828522,
"step": 1730,
"train/kl_loss_qwen": 0.024620172381401063,
"train/kl_loss_r1": 0.01482275347225368,
"train/total_kl": 0.039442925900220874
},
{
"epoch": 2.16049766718507,
"grad_norm": 1.1640625,
"learning_rate": 1.3795143212951432e-05,
"loss": 0.2633,
"mean_token_accuracy": 0.9778509587049484,
"step": 1735,
"train/kl_loss_qwen": 0.024361231364309788,
"train/kl_loss_r1": 0.01404720451682806,
"train/total_kl": 0.03840843569487333
},
{
"epoch": 2.166718506998445,
"grad_norm": 0.97265625,
"learning_rate": 1.3748443337484433e-05,
"loss": 0.2285,
"mean_token_accuracy": 0.9812567800283432,
"step": 1740,
"train/kl_loss_qwen": 0.02088723029009998,
"train/kl_loss_r1": 0.011959241493605078,
"train/total_kl": 0.032846471574157474
},
{
"epoch": 2.1729393468118197,
"grad_norm": 0.9765625,
"learning_rate": 1.3701743462017435e-05,
"loss": 0.2489,
"mean_token_accuracy": 0.9805923402309418,
"step": 1745,
"train/kl_loss_qwen": 0.022857177117839456,
"train/kl_loss_r1": 0.014695218997076154,
"train/total_kl": 0.037552396580576894
},
{
"epoch": 2.1791601866251944,
"grad_norm": 1.078125,
"learning_rate": 1.3655043586550436e-05,
"loss": 0.2526,
"mean_token_accuracy": 0.9761855214834213,
"step": 1750,
"train/kl_loss_qwen": 0.021363981626927854,
"train/kl_loss_r1": 0.012706464645452798,
"train/total_kl": 0.034070446714758874
},
{
"epoch": 2.185381026438569,
"grad_norm": 1.4140625,
"learning_rate": 1.3608343711083437e-05,
"loss": 0.2522,
"mean_token_accuracy": 0.9779788672924041,
"step": 1755,
"train/kl_loss_qwen": 0.021653601573780178,
"train/kl_loss_r1": 0.013945041154511274,
"train/total_kl": 0.03559864275157452
},
{
"epoch": 2.191601866251944,
"grad_norm": 0.93359375,
"learning_rate": 1.3561643835616437e-05,
"loss": 0.3356,
"mean_token_accuracy": 0.9763142317533493,
"step": 1760,
"train/kl_loss_qwen": 0.034495850279927256,
"train/kl_loss_r1": 0.01701771658845246,
"train/total_kl": 0.0515135663561523
},
{
"epoch": 2.1978227060653186,
"grad_norm": 1.234375,
"learning_rate": 1.3514943960149441e-05,
"loss": 0.2481,
"mean_token_accuracy": 0.9769844710826874,
"step": 1765,
"train/kl_loss_qwen": 0.022623211657628418,
"train/kl_loss_r1": 0.012992961728014053,
"train/total_kl": 0.035616173036396505
},
{
"epoch": 2.2040435458786938,
"grad_norm": 1.3203125,
"learning_rate": 1.3468244084682442e-05,
"loss": 0.2441,
"mean_token_accuracy": 0.9772080987691879,
"step": 1770,
"train/kl_loss_qwen": 0.02268908736295998,
"train/kl_loss_r1": 0.012291538529098034,
"train/total_kl": 0.034980626031756404
},
{
"epoch": 2.2102643856920685,
"grad_norm": 1.0859375,
"learning_rate": 1.3421544209215443e-05,
"loss": 0.2388,
"mean_token_accuracy": 0.9795448333024979,
"step": 1775,
"train/kl_loss_qwen": 0.019983268249779938,
"train/kl_loss_r1": 0.013864303706213832,
"train/total_kl": 0.033847571816295385
},
{
"epoch": 2.2164852255054432,
"grad_norm": 1.0625,
"learning_rate": 1.3374844333748443e-05,
"loss": 0.2366,
"mean_token_accuracy": 0.9784791618585587,
"step": 1780,
"train/kl_loss_qwen": 0.02112103491090238,
"train/kl_loss_r1": 0.012184371682815253,
"train/total_kl": 0.03330540684983134
},
{
"epoch": 2.222706065318818,
"grad_norm": 1.1484375,
"learning_rate": 1.3328144458281444e-05,
"loss": 0.2326,
"mean_token_accuracy": 0.978312885761261,
"step": 1785,
"train/kl_loss_qwen": 0.019464704208076,
"train/kl_loss_r1": 0.011881216848269104,
"train/total_kl": 0.031345921102911234
},
{
"epoch": 2.2289269051321927,
"grad_norm": 0.96875,
"learning_rate": 1.3281444582814446e-05,
"loss": 0.2322,
"mean_token_accuracy": 0.9802702635526657,
"step": 1790,
"train/kl_loss_qwen": 0.019677631743252277,
"train/kl_loss_r1": 0.0136221659835428,
"train/total_kl": 0.03329979768022895
},
{
"epoch": 2.2351477449455674,
"grad_norm": 1.203125,
"learning_rate": 1.3234744707347447e-05,
"loss": 0.2517,
"mean_token_accuracy": 0.9778961509466171,
"step": 1795,
"train/kl_loss_qwen": 0.023012708965688945,
"train/kl_loss_r1": 0.013481559325009584,
"train/total_kl": 0.03649426787160337
},
{
"epoch": 2.2413685847589426,
"grad_norm": 0.8125,
"learning_rate": 1.3188044831880448e-05,
"loss": 0.2359,
"mean_token_accuracy": 0.9810913383960724,
"step": 1800,
"train/kl_loss_qwen": 0.021271700272336602,
"train/kl_loss_r1": 0.013056211965158581,
"train/total_kl": 0.034327912330627444
},
{
"epoch": 2.2475894245723174,
"grad_norm": 0.99609375,
"learning_rate": 1.3141344956413449e-05,
"loss": 0.2346,
"mean_token_accuracy": 0.9790261298418045,
"step": 1805,
"train/kl_loss_qwen": 0.020045140152797104,
"train/kl_loss_r1": 0.01360967019572854,
"train/total_kl": 0.033654810208827254
},
{
"epoch": 2.253810264385692,
"grad_norm": 1.046875,
"learning_rate": 1.3094645080946453e-05,
"loss": 0.2477,
"mean_token_accuracy": 0.9797742009162903,
"step": 1810,
"train/kl_loss_qwen": 0.02143171979114413,
"train/kl_loss_r1": 0.013752156216651202,
"train/total_kl": 0.035183876287192106
},
{
"epoch": 2.260031104199067,
"grad_norm": 0.9921875,
"learning_rate": 1.3047945205479453e-05,
"loss": 0.2532,
"mean_token_accuracy": 0.9792828232049942,
"step": 1815,
"train/kl_loss_qwen": 0.021182486787438393,
"train/kl_loss_r1": 0.01435540292877704,
"train/total_kl": 0.035537889786064626
},
{
"epoch": 2.2662519440124416,
"grad_norm": 1.5,
"learning_rate": 1.3001245330012454e-05,
"loss": 0.4353,
"mean_token_accuracy": 0.9699081629514694,
"step": 1820,
"train/kl_loss_qwen": 0.04558118330314755,
"train/kl_loss_r1": 0.023637999431230128,
"train/total_kl": 0.06921918261796237
},
{
"epoch": 2.2724727838258163,
"grad_norm": 1.078125,
"learning_rate": 1.2954545454545455e-05,
"loss": 0.2321,
"mean_token_accuracy": 0.9784551143646241,
"step": 1825,
"train/kl_loss_qwen": 0.01986483633518219,
"train/kl_loss_r1": 0.012468844978138804,
"train/total_kl": 0.032333681266754864
},
{
"epoch": 2.2786936236391915,
"grad_norm": 1.1640625,
"learning_rate": 1.2907845579078455e-05,
"loss": 0.2454,
"mean_token_accuracy": 0.97675521671772,
"step": 1830,
"train/kl_loss_qwen": 0.02059942428022623,
"train/kl_loss_r1": 0.01287925757933408,
"train/total_kl": 0.03347868211567402
},
{
"epoch": 2.284914463452566,
"grad_norm": 0.97265625,
"learning_rate": 1.2861145703611458e-05,
"loss": 0.2431,
"mean_token_accuracy": 0.9791501730680465,
"step": 1835,
"train/kl_loss_qwen": 0.021640143543481826,
"train/kl_loss_r1": 0.013920898968353867,
"train/total_kl": 0.035561042837798595
},
{
"epoch": 2.291135303265941,
"grad_norm": 3.15625,
"learning_rate": 1.2814445828144458e-05,
"loss": 0.271,
"mean_token_accuracy": 0.979482638835907,
"step": 1840,
"train/kl_loss_qwen": 0.02593438569456339,
"train/kl_loss_r1": 0.015126829454675316,
"train/total_kl": 0.04106121482327581
},
{
"epoch": 2.2973561430793157,
"grad_norm": 1.1484375,
"learning_rate": 1.2767745952677459e-05,
"loss": 0.2398,
"mean_token_accuracy": 0.9809309899806976,
"step": 1845,
"train/kl_loss_qwen": 0.022775299800559878,
"train/kl_loss_r1": 0.01402155626565218,
"train/total_kl": 0.036796855833381416
},
{
"epoch": 2.3035769828926904,
"grad_norm": 0.95703125,
"learning_rate": 1.272104607721046e-05,
"loss": 0.2934,
"mean_token_accuracy": 0.9758806467056275,
"step": 1850,
"train/kl_loss_qwen": 0.02778648091480136,
"train/kl_loss_r1": 0.01586297785397619,
"train/total_kl": 0.043649458419531585
},
{
"epoch": 2.309797822706065,
"grad_norm": 0.828125,
"learning_rate": 1.2674346201743464e-05,
"loss": 0.2401,
"mean_token_accuracy": 0.9825777590274811,
"step": 1855,
"train/kl_loss_qwen": 0.021009960398077964,
"train/kl_loss_r1": 0.01420710023958236,
"train/total_kl": 0.03521706024184823
},
{
"epoch": 2.31601866251944,
"grad_norm": 1.2734375,
"learning_rate": 1.2627646326276464e-05,
"loss": 0.2827,
"mean_token_accuracy": 0.9746395200490952,
"step": 1860,
"train/kl_loss_qwen": 0.024723251862451435,
"train/kl_loss_r1": 0.015186823182739317,
"train/total_kl": 0.03991007544100285
},
{
"epoch": 2.322239502332815,
"grad_norm": 1.0625,
"learning_rate": 1.2580946450809465e-05,
"loss": 0.2482,
"mean_token_accuracy": 0.9802426367998123,
"step": 1865,
"train/kl_loss_qwen": 0.0225432176142931,
"train/kl_loss_r1": 0.013892730651423334,
"train/total_kl": 0.036435948219150305
},
{
"epoch": 2.32846034214619,
"grad_norm": 1.2734375,
"learning_rate": 1.2534246575342466e-05,
"loss": 0.2551,
"mean_token_accuracy": 0.9752663284540176,
"step": 1870,
"train/kl_loss_qwen": 0.02081627896986902,
"train/kl_loss_r1": 0.013366595236584544,
"train/total_kl": 0.034182874485850334
},
{
"epoch": 2.3346811819595645,
"grad_norm": 1.109375,
"learning_rate": 1.2487546699875467e-05,
"loss": 0.2517,
"mean_token_accuracy": 0.9780875205993652,
"step": 1875,
"train/kl_loss_qwen": 0.02112504974938929,
"train/kl_loss_r1": 0.015057702036574482,
"train/total_kl": 0.036182751413434744
},
{
"epoch": 2.3409020217729393,
"grad_norm": 1.234375,
"learning_rate": 1.2440846824408469e-05,
"loss": 0.2783,
"mean_token_accuracy": 0.9777207732200622,
"step": 1880,
"train/kl_loss_qwen": 0.026220168406143784,
"train/kl_loss_r1": 0.0165558461798355,
"train/total_kl": 0.042776014655828476
},
{
"epoch": 2.347122861586314,
"grad_norm": 1.046875,
"learning_rate": 1.239414694894147e-05,
"loss": 0.2401,
"mean_token_accuracy": 0.9795249253511429,
"step": 1885,
"train/kl_loss_qwen": 0.022062430484220387,
"train/kl_loss_r1": 0.01306857680901885,
"train/total_kl": 0.03513100752606988
},
{
"epoch": 2.353343701399689,
"grad_norm": 0.90625,
"learning_rate": 1.234744707347447e-05,
"loss": 0.2305,
"mean_token_accuracy": 0.9795470297336578,
"step": 1890,
"train/kl_loss_qwen": 0.019669259851798414,
"train/kl_loss_r1": 0.013222256046719848,
"train/total_kl": 0.032891515735536815
},
{
"epoch": 2.359564541213064,
"grad_norm": 0.8125,
"learning_rate": 1.2300747198007471e-05,
"loss": 0.2622,
"mean_token_accuracy": 0.9815815418958664,
"step": 1895,
"train/kl_loss_qwen": 0.02579428404569626,
"train/kl_loss_r1": 0.01565156860742718,
"train/total_kl": 0.04144585244357586
},
{
"epoch": 2.3657853810264386,
"grad_norm": 1.2890625,
"learning_rate": 1.2254047322540475e-05,
"loss": 0.2564,
"mean_token_accuracy": 0.9784956514835358,
"step": 1900,
"train/kl_loss_qwen": 0.022114967973902822,
"train/kl_loss_r1": 0.013662851555272937,
"train/total_kl": 0.03577781962230801
},
{
"epoch": 2.3720062208398134,
"grad_norm": 1.390625,
"learning_rate": 1.2207347447073476e-05,
"loss": 0.3352,
"mean_token_accuracy": 0.9750847607851029,
"step": 1905,
"train/kl_loss_qwen": 0.03689875598065555,
"train/kl_loss_r1": 0.016696492512710392,
"train/total_kl": 0.05359524823725224
},
{
"epoch": 2.378227060653188,
"grad_norm": 1.0703125,
"learning_rate": 1.2160647571606476e-05,
"loss": 0.2371,
"mean_token_accuracy": 0.9770203292369842,
"step": 1910,
"train/kl_loss_qwen": 0.019168762071058155,
"train/kl_loss_r1": 0.012693860824219883,
"train/total_kl": 0.03186262277886272
},
{
"epoch": 2.384447900466563,
"grad_norm": 0.94921875,
"learning_rate": 1.2113947696139477e-05,
"loss": 0.2373,
"mean_token_accuracy": 0.9789462387561798,
"step": 1915,
"train/kl_loss_qwen": 0.021564632654190063,
"train/kl_loss_r1": 0.012719874107278883,
"train/total_kl": 0.03428450655192137
},
{
"epoch": 2.3906687402799376,
"grad_norm": 1.4140625,
"learning_rate": 1.2067247820672478e-05,
"loss": 0.2346,
"mean_token_accuracy": 0.9807638555765152,
"step": 1920,
"train/kl_loss_qwen": 0.01933746659196913,
"train/kl_loss_r1": 0.013734246650710703,
"train/total_kl": 0.03307171277701855
},
{
"epoch": 2.3968895800933128,
"grad_norm": 1.3515625,
"learning_rate": 1.202054794520548e-05,
"loss": 0.2588,
"mean_token_accuracy": 0.9800190776586533,
"step": 1925,
"train/kl_loss_qwen": 0.02418329380452633,
"train/kl_loss_r1": 0.015474402927793562,
"train/total_kl": 0.03965769670903683
},
{
"epoch": 2.4031104199066875,
"grad_norm": 1.1171875,
"learning_rate": 1.197384806973848e-05,
"loss": 0.2492,
"mean_token_accuracy": 0.9790872097015381,
"step": 1930,
"train/kl_loss_qwen": 0.022408964531496166,
"train/kl_loss_r1": 0.013171161222271622,
"train/total_kl": 0.035580125823616984
},
{
"epoch": 2.4093312597200622,
"grad_norm": 1.0546875,
"learning_rate": 1.1927148194271482e-05,
"loss": 0.2521,
"mean_token_accuracy": 0.9767476886510849,
"step": 1935,
"train/kl_loss_qwen": 0.02167391194961965,
"train/kl_loss_r1": 0.014151084562763571,
"train/total_kl": 0.035824996419250965
},
{
"epoch": 2.415552099533437,
"grad_norm": 1.296875,
"learning_rate": 1.1880448318804482e-05,
"loss": 0.2498,
"mean_token_accuracy": 0.978100472688675,
"step": 1940,
"train/kl_loss_qwen": 0.02200420745648444,
"train/kl_loss_r1": 0.014483575685881078,
"train/total_kl": 0.03648778265342116
},
{
"epoch": 2.4217729393468117,
"grad_norm": 1.1875,
"learning_rate": 1.1833748443337485e-05,
"loss": 0.2496,
"mean_token_accuracy": 0.9778286337852478,
"step": 1945,
"train/kl_loss_qwen": 0.022651279880665242,
"train/kl_loss_r1": 0.013287181942723691,
"train/total_kl": 0.03593846196308732
},
{
"epoch": 2.4279937791601864,
"grad_norm": 1.7109375,
"learning_rate": 1.1787048567870487e-05,
"loss": 0.2598,
"mean_token_accuracy": 0.977265328168869,
"step": 1950,
"train/kl_loss_qwen": 0.02262912839651108,
"train/kl_loss_r1": 0.014686035527847707,
"train/total_kl": 0.03731516385450959
},
{
"epoch": 2.4342146189735616,
"grad_norm": 2.234375,
"learning_rate": 1.1740348692403488e-05,
"loss": 0.3154,
"mean_token_accuracy": 0.974388661980629,
"step": 1955,
"train/kl_loss_qwen": 0.031231827940791844,
"train/kl_loss_r1": 0.01720571951009333,
"train/total_kl": 0.04843754768371582
},
{
"epoch": 2.4404354587869364,
"grad_norm": 0.8203125,
"learning_rate": 1.1693648816936488e-05,
"loss": 0.2214,
"mean_token_accuracy": 0.9811009198427201,
"step": 1960,
"train/kl_loss_qwen": 0.01896182936616242,
"train/kl_loss_r1": 0.011808227049186826,
"train/total_kl": 0.030770056508481504
},
{
"epoch": 2.446656298600311,
"grad_norm": 1.125,
"learning_rate": 1.1646948941469489e-05,
"loss": 0.2434,
"mean_token_accuracy": 0.9757021725177765,
"step": 1965,
"train/kl_loss_qwen": 0.01998060490004718,
"train/kl_loss_r1": 0.012626229273155331,
"train/total_kl": 0.03260683408007026
},
{
"epoch": 2.452877138413686,
"grad_norm": 1.0703125,
"learning_rate": 1.1600249066002491e-05,
"loss": 0.2558,
"mean_token_accuracy": 0.9779347211122513,
"step": 1970,
"train/kl_loss_qwen": 0.021612715255469084,
"train/kl_loss_r1": 0.013517844607122242,
"train/total_kl": 0.03513055983930826
},
{
"epoch": 2.4590979782270606,
"grad_norm": 1.21875,
"learning_rate": 1.1553549190535492e-05,
"loss": 0.2521,
"mean_token_accuracy": 0.9801371067762374,
"step": 1975,
"train/kl_loss_qwen": 0.02266769213601947,
"train/kl_loss_r1": 0.014395871269516646,
"train/total_kl": 0.037063563149422406
},
{
"epoch": 2.4653188180404353,
"grad_norm": 1.421875,
"learning_rate": 1.1506849315068493e-05,
"loss": 0.2738,
"mean_token_accuracy": 0.9786773502826691,
"step": 1980,
"train/kl_loss_qwen": 0.02531546037644148,
"train/kl_loss_r1": 0.015837101102806627,
"train/total_kl": 0.04115256136283278
},
{
"epoch": 2.4715396578538105,
"grad_norm": 0.96484375,
"learning_rate": 1.1460149439601493e-05,
"loss": 0.2666,
"mean_token_accuracy": 0.9820117831230164,
"step": 1985,
"train/kl_loss_qwen": 0.025500294240191578,
"train/kl_loss_r1": 0.017055929615162314,
"train/total_kl": 0.042556223925203085
},
{
"epoch": 2.477760497667185,
"grad_norm": 1.0703125,
"learning_rate": 1.1413449564134496e-05,
"loss": 0.2625,
"mean_token_accuracy": 0.9783152371644974,
"step": 1990,
"train/kl_loss_qwen": 0.022538991970941426,
"train/kl_loss_r1": 0.01549134326633066,
"train/total_kl": 0.03803033493459225
},
{
"epoch": 2.48398133748056,
"grad_norm": 0.9140625,
"learning_rate": 1.1366749688667498e-05,
"loss": 0.2557,
"mean_token_accuracy": 0.9759873390197754,
"step": 1995,
"train/kl_loss_qwen": 0.02168611092492938,
"train/kl_loss_r1": 0.01415776691865176,
"train/total_kl": 0.03584387795999646
},
{
"epoch": 2.4902021772939347,
"grad_norm": 1.140625,
"learning_rate": 1.1320049813200499e-05,
"loss": 0.2739,
"mean_token_accuracy": 0.9793085306882858,
"step": 2000,
"train/kl_loss_qwen": 0.02674374058842659,
"train/kl_loss_r1": 0.01565704217646271,
"train/total_kl": 0.04240078274160623
},
{
"epoch": 2.4964230171073094,
"grad_norm": 0.99609375,
"learning_rate": 1.12733499377335e-05,
"loss": 0.3333,
"mean_token_accuracy": 0.9758429080247879,
"step": 2005,
"train/kl_loss_qwen": 0.03534267195500433,
"train/kl_loss_r1": 0.015796015737578273,
"train/total_kl": 0.05113868797197938
},
{
"epoch": 2.502643856920684,
"grad_norm": 1.15625,
"learning_rate": 1.12266500622665e-05,
"loss": 0.2685,
"mean_token_accuracy": 0.9771882861852645,
"step": 2010,
"train/kl_loss_qwen": 0.02408771966584027,
"train/kl_loss_r1": 0.014890200644731521,
"train/total_kl": 0.038977920450270175
},
{
"epoch": 2.508864696734059,
"grad_norm": 1.3359375,
"learning_rate": 1.1179950186799503e-05,
"loss": 0.2471,
"mean_token_accuracy": 0.9786090284585953,
"step": 2015,
"train/kl_loss_qwen": 0.021793363522738217,
"train/kl_loss_r1": 0.012957709864713252,
"train/total_kl": 0.03475107317790389
},
{
"epoch": 2.515085536547434,
"grad_norm": 0.9765625,
"learning_rate": 1.1133250311332503e-05,
"loss": 0.2501,
"mean_token_accuracy": 0.981274637579918,
"step": 2020,
"train/kl_loss_qwen": 0.023206943599507212,
"train/kl_loss_r1": 0.013862681039609016,
"train/total_kl": 0.03706962484866381
},
{
"epoch": 2.521306376360809,
"grad_norm": 0.96484375,
"learning_rate": 1.1086550435865504e-05,
"loss": 0.2465,
"mean_token_accuracy": 0.9786695569753647,
"step": 2025,
"train/kl_loss_qwen": 0.020848573138937353,
"train/kl_loss_r1": 0.0137579798232764,
"train/total_kl": 0.03460655324161053
},
{
"epoch": 2.5275272161741835,
"grad_norm": 0.98828125,
"learning_rate": 1.1039850560398506e-05,
"loss": 0.2439,
"mean_token_accuracy": 0.9790724396705628,
"step": 2030,
"train/kl_loss_qwen": 0.021428097784519196,
"train/kl_loss_r1": 0.012936983909457921,
"train/total_kl": 0.03436508160084486
},
{
"epoch": 2.5337480559875583,
"grad_norm": 0.921875,
"learning_rate": 1.0993150684931507e-05,
"loss": 0.2571,
"mean_token_accuracy": 0.9793956607580185,
"step": 2035,
"train/kl_loss_qwen": 0.0228791618719697,
"train/kl_loss_r1": 0.015054402546957136,
"train/total_kl": 0.037933564838021995
},
{
"epoch": 2.539968895800933,
"grad_norm": 0.96484375,
"learning_rate": 1.094645080946451e-05,
"loss": 0.3809,
"mean_token_accuracy": 0.975305300951004,
"step": 2040,
"train/kl_loss_qwen": 0.0327933412976563,
"train/kl_loss_r1": 0.02881522406823933,
"train/total_kl": 0.061608564015477894
},
{
"epoch": 2.546189735614308,
"grad_norm": 0.9140625,
"learning_rate": 1.089975093399751e-05,
"loss": 0.2729,
"mean_token_accuracy": 0.9835954070091247,
"step": 2045,
"train/kl_loss_qwen": 0.02814694056287408,
"train/kl_loss_r1": 0.01594695230014622,
"train/total_kl": 0.04409389290958643
},
{
"epoch": 2.5524105754276825,
"grad_norm": 1.0234375,
"learning_rate": 1.085305105853051e-05,
"loss": 0.264,
"mean_token_accuracy": 0.9798797309398651,
"step": 2050,
"train/kl_loss_qwen": 0.024475245364010335,
"train/kl_loss_r1": 0.014863114035688341,
"train/total_kl": 0.03933835970237851
},
{
"epoch": 2.5586314152410576,
"grad_norm": 1.125,
"learning_rate": 1.0806351183063511e-05,
"loss": 0.2793,
"mean_token_accuracy": 0.9761617630720139,
"step": 2055,
"train/kl_loss_qwen": 0.023740977654233573,
"train/kl_loss_r1": 0.016528584342449904,
"train/total_kl": 0.04026956185698509
},
{
"epoch": 2.5648522550544324,
"grad_norm": 1.171875,
"learning_rate": 1.0759651307596514e-05,
"loss": 0.3036,
"mean_token_accuracy": 0.9757337421178818,
"step": 2060,
"train/kl_loss_qwen": 0.031403438979759814,
"train/kl_loss_r1": 0.014756415458396076,
"train/total_kl": 0.04615985546261072
},
{
"epoch": 2.571073094867807,
"grad_norm": 0.953125,
"learning_rate": 1.0712951432129514e-05,
"loss": 0.2439,
"mean_token_accuracy": 0.9786640286445618,
"step": 2065,
"train/kl_loss_qwen": 0.022552527487277985,
"train/kl_loss_r1": 0.012621782696805894,
"train/total_kl": 0.035174309927970174
},
{
"epoch": 2.577293934681182,
"grad_norm": 0.8515625,
"learning_rate": 1.0666251556662515e-05,
"loss": 0.2411,
"mean_token_accuracy": 0.9811136335134506,
"step": 2070,
"train/kl_loss_qwen": 0.02110184049233794,
"train/kl_loss_r1": 0.014247958501800894,
"train/total_kl": 0.03534979866817593
},
{
"epoch": 2.5835147744945566,
"grad_norm": 1.53125,
"learning_rate": 1.0619551681195518e-05,
"loss": 0.2487,
"mean_token_accuracy": 0.978958186507225,
"step": 2075,
"train/kl_loss_qwen": 0.0206217001657933,
"train/kl_loss_r1": 0.013504683272913098,
"train/total_kl": 0.03412638353183865
},
{
"epoch": 2.5897356143079318,
"grad_norm": 0.88671875,
"learning_rate": 1.0572851805728518e-05,
"loss": 0.2444,
"mean_token_accuracy": 0.9794360756874084,
"step": 2080,
"train/kl_loss_qwen": 0.021966875065118074,
"train/kl_loss_r1": 0.013504690513946116,
"train/total_kl": 0.035471565742045644
},
{
"epoch": 2.5959564541213065,
"grad_norm": 1.453125,
"learning_rate": 1.052615193026152e-05,
"loss": 0.2507,
"mean_token_accuracy": 0.980023518204689,
"step": 2085,
"train/kl_loss_qwen": 0.022249753633514047,
"train/kl_loss_r1": 0.013989573833532632,
"train/total_kl": 0.03623932776972651
},
{
"epoch": 2.6021772939346812,
"grad_norm": 1.1171875,
"learning_rate": 1.0479452054794521e-05,
"loss": 0.2527,
"mean_token_accuracy": 0.9773518353700638,
"step": 2090,
"train/kl_loss_qwen": 0.021709746960550547,
"train/kl_loss_r1": 0.013672297820448875,
"train/total_kl": 0.03538204478099942
},
{
"epoch": 2.608398133748056,
"grad_norm": 1.0390625,
"learning_rate": 1.0432752179327522e-05,
"loss": 0.255,
"mean_token_accuracy": 0.9789919286966324,
"step": 2095,
"train/kl_loss_qwen": 0.02221295302733779,
"train/kl_loss_r1": 0.01521359293255955,
"train/total_kl": 0.03742654556408524
},
{
"epoch": 2.6146189735614307,
"grad_norm": 1.0546875,
"learning_rate": 1.0386052303860523e-05,
"loss": 0.2456,
"mean_token_accuracy": 0.9789235025644303,
"step": 2100,
"train/kl_loss_qwen": 0.02003535218536854,
"train/kl_loss_r1": 0.013994471030309796,
"train/total_kl": 0.03402982326224446
},
{
"epoch": 2.620839813374806,
"grad_norm": 1.953125,
"learning_rate": 1.0339352428393525e-05,
"loss": 0.2683,
"mean_token_accuracy": 0.9778778046369553,
"step": 2105,
"train/kl_loss_qwen": 0.024578660633414982,
"train/kl_loss_r1": 0.015411347197368742,
"train/total_kl": 0.03999000806361437
},
{
"epoch": 2.62706065318818,
"grad_norm": 1.171875,
"learning_rate": 1.0292652552926526e-05,
"loss": 0.2502,
"mean_token_accuracy": 0.9789797216653824,
"step": 2110,
"train/kl_loss_qwen": 0.02267702422104776,
"train/kl_loss_r1": 0.013770601083524524,
"train/total_kl": 0.036447625048458575
},
{
"epoch": 2.6332814930015553,
"grad_norm": 1.046875,
"learning_rate": 1.0245952677459526e-05,
"loss": 0.2559,
"mean_token_accuracy": 0.9788319110870362,
"step": 2115,
"train/kl_loss_qwen": 0.02250348115339875,
"train/kl_loss_r1": 0.015042783576063812,
"train/total_kl": 0.037546264659613374
},
{
"epoch": 2.63950233281493,
"grad_norm": 1.171875,
"learning_rate": 1.0199252801992529e-05,
"loss": 0.2475,
"mean_token_accuracy": 0.9789767384529113,
"step": 2120,
"train/kl_loss_qwen": 0.0217635712120682,
"train/kl_loss_r1": 0.013855892582796514,
"train/total_kl": 0.03561946395784617
},
{
"epoch": 2.645723172628305,
"grad_norm": 1.0234375,
"learning_rate": 1.015255292652553e-05,
"loss": 0.3489,
"mean_token_accuracy": 0.9748771101236343,
"step": 2125,
"train/kl_loss_qwen": 0.03360332241281867,
"train/kl_loss_r1": 0.018315932666882872,
"train/total_kl": 0.051919255033135416
},
{
"epoch": 2.6519440124416795,
"grad_norm": 1.1875,
"learning_rate": 1.0105853051058532e-05,
"loss": 0.2347,
"mean_token_accuracy": 0.9795038014650345,
"step": 2130,
"train/kl_loss_qwen": 0.02050428814254701,
"train/kl_loss_r1": 0.011696344916708767,
"train/total_kl": 0.0322006331756711
},
{
"epoch": 2.6581648522550543,
"grad_norm": 2.09375,
"learning_rate": 1.0059153175591532e-05,
"loss": 0.2775,
"mean_token_accuracy": 0.979162546992302,
"step": 2135,
"train/kl_loss_qwen": 0.026292033307254315,
"train/kl_loss_r1": 0.016034953179769218,
"train/total_kl": 0.04232698623090982
},
{
"epoch": 2.6643856920684295,
"grad_norm": 1.203125,
"learning_rate": 1.0012453300124533e-05,
"loss": 0.2311,
"mean_token_accuracy": 0.9770093053579331,
"step": 2140,
"train/kl_loss_qwen": 0.019046885380521416,
"train/kl_loss_r1": 0.012393153086304665,
"train/total_kl": 0.031440038606524466
},
{
"epoch": 2.670606531881804,
"grad_norm": 1.0546875,
"learning_rate": 9.965753424657534e-06,
"loss": 0.2415,
"mean_token_accuracy": 0.9810254126787186,
"step": 2145,
"train/kl_loss_qwen": 0.022190214600414038,
"train/kl_loss_r1": 0.013294363114982843,
"train/total_kl": 0.035484577808529136
},
{
"epoch": 2.676827371695179,
"grad_norm": 1.109375,
"learning_rate": 9.919053549190536e-06,
"loss": 0.235,
"mean_token_accuracy": 0.9792218834161759,
"step": 2150,
"train/kl_loss_qwen": 0.021480456925928593,
"train/kl_loss_r1": 0.012514953222125768,
"train/total_kl": 0.033995410334318875
},
{
"epoch": 2.6830482115085537,
"grad_norm": 0.98046875,
"learning_rate": 9.872353673723537e-06,
"loss": 0.2255,
"mean_token_accuracy": 0.9813844114542007,
"step": 2155,
"train/kl_loss_qwen": 0.019305172516033052,
"train/kl_loss_r1": 0.012685006693936884,
"train/total_kl": 0.03199017941951752
},
{
"epoch": 2.6892690513219284,
"grad_norm": 0.94921875,
"learning_rate": 9.825653798256538e-06,
"loss": 0.2614,
"mean_token_accuracy": 0.9802846044301987,
"step": 2160,
"train/kl_loss_qwen": 0.023292775312438608,
"train/kl_loss_r1": 0.014105364657007157,
"train/total_kl": 0.03739814003929496
},
{
"epoch": 2.695489891135303,
"grad_norm": 1.0546875,
"learning_rate": 9.77895392278954e-06,
"loss": 0.2779,
"mean_token_accuracy": 0.9766510784626007,
"step": 2165,
"train/kl_loss_qwen": 0.02564525925554335,
"train/kl_loss_r1": 0.015102893207222223,
"train/total_kl": 0.040748152509331705
},
{
"epoch": 2.701710730948678,
"grad_norm": 1.046875,
"learning_rate": 9.73225404732254e-06,
"loss": 0.2647,
"mean_token_accuracy": 0.9788645833730698,
"step": 2170,
"train/kl_loss_qwen": 0.023770625423640012,
"train/kl_loss_r1": 0.01477400113362819,
"train/total_kl": 0.03854462616145611
},
{
"epoch": 2.707931570762053,
"grad_norm": 0.98828125,
"learning_rate": 9.685554171855543e-06,
"loss": 0.2438,
"mean_token_accuracy": 0.9803738176822663,
"step": 2175,
"train/kl_loss_qwen": 0.020186571637168527,
"train/kl_loss_r1": 0.013914901157841086,
"train/total_kl": 0.0341014726087451
},
{
"epoch": 2.7141524105754278,
"grad_norm": 1.4609375,
"learning_rate": 9.638854296388544e-06,
"loss": 0.2489,
"mean_token_accuracy": 0.9783189207315445,
"step": 2180,
"train/kl_loss_qwen": 0.020895938901230694,
"train/kl_loss_r1": 0.013940211269073188,
"train/total_kl": 0.034836150519549844
},
{
"epoch": 2.7203732503888025,
"grad_norm": 1.0390625,
"learning_rate": 9.592154420921544e-06,
"loss": 0.2291,
"mean_token_accuracy": 0.9809900194406509,
"step": 2185,
"train/kl_loss_qwen": 0.019283190369606018,
"train/kl_loss_r1": 0.011813020100817084,
"train/total_kl": 0.031096210610121487
},
{
"epoch": 2.7265940902021772,
"grad_norm": 1.0859375,
"learning_rate": 9.545454545454545e-06,
"loss": 0.2716,
"mean_token_accuracy": 0.979528221487999,
"step": 2190,
"train/kl_loss_qwen": 0.024975268309935926,
"train/kl_loss_r1": 0.014736651070415973,
"train/total_kl": 0.03971191914752126
},
{
"epoch": 2.732814930015552,
"grad_norm": 0.9375,
"learning_rate": 9.498754669987546e-06,
"loss": 0.2547,
"mean_token_accuracy": 0.9805773764848709,
"step": 2195,
"train/kl_loss_qwen": 0.023621318116784095,
"train/kl_loss_r1": 0.014904734306037426,
"train/total_kl": 0.038526052702218296
},
{
"epoch": 2.739035769828927,
"grad_norm": 1.2421875,
"learning_rate": 9.452054794520548e-06,
"loss": 0.2519,
"mean_token_accuracy": 0.9800098180770874,
"step": 2200,
"train/kl_loss_qwen": 0.022577690612524747,
"train/kl_loss_r1": 0.014399249549023807,
"train/total_kl": 0.036976939905434845
},
{
"epoch": 2.7452566096423014,
"grad_norm": 0.98828125,
"learning_rate": 9.405354919053549e-06,
"loss": 0.2523,
"mean_token_accuracy": 0.9802424728870391,
"step": 2205,
"train/kl_loss_qwen": 0.023771630600094795,
"train/kl_loss_r1": 0.014084443286992609,
"train/total_kl": 0.03785607386380434
},
{
"epoch": 2.7514774494556766,
"grad_norm": 1.0625,
"learning_rate": 9.358655043586551e-06,
"loss": 0.2483,
"mean_token_accuracy": 0.9757383853197098,
"step": 2210,
"train/kl_loss_qwen": 0.020856014778837563,
"train/kl_loss_r1": 0.012496178969740868,
"train/total_kl": 0.03335219379514456
},
{
"epoch": 2.7576982892690514,
"grad_norm": 1.2265625,
"learning_rate": 9.311955168119552e-06,
"loss": 0.2609,
"mean_token_accuracy": 0.9750352591276169,
"step": 2215,
"train/kl_loss_qwen": 0.021947943326085805,
"train/kl_loss_r1": 0.013721926184371114,
"train/total_kl": 0.035669869370758535
},
{
"epoch": 2.763919129082426,
"grad_norm": 1.125,
"learning_rate": 9.265255292652554e-06,
"loss": 0.2498,
"mean_token_accuracy": 0.9788256555795669,
"step": 2220,
"train/kl_loss_qwen": 0.022918132552877068,
"train/kl_loss_r1": 0.013518631807528436,
"train/total_kl": 0.036436764243990186
},
{
"epoch": 2.770139968895801,
"grad_norm": 1.1796875,
"learning_rate": 9.218555417185555e-06,
"loss": 0.2567,
"mean_token_accuracy": 0.98291976749897,
"step": 2225,
"train/kl_loss_qwen": 0.02417180915363133,
"train/kl_loss_r1": 0.016105480049736796,
"train/total_kl": 0.04027728922665119
},
{
"epoch": 2.7763608087091756,
"grad_norm": 0.90234375,
"learning_rate": 9.171855541718556e-06,
"loss": 0.2501,
"mean_token_accuracy": 0.9805917859077453,
"step": 2230,
"train/kl_loss_qwen": 0.022929491940885782,
"train/kl_loss_r1": 0.014057897846214473,
"train/total_kl": 0.03698738953098655
},
{
"epoch": 2.7825816485225507,
"grad_norm": 1.1015625,
"learning_rate": 9.125155666251556e-06,
"loss": 0.3112,
"mean_token_accuracy": 0.9757759094238281,
"step": 2235,
"train/kl_loss_qwen": 0.030990847293287514,
"train/kl_loss_r1": 0.017853675317019223,
"train/total_kl": 0.048844522703438996
},
{
"epoch": 2.7888024883359255,
"grad_norm": 1.2109375,
"learning_rate": 9.078455790784557e-06,
"loss": 0.2578,
"mean_token_accuracy": 0.9765969723463058,
"step": 2240,
"train/kl_loss_qwen": 0.022567249741405247,
"train/kl_loss_r1": 0.014588132430799306,
"train/total_kl": 0.03715538214892149
},
{
"epoch": 2.7950233281493,
"grad_norm": 0.93359375,
"learning_rate": 9.03175591531756e-06,
"loss": 0.2468,
"mean_token_accuracy": 0.9806161612272263,
"step": 2245,
"train/kl_loss_qwen": 0.022640920570120217,
"train/kl_loss_r1": 0.013426762819290162,
"train/total_kl": 0.03606768334284425
},
{
"epoch": 2.801244167962675,
"grad_norm": 1.28125,
"learning_rate": 8.98505603985056e-06,
"loss": 0.2405,
"mean_token_accuracy": 0.9788148522377014,
"step": 2250,
"train/kl_loss_qwen": 0.020399608230218292,
"train/kl_loss_r1": 0.013216133532114326,
"train/total_kl": 0.03361574159935117
},
{
"epoch": 2.8074650077760497,
"grad_norm": 0.93359375,
"learning_rate": 8.938356164383562e-06,
"loss": 0.2289,
"mean_token_accuracy": 0.9812757492065429,
"step": 2255,
"train/kl_loss_qwen": 0.019857667246833445,
"train/kl_loss_r1": 0.013221802725456654,
"train/total_kl": 0.03307946994900703
},
{
"epoch": 2.8136858475894244,
"grad_norm": 1.296875,
"learning_rate": 8.891656288916563e-06,
"loss": 0.2606,
"mean_token_accuracy": 0.9791488260030746,
"step": 2260,
"train/kl_loss_qwen": 0.02399991424754262,
"train/kl_loss_r1": 0.015469257766380907,
"train/total_kl": 0.03946917224675417
},
{
"epoch": 2.819906687402799,
"grad_norm": 1.6875,
"learning_rate": 8.844956413449565e-06,
"loss": 0.2846,
"mean_token_accuracy": 0.979676753282547,
"step": 2265,
"train/kl_loss_qwen": 0.02852729302830994,
"train/kl_loss_r1": 0.01608511172235012,
"train/total_kl": 0.04461240470409393
},
{
"epoch": 2.8261275272161743,
"grad_norm": 1.0,
"learning_rate": 8.798256537982566e-06,
"loss": 0.2421,
"mean_token_accuracy": 0.979563570022583,
"step": 2270,
"train/kl_loss_qwen": 0.021803312422707676,
"train/kl_loss_r1": 0.012825471581891179,
"train/total_kl": 0.03462878372520208
},
{
"epoch": 2.832348367029549,
"grad_norm": 0.953125,
"learning_rate": 8.751556662515567e-06,
"loss": 0.255,
"mean_token_accuracy": 0.9786518633365631,
"step": 2275,
"train/kl_loss_qwen": 0.02268552640452981,
"train/kl_loss_r1": 0.014874024945311249,
"train/total_kl": 0.037559551559388636
},
{
"epoch": 2.838569206842924,
"grad_norm": 0.87109375,
"learning_rate": 8.704856787048568e-06,
"loss": 0.2709,
"mean_token_accuracy": 0.9777145385742188,
"step": 2280,
"train/kl_loss_qwen": 0.02695997697301209,
"train/kl_loss_r1": 0.015009569097310304,
"train/total_kl": 0.04196954630315304
},
{
"epoch": 2.8447900466562985,
"grad_norm": 1.015625,
"learning_rate": 8.658156911581568e-06,
"loss": 0.4012,
"mean_token_accuracy": 0.9728323191404342,
"step": 2285,
"train/kl_loss_qwen": 0.04328306377865374,
"train/kl_loss_r1": 0.019736759038642047,
"train/total_kl": 0.06301982244476675
},
{
"epoch": 2.8510108864696733,
"grad_norm": 1.1171875,
"learning_rate": 8.61145703611457e-06,
"loss": 0.2336,
"mean_token_accuracy": 0.9794570118188858,
"step": 2290,
"train/kl_loss_qwen": 0.01980093107558787,
"train/kl_loss_r1": 0.01263779290020466,
"train/total_kl": 0.0324387239292264
},
{
"epoch": 2.8572317262830484,
"grad_norm": 0.96484375,
"learning_rate": 8.564757160647571e-06,
"loss": 0.2557,
"mean_token_accuracy": 0.9764771848917008,
"step": 2295,
"train/kl_loss_qwen": 0.023008445603773,
"train/kl_loss_r1": 0.013009098009206355,
"train/total_kl": 0.036017543729394676
},
{
"epoch": 2.863452566096423,
"grad_norm": 1.21875,
"learning_rate": 8.518057285180574e-06,
"loss": 0.2353,
"mean_token_accuracy": 0.9793502748012543,
"step": 2300,
"train/kl_loss_qwen": 0.02138944426551461,
"train/kl_loss_r1": 0.012340294336900115,
"train/total_kl": 0.033729738742113116
},
{
"epoch": 2.869673405909798,
"grad_norm": 1.1328125,
"learning_rate": 8.471357409713574e-06,
"loss": 0.2507,
"mean_token_accuracy": 0.9794678062200546,
"step": 2305,
"train/kl_loss_qwen": 0.0230550997890532,
"train/kl_loss_r1": 0.01367465585935861,
"train/total_kl": 0.03672975599765778
},
{
"epoch": 2.8758942457231726,
"grad_norm": 1.3671875,
"learning_rate": 8.424657534246577e-06,
"loss": 0.2519,
"mean_token_accuracy": 0.9780717104673385,
"step": 2310,
"train/kl_loss_qwen": 0.022003966965712607,
"train/kl_loss_r1": 0.013341469364240766,
"train/total_kl": 0.03534543639980257
},
{
"epoch": 2.8821150855365474,
"grad_norm": 1.1328125,
"learning_rate": 8.377957658779577e-06,
"loss": 0.2565,
"mean_token_accuracy": 0.9794615656137466,
"step": 2315,
"train/kl_loss_qwen": 0.022503159195184707,
"train/kl_loss_r1": 0.014681264385581016,
"train/total_kl": 0.03718442320823669
},
{
"epoch": 2.888335925349922,
"grad_norm": 0.875,
"learning_rate": 8.331257783312578e-06,
"loss": 0.3476,
"mean_token_accuracy": 0.9739361822605133,
"step": 2320,
"train/kl_loss_qwen": 0.033717150893062355,
"train/kl_loss_r1": 0.017250060685910285,
"train/total_kl": 0.05096721239387989
},
{
"epoch": 2.894556765163297,
"grad_norm": 0.8515625,
"learning_rate": 8.284557907845579e-06,
"loss": 0.2501,
"mean_token_accuracy": 0.9814224302768707,
"step": 2325,
"train/kl_loss_qwen": 0.023675559274852275,
"train/kl_loss_r1": 0.014361454313620925,
"train/total_kl": 0.03803701344877482
},
{
"epoch": 2.900777604976672,
"grad_norm": 1.171875,
"learning_rate": 8.23785803237858e-06,
"loss": 0.3194,
"mean_token_accuracy": 0.9765466809272766,
"step": 2330,
"train/kl_loss_qwen": 0.03182602096349001,
"train/kl_loss_r1": 0.018149445950984954,
"train/total_kl": 0.04997546775266528
},
{
"epoch": 2.9069984447900468,
"grad_norm": 1.0703125,
"learning_rate": 8.191158156911582e-06,
"loss": 0.243,
"mean_token_accuracy": 0.9765629231929779,
"step": 2335,
"train/kl_loss_qwen": 0.019837050791829826,
"train/kl_loss_r1": 0.013477956131100654,
"train/total_kl": 0.03331500729545951
},
{
"epoch": 2.9132192846034215,
"grad_norm": 0.9296875,
"learning_rate": 8.144458281444582e-06,
"loss": 0.249,
"mean_token_accuracy": 0.9794359922409057,
"step": 2340,
"train/kl_loss_qwen": 0.021764508541673423,
"train/kl_loss_r1": 0.014173974050208926,
"train/total_kl": 0.03593848291784525
},
{
"epoch": 2.9194401244167962,
"grad_norm": 0.98828125,
"learning_rate": 8.097758405977585e-06,
"loss": 0.3243,
"mean_token_accuracy": 0.9754409641027451,
"step": 2345,
"train/kl_loss_qwen": 0.032446541963145135,
"train/kl_loss_r1": 0.016262303036637605,
"train/total_kl": 0.04870884427800774
},
{
"epoch": 2.925660964230171,
"grad_norm": 0.99609375,
"learning_rate": 8.051058530510586e-06,
"loss": 0.2413,
"mean_token_accuracy": 0.9799944281578064,
"step": 2350,
"train/kl_loss_qwen": 0.02185902800410986,
"train/kl_loss_r1": 0.012194494740106166,
"train/total_kl": 0.03405352234840393
},
{
"epoch": 2.931881804043546,
"grad_norm": 0.9453125,
"learning_rate": 8.004358655043588e-06,
"loss": 0.2488,
"mean_token_accuracy": 0.9812228798866272,
"step": 2355,
"train/kl_loss_qwen": 0.023556680977344514,
"train/kl_loss_r1": 0.01458953726105392,
"train/total_kl": 0.038146217819303274
},
{
"epoch": 2.9381026438569204,
"grad_norm": 1.296875,
"learning_rate": 7.957658779576589e-06,
"loss": 0.2386,
"mean_token_accuracy": 0.9794855356216431,
"step": 2360,
"train/kl_loss_qwen": 0.019754012860357762,
"train/kl_loss_r1": 0.0134123150492087,
"train/total_kl": 0.033166327979415655
},
{
"epoch": 2.9443234836702956,
"grad_norm": 0.90625,
"learning_rate": 7.91095890410959e-06,
"loss": 0.2524,
"mean_token_accuracy": 0.9802679121494293,
"step": 2365,
"train/kl_loss_qwen": 0.021867240034043788,
"train/kl_loss_r1": 0.015403355937451124,
"train/total_kl": 0.03727059587836266
},
{
"epoch": 2.9505443234836704,
"grad_norm": 0.92578125,
"learning_rate": 7.86425902864259e-06,
"loss": 0.2384,
"mean_token_accuracy": 0.9784934759140015,
"step": 2370,
"train/kl_loss_qwen": 0.019248896767385303,
"train/kl_loss_r1": 0.013327605556696653,
"train/total_kl": 0.032576502207666634
},
{
"epoch": 2.956765163297045,
"grad_norm": 1.1171875,
"learning_rate": 7.81755915317559e-06,
"loss": 0.2528,
"mean_token_accuracy": 0.9785091251134872,
"step": 2375,
"train/kl_loss_qwen": 0.02136381221935153,
"train/kl_loss_r1": 0.01490559543017298,
"train/total_kl": 0.03626940799877047
},
{
"epoch": 2.96298600311042,
"grad_norm": 1.0234375,
"learning_rate": 7.770859277708593e-06,
"loss": 0.254,
"mean_token_accuracy": 0.9753740966320038,
"step": 2380,
"train/kl_loss_qwen": 0.020779022481292486,
"train/kl_loss_r1": 0.012893599388189615,
"train/total_kl": 0.033672621753066775
},
{
"epoch": 2.9692068429237946,
"grad_norm": 1.296875,
"learning_rate": 7.724159402241594e-06,
"loss": 0.2723,
"mean_token_accuracy": 0.9807368129491806,
"step": 2385,
"train/kl_loss_qwen": 0.02706731208600104,
"train/kl_loss_r1": 0.015577892120927573,
"train/total_kl": 0.04264520406723023
},
{
"epoch": 2.9754276827371697,
"grad_norm": 1.1796875,
"learning_rate": 7.677459526774596e-06,
"loss": 0.2339,
"mean_token_accuracy": 0.9778724700212479,
"step": 2390,
"train/kl_loss_qwen": 0.019125875597819687,
"train/kl_loss_r1": 0.012182414485141634,
"train/total_kl": 0.03130828971043229
},
{
"epoch": 2.9816485225505445,
"grad_norm": 1.2578125,
"learning_rate": 7.630759651307597e-06,
"loss": 0.243,
"mean_token_accuracy": 0.9793420016765595,
"step": 2395,
"train/kl_loss_qwen": 0.021404419979080557,
"train/kl_loss_r1": 0.012169917370192707,
"train/total_kl": 0.033574337419122455
},
{
"epoch": 2.987869362363919,
"grad_norm": 0.984375,
"learning_rate": 7.584059775840598e-06,
"loss": 0.2408,
"mean_token_accuracy": 0.9772315412759781,
"step": 2400,
"train/kl_loss_qwen": 0.02061320682987571,
"train/kl_loss_r1": 0.013303012656979262,
"train/total_kl": 0.03391621951013803
},
{
"epoch": 2.994090202177294,
"grad_norm": 0.94921875,
"learning_rate": 7.537359900373599e-06,
"loss": 0.2771,
"mean_token_accuracy": 0.9785916924476623,
"step": 2405,
"train/kl_loss_qwen": 0.0252801182679832,
"train/kl_loss_r1": 0.01622594220098108,
"train/total_kl": 0.0415060605853796
},
{
"epoch": 3.001244167962675,
"grad_norm": 1.578125,
"learning_rate": 7.4906600249066005e-06,
"loss": 0.2953,
"mean_token_accuracy": 0.9816724224524065,
"step": 2410,
"train/kl_loss_qwen": 0.025597207248210907,
"train/kl_loss_r1": 0.01563291643238203,
"train/total_kl": 0.041230123659426514
},
{
"epoch": 3.00746500777605,
"grad_norm": 0.85546875,
"learning_rate": 7.443960149439601e-06,
"loss": 0.3073,
"mean_token_accuracy": 0.9799118191003799,
"step": 2415,
"train/kl_loss_qwen": 0.030909589771181346,
"train/kl_loss_r1": 0.01667693620547652,
"train/total_kl": 0.047586525231599806
},
{
"epoch": 3.0136858475894246,
"grad_norm": 0.984375,
"learning_rate": 7.397260273972603e-06,
"loss": 0.2404,
"mean_token_accuracy": 0.9838899701833725,
"step": 2420,
"train/kl_loss_qwen": 0.021309804217889906,
"train/kl_loss_r1": 0.013884992711246014,
"train/total_kl": 0.03519479688256979
},
{
"epoch": 3.0199066874027993,
"grad_norm": 0.875,
"learning_rate": 7.350560398505604e-06,
"loss": 0.2295,
"mean_token_accuracy": 0.9842253357172013,
"step": 2425,
"train/kl_loss_qwen": 0.021593318693339823,
"train/kl_loss_r1": 0.012967960792593658,
"train/total_kl": 0.034561279509216544
},
{
"epoch": 3.026127527216174,
"grad_norm": 0.8125,
"learning_rate": 7.303860523038606e-06,
"loss": 0.226,
"mean_token_accuracy": 0.9844829171895981,
"step": 2430,
"train/kl_loss_qwen": 0.019423839217051864,
"train/kl_loss_r1": 0.012976301368325949,
"train/total_kl": 0.032400140445679425
},
{
"epoch": 3.032348367029549,
"grad_norm": 1.578125,
"learning_rate": 7.2571606475716064e-06,
"loss": 0.2594,
"mean_token_accuracy": 0.9829055160284043,
"step": 2435,
"train/kl_loss_qwen": 0.02393628782592714,
"train/kl_loss_r1": 0.015033241617493332,
"train/total_kl": 0.03896952914074063
},
{
"epoch": 3.038569206842924,
"grad_norm": 0.89453125,
"learning_rate": 7.210460772104608e-06,
"loss": 0.2435,
"mean_token_accuracy": 0.9866632699966431,
"step": 2440,
"train/kl_loss_qwen": 0.023871434153988957,
"train/kl_loss_r1": 0.01572964512743056,
"train/total_kl": 0.03960107890889049
},
{
"epoch": 3.0447900466562987,
"grad_norm": 1.0234375,
"learning_rate": 7.1637608966376095e-06,
"loss": 0.2378,
"mean_token_accuracy": 0.9842400878667832,
"step": 2445,
"train/kl_loss_qwen": 0.022447610320523382,
"train/kl_loss_r1": 0.013542116852477193,
"train/total_kl": 0.03598972680047154
},
{
"epoch": 3.0510108864696734,
"grad_norm": 0.90625,
"learning_rate": 7.11706102117061e-06,
"loss": 0.2568,
"mean_token_accuracy": 0.9835693746805191,
"step": 2450,
"train/kl_loss_qwen": 0.0250473961699754,
"train/kl_loss_r1": 0.015254210913553834,
"train/total_kl": 0.040301607269793746
},
{
"epoch": 3.057231726283048,
"grad_norm": 0.8359375,
"learning_rate": 7.070361145703612e-06,
"loss": 0.2386,
"mean_token_accuracy": 0.9851376801729202,
"step": 2455,
"train/kl_loss_qwen": 0.023010611534118652,
"train/kl_loss_r1": 0.013890899089165031,
"train/total_kl": 0.036901510879397394
},
{
"epoch": 3.063452566096423,
"grad_norm": 1.1171875,
"learning_rate": 7.023661270236612e-06,
"loss": 0.2295,
"mean_token_accuracy": 0.9852157533168793,
"step": 2460,
"train/kl_loss_qwen": 0.020923609985038637,
"train/kl_loss_r1": 0.013110134052112699,
"train/total_kl": 0.034033743944019076
},
{
"epoch": 3.0696734059097976,
"grad_norm": 0.84375,
"learning_rate": 6.976961394769615e-06,
"loss": 0.2367,
"mean_token_accuracy": 0.984752967953682,
"step": 2465,
"train/kl_loss_qwen": 0.021800487814471126,
"train/kl_loss_r1": 0.014962652372196317,
"train/total_kl": 0.03676314065232873
},
{
"epoch": 3.075894245723173,
"grad_norm": 0.953125,
"learning_rate": 6.9302615193026155e-06,
"loss": 0.2176,
"mean_token_accuracy": 0.9840360462665558,
"step": 2470,
"train/kl_loss_qwen": 0.019439062848687173,
"train/kl_loss_r1": 0.012102234200574458,
"train/total_kl": 0.03154129749163985
},
{
"epoch": 3.0821150855365476,
"grad_norm": 0.91015625,
"learning_rate": 6.883561643835617e-06,
"loss": 0.24,
"mean_token_accuracy": 0.9856468439102173,
"step": 2475,
"train/kl_loss_qwen": 0.02432550024241209,
"train/kl_loss_r1": 0.014322337484918535,
"train/total_kl": 0.03864783812314272
},
{
"epoch": 3.0883359253499223,
"grad_norm": 0.8203125,
"learning_rate": 6.836861768368618e-06,
"loss": 0.2422,
"mean_token_accuracy": 0.9857906192541123,
"step": 2480,
"train/kl_loss_qwen": 0.024130608467385174,
"train/kl_loss_r1": 0.014549318444915115,
"train/total_kl": 0.03867992656305432
},
{
"epoch": 3.094556765163297,
"grad_norm": 0.7734375,
"learning_rate": 6.790161892901618e-06,
"loss": 0.2854,
"mean_token_accuracy": 0.9790276646614074,
"step": 2485,
"train/kl_loss_qwen": 0.02656708569265902,
"train/kl_loss_r1": 0.014770055492408573,
"train/total_kl": 0.04133714027702808
},
{
"epoch": 3.1007776049766718,
"grad_norm": 0.98828125,
"learning_rate": 6.743462017434621e-06,
"loss": 0.2284,
"mean_token_accuracy": 0.9816806197166443,
"step": 2490,
"train/kl_loss_qwen": 0.020325628202408554,
"train/kl_loss_r1": 0.012261225422844291,
"train/total_kl": 0.032586853578686716
},
{
"epoch": 3.1069984447900465,
"grad_norm": 0.80078125,
"learning_rate": 6.696762141967621e-06,
"loss": 0.2392,
"mean_token_accuracy": 0.9851239174604416,
"step": 2495,
"train/kl_loss_qwen": 0.023483004746958615,
"train/kl_loss_r1": 0.013791011273860931,
"train/total_kl": 0.037274016067385674
},
{
"epoch": 3.1132192846034217,
"grad_norm": 0.87890625,
"learning_rate": 6.650062266500623e-06,
"loss": 0.2369,
"mean_token_accuracy": 0.9840823352336884,
"step": 2500,
"train/kl_loss_qwen": 0.022309778584167363,
"train/kl_loss_r1": 0.012782163382507861,
"train/total_kl": 0.0350919421762228
},
{
"epoch": 3.1194401244167964,
"grad_norm": 0.8515625,
"learning_rate": 6.603362391033624e-06,
"loss": 0.229,
"mean_token_accuracy": 0.9852802842855454,
"step": 2505,
"train/kl_loss_qwen": 0.022154048085212708,
"train/kl_loss_r1": 0.01309482108335942,
"train/total_kl": 0.035248869378119704
},
{
"epoch": 3.125660964230171,
"grad_norm": 0.8359375,
"learning_rate": 6.556662515566626e-06,
"loss": 0.2327,
"mean_token_accuracy": 0.9822622090578079,
"step": 2510,
"train/kl_loss_qwen": 0.020434158109128474,
"train/kl_loss_r1": 0.012905464507639408,
"train/total_kl": 0.03333962252363563
},
{
"epoch": 3.131881804043546,
"grad_norm": 0.98046875,
"learning_rate": 6.509962640099627e-06,
"loss": 0.2825,
"mean_token_accuracy": 0.9828780442476273,
"step": 2515,
"train/kl_loss_qwen": 0.028179554687812924,
"train/kl_loss_r1": 0.016975441295653582,
"train/total_kl": 0.04515499575063586
},
{
"epoch": 3.1381026438569206,
"grad_norm": 1.2578125,
"learning_rate": 6.463262764632628e-06,
"loss": 0.2292,
"mean_token_accuracy": 0.9861107170581818,
"step": 2520,
"train/kl_loss_qwen": 0.020859976392239334,
"train/kl_loss_r1": 0.012708152551203966,
"train/total_kl": 0.03356812903657556
},
{
"epoch": 3.1443234836702953,
"grad_norm": 0.890625,
"learning_rate": 6.416562889165629e-06,
"loss": 0.2433,
"mean_token_accuracy": 0.9862571328878402,
"step": 2525,
"train/kl_loss_qwen": 0.022917523747310042,
"train/kl_loss_r1": 0.014852290134876966,
"train/total_kl": 0.037769814115017654
},
{
"epoch": 3.15054432348367,
"grad_norm": 0.83984375,
"learning_rate": 6.3698630136986296e-06,
"loss": 0.2509,
"mean_token_accuracy": 0.9852677673101425,
"step": 2530,
"train/kl_loss_qwen": 0.025660164793953298,
"train/kl_loss_r1": 0.014589101611636578,
"train/total_kl": 0.04024926638230682
},
{
"epoch": 3.1567651632970453,
"grad_norm": 1.9140625,
"learning_rate": 6.323163138231632e-06,
"loss": 0.2669,
"mean_token_accuracy": 0.9850893825292587,
"step": 2535,
"train/kl_loss_qwen": 0.027122320886701346,
"train/kl_loss_r1": 0.014969939785078167,
"train/total_kl": 0.04209226043894887
},
{
"epoch": 3.16298600311042,
"grad_norm": 1.1875,
"learning_rate": 6.276463262764633e-06,
"loss": 0.2448,
"mean_token_accuracy": 0.9816835910081864,
"step": 2540,
"train/kl_loss_qwen": 0.02137654577381909,
"train/kl_loss_r1": 0.013053974509239197,
"train/total_kl": 0.03443052032962442
},
{
"epoch": 3.1692068429237947,
"grad_norm": 0.890625,
"learning_rate": 6.229763387297634e-06,
"loss": 0.2434,
"mean_token_accuracy": 0.9859046876430512,
"step": 2545,
"train/kl_loss_qwen": 0.02334826118312776,
"train/kl_loss_r1": 0.014492624066770076,
"train/total_kl": 0.037840885668993
},
{
"epoch": 3.1754276827371695,
"grad_norm": 0.91015625,
"learning_rate": 6.183063511830635e-06,
"loss": 0.2375,
"mean_token_accuracy": 0.9857018113136291,
"step": 2550,
"train/kl_loss_qwen": 0.02287781867198646,
"train/kl_loss_r1": 0.014699449087493122,
"train/total_kl": 0.03757726764306426
},
{
"epoch": 3.181648522550544,
"grad_norm": 0.8671875,
"learning_rate": 6.136363636363637e-06,
"loss": 0.2169,
"mean_token_accuracy": 0.9859404623508453,
"step": 2555,
"train/kl_loss_qwen": 0.01947087454609573,
"train/kl_loss_r1": 0.01351618163753301,
"train/total_kl": 0.03298705592751503
},
{
"epoch": 3.187869362363919,
"grad_norm": 1.15625,
"learning_rate": 6.089663760896638e-06,
"loss": 0.2239,
"mean_token_accuracy": 0.9842052280902862,
"step": 2560,
"train/kl_loss_qwen": 0.020881024189293385,
"train/kl_loss_r1": 0.01321516155730933,
"train/total_kl": 0.034096185490489005
},
{
"epoch": 3.194090202177294,
"grad_norm": 0.984375,
"learning_rate": 6.042963885429639e-06,
"loss": 0.2523,
"mean_token_accuracy": 0.9886922299861908,
"step": 2565,
"train/kl_loss_qwen": 0.025517759006470443,
"train/kl_loss_r1": 0.01657579594757408,
"train/total_kl": 0.042093554977327585
},
{
"epoch": 3.200311041990669,
"grad_norm": 0.94140625,
"learning_rate": 5.99626400996264e-06,
"loss": 0.2401,
"mean_token_accuracy": 0.984867662191391,
"step": 2570,
"train/kl_loss_qwen": 0.023075867211446166,
"train/kl_loss_r1": 0.013981684250757099,
"train/total_kl": 0.03705755146220326
},
{
"epoch": 3.2065318818040436,
"grad_norm": 0.94921875,
"learning_rate": 5.949564134495641e-06,
"loss": 0.2792,
"mean_token_accuracy": 0.9805339246988296,
"step": 2575,
"train/kl_loss_qwen": 0.025687551125884056,
"train/kl_loss_r1": 0.01688022376038134,
"train/total_kl": 0.042567774560302495
},
{
"epoch": 3.2127527216174183,
"grad_norm": 0.78515625,
"learning_rate": 5.902864259028643e-06,
"loss": 0.2359,
"mean_token_accuracy": 0.9867773085832596,
"step": 2580,
"train/kl_loss_qwen": 0.022642063442617655,
"train/kl_loss_r1": 0.01564873745664954,
"train/total_kl": 0.038290800713002685
},
{
"epoch": 3.218973561430793,
"grad_norm": 0.77734375,
"learning_rate": 5.856164383561644e-06,
"loss": 0.2185,
"mean_token_accuracy": 0.9818668901920319,
"step": 2585,
"train/kl_loss_qwen": 0.01890602051280439,
"train/kl_loss_r1": 0.011296134302392602,
"train/total_kl": 0.030202154675498603
},
{
"epoch": 3.225194401244168,
"grad_norm": 0.82421875,
"learning_rate": 5.809464508094645e-06,
"loss": 0.246,
"mean_token_accuracy": 0.9839199364185334,
"step": 2590,
"train/kl_loss_qwen": 0.025229747220873833,
"train/kl_loss_r1": 0.013694578688591719,
"train/total_kl": 0.038924325909465554
},
{
"epoch": 3.231415241057543,
"grad_norm": 0.97265625,
"learning_rate": 5.762764632627646e-06,
"loss": 0.2688,
"mean_token_accuracy": 0.9858499974012375,
"step": 2595,
"train/kl_loss_qwen": 0.026664407551288606,
"train/kl_loss_r1": 0.01758768109139055,
"train/total_kl": 0.04425208875909448
},
{
"epoch": 3.2376360808709177,
"grad_norm": 0.76953125,
"learning_rate": 5.7160647571606484e-06,
"loss": 0.2406,
"mean_token_accuracy": 0.9867913007736206,
"step": 2600,
"train/kl_loss_qwen": 0.02284672809764743,
"train/kl_loss_r1": 0.014909073058515788,
"train/total_kl": 0.03775580152869225
},
{
"epoch": 3.2438569206842924,
"grad_norm": 0.98828125,
"learning_rate": 5.669364881693649e-06,
"loss": 0.2292,
"mean_token_accuracy": 0.9871266216039658,
"step": 2605,
"train/kl_loss_qwen": 0.021353343920782208,
"train/kl_loss_r1": 0.013833488407544791,
"train/total_kl": 0.035186832677572964
},
{
"epoch": 3.250077760497667,
"grad_norm": 0.8359375,
"learning_rate": 5.62266500622665e-06,
"loss": 0.243,
"mean_token_accuracy": 0.9875899940729141,
"step": 2610,
"train/kl_loss_qwen": 0.02369601596146822,
"train/kl_loss_r1": 0.015644747391343118,
"train/total_kl": 0.03934076325967908
},
{
"epoch": 3.256298600311042,
"grad_norm": 0.92578125,
"learning_rate": 5.575965130759651e-06,
"loss": 0.2631,
"mean_token_accuracy": 0.9842116951942443,
"step": 2615,
"train/kl_loss_qwen": 0.02683533593080938,
"train/kl_loss_r1": 0.015043137269094587,
"train/total_kl": 0.04187847292050719
},
{
"epoch": 3.2625194401244166,
"grad_norm": 0.94140625,
"learning_rate": 5.529265255292652e-06,
"loss": 0.2267,
"mean_token_accuracy": 0.9818090766668319,
"step": 2620,
"train/kl_loss_qwen": 0.02027418022044003,
"train/kl_loss_r1": 0.011717557231895626,
"train/total_kl": 0.03199173752218485
},
{
"epoch": 3.2687402799377914,
"grad_norm": 0.828125,
"learning_rate": 5.482565379825654e-06,
"loss": 0.2873,
"mean_token_accuracy": 0.9823738813400269,
"step": 2625,
"train/kl_loss_qwen": 0.029073307709768414,
"train/kl_loss_r1": 0.016109167714603245,
"train/total_kl": 0.045182475447654726
},
{
"epoch": 3.2749611197511665,
"grad_norm": 0.9375,
"learning_rate": 5.435865504358655e-06,
"loss": 0.2492,
"mean_token_accuracy": 0.9855016142129898,
"step": 2630,
"train/kl_loss_qwen": 0.023096950352191926,
"train/kl_loss_r1": 0.015297620929777623,
"train/total_kl": 0.038394571375101806
},
{
"epoch": 3.2811819595645413,
"grad_norm": 0.921875,
"learning_rate": 5.389165628891657e-06,
"loss": 0.239,
"mean_token_accuracy": 0.9847406953573227,
"step": 2635,
"train/kl_loss_qwen": 0.021637895377352834,
"train/kl_loss_r1": 0.01458637174218893,
"train/total_kl": 0.03622426679357886
},
{
"epoch": 3.287402799377916,
"grad_norm": 0.87890625,
"learning_rate": 5.342465753424657e-06,
"loss": 0.2682,
"mean_token_accuracy": 0.9817533552646637,
"step": 2640,
"train/kl_loss_qwen": 0.026832366455346347,
"train/kl_loss_r1": 0.015036878059618175,
"train/total_kl": 0.041869244445115326
},
{
"epoch": 3.2936236391912908,
"grad_norm": 1.046875,
"learning_rate": 5.29576587795766e-06,
"loss": 0.2263,
"mean_token_accuracy": 0.9815866380929947,
"step": 2645,
"train/kl_loss_qwen": 0.020331070409156382,
"train/kl_loss_r1": 0.012977494508959353,
"train/total_kl": 0.03330856496468186
},
{
"epoch": 3.2998444790046655,
"grad_norm": 0.875,
"learning_rate": 5.24906600249066e-06,
"loss": 0.2629,
"mean_token_accuracy": 0.9831759363412857,
"step": 2650,
"train/kl_loss_qwen": 0.02541449787095189,
"train/kl_loss_r1": 0.015678114630281924,
"train/total_kl": 0.04109261250123382
},
{
"epoch": 3.3060653188180407,
"grad_norm": 1.3515625,
"learning_rate": 5.202366127023661e-06,
"loss": 0.2377,
"mean_token_accuracy": 0.9843966364860535,
"step": 2655,
"train/kl_loss_qwen": 0.022267935564741492,
"train/kl_loss_r1": 0.014039589231833816,
"train/total_kl": 0.03630752470344305
},
{
"epoch": 3.3122861586314154,
"grad_norm": 1.03125,
"learning_rate": 5.1556662515566625e-06,
"loss": 0.2288,
"mean_token_accuracy": 0.9853380292654037,
"step": 2660,
"train/kl_loss_qwen": 0.020760743832215666,
"train/kl_loss_r1": 0.013922068243846297,
"train/total_kl": 0.03468281263485551
},
{
"epoch": 3.31850699844479,
"grad_norm": 1.3046875,
"learning_rate": 5.108966376089663e-06,
"loss": 0.2746,
"mean_token_accuracy": 0.9855523884296418,
"step": 2665,
"train/kl_loss_qwen": 0.028636119095608592,
"train/kl_loss_r1": 0.016617331188172102,
"train/total_kl": 0.04525345005095005
},
{
"epoch": 3.324727838258165,
"grad_norm": 0.87890625,
"learning_rate": 5.062266500622666e-06,
"loss": 0.2796,
"mean_token_accuracy": 0.9843825936317444,
"step": 2670,
"train/kl_loss_qwen": 0.02719255774281919,
"train/kl_loss_r1": 0.01748746286612004,
"train/total_kl": 0.04468002058565616
},
{
"epoch": 3.3309486780715396,
"grad_norm": 0.890625,
"learning_rate": 5.015566625155666e-06,
"loss": 0.2395,
"mean_token_accuracy": 0.985189613699913,
"step": 2675,
"train/kl_loss_qwen": 0.022867527883499862,
"train/kl_loss_r1": 0.01357824713923037,
"train/total_kl": 0.03644577506929636
},
{
"epoch": 3.3371695178849143,
"grad_norm": 0.984375,
"learning_rate": 4.968866749688668e-06,
"loss": 0.2537,
"mean_token_accuracy": 0.9825487434864044,
"step": 2680,
"train/kl_loss_qwen": 0.023506175680086016,
"train/kl_loss_r1": 0.014184463652782142,
"train/total_kl": 0.03769063977524638
},
{
"epoch": 3.343390357698289,
"grad_norm": 0.859375,
"learning_rate": 4.9221668742216685e-06,
"loss": 0.2369,
"mean_token_accuracy": 0.9860921442508698,
"step": 2685,
"train/kl_loss_qwen": 0.023705671727657317,
"train/kl_loss_r1": 0.014161279378458857,
"train/total_kl": 0.03786695105955005
},
{
"epoch": 3.3496111975116643,
"grad_norm": 1.015625,
"learning_rate": 4.87546699875467e-06,
"loss": 0.2299,
"mean_token_accuracy": 0.9845267534255981,
"step": 2690,
"train/kl_loss_qwen": 0.021310369204729795,
"train/kl_loss_r1": 0.013280869252048433,
"train/total_kl": 0.03459123857319355
},
{
"epoch": 3.355832037325039,
"grad_norm": 0.73046875,
"learning_rate": 4.8287671232876716e-06,
"loss": 0.2275,
"mean_token_accuracy": 0.9860312432050705,
"step": 2695,
"train/kl_loss_qwen": 0.02123181507922709,
"train/kl_loss_r1": 0.013362622214481234,
"train/total_kl": 0.03459443720057607
},
{
"epoch": 3.3620528771384137,
"grad_norm": 1.0625,
"learning_rate": 4.782067247820672e-06,
"loss": 0.2565,
"mean_token_accuracy": 0.9833629161119462,
"step": 2700,
"train/kl_loss_qwen": 0.024914097087457777,
"train/kl_loss_r1": 0.013864034041762351,
"train/total_kl": 0.038778131082654
},
{
"epoch": 3.3682737169517885,
"grad_norm": 1.1015625,
"learning_rate": 4.735367372353674e-06,
"loss": 0.2274,
"mean_token_accuracy": 0.985034841299057,
"step": 2705,
"train/kl_loss_qwen": 0.021230686455965042,
"train/kl_loss_r1": 0.01340056979097426,
"train/total_kl": 0.03463125610724092
},
{
"epoch": 3.374494556765163,
"grad_norm": 1.0625,
"learning_rate": 4.6886674968866744e-06,
"loss": 0.2197,
"mean_token_accuracy": 0.9832078158855438,
"step": 2710,
"train/kl_loss_qwen": 0.019347388157621027,
"train/kl_loss_r1": 0.011695200949907303,
"train/total_kl": 0.031042589247226714
},
{
"epoch": 3.380715396578538,
"grad_norm": 0.875,
"learning_rate": 4.641967621419677e-06,
"loss": 0.2359,
"mean_token_accuracy": 0.9849886059761047,
"step": 2715,
"train/kl_loss_qwen": 0.022014891589060427,
"train/kl_loss_r1": 0.014034424582496286,
"train/total_kl": 0.03604931645095348
},
{
"epoch": 3.386936236391913,
"grad_norm": 0.87109375,
"learning_rate": 4.5952677459526775e-06,
"loss": 0.2505,
"mean_token_accuracy": 0.984162563085556,
"step": 2720,
"train/kl_loss_qwen": 0.02434834372252226,
"train/kl_loss_r1": 0.014979369170032442,
"train/total_kl": 0.03932771300897002
},
{
"epoch": 3.393157076205288,
"grad_norm": 0.8203125,
"learning_rate": 4.548567870485679e-06,
"loss": 0.2663,
"mean_token_accuracy": 0.984138822555542,
"step": 2725,
"train/kl_loss_qwen": 0.026038512215018274,
"train/kl_loss_r1": 0.015358842397108673,
"train/total_kl": 0.04139735447242856
},
{
"epoch": 3.3993779160186626,
"grad_norm": 1.046875,
"learning_rate": 4.50186799501868e-06,
"loss": 0.2214,
"mean_token_accuracy": 0.9856981605291366,
"step": 2730,
"train/kl_loss_qwen": 0.019446768146008254,
"train/kl_loss_r1": 0.012801338406279682,
"train/total_kl": 0.0322481069713831
},
{
"epoch": 3.4055987558320373,
"grad_norm": 1.1796875,
"learning_rate": 4.455168119551681e-06,
"loss": 0.2338,
"mean_token_accuracy": 0.9839027732610702,
"step": 2735,
"train/kl_loss_qwen": 0.02064052429050207,
"train/kl_loss_r1": 0.012976438086479903,
"train/total_kl": 0.033616962376981974
},
{
"epoch": 3.411819595645412,
"grad_norm": 1.0078125,
"learning_rate": 4.408468244084683e-06,
"loss": 0.2274,
"mean_token_accuracy": 0.9858880639076233,
"step": 2740,
"train/kl_loss_qwen": 0.020935347443446516,
"train/kl_loss_r1": 0.013251440855674446,
"train/total_kl": 0.03418678799644113
},
{
"epoch": 3.4180404354587868,
"grad_norm": 0.83984375,
"learning_rate": 4.3617683686176835e-06,
"loss": 0.2285,
"mean_token_accuracy": 0.9858361423015595,
"step": 2745,
"train/kl_loss_qwen": 0.021212745131924747,
"train/kl_loss_r1": 0.01365222295280546,
"train/total_kl": 0.03486496862024069
},
{
"epoch": 3.424261275272162,
"grad_norm": 1.0078125,
"learning_rate": 4.315068493150685e-06,
"loss": 0.2295,
"mean_token_accuracy": 0.9845366030931473,
"step": 2750,
"train/kl_loss_qwen": 0.020564079657196997,
"train/kl_loss_r1": 0.013706768536940217,
"train/total_kl": 0.034270848426967856
},
{
"epoch": 3.4304821150855367,
"grad_norm": 1.0078125,
"learning_rate": 4.2683686176836865e-06,
"loss": 0.225,
"mean_token_accuracy": 0.9845517426729202,
"step": 2755,
"train/kl_loss_qwen": 0.020470702182501556,
"train/kl_loss_r1": 0.013152860198169946,
"train/total_kl": 0.03362356275320053
},
{
"epoch": 3.4367029548989114,
"grad_norm": 0.8046875,
"learning_rate": 4.221668742216688e-06,
"loss": 0.2341,
"mean_token_accuracy": 0.984512385725975,
"step": 2760,
"train/kl_loss_qwen": 0.021487886970862746,
"train/kl_loss_r1": 0.013046193053014576,
"train/total_kl": 0.03453407995402813
},
{
"epoch": 3.442923794712286,
"grad_norm": 1.0625,
"learning_rate": 4.174968866749689e-06,
"loss": 0.2231,
"mean_token_accuracy": 0.9859201848506928,
"step": 2765,
"train/kl_loss_qwen": 0.020332144340500236,
"train/kl_loss_r1": 0.01277754541952163,
"train/total_kl": 0.033109689690172674
},
{
"epoch": 3.449144634525661,
"grad_norm": 1.0234375,
"learning_rate": 4.12826899128269e-06,
"loss": 0.2343,
"mean_token_accuracy": 0.9809245645999909,
"step": 2770,
"train/kl_loss_qwen": 0.020196593133732677,
"train/kl_loss_r1": 0.012610416440293194,
"train/total_kl": 0.03280700957402587
},
{
"epoch": 3.4553654743390356,
"grad_norm": 1.015625,
"learning_rate": 4.081569115815691e-06,
"loss": 0.2344,
"mean_token_accuracy": 0.9842493683099747,
"step": 2775,
"train/kl_loss_qwen": 0.021661369316279887,
"train/kl_loss_r1": 0.013402773765847087,
"train/total_kl": 0.03506414322182536
},
{
"epoch": 3.4615863141524104,
"grad_norm": 0.875,
"learning_rate": 4.0348692403486925e-06,
"loss": 0.2494,
"mean_token_accuracy": 0.985339805483818,
"step": 2780,
"train/kl_loss_qwen": 0.023978083208203316,
"train/kl_loss_r1": 0.014692715555429458,
"train/total_kl": 0.038670798763632774
},
{
"epoch": 3.4678071539657855,
"grad_norm": 0.8671875,
"learning_rate": 3.988169364881694e-06,
"loss": 0.2273,
"mean_token_accuracy": 0.9854962199926376,
"step": 2785,
"train/kl_loss_qwen": 0.020899151754565536,
"train/kl_loss_r1": 0.013141945214010775,
"train/total_kl": 0.03404109720140695
},
{
"epoch": 3.4740279937791603,
"grad_norm": 1.4609375,
"learning_rate": 3.941469489414695e-06,
"loss": 0.247,
"mean_token_accuracy": 0.9863706976175308,
"step": 2790,
"train/kl_loss_qwen": 0.02398818014189601,
"train/kl_loss_r1": 0.014264530991204083,
"train/total_kl": 0.038252711109817025
},
{
"epoch": 3.480248833592535,
"grad_norm": 0.79296875,
"learning_rate": 3.894769613947696e-06,
"loss": 0.2306,
"mean_token_accuracy": 0.9847693234682083,
"step": 2795,
"train/kl_loss_qwen": 0.020988399861380458,
"train/kl_loss_r1": 0.013396636093966663,
"train/total_kl": 0.03438503593206406
},
{
"epoch": 3.4864696734059097,
"grad_norm": 0.83984375,
"learning_rate": 3.848069738480698e-06,
"loss": 0.2387,
"mean_token_accuracy": 0.9844767868518829,
"step": 2800,
"train/kl_loss_qwen": 0.021816241182386877,
"train/kl_loss_r1": 0.014730063872411847,
"train/total_kl": 0.03654630491510034
},
{
"epoch": 3.4926905132192845,
"grad_norm": 1.078125,
"learning_rate": 3.801369863013699e-06,
"loss": 0.238,
"mean_token_accuracy": 0.9856153309345246,
"step": 2805,
"train/kl_loss_qwen": 0.022997609293088316,
"train/kl_loss_r1": 0.014218732388690114,
"train/total_kl": 0.037216341588646173
},
{
"epoch": 3.4989113530326597,
"grad_norm": 0.81640625,
"learning_rate": 3.7546699875467e-06,
"loss": 0.2414,
"mean_token_accuracy": 0.9863660573959351,
"step": 2810,
"train/kl_loss_qwen": 0.023191145109012722,
"train/kl_loss_r1": 0.014856462017633021,
"train/total_kl": 0.03804760677739978
},
{
"epoch": 3.505132192846034,
"grad_norm": 1.3046875,
"learning_rate": 3.707970112079701e-06,
"loss": 0.224,
"mean_token_accuracy": 0.9856793075799942,
"step": 2815,
"train/kl_loss_qwen": 0.020576135814189912,
"train/kl_loss_r1": 0.01223513432778418,
"train/total_kl": 0.032811269722878934
},
{
"epoch": 3.511353032659409,
"grad_norm": 1.03125,
"learning_rate": 3.6612702366127026e-06,
"loss": 0.2458,
"mean_token_accuracy": 0.9840625703334809,
"step": 2820,
"train/kl_loss_qwen": 0.021890020091086627,
"train/kl_loss_r1": 0.015305952937342226,
"train/total_kl": 0.03719597272574902
},
{
"epoch": 3.517573872472784,
"grad_norm": 0.75390625,
"learning_rate": 3.6145703611457037e-06,
"loss": 0.2366,
"mean_token_accuracy": 0.9833911150693894,
"step": 2825,
"train/kl_loss_qwen": 0.021799473231658338,
"train/kl_loss_r1": 0.013875545375049115,
"train/total_kl": 0.035675018839538095
},
{
"epoch": 3.5237947122861586,
"grad_norm": 1.15625,
"learning_rate": 3.567870485678705e-06,
"loss": 0.232,
"mean_token_accuracy": 0.9845116376876831,
"step": 2830,
"train/kl_loss_qwen": 0.021351216733455657,
"train/kl_loss_r1": 0.013609965075738728,
"train/total_kl": 0.034961181692779064
},
{
"epoch": 3.5300155520995333,
"grad_norm": 0.8515625,
"learning_rate": 3.5211706102117063e-06,
"loss": 0.2336,
"mean_token_accuracy": 0.9829171359539032,
"step": 2835,
"train/kl_loss_qwen": 0.02112548053264618,
"train/kl_loss_r1": 0.01297055478207767,
"train/total_kl": 0.034096034802496435
},
{
"epoch": 3.536236391912908,
"grad_norm": 0.97265625,
"learning_rate": 3.4744707347447074e-06,
"loss": 0.2601,
"mean_token_accuracy": 0.9832925647497177,
"step": 2840,
"train/kl_loss_qwen": 0.024747973820194603,
"train/kl_loss_r1": 0.014901431510224938,
"train/total_kl": 0.03964940514415503
},
{
"epoch": 3.5424572317262832,
"grad_norm": 0.86328125,
"learning_rate": 3.4277708592777085e-06,
"loss": 0.2468,
"mean_token_accuracy": 0.9836038619279861,
"step": 2845,
"train/kl_loss_qwen": 0.02415000000037253,
"train/kl_loss_r1": 0.014615483209490776,
"train/total_kl": 0.03876548307016492
},
{
"epoch": 3.548678071539658,
"grad_norm": 0.82421875,
"learning_rate": 3.38107098381071e-06,
"loss": 0.2488,
"mean_token_accuracy": 0.9870301902294158,
"step": 2850,
"train/kl_loss_qwen": 0.02544220401905477,
"train/kl_loss_r1": 0.015255382750183344,
"train/total_kl": 0.040697587002068755
},
{
"epoch": 3.5548989113530327,
"grad_norm": 0.87109375,
"learning_rate": 3.334371108343711e-06,
"loss": 0.2663,
"mean_token_accuracy": 0.9848790228366852,
"step": 2855,
"train/kl_loss_qwen": 0.02661481872200966,
"train/kl_loss_r1": 0.016790007473900914,
"train/total_kl": 0.04340482642874122
},
{
"epoch": 3.5611197511664074,
"grad_norm": 1.0859375,
"learning_rate": 3.2876712328767123e-06,
"loss": 0.3302,
"mean_token_accuracy": 0.9799584716558456,
"step": 2860,
"train/kl_loss_qwen": 0.03250132179819047,
"train/kl_loss_r1": 0.01764731693547219,
"train/total_kl": 0.05014863768592477
},
{
"epoch": 3.567340590979782,
"grad_norm": 0.8359375,
"learning_rate": 3.240971357409714e-06,
"loss": 0.2314,
"mean_token_accuracy": 0.9842890292406082,
"step": 2865,
"train/kl_loss_qwen": 0.020937564410269262,
"train/kl_loss_r1": 0.012288552708923817,
"train/total_kl": 0.033226117584854366
},
{
"epoch": 3.573561430793157,
"grad_norm": 5.96875,
"learning_rate": 3.194271481942715e-06,
"loss": 0.4016,
"mean_token_accuracy": 0.9750429719686509,
"step": 2870,
"train/kl_loss_qwen": 0.04201047793030739,
"train/kl_loss_r1": 0.022988221771083773,
"train/total_kl": 0.06499869888648391
},
{
"epoch": 3.5797822706065316,
"grad_norm": 2.0625,
"learning_rate": 3.1475716064757164e-06,
"loss": 0.414,
"mean_token_accuracy": 0.9800378859043122,
"step": 2875,
"train/kl_loss_qwen": 0.037109590321779254,
"train/kl_loss_r1": 0.03484028337989002,
"train/total_kl": 0.07194987395778299
},
{
"epoch": 3.586003110419907,
"grad_norm": 0.77734375,
"learning_rate": 3.100871731008717e-06,
"loss": 0.2773,
"mean_token_accuracy": 0.9851849496364593,
"step": 2880,
"train/kl_loss_qwen": 0.0281123923137784,
"train/kl_loss_r1": 0.01716474846471101,
"train/total_kl": 0.04527714066207409
},
{
"epoch": 3.5922239502332816,
"grad_norm": 1.0703125,
"learning_rate": 3.0541718555417186e-06,
"loss": 0.2348,
"mean_token_accuracy": 0.9836596220731735,
"step": 2885,
"train/kl_loss_qwen": 0.02031282209791243,
"train/kl_loss_r1": 0.01318891711998731,
"train/total_kl": 0.033501739241182805
},
{
"epoch": 3.5984447900466563,
"grad_norm": 0.828125,
"learning_rate": 3.0074719800747197e-06,
"loss": 0.2329,
"mean_token_accuracy": 0.9853809595108032,
"step": 2890,
"train/kl_loss_qwen": 0.021543790493160485,
"train/kl_loss_r1": 0.013360623200424016,
"train/total_kl": 0.03490441376343369
},
{
"epoch": 3.604665629860031,
"grad_norm": 0.93359375,
"learning_rate": 2.9607721046077213e-06,
"loss": 0.232,
"mean_token_accuracy": 0.9842139780521393,
"step": 2895,
"train/kl_loss_qwen": 0.019965836266055702,
"train/kl_loss_r1": 0.013940862705931067,
"train/total_kl": 0.03390669859945774
},
{
"epoch": 3.6108864696734058,
"grad_norm": 0.8671875,
"learning_rate": 2.9140722291407224e-06,
"loss": 0.2179,
"mean_token_accuracy": 0.9845876067876815,
"step": 2900,
"train/kl_loss_qwen": 0.01916212271898985,
"train/kl_loss_r1": 0.011550022312439978,
"train/total_kl": 0.030712145008146764
},
{
"epoch": 3.617107309486781,
"grad_norm": 0.8125,
"learning_rate": 2.8673723536737235e-06,
"loss": 0.2293,
"mean_token_accuracy": 0.9862509101629258,
"step": 2905,
"train/kl_loss_qwen": 0.02187169035896659,
"train/kl_loss_r1": 0.013140536611899734,
"train/total_kl": 0.03501222673803568
},
{
"epoch": 3.6233281493001557,
"grad_norm": 0.8359375,
"learning_rate": 2.820672478206725e-06,
"loss": 0.2403,
"mean_token_accuracy": 0.9864229768514633,
"step": 2910,
"train/kl_loss_qwen": 0.022343243472278118,
"train/kl_loss_r1": 0.014794543385505676,
"train/total_kl": 0.03713778667151928
},
{
"epoch": 3.6295489891135304,
"grad_norm": 0.9296875,
"learning_rate": 2.773972602739726e-06,
"loss": 0.2342,
"mean_token_accuracy": 0.9859908074140549,
"step": 2915,
"train/kl_loss_qwen": 0.020766420010477304,
"train/kl_loss_r1": 0.013887669052928686,
"train/total_kl": 0.03465408906340599
},
{
"epoch": 3.635769828926905,
"grad_norm": 0.93359375,
"learning_rate": 2.7272727272727272e-06,
"loss": 0.258,
"mean_token_accuracy": 0.9863515943288803,
"step": 2920,
"train/kl_loss_qwen": 0.026655311090871693,
"train/kl_loss_r1": 0.015320436703041196,
"train/total_kl": 0.04197574770078063
},
{
"epoch": 3.64199066874028,
"grad_norm": 0.87890625,
"learning_rate": 2.6805728518057283e-06,
"loss": 0.2441,
"mean_token_accuracy": 0.986115324497223,
"step": 2925,
"train/kl_loss_qwen": 0.023562894901260734,
"train/kl_loss_r1": 0.014923631912097335,
"train/total_kl": 0.038486526999622586
},
{
"epoch": 3.6482115085536546,
"grad_norm": 1.4453125,
"learning_rate": 2.63387297633873e-06,
"loss": 0.2312,
"mean_token_accuracy": 0.983121731877327,
"step": 2930,
"train/kl_loss_qwen": 0.021840346092358232,
"train/kl_loss_r1": 0.012263339408673347,
"train/total_kl": 0.034103685058653355
},
{
"epoch": 3.6544323483670293,
"grad_norm": 0.87890625,
"learning_rate": 2.587173100871731e-06,
"loss": 0.2305,
"mean_token_accuracy": 0.9866573423147201,
"step": 2935,
"train/kl_loss_qwen": 0.021724556758999824,
"train/kl_loss_r1": 0.013378932792693376,
"train/total_kl": 0.03510348927229643
},
{
"epoch": 3.6606531881804045,
"grad_norm": 0.890625,
"learning_rate": 2.5404732254047325e-06,
"loss": 0.263,
"mean_token_accuracy": 0.9836262166500092,
"step": 2940,
"train/kl_loss_qwen": 0.025465904222801327,
"train/kl_loss_r1": 0.015349965426139534,
"train/total_kl": 0.04081586915999651
},
{
"epoch": 3.6668740279937793,
"grad_norm": 0.890625,
"learning_rate": 2.4937733499377336e-06,
"loss": 0.2345,
"mean_token_accuracy": 0.9856616973876953,
"step": 2945,
"train/kl_loss_qwen": 0.022425138484686614,
"train/kl_loss_r1": 0.01358982149977237,
"train/total_kl": 0.036014959961175916
},
{
"epoch": 3.673094867807154,
"grad_norm": 0.94921875,
"learning_rate": 2.447073474470735e-06,
"loss": 0.275,
"mean_token_accuracy": 0.9830880254507065,
"step": 2950,
"train/kl_loss_qwen": 0.02608721745200455,
"train/kl_loss_r1": 0.015567693463526665,
"train/total_kl": 0.04165491117164492
},
{
"epoch": 3.6793157076205287,
"grad_norm": 1.03125,
"learning_rate": 2.4003735990037362e-06,
"loss": 0.2202,
"mean_token_accuracy": 0.9819297671318055,
"step": 2955,
"train/kl_loss_qwen": 0.018545484030619265,
"train/kl_loss_r1": 0.011856895894743502,
"train/total_kl": 0.030402379855513573
},
{
"epoch": 3.6855365474339035,
"grad_norm": 0.86328125,
"learning_rate": 2.353673723536737e-06,
"loss": 0.2471,
"mean_token_accuracy": 0.9828756898641586,
"step": 2960,
"train/kl_loss_qwen": 0.022580026322975753,
"train/kl_loss_r1": 0.013090070732869209,
"train/total_kl": 0.03567009726539254
},
{
"epoch": 3.6917573872472786,
"grad_norm": 0.90625,
"learning_rate": 2.3069738480697384e-06,
"loss": 0.2389,
"mean_token_accuracy": 0.9842888534069061,
"step": 2965,
"train/kl_loss_qwen": 0.021884618513286113,
"train/kl_loss_r1": 0.014056896232068539,
"train/total_kl": 0.035941514931619165
},
{
"epoch": 3.697978227060653,
"grad_norm": 1.40625,
"learning_rate": 2.2602739726027396e-06,
"loss": 0.25,
"mean_token_accuracy": 0.9838718444108963,
"step": 2970,
"train/kl_loss_qwen": 0.023744882782921195,
"train/kl_loss_r1": 0.014738423796370626,
"train/total_kl": 0.038483306765556335
},
{
"epoch": 3.704199066874028,
"grad_norm": 1.0390625,
"learning_rate": 2.213574097135741e-06,
"loss": 0.2358,
"mean_token_accuracy": 0.9839303970336915,
"step": 2975,
"train/kl_loss_qwen": 0.02131864381954074,
"train/kl_loss_r1": 0.014065050520002842,
"train/total_kl": 0.03538369433954358
},
{
"epoch": 3.710419906687403,
"grad_norm": 0.80078125,
"learning_rate": 2.166874221668742e-06,
"loss": 0.2444,
"mean_token_accuracy": 0.9859850376844406,
"step": 2980,
"train/kl_loss_qwen": 0.023973260773345828,
"train/kl_loss_r1": 0.014935575192794204,
"train/total_kl": 0.03890883605927229
},
{
"epoch": 3.7166407465007776,
"grad_norm": 1.03125,
"learning_rate": 2.1201743462017437e-06,
"loss": 0.2339,
"mean_token_accuracy": 0.9822094053030014,
"step": 2985,
"train/kl_loss_qwen": 0.020026676869019867,
"train/kl_loss_r1": 0.012334840325638651,
"train/total_kl": 0.032361517008394
},
{
"epoch": 3.7228615863141523,
"grad_norm": 0.921875,
"learning_rate": 2.073474470734745e-06,
"loss": 0.22,
"mean_token_accuracy": 0.9863646864891052,
"step": 2990,
"train/kl_loss_qwen": 0.0210922843310982,
"train/kl_loss_r1": 0.012671014782972634,
"train/total_kl": 0.033763298857957126
},
{
"epoch": 3.729082426127527,
"grad_norm": 0.8828125,
"learning_rate": 2.0267745952677463e-06,
"loss": 0.2267,
"mean_token_accuracy": 0.9849774003028869,
"step": 2995,
"train/kl_loss_qwen": 0.021177000598981977,
"train/kl_loss_r1": 0.01177487033419311,
"train/total_kl": 0.03295187065377832
},
{
"epoch": 3.7353032659409022,
"grad_norm": 0.8828125,
"learning_rate": 1.9800747198007475e-06,
"loss": 0.2236,
"mean_token_accuracy": 0.9847380638122558,
"step": 3000,
"train/kl_loss_qwen": 0.019074604008346797,
"train/kl_loss_r1": 0.013245354662649334,
"train/total_kl": 0.03231995878741145
},
{
"epoch": 3.741524105754277,
"grad_norm": 0.8671875,
"learning_rate": 1.933374844333748e-06,
"loss": 0.3323,
"mean_token_accuracy": 0.9824711471796036,
"step": 3005,
"train/kl_loss_qwen": 0.03514354228973389,
"train/kl_loss_r1": 0.02021597446873784,
"train/total_kl": 0.05535951666533947
},
{
"epoch": 3.7477449455676517,
"grad_norm": 0.85546875,
"learning_rate": 1.8866749688667499e-06,
"loss": 0.2289,
"mean_token_accuracy": 0.9856206774711609,
"step": 3010,
"train/kl_loss_qwen": 0.021088129049167036,
"train/kl_loss_r1": 0.013338046660646797,
"train/total_kl": 0.03442617561668158
},
{
"epoch": 3.7539657853810264,
"grad_norm": 0.87890625,
"learning_rate": 1.839975093399751e-06,
"loss": 0.4054,
"mean_token_accuracy": 0.9761894792318344,
"step": 3015,
"train/kl_loss_qwen": 0.043745915545150636,
"train/kl_loss_r1": 0.021301075490191577,
"train/total_kl": 0.06504699122160673
},
{
"epoch": 3.760186625194401,
"grad_norm": 0.87109375,
"learning_rate": 1.7932752179327523e-06,
"loss": 0.2172,
"mean_token_accuracy": 0.9812994867563247,
"step": 3020,
"train/kl_loss_qwen": 0.018437253870069982,
"train/kl_loss_r1": 0.010920788859948516,
"train/total_kl": 0.02935804296284914
},
{
"epoch": 3.766407465007776,
"grad_norm": 1.0546875,
"learning_rate": 1.7465753424657534e-06,
"loss": 0.2311,
"mean_token_accuracy": 0.9857212871313095,
"step": 3025,
"train/kl_loss_qwen": 0.0210646481718868,
"train/kl_loss_r1": 0.014203881798312067,
"train/total_kl": 0.035268529783934355
},
{
"epoch": 3.7726283048211506,
"grad_norm": 0.84765625,
"learning_rate": 1.6998754669987547e-06,
"loss": 0.2289,
"mean_token_accuracy": 0.9842836320400238,
"step": 3030,
"train/kl_loss_qwen": 0.02159463716670871,
"train/kl_loss_r1": 0.012302979337982833,
"train/total_kl": 0.03389761624857783
},
{
"epoch": 3.778849144634526,
"grad_norm": 0.79296875,
"learning_rate": 1.6531755915317558e-06,
"loss": 0.2267,
"mean_token_accuracy": 0.9854977697134018,
"step": 3035,
"train/kl_loss_qwen": 0.020470092073082924,
"train/kl_loss_r1": 0.013319645705632866,
"train/total_kl": 0.03378973761573434
},
{
"epoch": 3.7850699844479005,
"grad_norm": 0.953125,
"learning_rate": 1.6064757160647571e-06,
"loss": 0.2509,
"mean_token_accuracy": 0.9862113922834397,
"step": 3040,
"train/kl_loss_qwen": 0.0245562803465873,
"train/kl_loss_r1": 0.015157862054184078,
"train/total_kl": 0.03971414268016815
},
{
"epoch": 3.7912908242612753,
"grad_norm": 0.82421875,
"learning_rate": 1.5597758405977585e-06,
"loss": 0.2228,
"mean_token_accuracy": 0.9858496934175491,
"step": 3045,
"train/kl_loss_qwen": 0.020629500132054092,
"train/kl_loss_r1": 0.013019497063942254,
"train/total_kl": 0.03364899717271328
},
{
"epoch": 3.79751166407465,
"grad_norm": 1.0625,
"learning_rate": 1.5130759651307598e-06,
"loss": 0.2332,
"mean_token_accuracy": 0.9846426278352738,
"step": 3050,
"train/kl_loss_qwen": 0.021104606799781322,
"train/kl_loss_r1": 0.013108310452662409,
"train/total_kl": 0.0342129172757268
},
{
"epoch": 3.8037325038880248,
"grad_norm": 0.875,
"learning_rate": 1.4663760896637609e-06,
"loss": 0.2584,
"mean_token_accuracy": 0.9858539253473282,
"step": 3055,
"train/kl_loss_qwen": 0.025427423184737563,
"train/kl_loss_r1": 0.016527001629583538,
"train/total_kl": 0.04195442469790578
},
{
"epoch": 3.8099533437014,
"grad_norm": 0.95703125,
"learning_rate": 1.4196762141967622e-06,
"loss": 0.2181,
"mean_token_accuracy": 0.9840226501226426,
"step": 3060,
"train/kl_loss_qwen": 0.01866429247893393,
"train/kl_loss_r1": 0.012438310799188912,
"train/total_kl": 0.03110260358080268
},
{
"epoch": 3.816174183514774,
"grad_norm": 1.0234375,
"learning_rate": 1.3729763387297635e-06,
"loss": 0.2452,
"mean_token_accuracy": 0.9825713008642196,
"step": 3065,
"train/kl_loss_qwen": 0.02215881203301251,
"train/kl_loss_r1": 0.013574238121509551,
"train/total_kl": 0.035733049549162385
},
{
"epoch": 3.8223950233281494,
"grad_norm": 0.92578125,
"learning_rate": 1.3262764632627648e-06,
"loss": 0.2237,
"mean_token_accuracy": 0.9860330015420914,
"step": 3070,
"train/kl_loss_qwen": 0.020841342536732553,
"train/kl_loss_r1": 0.012603346444666385,
"train/total_kl": 0.03344468884170056
},
{
"epoch": 3.828615863141524,
"grad_norm": 0.8828125,
"learning_rate": 1.2795765877957657e-06,
"loss": 0.2413,
"mean_token_accuracy": 0.9861990302801132,
"step": 3075,
"train/kl_loss_qwen": 0.023467224929481743,
"train/kl_loss_r1": 0.014058938180096448,
"train/total_kl": 0.03752616299316287
},
{
"epoch": 3.834836702954899,
"grad_norm": 0.85546875,
"learning_rate": 1.232876712328767e-06,
"loss": 0.2327,
"mean_token_accuracy": 0.9857694715261459,
"step": 3080,
"train/kl_loss_qwen": 0.021740892436355352,
"train/kl_loss_r1": 0.013577925111167132,
"train/total_kl": 0.03531881738454103
},
{
"epoch": 3.8410575427682736,
"grad_norm": 1.03125,
"learning_rate": 1.1861768368617684e-06,
"loss": 0.2356,
"mean_token_accuracy": 0.9867552161216736,
"step": 3085,
"train/kl_loss_qwen": 0.021518895542249082,
"train/kl_loss_r1": 0.014279638021253049,
"train/total_kl": 0.03579853363335132
},
{
"epoch": 3.8472783825816483,
"grad_norm": 1.140625,
"learning_rate": 1.1394769613947697e-06,
"loss": 0.2505,
"mean_token_accuracy": 0.9849425464868545,
"step": 3090,
"train/kl_loss_qwen": 0.023463033000007273,
"train/kl_loss_r1": 0.015782216051593422,
"train/total_kl": 0.03924524867907166
},
{
"epoch": 3.8534992223950235,
"grad_norm": 0.82421875,
"learning_rate": 1.0927770859277708e-06,
"loss": 0.4111,
"mean_token_accuracy": 0.9756690293550492,
"step": 3095,
"train/kl_loss_qwen": 0.04434741260483861,
"train/kl_loss_r1": 0.02056443770416081,
"train/total_kl": 0.0649118491448462
},
{
"epoch": 3.8597200622083983,
"grad_norm": 0.9140625,
"learning_rate": 1.046077210460772e-06,
"loss": 0.2567,
"mean_token_accuracy": 0.9853157699108124,
"step": 3100,
"train/kl_loss_qwen": 0.026550929993391037,
"train/kl_loss_r1": 0.015549480146728457,
"train/total_kl": 0.04210041025653481
},
{
"epoch": 3.865940902021773,
"grad_norm": 0.98828125,
"learning_rate": 9.993773349937734e-07,
"loss": 0.25,
"mean_token_accuracy": 0.9842557400465012,
"step": 3105,
"train/kl_loss_qwen": 0.022726377053186298,
"train/kl_loss_r1": 0.01626164559274912,
"train/total_kl": 0.038988023158162834
},
{
"epoch": 3.8721617418351477,
"grad_norm": 0.7734375,
"learning_rate": 9.526774595267746e-07,
"loss": 0.2306,
"mean_token_accuracy": 0.9841700613498687,
"step": 3110,
"train/kl_loss_qwen": 0.02183036059141159,
"train/kl_loss_r1": 0.012751943548209965,
"train/total_kl": 0.034582304395735265
},
{
"epoch": 3.8783825816485225,
"grad_norm": 0.9453125,
"learning_rate": 9.059775840597758e-07,
"loss": 0.2701,
"mean_token_accuracy": 0.984642618894577,
"step": 3115,
"train/kl_loss_qwen": 0.02554837050847709,
"train/kl_loss_r1": 0.016179563431069254,
"train/total_kl": 0.041727933939546345
},
{
"epoch": 3.8846034214618976,
"grad_norm": 0.98828125,
"learning_rate": 8.592777085927771e-07,
"loss": 0.219,
"mean_token_accuracy": 0.9848039954900741,
"step": 3120,
"train/kl_loss_qwen": 0.018509938986971973,
"train/kl_loss_r1": 0.013476863643154502,
"train/total_kl": 0.03198680253699422
},
{
"epoch": 3.890824261275272,
"grad_norm": 0.828125,
"learning_rate": 8.125778331257784e-07,
"loss": 0.3768,
"mean_token_accuracy": 0.9785630255937576,
"step": 3125,
"train/kl_loss_qwen": 0.03686713627539575,
"train/kl_loss_r1": 0.024776964401826262,
"train/total_kl": 0.06164409937337041
},
{
"epoch": 3.897045101088647,
"grad_norm": 0.99609375,
"learning_rate": 7.658779576587797e-07,
"loss": 0.2351,
"mean_token_accuracy": 0.9840314447879791,
"step": 3130,
"train/kl_loss_qwen": 0.022078597731888295,
"train/kl_loss_r1": 0.013947232184000314,
"train/total_kl": 0.03602582989260554
},
{
"epoch": 3.903265940902022,
"grad_norm": 0.9296875,
"learning_rate": 7.191780821917808e-07,
"loss": 0.232,
"mean_token_accuracy": 0.9858786344528199,
"step": 3135,
"train/kl_loss_qwen": 0.02128533157519996,
"train/kl_loss_r1": 0.01425166679546237,
"train/total_kl": 0.0355369983240962
},
{
"epoch": 3.9094867807153966,
"grad_norm": 0.92578125,
"learning_rate": 6.724782067247821e-07,
"loss": 0.2524,
"mean_token_accuracy": 0.9848507881164551,
"step": 3140,
"train/kl_loss_qwen": 0.02394880629144609,
"train/kl_loss_r1": 0.015210675774142146,
"train/total_kl": 0.03915948234498501
},
{
"epoch": 3.9157076205287713,
"grad_norm": 0.78125,
"learning_rate": 6.257783312577833e-07,
"loss": 0.2599,
"mean_token_accuracy": 0.9854637980461121,
"step": 3145,
"train/kl_loss_qwen": 0.02829183344729245,
"train/kl_loss_r1": 0.013507619872689247,
"train/total_kl": 0.04179945318028331
},
{
"epoch": 3.921928460342146,
"grad_norm": 0.75,
"learning_rate": 5.790784557907846e-07,
"loss": 0.2671,
"mean_token_accuracy": 0.9863925516605377,
"step": 3150,
"train/kl_loss_qwen": 0.027312430460005997,
"train/kl_loss_r1": 0.01701681511476636,
"train/total_kl": 0.044329245761036876
},
{
"epoch": 3.928149300155521,
"grad_norm": 0.8203125,
"learning_rate": 5.323785803237859e-07,
"loss": 0.3209,
"mean_token_accuracy": 0.97878338098526,
"step": 3155,
"train/kl_loss_qwen": 0.03283619345165789,
"train/kl_loss_r1": 0.017961669899523258,
"train/total_kl": 0.05079786339774728
},
{
"epoch": 3.934370139968896,
"grad_norm": 1.15625,
"learning_rate": 4.856787048567871e-07,
"loss": 0.2415,
"mean_token_accuracy": 0.9832513570785523,
"step": 3160,
"train/kl_loss_qwen": 0.02150732106529176,
"train/kl_loss_r1": 0.014138684188947082,
"train/total_kl": 0.035646005533635616
},
{
"epoch": 3.9405909797822707,
"grad_norm": 0.78515625,
"learning_rate": 4.389788293897883e-07,
"loss": 0.3302,
"mean_token_accuracy": 0.9821478694677352,
"step": 3165,
"train/kl_loss_qwen": 0.035413914173841474,
"train/kl_loss_r1": 0.019884266471490265,
"train/total_kl": 0.05529817976057529
},
{
"epoch": 3.9468118195956454,
"grad_norm": 0.8046875,
"learning_rate": 3.9227895392278954e-07,
"loss": 0.2315,
"mean_token_accuracy": 0.9847661107778549,
"step": 3170,
"train/kl_loss_qwen": 0.021044514747336505,
"train/kl_loss_r1": 0.01309770722873509,
"train/total_kl": 0.03414222216233611
},
{
"epoch": 3.95303265940902,
"grad_norm": 1.0859375,
"learning_rate": 3.4557907845579075e-07,
"loss": 0.3341,
"mean_token_accuracy": 0.9789846986532211,
"step": 3175,
"train/kl_loss_qwen": 0.03371955840848386,
"train/kl_loss_r1": 0.017813174077309667,
"train/total_kl": 0.05153273269534111
},
{
"epoch": 3.959253499222395,
"grad_norm": 0.9296875,
"learning_rate": 2.98879202988792e-07,
"loss": 0.2994,
"mean_token_accuracy": 0.9830943882465363,
"step": 3180,
"train/kl_loss_qwen": 0.033274567080661656,
"train/kl_loss_r1": 0.015842707734555005,
"train/total_kl": 0.04911727402359247
},
{
"epoch": 3.9654743390357696,
"grad_norm": 1.265625,
"learning_rate": 2.521793275217933e-07,
"loss": 0.2351,
"mean_token_accuracy": 0.984268057346344,
"step": 3185,
"train/kl_loss_qwen": 0.021436449000611903,
"train/kl_loss_r1": 0.014701427333056927,
"train/total_kl": 0.03613787675276399
},
{
"epoch": 3.971695178849145,
"grad_norm": 0.85546875,
"learning_rate": 2.0547945205479452e-07,
"loss": 0.2427,
"mean_token_accuracy": 0.9866203486919403,
"step": 3190,
"train/kl_loss_qwen": 0.02276371791958809,
"train/kl_loss_r1": 0.015056712529622018,
"train/total_kl": 0.03782043047249317
},
{
"epoch": 3.9779160186625195,
"grad_norm": 0.75390625,
"learning_rate": 1.5877957658779578e-07,
"loss": 0.2355,
"mean_token_accuracy": 0.9860924631357193,
"step": 3195,
"train/kl_loss_qwen": 0.022292080451734364,
"train/kl_loss_r1": 0.01344187636859715,
"train/total_kl": 0.035733957309275866
},
{
"epoch": 3.9841368584758943,
"grad_norm": 0.8515625,
"learning_rate": 1.1207970112079702e-07,
"loss": 0.2508,
"mean_token_accuracy": 0.985159307718277,
"step": 3200,
"train/kl_loss_qwen": 0.02407874008640647,
"train/kl_loss_r1": 0.015484006190672518,
"train/total_kl": 0.039562746044248344
},
{
"epoch": 3.990357698289269,
"grad_norm": 0.80078125,
"learning_rate": 6.537982565379826e-08,
"loss": 0.2122,
"mean_token_accuracy": 0.9835577666759491,
"step": 3205,
"train/kl_loss_qwen": 0.018145430739969014,
"train/kl_loss_r1": 0.011138362321071326,
"train/total_kl": 0.029283793363720178
},
{
"epoch": 3.9965785381026437,
"grad_norm": 0.90234375,
"learning_rate": 1.86799501867995e-08,
"loss": 0.2528,
"mean_token_accuracy": 0.9819873452186585,
"step": 3210,
"train/kl_loss_qwen": 0.023181884456425904,
"train/kl_loss_r1": 0.01377418297342956,
"train/total_kl": 0.03695606719702482
}
],
"logging_steps": 5,
"max_steps": 3212,
"num_input_tokens_seen": 0,
"num_train_epochs": 4,
"save_steps": 500,
"stateful_callbacks": {
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": true,
"should_training_stop": true
},
"attributes": {}
}
},
"total_flos": 1.0794727176859484e+18,
"train_batch_size": 2,
"trial_name": null,
"trial_params": null
}