| { |
| "best_metric": null, |
| "best_model_checkpoint": null, |
| "epoch": 3.999066874027994, |
| "eval_steps": 500, |
| "global_step": 3212, |
| "is_hyper_param_search": false, |
| "is_local_process_zero": true, |
| "is_world_process_zero": true, |
| "log_history": [ |
| { |
| "epoch": 0.006220839813374806, |
| "grad_norm": 4.5, |
| "learning_rate": 2.9953300124533003e-05, |
| "loss": 0.8649, |
| "mean_token_accuracy": 0.885539248585701, |
| "step": 5, |
| "train/kl_loss_qwen": 0.06747693261131645, |
| "train/kl_loss_r1": 0.04241067896800814, |
| "train/total_kl": 0.10988761270418763 |
| }, |
| { |
| "epoch": 0.012441679626749611, |
| "grad_norm": 14.6875, |
| "learning_rate": 2.9906600249066002e-05, |
| "loss": 1.2059, |
| "mean_token_accuracy": 0.8885251730680466, |
| "step": 10, |
| "train/kl_loss_qwen": 0.0929522925056517, |
| "train/kl_loss_r1": 0.1073197754449211, |
| "train/total_kl": 0.20027207368984817 |
| }, |
| { |
| "epoch": 0.01866251944012442, |
| "grad_norm": 2.515625, |
| "learning_rate": 2.9859900373599004e-05, |
| "loss": 0.5277, |
| "mean_token_accuracy": 0.9018729269504547, |
| "step": 15, |
| "train/kl_loss_qwen": 0.03184658419340849, |
| "train/kl_loss_r1": 0.01505236077355221, |
| "train/total_kl": 0.04689894551411271 |
| }, |
| { |
| "epoch": 0.024883359253499222, |
| "grad_norm": 2.734375, |
| "learning_rate": 2.9813200498132003e-05, |
| "loss": 0.5372, |
| "mean_token_accuracy": 0.8993205606937409, |
| "step": 20, |
| "train/kl_loss_qwen": 0.03552339724265039, |
| "train/kl_loss_r1": 0.012143875833135098, |
| "train/total_kl": 0.04766727341338992 |
| }, |
| { |
| "epoch": 0.03110419906687403, |
| "grad_norm": 2.703125, |
| "learning_rate": 2.9766500622665006e-05, |
| "loss": 0.5124, |
| "mean_token_accuracy": 0.9028977572917938, |
| "step": 25, |
| "train/kl_loss_qwen": 0.031236130651086567, |
| "train/kl_loss_r1": 0.012251556990668178, |
| "train/total_kl": 0.04348768750205636 |
| }, |
| { |
| "epoch": 0.03732503888024884, |
| "grad_norm": 2.5625, |
| "learning_rate": 2.9719800747198008e-05, |
| "loss": 0.4767, |
| "mean_token_accuracy": 0.9011666357517243, |
| "step": 30, |
| "train/kl_loss_qwen": 0.026808999991044403, |
| "train/kl_loss_r1": 0.008258039911743254, |
| "train/total_kl": 0.03506704047322273 |
| }, |
| { |
| "epoch": 0.04354587869362364, |
| "grad_norm": 3.765625, |
| "learning_rate": 2.9673100871731007e-05, |
| "loss": 0.511, |
| "mean_token_accuracy": 0.9000001281499863, |
| "step": 35, |
| "train/kl_loss_qwen": 0.027317401487380266, |
| "train/kl_loss_r1": 0.013182285078801214, |
| "train/total_kl": 0.04049968663603067 |
| }, |
| { |
| "epoch": 0.049766718506998445, |
| "grad_norm": 2.609375, |
| "learning_rate": 2.962640099626401e-05, |
| "loss": 0.5154, |
| "mean_token_accuracy": 0.8928132474422454, |
| "step": 40, |
| "train/kl_loss_qwen": 0.027987364726141096, |
| "train/kl_loss_r1": 0.012156172015238553, |
| "train/total_kl": 0.04014353705570102 |
| }, |
| { |
| "epoch": 0.05598755832037325, |
| "grad_norm": 2.390625, |
| "learning_rate": 2.9579701120797012e-05, |
| "loss": 0.4937, |
| "mean_token_accuracy": 0.8918720930814743, |
| "step": 45, |
| "train/kl_loss_qwen": 0.024307892844080924, |
| "train/kl_loss_r1": 0.009873847151175142, |
| "train/total_kl": 0.034181739576160906 |
| }, |
| { |
| "epoch": 0.06220839813374806, |
| "grad_norm": 11.0625, |
| "learning_rate": 2.9533001245330014e-05, |
| "loss": 0.5548, |
| "mean_token_accuracy": 0.9037962466478348, |
| "step": 50, |
| "train/kl_loss_qwen": 0.0403732392936945, |
| "train/kl_loss_r1": 0.01709484038874507, |
| "train/total_kl": 0.057468080334365367 |
| }, |
| { |
| "epoch": 0.06842923794712286, |
| "grad_norm": 2.71875, |
| "learning_rate": 2.9486301369863017e-05, |
| "loss": 0.473, |
| "mean_token_accuracy": 0.902271169424057, |
| "step": 55, |
| "train/kl_loss_qwen": 0.027851210488006473, |
| "train/kl_loss_r1": 0.009670931240543723, |
| "train/total_kl": 0.03752214219421148 |
| }, |
| { |
| "epoch": 0.07465007776049767, |
| "grad_norm": 2.46875, |
| "learning_rate": 2.9439601494396016e-05, |
| "loss": 0.4726, |
| "mean_token_accuracy": 0.8976862788200378, |
| "step": 60, |
| "train/kl_loss_qwen": 0.02319532949477434, |
| "train/kl_loss_r1": 0.011528853024356068, |
| "train/total_kl": 0.034724182728677985 |
| }, |
| { |
| "epoch": 0.08087091757387248, |
| "grad_norm": 2.734375, |
| "learning_rate": 2.9392901618929018e-05, |
| "loss": 0.4812, |
| "mean_token_accuracy": 0.8980915457010269, |
| "step": 65, |
| "train/kl_loss_qwen": 0.0253461551386863, |
| "train/kl_loss_r1": 0.011177089205011726, |
| "train/total_kl": 0.036523244343698025 |
| }, |
| { |
| "epoch": 0.08709175738724728, |
| "grad_norm": 2.25, |
| "learning_rate": 2.934620174346202e-05, |
| "loss": 0.4546, |
| "mean_token_accuracy": 0.9052111625671386, |
| "step": 70, |
| "train/kl_loss_qwen": 0.024780120234936476, |
| "train/kl_loss_r1": 0.010003501223400236, |
| "train/total_kl": 0.03478362150490284 |
| }, |
| { |
| "epoch": 0.09331259720062209, |
| "grad_norm": 2.5, |
| "learning_rate": 2.929950186799502e-05, |
| "loss": 0.4993, |
| "mean_token_accuracy": 0.8921610146760941, |
| "step": 75, |
| "train/kl_loss_qwen": 0.023273218562826513, |
| "train/kl_loss_r1": 0.011020376090891659, |
| "train/total_kl": 0.03429359458386898 |
| }, |
| { |
| "epoch": 0.09953343701399689, |
| "grad_norm": 2.3125, |
| "learning_rate": 2.9252801992528022e-05, |
| "loss": 0.4828, |
| "mean_token_accuracy": 0.8996184289455413, |
| "step": 80, |
| "train/kl_loss_qwen": 0.024831860419362785, |
| "train/kl_loss_r1": 0.01152246268466115, |
| "train/total_kl": 0.03635432319715619 |
| }, |
| { |
| "epoch": 0.1057542768273717, |
| "grad_norm": 2.859375, |
| "learning_rate": 2.920610211706102e-05, |
| "loss": 0.4623, |
| "mean_token_accuracy": 0.898178032040596, |
| "step": 85, |
| "train/kl_loss_qwen": 0.022067550197243692, |
| "train/kl_loss_r1": 0.009043183457106353, |
| "train/total_kl": 0.031110733561217786 |
| }, |
| { |
| "epoch": 0.1119751166407465, |
| "grad_norm": 2.578125, |
| "learning_rate": 2.9159402241594023e-05, |
| "loss": 0.6165, |
| "mean_token_accuracy": 0.8967886596918107, |
| "step": 90, |
| "train/kl_loss_qwen": 0.04917705850675702, |
| "train/kl_loss_r1": 0.01726052793674171, |
| "train/total_kl": 0.06643758723512291 |
| }, |
| { |
| "epoch": 0.1181959564541213, |
| "grad_norm": 2.59375, |
| "learning_rate": 2.9112702366127026e-05, |
| "loss": 0.4688, |
| "mean_token_accuracy": 0.8956692755222321, |
| "step": 95, |
| "train/kl_loss_qwen": 0.022392515651881696, |
| "train/kl_loss_r1": 0.010053132427856326, |
| "train/total_kl": 0.03244564794003964 |
| }, |
| { |
| "epoch": 0.12441679626749612, |
| "grad_norm": 2.421875, |
| "learning_rate": 2.9066002490660025e-05, |
| "loss": 0.4666, |
| "mean_token_accuracy": 0.9006453633308411, |
| "step": 100, |
| "train/kl_loss_qwen": 0.02538487664423883, |
| "train/kl_loss_r1": 0.00974747968139127, |
| "train/total_kl": 0.03513235654681921 |
| }, |
| { |
| "epoch": 0.13063763608087092, |
| "grad_norm": 2.296875, |
| "learning_rate": 2.9019302615193027e-05, |
| "loss": 0.4403, |
| "mean_token_accuracy": 0.8980156928300858, |
| "step": 105, |
| "train/kl_loss_qwen": 0.019946316070854665, |
| "train/kl_loss_r1": 0.00894002104178071, |
| "train/total_kl": 0.0288863368332386 |
| }, |
| { |
| "epoch": 0.1368584758942457, |
| "grad_norm": 2.359375, |
| "learning_rate": 2.8972602739726026e-05, |
| "loss": 0.4374, |
| "mean_token_accuracy": 0.9068128049373627, |
| "step": 110, |
| "train/kl_loss_qwen": 0.02424931791611016, |
| "train/kl_loss_r1": 0.009157051984220742, |
| "train/total_kl": 0.03340637004002929 |
| }, |
| { |
| "epoch": 0.14307931570762053, |
| "grad_norm": 2.234375, |
| "learning_rate": 2.8925902864259028e-05, |
| "loss": 0.4392, |
| "mean_token_accuracy": 0.9012053400278092, |
| "step": 115, |
| "train/kl_loss_qwen": 0.020489979069679976, |
| "train/kl_loss_r1": 0.008880690694786609, |
| "train/total_kl": 0.02937066974118352 |
| }, |
| { |
| "epoch": 0.14930015552099535, |
| "grad_norm": 2.546875, |
| "learning_rate": 2.887920298879203e-05, |
| "loss": 0.4412, |
| "mean_token_accuracy": 0.899726277589798, |
| "step": 120, |
| "train/kl_loss_qwen": 0.0204013851005584, |
| "train/kl_loss_r1": 0.009058444690890611, |
| "train/total_kl": 0.029459829907864332 |
| }, |
| { |
| "epoch": 0.15552099533437014, |
| "grad_norm": 2.03125, |
| "learning_rate": 2.883250311332503e-05, |
| "loss": 0.4338, |
| "mean_token_accuracy": 0.9087229013442993, |
| "step": 125, |
| "train/kl_loss_qwen": 0.023963469313457608, |
| "train/kl_loss_r1": 0.010771268280223012, |
| "train/total_kl": 0.03473473777994514 |
| }, |
| { |
| "epoch": 0.16174183514774496, |
| "grad_norm": 2.359375, |
| "learning_rate": 2.8785803237858032e-05, |
| "loss": 0.4331, |
| "mean_token_accuracy": 0.9061719745397567, |
| "step": 130, |
| "train/kl_loss_qwen": 0.022065827203914524, |
| "train/kl_loss_r1": 0.011356789106503128, |
| "train/total_kl": 0.03342261621728539 |
| }, |
| { |
| "epoch": 0.16796267496111975, |
| "grad_norm": 2.234375, |
| "learning_rate": 2.8739103362391034e-05, |
| "loss": 0.4374, |
| "mean_token_accuracy": 0.9011161267757416, |
| "step": 135, |
| "train/kl_loss_qwen": 0.021853275410830975, |
| "train/kl_loss_r1": 0.010496085102204233, |
| "train/total_kl": 0.032349360454827544 |
| }, |
| { |
| "epoch": 0.17418351477449456, |
| "grad_norm": 2.328125, |
| "learning_rate": 2.8692403486924037e-05, |
| "loss": 0.4457, |
| "mean_token_accuracy": 0.9047422379255294, |
| "step": 140, |
| "train/kl_loss_qwen": 0.02275628219358623, |
| "train/kl_loss_r1": 0.010783428023569287, |
| "train/total_kl": 0.03353970991447568 |
| }, |
| { |
| "epoch": 0.18040435458786935, |
| "grad_norm": 3.21875, |
| "learning_rate": 2.864570361145704e-05, |
| "loss": 0.4538, |
| "mean_token_accuracy": 0.9026034384965896, |
| "step": 145, |
| "train/kl_loss_qwen": 0.02352142836898565, |
| "train/kl_loss_r1": 0.011291519668884576, |
| "train/total_kl": 0.03481294792145491 |
| }, |
| { |
| "epoch": 0.18662519440124417, |
| "grad_norm": 3.078125, |
| "learning_rate": 2.8599003735990038e-05, |
| "loss": 0.458, |
| "mean_token_accuracy": 0.9031858772039414, |
| "step": 150, |
| "train/kl_loss_qwen": 0.022739559737965466, |
| "train/kl_loss_r1": 0.012792359199374914, |
| "train/total_kl": 0.03553191879764199 |
| }, |
| { |
| "epoch": 0.19284603421461896, |
| "grad_norm": 2.375, |
| "learning_rate": 2.855230386052304e-05, |
| "loss": 0.5434, |
| "mean_token_accuracy": 0.907307168841362, |
| "step": 155, |
| "train/kl_loss_qwen": 0.04449260346591473, |
| "train/kl_loss_r1": 0.014073733380064369, |
| "train/total_kl": 0.05856633689254522 |
| }, |
| { |
| "epoch": 0.19906687402799378, |
| "grad_norm": 2.59375, |
| "learning_rate": 2.8505603985056043e-05, |
| "loss": 0.4605, |
| "mean_token_accuracy": 0.8996091216802597, |
| "step": 160, |
| "train/kl_loss_qwen": 0.025977824395522476, |
| "train/kl_loss_r1": 0.01165865061338991, |
| "train/total_kl": 0.03763647498562932 |
| }, |
| { |
| "epoch": 0.2052877138413686, |
| "grad_norm": 2.515625, |
| "learning_rate": 2.8458904109589042e-05, |
| "loss": 0.528, |
| "mean_token_accuracy": 0.900575140118599, |
| "step": 165, |
| "train/kl_loss_qwen": 0.031398235633969304, |
| "train/kl_loss_r1": 0.023330681957304478, |
| "train/total_kl": 0.05472891740500927 |
| }, |
| { |
| "epoch": 0.2115085536547434, |
| "grad_norm": 2.65625, |
| "learning_rate": 2.8412204234122044e-05, |
| "loss": 0.4433, |
| "mean_token_accuracy": 0.9035054802894592, |
| "step": 170, |
| "train/kl_loss_qwen": 0.0246684439945966, |
| "train/kl_loss_r1": 0.011178959859535098, |
| "train/total_kl": 0.03584740431979298 |
| }, |
| { |
| "epoch": 0.2177293934681182, |
| "grad_norm": 2.78125, |
| "learning_rate": 2.8365504358655043e-05, |
| "loss": 0.4265, |
| "mean_token_accuracy": 0.9048573732376098, |
| "step": 175, |
| "train/kl_loss_qwen": 0.02242542668245733, |
| "train/kl_loss_r1": 0.010072631668299437, |
| "train/total_kl": 0.032498058304190634 |
| }, |
| { |
| "epoch": 0.223950233281493, |
| "grad_norm": 2.53125, |
| "learning_rate": 2.8318804483188046e-05, |
| "loss": 0.469, |
| "mean_token_accuracy": 0.9018107861280441, |
| "step": 180, |
| "train/kl_loss_qwen": 0.02478899694979191, |
| "train/kl_loss_r1": 0.012270277575589716, |
| "train/total_kl": 0.037059274548664686 |
| }, |
| { |
| "epoch": 0.2301710730948678, |
| "grad_norm": 2.25, |
| "learning_rate": 2.8272104607721048e-05, |
| "loss": 0.5042, |
| "mean_token_accuracy": 0.9139624059200286, |
| "step": 185, |
| "train/kl_loss_qwen": 0.03831529831513762, |
| "train/kl_loss_r1": 0.01714326792862266, |
| "train/total_kl": 0.05545856654644012 |
| }, |
| { |
| "epoch": 0.2363919129082426, |
| "grad_norm": 2.140625, |
| "learning_rate": 2.8225404732254047e-05, |
| "loss": 0.5493, |
| "mean_token_accuracy": 0.9074622631072998, |
| "step": 190, |
| "train/kl_loss_qwen": 0.04459263035096228, |
| "train/kl_loss_r1": 0.01827790851239115, |
| "train/total_kl": 0.06287053730338812 |
| }, |
| { |
| "epoch": 0.24261275272161742, |
| "grad_norm": 2.40625, |
| "learning_rate": 2.817870485678705e-05, |
| "loss": 0.4768, |
| "mean_token_accuracy": 0.9010340601205826, |
| "step": 195, |
| "train/kl_loss_qwen": 0.027825326565653084, |
| "train/kl_loss_r1": 0.01221497980877757, |
| "train/total_kl": 0.04004030600190163 |
| }, |
| { |
| "epoch": 0.24883359253499224, |
| "grad_norm": 2.515625, |
| "learning_rate": 2.813200498132005e-05, |
| "loss": 0.464, |
| "mean_token_accuracy": 0.8969788819551467, |
| "step": 200, |
| "train/kl_loss_qwen": 0.02236967678181827, |
| "train/kl_loss_r1": 0.011131012113764882, |
| "train/total_kl": 0.03350068908184767 |
| }, |
| { |
| "epoch": 0.25505443234836706, |
| "grad_norm": 2.484375, |
| "learning_rate": 2.808530510585305e-05, |
| "loss": 0.4246, |
| "mean_token_accuracy": 0.9050369083881378, |
| "step": 205, |
| "train/kl_loss_qwen": 0.0205402294639498, |
| "train/kl_loss_r1": 0.009700670512393117, |
| "train/total_kl": 0.030240900162607432 |
| }, |
| { |
| "epoch": 0.26127527216174184, |
| "grad_norm": 2.3125, |
| "learning_rate": 2.8038605230386053e-05, |
| "loss": 0.4422, |
| "mean_token_accuracy": 0.90710708796978, |
| "step": 210, |
| "train/kl_loss_qwen": 0.02467436045408249, |
| "train/kl_loss_r1": 0.011160785856191069, |
| "train/total_kl": 0.03583514606580138 |
| }, |
| { |
| "epoch": 0.26749611197511663, |
| "grad_norm": 3.40625, |
| "learning_rate": 2.7991905354919052e-05, |
| "loss": 0.4912, |
| "mean_token_accuracy": 0.9063985139131546, |
| "step": 215, |
| "train/kl_loss_qwen": 0.03254157407209277, |
| "train/kl_loss_r1": 0.014230213570408523, |
| "train/total_kl": 0.04677178747951984 |
| }, |
| { |
| "epoch": 0.2737169517884914, |
| "grad_norm": 2.078125, |
| "learning_rate": 2.7945205479452054e-05, |
| "loss": 0.4077, |
| "mean_token_accuracy": 0.9085961043834686, |
| "step": 220, |
| "train/kl_loss_qwen": 0.019017737498506902, |
| "train/kl_loss_r1": 0.008564504305832088, |
| "train/total_kl": 0.027582241501659156 |
| }, |
| { |
| "epoch": 0.27993779160186627, |
| "grad_norm": 2.609375, |
| "learning_rate": 2.7898505603985057e-05, |
| "loss": 0.4285, |
| "mean_token_accuracy": 0.9006385743618012, |
| "step": 225, |
| "train/kl_loss_qwen": 0.020106442319229246, |
| "train/kl_loss_r1": 0.008756639622151851, |
| "train/total_kl": 0.028863081801682712 |
| }, |
| { |
| "epoch": 0.28615863141524106, |
| "grad_norm": 2.5625, |
| "learning_rate": 2.785180572851806e-05, |
| "loss": 0.4375, |
| "mean_token_accuracy": 0.9008216232061386, |
| "step": 230, |
| "train/kl_loss_qwen": 0.021523965429514645, |
| "train/kl_loss_r1": 0.008759856573306024, |
| "train/total_kl": 0.03028382211923599 |
| }, |
| { |
| "epoch": 0.29237947122861585, |
| "grad_norm": 2.578125, |
| "learning_rate": 2.780510585305106e-05, |
| "loss": 0.4448, |
| "mean_token_accuracy": 0.9039193242788315, |
| "step": 235, |
| "train/kl_loss_qwen": 0.02277344111353159, |
| "train/kl_loss_r1": 0.01099874887149781, |
| "train/total_kl": 0.03377219010144472 |
| }, |
| { |
| "epoch": 0.2986003110419907, |
| "grad_norm": 2.609375, |
| "learning_rate": 2.775840597758406e-05, |
| "loss": 0.4399, |
| "mean_token_accuracy": 0.8983087122440339, |
| "step": 240, |
| "train/kl_loss_qwen": 0.020881993137300013, |
| "train/kl_loss_r1": 0.009922460105735808, |
| "train/total_kl": 0.03080445323139429 |
| }, |
| { |
| "epoch": 0.3048211508553655, |
| "grad_norm": 2.796875, |
| "learning_rate": 2.7711706102117063e-05, |
| "loss": 0.417, |
| "mean_token_accuracy": 0.9045127362012864, |
| "step": 245, |
| "train/kl_loss_qwen": 0.020143334427848457, |
| "train/kl_loss_r1": 0.008726878045126795, |
| "train/total_kl": 0.02887021256610751 |
| }, |
| { |
| "epoch": 0.3110419906687403, |
| "grad_norm": 2.3125, |
| "learning_rate": 2.7665006226650062e-05, |
| "loss": 0.4208, |
| "mean_token_accuracy": 0.9110885441303254, |
| "step": 250, |
| "train/kl_loss_qwen": 0.021725011849775912, |
| "train/kl_loss_r1": 0.012001089472323655, |
| "train/total_kl": 0.03372610127553344 |
| }, |
| { |
| "epoch": 0.31726283048211507, |
| "grad_norm": 2.46875, |
| "learning_rate": 2.7618306351183064e-05, |
| "loss": 0.4402, |
| "mean_token_accuracy": 0.9017707496881485, |
| "step": 255, |
| "train/kl_loss_qwen": 0.022058865614235403, |
| "train/kl_loss_r1": 0.010667199129238724, |
| "train/total_kl": 0.032726064510643485 |
| }, |
| { |
| "epoch": 0.3234836702954899, |
| "grad_norm": 2.265625, |
| "learning_rate": 2.7571606475716067e-05, |
| "loss": 0.4254, |
| "mean_token_accuracy": 0.9135203003883362, |
| "step": 260, |
| "train/kl_loss_qwen": 0.025819759676232935, |
| "train/kl_loss_r1": 0.012692330474965274, |
| "train/total_kl": 0.0385120902210474 |
| }, |
| { |
| "epoch": 0.3297045101088647, |
| "grad_norm": 2.78125, |
| "learning_rate": 2.7524906600249066e-05, |
| "loss": 0.4498, |
| "mean_token_accuracy": 0.9065485000610352, |
| "step": 265, |
| "train/kl_loss_qwen": 0.02562568709254265, |
| "train/kl_loss_r1": 0.012835084449034185, |
| "train/total_kl": 0.03846077108755708 |
| }, |
| { |
| "epoch": 0.3359253499222395, |
| "grad_norm": 3.4375, |
| "learning_rate": 2.7478206724782068e-05, |
| "loss": 0.4544, |
| "mean_token_accuracy": 0.8968957453966141, |
| "step": 270, |
| "train/kl_loss_qwen": 0.020935205090790988, |
| "train/kl_loss_r1": 0.011926196550484746, |
| "train/total_kl": 0.03286140169948339 |
| }, |
| { |
| "epoch": 0.3421461897356143, |
| "grad_norm": 2.59375, |
| "learning_rate": 2.743150684931507e-05, |
| "loss": 0.4695, |
| "mean_token_accuracy": 0.895763835310936, |
| "step": 275, |
| "train/kl_loss_qwen": 0.024620278738439083, |
| "train/kl_loss_r1": 0.00964386686682701, |
| "train/total_kl": 0.0342641456052661 |
| }, |
| { |
| "epoch": 0.3483670295489891, |
| "grad_norm": 3.546875, |
| "learning_rate": 2.738480697384807e-05, |
| "loss": 0.4383, |
| "mean_token_accuracy": 0.9082347899675369, |
| "step": 280, |
| "train/kl_loss_qwen": 0.022315250197425484, |
| "train/kl_loss_r1": 0.014057450694963336, |
| "train/total_kl": 0.036372700985521075 |
| }, |
| { |
| "epoch": 0.3545878693623639, |
| "grad_norm": 2.296875, |
| "learning_rate": 2.7338107098381072e-05, |
| "loss": 0.4469, |
| "mean_token_accuracy": 0.9045476704835892, |
| "step": 285, |
| "train/kl_loss_qwen": 0.023055148823186756, |
| "train/kl_loss_r1": 0.009570301149506123, |
| "train/total_kl": 0.03262544954195619 |
| }, |
| { |
| "epoch": 0.3608087091757387, |
| "grad_norm": 2.421875, |
| "learning_rate": 2.729140722291407e-05, |
| "loss": 0.442, |
| "mean_token_accuracy": 0.9033053010702133, |
| "step": 290, |
| "train/kl_loss_qwen": 0.022126297745853663, |
| "train/kl_loss_r1": 0.012546762591227889, |
| "train/total_kl": 0.034673060104250905 |
| }, |
| { |
| "epoch": 0.36702954898911355, |
| "grad_norm": 2.390625, |
| "learning_rate": 2.7244707347447073e-05, |
| "loss": 0.4162, |
| "mean_token_accuracy": 0.9015816122293472, |
| "step": 295, |
| "train/kl_loss_qwen": 0.02032669628970325, |
| "train/kl_loss_r1": 0.007502669095993042, |
| "train/total_kl": 0.027829365665093066 |
| }, |
| { |
| "epoch": 0.37325038880248834, |
| "grad_norm": 2.390625, |
| "learning_rate": 2.7198007471980076e-05, |
| "loss": 0.4248, |
| "mean_token_accuracy": 0.9025011241436005, |
| "step": 300, |
| "train/kl_loss_qwen": 0.0200017383787781, |
| "train/kl_loss_r1": 0.009314235928468407, |
| "train/total_kl": 0.029315974470227955 |
| }, |
| { |
| "epoch": 0.37947122861586313, |
| "grad_norm": 2.265625, |
| "learning_rate": 2.7151307596513075e-05, |
| "loss": 0.4476, |
| "mean_token_accuracy": 0.8975890159606934, |
| "step": 305, |
| "train/kl_loss_qwen": 0.021518654003739358, |
| "train/kl_loss_r1": 0.010331802139990031, |
| "train/total_kl": 0.03185045635327697 |
| }, |
| { |
| "epoch": 0.3856920684292379, |
| "grad_norm": 2.984375, |
| "learning_rate": 2.7104607721046077e-05, |
| "loss": 0.473, |
| "mean_token_accuracy": 0.9017946988344192, |
| "step": 310, |
| "train/kl_loss_qwen": 0.028143000835552812, |
| "train/kl_loss_r1": 0.01120884264819324, |
| "train/total_kl": 0.039351843390613796 |
| }, |
| { |
| "epoch": 0.39191290824261277, |
| "grad_norm": 2.234375, |
| "learning_rate": 2.705790784557908e-05, |
| "loss": 0.3974, |
| "mean_token_accuracy": 0.9137770593166351, |
| "step": 315, |
| "train/kl_loss_qwen": 0.02027838435024023, |
| "train/kl_loss_r1": 0.009311219793744385, |
| "train/total_kl": 0.029589604306966066 |
| }, |
| { |
| "epoch": 0.39813374805598756, |
| "grad_norm": 2.546875, |
| "learning_rate": 2.701120797011208e-05, |
| "loss": 0.438, |
| "mean_token_accuracy": 0.9064665764570237, |
| "step": 320, |
| "train/kl_loss_qwen": 0.022875147871673107, |
| "train/kl_loss_r1": 0.010096224106382579, |
| "train/total_kl": 0.0329713718034327 |
| }, |
| { |
| "epoch": 0.40435458786936235, |
| "grad_norm": 2.578125, |
| "learning_rate": 2.6964508094645084e-05, |
| "loss": 0.4148, |
| "mean_token_accuracy": 0.9041642516851425, |
| "step": 325, |
| "train/kl_loss_qwen": 0.02039993805810809, |
| "train/kl_loss_r1": 0.009322560648433864, |
| "train/total_kl": 0.02972249872982502 |
| }, |
| { |
| "epoch": 0.4105754276827372, |
| "grad_norm": 3.15625, |
| "learning_rate": 2.6917808219178083e-05, |
| "loss": 0.4599, |
| "mean_token_accuracy": 0.8985224097967148, |
| "step": 330, |
| "train/kl_loss_qwen": 0.023622136563062668, |
| "train/kl_loss_r1": 0.010554712312296034, |
| "train/total_kl": 0.03417684901505709 |
| }, |
| { |
| "epoch": 0.416796267496112, |
| "grad_norm": 2.53125, |
| "learning_rate": 2.6871108343711085e-05, |
| "loss": 0.4479, |
| "mean_token_accuracy": 0.9001316875219345, |
| "step": 335, |
| "train/kl_loss_qwen": 0.023164877016097308, |
| "train/kl_loss_r1": 0.01062884961720556, |
| "train/total_kl": 0.03379372642375529 |
| }, |
| { |
| "epoch": 0.4230171073094868, |
| "grad_norm": 2.3125, |
| "learning_rate": 2.6824408468244084e-05, |
| "loss": 0.4349, |
| "mean_token_accuracy": 0.8997949302196503, |
| "step": 340, |
| "train/kl_loss_qwen": 0.020284941466525198, |
| "train/kl_loss_r1": 0.008697902620770036, |
| "train/total_kl": 0.028982843924313783 |
| }, |
| { |
| "epoch": 0.42923794712286156, |
| "grad_norm": 2.484375, |
| "learning_rate": 2.6777708592777087e-05, |
| "loss": 0.4183, |
| "mean_token_accuracy": 0.9043066084384919, |
| "step": 345, |
| "train/kl_loss_qwen": 0.020022868039086462, |
| "train/kl_loss_r1": 0.009400142775848507, |
| "train/total_kl": 0.02942301072180271 |
| }, |
| { |
| "epoch": 0.4354587869362364, |
| "grad_norm": 2.265625, |
| "learning_rate": 2.673100871731009e-05, |
| "loss": 0.4479, |
| "mean_token_accuracy": 0.9017944246530533, |
| "step": 350, |
| "train/kl_loss_qwen": 0.02255958765745163, |
| "train/kl_loss_r1": 0.011340912338346243, |
| "train/total_kl": 0.033900499902665616 |
| }, |
| { |
| "epoch": 0.4416796267496112, |
| "grad_norm": 2.515625, |
| "learning_rate": 2.6684308841843088e-05, |
| "loss": 0.5377, |
| "mean_token_accuracy": 0.9042023122310638, |
| "step": 355, |
| "train/kl_loss_qwen": 0.03636851399205625, |
| "train/kl_loss_r1": 0.018854469433426856, |
| "train/total_kl": 0.055222983751446006 |
| }, |
| { |
| "epoch": 0.447900466562986, |
| "grad_norm": 2.234375, |
| "learning_rate": 2.663760896637609e-05, |
| "loss": 0.4614, |
| "mean_token_accuracy": 0.9028053224086762, |
| "step": 360, |
| "train/kl_loss_qwen": 0.027840341813862322, |
| "train/kl_loss_r1": 0.012210264848545194, |
| "train/total_kl": 0.040050606802105905 |
| }, |
| { |
| "epoch": 0.45412130637636083, |
| "grad_norm": 2.21875, |
| "learning_rate": 2.6590909090909093e-05, |
| "loss": 0.4881, |
| "mean_token_accuracy": 0.9026069700717926, |
| "step": 365, |
| "train/kl_loss_qwen": 0.0276740618981421, |
| "train/kl_loss_r1": 0.014049774222075938, |
| "train/total_kl": 0.04172383584082127 |
| }, |
| { |
| "epoch": 0.4603421461897356, |
| "grad_norm": 2.59375, |
| "learning_rate": 2.6544209215442092e-05, |
| "loss": 0.5749, |
| "mean_token_accuracy": 0.9026127278804779, |
| "step": 370, |
| "train/kl_loss_qwen": 0.04495285819284618, |
| "train/kl_loss_r1": 0.020119147619698196, |
| "train/total_kl": 0.06507200542837381 |
| }, |
| { |
| "epoch": 0.4665629860031104, |
| "grad_norm": 2.484375, |
| "learning_rate": 2.6497509339975094e-05, |
| "loss": 0.4118, |
| "mean_token_accuracy": 0.9034813940525055, |
| "step": 375, |
| "train/kl_loss_qwen": 0.017691825143992902, |
| "train/kl_loss_r1": 0.008957023778930307, |
| "train/total_kl": 0.02664884882979095 |
| }, |
| { |
| "epoch": 0.4727838258164852, |
| "grad_norm": 2.515625, |
| "learning_rate": 2.6450809464508093e-05, |
| "loss": 0.4096, |
| "mean_token_accuracy": 0.910720819234848, |
| "step": 380, |
| "train/kl_loss_qwen": 0.02144034132361412, |
| "train/kl_loss_r1": 0.010176640888676047, |
| "train/total_kl": 0.03161698216572404 |
| }, |
| { |
| "epoch": 0.47900466562986005, |
| "grad_norm": 2.171875, |
| "learning_rate": 2.6404109589041096e-05, |
| "loss": 0.4332, |
| "mean_token_accuracy": 0.9097962707281113, |
| "step": 385, |
| "train/kl_loss_qwen": 0.026963545754551888, |
| "train/kl_loss_r1": 0.012227852316573262, |
| "train/total_kl": 0.03919139839708805 |
| }, |
| { |
| "epoch": 0.48522550544323484, |
| "grad_norm": 2.5625, |
| "learning_rate": 2.6357409713574098e-05, |
| "loss": 0.4293, |
| "mean_token_accuracy": 0.910787695646286, |
| "step": 390, |
| "train/kl_loss_qwen": 0.02452428713440895, |
| "train/kl_loss_r1": 0.011624911101534963, |
| "train/total_kl": 0.03614919856190681 |
| }, |
| { |
| "epoch": 0.49144634525660963, |
| "grad_norm": 2.625, |
| "learning_rate": 2.6310709838107097e-05, |
| "loss": 0.4018, |
| "mean_token_accuracy": 0.9127192169427871, |
| "step": 395, |
| "train/kl_loss_qwen": 0.019982953229919075, |
| "train/kl_loss_r1": 0.009762761346064509, |
| "train/total_kl": 0.029745714645832776 |
| }, |
| { |
| "epoch": 0.4976671850699845, |
| "grad_norm": 2.21875, |
| "learning_rate": 2.62640099626401e-05, |
| "loss": 0.4309, |
| "mean_token_accuracy": 0.9098518759012222, |
| "step": 400, |
| "train/kl_loss_qwen": 0.024961045105010272, |
| "train/kl_loss_r1": 0.011534130433574319, |
| "train/total_kl": 0.03649517530575395 |
| }, |
| { |
| "epoch": 0.5038880248833593, |
| "grad_norm": 2.125, |
| "learning_rate": 2.6217310087173102e-05, |
| "loss": 0.3924, |
| "mean_token_accuracy": 0.9169116854667664, |
| "step": 405, |
| "train/kl_loss_qwen": 0.021090314723551273, |
| "train/kl_loss_r1": 0.010099838604219258, |
| "train/total_kl": 0.031190153490751982 |
| }, |
| { |
| "epoch": 0.5101088646967341, |
| "grad_norm": 2.765625, |
| "learning_rate": 2.6170610211706104e-05, |
| "loss": 0.4122, |
| "mean_token_accuracy": 0.9040325850248336, |
| "step": 410, |
| "train/kl_loss_qwen": 0.01960067362524569, |
| "train/kl_loss_r1": 0.008205437916330993, |
| "train/total_kl": 0.027806111704558135 |
| }, |
| { |
| "epoch": 0.5163297045101088, |
| "grad_norm": 2.28125, |
| "learning_rate": 2.6123910336239106e-05, |
| "loss": 0.3899, |
| "mean_token_accuracy": 0.9136340916156769, |
| "step": 415, |
| "train/kl_loss_qwen": 0.019829964730888605, |
| "train/kl_loss_r1": 0.009041843877639621, |
| "train/total_kl": 0.028871809039264916 |
| }, |
| { |
| "epoch": 0.5225505443234837, |
| "grad_norm": 2.6875, |
| "learning_rate": 2.6077210460772105e-05, |
| "loss": 0.4553, |
| "mean_token_accuracy": 0.9060747653245926, |
| "step": 420, |
| "train/kl_loss_qwen": 0.02692516231909394, |
| "train/kl_loss_r1": 0.013944354082923383, |
| "train/total_kl": 0.0408695163205266 |
| }, |
| { |
| "epoch": 0.5287713841368584, |
| "grad_norm": 2.0625, |
| "learning_rate": 2.6030510585305108e-05, |
| "loss": 0.414, |
| "mean_token_accuracy": 0.9070446848869324, |
| "step": 425, |
| "train/kl_loss_qwen": 0.020327215222641824, |
| "train/kl_loss_r1": 0.009817754128016531, |
| "train/total_kl": 0.030144969280809165 |
| }, |
| { |
| "epoch": 0.5349922239502333, |
| "grad_norm": 2.203125, |
| "learning_rate": 2.5983810709838107e-05, |
| "loss": 0.4792, |
| "mean_token_accuracy": 0.9056743770837784, |
| "step": 430, |
| "train/kl_loss_qwen": 0.029629909666255116, |
| "train/kl_loss_r1": 0.01435271161608398, |
| "train/total_kl": 0.043982621002942326 |
| }, |
| { |
| "epoch": 0.5412130637636081, |
| "grad_norm": 2.828125, |
| "learning_rate": 2.593711083437111e-05, |
| "loss": 0.4092, |
| "mean_token_accuracy": 0.9107071310281754, |
| "step": 435, |
| "train/kl_loss_qwen": 0.02214355799369514, |
| "train/kl_loss_r1": 0.010212240810506045, |
| "train/total_kl": 0.03235579859465361 |
| }, |
| { |
| "epoch": 0.5474339035769828, |
| "grad_norm": 2.515625, |
| "learning_rate": 2.589041095890411e-05, |
| "loss": 0.4217, |
| "mean_token_accuracy": 0.9096204102039337, |
| "step": 440, |
| "train/kl_loss_qwen": 0.02451937450096011, |
| "train/kl_loss_r1": 0.010314402729272842, |
| "train/total_kl": 0.03483377709053457 |
| }, |
| { |
| "epoch": 0.5536547433903577, |
| "grad_norm": 2.234375, |
| "learning_rate": 2.584371108343711e-05, |
| "loss": 0.511, |
| "mean_token_accuracy": 0.9087847948074341, |
| "step": 445, |
| "train/kl_loss_qwen": 0.03897065857890993, |
| "train/kl_loss_r1": 0.013747443165630101, |
| "train/total_kl": 0.052718101628124715 |
| }, |
| { |
| "epoch": 0.5598755832037325, |
| "grad_norm": 2.546875, |
| "learning_rate": 2.5797011207970113e-05, |
| "loss": 0.4145, |
| "mean_token_accuracy": 0.9128732204437255, |
| "step": 450, |
| "train/kl_loss_qwen": 0.02431764816865325, |
| "train/kl_loss_r1": 0.010849157627671958, |
| "train/total_kl": 0.03516680607572198 |
| }, |
| { |
| "epoch": 0.5660964230171073, |
| "grad_norm": 2.75, |
| "learning_rate": 2.5750311332503115e-05, |
| "loss": 0.4282, |
| "mean_token_accuracy": 0.9059774994850158, |
| "step": 455, |
| "train/kl_loss_qwen": 0.022139727883040906, |
| "train/kl_loss_r1": 0.011035876907408237, |
| "train/total_kl": 0.03317560441792011 |
| }, |
| { |
| "epoch": 0.5723172628304821, |
| "grad_norm": 2.359375, |
| "learning_rate": 2.5703611457036114e-05, |
| "loss": 0.4504, |
| "mean_token_accuracy": 0.8980892598628998, |
| "step": 460, |
| "train/kl_loss_qwen": 0.020996935572475194, |
| "train/kl_loss_r1": 0.011420201789587737, |
| "train/total_kl": 0.032417137362062934 |
| }, |
| { |
| "epoch": 0.578538102643857, |
| "grad_norm": 2.421875, |
| "learning_rate": 2.5656911581569117e-05, |
| "loss": 0.4246, |
| "mean_token_accuracy": 0.9115836918354034, |
| "step": 465, |
| "train/kl_loss_qwen": 0.025193213764578105, |
| "train/kl_loss_r1": 0.012585591687820852, |
| "train/total_kl": 0.0377788052894175 |
| }, |
| { |
| "epoch": 0.5847589424572317, |
| "grad_norm": 2.53125, |
| "learning_rate": 2.5610211706102116e-05, |
| "loss": 0.4263, |
| "mean_token_accuracy": 0.9069680899381638, |
| "step": 470, |
| "train/kl_loss_qwen": 0.02035662648268044, |
| "train/kl_loss_r1": 0.010218093637377024, |
| "train/total_kl": 0.03057471993379295 |
| }, |
| { |
| "epoch": 0.5909797822706065, |
| "grad_norm": 2.40625, |
| "learning_rate": 2.5563511830635118e-05, |
| "loss": 0.414, |
| "mean_token_accuracy": 0.9063103586435318, |
| "step": 475, |
| "train/kl_loss_qwen": 0.020925334934145213, |
| "train/kl_loss_r1": 0.009019026858732104, |
| "train/total_kl": 0.029944361280649902 |
| }, |
| { |
| "epoch": 0.5972006220839814, |
| "grad_norm": 2.078125, |
| "learning_rate": 2.551681195516812e-05, |
| "loss": 0.4135, |
| "mean_token_accuracy": 0.9108444273471832, |
| "step": 480, |
| "train/kl_loss_qwen": 0.0211629044264555, |
| "train/kl_loss_r1": 0.009259478491730987, |
| "train/total_kl": 0.03042238261550665 |
| }, |
| { |
| "epoch": 0.6034214618973561, |
| "grad_norm": 2.8125, |
| "learning_rate": 2.547011207970112e-05, |
| "loss": 0.4338, |
| "mean_token_accuracy": 0.899581903219223, |
| "step": 485, |
| "train/kl_loss_qwen": 0.02072710790671408, |
| "train/kl_loss_r1": 0.010435436002444476, |
| "train/total_kl": 0.03116254387423396 |
| }, |
| { |
| "epoch": 0.609642301710731, |
| "grad_norm": 2.484375, |
| "learning_rate": 2.5423412204234122e-05, |
| "loss": 0.5159, |
| "mean_token_accuracy": 0.9059219062328339, |
| "step": 490, |
| "train/kl_loss_qwen": 0.03367695207707584, |
| "train/kl_loss_r1": 0.018230854975990952, |
| "train/total_kl": 0.05190780712291598 |
| }, |
| { |
| "epoch": 0.6158631415241057, |
| "grad_norm": 2.734375, |
| "learning_rate": 2.5376712328767124e-05, |
| "loss": 0.5261, |
| "mean_token_accuracy": 0.9024108290672302, |
| "step": 495, |
| "train/kl_loss_qwen": 0.03762428821064532, |
| "train/kl_loss_r1": 0.014978185016661882, |
| "train/total_kl": 0.05260247401893139 |
| }, |
| { |
| "epoch": 0.6220839813374806, |
| "grad_norm": 2.3125, |
| "learning_rate": 2.5330012453300127e-05, |
| "loss": 0.4235, |
| "mean_token_accuracy": 0.9005639761686325, |
| "step": 500, |
| "train/kl_loss_qwen": 0.01958498265594244, |
| "train/kl_loss_r1": 0.009812347800470888, |
| "train/total_kl": 0.029397330433130264 |
| }, |
| { |
| "epoch": 0.6283048211508554, |
| "grad_norm": 2.1875, |
| "learning_rate": 2.528331257783313e-05, |
| "loss": 0.4486, |
| "mean_token_accuracy": 0.9037535905838012, |
| "step": 505, |
| "train/kl_loss_qwen": 0.024349090829491615, |
| "train/kl_loss_r1": 0.01013639271259308, |
| "train/total_kl": 0.034485483448952435 |
| }, |
| { |
| "epoch": 0.6345256609642301, |
| "grad_norm": 2.359375, |
| "learning_rate": 2.5236612702366128e-05, |
| "loss": 0.4169, |
| "mean_token_accuracy": 0.909102076292038, |
| "step": 510, |
| "train/kl_loss_qwen": 0.021461383812129496, |
| "train/kl_loss_r1": 0.00960217888932675, |
| "train/total_kl": 0.03106356244534254 |
| }, |
| { |
| "epoch": 0.640746500777605, |
| "grad_norm": 2.078125, |
| "learning_rate": 2.518991282689913e-05, |
| "loss": 0.5199, |
| "mean_token_accuracy": 0.9052909880876541, |
| "step": 515, |
| "train/kl_loss_qwen": 0.04063015528954565, |
| "train/kl_loss_r1": 0.012601481808815151, |
| "train/total_kl": 0.05323163778521121 |
| }, |
| { |
| "epoch": 0.6469673405909798, |
| "grad_norm": 2.546875, |
| "learning_rate": 2.514321295143213e-05, |
| "loss": 0.4219, |
| "mean_token_accuracy": 0.9009439706802368, |
| "step": 520, |
| "train/kl_loss_qwen": 0.022013092087581752, |
| "train/kl_loss_r1": 0.009523639199323952, |
| "train/total_kl": 0.03153673121705651 |
| }, |
| { |
| "epoch": 0.6531881804043546, |
| "grad_norm": 2.453125, |
| "learning_rate": 2.509651307596513e-05, |
| "loss": 0.3976, |
| "mean_token_accuracy": 0.9118671506643296, |
| "step": 525, |
| "train/kl_loss_qwen": 0.020429779263213276, |
| "train/kl_loss_r1": 0.009877034788951277, |
| "train/total_kl": 0.030306814052164555 |
| }, |
| { |
| "epoch": 0.6594090202177294, |
| "grad_norm": 2.71875, |
| "learning_rate": 2.5049813200498134e-05, |
| "loss": 0.4137, |
| "mean_token_accuracy": 0.9093097120523452, |
| "step": 530, |
| "train/kl_loss_qwen": 0.02071451968513429, |
| "train/kl_loss_r1": 0.010642997454851866, |
| "train/total_kl": 0.03135751727968454 |
| }, |
| { |
| "epoch": 0.6656298600311042, |
| "grad_norm": 2.21875, |
| "learning_rate": 2.5003113325031133e-05, |
| "loss": 0.4233, |
| "mean_token_accuracy": 0.9019553482532501, |
| "step": 535, |
| "train/kl_loss_qwen": 0.018656383082270623, |
| "train/kl_loss_r1": 0.00829046352300793, |
| "train/total_kl": 0.026946846721693875 |
| }, |
| { |
| "epoch": 0.671850699844479, |
| "grad_norm": 2.671875, |
| "learning_rate": 2.4956413449564135e-05, |
| "loss": 0.4466, |
| "mean_token_accuracy": 0.9081733852624894, |
| "step": 540, |
| "train/kl_loss_qwen": 0.02441343287937343, |
| "train/kl_loss_r1": 0.014263224578462541, |
| "train/total_kl": 0.03867665748111904 |
| }, |
| { |
| "epoch": 0.6780715396578538, |
| "grad_norm": 2.75, |
| "learning_rate": 2.4909713574097134e-05, |
| "loss": 0.4312, |
| "mean_token_accuracy": 0.9087280422449112, |
| "step": 545, |
| "train/kl_loss_qwen": 0.024243433307856322, |
| "train/kl_loss_r1": 0.01274189695250243, |
| "train/total_kl": 0.036985330190509556 |
| }, |
| { |
| "epoch": 0.6842923794712286, |
| "grad_norm": 2.15625, |
| "learning_rate": 2.4863013698630137e-05, |
| "loss": 0.4367, |
| "mean_token_accuracy": 0.9086010038852692, |
| "step": 550, |
| "train/kl_loss_qwen": 0.02496406654827297, |
| "train/kl_loss_r1": 0.012116139847785234, |
| "train/total_kl": 0.03708020634949207 |
| }, |
| { |
| "epoch": 0.6905132192846034, |
| "grad_norm": 2.390625, |
| "learning_rate": 2.481631382316314e-05, |
| "loss": 0.4226, |
| "mean_token_accuracy": 0.90582574903965, |
| "step": 555, |
| "train/kl_loss_qwen": 0.022924260469153523, |
| "train/kl_loss_r1": 0.010547170951031148, |
| "train/total_kl": 0.033471431396901605 |
| }, |
| { |
| "epoch": 0.6967340590979783, |
| "grad_norm": 2.0625, |
| "learning_rate": 2.4769613947696138e-05, |
| "loss": 0.436, |
| "mean_token_accuracy": 0.9055513799190521, |
| "step": 560, |
| "train/kl_loss_qwen": 0.022723140241578222, |
| "train/kl_loss_r1": 0.010732360580004752, |
| "train/total_kl": 0.03345550089143216 |
| }, |
| { |
| "epoch": 0.702954898911353, |
| "grad_norm": 2.328125, |
| "learning_rate": 2.472291407222914e-05, |
| "loss": 0.4205, |
| "mean_token_accuracy": 0.9103393256664276, |
| "step": 565, |
| "train/kl_loss_qwen": 0.022250397596508265, |
| "train/kl_loss_r1": 0.010711905942298473, |
| "train/total_kl": 0.03296230314299464 |
| }, |
| { |
| "epoch": 0.7091757387247278, |
| "grad_norm": 2.40625, |
| "learning_rate": 2.4676214196762143e-05, |
| "loss": 0.4279, |
| "mean_token_accuracy": 0.9037681072950363, |
| "step": 570, |
| "train/kl_loss_qwen": 0.02226592218503356, |
| "train/kl_loss_r1": 0.011035812250338495, |
| "train/total_kl": 0.03330173455178738 |
| }, |
| { |
| "epoch": 0.7153965785381027, |
| "grad_norm": 2.3125, |
| "learning_rate": 2.4629514321295142e-05, |
| "loss": 0.4242, |
| "mean_token_accuracy": 0.9072872966527938, |
| "step": 575, |
| "train/kl_loss_qwen": 0.023182417685166, |
| "train/kl_loss_r1": 0.01031209627399221, |
| "train/total_kl": 0.03349451422691345 |
| }, |
| { |
| "epoch": 0.7216174183514774, |
| "grad_norm": 2.65625, |
| "learning_rate": 2.4582814445828148e-05, |
| "loss": 0.4304, |
| "mean_token_accuracy": 0.9093700498342514, |
| "step": 580, |
| "train/kl_loss_qwen": 0.022953651519492267, |
| "train/kl_loss_r1": 0.012493736506439746, |
| "train/total_kl": 0.03544738814234734 |
| }, |
| { |
| "epoch": 0.7278382581648523, |
| "grad_norm": 2.34375, |
| "learning_rate": 2.4536114570361147e-05, |
| "loss": 0.4096, |
| "mean_token_accuracy": 0.9129402995109558, |
| "step": 585, |
| "train/kl_loss_qwen": 0.022961481800302865, |
| "train/kl_loss_r1": 0.01040629018098116, |
| "train/total_kl": 0.03336777174845338 |
| }, |
| { |
| "epoch": 0.7340590979782271, |
| "grad_norm": 2.1875, |
| "learning_rate": 2.448941469489415e-05, |
| "loss": 0.3991, |
| "mean_token_accuracy": 0.914150008559227, |
| "step": 590, |
| "train/kl_loss_qwen": 0.022263350780121982, |
| "train/kl_loss_r1": 0.011094499076716603, |
| "train/total_kl": 0.03335785013623536 |
| }, |
| { |
| "epoch": 0.7402799377916018, |
| "grad_norm": 2.234375, |
| "learning_rate": 2.444271481942715e-05, |
| "loss": 0.4076, |
| "mean_token_accuracy": 0.9096796810626984, |
| "step": 595, |
| "train/kl_loss_qwen": 0.020499514462426306, |
| "train/kl_loss_r1": 0.009279927227180452, |
| "train/total_kl": 0.02977944165468216 |
| }, |
| { |
| "epoch": 0.7465007776049767, |
| "grad_norm": 2.65625, |
| "learning_rate": 2.439601494396015e-05, |
| "loss": 0.4216, |
| "mean_token_accuracy": 0.9014455765485764, |
| "step": 600, |
| "train/kl_loss_qwen": 0.018622068548575045, |
| "train/kl_loss_r1": 0.009365804423578084, |
| "train/total_kl": 0.027987872809171678 |
| }, |
| { |
| "epoch": 0.7527216174183515, |
| "grad_norm": 2.296875, |
| "learning_rate": 2.4349315068493153e-05, |
| "loss": 0.3906, |
| "mean_token_accuracy": 0.9145099073648453, |
| "step": 605, |
| "train/kl_loss_qwen": 0.019467818038538098, |
| "train/kl_loss_r1": 0.008078851248137653, |
| "train/total_kl": 0.02754666917026043 |
| }, |
| { |
| "epoch": 0.7589424572317263, |
| "grad_norm": 2.515625, |
| "learning_rate": 2.4302615193026152e-05, |
| "loss": 0.3987, |
| "mean_token_accuracy": 0.9153716772794723, |
| "step": 610, |
| "train/kl_loss_qwen": 0.022999429237097503, |
| "train/kl_loss_r1": 0.00981712534558028, |
| "train/total_kl": 0.03281655451282859 |
| }, |
| { |
| "epoch": 0.7651632970451011, |
| "grad_norm": 2.703125, |
| "learning_rate": 2.4255915317559154e-05, |
| "loss": 0.3885, |
| "mean_token_accuracy": 0.913951313495636, |
| "step": 615, |
| "train/kl_loss_qwen": 0.01929868240840733, |
| "train/kl_loss_r1": 0.009192716074176132, |
| "train/total_kl": 0.0284913981333375 |
| }, |
| { |
| "epoch": 0.7713841368584758, |
| "grad_norm": 2.515625, |
| "learning_rate": 2.4209215442092156e-05, |
| "loss": 0.438, |
| "mean_token_accuracy": 0.9032023847103119, |
| "step": 620, |
| "train/kl_loss_qwen": 0.02276699091307819, |
| "train/kl_loss_r1": 0.010404858528636396, |
| "train/total_kl": 0.03317184979096055 |
| }, |
| { |
| "epoch": 0.7776049766718507, |
| "grad_norm": 2.75, |
| "learning_rate": 2.4162515566625155e-05, |
| "loss": 0.4249, |
| "mean_token_accuracy": 0.901955908536911, |
| "step": 625, |
| "train/kl_loss_qwen": 0.022086183354258538, |
| "train/kl_loss_r1": 0.010839143022894859, |
| "train/total_kl": 0.03292532628402114 |
| }, |
| { |
| "epoch": 0.7838258164852255, |
| "grad_norm": 2.421875, |
| "learning_rate": 2.4115815691158158e-05, |
| "loss": 0.4441, |
| "mean_token_accuracy": 0.9012407660484314, |
| "step": 630, |
| "train/kl_loss_qwen": 0.021360087487846614, |
| "train/kl_loss_r1": 0.010610865615308284, |
| "train/total_kl": 0.0319709531031549 |
| }, |
| { |
| "epoch": 0.7900466562986003, |
| "grad_norm": 2.15625, |
| "learning_rate": 2.4069115815691157e-05, |
| "loss": 0.4119, |
| "mean_token_accuracy": 0.9116487741470337, |
| "step": 635, |
| "train/kl_loss_qwen": 0.02234299052506685, |
| "train/kl_loss_r1": 0.010703041870146989, |
| "train/total_kl": 0.033046032395213844 |
| }, |
| { |
| "epoch": 0.7962674961119751, |
| "grad_norm": 2.15625, |
| "learning_rate": 2.402241594022416e-05, |
| "loss": 0.3923, |
| "mean_token_accuracy": 0.9124638080596924, |
| "step": 640, |
| "train/kl_loss_qwen": 0.02015606495551765, |
| "train/kl_loss_r1": 0.008730803325306624, |
| "train/total_kl": 0.02888686824589968 |
| }, |
| { |
| "epoch": 0.80248833592535, |
| "grad_norm": 2.5625, |
| "learning_rate": 2.397571606475716e-05, |
| "loss": 0.4379, |
| "mean_token_accuracy": 0.9059850156307221, |
| "step": 645, |
| "train/kl_loss_qwen": 0.024274708051234484, |
| "train/kl_loss_r1": 0.013806939870119096, |
| "train/total_kl": 0.0380816476419568 |
| }, |
| { |
| "epoch": 0.8087091757387247, |
| "grad_norm": 2.484375, |
| "learning_rate": 2.392901618929016e-05, |
| "loss": 0.4658, |
| "mean_token_accuracy": 0.903114652633667, |
| "step": 650, |
| "train/kl_loss_qwen": 0.02699953648261726, |
| "train/kl_loss_r1": 0.01478456505574286, |
| "train/total_kl": 0.04178410097956657 |
| }, |
| { |
| "epoch": 0.8149300155520995, |
| "grad_norm": 2.25, |
| "learning_rate": 2.3882316313823163e-05, |
| "loss": 0.4109, |
| "mean_token_accuracy": 0.9127248078584671, |
| "step": 655, |
| "train/kl_loss_qwen": 0.022482301201671363, |
| "train/kl_loss_r1": 0.011614846624433994, |
| "train/total_kl": 0.03409714791923761 |
| }, |
| { |
| "epoch": 0.8211508553654744, |
| "grad_norm": 3.03125, |
| "learning_rate": 2.3835616438356165e-05, |
| "loss": 0.4755, |
| "mean_token_accuracy": 0.8993414014577865, |
| "step": 660, |
| "train/kl_loss_qwen": 0.02683520861901343, |
| "train/kl_loss_r1": 0.011668766860384493, |
| "train/total_kl": 0.03850397523492575 |
| }, |
| { |
| "epoch": 0.8273716951788491, |
| "grad_norm": 2.328125, |
| "learning_rate": 2.3788916562889164e-05, |
| "loss": 0.387, |
| "mean_token_accuracy": 0.9139132559299469, |
| "step": 665, |
| "train/kl_loss_qwen": 0.01782120973803103, |
| "train/kl_loss_r1": 0.007813481765333563, |
| "train/total_kl": 0.025634691584855318 |
| }, |
| { |
| "epoch": 0.833592534992224, |
| "grad_norm": 2.578125, |
| "learning_rate": 2.374221668742217e-05, |
| "loss": 0.4095, |
| "mean_token_accuracy": 0.911031749844551, |
| "step": 670, |
| "train/kl_loss_qwen": 0.02113759545609355, |
| "train/kl_loss_r1": 0.01039525493979454, |
| "train/total_kl": 0.03153285039588809 |
| }, |
| { |
| "epoch": 0.8398133748055988, |
| "grad_norm": 2.265625, |
| "learning_rate": 2.369551681195517e-05, |
| "loss": 0.4168, |
| "mean_token_accuracy": 0.9161271333694458, |
| "step": 675, |
| "train/kl_loss_qwen": 0.024909159727394582, |
| "train/kl_loss_r1": 0.011709271254949272, |
| "train/total_kl": 0.036618431005626915 |
| }, |
| { |
| "epoch": 0.8460342146189735, |
| "grad_norm": 2.46875, |
| "learning_rate": 2.364881693648817e-05, |
| "loss": 0.3758, |
| "mean_token_accuracy": 0.9198156714439392, |
| "step": 680, |
| "train/kl_loss_qwen": 0.021275783283635975, |
| "train/kl_loss_r1": 0.009512535692192615, |
| "train/total_kl": 0.03078831881284714 |
| }, |
| { |
| "epoch": 0.8522550544323484, |
| "grad_norm": 2.640625, |
| "learning_rate": 2.3602117061021174e-05, |
| "loss": 0.4299, |
| "mean_token_accuracy": 0.9063263684511185, |
| "step": 685, |
| "train/kl_loss_qwen": 0.021453795861452817, |
| "train/kl_loss_r1": 0.010479483660310507, |
| "train/total_kl": 0.03193327952176332 |
| }, |
| { |
| "epoch": 0.8584758942457231, |
| "grad_norm": 2.546875, |
| "learning_rate": 2.3555417185554173e-05, |
| "loss": 0.4041, |
| "mean_token_accuracy": 0.913576290011406, |
| "step": 690, |
| "train/kl_loss_qwen": 0.022580369981005786, |
| "train/kl_loss_r1": 0.010107158054597675, |
| "train/total_kl": 0.03268752777948976 |
| }, |
| { |
| "epoch": 0.864696734059098, |
| "grad_norm": 2.84375, |
| "learning_rate": 2.3508717310087175e-05, |
| "loss": 0.4291, |
| "mean_token_accuracy": 0.9059417158365249, |
| "step": 695, |
| "train/kl_loss_qwen": 0.022479857504367828, |
| "train/kl_loss_r1": 0.010261117829941213, |
| "train/total_kl": 0.03274097526445985 |
| }, |
| { |
| "epoch": 0.8709175738724728, |
| "grad_norm": 2.71875, |
| "learning_rate": 2.3462017434620174e-05, |
| "loss": 0.4494, |
| "mean_token_accuracy": 0.9059775233268738, |
| "step": 700, |
| "train/kl_loss_qwen": 0.027120739314705135, |
| "train/kl_loss_r1": 0.011393017042428255, |
| "train/total_kl": 0.03851375617086887 |
| }, |
| { |
| "epoch": 0.8771384136858476, |
| "grad_norm": 2.25, |
| "learning_rate": 2.3415317559153177e-05, |
| "loss": 0.407, |
| "mean_token_accuracy": 0.9145919442176819, |
| "step": 705, |
| "train/kl_loss_qwen": 0.021546046063303948, |
| "train/kl_loss_r1": 0.012116323586087673, |
| "train/total_kl": 0.03366236938163638 |
| }, |
| { |
| "epoch": 0.8833592534992224, |
| "grad_norm": 2.390625, |
| "learning_rate": 2.336861768368618e-05, |
| "loss": 0.4101, |
| "mean_token_accuracy": 0.9063404113054275, |
| "step": 710, |
| "train/kl_loss_qwen": 0.020995961781591178, |
| "train/kl_loss_r1": 0.008313580113463104, |
| "train/total_kl": 0.029309542011469604 |
| }, |
| { |
| "epoch": 0.8895800933125972, |
| "grad_norm": 3.0, |
| "learning_rate": 2.3321917808219178e-05, |
| "loss": 0.412, |
| "mean_token_accuracy": 0.9092709690332412, |
| "step": 715, |
| "train/kl_loss_qwen": 0.020147784356959166, |
| "train/kl_loss_r1": 0.01101614481303841, |
| "train/total_kl": 0.031163928750902414 |
| }, |
| { |
| "epoch": 0.895800933125972, |
| "grad_norm": 2.765625, |
| "learning_rate": 2.327521793275218e-05, |
| "loss": 0.4405, |
| "mean_token_accuracy": 0.9061545938253402, |
| "step": 720, |
| "train/kl_loss_qwen": 0.024695659801363946, |
| "train/kl_loss_r1": 0.011185528873465956, |
| "train/total_kl": 0.035881188977509734 |
| }, |
| { |
| "epoch": 0.9020217729393468, |
| "grad_norm": 2.15625, |
| "learning_rate": 2.322851805728518e-05, |
| "loss": 0.4035, |
| "mean_token_accuracy": 0.9125464528799057, |
| "step": 725, |
| "train/kl_loss_qwen": 0.02164424294605851, |
| "train/kl_loss_r1": 0.011241717310622335, |
| "train/total_kl": 0.03288596007041633 |
| }, |
| { |
| "epoch": 0.9082426127527217, |
| "grad_norm": 3.015625, |
| "learning_rate": 2.318181818181818e-05, |
| "loss": 0.4681, |
| "mean_token_accuracy": 0.9115902453660965, |
| "step": 730, |
| "train/kl_loss_qwen": 0.031023595342412592, |
| "train/kl_loss_r1": 0.013560534256976097, |
| "train/total_kl": 0.04458412951789796 |
| }, |
| { |
| "epoch": 0.9144634525660964, |
| "grad_norm": 2.46875, |
| "learning_rate": 2.3135118306351184e-05, |
| "loss": 0.5105, |
| "mean_token_accuracy": 0.9097710341215134, |
| "step": 735, |
| "train/kl_loss_qwen": 0.04099215737078339, |
| "train/kl_loss_r1": 0.015071367053315044, |
| "train/total_kl": 0.05606352426111698 |
| }, |
| { |
| "epoch": 0.9206842923794712, |
| "grad_norm": 2.5, |
| "learning_rate": 2.3088418430884183e-05, |
| "loss": 0.4504, |
| "mean_token_accuracy": 0.9054893583059311, |
| "step": 740, |
| "train/kl_loss_qwen": 0.026908464403823017, |
| "train/kl_loss_r1": 0.011770134512335061, |
| "train/total_kl": 0.038678599148988725 |
| }, |
| { |
| "epoch": 0.926905132192846, |
| "grad_norm": 2.234375, |
| "learning_rate": 2.3041718555417185e-05, |
| "loss": 0.41, |
| "mean_token_accuracy": 0.9051820576190949, |
| "step": 745, |
| "train/kl_loss_qwen": 0.018081901129335165, |
| "train/kl_loss_r1": 0.008661592192947865, |
| "train/total_kl": 0.026743493136018516 |
| }, |
| { |
| "epoch": 0.9331259720062208, |
| "grad_norm": 2.359375, |
| "learning_rate": 2.2995018679950184e-05, |
| "loss": 0.4378, |
| "mean_token_accuracy": 0.9121837258338928, |
| "step": 750, |
| "train/kl_loss_qwen": 0.027031197026371957, |
| "train/kl_loss_r1": 0.013320808461867274, |
| "train/total_kl": 0.04035200551152229 |
| }, |
| { |
| "epoch": 0.9393468118195957, |
| "grad_norm": 2.453125, |
| "learning_rate": 2.2948318804483187e-05, |
| "loss": 0.4181, |
| "mean_token_accuracy": 0.9081921458244324, |
| "step": 755, |
| "train/kl_loss_qwen": 0.021465251781046392, |
| "train/kl_loss_r1": 0.011396374832838774, |
| "train/total_kl": 0.032861626520752904 |
| }, |
| { |
| "epoch": 0.9455676516329704, |
| "grad_norm": 2.578125, |
| "learning_rate": 2.2901618929016193e-05, |
| "loss": 0.4726, |
| "mean_token_accuracy": 0.9009045392274857, |
| "step": 760, |
| "train/kl_loss_qwen": 0.02590537634678185, |
| "train/kl_loss_r1": 0.012987637892365456, |
| "train/total_kl": 0.03889301391318441 |
| }, |
| { |
| "epoch": 0.9517884914463453, |
| "grad_norm": 1.890625, |
| "learning_rate": 2.285491905354919e-05, |
| "loss": 0.3837, |
| "mean_token_accuracy": 0.9149051457643509, |
| "step": 765, |
| "train/kl_loss_qwen": 0.020421567978337406, |
| "train/kl_loss_r1": 0.009222430060617626, |
| "train/total_kl": 0.029643998201936483 |
| }, |
| { |
| "epoch": 0.9580093312597201, |
| "grad_norm": 2.234375, |
| "learning_rate": 2.2808219178082194e-05, |
| "loss": 0.4142, |
| "mean_token_accuracy": 0.910207200050354, |
| "step": 770, |
| "train/kl_loss_qwen": 0.02117032711394131, |
| "train/kl_loss_r1": 0.010742365522310138, |
| "train/total_kl": 0.031912692729383706 |
| }, |
| { |
| "epoch": 0.9642301710730948, |
| "grad_norm": 2.78125, |
| "learning_rate": 2.2761519302615196e-05, |
| "loss": 0.4285, |
| "mean_token_accuracy": 0.9055554062128067, |
| "step": 775, |
| "train/kl_loss_qwen": 0.022083445498719812, |
| "train/kl_loss_r1": 0.011104172887280583, |
| "train/total_kl": 0.03318761847913265 |
| }, |
| { |
| "epoch": 0.9704510108864697, |
| "grad_norm": 2.0625, |
| "learning_rate": 2.2714819427148195e-05, |
| "loss": 0.4154, |
| "mean_token_accuracy": 0.9221815407276154, |
| "step": 780, |
| "train/kl_loss_qwen": 0.028531118156388403, |
| "train/kl_loss_r1": 0.01254213583888486, |
| "train/total_kl": 0.041073253750801085 |
| }, |
| { |
| "epoch": 0.9766718506998445, |
| "grad_norm": 2.1875, |
| "learning_rate": 2.2668119551681198e-05, |
| "loss": 0.3951, |
| "mean_token_accuracy": 0.9119761139154434, |
| "step": 785, |
| "train/kl_loss_qwen": 0.020619897544384, |
| "train/kl_loss_r1": 0.009239812684245407, |
| "train/total_kl": 0.02985971048474312 |
| }, |
| { |
| "epoch": 0.9828926905132193, |
| "grad_norm": 57.75, |
| "learning_rate": 2.2621419676214197e-05, |
| "loss": 0.3857, |
| "mean_token_accuracy": 0.9099031835794449, |
| "step": 790, |
| "train/kl_loss_qwen": 0.018582486687228082, |
| "train/kl_loss_r1": 0.00894598305458203, |
| "train/total_kl": 0.027528469683602452 |
| }, |
| { |
| "epoch": 0.9891135303265941, |
| "grad_norm": 2.21875, |
| "learning_rate": 2.25747198007472e-05, |
| "loss": 0.4272, |
| "mean_token_accuracy": 0.9072646647691727, |
| "step": 795, |
| "train/kl_loss_qwen": 0.02253551883623004, |
| "train/kl_loss_r1": 0.010769509780220687, |
| "train/total_kl": 0.033305028639733794 |
| }, |
| { |
| "epoch": 0.995334370139969, |
| "grad_norm": 2.859375, |
| "learning_rate": 2.25280199252802e-05, |
| "loss": 0.5008, |
| "mean_token_accuracy": 0.9021875262260437, |
| "step": 800, |
| "train/kl_loss_qwen": 0.0319652761798352, |
| "train/kl_loss_r1": 0.012161148013547063, |
| "train/total_kl": 0.04412642428651452 |
| }, |
| { |
| "epoch": 1.00248833592535, |
| "grad_norm": 1.609375, |
| "learning_rate": 2.24813200498132e-05, |
| "loss": 0.4557, |
| "mean_token_accuracy": 0.9248083342205394, |
| "step": 805, |
| "train/kl_loss_qwen": 0.021597513886676592, |
| "train/kl_loss_r1": 0.013360376871952956, |
| "train/total_kl": 0.03495789039880037 |
| }, |
| { |
| "epoch": 1.0087091757387248, |
| "grad_norm": 1.4921875, |
| "learning_rate": 2.2434620174346203e-05, |
| "loss": 0.3201, |
| "mean_token_accuracy": 0.9592776656150818, |
| "step": 810, |
| "train/kl_loss_qwen": 0.026713818963617086, |
| "train/kl_loss_r1": 0.014814306050539017, |
| "train/total_kl": 0.041528125293552876 |
| }, |
| { |
| "epoch": 1.0149300155520995, |
| "grad_norm": 1.65625, |
| "learning_rate": 2.2387920298879202e-05, |
| "loss": 0.3216, |
| "mean_token_accuracy": 0.9562903255224228, |
| "step": 815, |
| "train/kl_loss_qwen": 0.0231754750944674, |
| "train/kl_loss_r1": 0.018418258568271995, |
| "train/total_kl": 0.041593733709305525 |
| }, |
| { |
| "epoch": 1.0211508553654742, |
| "grad_norm": 1.3046875, |
| "learning_rate": 2.2341220423412204e-05, |
| "loss": 0.2895, |
| "mean_token_accuracy": 0.9590234607458115, |
| "step": 820, |
| "train/kl_loss_qwen": 0.021737991878762842, |
| "train/kl_loss_r1": 0.013914320012554526, |
| "train/total_kl": 0.035652312077581884 |
| }, |
| { |
| "epoch": 1.0273716951788492, |
| "grad_norm": 1.890625, |
| "learning_rate": 2.2294520547945206e-05, |
| "loss": 0.3005, |
| "mean_token_accuracy": 0.9565304934978485, |
| "step": 825, |
| "train/kl_loss_qwen": 0.02263927822932601, |
| "train/kl_loss_r1": 0.012905962206423283, |
| "train/total_kl": 0.03554524062201381 |
| }, |
| { |
| "epoch": 1.033592534992224, |
| "grad_norm": 1.515625, |
| "learning_rate": 2.2247820672478205e-05, |
| "loss": 0.3013, |
| "mean_token_accuracy": 0.9635909259319305, |
| "step": 830, |
| "train/kl_loss_qwen": 0.024365014489740135, |
| "train/kl_loss_r1": 0.014652392477728426, |
| "train/total_kl": 0.03901740722358227 |
| }, |
| { |
| "epoch": 1.0398133748055987, |
| "grad_norm": 1.6796875, |
| "learning_rate": 2.2201120797011208e-05, |
| "loss": 0.316, |
| "mean_token_accuracy": 0.9590081989765167, |
| "step": 835, |
| "train/kl_loss_qwen": 0.023819171031937002, |
| "train/kl_loss_r1": 0.016059246635995804, |
| "train/total_kl": 0.03987841745838523 |
| }, |
| { |
| "epoch": 1.0460342146189736, |
| "grad_norm": 1.3828125, |
| "learning_rate": 2.2154420921544207e-05, |
| "loss": 0.3033, |
| "mean_token_accuracy": 0.9596952319145202, |
| "step": 840, |
| "train/kl_loss_qwen": 0.02370280809700489, |
| "train/kl_loss_r1": 0.014899721695110201, |
| "train/total_kl": 0.03860252983868122 |
| }, |
| { |
| "epoch": 1.0522550544323483, |
| "grad_norm": 1.234375, |
| "learning_rate": 2.210772104607721e-05, |
| "loss": 0.2822, |
| "mean_token_accuracy": 0.961972963809967, |
| "step": 845, |
| "train/kl_loss_qwen": 0.021481084870174527, |
| "train/kl_loss_r1": 0.01311062837485224, |
| "train/total_kl": 0.03459171336144209 |
| }, |
| { |
| "epoch": 1.058475894245723, |
| "grad_norm": 1.484375, |
| "learning_rate": 2.2061021170610215e-05, |
| "loss": 0.2895, |
| "mean_token_accuracy": 0.959705936908722, |
| "step": 850, |
| "train/kl_loss_qwen": 0.022235888708382844, |
| "train/kl_loss_r1": 0.013539392384700477, |
| "train/total_kl": 0.03577528093010187 |
| }, |
| { |
| "epoch": 1.064696734059098, |
| "grad_norm": 1.890625, |
| "learning_rate": 2.2014321295143214e-05, |
| "loss": 0.2909, |
| "mean_token_accuracy": 0.960792264342308, |
| "step": 855, |
| "train/kl_loss_qwen": 0.020066874427720906, |
| "train/kl_loss_r1": 0.014030058751814067, |
| "train/total_kl": 0.034096932876855134 |
| }, |
| { |
| "epoch": 1.0709175738724728, |
| "grad_norm": 1.6171875, |
| "learning_rate": 2.1967621419676216e-05, |
| "loss": 0.3042, |
| "mean_token_accuracy": 0.9614545047283173, |
| "step": 860, |
| "train/kl_loss_qwen": 0.023757481807842852, |
| "train/kl_loss_r1": 0.015206769714131952, |
| "train/total_kl": 0.03896425180137157 |
| }, |
| { |
| "epoch": 1.0771384136858475, |
| "grad_norm": 1.28125, |
| "learning_rate": 2.192092154420922e-05, |
| "loss": 0.3703, |
| "mean_token_accuracy": 0.955784410238266, |
| "step": 865, |
| "train/kl_loss_qwen": 0.03151101716794073, |
| "train/kl_loss_r1": 0.01914216240402311, |
| "train/total_kl": 0.050653179083019494 |
| }, |
| { |
| "epoch": 1.0833592534992225, |
| "grad_norm": 5.53125, |
| "learning_rate": 2.1874221668742218e-05, |
| "loss": 0.4169, |
| "mean_token_accuracy": 0.9540597677230835, |
| "step": 870, |
| "train/kl_loss_qwen": 0.03798724971711635, |
| "train/kl_loss_r1": 0.021596997044980526, |
| "train/total_kl": 0.05958424676209688 |
| }, |
| { |
| "epoch": 1.0895800933125972, |
| "grad_norm": 2.265625, |
| "learning_rate": 2.182752179327522e-05, |
| "loss": 0.3297, |
| "mean_token_accuracy": 0.9567724496126175, |
| "step": 875, |
| "train/kl_loss_qwen": 0.02518448540940881, |
| "train/kl_loss_r1": 0.015798166557215155, |
| "train/total_kl": 0.04098265203647315 |
| }, |
| { |
| "epoch": 1.095800933125972, |
| "grad_norm": 1.53125, |
| "learning_rate": 2.178082191780822e-05, |
| "loss": 0.2776, |
| "mean_token_accuracy": 0.96037577688694, |
| "step": 880, |
| "train/kl_loss_qwen": 0.019977604039013386, |
| "train/kl_loss_r1": 0.012469864799641073, |
| "train/total_kl": 0.032447469513863327 |
| }, |
| { |
| "epoch": 1.1020217729393469, |
| "grad_norm": 1.6796875, |
| "learning_rate": 2.173412204234122e-05, |
| "loss": 0.3031, |
| "mean_token_accuracy": 0.9599328011274337, |
| "step": 885, |
| "train/kl_loss_qwen": 0.02527875336818397, |
| "train/kl_loss_r1": 0.014116847841069102, |
| "train/total_kl": 0.0393956009298563 |
| }, |
| { |
| "epoch": 1.1082426127527216, |
| "grad_norm": 1.4921875, |
| "learning_rate": 2.1687422166874224e-05, |
| "loss": 0.3096, |
| "mean_token_accuracy": 0.9562761545181274, |
| "step": 890, |
| "train/kl_loss_qwen": 0.02247354043647647, |
| "train/kl_loss_r1": 0.01520557776093483, |
| "train/total_kl": 0.03767911838367581 |
| }, |
| { |
| "epoch": 1.1144634525660964, |
| "grad_norm": 1.5078125, |
| "learning_rate": 2.1640722291407223e-05, |
| "loss": 0.277, |
| "mean_token_accuracy": 0.9599349290132523, |
| "step": 895, |
| "train/kl_loss_qwen": 0.01961457757279277, |
| "train/kl_loss_r1": 0.012993672012817115, |
| "train/total_kl": 0.0326082497369498 |
| }, |
| { |
| "epoch": 1.1206842923794713, |
| "grad_norm": 1.546875, |
| "learning_rate": 2.1594022415940225e-05, |
| "loss": 0.3727, |
| "mean_token_accuracy": 0.9548643559217453, |
| "step": 900, |
| "train/kl_loss_qwen": 0.0343707412481308, |
| "train/kl_loss_r1": 0.017095418740063907, |
| "train/total_kl": 0.051466159708797934 |
| }, |
| { |
| "epoch": 1.126905132192846, |
| "grad_norm": 1.375, |
| "learning_rate": 2.1547322540473224e-05, |
| "loss": 0.3068, |
| "mean_token_accuracy": 0.9591044306755065, |
| "step": 905, |
| "train/kl_loss_qwen": 0.02452373835258186, |
| "train/kl_loss_r1": 0.01449969953391701, |
| "train/total_kl": 0.039023438654839995 |
| }, |
| { |
| "epoch": 1.1331259720062208, |
| "grad_norm": 1.3828125, |
| "learning_rate": 2.1500622665006227e-05, |
| "loss": 0.2977, |
| "mean_token_accuracy": 0.9605327278375626, |
| "step": 910, |
| "train/kl_loss_qwen": 0.023107501212507486, |
| "train/kl_loss_r1": 0.015223974105902016, |
| "train/total_kl": 0.038331475015729664 |
| }, |
| { |
| "epoch": 1.1393468118195957, |
| "grad_norm": 1.4609375, |
| "learning_rate": 2.145392278953923e-05, |
| "loss": 0.3055, |
| "mean_token_accuracy": 0.9603873282670975, |
| "step": 915, |
| "train/kl_loss_qwen": 0.023001648485660553, |
| "train/kl_loss_r1": 0.015112580894492567, |
| "train/total_kl": 0.0381142295897007 |
| }, |
| { |
| "epoch": 1.1455676516329705, |
| "grad_norm": 1.5703125, |
| "learning_rate": 2.1407222914072228e-05, |
| "loss": 0.3037, |
| "mean_token_accuracy": 0.9607974886894226, |
| "step": 920, |
| "train/kl_loss_qwen": 0.023130306228995322, |
| "train/kl_loss_r1": 0.013983825081959366, |
| "train/total_kl": 0.03711413135752082 |
| }, |
| { |
| "epoch": 1.1517884914463452, |
| "grad_norm": 1.203125, |
| "learning_rate": 2.136052303860523e-05, |
| "loss": 0.288, |
| "mean_token_accuracy": 0.9628516793251037, |
| "step": 925, |
| "train/kl_loss_qwen": 0.022921944176778196, |
| "train/kl_loss_r1": 0.01405964158475399, |
| "train/total_kl": 0.036981585528701545 |
| }, |
| { |
| "epoch": 1.15800933125972, |
| "grad_norm": 1.4375, |
| "learning_rate": 2.131382316313823e-05, |
| "loss": 0.3152, |
| "mean_token_accuracy": 0.9601940363645554, |
| "step": 930, |
| "train/kl_loss_qwen": 0.026545584946870805, |
| "train/kl_loss_r1": 0.014174379943870007, |
| "train/total_kl": 0.040719965007156134 |
| }, |
| { |
| "epoch": 1.164230171073095, |
| "grad_norm": 1.2734375, |
| "learning_rate": 2.126712328767123e-05, |
| "loss": 0.2835, |
| "mean_token_accuracy": 0.9574981659650803, |
| "step": 935, |
| "train/kl_loss_qwen": 0.019981388468295336, |
| "train/kl_loss_r1": 0.012800442287698388, |
| "train/total_kl": 0.032781831081956626 |
| }, |
| { |
| "epoch": 1.1704510108864696, |
| "grad_norm": 1.484375, |
| "learning_rate": 2.1220423412204237e-05, |
| "loss": 0.2909, |
| "mean_token_accuracy": 0.958210039138794, |
| "step": 940, |
| "train/kl_loss_qwen": 0.0211213490460068, |
| "train/kl_loss_r1": 0.012211221340112387, |
| "train/total_kl": 0.03333257073536515 |
| }, |
| { |
| "epoch": 1.1766718506998446, |
| "grad_norm": 1.7578125, |
| "learning_rate": 2.1173723536737236e-05, |
| "loss": 0.3088, |
| "mean_token_accuracy": 0.9566162914037705, |
| "step": 945, |
| "train/kl_loss_qwen": 0.023499226197600365, |
| "train/kl_loss_r1": 0.014358895621262491, |
| "train/total_kl": 0.037858121935278176 |
| }, |
| { |
| "epoch": 1.1828926905132193, |
| "grad_norm": 2.890625, |
| "learning_rate": 2.112702366127024e-05, |
| "loss": 0.3129, |
| "mean_token_accuracy": 0.9563288688659668, |
| "step": 950, |
| "train/kl_loss_qwen": 0.023788028536364435, |
| "train/kl_loss_r1": 0.015399044775404037, |
| "train/total_kl": 0.03918707333505154 |
| }, |
| { |
| "epoch": 1.189113530326594, |
| "grad_norm": 1.3515625, |
| "learning_rate": 2.1080323785803238e-05, |
| "loss": 0.2965, |
| "mean_token_accuracy": 0.9597578674554825, |
| "step": 955, |
| "train/kl_loss_qwen": 0.023407862475141882, |
| "train/kl_loss_r1": 0.013951084460131824, |
| "train/total_kl": 0.03735894681885839 |
| }, |
| { |
| "epoch": 1.1953343701399688, |
| "grad_norm": 1.546875, |
| "learning_rate": 2.103362391033624e-05, |
| "loss": 0.3034, |
| "mean_token_accuracy": 0.952317300438881, |
| "step": 960, |
| "train/kl_loss_qwen": 0.02142586586996913, |
| "train/kl_loss_r1": 0.013223635125905275, |
| "train/total_kl": 0.03464950108900666 |
| }, |
| { |
| "epoch": 1.2015552099533438, |
| "grad_norm": 1.7578125, |
| "learning_rate": 2.0986924034869242e-05, |
| "loss": 0.2921, |
| "mean_token_accuracy": 0.9569721490144729, |
| "step": 965, |
| "train/kl_loss_qwen": 0.020508702797815203, |
| "train/kl_loss_r1": 0.013173141260631382, |
| "train/total_kl": 0.033681843988597394 |
| }, |
| { |
| "epoch": 1.2077760497667185, |
| "grad_norm": 1.4921875, |
| "learning_rate": 2.094022415940224e-05, |
| "loss": 0.3207, |
| "mean_token_accuracy": 0.9579594194889068, |
| "step": 970, |
| "train/kl_loss_qwen": 0.026407206989824773, |
| "train/kl_loss_r1": 0.01604833439923823, |
| "train/total_kl": 0.04245554124936461 |
| }, |
| { |
| "epoch": 1.2139968895800932, |
| "grad_norm": 1.40625, |
| "learning_rate": 2.0893524283935244e-05, |
| "loss": 0.2691, |
| "mean_token_accuracy": 0.9618915826082229, |
| "step": 975, |
| "train/kl_loss_qwen": 0.020143463788554073, |
| "train/kl_loss_r1": 0.011573326494544744, |
| "train/total_kl": 0.031716789770871404 |
| }, |
| { |
| "epoch": 1.2202177293934682, |
| "grad_norm": 1.71875, |
| "learning_rate": 2.0846824408468246e-05, |
| "loss": 0.2878, |
| "mean_token_accuracy": 0.9602339863777161, |
| "step": 980, |
| "train/kl_loss_qwen": 0.021193863078951835, |
| "train/kl_loss_r1": 0.014284224039874971, |
| "train/total_kl": 0.03547808742150664 |
| }, |
| { |
| "epoch": 1.226438569206843, |
| "grad_norm": 1.546875, |
| "learning_rate": 2.0800124533001245e-05, |
| "loss": 0.2961, |
| "mean_token_accuracy": 0.9568452388048172, |
| "step": 985, |
| "train/kl_loss_qwen": 0.021635016007348896, |
| "train/kl_loss_r1": 0.012491077953018247, |
| "train/total_kl": 0.034126093704253437 |
| }, |
| { |
| "epoch": 1.2326594090202176, |
| "grad_norm": 1.4609375, |
| "learning_rate": 2.0753424657534248e-05, |
| "loss": 0.2762, |
| "mean_token_accuracy": 0.9612568289041519, |
| "step": 990, |
| "train/kl_loss_qwen": 0.020384321454912424, |
| "train/kl_loss_r1": 0.012731389002874493, |
| "train/total_kl": 0.03311571013182402 |
| }, |
| { |
| "epoch": 1.2388802488335926, |
| "grad_norm": 1.6484375, |
| "learning_rate": 2.0706724782067247e-05, |
| "loss": 0.298, |
| "mean_token_accuracy": 0.9548188507556915, |
| "step": 995, |
| "train/kl_loss_qwen": 0.02017202479764819, |
| "train/kl_loss_r1": 0.013068727403879165, |
| "train/total_kl": 0.0332407521083951 |
| }, |
| { |
| "epoch": 1.2451010886469673, |
| "grad_norm": 1.4140625, |
| "learning_rate": 2.066002490660025e-05, |
| "loss": 0.3913, |
| "mean_token_accuracy": 0.9523698449134826, |
| "step": 1000, |
| "train/kl_loss_qwen": 0.0328057702165097, |
| "train/kl_loss_r1": 0.017370638553984463, |
| "train/total_kl": 0.05017640832811594 |
| }, |
| { |
| "epoch": 1.251321928460342, |
| "grad_norm": 1.421875, |
| "learning_rate": 2.061332503113325e-05, |
| "loss": 0.2838, |
| "mean_token_accuracy": 0.9600636452436447, |
| "step": 1005, |
| "train/kl_loss_qwen": 0.02112743421457708, |
| "train/kl_loss_r1": 0.012237887969240547, |
| "train/total_kl": 0.033365322183817624 |
| }, |
| { |
| "epoch": 1.257542768273717, |
| "grad_norm": 1.453125, |
| "learning_rate": 2.056662515566625e-05, |
| "loss": 0.2888, |
| "mean_token_accuracy": 0.9591195553541183, |
| "step": 1010, |
| "train/kl_loss_qwen": 0.020449397200718523, |
| "train/kl_loss_r1": 0.013287889072671533, |
| "train/total_kl": 0.03373728627339005 |
| }, |
| { |
| "epoch": 1.2637636080870918, |
| "grad_norm": 1.875, |
| "learning_rate": 2.0519925280199253e-05, |
| "loss": 0.334, |
| "mean_token_accuracy": 0.9558851152658463, |
| "step": 1015, |
| "train/kl_loss_qwen": 0.02765529789030552, |
| "train/kl_loss_r1": 0.01525876906234771, |
| "train/total_kl": 0.04291406646370888 |
| }, |
| { |
| "epoch": 1.2699844479004665, |
| "grad_norm": 1.390625, |
| "learning_rate": 2.047322540473225e-05, |
| "loss": 0.2733, |
| "mean_token_accuracy": 0.9612768888473511, |
| "step": 1020, |
| "train/kl_loss_qwen": 0.02055009249597788, |
| "train/kl_loss_r1": 0.01219199935439974, |
| "train/total_kl": 0.03274209164083004 |
| }, |
| { |
| "epoch": 1.2762052877138412, |
| "grad_norm": 1.484375, |
| "learning_rate": 2.0426525529265254e-05, |
| "loss": 0.3006, |
| "mean_token_accuracy": 0.9604948818683624, |
| "step": 1025, |
| "train/kl_loss_qwen": 0.023509953077882527, |
| "train/kl_loss_r1": 0.013066381262615324, |
| "train/total_kl": 0.0365763345733285 |
| }, |
| { |
| "epoch": 1.2824261275272162, |
| "grad_norm": 1.234375, |
| "learning_rate": 2.037982565379826e-05, |
| "loss": 0.3579, |
| "mean_token_accuracy": 0.9586360841989517, |
| "step": 1030, |
| "train/kl_loss_qwen": 0.03005623547360301, |
| "train/kl_loss_r1": 0.018516876851208508, |
| "train/total_kl": 0.048573113046586514 |
| }, |
| { |
| "epoch": 1.288646967340591, |
| "grad_norm": 1.75, |
| "learning_rate": 2.033312577833126e-05, |
| "loss": 0.3284, |
| "mean_token_accuracy": 0.9601274847984314, |
| "step": 1035, |
| "train/kl_loss_qwen": 0.029562953114509582, |
| "train/kl_loss_r1": 0.014028432802297175, |
| "train/total_kl": 0.04359138542786241 |
| }, |
| { |
| "epoch": 1.2948678071539659, |
| "grad_norm": 1.4375, |
| "learning_rate": 2.028642590286426e-05, |
| "loss": 0.3047, |
| "mean_token_accuracy": 0.957324641942978, |
| "step": 1040, |
| "train/kl_loss_qwen": 0.02176124998368323, |
| "train/kl_loss_r1": 0.01420491524040699, |
| "train/total_kl": 0.03596616517752409 |
| }, |
| { |
| "epoch": 1.3010886469673406, |
| "grad_norm": 1.5390625, |
| "learning_rate": 2.023972602739726e-05, |
| "loss": 0.2959, |
| "mean_token_accuracy": 0.9622577458620072, |
| "step": 1045, |
| "train/kl_loss_qwen": 0.023116547102108597, |
| "train/kl_loss_r1": 0.014679647493176162, |
| "train/total_kl": 0.03779619401320815 |
| }, |
| { |
| "epoch": 1.3073094867807153, |
| "grad_norm": 1.3828125, |
| "learning_rate": 2.0193026151930263e-05, |
| "loss": 0.2817, |
| "mean_token_accuracy": 0.9572558134794236, |
| "step": 1050, |
| "train/kl_loss_qwen": 0.02008639704436064, |
| "train/kl_loss_r1": 0.012323370180092752, |
| "train/total_kl": 0.03240976668894291 |
| }, |
| { |
| "epoch": 1.31353032659409, |
| "grad_norm": 1.953125, |
| "learning_rate": 2.0146326276463265e-05, |
| "loss": 0.2899, |
| "mean_token_accuracy": 0.959894523024559, |
| "step": 1055, |
| "train/kl_loss_qwen": 0.022242504497990014, |
| "train/kl_loss_r1": 0.012922527687624096, |
| "train/total_kl": 0.03516503153368831 |
| }, |
| { |
| "epoch": 1.319751166407465, |
| "grad_norm": 1.5390625, |
| "learning_rate": 2.0099626400996264e-05, |
| "loss": 0.275, |
| "mean_token_accuracy": 0.9640595138072967, |
| "step": 1060, |
| "train/kl_loss_qwen": 0.020678923232480884, |
| "train/kl_loss_r1": 0.013264290383085608, |
| "train/total_kl": 0.033943213801831004 |
| }, |
| { |
| "epoch": 1.3259720062208398, |
| "grad_norm": 1.453125, |
| "learning_rate": 2.0052926525529266e-05, |
| "loss": 0.2958, |
| "mean_token_accuracy": 0.9585067182779312, |
| "step": 1065, |
| "train/kl_loss_qwen": 0.020578745240345597, |
| "train/kl_loss_r1": 0.013947037351317703, |
| "train/total_kl": 0.03452578242868185 |
| }, |
| { |
| "epoch": 1.3321928460342147, |
| "grad_norm": 1.46875, |
| "learning_rate": 2.000622665006227e-05, |
| "loss": 0.2985, |
| "mean_token_accuracy": 0.9577532559633255, |
| "step": 1070, |
| "train/kl_loss_qwen": 0.02328689182177186, |
| "train/kl_loss_r1": 0.01395503762178123, |
| "train/total_kl": 0.037241929210722446 |
| }, |
| { |
| "epoch": 1.3384136858475895, |
| "grad_norm": 1.5234375, |
| "learning_rate": 1.9959526774595268e-05, |
| "loss": 0.2788, |
| "mean_token_accuracy": 0.9609476655721665, |
| "step": 1075, |
| "train/kl_loss_qwen": 0.020258180052042007, |
| "train/kl_loss_r1": 0.013444960676133632, |
| "train/total_kl": 0.03370314054191113 |
| }, |
| { |
| "epoch": 1.3446345256609642, |
| "grad_norm": 1.328125, |
| "learning_rate": 1.991282689912827e-05, |
| "loss": 0.2978, |
| "mean_token_accuracy": 0.9590980023145675, |
| "step": 1080, |
| "train/kl_loss_qwen": 0.02293569967150688, |
| "train/kl_loss_r1": 0.014317399612627924, |
| "train/total_kl": 0.037253099400550126 |
| }, |
| { |
| "epoch": 1.350855365474339, |
| "grad_norm": 1.359375, |
| "learning_rate": 1.986612702366127e-05, |
| "loss": 0.269, |
| "mean_token_accuracy": 0.9612076997756958, |
| "step": 1085, |
| "train/kl_loss_qwen": 0.020363600039854646, |
| "train/kl_loss_r1": 0.011795403668656945, |
| "train/total_kl": 0.032159003615379336 |
| }, |
| { |
| "epoch": 1.3570762052877139, |
| "grad_norm": 1.46875, |
| "learning_rate": 1.981942714819427e-05, |
| "loss": 0.3482, |
| "mean_token_accuracy": 0.9550175487995147, |
| "step": 1090, |
| "train/kl_loss_qwen": 0.029534393968060613, |
| "train/kl_loss_r1": 0.01619353631976992, |
| "train/total_kl": 0.04572793049737811 |
| }, |
| { |
| "epoch": 1.3632970451010886, |
| "grad_norm": 1.6171875, |
| "learning_rate": 1.9772727272727274e-05, |
| "loss": 0.2874, |
| "mean_token_accuracy": 0.9602297455072403, |
| "step": 1095, |
| "train/kl_loss_qwen": 0.020855060778558254, |
| "train/kl_loss_r1": 0.01363906858023256, |
| "train/total_kl": 0.03449412910267711 |
| }, |
| { |
| "epoch": 1.3695178849144636, |
| "grad_norm": 1.578125, |
| "learning_rate": 1.9726027397260273e-05, |
| "loss": 0.3941, |
| "mean_token_accuracy": 0.9562926113605499, |
| "step": 1100, |
| "train/kl_loss_qwen": 0.03488424099050462, |
| "train/kl_loss_r1": 0.01934248344041407, |
| "train/total_kl": 0.05422672387212515 |
| }, |
| { |
| "epoch": 1.3757387247278383, |
| "grad_norm": 1.5546875, |
| "learning_rate": 1.9679327521793275e-05, |
| "loss": 0.2959, |
| "mean_token_accuracy": 0.956820473074913, |
| "step": 1105, |
| "train/kl_loss_qwen": 0.021371696330606937, |
| "train/kl_loss_r1": 0.012425292772240937, |
| "train/total_kl": 0.033796988613903525 |
| }, |
| { |
| "epoch": 1.381959564541213, |
| "grad_norm": 1.6484375, |
| "learning_rate": 1.9632627646326274e-05, |
| "loss": 0.3097, |
| "mean_token_accuracy": 0.9579416275024414, |
| "step": 1110, |
| "train/kl_loss_qwen": 0.023708021268248558, |
| "train/kl_loss_r1": 0.015187849942594766, |
| "train/total_kl": 0.03889587111771107 |
| }, |
| { |
| "epoch": 1.3881804043545878, |
| "grad_norm": 1.421875, |
| "learning_rate": 1.9585927770859276e-05, |
| "loss": 0.2784, |
| "mean_token_accuracy": 0.9591321825981141, |
| "step": 1115, |
| "train/kl_loss_qwen": 0.02066819160245359, |
| "train/kl_loss_r1": 0.011791627784259618, |
| "train/total_kl": 0.032459819409996274 |
| }, |
| { |
| "epoch": 1.3944012441679627, |
| "grad_norm": 1.4453125, |
| "learning_rate": 1.9539227895392282e-05, |
| "loss": 0.2905, |
| "mean_token_accuracy": 0.9603239595890045, |
| "step": 1120, |
| "train/kl_loss_qwen": 0.021381384460255504, |
| "train/kl_loss_r1": 0.014689616672694684, |
| "train/total_kl": 0.03607100090011954 |
| }, |
| { |
| "epoch": 1.4006220839813375, |
| "grad_norm": 3.125, |
| "learning_rate": 1.949252801992528e-05, |
| "loss": 0.39, |
| "mean_token_accuracy": 0.9580953747034073, |
| "step": 1125, |
| "train/kl_loss_qwen": 0.03591306242160499, |
| "train/kl_loss_r1": 0.018943295208737256, |
| "train/total_kl": 0.054856357537209986 |
| }, |
| { |
| "epoch": 1.4068429237947122, |
| "grad_norm": 1.5234375, |
| "learning_rate": 1.9445828144458284e-05, |
| "loss": 0.3111, |
| "mean_token_accuracy": 0.9572787255048751, |
| "step": 1130, |
| "train/kl_loss_qwen": 0.023058245377615093, |
| "train/kl_loss_r1": 0.01515980097465217, |
| "train/total_kl": 0.03821804653853178 |
| }, |
| { |
| "epoch": 1.4130637636080872, |
| "grad_norm": 1.375, |
| "learning_rate": 1.9399128268991283e-05, |
| "loss": 0.3609, |
| "mean_token_accuracy": 0.9568741142749786, |
| "step": 1135, |
| "train/kl_loss_qwen": 0.03462322899140417, |
| "train/kl_loss_r1": 0.015330694918520748, |
| "train/total_kl": 0.049953922908753154 |
| }, |
| { |
| "epoch": 1.419284603421462, |
| "grad_norm": 1.5234375, |
| "learning_rate": 1.9352428393524285e-05, |
| "loss": 0.2859, |
| "mean_token_accuracy": 0.9596155285835266, |
| "step": 1140, |
| "train/kl_loss_qwen": 0.019285118207335472, |
| "train/kl_loss_r1": 0.013246331200934946, |
| "train/total_kl": 0.032531449338421226 |
| }, |
| { |
| "epoch": 1.4255054432348366, |
| "grad_norm": 1.6328125, |
| "learning_rate": 1.9305728518057287e-05, |
| "loss": 0.3679, |
| "mean_token_accuracy": 0.9594572901725769, |
| "step": 1145, |
| "train/kl_loss_qwen": 0.03480704687535763, |
| "train/kl_loss_r1": 0.01769161957781762, |
| "train/total_kl": 0.0524986662901938 |
| }, |
| { |
| "epoch": 1.4317262830482116, |
| "grad_norm": 1.6015625, |
| "learning_rate": 1.9259028642590286e-05, |
| "loss": 0.3798, |
| "mean_token_accuracy": 0.9549993693828582, |
| "step": 1150, |
| "train/kl_loss_qwen": 0.033570041367784145, |
| "train/kl_loss_r1": 0.01750114664901048, |
| "train/total_kl": 0.0510711875744164 |
| }, |
| { |
| "epoch": 1.4379471228615863, |
| "grad_norm": 1.4453125, |
| "learning_rate": 1.921232876712329e-05, |
| "loss": 0.2985, |
| "mean_token_accuracy": 0.9594900667667389, |
| "step": 1155, |
| "train/kl_loss_qwen": 0.021839511627331377, |
| "train/kl_loss_r1": 0.014621772128157318, |
| "train/total_kl": 0.036461283918470144 |
| }, |
| { |
| "epoch": 1.444167962674961, |
| "grad_norm": 1.375, |
| "learning_rate": 1.9165628891656288e-05, |
| "loss": 0.291, |
| "mean_token_accuracy": 0.9573999226093293, |
| "step": 1160, |
| "train/kl_loss_qwen": 0.021014203736558556, |
| "train/kl_loss_r1": 0.013348353654146194, |
| "train/total_kl": 0.03436255753040314 |
| }, |
| { |
| "epoch": 1.450388802488336, |
| "grad_norm": 4.03125, |
| "learning_rate": 1.911892901618929e-05, |
| "loss": 0.4053, |
| "mean_token_accuracy": 0.9548583000898361, |
| "step": 1165, |
| "train/kl_loss_qwen": 0.03519875258207321, |
| "train/kl_loss_r1": 0.022582641919143498, |
| "train/total_kl": 0.0577813945710659 |
| }, |
| { |
| "epoch": 1.4566096423017107, |
| "grad_norm": 1.59375, |
| "learning_rate": 1.9072229140722292e-05, |
| "loss": 0.3189, |
| "mean_token_accuracy": 0.9598561078310013, |
| "step": 1170, |
| "train/kl_loss_qwen": 0.02605470730923116, |
| "train/kl_loss_r1": 0.016693935636430977, |
| "train/total_kl": 0.04274864299222827 |
| }, |
| { |
| "epoch": 1.4628304821150855, |
| "grad_norm": 1.3984375, |
| "learning_rate": 1.902552926525529e-05, |
| "loss": 0.2911, |
| "mean_token_accuracy": 0.9594184875488281, |
| "step": 1175, |
| "train/kl_loss_qwen": 0.022187241865321995, |
| "train/kl_loss_r1": 0.013874154957011341, |
| "train/total_kl": 0.036061396915465595 |
| }, |
| { |
| "epoch": 1.4690513219284602, |
| "grad_norm": 2.328125, |
| "learning_rate": 1.8978829389788294e-05, |
| "loss": 0.3264, |
| "mean_token_accuracy": 0.9572916924953461, |
| "step": 1180, |
| "train/kl_loss_qwen": 0.0274376577232033, |
| "train/kl_loss_r1": 0.01724695498123765, |
| "train/total_kl": 0.04468461312353611 |
| }, |
| { |
| "epoch": 1.4752721617418352, |
| "grad_norm": 1.65625, |
| "learning_rate": 1.8932129514321296e-05, |
| "loss": 0.399, |
| "mean_token_accuracy": 0.956961777806282, |
| "step": 1185, |
| "train/kl_loss_qwen": 0.037932181172072886, |
| "train/kl_loss_r1": 0.02000022241845727, |
| "train/total_kl": 0.057932402938604355 |
| }, |
| { |
| "epoch": 1.48149300155521, |
| "grad_norm": 1.28125, |
| "learning_rate": 1.8885429638854295e-05, |
| "loss": 0.2916, |
| "mean_token_accuracy": 0.961290568113327, |
| "step": 1190, |
| "train/kl_loss_qwen": 0.02299168729223311, |
| "train/kl_loss_r1": 0.014748373185284436, |
| "train/total_kl": 0.03774006050080061 |
| }, |
| { |
| "epoch": 1.4877138413685849, |
| "grad_norm": 1.21875, |
| "learning_rate": 1.8838729763387298e-05, |
| "loss": 0.284, |
| "mean_token_accuracy": 0.9619271278381347, |
| "step": 1195, |
| "train/kl_loss_qwen": 0.021989288041368127, |
| "train/kl_loss_r1": 0.013442329177632929, |
| "train/total_kl": 0.03543161693960428 |
| }, |
| { |
| "epoch": 1.4939346811819596, |
| "grad_norm": 1.4140625, |
| "learning_rate": 1.8792029887920297e-05, |
| "loss": 0.2754, |
| "mean_token_accuracy": 0.9628610700368881, |
| "step": 1200, |
| "train/kl_loss_qwen": 0.01976469177752733, |
| "train/kl_loss_r1": 0.013379984023049473, |
| "train/total_kl": 0.03314467594027519 |
| }, |
| { |
| "epoch": 1.5001555209953343, |
| "grad_norm": 1.8671875, |
| "learning_rate": 1.8745330012453302e-05, |
| "loss": 0.3202, |
| "mean_token_accuracy": 0.9567913293838501, |
| "step": 1205, |
| "train/kl_loss_qwen": 0.02559811775572598, |
| "train/kl_loss_r1": 0.01404339938890189, |
| "train/total_kl": 0.03964151693508029 |
| }, |
| { |
| "epoch": 1.506376360808709, |
| "grad_norm": 1.328125, |
| "learning_rate": 1.8698630136986305e-05, |
| "loss": 0.2755, |
| "mean_token_accuracy": 0.9610955238342285, |
| "step": 1210, |
| "train/kl_loss_qwen": 0.020736100152134895, |
| "train/kl_loss_r1": 0.012843929487280548, |
| "train/total_kl": 0.03358002956956625 |
| }, |
| { |
| "epoch": 1.512597200622084, |
| "grad_norm": 1.7109375, |
| "learning_rate": 1.8651930261519304e-05, |
| "loss": 0.3054, |
| "mean_token_accuracy": 0.9547863215208053, |
| "step": 1215, |
| "train/kl_loss_qwen": 0.022321202885359527, |
| "train/kl_loss_r1": 0.015055784210562705, |
| "train/total_kl": 0.03737698718905449 |
| }, |
| { |
| "epoch": 1.5188180404354588, |
| "grad_norm": 1.328125, |
| "learning_rate": 1.8605230386052306e-05, |
| "loss": 0.2832, |
| "mean_token_accuracy": 0.9598489284515381, |
| "step": 1220, |
| "train/kl_loss_qwen": 0.02179465526714921, |
| "train/kl_loss_r1": 0.013072352437302471, |
| "train/total_kl": 0.03486700775101781 |
| }, |
| { |
| "epoch": 1.5250388802488337, |
| "grad_norm": 1.171875, |
| "learning_rate": 1.8558530510585305e-05, |
| "loss": 0.2928, |
| "mean_token_accuracy": 0.9627665460109711, |
| "step": 1225, |
| "train/kl_loss_qwen": 0.022760304110124707, |
| "train/kl_loss_r1": 0.014947098214179277, |
| "train/total_kl": 0.037707402184605596 |
| }, |
| { |
| "epoch": 1.5312597200622085, |
| "grad_norm": 1.1875, |
| "learning_rate": 1.8511830635118307e-05, |
| "loss": 0.2857, |
| "mean_token_accuracy": 0.9622293323278427, |
| "step": 1230, |
| "train/kl_loss_qwen": 0.021702085016295315, |
| "train/kl_loss_r1": 0.014505600836127997, |
| "train/total_kl": 0.03620768608525395 |
| }, |
| { |
| "epoch": 1.5374805598755832, |
| "grad_norm": 1.4375, |
| "learning_rate": 1.846513075965131e-05, |
| "loss": 0.3007, |
| "mean_token_accuracy": 0.9588985919952393, |
| "step": 1235, |
| "train/kl_loss_qwen": 0.023196784174069764, |
| "train/kl_loss_r1": 0.015077767241746188, |
| "train/total_kl": 0.03827455164864659 |
| }, |
| { |
| "epoch": 1.543701399688958, |
| "grad_norm": 1.3671875, |
| "learning_rate": 1.841843088418431e-05, |
| "loss": 0.3002, |
| "mean_token_accuracy": 0.9607412844896317, |
| "step": 1240, |
| "train/kl_loss_qwen": 0.02430763831362128, |
| "train/kl_loss_r1": 0.013863891735672951, |
| "train/total_kl": 0.03817152995616198 |
| }, |
| { |
| "epoch": 1.5499222395023327, |
| "grad_norm": 1.328125, |
| "learning_rate": 1.837173100871731e-05, |
| "loss": 0.2951, |
| "mean_token_accuracy": 0.9558100968599319, |
| "step": 1245, |
| "train/kl_loss_qwen": 0.020561574772000313, |
| "train/kl_loss_r1": 0.014364191447384655, |
| "train/total_kl": 0.03492576666176319 |
| }, |
| { |
| "epoch": 1.5561430793157076, |
| "grad_norm": 1.5703125, |
| "learning_rate": 1.832503113325031e-05, |
| "loss": 0.2871, |
| "mean_token_accuracy": 0.9567299842834472, |
| "step": 1250, |
| "train/kl_loss_qwen": 0.02099115620367229, |
| "train/kl_loss_r1": 0.01232013343833387, |
| "train/total_kl": 0.03331128945574165 |
| }, |
| { |
| "epoch": 1.5623639191290826, |
| "grad_norm": 1.859375, |
| "learning_rate": 1.8278331257783313e-05, |
| "loss": 0.2965, |
| "mean_token_accuracy": 0.9580708712339401, |
| "step": 1255, |
| "train/kl_loss_qwen": 0.019678771495819092, |
| "train/kl_loss_r1": 0.013691711169667543, |
| "train/total_kl": 0.03337048254907131 |
| }, |
| { |
| "epoch": 1.5685847589424573, |
| "grad_norm": 1.625, |
| "learning_rate": 1.8231631382316315e-05, |
| "loss": 0.3153, |
| "mean_token_accuracy": 0.9576340615749359, |
| "step": 1260, |
| "train/kl_loss_qwen": 0.023866409715265036, |
| "train/kl_loss_r1": 0.014706146181561052, |
| "train/total_kl": 0.03857255624607205 |
| }, |
| { |
| "epoch": 1.574805598755832, |
| "grad_norm": 1.4765625, |
| "learning_rate": 1.8184931506849314e-05, |
| "loss": 0.2907, |
| "mean_token_accuracy": 0.9617926776409149, |
| "step": 1265, |
| "train/kl_loss_qwen": 0.021931132208555935, |
| "train/kl_loss_r1": 0.014819200243800878, |
| "train/total_kl": 0.036750332452356815 |
| }, |
| { |
| "epoch": 1.5810264385692068, |
| "grad_norm": 1.28125, |
| "learning_rate": 1.8138231631382316e-05, |
| "loss": 0.2851, |
| "mean_token_accuracy": 0.9603859275579453, |
| "step": 1270, |
| "train/kl_loss_qwen": 0.02175323711708188, |
| "train/kl_loss_r1": 0.01273711076937616, |
| "train/total_kl": 0.034490348072722554 |
| }, |
| { |
| "epoch": 1.5872472783825815, |
| "grad_norm": 1.578125, |
| "learning_rate": 1.809153175591532e-05, |
| "loss": 0.4085, |
| "mean_token_accuracy": 0.9475253760814667, |
| "step": 1275, |
| "train/kl_loss_qwen": 0.03326868480071425, |
| "train/kl_loss_r1": 0.017885031923651696, |
| "train/total_kl": 0.05115371756255627 |
| }, |
| { |
| "epoch": 1.5934681181959565, |
| "grad_norm": 1.5078125, |
| "learning_rate": 1.8044831880448318e-05, |
| "loss": 0.3215, |
| "mean_token_accuracy": 0.9612332046031952, |
| "step": 1280, |
| "train/kl_loss_qwen": 0.027783603593707084, |
| "train/kl_loss_r1": 0.01593417483381927, |
| "train/total_kl": 0.04371777819469571 |
| }, |
| { |
| "epoch": 1.5996889580093314, |
| "grad_norm": 1.921875, |
| "learning_rate": 1.799813200498132e-05, |
| "loss": 0.2871, |
| "mean_token_accuracy": 0.9571006387472153, |
| "step": 1285, |
| "train/kl_loss_qwen": 0.018922175094485284, |
| "train/kl_loss_r1": 0.011591637996025384, |
| "train/total_kl": 0.030513812974095344 |
| }, |
| { |
| "epoch": 1.6059097978227062, |
| "grad_norm": 1.3046875, |
| "learning_rate": 1.795143212951432e-05, |
| "loss": 0.3004, |
| "mean_token_accuracy": 0.9639281570911408, |
| "step": 1290, |
| "train/kl_loss_qwen": 0.025467291148379444, |
| "train/kl_loss_r1": 0.014465117454528808, |
| "train/total_kl": 0.039932408928871156 |
| }, |
| { |
| "epoch": 1.6121306376360809, |
| "grad_norm": 1.4921875, |
| "learning_rate": 1.7904732254047325e-05, |
| "loss": 0.3065, |
| "mean_token_accuracy": 0.957399845123291, |
| "step": 1295, |
| "train/kl_loss_qwen": 0.024825150426477195, |
| "train/kl_loss_r1": 0.013710612105205655, |
| "train/total_kl": 0.03853576248511672 |
| }, |
| { |
| "epoch": 1.6183514774494556, |
| "grad_norm": 1.3125, |
| "learning_rate": 1.7858032378580327e-05, |
| "loss": 0.2833, |
| "mean_token_accuracy": 0.9580383241176605, |
| "step": 1300, |
| "train/kl_loss_qwen": 0.020569146750494836, |
| "train/kl_loss_r1": 0.012861439283005894, |
| "train/total_kl": 0.033430585730820896 |
| }, |
| { |
| "epoch": 1.6245723172628304, |
| "grad_norm": 2.015625, |
| "learning_rate": 1.7811332503113326e-05, |
| "loss": 0.3294, |
| "mean_token_accuracy": 0.9609451532363892, |
| "step": 1305, |
| "train/kl_loss_qwen": 0.02771374033764005, |
| "train/kl_loss_r1": 0.01762062469497323, |
| "train/total_kl": 0.045334365032613275 |
| }, |
| { |
| "epoch": 1.6307931570762053, |
| "grad_norm": 1.3125, |
| "learning_rate": 1.776463262764633e-05, |
| "loss": 0.2977, |
| "mean_token_accuracy": 0.9565259754657746, |
| "step": 1310, |
| "train/kl_loss_qwen": 0.022654768778011203, |
| "train/kl_loss_r1": 0.01242492652963847, |
| "train/total_kl": 0.03507969556376338 |
| }, |
| { |
| "epoch": 1.63701399688958, |
| "grad_norm": 1.75, |
| "learning_rate": 1.7717932752179327e-05, |
| "loss": 0.3123, |
| "mean_token_accuracy": 0.9604735493659973, |
| "step": 1315, |
| "train/kl_loss_qwen": 0.024692377913743256, |
| "train/kl_loss_r1": 0.015999246342107653, |
| "train/total_kl": 0.04069162430241704 |
| }, |
| { |
| "epoch": 1.643234836702955, |
| "grad_norm": 1.6953125, |
| "learning_rate": 1.767123287671233e-05, |
| "loss": 0.3212, |
| "mean_token_accuracy": 0.9578433007001876, |
| "step": 1320, |
| "train/kl_loss_qwen": 0.025619086902588607, |
| "train/kl_loss_r1": 0.015220096544362604, |
| "train/total_kl": 0.04083918360993266 |
| }, |
| { |
| "epoch": 1.6494556765163297, |
| "grad_norm": 1.2734375, |
| "learning_rate": 1.7624533001245332e-05, |
| "loss": 0.2734, |
| "mean_token_accuracy": 0.9615452647209167, |
| "step": 1325, |
| "train/kl_loss_qwen": 0.020037101954221724, |
| "train/kl_loss_r1": 0.01251753638498485, |
| "train/total_kl": 0.032554637920111415 |
| }, |
| { |
| "epoch": 1.6556765163297045, |
| "grad_norm": 1.484375, |
| "learning_rate": 1.757783312577833e-05, |
| "loss": 0.3049, |
| "mean_token_accuracy": 0.9566170126199722, |
| "step": 1330, |
| "train/kl_loss_qwen": 0.022488067951053382, |
| "train/kl_loss_r1": 0.014429900841787458, |
| "train/total_kl": 0.03691796939820051 |
| }, |
| { |
| "epoch": 1.6618973561430792, |
| "grad_norm": 1.28125, |
| "learning_rate": 1.7531133250311334e-05, |
| "loss": 0.2719, |
| "mean_token_accuracy": 0.9647402167320251, |
| "step": 1335, |
| "train/kl_loss_qwen": 0.02126315711066127, |
| "train/kl_loss_r1": 0.013214132492430508, |
| "train/total_kl": 0.03447728957980871 |
| }, |
| { |
| "epoch": 1.6681181959564542, |
| "grad_norm": 1.2265625, |
| "learning_rate": 1.7484433374844333e-05, |
| "loss": 0.2843, |
| "mean_token_accuracy": 0.9628708630800247, |
| "step": 1340, |
| "train/kl_loss_qwen": 0.022394176525995135, |
| "train/kl_loss_r1": 0.012963168020360172, |
| "train/total_kl": 0.035357344802469014 |
| }, |
| { |
| "epoch": 1.674339035769829, |
| "grad_norm": 1.59375, |
| "learning_rate": 1.7437733499377335e-05, |
| "loss": 0.3063, |
| "mean_token_accuracy": 0.95919728577137, |
| "step": 1345, |
| "train/kl_loss_qwen": 0.024591578030958773, |
| "train/kl_loss_r1": 0.014588873228058219, |
| "train/total_kl": 0.03918045153841376 |
| }, |
| { |
| "epoch": 1.6805598755832039, |
| "grad_norm": 1.2890625, |
| "learning_rate": 1.7391033623910337e-05, |
| "loss": 0.2814, |
| "mean_token_accuracy": 0.9604864865541458, |
| "step": 1350, |
| "train/kl_loss_qwen": 0.021181778702884912, |
| "train/kl_loss_r1": 0.012493171030655503, |
| "train/total_kl": 0.03367494996637106 |
| }, |
| { |
| "epoch": 1.6867807153965786, |
| "grad_norm": 1.734375, |
| "learning_rate": 1.7344333748443336e-05, |
| "loss": 0.2888, |
| "mean_token_accuracy": 0.962582352757454, |
| "step": 1355, |
| "train/kl_loss_qwen": 0.022155422298237682, |
| "train/kl_loss_r1": 0.01366903679445386, |
| "train/total_kl": 0.03582445904612541 |
| }, |
| { |
| "epoch": 1.6930015552099533, |
| "grad_norm": 1.640625, |
| "learning_rate": 1.729763387297634e-05, |
| "loss": 0.3055, |
| "mean_token_accuracy": 0.9639359444379807, |
| "step": 1360, |
| "train/kl_loss_qwen": 0.025513780070468783, |
| "train/kl_loss_r1": 0.01692169248126447, |
| "train/total_kl": 0.04243547255173326 |
| }, |
| { |
| "epoch": 1.699222395023328, |
| "grad_norm": 1.6171875, |
| "learning_rate": 1.725093399750934e-05, |
| "loss": 0.2947, |
| "mean_token_accuracy": 0.9534312933683395, |
| "step": 1365, |
| "train/kl_loss_qwen": 0.020309114549309015, |
| "train/kl_loss_r1": 0.01252038376405835, |
| "train/total_kl": 0.03282949859276414 |
| }, |
| { |
| "epoch": 1.7054432348367028, |
| "grad_norm": 1.3671875, |
| "learning_rate": 1.720423412204234e-05, |
| "loss": 0.2779, |
| "mean_token_accuracy": 0.9649826675653458, |
| "step": 1370, |
| "train/kl_loss_qwen": 0.022552193282172082, |
| "train/kl_loss_r1": 0.014152583619579672, |
| "train/total_kl": 0.03670477671548724 |
| }, |
| { |
| "epoch": 1.7116640746500777, |
| "grad_norm": 1.484375, |
| "learning_rate": 1.7157534246575342e-05, |
| "loss": 0.2878, |
| "mean_token_accuracy": 0.9584995239973069, |
| "step": 1375, |
| "train/kl_loss_qwen": 0.022065887739881874, |
| "train/kl_loss_r1": 0.012487068446353078, |
| "train/total_kl": 0.034552955999970436 |
| }, |
| { |
| "epoch": 1.7178849144634527, |
| "grad_norm": 1.1328125, |
| "learning_rate": 1.711083437110834e-05, |
| "loss": 0.2609, |
| "mean_token_accuracy": 0.9647163540124893, |
| "step": 1380, |
| "train/kl_loss_qwen": 0.019539849366992712, |
| "train/kl_loss_r1": 0.011925394786521793, |
| "train/total_kl": 0.03146524429321289 |
| }, |
| { |
| "epoch": 1.7241057542768274, |
| "grad_norm": 1.7109375, |
| "learning_rate": 1.7064134495641347e-05, |
| "loss": 0.3011, |
| "mean_token_accuracy": 0.9581982225179673, |
| "step": 1385, |
| "train/kl_loss_qwen": 0.02257566642947495, |
| "train/kl_loss_r1": 0.013715238706208766, |
| "train/total_kl": 0.03629090515896678 |
| }, |
| { |
| "epoch": 1.7303265940902022, |
| "grad_norm": 1.328125, |
| "learning_rate": 1.701743462017435e-05, |
| "loss": 0.285, |
| "mean_token_accuracy": 0.9621599823236465, |
| "step": 1390, |
| "train/kl_loss_qwen": 0.022289714217185973, |
| "train/kl_loss_r1": 0.01341030071489513, |
| "train/total_kl": 0.035700014885514976 |
| }, |
| { |
| "epoch": 1.736547433903577, |
| "grad_norm": 1.40625, |
| "learning_rate": 1.697073474470735e-05, |
| "loss": 0.2936, |
| "mean_token_accuracy": 0.9583886325359344, |
| "step": 1395, |
| "train/kl_loss_qwen": 0.021757268300279974, |
| "train/kl_loss_r1": 0.013224484142847359, |
| "train/total_kl": 0.03498175237327814 |
| }, |
| { |
| "epoch": 1.7427682737169516, |
| "grad_norm": 1.4765625, |
| "learning_rate": 1.692403486924035e-05, |
| "loss": 0.3241, |
| "mean_token_accuracy": 0.9611039608716965, |
| "step": 1400, |
| "train/kl_loss_qwen": 0.027939339494332673, |
| "train/kl_loss_r1": 0.015984538733027874, |
| "train/total_kl": 0.043923878204077484 |
| }, |
| { |
| "epoch": 1.7489891135303266, |
| "grad_norm": 1.6015625, |
| "learning_rate": 1.687733499377335e-05, |
| "loss": 0.3045, |
| "mean_token_accuracy": 0.9567447185516358, |
| "step": 1405, |
| "train/kl_loss_qwen": 0.02204110100865364, |
| "train/kl_loss_r1": 0.01382591521833092, |
| "train/total_kl": 0.03586701643653214 |
| }, |
| { |
| "epoch": 1.7552099533437016, |
| "grad_norm": 1.84375, |
| "learning_rate": 1.6830635118306352e-05, |
| "loss": 0.2962, |
| "mean_token_accuracy": 0.9537202090024948, |
| "step": 1410, |
| "train/kl_loss_qwen": 0.021085012378171085, |
| "train/kl_loss_r1": 0.01382909684907645, |
| "train/total_kl": 0.03491410920396447 |
| }, |
| { |
| "epoch": 1.7614307931570763, |
| "grad_norm": 1.5078125, |
| "learning_rate": 1.6783935242839355e-05, |
| "loss": 0.2926, |
| "mean_token_accuracy": 0.9642517894506455, |
| "step": 1415, |
| "train/kl_loss_qwen": 0.023424046859145165, |
| "train/kl_loss_r1": 0.014761518430896103, |
| "train/total_kl": 0.03818556563928723 |
| }, |
| { |
| "epoch": 1.767651632970451, |
| "grad_norm": 1.484375, |
| "learning_rate": 1.6737235367372354e-05, |
| "loss": 0.3051, |
| "mean_token_accuracy": 0.9608754545450211, |
| "step": 1420, |
| "train/kl_loss_qwen": 0.024306372087448836, |
| "train/kl_loss_r1": 0.014464322733692825, |
| "train/total_kl": 0.03877069475129247 |
| }, |
| { |
| "epoch": 1.7738724727838258, |
| "grad_norm": 1.734375, |
| "learning_rate": 1.6690535491905356e-05, |
| "loss": 0.2896, |
| "mean_token_accuracy": 0.9598593056201935, |
| "step": 1425, |
| "train/kl_loss_qwen": 0.020282325707376002, |
| "train/kl_loss_r1": 0.012976178899407387, |
| "train/total_kl": 0.03325850497931242 |
| }, |
| { |
| "epoch": 1.7800933125972005, |
| "grad_norm": 1.4921875, |
| "learning_rate": 1.6643835616438355e-05, |
| "loss": 0.4165, |
| "mean_token_accuracy": 0.9545033365488053, |
| "step": 1430, |
| "train/kl_loss_qwen": 0.03436682634055614, |
| "train/kl_loss_r1": 0.0241848505102098, |
| "train/total_kl": 0.05855167773552239 |
| }, |
| { |
| "epoch": 1.7863141524105755, |
| "grad_norm": 1.8828125, |
| "learning_rate": 1.6597135740971357e-05, |
| "loss": 0.2962, |
| "mean_token_accuracy": 0.9586415469646454, |
| "step": 1435, |
| "train/kl_loss_qwen": 0.022492232220247387, |
| "train/kl_loss_r1": 0.013683093525469304, |
| "train/total_kl": 0.036175326071679594 |
| }, |
| { |
| "epoch": 1.7925349922239502, |
| "grad_norm": 1.6953125, |
| "learning_rate": 1.655043586550436e-05, |
| "loss": 0.3056, |
| "mean_token_accuracy": 0.9552174896001816, |
| "step": 1440, |
| "train/kl_loss_qwen": 0.021061650943011045, |
| "train/kl_loss_r1": 0.014696670183911919, |
| "train/total_kl": 0.035758321080356835 |
| }, |
| { |
| "epoch": 1.7987558320373251, |
| "grad_norm": 1.3125, |
| "learning_rate": 1.650373599003736e-05, |
| "loss": 0.3284, |
| "mean_token_accuracy": 0.9582234472036362, |
| "step": 1445, |
| "train/kl_loss_qwen": 0.026695101195946334, |
| "train/kl_loss_r1": 0.015962717402726413, |
| "train/total_kl": 0.042657819017767905 |
| }, |
| { |
| "epoch": 1.8049766718506999, |
| "grad_norm": 1.5234375, |
| "learning_rate": 1.645703611457036e-05, |
| "loss": 0.3002, |
| "mean_token_accuracy": 0.9622107416391372, |
| "step": 1450, |
| "train/kl_loss_qwen": 0.02437539123930037, |
| "train/kl_loss_r1": 0.014243083982728421, |
| "train/total_kl": 0.03861847519874573 |
| }, |
| { |
| "epoch": 1.8111975116640746, |
| "grad_norm": 1.2421875, |
| "learning_rate": 1.641033623910336e-05, |
| "loss": 0.2928, |
| "mean_token_accuracy": 0.9614711910486221, |
| "step": 1455, |
| "train/kl_loss_qwen": 0.02260896023362875, |
| "train/kl_loss_r1": 0.012275043106637896, |
| "train/total_kl": 0.03488400299102068 |
| }, |
| { |
| "epoch": 1.8174183514774493, |
| "grad_norm": 1.40625, |
| "learning_rate": 1.6363636363636363e-05, |
| "loss": 0.2943, |
| "mean_token_accuracy": 0.9561317473649978, |
| "step": 1460, |
| "train/kl_loss_qwen": 0.020934791956096887, |
| "train/kl_loss_r1": 0.013324381457641721, |
| "train/total_kl": 0.034259173553436995 |
| }, |
| { |
| "epoch": 1.8236391912908243, |
| "grad_norm": 1.484375, |
| "learning_rate": 1.6316936488169365e-05, |
| "loss": 0.2998, |
| "mean_token_accuracy": 0.9572570383548736, |
| "step": 1465, |
| "train/kl_loss_qwen": 0.019881926383823155, |
| "train/kl_loss_r1": 0.013012451119720936, |
| "train/total_kl": 0.03289437731727958 |
| }, |
| { |
| "epoch": 1.829860031104199, |
| "grad_norm": 1.28125, |
| "learning_rate": 1.6270236612702364e-05, |
| "loss": 0.2816, |
| "mean_token_accuracy": 0.9600322395563126, |
| "step": 1470, |
| "train/kl_loss_qwen": 0.020596644142642617, |
| "train/kl_loss_r1": 0.01168474464211613, |
| "train/total_kl": 0.032281389273703096 |
| }, |
| { |
| "epoch": 1.836080870917574, |
| "grad_norm": 6.1875, |
| "learning_rate": 1.622353673723537e-05, |
| "loss": 0.4247, |
| "mean_token_accuracy": 0.9523273229598999, |
| "step": 1475, |
| "train/kl_loss_qwen": 0.04184676762670279, |
| "train/kl_loss_r1": 0.02051756768487394, |
| "train/total_kl": 0.06236433489248157 |
| }, |
| { |
| "epoch": 1.8423017107309487, |
| "grad_norm": 1.6015625, |
| "learning_rate": 1.6176836861768372e-05, |
| "loss": 0.277, |
| "mean_token_accuracy": 0.9600133568048477, |
| "step": 1480, |
| "train/kl_loss_qwen": 0.020399686740711333, |
| "train/kl_loss_r1": 0.012775455461815, |
| "train/total_kl": 0.03317514192312956 |
| }, |
| { |
| "epoch": 1.8485225505443235, |
| "grad_norm": 1.3203125, |
| "learning_rate": 1.613013698630137e-05, |
| "loss": 0.2965, |
| "mean_token_accuracy": 0.9654383957386017, |
| "step": 1485, |
| "train/kl_loss_qwen": 0.02537273187190294, |
| "train/kl_loss_r1": 0.015087466267868877, |
| "train/total_kl": 0.040460198651999235 |
| }, |
| { |
| "epoch": 1.8547433903576982, |
| "grad_norm": 1.4296875, |
| "learning_rate": 1.6083437110834373e-05, |
| "loss": 0.2804, |
| "mean_token_accuracy": 0.9586332231760025, |
| "step": 1490, |
| "train/kl_loss_qwen": 0.01983982524834573, |
| "train/kl_loss_r1": 0.011603046138770879, |
| "train/total_kl": 0.031442871689796446 |
| }, |
| { |
| "epoch": 1.860964230171073, |
| "grad_norm": 1.625, |
| "learning_rate": 1.6036737235367372e-05, |
| "loss": 0.2797, |
| "mean_token_accuracy": 0.9595640987157822, |
| "step": 1495, |
| "train/kl_loss_qwen": 0.019799032853916286, |
| "train/kl_loss_r1": 0.012844469002448022, |
| "train/total_kl": 0.03264350155368447 |
| }, |
| { |
| "epoch": 1.8671850699844479, |
| "grad_norm": 1.2734375, |
| "learning_rate": 1.5990037359900375e-05, |
| "loss": 0.3118, |
| "mean_token_accuracy": 0.9638541102409363, |
| "step": 1500, |
| "train/kl_loss_qwen": 0.026107014529407023, |
| "train/kl_loss_r1": 0.016707474808208646, |
| "train/total_kl": 0.04281448973342776 |
| }, |
| { |
| "epoch": 1.8734059097978228, |
| "grad_norm": 1.59375, |
| "learning_rate": 1.5943337484433377e-05, |
| "loss": 0.2922, |
| "mean_token_accuracy": 0.9552089840173721, |
| "step": 1505, |
| "train/kl_loss_qwen": 0.0205880144611001, |
| "train/kl_loss_r1": 0.01196823725476861, |
| "train/total_kl": 0.03255625148303807 |
| }, |
| { |
| "epoch": 1.8796267496111976, |
| "grad_norm": 1.390625, |
| "learning_rate": 1.5896637608966376e-05, |
| "loss": 0.3049, |
| "mean_token_accuracy": 0.9595163345336915, |
| "step": 1510, |
| "train/kl_loss_qwen": 0.024258351232856513, |
| "train/kl_loss_r1": 0.01617993521504104, |
| "train/total_kl": 0.04043828658759594 |
| }, |
| { |
| "epoch": 1.8858475894245723, |
| "grad_norm": 1.5, |
| "learning_rate": 1.584993773349938e-05, |
| "loss": 0.2934, |
| "mean_token_accuracy": 0.9597264170646668, |
| "step": 1515, |
| "train/kl_loss_qwen": 0.023380379332229494, |
| "train/kl_loss_r1": 0.013724281871691345, |
| "train/total_kl": 0.03710466120392084 |
| }, |
| { |
| "epoch": 1.892068429237947, |
| "grad_norm": 1.375, |
| "learning_rate": 1.5803237858032377e-05, |
| "loss": 0.2886, |
| "mean_token_accuracy": 0.9607859402894974, |
| "step": 1520, |
| "train/kl_loss_qwen": 0.021867345878854395, |
| "train/kl_loss_r1": 0.014179157582111657, |
| "train/total_kl": 0.036046503484249114 |
| }, |
| { |
| "epoch": 1.8982892690513218, |
| "grad_norm": 1.6484375, |
| "learning_rate": 1.575653798256538e-05, |
| "loss": 0.2992, |
| "mean_token_accuracy": 0.9605538129806519, |
| "step": 1525, |
| "train/kl_loss_qwen": 0.023080370994284748, |
| "train/kl_loss_r1": 0.01472889562137425, |
| "train/total_kl": 0.03780926624312997 |
| }, |
| { |
| "epoch": 1.9045101088646967, |
| "grad_norm": 1.875, |
| "learning_rate": 1.5709838107098382e-05, |
| "loss": 0.3005, |
| "mean_token_accuracy": 0.9580298513174057, |
| "step": 1530, |
| "train/kl_loss_qwen": 0.02314431550912559, |
| "train/kl_loss_r1": 0.013429639278911054, |
| "train/total_kl": 0.036573955044150355 |
| }, |
| { |
| "epoch": 1.9107309486780717, |
| "grad_norm": 1.390625, |
| "learning_rate": 1.566313823163138e-05, |
| "loss": 0.2749, |
| "mean_token_accuracy": 0.9649899780750275, |
| "step": 1535, |
| "train/kl_loss_qwen": 0.02057855702005327, |
| "train/kl_loss_r1": 0.014282949059270323, |
| "train/total_kl": 0.03486150596290827 |
| }, |
| { |
| "epoch": 1.9169517884914464, |
| "grad_norm": 1.3203125, |
| "learning_rate": 1.5616438356164384e-05, |
| "loss": 0.2972, |
| "mean_token_accuracy": 0.9626806735992431, |
| "step": 1540, |
| "train/kl_loss_qwen": 0.025072267558425666, |
| "train/kl_loss_r1": 0.015387872420251369, |
| "train/total_kl": 0.04046014007180929 |
| }, |
| { |
| "epoch": 1.9231726283048212, |
| "grad_norm": 1.6015625, |
| "learning_rate": 1.5569738480697383e-05, |
| "loss": 0.2917, |
| "mean_token_accuracy": 0.9622645407915116, |
| "step": 1545, |
| "train/kl_loss_qwen": 0.022078696498647334, |
| "train/kl_loss_r1": 0.014551608706824481, |
| "train/total_kl": 0.036630304995924234 |
| }, |
| { |
| "epoch": 1.929393468118196, |
| "grad_norm": 1.625, |
| "learning_rate": 1.5523038605230385e-05, |
| "loss": 0.3041, |
| "mean_token_accuracy": 0.9566681832075119, |
| "step": 1550, |
| "train/kl_loss_qwen": 0.02196988635696471, |
| "train/kl_loss_r1": 0.014778985898010433, |
| "train/total_kl": 0.03674887223169208 |
| }, |
| { |
| "epoch": 1.9356143079315706, |
| "grad_norm": 1.2890625, |
| "learning_rate": 1.5476338729763387e-05, |
| "loss": 0.3967, |
| "mean_token_accuracy": 0.9541066825389862, |
| "step": 1555, |
| "train/kl_loss_qwen": 0.03710188092663884, |
| "train/kl_loss_r1": 0.018790926854126155, |
| "train/total_kl": 0.055892806779593227 |
| }, |
| { |
| "epoch": 1.9418351477449456, |
| "grad_norm": 1.4296875, |
| "learning_rate": 1.5429638854296386e-05, |
| "loss": 0.3105, |
| "mean_token_accuracy": 0.9602783590555191, |
| "step": 1560, |
| "train/kl_loss_qwen": 0.02596303396858275, |
| "train/kl_loss_r1": 0.0147313819732517, |
| "train/total_kl": 0.040694416221231225 |
| }, |
| { |
| "epoch": 1.9480559875583203, |
| "grad_norm": 2.21875, |
| "learning_rate": 1.5382938978829392e-05, |
| "loss": 0.2919, |
| "mean_token_accuracy": 0.95930115878582, |
| "step": 1565, |
| "train/kl_loss_qwen": 0.02266333531588316, |
| "train/kl_loss_r1": 0.013036081078462302, |
| "train/total_kl": 0.03569941623136401 |
| }, |
| { |
| "epoch": 1.9542768273716953, |
| "grad_norm": 1.2421875, |
| "learning_rate": 1.5336239103362394e-05, |
| "loss": 0.3061, |
| "mean_token_accuracy": 0.9625548154115677, |
| "step": 1570, |
| "train/kl_loss_qwen": 0.026318618888035418, |
| "train/kl_loss_r1": 0.015444871853105724, |
| "train/total_kl": 0.04176349071785808 |
| }, |
| { |
| "epoch": 1.96049766718507, |
| "grad_norm": 1.515625, |
| "learning_rate": 1.5289539227895393e-05, |
| "loss": 0.2886, |
| "mean_token_accuracy": 0.9617161154747009, |
| "step": 1575, |
| "train/kl_loss_qwen": 0.02043143748305738, |
| "train/kl_loss_r1": 0.014007525471970438, |
| "train/total_kl": 0.03443896248936653 |
| }, |
| { |
| "epoch": 1.9667185069984447, |
| "grad_norm": 1.4453125, |
| "learning_rate": 1.5242839352428394e-05, |
| "loss": 0.296, |
| "mean_token_accuracy": 0.958229985833168, |
| "step": 1580, |
| "train/kl_loss_qwen": 0.020992166455835105, |
| "train/kl_loss_r1": 0.013891345215961337, |
| "train/total_kl": 0.03488351134583354 |
| }, |
| { |
| "epoch": 1.9729393468118195, |
| "grad_norm": 1.7109375, |
| "learning_rate": 1.5196139476961396e-05, |
| "loss": 0.303, |
| "mean_token_accuracy": 0.955667045712471, |
| "step": 1585, |
| "train/kl_loss_qwen": 0.021437043463811277, |
| "train/kl_loss_r1": 0.013299981201998889, |
| "train/total_kl": 0.03473702482879162 |
| }, |
| { |
| "epoch": 1.9791601866251944, |
| "grad_norm": 3.46875, |
| "learning_rate": 1.5149439601494397e-05, |
| "loss": 0.3863, |
| "mean_token_accuracy": 0.9547875672578812, |
| "step": 1590, |
| "train/kl_loss_qwen": 0.03339828597381711, |
| "train/kl_loss_r1": 0.019195286463946103, |
| "train/total_kl": 0.05259357215836644 |
| }, |
| { |
| "epoch": 1.9853810264385692, |
| "grad_norm": 1.40625, |
| "learning_rate": 1.5102739726027398e-05, |
| "loss": 0.302, |
| "mean_token_accuracy": 0.9607174038887024, |
| "step": 1595, |
| "train/kl_loss_qwen": 0.024118094984441996, |
| "train/kl_loss_r1": 0.015118178050033747, |
| "train/total_kl": 0.039236273430287835 |
| }, |
| { |
| "epoch": 1.9916018662519441, |
| "grad_norm": 1.234375, |
| "learning_rate": 1.5056039850560399e-05, |
| "loss": 0.2702, |
| "mean_token_accuracy": 0.9614597886800766, |
| "step": 1600, |
| "train/kl_loss_qwen": 0.02008180283010006, |
| "train/kl_loss_r1": 0.011453768424689769, |
| "train/total_kl": 0.031535571161657575 |
| }, |
| { |
| "epoch": 1.9978227060653189, |
| "grad_norm": 1.1640625, |
| "learning_rate": 1.5009339975093401e-05, |
| "loss": 0.2883, |
| "mean_token_accuracy": 0.9607007771730423, |
| "step": 1605, |
| "train/kl_loss_qwen": 0.023967621568590402, |
| "train/kl_loss_r1": 0.01288898903876543, |
| "train/total_kl": 0.03685661060735583 |
| }, |
| { |
| "epoch": 2.0049766718507, |
| "grad_norm": 1.3515625, |
| "learning_rate": 1.4962640099626402e-05, |
| "loss": 0.2945, |
| "mean_token_accuracy": 0.9731682376428084, |
| "step": 1610, |
| "train/kl_loss_qwen": 0.021845903649756856, |
| "train/kl_loss_r1": 0.012560325928709724, |
| "train/total_kl": 0.034406229599633 |
| }, |
| { |
| "epoch": 2.011197511664075, |
| "grad_norm": 1.1015625, |
| "learning_rate": 1.4915940224159402e-05, |
| "loss": 0.2426, |
| "mean_token_accuracy": 0.9784580409526825, |
| "step": 1615, |
| "train/kl_loss_qwen": 0.02075221575796604, |
| "train/kl_loss_r1": 0.012880782317370176, |
| "train/total_kl": 0.03363299807533622 |
| }, |
| { |
| "epoch": 2.0174183514774495, |
| "grad_norm": 0.95703125, |
| "learning_rate": 1.4869240348692403e-05, |
| "loss": 0.2472, |
| "mean_token_accuracy": 0.9778133362531662, |
| "step": 1620, |
| "train/kl_loss_qwen": 0.02218270841985941, |
| "train/kl_loss_r1": 0.012616124283522368, |
| "train/total_kl": 0.03479883261024952 |
| }, |
| { |
| "epoch": 2.0236391912908243, |
| "grad_norm": 0.9296875, |
| "learning_rate": 1.4822540473225404e-05, |
| "loss": 0.2411, |
| "mean_token_accuracy": 0.9795323252677918, |
| "step": 1625, |
| "train/kl_loss_qwen": 0.021198717644438148, |
| "train/kl_loss_r1": 0.013453285675495863, |
| "train/total_kl": 0.034652003180235626 |
| }, |
| { |
| "epoch": 2.029860031104199, |
| "grad_norm": 0.9765625, |
| "learning_rate": 1.4775840597758408e-05, |
| "loss": 0.2423, |
| "mean_token_accuracy": 0.9800434708595276, |
| "step": 1630, |
| "train/kl_loss_qwen": 0.02066632085479796, |
| "train/kl_loss_r1": 0.014415074535645545, |
| "train/total_kl": 0.03508139550685883 |
| }, |
| { |
| "epoch": 2.0360808709175737, |
| "grad_norm": 1.1015625, |
| "learning_rate": 1.4729140722291408e-05, |
| "loss": 0.2389, |
| "mean_token_accuracy": 0.9806335180997848, |
| "step": 1635, |
| "train/kl_loss_qwen": 0.02023201258853078, |
| "train/kl_loss_r1": 0.01314310000743717, |
| "train/total_kl": 0.0333751130849123 |
| }, |
| { |
| "epoch": 2.0423017107309485, |
| "grad_norm": 1.0078125, |
| "learning_rate": 1.4682440846824409e-05, |
| "loss": 0.2651, |
| "mean_token_accuracy": 0.9811090856790543, |
| "step": 1640, |
| "train/kl_loss_qwen": 0.024384100595489143, |
| "train/kl_loss_r1": 0.016845971532166003, |
| "train/total_kl": 0.04123007152229548 |
| }, |
| { |
| "epoch": 2.0485225505443236, |
| "grad_norm": 0.828125, |
| "learning_rate": 1.463574097135741e-05, |
| "loss": 0.244, |
| "mean_token_accuracy": 0.9806887865066528, |
| "step": 1645, |
| "train/kl_loss_qwen": 0.02161189350299537, |
| "train/kl_loss_r1": 0.01435529210139066, |
| "train/total_kl": 0.035967185720801355 |
| }, |
| { |
| "epoch": 2.0547433903576984, |
| "grad_norm": 1.1015625, |
| "learning_rate": 1.4589041095890412e-05, |
| "loss": 0.2589, |
| "mean_token_accuracy": 0.9809038013219833, |
| "step": 1650, |
| "train/kl_loss_qwen": 0.023991528805345295, |
| "train/kl_loss_r1": 0.015264363773167134, |
| "train/total_kl": 0.039255892764776944 |
| }, |
| { |
| "epoch": 2.060964230171073, |
| "grad_norm": 0.96484375, |
| "learning_rate": 1.4542341220423413e-05, |
| "loss": 0.2429, |
| "mean_token_accuracy": 0.9789062738418579, |
| "step": 1655, |
| "train/kl_loss_qwen": 0.020654200948774813, |
| "train/kl_loss_r1": 0.013649226189590991, |
| "train/total_kl": 0.03430342748761177 |
| }, |
| { |
| "epoch": 2.067185069984448, |
| "grad_norm": 2.1875, |
| "learning_rate": 1.4495641344956414e-05, |
| "loss": 0.3744, |
| "mean_token_accuracy": 0.9751468390226364, |
| "step": 1660, |
| "train/kl_loss_qwen": 0.03906259112991393, |
| "train/kl_loss_r1": 0.020116307865828277, |
| "train/total_kl": 0.05917889960110188 |
| }, |
| { |
| "epoch": 2.0734059097978226, |
| "grad_norm": 1.1015625, |
| "learning_rate": 1.4448941469489414e-05, |
| "loss": 0.2823, |
| "mean_token_accuracy": 0.977814581990242, |
| "step": 1665, |
| "train/kl_loss_qwen": 0.02684653955511749, |
| "train/kl_loss_r1": 0.016426597093231975, |
| "train/total_kl": 0.04327313648536801 |
| }, |
| { |
| "epoch": 2.0796267496111973, |
| "grad_norm": 0.890625, |
| "learning_rate": 1.4402241594022415e-05, |
| "loss": 0.241, |
| "mean_token_accuracy": 0.978304636478424, |
| "step": 1670, |
| "train/kl_loss_qwen": 0.01918859565630555, |
| "train/kl_loss_r1": 0.012731851963326334, |
| "train/total_kl": 0.03192044720053673 |
| }, |
| { |
| "epoch": 2.0858475894245725, |
| "grad_norm": 1.0703125, |
| "learning_rate": 1.4355541718555419e-05, |
| "loss": 0.2495, |
| "mean_token_accuracy": 0.9780581414699554, |
| "step": 1675, |
| "train/kl_loss_qwen": 0.022329255240038037, |
| "train/kl_loss_r1": 0.013668485963717104, |
| "train/total_kl": 0.035997741110622886 |
| }, |
| { |
| "epoch": 2.0920684292379472, |
| "grad_norm": 2.0, |
| "learning_rate": 1.430884184308842e-05, |
| "loss": 0.3164, |
| "mean_token_accuracy": 0.973807492852211, |
| "step": 1680, |
| "train/kl_loss_qwen": 0.0302242751698941, |
| "train/kl_loss_r1": 0.01509574861265719, |
| "train/total_kl": 0.045320024248212576 |
| }, |
| { |
| "epoch": 2.098289269051322, |
| "grad_norm": 0.99609375, |
| "learning_rate": 1.426214196762142e-05, |
| "loss": 0.2657, |
| "mean_token_accuracy": 0.9796731650829316, |
| "step": 1685, |
| "train/kl_loss_qwen": 0.024477861635386945, |
| "train/kl_loss_r1": 0.016039001010358333, |
| "train/total_kl": 0.04051686236634851 |
| }, |
| { |
| "epoch": 2.1045101088646967, |
| "grad_norm": 0.96484375, |
| "learning_rate": 1.4215442092154421e-05, |
| "loss": 0.2612, |
| "mean_token_accuracy": 0.9790675967931748, |
| "step": 1690, |
| "train/kl_loss_qwen": 0.02389554716646671, |
| "train/kl_loss_r1": 0.01507699298672378, |
| "train/total_kl": 0.03897254019975662 |
| }, |
| { |
| "epoch": 2.1107309486780714, |
| "grad_norm": 1.0546875, |
| "learning_rate": 1.4168742216687423e-05, |
| "loss": 0.3605, |
| "mean_token_accuracy": 0.9704611152410507, |
| "step": 1695, |
| "train/kl_loss_qwen": 0.03224745257757604, |
| "train/kl_loss_r1": 0.017923418898135424, |
| "train/total_kl": 0.05017087059095502 |
| }, |
| { |
| "epoch": 2.116951788491446, |
| "grad_norm": 0.92578125, |
| "learning_rate": 1.4122042341220424e-05, |
| "loss": 0.2689, |
| "mean_token_accuracy": 0.9798552840948105, |
| "step": 1700, |
| "train/kl_loss_qwen": 0.023866656003519893, |
| "train/kl_loss_r1": 0.01644910844042897, |
| "train/total_kl": 0.040315764397382735 |
| }, |
| { |
| "epoch": 2.1231726283048213, |
| "grad_norm": 1.0546875, |
| "learning_rate": 1.4075342465753425e-05, |
| "loss": 0.2528, |
| "mean_token_accuracy": 0.9789301216602325, |
| "step": 1705, |
| "train/kl_loss_qwen": 0.022611541347578167, |
| "train/kl_loss_r1": 0.014065819093957543, |
| "train/total_kl": 0.0366773602552712 |
| }, |
| { |
| "epoch": 2.129393468118196, |
| "grad_norm": 0.921875, |
| "learning_rate": 1.4028642590286425e-05, |
| "loss": 0.2394, |
| "mean_token_accuracy": 0.9789743661880493, |
| "step": 1710, |
| "train/kl_loss_qwen": 0.020024046860635282, |
| "train/kl_loss_r1": 0.012307545309886337, |
| "train/total_kl": 0.03233159258961678 |
| }, |
| { |
| "epoch": 2.135614307931571, |
| "grad_norm": 1.0390625, |
| "learning_rate": 1.3981942714819426e-05, |
| "loss": 0.2393, |
| "mean_token_accuracy": 0.9808943539857864, |
| "step": 1715, |
| "train/kl_loss_qwen": 0.022391148284077643, |
| "train/kl_loss_r1": 0.013058097870089113, |
| "train/total_kl": 0.03544924585148692 |
| }, |
| { |
| "epoch": 2.1418351477449455, |
| "grad_norm": 1.734375, |
| "learning_rate": 1.393524283935243e-05, |
| "loss": 0.2753, |
| "mean_token_accuracy": 0.9771335572004318, |
| "step": 1720, |
| "train/kl_loss_qwen": 0.024992619268596174, |
| "train/kl_loss_r1": 0.01562864559236914, |
| "train/total_kl": 0.04062126437202096 |
| }, |
| { |
| "epoch": 2.1480559875583203, |
| "grad_norm": 1.34375, |
| "learning_rate": 1.388854296388543e-05, |
| "loss": 0.242, |
| "mean_token_accuracy": 0.9794571280479432, |
| "step": 1725, |
| "train/kl_loss_qwen": 0.02109189019538462, |
| "train/kl_loss_r1": 0.013026425126008689, |
| "train/total_kl": 0.03411831529811025 |
| }, |
| { |
| "epoch": 2.154276827371695, |
| "grad_norm": 1.1171875, |
| "learning_rate": 1.3841843088418432e-05, |
| "loss": 0.2591, |
| "mean_token_accuracy": 0.9810844957828522, |
| "step": 1730, |
| "train/kl_loss_qwen": 0.024620172381401063, |
| "train/kl_loss_r1": 0.01482275347225368, |
| "train/total_kl": 0.039442925900220874 |
| }, |
| { |
| "epoch": 2.16049766718507, |
| "grad_norm": 1.1640625, |
| "learning_rate": 1.3795143212951432e-05, |
| "loss": 0.2633, |
| "mean_token_accuracy": 0.9778509587049484, |
| "step": 1735, |
| "train/kl_loss_qwen": 0.024361231364309788, |
| "train/kl_loss_r1": 0.01404720451682806, |
| "train/total_kl": 0.03840843569487333 |
| }, |
| { |
| "epoch": 2.166718506998445, |
| "grad_norm": 0.97265625, |
| "learning_rate": 1.3748443337484433e-05, |
| "loss": 0.2285, |
| "mean_token_accuracy": 0.9812567800283432, |
| "step": 1740, |
| "train/kl_loss_qwen": 0.02088723029009998, |
| "train/kl_loss_r1": 0.011959241493605078, |
| "train/total_kl": 0.032846471574157474 |
| }, |
| { |
| "epoch": 2.1729393468118197, |
| "grad_norm": 0.9765625, |
| "learning_rate": 1.3701743462017435e-05, |
| "loss": 0.2489, |
| "mean_token_accuracy": 0.9805923402309418, |
| "step": 1745, |
| "train/kl_loss_qwen": 0.022857177117839456, |
| "train/kl_loss_r1": 0.014695218997076154, |
| "train/total_kl": 0.037552396580576894 |
| }, |
| { |
| "epoch": 2.1791601866251944, |
| "grad_norm": 1.078125, |
| "learning_rate": 1.3655043586550436e-05, |
| "loss": 0.2526, |
| "mean_token_accuracy": 0.9761855214834213, |
| "step": 1750, |
| "train/kl_loss_qwen": 0.021363981626927854, |
| "train/kl_loss_r1": 0.012706464645452798, |
| "train/total_kl": 0.034070446714758874 |
| }, |
| { |
| "epoch": 2.185381026438569, |
| "grad_norm": 1.4140625, |
| "learning_rate": 1.3608343711083437e-05, |
| "loss": 0.2522, |
| "mean_token_accuracy": 0.9779788672924041, |
| "step": 1755, |
| "train/kl_loss_qwen": 0.021653601573780178, |
| "train/kl_loss_r1": 0.013945041154511274, |
| "train/total_kl": 0.03559864275157452 |
| }, |
| { |
| "epoch": 2.191601866251944, |
| "grad_norm": 0.93359375, |
| "learning_rate": 1.3561643835616437e-05, |
| "loss": 0.3356, |
| "mean_token_accuracy": 0.9763142317533493, |
| "step": 1760, |
| "train/kl_loss_qwen": 0.034495850279927256, |
| "train/kl_loss_r1": 0.01701771658845246, |
| "train/total_kl": 0.0515135663561523 |
| }, |
| { |
| "epoch": 2.1978227060653186, |
| "grad_norm": 1.234375, |
| "learning_rate": 1.3514943960149441e-05, |
| "loss": 0.2481, |
| "mean_token_accuracy": 0.9769844710826874, |
| "step": 1765, |
| "train/kl_loss_qwen": 0.022623211657628418, |
| "train/kl_loss_r1": 0.012992961728014053, |
| "train/total_kl": 0.035616173036396505 |
| }, |
| { |
| "epoch": 2.2040435458786938, |
| "grad_norm": 1.3203125, |
| "learning_rate": 1.3468244084682442e-05, |
| "loss": 0.2441, |
| "mean_token_accuracy": 0.9772080987691879, |
| "step": 1770, |
| "train/kl_loss_qwen": 0.02268908736295998, |
| "train/kl_loss_r1": 0.012291538529098034, |
| "train/total_kl": 0.034980626031756404 |
| }, |
| { |
| "epoch": 2.2102643856920685, |
| "grad_norm": 1.0859375, |
| "learning_rate": 1.3421544209215443e-05, |
| "loss": 0.2388, |
| "mean_token_accuracy": 0.9795448333024979, |
| "step": 1775, |
| "train/kl_loss_qwen": 0.019983268249779938, |
| "train/kl_loss_r1": 0.013864303706213832, |
| "train/total_kl": 0.033847571816295385 |
| }, |
| { |
| "epoch": 2.2164852255054432, |
| "grad_norm": 1.0625, |
| "learning_rate": 1.3374844333748443e-05, |
| "loss": 0.2366, |
| "mean_token_accuracy": 0.9784791618585587, |
| "step": 1780, |
| "train/kl_loss_qwen": 0.02112103491090238, |
| "train/kl_loss_r1": 0.012184371682815253, |
| "train/total_kl": 0.03330540684983134 |
| }, |
| { |
| "epoch": 2.222706065318818, |
| "grad_norm": 1.1484375, |
| "learning_rate": 1.3328144458281444e-05, |
| "loss": 0.2326, |
| "mean_token_accuracy": 0.978312885761261, |
| "step": 1785, |
| "train/kl_loss_qwen": 0.019464704208076, |
| "train/kl_loss_r1": 0.011881216848269104, |
| "train/total_kl": 0.031345921102911234 |
| }, |
| { |
| "epoch": 2.2289269051321927, |
| "grad_norm": 0.96875, |
| "learning_rate": 1.3281444582814446e-05, |
| "loss": 0.2322, |
| "mean_token_accuracy": 0.9802702635526657, |
| "step": 1790, |
| "train/kl_loss_qwen": 0.019677631743252277, |
| "train/kl_loss_r1": 0.0136221659835428, |
| "train/total_kl": 0.03329979768022895 |
| }, |
| { |
| "epoch": 2.2351477449455674, |
| "grad_norm": 1.203125, |
| "learning_rate": 1.3234744707347447e-05, |
| "loss": 0.2517, |
| "mean_token_accuracy": 0.9778961509466171, |
| "step": 1795, |
| "train/kl_loss_qwen": 0.023012708965688945, |
| "train/kl_loss_r1": 0.013481559325009584, |
| "train/total_kl": 0.03649426787160337 |
| }, |
| { |
| "epoch": 2.2413685847589426, |
| "grad_norm": 0.8125, |
| "learning_rate": 1.3188044831880448e-05, |
| "loss": 0.2359, |
| "mean_token_accuracy": 0.9810913383960724, |
| "step": 1800, |
| "train/kl_loss_qwen": 0.021271700272336602, |
| "train/kl_loss_r1": 0.013056211965158581, |
| "train/total_kl": 0.034327912330627444 |
| }, |
| { |
| "epoch": 2.2475894245723174, |
| "grad_norm": 0.99609375, |
| "learning_rate": 1.3141344956413449e-05, |
| "loss": 0.2346, |
| "mean_token_accuracy": 0.9790261298418045, |
| "step": 1805, |
| "train/kl_loss_qwen": 0.020045140152797104, |
| "train/kl_loss_r1": 0.01360967019572854, |
| "train/total_kl": 0.033654810208827254 |
| }, |
| { |
| "epoch": 2.253810264385692, |
| "grad_norm": 1.046875, |
| "learning_rate": 1.3094645080946453e-05, |
| "loss": 0.2477, |
| "mean_token_accuracy": 0.9797742009162903, |
| "step": 1810, |
| "train/kl_loss_qwen": 0.02143171979114413, |
| "train/kl_loss_r1": 0.013752156216651202, |
| "train/total_kl": 0.035183876287192106 |
| }, |
| { |
| "epoch": 2.260031104199067, |
| "grad_norm": 0.9921875, |
| "learning_rate": 1.3047945205479453e-05, |
| "loss": 0.2532, |
| "mean_token_accuracy": 0.9792828232049942, |
| "step": 1815, |
| "train/kl_loss_qwen": 0.021182486787438393, |
| "train/kl_loss_r1": 0.01435540292877704, |
| "train/total_kl": 0.035537889786064626 |
| }, |
| { |
| "epoch": 2.2662519440124416, |
| "grad_norm": 1.5, |
| "learning_rate": 1.3001245330012454e-05, |
| "loss": 0.4353, |
| "mean_token_accuracy": 0.9699081629514694, |
| "step": 1820, |
| "train/kl_loss_qwen": 0.04558118330314755, |
| "train/kl_loss_r1": 0.023637999431230128, |
| "train/total_kl": 0.06921918261796237 |
| }, |
| { |
| "epoch": 2.2724727838258163, |
| "grad_norm": 1.078125, |
| "learning_rate": 1.2954545454545455e-05, |
| "loss": 0.2321, |
| "mean_token_accuracy": 0.9784551143646241, |
| "step": 1825, |
| "train/kl_loss_qwen": 0.01986483633518219, |
| "train/kl_loss_r1": 0.012468844978138804, |
| "train/total_kl": 0.032333681266754864 |
| }, |
| { |
| "epoch": 2.2786936236391915, |
| "grad_norm": 1.1640625, |
| "learning_rate": 1.2907845579078455e-05, |
| "loss": 0.2454, |
| "mean_token_accuracy": 0.97675521671772, |
| "step": 1830, |
| "train/kl_loss_qwen": 0.02059942428022623, |
| "train/kl_loss_r1": 0.01287925757933408, |
| "train/total_kl": 0.03347868211567402 |
| }, |
| { |
| "epoch": 2.284914463452566, |
| "grad_norm": 0.97265625, |
| "learning_rate": 1.2861145703611458e-05, |
| "loss": 0.2431, |
| "mean_token_accuracy": 0.9791501730680465, |
| "step": 1835, |
| "train/kl_loss_qwen": 0.021640143543481826, |
| "train/kl_loss_r1": 0.013920898968353867, |
| "train/total_kl": 0.035561042837798595 |
| }, |
| { |
| "epoch": 2.291135303265941, |
| "grad_norm": 3.15625, |
| "learning_rate": 1.2814445828144458e-05, |
| "loss": 0.271, |
| "mean_token_accuracy": 0.979482638835907, |
| "step": 1840, |
| "train/kl_loss_qwen": 0.02593438569456339, |
| "train/kl_loss_r1": 0.015126829454675316, |
| "train/total_kl": 0.04106121482327581 |
| }, |
| { |
| "epoch": 2.2973561430793157, |
| "grad_norm": 1.1484375, |
| "learning_rate": 1.2767745952677459e-05, |
| "loss": 0.2398, |
| "mean_token_accuracy": 0.9809309899806976, |
| "step": 1845, |
| "train/kl_loss_qwen": 0.022775299800559878, |
| "train/kl_loss_r1": 0.01402155626565218, |
| "train/total_kl": 0.036796855833381416 |
| }, |
| { |
| "epoch": 2.3035769828926904, |
| "grad_norm": 0.95703125, |
| "learning_rate": 1.272104607721046e-05, |
| "loss": 0.2934, |
| "mean_token_accuracy": 0.9758806467056275, |
| "step": 1850, |
| "train/kl_loss_qwen": 0.02778648091480136, |
| "train/kl_loss_r1": 0.01586297785397619, |
| "train/total_kl": 0.043649458419531585 |
| }, |
| { |
| "epoch": 2.309797822706065, |
| "grad_norm": 0.828125, |
| "learning_rate": 1.2674346201743464e-05, |
| "loss": 0.2401, |
| "mean_token_accuracy": 0.9825777590274811, |
| "step": 1855, |
| "train/kl_loss_qwen": 0.021009960398077964, |
| "train/kl_loss_r1": 0.01420710023958236, |
| "train/total_kl": 0.03521706024184823 |
| }, |
| { |
| "epoch": 2.31601866251944, |
| "grad_norm": 1.2734375, |
| "learning_rate": 1.2627646326276464e-05, |
| "loss": 0.2827, |
| "mean_token_accuracy": 0.9746395200490952, |
| "step": 1860, |
| "train/kl_loss_qwen": 0.024723251862451435, |
| "train/kl_loss_r1": 0.015186823182739317, |
| "train/total_kl": 0.03991007544100285 |
| }, |
| { |
| "epoch": 2.322239502332815, |
| "grad_norm": 1.0625, |
| "learning_rate": 1.2580946450809465e-05, |
| "loss": 0.2482, |
| "mean_token_accuracy": 0.9802426367998123, |
| "step": 1865, |
| "train/kl_loss_qwen": 0.0225432176142931, |
| "train/kl_loss_r1": 0.013892730651423334, |
| "train/total_kl": 0.036435948219150305 |
| }, |
| { |
| "epoch": 2.32846034214619, |
| "grad_norm": 1.2734375, |
| "learning_rate": 1.2534246575342466e-05, |
| "loss": 0.2551, |
| "mean_token_accuracy": 0.9752663284540176, |
| "step": 1870, |
| "train/kl_loss_qwen": 0.02081627896986902, |
| "train/kl_loss_r1": 0.013366595236584544, |
| "train/total_kl": 0.034182874485850334 |
| }, |
| { |
| "epoch": 2.3346811819595645, |
| "grad_norm": 1.109375, |
| "learning_rate": 1.2487546699875467e-05, |
| "loss": 0.2517, |
| "mean_token_accuracy": 0.9780875205993652, |
| "step": 1875, |
| "train/kl_loss_qwen": 0.02112504974938929, |
| "train/kl_loss_r1": 0.015057702036574482, |
| "train/total_kl": 0.036182751413434744 |
| }, |
| { |
| "epoch": 2.3409020217729393, |
| "grad_norm": 1.234375, |
| "learning_rate": 1.2440846824408469e-05, |
| "loss": 0.2783, |
| "mean_token_accuracy": 0.9777207732200622, |
| "step": 1880, |
| "train/kl_loss_qwen": 0.026220168406143784, |
| "train/kl_loss_r1": 0.0165558461798355, |
| "train/total_kl": 0.042776014655828476 |
| }, |
| { |
| "epoch": 2.347122861586314, |
| "grad_norm": 1.046875, |
| "learning_rate": 1.239414694894147e-05, |
| "loss": 0.2401, |
| "mean_token_accuracy": 0.9795249253511429, |
| "step": 1885, |
| "train/kl_loss_qwen": 0.022062430484220387, |
| "train/kl_loss_r1": 0.01306857680901885, |
| "train/total_kl": 0.03513100752606988 |
| }, |
| { |
| "epoch": 2.353343701399689, |
| "grad_norm": 0.90625, |
| "learning_rate": 1.234744707347447e-05, |
| "loss": 0.2305, |
| "mean_token_accuracy": 0.9795470297336578, |
| "step": 1890, |
| "train/kl_loss_qwen": 0.019669259851798414, |
| "train/kl_loss_r1": 0.013222256046719848, |
| "train/total_kl": 0.032891515735536815 |
| }, |
| { |
| "epoch": 2.359564541213064, |
| "grad_norm": 0.8125, |
| "learning_rate": 1.2300747198007471e-05, |
| "loss": 0.2622, |
| "mean_token_accuracy": 0.9815815418958664, |
| "step": 1895, |
| "train/kl_loss_qwen": 0.02579428404569626, |
| "train/kl_loss_r1": 0.01565156860742718, |
| "train/total_kl": 0.04144585244357586 |
| }, |
| { |
| "epoch": 2.3657853810264386, |
| "grad_norm": 1.2890625, |
| "learning_rate": 1.2254047322540475e-05, |
| "loss": 0.2564, |
| "mean_token_accuracy": 0.9784956514835358, |
| "step": 1900, |
| "train/kl_loss_qwen": 0.022114967973902822, |
| "train/kl_loss_r1": 0.013662851555272937, |
| "train/total_kl": 0.03577781962230801 |
| }, |
| { |
| "epoch": 2.3720062208398134, |
| "grad_norm": 1.390625, |
| "learning_rate": 1.2207347447073476e-05, |
| "loss": 0.3352, |
| "mean_token_accuracy": 0.9750847607851029, |
| "step": 1905, |
| "train/kl_loss_qwen": 0.03689875598065555, |
| "train/kl_loss_r1": 0.016696492512710392, |
| "train/total_kl": 0.05359524823725224 |
| }, |
| { |
| "epoch": 2.378227060653188, |
| "grad_norm": 1.0703125, |
| "learning_rate": 1.2160647571606476e-05, |
| "loss": 0.2371, |
| "mean_token_accuracy": 0.9770203292369842, |
| "step": 1910, |
| "train/kl_loss_qwen": 0.019168762071058155, |
| "train/kl_loss_r1": 0.012693860824219883, |
| "train/total_kl": 0.03186262277886272 |
| }, |
| { |
| "epoch": 2.384447900466563, |
| "grad_norm": 0.94921875, |
| "learning_rate": 1.2113947696139477e-05, |
| "loss": 0.2373, |
| "mean_token_accuracy": 0.9789462387561798, |
| "step": 1915, |
| "train/kl_loss_qwen": 0.021564632654190063, |
| "train/kl_loss_r1": 0.012719874107278883, |
| "train/total_kl": 0.03428450655192137 |
| }, |
| { |
| "epoch": 2.3906687402799376, |
| "grad_norm": 1.4140625, |
| "learning_rate": 1.2067247820672478e-05, |
| "loss": 0.2346, |
| "mean_token_accuracy": 0.9807638555765152, |
| "step": 1920, |
| "train/kl_loss_qwen": 0.01933746659196913, |
| "train/kl_loss_r1": 0.013734246650710703, |
| "train/total_kl": 0.03307171277701855 |
| }, |
| { |
| "epoch": 2.3968895800933128, |
| "grad_norm": 1.3515625, |
| "learning_rate": 1.202054794520548e-05, |
| "loss": 0.2588, |
| "mean_token_accuracy": 0.9800190776586533, |
| "step": 1925, |
| "train/kl_loss_qwen": 0.02418329380452633, |
| "train/kl_loss_r1": 0.015474402927793562, |
| "train/total_kl": 0.03965769670903683 |
| }, |
| { |
| "epoch": 2.4031104199066875, |
| "grad_norm": 1.1171875, |
| "learning_rate": 1.197384806973848e-05, |
| "loss": 0.2492, |
| "mean_token_accuracy": 0.9790872097015381, |
| "step": 1930, |
| "train/kl_loss_qwen": 0.022408964531496166, |
| "train/kl_loss_r1": 0.013171161222271622, |
| "train/total_kl": 0.035580125823616984 |
| }, |
| { |
| "epoch": 2.4093312597200622, |
| "grad_norm": 1.0546875, |
| "learning_rate": 1.1927148194271482e-05, |
| "loss": 0.2521, |
| "mean_token_accuracy": 0.9767476886510849, |
| "step": 1935, |
| "train/kl_loss_qwen": 0.02167391194961965, |
| "train/kl_loss_r1": 0.014151084562763571, |
| "train/total_kl": 0.035824996419250965 |
| }, |
| { |
| "epoch": 2.415552099533437, |
| "grad_norm": 1.296875, |
| "learning_rate": 1.1880448318804482e-05, |
| "loss": 0.2498, |
| "mean_token_accuracy": 0.978100472688675, |
| "step": 1940, |
| "train/kl_loss_qwen": 0.02200420745648444, |
| "train/kl_loss_r1": 0.014483575685881078, |
| "train/total_kl": 0.03648778265342116 |
| }, |
| { |
| "epoch": 2.4217729393468117, |
| "grad_norm": 1.1875, |
| "learning_rate": 1.1833748443337485e-05, |
| "loss": 0.2496, |
| "mean_token_accuracy": 0.9778286337852478, |
| "step": 1945, |
| "train/kl_loss_qwen": 0.022651279880665242, |
| "train/kl_loss_r1": 0.013287181942723691, |
| "train/total_kl": 0.03593846196308732 |
| }, |
| { |
| "epoch": 2.4279937791601864, |
| "grad_norm": 1.7109375, |
| "learning_rate": 1.1787048567870487e-05, |
| "loss": 0.2598, |
| "mean_token_accuracy": 0.977265328168869, |
| "step": 1950, |
| "train/kl_loss_qwen": 0.02262912839651108, |
| "train/kl_loss_r1": 0.014686035527847707, |
| "train/total_kl": 0.03731516385450959 |
| }, |
| { |
| "epoch": 2.4342146189735616, |
| "grad_norm": 2.234375, |
| "learning_rate": 1.1740348692403488e-05, |
| "loss": 0.3154, |
| "mean_token_accuracy": 0.974388661980629, |
| "step": 1955, |
| "train/kl_loss_qwen": 0.031231827940791844, |
| "train/kl_loss_r1": 0.01720571951009333, |
| "train/total_kl": 0.04843754768371582 |
| }, |
| { |
| "epoch": 2.4404354587869364, |
| "grad_norm": 0.8203125, |
| "learning_rate": 1.1693648816936488e-05, |
| "loss": 0.2214, |
| "mean_token_accuracy": 0.9811009198427201, |
| "step": 1960, |
| "train/kl_loss_qwen": 0.01896182936616242, |
| "train/kl_loss_r1": 0.011808227049186826, |
| "train/total_kl": 0.030770056508481504 |
| }, |
| { |
| "epoch": 2.446656298600311, |
| "grad_norm": 1.125, |
| "learning_rate": 1.1646948941469489e-05, |
| "loss": 0.2434, |
| "mean_token_accuracy": 0.9757021725177765, |
| "step": 1965, |
| "train/kl_loss_qwen": 0.01998060490004718, |
| "train/kl_loss_r1": 0.012626229273155331, |
| "train/total_kl": 0.03260683408007026 |
| }, |
| { |
| "epoch": 2.452877138413686, |
| "grad_norm": 1.0703125, |
| "learning_rate": 1.1600249066002491e-05, |
| "loss": 0.2558, |
| "mean_token_accuracy": 0.9779347211122513, |
| "step": 1970, |
| "train/kl_loss_qwen": 0.021612715255469084, |
| "train/kl_loss_r1": 0.013517844607122242, |
| "train/total_kl": 0.03513055983930826 |
| }, |
| { |
| "epoch": 2.4590979782270606, |
| "grad_norm": 1.21875, |
| "learning_rate": 1.1553549190535492e-05, |
| "loss": 0.2521, |
| "mean_token_accuracy": 0.9801371067762374, |
| "step": 1975, |
| "train/kl_loss_qwen": 0.02266769213601947, |
| "train/kl_loss_r1": 0.014395871269516646, |
| "train/total_kl": 0.037063563149422406 |
| }, |
| { |
| "epoch": 2.4653188180404353, |
| "grad_norm": 1.421875, |
| "learning_rate": 1.1506849315068493e-05, |
| "loss": 0.2738, |
| "mean_token_accuracy": 0.9786773502826691, |
| "step": 1980, |
| "train/kl_loss_qwen": 0.02531546037644148, |
| "train/kl_loss_r1": 0.015837101102806627, |
| "train/total_kl": 0.04115256136283278 |
| }, |
| { |
| "epoch": 2.4715396578538105, |
| "grad_norm": 0.96484375, |
| "learning_rate": 1.1460149439601493e-05, |
| "loss": 0.2666, |
| "mean_token_accuracy": 0.9820117831230164, |
| "step": 1985, |
| "train/kl_loss_qwen": 0.025500294240191578, |
| "train/kl_loss_r1": 0.017055929615162314, |
| "train/total_kl": 0.042556223925203085 |
| }, |
| { |
| "epoch": 2.477760497667185, |
| "grad_norm": 1.0703125, |
| "learning_rate": 1.1413449564134496e-05, |
| "loss": 0.2625, |
| "mean_token_accuracy": 0.9783152371644974, |
| "step": 1990, |
| "train/kl_loss_qwen": 0.022538991970941426, |
| "train/kl_loss_r1": 0.01549134326633066, |
| "train/total_kl": 0.03803033493459225 |
| }, |
| { |
| "epoch": 2.48398133748056, |
| "grad_norm": 0.9140625, |
| "learning_rate": 1.1366749688667498e-05, |
| "loss": 0.2557, |
| "mean_token_accuracy": 0.9759873390197754, |
| "step": 1995, |
| "train/kl_loss_qwen": 0.02168611092492938, |
| "train/kl_loss_r1": 0.01415776691865176, |
| "train/total_kl": 0.03584387795999646 |
| }, |
| { |
| "epoch": 2.4902021772939347, |
| "grad_norm": 1.140625, |
| "learning_rate": 1.1320049813200499e-05, |
| "loss": 0.2739, |
| "mean_token_accuracy": 0.9793085306882858, |
| "step": 2000, |
| "train/kl_loss_qwen": 0.02674374058842659, |
| "train/kl_loss_r1": 0.01565704217646271, |
| "train/total_kl": 0.04240078274160623 |
| }, |
| { |
| "epoch": 2.4964230171073094, |
| "grad_norm": 0.99609375, |
| "learning_rate": 1.12733499377335e-05, |
| "loss": 0.3333, |
| "mean_token_accuracy": 0.9758429080247879, |
| "step": 2005, |
| "train/kl_loss_qwen": 0.03534267195500433, |
| "train/kl_loss_r1": 0.015796015737578273, |
| "train/total_kl": 0.05113868797197938 |
| }, |
| { |
| "epoch": 2.502643856920684, |
| "grad_norm": 1.15625, |
| "learning_rate": 1.12266500622665e-05, |
| "loss": 0.2685, |
| "mean_token_accuracy": 0.9771882861852645, |
| "step": 2010, |
| "train/kl_loss_qwen": 0.02408771966584027, |
| "train/kl_loss_r1": 0.014890200644731521, |
| "train/total_kl": 0.038977920450270175 |
| }, |
| { |
| "epoch": 2.508864696734059, |
| "grad_norm": 1.3359375, |
| "learning_rate": 1.1179950186799503e-05, |
| "loss": 0.2471, |
| "mean_token_accuracy": 0.9786090284585953, |
| "step": 2015, |
| "train/kl_loss_qwen": 0.021793363522738217, |
| "train/kl_loss_r1": 0.012957709864713252, |
| "train/total_kl": 0.03475107317790389 |
| }, |
| { |
| "epoch": 2.515085536547434, |
| "grad_norm": 0.9765625, |
| "learning_rate": 1.1133250311332503e-05, |
| "loss": 0.2501, |
| "mean_token_accuracy": 0.981274637579918, |
| "step": 2020, |
| "train/kl_loss_qwen": 0.023206943599507212, |
| "train/kl_loss_r1": 0.013862681039609016, |
| "train/total_kl": 0.03706962484866381 |
| }, |
| { |
| "epoch": 2.521306376360809, |
| "grad_norm": 0.96484375, |
| "learning_rate": 1.1086550435865504e-05, |
| "loss": 0.2465, |
| "mean_token_accuracy": 0.9786695569753647, |
| "step": 2025, |
| "train/kl_loss_qwen": 0.020848573138937353, |
| "train/kl_loss_r1": 0.0137579798232764, |
| "train/total_kl": 0.03460655324161053 |
| }, |
| { |
| "epoch": 2.5275272161741835, |
| "grad_norm": 0.98828125, |
| "learning_rate": 1.1039850560398506e-05, |
| "loss": 0.2439, |
| "mean_token_accuracy": 0.9790724396705628, |
| "step": 2030, |
| "train/kl_loss_qwen": 0.021428097784519196, |
| "train/kl_loss_r1": 0.012936983909457921, |
| "train/total_kl": 0.03436508160084486 |
| }, |
| { |
| "epoch": 2.5337480559875583, |
| "grad_norm": 0.921875, |
| "learning_rate": 1.0993150684931507e-05, |
| "loss": 0.2571, |
| "mean_token_accuracy": 0.9793956607580185, |
| "step": 2035, |
| "train/kl_loss_qwen": 0.0228791618719697, |
| "train/kl_loss_r1": 0.015054402546957136, |
| "train/total_kl": 0.037933564838021995 |
| }, |
| { |
| "epoch": 2.539968895800933, |
| "grad_norm": 0.96484375, |
| "learning_rate": 1.094645080946451e-05, |
| "loss": 0.3809, |
| "mean_token_accuracy": 0.975305300951004, |
| "step": 2040, |
| "train/kl_loss_qwen": 0.0327933412976563, |
| "train/kl_loss_r1": 0.02881522406823933, |
| "train/total_kl": 0.061608564015477894 |
| }, |
| { |
| "epoch": 2.546189735614308, |
| "grad_norm": 0.9140625, |
| "learning_rate": 1.089975093399751e-05, |
| "loss": 0.2729, |
| "mean_token_accuracy": 0.9835954070091247, |
| "step": 2045, |
| "train/kl_loss_qwen": 0.02814694056287408, |
| "train/kl_loss_r1": 0.01594695230014622, |
| "train/total_kl": 0.04409389290958643 |
| }, |
| { |
| "epoch": 2.5524105754276825, |
| "grad_norm": 1.0234375, |
| "learning_rate": 1.085305105853051e-05, |
| "loss": 0.264, |
| "mean_token_accuracy": 0.9798797309398651, |
| "step": 2050, |
| "train/kl_loss_qwen": 0.024475245364010335, |
| "train/kl_loss_r1": 0.014863114035688341, |
| "train/total_kl": 0.03933835970237851 |
| }, |
| { |
| "epoch": 2.5586314152410576, |
| "grad_norm": 1.125, |
| "learning_rate": 1.0806351183063511e-05, |
| "loss": 0.2793, |
| "mean_token_accuracy": 0.9761617630720139, |
| "step": 2055, |
| "train/kl_loss_qwen": 0.023740977654233573, |
| "train/kl_loss_r1": 0.016528584342449904, |
| "train/total_kl": 0.04026956185698509 |
| }, |
| { |
| "epoch": 2.5648522550544324, |
| "grad_norm": 1.171875, |
| "learning_rate": 1.0759651307596514e-05, |
| "loss": 0.3036, |
| "mean_token_accuracy": 0.9757337421178818, |
| "step": 2060, |
| "train/kl_loss_qwen": 0.031403438979759814, |
| "train/kl_loss_r1": 0.014756415458396076, |
| "train/total_kl": 0.04615985546261072 |
| }, |
| { |
| "epoch": 2.571073094867807, |
| "grad_norm": 0.953125, |
| "learning_rate": 1.0712951432129514e-05, |
| "loss": 0.2439, |
| "mean_token_accuracy": 0.9786640286445618, |
| "step": 2065, |
| "train/kl_loss_qwen": 0.022552527487277985, |
| "train/kl_loss_r1": 0.012621782696805894, |
| "train/total_kl": 0.035174309927970174 |
| }, |
| { |
| "epoch": 2.577293934681182, |
| "grad_norm": 0.8515625, |
| "learning_rate": 1.0666251556662515e-05, |
| "loss": 0.2411, |
| "mean_token_accuracy": 0.9811136335134506, |
| "step": 2070, |
| "train/kl_loss_qwen": 0.02110184049233794, |
| "train/kl_loss_r1": 0.014247958501800894, |
| "train/total_kl": 0.03534979866817593 |
| }, |
| { |
| "epoch": 2.5835147744945566, |
| "grad_norm": 1.53125, |
| "learning_rate": 1.0619551681195518e-05, |
| "loss": 0.2487, |
| "mean_token_accuracy": 0.978958186507225, |
| "step": 2075, |
| "train/kl_loss_qwen": 0.0206217001657933, |
| "train/kl_loss_r1": 0.013504683272913098, |
| "train/total_kl": 0.03412638353183865 |
| }, |
| { |
| "epoch": 2.5897356143079318, |
| "grad_norm": 0.88671875, |
| "learning_rate": 1.0572851805728518e-05, |
| "loss": 0.2444, |
| "mean_token_accuracy": 0.9794360756874084, |
| "step": 2080, |
| "train/kl_loss_qwen": 0.021966875065118074, |
| "train/kl_loss_r1": 0.013504690513946116, |
| "train/total_kl": 0.035471565742045644 |
| }, |
| { |
| "epoch": 2.5959564541213065, |
| "grad_norm": 1.453125, |
| "learning_rate": 1.052615193026152e-05, |
| "loss": 0.2507, |
| "mean_token_accuracy": 0.980023518204689, |
| "step": 2085, |
| "train/kl_loss_qwen": 0.022249753633514047, |
| "train/kl_loss_r1": 0.013989573833532632, |
| "train/total_kl": 0.03623932776972651 |
| }, |
| { |
| "epoch": 2.6021772939346812, |
| "grad_norm": 1.1171875, |
| "learning_rate": 1.0479452054794521e-05, |
| "loss": 0.2527, |
| "mean_token_accuracy": 0.9773518353700638, |
| "step": 2090, |
| "train/kl_loss_qwen": 0.021709746960550547, |
| "train/kl_loss_r1": 0.013672297820448875, |
| "train/total_kl": 0.03538204478099942 |
| }, |
| { |
| "epoch": 2.608398133748056, |
| "grad_norm": 1.0390625, |
| "learning_rate": 1.0432752179327522e-05, |
| "loss": 0.255, |
| "mean_token_accuracy": 0.9789919286966324, |
| "step": 2095, |
| "train/kl_loss_qwen": 0.02221295302733779, |
| "train/kl_loss_r1": 0.01521359293255955, |
| "train/total_kl": 0.03742654556408524 |
| }, |
| { |
| "epoch": 2.6146189735614307, |
| "grad_norm": 1.0546875, |
| "learning_rate": 1.0386052303860523e-05, |
| "loss": 0.2456, |
| "mean_token_accuracy": 0.9789235025644303, |
| "step": 2100, |
| "train/kl_loss_qwen": 0.02003535218536854, |
| "train/kl_loss_r1": 0.013994471030309796, |
| "train/total_kl": 0.03402982326224446 |
| }, |
| { |
| "epoch": 2.620839813374806, |
| "grad_norm": 1.953125, |
| "learning_rate": 1.0339352428393525e-05, |
| "loss": 0.2683, |
| "mean_token_accuracy": 0.9778778046369553, |
| "step": 2105, |
| "train/kl_loss_qwen": 0.024578660633414982, |
| "train/kl_loss_r1": 0.015411347197368742, |
| "train/total_kl": 0.03999000806361437 |
| }, |
| { |
| "epoch": 2.62706065318818, |
| "grad_norm": 1.171875, |
| "learning_rate": 1.0292652552926526e-05, |
| "loss": 0.2502, |
| "mean_token_accuracy": 0.9789797216653824, |
| "step": 2110, |
| "train/kl_loss_qwen": 0.02267702422104776, |
| "train/kl_loss_r1": 0.013770601083524524, |
| "train/total_kl": 0.036447625048458575 |
| }, |
| { |
| "epoch": 2.6332814930015553, |
| "grad_norm": 1.046875, |
| "learning_rate": 1.0245952677459526e-05, |
| "loss": 0.2559, |
| "mean_token_accuracy": 0.9788319110870362, |
| "step": 2115, |
| "train/kl_loss_qwen": 0.02250348115339875, |
| "train/kl_loss_r1": 0.015042783576063812, |
| "train/total_kl": 0.037546264659613374 |
| }, |
| { |
| "epoch": 2.63950233281493, |
| "grad_norm": 1.171875, |
| "learning_rate": 1.0199252801992529e-05, |
| "loss": 0.2475, |
| "mean_token_accuracy": 0.9789767384529113, |
| "step": 2120, |
| "train/kl_loss_qwen": 0.0217635712120682, |
| "train/kl_loss_r1": 0.013855892582796514, |
| "train/total_kl": 0.03561946395784617 |
| }, |
| { |
| "epoch": 2.645723172628305, |
| "grad_norm": 1.0234375, |
| "learning_rate": 1.015255292652553e-05, |
| "loss": 0.3489, |
| "mean_token_accuracy": 0.9748771101236343, |
| "step": 2125, |
| "train/kl_loss_qwen": 0.03360332241281867, |
| "train/kl_loss_r1": 0.018315932666882872, |
| "train/total_kl": 0.051919255033135416 |
| }, |
| { |
| "epoch": 2.6519440124416795, |
| "grad_norm": 1.1875, |
| "learning_rate": 1.0105853051058532e-05, |
| "loss": 0.2347, |
| "mean_token_accuracy": 0.9795038014650345, |
| "step": 2130, |
| "train/kl_loss_qwen": 0.02050428814254701, |
| "train/kl_loss_r1": 0.011696344916708767, |
| "train/total_kl": 0.0322006331756711 |
| }, |
| { |
| "epoch": 2.6581648522550543, |
| "grad_norm": 2.09375, |
| "learning_rate": 1.0059153175591532e-05, |
| "loss": 0.2775, |
| "mean_token_accuracy": 0.979162546992302, |
| "step": 2135, |
| "train/kl_loss_qwen": 0.026292033307254315, |
| "train/kl_loss_r1": 0.016034953179769218, |
| "train/total_kl": 0.04232698623090982 |
| }, |
| { |
| "epoch": 2.6643856920684295, |
| "grad_norm": 1.203125, |
| "learning_rate": 1.0012453300124533e-05, |
| "loss": 0.2311, |
| "mean_token_accuracy": 0.9770093053579331, |
| "step": 2140, |
| "train/kl_loss_qwen": 0.019046885380521416, |
| "train/kl_loss_r1": 0.012393153086304665, |
| "train/total_kl": 0.031440038606524466 |
| }, |
| { |
| "epoch": 2.670606531881804, |
| "grad_norm": 1.0546875, |
| "learning_rate": 9.965753424657534e-06, |
| "loss": 0.2415, |
| "mean_token_accuracy": 0.9810254126787186, |
| "step": 2145, |
| "train/kl_loss_qwen": 0.022190214600414038, |
| "train/kl_loss_r1": 0.013294363114982843, |
| "train/total_kl": 0.035484577808529136 |
| }, |
| { |
| "epoch": 2.676827371695179, |
| "grad_norm": 1.109375, |
| "learning_rate": 9.919053549190536e-06, |
| "loss": 0.235, |
| "mean_token_accuracy": 0.9792218834161759, |
| "step": 2150, |
| "train/kl_loss_qwen": 0.021480456925928593, |
| "train/kl_loss_r1": 0.012514953222125768, |
| "train/total_kl": 0.033995410334318875 |
| }, |
| { |
| "epoch": 2.6830482115085537, |
| "grad_norm": 0.98046875, |
| "learning_rate": 9.872353673723537e-06, |
| "loss": 0.2255, |
| "mean_token_accuracy": 0.9813844114542007, |
| "step": 2155, |
| "train/kl_loss_qwen": 0.019305172516033052, |
| "train/kl_loss_r1": 0.012685006693936884, |
| "train/total_kl": 0.03199017941951752 |
| }, |
| { |
| "epoch": 2.6892690513219284, |
| "grad_norm": 0.94921875, |
| "learning_rate": 9.825653798256538e-06, |
| "loss": 0.2614, |
| "mean_token_accuracy": 0.9802846044301987, |
| "step": 2160, |
| "train/kl_loss_qwen": 0.023292775312438608, |
| "train/kl_loss_r1": 0.014105364657007157, |
| "train/total_kl": 0.03739814003929496 |
| }, |
| { |
| "epoch": 2.695489891135303, |
| "grad_norm": 1.0546875, |
| "learning_rate": 9.77895392278954e-06, |
| "loss": 0.2779, |
| "mean_token_accuracy": 0.9766510784626007, |
| "step": 2165, |
| "train/kl_loss_qwen": 0.02564525925554335, |
| "train/kl_loss_r1": 0.015102893207222223, |
| "train/total_kl": 0.040748152509331705 |
| }, |
| { |
| "epoch": 2.701710730948678, |
| "grad_norm": 1.046875, |
| "learning_rate": 9.73225404732254e-06, |
| "loss": 0.2647, |
| "mean_token_accuracy": 0.9788645833730698, |
| "step": 2170, |
| "train/kl_loss_qwen": 0.023770625423640012, |
| "train/kl_loss_r1": 0.01477400113362819, |
| "train/total_kl": 0.03854462616145611 |
| }, |
| { |
| "epoch": 2.707931570762053, |
| "grad_norm": 0.98828125, |
| "learning_rate": 9.685554171855543e-06, |
| "loss": 0.2438, |
| "mean_token_accuracy": 0.9803738176822663, |
| "step": 2175, |
| "train/kl_loss_qwen": 0.020186571637168527, |
| "train/kl_loss_r1": 0.013914901157841086, |
| "train/total_kl": 0.0341014726087451 |
| }, |
| { |
| "epoch": 2.7141524105754278, |
| "grad_norm": 1.4609375, |
| "learning_rate": 9.638854296388544e-06, |
| "loss": 0.2489, |
| "mean_token_accuracy": 0.9783189207315445, |
| "step": 2180, |
| "train/kl_loss_qwen": 0.020895938901230694, |
| "train/kl_loss_r1": 0.013940211269073188, |
| "train/total_kl": 0.034836150519549844 |
| }, |
| { |
| "epoch": 2.7203732503888025, |
| "grad_norm": 1.0390625, |
| "learning_rate": 9.592154420921544e-06, |
| "loss": 0.2291, |
| "mean_token_accuracy": 0.9809900194406509, |
| "step": 2185, |
| "train/kl_loss_qwen": 0.019283190369606018, |
| "train/kl_loss_r1": 0.011813020100817084, |
| "train/total_kl": 0.031096210610121487 |
| }, |
| { |
| "epoch": 2.7265940902021772, |
| "grad_norm": 1.0859375, |
| "learning_rate": 9.545454545454545e-06, |
| "loss": 0.2716, |
| "mean_token_accuracy": 0.979528221487999, |
| "step": 2190, |
| "train/kl_loss_qwen": 0.024975268309935926, |
| "train/kl_loss_r1": 0.014736651070415973, |
| "train/total_kl": 0.03971191914752126 |
| }, |
| { |
| "epoch": 2.732814930015552, |
| "grad_norm": 0.9375, |
| "learning_rate": 9.498754669987546e-06, |
| "loss": 0.2547, |
| "mean_token_accuracy": 0.9805773764848709, |
| "step": 2195, |
| "train/kl_loss_qwen": 0.023621318116784095, |
| "train/kl_loss_r1": 0.014904734306037426, |
| "train/total_kl": 0.038526052702218296 |
| }, |
| { |
| "epoch": 2.739035769828927, |
| "grad_norm": 1.2421875, |
| "learning_rate": 9.452054794520548e-06, |
| "loss": 0.2519, |
| "mean_token_accuracy": 0.9800098180770874, |
| "step": 2200, |
| "train/kl_loss_qwen": 0.022577690612524747, |
| "train/kl_loss_r1": 0.014399249549023807, |
| "train/total_kl": 0.036976939905434845 |
| }, |
| { |
| "epoch": 2.7452566096423014, |
| "grad_norm": 0.98828125, |
| "learning_rate": 9.405354919053549e-06, |
| "loss": 0.2523, |
| "mean_token_accuracy": 0.9802424728870391, |
| "step": 2205, |
| "train/kl_loss_qwen": 0.023771630600094795, |
| "train/kl_loss_r1": 0.014084443286992609, |
| "train/total_kl": 0.03785607386380434 |
| }, |
| { |
| "epoch": 2.7514774494556766, |
| "grad_norm": 1.0625, |
| "learning_rate": 9.358655043586551e-06, |
| "loss": 0.2483, |
| "mean_token_accuracy": 0.9757383853197098, |
| "step": 2210, |
| "train/kl_loss_qwen": 0.020856014778837563, |
| "train/kl_loss_r1": 0.012496178969740868, |
| "train/total_kl": 0.03335219379514456 |
| }, |
| { |
| "epoch": 2.7576982892690514, |
| "grad_norm": 1.2265625, |
| "learning_rate": 9.311955168119552e-06, |
| "loss": 0.2609, |
| "mean_token_accuracy": 0.9750352591276169, |
| "step": 2215, |
| "train/kl_loss_qwen": 0.021947943326085805, |
| "train/kl_loss_r1": 0.013721926184371114, |
| "train/total_kl": 0.035669869370758535 |
| }, |
| { |
| "epoch": 2.763919129082426, |
| "grad_norm": 1.125, |
| "learning_rate": 9.265255292652554e-06, |
| "loss": 0.2498, |
| "mean_token_accuracy": 0.9788256555795669, |
| "step": 2220, |
| "train/kl_loss_qwen": 0.022918132552877068, |
| "train/kl_loss_r1": 0.013518631807528436, |
| "train/total_kl": 0.036436764243990186 |
| }, |
| { |
| "epoch": 2.770139968895801, |
| "grad_norm": 1.1796875, |
| "learning_rate": 9.218555417185555e-06, |
| "loss": 0.2567, |
| "mean_token_accuracy": 0.98291976749897, |
| "step": 2225, |
| "train/kl_loss_qwen": 0.02417180915363133, |
| "train/kl_loss_r1": 0.016105480049736796, |
| "train/total_kl": 0.04027728922665119 |
| }, |
| { |
| "epoch": 2.7763608087091756, |
| "grad_norm": 0.90234375, |
| "learning_rate": 9.171855541718556e-06, |
| "loss": 0.2501, |
| "mean_token_accuracy": 0.9805917859077453, |
| "step": 2230, |
| "train/kl_loss_qwen": 0.022929491940885782, |
| "train/kl_loss_r1": 0.014057897846214473, |
| "train/total_kl": 0.03698738953098655 |
| }, |
| { |
| "epoch": 2.7825816485225507, |
| "grad_norm": 1.1015625, |
| "learning_rate": 9.125155666251556e-06, |
| "loss": 0.3112, |
| "mean_token_accuracy": 0.9757759094238281, |
| "step": 2235, |
| "train/kl_loss_qwen": 0.030990847293287514, |
| "train/kl_loss_r1": 0.017853675317019223, |
| "train/total_kl": 0.048844522703438996 |
| }, |
| { |
| "epoch": 2.7888024883359255, |
| "grad_norm": 1.2109375, |
| "learning_rate": 9.078455790784557e-06, |
| "loss": 0.2578, |
| "mean_token_accuracy": 0.9765969723463058, |
| "step": 2240, |
| "train/kl_loss_qwen": 0.022567249741405247, |
| "train/kl_loss_r1": 0.014588132430799306, |
| "train/total_kl": 0.03715538214892149 |
| }, |
| { |
| "epoch": 2.7950233281493, |
| "grad_norm": 0.93359375, |
| "learning_rate": 9.03175591531756e-06, |
| "loss": 0.2468, |
| "mean_token_accuracy": 0.9806161612272263, |
| "step": 2245, |
| "train/kl_loss_qwen": 0.022640920570120217, |
| "train/kl_loss_r1": 0.013426762819290162, |
| "train/total_kl": 0.03606768334284425 |
| }, |
| { |
| "epoch": 2.801244167962675, |
| "grad_norm": 1.28125, |
| "learning_rate": 8.98505603985056e-06, |
| "loss": 0.2405, |
| "mean_token_accuracy": 0.9788148522377014, |
| "step": 2250, |
| "train/kl_loss_qwen": 0.020399608230218292, |
| "train/kl_loss_r1": 0.013216133532114326, |
| "train/total_kl": 0.03361574159935117 |
| }, |
| { |
| "epoch": 2.8074650077760497, |
| "grad_norm": 0.93359375, |
| "learning_rate": 8.938356164383562e-06, |
| "loss": 0.2289, |
| "mean_token_accuracy": 0.9812757492065429, |
| "step": 2255, |
| "train/kl_loss_qwen": 0.019857667246833445, |
| "train/kl_loss_r1": 0.013221802725456654, |
| "train/total_kl": 0.03307946994900703 |
| }, |
| { |
| "epoch": 2.8136858475894244, |
| "grad_norm": 1.296875, |
| "learning_rate": 8.891656288916563e-06, |
| "loss": 0.2606, |
| "mean_token_accuracy": 0.9791488260030746, |
| "step": 2260, |
| "train/kl_loss_qwen": 0.02399991424754262, |
| "train/kl_loss_r1": 0.015469257766380907, |
| "train/total_kl": 0.03946917224675417 |
| }, |
| { |
| "epoch": 2.819906687402799, |
| "grad_norm": 1.6875, |
| "learning_rate": 8.844956413449565e-06, |
| "loss": 0.2846, |
| "mean_token_accuracy": 0.979676753282547, |
| "step": 2265, |
| "train/kl_loss_qwen": 0.02852729302830994, |
| "train/kl_loss_r1": 0.01608511172235012, |
| "train/total_kl": 0.04461240470409393 |
| }, |
| { |
| "epoch": 2.8261275272161743, |
| "grad_norm": 1.0, |
| "learning_rate": 8.798256537982566e-06, |
| "loss": 0.2421, |
| "mean_token_accuracy": 0.979563570022583, |
| "step": 2270, |
| "train/kl_loss_qwen": 0.021803312422707676, |
| "train/kl_loss_r1": 0.012825471581891179, |
| "train/total_kl": 0.03462878372520208 |
| }, |
| { |
| "epoch": 2.832348367029549, |
| "grad_norm": 0.953125, |
| "learning_rate": 8.751556662515567e-06, |
| "loss": 0.255, |
| "mean_token_accuracy": 0.9786518633365631, |
| "step": 2275, |
| "train/kl_loss_qwen": 0.02268552640452981, |
| "train/kl_loss_r1": 0.014874024945311249, |
| "train/total_kl": 0.037559551559388636 |
| }, |
| { |
| "epoch": 2.838569206842924, |
| "grad_norm": 0.87109375, |
| "learning_rate": 8.704856787048568e-06, |
| "loss": 0.2709, |
| "mean_token_accuracy": 0.9777145385742188, |
| "step": 2280, |
| "train/kl_loss_qwen": 0.02695997697301209, |
| "train/kl_loss_r1": 0.015009569097310304, |
| "train/total_kl": 0.04196954630315304 |
| }, |
| { |
| "epoch": 2.8447900466562985, |
| "grad_norm": 1.015625, |
| "learning_rate": 8.658156911581568e-06, |
| "loss": 0.4012, |
| "mean_token_accuracy": 0.9728323191404342, |
| "step": 2285, |
| "train/kl_loss_qwen": 0.04328306377865374, |
| "train/kl_loss_r1": 0.019736759038642047, |
| "train/total_kl": 0.06301982244476675 |
| }, |
| { |
| "epoch": 2.8510108864696733, |
| "grad_norm": 1.1171875, |
| "learning_rate": 8.61145703611457e-06, |
| "loss": 0.2336, |
| "mean_token_accuracy": 0.9794570118188858, |
| "step": 2290, |
| "train/kl_loss_qwen": 0.01980093107558787, |
| "train/kl_loss_r1": 0.01263779290020466, |
| "train/total_kl": 0.0324387239292264 |
| }, |
| { |
| "epoch": 2.8572317262830484, |
| "grad_norm": 0.96484375, |
| "learning_rate": 8.564757160647571e-06, |
| "loss": 0.2557, |
| "mean_token_accuracy": 0.9764771848917008, |
| "step": 2295, |
| "train/kl_loss_qwen": 0.023008445603773, |
| "train/kl_loss_r1": 0.013009098009206355, |
| "train/total_kl": 0.036017543729394676 |
| }, |
| { |
| "epoch": 2.863452566096423, |
| "grad_norm": 1.21875, |
| "learning_rate": 8.518057285180574e-06, |
| "loss": 0.2353, |
| "mean_token_accuracy": 0.9793502748012543, |
| "step": 2300, |
| "train/kl_loss_qwen": 0.02138944426551461, |
| "train/kl_loss_r1": 0.012340294336900115, |
| "train/total_kl": 0.033729738742113116 |
| }, |
| { |
| "epoch": 2.869673405909798, |
| "grad_norm": 1.1328125, |
| "learning_rate": 8.471357409713574e-06, |
| "loss": 0.2507, |
| "mean_token_accuracy": 0.9794678062200546, |
| "step": 2305, |
| "train/kl_loss_qwen": 0.0230550997890532, |
| "train/kl_loss_r1": 0.01367465585935861, |
| "train/total_kl": 0.03672975599765778 |
| }, |
| { |
| "epoch": 2.8758942457231726, |
| "grad_norm": 1.3671875, |
| "learning_rate": 8.424657534246577e-06, |
| "loss": 0.2519, |
| "mean_token_accuracy": 0.9780717104673385, |
| "step": 2310, |
| "train/kl_loss_qwen": 0.022003966965712607, |
| "train/kl_loss_r1": 0.013341469364240766, |
| "train/total_kl": 0.03534543639980257 |
| }, |
| { |
| "epoch": 2.8821150855365474, |
| "grad_norm": 1.1328125, |
| "learning_rate": 8.377957658779577e-06, |
| "loss": 0.2565, |
| "mean_token_accuracy": 0.9794615656137466, |
| "step": 2315, |
| "train/kl_loss_qwen": 0.022503159195184707, |
| "train/kl_loss_r1": 0.014681264385581016, |
| "train/total_kl": 0.03718442320823669 |
| }, |
| { |
| "epoch": 2.888335925349922, |
| "grad_norm": 0.875, |
| "learning_rate": 8.331257783312578e-06, |
| "loss": 0.3476, |
| "mean_token_accuracy": 0.9739361822605133, |
| "step": 2320, |
| "train/kl_loss_qwen": 0.033717150893062355, |
| "train/kl_loss_r1": 0.017250060685910285, |
| "train/total_kl": 0.05096721239387989 |
| }, |
| { |
| "epoch": 2.894556765163297, |
| "grad_norm": 0.8515625, |
| "learning_rate": 8.284557907845579e-06, |
| "loss": 0.2501, |
| "mean_token_accuracy": 0.9814224302768707, |
| "step": 2325, |
| "train/kl_loss_qwen": 0.023675559274852275, |
| "train/kl_loss_r1": 0.014361454313620925, |
| "train/total_kl": 0.03803701344877482 |
| }, |
| { |
| "epoch": 2.900777604976672, |
| "grad_norm": 1.171875, |
| "learning_rate": 8.23785803237858e-06, |
| "loss": 0.3194, |
| "mean_token_accuracy": 0.9765466809272766, |
| "step": 2330, |
| "train/kl_loss_qwen": 0.03182602096349001, |
| "train/kl_loss_r1": 0.018149445950984954, |
| "train/total_kl": 0.04997546775266528 |
| }, |
| { |
| "epoch": 2.9069984447900468, |
| "grad_norm": 1.0703125, |
| "learning_rate": 8.191158156911582e-06, |
| "loss": 0.243, |
| "mean_token_accuracy": 0.9765629231929779, |
| "step": 2335, |
| "train/kl_loss_qwen": 0.019837050791829826, |
| "train/kl_loss_r1": 0.013477956131100654, |
| "train/total_kl": 0.03331500729545951 |
| }, |
| { |
| "epoch": 2.9132192846034215, |
| "grad_norm": 0.9296875, |
| "learning_rate": 8.144458281444582e-06, |
| "loss": 0.249, |
| "mean_token_accuracy": 0.9794359922409057, |
| "step": 2340, |
| "train/kl_loss_qwen": 0.021764508541673423, |
| "train/kl_loss_r1": 0.014173974050208926, |
| "train/total_kl": 0.03593848291784525 |
| }, |
| { |
| "epoch": 2.9194401244167962, |
| "grad_norm": 0.98828125, |
| "learning_rate": 8.097758405977585e-06, |
| "loss": 0.3243, |
| "mean_token_accuracy": 0.9754409641027451, |
| "step": 2345, |
| "train/kl_loss_qwen": 0.032446541963145135, |
| "train/kl_loss_r1": 0.016262303036637605, |
| "train/total_kl": 0.04870884427800774 |
| }, |
| { |
| "epoch": 2.925660964230171, |
| "grad_norm": 0.99609375, |
| "learning_rate": 8.051058530510586e-06, |
| "loss": 0.2413, |
| "mean_token_accuracy": 0.9799944281578064, |
| "step": 2350, |
| "train/kl_loss_qwen": 0.02185902800410986, |
| "train/kl_loss_r1": 0.012194494740106166, |
| "train/total_kl": 0.03405352234840393 |
| }, |
| { |
| "epoch": 2.931881804043546, |
| "grad_norm": 0.9453125, |
| "learning_rate": 8.004358655043588e-06, |
| "loss": 0.2488, |
| "mean_token_accuracy": 0.9812228798866272, |
| "step": 2355, |
| "train/kl_loss_qwen": 0.023556680977344514, |
| "train/kl_loss_r1": 0.01458953726105392, |
| "train/total_kl": 0.038146217819303274 |
| }, |
| { |
| "epoch": 2.9381026438569204, |
| "grad_norm": 1.296875, |
| "learning_rate": 7.957658779576589e-06, |
| "loss": 0.2386, |
| "mean_token_accuracy": 0.9794855356216431, |
| "step": 2360, |
| "train/kl_loss_qwen": 0.019754012860357762, |
| "train/kl_loss_r1": 0.0134123150492087, |
| "train/total_kl": 0.033166327979415655 |
| }, |
| { |
| "epoch": 2.9443234836702956, |
| "grad_norm": 0.90625, |
| "learning_rate": 7.91095890410959e-06, |
| "loss": 0.2524, |
| "mean_token_accuracy": 0.9802679121494293, |
| "step": 2365, |
| "train/kl_loss_qwen": 0.021867240034043788, |
| "train/kl_loss_r1": 0.015403355937451124, |
| "train/total_kl": 0.03727059587836266 |
| }, |
| { |
| "epoch": 2.9505443234836704, |
| "grad_norm": 0.92578125, |
| "learning_rate": 7.86425902864259e-06, |
| "loss": 0.2384, |
| "mean_token_accuracy": 0.9784934759140015, |
| "step": 2370, |
| "train/kl_loss_qwen": 0.019248896767385303, |
| "train/kl_loss_r1": 0.013327605556696653, |
| "train/total_kl": 0.032576502207666634 |
| }, |
| { |
| "epoch": 2.956765163297045, |
| "grad_norm": 1.1171875, |
| "learning_rate": 7.81755915317559e-06, |
| "loss": 0.2528, |
| "mean_token_accuracy": 0.9785091251134872, |
| "step": 2375, |
| "train/kl_loss_qwen": 0.02136381221935153, |
| "train/kl_loss_r1": 0.01490559543017298, |
| "train/total_kl": 0.03626940799877047 |
| }, |
| { |
| "epoch": 2.96298600311042, |
| "grad_norm": 1.0234375, |
| "learning_rate": 7.770859277708593e-06, |
| "loss": 0.254, |
| "mean_token_accuracy": 0.9753740966320038, |
| "step": 2380, |
| "train/kl_loss_qwen": 0.020779022481292486, |
| "train/kl_loss_r1": 0.012893599388189615, |
| "train/total_kl": 0.033672621753066775 |
| }, |
| { |
| "epoch": 2.9692068429237946, |
| "grad_norm": 1.296875, |
| "learning_rate": 7.724159402241594e-06, |
| "loss": 0.2723, |
| "mean_token_accuracy": 0.9807368129491806, |
| "step": 2385, |
| "train/kl_loss_qwen": 0.02706731208600104, |
| "train/kl_loss_r1": 0.015577892120927573, |
| "train/total_kl": 0.04264520406723023 |
| }, |
| { |
| "epoch": 2.9754276827371697, |
| "grad_norm": 1.1796875, |
| "learning_rate": 7.677459526774596e-06, |
| "loss": 0.2339, |
| "mean_token_accuracy": 0.9778724700212479, |
| "step": 2390, |
| "train/kl_loss_qwen": 0.019125875597819687, |
| "train/kl_loss_r1": 0.012182414485141634, |
| "train/total_kl": 0.03130828971043229 |
| }, |
| { |
| "epoch": 2.9816485225505445, |
| "grad_norm": 1.2578125, |
| "learning_rate": 7.630759651307597e-06, |
| "loss": 0.243, |
| "mean_token_accuracy": 0.9793420016765595, |
| "step": 2395, |
| "train/kl_loss_qwen": 0.021404419979080557, |
| "train/kl_loss_r1": 0.012169917370192707, |
| "train/total_kl": 0.033574337419122455 |
| }, |
| { |
| "epoch": 2.987869362363919, |
| "grad_norm": 0.984375, |
| "learning_rate": 7.584059775840598e-06, |
| "loss": 0.2408, |
| "mean_token_accuracy": 0.9772315412759781, |
| "step": 2400, |
| "train/kl_loss_qwen": 0.02061320682987571, |
| "train/kl_loss_r1": 0.013303012656979262, |
| "train/total_kl": 0.03391621951013803 |
| }, |
| { |
| "epoch": 2.994090202177294, |
| "grad_norm": 0.94921875, |
| "learning_rate": 7.537359900373599e-06, |
| "loss": 0.2771, |
| "mean_token_accuracy": 0.9785916924476623, |
| "step": 2405, |
| "train/kl_loss_qwen": 0.0252801182679832, |
| "train/kl_loss_r1": 0.01622594220098108, |
| "train/total_kl": 0.0415060605853796 |
| }, |
| { |
| "epoch": 3.001244167962675, |
| "grad_norm": 1.578125, |
| "learning_rate": 7.4906600249066005e-06, |
| "loss": 0.2953, |
| "mean_token_accuracy": 0.9816724224524065, |
| "step": 2410, |
| "train/kl_loss_qwen": 0.025597207248210907, |
| "train/kl_loss_r1": 0.01563291643238203, |
| "train/total_kl": 0.041230123659426514 |
| }, |
| { |
| "epoch": 3.00746500777605, |
| "grad_norm": 0.85546875, |
| "learning_rate": 7.443960149439601e-06, |
| "loss": 0.3073, |
| "mean_token_accuracy": 0.9799118191003799, |
| "step": 2415, |
| "train/kl_loss_qwen": 0.030909589771181346, |
| "train/kl_loss_r1": 0.01667693620547652, |
| "train/total_kl": 0.047586525231599806 |
| }, |
| { |
| "epoch": 3.0136858475894246, |
| "grad_norm": 0.984375, |
| "learning_rate": 7.397260273972603e-06, |
| "loss": 0.2404, |
| "mean_token_accuracy": 0.9838899701833725, |
| "step": 2420, |
| "train/kl_loss_qwen": 0.021309804217889906, |
| "train/kl_loss_r1": 0.013884992711246014, |
| "train/total_kl": 0.03519479688256979 |
| }, |
| { |
| "epoch": 3.0199066874027993, |
| "grad_norm": 0.875, |
| "learning_rate": 7.350560398505604e-06, |
| "loss": 0.2295, |
| "mean_token_accuracy": 0.9842253357172013, |
| "step": 2425, |
| "train/kl_loss_qwen": 0.021593318693339823, |
| "train/kl_loss_r1": 0.012967960792593658, |
| "train/total_kl": 0.034561279509216544 |
| }, |
| { |
| "epoch": 3.026127527216174, |
| "grad_norm": 0.8125, |
| "learning_rate": 7.303860523038606e-06, |
| "loss": 0.226, |
| "mean_token_accuracy": 0.9844829171895981, |
| "step": 2430, |
| "train/kl_loss_qwen": 0.019423839217051864, |
| "train/kl_loss_r1": 0.012976301368325949, |
| "train/total_kl": 0.032400140445679425 |
| }, |
| { |
| "epoch": 3.032348367029549, |
| "grad_norm": 1.578125, |
| "learning_rate": 7.2571606475716064e-06, |
| "loss": 0.2594, |
| "mean_token_accuracy": 0.9829055160284043, |
| "step": 2435, |
| "train/kl_loss_qwen": 0.02393628782592714, |
| "train/kl_loss_r1": 0.015033241617493332, |
| "train/total_kl": 0.03896952914074063 |
| }, |
| { |
| "epoch": 3.038569206842924, |
| "grad_norm": 0.89453125, |
| "learning_rate": 7.210460772104608e-06, |
| "loss": 0.2435, |
| "mean_token_accuracy": 0.9866632699966431, |
| "step": 2440, |
| "train/kl_loss_qwen": 0.023871434153988957, |
| "train/kl_loss_r1": 0.01572964512743056, |
| "train/total_kl": 0.03960107890889049 |
| }, |
| { |
| "epoch": 3.0447900466562987, |
| "grad_norm": 1.0234375, |
| "learning_rate": 7.1637608966376095e-06, |
| "loss": 0.2378, |
| "mean_token_accuracy": 0.9842400878667832, |
| "step": 2445, |
| "train/kl_loss_qwen": 0.022447610320523382, |
| "train/kl_loss_r1": 0.013542116852477193, |
| "train/total_kl": 0.03598972680047154 |
| }, |
| { |
| "epoch": 3.0510108864696734, |
| "grad_norm": 0.90625, |
| "learning_rate": 7.11706102117061e-06, |
| "loss": 0.2568, |
| "mean_token_accuracy": 0.9835693746805191, |
| "step": 2450, |
| "train/kl_loss_qwen": 0.0250473961699754, |
| "train/kl_loss_r1": 0.015254210913553834, |
| "train/total_kl": 0.040301607269793746 |
| }, |
| { |
| "epoch": 3.057231726283048, |
| "grad_norm": 0.8359375, |
| "learning_rate": 7.070361145703612e-06, |
| "loss": 0.2386, |
| "mean_token_accuracy": 0.9851376801729202, |
| "step": 2455, |
| "train/kl_loss_qwen": 0.023010611534118652, |
| "train/kl_loss_r1": 0.013890899089165031, |
| "train/total_kl": 0.036901510879397394 |
| }, |
| { |
| "epoch": 3.063452566096423, |
| "grad_norm": 1.1171875, |
| "learning_rate": 7.023661270236612e-06, |
| "loss": 0.2295, |
| "mean_token_accuracy": 0.9852157533168793, |
| "step": 2460, |
| "train/kl_loss_qwen": 0.020923609985038637, |
| "train/kl_loss_r1": 0.013110134052112699, |
| "train/total_kl": 0.034033743944019076 |
| }, |
| { |
| "epoch": 3.0696734059097976, |
| "grad_norm": 0.84375, |
| "learning_rate": 6.976961394769615e-06, |
| "loss": 0.2367, |
| "mean_token_accuracy": 0.984752967953682, |
| "step": 2465, |
| "train/kl_loss_qwen": 0.021800487814471126, |
| "train/kl_loss_r1": 0.014962652372196317, |
| "train/total_kl": 0.03676314065232873 |
| }, |
| { |
| "epoch": 3.075894245723173, |
| "grad_norm": 0.953125, |
| "learning_rate": 6.9302615193026155e-06, |
| "loss": 0.2176, |
| "mean_token_accuracy": 0.9840360462665558, |
| "step": 2470, |
| "train/kl_loss_qwen": 0.019439062848687173, |
| "train/kl_loss_r1": 0.012102234200574458, |
| "train/total_kl": 0.03154129749163985 |
| }, |
| { |
| "epoch": 3.0821150855365476, |
| "grad_norm": 0.91015625, |
| "learning_rate": 6.883561643835617e-06, |
| "loss": 0.24, |
| "mean_token_accuracy": 0.9856468439102173, |
| "step": 2475, |
| "train/kl_loss_qwen": 0.02432550024241209, |
| "train/kl_loss_r1": 0.014322337484918535, |
| "train/total_kl": 0.03864783812314272 |
| }, |
| { |
| "epoch": 3.0883359253499223, |
| "grad_norm": 0.8203125, |
| "learning_rate": 6.836861768368618e-06, |
| "loss": 0.2422, |
| "mean_token_accuracy": 0.9857906192541123, |
| "step": 2480, |
| "train/kl_loss_qwen": 0.024130608467385174, |
| "train/kl_loss_r1": 0.014549318444915115, |
| "train/total_kl": 0.03867992656305432 |
| }, |
| { |
| "epoch": 3.094556765163297, |
| "grad_norm": 0.7734375, |
| "learning_rate": 6.790161892901618e-06, |
| "loss": 0.2854, |
| "mean_token_accuracy": 0.9790276646614074, |
| "step": 2485, |
| "train/kl_loss_qwen": 0.02656708569265902, |
| "train/kl_loss_r1": 0.014770055492408573, |
| "train/total_kl": 0.04133714027702808 |
| }, |
| { |
| "epoch": 3.1007776049766718, |
| "grad_norm": 0.98828125, |
| "learning_rate": 6.743462017434621e-06, |
| "loss": 0.2284, |
| "mean_token_accuracy": 0.9816806197166443, |
| "step": 2490, |
| "train/kl_loss_qwen": 0.020325628202408554, |
| "train/kl_loss_r1": 0.012261225422844291, |
| "train/total_kl": 0.032586853578686716 |
| }, |
| { |
| "epoch": 3.1069984447900465, |
| "grad_norm": 0.80078125, |
| "learning_rate": 6.696762141967621e-06, |
| "loss": 0.2392, |
| "mean_token_accuracy": 0.9851239174604416, |
| "step": 2495, |
| "train/kl_loss_qwen": 0.023483004746958615, |
| "train/kl_loss_r1": 0.013791011273860931, |
| "train/total_kl": 0.037274016067385674 |
| }, |
| { |
| "epoch": 3.1132192846034217, |
| "grad_norm": 0.87890625, |
| "learning_rate": 6.650062266500623e-06, |
| "loss": 0.2369, |
| "mean_token_accuracy": 0.9840823352336884, |
| "step": 2500, |
| "train/kl_loss_qwen": 0.022309778584167363, |
| "train/kl_loss_r1": 0.012782163382507861, |
| "train/total_kl": 0.0350919421762228 |
| }, |
| { |
| "epoch": 3.1194401244167964, |
| "grad_norm": 0.8515625, |
| "learning_rate": 6.603362391033624e-06, |
| "loss": 0.229, |
| "mean_token_accuracy": 0.9852802842855454, |
| "step": 2505, |
| "train/kl_loss_qwen": 0.022154048085212708, |
| "train/kl_loss_r1": 0.01309482108335942, |
| "train/total_kl": 0.035248869378119704 |
| }, |
| { |
| "epoch": 3.125660964230171, |
| "grad_norm": 0.8359375, |
| "learning_rate": 6.556662515566626e-06, |
| "loss": 0.2327, |
| "mean_token_accuracy": 0.9822622090578079, |
| "step": 2510, |
| "train/kl_loss_qwen": 0.020434158109128474, |
| "train/kl_loss_r1": 0.012905464507639408, |
| "train/total_kl": 0.03333962252363563 |
| }, |
| { |
| "epoch": 3.131881804043546, |
| "grad_norm": 0.98046875, |
| "learning_rate": 6.509962640099627e-06, |
| "loss": 0.2825, |
| "mean_token_accuracy": 0.9828780442476273, |
| "step": 2515, |
| "train/kl_loss_qwen": 0.028179554687812924, |
| "train/kl_loss_r1": 0.016975441295653582, |
| "train/total_kl": 0.04515499575063586 |
| }, |
| { |
| "epoch": 3.1381026438569206, |
| "grad_norm": 1.2578125, |
| "learning_rate": 6.463262764632628e-06, |
| "loss": 0.2292, |
| "mean_token_accuracy": 0.9861107170581818, |
| "step": 2520, |
| "train/kl_loss_qwen": 0.020859976392239334, |
| "train/kl_loss_r1": 0.012708152551203966, |
| "train/total_kl": 0.03356812903657556 |
| }, |
| { |
| "epoch": 3.1443234836702953, |
| "grad_norm": 0.890625, |
| "learning_rate": 6.416562889165629e-06, |
| "loss": 0.2433, |
| "mean_token_accuracy": 0.9862571328878402, |
| "step": 2525, |
| "train/kl_loss_qwen": 0.022917523747310042, |
| "train/kl_loss_r1": 0.014852290134876966, |
| "train/total_kl": 0.037769814115017654 |
| }, |
| { |
| "epoch": 3.15054432348367, |
| "grad_norm": 0.83984375, |
| "learning_rate": 6.3698630136986296e-06, |
| "loss": 0.2509, |
| "mean_token_accuracy": 0.9852677673101425, |
| "step": 2530, |
| "train/kl_loss_qwen": 0.025660164793953298, |
| "train/kl_loss_r1": 0.014589101611636578, |
| "train/total_kl": 0.04024926638230682 |
| }, |
| { |
| "epoch": 3.1567651632970453, |
| "grad_norm": 1.9140625, |
| "learning_rate": 6.323163138231632e-06, |
| "loss": 0.2669, |
| "mean_token_accuracy": 0.9850893825292587, |
| "step": 2535, |
| "train/kl_loss_qwen": 0.027122320886701346, |
| "train/kl_loss_r1": 0.014969939785078167, |
| "train/total_kl": 0.04209226043894887 |
| }, |
| { |
| "epoch": 3.16298600311042, |
| "grad_norm": 1.1875, |
| "learning_rate": 6.276463262764633e-06, |
| "loss": 0.2448, |
| "mean_token_accuracy": 0.9816835910081864, |
| "step": 2540, |
| "train/kl_loss_qwen": 0.02137654577381909, |
| "train/kl_loss_r1": 0.013053974509239197, |
| "train/total_kl": 0.03443052032962442 |
| }, |
| { |
| "epoch": 3.1692068429237947, |
| "grad_norm": 0.890625, |
| "learning_rate": 6.229763387297634e-06, |
| "loss": 0.2434, |
| "mean_token_accuracy": 0.9859046876430512, |
| "step": 2545, |
| "train/kl_loss_qwen": 0.02334826118312776, |
| "train/kl_loss_r1": 0.014492624066770076, |
| "train/total_kl": 0.037840885668993 |
| }, |
| { |
| "epoch": 3.1754276827371695, |
| "grad_norm": 0.91015625, |
| "learning_rate": 6.183063511830635e-06, |
| "loss": 0.2375, |
| "mean_token_accuracy": 0.9857018113136291, |
| "step": 2550, |
| "train/kl_loss_qwen": 0.02287781867198646, |
| "train/kl_loss_r1": 0.014699449087493122, |
| "train/total_kl": 0.03757726764306426 |
| }, |
| { |
| "epoch": 3.181648522550544, |
| "grad_norm": 0.8671875, |
| "learning_rate": 6.136363636363637e-06, |
| "loss": 0.2169, |
| "mean_token_accuracy": 0.9859404623508453, |
| "step": 2555, |
| "train/kl_loss_qwen": 0.01947087454609573, |
| "train/kl_loss_r1": 0.01351618163753301, |
| "train/total_kl": 0.03298705592751503 |
| }, |
| { |
| "epoch": 3.187869362363919, |
| "grad_norm": 1.15625, |
| "learning_rate": 6.089663760896638e-06, |
| "loss": 0.2239, |
| "mean_token_accuracy": 0.9842052280902862, |
| "step": 2560, |
| "train/kl_loss_qwen": 0.020881024189293385, |
| "train/kl_loss_r1": 0.01321516155730933, |
| "train/total_kl": 0.034096185490489005 |
| }, |
| { |
| "epoch": 3.194090202177294, |
| "grad_norm": 0.984375, |
| "learning_rate": 6.042963885429639e-06, |
| "loss": 0.2523, |
| "mean_token_accuracy": 0.9886922299861908, |
| "step": 2565, |
| "train/kl_loss_qwen": 0.025517759006470443, |
| "train/kl_loss_r1": 0.01657579594757408, |
| "train/total_kl": 0.042093554977327585 |
| }, |
| { |
| "epoch": 3.200311041990669, |
| "grad_norm": 0.94140625, |
| "learning_rate": 5.99626400996264e-06, |
| "loss": 0.2401, |
| "mean_token_accuracy": 0.984867662191391, |
| "step": 2570, |
| "train/kl_loss_qwen": 0.023075867211446166, |
| "train/kl_loss_r1": 0.013981684250757099, |
| "train/total_kl": 0.03705755146220326 |
| }, |
| { |
| "epoch": 3.2065318818040436, |
| "grad_norm": 0.94921875, |
| "learning_rate": 5.949564134495641e-06, |
| "loss": 0.2792, |
| "mean_token_accuracy": 0.9805339246988296, |
| "step": 2575, |
| "train/kl_loss_qwen": 0.025687551125884056, |
| "train/kl_loss_r1": 0.01688022376038134, |
| "train/total_kl": 0.042567774560302495 |
| }, |
| { |
| "epoch": 3.2127527216174183, |
| "grad_norm": 0.78515625, |
| "learning_rate": 5.902864259028643e-06, |
| "loss": 0.2359, |
| "mean_token_accuracy": 0.9867773085832596, |
| "step": 2580, |
| "train/kl_loss_qwen": 0.022642063442617655, |
| "train/kl_loss_r1": 0.01564873745664954, |
| "train/total_kl": 0.038290800713002685 |
| }, |
| { |
| "epoch": 3.218973561430793, |
| "grad_norm": 0.77734375, |
| "learning_rate": 5.856164383561644e-06, |
| "loss": 0.2185, |
| "mean_token_accuracy": 0.9818668901920319, |
| "step": 2585, |
| "train/kl_loss_qwen": 0.01890602051280439, |
| "train/kl_loss_r1": 0.011296134302392602, |
| "train/total_kl": 0.030202154675498603 |
| }, |
| { |
| "epoch": 3.225194401244168, |
| "grad_norm": 0.82421875, |
| "learning_rate": 5.809464508094645e-06, |
| "loss": 0.246, |
| "mean_token_accuracy": 0.9839199364185334, |
| "step": 2590, |
| "train/kl_loss_qwen": 0.025229747220873833, |
| "train/kl_loss_r1": 0.013694578688591719, |
| "train/total_kl": 0.038924325909465554 |
| }, |
| { |
| "epoch": 3.231415241057543, |
| "grad_norm": 0.97265625, |
| "learning_rate": 5.762764632627646e-06, |
| "loss": 0.2688, |
| "mean_token_accuracy": 0.9858499974012375, |
| "step": 2595, |
| "train/kl_loss_qwen": 0.026664407551288606, |
| "train/kl_loss_r1": 0.01758768109139055, |
| "train/total_kl": 0.04425208875909448 |
| }, |
| { |
| "epoch": 3.2376360808709177, |
| "grad_norm": 0.76953125, |
| "learning_rate": 5.7160647571606484e-06, |
| "loss": 0.2406, |
| "mean_token_accuracy": 0.9867913007736206, |
| "step": 2600, |
| "train/kl_loss_qwen": 0.02284672809764743, |
| "train/kl_loss_r1": 0.014909073058515788, |
| "train/total_kl": 0.03775580152869225 |
| }, |
| { |
| "epoch": 3.2438569206842924, |
| "grad_norm": 0.98828125, |
| "learning_rate": 5.669364881693649e-06, |
| "loss": 0.2292, |
| "mean_token_accuracy": 0.9871266216039658, |
| "step": 2605, |
| "train/kl_loss_qwen": 0.021353343920782208, |
| "train/kl_loss_r1": 0.013833488407544791, |
| "train/total_kl": 0.035186832677572964 |
| }, |
| { |
| "epoch": 3.250077760497667, |
| "grad_norm": 0.8359375, |
| "learning_rate": 5.62266500622665e-06, |
| "loss": 0.243, |
| "mean_token_accuracy": 0.9875899940729141, |
| "step": 2610, |
| "train/kl_loss_qwen": 0.02369601596146822, |
| "train/kl_loss_r1": 0.015644747391343118, |
| "train/total_kl": 0.03934076325967908 |
| }, |
| { |
| "epoch": 3.256298600311042, |
| "grad_norm": 0.92578125, |
| "learning_rate": 5.575965130759651e-06, |
| "loss": 0.2631, |
| "mean_token_accuracy": 0.9842116951942443, |
| "step": 2615, |
| "train/kl_loss_qwen": 0.02683533593080938, |
| "train/kl_loss_r1": 0.015043137269094587, |
| "train/total_kl": 0.04187847292050719 |
| }, |
| { |
| "epoch": 3.2625194401244166, |
| "grad_norm": 0.94140625, |
| "learning_rate": 5.529265255292652e-06, |
| "loss": 0.2267, |
| "mean_token_accuracy": 0.9818090766668319, |
| "step": 2620, |
| "train/kl_loss_qwen": 0.02027418022044003, |
| "train/kl_loss_r1": 0.011717557231895626, |
| "train/total_kl": 0.03199173752218485 |
| }, |
| { |
| "epoch": 3.2687402799377914, |
| "grad_norm": 0.828125, |
| "learning_rate": 5.482565379825654e-06, |
| "loss": 0.2873, |
| "mean_token_accuracy": 0.9823738813400269, |
| "step": 2625, |
| "train/kl_loss_qwen": 0.029073307709768414, |
| "train/kl_loss_r1": 0.016109167714603245, |
| "train/total_kl": 0.045182475447654726 |
| }, |
| { |
| "epoch": 3.2749611197511665, |
| "grad_norm": 0.9375, |
| "learning_rate": 5.435865504358655e-06, |
| "loss": 0.2492, |
| "mean_token_accuracy": 0.9855016142129898, |
| "step": 2630, |
| "train/kl_loss_qwen": 0.023096950352191926, |
| "train/kl_loss_r1": 0.015297620929777623, |
| "train/total_kl": 0.038394571375101806 |
| }, |
| { |
| "epoch": 3.2811819595645413, |
| "grad_norm": 0.921875, |
| "learning_rate": 5.389165628891657e-06, |
| "loss": 0.239, |
| "mean_token_accuracy": 0.9847406953573227, |
| "step": 2635, |
| "train/kl_loss_qwen": 0.021637895377352834, |
| "train/kl_loss_r1": 0.01458637174218893, |
| "train/total_kl": 0.03622426679357886 |
| }, |
| { |
| "epoch": 3.287402799377916, |
| "grad_norm": 0.87890625, |
| "learning_rate": 5.342465753424657e-06, |
| "loss": 0.2682, |
| "mean_token_accuracy": 0.9817533552646637, |
| "step": 2640, |
| "train/kl_loss_qwen": 0.026832366455346347, |
| "train/kl_loss_r1": 0.015036878059618175, |
| "train/total_kl": 0.041869244445115326 |
| }, |
| { |
| "epoch": 3.2936236391912908, |
| "grad_norm": 1.046875, |
| "learning_rate": 5.29576587795766e-06, |
| "loss": 0.2263, |
| "mean_token_accuracy": 0.9815866380929947, |
| "step": 2645, |
| "train/kl_loss_qwen": 0.020331070409156382, |
| "train/kl_loss_r1": 0.012977494508959353, |
| "train/total_kl": 0.03330856496468186 |
| }, |
| { |
| "epoch": 3.2998444790046655, |
| "grad_norm": 0.875, |
| "learning_rate": 5.24906600249066e-06, |
| "loss": 0.2629, |
| "mean_token_accuracy": 0.9831759363412857, |
| "step": 2650, |
| "train/kl_loss_qwen": 0.02541449787095189, |
| "train/kl_loss_r1": 0.015678114630281924, |
| "train/total_kl": 0.04109261250123382 |
| }, |
| { |
| "epoch": 3.3060653188180407, |
| "grad_norm": 1.3515625, |
| "learning_rate": 5.202366127023661e-06, |
| "loss": 0.2377, |
| "mean_token_accuracy": 0.9843966364860535, |
| "step": 2655, |
| "train/kl_loss_qwen": 0.022267935564741492, |
| "train/kl_loss_r1": 0.014039589231833816, |
| "train/total_kl": 0.03630752470344305 |
| }, |
| { |
| "epoch": 3.3122861586314154, |
| "grad_norm": 1.03125, |
| "learning_rate": 5.1556662515566625e-06, |
| "loss": 0.2288, |
| "mean_token_accuracy": 0.9853380292654037, |
| "step": 2660, |
| "train/kl_loss_qwen": 0.020760743832215666, |
| "train/kl_loss_r1": 0.013922068243846297, |
| "train/total_kl": 0.03468281263485551 |
| }, |
| { |
| "epoch": 3.31850699844479, |
| "grad_norm": 1.3046875, |
| "learning_rate": 5.108966376089663e-06, |
| "loss": 0.2746, |
| "mean_token_accuracy": 0.9855523884296418, |
| "step": 2665, |
| "train/kl_loss_qwen": 0.028636119095608592, |
| "train/kl_loss_r1": 0.016617331188172102, |
| "train/total_kl": 0.04525345005095005 |
| }, |
| { |
| "epoch": 3.324727838258165, |
| "grad_norm": 0.87890625, |
| "learning_rate": 5.062266500622666e-06, |
| "loss": 0.2796, |
| "mean_token_accuracy": 0.9843825936317444, |
| "step": 2670, |
| "train/kl_loss_qwen": 0.02719255774281919, |
| "train/kl_loss_r1": 0.01748746286612004, |
| "train/total_kl": 0.04468002058565616 |
| }, |
| { |
| "epoch": 3.3309486780715396, |
| "grad_norm": 0.890625, |
| "learning_rate": 5.015566625155666e-06, |
| "loss": 0.2395, |
| "mean_token_accuracy": 0.985189613699913, |
| "step": 2675, |
| "train/kl_loss_qwen": 0.022867527883499862, |
| "train/kl_loss_r1": 0.01357824713923037, |
| "train/total_kl": 0.03644577506929636 |
| }, |
| { |
| "epoch": 3.3371695178849143, |
| "grad_norm": 0.984375, |
| "learning_rate": 4.968866749688668e-06, |
| "loss": 0.2537, |
| "mean_token_accuracy": 0.9825487434864044, |
| "step": 2680, |
| "train/kl_loss_qwen": 0.023506175680086016, |
| "train/kl_loss_r1": 0.014184463652782142, |
| "train/total_kl": 0.03769063977524638 |
| }, |
| { |
| "epoch": 3.343390357698289, |
| "grad_norm": 0.859375, |
| "learning_rate": 4.9221668742216685e-06, |
| "loss": 0.2369, |
| "mean_token_accuracy": 0.9860921442508698, |
| "step": 2685, |
| "train/kl_loss_qwen": 0.023705671727657317, |
| "train/kl_loss_r1": 0.014161279378458857, |
| "train/total_kl": 0.03786695105955005 |
| }, |
| { |
| "epoch": 3.3496111975116643, |
| "grad_norm": 1.015625, |
| "learning_rate": 4.87546699875467e-06, |
| "loss": 0.2299, |
| "mean_token_accuracy": 0.9845267534255981, |
| "step": 2690, |
| "train/kl_loss_qwen": 0.021310369204729795, |
| "train/kl_loss_r1": 0.013280869252048433, |
| "train/total_kl": 0.03459123857319355 |
| }, |
| { |
| "epoch": 3.355832037325039, |
| "grad_norm": 0.73046875, |
| "learning_rate": 4.8287671232876716e-06, |
| "loss": 0.2275, |
| "mean_token_accuracy": 0.9860312432050705, |
| "step": 2695, |
| "train/kl_loss_qwen": 0.02123181507922709, |
| "train/kl_loss_r1": 0.013362622214481234, |
| "train/total_kl": 0.03459443720057607 |
| }, |
| { |
| "epoch": 3.3620528771384137, |
| "grad_norm": 1.0625, |
| "learning_rate": 4.782067247820672e-06, |
| "loss": 0.2565, |
| "mean_token_accuracy": 0.9833629161119462, |
| "step": 2700, |
| "train/kl_loss_qwen": 0.024914097087457777, |
| "train/kl_loss_r1": 0.013864034041762351, |
| "train/total_kl": 0.038778131082654 |
| }, |
| { |
| "epoch": 3.3682737169517885, |
| "grad_norm": 1.1015625, |
| "learning_rate": 4.735367372353674e-06, |
| "loss": 0.2274, |
| "mean_token_accuracy": 0.985034841299057, |
| "step": 2705, |
| "train/kl_loss_qwen": 0.021230686455965042, |
| "train/kl_loss_r1": 0.01340056979097426, |
| "train/total_kl": 0.03463125610724092 |
| }, |
| { |
| "epoch": 3.374494556765163, |
| "grad_norm": 1.0625, |
| "learning_rate": 4.6886674968866744e-06, |
| "loss": 0.2197, |
| "mean_token_accuracy": 0.9832078158855438, |
| "step": 2710, |
| "train/kl_loss_qwen": 0.019347388157621027, |
| "train/kl_loss_r1": 0.011695200949907303, |
| "train/total_kl": 0.031042589247226714 |
| }, |
| { |
| "epoch": 3.380715396578538, |
| "grad_norm": 0.875, |
| "learning_rate": 4.641967621419677e-06, |
| "loss": 0.2359, |
| "mean_token_accuracy": 0.9849886059761047, |
| "step": 2715, |
| "train/kl_loss_qwen": 0.022014891589060427, |
| "train/kl_loss_r1": 0.014034424582496286, |
| "train/total_kl": 0.03604931645095348 |
| }, |
| { |
| "epoch": 3.386936236391913, |
| "grad_norm": 0.87109375, |
| "learning_rate": 4.5952677459526775e-06, |
| "loss": 0.2505, |
| "mean_token_accuracy": 0.984162563085556, |
| "step": 2720, |
| "train/kl_loss_qwen": 0.02434834372252226, |
| "train/kl_loss_r1": 0.014979369170032442, |
| "train/total_kl": 0.03932771300897002 |
| }, |
| { |
| "epoch": 3.393157076205288, |
| "grad_norm": 0.8203125, |
| "learning_rate": 4.548567870485679e-06, |
| "loss": 0.2663, |
| "mean_token_accuracy": 0.984138822555542, |
| "step": 2725, |
| "train/kl_loss_qwen": 0.026038512215018274, |
| "train/kl_loss_r1": 0.015358842397108673, |
| "train/total_kl": 0.04139735447242856 |
| }, |
| { |
| "epoch": 3.3993779160186626, |
| "grad_norm": 1.046875, |
| "learning_rate": 4.50186799501868e-06, |
| "loss": 0.2214, |
| "mean_token_accuracy": 0.9856981605291366, |
| "step": 2730, |
| "train/kl_loss_qwen": 0.019446768146008254, |
| "train/kl_loss_r1": 0.012801338406279682, |
| "train/total_kl": 0.0322481069713831 |
| }, |
| { |
| "epoch": 3.4055987558320373, |
| "grad_norm": 1.1796875, |
| "learning_rate": 4.455168119551681e-06, |
| "loss": 0.2338, |
| "mean_token_accuracy": 0.9839027732610702, |
| "step": 2735, |
| "train/kl_loss_qwen": 0.02064052429050207, |
| "train/kl_loss_r1": 0.012976438086479903, |
| "train/total_kl": 0.033616962376981974 |
| }, |
| { |
| "epoch": 3.411819595645412, |
| "grad_norm": 1.0078125, |
| "learning_rate": 4.408468244084683e-06, |
| "loss": 0.2274, |
| "mean_token_accuracy": 0.9858880639076233, |
| "step": 2740, |
| "train/kl_loss_qwen": 0.020935347443446516, |
| "train/kl_loss_r1": 0.013251440855674446, |
| "train/total_kl": 0.03418678799644113 |
| }, |
| { |
| "epoch": 3.4180404354587868, |
| "grad_norm": 0.83984375, |
| "learning_rate": 4.3617683686176835e-06, |
| "loss": 0.2285, |
| "mean_token_accuracy": 0.9858361423015595, |
| "step": 2745, |
| "train/kl_loss_qwen": 0.021212745131924747, |
| "train/kl_loss_r1": 0.01365222295280546, |
| "train/total_kl": 0.03486496862024069 |
| }, |
| { |
| "epoch": 3.424261275272162, |
| "grad_norm": 1.0078125, |
| "learning_rate": 4.315068493150685e-06, |
| "loss": 0.2295, |
| "mean_token_accuracy": 0.9845366030931473, |
| "step": 2750, |
| "train/kl_loss_qwen": 0.020564079657196997, |
| "train/kl_loss_r1": 0.013706768536940217, |
| "train/total_kl": 0.034270848426967856 |
| }, |
| { |
| "epoch": 3.4304821150855367, |
| "grad_norm": 1.0078125, |
| "learning_rate": 4.2683686176836865e-06, |
| "loss": 0.225, |
| "mean_token_accuracy": 0.9845517426729202, |
| "step": 2755, |
| "train/kl_loss_qwen": 0.020470702182501556, |
| "train/kl_loss_r1": 0.013152860198169946, |
| "train/total_kl": 0.03362356275320053 |
| }, |
| { |
| "epoch": 3.4367029548989114, |
| "grad_norm": 0.8046875, |
| "learning_rate": 4.221668742216688e-06, |
| "loss": 0.2341, |
| "mean_token_accuracy": 0.984512385725975, |
| "step": 2760, |
| "train/kl_loss_qwen": 0.021487886970862746, |
| "train/kl_loss_r1": 0.013046193053014576, |
| "train/total_kl": 0.03453407995402813 |
| }, |
| { |
| "epoch": 3.442923794712286, |
| "grad_norm": 1.0625, |
| "learning_rate": 4.174968866749689e-06, |
| "loss": 0.2231, |
| "mean_token_accuracy": 0.9859201848506928, |
| "step": 2765, |
| "train/kl_loss_qwen": 0.020332144340500236, |
| "train/kl_loss_r1": 0.01277754541952163, |
| "train/total_kl": 0.033109689690172674 |
| }, |
| { |
| "epoch": 3.449144634525661, |
| "grad_norm": 1.0234375, |
| "learning_rate": 4.12826899128269e-06, |
| "loss": 0.2343, |
| "mean_token_accuracy": 0.9809245645999909, |
| "step": 2770, |
| "train/kl_loss_qwen": 0.020196593133732677, |
| "train/kl_loss_r1": 0.012610416440293194, |
| "train/total_kl": 0.03280700957402587 |
| }, |
| { |
| "epoch": 3.4553654743390356, |
| "grad_norm": 1.015625, |
| "learning_rate": 4.081569115815691e-06, |
| "loss": 0.2344, |
| "mean_token_accuracy": 0.9842493683099747, |
| "step": 2775, |
| "train/kl_loss_qwen": 0.021661369316279887, |
| "train/kl_loss_r1": 0.013402773765847087, |
| "train/total_kl": 0.03506414322182536 |
| }, |
| { |
| "epoch": 3.4615863141524104, |
| "grad_norm": 0.875, |
| "learning_rate": 4.0348692403486925e-06, |
| "loss": 0.2494, |
| "mean_token_accuracy": 0.985339805483818, |
| "step": 2780, |
| "train/kl_loss_qwen": 0.023978083208203316, |
| "train/kl_loss_r1": 0.014692715555429458, |
| "train/total_kl": 0.038670798763632774 |
| }, |
| { |
| "epoch": 3.4678071539657855, |
| "grad_norm": 0.8671875, |
| "learning_rate": 3.988169364881694e-06, |
| "loss": 0.2273, |
| "mean_token_accuracy": 0.9854962199926376, |
| "step": 2785, |
| "train/kl_loss_qwen": 0.020899151754565536, |
| "train/kl_loss_r1": 0.013141945214010775, |
| "train/total_kl": 0.03404109720140695 |
| }, |
| { |
| "epoch": 3.4740279937791603, |
| "grad_norm": 1.4609375, |
| "learning_rate": 3.941469489414695e-06, |
| "loss": 0.247, |
| "mean_token_accuracy": 0.9863706976175308, |
| "step": 2790, |
| "train/kl_loss_qwen": 0.02398818014189601, |
| "train/kl_loss_r1": 0.014264530991204083, |
| "train/total_kl": 0.038252711109817025 |
| }, |
| { |
| "epoch": 3.480248833592535, |
| "grad_norm": 0.79296875, |
| "learning_rate": 3.894769613947696e-06, |
| "loss": 0.2306, |
| "mean_token_accuracy": 0.9847693234682083, |
| "step": 2795, |
| "train/kl_loss_qwen": 0.020988399861380458, |
| "train/kl_loss_r1": 0.013396636093966663, |
| "train/total_kl": 0.03438503593206406 |
| }, |
| { |
| "epoch": 3.4864696734059097, |
| "grad_norm": 0.83984375, |
| "learning_rate": 3.848069738480698e-06, |
| "loss": 0.2387, |
| "mean_token_accuracy": 0.9844767868518829, |
| "step": 2800, |
| "train/kl_loss_qwen": 0.021816241182386877, |
| "train/kl_loss_r1": 0.014730063872411847, |
| "train/total_kl": 0.03654630491510034 |
| }, |
| { |
| "epoch": 3.4926905132192845, |
| "grad_norm": 1.078125, |
| "learning_rate": 3.801369863013699e-06, |
| "loss": 0.238, |
| "mean_token_accuracy": 0.9856153309345246, |
| "step": 2805, |
| "train/kl_loss_qwen": 0.022997609293088316, |
| "train/kl_loss_r1": 0.014218732388690114, |
| "train/total_kl": 0.037216341588646173 |
| }, |
| { |
| "epoch": 3.4989113530326597, |
| "grad_norm": 0.81640625, |
| "learning_rate": 3.7546699875467e-06, |
| "loss": 0.2414, |
| "mean_token_accuracy": 0.9863660573959351, |
| "step": 2810, |
| "train/kl_loss_qwen": 0.023191145109012722, |
| "train/kl_loss_r1": 0.014856462017633021, |
| "train/total_kl": 0.03804760677739978 |
| }, |
| { |
| "epoch": 3.505132192846034, |
| "grad_norm": 1.3046875, |
| "learning_rate": 3.707970112079701e-06, |
| "loss": 0.224, |
| "mean_token_accuracy": 0.9856793075799942, |
| "step": 2815, |
| "train/kl_loss_qwen": 0.020576135814189912, |
| "train/kl_loss_r1": 0.01223513432778418, |
| "train/total_kl": 0.032811269722878934 |
| }, |
| { |
| "epoch": 3.511353032659409, |
| "grad_norm": 1.03125, |
| "learning_rate": 3.6612702366127026e-06, |
| "loss": 0.2458, |
| "mean_token_accuracy": 0.9840625703334809, |
| "step": 2820, |
| "train/kl_loss_qwen": 0.021890020091086627, |
| "train/kl_loss_r1": 0.015305952937342226, |
| "train/total_kl": 0.03719597272574902 |
| }, |
| { |
| "epoch": 3.517573872472784, |
| "grad_norm": 0.75390625, |
| "learning_rate": 3.6145703611457037e-06, |
| "loss": 0.2366, |
| "mean_token_accuracy": 0.9833911150693894, |
| "step": 2825, |
| "train/kl_loss_qwen": 0.021799473231658338, |
| "train/kl_loss_r1": 0.013875545375049115, |
| "train/total_kl": 0.035675018839538095 |
| }, |
| { |
| "epoch": 3.5237947122861586, |
| "grad_norm": 1.15625, |
| "learning_rate": 3.567870485678705e-06, |
| "loss": 0.232, |
| "mean_token_accuracy": 0.9845116376876831, |
| "step": 2830, |
| "train/kl_loss_qwen": 0.021351216733455657, |
| "train/kl_loss_r1": 0.013609965075738728, |
| "train/total_kl": 0.034961181692779064 |
| }, |
| { |
| "epoch": 3.5300155520995333, |
| "grad_norm": 0.8515625, |
| "learning_rate": 3.5211706102117063e-06, |
| "loss": 0.2336, |
| "mean_token_accuracy": 0.9829171359539032, |
| "step": 2835, |
| "train/kl_loss_qwen": 0.02112548053264618, |
| "train/kl_loss_r1": 0.01297055478207767, |
| "train/total_kl": 0.034096034802496435 |
| }, |
| { |
| "epoch": 3.536236391912908, |
| "grad_norm": 0.97265625, |
| "learning_rate": 3.4744707347447074e-06, |
| "loss": 0.2601, |
| "mean_token_accuracy": 0.9832925647497177, |
| "step": 2840, |
| "train/kl_loss_qwen": 0.024747973820194603, |
| "train/kl_loss_r1": 0.014901431510224938, |
| "train/total_kl": 0.03964940514415503 |
| }, |
| { |
| "epoch": 3.5424572317262832, |
| "grad_norm": 0.86328125, |
| "learning_rate": 3.4277708592777085e-06, |
| "loss": 0.2468, |
| "mean_token_accuracy": 0.9836038619279861, |
| "step": 2845, |
| "train/kl_loss_qwen": 0.02415000000037253, |
| "train/kl_loss_r1": 0.014615483209490776, |
| "train/total_kl": 0.03876548307016492 |
| }, |
| { |
| "epoch": 3.548678071539658, |
| "grad_norm": 0.82421875, |
| "learning_rate": 3.38107098381071e-06, |
| "loss": 0.2488, |
| "mean_token_accuracy": 0.9870301902294158, |
| "step": 2850, |
| "train/kl_loss_qwen": 0.02544220401905477, |
| "train/kl_loss_r1": 0.015255382750183344, |
| "train/total_kl": 0.040697587002068755 |
| }, |
| { |
| "epoch": 3.5548989113530327, |
| "grad_norm": 0.87109375, |
| "learning_rate": 3.334371108343711e-06, |
| "loss": 0.2663, |
| "mean_token_accuracy": 0.9848790228366852, |
| "step": 2855, |
| "train/kl_loss_qwen": 0.02661481872200966, |
| "train/kl_loss_r1": 0.016790007473900914, |
| "train/total_kl": 0.04340482642874122 |
| }, |
| { |
| "epoch": 3.5611197511664074, |
| "grad_norm": 1.0859375, |
| "learning_rate": 3.2876712328767123e-06, |
| "loss": 0.3302, |
| "mean_token_accuracy": 0.9799584716558456, |
| "step": 2860, |
| "train/kl_loss_qwen": 0.03250132179819047, |
| "train/kl_loss_r1": 0.01764731693547219, |
| "train/total_kl": 0.05014863768592477 |
| }, |
| { |
| "epoch": 3.567340590979782, |
| "grad_norm": 0.8359375, |
| "learning_rate": 3.240971357409714e-06, |
| "loss": 0.2314, |
| "mean_token_accuracy": 0.9842890292406082, |
| "step": 2865, |
| "train/kl_loss_qwen": 0.020937564410269262, |
| "train/kl_loss_r1": 0.012288552708923817, |
| "train/total_kl": 0.033226117584854366 |
| }, |
| { |
| "epoch": 3.573561430793157, |
| "grad_norm": 5.96875, |
| "learning_rate": 3.194271481942715e-06, |
| "loss": 0.4016, |
| "mean_token_accuracy": 0.9750429719686509, |
| "step": 2870, |
| "train/kl_loss_qwen": 0.04201047793030739, |
| "train/kl_loss_r1": 0.022988221771083773, |
| "train/total_kl": 0.06499869888648391 |
| }, |
| { |
| "epoch": 3.5797822706065316, |
| "grad_norm": 2.0625, |
| "learning_rate": 3.1475716064757164e-06, |
| "loss": 0.414, |
| "mean_token_accuracy": 0.9800378859043122, |
| "step": 2875, |
| "train/kl_loss_qwen": 0.037109590321779254, |
| "train/kl_loss_r1": 0.03484028337989002, |
| "train/total_kl": 0.07194987395778299 |
| }, |
| { |
| "epoch": 3.586003110419907, |
| "grad_norm": 0.77734375, |
| "learning_rate": 3.100871731008717e-06, |
| "loss": 0.2773, |
| "mean_token_accuracy": 0.9851849496364593, |
| "step": 2880, |
| "train/kl_loss_qwen": 0.0281123923137784, |
| "train/kl_loss_r1": 0.01716474846471101, |
| "train/total_kl": 0.04527714066207409 |
| }, |
| { |
| "epoch": 3.5922239502332816, |
| "grad_norm": 1.0703125, |
| "learning_rate": 3.0541718555417186e-06, |
| "loss": 0.2348, |
| "mean_token_accuracy": 0.9836596220731735, |
| "step": 2885, |
| "train/kl_loss_qwen": 0.02031282209791243, |
| "train/kl_loss_r1": 0.01318891711998731, |
| "train/total_kl": 0.033501739241182805 |
| }, |
| { |
| "epoch": 3.5984447900466563, |
| "grad_norm": 0.828125, |
| "learning_rate": 3.0074719800747197e-06, |
| "loss": 0.2329, |
| "mean_token_accuracy": 0.9853809595108032, |
| "step": 2890, |
| "train/kl_loss_qwen": 0.021543790493160485, |
| "train/kl_loss_r1": 0.013360623200424016, |
| "train/total_kl": 0.03490441376343369 |
| }, |
| { |
| "epoch": 3.604665629860031, |
| "grad_norm": 0.93359375, |
| "learning_rate": 2.9607721046077213e-06, |
| "loss": 0.232, |
| "mean_token_accuracy": 0.9842139780521393, |
| "step": 2895, |
| "train/kl_loss_qwen": 0.019965836266055702, |
| "train/kl_loss_r1": 0.013940862705931067, |
| "train/total_kl": 0.03390669859945774 |
| }, |
| { |
| "epoch": 3.6108864696734058, |
| "grad_norm": 0.8671875, |
| "learning_rate": 2.9140722291407224e-06, |
| "loss": 0.2179, |
| "mean_token_accuracy": 0.9845876067876815, |
| "step": 2900, |
| "train/kl_loss_qwen": 0.01916212271898985, |
| "train/kl_loss_r1": 0.011550022312439978, |
| "train/total_kl": 0.030712145008146764 |
| }, |
| { |
| "epoch": 3.617107309486781, |
| "grad_norm": 0.8125, |
| "learning_rate": 2.8673723536737235e-06, |
| "loss": 0.2293, |
| "mean_token_accuracy": 0.9862509101629258, |
| "step": 2905, |
| "train/kl_loss_qwen": 0.02187169035896659, |
| "train/kl_loss_r1": 0.013140536611899734, |
| "train/total_kl": 0.03501222673803568 |
| }, |
| { |
| "epoch": 3.6233281493001557, |
| "grad_norm": 0.8359375, |
| "learning_rate": 2.820672478206725e-06, |
| "loss": 0.2403, |
| "mean_token_accuracy": 0.9864229768514633, |
| "step": 2910, |
| "train/kl_loss_qwen": 0.022343243472278118, |
| "train/kl_loss_r1": 0.014794543385505676, |
| "train/total_kl": 0.03713778667151928 |
| }, |
| { |
| "epoch": 3.6295489891135304, |
| "grad_norm": 0.9296875, |
| "learning_rate": 2.773972602739726e-06, |
| "loss": 0.2342, |
| "mean_token_accuracy": 0.9859908074140549, |
| "step": 2915, |
| "train/kl_loss_qwen": 0.020766420010477304, |
| "train/kl_loss_r1": 0.013887669052928686, |
| "train/total_kl": 0.03465408906340599 |
| }, |
| { |
| "epoch": 3.635769828926905, |
| "grad_norm": 0.93359375, |
| "learning_rate": 2.7272727272727272e-06, |
| "loss": 0.258, |
| "mean_token_accuracy": 0.9863515943288803, |
| "step": 2920, |
| "train/kl_loss_qwen": 0.026655311090871693, |
| "train/kl_loss_r1": 0.015320436703041196, |
| "train/total_kl": 0.04197574770078063 |
| }, |
| { |
| "epoch": 3.64199066874028, |
| "grad_norm": 0.87890625, |
| "learning_rate": 2.6805728518057283e-06, |
| "loss": 0.2441, |
| "mean_token_accuracy": 0.986115324497223, |
| "step": 2925, |
| "train/kl_loss_qwen": 0.023562894901260734, |
| "train/kl_loss_r1": 0.014923631912097335, |
| "train/total_kl": 0.038486526999622586 |
| }, |
| { |
| "epoch": 3.6482115085536546, |
| "grad_norm": 1.4453125, |
| "learning_rate": 2.63387297633873e-06, |
| "loss": 0.2312, |
| "mean_token_accuracy": 0.983121731877327, |
| "step": 2930, |
| "train/kl_loss_qwen": 0.021840346092358232, |
| "train/kl_loss_r1": 0.012263339408673347, |
| "train/total_kl": 0.034103685058653355 |
| }, |
| { |
| "epoch": 3.6544323483670293, |
| "grad_norm": 0.87890625, |
| "learning_rate": 2.587173100871731e-06, |
| "loss": 0.2305, |
| "mean_token_accuracy": 0.9866573423147201, |
| "step": 2935, |
| "train/kl_loss_qwen": 0.021724556758999824, |
| "train/kl_loss_r1": 0.013378932792693376, |
| "train/total_kl": 0.03510348927229643 |
| }, |
| { |
| "epoch": 3.6606531881804045, |
| "grad_norm": 0.890625, |
| "learning_rate": 2.5404732254047325e-06, |
| "loss": 0.263, |
| "mean_token_accuracy": 0.9836262166500092, |
| "step": 2940, |
| "train/kl_loss_qwen": 0.025465904222801327, |
| "train/kl_loss_r1": 0.015349965426139534, |
| "train/total_kl": 0.04081586915999651 |
| }, |
| { |
| "epoch": 3.6668740279937793, |
| "grad_norm": 0.890625, |
| "learning_rate": 2.4937733499377336e-06, |
| "loss": 0.2345, |
| "mean_token_accuracy": 0.9856616973876953, |
| "step": 2945, |
| "train/kl_loss_qwen": 0.022425138484686614, |
| "train/kl_loss_r1": 0.01358982149977237, |
| "train/total_kl": 0.036014959961175916 |
| }, |
| { |
| "epoch": 3.673094867807154, |
| "grad_norm": 0.94921875, |
| "learning_rate": 2.447073474470735e-06, |
| "loss": 0.275, |
| "mean_token_accuracy": 0.9830880254507065, |
| "step": 2950, |
| "train/kl_loss_qwen": 0.02608721745200455, |
| "train/kl_loss_r1": 0.015567693463526665, |
| "train/total_kl": 0.04165491117164492 |
| }, |
| { |
| "epoch": 3.6793157076205287, |
| "grad_norm": 1.03125, |
| "learning_rate": 2.4003735990037362e-06, |
| "loss": 0.2202, |
| "mean_token_accuracy": 0.9819297671318055, |
| "step": 2955, |
| "train/kl_loss_qwen": 0.018545484030619265, |
| "train/kl_loss_r1": 0.011856895894743502, |
| "train/total_kl": 0.030402379855513573 |
| }, |
| { |
| "epoch": 3.6855365474339035, |
| "grad_norm": 0.86328125, |
| "learning_rate": 2.353673723536737e-06, |
| "loss": 0.2471, |
| "mean_token_accuracy": 0.9828756898641586, |
| "step": 2960, |
| "train/kl_loss_qwen": 0.022580026322975753, |
| "train/kl_loss_r1": 0.013090070732869209, |
| "train/total_kl": 0.03567009726539254 |
| }, |
| { |
| "epoch": 3.6917573872472786, |
| "grad_norm": 0.90625, |
| "learning_rate": 2.3069738480697384e-06, |
| "loss": 0.2389, |
| "mean_token_accuracy": 0.9842888534069061, |
| "step": 2965, |
| "train/kl_loss_qwen": 0.021884618513286113, |
| "train/kl_loss_r1": 0.014056896232068539, |
| "train/total_kl": 0.035941514931619165 |
| }, |
| { |
| "epoch": 3.697978227060653, |
| "grad_norm": 1.40625, |
| "learning_rate": 2.2602739726027396e-06, |
| "loss": 0.25, |
| "mean_token_accuracy": 0.9838718444108963, |
| "step": 2970, |
| "train/kl_loss_qwen": 0.023744882782921195, |
| "train/kl_loss_r1": 0.014738423796370626, |
| "train/total_kl": 0.038483306765556335 |
| }, |
| { |
| "epoch": 3.704199066874028, |
| "grad_norm": 1.0390625, |
| "learning_rate": 2.213574097135741e-06, |
| "loss": 0.2358, |
| "mean_token_accuracy": 0.9839303970336915, |
| "step": 2975, |
| "train/kl_loss_qwen": 0.02131864381954074, |
| "train/kl_loss_r1": 0.014065050520002842, |
| "train/total_kl": 0.03538369433954358 |
| }, |
| { |
| "epoch": 3.710419906687403, |
| "grad_norm": 0.80078125, |
| "learning_rate": 2.166874221668742e-06, |
| "loss": 0.2444, |
| "mean_token_accuracy": 0.9859850376844406, |
| "step": 2980, |
| "train/kl_loss_qwen": 0.023973260773345828, |
| "train/kl_loss_r1": 0.014935575192794204, |
| "train/total_kl": 0.03890883605927229 |
| }, |
| { |
| "epoch": 3.7166407465007776, |
| "grad_norm": 1.03125, |
| "learning_rate": 2.1201743462017437e-06, |
| "loss": 0.2339, |
| "mean_token_accuracy": 0.9822094053030014, |
| "step": 2985, |
| "train/kl_loss_qwen": 0.020026676869019867, |
| "train/kl_loss_r1": 0.012334840325638651, |
| "train/total_kl": 0.032361517008394 |
| }, |
| { |
| "epoch": 3.7228615863141523, |
| "grad_norm": 0.921875, |
| "learning_rate": 2.073474470734745e-06, |
| "loss": 0.22, |
| "mean_token_accuracy": 0.9863646864891052, |
| "step": 2990, |
| "train/kl_loss_qwen": 0.0210922843310982, |
| "train/kl_loss_r1": 0.012671014782972634, |
| "train/total_kl": 0.033763298857957126 |
| }, |
| { |
| "epoch": 3.729082426127527, |
| "grad_norm": 0.8828125, |
| "learning_rate": 2.0267745952677463e-06, |
| "loss": 0.2267, |
| "mean_token_accuracy": 0.9849774003028869, |
| "step": 2995, |
| "train/kl_loss_qwen": 0.021177000598981977, |
| "train/kl_loss_r1": 0.01177487033419311, |
| "train/total_kl": 0.03295187065377832 |
| }, |
| { |
| "epoch": 3.7353032659409022, |
| "grad_norm": 0.8828125, |
| "learning_rate": 1.9800747198007475e-06, |
| "loss": 0.2236, |
| "mean_token_accuracy": 0.9847380638122558, |
| "step": 3000, |
| "train/kl_loss_qwen": 0.019074604008346797, |
| "train/kl_loss_r1": 0.013245354662649334, |
| "train/total_kl": 0.03231995878741145 |
| }, |
| { |
| "epoch": 3.741524105754277, |
| "grad_norm": 0.8671875, |
| "learning_rate": 1.933374844333748e-06, |
| "loss": 0.3323, |
| "mean_token_accuracy": 0.9824711471796036, |
| "step": 3005, |
| "train/kl_loss_qwen": 0.03514354228973389, |
| "train/kl_loss_r1": 0.02021597446873784, |
| "train/total_kl": 0.05535951666533947 |
| }, |
| { |
| "epoch": 3.7477449455676517, |
| "grad_norm": 0.85546875, |
| "learning_rate": 1.8866749688667499e-06, |
| "loss": 0.2289, |
| "mean_token_accuracy": 0.9856206774711609, |
| "step": 3010, |
| "train/kl_loss_qwen": 0.021088129049167036, |
| "train/kl_loss_r1": 0.013338046660646797, |
| "train/total_kl": 0.03442617561668158 |
| }, |
| { |
| "epoch": 3.7539657853810264, |
| "grad_norm": 0.87890625, |
| "learning_rate": 1.839975093399751e-06, |
| "loss": 0.4054, |
| "mean_token_accuracy": 0.9761894792318344, |
| "step": 3015, |
| "train/kl_loss_qwen": 0.043745915545150636, |
| "train/kl_loss_r1": 0.021301075490191577, |
| "train/total_kl": 0.06504699122160673 |
| }, |
| { |
| "epoch": 3.760186625194401, |
| "grad_norm": 0.87109375, |
| "learning_rate": 1.7932752179327523e-06, |
| "loss": 0.2172, |
| "mean_token_accuracy": 0.9812994867563247, |
| "step": 3020, |
| "train/kl_loss_qwen": 0.018437253870069982, |
| "train/kl_loss_r1": 0.010920788859948516, |
| "train/total_kl": 0.02935804296284914 |
| }, |
| { |
| "epoch": 3.766407465007776, |
| "grad_norm": 1.0546875, |
| "learning_rate": 1.7465753424657534e-06, |
| "loss": 0.2311, |
| "mean_token_accuracy": 0.9857212871313095, |
| "step": 3025, |
| "train/kl_loss_qwen": 0.0210646481718868, |
| "train/kl_loss_r1": 0.014203881798312067, |
| "train/total_kl": 0.035268529783934355 |
| }, |
| { |
| "epoch": 3.7726283048211506, |
| "grad_norm": 0.84765625, |
| "learning_rate": 1.6998754669987547e-06, |
| "loss": 0.2289, |
| "mean_token_accuracy": 0.9842836320400238, |
| "step": 3030, |
| "train/kl_loss_qwen": 0.02159463716670871, |
| "train/kl_loss_r1": 0.012302979337982833, |
| "train/total_kl": 0.03389761624857783 |
| }, |
| { |
| "epoch": 3.778849144634526, |
| "grad_norm": 0.79296875, |
| "learning_rate": 1.6531755915317558e-06, |
| "loss": 0.2267, |
| "mean_token_accuracy": 0.9854977697134018, |
| "step": 3035, |
| "train/kl_loss_qwen": 0.020470092073082924, |
| "train/kl_loss_r1": 0.013319645705632866, |
| "train/total_kl": 0.03378973761573434 |
| }, |
| { |
| "epoch": 3.7850699844479005, |
| "grad_norm": 0.953125, |
| "learning_rate": 1.6064757160647571e-06, |
| "loss": 0.2509, |
| "mean_token_accuracy": 0.9862113922834397, |
| "step": 3040, |
| "train/kl_loss_qwen": 0.0245562803465873, |
| "train/kl_loss_r1": 0.015157862054184078, |
| "train/total_kl": 0.03971414268016815 |
| }, |
| { |
| "epoch": 3.7912908242612753, |
| "grad_norm": 0.82421875, |
| "learning_rate": 1.5597758405977585e-06, |
| "loss": 0.2228, |
| "mean_token_accuracy": 0.9858496934175491, |
| "step": 3045, |
| "train/kl_loss_qwen": 0.020629500132054092, |
| "train/kl_loss_r1": 0.013019497063942254, |
| "train/total_kl": 0.03364899717271328 |
| }, |
| { |
| "epoch": 3.79751166407465, |
| "grad_norm": 1.0625, |
| "learning_rate": 1.5130759651307598e-06, |
| "loss": 0.2332, |
| "mean_token_accuracy": 0.9846426278352738, |
| "step": 3050, |
| "train/kl_loss_qwen": 0.021104606799781322, |
| "train/kl_loss_r1": 0.013108310452662409, |
| "train/total_kl": 0.0342129172757268 |
| }, |
| { |
| "epoch": 3.8037325038880248, |
| "grad_norm": 0.875, |
| "learning_rate": 1.4663760896637609e-06, |
| "loss": 0.2584, |
| "mean_token_accuracy": 0.9858539253473282, |
| "step": 3055, |
| "train/kl_loss_qwen": 0.025427423184737563, |
| "train/kl_loss_r1": 0.016527001629583538, |
| "train/total_kl": 0.04195442469790578 |
| }, |
| { |
| "epoch": 3.8099533437014, |
| "grad_norm": 0.95703125, |
| "learning_rate": 1.4196762141967622e-06, |
| "loss": 0.2181, |
| "mean_token_accuracy": 0.9840226501226426, |
| "step": 3060, |
| "train/kl_loss_qwen": 0.01866429247893393, |
| "train/kl_loss_r1": 0.012438310799188912, |
| "train/total_kl": 0.03110260358080268 |
| }, |
| { |
| "epoch": 3.816174183514774, |
| "grad_norm": 1.0234375, |
| "learning_rate": 1.3729763387297635e-06, |
| "loss": 0.2452, |
| "mean_token_accuracy": 0.9825713008642196, |
| "step": 3065, |
| "train/kl_loss_qwen": 0.02215881203301251, |
| "train/kl_loss_r1": 0.013574238121509551, |
| "train/total_kl": 0.035733049549162385 |
| }, |
| { |
| "epoch": 3.8223950233281494, |
| "grad_norm": 0.92578125, |
| "learning_rate": 1.3262764632627648e-06, |
| "loss": 0.2237, |
| "mean_token_accuracy": 0.9860330015420914, |
| "step": 3070, |
| "train/kl_loss_qwen": 0.020841342536732553, |
| "train/kl_loss_r1": 0.012603346444666385, |
| "train/total_kl": 0.03344468884170056 |
| }, |
| { |
| "epoch": 3.828615863141524, |
| "grad_norm": 0.8828125, |
| "learning_rate": 1.2795765877957657e-06, |
| "loss": 0.2413, |
| "mean_token_accuracy": 0.9861990302801132, |
| "step": 3075, |
| "train/kl_loss_qwen": 0.023467224929481743, |
| "train/kl_loss_r1": 0.014058938180096448, |
| "train/total_kl": 0.03752616299316287 |
| }, |
| { |
| "epoch": 3.834836702954899, |
| "grad_norm": 0.85546875, |
| "learning_rate": 1.232876712328767e-06, |
| "loss": 0.2327, |
| "mean_token_accuracy": 0.9857694715261459, |
| "step": 3080, |
| "train/kl_loss_qwen": 0.021740892436355352, |
| "train/kl_loss_r1": 0.013577925111167132, |
| "train/total_kl": 0.03531881738454103 |
| }, |
| { |
| "epoch": 3.8410575427682736, |
| "grad_norm": 1.03125, |
| "learning_rate": 1.1861768368617684e-06, |
| "loss": 0.2356, |
| "mean_token_accuracy": 0.9867552161216736, |
| "step": 3085, |
| "train/kl_loss_qwen": 0.021518895542249082, |
| "train/kl_loss_r1": 0.014279638021253049, |
| "train/total_kl": 0.03579853363335132 |
| }, |
| { |
| "epoch": 3.8472783825816483, |
| "grad_norm": 1.140625, |
| "learning_rate": 1.1394769613947697e-06, |
| "loss": 0.2505, |
| "mean_token_accuracy": 0.9849425464868545, |
| "step": 3090, |
| "train/kl_loss_qwen": 0.023463033000007273, |
| "train/kl_loss_r1": 0.015782216051593422, |
| "train/total_kl": 0.03924524867907166 |
| }, |
| { |
| "epoch": 3.8534992223950235, |
| "grad_norm": 0.82421875, |
| "learning_rate": 1.0927770859277708e-06, |
| "loss": 0.4111, |
| "mean_token_accuracy": 0.9756690293550492, |
| "step": 3095, |
| "train/kl_loss_qwen": 0.04434741260483861, |
| "train/kl_loss_r1": 0.02056443770416081, |
| "train/total_kl": 0.0649118491448462 |
| }, |
| { |
| "epoch": 3.8597200622083983, |
| "grad_norm": 0.9140625, |
| "learning_rate": 1.046077210460772e-06, |
| "loss": 0.2567, |
| "mean_token_accuracy": 0.9853157699108124, |
| "step": 3100, |
| "train/kl_loss_qwen": 0.026550929993391037, |
| "train/kl_loss_r1": 0.015549480146728457, |
| "train/total_kl": 0.04210041025653481 |
| }, |
| { |
| "epoch": 3.865940902021773, |
| "grad_norm": 0.98828125, |
| "learning_rate": 9.993773349937734e-07, |
| "loss": 0.25, |
| "mean_token_accuracy": 0.9842557400465012, |
| "step": 3105, |
| "train/kl_loss_qwen": 0.022726377053186298, |
| "train/kl_loss_r1": 0.01626164559274912, |
| "train/total_kl": 0.038988023158162834 |
| }, |
| { |
| "epoch": 3.8721617418351477, |
| "grad_norm": 0.7734375, |
| "learning_rate": 9.526774595267746e-07, |
| "loss": 0.2306, |
| "mean_token_accuracy": 0.9841700613498687, |
| "step": 3110, |
| "train/kl_loss_qwen": 0.02183036059141159, |
| "train/kl_loss_r1": 0.012751943548209965, |
| "train/total_kl": 0.034582304395735265 |
| }, |
| { |
| "epoch": 3.8783825816485225, |
| "grad_norm": 0.9453125, |
| "learning_rate": 9.059775840597758e-07, |
| "loss": 0.2701, |
| "mean_token_accuracy": 0.984642618894577, |
| "step": 3115, |
| "train/kl_loss_qwen": 0.02554837050847709, |
| "train/kl_loss_r1": 0.016179563431069254, |
| "train/total_kl": 0.041727933939546345 |
| }, |
| { |
| "epoch": 3.8846034214618976, |
| "grad_norm": 0.98828125, |
| "learning_rate": 8.592777085927771e-07, |
| "loss": 0.219, |
| "mean_token_accuracy": 0.9848039954900741, |
| "step": 3120, |
| "train/kl_loss_qwen": 0.018509938986971973, |
| "train/kl_loss_r1": 0.013476863643154502, |
| "train/total_kl": 0.03198680253699422 |
| }, |
| { |
| "epoch": 3.890824261275272, |
| "grad_norm": 0.828125, |
| "learning_rate": 8.125778331257784e-07, |
| "loss": 0.3768, |
| "mean_token_accuracy": 0.9785630255937576, |
| "step": 3125, |
| "train/kl_loss_qwen": 0.03686713627539575, |
| "train/kl_loss_r1": 0.024776964401826262, |
| "train/total_kl": 0.06164409937337041 |
| }, |
| { |
| "epoch": 3.897045101088647, |
| "grad_norm": 0.99609375, |
| "learning_rate": 7.658779576587797e-07, |
| "loss": 0.2351, |
| "mean_token_accuracy": 0.9840314447879791, |
| "step": 3130, |
| "train/kl_loss_qwen": 0.022078597731888295, |
| "train/kl_loss_r1": 0.013947232184000314, |
| "train/total_kl": 0.03602582989260554 |
| }, |
| { |
| "epoch": 3.903265940902022, |
| "grad_norm": 0.9296875, |
| "learning_rate": 7.191780821917808e-07, |
| "loss": 0.232, |
| "mean_token_accuracy": 0.9858786344528199, |
| "step": 3135, |
| "train/kl_loss_qwen": 0.02128533157519996, |
| "train/kl_loss_r1": 0.01425166679546237, |
| "train/total_kl": 0.0355369983240962 |
| }, |
| { |
| "epoch": 3.9094867807153966, |
| "grad_norm": 0.92578125, |
| "learning_rate": 6.724782067247821e-07, |
| "loss": 0.2524, |
| "mean_token_accuracy": 0.9848507881164551, |
| "step": 3140, |
| "train/kl_loss_qwen": 0.02394880629144609, |
| "train/kl_loss_r1": 0.015210675774142146, |
| "train/total_kl": 0.03915948234498501 |
| }, |
| { |
| "epoch": 3.9157076205287713, |
| "grad_norm": 0.78125, |
| "learning_rate": 6.257783312577833e-07, |
| "loss": 0.2599, |
| "mean_token_accuracy": 0.9854637980461121, |
| "step": 3145, |
| "train/kl_loss_qwen": 0.02829183344729245, |
| "train/kl_loss_r1": 0.013507619872689247, |
| "train/total_kl": 0.04179945318028331 |
| }, |
| { |
| "epoch": 3.921928460342146, |
| "grad_norm": 0.75, |
| "learning_rate": 5.790784557907846e-07, |
| "loss": 0.2671, |
| "mean_token_accuracy": 0.9863925516605377, |
| "step": 3150, |
| "train/kl_loss_qwen": 0.027312430460005997, |
| "train/kl_loss_r1": 0.01701681511476636, |
| "train/total_kl": 0.044329245761036876 |
| }, |
| { |
| "epoch": 3.928149300155521, |
| "grad_norm": 0.8203125, |
| "learning_rate": 5.323785803237859e-07, |
| "loss": 0.3209, |
| "mean_token_accuracy": 0.97878338098526, |
| "step": 3155, |
| "train/kl_loss_qwen": 0.03283619345165789, |
| "train/kl_loss_r1": 0.017961669899523258, |
| "train/total_kl": 0.05079786339774728 |
| }, |
| { |
| "epoch": 3.934370139968896, |
| "grad_norm": 1.15625, |
| "learning_rate": 4.856787048567871e-07, |
| "loss": 0.2415, |
| "mean_token_accuracy": 0.9832513570785523, |
| "step": 3160, |
| "train/kl_loss_qwen": 0.02150732106529176, |
| "train/kl_loss_r1": 0.014138684188947082, |
| "train/total_kl": 0.035646005533635616 |
| }, |
| { |
| "epoch": 3.9405909797822707, |
| "grad_norm": 0.78515625, |
| "learning_rate": 4.389788293897883e-07, |
| "loss": 0.3302, |
| "mean_token_accuracy": 0.9821478694677352, |
| "step": 3165, |
| "train/kl_loss_qwen": 0.035413914173841474, |
| "train/kl_loss_r1": 0.019884266471490265, |
| "train/total_kl": 0.05529817976057529 |
| }, |
| { |
| "epoch": 3.9468118195956454, |
| "grad_norm": 0.8046875, |
| "learning_rate": 3.9227895392278954e-07, |
| "loss": 0.2315, |
| "mean_token_accuracy": 0.9847661107778549, |
| "step": 3170, |
| "train/kl_loss_qwen": 0.021044514747336505, |
| "train/kl_loss_r1": 0.01309770722873509, |
| "train/total_kl": 0.03414222216233611 |
| }, |
| { |
| "epoch": 3.95303265940902, |
| "grad_norm": 1.0859375, |
| "learning_rate": 3.4557907845579075e-07, |
| "loss": 0.3341, |
| "mean_token_accuracy": 0.9789846986532211, |
| "step": 3175, |
| "train/kl_loss_qwen": 0.03371955840848386, |
| "train/kl_loss_r1": 0.017813174077309667, |
| "train/total_kl": 0.05153273269534111 |
| }, |
| { |
| "epoch": 3.959253499222395, |
| "grad_norm": 0.9296875, |
| "learning_rate": 2.98879202988792e-07, |
| "loss": 0.2994, |
| "mean_token_accuracy": 0.9830943882465363, |
| "step": 3180, |
| "train/kl_loss_qwen": 0.033274567080661656, |
| "train/kl_loss_r1": 0.015842707734555005, |
| "train/total_kl": 0.04911727402359247 |
| }, |
| { |
| "epoch": 3.9654743390357696, |
| "grad_norm": 1.265625, |
| "learning_rate": 2.521793275217933e-07, |
| "loss": 0.2351, |
| "mean_token_accuracy": 0.984268057346344, |
| "step": 3185, |
| "train/kl_loss_qwen": 0.021436449000611903, |
| "train/kl_loss_r1": 0.014701427333056927, |
| "train/total_kl": 0.03613787675276399 |
| }, |
| { |
| "epoch": 3.971695178849145, |
| "grad_norm": 0.85546875, |
| "learning_rate": 2.0547945205479452e-07, |
| "loss": 0.2427, |
| "mean_token_accuracy": 0.9866203486919403, |
| "step": 3190, |
| "train/kl_loss_qwen": 0.02276371791958809, |
| "train/kl_loss_r1": 0.015056712529622018, |
| "train/total_kl": 0.03782043047249317 |
| }, |
| { |
| "epoch": 3.9779160186625195, |
| "grad_norm": 0.75390625, |
| "learning_rate": 1.5877957658779578e-07, |
| "loss": 0.2355, |
| "mean_token_accuracy": 0.9860924631357193, |
| "step": 3195, |
| "train/kl_loss_qwen": 0.022292080451734364, |
| "train/kl_loss_r1": 0.01344187636859715, |
| "train/total_kl": 0.035733957309275866 |
| }, |
| { |
| "epoch": 3.9841368584758943, |
| "grad_norm": 0.8515625, |
| "learning_rate": 1.1207970112079702e-07, |
| "loss": 0.2508, |
| "mean_token_accuracy": 0.985159307718277, |
| "step": 3200, |
| "train/kl_loss_qwen": 0.02407874008640647, |
| "train/kl_loss_r1": 0.015484006190672518, |
| "train/total_kl": 0.039562746044248344 |
| }, |
| { |
| "epoch": 3.990357698289269, |
| "grad_norm": 0.80078125, |
| "learning_rate": 6.537982565379826e-08, |
| "loss": 0.2122, |
| "mean_token_accuracy": 0.9835577666759491, |
| "step": 3205, |
| "train/kl_loss_qwen": 0.018145430739969014, |
| "train/kl_loss_r1": 0.011138362321071326, |
| "train/total_kl": 0.029283793363720178 |
| }, |
| { |
| "epoch": 3.9965785381026437, |
| "grad_norm": 0.90234375, |
| "learning_rate": 1.86799501867995e-08, |
| "loss": 0.2528, |
| "mean_token_accuracy": 0.9819873452186585, |
| "step": 3210, |
| "train/kl_loss_qwen": 0.023181884456425904, |
| "train/kl_loss_r1": 0.01377418297342956, |
| "train/total_kl": 0.03695606719702482 |
| } |
| ], |
| "logging_steps": 5, |
| "max_steps": 3212, |
| "num_input_tokens_seen": 0, |
| "num_train_epochs": 4, |
| "save_steps": 500, |
| "stateful_callbacks": { |
| "TrainerControl": { |
| "args": { |
| "should_epoch_stop": false, |
| "should_evaluate": false, |
| "should_log": false, |
| "should_save": true, |
| "should_training_stop": true |
| }, |
| "attributes": {} |
| } |
| }, |
| "total_flos": 1.0794727176859484e+18, |
| "train_batch_size": 2, |
| "trial_name": null, |
| "trial_params": null |
| } |
|
|