{ "best_metric": null, "best_model_checkpoint": null, "epoch": 1.0, "eval_steps": 500, "global_step": 1088, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "epoch": 0.004595588235294118, "grad_norm": 75.5, "learning_rate": 2.9965533088235297e-05, "loss": 7.523, "mean_token_accuracy": 0.656203106045723, "step": 5, "train/kl_loss_qwen": 1.0067849405109883, "train/kl_loss_r1": 0.4999275255157499, "train/total_kl": 1.5067124910652638 }, { "epoch": 0.009191176470588236, "grad_norm": 29.125, "learning_rate": 2.993106617647059e-05, "loss": 5.5883, "mean_token_accuracy": 0.7142428308725357, "step": 10, "train/kl_loss_qwen": 0.7231092929840088, "train/kl_loss_r1": 0.4078650489449501, "train/total_kl": 1.13097435683012 }, { "epoch": 0.013786764705882353, "grad_norm": 38.75, "learning_rate": 2.9896599264705885e-05, "loss": 4.3, "mean_token_accuracy": 0.7153706133365632, "step": 15, "train/kl_loss_qwen": 0.542685666680336, "train/kl_loss_r1": 0.2508307069540024, "train/total_kl": 0.7935163721442222 }, { "epoch": 0.01838235294117647, "grad_norm": 14.5, "learning_rate": 2.9862132352941178e-05, "loss": 3.2403, "mean_token_accuracy": 0.7293514549732208, "step": 20, "train/kl_loss_qwen": 0.3540587030351162, "train/kl_loss_r1": 0.18121434897184371, "train/total_kl": 0.5352730460464954 }, { "epoch": 0.02297794117647059, "grad_norm": 13.4375, "learning_rate": 2.982766544117647e-05, "loss": 3.1363, "mean_token_accuracy": 0.7384833335876465, "step": 25, "train/kl_loss_qwen": 0.3636454150080681, "train/kl_loss_r1": 0.15524634066969156, "train/total_kl": 0.5188917614519596 }, { "epoch": 0.027573529411764705, "grad_norm": 19.25, "learning_rate": 2.9793198529411766e-05, "loss": 4.2733, "mean_token_accuracy": 0.7523588448762893, "step": 30, "train/kl_loss_qwen": 0.5658364623785019, "train/kl_loss_r1": 0.27777326982468364, "train/total_kl": 0.843609730899334 }, { "epoch": 0.03216911764705882, "grad_norm": 31.5, "learning_rate": 2.975873161764706e-05, "loss": 3.7129, "mean_token_accuracy": 0.7343137323856354, "step": 35, "train/kl_loss_qwen": 0.4348488930612803, "train/kl_loss_r1": 0.2575880441814661, "train/total_kl": 0.6924369387328625 }, { "epoch": 0.03676470588235294, "grad_norm": 8.25, "learning_rate": 2.9724264705882355e-05, "loss": 2.7708, "mean_token_accuracy": 0.728923574090004, "step": 40, "train/kl_loss_qwen": 0.2851369768381119, "train/kl_loss_r1": 0.13467254638671874, "train/total_kl": 0.419809527695179 }, { "epoch": 0.04136029411764706, "grad_norm": 9.0625, "learning_rate": 2.9689797794117647e-05, "loss": 3.1069, "mean_token_accuracy": 0.7631141632795334, "step": 45, "train/kl_loss_qwen": 0.3510517507791519, "train/kl_loss_r1": 0.16951459292322396, "train/total_kl": 0.5205663420259953 }, { "epoch": 0.04595588235294118, "grad_norm": 20.5, "learning_rate": 2.9655330882352943e-05, "loss": 2.9952, "mean_token_accuracy": 0.7505580186843872, "step": 50, "train/kl_loss_qwen": 0.3157908026129007, "train/kl_loss_r1": 0.15686270054429768, "train/total_kl": 0.4726535022258759 }, { "epoch": 0.050551470588235295, "grad_norm": 6.65625, "learning_rate": 2.9620863970588236e-05, "loss": 2.8788, "mean_token_accuracy": 0.7706852316856384, "step": 55, "train/kl_loss_qwen": 0.2879650827497244, "train/kl_loss_r1": 0.16403407491743566, "train/total_kl": 0.45199914574623107 }, { "epoch": 0.05514705882352941, "grad_norm": 41.5, "learning_rate": 2.958639705882353e-05, "loss": 4.1419, "mean_token_accuracy": 0.7634413212537765, "step": 60, "train/kl_loss_qwen": 0.5039678934961558, "train/kl_loss_r1": 0.3037068540230393, "train/total_kl": 0.8076747469604015 }, { "epoch": 0.05974264705882353, "grad_norm": 8.8125, "learning_rate": 2.9551930147058824e-05, "loss": 2.847, "mean_token_accuracy": 0.7341876327991486, "step": 65, "train/kl_loss_qwen": 0.296791860088706, "train/kl_loss_r1": 0.16430705823004246, "train/total_kl": 0.4610989138484001 }, { "epoch": 0.06433823529411764, "grad_norm": 11.5, "learning_rate": 2.9517463235294117e-05, "loss": 2.524, "mean_token_accuracy": 0.747851875424385, "step": 70, "train/kl_loss_qwen": 0.23588257953524588, "train/kl_loss_r1": 0.12017320897430181, "train/total_kl": 0.3560557886958122 }, { "epoch": 0.06893382352941177, "grad_norm": 6.8125, "learning_rate": 2.9482996323529412e-05, "loss": 2.638, "mean_token_accuracy": 0.7645364701747894, "step": 75, "train/kl_loss_qwen": 0.2567322202026844, "train/kl_loss_r1": 0.138734588958323, "train/total_kl": 0.3954668059945107 }, { "epoch": 0.07352941176470588, "grad_norm": 7.84375, "learning_rate": 2.9448529411764705e-05, "loss": 3.5239, "mean_token_accuracy": 0.760419961810112, "step": 80, "train/kl_loss_qwen": 0.4126748025417328, "train/kl_loss_r1": 0.2278809394687414, "train/total_kl": 0.640555739402771 }, { "epoch": 0.078125, "grad_norm": 18.875, "learning_rate": 2.94140625e-05, "loss": 4.2956, "mean_token_accuracy": 0.7762624591588974, "step": 85, "train/kl_loss_qwen": 0.5349518846720457, "train/kl_loss_r1": 0.3311561655253172, "train/total_kl": 0.8661080494523048 }, { "epoch": 0.08272058823529412, "grad_norm": 47.0, "learning_rate": 2.9379595588235297e-05, "loss": 3.2597, "mean_token_accuracy": 0.7334744036197662, "step": 90, "train/kl_loss_qwen": 0.3614440344274044, "train/kl_loss_r1": 0.20499854441732168, "train/total_kl": 0.5664425753057003 }, { "epoch": 0.08731617647058823, "grad_norm": 11.9375, "learning_rate": 2.934512867647059e-05, "loss": 3.0669, "mean_token_accuracy": 0.7597341448068619, "step": 95, "train/kl_loss_qwen": 0.3339898385107517, "train/kl_loss_r1": 0.19944773185998202, "train/total_kl": 0.5334375720471144 }, { "epoch": 0.09191176470588236, "grad_norm": 12.0, "learning_rate": 2.9310661764705885e-05, "loss": 2.4843, "mean_token_accuracy": 0.7619072079658509, "step": 100, "train/kl_loss_qwen": 0.22200208008289338, "train/kl_loss_r1": 0.13626624476164578, "train/total_kl": 0.35826832354068755 }, { "epoch": 0.09650735294117647, "grad_norm": 23.375, "learning_rate": 2.9276194852941174e-05, "loss": 2.7679, "mean_token_accuracy": 0.7749551564455033, "step": 105, "train/kl_loss_qwen": 0.27624217644333837, "train/kl_loss_r1": 0.17033643070608379, "train/total_kl": 0.4465786039829254 }, { "epoch": 0.10110294117647059, "grad_norm": 11.6875, "learning_rate": 2.924172794117647e-05, "loss": 3.3113, "mean_token_accuracy": 0.7359262406826019, "step": 110, "train/kl_loss_qwen": 0.386141000315547, "train/kl_loss_r1": 0.20178384203463792, "train/total_kl": 0.5879248447716237 }, { "epoch": 0.1056985294117647, "grad_norm": 10.375, "learning_rate": 2.9207261029411766e-05, "loss": 4.194, "mean_token_accuracy": 0.740036615729332, "step": 115, "train/kl_loss_qwen": 0.5264142207801342, "train/kl_loss_r1": 0.2895144520327449, "train/total_kl": 0.8159286729991436 }, { "epoch": 0.11029411764705882, "grad_norm": 51.5, "learning_rate": 2.917279411764706e-05, "loss": 4.3143, "mean_token_accuracy": 0.7599226355552673, "step": 120, "train/kl_loss_qwen": 0.5216624522581697, "train/kl_loss_r1": 0.3390774505212903, "train/total_kl": 0.8607399154454469 }, { "epoch": 0.11488970588235294, "grad_norm": 13.0, "learning_rate": 2.9138327205882355e-05, "loss": 3.973, "mean_token_accuracy": 0.756134757399559, "step": 125, "train/kl_loss_qwen": 0.48524228297173977, "train/kl_loss_r1": 0.27532588355243204, "train/total_kl": 0.7605681672692299 }, { "epoch": 0.11948529411764706, "grad_norm": 24.375, "learning_rate": 2.9103860294117647e-05, "loss": 3.3751, "mean_token_accuracy": 0.7322900414466857, "step": 130, "train/kl_loss_qwen": 0.3569587718695402, "train/kl_loss_r1": 0.2533737229183316, "train/total_kl": 0.6103324957191945 }, { "epoch": 0.12408088235294118, "grad_norm": 15.25, "learning_rate": 2.9069393382352943e-05, "loss": 3.8036, "mean_token_accuracy": 0.7421320974826813, "step": 135, "train/kl_loss_qwen": 0.45374844707548617, "train/kl_loss_r1": 0.2738330475986004, "train/total_kl": 0.7275814957916736 }, { "epoch": 0.12867647058823528, "grad_norm": 5.75, "learning_rate": 2.9034926470588236e-05, "loss": 2.95, "mean_token_accuracy": 0.745361715555191, "step": 140, "train/kl_loss_qwen": 0.3025351382791996, "train/kl_loss_r1": 0.17302710115909575, "train/total_kl": 0.4755622450262308 }, { "epoch": 0.1332720588235294, "grad_norm": 33.0, "learning_rate": 2.900045955882353e-05, "loss": 4.0155, "mean_token_accuracy": 0.7763338893651962, "step": 145, "train/kl_loss_qwen": 0.5002008650451899, "train/kl_loss_r1": 0.2966492097824812, "train/total_kl": 0.7968500778079033 }, { "epoch": 0.13786764705882354, "grad_norm": 13.75, "learning_rate": 2.8965992647058824e-05, "loss": 3.1621, "mean_token_accuracy": 0.7467743963003158, "step": 150, "train/kl_loss_qwen": 0.34167556203901767, "train/kl_loss_r1": 0.2065791456028819, "train/total_kl": 0.5482547096908092 }, { "epoch": 0.14246323529411764, "grad_norm": 11.3125, "learning_rate": 2.8931525735294117e-05, "loss": 4.0015, "mean_token_accuracy": 0.7587345838546753, "step": 155, "train/kl_loss_qwen": 0.46732648052275183, "train/kl_loss_r1": 0.3139583099633455, "train/total_kl": 0.7812847837805748 }, { "epoch": 0.14705882352941177, "grad_norm": 25.75, "learning_rate": 2.8897058823529413e-05, "loss": 3.6916, "mean_token_accuracy": 0.7547200947999955, "step": 160, "train/kl_loss_qwen": 0.45896258056163786, "train/kl_loss_r1": 0.2407479902729392, "train/total_kl": 0.6997105687856674 }, { "epoch": 0.15165441176470587, "grad_norm": 10.375, "learning_rate": 2.8862591911764705e-05, "loss": 2.8947, "mean_token_accuracy": 0.7471380352973938, "step": 165, "train/kl_loss_qwen": 0.2993515759706497, "train/kl_loss_r1": 0.1753220736980438, "train/total_kl": 0.47467364743351936 }, { "epoch": 0.15625, "grad_norm": 7.21875, "learning_rate": 2.8828125e-05, "loss": 3.0875, "mean_token_accuracy": 0.7554198652505875, "step": 170, "train/kl_loss_qwen": 0.3381518451496959, "train/kl_loss_r1": 0.1907153930515051, "train/total_kl": 0.5288672372698784 }, { "epoch": 0.16084558823529413, "grad_norm": 46.25, "learning_rate": 2.8793658088235297e-05, "loss": 3.8006, "mean_token_accuracy": 0.7543142795562744, "step": 175, "train/kl_loss_qwen": 0.4342954009771347, "train/kl_loss_r1": 0.2781439159065485, "train/total_kl": 0.7124393127858639 }, { "epoch": 0.16544117647058823, "grad_norm": 27.625, "learning_rate": 2.875919117647059e-05, "loss": 3.1037, "mean_token_accuracy": 0.7643545418977737, "step": 180, "train/kl_loss_qwen": 0.32490024231374265, "train/kl_loss_r1": 0.2150045122951269, "train/total_kl": 0.5399047564715147 }, { "epoch": 0.17003676470588236, "grad_norm": 15.0625, "learning_rate": 2.8724724264705885e-05, "loss": 3.3512, "mean_token_accuracy": 0.7656952410936355, "step": 185, "train/kl_loss_qwen": 0.39200425930321214, "train/kl_loss_r1": 0.21828225292265416, "train/total_kl": 0.610286520421505 }, { "epoch": 0.17463235294117646, "grad_norm": 9.5, "learning_rate": 2.8690257352941175e-05, "loss": 2.4934, "mean_token_accuracy": 0.7389886736869812, "step": 190, "train/kl_loss_qwen": 0.24613040834665298, "train/kl_loss_r1": 0.12397182490676642, "train/total_kl": 0.37010223269462583 }, { "epoch": 0.1792279411764706, "grad_norm": 17.5, "learning_rate": 2.865579044117647e-05, "loss": 3.0527, "mean_token_accuracy": 0.7645234823226928, "step": 195, "train/kl_loss_qwen": 0.3280874006450176, "train/kl_loss_r1": 0.1920649280771613, "train/total_kl": 0.5201523378491402 }, { "epoch": 0.18382352941176472, "grad_norm": 8.3125, "learning_rate": 2.8621323529411766e-05, "loss": 2.5046, "mean_token_accuracy": 0.7753487080335617, "step": 200, "train/kl_loss_qwen": 0.24486010633409022, "train/kl_loss_r1": 0.12939048558473587, "train/total_kl": 0.3742505945265293 }, { "epoch": 0.18841911764705882, "grad_norm": 35.0, "learning_rate": 2.858685661764706e-05, "loss": 3.7333, "mean_token_accuracy": 0.7638763725757599, "step": 205, "train/kl_loss_qwen": 0.4581252448260784, "train/kl_loss_r1": 0.25974704790860415, "train/total_kl": 0.7178723007440567 }, { "epoch": 0.19301470588235295, "grad_norm": 11.3125, "learning_rate": 2.8552389705882355e-05, "loss": 3.4325, "mean_token_accuracy": 0.7258242666721344, "step": 210, "train/kl_loss_qwen": 0.3888599809259176, "train/kl_loss_r1": 0.22046158649027348, "train/total_kl": 0.609321566671133 }, { "epoch": 0.19761029411764705, "grad_norm": 7.28125, "learning_rate": 2.8517922794117647e-05, "loss": 2.5594, "mean_token_accuracy": 0.746726468205452, "step": 215, "train/kl_loss_qwen": 0.23355862349271775, "train/kl_loss_r1": 0.15477345269173384, "train/total_kl": 0.38833207711577417 }, { "epoch": 0.20220588235294118, "grad_norm": 15.4375, "learning_rate": 2.8483455882352943e-05, "loss": 3.2255, "mean_token_accuracy": 0.763618940114975, "step": 220, "train/kl_loss_qwen": 0.3598331693559885, "train/kl_loss_r1": 0.22203538492321967, "train/total_kl": 0.5818685468286275 }, { "epoch": 0.20680147058823528, "grad_norm": 11.6875, "learning_rate": 2.8448988970588236e-05, "loss": 3.1035, "mean_token_accuracy": 0.7524501204490661, "step": 225, "train/kl_loss_qwen": 0.32799928411841395, "train/kl_loss_r1": 0.2156254580244422, "train/total_kl": 0.5436247382313013 }, { "epoch": 0.2113970588235294, "grad_norm": 18.5, "learning_rate": 2.841452205882353e-05, "loss": 3.5389, "mean_token_accuracy": 0.7489451408386231, "step": 230, "train/kl_loss_qwen": 0.3832179747521877, "train/kl_loss_r1": 0.2746766399592161, "train/total_kl": 0.6578946128487587 }, { "epoch": 0.21599264705882354, "grad_norm": 32.75, "learning_rate": 2.8380055147058824e-05, "loss": 3.1394, "mean_token_accuracy": 0.762254998087883, "step": 235, "train/kl_loss_qwen": 0.3588922441005707, "train/kl_loss_r1": 0.19826317485421896, "train/total_kl": 0.5571554228663445 }, { "epoch": 0.22058823529411764, "grad_norm": 24.0, "learning_rate": 2.8345588235294117e-05, "loss": 3.1694, "mean_token_accuracy": 0.7346105724573135, "step": 240, "train/kl_loss_qwen": 0.3613942746073008, "train/kl_loss_r1": 0.1897347206249833, "train/total_kl": 0.5511290028691291 }, { "epoch": 0.22518382352941177, "grad_norm": 15.1875, "learning_rate": 2.8311121323529413e-05, "loss": 3.3187, "mean_token_accuracy": 0.7426173239946365, "step": 245, "train/kl_loss_qwen": 0.35766145810484884, "train/kl_loss_r1": 0.23391314651817083, "train/total_kl": 0.5915746077895164 }, { "epoch": 0.22977941176470587, "grad_norm": 8.9375, "learning_rate": 2.8276654411764705e-05, "loss": 2.8405, "mean_token_accuracy": 0.7459217041730881, "step": 250, "train/kl_loss_qwen": 0.2941163208335638, "train/kl_loss_r1": 0.17592173498123884, "train/total_kl": 0.47003805860877035 }, { "epoch": 0.234375, "grad_norm": 7.5, "learning_rate": 2.82421875e-05, "loss": 2.8605, "mean_token_accuracy": 0.7551658779382706, "step": 255, "train/kl_loss_qwen": 0.2726207092404366, "train/kl_loss_r1": 0.19635038916021585, "train/total_kl": 0.4689711004495621 }, { "epoch": 0.23897058823529413, "grad_norm": 22.875, "learning_rate": 2.8207720588235297e-05, "loss": 3.3814, "mean_token_accuracy": 0.7645096510648728, "step": 260, "train/kl_loss_qwen": 0.38655108250677583, "train/kl_loss_r1": 0.2306967219337821, "train/total_kl": 0.6172478139400482 }, { "epoch": 0.24356617647058823, "grad_norm": 8.1875, "learning_rate": 2.817325367647059e-05, "loss": 3.1262, "mean_token_accuracy": 0.7208732426166534, "step": 265, "train/kl_loss_qwen": 0.3265652749687433, "train/kl_loss_r1": 0.19569566920399667, "train/total_kl": 0.5222609452903271 }, { "epoch": 0.24816176470588236, "grad_norm": 18.0, "learning_rate": 2.8138786764705882e-05, "loss": 3.0819, "mean_token_accuracy": 0.7513671040534973, "step": 270, "train/kl_loss_qwen": 0.3243158679455519, "train/kl_loss_r1": 0.21789413895457982, "train/total_kl": 0.5422100141644478 }, { "epoch": 0.25275735294117646, "grad_norm": 6.09375, "learning_rate": 2.8104319852941175e-05, "loss": 2.3684, "mean_token_accuracy": 0.7698420792818069, "step": 275, "train/kl_loss_qwen": 0.20914174802601337, "train/kl_loss_r1": 0.12488835342228413, "train/total_kl": 0.33403009958565233 }, { "epoch": 0.25735294117647056, "grad_norm": 35.5, "learning_rate": 2.806985294117647e-05, "loss": 2.9746, "mean_token_accuracy": 0.7567938059568405, "step": 280, "train/kl_loss_qwen": 0.2870381150394678, "train/kl_loss_r1": 0.21586436461657285, "train/total_kl": 0.5029024768620729 }, { "epoch": 0.2619485294117647, "grad_norm": 10.25, "learning_rate": 2.8035386029411767e-05, "loss": 2.7672, "mean_token_accuracy": 0.758710753917694, "step": 285, "train/kl_loss_qwen": 0.28009881228208544, "train/kl_loss_r1": 0.16334772501140832, "train/total_kl": 0.4434465430676937 }, { "epoch": 0.2665441176470588, "grad_norm": 13.0625, "learning_rate": 2.800091911764706e-05, "loss": 2.9307, "mean_token_accuracy": 0.7504922091960907, "step": 290, "train/kl_loss_qwen": 0.3210148632526398, "train/kl_loss_r1": 0.1687827054411173, "train/total_kl": 0.48979756236076355 }, { "epoch": 0.2711397058823529, "grad_norm": 15.0625, "learning_rate": 2.7966452205882355e-05, "loss": 2.7678, "mean_token_accuracy": 0.7582155168056488, "step": 295, "train/kl_loss_qwen": 0.291231270134449, "train/kl_loss_r1": 0.1674706531688571, "train/total_kl": 0.4587019272148609 }, { "epoch": 0.2757352941176471, "grad_norm": 10.1875, "learning_rate": 2.7931985294117648e-05, "loss": 2.4064, "mean_token_accuracy": 0.748086565732956, "step": 300, "train/kl_loss_qwen": 0.21337708421051502, "train/kl_loss_r1": 0.11356487087905406, "train/total_kl": 0.3269419576972723 }, { "epoch": 0.2803308823529412, "grad_norm": 12.0, "learning_rate": 2.7897518382352943e-05, "loss": 3.3713, "mean_token_accuracy": 0.7676705598831177, "step": 305, "train/kl_loss_qwen": 0.38383147977292537, "train/kl_loss_r1": 0.23011279180645944, "train/total_kl": 0.6139442846179008 }, { "epoch": 0.2849264705882353, "grad_norm": 13.0, "learning_rate": 2.7863051470588236e-05, "loss": 2.3748, "mean_token_accuracy": 0.7754788219928741, "step": 310, "train/kl_loss_qwen": 0.2166389824822545, "train/kl_loss_r1": 0.12619577907025814, "train/total_kl": 0.34283475764095783 }, { "epoch": 0.28952205882352944, "grad_norm": 14.3125, "learning_rate": 2.782858455882353e-05, "loss": 2.7837, "mean_token_accuracy": 0.7562883973121644, "step": 315, "train/kl_loss_qwen": 0.2925012856721878, "train/kl_loss_r1": 0.1582660662010312, "train/total_kl": 0.45076735615730285 }, { "epoch": 0.29411764705882354, "grad_norm": 24.75, "learning_rate": 2.7794117647058824e-05, "loss": 2.8939, "mean_token_accuracy": 0.7451714336872101, "step": 320, "train/kl_loss_qwen": 0.2792695712298155, "train/kl_loss_r1": 0.18812930770218372, "train/total_kl": 0.4673988774418831 }, { "epoch": 0.29871323529411764, "grad_norm": 34.0, "learning_rate": 2.7759650735294117e-05, "loss": 3.1971, "mean_token_accuracy": 0.7753181874752044, "step": 325, "train/kl_loss_qwen": 0.3638820182532072, "train/kl_loss_r1": 0.20677912458777428, "train/total_kl": 0.5706611409783363 }, { "epoch": 0.30330882352941174, "grad_norm": 23.5, "learning_rate": 2.7725183823529413e-05, "loss": 2.5968, "mean_token_accuracy": 0.7559898108243942, "step": 330, "train/kl_loss_qwen": 0.24033832624554635, "train/kl_loss_r1": 0.15211960580199957, "train/total_kl": 0.3924579367041588 }, { "epoch": 0.3079044117647059, "grad_norm": 12.1875, "learning_rate": 2.7690716911764705e-05, "loss": 3.1609, "mean_token_accuracy": 0.7667332828044892, "step": 335, "train/kl_loss_qwen": 0.338285806030035, "train/kl_loss_r1": 0.21732427142560481, "train/total_kl": 0.5556100673973561 }, { "epoch": 0.3125, "grad_norm": 8.6875, "learning_rate": 2.765625e-05, "loss": 3.4132, "mean_token_accuracy": 0.7583595246076584, "step": 340, "train/kl_loss_qwen": 0.3800947768613696, "train/kl_loss_r1": 0.25115054063498976, "train/total_kl": 0.6312453065067529 }, { "epoch": 0.3170955882352941, "grad_norm": 8.125, "learning_rate": 2.7621783088235297e-05, "loss": 2.7595, "mean_token_accuracy": 0.7543198734521865, "step": 345, "train/kl_loss_qwen": 0.26038931421935557, "train/kl_loss_r1": 0.17919862512499093, "train/total_kl": 0.43958794698119164 }, { "epoch": 0.32169117647058826, "grad_norm": 9.0, "learning_rate": 2.758731617647059e-05, "loss": 2.8555, "mean_token_accuracy": 0.7692651629447937, "step": 350, "train/kl_loss_qwen": 0.30205008797347543, "train/kl_loss_r1": 0.17516350764781236, "train/total_kl": 0.47721359729766843 }, { "epoch": 0.32628676470588236, "grad_norm": 14.5, "learning_rate": 2.7552849264705882e-05, "loss": 2.6488, "mean_token_accuracy": 0.7590999722480773, "step": 355, "train/kl_loss_qwen": 0.25812953151762486, "train/kl_loss_r1": 0.15315534509718418, "train/total_kl": 0.4112848773598671 }, { "epoch": 0.33088235294117646, "grad_norm": 18.875, "learning_rate": 2.7518382352941175e-05, "loss": 2.8598, "mean_token_accuracy": 0.774398872256279, "step": 360, "train/kl_loss_qwen": 0.2998722895979881, "train/kl_loss_r1": 0.1808535248041153, "train/total_kl": 0.48072580993175507 }, { "epoch": 0.33547794117647056, "grad_norm": 15.5625, "learning_rate": 2.748391544117647e-05, "loss": 3.5063, "mean_token_accuracy": 0.7680695742368698, "step": 365, "train/kl_loss_qwen": 0.3873132593929768, "train/kl_loss_r1": 0.26921150721609594, "train/total_kl": 0.6565247721970081 }, { "epoch": 0.3400735294117647, "grad_norm": 11.6875, "learning_rate": 2.7449448529411767e-05, "loss": 3.8119, "mean_token_accuracy": 0.7418938785791397, "step": 370, "train/kl_loss_qwen": 0.47169247530400754, "train/kl_loss_r1": 0.26214057188481094, "train/total_kl": 0.7338330511003732 }, { "epoch": 0.3446691176470588, "grad_norm": 8.625, "learning_rate": 2.741498161764706e-05, "loss": 3.0413, "mean_token_accuracy": 0.7195575445890426, "step": 375, "train/kl_loss_qwen": 0.3134828630834818, "train/kl_loss_r1": 0.18996739368885757, "train/total_kl": 0.5034502573311329 }, { "epoch": 0.3492647058823529, "grad_norm": 21.875, "learning_rate": 2.7380514705882355e-05, "loss": 2.7333, "mean_token_accuracy": 0.7529161244630813, "step": 380, "train/kl_loss_qwen": 0.26783917360007764, "train/kl_loss_r1": 0.16146638356149196, "train/total_kl": 0.42930555492639544 }, { "epoch": 0.3538602941176471, "grad_norm": 23.5, "learning_rate": 2.7346047794117648e-05, "loss": 2.9696, "mean_token_accuracy": 0.7752228945493698, "step": 385, "train/kl_loss_qwen": 0.28993729297071696, "train/kl_loss_r1": 0.21835732236504554, "train/total_kl": 0.5082946226000786 }, { "epoch": 0.3584558823529412, "grad_norm": 26.5, "learning_rate": 2.7311580882352944e-05, "loss": 2.4825, "mean_token_accuracy": 0.739210131764412, "step": 390, "train/kl_loss_qwen": 0.23699542619287967, "train/kl_loss_r1": 0.13306182324886323, "train/total_kl": 0.37005725055933 }, { "epoch": 0.3630514705882353, "grad_norm": 20.375, "learning_rate": 2.7277113970588233e-05, "loss": 3.0705, "mean_token_accuracy": 0.7504832357168197, "step": 395, "train/kl_loss_qwen": 0.3206694882363081, "train/kl_loss_r1": 0.203219941444695, "train/total_kl": 0.5238894239068032 }, { "epoch": 0.36764705882352944, "grad_norm": 7.03125, "learning_rate": 2.724264705882353e-05, "loss": 2.7817, "mean_token_accuracy": 0.7592732578516006, "step": 400, "train/kl_loss_qwen": 0.25980725064873694, "train/kl_loss_r1": 0.17893490809947252, "train/total_kl": 0.4387421656399965 }, { "epoch": 0.37224264705882354, "grad_norm": 15.8125, "learning_rate": 2.7208180147058825e-05, "loss": 2.7213, "mean_token_accuracy": 0.7661308318376541, "step": 405, "train/kl_loss_qwen": 0.27035542018711567, "train/kl_loss_r1": 0.16476453188806772, "train/total_kl": 0.43511994630098344 }, { "epoch": 0.37683823529411764, "grad_norm": 9.5625, "learning_rate": 2.7173713235294117e-05, "loss": 3.3107, "mean_token_accuracy": 0.7672391653060913, "step": 410, "train/kl_loss_qwen": 0.37639964669942855, "train/kl_loss_r1": 0.22928424850106238, "train/total_kl": 0.6056838996708394 }, { "epoch": 0.38143382352941174, "grad_norm": 6.59375, "learning_rate": 2.7139246323529413e-05, "loss": 2.8039, "mean_token_accuracy": 0.7417833805084229, "step": 415, "train/kl_loss_qwen": 0.28083805963397024, "train/kl_loss_r1": 0.18152289222925902, "train/total_kl": 0.46236095279455186 }, { "epoch": 0.3860294117647059, "grad_norm": 11.875, "learning_rate": 2.7104779411764706e-05, "loss": 2.9833, "mean_token_accuracy": 0.7545632183551788, "step": 420, "train/kl_loss_qwen": 0.3026548307389021, "train/kl_loss_r1": 0.19777862951159478, "train/total_kl": 0.500433461368084 }, { "epoch": 0.390625, "grad_norm": 7.6875, "learning_rate": 2.70703125e-05, "loss": 2.7921, "mean_token_accuracy": 0.7616397023200989, "step": 425, "train/kl_loss_qwen": 0.2890779687091708, "train/kl_loss_r1": 0.17925369031727315, "train/total_kl": 0.4683316584676504 }, { "epoch": 0.3952205882352941, "grad_norm": 5.5625, "learning_rate": 2.7035845588235297e-05, "loss": 2.7383, "mean_token_accuracy": 0.7346738040447235, "step": 430, "train/kl_loss_qwen": 0.28430320098996165, "train/kl_loss_r1": 0.16884665340185165, "train/total_kl": 0.45314985513687134 }, { "epoch": 0.39981617647058826, "grad_norm": 11.8125, "learning_rate": 2.700137867647059e-05, "loss": 3.2727, "mean_token_accuracy": 0.764810037612915, "step": 435, "train/kl_loss_qwen": 0.36565163880586626, "train/kl_loss_r1": 0.22558138892054558, "train/total_kl": 0.5912330389022827 }, { "epoch": 0.40441176470588236, "grad_norm": 8.125, "learning_rate": 2.6966911764705883e-05, "loss": 3.3381, "mean_token_accuracy": 0.7699699103832245, "step": 440, "train/kl_loss_qwen": 0.35228237994015216, "train/kl_loss_r1": 0.2567650653421879, "train/total_kl": 0.609047444164753 }, { "epoch": 0.40900735294117646, "grad_norm": 19.5, "learning_rate": 2.6932444852941175e-05, "loss": 3.0697, "mean_token_accuracy": 0.7416951596736908, "step": 445, "train/kl_loss_qwen": 0.33608091417700053, "train/kl_loss_r1": 0.20944351907819508, "train/total_kl": 0.5455244343727828 }, { "epoch": 0.41360294117647056, "grad_norm": 16.625, "learning_rate": 2.689797794117647e-05, "loss": 2.7871, "mean_token_accuracy": 0.7526424586772918, "step": 450, "train/kl_loss_qwen": 0.30512944534420966, "train/kl_loss_r1": 0.15808237809687853, "train/total_kl": 0.46321182437241076 }, { "epoch": 0.4181985294117647, "grad_norm": 7.375, "learning_rate": 2.6863511029411767e-05, "loss": 2.8216, "mean_token_accuracy": 0.7598502576351166, "step": 455, "train/kl_loss_qwen": 0.27531296089291574, "train/kl_loss_r1": 0.19029796570539476, "train/total_kl": 0.46561092883348465 }, { "epoch": 0.4227941176470588, "grad_norm": 9.0625, "learning_rate": 2.682904411764706e-05, "loss": 2.7403, "mean_token_accuracy": 0.7585819303989411, "step": 460, "train/kl_loss_qwen": 0.2825481027364731, "train/kl_loss_r1": 0.17290859669446945, "train/total_kl": 0.45545670166611674 }, { "epoch": 0.4273897058823529, "grad_norm": 5.625, "learning_rate": 2.6794577205882355e-05, "loss": 3.6634, "mean_token_accuracy": 0.763472780585289, "step": 465, "train/kl_loss_qwen": 0.42548854760825633, "train/kl_loss_r1": 0.2631331071257591, "train/total_kl": 0.6886216450482607 }, { "epoch": 0.4319852941176471, "grad_norm": 7.84375, "learning_rate": 2.6760110294117648e-05, "loss": 2.3183, "mean_token_accuracy": 0.7590369611978531, "step": 470, "train/kl_loss_qwen": 0.2138752520084381, "train/kl_loss_r1": 0.11956894248723984, "train/total_kl": 0.3334441937506199 }, { "epoch": 0.4365808823529412, "grad_norm": 9.25, "learning_rate": 2.6725643382352944e-05, "loss": 2.7691, "mean_token_accuracy": 0.7740260541439057, "step": 475, "train/kl_loss_qwen": 0.28194935582578184, "train/kl_loss_r1": 0.17588923051953315, "train/total_kl": 0.4578385904431343 }, { "epoch": 0.4411764705882353, "grad_norm": 16.5, "learning_rate": 2.6691176470588233e-05, "loss": 2.9371, "mean_token_accuracy": 0.7553506731987, "step": 480, "train/kl_loss_qwen": 0.3055728547275066, "train/kl_loss_r1": 0.19807562176138163, "train/total_kl": 0.5036484815180302 }, { "epoch": 0.44577205882352944, "grad_norm": 8.25, "learning_rate": 2.665670955882353e-05, "loss": 2.564, "mean_token_accuracy": 0.7415809512138367, "step": 485, "train/kl_loss_qwen": 0.24062816128134729, "train/kl_loss_r1": 0.1463530447334051, "train/total_kl": 0.38698121197521684 }, { "epoch": 0.45036764705882354, "grad_norm": 12.5, "learning_rate": 2.6622242647058825e-05, "loss": 2.9048, "mean_token_accuracy": 0.7778663486242294, "step": 490, "train/kl_loss_qwen": 0.30084225051105024, "train/kl_loss_r1": 0.19928387235850095, "train/total_kl": 0.5001261174678803 }, { "epoch": 0.45496323529411764, "grad_norm": 8.4375, "learning_rate": 2.6587775735294117e-05, "loss": 3.25, "mean_token_accuracy": 0.7694221258163452, "step": 495, "train/kl_loss_qwen": 0.3652114329859614, "train/kl_loss_r1": 0.22170483991503714, "train/total_kl": 0.5869162768125534 }, { "epoch": 0.45955882352941174, "grad_norm": 33.25, "learning_rate": 2.6553308823529413e-05, "loss": 3.0252, "mean_token_accuracy": 0.7460946381092072, "step": 500, "train/kl_loss_qwen": 0.30894157737493516, "train/kl_loss_r1": 0.20898498129099607, "train/total_kl": 0.5179265588521957 }, { "epoch": 0.4641544117647059, "grad_norm": 8.1875, "learning_rate": 2.6518841911764706e-05, "loss": 2.8175, "mean_token_accuracy": 0.7537802934646607, "step": 505, "train/kl_loss_qwen": 0.27506737038493156, "train/kl_loss_r1": 0.17378015574067832, "train/total_kl": 0.4488475173711777 }, { "epoch": 0.46875, "grad_norm": 6.4375, "learning_rate": 2.6484375000000002e-05, "loss": 2.3492, "mean_token_accuracy": 0.7604597806930542, "step": 510, "train/kl_loss_qwen": 0.21084308940917254, "train/kl_loss_r1": 0.12702357918024063, "train/total_kl": 0.3378666639328003 }, { "epoch": 0.4733455882352941, "grad_norm": 5.28125, "learning_rate": 2.6449908088235298e-05, "loss": 2.4155, "mean_token_accuracy": 0.7750326544046402, "step": 515, "train/kl_loss_qwen": 0.22967448085546494, "train/kl_loss_r1": 0.14129504952579736, "train/total_kl": 0.37096953131258487 }, { "epoch": 0.47794117647058826, "grad_norm": 7.6875, "learning_rate": 2.6415441176470587e-05, "loss": 2.4723, "mean_token_accuracy": 0.7769854992628098, "step": 520, "train/kl_loss_qwen": 0.2410843674093485, "train/kl_loss_r1": 0.14776650853455067, "train/total_kl": 0.38885087966918946 }, { "epoch": 0.48253676470588236, "grad_norm": 6.40625, "learning_rate": 2.6380974264705883e-05, "loss": 2.6232, "mean_token_accuracy": 0.7474688351154327, "step": 525, "train/kl_loss_qwen": 0.273803885653615, "train/kl_loss_r1": 0.15615152288228273, "train/total_kl": 0.42995540648698805 }, { "epoch": 0.48713235294117646, "grad_norm": 11.4375, "learning_rate": 2.6346507352941175e-05, "loss": 2.5732, "mean_token_accuracy": 0.7471906542778015, "step": 530, "train/kl_loss_qwen": 0.24260313846170903, "train/kl_loss_r1": 0.14697427842766048, "train/total_kl": 0.38957741148769853 }, { "epoch": 0.49172794117647056, "grad_norm": 9.4375, "learning_rate": 2.631204044117647e-05, "loss": 2.4132, "mean_token_accuracy": 0.7701083302497864, "step": 535, "train/kl_loss_qwen": 0.2194656167179346, "train/kl_loss_r1": 0.13061367962509393, "train/total_kl": 0.35007930025458334 }, { "epoch": 0.4963235294117647, "grad_norm": 14.1875, "learning_rate": 2.6277573529411767e-05, "loss": 2.8059, "mean_token_accuracy": 0.7791450679302215, "step": 540, "train/kl_loss_qwen": 0.2814615525305271, "train/kl_loss_r1": 0.18742658831179143, "train/total_kl": 0.468888146430254 }, { "epoch": 0.5009191176470589, "grad_norm": 6.09375, "learning_rate": 2.624310661764706e-05, "loss": 2.5685, "mean_token_accuracy": 0.7711760759353637, "step": 545, "train/kl_loss_qwen": 0.2479680348187685, "train/kl_loss_r1": 0.15079462714493275, "train/total_kl": 0.3987626597285271 }, { "epoch": 0.5055147058823529, "grad_norm": 13.9375, "learning_rate": 2.6208639705882356e-05, "loss": 2.9214, "mean_token_accuracy": 0.777749553322792, "step": 550, "train/kl_loss_qwen": 0.3169623063877225, "train/kl_loss_r1": 0.18846932239830494, "train/total_kl": 0.5054316341876983 }, { "epoch": 0.5101102941176471, "grad_norm": 10.9375, "learning_rate": 2.6174172794117648e-05, "loss": 3.4257, "mean_token_accuracy": 0.7404684275388718, "step": 555, "train/kl_loss_qwen": 0.3698401369154453, "train/kl_loss_r1": 0.25148618761450053, "train/total_kl": 0.6213263235986233 }, { "epoch": 0.5147058823529411, "grad_norm": 11.125, "learning_rate": 2.613970588235294e-05, "loss": 2.2958, "mean_token_accuracy": 0.7467740803956986, "step": 560, "train/kl_loss_qwen": 0.1958090879023075, "train/kl_loss_r1": 0.12171240914613009, "train/total_kl": 0.31752149723470213 }, { "epoch": 0.5193014705882353, "grad_norm": 6.25, "learning_rate": 2.6105238970588233e-05, "loss": 3.0122, "mean_token_accuracy": 0.7664730340242386, "step": 565, "train/kl_loss_qwen": 0.3262002274394035, "train/kl_loss_r1": 0.19693421963602303, "train/total_kl": 0.5231344491243363 }, { "epoch": 0.5238970588235294, "grad_norm": 5.9375, "learning_rate": 2.607077205882353e-05, "loss": 2.6851, "mean_token_accuracy": 0.7639783143997192, "step": 570, "train/kl_loss_qwen": 0.2612082902342081, "train/kl_loss_r1": 0.16572732012718916, "train/total_kl": 0.42693560793995855 }, { "epoch": 0.5284926470588235, "grad_norm": 6.25, "learning_rate": 2.6036305147058825e-05, "loss": 2.6604, "mean_token_accuracy": 0.7705452233552933, "step": 575, "train/kl_loss_qwen": 0.272306926548481, "train/kl_loss_r1": 0.15905672162771226, "train/total_kl": 0.4313636474311352 }, { "epoch": 0.5330882352941176, "grad_norm": 8.4375, "learning_rate": 2.6001838235294117e-05, "loss": 3.255, "mean_token_accuracy": 0.7644341349601745, "step": 580, "train/kl_loss_qwen": 0.3845398426055908, "train/kl_loss_r1": 0.1971276355907321, "train/total_kl": 0.581667472794652 }, { "epoch": 0.5376838235294118, "grad_norm": 5.46875, "learning_rate": 2.5967371323529413e-05, "loss": 2.321, "mean_token_accuracy": 0.73127601146698, "step": 585, "train/kl_loss_qwen": 0.18589173927903174, "train/kl_loss_r1": 0.11133090611547232, "train/total_kl": 0.2972226433455944 }, { "epoch": 0.5422794117647058, "grad_norm": 8.1875, "learning_rate": 2.5932904411764706e-05, "loss": 3.1372, "mean_token_accuracy": 0.766996106505394, "step": 590, "train/kl_loss_qwen": 0.32438481897115706, "train/kl_loss_r1": 0.23537467941641807, "train/total_kl": 0.5597595013678074 }, { "epoch": 0.546875, "grad_norm": 14.5, "learning_rate": 2.5898437500000002e-05, "loss": 2.838, "mean_token_accuracy": 0.7733567923307418, "step": 595, "train/kl_loss_qwen": 0.3003999553620815, "train/kl_loss_r1": 0.18438877165317535, "train/total_kl": 0.4847887299954891 }, { "epoch": 0.5514705882352942, "grad_norm": 8.1875, "learning_rate": 2.5863970588235298e-05, "loss": 3.119, "mean_token_accuracy": 0.7530891060829162, "step": 600, "train/kl_loss_qwen": 0.3513902911916375, "train/kl_loss_r1": 0.2060710046440363, "train/total_kl": 0.5574612963944674 }, { "epoch": 0.5560661764705882, "grad_norm": 7.375, "learning_rate": 2.5829503676470587e-05, "loss": 3.1272, "mean_token_accuracy": 0.7233130037784576, "step": 605, "train/kl_loss_qwen": 0.32725715525448323, "train/kl_loss_r1": 0.21415164284408092, "train/total_kl": 0.5414088018238544 }, { "epoch": 0.5606617647058824, "grad_norm": 7.78125, "learning_rate": 2.5795036764705883e-05, "loss": 2.65, "mean_token_accuracy": 0.7488237828016281, "step": 610, "train/kl_loss_qwen": 0.25779034085571767, "train/kl_loss_r1": 0.15438018105924128, "train/total_kl": 0.4121705275028944 }, { "epoch": 0.5652573529411765, "grad_norm": 7.1875, "learning_rate": 2.5760569852941175e-05, "loss": 3.1002, "mean_token_accuracy": 0.7656900107860565, "step": 615, "train/kl_loss_qwen": 0.32317040748894216, "train/kl_loss_r1": 0.22581094168126584, "train/total_kl": 0.5489813484251499 }, { "epoch": 0.5698529411764706, "grad_norm": 10.3125, "learning_rate": 2.572610294117647e-05, "loss": 3.6832, "mean_token_accuracy": 0.7709728151559829, "step": 620, "train/kl_loss_qwen": 0.43695655167102815, "train/kl_loss_r1": 0.26164604611694814, "train/total_kl": 0.6986026015132666 }, { "epoch": 0.5744485294117647, "grad_norm": 9.75, "learning_rate": 2.5691636029411767e-05, "loss": 2.8011, "mean_token_accuracy": 0.7490771561861038, "step": 625, "train/kl_loss_qwen": 0.27099971994757655, "train/kl_loss_r1": 0.1779295329004526, "train/total_kl": 0.4489292375743389 }, { "epoch": 0.5790441176470589, "grad_norm": 5.34375, "learning_rate": 2.565716911764706e-05, "loss": 2.5584, "mean_token_accuracy": 0.7660718470811844, "step": 630, "train/kl_loss_qwen": 0.23552559316158295, "train/kl_loss_r1": 0.14556924644857644, "train/total_kl": 0.3810948390513659 }, { "epoch": 0.5836397058823529, "grad_norm": 6.96875, "learning_rate": 2.5622702205882356e-05, "loss": 2.8204, "mean_token_accuracy": 0.7795866638422012, "step": 635, "train/kl_loss_qwen": 0.2912254322320223, "train/kl_loss_r1": 0.18594579454511403, "train/total_kl": 0.477171229571104 }, { "epoch": 0.5882352941176471, "grad_norm": 26.375, "learning_rate": 2.5588235294117648e-05, "loss": 3.5962, "mean_token_accuracy": 0.7579382926225662, "step": 640, "train/kl_loss_qwen": 0.4152888409793377, "train/kl_loss_r1": 0.2703390533104539, "train/total_kl": 0.6856279008090496 }, { "epoch": 0.5928308823529411, "grad_norm": 6.5625, "learning_rate": 2.555376838235294e-05, "loss": 2.2892, "mean_token_accuracy": 0.7371518105268479, "step": 645, "train/kl_loss_qwen": 0.2000577926635742, "train/kl_loss_r1": 0.1173404160887003, "train/total_kl": 0.3173982098698616 }, { "epoch": 0.5974264705882353, "grad_norm": 5.34375, "learning_rate": 2.5519301470588233e-05, "loss": 2.9149, "mean_token_accuracy": 0.7631843984127045, "step": 650, "train/kl_loss_qwen": 0.30258313585072755, "train/kl_loss_r1": 0.17346918024122715, "train/total_kl": 0.476052313297987 }, { "epoch": 0.6020220588235294, "grad_norm": 5.625, "learning_rate": 2.548483455882353e-05, "loss": 2.3347, "mean_token_accuracy": 0.7706077218055725, "step": 655, "train/kl_loss_qwen": 0.21414661556482315, "train/kl_loss_r1": 0.12977762762457132, "train/total_kl": 0.3439242452383041 }, { "epoch": 0.6066176470588235, "grad_norm": 18.875, "learning_rate": 2.5450367647058825e-05, "loss": 3.5523, "mean_token_accuracy": 0.7638006836175919, "step": 660, "train/kl_loss_qwen": 0.4221733514219522, "train/kl_loss_r1": 0.2539014684036374, "train/total_kl": 0.6760748248547316 }, { "epoch": 0.6112132352941176, "grad_norm": 20.375, "learning_rate": 2.5415900735294118e-05, "loss": 2.58, "mean_token_accuracy": 0.7460006952285767, "step": 665, "train/kl_loss_qwen": 0.25217038616538046, "train/kl_loss_r1": 0.1543192882090807, "train/total_kl": 0.40648967288434507 }, { "epoch": 0.6158088235294118, "grad_norm": 6.4375, "learning_rate": 2.5381433823529414e-05, "loss": 2.7286, "mean_token_accuracy": 0.7695958316326141, "step": 670, "train/kl_loss_qwen": 0.28523584045469763, "train/kl_loss_r1": 0.16746240444481372, "train/total_kl": 0.45269824415445326 }, { "epoch": 0.6204044117647058, "grad_norm": 9.125, "learning_rate": 2.5346966911764706e-05, "loss": 2.7487, "mean_token_accuracy": 0.7600745111703873, "step": 675, "train/kl_loss_qwen": 0.26131963096559047, "train/kl_loss_r1": 0.18360938951373101, "train/total_kl": 0.4449290160089731 }, { "epoch": 0.625, "grad_norm": 5.6875, "learning_rate": 2.5312500000000002e-05, "loss": 2.5675, "mean_token_accuracy": 0.7691577523946762, "step": 680, "train/kl_loss_qwen": 0.24630658701062202, "train/kl_loss_r1": 0.15804811622947454, "train/total_kl": 0.404354702308774 }, { "epoch": 0.6295955882352942, "grad_norm": 7.90625, "learning_rate": 2.5278033088235295e-05, "loss": 2.9306, "mean_token_accuracy": 0.7747731059789658, "step": 685, "train/kl_loss_qwen": 0.3065579190850258, "train/kl_loss_r1": 0.1966759165748954, "train/total_kl": 0.5032338403165341 }, { "epoch": 0.6341911764705882, "grad_norm": 14.25, "learning_rate": 2.5243566176470587e-05, "loss": 3.0556, "mean_token_accuracy": 0.7747425675392151, "step": 690, "train/kl_loss_qwen": 0.34722540378570554, "train/kl_loss_r1": 0.20382858254015446, "train/total_kl": 0.5510539896786213 }, { "epoch": 0.6387867647058824, "grad_norm": 8.25, "learning_rate": 2.5209099264705883e-05, "loss": 2.9003, "mean_token_accuracy": 0.7529223769903183, "step": 695, "train/kl_loss_qwen": 0.30322663113474846, "train/kl_loss_r1": 0.1966948075219989, "train/total_kl": 0.4999214388430119 }, { "epoch": 0.6433823529411765, "grad_norm": 20.625, "learning_rate": 2.5174632352941176e-05, "loss": 2.7603, "mean_token_accuracy": 0.7450964391231537, "step": 700, "train/kl_loss_qwen": 0.2775906875729561, "train/kl_loss_r1": 0.1681121250614524, "train/total_kl": 0.44570281244814397 }, { "epoch": 0.6479779411764706, "grad_norm": 7.46875, "learning_rate": 2.514016544117647e-05, "loss": 2.2999, "mean_token_accuracy": 0.7612766295671463, "step": 705, "train/kl_loss_qwen": 0.20588579438626767, "train/kl_loss_r1": 0.11731699910014867, "train/total_kl": 0.3232027903199196 }, { "epoch": 0.6525735294117647, "grad_norm": 24.25, "learning_rate": 2.5105698529411767e-05, "loss": 3.0425, "mean_token_accuracy": 0.7618170917034149, "step": 710, "train/kl_loss_qwen": 0.33920769318938254, "train/kl_loss_r1": 0.20069157797843218, "train/total_kl": 0.5398992709815502 }, { "epoch": 0.6571691176470589, "grad_norm": 6.34375, "learning_rate": 2.507123161764706e-05, "loss": 3.3906, "mean_token_accuracy": 0.7389930814504624, "step": 715, "train/kl_loss_qwen": 0.3495714729651809, "train/kl_loss_r1": 0.2725962562486529, "train/total_kl": 0.622167743742466 }, { "epoch": 0.6617647058823529, "grad_norm": 13.625, "learning_rate": 2.5036764705882356e-05, "loss": 2.5055, "mean_token_accuracy": 0.7673314332962036, "step": 720, "train/kl_loss_qwen": 0.24460462778806685, "train/kl_loss_r1": 0.15297702196985483, "train/total_kl": 0.39758165180683136 }, { "epoch": 0.6663602941176471, "grad_norm": 8.0, "learning_rate": 2.500229779411765e-05, "loss": 2.9579, "mean_token_accuracy": 0.7666648864746094, "step": 725, "train/kl_loss_qwen": 0.3130575641989708, "train/kl_loss_r1": 0.20369201358407735, "train/total_kl": 0.5167495809495449 }, { "epoch": 0.6709558823529411, "grad_norm": 32.25, "learning_rate": 2.496783088235294e-05, "loss": 3.303, "mean_token_accuracy": 0.7632827788591385, "step": 730, "train/kl_loss_qwen": 0.37421940360218287, "train/kl_loss_r1": 0.23571279421448707, "train/total_kl": 0.6099322006106377 }, { "epoch": 0.6755514705882353, "grad_norm": 6.0625, "learning_rate": 2.4933363970588233e-05, "loss": 2.3364, "mean_token_accuracy": 0.7545148015022278, "step": 735, "train/kl_loss_qwen": 0.20344098135828972, "train/kl_loss_r1": 0.12272758428007365, "train/total_kl": 0.3261685647070408 }, { "epoch": 0.6801470588235294, "grad_norm": 5.625, "learning_rate": 2.489889705882353e-05, "loss": 2.5848, "mean_token_accuracy": 0.773073548078537, "step": 740, "train/kl_loss_qwen": 0.24243146367371082, "train/kl_loss_r1": 0.1647475201636553, "train/total_kl": 0.4071789853274822 }, { "epoch": 0.6847426470588235, "grad_norm": 5.71875, "learning_rate": 2.4864430147058825e-05, "loss": 3.2043, "mean_token_accuracy": 0.7741522669792176, "step": 745, "train/kl_loss_qwen": 0.34202426187694074, "train/kl_loss_r1": 0.23942313343286514, "train/total_kl": 0.5814473945647478 }, { "epoch": 0.6893382352941176, "grad_norm": 16.875, "learning_rate": 2.4829963235294118e-05, "loss": 3.1311, "mean_token_accuracy": 0.759959951043129, "step": 750, "train/kl_loss_qwen": 0.33796292170882225, "train/kl_loss_r1": 0.21734277866780757, "train/total_kl": 0.5553057052195072 }, { "epoch": 0.6939338235294118, "grad_norm": 6.125, "learning_rate": 2.4795496323529414e-05, "loss": 2.2645, "mean_token_accuracy": 0.729770639538765, "step": 755, "train/kl_loss_qwen": 0.19255626071244478, "train/kl_loss_r1": 0.11135205067694187, "train/total_kl": 0.30390830971300603 }, { "epoch": 0.6985294117647058, "grad_norm": 12.875, "learning_rate": 2.4761029411764706e-05, "loss": 2.7247, "mean_token_accuracy": 0.767203563451767, "step": 760, "train/kl_loss_qwen": 0.2671534739434719, "train/kl_loss_r1": 0.16766709443181754, "train/total_kl": 0.43482056371867656 }, { "epoch": 0.703125, "grad_norm": 21.5, "learning_rate": 2.4726562500000002e-05, "loss": 3.0395, "mean_token_accuracy": 0.7792555302381515, "step": 765, "train/kl_loss_qwen": 0.3042921770364046, "train/kl_loss_r1": 0.23475912101566793, "train/total_kl": 0.5390512943267822 }, { "epoch": 0.7077205882352942, "grad_norm": 18.25, "learning_rate": 2.4692095588235295e-05, "loss": 3.132, "mean_token_accuracy": 0.7637085497379303, "step": 770, "train/kl_loss_qwen": 0.3571842934936285, "train/kl_loss_r1": 0.2055378383025527, "train/total_kl": 0.5627221390604973 }, { "epoch": 0.7123161764705882, "grad_norm": 7.53125, "learning_rate": 2.4657628676470587e-05, "loss": 2.8827, "mean_token_accuracy": 0.7434431910514832, "step": 775, "train/kl_loss_qwen": 0.3152502715587616, "train/kl_loss_r1": 0.18244544900953769, "train/total_kl": 0.4976957157254219 }, { "epoch": 0.7169117647058824, "grad_norm": 20.5, "learning_rate": 2.4623161764705883e-05, "loss": 2.8948, "mean_token_accuracy": 0.7385075211524963, "step": 780, "train/kl_loss_qwen": 0.301816888153553, "train/kl_loss_r1": 0.18196456991136073, "train/total_kl": 0.48378146141767503 }, { "epoch": 0.7215073529411765, "grad_norm": 6.03125, "learning_rate": 2.4588694852941176e-05, "loss": 2.5771, "mean_token_accuracy": 0.753093707561493, "step": 785, "train/kl_loss_qwen": 0.24673266094177962, "train/kl_loss_r1": 0.15335584823042153, "train/total_kl": 0.4000885050743818 }, { "epoch": 0.7261029411764706, "grad_norm": 12.5625, "learning_rate": 2.455422794117647e-05, "loss": 2.6954, "mean_token_accuracy": 0.7686734408140182, "step": 790, "train/kl_loss_qwen": 0.2682993970811367, "train/kl_loss_r1": 0.1770503718405962, "train/total_kl": 0.44534977376461027 }, { "epoch": 0.7306985294117647, "grad_norm": 5.84375, "learning_rate": 2.4519761029411768e-05, "loss": 2.399, "mean_token_accuracy": 0.7646504133939743, "step": 795, "train/kl_loss_qwen": 0.2142568849027157, "train/kl_loss_r1": 0.13209631983190775, "train/total_kl": 0.34635320864617825 }, { "epoch": 0.7352941176470589, "grad_norm": 4.53125, "learning_rate": 2.448529411764706e-05, "loss": 2.6112, "mean_token_accuracy": 0.760350888967514, "step": 800, "train/kl_loss_qwen": 0.24145320765674114, "train/kl_loss_r1": 0.1602572899311781, "train/total_kl": 0.40171049572527406 }, { "epoch": 0.7398897058823529, "grad_norm": 5.53125, "learning_rate": 2.4450827205882356e-05, "loss": 2.7783, "mean_token_accuracy": 0.7784444391727448, "step": 805, "train/kl_loss_qwen": 0.2839724402874708, "train/kl_loss_r1": 0.18588781580328942, "train/total_kl": 0.46986025720834734 }, { "epoch": 0.7444852941176471, "grad_norm": 13.8125, "learning_rate": 2.4416360294117645e-05, "loss": 3.2653, "mean_token_accuracy": 0.7738717645406723, "step": 810, "train/kl_loss_qwen": 0.36536430157721045, "train/kl_loss_r1": 0.24171638526022435, "train/total_kl": 0.6070806853473186 }, { "epoch": 0.7490808823529411, "grad_norm": 6.625, "learning_rate": 2.438189338235294e-05, "loss": 2.3927, "mean_token_accuracy": 0.7411265462636948, "step": 815, "train/kl_loss_qwen": 0.21468257531523705, "train/kl_loss_r1": 0.1389029709622264, "train/total_kl": 0.35358554795384406 }, { "epoch": 0.7536764705882353, "grad_norm": 10.5625, "learning_rate": 2.4347426470588234e-05, "loss": 2.6545, "mean_token_accuracy": 0.7369672119617462, "step": 820, "train/kl_loss_qwen": 0.23823342826217414, "train/kl_loss_r1": 0.16688897851854562, "train/total_kl": 0.4051224060356617 }, { "epoch": 0.7582720588235294, "grad_norm": 9.5, "learning_rate": 2.431295955882353e-05, "loss": 2.221, "mean_token_accuracy": 0.7671397745609283, "step": 825, "train/kl_loss_qwen": 0.1944459293037653, "train/kl_loss_r1": 0.11296823415905237, "train/total_kl": 0.30741416439414027 }, { "epoch": 0.7628676470588235, "grad_norm": 9.8125, "learning_rate": 2.4278492647058825e-05, "loss": 2.8627, "mean_token_accuracy": 0.7721496760845185, "step": 830, "train/kl_loss_qwen": 0.29709434546530245, "train/kl_loss_r1": 0.19235175009816885, "train/total_kl": 0.4894461028277874 }, { "epoch": 0.7674632352941176, "grad_norm": 9.0625, "learning_rate": 2.4244025735294118e-05, "loss": 2.5478, "mean_token_accuracy": 0.777729532122612, "step": 835, "train/kl_loss_qwen": 0.24631783794611692, "train/kl_loss_r1": 0.16106365360319613, "train/total_kl": 0.40738149620592595 }, { "epoch": 0.7720588235294118, "grad_norm": 5.8125, "learning_rate": 2.4209558823529414e-05, "loss": 3.015, "mean_token_accuracy": 0.7657909542322159, "step": 840, "train/kl_loss_qwen": 0.3283080026507378, "train/kl_loss_r1": 0.20606368985027074, "train/total_kl": 0.5343716844916344 }, { "epoch": 0.7766544117647058, "grad_norm": 11.25, "learning_rate": 2.4175091911764706e-05, "loss": 2.4779, "mean_token_accuracy": 0.7260577827692032, "step": 845, "train/kl_loss_qwen": 0.224995918571949, "train/kl_loss_r1": 0.13734962455928326, "train/total_kl": 0.36234553903341293 }, { "epoch": 0.78125, "grad_norm": 12.4375, "learning_rate": 2.4140625e-05, "loss": 2.5439, "mean_token_accuracy": 0.7665543109178543, "step": 850, "train/kl_loss_qwen": 0.2431650910526514, "train/kl_loss_r1": 0.163537354208529, "train/total_kl": 0.40670243836939335 }, { "epoch": 0.7858455882352942, "grad_norm": 4.90625, "learning_rate": 2.4106158088235295e-05, "loss": 3.2831, "mean_token_accuracy": 0.7692991495132446, "step": 855, "train/kl_loss_qwen": 0.3613782159984112, "train/kl_loss_r1": 0.23370234090834857, "train/total_kl": 0.595080553740263 }, { "epoch": 0.7904411764705882, "grad_norm": 11.625, "learning_rate": 2.4071691176470587e-05, "loss": 3.0925, "mean_token_accuracy": 0.7705245614051819, "step": 860, "train/kl_loss_qwen": 0.32698389384895565, "train/kl_loss_r1": 0.21528607234358788, "train/total_kl": 0.5422699719667434 }, { "epoch": 0.7950367647058824, "grad_norm": 10.0, "learning_rate": 2.4037224264705883e-05, "loss": 2.5964, "mean_token_accuracy": 0.7585686951875686, "step": 865, "train/kl_loss_qwen": 0.24837292842566966, "train/kl_loss_r1": 0.1542820379137993, "train/total_kl": 0.40265496596693995 }, { "epoch": 0.7996323529411765, "grad_norm": 23.125, "learning_rate": 2.4002757352941176e-05, "loss": 2.4837, "mean_token_accuracy": 0.7597948163747787, "step": 870, "train/kl_loss_qwen": 0.2187556240707636, "train/kl_loss_r1": 0.13237967137247325, "train/total_kl": 0.3511353015899658 }, { "epoch": 0.8042279411764706, "grad_norm": 5.15625, "learning_rate": 2.3968290441176472e-05, "loss": 2.5718, "mean_token_accuracy": 0.7743768215179443, "step": 875, "train/kl_loss_qwen": 0.2609509777277708, "train/kl_loss_r1": 0.1498867817223072, "train/total_kl": 0.4108377553522587 }, { "epoch": 0.8088235294117647, "grad_norm": 7.65625, "learning_rate": 2.3933823529411768e-05, "loss": 3.0424, "mean_token_accuracy": 0.76705681681633, "step": 880, "train/kl_loss_qwen": 0.328360665217042, "train/kl_loss_r1": 0.20937101989984513, "train/total_kl": 0.5377316907048225 }, { "epoch": 0.8134191176470589, "grad_norm": 38.5, "learning_rate": 2.389935661764706e-05, "loss": 3.3681, "mean_token_accuracy": 0.7505431562662125, "step": 885, "train/kl_loss_qwen": 0.3830601923167706, "train/kl_loss_r1": 0.23940850496292115, "train/total_kl": 0.6224686868488789 }, { "epoch": 0.8180147058823529, "grad_norm": 6.78125, "learning_rate": 2.3864889705882356e-05, "loss": 2.5873, "mean_token_accuracy": 0.7314470678567886, "step": 890, "train/kl_loss_qwen": 0.22989343330264092, "train/kl_loss_r1": 0.17244479935616255, "train/total_kl": 0.4023382365703583 }, { "epoch": 0.8226102941176471, "grad_norm": 24.125, "learning_rate": 2.3830422794117645e-05, "loss": 3.0858, "mean_token_accuracy": 0.7681948751211166, "step": 895, "train/kl_loss_qwen": 0.32556538172066213, "train/kl_loss_r1": 0.2322130450978875, "train/total_kl": 0.5577784314751625 }, { "epoch": 0.8272058823529411, "grad_norm": 8.8125, "learning_rate": 2.379595588235294e-05, "loss": 2.7973, "mean_token_accuracy": 0.758452445268631, "step": 900, "train/kl_loss_qwen": 0.2798971727490425, "train/kl_loss_r1": 0.17839549258351325, "train/total_kl": 0.45829266123473644 }, { "epoch": 0.8318014705882353, "grad_norm": 7.03125, "learning_rate": 2.3761488970588234e-05, "loss": 2.946, "mean_token_accuracy": 0.7686445116996765, "step": 905, "train/kl_loss_qwen": 0.2969953244552016, "train/kl_loss_r1": 0.2133618885651231, "train/total_kl": 0.5103572174906731 }, { "epoch": 0.8363970588235294, "grad_norm": 5.6875, "learning_rate": 2.372702205882353e-05, "loss": 2.9284, "mean_token_accuracy": 0.763682508468628, "step": 910, "train/kl_loss_qwen": 0.28750825896859167, "train/kl_loss_r1": 0.20824656039476394, "train/total_kl": 0.4957548208534718 }, { "epoch": 0.8409926470588235, "grad_norm": 6.0, "learning_rate": 2.3692555147058826e-05, "loss": 2.4715, "mean_token_accuracy": 0.7754847556352615, "step": 915, "train/kl_loss_qwen": 0.23572093360126017, "train/kl_loss_r1": 0.15165257677435875, "train/total_kl": 0.3873735036700964 }, { "epoch": 0.8455882352941176, "grad_norm": 37.0, "learning_rate": 2.3658088235294118e-05, "loss": 3.8152, "mean_token_accuracy": 0.7668180167675018, "step": 920, "train/kl_loss_qwen": 0.43432158417999744, "train/kl_loss_r1": 0.29057041853666304, "train/total_kl": 0.7248920112848282 }, { "epoch": 0.8501838235294118, "grad_norm": 8.4375, "learning_rate": 2.3623621323529414e-05, "loss": 2.2838, "mean_token_accuracy": 0.756912013888359, "step": 925, "train/kl_loss_qwen": 0.19460431225597857, "train/kl_loss_r1": 0.12254806980490685, "train/total_kl": 0.31715237982571126 }, { "epoch": 0.8547794117647058, "grad_norm": 6.09375, "learning_rate": 2.3589154411764707e-05, "loss": 2.8498, "mean_token_accuracy": 0.7745060354471207, "step": 930, "train/kl_loss_qwen": 0.31135519929230215, "train/kl_loss_r1": 0.16893052253872157, "train/total_kl": 0.48028572648763657 }, { "epoch": 0.859375, "grad_norm": 9.25, "learning_rate": 2.35546875e-05, "loss": 2.5034, "mean_token_accuracy": 0.7658473283052445, "step": 935, "train/kl_loss_qwen": 0.23895751722157002, "train/kl_loss_r1": 0.16066635940223933, "train/total_kl": 0.39962387681007383 }, { "epoch": 0.8639705882352942, "grad_norm": 4.90625, "learning_rate": 2.3520220588235295e-05, "loss": 2.3413, "mean_token_accuracy": 0.7497002571821213, "step": 940, "train/kl_loss_qwen": 0.22181288599967958, "train/kl_loss_r1": 0.13520750738680362, "train/total_kl": 0.3570203959941864 }, { "epoch": 0.8685661764705882, "grad_norm": 7.78125, "learning_rate": 2.3485753676470588e-05, "loss": 3.0273, "mean_token_accuracy": 0.7652308195829391, "step": 945, "train/kl_loss_qwen": 0.31859342865645884, "train/kl_loss_r1": 0.2173796972259879, "train/total_kl": 0.5359731260687113 }, { "epoch": 0.8731617647058824, "grad_norm": 6.0, "learning_rate": 2.3451286764705883e-05, "loss": 3.2067, "mean_token_accuracy": 0.7529262214899063, "step": 950, "train/kl_loss_qwen": 0.34089123979210856, "train/kl_loss_r1": 0.22591239623725415, "train/total_kl": 0.5668036345392465 }, { "epoch": 0.8777573529411765, "grad_norm": 13.0625, "learning_rate": 2.3416819852941176e-05, "loss": 3.0626, "mean_token_accuracy": 0.7502310097217559, "step": 955, "train/kl_loss_qwen": 0.3198371402919292, "train/kl_loss_r1": 0.2195627711713314, "train/total_kl": 0.5393999077379703 }, { "epoch": 0.8823529411764706, "grad_norm": 5.09375, "learning_rate": 2.3382352941176472e-05, "loss": 2.7594, "mean_token_accuracy": 0.7421835958957672, "step": 960, "train/kl_loss_qwen": 0.27218600660562514, "train/kl_loss_r1": 0.17624912671744825, "train/total_kl": 0.44843512773513794 }, { "epoch": 0.8869485294117647, "grad_norm": 5.3125, "learning_rate": 2.3347886029411768e-05, "loss": 3.4481, "mean_token_accuracy": 0.7635885417461395, "step": 965, "train/kl_loss_qwen": 0.3790398512035608, "train/kl_loss_r1": 0.2533990180119872, "train/total_kl": 0.6324388731271029 }, { "epoch": 0.8915441176470589, "grad_norm": 9.5, "learning_rate": 2.331341911764706e-05, "loss": 2.3847, "mean_token_accuracy": 0.7719403833150864, "step": 970, "train/kl_loss_qwen": 0.22646238952875136, "train/kl_loss_r1": 0.1279384709894657, "train/total_kl": 0.3544008556753397 }, { "epoch": 0.8961397058823529, "grad_norm": 5.90625, "learning_rate": 2.3278952205882353e-05, "loss": 2.9426, "mean_token_accuracy": 0.7727076560258865, "step": 975, "train/kl_loss_qwen": 0.304868184402585, "train/kl_loss_r1": 0.19793193209916354, "train/total_kl": 0.5028001211583615 }, { "epoch": 0.9007352941176471, "grad_norm": 9.5625, "learning_rate": 2.3244485294117645e-05, "loss": 2.9464, "mean_token_accuracy": 0.7676802188158035, "step": 980, "train/kl_loss_qwen": 0.3127247016876936, "train/kl_loss_r1": 0.1998186567798257, "train/total_kl": 0.5125433541834354 }, { "epoch": 0.9053308823529411, "grad_norm": 7.0625, "learning_rate": 2.321001838235294e-05, "loss": 2.9416, "mean_token_accuracy": 0.7612376570701599, "step": 985, "train/kl_loss_qwen": 0.29801272638142107, "train/kl_loss_r1": 0.19902198743075133, "train/total_kl": 0.49703471437096597 }, { "epoch": 0.9099264705882353, "grad_norm": 7.5625, "learning_rate": 2.3175551470588234e-05, "loss": 2.413, "mean_token_accuracy": 0.7658768028020859, "step": 990, "train/kl_loss_qwen": 0.2236352551728487, "train/kl_loss_r1": 0.13950190246105193, "train/total_kl": 0.3631371632218361 }, { "epoch": 0.9145220588235294, "grad_norm": 12.125, "learning_rate": 2.314108455882353e-05, "loss": 2.669, "mean_token_accuracy": 0.7687429904937744, "step": 995, "train/kl_loss_qwen": 0.27499873116612433, "train/kl_loss_r1": 0.16382879298180342, "train/total_kl": 0.43882752135396 }, { "epoch": 0.9191176470588235, "grad_norm": 34.0, "learning_rate": 2.3106617647058826e-05, "loss": 3.0599, "mean_token_accuracy": 0.7651446223258972, "step": 1000, "train/kl_loss_qwen": 0.32082758136093614, "train/kl_loss_r1": 0.20667899027466774, "train/total_kl": 0.5275065772235393 }, { "epoch": 0.9237132352941176, "grad_norm": 6.53125, "learning_rate": 2.3072150735294118e-05, "loss": 2.5313, "mean_token_accuracy": 0.76262626349926, "step": 1005, "train/kl_loss_qwen": 0.2558111008256674, "train/kl_loss_r1": 0.15045844614505768, "train/total_kl": 0.4062695436179638 }, { "epoch": 0.9283088235294118, "grad_norm": 5.90625, "learning_rate": 2.3037683823529414e-05, "loss": 3.1849, "mean_token_accuracy": 0.7305946588516236, "step": 1010, "train/kl_loss_qwen": 0.3190811090171337, "train/kl_loss_r1": 0.20359136033803224, "train/total_kl": 0.5226724751293659 }, { "epoch": 0.9329044117647058, "grad_norm": 12.375, "learning_rate": 2.3003216911764707e-05, "loss": 3.1059, "mean_token_accuracy": 0.7705761641263962, "step": 1015, "train/kl_loss_qwen": 0.3244234949350357, "train/kl_loss_r1": 0.23338106833398342, "train/total_kl": 0.557804561406374 }, { "epoch": 0.9375, "grad_norm": 6.0625, "learning_rate": 2.296875e-05, "loss": 3.0695, "mean_token_accuracy": 0.7646759301424026, "step": 1020, "train/kl_loss_qwen": 0.31649671010673047, "train/kl_loss_r1": 0.2347225785255432, "train/total_kl": 0.5512192968279124 }, { "epoch": 0.9420955882352942, "grad_norm": 8.125, "learning_rate": 2.2934283088235295e-05, "loss": 2.4066, "mean_token_accuracy": 0.7482253730297088, "step": 1025, "train/kl_loss_qwen": 0.2247611027210951, "train/kl_loss_r1": 0.13678079079836608, "train/total_kl": 0.3615418955683708 }, { "epoch": 0.9466911764705882, "grad_norm": 10.5, "learning_rate": 2.2899816176470588e-05, "loss": 2.5618, "mean_token_accuracy": 0.7486281037330628, "step": 1030, "train/kl_loss_qwen": 0.24083134531974792, "train/kl_loss_r1": 0.1521694902330637, "train/total_kl": 0.39300084486603737 }, { "epoch": 0.9512867647058824, "grad_norm": 6.375, "learning_rate": 2.2865349264705884e-05, "loss": 2.528, "mean_token_accuracy": 0.7573053300380707, "step": 1035, "train/kl_loss_qwen": 0.2377445988357067, "train/kl_loss_r1": 0.15604632087051867, "train/total_kl": 0.39379091933369637 }, { "epoch": 0.9558823529411765, "grad_norm": 9.9375, "learning_rate": 2.2830882352941176e-05, "loss": 2.4803, "mean_token_accuracy": 0.7767712444067001, "step": 1040, "train/kl_loss_qwen": 0.23854669630527497, "train/kl_loss_r1": 0.15197529271245003, "train/total_kl": 0.39052199125289916 }, { "epoch": 0.9604779411764706, "grad_norm": 4.71875, "learning_rate": 2.2796415441176472e-05, "loss": 2.5356, "mean_token_accuracy": 0.7657318651676178, "step": 1045, "train/kl_loss_qwen": 0.2492308657616377, "train/kl_loss_r1": 0.15562628637999296, "train/total_kl": 0.4048571538180113 }, { "epoch": 0.9650735294117647, "grad_norm": 6.125, "learning_rate": 2.2761948529411768e-05, "loss": 2.7125, "mean_token_accuracy": 0.7519971400499343, "step": 1050, "train/kl_loss_qwen": 0.2670097855851054, "train/kl_loss_r1": 0.17238117679953574, "train/total_kl": 0.43939096443355086 }, { "epoch": 0.9696691176470589, "grad_norm": 5.75, "learning_rate": 2.272748161764706e-05, "loss": 2.28, "mean_token_accuracy": 0.7458152621984482, "step": 1055, "train/kl_loss_qwen": 0.21117937862873076, "train/kl_loss_r1": 0.12069441135972739, "train/total_kl": 0.33187379613518714 }, { "epoch": 0.9742647058823529, "grad_norm": 22.375, "learning_rate": 2.2693014705882353e-05, "loss": 2.6571, "mean_token_accuracy": 0.762286388874054, "step": 1060, "train/kl_loss_qwen": 0.2774271484464407, "train/kl_loss_r1": 0.16375370547175408, "train/total_kl": 0.4411808494478464 }, { "epoch": 0.9788602941176471, "grad_norm": 14.6875, "learning_rate": 2.2658547794117646e-05, "loss": 2.9265, "mean_token_accuracy": 0.758323472738266, "step": 1065, "train/kl_loss_qwen": 0.30878260508179667, "train/kl_loss_r1": 0.19694424830377102, "train/total_kl": 0.5057268541306257 }, { "epoch": 0.9834558823529411, "grad_norm": 14.5625, "learning_rate": 2.262408088235294e-05, "loss": 2.5522, "mean_token_accuracy": 0.7652994871139527, "step": 1070, "train/kl_loss_qwen": 0.24689169451594353, "train/kl_loss_r1": 0.15555771812796593, "train/total_kl": 0.4024494141340256 }, { "epoch": 0.9880514705882353, "grad_norm": 8.4375, "learning_rate": 2.2589613970588234e-05, "loss": 2.9886, "mean_token_accuracy": 0.7621013224124908, "step": 1075, "train/kl_loss_qwen": 0.30935199521481993, "train/kl_loss_r1": 0.21715811733156443, "train/total_kl": 0.5265101172029972 }, { "epoch": 0.9926470588235294, "grad_norm": 12.75, "learning_rate": 2.255514705882353e-05, "loss": 2.7839, "mean_token_accuracy": 0.7489064037799835, "step": 1080, "train/kl_loss_qwen": 0.28402559775859115, "train/kl_loss_r1": 0.16853774935007096, "train/total_kl": 0.45256335139274595 }, { "epoch": 0.9972426470588235, "grad_norm": 29.625, "learning_rate": 2.2520680147058826e-05, "loss": 2.9104, "mean_token_accuracy": 0.7622999787330628, "step": 1085, "train/kl_loss_qwen": 0.30061994940042497, "train/kl_loss_r1": 0.19877788815647363, "train/total_kl": 0.4993978329002857 } ], "logging_steps": 5, "max_steps": 4352, "num_input_tokens_seen": 0, "num_train_epochs": 4, "save_steps": 500, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": false }, "attributes": {} } }, "total_flos": 1.6991100809098752e+17, "train_batch_size": 2, "trial_name": null, "trial_params": null }