| { |
| "best_global_step": null, |
| "best_metric": null, |
| "best_model_checkpoint": null, |
| "epoch": 1.0, |
| "eval_steps": 500, |
| "global_step": 433, |
| "is_hyper_param_search": false, |
| "is_local_process_zero": true, |
| "is_world_process_zero": true, |
| "log_history": [ |
| { |
| "entropy": 0.11948550771921873, |
| "epoch": 0.023111367904087823, |
| "grad_norm": 0.26614415645599365, |
| "learning_rate": 6.923076923076924e-05, |
| "loss": 0.27834961414337156, |
| "mean_token_accuracy": 0.9158459510654211, |
| "num_tokens": 91409.0, |
| "step": 10 |
| }, |
| { |
| "entropy": 0.14536615274846554, |
| "epoch": 0.046222735808175645, |
| "grad_norm": 0.28414708375930786, |
| "learning_rate": 9.994965332706573e-05, |
| "loss": 0.13056882619857788, |
| "mean_token_accuracy": 0.9612345997244119, |
| "num_tokens": 186627.0, |
| "step": 20 |
| }, |
| { |
| "entropy": 0.11003581081749872, |
| "epoch": 0.06933410371226346, |
| "grad_norm": 0.2106354683637619, |
| "learning_rate": 9.964234631709187e-05, |
| "loss": 0.09309924244880677, |
| "mean_token_accuracy": 0.9709797658026218, |
| "num_tokens": 276604.0, |
| "step": 30 |
| }, |
| { |
| "entropy": 0.0915378995705396, |
| "epoch": 0.09244547161635129, |
| "grad_norm": 0.2663438022136688, |
| "learning_rate": 9.905741916970864e-05, |
| "loss": 0.10451314449310303, |
| "mean_token_accuracy": 0.9715173915028572, |
| "num_tokens": 368108.0, |
| "step": 40 |
| }, |
| { |
| "entropy": 0.10749789654510096, |
| "epoch": 0.11555683952043912, |
| "grad_norm": 0.17998279631137848, |
| "learning_rate": 9.819814303479267e-05, |
| "loss": 0.10180811882019043, |
| "mean_token_accuracy": 0.9665989849716425, |
| "num_tokens": 457334.0, |
| "step": 50 |
| }, |
| { |
| "entropy": 0.08793499013991095, |
| "epoch": 0.13866820742452693, |
| "grad_norm": 0.18421846628189087, |
| "learning_rate": 9.706932333304517e-05, |
| "loss": 0.10302398204803467, |
| "mean_token_accuracy": 0.9739916753023863, |
| "num_tokens": 547458.0, |
| "step": 60 |
| }, |
| { |
| "entropy": 0.10031854717526585, |
| "epoch": 0.16177957532861476, |
| "grad_norm": 0.1583297848701477, |
| "learning_rate": 9.567727288213005e-05, |
| "loss": 0.09594225287437438, |
| "mean_token_accuracy": 0.9684251010417938, |
| "num_tokens": 633576.0, |
| "step": 70 |
| }, |
| { |
| "entropy": 0.10018112544203177, |
| "epoch": 0.18489094323270258, |
| "grad_norm": 0.17029769718647003, |
| "learning_rate": 9.40297765928369e-05, |
| "loss": 0.08666939735412597, |
| "mean_token_accuracy": 0.9722081393003463, |
| "num_tokens": 725021.0, |
| "step": 80 |
| }, |
| { |
| "entropy": 0.08978840237832628, |
| "epoch": 0.2080023111367904, |
| "grad_norm": 0.21113114058971405, |
| "learning_rate": 9.213604793270196e-05, |
| "loss": 0.10337703227996826, |
| "mean_token_accuracy": 0.9718282397836446, |
| "num_tokens": 809468.0, |
| "step": 90 |
| }, |
| { |
| "entropy": 0.08143368383025518, |
| "epoch": 0.23111367904087823, |
| "grad_norm": 0.2660817801952362, |
| "learning_rate": 9.000667740056032e-05, |
| "loss": 0.07579125165939331, |
| "mean_token_accuracy": 0.9780994143337012, |
| "num_tokens": 898185.0, |
| "step": 100 |
| }, |
| { |
| "entropy": 0.07822052207193338, |
| "epoch": 0.25422504694496606, |
| "grad_norm": 0.25105559825897217, |
| "learning_rate": 8.765357330018056e-05, |
| "loss": 0.0827728271484375, |
| "mean_token_accuracy": 0.9731388352811337, |
| "num_tokens": 988490.0, |
| "step": 110 |
| }, |
| { |
| "entropy": 0.0850134992855601, |
| "epoch": 0.27733641484905386, |
| "grad_norm": 0.15802568197250366, |
| "learning_rate": 8.508989514419958e-05, |
| "loss": 0.07012671828269959, |
| "mean_token_accuracy": 0.9775275759398937, |
| "num_tokens": 1078890.0, |
| "step": 120 |
| }, |
| { |
| "entropy": 0.07775390069000424, |
| "epoch": 0.3004477827531417, |
| "grad_norm": 0.3077862858772278, |
| "learning_rate": 8.232998006078997e-05, |
| "loss": 0.07896218299865723, |
| "mean_token_accuracy": 0.9768860664218664, |
| "num_tokens": 1171456.0, |
| "step": 130 |
| }, |
| { |
| "entropy": 0.06990418929490261, |
| "epoch": 0.3235591506572295, |
| "grad_norm": 0.20379361510276794, |
| "learning_rate": 7.938926261462366e-05, |
| "loss": 0.0791102945804596, |
| "mean_token_accuracy": 0.9748555511236191, |
| "num_tokens": 1267191.0, |
| "step": 140 |
| }, |
| { |
| "entropy": 0.07729233189020306, |
| "epoch": 0.34667051856131736, |
| "grad_norm": 0.2790727913379669, |
| "learning_rate": 7.628418849052523e-05, |
| "loss": 0.07758013606071472, |
| "mean_token_accuracy": 0.9756737377494573, |
| "num_tokens": 1354080.0, |
| "step": 150 |
| }, |
| { |
| "entropy": 0.08708043664228171, |
| "epoch": 0.36978188646540516, |
| "grad_norm": 0.269930899143219, |
| "learning_rate": 7.303212252253162e-05, |
| "loss": 0.08181141018867492, |
| "mean_token_accuracy": 0.9762891136109829, |
| "num_tokens": 1442199.0, |
| "step": 160 |
| }, |
| { |
| "entropy": 0.081081559494487, |
| "epoch": 0.392893254369493, |
| "grad_norm": 0.1513710916042328, |
| "learning_rate": 6.965125158269619e-05, |
| "loss": 0.0810213029384613, |
| "mean_token_accuracy": 0.9729760400950909, |
| "num_tokens": 1537565.0, |
| "step": 170 |
| }, |
| { |
| "entropy": 0.07967969757737592, |
| "epoch": 0.4160046222735808, |
| "grad_norm": 0.26842933893203735, |
| "learning_rate": 6.616048287272301e-05, |
| "loss": 0.0828117549419403, |
| "mean_token_accuracy": 0.9750622134655714, |
| "num_tokens": 1631534.0, |
| "step": 180 |
| }, |
| { |
| "entropy": 0.08117348714149557, |
| "epoch": 0.4391159901776686, |
| "grad_norm": 1.2517547607421875, |
| "learning_rate": 6.257933818722543e-05, |
| "loss": 0.07101889252662659, |
| "mean_token_accuracy": 0.9764051765203476, |
| "num_tokens": 1718429.0, |
| "step": 190 |
| }, |
| { |
| "entropy": 0.0724065299378708, |
| "epoch": 0.46222735808175647, |
| "grad_norm": 0.3557807505130768, |
| "learning_rate": 5.8927844739931834e-05, |
| "loss": 0.07825151681900025, |
| "mean_token_accuracy": 0.9812528945505619, |
| "num_tokens": 1804347.0, |
| "step": 200 |
| }, |
| { |
| "entropy": 0.07162103470182046, |
| "epoch": 0.48533872598584427, |
| "grad_norm": 0.13491679728031158, |
| "learning_rate": 5.522642316338268e-05, |
| "loss": 0.06295353174209595, |
| "mean_token_accuracy": 0.982288584113121, |
| "num_tokens": 1893854.0, |
| "step": 210 |
| }, |
| { |
| "entropy": 0.06431798301055096, |
| "epoch": 0.5084500938899321, |
| "grad_norm": 0.18494592607021332, |
| "learning_rate": 5.149577330846993e-05, |
| "loss": 0.058886730670928956, |
| "mean_token_accuracy": 0.9838358085602522, |
| "num_tokens": 1983498.0, |
| "step": 220 |
| }, |
| { |
| "entropy": 0.06635294057487044, |
| "epoch": 0.53156146179402, |
| "grad_norm": 0.24623480439186096, |
| "learning_rate": 4.775675848247427e-05, |
| "loss": 0.0680863082408905, |
| "mean_token_accuracy": 0.9789745938032866, |
| "num_tokens": 2069577.0, |
| "step": 230 |
| }, |
| { |
| "entropy": 0.05904825783218257, |
| "epoch": 0.5546728296981077, |
| "grad_norm": 0.1385364532470703, |
| "learning_rate": 4.403028877298779e-05, |
| "loss": 0.0629492461681366, |
| "mean_token_accuracy": 0.9808661632239819, |
| "num_tokens": 2165912.0, |
| "step": 240 |
| }, |
| { |
| "entropy": 0.06153596926887985, |
| "epoch": 0.5777841976021956, |
| "grad_norm": 0.23048147559165955, |
| "learning_rate": 4.0337204110222346e-05, |
| "loss": 0.06230597496032715, |
| "mean_token_accuracy": 0.9814305957406759, |
| "num_tokens": 2258129.0, |
| "step": 250 |
| }, |
| { |
| "entropy": 0.07209547915845178, |
| "epoch": 0.6008955655062834, |
| "grad_norm": 0.31134361028671265, |
| "learning_rate": 3.6698157721666246e-05, |
| "loss": 0.07214216589927673, |
| "mean_token_accuracy": 0.9757671516388655, |
| "num_tokens": 2352490.0, |
| "step": 260 |
| }, |
| { |
| "entropy": 0.06986395110143348, |
| "epoch": 0.6240069334103713, |
| "grad_norm": 0.22902478277683258, |
| "learning_rate": 3.313350063085851e-05, |
| "loss": 0.061023789644241336, |
| "mean_token_accuracy": 0.9813447464257479, |
| "num_tokens": 2449939.0, |
| "step": 270 |
| }, |
| { |
| "entropy": 0.06509343424113467, |
| "epoch": 0.647118301314459, |
| "grad_norm": 0.20774446427822113, |
| "learning_rate": 2.9663167846209998e-05, |
| "loss": 0.06663904786109924, |
| "mean_token_accuracy": 0.9776077982038259, |
| "num_tokens": 2536315.0, |
| "step": 280 |
| }, |
| { |
| "entropy": 0.07028964825440198, |
| "epoch": 0.6702296692185469, |
| "grad_norm": 0.5163052678108215, |
| "learning_rate": 2.630656687635007e-05, |
| "loss": 0.06851853728294373, |
| "mean_token_accuracy": 0.9816378477960825, |
| "num_tokens": 2620461.0, |
| "step": 290 |
| }, |
| { |
| "entropy": 0.06622880457434803, |
| "epoch": 0.6933410371226347, |
| "grad_norm": 0.20420022308826447, |
| "learning_rate": 2.3082469195465893e-05, |
| "loss": 0.060293692350387576, |
| "mean_token_accuracy": 0.9812385808676481, |
| "num_tokens": 2707354.0, |
| "step": 300 |
| }, |
| { |
| "entropy": 0.05972621100372635, |
| "epoch": 0.7164524050267225, |
| "grad_norm": 0.23962542414665222, |
| "learning_rate": 2.0008905265604316e-05, |
| "loss": 0.059133869409561154, |
| "mean_token_accuracy": 0.9837360788136721, |
| "num_tokens": 2799514.0, |
| "step": 310 |
| }, |
| { |
| "entropy": 0.064708915000665, |
| "epoch": 0.7395637729308103, |
| "grad_norm": 0.36816108226776123, |
| "learning_rate": 1.7103063703014372e-05, |
| "loss": 0.06433560252189637, |
| "mean_token_accuracy": 0.9801775582134724, |
| "num_tokens": 2886235.0, |
| "step": 320 |
| }, |
| { |
| "entropy": 0.06845741930883378, |
| "epoch": 0.7626751408348982, |
| "grad_norm": 0.3006114065647125, |
| "learning_rate": 1.438119515243277e-05, |
| "loss": 0.08132993578910827, |
| "mean_token_accuracy": 0.9770394150167704, |
| "num_tokens": 2982258.0, |
| "step": 330 |
| }, |
| { |
| "entropy": 0.06192119924526196, |
| "epoch": 0.785786508738986, |
| "grad_norm": 0.18720364570617676, |
| "learning_rate": 1.1858521406886675e-05, |
| "loss": 0.06992543935775757, |
| "mean_token_accuracy": 0.9823945354670286, |
| "num_tokens": 3073595.0, |
| "step": 340 |
| }, |
| { |
| "entropy": 0.06460340030607767, |
| "epoch": 0.8088978766430738, |
| "grad_norm": 0.184926837682724, |
| "learning_rate": 9.549150281252633e-06, |
| "loss": 0.054811447858810425, |
| "mean_token_accuracy": 0.9821836479008198, |
| "num_tokens": 3164209.0, |
| "step": 350 |
| }, |
| { |
| "entropy": 0.058504054805962366, |
| "epoch": 0.8320092445471616, |
| "grad_norm": 0.14722444117069244, |
| "learning_rate": 7.465996715633028e-06, |
| "loss": 0.052557700872421266, |
| "mean_token_accuracy": 0.9828244287520647, |
| "num_tokens": 3251398.0, |
| "step": 360 |
| }, |
| { |
| "entropy": 0.0587506559852045, |
| "epoch": 0.8551206124512495, |
| "grad_norm": 0.2183341383934021, |
| "learning_rate": 5.620710549772295e-06, |
| "loss": 0.047099152207374574, |
| "mean_token_accuracy": 0.9847885105758906, |
| "num_tokens": 3339179.0, |
| "step": 370 |
| }, |
| { |
| "entropy": 0.06087374361522961, |
| "epoch": 0.8782319803553372, |
| "grad_norm": 0.25436943769454956, |
| "learning_rate": 4.023611372427471e-06, |
| "loss": 0.0633423924446106, |
| "mean_token_accuracy": 0.9787029094994069, |
| "num_tokens": 3432843.0, |
| "step": 380 |
| }, |
| { |
| "entropy": 0.06056068325706292, |
| "epoch": 0.9013433482594251, |
| "grad_norm": 0.30825623869895935, |
| "learning_rate": 2.6836308100417873e-06, |
| "loss": 0.06760269403457642, |
| "mean_token_accuracy": 0.9815809104591608, |
| "num_tokens": 3527052.0, |
| "step": 390 |
| }, |
| { |
| "entropy": 0.05664928670958034, |
| "epoch": 0.9244547161635129, |
| "grad_norm": 0.23580507934093475, |
| "learning_rate": 1.6082625774666794e-06, |
| "loss": 0.05145724415779114, |
| "mean_token_accuracy": 0.984954122826457, |
| "num_tokens": 3614848.0, |
| "step": 400 |
| }, |
| { |
| "entropy": 0.05730503358645365, |
| "epoch": 0.9475660840676008, |
| "grad_norm": 0.22909007966518402, |
| "learning_rate": 8.035205700685167e-07, |
| "loss": 0.05865706205368042, |
| "mean_token_accuracy": 0.9834270779043436, |
| "num_tokens": 3710942.0, |
| "step": 410 |
| }, |
| { |
| "entropy": 0.06027186379069462, |
| "epoch": 0.9706774519716885, |
| "grad_norm": 0.18639437854290009, |
| "learning_rate": 2.7390523158633554e-07, |
| "loss": 0.0708554208278656, |
| "mean_token_accuracy": 0.9833787675946951, |
| "num_tokens": 3796461.0, |
| "step": 420 |
| }, |
| { |
| "entropy": 0.06049862803483848, |
| "epoch": 0.9937888198757764, |
| "grad_norm": 0.4046548902988434, |
| "learning_rate": 2.237838582483387e-08, |
| "loss": 0.0617963433265686, |
| "mean_token_accuracy": 0.9795267052948475, |
| "num_tokens": 3883780.0, |
| "step": 430 |
| } |
| ], |
| "logging_steps": 10, |
| "max_steps": 433, |
| "num_input_tokens_seen": 0, |
| "num_train_epochs": 1, |
| "save_steps": 100, |
| "stateful_callbacks": { |
| "TrainerControl": { |
| "args": { |
| "should_epoch_stop": false, |
| "should_evaluate": false, |
| "should_log": false, |
| "should_save": true, |
| "should_training_stop": true |
| }, |
| "attributes": {} |
| } |
| }, |
| "total_flos": 1.6767907013265408e+17, |
| "train_batch_size": 1, |
| "trial_name": null, |
| "trial_params": null |
| } |
|
|