n4ksworks's picture
ad9f0e7a370f: checkpoint-433
9b8bd1e verified
Raw
History Blame Contribute Delete
13.9 kB
{
"best_global_step": null,
"best_metric": null,
"best_model_checkpoint": null,
"epoch": 1.0,
"eval_steps": 500,
"global_step": 433,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"entropy": 0.11948550771921873,
"epoch": 0.023111367904087823,
"grad_norm": 0.26614415645599365,
"learning_rate": 6.923076923076924e-05,
"loss": 0.27834961414337156,
"mean_token_accuracy": 0.9158459510654211,
"num_tokens": 91409.0,
"step": 10
},
{
"entropy": 0.14536615274846554,
"epoch": 0.046222735808175645,
"grad_norm": 0.28414708375930786,
"learning_rate": 9.994965332706573e-05,
"loss": 0.13056882619857788,
"mean_token_accuracy": 0.9612345997244119,
"num_tokens": 186627.0,
"step": 20
},
{
"entropy": 0.11003581081749872,
"epoch": 0.06933410371226346,
"grad_norm": 0.2106354683637619,
"learning_rate": 9.964234631709187e-05,
"loss": 0.09309924244880677,
"mean_token_accuracy": 0.9709797658026218,
"num_tokens": 276604.0,
"step": 30
},
{
"entropy": 0.0915378995705396,
"epoch": 0.09244547161635129,
"grad_norm": 0.2663438022136688,
"learning_rate": 9.905741916970864e-05,
"loss": 0.10451314449310303,
"mean_token_accuracy": 0.9715173915028572,
"num_tokens": 368108.0,
"step": 40
},
{
"entropy": 0.10749789654510096,
"epoch": 0.11555683952043912,
"grad_norm": 0.17998279631137848,
"learning_rate": 9.819814303479267e-05,
"loss": 0.10180811882019043,
"mean_token_accuracy": 0.9665989849716425,
"num_tokens": 457334.0,
"step": 50
},
{
"entropy": 0.08793499013991095,
"epoch": 0.13866820742452693,
"grad_norm": 0.18421846628189087,
"learning_rate": 9.706932333304517e-05,
"loss": 0.10302398204803467,
"mean_token_accuracy": 0.9739916753023863,
"num_tokens": 547458.0,
"step": 60
},
{
"entropy": 0.10031854717526585,
"epoch": 0.16177957532861476,
"grad_norm": 0.1583297848701477,
"learning_rate": 9.567727288213005e-05,
"loss": 0.09594225287437438,
"mean_token_accuracy": 0.9684251010417938,
"num_tokens": 633576.0,
"step": 70
},
{
"entropy": 0.10018112544203177,
"epoch": 0.18489094323270258,
"grad_norm": 0.17029769718647003,
"learning_rate": 9.40297765928369e-05,
"loss": 0.08666939735412597,
"mean_token_accuracy": 0.9722081393003463,
"num_tokens": 725021.0,
"step": 80
},
{
"entropy": 0.08978840237832628,
"epoch": 0.2080023111367904,
"grad_norm": 0.21113114058971405,
"learning_rate": 9.213604793270196e-05,
"loss": 0.10337703227996826,
"mean_token_accuracy": 0.9718282397836446,
"num_tokens": 809468.0,
"step": 90
},
{
"entropy": 0.08143368383025518,
"epoch": 0.23111367904087823,
"grad_norm": 0.2660817801952362,
"learning_rate": 9.000667740056032e-05,
"loss": 0.07579125165939331,
"mean_token_accuracy": 0.9780994143337012,
"num_tokens": 898185.0,
"step": 100
},
{
"entropy": 0.07822052207193338,
"epoch": 0.25422504694496606,
"grad_norm": 0.25105559825897217,
"learning_rate": 8.765357330018056e-05,
"loss": 0.0827728271484375,
"mean_token_accuracy": 0.9731388352811337,
"num_tokens": 988490.0,
"step": 110
},
{
"entropy": 0.0850134992855601,
"epoch": 0.27733641484905386,
"grad_norm": 0.15802568197250366,
"learning_rate": 8.508989514419958e-05,
"loss": 0.07012671828269959,
"mean_token_accuracy": 0.9775275759398937,
"num_tokens": 1078890.0,
"step": 120
},
{
"entropy": 0.07775390069000424,
"epoch": 0.3004477827531417,
"grad_norm": 0.3077862858772278,
"learning_rate": 8.232998006078997e-05,
"loss": 0.07896218299865723,
"mean_token_accuracy": 0.9768860664218664,
"num_tokens": 1171456.0,
"step": 130
},
{
"entropy": 0.06990418929490261,
"epoch": 0.3235591506572295,
"grad_norm": 0.20379361510276794,
"learning_rate": 7.938926261462366e-05,
"loss": 0.0791102945804596,
"mean_token_accuracy": 0.9748555511236191,
"num_tokens": 1267191.0,
"step": 140
},
{
"entropy": 0.07729233189020306,
"epoch": 0.34667051856131736,
"grad_norm": 0.2790727913379669,
"learning_rate": 7.628418849052523e-05,
"loss": 0.07758013606071472,
"mean_token_accuracy": 0.9756737377494573,
"num_tokens": 1354080.0,
"step": 150
},
{
"entropy": 0.08708043664228171,
"epoch": 0.36978188646540516,
"grad_norm": 0.269930899143219,
"learning_rate": 7.303212252253162e-05,
"loss": 0.08181141018867492,
"mean_token_accuracy": 0.9762891136109829,
"num_tokens": 1442199.0,
"step": 160
},
{
"entropy": 0.081081559494487,
"epoch": 0.392893254369493,
"grad_norm": 0.1513710916042328,
"learning_rate": 6.965125158269619e-05,
"loss": 0.0810213029384613,
"mean_token_accuracy": 0.9729760400950909,
"num_tokens": 1537565.0,
"step": 170
},
{
"entropy": 0.07967969757737592,
"epoch": 0.4160046222735808,
"grad_norm": 0.26842933893203735,
"learning_rate": 6.616048287272301e-05,
"loss": 0.0828117549419403,
"mean_token_accuracy": 0.9750622134655714,
"num_tokens": 1631534.0,
"step": 180
},
{
"entropy": 0.08117348714149557,
"epoch": 0.4391159901776686,
"grad_norm": 1.2517547607421875,
"learning_rate": 6.257933818722543e-05,
"loss": 0.07101889252662659,
"mean_token_accuracy": 0.9764051765203476,
"num_tokens": 1718429.0,
"step": 190
},
{
"entropy": 0.0724065299378708,
"epoch": 0.46222735808175647,
"grad_norm": 0.3557807505130768,
"learning_rate": 5.8927844739931834e-05,
"loss": 0.07825151681900025,
"mean_token_accuracy": 0.9812528945505619,
"num_tokens": 1804347.0,
"step": 200
},
{
"entropy": 0.07162103470182046,
"epoch": 0.48533872598584427,
"grad_norm": 0.13491679728031158,
"learning_rate": 5.522642316338268e-05,
"loss": 0.06295353174209595,
"mean_token_accuracy": 0.982288584113121,
"num_tokens": 1893854.0,
"step": 210
},
{
"entropy": 0.06431798301055096,
"epoch": 0.5084500938899321,
"grad_norm": 0.18494592607021332,
"learning_rate": 5.149577330846993e-05,
"loss": 0.058886730670928956,
"mean_token_accuracy": 0.9838358085602522,
"num_tokens": 1983498.0,
"step": 220
},
{
"entropy": 0.06635294057487044,
"epoch": 0.53156146179402,
"grad_norm": 0.24623480439186096,
"learning_rate": 4.775675848247427e-05,
"loss": 0.0680863082408905,
"mean_token_accuracy": 0.9789745938032866,
"num_tokens": 2069577.0,
"step": 230
},
{
"entropy": 0.05904825783218257,
"epoch": 0.5546728296981077,
"grad_norm": 0.1385364532470703,
"learning_rate": 4.403028877298779e-05,
"loss": 0.0629492461681366,
"mean_token_accuracy": 0.9808661632239819,
"num_tokens": 2165912.0,
"step": 240
},
{
"entropy": 0.06153596926887985,
"epoch": 0.5777841976021956,
"grad_norm": 0.23048147559165955,
"learning_rate": 4.0337204110222346e-05,
"loss": 0.06230597496032715,
"mean_token_accuracy": 0.9814305957406759,
"num_tokens": 2258129.0,
"step": 250
},
{
"entropy": 0.07209547915845178,
"epoch": 0.6008955655062834,
"grad_norm": 0.31134361028671265,
"learning_rate": 3.6698157721666246e-05,
"loss": 0.07214216589927673,
"mean_token_accuracy": 0.9757671516388655,
"num_tokens": 2352490.0,
"step": 260
},
{
"entropy": 0.06986395110143348,
"epoch": 0.6240069334103713,
"grad_norm": 0.22902478277683258,
"learning_rate": 3.313350063085851e-05,
"loss": 0.061023789644241336,
"mean_token_accuracy": 0.9813447464257479,
"num_tokens": 2449939.0,
"step": 270
},
{
"entropy": 0.06509343424113467,
"epoch": 0.647118301314459,
"grad_norm": 0.20774446427822113,
"learning_rate": 2.9663167846209998e-05,
"loss": 0.06663904786109924,
"mean_token_accuracy": 0.9776077982038259,
"num_tokens": 2536315.0,
"step": 280
},
{
"entropy": 0.07028964825440198,
"epoch": 0.6702296692185469,
"grad_norm": 0.5163052678108215,
"learning_rate": 2.630656687635007e-05,
"loss": 0.06851853728294373,
"mean_token_accuracy": 0.9816378477960825,
"num_tokens": 2620461.0,
"step": 290
},
{
"entropy": 0.06622880457434803,
"epoch": 0.6933410371226347,
"grad_norm": 0.20420022308826447,
"learning_rate": 2.3082469195465893e-05,
"loss": 0.060293692350387576,
"mean_token_accuracy": 0.9812385808676481,
"num_tokens": 2707354.0,
"step": 300
},
{
"entropy": 0.05972621100372635,
"epoch": 0.7164524050267225,
"grad_norm": 0.23962542414665222,
"learning_rate": 2.0008905265604316e-05,
"loss": 0.059133869409561154,
"mean_token_accuracy": 0.9837360788136721,
"num_tokens": 2799514.0,
"step": 310
},
{
"entropy": 0.064708915000665,
"epoch": 0.7395637729308103,
"grad_norm": 0.36816108226776123,
"learning_rate": 1.7103063703014372e-05,
"loss": 0.06433560252189637,
"mean_token_accuracy": 0.9801775582134724,
"num_tokens": 2886235.0,
"step": 320
},
{
"entropy": 0.06845741930883378,
"epoch": 0.7626751408348982,
"grad_norm": 0.3006114065647125,
"learning_rate": 1.438119515243277e-05,
"loss": 0.08132993578910827,
"mean_token_accuracy": 0.9770394150167704,
"num_tokens": 2982258.0,
"step": 330
},
{
"entropy": 0.06192119924526196,
"epoch": 0.785786508738986,
"grad_norm": 0.18720364570617676,
"learning_rate": 1.1858521406886675e-05,
"loss": 0.06992543935775757,
"mean_token_accuracy": 0.9823945354670286,
"num_tokens": 3073595.0,
"step": 340
},
{
"entropy": 0.06460340030607767,
"epoch": 0.8088978766430738,
"grad_norm": 0.184926837682724,
"learning_rate": 9.549150281252633e-06,
"loss": 0.054811447858810425,
"mean_token_accuracy": 0.9821836479008198,
"num_tokens": 3164209.0,
"step": 350
},
{
"entropy": 0.058504054805962366,
"epoch": 0.8320092445471616,
"grad_norm": 0.14722444117069244,
"learning_rate": 7.465996715633028e-06,
"loss": 0.052557700872421266,
"mean_token_accuracy": 0.9828244287520647,
"num_tokens": 3251398.0,
"step": 360
},
{
"entropy": 0.0587506559852045,
"epoch": 0.8551206124512495,
"grad_norm": 0.2183341383934021,
"learning_rate": 5.620710549772295e-06,
"loss": 0.047099152207374574,
"mean_token_accuracy": 0.9847885105758906,
"num_tokens": 3339179.0,
"step": 370
},
{
"entropy": 0.06087374361522961,
"epoch": 0.8782319803553372,
"grad_norm": 0.25436943769454956,
"learning_rate": 4.023611372427471e-06,
"loss": 0.0633423924446106,
"mean_token_accuracy": 0.9787029094994069,
"num_tokens": 3432843.0,
"step": 380
},
{
"entropy": 0.06056068325706292,
"epoch": 0.9013433482594251,
"grad_norm": 0.30825623869895935,
"learning_rate": 2.6836308100417873e-06,
"loss": 0.06760269403457642,
"mean_token_accuracy": 0.9815809104591608,
"num_tokens": 3527052.0,
"step": 390
},
{
"entropy": 0.05664928670958034,
"epoch": 0.9244547161635129,
"grad_norm": 0.23580507934093475,
"learning_rate": 1.6082625774666794e-06,
"loss": 0.05145724415779114,
"mean_token_accuracy": 0.984954122826457,
"num_tokens": 3614848.0,
"step": 400
},
{
"entropy": 0.05730503358645365,
"epoch": 0.9475660840676008,
"grad_norm": 0.22909007966518402,
"learning_rate": 8.035205700685167e-07,
"loss": 0.05865706205368042,
"mean_token_accuracy": 0.9834270779043436,
"num_tokens": 3710942.0,
"step": 410
},
{
"entropy": 0.06027186379069462,
"epoch": 0.9706774519716885,
"grad_norm": 0.18639437854290009,
"learning_rate": 2.7390523158633554e-07,
"loss": 0.0708554208278656,
"mean_token_accuracy": 0.9833787675946951,
"num_tokens": 3796461.0,
"step": 420
},
{
"entropy": 0.06049862803483848,
"epoch": 0.9937888198757764,
"grad_norm": 0.4046548902988434,
"learning_rate": 2.237838582483387e-08,
"loss": 0.0617963433265686,
"mean_token_accuracy": 0.9795267052948475,
"num_tokens": 3883780.0,
"step": 430
}
],
"logging_steps": 10,
"max_steps": 433,
"num_input_tokens_seen": 0,
"num_train_epochs": 1,
"save_steps": 100,
"stateful_callbacks": {
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": true,
"should_training_stop": true
},
"attributes": {}
}
},
"total_flos": 1.6767907013265408e+17,
"train_batch_size": 1,
"trial_name": null,
"trial_params": null
}