vi-lo / trainer_state.json
hai2131's picture
Upload checkpoint with token
f819566 verified
Raw
History Blame Contribute Delete
22.7 kB
{
"best_global_step": null,
"best_metric": null,
"best_model_checkpoint": null,
"epoch": 1.0,
"eval_steps": 500,
"global_step": 1189,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"epoch": 0.008413967185527976,
"grad_norm": 5.52308988571167,
"learning_rate": 3.7815126050420167e-06,
"loss": 2.3433109283447267,
"step": 10
},
{
"epoch": 0.016827934371055953,
"grad_norm": 2.464683771133423,
"learning_rate": 7.983193277310924e-06,
"loss": 1.652139663696289,
"step": 20
},
{
"epoch": 0.02524190155658393,
"grad_norm": 2.0469274520874023,
"learning_rate": 1.2184873949579832e-05,
"loss": 1.1116899490356444,
"step": 30
},
{
"epoch": 0.033655868742111905,
"grad_norm": 0.7639474868774414,
"learning_rate": 1.638655462184874e-05,
"loss": 0.7363139629364014,
"step": 40
},
{
"epoch": 0.04206983592763988,
"grad_norm": 0.5862300992012024,
"learning_rate": 2.058823529411765e-05,
"loss": 0.6817426681518555,
"step": 50
},
{
"epoch": 0.05048380311316786,
"grad_norm": 0.5755972266197205,
"learning_rate": 2.4789915966386556e-05,
"loss": 0.6467609405517578,
"step": 60
},
{
"epoch": 0.058897770298695834,
"grad_norm": 0.6070194840431213,
"learning_rate": 2.8991596638655467e-05,
"loss": 0.6276434898376465,
"step": 70
},
{
"epoch": 0.06731173748422381,
"grad_norm": 0.5020004510879517,
"learning_rate": 3.319327731092437e-05,
"loss": 0.6195865154266358,
"step": 80
},
{
"epoch": 0.07572570466975179,
"grad_norm": 0.6197963953018188,
"learning_rate": 3.739495798319328e-05,
"loss": 0.6030911445617676,
"step": 90
},
{
"epoch": 0.08413967185527976,
"grad_norm": 0.5069003105163574,
"learning_rate": 4.159663865546219e-05,
"loss": 0.6262809276580811,
"step": 100
},
{
"epoch": 0.09255363904080774,
"grad_norm": 0.5204105377197266,
"learning_rate": 4.579831932773109e-05,
"loss": 0.6028512954711914,
"step": 110
},
{
"epoch": 0.10096760622633572,
"grad_norm": 0.5738821625709534,
"learning_rate": 5e-05,
"loss": 0.5683792114257813,
"step": 120
},
{
"epoch": 0.10938157341186369,
"grad_norm": 0.49655693769454956,
"learning_rate": 4.998922515567496e-05,
"loss": 0.5995708465576172,
"step": 130
},
{
"epoch": 0.11779554059739167,
"grad_norm": 0.5619757771492004,
"learning_rate": 4.995690991048146e-05,
"loss": 0.564251708984375,
"step": 140
},
{
"epoch": 0.12620950778291964,
"grad_norm": 0.4584529399871826,
"learning_rate": 4.99030821197584e-05,
"loss": 0.5650043487548828,
"step": 150
},
{
"epoch": 0.13462347496844762,
"grad_norm": 0.4953455626964569,
"learning_rate": 4.982778818239101e-05,
"loss": 0.5550412178039551,
"step": 160
},
{
"epoch": 0.1430374421539756,
"grad_norm": 0.4682803750038147,
"learning_rate": 4.97310930008156e-05,
"loss": 0.5843101024627686,
"step": 170
},
{
"epoch": 0.15145140933950357,
"grad_norm": 0.4659602642059326,
"learning_rate": 4.961307992507443e-05,
"loss": 0.5531447410583497,
"step": 180
},
{
"epoch": 0.15986537652503155,
"grad_norm": 0.4590919315814972,
"learning_rate": 4.947385068096907e-05,
"loss": 0.5672853469848633,
"step": 190
},
{
"epoch": 0.16827934371055953,
"grad_norm": 0.45025721192359924,
"learning_rate": 4.9313525282373974e-05,
"loss": 0.5719799041748047,
"step": 200
},
{
"epoch": 0.1766933108960875,
"grad_norm": 0.403734415769577,
"learning_rate": 4.9132241927786035e-05,
"loss": 0.5558256149291992,
"step": 210
},
{
"epoch": 0.18510727808161548,
"grad_norm": 0.4194377064704895,
"learning_rate": 4.893015688119921e-05,
"loss": 0.5472552299499511,
"step": 220
},
{
"epoch": 0.19352124526714345,
"grad_norm": 0.4364999234676361,
"learning_rate": 4.870744433740688e-05,
"loss": 0.5540333747863769,
"step": 230
},
{
"epoch": 0.20193521245267143,
"grad_norm": 0.4469076097011566,
"learning_rate": 4.8464296271848155e-05,
"loss": 0.5611124038696289,
"step": 240
},
{
"epoch": 0.2103491796381994,
"grad_norm": 0.4727751314640045,
"learning_rate": 4.8200922275127355e-05,
"loss": 0.5728967189788818,
"step": 250
},
{
"epoch": 0.21876314682372738,
"grad_norm": 0.44017159938812256,
"learning_rate": 4.7917549372349616e-05,
"loss": 0.5312878131866455,
"step": 260
},
{
"epoch": 0.22717711400925536,
"grad_norm": 0.4599165618419647,
"learning_rate": 4.761442182742799e-05,
"loss": 0.5565039634704589,
"step": 270
},
{
"epoch": 0.23559108119478334,
"grad_norm": 0.4193755090236664,
"learning_rate": 4.7291800932531064e-05,
"loss": 0.540295934677124,
"step": 280
},
{
"epoch": 0.2440050483803113,
"grad_norm": 0.45968326926231384,
"learning_rate": 4.694996478285231e-05,
"loss": 0.5284191131591797,
"step": 290
},
{
"epoch": 0.2524190155658393,
"grad_norm": 0.3882873058319092,
"learning_rate": 4.6589208036895535e-05,
"loss": 0.5438860416412353,
"step": 300
},
{
"epoch": 0.2608329827513673,
"grad_norm": 0.4749172329902649,
"learning_rate": 4.620984166248288e-05,
"loss": 0.5341141700744629,
"step": 310
},
{
"epoch": 0.26924694993689524,
"grad_norm": 0.433540403842926,
"learning_rate": 4.581219266870446e-05,
"loss": 0.5331087112426758,
"step": 320
},
{
"epoch": 0.27766091712242325,
"grad_norm": 0.4713405668735504,
"learning_rate": 4.53966038240406e-05,
"loss": 0.5343032836914062,
"step": 330
},
{
"epoch": 0.2860748843079512,
"grad_norm": 0.3954574465751648,
"learning_rate": 4.496343336089965e-05,
"loss": 0.5209596633911133,
"step": 340
},
{
"epoch": 0.2944888514934792,
"grad_norm": 0.41449224948883057,
"learning_rate": 4.4513054666826146e-05,
"loss": 0.5443466663360595,
"step": 350
},
{
"epoch": 0.30290281867900715,
"grad_norm": 0.4463038742542267,
"learning_rate": 4.4045855962645363e-05,
"loss": 0.5250945091247559,
"step": 360
},
{
"epoch": 0.31131678586453515,
"grad_norm": 0.38618430495262146,
"learning_rate": 4.3562239967821805e-05,
"loss": 0.5211163997650147,
"step": 370
},
{
"epoch": 0.3197307530500631,
"grad_norm": 0.39523622393608093,
"learning_rate": 4.306262355332006e-05,
"loss": 0.5420632362365723,
"step": 380
},
{
"epoch": 0.3281447202355911,
"grad_norm": 0.3752327263355255,
"learning_rate": 4.254743738226721e-05,
"loss": 0.5398785591125488,
"step": 390
},
{
"epoch": 0.33655868742111905,
"grad_norm": 0.42189350724220276,
"learning_rate": 4.201712553872658e-05,
"loss": 0.5390230655670166,
"step": 400
},
{
"epoch": 0.34497265460664706,
"grad_norm": 0.3766239583492279,
"learning_rate": 4.147214514490278e-05,
"loss": 0.518889045715332,
"step": 410
},
{
"epoch": 0.353386621792175,
"grad_norm": 0.38176998496055603,
"learning_rate": 4.0912965967108125e-05,
"loss": 0.5434842109680176,
"step": 420
},
{
"epoch": 0.361800588977703,
"grad_norm": 0.43197810649871826,
"learning_rate": 4.034007001082985e-05,
"loss": 0.5342769145965576,
"step": 430
},
{
"epoch": 0.37021455616323096,
"grad_norm": 0.4258919060230255,
"learning_rate": 3.975395110524742e-05,
"loss": 0.511136817932129,
"step": 440
},
{
"epoch": 0.37862852334875896,
"grad_norm": 0.42476603388786316,
"learning_rate": 3.9155114477557933e-05,
"loss": 0.5225476264953614,
"step": 450
},
{
"epoch": 0.3870424905342869,
"grad_norm": 0.38390135765075684,
"learning_rate": 3.854407631747654e-05,
"loss": 0.5341035842895507,
"step": 460
},
{
"epoch": 0.3954564577198149,
"grad_norm": 0.3868181109428406,
"learning_rate": 3.792136333228735e-05,
"loss": 0.5320357799530029,
"step": 470
},
{
"epoch": 0.40387042490534286,
"grad_norm": 0.4116423726081848,
"learning_rate": 3.728751229282836e-05,
"loss": 0.523101806640625,
"step": 480
},
{
"epoch": 0.41228439209087087,
"grad_norm": 0.37969765067100525,
"learning_rate": 3.664306957080159e-05,
"loss": 0.5135246753692627,
"step": 490
},
{
"epoch": 0.4206983592763988,
"grad_norm": 0.4192858934402466,
"learning_rate": 3.598859066780754e-05,
"loss": 0.5182962417602539,
"step": 500
},
{
"epoch": 0.4291123264619268,
"grad_norm": 0.3658738136291504,
"learning_rate": 3.5324639736509714e-05,
"loss": 0.5355247020721435,
"step": 510
},
{
"epoch": 0.43752629364745477,
"grad_norm": 0.4016229808330536,
"learning_rate": 3.4651789094342044e-05,
"loss": 0.513187026977539,
"step": 520
},
{
"epoch": 0.44594026083298277,
"grad_norm": 0.367687463760376,
"learning_rate": 3.39706187301784e-05,
"loss": 0.5053876876831055,
"step": 530
},
{
"epoch": 0.4543542280185107,
"grad_norm": 0.36950457096099854,
"learning_rate": 3.3281715804389403e-05,
"loss": 0.5256223201751709,
"step": 540
},
{
"epoch": 0.4627681952040387,
"grad_norm": 0.4080349802970886,
"learning_rate": 3.258567414271748e-05,
"loss": 0.5013936519622803,
"step": 550
},
{
"epoch": 0.47118216238956667,
"grad_norm": 0.4254259765148163,
"learning_rate": 3.18830937244065e-05,
"loss": 0.5354822635650635,
"step": 560
},
{
"epoch": 0.4795961295750947,
"grad_norm": 0.3755163252353668,
"learning_rate": 3.117458016502711e-05,
"loss": 0.5031180381774902,
"step": 570
},
{
"epoch": 0.4880100967606226,
"grad_norm": 0.36723464727401733,
"learning_rate": 3.046074419444366e-05,
"loss": 0.5144643783569336,
"step": 580
},
{
"epoch": 0.49642406394615063,
"grad_norm": 0.3998170495033264,
"learning_rate": 2.9742201130372693e-05,
"loss": 0.5088897705078125,
"step": 590
},
{
"epoch": 0.5048380311316786,
"grad_norm": 0.3749750554561615,
"learning_rate": 2.901957034798671e-05,
"loss": 0.4881998062133789,
"step": 600
},
{
"epoch": 0.5132519983172066,
"grad_norm": 0.36973705887794495,
"learning_rate": 2.8293474746020472e-05,
"loss": 0.49605550765991213,
"step": 610
},
{
"epoch": 0.5216659655027346,
"grad_norm": 0.34159213304519653,
"learning_rate": 2.756454020984009e-05,
"loss": 0.516224479675293,
"step": 620
},
{
"epoch": 0.5300799326882625,
"grad_norm": 0.37420156598091125,
"learning_rate": 2.68333950719376e-05,
"loss": 0.5166028022766114,
"step": 630
},
{
"epoch": 0.5384938998737905,
"grad_norm": 0.40217989683151245,
"learning_rate": 2.6100669570316195e-05,
"loss": 0.5076315879821778,
"step": 640
},
{
"epoch": 0.5469078670593185,
"grad_norm": 0.40898215770721436,
"learning_rate": 2.5366995305232916e-05,
"loss": 0.5209317207336426,
"step": 650
},
{
"epoch": 0.5553218342448465,
"grad_norm": 0.35764551162719727,
"learning_rate": 2.463300469476709e-05,
"loss": 0.4946465492248535,
"step": 660
},
{
"epoch": 0.5637358014303744,
"grad_norm": 0.3629818558692932,
"learning_rate": 2.3899330429683807e-05,
"loss": 0.5308743476867676,
"step": 670
},
{
"epoch": 0.5721497686159024,
"grad_norm": 0.405501127243042,
"learning_rate": 2.3166604928062406e-05,
"loss": 0.498077392578125,
"step": 680
},
{
"epoch": 0.5805637358014304,
"grad_norm": 0.3686980903148651,
"learning_rate": 2.243545979015992e-05,
"loss": 0.4924039840698242,
"step": 690
},
{
"epoch": 0.5889777029869584,
"grad_norm": 0.37260791659355164,
"learning_rate": 2.1706525253979534e-05,
"loss": 0.49569120407104494,
"step": 700
},
{
"epoch": 0.5973916701724863,
"grad_norm": 0.33350419998168945,
"learning_rate": 2.0980429652013297e-05,
"loss": 0.5090860843658447,
"step": 710
},
{
"epoch": 0.6058056373580143,
"grad_norm": 0.34768742322921753,
"learning_rate": 2.025779886962731e-05,
"loss": 0.5070259094238281,
"step": 720
},
{
"epoch": 0.6142196045435423,
"grad_norm": 0.420901894569397,
"learning_rate": 1.9539255805556344e-05,
"loss": 0.5386468887329101,
"step": 730
},
{
"epoch": 0.6226335717290703,
"grad_norm": 0.3629691004753113,
"learning_rate": 1.8825419834972902e-05,
"loss": 0.5100968360900879,
"step": 740
},
{
"epoch": 0.6310475389145982,
"grad_norm": 0.37897151708602905,
"learning_rate": 1.811690627559351e-05,
"loss": 0.4982123374938965,
"step": 750
},
{
"epoch": 0.6394615061001262,
"grad_norm": 0.41103869676589966,
"learning_rate": 1.7414325857282526e-05,
"loss": 0.49430279731750487,
"step": 760
},
{
"epoch": 0.6478754732856542,
"grad_norm": 0.419221967458725,
"learning_rate": 1.6718284195610606e-05,
"loss": 0.5015609741210938,
"step": 770
},
{
"epoch": 0.6562894404711822,
"grad_norm": 0.4170032739639282,
"learning_rate": 1.6029381269821604e-05,
"loss": 0.5064301490783691,
"step": 780
},
{
"epoch": 0.6647034076567101,
"grad_norm": 0.3627830147743225,
"learning_rate": 1.534821090565796e-05,
"loss": 0.5212658882141114,
"step": 790
},
{
"epoch": 0.6731173748422381,
"grad_norm": 0.3786025941371918,
"learning_rate": 1.4675360263490295e-05,
"loss": 0.5047730445861817,
"step": 800
},
{
"epoch": 0.6815313420277661,
"grad_norm": 0.35577592253685,
"learning_rate": 1.4011409332192472e-05,
"loss": 0.507427167892456,
"step": 810
},
{
"epoch": 0.6899453092132941,
"grad_norm": 0.4018078148365021,
"learning_rate": 1.335693042919841e-05,
"loss": 0.5077090740203858,
"step": 820
},
{
"epoch": 0.698359276398822,
"grad_norm": 0.42130208015441895,
"learning_rate": 1.2712487707171645e-05,
"loss": 0.5090289115905762,
"step": 830
},
{
"epoch": 0.70677324358435,
"grad_norm": 0.36082717776298523,
"learning_rate": 1.2078636667712649e-05,
"loss": 0.5091034889221191,
"step": 840
},
{
"epoch": 0.715187210769878,
"grad_norm": 0.4265519678592682,
"learning_rate": 1.1455923682523475e-05,
"loss": 0.517885971069336,
"step": 850
},
{
"epoch": 0.723601177955406,
"grad_norm": 0.34974387288093567,
"learning_rate": 1.0844885522442074e-05,
"loss": 0.5208765029907226,
"step": 860
},
{
"epoch": 0.7320151451409339,
"grad_norm": 0.35048907995224,
"learning_rate": 1.0246048894752589e-05,
"loss": 0.49442739486694337,
"step": 870
},
{
"epoch": 0.7404291123264619,
"grad_norm": 0.42127740383148193,
"learning_rate": 9.659929989170154e-06,
"loss": 0.4968879699707031,
"step": 880
},
{
"epoch": 0.7488430795119899,
"grad_norm": 0.39883238077163696,
"learning_rate": 9.087034032891883e-06,
"loss": 0.5004133224487305,
"step": 890
},
{
"epoch": 0.7572570466975179,
"grad_norm": 0.35957688093185425,
"learning_rate": 8.527854855097225e-06,
"loss": 0.47731876373291016,
"step": 900
},
{
"epoch": 0.7656710138830458,
"grad_norm": 0.3513461947441101,
"learning_rate": 7.982874461273438e-06,
"loss": 0.4781493186950684,
"step": 910
},
{
"epoch": 0.7740849810685738,
"grad_norm": 0.3396323323249817,
"learning_rate": 7.452562617732794e-06,
"loss": 0.48314857482910156,
"step": 920
},
{
"epoch": 0.7824989482541018,
"grad_norm": 0.35780707001686096,
"learning_rate": 6.93737644667995e-06,
"loss": 0.5017595291137695,
"step": 930
},
{
"epoch": 0.7909129154396298,
"grad_norm": 0.38778507709503174,
"learning_rate": 6.4377600321782e-06,
"loss": 0.507000732421875,
"step": 940
},
{
"epoch": 0.7993268826251577,
"grad_norm": 0.3847760856151581,
"learning_rate": 5.954144037354645e-06,
"loss": 0.5197389602661133,
"step": 950
},
{
"epoch": 0.8077408498106857,
"grad_norm": 0.45024698972702026,
"learning_rate": 5.486945333173851e-06,
"loss": 0.4876283645629883,
"step": 960
},
{
"epoch": 0.8161548169962137,
"grad_norm": 0.39939478039741516,
"learning_rate": 5.036566639100351e-06,
"loss": 0.5140261173248291,
"step": 970
},
{
"epoch": 0.8245687841817417,
"grad_norm": 0.35428670048713684,
"learning_rate": 4.603396175959404e-06,
"loss": 0.49584507942199707,
"step": 980
},
{
"epoch": 0.8329827513672696,
"grad_norm": 0.3984188139438629,
"learning_rate": 4.187807331295549e-06,
"loss": 0.5067983627319336,
"step": 990
},
{
"epoch": 0.8413967185527976,
"grad_norm": 0.3336002230644226,
"learning_rate": 3.7901583375171273e-06,
"loss": 0.48990588188171386,
"step": 1000
},
{
"epoch": 0.8498106857383256,
"grad_norm": 0.36534884572029114,
"learning_rate": 3.4107919631044732e-06,
"loss": 0.4993289947509766,
"step": 1010
},
{
"epoch": 0.8582246529238536,
"grad_norm": 0.3818396031856537,
"learning_rate": 3.0500352171476897e-06,
"loss": 0.5111321449279785,
"step": 1020
},
{
"epoch": 0.8666386201093815,
"grad_norm": 0.34951460361480713,
"learning_rate": 2.708199067468939e-06,
"loss": 0.5004692077636719,
"step": 1030
},
{
"epoch": 0.8750525872949095,
"grad_norm": 0.34865912795066833,
"learning_rate": 2.385578172572009e-06,
"loss": 0.48421926498413087,
"step": 1040
},
{
"epoch": 0.8834665544804375,
"grad_norm": 0.3657017648220062,
"learning_rate": 2.0824506276503897e-06,
"loss": 0.49608964920043946,
"step": 1050
},
{
"epoch": 0.8918805216659655,
"grad_norm": 0.36945363879203796,
"learning_rate": 1.7990777248726442e-06,
"loss": 0.49359979629516604,
"step": 1060
},
{
"epoch": 0.9002944888514934,
"grad_norm": 0.40284156799316406,
"learning_rate": 1.5357037281518522e-06,
"loss": 0.5033816337585449,
"step": 1070
},
{
"epoch": 0.9087084560370214,
"grad_norm": 0.37313589453697205,
"learning_rate": 1.2925556625931173e-06,
"loss": 0.4955038547515869,
"step": 1080
},
{
"epoch": 0.9171224232225494,
"grad_norm": 0.37710103392601013,
"learning_rate": 1.0698431188007952e-06,
"loss": 0.505764389038086,
"step": 1090
},
{
"epoch": 0.9255363904080774,
"grad_norm": 0.36644142866134644,
"learning_rate": 8.677580722139672e-07,
"loss": 0.4921365737915039,
"step": 1100
},
{
"epoch": 0.9339503575936053,
"grad_norm": 0.3648861050605774,
"learning_rate": 6.864747176260289e-07,
"loss": 0.5047013759613037,
"step": 1110
},
{
"epoch": 0.9423643247791333,
"grad_norm": 0.34883520007133484,
"learning_rate": 5.261493190309303e-07,
"loss": 0.4873218536376953,
"step": 1120
},
{
"epoch": 0.9507782919646613,
"grad_norm": 0.35124751925468445,
"learning_rate": 3.8692007492557024e-07,
"loss": 0.5037882804870606,
"step": 1130
},
{
"epoch": 0.9591922591501894,
"grad_norm": 0.39010515809059143,
"learning_rate": 2.6890699918440676e-07,
"loss": 0.512601661682129,
"step": 1140
},
{
"epoch": 0.9676062263357172,
"grad_norm": 0.3450499176979065,
"learning_rate": 1.7221181760899152e-07,
"loss": 0.49816131591796875,
"step": 1150
},
{
"epoch": 0.9760201935212452,
"grad_norm": 0.3444308340549469,
"learning_rate": 9.691788024160376e-08,
"loss": 0.5218628883361817,
"step": 1160
},
{
"epoch": 0.9844341607067733,
"grad_norm": 0.37698882818222046,
"learning_rate": 4.3090089518540987e-08,
"loss": 0.5030824661254882,
"step": 1170
},
{
"epoch": 0.9928481278923013,
"grad_norm": 0.36695829033851624,
"learning_rate": 1.0774844325039946e-08,
"loss": 0.48960113525390625,
"step": 1180
}
],
"logging_steps": 10,
"max_steps": 1189,
"num_input_tokens_seen": 0,
"num_train_epochs": 1,
"save_steps": 500,
"stateful_callbacks": {
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": true,
"should_training_stop": true
},
"attributes": {}
}
},
"total_flos": 5.558831689184051e+16,
"train_batch_size": 4,
"trial_name": null,
"trial_params": null
}