binary-hermes3-lora / checkpoint-600 /trainer_state.json
SoulInPsyAbstract's picture
Upload folder using huggingface_hub
befbb25 verified
Raw
History Blame Contribute Delete
31 kB
{
"best_metric": null,
"best_model_checkpoint": null,
"epoch": 2.0434227330779056,
"eval_steps": 500,
"global_step": 600,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"epoch": 0.017028522775649212,
"grad_norm": 6.522716999053955,
"learning_rate": 0.0001988623435722412,
"loss": 2.7211,
"mean_token_accuracy": 0.5789041496813297,
"num_tokens": 4727.0,
"step": 5
},
{
"epoch": 0.034057045551298425,
"grad_norm": 1.0070050954818726,
"learning_rate": 0.00019772468714448238,
"loss": 0.9998,
"mean_token_accuracy": 0.8499793156981468,
"num_tokens": 9471.0,
"step": 10
},
{
"epoch": 0.05108556832694764,
"grad_norm": 0.7373425960540771,
"learning_rate": 0.00019658703071672356,
"loss": 0.8303,
"mean_token_accuracy": 0.8681916877627373,
"num_tokens": 14013.0,
"step": 15
},
{
"epoch": 0.06811409110259685,
"grad_norm": 0.8468236327171326,
"learning_rate": 0.00019544937428896475,
"loss": 0.8404,
"mean_token_accuracy": 0.8622620105743408,
"num_tokens": 18725.0,
"step": 20
},
{
"epoch": 0.08514261387824607,
"grad_norm": 0.8178804516792297,
"learning_rate": 0.00019431171786120593,
"loss": 0.9073,
"mean_token_accuracy": 0.8524447843432427,
"num_tokens": 23497.0,
"step": 25
},
{
"epoch": 0.10217113665389528,
"grad_norm": 0.890177309513092,
"learning_rate": 0.00019317406143344712,
"loss": 0.8029,
"mean_token_accuracy": 0.8642359614372254,
"num_tokens": 28192.0,
"step": 30
},
{
"epoch": 0.11919965942954448,
"grad_norm": 1.0545469522476196,
"learning_rate": 0.0001920364050056883,
"loss": 0.7458,
"mean_token_accuracy": 0.8732351213693619,
"num_tokens": 32805.0,
"step": 35
},
{
"epoch": 0.1362281822051937,
"grad_norm": 1.0384492874145508,
"learning_rate": 0.00019089874857792946,
"loss": 0.9235,
"mean_token_accuracy": 0.8408558666706085,
"num_tokens": 37714.0,
"step": 40
},
{
"epoch": 0.1532567049808429,
"grad_norm": 0.6860374808311462,
"learning_rate": 0.00018976109215017067,
"loss": 0.7623,
"mean_token_accuracy": 0.8656536340713501,
"num_tokens": 42429.0,
"step": 45
},
{
"epoch": 0.17028522775649213,
"grad_norm": 0.7284501791000366,
"learning_rate": 0.00018862343572241183,
"loss": 0.7588,
"mean_token_accuracy": 0.8688850715756417,
"num_tokens": 47099.0,
"step": 50
},
{
"epoch": 0.18731375053214133,
"grad_norm": 0.8899862170219421,
"learning_rate": 0.00018748577929465302,
"loss": 0.7065,
"mean_token_accuracy": 0.8717748820781708,
"num_tokens": 51795.0,
"step": 55
},
{
"epoch": 0.20434227330779056,
"grad_norm": 0.5350505709648132,
"learning_rate": 0.0001863481228668942,
"loss": 0.6696,
"mean_token_accuracy": 0.8851396456360817,
"num_tokens": 56369.0,
"step": 60
},
{
"epoch": 0.22137079608343976,
"grad_norm": 0.6087013483047485,
"learning_rate": 0.0001852104664391354,
"loss": 0.7204,
"mean_token_accuracy": 0.8682332798838616,
"num_tokens": 61018.0,
"step": 65
},
{
"epoch": 0.23839931885908897,
"grad_norm": 0.7879019379615784,
"learning_rate": 0.00018407281001137657,
"loss": 0.7692,
"mean_token_accuracy": 0.8653983056545258,
"num_tokens": 65741.0,
"step": 70
},
{
"epoch": 0.2554278416347382,
"grad_norm": 0.6546444296836853,
"learning_rate": 0.00018293515358361776,
"loss": 0.7119,
"mean_token_accuracy": 0.8726310178637504,
"num_tokens": 70425.0,
"step": 75
},
{
"epoch": 0.2724563644103874,
"grad_norm": 0.770902156829834,
"learning_rate": 0.00018179749715585894,
"loss": 0.7035,
"mean_token_accuracy": 0.8711811751127243,
"num_tokens": 75101.0,
"step": 80
},
{
"epoch": 0.2894848871860366,
"grad_norm": 0.8873187899589539,
"learning_rate": 0.00018065984072810013,
"loss": 0.7419,
"mean_token_accuracy": 0.8616803497076034,
"num_tokens": 79888.0,
"step": 85
},
{
"epoch": 0.3065134099616858,
"grad_norm": 0.7061370015144348,
"learning_rate": 0.0001795221843003413,
"loss": 0.66,
"mean_token_accuracy": 0.8744896531105042,
"num_tokens": 84562.0,
"step": 90
},
{
"epoch": 0.32354193273733506,
"grad_norm": 0.8232033252716064,
"learning_rate": 0.0001783845278725825,
"loss": 0.7403,
"mean_token_accuracy": 0.8659066379070282,
"num_tokens": 89238.0,
"step": 95
},
{
"epoch": 0.34057045551298426,
"grad_norm": 0.7313310503959656,
"learning_rate": 0.00017724687144482368,
"loss": 0.7157,
"mean_token_accuracy": 0.8661555901169777,
"num_tokens": 93987.0,
"step": 100
},
{
"epoch": 0.35759897828863346,
"grad_norm": 0.7119390964508057,
"learning_rate": 0.00017610921501706487,
"loss": 0.7016,
"mean_token_accuracy": 0.8678551658987999,
"num_tokens": 98722.0,
"step": 105
},
{
"epoch": 0.37462750106428266,
"grad_norm": 0.7126006484031677,
"learning_rate": 0.00017497155858930602,
"loss": 0.7009,
"mean_token_accuracy": 0.867291408777237,
"num_tokens": 103439.0,
"step": 110
},
{
"epoch": 0.39165602383993187,
"grad_norm": 0.6158230304718018,
"learning_rate": 0.00017383390216154724,
"loss": 0.7236,
"mean_token_accuracy": 0.8636128515005111,
"num_tokens": 108209.0,
"step": 115
},
{
"epoch": 0.4086845466155811,
"grad_norm": 0.6498322486877441,
"learning_rate": 0.0001726962457337884,
"loss": 0.6813,
"mean_token_accuracy": 0.8757071048021317,
"num_tokens": 112855.0,
"step": 120
},
{
"epoch": 0.4257130693912303,
"grad_norm": 0.6594287157058716,
"learning_rate": 0.0001715585893060296,
"loss": 0.7062,
"mean_token_accuracy": 0.8650311172008515,
"num_tokens": 117653.0,
"step": 125
},
{
"epoch": 0.4427415921668795,
"grad_norm": 0.7375237941741943,
"learning_rate": 0.00017042093287827076,
"loss": 0.6477,
"mean_token_accuracy": 0.8733970731496811,
"num_tokens": 122397.0,
"step": 130
},
{
"epoch": 0.45977011494252873,
"grad_norm": 0.5958442687988281,
"learning_rate": 0.00016928327645051198,
"loss": 0.691,
"mean_token_accuracy": 0.8681387722492218,
"num_tokens": 127136.0,
"step": 135
},
{
"epoch": 0.47679863771817793,
"grad_norm": 0.7407785654067993,
"learning_rate": 0.00016814562002275313,
"loss": 0.6477,
"mean_token_accuracy": 0.8752307429909706,
"num_tokens": 131833.0,
"step": 140
},
{
"epoch": 0.49382716049382713,
"grad_norm": 0.8190199732780457,
"learning_rate": 0.00016700796359499432,
"loss": 0.6608,
"mean_token_accuracy": 0.8762851104140281,
"num_tokens": 136441.0,
"step": 145
},
{
"epoch": 0.5108556832694764,
"grad_norm": 0.7571837306022644,
"learning_rate": 0.0001658703071672355,
"loss": 0.673,
"mean_token_accuracy": 0.8691665843129158,
"num_tokens": 141186.0,
"step": 150
},
{
"epoch": 0.5278842060451255,
"grad_norm": 0.6653426885604858,
"learning_rate": 0.0001647326507394767,
"loss": 0.7126,
"mean_token_accuracy": 0.8647830635309219,
"num_tokens": 145971.0,
"step": 155
},
{
"epoch": 0.5449127288207748,
"grad_norm": 0.7333567142486572,
"learning_rate": 0.00016359499431171787,
"loss": 0.6287,
"mean_token_accuracy": 0.878324082493782,
"num_tokens": 150669.0,
"step": 160
},
{
"epoch": 0.561941251596424,
"grad_norm": 0.8214460015296936,
"learning_rate": 0.00016245733788395906,
"loss": 0.6608,
"mean_token_accuracy": 0.8729922890663147,
"num_tokens": 155374.0,
"step": 165
},
{
"epoch": 0.5789697743720732,
"grad_norm": 0.6251844167709351,
"learning_rate": 0.00016131968145620024,
"loss": 0.6556,
"mean_token_accuracy": 0.8770609870553017,
"num_tokens": 160068.0,
"step": 170
},
{
"epoch": 0.5959982971477225,
"grad_norm": 0.804166853427887,
"learning_rate": 0.00016018202502844143,
"loss": 0.6366,
"mean_token_accuracy": 0.8760894432663917,
"num_tokens": 164696.0,
"step": 175
},
{
"epoch": 0.6130268199233716,
"grad_norm": 0.7013877034187317,
"learning_rate": 0.0001590443686006826,
"loss": 0.6328,
"mean_token_accuracy": 0.8779815405607223,
"num_tokens": 169356.0,
"step": 180
},
{
"epoch": 0.6300553426990209,
"grad_norm": 1.0623070001602173,
"learning_rate": 0.0001579067121729238,
"loss": 0.6734,
"mean_token_accuracy": 0.8710577815771103,
"num_tokens": 174041.0,
"step": 185
},
{
"epoch": 0.6470838654746701,
"grad_norm": 0.7858535647392273,
"learning_rate": 0.00015676905574516496,
"loss": 0.6775,
"mean_token_accuracy": 0.8692880481481552,
"num_tokens": 178858.0,
"step": 190
},
{
"epoch": 0.6641123882503193,
"grad_norm": 0.8943309187889099,
"learning_rate": 0.00015563139931740617,
"loss": 0.6874,
"mean_token_accuracy": 0.868885512650013,
"num_tokens": 183669.0,
"step": 195
},
{
"epoch": 0.6811409110259685,
"grad_norm": 0.5898745656013489,
"learning_rate": 0.00015449374288964733,
"loss": 0.6907,
"mean_token_accuracy": 0.8661940798163414,
"num_tokens": 188473.0,
"step": 200
},
{
"epoch": 0.6981694338016177,
"grad_norm": 0.6333857774734497,
"learning_rate": 0.00015335608646188854,
"loss": 0.6129,
"mean_token_accuracy": 0.8817986205220223,
"num_tokens": 193171.0,
"step": 205
},
{
"epoch": 0.7151979565772669,
"grad_norm": 0.5913947820663452,
"learning_rate": 0.0001522184300341297,
"loss": 0.5896,
"mean_token_accuracy": 0.8822762459516525,
"num_tokens": 197817.0,
"step": 210
},
{
"epoch": 0.7322264793529162,
"grad_norm": 0.6990242004394531,
"learning_rate": 0.00015108077360637088,
"loss": 0.6512,
"mean_token_accuracy": 0.8739180400967598,
"num_tokens": 202556.0,
"step": 215
},
{
"epoch": 0.7492550021285653,
"grad_norm": 0.6869048476219177,
"learning_rate": 0.00014994311717861207,
"loss": 0.7025,
"mean_token_accuracy": 0.8662877783179284,
"num_tokens": 207294.0,
"step": 220
},
{
"epoch": 0.7662835249042146,
"grad_norm": 0.5135166049003601,
"learning_rate": 0.00014880546075085325,
"loss": 0.6382,
"mean_token_accuracy": 0.8849207311868668,
"num_tokens": 211927.0,
"step": 225
},
{
"epoch": 0.7833120476798637,
"grad_norm": 0.6304216980934143,
"learning_rate": 0.00014766780432309444,
"loss": 0.6834,
"mean_token_accuracy": 0.8688049465417862,
"num_tokens": 216626.0,
"step": 230
},
{
"epoch": 0.800340570455513,
"grad_norm": 0.6879922151565552,
"learning_rate": 0.00014653014789533562,
"loss": 0.6902,
"mean_token_accuracy": 0.8655798360705376,
"num_tokens": 221432.0,
"step": 235
},
{
"epoch": 0.8173690932311622,
"grad_norm": 0.6433548331260681,
"learning_rate": 0.0001453924914675768,
"loss": 0.6129,
"mean_token_accuracy": 0.8795880794525146,
"num_tokens": 226022.0,
"step": 240
},
{
"epoch": 0.8343976160068114,
"grad_norm": 0.7876724600791931,
"learning_rate": 0.000144254835039818,
"loss": 0.6441,
"mean_token_accuracy": 0.8729524433612823,
"num_tokens": 230692.0,
"step": 245
},
{
"epoch": 0.8514261387824607,
"grad_norm": 0.6494749188423157,
"learning_rate": 0.00014311717861205915,
"loss": 0.7033,
"mean_token_accuracy": 0.8632469072937965,
"num_tokens": 235400.0,
"step": 250
},
{
"epoch": 0.8684546615581098,
"grad_norm": 0.6332300305366516,
"learning_rate": 0.00014197952218430036,
"loss": 0.5947,
"mean_token_accuracy": 0.8860528379678726,
"num_tokens": 239997.0,
"step": 255
},
{
"epoch": 0.885483184333759,
"grad_norm": 0.7144895195960999,
"learning_rate": 0.00014084186575654152,
"loss": 0.649,
"mean_token_accuracy": 0.8745664536952973,
"num_tokens": 244704.0,
"step": 260
},
{
"epoch": 0.9025117071094083,
"grad_norm": 0.5460124015808105,
"learning_rate": 0.00013970420932878273,
"loss": 0.6622,
"mean_token_accuracy": 0.8692788198590279,
"num_tokens": 249428.0,
"step": 265
},
{
"epoch": 0.9195402298850575,
"grad_norm": 0.65619295835495,
"learning_rate": 0.0001385665529010239,
"loss": 0.657,
"mean_token_accuracy": 0.8737826406955719,
"num_tokens": 254150.0,
"step": 270
},
{
"epoch": 0.9365687526607067,
"grad_norm": 0.8474870324134827,
"learning_rate": 0.0001374288964732651,
"loss": 0.6607,
"mean_token_accuracy": 0.8756056800484657,
"num_tokens": 258826.0,
"step": 275
},
{
"epoch": 0.9535972754363559,
"grad_norm": 0.6054229736328125,
"learning_rate": 0.00013629124004550626,
"loss": 0.6526,
"mean_token_accuracy": 0.8718441724777222,
"num_tokens": 263524.0,
"step": 280
},
{
"epoch": 0.9706257982120051,
"grad_norm": 0.6568702459335327,
"learning_rate": 0.00013515358361774744,
"loss": 0.6174,
"mean_token_accuracy": 0.881709736585617,
"num_tokens": 268179.0,
"step": 285
},
{
"epoch": 0.9876543209876543,
"grad_norm": 0.7518045902252197,
"learning_rate": 0.00013401592718998863,
"loss": 0.5896,
"mean_token_accuracy": 0.885109031200409,
"num_tokens": 272803.0,
"step": 290
},
{
"epoch": 1.0046828437633035,
"grad_norm": 0.5392197370529175,
"learning_rate": 0.00013287827076222981,
"loss": 0.6753,
"mean_token_accuracy": 0.8788385137915611,
"num_tokens": 277527.0,
"step": 295
},
{
"epoch": 1.0217113665389528,
"grad_norm": 0.5845906734466553,
"learning_rate": 0.000131740614334471,
"loss": 0.5237,
"mean_token_accuracy": 0.8938747227191925,
"num_tokens": 282199.0,
"step": 300
},
{
"epoch": 1.038739889314602,
"grad_norm": 0.6392928957939148,
"learning_rate": 0.00013060295790671218,
"loss": 0.4973,
"mean_token_accuracy": 0.8982622623443604,
"num_tokens": 286951.0,
"step": 305
},
{
"epoch": 1.055768412090251,
"grad_norm": 0.5399300456047058,
"learning_rate": 0.00012946530147895337,
"loss": 0.5076,
"mean_token_accuracy": 0.9008002370595932,
"num_tokens": 291569.0,
"step": 310
},
{
"epoch": 1.0727969348659003,
"grad_norm": 0.6236026883125305,
"learning_rate": 0.00012832764505119455,
"loss": 0.5084,
"mean_token_accuracy": 0.8972577184438706,
"num_tokens": 296230.0,
"step": 315
},
{
"epoch": 1.0898254576415496,
"grad_norm": 0.7385813593864441,
"learning_rate": 0.0001271899886234357,
"loss": 0.5062,
"mean_token_accuracy": 0.8956585437059402,
"num_tokens": 301029.0,
"step": 320
},
{
"epoch": 1.1068539804171988,
"grad_norm": 0.7647150754928589,
"learning_rate": 0.00012605233219567692,
"loss": 0.5078,
"mean_token_accuracy": 0.8982979074120522,
"num_tokens": 305696.0,
"step": 325
},
{
"epoch": 1.123882503192848,
"grad_norm": 0.6433872580528259,
"learning_rate": 0.00012491467576791808,
"loss": 0.5215,
"mean_token_accuracy": 0.8974734947085381,
"num_tokens": 310343.0,
"step": 330
},
{
"epoch": 1.1409110259684971,
"grad_norm": 0.6470033526420593,
"learning_rate": 0.0001237770193401593,
"loss": 0.5261,
"mean_token_accuracy": 0.8938129872083664,
"num_tokens": 315097.0,
"step": 335
},
{
"epoch": 1.1579395487441464,
"grad_norm": 0.6738846302032471,
"learning_rate": 0.00012263936291240045,
"loss": 0.5277,
"mean_token_accuracy": 0.8924461513757705,
"num_tokens": 319861.0,
"step": 340
},
{
"epoch": 1.1749680715197957,
"grad_norm": 0.6639145016670227,
"learning_rate": 0.00012150170648464165,
"loss": 0.5127,
"mean_token_accuracy": 0.8926685571670532,
"num_tokens": 324544.0,
"step": 345
},
{
"epoch": 1.191996594295445,
"grad_norm": 0.7034420371055603,
"learning_rate": 0.00012036405005688282,
"loss": 0.51,
"mean_token_accuracy": 0.8971043467521668,
"num_tokens": 329302.0,
"step": 350
},
{
"epoch": 1.2090251170710942,
"grad_norm": 0.6675500273704529,
"learning_rate": 0.000119226393629124,
"loss": 0.5738,
"mean_token_accuracy": 0.8855719327926636,
"num_tokens": 334103.0,
"step": 355
},
{
"epoch": 1.2260536398467432,
"grad_norm": 0.6019395589828491,
"learning_rate": 0.00011808873720136519,
"loss": 0.476,
"mean_token_accuracy": 0.8989460453391075,
"num_tokens": 338666.0,
"step": 360
},
{
"epoch": 1.2430821626223925,
"grad_norm": 0.6599250435829163,
"learning_rate": 0.00011695108077360638,
"loss": 0.5178,
"mean_token_accuracy": 0.8887226998805999,
"num_tokens": 343333.0,
"step": 365
},
{
"epoch": 1.2601106853980417,
"grad_norm": 0.7334213852882385,
"learning_rate": 0.00011581342434584756,
"loss": 0.5378,
"mean_token_accuracy": 0.8895460113883018,
"num_tokens": 348092.0,
"step": 370
},
{
"epoch": 1.277139208173691,
"grad_norm": 0.7423357963562012,
"learning_rate": 0.00011467576791808873,
"loss": 0.5012,
"mean_token_accuracy": 0.8994292929768563,
"num_tokens": 352661.0,
"step": 375
},
{
"epoch": 1.29416773094934,
"grad_norm": 0.857515811920166,
"learning_rate": 0.00011353811149032993,
"loss": 0.507,
"mean_token_accuracy": 0.8979884222149849,
"num_tokens": 357330.0,
"step": 380
},
{
"epoch": 1.3111962537249893,
"grad_norm": 0.5656803250312805,
"learning_rate": 0.0001124004550625711,
"loss": 0.5009,
"mean_token_accuracy": 0.8934224143624305,
"num_tokens": 362020.0,
"step": 385
},
{
"epoch": 1.3282247765006385,
"grad_norm": 0.6634964942932129,
"learning_rate": 0.00011126279863481229,
"loss": 0.5414,
"mean_token_accuracy": 0.8910330131649971,
"num_tokens": 366728.0,
"step": 390
},
{
"epoch": 1.3452532992762878,
"grad_norm": 0.7004157304763794,
"learning_rate": 0.00011012514220705347,
"loss": 0.4922,
"mean_token_accuracy": 0.8992783546447753,
"num_tokens": 371381.0,
"step": 395
},
{
"epoch": 1.362281822051937,
"grad_norm": 0.6225594282150269,
"learning_rate": 0.00010898748577929466,
"loss": 0.5084,
"mean_token_accuracy": 0.8956901535391808,
"num_tokens": 376043.0,
"step": 400
},
{
"epoch": 1.3793103448275863,
"grad_norm": 0.8019647598266602,
"learning_rate": 0.00010784982935153584,
"loss": 0.5303,
"mean_token_accuracy": 0.8940754950046539,
"num_tokens": 380714.0,
"step": 405
},
{
"epoch": 1.3963388676032356,
"grad_norm": 0.8314201831817627,
"learning_rate": 0.00010671217292377703,
"loss": 0.5249,
"mean_token_accuracy": 0.8924115225672722,
"num_tokens": 385498.0,
"step": 410
},
{
"epoch": 1.4133673903788846,
"grad_norm": 0.6691393256187439,
"learning_rate": 0.00010557451649601821,
"loss": 0.4817,
"mean_token_accuracy": 0.89882483035326,
"num_tokens": 390179.0,
"step": 415
},
{
"epoch": 1.4303959131545338,
"grad_norm": 0.8554338216781616,
"learning_rate": 0.00010443686006825938,
"loss": 0.5191,
"mean_token_accuracy": 0.8876234069466591,
"num_tokens": 394930.0,
"step": 420
},
{
"epoch": 1.447424435930183,
"grad_norm": 0.696018636226654,
"learning_rate": 0.00010329920364050057,
"loss": 0.5386,
"mean_token_accuracy": 0.891503955423832,
"num_tokens": 399685.0,
"step": 425
},
{
"epoch": 1.4644529587058321,
"grad_norm": 0.7389529943466187,
"learning_rate": 0.00010216154721274175,
"loss": 0.4949,
"mean_token_accuracy": 0.9004919424653053,
"num_tokens": 404300.0,
"step": 430
},
{
"epoch": 1.4814814814814814,
"grad_norm": 1.0227491855621338,
"learning_rate": 0.00010102389078498294,
"loss": 0.54,
"mean_token_accuracy": 0.8893611416220665,
"num_tokens": 409079.0,
"step": 435
},
{
"epoch": 1.4985100042571307,
"grad_norm": 0.6526888012886047,
"learning_rate": 9.988623435722412e-05,
"loss": 0.4917,
"mean_token_accuracy": 0.8958082437515259,
"num_tokens": 413758.0,
"step": 440
},
{
"epoch": 1.51553852703278,
"grad_norm": 0.5875766277313232,
"learning_rate": 9.874857792946531e-05,
"loss": 0.4991,
"mean_token_accuracy": 0.8971148490905761,
"num_tokens": 418502.0,
"step": 445
},
{
"epoch": 1.5325670498084292,
"grad_norm": 0.6892980337142944,
"learning_rate": 9.761092150170649e-05,
"loss": 0.4551,
"mean_token_accuracy": 0.9068983420729637,
"num_tokens": 423099.0,
"step": 450
},
{
"epoch": 1.5495955725840784,
"grad_norm": 0.6264586448669434,
"learning_rate": 9.647326507394768e-05,
"loss": 0.468,
"mean_token_accuracy": 0.9043048679828644,
"num_tokens": 427701.0,
"step": 455
},
{
"epoch": 1.5666240953597277,
"grad_norm": 0.5398015379905701,
"learning_rate": 9.533560864618886e-05,
"loss": 0.4877,
"mean_token_accuracy": 0.8986729174852371,
"num_tokens": 432430.0,
"step": 460
},
{
"epoch": 1.5836526181353767,
"grad_norm": 0.827769935131073,
"learning_rate": 9.419795221843003e-05,
"loss": 0.4951,
"mean_token_accuracy": 0.9012611672282219,
"num_tokens": 437078.0,
"step": 465
},
{
"epoch": 1.600681140911026,
"grad_norm": 0.6888080835342407,
"learning_rate": 9.306029579067122e-05,
"loss": 0.5108,
"mean_token_accuracy": 0.8976602256298065,
"num_tokens": 441734.0,
"step": 470
},
{
"epoch": 1.617709663686675,
"grad_norm": 0.837681233882904,
"learning_rate": 9.19226393629124e-05,
"loss": 0.5377,
"mean_token_accuracy": 0.8850761532783509,
"num_tokens": 446637.0,
"step": 475
},
{
"epoch": 1.6347381864623243,
"grad_norm": 0.7211363315582275,
"learning_rate": 9.078498293515359e-05,
"loss": 0.5001,
"mean_token_accuracy": 0.898733913898468,
"num_tokens": 451301.0,
"step": 480
},
{
"epoch": 1.6517667092379735,
"grad_norm": 0.6663438081741333,
"learning_rate": 8.964732650739477e-05,
"loss": 0.5144,
"mean_token_accuracy": 0.8976200923323632,
"num_tokens": 455965.0,
"step": 485
},
{
"epoch": 1.6687952320136228,
"grad_norm": 0.8935639262199402,
"learning_rate": 8.850967007963596e-05,
"loss": 0.5331,
"mean_token_accuracy": 0.8960411131381989,
"num_tokens": 460716.0,
"step": 490
},
{
"epoch": 1.685823754789272,
"grad_norm": 0.7235546708106995,
"learning_rate": 8.737201365187714e-05,
"loss": 0.4831,
"mean_token_accuracy": 0.8972082689404488,
"num_tokens": 465370.0,
"step": 495
},
{
"epoch": 1.7028522775649213,
"grad_norm": 0.774000346660614,
"learning_rate": 8.623435722411833e-05,
"loss": 0.5186,
"mean_token_accuracy": 0.8950631290674209,
"num_tokens": 470043.0,
"step": 500
},
{
"epoch": 1.7198808003405706,
"grad_norm": 0.5213722586631775,
"learning_rate": 8.509670079635951e-05,
"loss": 0.4567,
"mean_token_accuracy": 0.9016156733036041,
"num_tokens": 474573.0,
"step": 505
},
{
"epoch": 1.7369093231162198,
"grad_norm": 0.7278684377670288,
"learning_rate": 8.395904436860069e-05,
"loss": 0.5545,
"mean_token_accuracy": 0.8925162181258202,
"num_tokens": 479305.0,
"step": 510
},
{
"epoch": 1.7539378458918689,
"grad_norm": 0.7252481579780579,
"learning_rate": 8.282138794084187e-05,
"loss": 0.496,
"mean_token_accuracy": 0.8953201442956924,
"num_tokens": 484033.0,
"step": 515
},
{
"epoch": 1.770966368667518,
"grad_norm": 0.727513313293457,
"learning_rate": 8.168373151308306e-05,
"loss": 0.5033,
"mean_token_accuracy": 0.8998701125383377,
"num_tokens": 488727.0,
"step": 520
},
{
"epoch": 1.7879948914431671,
"grad_norm": 0.5375337600708008,
"learning_rate": 8.054607508532424e-05,
"loss": 0.4903,
"mean_token_accuracy": 0.8960629358887673,
"num_tokens": 493411.0,
"step": 525
},
{
"epoch": 1.8050234142188164,
"grad_norm": 0.5851954221725464,
"learning_rate": 7.940841865756543e-05,
"loss": 0.5139,
"mean_token_accuracy": 0.8972602248191833,
"num_tokens": 498098.0,
"step": 530
},
{
"epoch": 1.8220519369944657,
"grad_norm": 0.6942209005355835,
"learning_rate": 7.827076222980661e-05,
"loss": 0.4728,
"mean_token_accuracy": 0.9009919315576553,
"num_tokens": 502717.0,
"step": 535
},
{
"epoch": 1.839080459770115,
"grad_norm": 0.9342221021652222,
"learning_rate": 7.71331058020478e-05,
"loss": 0.5283,
"mean_token_accuracy": 0.8924958631396294,
"num_tokens": 507462.0,
"step": 540
},
{
"epoch": 1.8561089825457642,
"grad_norm": 0.7415278553962708,
"learning_rate": 7.599544937428897e-05,
"loss": 0.5394,
"mean_token_accuracy": 0.8913042590022087,
"num_tokens": 512202.0,
"step": 545
},
{
"epoch": 1.8731375053214134,
"grad_norm": 0.7223448157310486,
"learning_rate": 7.485779294653015e-05,
"loss": 0.5473,
"mean_token_accuracy": 0.8873603999614715,
"num_tokens": 517047.0,
"step": 550
},
{
"epoch": 1.8901660280970627,
"grad_norm": 0.6324387192726135,
"learning_rate": 7.372013651877134e-05,
"loss": 0.4986,
"mean_token_accuracy": 0.9018153563141823,
"num_tokens": 521653.0,
"step": 555
},
{
"epoch": 1.907194550872712,
"grad_norm": 0.6177689433097839,
"learning_rate": 7.258248009101252e-05,
"loss": 0.5242,
"mean_token_accuracy": 0.8907949879765511,
"num_tokens": 526387.0,
"step": 560
},
{
"epoch": 1.924223073648361,
"grad_norm": 0.6327561140060425,
"learning_rate": 7.14448236632537e-05,
"loss": 0.4725,
"mean_token_accuracy": 0.9006670027971267,
"num_tokens": 531113.0,
"step": 565
},
{
"epoch": 1.9412515964240102,
"grad_norm": 0.6829894781112671,
"learning_rate": 7.030716723549489e-05,
"loss": 0.5255,
"mean_token_accuracy": 0.8897917374968529,
"num_tokens": 535963.0,
"step": 570
},
{
"epoch": 1.9582801191996593,
"grad_norm": 0.7764301896095276,
"learning_rate": 6.916951080773608e-05,
"loss": 0.5636,
"mean_token_accuracy": 0.8877105817198754,
"num_tokens": 540801.0,
"step": 575
},
{
"epoch": 1.9753086419753085,
"grad_norm": 0.7201740741729736,
"learning_rate": 6.803185437997726e-05,
"loss": 0.5279,
"mean_token_accuracy": 0.8954470381140709,
"num_tokens": 545507.0,
"step": 580
},
{
"epoch": 1.9923371647509578,
"grad_norm": 0.6038010716438293,
"learning_rate": 6.689419795221843e-05,
"loss": 0.505,
"mean_token_accuracy": 0.8970827981829643,
"num_tokens": 550257.0,
"step": 585
},
{
"epoch": 2.009365687526607,
"grad_norm": 0.5724640488624573,
"learning_rate": 6.575654152445962e-05,
"loss": 0.5361,
"mean_token_accuracy": 0.9015150561928749,
"num_tokens": 554990.0,
"step": 590
},
{
"epoch": 2.0263942103022563,
"grad_norm": 0.5974262952804565,
"learning_rate": 6.46188850967008e-05,
"loss": 0.3674,
"mean_token_accuracy": 0.922430993616581,
"num_tokens": 559672.0,
"step": 595
},
{
"epoch": 2.0434227330779056,
"grad_norm": 0.6744574904441833,
"learning_rate": 6.348122866894199e-05,
"loss": 0.3751,
"mean_token_accuracy": 0.9247258752584457,
"num_tokens": 564411.0,
"step": 600
}
],
"logging_steps": 5,
"max_steps": 879,
"num_input_tokens_seen": 0,
"num_train_epochs": 3,
"save_steps": 200,
"stateful_callbacks": {
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": true,
"should_training_stop": false
},
"attributes": {}
}
},
"total_flos": 2.555721091318579e+16,
"train_batch_size": 1,
"trial_name": null,
"trial_params": null
}