hadxs's picture
Upload folder using huggingface_hub
6f088a3 verified
Raw
History Blame Contribute Delete
18.8 kB
{
"best_global_step": null,
"best_metric": null,
"best_model_checkpoint": null,
"epoch": 0.012572527769570711,
"eval_steps": 500,
"global_step": 2000,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"epoch": 0.00012572527769570712,
"grad_norm": 0.5962838530540466,
"learning_rate": 4.75e-07,
"loss": 3.0013919830322267,
"step": 20
},
{
"epoch": 0.00025145055539141424,
"grad_norm": 0.6844280958175659,
"learning_rate": 9.75e-07,
"loss": 3.018001365661621,
"step": 40
},
{
"epoch": 0.0003771758330871213,
"grad_norm": 0.4779929220676422,
"learning_rate": 1.475e-06,
"loss": 3.1058986663818358,
"step": 60
},
{
"epoch": 0.0005029011107828285,
"grad_norm": 0.555294930934906,
"learning_rate": 1.975e-06,
"loss": 2.909657287597656,
"step": 80
},
{
"epoch": 0.0006286263884785355,
"grad_norm": 0.5354552865028381,
"learning_rate": 2.4750000000000004e-06,
"loss": 2.8872909545898438,
"step": 100
},
{
"epoch": 0.0007543516661742426,
"grad_norm": 0.5644583702087402,
"learning_rate": 2.975e-06,
"loss": 2.859341621398926,
"step": 120
},
{
"epoch": 0.0008800769438699498,
"grad_norm": 0.630761981010437,
"learning_rate": 3.4750000000000006e-06,
"loss": 2.933867835998535,
"step": 140
},
{
"epoch": 0.001005802221565657,
"grad_norm": 0.764999508857727,
"learning_rate": 3.975e-06,
"loss": 2.782645606994629,
"step": 160
},
{
"epoch": 0.001131527499261364,
"grad_norm": 1.0221054553985596,
"learning_rate": 4.475e-06,
"loss": 2.8541688919067383,
"step": 180
},
{
"epoch": 0.001257252776957071,
"grad_norm": 0.8221330046653748,
"learning_rate": 4.975000000000001e-06,
"loss": 2.6588584899902346,
"step": 200
},
{
"epoch": 0.0013829780546527782,
"grad_norm": 0.873559832572937,
"learning_rate": 5.475e-06,
"loss": 2.549220848083496,
"step": 220
},
{
"epoch": 0.0015087033323484852,
"grad_norm": 0.813358724117279,
"learning_rate": 5.975e-06,
"loss": 2.5854366302490233,
"step": 240
},
{
"epoch": 0.0016344286100441925,
"grad_norm": 0.856169581413269,
"learning_rate": 6.475000000000001e-06,
"loss": 2.5309289932250976,
"step": 260
},
{
"epoch": 0.0017601538877398996,
"grad_norm": 0.951108455657959,
"learning_rate": 6.975000000000001e-06,
"loss": 2.4736785888671875,
"step": 280
},
{
"epoch": 0.0018858791654356066,
"grad_norm": 0.8016313910484314,
"learning_rate": 7.4750000000000004e-06,
"loss": 2.2943771362304686,
"step": 300
},
{
"epoch": 0.002011604443131314,
"grad_norm": 0.915063202381134,
"learning_rate": 7.975e-06,
"loss": 2.3273014068603515,
"step": 320
},
{
"epoch": 0.0021373297208270208,
"grad_norm": 0.720587968826294,
"learning_rate": 8.475000000000001e-06,
"loss": 2.350560760498047,
"step": 340
},
{
"epoch": 0.002263054998522728,
"grad_norm": 0.711700439453125,
"learning_rate": 8.975e-06,
"loss": 2.3248199462890624,
"step": 360
},
{
"epoch": 0.002388780276218435,
"grad_norm": 0.8843226432800293,
"learning_rate": 9.475e-06,
"loss": 2.335201454162598,
"step": 380
},
{
"epoch": 0.002514505553914142,
"grad_norm": 0.4873352348804474,
"learning_rate": 9.975e-06,
"loss": 2.424860382080078,
"step": 400
},
{
"epoch": 0.0026402308316098495,
"grad_norm": 0.6487540602684021,
"learning_rate": 1.0475e-05,
"loss": 2.2071765899658202,
"step": 420
},
{
"epoch": 0.0027659561093055563,
"grad_norm": 0.6322605013847351,
"learning_rate": 1.0975e-05,
"loss": 2.2878080368041993,
"step": 440
},
{
"epoch": 0.0028916813870012636,
"grad_norm": 0.5939791798591614,
"learning_rate": 1.1475000000000001e-05,
"loss": 2.3425870895385743,
"step": 460
},
{
"epoch": 0.0030174066646969705,
"grad_norm": 0.6943904161453247,
"learning_rate": 1.1975e-05,
"loss": 2.2085947036743163,
"step": 480
},
{
"epoch": 0.0031431319423926777,
"grad_norm": 0.7218244075775146,
"learning_rate": 1.2475e-05,
"loss": 2.2360507965087892,
"step": 500
},
{
"epoch": 0.003268857220088385,
"grad_norm": 0.8252770900726318,
"learning_rate": 1.2975e-05,
"loss": 2.3641361236572265,
"step": 520
},
{
"epoch": 0.003394582497784092,
"grad_norm": 0.5744673013687134,
"learning_rate": 1.3475000000000002e-05,
"loss": 2.236039924621582,
"step": 540
},
{
"epoch": 0.003520307775479799,
"grad_norm": 0.6768812537193298,
"learning_rate": 1.3975000000000003e-05,
"loss": 2.2313003540039062,
"step": 560
},
{
"epoch": 0.003646033053175506,
"grad_norm": 0.6503052711486816,
"learning_rate": 1.4475e-05,
"loss": 2.2801786422729493,
"step": 580
},
{
"epoch": 0.0037717583308712133,
"grad_norm": 0.629787266254425,
"learning_rate": 1.4975e-05,
"loss": 2.346693420410156,
"step": 600
},
{
"epoch": 0.0038974836085669206,
"grad_norm": 0.6764146089553833,
"learning_rate": 1.5475e-05,
"loss": 2.093250274658203,
"step": 620
},
{
"epoch": 0.004023208886262628,
"grad_norm": 0.7266194224357605,
"learning_rate": 1.5975000000000002e-05,
"loss": 2.242112922668457,
"step": 640
},
{
"epoch": 0.004148934163958335,
"grad_norm": 0.5509718656539917,
"learning_rate": 1.6475e-05,
"loss": 2.2910560607910155,
"step": 660
},
{
"epoch": 0.0042746594416540416,
"grad_norm": 0.7285779714584351,
"learning_rate": 1.6975000000000003e-05,
"loss": 2.480996322631836,
"step": 680
},
{
"epoch": 0.004400384719349749,
"grad_norm": 0.5729554295539856,
"learning_rate": 1.7475e-05,
"loss": 2.1267959594726564,
"step": 700
},
{
"epoch": 0.004526109997045456,
"grad_norm": 0.6237987279891968,
"learning_rate": 1.7975e-05,
"loss": 2.3381301879882814,
"step": 720
},
{
"epoch": 0.004651835274741163,
"grad_norm": 0.6548975110054016,
"learning_rate": 1.8475000000000002e-05,
"loss": 2.1999746322631837,
"step": 740
},
{
"epoch": 0.00477756055243687,
"grad_norm": 0.614876389503479,
"learning_rate": 1.8975e-05,
"loss": 2.3489891052246095,
"step": 760
},
{
"epoch": 0.0049032858301325775,
"grad_norm": 0.6543737053871155,
"learning_rate": 1.9475000000000002e-05,
"loss": 2.261593055725098,
"step": 780
},
{
"epoch": 0.005029011107828284,
"grad_norm": 0.6650403141975403,
"learning_rate": 1.9975e-05,
"loss": 2.307338523864746,
"step": 800
},
{
"epoch": 0.005154736385523991,
"grad_norm": 0.691130518913269,
"learning_rate": 2.0475e-05,
"loss": 2.2411531448364257,
"step": 820
},
{
"epoch": 0.005280461663219699,
"grad_norm": 0.6249509453773499,
"learning_rate": 2.0975e-05,
"loss": 2.437354850769043,
"step": 840
},
{
"epoch": 0.005406186940915406,
"grad_norm": 0.7308785319328308,
"learning_rate": 2.1475e-05,
"loss": 2.16713924407959,
"step": 860
},
{
"epoch": 0.005531912218611113,
"grad_norm": 0.7222583889961243,
"learning_rate": 2.1975000000000002e-05,
"loss": 2.2146921157836914,
"step": 880
},
{
"epoch": 0.00565763749630682,
"grad_norm": 0.8205286264419556,
"learning_rate": 2.2475e-05,
"loss": 2.1331754684448243,
"step": 900
},
{
"epoch": 0.005783362774002527,
"grad_norm": 0.8732596635818481,
"learning_rate": 2.2975000000000003e-05,
"loss": 2.3930585861206053,
"step": 920
},
{
"epoch": 0.005909088051698234,
"grad_norm": 0.8867924213409424,
"learning_rate": 2.3475e-05,
"loss": 2.325008773803711,
"step": 940
},
{
"epoch": 0.006034813329393941,
"grad_norm": 0.6259322762489319,
"learning_rate": 2.3975e-05,
"loss": 2.1665245056152345,
"step": 960
},
{
"epoch": 0.006160538607089649,
"grad_norm": 0.7788486480712891,
"learning_rate": 2.4475000000000002e-05,
"loss": 2.0807886123657227,
"step": 980
},
{
"epoch": 0.0062862638847853555,
"grad_norm": 0.7346381545066833,
"learning_rate": 2.4975e-05,
"loss": 2.2518342971801757,
"step": 1000
},
{
"epoch": 0.006411989162481062,
"grad_norm": 0.6551724672317505,
"learning_rate": 2.5475e-05,
"loss": 2.2025928497314453,
"step": 1020
},
{
"epoch": 0.00653771444017677,
"grad_norm": 0.42648759484291077,
"learning_rate": 2.5974999999999998e-05,
"loss": 2.2169179916381836,
"step": 1040
},
{
"epoch": 0.006663439717872477,
"grad_norm": 0.6696974039077759,
"learning_rate": 2.6475e-05,
"loss": 2.2179336547851562,
"step": 1060
},
{
"epoch": 0.006789164995568184,
"grad_norm": 0.6720432043075562,
"learning_rate": 2.6975000000000002e-05,
"loss": 2.1793497085571287,
"step": 1080
},
{
"epoch": 0.0069148902732638915,
"grad_norm": 0.7858997583389282,
"learning_rate": 2.7475e-05,
"loss": 2.2960178375244142,
"step": 1100
},
{
"epoch": 0.007040615550959598,
"grad_norm": 0.6754783987998962,
"learning_rate": 2.7975000000000002e-05,
"loss": 2.193424415588379,
"step": 1120
},
{
"epoch": 0.007166340828655305,
"grad_norm": 0.8978444933891296,
"learning_rate": 2.8475e-05,
"loss": 2.245846748352051,
"step": 1140
},
{
"epoch": 0.007292066106351012,
"grad_norm": 0.6270891427993774,
"learning_rate": 2.8975000000000003e-05,
"loss": 2.222321891784668,
"step": 1160
},
{
"epoch": 0.00741779138404672,
"grad_norm": 0.8105082511901855,
"learning_rate": 2.9475e-05,
"loss": 2.2370512008666994,
"step": 1180
},
{
"epoch": 0.007543516661742427,
"grad_norm": 0.8254700303077698,
"learning_rate": 2.9975000000000004e-05,
"loss": 2.2856861114501954,
"step": 1200
},
{
"epoch": 0.0076692419394381334,
"grad_norm": 0.7499117851257324,
"learning_rate": 3.0475000000000002e-05,
"loss": 2.145079803466797,
"step": 1220
},
{
"epoch": 0.007794967217133841,
"grad_norm": 0.5796831846237183,
"learning_rate": 3.0975e-05,
"loss": 2.2193859100341795,
"step": 1240
},
{
"epoch": 0.007920692494829547,
"grad_norm": 0.7580195069313049,
"learning_rate": 3.1475e-05,
"loss": 2.325836181640625,
"step": 1260
},
{
"epoch": 0.008046417772525256,
"grad_norm": 0.7444676756858826,
"learning_rate": 3.1975e-05,
"loss": 2.176131820678711,
"step": 1280
},
{
"epoch": 0.008172143050220963,
"grad_norm": 0.9642544984817505,
"learning_rate": 3.2474999999999997e-05,
"loss": 2.139938735961914,
"step": 1300
},
{
"epoch": 0.00829786832791667,
"grad_norm": 0.8218713998794556,
"learning_rate": 3.2975e-05,
"loss": 2.2411163330078123,
"step": 1320
},
{
"epoch": 0.008423593605612376,
"grad_norm": 1.0058637857437134,
"learning_rate": 3.3475e-05,
"loss": 2.2701160430908205,
"step": 1340
},
{
"epoch": 0.008549318883308083,
"grad_norm": 0.9082450270652771,
"learning_rate": 3.3975e-05,
"loss": 2.223080635070801,
"step": 1360
},
{
"epoch": 0.00867504416100379,
"grad_norm": 1.5511119365692139,
"learning_rate": 3.4475000000000005e-05,
"loss": 2.2058855056762696,
"step": 1380
},
{
"epoch": 0.008800769438699499,
"grad_norm": 0.9214478731155396,
"learning_rate": 3.4975e-05,
"loss": 2.275226593017578,
"step": 1400
},
{
"epoch": 0.008926494716395205,
"grad_norm": 0.7495436668395996,
"learning_rate": 3.5475e-05,
"loss": 2.0992334365844725,
"step": 1420
},
{
"epoch": 0.009052219994090912,
"grad_norm": 0.7678313851356506,
"learning_rate": 3.5975e-05,
"loss": 2.151212692260742,
"step": 1440
},
{
"epoch": 0.009177945271786619,
"grad_norm": 0.8514085412025452,
"learning_rate": 3.6475000000000006e-05,
"loss": 2.3009883880615236,
"step": 1460
},
{
"epoch": 0.009303670549482326,
"grad_norm": 0.7245936393737793,
"learning_rate": 3.6975000000000004e-05,
"loss": 2.2095823287963867,
"step": 1480
},
{
"epoch": 0.009429395827178033,
"grad_norm": 0.576258659362793,
"learning_rate": 3.7475e-05,
"loss": 2.2135459899902346,
"step": 1500
},
{
"epoch": 0.00955512110487374,
"grad_norm": 0.7789803147315979,
"learning_rate": 3.7975e-05,
"loss": 2.172737884521484,
"step": 1520
},
{
"epoch": 0.009680846382569448,
"grad_norm": 0.6502222418785095,
"learning_rate": 3.8475e-05,
"loss": 2.202811622619629,
"step": 1540
},
{
"epoch": 0.009806571660265155,
"grad_norm": 0.7619134783744812,
"learning_rate": 3.8975e-05,
"loss": 2.120333671569824,
"step": 1560
},
{
"epoch": 0.009932296937960862,
"grad_norm": 0.624914824962616,
"learning_rate": 3.9475000000000004e-05,
"loss": 2.133666229248047,
"step": 1580
},
{
"epoch": 0.010058022215656569,
"grad_norm": 0.8268408179283142,
"learning_rate": 3.9975e-05,
"loss": 2.2280460357666017,
"step": 1600
},
{
"epoch": 0.010183747493352276,
"grad_norm": 1.2030913829803467,
"learning_rate": 4.0475e-05,
"loss": 2.2895408630371095,
"step": 1620
},
{
"epoch": 0.010309472771047982,
"grad_norm": 0.5576544404029846,
"learning_rate": 4.0975e-05,
"loss": 2.143132781982422,
"step": 1640
},
{
"epoch": 0.01043519804874369,
"grad_norm": 0.6146367192268372,
"learning_rate": 4.1475000000000005e-05,
"loss": 2.0781791687011717,
"step": 1660
},
{
"epoch": 0.010560923326439398,
"grad_norm": 0.637881875038147,
"learning_rate": 4.1975000000000004e-05,
"loss": 2.269753265380859,
"step": 1680
},
{
"epoch": 0.010686648604135105,
"grad_norm": 1.2377184629440308,
"learning_rate": 4.2475e-05,
"loss": 2.3090824127197265,
"step": 1700
},
{
"epoch": 0.010812373881830812,
"grad_norm": 1.0414743423461914,
"learning_rate": 4.2975e-05,
"loss": 2.2602685928344726,
"step": 1720
},
{
"epoch": 0.010938099159526518,
"grad_norm": 0.7796839475631714,
"learning_rate": 4.3475000000000006e-05,
"loss": 2.3865522384643554,
"step": 1740
},
{
"epoch": 0.011063824437222225,
"grad_norm": 0.7342143654823303,
"learning_rate": 4.3975e-05,
"loss": 2.3370746612548827,
"step": 1760
},
{
"epoch": 0.011189549714917932,
"grad_norm": 0.6339659094810486,
"learning_rate": 4.4475e-05,
"loss": 2.2576133728027346,
"step": 1780
},
{
"epoch": 0.01131527499261364,
"grad_norm": 0.6305493116378784,
"learning_rate": 4.4975e-05,
"loss": 2.146904945373535,
"step": 1800
},
{
"epoch": 0.011441000270309348,
"grad_norm": 0.7393673658370972,
"learning_rate": 4.5475e-05,
"loss": 2.207014465332031,
"step": 1820
},
{
"epoch": 0.011566725548005054,
"grad_norm": 0.5975062847137451,
"learning_rate": 4.5975e-05,
"loss": 2.2376119613647463,
"step": 1840
},
{
"epoch": 0.011692450825700761,
"grad_norm": 0.8439088463783264,
"learning_rate": 4.6475000000000005e-05,
"loss": 2.172005844116211,
"step": 1860
},
{
"epoch": 0.011818176103396468,
"grad_norm": 0.9270113110542297,
"learning_rate": 4.6975000000000003e-05,
"loss": 2.373341369628906,
"step": 1880
},
{
"epoch": 0.011943901381092175,
"grad_norm": 0.8112410306930542,
"learning_rate": 4.7475e-05,
"loss": 2.2132829666137694,
"step": 1900
},
{
"epoch": 0.012069626658787882,
"grad_norm": 0.7576470971107483,
"learning_rate": 4.7975e-05,
"loss": 2.1676565170288087,
"step": 1920
},
{
"epoch": 0.01219535193648359,
"grad_norm": 0.6396933794021606,
"learning_rate": 4.8475000000000006e-05,
"loss": 2.1356874465942384,
"step": 1940
},
{
"epoch": 0.012321077214179297,
"grad_norm": 0.9815897941589355,
"learning_rate": 4.8975000000000005e-05,
"loss": 2.153605651855469,
"step": 1960
},
{
"epoch": 0.012446802491875004,
"grad_norm": 1.0716313123703003,
"learning_rate": 4.9475e-05,
"loss": 2.237149238586426,
"step": 1980
},
{
"epoch": 0.012572527769570711,
"grad_norm": 0.7417507171630859,
"learning_rate": 4.9975e-05,
"loss": 2.3103559494018553,
"step": 2000
}
],
"logging_steps": 20,
"max_steps": 160000,
"num_input_tokens_seen": 0,
"num_train_epochs": 2,
"save_steps": 500,
"stateful_callbacks": {
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": true,
"should_training_stop": false
},
"attributes": {}
}
},
"total_flos": 1.2369016881496474e+17,
"train_batch_size": 4,
"trial_name": null,
"trial_params": null
}