Sunu-7B-Instruct / checkpoint-1500 /trainer_state.json
bilalfaye's picture
Upload folder using huggingface_hub
1a9cb90 verified
Raw
History Blame Contribute Delete
46 kB
{
"best_global_step": null,
"best_metric": null,
"best_model_checkpoint": null,
"epoch": 0.7745558406351358,
"eval_steps": 500,
"global_step": 1500,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"entropy": 2.314144600741565,
"epoch": 0.005163705604234238,
"grad_norm": 4.290224552154541,
"learning_rate": 1.5254237288135596e-06,
"loss": 4.511758422851562,
"mean_token_accuracy": 0.3633482086937875,
"num_tokens": 57862.0,
"step": 10
},
{
"entropy": 2.3062521956861017,
"epoch": 0.010327411208468477,
"grad_norm": 4.981228828430176,
"learning_rate": 3.2203389830508473e-06,
"loss": 4.534395980834961,
"mean_token_accuracy": 0.3670886025764048,
"num_tokens": 114505.0,
"step": 20
},
{
"entropy": 2.445302851125598,
"epoch": 0.015491116812702715,
"grad_norm": 3.324716091156006,
"learning_rate": 4.915254237288136e-06,
"loss": 4.264028549194336,
"mean_token_accuracy": 0.37419168511405587,
"num_tokens": 177985.0,
"step": 30
},
{
"entropy": 2.5100959464907646,
"epoch": 0.020654822416936953,
"grad_norm": 2.0952486991882324,
"learning_rate": 6.610169491525424e-06,
"loss": 3.9582889556884764,
"mean_token_accuracy": 0.3963044578209519,
"num_tokens": 239576.0,
"step": 40
},
{
"entropy": 2.665686187893152,
"epoch": 0.025818528021171194,
"grad_norm": 1.5603235960006714,
"learning_rate": 8.305084745762712e-06,
"loss": 3.556003189086914,
"mean_token_accuracy": 0.4520953473169357,
"num_tokens": 291640.0,
"step": 50
},
{
"entropy": 2.741910447925329,
"epoch": 0.03098223362540543,
"grad_norm": 0.9505864977836609,
"learning_rate": 1e-05,
"loss": 3.2364212036132813,
"mean_token_accuracy": 0.5039095370098948,
"num_tokens": 349011.0,
"step": 60
},
{
"entropy": 2.7771890498697758,
"epoch": 0.03614593922963967,
"grad_norm": 0.7826384902000427,
"learning_rate": 9.999300418283908e-06,
"loss": 3.075259208679199,
"mean_token_accuracy": 0.522175510879606,
"num_tokens": 407532.0,
"step": 70
},
{
"entropy": 2.6670482574030756,
"epoch": 0.04130964483387391,
"grad_norm": 0.7306021451950073,
"learning_rate": 9.997201868901463e-06,
"loss": 2.959842300415039,
"mean_token_accuracy": 0.5392204709351063,
"num_tokens": 464814.0,
"step": 80
},
{
"entropy": 2.534086942858994,
"epoch": 0.04647335043810815,
"grad_norm": 0.7267245650291443,
"learning_rate": 9.993704939095376e-06,
"loss": 2.857519340515137,
"mean_token_accuracy": 0.5584392322227358,
"num_tokens": 523494.0,
"step": 90
},
{
"entropy": 2.48643469568342,
"epoch": 0.05163705604234239,
"grad_norm": 0.9745510816574097,
"learning_rate": 9.988810607420912e-06,
"loss": 2.770132637023926,
"mean_token_accuracy": 0.5674901144579053,
"num_tokens": 578916.0,
"step": 100
},
{
"entropy": 2.3004672840237617,
"epoch": 0.056800761646576624,
"grad_norm": 0.9000684022903442,
"learning_rate": 9.982520243472044e-06,
"loss": 2.6292037963867188,
"mean_token_accuracy": 0.5810430168174208,
"num_tokens": 640210.0,
"step": 110
},
{
"entropy": 2.309546428732574,
"epoch": 0.06196446725081086,
"grad_norm": 0.9355388283729553,
"learning_rate": 9.974835607498224e-06,
"loss": 2.623982620239258,
"mean_token_accuracy": 0.5811452951282263,
"num_tokens": 698620.0,
"step": 120
},
{
"entropy": 2.3742345267906786,
"epoch": 0.0671281728550451,
"grad_norm": 0.9847837090492249,
"learning_rate": 9.965758849911774e-06,
"loss": 2.670285224914551,
"mean_token_accuracy": 0.5726205869577825,
"num_tokens": 764363.0,
"step": 130
},
{
"entropy": 2.21920911911875,
"epoch": 0.07229187845927934,
"grad_norm": 1.1952255964279175,
"learning_rate": 9.955292510686156e-06,
"loss": 2.527632141113281,
"mean_token_accuracy": 0.5953943591564894,
"num_tokens": 821339.0,
"step": 140
},
{
"entropy": 2.1673635978251697,
"epoch": 0.07745558406351358,
"grad_norm": 1.1929246187210083,
"learning_rate": 9.943439518645193e-06,
"loss": 2.4985078811645507,
"mean_token_accuracy": 0.6023027936927974,
"num_tokens": 871877.0,
"step": 150
},
{
"entropy": 2.211511859484017,
"epoch": 0.08261928966774781,
"grad_norm": 1.358289122581482,
"learning_rate": 9.930203190643491e-06,
"loss": 2.500803756713867,
"mean_token_accuracy": 0.5940627983771265,
"num_tokens": 929202.0,
"step": 160
},
{
"entropy": 2.1249462071806193,
"epoch": 0.08778299527198205,
"grad_norm": 1.2578144073486328,
"learning_rate": 9.915587230638269e-06,
"loss": 2.4678808212280274,
"mean_token_accuracy": 0.6021689807996153,
"num_tokens": 987967.0,
"step": 170
},
{
"entropy": 2.0816542433574794,
"epoch": 0.0929467008762163,
"grad_norm": 1.4549826383590698,
"learning_rate": 9.899595728652883e-06,
"loss": 2.385122871398926,
"mean_token_accuracy": 0.6153967375867069,
"num_tokens": 1042757.0,
"step": 180
},
{
"entropy": 2.01310737170279,
"epoch": 0.09811040648045054,
"grad_norm": 1.3826615810394287,
"learning_rate": 9.882233159632297e-06,
"loss": 2.281660270690918,
"mean_token_accuracy": 0.6195336611010134,
"num_tokens": 1096431.0,
"step": 190
},
{
"entropy": 2.036235300358385,
"epoch": 0.10327411208468477,
"grad_norm": 1.4376295804977417,
"learning_rate": 9.863504382190838e-06,
"loss": 2.3184206008911135,
"mean_token_accuracy": 0.6207408639602363,
"num_tokens": 1151395.0,
"step": 200
},
{
"entropy": 2.032619636319578,
"epoch": 0.10843781768891901,
"grad_norm": 1.5430495738983154,
"learning_rate": 9.843414637252615e-06,
"loss": 2.307057571411133,
"mean_token_accuracy": 0.6216312819160521,
"num_tokens": 1206304.0,
"step": 210
},
{
"entropy": 1.993878381885588,
"epoch": 0.11360152329315325,
"grad_norm": 1.6275994777679443,
"learning_rate": 9.821969546584922e-06,
"loss": 2.3098770141601563,
"mean_token_accuracy": 0.6226980553008616,
"num_tokens": 1263118.0,
"step": 220
},
{
"entropy": 1.958546225167811,
"epoch": 0.11876522889738748,
"grad_norm": 1.6821534633636475,
"learning_rate": 9.79917511122509e-06,
"loss": 2.2890209197998046,
"mean_token_accuracy": 0.6257161197252572,
"num_tokens": 1321193.0,
"step": 230
},
{
"entropy": 1.9737237187102437,
"epoch": 0.12392893450162172,
"grad_norm": 1.6766833066940308,
"learning_rate": 9.775037709801206e-06,
"loss": 2.2315126419067384,
"mean_token_accuracy": 0.6283347339369356,
"num_tokens": 1379782.0,
"step": 240
},
{
"entropy": 1.9693593598902226,
"epoch": 0.12909264010585597,
"grad_norm": 1.7196708917617798,
"learning_rate": 9.749564096747148e-06,
"loss": 2.2683509826660155,
"mean_token_accuracy": 0.6241073801182211,
"num_tokens": 1436026.0,
"step": 250
},
{
"entropy": 2.006697486527264,
"epoch": 0.1342563457100902,
"grad_norm": 1.725196361541748,
"learning_rate": 9.722761400412496e-06,
"loss": 2.237827110290527,
"mean_token_accuracy": 0.618116126768291,
"num_tokens": 1491038.0,
"step": 260
},
{
"entropy": 1.9512792754918338,
"epoch": 0.13942005131432444,
"grad_norm": 1.7161600589752197,
"learning_rate": 9.694637121067764e-06,
"loss": 2.2142683029174806,
"mean_token_accuracy": 0.630404542479664,
"num_tokens": 1549020.0,
"step": 270
},
{
"entropy": 1.911211796849966,
"epoch": 0.14458375691855868,
"grad_norm": 1.7496988773345947,
"learning_rate": 9.6651991288056e-06,
"loss": 2.1877910614013674,
"mean_token_accuracy": 0.6333114374428988,
"num_tokens": 1603318.0,
"step": 280
},
{
"entropy": 1.9003798129037022,
"epoch": 0.14974746252279292,
"grad_norm": 1.8355860710144043,
"learning_rate": 9.63445566133846e-06,
"loss": 2.129390525817871,
"mean_token_accuracy": 0.6355364937335253,
"num_tokens": 1659733.0,
"step": 290
},
{
"entropy": 1.8534355744719506,
"epoch": 0.15491116812702715,
"grad_norm": 2.051910638809204,
"learning_rate": 9.602415321693434e-06,
"loss": 2.175747299194336,
"mean_token_accuracy": 0.6399295572191477,
"num_tokens": 1717989.0,
"step": 300
},
{
"entropy": 1.9231654025614262,
"epoch": 0.1600748737312614,
"grad_norm": 2.169067621231079,
"learning_rate": 9.569087075804842e-06,
"loss": 2.1539403915405275,
"mean_token_accuracy": 0.6277882568538189,
"num_tokens": 1775607.0,
"step": 310
},
{
"entropy": 1.8140981450676918,
"epoch": 0.16523857933549563,
"grad_norm": 2.2599377632141113,
"learning_rate": 9.534480250005263e-06,
"loss": 2.035861587524414,
"mean_token_accuracy": 0.650528599601239,
"num_tokens": 1828714.0,
"step": 320
},
{
"entropy": 1.8829220661893487,
"epoch": 0.17040228493972986,
"grad_norm": 1.9995423555374146,
"learning_rate": 9.498604528415731e-06,
"loss": 2.1237022399902346,
"mean_token_accuracy": 0.6376794545911253,
"num_tokens": 1888678.0,
"step": 330
},
{
"entropy": 1.8207894021645188,
"epoch": 0.1755659905439641,
"grad_norm": 1.9134663343429565,
"learning_rate": 9.461469950235795e-06,
"loss": 2.097091484069824,
"mean_token_accuracy": 0.6478853410109877,
"num_tokens": 1947050.0,
"step": 340
},
{
"entropy": 1.8442208072170616,
"epoch": 0.18072969614819834,
"grad_norm": 1.9808735847473145,
"learning_rate": 9.423086906934228e-06,
"loss": 2.088273811340332,
"mean_token_accuracy": 0.6407218304462731,
"num_tokens": 2008047.0,
"step": 350
},
{
"entropy": 1.8381939049810172,
"epoch": 0.1858934017524326,
"grad_norm": 2.294248580932617,
"learning_rate": 9.38346613934115e-06,
"loss": 2.0682788848876954,
"mean_token_accuracy": 0.6440740385092795,
"num_tokens": 2067767.0,
"step": 360
},
{
"entropy": 1.8192341944202781,
"epoch": 0.19105710735666684,
"grad_norm": 2.4948010444641113,
"learning_rate": 9.342618734642395e-06,
"loss": 2.0498260498046874,
"mean_token_accuracy": 0.6429526777938008,
"num_tokens": 2123254.0,
"step": 370
},
{
"entropy": 1.8355431320145725,
"epoch": 0.19622081296090108,
"grad_norm": 2.3000476360321045,
"learning_rate": 9.300556123276955e-06,
"loss": 2.0951522827148437,
"mean_token_accuracy": 0.6433267280459404,
"num_tokens": 2182713.0,
"step": 380
},
{
"entropy": 1.7422058419324458,
"epoch": 0.2013845185651353,
"grad_norm": 2.5333197116851807,
"learning_rate": 9.257290075738365e-06,
"loss": 2.0272647857666017,
"mean_token_accuracy": 0.6579547147266567,
"num_tokens": 2237830.0,
"step": 390
},
{
"entropy": 1.835691255517304,
"epoch": 0.20654822416936955,
"grad_norm": 2.446470260620117,
"learning_rate": 9.212832699280942e-06,
"loss": 2.0740291595458986,
"mean_token_accuracy": 0.6418645719066263,
"num_tokens": 2297593.0,
"step": 400
},
{
"entropy": 1.7601716231554747,
"epoch": 0.21171192977360379,
"grad_norm": 2.3453147411346436,
"learning_rate": 9.16719643453177e-06,
"loss": 2.0224067687988283,
"mean_token_accuracy": 0.6526825280860067,
"num_tokens": 2358420.0,
"step": 410
},
{
"entropy": 1.7842545576393605,
"epoch": 0.21687563537783802,
"grad_norm": 2.343998908996582,
"learning_rate": 9.120394052009412e-06,
"loss": 2.0284013748168945,
"mean_token_accuracy": 0.6491527157835663,
"num_tokens": 2413411.0,
"step": 420
},
{
"entropy": 1.8035912558436393,
"epoch": 0.22203934098207226,
"grad_norm": 2.4624032974243164,
"learning_rate": 9.072438648550304e-06,
"loss": 2.0193674087524416,
"mean_token_accuracy": 0.64464613776654,
"num_tokens": 2474489.0,
"step": 430
},
{
"entropy": 1.770039344392717,
"epoch": 0.2272030465863065,
"grad_norm": 2.3914804458618164,
"learning_rate": 9.023343643643821e-06,
"loss": 1.9908281326293946,
"mean_token_accuracy": 0.6467450003139674,
"num_tokens": 2534478.0,
"step": 440
},
{
"entropy": 1.7397029646672308,
"epoch": 0.23236675219054073,
"grad_norm": 2.477668285369873,
"learning_rate": 8.973122775677078e-06,
"loss": 1.9814176559448242,
"mean_token_accuracy": 0.6576142696663737,
"num_tokens": 2588626.0,
"step": 450
},
{
"entropy": 1.7738654158078133,
"epoch": 0.23753045779477497,
"grad_norm": 2.0178322792053223,
"learning_rate": 8.921790098090477e-06,
"loss": 1.9442926406860352,
"mean_token_accuracy": 0.6512955661863089,
"num_tokens": 2647237.0,
"step": 460
},
{
"entropy": 1.7735189321450888,
"epoch": 0.2426941633990092,
"grad_norm": 2.549083948135376,
"learning_rate": 8.869359975445085e-06,
"loss": 1.9767679214477538,
"mean_token_accuracy": 0.6500832958146929,
"num_tokens": 2703821.0,
"step": 470
},
{
"entropy": 1.7094212627038359,
"epoch": 0.24785786900324344,
"grad_norm": 2.312490224838257,
"learning_rate": 8.815847079402972e-06,
"loss": 1.9500492095947266,
"mean_token_accuracy": 0.6588690262287855,
"num_tokens": 2760705.0,
"step": 480
},
{
"entropy": 1.6987796766683458,
"epoch": 0.2530215746074777,
"grad_norm": 2.1077768802642822,
"learning_rate": 8.761266384621599e-06,
"loss": 1.8798688888549804,
"mean_token_accuracy": 0.6636769481934607,
"num_tokens": 2816194.0,
"step": 490
},
{
"entropy": 1.771947745513171,
"epoch": 0.25818528021171194,
"grad_norm": 2.3342082500457764,
"learning_rate": 8.705633164563413e-06,
"loss": 1.9463973999023438,
"mean_token_accuracy": 0.6494354791007936,
"num_tokens": 2875579.0,
"step": 500
},
{
"entropy": 1.6847813020460307,
"epoch": 0.2633489858159462,
"grad_norm": 2.528355121612549,
"learning_rate": 8.648962987221837e-06,
"loss": 1.8783418655395507,
"mean_token_accuracy": 0.6657532411627471,
"num_tokens": 2935829.0,
"step": 510
},
{
"entropy": 1.7175002202391625,
"epoch": 0.2685126914201804,
"grad_norm": 2.8453621864318848,
"learning_rate": 8.591271710764839e-06,
"loss": 1.9445688247680664,
"mean_token_accuracy": 0.66049327487126,
"num_tokens": 2998604.0,
"step": 520
},
{
"entropy": 1.6917494175955654,
"epoch": 0.27367639702441465,
"grad_norm": 2.5570693016052246,
"learning_rate": 8.532575479097294e-06,
"loss": 1.9342041015625,
"mean_token_accuracy": 0.6653022102080286,
"num_tokens": 3057855.0,
"step": 530
},
{
"entropy": 1.6881575733423233,
"epoch": 0.2788401026286489,
"grad_norm": 2.789048433303833,
"learning_rate": 8.472890717343391e-06,
"loss": 1.9400022506713868,
"mean_token_accuracy": 0.6622203260660171,
"num_tokens": 3117202.0,
"step": 540
},
{
"entropy": 1.6826916345395149,
"epoch": 0.2840038082328831,
"grad_norm": 2.3692917823791504,
"learning_rate": 8.412234127250353e-06,
"loss": 1.9006750106811523,
"mean_token_accuracy": 0.6645334579981863,
"num_tokens": 3172362.0,
"step": 550
},
{
"entropy": 1.766061083227396,
"epoch": 0.28916751383711736,
"grad_norm": 2.456371545791626,
"learning_rate": 8.350622682514735e-06,
"loss": 1.921757125854492,
"mean_token_accuracy": 0.6515732076019048,
"num_tokens": 3232155.0,
"step": 560
},
{
"entropy": 1.6578089219518006,
"epoch": 0.2943312194413516,
"grad_norm": 2.7018346786499023,
"learning_rate": 8.288073624032634e-06,
"loss": 1.8441638946533203,
"mean_token_accuracy": 0.6680269423872233,
"num_tokens": 3286329.0,
"step": 570
},
{
"entropy": 1.654622305277735,
"epoch": 0.29949492504558584,
"grad_norm": 4.346279621124268,
"learning_rate": 8.224604455075115e-06,
"loss": 1.8432125091552733,
"mean_token_accuracy": 0.6731441116891801,
"num_tokens": 3342818.0,
"step": 580
},
{
"entropy": 1.6787990959361196,
"epoch": 0.3046586306498201,
"grad_norm": 3.129047393798828,
"learning_rate": 8.160232936390239e-06,
"loss": 1.8712753295898437,
"mean_token_accuracy": 0.6667228513397276,
"num_tokens": 3400376.0,
"step": 590
},
{
"entropy": 1.6542711967602373,
"epoch": 0.3098223362540543,
"grad_norm": 2.696822166442871,
"learning_rate": 8.094977081233006e-06,
"loss": 1.8849586486816405,
"mean_token_accuracy": 0.6719589663669467,
"num_tokens": 3456541.0,
"step": 600
},
{
"entropy": 1.6884654670953751,
"epoch": 0.31498604185828855,
"grad_norm": 2.8305869102478027,
"learning_rate": 8.02885515032467e-06,
"loss": 1.8814594268798828,
"mean_token_accuracy": 0.6616028868593276,
"num_tokens": 3517505.0,
"step": 610
},
{
"entropy": 1.6523817678913475,
"epoch": 0.3201497474625228,
"grad_norm": 2.9480113983154297,
"learning_rate": 7.961885646742793e-06,
"loss": 1.8499563217163086,
"mean_token_accuracy": 0.6699530448764562,
"num_tokens": 3576873.0,
"step": 620
},
{
"entropy": 1.6591516112908722,
"epoch": 0.325313453066757,
"grad_norm": 2.808748722076416,
"learning_rate": 7.894087310743468e-06,
"loss": 1.8640859603881836,
"mean_token_accuracy": 0.6685048970393836,
"num_tokens": 3635972.0,
"step": 630
},
{
"entropy": 1.6725056597962975,
"epoch": 0.33047715867099126,
"grad_norm": 2.86258602142334,
"learning_rate": 7.825479114517197e-06,
"loss": 1.8851621627807618,
"mean_token_accuracy": 0.6656569407321513,
"num_tokens": 3695665.0,
"step": 640
},
{
"entropy": 1.7031017780303954,
"epoch": 0.3356408642752255,
"grad_norm": 2.7420291900634766,
"learning_rate": 7.756080256879837e-06,
"loss": 1.9014200210571288,
"mean_token_accuracy": 0.6594709505327045,
"num_tokens": 3756825.0,
"step": 650
},
{
"entropy": 1.6275493199937046,
"epoch": 0.34080456987945973,
"grad_norm": 2.4571967124938965,
"learning_rate": 7.685910157900158e-06,
"loss": 1.8154626846313477,
"mean_token_accuracy": 0.6747128195129335,
"num_tokens": 3810252.0,
"step": 660
},
{
"entropy": 1.6585977658629418,
"epoch": 0.34596827548369397,
"grad_norm": 2.930661678314209,
"learning_rate": 7.614988453465469e-06,
"loss": 1.8117719650268556,
"mean_token_accuracy": 0.6702397681772709,
"num_tokens": 3867849.0,
"step": 670
},
{
"entropy": 1.613425246719271,
"epoch": 0.3511319810879282,
"grad_norm": 2.6743385791778564,
"learning_rate": 7.5433349897868445e-06,
"loss": 1.8200990676879882,
"mean_token_accuracy": 0.6785018056631088,
"num_tokens": 3923617.0,
"step": 680
},
{
"entropy": 1.6036935173906386,
"epoch": 0.35629568669216244,
"grad_norm": 3.227348804473877,
"learning_rate": 7.470969817845518e-06,
"loss": 1.8284185409545899,
"mean_token_accuracy": 0.677451788727194,
"num_tokens": 3982408.0,
"step": 690
},
{
"entropy": 1.6516794299706816,
"epoch": 0.3614593922963967,
"grad_norm": 2.5348830223083496,
"learning_rate": 7.397913187781962e-06,
"loss": 1.7846315383911133,
"mean_token_accuracy": 0.667611647490412,
"num_tokens": 4042044.0,
"step": 700
},
{
"entropy": 1.6284298423677683,
"epoch": 0.36662309790063097,
"grad_norm": 2.7191591262817383,
"learning_rate": 7.324185543229226e-06,
"loss": 1.7883028030395507,
"mean_token_accuracy": 0.6704605929553509,
"num_tokens": 4101051.0,
"step": 710
},
{
"entropy": 1.6191234907135368,
"epoch": 0.3717868035048652,
"grad_norm": 3.107022285461426,
"learning_rate": 7.249807515592149e-06,
"loss": 1.8238798141479493,
"mean_token_accuracy": 0.6791106869466603,
"num_tokens": 4155970.0,
"step": 720
},
{
"entropy": 1.608538744226098,
"epoch": 0.37695050910909944,
"grad_norm": 2.7626278400421143,
"learning_rate": 7.174799918274018e-06,
"loss": 1.8144886016845703,
"mean_token_accuracy": 0.6752197206951678,
"num_tokens": 4214152.0,
"step": 730
},
{
"entropy": 1.5898057647049426,
"epoch": 0.3821142147133337,
"grad_norm": 3.050821304321289,
"learning_rate": 7.099183740852296e-06,
"loss": 1.7754302978515626,
"mean_token_accuracy": 0.6882044620811939,
"num_tokens": 4268661.0,
"step": 740
},
{
"entropy": 1.589722546003759,
"epoch": 0.3872779203175679,
"grad_norm": 2.4175822734832764,
"learning_rate": 7.022980143205046e-06,
"loss": 1.7560914993286132,
"mean_token_accuracy": 0.6823293645866215,
"num_tokens": 4326013.0,
"step": 750
},
{
"entropy": 1.617487209662795,
"epoch": 0.39244162592180215,
"grad_norm": 3.3936614990234375,
"learning_rate": 6.946210449589714e-06,
"loss": 1.7842348098754883,
"mean_token_accuracy": 0.6780483150854707,
"num_tokens": 4383920.0,
"step": 760
},
{
"entropy": 1.533230573683977,
"epoch": 0.3976053315260364,
"grad_norm": 2.9665133953094482,
"learning_rate": 6.868896142675903e-06,
"loss": 1.710638427734375,
"mean_token_accuracy": 0.6923438510857522,
"num_tokens": 4439586.0,
"step": 770
},
{
"entropy": 1.5793293181806802,
"epoch": 0.4027690371302706,
"grad_norm": 3.2671494483947754,
"learning_rate": 6.791058857533814e-06,
"loss": 1.7711971282958985,
"mean_token_accuracy": 0.6793887334875762,
"num_tokens": 4499436.0,
"step": 780
},
{
"entropy": 1.6055224198848008,
"epoch": 0.40793274273450486,
"grad_norm": 3.0365958213806152,
"learning_rate": 6.712720375580057e-06,
"loss": 1.7774797439575196,
"mean_token_accuracy": 0.6797658964060247,
"num_tokens": 4560396.0,
"step": 790
},
{
"entropy": 1.5976737398654222,
"epoch": 0.4130964483387391,
"grad_norm": 3.591005802154541,
"learning_rate": 6.633902618482484e-06,
"loss": 1.799213981628418,
"mean_token_accuracy": 0.6778102850541472,
"num_tokens": 4615989.0,
"step": 800
},
{
"entropy": 1.5854384305886924,
"epoch": 0.41826015394297333,
"grad_norm": 3.1233737468719482,
"learning_rate": 6.554627642025807e-06,
"loss": 1.7758049011230468,
"mean_token_accuracy": 0.6774546066299081,
"num_tokens": 4672312.0,
"step": 810
},
{
"entropy": 1.600548622570932,
"epoch": 0.42342385954720757,
"grad_norm": 2.7607760429382324,
"learning_rate": 6.474917629939652e-06,
"loss": 1.76180419921875,
"mean_token_accuracy": 0.6780235351994633,
"num_tokens": 4732253.0,
"step": 820
},
{
"entropy": 1.5646572889760137,
"epoch": 0.4285875651514418,
"grad_norm": 2.9936444759368896,
"learning_rate": 6.394794887690838e-06,
"loss": 1.7622745513916016,
"mean_token_accuracy": 0.6872309047728777,
"num_tokens": 4790066.0,
"step": 830
},
{
"entropy": 1.5807129088789225,
"epoch": 0.43375127075567604,
"grad_norm": 3.0497989654541016,
"learning_rate": 6.314281836241573e-06,
"loss": 1.7779891967773438,
"mean_token_accuracy": 0.6838998203165829,
"num_tokens": 4845690.0,
"step": 840
},
{
"entropy": 1.5713144928216933,
"epoch": 0.4389149763599103,
"grad_norm": 3.0101318359375,
"learning_rate": 6.233401005775339e-06,
"loss": 1.7724430084228515,
"mean_token_accuracy": 0.6852510153315962,
"num_tokens": 4906514.0,
"step": 850
},
{
"entropy": 1.5716465872712433,
"epoch": 0.4440786819641445,
"grad_norm": 3.062901258468628,
"learning_rate": 6.1521750293922035e-06,
"loss": 1.728415298461914,
"mean_token_accuracy": 0.6828448900021613,
"num_tokens": 4962657.0,
"step": 860
},
{
"entropy": 1.5911185608245433,
"epoch": 0.44924238756837875,
"grad_norm": 3.1436402797698975,
"learning_rate": 6.070626636775349e-06,
"loss": 1.7529178619384767,
"mean_token_accuracy": 0.6815405933186411,
"num_tokens": 5019475.0,
"step": 870
},
{
"entropy": 1.6022390400990845,
"epoch": 0.454406093172613,
"grad_norm": 3.270408868789673,
"learning_rate": 5.988778647830554e-06,
"loss": 1.7645608901977539,
"mean_token_accuracy": 0.6775381861254572,
"num_tokens": 5074009.0,
"step": 880
},
{
"entropy": 1.5316935462877155,
"epoch": 0.4595697987768472,
"grad_norm": 3.3750274181365967,
"learning_rate": 5.906653966300444e-06,
"loss": 1.7380414962768556,
"mean_token_accuracy": 0.6924085746519267,
"num_tokens": 5131114.0,
"step": 890
},
{
"entropy": 1.5163973657414318,
"epoch": 0.46473350438108146,
"grad_norm": 3.4683239459991455,
"learning_rate": 5.824275573355278e-06,
"loss": 1.7235090255737304,
"mean_token_accuracy": 0.6898601963184774,
"num_tokens": 5184643.0,
"step": 900
},
{
"entropy": 1.5578045804984868,
"epoch": 0.4698972099853157,
"grad_norm": 2.7193562984466553,
"learning_rate": 5.741666521162055e-06,
"loss": 1.7631567001342774,
"mean_token_accuracy": 0.6847550798207521,
"num_tokens": 5245294.0,
"step": 910
},
{
"entropy": 1.5216822805814445,
"epoch": 0.47506091558954994,
"grad_norm": 3.321866273880005,
"learning_rate": 5.658849926433774e-06,
"loss": 1.7373876571655273,
"mean_token_accuracy": 0.6913335792720318,
"num_tokens": 5299386.0,
"step": 920
},
{
"entropy": 1.5747642540372908,
"epoch": 0.4802246211937842,
"grad_norm": 3.5749261379241943,
"learning_rate": 5.575848963960621e-06,
"loss": 1.8702735900878906,
"mean_token_accuracy": 0.6848366302903741,
"num_tokens": 5359761.0,
"step": 930
},
{
"entropy": 1.5551650236360728,
"epoch": 0.4853883267980184,
"grad_norm": 2.854201555252075,
"learning_rate": 5.4926868601249e-06,
"loss": 1.7384683609008789,
"mean_token_accuracy": 0.6877018769271672,
"num_tokens": 5419068.0,
"step": 940
},
{
"entropy": 1.5700966760516166,
"epoch": 0.49055203240225265,
"grad_norm": 3.1503734588623047,
"learning_rate": 5.4093868864015405e-06,
"loss": 1.7581310272216797,
"mean_token_accuracy": 0.6791030686348677,
"num_tokens": 5478815.0,
"step": 950
},
{
"entropy": 1.613727968931198,
"epoch": 0.4957157380064869,
"grad_norm": 2.6259965896606445,
"learning_rate": 5.325972352845965e-06,
"loss": 1.7862756729125977,
"mean_token_accuracy": 0.6786239412613213,
"num_tokens": 5540701.0,
"step": 960
},
{
"entropy": 1.5610787151381373,
"epoch": 0.5008794436107211,
"grad_norm": 3.689964532852173,
"learning_rate": 5.24246660157119e-06,
"loss": 1.7218122482299805,
"mean_token_accuracy": 0.6857390251941979,
"num_tokens": 5600139.0,
"step": 970
},
{
"entropy": 1.5385319583117962,
"epoch": 0.5060431492149554,
"grad_norm": 3.3747434616088867,
"learning_rate": 5.1588930002159255e-06,
"loss": 1.7435245513916016,
"mean_token_accuracy": 0.6888230754062533,
"num_tokens": 5660146.0,
"step": 980
},
{
"entropy": 1.5208949162624776,
"epoch": 0.5112068548191896,
"grad_norm": 3.128319501876831,
"learning_rate": 5.075274935405554e-06,
"loss": 1.7131477355957032,
"mean_token_accuracy": 0.6928804327733815,
"num_tokens": 5715836.0,
"step": 990
},
{
"entropy": 1.570724095776677,
"epoch": 0.5163705604234239,
"grad_norm": 3.4249417781829834,
"learning_rate": 4.991635806207788e-06,
"loss": 1.740692710876465,
"mean_token_accuracy": 0.6794734395109117,
"num_tokens": 5775680.0,
"step": 1000
},
{
"entropy": 1.5739252456463872,
"epoch": 0.5215342660276581,
"grad_norm": 3.293403148651123,
"learning_rate": 4.90799901758484e-06,
"loss": 1.7488651275634766,
"mean_token_accuracy": 0.6808769708499313,
"num_tokens": 5835601.0,
"step": 1010
},
{
"entropy": 1.5107452761381865,
"epoch": 0.5266979716318924,
"grad_norm": 2.878034830093384,
"learning_rate": 4.824387973843957e-06,
"loss": 1.6590751647949218,
"mean_token_accuracy": 0.690271249320358,
"num_tokens": 5890934.0,
"step": 1020
},
{
"entropy": 1.514897836279124,
"epoch": 0.5318616772361265,
"grad_norm": 3.4561750888824463,
"learning_rate": 4.74082607208812e-06,
"loss": 1.731280517578125,
"mean_token_accuracy": 0.6955772273242473,
"num_tokens": 5945888.0,
"step": 1030
},
{
"entropy": 1.5494694444350898,
"epoch": 0.5370253828403608,
"grad_norm": 2.9247806072235107,
"learning_rate": 4.6573366956687885e-06,
"loss": 1.7154525756835937,
"mean_token_accuracy": 0.6881961709819734,
"num_tokens": 6006943.0,
"step": 1040
},
{
"entropy": 1.503813881985843,
"epoch": 0.542189088444595,
"grad_norm": 3.631777286529541,
"learning_rate": 4.573943207642452e-06,
"loss": 1.681452751159668,
"mean_token_accuracy": 0.697669006511569,
"num_tokens": 6060833.0,
"step": 1050
},
{
"entropy": 1.5411254486069084,
"epoch": 0.5473527940488293,
"grad_norm": 3.4545819759368896,
"learning_rate": 4.4906689442328935e-06,
"loss": 1.7160356521606446,
"mean_token_accuracy": 0.6927138103172183,
"num_tokens": 6120497.0,
"step": 1060
},
{
"entropy": 1.5344152220524847,
"epoch": 0.5525164996530635,
"grad_norm": 3.3207011222839355,
"learning_rate": 4.407537208300957e-06,
"loss": 1.706760787963867,
"mean_token_accuracy": 0.6856313841417432,
"num_tokens": 6174935.0,
"step": 1070
},
{
"entropy": 1.5373618413694203,
"epoch": 0.5576802052572978,
"grad_norm": 3.1633057594299316,
"learning_rate": 4.3245712628236356e-06,
"loss": 1.6977998733520507,
"mean_token_accuracy": 0.6875226662494243,
"num_tokens": 6232772.0,
"step": 1080
},
{
"entropy": 1.5202652599662543,
"epoch": 0.562843910861532,
"grad_norm": 3.3870980739593506,
"learning_rate": 4.241794324384334e-06,
"loss": 1.6651535034179688,
"mean_token_accuracy": 0.6929561857134103,
"num_tokens": 6288864.0,
"step": 1090
},
{
"entropy": 1.5275507621467113,
"epoch": 0.5680076164657663,
"grad_norm": 3.7178127765655518,
"learning_rate": 4.159229556676111e-06,
"loss": 1.7133949279785157,
"mean_token_accuracy": 0.6909235632047057,
"num_tokens": 6344455.0,
"step": 1100
},
{
"entropy": 1.5437531962059439,
"epoch": 0.5731713220700004,
"grad_norm": 3.153742551803589,
"learning_rate": 4.076900064019721e-06,
"loss": 1.6549795150756836,
"mean_token_accuracy": 0.6886627374216914,
"num_tokens": 6404487.0,
"step": 1110
},
{
"entropy": 1.5580279475077987,
"epoch": 0.5783350276742347,
"grad_norm": 3.5760765075683594,
"learning_rate": 3.994828884898267e-06,
"loss": 1.7145551681518554,
"mean_token_accuracy": 0.682994660269469,
"num_tokens": 6461435.0,
"step": 1120
},
{
"entropy": 1.5585046796128155,
"epoch": 0.5834987332784689,
"grad_norm": 3.4421780109405518,
"learning_rate": 3.91303898551028e-06,
"loss": 1.7370725631713868,
"mean_token_accuracy": 0.6830578180029988,
"num_tokens": 6519733.0,
"step": 1130
},
{
"entropy": 1.5062665017321706,
"epoch": 0.5886624388827032,
"grad_norm": 3.7130508422851562,
"learning_rate": 3.8315532533430285e-06,
"loss": 1.6507293701171875,
"mean_token_accuracy": 0.6971155289560557,
"num_tokens": 6574778.0,
"step": 1140
},
{
"entropy": 1.5483961730264126,
"epoch": 0.5938261444869375,
"grad_norm": 3.213446617126465,
"learning_rate": 3.7503944907678543e-06,
"loss": 1.7045827865600587,
"mean_token_accuracy": 0.6846825909800828,
"num_tokens": 6636487.0,
"step": 1150
},
{
"entropy": 1.521242902148515,
"epoch": 0.5989898500911717,
"grad_norm": 3.2636988162994385,
"learning_rate": 3.6695854086593126e-06,
"loss": 1.729298973083496,
"mean_token_accuracy": 0.6911605210974813,
"num_tokens": 6694875.0,
"step": 1160
},
{
"entropy": 1.5237868349999188,
"epoch": 0.604153555695406,
"grad_norm": 2.997082471847534,
"learning_rate": 3.5891486200399413e-06,
"loss": 1.6901542663574218,
"mean_token_accuracy": 0.6919798749499023,
"num_tokens": 6753426.0,
"step": 1170
},
{
"entropy": 1.5269257510080934,
"epoch": 0.6093172612996401,
"grad_norm": 3.731106996536255,
"learning_rate": 3.509106633752387e-06,
"loss": 1.6440200805664062,
"mean_token_accuracy": 0.6950043804012239,
"num_tokens": 6808143.0,
"step": 1180
},
{
"entropy": 1.5221130210906266,
"epoch": 0.6144809669038744,
"grad_norm": 3.8402719497680664,
"learning_rate": 3.429481848160702e-06,
"loss": 1.6718801498413085,
"mean_token_accuracy": 0.6911504022777081,
"num_tokens": 6864798.0,
"step": 1190
},
{
"entropy": 1.5205140718258918,
"epoch": 0.6196446725081086,
"grad_norm": 3.4700653553009033,
"learning_rate": 3.350296544882543e-06,
"loss": 1.6980148315429688,
"mean_token_accuracy": 0.6922329823486507,
"num_tokens": 6922981.0,
"step": 1200
},
{
"entropy": 1.5266519831493497,
"epoch": 0.6248083781123429,
"grad_norm": 3.607825517654419,
"learning_rate": 3.2715728825540525e-06,
"loss": 1.631779098510742,
"mean_token_accuracy": 0.6872100684791803,
"num_tokens": 6981533.0,
"step": 1210
},
{
"entropy": 1.5002226968295873,
"epoch": 0.6299720837165771,
"grad_norm": 3.377911329269409,
"learning_rate": 3.19333289062915e-06,
"loss": 1.6522918701171876,
"mean_token_accuracy": 0.6967718885280192,
"num_tokens": 7038373.0,
"step": 1220
},
{
"entropy": 1.5242467124015093,
"epoch": 0.6351357893208114,
"grad_norm": 3.501469135284424,
"learning_rate": 3.1155984632149565e-06,
"loss": 1.6960077285766602,
"mean_token_accuracy": 0.6928639176301659,
"num_tokens": 7093887.0,
"step": 1230
},
{
"entropy": 1.4608128021471203,
"epoch": 0.6402994949250456,
"grad_norm": 3.654232978820801,
"learning_rate": 3.0383913529451286e-06,
"loss": 1.7012401580810548,
"mean_token_accuracy": 0.7011943313293159,
"num_tokens": 7151754.0,
"step": 1240
},
{
"entropy": 1.5049133917316795,
"epoch": 0.6454632005292799,
"grad_norm": 3.303011655807495,
"learning_rate": 2.961733164892744e-06,
"loss": 1.6440134048461914,
"mean_token_accuracy": 0.6968953931704164,
"num_tokens": 7206859.0,
"step": 1250
},
{
"entropy": 1.5117103354074062,
"epoch": 0.650626906133514,
"grad_norm": 3.7072722911834717,
"learning_rate": 2.8856453505245018e-06,
"loss": 1.6840539932250977,
"mean_token_accuracy": 0.693806461431086,
"num_tokens": 7263449.0,
"step": 1260
},
{
"entropy": 1.5635873224586248,
"epoch": 0.6557906117377483,
"grad_norm": 3.4487006664276123,
"learning_rate": 2.8101492016979027e-06,
"loss": 1.6962623596191406,
"mean_token_accuracy": 0.6828934441320598,
"num_tokens": 7325657.0,
"step": 1270
},
{
"entropy": 1.5361614923924207,
"epoch": 0.6609543173419825,
"grad_norm": 3.230065107345581,
"learning_rate": 2.7352658447030882e-06,
"loss": 1.683184814453125,
"mean_token_accuracy": 0.6885475309565663,
"num_tokens": 7388205.0,
"step": 1280
},
{
"entropy": 1.5501774417236447,
"epoch": 0.6661180229462168,
"grad_norm": 3.5160152912139893,
"learning_rate": 2.6610162343510183e-06,
"loss": 1.677423095703125,
"mean_token_accuracy": 0.6876688521355391,
"num_tokens": 7450244.0,
"step": 1290
},
{
"entropy": 1.5194588591344655,
"epoch": 0.671281728550451,
"grad_norm": 3.322783946990967,
"learning_rate": 2.587421148109619e-06,
"loss": 1.648874855041504,
"mean_token_accuracy": 0.6902382445521653,
"num_tokens": 7505939.0,
"step": 1300
},
{
"entropy": 1.507914131693542,
"epoch": 0.6764454341546853,
"grad_norm": 3.6274726390838623,
"learning_rate": 2.5145011802895835e-06,
"loss": 1.663113784790039,
"mean_token_accuracy": 0.6951411304064095,
"num_tokens": 7564882.0,
"step": 1310
},
{
"entropy": 1.5362407561391591,
"epoch": 0.6816091397589195,
"grad_norm": 3.344320058822632,
"learning_rate": 2.4422767362814045e-06,
"loss": 1.6967851638793945,
"mean_token_accuracy": 0.6901100830174982,
"num_tokens": 7623495.0,
"step": 1320
},
{
"entropy": 1.494422941375524,
"epoch": 0.6867728453631537,
"grad_norm": 3.1491241455078125,
"learning_rate": 2.370768026845276e-06,
"loss": 1.635594367980957,
"mean_token_accuracy": 0.7006629945710301,
"num_tokens": 7679031.0,
"step": 1330
},
{
"entropy": 1.5000297093763948,
"epoch": 0.6919365509673879,
"grad_norm": 3.4950554370880127,
"learning_rate": 2.299995062455459e-06,
"loss": 1.6696474075317382,
"mean_token_accuracy": 0.6986143794842065,
"num_tokens": 7735514.0,
"step": 1340
},
{
"entropy": 1.5232544343918561,
"epoch": 0.6971002565716222,
"grad_norm": 3.4810843467712402,
"learning_rate": 2.2299776477007073e-06,
"loss": 1.7151317596435547,
"mean_token_accuracy": 0.6927640223875642,
"num_tokens": 7796754.0,
"step": 1350
},
{
"entropy": 1.502943632658571,
"epoch": 0.7022639621758564,
"grad_norm": 3.725968837738037,
"learning_rate": 2.16073537574229e-06,
"loss": 1.7005264282226562,
"mean_token_accuracy": 0.6939697286114097,
"num_tokens": 7849113.0,
"step": 1360
},
{
"entropy": 1.478423805627972,
"epoch": 0.7074276677800907,
"grad_norm": 3.172076940536499,
"learning_rate": 2.0922876228311833e-06,
"loss": 1.6220563888549804,
"mean_token_accuracy": 0.7034369039349258,
"num_tokens": 7901767.0,
"step": 1370
},
{
"entropy": 1.5537946743890643,
"epoch": 0.7125913733843249,
"grad_norm": 2.651193380355835,
"learning_rate": 2.0246535428859652e-06,
"loss": 1.6728511810302735,
"mean_token_accuracy": 0.6893611557781696,
"num_tokens": 7958886.0,
"step": 1380
},
{
"entropy": 1.5085574766620993,
"epoch": 0.7177550789885592,
"grad_norm": 3.2171072959899902,
"learning_rate": 1.957852062132924e-06,
"loss": 1.6374216079711914,
"mean_token_accuracy": 0.6916413919068873,
"num_tokens": 8017309.0,
"step": 1390
},
{
"entropy": 1.4872288034297525,
"epoch": 0.7229187845927934,
"grad_norm": 3.231069564819336,
"learning_rate": 1.8919018738098704e-06,
"loss": 1.6256633758544923,
"mean_token_accuracy": 0.700919216312468,
"num_tokens": 8070914.0,
"step": 1400
},
{
"entropy": 1.5161595033481716,
"epoch": 0.7280824901970276,
"grad_norm": 3.446316957473755,
"learning_rate": 1.8268214329351797e-06,
"loss": 1.659726905822754,
"mean_token_accuracy": 0.693359113112092,
"num_tokens": 8131134.0,
"step": 1410
},
{
"entropy": 1.456791919004172,
"epoch": 0.7332461958012619,
"grad_norm": 3.6375229358673096,
"learning_rate": 1.762628951143454e-06,
"loss": 1.6198995590209961,
"mean_token_accuracy": 0.7025071810930967,
"num_tokens": 8190223.0,
"step": 1420
},
{
"entropy": 1.4585289044305683,
"epoch": 0.7384099014054961,
"grad_norm": 3.609488010406494,
"learning_rate": 1.6993423915893241e-06,
"loss": 1.6428106307983399,
"mean_token_accuracy": 0.7031498954631388,
"num_tokens": 8246600.0,
"step": 1430
},
{
"entropy": 1.5095368220470846,
"epoch": 0.7435736070097304,
"grad_norm": 3.793874979019165,
"learning_rate": 1.6369794639207626e-06,
"loss": 1.666793441772461,
"mean_token_accuracy": 0.6975488003343344,
"num_tokens": 8305667.0,
"step": 1440
},
{
"entropy": 1.476070403493941,
"epoch": 0.7487373126139646,
"grad_norm": 3.5500707626342773,
"learning_rate": 1.575557619323353e-06,
"loss": 1.6536979675292969,
"mean_token_accuracy": 0.7006435849703848,
"num_tokens": 8361798.0,
"step": 1450
},
{
"entropy": 1.479835407063365,
"epoch": 0.7539010182181989,
"grad_norm": 3.9020698070526123,
"learning_rate": 1.5150940456368784e-06,
"loss": 1.6674226760864257,
"mean_token_accuracy": 0.6992986600846052,
"num_tokens": 8422131.0,
"step": 1460
},
{
"entropy": 1.5744852369651199,
"epoch": 0.7590647238224331,
"grad_norm": 3.2233102321624756,
"learning_rate": 1.4556056625455922e-06,
"loss": 1.7020431518554688,
"mean_token_accuracy": 0.6818056128919124,
"num_tokens": 8482143.0,
"step": 1470
},
{
"entropy": 1.5154328759759665,
"epoch": 0.7642284294266674,
"grad_norm": 3.932781934738159,
"learning_rate": 1.3971091168435463e-06,
"loss": 1.6716676712036134,
"mean_token_accuracy": 0.6966965162195266,
"num_tokens": 8542786.0,
"step": 1480
},
{
"entropy": 1.4795137772336602,
"epoch": 0.7693921350309015,
"grad_norm": 3.6792986392974854,
"learning_rate": 1.3396207777762732e-06,
"loss": 1.6791370391845704,
"mean_token_accuracy": 0.696836537308991,
"num_tokens": 8600887.0,
"step": 1490
},
{
"entropy": 1.4590562399476767,
"epoch": 0.7745558406351358,
"grad_norm": 3.962369441986084,
"learning_rate": 1.2831567324601325e-06,
"loss": 1.5969234466552735,
"mean_token_accuracy": 0.7039340647868813,
"num_tokens": 8662003.0,
"step": 1500
}
],
"logging_steps": 10,
"max_steps": 1937,
"num_input_tokens_seen": 0,
"num_train_epochs": 1,
"save_steps": 500,
"stateful_callbacks": {
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": true,
"should_training_stop": false
},
"attributes": {}
}
},
"total_flos": 3.716705840348068e+17,
"train_batch_size": 1,
"trial_name": null,
"trial_params": null
}