NLAQA / trainer_state.json
Dilaksan's picture
Upload 13 files
17411fe verified
Raw
History Blame Contribute Delete
43.5 kB
{
"best_global_step": null,
"best_metric": null,
"best_model_checkpoint": null,
"epoch": 20.0,
"eval_steps": 500,
"global_step": 2260,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"epoch": 0.08888888888888889,
"grad_norm": 0.8280278444290161,
"learning_rate": 1.8e-05,
"loss": 0.8199,
"step": 10
},
{
"epoch": 0.17777777777777778,
"grad_norm": 0.33694130182266235,
"learning_rate": 3.8e-05,
"loss": 0.7234,
"step": 20
},
{
"epoch": 0.26666666666666666,
"grad_norm": 0.5253115296363831,
"learning_rate": 5.8e-05,
"loss": 0.6757,
"step": 30
},
{
"epoch": 0.35555555555555557,
"grad_norm": 0.4070330262184143,
"learning_rate": 7.800000000000001e-05,
"loss": 0.5784,
"step": 40
},
{
"epoch": 0.4444444444444444,
"grad_norm": 0.468620240688324,
"learning_rate": 9.8e-05,
"loss": 0.5344,
"step": 50
},
{
"epoch": 0.5333333333333333,
"grad_norm": 0.29918837547302246,
"learning_rate": 9.999590801246853e-05,
"loss": 0.4592,
"step": 60
},
{
"epoch": 0.6222222222222222,
"grad_norm": 0.46750399470329285,
"learning_rate": 9.998176373027159e-05,
"loss": 0.4602,
"step": 70
},
{
"epoch": 0.7111111111111111,
"grad_norm": 0.5740944147109985,
"learning_rate": 9.995751949253889e-05,
"loss": 0.4043,
"step": 80
},
{
"epoch": 0.8,
"grad_norm": 0.5454725027084351,
"learning_rate": 9.99231801983717e-05,
"loss": 0.3956,
"step": 90
},
{
"epoch": 0.8888888888888888,
"grad_norm": 0.6640157103538513,
"learning_rate": 9.987875278680778e-05,
"loss": 0.4194,
"step": 100
},
{
"epoch": 0.9777777777777777,
"grad_norm": 0.5255690813064575,
"learning_rate": 9.982424623541908e-05,
"loss": 0.3796,
"step": 110
},
{
"epoch": 1.0,
"eval_loss": 0.3822258412837982,
"eval_runtime": 24.245,
"eval_samples_per_second": 4.125,
"eval_steps_per_second": 0.536,
"step": 113
},
{
"epoch": 1.0622222222222222,
"grad_norm": 0.46724095940589905,
"learning_rate": 9.975967155849773e-05,
"loss": 0.3253,
"step": 120
},
{
"epoch": 1.1511111111111112,
"grad_norm": 0.40628087520599365,
"learning_rate": 9.968504180483023e-05,
"loss": 0.3997,
"step": 130
},
{
"epoch": 1.24,
"grad_norm": 0.641273558139801,
"learning_rate": 9.960037205506079e-05,
"loss": 0.3381,
"step": 140
},
{
"epoch": 1.3288888888888888,
"grad_norm": 0.5509289503097534,
"learning_rate": 9.950567941864377e-05,
"loss": 0.3444,
"step": 150
},
{
"epoch": 1.4177777777777778,
"grad_norm": 0.49098026752471924,
"learning_rate": 9.94009830303865e-05,
"loss": 0.3568,
"step": 160
},
{
"epoch": 1.5066666666666668,
"grad_norm": 0.6113401055335999,
"learning_rate": 9.928630404658255e-05,
"loss": 0.3037,
"step": 170
},
{
"epoch": 1.5955555555555554,
"grad_norm": 0.41983288526535034,
"learning_rate": 9.916166564073662e-05,
"loss": 0.3177,
"step": 180
},
{
"epoch": 1.6844444444444444,
"grad_norm": 0.5567779541015625,
"learning_rate": 9.90270929988818e-05,
"loss": 0.3761,
"step": 190
},
{
"epoch": 1.7733333333333334,
"grad_norm": 0.4871814250946045,
"learning_rate": 9.888261331449029e-05,
"loss": 0.3177,
"step": 200
},
{
"epoch": 1.8622222222222222,
"grad_norm": 0.8324890732765198,
"learning_rate": 9.872825578297811e-05,
"loss": 0.3103,
"step": 210
},
{
"epoch": 1.951111111111111,
"grad_norm": 0.5431402325630188,
"learning_rate": 9.85640515958057e-05,
"loss": 0.3238,
"step": 220
},
{
"epoch": 2.0,
"eval_loss": 0.3141745328903198,
"eval_runtime": 22.8047,
"eval_samples_per_second": 4.385,
"eval_steps_per_second": 0.57,
"step": 226
},
{
"epoch": 2.0355555555555553,
"grad_norm": 0.46945399045944214,
"learning_rate": 9.839003393417486e-05,
"loss": 0.3596,
"step": 230
},
{
"epoch": 2.1244444444444444,
"grad_norm": 0.5933423042297363,
"learning_rate": 9.820623796232378e-05,
"loss": 0.2621,
"step": 240
},
{
"epoch": 2.2133333333333334,
"grad_norm": 0.5787666440010071,
"learning_rate": 9.80127008204213e-05,
"loss": 0.2739,
"step": 250
},
{
"epoch": 2.3022222222222224,
"grad_norm": 0.6163641810417175,
"learning_rate": 9.780946161706188e-05,
"loss": 0.2683,
"step": 260
},
{
"epoch": 2.391111111111111,
"grad_norm": 0.6638880968093872,
"learning_rate": 9.759656142136279e-05,
"loss": 0.2813,
"step": 270
},
{
"epoch": 2.48,
"grad_norm": 0.550884485244751,
"learning_rate": 9.737404325466521e-05,
"loss": 0.3166,
"step": 280
},
{
"epoch": 2.568888888888889,
"grad_norm": 0.9437989592552185,
"learning_rate": 9.714195208184076e-05,
"loss": 0.286,
"step": 290
},
{
"epoch": 2.6577777777777776,
"grad_norm": 0.6860134601593018,
"learning_rate": 9.690033480220535e-05,
"loss": 0.2935,
"step": 300
},
{
"epoch": 2.7466666666666666,
"grad_norm": 0.7631677389144897,
"learning_rate": 9.664924024004203e-05,
"loss": 0.2836,
"step": 310
},
{
"epoch": 2.8355555555555556,
"grad_norm": 1.093269944190979,
"learning_rate": 9.638871913473501e-05,
"loss": 0.2875,
"step": 320
},
{
"epoch": 2.924444444444444,
"grad_norm": 0.7322181463241577,
"learning_rate": 9.611882413051659e-05,
"loss": 0.2811,
"step": 330
},
{
"epoch": 3.0,
"eval_loss": 0.29859602451324463,
"eval_runtime": 22.7936,
"eval_samples_per_second": 4.387,
"eval_steps_per_second": 0.57,
"step": 339
},
{
"epoch": 3.008888888888889,
"grad_norm": 0.6508819460868835,
"learning_rate": 9.583960976582913e-05,
"loss": 0.2612,
"step": 340
},
{
"epoch": 3.097777777777778,
"grad_norm": 0.813624382019043,
"learning_rate": 9.555113246230442e-05,
"loss": 0.2477,
"step": 350
},
{
"epoch": 3.1866666666666665,
"grad_norm": 0.7740529775619507,
"learning_rate": 9.525345051336232e-05,
"loss": 0.2508,
"step": 360
},
{
"epoch": 3.2755555555555556,
"grad_norm": 0.6230549812316895,
"learning_rate": 9.494662407243129e-05,
"loss": 0.2201,
"step": 370
},
{
"epoch": 3.3644444444444446,
"grad_norm": 0.605621874332428,
"learning_rate": 9.463071514079299e-05,
"loss": 0.2579,
"step": 380
},
{
"epoch": 3.453333333333333,
"grad_norm": 0.6390963196754456,
"learning_rate": 9.430578755505345e-05,
"loss": 0.2468,
"step": 390
},
{
"epoch": 3.542222222222222,
"grad_norm": 0.6382352709770203,
"learning_rate": 9.39719069742436e-05,
"loss": 0.254,
"step": 400
},
{
"epoch": 3.631111111111111,
"grad_norm": 1.0674622058868408,
"learning_rate": 9.36291408665512e-05,
"loss": 0.2817,
"step": 410
},
{
"epoch": 3.7199999999999998,
"grad_norm": 0.6276893615722656,
"learning_rate": 9.327755849568745e-05,
"loss": 0.2549,
"step": 420
},
{
"epoch": 3.8088888888888888,
"grad_norm": 0.8051192164421082,
"learning_rate": 9.291723090689058e-05,
"loss": 0.2707,
"step": 430
},
{
"epoch": 3.897777777777778,
"grad_norm": 1.0645169019699097,
"learning_rate": 9.25482309125696e-05,
"loss": 0.2107,
"step": 440
},
{
"epoch": 3.986666666666667,
"grad_norm": 0.9240409135818481,
"learning_rate": 9.217063307759098e-05,
"loss": 0.2654,
"step": 450
},
{
"epoch": 4.0,
"eval_loss": 0.29310476779937744,
"eval_runtime": 22.794,
"eval_samples_per_second": 4.387,
"eval_steps_per_second": 0.57,
"step": 452
},
{
"epoch": 4.071111111111111,
"grad_norm": 0.6939980983734131,
"learning_rate": 9.178451370421092e-05,
"loss": 0.2052,
"step": 460
},
{
"epoch": 4.16,
"grad_norm": 0.731479823589325,
"learning_rate": 9.138995081665691e-05,
"loss": 0.2145,
"step": 470
},
{
"epoch": 4.248888888888889,
"grad_norm": 0.8955116868019104,
"learning_rate": 9.098702414536107e-05,
"loss": 0.2046,
"step": 480
},
{
"epoch": 4.337777777777778,
"grad_norm": 1.1034150123596191,
"learning_rate": 9.057581511084879e-05,
"loss": 0.1743,
"step": 490
},
{
"epoch": 4.426666666666667,
"grad_norm": 0.9072665572166443,
"learning_rate": 9.015640680728595e-05,
"loss": 0.2571,
"step": 500
},
{
"epoch": 4.515555555555555,
"grad_norm": 1.0989047288894653,
"learning_rate": 8.972888398568772e-05,
"loss": 0.2083,
"step": 510
},
{
"epoch": 4.604444444444445,
"grad_norm": 1.1180020570755005,
"learning_rate": 8.929333303679276e-05,
"loss": 0.2248,
"step": 520
},
{
"epoch": 4.693333333333333,
"grad_norm": 0.9198616743087769,
"learning_rate": 8.884984197360605e-05,
"loss": 0.2404,
"step": 530
},
{
"epoch": 4.782222222222222,
"grad_norm": 0.8098738789558411,
"learning_rate": 8.839850041361368e-05,
"loss": 0.2395,
"step": 540
},
{
"epoch": 4.871111111111111,
"grad_norm": 0.9560163617134094,
"learning_rate": 8.793939956067379e-05,
"loss": 0.2291,
"step": 550
},
{
"epoch": 4.96,
"grad_norm": 0.9346197247505188,
"learning_rate": 8.747263218658661e-05,
"loss": 0.2112,
"step": 560
},
{
"epoch": 5.0,
"eval_loss": 0.2931341826915741,
"eval_runtime": 22.801,
"eval_samples_per_second": 4.386,
"eval_steps_per_second": 0.57,
"step": 565
},
{
"epoch": 5.044444444444444,
"grad_norm": 0.727533221244812,
"learning_rate": 8.699829261234791e-05,
"loss": 0.2315,
"step": 570
},
{
"epoch": 5.133333333333334,
"grad_norm": 0.8154391050338745,
"learning_rate": 8.651647668908917e-05,
"loss": 0.23,
"step": 580
},
{
"epoch": 5.222222222222222,
"grad_norm": 1.1250296831130981,
"learning_rate": 8.60272817787088e-05,
"loss": 0.1952,
"step": 590
},
{
"epoch": 5.311111111111111,
"grad_norm": 1.1119612455368042,
"learning_rate": 8.553080673419784e-05,
"loss": 0.1742,
"step": 600
},
{
"epoch": 5.4,
"grad_norm": 1.0984034538269043,
"learning_rate": 8.502715187966455e-05,
"loss": 0.2081,
"step": 610
},
{
"epoch": 5.488888888888889,
"grad_norm": 0.9959269165992737,
"learning_rate": 8.451641899006155e-05,
"loss": 0.1958,
"step": 620
},
{
"epoch": 5.5777777777777775,
"grad_norm": 0.8436211347579956,
"learning_rate": 8.399871127061991e-05,
"loss": 0.1772,
"step": 630
},
{
"epoch": 5.666666666666667,
"grad_norm": 1.0537818670272827,
"learning_rate": 8.347413333599419e-05,
"loss": 0.1792,
"step": 640
},
{
"epoch": 5.7555555555555555,
"grad_norm": 1.2140848636627197,
"learning_rate": 8.294279118912267e-05,
"loss": 0.2104,
"step": 650
},
{
"epoch": 5.844444444444444,
"grad_norm": 1.4907416105270386,
"learning_rate": 8.240479219980697e-05,
"loss": 0.2044,
"step": 660
},
{
"epoch": 5.933333333333334,
"grad_norm": 0.8753892183303833,
"learning_rate": 8.186024508301564e-05,
"loss": 0.1779,
"step": 670
},
{
"epoch": 6.0,
"eval_loss": 0.30221858620643616,
"eval_runtime": 22.8113,
"eval_samples_per_second": 4.384,
"eval_steps_per_second": 0.57,
"step": 678
},
{
"epoch": 6.017777777777778,
"grad_norm": 1.161600112915039,
"learning_rate": 8.130925987691569e-05,
"loss": 0.2089,
"step": 680
},
{
"epoch": 6.1066666666666665,
"grad_norm": 1.0779800415039062,
"learning_rate": 8.0751947920637e-05,
"loss": 0.1549,
"step": 690
},
{
"epoch": 6.195555555555556,
"grad_norm": 1.244500756263733,
"learning_rate": 8.018842183177363e-05,
"loss": 0.1777,
"step": 700
},
{
"epoch": 6.2844444444444445,
"grad_norm": 1.0372693538665771,
"learning_rate": 7.961879548362687e-05,
"loss": 0.1681,
"step": 710
},
{
"epoch": 6.373333333333333,
"grad_norm": 1.275514841079712,
"learning_rate": 7.904318398219456e-05,
"loss": 0.1783,
"step": 720
},
{
"epoch": 6.4622222222222225,
"grad_norm": 1.0903297662734985,
"learning_rate": 7.84617036429113e-05,
"loss": 0.1777,
"step": 730
},
{
"epoch": 6.551111111111111,
"grad_norm": 1.1274893283843994,
"learning_rate": 7.787447196714427e-05,
"loss": 0.1372,
"step": 740
},
{
"epoch": 6.64,
"grad_norm": 1.0295445919036865,
"learning_rate": 7.728160761844938e-05,
"loss": 0.1765,
"step": 750
},
{
"epoch": 6.728888888888889,
"grad_norm": 0.7822284698486328,
"learning_rate": 7.668323039859255e-05,
"loss": 0.1741,
"step": 760
},
{
"epoch": 6.817777777777778,
"grad_norm": 1.2998981475830078,
"learning_rate": 7.607946122334115e-05,
"loss": 0.1763,
"step": 770
},
{
"epoch": 6.906666666666666,
"grad_norm": 0.9125447273254395,
"learning_rate": 7.54704220980301e-05,
"loss": 0.1672,
"step": 780
},
{
"epoch": 6.995555555555556,
"grad_norm": 1.3892459869384766,
"learning_rate": 7.485623609290792e-05,
"loss": 0.201,
"step": 790
},
{
"epoch": 7.0,
"eval_loss": 0.31423336267471313,
"eval_runtime": 22.8119,
"eval_samples_per_second": 4.384,
"eval_steps_per_second": 0.57,
"step": 791
},
{
"epoch": 7.08,
"grad_norm": 1.2177425622940063,
"learning_rate": 7.423702731826764e-05,
"loss": 0.161,
"step": 800
},
{
"epoch": 7.168888888888889,
"grad_norm": 1.2349414825439453,
"learning_rate": 7.361292089936748e-05,
"loss": 0.1288,
"step": 810
},
{
"epoch": 7.257777777777778,
"grad_norm": 1.3617855310440063,
"learning_rate": 7.298404295114633e-05,
"loss": 0.1498,
"step": 820
},
{
"epoch": 7.346666666666667,
"grad_norm": 1.0532838106155396,
"learning_rate": 7.235052055273947e-05,
"loss": 0.145,
"step": 830
},
{
"epoch": 7.435555555555555,
"grad_norm": 2.5282888412475586,
"learning_rate": 7.171248172179933e-05,
"loss": 0.1572,
"step": 840
},
{
"epoch": 7.524444444444445,
"grad_norm": 1.316571831703186,
"learning_rate": 7.107005538862646e-05,
"loss": 0.1743,
"step": 850
},
{
"epoch": 7.613333333333333,
"grad_norm": 1.0913692712783813,
"learning_rate": 7.042337137011641e-05,
"loss": 0.1319,
"step": 860
},
{
"epoch": 7.702222222222222,
"grad_norm": 1.2439199686050415,
"learning_rate": 6.977256034352712e-05,
"loss": 0.1523,
"step": 870
},
{
"epoch": 7.791111111111111,
"grad_norm": 1.400645136833191,
"learning_rate": 6.911775382007274e-05,
"loss": 0.1647,
"step": 880
},
{
"epoch": 7.88,
"grad_norm": 1.1752562522888184,
"learning_rate": 6.845908411834859e-05,
"loss": 0.147,
"step": 890
},
{
"epoch": 7.968888888888889,
"grad_norm": 1.1503429412841797,
"learning_rate": 6.779668433759336e-05,
"loss": 0.1609,
"step": 900
},
{
"epoch": 8.0,
"eval_loss": 0.33602261543273926,
"eval_runtime": 22.8016,
"eval_samples_per_second": 4.386,
"eval_steps_per_second": 0.57,
"step": 904
},
{
"epoch": 8.053333333333333,
"grad_norm": 1.0708063840866089,
"learning_rate": 6.713068833079333e-05,
"loss": 0.146,
"step": 910
},
{
"epoch": 8.142222222222221,
"grad_norm": 0.9203677177429199,
"learning_rate": 6.646123067763417e-05,
"loss": 0.13,
"step": 920
},
{
"epoch": 8.231111111111112,
"grad_norm": 1.0815396308898926,
"learning_rate": 6.578844665730629e-05,
"loss": 0.1515,
"step": 930
},
{
"epoch": 8.32,
"grad_norm": 1.0179847478866577,
"learning_rate": 6.511247222116839e-05,
"loss": 0.1034,
"step": 940
},
{
"epoch": 8.408888888888889,
"grad_norm": 1.5660508871078491,
"learning_rate": 6.443344396527548e-05,
"loss": 0.1566,
"step": 950
},
{
"epoch": 8.497777777777777,
"grad_norm": 1.3174259662628174,
"learning_rate": 6.375149910277656e-05,
"loss": 0.1555,
"step": 960
},
{
"epoch": 8.586666666666666,
"grad_norm": 1.3149052858352661,
"learning_rate": 6.306677543618742e-05,
"loss": 0.1545,
"step": 970
},
{
"epoch": 8.675555555555556,
"grad_norm": 1.0674543380737305,
"learning_rate": 6.237941132954475e-05,
"loss": 0.1173,
"step": 980
},
{
"epoch": 8.764444444444445,
"grad_norm": 2.6074378490448,
"learning_rate": 6.168954568044626e-05,
"loss": 0.1439,
"step": 990
},
{
"epoch": 8.853333333333333,
"grad_norm": 1.1385785341262817,
"learning_rate": 6.099731789198344e-05,
"loss": 0.1057,
"step": 1000
},
{
"epoch": 8.942222222222222,
"grad_norm": 1.4166982173919678,
"learning_rate": 6.030286784457191e-05,
"loss": 0.1318,
"step": 1010
},
{
"epoch": 9.0,
"eval_loss": 0.3568514883518219,
"eval_runtime": 22.8151,
"eval_samples_per_second": 4.383,
"eval_steps_per_second": 0.57,
"step": 1017
},
{
"epoch": 9.026666666666667,
"grad_norm": 1.4854719638824463,
"learning_rate": 5.960633586768543e-05,
"loss": 0.1511,
"step": 1020
},
{
"epoch": 9.115555555555556,
"grad_norm": 1.2033461332321167,
"learning_rate": 5.890786271149904e-05,
"loss": 0.0962,
"step": 1030
},
{
"epoch": 9.204444444444444,
"grad_norm": 1.3722549676895142,
"learning_rate": 5.8207589518447405e-05,
"loss": 0.1056,
"step": 1040
},
{
"epoch": 9.293333333333333,
"grad_norm": 1.156151294708252,
"learning_rate": 5.750565779470368e-05,
"loss": 0.1185,
"step": 1050
},
{
"epoch": 9.382222222222222,
"grad_norm": 1.1652061939239502,
"learning_rate": 5.680220938158495e-05,
"loss": 0.1073,
"step": 1060
},
{
"epoch": 9.471111111111112,
"grad_norm": 1.1125752925872803,
"learning_rate": 5.609738642689001e-05,
"loss": 0.1081,
"step": 1070
},
{
"epoch": 9.56,
"grad_norm": 1.2892574071884155,
"learning_rate": 5.539133135617517e-05,
"loss": 0.1231,
"step": 1080
},
{
"epoch": 9.648888888888889,
"grad_norm": 1.379626989364624,
"learning_rate": 5.4684186843973826e-05,
"loss": 0.1066,
"step": 1090
},
{
"epoch": 9.737777777777778,
"grad_norm": 1.0732649564743042,
"learning_rate": 5.397609578496593e-05,
"loss": 0.1111,
"step": 1100
},
{
"epoch": 9.826666666666666,
"grad_norm": 1.5738511085510254,
"learning_rate": 5.326720126510275e-05,
"loss": 0.1213,
"step": 1110
},
{
"epoch": 9.915555555555555,
"grad_norm": 1.2037897109985352,
"learning_rate": 5.2557646532693226e-05,
"loss": 0.1145,
"step": 1120
},
{
"epoch": 10.0,
"grad_norm": 1.7668266296386719,
"learning_rate": 5.184757496945726e-05,
"loss": 0.142,
"step": 1130
},
{
"epoch": 10.0,
"eval_loss": 0.38781511783599854,
"eval_runtime": 22.819,
"eval_samples_per_second": 4.382,
"eval_steps_per_second": 0.57,
"step": 1130
},
{
"epoch": 10.088888888888889,
"grad_norm": 1.293931245803833,
"learning_rate": 5.1137130061552174e-05,
"loss": 0.0851,
"step": 1140
},
{
"epoch": 10.177777777777777,
"grad_norm": 1.5352977514266968,
"learning_rate": 5.042645537057819e-05,
"loss": 0.1186,
"step": 1150
},
{
"epoch": 10.266666666666667,
"grad_norm": 1.765360951423645,
"learning_rate": 4.971569450456836e-05,
"loss": 0.1055,
"step": 1160
},
{
"epoch": 10.355555555555556,
"grad_norm": 1.5278376340866089,
"learning_rate": 4.9004991088969384e-05,
"loss": 0.0788,
"step": 1170
},
{
"epoch": 10.444444444444445,
"grad_norm": 1.144656777381897,
"learning_rate": 4.829448873761885e-05,
"loss": 0.0976,
"step": 1180
},
{
"epoch": 10.533333333333333,
"grad_norm": 0.9775051474571228,
"learning_rate": 4.758433102372466e-05,
"loss": 0.0866,
"step": 1190
},
{
"epoch": 10.622222222222222,
"grad_norm": 1.5830668210983276,
"learning_rate": 4.687466145085286e-05,
"loss": 0.1037,
"step": 1200
},
{
"epoch": 10.71111111111111,
"grad_norm": 1.668695092201233,
"learning_rate": 4.616562342392955e-05,
"loss": 0.1323,
"step": 1210
},
{
"epoch": 10.8,
"grad_norm": 1.8038705587387085,
"learning_rate": 4.545736022026247e-05,
"loss": 0.1157,
"step": 1220
},
{
"epoch": 10.88888888888889,
"grad_norm": 1.432991862297058,
"learning_rate": 4.4750014960588666e-05,
"loss": 0.1234,
"step": 1230
},
{
"epoch": 10.977777777777778,
"grad_norm": 1.264278531074524,
"learning_rate": 4.404373058015371e-05,
"loss": 0.1105,
"step": 1240
},
{
"epoch": 11.0,
"eval_loss": 0.4054388403892517,
"eval_runtime": 22.808,
"eval_samples_per_second": 4.384,
"eval_steps_per_second": 0.57,
"step": 1243
},
{
"epoch": 11.062222222222223,
"grad_norm": 1.5953978300094604,
"learning_rate": 4.333864979982825e-05,
"loss": 0.1119,
"step": 1250
},
{
"epoch": 11.151111111111112,
"grad_norm": 1.5366672277450562,
"learning_rate": 4.2634915097268115e-05,
"loss": 0.0805,
"step": 1260
},
{
"epoch": 11.24,
"grad_norm": 1.175093173980713,
"learning_rate": 4.193266867812346e-05,
"loss": 0.1111,
"step": 1270
},
{
"epoch": 11.328888888888889,
"grad_norm": 1.193050503730774,
"learning_rate": 4.123205244730275e-05,
"loss": 0.0814,
"step": 1280
},
{
"epoch": 11.417777777777777,
"grad_norm": 1.9646860361099243,
"learning_rate": 4.0533207980297724e-05,
"loss": 0.0884,
"step": 1290
},
{
"epoch": 11.506666666666666,
"grad_norm": 1.2864062786102295,
"learning_rate": 3.9836276494574865e-05,
"loss": 0.0811,
"step": 1300
},
{
"epoch": 11.595555555555556,
"grad_norm": 1.9868394136428833,
"learning_rate": 3.914139882103911e-05,
"loss": 0.1031,
"step": 1310
},
{
"epoch": 11.684444444444445,
"grad_norm": 1.0178577899932861,
"learning_rate": 3.844871537557583e-05,
"loss": 0.0779,
"step": 1320
},
{
"epoch": 11.773333333333333,
"grad_norm": 1.2357277870178223,
"learning_rate": 3.7758366130676504e-05,
"loss": 0.0997,
"step": 1330
},
{
"epoch": 11.862222222222222,
"grad_norm": 1.4548487663269043,
"learning_rate": 3.7139162859371955e-05,
"loss": 0.0916,
"step": 1340
},
{
"epoch": 11.95111111111111,
"grad_norm": 1.3962253332138062,
"learning_rate": 3.645363250772425e-05,
"loss": 0.1056,
"step": 1350
},
{
"epoch": 12.0,
"eval_loss": 0.4192918539047241,
"eval_runtime": 22.8206,
"eval_samples_per_second": 4.382,
"eval_steps_per_second": 0.57,
"step": 1356
},
{
"epoch": 12.035555555555556,
"grad_norm": 1.0945167541503906,
"learning_rate": 3.5770839508645385e-05,
"loss": 0.0946,
"step": 1360
},
{
"epoch": 12.124444444444444,
"grad_norm": 1.3720024824142456,
"learning_rate": 3.509092183603659e-05,
"loss": 0.0843,
"step": 1370
},
{
"epoch": 12.213333333333333,
"grad_norm": 3.5357658863067627,
"learning_rate": 3.4414016882773757e-05,
"loss": 0.0951,
"step": 1380
},
{
"epoch": 12.302222222222222,
"grad_norm": 1.6700564622879028,
"learning_rate": 3.37402614329441e-05,
"loss": 0.0929,
"step": 1390
},
{
"epoch": 12.391111111111112,
"grad_norm": 1.6576741933822632,
"learning_rate": 3.306979163420582e-05,
"loss": 0.0678,
"step": 1400
},
{
"epoch": 12.48,
"grad_norm": 1.3355114459991455,
"learning_rate": 3.2402742970276426e-05,
"loss": 0.0785,
"step": 1410
},
{
"epoch": 12.568888888888889,
"grad_norm": 1.2856038808822632,
"learning_rate": 3.1739250233554996e-05,
"loss": 0.0729,
"step": 1420
},
{
"epoch": 12.657777777777778,
"grad_norm": 1.1800755262374878,
"learning_rate": 3.107944749788449e-05,
"loss": 0.0761,
"step": 1430
},
{
"epoch": 12.746666666666666,
"grad_norm": 0.9438807964324951,
"learning_rate": 3.0423468091458918e-05,
"loss": 0.0962,
"step": 1440
},
{
"epoch": 12.835555555555555,
"grad_norm": 1.2357594966888428,
"learning_rate": 2.9771444569881413e-05,
"loss": 0.0778,
"step": 1450
},
{
"epoch": 12.924444444444445,
"grad_norm": 1.2670978307724,
"learning_rate": 2.9123508689378352e-05,
"loss": 0.0712,
"step": 1460
},
{
"epoch": 13.0,
"eval_loss": 0.452305406332016,
"eval_runtime": 22.8071,
"eval_samples_per_second": 4.385,
"eval_steps_per_second": 0.57,
"step": 1469
},
{
"epoch": 13.008888888888889,
"grad_norm": 1.1917250156402588,
"learning_rate": 2.847979138017496e-05,
"loss": 0.078,
"step": 1470
},
{
"epoch": 13.097777777777777,
"grad_norm": 1.3447437286376953,
"learning_rate": 2.784042272003794e-05,
"loss": 0.0705,
"step": 1480
},
{
"epoch": 13.186666666666667,
"grad_norm": 1.989099144935608,
"learning_rate": 2.720553190799019e-05,
"loss": 0.066,
"step": 1490
},
{
"epoch": 13.275555555555556,
"grad_norm": 1.0475879907608032,
"learning_rate": 2.6575247238203328e-05,
"loss": 0.0636,
"step": 1500
},
{
"epoch": 13.364444444444445,
"grad_norm": 1.481781005859375,
"learning_rate": 2.5949696074072786e-05,
"loss": 0.0831,
"step": 1510
},
{
"epoch": 13.453333333333333,
"grad_norm": 0.9895071387290955,
"learning_rate": 2.532900482248124e-05,
"loss": 0.0745,
"step": 1520
},
{
"epoch": 13.542222222222222,
"grad_norm": 1.4489779472351074,
"learning_rate": 2.471329890825514e-05,
"loss": 0.0757,
"step": 1530
},
{
"epoch": 13.63111111111111,
"grad_norm": 1.0097142457962036,
"learning_rate": 2.410270274881981e-05,
"loss": 0.0698,
"step": 1540
},
{
"epoch": 13.72,
"grad_norm": 1.7415978908538818,
"learning_rate": 2.3497339729058083e-05,
"loss": 0.0889,
"step": 1550
},
{
"epoch": 13.80888888888889,
"grad_norm": 1.0850639343261719,
"learning_rate": 2.2897332176377528e-05,
"loss": 0.0725,
"step": 1560
},
{
"epoch": 13.897777777777778,
"grad_norm": 1.0806571245193481,
"learning_rate": 2.2302801335991413e-05,
"loss": 0.0894,
"step": 1570
},
{
"epoch": 13.986666666666666,
"grad_norm": 1.1130938529968262,
"learning_rate": 2.1713867346418354e-05,
"loss": 0.062,
"step": 1580
},
{
"epoch": 14.0,
"eval_loss": 0.4800405502319336,
"eval_runtime": 22.8054,
"eval_samples_per_second": 4.385,
"eval_steps_per_second": 0.57,
"step": 1582
},
{
"epoch": 14.071111111111112,
"grad_norm": 0.8069847226142883,
"learning_rate": 2.1130649215205584e-05,
"loss": 0.0638,
"step": 1590
},
{
"epoch": 14.16,
"grad_norm": 1.0252199172973633,
"learning_rate": 2.0553264794880756e-05,
"loss": 0.0546,
"step": 1600
},
{
"epoch": 14.248888888888889,
"grad_norm": 0.7054935693740845,
"learning_rate": 1.9981830759137186e-05,
"loss": 0.0547,
"step": 1610
},
{
"epoch": 14.337777777777777,
"grad_norm": 1.59795343875885,
"learning_rate": 1.9416462579257273e-05,
"loss": 0.0669,
"step": 1620
},
{
"epoch": 14.426666666666666,
"grad_norm": 0.9351125955581665,
"learning_rate": 1.885727450077879e-05,
"loss": 0.0755,
"step": 1630
},
{
"epoch": 14.515555555555556,
"grad_norm": 1.1384128332138062,
"learning_rate": 1.8304379520409087e-05,
"loss": 0.07,
"step": 1640
},
{
"epoch": 14.604444444444445,
"grad_norm": 0.9477954506874084,
"learning_rate": 1.7757889363191483e-05,
"loss": 0.0503,
"step": 1650
},
{
"epoch": 14.693333333333333,
"grad_norm": 1.6113272905349731,
"learning_rate": 1.7217914459928646e-05,
"loss": 0.0797,
"step": 1660
},
{
"epoch": 14.782222222222222,
"grad_norm": 2.085812568664551,
"learning_rate": 1.668456392486762e-05,
"loss": 0.065,
"step": 1670
},
{
"epoch": 14.87111111111111,
"grad_norm": 1.1539088487625122,
"learning_rate": 1.615794553365066e-05,
"loss": 0.0776,
"step": 1680
},
{
"epoch": 14.96,
"grad_norm": 1.685166597366333,
"learning_rate": 1.5638165701536868e-05,
"loss": 0.0742,
"step": 1690
},
{
"epoch": 15.0,
"eval_loss": 0.5068357586860657,
"eval_runtime": 22.7972,
"eval_samples_per_second": 4.386,
"eval_steps_per_second": 0.57,
"step": 1695
},
{
"epoch": 15.044444444444444,
"grad_norm": 1.00210440158844,
"learning_rate": 1.5125329461898408e-05,
"loss": 0.0496,
"step": 1700
},
{
"epoch": 15.133333333333333,
"grad_norm": 0.8724846839904785,
"learning_rate": 1.4619540444996227e-05,
"loss": 0.0577,
"step": 1710
},
{
"epoch": 15.222222222222221,
"grad_norm": 1.568989872932434,
"learning_rate": 1.4120900857039126e-05,
"loss": 0.0679,
"step": 1720
},
{
"epoch": 15.311111111111112,
"grad_norm": 1.4423738718032837,
"learning_rate": 1.3629511459530758e-05,
"loss": 0.056,
"step": 1730
},
{
"epoch": 15.4,
"grad_norm": 1.4789477586746216,
"learning_rate": 1.3145471548908345e-05,
"loss": 0.0661,
"step": 1740
},
{
"epoch": 15.488888888888889,
"grad_norm": 1.2932227849960327,
"learning_rate": 1.266887893647764e-05,
"loss": 0.0736,
"step": 1750
},
{
"epoch": 15.577777777777778,
"grad_norm": 1.0465151071548462,
"learning_rate": 1.2199829928647949e-05,
"loss": 0.0582,
"step": 1760
},
{
"epoch": 15.666666666666666,
"grad_norm": 1.129989504814148,
"learning_rate": 1.1738419307471138e-05,
"loss": 0.0612,
"step": 1770
},
{
"epoch": 15.755555555555556,
"grad_norm": 1.283918023109436,
"learning_rate": 1.1284740311488812e-05,
"loss": 0.0592,
"step": 1780
},
{
"epoch": 15.844444444444445,
"grad_norm": 0.6702640652656555,
"learning_rate": 1.083888461689137e-05,
"loss": 0.0609,
"step": 1790
},
{
"epoch": 15.933333333333334,
"grad_norm": 1.0527065992355347,
"learning_rate": 1.0400942318992668e-05,
"loss": 0.0624,
"step": 1800
},
{
"epoch": 16.0,
"eval_loss": 0.5388746857643127,
"eval_runtime": 22.7988,
"eval_samples_per_second": 4.386,
"eval_steps_per_second": 0.57,
"step": 1808
},
{
"epoch": 16.017777777777777,
"grad_norm": 0.8927621841430664,
"learning_rate": 9.971001914024247e-06,
"loss": 0.0542,
"step": 1810
},
{
"epoch": 16.106666666666666,
"grad_norm": 1.9986155033111572,
"learning_rate": 9.549150281252633e-06,
"loss": 0.0738,
"step": 1820
},
{
"epoch": 16.195555555555554,
"grad_norm": 0.7365565299987793,
"learning_rate": 9.135472665423433e-06,
"loss": 0.0536,
"step": 1830
},
{
"epoch": 16.284444444444443,
"grad_norm": 1.414197564125061,
"learning_rate": 8.730052659535675e-06,
"loss": 0.0561,
"step": 1840
},
{
"epoch": 16.373333333333335,
"grad_norm": 1.1275652647018433,
"learning_rate": 8.332972187949889e-06,
"loss": 0.053,
"step": 1850
},
{
"epoch": 16.462222222222223,
"grad_norm": 1.1671727895736694,
"learning_rate": 7.94431148983349e-06,
"loss": 0.0655,
"step": 1860
},
{
"epoch": 16.551111111111112,
"grad_norm": 0.7808873653411865,
"learning_rate": 7.564149102946572e-06,
"loss": 0.052,
"step": 1870
},
{
"epoch": 16.64,
"grad_norm": 1.3717401027679443,
"learning_rate": 7.192561847771589e-06,
"loss": 0.0626,
"step": 1880
},
{
"epoch": 16.72888888888889,
"grad_norm": 1.3122680187225342,
"learning_rate": 6.829624811990038e-06,
"loss": 0.0523,
"step": 1890
},
{
"epoch": 16.817777777777778,
"grad_norm": 0.9357064366340637,
"learning_rate": 6.475411335309245e-06,
"loss": 0.0512,
"step": 1900
},
{
"epoch": 16.906666666666666,
"grad_norm": 1.1543922424316406,
"learning_rate": 6.129992994642425e-06,
"loss": 0.0547,
"step": 1910
},
{
"epoch": 16.995555555555555,
"grad_norm": 1.072333574295044,
"learning_rate": 5.793439589644917e-06,
"loss": 0.0615,
"step": 1920
},
{
"epoch": 17.0,
"eval_loss": 0.5451540350914001,
"eval_runtime": 22.8109,
"eval_samples_per_second": 4.384,
"eval_steps_per_second": 0.57,
"step": 1921
},
{
"epoch": 17.08,
"grad_norm": 1.281044602394104,
"learning_rate": 5.4658191286095895e-06,
"loss": 0.0539,
"step": 1930
},
{
"epoch": 17.16888888888889,
"grad_norm": 0.7179533839225769,
"learning_rate": 5.1471978147241974e-06,
"loss": 0.0563,
"step": 1940
},
{
"epoch": 17.25777777777778,
"grad_norm": 0.7629289031028748,
"learning_rate": 4.837640032693558e-06,
"loss": 0.0577,
"step": 1950
},
{
"epoch": 17.346666666666668,
"grad_norm": 1.0043361186981201,
"learning_rate": 4.537208335729088e-06,
"loss": 0.0553,
"step": 1960
},
{
"epoch": 17.435555555555556,
"grad_norm": 1.1511973142623901,
"learning_rate": 4.245963432908556e-06,
"loss": 0.0529,
"step": 1970
},
{
"epoch": 17.524444444444445,
"grad_norm": 1.298182487487793,
"learning_rate": 3.963964176908391e-06,
"loss": 0.0477,
"step": 1980
},
{
"epoch": 17.613333333333333,
"grad_norm": 1.01607084274292,
"learning_rate": 3.691267552111183e-06,
"loss": 0.0569,
"step": 1990
},
{
"epoch": 17.702222222222222,
"grad_norm": 1.1849422454833984,
"learning_rate": 3.4279286630906572e-06,
"loss": 0.0476,
"step": 2000
},
{
"epoch": 17.79111111111111,
"grad_norm": 1.1263349056243896,
"learning_rate": 3.1740007234766002e-06,
"loss": 0.0534,
"step": 2010
},
{
"epoch": 17.88,
"grad_norm": 1.0211373567581177,
"learning_rate": 2.9295350452017535e-06,
"loss": 0.0503,
"step": 2020
},
{
"epoch": 17.968888888888888,
"grad_norm": 0.8752411603927612,
"learning_rate": 2.6945810281331085e-06,
"loss": 0.0546,
"step": 2030
},
{
"epoch": 18.0,
"eval_loss": 0.5564368963241577,
"eval_runtime": 22.789,
"eval_samples_per_second": 4.388,
"eval_steps_per_second": 0.57,
"step": 2034
},
{
"epoch": 18.053333333333335,
"grad_norm": 1.052837610244751,
"learning_rate": 2.4691861500895474e-06,
"loss": 0.0525,
"step": 2040
},
{
"epoch": 18.142222222222223,
"grad_norm": 0.5916168689727783,
"learning_rate": 2.2533959572478392e-06,
"loss": 0.0452,
"step": 2050
},
{
"epoch": 18.23111111111111,
"grad_norm": 0.8715868592262268,
"learning_rate": 2.0472540549390074e-06,
"loss": 0.0504,
"step": 2060
},
{
"epoch": 18.32,
"grad_norm": 1.3320412635803223,
"learning_rate": 1.85080209883689e-06,
"loss": 0.051,
"step": 2070
},
{
"epoch": 18.40888888888889,
"grad_norm": 1.0562243461608887,
"learning_rate": 1.6640797865406288e-06,
"loss": 0.0564,
"step": 2080
},
{
"epoch": 18.497777777777777,
"grad_norm": 0.8278095126152039,
"learning_rate": 1.4871248495529011e-06,
"loss": 0.0502,
"step": 2090
},
{
"epoch": 18.586666666666666,
"grad_norm": 1.0500751733779907,
"learning_rate": 1.3199730456553926e-06,
"loss": 0.0532,
"step": 2100
},
{
"epoch": 18.675555555555555,
"grad_norm": 1.490010380744934,
"learning_rate": 1.1626581516831048e-06,
"loss": 0.0647,
"step": 2110
},
{
"epoch": 18.764444444444443,
"grad_norm": 1.9580787420272827,
"learning_rate": 1.0152119566990025e-06,
"loss": 0.0583,
"step": 2120
},
{
"epoch": 18.85333333333333,
"grad_norm": 1.0863550901412964,
"learning_rate": 8.776642555702985e-07,
"loss": 0.0534,
"step": 2130
},
{
"epoch": 18.942222222222224,
"grad_norm": 1.1364506483078003,
"learning_rate": 7.50042842947718e-07,
"loss": 0.0495,
"step": 2140
},
{
"epoch": 19.0,
"eval_loss": 0.5644907355308533,
"eval_runtime": 22.8007,
"eval_samples_per_second": 4.386,
"eval_steps_per_second": 0.57,
"step": 2147
},
{
"epoch": 19.026666666666667,
"grad_norm": 0.4925549328327179,
"learning_rate": 6.323735076489535e-07,
"loss": 0.0476,
"step": 2150
},
{
"epoch": 19.115555555555556,
"grad_norm": 1.1283750534057617,
"learning_rate": 5.246800274474439e-07,
"loss": 0.0498,
"step": 2160
},
{
"epoch": 19.204444444444444,
"grad_norm": 1.1284992694854736,
"learning_rate": 4.269841642675576e-07,
"loss": 0.0521,
"step": 2170
},
{
"epoch": 19.293333333333333,
"grad_norm": 1.0008766651153564,
"learning_rate": 3.393056597870703e-07,
"loss": 0.0505,
"step": 2180
},
{
"epoch": 19.38222222222222,
"grad_norm": 0.728695809841156,
"learning_rate": 2.616622314479067e-07,
"loss": 0.0441,
"step": 2190
},
{
"epoch": 19.47111111111111,
"grad_norm": 0.9185757637023926,
"learning_rate": 1.9406956887595418e-07,
"loss": 0.0491,
"step": 2200
},
{
"epoch": 19.56,
"grad_norm": 0.7735620141029358,
"learning_rate": 1.3654133071059893e-07,
"loss": 0.0597,
"step": 2210
},
{
"epoch": 19.648888888888887,
"grad_norm": 0.6428269743919373,
"learning_rate": 8.90891418446782e-08,
"loss": 0.0681,
"step": 2220
},
{
"epoch": 19.73777777777778,
"grad_norm": 1.19765305519104,
"learning_rate": 5.1722591075425986e-08,
"loss": 0.0487,
"step": 2230
},
{
"epoch": 19.826666666666668,
"grad_norm": 1.2431554794311523,
"learning_rate": 2.4449229166823016e-08,
"loss": 0.0523,
"step": 2240
},
{
"epoch": 19.915555555555557,
"grad_norm": 0.572210967540741,
"learning_rate": 7.2745673238006076e-09,
"loss": 0.0537,
"step": 2250
},
{
"epoch": 20.0,
"grad_norm": 1.5146510601043701,
"learning_rate": 2.020760785648168e-10,
"loss": 0.0445,
"step": 2260
},
{
"epoch": 20.0,
"eval_loss": 0.5654152035713196,
"eval_runtime": 22.8163,
"eval_samples_per_second": 4.383,
"eval_steps_per_second": 0.57,
"step": 2260
}
],
"logging_steps": 10,
"max_steps": 2260,
"num_input_tokens_seen": 0,
"num_train_epochs": 20,
"save_steps": 500,
"stateful_callbacks": {
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": true,
"should_training_stop": true
},
"attributes": {}
}
},
"total_flos": 1.67518433968128e+18,
"train_batch_size": 1,
"trial_name": null,
"trial_params": null
}