CodeIsAbstract's picture
Training in progress, step 2100, checkpoint
56366b2 verified
Raw
History Blame Contribute Delete
43.1 kB
{
"best_global_step": null,
"best_metric": null,
"best_model_checkpoint": null,
"epoch": 1.0,
"eval_steps": 150,
"global_step": 2100,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"epoch": 0.004761904761904762,
"grad_norm": 138.4115447998047,
"learning_rate": 3.4285714285714286e-07,
"loss": 40.940005493164065,
"step": 10
},
{
"epoch": 0.009523809523809525,
"grad_norm": 137.81439208984375,
"learning_rate": 7.238095238095238e-07,
"loss": 60.1491455078125,
"step": 20
},
{
"epoch": 0.014285714285714285,
"grad_norm": 66.88855743408203,
"learning_rate": 1.1047619047619047e-06,
"loss": 41.3765869140625,
"step": 30
},
{
"epoch": 0.01904761904761905,
"grad_norm": 61.619834899902344,
"learning_rate": 1.4857142857142858e-06,
"loss": 37.01522216796875,
"step": 40
},
{
"epoch": 0.023809523809523808,
"grad_norm": 103.27572631835938,
"learning_rate": 1.8666666666666667e-06,
"loss": 33.547723388671876,
"step": 50
},
{
"epoch": 0.02857142857142857,
"grad_norm": 70.52592468261719,
"learning_rate": 2.2476190476190477e-06,
"loss": 33.890313720703126,
"step": 60
},
{
"epoch": 0.03333333333333333,
"grad_norm": 32.40092086791992,
"learning_rate": 2.6285714285714286e-06,
"loss": 32.475531005859374,
"step": 70
},
{
"epoch": 0.0380952380952381,
"grad_norm": 48.953285217285156,
"learning_rate": 3.0095238095238094e-06,
"loss": 31.98614501953125,
"step": 80
},
{
"epoch": 0.04285714285714286,
"grad_norm": 79.75335693359375,
"learning_rate": 3.3904761904761903e-06,
"loss": 30.443341064453126,
"step": 90
},
{
"epoch": 0.047619047619047616,
"grad_norm": 58.47705841064453,
"learning_rate": 3.771428571428571e-06,
"loss": 32.29954833984375,
"step": 100
},
{
"epoch": 0.05238095238095238,
"grad_norm": 33.17606735229492,
"learning_rate": 3.999960323578798e-06,
"loss": 32.247186279296876,
"step": 110
},
{
"epoch": 0.05714285714285714,
"grad_norm": 40.67790985107422,
"learning_rate": 3.999513981918989e-06,
"loss": 32.20079040527344,
"step": 120
},
{
"epoch": 0.06190476190476191,
"grad_norm": 45.4234619140625,
"learning_rate": 3.998571814122654e-06,
"loss": 30.031964111328126,
"step": 130
},
{
"epoch": 0.06666666666666667,
"grad_norm": 60.951908111572266,
"learning_rate": 3.997134053822277e-06,
"loss": 29.55460205078125,
"step": 140
},
{
"epoch": 0.07142857142857142,
"grad_norm": 63.76414489746094,
"learning_rate": 3.995201057544064e-06,
"loss": 28.688177490234374,
"step": 150
},
{
"epoch": 0.07142857142857142,
"eval_accuracy": 0.043283464566929136,
"eval_loss": 27.93197250366211,
"eval_runtime": 24.8513,
"eval_samples_per_second": 20.12,
"eval_steps_per_second": 2.535,
"step": 150
},
{
"epoch": 0.0761904761904762,
"grad_norm": 55.72420120239258,
"learning_rate": 3.992773304619536e-06,
"loss": 27.05469970703125,
"step": 160
},
{
"epoch": 0.08095238095238096,
"grad_norm": 41.70425796508789,
"learning_rate": 3.989851397066665e-06,
"loss": 26.17386474609375,
"step": 170
},
{
"epoch": 0.08571428571428572,
"grad_norm": 41.78767776489258,
"learning_rate": 3.98643605944059e-06,
"loss": 26.51021728515625,
"step": 180
},
{
"epoch": 0.09047619047619047,
"grad_norm": 50.67561721801758,
"learning_rate": 3.98252813865395e-06,
"loss": 26.913729858398437,
"step": 190
},
{
"epoch": 0.09523809523809523,
"grad_norm": 57.547393798828125,
"learning_rate": 3.978128603766867e-06,
"loss": 25.517425537109375,
"step": 200
},
{
"epoch": 0.1,
"grad_norm": 26.557636260986328,
"learning_rate": 3.97323854574665e-06,
"loss": 24.818318176269532,
"step": 210
},
{
"epoch": 0.10476190476190476,
"grad_norm": 45.89893341064453,
"learning_rate": 3.967859177197259e-06,
"loss": 24.499539184570313,
"step": 220
},
{
"epoch": 0.10952380952380952,
"grad_norm": 76.51309967041016,
"learning_rate": 3.961991832058617e-06,
"loss": 23.831640625,
"step": 230
},
{
"epoch": 0.11428571428571428,
"grad_norm": 36.89082336425781,
"learning_rate": 3.955637965275824e-06,
"loss": 23.571630859375,
"step": 240
},
{
"epoch": 0.11904761904761904,
"grad_norm": 19.28327751159668,
"learning_rate": 3.948799152438371e-06,
"loss": 22.825534057617187,
"step": 250
},
{
"epoch": 0.12380952380952381,
"grad_norm": 30.663532257080078,
"learning_rate": 3.941477089389439e-06,
"loss": 22.282626342773437,
"step": 260
},
{
"epoch": 0.12857142857142856,
"grad_norm": 60.91099548339844,
"learning_rate": 3.9336735918053705e-06,
"loss": 22.1782470703125,
"step": 270
},
{
"epoch": 0.13333333333333333,
"grad_norm": 68.26007843017578,
"learning_rate": 3.92539059474543e-06,
"loss": 22.209671020507812,
"step": 280
},
{
"epoch": 0.1380952380952381,
"grad_norm": 24.719745635986328,
"learning_rate": 3.916630152171965e-06,
"loss": 21.11513671875,
"step": 290
},
{
"epoch": 0.14285714285714285,
"grad_norm": 45.6879768371582,
"learning_rate": 3.907394436441075e-06,
"loss": 21.380886840820313,
"step": 300
},
{
"epoch": 0.14285714285714285,
"eval_accuracy": 0.04578740157480315,
"eval_loss": 21.396591186523438,
"eval_runtime": 25.9922,
"eval_samples_per_second": 19.237,
"eval_steps_per_second": 2.424,
"step": 300
},
{
"epoch": 0.14761904761904762,
"grad_norm": 59.79628372192383,
"learning_rate": 3.897685737763927e-06,
"loss": 21.495401000976564,
"step": 310
},
{
"epoch": 0.1523809523809524,
"grad_norm": 52.11283874511719,
"learning_rate": 3.887506463638843e-06,
"loss": 21.374043273925782,
"step": 320
},
{
"epoch": 0.15714285714285714,
"grad_norm": 17.035280227661133,
"learning_rate": 3.876859138254304e-06,
"loss": 20.709390258789064,
"step": 330
},
{
"epoch": 0.1619047619047619,
"grad_norm": 47.00483322143555,
"learning_rate": 3.865746401863021e-06,
"loss": 20.654705810546876,
"step": 340
},
{
"epoch": 0.16666666666666666,
"grad_norm": 47.759559631347656,
"learning_rate": 3.854171010127219e-06,
"loss": 20.17596435546875,
"step": 350
},
{
"epoch": 0.17142857142857143,
"grad_norm": 47.72419738769531,
"learning_rate": 3.842135833435311e-06,
"loss": 20.0145751953125,
"step": 360
},
{
"epoch": 0.1761904761904762,
"grad_norm": 51.43965148925781,
"learning_rate": 3.829643856190115e-06,
"loss": 20.162620544433594,
"step": 370
},
{
"epoch": 0.18095238095238095,
"grad_norm": 77.80012512207031,
"learning_rate": 3.8166981760688015e-06,
"loss": 19.78917694091797,
"step": 380
},
{
"epoch": 0.18571428571428572,
"grad_norm": 51.120635986328125,
"learning_rate": 3.8033020032547535e-06,
"loss": 19.7965087890625,
"step": 390
},
{
"epoch": 0.19047619047619047,
"grad_norm": 35.47827911376953,
"learning_rate": 3.7894586596415266e-06,
"loss": 19.693804931640624,
"step": 400
},
{
"epoch": 0.19523809523809524,
"grad_norm": 36.45315933227539,
"learning_rate": 3.775171578009108e-06,
"loss": 19.68980255126953,
"step": 410
},
{
"epoch": 0.2,
"grad_norm": 19.75481605529785,
"learning_rate": 3.7604443011726775e-06,
"loss": 19.586700439453125,
"step": 420
},
{
"epoch": 0.20476190476190476,
"grad_norm": 61.62051773071289,
"learning_rate": 3.7452804811040844e-06,
"loss": 19.429611206054688,
"step": 430
},
{
"epoch": 0.20952380952380953,
"grad_norm": 20.707780838012695,
"learning_rate": 3.7296838780262574e-06,
"loss": 19.41503143310547,
"step": 440
},
{
"epoch": 0.21428571428571427,
"grad_norm": 61.07346725463867,
"learning_rate": 3.713658359480768e-06,
"loss": 19.5462646484375,
"step": 450
},
{
"epoch": 0.21428571428571427,
"eval_accuracy": 0.048236220472440944,
"eval_loss": 18.801279067993164,
"eval_runtime": 25.633,
"eval_samples_per_second": 19.506,
"eval_steps_per_second": 2.458,
"step": 450
},
{
"epoch": 0.21904761904761905,
"grad_norm": 20.04033088684082,
"learning_rate": 3.6972078993687815e-06,
"loss": 18.968704223632812,
"step": 460
},
{
"epoch": 0.22380952380952382,
"grad_norm": 65.65965270996094,
"learning_rate": 3.680336576965642e-06,
"loss": 18.938497924804686,
"step": 470
},
{
"epoch": 0.22857142857142856,
"grad_norm": 48.90804672241211,
"learning_rate": 3.663048575909311e-06,
"loss": 18.844175720214842,
"step": 480
},
{
"epoch": 0.23333333333333334,
"grad_norm": 17.749887466430664,
"learning_rate": 3.645348183162947e-06,
"loss": 18.766136169433594,
"step": 490
},
{
"epoch": 0.23809523809523808,
"grad_norm": 43.13874435424805,
"learning_rate": 3.627239787951847e-06,
"loss": 18.34910888671875,
"step": 500
},
{
"epoch": 0.24285714285714285,
"grad_norm": 29.883098602294922,
"learning_rate": 3.608727880675036e-06,
"loss": 18.39371337890625,
"step": 510
},
{
"epoch": 0.24761904761904763,
"grad_norm": 23.2874698638916,
"learning_rate": 3.58981705179177e-06,
"loss": 18.52344207763672,
"step": 520
},
{
"epoch": 0.2523809523809524,
"grad_norm": 28.679786682128906,
"learning_rate": 3.570511990683222e-06,
"loss": 18.389620971679687,
"step": 530
},
{
"epoch": 0.2571428571428571,
"grad_norm": 39.36701965332031,
"learning_rate": 3.550817484489643e-06,
"loss": 18.337835693359374,
"step": 540
},
{
"epoch": 0.2619047619047619,
"grad_norm": 14.972796440124512,
"learning_rate": 3.5307384169232777e-06,
"loss": 18.569638061523438,
"step": 550
},
{
"epoch": 0.26666666666666666,
"grad_norm": 20.092327117919922,
"learning_rate": 3.5102797670573345e-06,
"loss": 18.32196044921875,
"step": 560
},
{
"epoch": 0.2714285714285714,
"grad_norm": 42.83948516845703,
"learning_rate": 3.4894466080913077e-06,
"loss": 18.12080078125,
"step": 570
},
{
"epoch": 0.2761904761904762,
"grad_norm": 150.76181030273438,
"learning_rate": 3.4682441060929587e-06,
"loss": 18.27479248046875,
"step": 580
},
{
"epoch": 0.28095238095238095,
"grad_norm": 24.40485382080078,
"learning_rate": 3.446677518717271e-06,
"loss": 18.172178649902342,
"step": 590
},
{
"epoch": 0.2857142857142857,
"grad_norm": 21.843042373657227,
"learning_rate": 3.4247521939026897e-06,
"loss": 17.919189453125,
"step": 600
},
{
"epoch": 0.2857142857142857,
"eval_accuracy": 0.05248031496062992,
"eval_loss": 17.725130081176758,
"eval_runtime": 25.3949,
"eval_samples_per_second": 19.689,
"eval_steps_per_second": 2.481,
"step": 600
},
{
"epoch": 0.2904761904761905,
"grad_norm": 20.064794540405273,
"learning_rate": 3.4024735685449766e-06,
"loss": 17.788371276855468,
"step": 610
},
{
"epoch": 0.29523809523809524,
"grad_norm": 19.219192504882812,
"learning_rate": 3.379847167149008e-06,
"loss": 17.86636962890625,
"step": 620
},
{
"epoch": 0.3,
"grad_norm": 23.365055084228516,
"learning_rate": 3.3568786004588363e-06,
"loss": 17.805162048339845,
"step": 630
},
{
"epoch": 0.3047619047619048,
"grad_norm": 16.860742568969727,
"learning_rate": 3.333573564066385e-06,
"loss": 17.576748657226563,
"step": 640
},
{
"epoch": 0.30952380952380953,
"grad_norm": 23.96249008178711,
"learning_rate": 3.3099378369990875e-06,
"loss": 17.694325256347657,
"step": 650
},
{
"epoch": 0.3142857142857143,
"grad_norm": 16.125730514526367,
"learning_rate": 3.285977280286845e-06,
"loss": 17.539736938476562,
"step": 660
},
{
"epoch": 0.319047619047619,
"grad_norm": 16.924381256103516,
"learning_rate": 3.261697835508648e-06,
"loss": 17.864358520507814,
"step": 670
},
{
"epoch": 0.3238095238095238,
"grad_norm": 24.52809715270996,
"learning_rate": 3.2371055233192185e-06,
"loss": 17.447659301757813,
"step": 680
},
{
"epoch": 0.32857142857142857,
"grad_norm": 24.08842658996582,
"learning_rate": 3.2122064419560557e-06,
"loss": 17.473863220214845,
"step": 690
},
{
"epoch": 0.3333333333333333,
"grad_norm": 26.00309944152832,
"learning_rate": 3.1870067657272295e-06,
"loss": 17.199142456054688,
"step": 700
},
{
"epoch": 0.3380952380952381,
"grad_norm": 29.389789581298828,
"learning_rate": 3.1615127434803192e-06,
"loss": 17.315379333496093,
"step": 710
},
{
"epoch": 0.34285714285714286,
"grad_norm": 30.414424896240234,
"learning_rate": 3.1357306970528665e-06,
"loss": 17.431112670898436,
"step": 720
},
{
"epoch": 0.3476190476190476,
"grad_norm": 32.14336395263672,
"learning_rate": 3.1096670197047267e-06,
"loss": 17.360943603515626,
"step": 730
},
{
"epoch": 0.3523809523809524,
"grad_norm": 14.162923812866211,
"learning_rate": 3.0833281745327123e-06,
"loss": 17.168132019042968,
"step": 740
},
{
"epoch": 0.35714285714285715,
"grad_norm": 21.957395553588867,
"learning_rate": 3.056720692867918e-06,
"loss": 17.510189819335938,
"step": 750
},
{
"epoch": 0.35714285714285715,
"eval_accuracy": 0.057960629921259846,
"eval_loss": 17.25590705871582,
"eval_runtime": 25.9338,
"eval_samples_per_second": 19.28,
"eval_steps_per_second": 2.429,
"step": 750
},
{
"epoch": 0.3619047619047619,
"grad_norm": 22.730085372924805,
"learning_rate": 3.029851172656121e-06,
"loss": 17.168865966796876,
"step": 760
},
{
"epoch": 0.36666666666666664,
"grad_norm": 9.091358184814453,
"learning_rate": 3.0027262768216716e-06,
"loss": 17.32322540283203,
"step": 770
},
{
"epoch": 0.37142857142857144,
"grad_norm": 46.21049118041992,
"learning_rate": 2.9753527316152624e-06,
"loss": 17.2936767578125,
"step": 780
},
{
"epoch": 0.3761904761904762,
"grad_norm": 12.04414176940918,
"learning_rate": 2.9477373249459973e-06,
"loss": 17.235751342773437,
"step": 790
},
{
"epoch": 0.38095238095238093,
"grad_norm": 43.7669563293457,
"learning_rate": 2.919886904698173e-06,
"loss": 17.19912109375,
"step": 800
},
{
"epoch": 0.38571428571428573,
"grad_norm": 15.64034652709961,
"learning_rate": 2.8918083770331857e-06,
"loss": 17.119082641601562,
"step": 810
},
{
"epoch": 0.3904761904761905,
"grad_norm": 15.29228401184082,
"learning_rate": 2.8635087046769856e-06,
"loss": 17.21935119628906,
"step": 820
},
{
"epoch": 0.3952380952380952,
"grad_norm": 40.923484802246094,
"learning_rate": 2.83499490519351e-06,
"loss": 17.068731689453124,
"step": 830
},
{
"epoch": 0.4,
"grad_norm": 18.847187042236328,
"learning_rate": 2.8062740492445104e-06,
"loss": 17.178439331054687,
"step": 840
},
{
"epoch": 0.40476190476190477,
"grad_norm": 10.75904369354248,
"learning_rate": 2.7773532588362205e-06,
"loss": 17.27076873779297,
"step": 850
},
{
"epoch": 0.4095238095238095,
"grad_norm": 22.709970474243164,
"learning_rate": 2.748239705553287e-06,
"loss": 17.397381591796876,
"step": 860
},
{
"epoch": 0.4142857142857143,
"grad_norm": 22.443639755249023,
"learning_rate": 2.718940608780408e-06,
"loss": 17.009933471679688,
"step": 870
},
{
"epoch": 0.41904761904761906,
"grad_norm": 9.636713027954102,
"learning_rate": 2.6894632339121183e-06,
"loss": 17.1143310546875,
"step": 880
},
{
"epoch": 0.4238095238095238,
"grad_norm": 11.698447227478027,
"learning_rate": 2.6598148905511656e-06,
"loss": 17.266459655761718,
"step": 890
},
{
"epoch": 0.42857142857142855,
"grad_norm": 34.808990478515625,
"learning_rate": 2.6300029306959236e-06,
"loss": 17.431172180175782,
"step": 900
},
{
"epoch": 0.42857142857142855,
"eval_accuracy": 0.059070866141732285,
"eval_loss": 16.987903594970703,
"eval_runtime": 25.5466,
"eval_samples_per_second": 19.572,
"eval_steps_per_second": 2.466,
"step": 900
},
{
"epoch": 0.43333333333333335,
"grad_norm": 9.677335739135742,
"learning_rate": 2.600034746917292e-06,
"loss": 17.079855346679686,
"step": 910
},
{
"epoch": 0.4380952380952381,
"grad_norm": 24.325902938842773,
"learning_rate": 2.569917770525538e-06,
"loss": 16.793905639648436,
"step": 920
},
{
"epoch": 0.44285714285714284,
"grad_norm": 32.768287658691406,
"learning_rate": 2.539659469727526e-06,
"loss": 17.420681762695313,
"step": 930
},
{
"epoch": 0.44761904761904764,
"grad_norm": 11.458124160766602,
"learning_rate": 2.509267347774807e-06,
"loss": 17.01726837158203,
"step": 940
},
{
"epoch": 0.4523809523809524,
"grad_norm": 47.37931442260742,
"learning_rate": 2.478748941103006e-06,
"loss": 16.992041015625,
"step": 950
},
{
"epoch": 0.45714285714285713,
"grad_norm": 16.12019157409668,
"learning_rate": 2.448111817462992e-06,
"loss": 17.042259216308594,
"step": 960
},
{
"epoch": 0.46190476190476193,
"grad_norm": 55.0360107421875,
"learning_rate": 2.417363574044275e-06,
"loss": 16.924298095703126,
"step": 970
},
{
"epoch": 0.4666666666666667,
"grad_norm": 8.713092803955078,
"learning_rate": 2.3865118355911064e-06,
"loss": 16.67218780517578,
"step": 980
},
{
"epoch": 0.4714285714285714,
"grad_norm": 30.71510887145996,
"learning_rate": 2.355564252511746e-06,
"loss": 16.627642822265624,
"step": 990
},
{
"epoch": 0.47619047619047616,
"grad_norm": 11.165261268615723,
"learning_rate": 2.3245284989813637e-06,
"loss": 16.885775756835937,
"step": 1000
},
{
"epoch": 0.48095238095238096,
"grad_norm": 33.494205474853516,
"learning_rate": 2.293412271039051e-06,
"loss": 16.8844970703125,
"step": 1010
},
{
"epoch": 0.4857142857142857,
"grad_norm": 16.44525909423828,
"learning_rate": 2.262223284679405e-06,
"loss": 16.938031005859376,
"step": 1020
},
{
"epoch": 0.49047619047619045,
"grad_norm": 56.29051208496094,
"learning_rate": 2.2309692739391725e-06,
"loss": 17.36894836425781,
"step": 1030
},
{
"epoch": 0.49523809523809526,
"grad_norm": 18.217512130737305,
"learning_rate": 2.1996579889794097e-06,
"loss": 16.765081787109374,
"step": 1040
},
{
"epoch": 0.5,
"grad_norm": 12.565701484680176,
"learning_rate": 2.1682971941636525e-06,
"loss": 17.061727905273436,
"step": 1050
},
{
"epoch": 0.5,
"eval_accuracy": 0.06236220472440945,
"eval_loss": 16.80004119873047,
"eval_runtime": 25.3543,
"eval_samples_per_second": 19.721,
"eval_steps_per_second": 2.485,
"step": 1050
},
{
"epoch": 0.5047619047619047,
"grad_norm": 7.379430770874023,
"learning_rate": 2.1368946661325625e-06,
"loss": 17.065571594238282,
"step": 1060
},
{
"epoch": 0.5095238095238095,
"grad_norm": 33.2353515625,
"learning_rate": 2.1054581918755225e-06,
"loss": 16.781719970703126,
"step": 1070
},
{
"epoch": 0.5142857142857142,
"grad_norm": 5.199227809906006,
"learning_rate": 2.073995566799676e-06,
"loss": 16.9568115234375,
"step": 1080
},
{
"epoch": 0.5190476190476191,
"grad_norm": 21.680280685424805,
"learning_rate": 2.042514592796871e-06,
"loss": 16.72358856201172,
"step": 1090
},
{
"epoch": 0.5238095238095238,
"grad_norm": 19.837730407714844,
"learning_rate": 2.011023076309001e-06,
"loss": 16.884307861328125,
"step": 1100
},
{
"epoch": 0.5285714285714286,
"grad_norm": 12.718480110168457,
"learning_rate": 1.979528826392213e-06,
"loss": 16.639022827148438,
"step": 1110
},
{
"epoch": 0.5333333333333333,
"grad_norm": 16.71331787109375,
"learning_rate": 1.9480396527804736e-06,
"loss": 16.607608032226562,
"step": 1120
},
{
"epoch": 0.5380952380952381,
"grad_norm": 21.276140213012695,
"learning_rate": 1.916563363948959e-06,
"loss": 17.104000854492188,
"step": 1130
},
{
"epoch": 0.5428571428571428,
"grad_norm": 22.885112762451172,
"learning_rate": 1.8851077651777652e-06,
"loss": 16.868312072753906,
"step": 1140
},
{
"epoch": 0.5476190476190477,
"grad_norm": 38.87709426879883,
"learning_rate": 1.8536806566164048e-06,
"loss": 16.6172607421875,
"step": 1150
},
{
"epoch": 0.5523809523809524,
"grad_norm": 20.984086990356445,
"learning_rate": 1.8222898313495766e-06,
"loss": 16.41285400390625,
"step": 1160
},
{
"epoch": 0.5571428571428572,
"grad_norm": 18.480567932128906,
"learning_rate": 1.7909430734646932e-06,
"loss": 16.545147705078126,
"step": 1170
},
{
"epoch": 0.5619047619047619,
"grad_norm": 10.486381530761719,
"learning_rate": 1.7596481561216285e-06,
"loss": 16.698062133789062,
"step": 1180
},
{
"epoch": 0.5666666666666667,
"grad_norm": 28.246742248535156,
"learning_rate": 1.7284128396251875e-06,
"loss": 16.808547973632812,
"step": 1190
},
{
"epoch": 0.5714285714285714,
"grad_norm": 14.525625228881836,
"learning_rate": 1.6972448695007526e-06,
"loss": 16.164341735839844,
"step": 1200
},
{
"epoch": 0.5714285714285714,
"eval_accuracy": 0.05882677165354331,
"eval_loss": 16.66090965270996,
"eval_runtime": 25.3757,
"eval_samples_per_second": 19.704,
"eval_steps_per_second": 2.483,
"step": 1200
},
{
"epoch": 0.5761904761904761,
"grad_norm": 16.894689559936523,
"learning_rate": 1.6661519745736042e-06,
"loss": 16.504466247558593,
"step": 1210
},
{
"epoch": 0.580952380952381,
"grad_norm": 8.992559432983398,
"learning_rate": 1.6351418650523748e-06,
"loss": 17.111102294921874,
"step": 1220
},
{
"epoch": 0.5857142857142857,
"grad_norm": 10.779234886169434,
"learning_rate": 1.6042222306171245e-06,
"loss": 16.793231201171874,
"step": 1230
},
{
"epoch": 0.5904761904761905,
"grad_norm": 13.19653606414795,
"learning_rate": 1.5734007385125066e-06,
"loss": 16.616178894042967,
"step": 1240
},
{
"epoch": 0.5952380952380952,
"grad_norm": 10.069211959838867,
"learning_rate": 1.5426850316464914e-06,
"loss": 16.469076538085936,
"step": 1250
},
{
"epoch": 0.6,
"grad_norm": 11.769493103027344,
"learning_rate": 1.5120827266951346e-06,
"loss": 16.354193115234374,
"step": 1260
},
{
"epoch": 0.6047619047619047,
"grad_norm": 18.091075897216797,
"learning_rate": 1.4816014122138387e-06,
"loss": 16.668800354003906,
"step": 1270
},
{
"epoch": 0.6095238095238096,
"grad_norm": 40.2747802734375,
"learning_rate": 1.4512486467555996e-06,
"loss": 16.58080596923828,
"step": 1280
},
{
"epoch": 0.6142857142857143,
"grad_norm": 38.875709533691406,
"learning_rate": 1.4210319569966813e-06,
"loss": 16.504058837890625,
"step": 1290
},
{
"epoch": 0.6190476190476191,
"grad_norm": 20.455795288085938,
"learning_rate": 1.3909588358702065e-06,
"loss": 16.619796752929688,
"step": 1300
},
{
"epoch": 0.6238095238095238,
"grad_norm": 26.14783477783203,
"learning_rate": 1.3610367407081037e-06,
"loss": 16.69707336425781,
"step": 1310
},
{
"epoch": 0.6285714285714286,
"grad_norm": 12.17022705078125,
"learning_rate": 1.3312730913918927e-06,
"loss": 16.7201904296875,
"step": 1320
},
{
"epoch": 0.6333333333333333,
"grad_norm": 13.315362930297852,
"learning_rate": 1.3016752685127483e-06,
"loss": 16.331112670898438,
"step": 1330
},
{
"epoch": 0.638095238095238,
"grad_norm": 6.595879077911377,
"learning_rate": 1.2722506115413118e-06,
"loss": 16.394076538085937,
"step": 1340
},
{
"epoch": 0.6428571428571429,
"grad_norm": 7.89982271194458,
"learning_rate": 1.243006417007699e-06,
"loss": 16.70445098876953,
"step": 1350
},
{
"epoch": 0.6428571428571429,
"eval_accuracy": 0.06341732283464567,
"eval_loss": 16.499183654785156,
"eval_runtime": 25.1886,
"eval_samples_per_second": 19.85,
"eval_steps_per_second": 2.501,
"step": 1350
},
{
"epoch": 0.6476190476190476,
"grad_norm": 9.356073379516602,
"learning_rate": 1.2139499366921528e-06,
"loss": 16.716755676269532,
"step": 1360
},
{
"epoch": 0.6523809523809524,
"grad_norm": 13.010209083557129,
"learning_rate": 1.185088375826799e-06,
"loss": 17.275030517578124,
"step": 1370
},
{
"epoch": 0.6571428571428571,
"grad_norm": 7.622005462646484,
"learning_rate": 1.156428891308936e-06,
"loss": 16.587196350097656,
"step": 1380
},
{
"epoch": 0.6619047619047619,
"grad_norm": 11.086586952209473,
"learning_rate": 1.1279785899263192e-06,
"loss": 16.67912902832031,
"step": 1390
},
{
"epoch": 0.6666666666666666,
"grad_norm": 22.962263107299805,
"learning_rate": 1.099744526594867e-06,
"loss": 16.530209350585938,
"step": 1400
},
{
"epoch": 0.6714285714285714,
"grad_norm": 7.309661388397217,
"learning_rate": 1.0717337026092269e-06,
"loss": 16.585041809082032,
"step": 1410
},
{
"epoch": 0.6761904761904762,
"grad_norm": 7.678780555725098,
"learning_rate": 1.0439530639066418e-06,
"loss": 16.243795776367186,
"step": 1420
},
{
"epoch": 0.680952380952381,
"grad_norm": 38.843414306640625,
"learning_rate": 1.0164094993445473e-06,
"loss": 16.31683349609375,
"step": 1430
},
{
"epoch": 0.6857142857142857,
"grad_norm": 8.149712562561035,
"learning_rate": 9.891098389923132e-07,
"loss": 16.380844116210938,
"step": 1440
},
{
"epoch": 0.6904761904761905,
"grad_norm": 23.914464950561523,
"learning_rate": 9.620608524375702e-07,
"loss": 16.283917236328126,
"step": 1450
},
{
"epoch": 0.6952380952380952,
"grad_norm": 17.59719467163086,
"learning_rate": 9.352692471075336e-07,
"loss": 16.381610107421874,
"step": 1460
},
{
"epoch": 0.7,
"grad_norm": 56.93424606323242,
"learning_rate": 9.087416666057417e-07,
"loss": 17.249729919433594,
"step": 1470
},
{
"epoch": 0.7047619047619048,
"grad_norm": 9.12337589263916,
"learning_rate": 8.824846890646149e-07,
"loss": 16.201866149902344,
"step": 1480
},
{
"epoch": 0.7095238095238096,
"grad_norm": 10.127345085144043,
"learning_rate": 8.565048255142577e-07,
"loss": 16.494973754882814,
"step": 1490
},
{
"epoch": 0.7142857142857143,
"grad_norm": 23.02049446105957,
"learning_rate": 8.308085182678972e-07,
"loss": 16.431625366210938,
"step": 1500
},
{
"epoch": 0.7142857142857143,
"eval_accuracy": 0.06583464566929134,
"eval_loss": 16.394376754760742,
"eval_runtime": 25.1159,
"eval_samples_per_second": 19.908,
"eval_steps_per_second": 2.508,
"step": 1500
},
{
"epoch": 0.719047619047619,
"grad_norm": 25.103525161743164,
"learning_rate": 8.054021393243589e-07,
"loss": 16.271298217773438,
"step": 1510
},
{
"epoch": 0.7238095238095238,
"grad_norm": 20.621360778808594,
"learning_rate": 7.80291988787982e-07,
"loss": 16.023663330078126,
"step": 1520
},
{
"epoch": 0.7285714285714285,
"grad_norm": 14.038392066955566,
"learning_rate": 7.554842933063619e-07,
"loss": 16.03165283203125,
"step": 1530
},
{
"epoch": 0.7333333333333333,
"grad_norm": 11.327874183654785,
"learning_rate": 7.30985204526309e-07,
"loss": 16.745071411132812,
"step": 1540
},
{
"epoch": 0.7380952380952381,
"grad_norm": 12.739700317382812,
"learning_rate": 7.068007975684009e-07,
"loss": 16.04017791748047,
"step": 1550
},
{
"epoch": 0.7428571428571429,
"grad_norm": 9.787664413452148,
"learning_rate": 6.829370695205175e-07,
"loss": 16.20958251953125,
"step": 1560
},
{
"epoch": 0.7476190476190476,
"grad_norm": 12.524157524108887,
"learning_rate": 6.593999379507207e-07,
"loss": 16.128921508789062,
"step": 1570
},
{
"epoch": 0.7523809523809524,
"grad_norm": 6.589555263519287,
"learning_rate": 6.3619523943986e-07,
"loss": 16.84815368652344,
"step": 1580
},
{
"epoch": 0.7571428571428571,
"grad_norm": 9.732259750366211,
"learning_rate": 6.133287281342496e-07,
"loss": 16.412393188476564,
"step": 1590
},
{
"epoch": 0.7619047619047619,
"grad_norm": 13.840083122253418,
"learning_rate": 5.908060743187979e-07,
"loss": 16.528514099121093,
"step": 1600
},
{
"epoch": 0.7666666666666667,
"grad_norm": 12.243499755859375,
"learning_rate": 5.686328630109287e-07,
"loss": 16.269061279296874,
"step": 1610
},
{
"epoch": 0.7714285714285715,
"grad_norm": 12.514222145080566,
"learning_rate": 5.468145925756424e-07,
"loss": 16.259161376953124,
"step": 1620
},
{
"epoch": 0.7761904761904762,
"grad_norm": 9.389951705932617,
"learning_rate": 5.253566733620706e-07,
"loss": 16.349365234375,
"step": 1630
},
{
"epoch": 0.780952380952381,
"grad_norm": 36.1035041809082,
"learning_rate": 5.042644263618525e-07,
"loss": 16.16446533203125,
"step": 1640
},
{
"epoch": 0.7857142857142857,
"grad_norm": 9.599213600158691,
"learning_rate": 4.835430818896733e-07,
"loss": 16.311676025390625,
"step": 1650
},
{
"epoch": 0.7857142857142857,
"eval_accuracy": 0.06944881889763779,
"eval_loss": 16.275449752807617,
"eval_runtime": 26.1826,
"eval_samples_per_second": 19.097,
"eval_steps_per_second": 2.406,
"step": 1650
},
{
"epoch": 0.7904761904761904,
"grad_norm": 8.050191879272461,
"learning_rate": 4.6319777828628237e-07,
"loss": 16.19422607421875,
"step": 1660
},
{
"epoch": 0.7952380952380952,
"grad_norm": 15.81093692779541,
"learning_rate": 4.432335606443234e-07,
"loss": 16.439752197265626,
"step": 1670
},
{
"epoch": 0.8,
"grad_norm": 16.138633728027344,
"learning_rate": 4.236553795572875e-07,
"loss": 16.333755493164062,
"step": 1680
},
{
"epoch": 0.8047619047619048,
"grad_norm": 16.733367919921875,
"learning_rate": 4.0446808989189485e-07,
"loss": 16.334153747558595,
"step": 1690
},
{
"epoch": 0.8095238095238095,
"grad_norm": 8.272436141967773,
"learning_rate": 3.856764495842197e-07,
"loss": 16.340499877929688,
"step": 1700
},
{
"epoch": 0.8142857142857143,
"grad_norm": 34.05455017089844,
"learning_rate": 3.6728511845984776e-07,
"loss": 16.4441162109375,
"step": 1710
},
{
"epoch": 0.819047619047619,
"grad_norm": 16.842851638793945,
"learning_rate": 3.4929865707836535e-07,
"loss": 16.022296142578124,
"step": 1720
},
{
"epoch": 0.8238095238095238,
"grad_norm": 10.098868370056152,
"learning_rate": 3.317215256024606e-07,
"loss": 16.09764404296875,
"step": 1730
},
{
"epoch": 0.8285714285714286,
"grad_norm": 8.483038902282715,
"learning_rate": 3.1455808269192164e-07,
"loss": 16.11446533203125,
"step": 1740
},
{
"epoch": 0.8333333333333334,
"grad_norm": 10.998558044433594,
"learning_rate": 2.9781258442280877e-07,
"loss": 16.22391357421875,
"step": 1750
},
{
"epoch": 0.8380952380952381,
"grad_norm": 10.043136596679688,
"learning_rate": 2.814891832320565e-07,
"loss": 16.850048828125,
"step": 1760
},
{
"epoch": 0.8428571428571429,
"grad_norm": 13.000489234924316,
"learning_rate": 2.6559192688778263e-07,
"loss": 16.31856689453125,
"step": 1770
},
{
"epoch": 0.8476190476190476,
"grad_norm": 11.428621292114258,
"learning_rate": 2.5012475748554916e-07,
"loss": 16.24926300048828,
"step": 1780
},
{
"epoch": 0.8523809523809524,
"grad_norm": 21.403606414794922,
"learning_rate": 2.3509151047082866e-07,
"loss": 16.078160095214844,
"step": 1790
},
{
"epoch": 0.8571428571428571,
"grad_norm": 9.761038780212402,
"learning_rate": 2.2049591368791386e-07,
"loss": 15.990585327148438,
"step": 1800
},
{
"epoch": 0.8571428571428571,
"eval_accuracy": 0.0696771653543307,
"eval_loss": 16.194637298583984,
"eval_runtime": 25.3768,
"eval_samples_per_second": 19.703,
"eval_steps_per_second": 2.483,
"step": 1800
},
{
"epoch": 0.861904761904762,
"grad_norm": 15.835714340209961,
"learning_rate": 2.0634158645551358e-07,
"loss": 16.231326293945312,
"step": 1810
},
{
"epoch": 0.8666666666666667,
"grad_norm": 5.838013648986816,
"learning_rate": 1.9263203866925725e-07,
"loss": 16.3001220703125,
"step": 1820
},
{
"epoch": 0.8714285714285714,
"grad_norm": 8.052929878234863,
"learning_rate": 1.7937066993133553e-07,
"loss": 16.139373779296875,
"step": 1830
},
{
"epoch": 0.8761904761904762,
"grad_norm": 18.70516586303711,
"learning_rate": 1.665607687074886e-07,
"loss": 16.020474243164063,
"step": 1840
},
{
"epoch": 0.8809523809523809,
"grad_norm": 17.08431053161621,
"learning_rate": 1.5420551151155393e-07,
"loss": 16.245944213867187,
"step": 1850
},
{
"epoch": 0.8857142857142857,
"grad_norm": 17.282939910888672,
"learning_rate": 1.4230796211777784e-07,
"loss": 16.05218505859375,
"step": 1860
},
{
"epoch": 0.8904761904761904,
"grad_norm": 13.214439392089844,
"learning_rate": 1.3087107080107852e-07,
"loss": 16.017184448242187,
"step": 1870
},
{
"epoch": 0.8952380952380953,
"grad_norm": 22.98546600341797,
"learning_rate": 1.1989767360545779e-07,
"loss": 16.036334228515624,
"step": 1880
},
{
"epoch": 0.9,
"grad_norm": 23.661928176879883,
"learning_rate": 1.0939049164073777e-07,
"loss": 15.678387451171876,
"step": 1890
},
{
"epoch": 0.9047619047619048,
"grad_norm": 11.723611831665039,
"learning_rate": 9.935213040779911e-08,
"loss": 16.37012939453125,
"step": 1900
},
{
"epoch": 0.9095238095238095,
"grad_norm": 21.208452224731445,
"learning_rate": 8.978507915248434e-08,
"loss": 16.12847900390625,
"step": 1910
},
{
"epoch": 0.9142857142857143,
"grad_norm": 19.140209197998047,
"learning_rate": 8.069171024833222e-08,
"loss": 16.41150817871094,
"step": 1920
},
{
"epoch": 0.919047619047619,
"grad_norm": 12.952860832214355,
"learning_rate": 7.207427860829351e-08,
"loss": 15.9720703125,
"step": 1930
},
{
"epoch": 0.9238095238095239,
"grad_norm": 11.641100883483887,
"learning_rate": 6.393492112557064e-08,
"loss": 16.332427978515625,
"step": 1940
},
{
"epoch": 0.9285714285714286,
"grad_norm": 10.129194259643555,
"learning_rate": 5.627565614372653e-08,
"loss": 16.232325744628906,
"step": 1950
},
{
"epoch": 0.9285714285714286,
"eval_accuracy": 0.06559055118110237,
"eval_loss": 16.09013557434082,
"eval_runtime": 25.2262,
"eval_samples_per_second": 19.821,
"eval_steps_per_second": 2.497,
"step": 1950
},
{
"epoch": 0.9333333333333333,
"grad_norm": 10.955820083618164,
"learning_rate": 4.909838295618907e-08,
"loss": 16.038211059570312,
"step": 1960
},
{
"epoch": 0.9380952380952381,
"grad_norm": 10.441788673400879,
"learning_rate": 4.2404881335276644e-08,
"loss": 16.02879638671875,
"step": 1970
},
{
"epoch": 0.9428571428571428,
"grad_norm": 9.26267147064209,
"learning_rate": 3.619681109086237e-08,
"loss": 15.950970458984376,
"step": 1980
},
{
"epoch": 0.9476190476190476,
"grad_norm": 19.122802734375,
"learning_rate": 3.0475711658785485e-08,
"loss": 16.08349151611328,
"step": 1990
},
{
"epoch": 0.9523809523809523,
"grad_norm": 18.312496185302734,
"learning_rate": 2.5243001719111646e-08,
"loss": 16.050738525390624,
"step": 2000
},
{
"epoch": 0.9571428571428572,
"grad_norm": 11.455791473388672,
"learning_rate": 2.049997884433985e-08,
"loss": 16.05840606689453,
"step": 2010
},
{
"epoch": 0.9619047619047619,
"grad_norm": 11.550554275512695,
"learning_rate": 1.6247819177636735e-08,
"loss": 16.087054443359374,
"step": 2020
},
{
"epoch": 0.9666666666666667,
"grad_norm": 19.676589965820312,
"learning_rate": 1.248757714118609e-08,
"loss": 15.8768310546875,
"step": 2030
},
{
"epoch": 0.9714285714285714,
"grad_norm": 9.593478202819824,
"learning_rate": 9.220185174720453e-09,
"loss": 16.02369079589844,
"step": 2040
},
{
"epoch": 0.9761904761904762,
"grad_norm": 10.647096633911133,
"learning_rate": 6.446453504299176e-09,
"loss": 15.94654541015625,
"step": 2050
},
{
"epoch": 0.9809523809523809,
"grad_norm": 6.6210713386535645,
"learning_rate": 4.167069941395818e-09,
"loss": 16.178671264648436,
"step": 2060
},
{
"epoch": 0.9857142857142858,
"grad_norm": 11.91507339477539,
"learning_rate": 2.38259971233834e-09,
"loss": 15.88709716796875,
"step": 2070
},
{
"epoch": 0.9904761904761905,
"grad_norm": 29.012462615966797,
"learning_rate": 1.093485318147902e-09,
"loss": 15.998876953125,
"step": 2080
},
{
"epoch": 0.9952380952380953,
"grad_norm": 13.495532035827637,
"learning_rate": 3.0004642481151755e-10,
"loss": 15.837295532226562,
"step": 2090
},
{
"epoch": 1.0,
"grad_norm": 10.239914894104004,
"learning_rate": 2.4797840116885795e-12,
"loss": 16.02972869873047,
"step": 2100
},
{
"epoch": 1.0,
"eval_accuracy": 0.06144094488188977,
"eval_loss": 16.065017700195312,
"eval_runtime": 25.407,
"eval_samples_per_second": 19.68,
"eval_steps_per_second": 2.48,
"step": 2100
}
],
"logging_steps": 10,
"max_steps": 2100,
"num_input_tokens_seen": 0,
"num_train_epochs": 9223372036854775807,
"save_steps": 300,
"stateful_callbacks": {
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": true,
"should_training_stop": true
},
"attributes": {}
}
},
"total_flos": 0.0,
"train_batch_size": 4,
"trial_name": null,
"trial_params": null
}