weilulobster's picture
Add EMMA classifier/evaluation checkpoints (GitHub LFS objects were never uploaded)
a1f8feb verified
Raw
History Blame Contribute Delete
41.1 kB
{
"best_metric": null,
"best_model_checkpoint": null,
"epoch": 9.75609756097561,
"global_step": 2800,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"epoch": 0.03,
"learning_rate": 0.00019930313588850174,
"loss": 3.8899,
"step": 10
},
{
"epoch": 0.07,
"learning_rate": 0.00019860627177700348,
"loss": 3.223,
"step": 20
},
{
"epoch": 0.1,
"learning_rate": 0.00019790940766550524,
"loss": 3.1045,
"step": 30
},
{
"epoch": 0.14,
"learning_rate": 0.00019721254355400697,
"loss": 2.847,
"step": 40
},
{
"epoch": 0.17,
"learning_rate": 0.00019651567944250874,
"loss": 2.9753,
"step": 50
},
{
"epoch": 0.21,
"learning_rate": 0.00019581881533101044,
"loss": 2.9102,
"step": 60
},
{
"epoch": 0.24,
"learning_rate": 0.0001951219512195122,
"loss": 2.8334,
"step": 70
},
{
"epoch": 0.28,
"learning_rate": 0.00019442508710801394,
"loss": 2.794,
"step": 80
},
{
"epoch": 0.31,
"learning_rate": 0.0001937282229965157,
"loss": 2.7356,
"step": 90
},
{
"epoch": 0.35,
"learning_rate": 0.0001930313588850174,
"loss": 2.6414,
"step": 100
},
{
"epoch": 0.35,
"eval_accuracy": 0.5204419889502763,
"eval_loss": 2.669311046600342,
"eval_runtime": 293.1372,
"eval_samples_per_second": 27.786,
"eval_steps_per_second": 3.476,
"step": 100
},
{
"epoch": 0.38,
"learning_rate": 0.00019233449477351917,
"loss": 2.6534,
"step": 110
},
{
"epoch": 0.42,
"learning_rate": 0.0001916376306620209,
"loss": 2.5765,
"step": 120
},
{
"epoch": 0.45,
"learning_rate": 0.00019094076655052267,
"loss": 2.5439,
"step": 130
},
{
"epoch": 0.49,
"learning_rate": 0.0001902439024390244,
"loss": 2.5482,
"step": 140
},
{
"epoch": 0.52,
"learning_rate": 0.00018954703832752614,
"loss": 2.5077,
"step": 150
},
{
"epoch": 0.56,
"learning_rate": 0.0001888501742160279,
"loss": 2.5218,
"step": 160
},
{
"epoch": 0.59,
"learning_rate": 0.00018815331010452963,
"loss": 2.3255,
"step": 170
},
{
"epoch": 0.63,
"learning_rate": 0.00018745644599303137,
"loss": 2.3874,
"step": 180
},
{
"epoch": 0.66,
"learning_rate": 0.0001867595818815331,
"loss": 2.3304,
"step": 190
},
{
"epoch": 0.7,
"learning_rate": 0.00018606271777003486,
"loss": 2.2286,
"step": 200
},
{
"epoch": 0.7,
"eval_accuracy": 0.5642725598526703,
"eval_loss": 2.2449886798858643,
"eval_runtime": 293.6028,
"eval_samples_per_second": 27.742,
"eval_steps_per_second": 3.471,
"step": 200
},
{
"epoch": 0.73,
"learning_rate": 0.0001853658536585366,
"loss": 2.1984,
"step": 210
},
{
"epoch": 0.77,
"learning_rate": 0.00018466898954703833,
"loss": 2.2406,
"step": 220
},
{
"epoch": 0.8,
"learning_rate": 0.00018397212543554007,
"loss": 2.1315,
"step": 230
},
{
"epoch": 0.84,
"learning_rate": 0.00018327526132404183,
"loss": 2.0743,
"step": 240
},
{
"epoch": 0.87,
"learning_rate": 0.00018257839721254356,
"loss": 2.0483,
"step": 250
},
{
"epoch": 0.91,
"learning_rate": 0.0001818815331010453,
"loss": 2.0747,
"step": 260
},
{
"epoch": 0.94,
"learning_rate": 0.00018118466898954703,
"loss": 2.0846,
"step": 270
},
{
"epoch": 0.98,
"learning_rate": 0.0001804878048780488,
"loss": 1.9392,
"step": 280
},
{
"epoch": 1.01,
"learning_rate": 0.00017979094076655053,
"loss": 1.9443,
"step": 290
},
{
"epoch": 1.05,
"learning_rate": 0.00017909407665505226,
"loss": 1.871,
"step": 300
},
{
"epoch": 1.05,
"eval_accuracy": 0.6078575813382443,
"eval_loss": 1.9149649143218994,
"eval_runtime": 301.3751,
"eval_samples_per_second": 27.026,
"eval_steps_per_second": 3.381,
"step": 300
},
{
"epoch": 1.08,
"learning_rate": 0.00017839721254355403,
"loss": 1.9009,
"step": 310
},
{
"epoch": 1.11,
"learning_rate": 0.00017770034843205576,
"loss": 1.8669,
"step": 320
},
{
"epoch": 1.15,
"learning_rate": 0.0001770034843205575,
"loss": 1.8627,
"step": 330
},
{
"epoch": 1.18,
"learning_rate": 0.00017630662020905923,
"loss": 1.8475,
"step": 340
},
{
"epoch": 1.22,
"learning_rate": 0.000175609756097561,
"loss": 1.7538,
"step": 350
},
{
"epoch": 1.25,
"learning_rate": 0.00017491289198606273,
"loss": 1.7642,
"step": 360
},
{
"epoch": 1.29,
"learning_rate": 0.00017421602787456446,
"loss": 1.7665,
"step": 370
},
{
"epoch": 1.32,
"learning_rate": 0.0001735191637630662,
"loss": 1.6783,
"step": 380
},
{
"epoch": 1.36,
"learning_rate": 0.00017282229965156796,
"loss": 1.6583,
"step": 390
},
{
"epoch": 1.39,
"learning_rate": 0.0001721254355400697,
"loss": 1.7339,
"step": 400
},
{
"epoch": 1.39,
"eval_accuracy": 0.6306936771025169,
"eval_loss": 1.6812902688980103,
"eval_runtime": 292.2248,
"eval_samples_per_second": 27.872,
"eval_steps_per_second": 3.487,
"step": 400
},
{
"epoch": 1.43,
"learning_rate": 0.00017142857142857143,
"loss": 1.6163,
"step": 410
},
{
"epoch": 1.46,
"learning_rate": 0.0001707317073170732,
"loss": 1.5708,
"step": 420
},
{
"epoch": 1.5,
"learning_rate": 0.00017003484320557492,
"loss": 1.5696,
"step": 430
},
{
"epoch": 1.53,
"learning_rate": 0.00016933797909407668,
"loss": 1.6017,
"step": 440
},
{
"epoch": 1.57,
"learning_rate": 0.0001686411149825784,
"loss": 1.5735,
"step": 450
},
{
"epoch": 1.6,
"learning_rate": 0.00016794425087108015,
"loss": 1.5265,
"step": 460
},
{
"epoch": 1.64,
"learning_rate": 0.0001672473867595819,
"loss": 1.5508,
"step": 470
},
{
"epoch": 1.67,
"learning_rate": 0.00016655052264808365,
"loss": 1.4604,
"step": 480
},
{
"epoch": 1.71,
"learning_rate": 0.00016585365853658536,
"loss": 1.5646,
"step": 490
},
{
"epoch": 1.74,
"learning_rate": 0.00016515679442508712,
"loss": 1.484,
"step": 500
},
{
"epoch": 1.74,
"eval_accuracy": 0.6531614487415592,
"eval_loss": 1.5198744535446167,
"eval_runtime": 291.9876,
"eval_samples_per_second": 27.895,
"eval_steps_per_second": 3.49,
"step": 500
},
{
"epoch": 1.78,
"learning_rate": 0.00016445993031358885,
"loss": 1.5005,
"step": 510
},
{
"epoch": 1.81,
"learning_rate": 0.00016376306620209061,
"loss": 1.4561,
"step": 520
},
{
"epoch": 1.85,
"learning_rate": 0.00016306620209059232,
"loss": 1.4335,
"step": 530
},
{
"epoch": 1.88,
"learning_rate": 0.00016236933797909408,
"loss": 1.4252,
"step": 540
},
{
"epoch": 1.92,
"learning_rate": 0.00016167247386759582,
"loss": 1.4586,
"step": 550
},
{
"epoch": 1.95,
"learning_rate": 0.00016097560975609758,
"loss": 1.4068,
"step": 560
},
{
"epoch": 1.99,
"learning_rate": 0.00016027874564459931,
"loss": 1.4227,
"step": 570
},
{
"epoch": 2.02,
"learning_rate": 0.00015958188153310105,
"loss": 1.3449,
"step": 580
},
{
"epoch": 2.06,
"learning_rate": 0.0001588850174216028,
"loss": 1.308,
"step": 590
},
{
"epoch": 2.09,
"learning_rate": 0.00015818815331010454,
"loss": 1.3087,
"step": 600
},
{
"epoch": 2.09,
"eval_accuracy": 0.6647022713321056,
"eval_loss": 1.4196171760559082,
"eval_runtime": 293.0401,
"eval_samples_per_second": 27.795,
"eval_steps_per_second": 3.477,
"step": 600
},
{
"epoch": 2.13,
"learning_rate": 0.00015749128919860628,
"loss": 1.2248,
"step": 610
},
{
"epoch": 2.16,
"learning_rate": 0.00015679442508710801,
"loss": 1.2168,
"step": 620
},
{
"epoch": 2.2,
"learning_rate": 0.00015609756097560978,
"loss": 1.2282,
"step": 630
},
{
"epoch": 2.23,
"learning_rate": 0.00015540069686411148,
"loss": 1.2161,
"step": 640
},
{
"epoch": 2.26,
"learning_rate": 0.00015470383275261324,
"loss": 1.1724,
"step": 650
},
{
"epoch": 2.3,
"learning_rate": 0.00015400696864111498,
"loss": 1.2168,
"step": 660
},
{
"epoch": 2.33,
"learning_rate": 0.00015331010452961674,
"loss": 1.1928,
"step": 670
},
{
"epoch": 2.37,
"learning_rate": 0.00015261324041811848,
"loss": 1.1841,
"step": 680
},
{
"epoch": 2.4,
"learning_rate": 0.0001519163763066202,
"loss": 1.1963,
"step": 690
},
{
"epoch": 2.44,
"learning_rate": 0.00015121951219512197,
"loss": 1.1799,
"step": 700
},
{
"epoch": 2.44,
"eval_accuracy": 0.6929404542664211,
"eval_loss": 1.2876527309417725,
"eval_runtime": 291.746,
"eval_samples_per_second": 27.918,
"eval_steps_per_second": 3.493,
"step": 700
},
{
"epoch": 2.47,
"learning_rate": 0.0001505226480836237,
"loss": 1.1571,
"step": 710
},
{
"epoch": 2.51,
"learning_rate": 0.00014982578397212544,
"loss": 1.1253,
"step": 720
},
{
"epoch": 2.54,
"learning_rate": 0.00014912891986062718,
"loss": 1.1619,
"step": 730
},
{
"epoch": 2.58,
"learning_rate": 0.00014843205574912894,
"loss": 1.1534,
"step": 740
},
{
"epoch": 2.61,
"learning_rate": 0.00014773519163763067,
"loss": 1.1443,
"step": 750
},
{
"epoch": 2.65,
"learning_rate": 0.0001470383275261324,
"loss": 1.1674,
"step": 760
},
{
"epoch": 2.68,
"learning_rate": 0.00014634146341463414,
"loss": 1.2101,
"step": 770
},
{
"epoch": 2.72,
"learning_rate": 0.0001456445993031359,
"loss": 1.156,
"step": 780
},
{
"epoch": 2.75,
"learning_rate": 0.00014494773519163764,
"loss": 1.1294,
"step": 790
},
{
"epoch": 2.79,
"learning_rate": 0.00014425087108013937,
"loss": 1.1236,
"step": 800
},
{
"epoch": 2.79,
"eval_accuracy": 0.7019030079803561,
"eval_loss": 1.2286723852157593,
"eval_runtime": 294.5533,
"eval_samples_per_second": 27.652,
"eval_steps_per_second": 3.459,
"step": 800
},
{
"epoch": 2.82,
"learning_rate": 0.0001435540069686411,
"loss": 1.1472,
"step": 810
},
{
"epoch": 2.86,
"learning_rate": 0.00014285714285714287,
"loss": 1.1352,
"step": 820
},
{
"epoch": 2.89,
"learning_rate": 0.0001421602787456446,
"loss": 1.1197,
"step": 830
},
{
"epoch": 2.93,
"learning_rate": 0.00014146341463414634,
"loss": 1.0767,
"step": 840
},
{
"epoch": 2.96,
"learning_rate": 0.0001407665505226481,
"loss": 1.0855,
"step": 850
},
{
"epoch": 3.0,
"learning_rate": 0.00014006968641114983,
"loss": 1.12,
"step": 860
},
{
"epoch": 3.03,
"learning_rate": 0.0001393728222996516,
"loss": 1.0387,
"step": 870
},
{
"epoch": 3.07,
"learning_rate": 0.0001386759581881533,
"loss": 0.9932,
"step": 880
},
{
"epoch": 3.1,
"learning_rate": 0.00013797909407665506,
"loss": 0.9766,
"step": 890
},
{
"epoch": 3.14,
"learning_rate": 0.0001372822299651568,
"loss": 0.9447,
"step": 900
},
{
"epoch": 3.14,
"eval_accuracy": 0.7130755064456722,
"eval_loss": 1.1540069580078125,
"eval_runtime": 293.0443,
"eval_samples_per_second": 27.794,
"eval_steps_per_second": 3.477,
"step": 900
},
{
"epoch": 3.17,
"learning_rate": 0.00013658536585365856,
"loss": 0.9596,
"step": 910
},
{
"epoch": 3.21,
"learning_rate": 0.00013588850174216027,
"loss": 0.9064,
"step": 920
},
{
"epoch": 3.24,
"learning_rate": 0.00013519163763066203,
"loss": 0.9208,
"step": 930
},
{
"epoch": 3.28,
"learning_rate": 0.00013449477351916376,
"loss": 0.8917,
"step": 940
},
{
"epoch": 3.31,
"learning_rate": 0.00013379790940766553,
"loss": 0.9753,
"step": 950
},
{
"epoch": 3.34,
"learning_rate": 0.00013310104529616726,
"loss": 0.947,
"step": 960
},
{
"epoch": 3.38,
"learning_rate": 0.000132404181184669,
"loss": 0.9483,
"step": 970
},
{
"epoch": 3.41,
"learning_rate": 0.00013170731707317076,
"loss": 0.92,
"step": 980
},
{
"epoch": 3.45,
"learning_rate": 0.00013101045296167246,
"loss": 0.9128,
"step": 990
},
{
"epoch": 3.48,
"learning_rate": 0.00013031358885017423,
"loss": 0.9463,
"step": 1000
},
{
"epoch": 3.48,
"eval_accuracy": 0.7253529772866789,
"eval_loss": 1.0846450328826904,
"eval_runtime": 292.891,
"eval_samples_per_second": 27.809,
"eval_steps_per_second": 3.479,
"step": 1000
},
{
"epoch": 3.52,
"learning_rate": 0.00012961672473867596,
"loss": 0.916,
"step": 1010
},
{
"epoch": 3.55,
"learning_rate": 0.00012891986062717772,
"loss": 0.9094,
"step": 1020
},
{
"epoch": 3.59,
"learning_rate": 0.00012822299651567943,
"loss": 0.9522,
"step": 1030
},
{
"epoch": 3.62,
"learning_rate": 0.0001275261324041812,
"loss": 0.9032,
"step": 1040
},
{
"epoch": 3.66,
"learning_rate": 0.00012682926829268293,
"loss": 0.9051,
"step": 1050
},
{
"epoch": 3.69,
"learning_rate": 0.0001261324041811847,
"loss": 0.9214,
"step": 1060
},
{
"epoch": 3.73,
"learning_rate": 0.0001254355400696864,
"loss": 0.8808,
"step": 1070
},
{
"epoch": 3.76,
"learning_rate": 0.00012473867595818816,
"loss": 0.8724,
"step": 1080
},
{
"epoch": 3.8,
"learning_rate": 0.0001240418118466899,
"loss": 0.8951,
"step": 1090
},
{
"epoch": 3.83,
"learning_rate": 0.00012334494773519165,
"loss": 0.9383,
"step": 1100
},
{
"epoch": 3.83,
"eval_accuracy": 0.7306322897483118,
"eval_loss": 1.059184193611145,
"eval_runtime": 293.0858,
"eval_samples_per_second": 27.791,
"eval_steps_per_second": 3.477,
"step": 1100
},
{
"epoch": 3.87,
"learning_rate": 0.0001226480836236934,
"loss": 0.8675,
"step": 1110
},
{
"epoch": 3.9,
"learning_rate": 0.00012195121951219512,
"loss": 0.8616,
"step": 1120
},
{
"epoch": 3.94,
"learning_rate": 0.00012125435540069687,
"loss": 0.8807,
"step": 1130
},
{
"epoch": 3.97,
"learning_rate": 0.00012055749128919862,
"loss": 0.8594,
"step": 1140
},
{
"epoch": 4.01,
"learning_rate": 0.00011986062717770035,
"loss": 0.9073,
"step": 1150
},
{
"epoch": 4.04,
"learning_rate": 0.0001191637630662021,
"loss": 0.7567,
"step": 1160
},
{
"epoch": 4.08,
"learning_rate": 0.00011846689895470385,
"loss": 0.7788,
"step": 1170
},
{
"epoch": 4.11,
"learning_rate": 0.00011777003484320558,
"loss": 0.7694,
"step": 1180
},
{
"epoch": 4.15,
"learning_rate": 0.00011707317073170732,
"loss": 0.7073,
"step": 1190
},
{
"epoch": 4.18,
"learning_rate": 0.00011637630662020907,
"loss": 0.7813,
"step": 1200
},
{
"epoch": 4.18,
"eval_accuracy": 0.7349294045426642,
"eval_loss": 1.0452630519866943,
"eval_runtime": 295.364,
"eval_samples_per_second": 27.576,
"eval_steps_per_second": 3.45,
"step": 1200
},
{
"epoch": 4.22,
"learning_rate": 0.00011567944250871081,
"loss": 0.7916,
"step": 1210
},
{
"epoch": 4.25,
"learning_rate": 0.00011498257839721256,
"loss": 0.8,
"step": 1220
},
{
"epoch": 4.29,
"learning_rate": 0.00011428571428571428,
"loss": 0.7617,
"step": 1230
},
{
"epoch": 4.32,
"learning_rate": 0.00011358885017421603,
"loss": 0.7524,
"step": 1240
},
{
"epoch": 4.36,
"learning_rate": 0.00011289198606271778,
"loss": 0.7477,
"step": 1250
},
{
"epoch": 4.39,
"learning_rate": 0.00011219512195121953,
"loss": 0.7435,
"step": 1260
},
{
"epoch": 4.43,
"learning_rate": 0.00011149825783972125,
"loss": 0.7493,
"step": 1270
},
{
"epoch": 4.46,
"learning_rate": 0.000110801393728223,
"loss": 0.731,
"step": 1280
},
{
"epoch": 4.49,
"learning_rate": 0.00011010452961672475,
"loss": 0.7566,
"step": 1290
},
{
"epoch": 4.53,
"learning_rate": 0.00010940766550522648,
"loss": 0.7157,
"step": 1300
},
{
"epoch": 4.53,
"eval_accuracy": 0.7325966850828729,
"eval_loss": 1.0333356857299805,
"eval_runtime": 292.3822,
"eval_samples_per_second": 27.857,
"eval_steps_per_second": 3.485,
"step": 1300
},
{
"epoch": 4.56,
"learning_rate": 0.00010871080139372823,
"loss": 0.7028,
"step": 1310
},
{
"epoch": 4.6,
"learning_rate": 0.00010801393728222998,
"loss": 0.7242,
"step": 1320
},
{
"epoch": 4.63,
"learning_rate": 0.00010731707317073172,
"loss": 0.7527,
"step": 1330
},
{
"epoch": 4.67,
"learning_rate": 0.00010662020905923345,
"loss": 0.7347,
"step": 1340
},
{
"epoch": 4.7,
"learning_rate": 0.00010592334494773519,
"loss": 0.745,
"step": 1350
},
{
"epoch": 4.74,
"learning_rate": 0.00010522648083623694,
"loss": 0.7286,
"step": 1360
},
{
"epoch": 4.77,
"learning_rate": 0.00010452961672473869,
"loss": 0.6988,
"step": 1370
},
{
"epoch": 4.81,
"learning_rate": 0.00010383275261324041,
"loss": 0.7018,
"step": 1380
},
{
"epoch": 4.84,
"learning_rate": 0.00010313588850174216,
"loss": 0.7321,
"step": 1390
},
{
"epoch": 4.88,
"learning_rate": 0.0001024390243902439,
"loss": 0.7231,
"step": 1400
},
{
"epoch": 4.88,
"eval_accuracy": 0.7453652547575199,
"eval_loss": 0.9866864681243896,
"eval_runtime": 327.7217,
"eval_samples_per_second": 24.853,
"eval_steps_per_second": 3.109,
"step": 1400
},
{
"epoch": 4.91,
"learning_rate": 0.00010174216027874565,
"loss": 0.7052,
"step": 1410
},
{
"epoch": 4.95,
"learning_rate": 0.00010104529616724739,
"loss": 0.7247,
"step": 1420
},
{
"epoch": 4.98,
"learning_rate": 0.00010034843205574914,
"loss": 0.7218,
"step": 1430
},
{
"epoch": 5.02,
"learning_rate": 9.965156794425087e-05,
"loss": 0.6719,
"step": 1440
},
{
"epoch": 5.05,
"learning_rate": 9.895470383275262e-05,
"loss": 0.6509,
"step": 1450
},
{
"epoch": 5.09,
"learning_rate": 9.825783972125437e-05,
"loss": 0.6253,
"step": 1460
},
{
"epoch": 5.12,
"learning_rate": 9.75609756097561e-05,
"loss": 0.6017,
"step": 1470
},
{
"epoch": 5.16,
"learning_rate": 9.686411149825785e-05,
"loss": 0.6031,
"step": 1480
},
{
"epoch": 5.19,
"learning_rate": 9.616724738675959e-05,
"loss": 0.6391,
"step": 1490
},
{
"epoch": 5.23,
"learning_rate": 9.547038327526133e-05,
"loss": 0.6205,
"step": 1500
},
{
"epoch": 5.23,
"eval_accuracy": 0.7446286065070595,
"eval_loss": 0.9795861840248108,
"eval_runtime": 296.8791,
"eval_samples_per_second": 27.435,
"eval_steps_per_second": 3.432,
"step": 1500
},
{
"epoch": 5.26,
"learning_rate": 9.477351916376307e-05,
"loss": 0.5884,
"step": 1510
},
{
"epoch": 5.3,
"learning_rate": 9.407665505226482e-05,
"loss": 0.62,
"step": 1520
},
{
"epoch": 5.33,
"learning_rate": 9.337979094076655e-05,
"loss": 0.5948,
"step": 1530
},
{
"epoch": 5.37,
"learning_rate": 9.26829268292683e-05,
"loss": 0.5942,
"step": 1540
},
{
"epoch": 5.4,
"learning_rate": 9.198606271777003e-05,
"loss": 0.6308,
"step": 1550
},
{
"epoch": 5.44,
"learning_rate": 9.128919860627178e-05,
"loss": 0.6113,
"step": 1560
},
{
"epoch": 5.47,
"learning_rate": 9.059233449477352e-05,
"loss": 0.6217,
"step": 1570
},
{
"epoch": 5.51,
"learning_rate": 8.989547038327526e-05,
"loss": 0.6375,
"step": 1580
},
{
"epoch": 5.54,
"learning_rate": 8.919860627177701e-05,
"loss": 0.6068,
"step": 1590
},
{
"epoch": 5.57,
"learning_rate": 8.850174216027875e-05,
"loss": 0.5982,
"step": 1600
},
{
"epoch": 5.57,
"eval_accuracy": 0.7524861878453039,
"eval_loss": 0.9573265910148621,
"eval_runtime": 291.5725,
"eval_samples_per_second": 27.935,
"eval_steps_per_second": 3.495,
"step": 1600
},
{
"epoch": 5.61,
"learning_rate": 8.78048780487805e-05,
"loss": 0.5714,
"step": 1610
},
{
"epoch": 5.64,
"learning_rate": 8.710801393728223e-05,
"loss": 0.61,
"step": 1620
},
{
"epoch": 5.68,
"learning_rate": 8.641114982578398e-05,
"loss": 0.5779,
"step": 1630
},
{
"epoch": 5.71,
"learning_rate": 8.571428571428571e-05,
"loss": 0.5917,
"step": 1640
},
{
"epoch": 5.75,
"learning_rate": 8.501742160278746e-05,
"loss": 0.5988,
"step": 1650
},
{
"epoch": 5.78,
"learning_rate": 8.43205574912892e-05,
"loss": 0.5805,
"step": 1660
},
{
"epoch": 5.82,
"learning_rate": 8.362369337979094e-05,
"loss": 0.63,
"step": 1670
},
{
"epoch": 5.85,
"learning_rate": 8.292682926829268e-05,
"loss": 0.572,
"step": 1680
},
{
"epoch": 5.89,
"learning_rate": 8.222996515679443e-05,
"loss": 0.5867,
"step": 1690
},
{
"epoch": 5.92,
"learning_rate": 8.153310104529616e-05,
"loss": 0.6281,
"step": 1700
},
{
"epoch": 5.92,
"eval_accuracy": 0.7565377532228361,
"eval_loss": 0.9512879252433777,
"eval_runtime": 291.1378,
"eval_samples_per_second": 27.976,
"eval_steps_per_second": 3.5,
"step": 1700
},
{
"epoch": 5.96,
"learning_rate": 8.083623693379791e-05,
"loss": 0.5597,
"step": 1710
},
{
"epoch": 5.99,
"learning_rate": 8.013937282229966e-05,
"loss": 0.6012,
"step": 1720
},
{
"epoch": 6.03,
"learning_rate": 7.94425087108014e-05,
"loss": 0.5376,
"step": 1730
},
{
"epoch": 6.06,
"learning_rate": 7.874564459930314e-05,
"loss": 0.4912,
"step": 1740
},
{
"epoch": 6.1,
"learning_rate": 7.804878048780489e-05,
"loss": 0.5127,
"step": 1750
},
{
"epoch": 6.13,
"learning_rate": 7.735191637630662e-05,
"loss": 0.4802,
"step": 1760
},
{
"epoch": 6.17,
"learning_rate": 7.665505226480837e-05,
"loss": 0.5208,
"step": 1770
},
{
"epoch": 6.2,
"learning_rate": 7.59581881533101e-05,
"loss": 0.4987,
"step": 1780
},
{
"epoch": 6.24,
"learning_rate": 7.526132404181185e-05,
"loss": 0.5009,
"step": 1790
},
{
"epoch": 6.27,
"learning_rate": 7.456445993031359e-05,
"loss": 0.5127,
"step": 1800
},
{
"epoch": 6.27,
"eval_accuracy": 0.7564149785144261,
"eval_loss": 0.9356275796890259,
"eval_runtime": 291.6616,
"eval_samples_per_second": 27.926,
"eval_steps_per_second": 3.494,
"step": 1800
},
{
"epoch": 6.31,
"learning_rate": 7.386759581881534e-05,
"loss": 0.4736,
"step": 1810
},
{
"epoch": 6.34,
"learning_rate": 7.317073170731707e-05,
"loss": 0.4973,
"step": 1820
},
{
"epoch": 6.38,
"learning_rate": 7.247386759581882e-05,
"loss": 0.477,
"step": 1830
},
{
"epoch": 6.41,
"learning_rate": 7.177700348432055e-05,
"loss": 0.5001,
"step": 1840
},
{
"epoch": 6.45,
"learning_rate": 7.10801393728223e-05,
"loss": 0.4986,
"step": 1850
},
{
"epoch": 6.48,
"learning_rate": 7.038327526132405e-05,
"loss": 0.5123,
"step": 1860
},
{
"epoch": 6.52,
"learning_rate": 6.96864111498258e-05,
"loss": 0.4856,
"step": 1870
},
{
"epoch": 6.55,
"learning_rate": 6.898954703832753e-05,
"loss": 0.4959,
"step": 1880
},
{
"epoch": 6.59,
"learning_rate": 6.829268292682928e-05,
"loss": 0.4967,
"step": 1890
},
{
"epoch": 6.62,
"learning_rate": 6.759581881533101e-05,
"loss": 0.4718,
"step": 1900
},
{
"epoch": 6.62,
"eval_accuracy": 0.7625537139349294,
"eval_loss": 0.9554521441459656,
"eval_runtime": 292.36,
"eval_samples_per_second": 27.859,
"eval_steps_per_second": 3.485,
"step": 1900
},
{
"epoch": 6.66,
"learning_rate": 6.689895470383276e-05,
"loss": 0.5155,
"step": 1910
},
{
"epoch": 6.69,
"learning_rate": 6.62020905923345e-05,
"loss": 0.4721,
"step": 1920
},
{
"epoch": 6.72,
"learning_rate": 6.550522648083623e-05,
"loss": 0.4835,
"step": 1930
},
{
"epoch": 6.76,
"learning_rate": 6.480836236933798e-05,
"loss": 0.4771,
"step": 1940
},
{
"epoch": 6.79,
"learning_rate": 6.411149825783971e-05,
"loss": 0.5058,
"step": 1950
},
{
"epoch": 6.83,
"learning_rate": 6.341463414634146e-05,
"loss": 0.5301,
"step": 1960
},
{
"epoch": 6.86,
"learning_rate": 6.27177700348432e-05,
"loss": 0.4671,
"step": 1970
},
{
"epoch": 6.9,
"learning_rate": 6.202090592334495e-05,
"loss": 0.4833,
"step": 1980
},
{
"epoch": 6.93,
"learning_rate": 6.13240418118467e-05,
"loss": 0.503,
"step": 1990
},
{
"epoch": 6.97,
"learning_rate": 6.0627177700348435e-05,
"loss": 0.4762,
"step": 2000
},
{
"epoch": 6.97,
"eval_accuracy": 0.7695518723143032,
"eval_loss": 0.8946472406387329,
"eval_runtime": 290.4161,
"eval_samples_per_second": 28.046,
"eval_steps_per_second": 3.509,
"step": 2000
},
{
"epoch": 7.0,
"learning_rate": 5.9930313588850176e-05,
"loss": 0.495,
"step": 2010
},
{
"epoch": 7.04,
"learning_rate": 5.9233449477351924e-05,
"loss": 0.4181,
"step": 2020
},
{
"epoch": 7.07,
"learning_rate": 5.853658536585366e-05,
"loss": 0.3798,
"step": 2030
},
{
"epoch": 7.11,
"learning_rate": 5.783972125435541e-05,
"loss": 0.4163,
"step": 2040
},
{
"epoch": 7.14,
"learning_rate": 5.714285714285714e-05,
"loss": 0.441,
"step": 2050
},
{
"epoch": 7.18,
"learning_rate": 5.644599303135889e-05,
"loss": 0.3888,
"step": 2060
},
{
"epoch": 7.21,
"learning_rate": 5.5749128919860624e-05,
"loss": 0.4256,
"step": 2070
},
{
"epoch": 7.25,
"learning_rate": 5.505226480836237e-05,
"loss": 0.4002,
"step": 2080
},
{
"epoch": 7.28,
"learning_rate": 5.4355400696864114e-05,
"loss": 0.4,
"step": 2090
},
{
"epoch": 7.32,
"learning_rate": 5.365853658536586e-05,
"loss": 0.3814,
"step": 2100
},
{
"epoch": 7.32,
"eval_accuracy": 0.7636586863106201,
"eval_loss": 0.9409201145172119,
"eval_runtime": 291.524,
"eval_samples_per_second": 27.939,
"eval_steps_per_second": 3.495,
"step": 2100
},
{
"epoch": 7.35,
"learning_rate": 5.2961672473867597e-05,
"loss": 0.4116,
"step": 2110
},
{
"epoch": 7.39,
"learning_rate": 5.2264808362369345e-05,
"loss": 0.4111,
"step": 2120
},
{
"epoch": 7.42,
"learning_rate": 5.156794425087108e-05,
"loss": 0.4143,
"step": 2130
},
{
"epoch": 7.46,
"learning_rate": 5.087108013937283e-05,
"loss": 0.3869,
"step": 2140
},
{
"epoch": 7.49,
"learning_rate": 5.017421602787457e-05,
"loss": 0.4337,
"step": 2150
},
{
"epoch": 7.53,
"learning_rate": 4.947735191637631e-05,
"loss": 0.3878,
"step": 2160
},
{
"epoch": 7.56,
"learning_rate": 4.885017421602788e-05,
"loss": 0.4246,
"step": 2170
},
{
"epoch": 7.6,
"learning_rate": 4.815331010452962e-05,
"loss": 0.4499,
"step": 2180
},
{
"epoch": 7.63,
"learning_rate": 4.745644599303136e-05,
"loss": 0.4252,
"step": 2190
},
{
"epoch": 7.67,
"learning_rate": 4.675958188153311e-05,
"loss": 0.397,
"step": 2200
},
{
"epoch": 7.67,
"eval_accuracy": 0.7673419275629221,
"eval_loss": 0.9199063777923584,
"eval_runtime": 293.6426,
"eval_samples_per_second": 27.738,
"eval_steps_per_second": 3.47,
"step": 2200
},
{
"epoch": 7.7,
"learning_rate": 4.606271777003485e-05,
"loss": 0.4187,
"step": 2210
},
{
"epoch": 7.74,
"learning_rate": 4.536585365853659e-05,
"loss": 0.3954,
"step": 2220
},
{
"epoch": 7.77,
"learning_rate": 4.466898954703833e-05,
"loss": 0.3953,
"step": 2230
},
{
"epoch": 7.8,
"learning_rate": 4.397212543554007e-05,
"loss": 0.4162,
"step": 2240
},
{
"epoch": 7.84,
"learning_rate": 4.3275261324041814e-05,
"loss": 0.3989,
"step": 2250
},
{
"epoch": 7.87,
"learning_rate": 4.2578397212543556e-05,
"loss": 0.4468,
"step": 2260
},
{
"epoch": 7.91,
"learning_rate": 4.1881533101045304e-05,
"loss": 0.4146,
"step": 2270
},
{
"epoch": 7.94,
"learning_rate": 4.1184668989547045e-05,
"loss": 0.3822,
"step": 2280
},
{
"epoch": 7.98,
"learning_rate": 4.0487804878048786e-05,
"loss": 0.4059,
"step": 2290
},
{
"epoch": 8.01,
"learning_rate": 3.979094076655052e-05,
"loss": 0.3776,
"step": 2300
},
{
"epoch": 8.01,
"eval_accuracy": 0.7669736034376918,
"eval_loss": 0.9196868538856506,
"eval_runtime": 292.7787,
"eval_samples_per_second": 27.82,
"eval_steps_per_second": 3.48,
"step": 2300
},
{
"epoch": 8.05,
"learning_rate": 3.909407665505226e-05,
"loss": 0.3436,
"step": 2310
},
{
"epoch": 8.08,
"learning_rate": 3.8397212543554004e-05,
"loss": 0.3568,
"step": 2320
},
{
"epoch": 8.12,
"learning_rate": 3.770034843205575e-05,
"loss": 0.3505,
"step": 2330
},
{
"epoch": 8.15,
"learning_rate": 3.700348432055749e-05,
"loss": 0.3652,
"step": 2340
},
{
"epoch": 8.19,
"learning_rate": 3.6306620209059234e-05,
"loss": 0.3567,
"step": 2350
},
{
"epoch": 8.22,
"learning_rate": 3.5609756097560976e-05,
"loss": 0.3902,
"step": 2360
},
{
"epoch": 8.26,
"learning_rate": 3.491289198606272e-05,
"loss": 0.3264,
"step": 2370
},
{
"epoch": 8.29,
"learning_rate": 3.421602787456446e-05,
"loss": 0.3866,
"step": 2380
},
{
"epoch": 8.33,
"learning_rate": 3.35191637630662e-05,
"loss": 0.3316,
"step": 2390
},
{
"epoch": 8.36,
"learning_rate": 3.282229965156795e-05,
"loss": 0.3447,
"step": 2400
},
{
"epoch": 8.36,
"eval_accuracy": 0.7695518723143032,
"eval_loss": 0.9099560976028442,
"eval_runtime": 293.3785,
"eval_samples_per_second": 27.763,
"eval_steps_per_second": 3.473,
"step": 2400
},
{
"epoch": 8.4,
"learning_rate": 3.212543554006969e-05,
"loss": 0.3368,
"step": 2410
},
{
"epoch": 8.43,
"learning_rate": 3.142857142857143e-05,
"loss": 0.3633,
"step": 2420
},
{
"epoch": 8.47,
"learning_rate": 3.073170731707317e-05,
"loss": 0.3758,
"step": 2430
},
{
"epoch": 8.5,
"learning_rate": 3.0034843205574913e-05,
"loss": 0.3261,
"step": 2440
},
{
"epoch": 8.54,
"learning_rate": 2.9337979094076655e-05,
"loss": 0.3272,
"step": 2450
},
{
"epoch": 8.57,
"learning_rate": 2.86411149825784e-05,
"loss": 0.3535,
"step": 2460
},
{
"epoch": 8.61,
"learning_rate": 2.794425087108014e-05,
"loss": 0.3336,
"step": 2470
},
{
"epoch": 8.64,
"learning_rate": 2.7247386759581882e-05,
"loss": 0.3334,
"step": 2480
},
{
"epoch": 8.68,
"learning_rate": 2.6550522648083627e-05,
"loss": 0.336,
"step": 2490
},
{
"epoch": 8.71,
"learning_rate": 2.5853658536585368e-05,
"loss": 0.3473,
"step": 2500
},
{
"epoch": 8.71,
"eval_accuracy": 0.7691835481890731,
"eval_loss": 0.9262986183166504,
"eval_runtime": 292.9844,
"eval_samples_per_second": 27.8,
"eval_steps_per_second": 3.478,
"step": 2500
},
{
"epoch": 8.75,
"learning_rate": 2.515679442508711e-05,
"loss": 0.3335,
"step": 2510
},
{
"epoch": 8.78,
"learning_rate": 2.445993031358885e-05,
"loss": 0.3567,
"step": 2520
},
{
"epoch": 8.82,
"learning_rate": 2.3763066202090596e-05,
"loss": 0.3473,
"step": 2530
},
{
"epoch": 8.85,
"learning_rate": 2.3066202090592334e-05,
"loss": 0.3289,
"step": 2540
},
{
"epoch": 8.89,
"learning_rate": 2.2369337979094075e-05,
"loss": 0.3272,
"step": 2550
},
{
"epoch": 8.92,
"learning_rate": 2.167247386759582e-05,
"loss": 0.3401,
"step": 2560
},
{
"epoch": 8.95,
"learning_rate": 2.097560975609756e-05,
"loss": 0.341,
"step": 2570
},
{
"epoch": 8.99,
"learning_rate": 2.0278745644599302e-05,
"loss": 0.3364,
"step": 2580
},
{
"epoch": 9.02,
"learning_rate": 1.9581881533101047e-05,
"loss": 0.3264,
"step": 2590
},
{
"epoch": 9.06,
"learning_rate": 1.888501742160279e-05,
"loss": 0.3242,
"step": 2600
},
{
"epoch": 9.06,
"eval_accuracy": 0.7756906077348066,
"eval_loss": 0.9101601839065552,
"eval_runtime": 293.3362,
"eval_samples_per_second": 27.767,
"eval_steps_per_second": 3.474,
"step": 2600
},
{
"epoch": 9.09,
"learning_rate": 1.818815331010453e-05,
"loss": 0.3211,
"step": 2610
},
{
"epoch": 9.13,
"learning_rate": 1.749128919860627e-05,
"loss": 0.328,
"step": 2620
},
{
"epoch": 9.16,
"learning_rate": 1.6794425087108016e-05,
"loss": 0.3004,
"step": 2630
},
{
"epoch": 9.2,
"learning_rate": 1.6097560975609757e-05,
"loss": 0.2817,
"step": 2640
},
{
"epoch": 9.23,
"learning_rate": 1.54006968641115e-05,
"loss": 0.2847,
"step": 2650
},
{
"epoch": 9.27,
"learning_rate": 1.4703832752613242e-05,
"loss": 0.2653,
"step": 2660
},
{
"epoch": 9.3,
"learning_rate": 1.4006968641114985e-05,
"loss": 0.3139,
"step": 2670
},
{
"epoch": 9.34,
"learning_rate": 1.3310104529616726e-05,
"loss": 0.3207,
"step": 2680
},
{
"epoch": 9.37,
"learning_rate": 1.2613240418118469e-05,
"loss": 0.3138,
"step": 2690
},
{
"epoch": 9.41,
"learning_rate": 1.191637630662021e-05,
"loss": 0.3132,
"step": 2700
},
{
"epoch": 9.41,
"eval_accuracy": 0.7720073664825046,
"eval_loss": 0.9132338166236877,
"eval_runtime": 293.796,
"eval_samples_per_second": 27.723,
"eval_steps_per_second": 3.468,
"step": 2700
},
{
"epoch": 9.44,
"learning_rate": 1.1219512195121952e-05,
"loss": 0.2844,
"step": 2710
},
{
"epoch": 9.48,
"learning_rate": 1.0522648083623695e-05,
"loss": 0.3257,
"step": 2720
},
{
"epoch": 9.51,
"learning_rate": 9.825783972125436e-06,
"loss": 0.3194,
"step": 2730
},
{
"epoch": 9.55,
"learning_rate": 9.128919860627178e-06,
"loss": 0.3099,
"step": 2740
},
{
"epoch": 9.58,
"learning_rate": 8.43205574912892e-06,
"loss": 0.3149,
"step": 2750
},
{
"epoch": 9.62,
"learning_rate": 7.735191637630662e-06,
"loss": 0.2936,
"step": 2760
},
{
"epoch": 9.65,
"learning_rate": 7.038327526132404e-06,
"loss": 0.3089,
"step": 2770
},
{
"epoch": 9.69,
"learning_rate": 6.341463414634147e-06,
"loss": 0.3239,
"step": 2780
},
{
"epoch": 9.72,
"learning_rate": 5.644599303135889e-06,
"loss": 0.2685,
"step": 2790
},
{
"epoch": 9.76,
"learning_rate": 4.947735191637631e-06,
"loss": 0.3238,
"step": 2800
},
{
"epoch": 9.76,
"eval_accuracy": 0.7755678330263965,
"eval_loss": 0.9060993194580078,
"eval_runtime": 293.0681,
"eval_samples_per_second": 27.792,
"eval_steps_per_second": 3.477,
"step": 2800
}
],
"max_steps": 2870,
"num_train_epochs": 10,
"total_flos": 5.548869192090562e+19,
"trial_name": null,
"trial_params": null
}