PEFT
Safetensors
t3r / trainer_state.json
windgrin's picture
Upload folder using huggingface_hub
a63ad14 verified
Raw
History Blame Contribute Delete
52.4 kB
{
"best_global_step": null,
"best_metric": null,
"best_model_checkpoint": null,
"epoch": 2.1585585585585587,
"eval_steps": 500,
"global_step": 300,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"epoch": 0.007207207207207207,
"grad_norm": 11.684535026550293,
"learning_rate": 0.0,
"loss": 1.9738,
"step": 1
},
{
"epoch": 0.014414414414414415,
"grad_norm": 11.136099815368652,
"learning_rate": 4.7619047619047615e-06,
"loss": 1.8034,
"step": 2
},
{
"epoch": 0.021621621621621623,
"grad_norm": 11.060067176818848,
"learning_rate": 9.523809523809523e-06,
"loss": 1.8687,
"step": 3
},
{
"epoch": 0.02882882882882883,
"grad_norm": 7.806331157684326,
"learning_rate": 1.4285714285714285e-05,
"loss": 1.2328,
"step": 4
},
{
"epoch": 0.036036036036036036,
"grad_norm": 10.489537239074707,
"learning_rate": 1.9047619047619046e-05,
"loss": 1.7451,
"step": 5
},
{
"epoch": 0.043243243243243246,
"grad_norm": 10.609748840332031,
"learning_rate": 2.380952380952381e-05,
"loss": 1.9471,
"step": 6
},
{
"epoch": 0.05045045045045045,
"grad_norm": 7.325054168701172,
"learning_rate": 2.857142857142857e-05,
"loss": 1.4811,
"step": 7
},
{
"epoch": 0.05765765765765766,
"grad_norm": 6.63484001159668,
"learning_rate": 3.3333333333333335e-05,
"loss": 1.7721,
"step": 8
},
{
"epoch": 0.06486486486486487,
"grad_norm": 5.522454261779785,
"learning_rate": 3.809523809523809e-05,
"loss": 1.3708,
"step": 9
},
{
"epoch": 0.07207207207207207,
"grad_norm": 5.074100971221924,
"learning_rate": 4.2857142857142856e-05,
"loss": 1.2314,
"step": 10
},
{
"epoch": 0.07927927927927927,
"grad_norm": 5.2653727531433105,
"learning_rate": 4.761904761904762e-05,
"loss": 1.3018,
"step": 11
},
{
"epoch": 0.08648648648648649,
"grad_norm": 6.736268520355225,
"learning_rate": 5.2380952380952384e-05,
"loss": 1.3999,
"step": 12
},
{
"epoch": 0.0936936936936937,
"grad_norm": 5.054599761962891,
"learning_rate": 5.714285714285714e-05,
"loss": 1.2591,
"step": 13
},
{
"epoch": 0.1009009009009009,
"grad_norm": 8.724349975585938,
"learning_rate": 6.19047619047619e-05,
"loss": 1.2616,
"step": 14
},
{
"epoch": 0.10810810810810811,
"grad_norm": 4.677655220031738,
"learning_rate": 6.666666666666667e-05,
"loss": 1.2418,
"step": 15
},
{
"epoch": 0.11531531531531532,
"grad_norm": 5.682474613189697,
"learning_rate": 7.142857142857143e-05,
"loss": 1.1806,
"step": 16
},
{
"epoch": 0.12252252252252252,
"grad_norm": 5.526418209075928,
"learning_rate": 7.619047619047618e-05,
"loss": 1.2929,
"step": 17
},
{
"epoch": 0.12972972972972974,
"grad_norm": 6.196779727935791,
"learning_rate": 8.095238095238096e-05,
"loss": 1.1647,
"step": 18
},
{
"epoch": 0.13693693693693693,
"grad_norm": 5.527401924133301,
"learning_rate": 8.571428571428571e-05,
"loss": 1.2824,
"step": 19
},
{
"epoch": 0.14414414414414414,
"grad_norm": 5.004215717315674,
"learning_rate": 9.047619047619048e-05,
"loss": 1.2304,
"step": 20
},
{
"epoch": 0.15135135135135136,
"grad_norm": 4.4609375,
"learning_rate": 9.523809523809524e-05,
"loss": 0.9803,
"step": 21
},
{
"epoch": 0.15855855855855855,
"grad_norm": 3.6623268127441406,
"learning_rate": 0.0001,
"loss": 0.9208,
"step": 22
},
{
"epoch": 0.16576576576576577,
"grad_norm": 3.9360475540161133,
"learning_rate": 0.00010476190476190477,
"loss": 1.0879,
"step": 23
},
{
"epoch": 0.17297297297297298,
"grad_norm": 4.082197666168213,
"learning_rate": 0.00010952380952380953,
"loss": 0.898,
"step": 24
},
{
"epoch": 0.18018018018018017,
"grad_norm": 3.7158267498016357,
"learning_rate": 0.00011428571428571428,
"loss": 1.0313,
"step": 25
},
{
"epoch": 0.1873873873873874,
"grad_norm": 3.3059310913085938,
"learning_rate": 0.00011904761904761905,
"loss": 0.8641,
"step": 26
},
{
"epoch": 0.1945945945945946,
"grad_norm": 4.730854034423828,
"learning_rate": 0.0001238095238095238,
"loss": 0.9493,
"step": 27
},
{
"epoch": 0.2018018018018018,
"grad_norm": 3.885230541229248,
"learning_rate": 0.00012857142857142858,
"loss": 0.9264,
"step": 28
},
{
"epoch": 0.209009009009009,
"grad_norm": 3.9439027309417725,
"learning_rate": 0.00013333333333333334,
"loss": 1.2871,
"step": 29
},
{
"epoch": 0.21621621621621623,
"grad_norm": 3.5822014808654785,
"learning_rate": 0.0001380952380952381,
"loss": 1.2572,
"step": 30
},
{
"epoch": 0.22342342342342342,
"grad_norm": 3.486072540283203,
"learning_rate": 0.00014285714285714287,
"loss": 0.9093,
"step": 31
},
{
"epoch": 0.23063063063063063,
"grad_norm": 3.3355259895324707,
"learning_rate": 0.00014761904761904763,
"loss": 1.0274,
"step": 32
},
{
"epoch": 0.23783783783783785,
"grad_norm": 3.612154722213745,
"learning_rate": 0.00015238095238095237,
"loss": 1.0658,
"step": 33
},
{
"epoch": 0.24504504504504504,
"grad_norm": 3.29073429107666,
"learning_rate": 0.00015714285714285716,
"loss": 1.0701,
"step": 34
},
{
"epoch": 0.25225225225225223,
"grad_norm": 3.8151745796203613,
"learning_rate": 0.00016190476190476192,
"loss": 1.1347,
"step": 35
},
{
"epoch": 0.2594594594594595,
"grad_norm": 4.158012390136719,
"learning_rate": 0.0001666666666666667,
"loss": 1.0801,
"step": 36
},
{
"epoch": 0.26666666666666666,
"grad_norm": 4.130226135253906,
"learning_rate": 0.00017142857142857143,
"loss": 1.0072,
"step": 37
},
{
"epoch": 0.27387387387387385,
"grad_norm": 3.8441193103790283,
"learning_rate": 0.0001761904761904762,
"loss": 1.1024,
"step": 38
},
{
"epoch": 0.2810810810810811,
"grad_norm": 3.5585989952087402,
"learning_rate": 0.00018095238095238095,
"loss": 0.9666,
"step": 39
},
{
"epoch": 0.2882882882882883,
"grad_norm": 3.3715403079986572,
"learning_rate": 0.00018571428571428572,
"loss": 0.9336,
"step": 40
},
{
"epoch": 0.2954954954954955,
"grad_norm": 3.3742058277130127,
"learning_rate": 0.00019047619047619048,
"loss": 0.8506,
"step": 41
},
{
"epoch": 0.3027027027027027,
"grad_norm": 7.884325981140137,
"learning_rate": 0.00019523809523809525,
"loss": 0.827,
"step": 42
},
{
"epoch": 0.3099099099099099,
"grad_norm": 3.457500696182251,
"learning_rate": 0.0002,
"loss": 1.0578,
"step": 43
},
{
"epoch": 0.3171171171171171,
"grad_norm": 4.896909713745117,
"learning_rate": 0.000199996434000411,
"loss": 0.9905,
"step": 44
},
{
"epoch": 0.32432432432432434,
"grad_norm": 4.666468143463135,
"learning_rate": 0.000199985736255971,
"loss": 0.935,
"step": 45
},
{
"epoch": 0.33153153153153153,
"grad_norm": 3.2455365657806396,
"learning_rate": 0.00019996790752964305,
"loss": 0.8739,
"step": 46
},
{
"epoch": 0.3387387387387387,
"grad_norm": 4.211050033569336,
"learning_rate": 0.0001999429490929718,
"loss": 0.9597,
"step": 47
},
{
"epoch": 0.34594594594594597,
"grad_norm": 3.6991987228393555,
"learning_rate": 0.00019991086272599273,
"loss": 1.2004,
"step": 48
},
{
"epoch": 0.35315315315315315,
"grad_norm": 3.0730082988739014,
"learning_rate": 0.00019987165071710527,
"loss": 0.9823,
"step": 49
},
{
"epoch": 0.36036036036036034,
"grad_norm": 4.365278720855713,
"learning_rate": 0.00019982531586290958,
"loss": 1.0471,
"step": 50
},
{
"epoch": 0.3675675675675676,
"grad_norm": 3.7972359657287598,
"learning_rate": 0.00019977186146800707,
"loss": 0.9361,
"step": 51
},
{
"epoch": 0.3747747747747748,
"grad_norm": 2.764312982559204,
"learning_rate": 0.00019971129134476473,
"loss": 0.7888,
"step": 52
},
{
"epoch": 0.38198198198198197,
"grad_norm": 3.2575714588165283,
"learning_rate": 0.0001996436098130433,
"loss": 1.1607,
"step": 53
},
{
"epoch": 0.3891891891891892,
"grad_norm": 2.767519235610962,
"learning_rate": 0.00019956882169988905,
"loss": 1.0077,
"step": 54
},
{
"epoch": 0.3963963963963964,
"grad_norm": 3.0031251907348633,
"learning_rate": 0.00019948693233918952,
"loss": 0.9016,
"step": 55
},
{
"epoch": 0.4036036036036036,
"grad_norm": 5.109826564788818,
"learning_rate": 0.00019939794757129332,
"loss": 1.2846,
"step": 56
},
{
"epoch": 0.41081081081081083,
"grad_norm": 3.3529696464538574,
"learning_rate": 0.00019930187374259337,
"loss": 0.8013,
"step": 57
},
{
"epoch": 0.418018018018018,
"grad_norm": 2.8710315227508545,
"learning_rate": 0.0001991987177050743,
"loss": 1.0549,
"step": 58
},
{
"epoch": 0.4252252252252252,
"grad_norm": 4.7763848304748535,
"learning_rate": 0.00019908848681582391,
"loss": 0.9911,
"step": 59
},
{
"epoch": 0.43243243243243246,
"grad_norm": 5.199997425079346,
"learning_rate": 0.00019897118893650825,
"loss": 1.3337,
"step": 60
},
{
"epoch": 0.43963963963963965,
"grad_norm": 3.5701940059661865,
"learning_rate": 0.00019884683243281116,
"loss": 1.0998,
"step": 61
},
{
"epoch": 0.44684684684684683,
"grad_norm": 3.537388324737549,
"learning_rate": 0.00019871542617383743,
"loss": 0.8564,
"step": 62
},
{
"epoch": 0.4540540540540541,
"grad_norm": 5.325186729431152,
"learning_rate": 0.00019857697953148037,
"loss": 1.1864,
"step": 63
},
{
"epoch": 0.46126126126126127,
"grad_norm": 2.8981680870056152,
"learning_rate": 0.00019843150237975344,
"loss": 0.8237,
"step": 64
},
{
"epoch": 0.46846846846846846,
"grad_norm": 2.997547149658203,
"learning_rate": 0.00019827900509408581,
"loss": 0.901,
"step": 65
},
{
"epoch": 0.4756756756756757,
"grad_norm": 3.446580410003662,
"learning_rate": 0.0001981194985505827,
"loss": 1.0586,
"step": 66
},
{
"epoch": 0.4828828828828829,
"grad_norm": 3.1360299587249756,
"learning_rate": 0.00019795299412524945,
"loss": 1.0281,
"step": 67
},
{
"epoch": 0.4900900900900901,
"grad_norm": 3.573737859725952,
"learning_rate": 0.00019777950369318035,
"loss": 1.0386,
"step": 68
},
{
"epoch": 0.4972972972972973,
"grad_norm": 2.641695499420166,
"learning_rate": 0.00019759903962771156,
"loss": 0.786,
"step": 69
},
{
"epoch": 0.5045045045045045,
"grad_norm": 3.949854612350464,
"learning_rate": 0.0001974116147995387,
"loss": 1.0804,
"step": 70
},
{
"epoch": 0.5117117117117117,
"grad_norm": 3.0651161670684814,
"learning_rate": 0.00019721724257579907,
"loss": 0.874,
"step": 71
},
{
"epoch": 0.518918918918919,
"grad_norm": 3.4615607261657715,
"learning_rate": 0.000197015936819118,
"loss": 0.929,
"step": 72
},
{
"epoch": 0.5261261261261261,
"grad_norm": 2.989096164703369,
"learning_rate": 0.00019680771188662044,
"loss": 1.1453,
"step": 73
},
{
"epoch": 0.5333333333333333,
"grad_norm": 3.3436026573181152,
"learning_rate": 0.00019659258262890683,
"loss": 1.1162,
"step": 74
},
{
"epoch": 0.5405405405405406,
"grad_norm": 4.048951148986816,
"learning_rate": 0.0001963705643889941,
"loss": 1.0755,
"step": 75
},
{
"epoch": 0.5477477477477477,
"grad_norm": 3.2565155029296875,
"learning_rate": 0.00019614167300122126,
"loss": 1.1184,
"step": 76
},
{
"epoch": 0.554954954954955,
"grad_norm": 2.9959020614624023,
"learning_rate": 0.00019590592479012023,
"loss": 0.9782,
"step": 77
},
{
"epoch": 0.5621621621621622,
"grad_norm": 3.099621534347534,
"learning_rate": 0.00019566333656925147,
"loss": 1.0039,
"step": 78
},
{
"epoch": 0.5693693693693693,
"grad_norm": 2.6794540882110596,
"learning_rate": 0.00019541392564000488,
"loss": 0.6505,
"step": 79
},
{
"epoch": 0.5765765765765766,
"grad_norm": 3.1174347400665283,
"learning_rate": 0.00019515770979036594,
"loss": 1.0842,
"step": 80
},
{
"epoch": 0.5837837837837838,
"grad_norm": 2.441861391067505,
"learning_rate": 0.00019489470729364692,
"loss": 0.9361,
"step": 81
},
{
"epoch": 0.590990990990991,
"grad_norm": 2.635843515396118,
"learning_rate": 0.0001946249369071837,
"loss": 1.0426,
"step": 82
},
{
"epoch": 0.5981981981981982,
"grad_norm": 2.612903594970703,
"learning_rate": 0.00019434841787099803,
"loss": 0.7473,
"step": 83
},
{
"epoch": 0.6054054054054054,
"grad_norm": 3.215303421020508,
"learning_rate": 0.00019406516990642532,
"loss": 0.8283,
"step": 84
},
{
"epoch": 0.6126126126126126,
"grad_norm": 2.905101776123047,
"learning_rate": 0.00019377521321470805,
"loss": 0.9883,
"step": 85
},
{
"epoch": 0.6198198198198198,
"grad_norm": 2.8337690830230713,
"learning_rate": 0.00019347856847555512,
"loss": 0.881,
"step": 86
},
{
"epoch": 0.6270270270270271,
"grad_norm": 3.142810106277466,
"learning_rate": 0.00019317525684566685,
"loss": 0.9619,
"step": 87
},
{
"epoch": 0.6342342342342342,
"grad_norm": 2.890902519226074,
"learning_rate": 0.00019286529995722623,
"loss": 0.9102,
"step": 88
},
{
"epoch": 0.6414414414414414,
"grad_norm": 3.039911985397339,
"learning_rate": 0.00019254871991635598,
"loss": 0.965,
"step": 89
},
{
"epoch": 0.6486486486486487,
"grad_norm": 4.075260162353516,
"learning_rate": 0.00019222553930154198,
"loss": 1.1541,
"step": 90
},
{
"epoch": 0.6558558558558558,
"grad_norm": 3.2090113162994385,
"learning_rate": 0.00019189578116202307,
"loss": 1.2582,
"step": 91
},
{
"epoch": 0.6630630630630631,
"grad_norm": 2.8671350479125977,
"learning_rate": 0.00019155946901614702,
"loss": 0.6915,
"step": 92
},
{
"epoch": 0.6702702702702703,
"grad_norm": 3.6259381771087646,
"learning_rate": 0.00019121662684969335,
"loss": 0.8306,
"step": 93
},
{
"epoch": 0.6774774774774774,
"grad_norm": 3.5522236824035645,
"learning_rate": 0.0001908672791141625,
"loss": 1.0978,
"step": 94
},
{
"epoch": 0.6846846846846847,
"grad_norm": 3.524630546569824,
"learning_rate": 0.00019051145072503215,
"loss": 0.9786,
"step": 95
},
{
"epoch": 0.6918918918918919,
"grad_norm": 3.0533735752105713,
"learning_rate": 0.00019014916705998002,
"loss": 0.9278,
"step": 96
},
{
"epoch": 0.6990990990990991,
"grad_norm": 3.5166573524475098,
"learning_rate": 0.00018978045395707418,
"loss": 0.9571,
"step": 97
},
{
"epoch": 0.7063063063063063,
"grad_norm": 2.7091610431671143,
"learning_rate": 0.00018940533771293007,
"loss": 0.8795,
"step": 98
},
{
"epoch": 0.7135135135135136,
"grad_norm": 3.2437844276428223,
"learning_rate": 0.00018902384508083517,
"loss": 0.8935,
"step": 99
},
{
"epoch": 0.7207207207207207,
"grad_norm": 2.761455774307251,
"learning_rate": 0.00018863600326884082,
"loss": 0.8749,
"step": 100
},
{
"epoch": 0.7279279279279279,
"grad_norm": 2.5887527465820312,
"learning_rate": 0.00018824183993782192,
"loss": 0.7539,
"step": 101
},
{
"epoch": 0.7351351351351352,
"grad_norm": 3.1463191509246826,
"learning_rate": 0.00018784138319950398,
"loss": 0.8477,
"step": 102
},
{
"epoch": 0.7423423423423423,
"grad_norm": 3.196107864379883,
"learning_rate": 0.00018743466161445823,
"loss": 0.99,
"step": 103
},
{
"epoch": 0.7495495495495496,
"grad_norm": 3.304748773574829,
"learning_rate": 0.00018702170419006482,
"loss": 1.1633,
"step": 104
},
{
"epoch": 0.7567567567567568,
"grad_norm": 4.191944122314453,
"learning_rate": 0.00018660254037844388,
"loss": 1.0025,
"step": 105
},
{
"epoch": 0.7639639639639639,
"grad_norm": 2.500408411026001,
"learning_rate": 0.00018617720007435497,
"loss": 0.7228,
"step": 106
},
{
"epoch": 0.7711711711711712,
"grad_norm": 3.017630100250244,
"learning_rate": 0.0001857457136130651,
"loss": 0.84,
"step": 107
},
{
"epoch": 0.7783783783783784,
"grad_norm": 3.539093017578125,
"learning_rate": 0.00018530811176818514,
"loss": 0.9757,
"step": 108
},
{
"epoch": 0.7855855855855856,
"grad_norm": 3.014693260192871,
"learning_rate": 0.00018486442574947511,
"loss": 1.0803,
"step": 109
},
{
"epoch": 0.7927927927927928,
"grad_norm": 3.0560622215270996,
"learning_rate": 0.00018441468720061815,
"loss": 0.975,
"step": 110
},
{
"epoch": 0.8,
"grad_norm": 2.454893112182617,
"learning_rate": 0.00018395892819696389,
"loss": 0.8205,
"step": 111
},
{
"epoch": 0.8072072072072072,
"grad_norm": 2.9785032272338867,
"learning_rate": 0.00018349718124324076,
"loss": 0.9708,
"step": 112
},
{
"epoch": 0.8144144144144144,
"grad_norm": 3.3276872634887695,
"learning_rate": 0.00018302947927123766,
"loss": 0.9441,
"step": 113
},
{
"epoch": 0.8216216216216217,
"grad_norm": 2.9160008430480957,
"learning_rate": 0.00018255585563745538,
"loss": 1.1011,
"step": 114
},
{
"epoch": 0.8288288288288288,
"grad_norm": 2.756060838699341,
"learning_rate": 0.00018207634412072764,
"loss": 0.8479,
"step": 115
},
{
"epoch": 0.836036036036036,
"grad_norm": 2.8569912910461426,
"learning_rate": 0.00018159097891981186,
"loss": 0.923,
"step": 116
},
{
"epoch": 0.8432432432432433,
"grad_norm": 2.985607624053955,
"learning_rate": 0.00018109979465095013,
"loss": 1.0308,
"step": 117
},
{
"epoch": 0.8504504504504504,
"grad_norm": 2.8948869705200195,
"learning_rate": 0.00018060282634540053,
"loss": 0.8382,
"step": 118
},
{
"epoch": 0.8576576576576577,
"grad_norm": 2.6343963146209717,
"learning_rate": 0.00018010010944693848,
"loss": 0.7894,
"step": 119
},
{
"epoch": 0.8648648648648649,
"grad_norm": 3.4868533611297607,
"learning_rate": 0.00017959167980932908,
"loss": 0.844,
"step": 120
},
{
"epoch": 0.872072072072072,
"grad_norm": 2.749204158782959,
"learning_rate": 0.00017907757369376985,
"loss": 1.0067,
"step": 121
},
{
"epoch": 0.8792792792792793,
"grad_norm": 2.7613115310668945,
"learning_rate": 0.00017855782776630483,
"loss": 0.9647,
"step": 122
},
{
"epoch": 0.8864864864864865,
"grad_norm": 3.023930072784424,
"learning_rate": 0.0001780324790952092,
"loss": 1.0151,
"step": 123
},
{
"epoch": 0.8936936936936937,
"grad_norm": 2.894148349761963,
"learning_rate": 0.0001775015651483459,
"loss": 0.7528,
"step": 124
},
{
"epoch": 0.9009009009009009,
"grad_norm": 2.740029811859131,
"learning_rate": 0.00017696512379049325,
"loss": 0.7695,
"step": 125
},
{
"epoch": 0.9081081081081082,
"grad_norm": 3.4892916679382324,
"learning_rate": 0.00017642319328064446,
"loss": 1.1829,
"step": 126
},
{
"epoch": 0.9153153153153153,
"grad_norm": 3.0546014308929443,
"learning_rate": 0.0001758758122692791,
"loss": 0.8454,
"step": 127
},
{
"epoch": 0.9225225225225225,
"grad_norm": 3.2734737396240234,
"learning_rate": 0.00017532301979560636,
"loss": 0.7378,
"step": 128
},
{
"epoch": 0.9297297297297298,
"grad_norm": 3.5465164184570312,
"learning_rate": 0.00017476485528478093,
"loss": 1.0544,
"step": 129
},
{
"epoch": 0.9369369369369369,
"grad_norm": 2.907961130142212,
"learning_rate": 0.0001742013585450911,
"loss": 0.8242,
"step": 130
},
{
"epoch": 0.9441441441441442,
"grad_norm": 3.7469565868377686,
"learning_rate": 0.00017363256976511972,
"loss": 1.0882,
"step": 131
},
{
"epoch": 0.9513513513513514,
"grad_norm": 2.788562774658203,
"learning_rate": 0.00017305852951087798,
"loss": 0.6901,
"step": 132
},
{
"epoch": 0.9585585585585585,
"grad_norm": 3.597954511642456,
"learning_rate": 0.000172479278722912,
"loss": 1.0036,
"step": 133
},
{
"epoch": 0.9657657657657658,
"grad_norm": 2.6259546279907227,
"learning_rate": 0.0001718948587133833,
"loss": 0.775,
"step": 134
},
{
"epoch": 0.972972972972973,
"grad_norm": 2.546386480331421,
"learning_rate": 0.00017130531116312203,
"loss": 1.1544,
"step": 135
},
{
"epoch": 0.9801801801801802,
"grad_norm": 3.005147695541382,
"learning_rate": 0.00017071067811865476,
"loss": 0.9333,
"step": 136
},
{
"epoch": 0.9873873873873874,
"grad_norm": 3.014779806137085,
"learning_rate": 0.0001701110019892053,
"loss": 0.9593,
"step": 137
},
{
"epoch": 0.9945945945945946,
"grad_norm": 3.0027060508728027,
"learning_rate": 0.00016950632554367019,
"loss": 0.8674,
"step": 138
},
{
"epoch": 1.0,
"grad_norm": 3.3540961742401123,
"learning_rate": 0.00016889669190756868,
"loss": 1.0522,
"step": 139
},
{
"epoch": 1.0072072072072071,
"grad_norm": 2.276853561401367,
"learning_rate": 0.00016828214455996658,
"loss": 0.6489,
"step": 140
},
{
"epoch": 1.0144144144144145,
"grad_norm": 2.078212022781372,
"learning_rate": 0.00016766272733037576,
"loss": 0.5525,
"step": 141
},
{
"epoch": 1.0216216216216216,
"grad_norm": 2.5213096141815186,
"learning_rate": 0.00016703848439562785,
"loss": 0.5721,
"step": 142
},
{
"epoch": 1.0288288288288288,
"grad_norm": 2.609396457672119,
"learning_rate": 0.00016640946027672392,
"loss": 0.5182,
"step": 143
},
{
"epoch": 1.0360360360360361,
"grad_norm": 3.169931411743164,
"learning_rate": 0.0001657756998356589,
"loss": 0.66,
"step": 144
},
{
"epoch": 1.0432432432432432,
"grad_norm": 3.4300990104675293,
"learning_rate": 0.00016513724827222227,
"loss": 0.7957,
"step": 145
},
{
"epoch": 1.0504504504504504,
"grad_norm": 3.529196262359619,
"learning_rate": 0.0001644941511207742,
"loss": 0.6789,
"step": 146
},
{
"epoch": 1.0576576576576577,
"grad_norm": 3.195830821990967,
"learning_rate": 0.00016384645424699835,
"loss": 0.6448,
"step": 147
},
{
"epoch": 1.0648648648648649,
"grad_norm": 3.7281556129455566,
"learning_rate": 0.0001631942038446304,
"loss": 0.7441,
"step": 148
},
{
"epoch": 1.072072072072072,
"grad_norm": 3.6758270263671875,
"learning_rate": 0.00016253744643216368,
"loss": 0.6576,
"step": 149
},
{
"epoch": 1.0792792792792794,
"grad_norm": 2.8492960929870605,
"learning_rate": 0.00016187622884953145,
"loss": 0.5277,
"step": 150
},
{
"epoch": 1.0864864864864865,
"grad_norm": 4.0120439529418945,
"learning_rate": 0.0001612105982547663,
"loss": 0.7105,
"step": 151
},
{
"epoch": 1.0936936936936936,
"grad_norm": 3.6597225666046143,
"learning_rate": 0.00016054060212063672,
"loss": 0.6119,
"step": 152
},
{
"epoch": 1.100900900900901,
"grad_norm": 3.324005365371704,
"learning_rate": 0.0001598662882312615,
"loss": 0.5402,
"step": 153
},
{
"epoch": 1.1081081081081081,
"grad_norm": 3.6454312801361084,
"learning_rate": 0.0001591877046787017,
"loss": 0.5997,
"step": 154
},
{
"epoch": 1.1153153153153152,
"grad_norm": 3.3868091106414795,
"learning_rate": 0.00015850489985953076,
"loss": 0.6123,
"step": 155
},
{
"epoch": 1.1225225225225226,
"grad_norm": 4.359033584594727,
"learning_rate": 0.0001578179224713827,
"loss": 0.8261,
"step": 156
},
{
"epoch": 1.1297297297297297,
"grad_norm": 3.414869785308838,
"learning_rate": 0.00015712682150947923,
"loss": 0.6084,
"step": 157
},
{
"epoch": 1.1369369369369369,
"grad_norm": 3.363609552383423,
"learning_rate": 0.00015643164626313527,
"loss": 0.4678,
"step": 158
},
{
"epoch": 1.1441441441441442,
"grad_norm": 3.4990248680114746,
"learning_rate": 0.00015573244631224365,
"loss": 0.5549,
"step": 159
},
{
"epoch": 1.1513513513513514,
"grad_norm": 3.346892833709717,
"learning_rate": 0.00015502927152373914,
"loss": 0.5847,
"step": 160
},
{
"epoch": 1.1585585585585585,
"grad_norm": 3.1101760864257812,
"learning_rate": 0.0001543221720480419,
"loss": 0.4695,
"step": 161
},
{
"epoch": 1.1657657657657658,
"grad_norm": 3.5808727741241455,
"learning_rate": 0.00015361119831548069,
"loss": 0.6057,
"step": 162
},
{
"epoch": 1.172972972972973,
"grad_norm": 2.9661688804626465,
"learning_rate": 0.00015289640103269625,
"loss": 0.4864,
"step": 163
},
{
"epoch": 1.1801801801801801,
"grad_norm": 3.4772303104400635,
"learning_rate": 0.00015217783117902497,
"loss": 0.5846,
"step": 164
},
{
"epoch": 1.1873873873873875,
"grad_norm": 4.1343841552734375,
"learning_rate": 0.0001514555400028629,
"loss": 0.5762,
"step": 165
},
{
"epoch": 1.1945945945945946,
"grad_norm": 4.29697847366333,
"learning_rate": 0.00015072957901801076,
"loss": 0.6847,
"step": 166
},
{
"epoch": 1.2018018018018017,
"grad_norm": 3.9759178161621094,
"learning_rate": 0.00015000000000000001,
"loss": 0.5391,
"step": 167
},
{
"epoch": 1.209009009009009,
"grad_norm": 3.587759017944336,
"learning_rate": 0.00014926685498240028,
"loss": 0.7039,
"step": 168
},
{
"epoch": 1.2162162162162162,
"grad_norm": 3.6181018352508545,
"learning_rate": 0.00014853019625310813,
"loss": 0.4963,
"step": 169
},
{
"epoch": 1.2234234234234234,
"grad_norm": 3.5132596492767334,
"learning_rate": 0.0001477900763506181,
"loss": 0.5419,
"step": 170
},
{
"epoch": 1.2306306306306307,
"grad_norm": 4.010970115661621,
"learning_rate": 0.0001470465480602756,
"loss": 0.6267,
"step": 171
},
{
"epoch": 1.2378378378378379,
"grad_norm": 3.2222988605499268,
"learning_rate": 0.00014629966441051208,
"loss": 0.4639,
"step": 172
},
{
"epoch": 1.245045045045045,
"grad_norm": 2.956730604171753,
"learning_rate": 0.0001455494786690634,
"loss": 0.4572,
"step": 173
},
{
"epoch": 1.2522522522522523,
"grad_norm": 3.9305412769317627,
"learning_rate": 0.00014479604433917045,
"loss": 0.635,
"step": 174
},
{
"epoch": 1.2594594594594595,
"grad_norm": 4.476108074188232,
"learning_rate": 0.00014403941515576344,
"loss": 0.7155,
"step": 175
},
{
"epoch": 1.2666666666666666,
"grad_norm": 3.3448009490966797,
"learning_rate": 0.0001432796450816295,
"loss": 0.5718,
"step": 176
},
{
"epoch": 1.2738738738738737,
"grad_norm": 3.6916096210479736,
"learning_rate": 0.00014251678830356408,
"loss": 0.5516,
"step": 177
},
{
"epoch": 1.281081081081081,
"grad_norm": 4.04361629486084,
"learning_rate": 0.00014175089922850633,
"loss": 0.6114,
"step": 178
},
{
"epoch": 1.2882882882882882,
"grad_norm": 3.9775683879852295,
"learning_rate": 0.00014098203247965875,
"loss": 0.6083,
"step": 179
},
{
"epoch": 1.2954954954954956,
"grad_norm": 3.9424428939819336,
"learning_rate": 0.00014021024289259158,
"loss": 0.5872,
"step": 180
},
{
"epoch": 1.3027027027027027,
"grad_norm": 3.335747003555298,
"learning_rate": 0.00013943558551133186,
"loss": 0.6535,
"step": 181
},
{
"epoch": 1.3099099099099099,
"grad_norm": 4.008434295654297,
"learning_rate": 0.0001386581155844376,
"loss": 0.5727,
"step": 182
},
{
"epoch": 1.317117117117117,
"grad_norm": 3.780360698699951,
"learning_rate": 0.0001378778885610576,
"loss": 0.5755,
"step": 183
},
{
"epoch": 1.3243243243243243,
"grad_norm": 3.519291400909424,
"learning_rate": 0.0001370949600869768,
"loss": 0.6356,
"step": 184
},
{
"epoch": 1.3315315315315315,
"grad_norm": 3.550152540206909,
"learning_rate": 0.00013630938600064747,
"loss": 0.493,
"step": 185
},
{
"epoch": 1.3387387387387388,
"grad_norm": 3.578202247619629,
"learning_rate": 0.00013552122232920707,
"loss": 0.4639,
"step": 186
},
{
"epoch": 1.345945945945946,
"grad_norm": 3.857863187789917,
"learning_rate": 0.00013473052528448201,
"loss": 0.4861,
"step": 187
},
{
"epoch": 1.353153153153153,
"grad_norm": 3.5476558208465576,
"learning_rate": 0.00013393735125897925,
"loss": 0.4221,
"step": 188
},
{
"epoch": 1.3603603603603602,
"grad_norm": 4.612096786499023,
"learning_rate": 0.0001331417568218636,
"loss": 0.6924,
"step": 189
},
{
"epoch": 1.3675675675675676,
"grad_norm": 3.7291951179504395,
"learning_rate": 0.0001323437987149238,
"loss": 0.5414,
"step": 190
},
{
"epoch": 1.3747747747747747,
"grad_norm": 3.549318790435791,
"learning_rate": 0.00013154353384852558,
"loss": 0.5876,
"step": 191
},
{
"epoch": 1.381981981981982,
"grad_norm": 3.562321424484253,
"learning_rate": 0.00013074101929755252,
"loss": 0.5237,
"step": 192
},
{
"epoch": 1.3891891891891892,
"grad_norm": 3.622387409210205,
"learning_rate": 0.00012993631229733582,
"loss": 0.5796,
"step": 193
},
{
"epoch": 1.3963963963963963,
"grad_norm": 4.345496654510498,
"learning_rate": 0.00012912947023957212,
"loss": 0.5582,
"step": 194
},
{
"epoch": 1.4036036036036035,
"grad_norm": 3.7925331592559814,
"learning_rate": 0.00012832055066823038,
"loss": 0.4847,
"step": 195
},
{
"epoch": 1.4108108108108108,
"grad_norm": 3.877462148666382,
"learning_rate": 0.0001275096112754478,
"loss": 0.6631,
"step": 196
},
{
"epoch": 1.418018018018018,
"grad_norm": 3.4748427867889404,
"learning_rate": 0.00012669670989741517,
"loss": 0.4883,
"step": 197
},
{
"epoch": 1.4252252252252253,
"grad_norm": 5.154613494873047,
"learning_rate": 0.00012588190451025207,
"loss": 0.7408,
"step": 198
},
{
"epoch": 1.4324324324324325,
"grad_norm": 4.5702009201049805,
"learning_rate": 0.00012506525322587207,
"loss": 0.6509,
"step": 199
},
{
"epoch": 1.4396396396396396,
"grad_norm": 4.41005802154541,
"learning_rate": 0.000124246814287838,
"loss": 0.6209,
"step": 200
},
{
"epoch": 1.4468468468468467,
"grad_norm": 3.8622541427612305,
"learning_rate": 0.00012342664606720822,
"loss": 0.4897,
"step": 201
},
{
"epoch": 1.454054054054054,
"grad_norm": 3.2512149810791016,
"learning_rate": 0.0001226048070583735,
"loss": 0.4093,
"step": 202
},
{
"epoch": 1.4612612612612612,
"grad_norm": 4.367804527282715,
"learning_rate": 0.00012178135587488515,
"loss": 0.7187,
"step": 203
},
{
"epoch": 1.4684684684684686,
"grad_norm": 4.4729695320129395,
"learning_rate": 0.00012095635124527486,
"loss": 0.6875,
"step": 204
},
{
"epoch": 1.4756756756756757,
"grad_norm": 3.868335723876953,
"learning_rate": 0.00012012985200886602,
"loss": 0.4708,
"step": 205
},
{
"epoch": 1.4828828828828828,
"grad_norm": 4.509119987487793,
"learning_rate": 0.00011930191711157737,
"loss": 0.6751,
"step": 206
},
{
"epoch": 1.49009009009009,
"grad_norm": 4.019607067108154,
"learning_rate": 0.00011847260560171896,
"loss": 0.5807,
"step": 207
},
{
"epoch": 1.4972972972972973,
"grad_norm": 4.538064479827881,
"learning_rate": 0.00011764197662578086,
"loss": 0.5487,
"step": 208
},
{
"epoch": 1.5045045045045045,
"grad_norm": 3.9388089179992676,
"learning_rate": 0.00011681008942421483,
"loss": 0.6733,
"step": 209
},
{
"epoch": 1.5117117117117118,
"grad_norm": 3.6662909984588623,
"learning_rate": 0.00011597700332720923,
"loss": 0.6427,
"step": 210
},
{
"epoch": 1.518918918918919,
"grad_norm": 4.474135875701904,
"learning_rate": 0.00011514277775045768,
"loss": 0.461,
"step": 211
},
{
"epoch": 1.526126126126126,
"grad_norm": 4.503089904785156,
"learning_rate": 0.00011430747219092142,
"loss": 0.6343,
"step": 212
},
{
"epoch": 1.5333333333333332,
"grad_norm": 3.5401525497436523,
"learning_rate": 0.00011347114622258612,
"loss": 0.4952,
"step": 213
},
{
"epoch": 1.5405405405405406,
"grad_norm": 3.793971300125122,
"learning_rate": 0.00011263385949221295,
"loss": 0.5508,
"step": 214
},
{
"epoch": 1.5477477477477477,
"grad_norm": 4.067086219787598,
"learning_rate": 0.00011179567171508463,
"loss": 0.6104,
"step": 215
},
{
"epoch": 1.554954954954955,
"grad_norm": 3.9283523559570312,
"learning_rate": 0.00011095664267074655,
"loss": 0.4628,
"step": 216
},
{
"epoch": 1.5621621621621622,
"grad_norm": 4.976551532745361,
"learning_rate": 0.00011011683219874323,
"loss": 0.876,
"step": 217
},
{
"epoch": 1.5693693693693693,
"grad_norm": 4.267294406890869,
"learning_rate": 0.00010927630019435066,
"loss": 0.4994,
"step": 218
},
{
"epoch": 1.5765765765765765,
"grad_norm": 3.360891819000244,
"learning_rate": 0.00010843510660430447,
"loss": 0.3533,
"step": 219
},
{
"epoch": 1.5837837837837838,
"grad_norm": 3.7110517024993896,
"learning_rate": 0.00010759331142252462,
"loss": 0.5224,
"step": 220
},
{
"epoch": 1.590990990990991,
"grad_norm": 4.481605052947998,
"learning_rate": 0.00010675097468583652,
"loss": 0.5574,
"step": 221
},
{
"epoch": 1.5981981981981983,
"grad_norm": 4.053014278411865,
"learning_rate": 0.00010590815646968934,
"loss": 0.6144,
"step": 222
},
{
"epoch": 1.6054054054054054,
"grad_norm": 4.868806838989258,
"learning_rate": 0.00010506491688387127,
"loss": 0.6848,
"step": 223
},
{
"epoch": 1.6126126126126126,
"grad_norm": 3.274519681930542,
"learning_rate": 0.00010422131606822269,
"loss": 0.4239,
"step": 224
},
{
"epoch": 1.6198198198198197,
"grad_norm": 4.9189276695251465,
"learning_rate": 0.00010337741418834684,
"loss": 0.7214,
"step": 225
},
{
"epoch": 1.627027027027027,
"grad_norm": 4.758511066436768,
"learning_rate": 0.00010253327143131879,
"loss": 0.7428,
"step": 226
},
{
"epoch": 1.6342342342342342,
"grad_norm": 3.2766125202178955,
"learning_rate": 0.0001016889480013931,
"loss": 0.4058,
"step": 227
},
{
"epoch": 1.6414414414414416,
"grad_norm": 4.384894847869873,
"learning_rate": 0.00010084450411570985,
"loss": 0.5434,
"step": 228
},
{
"epoch": 1.6486486486486487,
"grad_norm": 3.8896596431732178,
"learning_rate": 0.0001,
"loss": 0.5409,
"step": 229
},
{
"epoch": 1.6558558558558558,
"grad_norm": 3.30137038230896,
"learning_rate": 9.915549588429015e-05,
"loss": 0.3562,
"step": 230
},
{
"epoch": 1.663063063063063,
"grad_norm": 3.669996976852417,
"learning_rate": 9.83110519986069e-05,
"loss": 0.5631,
"step": 231
},
{
"epoch": 1.6702702702702703,
"grad_norm": 4.830873966217041,
"learning_rate": 9.746672856868123e-05,
"loss": 0.5807,
"step": 232
},
{
"epoch": 1.6774774774774774,
"grad_norm": 4.004265308380127,
"learning_rate": 9.662258581165319e-05,
"loss": 0.4425,
"step": 233
},
{
"epoch": 1.6846846846846848,
"grad_norm": 3.8576467037200928,
"learning_rate": 9.577868393177732e-05,
"loss": 0.5727,
"step": 234
},
{
"epoch": 1.691891891891892,
"grad_norm": 3.7281970977783203,
"learning_rate": 9.493508311612874e-05,
"loss": 0.4434,
"step": 235
},
{
"epoch": 1.699099099099099,
"grad_norm": 3.8081681728363037,
"learning_rate": 9.409184353031068e-05,
"loss": 0.6825,
"step": 236
},
{
"epoch": 1.7063063063063062,
"grad_norm": 4.315023422241211,
"learning_rate": 9.324902531416349e-05,
"loss": 0.6077,
"step": 237
},
{
"epoch": 1.7135135135135136,
"grad_norm": 4.316312313079834,
"learning_rate": 9.24066885774754e-05,
"loss": 0.6121,
"step": 238
},
{
"epoch": 1.7207207207207207,
"grad_norm": 5.163501262664795,
"learning_rate": 9.156489339569554e-05,
"loss": 0.7748,
"step": 239
},
{
"epoch": 1.727927927927928,
"grad_norm": 3.634093999862671,
"learning_rate": 9.072369980564935e-05,
"loss": 0.751,
"step": 240
},
{
"epoch": 1.7351351351351352,
"grad_norm": 3.306368350982666,
"learning_rate": 8.98831678012568e-05,
"loss": 0.3867,
"step": 241
},
{
"epoch": 1.7423423423423423,
"grad_norm": 4.843188285827637,
"learning_rate": 8.90433573292535e-05,
"loss": 0.6822,
"step": 242
},
{
"epoch": 1.7495495495495494,
"grad_norm": 5.148568153381348,
"learning_rate": 8.820432828491542e-05,
"loss": 0.8646,
"step": 243
},
{
"epoch": 1.7567567567567568,
"grad_norm": 4.512259006500244,
"learning_rate": 8.73661405077871e-05,
"loss": 0.8513,
"step": 244
},
{
"epoch": 1.763963963963964,
"grad_norm": 4.428910255432129,
"learning_rate": 8.652885377741393e-05,
"loss": 0.583,
"step": 245
},
{
"epoch": 1.7711711711711713,
"grad_norm": 3.868445873260498,
"learning_rate": 8.569252780907862e-05,
"loss": 0.4966,
"step": 246
},
{
"epoch": 1.7783783783783784,
"grad_norm": 4.749986171722412,
"learning_rate": 8.485722224954237e-05,
"loss": 0.8847,
"step": 247
},
{
"epoch": 1.7855855855855856,
"grad_norm": 3.9325308799743652,
"learning_rate": 8.402299667279078e-05,
"loss": 0.611,
"step": 248
},
{
"epoch": 1.7927927927927927,
"grad_norm": 4.074451446533203,
"learning_rate": 8.31899105757852e-05,
"loss": 0.6358,
"step": 249
},
{
"epoch": 1.8,
"grad_norm": 3.572497844696045,
"learning_rate": 8.235802337421919e-05,
"loss": 0.6278,
"step": 250
},
{
"epoch": 1.8072072072072072,
"grad_norm": 4.139247417449951,
"learning_rate": 8.15273943982811e-05,
"loss": 0.6351,
"step": 251
},
{
"epoch": 1.8144144144144145,
"grad_norm": 3.6678519248962402,
"learning_rate": 8.06980828884227e-05,
"loss": 0.5672,
"step": 252
},
{
"epoch": 1.8216216216216217,
"grad_norm": 3.446139097213745,
"learning_rate": 7.987014799113397e-05,
"loss": 0.4856,
"step": 253
},
{
"epoch": 1.8288288288288288,
"grad_norm": 3.493777275085449,
"learning_rate": 7.904364875472513e-05,
"loss": 0.6045,
"step": 254
},
{
"epoch": 1.836036036036036,
"grad_norm": 4.7790961265563965,
"learning_rate": 7.821864412511485e-05,
"loss": 0.7036,
"step": 255
},
{
"epoch": 1.8432432432432433,
"grad_norm": 4.165652275085449,
"learning_rate": 7.739519294162652e-05,
"loss": 0.5238,
"step": 256
},
{
"epoch": 1.8504504504504504,
"grad_norm": 3.581364870071411,
"learning_rate": 7.65733539327918e-05,
"loss": 0.4565,
"step": 257
},
{
"epoch": 1.8576576576576578,
"grad_norm": 3.2657792568206787,
"learning_rate": 7.5753185712162e-05,
"loss": 0.3849,
"step": 258
},
{
"epoch": 1.864864864864865,
"grad_norm": 3.9218881130218506,
"learning_rate": 7.493474677412794e-05,
"loss": 0.4958,
"step": 259
},
{
"epoch": 1.872072072072072,
"grad_norm": 3.588848829269409,
"learning_rate": 7.411809548974792e-05,
"loss": 0.503,
"step": 260
},
{
"epoch": 1.8792792792792792,
"grad_norm": 4.164908409118652,
"learning_rate": 7.330329010258483e-05,
"loss": 0.4935,
"step": 261
},
{
"epoch": 1.8864864864864865,
"grad_norm": 3.1876206398010254,
"learning_rate": 7.24903887245522e-05,
"loss": 0.4137,
"step": 262
},
{
"epoch": 1.8936936936936937,
"grad_norm": 4.017881870269775,
"learning_rate": 7.16794493317696e-05,
"loss": 0.5476,
"step": 263
},
{
"epoch": 1.900900900900901,
"grad_norm": 4.565951347351074,
"learning_rate": 7.087052976042789e-05,
"loss": 0.6215,
"step": 264
},
{
"epoch": 1.9081081081081082,
"grad_norm": 4.266515731811523,
"learning_rate": 7.006368770266421e-05,
"loss": 0.6048,
"step": 265
},
{
"epoch": 1.9153153153153153,
"grad_norm": 5.410391807556152,
"learning_rate": 6.925898070244752e-05,
"loss": 0.7368,
"step": 266
},
{
"epoch": 1.9225225225225224,
"grad_norm": 4.181150436401367,
"learning_rate": 6.845646615147445e-05,
"loss": 0.5578,
"step": 267
},
{
"epoch": 1.9297297297297298,
"grad_norm": 3.141552448272705,
"learning_rate": 6.765620128507619e-05,
"loss": 0.4533,
"step": 268
},
{
"epoch": 1.936936936936937,
"grad_norm": 4.941766738891602,
"learning_rate": 6.685824317813643e-05,
"loss": 0.8238,
"step": 269
},
{
"epoch": 1.9441441441441443,
"grad_norm": 4.092807769775391,
"learning_rate": 6.606264874102079e-05,
"loss": 0.5195,
"step": 270
},
{
"epoch": 1.9513513513513514,
"grad_norm": 4.641556262969971,
"learning_rate": 6.526947471551798e-05,
"loss": 0.7784,
"step": 271
},
{
"epoch": 1.9585585585585585,
"grad_norm": 5.080158710479736,
"learning_rate": 6.447877767079298e-05,
"loss": 0.7487,
"step": 272
},
{
"epoch": 1.9657657657657657,
"grad_norm": 4.7158403396606445,
"learning_rate": 6.369061399935255e-05,
"loss": 0.7191,
"step": 273
},
{
"epoch": 1.972972972972973,
"grad_norm": 4.332622528076172,
"learning_rate": 6.290503991302324e-05,
"loss": 0.7141,
"step": 274
},
{
"epoch": 1.9801801801801802,
"grad_norm": 3.9569380283355713,
"learning_rate": 6.21221114389424e-05,
"loss": 0.5547,
"step": 275
},
{
"epoch": 1.9873873873873875,
"grad_norm": 4.2110371589660645,
"learning_rate": 6.134188441556241e-05,
"loss": 0.5634,
"step": 276
},
{
"epoch": 1.9945945945945946,
"grad_norm": 3.706193685531616,
"learning_rate": 6.0564414488668165e-05,
"loss": 0.3742,
"step": 277
},
{
"epoch": 2.0,
"grad_norm": 5.037712097167969,
"learning_rate": 5.9789757107408416e-05,
"loss": 0.6155,
"step": 278
},
{
"epoch": 2.007207207207207,
"grad_norm": 2.617781639099121,
"learning_rate": 5.901796752034128e-05,
"loss": 0.2552,
"step": 279
},
{
"epoch": 2.0144144144144143,
"grad_norm": 3.264190435409546,
"learning_rate": 5.824910077149371e-05,
"loss": 0.3758,
"step": 280
},
{
"epoch": 2.0216216216216214,
"grad_norm": 2.382774829864502,
"learning_rate": 5.748321169643596e-05,
"loss": 0.2344,
"step": 281
},
{
"epoch": 2.028828828828829,
"grad_norm": 2.84346604347229,
"learning_rate": 5.672035491837053e-05,
"loss": 0.2901,
"step": 282
},
{
"epoch": 2.036036036036036,
"grad_norm": 3.0451385974884033,
"learning_rate": 5.596058484423656e-05,
"loss": 0.283,
"step": 283
},
{
"epoch": 2.0432432432432432,
"grad_norm": 2.93656587600708,
"learning_rate": 5.5203955660829544e-05,
"loss": 0.2312,
"step": 284
},
{
"epoch": 2.0504504504504504,
"grad_norm": 2.954282283782959,
"learning_rate": 5.44505213309366e-05,
"loss": 0.2203,
"step": 285
},
{
"epoch": 2.0576576576576575,
"grad_norm": 3.2899863719940186,
"learning_rate": 5.3700335589487925e-05,
"loss": 0.2358,
"step": 286
},
{
"epoch": 2.064864864864865,
"grad_norm": 3.8231899738311768,
"learning_rate": 5.2953451939724454e-05,
"loss": 0.3681,
"step": 287
},
{
"epoch": 2.0720720720720722,
"grad_norm": 3.0866289138793945,
"learning_rate": 5.220992364938193e-05,
"loss": 0.2551,
"step": 288
},
{
"epoch": 2.0792792792792794,
"grad_norm": 3.7291922569274902,
"learning_rate": 5.146980374689192e-05,
"loss": 0.2682,
"step": 289
},
{
"epoch": 2.0864864864864865,
"grad_norm": 3.8686490058898926,
"learning_rate": 5.073314501759977e-05,
"loss": 0.3748,
"step": 290
},
{
"epoch": 2.0936936936936936,
"grad_norm": 3.421870708465576,
"learning_rate": 5.000000000000002e-05,
"loss": 0.2552,
"step": 291
},
{
"epoch": 2.1009009009009008,
"grad_norm": 2.767481803894043,
"learning_rate": 4.9270420981989294e-05,
"loss": 0.1309,
"step": 292
},
{
"epoch": 2.108108108108108,
"grad_norm": 4.461688041687012,
"learning_rate": 4.854445999713715e-05,
"loss": 0.4446,
"step": 293
},
{
"epoch": 2.1153153153153155,
"grad_norm": 4.609604358673096,
"learning_rate": 4.7822168820975066e-05,
"loss": 0.2715,
"step": 294
},
{
"epoch": 2.1225225225225226,
"grad_norm": 4.200955390930176,
"learning_rate": 4.710359896730379e-05,
"loss": 0.1522,
"step": 295
},
{
"epoch": 2.1297297297297297,
"grad_norm": 4.314525127410889,
"learning_rate": 4.638880168451938e-05,
"loss": 0.1918,
"step": 296
},
{
"epoch": 2.136936936936937,
"grad_norm": 5.728034973144531,
"learning_rate": 4.567782795195816e-05,
"loss": 0.373,
"step": 297
},
{
"epoch": 2.144144144144144,
"grad_norm": 3.6254327297210693,
"learning_rate": 4.497072847626087e-05,
"loss": 0.2126,
"step": 298
},
{
"epoch": 2.1513513513513516,
"grad_norm": 5.762700080871582,
"learning_rate": 4.426755368775637e-05,
"loss": 0.3238,
"step": 299
},
{
"epoch": 2.1585585585585587,
"grad_norm": 4.812894344329834,
"learning_rate": 4.356835373686475e-05,
"loss": 0.261,
"step": 300
}
],
"logging_steps": 1,
"max_steps": 414,
"num_input_tokens_seen": 0,
"num_train_epochs": 3,
"save_steps": 100,
"stateful_callbacks": {
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": true,
"should_training_stop": false
},
"attributes": {}
}
},
"total_flos": 1.3170278325901995e+17,
"train_batch_size": 4,
"trial_name": null,
"trial_params": null
}